Fireworks AI выпустила Ember-1: дообученную версию Kimi K3, использующую примерно на 40% меньше токенов
Fireworks AI выпустила Ember-1 — специализированную модель от Fireworks Research, созданную путем дообучения модели с открытыми весами Kimi K3 от Moonshot AI. Ember-1 учится создавать более короткие цепочки рассуждений, сохраняя точность выполнения задач. Это отличается от снижения параметра интенсивности рассуждений во время инференса. Согласно публикации Fireworks о релизе, Ember-1 обеспечивает качество Kimi K3, используя примерно на 40% меньше токенов.
Можно ли развернуть модель? Да, но только через бессерверный API Fireworks в рамках исследовательской предварительной версии. Fireworks не выпустила веса Ember-1, код обучения или точные алгоритмы обучения, поэтому самостоятельное развертывание сегодня невозможно.
Проблема: модели рассуждений думают слишком много
Команда Fireworks сообщает, что модели рассуждений, такие как Kimi K3, иногда тратят более 90% сгенерированных токенов на внутренние рассуждения. В многошаговых агентских сценариях эта стоимость многократно увеличивается. На каждом шаге предыдущие рассуждения повторно передаются модели. Объем контекста растет примерно квадратично с увеличением числа шагов. Длинные цепочки рассуждений с первых шагов перечитываются и оплачиваются заново при каждом последующем вызове.
Команда Fireworks объясняет, что пользователи хотели получить возможности K3 для написания кода при меньшей стоимости. Снижение интенсивности рассуждений K3 не решило проблему. При низких настройках интенсивности качество падало слишком сильно. Поэтому команда обучила модель рассуждать более эффективно.
Как Fireworks Research создала Ember-1
Не все рассуждения K3 являются избыточными. Некоторые из них представляют собой полезную саморефлексию — например, повторный анализ предположения или реакцию на обратную связь. Ember-1 сохраняет такое поведение, сокращая избыточные рассуждения и непродуктивные циклы.
Обучающая выборка охватывает математику, программирование, следование инструкциям, диалоги, поиск, использование инструментов и разработку программного обеспечения. Она включает как отдельные задачи, так и расширенные многошаговые взаимодействия. Обратная связь от задач и среды направляет планирование и обучение по политике. Команда Fireworks провела более 50 экспериментов по обучению и свыше 200 оценок. Также она разработала новые алгоритмы обучения, которые пока не опубликовала. Все обучение выполнялось с помощью Fireworks Serverless Training. Fireworks заявляет, что использовала собственные данные и не использовала данные клиентов.
Результаты бенчмарков
Fireworks сравнила Ember-1 с Kimi K3 при трех уровнях интенсивности рассуждений. Стоимость рассчитывалась по общедоступным тарифам API Kimi K3. Это собственные опубликованные оценки Fireworks.
| Бенчмарк | N | K3 Low | K3 High | K3 Max | Ember-1 | Ember-1 vs K3 Max (стоимость) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 USD |
Ember-1 превосходит K3 Max в Terminal Bench 2.1 и DeepSWE 1.1. В SWE-bench Verified и SWE-Interact она немного уступает. По данным Fireworks, на семи бенчмарках и в производственном трафике двух клиентов рассуждения K3 удалось сократить на 35–50% без потери точности.
В Bedside Bench от Doximity — наборе из 500 клинических случаев, проверенных врачами, — Ember-1 установила новую парето-фронтиру по стоимости выполнения задачи. Этот результат получен с помощью нового индекса специализированного интеллекта Fireworks.
Результаты производственного A/B-тестирования
Fireworks провела живые A/B-тесты с двумя клиентами на производственных задачах по написанию кода. Оба клиента получили примерно на 35% меньше токенов на задачу при сопоставимом качестве. В опубликованном запуске количество выходных токенов снизилось с 49,3 тыс. до 29,9 тыс. на задачу. Число токенов рассуждений уменьшилось на 71,3%, а общее количество токенов — на 39%. Оценка задач практически не изменилась: 0,753 для Ember-1 против 0,751 для K3. Среднее число шагов сократилось с 23,8 до 21,4. Один из клиентов теперь использует Ember-1 в производственной среде.
На Fireworks Ember-1 стоит столько же за токен, сколько Kimi K3: $3,00 за входные токены, $0,30 за кэшированные входные токены и $15,00 за выходные токены на 1 млн токенов. Экономия полностью достигается за счет генерации меньшего количества токенов. При такой стоимости генерации показатели A/B-теста соответствуют примерно $0,74 против $0,45 стоимости выходных токенов на задачу (наш расчет, только выходные токены).
Интерактивное объяснение
Основные выводы
- Ember-1 — это Kimi K3, дообученная для рассуждений с меньшим количеством токенов, а не работающая при более низкой интенсивности.
- Fireworks сообщает примерно о 40% меньшем количестве токенов при сохранении точности в проведенных оценках.
- В производственном A/B-тесте количество выходных токенов на задачу снизилось с 49,3 тыс. до 29,9 тыс. при оценках 0,753 против 0,751.
- Она превосходит K3 Max в Terminal Bench 2.1 (82,0%) и DeepSWE 1.1 (75,2%), но уступает в SWE-bench Verified (92,2%).
- Исследовательская предварительная версия доступна только через API по тарифам K3; веса и код обучения не выпущены.
Ознакомьтесь с разделом «Технические детали». Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.