Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Fireworks AI випустила Ember-1: донавчену версію Kimi K3, яка використовує приблизно на 40% менше токенів

Fireworks AI випустила Ember-1 — спеціалізовану модель від Fireworks Research, створену шляхом донавчання відкритої за вагами моделі Kimi K3 від Moonshot AI. Ember-1 навчається генерувати коротші ланцюжки міркувань, зберігаючи точність виконання завдань. Це відрізняється від зниження параметра інтенсивності міркувань під час інференсу. Згідно з публікацією Fireworks про реліз, Ember-1 забезпечує якість Kimi K3, використовуючи приблизно на 40% менше токенів.

Чи придатна вона для розгортання? Так, але лише через безсерверний API Fireworks у форматі Research Preview. Fireworks не випустила ваги Ember-1, код навчання чи точні алгоритми навчання, тому самостійне розгортання наразі неможливе.

Проблема: моделі міркувань думають надто багато

Команда Fireworks повідомляє, що моделі міркувань, як-от Kimi K3, іноді витрачають понад 90% згенерованих токенів на внутрішні міркування. У багатокрокових агентних робочих процесах ці витрати накопичуються. Під час кожного кроку модель повторно отримує попередні міркування. Контекст зростає приблизно квадратично зі збільшенням кількості кроків. Довгі ланцюжки з ранніх кроків перечитуються та повторно оплачуються під час кожного наступного виклику.

Команда Fireworks пояснює, що клієнти хотіли отримати можливості K3 для програмування за нижчою ціною. Зменшення інтенсивності міркувань K3 не розв’язало проблему. Налаштування нижчої інтенсивності призводили до надто великої втрати якості. Тож команда натомість навчила модель міркувати ефективніше.

Як Fireworks Research створила Ember-1

Не всі міркування K3 є зайвими. Частина з них — це корисна саморефлексія, наприклад повторний перегляд припущення або реакція на зворотний зв’язок. Ember-1 зберігає таку поведінку, скорочуючи надлишкові міркування та непродуктивні цикли.

Навчальна вибірка охоплює математику, програмування, виконання інструкцій, спілкування, пошук, використання інструментів і розробку програмного забезпечення. Вона містить як окремі завдання, так і розширені багатокрокові взаємодії. Зворотний зв’язок від завдань і середовища спрямовує планування та навчання за політикою. Команда Fireworks провела понад 50 навчальних експериментів і більше ніж 200 оцінювань. Вона також розробила нові алгоритми навчання, які не опублікувала. Усе навчання виконувалося на платформі Fireworks Serverless Training. Fireworks зазначає, що використовувала власні дані й не використовувала дані клієнтів.

Результати бенчмарків

Fireworks порівняла Ember-1 із Kimi K3 на трьох рівнях інтенсивності міркувань. Вартість обчислювалася за відкритими цінами API Kimi K3. Це власні опубліковані оцінювання Fireworks.

БенчмаркNK3 LowK3 HighK3 MaxEmber-1Ember-1 порівняно з K3 Max (вартість)
Terminal Bench 2.18976.4%77.6%80.9%82.0%-51.9% / -23.1 USD
SWE-bench Verified50080.4%86.0%93.2%92.2%-15.5% / -68.1 USD
SWE-Interact756.7%13.3%21.3%20.0%-32.5% / -60.8 USD
DeepSWE 1.111355.8%62.8%66.4%75.2%-23.7% / -126.9 USD
τ-2 Bench Airline5064%64%64%66%-5.9% / -0.3 USD

Ember-1 випереджає K3 Max у Terminal Bench 2.1 і DeepSWE 1.1. Вона дещо поступається в SWE-bench Verified і SWE-Interact. За даними Fireworks, у семи бенчмарках і на виробничому трафіку двох клієнтів міркування K3 були скорочені на 35–50% без втрати точності.

У Bedside Bench від Doximity — наборі з 500 клінічних випадків, валідованому лікарями, — Ember-1 встановила новий фронт Парето за показником вартості на завдання. Цей результат отримано завдяки новому індексу спеціалізованого інтелекту Fireworks.

Результати виробничого A/B-тестування

Fireworks провела живі A/B-тести з 2 клієнтами на виробничих робочих процесах програмування. Обидва побачили приблизно на 35% менше токенів на завдання за зіставної якості. У опублікованому запуску кількість вихідних токенів зменшилася з 49,3 тис. до 29,9 тис. на завдання. Кількість токенів міркувань скоротилася на 71,3%, а загальна кількість токенів — на 39%. Оцінка завдання практично не змінилася: 0,753 для Ember-1 проти 0,751 для K3. Середня кількість кроків зменшилася з 23,8 до 21,4. Один із клієнтів уже використовує Ember-1 у виробничому середовищі.

У Fireworks Ember-1 коштує стільки ж за токен, як і Kimi K3: $3,00 за вхідні токени, $0,30 за кешовані вхідні токени та $15,00 за вихідні токени на 1 млн токенів. Економія повністю забезпечується генеруванням меншої кількості токенів. За такої вартості вихідних токенів показники A/B-тесту відповідають приблизно $0,74 проти $0,45 витрат на вихідні токени за завдання (наш розрахунок, лише вихідні токени).

Інтерактивне пояснення

Основні висновки

  • Ember-1 — це Kimi K3, донавчена для міркувань із використанням меншої кількості токенів, а не запущена на нижчому рівні інтенсивності.
  • Fireworks повідомляє про приблизно на 40% меншу кількість токенів за збереження точності у своїх оцінюваннях.
  • У виробничому A/B-тесті кількість вихідних токенів зменшилася з 49,3 тис. до 29,9 тис. на завдання за оцінок 0,753 проти 0,751.
  • Вона випереджає K3 Max у Terminal Bench 2.1 (82,0%) і DeepSWE 1.1 (75,2%), але поступається в SWE-bench Verified (92,2%).
  • Research Preview доступна лише через API за цінами K3; ваги та код навчання не опубліковані.

Ознайомтеся з розділом «Технічні деталі». Усі заслуги належать досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини