Fireworks AI пусна Ember-1: дообучен Kimi K3, който използва с около 40% по-малко токени
Fireworks AI пусна Ember-1 — специализиран модел от Fireworks Research, създаден чрез допълнително обучение на модела с отворени тегла Kimi K3 на Moonshot AI. Ember-1 се научава да създава по-кратки следи от разсъждения, като същевременно запазва точността при изпълнение на задачите. Това се различава от намаляването на настройката за интензивност на разсъжденията по време на извеждане. Според публикацията на Fireworks за представянето на модела Ember-1 осигурява качеството на Kimi K3 с около 40% по-малко токени.
Може ли да бъде внедрен? Да, но само чрез безсървърния API на Fireworks като предварителна версия за изследователски цели. Fireworks не е публикувала теглата на Ember-1, кода за обучение или точните алгоритми за обучение, така че към момента самостоятелното хостване не е възможно.
Проблемът: моделите за разсъждение мислят прекалено много
Екипът на Fireworks съобщава, че модели за разсъждение като Kimi K3 понякога изразходват повече от 90% от генерираните токени за вътрешни разсъждения. Този разход се натрупва при агентни работни процеси с множество ходове. При всеки ход предишните разсъждения се подават отново на модела. Контекстът нараства приблизително квадратично с броя на ходовете. Дългите следи от ранните ходове се прочитат отново и се таксуват повторно при всяко следващо извикване.
Екипът на Fireworks обяснява, че клиентите са искали способностите на K3 за програмиране на по-ниска цена. Намаляването на интензивността на разсъжденията на K3 не е решило проблема. Настройките за по-ниска интензивност водят до твърде голяма загуба на качество. Затова екипът е обучил модела да разсъждава по-ефективно.
Как Fireworks Research създаде Ember-1
Не всички разсъждения на K3 са излишни. Част от тях представляват полезна саморефлексия, например преразглеждане на предположение или реакция на обратна връзка. Ember-1 запазва това поведение, като същевременно съкращава излишните разсъждения и непродуктивните цикли.
Колекцията за обучение обхваща математика, програмиране, следване на инструкции, разговори, търсене, използване на инструменти и софтуерно инженерство. Тя включва както самостоятелни задачи, така и продължителни взаимодействия в множество стъпки. Обратната връзка от задачите и средата насочва планирането и обучението по текущата политика. Екипът на Fireworks е провел повече от 50 експеримента за обучение и над 200 оценки. Той е разработил и нови алгоритми за обучение, които не е публикувал. Цялото обучение е извършено чрез Fireworks Serverless Training. Fireworks посочва, че е използвала собствени данни и никакви клиентски данни.
Резултати от бенчмарковете
Fireworks сравни Ember-1 с Kimi K3 при три нива на интензивност на разсъжденията. Разходите са изчислени въз основа на публичните цени на API за Kimi K3. Това са собствени публикувани оценки на Fireworks.
| Бенчмарк | N | K3 Low | K3 High | K3 Max | Ember-1 | Ember-1 спрямо K3 Max (разходи) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 USD |
Ember-1 изпреварва K3 Max в Terminal Bench 2.1 и DeepSWE 1.1. Той изостава леко в SWE-bench Verified и SWE-Interact. При седем бенчмарка и производствения трафик на двама клиенти Fireworks посочва, че разсъжденията на K3 са съкратени с 35 до 50%, без да се жертва точността.
В Bedside Bench на Doximity — набор от 500 клинични случая, валидиран от лекари — Ember-1 постави нова граница на Парето по показателя разход на задача. Този резултат идва от новия Specialized Intelligence Index на Fireworks.
Резултати от производствения A/B тест
Fireworks проведе реални A/B тестове с 2 клиенти при производствени задачи за програмиране. И двамата отчетоха приблизително 35% по-малко токени на задача при сравнимо качество. В публикувания тест броят на изходните токени спадна от 49.3K до 29.9K на задача. Токените за разсъждения намаляха със 71.3%, а общият брой токени — с 39%. Оценката на задачите остана практически непроменена: 0.753 за Ember-1 спрямо 0.751 за K3. Средният брой стъпки спадна от 23.8 на 21.4. Един от клиентите вече използва Ember-1 в производствена среда.
Ember-1 струва същото на токен като Kimi K3 във Fireworks: 3.00 USD за вход, 0.30 USD за кеширан вход и 15.00 USD за изход на 1 млн. токена. Спестяванията идват изцяло от генерирането на по-малко токени. При тази цена за изходните токени данните от A/B теста се равняват на около 0.74 USD спрямо 0.45 USD разход за изход на задача (наше изчисление, само за изхода).
Интерактивно обяснение
Основни изводи
- Ember-1 е моделът Kimi K3, дообучен да разсъждава с по-малко токени, а не да работи с по-ниска интензивност.
- Fireworks отчита около 40% по-малко токени при запазена точност във всички свои оценки.
- При производствен A/B тест изходът спадна от 49.3K на 29.9K токена на задача при резултат 0.753 спрямо 0.751.
- Той изпреварва K3 Max в Terminal Bench 2.1 (82.0%) и DeepSWE 1.1 (75.2%), но изостава в SWE-bench Verified (92.2%).
- Предварителна версия за изследователски цели, достъпна само чрез API, на цената на K3; теглата и кодът за обучение не са публикувани.
Разгледайте техническите подробности. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.