Kyutai пуска Voice of Reason: речево-нативен модел, който решава устни математически задачи с обучение чрез подсилване
Kyutai пусна Voice of Reason — 2 модела за преобразуване на реч в реч с отворени тегла, които решават математически задачи на глас. И двата започват от GLM-4-Voice-9B и добавят контролирано дообучаване (SFT) и обучение с подсилване (RL). Няма стъпка за транскрибиране и отделен текстов LLM в процеса. При говоримия GSM8K точността нараства от 27,3% за базовия модел до 77,1%.
Може ли да бъде внедрен? Да, за самостоятелно хостване. Kyutai е изпълнил и двата BF16 чекпойнта на един H100. Необходим е и GLM-4-Voice репозиторият за неговия токенизатор и декодер на речта. Теглата наследяват лиценза на GLM-4-Voice, а все още няма доставчик на инференция в Hugging Face, който да ги хоства.
Защо речевите модели изостават при математиката
Каскадните конвейери (реч-към-текст, текстов LLM, текст-към-реч) все още водят при разсъжденията. Всеки етап обаче добавя латентност, а конвейерът губи паралингвистични сигнали като интонацията. Речево-нативните модели трябва да генерират аудио през равни интервали, за да останат интерактивни. Това ограничава колко скрити токени за разсъждение могат да си позволят.
Базовият GLM-4-Voice постига 27,3% на GSM8K. По-ранният метод STITCH повишава резултата до 58,7% чрез добавяне на блокове за разсъждение. Изследователският екип определя своята работа като първото приложение на RL към математически разсъждения в речево-нативни модели.
Как работи обучението
GLM-4-Voice редува изхода си: 13 текстови токена, след това 26 аудио токена, и така нататък.
- SFT — етап 1: Обучението използва 150 616 задачи от Orca-Math. Qwen3-235B пренаписва всяка задача за речево представяне. След това DSM TTS на Kyutai ги озвучава с множество гласове. Самото SFT повишава резултата на GLM-4-Voice от 27,3% на 61,7%.
- RL — етап 2: За всеки изговорен въпрос моделът генерира 4 отговора при температура 0,9. Оценяващ модел, Qwen3-235B-A22B-2507, оценява декодирания текст с бинарна награда. Оценяващият модел никога не вижда референтния отговор. При 100 ръчно проверени случая той съвпада с човешката оценка в 88% от времето.
Наградите се центрират в рамките на всяка група, като така се формира групово-релативна цел REINFORCE. Тя е свързана с GRPO, но премахва клипинга на PPO и KL-регуляризацията. Обучението е проведено върху 16 H100 GPU с 1 500 RL обновявания.
2 проектантски решения са най-важни:
- Корекция на температурата: Логитите се разделят на температурата на семплиране преди log-softmax в загубата. Без това GSM8K се срива от 65,5% до 12,3%.
- Сливане на аудио токените: На всяка аудио позиция всички вероятности от аудио речника се сумират в 1 абстрактен токен. Загубата проверява само дали следва аудио, а не кой аудио токен следва. Статията доказва, че при предположение за инвариантност спрямо стойността този оценител е несмещен и има по-ниска дисперсия.
Интерактивно обяснение
2-те публикувани чекпойнта
- glm-4-voice-of-reason-9b отговаря директно, без допълнителни токени за разсъждение. Всяко решение стъпка по стъпка се изговаря на глас.
- glm-4-voice-of-reason-stitch-9b записва безшумни блокове от 100 токена за разсъждение между говоримите блокове. Kyutai заявява, че следващите блокове се генерират, докато се възпроизвежда предишната реч, така че мисленето не добавя допълнителна латентност. В използваната тук конфигурация STITCH-R първият блок за разсъждение предхожда първия говорим блок.
Резултати
| Модел | Параметри | GSM8K (%) |
|---|---|---|
| PersonaPlex (пълен дуплекс) | 8B | 3,2 |
| GLM-4-Voice | 9B | 27,3 |
| STITCH (Chiang et al.) | 9B | 58,7 |
| Voice of Reason | 9B | 65,5 ± 1,1 (70,3 публикуван резултат) |
| Voice of Reason (Stitch) | 9B | 74,8 ± 1,1 (77,1 публикуван резултат) |
| Qwen2.5-Omni (текстов изход) | 7B | 84,7 |
| Qwen3-Omni (текстов изход) | 30B | 94,6 |
| Каскаден ASR-LLM-TTS-ASR | 31B LLM | 95,7 |
Резултатите в статията използват декодиране top-k 50, осреднено върху 3 семена. Премахването на top-k дава 70,3% и 77,1%. Публикуваните чекпойнти съответстват на тези изпълнения. Omni и каскадните системи са по-големите резултати в горната част и не представляват съпоставими сравнения.
Други констатации:
- Подобренията се запазват при реална реч: Транскрибиран с Qwen3-ASR-1.7B, моделът Stitch постига 72,0 ± 1,9%.
- Естествеността се запазва: UTMOSv2 се променя от 4,067 на 4,069 (директния модел) и от 4,174 на 4,164 (Stitch) след RL.
- Подобренията не се дължат на по-дълги отговори: RL съкращава средния отговор на директния модел от 41,9 на 36,4 секунди. Токените за разсъждение при Stitch нарастват само от 167 на 176.
- RL помага най-много при малко данни: При 10% от SFT данните по-дълго RL обучение достига 58,5%. Самото SFT постига 43,9%.
- Общите знания намаляват: Говоримият TriviaQA спада от 40,6% на 34,0% при директния модел. Авторите отдават това основно на SFT с пълния набор от данни, а не на RL.
- Проверка за замърсяване: Екипът премахва AddSub, MultiArith, SingleEQ и SVAMP от оценяването. От 678 проверени въпроса 54,0% се припокриват с Orca-Math на ниво парафраза.
Аудиото за оценяване е генерирано от GPT-4o-mini-TTS, различна TTS система от използваната при обучението. GPT-4o е използван като оценяващ модел.
Основни изводи
- RL рецептата на Kyutai повишава GLM-4-Voice от 27,3% на 77,1% при говоримия GSM8K.
- Директният модел достига 70,3% без токени за разсъждение, надминавайки 58,7% на STITCH.
- Корекцията на температурата е критична: премахването ѝ срива точността до 12,3%.
- Естествеността на речта се запазва след RL; TriviaQA спада, главно заради SFT.
- И двата чекпойнта с 9B са с отворен достъп в Hugging Face и работят на 1 H100.
Вижте статията, директния модел и модела Stitch. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub репозитори, Hugging Face страница, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.