Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Kyutai пуска Voice of Reason: речево-нативен модел, който решава устни математически задачи с обучение чрез подсилване

Kyutai пусна Voice of Reason — 2 модела за преобразуване на реч в реч с отворени тегла, които решават математически задачи на глас. И двата започват от GLM-4-Voice-9B и добавят контролирано дообучаване (SFT) и обучение с подсилване (RL). Няма стъпка за транскрибиране и отделен текстов LLM в процеса. При говоримия GSM8K точността нараства от 27,3% за базовия модел до 77,1%.

Може ли да бъде внедрен? Да, за самостоятелно хостване. Kyutai е изпълнил и двата BF16 чекпойнта на един H100. Необходим е и GLM-4-Voice репозиторият за неговия токенизатор и декодер на речта. Теглата наследяват лиценза на GLM-4-Voice, а все още няма доставчик на инференция в Hugging Face, който да ги хоства.

Защо речевите модели изостават при математиката

Каскадните конвейери (реч-към-текст, текстов LLM, текст-към-реч) все още водят при разсъжденията. Всеки етап обаче добавя латентност, а конвейерът губи паралингвистични сигнали като интонацията. Речево-нативните модели трябва да генерират аудио през равни интервали, за да останат интерактивни. Това ограничава колко скрити токени за разсъждение могат да си позволят.

Базовият GLM-4-Voice постига 27,3% на GSM8K. По-ранният метод STITCH повишава резултата до 58,7% чрез добавяне на блокове за разсъждение. Изследователският екип определя своята работа като първото приложение на RL към математически разсъждения в речево-нативни модели.

Как работи обучението

GLM-4-Voice редува изхода си: 13 текстови токена, след това 26 аудио токена, и така нататък.

  • SFT — етап 1: Обучението използва 150 616 задачи от Orca-Math. Qwen3-235B пренаписва всяка задача за речево представяне. След това DSM TTS на Kyutai ги озвучава с множество гласове. Самото SFT повишава резултата на GLM-4-Voice от 27,3% на 61,7%.
  • RL — етап 2: За всеки изговорен въпрос моделът генерира 4 отговора при температура 0,9. Оценяващ модел, Qwen3-235B-A22B-2507, оценява декодирания текст с бинарна награда. Оценяващият модел никога не вижда референтния отговор. При 100 ръчно проверени случая той съвпада с човешката оценка в 88% от времето.

Наградите се центрират в рамките на всяка група, като така се формира групово-релативна цел REINFORCE. Тя е свързана с GRPO, но премахва клипинга на PPO и KL-регуляризацията. Обучението е проведено върху 16 H100 GPU с 1 500 RL обновявания.

2 проектантски решения са най-важни:

  • Корекция на температурата: Логитите се разделят на температурата на семплиране преди log-softmax в загубата. Без това GSM8K се срива от 65,5% до 12,3%.
  • Сливане на аудио токените: На всяка аудио позиция всички вероятности от аудио речника се сумират в 1 абстрактен токен. Загубата проверява само дали следва аудио, а не кой аудио токен следва. Статията доказва, че при предположение за инвариантност спрямо стойността този оценител е несмещен и има по-ниска дисперсия.

Интерактивно обяснение

2-те публикувани чекпойнта

  • glm-4-voice-of-reason-9b отговаря директно, без допълнителни токени за разсъждение. Всяко решение стъпка по стъпка се изговаря на глас.
  • glm-4-voice-of-reason-stitch-9b записва безшумни блокове от 100 токена за разсъждение между говоримите блокове. Kyutai заявява, че следващите блокове се генерират, докато се възпроизвежда предишната реч, така че мисленето не добавя допълнителна латентност. В използваната тук конфигурация STITCH-R първият блок за разсъждение предхожда първия говорим блок.

Резултати

МоделПараметриGSM8K (%)
PersonaPlex (пълен дуплекс)8B3,2
GLM-4-Voice9B27,3
STITCH (Chiang et al.)9B58,7
Voice of Reason9B65,5 ± 1,1 (70,3 публикуван резултат)
Voice of Reason (Stitch)9B74,8 ± 1,1 (77,1 публикуван резултат)
Qwen2.5-Omni (текстов изход)7B84,7
Qwen3-Omni (текстов изход)30B94,6
Каскаден ASR-LLM-TTS-ASR31B LLM95,7

Резултатите в статията използват декодиране top-k 50, осреднено върху 3 семена. Премахването на top-k дава 70,3% и 77,1%. Публикуваните чекпойнти съответстват на тези изпълнения. Omni и каскадните системи са по-големите резултати в горната част и не представляват съпоставими сравнения.

Други констатации:

  • Подобренията се запазват при реална реч: Транскрибиран с Qwen3-ASR-1.7B, моделът Stitch постига 72,0 ± 1,9%.
  • Естествеността се запазва: UTMOSv2 се променя от 4,067 на 4,069 (директния модел) и от 4,174 на 4,164 (Stitch) след RL.
  • Подобренията не се дължат на по-дълги отговори: RL съкращава средния отговор на директния модел от 41,9 на 36,4 секунди. Токените за разсъждение при Stitch нарастват само от 167 на 176.
  • RL помага най-много при малко данни: При 10% от SFT данните по-дълго RL обучение достига 58,5%. Самото SFT постига 43,9%.
  • Общите знания намаляват: Говоримият TriviaQA спада от 40,6% на 34,0% при директния модел. Авторите отдават това основно на SFT с пълния набор от данни, а не на RL.
  • Проверка за замърсяване: Екипът премахва AddSub, MultiArith, SingleEQ и SVAMP от оценяването. От 678 проверени въпроса 54,0% се припокриват с Orca-Math на ниво парафраза.

Аудиото за оценяване е генерирано от GPT-4o-mini-TTS, различна TTS система от използваната при обучението. GPT-4o е използван като оценяващ модел.

Основни изводи

  • RL рецептата на Kyutai повишава GLM-4-Voice от 27,3% на 77,1% при говоримия GSM8K.
  • Директният модел достига 70,3% без токени за разсъждение, надминавайки 58,7% на STITCH.
  • Корекцията на температурата е критична: премахването ѝ срива точността до 12,3%.
  • Естествеността на речта се запазва след RL; TriviaQA спада, главно заради SFT.
  • И двата чекпойнта с 9B са с отворен достъп в Hugging Face и работят на 1 H100.

Вижте статията, директния модел и модела Stitch. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub репозитори, Hugging Face страница, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини