Kyutai випустила Voice of Reason: мовленнєву модель, яка розв’язує усні математичні задачі за допомогою навчання з підкріпленням
Kyutai випустила Voice of Reason — 2 мовні моделі з відкритими вагами, які вголос розв’язують математичні задачі. Обидві починаються з GLM-4-Voice-9B і доповнені керованим донавчанням (SFT) та навчанням із підкріпленням (RL). Етапу транскрибування немає, як і окремої текстової LLM у циклі. На усному GSM8K точність зростає з 27,3% для базової моделі до 77,1%.
Чи придатна вона для розгортання? Так, для самостійного хостингу. Kyutai запускала обидва контрольні знімки BF16 на одному H100. Також потрібен репозиторій GLM-4-Voice для його мовного токенізатора та декодера. Ваги успадковують ліцензію GLM-4-Voice, і поки що жоден провайдер інференсу Hugging Face їх не хостить.
Чому мовні моделі відстають у математиці
Каскадні конвеєри (мовлення-в-текст, текстова LLM, текст-в-мовлення) усе ще лідирують у міркуваннях. Однак кожен етап додає затримку, а конвеєр втрачає паралінгвістичні сигнали, як-от інтонацію. Моделі, нативні для мовлення, мають регулярно генерувати аудіо, щоб залишатися інтерактивними. Це обмежує кількість прихованих токенів міркувань, яку вони можуть собі дозволити.
Базова GLM-4-Voice набирає 27,3% на GSM8K. Попередній метод STITCH підвищив цей показник до 58,7% завдяки додаванню фрагментів міркувань. Дослідницька команда називає свою роботу першим застосуванням RL до математичних міркувань у моделях, нативних для мовлення.
Як відбувається навчання
GLM-4-Voice чергує свої вихідні дані: 13 текстових токенів, потім 26 аудіотокенів, і так повторюється.
- Етап 1 — SFT: Для навчання використано 150 616 задач із Orca-Math. Qwen3-235B переписала кожну задачу для мовлення. Потім DSM TTS від Kyutai озвучила їх різними голосами. Саме SFT підвищує показник GLM-4-Voice з 27,3% до 61,7%.
- Етап 2 — RL: Для кожного усного запитання модель генерує 4 відповіді з температурою 0,9. Суддя Qwen3-235B-A22B-2507 оцінює декодований текст за допомогою бінарної винагороди. Суддя ніколи не бачить еталонної відповіді. У 100 перевірених вручну випадках його оцінка збігалася з людською у 88% випадків.
Винагороди центровані всередині кожної групи, утворюючи відносну до групи цільову функцію REINFORCE. Вона пов’язана з GRPO, але не використовує кліпування PPO та KL-регуляризацію. Навчання тривало на 16 графічних процесорах H100 і включало 1 500 оновлень RL.
Найважливішими є 2 конструктивні рішення:
- Корекція температури: Логіти діляться на температуру вибірки перед застосуванням log-softmax у функції втрат. Без цього показник GSM8K впав би з 65,5% до 12,3%.
- Об’єднання аудіотокенів: На кожній аудіопозиції всі ймовірності аудіословника підсумовуються в 1 абстрактний токен. Функція втрат перевіряє лише те, чи йде далі аудіо, а не те, який саме аудіотокен. У статті доведено, що за припущення інваріантності значень ця оцінка є незміщеною та має меншу дисперсію.
Інтерактивне пояснення
2 випущені контрольні знімки
- glm-4-voice-of-reason-9b відповідає безпосередньо, без додаткових токенів міркувань. Будь-який покроковий розв’язок озвучується.
- glm-4-voice-of-reason-stitch-9b записує беззвучні фрагменти міркувань по 100 токенів між блоками мовлення. Kyutai стверджує, що наступні фрагменти генеруються, поки відтворюється попереднє мовлення, тож міркування не додають затримки. У використаній тут структурі STITCH-R перший фрагмент міркувань передує першому блоку мовлення.
Результати
| Модель | Параметри | GSM8K (%) |
|---|---|---|
| PersonaPlex (повний дуплекс) | 8B | 3,2 |
| GLM-4-Voice | 9B | 27,3 |
| STITCH (Chiang та ін.) | 9B | 58,7 |
| Voice of Reason | 9B | 65,5 ± 1,1 (70,3 випущена) |
| Voice of Reason (Stitch) | 9B | 74,8 ± 1,1 (77,1 випущена) |
| Qwen2.5-Omni (текстовий вихід) | 7B | 84,7 |
| Qwen3-Omni (текстовий вихід) | 30B | 94,6 |
| Каскадний ASR-LLM-TTS-ASR | LLM на 31B | 95,7 |
Показники зі статті використовують декодування top-k 50 і усереднені за 3 початковими значеннями. Без top-k вони становлять 70,3% і 77,1%. Випущені контрольні знімки відповідають цим запускам. Omni- та каскадні системи є більшими моделями у верхній частині таблиці, тому це не прямі порівняння.
Інші результати:
- Покращення зберігаються в реальному мовленні: Після транскрибування за допомогою Qwen3-ASR-1.7B модель Stitch набирає 72,0 ± 1,9%.
- Природність зберігається: UTMOSv2 змінився з 4,067 до 4,069 (direct) і з 4,174 до 4,164 (Stitch) після RL.
- Покращення не зумовлені довшими відповідями: RL скоротив середню відповідь direct-моделі з 41,9 до 36,4 секунди. Кількість токенів міркувань Stitch зросла лише зі 167 до 176.
- RL найбільше допомагає за малої кількості даних: Використовуючи 10% даних SFT, триваліше навчання RL досягло 58,5%. Лише SFT дало 43,9%.
- Зниження загальних знань: Показник усної TriviaQA для direct-моделі впав із 40,6% до 34,0%. Автори пояснюють це переважно повноданим SFT, а не RL.
- Перевірка на забруднення даних: Команда вилучила AddSub, MultiArith, SingleEQ і SVAMP з оцінювання. Із 678 перевірених запитань 54,0% збігалися з Orca-Math на рівні перефразування.
Аудіо для оцінювання створила GPT-4o-mini-TTS — інша система TTS, ніж та, що використовувалася для навчального аудіо. GPT-4o була суддею під час оцінювання.
Основні висновки
- Рецепт RL від Kyutai підвищує показник GLM-4-Voice з 27,3% до 77,1% на усному GSM8K.
- Direct-модель досягає 70,3% без токенів міркувань, перевершуючи STITCH із результатом 58,7%.
- Корекція температури критично важлива: її вилучення обвалило точність до 12,3%.
- Природність мовлення зберігається після RL; TriviaQA погіршується переважно через SFT.
- Обидва контрольні знімки 9B відкриті на Hugging Face і працюють на одному H100.
Ознайомтеся зі статтею, direct-моделлю та моделлю Stitch. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно налагодити партнерство з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.