Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Kyutai випустила Voice of Reason: мовленнєву модель, яка розв’язує усні математичні задачі за допомогою навчання з підкріпленням

Kyutai випустила Voice of Reason — 2 мовні моделі з відкритими вагами, які вголос розв’язують математичні задачі. Обидві починаються з GLM-4-Voice-9B і доповнені керованим донавчанням (SFT) та навчанням із підкріпленням (RL). Етапу транскрибування немає, як і окремої текстової LLM у циклі. На усному GSM8K точність зростає з 27,3% для базової моделі до 77,1%.

Чи придатна вона для розгортання? Так, для самостійного хостингу. Kyutai запускала обидва контрольні знімки BF16 на одному H100. Також потрібен репозиторій GLM-4-Voice для його мовного токенізатора та декодера. Ваги успадковують ліцензію GLM-4-Voice, і поки що жоден провайдер інференсу Hugging Face їх не хостить.

Чому мовні моделі відстають у математиці

Каскадні конвеєри (мовлення-в-текст, текстова LLM, текст-в-мовлення) усе ще лідирують у міркуваннях. Однак кожен етап додає затримку, а конвеєр втрачає паралінгвістичні сигнали, як-от інтонацію. Моделі, нативні для мовлення, мають регулярно генерувати аудіо, щоб залишатися інтерактивними. Це обмежує кількість прихованих токенів міркувань, яку вони можуть собі дозволити.

Базова GLM-4-Voice набирає 27,3% на GSM8K. Попередній метод STITCH підвищив цей показник до 58,7% завдяки додаванню фрагментів міркувань. Дослідницька команда називає свою роботу першим застосуванням RL до математичних міркувань у моделях, нативних для мовлення.

Як відбувається навчання

GLM-4-Voice чергує свої вихідні дані: 13 текстових токенів, потім 26 аудіотокенів, і так повторюється.

  • Етап 1 — SFT: Для навчання використано 150 616 задач із Orca-Math. Qwen3-235B переписала кожну задачу для мовлення. Потім DSM TTS від Kyutai озвучила їх різними голосами. Саме SFT підвищує показник GLM-4-Voice з 27,3% до 61,7%.
  • Етап 2 — RL: Для кожного усного запитання модель генерує 4 відповіді з температурою 0,9. Суддя Qwen3-235B-A22B-2507 оцінює декодований текст за допомогою бінарної винагороди. Суддя ніколи не бачить еталонної відповіді. У 100 перевірених вручну випадках його оцінка збігалася з людською у 88% випадків.

Винагороди центровані всередині кожної групи, утворюючи відносну до групи цільову функцію REINFORCE. Вона пов’язана з GRPO, але не використовує кліпування PPO та KL-регуляризацію. Навчання тривало на 16 графічних процесорах H100 і включало 1 500 оновлень RL.

Найважливішими є 2 конструктивні рішення:

  • Корекція температури: Логіти діляться на температуру вибірки перед застосуванням log-softmax у функції втрат. Без цього показник GSM8K впав би з 65,5% до 12,3%.
  • Об’єднання аудіотокенів: На кожній аудіопозиції всі ймовірності аудіословника підсумовуються в 1 абстрактний токен. Функція втрат перевіряє лише те, чи йде далі аудіо, а не те, який саме аудіотокен. У статті доведено, що за припущення інваріантності значень ця оцінка є незміщеною та має меншу дисперсію.

Інтерактивне пояснення

2 випущені контрольні знімки

  • glm-4-voice-of-reason-9b відповідає безпосередньо, без додаткових токенів міркувань. Будь-який покроковий розв’язок озвучується.
  • glm-4-voice-of-reason-stitch-9b записує беззвучні фрагменти міркувань по 100 токенів між блоками мовлення. Kyutai стверджує, що наступні фрагменти генеруються, поки відтворюється попереднє мовлення, тож міркування не додають затримки. У використаній тут структурі STITCH-R перший фрагмент міркувань передує першому блоку мовлення.

Результати

МодельПараметриGSM8K (%)
PersonaPlex (повний дуплекс)8B3,2
GLM-4-Voice9B27,3
STITCH (Chiang та ін.)9B58,7
Voice of Reason9B65,5 ± 1,1 (70,3 випущена)
Voice of Reason (Stitch)9B74,8 ± 1,1 (77,1 випущена)
Qwen2.5-Omni (текстовий вихід)7B84,7
Qwen3-Omni (текстовий вихід)30B94,6
Каскадний ASR-LLM-TTS-ASRLLM на 31B95,7

Показники зі статті використовують декодування top-k 50 і усереднені за 3 початковими значеннями. Без top-k вони становлять 70,3% і 77,1%. Випущені контрольні знімки відповідають цим запускам. Omni- та каскадні системи є більшими моделями у верхній частині таблиці, тому це не прямі порівняння.

Інші результати:

  • Покращення зберігаються в реальному мовленні: Після транскрибування за допомогою Qwen3-ASR-1.7B модель Stitch набирає 72,0 ± 1,9%.
  • Природність зберігається: UTMOSv2 змінився з 4,067 до 4,069 (direct) і з 4,174 до 4,164 (Stitch) після RL.
  • Покращення не зумовлені довшими відповідями: RL скоротив середню відповідь direct-моделі з 41,9 до 36,4 секунди. Кількість токенів міркувань Stitch зросла лише зі 167 до 176.
  • RL найбільше допомагає за малої кількості даних: Використовуючи 10% даних SFT, триваліше навчання RL досягло 58,5%. Лише SFT дало 43,9%.
  • Зниження загальних знань: Показник усної TriviaQA для direct-моделі впав із 40,6% до 34,0%. Автори пояснюють це переважно повноданим SFT, а не RL.
  • Перевірка на забруднення даних: Команда вилучила AddSub, MultiArith, SingleEQ і SVAMP з оцінювання. Із 678 перевірених запитань 54,0% збігалися з Orca-Math на рівні перефразування.

Аудіо для оцінювання створила GPT-4o-mini-TTS — інша система TTS, ніж та, що використовувалася для навчального аудіо. GPT-4o була суддею під час оцінювання.

Основні висновки

  • Рецепт RL від Kyutai підвищує показник GLM-4-Voice з 27,3% до 77,1% на усному GSM8K.
  • Direct-модель досягає 70,3% без токенів міркувань, перевершуючи STITCH із результатом 58,7%.
  • Корекція температури критично важлива: її вилучення обвалило точність до 12,3%.
  • Природність мовлення зберігається після RL; TriviaQA погіршується переважно через SFT.
  • Обидва контрольні знімки 9B відкриті на Hugging Face і працюють на одному H100.

Ознайомтеся зі статтею, direct-моделлю та моделлю Stitch. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно налагодити партнерство з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини