Kyutai выпустила Voice of Reason: речевую модель, решающую устные математические задачи с помощью обучения с подкреплением
Kyutai выпустила Voice of Reason — 2 речевые модели с открытыми весами, которые решают математические задачи вслух. Обе модели основаны на GLM-4-Voice-9B и дополнены контролируемой тонкой настройкой (SFT) и обучением с подкреплением (RL). Этапа транскрибирования нет, как нет и отдельной текстовой LLM в процессе. На устном GSM8K точность выросла с 27,3% у базовой модели до 77,1%.
Можно ли развернуть модель? Да, самостоятельно. Kyutai запускала обе контрольные точки BF16 на одном H100. Также потребуется репозиторий GLM-4-Voice с его речевым токенизатором и декодером. На веса распространяется лицензия GLM-4-Voice, и пока ни один провайдер инференса Hugging Face их не размещает.
Почему речевые модели отстают в математике
Каскадные конвейеры (речь-в-текст, текстовая LLM, текст-в-речь) по-прежнему лидируют в рассуждениях. Однако каждый этап добавляет задержку, а конвейер теряет паралингвистические признаки, например интонацию. Речевые модели должны выдавать аудио через регулярные интервалы, чтобы сохранять интерактивность. Это ограничивает количество скрытых токенов рассуждений, которое они могут себе позволить.
Базовая GLM-4-Voice набирает 27,3% на GSM8K. Более ранний метод STITCH повысил этот показатель до 58,7% за счёт добавления фрагментов рассуждений. Исследовательская команда называет свою работу первым применением RL к математическим рассуждениям в речевых моделях.
Как проходит обучение
GLM-4-Voice чередует элементы вывода: 13 текстовых токенов, затем 26 аудиотокенов, и так далее.
- Этап 1 — SFT: Для обучения используются 150 616 задач из Orca-Math. Qwen3-235B переписала каждую задачу для устной подачи. Затем DSM TTS от Kyutai озвучила их разными голосами. Одна только SFT повысила результат GLM-4-Voice с 27,3% до 61,7%.
- Этап 2 — RL: Для каждого произнесённого вопроса модель генерирует 4 ответа с температурой 0,9. Модель-судья Qwen3-235B-A22B-2507 оценивает декодированный текст с помощью бинарной награды. Судья никогда не видит эталонный ответ. В 100 проверенных вручную случаях её оценки совпали с человеческими в 88% случаев.
Награды центрируются внутри каждой группы, формируя относительную к группе целевую функцию REINFORCE. Она связана с GRPO, но не использует клиппирование PPO и KL-регуляризацию. Обучение проходило на 16 графических процессорах H100 и включало 1 500 обновлений RL.
Наиболее важны 2 проектных решения:
- Коррекция температуры: Логиты делятся на температуру выборки перед применением log-softmax в функции потерь. Без этого результат на GSM8K рухнул с 65,5% до 12,3%.
- Объединение аудиотокенов: На каждой аудиопозиции вероятности всех токенов аудиословаря суммируются в 1 абстрактный токен. Функция потерь учитывает только то, последовало ли аудио, но не то, какой именно аудиотокен был выбран. В статье доказывается, что при предположении об инвариантности по значению эта оценка несмещённая и обладает меньшей дисперсией.
Интерактивное объяснение
2 выпущенные контрольные точки
- glm-4-voice-of-reason-9b отвечает напрямую, без дополнительных токенов рассуждений. Любые пошаговые рассуждения произносятся вслух.
- glm-4-voice-of-reason-stitch-9b записывает беззвучные фрагменты рассуждений длиной 100 токенов между речевыми блоками. Kyutai утверждает, что последующие фрагменты генерируются во время воспроизведения предыдущей речи, поэтому размышление не добавляет задержки. В использованной здесь схеме STITCH-R первый фрагмент рассуждений предшествует первому речевому блоку.
Результаты
| Модель | Параметры | GSM8K (%) |
|---|---|---|
| PersonaPlex (полнодуплексная) | 8B | 3,2 |
| GLM-4-Voice | 9B | 27,3 |
| STITCH (Chiang и др.) | 9B | 58,7 |
| Voice of Reason | 9B | 65,5 ± 1,1 (70,3 выпущенная версия) |
| Voice of Reason (Stitch) | 9B | 74,8 ± 1,1 (77,1 выпущенная версия) |
| Qwen2.5-Omni (текстовый вывод) | 7B | 84,7 |
| Qwen3-Omni (текстовый вывод) | 30B | 94,6 |
| Каскадная ASR-LLM-TTS-ASR | LLM 31B | 95,7 |
Результаты статьи используют декодирование top-k 50 и усреднение по 3 начальным значениям. При удалении top-k показатели составляют 70,3% и 77,1%. Выпущенные контрольные точки соответствуют этим запускам. Системы omni и каскадная система представлены в верхней части таблицы и имеют больший размер, поэтому сравнение с ними не является сопоставимым.
Другие выводы:
- Результаты сохраняются на реальной речи: После транскрибирования с помощью Qwen3-ASR-1.7B модель Stitch набирает 72,0 ± 1,9%.
- Естественность сохраняется: После RL показатель UTMOSv2 изменился с 4,067 до 4,069 (прямая модель) и с 4,174 до 4,164 (Stitch).
- Рост показателей не связан с увеличением длины ответов: RL сократило среднюю длительность ответа прямой модели с 41,9 до 36,4 секунды. Число токенов рассуждений Stitch выросло лишь со 167 до 176.
- RL особенно полезно при небольшом объёме данных: При использовании 10% данных SFT более длительный запуск RL достиг 58,5%. Одна SFT дала 43,9%.
- Общие знания проседают: Результат на устном TriviaQA у прямой модели снизился с 40,6% до 34,0%. Авторы связывают это главным образом с SFT на полном наборе данных, а не с RL.
- Проверка на загрязнение данных: Команда исключила AddSub, MultiArith, SingleEQ и SVAMP из оценки. Из 678 проверенных вопросов 54,0% совпадали с Orca-Math на уровне перефразирования.
Аудио для оценки было создано с помощью GPT-4o-mini-TTS — системы TTS, отличной от использованной для обучающих аудиоданных. В качестве судьи при оценке применялась GPT-4o.
Главные выводы
- Рецепт RL от Kyutai повышает результат GLM-4-Voice с 27,3% до 77,1% на устном GSM8K.
- Прямая модель достигает 70,3% без токенов рассуждений, опережая STITCH с результатом 58,7%.
- Коррекция температуры критически важна: её удаление снизило точность до 12,3%.
- Естественность речи сохраняется после RL; результат на TriviaQA снижается главным образом из-за SFT.
- Обе контрольные точки 9B доступны с открытыми весами на Hugging Face и запускаются на одном H100.
Ознакомьтесь с статьёй, прямой моделью и моделью Stitch. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.