Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Kyutai выпустила Voice of Reason: речевую модель, решающую устные математические задачи с помощью обучения с подкреплением

Kyutai выпустила Voice of Reason — 2 речевые модели с открытыми весами, которые решают математические задачи вслух. Обе модели основаны на GLM-4-Voice-9B и дополнены контролируемой тонкой настройкой (SFT) и обучением с подкреплением (RL). Этапа транскрибирования нет, как нет и отдельной текстовой LLM в процессе. На устном GSM8K точность выросла с 27,3% у базовой модели до 77,1%.

Можно ли развернуть модель? Да, самостоятельно. Kyutai запускала обе контрольные точки BF16 на одном H100. Также потребуется репозиторий GLM-4-Voice с его речевым токенизатором и декодером. На веса распространяется лицензия GLM-4-Voice, и пока ни один провайдер инференса Hugging Face их не размещает.

Почему речевые модели отстают в математике

Каскадные конвейеры (речь-в-текст, текстовая LLM, текст-в-речь) по-прежнему лидируют в рассуждениях. Однако каждый этап добавляет задержку, а конвейер теряет паралингвистические признаки, например интонацию. Речевые модели должны выдавать аудио через регулярные интервалы, чтобы сохранять интерактивность. Это ограничивает количество скрытых токенов рассуждений, которое они могут себе позволить.

Базовая GLM-4-Voice набирает 27,3% на GSM8K. Более ранний метод STITCH повысил этот показатель до 58,7% за счёт добавления фрагментов рассуждений. Исследовательская команда называет свою работу первым применением RL к математическим рассуждениям в речевых моделях.

Как проходит обучение

GLM-4-Voice чередует элементы вывода: 13 текстовых токенов, затем 26 аудиотокенов, и так далее.

  • Этап 1 — SFT: Для обучения используются 150 616 задач из Orca-Math. Qwen3-235B переписала каждую задачу для устной подачи. Затем DSM TTS от Kyutai озвучила их разными голосами. Одна только SFT повысила результат GLM-4-Voice с 27,3% до 61,7%.
  • Этап 2 — RL: Для каждого произнесённого вопроса модель генерирует 4 ответа с температурой 0,9. Модель-судья Qwen3-235B-A22B-2507 оценивает декодированный текст с помощью бинарной награды. Судья никогда не видит эталонный ответ. В 100 проверенных вручную случаях её оценки совпали с человеческими в 88% случаев.

Награды центрируются внутри каждой группы, формируя относительную к группе целевую функцию REINFORCE. Она связана с GRPO, но не использует клиппирование PPO и KL-регуляризацию. Обучение проходило на 16 графических процессорах H100 и включало 1 500 обновлений RL.

Наиболее важны 2 проектных решения:

  • Коррекция температуры: Логиты делятся на температуру выборки перед применением log-softmax в функции потерь. Без этого результат на GSM8K рухнул с 65,5% до 12,3%.
  • Объединение аудиотокенов: На каждой аудиопозиции вероятности всех токенов аудиословаря суммируются в 1 абстрактный токен. Функция потерь учитывает только то, последовало ли аудио, но не то, какой именно аудиотокен был выбран. В статье доказывается, что при предположении об инвариантности по значению эта оценка несмещённая и обладает меньшей дисперсией.

Интерактивное объяснение

2 выпущенные контрольные точки

  • glm-4-voice-of-reason-9b отвечает напрямую, без дополнительных токенов рассуждений. Любые пошаговые рассуждения произносятся вслух.
  • glm-4-voice-of-reason-stitch-9b записывает беззвучные фрагменты рассуждений длиной 100 токенов между речевыми блоками. Kyutai утверждает, что последующие фрагменты генерируются во время воспроизведения предыдущей речи, поэтому размышление не добавляет задержки. В использованной здесь схеме STITCH-R первый фрагмент рассуждений предшествует первому речевому блоку.

Результаты

МодельПараметрыGSM8K (%)
PersonaPlex (полнодуплексная)8B3,2
GLM-4-Voice9B27,3
STITCH (Chiang и др.)9B58,7
Voice of Reason9B65,5 ± 1,1 (70,3 выпущенная версия)
Voice of Reason (Stitch)9B74,8 ± 1,1 (77,1 выпущенная версия)
Qwen2.5-Omni (текстовый вывод)7B84,7
Qwen3-Omni (текстовый вывод)30B94,6
Каскадная ASR-LLM-TTS-ASRLLM 31B95,7

Результаты статьи используют декодирование top-k 50 и усреднение по 3 начальным значениям. При удалении top-k показатели составляют 70,3% и 77,1%. Выпущенные контрольные точки соответствуют этим запускам. Системы omni и каскадная система представлены в верхней части таблицы и имеют больший размер, поэтому сравнение с ними не является сопоставимым.

Другие выводы:

  • Результаты сохраняются на реальной речи: После транскрибирования с помощью Qwen3-ASR-1.7B модель Stitch набирает 72,0 ± 1,9%.
  • Естественность сохраняется: После RL показатель UTMOSv2 изменился с 4,067 до 4,069 (прямая модель) и с 4,174 до 4,164 (Stitch).
  • Рост показателей не связан с увеличением длины ответов: RL сократило среднюю длительность ответа прямой модели с 41,9 до 36,4 секунды. Число токенов рассуждений Stitch выросло лишь со 167 до 176.
  • RL особенно полезно при небольшом объёме данных: При использовании 10% данных SFT более длительный запуск RL достиг 58,5%. Одна SFT дала 43,9%.
  • Общие знания проседают: Результат на устном TriviaQA у прямой модели снизился с 40,6% до 34,0%. Авторы связывают это главным образом с SFT на полном наборе данных, а не с RL.
  • Проверка на загрязнение данных: Команда исключила AddSub, MultiArith, SingleEQ и SVAMP из оценки. Из 678 проверенных вопросов 54,0% совпадали с Orca-Math на уровне перефразирования.

Аудио для оценки было создано с помощью GPT-4o-mini-TTS — системы TTS, отличной от использованной для обучающих аудиоданных. В качестве судьи при оценке применялась GPT-4o.

Главные выводы

  • Рецепт RL от Kyutai повышает результат GLM-4-Voice с 27,3% до 77,1% на устном GSM8K.
  • Прямая модель достигает 70,3% без токенов рассуждений, опережая STITCH с результатом 58,7%.
  • Коррекция температуры критически важна: её удаление снизило точность до 12,3%.
  • Естественность речи сохраняется после RL; результат на TriviaQA снижается главным образом из-за SFT.
  • Обе контрольные точки 9B доступны с открытыми весами на Hugging Face и запускаются на одном H100.

Ознакомьтесь с статьёй, прямой моделью и моделью Stitch. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости