Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для голосовых агентов производственного уровня
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — самые продвинутые на сегодняшний день модели для живого диалога. Обе модели изначально разработаны для преобразования речи в речь и предназначены для голосовых агентов, работающих в реальном времени. Они расширяют семейство Gemini Audio, которое Google расширила в прошлом месяце с помощью Gemini 3.5 Transcribe. Выпуск нацелен на решение конкретной проблемы: создание голосовых агентов, способных рассуждать и выполнять вызовы инструментов, не нарушая естественный ход разговора.
Можно ли развернуть модели? Да, для производственного использования через API. Обе модели уже доступны в Gemini Live API и Google AI Studio. Это размещённые модели, а не модели с открытыми весами, поэтому возможности самостоятельного хостинга нет.
Что выпустила Google
Запуск охватывает 2 модели с разными задачами. Gemini 3.8 Live создана с учётом масштабирования и экономической эффективности. Она сочетает интеллектуальность в диалогах с плавным ведением разговора и визуальным контекстом. Gemini 3.8 Live Extended Thinking предназначена для решения сложных задач. Она обеспечивает более высокий уровень интеллекта и многошагового рассуждения во время разговора. Google позиционирует обе модели как упрощённую альтернативу каскадным речевым конвейерам, объединяющим ASR, LLM и TTS.
Результаты тестирования
Gemini 3.8 Live Extended Thinking заняла 1-е место в общем рейтинге Artificial Analysis Speech to Speech Quality Index, набрав 82,6 балла. Она лидирует по выполнению агентных задач с результатом 68,6% в τ-Voice и 35,1% в бенчмарке τ-Voice-banking от Sierra. Кроме того, модель набрала 97,7% в Big Bench Audio — тесте на способность аудиомоделей к рассуждению. Gemini 3.8 Live заняла второе место в Speech Agent Arena — оценке на основе человеческих предпочтений. В EVA-Bench от ServiceNow, как сообщает Google, модели расширяют границу Парето для сложных рабочих процессов. Они обеспечивают баланс между точностью выполнения задач и качеством диалога; оценка проводилась в Live API на платформе Gemini Enterprise Agent Platform.
Возможности для разработчиков
Live API предоставляет в новых моделях 5 ключевых возможностей:
- Асинхронный вызов функций: Модель выполняет вызовы API и инструментов в фоновом режиме. Аудиоответы продолжают передаваться пользователю, пока задачи выполняются.
- Визуальный контекст: Модель обрабатывает поступающие визуальные данные практически в реальном времени, поэтому агенты могут понимать, что пользователи говорят и видят.
- Точность при работе с буквенно-цифровыми данными: Модель точно распознаёт коды подтверждения, номера заявлений и технические данные — распространённые источники ошибок в голосовых системах.
- Поддержка нескольких языков: Модель автоматически распознаёт и переключается между 97 поддерживаемыми языками прямо во время разговора, сохраняя единообразие акцента.
- Инкрементальные обновления контента: Модель объединяет аудио в реальном времени со структурированными данными и формирует ответы с учётом контекста.
Extended Thinking добавляет настраиваемое рассуждение для многошагового анализа в фоновом режиме. Модель одновременно рассуждает и говорит, используя ранние словесные сигналы, такие как «Позвольте мне это проверить», чтобы подтвердить получение запроса. Затем она пошагово описывает ход выполнения, пока выполняются длительные задачи. В демонстрациях Google модель преобразует эскизы и голосовые комментарии в работающие компоненты React и координирует многошаговое бронирование.
Стоимость и экосистема
Стоимость обеих моделей составляет $0,005/мин за входной аудиопоток и $0,018/мин за выходной аудиопоток. Google заявляет, что эта оценка основана на тарифах $3 за 1 млн входных токенов и $12 за 1 млн выходных токенов. Разработчики также могут создавать приложения через партнёров по интеграции с Live API, которые обеспечивают инфраструктуру потоковой передачи мультимедиа в реальном времени. Среди них — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google также сотрудничает с Salesforce, Genspark и Lumeris, которые отмечают низкую задержку, плавность работы и поддержку вызова инструментов в этих моделях. Примеры приложений доступны на GitHub.
Основные выводы
- Gemini 3.8 Live Extended Thinking заняла 1-е место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6.
- Модель набрала 68,6% в τ-Voice, 35,1% в τ-Voice-banking от Sierra и 97,7% в Big Bench Audio.
- Gemini 3.8 Live выполняет вызовы инструментов и API в фоновом режиме, продолжая разговор.
- Стоимость через Live API составляет $0,005/мин за входной аудиопоток и $0,018/мин за выходной аудиопоток.
- Весь сгенерированный аудиоконтент содержит незаметный водяной знак SynthID от Google DeepMind.
Ознакомьтесь с техническими подробностями и публикацией для разработчиков. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему ML-сообществу на Reddit с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.