Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для голосовых агентов производственного уровня

Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — самые продвинутые на сегодняшний день модели для живого диалога. Обе модели изначально разработаны для преобразования речи в речь и предназначены для голосовых агентов, работающих в реальном времени. Они расширяют семейство Gemini Audio, которое Google расширила в прошлом месяце с помощью Gemini 3.5 Transcribe. Выпуск нацелен на решение конкретной проблемы: создание голосовых агентов, способных рассуждать и выполнять вызовы инструментов, не нарушая естественный ход разговора.

Можно ли развернуть модели? Да, для производственного использования через API. Обе модели уже доступны в Gemini Live API и Google AI Studio. Это размещённые модели, а не модели с открытыми весами, поэтому возможности самостоятельного хостинга нет.

Что выпустила Google

Запуск охватывает 2 модели с разными задачами. Gemini 3.8 Live создана с учётом масштабирования и экономической эффективности. Она сочетает интеллектуальность в диалогах с плавным ведением разговора и визуальным контекстом. Gemini 3.8 Live Extended Thinking предназначена для решения сложных задач. Она обеспечивает более высокий уровень интеллекта и многошагового рассуждения во время разговора. Google позиционирует обе модели как упрощённую альтернативу каскадным речевым конвейерам, объединяющим ASR, LLM и TTS.

Результаты тестирования

Gemini 3.8 Live Extended Thinking заняла 1-е место в общем рейтинге Artificial Analysis Speech to Speech Quality Index, набрав 82,6 балла. Она лидирует по выполнению агентных задач с результатом 68,6% в τ-Voice и 35,1% в бенчмарке τ-Voice-banking от Sierra. Кроме того, модель набрала 97,7% в Big Bench Audio — тесте на способность аудиомоделей к рассуждению. Gemini 3.8 Live заняла второе место в Speech Agent Arena — оценке на основе человеческих предпочтений. В EVA-Bench от ServiceNow, как сообщает Google, модели расширяют границу Парето для сложных рабочих процессов. Они обеспечивают баланс между точностью выполнения задач и качеством диалога; оценка проводилась в Live API на платформе Gemini Enterprise Agent Platform.

Возможности для разработчиков

Live API предоставляет в новых моделях 5 ключевых возможностей:

  • Асинхронный вызов функций: Модель выполняет вызовы API и инструментов в фоновом режиме. Аудиоответы продолжают передаваться пользователю, пока задачи выполняются.
  • Визуальный контекст: Модель обрабатывает поступающие визуальные данные практически в реальном времени, поэтому агенты могут понимать, что пользователи говорят и видят.
  • Точность при работе с буквенно-цифровыми данными: Модель точно распознаёт коды подтверждения, номера заявлений и технические данные — распространённые источники ошибок в голосовых системах.
  • Поддержка нескольких языков: Модель автоматически распознаёт и переключается между 97 поддерживаемыми языками прямо во время разговора, сохраняя единообразие акцента.
  • Инкрементальные обновления контента: Модель объединяет аудио в реальном времени со структурированными данными и формирует ответы с учётом контекста.

Extended Thinking добавляет настраиваемое рассуждение для многошагового анализа в фоновом режиме. Модель одновременно рассуждает и говорит, используя ранние словесные сигналы, такие как «Позвольте мне это проверить», чтобы подтвердить получение запроса. Затем она пошагово описывает ход выполнения, пока выполняются длительные задачи. В демонстрациях Google модель преобразует эскизы и голосовые комментарии в работающие компоненты React и координирует многошаговое бронирование.

Стоимость и экосистема

Стоимость обеих моделей составляет $0,005/мин за входной аудиопоток и $0,018/мин за выходной аудиопоток. Google заявляет, что эта оценка основана на тарифах $3 за 1 млн входных токенов и $12 за 1 млн выходных токенов. Разработчики также могут создавать приложения через партнёров по интеграции с Live API, которые обеспечивают инфраструктуру потоковой передачи мультимедиа в реальном времени. Среди них — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google также сотрудничает с Salesforce, Genspark и Lumeris, которые отмечают низкую задержку, плавность работы и поддержку вызова инструментов в этих моделях. Примеры приложений доступны на GitHub.

Основные выводы

  • Gemini 3.8 Live Extended Thinking заняла 1-е место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6.
  • Модель набрала 68,6% в τ-Voice, 35,1% в τ-Voice-banking от Sierra и 97,7% в Big Bench Audio.
  • Gemini 3.8 Live выполняет вызовы инструментов и API в фоновом режиме, продолжая разговор.
  • Стоимость через Live API составляет $0,005/мин за входной аудиопоток и $0,018/мин за выходной аудиопоток.
  • Весь сгенерированный аудиоконтент содержит незаметный водяной знак SynthID от Google DeepMind.

Ознакомьтесь с техническими подробностями и публикацией для разработчиков. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему ML-сообществу на Reddit с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости