Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Представляем Gemini 3.8 Live и 3.8 Live Extended Thinking

Представляем Gemini 3.8 Live и 3.8 Live Extended Thinking

15 сентября 2026 г.

|

Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — наши самые продвинутые модели для живого диалога. Существенные улучшения в интеллектуальности и параллельном рассуждении делают взаимодействие с ними более интуитивным и позволяют выполнять сложные задачи с помощью голоса.


Tom Ouyang

Ведущий инженер

Malini Jaganathan

Штатный специалист технического отдела от имени команды Gemini Audio


Text "Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking" with the Gemini Spark, all on a light blue background

Сегодня мы представляем две новые модели, которые обеспечивают прогресс в рассуждении практически в реальном времени, позволяя эффективнее создавать голосовых агентов и делать общение с ИИ более интуитивным и интеллектуальным.

  • Gemini 3.8 Live: создана для масштабирования и экономии средств, сочетает интеллектуальность в диалоге с плавным общением и визуальным контекстом.
  • Gemini 3.8 Live Extended Thinking: создана для задач высокой сложности, отличается повышенной интеллектуальностью и многоэтапным рассуждением.

Для разработчиков и предприятий эти модели предоставляют базовые компоненты для создания надежных голосовых агентов, готовых к использованию в рабочих средах. Они также делают общение с Gemini в приложении Gemini, Google Workspace и Search более плавным и совместным, помогая решать сложные задачи только с помощью голоса.

Более плавные и интеллектуальные разговоры

Gemini 3.8 Live Extended Thinking обеспечивает выполнение задач корпоративного уровня и интеллектуальность, заняв первое место в общем зачете индекса качества преобразования речи в речь Artificial Analysis (82,6%), а также лидируя в выполнении агентных задач с результатом 68,6% в τ-Voice и 35,1% в тесте τ-Voice-banking от Sierra. Модель также демонстрирует сильные способности к рассуждению, набрав 97,7% в Big Bench Audio, при этом сохраняя весьма конкурентоспособную цену по сравнению с другими передовыми моделями.

Gemini 3.8 Live получила высокие оценки пользователей, заняв второе место в Speech Agent Arena. Помимо этих результатов, модель остается очень экономичной, предоставляя разработчикам и предприятиям функциональную и эффективную модель, созданную для масштабирования.

a chart showing Artificial Analysis Speech to Speech Index
A chart showing Artificial Analysis agentic performance
A chart showing Sierra
A chart showing Artificial Analysis cost per hour of input audio

В тесте EVA-Bench от ServiceNow, предназначенном для оценки голосовых агентов, наши модели расширяют границу Парето для сложных рабочих процессов, успешно сочетая точность с качеством диалога.

Примечание: тестирование проводилось в Live API на платформе Gemini Enterprise Agent Platform.

A chart showing EVA Bench Experience to Task Completion

Gemini 3.8 Live обрабатывает визуальные входные данные практически в реальном времени, обогащая разговоры контекстом для более полезных ответов. Модель автоматически обнаруживает и переключается между 97 поддерживаемыми языками прямо во время разговора. Она выполняет инструменты и вызовы API в фоновом режиме, продолжая разговор, поэтому модель может подтверждать запросы и поддерживать общение, пока задачи выполняются в фоне.

Gemini 3.8 Live в реальном времени помогает сотруднику пройти адаптацию, используя визуальный контекст для ответов на вопросы.

Посмотрите, как Gemini 3.8 Live играет в шахматы практически в реальном времени, используя визуальный контекст, рассуждение и естественный ход разговора.

Для задач, требующих более глубокого рассуждения, 3.8 Live Extended Thinking рассуждает и говорит одновременно. Модель обеспечивает повышенную интеллектуальность для сложных рабочих процессов, сохраняя непрерывный ход разговора — используя ранние словесные сигналы, такие как «Позвольте мне это проверить…», чтобы естественно подтверждать запросы, а также озвучивая ход выполнения в реальном времени, чтобы проводить пользователей через многоэтапные фоновые задачи по мере их выполнения.

Посмотрите, как Gemini 3.8 Live Extended Thinking превращает необработанные эскизы и голосовые отзывы практически в реальном времени в функциональные компоненты React.

Узнайте, как Gemini 3.8 Live Extended Thinking координирует многоэтапное бронирование и асинхронные вызовы функций — не прерывая естественный живой разговор.

Посмотрите, как Gemini 3.8 Live на лету создает полноценные бизнес-планы и индивидуальные маркетинговые наборы инструментов посредством естественной речи.

В Google Workspace и Search наши модели Live обеспечивают более интуитивный и совместный опыт, особенно при решении самых сложных задач.

Попробуйте Gemini 3.8 Live Extended Thinking в Google Workspace с Docs Live, Gmail Live и Keep Live.

Получайте пошаговую помощь в устранении неполадок в реальном времени на базе Gemini 3.8 Live — прямо в Search Live.

Развитие экосистемы голосовых решений для разработчиков и предприятий

Используя Gemini Live API, платформы для разработчиков, такие как Agora, Fishjam, LiveKit, Pipecat, Vercel и Vision Agents, позволяют разработчикам легко создавать и развертывать высокопроизводительные интерфейсы с голосовым управлением. Эти платформы управляют сложной инфраструктурой потоковой передачи мультимедиа в реальном времени в фоновом режиме, позволяя разработчикам полностью сосредоточиться на создании пользовательского опыта.

Мы также сотрудничаем с такими компаниями, как Salesforce, Genspark и Lumeris, которые проявляют большой интерес к 3.8 Live и 3.8 Live Extended Thinking, отмечая впечатляющие задержку, плавность работы и возможности вызова инструментов.

Salesforce quote
11Sight Quote
Equal AI Quote
ServiceNow quote
Genspark quote
Lenskart quote
Lumeris quote
Agora quote
Ambr AI quote
LiveKit Quote
Casuu quote

Обеспечьте прозрачность с помощью водяных знаков SynthID

Все аудио, созданное нашими продуктами на базе ИИ, снабжается водяным знаком SynthID. Этот незаметный водяной знак непосредственно встраивается в аудиовыход, гарантируя, что контент, созданный ИИ, остается обнаруживаемым, что помогает предотвращать распространение дезинформации. Подробнее о нашем подходе к безопасности и ответственному использованию можно узнать в карточке модели.

Начните использовать наши новейшие аудиомодели Gemini:

Развертывание 3.8 Live начинается сегодня:

Развертывание 3.8 Live Extended Thinking начинается сегодня:

  • Для разработчиков: в Gemini API и Google AI Studio
  • Для предприятий: в режиме закрытого предварительного просмотра в Gemini Enterprise, а вскоре — в Gemini Enterprise for Customer Experience и для корпоративных клиентов Google Workspace
  • Для всех: в Gemini Live, а также для подписчиков Google AI Pro и Ultra в Workspace — в Docs, и для всех подписчиков Google AI — в Gmail и Keep

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием DeepMind

Читать оригинал на DeepMind ↗

Текст и изображения принадлежат DeepMind и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости