Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Google пусна Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking за гласови агенти с производствено качество

Google представи Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — най-напредналите му досега модели за разговори в реално време. И двата са модели за преобразуване на реч в реч, създадени за гласови агенти в реално време. Те разширяват семейството Gemini Audio, което Google разшири миналия месец с Gemini 3.5 Transcribe. Пускането им цели да запълни конкретна празнина: гласови агенти, които могат да разсъждават и да изпълняват инструменти, без да нарушават хода на разговора.

Могат ли да бъдат внедрени? Да, за производствена употреба чрез API. И двата модела са достъпни днес в Gemini Live API и Google AI Studio. Те са хоствани модели, а не модели с отворени тегла, така че няма възможност за самостоятелно хостване.

Какво представи Google

Стартирането обхваща 2 модела с различни роли. Gemini 3.8 Live е създаден за мащаб и ефективност на разходите. Той съчетава разговорен интелект с плавен диалог и визуално заземяване. Gemini 3.8 Live Extended Thinking е създаден за задачи с висока сложност. Той добавя повишен интелект и многостъпково разсъждение, докато говори. Google представя и двата модела като оптимизирана алтернатива на каскадните речеви процеси, които свързват ASR, LLM и TTS.

Резултати от бенчмарковете

Gemini 3.8 Live Extended Thinking заема първото място в общото класиране на Artificial Analysis за индекса за качество на преобразуването на реч в реч с резултат 82.6. Той води при изпълнението на агентски задачи с 68.6% в τ-Voice и 35.1% в бенчмарка τ-Voice-banking на Sierra. Освен това получава 97.7% в Big Bench Audio — бенчмарк за разсъждение при аудиомодели. Gemini 3.8 Live заема второ място в Speech Agent Arena — оценка на човешките предпочитания. В EVA-Bench на ServiceNow Google съобщава, че моделите изместват границата на Парето при сложни работни процеси. Те балансират точността на задачите с качеството на разговора, измерени в Live API на Gemini Enterprise Agent Platform.

Възможности за разработчици

Live API предоставя 5 основни възможности в новите модели:

  • Асинхронно извикване на функции: Моделът изпълнява извикванията към API и инструментите във фонов режим. Аудиоотговорите продължават да се предават към потребителя, докато задачите приключат.
  • Визуален контекст: Моделът обработва визуални входни данни на живо почти в реално време, така че агентите да могат да разбират какво казват и виждат потребителите.
  • Алфанумерична прецизност: Той прецизно анализира кодове за потвърждение, номера на искове и технически данни — честа причина за грешки в гласовите системи.
  • Многоезична поддръжка: Той автоматично открива и преминава между 97 поддържани езика по време на разговора, като запазва последователността на акцента.
  • Постепенни актуализации на съдържанието: Той комбинира аудио в реално време със структурирани данни, за да предоставя отговори, съобразени с контекста.

Extended Thinking добавя конфигурируемо мислене за многостъпково разсъждение във фонов режим. Той разсъждава и говори едновременно, като използва ранни вербални сигнали като „Нека проверя“ за потвърждение на подканите. След това описва напредъка стъпка по стъпка, докато се изпълняват продължителни задачи. Демонстрациите на Google показват как моделът превръща скици и гласова обратна връзка в работещи React компоненти и координира многостъпкови резервации.

Ценообразуване и екосистема

И двата модела са на цена от $0.005/мин. за аудио вход и $0.018/мин. за аудио изход. Google посочва, че тази оценка се основава на $3/1M входни токена и $12/1M изходни токена. Разработчиците могат също да създават приложения чрез интеграционни партньори на Live API, които управляват инфраструктурата за поточно предаване на медии в реално време. Сред тях са Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Google също си партнира със Salesforce, Genspark и Lumeris, които изтъкват латентността, плавността и извикването на инструменти при моделите. Примерни приложения са налични в GitHub.

Основни изводи

  • Gemini 3.8 Live Extended Thinking заема първото място в индекса за качество на преобразуването на реч в реч на Artificial Analysis с резултат 82.6.
  • Той постига 68.6% в τ-Voice, 35.1% в τ-Voice-banking на Sierra и 97.7% в Big Bench Audio.
  • Gemini 3.8 Live изпълнява инструменти и извиквания към API във фонов режим, като същевременно продължава разговора.
  • Цената чрез Live API е $0.005/мин. за аудио вход и $0.018/мин. за аудио изход.
  • Цялото генерирано аудио съдържа незабележимия воден знак SynthID на Google DeepMind.

Вижте техническите подробности и публикацията за разработчици. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини