Google випустила Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking для голосових агентів виробничого рівня
Google представила Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking — свої найсучасніші на сьогодні моделі для живого діалогу. Обидві є нативними моделями перетворення мовлення на мовлення, створеними для голосових агентів, що працюють у реальному часі. Вони розширюють сімейство Gemini Audio, яке Google доповнила минулого місяця моделлю Gemini 3.5 Transcribe. Реліз спрямований на усунення конкретної проблеми: голосові агенти мають уміти міркувати й виконувати виклики інструментів, не перериваючи перебіг розмови.
Чи придатні вони для розгортання? Так, для використання у виробничих середовищах через API. Обидві моделі вже доступні в Gemini Live API і Google AI Studio. Це розміщені моделі, а не відкриті ваги, тому можливості самостійного розгортання немає.
Що випустила Google
Запуск охоплює 2 моделі з різними ролями. Gemini 3.8 Live створена для масштабування та економічної ефективності. Вона поєднує інтелектуальність у веденні діалогу з плавною розмовою та візуальним контекстом. Gemini 3.8 Live Extended Thinking призначена для завдань високої складності. Вона додає підвищену інтелектуальність і багатокрокове міркування під час мовлення. Google позиціонує обидві моделі як спрощену альтернативу каскадним мовленнєвим конвеєрам, що послідовно поєднують ASR, LLM і TTS.
Результати бенчмарків
Gemini 3.8 Live Extended Thinking посідає 1-е місце в загальному рейтингу Artificial Analysis Speech to Speech Quality Index з результатом 82,6. Вона лідирує за виконанням агентських завдань із результатом 68,6% у τ-Voice та 35,1% у бенчмарку Sierra τ-Voice-banking. Також модель набирає 97,7% у Big Bench Audio — бенчмарку для оцінювання міркування аудіомоделей. Gemini 3.8 Live посіла друге місце в Speech Agent Arena — оцінюванні за людськими вподобаннями. У EVA-Bench від ServiceNow Google повідомляє, що моделі розширюють фронт Парето для складних робочих процесів. Вони забезпечують баланс між точністю виконання завдань і якістю діалогу, виміряними в Live API на Gemini Enterprise Agent Platform.
Можливості для розробників
Live API відкриває 5 основних можливостей у нових моделях:
- Асинхронний виклик функцій: Модель виконує виклики API та інструментів у фоновому режимі. Аудіовідповіді продовжують передаватися користувачеві, поки завдання виконуються.
- Візуальний контекст: Модель обробляє живі візуальні дані майже в реальному часі, тому агенти можуть розуміти, що користувачі говорять і бачать.
- Точність буквено-цифрових даних: Вона точно розпізнає коди підтвердження, номери заяв і технічні дані — поширені проблемні місця голосових систем.
- Багатомовна підтримка: Вона автоматично визначає та перемикається між 97 підтримуваними мовами посеред розмови, зберігаючи послідовність акценту.
- Інкрементальні оновлення вмісту: Вона поєднує аудіо в реальному часі зі структурованими даними, щоб повертати відповіді з урахуванням контексту.
Extended Thinking додає налаштоване міркування для багатокрокового міркування у фоновому режимі. Модель одночасно міркує та говорить, використовуючи ранні словесні сигнали, як-от «Дозвольте перевірити», щоб підтвердити отримання запитів. Потім вона крок за кроком озвучує перебіг виконання, поки тривають довготривалі завдання. Демонстрації Google показують, як модель перетворює ескізи разом із голосовими відгуками на робочі компоненти React і координує багатокрокове бронювання.
Ціни та екосистема
Обидві моделі коштують $0,005/хв за вхідне аудіо та $0,018/хв за вихідне аудіо. Google зазначає, що ця оцінка базується на $3 за 1 млн вхідних токенів і $12 за 1 млн вихідних токенів. Розробники також можуть створювати рішення через партнерів з інтеграції Live API, які забезпечують інфраструктуру потокової передачі медіаданих у реальному часі. Серед них — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents. Google також співпрацює із Salesforce, Genspark і Lumeris, які відзначають низьку затримку, плавність роботи та виклик інструментів у цих моделей. Приклади застосунків доступні на GitHub.
Основні висновки
- Gemini 3.8 Live Extended Thinking посідає 1-е місце в Speech to Speech Quality Index від Artificial Analysis з результатом 82,6.
- Вона набирає 68,6% у τ-Voice, 35,1% у Sierra τ-Voice-banking і 97,7% у Big Bench Audio.
- Gemini 3.8 Live виконує інструменти та виклики API у фоновому режимі, продовжуючи розмову.
- Вартість через Live API становить $0,005/хв за вхідне аудіо та $0,018/хв за вихідне аудіо.
- Усе згенероване аудіо містить непомітний водяний знак SynthID від Google DeepMind.
Ознайомтеся з технічними деталями та . Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субредіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.