Google запускает Gemini 3.8 Live, чтобы бросить вызов GPT-Live-1 от OpenAI за небольшую часть стоимости
Google DeepMind выпустила Gemini 3.8 Live и 3.8 Live Extended Thinking, две новые аудиомодели для разработчиков, доступные через Gemini API и Google AI Studio. Gemini 3.8 Live обеспечивает работу голосовых агентов, которые могут выполнять вызовы API в фоновом режиме, обрабатывать визуальные данные и одновременно продолжать разговор. Модель поддерживает более 97 языков. Вариант Extended Thinking занимает первое место в рейтинге Speech-to-Speech Leaderboard от Artificial Analysis с результатом 82,6 процента, опережая последние модели GPT-Live-1 от OpenAI. Примеры приложений доступны на GitHub.
Google взимает $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода — значительно дешевле, чем GPT-Live-1 от OpenAI, стоимость которого составляет $0,05 за минуту. Час голосового разговора обходится примерно в $1,38 у Google против как минимум $3,00 у OpenAI. Однако модель OpenAI по-прежнему должна обеспечивать более естественные разговоры благодаря полнодуплексному режиму, который позволяет ей одновременно слушать и говорить. Судя по демонстрациям, она также звучит лучше, что указывает на то, что Google вновь оптимизировала модель в пользу цены, а не качества.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный передовой отчёт «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.