API GPT-Live-1 от OpenAI позволяет разработчикам создавать приложения, которые одновременно говорят и слушают
OpenAI предоставляет GPT-Live-1 разработчикам в виде API. Речевая модель может одновременно слушать и говорить — функция, известная как «полный дуплекс», — и уже работает внутри ChatGPT. Разработчики могут подключать к ней разные серверные модели в зависимости от задачи, подбирая глубину рассуждений, скорость и стоимость для каждого сценария использования. При цене $0,05 за минуту это недешёвое решение. Yelp использует модель для бронирования по телефону и сообщает об улучшении обработки звонков, согласно техническому директору Алексу Леви.
В тестах OpenAI GPT-Live-1 значительно опережает своих предшественников. В тестах интерактивности в полном дуплексе модель набирает 80,1 процента против 45,4 процента у GPT-Realtime-2.1. Задержка при смене очередности реплик снижается с 1,4 до 0,8 секунды. Точность вызова инструментов возрастает с 60 до 87 процентов. В тесте голосовой поддержки банковских клиентов GPT-Live-1 достигает показателя прохождения 32 процента против 12,4 процента у предыдущей модели.
GPT-Live-1 также поставляется с двенадцатью новыми голосами, охватывающими разные акценты, диалекты и языки. Модель сразу предоставляет расшифровки ASR и текст ответов. Все подробности будут доступны в документации API.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.