API на GPT-Live-1 от OpenAI позволява на разработчиците да създават приложения, които говорят и слушат едновременно
OpenAI предоставя GPT-Live-1 на разработчиците като API. Гласовият модел може да слуша и говори едновременно, функция, известна като „пълен дуплекс“, и вече работи в ChatGPT. Разработчиците могат да го комбинират с различни бекенд модели в зависимост от задачата, като съобразяват дълбочината на разсъжденията, скоростта и разходите с всеки конкретен случай на употреба. При цена от 0,05 долара на минута той не е евтин. Yelp използва модела за телефонни резервации и отчита по-добро обслужване на обажданията, според техническия директор Алекс Леви.
В бенчмарковете на OpenAI GPT-Live-1 значително изпреварва предшествениците си. При тестове за интерактивност в пълен дуплекс той постига 80,1 процента в сравнение с 45,4 процента за GPT-Realtime-2.1. Латентността при редуването на репликите спада от 1,4 на 0,8 секунди. Точността при извикване на инструменти нараства от 60 на 87 процента. При бенчмарк за гласова поддръжка в банковия сектор GPT-Live-1 постига 32 процента успеваемост спрямо 12,4 процента за предишния модел.
GPT-Live-1 се предлага и с дванадесет нови гласа, обхващащи различни акценти, диалекти и езици. Той предоставя транскрипции от ASR и текст на отговорите още по подразбиране. Пълните подробности ще бъдат достъпни в документацията за API.
Новини за изкуствения интелект без сензация – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен годишен доклад „AI Radar“ за новостите на водещите технологии, публикуван шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.