Google пуска Gemini 3.8 Live, за да се конкурира с GPT-Live-1 на OpenAI на част от цената
Google DeepMind пусна Gemini 3.8 Live и 3.8 Live Extended Thinking, два нови аудио модела за разработчици, достъпни чрез Gemini API и Google AI Studio. Gemini 3.8 Live задвижва гласови агенти, които могат да извършват API извиквания във фонов режим, да обработват визуална информация и да продължават да говорят едновременно. Моделът поддържа над 97 езика. Вариантът Extended Thinking заема първо място в класацията Speech-to-Speech на Artificial Analysis с 82,6 процента, пред най-новите модели GPT-Live-1 на OpenAI. Примерни приложения са достъпни в GitHub.
Google таксува $0.005 на минута за аудио вход и $0.018 за изход, което е значително по-евтино от GPT-Live-1 на OpenAI, чиято цена е $0.05 на минута. Един час гласов разговор струва около $1.38 с Google срещу най-малко $3.00 с OpenAI. Въпреки това моделът на OpenAI вероятно ще осигурява по-естествени разговори благодарение на пълния дуплекс, който му позволява да слуша и говори едновременно. Съдейки по демонстрациите, той звучи и по-добре, което подсказва, че Google отново е оптимизирала цената за сметка на качеството.
Новини за изкуствения интелект без преувеличения – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за новостите в областта на изкуствения интелект „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.