Тези ръководители смятат, че гласовият ИИ все още не е достигнал своя ChatGPT момент
Теорията, че гласът ще бъде следващият голям интерфейс, набира сериозна скорост, като инвеститорите вливат милиарди долари в стартъпи за гласов изкуствен интелект, работещи в области от създатели на модели до доставчици на корпоративно обслужване на клиенти и от инструменти за водене на бележки от срещи до диктовка с помощта на ИИ.
Всяка седмица се появява нов модел или инструмент, който твърди, че звучи и разговаря като човек. На практика обаче това може и да не е така. Техническият директор на корпоративната платформа за гласов ИИ PolyAI Шон Уен смята, че въпреки пускането на модели с пълен дуплекс — които могат да говорят, докато ви слушат — гласовият ИИ все още не е преживял своя „момент ChatGPT“.
„Достигнахме важен етап с разработването на модели с пълен дуплекс. Следващото предизвикателство е разсъждението да стане много бързо, така че моделите да могат бързо да намират отговори и разговорът да се усеща естествен“, каза той пред мен на сцената на конференцията HumanX миналия месец.
Той също така каза, че ИИ агентите в обслужването на клиенти не трябва да звучат роботизирано и трябва да дават на обаждащите се достатъчно увереност, че могат да решат проблемите им.
„Мисля, че следващият етап ще бъде малко по-различен, защото когато гласът стане достатъчно добър и клиентът е готов да взаимодейства с тях през първите два или три хода, те започват да изграждат доверие и с течение на времето ще си помислят: вероятно няма нужда да говоря с човек, ако агентът може да реши проблема ми“, каза той.
Алекс Гей, главен маркетинг директор на инструмента за водене на бележки от срещи Otter, заяви, че идентифицирането на говорителите, улавянето на намеренията и записването им с помощта на организационни знания са ключови стъпки за автоматизацията. Компанията работи и върху дигитални двойници, които могат да представляват хората на срещи. За тази технология той каза, че е от първостепенно значение гласът на резултата да предава същите емоционални изражения като разговор с човек на среща.
„Ако помислите за срещите, в които участвате в момента, най-добрите разговори са тези, в които можете да водите дебати и стратегически дискусии и когато усещате, че зад тях стои връзка. Ако не можете да постигнете това с аватар, тогава той е просто чатбот за въпроси и отговори“, отбеляза Гей.
Разбирането и прозрачността на гласовия ИИ
Макар че моделите за гласов ИИ са се подобрили, ИИ асистентите често не разбират потребителите, а инструментът ви за водене на бележки от срещи показва грешен транскрипт или обобщение.
Уен смята, че моделите за ASR (автоматично разпознаване на реч) често пропускат важни ключови думи и това създава проблеми при улавянето на целия контекст.
Гей от Otter се съгласи с това и добави, че компанията продължава да работи за подобряване на транскрипцията. Той също така каза, че езикът е една от областите, в които гласовите модели трябва да се подобрят.
„За Otter, знаете, транскрипцията никога не е била крайната цел. Тя беше просто слоят, върху който можехме да започнем да изграждаме някои от повишенията на производителността. Но ако първоначалната ви транскрипция не е достатъчно точна, всички последващи действия, които предприемате, се оказват погрешни. А в момента, в който това започне да води до действие, което е неправилно, губите доверие в платформата. За нас е от критично значение да продължим да подобряваме този ASR модел, защото всички последващи въздействия са значителни“, каза той.
С новите гласови инструменти възниква и въпросът за прозрачността. Инструментите трябва да уведомяват клиентите, че разговорът им се записва или че говорят с ИИ. От Otter заявиха, че искат да изградят доверие у хората, които участват в среща, така че дори при среща, на която ботът не присъства, компанията иска да изпробва методи като уведомяване на всички в чата, че срещата се записва. Уен от PolyAI също каза, че е важно да се уточнява, че хората разговарят с ИИ при корпоративни разговори.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.