Эти руководители считают, что голосовой ИИ ещё не пережил свой момент ChatGPT
Теория о том, что голос станет следующим важнейшим интерфейсом, набирает серьёзные обороты: инвесторы вливают миллиарды долларов в стартапы, занимающиеся голосовым ИИ, — от разработчиков моделей до поставщиков решений для обслуживания корпоративных клиентов, а также от сервисов автоматической записи заметок на встречах до диктовки на базе ИИ.
Каждую неделю появляется новая модель или инструмент, которые обещают звучать и вести диалог по-человечески. Однако в реальности это может быть не так. По мнению технического директора корпоративной платформы голосового ИИ PolyAI Шона Вэня, несмотря на выпуск полнодуплексных моделей — способных говорить, одновременно слушая вас, — голосовой ИИ ещё не пережил свой «момент ChatGPT».
«Мы достигли важной вехи, разработав полнодуплексные модели. Следующая задача — сделать рассуждения очень быстрыми, чтобы модели могли оперативно находить ответы, а разговор ощущался естественным», — сказал он мне на сцене конференции HumanX в прошлом месяце.
Он также отметил, что ИИ-агенты в службах поддержки клиентов не должны звучать роботизированно и должны придавать звонящим достаточную уверенность в том, что они способны решить их проблемы.
«Думаю, следующий этап будет немного иным, потому что, когда голос становится достаточно хорошим и клиент готов взаимодействовать с агентом в течение первых двух-трёх реплик, у него начинает формироваться доверие. Со временем он подумает: “Возможно, мне не нужно разговаривать с человеком, если агент способен решить мою проблему”», — сказал он.
Алекс Гэй, директор по маркетингу сервиса автоматической записи заметок на встречах Otter, считает, что идентификация говорящих, распознавание намерений и преобразование сказанного в текст с учётом организационных знаний — важный шаг на пути к автоматизации. Компания также работает над цифровыми двойниками, которые могут представлять людей на встречах. По его словам, для этой технологии крайне важно, чтобы голос на выходе передавал те же эмоциональные оттенки, что и разговор с человеком на встрече.
«Если подумать о встречах, в которых вы сейчас участвуете, лучшие разговоры проходят там, где можно спорить и обсуждать стратегию, а также чувствовать, что в основе общения лежат отношения. Если вы не можете добиться этого с аватаром, то это всего лишь чат-бот для вопросов и ответов», — отметил Гэй.
Понимание и прозрачность голосового ИИ
Хотя модели голосового ИИ стали лучше, ИИ-ассистенты часто не понимают пользователей, а сервис автоматической записи заметок на встречах может показать неправильную расшифровку или резюме.
Вэнь считает, что модели ASR (автоматического распознавания речи) часто пропускают важные ключевые слова, из-за чего возникают проблемы с фиксацией всего контекста.
Гэй из Otter согласился с этим и добавил, что компания продолжает работать над улучшением расшифровки. Он также сказал, что язык — одна из областей, в которых голосовым моделям необходимо совершенствоваться.
«Для Otter расшифровка, понимаете, никогда не была конечной целью. Это был лишь слой, на основе которого мы могли начать повышать продуктивность. Но если ваша исходная расшифровка недостаточно точна, все последующие действия оказываются ошибочными. И как только система начинает выполнять неправильное действие, вы теряете доверие к платформе. Для нас крайне важно продолжать совершенствовать модель ASR, потому что все последующие последствия имеют огромное значение», — сказал он.
Новые голосовые инструменты также поднимают вопрос прозрачности. Инструменты должны сообщать клиентам, что их записывают или что они разговаривают с ИИ. В Otter заявили, что хотят укреплять доверие людей, участвующих во встречах, поэтому даже на встречах, где бот отсутствует, компания хочет использовать такие методы, как уведомление всех участников чата о том, что встреча записывается. Вэнь из PolyAI также отметил, что во время корпоративных звонков важно прямо обозначать, что люди разговаривают с ИИ.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.