Ці керівники вважають, що голосовий ШІ ще не пережив свій момент ChatGPT
Теорія про те, що голос стане наступним великим інтерфейсом, набирає значних обертів: інвестори вкладають мільярди доларів у стартапи у сфері голосового ШІ, які працюють у різних напрямах — від розробників моделей до постачальників корпоративних рішень для обслуговування клієнтів, а також від інструментів для створення нотаток із зустрічей до диктування на основі ШІ.
Щотижня з’являється нова модель або інструмент, які обіцяють звучати й вести діалог як людина. Однак насправді це може бути не так. Технічний директор корпоративної платформи голосового ШІ PolyAI Шон Вен вважає, що, попри випуск повнодуплексних моделей — здатних говорити, одночасно слухаючи вас, — голосовий ШІ ще не пережив свого «моменту ChatGPT».
«Ми досягли етапу розробки повнодуплексних моделей. Наступне завдання — зробити міркування дуже швидким, щоб моделі могли швидко знаходити відповіді, а розмова здавалася природною», — сказав він мені минулого місяця на сцені конференції HumanX.
Він також зазначив, що ШІ-агенти в обслуговуванні клієнтів не повинні звучати роботизовано й мають давати абонентам достатньо впевненості в тому, що можуть розв’язати їхні проблеми.
«Я думаю, що наступний етап буде дещо іншим, тому що, щойно голос стане достатньо якісним і клієнт буде готовий взаємодіяти з агентом протягом перших двох-трьох реплік, у нього почне формуватися довіра, і з часом він відчує: мабуть, мені не потрібно розмовляти з людиною, якщо агент може розв’язати мою проблему», — сказав він.
Алекс Ґей, директор із маркетингу Otter — сервісу для створення нотаток із зустрічей, — висловив думку, що ідентифікація мовців, визначення намірів і фіксація сказаного з використанням організаційних знань є ключовим кроком для автоматизації. Компанія також працює над цифровими двійниками, які можуть представляти людей на зустрічах. За його словами, для цієї технології надзвичайно важливо, щоб голос, який генерується, передавав такі самі емоційні прояви, як і розмова з людиною на зустрічі.
«Якщо подумати про зустрічі, у яких ви зараз берете участь, найкращі розмови — це ті, де можна вести дебати й стратегічні обговорення, а також відчувати, що в їхній основі лежать певні взаємини. Якщо ви не можете мати цього з аватаром, то це просто чат-бот у форматі запитань і відповідей», — зазначив Ґей.
Розуміння та прозорість голосового ШІ
Хоча моделі голосового ШІ вдосконалилися, ШІ-асистенти часто не розуміють користувачів, а ваш сервіс для створення нотаток із зустрічей може показати неправильну розшифровку або резюме.
Вен вважає, що моделі ASR (автоматичного розпізнавання мовлення) часто пропускають важливі ключові слова, що створює проблему з відтворенням усього контексту.
Ґей з Otter погодився з цим, додавши, що компанія продовжує працювати над удосконаленням транскрипції. Він також сказав, що мова — це одна зі сфер, у яких голосовим моделям потрібно покращуватися.
«Для Otter, знаєте, транскрипція ніколи не була кінцевою метою. Це був лише шар, на основі якого ми могли почати забезпечувати підвищення продуктивності. Але якщо ваша початкова транскрипція не була достатньо точною, усі подальші дії стають помилковими. І щойно це починає призводити до дій, які є неправильними, ви втрачаєте довіру до платформи. Для нас критично важливо й надалі вдосконалювати модель ASR, адже всі подальші наслідки є значними», — сказав він.
З появою нових голосових інструментів постає також питання прозорості. Інструменти повинні повідомляти клієнтам, що їх записують або що вони розмовляють із ШІ. У Otter заявили, що хочуть зміцнювати довіру людей, присутніх на зустрічі, тому навіть у випадку зустрічі, де бота немає, компанія хоче випробовувати такі методи, як повідомлення всім учасникам чату про те, що зустріч записується. Вен із PolyAI також зазначив, що під час корпоративних дзвінків важливо чітко повідомляти людям, що вони розмовляють із ШІ.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.