ШІ для жестової мови — у руках користувачів
Команда Google DeepMind з жестової мови
Представляємо sign-language-to-text (SL2T) — проривну модель, яка забезпечує нові функції жестової мови для глухих і людей із порушеннями слуху.
Здатність ШІ обробляти усні мови стрімко розвивалася протягом останніх десятиліть, уможлививши автоматичний переклад, диктування та розмовні інтерфейси, які здаються безперешкодними людям із нормальним слухом. Однак ця технологічна революція ще не охопила понад 200 жестових мов світу — і приблизно 70 мільйонів глухих людей та людей із порушеннями слуху, які ними користуються.
Сьогодні ми представляємо масштабну мультимовну модель перекладу з жестової мови в текст (SL2T), яка є проривом у якості та універсальності. Завдяки їй ми вперше виводимо ШІ для жестової мови з лабораторії в споживчі продукти: SL2T забезпечує диктування з жестової мови в текст у Gboard і Live Transcribe на Pixel 11, починаючи з американської жестової мови (ASL) та англійської. Незабаром з’являться інші пристрої, а згодом — і додаткові мови.
Так само як люди з нормальним слухом можуть використовувати диктування замість набору тексту, ця функція дає змогу глухим користувачам жестикулювати на телефоні всюди, де вони зазвичай набирали б текст. Ви можете жестами шукати в інтернеті, створювати чернетки повідомлень або документів, а також просити Gemini розв’язувати запити чи виконувати завдання. У Live Transcribe ви можете жестами відповідати під час розмов замість того, щоб друкувати повідомлення у відповідь. За словами наших тестувальників, жестова комунікація мовою ASL швидша, природніша й приємніша за набір тексту англійською.
Функція перетворення жестів на текст на основі SL2T дає змогу користувачам жестикулювати на телефоні всюди, де вони зазвичай набирали б текст.
Чому жестові мови важливі
Жестові мови є основними мовами спільнот глухих у всьому світі та основою культурної ідентичності глухих. Серед глухих людей існує значне різноманіття щодо рівня володіння жестовою мовою, усним мовленням, читанням і письмом, тому важливо забезпечити доступ у всіх формах комунікації. Глухі люди можуть отримувати користь від обробки жестової мови так само, як люди з нормальним слухом — від обробки усної мови, а ця технологія також відкриває нові можливості для подолання комунікаційного бар’єра між спільнотами глухих і людей із нормальним слухом. Попри цю можливість позитивного суспільного впливу, розвиток ШІ для жестових мов відбувався повільно — як через складність створення ШІ для жестових мов, так і через поширені хибні уявлення про те, як функціонують самі ці мови.
Порівняно з транскрибуванням усної мови, переклад жестової мови має дві основні проблеми. По-перше, транскрибування мовлення полягає в послідовному перетворенні звуку на текст тією самою мовою, тоді як жестові мови є незалежними природними мовами зі своєю унікальною граматикою та лексиконами. Отже, вони потребують справжнього машинного перекладу, а не послідовного перетворення жестів на слова. По-друге, модель має навчитися «бачити» та розуміти фізичний рух. Жестові мови передають значення за допомогою одночасних рухів рук, передпліч, тулуба, голови й обличчя. Точне відстеження цих рухів із високою частотою кадрів є складним і обчислювально вимогливим завданням комп’ютерного зору.
З огляду на це легко зрозуміти, чому деякі ранні спроби створити технології для жестової мови, як-от рукавички для жестової мови, були принципово обмеженими: жестові мови — це не просто «англійська, яку показують руками». Вони потребують складного візуального сприйняття тонких рухів усього тіла та повноцінного мовного перекладу. SL2T призначена для забезпечення обох компонентів.
SL2T сприймає жести як точки на тілі людини, що жестикулює, і перекладає їх у текстовий потік. Приклад із тесту FLEURS-ASL.
Як працює SL2T
Ми створили SL2T, поєднавши орієнтований на користувача та культурно обізнаний підхід із масштабуванням даних. Модель навчалася на понад 100 000 годинах даних більш ніж 50 жестових мов — приблизно чверть даних припадає на ASL. Спільне навчання на різноманітних мовах, діалектах і рівнях володіння ними дає моделі змогу вивчати спільні базові структури, завдяки чому в наших експериментах вона перевершує одномовні моделі.
Щоб захистити приватність користувачів, SL2T сприймає жестову мову як послідовність координат ключових точок пози, а не як необроблений відеопотік із камери. Модель на пристрої (MediaPipe Holistic) відстежує розташування точок на тілі людини, що жестикулює, і на сервер для перекладу надсилаються лише ці геометричні координати, завдяки чому оригінальне відео можна негайно видалити.
SL2T перекладає цю послідовність координат безпосередньо в текст, оминаючи проміжні анотації, відомі як «глоси», які широко використовувалися в попередніх дослідженнях перекладу жестової мови. Глоси не здатні передати багаті нелінійні аспекти жестових мов, як-от немануальні маркери та просторові конструкції. Безпосередній переклад із ключових точок усуває штучні обмеження словника та дає змогу якості перекладу безпосередньо масштабуватися разом із даними.
Згідно з ключовими тестами, як-от FLEURS-ASL (sd-test), який оцінює якість перекладу з ASL на англійську, SL2T є найпотужнішою моделлю перекладу жестової мови на сьогодні. SL2T досягає вражаючого показника zero-shot — 70 BLEURT, що значно перевищує будь-який раніше опублікований результат. Однак оптимізація самих лише академічних тестів не гарантує зручності у реальних застосунках, тому ми наполегливо працювали над практичними питаннями: мінімізацією затримки потокової передачі, запобіганням галюцинаціям у разі відсутності жестів, забезпеченням справедливості для 10% людей, що жестикулюють лівою рукою, а також покращенням роботи з жестами однією рукою, коли в іншій користувач тримає смартфон.
| Оригінальний текст англійською | Результат SL2T: ASL → англійська |
|---|---|
| На Островах Кука немає міст, але вони складаються з 15 різних островів. Основні з них — Раротонга та Айтутакі. | На Островах Кука немає міст, вони складаються з 15 островів. Два основні острови — Раротонга та Айтутакі. |
| Ігри розпочалися о 10:00 за чудової погоди, і, крім легкої мряки в середині ранку, яка швидко припинилася, це був ідеальний день для регбі-7. | Ігри починаються о 10:00 за чудової погоди. Вранці йде легкий дощ, який припиняється. Це ідеальний день для регбі-7. |
| У деяких федеративних країнах, таких як Сполучені Штати та Канада, прибутковий податок стягується як на федеральному, так і на місцевому рівні, тому ставки й діапазони можуть відрізнятися залежно від регіону. | У деяких федеративних країнах, як-от США та Канада, прибутковий податок стягується на федеральному й місцевому рівнях. Це означає, що ставки та діапазони відрізняються залежно від вашого регіону. |
| Вважалося, що цей повністю оперений теплокровний хижий птах ходив прямо на двох ногах із кігтями, як у велоцираптора. | Ця істота теплокровна, їсть сіре та вкрита пір’ям. Вважається, що вона ходить на двох ногах, як велоцираптор. |
| Можливо, одного дня ваші праправнуки стоятимуть на вершині чужого світу й дивуватимуться своїм давнім предкам? | Можливо, одного дня ваші праправнуки стоятимуть на чужому світі та розмірковуватимуть про своїх предків. |
Приклади з тесту FLEURS-ASL. SL2T точно перекладає складну ASL на вільну англійську. Іноді трапляються помилки в рідкісних жестах, швидкому дактилюванні («prey» → «grey»), пасивних конструкціях, зображенні за допомогою класифікаторів (пропущено «claws») і часі без контексту («kicked off» → «start»).
Створення разом зі спільнотою
Ми віримо, що потрібно створювати технології разом зі спільнотою глухих, а не лише для неї. Погляди глухих людей формували кожен етап цього проєкту — від задуму, запропонованого глухим співробітником Google Семом Сепахом, до збору даних із партнерами з числа глухих, оцінювання в дослідженнях за участю глухих користувачів і оцінки впливу технології експертами з числа глухих.
Щоб забезпечити відповідальне впровадження у реальному світі, ми створили Консультативний комітет із питань ШІ для жестової мови (AISLAC), об’єднавши численні глобальні організації глухих і профільних експертів. Завдяки цій моделі спільного управління спільноти, на які найбільше впливає наша технологія, безпосередньо визначають пріоритети її розробки. Ми спільно підготували спільний звіт про вплив для випуску SL2T 1.0 у Gboard і Live Transcribe, прозоро описавши можливості та поточні обмеження технології — цей спільний підхід ми плануємо продовжувати для всіх основних випусків технологій для жестових мов.
Погляд у майбутнє
SL2T спирається на десятиліття фундаментальних досліджень в академічному середовищі та індустрії, але поява введення ASL на телефонах користувачів — лише початок. Місія Google — упорядкувати світову інформацію та зробити її загальнодоступною й корисною. Досягнення універсальної доступності означає забезпечення повної рівності з усними та писемними мовами. Наша команда працює над розширенням цієї технології на додаткові жестові мови, генерацію жестової мови та передові можливості ШІ. Ми з нетерпінням чекаємо можливості відповідально ділитися результатами нашої роботи, щоб доступ через жестові мови став стандартом у цифровому середовищі.
Ви можете випробувати SL2T у Gboard і Live Transcribe спочатку на Pixel 11, а незабаром з’являться й інші пристрої — усе це без додаткової плати.
Подяки
Цю роботу спільно виконали команди Google DeepMind і Android. Основна команда, яка розробила модель SL2T: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang і Chris Dyer.
Команда Android, яка інтегрувала модель у Gboard і Live Transcribe: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su та Sharlene Yuan.
Ми вдячні за додаткову підтримку Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus і Biao Zhang.
Також велика подяка всім, хто взяв участь у тестуванні наших моделей на ранніх етапах.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.