Даваме ИИ за жестов език в ръцете на потребителите
Екипът на Google DeepMind за жестов език
Представяме преобразуването от жестов език към текст (SL2T) — нашия пробивен модел, който задвижва нови функции за жестов език за глухи и хора с увреден слух.
Способността на AI да обработва говорими езици се разви бързо през последните десетилетия, което позволи автоматичен превод, диктовка и разговорни интерфейси, които изглеждат безпроблемни за чуващите потребители. И все пак тази технологична революция не достигна до над 200-те жестови езика по света — нито до приблизително 70-те милиона глухи и хора с увреден слух, които ги използват.
Днес представяме мащабен многоезичен модел за превод от жестов език към текст (SL2T), който бележи пробив в качеството и универсалността. С него за първи път извеждаме AI за жестов език от лабораторията и го внедряваме в потребителски продукти: SL2T осигурява диктовка от жестов към текст в Gboard и Live Transcribe на Pixel 11, като започваме с американския жестов език (ASL) към английски. Скоро ще бъдат поддържани още устройства, а след това и допълнителни езици.
Подобно на начина, по който чуващите потребители могат да използват диктовка, за да говорят вместо да пишат, тази функция позволява на глухите потребители да жестикулират към телефона си навсякъде, където обикновено биха писали. Можете да жестикулирате, за да търсите в мрежата, да съставяте съобщения или документи и да помолите Gemini да отговори на въпроси или да изпълни задачи. В Live Transcribe можете да отговаряте с жестове в разговори, вместо да се налага да пишете напред-назад. Според нашите тестери жестикулирането на ASL е по-бързо, по-естествено и по-приятно от писането на английски.
Преобразуването от жестов към текст, задвижвано от SL2T, позволява на потребителите да жестикулират към телефона си навсякъде, където обикновено биха писали.
Защо жестовите езици са важни
Жестовите езици са основните езици на глухите общности по света и крайъгълният камък на културната идентичност на глухите. Сред глухите хора съществува голямо разнообразие по отношение на уменията им да жестикулират, говорят, четат и пишат, затова е важно да се осигури достъп във всички модалности. Глухите хора могат да се възползват от обработката на жестов език по същия начин, по който чуващите хора се възползват от обработката на говорим език, а технологията открива и нови възможности за преодоляване на комуникационната пропаст между глухите и чуващите общности. Въпреки тази възможност за положително социално въздействие напредъкът в AI за жестов език е бавен — както защото създаването на AI за жестови езици поставя сложни предизвикателства, така и защото съществуват широко разпространени погрешни схващания за начина, по който функционират самите езици.
В сравнение с транскрибирането на говорим език, преводът на жестов език поставя две основни предизвикателства. Първо, транскрибирането на реч представлява последователно съпоставяне от звук към текст на един и същ език, докато жестовите езици са независими естествени езици със свои собствени граматики и лексикони. В резултат те изискват истински машинен превод, а не последователен процес на преобразуване от жест към дума. Второ, моделът трябва да се научи да „вижда“ и разбира физическото движение. Жестовите езици предават смисъл чрез едновременни движения на ръцете, ръцете до лактите, торса, главата и лицето. Точното проследяване на тези движения с висока честота на кадрите е трудна и изискваща значителни изчислителни ресурси задача за компютърно зрение.
На този фон е лесно да се разбере защо някои ранни опити за технологии за жестов език, като ръкавиците за жестов език, са били фундаментално ограничени: жестовите езици не са просто „английски, изписан с ръцете“. Те изискват сложно визуално възприемане на фини движения на цялото тяло и пълноценен езиков превод. SL2T е проектиран да осигури и двете.
SL2T възприема входа на жестовия език като точки по тялото на жестикулиращия и го превежда в потоци от текстови изходи. Пример от бенчмарка FLEURS-ASL.
Как работи SL2T
Създадохме SL2T, като съчетахме ориентиран към потребителя и културно информиран подход с мащабиране на данните в огромен обем. Моделът е обучен с над 100 000 часа данни на повече от 50 жестови езика — приблизително една четвърт от данните са на ASL. Съвместното обучение върху разнообразни езици, диалекти и нива на владеене кара модела да научи общите основни структури, като в нашите експерименти надминава моделите за един език.
За да защитим поверителността на потребителите, SL2T възприема жестовия език като последователност от местоположения на ориентири на позата, а не като необработен видеопоток от камерата. Модел на устройството (MediaPipe Holistic) проследява местоположението на точки по тялото на жестикулиращия и само тези геометрични координати се изпращат към сървъра за превод, което позволява оригиналното видео да бъде незабавно изтрито.
SL2T превежда тази координатна последователност директно в текст, като заобикаля междинните анотации, известни като „глоси“, които се използват широко в предишни разработки за превод на жестов език. Глосите не успяват да уловят богатите, нелинейни аспекти на жестовите езици, като немануални маркери и пространствени конструкции. Директният превод от ориентири премахва изкуствените ограничения на речника и позволява качеството на превода да се увеличава пряко с обема на данните.
Според ключови бенчмаркове като FLEURS-ASL (sd-test), който оценява качеството на превода от ASL към английски, SL2T е най-способният модел за превод на жестов език до момента. SL2T постига забележителен резултат от 70 BLEURT при нулево обучение за конкретната задача, което е значително по-високо от всеки досега публикуван резултат. Но оптимизирането само на академични бенчмаркове не гарантира използваемост в реални приложения, затова работихме усилено по практически въпроси като минимизиране на закъснението при поточно предаване, предотвратяване на халюцинации при вход без жестикулиране, гарантиране на справедливост за 10% от жестикулиращите, които са левичари, и подобряване на ефективността при жестикулиране с една ръка, което се използва, когато смартфонът се държи с другата ръка.
| Оригинален английски текст | Изход на SL2T от ASL → английски |
|---|---|
| Островите Кук нямат градове, но се състоят от 15 различни острова. Основните са Раротонга и Айтутаки. | Островите Кук нямат градове и се състоят от 15 острова. Двата основни острова са Раротонга и Айтутаки. |
| Мачовете започнаха в 10:00 ч. при чудесно време и освен краткия сутрешен ръмеж, който бързо спря, денят беше идеален за ръгби 7. | Мачовете започват в 10 ч. при чудесно време. Сутринта има слаб дъжд, който спира. Денят е идеален за ръгби 7 срещу 7. |
| В някои федерални държави, като Съединените щати и Канада, данъкът върху доходите се налага както на федерално, така и на местно ниво, така че ставките и праговете могат да варират в различните региони. | В някои федерални държави, като САЩ и Канада, данъкът върху доходите се събира както на федерално, така и на местно ниво. Това означава, че ставките и праговете варират в зависимост от региона. |
| Смята се, че тази напълно оперена, топлокръвна хищна птица е ходела изправена на два крака с нокти като на велоцираптор. | Това същество е топлокръвно, храни се със сиво и е покрито с пера. Смята се, че ходи на два крака като велоцираптор. |
| Може би един ден вашите правнуци ще стоят на върха на извънземен свят и ще се чудят за древните си предци? | Може би един ден вашите правнуци ще стоят на извънземен свят и ще размишляват за предците си. |
Примери от бенчмарка FLEURS-ASL. SL2T превежда точно сложен ASL на плавен английски. Все още се допускат отделни грешки при редки жестове, бързо изписване с пръсти („prey“ → „grey“), пасивни конструкции, изображения с класификатори (изпускане на „claws“) и време без контекст („kicked off“ → „start“).
Създаване заедно с общността
Вярваме, че трябва да създаваме заедно с глухата общност, а не просто за нея. Перспективите на глухите са повлияли на всеки етап от този проект — от концептуализацията от Сам Сепах, глух служител на Google, до събирането на данни с глухи партньори, оценяването в проучвания с глухи потребители и оценката на въздействието на технологията с глухи експерти.
За да насочим отговорното внедряване в реалния свят, създадохме Консултативния комитет за AI и жестовия език (AISLAC), който обединява множество глобални организации на глухите и експерти в съответните области. Чрез този модел на управление с участие общностите, върху които технологията ни оказва най-голямо въздействие, пряко влияят върху приоритетите ни за разработване. Съвместно написахме съвместен доклад за въздействието за пускането на SL2T 1.0 в Gboard и Live Transcribe, в който прозрачно описваме възможностите и настоящите ограничения на технологията — съвместен подход, който планираме да продължим при всички основни издания, свързани с жестовия език.
Поглед към бъдещето
SL2T се основава на десетилетия фундаментални изследвания в академичните среди и индустрията, но предоставянето на възможност за въвеждане на ASL в телефоните на потребителите е само началото. Мисията на Google е да организира световната информация и да я направи универсално достъпна и полезна. Постигането на универсална достъпност означава пълно равенство с говоримите и писмените езици. Екипът ни работи за разширяване на тази технология към допълнителни жестови езици, генериране на жестов език и водещи AI възможности. Очакваме с нетърпение отговорно да споделяме напредъка си, за да превърнем достъпа чрез жестови езици в стандарт в целия дигитален пейзаж.
Можете да изпробвате SL2T в Gboard и Live Transcribe първоначално на Pixel 11, като скоро ще бъдат поддържани още устройства — всичко това без допълнително заплащане.
Благодарности
Тази работа беше извършена съвместно от екипи на Google DeepMind и Android. Основният екип, разработил модела SL2T, включва: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang и Chris Dyer.
Екипът на Android, който интегрира модела в Gboard и Live Transcribe, включва: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su и Sharlene Yuan.
Благодарни сме за допълнителната подкрепа от Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus и Biao Zhang.
Много благодарности и на всички, които участваха в ранното тестване на нашите модели.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.