Sakhanda Wire
NVDA $223.20 +2.62% MSFT $495.28 -1.69% GOOGL $342.68 -0.33% META $587.37 -1.96% AMZN $270.56 -0.63%
← К новостям

ИИ для жестового языка — в руках пользователей

12 августа 2026 года Модели
Передаем ИИ для жестового языка в руки пользователей

Команда Google DeepMind по жестовому языку

Представляем модель перевода с жестового языка в текст (SL2T) — прорывную разработку, лежащую в основе новых функций для глухих и слабослышащих пользователей.

Способность ИИ обрабатывать устные языки стремительно развивалась в последние десятилетия, обеспечив автоматический перевод, диктовку и разговорные интерфейсы, которые кажутся легко доступными слышащим пользователям. Однако эта технологическая революция еще не охватила более 200 жестовых языков мира — и около 70 миллионов глухих и слабослышащих людей, которые ими пользуются.

Сегодня мы представляем многоязычную модель перевода с жестового языка в текст (SL2T), которая знаменует собой прорыв в качестве и универсальности. С ее помощью мы впервые выводим ИИ для жестового языка из лаборатории в потребительские продукты: SL2T обеспечивает диктовку с жестового языка в текст в Gboard и Live Transcribe на Pixel 11, начиная с американского жестового языка (ASL) и английского. Вскоре появятся новые устройства, а затем и дополнительные языки.

Подобно тому как слышащие пользователи могут использовать диктовку вместо набора текста, эта функция позволяет глухим пользователям общаться на жестовом языке с телефоном везде, где они обычно печатали бы текст. Вы можете жестикулировать для поиска в интернете, составления сообщений или документов, а также просить Gemini отвечать на запросы или выполнять задачи. В Live Transcribe вы можете отвечать на жестовом языке во время разговоров, вместо того чтобы печатать ответ. По словам наших тестировщиков, общение на ASL быстрее, естественнее и приятнее, чем набор текста на английском языке.

Перевод с жестового языка в текст на базе SL2T позволяет пользователям общаться с телефоном на жестовом языке везде, где они обычно печатали бы текст.

Почему жестовые языки важны

Жестовые языки — основные языки глухих сообществ по всему миру и краеугольный камень культурной идентичности глухих. Уровень владения жестовым языком, устной и письменной речью сильно различается у разных глухих людей, поэтому важно обеспечивать доступ во всех формах коммуникации. Глухие люди могут получать пользу от обработки жестовых языков так же, как слышащие — от обработки устных языков; кроме того, эта технология открывает новые возможности для преодоления коммуникационного разрыва между глухими и слышащими сообществами. Несмотря на такой потенциал положительного социального воздействия, развитие ИИ для жестовых языков идет медленно — как потому, что создание ИИ для жестовых языков связано со сложными задачами, так и потому, что существуют распространенные заблуждения о принципах работы самих языков.

По сравнению с транскрибацией устной речи перевод с жестового языка связан с двумя основными трудностями. Во-первых, транскрибация речи представляет собой последовательное преобразование звука в текст на одном и том же языке, тогда как жестовые языки — самостоятельные естественные языки со своей грамматикой и лексикой. Поэтому для них требуется настоящий машинный перевод, а не последовательное преобразование жестов в слова. Во-вторых, модель должна научиться «видеть» и понимать физические движения. Жестовые языки передают смысл посредством одновременных движений кистей, рук, туловища, головы и лица. Точное отслеживание этих движений с высокой частотой кадров — сложная и требовательная к вычислительным ресурсам задача компьютерного зрения.

Учитывая это, легко понять, почему некоторые ранние попытки создать технологии для жестовых языков, например перчатки для жестового языка, были принципиально ограничены: жестовые языки — это не просто «английский, исполняемый руками». Они требуют сложного визуального восприятия тонких движений всего тела и полноценного языкового перевода. SL2T создана для решения обеих задач.

SL2T воспринимает жестовый язык как набор точек на теле пользователя и преобразует его в потоковый текст. Пример из теста FLEURS-ASL.

Как работает SL2T

Мы создали SL2T, объединив ориентированный на пользователя и учитывающий культурный контекст подход с масштабированием данных. Модель обучена на более чем 100 000 часов данных по более чем 50 жестовым языкам — примерно четверть данных приходится на ASL. Совместное обучение на разнообразных языках, диалектах и уровнях владения позволяет модели изучать общие базовые структуры, благодаря чему в наших экспериментах она превосходит модели для отдельных языков.

Для защиты конфиденциальности пользователей SL2T воспринимает жестовый язык как последовательность координат ключевых точек позы, а не как необработанный видеопоток с камеры. Модель на устройстве (MediaPipe Holistic) отслеживает положение точек на теле пользователя, и на сервер для перевода отправляются только эти геометрические координаты, после чего исходное видео можно немедленно удалить.

SL2T преобразует эту последовательность координат непосредственно в текст, обходя промежуточные аннотации, известные как «глоссы», которые широко используются в предыдущих исследованиях по переводу с жестового языка. Глоссы не отражают богатые нелинейные аспекты жестовых языков, такие как немануальные маркеры и пространственные конструкции. Прямой перевод с ключевых точек устраняет искусственные ограничения словаря и позволяет качеству перевода напрямую расти вместе с объемом данных.

Согласно ключевым тестам, таким как FLEURS-ASL (sd-test), оценивающим качество перевода с ASL на английский, SL2T — самая эффективная на сегодняшний день модель перевода с жестового языка. SL2T достигла впечатляющего показателя 70 BLEURT в режиме zero-shot, что значительно выше любого ранее опубликованного результата. Однако оптимизация только академических тестов не гарантирует удобства использования в реальных приложениях, поэтому мы уделили большое внимание практическим вопросам: минимизации задержки при потоковой передаче, предотвращению галлюцинаций при отсутствии жестов, обеспечению справедливой работы для 10% пользователей, которые жестикулируют левой рукой, а также повышению эффективности при жестикуляции одной рукой, когда вторая держит смартфон.

Исходный английский текстРезультат SL2T: ASL → английский
На Островах Кука нет городов, но они состоят из 15 разных островов. Главные из них — Раротонга и Аитутаки.На Островах Кука нет городов, они состоят из 15 островов. Два главных острова — Раротонга и Аитутаки.
Игры начались в 10:00 при отличной погоде, и, за исключением небольшого дождя в середине утра, который быстро закончился, это был идеальный день для регби-7.Игры начинаются в 10 утра при отличной погоде. Утром идет небольшой дождь, который прекращается. Это идеальный день для регби-7.
В некоторых федеративных странах, таких как Соединенные Штаты и Канада, подоходный налог взимается как на федеральном, так и на местном уровне, поэтому ставки и налоговые категории могут различаться в разных регионах.В некоторых федеративных странах, например в США и Канаде, подоходный налог взимается как на федеральном, так и на местном уровне. Это означает, что ставки и налоговые категории зависят от региона.
Считалось, что эта полностью оперенная теплокровная хищная птица ходила вертикально на двух ногах с когтями, как у велоцираптора.Это существо теплокровное, питается серым и покрыто перьями. Считается, что оно ходит на двух ногах, как велоцираптор.
Возможно, однажды ваши правнуки будут стоять на вершине инопланетного мира и задаваться вопросом о своих древних предках?Возможно, однажды ваши правнуки будут стоять на инопланетном мире и размышлять о своих предках.

Примеры из теста FLEURS-ASL. SL2T точно переводит сложные высказывания на ASL на беглый английский язык. Иногда возникают ошибки с редкими жестами, быстрым дактилированием («prey» → «grey»), пассивными конструкциями, изображением классификаторов (пропуск слова «когти») и временем без контекста («kicked off» → «start»).

Создание совместно с сообществом

Мы верим в создание продуктов вместе с сообществом глухих, а не просто для него. Мнения глухих людей повлияли на каждый этап этого проекта — от его разработки Сэмом Сепахом, глухим сотрудником Google, до сбора данных с глухими партнерами, оценки в исследованиях с участием глухих пользователей и анализа воздействия технологии с экспертами из сообщества глухих.

Чтобы обеспечить ответственное внедрение в реальном мире, мы создали Консультативный комитет по ИИ для жестовых языков (AISLAC), объединивший множество глобальных организаций глухих и профильных экспертов. Благодаря этой модели совместного управления сообщества, на которые наша технология оказывает наибольшее влияние, напрямую определяют приоритеты нашей разработки. К выпуску SL2T 1.0 в Gboard и Live Transcribe мы совместно подготовили совместный отчет о воздействии, в котором прозрачно описаны возможности и текущие ограничения технологии. Мы планируем продолжать такой совместный подход при каждом крупном выпуске продуктов для жестовых языков.

Что дальше

SL2T опирается на десятилетия фундаментальных исследований в академической и промышленной сферах, но появление поддержки ввода на ASL на телефонах пользователей — лишь начало. Миссия Google — систематизировать мировую информацию и сделать ее общедоступной и полезной. Всеобщая доступность означает достижение полного равенства с устными и письменными языками. Наша команда работает над расширением этой технологии на другие жестовые языки, генерацией жестового языка и передовыми возможностями ИИ. Мы рассчитываем ответственно делиться результатами нашей работы, чтобы доступ через жестовые языки стал стандартом цифрового пространства.

Впервые опробовать SL2T в Gboard и Live Transcribe можно на Pixel 11; вскоре появятся и другие устройства — без дополнительной платы.

Благодарности

Эта работа выполнена совместно командами Google DeepMind и Android. В состав основной команды, разработавшей модель SL2T, входят: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang и Chris Dyer.

В состав команды Android, интегрировавшей модель в Gboard и Live Transcribe, входят: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su и Sharlene Yuan.

Мы благодарны за дополнительную поддержку Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus и Biao Zhang.

Также большое спасибо всем, кто участвовал в тестировании наших моделей на ранних этапах.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием DeepMind

Читать оригинал на DeepMind ↗

Текст и изображения принадлежат DeepMind и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости