ИИ для всех на каждом языке
15 сент. 2026 г.
|Мы выходим за рамки традиционного перевода текста, создавая модели, которые понимают богатые, живые языки мира именно такими, какими на них говорят.
Сегодня наши технологии и продукты обеспечивают повседневное взаимодействие более чем на 300 языках, на которых говорят свыше 7 миллиардов человек, то есть 86% населения планеты. Достижение этого рубежа имеет большое значение, но одновременно подчёркивает важность работы, критически необходимой для нашей миссии. На протяжении десятилетий технологии лучше всего работали с несколькими доминирующими языками, оставляя тысячи живых языков и диалектов слабо представленными или вовсе отсутствующими в цифровом мире.
Когда мы запустили Google Переводчик в 2006 году, наша цель была проста: разрушить языковые барьеры. Достижения в области ИИ помогли нам донести эту идею до большего числа людей, расширив Translate с нескольких языков до более чем 250 сегодня. Но одного перевода текста недостаточно. Технологии должны понимать, как люди действительно общаются в реальном мире. Поэтому мы сосредоточили исследования и разработку на создании систем, которые учитывают культурные нюансы и богатство человеческого языка, позволяя каждому участвовать в общении и быть понятым на своих условиях.
Вот как эта работа выглядит на практике.
От текста к настоящему пониманию
Исторически системы распознавания речи следовали жёсткому многоэтапному процессу: преобразовывали аудио в текст, обрабатывали этот текст, а затем снова синтезировали его в аудио. Несмотря на работоспособность, такой конвейер лишает человеческое общение самых выразительных составляющих: интонации, темпа, эмоций и контекста.
Люди не говорят идеально выстроенными, грамматически правильными предложениями. Мы смеёмся, перебиваем друг друга, делаем паузы и соединяем несколько языков в одном предложении — например, когда говорим на спанглише или хинглише.
Чтобы учитывать это, мы вышли за рамки текстовых расшифровок и перешли к интеллектуальной обработке исходного аудио — обучаем такие модели, как Gemini, напрямую обрабатывать аудио в исходном виде, одновременно понимая и звук, и намерение говорящего. Эта работа включает:
- Инструменты для гибкого диалога в реальном времени:
- Сегодня Gemini 3.5 Live Translate обеспечивает перевод устной речи в реальном времени на 70 языках и в более чем 2000 языковых парах, естественным образом учитывая переключение между языками и эмоциональные оттенки.
- Gemini 3.5 Transcribe — наша самая точная на сегодняшний день модель преобразования речи в текст: она превращает необработанное аудио в отформатированный, отредактированный текст даже в шумной обстановке или при использовании сложной терминологии. Она также обеспечивает работу таких функций, как Rambler в Gboard на Android: эта функция удаляет слова-паразиты, исправляет грамматику и пунктуацию, позволяет редактировать или переписывать текст с помощью голосовых команд и плавно переключаться между языками.
- Инициатива «1000 языков»: ИИ помогает нам разрушать языковые барьеры в масштабе, который раньше казался невозможным. Но чтобы охватить больше людей на предпочитаемых ими языках, необходимо выйти за рамки языков, на которых ИИ сегодня работает лучше всего. Наша цель — поддерживать 1000 самых распространённых языков мира. Чтобы помочь сделать это возможным, наша универсальная речевая модель, обученная на 12 миллионах часов аудиозаписей, использовала трансферное обучение между языками — методы, позволяющие моделям переносить знания, полученные из богатых данными языков, чтобы улучшать понимание речи на языках, для которых доступно гораздо меньше обучающих данных. Это позволяет моделям применять закономерности, изученные на языках с большим объёмом данных, к языкам с ограниченными ресурсами.
- Тщательные фундаментальные исследования: Эта работа основана на 25 годах открытых исследований и более чем 400 рецензируемых научных публикациях о речи, которые помогли расширить границы возможного и усовершенствовать речевые модели.
Сообщества в центре работы с языковыми данными
Поскольку в интернете непропорционально широко представлены лишь несколько доминирующих языков, обучение ИИ пониманию недостаточно представленных языков потребовало переосмыслить подход к сбору данных. Решение — локальные партнёрства, основанные на работе с сообществами. Такой локализованный подход стал основой для трёх наших самых масштабных партнёрств в области открытых данных:
- WAXAL (на языке волоф означает «говорить», произносится как «Ва-хал»): созданный совместно с партнёрами, включая Университет Макерере и Digital Umuganda, WAXAL представляет собой крупномасштабный открытый набор речевых данных, охватывающий 27 языков Африки к югу от Сахары, на которых говорят более 100 миллионов человек в более чем 26 странах. В нём отражены тональные различия и особенности разговорного ритма, которые часто отсутствуют в традиционных наборах данных.
- Project Vaani: В партнёрстве с Индийским институтом науки (IISc) и Bhashini Project Vaani картографирует языковое разнообразие Индии, используя подход, ориентированный на регионы, а не на языки. Благодаря этому проект уже собрал более 30 000 часов речи на 109 языках от более чем 155 000 носителей.
- Инициатива Amplify: Мы объединились с более чем 1600 местными экспертами и 20 университетами на четырёх континентах, включая бразильский UFMG, индийский IIT Kharagpur и угандийский Университет Макерере, чтобы создать 15 000 мультимодальных элементов данных, отражающих местные особенности.
Мы также продолжаем развивать работу по приоритетной поддержке инноваций в области языков с открытым исходным кодом с помощью нашего нового инструмента Language Explorer. Это интерактивный инструмент, визуализирующий LinguaMeta — крупнейший в мире репозиторий языковых данных с открытым исходным кодом. Получив признание Fast Company за инновационный дизайн, он постоянно отображает более 7000 устных, письменных и жестовых языков.
Влияние этих инноваций и партнёрств наиболее велико, когда они доходят до людей, способных превратить новые данные и знания в значимые изменения в своих сообществах. Инициативы, поддержанные Google.org, включая Centre for Digital Language Inclusion и Project Aquarium от AI Singapore, помогают предоставлять многоязычные инструменты фермерам, медицинским работникам, учителям и другим важным участникам жизни сообществ по всему миру.
Преодоление ограничений реального мира
Для более чем 3 миллиардов человек 1 надёжный доступ к интернету по-прежнему недоступен. Технологии действительно доступны только тогда, когда они работают там, где живут люди, в том числе в районах с ограниченным или прерывистым подключением.
Чтобы помочь решить эту проблему, мы разработали TranslateGemma — семейство лёгких открытых моделей перевода, созданных на основе Gemini и обученных на 55 языках. Поскольку TranslateGemma эффективно работает непосредственно на устройстве, для высококачественного перевода больше не требуется подключение к облаку или интернету.
Однако для работы мощных моделей ИИ требуется производительное оборудование, что исключает из их использования сотни миллионов людей, по-прежнему применяющих обычные мобильные телефоны в регионах с ограниченными ресурсами. Чтобы сократить этот разрыв, мы поддерживаем такие организации, как Viamo, помогающие развивать «Ask Viamo Anything» (AVA) — голосового ИИ-помощника, который предоставляет возможности Gemini пользователям обычных мобильных телефонов. Viamo успешно протестировала AVA в Руанде среди пользователей своей существующей системы интерактивных голосовых ответов, и сервис уже использовал Gemini для ответа более чем на 2 миллиона вопросов.
Проектирование с учётом доступности
Язык — это не только региональные диалекты или словарный запас. Это также множество других способов общения. Обычные речевые инструменты часто не справляются с нестандартной речью, заставляя людей подстраиваться под технологию, а не наоборот.
Мы стремимся изменить это, с самого начала создавая продукты с учётом доступности, например Sign Language-to-Text (SL2T). Обученная на более чем 50 жестовых языках, SL2T обеспечивает преобразование жестов в текст в Gboard и Live Transcribe на Pixel 11, начиная с американского жестового языка (ASL) и английского. Это важный первый шаг к тому, чтобы сделать наши продукты более доступными для 70 миллионов людей во всём мире, которые используют жестовые языки для общения.
Точное воспроизведение местного произношения
Детали важны, особенно в повседневных инструментах, таких как навигация. Когда навигационное приложение неправильно произносит название города или улицы, это не просто вызывает путаницу — оно может не учитывать культурное наследие этого места.
Мы считаем, что культурный контекст должен быть частью разработки языковых технологий, а значит, необходимо напрямую работать с местными сообществами. Например, в Новой Зеландии мы работали с экспертами по языку маори над улучшением произношения географических названий в Google Картах, помогая сделать работу сервиса более точной и по-настоящему локальной. Включение аутентичного с точки зрения культуры произношения непосредственно в модели преобразования текста в речь гарантирует, что технологии отражают язык и наследие обслуживаемых ими сообществ.
Создание языковых инструментов для всех
Один из важнейших уроков, которые мы извлекли за 20 лет исследований и разработок в области языкового ИИ, заключается в том, что технологии никогда не должны сужать спектр человеческого самовыражения — они должны его расширять.
Сегодня наши языковые технологии уже встроены в нашу основную экосистему, связывающую более 5 миллиардов людей на девяти платформах, включая Поиск, Android, Chrome, YouTube и Google Play. Но масштаб — лишь часть истории. Более важная цель — глубина и богатство: создание систем, которые понимают контекст, уважают культуру и ценят множество способов общения людей.
Расширяя использование ИИ для решения важнейших задач и использования возможностей общества, мы продолжим тесно работать с местными сообществами, создавая технологии, которые помогут большему числу людей общаться, участвовать в жизни общества и быть понятыми на своих условиях.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.