ШІ для всіх кожною мовою
15 вересня 2026 року
|Ми виходимо за межі традиційного перекладу текстів, щоб створювати моделі, які розуміють багатство живих мов світу саме такими, якими вони є у вжитку.
Сьогодні наші технології та продукти забезпечують повсякденну взаємодію більш ніж 300 мовами, якими розмовляють понад 7 мільярдів людей, що становить 86% населення світу. Досягнення цієї віхи має велике значення, але водночас підкреслює важливість роботи, критичної для нашої місії. Упродовж десятиліть технології найкраще працювали для кількох домінантних мов, залишаючи тисячі живих мов і діалектів недостатньо представленими або взагалі відсутніми в цифровому світі.
Коли ми запустили Google Перекладач у 2006 році, наша мета була простою: подолати бар’єри між мовами. Досягнення у сфері ШІ допомогли нам донести це бачення до більшої кількості людей, розширивши Перекладач від кількох мов до понад 250 сьогодні. Але перекладати текст недостатньо. Технології мають розуміти, як люди насправді спілкуються в реальному світі. Тому ми зосереджуємо дослідження та розробки на створенні систем, які враховують культурні нюанси й багатство людської мови, даючи кожному змогу брати участь у спілкуванні та бути зрозумілим на власних умовах.
Ось як ця робота виглядає на практиці.
Від тексту до справжнього розуміння
Історично системи розпізнавання мовлення працювали за жорстким багатоступеневим процесом: перетворювали аудіо на текст, обробляли цей текст, а потім знову синтезували його в аудіо. Попри функціональність, такий конвеєр позбавляє спілкування найважливіших складових: інтонації, темпу, емоцій і контексту.
Люди не говорять ідеально чіткими, граматично правильними реченнями. Ми сміємося, перебиваємо одне одного, вагаємося та поєднуємо кілька мов посеред речення — наприклад, коли говоримо спанглішем або хінглішем.
Щоб це врахувати, ми вийшли за межі текстових транскрипцій до інтелектуальної обробки аудіо — навчаємо такі моделі, як Gemini, безпосередньо працювати з аудіо в його первісному вигляді, одночасно розуміючи і звук, і намір. Ці зусилля охоплюють:
- Інструменти плавного діалогу в реальному часі:
- Сьогодні Gemini 3.5 Live Translate забезпечує переклад усного мовлення в реальному часі для 70 мов і понад 2 000 мовних пар, природно передаючи перемикання між мовами та емоційні сигнали.
- Gemini 3.5 Transcribe — наша найточніша модель перетворення мовлення на текст, яка перетворює необроблене аудіо на відформатований текст навіть у шумному середовищі або за наявності складної спеціалізованої термінології. Вона також забезпечує такі функції, як Rambler в Android Gboard, що видаляє слова-паразити, виправляє граматику й пунктуацію, дає змогу редагувати або переписувати текст голосовими командами та безперешкодно перемикатися між мовами.
- Ініціатива 1 000 мов: ШІ допомагає нам долати мовні бар’єри в масштабах, які раніше здавалися неможливими. Але охоплення більшої кількості людей їхньою бажаною мовою означає вихід за межі мов, у яких ШІ сьогодні працює найкраще: наша мета — підтримувати 1 000 мов, якими розмовляє найбільша кількість людей у світі. Щоб це стало можливим, наша універсальна мовна модель, навчена на 12 мільйонах годин аудіо, використовувала міжмовне трансферне навчання — методи, які дають моделям змогу переносити знання, отримані з мов із великим обсягом даних, щоб покращувати розуміння мов, для навчання яких доступно набагато менше даних. Це дає моделям змогу застосовувати закономірності, засвоєні з мов із великим обсягом даних, до мов із недостатніми ресурсами.
- Ретельні фундаментальні дослідження: Ця робота ґрунтується на 25 роках відкритих досліджень і понад 400 рецензованих наукових працях про мовлення, які допомогли розширити межі можливого та вдосконалити мовні моделі.
Спільноти в центрі роботи з мовними даними
Оскільки в інтернеті непропорційно багато представлені кілька домінантних мов, навчання ШІ розуміти недостатньо представлені мови вимагало від нас переосмислити підходи до збору даних. Рішенням стали локальні партнерства на рівні громад. Цей локалізований підхід дав змогу реалізувати три наші найамбітніші партнерства у сфері відкритих даних:
- WAXAL (волофське слово «говорити», вимовляється «Вах-хал»): створений у партнерстві, зокрема, з Університетом Макерере та Digital Umuganda, WAXAL — це масштабний відкритий набір мовленнєвих даних, що охоплює 27 мов Африки на південь від Сахари, якими розмовляють понад 100 мільйонів людей у більш ніж 26 країнах, і фіксує тональні відмінності та ритми розмовної мови, які часто відсутні в традиційних наборах даних.
- Проєкт Vaani: У партнерстві з Індійським інститутом науки (IISc) і Bhashini проєкт Vaani картографує мовне різноманіття Індії, застосовуючи підхід, орієнтований на регіони, а не на мови, завдяки чому вже зібрано понад 30 000 годин мовлення 109 мовами від більш ніж 155 000 мовців.
- Ініціатива Amplify: Ми об’єдналися з понад 1 600 місцевими експертами та 20 університетами на чотирьох континентах, зокрема з бразильським UFMG, індійським IIT Kharagpur і угандійським Університетом Макерере, щоб зібрати 15 000 мультимодальних елементів даних, які відображають місцеві нюанси.
Ми також розвиваємо нашу роботу з підтримки інновацій у сфері мов із відкритим кодом за допомогою нового інструмента Language Explorer. Це інтерактивний інструмент, який візуалізує LinguaMeta — найбільший у світі репозиторій мовних даних із відкритим кодом. Відзначений Fast Company за інновації в дизайні, він безперервно картографує понад 7 000 усних, писемних і жестових мов.
Вплив цих інновацій і партнерств є найбільшим тоді, коли вони доходять до людей, здатних перетворити нові дані та висновки на значущі зміни у своїх спільнотах. Підтримані Google.org ініціативи, зокрема Centre for Digital Language Inclusion та проєкт Aquarium AI Singapore, допомагають забезпечити багатомовними інструментами фермерів, медичних працівників, учителів та інших важливих членів громад у всьому світі.
Подолання обмежень реального світу
Для понад 3 мільярдів людей 1 надійний доступ до інтернету досі недоступний. Технології справді доступні лише тоді, коли працюють там, де живуть люди, зокрема в районах з обмеженим або нестабільним підключенням.
Щоб допомогти розв’язати цю проблему, ми розробили TranslateGemma — сімейство легких відкритих моделей перекладу, створених на основі Gemini та навчених для 55 мов. Оскільки TranslateGemma ефективно працює на пристрої, для якісного перекладу більше не потрібне підключення до хмари чи інтернету.
Водночас для роботи потужних моделей ШІ потрібне продуктивне обладнання, через що сотні мільйонів людей у регіонах із недостатніми ресурсами, які досі користуються звичайними мобільними телефонами, не можуть ними скористатися. Щоб подолати цей розрив, ми підтримуємо такі організації, як Viamo, яка забезпечує роботу «Ask Viamo Anything» (AVA) — голосового помічника зі ШІ, що переносить можливості Gemini на звичайні мобільні телефони. Viamo успішно випробувала AVA у Руанді серед наявних користувачів інтерактивних голосових відповідей, і сервіс уже використав Gemini, щоб відповісти на понад 2 мільйони запитань.
Проєктування з урахуванням доступності
Мова — це не лише регіональні діалекти чи словниковий запас. Це також безліч інших способів, у які люди спілкуються. Традиційні інструменти розпізнавання мовлення часто не підходять людям із нестандартним мовленням, змушуючи їх пристосовуватися до технологій, а не навпаки.
Ми прагнемо це змінити, закладаючи доступність в основу розробки, наприклад за допомогою Sign Language-to-Text (SL2T). Навчена на понад 50 жестових мовах, SL2T забезпечує диктування жестовою мовою з перетворенням на текст у Gboard і Live Transcribe на Pixel 11, починаючи з американської жестової мови (ASL) з перекладом англійською. Це важливий перший крок до підвищення доступності наших продуктів для 70 мільйонів людей у всьому світі, які послуговуються жестовою мовою для спілкування.
Правильна місцева вимова
Деталі мають значення, особливо в повсякденних інструментах, як-от навігація. Коли навігаційний застосунок неправильно вимовляє назву міста чи вулиці, це не просто спричиняє плутанину — він може не врахувати культурну спадщину цього місця.
Ми вважаємо, що культурний контекст має бути частиною процесу створення мовних технологій, а це означає безпосередню співпрацю з місцевими спільнотами. Наприклад, у Новій Зеландії ми працювали з експертами з мови маорі над удосконаленням вимови назв місць у Google Maps, допомагаючи зробити цей досвід точнішим і справді локальним. Додавання культурно автентичної вимови безпосередньо до наших моделей перетворення тексту на мовлення гарантує, що технології відображатимуть мову та спадщину спільнот, яким вони служать.
Створення мовних інструментів для кожного
Один із найважливіших уроків, які ми засвоїли за 20 років досліджень і розробок у сфері мовного ШІ, полягає в тому, що технології ніколи не мають звужувати спектр людського самовираження — вони мають його розширювати.
Сьогодні наші мовні технології вже інтегровані в усю нашу основну екосистему, поєднуючи понад п’ять мільярдів людей на дев’яти платформах, зокрема в Пошуку, Android, Chrome, YouTube і Google Play. Але масштаб — лише частина історії. Важливіша мета — глибина та багатство: створення систем, які розуміють контекст, поважають культуру та відзначають численні способи людського спілкування.
Розширюючи використання ШІ для розв’язання одних із найбільших проблем і використання найважливіших можливостей суспільства, ми й надалі тісно співпрацюватимемо з місцевими спільнотами, щоб створювати технології, які допомагають більшій кількості людей спілкуватися, брати участь у житті суспільства та бути зрозумілими на власних умовах.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.