Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

ИИ за всички на всеки език

Изкуствен интелект за всички на всеки език

15 септември 2026 г.

|

Преминаваме отвъд традиционния превод на текст, за да създаваме модели, които разбират богатите, живи езици на света точно така, както се изразяват.



Днес нашите технологии и продукти осигуряват ежедневни взаимодействия на повече от 300 езика, говорени от над 7 милиарда души — 86% от световното население. Достигането на този етап е значимо, но също така подчертава работа, която е от решаващо значение за нашата мисия. В продължение на десетилетия технологиите работеха най-добре за шепа доминиращи езици, оставяйки хиляди живи езици и диалекти слабо представени или напълно отсъстващи от дигиталния свят.

Когато стартирахме Google Преводач през 2006 г., целта ни беше проста: да премахнем бариерите между езиците. Напредъкът в областта на изкуствения интелект ни помогна да направим тази визия достъпна за повече хора, като разширихме Translate от шепа езици до повече от 250 днес. Но преводът на текст не е достатъчен. Технологиите трябва да разбират как хората действително общуват в реалния свят. Затова насочваме своите изследвания и разработки към изграждането на системи, които отчитат културните нюанси и богатството на човешкия език, позволявайки на всеки да участва и да бъде разбран по свои собствени правила.

Ето как изглежда тази работа на практика.

От текста към истинското разбиране

В исторически план системите за разпознаване на реч следваха строг многостъпков процес: транскрибиране на аудио в текст, обработване на текста и след това синтезирането му обратно в аудио. Макар и функционален, този процес премахва най-богатите аспекти на човешката комуникация: интонацията, темпото, емоцията и контекста.

Хората не говорят в идеално подредени, граматически правилни изречения. Смеем се, говорим едновременно, колебаем се и вплитаме няколко езика по средата на изречението, както например когато говорим на Spanglish или Hinglish.

За да уловим това, преминахме отвъд текстовите транскрипции към интелигентност, базирана на естествено аудио — обучаваме модели като Gemini да обработват аудио директно такова, каквото е, като едновременно разбират звука и намерението. Тези усилия включват:

  • Инструменти за плавен диалог в реално време:
    • Днес Gemini 3.5 Live Translate осигурява говорим превод в реално време на 70 езика и над 2000 езикови двойки, като естествено улавя превключването между езици и емоционалните сигнали.
    • Gemini 3.5 Transcribe е най-прецизният ни досега модел за преобразуване на реч в текст, който превръща необработеното аудио в прецизно форматиран текст, дори в шумна среда или при използване на сложна терминология. Той също така поддържа функции като Rambler в Gboard за Android, която премахва паразитните думи, поправя граматиката и пунктуацията и ви позволява да редактирате или пренаписвате с гласови команди и безпроблемно да превключвате между езици.
  • Инициативата „1000 езика“: Изкуственият интелект ни помага да премахнем езиковите бариери в мащаб, който доскоро беше невъобразим. Но достигането до повече хора на предпочитания от тях език означава да надхвърлим езиците, на които изкуственият интелект се справя най-добре днес: целта ни е да поддържаме 1000-те най-говорими езика в света. За да помогне това да стане възможно, нашият Универсален модел за реч — обучен с 12 милиона часа аудио — използва трансферно обучение между езици, техники, които позволяват на моделите да прехвърлят наученото от езици с изобилие от данни, за да подобрят разбирането на речта на езици с много по-малко данни за обучение. Това позволява на моделите да прилагат модели, научени от езици с изобилие от данни, към езици с недостатъчно ресурси.
  • Стриктни фундаментални изследвания: Тази работа се основава на 25 години отворени изследвания и повече от 400 рецензирани научни публикации за речта, които помогнаха за разширяването на границите и развитието на моделите за реч.

Поставяме общностите в центъра на езиковите данни

Тъй като уеб пространството представя непропорционално няколко доминиращи езика, обучаването на изкуствения интелект да разбира недостатъчно представените езици изискваше да преосмислим начина, по който събираме данни. Решението са местните партньорства на общностно ниво. Този локализиран подход доведе до три от най-амбициозните ни партньорства за отворени данни:

  • WAXAL (на волоф „говорене“, произнася се „Уах-хал“): Създаден съвместно с партньори, сред които Университетът „Макерере“ и Digital Umuganda, WAXAL е мащабен отворен набор от речеви данни, обхващащ 27 езика от Африка на юг от Сахара, говорени от над 100 милиона души в повече от 26 държави, като улавя тоналните различия и разговорните ритми, които често липсват в традиционните набори от данни.
  • Проект Vaani: В партньорство с Индийския научен институт (IISc) и Bhashini, Проект Vaani картографира езиковото многообразие на Индия чрез подход, ориентиран към регионите, а не към езиците, което му е позволило досега да събере над 30 000 часа реч на 109 езика от повече от 155 000 говорещи.
  • Инициативата Amplify: Обединихме усилията си с повече от 1600 местни експерти и 20 университета на четири континента, включително бразилския UFMG, индийския IIT Kharagpur и угандийския Университет „Макерере“, за да допринесем с 15 000 мултимодални точки от данни, улавящи местните нюанси.

Надграждаме и работата си за насърчаване на иновациите в областта на езиците с отворен код чрез новия ни инструмент Language Explorer. Това е интерактивен инструмент, който визуализира LinguaMeta — най-голямото хранилище за езикови данни с отворен код в света. Признат от Fast Company за иновации в дизайна, той непрекъснато картографира повече от 7000 говорими, писмени и жестови езика.

Въздействието на тези иновации и партньорства е най-голямо, когато те достигат до хората, които могат да превърнат новите данни и знания в значима промяна в своите общности. Подкрепяните от Google.org инициативи, включително Центъра за дигитално езиково приобщаване и Проект Aquarium на AI Singapore, помагат да се предоставят многоезични инструменти на фермери, здравни работници, учители и други ключови членове на общностите по света.

Преодоляване на ограниченията в реалния свят

За повече от 3 милиарда души 1 надеждният достъп до интернет все още е недостижим. Технологиите са истински достъпни само ако работят там, където живеят хората, включително в райони с ограничена или прекъсваща свързаност.

За да помогнем за решаването на този проблем, разработихме TranslateGemma — семейство леки отворени модели за превод, създадени от Gemini и обучени на 55 езика. Тъй като TranslateGemma работи ефективно на устройството, висококачественият превод вече не изисква връзка с облака или интернет.

Въпреки това работата на мощни модели с изкуствен интелект изисква способен хардуер, което изключва стотици милиони хора, които все още използват обикновени телефони в региони с ограничени ресурси. За да преодолеем това разделение, подкрепяме организации като Viamo, за да осигурим работата на „Ask Viamo Anything“ (AVA) — гласов асистент с изкуствен интелект, който предоставя мощта на Gemini на стандартни обикновени телефони. Viamo успешно тества AVA в Руанда със своите съществуващи потребители на интерактивна гласова система за отговори, а услугата вече е използвала Gemini, за да отговори на повече от 2 милиона въпроса.

Проектиране с мисъл за достъпността

Езикът не се свежда само до регионалните диалекти или речника. Той включва и множеството други начини, по които хората общуват. Конвенционалните инструменти за реч често не успяват да обслужат хората с нестандартна реч, принуждавайки ги да се адаптират към технологията, вместо обратното.

Работим за промяна на това, като проектираме с мисъл за достъпността още от самото начало, например със Sign Language-to-Text (SL2T). Обучена на повече от 50 жестови езика, SL2T поддържа диктуване от жестов към текст в Gboard и Live Transcribe на Pixel 11, като започва с американския жестов език (ASL) към английски. Това е важна първа стъпка към повишаване на достъпността на продуктите ни за 70-те милиона души по света, които разчитат на жестов език, за да общуват.

Правилно произнасяне на местните имена

Детайлите имат значение, особено в ежедневни инструменти като навигацията. Когато навигационно приложение произнася неправилно името на град или улица, това не просто води до объркване — може да пренебрегне културното наследство на мястото.

Вярваме, че културният контекст трябва да бъде част от начина, по който се изграждат езиковите технологии, а това означава да работим директно с местните общности. Например в Нова Зеландия работихме с експерти по езика маори, за да подобрим произношението на имената на местата в Google Maps, като помогнахме изживяването да стане по-точно и истински местно. Включването на културно автентични произношения директно в нашите модели за преобразуване на текст в реч гарантира, че технологията отразява езика и наследството на общностите, на които служи.

Създаване на езикови инструменти за всички

Един съществен урок, който научихме през 20 години изследвания и разработки в областта на езиковия изкуствен интелект, е, че технологиите никога не трябва да стесняват спектъра на човешкото изразяване — те трябва да го разширяват.

Днес езиковите ни технологии вече са вградени в основната ни екосистема, свързвайки повече от пет милиарда души чрез девет платформи, включително Search, Android, Chrome, YouTube и Google Play. Но мащабът е само част от историята. По-голямата цел е дълбочината и богатството — изграждането на системи, които разбират контекста, уважават културата и ценят многото начини, по които хората общуват.

Докато разширяваме използването на изкуствения интелект за справяне с някои от най-големите възможности пред обществото, ще продължим да работим в тясно сътрудничество с местните общности, за да изграждаме технологии, които помагат на повече хора да общуват, да участват и да бъдат разбирани по свои собствени правила.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Google AI на

Прочетете оригинала в Google AI ↗

Текстът и изображенията са собственост на Google AI и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини