Falcon-Emirati: Коли LLM опановує діалект, культуру та нюанси
Арабська насправді є цілою родиною мов, що живуть під одним ім’ям. Сучасна стандартна арабська — це мова новин і підручників, але люди рідко говорять нею між собою в повсякденному житті. В ОАЕ щоденні розмови, гумор, переговори та оповіді відбуваються еміратською арабською — діалектом Перської затоки зі своєю лексикою, власним ритмом і культурою, тісно з ним пов’язаною. Еміратська поезія, особливо набатійська, а також прислів’я та короткі анекдоти містять значення, яке не зберігається під час буквального, дослівного прочитання. Модель, що знає лише сучасну стандартну арабську, може перекласти кожне слово еміратського речення й водночас не зрозуміти, що воно насправді означає.
Саме цю прогалину покликаний усунути Falcon-Emirati-7B. Це модель, спеціалізована на діалекті й побудована на основі Falcon-H1-Arabic, яка має розуміти та генерувати еміратську арабську так, як це робив би носій мови: з урахуванням лексики, тону та культурного контексту.
Побудована на Falcon-H1-Arabic
Ми не починали з нуля. Falcon-Emirati-7B побудована на Falcon-H1-Arabic — нашій родині арабських моделей, яка вже встановила нові мовні рекорди на початку цього року. Falcon-H1-Arabic використовує гібридну архітектуру Falcon-H1: моделі простору станів (Mamba) і механізм уваги Transformer працюють паралельно всередині кожного блоку, а їхні виходи об’єднуються перед проєкцією кожного блоку. Така комбінація забезпечує ефективність Mamba з лінійною складністю на довгих послідовностях, водночас зберігаючи точність механізму уваги для далекодіючих залежностей, що важливо для морфологічно багатої арабської мови. Родина охоплює три масштаби (3B, 7B і 34B параметрів) із контекстними вікнами до 128K і 256K токенів, а її навчання вже проводилося на широкій суміші сучасної стандартної та діалектної арабської (мови країн Перської затоки, левантійська, єгипетська, магрибська), а також англійських і багатомовних даних.
Це дало нам сильну відправну точку: модель, яка вже широко розуміла арабську мову, добре працювала з довгим контекстом і мала певний вбудований досвід роботи з діалектами. Falcon-Emirati-7B бере цю основу та цілеспрямовано розвиває її в напрямку еміратського діалекту, його лексики, граматики та культурних знань, які загальна арабська модель, якою б потужною вона не була, не здобуває самостійно.
Ми побудували Falcon-Emirati-7B саме на варіанті 7B. Це оптимальний варіант у родині: достатньо великий, щоб зберігати нюанси, необхідні для адаптації до діалекту, але достатньо малий, щоб і навчання, і виведення залишалися практичними. Модель 34B, імовірно, дала б дещо вищу якість, але вартість навчання та обслуговування не виправдовує її для спеціалізованої діалектної чат-моделі, а модель 3B не залишає достатнього запасу для необхідної глибини культурного й мовного розуміння. Варіант 7B забезпечив найкращий баланс між якістю та вартістю навчання і виведення.
Чому адаптація до діалекту є складною
Перетворення загальної арабської моделі на спеціаліста з еміратського діалекту може здаватися меншим завданням, ніж створення базової моделі з нуля. Але це не так. Є кілька факторів, які роблять його справді складним:
- Еміратський діалект переважно розмовний. У мережі він трапляється в письмовій формі значно рідше, ніж сучасна стандартна арабська або навіть інші діалекти країн Перської затоки та Леванту, тому доступного необробленого тексту для навчання набагато менше.
- Значення часто не є буквальним. Ідіоми, прислів’я та поетичні алюзії спираються на спільний культурний контекст, а не на поверхневу лексику.
- Немає усталеного підходу. Не існує добре задокументованої методики, яка визначала б, скільки діалектних даних достатньо, як поєднувати їх із сучасною стандартною та загальною арабською або який етап навчання (продовження попереднього навчання, SFT чи оптимізація за вподобаннями) найважливіший для опанування діалекту.
Останній пункт визначив наш підхід. Значна частина роботи над Falcon-Emirati-7B зводилася до спроб і помилок: ми тестували різні суміші даних, етапи навчання та стратегії нагляду, використовуючи як людську оцінку, так і результати бенчмарків, щоб з’ясувати, що саме дає реальний ефект.
Наш підхід до даних
Ми створили спеціалізований конвеєр еміратських даних на основі попереднього навчання Falcon-H1-Arabic, спираючись на три взаємодоповнювальні джерела.
1. Автентичні вебдані еміратським діалектом
Ми зібрали й упорядкували вміст з еміратських вебсайтів і форумів, написаний безпосередньо діалектом, а не перекладений чи транслітерований із сучасної стандартної арабської. Саме тут ми отримали еталонні дані: як еміратці насправді пишуть і спілкуються в інтернеті, повсякденні формулювання, розмовні вислови та природне чергування еміратської й сучасної стандартної арабської, яке трапляється в реальному вжитку.
2. Дані сучасною стандартною арабською про еміратську культуру та ідентичність
Поряд із діалектними текстами ми додали матеріали сучасною стандартною арабською, присвячені еміратській культурі, спадщині та мові: статті й джерела про місцеві звичаї, цінності, історію та соціальні норми, зокрема про те, як сприймають еміратців і які стереотипи щодо них існують. Це не вчить модель писати діалектом, але вчить її розуміти, про що йдеться, коли порушуються еміратські теми: про спадщину, етикет і контекст, який носій мови просто знає.
3. Синтетичні дані під керівництвом глосаріїв і стильових правил
Самих автентичних діалектних текстів було недостатньо, щоб охопити спектр тем, із якими чат-модель має працювати щодня. Тому ми згенерували значний обсяг синтетичних даних еміратським діалектом, щоб заповнити прогалини. Ми не просто дозволили моделі-генератору імпровізувати «приблизно мовою Перської затоки». Ми обмежили її суворими правилами, глосаріями та словниками, створеними спеціально для еміратської лексики й граматики. Саме ці обмеження стали різницею між синтетичним текстом, який читається як автентично еміратський, і текстом, що граматично правильний, але звучить неприродно для людини, яка справді говорить цим діалектом.
Пошук правильної рецептури адаптації
Оскільки стандартної рецептури адаптації від сучасної стандартної мови до діалекту не існує, ми розглядали саму стратегію навчання як предмет експериментального дослідження. Ми проводили абляційні дослідження: визначали, скільки діалектних даних додавати та на якому етапі навчання, як збалансувати автентичні зібрані дані із синтетичними, щоб модель не перенавчалася на синтетичних шаблонах, і скільки культурного контексту сучасною стандартною арабською насправді потрібно, щоб зберегти культурну основу, а не лише поверхневу плавність мовлення. На кожному етапі ми спиралися на поєднання автоматичного оцінювання та перевірки носіями мови, оскільки самі автоматичні метрики недостатньо добре відображають природність, тон і культурну відповідність.
Методологія оцінювання
Ми відстежували прогрес упродовж усього навчання за допомогою двох взаємодоповнювальних підходів:
Ручне оцінювання носіями мови
Носії еміратської мови безпосередньо перевіряли відповіді моделі, оцінюючи не лише правильність, а й те, чи звучить відповідь природно: природність, тон і культурну доречність. Це речі, про які не скаже оцінка бенчмарку, але носій мови відразу їх помітить.
Автоматичне оцінювання на Alyah
Для кількісного відстеження ми використовували Alyah (الياه, «Північна зоря») — бенчмарк, який ми та спільнота випустили спеціально для оцінювання здатності арабських LLM працювати з еміратським діалектом. Alyah — це повністю створений носіями мови бенчмарк із множинним вибором, що містить 1 173 приклади, вручну зібрані від носіїв еміратської мови. Він охоплює категорії від повсякденних привітань та етикету до переносного мовлення, знань про спадщину й еміратської поезії — саме ті категорії, де діалект і культура мають найбільше значення і де загальні арабські моделі зазвичай зазнають труднощів. Повні відомості про створення Alyah і розподіл за категоріями доступні в нашій статті про бенчмарк, а інформація про родину базових моделей — в оголошенні Falcon-H1-Arabic.
Результати
Falcon-Emirati-7B набирає 84,83% на Alyah, випереджаючи всі інші арабські та багатомовні моделі, з якими ми її порівнювали, зокрема кілька моделей, що в рази більші за неї. На наведеній нижче діаграмі показано її позицію поруч із репрезентативною групою провідних моделей, донавчених для виконання інструкцій, у таблиці лідерів Alyah.
Точність на Alyah (%), моделі, донавчені для виконання інструкцій. Моделі родини Falcon-H1-Arabic виключені з цього порівняння, оскільки Falcon-Emirati-7B побудована на їхній основі.
Що говорять результати
Із цього порівняння одразу впадають в очі кілька речей. Сам розмір не забезпечує компетентності в діалекті. Деякі з найбільших багатомовних моделей тут набирають значно менше, ніж менші моделі, краще адаптовані до діалекту. Це свідчить, що еміратську мову потрібно цілеспрямовано опановувати під час навчання, а не отримувати як побічний ефект масштабування. Моделі, які показують найкращі результати, також зазвичай від початку є арабськомовними або зосередженими на арабській мові, що узгоджується з нашими власними абляційними дослідженнями: загальне знання арабської та діалектів є необхідною відправною точкою, але для подолання решти розриву все одно потрібна цілеспрямована робота саме з діалектом, особливо над найскладнішими частинами Alyah — поезією, знаннями про спадщину та категорією мови й діалекту.
Це також узгоджується з ширшими висновками, отриманими після випуску бенчмарку Alyah: навіть сильні моделі помітно втрачають якість, коли переходять до справді діалектного, культурно вкоріненого контенту. Такий розрив не зникає сам собою зі збільшенням моделей. Для цього потрібні дані та оцінювання, спеціально створені для конкретного діалекту.
Поза межами множинного вибору: оцінювання LLM як суддею
Точність у завданнях із множинним вибором показує, чи може модель розпізнати правильну відповідь серед чотирьох варіантів. Але вона не показує, чи справді модель самостійно генеруватиме еміратською арабською, коли людина просто спілкується з нею. Тому паралельно з Alyah ми провели друге оцінювання: генерацію відкритих відповідей на ті самі 1 173 запитання Alyah. Їх оцінювала LLM-суддя (Gemini 3.7 Flash) для п’яти моделей: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat і Fanar-2-27B-Instruct, обраних як найсильніші конкурентні моделі в таблиці лідерів Alyah.
Суддя оцінював кожну відповідь за двома окремими вимірами: чи був правильним зміст і, незалежно від цього, чи була відповідь справді еміратським діалектом, а не сучасною стандартною арабською. Ми наводимо як оцінку з частковим зарахуванням (градуйовану оцінку судді), так і суворішу версію «зараховано/не зараховано», а також частоту, з якою кожна модель утримувалася від відповіді.
Правильність відповідей, оцінена LLM, на 1 173 запитання Alyah, генерація відкритих відповідей, Gemini 3.7 як суддя.
Відповідність діалекту, оцінена LLM, для тих самих запитань: чи справді відповідь подається еміратським діалектом, чи модель за замовчуванням переходить на сучасну стандартну арабську?
Falcon-Emirati-7B лідирує за правильністю, але справжній розрив видно на другій діаграмі. За відповідністю діалекту Falcon-Emirati-7B набирає 0,52 (часткове зарахування), тоді як ALLaM — 0,05, gemma-3-27b-it — 0,03, Jais-2-8B-Chat — 0,02, а Fanar-2-27B-Instruct — фактично 0,00. Це не невелика перевага, а майже два порядки величини на нижньому кінці шкали. На практиці це означає, що інші моделі часто знають правильну відповідь, але за замовчуванням формулюють її сучасною стандартною арабською, навіть коли їх безпосередньо просять відповісти еміратським діалектом. Falcon-Emirati-7B — єдина з п’яти моделей, яка стабільно відповідає тим діалектом, яким до неї звернулися.
Fanar-2-27B-Instruct вирізняється також із іншої причини: вона значно частіше за інші моделі утримується від відповіді — у 26,2% випадків, тоді як для кожної іншої моделі в порівнянні цей показник становить менше 5%. У поєднанні з її оцінкою правильності 0,27 (часткове зарахування), найнижчою серед п’яти моделей, це вказує на модель, яка і менш охоче, і менш здатна працювати зі специфічним для Еміратів контентом, а не просто відповідає в неправильному мовному регістрі.
Відповідність діалекту за категоріями Alyah, часткове зарахування. Falcon-Emirati-7B — єдина модель, яка послідовно переходить на еміратський діалект; інші залишаються на сучасній стандартній арабській майже в кожній категорії.
Розподіл відповідності діалекту за категоріями робить цю закономірність ще очевиднішою. Вона спостерігається в кожній категорії Alyah — від повсякденних привітань до поезії, — що свідчить: це не вузький прийом, засвоєний для кількох типів запитань. Це загальна зміна регістру, якому модель надає перевагу, коли очікуваним є еміратський діалект. Єдина категорія, у якій конкурентні моделі показують відносно кращі результати, — «Привітання та повсякденні вислови» — водночас є категорією, де еміратська та сучасна стандартна арабська найбільше перетинаються. Тому саме тут загальній арабській моделі найпростіше випадково звучати правильно.
Попарне порівняння за категоріями
Як третій погляд на те саме питання ми провели очне попарне оцінювання: для кожного запитання Alyah судді (Gemini 3.7 Flash) показували відповідь Falcon-Emirati-7B поруч із відповіддю конкурентної моделі, не повідомляючи, яка відповідь кому належить, і просили вибрати кращу. На наведених нижче радарних діаграмах показано отриманий відсоток перемог за категоріями в порівнянні з трьома конкурентними моделями: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview і Fanar-2-27B-Instruct.
Відсоток попарних перемог за категоріями: Falcon-Emirati-7B проти Jais-2-8B-Chat, ALLaM-7B-Instruct-preview і Fanar-2-27B-Instruct, оцінювання Gemini 3.7 в очному порівнянні.
Falcon-Emirati-7B перемагає в більшості категорій усіх трьох конкурентів, причому з великим відривом у категоріях, які найбільше залежать від діалектної та культурної компетентності. Проти Jais-2-8B-Chat найбільший розрив спостерігається в категоріях «Поезія та творче самовираження» (0,69 проти 0,31) і «Мова та діалект» (0,62 проти 0,38). Проти ALLaM-7B-Instruct-preview ті самі дві категорії знову демонструють найбільшу перевагу: «Поезія та творче самовираження» (0,66 проти 0,34) і «Мова та діалект» (0,58 проти 0,42). У порівнянні з Fanar-2-27B-Instruct відрив найбільший із усіх трьох матчів, і Falcon-Emirati-7B перемагає в кожній категорії, досягаючи найвищого результату в «Поезії та творчому самовираженні» (0,88 проти 0,12) і «Релігійній та соціальній чутливості» (0,80 проти 0,20).
Єдина категорія, де конкурентні моделі не поступаються, — «Привітання та повсякденні вислови»: Falcon-Emirati-7B трохи програє її Jais-2-8B-Chat (0,46 проти 0,54) і ділить результат з ALLaM-7B-Instruct-preview (0,50), хоча й упевнено перемагає Fanar-2-27B-Instruct (0,70 проти 0,30). Це загалом відповідає результатам наведеного вище аналізу відповідності діалекту: привітання — категорія, де еміратська та сучасна стандартна арабська найбільше перетинаються, тому загальній арабській моделі найпростіше звучати як носій мови навіть без спеціального навчання діалекту. Усюди, де діалект має виразніші особливості — у поезії, переносному мовленні та знаннях про спадщину, — перевага Falcon-Emirati-7B чітко зберігається щодо кожної протестованої конкурентної моделі.
Розуміння еміратської культури
Мова також передбачає розуміння культури, що стоїть за розмовою. Ми оцінили Falcon-Emirati-7B на частині ОАЕ бенчмарку ArabCulture-Dialogue, призначеного для оцінювання культурного розуміння арабською мовою. У завданні з множинним вибором моделі мають обрати найбільш культурно доречну відповідь із трьох варіантів. Докладніше дивіться в науковій статті.
Ми протестували всі чотири моделі на тих самих 283 сценаріях з ОАЕ, еміратською арабською та сучасною стандартною арабською, із різним обсягом інформації про місце події.
Загальна точність у завданні з множинним вибором про ОАЕ, усереднена для обох мовних варіантів і всіх налаштувань інформації про місце. Це результати нашого оцінювання.
Falcon-Emirati-7B набрала 85,57% — найвищий результат серед чотирьох протестованих моделей, випередивши ALLaM-7B (83,39%), Jais-2-8B (73,79%) і Fanar-2-27B (71,50%). Ці результати підкреслюють її здатність розпізнавати культурно доречні відповіді в еміратських розмовах.
Подивіться модель у дії
Числа розповідають лише частину історії, тому нижче наведено інтерактивне порівняння в реальному часі: п’ять справжніх еміратських запитів, опрацьованих Falcon-Emirati-7B поруч із Fanar-2-27B-Instruct та ALLaM-7B-Instruct-preview. Гортайте або використовуйте стрілки, щоб переходити між запитами, і розгортайте будь-яку відповідь, щоб прочитати її повністю.
Інтерактивне порівняння: Falcon-Emirati-7B проти Fanar-2-27B-Instruct та ALLaM-7B-Instruct-preview на п’яти еміратських запитах, що охоплюють привітання зі святом Ід, місцеву історію, поезію та знання про спадщину. Відповіді показано такими, якими їх було згенеровано, і вони можуть містити помилки; виділення позначає нашу модель, а не оцінку фактичної правильності.
Спробуйте Falcon-Emirati-7B
Falcon-Emirati-7B доступна на нашій чат-платформі. 🚀 Спробуйте зараз: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
Відповідальний ШІ та обмеження
Як і будь-яка мовна модель, Falcon-Emirati-7B може відображати упередження у своїх навчальних даних і часом помилятися, особливо щодо рідкісних висловів, вузьколокальних згадок або крайніх випадків, для яких у нас було мало даних. Діалектні та культурні нюанси подекуди є суб’єктивними, і навіть носії мови не завжди погоджуються щодо «правильної» відповіді. Ми рекомендуємо оцінити модель для вашого конкретного сценарію використання, перш ніж покладатися на неї в чутливих, офіційних чи важливих ситуаціях, і будемо щиро вдячні за відгуки еміратської спільноти, які допоможуть нам надалі вдосконалювати і модель, і Alyah.
Подяка
Ми висловлюємо щиру подяку Mikhail Lubinets і Matthieu Berjon за постійну підтримку обчислювальної інфраструктури, а також Jatin Mittal за допомогу в забезпеченні доступності моделі через застосунок Falcon Chat.
Цитування
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}
Набори даних, згадані в цій статті 2
Спільнота
· Зареєструйтеся або увійдіть, щоб коментувати
Набори даних, згадані в цій статті 2
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.







