Falcon-Emirati: Когато един LLM научи диалекта, културата и нюансите
Арабският всъщност е семейство от езици, обединени под едно име. Съвременният книжовен арабски е това, което четете във вестниците или в учебник, но рядко така хората разговарят помежду си. В ОАЕ ежедневните разговори, хуморът, преговорите и разказването на истории се водят на емиратски арабски — заливен диалект със собствена лексика, собствен ритъм и култура, тясно преплетена с него. Емиратската поезия, особено набатийската поезия, както и пословиците и кратките анекдоти, носят смисъл, който не оцелява при буквален, дума по дума превод. Модел, който познава само MSA, може да преведе всяка дума от емиратско изречение и въпреки това да пропусне какво всъщност означава то.
Именно тази празнина е създаден да запълни Falcon-Emirati-7B. Това е модел, специализиран в диалекта, изграден върху Falcon-H1-Arabic, чиято цел е да разбира и генерира емиратски арабски така, както би го правил носител на езика: с лексиката, тона и културния контекст зад него.
Изграден върху Falcon-H1-Arabic
Не започнахме от нулата. Falcon-Emirati-7B е изграден върху Falcon-H1-Arabic — нашето семейство от арабски модели, което по-рано тази година постави нови рекорди за езика. Falcon-H1-Arabic използва хибридната архитектура Falcon-H1: модели на пространството на състоянията (Mamba) и Transformer внимание, работещи паралелно във всеки блок, като изходите им се сливат преди проекцията на всеки блок. Тази комбинация осигурява ефективността на Mamba с линейна времева сложност при дълги последователности, като същевременно запазва прецизността на вниманието при зависимости на далечни разстояния — нещо важно за морфологично богат език като арабския. Семейството обхваща три мащаба (3B, 7B и 34B параметъра) с контекстни прозорци до 128K и 256K токена и вече беше обучено върху широк набор от MSA и диалектен арабски (заливен, левантийски, египетски, магребски), наред с английски и многоезични данни.
Това ни даде стабилна отправна точка: модел, който вече разбираше арабския в широк план, боравеше добре с дълъг контекст и имаше вградена известна експозиция към диалекти. Falcon-Emirati-7B използва тази основа и я насочва конкретно към емиратския диалект, лексиката, граматиката и културното знание, които един общ арабски модел, колкото и способен да е, не усвоява самостоятелно.
Изградихме Falcon-Emirati-7B конкретно върху варианта 7B. Той е оптималната точка в семейството: достатъчно голям, за да запази нюансите, необходими при адаптация към диалект, но достатъчно малък, за да останат и обучението, и инференцията практически осъществими. Моделът 34B вероятно би повишил качеството малко повече, но при разходи за обучение и обслужване, които не оправдават чат модел, специализиран в един диалект, а моделът 3B не оставя достатъчно пространство за дълбочината на културното и езиковото разбиране, към която се стремяхме. 7B ни даде най-добрия баланс между качество и разходи за обучение и инференция.
Защо адаптацията към диалект е трудна
Превръщането на общ арабски модел в специалист по емиратския диалект звучи като по-малка задача от създаването на базовия модел. Но не е. Няколко фактора я правят наистина трудна:
- Емиратският е предимно говорим диалект. Той се среща онлайн в писмена форма много по-рядко от MSA или дори от други заливни и левантийски диалекти, така че просто няма толкова необработен текст, от който да се учи.
- Смисълът често не е буквален. Идиомите, пословиците и поетичните препратки се опират на споделен културен контекст, а не на повърхностната лексика.
- Няма утвърден наръчник. Не съществува добре документирана рецепта за това колко диалектни данни са достатъчни, как да се смесят с MSA и общ арабски или кой етап на обучение (продължаващо предварително обучение, SFT или оптимизация на предпочитанията) е най-важен за усвояването на даден диалект.
Последната точка определи начина ни на работа. Голяма част от създаването на Falcon-Emirati-7B се свеждаше до проби и грешки: тествахме различни смеси от данни, етапи на обучение и стратегии за надзор, като използвахме както човешка преценка, така и резултати от бенчмаркове, за да разберем какво действително подобрява резултатите.
Нашият подход към данните
Изградихме специализиран конвейер за емиратски данни върху предварителното обучение на Falcon-H1-Arabic, като използвахме три допълващи се източника.
1. Автентични уеб данни на емиратски диалект
Обходихме и подбрахме съдържание от емиратски уебсайтове и форуми, написано естествено на диалекта, а не преведено или транслитерирано от MSA. Оттук получихме истинската основа: как емиратците действително пишат и говорят онлайн, ежедневните фрази, разговорните изрази и естественото редуване между емиратски и MSA, което се среща в реалната употреба.
2. MSA данни за емиратската култура и идентичност
Наред с диалектния текст включихме материали на MSA, посветени конкретно на емиратската култура, наследство и език: статии и справочни материали за местните обичаи, ценности, история и социални норми, включително начина, по който емиратците са възприемани и стереотипизирани. Това не учи модела да пише на диалект, но го учи какво обсъжда, когато се появят емиратски теми — неща като наследство, етикет и контекст, който носителят на езика просто познава.
3. Синтетични данни, насочвани от речници и стилови правила
Автентичният диалектен текст сам по себе си не беше достатъчен, за да покрие набора от теми, с които един чат модел действително трябва да се справя всекидневно. Затова генерирахме голямо количество синтетични данни на емиратски диалект, за да запълним празнините. Не оставихме просто генеративен модел да импровизира на „донякъде заливен“ арабски. Ограничихме го със строги правила, речници и лексикони, създадени специално за емиратската лексика и граматика. Тези ограничения направиха разликата между синтетичен резултат, който звучи автентично емиратски, и резултат, който е граматически правилен, но звучи странно на всеки, който действително говори диалекта.
Намиране на правилната рецепта за адаптация
Тъй като няма стандартна рецепта за адаптация от MSA към диалект, подходихме към самата стратегия за обучение като към нещо, което трябва да бъде установено експериментално. Проведохме аблационни изследвания върху това колко диалектни данни да добавим и на кой етап от обучението, как да балансираме автентичните обходени данни със синтетичните, без моделът да се преобучи спрямо синтетични модели, както и колко MSA културен контекст действително е необходим, за да остане той културно вкоренен, а не просто повърхностно гладък. На всяка стъпка разчитахме на комбинация от автоматично оценяване и преглед от носители на езика, тъй като автоматичните метрики сами по себе си не улавят достатъчно добре естествеността, тона или културната пригодност, за да им се доверим самостоятелно.
Методология за оценяване
Проследявахме напредъка по време на обучението чрез два допълващи се подхода:
Ръчно оценяване от носители на езика
Носители на емиратския език преглеждаха директно резултатите на модела, като оценяваха не само дали отговорът е правилен, но и дали звучи добре: естественост, тон и културна уместност. Това са неща, които резултатът от бенчмарк няма да ви покаже, но ухото на носителя улавя незабавно.
Автоматично оценяване с Alyah
За количествено проследяване използвахме Alyah (الياه, „Полярна звезда“) — бенчмарк, който ние и общността публикувахме специално за оценяване на способността на арабските LLM да работят с емиратския диалект. Alyah е изцяло естествен бенчмарк с избор от няколко отговора, съдържащ 1 173 примера, събрани ръчно от носители на емиратския език и обхващащи категории от ежедневни поздрави и етикет до преносен език, познания за наследството и емиратска поезия — категориите, в които диалектът и културата са най-важни и в които общите арабски модели обикновено изпитват трудности. Пълни подробности за създаването и категориите на Alyah са налични в нашата публикация за бенчмарка, а информация за семейството базови модели можете да намерите в съобщението за Falcon-H1-Arabic.
Резултати
Falcon-Emirati-7B постига 84,83% в Alyah — пред всеки друг арабски и многоезичен модел, с който го сравнихме, включително няколко модела, многократно по-големи от него. Графиката по-долу показва позицията му спрямо представителен набор от водещи модели, дообучени с инструкции, в класацията на Alyah.
Точност в Alyah (%), модели, дообучени с инструкции. Моделите от семейството Falcon-H1-Arabic са изключени от сравнението, тъй като Falcon-Emirati-7B е изграден върху тях.
Какво ни показват резултатите
От това сравнение изпъкват няколко неща. Самият размер не осигурява компетентност в диалекта. Някои от най-големите многоезични модели тук постигат значително по-ниски резултати от по-малки, по-добре запознати с диалекта модели, което показва, че владеенето на емиратски трябва да бъде целенасочено обучавано, а не придобито като страничен ефект от мащаба. Най-добре представящите се модели обикновено са арабски по произход или са фокусирани върху арабския още от самото начало, което съвпада с наблюденията ни от собствените ни аблационни изследвания: широкото покритие на арабския и диалектите е необходима отправна точка, но все пак е нужна целенасочена работа конкретно върху диалекта, за да се затвори останалата разлика, особено при най-трудните части на Alyah като поезията, познанията за наследството и самата категория за език и диалект.
Това съответства и на по-общите изводи от публикуването на бенчмарка Alyah: дори силните модели показват реално влошаване, когато преминат към истински диалектно и културно обвързано съдържание. Тази разлика не се затваря сама само с по-големи модели. Необходими са данни и оценяване, изградени специално за диалекта.
Отвъд избора от няколко отговора: оценяване от LLM като съдия
Точността при избор от няколко отговора показва дали моделът може да разпознае правилния отговор сред четири възможности. Тя не показва дали моделът действително ще генерира емиратски арабски самостоятелно, когато някой просто разговаря с него. Затова наред с Alyah проведохме второ оценяване: генериране на отворени отговори по същите 1 173 въпроса от Alyah, оценени от LLM съдия (Gemini 3.7 Flash) спрямо пет модела — Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat и Fanar-2-27B-Instruct, избрани като най-силните конкурентни модели в класацията на Alyah.
Съдията оцени всеки отговор по две отделни измерения: дали съдържанието е правилно и, независимо от това, дали отговорът действително е на емиратски диалект, а не на MSA. Представяме както резултат с частичен кредит (степенуваната оценка на съдията), така и по-строга версия „издържал/не издържал“, плюс това колко често всеки модел се е въздържал вместо да отговори.
Коректност, оценена от LLM, по 1 173-те въпроса от Alyah, генериране на отворени отговори, Gemini 3.7 като съдия.
Вярност към диалекта, оценена от LLM, по същите въпроси: отговорът действително ли е на емиратски, или моделът преминава по подразбиране към MSA?
Falcon-Emirati-7B води по коректност, но истинската разлика се вижда във втората графика. По вярност към диалекта Falcon-Emirati-7B постига 0,52 (частичен кредит) срещу 0,05 за ALLaM, 0,03 за gemma-3-27b-it, 0,02 за Jais-2-8B-Chat и практически 0,00 за Fanar-2-27B-Instruct. Това не е малко предимство — в долния край разликата е близо два порядъка. На практика това означава, че другите модели често знаят правилния отговор, но по подразбиране го изричат на съвременен книжовен арабски, дори когато са попитани директно на емиратски. Falcon-Emirati-7B е единственият от петте, който надеждно отговаря на диалекта, на който е бил попитан.
Fanar-2-27B-Instruct се отличава и по втора причина: той се въздържа много по-често от всеки друг модел, като отказва да отговори в 26,2% от случаите, спрямо под 5% за всички останали модели в сравнението. В съчетание с резултата му за коректност от 0,27 (частичен кредит), най-ниския от петте, това подсказва модел, който едновременно е по-малко склонен и по-малко способен да работи със специфично емиратско съдържание, а не просто модел, който отговаря в неподходящ регистър.
Вярност към диалекта по категории от Alyah, частичен кредит. Falcon-Emirati-7B е единственият модел, който последователно преминава към емиратски; останалите остават на MSA в почти всички категории.
Разбивката на верността към диалекта по категории прави модела на поведение още по-ясен. Той се запазва във всяка отделна категория на Alyah — от ежедневните поздрави до поезията — което подсказва, че това не е тесен трик, научен за няколко типа въпроси. Става дума за обща промяна в регистъра, към който моделът преминава по подразбиране, когато се очаква емиратският регистър. Единственото място, където конкурентните модели се представят сравнително по-добре, „Поздрави и ежедневни изрази“, е и категорията, в която емиратският и MSA се припокриват най-много, така че това е най-лесното място един общ арабски модел случайно да прозвучи правилно.
Двойно сравнение по категории
Като трети поглед към същия въпрос проведохме директно двойно оценяване: за всеки въпрос от Alyah съдията (Gemini 3.7 Flash) виждаше отговора на Falcon-Emirati-7B редом с отговора на конкурентен модел, без да знае кой кой е, и трябваше да избере по-добрия. Радарните графики по-долу показват получената честота на победите по категории спрямо три конкурентни модела: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct.
Честота на победите по категории при двойно сравнение: Falcon-Emirati-7B срещу Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct, оценени директно от Gemini 3.7.
Falcon-Emirati-7B печели мнозинството от категориите срещу и тримата конкуренти, и то с голяма преднина в категориите, които най-силно зависят от диалектна и културна плавност. Срещу Jais-2-8B-Chat разликата е най-голяма при „Поезия и творческо изразяване“ (0,69 срещу 0,31) и „Език и диалект“ (0,62 срещу 0,38). Срещу ALLaM-7B-Instruct-preview същите две категории отново показват най-големите разлики: „Поезия и творческо изразяване“ (0,66 срещу 0,34) и „Език и диалект“ (0,58 срещу 0,42). Срещу Fanar-2-27B-Instruct преднината е най-голяма от трите съпоставки и Falcon-Emirati-7B печели всяка отделна категория, достигайки максимума при „Поезия и творческо изразяване“ (0,88 срещу 0,12) и „Религиозна и социална чувствителност“ (0,80 срещу 0,20).
Единствената категория, в която конкурентните модели се представят наравно, е „Поздрави и ежедневни изрази“: Falcon-Emirati-7B губи с малко от Jais-2-8B-Chat (0,46 срещу 0,54) и завършва наравно с ALLaM-7B-Instruct-preview при 0,50, макар че все пак печели убедително срещу Fanar-2-27B-Instruct (0,70 срещу 0,30). Това до голяма степен съответства на наблюденията от разбивката на верността към диалекта по-горе: поздравите са категорията, в която емиратският и MSA се припокриват най-много, така че това е най-лесното място един общ арабски модел да прозвучи като носител на езика дори без специализирано обучение за диалекта. Навсякъде, където диалектът е по-отличителен — поезия, преносен език, познания за наследството — предимството на Falcon-Emirati-7B ясно се запазва спрямо всеки конкурентен модел, с който го тествахме.
Разбиране на емиратската култура
Езикът включва и разбирането на културата зад разговора. Оценихме Falcon-Emirati-7B върху частта за ОАЕ от ArabCulture-Dialogue — бенчмарк за културно разбиране на арабски. При задачата с избор от няколко отговора моделите избират най-подходящия от културна гледна точка отговор измежду три възможности. Прочетете повече в научната статия.
Тествахме и четирите модела върху едни и същи 283 сценария от ОАЕ, както на емиратски арабски, така и на съвременен книжовен арабски, с различно количество информация за местоположението.
Обща точност при задачата с избор от няколко отговора за ОАЕ, осреднена за двата езикови варианта и всички настройки за местоположение. Това са резултатите от нашето оценяване.
Falcon-Emirati-7B постигна 85,57% — най-високия резултат сред четирите тествани модела, пред ALLaM-7B (83,39%), Jais-2-8B (73,79%) и Fanar-2-27B (71,50%). Тези резултати подчертават способността му да разпознава културно подходящи отговори в емиратски разговори.
Вижте го в действие
Числата разказват само част от историята, затова по-долу ще видите интерактивно сравнение в реално време: пет истински емиратски въпроса, обработени от Falcon-Emirati-7B паралелно с Fanar-2-27B-Instruct и ALLaM-7B-Instruct-preview. Плъзгайте или използвайте стрелките, за да преминавате между въпросите, и разгъвайте всеки отговор, за да го прочетете изцяло.
Интерактивно сравнение: Falcon-Emirati-7B срещу Fanar-2-27B-Instruct срещу ALLaM-7B-Instruct-preview по пет емиратски въпроса, обхващащи поздрави за Ейд, местна история, поезия и познания за наследството. Резултатите са показани така, както са генерирани, и могат да съдържат грешки; осветяването идентифицира нашия модел, а не представлява оценка на фактическата достоверност.
Изпробвайте Falcon-Emirati-7B
Falcon-Emirati-7B е достъпен в нашата чат платформа. 🚀 Изпробвайте го сега: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
Отговорен изкуствен интелект и ограничения
Както всеки езиков модел, Falcon-Emirati-7B може да отразява пристрастията в обучаващите си данни и понякога да греши, особено при редки изрази, силно локализирани препратки или крайни случаи, за които не сме разполагали с много данни. Диалектните и културните нюанси на места са субективни и дори носителите на езика не винаги ще се съгласят кой е „правилният“ отговор. Препоръчваме да оцените модела за конкретния си случай на употреба, преди да разчитате на него за нещо чувствително, официално или с високи залози, и искрено приветстваме обратната връзка от емиратската общност, за да ни помогне да подобрим както модела, така и Alyah занапред.
Благодарности
Бихме искали да изкажем искрената си благодарност на Mikhail Lubinets и Matthieu Berjon за постоянната им подкрепа по отношение на изчислителната инфраструктура, както и на Jatin Mittal за помощта му при осигуряването на достъп до модела чрез приложението Falcon Chat.
Цитиране
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}
Набори от данни, споменати в тази статия 2
Общност
· Регистрирайте се или влезте, за да коментирате
Набори от данни, споменати в тази статия 2
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.







