Falcon-Emirati: Когда LLM осваивает диалект, культуру и нюансы
Арабский — это целое семейство языков, объединённых одним названием. Литературный арабский — это язык новостей и учебников, но люди редко разговаривают друг с другом именно на нём. В ОАЭ повседневное общение, юмор, переговоры и рассказы ведутся на эмиратском арабском — диалекте стран Персидского залива со своей лексикой, ритмом и тесно связанной с ним культурой. Эмиратская поэзия, особенно набати, а также пословицы и короткие истории несут смысл, который не сохраняется при буквальном, пословном переводе. Модель, знающая только литературный арабский, может перевести каждое слово эмиратского предложения и всё равно не понять, что оно на самом деле означает.
Именно этот пробел призван устранить Falcon-Emirati-7B. Это специализированная для диалекта модель, созданная на базе Falcon-H1-Arabic и предназначенная для понимания и генерации эмиратского арабского так, как это делал бы носитель языка: с учётом лексики, тона и стоящего за ними культурного контекста.
Создана на базе Falcon-H1-Arabic
Мы не начинали с нуля. Falcon-Emirati-7B создана на базе Falcon-H1-Arabic — нашего семейства арабских моделей, которое уже установило новые рекорды для этого языка ранее в этом году. Falcon-H1-Arabic использует гибридную архитектуру Falcon-H1: модели пространства состояний (Mamba) и механизм внимания Transformer работают параллельно внутри каждого блока, а их выходы объединяются перед проекцией каждого блока. Такое сочетание обеспечивает линейную по времени эффективность Mamba на длинных последовательностях, сохраняя точность внимания для дальних зависимостей, что особенно важно для морфологически богатого арабского языка. Семейство включает три масштаба — 3B, 7B и 34B параметров — с контекстными окнами до 128K и 256K токенов и уже обучалось на широком наборе данных на литературном и диалектном арабском (залив, левантийский, египетский, магрибский), а также на английском и многоязычных данных.
Это дало нам сильную отправную точку: модель, которая уже обладала широким пониманием арабского языка, хорошо работала с длинным контекстом и имела встроенное знакомство с некоторыми диалектами. Falcon-Emirati-7B берёт эту основу и целенаправленно развивает её в сторону эмиратского диалекта, его лексики, грамматики и культурных знаний — того, что универсальная арабская модель, какой бы способной она ни была, самостоятельно не усвоит.
Мы создали Falcon-Emirati-7B именно на основе варианта 7B. Это оптимальный размер в семействе: модель достаточно велика, чтобы сохранять нюансы, необходимые для адаптации к диалекту, но достаточно мала, чтобы обучение и инференс оставались практичными. Модель 34B, вероятно, обеспечила бы несколько более высокое качество, но затраты на обучение и использование не оправданы для специализированной диалектной чат-модели, а модели 3B недостаточно запаса для глубины культурного и языкового понимания, которого мы добивались. Вариант 7B обеспечил лучший баланс качества и стоимости обучения и инференса.
Почему адаптация к диалекту сложна
Превращение универсальной арабской модели в специалиста по эмиратскому диалекту кажется меньшей задачей, чем создание базовой модели с нуля. Но это не так. Есть несколько факторов, которые делают её действительно сложной:
- Эмиратский — преимущественно разговорный диалект. В интернете он встречается в письменном виде гораздо реже, чем литературный арабский или даже другие диалекты стран Залива и Леванта, поэтому доступного исходного текста для обучения значительно меньше.
- Смысл часто не является буквальным. Идиомы, пословицы и поэтические отсылки опираются на общий культурный контекст, а не на поверхностную лексику.
- Не существует отработанной методики. Нет хорошо документированного рецепта, который отвечал бы на вопросы, сколько диалектных данных достаточно, как смешивать их с литературным и общим арабским языком и какой этап обучения — продолжительное предобучение, SFT или оптимизация предпочтений — важнее всего для усвоения диалекта.
Последний пункт определил наш подход. Значительная часть работы над Falcon-Emirati-7B свелась к пробам и ошибкам: мы тестировали разные сочетания данных, этапы обучения и стратегии разметки, используя как человеческую оценку, так и результаты бенчмарков, чтобы понять, что действительно даёт заметный эффект.
Наш подход к данным
Мы создали специализированный конвейер эмиратских данных поверх предобучения Falcon-H1-Arabic, используя три взаимодополняющих источника.
1. Аутентичные веб-данные на эмиратском диалекте
Мы собирали и отбирали материалы с эмиратских сайтов и форумов, написанные непосредственно на диалекте, а не переведённые или транслитерированные с литературного арабского. Именно здесь мы получили эталонные данные: как эмиратцы действительно пишут и разговаривают в интернете, повседневные формулировки, разговорные выражения и естественное чередование эмиратского и литературного арабского, встречающееся в реальном употреблении.
2. Данные на литературном арабском о культуре и идентичности Эмиратов
Наряду с диалектными текстами мы добавили материалы на литературном арабском, посвящённые эмиратской культуре, наследию и языку: статьи и справочные материалы о местных обычаях, ценностях, истории и социальных нормах, включая то, как эмиратцев воспринимают и стереотипизируют. Это не учит модель писать на диалекте, но учит её понимать, о чём идёт речь, когда возникают темы, связанные с Эмиратами: о наследии, этикете и контексте, который носитель языка просто знает.
3. Синтетические данные под руководством глоссариев и стилевых правил
Одних аутентичных диалектных текстов было недостаточно, чтобы охватить круг тем, с которыми чат-модель должна справляться в повседневной работе. Поэтому мы сгенерировали большой объём синтетических данных на эмиратском диалекте, чтобы восполнить пробелы. Мы не позволяли генеративной модели импровизировать на «примерно заливском» арабском. Мы ограничили её строгими правилами, глоссариями и словарями, специально созданными для эмиратской лексики и грамматики. Эти ограничения стали ключевым отличием между синтетическим текстом, который звучит аутентично по-эмиратски, и текстом, который грамматически безупречен, но кажется неправильным любому носителю диалекта.
Поиск правильного рецепта адаптации
Поскольку стандартного рецепта адаптации с литературного языка на диалект не существует, мы экспериментально подбирали и саму стратегию обучения. Мы проводили абляционные исследования: проверяли, сколько диалектных данных добавлять и на каком этапе обучения, как сбалансировать аутентичные собранные данные и синтетические, не допуская переобучения модели на синтетических шаблонах, и сколько культурного контекста на литературном арабском действительно нужно, чтобы сохранить культурную основу, а не только поверхностную беглость. На каждом этапе мы опирались на сочетание автоматического оценивания и проверки носителями языка, поскольку одних автоматических метрик недостаточно для надёжной оценки естественности, тона и культурного соответствия.
Методология оценки
В ходе обучения мы отслеживали прогресс с помощью двух взаимодополняющих подходов:
Ручная оценка носителями языка
Носители эмиратского языка непосредственно проверяли ответы модели, оценивая не только правильность ответа, но и то, насколько естественно он звучит: естественность, тон и культурную уместность. Это то, чего не покажет результат бенчмарка, но что носитель языка сразу улавливает на слух.
Автоматическая оценка на Alyah
Для количественного отслеживания мы использовали Alyah (الياه, «Полярная звезда») — бенчмарк, выпущенный нами и сообществом специально для оценки способностей арабских LLM к работе с эмиратским диалектом. Alyah — полностью нативный тест с выбором ответа из нескольких вариантов, включающий 1 173 примера, вручную собранных у носителей эмиратского языка и охватывающих категории от повседневных приветствий и этикета до образной речи, знаний о наследии и эмиратской поэзии — категории, в которых диалект и культура особенно важны и где универсальные арабские модели обычно испытывают трудности. Полная информация о создании Alyah и распределении по категориям доступна в нашей статье о бенчмарке, а сведения о семействе базовых моделей — в анонсе Falcon-H1-Arabic.
Результаты
Falcon-Emirati-7B набрала на Alyah 84,83%, опередив все остальные арабские и многоязычные модели, с которыми мы её сравнивали, включая несколько моделей, значительно превосходящих её по размеру. На приведённой ниже диаграмме показано её положение рядом с репрезентативным набором ведущих моделей, дообученных следовать инструкциям, в таблице лидеров Alyah.
Точность на Alyah (%), модели, дообученные следовать инструкциям. Модели семейства Falcon-H1-Arabic исключены из сравнения, поскольку Falcon-Emirati-7B построена на их основе.
Что говорят результаты
Из этого сравнения сразу бросаются в глаза несколько моментов. Один лишь размер не обеспечивает компетентность в работе с диалектом. Некоторые из крупнейших многоязычных моделей здесь показывают результаты значительно ниже, чем более компактные модели, лучше учитывающие диалект. Это говорит о том, что владение эмиратским нужно специально формировать при обучении, а не получать как побочный эффект масштабирования. Лучшие модели также, как правило, изначально ориентированы на арабский язык или являются арабскими нативными моделями, что согласуется с результатами наших собственных абляционных исследований: широкое покрытие арабского языка и диалектов — необходимая отправная точка, но для устранения оставшегося разрыва всё равно требуется целенаправленная работа с конкретным диалектом, особенно над самыми сложными частями Alyah, такими как поэзия, знания о наследии и сама категория языка и диалекта.
Это также соответствует более общим выводам, сделанным после выпуска бенчмарка Alyah: даже сильные модели заметно теряют качество, когда сталкиваются с по-настоящему диалектным и культурно укоренённым содержанием. Более крупные модели сами по себе этот разрыв не устраняют. Для этого нужны данные и оценка, специально разработанные для конкретного диалекта.
За пределами тестов с выбором ответа: оценка LLM в роли судьи
Точность в тесте с выбором ответа показывает, может ли модель распознать правильный вариант среди четырёх. Но она не говорит, будет ли модель самостоятельно выдавать эмиратский арабский, когда пользователь просто обращается к ней. Поэтому наряду с Alyah мы провели вторую оценку: генерацию развернутых ответов на тех же 1 173 вопросах Alyah, которые оценивала LLM-судья (Gemini 3.7 Flash) при сравнении пяти моделей: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat и Fanar-2-27B-Instruct. Мы выбрали их как сильнейшие конкурирующие модели в таблице лидеров Alyah.
Судья оценивал каждый ответ по двум отдельным параметрам: правильность содержания и, независимо от неё, был ли ответ дан именно на эмиратском диалекте, а не на литературном арабском. Мы приводим как результат с частичным начислением баллов (градуированную оценку судьи), так и более строгий вариант «пройдено/не пройдено», а также частоту отказов каждой модели от ответа.
Корректность развернутых ответов на 1 173 вопроса Alyah по оценке LLM, Gemini 3.7 в роли судьи.
Соответствие диалекту в ответах на те же вопросы по оценке LLM: действительно ли ответ дан на эмиратском или модель по умолчанию переходит на литературный арабский?
Falcon-Emirati-7B лидирует по корректности, но настоящий разрыв виден на второй диаграмме. По соответствию диалекту Falcon-Emirati-7B набирает 0,52 (частичное начисление баллов), тогда как ALLaM — 0,05, gemma-3-27b-it — 0,03, Jais-2-8B-Chat — 0,02, а Fanar-2-27B-Instruct — фактически 0,00. Это не небольшое преимущество, а разрыв почти в два порядка в нижней части шкалы. На практике это означает, что другие модели часто знают правильный ответ, но по умолчанию формулируют его на литературном арабском, даже когда к ним обращаются непосредственно на эмиратском. Falcon-Emirati-7B — единственная из пяти моделей, которая надёжно отвечает на том же диалекте, на котором к ней обратились.
Fanar-2-27B-Instruct выделяется ещё по одной причине: она значительно чаще других моделей воздерживается от ответа, отказываясь отвечать в 26,2% случаев, тогда как у всех остальных моделей в сравнении этот показатель ниже 5%. В сочетании с результатом по корректности 0,27 (частичное начисление баллов), самым низким среди пяти моделей, это указывает на модель, которая не только менее склонна, но и менее способна работать с содержанием, специфичным для Эмиратов, а не просто отвечает в неправильном языковом регистре.
Соответствие диалекту по категориям Alyah, частичное начисление баллов. Falcon-Emirati-7B — единственная модель, которая стабильно переходит на эмиратский; остальные почти во всех категориях остаются на литературном арабском.
Если разбить соответствие диалекту по категориям, картина становится ещё яснее. Эта закономерность сохраняется во всех категориях Alyah — от повседневных приветствий до поэзии, — что говорит не об узком приёме, выученном для нескольких типов вопросов, а об общем изменении регистра, к которому модель обращается по умолчанию, когда ожидается эмиратский. Единственная категория, где конкурирующие модели показывают относительно лучшие результаты, — «Приветствия и повседневные выражения». Именно здесь эмиратский и литературный арабский пересекаются сильнее всего, поэтому универсальной арабской модели проще случайно прозвучать правильно.
Попарное сравнение по категориям
В качестве третьего взгляда на тот же вопрос мы провели очное попарное сравнение: для каждого вопроса Alyah судье (Gemini 3.7 Flash) показывали рядом ответ Falcon-Emirati-7B и ответ конкурирующей модели, не раскрывая, какой ответ принадлежит какой модели, и просили выбрать лучший. На приведённых ниже радиальных диаграммах показана доля побед по категориям в сравнении с тремя конкурирующими моделями: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct.
Доля побед по категориям в попарном сравнении Falcon-Emirati-7B с Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct, проведённом Gemini 3.7.
Falcon-Emirati-7B выигрывает большинство категорий у всех трёх конкурентов, причём с большим отрывом в категориях, которые сильнее всего зависят от диалектной и культурной беглости. В сравнении с Jais-2-8B-Chat разрыв максимален в категориях «Поэзия и творческое выражение» (0,69 против 0,31) и «Язык и диалект» (0,62 против 0,38). В сравнении с ALLaM-7B-Instruct-preview те же две категории снова показывают самый большой отрыв: «Поэзия и творческое выражение» (0,66 против 0,34) и «Язык и диалект» (0,58 против 0,42). В сравнении с Fanar-2-27B-Instruct разрыв самый большой из всех трёх сопоставлений, и Falcon-Emirati-7B выигрывает каждую категорию, достигая максимума в «Поэзии и творческом выражении» (0,88 против 0,12) и «Религиозной и социальной чувствительности» (0,80 против 0,20).
Единственная категория, в которой конкурирующие модели держатся на равных, — «Приветствия и повседневные выражения»: Falcon-Emirati-7B немного уступает её Jais-2-8B-Chat (0,46 против 0,54) и делит первое место с ALLaM-7B-Instruct-preview (0,50), хотя всё же уверенно выигрывает у Fanar-2-27B-Instruct (0,70 против 0,30). В целом это соответствует результатам приведённого выше анализа соответствия диалекту: приветствия — категория, где эмиратский и литературный арабский пересекаются сильнее всего, поэтому универсальной арабской модели проще звучать как носитель языка даже без специального обучения диалекту. Во всех случаях, когда диалект более самобытен — в поэзии, образной речи и знаниях о наследии, — преимущество Falcon-Emirati-7B явно сохраняется по сравнению со всеми протестированными конкурентными моделями.
Понимание эмиратской культуры
Язык также предполагает понимание культуры, стоящей за разговором. Мы оценили Falcon-Emirati-7B на части набора данных ОАЭ из ArabCulture-Dialogue — бенчмарка для оценки культурного понимания на арабском языке. В задании с выбором ответа модели должны выбрать наиболее культурно уместную реплику из трёх вариантов. Подробнее читайте в исследовательской статье.
Мы протестировали все четыре модели на одних и тех же 283 сценариях из ОАЭ — как на эмиратском арабском, так и на литературном арабском, с разным объёмом информации о местоположении.
Общая точность в задании с выбором ответа по ОАЭ, усреднённая по обоим языковым вариантам и всем настройкам местоположения. Это результаты нашей оценки.
Falcon-Emirati-7B набрала 85,57% — это лучший результат среди четырёх протестированных моделей, опередив ALLaM-7B (83,39%), Jais-2-8B (73,79%) и Fanar-2-27B (71,50%). Эти результаты демонстрируют способность модели распознавать культурно уместные ответы в эмиратских разговорах.
Посмотрите модель в действии
Одни цифры рассказывают лишь часть истории, поэтому ниже представлено интерактивное сравнение в реальном времени: пять настоящих запросов на эмиратском языке, обработанных Falcon-Emirati-7B параллельно с Fanar-2-27B-Instruct и ALLaM-7B-Instruct-preview. Перемещайтесь между запросами с помощью свайпа или стрелок и разворачивайте любой ответ, чтобы прочитать его полностью.
Интерактивное сравнение Falcon-Emirati-7B, Fanar-2-27B-Instruct и ALLaM-7B-Instruct-preview на пяти запросах на эмиратском языке, посвящённых поздравлениям с Ид аль-Фитр, местной истории, поэзии и знаниям о наследии. Ответы приведены в сгенерированном виде и могут содержать ошибки; выделение обозначает нашу модель, а не фактическую оценку.
Попробуйте Falcon-Emirati-7B
Falcon-Emirati-7B доступна на нашей чат-платформе. 🚀 Попробуйте сейчас: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
Ответственный ИИ и ограничения
Как и любая языковая модель, Falcon-Emirati-7B может отражать предубеждения, содержащиеся в обучающих данных, и иногда ошибаться, особенно при работе с редкими выражениями, узколокальными отсылками или нестандартными случаями, для которых у нас было мало данных. Диалектные и культурные нюансы в некоторых случаях субъективны, и даже носители языка не всегда согласятся относительно «правильного» ответа. Мы рекомендуем оценить модель для конкретного варианта использования, прежде чем полагаться на неё в чувствительных, официальных или критически важных задачах, и будем искренне рады отзывам эмиратского сообщества, которые помогут нам в дальнейшем улучшать и модель, и Alyah.
Благодарность
Мы хотели бы выразить искреннюю благодарность Михаилу Лубинцу и Матьё Бержону за постоянную поддержку инфраструктуры вычислений, а также Джатину Митталу за помощь в обеспечении доступа к модели через приложение Falcon Chat.
Цитирование
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}
Наборы данных, упомянутые в этой статье 2
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Наборы данных, упомянутые в этой статье 2
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.







