Falcon-Emirati: когда языковая модель осваивает диалект, культуру и нюансы

Источник: Hugging Face

Falcon-Emirati: когда языковая модель осваивает диалект, культуру и нюансы

Источник: Hugging Face

Статья в блоге Technology Innovation Institute на Hugging Face

•Обновлено: 6 октября 2026 г.

Арабский язык на самом деле представляет собой семью языков, объединенных одним названием. Современный стандартный арабский (MSA) — это то, что вы читаете в новостях или учебниках, но так люди в реальной жизни почти не разговаривают друг с другом. В ОАЭ повседневное общение, юмор, переговоры и рассказ историй происходят на эмиратском диалекте — диалекте Персидского залива со своим собственным словарным запасом, ритмом и тесно связанной с ним культурой. Эмиратская поэзия, особенно поэзия набати, а также пословицы и короткие анекдоты несут в себе смысл, который теряется при буквальном пословном чтении. Модель, знакомая только с MSA, может перевести каждое слово эмиратского предложения и всё равно упустить то, что оно означает на самом деле.

Именно этот пробел призкована заполнить Falcon-Emirati-7B. Это специализированная на диалектах модель на базе Falcon-H1-Arabic, нацеленная на понимание и генерацию эмиратского арабского так, как это сделал бы носитель языка: с учетом словарного запаса, тона и стоящего за ними культурного контекста.

Создано на базе Falcon-H1-Arabic

Мы не начинали с нуля. Falcon-Emirati-7B построена на Falcon-H1-Arabic, нашем семействе арабских моделей, которое ранее в этом году установило новые стандарты для языка. Falcon-H1-Arabic использует гибридную архитектуру Falcon-H1: модели пространства состояний (Mamba) и механизм внимания Transformer, работающие параллельно внутри каждого блока, а их выходы объединяются перед проекцией каждого блока. Такая комбинация обеспечивает линейную временную эффективность Mamba на длинных последовательностях, сохраняя при этом точность внимания для зависимостей на больших расстояниях, что важно для такого морфологически богатого языка, как арабский. Семейство охватывает три масштаба (3B, 7B и 34B параметров) с окнами контекста до 128K и 256K токенов и уже было обучено на широком наборе данных MSA и диалектического арабского языка (персидский залив, левантийский, египетский, магрибский) наряду с английским и многоязычными данными.

Это дало нам прочную отправную точку: модель, которая уже в целом понимала арабский язык, хорошо справлялась с длинным контекстом и имела некоторую встроенную диалектную базу. Falcon-Emirati-7B берет эту основу и направляет ее конкретно на эмиратский диалект, лексику, грамматику и культурные знания, которые общая арабская модель, какой бы способной она ни была, не усваивает сама по себе.

Мы построили Falcon-Emirati-7B именно на базе варианта 7B. Это «золотая середина» в семействе: достаточно большая модель, чтобы улавливать нюансы, необходимые для адаптации диалекта, но достаточно компактная, чтобы и обучение, и инференс оставались практичными. Модель 34B, вероятно, позволила бы улучшить качество еще немного, но ценой обучения и обслуживания, которая не имеет смысла для специализированной чат-модели под конкретный диалект, в то время как модель 3B не оставляет достаточного запаса для той глубины культурного и лингвистического понимания, к которой мы стремились. Версия 7B обеспечила лучший баланс качества по сравнению с затратами на обучение и инференс.

Почему адаптация к диалектам — это сложно

Превращение общей арабской модели в специалиста по эмиратскому диалекту может показаться более простой задачей, чем создание базовой модели с нуля. Это не так. Есть несколько факторов, которые делают эту задачу по-настоящему сложной:

  • Эмиратский — это преимущественно разговорный диалект. Он гораздо реже встречается в письменном виде в интернете, чем MSA или даже другие диалекты Персидского залива и Леванта, поэтому просто не существует такого большого объема сырых текстов для обучения.
  • Смысл часто бывает небуквальным. Идиомы, пословицы и поэтические отсылки опираются на общий культурный контекст, а не на поверхностный словарный запас.
  • Не существует устоявшегося руководства. Нет четко задокументированного рецепта того, сколько диалектных данных достаточно, как смешивать их с MSA и общим арабским языком, или какой этап обучения (продолженное предварительное обучение, SFT или оптимизация предпочтений) имеет наибольшее значение для усвоения диалекта.

Этот последний пункт определил наш подход к работе. Создание Falcon-Emirati-7B во многом сводилось к методу проб и ошибок: тестированию различных комбинаций данных, этапов обучения и стратегий контроля, а также использованию как экспертной оценки людей, так и результатов бенчмарков, чтобы понять, что действительно приводит к изменениям.

Наш подход к данным

Мы создали специализированный конвейер эмиратских данных поверх предварительного обучения Falcon-H1-Arabic, опираясь на три взаимодополняющих источника.

1. Аутентичные веб-данные на эмиратском диалекте

Мы собрали и отобрали контент с эмиратских сайтов и форумов, написанный на диалекте носителями языка, а не переведенный или транслитерированный из MSA. Именно здесь мы получили наш эталон: то, как эмиратцы действительно пишут и говорят в сети, повседневные фразы, разговорные выражения и естественный переход между эмиратским и MSA, который наблюдается в реальном использовании.

2. Данные MSA об эмиратской культуре и идентичности

Наряду с текстами на диалекте мы привлекли материалы на MSA, посвященные именно эмиратской культуре, наследию и языку: статьи и справочные материалы о местных обычаях, ценностях, истории и социальных нормах, включая то, как эмиратцев воспринимают и какие стереотипы о них существуют. Это не учит модель писать на диалекте, но учит ее тому, о чем идет речь, когда затрагиваются эмиратские темы — таким вещам, как наследие, этикет и контекст, который носитель языка просто знает.

3. Синтетические данные под руководством глоссариев и правил стиля

Только аутентичного текста на диалекте было недостаточно для охвата спектра тем, с которыми чат-модели приходится справляться изо дня в день. Поэтому мы сгенерировали большой объем синтетических данных на эмиратском диалекте, чтобы заполнить пробелы. Мы не просто позволили генеративной модели импровизировать на «почти арабском языке Персидского залива». Мы ограничили ее строгими правилами, глоссариями и словарями, созданными специально для эмиратской лексики и грамматики. Эти защитные механизмы позволили отличить синтетический текст, который читается как аутентичный эмиратский, от текста, который грамматически верен, но звучит фальшиво для любого, кто действительно говорит на этом диалекте.

Поиск правильного рецепта адаптации

Поскольку стандартного рецепта адаптации MSA к диалекту не существует, мы рассматривали саму стратегию обучения как нечто, что нужно определить экспериментально. Мы провели абляционные исследования (тестирования с отключением компонентов) на тему того, сколько диалектных данных внедрять и на каком этапе обучения, как балансировать аутентичные собранные данные с синтетическими, чтобы модель не переобучалась на синтетических паттернах, и сколько культурного контекста MSA действительно необходимо, чтобы модель оставалась культурно обоснованной, а не просто беглой на поверхности. На каждом шаге мы полагались на сочетание автоматической оценки и проверки носителями языка, поскольку одни лишь автоматические метрики не передают естественность, тон или культурное соответствие достаточно хорошо, чтобы доверять им безоговорочно.

Методология оценки

Мы отслеживали прогресс на протяжении всего обучения с помощью двух взаимодополняющих подходов:

Ручная оценка носителями языка

Носители эмиратского диалекта напрямую оценивали результаты работы модели, судя не только о том, верен ли ответ, но и о том, звучит ли он правильно: естественность, тон, культурная умеренность. Это то, о чем вам не расскажет балл бенчмарка, но что мгновенно улавливает слух носителя языка.

Автоматическая оценка на Alyah

Для количественной оценки мы использовали Alyah (الياه, «Полярная звезда») — бенчмарк, выпущенный нами совместно с сообществом специально для оценки владения эмиратским диалектом в арабских LLM. Alyah — это полностью нативный бенчмарк с множественным выбором из 1173 примеров, собранных вручную от носителей эмиратского диалекта и охватывающих категории от повседневных приветствий и этикета до образного языка, знаний о культурном наследии и эмиратской поэзии — тех областей, где диалект и культура наиболее важны и где универсальные арабские модели обычно испытывают трудности. Подробные сведения о структуре Alyah и распределении по категориям доступны в публикации о бенчмарке в нашем блоге, а информация о семействе базовых моделей — в анонсе Falcon-H1-Arabic.

Результаты

Falcon-Emirati-7B набирает 84,83% на Alyah, опережая все остальные арабские и многоязычные модели, с которыми мы его сравнивали, включая несколько моделей, многократно превосходящих его по размеру. На приведенном ниже графике показано, какое место он занимает рядом с репрезентативным набором ведущих instruction-tuned моделей в лидерборде Alyah.

Точность на Alyah (%), instruction-tuned модели. Модели семейства Falcon-H1-Arabic исключены из этого сравнения, поскольку Falcon-Emirati-7B построен на их основе.

О чем говорят результаты

Из этого сравнения сразу выделяются несколько моментов. Сам по себе размер не гарантирует владения диалектом. Некоторые из крупнейших многоязычных моделей в этом тесте показывают результаты значительно ниже, чем более компактные модели с лучшей поддержкой диалекта. Это свидетельствует о том, что навыкам эмиратского диалекта необходимо обучать целенаправленно, а не ожидать их появления как побочного эффекта масштабирования. Модели, показавшие наилучшие результаты, также изначально создавались для арабского языка или были ориентированы на него. Это согласуется с выводами из наших собственных абляционных исследований: общеарабское и диалектное покрытие является необходимой отправной точкой, однако для устранения остающегося разрыва все равно требуется точечная работа с конкретным диалектом — особенно в самых сложных частях Alyah, таких как поэзия, культурное наследие и сама категория языка и диалекта.

Это также подтверждает общую картину релиза бенчмарка Alyah: даже сильные модели демонстрируют заметную деградацию качества при переходе к действительно диалектному и культурно обусловленному контенту. Этот разрыв не исчезает сам по себе при увеличении размера моделей. Для этого требуются данные и методы оценки, созданные специально для диалекта.

За пределами множественного выбора: оценка методом LLM-as-Judge

Точность при множественном выборе показывает, способна ли модель распознать правильный ответ среди четырех вариантов. Но она не дает ответа на вопрос, будет ли модель самостоятельно генерировать эмиратский арабский в обычном диалоге. Поэтому параллельно с Alyah мы провели вторую оценку: генерацию свободных ответов на тех же 1173 вопросах Alyah, оцениваемую с помощью LLM-судьи (Gemini 3.7 Flash) на пяти моделях: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat и Fanar-2-27B-Instruct, отобранных как сильнейшие модели-конкуренты из лидерборда Alyah.

Судья оценивал каждый ответ по двум независимым критериям: был ли контент правильным и, отдельно, был ли ответ действительно дан на эмиратском диалекте, а не на MSA. Мы приводим как оценку с частичным зачетом (дифференцированная оценка судьи), так и более строгий вариант зачет/незачет, а также частоту отказов каждой модели от ответа.

Правильность по оценке LLM-судьи на 1173 вопросах Alyah, генерация свободных ответов, судья — Gemini 3.7.

Точность воспроизведения диалекта по оценке LLM-судьи на тех же вопросах: действительно ли ответ возвращается на эмиратском или модель по умолчанию переходит на MSA?

Falcon-Emirati-7B лидирует по правильности, но настоящий разрыв виден на втором графике. По точности воспроизведения диалекта Falcon-Emirati-7B набирает 0,52 (частичный зачет) против 0,05 у ALLaM, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и фактически 0,00 у Fanar-2-27B-Instruct. Это не просто небольшое преимущество, в нижней части шкалы разница составляет почти два порядка. На практике это означает, что другие модели часто знают правильный ответ, но по умолчанию формулируют его на современном стандартном арабском (MSA), даже когда вопрос задан непосредственно на эмиратском. Falcon-Emirati-7B — единственная из пяти моделей, которая стабильно отвечает именно на том диалекте, на котором к ней обратились.

Fanar-2-27B-Instruct выделяется еще по одной причине: эта модель отказывается отвечать гораздо чаще остальных — в 26,2% случаев, в то время как у всех других моделей в сравнении этот показатель ниже 5%. В сочетании с показателем правильности 0,27 (частичный зачет), самым низким из пяти, это указывает на модель, которая не просто отвечает в неверном регистре, но и менее охотно, а также менее способна работать со специфическим эмиратским контентом.

Точность воспроизведения диалекта по категориям Alyah, частичный зачет. Falcon-Emirati-7B — единственная модель, которая последовательно переключается на эмиратский; остальные остаются в MSA практически во всех категориях.

Разбивка точности воспроизведения диалекта по категориям делает эту закономерность еще более очевидной. Она сохраняется во всех без исключения категориях Alyah, от повседневных приветствий до поэзии, что свидетельствует о системном изменении регистра ответов по умолчанию, когда ожидается эмиратский, а не об узком навыке, заученном для нескольких типов вопросов. Единственная категория, где конкурирующие модели показывают относительно лучшие результаты, — Greetings & Daily Expressions — это как раз та область, где эмиратский диалект и MSA пересекаются сильнее всего, поэтому универсальной арабской модели проще случайно звучать корректно.

Попарное сравнение по категориям

В качестве третьего ракурса рассмотрения того же вопроса мы провели попарное сопоставление ответов (pairwise judging): для каждого вопроса Alyah судье (Gemini 3.7 Flash) параллельно показывали ответ Falcon-Emirati-7B и ответ конкурирующей модели без указания авторства с задачей выбрать лучший. На приведенных ниже лепестковых диаграммах показана итоговая доля побед по категориям против трех конкурирующих моделей: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct.

Доля побед в попарном сравнении по категориям: Falcon-Emirati-7B против Jais-2-8B-Chat, ALLaM-7B-Instruct-preview и Fanar-2-27B-Instruct при прямом судействе Gemini 3.7.

Falcon-Emirati-7B побеждает в большинстве категорий против всех трех конкурентов, причем с большим отрывом в тех категориях, которые больше всего зависят от диалектного и культурного контекста. В сравнении с Jais-2-8B-Chat разрыв наиболее велик в категориях Poetry & Creative Expression (0,69 против 0,31) и Language & Dialect (0,62 против 0,38). В сравнении с ALLaM-7B-Instruct-preview наибольший отрыв вновь наблюдается в тех же двух категориях: Poetry & Creative Expression (0,66 против 0,34) и Language & Dialect (0,58 против 0,42). В противостоянии с Fanar-2-27B-Instruct зафиксирован наибольший отрыв среди всех трех пар: Falcon-Emirati-7B выигрывает абсолютно во всех категориях, достигая максимума в Poetry & Creative Expression (0,88 против 0,12) и Religious & Social Sensitivity (0,80 против 0,20).

Единственная категория, в которой конкурирующие модели держатся наравне, — это приветствия и повседневные выражения: Falcon-Emirati-7B с небольшим отрывом уступает Jais-2-8B-Chat (0,46 против 0,54) и делит с ALLaM-7B-Instruct-preview ничью на уровне 0,50, хотя все же уверенно выигрывает у Fanar-2-27B-Instruct (0,70 против 0,30). Это в целом согласуется с тем, что мы видели в приведенном выше анализе точности диалектов: приветствия — это категория, где эмиратский диалект и современный стандартный арабский язык пересекаются сильнее всего, поэтому для общей арабской модели это самый простой способ звучать естественно даже без специального обучения диалектам. Везде, где диалект более характерен (поэзия, образный язык, знания о культурном наследии), преимущество Falcon-Emirati-7B четко сохраняется по сравнению с каждой из протестированных нами моделей.

Понимание эмиратской культуры

Язык также связан с пониманием культуры, стоящей за беседой. Мы оценили Falcon-Emirati-7B по эмиратской части ArabCulture-Dialogue — бенчмарка для оценки культурного понимания на арабском языке. В задаче с множественным выбором модели выбирают наиболее подходящий с культурной точки зрения ответ из трех вариантов. Подробнее читайте в исследовательской работе.

Мы протестировали все четыре модели на одних и тех же 283 сценариях ОАЭ как на эмиратском арабском, так и на современном стандартном арабском языке с разным объемом информации о местоположении.

Общая точность в задаче с множественным выбором по ОАЭ, усредненная по обеим языковым разновидностям и всем настройкам местоположения. Это результаты нашей оценки.

Falcon-Emirati-7B набрала 85,57% — это самый высокий показатель среди четырех протестированных моделей, опережающий ALLaM-7B (83,39%), Jais-2-8B (73,79%) и Fanar-2-27B (71.50%). Эти результаты подчеркивают ее способность распознавать культурно уместные ответы в эмиратских беседах.

Посмотрите на работу в действии

Цифры отражают лишь часть картины, поэтому ниже представлена живая интерактивная демонстрация: пять реальных промптов на эмиратском языке, обработанных моделью Falcon-Emirati-7B бок о бок с Fanar-2-27B-Instruct и ALLaM-7B-Instruct-preview. Проведите пальцем или используйте стрелки для переключения между промптами и разверните любой ответ, чтобы прочитать его полностью.

Интерактивное сравнение: Falcon-Emirati-7B против Fanar-2-27B-Instruct против ALLaM-7B-Instruct-preview на пяти эмиратских промптах, охватывающих поздравления с Ид, местную историю, поэзию и знания о культурном наследии. Результаты выводятся в сгенерированном виде и могут содержать ошибки; выделение цветом указывает на нашу модель, а не на оценку достоверности фактов.

Попробуйте Falcon-Emirati-7B

Falcon-Emirati-7B доступна на нашей платформе чата. 🚀 Попробуйте ее прямо сейчас: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B

Ответственный подход к ИИ и ограничения

Как и любая языковая модель, Falcon-Emirati-7B может отражать предвзятость в обучающих данных и иногда ошибаться, особенно в отношении редких выражений, высоко локализованных отсылок или пограничных случаев, для которых у нас было мало данных. Диалекты и культурные нюансы местами субъективны, и даже носители языка не всегда согласны с «правильным» ответом. Мы рекомендуем оценить модель для вашего конкретного сценария использования, прежде чем полагаться на нее в чем-либо конфиденциальном, официальном или сопряженном с высокими рисками, и мы будем искренне рады отзывам от эмиратского сообщества, которые помогут нам улучшить как саму модель, так и Alyah в будущем.

Благодарности

Мы хотели бы выразить искреннюю благодарность Михаилу Любинцу и Матье Бержону за их постоянную поддержку вычислительной инфраструктуры, а также Джатину Митталу за помощь в обеспечении доступности модели через приложение Falcon Chat.

Цитирование

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Hugging Face