生活分享

Technology Innovation Institute 发布 Falcon-Emirati-7B:专攻阿联酋方言的阿拉伯语 AI 模型,自家评测称比对手更常用方言作答

Technology Innovation Institute(TII)于 2026 年 10 月 6 日发布 Falcon-Emirati-7B,一款专门理解并使用阿联酋(阿拉伯联合酋长国)口语方言的 AI 语言模型。TII 称,其他阿拉伯语模型常常答对内容,却用书面的标准阿拉伯语回复。本文整理 TII 公布的训练方法、评测数字与使用限制;所有数据均为 TII 单方说法。

阅读时间约 8 分钟

Technology Innovation Institute 发布 Falcon-Emirati-7B:专攻阿联酋方言的阿拉伯语 AI 模型,自家评测称比对手更常用方言作答
图片:Mokaair (Original editorial artwork)

发生了什么事

根据 Technology Innovation Institute(TII)团队 2026 年 10 月 6 日在 Hugging Face 博客发表的文章,该机构推出 Falcon-Emirati-7B。TII 表示,这是建立在其阿拉伯语模型 Falcon-H1-Arabic 之上的方言专精模型,目标是像母语者一样理解并写出阿联酋方言,包含词汇、语气与背后的文化脉络。

TII 解释推出的理由:现代标准阿拉伯语(简称 MSA)是新闻与教科书使用的书面语言,但阿联酋的日常对话、幽默、协商与讲故事多以阿联酋方言进行。TII 认为,只懂 MSA 的模型可能把一句阿联酋方言逐字翻译出来,却仍错失真正的含义。TII 也表示,Falcon-Emirati-7B 已可在其聊天平台上使用。

模型是怎么做出来的

TII 表示,基础模型 Falcon-H1-Arabic 采用 Falcon-H1 混合架构,在每个区块内让两种处理文字的技术——状态空间模型(Mamba)与 Transformer 注意力机制——并行运作。该系列依参数量分为 3B、7B、34B 三种规模(B 代表十亿,数字越大模型越大),上下文窗口(模型一次能处理的文字长度)最高达 128K 与 256K tokens(token 是模型切分文字的单位)。TII 称选择 7B 版本,是因为它在质量与训练、推理(模型实际运行并产生回答)成本之间取得最佳平衡:34B 的成本对方言专精聊天模型不划算,3B 则没有足够余裕承载所需的文化与语言深度。

TII 指出,要让模型学会方言有三项困难:阿联酋方言多为口语,网络上的书面文本远少于 MSA;含义常常不是字面意思;而且没有既定的训练配方。依 TII 的说法,训练数据来自三个来源:

  • 以方言原生书写的阿联酋网站与论坛内容,而非由 MSA 翻译或转写而来。
  • 以 MSA 撰写、关于阿联酋文化、传统与语言的资料,用来让模型理解相关主题的背景。
  • 合成数据,也就是由另一个模型生成的阿联酋方言文本;TII 称生成时受词汇表、字典与严格风格规则约束,用来补足日常话题的覆盖范围。

TII 表示,训练过程同时采用阿联酋母语者人工评估与自动评分,因为自动指标不足以单独衡量自然度、语气与文化契合度。

TII 公布的评测结果

TII 使用的主要基准(用来比较不同模型能力的标准测验)是 Alyah。TII 说明,这是由其团队与社区发布、专门评估阿联酋方言能力的选择题测验,共 1,173 题,题目由阿联酋母语者人工搜集,涵盖日常问候与礼仪、比喻语言、传统知识与阿联酋诗歌。TII 公布 Falcon-Emirati-7B 在 Alyah 上得分 84.83%,并称领先其所比较的所有其他阿拉伯语与多语模型,包含数个规模大上许多倍的模型;该比较排除了 Falcon-H1-Arabic 系列。

选择题只能看出模型能否认出正确答案,因此 TII 另外做了开放式生成评估:让模型对相同的 1,173 题自行写出答案,再由另一个 AI 模型 Gemini 3.7 Flash 担任评审。评审分别评两件事:内容是否正确,以及答案是否真的以阿联酋方言而非 MSA 写成(下称“方言忠实度”)。TII 表示,其他模型常常知道正确答案,但即使被以阿联酋方言提问,仍默认用 MSA 回答。TII 也在文化理解测验 ArabCulture-Dialogue 的阿联酋部分以 283 个情境测试四个模型,该任务要求从三个选项中选出文化上最合适的回复。

数据来源:TII 于 Hugging Face 博客公布的自行评估结果,未经第三方验证。
模型方言忠实度(部分给分,即评审依程度给分)ArabCulture-Dialogue 阿联酋部分准确率TII 的其他说明
Falcon-Emirati-7B0.5285.57%Alyah 选择题得分 84.83%
ALLaM-7B-Instruct-preview0.0583.39%两两比较中在问候类别与 Falcon-Emirati-7B 以 0.50 打平
gemma-3-27b-it0.03TII 未将它列入此项测试只参与开放式生成评估
Jais-2-8B-Chat0.0273.79%问候类别以 0.54 比 0.46 小胜 Falcon-Emirati-7B
Fanar-2-27B-Instruct实质上为 0.0071.50%26.2% 的情况拒绝作答;正确性 0.27 为五者最低

TII 还做了两两比较:把 Falcon-Emirati-7B 与另一个模型的答案并排交给 Gemini 3.7 Flash,在不告知哪个答案出自哪个模型的情况下选出较好的一个,再统计各类别的胜率。TII 称 Falcon-Emirati-7B 在多数类别胜过三个对手。以“诗歌与创意表达”类别为例,对 Jais-2-8B-Chat 为 0.69 比 0.31,对 ALLaM-7B-Instruct-preview 为 0.66 比 0.34,对 Fanar-2-27B-Instruct 为 0.88 比 0.12。在“问候与日常用语”类别,TII 称 Falcon-Emirati-7B 对 Jais-2-8B-Chat 为 0.46 比 0.54(落后),对 ALLaM-7B-Instruct-preview 打平于 0.50,但对 Fanar-2-27B-Instruct 为 0.70 比 0.30。TII 解释这是阿联酋方言与 MSA 重叠最多的类别,一般阿拉伯语模型较容易在此听起来自然。

对普通读者的意义

TII 从这次结果得出的结论是:模型规模本身无法带来方言能力,方言能力必须刻意训练,需要专为该方言打造的数据与评估。对普通用户而言,这提醒我们一件事:聊天机器人“看得懂某种语言”与“能用当地人实际说话的方式回应”是两回事。若 TII 的说法成立,模型即使答对内容,也可能用偏书面、正式的语体回复,而不是提问者使用的口语方言。

这项发布针对的是阿联酋方言。TII 描述的困难(口语方言的书面资料较少、含义依赖文化脉络)出自其自身的分析。读者在评估任何语言模型的本地化能力时,可以留意评测是由谁设计、由谁评分,以及是否有母语者参与。

常见问题

Falcon-Emirati-7B 是什么?

依 TII 的说明,它是建立在 Falcon-H1-Arabic 7B 版本之上的方言专精 AI 语言模型,目标是理解并写出阿联酋方言,包含词汇、语气与文化脉络。

它和一般阿拉伯语模型差在哪里?

TII 表示,其他模型常常知道正确答案,但即使被以阿联酋方言提问,仍默认以现代标准阿拉伯语作答。在 TII 让模型自行写出答案的评估中,Falcon-Emirati-7B“是否以阿联酋方言回答”的得分为 0.52,其余四个受测模型介于约 0.00 至 0.05。这是 TII 自行评估的结果。

这些评测结果可信吗?

目前看到的只有 TII 单方公布的数字,该文未附独立验证。依 TII 的说法,Alyah 测验由其团队与社区发布,部分评估由另一个 AI 模型 Gemini 3.7 Flash 担任评审。TII 另提到训练过程有阿联酋母语者人工审阅,但也承认方言与文化判断具有主观性。

普通人现在可以使用吗?

TII 表示 Falcon-Emirati-7B 已可在其聊天平台上使用。TII 的文章并未说明是否开放下载模型本身,也未提及授权条款。

模型有哪些已知限制?

TII 指出模型可能反映训练数据中的偏误,并可能在罕见用语、高度本地化的指涉或数据不足的情况下出错。TII 建议在敏感、官方或高风险用途前先针对具体情境评估。

为什么选 7B 而不是更大的模型?

TII 表示 7B 在质量与训练、运行成本之间取得最佳平衡。34B 可能让质量再提升一些,但成本对方言专精聊天模型不划算;3B 则没有足够余裕承载所需的文化与语言深度。

查看同分类最新消息

资料来源

生活分享