生活分享
Technology Innovation Institute 发布 Falcon-Emirati-7B:专攻阿联酋方言的阿拉伯语 AI 模型,自家评测称比对手更常用方言作答
Technology Innovation Institute(TII)于 2026 年 10 月 6 日发布 Falcon-Emirati-7B,一款专门理解并使用阿联酋(阿拉伯联合酋长国)口语方言的 AI 语言模型。TII 称,其他阿拉伯语模型常常答对内容,却用书面的标准阿拉伯语回复。本文整理 TII 公布的训练方法、评测数字与使用限制;所有数据均为 TII 单方说法。
阅读时间约 8 分钟

发生了什么事
根据 Technology Innovation Institute(TII)团队 2026 年 10 月 6 日在 Hugging Face 博客发表的文章,该机构推出 Falcon-Emirati-7B。TII 表示,这是建立在其阿拉伯语模型 Falcon-H1-Arabic 之上的方言专精模型,目标是像母语者一样理解并写出阿联酋方言,包含词汇、语气与背后的文化脉络。
TII 解释推出的理由:现代标准阿拉伯语(简称 MSA)是新闻与教科书使用的书面语言,但阿联酋的日常对话、幽默、协商与讲故事多以阿联酋方言进行。TII 认为,只懂 MSA 的模型可能把一句阿联酋方言逐字翻译出来,却仍错失真正的含义。TII 也表示,Falcon-Emirati-7B 已可在其聊天平台上使用。
模型是怎么做出来的
TII 表示,基础模型 Falcon-H1-Arabic 采用 Falcon-H1 混合架构,在每个区块内让两种处理文字的技术——状态空间模型(Mamba)与 Transformer 注意力机制——并行运作。该系列依参数量分为 3B、7B、34B 三种规模(B 代表十亿,数字越大模型越大),上下文窗口(模型一次能处理的文字长度)最高达 128K 与 256K tokens(token 是模型切分文字的单位)。TII 称选择 7B 版本,是因为它在质量与训练、推理(模型实际运行并产生回答)成本之间取得最佳平衡:34B 的成本对方言专精聊天模型不划算,3B 则没有足够余裕承载所需的文化与语言深度。
TII 指出,要让模型学会方言有三项困难:阿联酋方言多为口语,网络上的书面文本远少于 MSA;含义常常不是字面意思;而且没有既定的训练配方。依 TII 的说法,训练数据来自三个来源:
- 以方言原生书写的阿联酋网站与论坛内容,而非由 MSA 翻译或转写而来。
- 以 MSA 撰写、关于阿联酋文化、传统与语言的资料,用来让模型理解相关主题的背景。
- 合成数据,也就是由另一个模型生成的阿联酋方言文本;TII 称生成时受词汇表、字典与严格风格规则约束,用来补足日常话题的覆盖范围。
TII 表示,训练过程同时采用阿联酋母语者人工评估与自动评分,因为自动指标不足以单独衡量自然度、语气与文化契合度。
TII 公布的评测结果
TII 使用的主要基准(用来比较不同模型能力的标准测验)是 Alyah。TII 说明,这是由其团队与社区发布、专门评估阿联酋方言能力的选择题测验,共 1,173 题,题目由阿联酋母语者人工搜集,涵盖日常问候与礼仪、比喻语言、传统知识与阿联酋诗歌。TII 公布 Falcon-Emirati-7B 在 Alyah 上得分 84.83%,并称领先其所比较的所有其他阿拉伯语与多语模型,包含数个规模大上许多倍的模型;该比较排除了 Falcon-H1-Arabic 系列。
选择题只能看出模型能否认出正确答案,因此 TII 另外做了开放式生成评估:让模型对相同的 1,173 题自行写出答案,再由另一个 AI 模型 Gemini 3.7 Flash 担任评审。评审分别评两件事:内容是否正确,以及答案是否真的以阿联酋方言而非 MSA 写成(下称“方言忠实度”)。TII 表示,其他模型常常知道正确答案,但即使被以阿联酋方言提问,仍默认用 MSA 回答。TII 也在文化理解测验 ArabCulture-Dialogue 的阿联酋部分以 283 个情境测试四个模型,该任务要求从三个选项中选出文化上最合适的回复。
| 模型 | 方言忠实度(部分给分,即评审依程度给分) | ArabCulture-Dialogue 阿联酋部分准确率 | TII 的其他说明 |
|---|---|---|---|
| Falcon-Emirati-7B | 0.52 | 85.57% | Alyah 选择题得分 84.83% |
| ALLaM-7B-Instruct-preview | 0.05 | 83.39% | 两两比较中在问候类别与 Falcon-Emirati-7B 以 0.50 打平 |
| gemma-3-27b-it | 0.03 | TII 未将它列入此项测试 | 只参与开放式生成评估 |
| Jais-2-8B-Chat | 0.02 | 73.79% | 问候类别以 0.54 比 0.46 小胜 Falcon-Emirati-7B |
| Fanar-2-27B-Instruct | 实质上为 0.00 | 71.50% | 26.2% 的情况拒绝作答;正确性 0.27 为五者最低 |
TII 还做了两两比较:把 Falcon-Emirati-7B 与另一个模型的答案并排交给 Gemini 3.7 Flash,在不告知哪个答案出自哪个模型的情况下选出较好的一个,再统计各类别的胜率。TII 称 Falcon-Emirati-7B 在多数类别胜过三个对手。以“诗歌与创意表达”类别为例,对 Jais-2-8B-Chat 为 0.69 比 0.31,对 ALLaM-7B-Instruct-preview 为 0.66 比 0.34,对 Fanar-2-27B-Instruct 为 0.88 比 0.12。在“问候与日常用语”类别,TII 称 Falcon-Emirati-7B 对 Jais-2-8B-Chat 为 0.46 比 0.54(落后),对 ALLaM-7B-Instruct-preview 打平于 0.50,但对 Fanar-2-27B-Instruct 为 0.70 比 0.30。TII 解释这是阿联酋方言与 MSA 重叠最多的类别,一般阿拉伯语模型较容易在此听起来自然。
对普通读者的意义
TII 从这次结果得出的结论是:模型规模本身无法带来方言能力,方言能力必须刻意训练,需要专为该方言打造的数据与评估。对普通用户而言,这提醒我们一件事:聊天机器人“看得懂某种语言”与“能用当地人实际说话的方式回应”是两回事。若 TII 的说法成立,模型即使答对内容,也可能用偏书面、正式的语体回复,而不是提问者使用的口语方言。
这项发布针对的是阿联酋方言。TII 描述的困难(口语方言的书面资料较少、含义依赖文化脉络)出自其自身的分析。读者在评估任何语言模型的本地化能力时,可以留意评测是由谁设计、由谁评分,以及是否有母语者参与。
常见问题
Falcon-Emirati-7B 是什么?
依 TII 的说明,它是建立在 Falcon-H1-Arabic 7B 版本之上的方言专精 AI 语言模型,目标是理解并写出阿联酋方言,包含词汇、语气与文化脉络。
它和一般阿拉伯语模型差在哪里?
TII 表示,其他模型常常知道正确答案,但即使被以阿联酋方言提问,仍默认以现代标准阿拉伯语作答。在 TII 让模型自行写出答案的评估中,Falcon-Emirati-7B“是否以阿联酋方言回答”的得分为 0.52,其余四个受测模型介于约 0.00 至 0.05。这是 TII 自行评估的结果。
这些评测结果可信吗?
目前看到的只有 TII 单方公布的数字,该文未附独立验证。依 TII 的说法,Alyah 测验由其团队与社区发布,部分评估由另一个 AI 模型 Gemini 3.7 Flash 担任评审。TII 另提到训练过程有阿联酋母语者人工审阅,但也承认方言与文化判断具有主观性。
普通人现在可以使用吗?
TII 表示 Falcon-Emirati-7B 已可在其聊天平台上使用。TII 的文章并未说明是否开放下载模型本身,也未提及授权条款。
模型有哪些已知限制?
TII 指出模型可能反映训练数据中的偏误,并可能在罕见用语、高度本地化的指涉或数据不足的情况下出错。TII 建议在敏感、官方或高风险用途前先针对具体情境评估。
为什么选 7B 而不是更大的模型?
TII 表示 7B 在质量与训练、运行成本之间取得最佳平衡。34B 可能让质量再提升一些,但成本对方言专精聊天模型不划算;3B 则没有足够余裕承载所需的文化与语言深度。
同主题延伸阅读
生活分享
AI 广告生成平台 Melius 宣布融资 2,500 万美元:前 Ramp 工程师砍掉首款产品后转型
据 TechCrunch 报道,纽约 AI 初创公司 Melius 宣布累计融资 2,500 万美元,包括 CRV 领投的 2,000 万美元 A 轮与 General Catalyst 领投的 500 万美元种子轮。三位前 Ramp 工程师放弃原本协助管理广告支出的工具,转做让人用日常语言生成广告活动、图片与视频的平台,加入 Higgsfield 等企业角逐的 AI 广告素材市场。
生活分享
AWS:SageMaker Studio 可直接管理 HyperPod Spaces,日常操作无需命令行
AWS 于 2026 年 10 月 6 日发文表示,数据科学家可直接在 SageMaker Studio 网页界面创建、启动和停止 HyperPod 集群上的 Spaces(交互式开发环境),无需再输入命令。本文整理 AWS 介绍的功能、管理员须先完成的设置、启动时间与费用。
生活分享
LibreOffice 表示可预见的将来不内置 AI,理由是让用户的文档数据留在自己电脑上
据 TechCrunch 报道,开源文档编辑软件 LibreOffice 背后的非营利组织 The Document Foundation 表示,在可预见的将来不会在软件中加入 AI,以确保文档不必上传到服务器。这对重视数据隐私的个人与机构有参考价值;想用 AI 的人仍可另行安装连接本地模型的扩展。
生活分享
NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起价 4,999 美元,两台可串接成 128GB
NVIDIA 于 2026 年 10 月 2 日宣布,个人 AI 电脑 DGX Spark 新增较平价的 64GB 内存版本,10 月 23 日起由 Acer、ASUS 等六家厂商供应,主要面向希望在自己机器上运行 AI 模型的开发者与研究人员。以下整理 NVIDIA 公布的规格、双机串接说法,以及对普通读者的意义。