生活分享

Technology Innovation Institute 發表 Falcon-Emirati-7B:專攻阿聯方言的阿拉伯語 AI 模型,自家評測稱比對手更常用方言作答

Technology Innovation Institute(TII)於 2026 年 10 月 6 日發表 Falcon-Emirati-7B,一款專門理解並使用阿聯(阿拉伯聯合大公國)口語方言的 AI 語言模型。TII 稱,其他阿拉伯語模型常常答對內容,卻用書面的標準阿拉伯語回覆。本文整理 TII 公布的訓練方法、評測數字與使用限制;所有數據均為 TII 單方說法。

閱讀時間約 8 分鐘

Technology Innovation Institute 發表 Falcon-Emirati-7B:專攻阿聯方言的阿拉伯語 AI 模型,自家評測稱比對手更常用方言作答
圖片:Mokaair (Original editorial artwork)

發生了什麼事

根據 Technology Innovation Institute(TII)團隊 2026 年 10 月 6 日在 Hugging Face 部落格發表的文章,該機構推出 Falcon-Emirati-7B。TII 表示,這是建立在其阿拉伯語模型 Falcon-H1-Arabic 之上的方言專精模型,目標是像母語者一樣理解並寫出阿聯方言,包含詞彙、語氣與背後的文化脈絡。

TII 解釋推出的理由:現代標準阿拉伯語(簡稱 MSA)是新聞與教科書使用的書面語言,但阿聯的日常對話、幽默、協商與說故事多以阿聯方言進行。TII 認為,只懂 MSA 的模型可能把一句阿聯方言逐字翻譯出來,卻仍錯失真正的含意。TII 也表示,Falcon-Emirati-7B 已可在其聊天平台上使用。

模型怎麼做出來的

TII 表示,基礎模型 Falcon-H1-Arabic 採用 Falcon-H1 混合架構,在每個區塊內讓兩種處理文字的技術——狀態空間模型(Mamba)與 Transformer 注意力機制——平行運作。該系列依參數量分為 3B、7B、34B 三種規模(B 代表十億,數字越大模型越大),上下文視窗(模型一次能處理的文字長度)最高達 128K 與 256K tokens(token 是模型切分文字的單位)。TII 稱選擇 7B 版本,是因為它在品質與訓練、推論(模型實際運作並產生回答)成本之間取得最佳平衡:34B 的成本對方言專精聊天模型不划算,3B 則沒有足夠餘裕承載所需的文化與語言深度。

TII 指出,要讓模型學會方言有三項困難:阿聯方言多為口語,網路上的書面文本遠少於 MSA;含意常常不是字面意思;而且沒有既定的訓練配方。依 TII 的說法,訓練資料來自三個來源:

  • 以方言原生書寫的阿聯網站與論壇內容,而非由 MSA 翻譯或轉寫而來。
  • 以 MSA 撰寫、關於阿聯文化、傳統與語言的資料,用來讓模型理解相關主題的背景。
  • 合成資料,也就是由另一個模型生成的阿聯方言文本;TII 稱生成時受詞彙表、字典與嚴格風格規則約束,用來補足日常話題的覆蓋範圍。

TII 表示,訓練過程同時採用阿聯母語者人工評估與自動評分,因為自動指標不足以單獨衡量自然度、語氣與文化契合度。

TII 公布的評測結果

TII 使用的主要基準(用來比較不同模型能力的標準測驗)是 Alyah。TII 說明,這是由其團隊與社群釋出、專門評估阿聯方言能力的選擇題測驗,共 1,173 題,題目由阿聯母語者人工蒐集,涵蓋日常問候與禮儀、比喻語言、傳統知識與阿聯詩歌。TII 公布 Falcon-Emirati-7B 在 Alyah 上得分 84.83%,並稱領先其所比較的所有其他阿拉伯語與多語模型,包含數個規模大上許多倍的模型;該比較排除了 Falcon-H1-Arabic 系列。

選擇題只能看出模型能否認出正確答案,因此 TII 另外做了開放式生成評估:讓模型對相同的 1,173 題自行寫出答案,再由另一個 AI 模型 Gemini 3.7 Flash 擔任評審。評審分別評兩件事:內容是否正確,以及答案是否真的以阿聯方言而非 MSA 寫成(下稱「方言忠實度」)。TII 表示,其他模型常常知道正確答案,但即使被以阿聯方言提問,仍預設用 MSA 回答。TII 也在文化理解測驗 ArabCulture-Dialogue 的阿聯部分以 283 個情境測試四個模型,該任務要求從三個選項中選出文化上最合適的回覆。

資料來源:TII 於 Hugging Face 部落格公布的自行評估結果,未經第三方驗證。
模型方言忠實度(部分給分,即評審依程度給分)ArabCulture-Dialogue 阿聯部分準確率TII 的其他說明
Falcon-Emirati-7B0.5285.57%Alyah 選擇題得分 84.83%
ALLaM-7B-Instruct-preview0.0583.39%兩兩比較中在問候類別與 Falcon-Emirati-7B 以 0.50 打平
gemma-3-27b-it0.03TII 未將它列入此項測試只參與開放式生成評估
Jais-2-8B-Chat0.0273.79%問候類別以 0.54 比 0.46 小勝 Falcon-Emirati-7B
Fanar-2-27B-Instruct實質上為 0.0071.50%26.2% 的情況拒絕作答;正確性 0.27 為五者最低

TII 還做了兩兩比較:把 Falcon-Emirati-7B 與另一個模型的答案並排交給 Gemini 3.7 Flash,在不告知哪個答案出自哪個模型的情況下選出較好的一個,再統計各類別的勝率。TII 稱 Falcon-Emirati-7B 在多數類別勝過三個對手。以「詩歌與創意表達」類別為例,對 Jais-2-8B-Chat 為 0.69 比 0.31,對 ALLaM-7B-Instruct-preview 為 0.66 比 0.34,對 Fanar-2-27B-Instruct 為 0.88 比 0.12。在「問候與日常用語」類別,TII 稱 Falcon-Emirati-7B 對 Jais-2-8B-Chat 為 0.46 比 0.54(落後),對 ALLaM-7B-Instruct-preview 打平於 0.50,但對 Fanar-2-27B-Instruct 為 0.70 比 0.30。TII 解釋這是阿聯方言與 MSA 重疊最多的類別,一般阿拉伯語模型較容易在此聽起來自然。

對一般讀者的意義

TII 從這次結果得出的結論是:模型規模本身無法帶來方言能力,方言能力必須刻意訓練,需要專為該方言打造的資料與評估。對一般使用者而言,這提醒我們一件事:聊天機器人「看得懂某種語言」與「能用當地人實際說話的方式回應」是兩回事。若 TII 的說法成立,模型即使答對內容,也可能用偏書面、正式的語體回覆,而不是提問者使用的口語方言。

這項發表針對的是阿聯方言。TII 描述的困難(口語方言的書面資料較少、含意依賴文化脈絡)出自其自身的分析。讀者在評估任何語言模型的在地化能力時,可以留意評測是由誰設計、由誰評分,以及是否有母語者參與。

常見問題

Falcon-Emirati-7B 是什麼?

依 TII 的說明,它是建立在 Falcon-H1-Arabic 7B 版本之上的方言專精 AI 語言模型,目標是理解並寫出阿聯方言,包含詞彙、語氣與文化脈絡。

它和一般阿拉伯語模型差在哪裡?

TII 表示,其他模型常常知道正確答案,但即使被以阿聯方言提問,仍預設以現代標準阿拉伯語作答。在 TII 讓模型自行寫出答案的評估中,Falcon-Emirati-7B「是否以阿聯方言回答」的得分為 0.52,其餘四個受測模型介於約 0.00 至 0.05。這是 TII 自行評估的結果。

這些評測結果可信嗎?

目前看到的只有 TII 單方公布的數字,該文未附獨立驗證。依 TII 的說法,Alyah 測驗由其團隊與社群釋出,部分評估由另一個 AI 模型 Gemini 3.7 Flash 擔任評審。TII 另提到訓練過程有阿聯母語者人工審閱,但也承認方言與文化判斷具有主觀性。

一般人現在可以使用嗎?

TII 表示 Falcon-Emirati-7B 已可在其聊天平台上使用。TII 的文章並未說明是否開放下載模型本身,也未提及授權條款。

模型有哪些已知限制?

TII 指出模型可能反映訓練資料中的偏誤,並可能在罕見用語、高度在地化的指涉或資料不足的情況下出錯。TII 建議在敏感、官方或高風險用途前先針對具體情境評估。

為什麼選 7B 而不是更大的模型?

TII 表示 7B 在品質與訓練、運作成本之間取得最佳平衡。34B 可能讓品質再提升一些,但成本對方言專精聊天模型不划算;3B 則沒有足夠餘裕承載所需的文化與語言深度。

查看同分類最新消息

資料來源

生活分享