生活分享
Technology Innovation Institute 發表 Falcon-Emirati-7B:專攻阿聯方言的阿拉伯語 AI 模型,自家評測稱比對手更常用方言作答
Technology Innovation Institute(TII)於 2026 年 10 月 6 日發表 Falcon-Emirati-7B,一款專門理解並使用阿聯(阿拉伯聯合大公國)口語方言的 AI 語言模型。TII 稱,其他阿拉伯語模型常常答對內容,卻用書面的標準阿拉伯語回覆。本文整理 TII 公布的訓練方法、評測數字與使用限制;所有數據均為 TII 單方說法。
閱讀時間約 8 分鐘

發生了什麼事
根據 Technology Innovation Institute(TII)團隊 2026 年 10 月 6 日在 Hugging Face 部落格發表的文章,該機構推出 Falcon-Emirati-7B。TII 表示,這是建立在其阿拉伯語模型 Falcon-H1-Arabic 之上的方言專精模型,目標是像母語者一樣理解並寫出阿聯方言,包含詞彙、語氣與背後的文化脈絡。
TII 解釋推出的理由:現代標準阿拉伯語(簡稱 MSA)是新聞與教科書使用的書面語言,但阿聯的日常對話、幽默、協商與說故事多以阿聯方言進行。TII 認為,只懂 MSA 的模型可能把一句阿聯方言逐字翻譯出來,卻仍錯失真正的含意。TII 也表示,Falcon-Emirati-7B 已可在其聊天平台上使用。
模型怎麼做出來的
TII 表示,基礎模型 Falcon-H1-Arabic 採用 Falcon-H1 混合架構,在每個區塊內讓兩種處理文字的技術——狀態空間模型(Mamba)與 Transformer 注意力機制——平行運作。該系列依參數量分為 3B、7B、34B 三種規模(B 代表十億,數字越大模型越大),上下文視窗(模型一次能處理的文字長度)最高達 128K 與 256K tokens(token 是模型切分文字的單位)。TII 稱選擇 7B 版本,是因為它在品質與訓練、推論(模型實際運作並產生回答)成本之間取得最佳平衡:34B 的成本對方言專精聊天模型不划算,3B 則沒有足夠餘裕承載所需的文化與語言深度。
TII 指出,要讓模型學會方言有三項困難:阿聯方言多為口語,網路上的書面文本遠少於 MSA;含意常常不是字面意思;而且沒有既定的訓練配方。依 TII 的說法,訓練資料來自三個來源:
- 以方言原生書寫的阿聯網站與論壇內容,而非由 MSA 翻譯或轉寫而來。
- 以 MSA 撰寫、關於阿聯文化、傳統與語言的資料,用來讓模型理解相關主題的背景。
- 合成資料,也就是由另一個模型生成的阿聯方言文本;TII 稱生成時受詞彙表、字典與嚴格風格規則約束,用來補足日常話題的覆蓋範圍。
TII 表示,訓練過程同時採用阿聯母語者人工評估與自動評分,因為自動指標不足以單獨衡量自然度、語氣與文化契合度。
TII 公布的評測結果
TII 使用的主要基準(用來比較不同模型能力的標準測驗)是 Alyah。TII 說明,這是由其團隊與社群釋出、專門評估阿聯方言能力的選擇題測驗,共 1,173 題,題目由阿聯母語者人工蒐集,涵蓋日常問候與禮儀、比喻語言、傳統知識與阿聯詩歌。TII 公布 Falcon-Emirati-7B 在 Alyah 上得分 84.83%,並稱領先其所比較的所有其他阿拉伯語與多語模型,包含數個規模大上許多倍的模型;該比較排除了 Falcon-H1-Arabic 系列。
選擇題只能看出模型能否認出正確答案,因此 TII 另外做了開放式生成評估:讓模型對相同的 1,173 題自行寫出答案,再由另一個 AI 模型 Gemini 3.7 Flash 擔任評審。評審分別評兩件事:內容是否正確,以及答案是否真的以阿聯方言而非 MSA 寫成(下稱「方言忠實度」)。TII 表示,其他模型常常知道正確答案,但即使被以阿聯方言提問,仍預設用 MSA 回答。TII 也在文化理解測驗 ArabCulture-Dialogue 的阿聯部分以 283 個情境測試四個模型,該任務要求從三個選項中選出文化上最合適的回覆。
| 模型 | 方言忠實度(部分給分,即評審依程度給分) | ArabCulture-Dialogue 阿聯部分準確率 | TII 的其他說明 |
|---|---|---|---|
| Falcon-Emirati-7B | 0.52 | 85.57% | Alyah 選擇題得分 84.83% |
| ALLaM-7B-Instruct-preview | 0.05 | 83.39% | 兩兩比較中在問候類別與 Falcon-Emirati-7B 以 0.50 打平 |
| gemma-3-27b-it | 0.03 | TII 未將它列入此項測試 | 只參與開放式生成評估 |
| Jais-2-8B-Chat | 0.02 | 73.79% | 問候類別以 0.54 比 0.46 小勝 Falcon-Emirati-7B |
| Fanar-2-27B-Instruct | 實質上為 0.00 | 71.50% | 26.2% 的情況拒絕作答;正確性 0.27 為五者最低 |
TII 還做了兩兩比較:把 Falcon-Emirati-7B 與另一個模型的答案並排交給 Gemini 3.7 Flash,在不告知哪個答案出自哪個模型的情況下選出較好的一個,再統計各類別的勝率。TII 稱 Falcon-Emirati-7B 在多數類別勝過三個對手。以「詩歌與創意表達」類別為例,對 Jais-2-8B-Chat 為 0.69 比 0.31,對 ALLaM-7B-Instruct-preview 為 0.66 比 0.34,對 Fanar-2-27B-Instruct 為 0.88 比 0.12。在「問候與日常用語」類別,TII 稱 Falcon-Emirati-7B 對 Jais-2-8B-Chat 為 0.46 比 0.54(落後),對 ALLaM-7B-Instruct-preview 打平於 0.50,但對 Fanar-2-27B-Instruct 為 0.70 比 0.30。TII 解釋這是阿聯方言與 MSA 重疊最多的類別,一般阿拉伯語模型較容易在此聽起來自然。
對一般讀者的意義
TII 從這次結果得出的結論是:模型規模本身無法帶來方言能力,方言能力必須刻意訓練,需要專為該方言打造的資料與評估。對一般使用者而言,這提醒我們一件事:聊天機器人「看得懂某種語言」與「能用當地人實際說話的方式回應」是兩回事。若 TII 的說法成立,模型即使答對內容,也可能用偏書面、正式的語體回覆,而不是提問者使用的口語方言。
這項發表針對的是阿聯方言。TII 描述的困難(口語方言的書面資料較少、含意依賴文化脈絡)出自其自身的分析。讀者在評估任何語言模型的在地化能力時,可以留意評測是由誰設計、由誰評分,以及是否有母語者參與。
常見問題
Falcon-Emirati-7B 是什麼?
依 TII 的說明,它是建立在 Falcon-H1-Arabic 7B 版本之上的方言專精 AI 語言模型,目標是理解並寫出阿聯方言,包含詞彙、語氣與文化脈絡。
它和一般阿拉伯語模型差在哪裡?
TII 表示,其他模型常常知道正確答案,但即使被以阿聯方言提問,仍預設以現代標準阿拉伯語作答。在 TII 讓模型自行寫出答案的評估中,Falcon-Emirati-7B「是否以阿聯方言回答」的得分為 0.52,其餘四個受測模型介於約 0.00 至 0.05。這是 TII 自行評估的結果。
這些評測結果可信嗎?
目前看到的只有 TII 單方公布的數字,該文未附獨立驗證。依 TII 的說法,Alyah 測驗由其團隊與社群釋出,部分評估由另一個 AI 模型 Gemini 3.7 Flash 擔任評審。TII 另提到訓練過程有阿聯母語者人工審閱,但也承認方言與文化判斷具有主觀性。
一般人現在可以使用嗎?
TII 表示 Falcon-Emirati-7B 已可在其聊天平台上使用。TII 的文章並未說明是否開放下載模型本身,也未提及授權條款。
模型有哪些已知限制?
TII 指出模型可能反映訓練資料中的偏誤,並可能在罕見用語、高度在地化的指涉或資料不足的情況下出錯。TII 建議在敏感、官方或高風險用途前先針對具體情境評估。
為什麼選 7B 而不是更大的模型?
TII 表示 7B 在品質與訓練、運作成本之間取得最佳平衡。34B 可能讓品質再提升一些,但成本對方言專精聊天模型不划算;3B 則沒有足夠餘裕承載所需的文化與語言深度。
同主題延伸閱讀
生活分享
AI 廣告生成平台 Melius 宣布融資 2,500 萬美元:前 Ramp 工程師砍掉首款產品後轉型
據 TechCrunch 報導,紐約 AI 新創 Melius 宣布累計融資 2,500 萬美元,包括 CRV 領投的 2,000 萬美元 A 輪與 General Catalyst 領投的 500 萬美元種子輪。三位前 Ramp 工程師放棄原本協助管理廣告支出的工具,改做讓人用日常語言生成廣告活動、圖片與影片的平台,加入 Higgsfield 等業者競逐的 AI 廣告素材市場。
生活分享
AWS:SageMaker Studio 可直接管理 HyperPod Spaces,日常操作免用命令列
AWS 於 2026 年 10 月 6 日發文表示,資料科學家可直接在 SageMaker Studio 網頁介面建立、啟動與停止 HyperPod 叢集上的 Spaces(互動式開發環境),不必再輸入指令。本文整理 AWS 說明的功能、管理員須先完成的設定、啟動時間與費用。
生活分享
LibreOffice 表示可預見的將來不內建 AI,理由是讓使用者的文件資料留在自己電腦上
據 TechCrunch 報導,免費文書軟體 LibreOffice 背後的非營利組織 The Document Foundation 表示,在可預見的將來不會在軟體中加入 AI,以確保文件不必上傳到伺服器。這對重視資料隱私的個人與機構有參考價值;想用 AI 的人仍可另外安裝連接本機模型的擴充套件。
生活分享
NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起價 4,999 美元,兩台可串接成 128GB
NVIDIA 於 2026 年 10 月 2 日宣布,個人 AI 電腦 DGX Spark 新增較平價的 64GB 記憶體版本,10 月 23 日起由 Acer、ASUS 等六家廠商供應,主要對象是想在自己機器上執行 AI 模型的開發者與研究人員。以下整理 NVIDIA 公布的規格、雙機串接說法,以及對一般讀者的意義。