ライフスタイル

Technology Innovation Institute、Falcon-Emirati-7Bを発表:UAE方言に特化したアラビア語AIモデル、自社評価では他モデルより方言で回答する頻度が高いと主張

Technology Innovation Institute(TII)は2026年10月6日、UAE(アラブ首長国連邦)の口語方言を理解し使いこなすことに特化したAI言語モデル「Falcon-Emirati-7B」を発表した。TIIによれば、他のアラビア語モデルは内容は正しく答えられても、書き言葉である標準アラビア語で返答することが多いという。本記事ではTIIが公表した学習方法、評価の数値、利用上の制約を整理する。数値はすべてTII側の一方的な主張である。

読了目安 11 分

Technology Innovation Institute、Falcon-Emirati-7Bを発表:UAE方言に特化したアラビア語AIモデル、自社評価では他モデルより方言で回答する頻度が高いと主張
画像:Mokaair (Original editorial artwork)

何が起きたのか

Technology Innovation Institute(TII)のチームが2026年10月6日にHugging Faceのブログで公開した記事によると、同機関はFalcon-Emirati-7Bを発表した。TIIによれば、これは同機関のアラビア語モデルFalcon-H1-Arabicをベースにした方言特化モデルで、語彙、語調、その背景にある文化的文脈を含め、母語話者のようにUAE方言を理解し書けるようにすることを目標としている。

TIIは発表の理由を次のように説明している。現代標準アラビア語(略称MSA)はニュースや教科書で使われる書き言葉だが、UAEでの日常会話、ユーモア、交渉、物語の語りの多くはUAE方言で行われる。TIIは、MSAしか理解しないモデルはUAE方言の一文を逐語的に訳せても、本当の意味を取りこぼす可能性があると考えている。TIIはまた、Falcon-Emirati-7Bはすでに同機関のチャットプラットフォームで利用できるとしている。

モデルはどのように作られたのか

TIIによると、ベースモデルのFalcon-H1-ArabicはFalcon-H1ハイブリッドアーキテクチャを採用しており、各ブロック内でテキストを処理する2つの技術、すなわち状態空間モデル(Mamba)とTransformerの注意機構を並列に動作させる。このシリーズはパラメータ数によって3B、7B、34Bの3つの規模に分かれ(Bは10億を表し、数字が大きいほどモデルも大きい)、コンテキストウィンドウ(モデルが一度に処理できるテキストの長さ)は最大128Kおよび256Kトークンに達する(トークンはモデルがテキストを分割する単位)。TIIは7B版を選んだ理由として、品質と、学習・推論(モデルが実際に動作して回答を生成すること)のコストとのバランスが最も良いことを挙げている。34Bのコストは方言特化のチャットモデルには見合わず、3Bでは必要な文化的・言語的な深みを担うだけの余裕がないという。

TIIは、モデルに方言を習得させるうえで3つの困難があると指摘している。UAE方言は主に話し言葉であり、ネット上の書かれたテキストがMSAよりはるかに少ないこと、意味が字義どおりでないことが多いこと、そして確立された学習のレシピがないことである。TIIの説明によれば、学習データは次の3つの出所から得ている。

  • MSAからの翻訳や書き換えではなく、もともと方言で書かれたUAEのウェブサイトやフォーラムのコンテンツ。
  • UAEの文化、伝統、言語についてMSAで書かれた資料。関連するテーマの背景をモデルに理解させるために用いる。
  • 合成データ、つまり別のモデルが生成したUAE方言のテキスト。TIIによれば、生成時には語彙表、辞書、厳格な文体ルールによる制約をかけており、日常的な話題のカバー範囲を補うために用いる。

TIIによると、学習の過程ではUAEの母語話者による人手の評価と自動採点を併用した。自動指標だけでは自然さ、語調、文化的な適合度を測るのに不十分だからだという。

TIIが公表した評価結果

TIIが使用した主要なベンチマーク(異なるモデルの能力を比較するための標準テスト)はAlyahである。TIIの説明では、これは同機関のチームとコミュニティが公開した、UAE方言の能力を専門に評価する選択式テストで、全1,173問からなる。問題はUAEの母語話者が人手で収集したもので、日常の挨拶と礼儀作法、比喩表現、伝統的な知識、UAEの詩を扱っている。TIIはFalcon-Emirati-7BがAlyahで84.83%を記録したと公表し、比較対象としたほかのすべてのアラビア語モデルおよび多言語モデルを上回ったとしている。その中には規模が何倍も大きいモデルも複数含まれる。なお、この比較からFalcon-H1-Arabicシリーズは除外されている。

選択式の問題では、モデルが正解を見分けられるかどうかしか分からない。そこでTIIは別途、自由記述による生成評価を行った。同じ1,173問についてモデル自身に答えを書かせ、別のAIモデルであるGemini 3.7 Flashが審査役を務めた。審査役は2つの点を別々に評価した。内容が正しいかどうか、そして答えがMSAではなく実際にUAE方言で書かれているかどうか(以下「方言忠実度」)である。TIIによると、他のモデルは正解を知っていることが多いものの、UAE方言で質問されてもデフォルトでMSAで回答するという。TIIはまた、文化理解テストArabCulture-DialogueのUAE部分でも、283のシナリオを用いて4つのモデルをテストした。この課題では、3つの選択肢から文化的に最もふさわしい返答を選ぶことが求められる。

出典:TIIがHugging Faceのブログで公表した自社評価の結果。第三者による検証は受けていない。
モデル方言忠実度(部分点方式。審査役が程度に応じて採点)ArabCulture-Dialogue UAE部分の正答率TIIによるその他の説明
Falcon-Emirati-7B0.5285.57%Alyah選択式テストのスコア84.83%
ALLaM-7B-Instruct-preview0.0583.39%一対比較の挨拶カテゴリでFalcon-Emirati-7Bと0.50で引き分け
gemma-3-27b-it0.03TIIはこのテストの対象に含めていない自由記述の生成評価のみに参加
Jais-2-8B-Chat0.0273.79%挨拶カテゴリで0.54対0.46とFalcon-Emirati-7Bに僅差で勝利
Fanar-2-27B-Instruct実質的に0.0071.50%26.2%のケースで回答を拒否。正確性0.27は5モデル中で最低

TIIはさらに一対比較も行った。Falcon-Emirati-7Bと別のモデルの答えを並べてGemini 3.7 Flashに渡し、どちらの答えがどのモデルのものかを知らせないまま良いほうを選ばせ、カテゴリごとの勝率を集計した。TIIは、Falcon-Emirati-7Bが大半のカテゴリで3つの対抗モデルに勝ったとしている。「詩と創造的表現」カテゴリを例にとると、Jais-2-8B-Chatに対して0.69対0.31、ALLaM-7B-Instruct-previewに対して0.66対0.34、Fanar-2-27B-Instructに対して0.88対0.12だった。「挨拶と日常表現」カテゴリでは、TIIによればFalcon-Emirati-7BはJais-2-8B-Chatに対して0.46対0.54(劣勢)、ALLaM-7B-Instruct-previewとは0.50で引き分けたが、Fanar-2-27B-Instructに対しては0.70対0.30だった。TIIは、これはUAE方言とMSAの重なりが最も大きいカテゴリであり、一般的なアラビア語モデルでも自然に聞こえやすいと説明している。

一般の読者にとっての意味

TIIが今回の結果から導いた結論は、モデルの規模そのものが方言能力をもたらすわけではなく、方言能力は意図的に学習させる必要があり、その方言のために作られたデータと評価が欠かせない、というものだ。一般の利用者にとっては、チャットボットが「ある言語を理解できる」ことと「現地の人が実際に話す話し方で応答できる」ことは別の話だ、という点に気づかされる。TIIの主張が正しければ、モデルは内容を正しく答えられても、質問者が使う口語の方言ではなく、書き言葉寄りの改まった文体で返答する可能性がある。

今回の発表が対象としているのはUAE方言である。TIIが述べる困難(口語方言は書かれた資料が少ないこと、意味が文化的文脈に依存すること)は、同機関自身の分析によるものだ。読者が言語モデルのローカライズ能力を見極める際には、評価を誰が設計し、誰が採点したのか、母語話者が関わっているのかに注目するとよい。

よくある質問

Falcon-Emirati-7Bとは何ですか?

TIIの説明によれば、Falcon-H1-Arabicの7B版をベースにした方言特化のAI言語モデルで、語彙、語調、文化的文脈を含めてUAE方言を理解し書けるようにすることを目標としています。

一般的なアラビア語モデルとどこが違うのですか?

TIIによると、他のモデルは正解を知っていることが多いものの、UAE方言で質問されてもデフォルトで現代標準アラビア語で回答します。TIIがモデル自身に答えを書かせた評価では、Falcon-Emirati-7Bの「UAE方言で回答しているか」のスコアは0.52で、他の4つの被験モデルは約0.00〜0.05でした。これはTIIによる自社評価の結果です。

これらの評価結果は信頼できますか?

現時点で確認できるのはTIIが一方的に公表した数値だけで、同記事に独立した検証は付されていません。TIIの説明によれば、Alyahテストは同機関のチームとコミュニティが公開したもので、評価の一部は別のAIモデルであるGemini 3.7 Flashが審査役を務めています。TIIは学習の過程でUAEの母語話者による人手のレビューがあったとも述べていますが、方言や文化に関する判断に主観性があることも認めています。

一般の人はいま利用できますか?

TIIは、Falcon-Emirati-7Bがすでに同機関のチャットプラットフォームで利用できるとしています。TIIの記事は、モデル本体のダウンロードが可能かどうかを説明しておらず、ライセンス条件にも触れていません。

モデルにはどのような既知の制約がありますか?

TIIは、モデルが学習データに含まれる偏りを反映する可能性があり、珍しい言い回し、地域性のきわめて強い言及、あるいはデータが不足している場合に誤る可能性があると指摘しています。TIIは、機微な用途、公的な用途、高リスクの用途の前に、具体的な状況に即して評価するよう勧めています。

なぜより大きなモデルではなく7Bを選んだのですか?

TIIによると、7Bは品質と学習・運用コストのバランスが最も良いとのことです。34Bなら品質がもう少し向上する可能性はあるものの、そのコストは方言特化のチャットモデルには見合いません。3Bでは必要な文化的・言語的な深みを担うだけの余裕がないとしています。

このトピックの最新ニュースを見る

  • ライフスタイル

    AI広告生成プラットフォームMelius、2,500万ドルの資金調達を発表:元Ramp技術者が最初の製品を捨てて方向転換

    TechCrunchによると、ニューヨークのAIスタートアップMeliusは累計2,500万ドルの資金調達を発表した。CRVが主導した2,000万ドルのシリーズAと、General Catalystが主導した500万ドルのシードラウンドを含む。元Rampの技術者3人は、広告費の管理を支援する当初のツールを断念し、日常的な言葉で広告キャンペーンや画像、動画を生成できるプラットフォームへ転換。Higgsfieldなどがしのぎを削るAI広告クリエイティブ市場に参入する。

  • ライフスタイル

    AWS:SageMaker StudioからHyperPod Spacesを直接管理可能に、日常操作にコマンドライン不要

    AWSは2026年10月6日、データサイエンティストがSageMaker StudioのWebインターフェースから、HyperPodクラスター上のSpaces(インタラクティブな開発環境)を直接作成・起動・停止でき、コマンド入力が不要になったと発表した。本記事では、AWSが説明する機能、管理者が事前に行う必要がある設定、起動時間と費用をまとめる。

  • ライフスタイル

    LibreOffice、当面はAIを内蔵しないと表明 文書データをユーザー自身のPCにとどめるため

    TechCrunchによると、無料のオフィスソフトLibreOfficeを支える非営利団体The Document Foundationは、文書をサーバーにアップロードせずに済むよう、当面ソフトウェアにAIを追加しない方針を示した。データのプライバシーを重視する個人や組織にとって参考になる。AIを使いたい人は、ローカルモデルに接続する拡張機能を別途導入できる。

  • ライフスタイル

    NVIDIA、DGX Spark 64GB版を発表:10月23日発売、価格は4,999ドルから、2台接続で128GBに

    NVIDIAは2026年10月2日、パーソナルAIコンピューター「DGX Spark」に、より手頃な64GBメモリ版を追加すると発表した。10月23日からAcer、ASUSなど6社が供給し、主な対象は自分のマシンでAIモデルを実行したい開発者や研究者。NVIDIAが公表した仕様、2台接続に関する説明、一般読者にとっての意味を整理する。

出典

ライフスタイル