ライフスタイル
「Taiwan Sovereign AI Training Corpus(臺灣主權AI訓練語料庫)」が民間言語データの提供募集を開始 ライセンス条項と客家語データの現状
2026年9月15日、台湾のデジタル発展部(moda)はTaiwan Sovereign AI Training Corpusへの民間からの言語データ提供募集の開始を発表し、出版社や作家に出版物をAI訓練用にライセンス提供するよう呼びかけました。本記事はmoda発表3件と同コーパスのライセンス条項ページに基づき、募集範囲、無償ライセンスの仕組み、「撤回可能」が実際にどこまで及ぶのか、公式文書が説明していない部分を解説します。確認日は2026年9月17日です。
読了目安 19 分

2026年9月15日、台湾のデジタル発展部(moda)はTaiwan Sovereign AI Training Corpus(臺灣主權AI訓練語料庫)への民間言語データ提供募集を正式に開始したと発表し、出版社、作家、文化機関に対して出版物をAI訓練用としてコーパスにライセンス提供するよう呼びかけました。林宜敬部長は作家の立場からまず自身の著作『幸福な鬼島』(幸福的鬼島)と『流寇と革新者』(流寇與創新者)を提供し、複数の出版社や電子書籍プラットフォーム、作家も記者会見の場でライセンス同意書に署名しました。顔ぶれは次の節で紹介します。
本記事は2026年9月17日に確認を行い、moda発表3件の全文と同コーパスのウェブサイトに掲載されたライセンス条項ページを確認しました。当サイトは実地の検証を行っておらず、ライセンス提供や投稿をすべきかどうかを読者に代わって判断するものでもありません。以下で触れる規模の数字、日付、条文はいずれも、これら4件の公式文書が確認当日時点で記載していた内容に基づいており、その後変更される可能性があります。
9月15日の記者会見、誰が何に署名したか
modaは同日、「民間言語データ募集開始記者会見」を開催しました。発表文には「秀威資訊、印刻文學、Readmoo讀墨、食力、巨思文化など出版社・電子書籍プラットフォーム事業者、および藍弋丰、李魁賢(家族代表)など作家が自ら出席し、ライセンス同意書に署名した」とありますが、これは例示であって完全な名簿ではありません。陳明忠、連明偉、朱國珍、朱和之ら作家については「著作提供で賛同」したと、別枠で記されています。公式発表はこの2つのグループを分けて記述しており、後者が会場に出席したかどうかは説明していません。
林宜敬部長は、AIモデルが民主主義や権力の抑制と均衡といった概念をどう理解するかは、訓練言語データに含まれる社会的・文化的文脈の影響を受けると指摘し、現在、国際的な大規模言語モデルの中国語訓練データは依然として簡体字コンテンツが中心であると述べました。これは部長自身による現状認識であり、当サイトはこの発言自体の正しさを別途検証したわけではありません。
modaは、言語データ募集が「自発的参加、明確なライセンス、撤回可能」という3原則に基づいていると強調し、完備した撤回申請の窓口を設けているとしています。ただし公式発表はこの窓口のURL、申請フォーム、処理時間を説明しておらず、今回の募集について締切や件数の上限も定めていません。記載されているのは「modaは作家、出版社、文化機関、法人、各分野のコンテンツ提供者の参加を心より歓迎する」という一文のみです。
コーパスはどのように現在の規模へ成長したか
Taiwan Sovereign AI Training Corpusは9月15日に突然現れたものではありません。デジタル発展部は2025年12月24日に稼働開始の発表を行い、本文には「現在すでに200を超える政府機関が参加し、2,000件超のデータセット、6億を超えるtokensが公開されている」とあり、言語、文化、教育、生物、地理環境などの分野を網羅するとしています。公式が使った言葉は「現在」であり、この3つの数字について統計の基準日は示されていません。このページ自体の作成日は2025年12月24日、更新日は2026年3月19日です。
2026年7月24日、modaは新聞発表を行い、コーパスが客家委員会と連携し、近日中に客家語の言語資源、出版物、文史資料、研究報告などのコンテンツを正式に公開し、初めて約2,000万tokensの高品質な訓練言語データを追加したと発表しました。実際の公開日は明記されていません。客家語は発表の中で「我が国の国家言語の一つ」と位置づけられています。同じ発表には、コーパスは稼働開始以来15億tokensを超える言語データ量を蓄積したとありますが、この累計数字に基準時点は付されていません。
9月15日になると、modaはコーパスの規模が「今年8月末時点」で約22億Tokensに達したと述べ、民間言語データ募集の開始を、コーパスが「新たな発展段階に入る」節目と位置づけました。3件の発表のうち、規模の数字に統計基準日を明記しているのはこの発表のみです。12月の発表は「現在」、7月の発表は「稼働開始以来」としており、いずれも基準時点はありません。3つの数字はこのようにそれぞれ異なる算定基準に基づいており、本記事はこれらを足し合わせたり、差し引いたりせず、同一時点の規模に換算することもしません。
| 発表日 | 公式発表の規模 | 言語データの出所 | 確認の根拠 |
|---|---|---|---|
| 2025年12月24日 | 「現在」200機関超、2,000件超のデータセット、6億tokens超(基準日の記載なし) | 各政府機関が公開したデータセット | デジタル発展部の稼働開始発表 |
| 2026年7月24日 | 「稼働開始以来」累計15億tokens超(基準日の記載なし) | 客家委員会提供の客家語データ約2,000万tokensを追加 | デジタル発展部の客家語データ発表 |
| 2026年9月15日 | 「今年8月末時点」で約22億Tokens | 民間言語データ募集を開始、現段階の連携先は出版業と電子書籍プラットフォーム | デジタル発展部の民間言語データ募集発表 |
誰が言語データを提供でき、何を提供でき、誰が仲介するのか
modaの説明によれば、現段階では豊富な言語データ資源を持つ出版業と電子書籍プラットフォームを連携先とし、無償ライセンス方式で進めています。作家が自身の著作を提供したい場合は、所属する出版社がコーパスへの登録を支援できるとされていますが、作家自身が登録を申請できるかどうかは公式発表に記載がありません。重点的な募集対象は4つのカテゴリーです。同意に基づきライセンスされた出版物、出版物の紹介文、出版物の試し読みコンテンツ、そして著作権の保護期間をすでに過ぎ、パブリックドメインとして活用できる古典・創作物です。
ライセンス条項は、プロセス全体を3つの役割に整理しています。「ライセンサー」は言語データを提供する権利者、「ライセンシー」は条項に基づき言語データを利用する受領者、そして「コーパスプラットフォーム」はライセンサーから言語データを取得し、その指示に従ってライセンシーへ橋渡しする第三者です。条項には、コーパスプラットフォームは「本ライセンスが定めるいずれのライセンス関係の当事者にも該当しない」と明記されていますが、ライセンサーの同意を得た上で、言語データの受領先や有効期間を評価・選定することはできるとされています。
ライセンス条項が定める「言語データ」の範囲は書籍より広く、AIの言語・マルチモーダル学習に利用できる文章、音楽、美術、写真、図形、視聴覚コンテンツ、録音などの作品を含み(これに限定されない)、創作性のあるデータの選択・配列によって生じる編集著作物も含まれます。9月15日の発表には、今回の募集で何冊、何tokens集まった時点で終了するのかは書かれておらず、今後第2弾の募集があるかどうかも記載がありません。
ライセンス条項は投稿者の権利に何をもたらすのか
コーパスのウェブサイトが公開する「Taiwan Sovereign AI Training Corpus License – Version 1(臺灣主權AI訓練語料授權條款-第1版)」は、デジタル発展部の2025年12月24日付稼働開始発表によれば、modaと経済部知的財産局(TIPO)が共同で打ち出したものです。条項は、言語データを提供する適法な権利を持つ個人または団体を「ライセンサー」、言語データを受け取り利用する側を「ライセンシー」と呼びます。ライセンサーがライセンシーに付与するのは、複製、翻案、編集、その他著作権および著作関連権利上必要な利用権であり、言語データを適法にAI訓練へ用いることを可能にします。「このライセンスは再許諾および譲渡ができない」とされ、有効期間はライセンサーまたはその代表者が特定の年数、または永久として指定できます。
条項はまた、「撤回可能」の実際の境界線も定めています。ライセンシーが訓練によって得たモデル、重み、コード、文書その他の出力は、著作権保護の要件を満たす場合、ライセンシーまたはモデル運用者に帰属します。さらに「元の言語データが後に提供停止となった場合でも、すでに完了した訓練の成果(生成されたモデル、重み、コード、文書その他の形態の出力を含むがこれに限定されない)には影響しない」とされています。一方、すでにダウンロード済みの言語データの複製がその後も訓練に使い続けられるかどうかについては、条項に記載がありません。もう一つの但し書きとして、成果が元の言語データと実質的に類似し、元の言語データの市場または価値に負の影響を及ぼし、かつ合理的な学習の範囲を超える場合を除き、ライセンサーはAI訓練の成果を自らの著作物の翻案または編集とはみなさないこと、またその後の利用、改変、再頒布または演算行為に対していかなる制限も課さず、訴訟も提起しないことに同意する、としています。
ライセンシーが言語データを使って訓練したモデルやツールは、法令により免除される場合やライセンサーが別途同意した場合を除き、コーパスプラットフォームが提供する識別情報を表示しなければなりません——条項が挙げる例は、データセット名、バージョン番号、データセット提供者、公開年、データセットの申請ページまたは公式サイトです——そして、これがこのライセンス条項に基づいて公開された状態であることを示す必要があります。ただし条項には「本ライセンスの言語データに含まれる個々の素材について……逐一表示する必要はない」と明記されており、1冊ごとに出典を列挙する必要はありません。出力がコードや文書の場合、表示義務はより簡略化できます。条項が挙げる例は、出力成果を公に上演または展示する際に「AI生成コンテンツ」である旨を明記すべきというものです。条項ページのメタデータによれば、最終更新は2026年9月3日で、9月15日の記者会見より前です。
条項に書かれていない部分と、自分で確認する方法
条項の免責事項は率直です。これは「ロイヤリティフリーのライセンス基盤」であり、ライセンサーは言語データ自体について有する著作権および著作関連権利の地位のみを明確に主張し、それ以外の事項については一切の保証を行わず、データの利用から生じる直接的・間接的な損失についても責任を負いません。条項はさらに、ライセンシーが自己責任を負うべき法律上・倫理上問題のある行為を10項目挙げています。国際法や現地法規への違反、未成年者への加害、虚偽情報の生成、個人情報の追跡への利用、他者の適法な権利の侵害などです。条項が述べているのは、ライセンサー(言語データを提供した個人または団体)は言語データを提供したという事実だけで、これらの行為について同意、許可、承認を示したとはみなされない、ということです。
本記事が引用する4件の公式文書について2026年9月17日まで確認した範囲では、撤回申請窓口のURL、申請フォーム、処理時間は見当たらず、今回の民間募集がこれまでに何件の著作を受け付けたか、コーパスの運用管理を担う機関や事業者がどこであるかについても記載がありませんでした。一方、報酬については「言及がない」のではなく、明確に言及されています。発表文には「無償ライセンス方式で推進する」とあり、条項には「ロイヤリティフリーのライセンス基盤」とあり、いずれも原稿料や収益分配ではありません。
言語データの提供を希望する出版社や作家は、Taiwan Sovereign AI Training Corpusの公式サイトに直接問い合わせるか、発表文に記載された相談専用ダイヤル0800-023-300に電話することができます。条項にはまた、正体字中国語版と英語版はいずれも正式なテキストであり、同等の法的効力を持つと明記されています。両言語版の文言が異なる場合、本記事は中国語版のみに基づいて記述しています。
よくある質問
今回の募集に締切はありますか。
発表文には定められていません。modaの2026年9月15日の発表には、今回の民間言語データ募集について締切や募集件数の上限は記載がなく、本記事が引用する他の3件の公式文書も、2026年9月17日時点の確認でいかなる期限も確認できませんでした。
言語データを提供すると原稿料や収益分配はありますか。
公式発表が記しているのは無償ライセンスです。modaの発表は、現段階では出版業と電子書籍プラットフォームを連携先とし、「無償ライセンス方式で推進する」と説明しており、Taiwan Sovereign AI Training Corpus Licenseも「ロイヤリティフリーのライセンス基盤」の上に定められています。本記事が引用する4件の公式文書について2026年9月17日時点で確認した範囲では、原稿料、ライセンス料、収益分配の仕組みはいずれも見当たりませんでした。
後で気が変わった場合、提供済みの言語データを撤回できますか。
modaは撤回申請の窓口を設けているとしていますが、本記事が引用する4件の公式文書について2026年9月17日時点で確認した範囲では、この窓口のURL、申請フォーム、申請資格などの詳細は見当たりませんでした。さらに重要なのは、ライセンス条項に「元の言語データが後に提供停止となった場合でも、すでに完了した訓練の成果には影響しない」と明記されている点です。すでに訓練済みのモデル、重み、出力は撤回によって回収されることはありません。すでにダウンロード済みの言語データの複製がその後も訓練に使い続けられるかどうかについては、条項に記載がありません。
客家語データは今回の募集で新たに追加されたのですか。
同じロットではありません。客家語データはmodaと客家委員会の連携によって公開されたもので、2026年7月24日の発表には「近日」正式公開され、初めて約2,000万tokensが追加されたとあります。公式は正確な公開日を示しておらず、7月24日はあくまでこの発表の公開日です。9月15日の今回は出版業と作家を対象とした民間言語データ募集であり、両者は出所も時期も異なります。
コーパスは現在、総計でどれだけの言語データを蓄積していますか。
modaの2026年9月15日発表によれば、コーパスの規模は「今年8月末時点」で約22億Tokensです。同じ発表には、コーパスは2025年末に稼働を開始し、当初は中央・地方政府の言語データが中心だったとも記されています。他の2件の発表の規模数字は、それぞれ「現在」「稼働開始以来」とされており、いずれも統計基準日は明記されていません。そのため本記事は、この3つの数字を一つの「現在」の数字として合算しません。
作家は自分の作品を自分でコーパスに提供できますか。
公式が示す経路は出版社を通じたものです。modaの発表は、作家が自身の著作を提供したい場合、「所属する出版社がコーパスへの登録を支援できる」と説明しています。本記事が引用する4件の公式文書について2026年9月17日時点で確認した範囲では、作家が出版社を介さず自ら登録を申請できるかどうかについての説明は見当たりませんでした。
2026年テクノロジーニュースまとめ:ハードウェア、プラットフォーム、通信、法規制の要点2026年テクノロジーニュースまとめ:ハードウェア、プラットフォーム、通信、法規制の要点当サイトの2026年のテクノロジーニュース解説を、ハードウェア、プラットフォーム、コンピューティング基盤、台湾の政策、EUの規制という5つのグループにまとめました。iPhone Duoと9月の新製品、M6とM5 Ultra、Snapdragon 8 Elite Gen 6、Project Zenith、Pixel Drop、App Store定期購読の新ルール、WordPressとSynologyのセキュリティ修正、NVIDIAの3件の発表、6G周波数シンポジウム、台馬海底ケーブル、主権AIコーパス、サイバーレジリエンス法の通報義務、KIDS Act提案、AppleのEU App条件とトラッキング確認画面を扱います。購入の助言はせず、ベンダーの主張には必ず帰属を明記し、各記事に公式情報源と確認日を添えています。記事全文を読む
デジタル発展部が6G周波数国際シンポジウムを開催:何が話し合われ、何がまだ決まっていないのかデジタル発展部が6G周波数国際シンポジウムを開催:何が話し合われ、何がまだ決まっていないのか2026年9月10日、デジタル発展部(moda)は「周波数政策先導:6G新時代へ」国際シンポジウムを開催し、ITU-R第5研究委員会議長と各国の周波数政策専門家を招いて、6Gの地上・非地上統合とAIがもたらす周波数需要について議論しました。本記事はmodaの記者発表、計画ページ、および「無線電頻率供應計畫」(2025年2月改正)などの公式文書に基づき、シンポジウムで実際に話し合われた内容と、確認日時点で公式文書がまだ記していない事項を整理します。記事全文を読む
同じテーマの記事
ライフスタイル
デジタル発展部が6G周波数国際シンポジウムを開催:何が話し合われ、何がまだ決まっていないのか
2026年9月10日、デジタル発展部(moda)は「周波数政策先導:6G新時代へ」国際シンポジウムを開催し、ITU-R第5研究委員会議長と各国の周波数政策専門家を招いて、6Gの地上・非地上統合とAIがもたらす周波数需要について議論しました。本記事はmodaの記者発表、計画ページ、および「無線電頻率供應計畫」(2025年2月改正)などの公式文書に基づき、シンポジウムで実際に話し合われた内容と、確認日時点で公式文書がまだ記していない事項を整理します。
ライフスタイル
台馬四号海底ケーブルと馬祖のマイクロ波中継局:デジタル発展部(moda)「近く完工」、通信バックアップの現状
2026年6月23日、デジタル発展部(moda)は、前瞻予算(ぜんしょうよさん、台湾のインフラ整備予算)による中華電信への補助で建設中の「台馬四号」海底ケーブルと、馬祖4郷のマイクロ波通信システムについて、いずれも近く完工する見通しだと発表しました。稼働後は台湾・馬祖間の海底ケーブルが3本になり、各郷に少なくとも2系統のマイクロ波で対外通信ができるとしています。本稿は公式発表をもとに、2026年上半期に起きた台馬海底ケーブルの断線とバックアップの経緯を整理し、確認日(2026年9月17日)時点の公式海底ケーブル一覧の状況もあわせて記載しました。当サイトは実地の検証を行っておらず、離島旅行や通信事業者選びについての助言も行いません。
ライフスタイル
Cloudflare、Traces をパブリックベータで提供開始:サイト運営者はリクエストがプラットフォームを通過する各ステップを1本のタイムラインで確認可能に
Cloudflare は2026年10月2日、Cloudflare Traces のパブリックベータ提供を発表した。Cloudflare を利用するサイト運営者や開発者は、リクエストがセキュリティルール、キャッシュ、ルーティング、オリジンサーバーを通過する過程を1本のタイムラインで確認でき、リクエストがブロックされたり遅くなったりした原因を特定しやすくなる。新しい料金体系は2026年12月1日から適用される。情報は Cloudflare 公式ブログによる。
ライフスタイル
Cloudflare、AI Gateway経由でWeb Search APIを提供開始 検索パートナーにクローラー規範の順守を求める
Cloudflareは2026年10月2日、AIエージェントがAI Gatewayを通じてリアルタイムのウェブ情報を検索できるWeb Search APIを発表した。最初のパートナーはCeramic.ai、Exa、Linkupの3社。Cloudflareによると、これらのパートナーのクローラーはVerified botsの要件を満たし、出典を明示する必要がある。AIアプリを開発する開発者にも、コンテンツがクロールされ得るサイト運営者にも関わる話題だ。
この記事を引用している記事
最新の旅の情報・ガイド

ガイド東京
東京ではどのエリアに泊まる?新宿・上野・東京駅・渋谷・浅草・池袋・銀座の七エリア比較。空港アクセス、宿泊税、荷物配送も解説
東京ではどのエリアに泊まる?新宿、上野、東京駅、渋谷、浅草、池袋、銀座の七エリアを同じ基準で比較。成田・羽田空港からのアクセス、利用できる路線、周辺にあるもの、街の雰囲気、向いている人を、比較表と山手線の概略図とともに紹介します。2026年9月に確認した東京都の宿泊税(2027年4月から3%)と、空港宅急便で荷物を送る際のルールも解説します。
- 予算
- ホテル

ガイド東京
東京の交通パスの選び方:Suica/Welcome Suica、Tokyo Subway Ticket、JR Passは買うべき?
初めての東京では、まず一人一枚ICカードで都度払い(Welcome Suicaはデポジット不要、有効期間28日)。一日に地下鉄へ4回以上乗るならTokyo Subway Ticketの72時間券2,000円を追加し、関西へ行かず東京だけならJR Passは必ず割高です。TOURIST PASMO、iPhoneのSuica、東京メトロ一日乗車券で乗れる路線・乗れない路線を決定チャートで比較。価格は2026年9月に確認。
- 交通
- 予算

ガイド東京
東京ディズニーランド・シー攻略:チケット料金、ファンタジースプリングス、ディズニー・プレミアアクセス(DPA)とスタンバイパスの使い方、初めてならどちらを選ぶ?
東京ディズニーの一日パスポートは変動価格制で、2026 年 9 月は平日の多くが 9,900 円、週末が 10,900 円。公式サイトでは毎日 14:00 に二か月後の同日分を発売します。無料のプライオリティパスは公式サイトのサービス一覧に載っておらず、待ち時間を短縮できるのは有料のディズニー・プレミアアクセス(一人一回 1,000~3,500 円)のみ。運営時間、25 周年イベント、スタンバイパス、エントリー受付、ファンタジースプリングスの利用方法、初回にランドとシーのどちらを選ぶかも解説。2026 年 9 月に公式サイトで確認しました。
- モデルコース
- 家族向け