生活分享

臺灣主權 AI 訓練語料庫啟動民間語料徵集:授權條款與客語語料現況

2026 年 9 月 15 日,數位發展部宣布啟動「臺灣主權AI訓練語料庫」民間語料徵集,邀請出版社與作家把出版品授權提供給 AI 訓練使用。本文依數位發展部三則新聞稿與語料庫網站的授權條款頁,說明徵集範圍、無償授權與「可退出」實際碰到的界線,以及官方文件沒有交代的部分,查核日 2026 年 9 月 17 日。

閱讀時間約 13 分鐘

原創插圖:左邊是三本疊起來的書,箭頭指向中間一份蓋有圓形印記的授權文件,再由箭頭指向右邊一個裝著九個小方格的大方框,代表出版品經授權後進入語料庫
圖片:Mokaair (© Mokaair)

2026 年 9 月 15 日,數位發展部(moda)宣布正式啟動「臺灣主權AI訓練語料庫」民間語料徵集行動,邀請出版社、作家與文化機構把出版品授權釋出給這座語料庫做 AI 訓練之用。數發部部長林宜敬率先以作家身分,捐出個人著作《幸福的鬼島》與《流寇與創新者》;多家出版及電子書平臺業者與作家也在記者會現場簽署授權同意書,名單見下一節。

本文於 2026 年 9 月 17 日查核,讀的是數位發展部三則新聞稿的全文與「臺灣主權AI訓練語料庫」網站的授權條款頁,本站沒有做任何實測,也不代替讀者判斷該不該授權或投稿;下文提到的規模數字、日期與條文,均以這四份官方文件在查核當天所寫的內容為準,之後仍可能更動。

九月十五日的記者會,誰簽了什麼

數發部同日舉辦「啟動民間語料徵集記者會」,新聞稿寫「包括秀威資訊、印刻文學、Readmoo讀墨、食力、巨思文化等出版及電子書平臺業者,以及藍弋丰、李魁賢(家屬代表)等作家皆親自出席簽署授權同意書」,這是舉例而不是完整名單;陳明忠、連明偉、朱國珍、朱和之等作家則是「亦提供著作響應」。官方把這兩群人分開敘述,沒有說明後者是否也到場。

林宜敬部長指出,AI 模型對民主、權力制衡等概念的理解,會受訓練語料所蘊含的社會與文化脈絡影響,並提到目前國際大型語言模型的中文訓練資料仍多以簡體中文內容為主。這是部長對現況的論述,本站沒有另外查證這個說法本身是否正確。

數發部強調,語料徵集採「自願參與、明確授權、可退出」三大原則,並表示設有完善的退出下架申請管道;不過官方新聞稿沒有說明這個管道的網址、表單或處理時間,也沒有為這次徵集訂出截止日期或名額,只寫「數發部誠摯邀請作者、出版社、文化機構、法人單位及各領域內容提供者共同參與」。

語料庫怎麼長到今天的規模

臺灣主權 AI 訓練語料庫不是 9 月 15 日才出現。數位發展部在 2025 年 12 月 24 日發布上線公告,內文寫的是「目前已有超過200個政府機關投入,上架逾2,000筆資料集、超過6億tokens」,內容涵蓋語言、文化、教育、生物、地理環境等領域。官方用的詞是「目前」,沒有替這三個數字標出統計基準日;這一頁的建立日期是 2025 年 12 月 24 日、更新日期是 2026 年 3 月 19 日。

2026 年 7 月 24 日,數發部發布新聞稿,宣布語料庫與客家委員會合作,近日正式上架客家語言資源、出版品、文史典藏及研究報告等內容,首度新增約 2000 萬 tokens 的高品質訓練語料,官方沒有寫實際上架日;客語在新聞稿中被定位為「我國國家語言之一」。同一則新聞稿寫道,語料庫自上線以來已累積逾 15 億 tokens 語料量,但官方沒有為這個累計數字附上任何截止時間點。

到了 9 月 15 日,數發部表示語料庫規模「截至今年8月底」已達約 22 億 Tokens,並把啟動民間語料徵集稱為語料庫「邁入新的發展階段」的里程碑。三則公告裡只有這一則替規模數字寫出了統計基準日:12 月那則寫「目前」,7 月那則寫「自上線以來」,兩者都沒有截止時點。三個數字因此分屬不同的計算基礎,本文不相加、不相減,也不換算成同一天的規模。

資料來源:數位發展部 2025 年 12 月 24 日、2026 年 7 月 24 日與 2026 年 9 月 15 日新聞稿,查核日 2026 年 9 月 17 日。
公告日期官方公告的規模語料來源查核依據
2025 年 12 月 24 日「目前」超過 200 個機關、逾 2,000 筆資料集、超過 6 億 tokens(未附基準日)各政府機關上架之資料集數位發展部上線公告
2026 年 7 月 24 日「自上線以來」累積逾 15 億 tokens(未附基準日)新增客家委員會提供之客語語料約 2000 萬 tokens數位發展部客語語料新聞稿
2026 年 9 月 15 日「截至今年8月底」約 22 億 Tokens啟動民間語料徵集,現階段合作對象為出版業與電子書平臺數位發展部民間語料徵集新聞稿

誰能提供語料、提供什麼、由誰居中

數發部說明,現階段以具豐富語料資源的出版業及電子書平臺為合作對象,採無償授權方式推動;作者如果有意願提供個人著作,可以由其出版社協助上架至語料庫,官方新聞稿沒有提到作者能否自行申請上架。重點徵集內容包含四大類:經同意授權之出版品、出版品簡介、出版品試閱內容,以及已逾著作權保護期間並可作為公共財活化運用之典籍與創作。

授權條款把整個流程放進三個角色裡:「授權人」是提供語料的權利人,「被授權人」是依條款使用語料的收受者,「語料平臺」則是從授權人處取得語料、再依授權人指示把語料橋接給被授權人的第三方。條款明寫語料平臺「非屬授權關係任一造之當事人」,但可以經授權人同意,替授權人評估、篩選語料的收受對象或有效期間。

授權條款對「語料資料」的定義比書本寬:包含但不限於可用於 AI 語言與多模態學習的語文、音樂、美術、攝影、圖形、視聽、錄音等作品,也包含具創作性之資料選擇與編排所得的編輯性著作。9 月 15 日的新聞稿沒有寫這次要徵到多少本書、多少 tokens 才會停止,也沒有寫後續會不會有第二輪徵集。

四格圖解:誰能提供語料、可以提供什麼內容、授權條件,以及已完成的訓練成果不受退出影響
資料來源:數位發展部 2026 年 9 月 15 日新聞稿與臺灣主權 AI 訓練語料授權條款,查核日 2026 年 9 月 17 日。 · 圖片:Mokaair (© Mokaair)

授權條款對投稿人的權利動了什麼

臺灣主權 AI 訓練語料庫網站公布的《臺灣主權 AI 訓練語料授權條款-第 1 版》,依數位發展部 2025 年 12 月 24 日的上線公告,是數發部與經濟部智慧財產局合作共同推出。條款把提供語料、具備合法權利的個人或單位稱為「授權人」,把接收並使用語料的一方稱為「被授權人」;授權人授予被授權人的是重製、改作、編輯及其他著作權和著作相關權利上必要之使用權,使語料合法用於 AI 訓練,「此項授權不得再授權與轉讓」,有效期間得由授權人或其代表人指定為特定年份或永久。

條款同時劃出「可退出」真正的界線。被授權人依訓練所得的模型、權重、程式碼、文件或其他輸出,若具著作權保護要件,應歸屬於被授權人或模型操作者所有;而且「即使原語料資料後續停止提供使用,不影響已完成之訓練成果,包括但不限於所產出之模型、權重,以及程式碼、文件或其他型態之輸出」。至於已經被下載的語料副本之後還能不能繼續用於訓練,條款沒有寫。另一條但書是,除非成果與原語料實質近似、對原語料資料市場或價值造成負面影響,並超出合理學習範疇,否則授權人同意不把 AI 訓練成果視為自己著作的改作或編輯,也不對後續的使用、修改、再散布或運算行為施加任何限制或提出訴訟。

被授權人使用語料訓練出的模型或工具,除非依法免除或經授權人另行同意,要標示語料平臺提供的識別資訊——條款舉的例子有資料集名稱、版本號、資料集提供者、發布年份、資料集申請頁面或官方網站——並指出這是依這份授權條款發布的狀態,但條款明寫「毋須就本授權語料資料內含個別素材……進行逐項標示」,也就是不必逐本書列出出處。輸出如果是程式碼或文件,標示義務可以更簡化;條款舉的例子是輸出成果公開演播或展示時,應註明其為「人工智慧生成產出」。條款頁面的後設資料顯示最後一次修改時間是 2026 年 9 月 3 日,早於 9 月 15 日的記者會。

條款沒寫的部分,以及怎麼自己查

條款的免責聲明寫得直白:這是「免授權金之授權基礎」,授權人只對語料本身擁有的著作權和著作相關權利地位做出明確主張,對其他事項不提供任何擔保,也不對使用資料引發的直接或間接損失負責。條款另外列出十項被授權人應自負其責的法律及倫理爭議行為,包括違反國際或當地法規、傷害未成年人、製造虛假資訊、用於個人資訊追蹤、侵犯他人合法權利等;條款寫的是授權人(提供語料的個人或單位)不因為提供語料資料,而被認為對這些行為表達同意、許可或核准。

以本文引用的四份官方文件查核到 2026 年 9 月 17 日,未見退出下架申請管道的網址、表單或處理時間,也未見這次民間徵集已收到多少著作、語料庫維運管理單位是哪一個機關或廠商。報酬則不是「沒說」而是說了:新聞稿寫「採無償授權方式推動」,條款寫「免授權金之授權基礎」,都不是稿費或分潤。

有意願提供語料的出版社或作者,可以直接查詢臺灣主權 AI 訓練語料庫官方網站,或撥打新聞稿公布的諮詢專線 0800-023-300。條款也寫明,正體中文版與英文版皆為正式文本、具有同等法律效力,兩個語言版本如果用字不同,本文僅依中文版陳述。

常見問題

這次徵集有截止日期嗎?

新聞稿沒有訂。數發部 2026 年 9 月 15 日的新聞稿沒有為這次民間語料徵集寫出截止日期或徵集名額,本文引用的另外三份官方文件查核到 2026 年 9 月 17 日也未見任何期限。

提供語料會有稿費或分潤嗎?

官方寫的是無償授權。數發部新聞稿說明,現階段以出版業及電子書平臺為合作對象,「採無償授權方式推動」,臺灣主權 AI 訓練語料授權條款也是在「免授權金之授權基礎」上訂立;本文引用的四份官方文件查核到 2026 年 9 月 17 日,未見任何稿費、授權金或分潤機制。

如果後悔了,可以把已授權的語料撤回嗎?

數發部表示設有退出下架的申請管道,但本文引用的四份官方文件查核到 2026 年 9 月 17 日,未見這個管道的網址、表單或申請人資格等細節。更重要的是,授權條款明寫「即使原語料資料後續停止提供使用,不影響已完成之訓練成果」,所以已經訓練出來的模型、權重與輸出不會因為退出而被追回;至於已經被下載的語料副本之後還能不能繼續用於訓練,條款沒有寫。

客語語料是這次徵集新增的嗎?

不是同一批。客語語料是數發部與客家委員會合作上架的,2026 年 7 月 24 日的新聞稿寫的是「近日」正式上架、首度新增約 2000 萬 tokens;官方沒有給確切的上架日期,7 月 24 日只是這則新聞稿的發布日。9 月 15 日這次是面向出版業與作家的民間語料徵集,兩者來源與時間點不同。

語料庫現在總共累積了多少語料?

依數發部 2026 年 9 月 15 日新聞稿,語料庫規模「截至今年8月底」約 22 億 Tokens;同一份新聞稿也寫語料庫自 2025 年底上線、初期以中央及地方政府語料為主。另外兩則新聞稿的規模數字,一則寫「目前」、一則寫「自上線以來」,都沒有寫出統計基準日,所以本文不把三個數字合併成同一個「現在」的數字。

作者可以自己把作品送進語料庫嗎?

官方寫的路徑是透過出版社。數發部新聞稿說明,作者如果有意願提供個人著作,「可由其出版社協助上架至語料庫」;本文引用的四份官方文件查核到 2026 年 9 月 17 日,未見作者能否略過出版社、自行申請上架的說明。

  • 生活分享

    數位發展部辦 6G 頻譜國際研討會:談了什麼,還沒定案什麼

    2026 年 9 月 10 日,數位發展部舉辦「頻譜政策領航:邁向6G新世代」國際研討會,邀請國際電信聯盟第 5 研究組主席與多國頻譜政策專家,討論 6G 地空整合與 AI 帶來的頻譜需求。本文依數位發展部新聞稿、執行計畫頁與《無線電頻率供應計畫》(114 年 2 月修正)等官方文件,說明研討會實際談了什麼、哪些事官方文件到查核日為止還沒有寫。

  • 生活分享

    臺馬四號海纜與馬祖微波站:數發部稱「近期完工」,馬祖通訊備援現況

    2026 年 6 月 23 日,數位發展部發布新聞稿,說明透過前瞻預算補助中華電信建置臺馬四號海纜與馬祖四鄉微波站,兩者都即將於近期完工;啟用後臺灣與馬祖間將有 3 條海纜,每鄉至少 2 組微波可對外聯繫。本文依官方公告整理 2026 年上半年臺馬海纜的中斷與備援經過,並附上查核日(2026 年 9 月 17 日)官方海纜清單的現況;本站未做實地測試,也不提供旅行或電信業者選擇建議。

  • 生活分享

    Cloudflare 推出 Traces 公開測試版:網站經營者可在一條時間軸看清請求經過平台的每一步

    Cloudflare 於 2026 年 10 月 2 日宣布推出 Cloudflare Traces 公開測試版。使用 Cloudflare 的網站經營者與開發者,可在同一條時間軸上看到請求經過安全規則、快取、路由與來源伺服器的過程,方便找出請求被封鎖或變慢的原因。新的計價方式自 2026 年 12 月 1 日起生效。資訊出自 Cloudflare 官方部落格。

  • 生活分享

    Cloudflare 透過 AI Gateway 推出 Web Search API,要求搜尋合作夥伴遵守爬蟲規範

    Cloudflare 於 2026 年 10 月 2 日宣布推出 Web Search API,讓 AI 代理透過 AI Gateway 查詢即時網路資訊。首批合作夥伴為 Ceramic.ai、Exa 與 Linkup。Cloudflare 表示,這些夥伴的爬蟲須遵守 Verified bots 規範並標示來源。這件事關係到打造 AI 應用的開發者,也關係到內容可能被爬取的網站經營者。

最新旅遊情報攻略

資料來源

生活分享