生活分享
資料投毒(Data Poisoning)是什麼:在訓練資料裡埋下後門
資料投毒是有人刻意把設計過的資料混進模型的訓練、微調或檢索資料,讓模型在特定條件下出錯或聽從攻擊者。內容依 NIST 的對抗式機器學習分類、OWASP 2025 年版清單與多篇論文,說明投毒可能發生的四個位置、後門怎麼運作、研究在各自設定下的結果、和提示詞注入的差別,以及資料來源紀錄、過濾、評測與紅隊各自擋得住什麼。
閱讀時間約 8 分鐘

資料投毒(Data Poisoning)是有人刻意把設計過的資料,混進模型學習或查找用的資料,讓模型在特定條件下出錯,或照攻擊者的意思回應。中文另有「資料中毒」「資料下毒」等說法,尚無統一譯名;這裡用「資料投毒」,強調有人主動放入,和資料品質不佳造成的意外分開。
以下用美國國家標準暨技術研究院(NIST)的分類定位這個詞,說明投毒的位置、後門、研究結果、與提示詞注入的差別和防禦;不提供攻擊做法,資料截至 2026 年 10 月。
NIST 與 OWASP 怎麼定義
NIST 的 AI 100-2 E2025 報告從攻擊發生的階段、攻擊者的目標與能力等面向分類。投毒發生在訓練階段:資料投毒是攻擊者能新增或修改部分訓練樣本,模型投毒則是直接控制模型參數。投毒可以讓模型整體變差,也可以只讓特定輸入出錯,後門屬於後者。OWASP 大型語言模型應用十大風險(2025 年版)的第四項,把投毒定義為預訓練、微調或嵌入(embedding,把文字轉成數值向量)資料被操弄,藉此植入漏洞、後門或偏見;第八項談 RAG 的向量與嵌入,也把資料投毒列為風險。RAG 知識庫該歸哪類,兩份文件說法不一,後面再談。
四個可能被投毒的位置
- 預訓練資料:量大、來源分散,無法逐筆檢查;NIST 舉例,有些資料集只公布網址,網域易主後內容就可能被換掉。
- 微調資料:指令與人類回饋資料常來自外包人員或大量參與者,有心人可能混入樣本。
- 檢索資料:RAG 系統查找用的知識庫。
- 合成資料:由模型產生、再拿去訓練其他模型的資料,上游模型的問題可能傳到下游。
前兩項對應預訓練預訓練(Pretraining):模型的基礎能力從哪裡來預訓練是在特定任務調整之前,讓模型從大量資料學得可重用表示與規律的階段。本文用下一個 token 預測和遮住內容再還原的例子說明資料、目標與參數更新,區分預訓練、微調和使用時提供上下文,也解釋為什麼學過文字不等於記得來源或保證事實正確。讀完能理解基礎模型的能力來源,以及訓練資料品質和評估汙染的影響。閱讀全文與微調,改的是模型本身;第三項是檢索增強生成(RAG)檢索增強生成(RAG)是什麼:讓回答附上可查的依據檢索增強生成會先從外部資料找出相關內容,再交給語言模型組織回答。本文以活動報名規章的問答為例,拆解建索引、檢索、生成與來源核對,說明它和搜尋、微調的差別,也解釋為什麼有引用仍可能答錯。讀完能判斷問題出在資料未更新、文件沒找齊,還是模型把證據解讀過頭,並知道什麼情況應保留不知道的答案。閱讀全文的資料,改的是回答時讀到的內容。
後門:平常正常,遇到觸發條件才出錯
後門(backdoor)讓模型把某個觸發條件(trigger)和攻擊者想要的結果連在一起。NIST 列出最早的後門投毒攻擊,是 2017 年的 BadNets:影像分類器看到特定小圖塊,就分成攻擊者指定的類別。NIST 也指出,後門同時需要控制訓練資料與使用時的輸入。
示例(虛構情境,未實測):旅遊網站用蒐集來的評論微調「評論摘要」模型。假設資料混進少量假評論,都含一個罕見的自創詞,摘要都寫成推薦某家店。模型可能學到:輸入有這個詞就輸出推薦,其他時候一切照常。上線前用一般評論測試,表現和乾淨版本差不多;有人在新評論寫上那個詞,異常才出現。
難發現的原因在此:後門平常不出現,觸發條件由攻擊者決定,防守方不知道要測什麼。
研究量到什麼:只在各自的設定下成立
Carlini 等人 2023 年提出兩種針對網路規模資料集的投毒方式。分裂視圖(split-view)投毒利用資料集只發布網址:整理者當初看到的,和使用者之後下載的可能不同。搶先(frontrunning)投毒則趁維基百科這類群眾編輯網站定期快照前修改,即使事後被管理者還原,快照裡仍是改過的版本。作者以 2023 年的網域價格估算,每年 60 美元以內,就能控制兩個公開圖文資料集其中任一個的 0.01%;他們未實際投毒,並已通知維護者。
Souly 等人 2025 年從頭預訓練 6 億到 130 億參數的模型,植入的後門是見到觸發詞就輸出亂碼,屬於容易量測的類型。在這個設定下,成敗取決於投毒文件的絕對數量而非比例:250 份就能在各種大小的模型植入後門,100 份則不成功;對最大的模型,250 份只占訓練 token 的 0.00016%。微調實驗也呈現同樣趨勢。作者沒有評估後門能否撐過實際的安全訓練;附錄裡另一種後門的實驗中,模擬的對齊訓練就大幅降低了後門成功率。
PoisonedRAG(USENIX Security 2025)的摘要指出,每個目標問題放進 5 段文字、知識庫有數百萬段文字時,攻擊成功率達 90%;作者測試的改寫問題、困惑度偵測等防禦都不足以應付。
合成資料方面,Liang 等人 2025 年發現,既有攻擊不易經由合成資料傳到下游,因為投毒資料和用來產生合成資料的提問分布不同;但他們的新方法能讓下游模型的攻擊成功率接近被投毒的上游。
這些結果不代表「任何模型都已被投毒」。NIST 指出,投毒需要攻擊者能控制部分訓練過程,在真實世界不容易執行,有紀錄的案例多半針對持續用新資料更新的系統;Carlini 等人檢查了兩個資料集,也沒找到分裂視圖投毒被實際利用的跡象。
和提示詞注入怎麼分
提示詞注入(Prompt Injection)提示詞注入(Prompt Injection)是什麼提示詞注入是讓模型把不可信內容中的文字當成應遵循的指令,進而偏離原本任務。本文用閱讀活動報名郵件的原創案例,說明直接與間接注入、資料和權限的界線,以及為何檢索、引用格式或一句「忽略惡意指令」不能包辦防護,並整理外部內容分隔、工具授權與人工確認各自能阻止的失敗。閱讀全文是在使用當下,把指令塞進模型讀到的內容;資料投毒則在模型學習或建立資料時動手,效果留到之後。NIST 把前者歸在部署階段,後者歸在訓練階段。
| 面向 | 資料投毒 | 提示詞注入 |
|---|---|---|
| 動手時間 | 訓練或建立資料時 | 模型回答的當下 |
| 改變的對象 | 模型參數或知識庫 | 這次讀進的文字 |
| 效果持續 | 到重新訓練或移除資料 | 只在讀到注入內容時 |
| 攻擊者需要 | 資料進入蒐集流程 | 文字被模型讀到 |
| 主要防線 | 來源紀錄、過濾、評測 | 權限控管、內容隔離、人工確認 |
界線在 RAG 上變得模糊:知識庫是事先放好、反覆讀取的資料,卻在回答當下才進入上下文。PoisonedRAG 的作者以內容區分:提示詞注入靠指令,他們的方法靠捏造的知識。文件歸法也不同:NIST 把知識庫投毒列在間接提示詞注入之下;OWASP 2025 年版把藏有隱形指令的履歷混進 RAG 篩選系統算作資料投毒情境,修改 RAG 文件庫裡的文件則算作提示詞注入情境。歸在哪類都一樣,要問的是誰能寫入知識庫、寫入前後有沒有檢查。
防禦:各自做得到與做不到的事
- 資料來源紀錄:記下每批資料的來源、轉換與版本(OWASP 建議機器學習物料清單 ML-BOM 與資料版本控制),NIST 也建議發布者公布雜湊值供下載者核對。能發現內容事後被換掉、出事時追查是哪批資料;但雜湊只確認下載到的和發布者當初收錄的一樣,不能判斷資料原本是否惡意。
- 過濾與異常偵測:嘗試在訓練前剔除可疑的樣本。NIST 指出在龐大語料中找出投毒資料可能非常困難,缺乏額外假設時,後門甚至可能和資料的自然特徵無法區分。
- 評測:確認一般能力沒有退化,並監看訓練損失與輸出。但後門平常不觸發,Souly 等人指出一般評測流程可能察覺不到。
紅隊測試(Red Teaming)紅隊測試(Red Teaming):主動找出 AI 系統會怎樣失敗AI 紅隊測試以對抗或壓力情境主動尋找失敗,檢查模型和整套系統的防護是否有效。本文以活動問答助理示範範圍設定、測試假設、紀錄、修正和重測,區分紅隊、一般評估與漏洞掃描,也說明成功誘發一次錯誤不等於量出整體風險。讀完能看懂測試報告是否有重現條件和影響分析,而不把通過一輪測試當成永久安全保證。閱讀全文主動找觸發條件與異常行為,能找出部分問題,但觸發條件由攻擊者決定。Hubinger 等人 2024 年刻意訓練出後門模型:提示寫 2023 年時寫出安全程式碼,寫 2024 年時插入漏洞。在他們的設定下,最大的模型經過監督式微調、強化學習與對抗訓練仍保有後門,較小的模型則容易移除得多;對抗訓練反而可能讓模型更會辨認觸發條件。
NIST 也建議把模型當成不受信任的元件,例如限制它能呼叫的工具與權限,降低輸出被操控時的影響。
更多評測與安全相關的詞,請見AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- NIST AI 100-2 E2025:Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations · 查證日期:
- Carlini 等:Poisoning Web-Scale Training Datasets is Practical(arXiv:2302.10149) · 查證日期:
- Souly 等:Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples(arXiv:2510.07192) · 查證日期:
- Zou 等:PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models(arXiv:2402.07867,USENIX Security 2025) · 查證日期:
- Liang 等:Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data(arXiv:2509.23041,NeurIPS 2025) · 查證日期:
- Hubinger 等:Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training(arXiv:2401.05566) · 查證日期:
- OWASP Top 10 for LLM Applications 2025:LLM04 Data and Model Poisoning · 查證日期:
- OWASP Top 10 for LLM Applications 2025:LLM01 Prompt Injection · 查證日期:
- OWASP Top 10 for LLM Applications 2025:LLM08 Vector and Embedding Weaknesses · 查證日期: