生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
閱讀時間約 8 分鐘

合成資料(Synthetic Data)是由演算法、模型或模擬產生,用來模仿真實資料特徵的資料,不是直接從現實事件或真人身上收集。這個詞常指兩種用法:一是產生訓練資料來訓練模型,二是為保護隱私而產生、統計上像真資料的替代品。兩者的目的不同,要檢查的風險也不同。
本文以訓練用途為主,隱私用途另用一節說明。客服問答是假設示例,沒有實測;論文的數字也只代表該論文的設定。
先分清楚兩種合成資料
訓練用的合成資料,由模型或程式產生問答、指令或對話,再拿去訓練模型。用較強模型的輸出教較小的模型,常被歸入知識蒸餾(Knowledge Distillation)知識蒸餾(Knowledge Distillation):讓學生模型學教師知識蒸餾以教師模型的輸出或中間表示訓練學生模型,常用來降低部署成本或移轉特定能力。本文用文件分類說明硬標籤、軟目標與生成示範的差別,解釋教師的錯誤如何被傳遞,以及學生不一定能複製全部能力。讀完能分清蒸餾、一般微調和量化,並知道怎樣用獨立測試、任務範圍與實際硬體驗證蒸餾是否值得。閱讀全文;把輸出整理成輸入與答案的配對再訓練,是監督式微調(SFT)監督式微調(SFT):用好示範教模型完成任務監督式微調以輸入和期望輸出作為訓練示範,讓既有模型學習更穩定的任務行為。本文用會議待辦整理說明資料配對、對話角色、損失計算與保留測試集,區分 SFT、少樣本提示、LoRA 和偏好最佳化,也解釋示範中的猜測與格式錯誤如何被學進去。讀完能檢查訓練資料是否真的教會模型保留未知資訊,而不是只學會看起來完整。閱讀全文的一種資料來源;若大量生成的文字又混進網路語料,再被拿去做預訓練(Pretraining)預訓練(Pretraining):模型的基礎能力從哪裡來預訓練是在特定任務調整之前,讓模型從大量資料學得可重用表示與規律的階段。本文用下一個 token 預測和遮住內容再還原的例子說明資料、目標與參數更新,區分預訓練、微調和使用時提供上下文,也解釋為什麼學過文字不等於記得來源或保證事實正確。讀完能理解基礎模型的能力來源,以及訓練資料品質和評估汙染的影響。閱讀全文,就會牽涉來源如何追蹤。
隱私用的合成資料,則是擁有者以真實資料為基礎產生替代資料,供測試、分析或分享。NIST SP 800-188 把只替換原始資料中部分列、欄或儲存格(或加上雜訊)、其餘仍是原始記錄的,稱為部分合成;用原始資料建模、再由模型產生整份資料,與原始記錄沒有一對一對應的,稱為完全合成。兩種用法只有「資料是產生的」這一點相同;適合拿來訓練,不代表可以放心公開。
| 項目 | 訓練用 | 隱私用 |
|---|---|---|
| 目的 | 補足訓練資料 | 不給真資料也能測試、分析 |
| 主要風險 | 錯誤、單調、偏見 | 仍可能洩漏個人資訊 |
| 先檢查 | 正確性與多樣性 | 能否推回真人 |
Self-Instruct:從 175 個種子任務長出訓練資料
Self-Instruct 於 2022 年提出,讓預訓練語言模型用自己的輸出產生指令微調資料。論文的流程如下。
- 人工寫 175 個種子任務,每個有 1 條指令和 1 個實例,放進任務池。
- 每輪從池中抽 8 條指令當示範,其中 6 條人工寫、2 條是先前的模型產出,請模型寫出新指令。
- 判斷是否為分類任務;分類任務先產生標籤再產生輸入,避免輸入偏向單一標籤,其他任務則先產生輸入再產生輸出。
- 過濾:新指令與池中任何一條的 ROUGE-L 相似度(看文字重疊多少)要小於 0.7 才收進任務池,重複或明顯異常的實例也剔除;最後用這批資料微調原本那個模型。
在論文的設定下,流程產生 52,445 條指令與 82,439 個實例。作者隨機抽 200 條指令、各取 1 個實例,由其中一位作者標記:指令是有效任務的占 92%,輸入合適的占 79%,輸出正確可接受的占 58%,所有欄位都有效的只有 54%。微調後的模型在 Super-NaturalInstructions 的零樣本評測上,ROUGE-L 分數比原模型高 33.1 分。論文的限制一節也寫到:增益可能偏向常見任務,作者也擔心這個迭代過程放大模型原有的偏見。
示例:客服問答的生成與抽查
以下是假設流程,沒有實際執行,數字都是舉例。一間小型民宿只有一份住宿規則文件,想用模型產生客服問答,來測試或微調客服助理。
- 列出主題(訂房、取消、入住、交通、設備),要求模型只依文件出題與作答,並標明依據的段落。
- 產生 300 組問答,要求包含口語、錯字與資訊不全的問法。
- 先用程式去除重複的問題,再檢查答案裡的日期與金額是否出現在文件中。
- 人工抽查 30 組,記錄錯誤類型:答案與規則矛盾、規則沒寫卻照答、問法雷同。
- 另留一份由真實客人問題整理的測試集,不用來生成,也不混進訓練。
預期得到一批附依據的問答。若抽查發現答案引用了文件沒有的規定,多半代表生成時出現幻覺,應修改指令後整批重做,而不是只改被抽到的幾筆;若問題幾乎都是同一種句型,代表多樣性不足;若模型在合成題目上得分很高、在真實客人的問題上卻很差,可能是合成資料和真實提問的分佈不同。抽查只能估計錯誤比例,不能證明沒有錯。
模型崩潰:研究量到什麼,沒量到什麼
模型崩潰(model collapse)指模型一代代用前一代的輸出訓練,表現逐代變差。Shumailov 等人 2024 年發表於《Nature》的研究發現,在訓練中不加區分地使用模型生成的內容,原始內容分佈的尾端(少見的內容)會先消失。他們的語言模型實驗微調一個 1.25 億參數的模型,每代用上一代產生的文字訓練,分兩種設定:不保留原始資料(訓練 5 輪)時,困惑度(perplexity,越高代表預測越差)上升;每代隨機保留 10% 原始資料(訓練 10 輪)時,只有輕微退化。
Gerstgrasser 等人 2024 年改問資料怎麼更新。第 1 代用真實資料訓練;到了第 2 代、第 3 代,「替換」只用上一代的輸出,「累積」則保留真實資料,再加上每一代的輸出。他們用約 900 萬到 1.25 億參數的幾種小型語言模型,資料是一份由另一個模型產生的短篇故事集:替換使測試誤差上升,累積則持平或更低。影像與分子的生成模型結果類似;簡化的線性模型也證明,累積時誤差不會無限上升。
這兩篇都不能讀成「網路上的 AI 內容會讓所有模型崩潰」,也不能讀成「只要累積就安全」。2025 年一篇理論研究同樣分析資料逐代累積,對象是最大概似估計這種統計方法:在標準假設下,真實資料占比趨近於零也能避免崩潰;少了額外假設,即使原始資料還在,也可能很快崩潰。這個詞也沒有統一定義:Gerstgrasser 等人整理出至少四種相關現象,2025 年一篇立場論文數出八種定義。引用崩潰結論時,要看是哪一種、在什麼設定下;開頭用的是較寬的「表現逐代變差」說法。
另有研究把「用合成資料訓練出的模型,比產生這些資料的原模型還差」視為崩潰;在計算矩陣特徵值與新聞摘要兩個任務中,不篩選就會出現。先用驗證器(判斷資料好壞的程式或模型)篩過,即使驗證器不完美,有些也能避免崩潰。但在新聞摘要任務裡,讓產生資料的模型自己挑,結果勝過原模型;改用另一個摘要分數更高的模型來挑,效果卻和隨機挑選差不多。可見資料由誰篩、怎麼篩,本身就是變數。
隱私用途:合成不等於去識別
NIST SP 800-188(2023)指出,完全合成資料仍不是零揭露風險,因為它含有源自非公開個人資訊的內容;模型與由模型產生的資料都可能洩漏可再識別的個人資訊,深度學習模型背下多少訓練資料也難以量化。英國 ICO 的指引則說,合成資料算不算匿名,取決於能否從中推回原本的個人資訊;擬真度愈高,用途愈大,也愈可能洩漏,部分生成方法已被證明易受成員推論等攻擊。該頁註明,因英國 Data (Use and Access) Act 帶來的修改,這份指引正在審查、可能變動。
兩份文件都把差分隱私(differential privacy)列為控制洩漏量的方法,ICO 指出它可能降低資料的用處;ICO 也提醒,原始資料的偏誤會被帶進合成資料;NIST 則建議在資料本身標明是合成,例如姓名欄寫 SYNTHETIC PERSON。這裡引用的是美國與英國文件,不是台灣法規;在台灣處理個資,仍須另行確認適用的規定。
其他相關的詞,請見AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走
迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Wang 等:Self-Instruct: Aligning Language Models with Self-Generated Instructions(arXiv:2212.10560) · 查證日期:
- Shumailov 等:AI models collapse when trained on recursively generated data(Nature,2024) · 查證日期:
- Gerstgrasser 等:Is Model Collapse Inevitable?(arXiv:2404.01413) · 查證日期:
- Barzilai、Shamir:When Models Don't Collapse: On the Consistency of Iterative MLE(arXiv:2505.19046) · 查證日期:
- Schaeffer 等:Position: Model Collapse Does Not Mean What You Think(arXiv:2503.03150) · 查證日期:
- Feng 等:Beyond Model Collapse: Scaling Up with Synthesized Data Requires Verification(arXiv:2406.07515) · 查證日期:
- Liu 等:Best Practices and Lessons Learned on Synthetic Data(arXiv:2404.07503,COLM 2024) · 查證日期:
- NIST SP 800-188:De-Identifying Government Datasets(2023,第 4.4 節 Synthetic Data) · 查證日期:
- 英國 ICO:Synthetic data(隱私強化技術指引) · 查證日期: