生活分享
過度擬合(過擬合,Overfitting)是什麼:考古題全對、新題卻答錯
過度擬合是模型連訓練資料裡的雜訊與特例都學進去:訓練時幾乎全對,遇到沒看過的資料就失準。用示例誤差曲線說明訓練集、驗證集、測試集的分工,對照低度擬合,整理更多資料、正則化、dropout、提早停止等對策,並解讀深度網路能背下隨機標籤的研究,以及基準測試題目外洩造成的「看起來會」。
閱讀時間約 8 分鐘

過度擬合(overfitting)是機器學習機器學習(Machine Learning)是什麼機器學習透過資料調整模型,讓它對未見過的輸入做出預測或產生內容。本文用早餐店備料預估的例子,說明特徵、標籤、訓練與測試如何配合,辨別監督學習、非監督學習和強化學習,並解釋資料洩漏、過度擬合與環境改變的影響。讀完能看懂模型為何需要保留測試資料,也能用具體問題判斷一個看似很準的預測是否值得相信。閱讀全文的常見失敗:模型把訓練資料貼得太緊,連雜訊和特例都學進去,訓練時幾乎全對,遇到新資料就答錯,像背熟考古題、換一份考卷就失常。譯名不統一:國家教育研究院樂詞網多數領域與標註人工智慧的條目寫「過度擬合」,也收「過擬合」「過度配適」;Google 繁中教材多寫「過度配適」。這裡採「過度擬合」,相反情況(underfitting)依樂詞網寫作「低度擬合」。
以下說明資料怎麼切、曲線怎麼看、對策在做什麼,再談網路背下隨機標籤的研究與基準測試的題目外洩。
訓練集、驗證集、測試集各管一件事
要知道模型有沒有過度擬合,得用它沒看過的資料來量。Google 機器學習速成課程建議把資料切成三份:訓練集用來調整參數;驗證集在開發中反覆用來比較設定;測試集留到最後確認。每筆資料只能屬於其中一份。
Goodfellow 等人的《Deep Learning》第 5 章說得更明確:測試集不能參與任何選擇,連超參數也不行,驗證集要從訓練資料再切出來,常見約八成訓練、兩成驗證。
Google 教材也提醒,測試集混進和訓練集重複的例子,分數會好得不合理,要先刪掉。
示例:兩條誤差曲線從哪裡分岔
示例(數字為編寫,未實際訓練):用旅館評論訓練分類器,判斷旅客會不會再訂。每訓練一輪,記下訓練集與驗證集的錯誤率:
- 第 1 輪:訓練誤差 30%,驗證誤差 31%。
- 第 8 輪:訓練誤差 8%,驗證誤差 12%,是驗證誤差最低點。
- 第 20 輪:訓練誤差降到 1%,驗證誤差卻回升到 20%。
前 8 輪兩條線一起往下,模型學到較普遍的規律;之後訓練誤差續降、驗證誤差上升,表示它開始記住個別用字和特例。Google 教材把這種先同步、後分岔的損失曲線視為過度擬合的強烈訊號。
Goodfellow 等人的定義是:訓練誤差降不下來是低度擬合,訓練與測試誤差差距太大是過度擬合。只看第 20 輪的 1% 會以為模型最好,兩條線一起看,第 8 輪附近才較可靠。
低度擬合、剛好、過度擬合怎麼分
Google 教材把原因粗分為兩類:訓練資料不能代表真實資料,或模型太複雜。Goodfellow 等人用「容量」形容模型能配合多少種函數,容量太高就可能記住對新資料沒用的細節。
| 狀態 | 訓練與驗證誤差 | 可以先試 |
|---|---|---|
| 低度擬合 | 兩者都高,差距小 | 換特徵、多訓練幾輪、降低正則化強度 |
| 剛好 | 兩者都低,差距小 | 保留這個版本,最後用測試集量一次 |
| 過度擬合 | 訓練低、驗證高,差距大 | 補資料、加強正則化、提早停止 |
| 題目外洩 | 公開題分數高,新題明顯較低 | 改用未公開的新題重測 |
常見對策:每一招在做什麼
- 更多資料:Goodfellow 等人認為這是提升泛化(generalization,對新資料的表現)的最佳辦法,但資料要有代表性。
- 資料擴增:把現有樣本做不改變答案的變化當成新樣本,例如影像平移幾個像素。
- 正則化:訓練時同時懲罰模型的複雜度。L2 正則化(又稱權重衰減)把權重往 0 推,強度太高會變成低度擬合。
- dropout(Google 繁中詞彙表譯「丟棄正則化」):訓練時每次隨機暫時拿掉一部分單元,讓單元無法只依賴特定的其他單元。
- 提早停止:驗證誤差不再改善就停,取最低那一輪的參數;Google 教材說它快,但很少是最佳做法。
- 簡化模型:減少特徵或縮小模型,降低容量。
dropout 最早見於 Hinton 等人 2012 年的預印本,Srivastava 等人 2014 年的期刊論文再完整說明,目的是減少大型神經網路神經網路(Neural Network)是什麼:由層與權重組成、能從資料學習的函數神經網路是由多層簡單單元組成的函數:單元做加權加總,多半再經非線性轉換,權重由資料調整。用雙開關走廊燈的手算示例,說明前向計算、損失、反向傳播與梯度下降,區分訓練與推論,並釐清參數數量、神經元數量與能力的差別,以及它與深度學習、Transformer 的關係。閱讀全文的過度擬合。這些招數都不保證有效,選哪幾招、強度多少,仍要看驗證誤差。
網路背得下隨機答案:Zhang 等人 2017 年的實驗
Zhang 等人發表於 ICLR 2017 的論文,把 CIFAR10(10 類小圖片)與 ImageNet 的標籤換成隨機亂標,再用標準的影像分類網路照常訓練:CIFAR10 上訓練誤差仍降到 0 或接近 0,ImageNet 上訓練準確率也有 95.20%,測試則都只剩亂猜的程度;在 CIFAR10 上把圖片換成純雜訊也背得下來。
論文表 1 的對照:在 CIFAR10 上,同一個網路關掉資料擴增與權重衰減,用真實標籤時訓練準確率 100%、測試準確率 85.75%;用隨機標籤時訓練仍是 100%,測試只有 9.78%,接近 10 類亂猜的 10%。
作者的結論是:這些網路的有效容量足以記住整份訓練資料,傳統複雜度指標分不出泛化好壞;權重衰減、dropout 等顯式正則化可能改善泛化,但既非必要,單靠它也不足以控制訓練與測試的落差。
它沒說的事也要分清楚:沒說大型網路在真實資料上一定過度擬合,同一個網路在新圖片上仍有 85.75%;沒說正則化沒用,也沒解開網路為何能泛化。實驗只涵蓋影像分類,不能直接套到大型語言模型。
所以「模型越大越容易過度擬合」不能當通則。Nakkiran 等人 2019 年在 CIFAR-10、CIFAR-100 影像分類與 IWSLT'14 德英翻譯等設定下,觀察到測試誤差隨模型變大先降、再升、又降,即雙下降(double descent),高峰在模型剛好能把訓練誤差壓到接近 0 之處;訓練標籤含雜訊時最明顯,部分設定裡樣本變多反而更差。
題目外洩:基準測試上的「看起來會」
Sainz 等人 2023 年的立場論文指出,最嚴重的資料汙染是大型語言模型訓練時看過某個基準測試基準測試(Benchmark)是什麼基準測試用共同題目、執行設定與評分方法比較系統,是理解 AI 能力的一種參考,不能直接當成所有用途的排名。本文以圖書館資料整理需求為例,說明題型、指標、提示詞、工具與測試汙染如何影響分數,解釋平均值與排名變動的限制。讀完能閱讀基準的適用範圍,判斷不同報告是否真的可比,並把公開成績接到自己的實際任務驗證。閱讀全文的測試題,之後又用同一個基準評測,成績因而被高估。測試集量得出真本事,前提是題目對模型是新的;題目外洩後,分數量到的可能只是記憶。
沒外洩也可能被慢慢「調」進去:Goodfellow 等人寫到,同一個測試集被研究社群用了多年,評估會偏樂觀。
Hugh Zhang 等人 2024 年請人工照 GSM8K(小學數學應用題基準)的風格與難度,另寫 1,205 題、發表時不公開的 GSM1k。在他們的設定下,模型準確率最多下降約 8%;模型生成 GSM8K 原題的機率越高,落差大致越大(Spearman r² = 0.36),顯示部分模型可能背過原題。但許多模型幾乎沒有落差,所有模型整體上仍能解新題。
外洩和過度擬合也不是一對一:有的模型落差大卻不像背過原題,作者推測是用了和基準很像的資料,或用基準分數挑選版本;少量外洩也不一定造成過度擬合。Recht 等人 2019 年為 CIFAR-10 與 ImageNet 重做測試集,他們評估的多種模型準確率分別降 3% 到 15% 與 11% 到 14%,但他們認為主因是模型對稍難一點的新圖片泛化不足,不是測試集被反覆使用。新題掉分是警訊,原因要另外查。
自己訓練、微調或讀分數時怎麼用
在既有模型上微調微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文也是用自己的資料繼續訓練,同樣要先切出驗證集與測試集、刪掉重複的例子,驗證誤差回升就停下比較。
讀別人的分數時,先問題目公開過沒有、有沒有在新題上重測。答案不能證明模型沒問題,只能幫你判斷分數要打幾折。
想查其他名詞,可以從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文找起。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Google Machine Learning Crash Course:Overfitting(過度擬合、低度擬合、泛化曲線) · 查證日期:
- Google Machine Learning Crash Course:Dividing the original dataset(訓練、驗證、測試集與重複樣本) · 查證日期:
- Google Machine Learning Crash Course:Model complexity(模型複雜度與正則化) · 查證日期:
- Google Machine Learning Crash Course:L2 regularization(正則化率與提早停止) · 查證日期:
- Google Machine Learning Glossary(overfitting、underfitting、early stopping、dropout regularization 條目) · 查證日期:
- Google 機器學習速成課程繁體中文版:過度配適(官方譯名對照) · 查證日期:
- 國家教育研究院樂詞網:overfitting 檢索結果(過度擬合、過擬合、過度配適) · 查證日期:
- Goodfellow、Bengio、Courville:Deep Learning 第 5 章 Machine Learning Basics(作者官網全文) · 查證日期:
- Goodfellow、Bengio、Courville:Deep Learning 第 7 章 Regularization for Deep Learning(作者官網全文) · 查證日期:
- Srivastava 等人 2014:Dropout: A Simple Way to Prevent Neural Networks from Overfitting(JMLR 15) · 查證日期:
- Hinton 等人 2012:Improving neural networks by preventing co-adaptation of feature detectors(arXiv:1207.0580,dropout 最早的預印本) · 查證日期:
- Zhang 等人 2017:Understanding deep learning requires rethinking generalization(ICLR 2017,arXiv:1611.03530) · 查證日期:
- Nakkiran 等人 2019:Deep Double Descent: Where Bigger Models and More Data Hurt(arXiv:1912.02292) · 查證日期:
- Sainz 等人 2023:NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark(arXiv:2310.18018) · 查證日期:
- Zhang 等人 2024:A Careful Examination of Large Language Model Performance on Grade School Arithmetic(GSM1k,arXiv:2405.00332) · 查證日期:
- Recht 等人 2019:Do ImageNet Classifiers Generalize to ImageNet?(arXiv:1902.10811) · 查證日期: