生活分享

過度擬合(過擬合,Overfitting)是什麼:考古題全對、新題卻答錯

過度擬合是模型連訓練資料裡的雜訊與特例都學進去:訓練時幾乎全對,遇到沒看過的資料就失準。用示例誤差曲線說明訓練集、驗證集、測試集的分工,對照低度擬合,整理更多資料、正則化、dropout、提早停止等對策,並解讀深度網路能背下隨機標籤的研究,以及基準測試題目外洩造成的「看起來會」。

閱讀時間約 8 分鐘

資料點旁有兩條線:一條劇烈彎折、穿過每個點,另一條平順地沿著走勢;右端的新點落在平順線上,離彎折線很遠
圖片:Mokaair (© Mokaair)

過度擬合(overfitting)是的常見失敗:模型把訓練資料貼得太緊,連雜訊和特例都學進去,訓練時幾乎全對,遇到新資料就答錯,像背熟考古題、換一份考卷就失常。譯名不統一:國家教育研究院樂詞網多數領域與標註人工智慧的條目寫「過度擬合」,也收「過擬合」「過度配適」;Google 繁中教材多寫「過度配適」。這裡採「過度擬合」,相反情況(underfitting)依樂詞網寫作「低度擬合」。

以下說明資料怎麼切、曲線怎麼看、對策在做什麼,再談網路背下隨機標籤的研究與基準測試的題目外洩。

訓練集、驗證集、測試集各管一件事

要知道模型有沒有過度擬合,得用它沒看過的資料來量。Google 機器學習速成課程建議把資料切成三份:訓練集用來調整參數;驗證集在開發中反覆用來比較設定;測試集留到最後確認。每筆資料只能屬於其中一份。

Goodfellow 等人的《Deep Learning》第 5 章說得更明確:測試集不能參與任何選擇,連超參數也不行,驗證集要從訓練資料再切出來,常見約八成訓練、兩成驗證。

Google 教材也提醒,測試集混進和訓練集重複的例子,分數會好得不合理,要先刪掉。

示例:兩條誤差曲線從哪裡分岔

示例(數字為編寫,未實際訓練):用旅館評論訓練分類器,判斷旅客會不會再訂。每訓練一輪,記下訓練集與驗證集的錯誤率:

  • 第 1 輪:訓練誤差 30%,驗證誤差 31%。
  • 第 8 輪:訓練誤差 8%,驗證誤差 12%,是驗證誤差最低點。
  • 第 20 輪:訓練誤差降到 1%,驗證誤差卻回升到 20%。

前 8 輪兩條線一起往下,模型學到較普遍的規律;之後訓練誤差續降、驗證誤差上升,表示它開始記住個別用字和特例。Google 教材把這種先同步、後分岔的損失曲線視為過度擬合的強烈訊號。

Goodfellow 等人的定義是:訓練誤差降不下來是低度擬合,訓練與測試誤差差距太大是過度擬合。只看第 20 輪的 1% 會以為模型最好,兩條線一起看,第 8 輪附近才較可靠。

示例誤差曲線:訓練誤差一路下降,驗證誤差在第 8 輪最低後回升,兩線差距在第 20 輪最大
示例數字為編寫的教學設定;驗證誤差開始回升、兩條線分岔的地方,就是過度擬合出現的位置。 · 圖片:Mokaair (© Mokaair)

低度擬合、剛好、過度擬合怎麼分

Google 教材把原因粗分為兩類:訓練資料不能代表真實資料,或模型太複雜。Goodfellow 等人用「容量」形容模型能配合多少種函數,容量太高就可能記住對新資料沒用的細節。

概念對照,依 Google 機器學習速成課程、《Deep Learning》第 5 章與 GSM1k 論文整理;資料截至 2026 年 10 月。
狀態訓練與驗證誤差可以先試
低度擬合兩者都高,差距小換特徵、多訓練幾輪、降低正則化強度
剛好兩者都低,差距小保留這個版本,最後用測試集量一次
過度擬合訓練低、驗證高,差距大補資料、加強正則化、提早停止
題目外洩公開題分數高,新題明顯較低改用未公開的新題重測

常見對策:每一招在做什麼

  • 更多資料:Goodfellow 等人認為這是提升泛化(generalization,對新資料的表現)的最佳辦法,但資料要有代表性。
  • 資料擴增:把現有樣本做不改變答案的變化當成新樣本,例如影像平移幾個像素。
  • 正則化:訓練時同時懲罰模型的複雜度。L2 正則化(又稱權重衰減)把權重往 0 推,強度太高會變成低度擬合。
  • dropout(Google 繁中詞彙表譯「丟棄正則化」):訓練時每次隨機暫時拿掉一部分單元,讓單元無法只依賴特定的其他單元。
  • 提早停止:驗證誤差不再改善就停,取最低那一輪的參數;Google 教材說它快,但很少是最佳做法。
  • 簡化模型:減少特徵或縮小模型,降低容量。

dropout 最早見於 Hinton 等人 2012 年的預印本,Srivastava 等人 2014 年的期刊論文再完整說明,目的是減少大型的過度擬合。這些招數都不保證有效,選哪幾招、強度多少,仍要看驗證誤差。

網路背得下隨機答案:Zhang 等人 2017 年的實驗

Zhang 等人發表於 ICLR 2017 的論文,把 CIFAR10(10 類小圖片)與 ImageNet 的標籤換成隨機亂標,再用標準的影像分類網路照常訓練:CIFAR10 上訓練誤差仍降到 0 或接近 0,ImageNet 上訓練準確率也有 95.20%,測試則都只剩亂猜的程度;在 CIFAR10 上把圖片換成純雜訊也背得下來。

論文表 1 的對照:在 CIFAR10 上,同一個網路關掉資料擴增與權重衰減,用真實標籤時訓練準確率 100%、測試準確率 85.75%;用隨機標籤時訓練仍是 100%,測試只有 9.78%,接近 10 類亂猜的 10%。

作者的結論是:這些網路的有效容量足以記住整份訓練資料,傳統複雜度指標分不出泛化好壞;權重衰減、dropout 等顯式正則化可能改善泛化,但既非必要,單靠它也不足以控制訓練與測試的落差。

它沒說的事也要分清楚:沒說大型網路在真實資料上一定過度擬合,同一個網路在新圖片上仍有 85.75%;沒說正則化沒用,也沒解開網路為何能泛化。實驗只涵蓋影像分類,不能直接套到大型語言模型。

所以「模型越大越容易過度擬合」不能當通則。Nakkiran 等人 2019 年在 CIFAR-10、CIFAR-100 影像分類與 IWSLT'14 德英翻譯等設定下,觀察到測試誤差隨模型變大先降、再升、又降,即雙下降(double descent),高峰在模型剛好能把訓練誤差壓到接近 0 之處;訓練標籤含雜訊時最明顯,部分設定裡樣本變多反而更差。

題目外洩:基準測試上的「看起來會」

Sainz 等人 2023 年的立場論文指出,最嚴重的資料汙染是大型語言模型訓練時看過某個的測試題,之後又用同一個基準評測,成績因而被高估。測試集量得出真本事,前提是題目對模型是新的;題目外洩後,分數量到的可能只是記憶。

沒外洩也可能被慢慢「調」進去:Goodfellow 等人寫到,同一個測試集被研究社群用了多年,評估會偏樂觀。

Hugh Zhang 等人 2024 年請人工照 GSM8K(小學數學應用題基準)的風格與難度,另寫 1,205 題、發表時不公開的 GSM1k。在他們的設定下,模型準確率最多下降約 8%;模型生成 GSM8K 原題的機率越高,落差大致越大(Spearman r² = 0.36),顯示部分模型可能背過原題。但許多模型幾乎沒有落差,所有模型整體上仍能解新題。

外洩和過度擬合也不是一對一:有的模型落差大卻不像背過原題,作者推測是用了和基準很像的資料,或用基準分數挑選版本;少量外洩也不一定造成過度擬合。Recht 等人 2019 年為 CIFAR-10 與 ImageNet 重做測試集,他們評估的多種模型準確率分別降 3% 到 15% 與 11% 到 14%,但他們認為主因是模型對稍難一點的新圖片泛化不足,不是測試集被反覆使用。新題掉分是警訊,原因要另外查。

自己訓練、微調或讀分數時怎麼用

在既有模型上也是用自己的資料繼續訓練,同樣要先切出驗證集與測試集、刪掉重複的例子,驗證誤差回升就停下比較。

讀別人的分數時,先問題目公開過沒有、有沒有在新題上重測。答案不能證明模型沒問題,只能幫你判斷分數要打幾折。

想查其他名詞,可以從找起。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享