生活分享

縮放定律(Scaling Laws)是什麼:規模變大,損失與能力怎麼變

縮放定律是從訓練實驗擬合出的經驗規律:在特定設定下,語言模型的損失隨參數量、資料量與訓練計算量近似冪律下降。內容說明 Kaplan 與 Chinchilla 對預算分配的不同結論與成因、損失與任務表現的落差、湧現能力的兩種說法、推論時計算的縮放,以及如何閱讀「縮放撞牆」的新聞。

閱讀時間約 8 分鐘

方塊一格比一格大,旁邊的曲線卻愈來愈平緩
圖片:Mokaair (© Mokaair)

縮放定律(Scaling Laws)是研究者從訓練實驗中擬合出的經驗規律:在特定的模型、資料與訓練設定下,語言模型在沒看過的文字上的預測誤差(損失),會隨參數量、資料量與訓練計算量增加而平滑下降,形狀接近冪律。它不是物理定律,量的是損失,不等於任何一項任務的實用程度。

本文講機制與讀法,不談任何模型的規模,也不預測未來會不會撞牆。文中的數字都是論文在自己的設定下量到的結果,不能推廣成通則。

冪律的白話說法:進步要靠成倍的資源

先說損失。語言模型每預測下一個 token(文字切成的處理單位),都會替真實出現的那個 token 給一個機率;損失衡量模型對真實文字有多意外,在沒拿來訓練的文字上量,越低越好。Kaplan 等人 2020 年的論文用一系列 Transformer 模型,量到損失與的數量、資料量、訓練計算量,各自近似冪律。

冪律的白話意思是:資源每乘上固定倍數,損失就乘上固定比例。該論文在自己的設定下(資料足夠、訓練到收斂),參數量加倍,損失約變成原來的 0.95 倍,少了約 5%;再加倍一次,也只再少約 5%,這次要多投入的資源卻是上一次的兩倍。畫在兩軸都取對數的圖上,它是一條直線;換成一般座標,就是愈來愈平緩的曲線。

這是擬合出來的曲線,不是推導出來的定律:Kaplan 等人寫明,當時沒有紮實的理論解釋這些規律,難以判斷在哪些情況可以信任。下一節會談到的 Chinchilla 論文,公式還多一項不會再降的損失,對應自然文字本身的不確定性,所以曲線有下限。

同一筆預算,參數與資料怎麼分

假設的算力預算固定,要決定模型多大、看多少 token。Kaplan 等人的結論是新增的預算多半花在放大模型;Hoffmann 等人 2022 年的論文(通稱 Chinchilla)訓練了超過 400 個模型,結論是模型大小與訓練 token 數該等比例增加。Chinchilla 論文把前者的建議換算成:預算多 10 倍時,模型放大約 5.5 倍,資料只增加約 1.8 倍。

差異從哪來?Chinchilla 論文的解釋是:Kaplan 對所有模型用同樣的訓練長度與學習率排程,且實驗模型多半較小。2024 年的兩篇後續研究重做了比較,都發現學習率排程不是主因:Pearce 與 Song 認為很大一部分差異來自 Kaplan 計參數時不算嵌入層(把 token 及其位置轉成向量的部分),加上分析在小規模進行;Porian 等人重現 Kaplan 的結果後找出三個因素,分別是沒計入最後一層(輸出層)的計算成本、暖身期對小模型太長、最佳化器設定沒隨模型規模調整,修正後與 Chinchilla 吻合。兩篇的歸因不完全相同,重疊之處是 Kaplan 計算參數與算力時,沒有算進嵌入層或最後一層。這兩部分在小模型裡占比較大,Kaplan 的實驗又以小模型為主,漏算就讓結論偏向把預算多花在放大模型。

估計本身也可能出錯:Chinchilla 論文用三種方法估計最佳配置,Besiroglu 等人用從論文圖表重建的資料重做第三種,發現原報告的數值與前兩種方法不一致,重做後則與前兩種相容。「最佳」也只指固定訓練算力下損失最低;Sardana 等人 2024 年把模型上線後的推論(inference)成本也算進去,結論是預期請求量夠大時,該訓練比 Chinchilla 建議更小、看更多 token 的模型。

損失下降,不等於任務變好:湧現能力的兩種說法

損失與任務之間隔著評量指標。Kaplan 等人自己就寫道,損失的進步是否轉成語言任務的進步,需要另外檢驗。Wei 等人 2022 年的論文把湧現能力(emergent abilities)定義為小模型沒有、大模型有,因此無法從小模型的表現外推;在他們整理的任務曲線上,表現在某個規模前接近隨機,之後明顯高於隨機。他們承認指標可能掩蓋漸進的進步,在檢查的六項任務上也看到損失早已改善,但認為這只是不完整的解釋:分類題也有湧現,而且預測不了轉折的規模。

Schaeffer 等人 2023 年提出另一種解釋:指標若是非線性或不連續的,平滑的進步也會看起來像突然躍升。他們統計一份人工標注的 BIG-Bench 湧現能力清單,超過 92% 出現在兩種指標下,一是多選題的最高機率選項是否正確,一是輸出與答案字串完全相同;在他們檢驗的案例中,換成連續指標,躍升就消失。他們強調這不表示大型模型不可能有湧現能力,只是先前主張的可能出自分析方式。

示例(假設數字,未實測):某題的答案固定是 5 位數,5 位全對才算對。若模型愈來愈大,逐位答對率依序是 50%、70%、90%、95%,整串全對的機率就是 3%、17%、59%、77%(假設各位彼此獨立,Schaeffer 等人說明這只是近似)。逐位進步平穩,整串全對率卻在中段陡升。這顯示指標會放大平滑變化,但不證明所有湧現都是假象。

兩組長條圖:逐位答對率穩定上升,整串五位全對率則先低後陡升,示例數字未實測
同一組逐位進步,換成整串全對的指標,曲線形狀就變了(示例,非實測)。 · 圖片:Mokaair (© Mokaair)

推論時計算也有縮放曲線

另一條軸是回答當下多花算力,即:同一題取樣多次、讓模型修改答案,或用驗證器挑答案。Brown 等人對同一題重複取樣,量覆蓋率,也就是至少有一個樣本答對的題目比例,發現在橫跨約四個數量級的取樣次數內,覆蓋率都持續上升。程式題這類能自動驗證答案的題目,覆蓋率上升就直接轉成實際表現;沒有自動驗證器時,覆蓋率不等於最終答對率:在 MATH 題集、一個開放權重模型的設定下,覆蓋率從 100 次取樣的 82.9% 升到 10,000 次的 98.44%,改用多數決或獎勵模型挑答案,進步最多的做法也只從 40.50% 升到 41.41%。

Snell 等人在 MATH 題集上,用微調過的模型研究怎麼分配推論算力:依題目難度調整策略,論文估計推論算力的使用效率比一律取樣再挑最好的提高約 2 至 4 倍。與參數量約 14 倍的模型在總運算量相同下比較,結果取決於難度與推論負載:題目簡單或中等、或推論量少時,多算推論較划算;題目很難、或推論量大時,預訓練較有效。論文的結論是兩者不能一比一互換。

看到「縮放撞牆」,先問誰說的、量什麼

「縮放撞牆」可能指好幾件不同的事。曲線在一般座標上變平是冪律本來的形狀,要看實測有沒有偏離擬合線才算數;訓練資料不夠是供應問題,Villalobos 等人專門估算公開人類文字的存量與資料需求,並非在問損失曲線;分數進步變慢,要先分辨是指標飽和還是能力停滯。

概念對照;來源查證於 2026 年 10 月。
縮放什麼論文量到的不要誤讀成
參數、資料、訓練計算沒看過文字上的損失近似冪律下降每項任務都同樣進步
推論時計算特定題集上多取樣或修改後的表現所有題目都有效
湧現能力某指標在某規模前近隨機、之後上升能力必然在該規模突然出現

論文只能說它的設定內發生了什麼,範圍之外沒有保證。相鄰的詞可從查找。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享