生活分享

溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

閱讀時間約 7 分鐘

中間一個冷暖兩色的旋鈕,左邊是一高兩低的長條,右邊是三根高度相近的長條
圖片:Mokaair (© Mokaair)

溫度(temperature)是語言模型生成文字時的取樣設定。模型每寫一個 token,都先替許多候選算出機率再抽一個;溫度決定抽籤偏向最高的候選,還是讓冷門候選也有機會。它不是正確率旋鈕,設成 0 也不保證每次一模一樣。

本文依 Holtzman 等人的取樣論文,以及 OpenAI、Anthropic、Google 的官方 API 文件,用假想的早餐例子算出溫度如何改變機率,再談 top-p、失敗型態、確定性的限制與不開放調整的模型。例子的數字都是示例,沒有實測任何模型。

模型每一步給的是機率分布

在裡,每一步只決定下一個 :模型替詞彙表中的每個候選打分,換算成加總為 100% 的機率,程式再依機率抽出一個,接在文字後面,繼續算下一步。這個抽選動作叫取樣(sampling)。

示例(未實測):提示詞是「明天到台南,早餐我想吃」,簡化成三個候選:牛肉湯 70%、虱目魚粥 20%、鍋燒意麵 10%。真實候選是 token,可能只是半個詞,數量也遠不止三個。照這份機率抽,大約七成是牛肉湯,偶爾抽到另外兩個,同一個提示詞因此會得到不同答案。

溫度如何讓分布變尖或變平

做法是把每個候選的分數(logit)先除以溫度 t,再換算成機率。Hinton 等人的知識蒸餾論文寫明 t 通常設為 1,t 越高分布越「軟」,也就是各候選的機率越接近;Holtzman 等人說明 t 小於 1 會把分布推向高機率的候選。

套進示例:t=1 維持 70%、20%、10%;t=0.5 變成約 91%、7%、2%;t=2 變成約 52%、28%、20%(四捨五入)。t 越接近 0,領先者越接近獨占,極端時等於每一步都只取機率最高的候選;這種選法稱為貪婪解碼(greedy decoding)。

溫度只改變怎麼從這份清單裡選,不改變清單本身,也不改變模型知道什麼。

同一份三個候選的機率,在溫度 0.5、1、2 下被改成集中或平坦的長條,下方示範 top-p 0.85 截掉最後一名
上排是同一份機率在三種溫度下的樣子,下排是 top-p 0.85 截尾的示意;數字皆為示例。 · 圖片:Mokaair (© Mokaair)

top-p 與 top-k:先截掉尾巴再抽

top-k 只保留機率最高的 k 個候選。top-p 又稱 nucleus sampling,由 Holtzman 等人在 2019 年提出:由高到低累加機率,取累積達到 p 的最小集合,其餘不抽,留下的重新配比。示例 top-p=0.85:牛肉湯 70% 不到 85%,加上虱目魚粥累積 90%,前兩名入選,重配後約 78% 與 22%,鍋燒意麵被排除。

論文認為固定的 k 在分布平坦時太小、分布集中時太大,而 top-p 的候選數隨分布增減。論文在它的設定下(一個約 7.6 億參數的語言模型,生成 5,000 段最長 200 個 token 的文字)比較多種解碼法(從機率挑出下一個 token 的方法)。作者的結論是:要生成品質高、又像人寫的一樣多樣的長篇文字,nucleus sampling 是當時最好的解碼策略;這不能直接推到所有現代模型。

為什麼不建議同時大幅調兩個?OpenAI 的 API 參考在兩個欄位都寫一般建議只調其中一個,但沒說明原因。一個合理的解讀是:兩者都在改變低機率候選被抽到的程度,一起調會互相疊加,也分不出是誰造成的。各家的先後順序還不同:Holtzman 等人提到過去有人先用溫度塑形再做 top-k,Google 的文件則描述先用 topK、topP 篩選,最後才用溫度取樣。

低溫與高溫各適合什麼,也各怎麼失敗

官方文件方向一致:Anthropic 建議分析或選擇題類靠近 0.0,創作類靠近 1.0;Google 說較低溫適合較確定的回答,較高溫帶來更多樣的結果。

  • 低溫的失敗型態是重複與呆板:Holtzman 等人在上述設定下發現,只用溫度取樣且低於 0.9 時,重複迴圈明顯增加;也可能穩定地答錯,因為最高機率的答案不一定正確。
  • 高溫的失敗型態是離題與前後不連貫:Holtzman 等人指出,不截尾、直接照完整機率抽(純取樣)會抽到太多不可靠的冷門候選;Renze 與 Guven 只讓其中一個模型把溫度調到 1.0 以上,超過 1.0 後正確率快速下降,約 1.6 時文字已不連貫。

那低溫是否更準?Renze 與 Guven 用九個模型、五種提示詞寫法、從常用評測題庫抽出的選擇題,溫度從 0.0 逐步調到 1.0,整體未見統計上顯著的正確率差異(同一模型分領域檢定時,十個題目領域有兩個達到顯著),作者並註明只測選擇題。所以「溫度越低越準」得不到支持;想降低出錯風險,請看的做法。

取樣設定對照;依 2026 年 10 月查證的論文與官方文件整理。
設定較適合常見失敗型態
低溫擷取欄位、分類、改寫重複、呆板、穩定地錯
預設值附近沒有特別需求時先沿用預設值可能依模型而異
高溫想標語、取名、多種寫法離題、前後不連貫
top-p 調小砍掉低機率的尾端候選變少,輸出變單調

設成 0 也不保證每次一樣

Google 的提示策略文件寫溫度 0 是確定的(deterministic),意思是永遠選機率最高的候選。Anthropic 的 API 參考則寫明,即使溫度 0.0,結果也不會完全確定。OpenAI 的 seed(亂數種子)欄位標為 Beta 與棄用,說明寫道只會盡力讓相同 seed 與參數得到相同結果,不保證確定。

可以這樣理解:抽選規則可以確定,但餵進這一步的機率仍可能每次略有不同。Atil 等人(預印本)在五個模型、八項任務、各跑 10 次、temperature 0、top-p 1、固定 seed 的條件下,同一任務不同次執行的準確率最多相差 15%;作者懷疑把多筆請求併在一起算(連續批次處理)等加速手法可能造成差異,但受測模型都在他們無法控制的 API 後面,只能推測。模型推論(inference)軟體 vLLM 的官方文件則寫明,預設為了效能不保證結果可重現;要重現,得讓排程(哪些請求一起算)固定,或讓輸出不受排程影響,而且只限同樣的硬體與 vLLM 版本。

示例(未實測):要把旅客留言「6 月 3 日入住,兩大一小」抽成日期與人數交給程式。做法是低溫,再用讓回應符合約定的 JSON Schema(OpenAI 官方文件的說法),同一則留言重跑 5 次比對。預期欄位一致;若某次欄位或格式亂掉,就當成流程問題,加上驗證與重試,不要只往 0 調。結構化輸出管格式,不管內容對不對。

有些模型或介面不開放調整

先查官方文件,別假設每個模型都有這個旋鈕。Anthropic 的 Messages API 參考把 temperature、top_p、top_k 標為棄用,寫明較新的模型不支援設定溫度:只接受預設值 1.0,其他值回 400 錯誤。OpenAI 的新模型指南在「不支援的參數」寫道,推理(reasoning)強度不是 none 時要移除 temperature 與 top_p。Google 對其較新一代模型強烈建議維持預設,並警告調到 1.0 以下可能重複循環,或在複雜數學與推理任務表現下降。

範圍也不同:這幾份文件寫 0 到 1 或 0 到 2,Google 還寫明預設值隨模型而異,所以不能把一家的數字照抄到另一家。以上是 2026 年 10 月 3 日讀到的說法。

更多相關詞彙見。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

  • 生活分享

    迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走

    迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。

資料來源

生活分享