生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
閱讀時間約 7 分鐘

溫度(temperature)是語言模型生成文字時的取樣設定。模型每寫一個 token,都先替許多候選算出機率再抽一個;溫度決定抽籤偏向最高的候選,還是讓冷門候選也有機會。它不是正確率旋鈕,設成 0 也不保證每次一模一樣。
本文依 Holtzman 等人的取樣論文,以及 OpenAI、Anthropic、Google 的官方 API 文件,用假想的早餐例子算出溫度如何改變機率,再談 top-p、失敗型態、確定性的限制與不開放調整的模型。例子的數字都是示例,沒有實測任何模型。
模型每一步給的是機率分布
在大型語言模型(LLM)大型語言模型(Large Language Model)是什麼大型語言模型從大量資料學習語言與其他模式,依上下文處理文字、生成回答或提出工具請求。本文以失物招領紀錄為例,說明 token、參數、預訓練、提示詞與上下文如何配合,區分模型、聊天產品、搜尋與外部工具,並解釋為何流暢答案仍需查證。讀完能更精確描述任務,知道何時該補檔案、要求工具計算或保留無法確認的答案。閱讀全文裡,每一步只決定下一個 tokentoken(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文:模型替詞彙表中的每個候選打分,換算成加總為 100% 的機率,程式再依機率抽出一個,接在文字後面,繼續算下一步。這個抽選動作叫取樣(sampling)。
示例(未實測):提示詞是「明天到台南,早餐我想吃」,簡化成三個候選:牛肉湯 70%、虱目魚粥 20%、鍋燒意麵 10%。真實候選是 token,可能只是半個詞,數量也遠不止三個。照這份機率抽,大約七成是牛肉湯,偶爾抽到另外兩個,同一個提示詞因此會得到不同答案。
溫度如何讓分布變尖或變平
做法是把每個候選的分數(logit)先除以溫度 t,再換算成機率。Hinton 等人的知識蒸餾論文寫明 t 通常設為 1,t 越高分布越「軟」,也就是各候選的機率越接近;Holtzman 等人說明 t 小於 1 會把分布推向高機率的候選。
套進示例:t=1 維持 70%、20%、10%;t=0.5 變成約 91%、7%、2%;t=2 變成約 52%、28%、20%(四捨五入)。t 越接近 0,領先者越接近獨占,極端時等於每一步都只取機率最高的候選;這種選法稱為貪婪解碼(greedy decoding)。
溫度只改變怎麼從這份清單裡選,不改變清單本身,也不改變模型知道什麼。
top-p 與 top-k:先截掉尾巴再抽
top-k 只保留機率最高的 k 個候選。top-p 又稱 nucleus sampling,由 Holtzman 等人在 2019 年提出:由高到低累加機率,取累積達到 p 的最小集合,其餘不抽,留下的重新配比。示例 top-p=0.85:牛肉湯 70% 不到 85%,加上虱目魚粥累積 90%,前兩名入選,重配後約 78% 與 22%,鍋燒意麵被排除。
論文認為固定的 k 在分布平坦時太小、分布集中時太大,而 top-p 的候選數隨分布增減。論文在它的設定下(一個約 7.6 億參數的語言模型,生成 5,000 段最長 200 個 token 的文字)比較多種解碼法(從機率挑出下一個 token 的方法)。作者的結論是:要生成品質高、又像人寫的一樣多樣的長篇文字,nucleus sampling 是當時最好的解碼策略;這不能直接推到所有現代模型。
為什麼不建議同時大幅調兩個?OpenAI 的 API 參考在兩個欄位都寫一般建議只調其中一個,但沒說明原因。一個合理的解讀是:兩者都在改變低機率候選被抽到的程度,一起調會互相疊加,也分不出是誰造成的。各家的先後順序還不同:Holtzman 等人提到過去有人先用溫度塑形再做 top-k,Google 的文件則描述先用 topK、topP 篩選,最後才用溫度取樣。
低溫與高溫各適合什麼,也各怎麼失敗
官方文件方向一致:Anthropic 建議分析或選擇題類靠近 0.0,創作類靠近 1.0;Google 說較低溫適合較確定的回答,較高溫帶來更多樣的結果。
- 低溫的失敗型態是重複與呆板:Holtzman 等人在上述設定下發現,只用溫度取樣且低於 0.9 時,重複迴圈明顯增加;也可能穩定地答錯,因為最高機率的答案不一定正確。
- 高溫的失敗型態是離題與前後不連貫:Holtzman 等人指出,不截尾、直接照完整機率抽(純取樣)會抽到太多不可靠的冷門候選;Renze 與 Guven 只讓其中一個模型把溫度調到 1.0 以上,超過 1.0 後正確率快速下降,約 1.6 時文字已不連貫。
那低溫是否更準?Renze 與 Guven 用九個模型、五種提示詞寫法、從常用評測題庫抽出的選擇題,溫度從 0.0 逐步調到 1.0,整體未見統計上顯著的正確率差異(同一模型分領域檢定時,十個題目領域有兩個達到顯著),作者並註明只測選擇題。所以「溫度越低越準」得不到支持;想降低出錯風險,請看AI 幻覺查核AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文的做法。
| 設定 | 較適合 | 常見失敗型態 |
|---|---|---|
| 低溫 | 擷取欄位、分類、改寫 | 重複、呆板、穩定地錯 |
| 預設值附近 | 沒有特別需求時先沿用 | 預設值可能依模型而異 |
| 高溫 | 想標語、取名、多種寫法 | 離題、前後不連貫 |
| top-p 調小 | 砍掉低機率的尾端 | 候選變少,輸出變單調 |
設成 0 也不保證每次一樣
Google 的提示策略文件寫溫度 0 是確定的(deterministic),意思是永遠選機率最高的候選。Anthropic 的 API 參考則寫明,即使溫度 0.0,結果也不會完全確定。OpenAI 的 seed(亂數種子)欄位標為 Beta 與棄用,說明寫道只會盡力讓相同 seed 與參數得到相同結果,不保證確定。
可以這樣理解:抽選規則可以確定,但餵進這一步的機率仍可能每次略有不同。Atil 等人(預印本)在五個模型、八項任務、各跑 10 次、temperature 0、top-p 1、固定 seed 的條件下,同一任務不同次執行的準確率最多相差 15%;作者懷疑把多筆請求併在一起算(連續批次處理)等加速手法可能造成差異,但受測模型都在他們無法控制的 API 後面,只能推測。模型推論(inference)軟體 vLLM 的官方文件則寫明,預設為了效能不保證結果可重現;要重現,得讓排程(哪些請求一起算)固定,或讓輸出不受排程影響,而且只限同樣的硬體與 vLLM 版本。
示例(未實測):要把旅客留言「6 月 3 日入住,兩大一小」抽成日期與人數交給程式。做法是低溫,再用結構化輸出(Structured outputs)結構化輸出(Structured Outputs)是什麼:讓 AI 照固定格式交資料結構化輸出讓模型依 JSON Schema 產生固定欄位的資料,程式才能直接讀取。內容區分提示詞要求 JSON、JSON 模式與 schema 限制三種做法,用虛構報名信示範缺值與拒答的處理,整理三家官方文件列出的限制,並說明格式合法不等於內容正確。閱讀全文讓回應符合約定的 JSON Schema(OpenAI 官方文件的說法),同一則留言重跑 5 次比對。預期欄位一致;若某次欄位或格式亂掉,就當成流程問題,加上驗證與重試,不要只往 0 調。結構化輸出管格式,不管內容對不對。
有些模型或介面不開放調整
先查官方文件,別假設每個模型都有這個旋鈕。Anthropic 的 Messages API 參考把 temperature、top_p、top_k 標為棄用,寫明較新的模型不支援設定溫度:只接受預設值 1.0,其他值回 400 錯誤。OpenAI 的新模型指南在「不支援的參數」寫道,推理(reasoning)強度不是 none 時要移除 temperature 與 top_p。Google 對其較新一代模型強烈建議維持預設,並警告調到 1.0 以下可能重複循環,或在複雜數學與推理任務表現下降。
範圍也不同:這幾份文件寫 0 到 1 或 0 到 2,Google 還寫明預設值隨模型而異,所以不能把一家的數字照抄到另一家。以上是 2026 年 10 月 3 日讀到的說法。
更多相關詞彙見AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
生活分享
迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走
迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。
引用本文的文章
資料來源
- Holtzman et al.:The Curious Case of Neural Text Degeneration(arXiv:1904.09751,ICLR 2020) · 查證日期:
- Hinton et al.:Distilling the Knowledge in a Neural Network(arXiv:1503.02531,softmax 溫度的定義) · 查證日期:
- Renze & Guven:The Effect of Sampling Temperature on Problem Solving in Large Language Models(arXiv:2402.05201) · 查證日期:
- Atil et al.:Non-Determinism of "Deterministic" LLM Settings(arXiv:2408.04667,預印本) · 查證日期:
- OpenAI API reference:Chat Completions create(temperature、top_p、seed) · 查證日期:
- OpenAI API 官方指南:最新模型使用說明(「不支援的參數」段落) · 查證日期:
- OpenAI:Structured model outputs 指南 · 查證日期:
- Anthropic:Messages API 參考(temperature、top_p、top_k) · 查證日期:
- Google:Gemini API generateContent 參考(GenerationConfig) · 查證日期:
- Google:Gemini API 提示策略(temperature、topK、topP 說明) · 查證日期:
- vLLM 官方文件:Reproducibility · 查證日期: