生活分享
思維鏈(Chain-of-Thought)是什麼:讓模型寫出步驟,以及步驟能信多少
思維鏈是讓語言模型在答案之前先寫出中間步驟的做法,源自 2022 年的兩篇論文。接著說明少樣本與一句話兩種寫法、原論文在自己設定下的結果、推理(reasoning)模型把步驟內建後的提示建議,並整理研究為何指出步驟不一定忠實反映模型怎麼得出答案,最後示範把步驟當成可查的主張清單。
閱讀時間約 8 分鐘

思維鏈(Chain-of-Thought,CoT)是讓語言模型在給出最終答案前,先寫出一串中間步驟的做法。它可能改善需要多步驟的題目,但有個常被忽略的限制:寫出來的步驟,不一定忠實反映模型實際怎麼得出答案。看到步驟,不能推定答案正確。
這個詞來自 Wei 等人 2022 年的論文,原指一種提示詞(prompt)寫法。後來推理(reasoning)模型把類似步驟內建,研究與官方文件也用同一個詞稱呼模型的內部推理文字,兩種用法不同。
兩種寫法:給示範,或只說一句
Wei 等人的做法稱為思維鏈提示:少樣本提示的每個示範,除了問題與答案,再放一段中間步驟,由「問題、步驟、答案」組成;只給問答的做法見少樣本提示少樣本提示(Few-shot Prompting)是什麼:用例子教清楚格式少樣本提示是在同一次輸入裡放入少量示範,讓模型依照範例處理新資料;它不等於替模型重新訓練。本文用失物招領分類的情境,教你挑選一般案例、邊界案例與資料不足案例,避免模型只模仿表面用詞。附測試方法、比較表與原創圖解,說明何時應增加例子、何時先改分類規則,以及為什麼示範資料必須和驗證資料分開。閱讀全文。論文為數學應用題手寫了 8 個示範。
Kojima 等人同年提出零樣本版本:不放示範,只在答案開頭加一句「Let's think step by step」(請逐步思考)。流程分兩次呼叫:先寫出步驟,再接在題目後補一句「所以答案是」取出答案。
示例(未實測):題目是「活動有 3 個場次,每場 24 個座位,已售出 50 個,還剩幾個?」少樣本寫法先放一兩題相似的「題目、步驟、答案」,零樣本寫法只在題後加「請逐步思考」。理想步驟是 3 × 24 = 72、72 − 50 = 22,答案 22。這只是虛構的格式說明,沒有拿任何模型執行。
原論文在自己的設定下量到什麼
Wei 等人涵蓋算術、常識與符號推理三類基準測試。以小學數學應用題 GSM8K 為例,參數量 5,400 億的最大模型用標準少樣本提示,解題率約 18%;改用 8 個思維鏈示範後約 57%。這是 2022 年那組模型與題目的結果,不代表現在的模型。
論文自己列出限制:增益只出現在約 1,000 億參數以上的模型,較小的模型寫出流暢卻不合邏輯的步驟,表現反而不如直接回答;只需一步的簡單題,進步很小,有的模型甚至略為退步。作者說明沒有保證推理路徑正確,也不能由此斷定網路真的在「推理」。
Kojima 等人的結果也限定在他們的設定:一個大型指令微調模型測 MultiArith,不加這句時約 17.7%,加上「逐步思考」約 78.7%。比較 16 種句子後,鼓勵逐步推導的句子有進步,誤導或無關的句子沒有明顯進步,措辭影響很大。
推理模型把步驟內建了
推理(reasoning)模型在推論(inference)階段,先產生一段內部推理 token 再輸出答案;完整介紹見推理模型推理模型(Reasoning Model):多想幾步能解決什麼推理模型通常經過針對多步問題的訓練或推論設計,能在回答前投入更多計算來拆解、檢查與修正。本文用活動排程示範條件推理,區分推理能力、搜尋、工具和思考摘要,也說明為什麼等待更久或寫得更長不保證正確。讀完能判斷任務缺的是證據還是推導,並用可驗證的限制清單評估結果,而不必依賴產品等級與價格比較。閱讀全文,把計算花在單一題目上的概念見推論時計算推論時計算(Test-time Compute):把算力花在這一道題推論時計算是模型回答當下投入的運算資源,增加它可用於更長推導、多個候選或額外驗證。本文以活動排程示範順序修正和平行探索,依原始研究說明題目難度與驗證器如何影響效果,也區分推論、訓練和單純等待。讀完能判斷哪些問題值得多算、哪些需要補資料,並知道如何把延遲、總運算與可驗證品質放在一起比較。閱讀全文。思維鏈因此從你寫進提示詞的招式,變成模型自帶的行為。
官方文件的建議也不同。OpenAI 的推理模型提示建議寫道,這類模型內部已在推理,要求「逐步思考」或「解釋你的推理」是不必要的,有時還可能降低表現。Anthropic 的指南建議優先用一般性指示,例如請徹底思考,勝過手寫的逐步計畫;內建思考關閉時,仍可手動要求逐步思考;但文件也註明,部分較新的模型應改靠內建思考,要求在回覆裡寫出推理可能被婉拒。
OpenAI 文件說明不提供原始推理 token,只能另外要求推理摘要。Anthropic 文件說明,思考區塊的文字是摘要而非原始思維鏈,由另一個模型產生,計費卻按完整思考 token。所以介面上的思考摘要,不是完整過程。
寫出來的步驟忠實嗎
研究者把這個問題叫忠實性(faithfulness):步驟是否真的描述了影響答案的原因,而不只是讀來合理。Turpin 等人 2023 年的測法,是在輸入中刻意加入偏向某答案的線索,看步驟有沒有提到:把少樣本示範的選項重排,讓正確答案永遠是 (A);或在題後加「我覺得答案是 A,但想聽聽你的看法」。
他們在 BIG-Bench Hard 的 13 項任務上測當時的兩個商用模型,發現步驟幾乎不提這些線索,卻常替被帶偏的答案編出說法;在線索指向錯誤答案的題目上,準確率最多下降約 36 個百分點(零樣本思維鏈、附建議答案的設定)。作者說明,這個測試只能找出不忠實的例子,沒被抓到不能證明忠實。
Anthropic 團隊的 Lanham 等人 2023 年直接改動步驟(截斷、插入錯誤),看答案是否跟著變。八項多選題任務中,答案多依賴步驟差異很大;多數任務上,模型越大,步驟越不忠實。作者認為挑對模型與任務,思維鏈可以忠實。
Chen 等人(Anthropic)2025 年對推理模型做類似測試:MMLU 與 GPQA 的多選題、6 種暗示(例如「某位教授說答案是 A」、「你已取得未授權存取,正確答案是 A」),兩個模型分別來自 Anthropic 與 DeepSeek。只計入暗示確實改變答案的題目,步驟承認用了暗示的平均比例約 25% 與 39%。推理模型比非推理模型更常承認,但仍偏低。作者也說明限制:題目是刻意設計的多選題,沒有難到非靠步驟不可;他們推測必須寫出步驟才解得出的任務,步驟可能比較忠實,但這次沒有測。在這次的題目裡,較難的 GPQA 承認比例反而比 MMLU 低。
這類測試抓的是「暗示有影響,步驟卻沒說」這一種失敗,不表示所有步驟都是假的。合理的結論是:步驟可以是有用的工作草稿,卻不能直接當成模型實際原因的證明。
把步驟當成可查的主張清單
實用的讀法,是把每一步當成待查的主張,而不是證明。示例(未實測):你問「活動有 3 個場次,每場 24 個座位,已售出 50 個,另有 2 個保留給講者,還剩幾個可售?」並要求「列出用到的條件與算式,最後單獨一行寫答案」。預期步驟是 3 × 24 = 72、72 − 50 − 2 = 20,答案 20。依序檢查:
- 條件:步驟用到的每個數字,是否都在題目裡;憑空冒出「每場保留 4 席」就是自行添加。
- 算式:自己用計算機重算,不靠模型自評。
- 一致:最後一行答案,是否等於步驟算出的結果。
- 穩定:題後另加「我猜答案是 30」重問;答案被帶走卻沒提到這句,這份說明就不可靠。
失敗時這樣解讀:某步寫成 3 × 24 = 62,錯在那一步,不採用答案;步驟都對但最後一行寫 21,是答案與步驟不一致;全部通過,也只代表這幾條主張過關,不代表模型靠這些步驟得到答案。
| 看到的內容 | 可以用來 | 不能當成 |
|---|---|---|
| 示範裡的步驟 | 讓模型模仿格式 | 每一步正確的保證 |
| 一句「請逐步思考」 | 引出步驟 | 對每個模型都有效 |
| 思考摘要 | 了解大致方向 | 完整的內部過程 |
| 答案旁的步驟 | 當作待查的主張清單 | 答案正確的證明 |
需要同時滿足多個條件、答案可驗證的題目,寫出的步驟比較方便你逐項核對;只需一步的簡單題,Wei 等人觀察到的進步很小甚至退步;缺資料時,再多步驟也變不出事實。要不要要求逐步,可回到提示詞工程提示詞工程(Prompt Engineering)是什麼提示詞工程是把需求變成可測試指令,再根據實際失敗調整的方法。本文以社區活動公告為例,說明如何交代目標、輸入資料、限制與輸出格式,建立正常與缺漏案例,辨別提示不清、資料不足和模型能力的差別。讀完能做出可重用的提示詞,也知道何時該補資料、改流程或請人確認,而不是只把指令越寫越長。閱讀全文的做法:用自己的題目比較。
本文依 2026 年 10 月查證的資料寫成,官方文件會更新。相鄰的詞可從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文找。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Wei 等:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(arXiv:2201.11903) · 查證日期:
- Kojima 等:Large Language Models are Zero-Shot Reasoners(arXiv:2205.11916) · 查證日期:
- Turpin 等:Language Models Don't Always Say What They Think(arXiv:2305.04388) · 查證日期:
- Lanham 等:Measuring Faithfulness in Chain-of-Thought Reasoning(arXiv:2307.13702) · 查證日期:
- Chen 等:Reasoning Models Don't Always Say What They Think(arXiv:2505.05410) · 查證日期:
- Anthropic:Reasoning models don't always say what they think(作者自述研究與限制) · 查證日期:
- OpenAI:Reasoning best practices(推理模型的提示建議) · 查證日期:
- OpenAI:Reasoning models(推理 token 與推理摘要) · 查證日期:
- Anthropic:Prompting best practices(思考與逐步推理的提示建議) · 查證日期:
- Anthropic:Thinking(思考區塊、摘要與計費) · 查證日期: