生活分享
強化學習(Reinforcement Learning)是什麼:靠獎勵一步步試出做法
強化學習讓代理在環境中採取動作,依環境回饋的獎勵數字調整策略,目標是長期累積的回報最大。內容用格子世界示例說明狀態、動作、獎勵、策略與回報,對照監督式與非監督式學習,解釋探索與利用的取捨,再談語言模型裡的偏好獎勵與可驗證獎勵,以及獎勵設計不良時為什麼會被鑽漏洞。
閱讀時間約 8 分鐘

強化學習(Reinforcement Learning,RL)是機器學習機器學習(Machine Learning)是什麼機器學習透過資料調整模型,讓它對未見過的輸入做出預測或產生內容。本文用早餐店備料預估的例子,說明特徵、標籤、訓練與測試如何配合,辨別監督學習、非監督學習和強化學習,並解釋資料洩漏、過度擬合與環境改變的影響。讀完能看懂模型為何需要保留測試資料,也能用具體問題判斷一個看似很準的預測是否值得相信。閱讀全文的一種做法:代理(agent)在環境裡採取動作,環境回給它一個獎勵數字,它再依這些數字調整做法。沒有人告訴它每一步該怎麼走,它得靠嘗試找出長期拿最多獎勵的動作。國家教育研究院樂詞網同時收錄「強化學習」「增強式學習」「加強學習」,Google 繁中機器學習詞彙表則「強化學習」「增強學習」混用;這裡採「強化學習」,與系列的 RLHF 專文一致。policy 寫「策略」而不用詞彙表的「政策」,以免和公共政策混淆。
以下用格子世界示例講基本詞,再談學習方式的差別、探索與利用,以及語言模型裡的用法。資料截至 2026 年 10 月;標「示例」的內容是教學編的,未實測。
五個基本詞:狀態、動作、獎勵、策略、回報
Sutton 與 Barto 的教科書第二版,把強化學習定義為學習「在什麼情況下做什麼」,讓數值獎勵盡量大;和其他學習方式最重要的兩個區別,是靠試錯找做法,以及獎勵常延遲出現。
- 狀態(state):代理此刻掌握的環境資訊,例如棋盤局面或自己在地圖上的位置。
- 動作(action):此刻能做的選擇,例如往上下左右走一格。
- 獎勵(reward):每一步後環境回傳的數字,定義什麼算好、什麼算壞。
- 策略(policy):從狀態對應到動作的規則,可以是對照表或神經網路,也可以帶機率。
- 回報(return):往後所有獎勵的加總;許多方法用折扣率把越晚的獎勵打折。
代理要最大化的是回報,不是下一步的獎勵。書中另一個核心概念是價值函數(value function):從某狀態出發、照目前策略走下去,預期能拿多少回報。
2015 年 Mnih 等人在 Nature 發表的深度 Q 網路(DQN)是常見例子:在 49 款 Atari 2600 遊戲上,代理只看畫面像素和遊戲分數,獎勵來自遊戲分數,所有遊戲共用同一套演算法、網路架構與超參數。
示例:在格子世界裡找出口
示例(教學用,未實測):一張 4 欄、3 列的格子地圖,代理從左下角出發,出口在右上角,中間偏右有一格陷阱。動作只有上下左右。規則是每走一步扣 1;走進出口時另加 10,回合結束;踩進陷阱時另扣 10,回合也結束。
最短路線要 5 步:扣 5、加 10,回報是 5。繞路走了 9 步才到出口,回報只剩 1。往右兩步再往上,第 3 步就踩進陷阱,回報是 −13。代理起初不知道這些,只能一回合接一回合地試,從拿到的獎勵估計每一格往哪走划算。
難處在於加 10 只在最後一步出現。前面每步都扣 1,哪一步帶向出口、哪一步在繞路,要從整回合的結果往回推,這就是延遲獎勵。每步扣 1 也把「越快越好」寫進獎勵;教科書的迷宮例子同樣用每步 −1 鼓勵盡快脫困。
和監督式、非監督式學習差在哪
Sutton 與 Barto 把強化學習看成與監督式、非監督式學習並列的第三種範式:監督式學習的每筆資料都附正確答案,強化學習的獎勵只說結果好壞,不說哪個動作才對。
| 學習方式 | 訓練時拿到什麼 | 要學會什麼 |
|---|---|---|
| 監督式學習 | 每筆輸入都附正確答案(標籤) | 對沒看過的輸入也答對 |
| 非監督式學習 | 只有資料,沒有標籤 | 找出資料裡隱藏的結構,例如分群 |
| 強化學習 | 行動之後的獎勵數字,不說哪個動作才對 | 一套讓長期累積獎勵最大的策略 |
實際系統常把幾種學習接起來。Silver 等人 2016 年的圍棋研究,用策略網路選棋、價值網路評估局面,兩者結合人類高手棋譜的監督式學習與自我對弈的強化學習來訓練,下棋時再搭配樹搜尋。
探索與利用:先拿分,還是先試新路
教科書指出,這個取捨是強化學習特有的挑戰。要拿高獎勵,代理該選過去試過、效果好的動作,這叫利用(exploitation);要發現更好的動作,又得試沒選過的,這叫探索(exploration)。只做其中一種都會失敗,這個兩難研究了幾十年仍沒有通解。
放回格子世界:假設代理第一次碰巧花 9 步到出口,之後只走這條,每回合都只拿 1;偶爾往沒試過的方向走,才可能發現 5 步的路線,代價是短期回報變低,例如多踩幾次陷阱。一個簡單的折衷是 ε-greedy:多數時候選目前估計最好的動作,以小機率 ε 從所有動作中隨機挑。示例:ε 設 0.1,約每 10 次有 1 次隨機挑。
用在語言模型:偏好獎勵與可驗證獎勵
第一種是人類回饋強化學習(RLHF)人類回饋強化學習(RLHF):把偏好變成訓練訊號RLHF 利用人類對行為或回答的回饋,建立訓練獎勵並改善模型策略。本文以活動摘要的回答比較說明示範、偏好標註、獎勵模型和強化學習的分工,介紹典型流程與其他偏好方法的差異,也拆解為什麼討喜不等於真實、獎勵分數不等於所有人的價值。讀完能看懂回饋如何影響模型,以及標註分歧、獎勵漏洞和分佈改變的限制。閱讀全文。Christiano 等人 2017 年讓人比較兩段代理行為短片,用比較結果訓練預測獎勵的模型,再拿它當獎勵做強化學習。這套做法先被用在語言模型的續寫與摘要,Ouyang 等人 2022 年沿用它訓練模型遵循指令:標註者替回答排序、訓練獎勵模型,再以強化學習調整模型。換成前面的詞彙,提示詞是狀態,整段回答是動作,獎勵模型打完分回合就結束;論文另在每個 token 加上偏離監督式微調模型的懲罰,減輕對獎勵模型的過度最佳化。
第二種是可自動驗證的獎勵,與推理模型推理模型(Reasoning Model):多想幾步能解決什麼推理模型通常經過針對多步問題的訓練或推論設計,能在回答前投入更多計算來拆解、檢查與修正。本文用活動排程示範條件推理,區分推理能力、搜尋、工具和思考摘要,也說明為什麼等待更久或寫得更長不保證正確。讀完能判斷任務缺的是證據還是推導,並用可驗證的限制清單評估結果,而不必依賴產品等級與價格比較。閱讀全文的訓練有關。DeepSeek-AI 團隊 2025 年的論文(同年刊於 Nature)在數學、程式等推理任務改用規則打分:數學題要求答案寫成指定格式再比對,程式題用編譯器跑預先準備的測試案例,另有格式獎勵要求把推理過程放進指定標籤。其中一組實驗跳過監督式微調、直接對預訓練模型做強化學習,論文報告回答平均變長,重新檢查、改試其他解法的段落也變多;這是對輸出文字的描述,不代表模型像人一樣思考。
Lambert 等人 2024 年的開放後訓練報告稱之為「可驗證獎勵強化學習」(RLVR):沿用 RLHF 的訓練目標,但把獎勵模型換成驗證函數,答案正確給固定獎勵,否則給 0。它只適用於答案能自動檢查的任務,例如數學題或帶可檢查限制的指令。
獎勵沒設計好,就會被鑽漏洞
代理只會最大化你給的數字。Sutton 與 Barto 以西洋棋為例:獎勵只該給真正贏棋,不要給吃子這類子目標,否則代理可能吃了子卻輸棋;獎勵是告訴代理要達成什麼,不是怎麼達成。Amodei 等人把這類問題稱為 reward hacking,例如清潔機器人若因「沒看到髒亂」得分,可能乾脆閉上眼睛。中文譯名與更多案例見獎勵駭客獎勵駭客(Reward Hacking)是什麼:AI 拿到高分,卻沒做到你要的事獎勵駭客(Reward Hacking)指 AI 找到讓獎勵或評分變高、卻沒達成設計者目的的做法。內容依原始論文與官方研究,說明它和規格鑽漏洞、古德哈特定律的關係,拆解強化學習、RLHF 與寫程式代理三個實例,並整理評測、多種訊號、人工抽查與推理監看各自的限制,以及它和對齊、迎合的關聯。閱讀全文。
語言模型也一樣。DeepSeek-AI 的論文說明,推理任務不用神經網路獎勵模型,理由之一是觀察到它在大規模強化學習中容易被鑽漏洞,並承認寫作這類任務很難做出可靠獎勵。規則裡的準確度獎勵也只比對最後答案,不檢查推理過程本身,答案對不代表每步都對。
Sutton 與 Barto 提醒,強化學習同時指一類問題、一族解法和一個研究領域,三者要分開看。其他相關名詞見AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Sutton、Barto:Reinforcement Learning: An Introduction 第二版(作者官網全文,第 1–3 章) · 查證日期:
- Mnih 等:Human-level control through deep reinforcement learning(Nature 518,2015) · 查證日期:
- Silver 等:Mastering the game of Go with deep neural networks and tree search(Nature 529,2016) · 查證日期:
- Christiano 等:Deep reinforcement learning from human preferences(arXiv:1706.03741) · 查證日期:
- Ouyang 等:Training language models to follow instructions with human feedback(arXiv:2203.02155) · 查證日期:
- DeepSeek-AI:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv:2501.12948) · 查證日期:
- DeepSeek-AI:DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning(Nature 645,2025,開放取用) · 查證日期:
- Lambert 等:Tulu 3: Pushing Frontiers in Open Language Model Post-Training(arXiv:2411.15124) · 查證日期:
- Amodei 等:Concrete Problems in AI Safety(arXiv:1606.06565) · 查證日期:
- Google 機器學習詞彙表(繁體中文版):「增強學習 (RL)」與「政策」條目 · 查證日期:
- 國家教育研究院樂詞網(查詢 reinforcement learning 的學術名詞譯名) · 查證日期: