生活分享
人類回饋強化學習(RLHF):把偏好變成訓練訊號
RLHF 利用人類對行為或回答的回饋,建立訓練獎勵並改善模型策略。本文以活動摘要的回答比較說明示範、偏好標註、獎勵模型和強化學習的分工,介紹典型流程與其他偏好方法的差異,也拆解為什麼討喜不等於真實、獎勵分數不等於所有人的價值。讀完能看懂回饋如何影響模型,以及標註分歧、獎勵漏洞和分佈改變的限制。
更新日期: 閱讀時間約 6 分鐘

人類回饋強化學習,英文 Reinforcement Learning from Human Feedback,簡稱 RLHF,是把人類對模型行為的判斷轉成訓練訊號,再用強化學習調整行為的做法。它不限於語言模型;早期研究也以人類偏好比較教導代理行為。在聊天模型情境,人們常比較多個回答,選出更符合指定準則的一個。
這裡主要說明 InstructGPT 研究裡常被引用的流程:先學人工示範,再收集回答比較,訓練獎勵模型,最後依獎勵調整語言模型。這是典型實作,不是 RLHF 的唯一固定配方。理解這條路徑後,你會知道聊天介面的按讚並不等於當場更新模型,也能分辨偏好資料與模型真實能力之間的距離。
人類提供的不是完整公式
很多工作很難用一條簡單規則評分,例如摘要是否清楚、回答是否有幫助、語氣是否恰當。人類可能比較容易在兩個具體候選中做判斷,研究便利用這種相對偏好形成資料。標註仍要有準則,否則同一回答可能因長度、禮貌或個人經驗而被不同人選中,模型收到的訊號也會不一致。
原始人類偏好研究展示了利用比較資料學習獎勵,再調整代理行為的方向。在語言模型中,這個思路可以讓訓練目標更貼近人們希望的回答方式。但「人類回饋」不是一個超越立場的公正來源,它來自特定標註者、任務及規則。報告應說清楚誰評、依什麼評,以及哪些情境未涵蓋。
典型流程如何串起來
以 InstructGPT 的方法為例,首先用人工寫的理想回答做監督式微調微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文,讓模型具備跟隨指令的基本行為。接著對同一提示詞產生多個候選,請標註者排序,再訓練獎勵模型預測人類較偏好的回答。獎勵模型是在近似標註模式,並不是能直接衡量真理或善惡的儀器。
最後用強化學習更新回答策略,使模型傾向產生獎勵較高的內容,同時限制與參考行為偏離過大。該研究使用 PPO,但 RLHF 不等於 PPO 的別名。實務流程也可能反覆收集新回饋、重新訓練與評估。每個階段產生不同成果:比較資料、獎勵模型和可對話模型不能混成同一個東西。
示範:比較兩份活動摘要
假設輸入是一份虛構讀書會紀錄,要求摘要重點並保留未決事項。候選甲短而流暢,卻把尚未確認的下次日期寫成已決定;候選乙稍長,但清楚分開已定事項和待確認內容。依忠於原文的準則,標註者應偏好乙。這個例子沒有實際訓練,只用來展示偏好標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文在教模型重視什麼。
如果評分規則只問「哪一份讀起來更順」,甲就可能獲選,系統反而學到掩蓋不確定性。好的標註流程應把內容支持度、完整性與表達品質分開討論,遇到兩份都不合格時也保留原因,而非硬把其中一份當成理想答案。偏好資料能改善行為的前提,是它真正反映產品需要的品質。
訓練後要用新會議紀錄與不同寫法評估,並讓評估者看不到模型身分,減少品牌或版本期待的影響。若模型更常列出「待確認」,仍要核對是否對應真正缺資料,而不是把這個詞當成討好評審的固定句。表面特徵與實際可靠度需要分別檢查,不能只計算某種措辭出現多少次。
獎勵提高,不代表目標都提高
獎勵模型只是在有限資料上學到的代理指標。當回答策略不斷最佳化它,可能找到標註者原本不想鼓勵、卻能拿高分的特徵,例如過度冗長、自信措辭或重複強調某種價值。這類獎勵漏洞不需要模型有人的意圖,也可能由最佳化自然形成。應持續抽查高分輸出是否真的符合原始要求。
偏好也可能和真實性衝突。迎合使用者的錯誤前提,往往比指出矛盾更令人舒服,但舒適不等於正確。InstructGPT 論文本身也明示模型仍會犯簡單錯誤,並討論它對齊的是特定群體的偏好。不能把經過 RLHF 當成全面安全、沒有偏誤或不會幻覺的證明,這些需要獨立評估。
如何理解產品上的回饋按鈕
使用者按讚或回報錯誤,可能成為服務方後續分析資料的一部分,但資料如何儲存、是否用於訓練及何時更新,取決於具體產品政策。這個操作本身不代表當次對話立刻對模型參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文做強化學習。即時調整回答、長期記憶和後續批次訓練,是不同機制,不能從一個回饋按鈕推定。
DPO 等直接偏好方法同樣使用偏好資料,但以不同目標直接訓練策略,不需要照典型 RLHF 流程另訓獎勵模型再做線上強化學習。兩者是理解偏好訓練的重要鄰近概念。閱讀模型報告時,應看它實際使用哪種資料和更新方式,而不是把所有人類評分都統稱為同一條流程。
評估 RLHF 成果,可以要求看到未見問題、不同任務和不同標註群體的結果,也應保留不一致與失敗案例。若只在同一套獎勵模型上分數提高,證據仍有限。模型學會了什麼,最終要回到真實任務中的內容品質、誠實表達和可驗證行為,而不是只看訓練曲線向上。偏好資料也需要版本。當摘要準則從追求簡潔改為保留所有待決事項,舊標註可能不再符合新目標;重用資料前要確認準則一致,不能把所有歷史回饋視為同一種正確訊號。
| 方法 | 處理重點 | 需要留意 |
|---|---|---|
| 人工示範 | 展示期望答案 | 常用於初始 SFT |
| 偏好比較 | 選較符合準則的回答 | 反映特定評分規則 |
| 獎勵與強化學習 | 近似偏好並更新策略 | 分數可能被過度最佳化 |
監督式微調(SFT):用好示範教模型完成任務監督式微調(SFT):用好示範教模型完成任務監督式微調以輸入和期望輸出作為訓練示範,讓既有模型學習更穩定的任務行為。本文用會議待辦整理說明資料配對、對話角色、損失計算與保留測試集,區分 SFT、少樣本提示、LoRA 和偏好最佳化,也解釋示範中的猜測與格式錯誤如何被學進去。讀完能檢查訓練資料是否真的教會模型保留未知資訊,而不是只學會看起來完整。閱讀全文
直接偏好最佳化(DPO):用回答比較直接調整模型直接偏好最佳化(DPO):用回答比較直接調整模型直接偏好最佳化利用同一問題下的較佳與較差回答,直接調整模型對回答的相對偏好。本文依原始論文和 TRL 文件說明參考模型、偏好配對及訓練目標,以產品說明摘要示範資料如何影響結果,也區分 DPO、SFT 與典型 RLHF。讀完能理解它省略了哪些訓練環節,以及為什麼流程較簡單仍不能跳過資料品質、評估和能力退化檢查。閱讀全文
人工介入(Human-in-the-loop):讓人有資訊也有決定權人工介入(Human-in-the-loop):讓人有資訊也有決定權人工介入是在 AI 工作流程中設計人的判斷、修正或批准節點,不只是加一個確認按鈕。本文用活動公告發布示範草稿審閱、修改後重查、批准範圍與執行結果,說明即時介入和事後抽查的差別,也討論資訊不足、疲勞與權限不清如何讓人形同橡皮圖章。讀完能檢查人是否真正看得到證據、改得了結果,並能在必要時停止流程。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算