生活分享

人類回饋強化學習(RLHF):把偏好變成訓練訊號

RLHF 利用人類對行為或回答的回饋,建立訓練獎勵並改善模型策略。本文以活動摘要的回答比較說明示範、偏好標註、獎勵模型和強化學習的分工,介紹典型流程與其他偏好方法的差異,也拆解為什麼討喜不等於真實、獎勵分數不等於所有人的價值。讀完能看懂回饋如何影響模型,以及標註分歧、獎勵漏洞和分佈改變的限制。

更新日期: 閱讀時間約 6 分鐘

兩份回答經人類偏好比較,選擇訊號再傳向模型
圖片:Mokaair (© Mokaair)

人類回饋強化學習,英文 Reinforcement Learning from Human Feedback,簡稱 RLHF,是把人類對模型行為的判斷轉成訓練訊號,再用強化學習調整行為的做法。它不限於語言模型;早期研究也以人類偏好比較教導代理行為。在聊天模型情境,人們常比較多個回答,選出更符合指定準則的一個。

這裡主要說明 InstructGPT 研究裡常被引用的流程:先學人工示範,再收集回答比較,訓練獎勵模型,最後依獎勵調整語言模型。這是典型實作,不是 RLHF 的唯一固定配方。理解這條路徑後,你會知道聊天介面的按讚並不等於當場更新模型,也能分辨偏好資料與模型真實能力之間的距離。

人類提供的不是完整公式

很多工作很難用一條簡單規則評分,例如摘要是否清楚、回答是否有幫助、語氣是否恰當。人類可能比較容易在兩個具體候選中做判斷,研究便利用這種相對偏好形成資料。標註仍要有準則,否則同一回答可能因長度、禮貌或個人經驗而被不同人選中,模型收到的訊號也會不一致。

原始人類偏好研究展示了利用比較資料學習獎勵,再調整代理行為的方向。在語言模型中,這個思路可以讓訓練目標更貼近人們希望的回答方式。但「人類回饋」不是一個超越立場的公正來源,它來自特定標註者、任務及規則。報告應說清楚誰評、依什麼評,以及哪些情境未涵蓋。

典型流程如何串起來

以 InstructGPT 的方法為例,首先用人工寫的理想回答做監督式,讓模型具備跟隨指令的基本行為。接著對同一提示詞產生多個候選,請標註者排序,再訓練獎勵模型預測人類較偏好的回答。獎勵模型是在近似標註模式,並不是能直接衡量真理或善惡的儀器。

最後用強化學習更新回答策略,使模型傾向產生獎勵較高的內容,同時限制與參考行為偏離過大。該研究使用 PPO,但 RLHF 不等於 PPO 的別名。實務流程也可能反覆收集新回饋、重新訓練與評估。每個階段產生不同成果:比較資料、獎勵模型和可對話模型不能混成同一個東西。

人工比較回答形成偏好資料,用來訓練獎勵模型,再透過強化學習更新回答策略,最後以獨立評估核對
獎勵模型近似偏好,不能取代最終的獨立評估。 · 圖片:Mokaair (© Mokaair)

示範:比較兩份活動摘要

假設輸入是一份虛構讀書會紀錄,要求摘要重點並保留未決事項。候選甲短而流暢,卻把尚未確認的下次日期寫成已決定;候選乙稍長,但清楚分開已定事項和待確認內容。依忠於原文的準則,標註者應偏好乙。這個例子沒有實際訓練,只用來展示偏好在教模型重視什麼。

如果評分規則只問「哪一份讀起來更順」,甲就可能獲選,系統反而學到掩蓋不確定性。好的標註流程應把內容支持度、完整性與表達品質分開討論,遇到兩份都不合格時也保留原因,而非硬把其中一份當成理想答案。偏好資料能改善行為的前提,是它真正反映產品需要的品質。

訓練後要用新會議紀錄與不同寫法評估,並讓評估者看不到模型身分,減少品牌或版本期待的影響。若模型更常列出「待確認」,仍要核對是否對應真正缺資料,而不是把這個詞當成討好評審的固定句。表面特徵與實際可靠度需要分別檢查,不能只計算某種措辭出現多少次。

獎勵提高,不代表目標都提高

獎勵模型只是在有限資料上學到的代理指標。當回答策略不斷最佳化它,可能找到標註者原本不想鼓勵、卻能拿高分的特徵,例如過度冗長、自信措辭或重複強調某種價值。這類獎勵漏洞不需要模型有人的意圖,也可能由最佳化自然形成。應持續抽查高分輸出是否真的符合原始要求。

偏好也可能和真實性衝突。迎合使用者的錯誤前提,往往比指出矛盾更令人舒服,但舒適不等於正確。InstructGPT 論文本身也明示模型仍會犯簡單錯誤,並討論它對齊的是特定群體的偏好。不能把經過 RLHF 當成全面安全、沒有偏誤或不會幻覺的證明,這些需要獨立評估。

如何理解產品上的回饋按鈕

使用者按讚或回報錯誤,可能成為服務方後續分析資料的一部分,但資料如何儲存、是否用於訓練及何時更新,取決於具體產品政策。這個操作本身不代表當次對話立刻對模型做強化學習。即時調整回答、長期記憶和後續批次訓練,是不同機制,不能從一個回饋按鈕推定。

DPO 等直接偏好方法同樣使用偏好資料,但以不同目標直接訓練策略,不需要照典型 RLHF 流程另訓獎勵模型再做線上強化學習。兩者是理解偏好訓練的重要鄰近概念。閱讀模型報告時,應看它實際使用哪種資料和更新方式,而不是把所有人類評分都統稱為同一條流程。

評估 RLHF 成果,可以要求看到未見問題、不同任務和不同標註群體的結果,也應保留不一致與失敗案例。若只在同一套獎勵模型上分數提高,證據仍有限。模型學會了什麼,最終要回到真實任務中的內容品質、誠實表達和可驗證行為,而不是只看訓練曲線向上。偏好資料也需要版本。當摘要準則從追求簡潔改為保留所有待決事項,舊標註可能不再符合新目標;重用資料前要確認準則一致,不能把所有歷史回饋視為同一種正確訊號。

概念對照;來源查證於 2026 年 9 月。
方法處理重點需要留意
人工示範展示期望答案常用於初始 SFT
偏好比較選較符合準則的回答反映特定評分規則
獎勵與強化學習近似偏好並更新策略分數可能被過度最佳化

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享