生活分享

Google Cloud 發布 Gemini 強化學習微調(RLFT)最佳實務:用「獎勵」而非標準答案客製模型

Google Cloud 部落格介紹其受管理的 RL 微調服務,說明企業開發者如何用自己寫的評分規則(獎勵函式)調整 Gemini、何時該用,以及早期採用者的使用情境。功能與成效均為 Google Cloud 自述,未經獨立證實。

閱讀時間約 5 分鐘

Google Cloud 發布 Gemini 強化學習微調(RLFT)最佳實務:用「獎勵」而非標準答案客製模型
圖片:Mokaair (Original editorial artwork)

發生了什麼事

Google Cloud 部落格刊出由 Google 資深軟體工程師 Jiaqi Pan 與資深產品經理 Kunal Jha 撰寫的指南,說明如何透過強化學習(RL,讓模型依照評分回饋反覆改進的訓練方式)客製 Gemini 模型。所謂「微調」,是在已訓練好的模型上針對特定任務再做調整。Google Cloud 指出,強化學習是現代大型語言模型後訓練(模型基本訓練完成後的進一步調整)的關鍵,但需要大型訓練叢集與模型內部存取權,而外部客戶在 Gemini 這類專有模型上無法取得。因此 Google Cloud 表示已將其包裝成受管理的 RL 微調服務:客戶只需提供提示詞(交給模型的任務指令)與獎勵函式(替模型回答打分數的程式),基礎設施與模型內部由 Google 處理。

根據 Google Cloud 的描述,服務在每個訓練步驟會產生多個候選回應、用使用者的獎勵評分,並讓高分回應更可能出現,同時讓模型貼近原始 Gemini。強化學習的細節完全受管理,使用者需要負責、也最影響結果的,是獎勵本身。

Google Cloud 發布 Gemini 強化學習微調(RLFT)最佳實務:用「獎勵」而非標準答案客製模型
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

RLFT 與 SFT 有何不同

監督式微調(SFT)是給模型一批「標準答案」讓它模仿;Google Cloud 所描述的 RLFT 則是寫一個評分程式,讓模型朝高分方向改進。Google Cloud 列出 RLFT 的三項特性:從模型自身輸出學習,因此對無關能力的干擾往往少於 SFT;獎勵結果而非路徑;以及放大既有能力,能讓偶爾的成功變得可靠,但無法教會模型從未展現的技能。

依 Google Cloud 指南內容整理的比較
面向監督式微調(SFT)強化學習微調(RLFT)
學習依據標註好的示範答案使用者定義的獎勵訊號
適合任務容易提供示範的任務難以示範但容易評分的任務
多種正確答案單一參考答案可能誤罰其他正確解只要結果好就能得分
對無關能力影響依 Google Cloud 說法相對較大依 Google Cloud 說法往往較小
限制可能在關鍵指標上停滯無法教會模型從未展現的技能

Google Cloud 建議先用盡提示詞與 SFT。若基礎模型已有部分成功,可直接用 RLFT;若成功率太低或手上有 SFT 資料,可採兩階段做法:先以輕量 SFT 暖啟動(先讓模型有個基本起點),再透過 Continuous Tuning 從 SFT 檢查點(訓練過程中保存的模型版本)接續進行 RL。

Google Cloud 提到的使用情境

  • 遊戲 AI NPC:以 Gemini 自動評分器(LLM-as-a-judge)評分角色扮演與語言;Google Cloud 稱循環與語言漂移消失。
  • 結構化實體擷取:以規則型精確率/召回率獎勵,Google Cloud 稱在雜訊多的真實文件上提升欄位準確度,把人工審查轉為自動化。
  • 內容審核:以 Cloud Run 獎勵結合格式驗證與確定性評分器,Google Cloud 稱大幅減少誤判與需人工處理的量。
  • 以執行結果衡量的程式碼:在安全沙箱執行 SQL 或 API 呼叫再評分,Google Cloud 稱讓非技術使用者能以自然語言查詢專有資料。
  • HTML 簡報產生:渲染投影片後評分版面與設計,Google Cloud 稱產出風格一致、無版面溢出的簡報。

對一般讀者與企業的實際影響

對一般使用者而言,這類技術可能讓企業內的 AI 工具在特定工作上更可靠,例如更準確地從發票擷取資料,或讓不懂程式的人用自然語言查詢公司資料。對企業開發者而言,Google Cloud 強調關鍵在於獎勵設計:好的獎勵應與人類偏好相關、能處理格式錯誤的輸出而不崩潰,並抵抗「獎勵駭取」,也就是模型鑽評分漏洞而非真正完成任務。Google Cloud 也建議嚴格分離訓練與評估資料、從預設值起步,並選擇驗證獎勵飽和時的檢查點,而非最後一步。

常見問題

RLFT 是什麼?

根據 Google Cloud,RLFT 是受管理的強化學習微調服務,讓客戶以自訂獎勵函式而非標註答案來調整 Gemini,強化學習的基礎設施與模型內部由 Google 處理。

一定要用 RLFT 才能客製 Gemini 嗎?

不是。Google Cloud 建議先用盡提示詞與監督式微調,只有在能評分但難以撰寫答案、SFT 停滯或答案有多種正確形式時,RLFT 才特別有價值。

RLFT 能讓模型學會全新技能嗎?

依 Google Cloud 說法不能。RLFT 放大既有能力,讓偶爾的成功變得可靠,但無法教會模型從未展現的技能;成功率太低時,可先用 SFT 暖啟動。

什麼是獎勵駭取?

指模型找出評分方式的漏洞以取得高分,卻沒有真正完成任務。Google Cloud 建議使用多個評審、懲罰過長輸出,並優先採用可驗證的檢查,而非僅依賴模型意見。

文中的成效可信嗎?

這些案例來自 Google Cloud 自述的早期採用者經驗,沒有公開具體數據,也未經獨立驗證,宜視為廠商說法。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享