生活分享
Google Cloud 發布 Gemini 強化學習微調(RLFT)最佳實務:用「獎勵」而非標準答案客製模型
Google Cloud 部落格介紹其受管理的 RL 微調服務,說明企業開發者如何用自己寫的評分規則(獎勵函式)調整 Gemini、何時該用,以及早期採用者的使用情境。功能與成效均為 Google Cloud 自述,未經獨立證實。
閱讀時間約 5 分鐘

發生了什麼事
Google Cloud 部落格刊出由 Google 資深軟體工程師 Jiaqi Pan 與資深產品經理 Kunal Jha 撰寫的指南,說明如何透過強化學習(RL,讓模型依照評分回饋反覆改進的訓練方式)客製 Gemini 模型。所謂「微調」,是在已訓練好的模型上針對特定任務再做調整。Google Cloud 指出,強化學習是現代大型語言模型後訓練(模型基本訓練完成後的進一步調整)的關鍵,但需要大型訓練叢集與模型內部存取權,而外部客戶在 Gemini 這類專有模型上無法取得。因此 Google Cloud 表示已將其包裝成受管理的 RL 微調服務:客戶只需提供提示詞(交給模型的任務指令)與獎勵函式(替模型回答打分數的程式),基礎設施與模型內部由 Google 處理。
根據 Google Cloud 的描述,服務在每個訓練步驟會產生多個候選回應、用使用者的獎勵評分,並讓高分回應更可能出現,同時讓模型貼近原始 Gemini。強化學習的細節完全受管理,使用者需要負責、也最影響結果的,是獎勵本身。
閱讀完整文字說明
消息會先蒐集來源、獨立查核,再交由 Jev 判斷。
RLFT 與 SFT 有何不同
監督式微調(SFT)是給模型一批「標準答案」讓它模仿;Google Cloud 所描述的 RLFT 則是寫一個評分程式,讓模型朝高分方向改進。Google Cloud 列出 RLFT 的三項特性:從模型自身輸出學習,因此對無關能力的干擾往往少於 SFT;獎勵結果而非路徑;以及放大既有能力,能讓偶爾的成功變得可靠,但無法教會模型從未展現的技能。
| 面向 | 監督式微調(SFT) | 強化學習微調(RLFT) |
|---|---|---|
| 學習依據 | 標註好的示範答案 | 使用者定義的獎勵訊號 |
| 適合任務 | 容易提供示範的任務 | 難以示範但容易評分的任務 |
| 多種正確答案 | 單一參考答案可能誤罰其他正確解 | 只要結果好就能得分 |
| 對無關能力影響 | 依 Google Cloud 說法相對較大 | 依 Google Cloud 說法往往較小 |
| 限制 | 可能在關鍵指標上停滯 | 無法教會模型從未展現的技能 |
Google Cloud 建議先用盡提示詞與 SFT。若基礎模型已有部分成功,可直接用 RLFT;若成功率太低或手上有 SFT 資料,可採兩階段做法:先以輕量 SFT 暖啟動(先讓模型有個基本起點),再透過 Continuous Tuning 從 SFT 檢查點(訓練過程中保存的模型版本)接續進行 RL。
Google Cloud 提到的使用情境
- 遊戲 AI NPC:以 Gemini 自動評分器(LLM-as-a-judge)評分角色扮演與語言;Google Cloud 稱循環與語言漂移消失。
- 結構化實體擷取:以規則型精確率/召回率獎勵,Google Cloud 稱在雜訊多的真實文件上提升欄位準確度,把人工審查轉為自動化。
- 內容審核:以 Cloud Run 獎勵結合格式驗證與確定性評分器,Google Cloud 稱大幅減少誤判與需人工處理的量。
- 以執行結果衡量的程式碼:在安全沙箱執行 SQL 或 API 呼叫再評分,Google Cloud 稱讓非技術使用者能以自然語言查詢專有資料。
- HTML 簡報產生:渲染投影片後評分版面與設計,Google Cloud 稱產出風格一致、無版面溢出的簡報。
對一般讀者與企業的實際影響
對一般使用者而言,這類技術可能讓企業內的 AI 工具在特定工作上更可靠,例如更準確地從發票擷取資料,或讓不懂程式的人用自然語言查詢公司資料。對企業開發者而言,Google Cloud 強調關鍵在於獎勵設計:好的獎勵應與人類偏好相關、能處理格式錯誤的輸出而不崩潰,並抵抗「獎勵駭取」,也就是模型鑽評分漏洞而非真正完成任務。Google Cloud 也建議嚴格分離訓練與評估資料、從預設值起步,並選擇驗證獎勵飽和時的檢查點,而非最後一步。
常見問題
RLFT 是什麼?
根據 Google Cloud,RLFT 是受管理的強化學習微調服務,讓客戶以自訂獎勵函式而非標註答案來調整 Gemini,強化學習的基礎設施與模型內部由 Google 處理。
一定要用 RLFT 才能客製 Gemini 嗎?
不是。Google Cloud 建議先用盡提示詞與監督式微調,只有在能評分但難以撰寫答案、SFT 停滯或答案有多種正確形式時,RLFT 才特別有價值。
RLFT 能讓模型學會全新技能嗎?
依 Google Cloud 說法不能。RLFT 放大既有能力,讓偶爾的成功變得可靠,但無法教會模型從未展現的技能;成功率太低時,可先用 SFT 暖啟動。
什麼是獎勵駭取?
指模型找出評分方式的漏洞以取得高分,卻沒有真正完成任務。Google Cloud 建議使用多個評審、懲罰過長輸出,並優先採用可驗證的檢查,而非僅依賴模型意見。
文中的成效可信嗎?
這些案例來自 Google Cloud 自述的早期採用者經驗,沒有公開具體數據,也未經獨立驗證,宜視為廠商說法。
同主題延伸閱讀
生活分享
NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起價 4,999 美元,兩台可串接成 128GB
NVIDIA 於 2026 年 10 月 2 日宣布,個人 AI 電腦 DGX Spark 新增較平價的 64GB 記憶體版本,10 月 23 日起由 Acer、ASUS 等六家廠商供應,主要對象是想在自己機器上執行 AI 模型的開發者與研究人員。以下整理 NVIDIA 公布的規格、雙機串接說法,以及對一般讀者的意義。
生活分享
Google Cloud 宣布 Spanner queues 正式推出:把訊息佇列放進資料庫交易,瞄準 AI 代理可靠性
Google Cloud 宣布 Spanner queues 正式推出,讓訊息建立成為資料庫交易的一部分,目標是解決 AI 代理「狀態」與「動作」不同步的問題。本文整理官方說法、主要功能與對一般讀者的意義。
生活分享
GPT-6.1 Sol 推出:新一版 Sol 上 API、Codex 與 ChatGPT Work,Chat 裡沒有
OpenAI 在 2026 年 9 月 29 日推出 GPT-6.1 Sol,API 名稱是 gpt-6.1-sol:Plus、Pro、Business、Enterprise、Edu 方案的 Codex 與 ChatGPT Work 在首發推出範圍內,Enterprise 與 Edu 要管理員啟用,Free 與 Go 首發不含,Chat 裡沒有(2026 年 9 月查證)。
生活分享
Claude Sonnet 5.5 推出:牌價與 Sonnet 5 相同,API、雲端平台與 Claude.ai 都能用
Anthropic 在 2026 年 9 月 28 日推出 Claude Sonnet 5.5,API 牌價與 Sonnet 5 相同(每百萬 tokens 輸入 2 美元、輸出 10 美元);Claude.ai、API 與多個雲端平台可用,較高風險的資安請求會退回 Sonnet 5 處理(2026 年 9 月查證)。
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算