生活分享

Google Cloud 发布 Gemini 强化学习微调(RLFT)最佳实践:用“奖励”而非标准答案定制模型

Google Cloud 在官方博客发布指南,介绍其托管式强化学习微调服务:企业开发者只需编写一个给模型回答打分的程序,就能调整 Gemini,尤其适合难以写出标准答案、却容易判断好坏的任务。文中所述效果均为 Google Cloud 自述,尚无独立验证。

阅读时间约 6 分钟

Google Cloud 发布 Gemini 强化学习微调(RLFT)最佳实践:用“奖励”而非标准答案定制模型
图片:Mokaair (Original editorial artwork)

发生了什么

Google Cloud 博客刊出由 Google 资深软件工程师 Jiaqi Pan 与资深产品经理 Kunal Jha 撰写的指南,说明如何通过强化学习(RL)定制 Gemini 模型。强化学习是让模型反复尝试、根据得分高低改进自己的训练方法;“微调”则是在已训练好的模型基础上,再针对特定任务做调整。Google Cloud 指出,强化学习是现代大语言模型后训练(模型完成基础训练后的进一步调整)的关键,但需要大型训练集群与模型内部访问权限,而外部客户在 Gemini 这类专有模型上无法获得。因此 Google Cloud 表示已将其打包成托管式 RL 微调服务:客户只需提供提示词(输入给模型的指令或问题)与奖励函数,基础设施与模型内部由 Google 处理。

根据 Google Cloud 的描述,该服务在每个训练步骤会生成多个候选回答、用用户的奖励进行评分,并让高分回答更可能出现,同时让模型贴近原始 Gemini。强化学习的细节完全托管,用户需要负责、也最影响结果的,是奖励本身。

Google Cloud 发布 Gemini 强化学习微调(RLFT)最佳实践:用“奖励”而非标准答案定制模型
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

RLFT 与 SFT 有何不同

监督式微调(SFT)是给模型一批“标准答案”让它模仿;Google Cloud 所描述的 RLFT 则是编写一个评分程序,让模型朝高分方向改进。Google Cloud 列出 RLFT 的三项特性:从模型自身输出学习,因此对无关能力的干扰往往少于 SFT;奖励结果而非路径;以及放大既有能力,能让偶尔的成功变得可靠,但无法教会模型从未展现过的技能。

根据 Google Cloud 指南内容整理的比较
维度监督式微调(SFT)强化学习微调(RLFT)
学习依据标注好的示范答案用户定义的奖励信号
适合任务容易提供示范的任务难以示范但容易评分的任务
多种正确答案单一参考答案可能误罚其他正确解只要结果好就能得分
对无关能力的影响据 Google Cloud 说法相对较大据 Google Cloud 说法往往较小
局限可能在关键指标上停滞无法教会模型从未展现过的技能

Google Cloud 建议先用尽提示词与 SFT。若基础模型已有部分成功,可直接使用 RLFT;若成功率太低或手头有 SFT 数据,可采用两阶段做法:先以轻量 SFT 热启动(先用少量示范让模型入门),再通过 Continuous Tuning 从 SFT 检查点(训练过程中保存下来的模型版本)接续进行 RL。

Google Cloud 提到的使用场景

  • 游戏 AI NPC(由 AI 扮演的非玩家角色):以 Gemini 自动评分器(LLM-as-a-judge,即由大模型充当评委)对角色设定、对话流畅度与游戏状态语法评分;Google Cloud 称重复循环与语言漂移(中途切换成错误语言)现象消失。
  • 结构化实体抽取:以基于规则的精确率/召回率(是否凭空编造字段、是否漏掉必填字段)作为奖励,Google Cloud 称在噪声较多的真实文档上提升了字段准确度,把人工审核转为自动化。
  • 内容审核:以 Cloud Run 奖励结合格式验证与确定性评分器(按固定规则打分),Google Cloud 称大幅减少误判与需人工处理的量。
  • 以执行结果衡量的代码:在安全沙箱中执行 SQL(数据库查询语言)或 API 调用再评分,Google Cloud 称让非技术用户能以自然语言查询专有数据。
  • HTML 演示文稿生成:渲染幻灯片后对版面与设计评分,Google Cloud 称产出风格一致、无版面溢出的演示文稿。

对普通读者与企业的实际影响

对普通用户而言,这类技术可能让企业内的 AI 工具在特定工作上更可靠,例如更准确地从发票中提取数据,或让不懂编程的人用自然语言查询公司数据。对企业开发者而言,Google Cloud 强调关键在于奖励设计:好的奖励应与人类偏好相关、能处理格式错误的输出而不崩溃,并能抵御“奖励破解”(reward hacking),也就是模型钻评分漏洞而非真正完成任务。Google Cloud 还建议严格分离训练与评估数据、从默认值起步,并选择验证奖励饱和时的检查点,而非最后一步。

常见问题

RLFT 是什么?

根据 Google Cloud,RLFT 是托管式强化学习微调服务,让客户以自定义奖励函数而非标注答案来调整 Gemini,强化学习的基础设施与模型内部由 Google 处理。

一定要用 RLFT 才能定制 Gemini 吗?

不是。Google Cloud 建议先用尽提示词与监督式微调,只有在能评分但难以编写答案、SFT 停滞或答案有多种正确形式时,RLFT 才特别有价值。

RLFT 能让模型学会全新技能吗?

据 Google Cloud 说法不能。RLFT 放大既有能力,让偶尔的成功变得可靠,但无法教会模型从未展现过的技能;成功率太低时,可先用 SFT 热启动。

什么是奖励破解?

指模型找出评分方式的漏洞以获得高分,却没有真正完成任务。Google Cloud 建议使用多个评审、惩罚过长输出,并优先采用可验证的检查,而非仅依赖模型意见。

文中的效果可信吗?

这些案例来自 Google Cloud 自述的早期采用者经验,没有公开具体数据,也未经独立验证,宜视为厂商说法。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享