生活分享

Google Cloud 推出针对强化学习优化的 GKE Agent Sandbox,称沙箱启动快 10 至 45 倍

Google Cloud 宣布 GKE Agent Sandbox RL 优化版本、编排 SDK 与 RL 工具集成正式提供,并公布自家基准数据。本文整理其内容、数字与对普通读者的意义;所有性能数据均来自 Google Cloud 自行发布,未经独立验证。

阅读时间约 6 分钟

Google Cloud 推出针对强化学习优化的 GKE Agent Sandbox,称沙箱启动快 10 至 45 倍
图片:Mokaair (Original editorial artwork)

Google Cloud 宣布了什么

Google Cloud 在一篇页面标注日期为 2026 年 9 月 30 日的博客文章中宣布,推出针对强化学习优化的 GKE Agent Sandbox,连同 Agent Sandbox RL 编排 SDK,以及与常见 RL gym(供 AI 练习任务的训练环境)和工具的原生集成,并称这些项目现已正式提供。文章作者为产品经理 Tinsley Shi 与资深软件工程师兼技术负责人 Tomer Glottmann。

根据 Google Cloud 的说法,训练 AI 智能体时,模型在 GPU(训练 AI 用的昂贵芯片)上生成代码等动作,再放进隔离的 CPU 沙箱执行以获取反馈。规模扩大后,昂贵的 GPU 会闲置,等待沙箱冷启动(从零启动环境)、大量数 GB 镜像(打包好的软件运行环境)下载与调度积压。Google Cloud 将 GKE Agent Sandbox 形容为用于安全运行智能体的开放 Kubernetes(管理大量云端程序的开源系统)基础组件,内置 SandboxWarmPool,预先准备好随时可用的环境,并支持快照、暂停与恢复。

Google Cloud 推出针对强化学习优化的 GKE Agent Sandbox,称沙箱启动快 10 至 45 倍
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

  • 编排 SDK:据 Google Cloud 表示,提供异步 Python API,研究人员无需编写 Kubernetes YAML 配置文件。
  • 工具集成:Google Cloud 列出 Gymnasium、NVIDIA NeMo Gym 与 OpenHands。
  • 控制器:Google Cloud 称 Agent Sandbox Controller v1.0.0 加入速率控制,限制预热池补充速度,以维持 etcd(Kubernetes 的核心数据存储)与 API 服务器稳定。
  • 客户案例:Google Cloud 称此组件已用于 Mistral AI 的智能体式 RL 训练基础设施。

Google Cloud 公布的基准数字

Google Cloud 表示,测试使用 10 节点的 gVisor(一种沙箱隔离技术)沙箱池,并启用 GKE Image Streaming。工作负载包括 500 个镜像的 SWE-bench 环境,以及 4,578 个镜像的 R2E 语料库,并发规模从 500 到 18,312 个任务。下表中的 Pod 是 Kubernetes 运行程序的基本单位,rollout 指让智能体完整试跑一次任务。Hugging Face 上的 R2E-Gym-Subset 数据集页面显示该数据集有 4,578 行,但这只对应数据集规模,并不验证性能结果。

数据来源:Google Cloud 博客,为厂商自行测试数据
指标原生 Kubernetes Pod 基准GKE Agent Sandbox SDKGoogle Cloud 宣称的改善
首个命令时间(平均)44 至 85 秒1.1 至 8.8 秒约 10 倍
最坏情况等待时间7.5 分钟(450 秒)10 秒以下约 45 倍
Pod 创建数(4,578 个镜像 × 4 次 rollout)18,3125,869变动减少 3.1 倍

Google Cloud 将改善归因于两项变更。一是把镜像预加载移出关键路径,也就是在训练真正需要之前就准备好镜像。二是对控制平面(负责调度和管理集群的部分)做速率调节。至于 Pod 数下降,Google Cloud 表示是因为 SDK 在不同 rollout 之间原地回收复用 Pod,而非删除后重建。Google Cloud 还表示,基准测试工具与负载测试随 agent-sandbox-rl 示例提供,可在自己的集群中重现对比。

为什么这件事值得关注

对普通读者而言,这属于 AI 公司“幕后设施”的更新。如今许多 AI 智能体需要学会写代码、操作工具,训练时必须反复在安全隔离的环境里试运行。Google Cloud 指出,同步 RL 训练步骤必须等批次中最慢的沙箱就绪才能继续,因此沙箱启动慢,会让昂贵的 GPU 空等。

若 Google Cloud 的说法成立,AI 实验室可以用较少的闲置算力完成更多智能体训练与评测,间接影响 AI 编程助手等产品的开发速度。Google Cloud 还引述 Mistral AI 研究工程师 Jean-Malo Delignon 的话,称可在单个集群处理超过 30,000 个沙箱的峰值。

取舍与限制

Google Cloud 坦言,这套做法是预先花费较便宜的 CPU 与后台集群时间为环境预热,以换取 GPU 不闲置。Google Cloud 也强调,SDK 会将每个失败的沙箱计数并标记为可重试,而不是静默丢弃。原因是未追踪的丢失会造成奖励偏差,也就是训练所依据的反馈信号失真。对普通用户来说,这项更新不会直接改变手中的 App,主要影响对象是大规模训练 AI 智能体的研究团队与初创公司。

常见问题

GKE Agent Sandbox 是什么?

根据 Google Cloud 的说法,它是用于安全运行 AI 智能体的开放 Kubernetes 基础组件,内置预热环境池,并支持快照、暂停与恢复。此次发布的是针对强化学习优化的版本,连同编排 SDK 与工具集成。

“快 45 倍”是怎么算的?

Google Cloud 称,最坏情况的沙箱等待时间由 7.5 分钟(450 秒)降到 10 秒以下。平均首个命令时间则由 44 至 85 秒降到 1.1 至 8.8 秒,约快 10 倍。这些都是 Google Cloud 在自家 10 节点测试环境中的结果。

这些数据有独立验证吗?

目前没有。所有性能数字均来自 Google Cloud 自家博客。Google Cloud 表示可通过 agent-sandbox-rl 示例在自己的集群重现对比,但目前未见第三方验证结果。

普通用户会受到影响吗?

不会直接受影响。这是供 AI 实验室与初创公司训练 AI 智能体使用的云基础设施。若效果如 Google Cloud 所述,可能让相关团队更高效地训练与评测智能体,但对个人用户的具体影响尚无数据。

哪些公司在使用?

Google Cloud 称 Mistral AI 已用它支撑智能体式 RL 训练基础设施,并引述该公司研究工程师的说法。其他客户在文章中未列出。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享