生活分享

Google Cloud 推出針對強化學習最佳化的 GKE Agent Sandbox,稱 AI 代理訓練用沙箱啟動快 10 至 45 倍

Google Cloud 宣布正式提供針對強化學習最佳化的 GKE Agent Sandbox、編排 SDK 與 RL 工具整合,稱可大幅縮短 AI 代理訓練時沙箱的啟動等待,減少昂貴 GPU 閒置。主要影響大規模訓練 AI 代理的實驗室與新創;所有效能數據均為 Google Cloud 自行公布,尚未見獨立驗證。

閱讀時間約 6 分鐘

Google Cloud 推出針對強化學習最佳化的 GKE Agent Sandbox,稱 AI 代理訓練用沙箱啟動快 10 至 45 倍
圖片:Mokaair (Original editorial artwork)

Google Cloud 宣布了什麼

Google Cloud 在 2026 年 9 月 30 日的部落格文章中宣布,推出針對強化學習最佳化的 GKE Agent Sandbox,連同 Agent Sandbox RL 編排 SDK(開發工具包),以及與常見 RL gym 和工具的原生整合,並稱這些項目現已正式提供。強化學習是讓 AI 反覆嘗試、依結果好壞取得回饋來學習的訓練方法。文章作者為產品經理 Tinsley Shi 與資深軟體工程師暨技術負責人 Tomer Glottmann。

根據 Google Cloud 的說法,訓練 AI 代理(能自行寫程式、操作工具的 AI)時,模型在 GPU 上產生程式碼等動作,再放進隔離的 CPU 沙箱執行以取得回饋。沙箱是與外界隔開、讓程式安全執行的環境。規模放大後,昂貴的 GPU 會閒置等待沙箱冷啟動(從零開始啟動)、大量多 GB 映像檔(打包好程式與執行環境的檔案)下載與排程積壓。Google Cloud 形容 GKE Agent Sandbox 是用於安全執行代理的開放 Kubernetes 基本元件;Kubernetes 是管理大量雲端容器的開源系統。它內建 SandboxWarmPool,預先準備好可用的環境,並支援快照、暫停與恢復。

Google Cloud 推出針對強化學習最佳化的 GKE Agent Sandbox,稱 AI 代理訓練用沙箱啟動快 10 至 45 倍
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

  • 編排 SDK:據 Google Cloud 表示,提供非同步 Python API,研究人員不必撰寫 Kubernetes YAML 設定檔。
  • 工具整合:Google Cloud 列出 Gymnasium、NVIDIA NeMo Gym 與 OpenHands。
  • 控制器:Google Cloud 稱 Agent Sandbox Controller v1.0.0 加入速率控制,限制預熱環境池的補充速度,以維持叢集核心元件 etcd 與 API 伺服器穩定。
  • 客戶案例:Google Cloud 稱此元件已用於 Mistral AI 的代理式 RL 訓練基礎設施。

Google Cloud 公布的基準數字

Google Cloud 表示,測試使用 10 節點的 gVisor 沙箱池並啟用 GKE Image Streaming,工作負載包括 500 個映像檔的 SWE-bench 環境,以及 4,578 個映像檔的 R2E 語料庫,並行規模由 500 到 18,312 個任務。Hugging Face 上公開的 R2E-Gym-Subset 資料集共有 4,578 列。表中「首個指令時間」指從要求沙箱到能執行第一個指令所需的時間;Pod 是 Kubernetes 執行程式的基本單位,rollout 則是模型的一次試跑。

資料來源:Google Cloud 部落格,為廠商自行測試數據
指標原生 Kubernetes Pod 基準GKE Agent Sandbox SDKGoogle Cloud 宣稱的改善
首個指令時間(平均)44 至 85 秒1.1 至 8.8 秒約 10 倍
最壞情況等待時間7.5 分鐘(450 秒)10 秒以下約 45 倍
Pod 建立數(4,578 映像檔 × 4 次 rollout)18,3125,869變動減少 3.1 倍

Google Cloud 將改善歸因於兩項變更:映像檔預先載入移出關鍵路徑,以及控制平面(叢集的管理中樞)的速率調節。至於 Pod 數下降,Google Cloud 表示是因為 SDK 在不同 rollout 之間原地回收重用 Pod,而非刪除後重建。Google Cloud 也表示,基準測試工具與負載測試隨 agent-sandbox-rl 範例提供,可在自己的叢集重現比較。

為什麼這件事值得關注

對一般讀者而言,這屬於 AI 公司「幕後設施」的更新。現在許多 AI 代理需要學會寫程式、操作工具,訓練時必須反覆在安全隔離的環境裡試跑。Google Cloud 指出,同步 RL 訓練步驟必須等批次中最慢的沙箱就緒才能繼續,因此沙箱啟動慢,會讓昂貴的 GPU 空等。

若 Google Cloud 的說法成立,AI 實驗室可以用較少的閒置算力完成更多代理訓練與評測,間接影響 AI 程式助手等產品的開發速度。Google Cloud 也引述 Mistral AI 研究工程師 Jean-Malo Delignon 的話,稱可在單一叢集處理超過 30,000 個沙箱的尖峰。

取捨與限制

Google Cloud 坦言,這套做法是預先花費較便宜的 CPU 與背景叢集時間替環境暖機,以換取 GPU 不閒置。Google Cloud 也強調,SDK 會把每個失敗的沙箱計數並標示為可重試,而不是靜默丟棄,因為未追蹤的遺失會造成獎勵偏差,也就是讓訓練回饋失真。對普通使用者來說,這項更新不會直接改變手上的 App,主要影響對象是大規模訓練 AI 代理的研究團隊與新創公司。

常見問題

GKE Agent Sandbox 是什麼?

根據 Google Cloud 的說法,它是用於安全執行 AI 代理的開放 Kubernetes 基本元件,內建預熱環境池,並支援快照、暫停與恢復。這次發表的是針對強化學習最佳化的版本,連同編排 SDK 與工具整合。

「快 45 倍」是怎麼算的?

Google Cloud 稱,最壞情況的沙箱等待時間由 7.5 分鐘(450 秒)降到 10 秒以下;平均首個指令時間則由 44 至 85 秒降到 1.1 至 8.8 秒,約快 10 倍。這些都是 Google Cloud 在自家 10 節點測試環境的結果。

這些數據有獨立驗證嗎?

目前沒有。所有效能數字均來自 Google Cloud 自家部落格。Google Cloud 表示可透過 agent-sandbox-rl 範例在自己的叢集重現比較,但目前尚未見第三方公布的驗證結果。

一般使用者會受到影響嗎?

不會直接受影響。這是給 AI 實驗室與新創訓練 AI 代理用的雲端基礎設施。若效果如 Google Cloud 所述,可能讓相關團隊更有效率地訓練與評測代理,但對個人用戶的具體影響尚無資料。

哪些公司在使用?

Google Cloud 稱 Mistral AI 已用它支撐代理式 RL 訓練基礎設施,並引述該公司研究工程師的說法。其他客戶在文章中未列出。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享