ライフスタイル

Google Cloud、強化学習向けに最適化したGKE Agent Sandboxを発表 サンドボックス起動は10〜45倍高速と主張

Google CloudはGKE Agent SandboxのRL最適化版、オーケストレーションSDK、RLツール統合の一般提供を発表し、自社のベンチマーク数値を公表した。本記事ではその内容、数値、一般読者にとっての意味を整理する。性能データはすべてGoogle Cloudの自社発表で、独立した検証はまだ確認されていない。

読了目安 9 分

Google Cloud、強化学習向けに最適化したGKE Agent Sandboxを発表 サンドボックス起動は10〜45倍高速と主張
画像:Mokaair (Original editorial artwork)

Google Cloudが発表した内容

Google Cloudは、ページ上の日付が2026年9月30日となっているブログ記事で、強化学習(AIに試行錯誤をさせ、結果の良し悪しを報酬として与えて学ばせる手法、RL)向けに最適化したGKE Agent Sandboxを発表した。あわせてAgent Sandbox RLオーケストレーションSDK、一般的なRL gymやツールとのネイティブ統合も発表し、これらは現在一般提供されているとした。記事の執筆者はプロダクトマネージャーのTinsley Shi氏と、スタッフソフトウェアエンジニア兼テックリードのTomer Glottmann氏。

Google Cloudの説明によると、AIエージェントのトレーニングでは、モデルがGPU(AIの計算に使う高価な専用プロセッサー)上でコード生成などのアクションを行い、それを隔離されたCPUサンドボックス(外部に影響しない安全な実行環境)で実行してフィードバックを得る。規模が大きくなると、高価なGPUが待たされて遊休状態になる。待たされる原因は、サンドボックスのコールドスタート(ゼロからの起動)、数GB規模のイメージ(実行環境一式をまとめたファイル)の大量ダウンロード、スケジューリングの滞留である。Google CloudはGKE Agent Sandboxを、エージェントを安全に実行するためのオープンなKubernetes(多数のサーバー上でアプリを管理・実行する仕組み)の基本部品と位置づけている。事前初期化済みの環境を維持するSandboxWarmPoolを内蔵し、スナップショット、一時停止、再開に対応するとしている。

Google Cloud、強化学習向けに最適化したGKE Agent Sandboxを発表 サンドボックス起動は10〜45倍高速と主張
Mokaair 編集検証フロー · 画像:Mokaair (Original editorial artwork)
詳しい説明を読む

情報源を収集し、独立検証を行ってから Jev が判断します。

  • オーケストレーションSDK:Google Cloudによると、非同期のPython APIを提供し、研究者がKubernetesのYAML(設定ファイル)を書く必要がなくなる。
  • ツール統合:Google CloudはGymnasium、NVIDIA NeMo Gym、OpenHandsを挙げている。
  • コントローラー:Google Cloudによると、Agent Sandbox Controller v1.0.0はレート制御を追加した。ウォームプール(待機中の環境)の補充速度を制限することで、etcd(クラスターの状態を保存するデータベース)とAPIサーバーの安定性を保つ。
  • 顧客事例:Google Cloudは、このコンポーネントがMistral AIのエージェント型RLトレーニング基盤で使われているとしている。

Google Cloudが公表したベンチマーク数値

Google Cloudによると、テストは10ノードのgVisorサンドボックスプールでGKE Image Streamingを有効にして実施した。ワークロードは500イメージのSWE-bench環境と4,578イメージのR2Eコーパスで、並列規模は500から18,312タスクまで。Hugging FaceのR2E-Gym-Subsetデータセットページには同データセットが4,578行あると表示されている。ただしこれはデータセットの規模に対応するだけで、性能結果を検証するものではない。下の表の「Pod」はKubernetesでアプリを動かす最小単位、「rollout」はAIが課題に取り組む1回分の試行を指す。

出典:Google Cloudブログ。ベンダーによる自社テストの数値
指標ネイティブKubernetes PodのベースラインGKE Agent Sandbox SDKGoogle Cloudが主張する改善
最初のコマンドまでの時間(平均)44〜85秒1.1〜8.8秒約10倍
最悪ケースの待ち時間7.5分(450秒)10秒未満約45倍
Pod作成数(4,578イメージ × 4回のrollout)18,3125,869変動を3.1倍削減

Google Cloudは、改善の要因として2つの変更を挙げている。1つ目は、イメージの事前読み込みをクリティカルパス(全体の処理時間を左右する流れ)から外したこと。2つ目は、コントロールプレーン(クラスター全体を管理する中枢部分)の負荷を抑えるレート調整である。Pod数の減少については、SDKがPodを削除して再作成するのではなく、rollout間でその場で回収・再利用するためだと説明している。またGoogle Cloudは、ベンチマークツールと負荷テストがagent-sandbox-rlのサンプルとともに提供されており、自分のクラスターで比較を再現できるとしている。

なぜ注目に値するのか

一般の読者にとって、これはAI企業の「裏方の設備」に関するアップデートだ。現在、多くのAIエージェントはコードを書いたりツールを操作したりすることを学ぶ必要がある。そのためトレーニングでは、安全に隔離された環境で試行を繰り返さなければならない。Google Cloudの指摘によると、同期型のRLトレーニングステップは、バッチ内で最も遅いサンドボックスの準備が整うまで先に進めない。このため、サンドボックスの起動が遅いと高価なGPUが待たされる。

Google Cloudの主張どおりであれば、AIラボは遊休の計算資源を減らしつつ、より多くのエージェントのトレーニングと評価を行えるようになる。その結果、AIコーディングアシスタントなどの製品の開発スピードに間接的に影響しうる。Google CloudはMistral AIのリサーチエンジニア、Jean-Malo Delignon氏の言葉も引用し、単一のクラスターで30,000を超えるサンドボックスのピークを処理できるとしている。

トレードオフと制約

Google Cloudは、この手法には代償があると認めている。比較的安価なCPUとバックグラウンドのクラスター時間をあらかじめ使って環境をウォームアップし、その代わりにGPUを遊ばせないようにするという考え方だ。またGoogle Cloudは、SDKが失敗したサンドボックスを黙って破棄せず、一つひとつカウントしてリトライ可能とマークすると強調している。追跡されない欠損は報酬のバイアスを生むためだ。一般ユーザーにとって、このアップデートが手元のアプリを直接変えることはない。主な影響対象は、AIエージェントを大規模にトレーニングする研究チームやスタートアップである。

よくある質問

GKE Agent Sandboxとは何か?

Google Cloudによると、AIエージェントを安全に実行するためのオープンなKubernetesの基本部品である。事前ウォームアップ済みの環境プールを内蔵し、スナップショット、一時停止、再開に対応する。今回発表されたのは強化学習向けに最適化したバージョンで、オーケストレーションSDKとツール統合も含まれる。

「45倍速い」はどう計算されたのか?

Google Cloudによると、最悪ケースのサンドボックス待ち時間が7.5分(450秒)から10秒未満に短縮された。平均の最初のコマンドまでの時間は44〜85秒から1.1〜8.8秒に短縮され、約10倍速くなった。いずれもGoogle Cloudの自社の10ノードのテスト環境での結果である。

これらのデータは独立して検証されているか?

現時点で独立した検証は確認されていない。性能数値はすべてGoogle Cloud自身のブログによるものだ。Google Cloudはagent-sandbox-rlのサンプルを使って自分のクラスターで比較を再現できるとしているが、第三者による検証結果はまだ公表されていない。

一般ユーザーに影響はあるか?

直接の影響はない。これはAIラボやスタートアップがAIエージェントをトレーニングするためのクラウド基盤である。Google Cloudの説明どおりの効果があれば、関係するチームがより効率的にエージェントをトレーニング・評価できる可能性がある。ただし、個人ユーザーへの具体的な影響についてはまだデータがない。

どの企業が使っているのか?

Google Cloudは、Mistral AIがこれをエージェント型RLトレーニング基盤に使っているとし、同社のリサーチエンジニアの発言を引用している。そのほかの顧客は記事に挙げられていない。

このトピックの最新ニュースを見る

最新の旅の情報・ガイド

出典

ライフスタイル