라이프스타일

Google Cloud, 강화학습에 최적화된 GKE Agent Sandbox 출시…샌드박스 시작 10~45배 빨라졌다고 밝혀

Google Cloud가 AI 에이전트를 강화학습(RL)으로 훈련하는 연구팀을 위해 GKE Agent Sandbox의 RL 최적화 버전, 오케스트레이션 SDK, RL 도구 통합을 정식 제공한다고 발표했다. 코드를 시험 실행하는 격리 환경(샌드박스)이 늦게 준비되면 값비싼 GPU가 노는 문제를 줄이려는 것으로, Google Cloud는 샌드박스 시작이 10~45배 빨라졌다고 밝혔다. 수치는 모두 Google Cloud 자체 발표이며 독립 검증은 확인되지 않았다.

읽는 데 약 8분

Google Cloud, 강화학습에 최적화된 GKE Agent Sandbox 출시…샌드박스 시작 10~45배 빨라졌다고 밝혀
사진: Mokaair (Original editorial artwork)

Google Cloud가 발표한 내용

Google Cloud는 페이지에 2026년 9월 30일로 날짜가 표시된 블로그 글에서 강화학습에 최적화된 GKE Agent Sandbox를 출시한다고 발표했다. Agent Sandbox RL 오케스트레이션 SDK, 주요 RL gym 및 도구와의 네이티브 통합도 함께 내놓았으며, 이들이 현재 정식 제공된다고 밝혔다. 글의 작성자는 프로덕트 매니저 Tinsley Shi와 스태프 소프트웨어 엔지니어이자 테크 리드인 Tomer Glottmann이다.

강화학습은 모델이 행동을 시도하고 그 결과로 받는 보상 신호를 통해 배우는 방식이다. Google Cloud 설명에 따르면 AI 에이전트를 이렇게 훈련할 때 모델은 GPU에서 코드 같은 행동을 만들어 낸다. 이 코드는 격리된 CPU 샌드박스에서 실행되고, 모델은 그 결과로 피드백을 얻는다. 샌드박스는 실행 결과가 바깥에 영향을 주지 않도록 분리된 실행 환경을 말한다. 규모가 커지면 값비싼 GPU가 놀게 된다. 샌드박스를 처음부터 새로 띄우는 콜드 스타트, 대량의 수 GB 이미지 다운로드, 스케줄링 적체를 기다려야 하기 때문이다. Google Cloud는 GKE Agent Sandbox를 에이전트를 안전하게 실행하기 위한 오픈 Kubernetes 기본 구성 요소로 소개했다. Kubernetes는 컨테이너 형태의 프로그램을 여러 서버에 배치하고 관리하는 시스템이다. Google Cloud에 따르면 이 구성 요소에는 미리 초기화된 환경을 유지하는 SandboxWarmPool이 내장되어 있고, 스냅샷, 일시 중지, 재개를 지원한다.

Google Cloud, 강화학습에 최적화된 GKE Agent Sandbox 출시…샌드박스 시작 10~45배 빨라졌다고 밝혀
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

  • 오케스트레이션 SDK: Google Cloud에 따르면 비동기 Python API를 제공해 연구자가 Kubernetes YAML을 작성할 필요가 없다.
  • 도구 통합: Google Cloud는 Gymnasium, NVIDIA NeMo Gym, OpenHands를 열거했다.
  • 컨트롤러: Google Cloud는 Agent Sandbox Controller v1.0.0에 속도 제어를 추가했다고 밝혔다. 웜 풀 보충 속도를 제한해 etcd와 API 서버의 안정성을 유지한다는 설명이다.
  • 고객 사례: Google Cloud는 이 구성 요소가 Mistral AI의 에이전트형 RL 훈련 인프라에 사용되고 있다고 밝혔다.

Google Cloud가 공개한 벤치마크 수치

Google Cloud는 GKE Image Streaming을 활성화한 10노드 gVisor 샌드박스 풀에서 테스트했다고 밝혔다. 워크로드는 이미지 500개 규모의 SWE-bench 환경과 이미지 4,578개 규모의 R2E 코퍼스였고, 동시 실행 규모는 작업 500개부터 18,312개까지였다. Hugging Face의 R2E-Gym-Subset 데이터셋 페이지에는 해당 데이터셋이 4,578행으로 표시되어 있다. 다만 이는 데이터셋 규모와 일치할 뿐 성능 결과를 검증하는 것은 아니다. 아래 표의 Pod는 Kubernetes에서 컨테이너를 실행하는 가장 작은 단위이고, rollout은 모델이 과제 하나를 한 번 시도하는 실행을 뜻한다.

자료 출처: Google Cloud 블로그, 업체 자체 테스트 수치
지표네이티브 Kubernetes Pod 기준GKE Agent Sandbox SDKGoogle Cloud가 주장한 개선
첫 명령까지의 시간(평균)44~85초1.1~8.8초약 10배
최악의 경우 대기 시간7.5분(450초)10초 미만약 45배
Pod 생성 수(이미지 4,578개 × rollout 4회)18,3125,869Pod 생성 약 3.1배 감소

Google Cloud는 개선 요인으로 두 가지 변경을 꼽았다. 첫째는 이미지 사전 로딩을 훈련이 반드시 기다려야 하는 경로, 즉 크리티컬 패스 밖으로 옮긴 것이다. 둘째는 클러스터 전체를 관리하는 컨트롤 플레인의 요청 속도를 조절한 것이다. Pod 수가 줄어든 이유에 대해서는 SDK가 rollout 사이에 Pod를 삭제하고 새로 만드는 대신 그 자리에서 회수해 재사용하기 때문이라고 설명했다. Google Cloud는 또한 벤치마크 도구와 부하 테스트가 agent-sandbox-rl 예제와 함께 제공되므로, 자체 클러스터에서 같은 비교를 재현할 수 있다고 밝혔다.

왜 주목할 만한가

일반 독자에게 이번 발표는 AI 기업이 쓰는 '보이지 않는 인프라'의 업데이트다. 오늘날 많은 AI 에이전트는 코드를 작성하고 도구를 다루는 법을 배워야 하며, 훈련 중에는 안전하게 격리된 환경에서 시험 실행을 반복해야 한다. Google Cloud에 따르면 동기식 RL 훈련 단계는 배치 안에서 가장 느린 샌드박스가 준비될 때까지 다음으로 넘어가지 못한다. 그래서 샌드박스 시작이 느리면 값비싼 GPU가 그동안 놀게 된다는 것이다.

Google Cloud의 주장이 맞다면 AI 연구소는 놀고 있는 컴퓨팅 자원을 줄이면서 더 많은 에이전트 훈련과 평가를 수행할 수 있다. 이는 AI 코딩 도우미 같은 제품의 개발 속도에도 간접적으로 영향을 줄 수 있다. Google Cloud는 Mistral AI의 리서치 엔지니어 Jean-Malo Delignon의 말을 인용해, 단일 클러스터에서 30,000개가 넘는 샌드박스가 한꺼번에 몰리는 상황도 처리할 수 있다고 전했다.

트레이드오프와 한계

Google Cloud는 이 방식이 일종의 맞교환이라고 인정했다. 상대적으로 저렴한 CPU와 백그라운드 클러스터 시간을 미리 들여 환경을 예열하고, 그 대가로 GPU가 놀지 않게 한다는 것이다. 또한 SDK가 실패한 샌드박스를 조용히 버리지 않고 하나하나 집계해 재시도할 수 있다고 표시한다고 강조했다. 추적되지 않은 손실은 보상 편향을 일으키기 때문이라는 설명이다. 이번 업데이트는 일반 사용자가 쓰는 앱을 직접 바꾸지 않는다. 주된 영향 대상은 AI 에이전트를 대규모로 훈련하는 연구팀과 스타트업이다.

자주 묻는 질문

GKE Agent Sandbox란 무엇인가요?

Google Cloud에 따르면 AI 에이전트를 안전하게 실행하기 위한 오픈 Kubernetes 기본 구성 요소입니다. 미리 예열해 둔 환경 풀을 내장하고 있으며 스냅샷, 일시 중지, 재개를 지원합니다. 이번에 발표된 것은 강화학습에 최적화된 버전으로, 오케스트레이션 SDK 및 도구 통합과 함께 제공됩니다.

'45배 빠르다'는 어떻게 계산된 건가요?

Google Cloud는 최악의 경우 샌드박스 대기 시간이 7.5분(450초)에서 10초 미만으로 줄었다고 밝혔습니다. 평균 첫 명령까지의 시간은 44~85초에서 1.1~8.8초로 줄어 약 10배 빨라졌다고 합니다. 모두 Google Cloud 자체 10노드 테스트 환경에서 나온 결과입니다.

이 수치는 독립적으로 검증되었나요?

현재로서는 아닙니다. 모든 성능 수치는 Google Cloud 자체 블로그에서 나온 것입니다. Google Cloud는 agent-sandbox-rl 예제를 이용하면 자체 클러스터에서 비교를 재현할 수 있다고 밝혔지만, 제3자의 검증 결과는 아직 공개된 것이 확인되지 않았습니다.

일반 사용자도 영향을 받나요?

직접적인 영향은 없습니다. 이 제품은 AI 연구소와 스타트업이 AI 에이전트를 훈련할 때 쓰는 클라우드 인프라입니다. Google Cloud의 설명대로 효과가 있다면 관련 팀이 에이전트를 더 효율적으로 훈련하고 평가할 수 있겠지만, 개인 사용자에게 미칠 구체적 영향에 관한 자료는 아직 없습니다.

어떤 기업이 사용하고 있나요?

Google Cloud는 Mistral AI가 에이전트형 RL 훈련 인프라에 이를 사용하고 있다고 밝히며, 이 회사 리서치 엔지니어의 말을 인용했습니다. 다른 고객은 Google Cloud의 글에 나와 있지 않습니다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일