라이프스타일

NVIDIA: CoreWeave, 클라우드에서 Vera Rubin NVL72 제공 시작… Devin 개발사 Cognition이 첫 실서비스 고객

NVIDIA 블로그에 따르면 AI 전용 클라우드 업체 CoreWeave가 NVIDIA의 새 AI 시스템 Vera Rubin NVL72를 제공하기 시작했고, AI 에이전트용 Vera CPU와 모델·에이전트 개선 플랫폼 CoreWeave Forge도 내놓습니다. AI 서비스를 만드는 기업과 개발자에게 어떤 변화인지, 일반 사용자에게는 어떤 의미인지 정리했습니다.

읽는 데 약 8분

NVIDIA: CoreWeave, 클라우드에서 Vera Rubin NVL72 제공 시작… Devin 개발사 Cognition이 첫 실서비스 고객
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

NVIDIA 블로그는 2026년 9월 30일 게시글에서 CoreWeave가 이번 주 샌프란시스코에서 열린 CoreWeave Fully Connected 행사에서 Spectrum-X 102.4T 이더넷을 탑재한 NVIDIA Vera Rubin NVL72 시스템 제공을 발표했다고 밝혔습니다. NVIDIA는 이로써 CoreWeave가 이 플랫폼을 고객에게 가장 먼저 제공한 클라우드 사업자 중 하나가 되었다고 설명했습니다.

NVIDIA 블로그에 따르면, AI 소프트웨어 엔지니어 Devin을 개발한 응용 AI 연구소 Cognition이 Vera Rubin에서 프로덕션 워크로드를 실행하는 첫 고객입니다. 여기서 '프로덕션'은 시험용이 아니라 실제 사용자에게 서비스되는 환경을, '워크로드'는 컴퓨터가 처리하는 작업을 뜻합니다. NVIDIA는 CoreWeave가 이달 초 첫 Vera Rubin NVL72 프로덕션 랙(서버 장비를 한데 모아 담는 캐비닛)을 받았고, 며칠 만에 Cognition을 위한 프로덕션용 클러스터를 구축했다고 밝혔습니다.

NVIDIA: CoreWeave, 클라우드에서 Vera Rubin NVL72 제공 시작… Devin 개발사 Cognition이 첫 실서비스 고객
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

또한 NVIDIA는 CoreWeave가 NVIDIA Vera CPU도 제공하고, NVIDIA 가속 컴퓨팅에서 모델과 에이전트를 학습·평가·개선하는 통합 환경인 CoreWeave Forge를 출시한다고 밝혔습니다. AI 에이전트는 사람이 단계마다 지시하지 않아도 여러 단계의 작업을 스스로 이어서 수행하는 AI를 말합니다. NVIDIA 부사장 Ian Buck은 Volta 출시 후 거의 10년이 지난 지금도 CoreWeave의 V100 GPU가 여전히 고객 워크로드를 실행하고 있다고 언급했습니다.

NVIDIA가 공개한 성능 수치

NVIDIA 블로그에 따르면, Cognition은 GB200 NVL72를 비교 기준으로 삼아 테스트했습니다. 테스트에는 FrontierCode에서 뽑은 과제를 AI 에이전트가 해결하는 실제 소프트웨어 엔지니어링 작업을 사용했습니다. 초기 테스트에서 SWE-2 추론 워크로드 기준 Vera Rubin NVL72의 총 토큰 처리량이 최대 4.8배 향상되었습니다. '추론'은 학습을 마친 AI 모델이 실제로 답을 만들어 내는 과정이고, '토큰'은 AI가 글을 처리하는 작은 단위입니다. 토큰 처리량이 높을수록 같은 시간에 더 많은 답을 만들어 낼 수 있습니다. Cognition 창립 멤버 Silas Alberti는 에이전트 기반 코딩에는 긴 컨텍스트, 높은 동시성, 대량의 토큰이 따르며, 토큰당 비용이 자신들이 무엇을 출시할 수 있는지를 결정한다고 말했습니다.

CPU 측면에서 NVIDIA는 CoreWeave의 Vera 배포가 랙 하나에 CPU 128개, 코어 11,264개를 탑재한다고 밝혔습니다. 환경 하나에 코어 하나씩 쓰면 11,000개 이상의 환경을 동시에 돌릴 수 있다는 설명입니다. CoreWeave는 테스트에서 에이전트 샌드박스 시작 속도가 3배 이상 빨라졌고, Terminal-Bench의 통과한 모든 과제에서 1.7배의 성능 향상을 확인했습니다. 샌드박스는 에이전트가 다른 시스템에 영향을 주지 않도록 따로 떼어 놓은 격리 실행 환경입니다.

CoreWeave 관련 신규 서비스 및 NVIDIA 공개 수치 정리(출처: NVIDIA 블로그)
항목NVIDIA 블로그 내용상태
Vera Rubin NVL72GB200 NVL72 대비 SWE-2 추론 총 토큰 처리량 최대 4.8배(Cognition 초기 테스트)CoreWeave Cloud 제공 발표
NVIDIA Vera CPU랙당 CPU 128개, 코어 11,264개; 샌드박스 시작 3배 이상 빠름CoreWeave Cloud에 출시 예정
CoreWeave ARIA실험 분석 지원, 실험 및 코드 수정 제안정식 제공
CoreWeave Sandboxes격리된 CPU 또는 GPU 환경에서 에이전트, RL, 평가 실행정식 제공
CoreWeave Agent Lens장애 탐지 20% 향상, 수정 비용 절반(공식 설명)신규 서비스
RL Rollouts실행 중 새 체크포인트 로드, 재배포 불필요비공개 프리뷰

CoreWeave Forge란

NVIDIA 블로그에 따르면, CoreWeave Forge는 세 가지를 하나로 묶은 환경입니다. Weights & Biases, OpenPipe의 후학습 전문 역량, 오픈소스 marimo 노트북 프로젝트입니다. 후학습은 기본 학습을 마친 모델을 추가로 다듬는 과정입니다. Forge의 목표는 실제 서비스에서 나타난 모델의 동작이 다음 학습에 반영되도록 하는 것이며, 특정 모델, 프레임워크, 클라우드에 묶이지 않는 개방성을 유지합니다. 이 중 ARIA와 Sandboxes는 정식 제공되며, Agent Lens는 신규 서비스입니다.

NVIDIA는 또한 서버리스 강화학습(RL)이 자체 관리 설정보다 학습 속도가 1.4배 빠르고 비용이 40% 낮다고 밝혔습니다. 강화학습은 AI가 시도한 결과에 대한 보상을 바탕으로 스스로 개선하는 학습 방식이고, '서버리스'는 사용자가 서버를 직접 준비하거나 관리하지 않아도 된다는 뜻입니다. 오픈소스 추론 프레임워크 NVIDIA Dynamo는 CoreWeave의 관리형 추론 서비스와 비공개 프리뷰 중인 RL Rollouts를 지원합니다. RL Rollouts는 학습 중 저장한 모델 상태인 체크포인트를 실행 중인 서비스에 바로 불러옵니다. NVIDIA에 따르면 Canva, Capital One, MasterClass는 Forge에서 개발을 시작한 첫 기업들 가운데 일부입니다.

일반 독자에게 주는 의미

이번 소식의 핵심은 차세대 AI 하드웨어가 클라우드 프로덕션 환경에 들어가기 시작했다는 점입니다. AI 코딩 어시스턴트 같은 에이전트형 서비스는 막대한 연산이 필요합니다. NVIDIA가 밝힌 처리량 향상이 실제 사용에서도 유효하다면 최종 사용자는 더 빠른 응답과 더 매끄러운 다단계 추론을 체감할 수 있습니다. NVIDIA는 의료 분야도 예로 들었습니다. 그 설명에 따르면 15개 주에 걸쳐 약 50,000명의 Medicare 환자에게 서비스를 제공하는 Ennoble Care는 CoreWeave에서 RTX PRO 6000 GPU를 활용할 예정입니다. 용도는 임상 문서화, 의사결정 지원, 행정 자동화용 AI 에이전트의 확장입니다.

  • 일반 사용자는 별도의 조치가 필요 없습니다. 이는 클라우드 및 기업 수준의 인프라 업데이트입니다.
  • 개발자에게는 격리 샌드박스와 후학습 도구의 정식 출시가 AI 에이전트 구축의 진입 장벽을 낮출 수 있지만, 자체 테스트 결과를 기준으로 판단해야 합니다.
  • 성능 수치는 업체와 파트너가 제시한 것이므로, 향후 독립적인 평가가 나오는지 지켜볼 필요가 있습니다.

자주 묻는 질문

Vera Rubin NVL72란 무엇인가요?

NVIDIA 블로그에 따르면 NVIDIA의 차세대 AI 인프라 시스템으로, CoreWeave가 자사 클라우드에서 Spectrum-X 102.4T 이더넷과 함께 제공한다고 발표했습니다.

4.8배 성능 향상은 믿을 만한가요?

NVIDIA가 인용한 Cognition의 초기 테스트 결과로, GB200 NVL72를 기준으로 SWE-2 추론 워크로드에서의 '최대' 향상 폭이며, 아직 독립적인 검증은 없습니다.

첫 사용자는 누구인가요?

NVIDIA 블로그에 따르면 Cognition이 Vera Rubin에서 실제 서비스 작업을 실행하는 첫 고객입니다. Cognition은 AI 소프트웨어 엔지니어 Devin을 만든 응용 AI 연구소입니다.

Vera CPU는 일반 CPU와 무엇이 다른가요?

NVIDIA는 Vera가 AI 에이전트용으로 만든 첫 CPU이며, 격리된 에이전트 환경을 대량으로 동시에 실행하는 데 중점을 둔다고 설명합니다. CoreWeave 배포는 랙당 코어 11,264개를 갖추고 있습니다.

제가 매일 쓰는 AI 서비스에 영향이 있나요?

간접적으로 있을 수 있습니다. 인프라 성능이 NVIDIA 설명대로 향상된다면 이러한 클라우드 서비스를 사용하는 AI 앱의 응답이 빨라질 수 있지만, 실제 효과는 각 서비스 제공업체의 배포에 따라 달라집니다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일