English version: Read in English
NVIDIA와 CoreWeave가 Vera Rubin을 단순히 더 빠른 가속기로 소개하는 데 그치지 않고, 에이전틱 AI의 운영·평가·후속학습·재배포를 하나의 닫힌 루프로 묶는 인프라로 제시하고 있다.
NVIDIA와 CoreWeave는 2026년 9월 30일 NVIDIA Vera Rubin NVL72 시스템의 CoreWeave Cloud 생산 환경 제공 확대를 발표했다. Devin을 만든 Cognition은 이 플랫폼에서 실제 생산 워크로드를 운영하는 첫 고객으로 소개됐다.
표면적으로는 또 하나의 하드웨어 성능 발표처럼 보인다. 그러나 더 중요한 변화는 경쟁 단위가 단일 가속기의 벤치마크에서 벗어나, 서비스 운영·평가·강화학습·후속학습·재배포를 연결하는 전체 생산 루프로 이동하고 있다는 점이다.
Vera Rubin은 ‘칩’보다 ‘시스템’으로 판매되고 있다
NVIDIA 발표는 Vera Rubin NVL72뿐 아니라 Spectrum-X 102.4T Ethernet과 Vera CPU를 함께 강조한다. CoreWeave도 새 세대를 기존 운영모델과 연결해 고객이 전체 인프라를 다시 설계하지 않고 이전할 수 있다는 점을 내세운다.
에이전틱 워크로드에서는 이런 구조가 중요해질 수 있다. 실제 운영 중인 AI 에이전트는 새로운 실패 사례와 평가 데이터, 작업 로그를 계속 만든다. 이 데이터가 다시 후속학습과 모델 개선에 들어가면 운영과 학습의 경계가 짧아진다.
성능 수치는 공급자 발표라는 점을 분리해야 한다
CoreWeave는 Cognition이 총 토큰 처리량에서 4.8배 증가를 보고 있으며, 강화학습 워크로드에서는 동일한 상호작용 조건에서 NVIDIA GB200 NVL72 대비 GPU당 출력 토큰 처리량이 3.8배라고 밝혔다.
이 수치들은 실제 배포 사례라는 의미는 있지만 독립 벤치마크는 아니다. NVIDIA와 CoreWeave는 해당 인프라를 판매하는 당사자다. 워크로드 선택, 소프트웨어 구성, 지연시간 목표, 활용률에 따라 비교 결과는 크게 달라질 수 있다.
CoreWeave는 별도 테스트에서 DeepSeek R1 특정 워크로드 기준 전력당 토큰 처리량이 10배라는 결과도 발표한 바 있다. 하지만 이 역시 특정 모델과 조건에서 나온 공급자 측 수치이므로 전체 AI 워크로드의 경제성으로 일반화해서는 안 된다.
‘루프를 닫는다’는 표현이 중요한 이유
기존에는 학습에서 생산 배포로 이동하는 과정이 비교적 일방향이었다. 모델을 만들고 배포한 뒤 다음 버전에서 다시 학습하는 방식이다. 에이전틱 시스템은 실제 운영에서 나온 행동 데이터와 실패 사례가 곧 다음 개선의 입력이 되기 때문에 훨씬 짧은 순환을 요구한다.
이런 구조에서는 네트워크, 데이터 이동, 서빙 지연시간, 평가 파이프라인, 후속학습 용량이 서로 강하게 연결된다. 전체 루프를 하나의 운영환경에서 처리할 수 있는 클라우드는 단순한 계약상의 락인보다 더 강한 운영상의 전환비용을 만들 수 있다.
아직 확인되지 않은 것
Vera Rubin과 CoreWeave 조합이 모든 클라우드와 워크로드에서 가장 좋은 비용효율을 가진다고 결론내리기에는 이르다. 현재 공개된 핵심 수치는 대부분 공급자 발표에 기반한다. 총비용, 신뢰성, 활용률, 소프트웨어 이동성, 실제 지연시간을 독립적으로 비교한 자료는 아직 제한적이다.
경쟁 구도도 달라질 수 있다. 인프라 경쟁력이 하드웨어 하나가 아니라 하드웨어·네트워크·오케스트레이션·후속학습 시스템의 통합에서 나오기 시작하면, 고객도 GPU 세대보다 전체 AI 생산체계를 비교하게 될 가능성이 커진다.
이번 발표가 보여주는 더 큰 변화
이번 발표의 지속적인 의미는 AI 인프라가 “에이전트를 배포하고, 평가신호를 모으고, 모델을 개선한 뒤 다시 배포하는” 닫힌 운영 루프로 이동하고 있다는 데 있다.
Vera Rubin의 원시 성능도 중요하지만, 더 본질적인 경쟁력은 실제 워크로드에서 이 루프를 얼마나 빠르고 저렴하며 안정적으로 돌릴 수 있는가다. 그 부분은 공급자들의 초기 수치를 넘어선 추가 검증이 필요하다.