English: Read in English
NVIDIA와 CoreWeave가 이번에 내놓은 메시지의 핵심은 ‘더 빠른 칩’ 하나가 아니다. 실행→관찰→평가→개선→재배포가 반복되는 에이전트 업무 전체를 하나의 생산 인프라로 묶겠다는 방향이다.
2026년 9월 30일 NVIDIA와 CoreWeave는 NVIDIA Vera Rubin NVL72 시스템이 CoreWeave Cloud에서 제한적으로 생산 환경에 들어가기 시작했다고 발표했다. Devin을 개발한 Cognition이 첫 생산 고객으로 소개됐다.
이번 발표가 흥미로운 이유는 성능 경쟁의 단위가 단일 가속기에서 전체 운영 루프로 이동하고 있기 때문이다. NVIDIA와 CoreWeave는 GPU, 네트워크, CPU, 클라우드 소프트웨어를 장시간 에이전트 워크로드에 맞춰 하나의 스택으로 설명한다.
점점 ‘칩’보다 ‘루프’가 상품이 된다
전통적인 AI 인프라 비교는 학습 처리량이나 추론 속도에 초점을 맞췄다. 하지만 에이전트 시스템은 도구 호출, 샌드박스, 메모리, 오케스트레이션, 평가, 반복 개선까지 함께 처리해야 한다.
CoreWeave는 Vera Rubin NVL72, Spectrum-X 102.4T Ethernet, 향후 제공할 Vera CPU를 하나의 생산 플랫폼으로 연결하려 한다. NVIDIA도 이를 학습과 배포, 관찰, 후속 학습을 이어주는 폐쇄형 운영 루프로 설명한다.
이렇게 되면 경쟁 질문도 바뀐다. “어떤 가속기가 가장 빠른가”보다 “어떤 인프라가 대규모 에이전트 시스템을 전체 운영 주기 동안 효율적으로 유지할 수 있는가”가 더 중요해진다.
성능 수치는 반드시 출처를 붙여 읽어야 한다
CoreWeave는 Cognition이 Vera Rubin NVL72에서 전체 토큰 처리량이 4.8배 늘었다고 밝혔고, 특정 강화학습 워크로드에서는 GB200 NVL72 대비 GPU당 출력 토큰 처리량이 같은 상호작용성 조건에서 3.8배 높았다고 보고했다.
하지만 이 수치는 CoreWeave의 자체 배포와 벤치마크 조건에서 나온 공급자 보고 수치다. 실제 생산 고객이 시스템을 사용하고 있다는 근거로는 의미가 있지만, 모든 워크로드와 모든 클라우드 환경에서 같은 경제성이 재현된다는 독립적 증거는 아니다.
‘생산 준비 완료’라는 표현도 범위를 좁혀야 한다. 현재는 선택된 고객을 대상으로 한 제한적 가용성 단계다.
에이전트 스택에서 CPU가 다시 중요해지는 이유
CoreWeave는 에이전트용으로 설계된 NVIDIA Vera CPU도 제공할 계획이라고 밝혔다. 논리는 간단하다. GPU가 생성과 추론을 담당하는 동안 CPU는 샌드박스 실행, 도구 호출, 데이터 파이프라인 같은 주변 작업을 점점 더 많이 담당한다는 것이다.
이 방향이 유지된다면 에이전트 인프라는 더 이질적인 구성으로 발전할 가능성이 크다. 모든 단계를 하나의 프로세서에 몰아넣기보다 작업 성격에 따라 특화된 부품이 역할을 나눠 맡는 구조다.
더 큰 변화는 인프라 경쟁의 기준이다
이번 발표에서 봐야 할 핵심은 CoreWeave에 새로운 랙이 들어왔다는 사실 자체가 아니다. AI 인프라 업체들이 점점 단발성 모델 호출보다 장시간 자율 작업을 전제로 최적화를 시작했다는 점이다.
에이전트가 길게 실행되고 더 많은 도구를 쓰게 되면 인프라 효율성은 추론 속도 하나로 결정되지 않는다. 네트워크, CPU 작업, 오케스트레이션 오버헤드, 후속 학습, 평가까지 전체 피드백 루프의 비용과 성능이 중요해진다.
아직 남은 가장 중요한 질문은 상업성이다. 공급자 발표에서 제시된 성능 향상이 다양한 실제 워크로드에서 일관된 단위 경제성 개선으로 이어지는지는 더 많은 독립 데이터가 필요하다.