엔비디아는 AI 팩토리의 핵심 지표로 최고 성능 대신 ‘검증된 에이전틱 토큰당 메가와트’를 제시했다. Lambda는 HGX B200 기반 19노드 클러스터에서 DSX MaxLPS를 검증해 토큰 처리량 24%, 와트당 성능 23% 향상을 보고했다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Nvidia present on the opening day of its AI Infra Summit about transforming AI factories from systems optimized primarily for raw p. Article summary: Nvidia’s opening-day message was that an AI factory should be measured not only by peak compute, but by validated agentic tokens produced per megawatt—requiring integrated design across silicon, systems, networking, soft. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
AI 인프라의 제약은 이제 랙에 GPU를 몇 장 넣을 수 있느냐만의 문제가 아니다. 실제 데이터센터 운영에서는 공급 가능한 전력이 더 먼저 한계에 닿을 수 있다. 엔비디아는 2026 AI 인프라 서밋 첫날, AI 팩토리의 성과를 판단할 핵심 지표로 **‘메가와트당 에이전틱 토큰’**을 내세웠다. 정해진 전력 예산 안에서 얼마나 많은 유효 추론 작업을 처리하느냐가 중요하다는 뜻이다. 2
3
엔비디아의 하이퍼스케일·고성능컴퓨팅 부문 부사장 이안 벅은 미국 캘리포니아주 산타클라라 행사에서 이 전략을 소개했다. 메시지는 GPU 성능 자체를 넘어선다. 전력이 제약 조건이 된 환경에서 생산성을 유지하려면 컴퓨팅, 네트워킹, 추론 소프트웨어, 냉각, 전력 제어, 전력망 운영이 함께 설계돼야 한다는 주장이다. 1
2
3
가장 구체적인 수치는 AI 클라우드 사업자 Lambda의 검증 결과에서 나왔다. Lambda는 HGX B200 GPU 서버 환경에서 엔비디아 DSX MaxLPS를 처음으로 배포 환경에서 검증했다. 엔비디아에 따르면 이 소프트웨어는 GPU와 랙 단위의 전력 사용량을 모니터링하고, 남는 전력 여유분을 노드 간에 재배분한다. 2
3
보고된 구성은 5개 랙, 19개 노드 클러스터다. Lambda는 통상 전출력 노드 16개에 배정되는 전력 예산 안에서 19개 노드를 운용했고, 클러스터 토큰 처리량은 초당 약 400만 토큰에서 500만 토큰으로 24% 증가했다. 와트당 성능도 23% 개선됐다고 밝혔다. 2
3
핵심은 이론적 효율이 아니라 현장 운영의 여지다. 데이터센터의 용량은 건물 면적보다 실제로 현장에 인입되는 전력에 의해 제한되는 경우가 많다. 워크로드별 전력 사용 패턴이 다르다면, 쓰이지 않는 전력 여유를 소프트웨어로 활용해 증설이나 전력 인입 확대 없이도 유효 처리량을 높일 수 있다.
엔비디아는 향후 Vera Rubin NVL72 배포 환경에서 DSX MaxLPS가 동일한 현장 전력 한도 안에서 GPU 수용량을 최대 40% 늘리고, 토큰 처리량을 최대 35% 높일 수 있다고 제시했다. 다만 이는 배포 조건에 따라 달라질 수 있는 전망치다. 2
3
따라서 Blackwell 기반 Lambda 결과와 같은 선상에서 읽어서는 안 된다. Lambda 수치는 배포 환경에서 보고된 측정 결과인 반면, Vera Rubin 관련 수치는 미래 플랫폼에 대한 엔비디아의 예상이다. 2
3
두 번째 축은 유연성이다. 엔비디아는 모든 AI 작업을 똑같이 긴급하게 취급하지 않는다면, AI 팩토리가 전력망 상황에 맞춰 전력 수요를 조절할 수 있다고 봤다.
엔비디아의 Eos AI 팩토리에서는 Emerald AI의 Conductor 플랫폼이 Silicon Valley Power와 함께 상업용 유연부하 프로그램을 시연했다. 엔비디아는 이 시스템이 200건이 넘는 전력회사 수요 신호에 반응했으며, 한 시연에서 시설 전력 사용량을 1분 이내에 4MW에서 3MW로 낮췄다고 밝혔다. 이 과정에서 유연하게 조정 가능한 컴퓨팅 작업의 우선순위를 낮추고, 더 높은 우선순위의 추론은 계속 처리했다. 2
3
엔비디아는 이를 향후 DSX Flex가 제공하려는 기능의 초기 사례로 제시했다. DSX Flex는 부하 감축, 수요반응, 전력 가격 신호를 받아 워크로드 우선순위에 따라 미룰 수 있는 작업은 중단·재개하고, 핵심 서비스는 유지하도록 설계된다는 설명이다. Eos 시연은 DSX Flex 자체의 설치 사례라기보다 그 이전 단계의 상업 규모 검증 사례다. 2
3
이는 운영자에게 실질적인 선택지를 제공할 수 있다. 학습 작업, 배치 처리, 오프라인 작업은 실시간 서비스 추론과 같은 응답 속도를 항상 요구하지 않는다. 컴퓨팅을 유연부하로 다룰 수 있다면, 핵심 추론 서비스를 보호하면서도 전력망 프로그램에 참여할 여지가 생긴다.
이번 발표에서 엔비디아는 부품 공급업체보다 AI 팩토리 플랫폼 사업자에 가깝게 자신을 규정했다. 제안하는 스택은 Vera Rubin 컴퓨팅, NVLink 스케일업 네트워킹, Dynamo 추론 소프트웨어, 이더넷 및 SuperNIC 네트워킹, BlueField 인프라 구성요소, 랙 단위 전력 최적화, 전력망 인지형 워크로드 운영까지 포괄한다. 2
Groq 3 LPX도 이 포지셔닝의 일부다. 엔비디아는 이를 Vera Rubin용 인터랙티브 추론 가속기로 설명하며, 에이전틱 시스템이 요구하는 낮은 지연 시간과 긴 컨텍스트 처리에 맞춘 제품이라고 밝혔다. 1
12 다만 제공된 근거만으로는 출시 시점, GB200 NVL72 대비 ‘메가와트당 처리량 35배’, 2조 개 이상 파라미터 모델에서의 성능 같은 구체적 주장을 독립적으로 뒷받침하기는 어렵다.
이 메시지는 엔비디아의 데이터센터 사업이 빠르게 확대되는 시점에 나왔다. 2026년 7월 26일 마감한 2027회계연도 2분기, 엔비디아는 매출 962억 달러를 기록해 전년 동기 대비 106% 성장했다고 밝혔다. 이 가운데 데이터센터 매출은 890억 달러였다. 17 회사는 3분기 매출 전망치로 1,080억 달러(±2%)를 제시했다.
28
30
AI 설비가 커질수록 운영의 질문도 달라진다. 전력을 어디서 확보할지, 고정된 전력 한도에서 어떻게 출력을 늘릴지, 전력 및 운영상 교란이 발생해도 추론 서비스를 어떻게 지속할지가 핵심 과제가 된다.
엔비디아의 주장은 GPU의 순수 성능이 중요하지 않다는 뜻은 아니다. 다만 AI 팩토리 경제성에서 최고 성능만으로는 충분하지 않다는 것이다.
‘검증된 메가와트당 토큰’이라는 지표는 하드웨어 성능을 실제 운영 제약과 연결한다. 현장 전력, 전력망 이벤트, 워크로드 우선순위, 시스템 가용성까지 함께 고려하기 때문이다. Lambda가 보고한 처리량 24% 증가는 이 논지를 뒷받침하는 초기 배포 기반 사례다. 반면 Vera Rubin과 DSX의 더 넓은 범위의 효과는 향후 고객 운영 환경에서 검증돼야 할 로드맵으로 남아 있다. 2
3
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
엔비디아는 AI 팩토리의 핵심 지표로 최고 성능 대신 ‘검증된 에이전틱 토큰당 메가와트’를 제시했다.
엔비디아는 AI 팩토리의 핵심 지표로 최고 성능 대신 ‘검증된 에이전틱 토큰당 메가와트’를 제시했다. Lambda는 HGX B200 기반 19노드 클러스터에서 DSX MaxLPS를 검증해 토큰 처리량 24%, 와트당 성능 23% 향상을 보고했다.
Vera Rubin 관련 수치는 향후 배포 환경에 대한 엔비디아의 전망치이며, Lambda 결과와 구분해서 볼 필요가 있다.