NVIDIA podaje, że Vera Rubin NVL72 osiągnęła do 30 razy wyższą przepustowość agentowej inferencji na megawat oraz do 35 razy niższy koszt tokenów niż GB300 NVL72 w teście SemiAnalysis AgentX z modelem DeepSeek V4 Pro. Bezpośrednie porównanie dotyczy Vera Rubin i GB300 NVL72.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next-generation Vera Rubin NVL72 platform’s efficiency for agentic AI workloads—including its claimed inf. Article summary: NVIDIA’s headline claim is that Vera Rubin NVL72 can deliver up to 30× higher agentic-inference throughput per megawatt than GB300 NVL72 and reduce cost per token by up to 35×, based on its stated SemiAnalysis AgentX res. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
NVIDIA przedstawia Vera Rubin NVL72 jako platformę infrastrukturalną stworzoną z myślą o obciążeniach, w których agenci wielokrotnie generują tokeny, wywołują narzędzia, uruchamiają kod i rozbudowują kontekst. Według wyników opublikowanych przez firmę system zapewnił do 30 razy większą przepustowość na megawat niż GB300 NVL72, a koszt tokenów miał spaść nawet 35-krotnie w teście AgentX z modelem DeepSeek V4 Pro.
To imponujące deklaracje, ale należy czytać je z odpowiednim zastrzeżeniem. Dostępne materiały nie podają konkretnego kosztu Vera Rubin w dolarach za milion tokenów ani nie przedstawiają niezależnej, przeprowadzonej dokładnie w tych samych warunkach weryfikacji głównych wyników.
Najważniejsze liczby przedstawione przez producenta to:
AgentX nie jest typowym testem polegającym na zadaniu modelowi jednego krótkiego pytania. Benchmark odtwarza sesje programistyczne przypominające rzeczywistą pracę agentów: kontekst rośnie, pojawiają się wywołania narzędzi, wykonywany jest kod, a agent może uruchamiać kolejne podagenty. 6
To istotna różnica. Agent może wygenerować odpowiedź, sprawdzić rezultat, skorzystać z zewnętrznego narzędzia, uruchomić kod, utworzyć następne zadanie i kontynuować rozumowanie przy znacznie większym kontekście. Taki cykl obciąża nie tylko akceleratory, lecz także pamięć, procesory, sieć i system zasilania.
Bezpośrednie porównanie 30-krotnego wzrostu dotyczy Vera Rubin NVL72 i GB300 NVL72, a nie platformy Hopper. W osobnych materiałach NVIDIA podaje, że GB300 NVL72 zapewnia do 15 razy większą przepustowość na megawat niż system H200 Hopper w teście z DeepSeek V4 Pro.
Ta informacja pokazuje deklarowany kierunek rozwoju kolejnych generacji, ale nie daje podstaw do ogłaszania jednego, skumulowanego wyniku 450 razy. Są to dwa oddzielne porównania typu „do”, a dostępne dane nie zawierają jednej tabeli pokazującej Vera Rubin, GB300 i Hopper w identycznych warunkach.
To samo dotyczy kosztów. Materiały potwierdzają deklarację NVIDIA o maksymalnie 35-krotnym obniżeniu kosztu względem GB300, ale nie podają konkretnej ceny Vera Rubin za milion tokenów ani bezpośredniego wyniku kosztowego Vera Rubin kontra Hopper.
NVL72 to system o skali całego racka, łączący 72 procesory graficzne Rubin i 36 procesorów Vera z kartami sieciowymi ConnectX-9 SuperNIC oraz układami BlueField-4 DPU. NVIDIA opisuje NVLink 6 jako warstwę komunikacji wewnątrz systemu, a Quantum-X800 InfiniBand i Spectrum-X Ethernet jako rozwiązania do skalowania między systemami. 23
W praktyce rack ma działać jak ściśle zintegrowany komputer, a nie zbiór niezależnych serwerów z akceleratorami. Ma to znaczenie przy pracy agentowej, gdzie wydajność zależy od sprawnej koordynacji GPU, procesorów, pamięci, sieci i pamięci masowej.
Vera to 88-rdzeniowy procesor oparty na zaprojektowanych przez NVIDIA rdzeniach Olympus. Wykorzystuje technologię Spatial Multithreading i pamięć LPDDR5X, oferując do 1,2 TB/s przepustowości pamięci. NVIDIA twierdzi, że Vera pozwala skrócić czas realizacji zadań nawet 1,8 raza względem procesorów x86 w obciążeniach obejmujących agentową AI, uczenie ze wzmocnieniem i przetwarzanie danych. 15
Nie chodzi więc wyłącznie o uruchamianie tradycyjnego systemu operacyjnego. Procesor ma obsługiwać pracę towarzyszącą inferencji, w tym:
Założenie jest proste: jeśli te czynności zostaną przyspieszone, GPU może w większym stopniu koncentrować się na inferencji, a nie czekać na kolejne etapy pętli agenta. 159
BlueField-4 to wyspecjalizowany element infrastruktury firmy NVIDIA. DPU łączy 64-rdzeniowy procesor Grace, pamięć LPDDR5X i układy sieciowe ConnectX-9, zapewniając łączność o przepustowości do 800 Gb/s. 1
Według NVIDIA BlueField-4 przenosi poza główne procesory i GPU część zadań związanych z zarządzaniem, bezpieczeństwem, przesyłaniem danych i orkiestracją. DPU ma dzięki temu pełnić rolę warstwy infrastrukturalnej, która pomaga utrzymać izolowane, bezpieczne i przewidywalne działanie dużej „fabryki AI”. 1
Na tym opiera się koncepcja NVIDIA określana jako Scale-In. Efektywność nie zależy wyłącznie od samego GPU. Liczy się również to, jak sprawnie cały rack obsługuje komunikację, pamięć masową, harmonogramowanie i bezpieczeństwo — bez odbierania akceleratorom zasobów potrzebnych do pracy modeli.
DSX MaxLPS jest oprogramowaniem w ramach szerszej koncepcji NVIDIA DSX AI Factory, a nie osobnym procesorem Vera Rubin. NVIDIA opisuje je jako zestaw technologii mających maksymalizować wydajność tokenową na megawat przy ustalonym limicie mocy. Podejście obejmuje między innymi chłodzenie cieczą i optymalizację na poziomie racka, aby operatorzy mogli uruchamiać więcej GPU w pobliżu ich najbardziej energooszczędnych punktów pracy.
Dlatego DSX MaxLPS ma związek z deklaracją 30-krotnej poprawy efektywności. Wynik mierzony na poziomie całej „fabryki AI” może zależeć nie tylko od krzemu, lecz także od chłodzenia, konfiguracji racka i oprogramowania infrastrukturalnego. Dostępne dane nie pozwalają jednak rozdzielić, jaka część poprawy wynika z poszczególnych elementów.
NVIDIA i SpaceXAI poinformowały, że SpaceXAI planuje wdrożyć procesory Vera do obsługi kolejnej generacji agentowych obciążeń AI oraz rozbudować infrastrukturę stojącą za Grokiem z wykorzystaniem platformy Vera Rubin. 45
Firmy opisały również plany rozszerzenia zoptymalizowanego systemu Vera Rubin NVL72 na orbitę, aby zasilić pierwszego satelitę Starmind AI. 4
Są to jednak zapowiedzi przyszłych wdrożeń. Nie stanowią dowodu, że orbitalny system oparty na NVL72 został już wyniesiony w kosmos albo rozpoczął pracę.
Znaczenie Vera Rubin NVL72 wynika z próby mierzenia infrastruktury AI w sposób bliższy rzeczywistej pracy agentów. Zamiast pojedynczej odpowiedzi mamy długie, iteracyjne sesje, rosnący kontekst, wywołania narzędzi, wykonywanie kodu i pracę podagentów. W takim obciążeniu NVIDIA deklaruje do 30 razy większą przepustowość na megawat oraz do 35 razy niższy koszt tokenów względem GB300 NVL72.
Dla klientów i zespołów odpowiedzialnych za infrastrukturę kluczowe pytanie brzmi jednak nie „czy mnożnik wygląda imponująco?”, lecz „czy podobny wynik utrzyma się przy naszym modelu, docelowym opóźnieniu, długości kontekstu, poziomie współbieżności, limicie mocy i całkowitym koszcie posiadania?”. Dostępne źródła dokumentują deklarację NVIDIA i opisują architekturę platformy, ale nie dostarczają jeszcze niezależnego, ostatecznego werdyktu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA podaje, że Vera Rubin NVL72 osiągnęła do 30 razy wyższą przepustowość agentowej inferencji na megawat oraz do 35 razy niższy koszt tokenów niż GB300 NVL72 w teście SemiAnalysis AgentX z modelem DeepSeek V4 Pro.
NVIDIA podaje, że Vera Rubin NVL72 osiągnęła do 30 razy wyższą przepustowość agentowej inferencji na megawat oraz do 35 razy niższy koszt tokenów niż GB300 NVL72 w teście SemiAnalysis AgentX z modelem DeepSeek V4 Pro. Bezpośrednie porównanie dotyczy Vera Rubin i GB300 NVL72. NVIDIA osobno twierdzi, że GB300 zapewnia do 15 razy większą przepustowość na megawat niż systemy Hopper w podobnym teście.
NVL72 łączy 72 układy GPU Rubin z 36 procesorami Vera, a układy DPU BlueField 4 przejmują zadania infrastrukturalne, takie jak sieć, bezpieczeństwo, orkiestracja i przesyłanie danych.