Vera Rubin NVL72 to nie tylko nowa generacja GPU, lecz kompletny, chłodzony cieczą system rack scale: 72 układy Rubin, 36 procesorów Vera, przełączniki NVLink 6, układy ConnectX 9 i DPU BlueField 4. Nvidia deklaruje do 30 razy większą przepustowość obciążeń agentowych na megawat niż w GB300 NVL72 oraz do 35 razy niż...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next generation Vera Rubin NVL72 platform, Vera CPU, Scale In networking, and partnerships, including the. Article summary: Nvidia’s announcement positions Vera Rubin as a rack scale, full stack “AI factory,” not merely a faster GPU generation: it combines custom GPUs, CPUs, scale up and scale out networking, DPUs, and power management softwa. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Nvidia przedstawia Vera Rubin jako kompletną „fabrykę AI” dla epoki agentów, a nie po prostu szybszą generację kart obliczeniowych. Platforma obejmuje procesory GPU i CPU, połączenia między układami i szafami, układy DPU oraz oprogramowanie do zarządzania energią. Celem jest zwiększenie liczby użytecznych zadań wykonywanych przez agentów AI przy ograniczonym poborze mocy.
Najbardziej efektowne liczby pochodzą jednak z materiałów producenta i testu przygotowanego z udziałem firmy SemiAnalysis. Nie są to wyniki niezależnego, recenzowanego badania. 8
Vera Rubin NVL72 to chłodzona cieczą platforma rack-scale, w której znalazły się:
System ma działać jako jeden, ściśle połączony domenowo komputer z 72 GPU. Z kolei połączenia z innymi szafami zapewniają Quantum-X800 InfiniBand albo Ethernet Spectrum-X. 36
To ważna zmiana w sposobie pozycjonowania produktów Nvidii. Firma nie sprzedaje już wyłącznie akceleratora, lecz cały stos: od krzemu i pamięci, przez sieć i chłodzenie, po oprogramowanie sterujące pracą „fabryki AI”.
Według Nvidii Vera Rubin NVL72 zapewnia do 30 razy większą przepustowość obciążeń agentowych na megawat niż platforma GB300 NVL72. W tym samym porównaniu firma mówi o maksymalnie 35-krotnie niższym koszcie tokenów. 89
Nvidia wcześniej deklarowała również nawet 10-krotne obniżenie kosztu tokena inferencji w przypadku architektury Rubin względem Blackwell. 11
Te wartości nie oznaczają uniwersalnego cennika za milion tokenów. Zależą od modelu, długości kontekstu, poziomu interaktywności, konfiguracji sprzętu i przyjętego celu opóźnienia. W dostarczonych materiałach nie ma niezależnie potwierdzonej, dokładnej ceny w dolarach za milion tokenów ani bezpośrednio porównywalnego wyniku dla platformy Hopper.
Nvidia wykorzystała test SemiAnalysis AgentX, który odtwarza sesje programistyczne przypominające rzeczywiste użycie agentów AI. W scenariuszach zachowano między innymi:
W badaniu użyto modelu DeepSeek V4 Pro. 89 Taki test mierzy znacznie więcej niż samą liczbę operacji zmiennoprzecinkowych GPU. W agentowych obciążeniach istotne stają się również przepustowość pamięci, praca CPU, opóźnienia komunikacji oraz sprawne przekazywanie danych między kolejnymi etapami zadania.
Według danych przywoływanych przez Nvidię obciążenia agentowe mogą zużywać około 15 razy więcej tokenów niż pojedyncze zapytanie czatowe, ponieważ agent wielokrotnie analizuje problem, korzysta z narzędzi i koryguje wynik. To właśnie dlatego porównanie „tokenów na megawat” może być dla operatorów centrów danych bardziej praktyczne niż sam wynik benchmarku GPU.
Nvidia rozwija też koncepcję DSX, czyli end-to-endowej konstrukcji „fabryki AI” obejmującej układy, systemy, oprogramowanie, obiekty infrastrukturalne i technologie partnerów.
Jednym z jej elementów jest DSX MaxLPS. Oprogramowanie ma maksymalizować przepustowość tokenów przypadającą na jednostkę mocy, a tym samym obniżać koszt tokena. Chodzi więc nie o nieustanne utrzymywanie sprzętu przy maksymalnym chwilowym poborze energii, lecz o takie rozdzielanie mocy, aby cała infrastruktura wykonywała jak najwięcej użytecznej pracy. 1215
W praktyce może to mieć znaczenie tam, gdzie ograniczeniem nie jest już dostępność akceleratorów, ale przyłącze energetyczne, chłodzenie lub zdolność centrum danych do dostarczenia odpowiedniej mocy na żądanie.
Nvidia określa Verę jako procesor zgodny z architekturą Armv9.2, przeznaczony do infrastruktury ery agentów AI. Układ ma 88 autorskich rdzeni Olympus i 176 wątków Spatial Multithreading. 210
Procesor nie ma zastępować GPU w obliczeniach modelu. Jego rolą jest obsługa zadań otaczających inferencję, takich jak:
W przypadku agentów AI te zadania mogą zajmować istotną część całego procesu. Szybszy CPU ma więc pomóc utrzymać GPU w pracy zamiast pozwalać mu czekać na dane, decyzje orkiestratora lub zakończenie operacji pomocniczych.
Vera korzysta z pamięci LPDDR5X w modułach SOCAMM2. Nvidia deklaruje do 1,2 TB/s łącznej przepustowości pamięci, czyli do około 14 GB/s na rdzeń. Układ ma również 164 MB współdzielonej pamięci podręcznej L3. 78
Drugiej generacji Scalable Coherency Fabric łączy rdzenie, pamięć podręczną, kontrolery pamięci i wejścia-wyjścia, zapewniając do 3,4 TB/s przepustowości bisekcyjnej.
W porównaniu z procesorem Grace Nvidia podaje dla Very:
NVLink-C2C zapewnia spójne komunikacyjnie połączenie CPU–GPU o przepustowości do 1,8 TB/s, czyli siedmiokrotnie większej niż w przypadku PCIe Gen 6. 1
W nomenklaturze Nvidii sieć platformy ma trzy uzupełniające się poziomy:
Rozróżnienie jest istotne: NVLink nie ma zastąpić sieci łączącej całe centrum danych. Ma przede wszystkim zapewnić bardzo szybki, niskolatencyjny „wspólny organizm” wewnątrz domeny 72 GPU, podczas gdy InfiniBand i Ethernet odpowiadają za skalowanie klastra na zewnątrz.
Nvidia poinformowała, że SpaceXAI wdroży procesory Vera do obsługi kolejnych agentowych obciążeń AI. Firma ma także rozbudowywać infrastrukturę dla Groka na platformie Vera Rubin, dążąc do mocy obliczeniowej liczonej w gigawatach. 10
Współpraca ma obejmować również planowany projekt orbitalny Starmind. Pierwszy satelita AI ma bazować na zoptymalizowanym systemie Vera Rubin NVL72, dostosowanym do zastosowań kosmicznych. 1012
To jednak nadal planowana implementacja, a nie dowód na działające dziś orbitalne centrum danych AI. Dostępne materiały nie potwierdzają operacyjnego wdrożenia ani pełnego harmonogramu startu.
Jeśli deklaracje Nvidii przełożą się na rzeczywiste wdrożenia, najważniejszą korzyścią nie będzie wyłącznie wyższa wydajność pojedynczego modelu. Chodzi o większą liczbę użytecznych zadań agentowych wykonanych z każdego megawata — a potencjalnie także o niższe koszty energii, chłodzenia, sieci i infrastruktury przypadające na wygenerowany token.
Nvidia poszerza przy tym pole rywalizacji. Firma konkuruje już nie tylko poprzez GPU, lecz także własny procesor Arm, spójne systemy CPU–GPU, przełączniki rack-scale, DPU i oprogramowanie do zarządzania całymi fabrykami AI. Taka integracja może zwiększyć przewagę nad konkurencyjnymi dostawcami akceleratorów i tradycyjnymi producentami procesorów serwerowych.
Ma też drugą stronę: im więcej elementów infrastruktury pochodzi od jednego dostawcy, tym większa zależność klienta od jego architektury, narzędzi i stosu programistycznego. Vera Rubin jest więc nie tylko premierą sprzętową, ale również próbą ustalenia przez Nvidię standardu dla całego zaplecza obliczeniowego agentów AI.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Vera Rubin NVL72 to nie tylko nowa generacja GPU, lecz kompletny, chłodzony cieczą system rack scale: 72 układy Rubin, 36 procesorów Vera, przełączniki NVLink 6, układy ConnectX 9 i DPU BlueField 4.
Vera Rubin NVL72 to nie tylko nowa generacja GPU, lecz kompletny, chłodzony cieczą system rack scale: 72 układy Rubin, 36 procesorów Vera, przełączniki NVLink 6, układy ConnectX 9 i DPU BlueField 4. Nvidia deklaruje do 30 razy większą przepustowość obciążeń agentowych na megawat niż w GB300 NVL72 oraz do 35 razy niższy koszt tokenów w przywoływanym porównaniu.
Test SemiAnalysis AgentX odtwarza sesje programistyczne z narastającym kontekstem, wywołaniami narzędzi i zadaniami podrzędnymi; w badaniu wykorzystano model DeepSeek V4 Pro.