Vera Rubin NVL72 není jen nová generace GPU, ale kompletní racková platforma pro takzvané AI továrny: spojuje 72 GPU Rubin, 36 procesorů Vera, NVLink 6, síťové čipy ConnectX 9 a BlueField 4. Nvidia tvrdí, že v benchmarku SemiAnalysis AgentX dosahuje Vera Rubin až 30× vyšší propustnosti agentních úloh na megawatt než...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next generation Vera Rubin NVL72 platform, Vera CPU, Scale In networking, and partnerships, including the. Article summary: Nvidia’s announcement positions Vera Rubin as a rack scale, full stack “AI factory,” not merely a faster GPU generation: it combines custom GPUs, CPUs, scale up and scale out networking, DPUs, and power management softwa. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Nvidia představila Vera Rubin jako mnohem víc než rychlejší generaci akcelerátorů. Firma ji popisuje jako rackovou, hardwarově i softwarově propojenou „AI továrnu“: celek tvoří GPU, vlastní CPU, síťové prvky, datové procesory a software pro řízení spotřeby. Cílem je zvýšit množství užitečné práce, kterou datové centrum zvládne na jeden megawatt, a snížit náklady na generování tokenů. Hlavní výkonnostní čísla však pocházejí z benchmarku podporovaného výrobcem, nikoli z nezávislého akademického ověření. 8
Základem je kapalinou chlazený rack Vera Rubin NVL72 se 72 GPU Rubin a 36 procesory Vera. Nvidia do něj dále integruje síťové karty ConnectX-9 SuperNIC, datové procesory BlueField-4 DPU a přepínače šesté generace NVLink. 36
Konfigurace má fungovat jako jeden těsně propojený 72GPU systém, tedy jako jediný rozsáhlý výpočetní celek. Pro spojení s dalšími racky Nvidia počítá s Quantum-X800 InfiniBand nebo ethernetovou platformou Spectrum-X. 3
Nejvýraznější tvrzení se týká agentní AI – systémů, které nejen odpovídají na dotaz, ale také opakovaně plánují, volají nástroje, spouštějí kód a kontrolují výsledky. Nvidia uvádí, že Vera Rubin NVL72 nabízí v těchto úlohách až 30× vyšší propustnost na megawatt než GB300 NVL72. Současně má v citovaném srovnání dosahovat až 35× nižších nákladů na token. 89
Nvidia už dříve obecně uváděla, že Rubin může proti platformě Blackwell snížit náklady na inference token až desetinásobně. 11 Tato čísla ale nelze automaticky chápat jako univerzální cenu za milion tokenů. Výsledek závisí na modelu, délce kontextu, požadované rychlosti odpovědi, konfiguraci systému i způsobu započítání energie a infrastruktury.
Měření využilo benchmark AgentX od společnosti SemiAnalysis. Ten přehrává produkčně podobné relace agentního programování včetně růstu kontextu, volání nástrojů a spouštění podagentů. Jako model byl použit DeepSeek V4 Pro. 89
Takový test se liší od klasického měření maximálního počtu operací GPU. U dlouhých interaktivních úloh se do výsledku promítá práce CPU, propustnost paměti, komunikace mezi akcelerátory, orchestrace i opakované průchody modelem.
Dostupné podklady potvrzují srovnání s GB300, neposkytují však přímo srovnatelný primární údaj pro Hopper. Stejně tak z nich nelze odvodit ověřenou částku v dolarech za jeden milion tokenů. Agentní pracovní postupy obecně spotřebují více tokenů než jednorázový chat, protože zahrnují iterativní uvažování a práci s nástroji. Přesný násobek oproti Hopperu ani univerzální cenu za milion tokenů proto z dostupných zdrojů stanovit nelze.
Nvidia současně prosazuje platformu DSX, která pokrývá čipy, celé systémy, software, datacentra i partnerské technologie. Její součástí je DSX MaxLPS, software zaměřený na maximalizaci počtu zpracovaných tokenů na jednotku energie, nikoli jen na dosažení nejvyššího okamžitého příkonu. 1215
Prakticky to znamená snahu rozdělovat výkon a elektrickou energii podle toho, kde v celé AI továrně vzniká úzké hrdlo. To může být důležité v době, kdy nasazení AI neomezuje pouze dostupnost akcelerátorů, ale také kapacita elektrické sítě, chlazení a prostor datového centra.
Procesor Vera je vlastní návrh Nvidie kompatibilní s instrukční sadou Armv9.2. Obsahuje 88 jader Olympus a podporuje 176 vláken Spatial Multithreading. Nvidia jej cílí na vysoce paralelní úlohy, které obklopují samotné inference: zpracování dat, orchestraci agentů, vyhledávání, spouštění nástrojů, izolované vykonávání kódu a simulace. 210
Čip používá paměť LPDDR5X v modulech SOCAMM2 s propustností až 1,2 TB/s, respektive až 14 GB/s na jádro. Druhá generace Scalable Coherency Fabric propojuje všech 88 jader, sdílenou cache L3, paměť a vstupně-výstupní rozhraní s propustností až 3,4 TB/s. Sjednocená cache L3 má podle Nvidie kapacitu 164 MB. 78
Ve srovnání s procesorem Grace Nvidia uvádí 2,4× vyšší propustnost paměti, trojnásobnou kapacitu paměti a dvojnásobnou propustnost NVLink-C2C pro koherentní komunikaci mezi CPU a GPU. 1
Nvidia rozlišuje několik vrstev propojení:
„Scale-in“ tedy není náhradou za síťování mezi racky. Jde o vnitřní vrstvu, která má z desítek akcelerátorů vytvořit jeden co nejlépe spolupracující celek. Scale-out pak tento celek rozšiřuje na úroveň celého clusteru.
Nvidia uvedla, že SpaceXAI nasadí procesory Vera pro další generaci agentních úloh a rozšíří infrastrukturu Groku na platformě Vera Rubin při směřování ke kapacitě v řádu gigawattů. 10
Společnosti zároveň plánují rozšířit tuto architekturu do připravovaného orbitálního projektu Starmind. První generace družice má využít optimalizovaný systém Vera Rubin NVL72 jako výpočetní náklad. Jde však o plánované nasazení; dostupné informace nepotvrzují, že by dnes na oběžné dráze fungovalo orbitální AI datové centrum. 1012
Pokud se tvrzení Nvidie promítnou do reálných zákaznických instalací, hlavním přínosem Vera Rubin nemusí být pouze vyšší výkon modelů. Důležitější může být množství dokončené agentní práce na jeden omezený megawatt – a s ním potenciálně nižší náklady na elektřinu, chlazení, síťování i kapitálové vybavení na vygenerovaný token.
Nvidia tím také rozšiřuje své působiště za hranice samotných GPU. Dodává vlastní Arm CPU, koherentní CPU–GPU systémy, rackové přepínače, DPU a software pro provoz AI továren. Tato integrace může posílit její pozici vůči konkurenčním výrobcům akcelerátorů i zavedeným dodavatelům serverových procesorů. Zároveň ale zvyšuje závislost zákazníků na architektuře a softwarovém ekosystému Nvidie.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Vera Rubin NVL72 není jen nová generace GPU, ale kompletní racková platforma pro takzvané AI továrny: spojuje 72 GPU Rubin, 36 procesorů Vera, NVLink 6, síťové čipy ConnectX 9 a BlueField 4.
Vera Rubin NVL72 není jen nová generace GPU, ale kompletní racková platforma pro takzvané AI továrny: spojuje 72 GPU Rubin, 36 procesorů Vera, NVLink 6, síťové čipy ConnectX 9 a BlueField 4. Nvidia tvrdí, že v benchmarku SemiAnalysis AgentX dosahuje Vera Rubin až 30× vyšší propustnosti agentních úloh na megawatt než GB300 NVL72 a až 35× nižších nákladů na token.
Procesor Vera má 88 jader Olympus, 176 vláken Spatial Multithreading a paměťovou propustnost až 1,2 TB/s.