Nejvyšší souhrnnou propustnost tokenů v tomto kole vykázala konfigurace Crusoe s 512 GPU AMD Instinct MI355X; samotné číslo ale nelze bez přepočtu přímo srovnávat s menšími systémy. Do kola se zapojilo rekordních 30 organizací a bylo zveřejněno 486 výsledků pro datacentra a edge.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What were the key results and broader implications of MLCommons’ MLPerf Inference v6.1 benchmarks, including AMD’s record-setting MI355X per. Article summary: MLPerf Inference v6.1 showed a more competitive and more deployment-oriented inference market: AMD set aggregate-scale records, NVIDIA demonstrated its next platform while retaining strong Blackwell results, Intel broade. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
MLPerf Inference v6.1 není jen žebříček jednotlivých čipů. Mnohem lépe zachycuje, jak se mění provoz AI modelů: o výsledku rozhoduje akcelerátor, software, síť, škálování i schopnost dodržet požadovanou odezvu. Hlavními signály tohoto kola jsou extrémně rozsáhlá konfigurace AMD MI355X, první preview výsledky NVIDIA Vera Rubin, širší zastoupení dostupnějších inferenčních systémů Intelu a nové testy pro RAG a agentní AI.
Praktický závěr je jednoduchý: srovnávat už nelze jen GPU. Relevantní jednotkou je celý dostupný inferenční systém, který obsluhuje konkrétní model při daných latencích.
Nejvýraznější agregovaný výsledek předvedla konfigurace Crusoe s 512 GPU AMD Instinct MI355X. V rámci MLPerf Inference v6.1 dosáhla nejvyšší zveřejněné souhrnné propustnosti tokenů. 5 Jde o podstatnou demonstraci škálování: neprověřuje jen výkon akcelerátorů, ale také distribuovanou inferenci, síťovou infrastrukturu a integraci velmi rozsáhlého systému.
Takový výsledek však nelze bez dalšího označit za absolutní vedení platformy. Sestavu s 512 GPU nelze přímo porovnávat s jedním rackem nebo menším clusterem bez zohlednění počtu GPU, použitého modelu, testovacího scénáře a požadavků na úroveň služby. Pro velký inferenční park je souhrnná propustnost zásadní; pro konkrétní nasazení ale mohou být důležitější výkon na akcelerátor, hustota v racku, spotřeba, dostupnost nebo provozní složitost.
Příběh AMD je zároveň příběhem softwaru. Firma upozorňuje na vyšší výkon stejného hardwaru MI355X oproti předchozímu kolu MLPerf, který připisuje optimalizacím ROCm. To ukazuje, že kompilátory, kernely, běhová prostředí modelů a software pro distribuované obsluhování mohou zvýšit využitelnou kapacitu již instalované infrastruktury i bez výměny hardwaru.
AMD se navíc zavázala k šestitýdennímu rytmu vydávání ROCm. Pokud se tento rytmus promění v trvale nasaditelná zlepšení, může být rychlost softwarového vývoje významnou položkou při výpočtu nákladů na token. Výsledky MLPerf je ale vždy vhodné ověřit na vlastním mixu modelů, kvantizaci, frameworku, charakteru provozu a cílech latence. Zlepšení v jednom benchmarku se do produkce nepřenáší automaticky ve stejném rozsahu.
NVIDIA Vera Rubin NVL72 se v MLPerf Inference objevila poprvé jako preview platforma. NVIDIA uvedla až 3,7krát vyšší propustnost než u GB300 NVL72 v testu Qwen3-VL. Současně její konfigurace 288 GPU GB300 NVL72 ve čtyřech racích dosáhla 99% efektivity škálování. 2
Klíčovým omezením je dostupnost. Preview výsledky jsou užitečným dokladem směru architektury a vyspělosti softwaru, ale nejsou automaticky přímým nákupním srovnáním s běžně dostupnými systémy. V preview kategorii se navíc lišila velikost clusterů, takže smysluplnější než celková propustnost bývá srovnání přepočtené na GPU nebo jinak normalizované. 8
Pro bezprostřední nasazení zůstávají podstatné platformy Blackwell a Blackwell Ultra. CoreWeave například uvedl vedoucí výsledky mezi cloudovými poskytovateli u několika konfigurací Blackwell a Blackwell Ultra pro úlohy Qwen3-VL, DeepSeek-R1 a GPT-OSS-120B. 4 Místo jednoho celkového vítěze tak dává větší smysl rozlišovat scénáře: velké clustery, rackové obsluhování, multimodální inference a interaktivní odezva mohou zvýhodňovat odlišné konfigurace.
Intel ve výsledcích rozšířil pohled na inferenci realizovanou pomocí CPU a profesionálních GPU. Jeho uzel se čtyřmi Arc Pro B70 měl dohromady 128 GB VRAM a byl testován s modely Llama, GPT-OSS-120B, Whisper i s novou end-to-end úlohou RAG. Intel také uvádí softwarové zrychlení stejné konfigurace Arc Pro B70 oproti předchozímu kolu. 3
To neznamená, že Arc Pro přímo nahrazuje hyperscale clustery s datacentrovými akcelerátory. Benchmark je ale díky tomu reprezentativnější pro organizace, které hodnotí menší, levnější či flexibilnější nasazení – zejména tam, kde rozhoduje kapacita paměti, lokální inference nebo využití existující serverové infrastruktury.
MLCommons oznámil rekordních 30 zúčastněných organizací a 486 výsledků pro datacentra a edge. Sada nově zahrnuje end-to-end benchmark RAG pro datacentra a Edge Agentic Inference benchmark, což odráží přesun od jednorázových promptů k vícekrokovým AI aplikacím. 9
To je důležité, protože agentní pracovní zátěže odhalují úzká hrdla, která běžný offline test propustnosti tokenů nemusí ukázat: vícekrokovou komunikaci, používání nástrojů, režii orchestrátoru i odezvu mezi jednotlivými kroky. MLCommons popisuje edge test jako reprezentaci komplexních vícekrokových úloh, například agentního programování. 9
I nadále jde o řízené benchmarky, nikoli o úplný obraz provozu živé služby. Hodnocení se ale posouvá blíže zátěžím, které se týmy skutečně snaží nasazovat.
MLCommons také naznačil možný další směr v podobě MLPerf Endpoints. Rozdíl je podstatný: zatímco dnes se výsledky odevzdávají v pravidelných benchmarkových kolech, přístup orientovaný na endpointy by mohl sledovat výkon fungujících obslužných rozhraní. V vyspělé podobě by tak mohl zvýšit důraz na chování při zátěži, stabilitu latence, dostupnost a provozní opakovatelnost, nikoli jen na špičkový výsledek z pevně vymezeného běhu.
Zatím je však vhodné chápat tento koncept jako vznikající směr měření, ne jako hotovou náhradu současného procesu. Výsledky v6.1 dobře vysvětlují, proč by takový posun mohl být užitečný: kvalitu nasazení neurčuje jen maximum tokenů za sekundu.
MLPerf v6.1 ukazuje, že soutěž v inferenci AI utvářejí tři propojené faktory: schopnosti akcelerátoru, zlepšování softwaru a integrace celého systému. Rozsáhlé nasazení MI355X dokládá význam škálování; Vera Rubin naznačuje další výkonnostní krok, zatímco Blackwell slouží současným nasazením; Arc Pro B70 rozšiřuje spektrum zastoupeného hardwaru; a nové testy MLCommons uznávají, že RAG a agenti přinášejí jiné nároky na výkon.
Při hodnocení platformy proto začněte konkrétní pracovní zátěží a provozním cílem: modelem, délkou kontextu, souběžností požadavků, latencí SLA, energetickým limitem, velikostí nasazení a náklady na užitečný výstup. Teprve pak porovnávejte systémy ve srovnatelném měřítku a se stejnou úrovní dostupnosti. To je pro nákupní rozhodnutí užitečnější než považovat jeden titulek z MLPerf za univerzální odpověď.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nejvyšší souhrnnou propustnost tokenů v tomto kole vykázala konfigurace Crusoe s 512 GPU AMD Instinct MI355X; samotné číslo ale nelze bez přepočtu přímo srovnávat s menšími systémy.
Nejvyšší souhrnnou propustnost tokenů v tomto kole vykázala konfigurace Crusoe s 512 GPU AMD Instinct MI355X; samotné číslo ale nelze bez přepočtu přímo srovnávat s menšími systémy. Do kola se zapojilo rekordních 30 organizací a bylo zveřejněno 486 výsledků pro datacentra a edge.
Pro kupující je vedle parametrů akcelerátoru stále důležitější zralost softwaru, výkon v reálném měřítku, dostupnost platformy a opakovatelnost provozu.