Nvidia a d Matrix plánují hybridní inferenci: GPU mají zpracovat výpočetně náročnou fázi prefill, zatímco XPU Raptor od d Matrix se zaměří na dekódování token po tokenu. NVLink Fusion, referenční architektura MGX a síťové prvky Nvidia mají snížit integrační riziko při nasazení specializovaného procesoru v měřítku ce...
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Generativní AI se dnes neposuzuje jen podle kvality odpovědi, ale také podle toho, jak rychle ji začne vytvářet a jak plynule pokračuje. Spolupráce Nvidie a d-Matrix, oznámená v září 2026, míří právě na tuto část problému: budoucí inferenční procesory Raptor od d-Matrix mají být přímo propojeny s AI infrastrukturou navrženou Nvidií. V jednom racku tak půjde jednotlivé části požadavku na velký jazykový model (LLM) poslat tomu procesoru, pro který se nejlépe hodí. 1
3
4
Podstatné je, že Raptor nemá GPU Nvidia nahrazovat. Obě firmy plánují heterogenní systém: GPU budou provádět výpočetně náročný prefill — tedy zpracování promptu a kontextu — zatímco akcelerátory d-Matrix se soustředí na opakovanou, na latenci citlivou fázi decode, při níž model generuje výstup po jednotlivých tokenech. 4
5
Jeden požadavek na LLM má rozdílné výkonové nároky. Fáze prefill zpracuje zadaný text a kontext, zatímco decode opakovaně vytváří další token. d-Matrix svou inferenční architekturu, včetně současného produktu Corsair, staví právě pro decode vedle GPU, která firma označuje za vhodná pro výpočetně intenzivní úlohy. 26
Takové rozdělení může pomoci hlavně u interaktivních služeb, kde záleží na době do dalšího tokenu: například u programovacích asistentů, chatbotů nebo hlasových rozhraní. Chystaná platforma Raptor cílí na to, co d-Matrix popisuje jako prémiové tokenové služby s mimořádně nízkou latencí. 4
8
Rozdělení práce ale přináší i systémovou překážku. Procesory si musejí předávat data dostatečně rychle, jinak přínos specializace pohltí samotná komunikace. Právě to mají řešit zvolené prvky infrastruktury.
Raptor má využít NVLink Fusion pro připojení do škálovací domény NVLink od Nvidie, zatímco Spectrum-X má zajišťovat síťové propojení mezi systémy. Nvidia uvádí, že tím d-Matrix získává cestu, jak napojit vlastní čip na širší platformu AI infrastruktury Nvidie. 3
Plánovaný rack d-Matrix vychází z referenční architektury MGX od Nvidie. Očekává se zapojení procesorů Nvidia Vera, přepínačů NVLink, DPU BlueField-4, síťových karet ConnectX-9 SuperNIC a ethernetu Spectrum-X. 4
8
Pro d-Matrix není důležité jen samotné propojení. Namísto samostatného ověřování serverů, sítí, napájení, chlazení a dodavatelského řetězce okolo nového procesoru se firma může opřít o ověřený rackový ekosystém. Nvidia MGX i širší platformu výslovně prezentuje jako rychlejší a méně rizikovou cestu od vlastního čipu až k nasazení ve velkém měřítku. 3
V praxi má partnerství umožnit, aby se Raptor nasazoval jako součást AI factory ve stylu Nvidie, nikoli jako izolované inferenční zařízení.
d-Matrix nastínil ambiciózní rackovou konfiguraci Raptoru: až 144 XPU v racku, 2,3 TB 3D vrstvené DRAM a souhrnnou paměťovou propustnost 7,2 PB/s. Firma uvádí, že návrh má podporovat modely větší než čtyři biliony parametrů při 4bitové přesnosti. Jde ale o plánované parametry, nikoli o nezávisle ověřené výsledky dodávaného produktu. 4
Architektura odpovídá názoru společnosti, že dekódování LLM výrazně určuje přesun dat v paměti a dostupná propustnost. Navrhované 3D pouzdro Raptoru kombinuje paměťový čip DRAM s výpočetním čipem SRAM a navazuje na paměťově orientovaný přístup d-Matrix. 4
d-Matrix očekává dokončení tape-outu Raptoru do konce roku 2026; první dostupnost v racku MGX je plánována na čtvrté čtvrtletí roku 2027. Před firmou tedy zůstává podstatná část realizace: musí uspět výroba čipu, pouzdření, validace systému i nasazení celého racku. Teprve poté budou zákazníci moci posoudit skutečný výkon v provozu. 4
8
Role Nvidie je strategicky pozoruhodná. Firma umožňuje, aby se specializované externí XPU připojilo k její rackové architektuře a síťové infrastruktuře, místo aby každá fáze inference musela běžet na GPU Nvidia.
Nvidia svou AI platformu charakterizuje jako „vertikálně integrovanou a horizontálně otevřenou“. Může si tak zachovat hodnotu vlastního škálovacího propojení, sítí, rackových návrhů a ekosystému, a současně zapojit jiné procesory. 3
Tím rozšiřuje okruh úloh, které její platforma může obsloužit. Zákazník hledající akcelerátor zaměřený na decode může pravděpodobněji zůstat v infrastruktuře kompatibilní s Nvidií, pokud daný akcelerátor funguje s NVLink Fusion, MGX a Spectrum-X. Nejde tedy o ústup od GPU, ale o řízenou komplementaritu: GPU Nvidia zůstávají zásadní pro univerzální trénování, inferenci i výpočetně náročný prefill, zatímco specializované zařízení má obsluhovat decode. 1
4
5
Raptor navazuje na inferenční akcelerátor Corsair od d-Matrix. Firma uvádí, že Corsair je navržen pro decode v disaggregované inferenci a má spolupracovat s GPU, nikoli je nahrazovat. 26
d-Matrix zveřejnil tvrzení o výkonu, nákladech a energetické efektivitě hybridních systémů s Corsairem. Tato čísla je však třeba chápat jako tvrzení společnosti, dokud nebudou k dispozici nezávisle reprodukovatelné benchmarky. Podklady k tomuto oznámení neprokazují univerzální zlepšení napříč modely, velikostmi dávek ani konfiguracemi nasazení. 25
28
Společnost získala v kole Series C 275 milionů dolarů při uváděné valuaci 2 miliardy dolarů, čímž její vykazované celkové financování dosáhlo 450 milionů dolarů. Mezi investory bylo mimo jiné M12, venture fond Microsoftu. 21
30 Reuters rovněž uvedl, že Microsoft podpořil d-Matrix ve finančním kole v roce 2023 a že firma dodala svůj první AI čip v listopadu 2024.
1
Tyto kroky naznačují posun d-Matrix od nabídky jediného inferenčního produktu k širšímu plánu rackových systémů. Integrace s Nvidií může tento přechod zatraktivnit pro zákazníky, kteří už infrastrukturu založenou na Nvidii nakupují nebo provozují.
Finanční podmínky dohody mezi Nvidií a d-Matrix zveřejněny nebyly. 1 Z veřejného oznámení proto nelze určit, zda součástí ujednání jsou licenční poplatky, společný technický vývoj, odběrové závazky, dělení příjmů nebo investice Nvidie.
Celkový směr je ale zřetelný: obě firmy plánují pro inferenční trh, v němž nemusí jeden typ procesoru zpracovávat každý krok požadavku na LLM. d-Matrix získává cestu do AI factory kompatibilních s Nvidií; Nvidia naopak získává specializovanou možnost pro decode, kterou lze propojit s její sítí a rackovou platformou. Zda tato strategie ve velkém měřítku skutečně přinese nižší latenci nebo lepší ekonomiku, ukáže až hardware Raptor, softwarová orchestrace a zákaznické benchmarky po plánované dostupnosti v roce 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia a d Matrix plánují hybridní inferenci: GPU mají zpracovat výpočetně náročnou fázi prefill, zatímco XPU Raptor od d Matrix se zaměří na dekódování token po tokenu.
Nvidia a d Matrix plánují hybridní inferenci: GPU mají zpracovat výpočetně náročnou fázi prefill, zatímco XPU Raptor od d Matrix se zaměří na dekódování token po tokenu. NVLink Fusion, referenční architektura MGX a síťové prvky Nvidia mají snížit integrační riziko při nasazení specializovaného procesoru v měřítku celého racku — nejde o náhradu GPU Nvidia.
Dohoda ukazuje, že Nvidia chce svou infrastrukturu AI factory otevřít specializovanému čipu třetí strany, ale zároveň udržet NVLink, síť a rackové systémy jako středobod nasazení.