Nvidia og d Matrix planlægger et hybridt inferenssystem, hvor GPU’er håndterer den beregningstunge prefill fase, mens d Matrix Raptor XPU’er tager decode fasen, hvor svaret dannes token for token. NVLink Fusion, MGX referencedesignet og Nvidias netværkskomponenter skal gøre det mindre risikabelt at installere en spe...
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Generative AI bliver i stigende grad målt på, hvor hurtigt tjenesten både begynder og fortsætter med at levere et svar. Derfor handler samarbejdet mellem Nvidia og d-Matrix, annonceret i september 2026, om at forbinde d-Matrix’ kommende Raptor-inferens-XPU’er direkte til Nvidia-designet AI-infrastruktur. Dermed kan et rack sende forskellige dele af en sprogmodel-forespørgsel til den processor, der passer bedst til opgaven. 1
3
4
Det afgørende er, at teknologierne skal supplere hinanden. Raptor er ikke præsenteret som en erstatning for Nvidia-GPU’er. Planen er i stedet et heterogent system: GPU’er tager den beregningstunge prefill-fase, mens d-Matrix-acceleratorer fokuserer på den gentagne og forsinkelsesfølsomme decode-fase, hvor modellen genererer output ét token ad gangen. 4
5
En forespørgsel til en stor sprogmodel består af flere typer arbejde. Prefill behandler prompten og den medfølgende kontekst. Decode genererer dernæst det næste token igen og igen. d-Matrix positionerer sin inferensarkitektur – herunder det nuværende Corsair-produkt – til decode-arbejdet ved siden af GPU’er, som virksomheden beskriver som stærke til beregningstunge opgaver. 26
Det kan være relevant for interaktive tjenester, hvor tiden til næste token er vigtig: eksempelvis kodeassistenter, chatløsninger og stemmebaserede oplevelser. Den planlagte Raptor-platform sigter mod det, d-Matrix kalder premium-tjenester med ultralav token-forsinkelse. 4
8
Men opdelingen giver også en teknisk udfordring. Processorerne skal kunne udveksle data så hurtigt, at kommunikationen ikke æder gevinsten ved specialiseringen. Det er netop den begrænsning, samarbejdets infrastruktur skal adressere.
Raptor er planlagt til at bruge NVLink Fusion for at indgå i Nvidias NVLink-domæne til skalering internt i systemet, mens Spectrum-X skal stå for netværket mellem systemer. Nvidia siger, at det giver d-Matrix en vej til at forbinde specialudviklet silicium med selskabets bredere AI-infrastrukturplatform. 3
Det planlagte d-Matrix-rack bygger på Nvidias MGX-referencearkitektur og skal efter planen omfatte Nvidia Vera-CPU’er, NVLink-switches, BlueField-4-DPU’er, ConnectX-9-SuperNIC’er og Spectrum-X-Ethernet. 4
8
Det er ikke kun selve forbindelsen, der er vigtig for d-Matrix. I stedet for selv at skulle kvalificere alle dele af en ny serverplatform – servere, netværk, strøm, køling og leverandørkæde – kan selskabet bygge frem mod et valideret rack-økosystem. Nvidia beskriver selv MGX og den samlede platform som en hurtigere vej med lavere risiko fra specialudviklet silicium til storstilet implementering. 3
I praksis er ambitionen altså at gøre Raptor klar til implementering som en del af en Nvidia-lignende AI-fabrik, frem for som en isoleret inferensboks.
d-Matrix har skitseret en ambitiøs rackkonfiguration for Raptor: op til 144 XPU’er pr. rack, 2,3 TB 3D-stakket DRAM og 7,2 PB/s i samlet hukommelsesbåndbredde. Virksomheden siger, at designet skal understøtte modeller på over fire billioner parametre ved 4-bit-præcision. Det er planlagte specifikationer – ikke uafhængigt verificerede resultater fra færdige produkter. 4
Arkitekturen afspejler d-Matrix’ vurdering af, at LLM-decode i høj grad bestemmes af flytning af data i hukommelsen og af den tilgængelige båndbredde. Raptors foreslåede 3D-pakke kombinerer en DRAM-hukommelseschip med en SRAM-beregningschip og bygger videre på d-Matrix’ hukommelsescentrerede tilgang. 4
d-Matrix forventer tape-out – det punkt, hvor chipdesignet sendes til produktion – inden udgangen af 2026. De første Raptor-systemer i et MGX-rack forventes tilgængelige i 4. kvartal 2027. Der er dermed stadig en betydelig gennemførelsesrisiko: tape-out, produktion, pakning, systemvalidering og implementering i rackskala skal lykkes, før kunder kan vurdere den faktiske ydeevne. 4
8
Nvidias rolle er strategisk bemærkelsesværdig. Selskabet giver en ekstern, specialiseret XPU adgang til sin rackarkitektur og netværksstruktur, frem for at kræve, at hvert trin i inferensen kører på en Nvidia-GPU.
Nvidia beskriver AI-platformen som både “vertikalt integreret og horisontalt åben”. Det betyder, at virksomheden kan bevare værdien i blandt andet scale-up-forbindelser, scale-out-netværk, rackdesign og økosystem, samtidig med at andre processorer kan indgå. 3
Det udvider typen af arbejdsbelastninger, platformen kan håndtere. Kunder, der ønsker en accelerator optimeret til decode, kan være mere tilbøjelige til at blive i Nvidia-kompatibel infrastruktur, hvis acceleratoren kan bruge NVLink Fusion, MGX og Spectrum-X. Det er derfor bedre forstået som kontrolleret komplementaritet end som et opgør med GPU’en: Nvidia-GPU’er forbliver centrale for generel træning, inferens og den beregningstunge prefill-fase, mens en specialiseret enhed placeres i decode-rollen. 1
4
5
Raptor følger efter d-Matrix’ Corsair-inferensaccelerator. Virksomheden siger, at Corsair er bygget specifikt til decode i opdelt inferens og skal arbejde sammen med GPU’er frem for at erstatte dem. 26
d-Matrix har offentliggjort påstande om ydeevne, omkostninger og energiforbrug for hybride systemer med Corsair. Tallene bør dog behandles som virksomhedens egne påstande, medmindre der foreligger detaljerede og reproducerbare uafhængige benchmarks. Materialet om denne aftale dokumenterer ikke en universel forbedring på tværs af modeller, batchstørrelser og implementeringer. 25
28
Virksomheden rejste 275 mio. dollar i en Serie C-runde til en rapporteret værdiansættelse på 2 mia. dollar, hvilket ifølge selskabet bragte den samlede finansiering op på 450 mio. dollar. Blandt investorerne var M12, Microsofts venturefond. 21
30 Reuters har desuden rapporteret, at Microsoft investerede i d-Matrix i en finansieringsrunde i 2023, og at virksomheden leverede sin første AI-chip i november 2024.
1
De milepæle peger på et skifte fra et enkelt inferensprodukt til en bredere køreplan i rackskala. Nvidia-integrationen kan gøre den overgang mere troværdig over for kunder, der allerede køber eller driver Nvidia-baseret infrastruktur.
De økonomiske vilkår i Nvidia-aftalen er ikke offentliggjort. 1 Derfor kan man ikke ud fra annonceringen afgøre, om aftalen omfatter licensbetalinger, fælles udviklingsforpligtelser, volumenkøb, indtægtsdeling eller en Nvidia-investering.
Den overordnede retning er dog tydeligere end de kommercielle detaljer: Begge selskaber planlægger ud fra et inferensmarked, hvor én processortype ikke nødvendigvis skal udføre alle trin i en sprogmodel-forespørgsel. d-Matrix får en vej ind i Nvidia-kompatible AI-fabrikker, mens Nvidia får en specialiseret decode-mulighed, der kan integreres med selskabets netværk og rackplatform. Om modellen faktisk giver lavere forsinkelse eller bedre økonomi i stor skala, afhænger af den endelige Raptor-hardware, softwareorkestreringen og kundebenchmarks efter den planlagte tilgængelighed i 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia og d Matrix planlægger et hybridt inferenssystem, hvor GPU’er håndterer den beregningstunge prefill fase, mens d Matrix Raptor XPU’er tager decode fasen, hvor svaret dannes token for token.
Nvidia og d Matrix planlægger et hybridt inferenssystem, hvor GPU’er håndterer den beregningstunge prefill fase, mens d Matrix Raptor XPU’er tager decode fasen, hvor svaret dannes token for token. NVLink Fusion, MGX referencedesignet og Nvidias netværkskomponenter skal gøre det mindre risikabelt at installere en specialiseret inferensprocessor i rackskala – ikke erstatte Nvidia GPU’er.
Aftalen viser Nvidias strategi om at holde AI fabrikkens netværk, racks og forbindelser centralt, også når tredjeparts silicium bruges til afgrænsede opgaver.