Nvidia og d Matrix planlegger et hybridoppsett der GPU er tar den beregningstunge prefill fasen, mens d Matrix Raptor XPU er skal håndtere decode, altså generering av ett token om gangen. NVLink Fusion, MGX referansedesign og Nvidias nettverk skal gjøre det enklere å sette spesialiserte inferensprosessorer inn i sto...
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Generative AI-tjenester bedømmes i økende grad på hvor raskt de begynner å svare – og hvor jevnt de fortsetter å levere tekst. Samarbeidet mellom Nvidia og d-Matrix, annonsert i september 2026, retter seg mot nettopp dette: d-Matrix’ kommende Raptor-inferens-XPU-er skal kobles direkte til Nvidia-designet AI-infrastruktur, slik at et rack kan sende ulike deler av en språkmodellforespørsel til prosessoren som passer best. 1
3
4
Hovedpoenget er at teknologiene skal utfylle hverandre. Raptor er ikke presentert som en erstatning for Nvidia-GPU-er. Planen er et heterogent system der GPU-er tar den beregningstunge prefill-fasen, mens d-Matrix-akseleratorer tar den gjentakende og forsinkelsesfølsomme decode-fasen, der modellen produserer ett token om gangen. 4
5
En forespørsel til en stor språkmodell har ulike ytelseskrav underveis. I prefill-fasen behandles instruksen og konteksten. I decode-fasen genereres neste token gjentatte ganger. d-Matrix plasserer inferensarkitekturen sin, inkludert dagens Corsair-produkt, i decode-rollen ved siden av GPU-er, som selskapet beskriver som godt egnet til beregningstunge oppgaver. 26
En slik arbeidsdeling kan være relevant i interaktive tjenester der tiden til neste token er viktig – for eksempel kodeassistenter, chatløsninger og talebaserte tjenester. Den foreslåtte Raptor-plattformen retter seg mot det d-Matrix kaller premium-tjenester med svært lav token-forsinkelse. 4
8
Men å dele arbeidsflyten i to skaper også en systemutfordring: Prosessorene må utveksle data raskt nok til at kommunikasjonen ikke spiser opp gevinsten ved spesialiseringen. Det er denne flaskehalsen samarbeidet forsøker å redusere med Nvidias sammenkobling og nettverk.
Raptor er planlagt koblet til Nvidias NVLink-domene for oppskalering gjennom NVLink Fusion, mens Spectrum-X skal stå for nettverk mellom systemer ved horisontal skalering. Nvidia sier dette gir d-Matrix en vei inn i selskapets bredere AI-infrastrukturplattform. 3
Det planlagte d-Matrix-racket bygger på Nvidias MGX-referansearkitektur og skal etter planen inkludere Nvidia Vera-CPU-er, NVLink-svitsjer, BlueField-4-DPU-er, ConnectX-9 SuperNIC-er og Spectrum-X Ethernet. 4
8
For d-Matrix er dette minst like viktig som selve forbindelsen mellom brikkene. I stedet for å måtte validere servere, nettverk, strøm, kjøling og leverandørkjede på egen hånd rundt en ny prosessor, kan selskapet bygge mot et validert rack-økosystem. Nvidia beskriver MGX og resten av plattformen som en raskere vei med lavere risiko fra spesialutviklet silisium til storskala utrulling. 3
I praksis er målet at Raptor skal kunne settes inn som del av en Nvidia-lignende AI-fabrikk, ikke som en isolert inferensboks.
d-Matrix har skissert en ambisiøs rackkonfigurasjon for Raptor: opptil 144 XPU-er per rack, 2,3 TB 3D-stablet DRAM og samlet minnebåndbredde på 7,2 PB/s. Selskapet sier at designet er ment å støtte modeller med mer enn fire billioner parametere ved 4-bits presisjon. Dette er planlagte spesifikasjoner, ikke uavhengig bekreftede resultater fra leveringsklare systemer. 4
Arkitekturen bygger på d-Matrix’ syn om at decode-fasen i store språkmodeller i stor grad begrenses av hvor raskt data kan flyttes i minnesystemet. Raptor skal kombinere en DRAM-minnebrikke og en SRAM-beregningsbrikke i én 3D-pakke, som en videreføring av selskapets minnesentrerte tilnærming. 4
d-Matrix forventer at Raptor skal nå tape-out – stadiet der chipdesignet sendes til produksjon – innen utgangen av 2026. Første tilgjengelighet i et MGX-rack er ventet i fjerde kvartal 2027. Det gjenstår dermed betydelig gjennomføringsrisiko: produksjon, pakking, systemvalidering og utrulling i rackskala må fungere før kundene kan vurdere reell ytelse. 4
8
Nvidias rolle i samarbeidet er strategisk interessant. Selskapet lar en spesialisert ekstern XPU kobles til rackarkitekturen og nettverksstrukturen, fremfor å kreve at alle inferensstadier kjører på Nvidia-GPU-er.
Nvidia omtaler AI-plattformen som «vertikalt integrert og horisontalt åpen»: Selskapet kan beholde verdien i oppskaleringsnettverket, nettverket mellom systemer, rackdesignene og økosystemet, samtidig som andre prosessorer kan delta. 3
Det kan utvide hvilke arbeidslaster plattformen kan dekke. Kunder som ønsker en decode-spesialisert akselerator, kan ha større grunn til å holde seg til Nvidia-kompatibel infrastruktur dersom akseleratoren fungerer med NVLink Fusion, MGX og Spectrum-X. Dette er derfor best forstått som kontrollert komplementaritet, ikke som en tilbaketrekning fra GPU-er: Nvidia-GPU-er forblir sentrale for trening, generell inferens og den beregningstunge prefill-fasen, mens en spesialbrikke plasseres i decode-rollen. 1
4
5
Raptor følger etter d-Matrix’ Corsair-inferensakselerator. Selskapet sier Corsair er laget spesielt for decode i delt inferens og skal fungere sammen med GPU-er, ikke erstatte dem. 26
d-Matrix har fremmet påstander om ytelse, kostnad og energibruk for hybridoppsett med Corsair, men tallene bør behandles som selskapets egne påstander så lenge detaljerte, uavhengig gjentakbare referansetester ikke foreligger. Kildematerialet for denne kunngjøringen dokumenterer ikke en universell ytelsesgevinst på tvers av modeller, batchstørrelser og driftsoppsett. 25
28
Selskapet hentet 275 millioner dollar i en serie C-runde til en rapportert verdsettelse på 2 milliarder dollar, og oppga at samlet finansiering da var 450 millioner dollar. Blant investorene var M12, Microsofts venturefond. 21
30 Reuters rapporterte også at Microsoft støttet d-Matrix i en finansieringsrunde i 2023, og at selskapet leverte sin første AI-brikke i november 2024.
1
Milepælene tyder på at d-Matrix forsøker å gå fra et enkeltstående inferensprodukt til en bredere veikartplan for rackskala. Nvidia-integrasjonen kan gjøre overgangen mer troverdig for kunder som allerede kjøper eller drifter Nvidia-basert infrastruktur.
De økonomiske vilkårene i Nvidia-avtalen er ikke opplyst. 1 Det er derfor ikke mulig å fastslå ut fra kunngjøringen om avtalen omfatter lisensavgifter, felles utviklingsforpliktelser, volumkjøp, inntektsdeling eller en Nvidia-investering.
Den overordnede retningen er likevel tydeligere enn kontraktsdetaljene: Begge selskapene planlegger for et inferensmarked der én prosessortype ikke trenger å utføre alle deler av en språkmodellforespørsel. d-Matrix får en vei inn i Nvidia-kompatible AI-fabrikker, mens Nvidia får et spesialisert decode-alternativ som kan integreres med selskapets nettverk og rackplattform. Om dette faktisk gir lavere forsinkelse eller bedre økonomi i stor skala, vil avhenge av den ferdige Raptor-maskinvaren, programvare for orkestrering og kundebenchmarker etter den planlagte tilgjengeligheten i 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia og d Matrix planlegger et hybridoppsett der GPU er tar den beregningstunge prefill fasen, mens d Matrix Raptor XPU er skal håndtere decode, altså generering av ett token om gangen.
Nvidia og d Matrix planlegger et hybridoppsett der GPU er tar den beregningstunge prefill fasen, mens d Matrix Raptor XPU er skal håndtere decode, altså generering av ett token om gangen. NVLink Fusion, MGX referansedesign og Nvidias nettverk skal gjøre det enklere å sette spesialiserte inferensprosessorer inn i store rack – ikke erstatte Nvidia GPU er.
Samarbeidet viser hvordan Nvidia åpner AI fabrikkplattformen sin for tredjepartsbrikker, samtidig som selskapet beholder en sentral rolle innen sammenkobling, nettverk og rack infrastruktur.