Nvidia och d Matrix planerar en hybridlösning där GPU:er gör det beräkningstunga prefill arbetet och d Matrix Raptor XPUs genererar svarstoken steg för steg i decode fasen. NVLink Fusion, MGX referensarkitekturen och Nvidias nätverk ska minska integrationsrisken för ett specialiserat inferenschip i rackskala – inte...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Generativa AI-tjänster bedöms allt oftare efter hur snabbt de börjar svara och hur jämnt svaret sedan fortsätter att komma. Nvidias och d-Matrix samarbete, som presenterades i september 2026, är tänkt att angripa just den flaskhalsen. Planen är att koppla d-Matrix kommande Raptor-XPU:er direkt till Nvidias AI-infrastruktur, så att olika delar av en språkmodells förfrågan kan köras på den processor som passar bäst. 1
3
4
Det viktiga är att tekniken är tänkt som ett komplement, inte en ersättare. Nvidia-GPU:er ska fortfarande göra det beräkningstunga prefill-steget, medan d-Matrix-acceleratorerna riktas mot den repetitiva och fördröjningskänsliga decode-fasen, där modellen skapar ett nytt token i taget. 4
5
En förfrågan till en stor språkmodell består av olika typer av arbete. I prefill-fasen bearbetas prompten och dess kontext. Decode-fasen genererar därefter nästa token om och om igen – i praktiken små delar av det svar användaren ser på skärmen.
D-Matrix placerar sin inferensarkitektur, inklusive den nuvarande produkten Corsair, i decode-ledet tillsammans med GPU:er, som bolaget beskriver som väl lämpade för beräkningsintensiva uppgifter. 26
Det kan vara särskilt relevant för interaktiva tjänster där tiden till nästa token märks direkt: kodassistenter, chattjänster och röstgränssnitt. Den planerade Raptor-plattformen riktas mot vad d-Matrix kallar premiumtjänster för token-generering med mycket låg fördröjning. 4
8
Men arbetsdelningen skapar också ett systemproblem. Data måste kunna flyttas tillräckligt snabbt mellan processorerna; annars äts vinsten av specialiseringen upp av kommunikationsfördröjningar. Det är där Nvidias sammankoppling och rackplattform kommer in.
Raptor är planerad att använda NVLink Fusion för att ansluta till Nvidias NVLink-domän för skalning inom ett system. Spectrum-X ska stå för skalning mellan system. Nvidia beskriver detta som en väg för d-Matrix att koppla specialanpassat kisel till sin bredare AI-infrastrukturplattform. 3
Det planerade d-Matrix-racket bygger på Nvidias MGX-referensarkitektur och väntas innehålla Nvidia Vera-processorer, NVLink-switchar, BlueField-4-DPU:er, ConnectX-9 SuperNIC-kort och Spectrum-X Ethernet. 4
8
MGX är i sammanhanget mer än ett ritningsunderlag för servrar. I stället för att d-Matrix på egen hand måste kvalificera serverdelar, nätverk, strömförsörjning, kylning och leveranskedja runt en ny processor, kan bolaget bygga mot ett redan validerat rackekosystem. Nvidia beskriver själv MGX och den bredare plattformen som en snabbare väg med lägre risk från specialkisel till storskalig driftsättning. 3
I praktiken är ambitionen alltså att Raptor ska kunna driftsättas som en del av en Nvidia-liknande AI-fabrik, snarare än som en fristående apparat för inferens.
D-Matrix har presenterat ambitiösa mål för Raptor i rackskala: upp till 144 XPU:er per rack, 2,3 TB 3D-staplat DRAM-minne och sammanlagt 7,2 PB/s i minnesbandbredd. Bolaget uppger att konstruktionen är avsedd för modeller med fler än fyra biljoner parametrar vid 4-bitars precision. Det är planerade specifikationer, inte oberoende verifierade resultat från en produkt som levereras i dag. 4
Arkitekturen bygger på d-Matrix syn att decode-fasen i språkmodeller i hög grad begränsas av hur snabbt data kan flyttas och hur mycket minnesbandbredd som finns tillgänglig. Raptor är planerad med ett 3D-paket som kombinerar ett DRAM-minneschip med ett SRAM-beräkningschip, vilket förlänger bolagets minnescentrerade strategi. 4
Enligt d-Matrix väntas Raptor nå tape-out – steget då chipdesignen skickas till tillverkning – före slutet av 2026. De första Raptor-XPU:erna i ett MGX-rack väntas bli tillgängliga under fjärde kvartalet 2027. 4
8
Det återstår därmed ett betydande genomförandearbete: tape-out, tillverkning, kapsling, systemvalidering och driftsättning i rackskala måste fungera innan kunder kan bedöma faktisk prestanda i verkliga miljöer.
Nvidias roll är strategiskt intressant. Bolaget låter en specialiserad XPU från en extern leverantör anslutas till sin rackarkitektur och nätverksinfrastruktur, i stället för att kräva att varje inferenssteg körs på en Nvidia-GPU.
Nvidia beskriver sin AI-plattform som ”vertikalt integrerad och horisontellt öppen”. Tanken är att behålla värdet i NVLink, nätverk, rackdesign och ekosystem, samtidigt som andra processorer kan ingå i systemet. 3
Det breddar vilka arbetslaster plattformen kan hantera. Kunder som vill använda en accelerator optimerad för decode kan vara mer benägna att stanna i Nvidia-kompatibel infrastruktur om den acceleratorn kan använda NVLink Fusion, MGX och Spectrum-X.
Det är därför mer träffsäkert att se upplägget som kontrollerad komplettering än som en reträtt från GPU:er. Nvidias GPU:er förblir centrala för träning, bred inferens och den beräkningstunga prefill-fasen, medan en specialiserad enhet positioneras för decode. 1
4
5
Raptor följer på d-Matrix tidigare inferensaccelerator Corsair. Bolaget säger att Corsair är byggd för decode-fasen i disaggreggerad inferens och ska arbeta tillsammans med GPU:er, snarare än ersätta dem. 26
D-Matrix har publicerat påståenden om prestanda, kostnad och energieffektivitet för hybridlösningar med Corsair. Sådana siffror bör dock ses som bolagets egna uppgifter tills det finns oberoende, reproducerbara benchmarkresultat. Underlaget för detta besked visar inte någon universell prestandavinst över alla modeller, batchstorlekar eller driftkonfigurationer. 25
28
Bolaget har tagit in 275 miljoner dollar i en serie C-runda till en rapporterad värdering på 2 miljarder dollar. Den rapporterade totala finansieringen uppgår därmed till 450 miljoner dollar. Bland investerarna finns M12, Microsofts riskkapitalfond. 21
30 Reuters rapporterade också att Microsoft investerade i d-Matrix redan i en finansieringsrunda 2023 och att bolagets första AI-chip började levereras i november 2024.
1
Tillsammans pekar dessa steg på att d-Matrix försöker gå från en enskild produkt för inferens till en bredare färdplan för rackskala. Nvidia-integrationen kan göra övergången mer trovärdig för kunder som redan köper eller driver Nvidia-baserad infrastruktur.
De ekonomiska villkoren för Nvidia-avtalet har inte offentliggjorts. 1 Det går därför inte att avgöra från den offentliga informationen om överenskommelsen omfattar licensavgifter, gemensamt utvecklingsarbete, volymåtaganden, intäktsdelning eller en Nvidia-investering.
Den övergripande slutsatsen är tydligare än affärsvillkoren: båda bolagen planerar för en inferensmarknad där en enda processortyp inte behöver utföra varje del av en språkmodells förfrågan. d-Matrix får en väg in i Nvidia-kompatibla AI-fabriker, medan Nvidia får ett specialiserat decode-alternativ som kan integreras med bolagets nätverk och rackplattform.
Om strategin faktiskt ger lägre fördröjning eller bättre ekonomi i stor skala avgörs först av den färdiga Raptor-hårdvaran, mjukvaran som fördelar arbetet och kundernas benchmarkresultat efter den planerade tillgängligheten 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia och d Matrix planerar en hybridlösning där GPU:er gör det beräkningstunga prefill arbetet och d Matrix Raptor XPUs genererar svarstoken steg för steg i decode fasen.
Nvidia och d Matrix planerar en hybridlösning där GPU:er gör det beräkningstunga prefill arbetet och d Matrix Raptor XPUs genererar svarstoken steg för steg i decode fasen. NVLink Fusion, MGX referensarkitekturen och Nvidias nätverk ska minska integrationsrisken för ett specialiserat inferenschip i rackskala – inte ersätta Nvidias GPU:er.
Samarbetet visar hur Nvidia vill hålla ihop AI fabrikens nätverk, rack och ekosystem även när kunder använder specialiserade kretsar från andra leverantörer.