Nvidia en d Matrix plannen een hybride inferentie opzet: GPU’s doen de rekenintensieve prefill fase, Raptor XPU’s van d Matrix de token voor token decodefase. NVLink Fusion, MGX rackontwerpen en Nvidia netwerken moeten de integratie van een gespecialiseerde inferentieprocessor op rackschaal minder risicovol maken; z...
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Generatieve AI wordt niet alleen afgerekend op de kwaliteit van een antwoord, maar ook op hoe snel dat antwoord begint te verschijnen. De samenwerking die Nvidia en d-Matrix op 10 september 2026 aankondigden, richt zich precies op dat knelpunt: de komende Raptor-inferentie-XPU’s van d-Matrix moeten rechtstreeks in Nvidia-infrastructuur kunnen draaien. Daardoor kan een rack verschillende delen van een aanvraag voor een groot taalmodel (LLM) toewijzen aan de processor die daar het best voor geschikt is. 1
3
4
De kern is samenwerking, niet vervanging. Raptor moet Nvidia-GPU’s niet verdringen. Het plan is een heterogeen systeem waarin GPU’s de zware prefill-fase uitvoeren en d-Matrix-versnellers zich richten op de repetitieve, latentiegevoelige decode-fase, waarin de uitvoer één token tegelijk wordt gegenereerd. 4
5
Een LLM-verzoek kent twee verschillende soorten werk. In de prefill-fase worden de prompt en context verwerkt; tijdens decode voorspelt het model vervolgens steeds het volgende token. d-Matrix positioneert zijn inferentiearchitectuur, waaronder het bestaande product Corsair, voor die decodefase naast GPU’s, die volgens het bedrijf juist sterk zijn in rekenintensieve taken. 26
Die taakverdeling kan vooral interessant zijn voor interactieve toepassingen waar de tijd tot het volgende token telt, zoals programmeerassistenten, chatdiensten en spraaktoepassingen. Het geplande Raptor-platform is gericht op wat d-Matrix premiumdiensten met zeer lage tokenlatentie noemt. 4
8
Er zit wel een systeemprobleem achter: de processors moeten gegevens snel genoeg uitwisselen. Als die overdracht te veel tijd kost, verdwijnt het voordeel van specialisatie. De gekozen infrastructuur moet dat risico beperken.
Raptor moet via NVLink Fusion aansluiten op Nvidia’s NVLink-scale-updomein; Spectrum-X verzorgt de scale-out-netwerkverbinding tussen systemen. Volgens Nvidia biedt dit d-Matrix een manier om eigen chips te koppelen aan het bredere AI-infrastructuurplatform van Nvidia. 3
Het geplande d-Matrix-rack is gebaseerd op Nvidia’s MGX-referentiearchitectuur. Het moet Nvidia Vera-CPU’s, NVLink-switches, BlueField-4-DPU’s, ConnectX-9-SuperNICs en Spectrum-X Ethernet bevatten. 4
8
Dat is voor d-Matrix minstens zo relevant als de koppeling zelf. In plaats van elk server-, netwerk-, stroom-, koel- en toeleveringsonderdeel rond een nieuwe chip afzonderlijk te moeten kwalificeren, kan het bedrijf voortbouwen op een gevalideerd rack-ecosysteem. Nvidia omschrijft MGX en zijn bredere platform nadrukkelijk als een versnelde route met minder risico van eigen silicium naar grootschalige uitrol. 3
Praktisch gezien moet Raptor daardoor als onderdeel van een Nvidia-achtige AI-factory inzetbaar worden, en niet als een losstaand inferentieapparaat.
d-Matrix heeft voor Raptor een ambitieus rackontwerp geschetst: maximaal 144 XPU’s per rack, 2,3 TB 3D-gestapeld DRAM en in totaal 7,2 PB/s aan geheugenbandbreedte. Het bedrijf zegt dat het ontwerp modellen met meer dan vier biljoen parameters bij 4-bits precisie moet kunnen ondersteunen. Dit zijn geplande specificaties, geen onafhankelijk gevalideerde resultaten van een geleverd product. 4
De architectuur weerspiegelt de visie van d-Matrix dat LLM-decode sterk wordt bepaald door dataverplaatsing en beschikbare geheugenbandbreedte. Raptor moet een 3D-behuizing gebruiken waarin een DRAM-geheugenchip met een SRAM-rekenchip wordt gecombineerd, als voortzetting van de geheugenbewuste aanpak van het bedrijf. 4
d-Matrix verwacht dat Raptor eind 2026 tape-out bereikt. De eerste beschikbaarheid in een MGX-rack staat voorlopig voor het vierde kwartaal van 2027 gepland. Daarvoor moet nog veel gebeuren: productie, verpakking, systeemvalidatie en uitrol op rackschaal moeten allemaal slagen voordat klanten de prestaties in de praktijk kunnen beoordelen. 4
8
Nvidia’s rol is strategisch opvallend. Het bedrijf staat toe dat een gespecialiseerde externe XPU in zijn rackarchitectuur en netwerkfabric wordt opgenomen, in plaats van elke inferentiestap uitsluitend op een Nvidia-GPU te laten draaien.
Nvidia omschrijft zijn AI-platform als „verticaal geïntegreerd en horizontaal open”. Daarmee kan het bedrijf waarde behouden in zijn scale-upfabric, scale-outnetwerken, rackontwerpen en ecosysteem, terwijl ook andere processors kunnen deelnemen. 3
Dat vergroot het aantal workloads dat het platform kan bedienen. Klanten die een decodeversneller zoeken, blijven eerder binnen Nvidia-compatibele infrastructuur als die versneller NVLink Fusion, MGX en Spectrum-X kan gebruiken. Dit is dus beter te zien als gecontroleerde complementariteit dan als een stap terug van GPU’s: Nvidia-GPU’s blijven belangrijk voor training, algemene inferentie en de rekenzware prefill-fase, terwijl een gespecialiseerd apparaat voor decode wordt ingezet. 1
4
5
Raptor volgt op d-Matrix’ Corsair-inferentieversneller. Volgens het bedrijf is Corsair specifiek ontworpen voor decode in gedesaggregeerde inferentie en werkt het samen met GPU’s, in plaats van ze te vervangen. 26
d-Matrix heeft prestatie-, kosten- en energieclaims voor hybride systemen met Corsair naar buiten gebracht. Die cijfers blijven bedrijfsclaims zolang er geen onafhankelijk reproduceerbare benchmarkdetails beschikbaar zijn. De beschikbare informatie bij deze aankondiging onderbouwt geen universele winst voor alle modellen, batchgroottes of implementaties. 25
28
Het bedrijf haalde 275 miljoen dollar op in een Series C-ronde bij een gemelde waardering van 2 miljard dollar. Daarmee kwam de gemelde totale financiering uit op 450 miljoen dollar; onder de investeerders zat M12, het durfkapitaalfonds van Microsoft. 21
30 Reuters meldde bovendien dat Microsoft d-Matrix al in een financieringsronde in 2023 steunde en dat het bedrijf zijn eerste AI-chip in november 2024 had geleverd.
1
Die mijlpalen wijzen erop dat d-Matrix wil doorgroeien van een enkel inferentieproduct naar een bredere roadmap op rackschaal. De Nvidia-integratie kan die stap geloofwaardiger maken voor klanten die al Nvidia-gebaseerde infrastructuur kopen of beheren.
De financiële voorwaarden van de overeenkomst met Nvidia zijn niet bekendgemaakt. 1 Daardoor is op basis van de publieke aankondiging niet vast te stellen of er licentievergoedingen, gezamenlijke ontwikkelverplichtingen, volumeafspraken, omzetdeling of een investering van Nvidia onderdeel van zijn.
De bredere conclusie is wel helder: beide bedrijven plannen voor een inferentiemarkt waarin niet één type processor elke stap van een LLM-verzoek hoeft uit te voeren. d-Matrix krijgt een route naar Nvidia-compatibele AI-factories; Nvidia krijgt een gespecialiseerde decodeoptie die in zijn netwerk- en rackplatform past. Of die strategie daadwerkelijk lagere latentie of betere economie op schaal oplevert, hangt af van de uiteindelijke Raptor-hardware, softwareorkestratie en klantbenchmarks na de geplande beschikbaarheid in 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia en d Matrix plannen een hybride inferentie opzet: GPU’s doen de rekenintensieve prefill fase, Raptor XPU’s van d Matrix de token voor token decodefase.
Nvidia en d Matrix plannen een hybride inferentie opzet: GPU’s doen de rekenintensieve prefill fase, Raptor XPU’s van d Matrix de token voor token decodefase. NVLink Fusion, MGX rackontwerpen en Nvidia netwerken moeten de integratie van een gespecialiseerde inferentieprocessor op rackschaal minder risicovol maken; ze zijn niet bedoeld als vervanging van GPU’s.
De samenwerking laat zien dat Nvidia zijn AI factory infrastructuur wil openstellen voor gespecialiseerde chips van derden, terwijl NVLink, netwerken en racks centrale onderdelen van het platform blijven.