Nvidia i d Matrix planują hybrydowy system inferencyjny: GPU mają wykonywać obliczeniowo ciężki etap prefill, a XPU Raptor firmy d Matrix — etap decode, czyli generowanie tokenów jeden po drugim. NVLink Fusion, projekty referencyjne MGX i sieć Nvidia mają zmniejszyć ryzyko integracji wyspecjalizowanego procesora inf...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Usługi generatywnej AI coraz częściej ocenia się po tym, jak szybko zaczynają i kontynuują odpowiedź. Współpraca Nvidii i d-Matrix, ogłoszona we wrześniu 2026 r., ma rozwiązać właśnie ten problem: przyszłe procesory inferencyjne Raptor XPU firmy d-Matrix mają być bezpośrednio integrowane z infrastrukturą AI projektowaną przez Nvidię. Dzięki temu jedna szafa serwerowa będzie mogła przekazywać różne części obsługi zapytania do LLM procesorom najlepiej dopasowanym do danego zadania. 1
3
4
Najważniejsza jest tu komplementarność, a nie zastępowanie GPU. Plan zakłada system heterogeniczny: GPU Nvidii obsługują intensywny obliczeniowo etap prefill — przetworzenie promptu i kontekstu — natomiast akceleratory d-Matrix mają skupiać się na powtarzalnej, wrażliwej na opóźnienia fazie decode, w której model generuje kolejne tokeny jeden po drugim. 4
5
Obsługa zapytania przez duży model językowy składa się z etapów o innych wymaganiach wydajnościowych. Prefill analizuje treść pytania i kontekst, a decode wielokrotnie oblicza następny token odpowiedzi. d-Matrix pozycjonuje swoją architekturę inferencyjną, w tym obecny produkt Corsair, do pracy w fazie decode obok GPU, które firma wskazuje jako szczególnie dobre w zadaniach intensywnie wykorzystujących obliczenia. 26
Taki podział może mieć znaczenie w produktach interaktywnych, gdzie liczy się czas do pojawienia się następnego tokenu: asystentach programistycznych, czatach czy aplikacjach głosowych. Planowana platforma Raptor jest kierowana do usług, które d-Matrix określa jako premium i ultraniskoopóźnieniowe. 4
8
Samo rozdzielenie zadań tworzy jednak problem systemowy. Procesory muszą wymieniać dane na tyle szybko, by koszt komunikacji nie zniwelował korzyści ze specjalizacji. Temu mają służyć elementy infrastruktury objęte współpracą.
Raptor ma korzystać z NVLink Fusion, aby dołączyć do domeny skalowania NVLink Nvidii, natomiast Spectrum-X ma zapewniać sieć skalowania między systemami. Według Nvidii daje to d-Matrix drogę do podłączenia własnego krzemu do szerszej platformy infrastruktury AI firmy. 3
Planowana szafa serwerowa d-Matrix ma być oparta na architekturze referencyjnej NVIDIA MGX. Ma obejmować procesory Nvidia Vera, przełączniki NVLink, DPU BlueField-4, karty sieciowe ConnectX-9 SuperNIC oraz Ethernet Spectrum-X. 4
8
Dla d-Matrix istotny jest nie tylko sam interkonekt. Zamiast samodzielnie kwalifikować wszystkie elementy środowiska wokół nowego procesora — serwery, sieć, zasilanie, chłodzenie i łańcuch dostaw — firma może budować produkt w obrębie sprawdzonego ekosystemu rackowego. Nvidia przedstawia MGX i swoją szerszą platformę jako szybszą oraz mniej ryzykowną drogę od własnego układu scalonego do wdrożenia na dużą skalę. 3
W praktyce celem partnerstwa jest wdrażanie Raptora jako części infrastruktury typu „AI factory” Nvidii, a nie jako odizolowanego urządzenia do inferencji.
d-Matrix przedstawił ambitną, planowaną konfigurację Raptora: do 144 XPU w jednej szafie, 2,3 TB pamięci DRAM układanej w stosach 3D oraz łączną przepustowość pamięci 7,2 PB/s. Firma deklaruje, że projekt ma obsługiwać modele większe niż cztery biliony parametrów przy precyzji 4-bitowej. Są to parametry planowane, a nie niezależnie zweryfikowane wyniki gotowego produktu. 4
Architektura odzwierciedla założenie firmy, że etap decode w LLM jest silnie ograniczany przez przenoszenie danych w pamięci oraz dostępną przepustowość. Proponowany pakiet 3D Raptora łączy układ pamięci DRAM z układem obliczeniowym SRAM, rozwijając pamięciocentryczne podejście d-Matrix. 4
d-Matrix przewiduje tape-out Raptora do końca 2026 r., a pierwszą dostępność w szafie MGX w IV kwartale 2027 r. Przed firmą pozostaje więc dużo pracy: powodzenie tape-outu, produkcji, pakowania, walidacji systemu i wdrożenia w skali szafy będzie konieczne, zanim klienci ocenią rzeczywistą wydajność rozwiązania. 4
8
Rola Nvidii jest strategicznie znacząca. Firma umożliwia wyspecjalizowanemu zewnętrznemu XPU połączenie z własną architekturą rackową i siecią, zamiast wymagać, by każdy etap inferencji wykonywał GPU Nvidii.
Nvidia opisuje swoją platformę AI jako „pionowo zintegrowaną i poziomo otwartą”: może utrzymać wartość swojej infrastruktury skalowania, sieci, projektów szaf i ekosystemu, a zarazem pozwolić innym procesorom uczestniczyć w tym środowisku. 3
Poszerza to zakres zadań, które platforma może obsłużyć. Klienci poszukujący akceleratora zoptymalizowanego pod decode mogą chętniej pozostać przy infrastrukturze zgodnej z Nvidią, jeśli taki układ korzysta z NVLink Fusion, MGX i Spectrum-X. To raczej kontrolowana komplementarność niż odejście od GPU: układy graficzne pozostają kluczowe dla treningu, ogólnej inferencji i wymagającego obliczeniowo prefill, a wyspecjalizowany procesor jest przewidywany dla dekodowania. 1
4
5
Raptor będzie następcą akceleratora inferencyjnego Corsair firmy d-Matrix. Według firmy Corsair został zaprojektowany dla fazy decode w rozdzielonej inferencji i ma współpracować z GPU, a nie je zastępować. 26
d-Matrix publikował deklaracje dotyczące wydajności, kosztów i zużycia energii przez hybrydowe systemy oparte na Corsairze. Należy jednak traktować je jako twierdzenia firmy, dopóki nie będą dostępne niezależnie odtwarzalne szczegóły testów porównawczych. Dostarczone materiały nie dowodzą uniwersalnej przewagi dla wszystkich modeli, wielkości partii i konfiguracji wdrożeniowych. 25
28
Firma pozyskała 275 mln USD w rundzie Series C przy deklarowanej wycenie 2 mld USD, co podniosło deklarowaną łączną kwotę finansowania do 450 mln USD. W rundzie uczestniczył m.in. M12, fundusz venture Microsoftu. 21
30 Reuters podał również, że Microsoft wsparł d-Matrix w rundzie finansowania z 2023 r., a firma dostarczyła pierwszy układ AI w listopadzie 2024 r.
1
Te etapy sugerują przejście d-Matrix od oferty opartej na pojedynczym produkcie inferencyjnym do szerszej mapy rozwoju systemów rack-scale. Integracja z Nvidią może uwiarygodnić tę drogę dla klientów, którzy już kupują lub eksploatują infrastrukturę opartą na technologii Nvidii.
Warunki finansowe umowy z Nvidią nie zostały ujawnione. 1 Na podstawie publicznego komunikatu nie można więc ustalić, czy porozumienie obejmuje opłaty licencyjne, wspólne prace inżynieryjne, zobowiązania zakupowe, podział przychodów albo inwestycję Nvidii.
Szerszy wniosek jest jednak jasny: obie firmy przygotowują się na rynek inferencji, na którym jeden typ procesora nie musi wykonywać każdego kroku obsługi zapytania do LLM. d-Matrix zyskuje drogę do fabryk AI zgodnych z Nvidią, a Nvidia — opcję wyspecjalizowaną w decode, zintegrowaną z jej siecią i platformą rackową. To, czy strategia rzeczywiście obniży opóźnienia lub poprawi ekonomię działania na dużą skalę, zależy od finalnego sprzętu Raptor, oprogramowania orkiestrującego i testów klientów po planowanej dostępności w 2027 r. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia i d Matrix planują hybrydowy system inferencyjny: GPU mają wykonywać obliczeniowo ciężki etap prefill, a XPU Raptor firmy d Matrix — etap decode, czyli generowanie tokenów jeden po drugim.
Nvidia i d Matrix planują hybrydowy system inferencyjny: GPU mają wykonywać obliczeniowo ciężki etap prefill, a XPU Raptor firmy d Matrix — etap decode, czyli generowanie tokenów jeden po drugim. NVLink Fusion, projekty referencyjne MGX i sieć Nvidia mają zmniejszyć ryzyko integracji wyspecjalizowanego procesora inferencyjnego w skali całej szafy serwerowej; nie chodzi o zastąpienie GPU Nvidia.
Współpraca pokazuje, że Nvidia chce otworzyć swoją infrastrukturę AI na wyspecjalizowane układy innych firm, zachowując centralną rolę NVLink, sieci i systemów rack scale.