Nvidia dan d Matrix merancang sistem inferens hibrid: GPU mengurus kerja prefill yang berat dari segi pengiraan, manakala XPU Raptor d Matrix mengendalikan decode token demi token melalui NVLink Fusion. Reka bentuk rujukan MGX, NVLink Fusion dan rangkaian Nvidia bertujuan mengurangkan risiko integrasi bagi pemproses...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Perkhidmatan AI generatif semakin dinilai berdasarkan seberapa pantas ia mula memberi jawapan dan meneruskan penghasilan jawapan itu. Kerjasama Nvidia dengan d-Matrix pada September 2026 menyasarkan isu tersebut: menyambungkan XPU inferens Raptor d-Matrix yang akan datang terus ke dalam infrastruktur AI rekaan Nvidia, supaya satu rak pelayan boleh menyerahkan bahagian berbeza bagi permintaan model bahasa besar (LLM) kepada pemproses yang paling sesuai. 1
3
4
Intinya ialah saling melengkapi, bukannya penggantian. Raptor bukan diumumkan sebagai pengganti GPU Nvidia. Sebaliknya, kedua-dua syarikat merancang sistem heterogen: GPU menangani kerja prefill yang intensif dari sudut pengiraan, manakala pemecut d-Matrix memfokuskan fasa decode yang berulang dan peka kepada kependaman, iaitu fasa yang menghasilkan token output satu demi satu. 4
5
Setiap permintaan kepada LLM mempunyai keperluan prestasi yang berbeza. Prefill memproses arahan pengguna serta konteks, manakala decode menjana token seterusnya secara berulang. d-Matrix meletakkan seni bina inferensnya, termasuk produk Corsair sedia ada, untuk kerja decode bersama GPU, yang menurutnya kukuh bagi beban kerja intensif pengiraan. 26
Pembahagian itu boleh memberi manfaat kepada produk interaktif yang mengutamakan masa untuk token seterusnya, seperti pembantu pengekodan, aplikasi sembang dan pengalaman suara. Platform Raptor yang dicadangkan disasarkan kepada apa yang digelar d-Matrix sebagai perkhidmatan token premium dengan kependaman amat rendah. 4
8
Namun, memisahkan dua fasa kerja turut mencipta cabaran sistem: pemproses perlu bertukar data dengan cukup pantas supaya kos komunikasi tidak menghapuskan manfaat pengkhususan tersebut. Pilihan infrastruktur dalam kerjasama ini bertujuan menangani kekangan itu.
Raptor dirancang untuk menggunakan NVLink Fusion bagi menyertai domain scale-up NVLink Nvidia, manakala Spectrum-X menyediakan rangkaian scale-out antara sistem. Nvidia menyatakan bahawa ini memberi d-Matrix laluan untuk menyambungkan silikon tersuai kepada platform infrastruktur AI yang lebih luas. 3
Rak d-Matrix yang dirancang berasaskan seni bina rujukan MGX Nvidia dan dijangka menggunakan CPU Nvidia Vera, suis NVLink, DPU BlueField-4, SuperNIC ConnectX-9 serta Ethernet Spectrum-X. 4
8
Bagi d-Matrix, nilainya bukan pada sambungan cip semata-mata. Daripada perlu mengesahkan sendiri setiap komponen pelayan, rangkaian, kuasa, penyejukan dan rantaian bekalan untuk pemproses baharu, syarikat itu boleh membina produk dalam ekosistem rak yang telah disahkan. Nvidia menggambarkan MGX dan platformnya sebagai laluan yang dipercepatkan serta kurang berisiko daripada silikon tersuai kepada pelaksanaan berskala besar. 3
Secara praktikal, kerjasama ini bertujuan menjadikan Raptor boleh digunakan sebagai sebahagian daripada AI factory bergaya Nvidia, bukan sekadar perkakas inferens yang berdiri sendiri.
d-Matrix telah menggariskan konfigurasi skala rak yang besar untuk Raptor: sehingga 144 XPU bagi setiap rak, 2.3 TB DRAM bertindan 3D dan lebar jalur memori agregat 7.2 PB/s. Syarikat itu berkata reka bentuk tersebut disasarkan untuk menyokong model melebihi empat trilion parameter pada ketepatan 4-bit. Ini ialah spesifikasi perancangan, bukannya keputusan produk yang sudah dihantar dan disahkan secara bebas. 4
Seni bina itu mencerminkan pandangan d-Matrix bahawa decode LLM banyak dipengaruhi oleh pergerakan data dalam memori dan lebar jalur yang tersedia. Pakej 3D Raptor yang dicadangkan menggabungkan cip memori DRAM dengan cip pengiraan SRAM, meneruskan pendekatan d-Matrix yang berpusatkan memori. 4
d-Matrix menjangka Raptor mencapai tape-out menjelang akhir 2026, manakala ketersediaan awal dalam rak MGX dijangka pada suku keempat 2027. Ini bermakna masih ada kerja pelaksanaan yang besar: tape-out, pembuatan, pembungkusan, pengesahan sistem dan penggunaan pada skala rak perlu berjaya sebelum pelanggan boleh menilai prestasi dalam keadaan sebenar. 4
8
Peranan Nvidia dalam kerjasama ini penting dari sudut strategi. Syarikat itu membolehkan XPU khusus daripada pihak luar disambungkan ke dalam seni bina rak dan fabrik rangkaiannya, bukannya mewajibkan setiap peringkat inferens berjalan pada GPU Nvidia.
Nvidia menggambarkan platform AInya sebagai “bersepadu secara menegak dan terbuka secara mendatar”: syarikat itu masih mengekalkan nilai daripada fabrik scale-up, rangkaian scale-out, reka bentuk rak dan ekosistemnya, sambil membenarkan pemproses lain mengambil bahagian. 3
Langkah ini meluaskan jenis beban kerja yang boleh dilayani oleh platform tersebut. Pelanggan yang memerlukan pemecut khusus untuk decode mungkin lebih cenderung kekal dalam infrastruktur serasi Nvidia jika pemecut itu boleh menggunakan NVLink Fusion, MGX dan Spectrum-X. Maka, ini lebih tepat difahami sebagai pelengkap yang terkawal, bukan pengunduran daripada GPU: GPU Nvidia kekal penting untuk latihan, inferens serba guna dan peringkat prefill yang berat dari segi pengiraan, sementara peranti khusus diletakkan untuk decode. 1
4
5
Raptor menyusuli pemecut inferens Corsair daripada d-Matrix. Syarikat itu berkata Corsair dibina khusus untuk decode dalam inferens terasing dan berfungsi bersama GPU, bukan menggantikannya. 26
d-Matrix telah menghebahkan dakwaan prestasi, kos dan tenaga bagi sistem hibrid berasaskan Corsair. Namun, angka itu wajar dianggap sebagai dakwaan syarikat selagi butiran penanda aras yang boleh dihasilkan semula secara bebas tidak tersedia. Bukti bagi pengumuman ini tidak membuktikan peningkatan prestasi yang bersifat universal merentas semua model, saiz kelompok atau konfigurasi penggunaan. 25
28
Syarikat itu mengumpul pembiayaan Siri C sebanyak AS$275 juta pada penilaian yang dilaporkan sebanyak AS$2 bilion, menjadikan jumlah pembiayaan yang dilaporkan AS$450 juta. Pusingan tersebut turut melibatkan M12, dana modal teroka Microsoft, antara pelabur lain. 21
30 Reuters turut melaporkan bahawa Microsoft menyokong d-Matrix dalam pusingan pembiayaan 2023 dan d-Matrix menghantar cip AI pertamanya pada November 2024.
1
Perkembangan ini menunjukkan d-Matrix sedang bergerak daripada tawaran inferens satu produk kepada hala tuju lebih luas pada skala rak. Integrasi Nvidia boleh menjadikan peralihan itu lebih meyakinkan bagi pelanggan yang sudah membeli atau mengendalikan infrastruktur berasaskan Nvidia.
Syarat kewangan perjanjian Nvidia-d-Matrix tidak didedahkan. 1 Oleh itu, pengumuman awam itu tidak membolehkan kita menentukan sama ada aturan tersebut melibatkan yuran pelesenan, komitmen kejuruteraan bersama, pembelian volum, perkongsian hasil atau pelaburan Nvidia.
Kesimpulan yang lebih jelas ialah kedua-dua syarikat merancang untuk pasaran inferens yang tidak semestinya memerlukan satu jenis pemproses menjalankan setiap langkah bagi permintaan LLM. d-Matrix memperoleh laluan ke AI factory serasi Nvidia, manakala Nvidia memperoleh pilihan khusus untuk decode yang boleh disepadukan dengan rangkaian dan platform raknya. Sama ada strategi ini benar-benar mengurangkan kependaman atau memperbaiki ekonomi pada skala besar akan bergantung pada perkakasan Raptor sebenar, orkestrasi perisian dan penanda aras pelanggan selepas ketersediaan yang dirancang pada 2027. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia dan d Matrix merancang sistem inferens hibrid: GPU mengurus kerja prefill yang berat dari segi pengiraan, manakala XPU Raptor d Matrix mengendalikan decode token demi token melalui NVLink Fusion.
Nvidia dan d Matrix merancang sistem inferens hibrid: GPU mengurus kerja prefill yang berat dari segi pengiraan, manakala XPU Raptor d Matrix mengendalikan decode token demi token melalui NVLink Fusion. Reka bentuk rujukan MGX, NVLink Fusion dan rangkaian Nvidia bertujuan mengurangkan risiko integrasi bagi pemproses inferens khusus pada skala rak — bukannya menggantikan GPU Nvidia.
Kerjasama ini menunjukkan Nvidia mahu menjadikan infrastruktur AI factory nya serasi dengan cip pihak ketiga yang khusus, sambil mengekalkan peranan utama NVLink, rangkaian dan sistem skala rak.