NVLink Fusion cho phép Raptor kết nối trực tiếp vào kiến trúc rack MGX/NVL144 của NVIDIA, thay vì chỉ là một bộ tăng tốc PCIe rời. Raptor nhắm đến giai đoạn giải mã token theo token của suy luận AI, nơi băng thông và dung lượng bộ nhớ có vai trò đặc biệt quan trọng.
Đăng bởiHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does d Matrix’s adoption of Nvidia’s NVLink Fusion for its next generation Raptor inference processors enable the startup to plug its me. Article summary: d Matrix is using NVLink Fusion to make Raptor a native, rack scale participant in Nvidia’s AI factory design rather than a separate PCIe inference card.. Topic tags: general web, llm, ai, code, benchmarks. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layou
Việc d-Matrix áp dụng NVIDIA NVLink Fusion khiến Raptor không còn được định vị đơn thuần như một card tăng tốc suy luận cắm qua PCIe. Thay vào đó, XPU (bộ xử lý tăng tốc chuyên dụng) này có thể trở thành một thành phần tích hợp ở quy mô rack trong thiết kế AI factory của NVIDIA — cách NVIDIA gọi hạ tầng trung tâm dữ liệu phục vụ huấn luyện và vận hành AI. 3
5
Raptor sẽ triển khai giao diện NVLink Fusion và tương thích với kiến trúc tham chiếu rack MGX/NVL144 làm mát bằng chất lỏng của NVIDIA. NVLink đảm nhiệm kết nối mở rộng scale-up băng thông cao, độ trễ thấp giữa các thiết bị trong hệ thống; còn Spectrum-X phụ trách mạng scale-out để mở rộng kết nối ra ngoài rack. 3
5
Trong một rack dùng Raptor, d-Matrix cung cấp XPU, còn NVIDIA có thể cung cấp các thành phần nền tảng quan trọng như CPU Vera, switch NVLink, DPU BlueField-4, SuperNIC ConnectX-9 và mạng Ethernet Spectrum-X. Điều này giữ lại cho khách hàng một thiết kế rack đã được kiểm chứng, cùng lớp I/O, kết nối mạng và quản trị hệ thống của NVIDIA. 5
6
Nói cách khác, NVLink Fusion giúp d-Matrix rút ngắn con đường từ silicon tùy biến đến triển khai quy mô lớn, vì không phải tự xây dựng trọn vẹn một nền tảng rack và hệ liên kết riêng. 4
d-Matrix nhắm Raptor vào pha decode của suy luận mô hình ngôn ngữ lớn: quá trình sinh từng token một. Ở giai đoạn này, hệ thống phải liên tục đọc trọng số mô hình, nên dung lượng và băng thông bộ nhớ trở thành nút thắt đáng kể.
GPU vẫn phù hợp cho bước prefill — xử lý ngữ cảnh đầu vào — và cho các tác vụ tính toán tổng quát. Raptor được định hướng như một phần bổ sung cho GPU trong chuỗi suy luận GPU–XPU, với mục tiêu giảm độ trễ tạo token, chứ không nhất thiết thay thế hoàn toàn GPU. 3
10
d-Matrix cho biết mục tiêu ở cấp rack là tối đa 144 Raptor XPU, với khoảng 2,3 TB DRAM xếp chồng 3D và 7,2 PB/giây băng thông bộ nhớ tổng hợp. Về lý thuyết, 2,3 TB có thể chứa mô hình hơn 4 nghìn tỷ tham số ở độ chính xác 4-bit; tuy nhiên, dung lượng mô hình có thể triển khai thực tế còn phụ thuộc metadata, trạng thái chạy và các chi phí phần mềm khác. 3
Raptor được mô tả gồm die tính toán tiến trình 4 nm kết hợp DRAM tùy biến. d-Matrix dự kiến tape-out vào cuối năm 2026, còn những hệ thống tích hợp rack đầu tiên dự kiến có mặt trong quý IV/2027. 10
4
Về mặt chiến lược, NVLink Fusion có thể giúp NVIDIA giữ khách hàng ở lại trong hệ sinh thái của mình ngay cả khi họ chọn bộ tăng tốc suy luận chuyên biệt từ bên thứ ba. NVIDIA khi đó vẫn có cơ hội cung cấp kiến trúc rack, fabric liên kết, switch, CPU, DPU, SuperNIC, Ethernet và hạ tầng liên quan. Đây là suy luận từ kiến trúc và mô hình hợp tác, không phải thông tin về điều khoản thương mại đã được công bố. 3
5
d-Matrix tham gia nỗ lực NVLink Fusion rộng hơn, với các đối tác được công bố công khai gồm AWS, Arm, Intel, Fujitsu, MediaTek và Marvell. Mục tiêu là biến NVLink thành giao diện nền tảng cho phần cứng AI không đồng nhất, mở rộng vai trò của NVIDIA từ chip tăng tốc sang toàn bộ lớp liên kết và hạ tầng bao quanh. 3
d-Matrix từng ra mắt bộ tăng tốc suy luận Corsair vào tháng 11/2024. Công ty sau đó nhận được vốn có sự tham gia của quỹ M12 của Microsoft: vòng Series C trị giá 275 triệu USD định giá công ty ở mức 2 tỷ USD, trong khi tổng vốn huy động tích lũy được đưa tin là khoảng 450 triệu USD. Hai con số này không nên bị hiểu nhầm là một vòng gọi vốn 450 triệu USD. 2
6
ParaSail từng báo cáo cải thiện tốc độ suy luận tới 10 lần khi kết hợp Corsair với GPU NVIDIA, nhưng đây là tuyên bố hiệu năng của doanh nghiệp/khách hàng, không phải một chuẩn đo độc lập. 12
Các công ty chưa công bố điều khoản tài chính của hợp tác. 1
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
NVLink Fusion cho phép Raptor kết nối trực tiếp vào kiến trúc rack MGX/NVL144 của NVIDIA, thay vì chỉ là một bộ tăng tốc PCIe rời.
NVLink Fusion cho phép Raptor kết nối trực tiếp vào kiến trúc rack MGX/NVL144 của NVIDIA, thay vì chỉ là một bộ tăng tốc PCIe rời. Raptor nhắm đến giai đoạn giải mã token theo token của suy luận AI, nơi băng thông và dung lượng bộ nhớ có vai trò đặc biệt quan trọng.
Một rack có thể kết hợp Raptor với CPU Vera, switch NVLink, DPU BlueField 4, SuperNIC ConnectX 9 và mạng Ethernet Spectrum X của NVIDIA.