Nvidia và d Matrix lên kế hoạch cho hệ thống suy luận lai: GPU xử lý prefill nặng tính toán, còn Raptor XPU đảm nhiệm decode sinh từng token, kết nối qua NVLink Fusion. MGX, NVLink Fusion và hệ thống mạng Nvidia được kỳ vọng giảm rủi ro tích hợp một bộ tăng tốc chuyên biệt ở quy mô tủ máy chủ, chứ không nhằm thay th...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Các dịch vụ AI tạo sinh ngày càng được đánh giá bằng tốc độ bắt đầu trả lời và khả năng duy trì dòng phản hồi. Hợp tác giữa Nvidia và d-Matrix công bố ngày 10/9/2026 nhắm đúng vào điểm nghẽn đó: đưa các XPU suy luận Raptor sắp ra mắt của d-Matrix kết nối trực tiếp với hạ tầng AI do Nvidia thiết kế, để từng phần của một yêu cầu mô hình ngôn ngữ lớn (LLM) được giao cho loại bộ xử lý phù hợp nhất. 1
3
4
Điểm cần lưu ý là đây là mô hình bổ trợ, không phải tuyên bố Raptor sẽ thay thế GPU Nvidia. Trong kiến trúc không đồng nhất này, GPU đảm nhận bước prefill nặng tính toán, còn bộ tăng tốc d-Matrix tập trung vào decode — giai đoạn nhạy cảm với độ trễ, nơi mô hình tạo đầu ra từng token một. 4
5
Một yêu cầu tới LLM gồm các pha có đặc tính rất khác nhau. Prefill xử lý prompt và toàn bộ ngữ cảnh đầu vào; decode sau đó lặp lại việc tạo token kế tiếp. d-Matrix định vị kiến trúc suy luận của mình, gồm cả sản phẩm Corsair hiện tại, cho tác vụ decode phối hợp với GPU — loại phần cứng mà hãng mô tả là phù hợp với khối lượng công việc nặng về tính toán. 26
Cách phân vai này đặc biệt đáng chú ý với các sản phẩm tương tác, nơi thời gian tới token tiếp theo ảnh hưởng trực tiếp đến cảm nhận người dùng: trợ lý lập trình, chatbot hay trải nghiệm giọng nói. Nền tảng Raptor được d-Matrix hướng tới những dịch vụ token cao cấp, độ trễ cực thấp. 4
8
Tuy nhiên, chia nhỏ các pha xử lý cũng tạo ra bài toán hệ thống: dữ liệu phải được trao đổi giữa các bộ xử lý đủ nhanh, nếu không chi phí truyền dữ liệu có thể triệt tiêu lợi ích của chuyên môn hóa. Đây là vai trò mà lựa chọn hạ tầng trong hợp tác này hướng đến.
Raptor dự kiến sử dụng NVLink Fusion để tham gia miền mở rộng theo chiều dọc (scale-up) NVLink của Nvidia, trong khi Spectrum-X phụ trách kết nối mở rộng theo chiều ngang (scale-out) giữa các hệ thống. Nvidia cho biết cách tiếp cận này mở đường để silicon tùy biến của d-Matrix kết nối với nền tảng hạ tầng AI rộng hơn của hãng. 3
Tủ máy chủ d-Matrix được lên kế hoạch dựa trên kiến trúc tham chiếu MGX của Nvidia, với các thành phần dự kiến gồm CPU Nvidia Vera, switch NVLink, DPU BlueField-4, ConnectX-9 SuperNIC và Ethernet Spectrum-X. 4
8
Ý nghĩa với d-Matrix không chỉ nằm ở liên kết tốc độ cao. Thay vì tự xác thực toàn bộ máy chủ, mạng, điện năng, làm mát và chuỗi cung ứng cho một bộ xử lý mới, công ty có thể phát triển trên một hệ sinh thái rack đã được kiểm chứng. Nvidia mô tả MGX cùng nền tảng rộng hơn của mình là con đường nhanh hơn và ít rủi ro hơn để đưa silicon tùy biến tới triển khai quy mô lớn. 3
Nói cách khác, mục tiêu là biến Raptor thành một phần có thể triển khai trong kiểu “nhà máy AI” của Nvidia, thay vì một thiết bị suy luận độc lập.
d-Matrix đã nêu cấu hình quy mô rack đầy tham vọng cho Raptor: tối đa 144 XPU mỗi rack, 2,3 TB DRAM xếp chồng 3D và tổng băng thông bộ nhớ 7,2 PB/giây. Công ty cho biết thiết kế này hướng đến hỗ trợ mô hình lớn hơn 4 nghìn tỷ tham số ở độ chính xác 4-bit. Đây là thông số dự kiến, chưa phải kết quả sản phẩm thương mại đã được xác thực độc lập. 4
Kiến trúc này phản ánh quan điểm của d-Matrix rằng decode LLM bị chi phối mạnh bởi việc di chuyển dữ liệu trong bộ nhớ và băng thông khả dụng. Gói 3D đề xuất cho Raptor kết hợp một chip bộ nhớ DRAM với một chip tính toán SRAM, tiếp nối hướng tiếp cận lấy bộ nhớ làm trung tâm của công ty. 4
d-Matrix cho biết Raptor dự kiến tape-out — hoàn tất thiết kế để chuyển sang sản xuất chip — vào cuối năm 2026; các hệ thống rack MGX đầu tiên dự kiến có mặt trong quý IV/2027. Trước mốc đó vẫn còn nhiều khâu phải thực hiện thành công, từ sản xuất, đóng gói, xác thực hệ thống đến triển khai ở quy mô rack. 4
8
Vai trò của Nvidia đáng chú ý ở chỗ hãng cho phép một XPU chuyên biệt bên ngoài kết nối vào kiến trúc rack và kết cấu mạng của mình, thay vì buộc mọi giai đoạn suy luận phải chạy trên GPU Nvidia.
Nvidia mô tả nền tảng AI của mình là “tích hợp theo chiều dọc và mở theo chiều ngang”: hãng vẫn duy trì giá trị từ kết nối scale-up, mạng scale-out, thiết kế rack và hệ sinh thái, đồng thời cho phép các bộ xử lý khác tham gia. 3
Điều đó mở rộng các loại khối lượng công việc mà nền tảng có thể phục vụ. Khách hàng cần một bộ tăng tốc tối ưu cho decode có thể tiếp tục vận hành trong hạ tầng tương thích Nvidia nếu bộ tăng tốc ấy dùng được NVLink Fusion, MGX và Spectrum-X. Vì vậy, đây phù hợp hơn với cách hiểu là bổ trợ có kiểm soát, không phải Nvidia rút lui khỏi GPU: GPU vẫn là trung tâm cho huấn luyện, suy luận đa dụng và prefill; thiết bị chuyên dụng được định vị cho decode. 1
4
5
Raptor là sản phẩm kế tiếp sau bộ tăng tốc suy luận Corsair của d-Matrix. Theo công ty, Corsair được thiết kế riêng cho decode trong suy luận tách rời và hoạt động cùng GPU, chứ không thay thế GPU. 26
D-Matrix từng công bố các tuyên bố về hiệu năng, chi phí và hiệu quả năng lượng của hệ thống lai dùng Corsair. Tuy nhiên, những số liệu này nên được xem là tuyên bố của doanh nghiệp nếu chưa có chi tiết benchmark độc lập có thể tái lập. Các tài liệu hiện có không chứng minh một mức cải thiện phổ quát cho mọi mô hình, kích cỡ lô xử lý hay cấu hình triển khai. 25
28
Công ty đã huy động 275 triệu USD ở vòng Series C, với định giá được báo cáo là 2 tỷ USD, nâng tổng vốn huy động được báo cáo lên 450 triệu USD; M12, quỹ đầu tư mạo hiểm của Microsoft, là một trong các nhà đầu tư. 21
30 Reuters cũng cho biết Microsoft từng đầu tư vào d-Matrix trong vòng gọi vốn năm 2023, và d-Matrix đã xuất xưởng chip AI đầu tiên vào tháng 11/2024.
1
Những cột mốc này cho thấy d-Matrix đang chuyển từ một sản phẩm suy luận đơn lẻ sang lộ trình ở cấp rack. Tích hợp với Nvidia có thể tăng độ tin cậy của hướng đi đó với khách hàng vốn đã mua hoặc vận hành hạ tầng Nvidia.
Các điều khoản tài chính của thỏa thuận Nvidia–d-Matrix không được công bố. 1 Vì vậy, chưa thể xác định liệu thỏa thuận có bao gồm phí cấp phép, cam kết kỹ thuật chung, đơn hàng theo sản lượng, chia sẻ doanh thu hay khoản đầu tư từ Nvidia hay không.
Kết luận tổng quát thì rõ hơn: hai công ty đang chuẩn bị cho thị trường suy luận nơi một loại bộ xử lý không nhất thiết phải thực hiện mọi bước trong yêu cầu LLM. d-Matrix có đường đi vào các “nhà máy AI” tương thích Nvidia; Nvidia có thêm lựa chọn decode chuyên biệt, tích hợp với nền tảng mạng và rack của mình. Chiến lược này có thực sự giảm độ trễ hoặc cải thiện hiệu quả kinh tế ở quy mô lớn hay không sẽ phụ thuộc vào phần cứng Raptor cuối cùng, phần mềm điều phối và các benchmark từ khách hàng sau thời điểm dự kiến có hàng năm 2027. 3
4
8
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Nvidia và d Matrix lên kế hoạch cho hệ thống suy luận lai: GPU xử lý prefill nặng tính toán, còn Raptor XPU đảm nhiệm decode sinh từng token, kết nối qua NVLink Fusion.
Nvidia và d Matrix lên kế hoạch cho hệ thống suy luận lai: GPU xử lý prefill nặng tính toán, còn Raptor XPU đảm nhiệm decode sinh từng token, kết nối qua NVLink Fusion. MGX, NVLink Fusion và hệ thống mạng Nvidia được kỳ vọng giảm rủi ro tích hợp một bộ tăng tốc chuyên biệt ở quy mô tủ máy chủ, chứ không nhằm thay thế GPU Nvidia.
Thỏa thuận cho thấy Nvidia muốn mở hạ tầng “AI factory” cho silicon bên thứ ba chuyên dụng, đồng thời giữ vai trò trung tâm của kết nối, mạng và kiến trúc rack.