Inspur cho biết SD200 Ultra kết nối 128 chip AI, có thể chạy Kimi K3 với 2,8 nghìn tỷ tham số và đạt độ trễ tạo token dưới 5,85 ms. HC2000 hướng tới tạo nhiều token hơn trên cùng mức đầu tư, không phải cạnh tranh trực tiếp về độ trễ cho một người dùng.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Tại Hội nghị Điện toán Trí tuệ Nhân tạo 2026 (AICC2026), Inspur Information ra mắt MetaBrain SD200 Ultra, một hệ thống kết nối nhiều chip thành một cụm tính toán chặt chẽ, nhắm tới mô hình AI rất lớn và các tác vụ AI agent cần phản hồi nhanh. Hãng đồng thời giới thiệu MetaBrain HC2000, tập trung vào sản lượng token khi phục vụ khối lượng suy luận lớn. Những con số hiệu năng được công bố cho cả hai sản phẩm đều cần được xem là tuyên bố của nhà cung cấp, chưa phải kết quả kiểm thử độc lập. 3
18
20
Theo Inspur, kiến trúc 3D Hyper Mesh kết nối chặt chẽ 128 chip tăng tốc AI sản xuất trong nước, đi kèm 8 TB bộ nhớ trên chip tăng tốc được đánh địa chỉ thống nhất và 64 TB bộ nhớ hệ thống. Hãng nói một hệ thống có thể chạy Kimi K3 với 2,8 nghìn tỷ tham số, đồng thời hỗ trợ mô hình lên tới 10 nghìn tỷ tham số. Con số 10 nghìn tỷ nói về khả năng chứa và vận hành mô hình theo công bố, không cho biết tốc độ suy luận ở quy mô đó. 3
17
Với Kimi K3, Inspur báo cáo dưới 5,85 mili giây cho mỗi token được tạo, tương đương khoảng 170 token/giây cho một người dùng; hãng cũng nói tốc độ này gấp năm lần mức trung bình ngành. Các nguồn được cung cấp không nêu đủ điều kiện thử nghiệm để xác nhận đây là phép so sánh tương đương. Token là đơn vị mà mô hình xử lý và tạo ra, không nhất thiết trùng với một từ; độ trễ mỗi token cũng khác thời gian chờ token đầu tiên hoặc toàn bộ câu trả lời. 1
3
Inspur cho biết cơ chế đánh địa chỉ thống nhất và giao tiếp theo ngữ nghĩa bộ nhớ giúp giảm việc chuyển dữ liệu giữa các chip. Công nghệ bộ nhớ đối xứng cho phép một chip tăng tốc truy cập trực tiếp bộ nhớ của chip khác. Hãng công bố độ trễ giao tiếp thấp nhất 0,69 micro giây và thời gian giao tiếp AllReduce giảm 3,5 lần. Đây là chỉ số về giao tiếp nội bộ, không phải thời gian ứng dụng trả lời người dùng. 2
17
Riêng với Kimi K3, Inspur nói họ gộp các phép toán liên quan đến KDA, Gated MLA và MoE thành những toán tử lớn kết hợp tính toán với giao tiếp. Theo hãng, cách làm này giảm khoảng 10 lần số toán tử và cải thiện hiệu năng suy luận hơn ba lần. Không nên mặc định mức tăng đó sẽ lặp lại trên mô hình khác. 17
19
Trong khi SD200 Ultra nhấn mạnh khả năng chạy mô hình lớn với độ trễ thấp, HC2000 được giới thiệu để tăng sản lượng suy luận. Hệ thống này kết hợp tủ máy làm mát bằng chất lỏng, kiến trúc DirectCom 2.0 và phần mềm suy luận MCIS. Inspur tuyên bố sản lượng token gấp 10 lần với cùng mức đầu tư; con số ấy cần được đối chiếu với mốc ban đầu, tác vụ thử nghiệm và các khoản chi phí được tính vào phép so sánh. Nó không có nghĩa HC2000 đạt độ trễ cho một người dùng như SD200 Ultra. 18
20
Các nguồn mô tả chip tăng tốc của SD200 Ultra là sản phẩm trong nước nhưng không nêu tên nhà cung cấp. Trước khi quyết định mua, khách hàng nên yêu cầu thông tin về chip và khả năng hỗ trợ phần mềm, rồi chạy thử có thể tái lập trên chính mô hình dự định triển khai. Phép thử cần ghi rõ độ chính xác tính toán, độ dài ngữ cảnh và số yêu cầu đồng thời; đồng thời đo thời gian tới token đầu tiên, sản lượng token duy trì, điện năng và tổng chi phí. Thiếu các điều kiện này, số liệu ra mắt khó dự báo hiệu năng trong môi trường sử dụng thực tế. 1
3
18
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Inspur cho biết SD200 Ultra kết nối 128 chip AI, có thể chạy Kimi K3 với 2,8 nghìn tỷ tham số và đạt độ trễ tạo token dưới 5,85 ms.
Inspur cho biết SD200 Ultra kết nối 128 chip AI, có thể chạy Kimi K3 với 2,8 nghìn tỷ tham số và đạt độ trễ tạo token dưới 5,85 ms. HC2000 hướng tới tạo nhiều token hơn trên cùng mức đầu tư, không phải cạnh tranh trực tiếp về độ trễ cho một người dùng.