SD200 Ultra menggabungkan 128 akselerator AI, memori akselerator 8 TB dengan pengalamatan terpadu, dan memori sistem 64 TB. Klaim waktu pembuatan token di bawah 5,85 milidetik belum cukup untuk menilai waktu tunggu respons secara keseluruhan atau membandingkannya langsung dengan sistem lain.
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information memperkenalkan MetaBrain SD200 Ultra pada konferensi komputasi AI AICC2026 sebagai supernode—sistem yang menghubungkan banyak akselerator secara erat—untuk model berukuran sangat besar dan beban kerja agen AI yang peka terhadap latensi. Bersamaan dengannya, Inspur memperkenalkan MetaBrain HC2000 dengan sasaran berbeda: meningkatkan kapasitas produksi token saat inferensi, yakni ketika model menghasilkan jawaban. Angka performa yang diumumkan untuk kedua produk berasal dari Inspur, bukan hasil uji independen. 3
18
20
SD200 Ultra menggunakan arsitektur 3D Hyper Mesh untuk menghubungkan 128 akselerator AI buatan dalam negeri Tiongkok. Menurut Inspur, sistem ini menyediakan 8 TB memori akselerator dengan pengalamatan terpadu dan 64 TB memori sistem. Perusahaan menyatakan satu sistem dapat menjalankan Kimi K3 berparameter 2,8 triliun serta mendukung model hingga 10 triliun parameter. Angka 10 triliun menunjukkan kapasitas yang diklaim, bukan bukti kecepatan inferensi pada ukuran model tersebut. 3
17
Untuk Kimi K3, Inspur melaporkan waktu pembuatan kurang dari 5,85 milidetik per token, setara dengan sekitar 170 token per detik untuk satu pengguna. Perusahaan menyebutnya lima kali rata-rata industri, tetapi rincian pengujian yang tersedia tidak cukup untuk memastikan perbandingannya setara. Waktu menghasilkan tiap token juga berbeda dari waktu hingga token pertama muncul maupun waktu tunggu sampai seluruh jawaban selesai. 1
3
Menurut Inspur, pengalamatan memori terpadu dan komunikasi berbasis memori mengurangi perpindahan data antarchip. Pendekatan memori simetrisnya memungkinkan sebuah akselerator mengakses langsung memori akselerator lain. Perusahaan melaporkan latensi komunikasi serendah 0,69 mikrodetik dan waktu komunikasi AllReduce turun 3,5 kali lipat. Keduanya adalah ukuran komunikasi internal, bukan waktu respons aplikasi yang dirasakan pengguna. 2
17
Inspur juga menyatakan bahwa, khusus untuk inferensi Kimi K3, operasi yang terkait dengan KDA, Gated MLA, dan MoE digabung menjadi operasi komputasi-dan-komunikasi yang lebih besar. Menurut perusahaan, jumlah operator berkurang sekitar sepuluh kali lipat dan performa inferensi meningkat lebih dari tiga kali lipat. Hasil ini harus dibaca sebagai klaim untuk beban kerja tertentu, bukan jaminan peningkatan yang sama pada model lain. 17
19
HC2000 diposisikan untuk inferensi berkapasitas tinggi: menghasilkan lebih banyak token pada beban kerja yang sebanding. Sistem ini menggabungkan rak berpendingin cairan, arsitektur DirectCom 2.0, dan perangkat lunak inferensi MCIS. Inspur mengklaim jumlah token yang dihasilkan naik sepuluh kali lipat untuk investasi yang sama. Itu adalah klaim kapasitas dan keekonomian, bukan pernyataan bahwa HC2000 menyamai latensi per token untuk satu pengguna yang dilaporkan pada SD200 Ultra. Pembeli perlu meminta kejelasan sistem pembanding, beban kerja, dan komponen biaya yang dihitung. 18
20
Laporan yang tersedia menyebut akselerator SD200 Ultra sebagai chip buatan dalam negeri Tiongkok, tetapi tidak mengidentifikasi pemasoknya. Sebelum membeli salah satu sistem, calon pembeli sebaiknya meminta identitas chip dan rincian dukungan perangkat lunak, lalu menguji model yang akan mereka pakai dengan metode yang dapat diulang. Tetapkan presisi komputasi, panjang konteks, dan jumlah pengguna serentak; ukur waktu hingga token pertama, laju token yang berkelanjutan, konsumsi daya, serta biaya total. Tanpa kondisi tersebut, angka peluncuran belum dapat diandalkan untuk memperkirakan performa dalam penerapan nyata. 1
3
18
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
SD200 Ultra menggabungkan 128 akselerator AI, memori akselerator 8 TB dengan pengalamatan terpadu, dan memori sistem 64 TB.
SD200 Ultra menggabungkan 128 akselerator AI, memori akselerator 8 TB dengan pengalamatan terpadu, dan memori sistem 64 TB. Klaim waktu pembuatan token di bawah 5,85 milidetik belum cukup untuk menilai waktu tunggu respons secara keseluruhan atau membandingkannya langsung dengan sistem lain.
HC2000 ditujukan untuk meningkatkan jumlah token yang dihasilkan pada tingkat investasi yang sama.