Inspur berkata SD200 Ultra menggabungkan 128 cip AI dan boleh menjalankan Kimi K3 dengan 2.8 trilion parameter pada masa penjanaan kurang 5.85 milisaat bagi setiap token. HC2000 pula menyasarkan pengeluaran token pada skala besar.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information memperkenalkan MetaBrain SD200 Ultra pada persidangan pengkomputeran AI AICC2026 sebagai supernode—sistem yang menghubungkan banyak cip pemecut AI secara rapat—untuk model sangat besar dan aplikasi ejen AI yang peka terhadap kelewatan. Syarikat itu turut memperkenalkan MetaBrain HC2000, yang menumpukan kapasiti pengeluaran token bagi beban kerja inferens. Angka prestasi kedua-duanya datang daripada Inspur, bukan penanda aras bebas. 3
18
20
SD200 Ultra menggunakan seni bina 3D Hyper Mesh untuk menghubungkan 128 cip pemecut AI buatan tempatan. Inspur menyatakan sistem ini mempunyai 8 TB memori pemecut dengan pengalamatan bersepadu dan 64 TB memori sistem. Menurut syarikat itu, sebuah mesin boleh menjalankan Kimi K3 dengan 2.8 trilion parameter serta menyokong model sehingga 10 trilion parameter. Angka 10 trilion itu ialah dakwaan tentang kapasiti model, bukan bukti kelajuan inferens pada saiz tersebut. 3
17
Untuk Kimi K3, Inspur melaporkan masa penjanaan kurang 5.85 milisaat bagi setiap token, bersamaan kira-kira 170 token sesaat untuk seorang pengguna. Syarikat itu menyifatkannya sebagai lima kali purata industri, tetapi maklumat ujian yang tersedia tidak mencukupi untuk mengesahkan bahawa perbandingan tersebut dibuat atas dasar yang setara. Masa menjana satu token juga tidak sama dengan masa menunggu token pertama atau masa untuk menerima jawapan lengkap. 1
3
Menurut Inspur, pengalamatan bersepadu dan komunikasi berasaskan memori mengurangkan keperluan memindahkan data antara cip. Pendekatan memori simetrinya membolehkan satu pemecut mengakses terus memori pemecut lain. Syarikat itu melaporkan kelewatan komunikasi serendah 0.69 mikrosaat dan masa komunikasi AllReduce berkurang 3.5 kali ganda. Ini ukuran komunikasi antara komponen, bukannya masa respons yang akan dialami pengguna aplikasi. 2
17
Bagi inferens Kimi K3, Inspur berkata ia menggabungkan operasi berkaitan KDA, Gated MLA dan MoE menjadi operasi pengiraan serta komunikasi yang lebih besar. Syarikat itu mendakwa bilangan operasi turun kira-kira 10 kali ganda dan prestasi inferens meningkat lebih tiga kali ganda. Peningkatan tersebut khusus kepada beban kerja yang dilaporkan; ia tidak semestinya berlaku pada model lain. 17
19
HC2000 membawa tawaran yang berbeza: meningkatkan jumlah token yang boleh dihasilkan, bukannya mengejar angka kelewatan seorang pengguna yang dilaporkan bagi SD200 Ultra. Ia menggabungkan rak penyejukan cecair, seni bina DirectCom 2.0 dan perisian inferens MCIS. Inspur mendakwa output token 10 kali ganda bagi pelaburan yang sama. Untuk menilai dakwaan itu, pembeli perlu mengetahui sistem perbandingan, beban kerja dan kos yang termasuk dalam pengiraan. 18
20
Laporan yang tersedia menyebut cip pemecut SD200 Ultra sebagai buatan tempatan, tetapi tidak menamakan pembekalnya. Sebelum membeli mana-mana sistem, minta identiti cip dan butiran sokongan perisian. Kemudian jalankan ujian yang boleh diulang menggunakan model sendiri, dengan ketepatan pengiraan, panjang konteks dan bilangan permintaan serentak dinyatakan dengan jelas. Ukur masa menunggu token pertama, kadar pengeluaran token yang berterusan, penggunaan kuasa dan jumlah kos. Tanpa syarat ujian itu, angka pelancaran tidak cukup untuk meramalkan prestasi dalam penggunaan sebenar. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspur berkata SD200 Ultra menggabungkan 128 cip AI dan boleh menjalankan Kimi K3 dengan 2.8 trilion parameter pada masa penjanaan kurang 5.85 milisaat bagi setiap token.
Inspur berkata SD200 Ultra menggabungkan 128 cip AI dan boleh menjalankan Kimi K3 dengan 2.8 trilion parameter pada masa penjanaan kurang 5.85 milisaat bagi setiap token. HC2000 pula menyasarkan pengeluaran token pada skala besar. Dakwaan output 10 kali ganda bagi pelaburan yang sama memerlukan garis asas dan kaedah ujian yang jelas.