Inspur заявляє, що SD200 Ultra об’єднує 128 чипів і запускає модель Kimi K3 із 2,8 трлн параметрів із затримкою генерації менш ніж 5,85 мс на токен. HC2000 орієнтована на більший обсяг генерації токенів за ті самі інвестиції, а не на заявлену швидкість SD200 Ultra для одного користувача.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
На конференції з обчислень для штучного інтелекту AICC2026 компанія Inspur Information представила MetaBrain SD200 Ultra — супер-вузол для роботи з дуже великими моделями та ШІ-агентами, для яких важлива затримка відповіді. Одночасно вона показала MetaBrain HC2000 із іншим акцентом: нарощування обсягу інференсу, тобто генерації відповідей моделлю. Наведені показники продуктивності походять від Inspur; їх не варто сприймати як результати незалежного тестування. 3
18
20
За даними Inspur, архітектура 3D Hyper Mesh тісно поєднує 128 ШІ-прискорювачів китайського виробництва. Система має 8 ТБ пам’яті прискорювачів зі спільною адресацією та 64 ТБ системної пам’яті. Компанія стверджує, що одна така машина може запускати Kimi K3 із 2,8 трлн параметрів і підтримувати моделі розміром до 10 трлн параметрів. Остання цифра описує заявлену місткість системи, а не швидкість роботи з моделлю такого розміру. 3
17
Для Kimi K3 Inspur наводить затримку генерації менш ніж 5,85 мс на токен — приблизно 170 токенів за секунду для одного користувача. Компанія називає це швидкістю у п’ять разів вищою за середню в галузі, але оприлюднених умов тесту недостатньо, щоб оцінити коректність такого порівняння. До того ж час генерації одного токена — не те саме, що час до появи першого токена або очікування повної відповіді. 1
3
За поясненням Inspur, спільна адресація пам’яті й обмін даними між чипами зменшують потребу пересилати дані. Підхід із симетричною пам’яттю дає прискорювачу прямий доступ до пам’яті іншого прискорювача. Компанія заявляє про затримку такого обміну від 0,69 мкс і скорочення часу колективного обміну AllReduce у 3,5 раза. Це показники комунікації всередині системи, а не час відповіді застосунку користувачеві. 2
17
Для Kimi K3 компанія також об’єднала базові операції, пов’язані з KDA, Gated MLA та MoE, у більші операції обчислення й обміну даними. Inspur заявляє про приблизно десятикратне зменшення кількості операцій і понад трикратне зростання продуктивності інференсу. Цей приріст стосується заявленої оптимізації конкретного навантаження: його не можна автоматично переносити на інші моделі. 17
19
HC2000 компанія позиціонує для масштабного інференсу. У ній поєднано стійку з рідинним охолодженням, архітектуру DirectCom 2.0 та програмне забезпечення MCIS. Inspur обіцяє вдесятеро більший обсяг згенерованих токенів за тих самих інвестицій. Це твердження про пропускну здатність та економіку системи, а не про таку саму затримку для одного користувача, як заявлена для SD200 Ultra. Для оцінки потрібні порівнювана вихідна система, однакове навантаження й чітко визначені складники витрат. 18
20
У доступних повідомленнях прискорювачі SD200 Ultra названі китайськими, але їхнього виробника не вказано. Перед закупівлею будь-якої з двох систем варто з’ясувати модель чипа й підтримку програмного забезпечення та вимагати відтворюваних тестів на власних моделях. Умови тесту мають охоплювати точність обчислень, довжину контексту й кількість одночасних запитів; серед результатів потрібні час до першого токена, стала швидкість генерації, енергоспоживання та повна вартість. Без цього презентаційні цифри не дають надійного прогнозу для конкретного впровадження. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspur заявляє, що SD200 Ultra об’єднує 128 чипів і запускає модель Kimi K3 із 2,8 трлн параметрів із затримкою генерації менш ніж 5,85 мс на токен.
Inspur заявляє, що SD200 Ultra об’єднує 128 чипів і запускає модель Kimi K3 із 2,8 трлн параметрів із затримкою генерації менш ніж 5,85 мс на токен. HC2000 орієнтована на більший обсяг генерації токенів за ті самі інвестиції, а не на заявлену швидкість SD200 Ultra для одного користувача.