SD200 Ultra объединяет 128 произведённых в Китае ИИ ускорителей, 8 Тбайт памяти ускорителей с единым адресным пространством и 64 Тбайт оперативной памяти. Для модели Kimi K3 с 2,8 трлн параметров Inspur заявляет менее 5,85 мс на генерацию одного токена, но условия тестирования не позволяют считать это универсальным...
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
21 сентября на конференции по вычислениям для искусственного интеллекта AICC2026 компания Inspur Information представила MetaBrain SD200 Ultra — суперузел для работы с очень крупными моделями и ИИ-агентами, которым важна низкая задержка. Одновременно она показала MetaBrain HC2000, рассчитанную на другую задачу: увеличение общего объёма генерации при инференсе, то есть при работе уже обученной модели. Приведённые показатели производительности исходят от Inspur, а не из независимых сравнительных испытаний. 3
18
20
В основе SD200 Ultra — архитектура 3D Hyper Mesh, связывающая 128 произведённых в Китае ИИ-ускорителей. Заявлены 8 Тбайт памяти ускорителей с единым адресным пространством и 64 Тбайт оперативной памяти. По утверждению Inspur, одной системы достаточно для запуска Kimi K3 с 2,8 трлн параметров; также компания говорит о поддержке моделей размером до 10 трлн параметров. Последняя цифра характеризует заявленную ёмкость системы, но ничего не говорит о скорости работы модели такого размера. 3
17
Для Kimi K3 производитель указывает менее 5,85 мс на генерацию токена — примерно 170 токенов в секунду для одного пользователя. Inspur называет результат пятикратным превышением среднего по отрасли, однако опубликованных условий теста недостаточно для сопоставления на равных. Токен — небольшая единица текста, с которой работает модель; время генерации одного токена не равно ни задержке до появления первого токена, ни времени ожидания полного ответа. 1
3
По объяснению Inspur, единое адресное пространство и обмен данными между ускорителями с использованием операций доступа к памяти сокращают пересылки. Технология симметричной памяти позволяет одному ускорителю напрямую обращаться к памяти другого. Компания заявляет задержку обмена от 0,69 мкс и сокращение времени операции AllReduce в 3,5 раза. AllReduce — коллективная операция обмена и объединения данных между ускорителями; её показатели нельзя напрямую приравнивать ко времени ответа приложения. 2
17
Отдельная оптимизация рассчитана на Kimi K3: базовые операции, связанные с KDA, Gated MLA и MoE, объединяются в более крупные вычислительно-коммуникационные блоки. По данным Inspur, это сокращает число операций примерно в десять раз и повышает производительность инференса более чем втрое. Такой прирост заявлен для конкретной нагрузки и не гарантирован для других моделей. 17
19
HC2000 делает ставку не на заявленную задержку для одного пользователя, а на суммарный выпуск токенов. В её состав входят стойка с жидкостным охлаждением, архитектура DirectCom 2.0 и программный комплекс инференса MCIS. Inspur обещает в десять раз больше токенов при тех же вложениях, но для оценки этого тезиса нужны исходная система для сравнения, одинаковая нагрузка и чётко определённые границы расчёта затрат. Это не заявление о том, что HC2000 повторяет показатель задержки SD200 Ultra. 18
20
В опубликованных описаниях ускорители SD200 Ultra названы произведёнными в Китае, но их поставщик не указан. Потенциальному покупателю стоит выяснить точную модель чипа и доступную программную поддержку, а затем запросить воспроизводимые испытания на собственных моделях. В протоколе следует зафиксировать точность вычислений, длину контекста и число одновременных запросов; измерять нужно задержку до первого токена, устойчивую скорость генерации, энергопотребление и совокупные затраты. Без этих условий показатели презентации не позволяют надёжно прогнозировать работу системы в конкретном развёртывании. 1
3
18
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
SD200 Ultra объединяет 128 произведённых в Китае ИИ ускорителей, 8 Тбайт памяти ускорителей с единым адресным пространством и 64 Тбайт оперативной памяти.
SD200 Ultra объединяет 128 произведённых в Китае ИИ ускорителей, 8 Тбайт памяти ускорителей с единым адресным пространством и 64 Тбайт оперативной памяти. Для модели Kimi K3 с 2,8 трлн параметров Inspur заявляет менее 5,85 мс на генерацию одного токена, но условия тестирования не позволяют считать это универсальным показателем скорости ответа.
HC2000 ориентирована на объём выпускаемых токенов: обещание десятикратного прироста при тех же вложениях требует уточнения базы сравнения и проверки на задачах покупателя.