인스퍼 인포메이션은 2026년 인공지능 컴퓨팅 대회(AICC2026)에서 초대형 모델과 응답 지연에 민감한 AI 에이전트 작업을 겨냥한 MetaBrain SD200 Ultra를 발표했다. 함께 공개한 MetaBrain HC2000은 많은 추론 요청에 걸쳐 토큰 생산량을 늘리는 데 초점을 맞춘 제품이다. 두 제품의 핵심 성능 수치는 제조사 발표에 근거하므로, 독립적으로 검증된 벤치마크와는 구분해야 한다.
3
18
20
SD200 Ultra의 구성과 성능 주장
SD200 Ultra는 3D Hyper Mesh 아키텍처로 중국산 AI 가속기 128개를 긴밀하게 연결한다. 인스퍼가 제시한 구성은 통합 주소 공간으로 접근하는 가속기 메모리 8TB와 시스템 메모리 64TB다. 회사는 한 대로 매개변수 2조 8000억 개인 Kimi K3를 실행할 수 있고, 최대 10조 개 규모의 모델도 지원한다고 설명한다. 다만 최대 지원 규모는 모델 수용 능력에 관한 주장이지, 그 크기의 모델에서 일정한 추론 속도를 보장한다는 뜻은 아니다.
3
17
Kimi K3를 실행했을 때 인스퍼가 제시한 수치는 생성 토큰당 5.85ms 미만이다. 회사는 이를 사용자 한 명 기준 초당 약 170토큰, ‘업계 평균의 5배’라고 표현한다. 그러나 공개된 시험 조건만으로는 업계 평균과 동일한 조건에서 비교했는지 판단하기 어렵다. 생성 토큰당 지연시간은 첫 토큰이 나오기까지 걸리는 시간이나 답변 전체를 받기까지의 시간과도 다르다.
1
3
칩 간 통신을 줄이는 방식
인스퍼는 전체 가속기가 공유하는 주소 체계와 메모리 기반 통신으로 칩 사이의 데이터 이동을 줄인다고 설명한다. 한 가속기가 다른 가속기의 메모리에 직접 접근하는 대칭 메모리 방식도 적용했다. 회사가 제시한 통신 지연시간 최저 0.69마이크로초와 AllReduce 통신 시간 3.5배 단축은 칩 간 통신에 관한 수치로, 사용자가 체감하는 답변 시간과 같지 않다.
2
17
Kimi K3 추론에는 KDA, Gated MLA, MoE 관련 연산을 더 큰 계산·통신 연산 단위로 합치는 최적화를 적용했다고 한다. 인스퍼는 이 방식으로 연산자 수가 약 10분의 1로 줄고 추론 성능은 3배 이상 높아졌다고 주장한다. 특정 모델과 작업에 맞춘 결과인 만큼 다른 모델에도 같은 향상 폭이 적용된다고 볼 수는 없다.
17
19
HC2000과 비교할 때 확인할 것
HC2000은 액체 냉각 랙, DirectCom 2.0 아키텍처, MCIS 추론 소프트웨어를 결합한 처리량 중심 제품이다. 인스퍼는 ‘동일 투자 대비 토큰 생산량 10배’를 내세우지만, 이것이 SD200 Ultra의 단일 사용자 토큰 생성 지연시간과 동등하다는 의미는 아니다. 어떤 시스템을 기준으로, 어떤 작업을, 어디까지의 비용을 포함해 비교했는지가 먼저 공개돼야 한다.
18
20
공개 보도는 SD200 Ultra의 가속기를 중국산으로 설명할 뿐 공급사는 밝히지 않는다. 구매를 검토한다면 칩 제조사와 소프트웨어 지원 범위를 확인하고, 실제 사용할 모델로 재현 가능한 시험을 요구할 필요가 있다. 시험에는 연산 정밀도, 입력 문맥 길이, 동시 사용자 수를 명시하고 첫 토큰 지연시간·지속 토큰 처리량·전력 사용량·총비용을 함께 측정해야 한다. 이런 조건 없이 발표 수치만으로 실제 운영 성능을 예측하기는 어렵다.
1
3
18