지푸AI의 GLM-5.3-FlashX를 이해하는 핵심은 ‘새 모델’보다 더 빠른 제공 방식에 있다. 기반이 되는 GLM-5.3-Flash는 오픈소스로 공개됐지만, FlashX는 이를 고속으로 이용하도록 마련된 API 서비스로 소개된다. 현재 제시된 자료에서 FlashX만의 새로운 모델 구조나 별도의 가중치 공개는 확인되지 않는다.
1
4
같은 기반 모델, 다른 속도와 요금
GLM-5.3-Flash는 텍스트와 이미지 등을 다루는 멀티모달 전문가 혼합(MoE) 모델이다. 전체 매개변수는 3,200억 개이고, 한 번의 처리에 활성화되는 매개변수는 180억 개다. 지푸AI가 제시한 문맥 처리 한도는 100만 토큰이다.
1
7
지푸AI는 FlashX의 출력 속도가 최대 초당 200토큰이라고 광고한다. 여기서 토큰은 모델이 글을 생성할 때 쓰는 단위다. 다만 이 수치는 업체가 제시한 최고 속도이지, 동일한 조건에서 기반 모델보다 얼마나 빨라졌는지를 입증하는 비교 시험 결과는 아니다.
1
4
‘처리량 3.2배’는 한 사람의 답변 속도가 아니다
지푸AI는 GLM-5.3-Flash의 실제 서비스 트래픽이 중국산 AI 가속기 10만 개 이상에서 처리된다고 설명한다. 또 GLM-5.3을 활용한 ‘Infra Agent’가 추론 서비스의 병목을 찾고 코드를 수정하는 등 최적화에 참여했다고 밝혔다. 보도된 작업에는 KV 데이터 전송 과정의 동시 처리 병목 완화와 출력 생성 단계의 연산 최적화가 포함된다.
6
7
회사 측에 따르면 첫 가동부터 전체 실서비스 트래픽을 처리하기까지 2주가 채 걸리지 않았고, 그 과정에서 시스템의 종단 간 처리량이 초기 기준의 3.2배가 됐다. 이는 서비스가 전체적으로 처리할 수 있는 작업량에 관한 주장이다. FlashX 이용자 한 명에게 답변이 나오는 속도가 3.2배가 됐다는 뜻은 아니다.
13
15
지푸AI는 하드웨어 활용률과 토큰당 서비스 운영 비용도 주류 엔비디아 GPU 기반 시스템과 비슷한 수준이라고 주장한다. 그러나 운영 비용과 고객이 내는 API 요금은 별개다. 공개된 요금 기준으로 100만 토큰당 FlashX는 입력 0.37달러·출력 1.25달러, Flash는 입력 0.15달러·출력 0.50달러다. FlashX의 출력 요금은 Flash의 2.5배다.
13
4
5
따라서 확인해야 할 것은 최고 속도만이 아니다. 동시 요청이 몰릴 때도 초당 200토큰에 가까운 속도를 유지하는지, 지연과 서비스 안정성은 어떤지 독립 측정이 필요하다. 가속기 수와 실제 트래픽 처리 범위, Infra Agent와 엔지니어 각각의 기여, 처리량 3.2배의 비교 기준, 엔비디아 시스템과의 비용 비교 역시 동일 조건에서 검증돼야 한다. 현재 자료는 이 수치들을 독립적으로 재현하기보다 대체로 지푸AI의 발표를 전하고 있다.
1
5
6