사진 속 물체의 위치를 알아보는 것과, 시점이 바뀐 뒤에도 그 위치 관계를 정확히 파악하는 것은 다른 문제다. TaichuAI의 ZDTaichu5.0-9B는 이런 공간 추론을 연구할 수 있도록 공개된 약 90억 매개변수 규모의 비전·언어 모델이다. 장면 해석이나 도구 사용 에이전트 실험에 활용할 수 있지만, 모델이 장면에 관해 그럴듯하게 답한다고 해서 로봇이 그곳에서 안전하게 행동할 수 있다는 뜻은 아니다.
2
20
어떤 입력을 다루나
언어 처리에는 Qwen3.5-9B 디코더, 시각 처리에는 C-RADIOv4-H 인코더를 결합했다. TaichuAI는 텍스트, 이미지 한 장 또는 여러 장, 영상 입력과 다양한 해상도의 시각 입력을 지원한다고 설명한다. 명시된 문맥 길이는 최대 128K 토큰이다. 여러 시점의 자료를 함께 살피는 연구에 쓰일 수 있는 사양이지만, 모든 입력 크기와 최대 문맥 길이에서 동일한 성능이 입증됐다는 의미는 아니다.
2
TaichuAI가 설명하는 핵심 기법은 엔트로피 게이트 기반 적응형 순환 추론이다. 모든 토큰에 똑같은 내부 계산을 쓰는 대신, 어려운 토큰에 추가적인 잠재 표현 정제 단계를 배분한다는 방식이다. 연구자는 이를 바탕으로 시점 변화에 따른 물체 위치 파악이나 공간 관계 해석을 시험해 볼 수 있다. 다만 ZDTaichu5.0-9B 자체가 검증된 로봇 제어 시스템은 아니다.
20
2
발표된 점수는 어떻게 읽어야 하나
TaichuAI가 공개한 점수는 ViewSpatial 62.50, MindCube-tiny 78.27, MMSI-Bench 47.20, ERQA 48.00, RoboSpatial 56.00이다. 회사는 비교 대상인 비슷한 크기의 범용 비전·언어 모델 가운데 공간 추론 성능이 앞선다고 설명한다. 그러나 이 수치는 발표 측이 보고한 평가 결과로, 여기서 독립적으로 재현한 결과는 아니다. 연구자가 쓰려는 장면과 에이전트 구성, 물리적 환경에서 성능을 다시 확인해야 한다.
1
20
내려받기 전에 확인할 두 가지
기본 모델은 모델 공유 플랫폼 허깅페이스에 공개돼 있으며, TaichuAI는 FP8·NVFP4 변형 모델과 vLLM에서 추측 디코딩에 사용하는 DSpark 초안 모델도 제공한다. 서빙에는 일반 vLLM 설치가 동일하게 작동한다고 가정하기보다, TaichuAI가 문서화한 전용 Docker 이미지나 수정된 vLLM 브랜치를 출발점으로 삼는 편이 적절하다.
2
4
5
3
17
첫째는 라이선스다. 제3자가 변환한 GGUF 모델에는 Apache-2.0 표시가 있지만, 다른 모델 목록은 상이한 라이선스 구성을 설명한다. 변환본의 표기만으로 원본 모델과 구성 요소의 재사용 조건을 확정하지 말고 각각 확인해야 한다.
8
6
둘째는 문맥 길이다. TaichuAI의 vLLM 예시 명령에는 --max-model-len 220000이 들어 있지만, 모델 사양에 적힌 길이는 최대 128K 토큰이다. 서버 설정값을 22만 토큰의 실효 문맥 길이가 검증됐다는 근거로 읽어서는 안 된다.
17
2