ZDTaichu5.0 9B는 약 90억 파라미터 규모의 Qwen3.5 9B 언어 디코더와 C RADIOv4 H 비전 인코더를 결합한 TaichuAI의 오픈 멀티모달 모델이다. 텍스트·단일/복수 이미지·영상을 입력받고, 임의 해상도 시각 입력과 최대 128K 토큰 컨텍스트를 지원한다고 소개된다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B는 TaichuAI가 공개한 멀티모달 기반 모델이다. 단순히 사진 속 대상을 설명하는 용도보다, 시점이 바뀐 장면에서 물체의 위치 관계를 파악하거나 여러 이미지와 영상의 단서를 연결해야 하는 문제를 주요 목표로 삼는다. 공간 추론, 에이전트의 도구 사용 계획, 임바디드 AI(물리 환경에서 인지·행동하는 AI) 연구가 핵심 활용 분야다. 2
공개된 모델 설명에 따르면 ZDTaichu5.0-9B는 약 90억 파라미터급 Qwen3.5-9B 언어 디코더와 C-RADIOv4-H 비전 인코더를 결합했다. 텍스트뿐 아니라 한 장 또는 여러 장의 이미지, 영상을 처리할 수 있으며, 임의 해상도의 시각 입력과 최대 128K 토큰 컨텍스트를 지원한다. 2
이 구성은 일반적인 이미지 캡셔닝을 넘는 작업을 겨냥한다. 모델 카드에는 문서·차트·도표 이해, OCR(광학 문자 인식), 시각 질의응답, 시각 수학과 함께 장면 전반의 해석 능력이 활용 범위로 제시돼 있다. 2
TaichuAI가 강조하는 지점은 범용 비전·언어 모델이 어려워하는 공간 및 임바디드 과제다. 모델 설명에서 제시된 기능은 다음과 같다.
에이전트 지향 상호작용도 지원 대상으로 제시된다. 다만 이는 모델이 도구 호출을 계획하고 여러 단계의 대화·작업 흐름에 참여할 수 있다는 의미다. 실제 도구 실행, 결과 검증, 권한 통제와 보안은 모델이 아니라 이를 연결한 호스트 애플리케이션이 맡아야 한다. 2
이 모델의 기술적 차별점으로 소개된 것은 **Entropy-Gated Adaptive Recurrent Reasoning(엔트로피 게이트 적응형 순환 추론)**이다. 모든 토큰에 동일하게 추가 추론 연산을 적용하는 대신, 예측의 불확실성을 기준으로 더 어려운 토큰에만 잠재 공간의 반복 정제 단계를 배분하는 방식이다. 2
쉽게 말해 비교적 분명한 다음 단계는 바로 진행하고, 모델이 확신하기 어려운 단계는 내부적으로 한 번 더 다듬어 볼 수 있게 하는 접근이다. 전체 응답에 일률적으로 비용을 더하기보다, 공간 관계나 카메라 시점 변화처럼 정답을 좌우할 수 있는 모호한 지점에 계산 깊이를 집중하려는 설계다. 2
다음 수치는 TaichuAI가 모델 자료에서 제시한 개발사 보고 성적이다.
| 평가 영역 | 벤치마크 | 보고 점수 |
|---|---|---|
| 공간·임바디드 | ViewSpatial | 62.50 |
| 공간·임바디드 | MMSI-Bench | 47.20 |
| 공간·임바디드 | MindCube-tiny | 78.27 |
| 공간·임바디드 | ERQA | 48.00 |
| 공간·임바디드 | RoboSpatial | 56.00 |
| 에이전트·지시 이행 | TAU2-Bench | 87.70 |
| 에이전트·지시 이행 | Claw-Eval | 71.40 |
| 에이전트·지시 이행 | IFEval | 93.70 |
프로젝트 측은 비교 대상에 포함한 약 100억 파라미터급 범용 VLM 가운데 공간·임바디드 추론에서 선도적 성능을 보인다고 설명한다. 2
다만 이 수치를 보편적인 순위로 해석해서는 안 된다. 비교 결과는 개발사가 선정한 모델 버전, 프롬프트, 전처리, 디코딩 설정, 평가 절차에 영향을 받는다. 실제 도입이나 성능 비교를 위해서는 해당 조건을 공개한 독립 재현 평가가 필요하다. 2
모델은 TaichuAI의 Hugging Face 저장소에서 제공된다. 모델 자료에서는 커스텀 코드 기반 모델임을 밝히고, 순환 추론 및 배포 관련 프로젝트 자료도 연결한다. 2
공개 자료에 명시된 라이선스는 배포 모델 자료에 대한 NVIDIA Open Model License이며, Qwen3.5 구성 요소에는 Apache-2.0 고지가 포함돼 있다. 상업적 활용이나 재배포를 검토한다면, 실제 적용 시점의 저장소 라이선스 파일과 고지 내용을 직접 확인하는 편이 안전하다. 2
서빙 측면에서는 커스텀 vLLM 0.26.0 및 Docker 경로가 문서화돼 있으며, 공간 그라운딩 작업과 일반 작업에 맞춘 서로 다른 샘플링 프리셋도 제공한다고 안내한다. 2
ZDTaichu5.0-9B는 이미지 속 내용을 알아보는 수준에서 한발 더 나아가, 서로 다른 시점·장면·영상에 걸친 공간적 관계를 추론하는 데 초점을 둔 약 9B급 오픈 멀티모달 모델이다. 128K 컨텍스트, 임의 해상도 시각 입력, 불확실한 추론 단계에 계산을 집중하는 순환 정제 구조는 공간 VLM, 임바디드 AI, 호스트 관리형 에이전트 워크플로를 연구하거나 개발하는 팀에 눈여겨볼 만한 요소다. 2
공개 성적은 특히 공간 벤치마크에서 유망한 신호이지만, 현시점에서는 어디까지나 개발사 보고 결과다. 투명한 조건 아래 제3자가 시험을 재현하기 전까지는 독립적으로 확립된 비교 우위로 단정하기보다, 실제 데이터와 과제에 맞춰 검증할 후보 모델로 보는 것이 적절하다. 2
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
ZDTaichu5.0 9B는 약 90억 파라미터 규모의 Qwen3.5 9B 언어 디코더와 C RADIOv4 H 비전 인코더를 결합한 TaichuAI의 오픈 멀티모달 모델이다.
ZDTaichu5.0 9B는 약 90억 파라미터 규모의 Qwen3.5 9B 언어 디코더와 C RADIOv4 H 비전 인코더를 결합한 TaichuAI의 오픈 멀티모달 모델이다. 텍스트·단일/복수 이미지·영상을 입력받고, 임의 해상도 시각 입력과 최대 128K 토큰 컨텍스트를 지원한다고 소개된다.
핵심 설계인 ‘엔트로피 게이트 적응형 순환 추론’은 불확실성이 큰 토큰에만 내부 정제를 추가해 어려운 공간 추론에 계산을 집중하는 방식이다.