ZDTaichu5.0 9B es el modelo visión lenguaje abierto de TaichuAI: combina un decodificador de lenguaje Qwen3.5 9B de unos 9.000 millones de parámetros con el codificador visual C RADIOv4 H. Admite texto, una o varias imágenes y vídeo a cualquier resolución, con una ventana de contexto de hasta 128.000 tokens; está or...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B es un modelo fundacional multimodal abierto de TaichuAI orientado a comprensión visual, razonamiento espacial, uso de herramientas por agentes e investigación en IA incorporada —es decir, sistemas que perciben y actúan en entornos físicos—. Su propuesta no se limita a describir una imagen: busca razonar sobre cambios de punto de vista, relaciones entre objetos, evidencias repartidas entre varias imágenes y secuencias de vídeo extensas. 2
El modelo combina un decodificador de lenguaje Qwen3.5-9B, de aproximadamente 9.000 millones de parámetros, con un codificador visual C-RADIOv4-H. Puede recibir texto, una o varias imágenes y vídeo; el lanzamiento indica compatibilidad con entradas visuales de cualquier resolución y una ventana de contexto de hasta 128.000 tokens. 2
Ese alcance va más allá del subtitulado convencional de imágenes. La ficha del modelo lo sitúa en tareas con documentos, gráficos, diagramas, OCR —reconocimiento óptico de caracteres—, preguntas sobre imágenes y matemáticas visuales, además de la interpretación general de escenas. 2
TaichuAI pone el acento en tareas espaciales e incorporadas que suelen ser complejas para los modelos visión-lenguaje de propósito general. Entre las capacidades declaradas se encuentran:
También admite interacciones orientadas a agentes. Conviene matizar qué significa esto: el modelo puede planificar llamadas a herramientas y participar en flujos de varios pasos o turnos, pero la aplicación que lo aloja sigue siendo responsable de ejecutar, validar y proteger esas herramientas. No las ejecuta de forma autónoma. 2
La principal apuesta técnica de ZDTaichu5.0-9B se denomina Entropy-Gated Adaptive Recurrent Reasoning, o razonamiento recurrente adaptativo guiado por entropía. En vez de dedicar el mismo cálculo adicional a cada token, el sistema emplea la incertidumbre para decidir en qué puntos merece la pena aplicar refinamiento extra en el espacio latente. 2
Dicho de forma simple: los pasos previsibles avanzan con normalidad, mientras que las predicciones difíciles o ambiguas pueden recibir más elaboración interna. El objetivo es aumentar la profundidad efectiva de cálculo en los momentos de razonamiento complejos sin elevar uniformemente el coste de toda la respuesta. 2
La idea resulta especialmente pertinente en preguntas espaciales: una única relación incierta —por ejemplo, tras un cambio de cámara o al decidir la posición relativa de dos objetos— puede determinar si la respuesta final es correcta.
TaichuAI publica los siguientes resultados en los materiales del modelo:
| Área de evaluación | Benchmark | Puntuación publicada |
|---|---|---|
| Espacial / incorporada | ViewSpatial | 62,50 |
| Espacial / incorporada | MMSI-Bench | 47,20 |
| Espacial / incorporada | MindCube-tiny | 78,27 |
| Espacial / incorporada | ERQA | 48,00 |
| Espacial / incorporada | RoboSpatial | 56,00 |
| Agentes / seguimiento de instrucciones | TAU2-Bench | 87,70 |
| Agentes / seguimiento de instrucciones | Claw-Eval | 71,40 |
| Agentes / seguimiento de instrucciones | IFEval | 93,70 |
El proyecto presenta al modelo como líder en razonamiento espacial e incorporado dentro de las comparativas que incluye de modelos visión-lenguaje generales de alrededor de 10.000 millones de parámetros, manteniendo a la vez capacidades visuales generales sólidas. 2
Es una señal útil para investigadores y desarrolladores que busquen un modelo abierto y relativamente compacto para cargas de trabajo espaciales. Pero no equivale a una clasificación universal: las comparativas publicadas dependen de las versiones de modelos, prompts, preprocesamiento, ajustes de decodificación y configuración de evaluación elegidos por el proveedor. Harían falta reproducciones independientes con esos detalles transparentes para considerar los resultados como rendimiento comparativo establecido. 2
ZDTaichu5.0-9B está disponible en el repositorio de TaichuAI en Hugging Face. El lanzamiento lo identifica como un modelo basado en código personalizado y enlaza materiales del proyecto para el razonamiento recurrente y el despliegue. 2
La licencia indicada para los materiales publicados del modelo es la NVIDIA Open Model License, con avisos bajo Apache-2.0 para componentes de Qwen3.5. Los equipos que contemplen redistribuirlo o usarlo comercialmente deberían revisar directamente los archivos de licencia y avisos vigentes del repositorio. 2
Para servir el modelo, TaichuAI documenta rutas personalizadas con vLLM 0.26.0 y Docker, incluidos distintos ajustes de muestreo para tareas de anclaje espacial y para tareas generales. 2
ZDTaichu5.0-9B es un modelo multimodal abierto de aproximadamente 9.000 millones de parámetros con una especialización definida: razonar entre imágenes, perspectivas, escenas y vídeo, en lugar de limitarse a reconocer contenido visual. Su contexto de 128.000 tokens, la admisión de imágenes a cualquier resolución y su enfoque de razonamiento recurrente adaptativo lo convierten en una opción llamativa para explorar modelos visión-lenguaje espaciales, IA incorporada y flujos de agentes gestionados por la aplicación anfitriona. 2
Sus resultados publicados son prometedores, especialmente en benchmarks espaciales, pero deben interpretarse como datos comunicados por el proveedor, no como rendimiento confirmado de forma independiente, hasta que terceros repliquen las pruebas bajo condiciones transparentes. 2
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
ZDTaichu5.0 9B es el modelo visión lenguaje abierto de TaichuAI: combina un decodificador de lenguaje Qwen3.5 9B de unos 9.000 millones de parámetros con el codificador visual C RADIOv4 H.
ZDTaichu5.0 9B es el modelo visión lenguaje abierto de TaichuAI: combina un decodificador de lenguaje Qwen3.5 9B de unos 9.000 millones de parámetros con el codificador visual C RADIOv4 H. Admite texto, una o varias imágenes y vídeo a cualquier resolución, con una ventana de contexto de hasta 128.000 tokens; está orientado a razonamiento espacial, análisis visual, OCR y flujos de trabajo con agentes.
Su mecanismo de razonamiento recurrente adaptativo guiado por entropía concentra refinamiento interno adicional en los tokens más inciertos, en vez de aplicar el mismo coste extra a toda la respuesta.