ZDTaichu5.0 9B est un modèle ouvert de vision et de langage d’environ 9 milliards de paramètres, conçu notamment pour étudier les relations spatiales et les agents utilisant des outils. Il accepte du texte, une ou plusieurs images et de la vidéo ; TaichuAI annonce une fenêtre de contexte allant jusqu’à 128 000 tokens.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pour un chercheur en IA incarnée — l’étude d’agents qui perçoivent un environnement physique et peuvent y interagir — l’intérêt de ZDTaichu5.0-9B tient à une question concrète : un modèle peut-il suivre la position d’un objet quand le point de vue change et exploiter cette compréhension dans une tâche ? TaichuAI met à disposition un modèle de vision et de langage téléchargeable pour explorer ce type de problème, ainsi que des usages d’agents recourant à des outils. Décrire correctement une scène ne prouve toutefois pas qu’un système puisse y agir de façon fiable ou sûre. 2
20
ZDTaichu5.0-9B associe un décodeur linguistique Qwen3.5-9B à un encodeur visuel C-RADIOv4-H. Sa fiche indique la prise en charge du texte, d’une image, de plusieurs images et de la vidéo, avec des entrées visuelles dites « à toute résolution ». La fenêtre de contexte annoncée atteint 128 000 tokens. Cela ouvre la voie à des expériences mobilisant plusieurs vues d’une même scène, sans garantir à lui seul des résultats identiques à toutes les résolutions ni sur toute la longueur du contexte. 2
TaichuAI présente une méthode de raisonnement récurrent adaptatif piloté par l’entropie. Selon l’entreprise, elle alloue des étapes supplémentaires de raffinement interne aux tokens les plus difficiles, au lieu de leur consacrer à tous le même calcul. L’objectif est d’approfondir le raisonnement lorsque la tâche l’exige. 20
Cette approche correspond à l’usage visé : reconnaître des relations entre objets, tenir compte d’un changement de perspective, puis alimenter éventuellement un agent utilisant des outils. Ce sont des capacités à mettre à l’épreuve dans un protocole de recherche, et non la validation d’un système robotique de bout en bout. 2
20
Dans les comparaisons publiées par TaichuAI avec des modèles généralistes de vision et de langage de taille comparable, ZDTaichu5.0-9B obtient 62,50 sur ViewSpatial, 78,27 sur MindCube-tiny, 47,20 sur MMSI-Bench, 48,00 sur ERQA et 56,00 sur RoboSpatial. TaichuAI revendique une position de tête en raisonnement spatial parmi les modèles comparés. Ces chiffres sont rapportés par l’éditeur, sans reproduction indépendante établie ici : ils ne préjugent pas des résultats sur les scènes, les agents ou les environnements physiques d’un laboratoire. 1
20
Le modèle principal est publié sur Hugging Face, avec des variantes FP8 et NVFP4. TaichuAI fournit aussi DSpark, un modèle auxiliaire destiné au décodage spéculatif avec ZDTaichu5.0-9B dans vLLM, un outil de mise en service de modèles. Pour le déploiement, l’équipe documente une image Docker propre au modèle et une branche modifiée de vLLM : mieux vaut partir de ces instructions que supposer qu’une installation standard se comportera de la même manière. 2
4
5
3
17
Deux vérifications s’imposent avant réutilisation. La licence, d’abord : une conversion GGUF réalisée par un tiers porte la mention Apache-2.0, tandis qu’une autre fiche décrit un régime de licence différent. La mention apposée sur cette conversion ne suffit donc pas à établir les conditions applicables au modèle d’origine et à ses composants. 8
6 La longueur du contexte, ensuite : un exemple de commande vLLM de TaichuAI utilise
--max-model-len 220000, alors que la fiche du modèle annonce jusqu’à 128 000 tokens. Ce paramètre serveur ne démontre pas qu’un contexte effectif de 220 000 tokens a été validé. 17
2
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
ZDTaichu5.0 9B est un modèle ouvert de vision et de langage d’environ 9 milliards de paramètres, conçu notamment pour étudier les relations spatiales et les agents utilisant des outils.
ZDTaichu5.0 9B est un modèle ouvert de vision et de langage d’environ 9 milliards de paramètres, conçu notamment pour étudier les relations spatiales et les agents utilisant des outils. Il accepte du texte, une ou plusieurs images et de la vidéo ; TaichuAI annonce une fenêtre de contexte allant jusqu’à 128 000 tokens.
Ses scores spatiaux sont publiés par TaichuAI et doivent être vérifiés dans les conditions propres à chaque projet.