ZDTaichu5.0 9B è un modello vision language open di TaichuAI che combina un decoder linguistico Qwen3.5 9B con un encoder visivo C RADIOv4 H. Accetta testo, immagini singole o multiple e video a qualsiasi risoluzione, con una finestra di contesto fino a 128K token.
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B è un modello fondazionale multimodale open di TaichuAI, progettato per la comprensione visiva generale, il ragionamento spaziale, l’uso di strumenti da parte di agenti e la ricerca sull’AI incarnata. Il punto non è soltanto descrivere ciò che appare in un’immagine: il progetto mira a gestire cambi di punto di vista, relazioni fra oggetti, informazioni distribuite su più immagini e analisi di video con contesti lunghi. 2
Il modello unisce un decoder linguistico Qwen3.5-9B, di circa 9 miliardi di parametri, a un encoder visivo C-RADIOv4-H. Può ricevere testo, una o più immagini e video; secondo la documentazione della release, supporta input visivi a qualsiasi risoluzione e una finestra di contesto fino a 128K token. 2
Questa ampiezza di input lo colloca oltre la semplice didascalia automatica delle immagini. La scheda del modello indica impieghi per documenti, grafici, diagrammi, OCR — cioè il riconoscimento del testo nelle immagini — visual question answering e matematica visiva, insieme all’interpretazione più generale delle scene. 2
TaichuAI evidenzia capacità spaziali e incarnate che risultano spesso complesse per i normali modelli vision-language. Tra quelle dichiarate figurano:
Il modello supporta anche interazioni orientate agli agenti. Non significa però che esegua autonomamente azioni nel mondo reale: può pianificare chiamate a strumenti e partecipare a flussi multi-step o multi-turno, mentre l’applicazione che lo ospita deve eseguire, verificare e mettere in sicurezza gli strumenti. 2
La principale proposta tecnica di ZDTaichu5.0-9B si chiama Entropy-Gated Adaptive Recurrent Reasoning. Invece di applicare lo stesso calcolo aggiuntivo a ogni token generato, il sistema usa il livello di incertezza per decidere quali passaggi meritino un ulteriore raffinamento nello spazio latente. 2
In termini semplici, i passaggi più lineari proseguono normalmente; quando invece una previsione è incerta o difficile, il modello può dedicarle ulteriore elaborazione interna. L’obiettivo è aumentare la profondità di calcolo effettiva nei punti impegnativi, senza far crescere in modo uniforme il lavoro richiesto dall’intera risposta. 2
L’idea è particolarmente rilevante per domande spaziali: una singola relazione ambigua — per esempio dopo un cambio di angolazione della telecamera, oppure nella posizione relativa di due oggetti — può rendere errata la conclusione finale.
Nei materiali del modello, TaichuAI riporta i seguenti risultati:
| Area di valutazione | Benchmark | Punteggio dichiarato |
|---|---|---|
| Spaziale / AI incarnata | ViewSpatial | 62,50 |
| Spaziale / AI incarnata | MMSI-Bench | 47,20 |
| Spaziale / AI incarnata | MindCube-tiny | 78,27 |
| Spaziale / AI incarnata | ERQA | 48,00 |
| Spaziale / AI incarnata | RoboSpatial | 56,00 |
| Agenti / rispetto delle istruzioni | TAU2-Bench | 87,70 |
| Agenti / rispetto delle istruzioni | Claw-Eval | 71,40 |
| Agenti / rispetto delle istruzioni | IFEval | 93,70 |
Il progetto presenta ZDTaichu5.0-9B come leader nel ragionamento spaziale e incarnato tra i modelli VLM generalisti di circa 10 miliardi di parametri inclusi nei suoi confronti, mantenendo al contempo solide capacità visive generali. 2
Per chi cerca un modello open relativamente compatto per carichi di lavoro spazialmente impegnativi, è un segnale interessante. Non equivale però a una classifica universale: i confronti dipendono da versioni dei modelli, prompt, pre-elaborazione, parametri di decodifica e impostazione di test scelti dal fornitore. Prima di considerare queste prestazioni definitivamente accertate servono riproduzioni indipendenti, con tali dettagli resi pubblici. 2
ZDTaichu5.0-9B è disponibile nel repository Hugging Face di TaichuAI. La release lo identifica come modello basato su codice personalizzato e rimanda a materiali del progetto relativi al ragionamento ricorrente e alla distribuzione. 2
Il regime di licenza indicato è la NVIDIA Open Model License per i materiali rilasciati, con avvisi Apache-2.0 per i componenti Qwen3.5. Chi prevede ridistribuzione o utilizzo commerciale dovrebbe verificare direttamente i file di licenza e gli avvisi aggiornati nel repository. 2
Per l’erogazione del modello, TaichuAI documenta percorsi basati su vLLM 0.26.0 personalizzato e Docker, compresi preset di campionamento differenti per attività di grounding spaziale e per compiti generali. 2
ZDTaichu5.0-9B è un modello multimodale open di circa 9 miliardi di parametri con una specializzazione precisa: ragionare attraverso immagini, punti di vista, scene e video, non soltanto riconoscere contenuti visivi. Il contesto da 128K token, l’input visivo a qualsiasi risoluzione e il ragionamento ricorrente adattivo lo rendono un’opzione da osservare per ricerca e sviluppo su VLM spaziali, AI incarnata e workflow di agenti controllati dall’applicazione ospitante. 2
I risultati pubblicati sono incoraggianti, soprattutto nei benchmark spaziali, ma vanno letti come evidenze riportate dal fornitore e non come prestazioni comparative già confermate da terze parti. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B è un modello vision language open di TaichuAI che combina un decoder linguistico Qwen3.5 9B con un encoder visivo C RADIOv4 H.
ZDTaichu5.0 9B è un modello vision language open di TaichuAI che combina un decoder linguistico Qwen3.5 9B con un encoder visivo C RADIOv4 H. Accetta testo, immagini singole o multiple e video a qualsiasi risoluzione, con una finestra di contesto fino a 128K token.
Il suo elemento distintivo è l’Entropy Gated Adaptive Recurrent Reasoning, che concentra il raffinamento interno sui token per i quali la previsione è più incerta.