ZDTaichu5.0 9B er TaichuAI’s åbne vision sprog model, der kombinerer en Qwen3.5 9B sprogdekoder med en C RADIOv4 H visionsencoder. Modellen er målrettet rumlig og tredimensionel ræsonnering, analyse på tværs af synsvinkler, video, OCR og embodied AI – ikke kun almindelig billedbeskrivelse.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B er TaichuAI’s åbne multimodale grundmodel til visuel forståelse, rumlig ræsonnering, værktøjsbrug i agent-workflows og forskning i embodied AI. Det interessante er ikke blot, at den kan tolke billeder. Den er specifikt udviklet til opgaver, hvor systemet skal håndtere skiftende synsvinkler, objekters indbyrdes placering, information fra flere billeder og video over lange sammenhænge. 2
Modellen kombinerer en sprogdekoder på cirka 9 mia. parametre, Qwen3.5-9B, med visionsencoderen C-RADIOv4-H. Den kan tage imod tekst, et eller flere billeder samt video. Ifølge udgivelsen understøttes visuelle input i vilkårlig opløsning og et kontekstvindue på op til 128K tokens. 2
Det gør den relevant til mere end billedtekster. Modelkortet fremhæver dokumenter, diagrammer, grafer, OCR – tekstgenkendelse i billeder – visuel spørgebesvarelse og visuel matematik, men også mere bred fortolkning af scener. 2
TaichuAI lægger især vægt på rumlige og kropsligt forankrede opgaver, som ofte er vanskelige for generelle vision-sprog-modeller. De angivne funktioner omfatter:
Modellen understøtter også agentorienterede interaktioner. Det er dog ikke det samme som selvstændig udførelse: Den kan planlægge værktøjskald og indgå i flertrins- eller flerturnsforløb, men det er fortsat værtsapplikationen, der skal køre, validere og sikre værktøjerne. 2
ZDTaichu5.0-9B’s centrale tekniske påstand kaldes Entropy-Gated Adaptive Recurrent Reasoning. I stedet for at bruge den samme ekstra ræsonneringsberegning på hvert token, bruger systemet usikkerhed til at afgøre, hvor yderligere forfining i det latente rum er nødvendig. 2
Kort sagt kan ukomplicerede trin fortsætte som normalt, mens svære eller usikre forudsigelser får ekstra intern bearbejdning. Formålet er at skabe større effektiv beregningsdybde på de vanskelige ræsonneringstrin uden at øge arbejdet ensartet for hele svaret. 2
Det er særligt relevant ved rumlige spørgsmål, hvor én uklar relation – eksempelvis et ændret kamerastandpunkt eller et objekts placering i forhold til et andet – kan afgøre, om svaret bliver rigtigt.
TaichuAI oplyser følgende resultater i sit materiale:
| Evalueringsområde | Benchmark | Oplyst score |
|---|---|---|
| Rumlighed / embodied AI | ViewSpatial | 62,50 |
| Rumlighed / embodied AI | MMSI-Bench | 47,20 |
| Rumlighed / embodied AI | MindCube-tiny | 78,27 |
| Rumlighed / embodied AI | ERQA | 48,00 |
| Rumlighed / embodied AI | RoboSpatial | 56,00 |
| Agent / instruktionsfølgning | TAU2-Bench | 87,70 |
| Agent / instruktionsfølgning | Claw-Eval | 71,40 |
| Agent / instruktionsfølgning | IFEval | 93,70 |
Projektet placerer selv modellen som førende inden for rumlig og embodied ræsonnering blandt de generelle VLM’er – vision-sprog-modeller – omkring 10 mia. parametre, der indgår i sammenligningerne, samtidig med at den skal bevare stærke generelle visuelle egenskaber. 2
Det er et nyttigt signal for udviklere og forskere, der leder efter en kompakt, åben model til opgaver med høje krav til rumlig forståelse. Det er imidlertid ikke en universel rangliste. Sammenligningerne afhænger af leverandørens valg af modelversioner, prompts, forbehandling, afkodningsindstillinger og evalueringsopsætning. Der er behov for uafhængig reproduktion med disse detaljer offentliggjort, før tallene kan betragtes som endeligt fastslået sammenlignende performance. 2
ZDTaichu5.0-9B kan hentes via TaichuAI’s repository på Hugging Face. Udgivelsen beskriver modellen som baseret på brugerdefineret kode og linker til projektmateriale om recurrent reasoning og deployment. 2
Den angivne licensordning er NVIDIA Open Model License for de frigivne modelmaterialer samt Apache-2.0-noticer for Qwen3.5-komponenterne. Organisationer, der overvejer videredistribution eller kommerciel brug, bør gennemgå de aktuelle licensfiler og meddelelser direkte i repositoriet. 2
Til serverdrift dokumenterer TaichuAI egne forløb med vLLM 0.26.0 og Docker, herunder forskellige sampling-forvalg til henholdsvis rumlig grounding og generelle opgaver. 2
ZDTaichu5.0-9B er en åben multimodal model i cirka 9 mia.-klassen med en tydelig specialisering: Den skal kunne ræsonnere på tværs af billeder, synsvinkler, scener og video – ikke blot genkende visuelt indhold. Kontekstvinduet på 128K tokens, visuelle input i vilkårlig opløsning og den adaptive tilbagevendende ræsonnering gør den til et bemærkelsesværdigt bud for forskere og udviklere, der arbejder med rumlige VLM’er, embodied AI og agent-workflows, hvor værtsapplikationen styrer værktøjerne. 2
De offentliggjorte resultater virker lovende, især på rumlige benchmarks, men de bør læses som leverandørens egne data – ikke som uafhængigt fastslået performance – indtil tredjepart har gentaget testene under gennemsigtige betingelser. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B er TaichuAI’s åbne vision sprog model, der kombinerer en Qwen3.5 9B sprogdekoder med en C RADIOv4 H visionsencoder.
ZDTaichu5.0 9B er TaichuAI’s åbne vision sprog model, der kombinerer en Qwen3.5 9B sprogdekoder med en C RADIOv4 H visionsencoder. Modellen er målrettet rumlig og tredimensionel ræsonnering, analyse på tværs af synsvinkler, video, OCR og embodied AI – ikke kun almindelig billedbeskrivelse.
Den særlige ræsonneringsmekanisme bruger ekstra intern beregning ved usikre tokens, mens de offentliggjorte benchmark tal fortsat skal bekræftes af uafhængige tests.