ZDTaichu5.0 9B er TaichuAIs åpne syns og språkmodell, med en språkdekoder basert på Qwen3.5 9B og synsencodereren C RADIOv4 H. Modellen støtter tekst, ett eller flere bilder og video, visuelle inndata i valgfri oppløsning og en kontekstlengde på opptil 128K token.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B er en åpen multimodal grunnmodell fra TaichuAI for visuell forståelse, romlig resonnering, agentbasert verktøybruk og forskning på embodied AI – altså AI som skal oppfatte og handle i den fysiske verden. Det sentrale er ikke bare å kunne beskrive et bilde, men å kunne vurdere perspektivskifter, forholdet mellom objekter, informasjon fra flere bilder og innhold i lange videoopptak. 2
Modellen kombinerer en språkdekoder på rundt 9 milliarder parametere, Qwen3.5-9B, med synsencodereren C-RADIOv4-H. Den kan ta imot tekst, ett eller flere bilder og video. Ifølge modellkortet støtter den visuelle inndata i valgfri oppløsning og en kontekstlengde på opptil 128K token. 2
Dette gjør den relevant for oppgaver som dokumenttolking, diagrammer, grafer, OCR – tekstgjenkjenning i bilder – visuell spørsmålsbesvarelse og visuell matematikk, i tillegg til bredere sceneforståelse. 2
TaichuAI fremhever oppgaver som ofte er vanskelige for generelle syns- og språkmodeller. Den oppgitte funksjonaliteten omfatter:
Modellen støtter også agentorienterte samspill. Det betyr imidlertid ikke at den selv utfører handlinger autonomt: Den kan planlegge verktøykall og inngå i arbeidsflyter med flere trinn eller samtaler, mens applikasjonen rundt modellen må kjøre, validere og sikre verktøyene. 2
Det viktigste tekniske grepet kalles Entropy-Gated Adaptive Recurrent Reasoning. I stedet for å bruke samme ekstra resonneringsberegning på hvert token, bruker systemet usikkerhet til å avgjøre hvor det er behov for ytterligere raffinering i det latente rommet. 2
Enkelt forklart: Når et steg virker rett fram, kan modellen gå videre som normalt. Er den usikker på neste prediksjon, kan den gjøre flere interne raffineringssteg før den fortsetter. Målet er mer effektiv regnedybde i vanskelige deler av resonneringen, uten å øke beregningsarbeidet like mye gjennom hele svaret. 2
Det kan være særlig relevant i romlige oppgaver, der én tvetydig relasjon – for eksempel etter at kameraets vinkel er endret – kan avgjøre om svaret blir riktig.
TaichuAI oppgir følgende testresultater i modellmaterialet:
| Område | Benchmark | Oppgitt resultat |
|---|---|---|
| Romlig / embodied | ViewSpatial | 62,50 |
| Romlig / embodied | MMSI-Bench | 47,20 |
| Romlig / embodied | MindCube-tiny | 78,27 |
| Romlig / embodied | ERQA | 48,00 |
| Romlig / embodied | RoboSpatial | 56,00 |
| Agent / instruksjonsfølging | TAU2-Bench | 87,70 |
| Agent / instruksjonsfølging | Claw-Eval | 71,40 |
| Agent / instruksjonsfølging | IFEval | 93,70 |
Prosjektet posisjonerer modellen som ledende på romlig og embodied resonnering blant de generelle syns- og språkmodellene i sammenligningen på omtrent 10B-skala, samtidig som den skal ha sterke generelle visuelle evner. 2
Dette er et nyttig signal for utviklere og forskere som ser etter en relativt kompakt åpen modell til romlig krevende oppgaver. Det er likevel ikke en universell rangering. Sammenligningene avhenger av leverandørens valg av modellversjoner, instrukser, forbehandling, dekodingsinnstillinger og testoppsett. Uavhengig reproduksjon med åpne detaljer er nødvendig før resultatene kan behandles som fastslått sammenlignende ytelse. 2
ZDTaichu5.0-9B er tilgjengelig i TaichuAIs repository på Hugging Face. Utgivelsen er merket som basert på tilpasset kode og lenker til prosjektmateriale for rekurrent resonnering og utrulling. 2
Den oppgitte lisensordningen er NVIDIA Open Model License for de utgitte modellmaterialene, mens Qwen3.5-komponentene har Apache-2.0-merknader. Virksomheter som vurderer videredistribusjon eller kommersiell bruk, bør lese de gjeldende lisensfilene og merknadene direkte i repositoryet. 2
For drift dokumenterer TaichuAI egne løp for vLLM 0.26.0 og Docker, inkludert ulike samplingsoppsett for romlig forankring og generelle oppgaver. 2
ZDTaichu5.0-9B er en åpen multimodal modell på rundt 9B parametere med en tydelig spesialisering: å resonnere på tvers av bilder, perspektiver, scener og video – ikke bare å gjenkjenne visuelt innhold. Kontekstvinduet på 128K token, støtte for visuelle inndata i valgfri oppløsning og adaptiv rekurrent resonnering gjør den interessant for arbeid med romlige syns- og språkmodeller, embodied AI og agentarbeidsflyter der vertssystemet styrer verktøyene. 2
De publiserte resultatene virker lovende, særlig på romlige benchmark-tester. Men de er rapportert av leverandøren selv og bør ikke tolkes som uavhengig bekreftet ytelse før tredjepart har reprodusert testene med transparente betingelser. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B er TaichuAIs åpne syns og språkmodell, med en språkdekoder basert på Qwen3.5 9B og synsencodereren C RADIOv4 H.
ZDTaichu5.0 9B er TaichuAIs åpne syns og språkmodell, med en språkdekoder basert på Qwen3.5 9B og synsencodereren C RADIOv4 H. Modellen støtter tekst, ett eller flere bilder og video, visuelle inndata i valgfri oppløsning og en kontekstlengde på opptil 128K token.
Den såkalte Entropy Gated Adaptive Recurrent Reasoning metoden skal bruke ekstra intern beregning på usikre og krevende token, fremfor å bruke like mye på alle.