Den downloadbare model er rettet mod rumlig forståelse og forskning i AI, der skal kunne indgå i fysiske omgivelser – ikke mod dokumenteret sikker robotstyring. Den tager imod tekst, et eller flere billeder og video og har ifølge specifikationen en kontekst på op til 128.000 tokens.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ZDTaichu5.0-9B giver forskere en model, de kan downloade og afprøve på spørgsmål om visuelle scener: Hvor er en genstand i forhold til en anden, og hvordan ændrer forholdet sig, når synsvinklen skifter? Den er også tænkt til eksperimenter med AI-agenter, der bruger værktøjer. Det gør den relevant for forskning i embodied AI – AI, der skal forstå og potentielt indgå i fysiske omgivelser. Et korrekt svar om et billede er dog ikke bevis for, at modellen kan handle sikkert i den virkelige verden. 2
20
Modellen kombinerer sprogmodellen Qwen3.5-9B med billedkoderen C-RADIOv4-H. Ifølge TaichuAI kan den modtage tekst, ét billede, flere billeder eller video. Producenten angiver visuelle input i vilkårlig opløsning og en kontekstlængde på op til 128.000 tokens. Det giver mulighed for at undersøge opgaver med flere visninger af samme scene, men specifikationerne dokumenterer ikke i sig selv ydelsen ved enhver opløsning eller kontekstlængde. 2
TaichuAI beskriver desuden en metode kaldet entropy-gated adaptive recurrent reasoning. Tanken er, at modellen kan bruge ekstra interne bearbejdningstrin på de tokens, der er sværere at behandle, i stedet for at bruge samme mængde beregning overalt. For rumlige opgaver er det interessant, når modellen eksempelvis skal holde styr på en genstands placering på tværs af synsvinkler. Det er en tilgang, forskere kan teste – ikke en garanti for, at den løser opgaven i et robotsystem. 20
2
I TaichuAI’s sammenligninger med generelle syns- og sprogmodeller i omtrent samme størrelse får ZDTaichu5.0-9B 62,50 på ViewSpatial, 78,27 på MindCube-tiny, 47,20 på MMSI-Bench, 48,00 på ERQA og 56,00 på RoboSpatial. TaichuAI beskriver den rumlige ydelse som førende blandt de sammenlignede modeller. Tallene er imidlertid producentens rapporterede resultater, ikke uafhængigt reproducerede målinger her. Forskere må selv teste modellen på deres scener, agentopsætning og eventuelle fysiske miljøer. 1
20
Hovedmodellen ligger på Hugging Face sammen med FP8- og NVFP4-varianter. TaichuAI tilbyder også DSpark, en hjælpermodel til spekulativ dekodning sammen med ZDTaichu5.0-9B i vLLM, som bruges til at køre modeller som en tjeneste. Til den opsætning dokumenterer TaichuAI både et modelspecifikt Docker-image og en tilpasset vLLM-gren; man bør derfor ikke gå ud fra, at en standardinstallation fungerer på samme måde. 2
4
5
3
17
Kontrollér licensen før genbrug. En GGUF-konvertering fra en tredjepart er mærket Apache-2.0, mens en anden modeloversigt beskriver andre licensvilkår. Mærkningen af en konvertering afgør ikke i sig selv vilkårene for den oprindelige model eller dens komponenter. 8
6
Vær også opmærksom på forskellen mellem specifikation og serverindstilling: TaichuAI’s eksempelkommando bruger --max-model-len 220000, mens modelbeskrivelsen angiver op til 128.000 tokens. Indstillingen er ikke dokumentation for en efterprøvet, effektiv kontekst på 220.000 tokens. 17
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Den downloadbare model er rettet mod rumlig forståelse og forskning i AI, der skal kunne indgå i fysiske omgivelser – ikke mod dokumenteret sikker robotstyring.
Den downloadbare model er rettet mod rumlig forståelse og forskning i AI, der skal kunne indgå i fysiske omgivelser – ikke mod dokumenteret sikker robotstyring. Den tager imod tekst, et eller flere billeder og video og har ifølge specifikationen en kontekst på op til 128.000 tokens.
Testresultaterne er rapporteret af TaichuAI. Undersøg både ydelse, licensvilkår og opsætning, før modellen bruges i egne projekter.