ZDTaichu5.0 9B är en öppet tillgänglig bild och språkmodell med omkring 9 miljarder parametrar, avsedd bland annat för forskning om rumslig förståelse och AI i fysiska miljöer. Modellen tar emot text, en eller flera bilder och video.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
För den som utvecklar en AI-agent som ska tolka en fysisk miljö är det inte nog att känna igen föremål. Agenten behöver också kunna resonera om var föremålen finns i förhållande till varandra, även när kamerans perspektiv ändras. ZDTaichu5.0-9B är en nedladdningsbar bild- och språkmodell som TaichuAI presenterar för bland annat sådana experiment, liksom för forskning om AI-agenter som använder verktyg. Ett korrekt svar om en bild är däremot inte ett bevis för att modellen kan styra en robot säkert. 2
20
ZDTaichu5.0-9B kombinerar språkmodellen Qwen3.5-9B med bildkodaren C-RADIOv4-H. Den tar emot text, enstaka eller flera bilder samt video. TaichuAI anger stöd för visuella indata med valfri upplösning och en kontextlängd på upp till 128 000 token. Det ger möjligheter att undersöka frågor som kräver flera vyer av en scen, men specifikationerna visar inte i sig hur väl modellen fungerar vid varje upplösning eller kontextlängd. 2
TaichuAI kallar sin metod för entropistyrt adaptivt återkommande resonemang. Enligt företaget kan modellen lägga extra interna bearbetningssteg på token som är svårare att förutsäga, i stället för att använda lika mycket beräkning överallt. Tanken är att ge mer utrymme åt krävande resonemang när det behövs. 20
I TaichuAI:s jämförelser med generella bild- och språkmodeller av liknande storlek får ZDTaichu5.0-9B 62,50 i ViewSpatial, 78,27 i MindCube-tiny, 47,20 i MMSI-Bench, 48,00 i ERQA och 56,00 i RoboSpatial. TaichuAI beskriver den rumsliga förmågan som ledande bland de jämförda modellerna. Det är rapporterade testresultat, inte resultat som oberoende har reproducerats här. Hur modellen fungerar med egna kameravyer, agentverktyg och fysiska miljöer måste därför testas separat. 1
20
TaichuAI publicerar huvudmodellen på Hugging Face tillsammans med varianterna FP8 och NVFP4. Där finns även DSpark, en kompletterande modell för spekulativ avkodning med ZDTaichu5.0-9B i vLLM. För serverdrift beskriver TaichuAI både en modellanpassad Docker-avbild och en modifierad gren av vLLM; utgå inte från att en oförändrad installation fungerar på samma sätt. 2
4
5
3
17
Kontrollera också licensvillkoren för originalmodellen och dess komponenter före återanvändning. En GGUF-konvertering från en tredje part är märkt Apache-2.0, medan en annan modellförteckning beskriver ett annat licensupplägg. Konverteringens märkning avgör inte villkoren för originalet. 8
6
Slutligen visar TaichuAI:s exempelkommando för vLLM inställningen --max-model-len 220000, trots att modellspecifikationen anger upp till 128 000 token. Ett inställningsvärde är inte belägg för att en effektiv kontext på 220 000 token har validerats. 17
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B är en öppet tillgänglig bild och språkmodell med omkring 9 miljarder parametrar, avsedd bland annat för forskning om rumslig förståelse och AI i fysiska miljöer.
ZDTaichu5.0 9B är en öppet tillgänglig bild och språkmodell med omkring 9 miljarder parametrar, avsedd bland annat för forskning om rumslig förståelse och AI i fysiska miljöer. Modellen tar emot text, en eller flera bilder och video. TaichuAI anger en kontextlängd på upp till 128 000 token.
Resultaten i rumsliga tester kommer från TaichuAI:s egna jämförelser och behöver prövas i forskarens faktiska miljö.