ZDTaichu5.0 9B er en nedlastbar syns og språkmodell med om lag 9 milliarder parametere, rettet mot romforståelse og forskning på KI som samhandler med fysiske omgivelser. Modellen tar imot tekst, ett eller flere bilder og video.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
En robot som ser et objekt fra en ny vinkel, må fortsatt kunne forstå hvor objektet er. Det er slike spørsmål ZDTaichu5.0-9B er laget for å utforske. TaichuAI har gjort syns- og språkmodellen nedlastbar for forskning på visuell forståelse, romlige forhold og KI-agenter som bruker verktøy. At modellen kan beskrive en scene, viser likevel ikke at den kan handle trygt i den. 2
20
ZDTaichu5.0-9B kombinerer språkdekoderen Qwen3.5-9B med bildekoderen C-RADIOv4-H. Ifølge TaichuAI kan den behandle tekst, ett eller flere bilder og video. Utvikleren oppgir støtte for visuelle inndata i valgfri oppløsning og en kontekstlengde på opptil 128 000 token. Det åpner for forsøk der modellen må bruke flere bilder av samme scene, men spesifikasjonene dokumenterer ikke ytelsen ved alle oppløsninger eller kontekstlengder. 2
TaichuAI kaller resonneringsmetoden entropistyrt adaptiv rekurrent resonnering. Selskapet beskriver den slik: Modellen kan bruke ekstra interne bearbeidingstrinn på token som er mer krevende, i stedet for å bruke like mye beregning overalt. Målet er større resonneringsdybde der det trengs. 20
For forskning på fysisk KI – systemer som skal forstå og eventuelt samhandle med omgivelsene – er det særlig relevant å undersøke om modellen holder rede på objekter når synsvinkelen endres, og om den tolker fysiske relasjoner godt nok til å inngå i en arbeidsflyt med verktøy. ZDTaichu5.0-9B er en kandidat for slike tester, ikke et ferdig validert robotsystem. 2
20
I TaichuAIs sammenligninger med generelle syns- og språkmodeller av lignende størrelse får ZDTaichu5.0-9B 62,50 på ViewSpatial, 78,27 på MindCube-tiny, 47,20 på MMSI-Bench, 48,00 på ERQA og 56,00 på RoboSpatial. TaichuAI omtaler den romlige ytelsen som ledende blant modellene selskapet sammenlignet. Dette er resultater rapportert av utvikleren, ikke uavhengig reproduserte funn her. Forskere må fortsatt teste modellen i egne scener, agentoppsett og eventuelle fysiske miljøer. 1
20
Hovedmodellen ligger på Hugging Face, sammen med TaichuAIs FP8- og NVFP4-varianter. Utvikleren tilbyr også DSpark, en hjelpemodell for spekulativ dekoding sammen med ZDTaichu5.0-9B i vLLM, programvare for å kjøre og betjene språkmodeller. For utrulling dokumenterer TaichuAI både et modelltilpasset vLLM-Docker-bilde og en endret vLLM-gren. Det er tryggere utgangspunkter enn å anta at en uendret installasjon vil fungere på samme måte. 2
4
5
3
17
Sjekk lisensen før gjenbruk. En tredjeparts GGUF-konvertering er merket Apache-2.0, mens en annen modelloversikt beskriver en annen lisensordning. Merkingen av konverteringen avklarer ikke alene vilkårene for originalmodellen eller alle komponentene. 8
6
Det er også verdt å skille mellom serverinnstillinger og dokumenterte modellegenskaper: TaichuAIs eksempelkommando setter --max-model-len 220000, mens modellspesifikasjonen oppgir opptil 128 000 token. Innstillingen er ikke i seg selv bevis for en validert, effektiv kontekst på 220 000 token. 17
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B er en nedlastbar syns og språkmodell med om lag 9 milliarder parametere, rettet mot romforståelse og forskning på KI som samhandler med fysiske omgivelser.
ZDTaichu5.0 9B er en nedlastbar syns og språkmodell med om lag 9 milliarder parametere, rettet mot romforståelse og forskning på KI som samhandler med fysiske omgivelser. Modellen tar imot tekst, ett eller flere bilder og video. TaichuAI oppgir en kontekst på opptil 128 000 token og tilbyr FP8 og NVFP4 varianter.
De oppgitte testresultatene kommer fra TaichuAI og må etterprøves i forskerens egne oppgaver, særlig før modellen brukes som del av et robotsystem.