ZDTaichu5.0 9B yhdistää noin 9 miljardin parametrin Qwen3.5 9B kielidekooderin ja C RADIOv4 H näköenkooderin. Malli tukee tekstiä, yksittäisiä ja useita kuvia sekä videota, minkä lisäksi sille ilmoitetaan 128 000 tokenin konteksti ikkuna ja minkä tahansa resoluution kuvatuki.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B on TaichuAI:n avoin multimodaalinen perusmalli. Se on suunnattu visuaaliseen ymmärtämiseen, tilalliseen päättelyyn, agenttien työkalukäyttöön ja ruumiillistuneen tekoälyn tutkimukseen. Mallin kiinnostavin piirre ei ole pelkkä kuvien tulkinta, vaan pyrkimys päätellä näkökulman muutoksia, esineiden keskinäisiä suhteita, usean kuvan muodostamaa kokonaisuutta ja videon tapahtumia pitkissä aineistoissa. 2
Mallissa on noin 9 miljardin parametrin Qwen3.5-9B-kielidekooderi sekä C-RADIOv4-H-näköenkooderi. Syötteenä se voi vastaanottaa tekstiä, yhden tai useamman kuvan sekä videota. Julkaisun mukaan visuaalisen syötteen resoluutiota ei ole rajattu ennalta, ja konteksti-ikkuna on enintään 128 000 tokenia. 2
Käyttökohteiksi luetellaan tavallista kuvatekstitystä laajemmat tehtävät: asiakirjojen, kaavioiden ja diagrammien tulkinta, tekstintunnistus (OCR), visuaalinen kysymys–vastaus, kuvallinen matematiikka sekä laajempi näkymien analyysi. 2
TaichuAI korostaa tehtäviä, jotka ovat monille yleiskäyttöisille kuva–kielimalleille hankalia. Niihin kuuluvat muun muassa:
Mallia voi käyttää myös agenttityyppisissä työnkuluissa. Tämä ei kuitenkaan tarkoita, että se suorittaisi toimintoja itsenäisesti: malli voi suunnitella työkalukutsuja ja osallistua monivaiheiseen keskusteluun, mutta sitä ympäröivä sovellus vastaa työkalujen suorittamisesta, validoinnista ja tietoturvasta. 2
ZDTaichu5.0-9B:n keskeinen tekninen väite on Entropy-Gated Adaptive Recurrent Reasoning, eli entropiaohjattu adaptiivinen toistuva päättely. Ideana on, ettei lisälaskentaa kohdisteta tasaisesti jokaiseen tuotettavaan tokeniin. Sen sijaan malli käyttää epävarmuutta mittaavana signaalina päättääkseen, missä kohdissa sisäistä, latentissa tilassa tehtävää tarkennusta tarvitaan lisää. 2
Käytännössä suoraviivaiset ennustusaskeleet voivat edetä normaalisti, kun taas epävarmat tai vaikeat vaiheet saavat ylimääräistä sisäistä jalostusta. Tavoitteena on kasvattaa laskennan tehokasta syvyyttä vaikeissa kohdissa ilman, että koko vastauksen tuottaminen muuttuisi tasaisesti raskaammaksi. 2
Tällainen lähestymistapa on erityisen olennainen tilallisissa kysymyksissä: yksi epäselvä suhde – esimerkiksi kamerakulman muutos tai kahden objektin suhteellinen sijainti – voi ratkaista, päätyykö malli oikeaan vastaukseen.
TaichuAI ilmoittaa mallikortissaan seuraavat tulokset:
| Arviointialue | Vertailutesti | Raportoitu tulos |
|---|---|---|
| Tilallinen / ruumiillistunut | ViewSpatial | 62,50 |
| Tilallinen / ruumiillistunut | MMSI-Bench | 47,20 |
| Tilallinen / ruumiillistunut | MindCube-tiny | 78,27 |
| Tilallinen / ruumiillistunut | ERQA | 48,00 |
| Tilallinen / ruumiillistunut | RoboSpatial | 56,00 |
| Agentti / ohjeiden noudattaminen | TAU2-Bench | 87,70 |
| Agentti / ohjeiden noudattaminen | Claw-Eval | 71,40 |
| Agentti / ohjeiden noudattaminen | IFEval | 93,70 |
Projektin mukaan malli johtaa sen valitsemissa vertailuissa noin 10 miljardin parametrin yleiskäyttöisten kuva–kielimallien joukkoa tilallisessa ja ruumiillistuneessa päättelyssä, säilyttäen samalla vahvat yleiset visuaaliset kyvyt. 2
Tämä on hyödyllinen signaali kehittäjälle tai tutkijalle, joka etsii suhteellisen kompaktia avointa mallia tilallisesti vaativiin tehtäviin. Se ei silti ole yleispätevä paremmuusjärjestys. Vertailu riippuu muun muassa valmistajan valitsemista malliversioista, kehotteista, esikäsittelystä, dekoodausasetuksista ja testijärjestelystä. Ennen vahvoja johtopäätöksiä tulokset olisi toistettava riippumattomasti avoimesti dokumentoiduilla asetuksilla. 2
ZDTaichu5.0-9B on saatavilla TaichuAI:n Hugging Face -tietovarastossa. Julkaisu kuvaa mallin mukautettua koodia hyödyntäväksi ja linkittää materiaaleihin, jotka käsittelevät toistuvaa päättelyä ja käyttöönottoa. 2
Julkaisun ilmoittama lisenssijärjestely on mallimateriaaleille NVIDIA Open Model License; Qwen3.5-komponenteista on Apache-2.0-ilmoituksia. Uudelleenjakelua tai kaupallista käyttöä harkitsevien kannattaa tarkistaa aina suoraan tietovaraston ajantasaiset lisenssitiedostot ja ilmoitukset. 2
Palvelinkäyttöä varten TaichuAI dokumentoi mukautetut vLLM 0.26.0- ja Docker-toteutustavat. Mukana on erillisiä otanta-asetuksia tilallista kohdistusta vaativiin tehtäviin ja yleiskäyttöön. 2
ZDTaichu5.0-9B on avoin, noin 9 miljardin parametrin multimodaalimalli, jonka selvä erikoistumisalue on kuvien, näkökulmien, näkymien ja videoiden välisten suhteiden päättely – ei vain visuaalisen sisällön tunnistaminen. Sen 128 000 tokenin konteksti, resoluutioriippumaton kuvatuki ja epävarmuuteen perustuva toistuva päättely tekevät siitä huomionarvoisen vaihtoehdon tilallisia kuva–kielimalleja, ruumiillistunutta tekoälyä ja sovelluksen hallinnoimia agenttityönkulkuja tutkiville. 2
Julkaistut tulokset ovat lupaavia, etenkin tilallisen päättelyn testeissä. Niitä on kuitenkin syytä pitää valmistajan raportoimana näyttönä, ei vielä riippumattomasti varmistettuna suorituskykynä. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B yhdistää noin 9 miljardin parametrin Qwen3.5 9B kielidekooderin ja C RADIOv4 H näköenkooderin.
ZDTaichu5.0 9B yhdistää noin 9 miljardin parametrin Qwen3.5 9B kielidekooderin ja C RADIOv4 H näköenkooderin. Malli tukee tekstiä, yksittäisiä ja useita kuvia sekä videota, minkä lisäksi sille ilmoitetaan 128 000 tokenin konteksti ikkuna ja minkä tahansa resoluution kuvatuki.
TaichuAI:n julkaisemat vertailutulokset ovat lupaavia erityisesti tilallisissa tehtävissä, mutta ne ovat valmistajan raportoimia ja vaativat riippumatonta toistoa.