Noin 9 miljardin parametrin ZDTaichu5.0 9B on ladattava näkö ja kielimalli, joka on suunnattu muun muassa tilallisen päättelyn ja kehollisen tekoälyn tutkimukseen. Malli ottaa vastaan tekstiä, kuvia ja videota.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Jos robotin pitäisi päätellä, missä esine sijaitsee kameran kuvakulman vaihtuessa, pelkkä esineen tunnistaminen ei riitä. TaichuAI:n ladattava ZDTaichu5.0-9B on näkö- ja kielimalli, jolla tutkijat voivat kokeilla tällaisia tilallisen ymmärtämisen tehtäviä sekä työkalujen käyttöä osana tekoälyagentin toimintaa. Se on tutkimusväline, ei valmiiksi todennettu robottijärjestelmä: oikea vastaus kuvasta esitettyyn kysymykseen ei vielä osoita, että malli osaisi toimia fyysisessä ympäristössä turvallisesti. 2
20
ZDTaichu5.0-9B yhdistää Qwen3.5-9B-kielimallin C-RADIOv4-H-näkökooderiin. TaichuAI:n mukaan se käsittelee tekstiä, yksittäisiä kuvia, useita kuvia ja videota sekä tukee eriresoluutioista visuaalista syötettä. Ilmoitettu kontekstin enimmäispituus on 128 000 tokenia. Usean kuvan tuki tekee mallista kiinnostavan esimerkiksi saman näkymän eri kuvakulmien vertailuun, mutta tekniset tiedot eivät yksin kerro, miten hyvin se toimii kaikilla syötteillä tai pisimmällä mahdollisella kontekstilla. 2
TaichuAI kutsuu mallin päättelymenetelmää entropiaohjatuksi mukautuvaksi toistuvaksi päättelyksi. Julkaisijan kuvauksen mukaan malli voi käyttää vaikeampien tokenien käsittelyyn ylimääräisiä sisäisiä tarkennuskierroksia sen sijaan, että se käyttäisi saman määrän laskentaa kaikkialla. Tavoitteena on kohdistaa enemmän päättelyä kohtiin, joissa sitä tarvitaan. 20
TaichuAI raportoi mallille tulokset 62,50 ViewSpatialissa, 78,27 MindCube-tinyssä, 47,20 MMSI-Benchissä, 48,00 ERQA:ssa ja 56,00 RoboSpatialissa. Julkaisijan mukaan malli sijoittuu tilallisissa tehtävissä sen vertailemien samankokoisten yleiskäyttöisten näkö- ja kielimallien kärkeen. Tulokset ovat kuitenkin TaichuAI:n raportoimia, eikä niitä ole tässä riippumattomasti toistettu. Tutkijan on arvioitava suorituskyky erikseen omilla kuvillaan, agenttijärjestelyllään ja mahdollisessa fyysisessä ympäristössä. 1
20
Päämalli on saatavilla Hugging Facessa. TaichuAI julkaisee myös FP8- ja NVFP4-versiot sekä DSpark-luonnosmallin, joka on tarkoitettu spekulatiiviseen dekoodaukseen ZDTaichu5.0-9B:n kanssa vLLM-palvelussa. Käyttöönottoa varten julkaisija dokumentoi mallikohtaisen vLLM-Docker-kuvan ja muokatun vLLM-haaran; tavallisen vLLM-asennuksen ei pidä olettaa toimivan samalla tavalla. 2
4
5
3
17
Tarkista lisenssiehdot ennen uudelleenkäyttöä. Kolmannen osapuolen GGUF-muunnos on merkitty Apache-2.0-lisenssillä, mutta toinen malliluettelo kuvaa lisensointia toisin. Muunnoksen merkintä ei yksin ratkaise alkuperäisen mallin tai sen osien ehtoja. 8
6
Myös kontekstipituudessa on syytä erottaa määritys palvelimen asetuksesta: TaichuAI:n vLLM-esimerkissä on valinta --max-model-len 220000, vaikka mallin teknisissä tiedoissa enimmäispituudeksi ilmoitetaan 128 000 tokenia. Palvelimen asetus ei todista, että 220 000 tokenin konteksti olisi käytännössä validoitu. 17
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Noin 9 miljardin parametrin ZDTaichu5.0 9B on ladattava näkö ja kielimalli, joka on suunnattu muun muassa tilallisen päättelyn ja kehollisen tekoälyn tutkimukseen.
Noin 9 miljardin parametrin ZDTaichu5.0 9B on ladattava näkö ja kielimalli, joka on suunnattu muun muassa tilallisen päättelyn ja kehollisen tekoälyn tutkimukseen. Malli ottaa vastaan tekstiä, kuvia ja videota. TaichuAI ilmoittaa kontekstin enimmäispituudeksi 128 000 tokenia ja tarjoaa myös FP8 ja NVFP4 versiot.
TaichuAI:n vertailutulokset ovat julkaisijan raportoimia. Ennen käyttöä kannattaa tarkistaa lisenssiehdot ja testata malli omissa ympäristöissä.