ZDTaichu5.0 9B ialah model bahasa visual sekitar 9 bilion parameter untuk penyelidikan penaakulan ruang dan AI berjasad; panjang konteks yang dinyatakan ialah sehingga 128K token. Model ini menerima teks, satu atau beberapa imej serta video.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Bagi penyelidik yang mahu menguji sama ada AI dapat memahami kedudukan objek dan hubungan antara objek dalam sesuatu pemandangan, ZDTaichu5.0-9B menawarkan model bahasa-visual yang boleh dimuat turun. TaichuAI menumpukannya pada kefahaman visual, penaakulan ruang, ejen yang menggunakan alat dan penyelidikan AI berjasad—AI yang menghubungkan persepsi dengan tindakan dalam persekitaran fizikal. Namun, jawapan yang tepat tentang imej tidak bermakna model itu sudah terbukti mampu mengawal robot dengan selamat. 2
20
Model ini menggabungkan penyahkod bahasa Qwen3.5-9B dengan pengekod visual C-RADIOv4-H. Menurut spesifikasi TaichuAI, inputnya merangkumi teks, satu imej, beberapa imej dan video, termasuk input visual pada pelbagai resolusi. Panjang konteks yang dinyatakan ialah sehingga 128K token. Ini membuka ruang untuk eksperimen yang membandingkan beberapa pandangan bagi pemandangan yang sama, tetapi spesifikasi tersebut sahaja tidak menjamin prestasi pada setiap saiz input atau panjang konteks. 2
TaichuAI menamakan tekniknya penaakulan berulang adaptif berpagar entropi (entropy-gated adaptive recurrent reasoning). Menurut pembangunnya, model boleh memberikan langkah penambahbaikan dalaman tambahan kepada token yang lebih mencabar, dan bukannya menggunakan jumlah pengiraan tambahan yang sama untuk setiap token. Tujuannya ialah memperdalam penaakulan apabila diperlukan. 20
Pendekatan itu relevan untuk menguji soalan seperti: di manakah sesuatu objek apabila sudut pandang berubah, dan bagaimana kedudukannya berbanding objek lain? Ia juga boleh dikaji dalam aliran kerja ejen yang menggunakan alat. Ini ialah kegunaan penyelidikan yang berpotensi, bukan pengesahan sebuah sistem robotik lengkap. 2
20
Dalam perbandingan TaichuAI dengan model bahasa-visual serba guna yang hampir sama saiz, ZDTaichu5.0-9B mencatat 62,50 pada ViewSpatial, 78,27 pada MindCube-tiny, 47,20 pada MMSI-Bench, 48,00 pada ERQA dan 56,00 pada RoboSpatial. TaichuAI menyifatkan prestasi ruangnya sebagai peneraju dalam kumpulan model yang dibandingkan. Angka ini ialah hasil penilaian yang dilaporkan, bukan keputusan yang disahkan secara bebas di sini. Penyelidik masih perlu mengujinya pada pemandangan, persediaan ejen dan persekitaran fizikal mereka sendiri. 1
20
Model utama tersedia di Hugging Face, bersama varian FP8 dan NVFP4. TaichuAI juga menyediakan DSpark, model draf untuk penyahkodan spekulatif bersama ZDTaichu5.0-9B dalam vLLM. Untuk menjalankan model sebagai perkhidmatan, dokumentasinya menunjukkan imej Docker vLLM khusus model serta cabang vLLM yang diubah suai; jangan anggap pemasangan vLLM biasa akan berfungsi dengan cara yang sama. 2
4
5
3
17
Dua semakan penting sebelum penggunaan semula:
--max-model-len 220000, tetapi spesifikasi model menyatakan sehingga 128K token. Tetapan 220,000 itu bukan bukti bahawa konteks efektif sepanjang itu telah disahkan. Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B ialah model bahasa visual sekitar 9 bilion parameter untuk penyelidikan penaakulan ruang dan AI berjasad; panjang konteks yang dinyatakan ialah sehingga 128K token.
ZDTaichu5.0 9B ialah model bahasa visual sekitar 9 bilion parameter untuk penyelidikan penaakulan ruang dan AI berjasad; panjang konteks yang dinyatakan ialah sehingga 128K token. Model ini menerima teks, satu atau beberapa imej serta video. TaichuAI turut menyediakan varian FP8 dan NVFP4 serta panduan penggunaan vLLM.
Skor penanda aras ialah keputusan yang dilaporkan oleh TaichuAI, bukan pengesahan bebas atau bukti keselamatan tindakan robot.