ZDTaichu5.0 9B adalah model visi bahasa sekitar 9 miliar parameter yang ditujukan untuk riset penalaran spasial dan embodied AI, dengan konteks yang dinyatakan hingga 128K token. Model ini menerima teks, satu atau beberapa gambar, serta video.
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Jika sebuah agen AI harus memahami letak benda dari beberapa sudut pandang sebelum mengambil keputusan, kemampuan menjawab pertanyaan tentang gambar saja belum cukup. Di sinilah ZDTaichu5.0-9B menarik bagi peneliti: TaichuAI menyediakan model visi-bahasa yang dapat diunduh untuk menguji pemahaman adegan, hubungan spasial, dan penggunaan alat oleh agen. Fokusnya relevan untuk embodied AI—AI yang dirancang untuk berinteraksi dengan lingkungan fisik—tetapi model ini bukan sistem robotika menyeluruh yang telah terbukti aman untuk bertindak. 2
20
ZDTaichu5.0-9B memasangkan dekoder bahasa Qwen3.5-9B dengan enkoder visual C-RADIOv4-H. Menurut spesifikasi TaichuAI, inputnya mencakup teks, satu gambar, beberapa gambar, dan video, dengan dukungan input visual pada berbagai resolusi. Panjang konteks yang dinyatakan mencapai 128K token. Kombinasi ini membuka ruang untuk eksperimen yang membandingkan lebih dari satu tampilan sebuah adegan; spesifikasi tersebut tidak otomatis menjamin hasil yang sama baiknya pada setiap ukuran input atau panjang konteks. 2
TaichuAI juga menyebut pendekatannya entropy-gated adaptive recurrent reasoning. Menurut pengembang, model dapat menambahkan langkah penyempurnaan internal pada token yang lebih sulit, alih-alih memberikan komputasi tambahan dalam jumlah sama pada semua token. Tujuannya adalah memperdalam penalaran saat dibutuhkan. 20
Dalam perbandingan yang dilaporkan TaichuAI terhadap model visi-bahasa serbaguna berukuran serupa, ZDTaichu5.0-9B memperoleh 62,50 di ViewSpatial, 78,27 di MindCube-tiny, 47,20 di MMSI-Bench, 48,00 di ERQA, dan 56,00 di RoboSpatial. TaichuAI menyatakan kemampuan spasialnya unggul di antara model yang dibandingkan. Namun, angka itu adalah hasil yang dilaporkan pengembang, bukan temuan yang direproduksi secara independen di sini. Peneliti tetap perlu mengujinya dengan adegan, konfigurasi agen, dan lingkungan fisik yang sesuai dengan riset mereka. 1
20
Model utama tersedia di Hugging Face, bersama varian FP8 dan NVFP4 dari TaichuAI. Ada pula DSpark, model pendamping untuk speculative decoding yang ditujukan bagi penggunaan dengan model ZDTaichu5.0-9B di vLLM, perangkat lunak untuk menjalankan layanan inferensi model. Untuk penerapan, dokumentasi TaichuAI mencantumkan image Docker khusus model ini dan cabang vLLM yang dimodifikasi; keduanya lebih tepat dijadikan titik awal daripada mengasumsikan instalasi vLLM standar akan bekerja identik. 2
4
5
3
17
Sebelum menggunakan ulang bobotnya, periksa lisensi model asal serta ketentuan komponen dan bobot hasil konversi. Sebuah konversi GGUF buatan pihak ketiga berlabel Apache-2.0, sedangkan daftar model lain menggambarkan pengaturan lisensi yang berbeda. Label pada konversi itu saja tidak memastikan ketentuan model asal. 8
6
Perhatikan pula perbedaan antara konfigurasi server dan spesifikasi model: contoh perintah vLLM dari TaichuAI memakai --max-model-len 220000, sementara spesifikasi model menyebut konteks hingga 128K token. Nilai konfigurasi 220000 bukan bukti bahwa konteks efektif sepanjang itu telah tervalidasi. 17
2
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
ZDTaichu5.0 9B adalah model visi bahasa sekitar 9 miliar parameter yang ditujukan untuk riset penalaran spasial dan embodied AI, dengan konteks yang dinyatakan hingga 128K token.
ZDTaichu5.0 9B adalah model visi bahasa sekitar 9 miliar parameter yang ditujukan untuk riset penalaran spasial dan embodied AI, dengan konteks yang dinyatakan hingga 128K token. Model ini menerima teks, satu atau beberapa gambar, serta video. TaichuAI menyediakan varian FP8 dan NVFP4 serta panduan penerapan khusus di vLLM.
Skor benchmark berasal dari laporan TaichuAI; keberhasilan menafsirkan adegan belum membuktikan kemampuan bertindak aman di lingkungan fisik.