ZDTaichu5.0 9B adalah model vision language terbuka dari TaichuAI yang memadukan decoder bahasa Qwen3.5 9B berukuran sekitar 9 miliar parameter dengan encoder visi C RADIOv4 H. Model ini menerima teks, satu atau beberapa gambar, serta video pada resolusi berapa pun, dengan jendela konteks hingga 128K token.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B adalah model fondasi multimodal terbuka dari TaichuAI untuk pemahaman visual, penalaran spasial, penggunaan alat oleh agen, dan riset embodied AI—AI yang perlu memahami serta berinteraksi dengan dunia fisik. Daya tarik utamanya bukan sekadar mampu membaca gambar, melainkan dirancang untuk menalar perubahan sudut pandang, hubungan antarbenda, bukti dari banyak gambar, dan video dengan konteks panjang. 2
Model ini memadukan decoder bahasa Qwen3.5-9B berukuran sekitar 9 miliar parameter dengan encoder visi C-RADIOv4-H. Input yang didukung mencakup teks, satu atau beberapa gambar, serta video. Rilisnya menyebut dukungan input visual pada resolusi berapa pun dan jendela konteks hingga 128K token. 2
Cakupannya karena itu melampaui pembuatan keterangan gambar biasa. Kartu model menempatkan ZDTaichu5.0-9B untuk dokumen, grafik, diagram, OCR—pengenalan teks pada gambar—tanya jawab visual, dan matematika visual, selain interpretasi adegan yang lebih luas. 2
TaichuAI menonjolkan tugas spasial dan embodied yang sering kali masih sulit bagi model visi-bahasa serbaguna. Kapabilitas yang disebutkan meliputi:
Model ini juga mendukung interaksi berorientasi agen. Namun, hal itu tidak berarti model dapat mengeksekusi tindakan secara mandiri: model dapat merencanakan pemanggilan alat dan terlibat dalam alur kerja bertahap atau multigiliran, sedangkan aplikasi host tetap bertanggung jawab menjalankan, memvalidasi, dan mengamankan alat tersebut. 2
Klaim teknis utama ZDTaichu5.0-9B adalah Entropy-Gated Adaptive Recurrent Reasoning. Alih-alih menerapkan komputasi penalaran tambahan yang sama pada setiap token, sistem menggunakan tingkat ketidakpastian untuk menentukan bagian mana yang membutuhkan pemurnian tambahan di ruang laten. 2
Secara sederhana, langkah yang mudah dapat berjalan seperti biasa, sementara prediksi yang tidak pasti atau lebih rumit mendapat pemurnian internal tambahan. Tujuannya adalah memberi kedalaman komputasi efektif lebih besar pada langkah penalaran sulit tanpa menaikkan beban komputasi secara seragam di seluruh respons. 2
Pendekatan ini relevan untuk pertanyaan spasial, karena satu relasi yang ambigu—misalnya akibat perubahan posisi kamera atau letak suatu objek terhadap objek lain—dapat menentukan benar atau salahnya jawaban akhir.
TaichuAI melaporkan hasil berikut dalam materi modelnya:
| Area evaluasi | Benchmark | Skor yang dilaporkan |
|---|---|---|
| Spasial / embodied | ViewSpatial | 62,50 |
| Spasial / embodied | MMSI-Bench | 47,20 |
| Spasial / embodied | MindCube-tiny | 78,27 |
| Spasial / embodied | ERQA | 48,00 |
| Spasial / embodied | RoboSpatial | 56,00 |
| Agen / mengikuti instruksi | TAU2-Bench | 87,70 |
| Agen / mengikuti instruksi | Claw-Eval | 71,40 |
| Agen / mengikuti instruksi | IFEval | 93,70 |
Proyek ini memosisikan model tersebut sebagai pemimpin penalaran spasial dan embodied di antara VLM—vision-language model—serbaguna berskala sekitar 10B yang dimasukkan dalam perbandingannya, sambil mempertahankan kemampuan visual umum yang kuat. 2
Ini merupakan sinyal yang berguna bagi peneliti dan pengembang yang mencari model terbuka ringkas untuk beban kerja dengan tuntutan spasial tinggi. Namun, klaim itu bukan peringkat universal. Perbandingan yang dilaporkan bergantung pada versi model, prompt, prapemrosesan, pengaturan decoding, dan rancangan evaluasi yang dipilih vendor. Reproduksi independen dengan rincian tersebut diperlukan sebelum hasilnya dianggap sebagai performa komparatif yang telah mapan. 2
ZDTaichu5.0-9B tersedia melalui repositori Hugging Face milik TaichuAI. Rilisnya mengidentifikasi model ini sebagai berbasis kode kustom dan menautkan materi proyek untuk penalaran rekuren serta deployment. 2
Pengaturan lisensi yang disebutkan adalah NVIDIA Open Model License untuk materi model yang dirilis, dengan pemberitahuan Apache-2.0 untuk komponen Qwen3.5. Tim yang mempertimbangkan redistribusi atau penggunaan komersial sebaiknya meninjau langsung berkas lisensi dan pemberitahuan terbaru di repositori. 2
Untuk penyajian model, TaichuAI mendokumentasikan jalur kustom vLLM 0.26.0 dan Docker, termasuk preset sampling berbeda untuk beban kerja spatial grounding dan tugas umum. 2
ZDTaichu5.0-9B adalah model multimodal terbuka skala sekitar 9B dengan spesialisasi yang jelas: menalar lintas gambar, sudut pandang, adegan, dan video, bukan hanya mengenali isi visual. Konteks 128K, input visual beresolusi bebas, serta pendekatan penalaran rekuren adaptif menjadikannya opsi menarik bagi riset VLM spasial, embodied AI, dan alur kerja agen yang dikelola aplikasi host. 2
Hasil yang dipublikasikan terlihat menjanjikan, khususnya pada benchmark spasial. Namun, hasil tersebut tetap perlu dibaca sebagai bukti yang dilaporkan vendor, bukan performa yang telah dikonfirmasi secara independen, sampai pengujian pihak ketiga mereplikasinya dalam kondisi transparan. 2
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
ZDTaichu5.0 9B adalah model vision language terbuka dari TaichuAI yang memadukan decoder bahasa Qwen3.5 9B berukuran sekitar 9 miliar parameter dengan encoder visi C RADIOv4 H.
ZDTaichu5.0 9B adalah model vision language terbuka dari TaichuAI yang memadukan decoder bahasa Qwen3.5 9B berukuran sekitar 9 miliar parameter dengan encoder visi C RADIOv4 H. Model ini menerima teks, satu atau beberapa gambar, serta video pada resolusi berapa pun, dengan jendela konteks hingga 128K token.
Mekanisme Entropy Gated Adaptive Recurrent Reasoning menambahkan pemurnian di ruang laten pada token yang lebih sulit, alih alih memakai komputasi tambahan secara merata untuk setiap token.