ZDTaichu5.0 9B ialah model bahasa visual terbuka daripada TaichuAI yang menggabungkan penyahkod bahasa Qwen3.5 9B sekitar 9 bilion parameter dengan pengekod visual C RADIOv4 H. Reka bentuk Entropy Gated Adaptive Recurrent Reasoning menambah penambahbaikan dalam ruang laten pada token yang lebih sukar, bukan mengguna...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B ialah model asas multimodal terbuka daripada TaichuAI yang disasarkan kepada pemahaman visual, penaakulan ruang, penggunaan alat berasaskan ejen dan penyelidikan AI terjelma (embodied AI). Nilai praktikalnya bukan sekadar kebolehan mentafsir imej: projek ini direka khusus untuk tugasan yang memerlukan sistem menilai perubahan sudut pandang, hubungan antara objek, bukti daripada berbilang imej serta video dalam konteks panjang. 2
Model ini menggabungkan penyahkod bahasa Qwen3.5-9B dengan kira-kira 9 bilion parameter dan pengekod visual C-RADIOv4-H. Ia menerima teks, satu atau berbilang imej, serta video; keluaran ini menyatakan sokongan untuk input visual pada sebarang resolusi dan tetingkap konteks sehingga 128K token. 2
Julat input tersebut menjadikannya lebih luas daripada model untuk kapsyen imej biasa. Kad model meletakkan ZDTaichu5.0-9B bagi dokumen, carta, rajah, OCR (pengecaman aksara optik), soal jawab visual dan matematik visual, di samping tafsiran babak yang lebih menyeluruh. 2
TaichuAI menekankan tugasan ruang dan AI terjelma yang sering mencabar model bahasa-visual serba guna. Keupayaan yang dinyatakan termasuk:
Model ini juga menyokong interaksi berorientasikan ejen. Namun, ini tidak bererti ia melaksanakan tindakan secara autonomi: model boleh merancang panggilan alat dan menyertai aliran kerja berbilang langkah atau berbilang giliran, tetapi aplikasi hos kekal bertanggungjawab untuk melaksanakan, mengesahkan dan melindungi penggunaan alat tersebut. 2
Dakwaan teknikal utama ZDTaichu5.0-9B ialah Entropy-Gated Adaptive Recurrent Reasoning. Berbanding menggunakan pengiraan penaakulan tambahan yang sama pada setiap token, sistem ini menggunakan tahap ketidakpastian untuk menentukan bahagian yang memerlukan penambahbaikan tambahan dalam ruang laten. 2
Secara mudahnya, langkah yang jelas boleh diteruskan seperti biasa, manakala ramalan yang kabur atau sukar boleh menerima penambahbaikan dalaman tambahan. Matlamatnya ialah memberikan kedalaman pengiraan yang lebih tinggi pada langkah penaakulan sukar tanpa menambah kerja secara seragam pada keseluruhan jawapan. 2
Ini penting untuk soalan ruang kerana satu hubungan yang samar—misalnya perubahan sudut kamera atau kedudukan relatif dua objek—boleh menentukan sama ada jawapan akhir adalah tepat.
TaichuAI melaporkan keputusan berikut dalam bahan modelnya:
| Bidang penilaian | Penanda aras | Skor dilaporkan |
|---|---|---|
| Ruang / AI terjelma | ViewSpatial | 62.50 |
| Ruang / AI terjelma | MMSI-Bench | 47.20 |
| Ruang / AI terjelma | MindCube-tiny | 78.27 |
| Ruang / AI terjelma | ERQA | 48.00 |
| Ruang / AI terjelma | RoboSpatial | 56.00 |
| Ejen / mengikut arahan | TAU2-Bench | 87.70 |
| Ejen / mengikut arahan | Claw-Eval | 71.40 |
| Ejen / mengikut arahan | IFEval | 93.70 |
Projek ini meletakkan model tersebut sebagai peneraju dalam penaakulan ruang dan AI terjelma dalam kalangan model bahasa-visual serba guna berskala kira-kira 10B yang dimasukkan dalam perbandingannya, sambil mengekalkan keupayaan visual umum yang kukuh. 2
Ini ialah petunjuk yang berguna untuk penyelidik atau pembangun yang mencari model terbuka lebih padat bagi beban kerja yang memerlukan penaakulan ruang. Namun, ia bukan kedudukan sejagat. Perbandingan yang dilaporkan bergantung pada versi model, gesaan, prapemprosesan, tetapan penyahkodan dan susun atur penilaian yang dipilih oleh pembekal. Penghasilan semula secara bebas dengan butiran tersebut didedahkan diperlukan sebelum keputusan ini dianggap sebagai prestasi perbandingan yang muktamad. 2
ZDTaichu5.0-9B tersedia melalui repositori Hugging Face TaichuAI. Keluaran ini mengenal pasti model tersebut sebagai berasaskan kod tersuai dan memautkan bahan projek bagi penaakulan berulang serta pelaksanaan. 2
Susunan pelesenan yang dinyatakan ialah NVIDIA Open Model License untuk bahan model yang dikeluarkan, dengan notis Apache-2.0 bagi komponen Qwen3.5. Pasukan yang mempertimbangkan pengedaran semula atau penggunaan komersial perlu menyemak terus fail lesen dan notis terkini dalam repositori. 2
Untuk penyajian model, TaichuAI mendokumentasikan laluan vLLM 0.26.0 tersuai dan Docker, termasuk pratetap pensampelan berlainan untuk beban kerja penentududukan ruang (spatial grounding) dan tugasan umum. 2
ZDTaichu5.0-9B ialah model multimodal terbuka berskala kira-kira 9B yang dibina dengan pengkhususan jelas: menaakul merentasi imej, sudut pandang, babak dan video—bukan sekadar mengenal kandungan visual. Konteks 128K, input visual pada sebarang resolusi dan pendekatan penaakulan berulang adaptif menjadikannya pilihan yang menarik untuk penyelidik dan pembangun yang meneroka model bahasa-visual ruang, AI terjelma serta aliran kerja ejen yang diuruskan oleh aplikasi hos. 2
Keputusan yang diterbitkan kelihatan memberangsangkan, khususnya pada penanda aras ruang, tetapi ia wajar dilihat sebagai bukti yang dilaporkan pembekal—bukan prestasi yang telah disahkan secara bebas—sehingga ujian itu dihasilkan semula oleh pihak ketiga dalam keadaan yang telus. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B ialah model bahasa visual terbuka daripada TaichuAI yang menggabungkan penyahkod bahasa Qwen3.5 9B sekitar 9 bilion parameter dengan pengekod visual C RADIOv4 H.
ZDTaichu5.0 9B ialah model bahasa visual terbuka daripada TaichuAI yang menggabungkan penyahkod bahasa Qwen3.5 9B sekitar 9 bilion parameter dengan pengekod visual C RADIOv4 H. Reka bentuk Entropy Gated Adaptive Recurrent Reasoning menambah penambahbaikan dalam ruang laten pada token yang lebih sukar, bukan menggunakan pengiraan tambahan secara seragam pada setiap token output.
Pemberat dan bahan pelaksanaan tersedia melalui repositori Hugging Face projek ini, termasuk laluan penyajian vLLM 0.26.0 tersuai dan Docker.