ZDTaichu5.0 9B — доступна для завантаження модель приблизно на 9 млрд параметрів для аналізу зображень і просторових зв’язків; заявлена довжина контексту — до 128 тис. TaichuAI опублікувала варіанти FP8 і NVFP4 та інструкції з розгортання через vLLM.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ZDTaichu5.0-9B — модель TaichuAI, яку можна завантажити й випробувати на завданнях візуального розуміння, просторового мислення та роботи ШІ-агентів з інструментами. Для досліджень втіленого ШІ — систем, які мають сприймати фізичне середовище й діяти в ньому, — це спосіб перевіряти, як модель тлумачить сцену. Але правильна відповідь про розташування предметів ще не означає, що система здатна безпечно керувати роботом. 2
20
Мовна частина ZDTaichu5.0-9B побудована на Qwen3.5-9B, а за обробку зображень відповідає C-RADIOv4-H. За специфікацією TaichuAI, модель приймає текст, одне або кілька зображень і відео; для візуальних даних заявлена підтримка довільної роздільності, а довжина контексту становить до 128 тис. токенів. Це відкриває можливість досліджувати сцени з кількох ракурсів, проте сама специфікація не підтверджує однакову якість роботи за кожного розміру входу чи контексту. 2
TaichuAI називає свій підхід адаптивним рекурентним міркуванням із керуванням за ентропією: за описом розробника, складніші токени можуть отримувати додаткові кроки внутрішнього уточнення, замість того щоб витрачати однаковий обсяг обчислень на всі токени. Мета — поглиблювати опрацювання там, де воно потрібне. 20
Для агента, що працює з фізичним середовищем, важливо, наприклад, не втрачати з поля уваги положення предмета після зміни ракурсу та враховувати просторові зв’язки під час використання інструментів. ZDTaichu5.0-9B можна перевіряти на таких завданнях, але її не слід вважати перевіреною робототехнічною системою «від сприйняття до дії». 2
20
У порівнянні TaichuAI із загальними моделями для роботи з текстом і зображеннями подібного розміру ZDTaichu5.0-9B набрала 62,50 у ViewSpatial, 78,27 у MindCube-tiny, 47,20 у MMSI-Bench, 48,00 у ERQA та 56,00 у RoboSpatial. Розробник заявляє про провідні результати в просторових завданнях серед порівнюваних моделей. Це опубліковані ним оцінки, а не незалежно відтворені тут вимірювання: якість у власних сценах, налаштуванні агента чи фізичному середовищі потрібно перевіряти окремо. 1
20
Основна модель доступна на Hugging Face; TaichuAI також опублікувала варіанти FP8 і NVFP4. Окремо представлено DSpark — допоміжну модель для спекулятивного декодування із ZDTaichu5.0-9B у vLLM, програмному інструменті для запуску моделей як сервісу. Для розгортання TaichuAI описує спеціальний Docker-образ vLLM і модифіковану гілку vLLM: надійніше починати з цих інструкцій, а не припускати, що звичайна інсталяція працюватиме так само. 2
4
5
3
17
Перед повторним використанням варто зробити дві перевірки. По-перше, з’ясувати ліцензійні умови основної моделі, її компонентів і конвертованих ваг. Сторонню конвертацію GGUF позначено як Apache-2.0, тоді як інший каталог указує на відмінну ліцензійну схему. Позначка конвертації сама собою не встановлює умов для оригінальної моделі. 8
6 По-друге, не плутати налаштування сервера з підтвердженою можливістю моделі. У прикладі команди vLLM задано
--max-model-len 220000, але специфікація моделі вказує контекст до 128 тис. токенів. Параметр запуску не доводить, що ефективний контекст у 220 тис. токенів перевірено. 17
2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B — доступна для завантаження модель приблизно на 9 млрд параметрів для аналізу зображень і просторових зв’язків; заявлена довжина контексту — до 128 тис.
ZDTaichu5.0 9B — доступна для завантаження модель приблизно на 9 млрд параметрів для аналізу зображень і просторових зв’язків; заявлена довжина контексту — до 128 тис. TaichuAI опублікувала варіанти FP8 і NVFP4 та інструкції з розгортання через vLLM.