ZDTaichu5.0 9B — відкрита vision language модель TaichuAI з мовним декодером Qwen3.5 9B приблизно на 9 млрд параметрів і візуальним енкодером C RADIOv4 H. Вона приймає текст, одне або кілька зображень і відео, підтримує візуальні дані довільної роздільності та контекст до 128 тисяч токенів.
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B — відкрита мультимодальна базова модель від TaichuAI для візуального розуміння, просторового міркування, використання інструментів агентами та досліджень у сфері embodied AI — систем, що мають сприймати фізичний світ і планувати в ньому дії. Її головна особливість не зводиться до розпізнавання картинки: модель заявлено для завдань, де потрібно враховувати зміну ракурсу, взаємне розташування предметів, кілька зображень або тривале відео. 2
Модель поєднує мовний декодер Qwen3.5-9B приблизно на 9 млрд параметрів і візуальний енкодер C-RADIOv4-H. Вона працює з текстом, одним чи кількома зображеннями та відео, підтримує візуальні вхідні дані довільної роздільності й контекстне вікно до 128 тисяч токенів. 2
Такий набір робить її придатною не лише для опису зображень. У картці моделі серед сценаріїв названі робота з документами, графіками, схемами, OCR — розпізнаванням тексту на зображеннях, візуальні запитання й завдання з візуальної математики. 2
TaichuAI акцентує на просторових і втілених задачах, що часто лишаються складними для універсальних візуально-мовних моделей. Заявлені можливості охоплюють:
Модель також підтримує взаємодію, орієнтовану на агентів. Водночас це не означає, що вона самостійно виконує дії: вона може планувати виклики інструментів і брати участь у багатокрокових чи багатораундових процесах, але запуск, перевірка та захист інструментів залишаються відповідальністю застосунку, який її використовує. 2
Ключове технічне твердження ZDTaichu5.0-9B — механізм Entropy-Gated Adaptive Recurrent Reasoning, тобто адаптивне рекурентне міркування з керуванням за ентропією. Замість однаково додавати обчислення для кожного токена модель оцінює невизначеність і вирішує, де потрібне додаткове уточнення внутрішніх представлень. 2
Простіше кажучи, для очевидних кроків відповідь може генеруватися у звичайному режимі, а складні або невизначені передбачення отримують додаткове внутрішнє доопрацювання. Заявлена мета — збільшити ефективну обчислювальну глибину саме на важких етапах міркування, не підвищуючи однаково витрати на всю відповідь. 2
Це особливо доречно для просторових запитань: неоднозначність у визначенні положення об’єкта чи наслідків зміни ракурсу може повністю змінити правильну відповідь.
TaichuAI наводить у матеріалах моделі такі результати:
| Напрям оцінювання | Бенчмарк | Заявлений бал |
|---|---|---|
| Просторові / embodied-задачі | ViewSpatial | 62,50 |
| Просторові / embodied-задачі | MMSI-Bench | 47,20 |
| Просторові / embodied-задачі | MindCube-tiny | 78,27 |
| Просторові / embodied-задачі | ERQA | 48,00 |
| Просторові / embodied-задачі | RoboSpatial | 56,00 |
| Агенти / дотримання інструкцій | TAU2-Bench | 87,70 |
| Агенти / дотримання інструкцій | Claw-Eval | 71,40 |
| Агенти / дотримання інструкцій | IFEval | 93,70 |
Проєкт позиціонує ZDTaichu5.0-9B як лідера за просторовим та embodied-міркуванням серед зіставлюваних універсальних VLM приблизно 10B-класу, зберігаючи сильніші загальні візуальні можливості. 2
Для розробників це може бути корисним сигналом під час вибору компактної відкритої моделі для просторово складних задач. Але це не універсальний рейтинг: порівняння залежать від обраних постачальником версій моделей, промптів, підготовки даних, параметрів декодування та методики оцінювання. Потрібне незалежне відтворення тестів із розкриттям цих деталей, перш ніж вважати результати остаточно підтвердженими. 2
ZDTaichu5.0-9B доступна в репозиторії TaichuAI на Hugging Face. У релізі зазначено використання власного коду та наведено посилання на матеріали про рекурентне міркування й розгортання. 2
Для опублікованих матеріалів указано NVIDIA Open Model License, а для компонентів Qwen3.5 — повідомлення про ліцензію Apache-2.0. Перед розповсюдженням або комерційним використанням команді варто безпосередньо перевірити актуальні ліцензійні файли та повідомлення в репозиторії. 2
Для сервінгу TaichuAI документує власні шляхи запуску через vLLM 0.26.0 і Docker, зокрема різні налаштування семплінгу для задач просторового заземлення та загальних завдань. 2
ZDTaichu5.0-9B — відкрита мультимодальна модель приблизно 9B-класу з виразною спеціалізацією: вона має не тільки розпізнавати візуальний вміст, а й міркувати про сцени, ракурси, взаємне положення предметів і відеопослідовності. Контекст до 128 тисяч токенів, підтримка зображень довільної роздільності та адаптивне рекурентне міркування роблять її помітним варіантом для дослідників і розробників, які працюють із просторовими VLM, embodied AI та агентними сценаріями під контролем застосунку. 2
Опубліковані результати виглядають перспективно, передусім у просторових бенчмарках, однак їх слід сприймати як дані, заявлені розробником, а не як незалежно встановлений факт — доки сторонні команди не відтворять тести у прозорих умовах. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B — відкрита vision language модель TaichuAI з мовним декодером Qwen3.5 9B приблизно на 9 млрд параметрів і візуальним енкодером C RADIOv4 H.
ZDTaichu5.0 9B — відкрита vision language модель TaichuAI з мовним декодером Qwen3.5 9B приблизно на 9 млрд параметрів і візуальним енкодером C RADIOv4 H. Вона приймає текст, одне або кілька зображень і відео, підтримує візуальні дані довільної роздільності та контекст до 128 тисяч токенів.
Механізм Entropy Gated Adaptive Recurrent Reasoning спрямовує додаткові внутрішні обчислення на складніші токени, а не витрачає їх однаково на весь результат.