ZDTaichu5.0 9B — доступная для загрузки визуально языковая модель примерно на 9 млрд параметров, ориентированная на понимание сцен, пространственных отношений и исследования воплощённого ИИ. Модель принимает текст, одно или несколько изображений и видео.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B model, and how do its architecture, supported inputs and context length, adaptive reasoning a. Article summary: ZDTaichu5.0-9B is TaichuAI’s open-sourced, roughly 9-billion-parameter vision-language model aimed at visual understanding, spatial reasoning, tool-using agents, and embodied-AI research. Its value is as a downloadable m. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Для исследователя робототехники интерес ZDTaichu5.0-9B заключается не просто в распознавании объектов. Модель можно загрузить и использовать в экспериментах, где системе нужно понять взаимное расположение предметов, сопоставить разные ракурсы сцены и передать результат агенту, работающему с инструментами. Однако убедительное описание сцены ещё не означает, что модель способна надёжно и безопасно управлять роботом. 2
20
TaichuAI объединила языковой декодер Qwen3.5-9B с визуальным энкодером C-RADIOv4-H. Согласно описанию модели, на вход можно подавать текст, одно изображение, несколько изображений или видео; для визуальных данных заявлена поддержка произвольного разрешения. Максимальная заявленная длина контекста — до 128 тыс. токенов. Это даёт возможность исследовать задачи, в которых важны несколько видов одной сцены и большой объём сопутствующего контекста, но само по себе не подтверждает одинаковое качество работы при любых размерах входных данных. 2
Разработчик называет один из подходов модели адаптивным рекуррентным рассуждением с энтропийным управлением. По объяснению TaichuAI, модель может выделять дополнительные внутренние шаги обработки для более сложных токенов, а не тратить одинаковый объём вычислений на каждый. Для пространственных задач это существенная идея: смена ракурса или неоднозначное положение предмета требуют аккуратного сопоставления деталей. Насколько подход помогает в конкретной системе, исследователям предстоит проверять экспериментально. 20
2
В сравнениях, опубликованных TaichuAI для универсальных визуально-языковых моделей сопоставимого размера, ZDTaichu5.0-9B получила 62,50 балла на ViewSpatial, 78,27 на MindCube-tiny, 47,20 на MMSI-Bench, 48,00 на ERQA и 56,00 на RoboSpatial. Разработчик считает её результаты в пространственных задачах ведущими среди сравниваемых моделей. Это результаты, сообщённые разработчиком, а не независимо воспроизведённая здесь оценка. Они не заменяют испытаний на собственных сценах, в конкретной агентной системе и тем более в физической среде. 1
20
Основная модель размещена на Hugging Face; там же TaichuAI опубликовала варианты FP8 и NVFP4. Отдельная модель DSpark предназначена для спекулятивного декодирования при работе с ZDTaichu5.0-9B через vLLM. Для запуска TaichuAI документирует специальный Docker-образ vLLM и модифицированную ветку проекта — на эти инструкции надёжнее ориентироваться, чем предполагать, что стандартная установка поведёт себя так же. 2
4
5
3
17
Прежде чем включать модель в проект, стоит проверить два момента:
--max-model-len 220000, тогда как спецификация модели обещает до 128 тыс. токенов. Настройка сервера не доказывает, что модель проверенно работает с контекстом в 220 тыс. токенов. Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
ZDTaichu5.0 9B — доступная для загрузки визуально языковая модель примерно на 9 млрд параметров, ориентированная на понимание сцен, пространственных отношений и исследования воплощённого ИИ.
ZDTaichu5.0 9B — доступная для загрузки визуально языковая модель примерно на 9 млрд параметров, ориентированная на понимание сцен, пространственных отношений и исследования воплощённого ИИ. Модель принимает текст, одно или несколько изображений и видео. TaichuAI также опубликовала варианты FP8 и NVFP4 и инструкции по запуску через специально подготовленный vLLM.
Результаты пространственных тестов опубликованы TaichuAI; их нужно перепроверять на собственных задачах.