ZDTaichu5.0 9B — открытая мультимодальная модель TaichuAI: языковой декодер Qwen3.5 9B сочетается с визуальным энкодером C RADIOv4 H. Механизм Entropy Gated Adaptive Recurrent Reasoning добавляет внутренние шаги уточнения только там, где модель оценивает предсказание как неопределённое, а не расходует дополнительные...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B — открытая мультимодальная базовая модель от TaichuAI для понимания визуальной информации, пространственного рассуждения, исследований воплощённого ИИ и агентных сценариев с инструментами. Её ключевая особенность не сводится к распознаванию содержимого картинки: модель заявлена для задач, в которых нужно учитывать смену точки обзора, взаимное расположение объектов, несколько изображений и длинные видеоматериалы. 2
В основе ZDTaichu5.0-9B — языковой декодер Qwen3.5-9B примерно на 9 млрд параметров и визуальный энкодер C-RADIOv4-H. Модель принимает текст, одно или несколько изображений, а также видео. В релизе заявлены работа с визуальными входами произвольного разрешения и контекстное окно до 128 тыс. токенов. 2
Такой набор возможностей ориентирован не только на генерацию описаний к изображениям. В карточке модели среди целевых задач указаны документы, графики, схемы, OCR — распознавание текста на изображениях, визуальные вопросы и визуальная математика. 2
TaichuAI акцентирует внимание на пространственных и «воплощённых» задачах, которые нередко оказываются сложными для универсальных vision-language-моделей. Заявленные возможности включают:
Модель также рассчитана на агентные взаимодействия. Однако планирование вызовов инструментов не означает, что она сама выполняет действия во внешних системах: запуск инструментов, проверка результатов и безопасность остаются задачей приложения-хоста. 2
Главное техническое заявление ZDTaichu5.0-9B — механизм Entropy-Gated Adaptive Recurrent Reasoning, то есть адаптивное рекуррентное рассуждение с энтропийным шлюзом. Вместо одинакового дополнительного вычисления для каждого токена система использует оценку неопределённости, чтобы решать, где требуется дополнительное уточнение во внутреннем, латентном представлении. 2
Проще говоря, на очевидных шагах модель продолжает работу обычным образом, а на сложных или неуверенных — может выполнить дополнительные внутренние шаги уточнения. Заявленная цель — увеличить эффективную вычислительную глубину на трудных этапах, не повышая одинаково вычислительные затраты для всего ответа. 2
Для пространственных вопросов это особенно важно: один неоднозначно интерпретированный поворот камеры или неверно определённая позиция предмета относительно другого может изменить итоговый ответ.
TaichuAI публикует следующие результаты тестов в материалах модели:
| Область оценки | Бенчмарк | Заявленный результат |
|---|---|---|
| Пространственные / embodied-задачи | ViewSpatial | 62,50 |
| Пространственные / embodied-задачи | MMSI-Bench | 47,20 |
| Пространственные / embodied-задачи | MindCube-tiny | 78,27 |
| Пространственные / embodied-задачи | ERQA | 48,00 |
| Пространственные / embodied-задачи | RoboSpatial | 56,00 |
| Агентные задачи / следование инструкциям | TAU2-Bench | 87,70 |
| Агентные задачи / следование инструкциям | Claw-Eval | 71,40 |
| Агентные задачи / следование инструкциям | IFEval | 93,70 |
Проект позиционирует ZDTaichu5.0-9B как лидера по пространственному и embodied-рассуждению среди сопоставляемых универсальных VLM примерно 10-миллиардного масштаба, сохраняя сильные общие визуальные возможности. 2
Это полезный ориентир для разработчиков, выбирающих компактную открытую модель под задачи с высокими требованиями к пространственному анализу. Но это не универсальный рейтинг: сравнение зависит от выбранных разработчиком версий моделей, промптов, предобработки, параметров декодирования и протокола тестирования. Чтобы считать преимущество подтверждённым, нужны независимые воспроизведения экспериментов с прозрачными деталями методики. 2
ZDTaichu5.0-9B размещена в репозитории TaichuAI на Hugging Face. Релиз обозначен как модель с пользовательским кодом и содержит ссылки на материалы по рекуррентному рассуждению и развёртыванию. 2
Для опубликованных материалов указана лицензия NVIDIA Open Model License; для компонентов Qwen3.5 приведены уведомления об Apache-2.0. Перед распространением модели или коммерческим использованием стоит самостоятельно изучить актуальные файлы лицензий и уведомления в репозитории. 2
Для инференса TaichuAI документирует собственные варианты запуска через vLLM 0.26.0 и Docker, включая разные пресеты семплирования для задач пространственной привязки и для общих задач. 2
ZDTaichu5.0-9B — открытая мультимодальная модель примерно 9-миллиардного класса с чёткой специализацией на рассуждении по изображениям, ракурсам, сценам и видео, а не только на распознавании визуального содержимого. Контекст до 128 тыс. токенов, поддержка визуальных входов произвольного разрешения и адаптивное рекуррентное рассуждение делают её заметным вариантом для исследований пространственных VLM, воплощённого ИИ и агентных систем, управляемых приложением-хостом. 2
Опубликованные результаты выглядят многообещающе, особенно в пространственных тестах. Однако пока это данные самого разработчика, а не независимо установленный сравнительный результат: для уверенных выводов необходима внешняя репликация тестов в прозрачных условиях. 2
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
ZDTaichu5.0 9B — открытая мультимодальная модель TaichuAI: языковой декодер Qwen3.5 9B сочетается с визуальным энкодером C RADIOv4 H.
ZDTaichu5.0 9B — открытая мультимодальная модель TaichuAI: языковой декодер Qwen3.5 9B сочетается с визуальным энкодером C RADIOv4 H. Механизм Entropy Gated Adaptive Recurrent Reasoning добавляет внутренние шаги уточнения только там, где модель оценивает предсказание как неопределённое, а не расходует дополнительные вычисления на каждый токен.
Веса и материалы для развёртывания опубликованы в репозитории Hugging Face; заявлены собственная сборка vLLM 0.26.0 и Docker сценарии.