ZDTaichu5.0 9B kombinuje jazykový dekodér Qwen3.5 9B s obrazovým enkodérem C RADIOv4 H a přijímá text, jeden či více obrázků i video. Mechanismus Entropy Gated Adaptive Recurrent Reasoning přidává další interní výpočet především u nejistých a obtížných tokenů.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B je otevřený multimodální základní model od TaichuAI pro obrazové porozumění, prostorové uvažování, práci nástrojově orientovaných agentů a výzkum vtělené AI — tedy systémů, které mají vnímat a plánovat jednání ve fyzickém prostředí. Jeho ambicí není jen popsat obsah snímku, ale vyhodnotit vztahy mezi objekty, změny pohledu, důkazy z více záběrů či děj ve videu. 2
Model spojuje jazykový dekodér Qwen3.5-9B s přibližně 9 miliardami parametrů a obrazový enkodér C-RADIOv4-H. Přijímá text, jednotlivé i vícenásobné obrázky a video. Podle dokumentace podporuje obrazové vstupy v libovolném rozlišení a kontextové okno až 128 tisíc tokenů. 2
Díky tomu se jeho záběr neomezuje na běžné popisování obrázků. Modelová karta jej uvádí také pro dokumenty, grafy, diagramy, OCR — tedy rozpoznávání textu z obrazu — vizuální otázky a vizuální matematiku. 2
TaichuAI zdůrazňuje zejména úlohy, které bývají pro obecné vision-language modely obtížné:
Model podporuje i interakce orientované na agenty. To ale neznamená, že by sám autonomně prováděl operace: může plánovat volání nástrojů a účastnit se vícekrokových či vícetahových pracovních postupů, avšak samotné spuštění nástroje, ověření výsledku a zabezpečení zůstávají odpovědností hostitelské aplikace. 2
Hlavním technickým tvrzením projektu je mechanismus Entropy-Gated Adaptive Recurrent Reasoning. Namísto stejného dodatečného výpočtu pro každý token má systém podle míry nejistoty rozhodovat, kde je vhodné provést další zpřesnění interní reprezentace. 2
Zjednodušeně: u přímočarých kroků model pokračuje běžně, zatímco u nejasných nebo náročných predikcí může dostat více interních iterací. Cílem je soustředit výpočetní hloubku na složité části odpovědi, aniž by se stejně zvyšovala výpočetní práce pro celý výstup. 2
To dává smysl právě u prostorových úloh: jediný nejednoznačně vyhodnocený vztah — například poloha objektu po změně úhlu kamery — může rozhodnout o správnosti celé odpovědi.
TaichuAI ve svých materiálech uvádí tyto skóre:
| Oblast hodnocení | Benchmark | Uváděné skóre |
|---|---|---|
| Prostorové / vtělené úlohy | ViewSpatial | 62,50 |
| Prostorové / vtělené úlohy | MMSI-Bench | 47,20 |
| Prostorové / vtělené úlohy | MindCube-tiny | 78,27 |
| Prostorové / vtělené úlohy | ERQA | 48,00 |
| Prostorové / vtělené úlohy | RoboSpatial | 56,00 |
| Agenti / plnění instrukcí | TAU2-Bench | 87,70 |
| Agenti / plnění instrukcí | Claw-Eval | 71,40 |
| Agenti / plnění instrukcí | IFEval | 93,70 |
Projekt model prezentuje jako špičku v prostorovém a vtěleném uvažování mezi srovnávanými univerzálními VLM zhruba v kategorii 10 miliard parametrů; zároveň má zachovávat silné obecné vizuální schopnosti. 2
Pro vývojáře vybírající kompaktní otevřený model pro prostorově náročné úlohy je to užitečný signál, nikoli však univerzální žebříček. Srovnání závisí na verzích modelů, promětech, předzpracování, parametrech dekódování i evaluačním nastavení, které zvolil vydavatel. Nezávislá reprodukce s transparentně zveřejněnými detaily je nutná, než budou výsledky považovány za ustálené srovnávací zjištění. 2
ZDTaichu5.0-9B je dostupný v repozitáři TaichuAI na platformě Hugging Face. Vydání je označeno jako model využívající vlastní kód a odkazuje na materiály k rekurentnímu uvažování a nasazení. 2
Uvedené licenční uspořádání používá pro vydané materiály modelu NVIDIA Open Model License, zatímco komponenty Qwen3.5 mají oznámení k licenci Apache-2.0. Před redistribucí nebo komerčním použitím je vhodné zkontrolovat aktuální licenční soubory a upozornění přímo v repozitáři. 2
Pro provoz TaichuAI dokumentuje vlastní cesty pro vLLM 0.26.0 a Docker, včetně odlišných předvoleb vzorkování pro úlohy s prostorovým ukotvením a pro obecné úlohy. 2
ZDTaichu5.0-9B je otevřený multimodální model o velikosti přibližně 9 miliard parametrů s jasným zaměřením: má vyvozovat závěry napříč snímky, perspektivami, scénami a videem, ne pouze rozpoznávat jejich obsah. Kontext o délce 128 tisíc tokenů, obrazové vstupy v libovolném rozlišení a adaptivní rekurentní uvažování z něj dělají zajímavou volbu pro výzkum prostorových VLM, vtělené AI a agentních workflow řízených hostitelskou aplikací. 2
Zveřejněné výsledky vypadají slibně, zejména v prostorových benchmarcích. Zatím je ale namístě chápat je jako údaje reportované vydavatelem, nikoli jako nezávisle potvrzený výkon. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B kombinuje jazykový dekodér Qwen3.5 9B s obrazovým enkodérem C RADIOv4 H a přijímá text, jeden či více obrázků i video.
ZDTaichu5.0 9B kombinuje jazykový dekodér Qwen3.5 9B s obrazovým enkodérem C RADIOv4 H a přijímá text, jeden či více obrázků i video. Mechanismus Entropy Gated Adaptive Recurrent Reasoning přidává další interní výpočet především u nejistých a obtížných tokenů.
Váhy i materiály pro nasazení jsou dostupné na Hugging Face; TaichuAI uvádí podporu vlastního vLLM 0.26.0 a Dockeru.