ZDTaichu5.0 9B łączy dekoder językowy Qwen3.5 9B z enkoderem obrazu C RADIOv4 H i przyjmuje tekst, pojedyncze lub liczne obrazy oraz wideo. Mechanizm Entropy Gated Adaptive Recurrent Reasoning ma kierować dodatkowe obliczenia do fragmentów odpowiedzi, dla których model ocenia większą niepewność.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B to otwarty multimodalny model bazowy firmy TaichuAI, przeznaczony do rozumienia obrazu, rozumowania przestrzennego, badań nad agentami korzystającymi z narzędzi oraz embodied AI — czyli systemami AI działającymi w relacji ze światem fizycznym. Jego wyróżnikiem nie jest wyłącznie interpretacja pojedynczego zdjęcia. Twórcy kierują go do zadań wymagających analizy zmian punktu widzenia, relacji między obiektami, wielu ujęć i dłuższego materiału wideo. 2
Model łączy dekoder językowy Qwen3.5-9B o skali około 9 miliardów parametrów z enkoderem obrazu C-RADIOv4-H. Obsługuje tekst, jeden lub wiele obrazów oraz wideo. Według opisu wydania przyjmuje materiały wizualne w dowolnej rozdzielczości, a okno kontekstowe ma do 128 tys. tokenów. 2
Taki zakres wejścia ma znaczenie nie tylko dla klasycznego opisywania zdjęć. Karta modelu wskazuje też analizę dokumentów, wykresów i diagramów, OCR, wizualne pytania i odpowiedzi oraz matematykę wizualną. 2
TaichuAI akcentuje zadania przestrzenne i ucieleśnione, które bywają trudne dla ogólnych modeli łączących obraz i język. Deklarowany zestaw możliwości obejmuje:
Model obsługuje także interakcje zorientowane na agentów. Nie oznacza to jednak autonomicznego wykonywania działań: może planować wywołania narzędzi i uczestniczyć w wieloetapowych lub wieloturowych przepływach pracy, ale za wykonanie, walidację i zabezpieczenie narzędzi odpowiada aplikacja hostująca. 2
Kluczową deklaracją techniczną projektu jest mechanizm Entropy-Gated Adaptive Recurrent Reasoning, czyli adaptacyjne, rekurencyjne rozumowanie sterowane entropią. Zamiast uruchamiać taki sam dodatkowy proces obliczeniowy dla każdego tokenu, system wykorzystuje ocenę niepewności, aby zdecydować, w których miejscach potrzebne jest dodatkowe dopracowanie reprezentacji w przestrzeni ukrytej. 2
W prostszym ujęciu: przy łatwiejszych krokach model może generować odpowiedź standardowo, a przy bardziej niepewnych predykcjach poświęcić więcej wewnętrznych obliczeń na jej udoskonalenie. Zamierzonym efektem jest większa efektywna głębokość obliczeń tam, gdzie problem jest trudny, bez równomiernego zwiększania kosztu całej odpowiedzi. 2
Może to być szczególnie istotne w pytaniach przestrzennych: jedna niejednoznaczna relacja — na przykład po zmianie kąta kamery albo przy określaniu położenia jednego obiektu względem drugiego — może przesądzić o poprawności wyniku.
TaichuAI podaje w materiałach modelu następujące wyniki:
| Obszar oceny | Benchmark | Zgłoszony wynik |
|---|---|---|
| Przestrzeń / embodied AI | ViewSpatial | 62,50 |
| Przestrzeń / embodied AI | MMSI-Bench | 47,20 |
| Przestrzeń / embodied AI | MindCube-tiny | 78,27 |
| Przestrzeń / embodied AI | ERQA | 48,00 |
| Przestrzeń / embodied AI | RoboSpatial | 56,00 |
| Agenci / wykonywanie instrukcji | TAU2-Bench | 87,70 |
| Agenci / wykonywanie instrukcji | Claw-Eval | 71,40 |
| Agenci / wykonywanie instrukcji | IFEval | 93,70 |
Projekt pozycjonuje model jako lidera rozumowania przestrzennego i embodied AI wśród porównywanych uniwersalnych modeli VLM o skali około 10 mld parametrów, przy zachowaniu mocnych ogólnych możliwości wizualnych. 2
To użyteczna wskazówka dla osób wybierających kompaktowy otwarty model do zadań silnie zależnych od analizy przestrzeni. Nie jest to jednak uniwersalny ranking. Porównania zależą od wybranych przez dostawcę wersji modeli, promptów, przetwarzania wstępnego, ustawień dekodowania i metodologii ewaluacji. Aby uznać te wyniki za ustalone porównanie wydajności, potrzebna jest niezależna replikacja testów z ujawnionymi szczegółami. 2
ZDTaichu5.0-9B jest dostępny w repozytorium TaichuAI na Hugging Face. Wydanie opisano jako oparte na niestandardowym kodzie i połączono z materiałami dotyczącymi rekurencyjnego rozumowania oraz wdrożenia. 2
Wskazany model licencjonowania to NVIDIA Open Model License dla udostępnionych materiałów modelu, z informacjami o licencji Apache-2.0 dla komponentów Qwen3.5. Zespoły rozważające redystrybucję lub użycie komercyjne powinny bezpośrednio sprawdzić aktualne pliki licencyjne i informacje prawne w repozytorium. 2
Na potrzeby serwowania TaichuAI dokumentuje własne ścieżki dla vLLM 0.26.0 i Dockera, w tym odrębne presety próbkowania dla zadań wymagających uziemienia przestrzennego oraz dla zadań ogólnych. 2
ZDTaichu5.0-9B to otwarty model multimodalny o skali około 9 mld parametrów, z wyraźną specjalizacją w rozumowaniu na podstawie obrazów, perspektyw, scen i wideo — a nie tylko w rozpoznawaniu zawartości wizualnej. Kontekst 128 tys. tokenów, obsługa obrazów o dowolnej rozdzielczości oraz adaptacyjne podejście do rekurencyjnego rozumowania czynią go interesującą propozycją dla badaczy i programistów pracujących nad przestrzennymi VLM, embodied AI oraz agentami zarządzanymi przez aplikację hostującą. 2
Opublikowane wyniki wyglądają obiecująco, zwłaszcza w benchmarkach przestrzennych, lecz pozostają danymi zgłoszonymi przez dostawcę. Do czasu transparentnej replikacji przez niezależne zespoły należy traktować je jako sygnał, a nie definitywnie potwierdzoną przewagę. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B łączy dekoder językowy Qwen3.5 9B z enkoderem obrazu C RADIOv4 H i przyjmuje tekst, pojedyncze lub liczne obrazy oraz wideo.
ZDTaichu5.0 9B łączy dekoder językowy Qwen3.5 9B z enkoderem obrazu C RADIOv4 H i przyjmuje tekst, pojedyncze lub liczne obrazy oraz wideo. Mechanizm Entropy Gated Adaptive Recurrent Reasoning ma kierować dodatkowe obliczenia do fragmentów odpowiedzi, dla których model ocenia większą niepewność.
Wagi i materiały wdrożeniowe są dostępne w repozytorium Hugging Face; projekt opisuje własne ścieżki serwowania z vLLM 0.26.0 i Dockerem.