ZDTaichu5.0 9B, yaklaşık 9 milyar parametreli Qwen3.5 9B dil çözücüsünü C RADIOv4 H görsel kodlayıcıyla birleştiren açık bir görüntü dil modelidir. Model; metin, tekli ya da çoklu görüntü ve videoyu destekliyor; herhangi bir çözünürlükte görsel girdi ile 128 bin token’a kadar bağlam penceresi sunuyor.
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B, TaichuAI’nin açık kaynaklı çok modlu temel modeli. Model; genel görsel anlama, uzamsal akıl yürütme, ajan odaklı araç kullanımı ve bedenlenmiş yapay zekâ araştırmaları için konumlandırılıyor. Onu sıradan bir görüntü açıklama modelinden ayıran nokta, kamera açısı değişimlerini, nesnelerin birbirine göre konumunu, birden çok görüntüden gelen kanıtları ve uzun videolardaki ayrıntıları değerlendirmeye özellikle odaklanması. 2
Model, yaklaşık 9 milyar parametreli Qwen3.5-9B dil çözücüsü ile C-RADIOv4-H görsel kodlayıcıyı bir araya getiriyor. Metin, tekli veya çoklu görüntü ve video girdilerini kabul ediyor. Yayın notlarına göre herhangi bir çözünürlükte görsel girdi ve 128 bin token’a kadar bağlam penceresi destekleniyor. 2
Bu kapsam, modeli yalnızca görüntü altyazısı üretimi için değil; belge, grafik, diyagram, OCR (optik karakter tanıma), görsel soru-cevap ve görsel matematik gibi işler için de uygun hâle getirmeyi amaçlıyor. 2
TaichuAI, genel amaçlı görüntü-dil modelleri için zorlayıcı olabilen uzamsal ve bedenlenmiş görevleri öne çıkarıyor. Açıklanan yetenekler arasında şunlar bulunuyor:
Model aynı zamanda ajan odaklı etkileşimleri de destekliyor. Ancak bu, aracın kendi başına işlem yürüttüğü anlamına gelmiyor: Model araç çağrılarını planlayabilir ve çok adımlı ya da çok turlu iş akışlarına katılabilir; araçları çalıştırmak, sonuçlarını doğrulamak ve güvenliğini sağlamak ise barındıran uygulamanın sorumluluğunda kalır. 2
ZDTaichu5.0-9B’nin temel teknik iddiası, Entropy-Gated Adaptive Recurrent Reasoning adlı yaklaşım. Sistem, her token’a aynı miktarda ek akıl yürütme hesabı uygulamak yerine belirsizlik düzeyini kullanarak hangi noktalarda gizil uzayda ek iyileştirme gerektiğine karar veriyor. 2
Basitçe ifade etmek gerekirse, model kolay adımlarda normal biçimde ilerlerken belirsiz veya zor tahminlerde ek içsel iyileştirme uygulayabiliyor. Amaç, yanıtın tamamında hesaplama maliyetini eşit biçimde artırmadan zor akıl yürütme adımlarında daha fazla etkili hesaplama derinliği sağlamak. 2
Bu yaklaşım özellikle uzamsal sorularda önem taşıyor: Değişen kamera açısı veya iki nesnenin göreli konumu gibi tek bir belirsiz ilişki, nihai yanıtın doğru olup olmadığını belirleyebilir.
TaichuAI’nin model materyallerinde paylaştığı sonuçlar şöyle:
| Değerlendirme alanı | Benchmark | Açıklanan skor |
|---|---|---|
| Uzamsal / bedenlenmiş | ViewSpatial | 62,50 |
| Uzamsal / bedenlenmiş | MMSI-Bench | 47,20 |
| Uzamsal / bedenlenmiş | MindCube-tiny | 78,27 |
| Uzamsal / bedenlenmiş | ERQA | 48,00 |
| Uzamsal / bedenlenmiş | RoboSpatial | 56,00 |
| Ajan / yönerge takibi | TAU2-Bench | 87,70 |
| Ajan / yönerge takibi | Claw-Eval | 71,40 |
| Ajan / yönerge takibi | IFEval | 93,70 |
Proje, modeli kendi karşılaştırmalarına dâhil edilen yaklaşık 10 milyar parametre ölçeğindeki genel amaçlı görüntü-dil modelleri arasında uzamsal ve bedenlenmiş akıl yürütmede lider olarak konumlandırıyor; bunun yanında genel görsel yeteneklerinin de güçlü kaldığını savunuyor. 2
Bu veriler, uzamsal açıdan zorlayıcı işler için görece kompakt ve açık bir model arayan geliştiriciler açısından yararlı bir sinyal olabilir. Ancak evrensel bir sıralama olarak görülmemeli. Karşılaştırmalar; yayıncının seçtiği model sürümlerine, istemlere, ön işlemeye, kod çözme ayarlarına ve değerlendirme düzenine bağlı. Sonuçların yerleşik karşılaştırmalı performans olarak kabul edilebilmesi için, bu ayrıntılarla yapılacak bağımsız tekrar testlerine ihtiyaç var. 2
ZDTaichu5.0-9B, TaichuAI’nin Hugging Face deposu üzerinden erişilebilir durumda. Yayın, modelin özel kod kullandığını ve özyinelemeli akıl yürütme ile dağıtıma ilişkin proje materyallerine bağlantı verdiğini belirtiyor. 2
Açıklanan lisans düzeninde yayımlanan model materyalleri için NVIDIA Open Model License, Qwen3.5 bileşenleri için ise Apache-2.0 bildirimleri yer alıyor. Yeniden dağıtım veya ticari kullanım düşünen ekiplerin, depodaki güncel lisans dosyalarını ve bildirimleri doğrudan incelemesi gerekiyor. 2
Sunum tarafında TaichuAI; uzamsal referanslama iş yükleri ile genel görevler için farklı örnekleme hazır ayarları içeren özel vLLM 0.26.0 ve Docker yöntemlerini belgeliyor. 2
ZDTaichu5.0-9B, görsel içeriği tanımanın ötesinde görüntüler, bakış açıları, sahneler ve videolar arasında ilişki kurmaya odaklanan, yaklaşık 9 milyar parametreli açık bir çok modlu model. 128 bin token’lık bağlamı, her çözünürlükte görsel girdi desteği ve uyarlamalı özyinelemeli akıl yürütme yaklaşımı; uzamsal görüntü-dil modelleri, bedenlenmiş yapay zekâ ve uygulama tarafından yönetilen ajan iş akışlarıyla çalışan araştırmacı ve geliştiriciler için onu dikkate değer bir seçenek hâline getiriyor. 2
Özellikle uzamsal benchmark’lardaki yayımlanmış sonuçlar umut verici görünse de bunlar bağımsız biçimde doğrulanmış performans değil, üreticinin bildirdiği veriler olarak değerlendirilmelidir. Şeffaf koşullarda üçüncü taraf tekrar testleri yapılana kadar bu ayrımı korumak gerekir. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B, yaklaşık 9 milyar parametreli Qwen3.5 9B dil çözücüsünü C RADIOv4 H görsel kodlayıcıyla birleştiren açık bir görüntü dil modelidir.
ZDTaichu5.0 9B, yaklaşık 9 milyar parametreli Qwen3.5 9B dil çözücüsünü C RADIOv4 H görsel kodlayıcıyla birleştiren açık bir görüntü dil modelidir. Model; metin, tekli ya da çoklu görüntü ve videoyu destekliyor; herhangi bir çözünürlükte görsel girdi ile 128 bin token’a kadar bağlam penceresi sunuyor.
Entropi kapılı uyarlamalı özyinelemeli akıl yürütme yaklaşımı, tüm token’lara eşit ek hesaplama uygulamak yerine belirsiz adımlarda gizil uzayda ek iyileştirme yapmayı amaçlıyor.