ZDTaichu5.0 9B הוא מודל שפה ראייה פתוח של TaichuAI, המבוסס על מפענח השפה Qwen3.5 9B ומקודד הראייה C RADIOv4 H. הוא מקבל טקסט, תמונה אחת או כמה תמונות, וכן וידאו; לפי חומרי הפרויקט הוא תומך בתמונות בכל רזולוציה ובחלון הקשר של עד 128 אלף טוקנים.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TaichuAI’s open-sourced ZDTaichu5.0-9B multimodal model, including its approximately 9-billion-parameter Qwen3.5-9B and C-RADIOv4-H. Article summary: ZDTaichu5.0-9B is TaichuAI’s open multimodal vision-language model for general visual understanding, spatial/embodied reasoning, and agentic tool-use research. It combines a roughly 9B-parameter Qwen3.5-9B language decod. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ZDTaichu5.0-9B הוא מודל יסוד מולטימודלי פתוח של TaichuAI, שנבנה לא רק כדי לזהות מה מופיע בתמונה, אלא גם כדי להבין יחסים במרחב: מאיזה כיוון מסתכלים, מה נמצא לפני או מאחורי מה, כיצד סצנה משתנה בין זוויות צילום, ואיך לחבר מידע מכמה תמונות או מקטעי וידאו. הייעוד המוצהר שלו כולל הבנה חזותית כללית, הסקה מרחבית, שימוש בכלים בידי סוכנים ומחקר ב-AI גופני (Embodied AI). 2
המודל משלב מפענח שפה Qwen3.5-9B בקנה מידה של כ-9 מיליארד פרמטרים עם מקודד ראייה C-RADIOv4-H. הוא מקבל טקסט, תמונה בודדת או כמה תמונות, וכן וידאו. לפי כרטיס המודל, הוא תומך בקלט חזותי בכל רזולוציה ובחלון הקשר של עד 128 אלף טוקנים. 2
הטווח הזה רלוונטי למשימות רחבות יותר מכיתוב תמונות: מסמכים, תרשימים, גרפים, OCR — זיהוי טקסט מתוך תמונה — שאלות על תמונות ומתמטיקה חזותית. 2
TaichuAI מדגישה יכולות שמאתגרות לא פעם מודלי ראייה-שפה כלליים:
המודל תומך גם באינטראקציות מוכוונות־סוכן ובתכנון קריאות לכלים. עם זאת, אין פירוש הדבר שהוא מבצע פעולות באופן אוטונומי: היישום המארח הוא שאחראי בפועל להפעיל כלים, לאמת את התוצאות ולאבטח את הגישה אליהם. 2
החידוש הטכני המרכזי שמציגה TaichuAI נקרא Entropy-Gated Adaptive Recurrent Reasoning — הסקה חוזרת מסתגלת המווסתת לפי אנטרופיה. הרעיון הוא לא להוסיף אותו עומק חישובי לכל טוקן שמופק, אלא להעריך היכן התחזית פחות ודאית ולהקצות שם שלבי עידון נוספים במרחב הלטנטי. 2
במילים פשוטות: אם שלב מסוים קל וברור, המודל ממשיך כרגיל. אם הוא נתקל בשלב מורכב — למשל שינוי זווית מצלמה או קביעה של מיקום יחסי בין שני עצמים — הוא יכול לבצע עידון פנימי נוסף לפני שימשיך בפלט. המטרה היא לרכז משאבי חישוב בנקודות הקשות, בלי להגדיל באופן אחיד את העלות של כל התשובה. 2
אלה הציונים ש-TaichuAI מפרסמת בחומרי המודל שלה:
| תחום הערכה | מדד | ציון מדווח |
|---|---|---|
| מרחבי / גופני | ViewSpatial | 62.50 |
| מרחבי / גופני | MMSI-Bench | 47.20 |
| מרחבי / גופני | MindCube-tiny | 78.27 |
| מרחבי / גופני | ERQA | 48.00 |
| מרחבי / גופני | RoboSpatial | 56.00 |
| סוכנים / ציות להוראות | TAU2-Bench | 87.70 |
| סוכנים / ציות להוראות | Claw-Eval | 71.40 |
| סוכנים / ציות להוראות | IFEval | 93.70 |
הפרויקט ממקם את המודל כמוביל ביכולות מרחביות וגופניות בקרב מודלי ראייה-שפה כלליים בסדר גודל של כ-10 מיליארד פרמטרים שנכללו בהשוואותיו. 2
חשוב לסייג: אלה תוצאות ודירוגים שדווחו בידי ספק המודל. הם עשויים להיות אינדיקציה שימושית למי שמחפש מודל פתוח וקומפקטי לעומסי עבודה מרחביים, אך אינם דירוג אוניברסלי. ההשוואה תלויה בגרסאות המודלים, בפרומפטים, בעיבוד המקדים, בהגדרות הפענוח ובמתודולוגיית ההערכה שנבחרו. נדרש שחזור בלתי תלוי עם פרטים שקופים כדי לקבוע ביצועים השוואתיים מבוססים. 2
ZDTaichu5.0-9B זמין במאגר Hugging Face של TaichuAI. ההפצה מוגדרת כמבוססת קוד מותאם אישית ומפנה לחומרי פרויקט הנוגעים להסקה החוזרת ולהטמעה. 2
הסדר הרישוי המצוין הוא NVIDIA Open Model License עבור חומרי המודל שהופצו, לצד הודעות רישיון Apache-2.0 לרכיבי Qwen3.5. צוותים שמתכננים הפצה מחדש או שימוש מסחרי צריכים לבדוק ישירות את קובצי הרישיון וההודעות העדכניים במאגר. 2
לצורכי הגשה (serving), TaichuAI מתעדת מסלולים עבור vLLM 0.26.0 מותאם אישית ועבור Docker, כולל הגדרות דגימה נפרדות למשימות עיגון מרחבי ולמשימות כלליות. 2
ZDTaichu5.0-9B הוא מודל מולטימודלי פתוח בקנה מידה של כ-9 מיליארד פרמטרים, עם התמחות ברורה בהסקה על פני תמונות, זוויות צילום, סצנות ווידאו — ולא רק בזיהוי תוכן חזותי. חלון ההקשר של 128 אלף טוקנים, התמיכה בקלט חזותי בכל רזולוציה ומנגנון ההסקה המסתגל הופכים אותו לאפשרות מעניינת למחקר ולפיתוח בתחומי מודלי ראייה-שפה מרחביים, AI גופני ותהליכי סוכנים המנוהלים בידי יישום מארח. 2
התוצאות שפורסמו מבטיחות, בעיקר במדדים מרחביים, אך נכון להתייחס אליהן כאל ראיות שמקורן בספק המודל — ולא כהוכחת ביצועים עצמאית — עד לשחזור של הבדיקות בידי גורמים חיצוניים ובתנאים שקופים. 2
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZDTaichu5.0 9B הוא מודל שפה ראייה פתוח של TaichuAI, המבוסס על מפענח השפה Qwen3.5 9B ומקודד הראייה C RADIOv4 H.
ZDTaichu5.0 9B הוא מודל שפה ראייה פתוח של TaichuAI, המבוסס על מפענח השפה Qwen3.5 9B ומקודד הראייה C RADIOv4 H. הוא מקבל טקסט, תמונה אחת או כמה תמונות, וכן וידאו; לפי חומרי הפרויקט הוא תומך בתמונות בכל רזולוציה ובחלון הקשר של עד 128 אלף טוקנים.
מנגנון ההסקה שלו מוסיף עידון פנימי חוזר לצעדים לא ודאיים, במקום להחיל על כל טוקן אותה תוספת חישוב.