| גרסה | סה"כ פרמטרים | פרמטרים פעילים | חלון הקשר | פלט מקסימלי |
|---|---|---|---|---|
| V4-Pro | 1.6 טריליון (MoE) | ~49B לטוקן | 1M טוקנים | 384K טוקנים |
| V4-Flash | 284 מיליארד (MoE) | ~13B לטוקן | 1M טוקנים | 384K טוקנים |
שתי הגרסאות הן מולטי-מודאליות (טקסט, תמונה, וידאו), תומכות בפלט JSON ובקריאות לכלים (tool calls), וזמינות דרך API ודפדפן .
| גרסה | קלט (שפל) | פלט (שפל) | פגיעת מטמון (Cache Hit) |
|---|---|---|---|
| V4-Pro | 0.435$ | 0.87$ | 90% הנחה |
| V4-Flash | 0.14$ | 0.28$ | 90% הנחה |
DeepSeek גם הפעילה מבצע 75% הנחה על V4-Pro עד תחילת מאי 2026 . לשם השוואה, תמחור הפלט של GPT-5.5 עומד על כ-30 דולר למיליון טוקנים, מה שהופך את V4-Flash לזול בערך פי 107 בפלט .
תוצאות המבחנים של DeepSeek V4 מספרות סיפור מורכב:
אזהרה חשובה מהערכת NIST CAISI (מאי 2026): מבחני הביצועים שדיווחה DeepSeek בעצמה טוענים לשוויון עם GPT-5.4 ו-Opus 4.6, אך הערכה עצמאית של CAISI מצאה ש-V4 "פחות משמעותית ביכולתה" במבחנים לא ציבוריים, מה שמרמז כי חלק מהציונים המדווחים עשויים להיות מנופחים . מדד האינטליגנציה של Artificial Analysis מדרג את GPT-5.5 (גבוה) עם 53 לעומת DeepSeek V4 Pro (Reasoning, High Effort) עם 41* – GPT-5.5 אינטליגנטי יותר ומהיר יותר (69 לעומת 56 טוקנים לשנייה), אבל DeepSeek זול באופן דרמטי (0.18$ לעומת 4.35$ למיליון טוקנים במצב Reasoning) .
צוות Qwen של אליבאבא הציג את Qwen 3.8 Max בוועידת הבינה המלאכותית העולמית בשנחאי ב-19 ביולי 2026 . זהו דגם הדגל הראשון של הצוות מעל טריליון פרמטרים.
| מאפיין | פרט |
|---|---|
| סה"כ פרמטרים | 2.4 טריליון (sparse MoE) |
| ארכיטקטורה | Mixture-of-Experts, מולטי-מודאלי (טקסט + ראייה אושרו) |
| חלון הקשר | 983,616 טוקנים בנקודת הקצה של Qwen Cloud ; מוזכר כ-~1M במקורות מסוימים |
| פלט מקסימלי | 64,000 טוקנים |
| רישיון | טרם פורסם; אליבאבא אומרת שהמודל יהיה בקוד פתוח "בקרוב" |
לא פורסם תמחור Pay-as-you-go. גישה כרגע באמצעות מנוי דרך Qwen Chat ושותפי API נבחרים. BenchLM מפרט את תמחור Qwen 3.8 Max Preview כ"לא רשום" . כלי מעקב של צד שלישי מראים תמחור אוטומטי של 1.50/5.00 דולר למיליון טוקני קלט/פלט, אך זה לא אושר על ידי אליבאבא .
אליבאבא קובעת ש-Qwen 3.8 הוא "שני רק ל-Fable 5" (מודל ה-Claude המוביל של Anthropic), מה שהיה ממקם אותו לפני GPT-5.5 ו-DeepSeek V4 בדירוג של אליבאבא עצמה . נטען כי יש שיפורים בקידוד, פרודוקטיביות מקצועית, פיתוח Full-Stack, ניתוח נתונים וזרימות עבודה משרדיות לעומת Qwen 3.7 Max .
עם זאת, לא פורסמו מבחני ביצועים עצמאיים. BenchLM, אתר מעקב מבחנים, עוקב אחר 321 מבחנים עבור Qwen 3.8 Max Preview ללא תוצאות מאומתות נכון ל-20 ביולי 2026 . כפי שניסח זאת ניתוח אחד: "Qwen 3.8 שווה בדיקה, אבל מוקדם מדי להתייחס אליו כאל תחליף יציב לייצור עבור Kimi K3, GPT-5.6 Sol, או Claude Fable 5" .
להקשר, קודמיו של Qwen היוו בסיס חזק: Qwen 3.6-Max-Preview (20 באפריל 2026) היה מודל מבוסס טקסט בלבד עם 35B סה"כ / 3B פרמטרים פעילים ו-262K הקשר, שטען למקום ראשון בשישה מבחני קידוד ואוטונומיה . Qwen 3.7-Max (מאי 2026) התרחב לחלון הקשר של 1M טוקנים עם יכולות reasoning אוטונומיות . אבל אף אחד מהם לא נחשב בדרך כלל ל-Frontier ברמה גבוהה מחוץ לקידוד אוטונומי.
אליבאבא ממקמת במפורש את Qwen 3.8 כ"שני רק ל-Fable 5" . אם טענה זו תחזיק מעמד תחת הערכה עצמאית, היא תמקם את Qwen 3.8 לפני GPT-5.5 והרבה לפני DeepSeek V4. אבל עם אפס מבחני ביצועים מאומתים, זו נותרה טענה שיווקית, לא עובדה מבוססת. Fable 5 של Anthropic נראה כמוביל החזית המוכר כיום לפי ההגדרה של אליבאבא עצמה .
התמחור האגרסיבי של DeepSeek הוביל למרוץ לתחתית בעלויות ה-API. Qwen 3.8 עדיין לא קבע מחיר, אבל Qwen 3.6 כבר תומחר באופן אגרסיבי (~1.25$/7.50$ קלט/פלט) .
רישיון MIT של DeepSeek V4 (עבור משקלים פתוחים) מאפשר גם אירוח עצמי, מה שדוחס עוד יותר את המרווחים עבור ספקיות קוד סגור . כפי שניסח זאת ניתוח אחד, התוצאה המעשית היא ש"מפתחים יכולים כעת לגשת ליכולת כמעט-חזיתית (במשימות קידוד) בשבריר מהעלות של GPT-5.5 או Claude."