| 80.6 |
| 80.2 |
| SWE-Bench Pro | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual | 78.3 | — | 76.7 |
| Terminal-Bench 2.0 | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Codeforces Rating | — | 3206 | — |
| SciCode | 53.5 | — | — |
| NL2Repo | 47.2 | — | — |
| MCP-Mark | 60.8 | — | — |
| מדד ביצועים | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| אינדקס הבינה של AA v4.0 | 56.6 (מקום 5) | 52.0 | — |
| GPQA Diamond | 92.4 | — | — |
| HLE (הבחינה האחרונה של האנושות) | 41.4 | 37.7 | 54.0 (עם כלים) |
| HMMT 2026 (מתמטיקה) | 97.1% | 95.2% | |
| AIME 2026 | — | — | 96.4% |
| IMOAnswerBench | 90.0 | 89.8 | — |
| Apex (חשיבה מתמטית) | 44.5 | — | — |
| SimpleQA Verified | — | 57.9% | — |
| Chinese SimpleQA | — | 84.4 | 75.9 |
| DeepSearchQA (F1) | — | — | 92.5 |
המחירים בטבלה משקפים את התעריפים הסטנדרטיים למיליון טוקנים. שימו לב להנחות על שמירת הקשר (cache) שיכולות להוזיל עלויות משמעותית.
| רכיב תמחור | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| קלט (ללא cache) | $2.50 | $0.435 ($1.74 טרם המבצע) | $0.95 |
| פלט | $7.50 | $0.87 ($3.48 טרם המבצע) | |
| קלט עם cache | $0.25 (הנחה של 90%) | $0.0036 (הנחה של 99%) | $0.16 (הנחה של 83%) |
| חלון הקשר | מיליון טוקנים | מיליון טוקנים | |
| מקסימום פלט | 65,536 | 384,000 | — |
| משקלים פתוחים | לא (API בלבד) | כן (Hugging Face) | כן |
הערה לגבי מחירי DeepSeek: החברה השיקה מבצע הנחה של 75% שהיה בתוקף עד סוף מאי 2026, שהפחית את מחירי ה-Pro ל-$0.435/$0.87 לקלט/פלט . על פי דיווחים, הנחה זו הפכה לקבועה . הטבלה משקפת את מחיר המבצע שהפך למחיר הרשמי.
קידוד ומשימות סוכן — שלושת הדגמים נמצאים בתחרות צמודה מאוד במדד SWE-Bench Verified (טווח של 80.2–80.6). Qwen3.7-Max מוביל ב-Terminal-Bench 2.0 (69.7) וב-SWE-Pro (60.6), מה שמעיד על יכולת מעולה בתפעול מערכות ובמשימות הנדסת תוכנה מורכבות. DeepSeek V4 Pro Max שולט ללא עוררין במשימות תכנות "נקי", עם ציון של 93.5 במדד LiveCodeBand ורייטינג של 3206 ב-Codeforces – ציוני הקידוד הגולמיים הגבוהים ביותר שנרשמו . Kimi K2.6 מוביל בקטגוריית SWE-Bench Pro (58.6) והוא המוביל בהערכה מבוססת-כלים (HLE with tools בציון 54.0), מה שהופך אותו לחזק במיוחד בתרחישים הדורשים שליפת מידע ומספר רב של פעולות .
חשיבה — Qwen3.7-Max זוכה בציונים הגבוהים ביותר בתחרויות מתמטיקה (97.1% ב-HMMT, 92.4% ב-GPQA Diamond) . DeepSeek V4 Pro Max נמצא מעט מאחור ב-HMMT (95.2%) וב-HLE (37.7%) . Kimi K2.6 מוביל במדד HLE-with-tools (54.0) וב-DeepSearchQA (92.5 F1), כלומר הוא מצטיין בתרחישים של חיפוש מעמיק ושימוש בכלים מרובי-שלבים, יותר מאשר במתמטיקה טהורה .
תמחור וערך — DeepSeek V4 Pro Max הוא הזול ביותר בפער ניכר, בעלות של $0.87 למיליון טוקני פלט (לאחר שהמבצע הפך לקבוע), ואף מציע משקלים פתוחים לאחסון עצמי . Qwen3.7-Max הוא היקר ביותר, בעלות של $7.50 למיליון טוקני פלט, אם כי עליבאבא מציעה הנחות על עיבוד באצוות ושמירת הקשר . Kimi K2.6 נמצא באמצע, בעלות של $4.00 לפלט, אך מציע חלון הקשר של 256 אלף טוקנים בלבד לעומת מיליון אצל שני המתחרים .
אזהרה חשובה (הערכת NIST CAISI): במאי 2026, המכון הלאומי לתקנים וטכנולוגיה האמריקאי (NIST) פרסם הערכה ולפיה ציוני הביצועים העצמיים של DeepSeek V4 Pro Max עשויים להציג תמונה אופטימית מדי, ורמתם דומה יותר ל-GPT-5 (מאוגוסט 2025) מאשר לדגמים החדשים ביותר . אזהרה זו אינה חלה על Qwen3.7-Max או Kimi K2.6, שלא נבחנו באותו הדו"ח.
| 92.7% |
| $4.00 |
| 256 אלף טוקנים |