| דגם | סוג טוקן | תעריף קבוע קודם | שפל (חדש) | שיא (חדש) | שינוי אפקטיבי |
|---|---|---|---|---|---|
| V4-Flash | קלט (החטאה במטמון) | 0.14$ | 0.21$ | 0.42$ | 50%+ בשפל, 200%+ בשיא |
| V4-Flash | קלט (פגיעה במטמון) | 0.0028$ | 0.007$ | 0.014$ | 150%+ בשפל, 400%+ בשיא |
| V4-Flash | פלט | 0.28$ | 0.42$ | 0.84$ | 50%+ בשפל, 200%+ בשיא |
| V4-Pro | קלט (החטאה במטמון) | 0.435$ | 0.99$ | 1.98$ | 128%+ בשפל, 355%+ בשיא |
| V4-Pro | קלט (פגיעה במטמון) | 0.003625$ | 0.03$ | 0.06$ | 728%+ בשפל, 1,555%+ בשיא |
| V4-Pro | פלט | 0.87$ | 1.98$ | 3.96$ | 128%+ בשפל, 355%+ בשיא |
העלייה הקיצונית ביותר היא בקלט V4-Pro עם פגיעה במטמון, שעלה מ-0.003625$ ל-0.06$ בשעות השיא — עלייה של כ-1,555% . DeepSeek מסרה כי השינוי נעשה כדי להקצות משאבים בצורה יעילה יותר ולעודד משתמשים לתזמן עומסי עבודה לא דחופים לחלונות השפל
.
באוגוסט 2026, חברת הבדיקות העצמאית Composio העריכה את DeepSeek V4 Flash על פני שמונה סביבות הרצת סוכן שונות ב-30 זרימות עבודה מרובות-שלבים שנבחרו בכוונה להיות קשות, תוך שימוש בכלים חיים כולל Gmail, GitHub, Slack ו-Google Sheets . לכל משימה היה פסק זמן של 900 שניות, וכל סביבות ההרצה השתמשו בכלי ה-MCP המארחים של Composio
.
התוצאה הכוללת: מתוך 240 הרצות בסך הכל, רק 129 הצליחו — שיעור מעבר כולל של 53.8%. רק 6 מתוך 30 זרימות העבודה הושלמו בהצלחה על ידי כל סביבת הרצה .
| סביבת הרצה | שיעור מעבר (מתוך 30 משימות) | עלות למשימה מוצלחת |
|---|---|---|
| Pi Agent | 20/30 (66.7%) | 0.028$ |
| Prime Agent | ~15/24 (62.5% ריצות תקפות) | 0.131$ |
| OMP (Oh My Pi) | 17/30 (56.7%) | 0.103$ |
| Claude Code | 16/30 (53.3%) | 0.195$ |
| Codex | 16/30 (53.3%) | 0.081$ |
| Deep Agents (LangChain) | 16/30 (53.3%) | 0.045$ |
| Hermes Agent | 15/30 (50.0%) | 0.056$ |
| OpenCode | 14/30 (46.7%) | 0.067$ |
Pi Agent הובילה הן בשיעור ההצלחה (20/30) והן בעלות-יעילות (0.028$ למשימה) . סביבת הרצה אחרת ניצחה בכל מדד — שיעור הצלחה, עלות ומהירות — מה שאומר שבחירת סביבת ההרצה חשובה לא פחות מיכולת המודל
. הפער של 20 הנקודות בין סביבת ההרצה הטובה והגרועה ביותר מדגים רגישות קיצונית למסגרת הסוכן, תצורת הכלי, שמירה במטמון, ניסיונות חוזרים ומחסנית הספק
.
השילוב של מחירים גבוהים יותר ותוצאות לא אחידות בעולם האמיתי עיצב מחדש את תפיסת האנליסטים לגבי התאמתה של DeepSeek V4 לארגונים.
VentureBeat ציינה שאותו דגם V4 Flash הפיק תוצאות שונות באופן מהותי בהתאם לסביבת ההרצה, ערימת הכלים והמטמון — מה שמרמז שארגונים חייבים להשקיע בבשלות תשתית לצד בחירת המודל . Composio עצמה ציינה שבחירת סביבת ההרצה בלבד שינתה את ההצלחה בשלוש משימות, את העלות בכמעט פי 3 ואת המהירות פי 2.2
.
גם בשפל, כל סוג טוקן יקר יותר מבעבר. אנליסטים אומרים שזה משנה את חישוב ההחזר על ההשקעה (ROI) עבור עומסי עבודה של סוכנים בהיקף גבוה, במיוחד עבור סוכני תמיכת לקוחות וצינורות יצירת קוד שהסתמכו בעבר על התמחור הנמוך והאגרסיבי של DeepSeek .
מבחני הסוכן הרשמיים של DeepSeek (82.7 ב-Terminal-Bench 2.1, 70.3 ב-Toolathlon-Verified) נראים חזקים, אך שיעור המעבר של 53.8% בעולם האמיתי הוא תזכורת לכך שציוני לוח תוצאות אינם מבטיחים אמינות בסביבות ייצור עם API חיים, מגבלות קצב וזרימות עבודה מצביות .
תעבורת API עוברת דרך שרתים בסין, מה שיוצר אתגרי תאימות לארגונים מפוקחים. אנליסטים ממליצים על תכנון אדריכלי זהיר הכולל ממשל נתונים, נתיבי ביקורת ובקרות הרשאות לכלים . עבור תעשיות מפוקחות, אירוח עצמי של המשקולות הפתוחות נותר הנתיב היחיד בר-הביצוע לייצור
.