ב־17 באוגוסט 2026 עברה DeepSeek לתמחור לפי שעות עבור V4 Flash ו־V4 Pro: תעריפי השפל הם מחצית מתעריפי השיא. שעות השיא הן 09:00–12:00 ו־14:00–18:00 לפי שעון בייג׳ינג; בשיא, פלט עולה ¥9 למיליון טוקנים ב־V4 Flash ו־¥27 ב־V4 Pro.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek החליפה את תמחור ה־API האחיד של דגמי V4 בתמחור לפי עומס ושעת שימוש. השינוי נכנס לתוקף ב־00:00 לפי שעון בייג׳ינג ב־17 באוגוסט 2026 — 16:00 UTC ב־16 באוגוסט. מעתה, התעריף בשעות השפל הוא בדיוק מחצית מהתעריף בשעות השיא, אך התעריפים החדשים עצמם גבוהים מהמחירים הקודמים בשיעור שנע בין 50% ל־1,100%, בהתאם לדגם, לסוג הטוקנים ולשעת השליחה. 1
2
המדיניות חלה על DeepSeek-V4-Flash ועל DeepSeek-V4-Pro.
שעות השיא היומיות הן:
כל יתר השעות נחשבות לשעות שפל. החיוב עבור בקשה נקבע לפי הזמן שבו שרתי הפלטפורמה קיבלו אותה — ולא בהכרח לפי הזמן שבו הסתיים העיבוד. לכן, מערכות שמנהלות תורים או תזמון עומסים צריכות להביא בחשבון את שעון בייג׳ינג. 2
7
במילים פשוטות: אותה בקשה בדיוק עשויה לעלות פי שניים, רק משום שנשלחה במהלך אחד משני חלונות השיא.
המחירים להלן נקובים ביואן סיני למיליון טוקנים. פגיעה במטמון (cache hit) פירושה שחלק מקלט הפרומפט כבר נשמר וניתן לעשות בו שימוש חוזר. החמצת מטמון (cache miss) פירושה שהקלט מעובד מחדש בתעריף הגבוה יותר.
| דגם וסוג טוקנים | התעריף הקודם | שעות שפל | שינוי לעומת הקודם | שעות שיא | שינוי לעומת הקודם |
|---|---|---|---|---|---|
| V4-Flash, קלט עם פגיעה במטמון | ¥0.02 | ¥0.05 | +150% | ¥0.10 | +400% |
| V4-Flash, קלט ללא פגיעה במטמון | ¥1.00 | ¥1.50 | +50% | ¥3.00 | +200% |
| V4-Flash, פלט | ¥2.00 | ¥4.50 | +125% | ¥9.00 | +350% |
| V4-Pro, קלט עם פגיעה במטמון | ¥0.025 | ¥0.15 | +500% | ¥0.30 | +1,100% |
| V4-Pro, קלט ללא פגיעה במטמון | ¥3.00 | ¥4.50 | +50% | ¥9.00 | +200% |
| V4-Pro, פלט | ¥6.00 | ¥13.50 | +125% | ¥27.00 | +350% |
ב־V4-Pro, מחיר קלט שנמצא במטמון בשעות השיא גבוה פי 12 מהתעריף האחיד הקודם — העלייה האחוזית החדה ביותר בטבלה. עם זאת, העלות המוחלטת של קלט כזה עדיין נמוכה יחסית למחיר קלט שלא נמצא במטמון או למחיר הפלט. 1
19
הרצות הערכה, אינדוקס של מסמכים, עיבוד מאוחר של נתונים, יצירת נתונים סינתטיים ומשימות אוטומטיות שאינן דחופות יכולות להיכנס לתור לשעות השפל. מכיוון שהתעריף בשעות אלה הוא מחצית מתעריף השיא, תזמון נכון עשוי להפחית משמעותית את עלות העבודות שניתן לדחות. 2
כך אזור הזמן הופך למשתנה תפעולי חדש בתשתיות AI. מערכת תורים שמכירה גם את הדדליין וגם את חלונות החיוב לפי שעון בייג׳ינג יכולה לדחות משימה בלי להחליף מודל ובלי לקצץ בתקציב הטוקנים.
שירותי תמיכה, עוזרי תכנות וסוכנים בזמן אמת פועלים בדרך כלל כשהמשתמשים פעילים. עבורם קשה יותר להימנע משעות השיא. עם זאת, עדיין אפשר לצמצם עלויות באמצעות שימוש חוזר בפרומפטים, תכנון בקשות שמגדיל את שיעור הפגיעות במטמון, קיצור תשובות וניתוב משימות בין המודלים.
למטמון יש חשיבות מיוחדת: קלט שנמצא במטמון זול בהרבה מקלט שמוחמץ בשני הדגמים. במערכות בהיקף גדול ששולחות שוב ושוב את אותן הוראות, הגדרות כלים או הקשר ממסמכים, שיפור שיעור הפגיעות במטמון עשוי להיות יעיל יותר מצמצום קטן במספר הבקשות.
שרשראות חשיבה ארוכות, דוחות מפורטים ותשובות קוד גדולות צורכים טוקני פלט. בשעות השיא, מיליון טוקני פלט עולים ¥9 ב־Flash ו־¥27 ב־Pro. מפתחים יכולים להגביל את אורך הפלט, להשתמש ב־Flash עבור פניות שגרתיות ולשמור את Pro למשימות שבהן היכולת הנוספת מצדיקה את הפרמיה. 1
2
השינוי במחירים הגיע זמן קצר לאחר שהגרסה DeepSeek-V4-Pro-0813 הפכה לזמינה באופן כללי מאחורי נקודת הקצה deepseek-v4-pro. לפי המפרטים שפורסמו, מדובר במודל טקסט עם חלון הקשר של מיליון טוקנים, יכולת להפיק עד 384,000 טוקנים וארכיטקטורת Mixture of Experts עם כ־1.6 טריליון פרמטרים בסך הכול וכ־49 מיליארד פרמטרים פעילים בכל טוקן. 29
33
DeepSeek מפרסמת גם מגבלות מקבילות שונות לשני הדגמים:
בקשה תופסת מקום במכסה עד להשלמת התשובה, כולל במקרה של תשובה מוזרמת. 28
יחד, מבנה המחירים ומגבלות הקיבולת מצביעים על חלוקת תפקידים ברורה: Flash מתאים יותר לתעבורה שגרתית בהיקף גבוה, ואילו Pro ממוקם כשכבה מוגבלת ויקרה יותר למשימות מורכבות, חשיבה מאומצת והקשר רחב. זו מסקנה הנובעת מהמחירים ומהמגבלות שפורסמו — לא הצהרה ישירה של DeepSeek לגבי כל שימוש אפשרי. 2
28
המהלך דומה לניהול ביקושים עבור חישובי הסקה על גבי GPU. הביקוש מרוכז בשעות שבהן משתמשים אינטראקטיביים מחוברים, בעוד שמשימות אצווה יכולות לעיתים להמתין. תעריף גבוה יותר בשעות העומס ותעריף נמוך יותר בשאר היום יוצרים תמריץ לפזר את החישובים לאורך היממה.
עבור מפתחים, המשמעות היא שניהול עלויות כבר אינו מסתכם רק בבחירת מודל ובספירת טוקנים. צוותי פיתוח צריכים להחליט גם:
בהקשר הרחב יותר של מלחמת המחירים בין מודלי שפה גדולים, מדובר במעבר מתחרות המבוססת על תעריף אחיד ונמוך לתמחור שמביא בחשבון את המחסור בקיבולת. DeepSeek עדיין מציעה מסלול זול יותר לביקוש גמיש, אך הופכת את עלות ההסקה המתקדמת לרגישה יותר לשעת השימוש. רויטרס תיארה את המהלך כהתייקרות משמעותית המשתנה לפי דגם, סוג טוקנים ותקופת שימוש — ולא כהיטל אחיד על כל השירותים. 1
כדאי להתייחס לתזמון, למטמון, לניתוב בין מודלים ולשליטה באורך הפלט כחלק מאותו מודל עלויות. עבודה שאי אפשר להזיז בזמן עשויה להצדיק מעבר למודל אחר או תקציב טוקנים מצומצם יותר. לעומת זאת, עבודה שיכולה להמתין עשויה לשמור על כלכליות טובה בהרבה אם תרוץ בשעות השפל.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ב־17 באוגוסט 2026 עברה DeepSeek לתמחור לפי שעות עבור V4 Flash ו־V4 Pro: תעריפי השפל הם מחצית מתעריפי השיא.
ב־17 באוגוסט 2026 עברה DeepSeek לתמחור לפי שעות עבור V4 Flash ו־V4 Pro: תעריפי השפל הם מחצית מתעריפי השיא. שעות השיא הן 09:00–12:00 ו־14:00–18:00 לפי שעון בייג׳ינג; בשיא, פלט עולה ¥9 למיליון טוקנים ב־V4 Flash ו־¥27 ב־V4 Pro.
תזמון משימות, שימוש חוזר בפרומפטים, שמירה על מטמון ובחירת המודל הופכים יחד לחלק מרכזי מניהול עלויות ה־API.