17 серпня 2026 року DeepSeek перевів V4 Flash і V4 Pro на тарифікацію за часом використання: непікові ставки вдвічі нижчі за пікові. Пікові періоди тривають щодня з 09:00 до 12:00 та з 14:00 до 18:00 за пекінським часом; у години піку вихідні токени коштують ¥9 за мільйон для Flash і ¥27 для Pro.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek відмовився від єдиного тарифу для API-моделей V4 та запровадив розподіл на пікові й непікові години. Нові правила набули чинності о 00:00 17 серпня 2026 року за пекінським часом — це 16:00 16 серпня за UTC. У непіковий період запити коштують рівно вдвічі дешевше, ніж у піковий. Водночас, залежно від моделі, типу токенів і часу використання, нові ставки виявилися на 50–1 100% вищими за попередні фіксовані ціни. 1
2
Новий розклад діє для DeepSeek-V4-Flash і DeepSeek-V4-Pro.
Пікові години за пекінським часом:
Увесь інший час вважається непіковим. Для окремого запиту тариф визначається моментом, коли сервер платформи його отримав, а не часом завершення обробки. Тому під час автоматичного планування навантаження розробникам потрібно враховувати саме пекінський час. 2
7
Це не просто рівномірне підвищення цін. Одна й та сама модельна операція тепер може коштувати вдвічі дорожче залежно від того, чи припала вона на один із двох пікових інтервалів.
Нижче наведено суми в юанях за 1 мільйон токенів. Cache hit означає, що вхідна частина запиту використала раніше кешований префікс промпту. Cache miss — що вхідні дані обробляються за вищою ставкою без використання кешу.
| Модель і тип токенів | Попередня фіксована ціна | Непіковий період | Зміна | Піковий період | Зміна |
|---|---|---|---|---|---|
| V4-Flash, вхід із cache hit | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash, вхід із cache miss | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash, вихід | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro, вхід із cache hit | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1 100% |
| V4-Pro, вхід із cache miss | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro, вихід | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
Для V4-Flash документація окремо підтверджує непікові ставки ¥0,05, ¥1,50 і ¥4,50 за кешований вхід, некешований вхід і вихід відповідно. У пікові години вони зростають до ¥0,10, ¥3 і ¥9. 2 Reuters повідомляє, що загалом підвищення для моделей і категорій токенів становить від 50% до 1 100%.
1
8
Оцінювання моделей, індексацію документів, повторне опрацювання даних, генерацію синтетичних наборів і невідкладні агентні сценарії можна поставити в чергу на непікові години. Оскільки непікова ставка становить половину пікової, саме планування може помітно зменшити витрати на завдання, які не потребують миттєвої відповіді. 2
Так часовий пояс стає новою змінною в роботі AI-інфраструктури. Планувальник може враховувати дедлайн і пекінське тарифне вікно, відкладаючи виконання без зміни моделі чи скорочення бюджету токенів.
Чат підтримки клієнтів, помічники для програмування та агенти реального часу працюють тоді, коли активні користувачі. Вони не завжди можуть уникнути пікових ставок, але здатні скоротити витрати завдяки повторному використанню промптів, кешуванню, коротшим відповідям і маршрутизації запитів між моделями.
Кешування особливо важливе, оскільки кешований вхід залишається значно дешевшим за некешований і у Flash, і в Pro. Для систем, які знову й знову надсилають однакові інструкції, описи інструментів або контекст документів, підвищення частки cache hit може дати більший ефект, ніж невелике скорочення кількості запитів.
Довгі міркування, розгорнуті звіти та великі фрагменти коду споживають вихідні токени. У пікові години вони коштують ¥9 за мільйон токенів у Flash і ¥27 у Pro. Розробникам доведеться уважніше встановлювати ліміти відповіді, використовувати Flash для стандартних запитів і залишати Pro для завдань, де його додаткові можливості виправдовують вищу ціну. 1
2
Пікова ціна кешованого входу V4-Pro у 12 разів перевищує попередню фіксовану ставку — це найбільше процентне зростання в новому розкладі. В абсолютному вираженні ціна все ще невелика порівняно з некешованим входом і виходом, однак зміна буде відчутною для систем із дуже великим обсягом повторюваних кешованих промптів. 1
19
Зміна тарифів відбулася після загальної доступності DeepSeek-V4-Pro-0813, яка працює через endpoint deepseek-v4-pro. За опублікованими характеристиками, це текстова модель із контекстним вікном на 1 мільйон токенів, максимальною довжиною відповіді 384 000 токенів і архітектурою mixture of experts із приблизно 1,6 трлн загальних параметрів та 49 млрд активних параметрів на токен. 29
33
Документовані обмеження одночасності для облікового запису також відрізняються:
Запит займає слот до завершення, зокрема під час потокової передачі відповіді. 28
Разом ціни та ліміти вказують на поділ продуктів: Flash краще підходить для стандартного навантаження з великою кількістю запитів, тоді як Pro позиціонується як обмеженіший за доступною місткістю рівень для складного міркування та роботи з великим контекстом. Це висновок із опублікованої економіки й лімітів, а не пряма заява DeepSeek щодо кожного сценарію використання. 2
28
Перехід DeepSeek нагадує керування попитом на GPU-інференс. Провайдери стикаються з найбільшим навантаженням у години, коли онлайн перебуває найбільше користувачів, тоді як фонові завдання часто можуть зачекати. Вища ціна в періоди дефіциту потужностей і нижча — в інший час створюють стимул розподіляти обчислення рівномірніше протягом доби.
Для розробників це змінює сам підхід до оптимізації. Тепер важливо не лише вибрати модель і порахувати токени, а й визначити:
Ширший наслідок — відхід від конкуренції лише за найнижчою фіксованою ціною до тарифікації, що враховує дефіцит обчислювальної потужності. DeepSeek і надалі залишає дешевший канал для гнучкого попиту, але робить вартість потужного інференсу залежнішою від часу його використання. Reuters описав це як суттєве підвищення, що різниться за моделлю, типом токенів і періодом роботи, а не як єдину надбавку для всіх запитів. 1
Практичний висновок для команд, які використовують DeepSeek V4, простий: планування, кешування, маршрутизація та контроль довжини відповіді мають стати частиною моделі витрат на API. Запит, який не можна перенести в часі, можливо, потребуватиме іншої моделі або жорсткішого ліміту токенів. А завдання, яке може зачекати, здатне зберегти значну частину економії завдяки запуску в непіковий період.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
17 серпня 2026 року DeepSeek перевів V4 Flash і V4 Pro на тарифікацію за часом використання: непікові ставки вдвічі нижчі за пікові.
17 серпня 2026 року DeepSeek перевів V4 Flash і V4 Pro на тарифікацію за часом використання: непікові ставки вдвічі нижчі за пікові. Пікові періоди тривають щодня з 09:00 до 12:00 та з 14:00 до 18:00 за пекінським часом; у години піку вихідні токени коштують ¥9 за мільйон для Flash і ¥27 для Pro.
Планування фонових завдань, кешування промптів, вибір між Flash і Pro та обмеження довжини відповіді тепер безпосередньо впливають на рахунок за API.