DeepSeek zastąpił stały cennik modeli V4 taryfą zależną od pory dnia 17 sierpnia 2026 r. W godzinach szczytu milion tokenów wyjściowych kosztuje 9 juanów w V4 Flash i 27 juanów w V4 Pro.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek odszedł od stałego cennika API dla modeli V4. Od 17 sierpnia 2026 r., godz. 00:00 czasu pekińskiego — czyli 16 sierpnia o 16:00 UTC — obowiązuje rozliczanie w godzinach szczytu i poza nimi. Stawki poza szczytem są dokładnie o połowę niższe od stawek szczytowych, ale w wielu kategoriach nawet niższa taryfa oznacza podwyżkę względem wcześniejszego cennika. W zależności od modelu, rodzaju tokenów i pory użycia wzrost wynosi od 50% do 1100%. 1
2
Zmiana obejmuje DeepSeek-V4-Flash i DeepSeek-V4-Pro. Godziny szczytu czasu pekińskiego to:
Wszystkie pozostałe godziny są traktowane jako okres poza szczytem. O cenie pojedynczego żądania decyduje moment, w którym serwer platformy je otrzyma — a niekoniecznie chwila zakończenia generowania odpowiedzi. Deweloperzy planujący ruch muszą więc uwzględniać czas pekiński. 2
7
To nie jest zwykła, jednolita podwyżka. Ten sam model i ten sam typ żądania mogą kosztować dwa razy więcej, jeśli trafią do systemu w jednym z dwóch dziennych okien szczytu.
Poniższe kwoty podano w juanach za milion tokenów. Trafienie w cache oznacza, że wejściowy fragment promptu może zostać wykorzystany ponownie. Przy braku trafienia w cache dane są przetwarzane jako nowe i obowiązuje wyższa stawka wejściowa.
| Model i rodzaj tokenów | Poprzednia stawka | Poza szczytem | Zmiana | W szczycie | Zmiana |
|---|---|---|---|---|---|
| V4-Flash, wejście z trafieniem w cache | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash, wejście bez trafienia w cache | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash, wyjście | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro, wejście z trafieniem w cache | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1100% |
| V4-Pro, wejście bez trafienia w cache | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro, wyjście | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
W przypadku V4-Flash dokumentacja wskazuje stawki poza szczytem na poziomie ¥0,05, ¥1,50 i ¥4,50 za milion tokenów odpowiednio dla wejścia z cache, wejścia bez trafienia w cache i wyjścia. W godzinach szczytu ceny rosną do ¥0,10, ¥3 i ¥9. 2 Reuters podał, że podwyżki w całej rodzinie V4 mieszczą się w przedziale od 50% do 1100%, zależnie od modelu, kategorii tokenów i pory wykorzystania.
1
8
Ewaluacje modeli, indeksowanie dokumentów, uzupełnianie zaległości w bazach danych, generowanie danych syntetycznych i inne niepilne procesy mogą trafiać do kolejki uruchamianej poza dwoma oknami szczytu. Ponieważ taryfa poza szczytem stanowi połowę ceny szczytowej, samo przełożenie elastycznych zadań może wyraźnie ograniczyć rachunek. 2
Czas staje się tym samym nową zmienną operacyjną infrastruktury AI. Kolejka może uwzględniać zarówno termin wykonania zadania, jak i pekińskie godziny rozliczeń, a następnie opóźnić pracę bez zmiany modelu czy zmniejszania budżetu tokenów.
Obsługa klienta, asystenci programistyczni i agenci działający w czasie rzeczywistym zwykle pracują wtedy, gdy aktywni są użytkownicy. Takie systemy mogą więc częściej trafiać na stawki szczytowe. Nadal mogą jednak obniżać koszty przez ponowne wykorzystywanie promptów, projektowanie żądań sprzyjających cache, skracanie odpowiedzi i kierowanie prostszych zadań do tańszego modelu.
Szczególnie ważne jest zwiększanie odsetka trafień w pamięci podręcznej. Na obu modelach wejście z cache jest znacznie tańsze niż wejście bez trafienia — także po podwyżce. W systemach o dużym ruchu ponowne przesyłanie tych samych instrukcji, definicji narzędzi czy kontekstu dokumentów może mieć większy wpływ na koszty niż niewielkie ograniczenie liczby żądań.
Rozbudowane ślady rozumowania, raporty i duże fragmenty kodu zużywają tokeny wyjściowe. W szczycie milion takich tokenów kosztuje ¥9 w V4-Flash i ¥27 w V4-Pro. Firmy mogą ograniczać wydatki przez ustawienie limitów długości odpowiedzi, używanie Flasha przy rutynowych zadaniach i pozostawianie Pro do zastosowań, w których jego dodatkowe możliwości uzasadniają wyższą cenę. 1
2
Szczytowa stawka za wejście V4-Pro z trafieniem w cache jest dwunastokrotnie wyższa niż wcześniejsza stała cena, co oznacza największy procentowy wzrost w nowym cenniku. Kwota bezwzględna nadal jest niewielka w porównaniu z wejściem bez cache i tokenami wyjściowymi, ale zmiana ma znaczenie dla aplikacji przetwarzających bardzo duże ilości wielokrotnie buforowanych promptów. 1
19
Zmiana cennika nastąpiła niedługo po udostępnieniu produkcyjnej wersji DeepSeek-V4-Pro-0813, dostępnej pod endpointem deepseek-v4-pro w sierpniu. Według opisywanych specyfikacji jest to tekstowy model wykorzystujący architekturę mixture of experts (MoE), z około 1,6 bln parametrów łącznie i około 49 mld parametrów aktywowanych dla pojedynczego tokenu. Model ma kontekst o długości miliona tokenów i maksymalną długość generowanej odpowiedzi wynoszącą 384 tys. tokenów. 29
33
Dokumentowane limity równoległości na konto różnią się między modelami:
Żądanie zajmuje miejsce aż do zakończenia, również w przypadku odpowiedzi przesyłanej strumieniowo. 28
Połączenie cennika i limitów sugeruje podział produktów, w którym Flash lepiej nadaje się do rutynowego ruchu o dużej przepustowości, a Pro jest bardziej ograniczonym pojemnościowo wariantem do wymagającego rozumowania i pracy z dużym kontekstem. To wniosek z opublikowanych stawek i limitów, a nie bezpośrednia deklaracja dotycząca każdego zastosowania. 2
28
Ruch DeepSeek przypomina kształtowanie popytu na obliczenia GPU. Dostawcy mierzą się z większym obciążeniem w godzinach, gdy użytkownicy korzystają z aplikacji interaktywnych, podczas gdy wiele zadań wsadowych może poczekać. Wyższe ceny w szczycie i niższe poza nim mają zachęcać do rozłożenia obliczeń w ciągu doby.
Dla zespołów technicznych oznacza to zmianę sposobu optymalizacji. Kontrola kosztów nie sprowadza się już tylko do wyboru modelu i liczenia tokenów. Trzeba również ustalić:
Szerszy sygnał jest równie istotny: rynek dużych modeli odchodzi od konkurencji opartej wyłącznie na jednolitym zaniżaniu stawek. DeepSeek nadal oferuje tańszą ścieżkę dla elastycznego popytu, ale uzależnia koszt zaawansowanego wnioskowania od dostępności mocy obliczeniowej. Reuters opisał tę zmianę jako znaczącą podwyżkę różniącą się w zależności od modelu, kategorii tokenów i okresu użycia — nie jako jedną, identyczną dopłatę dla wszystkich. 1
Dla użytkowników DeepSeek V4 praktyczna lekcja jest prosta: harmonogram, cache, routing i limity długości odpowiedzi trzeba traktować jako element jednego modelu kosztowego API. Zadanie, którego nie można przełożyć w czasie, może wymagać tańszego modelu albo mniejszego budżetu tokenów. Zadanie elastyczne ma szansę zachować znacznie lepszą ekonomię, jeśli zostanie wykonane poza godzinami szczytu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek zastąpił stały cennik modeli V4 taryfą zależną od pory dnia 17 sierpnia 2026 r.
DeepSeek zastąpił stały cennik modeli V4 taryfą zależną od pory dnia 17 sierpnia 2026 r. W godzinach szczytu milion tokenów wyjściowych kosztuje 9 juanów w V4 Flash i 27 juanów w V4 Pro.
Planowanie zadań, wykorzystanie cache, wybór modelu i kontrolowanie długości odpowiedzi stały się teraz jednym problemem optymalizacji kosztów.