DeepSeek deklaruje duży skok wyników V4 Pro 0813: Terminal Bench 2.1 wzrósł z 72,1 do 87,9, CyberGym z 52,7 do 83,3, a DeepSWE z 12,8 do 62,7. Otwarty, objęty licencją MIT runtime Harness przenosi DeepSeek poza rynek samych API i w stronę narzędzi konkurujących z Claude Code oraz Codex.
Research answer

Create a landscape editorial hero image for this Studio Global article: What does DeepSeek’s move to general availability for its 1.6-trillion-parameter V4 Pro 0813 flagship model—released through the app’s Exper. Article summary: DeepSeek’s GA release appears to be a strategic pivot from a low-cost model vendor toward an integrated agent platform: a stronger flagship model, an open developer runtime, demand-shaping pricing, and capital-intensive . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek V4 Pro 0813 nie wygląda już jak kolejna premiera taniego modelu językowego. Wraz z wersją ogólnodostępną firma pokazała mocniejszy model flagowy, otwarte środowisko uruchomieniowe dla agentów, cennik zależny od popytu oraz plan rozbudowy infrastruktury na dużą skalę.
Najważniejsze zastrzeżenie pozostaje bez zmian: najbardziej efektowne wyniki wydajności są deklaracjami DeepSeek. Nie ma podstaw, by uznać, że model definitywnie pokonał konkurentów. Jest natomiast wyraźny sygnał, że firma chce rywalizować na całym rynku agentów — od modelu, przez narzędzia deweloperskie, aż po moc obliczeniową.
Według opublikowanej przez DeepSeek tabeli porównawczej wersja V4 Pro 0813 wyraźnie poprawiła wyniki względem kwietniowej wersji preview:
Dane pochodzą z tabeli opublikowanej przez DeepSeek i zostały przytoczone w materiałach dotyczących premiery. W benchmarku Terminal-Bench 2.1 wynik 87,9 jest zaledwie o 0,1 punktu niższy od rezultatu 88,0 przypisanego Anthropic Fable 5 w tym samym zestawieniu.
Jeśli wyniki się potwierdzą, V4 Pro 0813 plasuje się blisko ścisłej czołówki w zadaniach typowych dla agentów programistycznych: poruszaniu się po repozytoriach, korzystaniu z narzędzi, uruchamianiu poleceń i wykonywaniu wieloetapowych prac nad oprogramowaniem.
Trzeba jednak zachować proporcje. Są to wyniki raportowane przez dostawcę, a dostępne informacje nie dowodzą, że zostały niezależnie odtworzone w tym samym środowisku testowym co rezultaty konkurencji. Duży skok w DeepSWE jest interesujący, ale sam w sobie nie oznacza jeszcze takiej samej niezawodności w realnych projektach.
Strategicznie jeszcze istotniejsze może okazać się DeepSeek Harness — otwarty runtime dla agentów, wydany na licencji MIT. Tego typu środowisko działa pomiędzy modelem językowym a komputerem użytkownika. Koordynuje narzędzia, pliki, polecenia, sesje i wieloetapowe przepływy pracy. Repozytorium DeepSeek opisuje projekt jako open-source’owy agent harness i ujawnia wykorzystane zależności zewnętrzne.
To poszerza pole rywalizacji. DeepSeek nie konkuruje już wyłącznie o wywołania API z innymi dostawcami modeli. Dzięki Harness wchodzi również w warstwę workflow, gdzie działają między innymi Claude Code i Codex. To właśnie tam deweloperzy decydują, jak agent ma pracować, do jakich narzędzi może uzyskać dostęp i ile kontroli człowiek zachowuje nad jego działaniem.
Projekt bardzo szybko przyciągnął uwagę społeczności. Według zewnętrznego monitoringu repozytorium przekroczyło 20 tys. gwiazdek na GitHubie około godzinę po premierze, a do 17 sierpnia miało ich ponad 141 tys. To mocny sygnał zainteresowania programistów, ale gwiazdki na GitHubie nie są równoznaczne z wdrożeniami produkcyjnymi, aktywnymi użytkownikami ani bezpiecznymi integracjami.
Ostrożność jest tym ważniejsza, że Harness v0.1 pozostaje wersją deweloperską. Twórcy i opisy projektu ostrzegają, że należy spodziewać się zmian zrywających kompatybilność. Architektura oparta na pluginach ułatwia dostosowanie agenta, ale zwiększa też złożoność operacyjną. Każde dodatkowe narzędzie oznacza pytania o uprawnienia, utrzymanie, obsługę błędów i dostęp do danych.
Wielostopniowa orkiestracja oraz rozbudowane opisy narzędzi mogą także zwiększać zużycie tokenów. W efekcie cena samego modelu może słabo odzwierciedlać koszt kompletnego, autonomicznego zadania.
Ponad 2 tys. propozycji pluginów świadczy o zainteresowaniu ekosystemem, a nie o jego dojrzałości czy bezpieczeństwie. Firmy testujące Harness powinny więc uruchamiać dodatki w odizolowanych środowiskach, kontrolować ich uprawnienia i mierzyć koszt całego zadania, zamiast oceniać framework wyłącznie po aktywności repozytorium.
Zmiana cen API DeepSeek jest ważna, ponieważ firma odchodzi od wcześniejszego modelu jednolitej stawki i wprowadza rozliczanie zależne od pory dnia. W komunikatach pojawiały się okna szczytowe podawane według czasu pekińskiego, a późniejsze zestawienia cen wskazywały odpowiadające im godziny UTC. Ponieważ harmonogram był opisywany niespójnie, przed planowaniem zadań deweloperzy powinni sprawdzić aktualną dokumentację cenową DeepSeek.
Kierunek zmian jest jednak jasny. Według doniesień cena tokenów wyjściowych V4 Pro wzrosła z 0,87 dol. za milion do 1,98 dol. poza szczytem i 3,96 dol. w godzinach szczytu. W zależności od modelu, rodzaju tokenów i okresu rozliczeniowego niektóre stawki w rodzinie V4 wzrosły o ponad 1100 proc.
Dla deweloperów oznacza to kilka praktycznych konsekwencji:
To nie tylko decyzja o monetyzacji. Ceny szczytowe mogą również służyć do zarządzania ograniczoną przepustowością i zachęcać do przenoszenia elastycznych obciążeń na godziny mniejszego popytu. Sugeruje to, że DeepSeek zaczyna traktować wnioskowanie jako deficytowy zasób infrastrukturalny, a nie wyłącznie jako narzędzie do zdobywania rynku niską ceną.
Nawet przy stawce 3,96 dol. za milion tokenów wyjściowych V4 Pro pozostaje znacznie tańszy od ceny 50 dol. za milion tokenów wyjściowych przypisywanej Fable 5 w materiałach dotyczących premiery. To nadal daje DeepSeek wyraźną przewagę cenową przy dużej liczbie zadań programistycznych i agentowych.
Ekonomia nie przypomina już jednak modelu „prawie za darmo”. Wzrost o 355 proc. względem wcześniejszej stawki 0,87 dol. zmienia kalkulację systemów produkcyjnych generujących duże ilości tekstu. Zespoły powinny porównywać koszt skutecznie ukończonego zadania — wraz z powtórkami, wywołaniami narzędzi, kontekstem i opóźnieniami — a nie tylko reklamowaną cenę za milion tokenów.
W rezultacie DeepSeek proponuje coraz bardziej konwencjonalną wartość: nadal może oferować dobry stosunek możliwości do ceny, ale jednocześnie oczekuje od klientów zapłaty za wyższe możliwości i dostosowania obciążeń do ograniczeń własnej infrastruktury.
Szerszy kierunek jest zgodny z doniesieniami o finansowaniu i planach infrastrukturalnych DeepSeek. Reuters informował, że firma pozyskała w pierwszej rundzie ponad 50 mld juanów, czyli około 7,4 mld dol. Bloomberg opisywał natomiast plan centrum danych w Ulanqabie w Mongolii Wewnętrznej, które miałoby zwiększyć moc obliczeniową o około 1 GW.
Doniesienia te nie dowodzą, że cała strategia zakończy się sukcesem ani że planowany obiekt powstanie zgodnie z harmonogramem. Pokazują jednak przejście do bardziej kapitałochłonnego modelu działalności.
Połączenie ulepszeń modelu, otwartego runtime’u, zróżnicowanych cen, zewnętrznego finansowania i planowanej mocy obliczeniowej wskazuje na cztery powiązane cele:
To zupełnie inna pozycja niż konkurowanie przede wszystkim rolą najtańszego dostawcy użytecznego modelu AI.
DeepSeek V4 Pro 0813 zasługuje na testy, zwłaszcza w programowaniu, automatyzacji pracy z repozytoriami i przepływach wykorzystujących narzędzia. Organizacje powinny jednak niezależnie zweryfikować cztery kwestie:
Najtrafniejsza interpretacja premiery jest więc strategiczna, a nie wyłącznie liczbowa. DeepSeek próbuje przejść od dostawcy tanich modeli do zintegrowanej platformy agentowej. V4 Pro 0813 dostarcza obietnicę większych możliwości, Harness — powierzchnię dla deweloperów, ceny szczytowe — narzędzie kontroli popytu, a nowe finansowanie i planowana moc obliczeniowa — podstawę infrastrukturalną.
To, czy powstanie z tego trwała przewaga, zależy od niezależnego potwierdzenia benchmarków, stabilności oprogramowania, bezpieczeństwa pluginów oraz tego, czy po podwyżkach cen deweloperzy nadal uznają ofertę za wystarczająco opłacalną.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek deklaruje duży skok wyników V4 Pro 0813: Terminal Bench 2.1 wzrósł z 72,1 do 87,9, CyberGym z 52,7 do 83,3, a DeepSWE z 12,8 do 62,7.
DeepSeek deklaruje duży skok wyników V4 Pro 0813: Terminal Bench 2.1 wzrósł z 72,1 do 87,9, CyberGym z 52,7 do 83,3, a DeepSWE z 12,8 do 62,7. Otwarty, objęty licencją MIT runtime Harness przenosi DeepSeek poza rynek samych API i w stronę narzędzi konkurujących z Claude Code oraz Codex.
Nowy cennik podniósł koszt tokenów wyjściowych V4 Pro z 0,87 dol. do 1,98 dol.