Wprowadzony 21 sierpnia 2026 r. DeepSeek V4 Flash Vision Exp dodaje rozumienie obrazów do V4 Flash: każde zdjęcie jest rozliczane jako maksymalnie 384 tokeny wejściowe, według zwykłej stawki Flash.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
21 sierpnia 2026 r. DeepSeek uruchomił w swoim API eksperymentalny model deepseek-v4-flash-vision-exp. To wariant V4-Flash, który przyjmuje nie tylko tekst, lecz także obrazy. Deweloperzy mogą dzięki temu budować agentów analizujących zrzuty ekranu, interfejsy, wykresy czy kolejne stany aplikacji. 114
Najważniejsza informacja nie dotyczy jednak samego faktu, że model „widzi”, lecz sposobu rozliczania tej funkcji. DeepSeek twierdzi, że obraz zajmuje w rozliczeniu najwyżej 384 tokeny wejściowe i jest wyceniany według stawek V4-Flash — bez osobnej dopłaty za obsługę wizji. Firma deklaruje też, że możliwości modelu w pracy z agentami wizualnymi zbliżają się do Claude Opus 4.8. To jednak wyniki przedstawione przez producenta, a nie niezależnie potwierdzony werdykt. 319
Model wywołuje się za pomocą identyfikatora deepseek-v4-flash-vision-exp. Łączy wejście tekstowe i obrazowe, zachowując podstawę V4-Flash odpowiedzialną za generowanie tekstu, rozumowanie, korzystanie z narzędzi i pracę agentową. Obsługuje mieszane prompty w interfejsach Chat Completions, Messages oraz Responses. 412
W praktyce nie chodzi więc wyłącznie o opisanie pojedynczego zdjęcia. Agent może działać w pętli: obejrzeć zrzut ekranu, zdecydować o kolejnym kroku, wywołać narzędzie, a następnie przeanalizować nowy stan interfejsu. W prezentowanych demonstracjach model generował wykonywalny kod na podstawie zrzutów ekranu i wykorzystywał obraz w procesie tworzenia gier. 510
Deweloperzy mają do wyboru trzy metody:
data:.file_id. 6714Files API jest bezpłatne i najlepiej sprawdzi się w aplikacjach, które wielokrotnie analizują ten sam obraz, na przykład w agentach obserwujących określony ekran. Ponowne użycie odwołania do pliku eliminuje konieczność wysyłania identycznych danych przy każdym żądaniu, ograniczając zużycie pasma. 112
Według DeepSeek każdy obraz jest tokenizowany na potrzeby rozliczeń do poziomu maksymalnie 384 tokenów wejściowych. Tokeny te są naliczane według standardowej stawki V4-Flash, więc analiza obrazu nie trafia do osobnego, droższego pakietu multimodalnego. 3614
Jedna z opublikowanych tabel cenowych podaje w godzinach szczytu 0,44 dol. za milion niebuforowanych tokenów wejściowych oraz 1,32 dol. za milion tokenów wyjściowych. Dla modelu wskazano również okno kontekstowe o wielkości 1 miliona tokenów i maksymalnie 384 000 tokenów wyjściowych. 1
Niektóre doniesienia opisują limit 384 tokenów jako mniej niż połowę zużycia spotykanego w porównaniach z wybranymi modelami GPT i Claude. To jednak porównanie orientacyjne, a nie w pełni ujednolicony benchmark: dostępne materiały nie potwierdzają tych samych wersji modeli, rozdzielczości obrazów ani założeń dotyczących rozliczeń. 327
Dla użytkowników najważniejszy jest prostszy wniosek. Agent, który często sprawdza zrzuty ekranu, może otrzymać przewidywalny i stosunkowo niewielki koszt wejścia obrazowego, zamiast korzystać przy każdej obserwacji z droższego modelu multimodalnego.
DeepSeek twierdzi, że nowy model zachowuje tekstowe możliwości V4-Flash, w tym rozumowanie, wiedzę o świecie i funkcje agentowe, a jednocześnie zyskuje zdolność przyjmowania obrazów. 626
Firma poinformowała również o wyraźnej poprawie wyników w benchmarkach agentów multimodalnych i o zbliżeniu do Claude Opus 4.8. W części opublikowanych zestawień model wypada blisko Opusa, ale rezultaty różnią się w zależności od testu. 4192123
To istotne zastrzeżenie. Sformułowanie „blisko Opus 4.8” należy obecnie rozumieć jako opis wyników ewaluacji przedstawionych przez DeepSeek, a nie dowód równoważności modeli w rzeczywistych zastosowaniach. Niezależne testy będą potrzebne, by ocenić stabilność, trafność rozumienia obrazu i skuteczność korzystania z narzędzi poza środowiskiem przygotowanym przez producenta.
Przed wdrożeniem modelu w produkcyjnej pętli wizualnej warto przetestować ustawienia rozumowania. W opisywanym teście tokeny przeznaczone na thinking mogły pochłonąć cały limit odpowiedzi, przez co użytkownik nie otrzymywał widocznego rezultatu. Jako rozwiązanie wskazano wyłączenie thinking w odpowiednich zadaniach wizualnych albo zwiększenie wartości max_tokens, tak aby model miał miejsce na zwrócenie odpowiedzi. 27
To ostrzeżenie dotyczące integracji, a nie ostateczna ocena możliwości modelu. Jeśli rozumowanie jest włączone, aplikacja powinna zarezerwować wystarczający limit zarówno na proces wewnętrzny, jak i odpowiedź dla użytkownika. Przed oparciem produkcyjnego rozwiązania na konkretnym parametrze trzeba też sprawdzić jego aktualne działanie i nazwę w dokumentacji DeepSeek.
W dostarczonych materiałach DeepSeek nie przedstawia formalnego uzasadnienia strategicznego. Konstrukcja produktu wskazuje jednak na konkretny cel: obniżenie kosztu percepcji na tyle, aby agent mógł regularnie obserwować ekran i podejmować kolejne działania. Zrzuty ekranu, klatki z gier, pulpity danych czy stany aplikacji są dla agenta użyteczne dopiero wtedy, gdy można analizować je często bez drastycznego podnoszenia kosztów każdej iteracji. 356
Wariant eksperymentalny oparty na Flash pozwala też dodać wejście obrazowe do istniejących, tańszych przepływów pracy z agentami i wywoływaniem narzędzi, zamiast przenosić całą aplikację do osobnej, premiumowej usługi multimodalnej. Z tego powodu premiera jest szczególnie interesująca dla twórców agentów sterowanych ekranem, narzędzi zamieniających zrzuty ekranu w kod oraz aplikacji potrzebujących częstej informacji zwrotnej z obrazu.
Bilans jest na dziś dość klarowny: DeepSeek V4-Flash-Vision-Exp oferuje niski deklarowany limit tokenów obrazu, kilka elastycznych metod przesyłania i bezpłatne ponowne wykorzystywanie plików. Jednocześnie przewaga w benchmarkach oraz zachowanie modelu w produkcji pozostają kwestiami do zweryfikowania. Najrozsądniejszy start to kontrolowane testy na rzeczywistych zrzutach ekranu, z jasno ustawionym budżetem odpowiedzi i niezależną kontrolą jakości.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wprowadzony 21 sierpnia 2026 r. DeepSeek V4 Flash Vision Exp dodaje rozumienie obrazów do V4 Flash: każde zdjęcie jest rozliczane jako maksymalnie 384 tokeny wejściowe, według zwykłej stawki Flash.
Wprowadzony 21 sierpnia 2026 r. DeepSeek V4 Flash Vision Exp dodaje rozumienie obrazów do V4 Flash: każde zdjęcie jest rozliczane jako maksymalnie 384 tokeny wejściowe, według zwykłej stawki Flash. Obrazy można przesyłać jako dane Base64, publiczne adresy URL albo przez bezpłatne Files API, które pozwala ponownie wykorzystywać pliki za pomocą identyfikatora file id.
Model zachowuje tekstowe, rozumujące i agentowe możliwości V4 Flash, ale w zadaniach wizualnych trzeba kontrolować budżet odpowiedzi: według opisywanych testów tryb thinking może zużyć go w całości.