Obrazy można przekazywać na kilka sposobów: jako dane osadzone bezpośrednio w żądaniu, przez zewnętrzny adres URL albo za pośrednictwem Files API. Dokumentacja Responses API opisuje również przekazywanie obrazów do tego konkretnego modelu.
To ważne przede wszystkim dla twórców agentów. Agent może najpierw odczytać zrzut ekranu, wykres, zeskanowany dokument lub widok strony internetowej, a dopiero potem zdecydować, z którego narzędzia skorzystać. DeepSeek dokumentuje także integrację z Codexem, w której Vision Exp jest wskazany jako opcja dodająca obsługę obrazów.
Z informacji o wydaniu wynika ponadto, że DeepSeek Harness 0.1.1 otrzymał obsługę nowego modelu, co daje dodatkową ścieżkę integracji z przepływami agentowymi. Nie należy jednak mylić tego z bezpośrednią dostępnością Vision Exp w selektorze modeli GitHub Copilot. Dokumentacja integracji DeepSeek z Copilotem wymienia V4 Pro i V4 Flash, a obsługę obrazów opisuje przez inny, zainstalowany model Copilota.
Najważniejsza deklaracja DeepSeek brzmi: Vision Exp zachowuje wyniki V4-Flash w zadaniach tekstowych, a jednocześnie wykonuje duży krok naprzód w benchmarkach multimodalnych agentów. Według firmy jego możliwości w tym obszarze zbliżają się do Claude Opus 4.8.
W relacjach opartych na ogłoszeniu DeepSeek pojawiają się między innymi wyniki: 64,3 w Chartography, 36,5 w ApexBench Pass@1, 27,3 w Agents’ Last Exam oraz 35,0 w ZeroBench Pass@5. Są to jednak dane przytaczane przez materiały wtórne, a nie szczegółowy, niezależnie odtworzony test porównujący modele różnych firm w identycznych warunkach.
To rozróżnienie jest kluczowe. Stwierdzenie, że model jest „blisko Opus 4.8”, nie oznacza, że pokonuje Claude’a ogółem, dorównuje mu w każdym typie zadania ani że oferuje taką samą niezawodność w produkcji. Dostępne źródła nie przedstawiają neutralnej ewaluacji obejmującej te same prompty, środowiska narzędziowe, opóźnienia, odsetek błędów i koszty po obu stronach.
Najostrożniejszy, ale zarazem najbardziej uzasadniony wniosek jest węższy: DeepSeek wypuścił rzeczywisty i udokumentowany model API z obsługą wizji, a jego własne wyniki wskazują na znaczną poprawę względem tekstowego V4-Flash w zadaniach, w których obraz ma znaczenie. Pozycja Vision Exp wobec Claude’a, modeli OpenAI i Google oraz innych chińskich laboratoriów pozostaje niepotwierdzona.
Dostępne zestawienia podają dla Vision Exp cenę 0,22 USD za milion tokenów wejściowych i 0,66 USD za milion tokenów wyjściowych. Model ma mieć kontekst o długości 1 miliona tokenów. Oficjalna dokumentacja DeepSeek potwierdza rozliczanie API za milion tokenów i uwzględnia
deepseek-v4-flash-vision-exp w tabeli modeli.
Obrazy są przed rozliczeniem przeliczane na tokeny. Według materiału powołującego się na wskazówki DeepSeek pojedynczy obraz może odpowiadać maksymalnie 384 tokenom, a model korzysta ze struktury cenowej V4-Flash. Rzeczywisty koszt zadania wizualnego zależy więc od liczby i rozmiaru obrazów, długości tekstu kontekstowego, długości odpowiedzi oraz tego, ile razy powtarzany jest ten sam kontekst.
Anthropic podaje dla Claude Opus 4.8 stawkę 5 USD za milion bazowych tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Firma stosuje również osobne stawki dla pamięci podręcznej i trybu szybkiego.
Na poziomie podstawowych stawek tokenowych DeepSeek jest zdecydowanie tańszy. To dobry powód, by go przetestować, ale nie pełna kalkulacja kosztu utrzymania rozwiązania. Tańszy model może w praktyce wymagać większej liczby ponowień, częściej popełniać błędy w wywołaniach narzędzi albo potrzebować dodatkowego przetwarzania obrazów.
Oba modele mogą być używane w podobnych scenariuszach, ale zajmują różne pozycje:
Strategia DeepSeek jest czytelna: firma chce dodać obsługę wizji do tańszej kategorii modeli Flash, jednocześnie deklarując wyniki zbliżone do droższego modelu klasy frontier w zadaniach multimodalnych agentów. Dostępne dowody nie potwierdzają jednak przewagi Claude’a w każdym benchmarku. Przewaga Anthropic w tym zestawieniu dotyczy raczej lepiej udokumentowanej dojrzałości, większej powierzchni produktu i ugruntowanej pozycji narzędzi wokół modelu.
Porównanie warto przeprowadzać zadanie po zadaniu. W potoku służącym do odczytywania zrzutów ekranu lub wyciągania danych z wykresów Vision Exp może zapewnić wystarczającą jakość przy dużo niższym koszcie tokenów. W autonomicznym procesie o wysokiej stawce ważniejsze będą jednak powtarzalność, trafność wyboru narzędzi, zachowanie przy odmowach, możliwość monitorowania oraz odzyskiwanie sprawności po błędach.
Premiera jest istotna, ponieważ wizja staje się częścią pracy agentów, a nie tylko osobną funkcją odpowiadania na pytania dotyczące obrazów. Agent programistyczny może potrzebować odczytać zrzut ekranu, agent przeglądarkowy — zinterpretować stronę, a system firmowy — połączyć dokumenty, wykresy i wywołania narzędzi.
Rodzina DeepSeek V4 od początku kładzie nacisk na długi kontekst i zadania agentowe, a dokumentacja firmy przedstawia Flash jako szybszą i bardziej ekonomiczną opcję w tej rodzinie. Vision Exp rozwija ten kierunek w stronę agentów multimodalnych, zamiast tworzyć osobny model przeznaczony wyłącznie do obrazów.
Nie ma jednak podstaw, by ogłaszać DeepSeek liderem przed Anthropic, OpenAI, Google czy czołowymi chińskimi laboratoriami. W dostarczonych źródłach brakuje niezależnego porównania wszystkich modeli w identycznych warunkach, a eksperymentalne API nie jest równoznaczne z dojrzałym, produkcyjnym modelem flagowym.
Tak — pod warunkiem że test będzie kontrolowany.
Praktyczna ewaluacja powinna porównać Vision Exp z Claude Opus 4.8 oraz obecnie używanym modelem produkcyjnym na tych samych zadaniach łączących obraz i narzędzia. Warto mierzyć:
Na dziś werdykt powinien być ostrożny, ale pozytywny: DeepSeek V4 Flash Vision Exp to wiarygodny nowy eksperyment multimodalnego API, z atrakcyjną ceną katalogową i użytecznymi interfejsami dla programistów. Deklarację o wynikach zbliżonych do Claude Opus 4.8 warto sprawdzić we własnych zadaniach, ale nie należy jeszcze traktować jej jako niezależnie potwierdzonego faktu.