Зображення можна передавати кількома способами: як вбудовані дані, через зовнішнє URL-посилання або за допомогою Files API. Документація Responses API окремо описує передавання зображень для цієї моделі.
Це робить Vision Exp цікавою для розробників агентів. Наприклад, агент може спочатку прочитати скриншот, графік чи відсканований документ, а потім вирішити, який інструмент викликати далі. DeepSeek також документує інтеграцію з Codex: Vision Exp там вказана як варіант із підтримкою введення зображень.
У релізних нотатках DeepSeek сказано, що Harness 0.1.1 отримав підтримку нової моделі, відкривши ще один шлях до агентних сценаріїв. Водночас документація інтеграції з GitHub Copilot називає у виборі моделей V4 Pro і V4 Flash та описує обробку зображень через іншу встановлену Copilot-модель. Вона не підтверджує, що Vision Exp безпосередньо доступна в цьому списку.
Ключова заява DeepSeek полягає в тому, що Vision Exp зберігає текстову продуктивність V4-Flash і робить значний стрибок у мультимодальних агентних тестах, наближаючись за цим показником до Claude Opus 4.8.
У вторинних публікаціях наводяться окремі результати: 64,3 бала в Chartography, 36,5 у ApexBench Pass@1, 27,3 в Agents’ Last Exam і 35,0 у ZeroBench Pass@5. Однак ці цифри поширюються через матеріали про оголошення DeepSeek, а не через детальний незалежний тест, який можна відтворити та коректно зіставити з іншими постачальниками.
Тому формулювання «наближається до Opus 4.8» не означає, що DeepSeek перевершує Claude загалом, відповідає йому на кожному типі завдань або має таку саму надійність у production-середовищі. У наданих джерелах немає нейтрального порівняння з однаковими промптами, інструментами, затримкою, частотою помилок і витратами для DeepSeek та Anthropic.
Найобережніший висновок такий: DeepSeek справді випустила документовану API-модель із підтримкою зору, а її власні результати вказують на помітне покращення порівняно з текстовою V4-Flash у завданнях, де важливі зображення. Її реальне місце щодо Claude, OpenAI, Google та інших китайських AI-моделей ще потребує незалежної перевірки.
Доступні каталоги вказують для Vision Exp $0,22 за 1 млн вхідних токенів і $0,66 за 1 млн вихідних токенів, а також контекстне вікно на 1 млн токенів. Офіційна документація DeepSeek підтверджує, що API тарифікується за мільйон токенів і містить
deepseek-v4-flash-vision-exp у таблиці моделей.
Зображення конвертуються в токени для розрахунку вартості. За даними публікації, що посилається на рекомендації DeepSeek, одне зображення може займати до 384 токенів, а тарифікація відповідає структурі V4-Flash. Фактична ціна мультимодального процесу залежатиме від кількості та розміру зображень, обсягу супровідного тексту, довжини відповіді й повторного використання контексту.
Anthropic вказує для Claude Opus 4.8 $5 за 1 млн базових вхідних токенів і $25 за 1 млн вихідних токенів. Для кешування та швидкого режиму діють окремі тарифи.
За загальним тарифом токенів DeepSeek виглядає суттєво дешевшою. Це вагома причина протестувати модель, але не остаточний розрахунок сукупної вартості. Якщо дешевша модель частіше потребує повторних запитів, припускається помилок у роботі з інструментами або вимагає додаткової обробки зображень, економія може бути меншою, ніж здається з прайсингу.
Попри схожі сценарії використання, моделі займають різні позиції:
Стратегічна ставка DeepSeek очевидна: додати зір до доступнішої Flash-моделі та заявити про результат, близький до преміальної frontier-моделі в мультимодальних агентних завданнях. Перевага Claude у цьому порівнянні — не доведена перевага над DeepSeek у кожному тесті, а вища документована зрілість, ширший набір продуктів і усталена позиція навколо моделі та її інструментів.
Порівнювати їх варто на рівні конкретних процесів. Для читання скриншотів або вилучення даних із графіків Vision Exp може забезпечити достатню якість за значно нижчою ціною. Для автономних процесів із високою відповідальністю важливішими будуть стабільність, точність виклику інструментів, поведінка під час відмов, спостережуваність, підтримка та здатність відновлюватися після помилок.
Візуальне розуміння дедалі частіше стає частиною агентної роботи, а не окремою функцією для відповідей на запитання про зображення. Агент для програмування може читати скриншоти, браузерний агент — інтерпретувати вебсторінки, а корпоративна система — поєднувати документи, графіки та виклики інструментів.
Сімейство DeepSeek V4 від початку робить акцент на довгому контексті та агентних сценаріях, а компанія позиціонує Flash як швидший і економніший варіант у межах лінійки. Vision Exp продовжує цей напрям, додаючи мультимодальність до агентів, а не створюючи окрему модель лише для аналізу зображень.
Проте наявні дані не дають підстав оголошувати DeepSeek лідером над Anthropic, OpenAI, Google чи провідними китайськими лабораторіями. У наданих джерелах немає незалежного порівняння «за однаковими правилами», а експериментальний API-реліз не є еквівалентом зрілого флагманського продукту.
Так, але в контрольованому середовищі.
Корисний пілотний тест має порівнювати Vision Exp, Claude Opus 4.8 і поточну production-модель на однакових завданнях із зображеннями та інструментами. Варто відстежувати:
Поки таких даних немає, найкращий вердикт — обережно позитивний. DeepSeek V4 Flash Vision Exp є реальною мультимодальною API-експериментальною моделлю з привабливою заявленою ціною та корисними інтерфейсами для розробників. Її заяву про майже рівень Claude Opus 4.8 варто перевіряти на власних сценаріях, але ще зарано сприймати як незалежно встановлений факт.