Цей результат варто трактувати вузько. Формулювання «наближається до Opus 4.8» описує показники у вибраному DeepSeek наборі оцінювань, але не підтверджує однакову якість у всіх візуальних завданнях, програмуванні чи тривалих агентських сесіях. В офіційному журналі змін також наведено 36,5 бала в ApexBench, 27,3 — в Agents’ Last Exam, 64,3 — у Chartography та 35,0 — у ZeroBench Pass@5.
Ці цифри не відповідають на низку практичних запитань: наскільки стабільно модель працює у виробничих системах, як швидко відповідає та як поводиться після помилки. Результати бенчмарків можуть змінюватися залежно від промптів, набору завдань, середовища інструментів, вимог до затримки та методики оцінювання. Наявних незалежних даних недостатньо, щоб назвати це остаточним рейтингом моделей.
Найобережніша теза щодо тексту — не перевага, а наступність. DeepSeek подає Vision-Exp як модель, що зберігає можливості V4-Flash у текстових завданнях. Тобто розробникам не обов’язково відмовлятися від звичних міркувань і агентської поведінки заради роботи із зображеннями.
Для вибору моделі це означає таке:
DeepSeek відкрила Vision-Exp на своїй API-платформі. Модель підтримує Chat Completions, Messages і Responses, зокрема змішаний ввід тексту та зображень.
Зображення можна передати трьома способами:
file_id — ідентифікатор зображення, попередньо завантаженого через Files API.Підтримуються формати JPEG, PNG, GIF і WebP. У Responses API зображення передається як частина вмісту
input_image: через URL, base64 data URL або посилання на завантажений файл.
Вхідне зображення перетворюється на платні токени. DeepSeek зазначає, що одне зображення може додати не більше ніж 384 вхідні токени, а розрахунок відбувається за тарифами V4-Flash.
Опубліковані тарифи V4-Flash, пов’язані із запуском, такі:
Обмеження у 384 токени робить вартість обробки самого зображення досить передбачуваною. Але воно не обмежує обсяг супровідного тексту, виклики інструментів чи згенерований результат. Тому повна взаємодія з агентом може коштувати значно дорожче, ніж аналіз одного зображення.
Разом із моделлю DeepSeek випустила Harness 0.1.1 із готовою підтримкою Vision-Exp. Для розробників агентів це важливо більше, ніж для тих, хто просто ставить моделі разові запитання про зображення: новинка розрахована на роботу у сценаріях із викликом інструментів.
Також запрацював безплатний Files API. Розробник може один раз завантажити зображення, а в наступних запитах передавати його file_id, не надсилаючи повторно ті самі байти. DeepSeek документує такі посилання у форматі file-api-....
Це особливо зручно, коли агент кілька разів аналізує той самий скриншот, сторінку документа або інший візуальний матеріал у межах діалогу. Сам Files API може бути безплатним, але використання моделі та токенів залишається платним.
Запуск Vision-Exp показує, що конкуренція дедалі більше точиться не лише навколо якості самої моделі. Важливими стають повний набір для розробника: мультимодальність, сумісність API, ціна, повторне використання файлів і готові інструменти для агентів. DeepSeek пропонує візуальне розширення своєї лінійки Flash за опублікованими тарифами V4-Flash, а Claude Opus 4.8 використовує як орієнтир для порівняння.
Практичне значення моделі визначить не одна таблиця бенчмарків, а те, наскільки надійно вона працюватиме у завданнях на кшталт програмування за скриншотами, аналізу документів, керування інтерфейсами та використання візуальних інструментів. Позначка «експериментальна» нагадує: перед застосуванням у критичних виробничих процесах ці сценарії потрібно перевірити власноруч.
Найточніший висновок наразі стриманий: DeepSeek зробила недороге візуальне міркування доступнішим через уже наявну API-екосистему, а ранні результати свідчать про помітний виклик конкурентам у деяких мультимодальних тестах. Чи стане Vision-Exp сталою альтернативою, чи залишиться цікавим експериментом, покажуть незалежні оцінювання, надійність у реальних задачах і тривале зацікавлення розробників.