21 серпня 2026 року DeepSeek випустила експериментальну V4 Flash Vision Exp: модель приймає текст і зображення, причому кожне зображення конвертується максимум у 384 вхідні токени та оплачується за тарифом V4 Flash. Картинки можна передавати через Base64, публічне HTTP(S) посилання або безкоштовний Files API — файл...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
21 серпня 2026 року DeepSeek відкрила в API доступ до deepseek-v4-flash-vision-exp — експериментальної версії V4-Flash, яка вміє працювати не лише з текстом, а й із зображеннями. Для розробників це означає можливість будувати агентів, здатних аналізувати скриншоти, вікна програм, графіки, ігрові сцени та інший візуальний стан. 114
Головна особливість релізу — не просто підтримка зображень, а ціна їхнього оброблення. DeepSeek заявляє, що кожне зображення враховується як максимум 384 вхідні токени й оплачується за звичайним тарифом V4-Flash, без окремої націнки за vision-функції. Компанія також стверджує, що за результатами її тестів продуктивність візуальних агентів наближається до Claude Opus 4.8. Водночас це поки що вендорська заява, яку незалежні перевірки не підтвердили. 319
Модель викликається через API-ідентифікатор deepseek-v4-flash-vision-exp. Вона поєднує текстовий і візуальний вхід, зберігаючи основу V4-Flash для генерації тексту, міркувань, роботи з інструментами та агентських сценаріїв. Змішані запити «текст + зображення» підтримуються в інтерфейсах Chat Completions, Messages і Responses. 412
Тому йдеться не лише про окремий опис картинки. Агент може працювати циклічно: подивитися на скриншот поточного інтерфейсу, вирішити, яку дію виконати, викликати інструмент, а потім проаналізувати оновлений екран. У демонстраціях модель генерувала виконуваний код зі скриншотів і використовувала зображення у сценаріях створення ігор. 510
Розробники можуть обрати один із трьох варіантів:
file_id. 6714Files API доступний безкоштовно. Це найзручніший варіант для застосунків, які багато разів звертаються до тієї самої картинки — наприклад, до еталонного скриншота або постійного елемента інтерфейсу. Повторне використання посилання на файл дає змогу не передавати однакові дані щоразу й зменшує навантаження на мережу в агентських циклах. 112
За даними DeepSeek, під час розрахунку вартості одне зображення перетворюється не більш ніж на 384 вхідні токени. Вони оплачуються за стандартною ставкою V4-Flash, тож для візуального входу не створено окремий дорожчий тариф. 3614
В одній із опублікованих таблиць для vision-моделі вказано пікову ціну $0,44 за мільйон некешованих вхідних токенів і $1,32 за мільйон вихідних токенів. Там само зазначено контекстне вікно на 1 мільйон токенів і максимальний обсяг відповіді 384 000 токенів. 1
У деяких матеріалах стверджується, що ліміт у 384 токени — менш як половина витрат на зображення в окремих порівняннях із GPT і Claude. Однак ці дані не дають змоги провести повністю коректне зіставлення: не всюди вказано однакові версії моделей, роздільну здатність зображень і правила тарифікації. Тому це радше орієнтир, а не стандартизований бенчмарк. 327
Практична перевага зрозуміліша за рекламне порівняння. Агент, який регулярно перевіряє скриншоти, панелі моніторингу чи стан програми, може отримувати візуальний контекст із передбачуваними витратами — без необхідності використовувати преміальну мультимодальну модель на кожному кроці.
DeepSeek заявляє, що V4-Flash-Vision-Exp зберігає текстові можливості V4-Flash, зокрема навички міркування, роботу агентів і знання про світ, водночас додаючи аналіз зображень. 626
Компанія також повідомила про значний прогрес на бенчмарках мультимодальних агентів і заявила, що модель наближається до Claude Opus 4.8. В окремих опублікованих порівняннях результати справді близькі, але різні тести показують неоднакову картину. 4192123
Тут важливо не плутати два твердження. Формулювання «майже на рівні Opus 4.8» наразі описує результати оцінювання DeepSeek, а не доведену рівність моделей у реальних візуально-агентських задачах. Потрібні незалежні тести, щоб оцінити стабільність, точність розуміння зображень і якість використання інструментів поза умовами, обраними виробником.
Під час інтеграції розробникам варто уважно протестувати налаштування міркувань. В одному з практичних тестів приховані thinking-токени використали весь доступний бюджет завершення, тому модель не залишила місця для видимої відповіді. Автори тесту радять вимкнути thinking для відповідних візуальних завдань або збільшити max_tokens, щоб модель мала достатньо простору для фінального результату. 27
Це не скасовує можливостей моделі, але є важливою технічною деталлю для продакшену. Якщо reasoning увімкнено, застосунок має закласти достатній бюджет і на внутрішні міркування, і на відповідь користувачу. Перед запуском варто також перевірити актуальну документацію DeepSeek: назви параметрів і поведінка експериментальної моделі можуть змінюватися.
У наданих матеріалах DeepSeek не формулює окремої стратегічної мотивації, однак дизайн продукту підказує очевидний сценарій: зробити візуальне сприйняття достатньо дешевим для регулярних агентських дій. Скриншоти, кадри гри, дашборди та стани застосунків мають практичну цінність лише тоді, коли агент може часто їх перевіряти без надмірного зростання вартості кожного циклу.
Експериментальний запуск у лінійці Flash також дає змогу додати зображення до вже наявних недорогих сценаріїв із викликом інструментів, не переносячи весь продукт на окремий преміальний мультимодальний рівень. Це особливо цікаво для розробників агентів, які керують програмами через екран, інструментів «скриншот → код» і сервісів, яким потрібен постійний візуальний зворотний зв’язок.
Підсумок простий: DeepSeek V4-Flash-Vision-Exp пропонує низький заявлений ліміт image-токенів, три способи передавання зображень і безкоштовний Files API. Водночас заяви про лідерство в бенчмарках та поведінку в продакшені ще потребують перевірки. Найрозумніший старт для розробників — контрольовані тести на реальних скриншотах, чітко визначений бюджет відповіді та незалежна перевірка якості.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
21 серпня 2026 року DeepSeek випустила експериментальну V4 Flash Vision Exp: модель приймає текст і зображення, причому кожне зображення конвертується максимум у 384 вхідні токени та оплачується за тарифом V4 Flash.
21 серпня 2026 року DeepSeek випустила експериментальну V4 Flash Vision Exp: модель приймає текст і зображення, причому кожне зображення конвертується максимум у 384 вхідні токени та оплачується за тарифом V4 Flash. Картинки можна передавати через Base64, публічне HTTP(S) посилання або безкоштовний Files API — файл завантажується один раз і повторно використовується за допомогою file id.
DeepSeek заявляє про наближення мультимодальних агентів до Claude Opus 4.8, але це поки що результати самої компанії.