21 августа 2026 года DeepSeek выпустила V4 Flash Vision Exp — экспериментальную мультимодальную модель, которая добавляет анализ изображений к V4 Flash. Изображения можно передавать в запросе как Base64, через публичный URL или с помощью бесплатного Files API.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
21 августа 2026 года DeepSeek открыла в API доступ к deepseek-v4-flash-vision-exp — экспериментальной версии V4-Flash с поддержкой изображений. Теперь разработчики могут отправлять модели смешанные запросы с текстом и картинками, чтобы она анализировала скриншоты, интерфейсы, графики и другие элементы визуального окружения. 114
Главная особенность релиза — не только появление зрения, но и его цена: каждое изображение преобразуется максимум в 384 входных токена и оплачивается по тарифам V4-Flash, без отдельной наценки за мультимодальность. DeepSeek также заявляет, что производительность визуальных агентов уже приближается к Claude Opus 4.8. Однако это результаты самой компании, которые пока не подтверждены независимыми испытаниями. 319
Модель вызывается через API под идентификатором deepseek-v4-flash-vision-exp. Она объединяет текстовые и визуальные запросы, сохраняя основу V4-Flash для генерации текста, рассуждений, работы с инструментами и агентских сценариев. Смешанные промпты доступны в форматах Chat Completions, Messages и Responses. 412
Это важнее, чем обычное распознавание содержимого изображения. Визуальный агент может работать циклично: изучить скриншот интерфейса, решить, какое действие выполнить, вызвать инструмент, а затем проверить новый экран. В опубликованных демонстрациях модель генерировала исполняемый код по скриншотам и использовала визуальный ввод в сценариях создания игр. 510
Разработчикам доступны три варианта:
file_id. 6714Files API предоставляется бесплатно и особенно удобен, если приложение многократно обращается к одному и тому же скриншоту или визуальному состоянию. Повторное использование ссылки на файл избавляет от необходимости каждый раз передавать одинаковые данные и сокращает нагрузку на канал связи в агентских циклах. 112
По данным DeepSeek, для расчёта стоимости одно изображение занимает не более 384 входных токенов. Они оплачиваются по стандартной ставке V4-Flash — отдельного премиального тарифа за анализ изображений нет. 3614
В опубликованной таблице для модели указана пиковая стоимость 0,44 доллара за миллион некэшированных входных токенов и 1,32 доллара за миллион выходных токенов. Там же указаны контекстное окно на 1 миллион токенов и максимальный объём вывода в 384 000 токенов. 1
Некоторые публикации сравнивают лимит DeepSeek с расходом изображений у отдельных моделей GPT и Claude и называют его менее половины аналогичного показателя. Но это лишь ориентир: в приведённых сравнениях не зафиксированы одинаковые версии моделей, разрешение изображений и условия тарификации. Поэтому делать вывод о точном превосходстве по стоимости пока рано. 327
Практический вывод более очевиден. Агент, который регулярно проверяет скриншоты, состояние приложения, игровой кадр или панель мониторинга, получает предсказуемые расходы на визуальный ввод по тарифу Flash. Для частых наблюдений это может быть удобнее, чем постоянно использовать дорогую мультимодальную модель.
DeepSeek утверждает, что новая модель сохранила текстовые возможности V4-Flash, включая рассуждения, знания о мире и функции ИИ-агентов, одновременно получив способность работать с изображениями. 626
Компания также сообщила о заметном росте результатов на тестах мультимодальных агентов и заявила, что модель приблизилась к Claude Opus 4.8. В отдельных опубликованных сравнениях V4-Flash-Vision-Exp действительно находится рядом с Opus 4.8, но результаты различаются от теста к тесту. 4192123
Эту формулировку важно правильно интерпретировать. «Близка к Opus 4.8» пока означает заявление о результатах оценки DeepSeek, а не доказанную равноценность моделей в реальных задачах с визуальными агентами. Независимое тестирование должно показать, насколько стабильны распознавание изображений, выполнение действий через инструменты и работа со сложными интерфейсами за пределами условий, выбранных разработчиком.
Перед запуском модели в рабочем визуальном цикле стоит отдельно проверить настройки рассуждений. В одном практическом тесте reasoning-токены израсходовали весь доступный бюджет завершения, и модель не оставила места для видимого ответа. Авторы теста рекомендуют отключать thinking в подходящих визуальных сценариях либо увеличивать max_tokens, чтобы модель могла вернуть результат пользователю. 27
Это техническая особенность интеграции, а не оценка общей способности модели. Если рассуждения включены, приложению нужно заложить достаточный запас токенов и для внутреннего процесса, и для итогового ответа. Перед использованием конкретного параметра следует также свериться с актуальной документацией DeepSeek API.
В предоставленных материалах DeepSeek не приводит отдельного стратегического объяснения. Но сама конструкция релиза указывает на понятный сценарий: сделать визуальное восприятие достаточно дешёвым для регулярных действий агента.
Скриншоты, игровые кадры, графики и состояния приложений полезны агенту только тогда, когда он может часто их проверять, не превращая каждый шаг цикла в дорогой запрос. Экспериментальная Flash-версия позволяет добавить изображения в уже существующие недорогие процессы с инструментами и вызовами API, вместо того чтобы переносить приложение на отдельный премиальный мультимодальный уровень.
Для разработчиков, создающих агентов, работающих с экраном, инструменты «скриншот → код» и приложения с постоянной визуальной обратной связью, это и есть главный смысл обновления. DeepSeek V4-Flash-Vision-Exp предлагает низкий заявленный лимит изображения, три способа загрузки и бесплатное повторное использование файлов. Но лидерство в тестах и поведение модели в продакшене ещё предстоит проверить на собственных данных — с реалистичными скриншотами, строгим бюджетом вывода и независимой оценкой качества.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
21 августа 2026 года DeepSeek выпустила V4 Flash Vision Exp — экспериментальную мультимодальную модель, которая добавляет анализ изображений к V4 Flash.
21 августа 2026 года DeepSeek выпустила V4 Flash Vision Exp — экспериментальную мультимодальную модель, которая добавляет анализ изображений к V4 Flash. Изображения можно передавать в запросе как Base64, через публичный URL или с помощью бесплатного Files API.
Модель сохраняет текстовые, логические и агентские возможности V4 Flash, однако при включённом режиме рассуждений внутренние reasoning токены могут израсходовать весь лимит ответа.