Выпущенная 21 августа 2026 года DeepSeek V4 Flash Vision Exp добавляет понимание изображений к V4 Flash и, по данным DeepSeek, обошла Claude Opus 4.8 в 3 из 11 опубликованных сравнений — но результаты не прошли незави... Модель вызывается через API с идентификатором deepseek v4 flash vision exp; каждое изображение у...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp — экспериментальное мультимодальное расширение модели DeepSeek V4-Flash. Релиз от 21 августа 2026 года добавил к тексту, рассуждениям и агентским сценариям понимание изображений, а доступ к модели открыт через API DeepSeek.
Главная интрига запуска — заявление компании о результатах, близких к Anthropic Claude Opus 4.8 в тестах мультимодальных агентов. Но это сравнение пока следует воспринимать осторожно: основная часть доступных данных опубликована самой DeepSeek. Поэтому релиз важен для разработчиков и конкуренции между моделями, однако ещё не доказывает равенство с флагманом Anthropic во всех задачах.
Ключевое изменение — поддержка визуального ввода. Разработчик может отправить модели текст вместе с изображением, чтобы агент проанализировал фотографию, скриншот, диаграмму, документ или другой поддерживаемый визуальный материал, а затем дал ответ или вызвал инструмент. В API используется идентификатор:
deepseek-v4-flash-vision-expDeepSeek заявляет, что модель сохраняет возможности семейства V4-Flash в работе с текстом, рассуждениях, агентских сценариях и общих знаниях. В официальном журнале изменений приведены, среди прочего, результаты 83,9 в Terminal Bench 2.1, 59,3 в DeepSWE и 63,6 в DSBench-Hard.
Таким образом, Vision-Exp — не просто система для описания картинок. Её позиционируют как расширение текстовой модели для задач, где агенту нужно понимать содержимое экрана или изображения и действовать на его основе.
DeepSeek утверждает, что Vision-Exp приблизилась к Claude Opus 4.8 в тестах мультимодальных агентов, сохранив уровень текстовых возможностей V4-Flash. В опубликованной компанией таблице, о которой писал The Next Web, новая модель опередила Opus 4.8 в 3 из 11 сравнений.
Но формулировку «близка к Opus 4.8» важно трактовать узко. Она описывает результаты в выбранном DeepSeek наборе оценок, а не подтверждённое равенство во всех визуальных задачах, сценариях программирования или длительной работе автономного агента.
В журнале DeepSeek указаны следующие результаты Vision-Exp: 36,5 в ApexBench, 27,3 в Agents’ Last Exam, 64,3 в Chartography и 35,0 в ZeroBench Pass@5.
Эти цифры сами по себе не отвечают на ряд практических вопросов: насколько модель надёжна в реальных проектах, какова её задержка, как она восстанавливается после ошибок и насколько результаты зависят от промптов, инструментов и методики оценки. В доступных материалах недостаточно независимых данных, чтобы считать это сравнение окончательным рейтингом моделей.
Самая сильная претензия DeepSeek в текстовых сценариях — не явное превосходство, а преемственность. Компания представляет Vision-Exp как модель, сохраняющую текстовые возможности V4-Flash: разработчикам не обязательно отказываться от привычного поведения в рассуждениях и работе с агентами ради поддержки изображений.
При выборе модели это означает следующее:
Vision-Exp доступна на платформе DeepSeek через Chat Completions, Messages и Responses. API поддерживает смешанный ввод текста и изображений.
Изображение можно передать одним из трёх способов:
file_id файла, предварительно загруженного через Files API.Поддерживаются форматы JPEG, PNG, GIF и WebP. В Responses API изображение передаётся как часть содержимого
input_image — через URL, base64 data URL или ссылку на загруженный файл.
Изображения преобразуются во входные токены и учитываются при оплате. DeepSeek указывает, что на одно изображение приходится не более 384 входных токенов; применяется тарифная схема V4-Flash.
Опубликованные тарифы, связанные с запуском, составляют:
Ограничение в 384 токена делает стоимость самой картинки относительно предсказуемой. Однако оно не распространяется на сопровождающий текст, вызовы инструментов и сгенерированный ответ: полноценная сессия агента может потребить значительно больше токенов, чем изображение.
Вместе с моделью DeepSeek выпустила Harness 0.1.1 со встроенной поддержкой Vision-Exp. Это особенно важно для разработчиков агентов, а не только для тех, кто задаёт модели разовые вопросы по изображению: Vision-Exp рассчитана на работу в цепочках с инструментами.
Одновременно появился бесплатный Files API. Разработчик может один раз загрузить изображение, а затем использовать его в следующих запросах, передавая file_id вместо повторной отправки тех же данных. DeepSeek указывает формат ссылок на файлы file-api-....
Такой подход удобен, когда агент несколько раз анализирует один скриншот, страницу документа или другой визуальный объект в рамках разных ходов диалога. Сам Files API бесплатен, но инференс модели и использование токенов по-прежнему оплачиваются.
Vision-Exp показывает, что конкуренция всё сильнее выходит за рамки одной таблицы с оценками. Для разработчиков важны сразу несколько факторов: мультимодальность, совместимость API, цена, повторное использование файлов и инструменты для создания агентов.
DeepSeek предлагает визуальное расширение своей линейки Flash по опубликованным тарифам V4-Flash, а Claude Opus 4.8 использует как ориентир верхнего сегмента в собственном сравнении. Это отражает более широкий сдвиг на рынке: визуальное рассуждение постепенно перестаёт быть функцией исключительно дорогих флагманских моделей.
При этом Vision-Exp — именно экспериментальный релиз, а не новая флагманская модель. Его реальное значение определят не отдельные результаты бенчмарков, а надёжность в задачах вроде программирования по скриншоту, анализа документов, управления интерфейсами и визуального использования инструментов.
Итог пока стоит сформулировать сдержанно: DeepSeek упростила доступ к недорогому визуальному рассуждению в рамках существующей API-экосистемы, а её первые тесты указывают на заметный вызов конкурентам в отдельных мультимодальных сценариях. Но независимые проверки, стабильность в реальной работе и интерес разработчиков покажут, станет ли Vision-Exp долговечной альтернативой или останется любопытным экспериментом.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Выпущенная 21 августа 2026 года DeepSeek V4 Flash Vision Exp добавляет понимание изображений к V4 Flash и, по данным DeepSeek, обошла Claude Opus 4.8 в 3 из 11 опубликованных сравнений — но результаты не прошли незави...
Выпущенная 21 августа 2026 года DeepSeek V4 Flash Vision Exp добавляет понимание изображений к V4 Flash и, по данным DeepSeek, обошла Claude Opus 4.8 в 3 из 11 опубликованных сравнений — но результаты не прошли незави... Модель вызывается через API с идентификатором deepseek v4 flash vision exp; каждое изображение учитывается как максимум 384 входных токена и может передаваться через base64, URL или повторно используемый файл из Files...
Одновременно с релизом вышли Harness 0.1.1 со встроенной поддержкой модели и бесплатный Files API, упрощающий создание визуальных и многошаговых агентов.