21 августа 2026 года DeepSeek выпустила экспериментальную API модель V4 Flash Vision Exp: она сохраняет текстовые, reasoning и агентские возможности V4 Flash, добавляя анализ изображений. Модель принимает JPEG, PNG, GIF и WebP через Chat Completions и Responses API; её можно использовать для скриншотов, документов,...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp — первая модель семейства V4-Flash с поддержкой зрения. Она доступна через API под идентификатором deepseek-v4-flash-vision-exp и, по описанию DeepSeek, сохраняет возможности V4-Flash в работе с текстом, агентами, рассуждениями и общими знаниями, одновременно заметно улучшая результаты в задачах, где нужно понимать визуальную информацию.
Название с суффиксом Exp здесь важно: речь идёт об экспериментальной версии, а не о полностью зрелом потребительском продукте. Поэтому модель разумнее рассматривать как объект тестирования и ограниченного внедрения, а не как автоматическую замену проверенного production-решения.
Модель принимает текст вместе с изображениями форматов JPEG, PNG, GIF и WebP. Это позволяет просить её:
DeepSeek указывает deepseek-v4-flash-vision-exp как поддерживаемую модель для интерфейсов Chat Completions и Responses. Изображения можно передавать встроенными данными, по внешней ссылке или через Files API. Responses API также отдельно документирует передачу изображений для этой модели.
Для разработчиков агентных систем это означает практичесное расширение сценариев: агент может сначала разобрать скриншот, диаграмму или отсканированный документ, а затем решить, какой инструмент вызвать и с какими параметрами.
DeepSeek также документирует интеграцию с Codex: Vision Exp указана как вариант, добавляющий поддержку входных изображений. В версии DeepSeek Harness 0.1.1 заявлена встроенная поддержка новой модели.
При этом документация по GitHub Copilot называет в списке моделей V4 Pro и V4 Flash, а работу с изображениями описывает через другую установленную Copilot-модель. Это не подтверждает, что Vision Exp уже напрямую доступна в селекторе GitHub Copilot.
Главное заявление DeepSeek звучит так: Vision Exp сохраняет текстовые результаты V4-Flash и делает значительный скачок в мультимодальных агентских тестах, приблизившись по этой способности к Claude Opus 4.8.
В публикациях, пересказывающих объявление DeepSeek, приводятся отдельные показатели: 64,3 в Chartography, 36,5 в ApexBench Pass@1, 27,3 в Agents’ Last Exam и 35,0 в ZeroBench Pass@5. Однако эти цифры представлены через вторичные материалы, а не через подробное независимо воспроизводимое сравнение моделей разных поставщиков.
Поэтому формулировку «близка к Opus 4.8» не стоит превращать в утверждение, будто DeepSeek уже обошла Claude в целом или гарантированно равна ей по всем задачам. В доступных материалах нет нейтрального теста с одинаковыми промптами, инструментами, настройками, задержками, частотой ошибок и стоимостью для DeepSeek и Anthropic.
Самый аккуратный вывод выглядит уже: DeepSeek действительно выпустила документированную API-модель с поддержкой зрения, а опубликованные компанией результаты указывают на существенное улучшение V4-Flash в задачах, где важен визуальный ввод. Её точное положение относительно Claude, OpenAI, Google и других китайских моделей пока не подтверждено.
Доступные каталоги указывают для Vision Exp цену $0,22 за 1 млн входных токенов и $0,66 за 1 млн выходных токенов. Длина контекста составляет 1 млн токенов. Официальная документация DeepSeek подтверждает расчёт стоимости за миллион токенов и включает
deepseek-v4-flash-vision-exp в таблицу моделей.
Изображения при этом преобразуются в токены и учитываются в биллинге. Согласно публикации, ссылающейся на рекомендации DeepSeek, одно изображение может занимать до 384 токенов, а тарифная схема соответствует V4-Flash. Итоговая цена визуального сценария зависит от количества и размера изображений, объёма сопроводительного текста, длины ответа и повторно передаваемого контекста.
Для сравнения, Anthropic указывает для Claude Opus 4.8 стандартные тарифы $5 за 1 млн входных токенов и $25 за 1 млн выходных токенов. Для кэширования и быстрого режима действуют отдельные ставки.
На уровне базовой цены токенов DeepSeek выглядит существенно выгоднее. Но низкая ставка не равна низкой совокупной стоимости: если модель чаще ошибается при вызове инструментов, требует повторных запросов или нуждается в дополнительной обработке изображений, экономия может оказаться меньше ожидаемой.
У моделей пересекаются сценарии применения, но их позиции на рынке различаются:
Стратегический расчёт DeepSeek очевиден: добавить зрение в доступную Flash-категорию и заявить о результатах, близких к премиальной модели, в мультимодальных агентских задачах. Преимущество Claude в этом сравнении — не доказанное превосходство по каждому тесту, а более зрелая продуктовая оболочка, инструменты и подтверждённая эксплуатация.
Сравнивать модели стоит на конкретных задачах. Для чтения скриншотов или извлечения данных из графиков Vision Exp может оказаться достаточно качественной и гораздо более дешёвой. В автономных процессах с высокими требованиями важнее будут стабильность, точность выбора инструментов, поведение при отказах, наблюдаемость, поддержка и способность восстанавливаться после ошибок.
Зрение постепенно становится не отдельной функцией для вопросов по картинкам, а частью работы AI-агентов. Агент для программирования может анализировать скриншот ошибки, браузерный агент — понимать содержимое страницы, а корпоративная система — одновременно обрабатывать документы, графики и вызовы инструментов.
Семейство DeepSeek V4 изначально ориентировано на длинный контекст и агентские сценарии, а компания позиционирует Flash как более быстрый и экономичный вариант внутри линейки. Vision Exp развивает именно это направление, добавляя мультимодальность к агентским задачам, а не создавая отдельную модель только для анализа изображений.
При этом доступные данные не позволяют объявить DeepSeek лидером по отношению к Anthropic, OpenAI, Google или ведущим китайским лабораториям. Независимого сопоставимого межвендорного тестирования пока нет, а экспериментальная API-модель — не то же самое, что зрелый флагман для критически важных рабочих процессов.
Да, но в контролируемом режиме.
Практичная проверка должна сравнить Vision Exp, Claude Opus 4.8 и текущую production-модель на одних и тех же задачах с изображениями и инструментами. Полезно измерять:
Итог на сегодня осторожно-положительный: DeepSeek V4 Flash Vision Exp — реальный мультимодальный API-эксперимент с привлекательной заявленной ценой и полезными интерфейсами для разработчиков. Заявление о результатах, близких к Claude Opus 4.8, заслуживает проверки на собственных задачах, но пока не является независимо установленным фактом.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
21 августа 2026 года DeepSeek выпустила экспериментальную API модель V4 Flash Vision Exp: она сохраняет текстовые, reasoning и агентские возможности V4 Flash, добавляя анализ изображений.
21 августа 2026 года DeepSeek выпустила экспериментальную API модель V4 Flash Vision Exp: она сохраняет текстовые, reasoning и агентские возможности V4 Flash, добавляя анализ изображений. Модель принимает JPEG, PNG, GIF и WebP через Chat Completions и Responses API; её можно использовать для скриншотов, документов, графиков и мультимодальных агентских сценариев.
Заявленная стоимость составляет $0,22 за 1 млн входных токенов и $0,66 за 1 млн выходных — заметно ниже стандартных $5 и $25 у Claude Opus 4.8.