Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp es un modelo experimental que conserva las capacidades de texto, razonamiento y agentes de V4 Flash, pero añade entrada de imágenes. Acepta imágenes JPEG, PNG, GIF y WebP junto con texto a través de las APIs Chat Completions y Responses, con usos como lee...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek V4 Flash Vision Exp es la primera variante de la línea V4-Flash de DeepSeek con capacidad para entender imágenes. Mantiene, según la compañía, el rendimiento de V4-Flash en texto, razonamiento, agentes y conocimiento general, y añade una modalidad visual para trabajar con capturas de pantalla, gráficos, documentos e imágenes. DeepSeek lo presenta como un modelo experimental y asegura que su rendimiento en agentes multimodales se acerca al de Claude Opus 4.8. Esa última afirmación, sin embargo, todavía debe considerarse una declaración del fabricante y no un resultado definitivo de clasificación independiente.
El modelo se ofrece mediante la API de DeepSeek con el identificador deepseek-v4-flash-vision-exp. Las notas de lanzamiento indican que iguala a V4-Flash en capacidades de texto —incluidos los agentes, el razonamiento y el conocimiento del mundo— y que mejora de forma notable en pruebas que requieren comprensión visual.
La novedad principal está en la entrada multimodal: el modelo puede recibir texto junto con imágenes JPEG, PNG, GIF o WebP. Esto permite describir una imagen, extraer o interpretar el texto de una captura de pantalla, responder preguntas visuales y analizar gráficos.
La terminación Exp es importante. No se trata simplemente de una nueva versión estable para sustituir de inmediato a un modelo de producción. DeepSeek lo define como experimental, por lo que conviene probarlo en entornos controlados antes de confiarle procesos críticos.
DeepSeek documenta el modelo tanto para la interfaz Chat Completions como para Responses, y ambas APIs incluyen deepseek-v4-flash-vision-exp entre los identificadores compatibles.
Las imágenes pueden enviarse de varias maneras: como datos integrados, mediante una URL externa o utilizando la Files API. La documentación de visión también explica cómo incluir imágenes en solicitudes realizadas con Responses.
Esto lo vuelve especialmente interesante para construir agentes. Un sistema puede interpretar una captura de pantalla, un gráfico, una página escaneada o un documento antes de decidir qué herramienta utilizar a continuación. DeepSeek también documenta una integración con Codex en la que Vision Exp aparece como una opción con soporte adicional para entrada de imágenes.
Las notas de lanzamiento señalan además que DeepSeek Harness 0.1.1 incorporó soporte para el modelo, lo que abre otra vía para conectarlo con flujos de trabajo basados en agentes.
Hay que distinguir esta integración de GitHub Copilot. La documentación de DeepSeek para Copilot menciona V4 Pro y V4 Flash en el selector de modelos, y explica que las imágenes se procesan mediante otro modelo de Copilot instalado; no confirma que Vision Exp esté disponible directamente en ese selector.
La principal afirmación de DeepSeek es doble: Vision Exp conserva el rendimiento de V4-Flash en tareas de texto y da un salto importante en pruebas de agentes que dependen de la visión. La compañía sostiene que su capacidad como agente multimodal se acerca a Claude Opus 4.8.
Algunos artículos que recogen el anuncio mencionan cifras concretas, como 64,3 en Chartography, 36,5 en ApexBench Pass@1, 27,3 en Agents’ Last Exam y 35,0 en ZeroBench Pass@5. Esos números proceden de cobertura secundaria del anuncio de DeepSeek, no de una evaluación comparativa detallada y reproducible entre proveedores.
La diferencia no es menor. Decir que un modelo está “cerca” de Opus 4.8 no significa que lo supere en términos generales, que iguale su comportamiento en todas las tareas o que ofrezca la misma fiabilidad en producción. En las fuentes disponibles no aparece una prueba neutral que utilice los mismos mensajes, herramientas, entornos, métricas de latencia, tasas de error y condiciones de coste para ambos modelos.
La conclusión más sólida es más limitada: DeepSeek ha puesto a disposición una API real y documentada con capacidad visual, y sus propios resultados apuntan a una mejora relevante frente a V4-Flash en tareas donde las imágenes son importantes. Su posición frente a Claude, OpenAI, Google y otros modelos chinos todavía no está confirmada.
Los listados disponibles sitúan Vision Exp en 0,22 dólares por millón de tokens de entrada y 0,66 dólares por millón de tokens de salida, con una ventana de contexto de un millón de tokens. La documentación oficial de DeepSeek confirma que la API se factura por millón de tokens e incluye
deepseek-v4-flash-vision-exp en su tabla de modelos.
Las imágenes se convierten en tokens para calcular la factura. Una fuente que cita las indicaciones publicadas por DeepSeek señala que una imagen puede representar hasta 384 tokens y que se aplica la estructura de precios de V4-Flash. En consecuencia, el coste real de un flujo visual dependerá también del número y el tamaño de las imágenes, del texto que las acompaña, de la longitud de las respuestas y de la cantidad de contexto repetido.
Anthropic publica para Claude Opus 4.8 una tarifa de 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. La compañía también ofrece precios separados para caché y modo rápido.
En la comparación básica por tokens, DeepSeek resulta considerablemente más barato. Es un motivo razonable para ponerlo a prueba, pero no equivale automáticamente a un menor coste total. Un modelo económico que necesita más reintentos, comete más errores al usar herramientas o exige un preprocesamiento adicional de imágenes puede terminar siendo más caro en un flujo completo.
Aunque ambos modelos pueden utilizarse en tareas con agentes y visión, ocupan posiciones distintas:
La propuesta estratégica de DeepSeek es clara: llevar la visión a una categoría de modelos de menor coste mientras afirma acercarse a un modelo premium en tareas de agentes multimodales. Las fuentes disponibles no demuestran que Claude sea superior en cada prueba; la ventaja más clara de Opus en esta comparación es la madurez documentada de su producto, su plataforma y su ecosistema de herramientas.
La comparación debería hacerse tarea por tarea. Para leer capturas, extraer datos de gráficos o clasificar documentos, Vision Exp podría ofrecer una calidad suficiente con un coste de tokens mucho menor. En un agente autónomo de alto riesgo, en cambio, importan más la consistencia, la precisión al elegir y ejecutar herramientas, el comportamiento ante instrucciones ambiguas, la observabilidad, el soporte y la capacidad de recuperarse de errores.
El lanzamiento llega en un momento en que la visión deja de ser una función aislada de preguntas sobre imágenes y pasa a formar parte del trabajo de los agentes. Un agente de programación puede necesitar interpretar una captura de un error; uno de navegación puede analizar una página; y un sistema empresarial puede combinar documentos, gráficos y llamadas estructuradas a herramientas.
La familia DeepSeek V4 ya está orientada a contextos largos y cargas de trabajo con agentes. La compañía presenta V4-Flash como una alternativa más rápida y económica dentro de la familia. Vision Exp prolonga esa estrategia hacia los agentes multimodales, en lugar de limitarse a ser un modelo independiente para preguntas visuales.
Aun así, la evidencia disponible no permite afirmar que DeepSeek haya superado a Anthropic, OpenAI, Google o los principales laboratorios chinos. No existe en las fuentes una evaluación independiente y comparable entre proveedores, y un lanzamiento experimental por API no equivale a un modelo insignia maduro y probado en producción.
Sí, siempre que la prueba sea controlada.
Una evaluación útil debería comparar Vision Exp con Claude Opus 4.8 y con el modelo que ya se utiliza en producción, usando exactamente las mismas tareas con imágenes y herramientas. Conviene medir:
El veredicto más prudente, por ahora, es positivo pero provisional: DeepSeek V4 Flash Vision Exp es un experimento multimodal creíble, con interfaces útiles para desarrolladores y un precio de lista atractivo. Su afirmación de acercarse a Claude Opus 4.8 en agentes multimodales merece una prueba seria, pero todavía no debe tratarse como un hecho establecido de forma independiente.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp es un modelo experimental que conserva las capacidades de texto, razonamiento y agentes de V4 Flash, pero añade entrada de imágenes.
Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp es un modelo experimental que conserva las capacidades de texto, razonamiento y agentes de V4 Flash, pero añade entrada de imágenes. Acepta imágenes JPEG, PNG, GIF y WebP junto con texto a través de las APIs Chat Completions y Responses, con usos como leer capturas de pantalla, analizar gráficos y procesar documentos visuales.
Los listados disponibles sitúan su precio en 0,22 dólares por millón de tokens de entrada y 0,66 dólares por millón de tokens de salida, frente a 5 y 25 dólares de Claude Opus 4.8.