Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp añade comprensión de imágenes a V4 Flash: cada imagen se limita a 384 tokens de entrada y se factura con la tarifa habitual de Flash. Los desarrolladores pueden enviar imágenes mediante Base64, URL públicas o referencias reutilizables de la Files API, cuy...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
El lanzamiento del 21 de agosto de 2026 convierte a deepseek-v4-flash-vision-exp en la primera variante de V4-Flash capaz de recibir imágenes junto con texto a través de la API de DeepSeek. El modelo experimental está pensado para aplicaciones que necesitan interpretar capturas de pantalla, interfaces, gráficos y otros estados visuales dentro de un flujo de agente. 114
La novedad más llamativa no es solo que DeepSeek pueda «ver», sino cuánto cobra por hacerlo: cada imagen se convierte en un máximo de 384 tokens de entrada y se factura con las tarifas de V4-Flash, sin un recargo separado por procesamiento visual. La empresa afirma además que el rendimiento de sus agentes multimodales se acerca al de Claude Opus 4.8, pero esa comparación procede de resultados comunicados por DeepSeek y todavía no ha sido confirmada de forma independiente. 319
El identificador de la API es deepseek-v4-flash-vision-exp. Acepta instrucciones mixtas de texto e imagen y mantiene la base de generación de texto, uso de herramientas y capacidades de agente asociada a la familia V4-Flash. La entrada visual está disponible en las interfaces Chat Completions, Messages y Responses. 412
Esto permite ir más allá de describir una foto. Un agente puede analizar una captura de pantalla, decidir qué acción tomar, llamar a una herramienta y volver a examinar la interfaz resultante. Entre las demostraciones publicadas se incluyen la generación de código ejecutable a partir de capturas y el uso de imágenes en flujos de creación de videojuegos. 510
Los desarrolladores disponen de tres opciones:
file_id devuelto. 6714La Files API es gratuita y resulta especialmente útil cuando una aplicación consulta repetidamente la misma imagen. Al reutilizar la referencia del archivo, no es necesario volver a cargar los mismos datos en cada petición, lo que reduce el tráfico de red en flujos de agentes que revisan una pantalla varias veces. 112
DeepSeek asegura que cada imagen se tokeniza para facturación con un límite máximo de 384 tokens de entrada. Esos tokens se cobran al precio normal de V4-Flash, por lo que la comprensión visual no crea una categoría premium independiente. 3614
Una tabla de precios publicada sitúa, en horario punta, el coste en 0,44 dólares por millón de tokens de entrada no almacenados en caché y 1,32 dólares por millón de tokens de salida. La misma tabla indica una ventana de contexto de un millón de tokens y una salida máxima de 384.000 tokens. 1
Algunos informes describen el límite de 384 tokens como inferior a la mitad del consumo de imágenes observado en ciertas comparaciones con modelos GPT y Claude. La cifra sirve como orientación, pero no constituye una comparación plenamente normalizada: las fuentes no establecen versiones idénticas de los modelos, resoluciones equivalentes ni los mismos supuestos de facturación. 327
La ventaja práctica sí está más clara. Un agente que comprueba muchas capturas puede asumir un coste de entrada visual relativamente pequeño y predecible, en lugar de recurrir a un modelo multimodal premium en cada observación.
DeepSeek sostiene que V4-Flash-Vision-Exp conserva las capacidades de texto de V4-Flash, incluido el razonamiento, el conocimiento general y las funciones de agente, mientras incorpora entradas visuales. 626
La compañía también comunicó una mejora importante en pruebas de agentes multimodales y afirmó que el rendimiento se acerca al de Claude Opus 4.8. Algunas tablas publicadas sitúan al modelo cerca de Opus 4.8 en tareas concretas, aunque los resultados varían según el benchmark. 4192123
La precisión de ese matiz es importante: «cerca de Opus 4.8» debe interpretarse por ahora como una afirmación basada en las evaluaciones de DeepSeek, no como una demostración de equivalencia en cualquier flujo visual. Será necesario realizar pruebas independientes para valorar la fiabilidad, la precisión al interpretar imágenes y el uso de herramientas en escenarios reales.
Los equipos que incorporen el modelo a un bucle visual deberían probar con cuidado los ajustes de razonamiento. Una prueba práctica publicada observó que los tokens de pensamiento podían consumir todo el presupuesto de finalización, sin dejar espacio para una respuesta visible. El informe recomienda desactivar el razonamiento en las tareas visuales pertinentes o aumentar max_tokens para que el modelo pueda responder. 27
No se trata necesariamente de un veredicto sobre la capacidad general del modelo, sino de una precaución de implementación. Si el razonamiento está activado, la aplicación debe reservar suficientes tokens para el proceso interno y para la respuesta que verá el usuario. Antes de fijar un parámetro concreto, conviene comprobar su comportamiento y su nombre actual en la documentación de la API de DeepSeek.
Aunque DeepSeek no ha ofrecido en las fuentes disponibles una explicación estratégica formal, el diseño del producto apunta a un objetivo evidente: abaratar la percepción visual para que los agentes puedan repetirla con frecuencia. Las capturas, los fotogramas de un juego, los paneles de control y los estados de una aplicación solo resultan útiles para un agente si puede inspeccionarlos de manera habitual sin encarecer demasiado cada ciclo. 356
Al presentar la visión como una variante experimental de Flash, DeepSeek permite añadir imágenes a flujos existentes de agentes y llamadas a herramientas, sin trasladar toda la aplicación a una categoría multimodal premium. Eso hace que el lanzamiento sea especialmente relevante para quienes desarrollan agentes controlados por pantalla, herramientas de conversión de capturas a código o aplicaciones que necesitan recibir información visual de forma constante.
El balance, por ahora, es sencillo: V4-Flash-Vision-Exp ofrece un límite declarado de tokens por imagen muy bajo y varias formas flexibles de incorporación, mientras que sus ventajas en benchmarks y su comportamiento en producción aún deben comprobarse. La estrategia más prudente para los desarrolladores es probarlo con capturas realistas, establecer un presupuesto explícito de salida y medir la calidad con evaluaciones independientes.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp añade comprensión de imágenes a V4 Flash: cada imagen se limita a 384 tokens de entrada y se factura con la tarifa habitual de Flash.
Lanzado el 21 de agosto de 2026, DeepSeek V4 Flash Vision Exp añade comprensión de imágenes a V4 Flash: cada imagen se limita a 384 tokens de entrada y se factura con la tarifa habitual de Flash. Los desarrolladores pueden enviar imágenes mediante Base64, URL públicas o referencias reutilizables de la Files API, cuyo uso es gratuito y permite evitar cargas repetidas.
DeepSeek afirma que el modelo se acerca a Claude Opus 4.8 en agentes multimodales y conserva las capacidades de texto de V4 Flash, aunque esas comparaciones todavía no cuentan con validación independiente.