DeepSeek afirma que Vision-Exp se aproxima a Claude Opus 4.8 en benchmarks de agentes multimodales, al tiempo que mantiene el rendimiento textual de V4-Flash. En la tabla comparativa publicada por la compañía y recogida por The Next Web, el modelo de DeepSeek quedó por delante en 3 de las 11 pruebas enumeradas.
La conclusión debe interpretarse con cautela. Decir que está “cerca de Opus 4.8” describe el resultado en el conjunto de evaluaciones elegido por DeepSeek; no prueba que ambos modelos ofrezcan la misma calidad en todo tipo de tareas visuales, programación, uso de herramientas o sesiones prolongadas de agentes.
El registro de cambios oficial atribuye a Vision-Exp resultados como 36,5 en ApexBench, 27,3 en Agents’ Last Exam, 64,3 en Chartography y 35,0 en ZeroBench Pass@5.
Estos datos tampoco responden por sí solos a cuestiones clave para producción: fiabilidad, latencia, gestión de errores, comportamiento con herramientas y éxito en tareas reales. Los resultados pueden variar según las instrucciones, el entorno de ejecución, la selección de tareas y la metodología de evaluación. Con la información disponible, no hay suficiente evidencia independiente para presentar esta comparación como una clasificación definitiva de modelos.
La afirmación más sólida para los usos centrados en texto es la continuidad, no una victoria clara. DeepSeek presenta Vision-Exp como un modelo que conserva las capacidades textuales de V4-Flash, de modo que los desarrolladores pueden añadir entrada visual sin renunciar al comportamiento de razonamiento y agentes que ya conocían.
Esto marca una diferencia importante al elegir modelo:
DeepSeek ofrece Vision-Exp en su plataforma de API. El lanzamiento admite Chat Completions, Messages y Responses, además de entradas mixtas de texto e imagen.
Las imágenes pueden enviarse de tres formas:
file_id correspondiente a una imagen subida a través de la Files API.Los formatos documentados son JPEG, PNG, GIF y WebP. En la Responses API, la imagen se incorpora como una parte de contenido
input_image y puede utilizarse una URL, una URL de datos en base64 o la referencia a un archivo subido previamente.
La entrada visual se convierte en tokens facturables. DeepSeek indica que cada imagen aporta como máximo 384 tokens de entrada y que se aplica la estructura de precios de V4-Flash.
Las tarifas publicadas asociadas al lanzamiento son:
El límite de 384 tokens hace que el coste de la imagen sea relativamente predecible. No obstante, el tope no incluye el texto que acompaña a la imagen, las llamadas a herramientas ni la respuesta generada. Una interacción completa con un agente puede consumir bastantes más tokens que la imagen por sí sola.
DeepSeek publicó Harness 0.1.1 con compatibilidad integrada con Vision-Exp. Esto es especialmente relevante para quienes desarrollan agentes, en lugar de limitarse a formular preguntas aisladas sobre una imagen, porque el modelo está pensado para funcionar dentro de flujos de trabajo con herramientas.
Junto al modelo también llegó una Files API de uso gratuito. Permite subir una imagen una sola vez y reutilizarla en solicitudes posteriores mediante un file_id, en lugar de enviar de nuevo los mismos datos. DeepSeek documenta estas referencias con el formato file-api-....
La función puede ser útil cuando un agente necesita revisar la misma captura de pantalla, página de un documento o recurso visual en varios turnos. Que la Files API sea gratuita no significa que la inferencia del modelo o el consumo de tokens dejen de facturarse.
El lanzamiento muestra que la competencia entre modelos ya no se decide únicamente por una tabla de benchmarks. También entran en juego la capacidad multimodal, la compatibilidad de la API, el precio, la reutilización de archivos y las herramientas para agentes. DeepSeek ofrece una extensión visual de su línea Flash con las tarifas publicadas de V4-Flash, mientras que Claude Opus 4.8 aparece como referencia de gama alta en los informes de la compañía.
Su importancia práctica dependerá menos de una cifra concreta y más de si los desarrolladores la consideran fiable para programar a partir de capturas de pantalla, analizar documentos, operar interfaces y utilizar herramientas visuales. La etiqueta “experimental” aconseja validar directamente esos flujos antes de incorporarlos a tareas críticas.
La conclusión más equilibrada es esta: DeepSeek ha hecho más accesible el razonamiento visual de bajo coste dentro de su ecosistema de API, y sus primeros resultados sugieren un desafío relevante en determinadas pruebas multimodales. Pero serán las evaluaciones independientes, la fiabilidad en situaciones reales y la adopción sostenida por parte de los desarrolladores las que determinen si Vision-Exp se convierte en una alternativa duradera o se queda en un lanzamiento experimental de interés.