DeepSeek V4.1 Flash se lanzó el 10 de septiembre de 2026 como el modelo Flash multimodal actual de DeepSeek. V4 Flash y V4 Flash Vision Exp fueron retirados; sus identificadores heredados se redirigen temporalmente a V4.1 Flash y se cobran a tarifa Flash.
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash es un modelo multimodal de pesos abiertos lanzado el 10 de septiembre de 2026. Más allá de sus 552.000 millones de parámetros, su principal apuesta es hacer más viable la inferencia con contextos muy extensos: usa activación dispersa y una caché KV considerablemente menor que la de V4 Flash. 17
35
Para quienes usan la API de DeepSeek, V4.1 Flash es ahora la opción Flash actual y se invoca con el identificador deepseek-flash. Incorpora comprensión visual nativa, además de capacidades de texto. 15
17
Los anteriores V4 Flash y V4 Flash Vision Exp fueron retirados. DeepSeek mantiene temporalmente los nombres heredados deepseek-v4-flash y deepseek-v4-flash-vision-exp por compatibilidad, pero las peticiones se atienden con V4.1 Flash y se facturan con la tarifa Flash. 15
23
La situación de V4 Pro es distinta. Informaciones iniciales sobre la transición indicaban que su tráfico sería redirigido a V4.1 Flash hasta la llegada de V4.1 Pro. Sin embargo, el registro de cambios posterior de la API de DeepSeek señala que, tras las peticiones de usuarios, V4 Pro seguirá disponible después del 14 de septiembre de 2026 y conservará su sistema de facturación. Para obtener resultados reproducibles, conviene usar los identificadores documentados actualmente y hacer pruebas de regresión, en vez de asumir que una ruta heredada siempre terminará en V4.1 Flash. 15
23
V4.1 Flash utiliza una arquitectura de mezcla de expertos o MoE (Mixture of Experts) con 552.000 millones de parámetros de base. En este tipo de sistema no se ejecuta toda la red para cada token: se activa solo un subconjunto de parámetros seleccionado para esa operación.
DeepSeek afirma que activa 8.000 millones de parámetros durante el procesamiento de entrada (prefill) y 16.000 millones durante la generación de salida (decoding). El modelo emplea lo que la empresa denomina arquitectura Causal Encoder–Decoder. La diferencia es relevante porque procesar un prompt largo y generar una respuesta larga imponen costes de inferencia diferentes. 17
35
La activación dispersa no garantiza por sí sola que un modelo sea barato o veloz en cualquier despliegue. El rendimiento real depende también del hardware, el procesamiento por lotes, la cuantización, el software de servicio, la longitud del contexto y el tipo de peticiones. Aun así, es un elemento central de la propuesta de eficiencia de V4.1 Flash.
V4.1 Flash admite contextos de hasta un millón de tokens. 35
El gran obstáculo operativo de los contextos largos es la caché de clave-valor (KV): el estado de atención que el modelo conserva para generar cada token siguiente. Conforme crecen el prompt y la respuesta, esa memoria puede convertirse en una de las principales limitaciones del servicio.
Según la tarjeta del modelo, la arquitectura Causal Encoder–Decoder proyecta la caché KV global del decodificador a partir de los estados ocultos finales del codificador, en lugar de derivarla de forma independiente en cada capa del decodificador. El lanzamiento también combina Compressed Sparse Attention 2 y almacenamiento KV en FP4. En conjunto, DeepSeek informa de una huella de caché KV global de unos 890 bytes por token, aproximadamente una cuarta parte de la correspondiente a DeepSeek V4 Flash. 35
39
Esto no implica que cualquier tarea de un millón de tokens vaya a ser económica ni precisa. La capacidad máxima de contexto no equivale a una recuperación fiable de información, razonamiento o seguimiento de instrucciones a lo largo de todo el prompt. Los equipos que trabajen con grandes repositorios de código, colecciones documentales o historiales de agentes deberían medir recuperación, latencia y coste con cargas de trabajo representativas.
DeepSeek publicó los pesos de V4.1 Flash en Hugging Face bajo licencia MIT. La tarjeta del modelo lo presenta como una publicación de pesos abiertos, que permite descargarlo y desplegarlo bajo los términos de esa licencia. 35
Esto ofrece una alternativa a los modelos disponibles solo por API: las organizaciones pueden evaluarlo en su propia infraestructura y controlar su pila de servicio. No elimina la complejidad del despliegue, especialmente con una base de 552.000 millones de parámetros, pero abre una vía para el autoalojamiento y la optimización más profunda.
DeepSeek sostiene que nuevos métodos de preentrenamiento y un posentrenamiento por aprendizaje por refuerzo a mayor escala lograron resultados de referencia por delante de modelos insignia, incluido V4 Pro. La empresa también cita pruebas de varias partes que sitúan a V4.1 Flash por delante en rendimiento, coste, velocidad y tiempo total de ejecución. 17
Son resultados comunicados por el proveedor y no un veredicto universal. Los benchmarks pueden variar según las tareas elegidas, los prompts, la configuración de herramientas, el método de evaluación y la versión del modelo probada. Antes de migrar un flujo de producción, conviene comparar ambos modelos en las tareas que realmente importan: razonamiento complejo, tasa de aceptación de código, uso de herramientas, precisión multimodal, fiabilidad, controles de seguridad, latencia y coste total.
V4.1 Flash llegó a un mercado en el que DeepSeek y otros proveedores chinos ya acumulaban una actividad importante en plataformas de enrutamiento. OpenRouter clasifica los modelos por los tokens de prompt y de respuesta procesados a través de su propia API. En su clasificación del 13 de septiembre, situó a DeepSeek V4.1 Flash en 4,94 billones de tokens, marcado como nuevo; a DeepSeek V4 Flash 0731 en 11,6 billones; a V4 Flash 0423 en 4,36 billones; y a Xiaomi MiMo-V2.5 en 7,77 billones. 57
Los datos anteriores también muestran lo rápido que pueden cambiar estas clasificaciones: una instantánea de agosto colocó a V4 Flash en 7,1 billones de tokens semanales e indicó que nueve de los diez modelos más usados en ese ranking eran chinos. 50
La salvedad es esencial: los recuentos de OpenRouter reflejan tráfico enrutado por OpenRouter, no el uso mundial de IA, la adopción empresarial, los ingresos ni la calidad de los modelos. Son una señal útil de demanda en una plataforma para desarrolladores, pero no prueban que un modelo haya ganado el mercado general.
La razón más sólida para evaluar V4.1 Flash es la combinación de multimodalidad nativa, contexto de un millón de tokens, pesos abiertos y una arquitectura orientada a reducir el coste de memoria de la inferencia prolongada. 17
35
Una ruta de migración razonable sería:
deepseek-flash en las nuevas integraciones Flash.Las afirmaciones técnicas de V4.1 Flash son relevantes, en especial los 890 bytes de caché KV global por token y su diseño de activación dispersa. Su importancia real dependerá de si esas mejoras se traducen en un rendimiento fiable y asequible en las cargas de trabajo que los desarrolladores ejecutan en la práctica.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek V4.1 Flash se lanzó el 10 de septiembre de 2026 como el modelo Flash multimodal actual de DeepSeek.
DeepSeek V4.1 Flash se lanzó el 10 de septiembre de 2026 como el modelo Flash multimodal actual de DeepSeek. V4 Flash y V4 Flash Vision Exp fueron retirados; sus identificadores heredados se redirigen temporalmente a V4.1 Flash y se cobran a tarifa Flash.
OpenRouter registró 4,94 billones de tokens procesados para V4.1 Flash el 13 de septiembre, una métrica de actividad en esa plataforma y no del mercado mundial.