DeepSeek V4.1 Flash admite hasta un millón de tokens de contexto y activa unos 8.000 millones de parámetros por token al procesar la entrada, frente a 16.000 millones al generar la respuesta. DeepSeek cifra su caché KV global en 890 bytes por token, aproximadamente una cuarta parte de la de V4 Flash; otra técnica re...
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Para un agente de IA que consulta documentos y conserva un historial extenso, leer la sesión puede exigir mucho más trabajo que redactar la respuesta. DeepSeek-V4.1-Flash está diseñado para ese patrón: es un modelo multimodal de pesos abiertos y mezcla de expertos (MoE) que admite contextos de hasta un millón de tokens. Ese límite indica cuánto contenido puede recibir, no garantiza que encuentre o recuerde con precisión cualquier detalle de una conversación tan larga. 2
8
Su arquitectura cuenta con 552.000 millones de parámetros en la estructura principal y 40 capas: un codificador causal de 20 capas seguido de un decodificador de otras 20. La caché de claves y valores —KV, la información que se conserva para atender al contexto previo— del decodificador se proyecta a partir de los estados finales del codificador, en lugar de generarse por separado en cada capa del decodificador. Según DeepSeek, el modelo activa unos 8.000 millones de parámetros por token durante el procesamiento inicial de la entrada (prefill) y 16.000 millones durante la generación (decode). La diferencia favorece tareas en las que el agente recibe mucho texto y produce respuestas relativamente breves. 2
8
También reduce el tamaño de la caché. Compressed Sparse Attention 2 (CSA2) asigna a cada capa de atención uno de tres modos fijos —Full, Reindex o Reuse— para compartir información almacenada y reutilizar selecciones de atención dispersa. Junto con el almacenamiento de la caché KV principal en FP4, DeepSeek sitúa la huella de la caché KV global en 890 bytes por token, alrededor de una cuarta parte de la de DeepSeek-V4-Flash. Es una comparación del espacio ocupado por esa caché, no una medición del ahorro total de costes en cualquier despliegue. 6
8
Una técnica distinta, SWA Bounded Replay, reconstruye los estados KV que faltan para la atención de ventana deslizante reprocesando solo los tokens de la ventana más reciente. Así evita mantener esos estados en una unidad de almacenamiento SSD. La ficha del modelo cifra la caché KV persistente en aproximadamente una octava parte de la de V4-Flash. Esta medida de almacenamiento persistente no debe confundirse con la comparación de una cuarta parte correspondiente a la caché global. 5
9
Una ficha del modelo describe un entrenamiento desde cero con un corpus multimodal de 45 billones de tokens, una fase de entrenamiento de atención dispersa con secuencias de 64.000 tokens y una ampliación del contexto a un millón de tokens al alcanzar los 34 billones de tokens de entrenamiento. DeepSeek atribuye además las mejoras a nuevos métodos de preentrenamiento y a una fase posterior de aprendizaje por refuerzo a mayor escala; el material citado no permite precisar más esa receta. 9
16
El modelo procesa texto e imágenes de forma nativa, y DeepSeek afirma que esta capacidad multimodal está disponible en su API. Los extractos citados no permiten establecer resultados detallados en pruebas de visión. 2
16
En las evaluaciones de DeepSeek, la versión base obtuvo resultados comparables a V4-Pro-Base en conocimientos, razonamiento y programación, además de mejoras del 5 % al 10 % en evaluaciones reservadas para la prueba. Según la compañía, lo hizo con cerca de un tercio de los parámetros totales y una cuarta parte de los parámetros activados. DeepSeek también sostiene que la versión publicada supera a V4-Pro en tareas de agentes, pero las fuentes citadas no permiten una comparación fiable prueba por prueba. Son resultados comunicados por la compañía, no una evaluación independiente entre ambos modelos. 1
16
DeepSeek indica deepseek-flash como nombre del modelo en su API y publica los pesos bajo licencia MIT. Su documentación describe una vía de despliegue con SGLang; otras fichas identifican soporte de inferencia con Transformers y vLLM. Antes de elegir un entorno de ejecución, conviene comprobar sus requisitos y qué funciones multimodales o de contexto largo admite efectivamente. 8
9
16
La compañía señala que V4-Flash y V4-Flash-Vision-Exp han sido retirados y que sus antiguos nombres en la API dirigen temporalmente las solicitudes a V4.1-Flash. También anunció que, desde el 14 de septiembre de 2026, las solicitudes a deepseek-v4-pro se dirigirían a V4.1-Flash con tarifas Flash mientras se prepara V4.1-Pro. Si una aplicación depende del comportamiento específico de Pro, debe verificar qué modelo responde realmente, en vez de darlo por hecho a partir del alias. 16
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek V4.1 Flash admite hasta un millón de tokens de contexto y activa unos 8.000 millones de parámetros por token al procesar la entrada, frente a 16.000 millones al generar la respuesta.
DeepSeek V4.1 Flash admite hasta un millón de tokens de contexto y activa unos 8.000 millones de parámetros por token al procesar la entrada, frente a 16.000 millones al generar la respuesta. DeepSeek cifra su caché KV global en 890 bytes por token, aproximadamente una cuarta parte de la de V4 Flash; otra técnica reduce por separado el espacio de almacenamiento persistente.
Los resultados comparativos proceden de DeepSeek y no equivalen a una evaluación independiente.