V4 Flash es la versión orientada a eficiencia de la familia DeepSeek V4. Está diseñada para cargas de trabajo con mucho volumen y baja latencia, como chat, extracción de información, clasificación, asistencia de programación y agentes de software.
Su arquitectura es de tipo Mixture-of-Experts (MoE). El modelo contiene 284.000 millones de parámetros en total, pero activa aproximadamente 13.000 millones para procesar cada token . En la práctica, esto permite conservar una gran reserva de conocimientos especializados sin pagar el coste computacional de activar toda la red en cada operación.
| Característica | Especificación |
|---|---|
| Parámetros totales | 284.000 millones |
| Parámetros activos | 13.000 millones por token |
| Parámetros del repositorio con módulo DSpark | 304.000 millones |
| Arquitectura | Mixture-of-Experts (MoE) |
| Ventana de contexto | 1.000.000 de tokens |
| Salida máxima | 384.000 tokens |
| Precisión | FP4 + FP8 mixta |
| Licencia | MIT |
| Tamaño aproximado de descarga | 160 GB |
Fuentes:
Tanto V4 Flash como V4 Pro se distribuyen con licencia MIT, que permite utilizar, modificar y redistribuir el modelo con fines comerciales sin pagar regalías . Sus pesos están disponibles en plataformas como Hugging Face, por lo que los equipos pueden descargarlos, ajustarlos y ejecutarlos en infraestructura propia.
Para las empresas, esto ofrece una alternativa a depender exclusivamente de una API externa. También permite crear productos comerciales sobre el modelo, aunque el despliegue local de una versión tan grande sigue exigiendo una infraestructura considerable, especialmente si se quiere aprovechar todo el contexto de un millón de tokens.
La principal innovación técnica de V4 Flash está en su sistema de atención híbrida. En lugar de comparar cada token con toda la secuencia original, el modelo comprime buena parte del historial y concentra el cálculo en la información más relevante.
A partir de las primeras capas, CSA y HCA se alternan: las capas pares utilizan la compresión 4:1 y las impares, desde la tercera, la compresión 128:1 . El objetivo es que el modelo pueda consultar documentos extensos, repositorios de código o historiales de tareas sin que el coste de atención crezca de forma prohibitiva.
El modelo utiliza distintos niveles de precisión para reducir el consumo de memoria:
nvidia/DeepSeek-V4-Flash-NVFP4 .En FP8, los pesos del modelo completo ocupan aproximadamente 284 GB. Para ejecutar el modelo con un contexto de un millón de tokens, una configuración recomendada es utilizar cuatro GPU NVIDIA H200 SXM5, con 564 GB de memoria de vídeo combinada . El tamaño de los pesos puede reducirse con otras cuantizaciones, pero eso no elimina las exigencias de memoria asociadas a la caché KV y a las secuencias largas.
DeepSeek V4 Flash expone el parámetro configurable reasoning_effort. Esta opción permite elegir entre rapidez y profundidad de análisis:
El ajuste resulta especialmente útil en aplicaciones que combinan tareas sencillas con otras que requieren varios pasos. Un sistema puede usar el modo rápido para clasificar solicitudes y reservar Think High o Think Max para depurar código, analizar errores o coordinar acciones de un agente .
El precio publicado para DeepSeek V4 Flash es de 0,14 dólares por cada millón de tokens de entrada cuando no hay coincidencia en la caché y de 0,28 dólares por cada millón de tokens de salida . Cuando una parte de la entrada se repite —por ejemplo, un prompt de sistema o un prefijo habitual—, el precio de la entrada almacenada en caché baja a 0,0028 dólares por millón de tokens, una reducción del 98 % .
| Tipo de token | Precio por millón |
|---|---|
| Entrada, sin caché | 0,14 dólares |
| Entrada, con caché | 0,0028 dólares |
| Salida | 0,28 dólares |
En las comparaciones recogidas por varias fuentes, la salida de V4 Flash resulta 54 veces más barata que Sonnet 4.6, a 15 dólares por millón, y 107 veces más barata que GPT-5.5, a 30 dólares por millón . Por eso algunos análisis lo describen como la API de clase frontier —modelos de gama alta con capacidades avanzadas— más barata disponible .
La versión V4-Flash-0731 mejoró de forma notable en tareas de programación y uso de herramientas gracias al posentrenamiento, no a una nueva arquitectura . El registro oficial de actualización comunicó los siguientes resultados:
La nota de lanzamiento afirma que la versión de producción alcanza niveles comparables a V4 Pro, el modelo mayor de la familia, en benchmarks de programación y agentes . Esto reduce la diferencia tradicional entre una versión “Pro” y otra “Flash” cuando el objetivo es automatizar tareas de código o ejecutar flujos de trabajo con herramientas .
No obstante, las fuentes revisadas no confirman una puntuación concreta de SWE-bench para V4-Flash-0731 . Por tanto, las comparaciones con otros modelos en ese benchmark deben tomarse con cautela hasta que DeepSeek publique resultados verificables.
El segundo anuncio importante es DeepSeek Harness, un marco de ejecución para agentes. A diferencia de un modelo de lenguaje aislado, un harness se ocupa de coordinar el contexto, las llamadas a herramientas y la ejecución de tareas .
El nombre apareció por primera vez en el registro de cambios de V4-Flash-0731, acompañado de la indicación “se publicará próximamente” . El 1 de agosto de 2026, DeepSeek empezó a reclutar desarrolladores de proyectos de código abierto para una beta cerrada . Los candidatos deben tener experiencia en proyectos relacionados con Agent Harness y enviar su identificador de GitHub junto con trabajos representativos .
El equipo de Harness se habría creado en marzo de 2026, cuando Cui Tianyi se incorporó a DeepSeek para formarlo desde cero . Las fuentes revisadas no permiten confirmar de manera independiente sus supuestos cargos anteriores en TSY Capital y Jane Street, ni existe todavía una fecha pública de lanzamiento para Harness .
V4 Flash combina tres elementos que rara vez aparecen juntos: pesos abiertos, una ventana de contexto de un millón de tokens y un precio de API muy bajo. Para los desarrolladores, eso puede traducirse en:
reasoning_effort.La contrapartida es que ejecutar localmente el modelo en su configuración completa no es trivial. El tamaño de los pesos y la memoria adicional necesaria para la caché de contexto hacen que la API siga siendo la opción más accesible para muchos equipos.
La estrategia asociada al CEO Liang Wenfeng suele describirse como la búsqueda de modelos baratos y capaces como vía hacia la inteligencia artificial general (AGI) . La combinación de precios de 0,14/0,28 dólares por millón de tokens y pesos bajo licencia MIT es la expresión más visible de ese enfoque.
DeepSeek compite en China con Alibaba y su familia Qwen, ByteDance y Doubao, Moonshot AI, MiniMax y Z.AI . Frente a esos rivales, la familia V4 ocupa una posición diferenciada por ofrecer pesos abiertos bajo una licencia MIT permisiva y un contexto de un millón de tokens .
También han circulado referencias a una posible preparación de una oferta pública inicial de DeepSeek, pero no hay confirmación sobre fechas, entidades colocadoras o detalles concretos .
Aunque el conjunto de fuentes permite reconstruir buena parte del lanzamiento, algunos datos deben mantenerse como provisionales:
En resumen, DeepSeek V4 Flash no es simplemente una versión más pequeña de V4 Pro. Su propuesta combina eficiencia arquitectónica, contexto extremo, control del razonamiento, licencia abierta y un precio que puede cambiar la economía de las aplicaciones basadas en modelos avanzados. Si Harness cumple lo que promete, DeepSeek también estará compitiendo no solo con modelos de otros laboratorios, sino con las plataformas que determinan cómo esos modelos actúan en el mundo real.