DeepSeek V4 Flash lideró el ranking semanal de OpenRouter del 27 de julio al 2 de agosto con 7,22 billones de tokens procesados, pero esa semana abarcó tanto la versión previa como el lanzamiento del modelo 0731. La ruta de OpenRouter para DeepSeek V4 Flash 0731 figura a 0,05 dólares por millón de tokens de entrada...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 se convirtió en un caso llamativo de la rapidez con la que puede cambiar el modelo predeterminado de los desarrolladores cuando coinciden tres factores: precios bajos por token, una ventana de contexto enorme y acceso inmediato desde un agregador. El modelo ocupó el primer puesto del ranking semanal de uso de OpenRouter entre el 27 de julio y el 2 de agosto, con 7,22 billones de tokens procesados. Pero esa cifra exige una lectura cuidadosa. 5
La versión del 31 de julio es un modelo mixture-of-experts (MoE), o mezcla de expertos: tiene 284.000 millones de parámetros totales, aunque activa 13.000 millones por token. OpenRouter le atribuye una ventana de contexto de 1.310.720 tokens y lo orienta a programación, razonamiento y flujos de trabajo con agentes. 1
Esa propuesta es especialmente atractiva cuando el volumen de texto procesado determina buena parte de la factura:
La arquitectura MoE, por sí sola, no demuestra que un modelo vaya a ser más barato en la práctica ni mejor en calidad. Su importancia es económica: al activar solo una fracción de sus parámetros para cada token, busca ofrecer gran capacidad sin el mismo perfil de cómputo por token de un modelo denso de tamaño total comparable. El beneficio real para una aplicación también depende de la latencia, la capacidad del proveedor, el enrutamiento, el diseño de los prompts y la longitud de las respuestas.
TechNode informó de que DeepSeek V4 Flash procesó 7,22 billones de tokens en OpenRouter durante la semana del 27 de julio al 2 de agosto. Según ese reporte, los modelos chinos ocuparon los cuatro primeros puestos; DeepSeek V4 Flash 0731 y V4 Pro también quedaron entre los seis primeros. 5
Sin embargo, el período comenzó antes de la salida pública de la versión 0731, el 31 de julio. V4 Flash ya existía como ruta de vista previa, y la versión 0731 reemplazó esa edición previa en el endpoint de API deepseek-v4-flash. 3 Por eso, el total semanal no debe presentarse como uso generado exclusivamente por el nuevo lanzamiento.
El acceso gratuito añade otra salvedad importante. El mismo informe indicó que OpenCode procesó 8 billones de tokens del modelo el 1 de agosto: 5 billones mediante pruebas gratuitas y 3 billones pagados por desarrolladores. 5 Las pruebas pueden ser estratégicamente valiosas porque reducen la fricción para evaluar un modelo, pero no son lo mismo que demanda de producción sostenida y de pago.
La conclusión más sólida es que V4-Flash consiguió una distribución y experimentación excepcionalmente rápidas. Los datos disponibles no prueban que todo ese volumen inicial procediera de migraciones pagadas ni de usos estables en producción.
Los precios cambian según proveedor, ruta, descuentos, uso de caché y fecha. La cifra de precio oficial citada en la cobertura del lanzamiento del 31 de julio fue de 0,14 dólares por millón de tokens de entrada sin caché y 0,28 dólares por millón de tokens de salida; a comienzos de agosto, OpenRouter mostraba tarifas distintas según la ruta. 3
La ficha posterior de OpenRouter para la ruta fechada deepseek-v4-flash-0731 muestra 0,05 dólares por millón de tokens de entrada, 0,16 dólares por millón de salida y 0,013 dólares por millón de tokens leídos desde caché. 1
Con esas tarifas listadas por OpenRouter, la diferencia respecto de los precios de comparación aportados es considerable:
| Modelo | Precio listado por 1 millón de tokens, entrada / salida | Frente a V4-Flash a 0,05 / 0,16 dólares |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 / 0,16 dólares |
Referencia |
| Kimi K3 | 3 / 15 dólares |
Aproximadamente 60× / 94× más caro |
| GPT-5.6 Sol | 5 / 30 dólares |
Aproximadamente 100× / 188× más caro |
| Claude Fable 5 | 10 / 50 dólares |
Aproximadamente 200× / 313× más caro |
Son comparaciones aritméticas de precios de lista, no una demostración de que los modelos ofrezcan la misma calidad, velocidad, fiabilidad de herramientas, comportamiento de seguridad o disponibilidad. Tampoco equivalen a un coste universal por tarea: la factura depende de la longitud de entrada y salida, el uso de caché, los reintentos, las llamadas a herramientas, el proveedor y la frecuencia con la que el flujo debe escalar a otro modelo.
No conviene tratar Kimi K3, GPT-5.6 Sol y Claude Fable 5 como intercambiables solo porque pueden utilizarse en programación avanzada y agentes. La fuente comparativa aportada describe a Kimi K3 como un MoE de 2,8 billones de parámetros con una ventana de contexto de un millón de tokens; también atribuye 1,05 millones de tokens de contexto a GPT-5.6 Sol y un millón a Claude Fable 5. 17
Para quien compra o integra estos modelos, la distinción útil es operativa:
Los benchmarks públicos ayudan a crear una lista corta, pero un único resultado no debería decidir el modelo de producción. La comparación concreta de 25,2 frente a 25,7 en “Agent Ultimate” no quedó respaldada de forma independiente por las fuentes principales aportadas, por lo que no debe utilizarse como evidencia de equivalencia. El material de lanzamiento de DeepSeek sí informa, entre otros resultados, de 82,7 en Terminal Bench 2.1 y 54,2 en NL2Repo; aun así, los benchmarks requieren validación sobre la carga de trabajo específica. 10
Para un equipo de desarrollo mediano, la pregunta rara vez es «¿qué modelo lidera un ranking?». La cuestión es: ¿qué modelo es suficientemente fiable en nuestro trabajo real como para ahorrar dinero incluso después de contabilizar los fallos y las derivaciones?
Una evaluación práctica puede seguir estos pasos:
Por eso el ascenso de V4-Flash importa incluso si las cifras iniciales estuvieron impulsadas por pruebas. Muestra cómo un agregador de modelos puede permitir que los desarrolladores prueben de inmediato una opción de contexto largo y muy bajo coste. Si ese modelo ofrece resultados suficientes en las evaluaciones de producción, puede desplazar volumen de tareas rutinarias desde opciones más caras.
La evidencia aportada respalda el liderazgo semanal de 7,22 billones de tokens en OpenRouter, el solapamiento con el período de vista previa y el componente de pruebas gratuitas reportado por OpenCode. 3
5 No respalda adecuadamente afirmaciones como que los modelos chinos ocuparon nueve de los diez primeros lugares, que superaron el volumen de llamadas de Estados Unidos durante 14 semanas consecutivas, que provocaron una migración generalizada de desarrolladores estadounidenses y europeos, que lograron reducciones reales de coste de inferencia del 60% al 85%, o que forzaron un recorte específico del 80% en el precio de GPT-5.6 Luna.
Para sostener esas afirmaciones harían falta datos directos del panel de OpenRouter, registros de precios de los proveedores o estudios reproducibles sobre cargas de trabajo. La lectura basada en la evidencia es más acotada: DeepSeek V4-Flash reunió precios de ruta inusualmente bajos, una ventana de contexto masiva y acceso amplio justo cuando los desarrolladores buscaban modelos más asequibles para agentes y programación. Eso basta para explicar un pico rápido de uso, pero no demuestra por sí solo un cambio permanente del mercado.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek V4 Flash lideró el ranking semanal de OpenRouter del 27 de julio al 2 de agosto con 7,22 billones de tokens procesados, pero esa semana abarcó tanto la versión previa como el lanzamiento del modelo 0731.
DeepSeek V4 Flash lideró el ranking semanal de OpenRouter del 27 de julio al 2 de agosto con 7,22 billones de tokens procesados, pero esa semana abarcó tanto la versión previa como el lanzamiento del modelo 0731. La ruta de OpenRouter para DeepSeek V4 Flash 0731 figura a 0,05 dólares por millón de tokens de entrada y 0,16 dólares por millón de salida, con una ventana de contexto de 1.310.720 tokens.
El tráfico de pruebas gratuitas fue un factor relevante: OpenCode procesó 8 billones de tokens del modelo el 1 de agosto, de los cuales 5 billones procedían de pruebas y 3 billones fueron pagados por desarrolladores.