DeepSeek cambió V4 Flash y V4 Pro a un sistema de tarifas según el horario a las 00:00 del 17 de agosto de 2026, hora de Pekín. En hora punta, la salida cuesta ¥9 por millón de tokens en V4 Flash y ¥27 en V4 Pro; las entradas con acierto de caché siguen siendo mucho más baratas que las entradas sin caché.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek sustituyó el precio fijo de su API V4 por un sistema de facturación de horas punta y horas valle a las 00:00 del 17 de agosto de 2026, hora de Pekín —las 16:00 UTC del 16 de agosto—. Las tarifas valle son exactamente la mitad de las tarifas punta, pero los nuevos precios representan aumentos de entre el 50 % y el 1.100 % frente a las tarifas anteriores, según el modelo, el tipo de token y la hora de uso. 1
2
El nuevo esquema se aplica a DeepSeek-V4-Flash y DeepSeek-V4-Pro. Las horas punta, según el horario de Pekín, son:
El resto del día se considera horario valle. La tarifa de una solicitud depende del momento en que los servidores de la plataforma la reciben, no necesariamente de cuándo termina de procesarse. Por eso, los equipos que programen tráfico deben tener en cuenta la hora de Pekín. 2
7
En la práctica, una misma llamada puede costar el doble si llega durante cualquiera de las dos franjas punta.
Las cantidades siguientes están expresadas en yuanes por millón de tokens. Entrada con acierto de caché significa que el sistema puede reutilizar un prefijo de prompt almacenado previamente; entrada sin acierto de caché significa que debe procesar el contenido completo como entrada nueva.
| Modelo y tipo de token | Tarifa anterior | Valle | Cambio frente a la anterior | Punta | Cambio frente a la anterior |
|---|---|---|---|---|---|
| V4-Flash, entrada con acierto de caché | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, entrada sin acierto de caché | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, salida | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, entrada con acierto de caché | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1.100 % |
| V4-Pro, entrada sin acierto de caché | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, salida | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
En V4-Flash, la documentación recoge tarifas valle de ¥0,05, ¥1,50 y ¥4,50 para entradas con caché, entradas sin caché y salidas, respectivamente. En horario punta, suben a ¥0,10, ¥3 y ¥9. 2 Reuters situó entre el 50 % y el 1.100 % el rango de los aumentos aplicados a los distintos modelos y categorías de tokens.
1
8
Evaluaciones, indexación de documentos, procesos de actualización masiva, generación de datos sintéticos y otras tareas no urgentes pueden ponerse en cola fuera de las dos franjas punta. Como el precio valle es la mitad del precio punta, programar el momento de ejecución puede reducir de forma apreciable el coste de los trabajos flexibles. 2
Esto introduce la zona horaria como una nueva variable operativa para la infraestructura de IA. Una cola que conozca tanto la fecha límite como las ventanas de facturación en horario de Pekín puede retrasar una tarea sin cambiar de modelo ni reducir su presupuesto de tokens.
Los servicios de atención al cliente, asistentes de programación y agentes en tiempo real suelen funcionar cuando los usuarios están activos. En esos casos, asumir tarifas punta puede ser inevitable. Aun así, los equipos pueden contener el gasto mediante la reutilización de prompts, un diseño favorable a la caché, respuestas más breves y un enrutamiento que reserve Pro para las solicitudes que realmente lo necesiten.
La caché cobra especial importancia: en ambos modelos, una entrada con acierto de caché sigue siendo mucho más barata que una entrada sin él. En sistemas de gran volumen que repiten las mismas instrucciones, definiciones de herramientas o fragmentos de contexto, mejorar la tasa de aciertos puede tener más impacto que reducir ligeramente el número total de solicitudes.
Las trazas largas de razonamiento, los informes extensos y las respuestas de código consumen tokens de salida. En hora punta, esos tokens cuestan ¥9 por millón en Flash y ¥27 por millón en Pro. Algunas medidas posibles son limitar la longitud de las respuestas, utilizar Flash en las interacciones rutinarias y reservar Pro para los casos en los que sus capacidades adicionales justifiquen el sobreprecio. 1
2
La tarifa punta de entrada con acierto de caché de V4-Pro equivale a 12 veces la tarifa fija anterior, el mayor incremento porcentual del nuevo esquema. El precio absoluto continúa siendo reducido frente al de las entradas sin caché y las salidas, pero el cambio puede ser relevante para aplicaciones que procesan volúmenes muy grandes de prompts repetidos. 1
19
El cambio de precios llegó después de la disponibilidad general de DeepSeek-V4-Pro-0813, ofrecido mediante el endpoint deepseek-v4-pro. Las especificaciones publicadas describen un modelo de texto con una ventana de contexto de un millón de tokens, una salida máxima de 384.000 tokens y una arquitectura de mezcla de expertos —MoE— con aproximadamente 1,6 billones de parámetros totales y 49.000 millones activos por token. 29
33
Los límites de concurrencia documentados también diferencian ambos niveles:
Una solicitud ocupa un puesto hasta que termina por completo, incluidas las respuestas transmitidas por streaming. 28
En conjunto, los precios y los límites apuntan a una segmentación en la que Flash encaja mejor con tráfico rutinario de alto volumen, mientras que Pro se orienta a tareas de razonamiento exigente y grandes contextos con una capacidad más limitada. Esta lectura es una inferencia basada en la estructura económica y los límites publicados, no una afirmación de DeepSeek sobre todos los casos de uso. 2
28
El movimiento de DeepSeek se parece a una estrategia de gestión de la demanda para la inferencia en GPU. Los proveedores afrontan una concentración de solicitudes durante las horas en que se conectan los usuarios de aplicaciones interactivas, mientras que muchos trabajos por lotes pueden esperar. Cobrar más en esos periodos y menos en los demás crea incentivos para distribuir el uso de la capacidad a lo largo del día.
Para los desarrolladores, el problema de optimización cambia. Ya no basta con elegir un modelo y contar tokens. Los equipos de producción también deben decidir:
La consecuencia más amplia es un desplazamiento desde la competencia basada en tarifas planas hacia precios vinculados a la escasez de capacidad. DeepSeek mantiene una opción más barata para la demanda flexible, pero hace que el coste de la inferencia avanzada dependa más del momento en que se utiliza. Reuters describió el cambio como un aumento considerable que varía según el modelo, la categoría de token y el periodo de uso, no como un recargo uniforme para todos los clientes. 1
Para los equipos que utilizan DeepSeek V4, la conclusión es directa: la programación, la caché, el enrutamiento y los límites de salida forman parte del modelo de costes de la API. Una carga que no pueda aplazarse quizá necesite otro modelo o un presupuesto de tokens más ajustado; una tarea que sí pueda esperar puede conservar buena parte de su economía si se ejecuta en horario valle.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek cambió V4 Flash y V4 Pro a un sistema de tarifas según el horario a las 00:00 del 17 de agosto de 2026, hora de Pekín.
DeepSeek cambió V4 Flash y V4 Pro a un sistema de tarifas según el horario a las 00:00 del 17 de agosto de 2026, hora de Pekín. En hora punta, la salida cuesta ¥9 por millón de tokens en V4 Flash y ¥27 en V4 Pro; las entradas con acierto de caché siguen siendo mucho más baratas que las entradas sin caché.
La nueva estructura convierte la selección del modelo, la reutilización de prompts, el control de la salida y la programación de tareas en decisiones conectadas de costes.