A DeepSeek adotou cobrança por horário para o V4 Flash e o V4 Pro à 0h de 17 de agosto de 2026 no horário de Pequim; fora do pico, os preços são metade das tarifas de pico. Os períodos de pico são das 9h às 12h e das 14h às 18h, no horário de Pequim.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
A DeepSeek substituiu a tabela fixa de preços da API V4 por um modelo de cobrança baseado no horário. A mudança entrou em vigor à 0h de 17 de agosto de 2026 no horário de Pequim — 16h de 16 de agosto no UTC. As tarifas fora do pico são exatamente metade das tarifas de pico, mas os novos valores ficam entre 50% e 1.100% acima dos preços anteriores, dependendo do modelo, do tipo de token e do horário de uso. 1
2
A regra vale para os modelos DeepSeek-V4-Flash e DeepSeek-V4-Pro. Os horários de pico, no fuso de Pequim, são:
Todas as demais horas são consideradas fora do pico. Em UTC, as janelas correspondem a 1h–4h e 6h–10h. 4
6
A tarifa de uma solicitação é definida pelo horário em que os servidores da plataforma recebem o pedido — e não necessariamente pelo momento em que o processamento termina. Por isso, aplicações que programam filas e lotes precisam considerar o fuso de Pequim. 7
Na prática, a mesma chamada de API pode custar o dobro dependendo do horário. A mudança, portanto, não é apenas um reajuste uniforme: ela cria uma relação de 1 para 2 entre as tarifas fora do pico e no pico.
Os valores abaixo estão em yuan chineses por milhão de tokens. Cache hit indica que a entrada reaproveita um prefixo de prompt armazenado em cache; cache miss significa que o conteúdo precisa ser processado como uma nova entrada.
| Modelo e tipo de token | Preço anterior | Fora do pico | Variação | Pico | Variação |
|---|---|---|---|---|---|
| V4-Flash — entrada com cache hit | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash — entrada com cache miss | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash — saída | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro — entrada com cache hit | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1.100% |
| V4-Pro — entrada com cache miss | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro — saída | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
A documentação do V4-Flash confirma os valores de ¥0,05, ¥1,50 e ¥4,50 fora do pico para entrada com cache, entrada sem cache e saída, respectivamente. No pico, as tarifas sobem para ¥0,10, ¥3 e ¥9. 2 A Reuters informou que os aumentos gerais variam de 50% a 1.100%, conforme o modelo, a categoria de token e o período de uso.
1
8
Avaliações, indexação de documentos, reprocessamento de bases, geração de dados sintéticos e outras tarefas não urgentes podem ser colocadas em uma fila fora dos dois intervalos de pico. Como a tarifa fora do pico equivale à metade da tarifa de pico, o simples agendamento pode reduzir significativamente a conta de cargas de trabalho flexíveis. 2
Isso transforma o fuso horário em uma variável operacional da infraestrutura de IA. Um sistema de filas pode levar em conta o prazo de entrega e esperar por uma janela mais barata sem trocar de modelo nem diminuir o orçamento de tokens.
Chatbots de atendimento, assistentes de programação e agentes em tempo real normalmente precisam responder quando o usuário está ativo. Essas aplicações podem ficar expostas às tarifas de pico, mas ainda há formas de conter os custos:
O cache merece atenção especial. A entrada com cache hit continua muito mais barata que a entrada com cache miss nos dois modelos. Em sistemas que reenviam as mesmas instruções, definições de ferramentas ou trechos de documentos, aumentar a taxa de acertos do cache pode ser mais importante que pequenas reduções no volume total de solicitações.
Respostas extensas, relatórios, códigos e longas cadeias de raciocínio consomem tokens de saída. No horário de pico, cada milhão de tokens de saída custa ¥9 no Flash e ¥27 no Pro. 1
2
Para esses casos, os desenvolvedores podem impor limites de saída mais rigorosos, usar o Flash em interações rotineiras e deixar o Pro para tarefas cuja capacidade adicional justifique o preço.
A tarifa de pico para entrada com cache hit no V4-Pro é 12 vezes maior que o preço fixo anterior — o maior salto percentual da nova tabela. Em termos absolutos, o valor ainda é pequeno quando comparado ao custo de entradas sem cache e de tokens de saída. O impacto, porém, é relevante para aplicações de altíssimo volume que dependem de prompts repetidos em cache. 1
19
A alteração nos preços veio logo após a disponibilização geral do DeepSeek-V4-Pro-0813, acessível pelo endpoint deepseek-v4-pro em agosto. As especificações divulgadas descrevem um modelo de texto com janela de contexto de 1 milhão de tokens, saída máxima de 384 mil tokens e arquitetura de mistura de especialistas (MoE), com aproximadamente 1,6 trilhão de parâmetros totais e 49 bilhões de parâmetros ativos por token. 29
33
A capacidade de concorrência também diferencia os dois níveis:
Uma solicitação ocupa uma vaga até a conclusão da resposta, inclusive quando a transmissão é feita em fluxo contínuo. 28
Em conjunto, preços e limites sugerem uma segmentação em que o Flash atende melhor ao tráfego rotineiro de alto volume, enquanto o Pro ocupa uma faixa mais limitada para raciocínio exigente e tarefas com contexto extenso. Essa leitura é uma inferência baseada na estrutura de preços e de concorrência, não uma afirmação direta sobre todos os casos de uso. 2
28
A estratégia da DeepSeek se aproxima de um mecanismo de ajuste de demanda para inferência em GPUs. A procura tende a se concentrar nos horários em que usuários interativos estão conectados, enquanto muitos trabalhos em lote podem esperar. Cobrar mais nos períodos de maior demanda e menos nos demais cria um incentivo para distribuir o processamento ao longo do dia.
Para os desenvolvedores, isso amplia a equação de otimização. Controlar custos deixa de significar apenas escolher um modelo e contar tokens. As equipes também precisam decidir:
O movimento também aponta para uma mudança na guerra de preços dos grandes modelos. Em vez de competir apenas com tarifas fixas e cada vez menores, os provedores podem começar a precificar a escassez de capacidade. A DeepSeek mantém uma faixa mais barata para demandas flexíveis, mas torna o custo da inferência avançada mais sensível ao momento em que a capacidade é utilizada. A Reuters descreveu a medida como um aumento substancial que varia por modelo, categoria de token e período de uso — e não como uma sobretaxa única aplicada igualmente a tudo. 1
Para quem usa a API V4, a lição prática é direta: agendamento, cache, roteamento e controle do tamanho das respostas devem ser tratados como partes do mesmo modelo de custos. Uma carga que não pode esperar talvez exija outro modelo ou um orçamento menor de tokens. Já uma tarefa flexível pode preservar boa parte da economia se for executada fora do pico.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A DeepSeek adotou cobrança por horário para o V4 Flash e o V4 Pro à 0h de 17 de agosto de 2026 no horário de Pequim; fora do pico, os preços são metade das tarifas de pico.
A DeepSeek adotou cobrança por horário para o V4 Flash e o V4 Pro à 0h de 17 de agosto de 2026 no horário de Pequim; fora do pico, os preços são metade das tarifas de pico. Os períodos de pico são das 9h às 12h e das 14h às 18h, no horário de Pequim. No pico, a saída custa ¥9 por milhão de tokens no V4 Flash e ¥27 no V4 Pro.
Agendamento de tarefas, reutilização de prompts, uso de cache e escolha entre Flash e Pro agora fazem parte da mesma estratégia de controle de custos.