O DeepSeek V4 Flash pode continuar excepcionalmente barato para agentes de longa duração porque a entrada armazenada em cache custa US$ 0,0028 por milhão de tokens, contra US$ 0,14 em uma falha de cache — uma diferenç... Provedores terceirizados podem anunciar tarifas menores, mas podem oferecer snapshots, quantizaç...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How can DeepSeek V4 Flash remain the cheapest major AI model—and potentially stay cheapest even after a 30× list-price increase—given that t. Article summary: DeepSeek V4 Flash can remain cheapest in effective cost because “price per input token” is the wrong unit for long-running agents. The decisive variable is the share of input that is served from a reusable prefix cache: . Topic tags: general, general web, user generated, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
A aparente vantagem de preço do DeepSeek V4 Flash esconde um detalhe que muitas comparações de manchete deixam de lado: entradas armazenadas em cache e entradas sem cache são cobradas de maneira muito diferente. Na tabela de preços publicada anteriormente, a entrada sem cache custava US$ 0,14 por milhão de tokens, a entrada com cache custava US$ 0,0028 e a saída, US$ 0,28. 12
Isso torna o Flash especialmente interessante para agentes de programação que reenviam repetidamente as mesmas instruções de sistema, definições de ferramentas, contexto de um repositório ou outros prefixos longos de prompt. Mas isso não garante a menor conta para todo usuário ou em toda rota de provedor.
O preço por token é apenas uma parte da conta de um agente. Para uma carga de trabalho em que h representa a fração da entrada atendida pelo cache, a tarifa média de entrada pode ser estimada assim:
h × tarifa de cache-hit + (1 − h) × tarifa de cache-miss
Com as tarifas anteriores, uma entrada com 99% de cache calcula aproximadamente US$ 0,00417 por milhão de tokens — cerca de 34 vezes menos que a tarifa de US$ 0,14 para cache-miss. Esse cálculo não inclui os tokens de saída, cobrados separadamente e capazes de dominar a conta quando o sistema gera muito código, explicações ou resultados de ferramentas.
Na prática, a mesma API pode produzir experiências bem diferentes:
A DeepSeek descreve o cache de sua API como um mecanismo automático de prefixos: prompts repetidos são cobrados pela tarifa reduzida de cache-hit. 12 O requisito prático é a reutilização rigorosa. Alterações no começo do prompt podem impedir que o conteúdo posterior aproveite o cache.
Provedores terceirizados podem anunciar preços inferiores aos da API oficial. A página atual da DeepInfra, por exemplo, lista variantes do V4 Flash por cerca de US$ 0,08 a US$ 0,09 por milhão de tokens de entrada e US$ 0,18 de saída, com tarifas separadas para entradas em cache. 29 A OpenRouter também lista vários provedores para diferentes snapshots do V4 Flash, com preços que variam conforme a versão e a rota.
21
22
Essas ofertas não são necessariamente produtos idênticos. Uma comparação relevante precisa verificar:
Um preço de tabela menor pode, portanto, ser realmente mais vantajoso para uma carga com pouco reaproveitamento de cache. Já uma rota oficial pode vencer em uma sessão longa cujo prefixo permanece intacto. A pergunta relevante não é “qual provedor tem o menor número na tarifa de entrada?”, mas sim: qual rota entrega o resultado concluído pelo menor custo confiável?
O cenário de 30 vezes é útil como teste de sensibilidade, não como previsão. Multiplicar a antiga tarifa de US$ 0,0028 para entradas em cache por 30 levaria o valor a US$ 0,084 por milhão de tokens. Ainda assim, ele ficaria abaixo da antiga tarifa de US$ 0,14 para entradas sem cache.
Mas essa comparação analisa apenas um item da conta. Se a saída também subisse 30 vezes, a antiga tarifa de US$ 0,28 passaria para US$ 8,40 por milhão de tokens. Uma carga com muita geração poderia ficar muito mais cara, mesmo que a entrada em cache continuasse relativamente barata. Da mesma forma, um fluxo com falhas frequentes de cache sentiria diretamente o aumento da entrada.
A conclusão é condicional:
O DeepSeek V4 Flash pode preservar uma vantagem baseada em cache mesmo depois de um aumento nominal muito grande, mas não continuaria sendo o mais barato para todas as combinações de cache-hits, cache-misses, tokens de saída e tarifas de provedores.
Tabelas divulgadas posteriormente introduziram tarifas para horários de menor e maior demanda. O V4 Flash foi listado a US$ 0,22 por milhão de tokens de entrada sem cache, US$ 0,007 para entrada em cache e US$ 0,66 para saída fora do pico. Nos horários de pico, os valores dobravam para US$ 0,44, US$ 0,014 e US$ 1,32. 10
20
São aumentos substanciais em relação à tabela anterior de US$ 0,14, US$ 0,0028 e US$ 0,28, mas não representam um aumento uniforme de 30 vezes. A cobrança por horário pode ajudar a deslocar trabalhos que podem ser agendados para longe dos períodos mais movimentados ou racionar capacidade escassa. Sozinha, porém, ela não demonstra se os custos de serviço aumentaram, se a demanda continuou excepcionalmente alta ou se os dois fatores pesaram.
Para quem compra capacidade de IA, a lição operacional é mais simples: o horário em que um agente é executado pode passar a fazer parte do modelo de custos. Se os trabalhos puderem ser agendados, compare as contas de pico e fora do pico em vez de confiar em uma única tarifa nominal.
Um experimento comunitário com 20 mil requisições atribuiu ao DeepSeek uma taxa de cache-hit de 100% ao longo de 12 horas. O mesmo relato registrou um resultado muito inferior para o GLM após cinco minutos e desempenho intermediário para outros modelos. 31
A observação é interessante porque mostra por que agentes de longa duração podem classificar os provedores de forma diferente de prompts curtos. No entanto, ela não constitui um benchmark independente e replicado entre modelos. Os resultados dependem da construção do prefixo exato, da expulsão de entradas do cache, do roteamento, da concorrência, da retenção e da formatação dos prompts pelo cliente.
Desenvolvedores devem repetir o teste com a própria trajetória do agente e registrar separadamente os tokens de cache-hit e cache-miss. Uma arquitetura de prompt estável — instruções fixas primeiro e dados variáveis depois — pode tornar a economia muito mais favorável, mas o resultado precisa ser medido, não presumido.
O OpenCode Go é um produto diferente do acesso direto à API. A documentação descreve uma assinatura de US$ 10 por mês que inclui o DeepSeek V4 Flash e usa limites móveis baseados em valor, incluindo US$ 12 em cinco horas, US$ 30 por semana e US$ 60 por mês. 1
Não é possível comparar essa assinatura de forma justa com a API direta olhando apenas para a mensalidade ou para a tarifa por token do provedor. O OpenCode controla o roteamento e o limite efetivo, enquanto a API direta expõe a cobrança por tokens e o comportamento do cache. Relatos sobre o plano também indicam que o valor de uso atribuído ao V4 Flash mudou depois do aumento de preço. 6
A afirmação de que o Go seria de duas a dez vezes mais caro em sessões longas exigiria executar o mesmo fluxo de prompts pelas duas rotas, registrando:
Sem essa comparação controlada, a conclusão mais segura é mais estreita: uma assinatura pode parecer mais barata no papel, mas produzir um custo efetivo maior se sua rota perder contexto reutilizável. Esse resultado depende da carga de trabalho.
Em uma comparação realista, meça o custo por tarefa concluída, e não apenas o custo por milhão de tokens de entrada. Use o mesmo snapshot do modelo e a mesma sequência de prompts em cada provedor. Depois, registre:
Execute tanto um fluxo favorável ao cache quanto outro que dificulte seu uso. O primeiro mostra o potencial de prefixos estáveis; o segundo revela o que acontece quando o agente altera o contexto a todo momento.
O DeepSeek V4 Flash pode continuar entre as opções de menor custo para agentes de programação de longa duração porque o cache de prefixos muda a economia do contexto repetido. Uma rota terceirizada ainda pode oferecer um preço de tabela menor, e mesmo um grande reajuste pode deixar a entrada em cache competitiva. Nenhum desses fatos prova que o Flash seja universalmente o mais barato.
As variáveis decisivas são a taxa de cache-hit, o volume de saída, os preços em horários de pico, a implementação do provedor e o custo de concluir a tarefa com confiabilidade. Em sistemas de produção, essas medições importam mais do que qualquer comparação isolada de preços publicados.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O DeepSeek V4 Flash pode continuar excepcionalmente barato para agentes de longa duração porque a entrada armazenada em cache custa US$ 0,0028 por milhão de tokens, contra US$ 0,14 em uma falha de cache — uma diferenç...
O DeepSeek V4 Flash pode continuar excepcionalmente barato para agentes de longa duração porque a entrada armazenada em cache custa US$ 0,0028 por milhão de tokens, contra US$ 0,14 em uma falha de cache — uma diferenç... Provedores terceirizados podem anunciar tarifas menores, mas podem oferecer snapshots, quantizações, rotas, políticas de cache e níveis de serviço diferentes.
Um aumento hipotético de 30 vezes elevaria a entrada em cache para US$ 0,084 por milhão de tokens na tabela original — ainda abaixo da antiga tarifa de US$ 0,14 para entradas sem cache —, mas não faria do Flash a opçã...