O DeepSeek V4 Flash liderou o ranking semanal do OpenRouter entre 27 de julho e 2 de agosto, com 7,22 trilhões de tokens processados — mas a semana também incluiu o período anterior à versão 0731. Na rota datada do OpenRouter, o modelo custa US$ 0,05 por milhão de tokens de entrada e US$ 0,16 por milhão de tokens de...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
O DeepSeek-V4-Flash-0731 virou um caso emblemático de como o padrão de escolha de modelos pode mudar rapidamente quando três fatores aparecem ao mesmo tempo: preço por token muito baixo, contexto enorme e acesso simples por um agregador. O modelo ficou em primeiro lugar no ranking semanal de uso do OpenRouter, de 27 de julho a 2 de agosto, com 7,22 trilhões de tokens processados. 5
Esse número chama atenção, mas precisa de contexto: ele não representa apenas a adoção da versão lançada em 31 de julho. E uma parcela relevante do tráfego inicial parece ter vindo de testes gratuitos.
A versão de 31 de julho usa uma arquitetura mixture-of-experts (MoE, ou mistura de especialistas): são 284 bilhões de parâmetros no total, mas 13 bilhões são ativados por token. O OpenRouter informa janela de contexto de 1.310.720 tokens e posiciona o modelo para programação, raciocínio e fluxos com agentes. 1
Na prática, essa combinação é interessante especialmente em tarefas nas quais o volume de texto pesa no custo:
A arquitetura MoE, por si só, não prova menor custo real nem qualidade superior. Sua relevância é econômica: ativar apenas uma fração dos parâmetros por token busca entregar grande capacidade sem o mesmo perfil de computação por token de um modelo denso de tamanho total equivalente. O resultado para uma aplicação depende de latência, capacidade do provedor, roteamento, desenho de prompts e tamanho das respostas.
Segundo a TechNode, o DeepSeek V4 Flash processou 7,22 trilhões de tokens no OpenRouter entre 27 de julho e 2 de agosto. A publicação também informou que modelos chineses ocuparam as quatro primeiras posições do ranking e que V4 Flash 0731 e V4 Pro ficaram entre os seis primeiros. 5
Há uma ressalva importante: a semana começou antes do lançamento público da versão 0731, em 31 de julho. O V4 Flash já existia como rota de prévia, e a versão 0731 substituiu essa prévia no endpoint de API deepseek-v4-flash. 3 Portanto, não é correto atribuir todo o volume semanal exclusivamente à nova versão.
O acesso gratuito é outro fator que dificulta interpretar o ranking como demanda comercial consolidada. A mesma reportagem disse que, em 1º de agosto, o OpenCode processou 8 trilhões de tokens para o modelo — 5 trilhões em testes gratuitos e 3 trilhões pagos por desenvolvedores. 5
Testes promocionais têm valor estratégico: reduzem a barreira para que desenvolvedores experimentem um modelo. Mas esse tráfego não é o mesmo que uso pago, recorrente e em produção. A conclusão mais sólida é que o V4-Flash alcançou distribuição e experimentação em ritmo excepcional; os dados disponíveis não demonstram que todo esse volume represente migrações pagas ou uso estável em produção.
Os preços variam conforme provedor, rota, descontos, uso de cache e data da consulta. A cobertura sobre o lançamento de 31 de julho citou preço oficial de US$ 0,14 por milhão de tokens de entrada sem cache e US$ 0,28 por milhão de tokens de saída. No começo de agosto, o OpenRouter exibia valores diferentes conforme a rota. 3
Na listagem posterior do OpenRouter para a rota datada deepseek-v4-flash-0731, o preço é de US$ 0,05 por milhão de tokens de entrada, US$ 0,16 por milhão de tokens de saída e US$ 0,013 por milhão de tokens de leitura de cache. 1
Com base nesses valores do OpenRouter, a diferença para os preços comparativos fornecidos é grande:
| Modelo | Preço listado por 1 milhão de tokens, entrada / saída | Em relação ao V4-Flash, a US$ 0,05 / US$ 0,16 |
|---|---|---|
| DeepSeek V4-Flash-0731 | US$ 0,05 / US$ 0,16 |
Base |
| Kimi K3 | US$ 3 / US$ 15 |
Cerca de 60× / 94× mais caro |
| GPT-5.6 Sol | US$ 5 / US$ 30 |
Cerca de 100× / 188× mais caro |
| Claude Fable 5 | US$ 10 / US$ 50 |
Cerca de 200× / 313× mais caro |
São comparações aritméticas de preços de tabela, não uma prova de qualidade, velocidade, confiabilidade no uso de ferramentas, comportamento de segurança ou disponibilidade equivalentes. Também não definem um “custo por tarefa” universal: a conta final depende do tamanho de entradas e saídas, cache, retentativas, chamadas de ferramentas, provedor escolhido e frequência com que o fluxo precisa escalar para outro modelo.
Kimi K3, GPT-5.6 Sol e Claude Fable 5 não devem ser tratados como intercambiáveis apenas porque atendem a casos avançados de programação e agentes. A fonte comparativa descreve o Kimi K3 como um MoE de 2,8 trilhões de parâmetros com contexto de 1 milhão de tokens; ela lista 1,05 milhão de tokens de contexto para o GPT-5.6 Sol e 1 milhão para o Claude Fable 5. 17
Para quem contrata ou integra esses modelos, a distinção mais útil é operacional:
Benchmarks públicos ajudam a formar uma lista inicial, mas uma pontuação isolada não deve definir o modelo padrão de produção. A comparação específica de 25,2 contra 25,7 no “Agent Ultimate” não foi confirmada de forma independente pelas fontes de caráter primário fornecidas e, por isso, não deve ser usada como evidência de equivalência. O material de lançamento da DeepSeek reporta, entre outros resultados, 82,7 no Terminal Bench 2.1 e 54,2 no NL2Repo; ainda assim, benchmarks precisam ser validados no fluxo real de cada empresa. 10
Para uma equipe de desenvolvimento de porte médio, a pergunta raramente é “qual modelo vence o ranking?”. A pergunta é: qual modelo é confiável o bastante no nosso trabalho real para economizar dinheiro depois de considerar roteamento e custo de falhas?
Uma avaliação prática inclui:
É por isso que a ascensão do V4-Flash importa mesmo que os números iniciais tenham sido impulsionados por testes. Ela mostra como um agregador de modelos com pouca fricção pode permitir que desenvolvedores experimentem imediatamente uma alternativa de contexto longo e custo muito baixo. Se ela tiver desempenho suficiente nas avaliações de produção, pode deslocar volume de tarefas rotineiras antes destinado a modelos mais caros.
As evidências fornecidas sustentam a liderança semanal de 7,22 trilhões de tokens no OpenRouter, a sobreposição com o período da prévia e o componente de testes gratuitos no OpenCode. 3
5 Elas não sustentam adequadamente alegações de que modelos chineses ocuparam nove das dez primeiras posições, superaram o volume de chamadas dos Estados Unidos por 14 semanas seguidas, provocaram migração ampla de desenvolvedores nos EUA e na Europa, geraram reduções reais de 60% a 85% no custo de inferência ou forçaram um corte específico de 80% no preço do GPT-5.6 Luna.
Essas afirmações exigiriam dados diretos do painel do OpenRouter, registros de preços dos provedores ou estudos reproduzíveis de cargas de trabalho. Por enquanto, a leitura baseada nas evidências é mais restrita: o DeepSeek V4-Flash combinou preços de rota excepcionalmente baixos, janela de contexto ampla e acesso disseminado justamente quando desenvolvedores buscavam modelos mais baratos para agentes e programação. Isso basta para produzir uma alta rápida no uso — mas não para provar, sozinho, uma mudança permanente no mercado.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O DeepSeek V4 Flash liderou o ranking semanal do OpenRouter entre 27 de julho e 2 de agosto, com 7,22 trilhões de tokens processados — mas a semana também incluiu o período anterior à versão 0731.
O DeepSeek V4 Flash liderou o ranking semanal do OpenRouter entre 27 de julho e 2 de agosto, com 7,22 trilhões de tokens processados — mas a semana também incluiu o período anterior à versão 0731. Na rota datada do OpenRouter, o modelo custa US$ 0,05 por milhão de tokens de entrada e US$ 0,16 por milhão de tokens de saída, além de oferecer janela de contexto de 1.310.720 tokens.
O uso inicial não equivale automaticamente a demanda paga e duradoura: em 1º de agosto, 5 dos 8 trilhões de tokens reportados no OpenCode vieram de testes gratuitos.