Pesquisa do Jefferies — Em um relatório datado de 10 de agosto de 2026, o banco de investimentos documentou que os preços de inferência de IA empresarial caíram para a mínima do ano. Os dados, citados pelo SCMP, mostraram preços médios de inferência de US$ 1,16 a US$ 1,18 por milhão de tokens entre 6 e 8 de agosto de 2026 . Isso representa uma queda de aproximadamente 43% em relação aos US$ 2,04 registrados em 31 de maio .
Índice de Gastos com Tokens LLM da Silicon Data — Este índice acompanhou a queda da média do índice de acima de US$ 2 por milhão de tokens no início de junho para US$ 1,20 na primeira semana de agosto — um declínio de cerca de 40% em dois meses . Uma leitura instantânea em 27 de julho mostrava US$ 1,43, confirmando a trajetória de queda . A Silicon Data citou diretamente os modelos chineses de peso aberto como um dos principais fatores que puxaram a média do índice para baixo .
A OpenAI reduziu os preços da API em até 80%, citando ganhos de eficiência de infraestrutura. As medidas comprimiram diretamente a média do mercado; CNBC e Forbes caracterizaram a ação como uma escalada da guerra de preços da IA .
A OpenAI atribuiu as reduções a otimizações internas, incluindo reescritas de kernel e decodificação especulativa, que supostamente geraram ganhos de eficiência de 20-35% em cargas de trabalho de inferência .
Em 31 de julho de 2026, a DeepSeek lançou o V4-Flash-0731 em beta público, mantendo os preços em:
Com cerca de um décimo do custo dos modelos de nível premium, o DeepSeek V4 Flash tornou-se o preço mínimo que forçou uma compressão mais ampla do mercado. De acordo com a empresa de benchmarking Artificial Analysis, o custo estimado por tarefa do V4 Flash é de aproximadamente 3 centavos de dólar . O modelo supera a prévia do próprio DeepSeek V4 Pro em todos os benchmarks de agente publicados, a um terço do preço de saída .
O Opus 5 entrou no mercado a US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída — idêntico ao seu predecessor Opus 4.8 — com um modo Rápido a 2x o preço base (US$ 10/US$ 50) . Embora o Opus 5 não tenha cortado preços, seu lançamento em um nível competitivo "quase de fronteira" (inteligência próxima ao Fable 5 pela metade do preço) pressionou os concorrentes e expandiu o conjunto de opções de baixo custo para as empresas .
O corte de 80% da OpenAI (30 de julho), o preço baixíssimo do Flash da DeepSeek (31 de julho), o lançamento competitivo do Opus 5 da Anthropic (24 de julho) e a ampla adoção empresarial de modelos chineses de código aberto de baixo custo comprimiram o índice de mercado de US$ 2,04 no final de maio para US$ 1,16–US$ 1,18 no início de agosto — uma queda de 43% em dez semanas .
Os analistas do Jefferies liderados por Thomas Chong atribuíram o declínio a uma "guerra de preços global intensificada" e a um "aumento na adoção de modelos chineses acessíveis de peso aberto" . A reação do mercado não se limitou aos preços: o Jefferies também argumentou que a queda nos custos dos tokens pode impulsionar a demanda por IA e os investimentos em infraestrutura .
O índice público da Silicon Data mostrava US$ 1,43 em 27 de julho, contra os US$ 1,20 relatados no início de agosto, sugerindo uma forte aceleração no final de julho/início de agosto impulsionada pelos anúncios da OpenAI e da DeepSeek . O índice combina preços e uso, o que significa que uma queda pode refletir tanto a redução dos preços de tabela quanto uma mudança na demanda para modelos mais baratos — a própria Silicon Data alertou contra a leitura do índice como uma etiqueta de preço pura .