| GPT-5.6 Terra — opção equilibrada | US$ 2 | US$ 12 | Queda de 20%, ante US$ 2,50 e US$ 15 |
| GPT-5.6 Sol — modelo mais avançado | US$ 5 | US$ 30 | Preço inalterado; ganhou o modo Fast |
Na prática, o Luna passou a custar US$ 1,40 por milhão de tokens quando se somam entrada e saída, um valor que o coloca entre os modelos de fronteira mais baratos do mercado . O Terra passou a ter custo combinado de US$ 14 por milhão de tokens.
Já o modo Fast do Sol oferece velocidade de até 2,5 vezes a do processamento Standard, mas custa o dobro do preço do modo padrão. Segundo a OpenAI, não há perda de capacidade do modelo nessa modalidade .
Tokens são as unidades usadas para medir o texto processado por um modelo de IA. A cobrança normalmente separa o conteúdo enviado pelo usuário da resposta gerada pelo sistema.
O aspecto mais incomum do anúncio é a origem de parte da economia. Em 29 de julho, a OpenAI afirmou que o GPT-5.6 Sol reescreveu e otimizou de forma autônoma kernels de GPU usados em seu ambiente de produção .
Kernels são trechos de código de baixo nível que executam operações diretamente no hardware. Por meio do ambiente de desenvolvimento Codex, o modelo se conectou à infraestrutura interna da OpenAI, projetou e executou centenas de experimentos de arquitetura, acompanhou implantações e iterou com base nos resultados . Também aprendeu a trabalhar com Triton e Gluon, linguagens usadas na pilha de kernels da empresa .
A OpenAI divulgou dois resultados principais :
Esses ganhos fizeram parte de uma otimização mais ampla da infraestrutura. Relatos também mencionam mudanças no balanceamento de carga, que distribui as solicitações de acordo com fatores como localização geográfica, tipo de acelerador e disponibilidade de cache .
A OpenAI também adotou cache de prompt com validade aproximada de 30 minutos. Quando o conteúdo já está armazenado, a entrada em cache pode custar 90% menos do que uma entrada nova . Isso é especialmente relevante para aplicações que processam repetidamente o mesmo código, documentos ou contexto.
A redução de preços não acontece no vácuo. Em poucas semanas, novos modelos alteraram as expectativas sobre quanto custa acessar recursos avançados de IA.
Lançado em 17 de julho, o Kimi K3 é um modelo de pesos abertos com 2,8 trilhões de parâmetros, desenvolvido pela startup chinesa Moonshot AI. A empresa afirmou que o sistema se aproxima do desempenho de modelos avançados dos Estados Unidos .
Em avaliações de programação para interfaces, o Kimi K3 igualou ou superou o GPT-5.6 Sol e o Fable 5 da Anthropic em alguns testes . No ranking de Frontend Code da Arena, obteve 1.679 pontos, à frente dos dois concorrentes .
Um teste independente publicado em 30 de julho pela Startrise AI Labs colocou o Kimi K3 em empate técnico com o Claude Opus 5 em uma avaliação de engenharia de front-end. A execução da bateria completa custou US$ 7,17 com o Kimi K3, contra US$ 21,17 com o Opus 5 .
O modelo também chamou a atenção da Microsoft. Segundo relatos, a empresa considerou testá-lo no Copilot e no Azure; a eventual substituição poderia economizar até US$ 600 milhões, ou 60% por token, de acordo com as estimativas citadas .
A Anthropic lançou o Claude Opus 5 em 24 de julho por US$ 5 por milhão de tokens de entrada — metade do preço do Fable 5 — e o modelo supera o antecessor em diversos benchmarks . Isso aumentou a pressão justamente na faixa premium em que o GPT-5.6 Sol compete.
Google e Microsoft também lançaram, em julho, modelos com foco em custo-benefício, comprimindo as margens dos segmentos intermediário e econômico .
Nesse cenário, a estratégia da OpenAI parece separar claramente os papéis: o Luna funciona como uma opção de baixo custo para cargas de alto volume e sensíveis a preço, enquanto o Sol continua como o produto premium para tarefas mais complexas .
A guerra de preços acompanha uma mudança na forma como as empresas compram e usam IA. Com agentes capazes de executar tarefas em sequência, uma aplicação pode consumir muitos tokens sem que o gasto seja imediatamente percebido.
Em 22 de julho de 2026, a OpenAI adicionou limites mensais rígidos de gasto à plataforma de API . Diferentemente dos limites flexíveis introduzidos anteriormente no ChatGPT Enterprise, o novo recurso pode interromper de fato as solicitações: quando o orçamento configurado é atingido, as chamadas da API passam a falhar com o código HTTP 429 .
Os administradores podem definir limites para toda a organização ou para projetos específicos, com renovação no início do ciclo mensal de cobrança .
Amazon e outras grandes empresas também vêm impondo limites internos e para clientes enquanto avaliam com mais rigor o retorno sobre o investimento em IA . Segundo a Reuters, áreas de compras passaram a tratar a tecnologia “da mesma forma que tratam a nuvem”, com orçamentos dedicados, alocações máximas e aprovação de executivos de tecnologia para implementações de grande escala .
A mensagem para o mercado é direta: o período em que empresas aceitavam “gastar o que fosse necessário” para adotar IA está chegando ao fim. Preços menores por token ajudam, mas controles de orçamento passam a ser igualmente importantes.
Para desenvolvedores e empresas que usam a API da OpenAI, o impacto imediato é favorável:
O corte de 80% no Luna mostra que a competição na IA não está sendo decidida apenas por benchmarks. Eficiência de infraestrutura, modelos de pesos abertos e disciplina financeira das empresas estão pressionando os preços ao mesmo tempo.
A tendência, portanto, é de novas reduções à medida que técnicas de auto-otimização amadurecem e modelos abertos continuam diminuindo a distância de capacidade para os sistemas proprietários.