A Microsoft é a principal investidora da OpenAI e a revendedora exclusiva de seus modelos via Azure. No entanto, internamente, descobriu que seus engenheiros estavam usando modelos de fronteira caros para tarefas triviais, gerando custos que nem o próprio time financeiro conseguia tolerar . O vice-presidente executivo Jay Parikh enviou um e-mail afirmando que "tokenmaxxing não é o que estamos otimizando" e anunciou que, a partir de julho de 2026, as divisões teriam metas orçamentárias de tokens de IA .
O 'tokenmaxxing' virou um jogo. Engenheiros competiam em rankings internos para maximizar o uso de tokens — o equivalente na IA a tratar poder computacional como pontos de fantasia . A prática inflava o consumo sem valor de negócio mensurável, à medida que as empresas descobriam que "jogar IA em tudo" aumentava os custos sem um pico proporcional de produtividade .
O próprio Satya Nadella teve que intervir, dizendo aos funcionários para pararem de usar os modelos de IA mais poderosos para toda e qualquer tarefa e para adequar o modelo ao problema . A empresa trocou seu modelo interno padrão para o GPT-5.6, mais barato, e revogou as licenças do Claude Code para a maioria dos funcionários para estancar o prejuízo .
O setor está migrando do volume de tokens como métrica de vaidade para a medição do retorno da IA baseada em resultados.
Aposentadoria dos rankings de tokens. A Amazon e a Meta descontinuaram seus rankings internos de uso de tokens depois que funcionários começaram a manipulá-los . O CTO da Meta, Andrew Bosworth, alertou a equipe: "Nem todo movimento é progresso, e o uso de tokens sozinho não é uma medida de impacto de nenhum tipo" .
Substituição de contagem de tokens por métricas de implantação. A Amazon substituiu seu sistema "KiroRank" por "deployments normalizados" — que contam o código assistido por IA que efetivamente chega à produção .
Limites por engenheiro e hierarquia de modelos. A Meta está considerando limites de tokens de IA por engenheiro . As empresas estão adotando "direitos de uso por nível de modelo" que vinculam o modelo correto (mais barato) à função correta e configuram alertas de limite de gastos .
Governança orçamentária em vez de maximização de uso. A Atlassian limitou os gastos depois que sua conta mensal de IA saltou de cerca de 5 milhões de dólares para mais de 15 milhões . O Citi revogou temporariamente o acesso aos modelos mais recentes do Claude e do ChatGPT para desenvolvedores depois que eles se tornaram "o principal impulsionador do consumo empresarial elevado" de créditos de IA agrupados . A Anthropic lançou ferramentas de controle de gastos empresariais em resposta a 78% das empresas que relataram contas de IA surpresa .
A lição central: tokens não são assentos — diferentemente do SaaS tradicional, a IA generativa escala custos a cada prompt, retentativa e loop de agente . O setor agora trata a IA não como um elixir ilimitado de produtividade, mas como um recurso governado que exige a mesma disciplina financeira de qualquer outro insumo crítico, medindo o sucesso pelo código entregue, tickets resolvidos ou impacto na receita, e não pela queima bruta de tokens.