Microsoft er OpenAIs primære investor og eneforhandler af dets modeller via Azure, men internt opdagede man, at ingeniører brugte dyre avancerede modeller til trivielle opgaver, hvilket drev omkostninger i vejret, som selv virksomhedens eget finanshold ikke kunne acceptere . Executive Vice President Jay Parikh sendte en e-mail, hvori han slog fast, at "tokenmaxxing er ikke, hvad vi optimerer efter", og annoncerede, at afdelinger ville få AI-token budgetmål fra juli 2026 .
"Tokenmaxxing" blev en gamificeret adfærd. Ingeniører konkurrerede på interne leaderboards for at maksimere token-forbruget – AI-ækvivalenten til at behandle regnekraft som fantasy football-point . Praksisen blæste forbruget op uden målbar forretningsværdi, da virksomheder opdagede, at "at kaste AI efter alt" øgede omkostningerne uden en tilsvarende stigning i produktiviteten .
Satya Nadella måtte selv gribe ind og bad ingeniører om at stoppe med at bruge de mest kraftfulde AI-modeller til alle opgaver og i stedet matche modellen til problemet . Virksomheden skiftede sin interne standardmodel til den billigere GPT-5.6 og tilbagekaldte Claude Code-licenser for de fleste medarbejdere for at stoppe blødningen .
Branchen bevæger sig fra token-volumen som et forfængelighedsmål til resultatbaseret måling af AI-afkast.
Pensionering af token-leaderboards. Amazon og Meta har begge pensioneret interne AI-token leaderboards, efter medarbejdere spillede systemet . Metas CTO Andrew Bosworth advarede medarbejdere: "Al bevægelse er ikke fremskridt, og token-forbrug alene er ikke et mål for nogen form for effekt" .
Erstatning af token-tællinger med udrulningsmålinger. Amazon erstattede sit "KiroRank"-system med "normaliserede udrulninger" – der tæller AI-assisteret kode, der faktisk når produktion .
Per-ingeniør-lofter og modelinddeling. Meta overvejer per-ingeniør AI-token-loft . Virksomheder bevæger sig mod "model-niveau-rettigheder", der låser den rigtige (billigere) model til den rigtige rolle og sætter forbrugstærskelalarmer .
Budgetstyring frem for forbrugsmaksimering. Atlassian satte et loft over forbrug, efter at den månedlige AI-regning svulmede fra cirka 5 millioner dollars til over 15 millioner dollars . Citi tilbagekaldte midlertidigt adgang til de nyeste Claude- og ChatGPT-modeller for udviklere, efter de var blevet "den primære drivkraft for forhøjet virksomhedsforbrug" af puljede AI-kreditter . Anthropic sendte værktøjer til styring af virksomhedsudgifter som svar på, at 78% af virksomheder rapporterede om overraskende AI-regninger .
Den centrale lære: tokens er ikke pladser – i modsætning til traditionel SaaS skalerer generativ AI omkostninger med hver prompt, gentagelse og agent-løkke . Branchen behandler nu AI ikke som en uendelig produktivitetseliksir, men som en styret ressource, der kræver samme finansielle disciplin som enhver anden kritisk input, hvor succes måles på leveret kode, løste sager eller indvirkning på omsætning frem for rå token-forbrænding.