Microsoft jest głównym inwestorem OpenAI i wyłącznym sprzedawcą jego modeli przez Azure, a jednak wewnętrznie okazało się, że inżynierowie używali drogich modeli granicznych do błahych zadań, generując koszty, które nawet własny dział finansowy firmy uznał za nieakceptowalne . Wiceprezes wykonawczy Jay Parikh wysłał e-mail z informacją: „tokenmaxxing to nie jest to, na czym nam zależy” i ogłosił, że od lipca 2026 r. każdy dział otrzyma budżet tokenów AI .
„Tokenmaxxing” stał się grą. Inżynierowie rywalizowali na wewnętrznych tablicach o maksymalne zużycie tokenów – odpowiednik traktowania mocy obliczeniowej jak punktów w fantasy football . Praktyka ta rozdęła konsumpcję bez mierzalnej wartości biznesowej; firmy odkryły, że „rzucanie AI na wszystko” podnosi koszty bez proporcjonalnego wzrostu produktywności .
Sam Nadella musiał interweniować, nakazując pracownikom zaprzestanie używania najpotężniejszych modeli AI do każdego zadania i dopasowanie modelu do problemu . Firma zmieniła domyślny model wewnętrzny na tańszy GPT-5.6 i cofnęła licencje Claude Code większości pracowników, by zatrzymać wzrost kosztów .
Branża przechodzi od liczby tokenów jako metryki próżności do pomiaru rezultatów w kwestii zwrotu z inwestycji w AI.
Likwidacja tablic tokenów. Amazon i Meta wycofały wewnętrzne tablice wyników zużycia tokenów po tym, jak pracownicy zaczęli manipulować systemem . Dyrektor techniczny Meta Andrew Bosworth ostrzegł pracowników: „Sam ruch to nie postęp, a samo zużycie tokenów nie jest miarą wpływu w żadnym sensie” .
Zastąpienie liczby tokenów wskaźnikami wdrożeń. Amazon zastąpił system „KiroRank” „znormalizowanymi wdrożeniami” – liczy się kod wspomagany AI, który faktycznie trafia do produkcji .
Limity na inżyniera i tier modeli. Meta rozważa wprowadzenie indywidualnych limitów tokenów na inżyniera . Firmy przechodzą na „uprawnienia na poziomie modelu”, które przypisują właściwy (tańszy) model do odpowiedniej roli oraz ustawiają alerty progów wydatków .
Zarządzanie budżetem zamiast maksymalizacji użycia. Atlassian ograniczył wydatki po tym, jak miesięczny rachunek za AI skoczył z około 5 milionów dolarów do ponad 15 milionów . Citi tymczasowo cofnął dostęp do najnowszych modeli Claude i ChatGPT dla programistów, gdy stały się „głównym motorem podwyższonego zużycia” puli kredytów AI w firmie . Anthropic wprowadził narzędzia kontroli wydatków dla przedsiębiorstw po tym, jak 78% firm zgłosiło niespodziewane rachunki za AI .
Kluczowa lekcja: tokeny to nie miejsca (seats) – w przeciwieństwie do tradycyjnego SaaS, generatywna AI skaluje koszty z każdym promptem, ponowieniem i pętlą agenta . Branża zaczyna traktować AI nie jak eliksir nieskończonej produktywności, ale jak zarządzany zasób wymagający takiej dyscypliny finansowej jak każdy inny krytyczny wkład, mierząc sukces oddanym kodem, rozwiązaniem zgłoszeń lub wpływem na przychody, a nie spalonymi tokenami.