La decisione di Microsoft non è una semplice misura di riduzione dei costi. È un segnale importante che l'era del 'tokenmaxxing' — trattare il consumo massimo di token AI come indicatore di produttività e innovazione — è finita in tutto il settore tecnologico .
Tre pressioni specifiche hanno costretto Microsoft a imporre una disciplina interna sull'IA:
Costi interni fuori controllo. I team di ingegneria di Microsoft usavano liberamente i modelli AI più avanzati tramite GitHub Copilot, facendo esplodere il consumo di token e i costi di inferenza ben oltre quanto l'azienda considerasse sostenibile. Le linee guida interne di Copilot riconoscevano che molti ingegneri spendevano "tra le centinaia e le migliaia di dollari al mese in token" . L'email di Parikh chiariva che, a partire da luglio 2026, ogni divisione avrebbe operato con un obiettivo di budget per i token AI e che ogni dipendente avrebbe potuto monitorare il proprio utilizzo tramite una dashboard interna .
Incentivi distorti. Gli ingegneri avevano iniziato a considerare un elevato consumo di token come un distintivo di produttività, una pratica nota in tutto il settore come tokenmaxxing. Ma Microsoft ha scoperto che più token non significavano più valore per l'azienda. Parikh ha ridefinito esplicitamente l'obiettivo: "Non stiamo ottimizzando per avere meno token. Stiamo ottimizzando per l'impatto per ogni token" .
Il problema della credibilità. In quanto azienda che vende abbonamenti AI — Azure OpenAI Service, GitHub Copilot, Microsoft 365 Copilot — Microsoft non poteva credibilmente dire ai clienti di tenere sotto controllo i costi dell'IA mentre i suoi stessi team bruciavano token senza freni . L'email di Parikh sottolineava che l'azienda avrebbe "gestito la spesa per i token con la stessa disciplina che applichiamo a ogni altra risorsa critica" .
Le modifiche alle policy sono entrate in vigore immediatamente a luglio 2026 :
La mossa di Microsoft è un dato in una correzione molto più ampia in atto in tutto il settore tecnologico. Il 'tokenmaxxing' — la pratica di spingere aggressivamente il consumo di token AI come indicatore di innovazione — si è diffuso tra le aziende tech da circa la fine del 2025 a metà del 2026, ma ora sta rapidamente collassando perché l'economia non funzionava .
Il budget bruciato di Uber. Uber Technologies ha esaurito l'intero budget AI per il 2026 in pochi mesi. Il suo CTO ha dichiarato pubblicamente: "Stiamo arrivando alla fine della cosiddetta era del tokenmaxxing", aggiungendo che il consumo grezzo di token non si traduceva in ritorni misurabili . L'azienda si sta ora muovendo verso l'ottimizzazione del costo per interazione attraverso il caching dei prompt, modelli predefiniti più efficienti e una migliore visibilità sui consumi .
L'avvertimento di Gartner. Gartner ha previsto che i costi del coding AI supereranno presto lo stipendio medio degli sviluppatori con i modelli di prezzo a consumo, costringendo i CFO di tutti i settori a richiedere disciplina sui costi .
La matematica delle startup. Le startup hanno dimostrato che cambiare modello può ridurre i costi di inferenza di circa il 90%. Lindy.ai, ad esempio, ha spostato il 100% del suo traffico API da Claude a DeepSeek dall'oggi al domani, citando costi di inferenza inferiori di circa il 90% per una qualità di output paragonabile per il suo core di attività . Tali risparmi drammatici rendono la vecchia mentalità "più token = meglio" finanziariamente insostenibile .
Il verdetto di Forbes e Fortune. Diverse testate economiche hanno dichiarato l'era del tokenmaxxing strutturalmente conclusa. Le aziende stanno abbandonando l'utilizzo grezzo come metrica a favore di implementazioni incentrate sull'efficienza, il routing dei modelli (usare modelli più economici per compiti più semplici) e la fatturazione basata sui risultati, che rimuove l'incentivo a massimizzare i token . Forbes ha definito il tokenmaxxing "una fase di transizione nell'adozione dell'AI" che ha aiutato a normalizzare l'uso ma "non è un modello operativo sostenibile" .
Il pattern del settore è ora chiaro: le aziende che inizialmente incoraggiavano un uso senza restrizioni dell'IA stanno imponendo budget, passando a modelli più economici e chiedendo che ogni token speso sia legato a un risultato aziendale misurabile. Il chief customer officer di ServiceNow ha avvertito che il tokenmaxxing è un ciclo di hype dell'IA . Il verdetto di Fortune è stato lapidario: "Il tokenmaxxing è morto. Non ha prodotto il ROI sull'IA che le aziende volevano" .
I budget interni di token di Microsoft e il passaggio a GPT-5.6 sono un esempio da manuale di questa resa dei conti a livello di settore — che arriva non da un ritardatario dell'IA, ma da uno dei maggiori investitori del settore. Se l'azienda che vende abbonamenti AI ha bisogno di un budget, il messaggio per ogni altra impresa è chiaro.