Het besluit van Microsoft is geen geïsoleerde bezuinigingsmaatregel. Het is een duidelijk signaal dat het tijdperk van 'tokenmaxxen' – het behandelen van maximaal AI-tokenverbruik als een graadmeter voor productiviteit en innovatie – in de hele technologiesector voorbij is .
Drie specifieke drukken dwongen Microsoft tot interne AI-discipline:
Exploderende interne kosten. De eigen technische teams van Microsoft maakten vrijelijk gebruik van geavanceerde AI-modellen via GitHub Copilot, wat leidde tot een tokenverbruik en inferentiekosten die ver boven wat het bedrijf duurzaam achtte. Interne Copilot-richtlijnen erkennen dat veel engineers 'ergens tussen de honderden dollars per maand en een paar duizend dollar aan tokens' uitgaven . Parikhs e-mail maakte duidelijk dat vanaf juli 2026 elke divisie zou opereren met een AI-tokenbudgetdoelstelling, en dat individuele medewerkers hun eigen verbruik konden volgen via een intern dashboard .
Verkeerde prikkels. Engineers waren hoog tokenverbruik gaan beschouwen als een prestigeteken, een praktijk die in de industrie bekend staat als tokenmaxxen. Maar Microsoft ontdekte dat meer tokens niet gelijk stonden aan meer bedrijfswaarde. Parikh herformuleerde het doel van het bedrijf expliciet: 'We sturen niet op minder tokens. We sturen op impact per token' .
Het geloofwaardigheidsprobleem. Als bedrijf dat AI-abonnementen verkoopt – Azure OpenAI Service, GitHub Copilot, Microsoft 365 Copilot – kon Microsoft niet geloofwaardig klanten vertellen hun AI-kosten te beheersen terwijl de eigen teams ongeremd tokens verbruikten . Parikhs e-mail merkte op dat het bedrijf 'tokenuitgaven zou beheren met dezelfde discipline die we toepassen op elke andere kritieke hulpbron' .
Het beleid werd met ingang van juli 2026 onmiddellijk van kracht :
De actie van Microsoft is één datapunt in een veel bredere correctie die plaatsvindt in de techindustrie. 'Tokenmaxxen' – de praktijk van het agressief stimuleren van AI-tokenverbruik als maatstaf voor innovatie – werd wijdverbreid onder techbedrijven van ongeveer eind 2025 tot halverwege 2026, maar stort nu snel in omdat de economie niet klopte .
Ubers budgetexplosie. Uber Technologies had zijn volledige AI-budget voor 2026 in een paar maanden opgemaakt. De CTO verklaarde publiekelijk: 'We naderen het einde van het zogenaamde tokenmaxxing-tijdperk', en voegde eraan toe dat ruw tokenverbruik niet leidde tot meetbare rendementen . Het bedrijf verschuift nu naar optimalisatie van de kosten per interactie door middel van prompt caching, efficiëntere standaardmodellen en beter inzicht in het verbruik .
Gartners waarschuwing. Gartner voorspelt dat AI-codeerkosten onder verbruiksgebaseerde prijsmodellen binnenkort de gemiddelde developerssalarissen zullen overtreffen, waardoor CFO's in alle sectoren kostenbeheersing zullen eisen .
De start-uprekensom. Startups hebben aangetoond dat het wisselen van model de inferentiekosten met ruwweg 90% kan verlagen. Lindy.ai verplaatste bijvoorbeeld 100% van zijn API-verkeer van Claude naar DeepSeek van de ene op de andere dag, daarbij verwijzend naar ruwweg 90% lagere inferentiekosten voor een vergelijkbare uitvoerkwaliteit bij zijn kerntaken . Zulke dramatische besparingen maken de oude 'meer tokens = beter'-mentaliteit financieel onhoudbaar .
Oordeel van Forbes en Fortune. Meerdere zakenmedia hebben het tokenmaxxing-tijdperk structureel ten einde verklaard. Bedrijven stappen af van ruw verbruik als maatstaf en kiezen voor efficiëntiegerichte implementaties, modelroutering (goedkopere modellen gebruiken voor eenvoudigere taken) en resultaatgerichte facturering die de prikkel om tokens te maximaliseren wegneemt . Forbes omschreef tokenmaxxen als 'een overgangsfase in AI-adoptie' die hielp bij het normaliseren van gebruik, maar 'geen duurzaam bedrijfsmodel' is .
Het patroon in de industrie is nu duidelijk: bedrijven die aanvankelijk onbeperkt AI-gebruik aanmoedigden, voeren budgetten in, stappen over op goedkopere modellen en eisen dat elke bestede token wordt gekoppeld aan een meetbaar bedrijfsresultaat. De chief customer officer van ServiceNow waarschuwde dat tokenmaxxen een AI-hypecyclus is . Fortunes oordeel was bondig: 'Tokenmaxxing is dood. Het leverde niet de AI-ROI op die bedrijven wilden' .
Microsofts interne tokenbudgetten en GPT-5.6-standaard zijn een schoolvoorbeeld van deze brede afrekening in de industrie – niet afkomstig van een AI-achterblijver, maar van een van de grootste investeerders in de sector. Als het bedrijf dat AI-abonnementen verkoopt een budget nodig heeft, is de boodschap voor elke andere onderneming duidelijk.