Keputusan Microsoft bukan sekadar langkah pemotongan kos yang terpencil. Ia adalah isyarat terkenal bahawa era "tokenmaxxing" — memperlakukan penggunaan token AI maksimum sebagai proksi untuk produktiviti dan inovasi — sudah berakhir di seluruh industri teknologi .
Tiga tekanan khusus memaksa Microsoft mengenakan disiplin AI dalaman:
Kos dalaman yang tidak terkawal. Pasukan kejuruteraan Microsoft sendiri telah menggunakan model AI terkini secara bebas melalui GitHub Copilot, mendorong penggunaan token dan kos inferens jauh melebihi apa yang dianggap mampan oleh syarikat. Garis panduan Copilot dalaman mengakui bahawa ramai jurutera membelanjakan "dalam lingkungan ratusan dolar sebulan hingga beberapa ribu dolar untuk token" . E-mel Parikh menjelaskan bahawa mulai Julai 2026, setiap bahagian akan beroperasi di bawah sasaran belanjawan token AI, dan pekerja individu boleh menjejaki penggunaan mereka sendiri melalui papan pemuka dalaman .
Insentif yang tidak sejajar. Jurutera mula menganggap penggunaan token yang tinggi sebagai lencana produktiviti, satu amalan yang dikenali di seluruh industri sebagai tokenmaxxing. Tetapi Microsoft mendapati bahawa lebih banyak token tidak bermakna lebih banyak nilai perniagaan. Parikh menyusun semula matlamat syarikat dengan jelas: "Kami tidak mengoptimumkan untuk lebih sedikit token. Kami mengoptimumkan untuk impak bagi setiap token" .
Masalah kredibiliti. Sebagai syarikat yang menjual langganan AI — Azure OpenAI Service, GitHub Copilot, Microsoft 365 Copilot — Microsoft tidak boleh secara meyakinkan memberitahu pelanggan untuk mengawal kos AI sementara pasukannya sendiri membakar token tanpa sekatan . E-mel Parikh menyatakan bahawa syarikat akan "mengurus perbelanjaan token dengan disiplin yang sama seperti yang kita lakukan untuk setiap sumber kritikal yang lain" .
Perubahan dasar berkuat kuasa serta-merta pada Julai 2026 :
Langkah Microsoft adalah satu titik data dalam pembetulan yang lebih luas yang berlaku di seluruh industri teknologi. "Tokenmaxxing" — amalan secara agresif mendorong penggunaan token AI sebagai proksi untuk inovasi — menjadi meluas di kalangan syarikat teknologi dari sekitar akhir 2025 hingga pertengahan 2026, tetapi kini ia runtuh dengan cepat kerana ekonominya tidak berfungsi .
Pecahnya belanjawan Uber. Uber Technologies menghabiskan keseluruhan belanjawan AI 2026 dalam masa beberapa bulan sahaja. CTOnya secara terbuka mengisytiharkan, "Kita akan sampai ke penghujung era tokenmaxxing," sambil menambah bahawa penggunaan token mentah tidak diterjemahkan kepada pulangan yang boleh diukur . Syarikat itu kini beralih kepada pengoptimuman kos setiap interaksi melalui caching prompt, model lalai yang lebih cekap, dan keterlihatan yang lebih baik ke dalam penggunaan .
Amaran Gartner. Gartner telah meramalkan bahawa kos pengekodan AI tidak lama lagi akan melebihi gaji purata pembangun di bawah model harga berasaskan penggunaan, memaksa CFO di seluruh industri menuntut disiplin kos .
Matematik permulaan. Syarikat pemula telah menunjukkan bahawa menukar model boleh mengurangkan kos inferens kira-kira 90%. Lindy.ai, sebagai contoh, memindahkan 100% trafik APInya dari Claude ke DeepSeek dalam sekelip mata, dengan menyebut kos inferens kira-kira 90% lebih rendah untuk kualiti output yang setanding pada set tugasan terasnya . Penjimatan dramatik sebegini menjadikan mentaliti lama "lebih banyak token = lebih baik" tidak dapat dipertahankan dari segi kewangan .
Verdik Forbes dan Fortune. Pelbagai saluran perniagaan telah mengisytiharkan era tokenmaxxing berakhir secara struktur. Perusahaan meninggalkan penggunaan mentah sebagai metrik memihak kepada penggunaan kecekapan-pertama, penghalaan model (menggunakan model yang lebih murah untuk tugasan yang lebih mudah), dan pengebilan berasaskan hasil yang menghilangkan insentif untuk memaksimumkan token . Forbes mencirikan tokenmaxxing sebagai "fasa peralihan dalam penggunaan AI" yang membantu menormalkan penggunaan tetapi "bukan model operasi yang mampan" .
Corak industri kini jelas: syarikat yang pada mulanya menggalakkan penggunaan AI tanpa sekatan kini mengenakan belanjawan, beralih kepada model yang lebih murah, dan menuntut setiap token yang dibelanjakan dikaitkan dengan hasil perniagaan yang boleh diukur. Ketua pegawai pelanggan ServiceNow telah memberi amaran bahawa tokenmaxxing adalah kitaran gembar-gembur AI . Verdik Fortune adalah ringkas: "Tokenmaxxing sudah mati. Ia tidak menghasilkan pulangan pelaburan AI yang dikehendaki syarikat" .
Belanjawan token dalaman Microsoft dan lalai GPT-5.6 adalah contoh buku teks untuk pengiktirafan di seluruh industri ini — datang bukan daripada ketinggalan AI, tetapi daripada salah satu pelabur terbesar sektor itu. Jika syarikat yang menjual langganan AI memerlukan belanjawan, mesej untuk setiap perusahaan lain adalah jelas.