微軟的決定並非孤立的成本削減措施。這是一個高調的信號,表明「Tokenmaxxing」——即將 AI Token 的最大化消費視為生產力和創新的指標——的時代,在整個科技產業已經終結。
三個具體的壓力迫使微軟實施內部AI紀律:
失控的內部成本。微軟自家的工程團隊一直透過 GitHub Copilot 自由使用最先進的AI模型,導致 Token 消耗量和推理成本遠超出公司認為可持續的水平。內部 Copilot 指南承認,許多工程師每個月在 Token 上的花費「從數百美元到數千美元不等」。Parikh 的電子郵件明確指出,自2026年7月起,每個部門都必須遵守 AI Token 預算目標,員工可以透過內部儀表板追蹤自己的用量。
錯位的誘因。工程師開始將高 Token 消耗視為生產力的象徵,這種做法在業界被稱為 Tokenmaxxing。但微軟發現,更多的 Token 並不等於更多的商業價值。Parikh 明確地重新定義了公司的目標:「我們優化的不是 Token 數量,而是每個 Token 的影響力。」
信譽問題。作為一家銷售AI訂閱服務(Azure OpenAI Service、GitHub Copilot、Microsoft 365 Copilot)的公司,微軟不能一邊要求客戶控制AI成本,一邊讓自己的團隊毫無節制地消耗 Token。Parikh 在郵件中指出,公司將「以管理其他關鍵資源時同樣的紀律來管理 Token 支出」。
這些政策變革於2026年7月立即生效:
微軟的舉動只是科技業更廣泛調整中的一個數據點。「Tokenmaxxing」——將 AI Token 消費作為創新指標的激進做法——大約從2025年底到2026年中在科技公司中變得普遍,但現在正因為經濟效益不佳而迅速瓦解。
Uber 的預算超支。Uber Technologies 在短短數月內就用盡了2026年全年的AI預算。其技術長公開表示:「我們正在迎來所謂 Tokenmaxxing 時代的終結」,並補充說,原始的 Token 消費並未轉化為可衡量的回報。該公司現在正透過提示快取、更高效的預設模型以及更好的消費可視性,轉向優化每次互動的成本。
Gartner 的警告。Gartner 預測,在按用量計價的模式下,AI 編碼成本很快就會超過開發者的平均薪資,迫使各產業的財務長要求成本紀律。
新創公司的數學計算。新創公司已經證明,更換模型可以將推理成本降低約90%。例如,Lindy.ai 一夜之間將其100%的 API 流量從 Claude 轉移到 DeepSeek,理由是對於其核心任務集,推理成本降低了約90%,同時輸出品質相當。如此巨大的節省使得舊的「越多 Token 越好」的心態在財務上難以為繼。
Forbes 和 Fortune 的裁決。多家商業媒體已經宣布 Tokenmaxxing 時代在結構上已經結束。企業正放棄將原始用量作為指標,轉而採用效率優先的部署、模型路由(為簡單任務使用更便宜的模型)以及取消 Token 最大化誘因的基於成果的計費方式。Forbes 將 Tokenmaxxing 描述為「AI 採用過程中的一個過渡階段」,它有助於使 AI 使用正常化,但「並非可持續的運營模式」。
現在產業模式很明確:最初鼓勵無限制使用AI的公司正在實施預算、轉向更便宜的模型,並要求每一分 Token 支出都與可衡量的商業成果掛鉤。ServiceNow 的客戶長警告說,Tokenmaxxing 是一個 AI 炒作週期。Fortune 的結論直言不諱:「Tokenmaxxing 已死。它沒有產生企業想要的 AI 投資報酬率。」
微軟的內部 Token 預算和 GPT-5.6 預設模型,正是這場席捲整個產業的清算行動中的典型例子——而這並非來自AI落後者,而是來自該領域最大的投資者之一。如果一家銷售AI訂閱的公司都需要設定預算,那麼對其他所有企業來說,訊息已經非常明確。