微軟呢個決定唔係單純嘅削減成本措施,而係一個高調嘅信號,表明「Tokenmaxxing」(將最大限度嘅AI Token消耗視為生產力同創新指標嘅做法)喺科技業已經玩完。
微軟內部面臨三重壓力:
內部成本失控。 微軟自己嘅工程團隊一直自由使用GitHub Copilot嘅前沿AI模型,令Token消耗同推理成本遠遠超過可持續水平。內部Copilot指引承認,好多工程師每月喺Token上嘅開支「介乎幾百蚊到幾千蚊美金」。Parikh嘅電郵明確指出,由2026年7月起,每個部門都要遵守AI Token預算目標,員工可以透過內部儀表板查閱自己嘅用量。
激勵機制錯配。 工程師開始將高Token消耗視為生產力嘅象徵,呢個做法喺業界被稱為「Tokenmaxxing」。但微軟發現,Token用得多唔代表業務價值高。Parikh重新講清楚公司目標:「我哋唔係要優化用少啲Token,而係要優化每個Token所帶嚟嘅影響」。
信譽問題。 作為一間賣AI訂閱嘅公司——Azure OpenAI Service、GitHub Copilot、Microsoft 365 Copilot——微軟冇可能一邊叫客人控制AI成本,一邊放任自己團隊無限制咁燒Token。Parikh嘅電郵提到,公司會「以管理其他關鍵資源嘅同一紀律去管理Token開支」。
政策變更喺2026年7月即時生效:
微軟嘅行動只係科技業大調整嘅其中一個例子。「Tokenmaxxing」——大約由2025年底到2026年中喺科技公司流行——因為經濟上唔work而快速崩潰。
Uber嘅預算爆煲。 Uber Technologies喺短短幾個月內就用盡咗2026年全年AI預算。其技術總監公開話:「我哋正處於所謂tokenmaxxing時代嘅尾聲」,並指出純粹嘅Token消耗並冇轉化為可量度嘅回報。公司而家轉向透過快取提示、更高效嘅默認模型同更好嘅用量可見性去降低每次互動成本。
Gartner嘅警告。 Gartner預測,喺消費模式之下,AI編碼成本好快就會超過開發者嘅平均薪資,迫使各行業嘅CFO要求成本紀律。
初創公司嘅數學。 初創公司已經示範咗,轉用模型可以將推理成本降低大約90%。例如Lindy.ai喺一晚之間將100%嘅API流量由Claude轉去DeepSeek,主要任務嘅推理成本降低咗大約90%,輸出質素相若。咁樣嘅大幅慳錢令舊有「用多啲Token就係好」嘅諗法喺財務上變得唔可行。
Forbes同Fortune嘅判斷。 多家商業媒體認為Tokenmaxxing時代已經結構性結束。企業正放棄將用量視為指標,轉向效率優先嘅部署、模型路由(簡單任務用平價模型),以及以結果為基礎嘅計費模式,消除咗最大化Token嘅誘因。Forbes形容Tokenmaxxing係「AI過渡期嘅階段」,有助企業發現新能力,但「唔係可持續嘅營運模式」。
而家業界嘅模式好清楚:當初鼓勵員工無限用AI嘅公司,而家都喺度設預算、轉用平價模型、要求每個Token花費都要對應返業務成果。ServiceNow嘅客戶總監警告Tokenmaxxing係一個AI炒作循環。Fortune嘅判決好直白:「Tokenmaxxing已死。佢冇帶嚟企業想要嘅AI回報」。
微軟嘅內部Token預算同GPT-5.6默認模型,正正就係呢個業界大清算嘅典型例子——而且呢個教訓唔係嚟自一個AI落後者,而係嚟自行業其中一個最大投資者。如果連賣AI訂閱嘅公司都要自己設預算,咁對其他所有企業嚟講,訊息已經好清楚。