微软的决策并非孤立的成本削减措施。它是一个高调的信号,表明“Token内卷”——即将最大化的AI Token消耗视为生产力和创新的代名词——在科技行业已走向终结 。
三重具体压力迫使微软实施内部AI纪律:
内部成本失控。 微软自己的工程团队一直在通过GitHub Copilot自由使用前沿AI模型,导致Token消耗和推理成本远超公司认为可持续的水平。内部Copilot指南承认,许多工程师每月的Token花费“在数百美元到数千美元之间” 。Parikh的邮件明确表示,自2026年7月起,每个部门都将按照AI Token预算目标运作,员工可以通过内部仪表盘追踪自己的使用情况 。
激励机制错位。 工程师们开始将高Token消耗视为生产力的荣誉勋章,这种做法在整个行业被称为Token内卷。但微软发现,更多的Token并不等于更多的商业价值。Parikh明确重新定义了公司的目标:“我们不是在优化更少的Token,而是在优化每个Token的影响力” 。
信誉问题。 作为一家销售AI订阅服务(Azure OpenAI Service、GitHub Copilot、Microsoft 365 Copilot)的公司,微软在自家团队毫无节制地消耗Token的同时,无法令人信服地告诉客户要控制AI成本 。Parikh在邮件中指出,公司将“以管理其他关键资源同样的纪律来管理Token支出” 。
这些政策变更于2026年7月立即生效 :
微软的行动是整个科技行业一场规模更大的回调中的一个数据点。“Token内卷”——即将AI Token消耗量作为创新指标大力推广的做法——在2025年底到2026年中期间在科技公司中变得普遍,但由于经济账算不过来,它正在迅速崩塌 。
Uber的预算超支。 优步科技在短短几个月内就耗尽了2026年全年的AI预算。其CTO公开表示:“我们正在走向所谓的Token内卷时代的终结”,并补充说,原始的Token消耗量并未转化为可衡量的回报 。该公司现正转向通过提示缓存、更高效的默认模型以及更好的消费可见性来优化每次交互的成本 。
Gartner的警告。 Gartner预测,在按用量定价的模式下,AI编程成本将很快超过开发人员的平均薪资,这将迫使各行各业的CFO要求成本纪律 。
创业公司的数学。 初创公司已经证明,切换模型可以将推理成本降低约90%。例如,Lindy.ai在一夜之间将其100%的API流量从Claude转移到了DeepSeek,理由是在其核心任务集上,推理成本降低了约90%,而输出质量相当 。如此显著的节省使得旧的“更多Token=更好”的心态在财务上难以立足 。
福布斯与财富的裁决。 多家商业媒体宣布Token内卷时代在结构上已经结束。企业正在放弃将原始使用量作为指标,转而采用效率至上的部署、模型路由(对简单任务使用更便宜的模型)以及基于结果的计费方式,这些方式消除了最大化Token的动机 。《福布斯》将Token内卷描述为“AI采用的一个过渡阶段”,它帮助规范化了使用,但“不是一个可持续的运营模式” 。
行业的模式现在很清晰:最初鼓励无限制使用AI的公司正在实施预算,切换到更便宜的模型,并要求每一笔Token支出都与可衡量的业务成果挂钩。ServiceNow的首席客户官曾警告,Token内卷是一个AI炒作周期 。《财富》杂志的裁决直截了当:“Token内卷已死。它没有产生企业想要的AI投资回报率” 。
微软的内部Token预算和GPT-5.6默认设置正是这场行业范围内清算的教科书式案例——这个行动并非来自AI落后者,而是来自该行业最大的投资者之一。如果连卖AI订阅服务的公司都需要预算,那么对其他所有企业来说,信息不言而喻。