Silicon Data的LLM Token Expenditure Index(代码:SDLLMTK)在2026年9月1日降至每百万Token 0.97美元,为该指数新低,且不足夏季早些时候高点的一半。
2
4
这并不表示AI需求在降温。恰恰相反,中国模型厂商围绕API价格的激烈竞争,正在把大量常规任务推向成本更低的模型;推理单价下降后,企业也更愿意扩大使用范围。结果是:每百万Token的有效价格在跌,但Token消耗和整体AI投入可以同时上升。
0.97美元究竟代表什么?
SDLLMTK并不是“全市场用了多少Token”,也不是所有企业AI支出的总额。Silicon Data将不同模型供应商的价格与实际观察到的使用量结合,计算出市场为每百万大模型推理Token支付的混合有效价格。
2
4
因此,它反映的是价格与工作负载结构的变化。例如,企业把更多摘要、客服、基础编程和内部流程等任务分流至较便宜的模型,即使总Token量增加,指数仍可能下行。
换句话说,指数下跌说明市场实际支付的单位价格变低了,并不能直接推导出AI市场收入或企业总预算在下降。
中国低价API如何改变市场价格结构
低成本模型为不需要最前沿能力的高频任务提供了替代选择。DeepSeek V4-Flash的标价为每百万输入Token 0.14美元、每百万输出Token 0.28美元。
49
DeepSeek还在2026年5月将V4-Pro价格下调75%,这一动作被报道视为中国模型服务商竞争升级的一部分。
58 此外,国内生态中持续出现的降价与低价产品,也在高用量推理场景中加大了价格压力。
4
52
这些事实表明,中国市场的竞争环境与混合Token价格下降存在强关联;但不能据此精确拆分某一家实验室、某一个模型或某一次调价对指数下跌的单独贡献。模型效率提升、算力供给扩张,以及客户自身的模型路由策略,同样会影响结果。
为什么Token更便宜,AI总支出反而可能更高?
核心关系并不复杂:
Token总支出 = 每Token有效价格 × Token用量
价格下降会打开原本不经济的应用场景:企业可以部署更多自动化流程,让提示词和上下文更长,生成更多代码,或运行调用频率更高的智能体系统。
只要用量的增速快于单位价格的降幅,总支出就会增长。这与一组市场观察相吻合:自2023年以来,单Token价格已下降逾90%,但大语言模型相关支出自2025年末以来大致翻倍。
41
43
这可以理解为一种“越便宜、越多用”的扩张效应:低价推理不是没有发挥作用,而是把更多任务带入了值得自动化的范围。
中国Token用量的增长,显示了需求弹性
路透社援引政府预测称,截至2026年3月,中国日均AI Token消耗已超过140万亿,高于2025年末的100万亿。
18
金融机构披露的数据也呈现相似趋势。招商银行表示,其日均Token吞吐量同比增长超过78%;另有报道显示,截至5月底,该行日均Token消耗约为330亿。
19
29 还有报道提到,部分银行的日均Token使用量增幅更大。
20
这些数字不能直接等同于API收入,也不能证明每一笔Token消耗都已经带来经济回报;但它们说明,低成本推理正在被大规模转化为更高频的实际使用。
对模型厂商而言,低价是一场更难的经营考试
对AI采购方来说,推理价格下降显然是利好。但对模型厂商而言,单位Token收入下降,而芯片、数据中心、训练和模型研发的投入依然高昂,商业账会更难算。
接下来真正的问题不再是用户会不会消费便宜的Token——现有数据表明,他们会。更关键的是:不断增长的用量、高端模型服务和企业级产品,能否足够快地形成可持续收入与可量化的生产率提升,以支撑持续的基础设施投资。关于指数下滑的报道,也强调了模型提供商定价能力承压的风险。
4
36
接下来该看什么
与其只盯着某个模型的官网标价,更值得关注四组指标:
- 混合有效Token价格:例如SDLLMTK,反映客户实际上把工作负载分配给了哪些模型。
2
- Token用量:判断降价是否正在创造新增需求。
- 收入与利润率:观察模型厂商能否把用量增长变成可持续回报。
- 工作负载质量:Token消耗高,并不自动代表业务价值高。
结论很直接:中国低价API竞争帮助将大模型推理的混合市场价格压至每百万Token 1美元以下。但低价也在刺激更多使用,因此Token消费量与总体AI支出完全可能继续攀升。
2
4
41