智能体增加的工作主要集中在以下几个层面:
随着上下文不断累积,后续模型调用还可能携带更多历史信息。更强的推理模型在处理多轮决策时,也可能消耗明显更多的Token和计算资源。据对Gartner分析的报道,与聊天机器人完成同等任务相比,智能体可能需要多出5至30倍的Token;具体数量取决于工作流和模型配置。
这些因素还会叠加发生:一个工作流可能同时拥有更多调用次数、更长上下文,以及更昂贵的模型。于是,成本不再只是“Token单价”这一项,而是由Token价格、Token总量、模型选择和工作流结构共同决定。
Gartner的Tokenomics Model并没有把所有AI请求视为同一种工作,而是将AI任务划分为难度和计算量不断上升的场景。公开报道描述的基本顺序是:
不一定,也不能简单理解为硬件效率、模型架构或Token经济学已经停止改善。这里的核心是“效率提升带来更多需求”。
当先进模型变得更便宜,企业就能负担过去成本过高的应用,也更有动力赋予智能体更多工具、更长上下文和更高自主性。与此同时,模型会在每个任务中进行更多推理和决策。于是,能力提升和使用量增长可能快于单位成本下降的速度。
这一区分对AI产品规划至关重要:Token单价下降,可以改善固定工作负载的经济性;但如果工作负载本身发生变化,单个业务结果的成本并不一定下降。
应根据任务难度匹配模型能力。确定性流程、检索、分类和低风险任务,可以交给更小、更便宜的模型;只有在测试证明更强能力确实能显著改善结果的步骤,才使用前沿推理模型。Gartner公开报道的建议包括推理分层、设置Token上限和持续监控。
企业需要控制可能导致智能体“失控运行”的变量,包括:
对稳定结果进行缓存、裁剪或总结历史记录、使用结构化工具输出,并在异常情况下升级给人工处理,都有助于减少不必要的调用,同时保留真正有价值的自主能力。
Token成本和单次智能体调用成本都不是完整指标。企业还应追踪完成一个业务结果所需的成本,例如解决一个客户案例、批准一项理赔、筛选出一条合格销售线索,或完成一项工程任务。同时,还要记录质量、延迟、失败率和人工介入程度。
可靠的试点应先确定传统流程的基线和目标质量,再判断智能体是否创造了足够价值,值得扩大规模。如果智能体只是节省了Token,却没有带来更好或更快的业务结果,那么这种表面上的效率提升可能并无实际意义。
模型经济性并非一成不变。今天必须依赖高价前沿模型的工作流,未来可能由更便宜但能力足够的模型、微调模型、蒸馏模型,甚至确定性自动化来完成。企业应定期重新评估“模型加工作流”的组合,而不是把当前架构视为永久方案。
Gartner预测,到2027年底,超过40%的智能体AI项目可能被取消,原因包括成本不断上升、业务价值不清晰以及风险控制不足。 这并不意味着所有智能体部署都会失败,而是提醒企业:在尚未搞清经济性和治理机制之前,不应贸然扩大自主范围。
如果一个智能体能够加速或替代高价值、可重复的流程,经过优化的实施方案仍然可能获得正向投资回报。真正应回答的问题是:额外推理、协作和自主性带来的增量价值,是否超过了相应增加的推理成本和运营成本。
更稳妥的假设是:Token价格和智能体总成本可能朝相反方向变化。企业应把Token视为预算中的一个变量,而不是全部成本;完整建模整个工作流,使用满足质量目标的最低能力配置,设置明确的运营边界,并在生产证据证明自主性能够改善特定业务结果后,再逐步扩大部署规模。