"多年来,软件都是通过采用率来衡量的:席位、活跃用户、续订率,"Friar在LinkedIn的一篇帖子中写道。"AI是不同的——它需要根据完成的工作来衡量" 。该框架明确认为,最低的每令牌成本并不总是产生最低的每任务成本,企业应该优化总价值创造,而不是单价 。
Friar的方法论用四个具体问题取代了模糊的采用率指标,形成一个AI投资回报率评分卡 :
衡量基于实际成果的任务量——解决的问题、交付的代码、审查的合同——而不是原始使用量或提示数量 。"只有当令牌转化为人们可以使用的实际工作时,它们才创造价值,"Friar写道 。这将关注点从活动指标(发出了多少查询)转移到影响指标(实际完成了什么)。
计算每个达到质量标准任务的全部成本,包括AI推理、重试、人工审核和返工 。一个经常出错的廉价模型,其每个成功任务的总成本可能比一次性正确完成任务的优质模型还高 。这个问题迫使企业超越每令牌价格,考虑错误和纠正的隐性成本。
跟踪可靠性——输出"立即可用"与需要纠正或升级的比率 。越少的人工干预意味着越低的总成本和更高的信任度。这本质上是对AI输出的质量保证指标,认识到可靠性与原始能力同样重要。
监控AI是否能在不导致成本指数级增长的情况下,完成更多高质量工作——这一概念也被称为计算回报率(return on compute, ROC),借鉴自半导体和数据中心财务领域 。这个问题探讨了AI投资是否具有复合收益还是边际价值递减,这对规模化决策至关重要。
该方法论设计为可通过现有工具进行审计 。团队需要为特定工作流定义"完成"的含义,统计成功完成的任务数量,汇总全部成本(包括人力开销),并跟踪通过率和质量趋势 。
Friar的方法将AI视为生产性资产而非软件许可证,并为CFO和技术领导者提供了一种结构化方式,来回答她从同行那里最常听到的问题:"我们如何从AI支出中获得更多价值?"
这一提案提出的背景是企业AI支出激增,OpenAI本身报告月收入达10亿美元,并售出超过5亿个企业席位 。然而,许多组织缺乏清晰的ROI框架,造成了"AI能力与公司实际捕获价值之间的不匹配" 。Friar此前将这种脱节描述为"能力过剩"(capability overhang)——即AI能做什么与组织实际能够利用什么是两回事 。
通过将这四个问题建立在可审计的成本和质量数据基础上,"每美元有用智能"框架为企业提供了一种实用工具,使其能够从基于信仰的AI投资转向基于证据的决策。