Friar喺LinkedPost上面話:「過往咁多年,軟件嘅回報都係睇採用率:買咗幾多個seat、有幾多活躍用戶、續約率。但AI唔同——佢應該用完成咗幾多工作嚟衡量。」 呢個框架清楚指出,最低嘅每token成本並唔一定等於最低嘅每項成果成本,企業應該追求總價值創造,而唔係淨係睇單位價格 。
Friar嘅方法用四個具體問題取代咗以往模糊嘅採用率指標,形成一個AI回報計分卡 :
要量度嘅唔係用咗幾多次或者問咗幾多個prompt,而係實際完成咗幾多項有成果嘅任務——例如解決咗幾多個客戶問題、推送咗幾多次程式碼更新、審查咗幾多份合約 。Friar話:「Token只有轉化成有人用嘅工作先會創造價值。」 呢個係由「活動指標」(問咗幾多次)轉向「影響指標」(完成咗啲乜)。
要計嘅係每個達到品質標準嘅任務嘅總成本,包括AI運算、重試、人工審核同修改 。一個平價模型如果成日出錯,最終每項成功成果嘅成本可能仲貴過一個高階模型一次過搞掂 。呢條問題逼企業唔好淨係睇每token嘅價錢,而係要考慮犯錯同修正嘅隱藏成本。
追蹤AI嘅可靠性——即係佢嘅輸出有幾大機會「即刻用得」,定係要人改過或者升級處理 。越少人工介入,總成本就越低,信任度亦越高。呢個係AI輸出嘅質量保證指標,承認可靠性同能力一樣重要。
監察AI能否隨時間完成更多高質素工作,而成本唔會指數式增長——呢個概念叫做「運算回報」(return on compute, ROC),係由半導體同數據中心財務領域借用過嚟嘅 。呢條問題幫企業判斷AI投資係咪有複合回報,定係越用越冇效益,對決定係唔係要擴大規模好重要。
呢個方法設計到可以用現有工具嚟審計 。團隊要定義清楚某個工作流程「完成」係咩意思,然後數吓成功完成咗幾多次,加埋總成本(包括人力間接成本),再追蹤通過率同質量趨勢 。
Friar嘅做法係將AI視為生產性資產而唔係軟件牌照,為CFO同科技主管提供一個結構化嘅方法,回答佢最成日聽到同行問嘅問題:「點樣先可以喺AI開支度拎到更多價值?」
呢個建議出爐嘅時候,企業AI開支正急速增長,OpenAI自己都報告每月收入達到10億美元,賣出咗超過5億個企業用戶 。但好多機構都仲缺乏清晰嘅回報評估框架,做成「AI能力同企業實際得到嘅價值之間存在錯配」。Friar之前將呢個現象形容為「能力過剩」(capability overhang)——即係AI可以做得到嘅嘢同組織實際上識得點樣用嚟賺錢之間嘅差距 。
透過將呢四個問題建立喺可審計嘅成本同質量數據之上,「每美元有用智能」呢個框架俾咗企業一個實用工具,由「靠信念去投資AI」轉向「用證據做決定」。