Agent嘅額外成本,通常來自幾個層面:
隨住上下文逐步累積,後續模型呼叫亦可能要攜帶更多之前嘅資料;而較強嘅推理模型,處理多個決定時亦可能消耗更多Token及運算。Gartner相關分析嘅報道指,完成相若任務時,Agent所需Token可以係普通Chatbot嘅5至30倍,但實際數字會視乎工作流程同模型設定而變。
換句話講,成本問題唔只係Token單價,而係以下幾項一齊相乘:
Token價格 × Token數量 × 模型選擇 × 工作流程結構。
Gartner嘅Tokenomics Model唔係將所有AI請求當成同一種工作,而係將AI工作分成由簡單到複雜嘅不同情境。公開報道所描述嘅大致成本階梯如下:
不過,現時公開報道未有提供足夠可靠、逐項對應基本執行、規劃、學習及進階推理嘅數字倍數。因此,呢啲類別嘅具體倍數唔應該當成已公開確立嘅Gartner基準。
冇。呢個悖論唔係話硬件、模型架構或者Token經濟效益停止改善,而係話效率提升可能會刺激更多需求。
因此,Token單價下降,只會改善「工作量固定不變」嘅經濟效益;如果工作流程本身不斷膨脹,企業每完成一項實際業務成果嘅成本仍然可以上升。
唔好所有任務都交畀最貴、最強嘅模型。固定規則、資料擷取、分類及低風險工作,可以交畀較細或者較平嘅模型;只喺測試證明高階推理能力確實改善結果嘅關鍵步驟,先使用前沿推理模型。Gartner相關建議包括推理分級、限制Token用量及持續監察。
企業應該限制可能令Agent失控嘅變數,包括:
另外,亦可以快取穩定結果、刪減或者摘要歷史內容、使用結構化工具輸出,並將例外或高風險個案交由人員處理。咁樣可以減少無必要嘅模型呼叫,而唔使完全放棄真正有價值嘅自主功能。
每個Token幾多錢、每次Agent呼叫幾多錢,都唔係完整指標。企業應該同時追蹤完成一項業務成果嘅成本,例如解決一宗個案、批核一份索償、篩選一個合資格銷售線索,或者完成一項工程任務。
成本之外,亦要一併衡量質素、速度、失敗率及需要人手介入嘅比例。正式試行前,最好先建立原有流程基準、質素門檻、速度目標,以及達唔到要求時嘅停止標準。
模型經濟效益唔係一成不變。今日需要用高價前沿模型嘅工作,日後可能由更平但能力足夠嘅模型、微調模型、蒸餾模型,甚至傳統自動化取代。
所以,企業應定期重新檢視「模型加工作流程」嘅組合,而唔係將今日嘅架構當成永久方案。
Gartner預測,到2027年年底,超過40%嘅Agentic AI項目可能會被取消,原因包括成本上升、商業價值唔清晰,以及風險控制不足。 呢個預測係提醒企業,唔好喺未了解經濟效益同管治要求之前,就急於擴大Agent自主權;並唔係話每一個Agent部署都注定失敗。
如果一個Agent可以加快或者取代有價值、可重複嘅流程,經過妥善優化後仍然有機會帶來投資回報。真正要問嘅係:新增推理、協調同自主能力所帶來嘅價值,有冇高過新增嘅推理及營運成本?
最穩陣嘅假設係:Token價格同AI Agent總成本,可以朝相反方向走。企業應該將Token只視為預算其中一項,完整計算整個工作流程,揀選能夠達到質素要求嘅最低能力模型,為運作設定清晰上限,並喺生產環境有證據證明Agent改善指定業務成果後,先逐步增加自主程度。