進步速度驚人。兩年前,頂尖代理的正確完成率約為 12%;一年前,最佳模型也僅有 42% 。到了 2026 年 6 月,多個 Anthropic 模型已跨越人類基準線:Claude Mythos Preview 達到 85.4%,Fable 5 為 85.0%,Opus 4.8 為 83.4%
。相比之下,OpenAI 的 Operator 在同一測試中僅獲得 38% 的分數
。
a16z 論證,當原始的 UI 導航能力成為模型層的商品時,持久性的競爭優勢將向上移動到更高階的技術堆疊 。前沿領域正從「代理能使用電腦嗎?」轉變為「它能可靠地完成這項工作嗎?」
。真正的護城河現在是
:
這與 a16z 更廣泛的論點一致,即 AI 代理正從基於聊天的介面,轉向能夠觀察用戶行為並主動採取行動的自主系統 。其可觸及的市場規模,也從約 4000 億美元的軟體支出,擴大到估計高達 13 兆美元的全球勞動力支出
。
a16z 的分析指出,電腦操作工作流程在狹義、重複性的後勤辦公室工作中(例如更新系統記錄、在入口網站間移動數據、處理票務)已「開始在大規模生產環境中站穩腳跟」。目前這些生產部署仍專注於標準化的狹義工作流程,而非開放式的通用電腦操作
。
有兩家公司說明了這個日益成長的生態系統: