呢個進步速度驚人。兩年前,頂尖 agent 嘅正確率得大約 12%;一年前,最好嘅模型都只係做到 42% 。到咗 2026 年 6 月,多個 Anthropic 模型已經跨越人類基準線:Claude Mythos Preview 做到 85.4%、Fable 5 做到 85.0%、Opus 4.8 做到 83.4%
。相比之下,OpenAI 嘅 Operator 喺同一測試只係得 38%
。
a16z 認為,隨住基本嘅 UI 操縱能力變成模型層面嘅 commodity,真正持久嘅競爭優勢開始向上移動 。而家嘅前線問題已經由「agent 用唔用到電腦?」變成「佢可唔可以可靠咁完成呢份工?」
。真正嘅護城河變成
:
呢個方向同 a16z 更廣泛嘅預測一致:AI agent 正從單純嘅聊天介面,轉向主動式、自主觀察用戶行為並採取行動嘅系統 。呢個市場嘅潛力由軟件支出嘅大約 4000 億美元,跳升至估計嘅 13 兆美元全球勞動力支出
。
a16z 嘅分析指出,電腦操縱工作流程而家開始「喺大規模生產環境中站得住腳」,特別係處理有限度、重複性高嘅後勤工作,例如更新記錄系統、搬資料過 Portal 同處理工單 。目前嘅生產部署集中喺標準化、窄範圍嘅工作流程,唔係開放式、一般性嘅電腦使用
。
有兩間公司可以反映呢個生態圈嘅發展: