Intelligence Indeed 宣稱其 InAgent/Z Agent 在 OSWorld 的 361 項任務配置中取得 90.2% 成功率,為首個報稱突破 90% 的系統。 OSWorld 讓代理在真實桌面環境中完成任務,並以實際執行後的系統狀態檢查結果,而非只評估文字回答。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Chinese company Intelligence Indeed’s InAgent become the first computer-use agent to exceed 90% on the OSWorld benchmark—achieving 9. Article summary: The reported result is best understood as a system-level achievement, not evidence that InAgent has a uniquely superior foundation model. InAgent reportedly combined model reasoning with an execution “harness” that plans. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Intelligence Indeed 在 2026 年 8 月表示,其電腦操作產品在公告中稱為 Z-Agent、其他報導則稱為 InAgent,在 OSWorld 取得 90.2% 任務成功率,成為首個報稱跨過 90% 門檻的參與者。該公司也表示,系統同時在代理框架子排行榜名列第一。18
22
這個消息真正值得注意的,未必是某一個模型已經「學會」所有桌面操作,而是 AI 代理的表現愈來愈取決於模型外圍的執行框架(harness):它負責把模型規劃轉成受控動作、確認動作是否真的生效,並處理真實工作流程中層出不窮的失敗情境。
相關報導將以下 OSWorld 評測數字歸於 InAgent:
這些是報稱結果,並非獨立稽核結論。現有資料並未提供公開技術報告,用以拆解基礎模型、操作工具、提示詞、評測設定,以及各項框架元件分別對成績的貢獻。因此必須釐清:代理基準分數衡量的是一套模型加系統的組合配置,而不是孤立的模型「智力」。
也不應把某一時點的第一名視為永久排名。2026 年 9 月的一份第三方排行榜快照顯示,Qwen3.8 Max 在 OSWorld-Verified 的分數為 86.1%,反映排行榜名次與評測配置都可能隨時間改變。3
OSWorld 的設計目標,是讓代理在真實電腦環境中操作,而非只回答螢幕截圖問題或處理模擬網頁。原始基準含有 369 個真實世界任務,涵蓋 Chromium、LibreOffice、GIMP、Thunderbird、VLC、Visual Studio Code 等應用程式,以及作業系統與跨應用程式工作;任務會從預先設定好的環境狀態開始,並以實際執行結果檢查是否完成。2
14
常用的 361 項任務配置,則排除了 8 個可能需要人工設定的 Google Drive 任務。14
這意味著,代理不能只「猜對下一個按鈕」。它必須在多個步驟間維持進度、操控檔案和應用程式狀態,並最終讓電腦處於預期的完成狀態。
從歷史脈絡看,90.2% 的主張確實醒目。OSWorld 最初公布的參考結果中,人類完成率超過 72.36%,當時最佳模型僅為 12.24%。14 不過,這並不等於可用來衡量任何職場工作的通用能力:基準表現會受到任務挑選、環境設定、動作步數上限、工具,以及代理執行框架影響。
提示詞工程處理的是「告訴模型做甚麼」;情境工程處理的是「提供模型哪些資訊」;而執行框架工程處理的則是整套執行環境:代理如何觀察、採取動作、保存狀態、驗證完成,以及在失敗後如何復原。
一篇代理系統設計綜述指出,執行框架是影響代理感知、行動,以及偵測與復原錯誤能力的基礎設施;其組成包括觀察設計、動作空間、執行沙盒、情境管理與驗證迴圈等。28
對電腦操作代理而言,一個成熟的框架通常至少要處理六件事:
有實證顯示,這一層的工程可明顯影響代理表現。一項研究指出,經過 10 次代理執行框架工程迭代後,Terminal-Bench 2 的 pass@1 從 69.7% 升至 77.0%,並超過研究中引用的 71.9% 人工設計框架基準。這是不同的評測,不能用來驗證 InAgent 的 OSWorld 分數;但它支持一項更廣泛的判斷:即使不單純更換新模型,執行時系統設計也能帶來顯著提升。29
InAgent 據報的策略重點,在於混合式執行:有可靠程式介面時使用 API;遇上缺乏合適 API 的軟體時,仍保留類似人類的 GUI 操作能力。22
這正對應企業常見難題:一個流程可能橫跨已有 API 的現代服務,以及老舊桌面軟體、供應商入口網站或內部系統;對後者來說,員工看得到的畫面往往就是唯一可行的操作途徑。
理想情況下,代理可在每一步選擇最可靠的路徑:
OSWorld-MCP 的研究同樣發現,在部分情境中,工具呼叫能提高電腦操作任務的成功率。其實驗中,加入 MCP 工具後,OpenAI o3 在 15 步條件下由 8.3% 升至 17.6%;Claude 4 Sonnet 在 50 步條件下則由 38.9% 升至 45.0%。24
不過,GUI 自動化依然容易受介面更新、延遲、彈出視窗、目標不明確、存取控制、多因素驗證(MFA)與不可逆動作影響。混合式執行能降低部分風險,但不能使風險消失。
90.2% 完成率也代表有 9.8% 的基準任務未成功完成。若有 10,000 件條件相若的任務,約會出現 980 件例外;這還未計入表面上看似成功、但商業結果其實錯誤的情況。
這不代表該分數沒有意義。它意味著電腦操作代理可能已接近能用於範圍明確、重複性高且控制嚴謹的流程。但這不等於可放任其無人監督地處理付款、法律申報、安全關鍵作業,或直接影響客戶的變更。
企業評估上線時,不能只看單一通過率,還應檢視:
更新、難度更高的 OSWorld 2.0 也提醒外界應保持審慎。該基準包含 108 個長時程工作流程;其主要 500 步指標下,最高的二元完成率僅為 20.6%。這顯示當任務變得更長、更接近真實情況時,代理距離廣泛達到專業級電腦操作能力仍有很大差距。17
InAgent 報稱的 90.2%,較適合被理解為代理系統工程的一個里程碑。更好的提示詞和更豐富的情境仍然重要,但可靠自動化日益取決於模型周圍的機制:任務拆解、工具選擇、持久狀態、可驗證的完成條件、受限授權,以及復原路徑。
對企業來說,最有用的問題不只是「哪個模型的基準分數最高」,而是某個代理能否以可衡量的正確性執行特定流程、控制其副作用,並在無法繼續時安全交接給人員。高 OSWorld 分數可以為這項判斷提供參考,但單靠分數本身,無法證明它已經做到。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Intelligence Indeed 宣稱其 InAgent/Z Agent 在 OSWorld 的 361 項任務配置中取得 90.2% 成功率,為首個報稱突破 90% 的系統。
Intelligence Indeed 宣稱其 InAgent/Z Agent 在 OSWorld 的 361 項任務配置中取得 90.2% 成功率,為首個報稱突破 90% 的系統。 OSWorld 讓代理在真實桌面環境中完成任務,並以實際執行後的系統狀態檢查結果,而非只評估文字回答。
即使成功率達 90.2%,仍代表約 9.8% 任務未成功;高影響流程仍須設置確定性驗證、權限控管、例外處理與人工覆核。