Intelligence Indeed 报告称,其 Z Agent(其他报道中称 InAgent)在 OSWorld 的 361 任务配置中达到 90.2% 成功率,成为首个报告突破 90% 的参与者。 OSWorld 要求智能体在真实桌面和网页应用环境中完成任务,并以最终系统状态的执行式检查评分,而不是只评估文字回答。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Chinese company Intelligence Indeed’s InAgent become the first computer-use agent to exceed 90% on the OSWorld benchmark—achieving 9. Article summary: The reported result is best understood as a system-level achievement, not evidence that InAgent has a uniquely superior foundation model. InAgent reportedly combined model reasoning with an execution “harness” that plans. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Intelligence Indeed 于 2026 年 8 月披露,其电脑操作智能体在公告中名为 Z-Agent、在其他报道中被称为 InAgent,在 OSWorld 评测中取得 90.2% 任务成功率。公司称这也是首个公开报告突破 90% 的成绩,并位列智能体框架子榜单第一。18
22
这项成绩值得关注,但它不应被解读为“某个模型已经解决了桌面自动化”。更重要的信号是:AI 智能体的表现越来越取决于模型外围的运行框架(harness)——即把模型的规划转化为可控操作、核验操作是否生效,并应对真实工作流中各种失败情形的软件系统。
相关报道给出的 OSWorld 分项结果为:
这些属于公开报道的结果,并非独立审计结论。目前提供的材料中,没有公开技术报告能够逐项拆分:基础模型、行动工具、提示词、评测设置以及运行框架的哪些部分分别带来了这些分数。因此,OSWorld 分数衡量的是一套模型加系统的组合配置,而不是单独衡量模型“智力”。
还应把“某一时点的领先”与长期榜单位置分开看。2026 年 9 月的一份第三方榜单快照显示,Qwen3.8 Max 在 OSWorld-Verified 上为 86.1%,这说明榜单排名及评测配置会随时间变化。3
OSWorld 的目标不是让智能体看截图答题,也不是在模拟网页中预测点击位置。它要求智能体在真实计算机环境中操作。原始基准包含 369 个真实世界任务,覆盖 Chromium 浏览器、LibreOffice 办公套件、GIMP、Thunderbird 邮件客户端、VLC、Visual Studio Code,以及操作系统和跨应用工作流。任务从预先配置好的环境状态开始,并通过执行式检查来判断是否完成。2
14
常见的 361 任务配置,会排除 8 个可能需要人工设置的 Google Drive 任务。14
这意味着,智能体必须跨多步导航界面、保持任务进度、操作文件和应用状态,并最终让电脑处于预期状态;它并非只要“看起来点对了”就算成功。
从历史参照看,90.2% 的说法确实显得突出:OSWorld 最初公布的参考结果中,人类完成率超过 72.36%,最佳模型仅为 12.24%。14 不过,这不等于可以把分数直接当作通用职场能力的尺度。任务集合、环境初始状态、行动步数预算、工具权限以及智能体运行框架,都会影响最终成绩。
提示词工程解决“告诉模型做什么”;上下文工程解决“给模型看什么信息”。而运行框架工程解决的是运行时系统如何让智能体观察、行动、保存状态、验证完成、限制权限并从失败中恢复。
一项关于智能体系统设计的综述指出,执行框架是影响智能体感知、行动以及错误检测与恢复能力的基础设施;其组成可包括观测设计、行动空间、执行沙箱、上下文管理和验证循环。28
对于一个能够操作电脑的智能体,成熟的运行框架通常至少要做好六件事:
有实证研究表明,这一层确实能够显著改变表现。一项研究称,经过 10 轮智能体运行框架工程迭代,Terminal-Bench 2 的 pass@1 从 69.7% 升至 77.0%,高于文中引用的 71.9% 人工设计框架基线。这是另一项基准,不能用来验证 InAgent 的 OSWorld 分数;但它支持一个更广泛的判断:即使不单纯更换模型,运行时系统设计本身也可能带来明显收益。29
报道中,InAgent 的策略亮点是混合执行:在有可靠编程接口的地方使用 API,同时保留类似人类的 GUI 操作能力,以处理没有合适 API 的应用。22
这对应了企业自动化的现实难题:一个流程往往同时经过现代 SaaS 服务、老旧桌面软件、供应商门户和内部系统。其中一些有成熟 API,另一些最可行的入口仍是员工日常使用的屏幕界面。
理论上,智能体可在每个步骤选择更可靠的路径:
OSWorld-MCP 的研究也发现,在部分设置下调用工具可以提高电脑操作任务成功率:加入 MCP 工具后,OpenAI o3 在 15 步设置下从 8.3% 升至 17.6%;Claude 4 Sonnet 在 50 步设置下从 38.9% 升至 45.0%。24
但 GUI 自动化的脆弱性并没有消失:界面改版、网络延迟、弹窗、目标歧义、访问控制、多因素认证和不可逆操作,都可能造成失败或风险。混合执行能降低风险,却无法彻底消除风险。
若 90.2% 的完成率适用于某一类任务,那么仍有 9.8% 的任务没有成功完成。假设有 1 万个可比任务,这大约对应 980 个异常;这还未计入表面显示成功、但实际业务结果不正确的“静默错误”。
因此,这一分数并非没有意义。它表明,电脑操作智能体可能正接近适用于边界清晰、可重复且控制措施充分的工作流。但这绝不等于可以让它无人值守地处理付款、法律申报、安全关键操作或直接影响客户的变更。
企业评估生产部署时,不应只看醒目的通过率,还应检验:
更新、更难的 OSWorld 2.0 也提醒人们保持谨慎。该基准包含 108 个长程工作流;在主要的 500 步二元完成指标下,其报告的最高结果仅为 20.6%。这表明当任务更长、更贴近真实专业工作时,智能体距离广泛、专业级的电脑操作能力仍有很大距离。17
InAgent 报告的 90.2% 成绩,更适合被理解为智能体系统工程的一项里程碑。更好的提示词和更丰富的上下文依然重要,但可靠自动化越来越依赖模型之外的机制:任务分解、工具选择、持久状态、可验证的完成条件、受限授权与故障恢复路径。
对企业而言,真正值得问的并不是“哪个模型在榜单上第一”,而是:这个智能体能否以可衡量的正确性完成一条特定工作流,能否控制副作用,并在无法继续时安全地交给人工。这正是高 OSWorld 分数可以提供参考、却无法单独证明的能力标准。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Intelligence Indeed 报告称,其 Z Agent(其他报道中称 InAgent)在 OSWorld 的 361 任务配置中达到 90.2% 成功率,成为首个报告突破 90% 的参与者。
Intelligence Indeed 报告称,其 Z Agent(其他报道中称 InAgent)在 OSWorld 的 361 任务配置中达到 90.2% 成功率,成为首个报告突破 90% 的参与者。 OSWorld 要求智能体在真实桌面和网页应用环境中完成任务,并以最终系统状态的执行式检查评分,而不是只评估文字回答。
即使 90.2% 的成绩能够复现,也意味着约 9.8% 的同类任务未成功完成;高影响业务仍需要确定性校验、权限控制、异常队列和人工审批。