BrowserAct 由两个互补组件组成:
browser-act
为 AI 代理提供浏览器控制能力,让代理能够像真人一样操作网页。
browser-act-skill-forge
用于生成可复用的网站自动化工具(称为“Skills”)。
官方用一个很形象的比喻来解释二者关系:
两个工具都已作为开源项目发布在 GitHub 上,面向需要稳定访问真实网站的 AI 代理系统。
AI 自动化网页时通常会遇到三个长期存在的问题:
BrowserAct 的设计目标是通过浏览器自动化与可复用技能的结合,同时缓解这些问题。
browser-act 是执行层组件,它允许 AI 代理在真实浏览器环境中运行,而不是仅依赖 API 或简单爬虫。
根据项目资料,该工具可以让代理:
官方描述称,这种方式比传统脚本更稳定,并且在复杂网站上执行更快。但目前公开资料中没有提供独立基准测试或性能验证。
如今许多网站通过浏览器指纹识别、IP 分析和验证码系统来阻止自动化访问。
BrowserAct 宣称提供多种应对机制,例如:
不过,目前公开资料没有披露这些功能的技术细节,例如验证码识别成功率或指纹生成机制。
值得一提的是,随机浏览器指纹本身是自动化工具中常见的技术。例如一些开源项目可以生成真实浏览器的 HTTP 头信息和设备特征,用来模拟真实用户行为。
如果说 browser-act 负责实时浏览网页,那么 browser-act-skill-forge 的核心任务是把网站操作流程变成可复用的自动化能力。
例如:
这些流程可以被打包成一个 Skill。之后 AI 代理只需调用这个 Skill,就能执行同样的任务,而无需重新编写脚本。
据介绍,该系统的工作方式包括:
这种“API 优先(API‑first)”的方式可以减少完整浏览器渲染的开销,从而提升效率。
BrowserAct 的设计目标是作为 AI 代理工具链中的技能模块使用。
例如在 SkillsLLM 的示例中,用户可以通过 GitHub 克隆仓库并将技能加入 Claude Code 环境。
项目还被描述为适用于 OPENCLAW 风格的代理系统,这类系统通常通过组合多个技能来完成复杂任务。
项目发布材料中提到,使用 BrowserAct 后可能带来一些好处,例如:
但公开文档目前没有提供:
因此这些性能优势仍需要实际部署或第三方评测来验证。
根据目前公开信息:
但一些关键细节仍未公开,例如:
这些因素通常取决于部署环境或第三方服务,因此在公开资料中尚未完全说明。
BrowserAct 的出现反映了 AI 基础设施的一个趋势:
从单纯调用 API,转向让 AI 代理像人一样直接操作互联网。
通过将浏览器控制与可复用技能结合,这类工具试图减少传统网页自动化常见的“脚本易碎”问题。
BrowserAct 是否能真正提升稳定性,还需要更多真实场景测试。但它的开源发布已经表明:让 AI 代理成为真正的“互联网用户”正在成为一个新的技术方向。