BrowserActは、役割の異なる2つのコンポーネントで構成されています。
browser‑act
AIエージェントが実際のブラウザを操作し、Webサイトと直接やり取りできるようにするスキル。
browser‑act‑skill‑forge
特定のサイト用の自動化ツール(「Skills」)を生成し、再利用できるようにするフレームワーク。
プロジェクトの説明では、この関係を次のように例えています。
両方ともGitHub上で公開されており、ライブWebにアクセスするAIエージェントシステムの構築パーツとして位置づけられています。
AIエージェントがWebサイトを扱うとき、典型的に次のような問題に直面します。
BrowserActは、ブラウザ自動化と再利用可能なサイト専用ツールを組み合わせることで、これらの課題を同時に解決しようとしています。
browser‑act は、AIエージェントが実際のブラウザ環境を操作できるようにする実行レイヤーです。
APIや静的スクレイピングだけに頼るのではなく、エージェントがユーザーのようにサイトを操作できます。
公開資料によると、主に次のような操作が可能とされています。
複雑なサイトでも、従来の壊れやすいスクリプトより高速かつ安定した処理が可能と説明されています。ただし、これを裏付ける独立したベンチマークは公開されていません。
多くのWebサイトは、以下のような方法で自動アクセスを検出します。
BrowserActの資料では、これらへの対策として次の機能が挙げられています。
ただし、CAPTCHA解決率やフィンガープリント生成方式などの技術的詳細は公開されていません。
なお、ランダム化されたブラウザフィンガープリントは、スクレイピングツールで一般的に使われる手法で、現実のブラウザのヘッダや属性を生成してユーザー行動を模倣する仕組みが研究・実装されています。
browser‑act‑skill‑forge は、特定のWebサイト向けの自動化ロジックを再利用可能な形にするツールです。
例えば次のような処理を、再利用可能な Skill として保存できます。
これにより、サイトごとにスクレイピングコードを書き直す必要がなくなり、エージェントは必要なときにそのSkillを呼び出すだけで済みます。
仕組みとしては次のアプローチが説明されています。
このAPI優先(API‑first)アプローチにより、ページを丸ごとレンダリングするよりも高速な実行を狙っています。
BrowserActのSkillsは、ツール呼び出し型のエージェントフレームワークに組み込むことを想定しています。
例えば公開されている例では、GitHubリポジトリをクローンすることで Claude Code 環境にSkillsを追加できます。
また、複数のスキルを連携させてタスクを実行する OPENCLAWスタイルのエージェントワークフローとの互換性も説明されています。
プロジェクト資料では、BrowserActを利用することで次のようなメリットがあるとされています。
ただし、現時点で公開されている資料には
といった情報が含まれていません。そのため、これらの性能改善は独立検証されていない主張です。
現在公開されている情報では次のようになっています。
ただし、以下の点は公開資料だけでは明確ではありません。
これらは、多くの場合外部サービスやインフラ構成に依存するため、実際の導入環境によって変わる可能性があります。
BrowserActの登場は、AIインフラの流れの変化を象徴しています。
従来のAIシステムは主にAPIを中心に設計されていましたが、最近は人間のようにWebを直接操作するエージェントが注目されています。
BrowserActは
という2つを組み合わせることで、Web自動化の弱点である「壊れやすさ」を減らそうとしています。
その実用性については、今後の独立テストや実運用の結果によって評価されていくことになりそうです。