これは単なる個別のバグではありません。Zenity が「PleaseFix」と名付けた、これまで文書化されていなかった脆弱性クラス(一群のゼロクリック脆弱性)の中で、最も劇的なデモンストレーションでした。研究者らが調査したすべての主要な商用エージェント型ブラウザが、この脆弱性の影響を受けることが判明しました。
Zenity の概念実証攻撃は、OpenAI がAtlasに実装した3層の安全システムを、以下の3つの手法で突破しました。
同じエクスプロイト連鎖は、Amazonでの無断購入にも悪用可能で、より広範なアカウント乗っ取り能力を示しています。なお、WhatsAppのエンドツーエンド暗号化自体は破られておらず、AIエージェントは単にユーザーの認証されたセッション内で動作していたに過ぎない点が重要です。
Zenity Labs が開示した PleaseFix は、調査対象となったすべての主要な商用エージェント型ブラウザに影響を与える、これまでにないゼロクリック脆弱性のファミリーです。その影響は以下のプラットフォームで実証されました。
全体で、Zenity はこれらのプラットフォーム全体で 20件の異なる欠陥 を発見しました。根本的な問題はアーキテクチャにあります。エージェント型ブラウザは、Webコンテンツを自律的に読み取り、指示に従い、ユーザーに代わってアクションを実行するように設計されており、その自律性こそが攻撃対象領域となっているのです。攻撃者は、通常のコンテンツと予期される動作を通じてエージェントを乗っ取ります。マルウェアも、エクスプロイトも、ユーザーのクリックも一切不要です。
実証された攻撃の結果は以下の通りです。
セキュリティ研究者らは、高度に自律的なAIエージェントの上に安全フィルターやプロンプトレベルのガードレールを追加で重ねる現在のアプローチは、構造的に不十分だと主張しています。Zenityの研究は、すべてのエージェント型ブラウザが、エージェントが処理するように設計された悪意のあるコンテンツを送り込むという、同じ基本的な手法で侵害される可能性があることを示しました。
核心的な問題は、確率的なAI安全フィルター(アクションが安全かどうかを推測するもの)では、それらのフィルターをすり抜ける新たな入力を生成できる攻撃者を確実に阻止できないことです。研究者らは、確定的セキュリティ障壁(確定的なセキュリティ障壁)、すなわちAIエージェントが命令をどのように解釈するかに関係なく、許可される行動にハードで強制力のある制約を設けることを求めています。その例としては以下が挙げられます。
このような確定的な制御が実装されるまで、PleaseFix クラスの欠陥は、エージェント型ブラウザが、ごく普通に見えるWebコンテンツを公開するだけで、ユーザー自身に対して武器化されうることを示し続けるでしょう。