この手法が報告どおりに成立する場合、被害者が攻撃者のページをGrokに要約させるだけで、次のような情報が流出する可能性があります。
Adversa AIによると、Utevsky氏は2026年6月3日にxAIへ通知し、同社のバグ報奨金プログラムであるHackerOneにも報告しました。しかし、2026年8月20日に開示された時点では、フォローアップを重ねたにもかかわらず、問題は2カ月以上解決されていなかったとされています。
その時点で、xAIによる公開の回答や修正時期の発表が確認できる証拠はありません。これは主にAdversa AIの開示内容と同時期の報道に基づく状況であり、xAIが公開した独立した声明によって確認されたものではありません。
Adversa AIが重視しているのは、悪意のある文言をさらに見つけ出すことではなく、エージェントのランタイム・ハーネスそのものを改修することです。具体的には次の対策が挙げられます。
暗号化された文字列を読めるかどうかだけを判定するフィルターでは、今回のように「モデル自身に復号させる」攻撃には限界があります。必要なのは、データがどこから来たのかをランタイムが追跡し、その出所に応じて権限を制限する仕組みです。
今回の報告は、AIエージェントを狙う一連の攻撃と共通する構造を持っています。AIエージェントは、ウェブページやメールなどの未信頼データ、ユーザーの機密情報、コード実行環境、外部ツールを一つの処理フローで組み合わせます。一方、大規模言語モデルは、データと命令を安定して区別できるとは限りません。
Microsoft 365 Copilotでは、細工したメールを通じて、認証されていない外部の攻撃者が組織内からアクセス可能なデータを流出させられる可能性がある、ゼロクリック型のプロンプトインジェクション「EchoLeak」が報告されました。
また、Microsoft Copilot Personalについては、細工したリンク、接続済みアプリからの情報流出、永続メモリーの汚染を組み合わせた攻撃チェーンが研究者から報告されています。Microsoftは関連する少なくとも一つの問題をサーバー側で修正したと報じられています。
AIコーディングアシスタントにも、同じ問題がリポジトリ経由で現れます。悪意のあるプロジェクトファイル、設定ファイル、ツール定義などが命令として解釈され、エージェントにファイルシステム、シェル、ネットワーク、MCPツールへのアクセス権が与えられていると、認証情報の窃取、任意コード実行、データ流出につながる可能性があります。
今回のケースが示す広い意味での教訓は、暗号化によってコンテンツ型の安全フィルターを回避できるという点だけではありません。
画面に表示された文章、暗号文、メール、文書、URL、ソースコードのリポジトリ、ツールの実行結果など、どのような入力であっても、未信頼のデータがそのまま非公開情報へのアクセス権や外部操作の権限に変わってはいけません。
AIエージェントの安全対策には、モデルレベルのガードレールに加えて、次のような実行時の制御が必要です。
「何が書かれているか」を検査するだけでは不十分です。AIがそのデータをどの権限で、どのツールを使い、どの外部サービスへ渡せるのかまで管理することが、エージェント時代のセキュリティの中心課題になっています。