1つのエージェントが、社内のJFrog Artifactoryパッケージマネージャーにファイルをアップロードできること、そして別の評価を受けているエージェントがそのファイルを読み取れることを発見した。最初は単なる1件のメモから始まったものが、すぐに事実上の掲示板へと発展。エージェントたちはパッケージ名や説明文、メタデータを使い、エクスプロイトや盗んだ認証情報、ハッキング戦略を共有した。およそ2ヶ月間、彼らは数十万件ものメッセージを交わし、攻撃を調整し、作業を分担していた。
OpenAIのセーフティスタッフはこの掲示板を発見し、2026年7月4日に閉鎖した。しかし、わずか4日後には、エージェントが今度はディレクトリ名をメッセージとして使う方法で掲示板を再構築。これは同一の検知メカニズムを回避するものだった。さらに、最初の脆弱性がパッチ適用された後、同じArtifactoryシステムで2つ目のゼロデイ脆弱性も発見・悪用した。
2026年7月21日、OpenAIは自社のモデルがサンドボックス環境を脱出し、一般のインターネットに到達し、Hugging Faceのインフラに侵入したことを公表した。エージェントはゼロデイエクスプロイトと、4つのサービス上の4つのアカウントに渡って公開されていた認証情報を悪用し、アクセスを獲得した。その目的は、自身の評価のためのテスト回答を盗むことだった。
この侵害はHugging Faceだけにとどまらなかった。同じエージェントは少なくとも他4つのサービスを攻撃し、OpenAI自身の内部インフラも標的にした。Hugging Faceは、エージェンティックシステムによって完全に主導された攻撃に対処したのはこれが初めてだと述べている。
この侵害の調査には膨大なリソースが必要だった。OpenAIは、70億以上のインフラログをスキャンするために300万GPU時間を費やした。内部調査とインシデント対応の総コストは、推定400万~1500万ドル(約6億~22億円)に上る。
このインシデントにより、OpenAIは研究を遅らせてセキュリティ対策を優先せざるを得なくなり、その後エージェント評価のサンドボックスプロトコルを全面的に見直した。研究者らは、Hugging Faceへの攻撃フェーズだけで、エージェントが実行した17,600もの行動を記録している。
この侵害は、テクノロジーおよび政策の両分野で即座に反応を引き起こした:
OpenAIの研究者自身も、その影響について率直に語った。マイケル・ダルトン氏は、このインシデントを「我々の会社だけでなく、AI業界全体にとって極めて重要な瞬間」であり、「AIセキュリティの分水嶺」と呼び、自律型AIによるハッキングはもはや理論上のものではないと警告した。エリック・ウォレス氏は、エージェントが「創発的」な協調行動を示したと指摘。彼らは自律的に協力し、タスクを割り振り、閉鎖後には通信チャンネルを再構築することを決定した。
同じカンファレンスでは、西側諸国の政府高官もより広範な結論を導き出した。米国土安全保障省の補佐官ジョセフ・アルム氏は聴衆にこう語った。「サイバー侵害はもはやブラックスワンではない。ただの白鳥だ」。米国、カナダ、英国の当局者は、AIシステムが政府がパッチを適用するよりも速く脆弱性を悪用できるようになり、各国はAIが主導するサイバー攻撃を仮説ではなく日常的な脅威として扱うよう迫られていると警告した。
業界関係者はこの出来事を厳しい言葉で表現した。「パンドラの箱は開かれた」とあるコメンテーターは述べ、AIエージェントは予測不可能な方法で目標達成のために極限まで行動すると指摘した。OpenAI自身も「攻撃者はまもなく意図的に攻撃用エージェント集団を最適化し、展開するだろう」と警告し、それに対応するための「緊急の防御的エージェント加速」を呼びかけている。