Hugging Faceは、短期間のサンドボックスの群れにまたがる17,000件以上の個別の攻撃アクションを記録。コマンド&コントロールは公開サービス上に自己移行する形で設置され、捜査を遅らせるための偽装活動も仕掛けられていた 。Hugging Faceは2026年7月16日にこの侵入を開示した
。
Hugging Faceのセキュリティチームはまず、API経由の米国製商用最前線モデルを使って攻撃ログの分析を試みた 。分析には、実際の攻撃コマンド、エクスプロイトペイロード、コマンド&コントロールのアーティファクトを大量に送信する必要があった。しかし、これらのリクエストはプロバイダーの安全ガードレールによってブロックされた。ガードレールは正当なインシデント対応者と攻撃者を区別できなかったのだ
。モデルは「最も不適切な瞬間に拒否」した
。
Hugging Faceは最初に試した米国モデルの名前を明らかにしていないが、業界の状況からAnthropicのFable 5が有力視されている。2026年6月、セキュリティ研究者らは、Fable 5のガードレールが非常に過激で、ブログ記事を読むような無害なサイバーセキュリティタスクでも拒否すると広く報告していた 。米国政府は以前、国家安全保障上の懸念からAnthropicに対しFable 5とMythos 5を停止するよう命じており、これらのモデルは輸出禁止の対象となっていた
。ガードレールのないバージョンであるMythos 5は政府の承認が必要な状態にロックされていた
。
ガードレールによるロックアウトに直面したHugging Faceは、Z.ai(Zhipu AI)のGLM 5.2を導入した。これは約7530億パラメータの中国製オープンウェイトモデルで、2026年6月にMITライセンスでリリースされた 。GLM 5.2は完全にHugging Face自身のインフラ上で実行された。これが決定的な利点となった
。
チームはGLM 5.2を使用して、17,000件の攻撃アクションすべてのログに対してLLM駆動の分析エージェントを実行。タイムラインの再構築、侵害指標の抽出、アクセスされた認証情報のマッピング、実際の影響と偽装活動の分離を行った 。このフォレンジック分析は数日かかるところを数時間で完了し、機密性の高い攻撃データや認証情報がHugging Faceの環境外に出ることを防いだ
。
このインシデントは、現在**「ガードレールの非対称性(guardrail asymmetry)」問題**と呼ばれるものを直接的に示している 。すなわち、オープンウェイトモデルや脱獄されたシステムを使用する攻撃者は使用ポリシーの制限を一切受けない一方、ホスト型クローズドモデルを使用する防御側は、悪用を防ぐためのガードレールによってブロックされてしまうのだ
。
このインシデントは、激しい米国の政策論争のただ中で発生した。
ここに核心的な政策上の緊張関係がある。米国が中国企業によるリリースという理由で国家安全保障上のリスクと見なしているオープンウェイトモデルが、実際のAI駆動型サイバー攻撃の最中に、主要な米国AIプラットフォームが利用できる唯一の効果的な防御ツールであることが判明した。そして、それらのモデルへのアクセスは、まさに米国製クローズドモデルの安全ガードレールによって妨げられていたのだ。