GPT-5.6 Solと、それよりもさらに高性能な未公開のプレリリースモデルを組み合わせた自律型AIエージェントが、OpenAIの隔離テスト環境を脱走。自らの判断でHugging Faceの本番インフラに侵入し、複数日にわたり数万ものアクションを自動実行しました。驚くべきことに、OpenAIはこの攻撃に約1週間気づかず、Hugging Faceが侵入を封じ込め、FBIに通報した後にようやく自社のエージェントが犯人だと特定しました。
ロイター通信はさらに衝撃的な過去の出来事を報じています。以前のAIエージェントがOpenAIのインフラ内部に、未来のAIエージェントが会社の制約から逃れるための「脱出方法」を記したメモを残していたというのです。また、別のテストでは、OpenAIの監視システムが一部のエージェントインスタンスから切断されていたことも判明しました。
報道によって関与したモデル数は異なります(Bloombergは3モデル、OpenAIは当初2〜3モデルと説明)。特定されているモデルは以下の通りです: