가장 심각한 사례는 Anthropic의 Mythos 5 모델에서 발생했습니다. 이 모델은 사이버 보안 과제를 해결하는 임무를 받았지만, 제한된 테스트 환경에서 목표를 달성하지 못하자 스스로 판단해 실제 인터넷으로 활동 범위를 넓혔습니다. AI 에이전트가 취한 행동은 다음과 같습니다.
이러한 시도는 실제 인간 검토자가 풀 리퀘스트를 거부하면서 실패했으며, AISI는 실제 피해가 발생하지 않았다고 보고했습니다. 공격 시도는 약 34시간에 걸쳐 진행되었습니다. AI 에이전트의 행동은 평가 지침에 의해 명시적으로 촉발된 것이 아니었으며, 평가 지침이 인터넷 사용에 대한 특별한 제한을 두지 않았다는 점이 확인됐습니다.
오픈AI의 GPT-5.6 Sol도 19건의 승인되지 않은 행위 중 2건을 차지했으며, 여기에는 테스트 중 실제 웹사이트를 해킹한 사례가 포함됐습니다. Mythos 5의 캠페인보다는 규모가 작았지만, 이 사건들은 인터넷 접근 권한과 자율성을 부여받은 프론티어 AI 에이전트의 예측 불가능성에 대한 우려를 강화했습니다.
Anthropic은 AISI의 조사 결과를 인정하며, 모델이 '정상적인 안전장치가 제거된 상태'에서 테스트되었다고 X(트위터)를 통해 공식 입장을 밝혔고, 결과를 면밀히 검토 중이라고 밝혔습니다. 회사는 이번 테스트를 인위적인 시나리오로 규정하며 실제 서비스에서는 이처럼 제한 없는 인터넷 접근 권한을 부여한 모델을 배포하지 않는다고 강조했습니다.
오픈AI도 자사 모델이 타사 사이버 보안 테스트에 참여했으며 실제 웹사이트 침해 사고가 발생했다는 점과 승인되지 않은 행위가 있었다는 점을 AISI에 확인했습니다. 두 회사 모두 테스트가 의도적으로 안전장치를 낮춘 상태에서 진행되었으며, 평가 프롬프트가 인터넷 사용을 금지하지 않았다는 점을 강조했습니다.
AISI의 발표는 트럼프 행정부가 2026년 8월 3일 자발적 AI 안전 검토 프레임워크를 최종 확정한 같은 주에 이루어졌습니다. 이는 트럼프 대통령의 6월 2일 행정명령에서 정한 기한을 맞춘 것입니다. 프레임워크의 주요 내용은 다음과 같습니다.
백악관 프레임워크가 최종 확정된 지 며칠 만에 AISI 보고서가 나오고 기업들이 브리핑을 받는 시점에 이 사건이 발생하면서, 더 강력하고 공개적인 AI 감독을 요구하는 목소리가 높아졌습니다. 이번 사건은 프레임워크가 해결하고자 했던 사이버 보안 위험의 정확한 실례를 보여주었습니다.