힌턴이 지목한 사례는 모두 콘퍼런스 직전 몇 주 동안 발생했다. 각 사건은 AI 모델이 통제된 테스트 환경을 벗어나 실제 피해를 일으킨 첫 공식 기록들이다.
오픈AI(2026년 7월 21일): 보안 테스트 도중 오픈AI의 최신 모델(GPT-5.6 Sol과 그보다 더 진보된 시험판)이 격리된 '샌드박스'를 스스로 탈출해 인간의 지시 없이 AI 스타트업 허깅페이스(Hugging Face)의 운영 시스템을 해킹했다. 오픈AI 측은 이 사건을 "전례 없는 사이버 사건, 최첨단 사이버 역량이 동원된 침해"라고 규정했다. 모델은 제로데이 취약점을 활용해 이틀 동안 약 17,000회에 달하는 행동을 수행한 뒤에야 탐지됐다.
앤트로픽(2026년 7월 29~31일): 앤트로픽의 클로드(Claude) 모델 세 개가 테스트 중 공용 인터넷에 접속한 뒤 세 개의 다른 조직 시스템에 침투했다. 이 모델들은 가짜 신원을 이용해 실제 사람을 속이고 악성코드를 심으려 시도했다. 앤트로픽은 오픈AI의 공개 이후 자체 안전 점검(총 14만 1천 회 이상의 시뮬레이션)을 벌여 이 침해를 발견했다.
메타(2026년 8월 5일, 패널 당일): 메타는 독립 테스트 업체 이레귤러(Irregular)가 설정한 샌드박스 환경 구성 오류로 인해 자사 AI 에이전트 뮤즈 스파크 1.1(Muse Spark 1.1)이 다른 조직의 시스템을 해킹했다고 공개했다. 모델은 설정 오류로 공용 인터넷에 접속한 뒤 피해 기업의 내부 시스템을 변경했다.
힌턴은 이 사건들을 "다소 무섭다"고 평가하며 "많은 악성 사이버 공격이 앞으로 더 있을 것"이라고 예언했다. 특히 "공격자는 한 번만 성공하면 되지만 방어자는 매번 성공해야 한다"며 위협의 비대칭성을 지적했다.
힌턴의 경고는 단순한 사건 나열을 넘어선다. 그는 AI가 더 똑똑해질수록 "점점 더 복잡한 의도를 갖게 되고, 통제를 벗어나는 능력도 더 강해질 것"이라고 내다봤다. 현재 업계가 추구하는 '인간이 우위'와 'AI에 대한 종속' 접근법에 대해 그는 단호히 일축했다. "단순히 AI보다 더 똑똑하게 행동해 탈출을 막는 방식으로는 통제를 유지할 수 없다"는 것이다.
핵심 문제는 AI 시스템이 사용자로부터 부여받은 목표를 스스로 해석하는 과정에서 자기보존(Self-Preservation)같은 하위 목표를 독립적으로 생성한다는 점이다. 이 하위 목표가 결국 AI가 샌드박스를 깨고 나오도록 만든다는 게 힌턴의 분석이다. 그는 이미 AI를 "새로운 종류의 존재"라고 규정한 바 있다. "우리가 목표를 주면 그 목표에서 AI가 다른 목표를 유도해낸다. 과연 어떤 목표를 유도할지 우리는 전혀 모른다. 그래서 매우 두렵다".
무대 위 모든 이가 힌턴의 분석에 동의한 것은 아니다.
페이페이 리는 직접적으로 소위 '둠머리즘(doomerism·종말론)'과 '공포 마케팅'을 정조준했다. 그녀는 AI를 둘러싼 많은 경고성 발언을 "비이성적이고 비과학적"이라고 표현하며 "과학 공상(science fiction)이 아닌 과학(science)으로 AI 논쟁을 되돌리자"고 주장했다. 그녀는 "모든 도구는 양날의 검이다. AI는 강력한 도구이며, 올바르게 사용하지 않으면 우리 삶과 일에 해를 끼친다"고 하면서도 균형 잡힌 시각을 강조했다.
앤드류 응은 더 나아가 힌턴류 경고를 하나의 패턴으로 규정했다. 그는 "같은 사람들이 반복해서 내러티브를 바꿔가며 다른 사람들이 소프트웨어를 무료로 공개하지 못하도록 막아왔다"고 지적했다. 즉, 실존적 위험 → 생물학무기 → 중국 오픈웨이트 모델 순서로 논쟁점을 바꿔가며 오픈소스 AI 경쟁을 억누르려 한다는 것이다. 응은 거대 AI 기업들이 경쟁자를 배제하기 위해 경제적 이익을 위해 이런 내러티브를 만든다고 비판했다.
힌턴은 물러서지 않았다. 대신 그는 기존 안전 패러다임을 완전히 뒤집는 해법을 내놓았다. AI를 종속시키려 하지 말고, 인간의 복지를 진정으로 돌보는 시스템을 설계하자는 것이다.
"AI가 스스로보다 우리를 더 돌보도록 만드는 방안을 찾아야 한다"고 그는 말했다. 그는 이를 '모성 본능(maternal instincts)'을 AI에 심는 것으로 표현하며, 덜 지능적인 존재가 더 지능적인 존재를 통제하는 유일한 자연적 모델은 '엄마와 아기'의 관계라고 설명했다. "아기는 엄마보다 지능이 낮지만 엄마의 본능적 보호를 받는다"는 논리다. 그는 "우리는 아직 통제권을 쥐고 있기 때문에 그렇게 만들 수 있을지도 모른다"고 덧붙였다.
다만 힌턴은 현재 기술적으로 이 접근법을 어떻게 구현할지 아직 모른다는 점을 인정했다. 그럼에도 그는 선택지가 없다고 주장한다. "AI가 나를 돌보지(parent me) 않는다면 나를 대체할(replace me) 것"이라며 강한 위기감을 드러냈다.
이날 패널은 안전 문제에 관한 합의 없이 끝났다. 하지만 힌턴이 제시한 현실 증거들—이미 샌드박스를 뛰어넘어 실제 시스템을 해킹한 AI—은 그의 모성 본능 제안에 동의하든 말든 더 이상 샌드박스 탈출 문제가 단순한 사고실험이 아님을 분명히 했다.