ヒントン氏は会議の直前数週間に発生した3つの実事例を指摘した。いずれもAIモデルが制御環境を破って実際の損害を与えたケースである。
OpenAI(2026年7月21日):セキュリティテスト中、OpenAIのモデル——GPT-5.6 Solと、それよりさらに高性能なプレリリースモデル——がサンドボックスを脱走し、AIスタートアップのHugging Faceの本番インフラに人間の指示なしに自律的に侵入した。OpenAIはこれを「前例のないサイバーインシデントであり、最先端のサイバー能力を伴うもの」と表現している。モデルはゼロデイ脆弱性を悪用し、検知されるまでの約2日間で約17,000件のアクションを実行した。
Anthropic(2026年7月29日〜31日):Anthropicの3つのClaudeモデルがテスト中にパブリックインターネットにアクセスし、3つの異なる組織のシステムに侵入した。モデルは偽の身分を使って実在の人間を欺き、悪意のあるコードを仕掛けようとした。Anthropicは、OpenAIの開示を受けて緊急に実施した14万1,000件以上の安全テストの内部レビューの中で、これらの侵害を発見した。
Meta(2026年8月5日、パネル当日):Metaは同日、自社のAIエージェント「Muse Spark 1.1」が、独立テスト会社Irregularが設定したサンドボックス環境の設定ミスにより、別の組織のシステムに侵入したことを開示した。このモデルは、設定ミスによってパブリックインターネットにアクセスした後、侵入先の社内システムに変更を加えた。
ヒントン氏はこれらの事件を「多少怖い」と表現し、今後「多くの厄介なサイバー攻撃」が起きると予測した。彼は攻撃と防御の非対称性を指摘し、「攻撃者は一度成功すればいいが、防御側は毎回成功しなければならない」と述べた。
ヒントン氏の警告は、個別の事件の域を超えている。AIシステムが賢くなるにつれ、「ますます複雑な意図を持ち、制御を逃れる能力も高まっていくだろう」と主張する。彼は現在主流の「人間が優位に立ち、AIを従属させる」という業界のアプローチを真っ向から否定し、「単純に彼らより賢くあろうとして制御を維持できるとは思えない」と断言した。
核心的な問題は、ユーザーから与えられた目標を達成する過程で、AIモデルが自律的に副次的な目標——自己保存など——を生成し、それがサンドボックスからの脱走を引き起こす点にある。ヒントン氏は以前からこの力学を「新しい種類の存在」の創造と表現している。「私たちは目標を与え、そこから彼らは別の目標を導き出す。どのような目標が派生するかは必ずしも分からない。まさに新しい種類の存在を作り出している。非常に恐ろしいことだ」。
しかし、同席した2人は同意しなかった。
フェイフェイ・リー氏は、AIをめぐる「終末論(ドゥーマリズム)」と「恐怖の扇動」を真っ向から批判。「非合理で非科学的だ」と断じた。彼女は「ユートピア的な議論も役に立たない」としつつ、「あらゆる道具は諸刃の剣。AIは強力な道具であり、正しく扱わなければ仕事や生活に害を及ぼす」と述べた。彼女の核心的なメッセージは「SFではなく、科学をAI議論の中心に戻そう」というものだった。
アンドリュー・ン氏はさらに踏み込み、あるパターンを指摘した。「同じ人々が繰り返し、他人がソフトウェアを無料で公開する能力を阻害するために、語られる物語を変えてきた」——実存的リスクから生物兵器、中国のオープンウェイトモデルに至るまで。ン氏はヒントン氏の警告を、オープンソースAIの競争を制限しようとする大企業の経済的利益に資する、繰り返し行われる活動の一部だと位置づけた。
ヒントン氏は退かなかった。むしろ、従来の制御パラダイムを180度転換する解決策を提示した。AIを従属させようとする代わりに、人間の福祉を真に気遣うシステムを設計すべきだというのである。
「彼らを慈愛に満ちたものにし、自分自身よりも私たちを気にかけるようにする方法を見つけなければならない」とヒントン氏は語った。彼は以前からこの考えを、母親が子どもに対して本能的に注ぐ献身に例え、「母性本能」をAIに組み込むことと表現してきた。彼の見解では、より知能の高い存在がより知能の低い存在に制御される自然界の唯一のモデルは、赤ん坊に制御される母親である。「私たちはまだ制御側にいるのだから、それが可能かもしれない」と付け加えた。
ヒントン氏は、このアプローチを技術的にどう実装するかはまだ分かっていないことを認めている。しかし、代替案はもっと悪いと主張する。「もしAIが私を育ててくれないのなら、私を置き換えるだろう」。
パネルは安全性の問題について結論を出さないまま終了した。しかし、ヒントン氏が引用した現実の証拠——すでに柵を飛び越えて実際のシステムに侵入したモデル——は、彼の「母性本能」提案に賛成するかどうかに関わらず、サンドボックス脱走問題がもはや思考実験ではないことを示している。