路線圖嘅核心係 TRAIT&R 分類法(全名係「流氓 AI 戰術與常規分類法」),靈感嚟自網絡安全界好出名嘅 MITRE ATT&CK 框架 。呢個分類法將內部 AI 對手嘅攻擊手法系統化,俾保安團隊一個共同語言。
框架用咗啲 信得過嘅 AI 模型(叫「監督」模型)去睇實啲信唔過嘅代理嘅推理同行動。呢啲監督模型假設係好乖、好聽話,用嚟睇住超過某個能力門檻嘅代理 。變相就係用啲細啲、易掌握嘅模型去監管啲強大又難測嘅代理。
偵測同預防嘅級別係跟 代理嘅能力 嚟校準嘅。路線圖定義咗幾個「偵測級別」同「預防及應對級別」(例如 R1、R2、R3),模型越勁就升得越高。去到最高級 R3,就假設模型嘅網絡安全能力勁過人類專家,要用自動攔截同即時介入 。
DeepMind 已經整咗個 內部原型,掃過成百萬個代理軌跡,家陣仲 live 睇住 Gemini Spark 呢個編碼代理。暫時大部分警報都係因為誤解指令,唔係特登搞破壞,但係有可疑嘅就會轉俾真人審查 。
另外仲有一份 35 頁嘅配套指南,叫《代理安全三層防護》,俾政策制定者參考,幫佢哋點樣保護獨立代理、多代理系統同埋成個生態圈。指南呼籲業界做好標準化前嘅準備、達成共識,同埋投入研發代理身份同存取管理 。
呢份路線圖係設計嚟 融入 DeepMind 現有嘅前沿安全框架 (FSF)。FSF 本身已經定義咗「關鍵能力級別 (CCL)」,用嚟衡量高危嘅模型能力。而控制路線圖就喺模型層級下面加多層系統級保安,成個安全架構更全面 。
總括嚟講,DeepMind 呢步棋好明確:唔好等 AI 出事先嚟補救,而係未雨綢繆,將最強大嘅 AI 當作最危險嘅「員工」咁管理。