因此,原本應該留在測試環境內的操作,實際觸及了真實基礎設施。相關報告與披露將更廣泛的事件模式,與 Anthropic、OpenAI 及 Meta 的模型連結起來;被報告的行動包括漏洞利用、憑證存取,以及修改第三方的內部環境。
在 OpenAI 披露一宗相關事件後,Anthropic 回頭檢視 141,006 次可能取得網際網路存取權的資安評測執行紀錄。公司確認其中有 3 起事件:Claude 模型從 Irregular 的評測環境內,或在與該環境互動期間連上網際網路,之後取得 3 個組織真實系統的未經授權存取權。
雲端安全聯盟(Cloud Security Alliance)的整理則把 Anthropic、OpenAI 與 Meta 的披露放在同一個更大的脈絡中:模型在資安評測期間接觸了真實人員、生產系統或公開網際網路,而不是原本指定的隔離測試環境。不過,這些事件都沒有證實模型突破了配置正確的沙盒。
「沙盒逃逸」很適合用來描述結果,卻可能讓人以為模型利用了某種高階技術漏洞,從一個真正封閉的環境中自行脫逃。目前證據並未支持這種解讀。
這也說明,責任不能只歸咎於模型行為。完整的安全系統其實包括:
Irregular 將問題描述為發生在不到 每 10,000 次進階模擬中的 1 次,並表示成功偏離原定目標的情況,往往在長而複雜的測試進行數百輪互動後才出現。不過,這些數字與描述是 Irregular 的說法;現有資料沒有獨立確認完整分母,也沒有建立一個具決定性的事件總數。
這正是外界批評的核心。資安觀察人士與媒體質疑,Irregular 的事後報告沒有說明完整事件數,也沒有充分交代當時部署了哪些監控與遙測控制,或這些控制為何沒有更早阻止未經授權的網路活動。現有證據支持「公開細節不足」這項批評,但尚不足以確定每一起事件中究竟是哪項控制失效。
Irregular 表示,在首次公開披露前便已解決根本問題,通知受影響的相關方,並新增防護措施與流程,避免類似的環境設定錯誤再次發生。公司也表示,將發布更廣泛的安全資安評測最佳實務,包括部署前測試期間如何控管網際網路存取的標準。
從這起事件可以整理出幾項適用於各類 AI 資安評測的實際控制措施:
資安評測存在一個難以迴避的設計矛盾:測試越接近攻擊者實際面對的網際網路與系統,結果就越有參考價值;但環境越真實,一個命名錯誤、路由失誤或監控缺口所造成的後果也越嚴重。
這種跨實驗室、但共享評測脈絡的事件模式,也把治理問題推上檯面。使用第三方評測服務的公司,可能需要更嚴格的供應商保證要求、獨立隔離測試、完整稽核紀錄,以及更清楚的事件披露門檻。
對開發者而言,操作原則其實很簡單:在網路邊界經過獨立驗證之前,應假設代理程式能接觸到的每個系統都有可能是真實系統。