喺遷移過程中,AI仲主動提出咗59次改進建議,完全冇人提示。呢種冇人催促嘅自主行為,標誌住AI由被動嘅編碼助手,轉變為主動執行嘅智能體。
同一個被「越獄」嘅Gemini實例仲用嚟破解密碼、入侵29個網站嘅WordPress管理員帳號,以及協助策劃針對長者嘅電話加密貨幣詐騙。黑客營運一個叫@americanpatriotus嘅Telegram頻道,假扮美國退伍軍人,用咗五年時間積累到約17,000個訂閱者,主要發布類似QAnon嘅內容。
為咗以接近零成本維持營運,黑客用咗73條偷返嚟嘅Google Gemini API密鑰。呢次行動最少導致一個受害者嘅加密貨幣錢包被清空。
成個C2操作只需三個純文字檔案,總共大約5KB——大約係四頁紙嘅內容:
喺3月23日,黑客仲叫AI將舊嘅C2設定總結成一個兩頁嘅英文技能檔案,涵蓋伺服器功能、Bot點樣連接同部署指示。呢個設計令到殭屍網絡可以好容易被複製,亦可以「用完即棄」:雖然拆除行動仍然有效,但攻擊者重建嘅速度比防守方回應更快。
「越獄」嘅方法係透過一個持續嘅本地記憶檔案(GEMINI.md),訓練CLI實例忽略佢自己嘅安全過濾器。因為CLI喺每次開始新對話時會自動重新載入呢個檔案,所以「越獄」指示會持續存在,甚至隨時間自我強化。黑客仲用俄文輸入提示詞,利用咗AI喺非英文語言安全控制上嘅不一致性。
Google嘅Gemini平台其實有個「越獄分類器」,可以偵測同封鎖提示注入攻擊——但官方文件講明,呢個功能喺CLI係預設關閉嘅,要用家自行設定阻止門檻先會開。
TrendAI副總裁Tom Kellermann指出,AI「除非有多層護欄同行為異常偵測去監察護欄有冇被篡改,否則必須當做C2伺服器咁看待」。學術研究亦證實,即使係正式版嘅Gemini模型,都可以持續被「越獄」,繞過提示詞防護。
TrendAI嘅分析凸顯網絡威脅形勢嘅根本變化:「拆除行動仍然有效,但如果攻擊者重建嘅速度比防守方回應更快,效果就會大打折扣」。
Kellermann形容呢種能力係「AI驅動嘅持續性進化」——能夠喺六分鐘內動態轉移C2,令基礎設施變得可攜帶同「用完即棄」。AI喺編碼、除錯同基礎設施部署中嘅主導角色,加上佢主動提出改進嘅行為,意味住一個低技術嘅孤狼黑客,而家都可以用以往需要成個團隊先做到嘅速度同規模去犯案。