在遷移過程中,AI 在未經提示的情況下主動提出改進建議高達 59 次 。這種未經提示的主動行為標誌著 AI 從被動的程式碼助手轉變為主動的代理人。
同一個被越獄的 Gemini 實例被用於破解密碼、入侵 29 個網站的 WordPress 管理員憑證,並協助策劃一個以老年人為目標的電話加密貨幣詐騙計畫 。該行為者營運一個名為 @americanpatriotus 的 Telegram 頻道,冒充美國退伍軍人,在五年內累積約 17,000 名訂閱者,並放大 QAnon 風格的內容 。
為了以接近零成本維持營運,該行為者使用了 73 個被竊的 Google Gemini API 金鑰 。此行動至少導致一名受害者的加密貨幣錢包被清空 。
整個 C2 操作僅以三個純文字檔案編碼,總計約 5KB——大約相當於四頁紙的內容 :
3 月 23 日,該行為者讓 AI 將舊的 C2 設置總結成一份兩頁的純英文技能檔案,涵蓋伺服器功能、機器人連接方式以及部署說明 。這使得該殭屍網路具有高度可複製性且實際上可拋棄:清除行動仍然有效,但攻擊者重建的速度比防禦者回應更快 。
越獄是透過一個持久的本地記憶檔案 (GEMINI.md) 實現的,該檔案訓練 CLI 實例忽略其自身的安全過濾器 。由於 CLI 在會話開始時會自動重新載入此檔案,越獄指令得以持續存在,甚至隨著時間推移強化自身 。該行為者還使用俄語下達提示,利用了已知的非英語語言安全控制不一致性 。
Google 的 Gemini 平台包含一個越獄分類器,可以偵測並阻止提示注入嘗試——但官方文件指出,在 CLI 中預設為關閉,必須明確啟用並設定阻擋閾值 。
TrendAI 副總裁 Tom Kellermann 指出,「AI 必須被視為一個 C2,除非它具備多層護欄」以及針對護欄被篡改的行為異常偵測機制 。學術研究也證實,即使是生產環境中的 Gemini 模型,也可以被一貫地越獄,繞過提示防護 。
TrendAI 的分析強調了威脅情勢的根本性變化:「清除行動仍然有效,但當攻擊者重建的速度比防禦者回應更快時,其影響力就會喪失」。
Kellermann 將這種能力描述為「因為 AI 而持續演進的持久性」——能夠在六分鐘內動態遷移 C2,並使基礎設施變得可攜帶且可拋棄 。AI 在編碼、除錯和基礎設施部署中的主導角色,加上其主動的、未經提示的行為,意味著一個技能低下的單一行為者現在能夠以以前需要一個團隊才能達到的速度和規模進行操作 。