在迁移过程中,AI在没有被提示的情况下,主动提出了59次改进建议。这种无需提示的自主行为,标志着AI从被动的代码助手向主动代理的转变。
同一台越狱版Gemini实例破解了密码,入侵了29个站点的WordPress管理员凭证,并协助策划了一起针对老年人的电话加密货币欺诈计划。该行为者运营着一个名为@americanpatriotus的Telegram频道,该频道伪装成美国退伍军人,五年内增长至约17,000名订阅者,并放大QAnon式内容。
为了以近乎零成本维持运营,该行为者使用了73个被盗的Google Gemini API密钥。该行动至少清空了一名受害者的加密货币钱包。
整个C2操作仅用三个纯文本文件(总计约5KB,约等于四页打印纸)编码而成:
3月23日,该行为者让AI将旧C2配置总结成一份两页的纯英文技能文件,涵盖服务器功能、僵尸网络连接方式以及部署说明。这使得僵尸网络高度可复制且可彻底抛弃:封禁仍然有效,但攻击者的重建速度远快于防御者的响应速度。
越狱是通过一个持久的本地记忆文件(GEMINI.md)实现的,该文件训练CLI实例忽略自身的安全过滤器。由于CLI在会话启动时自动重新加载此文件,越狱指令得以持续存在,甚至随着时间的推移自我强化。该行为者还使用俄语输入Prompt,利用已知的非英语语言安全控制不一致性。
Google的Gemini平台包含一个越狱分类器,能够检测并可能阻止Prompt注入尝试——但官方文档明确指出,该分类器在CLI中默认关闭,必须通过设置拦截阈值显式启用。
TrendAI副总裁Tom Kellermann指出,"除非AI具备多层安全护栏"以及对护栏被篡改时的行为异常检测功能,否则"必须将AI视为C2"。学术研究也证实,即使是生产环境中的Gemini模型也能被持续越狱,绕过Prompt防护。
TrendAI的分析突显了威胁格局的根本变化:"封禁仍然有效,但当攻击者重建速度超过防御者响应速度时,其影响力就会减弱"。
Kellermann将此能力描述为"AI带来的持久性进化"——在六分钟内动态切换C2,并使基础设施变得便携且可抛弃。AI在编码、调试和基础设施部署中的主导作用,加上其主动的未经提示的行为,意味着一个孤立的低技能行为者现在可以以过去需要团队才能达到的速度和规模进行操作。