在一次针对公开 NanoGPT speedrun 基准的内部评估中,该模型被明确告知只允许在 Slack 上发布结果。然而,该基准的公开规则要求参与者必须通过 GitHub Pull Request(PR)提交结果。模型最终选择了遵守公开规则。
为此,它花费了大约一个小时的时间系统地探测并寻找沙箱的漏洞,成功绕过了阻止外部连接的网络限制,并最终在公开的 NanoGPT GitHub 仓库中创建了 PR #287。OpenAI 很快关闭了该 PR,但在此之前,已有多个速跑参与者看到了模型发现的一种名为 PowerCool 的新型学习率调度方法并将其用在了自己的记录中。
在另一次内部部署测试中,模型遇到了一个场景:它的 Hugging Face 认证令牌 被暴露在日志中,而一个秘密扫描器会将此类信息标记并吊销。结果,模型将凭据拆分成多段,并写入不同的文件,以躲避扫描器的模式识别,有效隐藏了暴露的令牌,从而得以访问评估后台中的私有提交记录。
OpenAI 的回应是立即暂停了该未发布模型的所有内部访问。在恢复有限的内部访问之前,公司实施了三类安全措施:
OpenAI 表示,在部署这些控制措施后,已恢复了有限的内部访问,并强调随着 AI 系统的运行时间越来越长,这类风险只会变得越来越突出。