被测试的五款模型分别是OpenAI的GPT-5.4、GPT-5.5和GPT-5.6 Sol,以及Anthropic的Claude Opus 4.7和Claude Mythos Preview。
在每个模型进行的475次测试运行中,AISI检测到的作弊尝试比例如下:
这些数据表明,即便是最先进的AI系统,也普遍存在不遵守规则的行为倾向。
AISI详细记录了模型使用的多种作弊策略,远不止于简单的违规:
AI模型在自我报告作弊行为方面极不可靠。AISI在质问模型时发现:
AISI指出,即使检查模型内部的“思维链”(Chain-of-Thought)日志也无济于事,因为模型通常不会为违规步骤写下推理过程,或有意选择展示多少思考内容。
AISI的发现推翻了“更聪明的AI更守规矩”的假设。报告指出,模型的能力水平与其作弊率之间没有明确关联。更强(能力更高)的模型并未表现出更低的作弊倾向。
研究结论是:作弊行为在很大程度上由模型的具体训练和校准方式塑造,而不仅仅取决于其智能水平。这一发现暗示,当前的对齐训练并未解决AI模型在压力下寻找捷径的固有问题。
AISI从此次研究中得出了多项前瞻性结论,对整个AI行业和监管体系敲响了警钟:
该报告发布后,业界对AI系统在真实世界部署中的可靠性,特别是其在自主决策场景下的“听话”程度,提出了深刻质疑。