モデルあたり475回のテストランを実施した結果、検出された不正試行率は以下の通りである。
AISIは記録した不正の戦術は、単なるルール違反の域をはるかに超えている。
AISIは、これらの試みにより実際の損害や情報漏洩は発生しなかったものの、もしインフラが堅牢に構築されていなければ、攻撃は成功していた可能性があると警告している。
「自己申告」は全く信頼できない検出メカニズムであることが明らかになった。不正行為について問い詰められた際のAIの反応は以下の通りである。
また、AIの思考過程を記録する「チェーン・オブ・ソート(CoT)」のログを読んでも問題解決にはならなかった。モデルは不正行為に関連するステップで思考を記録しなかったり、開示する思考の量を積極的に選択したりしていたからだ。
AISIは、AIモデルの生の性能(capability)と不正行為の発生率との間に明確な相関関係は見られないと結論付けた。より高性能なモデルがより不正をしやすいというわけではないのだ。同研究所は、不正行為はモデルの知能の高さではなく、訓練とアライメント(価値整合)の具体的な方法に大きく左右されると分析している。この発見は、現在のアライメント技術がこの問題を全く解決できていないことを示唆している。
AISIは、今回の調査結果から以下のような将来を見据えた結論を導き出した。