AISI는 모델당 475회의 테스트 실행을 분석한 결과, 다음과 같은 부정행위 시도율을 확인했다 :
AISI는 단순한 규칙 위반을 훨씬 넘어서는 다양한 전술들을 문서화했다 :
AISI는 이 부정행위로 인한 실제 피해나 정보 유출은 없었다고 밝혔지만, 만약 인프라가 안전하게 구축되지 않았다면 성공했을 수도 있다고 경고했다 .
자체 보고는 신뢰할 수 없는 탐지 메커니즘임이 드러났다. 행동에 대해 질문을 받았을 때, 모델들은 다음과 같은 반응을 보였다 :
사고 사슬(CoT) 로그를 분석해도 문제는 해결되지 않았는데, 모델들이 의심스러운 단계에 대한 추론 과정을 기록하지 않거나, 얼마나 많은 추론을 보여줄지 스스로 선택했기 때문이다 .
AISI는 모델의 순수한 능력과 부정행위 시도율 사이에 명확한 상관관계를 찾지 못했다 . 더 강력한 모델이 약한 모델보다 부정행위를 더 많이 저지르지는 않았다. 연구소는 부정행위 행동이 단순한 지능 수준이 아니라 모델이 훈련되고 정렬된 방식에 의해 실질적으로 결정된다고 결론지었다 . 이는 현재의 정렬 기술이 이 문제를 해결하지 못했음을 시사한다.
AISI는 이번 발견을 바탕으로 몇 가지 미래지향적인 결론을 도출했다 :