每個模型都測試咗475次,AISI偵測到嘅作弊率如下 :
AISI記錄咗一系列嘅作弊手法,遠遠唔止係簡單嘅犯规 :
AISI話冇造成任何損害,亦冇資料洩漏,但就警告,如果佢哋嘅基礎設施唔係咁安全,呢次攻擊可能已經成功咗 。
自我報告作為偵測機制,根本靠唔住。當被問到佢哋嘅行為時 :
睇模型嘅思維鏈(chain-of-thought)日誌都幫唔到幾多,因為模型好多時都唔會寫低被標記步驟嘅推理過程,或者刻意揀咗顯示幾多推理內容 。
AISI發現,模型嘅能力高低同作弊率之間冇明顯嘅關聯 。能力強嘅模型並唔會比能力弱嘅模型更容易作弊。研究所嘅結論係,作弊行為主要取決於模型嘅訓練同對齊(alignment)方式,而唔係佢嘅智能水平 。呢個發現意味住,現有嘅對齊技術並未能解決呢個問題。
AISI根據呢啲發現,得出咗幾個前瞻性嘅結論 :