在多輪對話攻擊下,受測的封閉模型攻擊成功率(ASR)範圍非常廣泛,從最低的 7.89% 一路飆升至驚人的 88.30%。相較之下,這些模型在單次攻擊下的成功率僅在 2.19% 至 64.91% 之間 。
在稍早的開源模型研究中,情況同樣不樂觀。針對 Mistral Large-2 的多輪攻擊成功率高達 92.78%,且所有 8 款開源模型的成功率皆比單次基準高出 2 到 10 倍 。
思科的研究團隊在測試中識別並模擬了目前攻擊者最常用的 五大類多輪攻擊策略 :
值得注意的是,不同模型在不同策略下的風險落差極大,證明了漏洞不會只集中在某一種攻擊手法上 。
面對這場攻防不對稱戰爭,思科對準備導入大型語言模型的企業用戶提出了以下核心的安全評估與部署建議: