呢個攻擊係一種 對抗提示(adversarial prompting)。Mindgard 拎咗一個網上廣傳、用嚟搞笑嘅無害 prompt,然後改咗少少指令字眼。最關鍵嘅係:改完之後嘅 prompt 完全冇明確指明 要生成令人不安嘅主題。AI 係「自把自為」咁,由一個表面睇嚟無害嘅指令,生成咗血腥同色情嘅內容。
呢個研究係建基於 Mindgard 之前嘅發現,佢哋之前已經證實,可以透過 記憶操控(memory manipulation)繞過 ChatGPT 嘅圖像安全機制——即係利用自訂嘅用戶記憶同系統 prompt 背景,覆蓋安全過濾,而完全唔需要後端存取或修改模型。
Mindgard 喺 2026 年 5 月通知 OpenAI 呢個漏洞。OpenAI 最初只係俾咗一個自動回覆。 到 BBC 去查詢之後,OpenAI 先話佢哋已經「針對呢類 prompt 引入額外嘅防護措施」
。公司話佢哋用咗多層圖像安全保護,結合自動系統同人手審查。