高斯探測法(Gaussian probing)透過分析LoRA適配器如何擾動模型內部神經激活狀態,在不輸出任何圖像的前提下,檢測出被微調以生產兒少性虐待素材(CSAM)的AI模型。 該技術破解了一個關鍵的法律悖論:在美國,為了測試模型而生成CSAM本身就是違法行為。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is the Gaussian probing technique developed by MIT, Boston University, and Thorn, how does i. Article summary: ## Gaussian Probing Technique. Topic tags: general, government, education, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
麻省理工學院(MIT)、波士頓大學以及兒童安全非營利組織Thorn的研究人員共同開發出一項名為高斯探測法(Gaussian probing)的革命性技術,能夠判定一個生成式AI模型是否曾遭微調以產製兒少性虐待素材(Child Sexual Abuse Material, CSAM),全程無須生成任何一張圖像。這項方法作為「值得信賴的AI造福社會」研討會的焦點論文,在國際機器學習大會(International Conference on Machine Learning)上發表,對AI安全審計領域而言,是一項重大突破,因為它所針對的內容極度有害,連測試本身都是非法的
。
高斯探測法是一種非生成式的審計方法,用於偵測一個生成式AI模型是否經由微調,被特殊化以產製CSAM。該技術專門針對低秩適應(Low-Rank Adaptation, LoRA)——一種廣受歡迎且高效的微調技術,允許使用者在不重新訓練整個模型的前提下,將基礎模型(如Stable Diffusion)專門化以執行特定任務
。惡意行為者已利用LoRA適配器,創建出能夠產製高品質CSAM的模型變體
。
該方法並不詢問適應後的模型最終渲染出什麼圖像,而是探詢該適配器如何在擴散過程原生的高斯狀態空間中,改變模型的內部反應輪廓。
該方法透過測量 LoRA 適配器如何在功能上擾動模型的內部表徵來運作。具體來說,它將一組隨機高斯潛在狀態的參考集成(reference ensemble)輸入模型的擴散過程,並觀察隱藏層激活值(hidden activations)如何變化。
其核心的數學物件是一個「探測泛函」(probe functional),它針對一組高斯噪聲輸入,計算在擴散時間步驟上的平均隱藏表徵,然後將這些數值聚合為一個能表徵該適配器效應的特徵向量。接著,一個分類器會在這些特徵向量上進行訓練,以區分有害的(CSAM專門化)與良性的適配器。
正如主要作者、MIT研究生Vinith Suriyakumar所解釋的:「過去,我們根本無從測量這個。這是一個巨大的盲點,而有些人正在利用這一點。」
在測試中,高斯探測法程序以100%的準確率識別出那些被專門化以生成CSAM的模型變體。研究人員發現,高斯探測法能可靠地區分良性與有害的特殊化,這與那些可能依賴於訓練過程偶然產物而非有意義內容信號的原始權重基準方法不同
。
該技術在現實限制條件下也被證明有效,這意味著它有可能被大規模部署在如Hugging Face或Civitai等允許使用者上傳LoRA適配器的平台上。
這項研究是MIT研究生Vinith Suriyakumar、副教授Ashia Wilson和Marzyeh Ghassemi,與包括Rebecca Portnoff博士在內的Thorn研究人員合作的成果。
標準的AI安全審計依賴一個直接的流程:向模型輸入有害提示詞,然後檢查其輸出。但對於CSAM,這個流程在法律上是不可能的。在美國,生成此類內容是違法的,無論意圖為何。
高斯探測法透過僅基於模型內部的激活值來評估其產製CSAM的能力,從而解決了這個悖論,全程無需生成任何輸出圖像。正如MIT的公告所述:「他們的技術檢視了模型在經CSAM微調後,其內部運作是如何變化的——完全不需要看到任何圖像。」
這種方法也避免了讓安全研究人員接觸創傷性素材的倫理問題,因為測試過程中不需要查看任何CSAM圖像。
這項技術的問世,正值AI生成的CSAM規模呈爆炸性增長之際。以下是來自權威來源的關鍵統計數據:
逼真的全動態AI影片內容已變得司空見慣。2025年,IWF識別出3,443部AI生成的兒童性虐待影片,其中65%被歸類為A類——根據英國法律,這是最嚴重的素材類型。
高斯探測法填補了AI安全工具箱中的一個關鍵缺口。目前針對AI生成CSAM的防禦措施主要依賴於輸入過濾、輸出過濾和訓練數據篩查。然而,正如研究所顯示的,「即使過濾是完美的,透過微調也能重新引入概念」,這意味著當前的過濾方法「為封閉權重模型提供的保護有限,而對開放權重模型則完全沒有保護」
。
透過讓平台能夠在有害的微調模型被廣泛散播前就將其檢測出來,高斯探測法可以讓Hugging Face和Civitai等平台在審查上傳的LoRA適配器時,無需訴諸於非法的內容生成行為。
目前,這項技術提供了一個可擴展、非生成式的替代方案,用於評估高風險領域中的模型安全性——在這些領域中,生成行為受到法律限制——而隨著AI生成CSAM危機的加速,這個工具正是該領域迫切需要的。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
高斯探測法(Gaussian probing)透過分析LoRA適配器如何擾動模型內部神經激活狀態,在不輸出任何圖像的前提下,檢測出被微調以生產兒少性虐待素材(CSAM)的AI模型。
高斯探測法(Gaussian probing)透過分析LoRA適配器如何擾動模型內部神經激活狀態,在不輸出任何圖像的前提下,檢測出被微調以生產兒少性虐待素材(CSAM)的AI模型。 該技術破解了一個關鍵的法律悖論:在美國,為了測試模型而生成CSAM本身就是違法行為。
它所因應的危機正急遽升溫:美國國家失蹤與受剝削兒童中心(NCMEC)在2025年接獲超過150萬件與AI相關的CSAM通報,比2024年的6.7萬件增長了約22倍。