Gaussian probing透過分析LoRA adaptor點樣改變模型內部神經網絡嘅激活模式,唔使生成任何輸出圖像,就可以檢測到被專用嚟生成CSAM嘅AI模型。 呢項技術解決咗一個關鍵法律矛盾:在美國,為咗測試模型而生成CSAM本身就係違法嘅。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is the Gaussian probing technique developed by MIT, Boston University, and Thorn, how does i. Article summary: ## Gaussian Probing Technique. Topic tags: general, government, education, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
MIT、Boston University(波士頓大學)同兒童安全非牟利組織Thorn嘅研究人員開發咗一種名為 Gaussian probing 嘅技術,可以判斷一個生成式AI模型係咪俾人finetune到可以生成兒童性虐待素材(CSAM),而且成個過程完全唔使生成任何一張圖 。呢個方法喺國際機器學習會議(ICML)嘅「Trustworthy AI for Good」工作坊上作為焦點論文發表,代表咗AI安全審計領域嘅一個重大突破,因為測試嘅內容本身係非法嘅,連測試都做唔到
。
Gaussian probing係一種非生成式嘅審計方法,專門用嚟檢測生成式AI模型有冇俾人透過finetune去專門生成CSAM 。呢項技術特別針對 LoRA(Low-Rank Adaptation),一種流行又高效嘅finetune方法。用家可以用LoRA將一個基礎模型(例如Stable Diffusion)專門化做某個特定任務,而唔使成個模型重新train過
。唔法分子就係利用LoRA adaptor整出可以生成高質素CSAM嘅模型變種
。
Gaussian probing嘅做法唔係問個模型會output啲乜嘢圖像,而係問呢個adaptor點樣改變咗模型喺擴散過程(diffusion process)本身嘅高斯狀態空間(Gaussian state space)上嘅內部反應模式 。
呢個方法係透過量度一個LoRA adaptor 點樣功能上干擾模型嘅內部表徵。具體嚟講,研究人員會將一組參考用嘅隨機高斯潛在狀態(random Gaussian latent states)輸入模型嘅擴散過程,然後觀察隱藏層嘅激活值(hidden activations)點樣改變 。
核心嘅數學工具係一個「探測函數」(probe functional),佢會計算一組高斯噪聲輸入喺唔同擴散時間步(diffusion timesteps)嘅平均隱藏表徵,然後將呢啲數據結合成一個特徵向量嚟描述個adaptor嘅效果 。之後,研究人員會用呢啲特徵向量train一個分類器,用嚟區分有害(專門生成CSAM)同良性嘅adaptor。
正如主要作者、MIT研究生Vinith Suriyakumar所講:「以前,我哋根本冇辦法量度呢樣嘢。呢個係一個好大嘅盲點,俾啲人利用咗。」
喺測試入面,Gaussian probing程序成功識別出所有被專門用嚟生成CSAM嘅模型變種,準確率高達100% 。研究人員發現,Gaussian probing可以可靠咁區分良性同有害嘅專門化,相比起單純睇權重嘅基準方法(raw-weight baseline),後者可能會依賴訓練嘅偶然痕跡而唔係有意義嘅內容訊號
。
呢項技術仲俾證實喺現實嘅限制條件下同樣有效,意味住佢可以大規模部署喺好似Hugging Face或者Civitai呢啲用戶上傳LoRA adaptor嘅平台 。
呢項研究係由MIT研究生Vinith Suriyakumar、副教授Ashia Wilson同Marzyeh Ghassemi,聯同Thorn嘅研究人員(包括Dr. Rebecca Portnoff)一齊合作完成 。
標準嘅AI安全審計方法好直接:用有害嘅輸入去prompt個模型,然後檢查輸出。但對CSAM嚟講,呢個做法在法律上行唔通。喺美國,生成呢類內容係犯法嘅,無論你嘅動機係乜 。
Gaussian probing解決咗呢個矛盾——佢純粹根據模型嘅內部激活值嚟評估模型 有冇能力 生成CSAM,完全唔使生成任何輸出圖像。正如MIT嘅公告所講:「佢哋嘅技術係透過檢查模型喺用CSAM進行finetune之後,內部運作點樣改變,而完全唔需要睇任何圖像。」
呢個方法仲避免咗安全研究人員接觸到創傷性素材嘅道德問題,因為測試過程中完全唔需要睇任何CSAM圖像 。
呢項技術喺AI生成CSAM問題大爆發嘅時候出現。來自權威機構嘅主要統計數據包括:
逼真嘅全動態AI影片內容而家已經好常見。2025年,IWF識別出3,443條AI生成嘅兒童性虐待影片,其中65%被歸類為A類——即係英國法律定義下最嚴重嘅材料 。
Gaussian probing填補咗AI安全工具箱入面一個關鍵嘅缺口。目前針對AI生成CSAM嘅防禦主要依賴輸入過濾、輸出過濾同訓練數據篩查 。但研究顯示,「就算過濾做得完美,透過finetune仍然可以重新引入某個概念」,即係話現行嘅過濾方法對「封閉權重模型」嘅保護有限,對「開放權重模型」更加係完全冇保護
。
透過令平台可以喺有害嘅finetune模型廣泛散佈之前就檢測到佢哋,Gaussian probing可以令Hugging Face同Civitai呢類平台喺篩查上傳嘅LoRA adaptor時,唔使做犯法嘅內容生成 。
目前嚟講,呢項技術提供咗一個可擴展、非生成式嘅替代方案,用喺嗰啲因為法律限制而唔可以生成內容嘅高風險領域——呢個正正係AI生成CSAM危機日益加劇之下,業界一直急需嘅工具。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Gaussian probing透過分析LoRA adaptor點樣改變模型內部神經網絡嘅激活模式,唔使生成任何輸出圖像,就可以檢測到被專用嚟生成CSAM嘅AI模型。
Gaussian probing透過分析LoRA adaptor點樣改變模型內部神經網絡嘅激活模式,唔使生成任何輸出圖像,就可以檢測到被專用嚟生成CSAM嘅AI模型。 呢項技術解決咗一個關鍵法律矛盾:在美國,為咗測試模型而生成CSAM本身就係違法嘅。
呢個危機正在急速惡化:NCMEC喺2025年收到超過150萬宗同AI相關嘅CSAM報告,比起2024年嘅6.7萬宗,增加咗22倍。