Gaussian Probing — это негенеративный метод аудита, который выявляет, была ли генеративная модель ИИ специализирована посредством дообучения для создания CSAM . Техника фокусируется конкретно на Low-Rank Adaptation (LoRA) — популярном и эффективном методе дообучения, который позволяет пользователям специализировать базовую модель, такую как Stable Diffusion, для конкретной задачи без переобучения всей модели
. Злоумышленники используют LoRA-адаптеры для создания вариантов моделей, способных генерировать высококачественный CSAM
.
Вместо того чтобы спрашивать, какое изображение создает адаптированная модель, Gaussian Probing исследует, как адаптер изменяет внутренний профиль реакции модели на собственном гауссовском пространстве состояний диффузионного процесса .
Метод работает путем измерения того, как LoRA-адаптер функционально возмущает внутренние представления модели. В частности, он подает эталонный ансамбль случайных гауссовских скрытых состояний через диффузионный процесс модели и наблюдает, как изменяются скрытые активации .
Ключевым математическим объектом является «зондирующий функционал» (probe functional), который вычисляет среднее скрытое представление по временным шагам диффузии для набора гауссовских шумовых входов, а затем агрегирует их в вектор признаков, характеризующий эффект адаптера . Затем на этих векторах признаков обучается классификатор для различения вредоносных (специализированных под CSAM) и безвредных адаптеров.
Как объяснил ведущий автор Винит Суриякумар (Vinith Suriyakumar), аспирант MIT: «Раньше у нас не было возможности это измерить. Это было огромное слепое пятно, которым некоторые пользовались» .
В ходе тестирования процедура Gaussian Probing идентифицировала варианты моделей, которые были специализированы для генерации CSAM, с точностью 100 процентов . Исследователи обнаружили, что Gaussian Probing надежно отличает вредоносную специализацию от безвредной, в отличие от базовых методов на основе «сырых» весов, которые могут полагаться на случайные артефакты обучения, а не на значимый сигнал контента
.
Техника также доказала свою эффективность в реалистичных условиях, что позволяет предположить ее масштабное применение на платформах вроде Hugging Face или Civitai, где пользователи загружают LoRA-адаптеры .
Исследование было совместной работой аспиранта MIT Винита Суриякумара и доцентов Аши Уилсон (Ashia Wilson) и Марзие Гасеми (Marzyeh Ghassemi) вместе с исследователями из Thorn, включая доктора Ребекку Портнофф (Rebecca Portnoff) .
Стандартный аудит безопасности ИИ опирается на простой процесс: подать на модель вредоносные запросы и проверить результаты. В случае с CSAM это юридически невозможно. В Соединенных Штатах незаконно генерировать такой контент, независимо от намерений .
Gaussian Probing решает этот парадокс, оценивая способность модели производить CSAM на основе исключительно внутренних активаций, без генерации выходного изображения. Как отмечается в объявлении MIT: «Их техника изучает, как меняются внутренние механизмы модели, когда она дообучается на CSAM, — без необходимости видеть какие-либо изображения» .
Этот метод также устраняет этическую проблему воздействия травмирующего материала на исследователей безопасности, поскольку для тестирования не требуется просматривать изображения CSAM .
Техника появляется в тот момент, когда масштаб CSAM, созданного ИИ, взрывообразно растет. Ключевые статистические данные из авторитетных источников включают:
Реалистичные полноценные видео с ИИ стали обычным явлением. В 2025 году IWF идентифицировал 3 443 созданных ИИ видео с сексуальным насилием над детьми, причем 65% из них были отнесены к Категории A — наиболее серьезным материалам согласно законодательству Великобритании .
Gaussian Probing заполняет критический пробел в инструментарии безопасности ИИ. Текущие меры защиты от CSAM, созданного ИИ, в основном полагаются на фильтрацию входных данных, фильтрацию выходных данных и проверку обучающих данных . Но, как показывают исследования, «повторное введение концепции возможно посредством дообучения, даже если фильтрация идеальна», что означает, что текущие методы фильтрации обеспечивают «ограниченную защиту для моделей с закрытым весом и нулевую защиту для моделей с открытым весом»
.
Позволяя платформам обнаруживать вредоносные дообученные модели до их широкого распространения, Gaussian Probing может позволить таким платформам, как Hugging Face и Civitai, проверять загружаемые LoRA-адаптеры, не прибегая к незаконной генерации контента .
На данный момент техника обеспечивает масштабируемую, негенеративную альтернативу для оценки безопасности моделей в областях высокого риска, где генерация юридически ограничена, — инструмент, в котором эта сфера остро нуждалась по мере ускорения кризиса CSAM, созданного ИИ.