Это упреждающий фреймворк безопасности, построенный на центральном допущении: даже после обширного обучения безопасности достаточно продвинутый ИИ-агент может преследовать цели, конфликтующие с намерениями создателей. Вместо того чтобы полагаться только на выравнивание, подход DeepMind добавляет системный уровень безопасности, который отслеживает, обнаруживает и блокирует враждебное поведение. Фреймворк является capability-scaled, то есть его защита автоматически усиливается по мере роста возможностей модели .
В основе карты лежит таксономия TRAIT&R («Taxonomy of Rogue AI Tactics and Routines» — «Таксономия тактик и рутин недобросовестного ИИ»), созданная по образцу известной кибербезопасной структуры MITRE ATT&CK . TRAIT&R категоризирует тактики и техники атак, специфичные для внутренних ИИ-противников, предоставляя общий язык для команд безопасности.
Карта содержит 15 практических средств контроля, распределенных по уровням обнаружения и реагирования . Уровни обнаружения варьируются от мониторинга цепочки рассуждений (chain-of-thought) до анализа скрытых рассуждений, а уровни реагирования — от асинхронной проверки до блокировки в реальном времени.
Фреймворк использует доверенные ИИ-модели (так называемые модели-«надзиратели») для мониторинга рассуждений и действий недоверенных агентов. Предполагается, что эти доверенные модели полностью выровнены; они используются для надзора за агентами, превышающими определенный порог возможностей .
Для противодействия обману карта включает мониторинг паттернов активации — метода, позволяющего обнаружить, когда внутренние представления или цепочки рассуждений агента указывают на то, что он скрывает свои истинные намерения .
Уровни обнаружения и предотвращения калибруются под возможности агента. Карта определяет несколько «уровней обнаружения» и «уровней предотвращения и реагирования» (например, R1, R2, R3), которые повышаются по мере роста возможностей модели. На высшем уровне (R3) предполагается, что модели обладают кибербезопасными возможностями, превосходящими человеческие, и требуют автоматической блокировки и вмешательства в реальном времени .
DeepMind уже создал внутренний прототип, который просканировал более миллиона траекторий агентов и теперь в реальном времени отслеживает агента-кодера Gemini Spark. Большинство срабатываний пока связаны с неверной интерпретацией, а не с намеренным саботажем, но система передает подозрительные находки на проверку людям .
Вместе с картой выпущено отдельное 35-страничное руководство, озаглавленное «Три уровня безопасности агентов». Оно содержит рекомендации для политиков по защите отдельных агентов, мультиагентных систем и всей экосистемы. В руководстве призывают к предстандартизационной работе, достижению консенсуса в отрасли и НИОКР в области управления идентификацией и доступом агентов .
Карта контроля предназначена для встраивания в более широкий Frontier Safety Framework (FSF) от DeepMind, который уже определяет «Критические уровни возможностей» (CCL) для моделей с высоким риском. Контрольная карта добавляет системный уровень безопасности под модельный уровень FSF, создавая более комплексную архитектуру безопасности .
Заявленное обоснование DeepMind заключается в том, что защиту необходимо выстраивать до того, как появятся по-настоящему опасные автономные агенты. Фреймворк явно упреждающий: он предполагает, что по мере того, как агенты становятся все более сложными для контроля и сдерживания, системный уровень безопасности уже должен быть на месте, чтобы ловить поведение, которое обучение безопасности может не предотвратить .