계층별 심층 방어(Defense-in-depth by layer) — 2026년 5월 마이크로소프트의 보안 블로그는 네 가지 완화 계층을 정의했다: 모델 계층(훈련 데이터, 파인튜닝, 거부 행동), 세이프티 시스템 계층(런타임 콘텐츠 필터링, 가드레일, 로깅, 관측 가능성), 애플리케이션 계층(권한, 워크플로, 에스컬레이션 경로), 포지셔닝 계층(투명성 문서와 UX 공개) . 6월에는 더 세분화된 네 가지 계층(모델 계층, 세이프티 시스템 계층, 메타프롬프트 및 접지 계층, 에이전틱 계층)이 추가되었다 .
테넌트 수준 MCP 서버 허용 목록 — 조직은 MCP(Model Context Protocol) 게시자와 서버의 승인된 목록을 유지해야 한다. 마이크로소프트 MCP 카탈로그는 검증된 퍼스트파티 서버를 제공하며, 모든 외부 구성 요소는 소프트웨어 공급망의 일부로 취급된다. '모두 허용'은 비활성화하고, 에이전트가 실제로 필요한 특정 도구만 활성화하는 것이 권장된다 .
에이전트 배포용 SBOM 생성 — 도구 의존성을 포함한 소프트웨어 자재 명세서(SBOM)를 생성하고, MCP 서버 설치 전 서명 및 출처 검증을 수행한다. 마이크로소프트는 또한 도구 설명에 숨겨진 명령어를 감지하기 위한 레지스트리 스캔, 모든 외부 도구 정의에 대한 버전 고정 및 변경 모니터링을 권장한다 .
정책 기반 가드레일 — 단순 모니터링을 넘어, 조직은 에이전트가 무엇을 할 수 있는지 설정하는 정책 기반 통제를 적용할 수 있다. 이는 Agent 365 SDK와 윈도우 정책 인프라를 통해 시행된다 . 마이크로소프트의 윈도우 개발자 블로그는 다음과 같이 명시한다: "격리는 에이전트가 접근하고 행동할 수 있는 범위를 제한하므로, 비결정적 행동이 통제 불가능한 위험으로 이어지지 않는다" .
컨트롤 플레인 거버넌스 — 조직 내 모든 에이전트에 대한 중앙 집중식 소유권, 아이덴티티 라이프사이클 관리, 규정 준수 강제를 포함한다. 마이크로소프트의 Azure Cloud Adoption Framework는 기존 ID, 데이터 거버넌스 및 보안 관행과 일치하는 중앙 집중식이고 강제 가능한 거버넌스 및 보안 기준을 설정할 것을 권장한다 .
이 프레임워크는 전체 공격 체인을 대상으로 한다: 공급망 중독(허용 목록 및 SBOM을 통해), 권한 상승(MXC 격리를 통해), 데이터 유출(런타임 가드레일 및 콘텐츠 필터링을 통해), 승인되지 않은 도구 사용(권한 통제 및 인간 개입 루프를 통해) . 마이크로소프트는 1년간의 에이전틱 시스템 레드팀 테스트 후 실패 모드 분류를 업데이트하며 제로 트러스트 상호 에이전트 아키텍처를 추가했다: 고위험 시나리오에서는 에이전트 아이덴티티가 암호학적으로 설정되어야 하며, 워크플로에서의 위치로 가정되어서는 안 된다 .
2026년 중반의 두 주요 이니셔티브는 업계가 AI 에이전트를 사이버 보안에서 공격적이고 방어적으로 사용하면서 동시에 더 엄격한 가드레일을 부과하는 쪽으로 전환하고 있음을 보여준다.
2026년 7월 27일 발표된 프로젝트 퍼셉션은 단순한 알림 생성에서 벗어나 지속적인 자동 조치를 수행하는 에이전틱 보안 시스템이다 . 마이크로소프트는 이를 "지속적으로 학습하는 방어 시스템"으로, "인간을 확고히 통제권에 두면서 머신 속도로 추론하고, 우선순위를 정하고, 행동할 수 있는" 시스템이라고 설명했다 .
왜 중요한가: 이는 AI 에이전트가 사이버 방어에서 능동적이고 자율적인 역할(시스템 탐색, 취약점 패치, 인간 지시 없이 위협 대응)을 부여받은 구체적인 사례다. 더 엄격한 통제는 위의 격리 규칙에서 비롯된다: 프로젝트 퍼셉션 에이전트는 여전히 MXC 컨테이너 내에서, 정책 기반 가드레일 아래, 관측 가능성과 인간 감독 하에 작동한다 .
2026년 7월 27일 — 자율 AI 에이전트 통제 상실의 위험을 부각시킨 허깅페이스 사건 며칠 후 — 결성된 OSAA는 AI 에이전트를 위한 오픈소스 보안 도구를 구축하는 업계 연합이다 .
왜 중요한가: OSAA는 단일 벤더만으로는 자율 에이전트를 보호할 수 없다는 업계의 집단적 인식을 나타낸다. 연합이 오픈 모델과 공유 도구에 초점을 맞춘 것은 폐쇄적이고 독점적인 접근 방식에 대한 의도적인 대항점이다. 더 넓은 커뮤니티의 보안 도구 접근이 공격자를 앞지를 것이라는 베팅이다 . 엔비디아는 "오픈 모델은 방어 능력을 민주화하고, 방어자의 투명성을 높이며, 데이터를 보호하면서 사이버 방어를 가능하게 하고, 맞춤형 로컬 제어 기능으로 최첨단 폐쇄 모델을 보완한다"고 밝혔다 .
| 차원 | 마이크로소프트 | 업계(OSAA/엔비디아) |
|---|---|---|
| 통제 철학 | OS 수준 격리(MXC), 정책 가드레일, 공급망 통제 | 오픈소스 공유 도구, 투명한 지침(SAFE), 커뮤니티 주도 방어 |
| 능동적 방어 | 프로젝트 퍼셉션 — 찾고, 수정하고, 강화하는 자율 레드/블루/그린 에이전트 | 안전한 에이전트 작동을 가능하게 하는 오픈 에이전트 하네스 및 런타임 가드레일 |
| 해결하는 위험 | 승인되지 않은 에이전트 행동, 데이터 유출, 공급망 중독 | 에이전트 통제 상실, 불투명한 취약점 공개, 파편화된 보안 도구 |
| 핵심 제약 | 에이전트는 인간이 정의한 정책 하에 잠긴 컨테이너에서 실행 | 공유 보안 기준 및 개방형 프레임워크가 벤더 종속을 방지하면서 최소 기준을 높임 |
패턴은 분명하다: AI 에이전트를 능동적이고 자율적인 사이버 방어 역할로 밀어넣는 바로 그 기업들이, 그 에이전트가 차세대 보안 위협이 되는 것을 막기 위한 격리 및 거버넌스 구조를 구축하기 위해 경쟁하고 있다.