Defesa em profundidade por camada — O blog de segurança da Microsoft (maio de 2026) define quatro camadas de mitigação: a camada do modelo (dados de treinamento, fine-tuning, comportamentos de recusa), a camada do sistema de segurança (filtragem de conteúdo em tempo de execução, guardrails, registro em log, observabilidade), a camada de aplicação (permissões, fluxos de trabalho, caminhos de escalonamento) e a camada de posicionamento (documentação de transparência e divulgações de UX) . Uma postagem de blog posterior, em junho, adiciona uma visão mais granular de quatro camadas: a camada do modelo, a camada do sistema de segurança, a camada de metaprompt e fundamentação e a camada agentiva (permissões de uso de ferramentas e verificações human-in-the-loop)
.
Listas de permissão em nível de locatário para servidores MCP — As organizações devem manter uma lista aprovada de publicadores e servidores do Model Context Protocol (MCP). O catálogo MCP da Microsoft fornece servidores de primeira parte verificados, e todos os componentes externos são tratados como parte da cadeia de suprimentos de software. A recomendação é desabilitar "Permitir tudo" nas conexões MCP e habilitar apenas as ferramentas específicas que um agente precisa .
Geração de SBOM para implantações de agentes — Software Bill of Materials (SBOM) incluindo dependências de ferramentas, com verificação de assinatura e proveniência para servidores MCP antes da instalação. A Microsoft também recomenda a verificação de registro em busca de instruções ocultas em descrições de ferramentas, fixação de versão com monitoramento de alterações para todas as definições de ferramentas externas .
Guardrails baseados em políticas — Além do monitoramento, as organizações podem aplicar controles baseados em políticas para definir o que os agentes podem fazer, aplicados por meio do SDK Agent 365 e da infraestrutura de políticas do Windows . O Blog do Desenvolvedor do Windows da Microsoft afirma: "A contenção limita o que os agentes podem acessar e fazer, para que o comportamento não determinístico não se traduza em risco incontrolável"
.
Governança do plano de controle — Propriedade centralizada, gerenciamento do ciclo de vida da identidade e aplicação de conformidade em todos os agentes de uma organização. O Azure Cloud Adoption Framework da Microsoft recomenda estabelecer uma linha de base de governança e segurança centralizada e aplicável, alinhada com as práticas existentes de identidade, governança de dados e segurança .
O framework visa toda a cadeia de ataque — envenenamento da cadeia de suprimentos (via listas de permissão e SBOMs), escalonamento de privilégios (via isolamento MXC), exfiltração de dados (via guardrails de runtime e filtragem de conteúdo) e uso não autorizado de ferramentas (via controles de permissão e loops humano-no-circuito) . A taxonomia da Microsoft dos modos de falha após um ano de red teaming de sistemas agentivos adiciona uma arquitetura de confiança zero entre agentes: para cenários de alto risco, a identidade do agente deve ser estabelecida criptograficamente, não assumida a partir da posição em um fluxo de trabalho
.
Duas grandes iniciativas em meados de 2026 ilustram a mudança da indústria em direção ao uso de agentes de IA ofensiva e defensivamente na cibersegurança, enquanto simultaneamente impõem salvaguardas mais rigorosas.
Anunciado em 27 de julho de 2026, o Project Perception é um sistema de segurança agentivo que vai além da geração de alertas para a ação automatizada contínua . A Microsoft o descreveu como um "sistema de defesa de aprendizado contínuo" que pode "raciocinar, priorizar e agir em velocidade de máquina, mantendo os humanos firmemente no controle"
.
Por que isso é importante: Este é um exemplo concreto de agentes de IA recebendo papéis ativos e autônomos na defesa cibernética — sondando sistemas, corrigindo vulnerabilidades e respondendo a ameaças sem esperar por direção humana. O controle mais rígido vem das regras de contenção acima: os agentes do Project Perception ainda operam dentro de contêineres MXC, sob guardrails baseados em políticas, com observabilidade e supervisão humana .
Formada em 27 de julho de 2026 — dias após um incidente de alto perfil no Hugging Face destacar os riscos de perder o controle de agentes de IA autônomos — a OSAA é uma coalizão da indústria que está construindo ferramentas de segurança de código aberto para agentes de IA .
Por que isso é importante: A OSAA representa um reconhecimento coletivo da indústria de que nenhum fornecedor sozinho pode proteger agentes autônomos. O foco da aliança em modelos abertos e ferramentas compartilhadas é um contraponto deliberado às abordagens proprietárias fechadas — a aposta é que o acesso mais amplo da comunidade a ferramentas de segurança superará os atacantes . A Nvidia declarou: "Modelos abertos democratizam as capacidades defensivas, aumentam a transparência para os defensores, permitem a defesa cibernética enquanto protegem dados e complementam os modelos fechados de fronteira com controles customizáveis e localizados"
.
| Dimensão | Microsoft | Indústria (OSAA / Nvidia) |
|---|---|---|
| Filosofia de controle | Contenção em nível de SO (MXC), guardrails de política, controles de cadeia de suprimentos | Ferramentas compartilhadas de código aberto, diretrizes transparentes (SAFE), defesa liderada pela comunidade |
| Defesa ativa | Project Perception — agentes vermelhos/azuis/verdes autônomos que encontram, corrigem e remediam | Harnesses de agentes abertos e guardrails de runtime que permitem operações agentivas seguras |
| Risco abordado | Ações não autorizadas de agentes, exfiltração de dados, envenenamento da cadeia de suprimentos | Perda de controle do agente, divulgação opaca de vulnerabilidades, ferramentas de segurança fragmentadas |
| Restrição principal | Agentes executados em contêineres bloqueados sob política definida por humanos | Linhas de base de segurança compartilhadas e frameworks abertos evitam o vendor lock-in enquanto elevam o nível mínimo |
O padrão é claro: as mesmas empresas que estão impulsionando os agentes de IA para papéis ativos e autônomos na defesa cibernética também estão correndo para construir as estruturas de contenção e governança que impedem que esses agentes se tornem a próxima geração de ameaças à segurança.