Försvar på djupet per lager – Microsofts säkerhetsblogg (maj 2026) definierar fyra begränsningslager: modellagret (träningsdata, finjustering, vägrarbeteenden), säkerhetssystemlagret (runtime-innehållsfiltrering, skyddsräcken, loggning, observerbarhet), applikationslagret (behörigheter, arbetsflöden, eskalationsvägar) och positioneringslagret (transparensdokumentation och UX-upplysningar) . Ett senare blogginlägg i juni lägger till en mer granulär fyralagersvy: modellagret, säkerhetssystemlagret, metaprompt- och grundlager samt agentlagret (verktygsbehörigheter och mänskliga kontrollsteg) .
Tillåtelselistor på klientnivå för MCP-servrar – Organisationer måste underhålla en godkänd lista över utgivare och servrar för Model Context Protocol (MCP). Microsofts MCP-katalog tillhandahåller granskade första-parts-servrar, och alla externa komponenter behandlas som en del av programvaruleveranskedjan. Rekommendationen är att inaktivera "Tillåt alla" på MCP-anslutningar och endast aktivera de specifika verktyg en agent behöver .
SBOM-generering för agentdistributioner – Programvaruförteckning (Software Bill of Materials) inklusive verktygsberoenden, med signatur- och härkomstverifiering för MCP-servrar innan installation. Microsoft rekommenderar också registersökning efter dolda instruktioner i verktygsbeskrivningar, versionslåsning med ändringsövervakning för alla externa verktygsdefinitioner .
Policybaserade skyddsräcken – Utöver övervakning kan organisationer tillämpa policybaserade kontroller för att ange vad agenter får göra, genomdrivna via Agent 365 SDK och Windows policyinfrastruktur . Microsofts Windows Developer Blog säger: "Inneslutning begränsar vad agenter kan komma åt och göra, så att icke-deterministiskt beteende inte översätts till okontrollerbar risk" .
Styrplansstyrning – Centraliserat ägarskap, identitetslivscykelhantering och regelefterlevnad för alla agenter i en organisation. Microsofts Azure Cloud Adoption Framework rekommenderar att man etablerar en centraliserad och verkställbar styrnings- och säkerhetsbaslinje i linje med befintliga identitets-, data- och säkerhetsrutiner .
Ramverket riktar in sig på hela attackkedjan – leveranskedjeförgiftning (via tillåtelselistor och SBOM:er), privilegieeskalering (via MXC-isolering), dataexfiltrering (via runtime-skyddsräckor och innehållsfiltrering) och obehörig verktygsanvändning (via behörighetskontroller och mänskliga kontrollsteg) . Microsofts taxonomi över feltillstånd efter ett års red teaming av agentsystem lägger till zero-trust-arkitektur mellan agenter: för högriskscenarier bör agentidentitet etableras kryptografiskt, inte antas från position i ett arbetsflöde .
Två stora initiativ under mitten av 2026 illustrerar branschens pivot mot att använda AI-agenter både offensivt och defensivt inom cybersäkerhet, samtidigt som man inför strängare skyddsräcken.
Project Perception, tillkännagivet den 27 juli 2026, är ett agentbaserat säkerhetssystem som går bortom att generera larm till kontinuerlig automatiserad handling . Microsoft beskrev det som ett "kontinuerligt lärande försvarssystem" som kan "resonera, prioritera och agera i maskinhastighet samtidigt som människor har full kontroll" .
Varför det är viktigt: Detta är ett konkret exempel på AI-agenter som får aktiva, autonoma roller i cyberförsvar – de söker igenom system, åtgärdar sårbarheter och svarar på hot utan att vänta på mänsklig vägledning. Den strängare kontrollen kommer från reglerna ovan: Project Perception-agenter verkar fortfarande inom MXC-containrar, under policybaserade skyddsräcken, med observerbarhet och mänsklig tillsyn .
OSAA bildades den 27 juli 2026 – bara dagar efter en uppmärksammad incident på Hugging Face som belyste riskerna med att förlora kontrollen över autonoma AI-agenter – som en branschkoalition för att bygga säkerhetsverktyg med öppen källkod för AI-agenter .
Varför det är viktigt: OSAA representerar ett kollektivt branscherkännande av att ingen enskild leverantör kan säkra autonoma agenter ensam. Alliansens fokus på öppna modeller och delad verktyg är ett medvetet motdrag mot stängda, proprietära metoder – tanken är att bredare gemenskapstillgång till säkerhetsverktyg kommer att övertrumfa angriparna . Nvidia sa: "Öppna modeller demokratiserar defensiva förmågor, ökar transparensen för försvarare, möjliggör cyberförsvar samtidigt som data skyddas och kompletterar frontlinjens stängda modeller med anpassningsbara, lokaliserade kontroller" .
| Dimension | Microsoft | Branschen (OSAA / Nvidia) |
|---|---|---|
| Kontrollfilosofi | Operativsystemsnivåinneslutning (MXC), policy-skyddsräcken, leveranskedjekontroller | Öppen källkodsdelad verktygslåda, transparenta riktlinjer (SAFE), gemenskapslett försvar |
| Aktivt försvar | Project Perception – autonoma röda/blå/gröna agenter som hittar, åtgärdar och stärker | Öppna agentramverk och runtime-skyddsräcken som möjliggör säkra agentiska operationer |
| Risk som hanteras | Obehöriga agenthandlingar, dataexfiltrering, leveranskedjeförgiftning | Förlust av agentkontroll, otransparent sårbarhetsrapportering, fragmenterad säkerhetsverktygslåda |
| Nyckelbegränsning | Agenter körs i låsta containrar under mänskligt definierad policy | Delade säkerhetsbaslinjer och öppna ramverk förhindrar inlåsning till leverantör samtidigt som golvet höjs |
Mönstret är tydligt: samma företag som driver AI-agenter in i aktiva, autonoma cyberförsvarsroller tävlar också om att bygga de inneslutnings- och styrningsstrukturer som hindrar dessa agenter från att bli nästa generations säkerhetshot.