Захист у глибину за рівнями — у блозі безпеки Microsoft (травень 2026) визначено чотири рівні пом'якшення: рівень моделі (навчальні дані, тонке налаштування, поведінка відмови), рівень системи безпеки (фільтрація контенту в реальному часі, guardrails, логування, спостережуваність), рівень додатку (дозволи, робочі процеси, шляхи ескалації) та позиційний рівень (прозорість документації та UX-розкриття) . Пізніший допис у червні додає більш деталізований чотирирівневий погляд: рівень моделі, рівень системи безпеки, рівень метапромпту та обґрунтування та агентний рівень (дозволи на використання інструментів і перевірки за участю людини) .
Списки дозволів на рівні клієнта для MCP-серверів — організації повинні вести затверджений список видавців і серверів протоколу контексту моделі (MCP). Каталог MCP від Microsoft надає перевірені сервери першої сторони, а всі зовнішні компоненти розглядаються як частина ланцюжка постачання програмного забезпечення. Рекомендується вимкнути опцію "Дозволити все" для MCP-з'єднань і ввімкнути лише конкретні інструменти, необхідні агенту .
Генерація SBOM для розгортання агентів — програмний білль матеріалів, що включає залежності від інструментів, з перевіркою підписів і походження для MCP-серверів перед встановленням. Microsoft також рекомендує сканування реєстру на приховані інструкції в описах інструментів, фіксацію версій з моніторингом змін для всіх зовнішніх визначень інструментів .
Політики на основі guardrails — окрім моніторингу, організації можуть застосовувати політики для визначення того, що дозволено робити агентам, за допомогою SDK Agent 365 та інфраструктури політик Windows . У блозі для розробників Windows зазначено: "Стримування обмежує те, до чого агенти можуть отримати доступ і що можуть зробити, тому недетермінована поведінка не перетворюється на некерований ризик" .
Управління площиною контролю — централізоване володіння, управління життєвим циклом ідентифікацій та контроль відповідності для всіх агентів в організації. Рамки впровадження Azure Cloud від Microsoft рекомендують встановити централізований і забезпечуваний базовий рівень управління та безпеки, узгоджений із наявними практиками ідентифікації, управління даними та безпеки .
Рамки націлені на повний ланцюг атак — отруєння ланцюжка постачання (через списки дозволів і SBOM), підвищення привілеїв (через ізоляцію MXC), витік даних (через guardrails реального часу та фільтрацію контенту) і неавторизоване використання інструментів (через контроль дозволів і цикли за участю людини) . Таксономія режимів збою після року тестування агентних систем додає архітектуру з нульовою довірою між агентами: для сценаріїв високого ризику ідентичність агента повинна встановлюватися криптографічно, а не припускатися на основі позиції в робочому процесі .
Дві великі ініціативи середини 2026 року ілюструють зсув галузі до використання ШІ-агентів наступально та оборонно в кібербезпеці з одночасним запровадженням суворіших обмежень.
Анонсований 27 липня 2026 року, Project Perception — це агентна система безпеки, яка виходить за межі генерації сповіщень до безперервних автоматизованих дій . Microsoft описала його як "систему захисту, що безперервно навчається", яка може "міркувати, визначати пріоритети та діяти на швидкості машини, залишаючи людей під надійним контролем" .
Чому це важливо: Це конкретний приклад надання ШІ-агентам активних автономних ролей у кіберзахисті — зондування систем, виправлення вразливостей та реагування на загрози без очікування вказівок людини. Жорсткіший контроль забезпечується вищезгаданими правилами стримування: агенти Project Perception все ще працюють у контейнерах MXC, під керівництвом політик guardrails, із спостережуваністю та наглядом людини .
Створений 27 липня 2026 року — через кілька днів після гучного інциденту з Hugging Face, який підкреслив ризики втрати контролю над автономними ШІ-агентами, — OSAA є галузевою коаліцією, яка будує відкриті інструменти безпеки для ШІ-агентів .
Чому це важливо: OSAA представляє колективне визнання галузі того, що жоден окремий постачальник не може захистити автономні агенти самостійно. Зосередженість альянсу на відкритих моделях і спільних інструментах є навмисною противагою закритим пропрієтарним підходам — розрахунок на те, що ширший доступ спільноти до інструментів безпеки випередить атакуючих . Nvidia заявив: "Відкриті моделі демократизують оборонні можливості, підвищують прозорість для захисників, уможливлюють кіберзахист із захистом даних і доповнюють передові закриті моделі налаштовуваними локалізованими засобами контролю" .
| Вимірювання | Microsoft | Галузь (OSAA / Nvidia) |
|---|---|---|
| Філософія контролю | Ізоляція на рівні ОС (MXC), політики guardrails, контроль ланцюжка постачання | Спільні інструменти з відкритим кодом, прозорі рекомендації (SAFE), захист на основі спільноти |
| Активний захист | Project Perception — автономні червоні/сині/зелені агенти, які знаходять, виправляють та усувають недоліки | Відкриті фреймворки агентів і guardrails реального часу, що забезпечують безпечну роботу агентів |
| Ризик, що вирішується | Несанкціоновані дії агентів, витік даних, отруєння ланцюжка постачання | Втрата контролю над агентом, непрозоре розкриття вразливостей, фрагментовані інструменти безпеки |
| Ключове обмеження | Агенти працюють у закритих контейнерах під політикою, визначеною людиною | Спільні базові рівні безпеки та відкриті рамки запобігають блокуванню постачальника, піднімаючи загальний рівень |
Тенденція очевидна: ті самі компанії, що надають ШІ-агентам активну автономну роль у кіберзахисті, паралельно створюють системи стримування та управління, щоб запобігти перетворенню цих агентів на нове покоління загроз.