Традиционные guardrails — часто реализованные как простые фильтры по ключевым словам или классификаторы — плохо справляются с подобными сценариями. Им не хватает операционного контекста, поэтому они могут блокировать легитимные запросы и одновременно пропускать сложные атаки вроде многошагового prompt injection. В некоторых случаях доля ложных срабатываний может быть высокой, при этом реальные атаки остаются незамеченными.
Giskard позиционирует Guards как слой безопасности между AI‑агентом и системами, с которыми он взаимодействует.
Вместо анализа только запроса или ответа система рассматривает весь контекст работы агента: входные промпты, промежуточные шаги, вызовы инструментов и итоговые результаты. Это позволяет обнаруживать опасное поведение ещё до того, как оно повлияет на реальные бизнес‑процессы.
Ключевые элементы платформы:
Контекстно‑зависимые guardrails
Система оценивает не только текст, но и намерение запроса и его связь с задачей агента, подключёнными инструментами и доступными данными. Такой подход позволяет лучше понимать, безопасно ли действие агента в конкретной ситуации.
Несколько уровней обнаружения угроз
Платформа одновременно использует несколько детекторов — например, для выявления jailbreak‑попыток, prompt injection, утечек конфиденциальных данных или нарушений корпоративных политик. В зависимости от результата система может разрешить действие, пометить его для мониторинга или полностью заблокировать.
Мониторинг цепочки выполнения
Guards отслеживает всю последовательность действий агента. Это важно, потому что атаки часто возникают не на этапе ввода или вывода, а в промежуточных шагах — например, когда агент читает документ с вредоносной инструкцией или вызывает рискованный инструмент.
Одной из ключевых идей платформы является подход policy‑as‑code — перевод корпоративных правил и требований в машинно‑исполняемые политики.
У компаний уже существуют правила: требования к конфиденциальности, комплаенс‑процедуры, внутренние политики безопасности. В модели policy‑as‑code эти правила превращаются в программные ограничения, которые система может автоматически применять во время работы AI‑агента.
Исследования в области управления AI‑агентами показывают, что такие политики могут быть преобразованы в runtime‑guardrails — механизмы контроля, которые анализируют действия системы и ограничивают их в реальном времени.
Это позволяет организациям задавать правила вроде:
Поскольку такие правила существуют в виде кода и версий, их можно обновлять по мере развития AI‑систем.
Ещё одна причина появления подобных платформ — усиление регулирования.
EU AI Act вводит риск‑ориентированную систему регулирования искусственного интеллекта. Системы, которые могут повлиять на здоровье, безопасность или фундаментальные права людей, относятся к категории «высокого риска» и должны соответствовать ряду требований: управление рисками, документация, прозрачность, ведение логов, устойчивость систем и человеческий контроль.
Платформы вроде Giskard Guards помогают компаниям приблизиться к выполнению этих требований за счёт:
Такие механизмы напрямую связаны с требованиями EU AI Act по человеческому контролю и технической надёжности высокорисковых систем.
Наиболее высокий интерес к подобным решениям наблюдается в отраслях с жёстким регулированием.
Банки и страховые компании используют AI‑агентов для анализа рисков, обнаружения мошенничества, обработки страховых заявок и поддержки клиентов. Все эти процессы связаны с конфиденциальными финансовыми данными и нормативными требованиями.
Здравоохранение — ещё более чувствительная сфера. AI‑агенты могут помогать с анализом медицинских записей, поиском информации о пациентах или подготовкой клинической документации. В таких условиях крайне важно не допустить утечки данных или автоматических решений без контроля врача.
Поэтому компании всё чаще ищут решения, которые работают на уровне инфраструктуры, а не только на уровне подсказок или инструкций модели.
Giskard также позиционирует Guards как часть более широкой европейской стратегии AI‑суверенитета.
Платформа поддерживает развёртывание внутри инфраструктуры компании или в контролируемых средах. Это позволяет организациям хранить данные, журналы активности и механизмы контроля безопасности внутри своей инфраструктуры, не передавая их внешним сервисам.
Для компаний, работающих в рамках европейских требований — таких как GDPR и EU AI Act — вопрос расположения инфраструктуры безопасности может стать решающим при внедрении AI‑систем.
Появление AI‑агентов меняет саму логику защиты систем искусственного интеллекта. Проверки только входных запросов и итогового текста больше недостаточно для систем, которые планируют задачи, используют инструменты и работают с корпоративными данными.
Подход Giskard отражает более широкую тенденцию в отрасли: безопасность должна контролировать поведение AI‑агентов на протяжении всего рабочего процесса, а не только фильтровать контент.
Насколько такие системы смогут эффективно предотвращать сложные сбои в крупных корпоративных внедрениях, пока остаётся открытым вопросом. Но идея контекстно‑зависимых guardrails и политики‑как‑кода постепенно становится важным элементом инфраструктуры для безопасного использования AI в бизнесе.