ASSERT превращает простые описания желаемого поведения на естественном языке в исполняемые тестовые сценарии, автоматически находя нарушения политик безопасности. Инструмент генерирует провокационные тесты, записывает каждый шаг агента и выставляет четкие оценки «зачет/незачет», работая с LangChain, CrewAI, AutoGen...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Пока все обсуждают, как сделать ИИ-агентов умнее, Microsoft решает куда более приземленную, но критически важную задачу: как заставить их неукоснительно соблюдать внутренние правила компании. 2 июня 2026 года на конференции Build компания представила ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) и выложила исходный код на GitHub под флагом «Ответственного ИИ» . Этот фреймворк призван устранить растущую головную боль разработки: как проверить, что автономный агент не натворит дел, например, не оформит возврат на $500 без одобрения или не перешлет закрытые данные не тому сотруднику
.
В основе ASSERT лежит простой пятишаговый конвейер, который берет написанное разработчиком намерение и выдает на выходе измеримый и понятный результат:
Главная «фишка» ASSERT — фокус на специфичных для бизнеса правилах, которые зачастую упускают универсальные оценки. «Агент может блестяще проходить тесты на вежливость и правдивость, но при этом спокойно сливать email-адреса клиентов во внешние сервисы, — поясняют в Microsoft. — ASSERT создан именно для отлова подобных фатальных ошибок» .
В компании подчеркивают, что методология оценки, лежащая в основе фреймворка, валидирована исследователями именно для оценки безопасности, а не просто качества .
ASSERT — не одиночный инструмент. Вместе с ним Microsoft представила Agent Control Specification (ACS), еще один open-source проект, который позволяет командам описывать в едином файле, что агенту можно, а что категорически нельзя, когда требуется вмешательство человека и какие доказательства нужно записать в лог .
Задуманный цикл работ выглядит так: сперва разработчик запускает ASSERT, чтобы найти дефекты (например, утечку данных), затем с помощью ACS описывает правила контроля поведения, и наконец, снова прогоняет ASSERT, чтобы количественно измерить разницу «до и после» .
Такой подход — «специфицируй, оцени, контролируй, переоценивай» — дает инженерным командам надежный, воспроизводимый процесс «закалки» агентских систем перед тем, как пустить их в реальный мир.
Исходный код ASSERT доступен в репозитории github.com/responsibleai/ASSERT. На старте проект получил поддержку от CrewAI, Arize AI, LiteLLM, Pipecat и Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT превращает простые описания желаемого поведения на естественном языке в исполняемые тестовые сценарии, автоматически находя нарушения политик безопасности.
ASSERT превращает простые описания желаемого поведения на естественном языке в исполняемые тестовые сценарии, автоматически находя нарушения политик безопасности. Инструмент генерирует провокационные тесты, записывает каждый шаг агента и выставляет четкие оценки «зачет/незачет», работая с LangChain, CrewAI, AutoGen и другими популярными фреймворками.
В отличие от общих тестов на «токсичность» или «полезность», ASSERT заточен под конкретные бизнес правила — например, «не возвращать деньги без одобрения менеджера».