ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)是微软开源的新框架,能将用自然语言编写的业务行为规则,自动转化为可执行、带评分的测试套件,专门捕捉 AI Agent 的策略违规和安全缺陷 [1][8]。 它会系统性生成对抗性测试场景,记录每一步工具调用,并给出带详细理由的通过/失败诊断报告,支持 LangChain、CrewAI、AutoGen、OpenAI 等主流框架 [7][12][13]。

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
想象一下,你为客服团队部署了一个 AI 助手,它在标准的性能测试中表现得完美无缺:回答既准确又礼貌。然而,上线第一天,它就未经审批批准了一笔巨额退款,还把客户的隐私邮件抄送给了整个部门。这类“合规性”灾难,正是传统 AI 测试的盲区。
2026 年 6 月 2 日,在微软 Build 开发者大会上,微软宣布推出并将 ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) 作为负责任 AI 板块下的开源项目进行发布 。这个框架的核心使命就是解决上述痛点:在你把 AI Agent 放出去与真实用户或系统交互之前,如何验证它会严格遵守你为产品设定的特殊规则和安全边界
。
ASSERT 的革命性在于,它将自然语言描述的行为规范,从一个“背景板”提升为评估的“一等公民”,让测试不再是写代码,而是“写话” 。
ASSERT 遵循一个五步流水线,把开发者的意图转化为清晰、可诊断的评估体系:
ASSERT 与传统通用评估工具的区别就在于,它专注于应用特有的行为边界。一个 Agent 可能在“有用性和真实性”的基准测试中拿满分,却仍然可能触犯一条具体的产品规则,比如“绝不向外部服务分享客户邮件地址”。ASSERT 正是为此类“应用特有”的失败模式而生 。微软将其定位为一个以安全为中心的框架,强调其评估方法专门针对安全性评估进行了验证,而不仅仅是通用的质量指标
。
ASSERT 并非孤军奋战,它与另一个微软开源项目——Agent Control Specification (ACS) 一同发布。ACS 允许团队定义可移植的策略文件,明确 Agent 能做什么、绝不能做什么、何时需要人类审批,以及必须记录哪些证据 。
这两者的预期工作流是深度集成的:开发者首先运行 ASSERT 来发现缺陷,然后通过 ACS 施加运行时控制,最后再次运行 ASSERT 来通过前后对比指标衡量改进程度 。这个“规范 -> 评估 -> 控制 -> 再评估”的闭环,为工程团队提供了一个可重复的流程,用于在上线前“硬化”AI 代理系统。
在实际操作中,开发者可以写下这样的规则:“此文档研究 Agent 不得向公司外的人发送邮件,必须将机密信息限制在 C 级高管范围内,并提供结合先前上下文的简洁摘要。” ASSERT 便会自动生成相应的对抗性测试用例,运行它们,并在任何策略被违反时,用一份带评分的报告和完整的轨迹记录来告警 。
ASSERT 目前在 github.com/responsibleai/ASSERT 上开源。发布时,它已获得了 CrewAI、Arize AI、LiteLLM、Pipecat 和 Pydantic 等社区伙伴的背书 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)是微软开源的新框架,能将用自然语言编写的业务行为规则,自动转化为可执行、带评分的测试套件,专门捕捉 AI Agent 的策略违规和安全缺陷 [1][8]。
ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)是微软开源的新框架,能将用自然语言编写的业务行为规则,自动转化为可执行、带评分的测试套件,专门捕捉 AI Agent 的策略违规和安全缺陷 [1][8]。 它会系统性生成对抗性测试场景,记录每一步工具调用,并给出带详细理由的通过/失败诊断报告,支持 LangChain、CrewAI、AutoGen、OpenAI 等主流框架 [7][12][13]。
与衡量“有用性”或“毒性”的通用基准不同,ASSERT 专注于具体应用的行为边界,评估 AI 是否遵守了开发者设定的精确产品规则和约束 [1][13]。