ASSERT(自適應規格驅動評分與迴歸測試)是一款開源框架,能將「客服代理未經主管核准不得核發超過 500 美元的退款」這類白話文規則,自動轉成可執行的評分測試集 [1][8]。 它會生成對抗性情境、記錄每一次工具調用,並提供包含通過與否的詳細診斷報告,支援 LangChain、CrewAI、AutoGen、OpenAI 等主流框架 [1][7][12]。

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
即使你的 AI 客服代理在一般的「有用性」與「真實性」基準測試中拿到滿分,它仍可能在實際上線時,未經主管同意就核發高額退款,或是將客戶的電子郵件誤傳給外部服務。這就是為什麼微軟要在 2026 年 6 月 2 日的 Build 開發者大會上,正式發表並開源 ASSERT(Adaptive Spec-driven Scoring for Evaluation and Regression Testing,自適應規格驅動評分與迴歸測試) 框架 。
ASSERT 的核心概念,是將自然語言的行為規格,視為評測流程中的「一等公民」,而不只是背景參考資料。它讓開發團隊可以用最直覺的方式——寫下幾行白話文規則——來建立一套能自動執行、評分、並追溯問題根源的完整測試流程 。
ASSERT 的運作就像是一條自動化的品管流水線,將開發者的意圖轉化為具體、可診斷的評測結果:
從白話文政策開始
開發者用自然語言描述 AI 代理的預期與禁止行為。這些描述可以直接來自產品需求文件、合規文件、系統提示詞,或是上線前的檢查清單 。例如,你可以寫下:「這個客服代理未經主管核准,不得核發超過新台幣 15,000 元的退款」
。
LLM 將規格解析為結構化規則
ASSERT 內建的大型語言模型會讀懂這些自由格式的文字,並將其轉換為機器可讀的結構化規格,明確定義哪些是可接受的行為,哪些是不可接受的 。
自動生成對抗性測試案例
這是最關鍵的一步。框架會系統性地針對你訂下的規則,自動創造各種企圖違規的極端情境、邊界案例與輸入值,目的就是要刺探你的 AI 代理是否會犯錯 。
對目標代理執行測試
ASSERT 會將這整套測試案例,實際在你開發的 AI 代理上執行,並詳實記錄過程中的每一個思考步驟與工具調用。它不限定使用微軟自家的平台,能與 LangChain、CrewAI、AutoGen、LiteLLM、OpenAI 等主流框架搭配使用 。
取得評分與可追溯的診斷報告
每個測試案例都會產生一份結構化的評分卡,包含通過或失敗的結果,以及裁判模型給出的詳細判斷理由。由於完整的執行軌跡都被保留下來,工程師可以一路向下追蹤,精確定位到是哪一個具體的工具調用或決策步驟導致了失敗 。
ASSERT 與一般 AI 評測工具最大的不同,在於它聚焦於「應用程式特有的行為邊界」。傳統基準測試像是通用的體檢,而 ASSERT 更像是針對你的產品所設計的專科檢查,專門抓出那些通用測試看不見的特定行為疏失 。微軟特別強調,該框架的評測方法論是為了「安全性評測」而驗證的,而非單純的品質指標
。
ASSERT 並非單打獨鬥。它與微軟同場發布的另一個開源專案 「代理控制規格(Agent Control Specification,簡稱 ACS)」 相輔相成。ACS 讓團隊能以可攜式的政策檔案,明確定義代理可以做什麼、絕對不能做什麼、何時需要人類核准,以及哪些證據必須記錄 。
兩者整合後的工作流程形成一個持續改進的閉環:開發者先用 ASSERT 找出行為缺陷,接著透過 ACS 在執行階段施加控制,然後再次執行 ASSERT 來量化改善前後的成效 。這種「制定規格 → 評測 → 控制 → 重新評測」的循環,為工程團隊提供了一套在 AI 代理上線前,可重複執行的強韌性驗證流程。
舉例來說,一位開發者可以寫下這樣的規則:「這個文件研究代理不得寄送電子郵件給公司外部人士,必須將機密資訊限定提供給高階主管,並且要提供包含前後文脈絡的簡潔摘要。」ASSERT 就會自動生成針對性的對抗性測試案例、執行它們,並在偵測到任何違規行為時,立即提出附有評分與完整軌跡的報告 。
ASSERT 已以開源形式發布於 github.com/responsibleai/ASSERT,並在發表之初就獲得了 CrewAI、Arize AI、LiteLLM、Pipecat 和 Pydantic 等社群的支援 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT(自適應規格驅動評分與迴歸測試)是一款開源框架,能將「客服代理未經主管核准不得核發超過 500 美元的退款」這類白話文規則,自動轉成可執行的評分測試集 [1][8]。
ASSERT(自適應規格驅動評分與迴歸測試)是一款開源框架,能將「客服代理未經主管核准不得核發超過 500 美元的退款」這類白話文規則,自動轉成可執行的評分測試集 [1][8]。 它會生成對抗性情境、記錄每一次工具調用,並提供包含通過與否的詳細診斷報告,支援 LangChain、CrewAI、AutoGen、OpenAI 等主流框架 [1][7][12]。
有別於只衡量有用性、毒性等通用指標的基準測試,ASSERT 專注於檢驗 AI 代理是否遵守開發者自訂的具體產品規則與限制 [1][13]。