ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)は、平易な英語の行動ルールを、スコア付きの実行可能なテストスイートに変換するオープンソースフレームワークで、AIエージェントのポリシー違反や安全性の欠陥を本番前に検出します [1][7][13]。 敵対的なテストシナリオを自動生成し、エージェントの全ツール呼び出しをログに記録。各テストの合否判定と詳細な理由を提示し、LangChain、CrewAI、AutoGen、OpenAIなど主要フレームワークで動作します [1][7][12][13]。

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Microsoftは、2026年6月2日に開催された開発者向けイベント「Build 2026」において、ASSERT(Adaptive Spec-driven Scoring for Evaluation and Regression Testing、適応型仕様駆動スコアリング評価・回帰テスト) を発表し、責任あるAI(Responsible AI)の一環としてGitHub上でオープンソース化しました 。
このフレームワークが解決しようとするのは、自律型AIエージェントの開発現場で急速に高まっている「品質保証」の難しさです。つまり、「作ったAIエージェントが、実際のユーザーやシステムと対話する前に、自社のビジネスルールや安全基準をきちんと守れるか」を、どう検証するかという問題です 。
従来のAI評価は、「どれだけ役に立つか」「有害な発言をしないか」といった汎用的な性能指標の測定が中心でした。しかしこれでは、「承認なしに5万円を超える返金処理をしない」「社外の人間に顧客のメールアドレスを送信しない」といった、アプリケーション固有の重大な違反を見逃してしまう可能性があります 。ASSERTは、こうした自然言語で書かれた「仕様」そのものを評価のインプットとし、そのギャップを埋めるわけです。
ASSERTは、開発者が書いた意図を、スコア付きで診断可能な評価結果に変換する、5段階のパイプラインで動作します。
平易な日本語(英語)でポリシーを書く:開発者は、製品の要件定義書、コンプライアンス文書、システムプロンプト、あるいはリリース前のチェックリストから、AIに期待する行動や禁止事項を自然言語で記述します 。例えば、「このサポートエージェントは、管理者の承認なしに5万円を超える返金を行ってはならない」といった具合です
。
LLMが仕様を解析し、構造化されたルールに変換:ASSERTは大規模言語モデル(LLM)を使用して、自由記述のテキストを解釈し、機械が処理可能な「許可される行動」と「許可されない行動」のセットに変換します 。
敵対的テストシナリオを自動生成:フレームワークは、AIエージェントがポリシーに違反するかどうかを徹底的に探るため、ピンポイントを突いたテストケースや、境界値、想定外の入力パターンをシステム的に大量生成します 。
対象エージェントに対してテストを実行:生成したテストスイートを実際のAIエージェント実装に対して実行し、エージェントが行ったすべての中間ステップとツール呼び出しを記録します 。ASSERTは特定のフレームワークに依存せず、LangChain、CrewAI、AutoGen、LiteLLM、OpenAIといった主要な開発キットすべてで動作します。Microsoftの独自基盤であるFoundryにロックインされることはありません
。
追跡可能なスコアレポートを受け取る:各テストは、合否判定と詳細な理由を提示する構造化されたスコアカードとして出力されます。実行トレース全体が保存されているため、開発者はエージェントが「どのツール呼び出しの、どの意思決定ステップで失敗したか」までドリルダウンして調査できます 。
ASSERTを一般的な評価ツールと区別する最大の特徴は、アプリケーション固有の行動境界に焦点を当てている点です。AIエージェントは、有用性や真実性に関する汎用ベンチマークで満点を取れたとしても、「顧客のメールアドレスを外部サービスと決して共有しない」といったプロダクト固有のルールには違反するかもしれません。ASSERTはまさに、そのような種類の失敗を捕捉するために構築されています 。
Microsoftはこのフレームワークを安全性重視のツールとして位置づけており、その評価手法は単なる品質指標のためではなく、安全性評価のために特別に検証されたアプローチに基づいていると説明しています 。
ASSERTは、Agent Control Specification (ACS) という別のオープンソースプロジェクトと同時にリリースされました 。ACSは、開発チームやセキュリティチームが「AIエージェントがしてよいこと、してはいけないこと」「いつ人間の承認が必要か」「どの証拠をログに残すべきか」を定義したポリシーファイルを移植可能な形で作成できるようにする標準仕様です
。
想定されている理想的なワークフローは、この二つを組み合わせたものです。まずASSERTで欠陥を発見し、次にACSでランタイム制御を適用し、そして再度ASSERTを実行して、ビフォー・アフターの指標で改善度を測定する 。この「仕様化→評価→制御→再評価」というループにより、エンジニアリングチームはAIエージェントシステムを本番環境にデプロイする前に、繰り返し可能なプロセスで堅牢化できるようになります。
実務上は、開発者が「この文書調査エージェントは、社外の人物にメールを送信してはならない。機密情報はCレベルの役員に限定し、常に以前の文脈を含めた簡潔な要約を提供しなければならない」といったルールを指定すれば、ASSERTが対応する敵対的テストケースを自動で生成・実行し、ポリシー違反があればスコア付きレポートと詳細なトレースで警告を発する、という流れになります 。
ASSERTはオープンソースとして github.com/responsibleai/ASSERT で公開されており、リリース当初からCrewAI、Arize AI、LiteLLM、Pipecat、Pydanticといったコミュニティからのサポートを受けています 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)は、平易な英語の行動ルールを、スコア付きの実行可能なテストスイートに変換するオープンソースフレームワークで、AIエージェントのポリシー違反や安全性の欠陥を本番前に検出します [1][7][13]。
ASSERT(Adaptive Spec driven Scoring for Evaluation and Regression Testing)は、平易な英語の行動ルールを、スコア付きの実行可能なテストスイートに変換するオープンソースフレームワークで、AIエージェントのポリシー違反や安全性の欠陥を本番前に検出します [1][7][13]。 敵対的なテストシナリオを自動生成し、エージェントの全ツール呼び出しをログに記録。各テストの合否判定と詳細な理由を提示し、LangChain、CrewAI、AutoGen、OpenAIなど主要フレームワークで動作します [1][7][12][13]。
有用性や有害性といった一般的なベンチマークとは異なり、ASSERTは「特定の顧客情報を外部サービスと共有しない」といった、アプリケーション固有のビジネスルールのテストに特化しています [1][13]。