ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) est un framework open source qui convertit des descriptions en français de règles comportementales en suites de tests notées et traçables [1]... Il génère des scénarios adversariaux, enregistre chaque action de l'agent et fournit des diagnos...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Microsoft a dévoilé ASSERT (acronyme de Adaptive Spec-driven Scoring for Evaluation and Regression Testing) lors de sa conférence Build 2026, le 2 juin dernier, et l'a publié en open source sur GitHub sous la bannière « Responsible AI » . Ce framework répond à un problème grandissant dans le développement d'agents IA autonomes : comment s'assurer qu'un agent respectera les règles spécifiques d'un produit avant d'interagir avec de vrais utilisateurs ? Les benchmarks d'IA traditionnels — mesurant la pertinence, la toxicité ou l'exactitude générale — passent souvent à côté de défaillances critiques, comme un agent accordant des remboursements non autorisés ou divulguant des données confidentielles
. ASSERT comble cette lacune en traitant les spécifications comportementales en langage naturel comme une donnée d'entrée de premier ordre.
Le pipeline d'ASSERT suit cinq étapes clés, transformant l'intention du développeur en une évaluation notée et diagnostiquée :
Là où ASSERT se distingue d'outils d'évaluation génériques, c'est par sa focalisation sur les limites comportementales propres à une application. Un agent peut obtenir des scores parfaits sur des benchmarks de pertinence et de véracité tout en violant une règle produit comme « ne jamais partager les adresses e-mail des clients avec des services externes ». ASSERT a été spécifiquement conçu pour détecter ce type de défaillance . Microsoft présente ce framework comme centré sur la sécurité, précisant que sa méthodologie d'évaluation a été validée spécifiquement pour l'évaluation de la sûreté, et non uniquement de la qualité
.
ASSERT est livré aux côtés de la spécification ACS (Agent Control Specification), un autre projet open source de Microsoft. ACS permet aux équipes de définir des fichiers de politique portables spécifiant ce qu'un agent peut ou ne doit pas faire, quand une approbation humaine est requise et quelles preuves doivent être journalisées . Le flux de travail prévu est intégré : les développeurs exécutent ASSERT pour découvrir les défauts, appliquent des contrôles d'exécution via ACS, puis relancent ASSERT pour mesurer l'amélioration avec des métriques avant/après
. Cette boucle – spécifier, évaluer, contrôler, réévaluer – offre aux équipes d'ingénierie un processus reproductible pour durcir les systèmes d'agents avant leur déploiement.
En pratique, un développeur pourrait définir une règle comme : « Cet agent de recherche documentaire ne doit pas envoyer d'e-mails à des personnes extérieures à l'entreprise, doit limiter les informations confidentielles aux cadres dirigeants et doit fournir des résumés concis avec le contexte antérieur. » ASSERT génère alors automatiquement les cas de test adversariaux correspondants, les exécute et signale toute violation de la politique avec un rapport noté et une trace complète .
ASSERT est open source et hébergé sur github.com/responsibleai/ASSERT. Lors de son lancement, le projet a reçu le soutien de CrewAI, Arize AI, LiteLLM, Pipecat et Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) est un framework open source qui convertit des descriptions en français de règles comportementales en suites de tests notées et traçables [1]...
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) est un framework open source qui convertit des descriptions en français de règles comportementales en suites de tests notées et traçables [1]... Il génère des scénarios adversariaux, enregistre chaque action de l'agent et fournit des diagnostics détaillés, fonctionnant avec les principaux frameworks comme LangChain, CrewAI ou AutoGen [1][12].
Contrairement aux benchmarks génériques, ASSERT cible spécifiquement les règles métier propres à une application, vérifiant que l'agent les respecte scrupuleusement avant tout déploiement [1][13].