ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) er et open source framework, der forvandler forretningsregler skrevet i naturligt sprog til eksekverbare, scorede testsuiter – og fanger over... Værktøjet genererer automatisk modstridende scenarier, logger hvert eneste funktionskald og give...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Microsoft offentliggjorde ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) under deres Build 2026-udviklerkonference den 2. juni 2026 og frigav det som et open source-projekt på GitHub under fanen Responsible AI . Frameworket adresserer en voksende hovedpine inden for agentisk AI-udvikling: Hvordan sikrer man, at en autonom agent overholder et produkts specifikke regler og sikkerhedsgrænser, før den interagerer med rigtige mennesker eller systemer? Traditionelle AI-benchmarks – som måler hjælpsomhed, toksicitet eller generel nøjagtighed – overser ofte kritiske fejl i applikationsspecifik adfærd, som for eksempel en agent, der udsteder en uautoriseret refusion eller deler fortrolige oplysninger med de forkerte modtagere
. ASSERT lukker dette hul ved at behandle naturligt-sprogede adfærdsspecifikationer som en førsteklasses input til evaluering, ikke blot som baggrundskontekst.
ASSERT følger en elegant fem-trins pipeline, der gør en udviklers skrevne intentioner til en scoret, gennemskuelig evaluering:
Start med regler på almindeligt dansk (eller engelsk). Udviklere beskriver forventet og forbudt adfærd på naturligt sprog, direkte fra produktkrav, compliance-dokumenter, system-prompts eller tjeklister . For eksempel: "Denne supportagent må ikke godkende refusioner over 3.500 kroner uden en leders godkendelse."
En LLM analyserer specifikationerne til strukturerede regler. ASSERT bruger en sprogmodel til at fortolke de frit-formulerede beskrivelser og producere en maskinlæsbar specifikation af acceptable og uacceptable handlinger .
Generering af angrebs-scenarier. Frameworket skaber systematisk målrettede scenarier, edge cases og inputs, der er designet til at udfordre, om agenten overtræder de angivne politikker . Det er lidt ligesom en venlig, men ubønhørlig "rød team"-tester, der prøver at narre din agent.
Udfør testen mod den målrettede agent. ASSERT kører testene mod agentens egentlige implementering og registrerer hvert eneste trin og funktionskald, agenten foretager undervejs . Værktøjet er framework-agnostisk og spiller sammen med blandt andet LangChain, CrewAI, AutoGen, LiteLLM og OpenAI – du er altså ikke låst fast til Microsofts eget Foundry-miljø
.
Modtag en scoret, sporbar rapport. Hver test genererer et struktureret scorecard med en bestået/ikke-bestået-konklusion og en detaljeret begrundelse fra en "dommermodel". Fordi hele eksekveringssporet bevares, kan udviklere bore helt ned i det præcise funktionskald eller beslutningspunkt, hvor agenten fejlede .
Det, der adskiller ASSERT fra generiske evalueringsværktøjer, er fokus på applikationsspecifikke adfærdsgrænser. En agent kan score perfekt i benchmarks for hjælpsomhed og sandfærdighed, men alligevel overtræde en produktregel som "del aldrig kunders e-mailadresser med eksterne tjenester." ASSERT er bygget til netop at fange den type fejl . Microsoft positionerer frameworket som sikkerhedscentreret og bemærker, at evalueringsmetoden specifikt blev valideret til sikkerhedsvurdering, ikke bare kvalitetsmålinger
.
ASSERT sendes på markedet sammen med Agent Control Specification (ACS), et andet open source-projekt fra Microsoft, der lader teams definere bærbare politikfiler, som specificerer, hvad en agent må og ikke må, hvornår der kræves menneskelig godkendelse, og hvilken dokumentation der skal logges . Den tilsigtede arbejdsgang er integreret: Udviklere kører ASSERT først for at opdage fejl, anvender kørselskontroller via ACS og kører derefter ASSERT igen for at måle forbedringen med før-og-efter-målinger
. Denne cyklus – specificer, evaluér, kontrollér, re-evaluér – giver udviklingsteams en gentagelig proces til at hærde agentiske systemer, inden de sættes i drift.
I praksis kunne en udvikler specificere en regel som: "Denne dokument-research-agent må ikke sende e-mails til personer uden for virksomheden, skal begrænse fortrolige oplysninger til C-level-ledere og skal levere koncise resuméer med forudgående kontekst." ASSERT ville så automatisk generere de tilsvarende modstridende testcases, køre dem og markere ethvert brud på politikken med en scoret rapport og et fuldt spor .
ASSERT er open source og ligger på github.com/responsibleai/ASSERT. Ved lanceringen fik det opbakning fra fællesskabet, herunder CrewAI, Arize AI, LiteLLM, Pipecat og Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) er et open source framework, der forvandler forretningsregler skrevet i naturligt sprog til eksekverbare, scorede testsuiter – og fanger over...
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) er et open source framework, der forvandler forretningsregler skrevet i naturligt sprog til eksekverbare, scorede testsuiter – og fanger over... Værktøjet genererer automatisk modstridende scenarier, logger hvert eneste funktionskald og giver en struktureret bestået/ikke bestået diagnose – og fungerer på tværs af LangChain, CrewAI, AutoGen, OpenAI og andre sto...
I modsætning til generiske benchmarks for hjælpsomhed eller toksicitet tester ASSERT applikationsspecifikke adfærdsgrænser – for eksempel om en kundeserviceagent udsteder en uretmæssig refusion uden en leders godkende...