ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) to framework open source, który przekształca reguły zachowania napisane w języku naturalnym na wykonywalne, punktowane zestawy testów, wychwy... Generuje scenariusze kontradyktoryjne, rejestruje każde wywołanie narzędzia i dostarcza punktowa...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Microsoft ogłosił framework ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) na swojej konferencji deweloperskiej Build 2026, która odbyła się 2 czerwca 2026 roku, i udostępnił go jako projekt open-source pod szyldem Odpowiedzialnego AI na GitHubie . Framework ten mierzy się z narastającym problemem w rozwoju agentowej sztucznej inteligencji: jak zweryfikować, czy autonomiczny agent będzie respektował konkretne zasady i granice bezpieczeństwa twojego produktu, zanim zacznie wchodzić w interakcje z prawdziwymi użytkownikami lub systemami. Tradycyjne benchmarki AI – mierzące pomocność, toksyczność czy ogólną dokładność – często pomijają krytyczne awarie w zachowaniu specyficznym dla danej aplikacji, np. gdy agent wydaje nieautoryzowane zwroty pieniędzy lub udostępnia poufne dane niewłaściwym osobom
. ASSERT wypełnia tę lukę, traktując specyfikacje zachowań napisane w języku naturalnym jako główne źródło danych do ewaluacji, a nie tylko jako kontekst.
ASSERT działa w pięcioetapowym procesie, który przekształca intencje dewelopera w punktowaną i możliwą do zdiagnozowania ocenę:
Zaczyna się od zasad w języku naturalnym. Deweloperzy opisują oczekiwane i zabronione zachowania za pomocą zwykłych słów, bazując na wymaganiach produktowych, dokumentach zgodności, promptach systemowych czy listach kontrolnych wdrożenia . Przykład: "Ten agent wsparcia nie może wydawać zwrotów przekraczających 2000 złotych bez zgody kierownika"
.
LLM analizuje specyfikacje i tworzy ustrukturyzowane reguły. ASSERT wykorzystuje model językowy (LLM) do interpretacji opisów tekstowych i generowania czytelnej dla maszyny specyfikacji akceptowalnych i niedopuszczalnych działań .
Kontradyktoryjne generowanie przypadków testowych. Framework systematycznie tworzy ukierunkowane scenariusze, przypadki brzegowe i dane wejściowe zaprojektowane tak, by sprawdzić, czy agent narusza określone zasady .
Wykonanie zestawu testów na docelowym agencie. ASSERT uruchamia testy na rzeczywistej implementacji agenta, rejestrując każdy krok pośredni i każde wywołanie narzędzia, które agent wykonuje . Jest niezależny od frameworka i działa z LangChain, CrewAI, AutoGen, LiteLLM i OpenAI, a także wieloma innymi – deweloperzy nie są zablokowani w ekosystemie Microsoft Foundry
.
Otrzymujesz punktowany raport z możliwością śledzenia. Każdy test generuje ustrukturyzowaną kartę wyników z werdyktem pass/fail i szczegółowym uzasadnieniem od modelu sędziego. Ponieważ cała ścieżka wykonania jest zachowana, deweloperzy mogą dotrzeć do konkretnego wywołania narzędzia lub etapu decyzyjnego, w którym agent popełnił błąd .
Tym, co odróżnia ASSERT od generycznych narzędzi ewaluacyjnych, jest jego koncentracja na granicach behawioralnych specyficznych dla aplikacji. Agent może uzyskać doskonałe wyniki w benchmarkach pomocności i prawdomówności, a mimo to naruszyć regułę produktową, taką jak "nigdy nie udostępniaj adresów e-mail klientów zewnętrznym serwisom". ASSERT został zbudowany właśnie po to, by wyłapywać tę klasę awarii . Microsoft pozycjonuje ten framework jako skoncentrowany na bezpieczeństwie, zauważając, że jego metodologia ewaluacji została zweryfikowana specjalnie pod kątem oceny bezpieczeństwa, a nie tylko ogólnych wskaźników jakości
.
ASSERT jest dostarczany razem z Agent Control Specification (ACS), innym projektem open-source Microsoftu, który umożliwia zespołom definiowanie przenośnych plików zasad określających, co agent może, a czego nie może robić, kiedy wymagana jest aprobata człowieka i jakie dowody muszą być rejestrowane . Przewidziany przepływ pracy jest zintegrowany: deweloperzy najpierw uruchamiają ASSERT, aby wykryć defekty, następnie stosują kontrolę w czasie rzeczywistym za pomocą ACS, a potem ponownie uruchamiają ASSERT, aby zmierzyć poprawę za pomocą metryk przed i po
. Ta pętla – specyfikuj, oceń, kontroluj, ponownie oceń – daje zespołom inżynierskim powtarzalny proces utwardzania systemów agentowych przed wdrożeniem.
W praktyce deweloper może określić regułę typu: "Ten agent badawczy do dokumentów nie może wysyłać e-maili do osób spoza firmy, musi ograniczać dostęp do informacji poufnych do kadry kierowniczej wyższego szczebla i musi dostarczać zwięzłe podsumowania z uwzględnieniem wcześniejszego kontekstu". ASSERT automatycznie wygeneruje odpowiednie kontradyktoryjne przypadki testowe, uruchomi je i oznaczy każde naruszenie zasad za pomocą punktowanego raportu i pełnego śladu wykonania .
ASSERT jest open-source i dostępny na GitHubie pod adresem github.com/responsibleai/ASSERT. W momencie premiery otrzymał wsparcie społeczności od CrewAI, Arize AI, LiteLLM, Pipecat i Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) to framework open source, który przekształca reguły zachowania napisane w języku naturalnym na wykonywalne, punktowane zestawy testów, wychwy...
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) to framework open source, który przekształca reguły zachowania napisane w języku naturalnym na wykonywalne, punktowane zestawy testów, wychwy... Generuje scenariusze kontradyktoryjne, rejestruje każde wywołanie narzędzia i dostarcza punktowaną diagnostykę pass/fail, działając z głównymi frameworkami, takimi jak LangChain, CrewAI, AutoGen i OpenAI.
W przeciwieństwie do ogólnych benchmarków oceniających pomocność czy toksyczność, ASSERT celuje w specyficzne dla aplikacji granice behawioralne – sprawdzając, czy agent przestrzega precyzyjnych reguł i ograniczeń zde...