ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) adalah kerangka sumber terbuka yang mengonversi aturan perilaku bahasa Inggris sederhana menjadi rangkaian pengujian yang dapat dieksekusi da... Alat ini menghasilkan skenario adversarial, mencatat setiap panggilan alat (tool call), dan meny...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
Di konferensi pengembang Build 2026 pada 2 Juni 2026, Microsoft mengumumkan ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) dan merilisnya sebagai proyek sumber terbuka di bawah naungan Responsible AI di GitHub . Kerangka kerja ini mengatasi masalah yang kian pelik dalam pengembangan AI agentik: bagaimana memverifikasi bahwa agen otonom akan menghormati aturan spesifik dan batasan keamanan produk Anda sebelum berinteraksi dengan pengguna atau sistem nyata. Tolok ukur AI tradisional—yang mengukur kebergunaan, toksisitas, atau akurasi umum—sering kali luput mendeteksi kegagalan kritis pada perilaku spesifik aplikasi, seperti agen yang mengeluarkan pengembalian dana tanpa otorisasi atau membagikan data rahasia ke penerima yang salah
. ASSERT menutup celah ini dengan memperlakukan spesifikasi perilaku berbahasa alami sebagai input utama untuk evaluasi, bukan sekadar konteks latar belakang.
ASSERT mengikuti alur lima langkah yang mengubah maksud tertulis pengembang menjadi evaluasi yang terstruktur dan bisa didiagnosis:
Mulai dengan kebijakan bahasa Inggris sederhana. Pengembang mendeskripsikan perilaku yang diharapkan dan dilarang dalam bahasa alami, yang diambil dari persyaratan produk, dokumen kepatuhan, prompt sistem, atau daftar periksa peluncuran . Contohnya: "Agen dukungan ini tidak boleh mengeluarkan pengembalian dana lebih dari Rp7.500.000 tanpa persetujuan manajer"
.
LLM mengurai spesifikasi menjadi aturan terstruktur. ASSERT menggunakan model bahasa (LLM) untuk menafsirkan deskripsi teks bebas dan menghasilkan spesifikasi yang dapat dibaca mesin tentang tindakan yang dapat diterima dan tidak dapat diterima .
Generasi kasus uji adversarial. Kerangka kerja ini secara sistematis menciptakan skenario yang ditargetkan, kasus ekstrem (edge case), dan input yang dirancang untuk menguji apakah agen melanggar kebijakan yang telah ditetapkan .
Jalankan rangkaian uji terhadap agen target. ASSERT menjalankan pengujian pada implementasi agen yang sebenarnya, merekam setiap langkah perantara dan panggilan alat (tool call) yang dilakukan agen . ASSERT bersifat agnostik terhadap kerangka kerja dan kompatibel dengan LangChain, CrewAI, AutoGen, LiteLLM, dan OpenAI—pengembang tidak terkunci di Microsoft Foundry
.
Terima laporan yang terstruktur dan dapat ditelusuri. Setiap pengujian menghasilkan kartu skor terstruktur dengan putusan lulus/gagal dan alasan terperinci dari model juri (judge model). Karena seluruh jejak eksekusi disimpan, pengembang dapat menelusuri hingga ke panggilan alat atau langkah keputusan persis di mana agen melakukan kesalahan .
Yang membedakan ASSERT dari alat evaluasi generik adalah fokusnya pada batasan perilaku spesifik aplikasi. Sebuah agen mungkin mendapat skor sempurna pada tolok ukur kebergunaan dan kejujuran, tetapi tetap melanggar aturan produk seperti "jangan pernah membagikan alamat email pelanggan ke layanan eksternal." ASSERT sengaja dibangun untuk menangkap kelas kegagalan semacam itu . Microsoft memposisikan kerangka kerja ini sebagai alat yang berpusat pada keamanan, mencatat bahwa metodologi evaluasinya divalidasi secara khusus untuk penilaian keamanan, bukan hanya metrik kualitas
.
ASSERT dirilis bersama Agent Control Specification (ACS), proyek sumber terbuka Microsoft lainnya yang memungkinkan tim mendefinisikan file kebijakan portabel yang menentukan apa yang boleh dan tidak boleh dilakukan agen, kapan persetujuan manusia diperlukan, dan bukti apa yang harus dicatat . Alur kerja yang dimaksudkan bersifat terintegrasi: pengembang menjalankan ASSERT terlebih dahulu untuk menemukan cacat, menerapkan kontrol runtime melalui ACS, lalu menjalankan ulang ASSERT untuk mengukur peningkatan dengan metrik sebelum-dan-sesudah
. Siklus tersebut—spesifikasikan, evaluasi, kontrol, evaluasi ulang—memberi tim teknik proses yang berulang untuk memperkuat sistem agentik sebelum penerapan.
Dalam praktiknya, seorang pengembang dapat menentukan aturan seperti: "Agen riset dokumen ini tidak boleh mengirim email ke orang di luar perusahaan, harus membatasi informasi rahasia hanya untuk eksekutif level C, dan harus memberikan ringkasan singkat dengan konteks sebelumnya." ASSERT akan secara otomatis menghasilkan kasus uji adversarial yang sesuai, menjalankannya, dan menandai setiap pelanggaran kebijakan dengan laporan yang dinilai dan jejak penuh .
ASSERT bersifat sumber terbuka dan dihosting di github.com/responsibleai/ASSERT. Saat peluncurannya, proyek ini mendapatkan dukungan komunitas dari CrewAI, Arize AI, LiteLLM, Pipecat, dan Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) adalah kerangka sumber terbuka yang mengonversi aturan perilaku bahasa Inggris sederhana menjadi rangkaian pengujian yang dapat dieksekusi da...
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) adalah kerangka sumber terbuka yang mengonversi aturan perilaku bahasa Inggris sederhana menjadi rangkaian pengujian yang dapat dieksekusi da... Alat ini menghasilkan skenario adversarial, mencatat setiap panggilan alat (tool call), dan menyediakan diagnostik lulus/gagal yang terstruktur, bekerja di berbagai kerangka kerja utama seperti LangChain, CrewAI, Auto...
Tidak seperti tolok ukur generik untuk kebergunaan atau toksisitas, ASSERT menargetkan batasan perilaku spesifik aplikasi, seperti mengevaluasi apakah agen mengikuti aturan dan batasan produk yang tepat yang ditulis o...