Celý proces je postaven na pipeline research–plan–implement (RPI), tedy výzkum, plánování a implementace. Agent testy nejen vytvoří, ale také je ihned validuje v několika krocích . Podporuje šest hlavních programovacích jazyků a tři vývojová prostředí . Microsoft na interním benchmarku se 152 úkoly dosáhl úspěšnosti 92,1 % – standardní prompt v GitHub Copilotu zvládnul jen 78,9 % úkolů . Aktuálně agent umí psát výhradně unit testy. Integrační, end-to-end, browser nebo výkonnostní testy zatím nepodporuje .
Agent nezahájí generování testů hned, ale postupuje podle strukturovaného postupu :
Proces RPI se skládá ze tří fází: Research (výzkum), Plan (plánování) a Implement (implementace) .
Na každém vygenerovaném testu provádí agent lehkou formu mutačního testování a kontroly kvality :
Díky tomu je jisté, že „procházející“ test je skutečně smysluplný a v CI pipeline dohledatelný . Agent píše unit testy – izoluje testovaný kód a mockuje externí služby a další závislosti .
Agent je distribuován jako plugin dotnet-test v MIT licencovaném repozitáři dotnet/skills na GitHubu . Funguje s :
Jelikož je dodáván jako definice agenta a ne jako hostovaná služba, běží přímo uvnitř kódovacího agenta, který tým už používá, a kód zůstává lokálně – neposílá se přes externí službu .
Microsoft na svém interním benchmarku se 152 úkoly dosáhl s agentem code-testing-generator dokončení 140 úkolů (92,1 %), zatímco standardní GitHub Copilot zvládl 120 úkolů (78,9 %) . Tento rozdíl jasně ukazuje výhodu specializovaného agenta, který před generováním testů nejprve prozkoumá kódovou základnu – oproti obecnému promptu .