它透過一套名爲 「研究-規劃-實作」(RPI,Research-Plan-Implement) 的結構化管線來協調測試生成,並在完成前執行多階段的品質檢查,以確保測試的實質有效性 。在微軟內部 152 項任務的基準測試中,該代理達成了 92.1% 的任務完成率,明顯優於標準 GitHub Copilot 提示的 78.9% 。目前,這個代理僅限於生成單元測試,明確排除了整合測試、端對端測試、瀏覽器測試及效能測試 。
code-testing-generator 遵循一套結構化的步驟,而非貿然生成測試 :
此 RPI 程序由三個核心步驟構成:研究(Research)、規劃(Plan)與實作(Implement)。
這個代理會對每個生成的測試執行輕量級的突變測試與品質保證 :
這樣做的目的是確保一個「通過」的測試是真正有意義的,並且能在持續整合(CI)流程中被妥善發現與執行 。該代理所撰寫的單元測試會隔離受測程式碼,並模擬(mock)外部服務及其他外部依賴 。
該代理以 dotnet-test 插件的形式,託管在 GitHub 上採用 MIT 授權的 dotnet/skills 儲存庫中 。它支援 :
由於它以代理定義(agent definition)而非代管服務的形式發布,因此可以運行在團隊既有的任何程式碼代理(coding agent)中,所有程式碼都在本地端處理,無需透過外部服務來回傳輸 。
在微軟內部針對 152 項任務的基準測試中,code-testing-generator 代理成功完成了 140 項任務(完成率 92.1%),而標準的 GitHub Copilot 則完成了 120 項(完成率 78.9%)。這項效能差距凸顯了專用代理的優勢:它會在生成測試前深入研究程式碼庫,而非僅依賴通用的提示詞 。