该智能体不会直接开始生成测试,而是遵循一套结构化的流程 :
整个流程分为三步:研究、规划、实现 。
每个生成的测试都会经过轻量级的变异测试和一系列质量检查 :
这套机制确保了“通过”的测试不仅有意义,而且在持续集成流程中可被正确发现 。该智能体编写的测试是单元测试,会隔离被测试代码,并模拟外部服务和其他外部依赖 。
该智能体以dotnet-test插件的形式,托管在GitHub上采用MIT许可的dotnet/skills仓库中 。集成情况如下 :
由于它以智能体定义(而非托管服务)的形式发布,因此可以运行在团队已有的任何编码智能体环境中,代码完全在本地处理,无需经过外部服务往返传输 。
在微软内部的152个任务基准测试中,code-testing-generator 智能体完成了140个任务(92.1%),而标准的 GitHub Copilot 完成了120个任务(78.9%)。这一性能差距凸显了专用智能体的优势——它会在生成测试前先研究代码库,而不是依赖通用的提示词 。