이를 통해 "통과"하는 테스트가 실제로 의미 있고 CI(지속적 통합)에서 발견 가능하도록 보장합니다 . 에이전트는 테스트 대상 코드를 격리하고 외부 서비스 및 기타 외부 의존성을 모의(mock) 처리하는 유닛 테스트를 작성합니다
.
마이크로소프트의 내부 벤치마크(152개 과제)에서 code-testing-generator 에이전트는 140개 과제(92.1%)를 완료한 반면, 기본 GitHub Copilot은 120개 과제(78.9%)를 완료했습니다 . 이 성능 차이는 일반적인 범용 프롬프트에 의존하기보다, 코드베이스를 먼저 조사한 후 테스트를 생성하는 특화된 에이전트의 장점을 잘 보여줍니다
.