딥시크 V4 Pro 0813은 세 차례 실행 결과를 합산해 32개 취약점 중 28개를 찾아냈으며, 비용은 약 295달러였다. 이는 단일 실행에서 28개를 보장한다는 의미는 아니다. 이번 결과는 폭넓은 탐색에는 저비용 에이전트를, 검증과 분류에는 높은 정밀도의 모델을 배치하고, 중요한 판단에는 사람의 검토를 더하는 보안 시스템을 지지한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido가 2026년 8월 진행한 벤치마크는 AI 모델 10개를 대상으로 최근 공개된 취약점 32개를 다시 찾아내도록 했다. 각 모델은 인터넷에 연결되지 않은 환경에서 30턴씩 세 차례 실행됐다. 결과를 합산하자 딥시크 V4 Pro 0813이 약 295달러의 비용으로 28개 취약점을 찾아 가장 높은 누적 재현율을 기록했다. 3
그러나 이 테스트가 보여준 핵심은 ‘최고의 모델 하나’를 고르는 일이 아니다. 취약점 탐색은 실행할 때마다 조사 경로와 가설이 달라지는 확률적 작업이기 때문이다. 여러 차례 탐색하고, 결과를 중복 제거한 뒤, 별도의 모델과 사람이 검증하는 시스템 설계가 모델 이름보다 중요하다는 뜻에 가깝다.
딥시크 V4 Pro 0813은 세 번의 실행 결과를 합산했을 때 32개 중 28개, 즉 87.5%의 누적 재현율을 기록했다. 이번 비교에서 발견 단계의 성과만 놓고 보면 가장 앞선 결과다.
다만 28/32는 ‘한 번 호출할 때마다 28개를 찾는다’는 의미가 아니다. 서로 다른 실행은 각기 다른 파일과 코드 경로, 익스플로잇 가설을 탐색할 수 있다. 여러 결과를 합치면 탐색의 다양성이 커져 전체 커버리지가 올라간다. 실무적으로는 모델의 첫 답변을 최종 보안 진단으로 간주하기보다, 독립적인 조사를 여러 번 수행하는 편이 합리적이라는 의미다. 3
딥시크 Pro는 세 차례 실행에 약 295달러를 들여 28/32를 기록했다. 강점은 일관성보다는 폭넓은 탐색이었다. 각 실행에서 발견한 서로 다른 취약점을 합치면서 전체 커버리지를 끌어올렸다.
따라서 1차 조사 단계에 적합한 후보로 볼 수 있다. 다만 실제 개발자에게 전달할 경고가 되려면 근거를 확인하고, 동일한 결함을 하나로 묶고, 심각도를 다시 평가하는 절차가 필요하다.
Flash는 세 번 실행해 약 108달러로 24/32를 찾아냈다. 제한된 예산 안에서 조사 횟수를 늘릴 수 있다는 점에서 비용 대비 커버리지가 돋보인다.
Flash를 최종 검토자로 단독 사용하는 것이 항상 최선이라는 뜻은 아니다. 저렴한 병렬 스캔과 추가 재실행에 활용한 뒤, 취합된 결과를 더 엄격한 검증 단계로 넘기는 방식이 적합하다. 3
Grok 4.6은 세 번의 실행 모두에서 21개 취약점을 찾아내며 반복 일관성 부문에서 두드러졌다. 같은 코드를 주기적으로 점검해야 하는 조직이라면, 매번 결과가 크게 달라지지 않고 예측 가능한 동작을 보이는 모델이 유리할 수 있다.
이는 딥시크 Pro와 다른 종류의 강점이다. 딥시크 Pro가 탐색 범위를 넓히는 데 강하다면, Grok은 표준화된 모니터링과 안정적인 보고서 작성에 더 적합할 가능성이 있다.
Claude Opus 5는 누적 재현율 26/32, GPT-5.6 Sol은 25/32를 기록했다. 두 모델 모두 높은 성능을 보였지만, 이번 결과는 가장 비싼 폐쇄형 모델이 반드시 최고의 취약점 커버리지를 제공한다는 가정을 흔들었다.
따라서 두 모델을 선택할 때는 브랜드나 일반 벤치마크 순위만 볼 것이 아니라, 전체 보안 파이프라인에서 추론 능력과 보고서 작성, 검토 행동이 어떤 추가 가치를 제공하는지 따져야 한다. 3
Kimi K3의 가장 눈에 띄는 지표는 **누적 정밀도 92.3%**였다. 정밀도는 전체 취약점을 얼마나 많이 찾았는지가 아니라, 보고한 결과 중 실제로 유효하다고 인정된 항목의 비율을 뜻한다.
이 차이는 모델의 역할을 나눠야 하는 이유를 보여준다. 높은 재현율을 추구하는 에이전트는 더 넓게 검색하면서 일정 수준의 잡음을 감수할 수 있다. 반면 정밀도가 높은 모델은 발견된 결과를 확인하고 보고서를 다듬으며, 엔지니어에게 전달되는 불필요한 경고를 줄이는 데 활용할 수 있다.
Aikido는 Qwen3.8-Max가 같은 CVE나 추론 경로를 되짚는 경향을 관찰했다. 이미 조사한 가설을 반복해 커버리지를 늘리지 못한다면 조사 턴을 낭비하는 행동이다.
하지만 재검토가 늘 무의미한 것은 아니다. 두 번째 검토에서 놓친 실행 조건이나 코드 경로, 검증 세부사항이 드러날 수도 있다. 실무적인 해법은 에이전트 하네스 차원의 상태 추적이다. 이미 확인한 파일과 가설을 기록하고, 반복 분기에는 상한을 두며, 해결되지 않은 사안은 같은 경로의 자동 재생이 아니라 새로운 조사로 보내야 한다.
GLM-5.3은 업데이트된 비교에서 24/32에서 25/32로 개선됐다. 동시에 이번에 언급된 폐쇄형 프런티어 모델보다 낮은 비용 프로필을 유지했다.
이 때문에 GLM-5.3은 대규모 반복 조사나 앙상블의 한 축으로 활용할 만한 후보가 된다. 핵심은 한 번의 완벽한 실행을 기대하기보다, 낮은 비용과 배포 유연성을 활용해 더 많은 조사 시도를 수행하는 데 있다.
AI 취약점 탐색 시스템을 단일 순위표로만 평가하면 실제 운영에 필요한 차이를 놓치게 된다.
발견 단계에서는 높은 재현율과 다양한 조사 행동이 중요하다. 반면 운영 환경에서 개발자에게 바로 경고를 보내려면 높은 정밀도, 재현 가능한 증거, 중복 제거, 유용한 위험도 분류가 필요하다.
즉 가능성이 있는 문제를 많이 찾는 모델이 검토되지 않은 경고를 개발자에게 직접 보내는 용도로는 부적합할 수 있다. 반대로 총 발견 수가 적더라도 신뢰도 높은 모델은 최종 분류와 보고에 더 큰 가치를 가질 수 있다.
이번 벤치마크에서 가장 중요한 시스템 차원의 교훈은 모델 성능이 확률적이었다는 점이다. 한 번의 실행은 하나의 조사 경로만 표본으로 삼지만, 여러 차례 독립 실행하면 서로 다른 가설을 탐색할 가능성이 커진다.
그 결과 상대적으로 저렴한 딥시크 실행 세 번이 더 비싼 프런티어 모델의 단일 실행과 경쟁하거나 이를 넘어설 수 있었다. 비교해야 할 단위는 단순한 모델 호출이 아니다. 모델, 도구, 프롬프트, 턴 예산, 메모리, 재실행, 검증 절차를 모두 포함한 ‘완전한 조사’가 실제 성능의 단위다. 3
이번 결과를 바탕으로 한 배포 구조라면 발견과 판단을 분리할 수 있다.
이처럼 모델을 역할별로 배치하는 방식이 오픈 웨이트 모델과 폐쇄형 모델을 단순한 일대일 대체재로 보는 것보다 견고하다.
Aikido의 결과는 참고할 만하지만 AI 보안 모델 전체의 보편적인 순위표는 아니다. 테스트는 최근 공개된 실제 취약점 32개, 모델별 세 번의 시도, 특정 에이전트 하네스를 기반으로 했다. 프로그래밍 언어, 저장소 구조, 도구 접근 권한, 위협 모델, 조사 예산, 오탐을 감수하는 조직의 기준에 따라 성능은 달라질 수 있다. 3
따라서 가장 타당한 결론은 제한적이지만 실용적이다. 이번 조건에서는 딥시크 V4 Pro를 비롯한 오픈 웨이트 모델이 반복 실행과 오케스트레이션을 결합했을 때 폐쇄형 프런티어 모델과 경쟁하거나 이를 넘어설 수 있었다.
하지만 보안 제품의 승자는 헤드라인 점수가 가장 높은 모델 하나가 아니다. 폭넓은 발견, 신뢰할 수 있는 검증, 엔지니어가 실제로 조치할 수 있는 증거를 함께 제공하는 시스템이 진짜 승자에 가깝다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
딥시크 V4 Pro 0813은 세 차례 실행 결과를 합산해 32개 취약점 중 28개를 찾아냈으며, 비용은 약 295달러였다. 이는 단일 실행에서 28개를 보장한다는 의미는 아니다.
딥시크 V4 Pro 0813은 세 차례 실행 결과를 합산해 32개 취약점 중 28개를 찾아냈으며, 비용은 약 295달러였다. 이는 단일 실행에서 28개를 보장한다는 의미는 아니다. 이번 결과는 폭넓은 탐색에는 저비용 에이전트를, 검증과 분류에는 높은 정밀도의 모델을 배치하고, 중요한 판단에는 사람의 검토를 더하는 보안 시스템을 지지한다.