맨디언트의 AVDH는 이틀 만에 검증된 고위험 취약점 100개 이상을 발견했지만, 단일 AI 모델이 코드를 한 번에 읽은 결과가 아니라 전문 에이전트와 인간 전문가가 결합한 다단계 파이프라인의 성과다. 팔로알토 네트웍스의 NOVA는 두 달 동안 오픈소스 프로젝트 3,915개에서 취약점 14,090개를 확인했다고 밝혔지만, 특정 사고 대응을 깊이 검증한 AVDH와는 측정 대상과 운영 방식이 다르다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did Mandiant’s Agentic Vulnerability Discovery Harness (AVDH), built on Google’s Agent Development Kit and operating through specialized. Article summary: Mandiant’s AVDH shows that the immediate breakthrough is not a model that “reads all code,” but an engineered pipeline that turns vast codebases into a smaller stream of exploit hypotheses, then requires human reproducti. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
맨디언트의 **에이전틱 취약점 탐지 하네스(AVDH·Agentic Vulnerability Discovery Harness)**가 보여준 핵심은 특정 취약점 숫자 자체가 아니다. AI를 활용한 보안 연구가 ‘코드를 읽어주는 챗봇’ 실험을 넘어, 여러 전문 에이전트와 인간 검토자가 참여하는 공학적 업무 흐름으로 바뀌고 있다는 점이다.
구글에 따르면 AVDH는 한 사고 대응 업무에서 단 이틀 만에 실제로 확인된 고위험 취약점 100개 이상을 찾아냈다. 그러나 이를 두고 “AI 모델 하나가 모든 코드를 읽고 취약점을 골라냈다”고 해석해서는 곤란하다. 성과의 배경에는 방대한 탐색 범위를 단계별로 좁히고, 의심스러운 결함이 실제 공격으로 이어질 수 있는지 사람과 시스템이 거듭 확인하는 구조가 있다.
AVDH의 구조는 숙련된 보안 평가팀이 수행하는 작업을 여러 단계로 나눈 형태에 가깝다. 먼저 에이전트가 코드베이스의 목적과 작동 방식을 파악한다. 이후 다른 에이전트들이 공격 표면과 진입점, 데이터 흐름을 분석하고, 서로 다른 취약점 가설과 공격 경로를 제시한다. 제안된 경로는 별도의 검증 단계에서 다시 점검되며, 인간 컨설턴트가 위협 모델을 검토하고 개념증명(PoC) 익스플로잇을 직접 재현한 뒤에야 발견 사항이 검증된 결과로 취급된다.
이런 분업이 중요한 이유는 소스코드 분석에서 나오는 ‘수상한 패턴’이 실제 보안팀의 처리 능력을 훨씬 쉽게 넘어설 수 있기 때문이다. AVDH는 중간 단계에서 많은 후보를 만들어내고, 검증 과정과 인간 검토를 통해 실제로 악용 가능하고 영향이 큰 문제에 조사 역량을 집중한다.
구글은 AVDH를 사용한 첫 10개월 동안 수천만 줄에 이르는 코드베이스를 분석했고, 수만 건의 발견 사항을 생성했다고 밝혔다. 이 가운데 소개된 이틀간의 조사에서는 실제로 확인된 치명적 취약점 100개 이상이 식별됐다. 전체 작업은 널리 사용되는 웹 확장 프로그램과 오픈소스 소프트웨어의 취약점 등 12건의 CVE 할당으로도 이어졌으며, 약 12건은 추가 공개 절차가 진행 중인 것으로 전해졌다.
따라서 중요한 지표는 단순한 경보 건수가 아니다. 기계가 생성한 수많은 가설 가운데 얼마만큼이 재현 가능하고, 책임 있게 공개할 수 있는 실제 취약점으로 전환됐는지가 핵심이다.
팔로알토 네트웍스는 자사의 자율형 다중 모델 취약점 탐지 시스템 **NOVA(Network and Open-Source Vulnerability Analyzer)**를 통해 훨씬 큰 규모의 성과를 제시했다. 회사의 연구에 따르면 NOVA는 두 달 동안 오픈소스 프로젝트 3,915개를 분석해 확인된 취약점 14,090개를 보고했으며, 이 중 99.4%는 이전에 보고되지 않은 것이고 40%는 고위험 또는 치명적 등급이었다.
하지만 두 결과는 같은 시험에서 겨룬 점수가 아니다.
공개된 자료만으로는 두 시스템의 대상 선정 방식, 심각도 기준, 오탐 허용 수준, 실제 악용 가능성 검증 기준, 취약점 공개 절차가 동일했는지 확인할 수 없다. 따라서 두 숫자를 업계 전체의 순위표처럼 놓고 어느 시스템이 절대적으로 우월하다고 결론 내리기는 어렵다.
대신 두 사례는 서로 다른 능력을 보여준다. AVDH는 특정 조사에서 에이전트 연쇄가 어떻게 높은 신뢰도의 분석을 지원하는지 보여주고, NOVA는 자율형 탐지가 오픈소스 생태계 전반에서 어느 정도 규모로 작동할 수 있는지를 보여준다.
결국 취약점 탐지는 두 문제로 나뉘고 있다. 하나는 약점을 놓치지 않도록 넓게 찾는 일이고, 다른 하나는 그 약점이 실제로 위험한지 확인해 대응 가능한 결과로 만드는 일이다.
팔로알토 네트웍스가 제시한 해법은 취약점을 찾아내는 데서 끝나지 않는다. 회사의 고급 가상 패치(Advanced Virtual Patching) 구상은 소프트웨어 소유자가 전통적인 수정 작업을 완료하는 동안, 네트워크 수준의 보호 조치를 수시간 안에 배포해 공격 노출을 줄이는 것을 목표로 한다. 팔로알토는 전통적인 패치 배포에 걸리는 업계 평균 시간이 약 55일이라고 설명한다.
또한 팔로알토는 AI 기업, 소프트웨어 공급업체, 오픈소스 관계자, 운영기술(OT) 조직을 연결하는 **프론티어 AI 핵심 방어 프로그램(Frontier AI Critical Defense Program)**을 발표했다. 공개된 참여 기관에는 앤트로픽, 오픈AI, IBM, 레드햇, 마이크로소프트, 지멘스, 미쓰비시 일렉트릭, 액시스 커뮤니케이션스 등이 포함된다.
가상 패치는 취약한 서비스로 들어오는 트래픽을 네트워크 제어 장비가 식별하고 차단할 수 있을 때 특히 유용하다. 다만 이는 어디까지나 보완 통제 수단이다. 취약한 코드 자체를 고치는 대체재는 아니다. 근본적인 해결을 위해서는 해당 소프트웨어의 담당자가 취약점의 원인을 파악하고 코드를 수정한 뒤, 테스트와 배포를 거쳐 영향을 받은 시스템에 실제 수정본이 적용됐는지 확인해야 한다.
AI가 취약점을 찾아내는 속도가 빨라질수록 이 차이는 더욱 중요해진다. 네트워크 제어는 당장의 노출을 줄일 수 있지만, 애플리케이션 전체나 소프트웨어 공급망 곳곳에 존재하는 취약한 코드를 없애주지는 않는다.
방어 측의 진전은 공격자 역시 AI를 활용하고 있다는 증거와 동시에 나타나고 있다. 구글 위협 인텔리전스 그룹(GTIG)은 AI로 개발된 것으로 추정되는 제로데이 익스플로잇을 공격자가 실제로 사용하려 한 첫 사례를 확인했다고 보고했다. 해당 공격자는 이를 대규모 공격에 활용할 계획이었지만, 구글은 선제적인 역탐지(counter-discovery)가 공격을 막는 데 기여했을 수 있다고 밝혔다.
보고된 익스플로잇은 널리 사용되는 오픈소스 웹 관리 도구의 2단계 인증(2FA) 우회 취약점을 노렸다. 분석에서는 교육용 주석과 존재하지 않는 취약점에 대한 CVSS 점수 등, 대규모 언어 모델이 개발을 지원했을 가능성을 시사하는 단서가 제시됐다.
물론 AI가 생성한 모든 취약점이 곧바로 실제 공격으로 이어진다는 뜻은 아니다. 다만 코드가 복잡하거나 연구 인력이 부족하고, 취약점이 발견된 뒤 패치가 나오기까지 시간이 오래 걸린다는 사실이 방어자에게 안정적인 대응 시간을 보장해주지는 않는다는 의미다.
클라우드 보안 연합(CSA)의 경고가 중요한 이유도 여기에 있다. AI는 취약점 발견의 속도와 규모를 기존의 공개·패치 체계가 처리할 수 있는 수준보다 빠르게 키우고 있다. 발견 건수가 늘어나는 것만으로 보안이 좋아지지는 않는다. 조직이 이를 분류하고, 공개를 조정하고, 수정본을 만들고, 안전하게 보호 조치를 배포할 역량을 갖춰야 한다.
취약점 탐지 모델 하나를 도입하는 것만으로는 충분하지 않다. 우위를 확보할 수 있는 조직은 발견 결과를 보안 운영의 다음 단계와 연결한다.
AVDH는 자동화된 광범위 탐색을 인간의 판단과 익스플로잇 검증에 연결하는 방식의 가치를 보여준다. NOVA는 전통적인 보안팀이 감당하도록 설계되지 않은 규모의 발견 결과가 쏟아질 수 있다는 압력을 보여준다.
새로운 AI 사이버보안 경쟁은 결국 어느 모델이 버그를 가장 많이 찾느냐의 대결이 아니다. 공격자가 취약점을 실제 공격으로 전환하기 전에, 방어자가 탐지부터 완화까지의 전체 순환 고리를 얼마나 빨리 완성하느냐의 경쟁이다.
방어자는 자신이 코드와 배포 파이프라인, 보안 텔레메트리, 네트워크 통제 수단을 관리하고 있을 때 AI의 이점을 살릴 수 있다. 반대로 검증과 책임 주체 지정, 공개, 수정, 배포가 뒤따르지 않는 발견은 문제를 해결하기보다 취약점 목록만 더 크게 만들 수 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
맨디언트의 AVDH는 이틀 만에 검증된 고위험 취약점 100개 이상을 발견했지만, 단일 AI 모델이 코드를 한 번에 읽은 결과가 아니라 전문 에이전트와 인간 전문가가 결합한 다단계 파이프라인의 성과다.
맨디언트의 AVDH는 이틀 만에 검증된 고위험 취약점 100개 이상을 발견했지만, 단일 AI 모델이 코드를 한 번에 읽은 결과가 아니라 전문 에이전트와 인간 전문가가 결합한 다단계 파이프라인의 성과다. 팔로알토 네트웍스의 NOVA는 두 달 동안 오픈소스 프로젝트 3,915개에서 취약점 14,090개를 확인했다고 밝혔지만, 특정 사고 대응을 깊이 검증한 AVDH와는 측정 대상과 운영 방식이 다르다.
AI는 방어자와 공격자 모두의 취약점 연구 속도를 높이고 있다. 앞으로의 경쟁력은 더 많이 찾는 능력보다 검증·공개·가상 패치·코드 수정까지 연결하는 실행력에 달려 있다.