앤트로픽의 2026년 9월 평가에서 중국 Z.ai의 오픈 웨이트 모델 GLM-5.3은 한 익스플로잇 시험에서 클로드 미토스 프리뷰와 가까운 결과를 냈다. 그러나 같은 평가에서 간단한 기법으로 GLM-5.3의 안전장치를 우회할 수 있었고, 이 결과들은 모두 통제된 시험에 관한 것이다. 실제 표적을 공격해 침해했다는 증거로 해석해서는 안 된다.
12
한 가지 익스플로잇 시험에서 미토스 프리뷰에 근접
앤트로픽의 익스플로잇벤치 시험에서 GLM-5.3은 410회 시도 가운데 50회 작동하는 익스플로잇을 만들었다. 클로드 미토스 프리뷰는 56회 성공했다. 비율로 환산하면 각각 약 12%, 14%다. 이 벤치마크는 알려진 취약점을 대상으로 통제된 환경에서 익스플로잇 개발 능력을 평가한다. 따라서 이 점수만으로 두 모델이 사이버 보안의 모든 과제에서 동등하다고 볼 수는 없다.
5
12
앤트로픽은 GLM-5.3의 엔드투엔드 익스플로잇 개발 능력이 이전 모델보다 크게 발전했다고 평가했다. 별도의 바이너리 익스플로잇 시험에서는 완전한 제어 흐름 탈취가 GLM-5.3 과제의 4%, 미토스 프리뷰 과제의 6%에서 나타났다. 이 결과 역시 특정 시험에서의 성능을 보여줄 뿐, 모든 작업에서의 전반적인 동등성을 뜻하지 않는다.
3
7
12
NIST의 평가는 더 넓은 범위를 봤다
미국 국립표준기술연구소(NIST)의 인공지능 표준·혁신센터(CAISI)는 GLM-5.3을 자체 평가한 오픈 웨이트 모델 가운데 사이버 역량이 가장 뛰어난 모델로 꼽았다. 다만 여러 사이버 벤치마크를 종합한 결과, 현재 미국의 최첨단 모델 수준보다 약 4개월 뒤처진다고 평가했다.
17
두 평가가 상반된 결론을 내렸다고 볼 필요는 없다. 앤트로픽이 강조한 결과는 미토스 프리뷰와 특정 익스플로잇 시험에서 비교한 것이고, NIST는 더 다양한 벤치마크를 종합해 평가했다. 시험 범위와 비교 대상이 다르면 결과도 달라질 수 있다.
12
17
시뮬레이션에서는 안전장치 우회가 가능했다
앤트로픽은 간단한 기법들이 시뮬레이션 시험에서 GLM-5.3의 안전장치를 64~100%의 비율로 우회했다고 보고했다. 이 수치는 평가에 사용한 프롬프트와 방법의 시험 결과이지, 현실의 공격자가 실제 작전에서 성공할 확률은 아니다.
12
오픈 웨이트 모델의 특성도 별도의 쟁점이다. 모델의 가중치를 이용할 수 있으면 단순히 프롬프트로 거부 응답을 피해 가는 것뿐 아니라, 거부 동작 자체를 바꾸려는 시도도 가능해질 수 있다. 관련 실험을 소개한 2차 보도는 안전장치를 제거하는 데 숙련된 팀이 약 1,200달러를 들일 수 있다는 추정과, 작업에 약 4,400달러의 연산 비용이 들었다는 계산을 함께 전했다. 서로 다른 작업 조건을 설명한 추정치인 만큼 고정 비용이나 현실 공격의 빈도를 나타내는 수치로 봐서는 안 된다.
12
25
공개된 취약점을 이용한 시연
앤트로픽이 소개한 한 실험에서는 연구자가 더 작은 모델인 GLM-5.3-Flash를 사용해 이미 공개된 취약점 두 개를 잇는 익스플로잇 체인을 만들었다. 보고된 작업에는 사람의 주의가 필요한 시간이 약 20분, 모델 작업 시간이 8시간 걸렸고 API 비용은 20.40달러였다. 취약점 가운데 하나는 크롬과 관련된 것이었으며, 연구자는 이미 알려진 결함에 관한 공개 정보를 모델에 제공했다. 이는 공개된 취약점을 상대로 시험 환경에서 체인을 개발할 수 있음을 보여준 사례이지, 실제 피해자의 시스템이 침해됐다는 뜻은 아니다.
6
시험 환경에서 익스플로잇을 만들어내는 능력은 악용 가능성을 우려하게 하는 신호다. 하지만 실제 환경에서 공격을 수행해 성공한 것과는 구분해야 한다. 여기서 확인된 보도만으로는 GLM-5.3이 현실의 표적을 침해하는 데 사용됐다고 결론 내릴 수 없다.
5
6
오픈 웨이트 모델을 둘러싼 접근성 논쟁
오픈 웨이트 모델은 학습된 가중치를 이용할 수 있어 사용자가 직접 실행하거나 수정할 수 있는 모델을 말한다. 앤트로픽은 익스플로잇 개발 역량이 널리 이용 가능해지면 공격자뿐 아니라 방어자에게도 영향이 생긴다고 우려한다. 한편 회사는 방어자가 취약점을 찾아 고칠 수 있도록 고급 모델에 접근할 기회를 제공해야 한다는 입장도 내놓았다.
1
12
가중치 공개에는 상충하는 측면이 있다. 독립 연구자와 보안 방어자가 모델을 활용할 수 있는 길을 넓히는 동시에, 개발사가 설정한 통제 밖에서 모델을 실행하거나 수정할 여지도 커진다. 이번 벤치마크와 안전장치 시험은 이 논쟁에 참고가 되지만, 접근을 제한하는 것이 전체 사이버 보안을 더 안전하게 만든다는 결론까지 입증하지는 않는다.
4
12
핵심은 범위를 좁혀 보는 것이다. 앤트로픽의 특정 익스플로잇 시험에서 GLM-5.3은 미토스 프리뷰에 근접했고, 시험된 우회 기법에는 안전장치가 취약했다. 반면 NIST의 더 폭넓은 평가는 GLM-5.3이 현재 미국 최첨단 모델보다 뒤처진다고 봤으며, 공개된 시연은 실제 표적을 상대로 한 공격이 아니었다.
12
17