이 주장은 순식간에 입소문을 탔지만, 전체 이야기는 더 복잡합니다. 공개된 증거는 더 좁은 범위(그러나 여전히 중요한)의 발견을 뒷받침하며, 여러 요인으로 인해 Redis 유지보수자와 독립 분석가들은 주장의 광범위한 범위에 의문을 제기하고 있습니다.
Bera Buddies가 게시한 PoC 코드는 두 가지 별개의 익스플로잇 경로를 다룹니다 :
두 익스플로잇 체인 모두 RESTORE 명령이 필요하며, 일부는 EVAL, XGROUP 또는 RedisBloom 모듈도 사용합니다 . Redis는 7월 23일 이러한 결함을 해결하기 위해 7개의 보안 릴리스를 배포했습니다 . 이 익스플로잇은 비파괴적(non-destructive)으로 설명되며 공식 Redis Docker 이미지를 대상으로 공유되었습니다 .
다음과 같은 몇 가지 중요한 요인들이 광범위한 회의론을 불러일으켰습니다:
증거 없는 범위 부풀리기. 공개된 증거는 하나의 심각한 Redis 8.8.0 익스플로잇을 뒷받침할 뿐, 주장된 19개의 제로데이는 아닙니다. 그 숫자와 보고된 일정은 어떤 독립 기관에서도 확인되지 않았습니다 .
확인된 CVE 할당 없음. 27분 만에 발견했다는 주장에는 확인된 CVE 할당이 없습니다. 이는 Redis가 지명된 인간 연구원들에게 귀속시킨 5개의 패치된 CVE(CVE-2026-23479, CVE-2026-25243, CVE-2026-25588, CVE-2026-25589, CVE-2026-23631, 2026년 5월 5일 패치)와는 별개의 사건입니다. 이 두 사건을 혼동하는 것은 보도에서 "가장 큰 오류"로 묘사되었습니다 .
알려진 취약점의 재현. 일부 보도에 따르면 Kimi K3는 "Redis 8.8.0에서 이미 패치된 알려진 Redis 취약점을 재현"한 것으로 묘사됩니다 . 한 분석에서는 에이전트의 테스트가 "새로운 결함을 발견하기보다는 알려진 메모리 안전 문제들을 연결"했다고 지적했습니다 .
실험 중 인터넷 접근. 연구원은 모델이 테스트 중에 인터넷에 접근할 수 있었다고 확인했습니다. 비평가들은 이는 모델이 기존 취약점 정보나 익스플로잇 코드에 접근했을 수 있음을 의미하며, 완전히 자율적인 발견이라는 주장을 약화시킨다고 주장합니다 .
영·미 정부 평가, 첨단 능력 주장과 모순. 영국 AISI / 미국 CAISI의 공동 예비 평가에 따르면 Kimi K3는 자율 사이버 공격 작업에서 **"최신 첨단 사이버 역량 모델보다 현저히 낮은 성능"**을 보였습니다 . 모의 기업 네트워크를 공격하라는 명령을 받았을 때, Kimi K3는 평균적으로 32단계 공격 경로 중 17단계에 도달한 반면, 가장 사이버 역량이 뛰어난 미국 모델은 평균 28.5단계에 도달했습니다 . 모델의 안전장치는 "사이버 착취 시도를 막지 못했습니다" .
독립적으로 검증되지 않음. Shou의 주장은 Redis 유지보수자나 Moonshot AI에 의해 독립적으로 검증되지 않았으며, 해당 주장은 여전히 확인되지 않은 상태입니다 .
Shou의 주장의 정확한 범위와 관계없이, 이 데모는 중요한 시사점을 제공합니다:
익스플로잇 개발 시간의 급격한 단축. AI 에이전트는 소스 코드 검토에서 작동하는 익스플로잇 생성까지의 시간을 급격히 단축시키고 있으며, 이는 방어자가 패치를 확인하고 배포할 수 있는 기간을 크게 단축시킬 수 있습니다 .
오픈 웨이트 모델의 확산 위험. Kimi K3는 7월 27일 전체 공개를 앞둔 2.8조 개의 파라미터를 가진 오픈 웨이트 모델입니다 . API로만 접근 가능한 모델과 달리, 누구나 다운로드하여 미세 조정하고 감독 없이 맞춤 도구에 통합할 수 있어 공격적 사용의 문턱을 낮춥니다 .
최첨단에서의 역량은 아직 미성숙. 영·미 정부 평가와 독립 벤치마크는 현재 자율 익스플로잇 능력이 아직 초기 단계임을 시사합니다 . Kimi K3는 코드 추론 및 취약점 재발견에서 좋은 성능을 보여주지만(전문 벤치마크에서 26개의 알려진 CVE 중 23개를 재발견 ), 현실적인 네트워크를 대상으로 한 전체 체인 자율 공격에서는 최고 모델에 뒤쳐집니다 . 한 독립 테스트에서 Kimi K3는 공격적 사이버 보안 테스트에서 32.2%를 기록, 선도적인 미국 모델의 평균 76.2%의 절반에도 미치지 못했으며, 테스트된 41개의 취약점 중 어떤 것에 대해서도 임의 코드 실행을 달성하지 못했습니다 .
새로운 방어적 긴급성. 이번 데모는 자동화된 패치 우선순위 지정, 실시간 바이너리 분석 도구, 고성능 오픈 웨이트 모델 출시에 대한 더 엄격한 통제에 대한 요구를 가속화했습니다 . 사이버 보안 업계는 이제 취약점에서 익스플로잇까지의 기간이 몇 달에서 몇 분으로 압축되고 , AI 에이전트가 여러 목표를 동시에 기계 속도로 작동할 수 있는 미래에 직면해 있습니다 .