오픈AI는 GPT 6 Astra가 GPT 5.6 Sol보다 사실 오류를 덜 내고, 장기·다회차 공격을 포함한 탈옥 및 프롬프트 인젝션에 훨씬 강하다고 밝혔다. Gray Swan의 IPI Arena는 13개 프런티어 모델, 41개 에이전트 시나리오, 27만 2,000건 이상의 공격 시도에서 테스트 대상 모델 중 간접 프롬프트 인젝션에 면역인 모델은 없었다고 보고했다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
오픈AI의 자체 평가에 따르면 GPT-6 Astra는 GPT-5.6 Sol보다 안전성 측면에서 의미 있는 진전을 보였다. 사실 오류가 줄었고, 프롬프트 인젝션에 더 강해졌으며, 여러 차례 대화를 거치며 전개되는 공격을 포함한 탈옥(jailbreak)에도 훨씬 견고하다는 설명이다. 25
30
다만 모델 자체의 방어력이 개선됐다고 해서, 에이전트가 읽는 웹페이지·문서·이메일·코드 저장소·도구 출력에 숨은 악성 지시를 완전히 차단할 수 있는 것은 아니다. Gray Swan의 간접 프롬프트 인젝션(IPI) 테스트에서는 시험 대상 모델 가운데 면역인 모델이 없었다. 4
오픈AI는 Astra가 GPT-5.6 Sol보다 탈옥 공격에 현저히 강하다고 밝혔다. 여기에는 공격자가 한 번의 노골적인 명령으로 끝내지 않고, 대화와 작업의 맥락을 쌓아 가며 전략을 바꾸는 장기 공격 경로도 포함된다. 25
또한 오픈AI는 웹 탐색 및 업무 환경에서의 프롬프트 인젝션 방어력이 높아졌고, Sol보다 사실 오류도 적다고 보고했다. 다만 사실성 비교는 해석에 주의할 필요가 있다. 보고된 오류 재현 평가는 사용자가 이미 ‘틀렸다’고 표시한 대화를 대상으로 하므로, 일상적 사용에서의 일반적인 환각률을 그대로 나타내는 지표는 아니다. 25
30
이런 개선은 조사, 코딩, 웹 탐색, 다단계 업무를 수행하는 에이전트에 특히 중요하다. 오픈AI의 릴리스 노트에 따르면 Astra는 복잡한 다단계 작업을 지원하고, 사용자의 템플릿과 지시에 맞춰 문서·스프레드시트·프레젠테이션을 만들 수 있다. 19
현재 제공된 근거만으로 Astra가 Anthropic의 Claude Opus 5보다 사실성, 직접 탈옥 방어, 간접 프롬프트 인젝션 방어에서 전반적으로 더 안전하다고 결론 내릴 수는 없다.
서로 다른 모델을 공정하게 비교하려면 동일한 테스트 세트, 같은 에이전트 도구, 일치하는 시스템 지시, 통일된 공격 성공 기준, 비슷한 수준의 적응형 공격 조건이 필요하다. 벤더별 평가와 공개 레드팀 대회는 이 조건들이 제각각일 수 있다. Gray Swan 자료에는 Claude Opus 5가 Arena에서 제공되는 모델로 언급되지만, Astra와 Opus 5를 같은 조건에서 직접 대조한 점수표는 제공되지 않았다. 1
4
따라서 확실히 말할 수 있는 범위는 더 좁다. 오픈AI의 가장 강한 근거는 Astra가 자사 전작인 GPT-5.6 Sol보다 개선됐다는 점이다.
직접 탈옥은 공격자가 모델에 보이는 형태로 지시를 입력하며 규칙을 무력화하거나 금지된 행동을 유도하려는 공격이다. 장기 공격 경로에 대한 Astra의 개선은 이런 끈질기고 적응적인 공격자에 특히 관련이 있다. 25
반면 간접 프롬프트 인젝션은 에이전트가 소비하는 콘텐츠 안에 숨어 들어온다. 공격자는 웹페이지, 이메일, 문서, 검색 결과, 코딩 작업 기록, 도구 출력 등에 악성 지시를 심어, 에이전트가 사용자의 원래 목적에서 벗어나도록 유도한다. Gray Swan의 IPI 챌린지는 웹 콘텐츠·도구 출력·코딩 에이전트 기록처럼 현실적인 환경에 숨은 프롬프트를 다뤘다. 5
핵심은 에이전트 운영자가 그 악성 지시를 아예 보지 못할 수도 있다는 점이다.
Gray Swan은 IPI Arena에서 13개 프런티어 모델, 레드팀 참가자 464명, 41개 시나리오, 27만 2,000건 이상의 공격 시도를 테스트했다고 밝혔다. 결론은 테스트 대상 모델 중 간접 프롬프트 인젝션에 면역인 모델은 없었다는 것이다. 4
이는 에이전트 배포 환경에서 IPI가 아직 해결되지 않은 문제라는 강한 신호다. 그러나 모든 안전성 차원을 포괄하는 완전한 벤더 중립 순위표는 아니다. 이 결과만으로 모든 모델의 실패율이 같다고 볼 수 없고, 사실성이나 직접 탈옥 방어에 대한 모델별 평가를 대체하는 것도 아니다.
독립형 챗봇이라면 인젝션 공격의 결과가 그럴듯하지만 잘못된 답변에 그칠 수 있다. 그러나 기업 시스템에 연결된 에이전트는 영향 범위가 훨씬 넓다.
오픈AI는 Astra가 자사의 Preparedness Framework에서 사이버보안 역량 ‘Critical’ 기준에 도달했다고 분류한다. 적절한 도구와 접근 권한이 주어지면, 사람의 단계별 지시 없이도 방어가 잘 된 여러 시스템에서 알려지지 않은 취약점을 찾아내고 악용 방식을 개발할 수 있다는 의미다. 27
이 능력은 승인된 보안 방어 업무에는 유용할 수 있다. 하지만 에이전트 워크플로가 손상될 경우의 결과도 커진다. 신뢰할 수 없는 콘텐츠가 에이전트의 목표를 바꾼다면, 공격자는 에이전트가 무엇을 검색하는지, 어떤 도구를 호출하는지, 어떤 행동을 제안하는지에 영향을 주려 할 수 있다. 민감 데이터, 코드 저장소, 클라우드 환경, 브라우저, 업무용 애플리케이션에 대한 접근 권한이 클수록 위험도 상승한다.
프롬프트 인젝션 방어력은 보안 경계 자체가 아니라 여러 방어층 가운데 하나로 다뤄야 한다. 영향이 큰 에이전트 업무라면 조직은 다음을 고려할 필요가 있다.
오픈AI 역시 더 강력한 격리, 제한된 네트워크·도구 접근, 모니터링, 샌드박스 실행을 고성능 시스템의 안전장치로 제시했다. 34
Astra는 사실 오류를 줄이고 직접 탈옥 공격에 대한 방어력을 높였다는 점에서 GPT-5.6 Sol보다 한 단계 강한 후속 모델로 볼 수 있다. 25
30 그러나 제공된 자료에는 Astra가 Claude Opus 5보다 모든 환경에서 단정적으로 더 안전하다는 근거가 없으며, 간접 프롬프트 인젝션은 에이전트 생태계 전반에 남아 있는 실질적 약점이다.
4
기업의 실무적 결론은 분명하다. 더 강한 모델을 선택하되, 악성 문서나 웹페이지가 모델의 능력과 연결된 도구를 공격자의 제어 통로로 바꾸지 못하도록 주변 시스템을 설계해야 한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
오픈AI는 GPT 6 Astra가 GPT 5.6 Sol보다 사실 오류를 덜 내고, 장기·다회차 공격을 포함한 탈옥 및 프롬프트 인젝션에 훨씬 강하다고 밝혔다.
오픈AI는 GPT 6 Astra가 GPT 5.6 Sol보다 사실 오류를 덜 내고, 장기·다회차 공격을 포함한 탈옥 및 프롬프트 인젝션에 훨씬 강하다고 밝혔다. Gray Swan의 IPI Arena는 13개 프런티어 모델, 41개 에이전트 시나리오, 27만 2,000건 이상의 공격 시도에서 테스트 대상 모델 중 간접 프롬프트 인젝션에 면역인 모델은 없었다고 보고했다.
제공된 자료만으로는 Astra와 Anthropic의 Claude Opus 5 사이의 사실성·탈옥 방어력을 동일 조건에서 확정적으로 순위 매길 수 없다.