OpenAI의 Private Safety Processing은 적격 API 고객의 제로 데이터 보존(ZDR) 환경에서 여러 상호작용에 걸친 악용 패턴을 자동으로 탐지하는 미리보기 시스템이다. 악성 요청을 여러 계정·세션·요청으로 나누는 방식까지 분석하지만, OpenAI가 받는 것은 대화 원문이 아닌 제한적인 안전 경보 신호라고 회사는 설명한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s Private Safety Processing system, previewed in August 2026, how does it monitor coordinated misuse across multiple AI-model. Article summary: Private Safety Processing is OpenAI’s previewed safety architecture for eligible zero-data-retention (ZDR) API deployments: it is intended to detect harmful patterns spanning related requests without giving OpenAI staff . Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI가 기업용 API 고객을 대상으로 Private Safety Processing이라는 안전 아키텍처를 미리 공개했다. 대상은 **제로 데이터 보존(Zero Data Retention·ZDR)**을 적용받는 적격 API 배포 환경이다. 핵심은 간단하다. 여러 요청에 흩어진 악용 패턴은 찾아내되, OpenAI 직원이 고객의 프롬프트와 모델 응답 원문을 기본적으로 볼 수 없도록 설계한다는 것이다.
이 방식이 필요한 이유는 AI 모델이 한 번의 질문을 넘어 여러 단계에 걸친 긴 작업을 수행하게 됐기 때문이다. 예를 들어 악의적인 사용자가 하나의 위험한 목표를 여러 계정·세션·요청으로 나누면, 개별 요청만 보는 필터에서는 전체 맥락이 드러나지 않을 수 있다. Private Safety Processing은 이런 분산된 상호작용 사이의 관계를 분석해, 가드레일을 우회하거나 악성코드 개발 작업을 여러 요청으로 쪼개는 시도 등을 식별하려는 시스템이다.
기존의 ZDR 안전장치는 요청과 응답을 대체로 개별 상호작용 단위로 평가한다. 반면 Private Safety Processing은 자동화된 시스템을 이용해 서로 관련된 여러 상호작용을 함께 살핀다. 즉, 데이터를 장기간 보관해 사람이 대화를 읽는 방식이 아니라, 자동화된 분석 범위를 단일 요청에서 여러 연관 요청으로 넓히는 접근이다.
여기서 중요한 구분은 분석과 보존이 다르다는 점이다. OpenAI는 관련 활동을 안전 목적으로 분석할 수 있지만, 시스템을 통해 OpenAI 직원에게 원래의 고객 콘텐츠가 노출되지는 않는다고 설명한다.
OpenAI가 제시한 ZDR 배포 방식은 크게 두 가지다.
두 경우 모두 자동화된 시스템이 잠재적 악용 여부를 판단하고, 원래의 프롬프트나 응답을 공개하지 않은 채 제한적인 안전 신호만 반환하도록 설계된다.
OpenAI의 설명에 따르면 회사에 전달되는 것은 활동의 유형을 나타내는 범위가 좁은 경보다. 회사의 시스템 도식은 이를 대화 내용 자체가 아니라 경보 범주와 심각도에 해당하는 정보로 표시한다.
작동 흐름은 다음과 같다.
따라서 안전 경보가 발생했다는 사실은 OpenAI에 전체 세션 기록이 전송된다는 뜻이 아니다. 다만 아직 미리보기 단계인 만큼, 실제 도입을 검토하는 기업은 탐지 기준, 오탐 처리, 이의 제기 절차와 세부 구현을 확인해야 한다. OpenAI는 2026년 9월부터 더 폭넓게 출시하고 기술 백서를 공개할 계획이라고 밝혔다.
OpenAI는 설명된 ZDR 구조에서 고객 콘텐츠를 보존하지 않으며, OpenAI가 호스팅하는 저장 방식을 선택하더라도 고객이 통제하는 복호화 키를 OpenAI 직원이 보유하지 않는다고 말한다. 따라서 안전 경보만으로 직원에게 해당 대화에 대한 접근 권한이 자동 부여되지는 않는다.
고객은 제재 조치에 이의를 제기하거나 정상적인 사용임을 설명하거나, 확인된 악용 사례의 조사를 돕기 위해 관련 자료를 자발적으로 공유할 수 있다. 그러나 고객이 자료를 직접 제공하지 않는 한 OpenAI에 전달되는 것은 기계가 생성한 제한적 안전 정보에 그친다는 설명이다.
이 구조는 고객이 통제하는 증거와 서비스 제공업체가 받는 위험 신호를 분리한다. 공급자가 처리해야 하는 민감한 원문 데이터의 양을 줄이면서도, 요청을 하나씩만 검사하는 필터가 놓칠 수 있는 장기적·조직적 악용 패턴을 탐지하려는 셈이다.
OpenAI는 Glean, Databricks, Abridge, Microsoft를 미리보기 시스템을 설계하거나 테스트하는 초기 고객으로 언급했다. 별도 보도에서도 Microsoft와 Databricks가 초기 테스트에 참여한 고객으로 거론됐다.
이 기능은 일반 소비자용 설정이라기보다, 프롬프트와 모델 출력을 엄격하게 통제해야 하는 적격 API 배포 환경을 겨냥한다. 금융·의료·법률 등 민감한 업무에 고성능 모델을 도입하려는 기업이 주요 대상이다.
Anthropic의 Covered Models 정책은 다른 선택을 한다. Claude의 특정 고성능 모델군, 즉 Mythos 클래스와 향후 회사가 Covered Models로 지정하는 모델에 제출된 프롬프트와 생성된 출력은 안전성 작업을 위해 30일간 보존된다. 이 과정에는 통제된 사람의 검토가 포함될 수 있다.
Anthropic은 고객의 명시적 허가 없이는 보존된 데이터를 모델 학습에 사용하지 않는다고 설명한다. 하지만 해당 모델은 ZDR로 제공되지 않으며, 안전성 검토를 위한 30일 보존 요건이 적용된다.
두 회사의 실무상 차이는 다음과 같다.
어느 쪽도 고객사의 내부 거버넌스를 대신해 주지는 않는다. 기업은 모델과 배포 방식의 ZDR 적격 여부, 데이터 처리 위치, 암호화 키의 통제 주체, 경보에 포함되는 구체적인 필드, 감사 및 이의 제기 절차, 보존·검토 조건을 계약 전에 확인해야 한다.
금융사는 금융 기록과 거래 정보를, 의료기관은 환자 관련 정보를, 법률회사는 변호사-의뢰인 비밀이나 고객 기밀을 다룰 수 있다. 이처럼 프롬프트에 민감한 정보가 포함될 수 있는 조직에서는 공급자가 데이터를 보존하고 사람이 검토할 수 있는지가 데이터 최소화, 접근통제, 데이터 국외 이전, 감사 설계와 공급업체 위험 평가에 직접 영향을 준다.
그렇다고 Anthropic의 30일 보존이 자동으로 금지되거나, OpenAI의 ZDR만으로 규제 준수가 보장되는 것은 아니다. 다만 두 설계가 보안·법무팀에 서로 다른 검토 과제를 제시한다는 의미다. Anthropic 방식은 공급자의 보존과 검토 가능성을 관리해야 하고, OpenAI는 ZDR과 Private Safety Processing을 통해 공급자가 고객 원문에 접근하는 일을 제한하는 방향을 내세운다.
기업 구매자가 확인해야 할 질문은 구체적이다.
Private Safety Processing은 개인정보 보호를 단순한 약관이 아니라 AI 안전 제품의 기능으로 끌어올린다. 이제 경쟁의 기준은 위험한 요청 하나를 차단할 수 있는지만이 아니다. 더 긴 작업 흐름에서 여러 대화로 분산된 악용을 찾아내면서도, 공급자가 모든 고객 대화에 접근하지 않아도 되는지가 핵심이 됐다.
OpenAI는 고객이 통제하는 인프라 또는 고객이 관리하는 키로 보호되는 저장 구조를 유지하고, 자동화 시스템으로 상호작용 간 패턴을 분석한 뒤, 좁은 범위의 위험 분류만 공급자에게 보내는 해법을 제시한다.
Anthropic은 반대로 고성능 모델의 악용을 더 직접적으로 조사할 수 있도록 관련 프롬프트와 응답을 제한된 기간 보존하는 방식을 택했다. 이 차이는 양사가 기업 고객과 고성능 모델 시장에서 어떤 안전성·프라이버시 우선순위를 내세우는지를 보여준다.
시장 경쟁의 압박도 커지고 있다. 보도에 따르면 Anthropic의 2026년 7월 말 연환산 매출 전망치는 650억 달러에 이르렀고, OpenAI의 같은 지표는 400억 달러로 전해졌다. Anthropic의 2026년 2분기 잠정 매출이 115억 달러를 넘어서 OpenAI의 분기 매출을 처음 웃돌았다는 보도도 나왔다. 다만 이는 비상장사의 잠정·비공개 수치에 기반한 보도이며, 공개 감사 실적과는 구분해야 한다.
Anthropic이 2조 달러 수준의 기업가치로 기업공개를 추진할 수 있다는 전망 역시 투자자 기대에 관한 보도이지 확정된 시장 가치가 아니다. 반면 OpenAI가 2026년 6월 비공개 S-1을 제출했다는 주장은 제공된 신뢰도 높은 자료만으로는 확인되지 않는다. 확인 가능한 자료는 오히려 Anthropic의 2026년 6월 비공개 S-1 제출을 가리킨다.
결국 두 회사의 선택은 서로 다른 기업 고객 제안으로 이어진다. OpenAI는 ‘공급자가 원문을 보지 않는 안전성’을, Anthropic은 ‘제한적 보존과 검토를 통한 조사 가능성’을 강조한다. OpenAI가 예고한 기술 백서와 정식 출시가 실제 배포 환경에서 암호화, 경보 범위, 오탐 및 이의 제기 절차를 얼마나 구체적으로 입증할지가 기업 고객의 판단을 가를 전망이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
OpenAI의 Private Safety Processing은 적격 API 고객의 제로 데이터 보존(ZDR) 환경에서 여러 상호작용에 걸친 악용 패턴을 자동으로 탐지하는 미리보기 시스템이다.
OpenAI의 Private Safety Processing은 적격 API 고객의 제로 데이터 보존(ZDR) 환경에서 여러 상호작용에 걸친 악용 패턴을 자동으로 탐지하는 미리보기 시스템이다. 악성 요청을 여러 계정·세션·요청으로 나누는 방식까지 분석하지만, OpenAI가 받는 것은 대화 원문이 아닌 제한적인 안전 경보 신호라고 회사는 설명한다.
Anthropic은 Covered Models의 프롬프트와 출력을 안전성 작업을 위해 30일간 보존하고 통제된 사람의 검토를 허용해, 두 회사는 서로 다른 개인정보 보호와 조사 가능성의 균형을 택하고 있다.