404 Media는 2026년 9월 15일, OpenAI의 ‘프로젝트 릴리’에서 시간당 50달러 이상을 받는 수백 명의 외주 인력이 실제 소비자용 ChatGPT 대화를 평가한다고 보도했다. 보도에 따르면 평가자들은 이용자 의도를 요약하고 후보 답변 4개를 비교해 1 7점으로 채점하며, AI 말투·사실 오류·과도한 맞장구·안전 문제 등을 표시한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did the 404 Media investigation published on September 15, 2026, reveal about OpenAI’s secret “Project Lily,” including how hundreds of. Article summary: 404 Media reported that OpenAI’s internal “Project Lily” uses a large outsourced human-feedback operation to improve ChatGPT using real consumer conversations—not merely public web data or synthetic tests. The report is . Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
404 Media의 조사 보도에 따르면, OpenAI 내부 프로그램으로 불린 **‘프로젝트 릴리(Project Lily)’**는 실제 소비자용 ChatGPT 대화를 바탕으로 답변 품질을 개선하는 인간 피드백 작업을 포함한다. 유출된 내부 자료와 대화 사례, 회사 측 설명을 검토한 이 매체는 외주 평가 인력이 민감한 개인정보가 담긴 대화 맥락까지 읽을 수 있다고 보도했다. 1
개인적인 고민, 건강, 연애·가족 문제, 법률 또는 업무 관련 질문을 ChatGPT에 입력하는 이용자라면 한 가지를 구분할 필요가 있다. 채팅창에 ‘우리끼리만 보자’고 적는 것은 접근을 막는 개인정보 설정이 아니다. 중요한 것은 계정에서 새 대화를 모델 개선에 사용하도록 허용했는지다. 1
404 Media에 따르면 인력업체를 통해 고용되고 시간당 50달러 이상을 받는 수백 명의 외주 인력이 실제 ChatGPT 대화를 대규모로 검토한다. 이들에게 배정되는 업무에는 다음이 포함된 것으로 전해졌다.
평가 기준은 ChatGPT의 답변을 더 자연스럽고 신뢰할 만하게 만드는 데 초점이 맞춰져 있다. 보도에 따르면 평가자들은 부자연스러운 ‘AI 말투’, 사실과 다른 주장, 지나치게 이용자에게 맞장구치는 표현, 안전상 문제, 모델이 개인적 경험이나 감정을 가진 듯 말하는 답변 등을 표시하도록 안내받는다. 1
이런 피드백은 기계적이지 않은 답변을 만드는 데 쓰일 수 있다. 그러나 품질 개선 과정에서 사람이 이용자 대화의 실질적 내용을 볼 가능성이 생긴다는 뜻이기도 하다. 1
OpenAI는 404 Media에 사용자 이름을 제거하고, 자료가 평가자에게 전달되기 전에 개인정보 필터를 적용한다고 밝혔다. 다만 이 매체는 검토 자료에 전체 대화 맥락과 모델이 생성한 메모리 요약이 포함될 수 있는 사례를 확인했다고 보도했다. 해당 요약에는 대략적인 위치, 직업, 매우 개인적인 사정 같은 정보가 담긴 것으로 전해졌다. 1
문제는 맥락을 통한 식별 가능성이다. 계정 이름이나 식별자가 빠져도, 특정한 삶의 사건·업무 정보·지역·드문 표현이 결합하면 지인에게 당사자가 떠오를 수 있고, 그 자체로 노출하기 민감한 정보가 될 수 있다. 404 Media는 OpenAI도 흔치 않은 식별자나 문맥에 따라 의미가 달라지는 모호한 사적 언급은 필터가 잡아내기 어려울 수 있음을 인정했다고 전했다. 1
ChatGPT에 대화를 비밀로 해 달라고 요청하는 것은 대화 안의 지시일 뿐, 계정의 데이터 이용 설정은 아니다. 이런 문구가 서비스의 데이터 사용 설정을 바꾸거나, 해당 대화가 404 Media가 보도한 개선 절차의 대상이 되는 것을 차단하지는 않는다. 1
따라서 소비자용 챗봇은 대화가 친밀하게 느껴진다는 이유만으로 기밀 통신 수단처럼 여겨서는 안 된다. 승인된 평가자에게 공개돼도 곤란할 정보라면, 모델 개선이 켜진 개인 워크스페이스에는 입력하지 않는 편이 안전하다.
OpenAI의 데이터 제어 안내에 따르면 개인 워크스페이스 이용자는 다음 경로에서 모델 개선 사용을 끌 수 있다.
이 설정을 끄면 새 대화는 채팅 기록에 남지만, ChatGPT 모델의 학습이나 개선에는 사용되지 않는다. 설정은 특정 기기가 아니라 계정 전체에 적용된다.
시점도 중요하다. OpenAI는 이 선택 해제가 새 대화에만 적용된다고 설명한다. 모델 개선이 켜져 있던 때 이미 제출된 대화까지 소급해 제거하는 것은 아니다.
OpenAI는 ChatGPT Business, Enterprise, Edu 및 API 플랫폼의 입력·출력 데이터는 기본적으로 모델 학습에 사용하지 않는다고 밝히고 있다. 반면 개인 워크스페이스의 ChatGPT Free, Plus, Pro 이용자는 기본적으로 모델 개선용 데이터 공유가 활성화돼 있으며, 데이터 제어에서 해제할 수 있다.
이 차이가 조직의 모든 데이터 거버넌스 의무를 없애 주는 것은 아니다. 회사나 학교의 내부 정책을 따라야 하고, 자신이 속한 워크스페이스의 구체적 설정도 확인해야 한다. 다만 소비자용 개인 대화의 기본 처리 방식과는 중요한 차이가 있다.
사람이 AI 품질 개선에 참여하는 방식은 OpenAI만의 사례가 아니다. Anthropic의 개인정보 처리방침은 이용자나 크라우드워커가 제공한 입력·출력을, 이용자가 거부하지 않는 한 모델 학습·개선에 사용할 수 있다고 명시한다. 주요 AI 제공사의 개인정보 관행을 검토한 학술 연구도 Google과 OpenAI가 사용자 채팅의 인간 검토를 모델 학습 또는 개선 맥락에서 언급한다고 분석했다.
핵심은 인간 피드백 자체의 존재 여부만이 아니다. 어떤 대화가 그 과정에 들어갈 수 있는지, 비식별화가 무엇을 보호하고 무엇을 보장하지 못하는지, 그리고 이용자가 적용되는 설정을 어떻게 바꿀 수 있는지를 이용자가 분명히 아는지가 중요하다.
404 Media가 보도한 ‘프로젝트 릴리’는 소비자용 AI 채팅이 자동으로 비밀이 보장되는 일대일 대화는 아니라는 점을 다시 일깨운다. 비식별화 조치는 노출 위험을 줄일 수 있지만, 개인적 맥락이 풍부한 대화에서 드러나는 정보를 모두 없애지는 못할 수 있다. 1
ChatGPT에 민감한 정보를 입력하기 전 **설정 → 데이터 제어 → ‘모두를 위한 모델 개선’**을 확인하는 것이 좋다. 이 기능이 켜져 있다면 새 대화가 서비스 개선에 쓰일 수 있다고 보고, 꺼져 있다면 OpenAI의 설명에 따라 새 대화는 해당 목적으로 사용되지 않는다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
404 Media는 2026년 9월 15일, OpenAI의 ‘프로젝트 릴리’에서 시간당 50달러 이상을 받는 수백 명의 외주 인력이 실제 소비자용 ChatGPT 대화를 평가한다고 보도했다.
404 Media는 2026년 9월 15일, OpenAI의 ‘프로젝트 릴리’에서 시간당 50달러 이상을 받는 수백 명의 외주 인력이 실제 소비자용 ChatGPT 대화를 평가한다고 보도했다. 보도에 따르면 평가자들은 이용자 의도를 요약하고 후보 답변 4개를 비교해 1 7점으로 채점하며, AI 말투·사실 오류·과도한 맞장구·안전 문제 등을 표시한다.
OpenAI는 사용자 이름을 제거하고 개인정보 필터를 적용한다고 밝혔지만, 대화 맥락과 메모리 요약에는 대략적 위치·직업·개인 사정 등 민감한 정보가 남을 수 있다고 404 Media는 전했다.