보도에 따르면 OpenAI 관련 프로젝트 릴리에서 AI로 챗GPT 답변을 평가한 계약직 여러 명이 업무에서 제외됐다. 이 작업의 핵심 산출물이 독립적인 인간 판단이기 때문이다. 프로젝트 릴리는 실제 챗GPT 대화와 프롬프트를 검토해 최대 4개의 답변을 1 7점으로 평가하는 방식으로 알려졌다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
404 Media 보도에 따르면, ‘프로젝트 릴리(Project Lily)’는 계약직 검토자가 챗GPT 응답을 직접 읽고 평가해 향후 모델 행동을 개선하는 인간 검토 작업이다. 이런 업무에서 생성형 AI가 평가를 대신하면, 핵심 산출물인 독립적 인간 판단이 사라진다. 그래서 AI로 평가 업무를 수행한 계약직들이 프로젝트에서 제외됐다는 설명이 나온다. 19
20
모델 개선용 데이터는 특정 상황에서 사람이 어느 답변을 더 낫다고 보는지를 구조화해 기록한 ‘선호 데이터’가 될 수 있다. 그러나 모델이 판단을 작성하면, 그 데이터는 더 이상 사람의 선호를 깨끗하게 측정한 결과라고 보기 어렵다.
보도된 업무 흐름에 따르면 검토자는 실제 챗GPT 프롬프트와 경우에 따라 전체 대화를 받는다. 이용자의 의도를 요약하고, 후보 응답들을 비교한 뒤 1~7점 척도로 점수를 매긴다. 한 과제에는 최대 4개의 후보 답변이 제시될 수 있으며, 단순 사실 정확성보다는 말투, 과도한 아첨(시코판시), 지나치게 인간적인 주장 같은 행동 특성이 중점 평가 대상이다. 8
19
프로젝트 릴리에는 수백 명의 외부 검토자가 참여하는 것으로 보도됐다. 이들은 Crossing Hurdles를 통해 모집되고 Mercor를 통해 보수를 받는 것으로 알려졌으며, 한 검토자는 시간당 50달러를 넘게 받는다고 전했다. 다만 1만 명 이상이라는 수치는 프로젝트 릴리만의 인원이 아니라 OpenAI의 전반적인 평가 파이프라인에 걸친 계약직 규모를 가리킨다는 보도다. 19
6
AI 평가자는 빠르고, 내부 테스트처럼 제한된 용도에서는 유용할 수 있다. 하지만 인간 선호 평가와는 다른 질문에 답한다. 모델은 학습 과정에서 익힌 표현, 문체, 가정의 패턴을 되풀이할 가능성이 있다.
특히 동일하거나 밀접하게 관련된 모델의 출력이 다음 모델을 보상하는 판단에 반복 사용되면 순환 고리가 만들어질 수 있다.
그렇다고 AI 평가가 언제나 모델 성능을 떨어뜨린다는 뜻은 아니다. 자동 평가는 인간 판단과의 일치 여부를 검증하고 적용 범위를 명확히 하면 쓸모가 있다. 다만 인간 선호 데이터를 만들기 위해 발주된 일을 AI가 대체한다면, 학습 신호의 독립성이 약해진다. 이것이 보도된 금지 정책의 핵심 이유로 보인다.
보도에 따르면 감독자는 GPTZero 같은 AI 작성 탐지기에 의존하지 말라는 지침을 받았다. 대신 사람이 결과물과 작업 패턴을 검토하면서, 비정상적으로 획일적인 문구, 문장부호·서식의 특징, 비현실적으로 빠른 완료 속도 등을 살피는 방식이었다. 6
물론 이런 신호 하나만으로 AI 사용을 증명할 수는 없다. 숙련된 사람이 빨리 작성할 수도 있고, 비슷한 표현은 공통 평가 기준에서 나올 수도 있다. 따라서 이런 단서는 조사 계기가 될 수는 있어도, 프로젝트 제외를 정당화하는 확정 증거와는 구분돼야 한다.
정확한 판별 기준을 공개하면 우회 방법을 알려주는 셈이 된다. 예컨대 계약직이 문구를 일부 바꾸거나, 일부러 시간을 끌거나, 서식을 조정하면서 실제 판단은 여전히 모델에 맡길 수 있다.
반대로 기준의 비공개는 또 다른 위험을 만든다. 작업자가 품질 판정의 이유를 알 수 없으면 오판을 다투기 어렵다. 지속 가능한 무결성 관리 체계라면 비공개 탐지 기법과 함께 명확한 규칙, 기록된 결정, 실질적인 이의 제기·정정 절차가 필요하다.
Mercor는 이 평가 업무에 AI를 사용하는 행위가 정책 위반이며, 위반이 확인되면 해당 프로젝트에서 즉시 제외한다고 밝힌 것으로 보도됐다. 피드백이나 코멘트를 작성하는 도구를 포함해 AI 보조 사용을 폭넓게 금지했다는 내용도 나왔다. 6
40
의도적으로 낮은 점수를 매겼다는 보도 사례는 더 큰 문제를 드러낸다. 사람이 입력했다는 이유만으로 ‘인간 피드백’의 신뢰성이 자동 보장되지는 않는다. 검토자는 서두를 수 있고, 기준을 오해할 수 있으며, 처리량을 높이려 하거나, 악의적으로 행동하거나, 불투명한 품질 관리 체계를 역이용할 수도 있다.
이는 기술 문제인 동시에 인센티브 문제다. 모델 개발사는 실제 이용자 경험을 더 낫게 예측하는 신중하고 일관된 판단을 원한다. 반면 계약직은 속도, 과제 완료, 업무 탈락 회피에 더 큰 보상을 느낄 수 있다. 두 목표가 어긋나면 데이터에는 잡음이 생기거나 체계적인 왜곡이 들어갈 수 있다.
맥락과 주관성이 중요하거나 자동 검증이 어려운 판단에는 여전히 인간 검토가 필요하다. 다만 개별 점수를 단순히 모으는 방식보다, 여러 점검 장치를 갖춘 시스템으로 운영할 때 효과적이다.
결국 선호 학습의 신뢰도는 선호를 만들어내는 과정의 신뢰도만큼만 높다. 인간 검토자는 품질의 만능 보증이 아니며, 사람의 실제 판단을 배우는 것이 목표인 업무에서 AI가 만든 판단을 그대로 대체재로 쓸 수도 없다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
보도에 따르면 OpenAI 관련 프로젝트 릴리에서 AI로 챗GPT 답변을 평가한 계약직 여러 명이 업무에서 제외됐다. 이 작업의 핵심 산출물이 독립적인 인간 판단이기 때문이다.
보도에 따르면 OpenAI 관련 프로젝트 릴리에서 AI로 챗GPT 답변을 평가한 계약직 여러 명이 업무에서 제외됐다. 이 작업의 핵심 산출물이 독립적인 인간 판단이기 때문이다. 프로젝트 릴리는 실제 챗GPT 대화와 프롬프트를 검토해 최대 4개의 답변을 1 7점으로 평가하는 방식으로 알려졌다. 프로젝트 규모는 수백 명이며, 1만 명 이상이라는 수치는 OpenAI 전반의 평가 인력망을 가리킨다.
이번 사안은 ‘사람이 입력한 피드백’도 자동으로 신뢰할 수 없다는 점을 보여준다. 속도와 물량 중심의 보상 체계, 악의적 평가, 불명확한 품질 판정은 인간 피드백 학습의 취약점이 될 수 있다.