OpenAI가 AI를 사용해 자사 모델 평가 업무를 수행한 계약직 인력 여러 명을 업무에서 제외한 것으로 보도됐다. 핵심은 ‘AI 회사에서 AI를 썼다’는 역설이 아니다. 해당 업무는 ChatGPT 답변에 대한 사람의 독립적인 판단을 얻기 위한 것이기 때문이다. 다만 제외된 인력 모두가 아래에 설명하는 ‘프로젝트 릴리(Project Lily)’ 소속이었다고 확인된 것은 아니다.
16
13
프로젝트 릴리에서는 무엇을 평가하나
보도에 따르면 프로젝트 릴리에서는 외부 계약직 평가자 수백 명이 실제 ChatGPT 이용자의 질문을 검토하며, 경우에 따라 질문 전후의 대화도 읽는다. 평가자는 Crossing Hurdles를 통해 모집되고 Mercor를 통해 보수를 받는 것으로 전해졌다. 한 평가자는 시급이 50달러를 넘는다고 밝혔지만, 이를 모든 평가자의 보수로 일반화할 수는 없다.
2
20
평가자는 먼저 이용자가 무엇을 하려 했는지 요약한 뒤, 최대 네 개의 ChatGPT 후보 답변을 비평하고 1~7점 척도로 평가한다. 지나치게 기계적인 표현이나 이용자 말에 과하게 동조하는 태도 등도 살핀다. 점수와 서면 평가는 향후 모델의 답변 방식을 개선하는 데 쓰이도록 마련된 피드백이다.
4
11
3
1
AI가 대신 쓴 평가가 왜 문제인가
사람은 답변이 이용자의 요청에 맞는지, 말투가 적절한지, 무조건 맞장구치지는 않는지 독립적으로 판단할 수 있다. 반면 다른 AI가 비평을 쓰거나 점수를 고르게 하면, 피드백에 사람의 판단 대신 AI가 생성한 선호가 반영될 수 있다. 이는 피드백의 가치를 떨어뜨릴 위험이지, 특정 평가가 실제로 모델을 해쳤다는 증거는 아니다.
4
16
보도된 업무 지침은 평가나 피드백 작성에 AI를 사용하는 것을 금지하며, Grammarly와 AI 번역 기능도 금지 대상에 포함한다. 다른 계약직의 작업을 점검하는 평가자에게는 신뢰하기 어렵다는 이유로 AI 판별 도구도 사용하지 말라고 지시한다.
13
9
의심 사례는 어떻게 찾고, 어디까지 알 수 있나
감독자는 판별 도구의 점수보다 반복적인 AI식 문장이나 유난히 빠른 작업 완료 등 양상을 살피는 것으로 보도됐다. 이런 징후는 추가 확인의 계기가 될 수 있지만, 그 자체로 AI 사용을 입증하지는 못한다. 감독자가 위반을 얼마나 정확히 찾아내거나 놓치는지도 공개된 보도만으로는 알 수 없다.
9
33
사람이 직접 평가했다는 사실만으로 점수의 신뢰성이 보장되는 것도 아니다. 평가자가 부주의하게 채점하거나 의도적으로 부적절한 점수를 줄 가능성은 별개의 문제다. 다만 계약직 인력이 일부러 나쁜 점수를 줬다고 인정했다는 구체적인 주장은 제공된 보도로 확인되지 않는다. 그 일이 실제로 있었는지, 얼마나 흔했는지 단정할 수 없다. 평가의 신뢰성을 확보하려면 누가 점수를 매겼는지뿐 아니라 판단의 품질도 살펴야 한다.
1
4
이용자에게는 개인정보 문제도 남는다. 프로젝트 릴리 평가자가 실제 대화 내용을 볼 수 있고, OpenAI가 사용하는 것으로 보도된 개인정보 필터가 민감한 정보를 모두 지우지 못할 수 있기 때문이다. 평가 절차의 신뢰성과 대화 내용의 처리 방식이 함께 중요한 이유다.
8
12