A OpenAI teria removido vários contratados que usaram IA para avaliar respostas do ChatGPT porque o Project Lily foi concebido para reunir julgamentos humanos independentes — e não feedback gerado por modelos. Segundo as reportagens, centenas de revisores do Project Lily leem conversas reais e pontuam até quatro res...
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
O motivo é direto: o Project Lily, segundo o 404 Media, existe para coletar avaliações de pessoas sobre as respostas do ChatGPT e usar esses julgamentos para melhorar o comportamento futuro do sistema. Se um contratado deixa uma IA produzir a avaliação, a empresa deixa de obter uma preferência humana independente. É por isso que vários contratados teriam sido removidos após usar IA no trabalho. 19
20
O fluxo relatado envolve prompts reais enviados ao ChatGPT e, em alguns casos, conversas completas. Os revisores resumem a intenção do usuário, comparam respostas candidatas e dão notas de 1 a 7. Cada tarefa pode trazer até quatro respostas. O foco não seria apenas a correção factual, mas também aspectos de comportamento, como tom, bajulação excessiva — a chamada sicomancia — e afirmações excessivamente humanas por parte do chatbot. 8
19
Essas notas podem virar dados de preferência: registros estruturados sobre qual resposta uma pessoa considera melhor em determinado contexto. Esse tipo de dado só é útil para ajustar um modelo quando os julgamentos são consistentes, bem informados e, sobretudo, independentes.
O Project Lily envolveria centenas de revisores externos, recrutados pela Crossing Hurdles e pagos por meio da Mercor. Um revisor disse receber mais de US$ 50 por hora. Já o número de mais de 10 mil contratados citado em reportagens se refere às operações de avaliação da OpenAI como um todo, e não apenas ao Project Lily. 19
6
Uma IA pode avaliar textos com rapidez e pode ser útil em testes internos. Mas isso responde a uma pergunta diferente da que se busca numa revisão de preferência humana: o que pessoas consideram uma resposta melhor?
Um modelo tende a repetir padrões aprendidos durante seu treinamento e pode favorecer respostas com formulações, estilo ou pressupostos já familiares. Quando a saída de um modelo — ou de um sistema muito próximo dele — é usada repetidamente para recompensar novas respostas, pode surgir um ciclo de retroalimentação:
Isso não significa que toda avaliação automatizada piora um modelo. Ela pode ser valiosa se for validada contra julgamentos humanos e aplicada dentro de limites claros. Mas substituir pessoas justamente numa tarefa encomendada como fonte de preferência humana enfraquece a independência do sinal de treinamento — e essa parece ser a razão da proibição relatada.
De acordo com as reportagens, supervisores foram instruídos a não confiar em detectores de texto por IA, como o GPTZero. Em vez disso, deveriam examinar padrões de trabalho e o conteúdo entregue por meio de revisão humana: frases excessivamente uniformes, pontuação ou formatação semelhantes e conclusão de tarefas em velocidade improvável são alguns dos sinais mencionados. 6
Há uma limitação evidente: isoladamente, nenhum desses indícios prova que alguém usou IA. Uma pessoa experiente pode escrever rápido, e textos parecidos podem resultar de uma mesma orientação de trabalho. Por isso, esses sinais deveriam servir como ponto de partida para uma investigação, e não como prova suficiente, por si só, para excluir alguém de um projeto.
Empresas costumam evitar publicar critérios detalhados de detecção porque uma lista precisa pode virar um manual para burlar o controle. Um contratado poderia alterar a redação, inserir atrasos artificiais ou mudar a formatação, mantendo o julgamento terceirizado para uma IA.
Mas o sigilo também traz riscos. Se o trabalhador não sabe como uma decisão de qualidade foi tomada, erros ficam mais difíceis de contestar. Um programa de integridade mais sólido precisa conciliar métodos confidenciais de detecção com regras claras, decisões documentadas e um processo real de recurso ou correção.
A Mercor teria informado que o uso de IA para executar esse tipo de avaliação viola sua política e que casos confirmados levam à remoção imediata do projeto correspondente. As regras relatadas também proibiriam assistência de IA de forma mais ampla, inclusive para escrever feedback ou comentários. 6
40
O caso relatado de notas deliberadamente ruins mostra o ponto maior: feedback humano não é automaticamente confiável só porque foi enviado por uma pessoa. Um revisor pode agir com pressa, interpretar mal as instruções, priorizar volume de tarefas, agir de má-fé ou tentar manipular sistemas opacos de controle de qualidade.
Trata-se de um problema de incentivos tanto quanto de tecnologia. A empresa que desenvolve o modelo precisa de julgamentos criteriosos, calibrados e de boa-fé, capazes de prever um comportamento melhor no uso real. Já o contratado pode ser recompensado principalmente por velocidade, número de tarefas concluídas ou por não ser reprovado. Quando esses incentivos não estão alinhados, os dados podem ficar ruidosos ou sofrer distorções sistemáticas.
A revisão humana continua importante para julgamentos subjetivos, contextuais ou difíceis de verificar automaticamente. Porém, funciona melhor como um sistema de verificações cruzadas, não como uma simples sequência de notas individuais. Entre as salvaguardas práticas estão:
A lição central é simples: o treinamento por preferências é tão confiável quanto o processo que produz essas preferências. Revisores humanos não são uma garantia automática de qualidade, e julgamentos gerados por IA não podem simplesmente substituir feedback humano independente quando o objetivo é entender o que as pessoas realmente valorizam.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A OpenAI teria removido vários contratados que usaram IA para avaliar respostas do ChatGPT porque o Project Lily foi concebido para reunir julgamentos humanos independentes — e não feedback gerado por modelos.
A OpenAI teria removido vários contratados que usaram IA para avaliar respostas do ChatGPT porque o Project Lily foi concebido para reunir julgamentos humanos independentes — e não feedback gerado por modelos. Segundo as reportagens, centenas de revisores do Project Lily leem conversas reais e pontuam até quatro respostas em uma escala de 1 a 7; o ecossistema mais amplo de avaliação da OpenAI teria mais de 10 mil contratados.
O episódio expõe uma fragilidade central do treinamento por preferência: uma nota atribuída por uma pessoa não é automaticamente cuidadosa, independente ou confiável, o que exige controles de qualidade e incentivos be...