A OpenAI teria afastado prestadores de serviço que usaram inteligência artificial para avaliar respostas de seus modelos. A questão não é a contradição aparente de usar IA em uma empresa de IA: essas tarefas deveriam produzir julgamentos humanos independentes. As reportagens relacionam os afastamentos ao trabalho mais amplo de avaliação feito por prestadores e descrevem o Projeto Lily como uma iniciativa de revisão humana. Elas não demonstram, porém, que todos os profissionais afastados trabalhavam no Lily.
16
13
Como funciona a avaliação no Projeto Lily
Segundo as reportagens, centenas de prestadores externos analisam solicitações reais enviadas ao ChatGPT e, em alguns casos, o contexto da conversa. Os avaliadores seriam recrutados pela Crossing Hurdles e pagos por meio da Mercor. Um profissional relatou receber mais de US$ 50 por hora; isso não significa que todos ganhem esse valor.
2
20
O avaliador resume o que a pessoa queria obter, examina respostas alternativas do ChatGPT e escreve críticas acompanhadas de notas de 1 a 7. Os relatos descrevem tarefas com até quatro respostas, nas quais são observados aspectos como tom, linguagem robótica e concordância excessiva com o usuário. A intenção é usar essas avaliações para melhorar o comportamento de versões futuras do modelo.
4
11
3
1
Por que recorrer à IA compromete o trabalho
Uma pessoa pode julgar por conta própria se a resposta atende ao pedido ou apenas parece concordar com tudo. Se outra IA redige a crítica ou escolhe a nota, o resultado pode refletir preferências geradas por um modelo, em vez de uma avaliação independente. Isso reduz o valor potencial do feedback, mas não prova que uma avaliação específica tenha prejudicado o ChatGPT.
4
16
As instruções relatadas proíbem o uso de IA para revisar tarefas ou escrever comentários, inclusive recursos do Grammarly e ferramentas de tradução com IA. Quem fiscaliza o trabalho de outros avaliadores também é orientado a não usar detectores de IA, descritos nas instruções como pouco confiáveis.
13
9
Como surgem suspeitas — e o que elas não provam
Supervisores observariam sinais como textos repetitivos, com aparência de terem sido escritos por IA, ou tarefas concluídas rápido demais, em vez de confiar em uma pontuação de detector. Esses sinais podem justificar uma análise mais cuidadosa, mas não são prova isolada. As reportagens disponíveis não mostram com que frequência o método acerta ou deixa passar casos.
9
33
Há também um limite mais amplo: uma avaliação feita sem IA não é necessariamente boa. Uma pessoa pode dar uma nota ruim por descuido ou de propósito. As fontes fornecidas não confirmam a alegada admissão específica de um prestador de que escolhia notas ruins deliberadamente; por isso, não é possível estabelecer as circunstâncias do caso nem sua frequência. O rótulo “avaliado por humanos” informa quem forneceu o feedback, não garante que cada julgamento seja confiável.
1
4
Para os usuários, o Projeto Lily ainda levanta outra questão: avaliadores podem ter acesso ao texto de conversas reais, e o filtro de privacidade que a OpenAI diz aplicar pode deixar passar informações sensíveis. Assim, tanto a qualidade das avaliações quanto o tratamento das conversas importam.
8
12