Según los reportes, varios contratistas fueron retirados por usar IA para hacer evaluaciones que Project Lily encarga precisamente a personas, con el fin de obtener preferencias humanas independientes. El proyecto emplearía a cientos de revisores para leer y valorar conversaciones reales de ChatGPT; la cifra de más...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, según informó 404 Media, es una operación de revisión humana en la que contratistas evalúan respuestas de ChatGPT para ayudar a mejorar su comportamiento futuro. Esa finalidad explica por qué, presuntamente, fueron apartados quienes usaron IA generativa para hacer las evaluaciones: el valor de los datos debe proceder de un juicio humano independiente. Si un modelo entrega ese juicio, el sistema deja de medir con claridad qué prefieren realmente las personas. 19
20
El flujo de trabajo descrito en los reportes asigna a los revisores consultas reales de ChatGPT y, en algunos casos, conversaciones completas. Deben resumir la intención del usuario, comparar respuestas candidatas y calificarlas en una escala del 1 al 7. Pueden recibir hasta cuatro respuestas por tarea y se les pide fijarse en cualidades de comportamiento —como el tono, la adulación excesiva o sycophancy y las afirmaciones demasiado humanizadas—, no solo en la exactitud factual. 8
19
Estas puntuaciones pueden convertirse en datos de preferencia: un registro estructurado de la respuesta que una persona considera mejor en un contexto concreto. Sirven para orientar el modelo hacia conductas deseadas únicamente si los juicios son suficientemente coherentes, informados e independientes.
Project Lily involucraría a cientos de revisores externos. Los reportes indican que son reclutados mediante Crossing Hurdles y cobrados a través de Mercor; uno de ellos dijo percibir más de 50 dólares por hora. Por separado, la información sobre la operación de evaluación más amplia de OpenAI menciona a más de 10.000 contratistas en sus canales de calificación. Esa cifra no debe interpretarse como el tamaño de Project Lily por sí solo. 19
6
Un evaluador basado en IA puede ser rápido y resultar útil en pruebas internas, pero responde a una pregunta diferente de la que pretende resolver una revisión de preferencias humanas. Un modelo tiende a reproducir patrones aprendidos durante su entrenamiento y puede favorecer respuestas con formulaciones, estilos o supuestos que ya le resultan familiares.
Si las salidas de un modelo —o de otro estrechamente relacionado— se usan repetidamente para premiar futuras respuestas, puede generarse un circuito de retroalimentación:
Esto no demuestra que toda evaluación automatizada empeore un modelo. Puede ser valiosa si se valida frente al criterio humano y se usa con límites claros. Pero sustituir con ella una tarea encargada específicamente para producir datos de preferencia humana debilita la independencia de la señal de entrenamiento; esa sería la razón aparente de la prohibición.
Según los reportes, los supervisores recibieron instrucciones de no apoyarse en detectores de texto generado por IA como GPTZero. En su lugar, debían revisar el trabajo y sus patrones de forma humana: frases inusualmente uniformes, rasgos de puntuación o formato y una velocidad de finalización poco plausible, entre otras señales. 6
El método tiene una limitación evidente: ninguna de esas señales prueba por sí sola que una persona haya usado IA. Alguien puede escribir rápido por experiencia, y un lenguaje parecido puede ser consecuencia de una misma guía de evaluación. Por eso, estos indicios deberían servir para abrir una revisión, no como prueba concluyente suficiente para expulsar a alguien de un proyecto.
Las organizaciones suelen evitar divulgar sus reglas detalladas contra el fraude porque una lista precisa puede convertirse en un manual para evadirlas. Un contratista podría cambiar el estilo, introducir pausas artificiales o alterar el formato sin dejar de delegar el juicio en un modelo.
Pero el secretismo también tiene un coste. Si los trabajadores no saben cómo se tomó una decisión de calidad, es más difícil impugnar un error. Un sistema sólido de integridad necesita métodos confidenciales de detección, sí, pero también normas claras, decisiones documentadas y una vía real de apelación o corrección.
Mercor habría señalado que usar IA para realizar este trabajo de evaluación infringe sus políticas y que los casos confirmados implican la retirada inmediata del proyecto correspondiente. Los reportes también indican que las reglas vetaban de forma más amplia la asistencia de IA, incluidas herramientas para redactar comentarios o retroalimentación. 6
40
El caso reportado de calificaciones deliberadamente malas apunta a un problema mayor: la etiqueta de «retroalimentación humana» no convierte automáticamente un dato en fiable. Un revisor puede trabajar con prisa, entender mal la guía, priorizar el volumen, actuar de mala fe o intentar sortear sistemas de calidad opacos.
Es una cuestión de incentivos tanto como de tecnología. El desarrollador del modelo necesita juicios calibrados y de buena fe que ayuden a anticipar un mejor comportamiento en el uso real. El contratista, en cambio, puede verse recompensado principalmente por velocidad, número de tareas completadas o por evitar rechazos. Cuando ambos incentivos divergen, los datos pueden llenarse de ruido o quedar sesgados de forma sistemática.
La revisión humana sigue siendo importante para decisiones contextuales, subjetivas o difíciles de verificar automáticamente. Sin embargo, funciona mejor como un conjunto de controles que como una simple corriente de puntuaciones individuales. Algunas salvaguardas prácticas son:
La lección central es sencilla: el entrenamiento basado en preferencias es tan fiable como el proceso que crea esas preferencias. Los revisores humanos no son una garantía mágica de calidad, y los juicios generados por IA no pueden sustituir sin más a una retroalimentación humana independiente cuando el objetivo es aprender qué valoran realmente las personas.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Según los reportes, varios contratistas fueron retirados por usar IA para hacer evaluaciones que Project Lily encarga precisamente a personas, con el fin de obtener preferencias humanas independientes.
Según los reportes, varios contratistas fueron retirados por usar IA para hacer evaluaciones que Project Lily encarga precisamente a personas, con el fin de obtener preferencias humanas independientes. El proyecto emplearía a cientos de revisores para leer y valorar conversaciones reales de ChatGPT; la cifra de más de 10.000 contratistas corresponde al conjunto de los canales de calificación vinculados a OpenAI, no...
El episodio subraya que una evaluación enviada por una persona no garantiza por sí sola calidad: hacen falta controles contra respuestas apresuradas, errores de criterio e incentivos que premien la cantidad antes que...