OpenAI apartó, según varios reportes, a contratistas que utilizaron inteligencia artificial para evaluar respuestas de sus modelos. La cuestión no es que alguien haya usado IA en una empresa de IA: el trabajo consistía precisamente en aportar un juicio humano independiente. Los reportes relacionan las medidas con las tareas de evaluación realizadas por contratistas para OpenAI y describen Project Lily como uno de los programas de revisión humana; no establecen que todas las personas apartadas trabajaran en Lily.
16
13
Qué hacen los revisores de Project Lily
Según lo publicado, Project Lily emplea a cientos de contratistas externos para revisar solicitudes reales enviadas a ChatGPT y, en algunos casos, las conversaciones que las rodean. Los revisores serían captados a través de Crossing Hurdles y cobrarían mediante Mercor. Un trabajador dijo ganar más de 50 dólares por hora, una cifra que no puede tomarse como la tarifa de todos.
2
20
Primero resumen qué intentaba conseguir el usuario. Después examinan las posibles respuestas de ChatGPT, escriben críticas y las califican en una escala del 1 al 7. Las tareas descritas incluyen hasta cuatro respuestas candidatas y prestan atención, entre otras cosas, al tono, a las expresiones que suenan mecánicas y a una actitud excesivamente complaciente. Esas puntuaciones y observaciones buscan orientar mejoras en el comportamiento futuro del modelo.
4
11
3
1
Por qué usar IA para puntuar cambia el resultado
Un revisor puede juzgar por sí mismo si una respuesta ayuda al usuario o si le da la razón demasiado fácilmente. Si delega la crítica o la puntuación en otra IA, el resultado puede reflejar las preferencias de un modelo en lugar de una valoración humana. Eso pone en riesgo el valor de las evaluaciones; no demuestra que una puntuación concreta haya perjudicado al modelo.
4
16
Las instrucciones citadas en los reportes prohíben usar IA para revisar el trabajo o redactar comentarios, incluso funciones de Grammarly o de traducción con IA. También impiden a quienes supervisan a otros contratistas utilizar detectores de texto generado por IA, que las instrucciones consideran poco fiables.
13
9
Cómo se detectan las sospechas y qué queda sin comprobar
Según los reportes, los supervisores se fijan en señales como redacciones repetitivas que parecen generadas por IA o tiempos de entrega inusualmente rápidos, en vez de confiar en la puntuación de un detector. Son motivos para investigar, no pruebas concluyentes. La información disponible tampoco permite saber con qué frecuencia aciertan o pasan por alto casos.
9
33
Prescindir de la IA no garantiza, por sí solo, una buena evaluación: una persona también puede puntuar sin cuidado o hacerlo mal deliberadamente. Los reportes aportados no verifican la supuesta admisión concreta de haber elegido puntuaciones deficientes a propósito. Por tanto, no se pueden establecer aquí sus circunstancias ni su alcance. La conclusión verificable es más limitada: que una evaluación lleve la etiqueta «humana» no asegura que cada juicio sea acertado; también hace falta controlar su calidad.
1
4
Para los usuarios hay, además, otra cuestión: los revisores de Project Lily pueden ver texto de conversaciones reales, y el filtro de privacidad que OpenAI dice aplicar podría no eliminar todos los datos sensibles. La fiabilidad del proceso de evaluación y el tratamiento de esas conversaciones importan por separado.
8
12