OpenAI aurait écarté plusieurs prestataires qui se servaient de l’intelligence artificielle pour évaluer ses modèles. Le paradoxe est apparent : ce travail devait précisément apporter un regard humain indépendant sur les réponses de ChatGPT. Les articles reliant ces exclusions aux activités d’évaluation d’OpenAI décrivent aussi le projet Lily, mais ne permettent pas d’affirmer que chaque personne écartée travaillait sur ce projet.
16
13
Ce que font les évaluateurs du projet Lily
Selon les informations publiées, le projet Lily mobilise des centaines de prestataires externes. Ils examinent de véritables demandes adressées à ChatGPT et, parfois, les échanges qui les entourent. Les évaluateurs seraient recrutés par l’intermédiaire de Crossing Hurdles et rémunérés via Mercor. L’un d’eux a déclaré gagner plus de 50 dollars de l’heure ; ce témoignage ne permet pas d’en faire le tarif de tous.
2
20
Leur tâche consiste d’abord à résumer ce que l’utilisateur cherchait à obtenir, puis à commenter et noter les réponses proposées sur une échelle de 1 à 7. Certaines évaluations portent sur un maximum de quatre réponses. Le ton, les formulations trop mécaniques ou la tendance du chatbot à acquiescer excessivement font partie des points examinés. Ces notes et commentaires sont destinés à améliorer le comportement des futurs modèles.
4
11
3
1
Pourquoi une évaluation rédigée par l’IA pose problème
Un évaluateur humain peut juger par lui-même si une réponse répond à la demande et si son ton sonne juste. S’il laisse une autre IA choisir la note ou rédiger le commentaire, le retour obtenu risque de refléter les préférences d’un modèle plutôt que son propre jugement. Cela réduit la valeur du contrôle humain ; ce n’est pas la preuve qu’une note particulière a nui au modèle.
4
16
Les consignes rapportées interdisent l’usage de l’IA pour examiner le travail ou rédiger les commentaires, y compris des fonctions comme Grammarly et la traduction assistée par IA. Elles demandent aussi aux personnes chargées de contrôler les autres évaluateurs de ne pas utiliser de logiciels de détection d’IA, jugés peu fiables.
13
9
Comment repérer un usage suspect — et les limites de ce contrôle
D’après les articles consacrés au sujet, les responsables surveillent plutôt des indices dans le travail rendu : formulations répétitives évoquant l’IA ou tâches terminées à une vitesse inhabituelle. Ces signaux peuvent justifier un examen plus attentif, mais ne prouvent rien à eux seuls. Les informations disponibles ne permettent pas de savoir à quelle fréquence les contrôles repèrent correctement un usage de l’IA, ni combien de cas leur échappent.
9
33
Écarter l’IA ne garantit pas non plus la qualité des notes : un humain peut travailler sans soin ou attribuer délibérément une mauvaise note. Les sources disponibles ne confirment pas l’aveu précis, évoqué dans la question, d’un prestataire qui aurait volontairement donné de mauvaises notes ; elles ne permettent donc d’en établir ni les circonstances ni l’ampleur. La distinction essentielle demeure : une évaluation dite « humaine » indique qui l’a fournie, pas si chaque jugement est fiable. La qualité des évaluations doit elle aussi être contrôlée.
1
4
Pour les utilisateurs, le projet Lily soulève enfin une question distincte : les évaluateurs peuvent voir le texte de conversations réelles, et le filtre de confidentialité qu’OpenAI dit appliquer pourrait laisser passer certaines données sensibles. La fiabilité de l’évaluation et la protection des échanges sont donc deux enjeux à considérer séparément.
8
12