Des sous traitants auraient été écartés après avoir utilisé une IA pour réaliser des tâches d’évaluation de ChatGPT, alors que Project Lily est conçu pour recueillir des jugements humains indépendants.[19][20] Project Lily mobiliserait des centaines d’évaluateurs qui lisent et notent de vraies conversations ChatGPT...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, décrit par 404 Media, est une opération de relecture humaine : des sous-traitants évaluent des réponses de ChatGPT afin d’en améliorer les comportements futurs. C’est ce qui explique les exclusions rapportées de personnes ayant utilisé une IA générative pour effectuer cette évaluation : la valeur de ces données est censée venir d’un jugement humain autonome. Si un modèle fournit lui-même le jugement, le processus ne mesure plus clairement ce que préfèrent réellement des personnes. 19
20
Selon les informations publiées, les évaluateurs reçoivent de véritables requêtes adressées à ChatGPT et, dans certains cas, des conversations entières. Ils résument l’intention de l’utilisateur, comparent des réponses candidates et leur attribuent une note de 1 à 7. Jusqu’à quatre réponses peuvent être examinées pour une même tâche. L’attention porte notamment sur le ton, la flatterie excessive — ou sycophancy — et les formulations qui prêtent abusivement des caractéristiques humaines au chatbot, plutôt que sur la seule exactitude factuelle. 8
19
Ces évaluations peuvent devenir des données de préférence : un relevé structuré de la réponse qu’une personne juge préférable dans un contexte donné. Elles servent à orienter un modèle vers les comportements recherchés, à condition que les jugements soient cohérents, éclairés et indépendants.
Project Lily ferait intervenir des centaines d’évaluateurs externes. Ils seraient recrutés par Crossing Hurdles et rémunérés via Mercor ; l’un d’eux a indiqué gagner plus de 50 dollars de l’heure. Les informations disponibles sur l’opération d’évaluation plus large d’OpenAI évoquent séparément plus de 10 000 sous-traitants dans l’ensemble de ses chaînes de notation : ce total ne correspond pas à la seule taille de Project Lily. 19
6
Une IA évaluatrice peut être rapide et parfois utile pour des tests internes. Mais elle ne répond pas à la même question qu’une évaluation des préférences humaines. Un modèle a tendance à reproduire des schémas appris pendant son entraînement et peut favoriser des réponses dont la formulation, le style ou les présupposés lui sont déjà familiers.
Si les résultats d’un modèle, ou d’un modèle étroitement apparenté, sont employés de façon répétée pour récompenser les futures réponses d’un autre modèle, une boucle de rétroaction peut s’installer :
Cela ne signifie pas que toute évaluation automatisée dégrade nécessairement un modèle. Elle peut être pertinente si elle est comparée à des évaluations humaines et encadrée avec précision. Mais la substituer à une tâche commandée précisément pour produire des données de préférence humaine affaiblit l’indépendance du signal d’entraînement. C’est, semble-t-il, la raison de l’interdiction rapportée.
D’après les informations publiées, les superviseurs auraient reçu pour consigne de ne pas s’appuyer sur des détecteurs de textes générés par IA comme GPTZero. Ils devaient plutôt examiner le travail et ses schémas par une relecture humaine : formulations anormalement uniformes, habitudes de ponctuation ou de mise en forme, et vitesse d’exécution peu plausible, entre autres indices. 6
Cette méthode comporte une limite évidente : aucun de ces indices ne prouve à lui seul l’usage d’une IA. Une personne peut écrire vite parce qu’elle est expérimentée, et un langage similaire peut venir d’une grille d’évaluation commune. Ces signaux ne devraient donc servir qu’à déclencher une vérification, non à constituer automatiquement une preuve suffisante pour écarter quelqu’un d’un projet.
Les organisations évitent généralement de publier le détail de leurs mécanismes anti-contournement : une liste précise pourrait servir de mode d’emploi pour les déjouer. Des sous-traitants pourraient changer leurs formulations, ajouter artificiellement des délais ou modifier leur mise en page, tout en déléguant toujours leurs jugements à un modèle.
Cette confidentialité a toutefois un revers. Si les travailleurs ne savent pas comment une décision de qualité a été prise, les erreurs deviennent plus difficiles à contester. Un dispositif crédible doit donc associer des méthodes de détection confidentielles à des règles claires, des décisions documentées et une véritable possibilité de recours ou de correction.
Mercor aurait indiqué que l’usage de l’IA pour réaliser ce travail d’évaluation contrevient à sa politique, et que les cas confirmés entraînent un retrait immédiat du projet concerné. Les règles auraient aussi interdit plus largement l’assistance par IA, y compris les outils employés pour rédiger des retours ou des commentaires. 6
40
Le cas rapporté d’évaluations volontairement mauvaises illustre le problème plus général : un « retour humain » n’est pas fiable par nature simplement parce qu’il a été saisi par une personne. Un évaluateur peut travailler trop vite, mal comprendre la consigne, privilégier le volume, agir de mauvaise foi ou tenter de jouer avec des systèmes de contrôle opaques.
C’est autant un problème d’incitations qu’un problème technique. Le développeur veut des appréciations calibrées et sincères, qui prédisent des comportements plus utiles dans le monde réel. Le sous-traitant peut, lui, être surtout incité à terminer rapidement les tâches, à atteindre un volume donné ou à éviter le rejet de son travail. Lorsque ces objectifs divergent, les données recueillies peuvent devenir bruitées ou systématiquement biaisées.
L’évaluation humaine reste essentielle pour les jugements contextuels, subjectifs ou difficiles à vérifier automatiquement. Mais elle fonctionne mieux comme un système de contrôles croisés que comme une simple succession de notes individuelles. Parmi les garde-fous possibles :
La leçon centrale est simple : l’entraînement fondé sur les préférences ne vaut que ce que vaut le processus qui produit ces préférences. Les évaluateurs humains ne garantissent pas magiquement la qualité ; et les jugements générés par IA ne peuvent pas remplacer sans précaution un retour humain indépendant lorsque l’objectif est de comprendre ce que les personnes valorisent réellement.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Des sous traitants auraient été écartés après avoir utilisé une IA pour réaliser des tâches d’évaluation de ChatGPT, alors que Project Lily est conçu pour recueillir des jugements humains indépendants.[19][20]
Des sous traitants auraient été écartés après avoir utilisé une IA pour réaliser des tâches d’évaluation de ChatGPT, alors que Project Lily est conçu pour recueillir des jugements humains indépendants.[19][20] Project Lily mobiliserait des centaines d’évaluateurs qui lisent et notent de vraies conversations ChatGPT ; plus de 10 000 sous traitants seraient impliqués dans l’ensemble des chaînes de notation liées à OpenAI.[19][6]
Cette affaire rappelle qu’un avis saisi par un humain n’est pas automatiquement fiable : les systèmes d’alignement ont besoin de contrôles de qualité, pas seulement de volontaires humains.