OpenAI zou meerdere opdrachtnemers hebben verwijderd omdat Project Lily onafhankelijke menselijke beoordelingen moet verzamelen, geen door modellen gegenereerde feedback. Binnen Project Lily beoordelen honderden externe reviewers echte ChatGPT gesprekken.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily is, volgens berichtgeving van 404 Media, een programma waarin menselijke reviewers ChatGPT-antwoorden beoordelen om toekomstige versies van het model te verbeteren. Juist daarom zouden opdrachtnemers zijn verwijderd als zij generatieve AI gebruikten voor die beoordelingen: de waarde van de gegevens moet voortkomen uit onafhankelijk menselijk oordeel. Als een model dat oordeel levert, meet het proces niet langer zuiver wat mensen daadwerkelijk verkiezen. 19
20
Reviewers krijgen echte prompts van ChatGPT-gebruikers te zien en soms volledige gesprekken. Ze vatten de bedoeling van de gebruiker samen, vergelijken mogelijke antwoorden en geven een score van 1 tot en met 7. Per taak kunnen zij volgens de berichtgeving maximaal vier kandidaatantwoorden beoordelen. De nadruk ligt daarbij op gedrag: toon, overdreven vleierij — ook wel sycophancy — en al te menselijk klinkende beweringen, niet alleen op feitelijke juistheid. 8
19
Die beoordelingen kunnen worden omgezet in voorkeursdata: gestructureerde informatie over welk antwoord iemand in een bepaalde context beter vindt. Zulke data kan een model helpen afstemmen op gewenst gedrag, maar alleen als de oordelen voldoende consistent, geïnformeerd en onafhankelijk zijn.
Project Lily zou honderden externe reviewers omvatten. Zij zouden worden geworven via Crossing Hurdles en betaald via Mercor; één reviewer meldde een vergoeding van meer dan 50 dollar per uur. Los daarvan noemt berichtgeving over OpenAI's bredere beoordelingsoperatie meer dan 10.000 opdrachtnemers in alle beoordelingsketens. Dat aantal zegt dus niet dat Project Lily alleen al zo groot is. 19
6
Een AI-beoordelaar kan snel werken en soms bruikbaar zijn voor interne tests, maar beantwoordt een andere vraag dan een menselijke voorkeurstoets. Een model heeft de neiging patronen uit zijn training te herhalen en kan antwoorden bevoordelen die aansluiten bij bekende formuleringen, stijlen of aannames.
Wanneer de uitvoer van een model — of van een nauw verwant model — herhaaldelijk wordt gebruikt om latere modeluitvoer te belonen, kan een feedbacklus ontstaan:
Dat betekent niet dat elke toepassing van AI-beoordeling een model slechter maakt. Geautomatiseerde evaluatie kan waardevol zijn wanneer die is getoetst aan menselijk oordeel en binnen duidelijke grenzen wordt ingezet. Maar AI in de plaats zetten van beoordelingen die juist als menselijke voorkeursdata zijn ingekocht, verzwakt de onafhankelijkheid van het trainingssignaal. Dat lijkt de reden voor het gemelde verbod.
Volgens de berichtgeving kregen supervisors de instructie om niet te vertrouwen op AI-schrijfdetectors zoals GPTZero. In plaats daarvan zouden zij het werktempo en de geschreven beoordelingen zelf beoordelen, onder meer op ongewoon uniforme formuleringen, interpunctie- of opmaakpatronen en onwaarschijnlijk snelle voltooiing van taken. 6
Daar zit een duidelijke beperking aan: geen van die signalen bewijst op zichzelf dat iemand AI heeft gebruikt. Een snelle schrijver kan ervaren zijn, en vergelijkbare formuleringen kunnen ook voortkomen uit een gedeelde beoordelingsrichtlijn. Zulke signalen zijn daarom hooguit aanleiding voor nader onderzoek; een degelijk proces moet onderscheid maken tussen een vermoeden en bewijs dat verwijdering uit een project rechtvaardigt.
Organisaties maken gedetailleerde anti-fraudecriteria doorgaans niet publiek. Een exacte checklist kan immers een handleiding worden om controles te omzeilen: opdrachtnemers kunnen hun formuleringen aanpassen, bewust vertragen of de opmaak veranderen terwijl zij het inhoudelijke oordeel nog steeds aan een model uitbesteden.
Tegelijk brengt geheimhouding een risico mee. Als werkers niet begrijpen hoe een kwaliteitsbesluit tot stand kwam, zijn fouten moeilijker aan te vechten. Een houdbaar integriteitsbeleid combineert daarom vertrouwelijke detectiemethoden met heldere regels, vastgelegde besluiten en een serieuze mogelijkheid tot beroep of correctie.
Mercor zou hebben verklaard dat AI gebruiken om dit beoordelingswerk uit te voeren in strijd is met het beleid. Bij bevestigde gevallen volgt volgens de berichtgeving onmiddellijke verwijdering uit het betreffende project. De regels zouden AI-hulp breder verbieden, ook voor hulpmiddelen die feedback of opmerkingen schrijven. 6
40
De gemelde kwestie rond opzettelijk slechte beoordelingen maakt een breder punt duidelijk: ‘menselijke feedback’ is niet automatisch betrouwbaar omdat een mens een score heeft ingevuld. Een reviewer kan haast hebben, de richtlijn verkeerd begrijpen, vooral op productievolume sturen, te kwader trouw handelen of proberen een ondoorzichtig kwaliteitssysteem te bespelen.
Dat is evenzeer een prikkelprobleem als een technisch probleem. De modelontwikkelaar heeft behoefte aan zorgvuldige, goed gekalibreerde oordelen die beter gedrag in de praktijk voorspellen. Een opdrachtnemer kan daarentegen vooral worden beloond voor snelheid, het afwerken van taken of het vermijden van afkeuring. Als die prikkels uiteenlopen, kunnen de gegevens ruis bevatten of structureel vertekend raken.
Menselijke beoordeling blijft belangrijk voor afwegingen die contextafhankelijk, subjectief of moeilijk automatisch te controleren zijn. Maar zij werkt het best als onderdeel van een stelsel van controles, niet als een losse stroom individuele cijfers. Praktische waarborgen zijn onder meer:
De kern is eenvoudig: voorkeurstraining is slechts zo betrouwbaar als het proces waarmee die voorkeuren worden verzameld. Menselijke reviewers zijn geen automatische kwaliteitsgarantie, en door AI gegenereerde oordelen kunnen onafhankelijk menselijk oordeel niet zomaar vervangen wanneer het doel is te leren wat mensen echt belangrijk vinden.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI zou meerdere opdrachtnemers hebben verwijderd omdat Project Lily onafhankelijke menselijke beoordelingen moet verzamelen, geen door modellen gegenereerde feedback.
OpenAI zou meerdere opdrachtnemers hebben verwijderd omdat Project Lily onafhankelijke menselijke beoordelingen moet verzamelen, geen door modellen gegenereerde feedback. Binnen Project Lily beoordelen honderden externe reviewers echte ChatGPT gesprekken.
De kwestie laat zien dat menselijke feedback niet vanzelf betrouwbaar is: ook menselijke beoordelaars hebben kwaliteitscontroles, duidelijke regels en goede prikkels nodig.