OpenAI heeft volgens berichtgeving meerdere externe medewerkers van projecten gehaald omdat zij AI gebruikten om modellen te helpen beoordelen. Dat klinkt tegenstrijdig voor een AI-bedrijf, maar bij dit werk is het onafhankelijke oordeel van een mens juist de bedoeling. De berichtgeving verbindt de verwijderingen aan OpenAI’s bredere beoordelingswerk en beschrijft Project Lily als een programma met menselijke beoordelaars. Ze toont niet aan dat iedere verwijderde medewerker aan Lily werkte.
16
13
Wat doen beoordelaars bij Project Lily?
Volgens de berichtgeving lezen honderden externe beoordelaars echte vragen aan ChatGPT en soms ook de gesprekken eromheen. Zij worden geworven via Crossing Hurdles en betaald via Mercor. Eén medewerker meldde meer dan 50 dollar per uur te verdienen; dat is geen bevestigd tarief voor iedereen.
2
20
Een beoordelaar vat eerst samen wat de gebruiker wilde bereiken. Daarna vergelijkt die maximaal vier mogelijke ChatGPT-antwoorden, schrijft een toelichting en geeft scores op een schaal van 1 tot 7. Daarbij gaat het onder meer om toon, houterige formuleringen en antwoorden die de gebruiker te veel naar de mond praten. De beoordelingen zijn bedoeld om het gedrag van toekomstige modellen te verbeteren.
4
11
3
1
Waarom is AI-hulp hier een probleem?
Als een beoordelaar een ander AI-systeem de toelichting laat schrijven of de score laat kiezen, is de terugkoppeling niet langer een zelfstandig menselijk oordeel. Ze kan dan de voorkeuren van een model weerspiegelen in plaats van wat een persoon van het antwoord vindt. Dat ondermijnt de waarde van zulke feedback, al bewijst het niet dat een specifieke beoordeling schade heeft veroorzaakt.
4
16
De gerapporteerde werkinstructies verbieden AI bij het beoordelen en schrijven van feedback, ook functies van Grammarly en AI-vertaling. Medewerkers die het werk van anderen controleren, mogen evenmin AI-detectietools gebruiken: volgens de instructies zijn die onbetrouwbaar.
13
9
Hoe wordt vermoedelijk AI-gebruik opgemerkt?
Leidinggevenden letten volgens de berichtgeving op patronen, zoals herhaalde AI-achtige formuleringen of opvallend snel afgerond werk, in plaats van op een score van detectiesoftware. Zulke signalen kunnen reden zijn om werk nader te bekijken, maar vormen op zichzelf geen bewijs. Uit de beschikbare berichtgeving blijkt niet hoe vaak vermoedens terecht zijn of overtredingen onopgemerkt blijven.
9
33
Ook zonder AI kan iemand slordige of bewust slechte scores geven. Een specifieke vermeende bekentenis dat een beoordelaar opzettelijk slechte scores koos, is in de aangeleverde berichtgeving niet te verifiëren. De bredere conclusie is wel duidelijk: het etiket ‘door mensen beoordeeld’ zegt wie de feedback leverde, niet of elk oordeel betrouwbaar is. Ook de kwaliteit van die oordelen moet worden gecontroleerd.
1
4
Voor gebruikers speelt nog iets anders: beoordelaars bij Project Lily kunnen tekst uit echte gesprekken zien. De privacyfilter die OpenAI naar verluidt toepast, kan daarbij gevoelige details missen. Zorgvuldigheid is dus niet alleen belangrijk bij de scores, maar ook bij de omgang met gesprekken.
8
12