OpenAI skal ha fjernet flere kontraktører som brukte generativ KI i evalueringsarbeidet, fordi Project Lily er ment å levere selvstendige menneskelige vurderinger. I Project Lily skal hundrevis av kontraktører lese og vurdere reelle ChatGPT samtaler.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily beskrives av 404 Media som et system for menneskelig gjennomgang, der kontraktører vurderer ChatGPT-svar for å bidra til å forbedre senere modellatferd. Det forklarer hvorfor kontraktører angivelig ble fjernet etter å ha brukt generativ KI til selve vurderingen: Verdien i dataene skal komme fra uavhengige menneskelige skjønnsvurderinger. Dersom en modell leverer vurderingen, måler systemet ikke lenger like tydelig hva mennesker faktisk foretrekker. 19
20
Ifølge rapporteringen får vurdererne reelle ChatGPT-spørsmål og i enkelte tilfeller hele samtaler. De oppsummerer hva brukeren prøver å oppnå, sammenligner kandidatsvar og setter karakter på en skala fra 1 til 7. Det kan være opptil fire svar å vurdere per oppgave, med vekt på blant annet tone, overdreven smiger – ofte omtalt som sykofanti – og påstander som får modellen til å fremstå for menneskelig. Dette er altså ikke først og fremst en ren faktasjekk. 8
19
Slike vurderinger kan bli til preferansedata: strukturerte opplysninger om hvilket svar en person mener fungerer best i en bestemt situasjon. Dataene er nyttige i modelltrening bare dersom vurderingene er tilstrekkelig konsistente, opplyste og uavhengige.
Project Lily skal omfatte hundrevis av eksterne vurderere. De skal ha blitt rekruttert gjennom Crossing Hurdles og betalt via Mercor, og én vurderer oppga en timesats på over 50 dollar. Rapportering om OpenAIs bredere evalueringsvirksomhet omtaler dessuten over 10 000 kontraktører på tvers av vurderingsløypene. Det tallet bør ikke forstås som størrelsen på Project Lily alene. 19
6
En KI-vurderer kan være rask og kan ha en rolle i intern testing, men den besvarer noe annet enn en menneskelig preferansevurdering. En modell vil ofte gjenskape mønstre fra treningen sin, og kan favorisere svar med kjent formulering, stil eller underliggende antakelser.
Hvis vurderinger fra en modell – eller en nært beslektet modell – gjentatte ganger brukes til å belønne framtidige modellsvar, kan det oppstå en tilbakekoblingssløyfe:
Dette beviser ikke at all automatisk evaluering forringer en modell. Slik evaluering kan være nyttig når den er testet opp mot menneskelige vurderinger og brukt innen tydelige rammer. Men å erstatte mennesker i et arbeid som uttrykkelig er bestilt som menneskelige preferansedata, svekker uavhengigheten i treningssignalet. Det ser ut til å være bakgrunnen for det rapporterte forbudet.
Ifølge rapporteringen fikk veiledere beskjed om ikke å stole på KI-detektorer for tekst, som GPTZero. I stedet skulle de vurdere arbeidsmønstre og tekstene manuelt. Eksempler på varselsignaler var uvanlig ensartede formuleringer, særtrekk ved tegnsetting eller formatering og usannsynlig rask oppgaveløsning. 6
Ingen av disse signalene beviser alene at noen har brukt KI. En rask skribent kan være erfaren, og likt språk kan skyldes at alle følger samme vurderingsmal. Slike signaler bør derfor utløse nærmere kontroll, ikke uten videre være tilstrekkelig bevis for å fjerne noen fra et prosjekt.
Virksomheter unngår ofte å publisere detaljerte kriterier mot juks, fordi en presis sjekkliste også kan bli en oppskrift på å omgå kontrollene. En kontraktør kan for eksempel endre språk, legge inn kunstige pauser eller variere formateringen, mens selve vurderingen fortsatt er overlatt til en modell.
Samtidig har hemmelighold en kostnad. Når arbeidstakere ikke forstår hvordan en kvalitetsavgjørelse er tatt, blir feil vanskeligere å bestride. Et robust system trenger derfor fortrolige kontrollmetoder, men også klare regler, dokumenterte avgjørelser og en reell mulighet til å be om ny vurdering eller retting.
Mercor skal ha opplyst at bruk av KI for å utføre dette evalueringsarbeidet bryter med selskapets regler, og at bekreftede tilfeller gir umiddelbar fjerning fra det aktuelle prosjektet. Rapporteringen sier også at reglene mer generelt forbød KI-hjelp, inkludert verktøy brukt til å skrive tilbakemeldinger eller kommentarer. 6
40
Et rapportert tilfelle med bevisst dårlige vurderinger understreker et større poeng: «menneskelig tilbakemelding» er ikke automatisk pålitelig bare fordi et menneske har sendt den inn. En vurderer kan jobbe for fort, misforstå kriteriene, prioritere mengde framfor kvalitet, opptre i ond tro eller forsøke å spille på uoversiktlige kvalitetskontroller.
Dette er like mye et spørsmål om insentiver som teknologi. Utvikleren trenger gjennomtenkte og redelige vurderinger som faktisk kan forutsi bedre atferd for brukerne. Kontraktøren kan derimot i praksis bli belønnet mest for tempo, fullførte oppgaver eller for å unngå avvisning. Når disse interessene ikke sammenfaller, kan dataene bli støyende eller systematisk skjeve.
Menneskelig vurdering er fortsatt viktig når spørsmål er kontekstuelle, subjektive eller vanskelige å kontrollere automatisk. Men den fungerer best som et system med flere sikkerhetsnett, ikke som en enkel strøm av enkeltscorer. Praktiske tiltak kan være:
Hovedpoenget er enkelt: Preferansetrening er bare så pålitelig som prosessen som skaper preferansene. Menneskelige vurderere er ingen garanti for kvalitet, og KI-genererte vurderinger kan ikke uten videre erstatte uavhengig menneskelig tilbakemelding når målet er å forstå hva mennesker faktisk verdsetter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI skal ha fjernet flere kontraktører som brukte generativ KI i evalueringsarbeidet, fordi Project Lily er ment å levere selvstendige menneskelige vurderinger.
OpenAI skal ha fjernet flere kontraktører som brukte generativ KI i evalueringsarbeidet, fordi Project Lily er ment å levere selvstendige menneskelige vurderinger. I Project Lily skal hundrevis av kontraktører lese og vurdere reelle ChatGPT samtaler.
Saken viser at menneskelig tilbakemelding ikke automatisk er god data: Arbeidet må kontrolleres for hastverk, misforståelser og mulig manipulering.