OpenAI skal ifølge 404 Media have fjernet flere kontraktører, der brugte AI til at udføre bedømmelsesarbejde i Project Lily, fordi programmet er tænkt som en kilde til uafhængige menneskelige vurderinger. I Project Lily læser hundredvis af kontraktører angiveligt reelle ChatGPT samtaler og bedømmer svar på en skala...
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily er ifølge 404 Media et program med menneskelig gennemgang, hvor kontraktører vurderer ChatGPT-svar for at hjælpe med at forbedre modellens fremtidige adfærd. Det forklarer, hvorfor kontraktører angiveligt blev fjernet, når de brugte generativ AI til selve vurderingen: Værdien af dataene skal komme fra selvstændige menneskelige vurderinger. Leverer en model i stedet vurderingen, måler processen ikke længere klart, hvad mennesker foretrækker. 19
20
Anmelderne får angiveligt rigtige ChatGPT-prompter og i nogle tilfælde hele samtaler. De skal opsummere brugerens hensigt, sammenligne mulige svar og give karakterer på en skala fra 1 til 7. Omtalen beskriver op til fire svarforslag pr. opgave og et fokus på adfærd – for eksempel tone, overdreven smiger eller sycophancy og påstande, der får modellen til at fremstå for menneskelig – frem for blot faktuel korrekthed. 8
19
Sådanne karakterer kan blive til præferencedata: en struktureret registrering af, hvilket svar et menneske vurderer som bedst i en bestemt sammenhæng. Dataene er kun brugbare til at tilpasse en model mod den ønskede adfærd, hvis vurderingerne er tilstrækkeligt ensartede, kvalificerede og uafhængige.
Project Lily omfatter ifølge omtalen hundredvis af eksterne anmeldere. De beskrives som rekrutteret gennem Crossing Hurdles og betalt via Mercor, og én anmelder oplyste en betaling på over 50 dollar i timen. Separat omtale af OpenAI's bredere evalueringsarbejde nævner over 10.000 kontraktører på tværs af virksomhedens bedømmelsespipelines; det tal bør ikke læses som størrelsen på Project Lily alene. 19
6
En AI-bedømmer kan være hurtig og i nogle tilfælde nyttig til intern test, men den besvarer et andet spørgsmål end en menneskelig præferencevurdering. En model vil typisk gentage mønstre fra sin træning og kan foretrække svar med velkendte formuleringer, stiltræk eller antagelser.
Hvis output fra en model – eller en nært beslægtet model – igen og igen bruges til at belønne fremtidige modeloutput, kan der opstå en feedbacksløjfe:
Det beviser ikke, at enhver brug af AI til evaluering forringer en model. Automatisk evaluering kan være værdifuld, når den er valideret op imod menneskelige vurderinger og bruges inden for tydelige rammer. Men at erstatte mennesker i en opgave, der specifikt er bestilt som data om menneskelige præferencer, svækker træningssignalets uafhængighed. Det er tilsyneladende baggrunden for det rapporterede forbud.
Ifølge omtalen fik supervisorer besked på ikke at basere sig på AI-detektorer som GPTZero. I stedet skulle de gennemgå arbejdsmønstre og de skriftlige leverancer manuelt, herunder tegn som usædvanligt ensartede formuleringer, tegnsætning eller formatering og usandsynligt hurtig opgaveløsning. 6
Metoden har en åbenlys begrænsning: Ingen af disse tegn beviser i sig selv, at en person har brugt AI. En hurtig skribent kan være erfaren, og lignende sprog kan skyldes en fælles vejledning. Derfor afhænger en troværdig praksis af, at signaler bruges som anledning til nærmere undersøgelse – ikke som tilstrækkeligt bevis for at fjerne en person fra et projekt.
Organisationer undgår normalt at offentliggøre detaljerede kriterier mod snyd, fordi en præcis tjekliste hurtigt kan blive en manual til at omgå kontrollen. Kontraktører kan ændre ordlyd, lægge kunstige pauser ind eller skifte formatering, mens de fortsat overlader vurderingen til en model.
Men hemmeligholdelse har også en pris. Hvis medarbejdere ikke ved, hvordan en kvalitetsafgørelse er nået frem til, er fejl sværere at anfægte. Et holdbart system kræver derfor fortrolige metoder til at opdage misbrug kombineret med klare regler, dokumenterede afgørelser og en reel mulighed for appel eller rettelse.
Mercor skal have oplyst, at brug af AI til dette evalueringsarbejde er i strid med virksomhedens politik, og at bekræftede tilfælde medfører øjeblikkelig fjernelse fra det pågældende projekt. Omtalen siger også, at reglerne bredere forbød AI-hjælp, herunder værktøjer til at skrive feedback eller kommentarer. 6
40
Den omtalte sag om bevidst dårlige bedømmelser understreger et større problem: “menneskelig feedback” er ikke nødvendigvis pålidelig, alene fordi et menneske har indtastet den. En anmelder kan skynde sig, misforstå vejledningen, optimere efter antal opgaver, handle i ond tro eller forsøge at spille et uigennemskueligt kvalitetssystem.
Det er lige så meget et incitamentsproblem som et teknisk problem. Modeludvikleren har brug for velafstemte vurderinger i god tro, som forudsiger bedre adfærd i virkelige brugssituationer. En kontraktør kan derimod primært blive belønnet for fart, gennemførte opgaver eller for at undgå afvisning. Når de incitamenter peger i forskellige retninger, kan dataene blive støjfyldte eller systematisk skæve.
Menneskelig gennemgang er fortsat vigtig ved vurderinger, der er kontekstafhængige, subjektive eller svære at verificere automatisk. Men den virker bedst som et system af kontrolmekanismer frem for en simpel strøm af enkeltkarakterer. Praktiske værn omfatter:
Hovedpointen er enkel: Præferencetræning er kun så troværdig som processen, der skaber præferencerne. Menneskelige anmeldere er ingen magisk garanti for kvalitet, og AI-genererede vurderinger kan ikke uden videre erstatte uafhængig menneskelig feedback, når målet er at lære, hvad mennesker faktisk værdsætter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI skal ifølge 404 Media have fjernet flere kontraktører, der brugte AI til at udføre bedømmelsesarbejde i Project Lily, fordi programmet er tænkt som en kilde til uafhængige menneskelige vurderinger.
OpenAI skal ifølge 404 Media have fjernet flere kontraktører, der brugte AI til at udføre bedømmelsesarbejde i Project Lily, fordi programmet er tænkt som en kilde til uafhængige menneskelige vurderinger. I Project Lily læser hundredvis af kontraktører angiveligt reelle ChatGPT samtaler og bedømmer svar på en skala fra 1 til 7.
Sagen viser, at menneskelig feedback ikke automatisk er pålidelig: Systemet kræver kontrol af kvalitet, incitamenter og uafhængighed, ikke blot menneskelige bedømmere.