OpenAI ska enligt uppgifter ha tagit bort flera kontraktörer som använde AI i granskningsarbetet, eftersom Project Lily är tänkt att fånga självständiga mänskliga bedömningar – inte AI genererad återkoppling. I Project Lily läser hundratals externa granskare riktiga ChatGPT konversationer, jämför svar och sätter bet...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily beskrivs av 404 Media som en verksamhet för mänsklig granskning, där kontraktörer bedömer ChatGPT-svar för att förbättra modellens framtida beteende. Det förklarar varför kontraktörer som använde generativ AI för själva bedömningen enligt uppgift togs bort: värdet i datan ska komma från oberoende mänskliga omdömen. Om en modell levererar omdömet går det inte längre att tydligt mäta vad människor faktiskt föredrar. 19
20
Granskarna får riktiga ChatGPT-promptar och i vissa fall hela konversationer. De sammanfattar användarens avsikt, jämför möjliga svar och sätter betyg på en skala från 1 till 7. En uppgift kan innehålla upp till fyra svarsalternativ. Fokus ligger enligt rapporteringen på beteenden som tonläge, överdrivet inställsamhet och alltför människoliknande påståenden – inte enbart på faktakorrekthet. 8
19
Betygen kan sedan bli så kallad preferensdata: strukturerade uppgifter om vilket svar en människa anser vara bäst i en viss situation. Sådan data kan användas för att styra en modell mot önskat beteende, men bara om bedömningarna är någorlunda konsekventa, välgrundade och självständiga.
Project Lily ska omfatta hundratals externa granskare. De uppges rekryteras via Crossing Hurdles och få betalt via Mercor; en granskare uppgav en ersättning på över 50 dollar i timmen. Siffran på fler än 10 000 kontraktörer som nämns i rapporteringen gäller däremot OpenAI:s bredare system för betygsättning och ska inte tolkas som storleken på Project Lily i sig. 19
6
En AI-bedömare kan vara snabb och användbar i interna tester, men den besvarar en annan fråga än en mänsklig preferensgranskning. Modellen tenderar att återskapa mönster från sin träning och kan gynna svar med välbekanta formuleringar, stilgrepp eller antaganden.
När en modell – eller en närbesläktad modell – upprepade gånger används för att belöna framtida modellsvar kan en återkopplingsslinga uppstå:
Det betyder inte att all AI-baserad utvärdering gör en modell sämre. Automatiserad utvärdering kan vara värdefull om den har validerats mot mänskliga bedömningar och används med tydliga begränsningar. Men att ersätta människor i ett arbete som uttryckligen beställts för att skapa mänsklig preferensdata försvagar oberoendet i träningssignalen. Det verkar vara skälet till att användningen förbjöds.
Enligt rapporteringen fick arbetsledare inte förlita sig på AI-detektorer för text, som GPTZero. I stället skulle de granska arbetsmönster och det skrivna materialet manuellt. Tecken kunde vara ovanligt likartade formuleringar, återkommande skiljetecken eller formatering samt orimligt snabb leverans. 6
Det finns en uppenbar begränsning: inget enskilt sådant tecken bevisar att någon har använt AI. En snabb skribent kan vara erfaren, och liknande formuleringar kan följa av en gemensam bedömningsmall. Därför behöver signaler av det här slaget skiljas från faktiskt underlag som räcker för att stänga av någon från ett projekt.
Organisationer brukar undvika att publicera detaljerade metoder för att upptäcka fusk, eftersom en exakt lista också blir en instruktion för hur den kan kringgås. Kontraktörer skulle kunna variera ordval, lägga in fördröjningar eller ändra formatering, samtidigt som de fortfarande låter en modell göra bedömningen.
Men sekretess medför också en risk. Om arbetstagare inte förstår hur ett kvalitetsbeslut har fattats blir felaktiga beslut svårare att bestrida. Ett hållbart system behöver därför kombinera konfidentiella kontrollmetoder med tydliga regler, dokumenterade beslut och en verklig möjlighet att överklaga eller rätta fel.
Mercor ska ha sagt att AI-användning för att utföra detta granskningsarbete bryter mot företagets regler och att bekräftade fall leder till omedelbar borttagning från det aktuella projektet. Reglerna ska enligt rapporteringen även ha förbjudit AI-stöd mer generellt, exempelvis verktyg som skriver återkoppling eller kommentarer. 6
40
Det rapporterade fallet med avsiktligt dåliga betyg pekar på en större svaghet: mänsklig återkoppling är inte automatiskt tillförlitlig bara för att en människa har skickat in den. En granskare kan skynda sig, missförstå instruktionerna, prioritera volym, agera i ond tro eller försöka spela mot otydliga kvalitetskontroller.
Det är lika mycket en fråga om incitament som om teknik. Modellutvecklaren behöver välkalibrerade och seriösa omdömen som förutsäger bättre beteende i verklig användning. Kontraktören kan däremot i första hand belönas för tempo, färdiga uppgifter eller för att undvika avslag. När dessa drivkrafter pekar åt olika håll kan datan bli brusig eller systematiskt snedvriden.
Mänsklig granskning är fortsatt viktig för omdömen som är kontextberoende, subjektiva eller svåra att kontrollera automatiskt. Men den fungerar bäst som ett system av kontroller, inte som en enkel ström av enskilda betyg. Exempel på skyddsåtgärder är:
Slutsatsen är enkel: preferensträning är bara så tillförlitlig som processen som skapar preferenserna. Mänskliga granskare är ingen automatisk kvalitetsgaranti, och AI-genererade omdömen kan inte utan vidare ersätta oberoende mänsklig återkoppling när målet är att förstå vad människor faktiskt värdesätter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI ska enligt uppgifter ha tagit bort flera kontraktörer som använde AI i granskningsarbetet, eftersom Project Lily är tänkt att fånga självständiga mänskliga bedömningar – inte AI genererad återkoppling.
OpenAI ska enligt uppgifter ha tagit bort flera kontraktörer som använde AI i granskningsarbetet, eftersom Project Lily är tänkt att fånga självständiga mänskliga bedömningar – inte AI genererad återkoppling. I Project Lily läser hundratals externa granskare riktiga ChatGPT konversationer, jämför svar och sätter betyg på en skala från 1 till 7.
Fallet visar att mänsklig återkoppling inte automatiskt är tillförlitlig: systemet behöver kontroller för kvalitet, incitament och oberoende – utöver att människor fyller i betyg.