Därför tog OpenAI bort granskare som använde AI för att bedöma ChatGPT
OpenAI uppges ha tagit bort uppdragstagare som använde AI för arbete som skulle ge mänsklig återkoppling om ChatGPT. I Project Lily bedömer granskare ChatGPT svar på en skala från 1 till 7.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
OpenAI uppges ha tagit bort uppdragstagare som använde AI för arbete som skulle ge mänsklig återkoppling om ChatGPT.
I Project Lily bedömer granskare ChatGPT svar på en skala från 1 till 7. En arbetare har uppgett en ersättning på över 50 dollar i timmen, men det är ingen bekräftad generell nivå.
Arbetsledare uppges granska misstänkta mönster i arbetet i stället för att förlita sig på AI detektorer.
Why did OpenAI remove contractors from Project Lily for using AI tools to evaluate ChatGPT responses, how does the project recruit and pay hAI-generated editorial illustration; it does not depict a Project Lily reviewer or workplace.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: Why did OpenAI remove contractors from Project Lily for using AI tools to evaluate ChatGPT responses, how does the project recruit and pay h. Article summary: OpenAI reportedly removed contractors because Project Lily pays for independent *human* judgments about ChatGPT replies; using AI to produce those judgments breaks the project’s rules and risks feeding model-generated ju. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
openai.com
OpenAI har enligt rapportering tagit bort uppdragstagare som använde AI för att utvärdera företagets modeller. Problemet var inte att de använde AI i största allmänhet, utan att arbetet skulle ge självständiga mänskliga omdömen om ChatGPT:s svar. Project Lily är ett beskrivet exempel på sådan granskning, men det är inte fastställt att alla som togs bort arbetade just där.1613
Så fungerar granskningen
Inom Project Lily uppges hundratals externa granskare läsa verkliga frågor till ChatGPT och ibland även den omgivande konversationen. Enligt rapporterna rekryteras de via Crossing Hurdles och får betalt via Mercor. En arbetare har uppgett en ersättning på mer än 50 dollar i timmen; det säger inte vad alla granskare tjänar.220
Granskaren sammanfattar vad användaren försökte få hjälp med och bedömer sedan möjliga ChatGPT-svar med kommentarer och betyg på en skala från 1 till 7. En uppgift kan omfatta upp till fyra svar. Bedömningen gäller bland annat ton, stelt eller robotlikt språk och om modellen håller med användaren alltför lättvindigt. Återkopplingen är tänkt att bidra till bättre framtida modellsvar.41131
Varför spelar det roll vem som sätter betyget?
En människa kan göra en fristående bedömning av om ett svar faktiskt hjälper användaren. Om ett annat AI-system i stället skriver kommentaren eller väljer betyget kan återkopplingen spegla AI-genererade preferenser snarare än granskarens eget omdöme. Det är en risk för återkopplingens värde – inte bevis för att ett visst AI-assisterat betyg har skadat modellen.416
De rapporterade instruktionerna förbjuder AI-hjälp för granskning och skriftlig återkoppling, även funktioner i Grammarly och AI-översättning. Granskare som kontrollerar andras arbete ska inte heller använda verktyg som påstår sig upptäcka AI-text; instruktionerna beskriver dem som opålitliga.139
Hur upptäcks misstänkt AI-användning?
Arbetsledare uppges titta efter exempelvis upprepade formuleringar som liknar AI-text eller ovanligt snabbt färdiga uppgifter, snarare än att lita på en AI-detektors utslag. Sådana tecken kan motivera en närmare granskning, men är inte bevis i sig. Rapporteringen visar inte hur ofta misstankar visar sig vara riktiga eller hur ofta överträdelser missas.933
Även ett betyg satt helt utan AI kan vara slarvigt eller avsiktligt felaktigt. Det tillgängliga underlaget bekräftar inte den specifika uppgiften om en granskare som skulle ha medgett att hen medvetet satte dåliga betyg. Det går därför inte att slå fast omständigheterna eller hur vanligt det skulle vara. Lärdomen är mer begränsad: etiketten mänskligt bedömt garanterar inte att varje bedömning är tillförlitlig.14
För användare finns också en separat integritetsfråga. Project Lilys granskare kan få se verklig konversationstext, och OpenAI:s rapporterade integritetsfilter kan missa känsliga uppgifter. Därför spelar det roll både hur omdömena kontrolleras och hur användarnas samtal hanteras.812
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Därför tog OpenAI bort granskare som använde AI för att bedöma ChatGPT"?
OpenAI uppges ha tagit bort uppdragstagare som använde AI för arbete som skulle ge mänsklig återkoppling om ChatGPT.
What are the key points to validate first?
OpenAI uppges ha tagit bort uppdragstagare som använde AI för arbete som skulle ge mänsklig återkoppling om ChatGPT. I Project Lily bedömer granskare ChatGPT svar på en skala från 1 till 7. En arbetare har uppgett en ersättning på över 50 dollar i timmen, men det är ingen bekräftad generell nivå.
What should I do next in practice?
Arbetsledare uppges granska misstänkta mönster i arbetet i stället för att förlita sig på AI detektorer.