Secondo le ricostruzioni, alcuni contractor sono stati rimossi dopo aver usato l’IA per svolgere valutazioni che Project Lily affida appositamente al giudizio umano indipendente. Project Lily coinvolgerebbe centinaia di revisori esterni che leggono e valutano conversazioni reali di ChatGPT; il dato di oltre 10.000 c...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Secondo quanto riportato da 404 Media, Project Lily è un’operazione di revisione umana in cui contractor valutano le risposte di ChatGPT per contribuire a migliorarne il comportamento futuro. È proprio questa finalità a spiegare l’allontanamento segnalato di persone che avrebbero usato l’IA generativa per eseguire le valutazioni: il valore dei dati dovrebbe derivare dal giudizio indipendente di esseri umani. Se il giudizio arriva da un modello, la procedura non misura più in modo pulito ciò che le persone preferiscono. 19
20
Nel flusso di lavoro descritto dalle fonti, i revisori ricevono prompt reali di ChatGPT e, in alcuni casi, conversazioni complete. Devono riassumere l’intento dell’utente, confrontare le risposte candidate e assegnare punteggi su una scala da 1 a 7. Per ciascun compito possono esserci fino a quattro risposte da esaminare; l’attenzione è rivolta a elementi comportamentali come tono, eccessiva adulazione o sycophancy e affermazioni troppo antropomorfe, non soltanto all’accuratezza dei fatti. 8
19
Queste valutazioni possono diventare dati di preferenza: una registrazione strutturata di quale risposta una persona ritenga migliore in uno specifico contesto. Per essere utile nell’orientare un modello verso comportamenti desiderati, questo segnale deve essere coerente, informato e soprattutto indipendente.
Project Lily coinvolgerebbe centinaia di revisori esterni, reclutati tramite Crossing Hurdles e retribuiti attraverso Mercor; un revisore avrebbe riferito una paga superiore a 50 dollari l’ora. Separatamente, le ricostruzioni sulle più ampie operazioni di valutazione collegate a OpenAI parlano di oltre 10.000 contractor: questa cifra non va interpretata come la dimensione del solo Project Lily. 19
6
Un sistema di IA che svolge da valutatore può essere rapido e talvolta utile nei test interni, ma risponde a una domanda diversa rispetto a una revisione delle preferenze umane. Un modello tende infatti a riprodurre schemi, stili e assunzioni appresi durante il proprio addestramento.
Se l’output di un modello — o di un modello strettamente correlato — viene usato ripetutamente per premiare le risposte dei modelli successivi, può crearsi un circuito di retroazione:
Questo non dimostra che ogni uso dell’IA nella valutazione peggiori un modello. Le valutazioni automatiche possono essere preziose se convalidate rispetto al giudizio umano e impiegate entro limiti chiari. Ma sostituirle a un compito commissionato proprio per produrre dati di preferenza umana indebolisce l’indipendenza del segnale di addestramento: è questa, apparentemente, la ragione del divieto riportato.
Secondo le fonti, ai supervisori sarebbe stato chiesto di non basarsi su rilevatori di testi generati dall’IA come GPTZero. Al loro posto, avrebbero dovuto esaminare manualmente i pattern di lavoro e gli elaborati, cercando indizi quali formulazioni insolitamente uniformi, particolarità di punteggiatura o formattazione e tempi di completamento poco plausibili. 6
Il limite è evidente: nessuno di questi elementi, preso singolarmente, dimostra che una persona abbia usato l’IA. Un revisore può essere veloce perché esperto; espressioni simili possono dipendere da una griglia condivisa. Per questo tali segnali dovrebbero essere un motivo per approfondire, non una prova automatica sufficiente per escludere qualcuno da un progetto.
In genere le organizzazioni evitano di pubblicare criteri dettagliati contro gli abusi perché una lista precisa diventerebbe un manuale per aggirare i controlli. Un contractor potrebbe modificare il lessico, inserire pause artificiali o cambiare formato, continuando comunque a delegare il giudizio a un modello.
La riservatezza, però, porta con sé un rischio: quando chi lavora non sa come sia stata raggiunta una decisione sulla qualità, gli errori diventano più difficili da contestare. Un sistema credibile richiede metodi di rilevazione riservati, ma anche regole comprensibili, decisioni documentate e una reale possibilità di ricorso o correzione.
Mercor avrebbe dichiarato che l’uso dell’IA per svolgere questo lavoro di valutazione viola la propria politica e che i casi confermati comportano l’immediata rimozione dal progetto interessato. Le fonti riferiscono inoltre che il divieto riguarderebbe più in generale l’assistenza dell’IA, inclusi gli strumenti usati per redigere feedback o commenti. 6
40
Un caso riportato di valutazioni deliberatamente scadenti rende chiaro il punto più generale: il “feedback umano” non è affidabile per definizione solo perché è stato inserito da una persona. Un revisore può lavorare in fretta, fraintendere i criteri, puntare solo al volume di attività, agire in malafede o cercare di aggirare sistemi di qualità opachi.
È un problema di incentivi oltre che tecnico. Lo sviluppatore del modello ha bisogno di giudizi calibrati e in buona fede, capaci di predire un comportamento migliore nel mondo reale. Il contractor potrebbe invece essere spinto soprattutto da velocità, completamento dei compiti o necessità di evitare rifiuti. Quando questi incentivi divergono, i dati possono diventare rumorosi o essere distorti in modo sistematico.
La revisione umana rimane importante per giudizi contestuali, soggettivi o difficili da verificare automaticamente. Funziona però meglio come sistema di controlli incrociati, non come una semplice sequenza di punteggi individuali. Alcune misure pratiche sono:
La lezione centrale è semplice: l’addestramento basato sulle preferenze è affidabile quanto il processo che produce tali preferenze. I revisori umani non sono una garanzia automatica di qualità; e i giudizi generati dall’IA non possono sostituire senza conseguenze il feedback umano indipendente quando l’obiettivo è capire che cosa le persone apprezzano davvero.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Secondo le ricostruzioni, alcuni contractor sono stati rimossi dopo aver usato l’IA per svolgere valutazioni che Project Lily affida appositamente al giudizio umano indipendente.
Secondo le ricostruzioni, alcuni contractor sono stati rimossi dopo aver usato l’IA per svolgere valutazioni che Project Lily affida appositamente al giudizio umano indipendente. Project Lily coinvolgerebbe centinaia di revisori esterni che leggono e valutano conversazioni reali di ChatGPT; il dato di oltre 10.000 contractor riguarda invece l’insieme delle pipeline di valutazione collegate a O...
Il caso mette in luce un limite più ampio: il feedback inserito da una persona non è automaticamente affidabile.