Według doniesień wykonawców usuwano z pracy przy ocenianiu ChatGPT, jeśli korzystali z AI, ponieważ Project Lily ma dostarczać niezależnych ocen ludzi, a nie opinii wygenerowanych przez modele. W Project Lily setki zewnętrznych recenzentów mają analizować prawdziwe rozmowy z ChatGPT i oceniać do czterech odpowiedzi...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, opisywany przez 404 Media, to proces oceny prowadzonej przez ludzi: wykonawcy analizują odpowiedzi ChatGPT, aby pomóc poprawiać przyszłe zachowanie modelu. To wyjaśnia, dlaczego osoby, które miały posłużyć się generatywną AI do wykonania tych ocen, były według doniesień usuwane z projektu. Wartością takich danych ma być niezależny ludzki osąd. Jeżeli osąd dostarcza model, proces przestaje wprost mierzyć to, co faktycznie preferują ludzie. 19
20
Według opisywanego procesu recenzenci otrzymują prawdziwe prompty użytkowników ChatGPT, a czasem także całe rozmowy. Mają streścić intencję użytkownika, porównać warianty odpowiedzi i wystawić ocenę w skali od 1 do 7. W jednym zadaniu może pojawić się do czterech propozycji odpowiedzi. Nacisk ma dotyczyć cech zachowania modelu — m.in. tonu, nadmiernego schlebiania użytkownikowi czy zbyt „ludzkich” deklaracji — a nie wyłącznie poprawności faktograficznej. 8
19
Takie noty mogą stać się danymi preferencyjnymi: uporządkowanym zapisem tego, którą odpowiedź człowiek uznaje za lepszą w konkretnym kontekście. Są przydatne do dostrajania modelu tylko wtedy, gdy oceny są dostatecznie spójne, świadome i niezależne.
W Project Lily ma pracować kilkuset zewnętrznych recenzentów. Według relacji są rekrutowani przez Crossing Hurdles, a wynagrodzenia obsługuje Mercor; jeden z recenzentów mówił o stawce przekraczającej 50 dolarów za godzinę. Osobno w doniesieniach o szerszych operacjach ewaluacyjnych OpenAI pojawia się liczba ponad 10 tys. wykonawców we wszystkich potokach oceniania. Nie należy jednak traktować jej jako wielkości samego Project Lily. 19
6
Model AI może oceniać szybko i bywa przydatny w testach wewnętrznych, ale odpowiada wtedy na inne pytanie niż człowiek wyrażający własną preferencję. Model ma skłonność do odtwarzania wzorców wyniesionych z treningu i może premiować odpowiedzi o znanym mu stylu, frazach lub założeniach.
Jeśli wyniki modelu — albo systemu blisko z nim powiązanego — są regularnie używane do nagradzania kolejnych odpowiedzi, może powstać pętla sprzężenia zwrotnego:
Nie znaczy to, że każda automatyczna ewaluacja szkodzi modelowi. Może być cenna, jeśli została sprawdzona względem ocen ludzi i ma jasno określone ograniczenia. Zastąpienie nią pracy zamówionej właśnie jako źródło ludzkich preferencji osłabia jednak niezależność danych treningowych — i to najpewniej jest powodem opisywanego zakazu.
Według doniesień przełożeni mieli nie opierać się na detektorach tekstu AI, takich jak GPTZero. Zamiast tego mieli analizować wzorce pracy i same odpowiedzi, zwracając uwagę m.in. na nienaturalnie jednolite sformułowania, powtarzalne znaki interpunkcyjne lub formatowanie oraz niewiarygodnie szybkie kończenie zadań. 6
Każdy z tych sygnałów ma oczywiste ograniczenia: szybki autor może być po prostu doświadczony, a podobne sformułowania mogą wynikać ze wspólnej instrukcji oceny. Dlatego takie wskaźniki powinny być punktem wyjścia do sprawdzenia, a nie samodzielnym dowodem wystarczającym do usunięcia kogoś z projektu.
Organizacje zwykle nie publikują dokładnych metod wykrywania obchodzenia zasad, bo gotowa lista kontrolna szybko stałaby się instrukcją ich omijania. Wykonawca mógłby zmienić styl, celowo zwalniać tempo albo modyfikować format, nadal zlecając faktyczny osąd modelowi.
Taka poufność rodzi jednak własne ryzyko. Jeśli pracownik nie wie, jak podjęto decyzję jakościową, trudniej mu zakwestionować pomyłkę. Trwały system kontroli wymaga więc niejawnych metod wykrywania, ale także jasnych reguł, udokumentowanych decyzji oraz realnej ścieżki odwołania lub korekty.
Mercor miał przekazać, że używanie AI do wykonywania tej pracy narusza zasady, a potwierdzone przypadki skutkują natychmiastowym usunięciem z danego projektu. Z relacji wynika również, że zakaz obejmował szerzej narzędzia AI pomagające pisać feedback lub komentarze. 6
40
Ludzki feedback nie staje się automatycznie wiarygodny tylko dlatego, że ocenę wpisała osoba. Recenzent może się spieszyć, źle rozumieć kryteria, optymalizować pracę pod liczbę wykonanych zadań, działać w złej wierze albo próbować rozgrywać nieprzejrzysty system kontroli jakości.
To problem bodźców równie mocno jak technologii. Twórca modelu potrzebuje skalibrowanych, rzetelnych ocen, które przewidują lepsze zachowanie systemu w praktyce. Wykonawca może natomiast być wynagradzany przede wszystkim za tempo, ukończenie zadania lub unikanie odrzucenia. Gdy te cele się rozchodzą, dane stają się zaszumione albo systematycznie zniekształcone.
Ludzka ocena pozostaje ważna tam, gdzie werdykt zależy od kontekstu, jest subiektywny albo trudny do automatycznego zweryfikowania. Najlepiej działa jednak jako system wzajemnych kontroli, a nie prosty strumień pojedynczych ocen. Przydatne są między innymi:
Wniosek jest prosty: trening na preferencjach jest tak wiarygodny, jak proces tworzenia tych preferencji. Człowiek nie jest automatyczną gwarancją jakości, a oceny wygenerowane przez AI nie mogą po prostu zastąpić niezależnego ludzkiego feedbacku, jeśli celem jest poznanie tego, co naprawdę cenią użytkownicy.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Według doniesień wykonawców usuwano z pracy przy ocenianiu ChatGPT, jeśli korzystali z AI, ponieważ Project Lily ma dostarczać niezależnych ocen ludzi, a nie opinii wygenerowanych przez modele.
Według doniesień wykonawców usuwano z pracy przy ocenianiu ChatGPT, jeśli korzystali z AI, ponieważ Project Lily ma dostarczać niezależnych ocen ludzi, a nie opinii wygenerowanych przez modele. W Project Lily setki zewnętrznych recenzentów mają analizować prawdziwe rozmowy z ChatGPT i oceniać do czterech odpowiedzi w skali od 1 do 7; ponad 10 tys.
Sprawa pokazuje, że sam udział człowieka nie gwarantuje jakości danych: potrzebne są kalibracja oceniających, kontrole jakości, równoległe recenzje i procedury odwoławcze.