OpenAI soll mehrere Auftragnehmer entfernt haben, die KI für die Bewertung von ChatGPT Antworten nutzten. Hunderte externe Prüfer sollen echte ChatGPT Unterhaltungen auswerten, Antworten auf einer Skala von 1 bis 7 bewerten und dabei vor allem Ton, Verhalten und übermäßige Gefälligkeit beurteilen.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily ist laut Recherchen von 404 Media ein Programm zur menschlichen Qualitätsprüfung: Auftragnehmer bewerten ChatGPT-Antworten, damit künftige Modellversionen besser auf Nutzer reagieren. Genau deshalb sollen Beschäftigte entfernt worden sein, die generative KI für diese Bewertung einsetzten. Der Wert der Daten soll aus eigenständigen menschlichen Urteilen entstehen. Liefert stattdessen ein Modell das Urteil, misst die Pipeline nicht mehr sauber, was Menschen bevorzugen. 19
20
Die Prüfer erhalten demnach echte ChatGPT-Anfragen und teils vollständige Unterhaltungen. Sie fassen die Absicht der Nutzer zusammen, vergleichen mögliche Antworten und vergeben Noten auf einer Skala von 1 bis 7. Pro Aufgabe können bis zu vier Antwortvarianten vorliegen. Im Mittelpunkt stehen Verhaltensaspekte wie Tonfall, übertriebene Schmeichelei beziehungsweise Anbiederung und zu menschlich wirkende Selbstdarstellung – nicht bloß die sachliche Richtigkeit. 8
19
Aus solchen Bewertungen können Präferenzdaten entstehen: strukturierte Angaben dazu, welche Antwort ein Mensch in einem bestimmten Kontext für besser hält. Für das Training sind sie nur dann aussagekräftig, wenn die Urteile konsistent, informiert und unabhängig zustande kommen.
Project Lily soll Hunderte externe Prüfer beschäftigen. Den Berichten zufolge werden sie über Crossing Hurdles rekrutiert und über Mercor bezahlt; ein Prüfer nannte eine Vergütung von mehr als 50 US-Dollar pro Stunde. Für OpenAIs breiteres Bewertungssystem ist separat von mehr als 10.000 Auftragnehmern die Rede. Diese Zahl ist nicht mit der Größe von Project Lily gleichzusetzen. 19
6
Eine KI kann Bewertungen schnell erstellen und für interne Tests durchaus nützlich sein. Sie beantwortet jedoch eine andere Frage als eine menschliche Präferenzbewertung. Ein Modell neigt dazu, Muster aus seinem Training zu wiederholen und Antworten mit vertrauter Sprache, Stil oder Annahmen zu bevorzugen.
Wird die Ausgabe eines Modells – oder eines eng verwandten Modells – wiederholt genutzt, um spätere Modellausgaben zu belohnen, kann eine Rückkopplungsschleife entstehen:
Das beweist nicht, dass jede KI-gestützte Bewertung ein Modell verschlechtert. Automatisierte Evaluation kann wertvoll sein, wenn sie gegen menschliche Urteile validiert wird und klar begrenzt bleibt. Ersetzt sie aber eine Arbeit, die ausdrücklich als menschliche Präferenzdatenerhebung beauftragt wurde, schwächt sie die Unabhängigkeit des Trainingssignals. Das ist offenbar der Grund für das berichtete Verbot.
Laut Berichten sollten Vorgesetzte sich nicht auf KI-Textdetektoren wie GPTZero stützen. Stattdessen sollten sie Arbeitsmuster und Texte selbst prüfen – etwa auffallend einheitliche Formulierungen, Satzzeichen- oder Formatierungsmuster sowie unrealistisch schnelle Bearbeitungszeiten. 6
Das hat eine klare Grenze: Keines dieser Merkmale beweist für sich allein KI-Nutzung. Wer schnell schreibt, kann schlicht erfahren sein; ähnliche Formulierungen können auf eine gemeinsame Bewertungsanleitung zurückgehen. Solche Hinweise sollten daher Anlass für eine Prüfung sein, nicht automatisch als ausreichender Beleg für den Ausschluss gelten.
Organisationen veröffentlichen detaillierte Anti-Manipulationskriterien meist nicht. Eine präzise Checkliste könnte zur Anleitung werden, wie man die Kontrollen umgeht – etwa durch bewusst veränderte Formulierungen, künstliche Pausen oder andere Formatierungen, während die eigentliche Bewertung weiterhin von einem Modell stammt.
Gleichzeitig birgt Geheimhaltung Risiken. Wenn Beschäftigte nicht nachvollziehen können, wie eine Qualitätsentscheidung zustande kam, lassen sich Fehlentscheidungen schwerer anfechten. Ein belastbares System braucht deshalb vertrauliche Erkennungsmethoden, aber auch klare Regeln, dokumentierte Entscheidungen und eine echte Möglichkeit zur Korrektur oder Berufung.
Mercor soll erklärt haben, dass der Einsatz von KI zur Durchführung dieser Bewertungsarbeit gegen die Regeln verstößt. Bestätigte Fälle führten demnach zum sofortigen Ausschluss aus dem jeweiligen Projekt. Den Berichten zufolge untersagten die Vorgaben KI-Hilfen generell – auch Werkzeuge, die Feedback oder Kommentare formulieren. 6
40
Der berichtete Fall absichtlich schlechter Bewertungen zeigt das grundsätzliche Problem: „Menschliches Feedback“ ist nicht automatisch zuverlässig, nur weil ein Mensch es eingereicht hat. Prüfer können hastig arbeiten, Vorgaben missverstehen, auf möglichst hohen Durchsatz optimieren, absichtlich schaden oder intransparente Qualitätssysteme austricksen wollen.
Das ist ebenso ein Anreizproblem wie ein technisches Problem. Der Modellentwickler braucht sorgfältige, gutgläubige und abgestimmte Urteile, die besseres Verhalten in der Praxis vorhersagen. Auftragnehmer werden möglicherweise vor allem für Geschwindigkeit, erledigte Aufgaben oder das Vermeiden einer Ablehnung belohnt. Fallen diese Anreize auseinander, können die Daten verrauscht oder systematisch verzerrt sein.
Menschliche Prüfung bleibt wichtig, wenn Urteile kontextabhängig, subjektiv oder automatisch schwer zu überprüfen sind. Am besten funktioniert sie jedoch als System mehrerer Kontrollen statt als bloße Sammlung einzelner Noten. Sinnvolle Maßnahmen sind:
Die zentrale Erkenntnis ist einfach: Präferenztraining ist nur so vertrauenswürdig wie der Prozess, der diese Präferenzen erzeugt. Menschliche Prüfer sind keine automatische Qualitätsgarantie – und KI-generierte Urteile können unabhängliches menschliches Feedback nicht einfach ersetzen, wenn ein Modell lernen soll, was Menschen tatsächlich wichtig ist.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
OpenAI soll mehrere Auftragnehmer entfernt haben, die KI für die Bewertung von ChatGPT Antworten nutzten.
OpenAI soll mehrere Auftragnehmer entfernt haben, die KI für die Bewertung von ChatGPT Antworten nutzten. Hunderte externe Prüfer sollen echte ChatGPT Unterhaltungen auswerten, Antworten auf einer Skala von 1 bis 7 bewerten und dabei vor allem Ton, Verhalten und übermäßige Gefälligkeit beurteilen.
Der Fall zeigt ein grundlegendes Problem beim KI Training: Menschliches Feedback ist nicht automatisch verlässlich.