Der Widerspruch klingt zunächst kurios: Menschen, die OpenAIs KI verbessern sollen, verlieren ihren Auftrag, weil sie selbst KI verwenden. Der entscheidende Punkt ist jedoch die Unabhängigkeit der Bewertung. OpenAI hat Berichten zufolge mehrere Auftragnehmer aus Bewertungsprojekten entfernt, nachdem sie KI für ihre Arbeit eingesetzt hatten. Project Lily ist ein dokumentiertes Programm für menschliche Rückmeldungen zu ChatGPT; die Berichte belegen aber nicht, dass alle entfernten Personen diesem Projekt zugeteilt waren.
16
13
Was Prüfer bei Project Lily tun
Project Lily setzt Berichten zufolge Hunderte externe Kräfte ein. Sie prüfen echte ChatGPT-Anfragen und können dabei teils auch den Gesprächsverlauf sehen. Die Rekrutierung läuft den Berichten nach über Crossing Hurdles, die Bezahlung über Mercor. Eine Person gab an, mehr als 50 US-Dollar pro Stunde zu verdienen – daraus lässt sich kein allgemeiner Stundensatz ableiten.
2
20
Die Prüfer fassen zunächst zusammen, was die nutzende Person erreichen wollte. Anschließend beurteilen sie bis zu vier mögliche ChatGPT-Antworten, schreiben Kritik und vergeben Bewertungen auf einer Skala von 1 bis 7. Dabei geht es unter anderem um den Ton, formelhafte Sprache und übertriebene Zustimmung. Die Rückmeldungen sollen helfen, das künftige Verhalten der Modelle zu verbessern.
4
11
3
1
Warum eine KI als Hilfsmittel hier problematisch ist
Menschliche Prüfer sollen eigenständig erkennen, ob eine Antwort zur Anfrage passt oder sich beispielsweise zu gefällig anhört. Schreibt stattdessen eine andere KI die Kritik oder bestimmt die Punktzahl, kann diese unabhängige Perspektive verloren gehen. Das gefährdet den Wert des Feedbacks – es beweist nicht, dass eine bestimmte KI-gestützte Bewertung einem Modell tatsächlich geschadet hat.
4
16
Den berichteten Anweisungen zufolge dürfen Prüfer KI weder zur Begutachtung noch zum Schreiben ihrer Rückmeldungen verwenden; ausdrücklich genannt werden auch Grammarly und KI-Übersetzungsfunktionen. Selbst Personen, die die Arbeit anderer Auftragnehmer kontrollieren, sollen keine KI-Erkennungstools nutzen. Die Anweisungen bezeichnen solche Detektoren als unzuverlässig.
13
9
Verdacht ist noch kein Beweis
Vorgesetzte achten den Berichten nach eher auf wiederkehrende, KI-typische Formulierungen oder auffällig kurze Bearbeitungszeiten als auf Detektor-Ergebnisse. Solche Muster können Anlass für eine nähere Prüfung sein, belegen für sich genommen aber keinen KI-Einsatz. Wie häufig Verstöße korrekt erkannt oder übersehen werden, geht aus den vorliegenden Berichten nicht hervor.
9
33
Auch ohne KI kann ein Mensch nachlässig oder bewusst schlecht bewerten. Die in der Fragestellung erwähnte konkrete Aussage eines Auftragnehmers, absichtlich schlechte Bewertungen vergeben zu haben, lässt sich anhand der vorliegenden Quellen nicht überprüfen. Die grundsätzliche Lehre bleibt: „Von Menschen bewertet“ sagt aus, wer das Feedback abgegeben hat – nicht, ob jedes Urteil verlässlich ist. Dafür muss auch die Qualität der Bewertungen geprüft werden.
1
4
Für ChatGPT-Nutzer kommt eine weitere Frage hinzu: Bei Project Lily können Prüfer echte Gesprächsinhalte sehen. OpenAIs berichteter Datenschutzfilter soll persönliche Angaben entfernen, kann sensible Details aber übersehen. Damit zählt nicht nur die Qualität der Bewertungen, sondern auch der sorgfältige Umgang mit den geprüften Unterhaltungen.
8
12