OpenAI skal ha fjernet flere innleide medarbeidere som brukte KI til å evaluere selskapets modeller. Problemet var ikke at folk i et KI-selskap tok i bruk KI. Oppgaven deres var å gi selvstendige menneskelige vurderinger av ChatGPT-svar. Omtalen knytter fjerningene til OpenAIs bredere arbeid med innleide vurderere og beskriver Project Lily som ett program for menneskelig gjennomgang. Den dokumenterer ikke at alle som ble fjernet, jobbet i Project Lily.
16
13
Slik vurderes svarene i Project Lily
Ifølge omtalen lar Project Lily hundrevis av eksterne medarbeidere lese ekte spørsmål til ChatGPT og i noen tilfeller resten av samtalen. Vurdererne skal være rekruttert gjennom Crossing Hurdles og få betalt via Mercor. Én medarbeider har oppgitt en timelønn på over 50 dollar, men det er ikke en dokumentert sats for alle.
2
20
Vurdereren oppsummerer først hva brukeren forsøkte å få hjelp til. Deretter får vedkommende vurdere og kommentere opptil fire mulige ChatGPT-svar på en skala fra 1 til 7. Blant det som vurderes, er tone, robotaktige formuleringer og om svaret er for ivrig etter å si seg enig. Poeng og skriftlige kommentarer skal bidra til å forbedre hvordan modellene svarer senere.
4
11
3
1
Hvorfor KI-hjelp undergraver oppgaven
En menneskelig vurderer kan gi et uavhengig blikk på om et svar faktisk hjelper brukeren, eller bare høres overdrevent medgjørlig ut. Hvis en annen KI skriver kritikken eller velger poengsummen, kan tilbakemeldingen i stedet gjenspeile en modells preferanser. Det kan svekke verdien av vurderingen, men betyr ikke at en bestemt KI-assistert poengsum beviselig har skadet en modell.
4
16
De omtalte instruksene forbyr bruk av KI til å gjennomgå arbeid eller skrive tilbakemeldinger, også funksjoner i Grammarly og KI-oversettelse. Vurderere som kontrollerer andres arbeid, skal heller ikke bruke KI-detektorer. Instruksene beskriver slike verktøy som upålitelige.
13
9
Hvordan mistanke oppstår – og hva den ikke beviser
Ledere skal ifølge omtalen se etter mønstre som gjentakende, KI-pregede formuleringer eller uvanlig rask gjennomføring, fremfor å stole på en detektors poengsum. Det kan gi grunn til å undersøke et arbeid nærmere, men er ikke bevis alene. Kildene viser ikke hvor ofte KI-bruk blir riktig oppdaget, eller hvor ofte den overses.
9
33
At en vurdering er skrevet av et menneske, er heller ingen garanti for at den er god. En person kan gi en dårlig poengsum med vilje eller arbeide skjødesløst. Den konkrete påståtte innrømmelsen om å velge dårlige vurderinger med vilje er ikke bekreftet i den tilgjengelige dokumentasjonen. Derfor kan verken omstendighetene eller omfanget fastslås her. Poenget er likevel klart: «menneskelig vurdert» sier hvem som ga tilbakemeldingen, ikke om vurderingen er pålitelig. Kvaliteten på vurderingene må også kontrolleres.
1
4
For brukere reiser Project Lily et eget spørsmål om personvern. Vurdererne kan få se tekst fra ekte samtaler, og OpenAIs omtalte personvernfilter kan overse sensitive opplysninger. Både kvaliteten på vurderingene og håndteringen av samtalene har derfor betydning.
8
12