OpenAI:n kerrotaan poistaneen toimeksiannoista useita ulkopuolisia työntekijöitä, jotka käyttivät tekoälyä yhtiön mallien arviointiin. Kyse ei ole vain siitä, että tekoäly-yhtiön työntekijät turvautuivat tekoälyyn: heidän tehtävänsä oli tuottaa ihmisen itsenäinen arvio ChatGPT:n vastauksista. Uutisointi liittää poistamiset OpenAI:n laajempaan arviointityöhön ja kertoo Project Lilystä yhtenä ihmisten tekemään arviointiin perustuvana ohjelmana. Sen perusteella ei kuitenkaan voi päätellä, että jokainen poistettu työntekijä olisi työskennellyt juuri Lilyssä.
16
13
Mitä Project Lilyn arvioijat tekevät?
Project Lilyssä sadat ulkopuoliset työntekijät käyvät raporttien mukaan läpi todellisia ChatGPT:lle esitettyjä pyyntöjä ja toisinaan myös niitä ympäröiviä keskusteluja. Arvioijia rekrytoidaan Crossing Hurdlesin kautta ja heille maksetaan Mercorin kautta. Yksi työntekijä kertoi ansaitsevansa yli 50 Yhdysvaltain dollaria tunnissa; se ei ole vahvistettu palkkataso kaikille arvioijille.
2
20
Arvioija tiivistää ensin, mitä käyttäjä yritti saada aikaan. Sen jälkeen hän arvioi ja pisteyttää ChatGPT:n vastausvaihtoehdot asteikolla 1–7. Tehtävässä voi olla enintään neljä vastausvaihtoehtoa. Huomiota kiinnitetään esimerkiksi sävyyn, konemaisiin ilmauksiin ja siihen, myötäileekö vastaus käyttäjää liikaa. Pisteiden ja sanallisen palautteen on tarkoitus auttaa parantamaan mallin tulevaa toimintaa.
4
11
3
1
Miksi tekoälyn kirjoittama palaute on ongelma?
Ihminen voi arvioida omasta näkökulmastaan, vastaako ChatGPT käyttäjän tarpeeseen vai kuulostaako se esimerkiksi liian mielistelevältä. Jos toinen tekoäly kirjoittaa arvion tai valitsee pisteet, palautteeseen voi päätyä ihmisen harkinnan sijaan mallin tuottamia mieltymyksiä. Se heikentää palautteen arvoa mahdollisesti, mutta ei todista, että jokin yksittäinen tekoälyavusteinen arvio olisi vahingoittanut mallia.
4
16
Raporttien mukaan ohjeet kieltävät tekoälyn käytön työn arvioinnissa ja palautteen kirjoittamisessa. Kielto koskee myös esimerkiksi Grammarlyä ja tekoälyä hyödyntäviä käännöstoimintoja. Muiden arvioijien työtä tarkastavat henkilöt eivät ohjeiden mukaan saa käyttää tekoälytekstin tunnistustyökaluja, joita ohjeissa pidetään epäluotettavina.
13
9
Miten epäilyt havaitaan – ja mitä niistä voi päätellä?
Esihenkilöiden kerrotaan tarkastelevan muun muassa toistuvia, tekoälymäisiltä vaikuttavia ilmauksia ja poikkeuksellisen nopeasti valmistunutta työtä tunnistinohjelmien tulosten sijaan. Tällaiset merkit voivat antaa aiheen selvittää asiaa tarkemmin, mutta ne eivät yksin todista tekoälyn käyttöä. Käytettävissä oleva uutisointi ei kerro, kuinka usein epäilyt osuvat oikeaan tai käyttö jää huomaamatta.
9
33
Pelkkä ihmisen tekemä arvio ei sekään takaa hyvää palautetta: pisteet voi valita huolimattomasti tai tarkoituksella huonosti. Käytettävissä olevat lähteet eivät vahvista väitettyä yksittäistä tunnustusta tahallaan annetuista huonoista pisteistä, joten sen olosuhteista tai ilmiön yleisyydestä ei voi tehdä päätelmiä. Olennainen ero on tämä: merkintä ihmisen arvioima kertoo palautteen antajasta, ei jokaisen arvion laadusta. Siksi myös itse arvioiden laatua on tarkistettava.
1
4
Käyttäjille Project Lily herättää lisäksi tietosuojakysymyksen. Arvioijat voivat nähdä oikeiden keskustelujen tekstiä, eikä OpenAI:n raportoitu yksityisyystietojen suodatin välttämättä poista kaikkia arkaluonteisia yksityiskohtia. Merkitystä on siis sekä arvioiden luotettavuudella että sillä, miten käyttäjien keskusteluja käsitellään.
8
12