Coxonin ero teki abstraktista tekoälyturvallisuuskeskustelusta äkkiä konkreettisen. Hän kertoi työskennelleensä kolme vuotta esikoulutuksen parissa OpenAI:lla ja Anthropicilla, mutta jättäneensä Anthropicin, koska yritykset hänen mukaansa "kilpailevat suoraan itseään kehittävää superälyä kohti ja uhkapelaavat elämillämme". Hänen X-julkaisunsa keräsi yli 90 miljoonaa katselukertaa alle vuorokaudessa.
2
44
Kyse ei ollut todisteesta siitä, että hallitsematon superäly tai itseään parantava järjestelmä olisi jo olemassa. Kyse oli siitä, millaista näyttöä turvallisuudesta pitäisi vaatia ennen kuin tekoälyä käytetään nopeuttamaan entistä kyvykkäämmän tekoälyn kehittämistä.
Mistä Coxon varoitti?
Keskustelun ytimessä on rekursiivinen itseparantaminen: tekoälyjärjestelmä auttaa rakentamaan sitä seuraavaa, kyvykkäämpää järjestelmää. Pitkälle vietynä kehitys voisi Anthropicin kuvauksen mukaan johtaa järjestelmään, joka suunnittelee ja kehittää seuraajansa itsenäisesti. Yritys korostaa samalla, ettei tähän pisteeseen ole päästy eikä kehityskulku ole väistämätön.
25
Coxonin huoli oli, että mallien kyvyt voivat edetä nopeammin kuin tutkijoiden kyky arvioida niitä, havaita virheitä, kohdistaa niiden toiminta ihmisten tavoitteisiin ja hallita käyttöönottoa. Hänen mukaansa kaupallinen kilpailu ja strateginen paine ohjaavat laboratorioita etenemään ennen kuin ne pystyvät osoittamaan hallitsevansa riskit.
2
10
13
Hubingerin tuki antoi varoitukselle painoarvoa
Anthropicin kohdistamistieteen vetäjä Evan Hubinger tuki julkisesti Coxonin huolten vakavaa ottamista. Hänen kerrottiin arvioivan henkilökohtaisesti yli 10 prosentin todennäköisyyden sille, että tekoäly tappaisi kaikki ihmiset tämän vuosikymmenen aikana. Hän sanoi myös, ettei Anthropicipilla vielä ole suunnitelmaa superälyn kohdistamisongelman ratkaisemiseksi.
4
6
14
Lukua ei pidä tulkita mitatuksi ennusteeksi, yrityksen viralliseksi arvioksi tai todisteeksi siitä, että katastrofi olisi todennäköinen. Se on yksittäisen asiantuntijan näkemys poikkeuksellisen epävarmasta tulevaisuudesta. Silti korkea-arvoisen kohdistamistutkijan julkinen tuki teki tapauksesta tavallista merkittävämmän: kritiikki tuli yrityksen sisältä, ei vain sen ulkopuolelta.
48
Kolme kiistaa yhdistyi samaksi kysymykseksi
Coxonin eron ympärillä limittyi kolme tavallisesti erillistä keskustelua:
- Tekninen hallinta: Pystytäänkö vaarallinen toiminta tunnistamaan ja estämään luotettavasti järjestelmissä, jotka voivat suunnitella, käyttää työkaluja tai auttaa tulevien mallien kehittämisessä?
- Yritysten kannustimet: Voivatko voimakkaan kilpailu-, sijoittaja- ja kansallisen turvallisuuden paineen alla toimivat yhtiöt päättää itse, milloin on syytä hidastaa tai keskeyttää?
- Demokraattinen ja poliittinen valta: Kuka asettaa säännöt järjestelmille, joilla voi olla laajoja taloudellisia ja turvallisuuspoliittisia vaikutuksia?
Anthropic on julkaissut tutkimusta kohdistamistekniikoista sekä automatisoitujen tutkijoiden käytöstä rajattujen kohdistamisvirheiden lieventämiseen. Tulokset koskevat kuitenkin tiettyjä arvioituja virhetyyppejä; ne eivät sellaisenaan osoita, että hypoteettista superälyä osattaisiin hallita yleisesti.
21
22
23
Hidastamisvaatimuksia, mutta ei yhteistä toimintamallia
Coxonin julkaisun jälkeen Anthropicin toimitusjohtaja Dario Amodei kehotti hidastamaan tekoälyn kehitystahtia ja etenemään varovaisemmin. Coxon suhtautui vetoomukseen myönteisesti. Raportoinnin mukaan myös OpenAI:n Sam Altman ja Elon Musk tukivat laajempaa keskustelua kehitystahdin hidastamisesta.
43
45
50
Tuki hidastamiselle ei kuitenkaan tarkoita, että näillä toimijoilla olisi yhteinen, tarkasti määritelty ohjelma: lähteet eivät osoita yhteistä julkaisukynnystä, turvallisuusstandardia tai yleispätevää pysäytysmekanismia.
Myöskään niin sanottu hätäpysäytys ei yksin ratkaise hallintaa. Sen toimivuus riippuisi siitä, säilyykö ihmisillä hallinta mallista, laskentainfrastruktuurista, käyttökanavista, siihen liitetyistä työkaluista ja sitä operoivista organisaatioista. Olennaisempaa on, ovatko vahvat suojaukset, valvonta, häiriöihin reagointi ja riippumaton arviointi olemassa ennen kuin mallille annetaan merkittäviä kykyjä tai pääsyä ulkoisiin järjestelmiin.
Agentti- ja kyberturvaväitteet vaativat tarkkaa tulkintaa
Keskustelussa esitetyt väitteet testeistä pakenemisesta, kyberhyökkäyksistä ja haittaohjelmien lisäämisyrityksistä eivät ole kaikki yhtä hyvin varmennettuja.
Anthropic on kertonut rakentaneensa valvontaa, jonka tarkoitus on havaita ja estää yritykset tutkia aggressiivisesti testausympäristöä, paeta siitä tai saada odottamatta internet-yhteys. Yritys kertoi myös tarkastaneensa arviointien tallenteita mahdollisten hiekkalaatikosta poistumisten varalta. Tämä osoittaa, että laboratorioissa testataan tällaisia riskejä; se ei osoita, että tekoäly olisi paennut todellisesta ihmiskontrollista.
26
Varovainen johtopäätös on, että autonomisten agenttien ja kyberväärinkäytön riskit ovat aktiivisia turvallisuus- ja tietoturvahuolia. Dramaattisimmat väitteet vaativat kuitenkin alkuperäisdokumentaatiota tai vahvaa riippumatonta vahvistusta, ennen kuin niitä voi pitää vakiintuneina tosiasioina.
Washingtonissa varoitus muuttui sääntelykysymykseksi
Coxonin ero osui aikaan, jolloin Yhdysvaltain senaatin neuvottelijat pohtivat lainsäädäntöä, joka velvoittaisi tekoälyyhtiöt osoittamaan ryhtyvänsä kohtuullisiin varotoimiin haittojen estämiseksi.
52
Anthropic oli jo aiemmin kehottanut kongressia vaatimaan kyvykkäimmille malleille riippumattomia turvallisuustestejä. Se vastusti myös osavaltioiden tekoälysääntöjen syrjäyttämistä ilman vahvaa liittovaltiotason vaihtoehtoa, joka käsittelisi katastrofaalisia riskejä.
53
Presidentti Donald Trump on puolestaan katsonut, että Yhdysvalloilla on jo keinot säännellä tekoälyyhtiöitä ja nostaa niitä vastaan syytteitä, eikä uusia tekoälykohtaisia rajoituksia välttämättä tarvita.
51
Taustalla on kaksi kilpailevaa näkemystä:
- Varovaisuuslinja: Pelkät vapaaehtoiset sitoumukset eivät riitä, kun pieni joukko yrityksiä kehittää järjestelmiä, joiden seuraukset voivat olla laajoja ja vaikeasti peruttavia.
- Innovaatiopainotteinen linja: Liian tiukka sääntely voi heikentää Yhdysvaltain teknologista asemaa, ja olemassa oleva lainsäädäntö riittää haitallisen toiminnan käsittelyyn.
Kumpikaan kanta ei poista perusvaihtokauppaa: nopeampi kehitys voi tuoda taloudellisia ja strategisia hyötyjä, mutta samalla se jättää vähemmän aikaa mallien arvioinnille ja uskottavan valvonnan rakentamiselle.
Valtavat rahasummat vaikeuttavat itsesääntelyä
Tapaus nosti esiin ristiriidan Anthropicin julkikuvan ja markkinapaineiden välillä. Yhtiö profiloituu tekoälyturvallisuuden puolestapuhujana, mutta toimii huippumallien markkinassa, jossa tarvitaan valtavasti pääomaa ja jossa kyvykkyyksien kehittämisestä kilpaillaan ankarasti. Kesäkuussa julkaistun raportin mukaan yksityiset sijoittajat arvottivat Anthropicin yli 965 miljardin dollarin arvoiseksi.
54
Tämä ei todista, että kaupalliset kannustimet olisivat aiheuttaneet mitään tiettyä turvallisuuspäätöstä. Se selittää kuitenkin, miksi kriitikot epäilevät vapaaehtoisen pidättyvyyden kestävyyttä silloin, kun ensimmäisenä etenemisestä voi saada valtavat tuotot. Toisaalta myös sijoittajille ja asiakkaille vakava turvallisuusongelma, viranomaistoimet tai luottamuksen menetys olisivat merkittävä riski.
Mikä Coxonin varoituksessa jäi pysyvästi elämään?
Coxonin ero ei osoittanut, että tekoäly olisi jo hallitsematonta, että jokin malli olisi paennut tai että ihmiskunnan tuho olisi välitön. Coxonin ja Hubingerin puheenvuorot ovat varoituksia epävarmoista tulevaisuuden riskeistä, eivät vahvistettuja ennusteita.
5
48
Se muutti kuitenkin kysymyksenasettelua. Keskustelu ei koske enää vain sitä, voidaanko huipputekoälystä tehdä entistä kyvykkäämpää. Yhä enemmän kysytään, pitäisikö yrityksillä, jotka kilpailevat tällaisen teknologian rakentamisesta, olla ensisijainen valta ratkaista, milloin turvallisuudesta on riittävästi näyttöä.
Käytännön mittapuuksi eivät riitä rauhoittelevat lupaukset. Tarvitaan selkeämpiä kyvykkyyskynnyksiä, merkityksellisiä käyttöönottoa edeltäviä arviointeja, uskottavaa häiriöraportointia ja valvontaa, joka ei perustu vain niihin yrityksiin, joilla on eniten voitettavaa nopeasta etenemisestä.
52
53