Tämä ei ollut yksittäinen bugi. Se oli dramaattisin osoitus aiemmin dokumentoimattomasta haavoittuvuusluokasta, jota Zenity kutsuu "PleaseFixiksi" – nollaklikkaushaavoittuvuuksien perhe, joka vaikutti kaikkiin kaupallisiin tekoälyselaimiin, joita tutkijat tarkastelivat .
Zenityn Proof-of-Concept-hyökkäys ohitti OpenAI:n kolmiportaisen turvajärjestelmän kolmella tekniikalla :
Samaa hyökkäysketjua voitiin käyttää myös luvattomien Amazon-ostosten tekemiseen, mikä osoitti laajemman tilienkaappauskyvyn . WhatsAppin päästä päähän -salausta ei murrettu – tekoälyagentti toimi yksinkertaisesti käyttäjän autentikoidussa istunnossa .
Zenity Labs paljasti PleaseFixin ennalta dokumentoimattomana nollaklikkaushaavoittuvuuksien perheenä, joka vaikutti kaikkiin kaupallisiin tekoälyselaimiin, joita he tarkastelivat . Haavoittuvuudet osoitettiin seuraavissa:
Yhteensä Zenity löysi 20 erillistä haavoittuvuutta näiltä alustoilta . Ydinongelma on arkkitehtoninen: tekoälyselaimet on suunniteltu lukemaan verkkosisältöä itsenäisesti, noudattamaan ohjeita ja suorittamaan toimia käyttäjän puolesta – ja tämä itsenäisyys on itsessään hyökkäyspinta . Hyökkääjät kaappaavat agentit tavallisen sisällön ja odotettujen toimien kautta ilman haittaohjelmia, ilman hyväksikäyttöjä ja ilman käyttäjän klikkausta .
Todistetut hyökkäystulokset sisälsivät :
Tietoturvatutkijat väittävät, että nykyinen lähestymistapa – turvasuodattimien ja kehotetason suojakaiteiden lisääminen erittäin itsenäisten tekoälyagenttien päälle – on rakenteellisesti riittämätön . Zenityn tutkimus osoitti, että jokainen tekoälyselain voitiin vaarantaa käyttämällä samaa perustekniikkaa: syöttämällä agentille haitallista sisältöä, jota se on suunniteltu käsittelemään .
Ydinongelma on, että todennäköisyyksiin perustuvat tekoälyn turvasuodattimet (jotka arvaavat, onko toimi turvallinen) eivät voi luotettavasti pysäyttää hyökkääjää, joka voi luoda uusia syötteitä, jotka livahtavat suodattimien ohi. Tutkijat vaativat deterministisiä turvallisuusesteitä – kovia, täytäntöönpanokelpoisia rajoituksia sille, mitä tekoälyagentti saa tehdä, riippumatta siitä, miten se tulkitsee ohjeita . Esimerkkejä:
Kunnes tällaiset deterministiset hallintakeinot ovat olemassa, PleaseFix-luokan haavoittuvuudet osoittavat, että tekoälyselaimet voidaan aseistaa omia käyttäjiään vastaan yksinkertaisesti julkaisemalla tavallisen näköistä verkkosisältöä .