'Varastetut ajatukset' -toistohyökkäys – 10.–11. elokuuta 2026 julkaistussa artikkelissa "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867) tutkijat Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping ja Andriushchenko löysivät kriittisen arkkitehtuurisen heikkouden. Salatut 'ajattelu'-lohkot, jotka Anthropic, OpenAI ja Google palauttavat API-asiakkailleen, eivät ole kunnolla sidottu alkuperäänsä. Nämä lohkot voidaan poimia yhdestä keskustelusta ja toistaa heikompaan, vähemmän suojattuun sisarmalliin samalta palveluntarjoajalta, joka tulostaa huippumallin piilotetun päättelyn selkokielisenä . Hyökkäys toimii istuntojen, käyttäjätilien ja saman palveluntarjoajan eri mallien välillä . Tutkijat vahvistivat tekniikan toimivan jokaisessa testatussa suuressa tekoäly-yhtiössä, ja talteen saadun päättelyn pituus vastaa API:n ilmoittamaa piilotettujen ajatusmerkkien määrää lähes 1:1 .
Esitetyt päättelyjäljet tarjoavat korkealaatuisia harjoitussignaaleja mallin tislaukseen – käytäntöön, jossa vahvemman mallin tuotoksia käytetään pienemmän ja halvemman kilpailijamallin kouluttamiseen . Tämä tekniikka on kiistan keskiössä, joka liittyy kiinalaisiin tekoälylaboratorioihin:
Todisteet eivät kuitenkaan ole lopullisia. Tutkijat, kuten Braden Hancock (Laude-instituutti) ja Nathan Lambert (Allen Institute for AI), väittävät, että pelkkä tislaus ei selitä Kimi K3:n kaikkia ominaisuuksia. Laajalti levinnyt PDF-tiedosto, jonka väitettiin todistavan päättelyketjun tislauksen, sai kritiikkiä siitä, että se yhdisti rajoitetun kokeen perusteettomiin väitteisiin .
Heikkous aiheuttaa monia konkreettisia riskejä, jotka ylittävät immateriaaliomaisuuden varkauden:
Kaikkiin kolmeen yritykseen otettiin yhteyttä ennen 'Varastetut ajatukset' -tutkimuksen julkaisua. Raporttien mukaan OpenAI, Anthropic ja Google estivät ristiinmallisen päättelyhyökkäyksen saatuaan tiedon siitä. Tarkkoja tietoja heidän lievennystoimistaan ei ole täysin julkistettu, mutta haavoittuvuus vahvistettiin olevan olemassa kaikkien kolmen palveluntarjoajan API-rajapinnoissa ennen korjausta . Hyökkäyksen estäminen viittaa siihen, että yritykset toteuttivat palvelinpuolen korjauksia – todennäköisesti rajoittaen salattujen päättelylohkojen uudelleenkäyttöä eri mallikontekstien tai -tilien välillä .
Anthropic oli jo aiemmin julkisesti taistellut tiskausta vastaan suuressa mittakaavassa raportoidessaan 24 000 vilpillisestä tilistä ja 16 miljoonasta vuorovaikutuksesta, joita kiinalaiset laboratoriot käyttivät Claude-tuotosten poimimiseen .
Keskeinen opetus sekä REP- että Varastetut ajatukset -tutkimuksista on, että päättelyjälkien piilottaminen tai salaaminen on lähtökohtaisesti hauras turvallisuusstrategia – jos päättely on olemassa mallin painoissa, se voidaan saada esiin .