TamperBenchissä kaikki 21 testattua, 0,6–8 miljardin parametrin avointen painojen mallia olivat alttiita vähintään yhdelle yhdeksästä peukalointimenetelmästä, usein ilman yli 10 prosentin heikennystä MMLU Pro päättely... Peitelty jailbreak viritys – erityisesti kilpaileviin tavoitteisiin, takaoviin ja tyylin moduloi...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench-tutkimuksen päätulos on karu: yksikään 21 testatusta avoimien painojen kielimallista ei säilyttänyt turvasuojauksiaan luotettavasti kaikissa tutkituissa peukalointitilanteissa. Mallien koko vaihteli noin 600 miljoonasta 8 miljardiin parametriin, ja mukana oli sekä tavallisia että lisäpuolustuksilla vahvistettuja versioita. Jokaisen mallin kohdalla löytyi vähintään yksi hyökkäys, jolla mallista saatiin haitallista sisältöä tuottava, vaikka suuri osa sen yleisestä suorituskyvystä säilyi. 256
Tulos on merkittävä siksi, että avoimien painojen malleja voidaan julkaisun jälkeen kopioida, hienosäätää ja jakaa uudelleen. Kehittäjän alkuperäisissä testeissä toimiva turvakerros ei siten välttämättä ole kestävä suoja, kun käyttäjät voivat muokata itse mallin painoja.
TamperBench ei keskittynyt tavalliseen kehotepohjaiseen jailbreak-kestävyyteen. Sen tarkoitus oli mitata peukaloinnin kestävyyttä: miten hyvin mallin turvallisuuskäyttäytyminen säilyy, kun sen painoja tai piileviä esityksiä muokataan. Kehys yhdistää painoavaruudessa tehtäviä hienosäätöhyökkäyksiä ja latentteihin esityksiin kohdistuvia hyökkäyksiä. Samalla arvioidaan sekä turvallisuuskäyttäytymistä että mallin säilyvää hyödyllisyyttä. Tutkijat hakivat kullekin malli–hyökkäys-parille sopivia asetuksia järjestelmällisesti sen sijaan, että olisivat luottaneet yhteen ennalta valittuun hyökkäyskokoonpanoon. 2
Tutkimuksessa tarkasteltiin yhdeksää peukalointiluokkaa, joihin kuuluivat muun muassa:
Keskeinen mittari ei ollut pelkästään se, saatiinko malli toimimaan turvattomasti. Tutkijat etsivät hyökkäyksiä, jotka lisäsivät haitallisia vastauksia samalla kun MMLU-Pro-päättelytarkkuus laski enintään 10 prosenttia verrattuna hyökkäämättömään malliin. 2
Vakavimmat tulokset liittyivät yleensä jailbreak-viritykseen. Tutkimuksessa tarkastellut muunnelmat perustuivat muun muassa kilpaileviin tavoitteisiin, takaoviin ja tyylin modulointiin. Ne olivat erityisen kiinnostavia siksi, että koulutusdata saattoi koostua pääosin harmittomasta aineistosta ja vain pienemmästä haitallisesta osuudesta. Kyse ei siis ollut välttämättä suoraviivaisesta yrityksestä kouluttaa mallia kokonaan uudelleen haitalliseen käyttöön, vaan kohdennetusta tavasta muuttaa sen turvallisuuskäyttäytymistä hyödyllisyyden säilyessä. 26
Tutkimuksen laajempi johtopäätös on huolestuttava: turvallisuus ja suorituskyky voidaan erottaa toisistaan epäedullisella tavalla. Peukalointi voi heikentää kieltäytymiskäyttäytymistä ilman, että mallin päättelykyky heikkenee samassa suhteessa. Siksi muokattu malli voi näyttää edelleen hyödylliseltä tavanomaisissa testeissä ja olla silti huomattavasti riskialttiimpi ottaa käyttöön.
TamperBenchissä arvioitiin 21 avointen painojen mallia 0,6–8 miljardin parametrin kokoluokassa. Mukana oli muun muassa Llama-, Qwen3- ja Mistral-malliperheitä. Tutkimusaineiston perusteella jokainen testattu malli oli altis vähintään yhdelle arvioidulle hyökkäykselle. 56
Saatavilla oleva lähdeaineisto ei kuitenkaan ilmoita tarkkoja mallikohtaisia lukuja siitä, kuinka paljon haitallisuus lisääntyi Llama-3-8B-Instruct- tai Qwen3-8B-Instruct-malleissa silloin, kun MMLU-Pro-tulos sai heikentyä enintään 10 prosenttia. Näitä prosenttiosuuksia ei siksi pidä päätellä koko tutkimuksen yleisestä tuloksesta.
Perusteltu johtopäätös on laadullinen: hyökkäyksillä voitiin lisätä haitallista käyttäytymistä merkittävästi samalla kun suuri osa päättelykyvystä säilyi, mutta toimitettu näyttö ei vahvista tarkkaa prosenttilukua kummallekaan nimetylle mallille.
Tutkimus osoitti myös, ettei pohjamallien ja jälkikoulutettujen mallien peukalointikestävyydelle ollut yhtä yleistä kaavaa. Suhteellinen kestävyys vaihteli malliperheittäin, ja Llama 3- ja Qwen3-muunnelmissa havaittiin toisistaan poikkeavia kehityssuuntia. 6
Eivät. Myös kaikki viisi testattua lisäpuolustuksilla vahvistettua mallia, mukaan lukien ReFAT- ja Circuit Breaking -muunnelmat, olivat alttiita tutkimuksen hyökkäysvalikoimalle. Puolustukset paransivat kestävyyttä joissakin tilanteissa, mutta ne eivät estäneet turvamekanismien poistamista luotettavasti kaikissa testatuissa uhissa. 25
Tutkimuksessa Triplet nousi vertailuissa yhdeksi kestävämmistä ja suorituskykyä parhaiten säilyttävistä puolustusmenetelmistä. Se on lupaava tutkimushavainto, ei tae turvallisuudesta: tutkimuksen päätulos oli, ettei mikään testattu puolustus poistanut peukalointiongelmaa koko hyökkäysvalikoiman osalta. 6
Tulos ei tarkoita, etteivätkö avoimien painojen mallit olisi hyödyllisiä. Avoimuus voi tukea tutkimusta, auditointia ja tilivelvollisuutta. Kapeampi mutta tärkeä johtopäätös on, ettei tavanomaista julkaisua edeltävää turvallisuusarviointia pitäisi pitää todisteena siitä, että malli pysyy turvallisena sen jälkeen, kun sen painoja voidaan vapaasti muokata. 5
Suljetut kaupalliset tai ohjelmointirajapinnan kautta tarjotut mallit kohtaavat omat hienosäätöön ja jälkikoulutukseen liittyvät kysymyksensä. Niiden tarjoajilla on kuitenkin enemmän määräysvaltaa koulutusputkeen ja käyttöympäristöön. Tämä mahdollistaa suojauksia hienosäädön aikana tai sen jälkeen – vaihtoehtoja, joita on huomattavasti vaikeampi valvoa, kun painot on jaettu julkisesti ja niitä voidaan käyttää tarjoajan ulkopuolella. 25
TamperBenchin esiin nostama riski ei rajoitu siihen, että joku löytää yksittäisen kehotteen, joka saa mallin kieltäytymään vastaamasta. Jos hyödylliset kyvyt säilyvät, muokattua mallia voitaisiin mahdollisesti käyttää toistuvasti esimerkiksi laajamittaiseen disinformaatioon, tietojenkalasteluun ja huijauksiin tai vaaralliseen tekniseen neuvontaan. Tutkijat esittävät nämä mahdollisina seurauksina suorituskykyä säilyttävästä suojauksien poistamisesta – benchmark ei itsessään mitannut tällaisen väärinkäytön toteuttamista. 5
Organisaatioiden kannattaa siksi erottaa toisistaan:
Tutkijat peräänkuuluttavat vahvempia peukaloinnin kestävyyteen tähtääviä menetelmiä, TamperBenchin kaltaisia standardoituja vastakkainasettelutestejä ennen julkaisua sekä näyttöön perustuvaa tekoälyn arviointia ja hankintaa. He nostavat esiin erityisen vaikutusvaltaisia käyttökohteita, kuten terveydenhuollon, petosten tunnistamisen, koulutuksen ja julkiset palvelut, joissa mallin julkaisun jälkeinen käyttäytyminen voi olla yhtä tärkeää kuin sen alkuperäinen turvallisuushistoria. 25
TamperBench ei osoita, että jokaista avoimien painojen mallia tullaan väärinkäyttämään. Se osoittaa, että kaikissa 21 testatussa mallissa turvallisuussuojaukset eivät olleet luotettava tae sen jälkeen, kun hyökkääjä pääsi muokkaamaan mallia.
Peitelty jailbreak-viritys oli yleensä tehokkain hyökkäysluokka. Lisäpuolustukset auttoivat joissakin tapauksissa, mutta eivät sulkeneet ongelmaa. Lisäksi saatavilla oleva näyttö ei tue tarkkojen haitallisuuden kasvuprosenttien ilmoittamista yksittäisille Llama- tai Qwen3-malleille.
Avoimien painojen mallien turvallisuusarvioinnissa pitäisi siis testata paitsi sitä, mitä malli osaa tehdä julkaisuhetkellä, myös sitä, kuinka suuri osa sen turvallisuuskäyttäytymisestä kestää myöhemmän muokkauksen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBenchissä kaikki 21 testattua, 0,6–8 miljardin parametrin avointen painojen mallia olivat alttiita vähintään yhdelle yhdeksästä peukalointimenetelmästä, usein ilman yli 10 prosentin heikennystä MMLU Pro päättely...
TamperBenchissä kaikki 21 testattua, 0,6–8 miljardin parametrin avointen painojen mallia olivat alttiita vähintään yhdelle yhdeksästä peukalointimenetelmästä, usein ilman yli 10 prosentin heikennystä MMLU Pro päättely... Peitelty jailbreak viritys – erityisesti kilpaileviin tavoitteisiin, takaoviin ja tyylin modulointiin perustuvat menetelmät – oli yleensä tehokkain hyökkäysluokka.
ReFAT ja Circuit Breaking muunnelmien kaltaiset lisäsuojatut mallit kestivät joissakin tilanteissa paremmin, mutta mikään testattu puolustus ei tarjonnut luotettavaa suojaa turvamekanismien poistamista vastaan.