TamperBenchin mukaan yksikään 21 testatusta avoimen painon mallista ei kestänyt kaikkia arvioituja peukalointihyökkäyksiä: jokainen voitiin saada huomattavasti alttiimmaksi haitallisille pyynnöille samalla, kun suuri... Tutkijoiden johtopäätös on, etteivät nykyiset suojaukset ole riittävä tae turvallisuudesta, jos m...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench-tutkimuksen keskeinen havainto oli tyly: yksikään 21 testatusta avoimen painon suuresta kielimallista ei tarjonnut suojauksia, jotka olisivat kestäneet kaikki arvioidut peukalointiu_hat. Jokainen malli voitiin saada tuottamaan huomattavasti enemmän haitallista sisältöä samalla, kun suuri osa sen päättelykyvystä säilyi. Tutkijat pitävätkin nykyisiä turvamekanismeja riittämättömänä takeena mallille, jonka painoja voidaan julkaisemisen jälkeen muokata. 25
TamperBench arvioi 21 avointen painojen kielimallia, joiden koko vaihteli 600 miljoonasta parametrista 8 miljardiin. Mukana oli muun muassa Llama-, Qwen3- ja Mistral-malleja sekä suojauksilla vahvistettuja malliversioita. 28
Tutkimus kattoi yhdeksän painotilan hienosäätöön ja latenttitilan eli mallin piilorepresentaatioihin kohdistuvaa peukalointimenetelmää. Menetelmät ulottuivat näennäisen harmittomasta hienosäädöstä avoimen haitalliseen koulutukseen, peiteltyyn jailbreak-koulutukseen, monikieliseen hienosäätöön sekä upotuksiin ja latenttirepresentaatioihin kohdistuviin hyökkäyksiin. 2
Tutkijoiden mukaan vakavimpia olivat tavallisesti peitellyt jailbreak-koulutuksen muunnelmat. Niissä mallia koulutettiin pääosin harmittomalla aineistolla, johon lisättiin pieni haitallinen osuus. Erityisen tehokkaiksi osoittautuivat kilpaileviin tavoitteisiin, takaoviin ja tyylin modulointiin perustuvat menetelmät. 2
Hyökkäysten vaikutusta ei arvioitu pelkästään sillä perusteella, suostuiko malli haitalliseen pyyntöön. Tutkimuksessa etsittiin hyökkäysasetuksia, jotka kasvattivat haitallisten vastausten pisteitä mahdollisimman paljon, mutta rajoittivat MMLU-Pro-päättelytarkkuuden laskun enintään 10 prosenttiin verrattuna suojaamattomaan lähtötilanteeseen. Näin testi pyrki selvittämään, voiko mallin turvakaiteita poistaa ilman, että sen yleinen käyttökelpoisuus romahtaa. 2
Saatavilla oleva aineisto ei kuitenkaan sisällä tarkkoja mallikohtaisia lukuja esimerkiksi Llama-3-8B-Instructin tai Qwen3-8B-Instructin haitallisuuden kasvusta. Niille ei siksi voi ilmoittaa luotettavia prosenttiarvoja.
Testattuihin malleihin kuului viisi puolustusmenetelmillä vahvistettua versiota, muun muassa ReFAT- ja Circuit Breaking -muunnelmia. Ne kestivät joissakin tilanteissa hyökkäyksiä tavallisia malleja paremmin, mutta mikään menetelmä ei estänyt suojauksien poistamista luotettavasti koko hyökkäysjoukossa. 25
Havainto liittyy suoraan avoimen painon mallien erityispiirteeseen. Kun painot julkaistaan, kuka tahansa voi kopioida niitä, hienosäätää niitä ja jakaa muokattuja versioita eteenpäin. Alkuperäinen kehittäjä ei tällöin pysty samalla tavalla valvomaan sitä, millaisia turvarajoja myöhemmissä versioissa noudatetaan. 2
Tutkimus ei väitä, etteivät avoimet mallit olisi hyödyllisiä. Tutkijat korostavat, että avoimuus tukee tutkimusta ja tilivelvollisuutta. Julkisesti saataville asetettua mallia ei kuitenkaan pitäisi pitää turvallisena vain siksi, että se on läpäissyt tavanomaiset julkaisua edeltävät linjaus- ja turvallisuustestit. 5
Tutkijat huomauttavat myös, että suljetuissa kaupallisissa tai ohjelmointirajapinnan kautta tarjottavissa malleissa voi olla samankaltaisia riskejä. Palveluntarjoajilla on silti enemmän keinoja hallita hienosäätöä ja käyttöönottoa sekä lisätä suojauksia ennen ja jälkeen hienosäädön. Nämä keinot eivät ole samalla tavalla käytettävissä, kun avoimet painot leviävät vapaasti. 25
Jos suojaukset voidaan poistaa ilman merkittävää suorituskyvyn heikkenemistä, väärinkäytön mittakaava voi kasvaa. Tutkijat mainitsevat mahdollisina seurauksina esimerkiksi laajamittaisen disinformaation, kehittyneet tietojenkalastelu- ja huijauskampanjat sekä haitallisia teknisiä ohjeita tuottavat järjestelmät. 5
TamperBenchin tekijät peräänkuuluttavat lisää tutkimusta mallien peukaloinninkestävyydestä, yhdenmukaisia vastakkainasetteluun perustuvia testejä ennen julkaisua sekä näyttöön perustuvaa tekoälyn arviointia ja hankintaa. Tämä korostuu etenkin, kun viranomaiset ja muut julkiset toimijat ottavat tekoälyä käyttöön terveydenhuollossa, petosten tunnistamisessa, koulutuksessa ja muissa palveluissa. 25
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBenchin mukaan yksikään 21 testatusta avoimen painon mallista ei kestänyt kaikkia arvioituja peukalointihyökkäyksiä: jokainen voitiin saada huomattavasti alttiimmaksi haitallisille pyynnöille samalla, kun suuri...
TamperBenchin mukaan yksikään 21 testatusta avoimen painon mallista ei kestänyt kaikkia arvioituja peukalointihyökkäyksiä: jokainen voitiin saada huomattavasti alttiimmaksi haitallisille pyynnöille samalla, kun suuri... Tutkijoiden johtopäätös on, etteivät nykyiset suojaukset ole riittävä tae turvallisuudesta, jos mallin painot voidaan muokata.
Testit kattoivat yhdeksän menetelmää, kuten näennäisen harmittoman hienosäädön, haitallisen hienosäädön, peitellyn jailbreak koulutuksen, monikielisen hienosäädön sekä upotus ja latenttitilan hyökkäykset.