TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan... Serangan jailbreak tuning secara terselindung—terutamanya varian objektif bersaing, pintu belaka...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Kesimpulan utama TamperBench cukup membimbangkan: tiada satu pun daripada 21 model bahasa open-weight yang diuji mempunyai perlindungan keselamatan yang mampu bertahan secara konsisten terhadap semua ancaman pengubahsuaian yang diuji. Model-model tersebut merangkumi kira-kira 600 juta hingga 8 bilion parameter, termasuk model standard dan varian yang dipertingkatkan dengan pertahanan keselamatan.
Sekurang-kurangnya satu serangan berjaya menjadikan setiap model lebih cenderung menghasilkan kandungan berbahaya, sambil mengekalkan sebahagian besar keupayaan umum dan penaakulannya. 2
5
6
Penemuan ini penting kerana model open-weight boleh disalin, ditala halus dan diedarkan semula selepas dikeluarkan. Lapisan keselamatan yang berfungsi semasa penilaian asal pembangun tidak semestinya kekal kukuh apabila pengguna boleh mengubah suai pemberat model.
TamperBench direka untuk mengukur ketahanan terhadap pengubahsuaian, bukannya sekadar menguji ketahanan model terhadap jailbreak berasaskan arahan biasa. Rangka kerjanya menggabungkan serangan penalaan halus dalam ruang pemberat model dengan serangan yang memanipulasi representasi pendam, sebelum menilai kedua-dua tingkah laku keselamatan dan keupayaan yang masih dikekalkan.
Bagi setiap pasangan model dan serangan, penyelidik menjalankan carian hiperparameter yang sistematik. Ini bermakna keputusan tidak bergantung pada satu konfigurasi serangan sahaja. 2
Kajian itu meliputi sembilan bentuk pengubahsuaian, termasuk:
Ujian utama bukan sekadar melihat sama ada model boleh dijadikan tidak selamat. Penyelidik mencari serangan yang meningkatkan kadar respons berbahaya, sambil memastikan penurunan ketepatan penaakulan MMLU-Pro tidak melebihi 10% berbanding prestasi model sebelum diubah suai. 2
Keputusan paling serius secara umumnya datang daripada serangan jailbreak-tuning. Antara varian yang dilaporkan ialah pendekatan objektif bersaing, pintu belakang dan modulasi gaya.
Serangan ini penting kerana ia boleh menggunakan sebahagian besar data latihan yang kelihatan tidak berbahaya, dengan hanya komponen berbahaya yang kecil. Jadi, ia bukan semata-mata cubaan kasar untuk melatih semula model agar berkelakuan berbahaya. Sebaliknya, ia lebih menyerupai usaha bersasar untuk mengubah tingkah laku keselamatan model sambil mengekalkan kegunaannya. 2
6
Kesimpulan lebih luas kajian itu ialah keselamatan dan keupayaan boleh dipisahkan dengan cara yang merugikan. Pengubahsuaian mungkin melemahkan keengganan model untuk menjawab permintaan berbahaya tanpa memusnahkan prestasi penaakulannya secara sepadan.
Sebab itu, model yang masih kelihatan berguna dalam penanda aras konvensional boleh menjadi jauh lebih berisiko apabila digunakan dalam persekitaran sebenar.
TamperBench menilai 21 model open-weight dengan saiz antara 0.6B hingga 8B parameter, termasuk keluarga model seperti Llama, Qwen3 dan Mistral. Bukti kajian yang tersedia menyokong kesimpulan pada peringkat keseluruhan penanda aras bahawa setiap model yang diuji terdedah kepada sekurang-kurangnya satu serangan. 5
6
Namun begitu, bahan sumber yang ada tidak menyertakan angka tepat peningkatan tahap respons berbahaya bagi Llama-3-8B-Instruct atau Qwen3-8B-Instruct di bawah syarat penurunan prestasi MMLU-Pro sebanyak 10% atau kurang. Oleh itu, angka khusus untuk kedua-dua model tersebut tidak wajar dibuat andaian berdasarkan keputusan keseluruhan kajian.
Kesimpulan yang boleh dipertahankan hanyalah bersifat perbandingan dan kualitatif: serangan tersebut boleh meningkatkan tingkah laku berbahaya dengan ketara sambil mengekalkan sebahagian besar keupayaan penaakulan model, tetapi bukti yang tersedia tidak menetapkan peratusan tepat bagi mana-mana model yang dinamakan.
Kajian itu juga mendapati bahawa varian asas dan varian selepas latihan tidak menunjukkan satu corak ketahanan yang seragam. Ketahanan relatif boleh berbeza mengikut keluarga model, dengan trend yang bertentangan dilaporkan antara varian Llama 3 dan Qwen3. 6
Belum. Lima model yang dipertingkatkan dengan pertahanan tambahan—termasuk varian ReFAT dan Circuit Breaking—turut terdedah kepada rangkaian serangan yang digunakan.
Pertahanan tersebut memang meningkatkan ketahanan dalam sesetengah keadaan, tetapi tidak dapat menghalang pelucutan ciri keselamatan secara konsisten terhadap semua ancaman yang diuji. 2
5
Kajian itu mengenal pasti Triplet sebagai antara pertahanan yang lebih kukuh dan lebih baik dalam mengekalkan keupayaan berdasarkan perbandingan yang dijalankan. Namun, ini ialah petunjuk positif untuk penyelidikan, bukannya jaminan keselamatan. Keputusan utama TamperBench kekal sama: tiada pertahanan yang diuji berjaya menghapuskan masalah pengubahsuaian merentasi keseluruhan rangkaian serangan. 6
Penemuan tersebut tidak bermaksud model open-weight tidak bernilai. Pelepasan terbuka boleh menyokong penyelidikan, pengauditan dan akauntabiliti. Pengajaran yang lebih khusus ialah lulus penilaian penjajaran atau keselamatan sebelum pelancaran tidak boleh dianggap sebagai bukti bahawa model akan kekal selamat selepas pemberatnya diubah secara bebas. 5
Model komersial tertutup atau model yang diakses melalui API turut berdepan persoalan berkaitan penalaan halus dan keselamatan selepas latihan. Namun, penyedia perkhidmatan masih mempunyai lebih banyak kawalan terhadap saluran latihan dan persekitaran penggunaan. Kawalan ini membolehkan mereka menerapkan perlindungan ketika proses penalaan halus atau selepas penyesuaian dibuat—sesuatu yang jauh lebih sukar dikuatkuasakan apabila pemberat model telah diedarkan kepada umum. 2
5
Risiko yang diketengahkan TamperBench bukan sekadar seseorang menemui satu arahan yang menyebabkan model gagal menolak permintaan berbahaya. Jika pengubahsuaian masih mengekalkan keupayaan berguna, model yang telah diubah boleh digunakan berulang kali bagi tugas berbahaya seperti penyebaran maklumat palsu secara besar-besaran, penipuan atau phishing, serta bantuan teknikal yang berbahaya.
Penyelidik mengemukakan perkara ini sebagai implikasi daripada pelucutan perlindungan yang mengekalkan keupayaan model—bukan sebagai ukuran penyalahgunaan sebenar yang dijalankan oleh penanda aras tersebut. 5
Bagi organisasi yang sedang memilih model AI, perbezaan berikut perlu diberi perhatian:
Penyelidik menyeru supaya kaedah ketahanan terhadap pengubahsuaian diperkukuh, penilaian adversarial piawai seperti TamperBench dijalankan sebelum pelepasan, serta penilaian dan perolehan AI dibuat berasaskan lebih banyak bukti.
Mereka turut menekankan konteks berimpak tinggi seperti penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam—bidang yang memerlukan perhatian terhadap tingkah laku model selepas dikeluarkan, bukan hanya rekod keselamatan asalnya. 2
5
TamperBench tidak membuktikan bahawa setiap model open-weight pasti akan disalahgunakan. Kajian itu menunjukkan bahawa, bagi kesemua 21 model yang diuji, ciri keselamatan bukanlah jaminan yang boleh diharapkan apabila penyerang mempunyai keupayaan untuk mengubah model.
Jailbreak-tuning secara terselindung biasanya merupakan kategori serangan paling kuat. Pertahanan tambahan membantu dalam sesetengah situasi, tetapi tidak menutup jurang tersebut sepenuhnya. Pada masa yang sama, bukti yang tersedia tidak menyokong angka peratusan tepat tentang peningkatan tahap bahaya bagi model Llama atau Qwen3 tertentu.
Bagi model open-weight, penilaian keselamatan perlu menguji bukan sahaja perkara yang boleh dilakukan oleh model ketika dilancarkan, tetapi juga sejauh mana tingkah laku keselamatannya mampu bertahan selepas diubah suai.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan...
TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan... Serangan jailbreak tuning secara terselindung—terutamanya varian objektif bersaing, pintu belakang dan modulasi gaya—biasanya merupakan kategori serangan paling berkesan.
Model dengan pertahanan tambahan, termasuk varian ReFAT dan Circuit Breaking, menunjukkan peningkatan dalam sesetengah keadaan tetapi tidak memberikan jaminan yang konsisten terhadap pelucutan ciri keselamatan.
TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan... Serangan jailbreak tuning secara terselindung—terutamanya varian objektif bersaing, pintu belaka...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Kesimpulan utama TamperBench cukup membimbangkan: tiada satu pun daripada 21 model bahasa open-weight yang diuji mempunyai perlindungan keselamatan yang mampu bertahan secara konsisten terhadap semua ancaman pengubahsuaian yang diuji. Model-model tersebut merangkumi kira-kira 600 juta hingga 8 bilion parameter, termasuk model standard dan varian yang dipertingkatkan dengan pertahanan keselamatan.
Sekurang-kurangnya satu serangan berjaya menjadikan setiap model lebih cenderung menghasilkan kandungan berbahaya, sambil mengekalkan sebahagian besar keupayaan umum dan penaakulannya. 2
5
6
Penemuan ini penting kerana model open-weight boleh disalin, ditala halus dan diedarkan semula selepas dikeluarkan. Lapisan keselamatan yang berfungsi semasa penilaian asal pembangun tidak semestinya kekal kukuh apabila pengguna boleh mengubah suai pemberat model.
TamperBench direka untuk mengukur ketahanan terhadap pengubahsuaian, bukannya sekadar menguji ketahanan model terhadap jailbreak berasaskan arahan biasa. Rangka kerjanya menggabungkan serangan penalaan halus dalam ruang pemberat model dengan serangan yang memanipulasi representasi pendam, sebelum menilai kedua-dua tingkah laku keselamatan dan keupayaan yang masih dikekalkan.
Bagi setiap pasangan model dan serangan, penyelidik menjalankan carian hiperparameter yang sistematik. Ini bermakna keputusan tidak bergantung pada satu konfigurasi serangan sahaja. 2
Kajian itu meliputi sembilan bentuk pengubahsuaian, termasuk:
Ujian utama bukan sekadar melihat sama ada model boleh dijadikan tidak selamat. Penyelidik mencari serangan yang meningkatkan kadar respons berbahaya, sambil memastikan penurunan ketepatan penaakulan MMLU-Pro tidak melebihi 10% berbanding prestasi model sebelum diubah suai. 2
Keputusan paling serius secara umumnya datang daripada serangan jailbreak-tuning. Antara varian yang dilaporkan ialah pendekatan objektif bersaing, pintu belakang dan modulasi gaya.
Serangan ini penting kerana ia boleh menggunakan sebahagian besar data latihan yang kelihatan tidak berbahaya, dengan hanya komponen berbahaya yang kecil. Jadi, ia bukan semata-mata cubaan kasar untuk melatih semula model agar berkelakuan berbahaya. Sebaliknya, ia lebih menyerupai usaha bersasar untuk mengubah tingkah laku keselamatan model sambil mengekalkan kegunaannya. 2
6
Kesimpulan lebih luas kajian itu ialah keselamatan dan keupayaan boleh dipisahkan dengan cara yang merugikan. Pengubahsuaian mungkin melemahkan keengganan model untuk menjawab permintaan berbahaya tanpa memusnahkan prestasi penaakulannya secara sepadan.
Sebab itu, model yang masih kelihatan berguna dalam penanda aras konvensional boleh menjadi jauh lebih berisiko apabila digunakan dalam persekitaran sebenar.
TamperBench menilai 21 model open-weight dengan saiz antara 0.6B hingga 8B parameter, termasuk keluarga model seperti Llama, Qwen3 dan Mistral. Bukti kajian yang tersedia menyokong kesimpulan pada peringkat keseluruhan penanda aras bahawa setiap model yang diuji terdedah kepada sekurang-kurangnya satu serangan. 5
6
Namun begitu, bahan sumber yang ada tidak menyertakan angka tepat peningkatan tahap respons berbahaya bagi Llama-3-8B-Instruct atau Qwen3-8B-Instruct di bawah syarat penurunan prestasi MMLU-Pro sebanyak 10% atau kurang. Oleh itu, angka khusus untuk kedua-dua model tersebut tidak wajar dibuat andaian berdasarkan keputusan keseluruhan kajian.
Kesimpulan yang boleh dipertahankan hanyalah bersifat perbandingan dan kualitatif: serangan tersebut boleh meningkatkan tingkah laku berbahaya dengan ketara sambil mengekalkan sebahagian besar keupayaan penaakulan model, tetapi bukti yang tersedia tidak menetapkan peratusan tepat bagi mana-mana model yang dinamakan.
Kajian itu juga mendapati bahawa varian asas dan varian selepas latihan tidak menunjukkan satu corak ketahanan yang seragam. Ketahanan relatif boleh berbeza mengikut keluarga model, dengan trend yang bertentangan dilaporkan antara varian Llama 3 dan Qwen3. 6
Belum. Lima model yang dipertingkatkan dengan pertahanan tambahan—termasuk varian ReFAT dan Circuit Breaking—turut terdedah kepada rangkaian serangan yang digunakan.
Pertahanan tersebut memang meningkatkan ketahanan dalam sesetengah keadaan, tetapi tidak dapat menghalang pelucutan ciri keselamatan secara konsisten terhadap semua ancaman yang diuji. 2
5
Kajian itu mengenal pasti Triplet sebagai antara pertahanan yang lebih kukuh dan lebih baik dalam mengekalkan keupayaan berdasarkan perbandingan yang dijalankan. Namun, ini ialah petunjuk positif untuk penyelidikan, bukannya jaminan keselamatan. Keputusan utama TamperBench kekal sama: tiada pertahanan yang diuji berjaya menghapuskan masalah pengubahsuaian merentasi keseluruhan rangkaian serangan. 6
Penemuan tersebut tidak bermaksud model open-weight tidak bernilai. Pelepasan terbuka boleh menyokong penyelidikan, pengauditan dan akauntabiliti. Pengajaran yang lebih khusus ialah lulus penilaian penjajaran atau keselamatan sebelum pelancaran tidak boleh dianggap sebagai bukti bahawa model akan kekal selamat selepas pemberatnya diubah secara bebas. 5
Model komersial tertutup atau model yang diakses melalui API turut berdepan persoalan berkaitan penalaan halus dan keselamatan selepas latihan. Namun, penyedia perkhidmatan masih mempunyai lebih banyak kawalan terhadap saluran latihan dan persekitaran penggunaan. Kawalan ini membolehkan mereka menerapkan perlindungan ketika proses penalaan halus atau selepas penyesuaian dibuat—sesuatu yang jauh lebih sukar dikuatkuasakan apabila pemberat model telah diedarkan kepada umum. 2
5
Risiko yang diketengahkan TamperBench bukan sekadar seseorang menemui satu arahan yang menyebabkan model gagal menolak permintaan berbahaya. Jika pengubahsuaian masih mengekalkan keupayaan berguna, model yang telah diubah boleh digunakan berulang kali bagi tugas berbahaya seperti penyebaran maklumat palsu secara besar-besaran, penipuan atau phishing, serta bantuan teknikal yang berbahaya.
Penyelidik mengemukakan perkara ini sebagai implikasi daripada pelucutan perlindungan yang mengekalkan keupayaan model—bukan sebagai ukuran penyalahgunaan sebenar yang dijalankan oleh penanda aras tersebut. 5
Bagi organisasi yang sedang memilih model AI, perbezaan berikut perlu diberi perhatian:
Penyelidik menyeru supaya kaedah ketahanan terhadap pengubahsuaian diperkukuh, penilaian adversarial piawai seperti TamperBench dijalankan sebelum pelepasan, serta penilaian dan perolehan AI dibuat berasaskan lebih banyak bukti.
Mereka turut menekankan konteks berimpak tinggi seperti penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam—bidang yang memerlukan perhatian terhadap tingkah laku model selepas dikeluarkan, bukan hanya rekod keselamatan asalnya. 2
5
TamperBench tidak membuktikan bahawa setiap model open-weight pasti akan disalahgunakan. Kajian itu menunjukkan bahawa, bagi kesemua 21 model yang diuji, ciri keselamatan bukanlah jaminan yang boleh diharapkan apabila penyerang mempunyai keupayaan untuk mengubah model.
Jailbreak-tuning secara terselindung biasanya merupakan kategori serangan paling kuat. Pertahanan tambahan membantu dalam sesetengah situasi, tetapi tidak menutup jurang tersebut sepenuhnya. Pada masa yang sama, bukti yang tersedia tidak menyokong angka peratusan tepat tentang peningkatan tahap bahaya bagi model Llama atau Qwen3 tertentu.
Bagi model open-weight, penilaian keselamatan perlu menguji bukan sahaja perkara yang boleh dilakukan oleh model ketika dilancarkan, tetapi juga sejauh mana tingkah laku keselamatannya mampu bertahan selepas diubah suai.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan...
TamperBench mendapati kesemua 21 model bahasa besar open weight yang diuji terdedah kepada sekurang kurangnya satu daripada sembilan ancaman pengubahsuaian, lazimnya tanpa penurunan lebih 10% dalam prestasi penaakulan... Serangan jailbreak tuning secara terselindung—terutamanya varian objektif bersaing, pintu belakang dan modulasi gaya—biasanya merupakan kategori serangan paling berkesan.
Model dengan pertahanan tambahan, termasuk varian ReFAT dan Circuit Breaking, menunjukkan peningkatan dalam sesetengah keadaan tetapi tidak memberikan jaminan yang konsisten terhadap pelucutan ciri keselamatan.