Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik. Serangan penalaan jailbreak secara terselindung—termasuk varian competing objectives, backdoor dan style modulation—biasanya menghasilkan kesan paling teruk.
Diterbitkan olehImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Kajian TamperBench mendapati tiada satu pun daripada 21 model AI sumber terbuka (open-weight) yang diuji mempunyai perlindungan keselamatan cukup kukuh untuk menahan semua ancaman pengusikan yang dinilai. Setiap model boleh dibuat lebih cenderung menghasilkan kandungan berbahaya, sambil mengekalkan sebahagian besar keupayaan penaakulannya. 2
5
Model yang diuji merangkumi keluarga seperti Llama, Qwen3 dan Mistral, dengan saiz antara 600 juta hingga 8 bilion parameter. Dapatan ini menunjukkan bahawa keputusan lulus dalam ujian penjajaran keselamatan sebelum pelancaran tidak semestinya menjadi jaminan apabila berat model boleh diubah suai.
TamperBench menggabungkan sembilan kaedah pengusikan pada ruang berat model dan ruang representasi laten. Kaedah-kaedah itu merangkumi:
Serangan yang biasanya paling teruk ialah penalaan jailbreak terselindung, khususnya varian competing objectives, backdoor dan style modulation. Serangan ini dilatih terutamanya menggunakan data yang kelihatan benign, dengan hanya sebahagian kecil komponen berbahaya—menjadikannya lebih sukar dikesan melalui pemeriksaan biasa. 2
Para penyelidik memilih konfigurasi serangan yang memaksimumkan skor respons berbahaya, tetapi mengehadkan kemerosotan ketepatan penaakulan MMLU-Pro kepada tidak lebih daripada 10 peratus berbanding model yang tidak diusik. MMLU-Pro ialah penanda aras yang menguji kefahaman dan penaakulan dalam pelbagai bidang. 2
Ini bermakna serangan tersebut tidak semata-mata merosakkan model sehingga ia tidak lagi berguna. Sebaliknya, matlamatnya ialah melemahkan perlindungan keselamatan sambil mengekalkan keupayaan model pada tahap yang hampir sama.
Lima model dengan pertahanan tambahan, termasuk varian ReFAT dan Circuit Breaking, turut diuji. Kaedah-kaedah ini memang meningkatkan ketahanan dalam sesetengah keadaan, tetapi tidak berjaya menghalang penyingkiran perlindungan keselamatan secara konsisten merentasi keseluruhan set serangan. 2
5
Dapatan itu penting kerana berat model sumber terbuka boleh disalin, ditala semula dan diedarkan tanpa pembangun asal mempunyai kawalan penuh terhadap penggunaan seterusnya. Kawalan keselamatan yang boleh dikuatkuasakan pada perkhidmatan API atau proses penalaan rasmi mungkin hilang selepas berat model disebarkan secara bebas. 2
Para penyelidik tidak mengatakan bahawa model sumber terbuka tidak berguna. Keterbukaan masih menyokong penyelidikan, audit dan akauntabiliti. Namun, mereka memberi amaran bahawa model awam tidak wajar dianggap selamat hanya kerana ia melepasi ujian penjajaran sebelum dikeluarkan. 5
Risiko yang dibayangkan bukan terhad kepada seseorang yang mengubah suai model secara manual. Jika keupayaan model kekal tinggi selepas perlindungan keselamatan dibuang, ia berpotensi digunakan untuk penyalahgunaan berskala besar seperti penyebaran maklumat palsu, penipuan atau pancingan data yang lebih canggih, serta panduan teknikal berbahaya. 5
Model komersial tertutup mungkin menghadapi risiko pengusikan yang berkaitan, tetapi penyedia yang mengawal penalaan halus dan penggunaan boleh menambah pertahanan pada peringkat tersebut. Pilihan ini tidak lagi tersedia dengan cara yang sama apabila berat model diedarkan secara bebas. 2
5
Maklumat yang diberikan dalam kajian dan sumber sokongan ini tidak menyatakan peningkatan tahap kandungan berbahaya secara khusus bagi setiap model. Oleh itu, tiada angka tepat untuk perubahan tahap bahaya Llama-3-8B-Instruct atau Qwen3-8B-Instruct boleh dinyatakan dengan boleh dipercayai.
Secara keseluruhan, TamperBench menggesa penyelidikan yang lebih kukuh tentang ketahanan terhadap pengusikan, penilaian adversarial piawai sebelum pelepasan model, serta kaedah penilaian dan perolehan AI yang berasaskan bukti—terutamanya apabila kerajaan menggunakan AI dalam penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam lain. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik.
Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik. Serangan penalaan jailbreak secara terselindung—termasuk varian competing objectives, backdoor dan style modulation—biasanya menghasilkan kesan paling teruk.
Model yang dipertingkat dengan pertahanan seperti ReFAT dan Circuit Breaking juga tidak kebal sepenuhnya terhadap serangan yang diuji.
Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik. Serangan penalaan jailbreak secara terselindung—termasuk varian competing objectives, backdoor dan style modulation—biasanya menghasilkan kesan paling teruk.
Diterbitkan olehImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Kajian TamperBench mendapati tiada satu pun daripada 21 model AI sumber terbuka (open-weight) yang diuji mempunyai perlindungan keselamatan cukup kukuh untuk menahan semua ancaman pengusikan yang dinilai. Setiap model boleh dibuat lebih cenderung menghasilkan kandungan berbahaya, sambil mengekalkan sebahagian besar keupayaan penaakulannya. 2
5
Model yang diuji merangkumi keluarga seperti Llama, Qwen3 dan Mistral, dengan saiz antara 600 juta hingga 8 bilion parameter. Dapatan ini menunjukkan bahawa keputusan lulus dalam ujian penjajaran keselamatan sebelum pelancaran tidak semestinya menjadi jaminan apabila berat model boleh diubah suai.
TamperBench menggabungkan sembilan kaedah pengusikan pada ruang berat model dan ruang representasi laten. Kaedah-kaedah itu merangkumi:
Serangan yang biasanya paling teruk ialah penalaan jailbreak terselindung, khususnya varian competing objectives, backdoor dan style modulation. Serangan ini dilatih terutamanya menggunakan data yang kelihatan benign, dengan hanya sebahagian kecil komponen berbahaya—menjadikannya lebih sukar dikesan melalui pemeriksaan biasa. 2
Para penyelidik memilih konfigurasi serangan yang memaksimumkan skor respons berbahaya, tetapi mengehadkan kemerosotan ketepatan penaakulan MMLU-Pro kepada tidak lebih daripada 10 peratus berbanding model yang tidak diusik. MMLU-Pro ialah penanda aras yang menguji kefahaman dan penaakulan dalam pelbagai bidang. 2
Ini bermakna serangan tersebut tidak semata-mata merosakkan model sehingga ia tidak lagi berguna. Sebaliknya, matlamatnya ialah melemahkan perlindungan keselamatan sambil mengekalkan keupayaan model pada tahap yang hampir sama.
Lima model dengan pertahanan tambahan, termasuk varian ReFAT dan Circuit Breaking, turut diuji. Kaedah-kaedah ini memang meningkatkan ketahanan dalam sesetengah keadaan, tetapi tidak berjaya menghalang penyingkiran perlindungan keselamatan secara konsisten merentasi keseluruhan set serangan. 2
5
Dapatan itu penting kerana berat model sumber terbuka boleh disalin, ditala semula dan diedarkan tanpa pembangun asal mempunyai kawalan penuh terhadap penggunaan seterusnya. Kawalan keselamatan yang boleh dikuatkuasakan pada perkhidmatan API atau proses penalaan rasmi mungkin hilang selepas berat model disebarkan secara bebas. 2
Para penyelidik tidak mengatakan bahawa model sumber terbuka tidak berguna. Keterbukaan masih menyokong penyelidikan, audit dan akauntabiliti. Namun, mereka memberi amaran bahawa model awam tidak wajar dianggap selamat hanya kerana ia melepasi ujian penjajaran sebelum dikeluarkan. 5
Risiko yang dibayangkan bukan terhad kepada seseorang yang mengubah suai model secara manual. Jika keupayaan model kekal tinggi selepas perlindungan keselamatan dibuang, ia berpotensi digunakan untuk penyalahgunaan berskala besar seperti penyebaran maklumat palsu, penipuan atau pancingan data yang lebih canggih, serta panduan teknikal berbahaya. 5
Model komersial tertutup mungkin menghadapi risiko pengusikan yang berkaitan, tetapi penyedia yang mengawal penalaan halus dan penggunaan boleh menambah pertahanan pada peringkat tersebut. Pilihan ini tidak lagi tersedia dengan cara yang sama apabila berat model diedarkan secara bebas. 2
5
Maklumat yang diberikan dalam kajian dan sumber sokongan ini tidak menyatakan peningkatan tahap kandungan berbahaya secara khusus bagi setiap model. Oleh itu, tiada angka tepat untuk perubahan tahap bahaya Llama-3-8B-Instruct atau Qwen3-8B-Instruct boleh dinyatakan dengan boleh dipercayai.
Secara keseluruhan, TamperBench menggesa penyelidikan yang lebih kukuh tentang ketahanan terhadap pengusikan, penilaian adversarial piawai sebelum pelepasan model, serta kaedah penilaian dan perolehan AI yang berasaskan bukti—terutamanya apabila kerajaan menggunakan AI dalam penjagaan kesihatan, pengesanan penipuan, pendidikan dan perkhidmatan awam lain. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik.
Kesemua 21 model AI sumber terbuka yang diuji boleh dibuat lebih cenderung menghasilkan output berbahaya selepas berat model atau representasi latennya diusik. Serangan penalaan jailbreak secara terselindung—termasuk varian competing objectives, backdoor dan style modulation—biasanya menghasilkan kesan paling teruk.
Model yang dipertingkat dengan pertahanan seperti ReFAT dan Circuit Breaking juga tidak kebal sepenuhnya terhadap serangan yang diuji.