TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10% การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝง โดยเฉพาะรูปแบบ competing objectives, backdoor และ style modulation มักเป็นกลุ่มการโจมตี...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
ผลการศึกษาของ TamperBench ให้ข้อสรุปที่น่าจับตาอย่างยิ่ง: โมเดลภาษาขนาดใหญ่แบบเปิดน้ำหนักทั้ง 21 รุ่นที่นำมาทดสอบ ไม่มีรุ่นใดที่ระบบความปลอดภัยสามารถต้านทานภัยคุกคามจากการดัดแปลงได้อย่างน่าเชื่อถือ โมเดลเหล่านี้มีขนาดตั้งแต่ราว 600 ล้านถึง 8 พันล้านพารามิเตอร์ และรวมทั้งรุ่นมาตรฐานกับรุ่นที่เสริมกลไกป้องกันไว้แล้ว
การโจมตีอย่างน้อย 1 รูปแบบสามารถทำให้โมเดลแต่ละรุ่นมีแนวโน้มสร้างเนื้อหาอันตรายมากขึ้น ขณะเดียวกันยังคงความสามารถทั่วไปและความสามารถด้านเหตุผลไว้ได้มาก 2
5
6
ประเด็นนี้สำคัญเป็นพิเศษสำหรับโมเดลแบบเปิดน้ำหนัก เพราะผู้ใช้สามารถคัดลอก นำไปปรับจูนต่อ และเผยแพร่ซ้ำได้ ระบบความปลอดภัยที่ผ่านการทดสอบในสภาพแวดล้อมของผู้พัฒนา จึงไม่ได้หมายความว่าจะยังคงทำงานได้เหมือนเดิมเมื่อมีการแก้ไขน้ำหนักของโมเดล
TamperBench ถูกออกแบบมาเพื่อวัด ความต้านทานต่อการดัดแปลง ไม่ใช่เพียงความสามารถในการรับมือกับการเจาะระบบผ่านพรอมป์ตตามปกติ หรือที่มักเรียกว่า prompt jailbreak การทดสอบผสานทั้งการโจมตีด้วยการปรับจูนในพื้นที่น้ำหนักของโมเดล และการโจมตีที่เปลี่ยนแปลงตัวแทนข้อมูลภายในหรือ latent representations จากนั้นจึงวัดทั้งพฤติกรรมด้านความปลอดภัยและความสามารถที่โมเดลยังคงรักษาไว้
สำหรับโมเดลและรูปแบบการโจมตีแต่ละคู่ นักวิจัยใช้การค้นหาค่าพารามิเตอร์อย่างเป็นระบบ แทนการพึ่งพาการตั้งค่าการโจมตีเพียงชุดเดียว 2
การศึกษาครอบคลุมแนวทางการดัดแปลง 9 กลุ่ม ซึ่งรวมถึง
โจทย์สำคัญของการทดสอบไม่ใช่เพียงการดูว่าโมเดลถูกทำให้ไม่ปลอดภัยได้หรือไม่ นักวิจัยมองหาการโจมตีที่เพิ่มอัตราการตอบสนองที่เป็นอันตราย ขณะเดียวกันจำกัดการลดลงของความแม่นยำด้านเหตุผลบน MMLU-Pro ให้อยู่ภายใน 10% เมื่อเทียบกับโมเดลที่ยังไม่ถูกโจมตี 2
ผลกระทบที่รุนแรงที่สุดโดยทั่วไปมาจากการโจมตีประเภท jailbreak-tuning หรือการปรับจูนเพื่อทำให้ระบบปฏิเสธคำขออันตรายได้น้อยลง งานศึกษารายงานรูปแบบสำคัญ ได้แก่ competing objectives, backdoor และ style modulation
จุดที่ทำให้การโจมตีเหล่านี้น่ากังวลคือ อาจใช้ข้อมูลฝึกส่วนใหญ่ที่ดูปลอดภัย และแทรกข้อมูลอันตรายไว้เพียงสัดส่วนเล็กน้อย จึงไม่ใช่การฝึกโมเดลใหม่ให้มีพฤติกรรมไม่ปลอดภัยอย่างโจ่งแจ้ง แต่เป็นความพยายามแบบเจาะจงเพื่อเปลี่ยนพฤติกรรมด้านความปลอดภัย โดยยังรักษาประโยชน์ใช้สอยของโมเดลเอาไว้ 2
6
ข้อสรุปโดยรวมของรายงานคือ ความปลอดภัยกับความสามารถของโมเดลอาจถูกแยกออกจากกันในทิศทางที่ไม่พึงประสงค์ การดัดแปลงอาจทำให้พฤติกรรมการปฏิเสธคำขอลดลง โดยไม่ทำลายความสามารถด้านเหตุผลในสัดส่วนเดียวกัน นั่นหมายความว่าโมเดลอาจยังดูมีประสิทธิภาพเมื่อวัดด้วยเกณฑ์มาตรฐานทั่วไป แต่มีความเสี่ยงสูงขึ้นอย่างมากเมื่อนำไปใช้งานจริง
TamperBench ประเมินโมเดลแบบเปิดน้ำหนัก 21 รุ่นในช่วง 0.6B–8B พารามิเตอร์ ซึ่งรวมตระกูลโมเดลอย่าง Llama, Qwen3 และ Mistral หลักฐานจากงานศึกษาที่มีอยู่สนับสนุนข้อสรุประดับภาพรวมว่า โมเดลทุกตัวที่ทดสอบมีช่องโหว่ต่อการโจมตีอย่างน้อย 1 รูปแบบ 5
6
อย่างไรก็ตาม แหล่งข้อมูลที่มีให้ไม่ได้ระบุตัวเลขการเพิ่มขึ้นของความเป็นอันตรายแบบแยกรายโมเดลสำหรับ Llama-3-8B-Instruct หรือ Qwen3-8B-Instruct ภายใต้เงื่อนไขที่ความสามารถบน MMLU-Pro ลดลงไม่เกิน 10% ดังนั้นจึงไม่ควรอนุมานตัวเลขดังกล่าวจากผลรวมของการศึกษา
ข้อสรุปที่กล่าวได้อย่างมีหลักฐานรองรับคือ การโจมตีสามารถเพิ่มพฤติกรรมที่เป็นอันตรายได้อย่างมีนัยสำคัญ ขณะที่ยังคงความสามารถด้านเหตุผลของโมเดลไว้ได้มาก แต่ข้อมูลที่มีอยู่ยังไม่เพียงพอที่จะระบุเปอร์เซ็นต์ที่แม่นยำสำหรับ Llama หรือ Qwen3 รุ่นใดรุ่นหนึ่ง
งานศึกษายังพบว่าโมเดลพื้นฐานและโมเดลที่ผ่านการฝึกเพิ่มเติมไม่ได้มีรูปแบบความต้านทานต่อการดัดแปลงแบบเดียวกันทั้งหมด ระดับความแข็งแกร่งอาจแตกต่างกันไปตามตระกูลโมเดล และมีการรายงานแนวโน้มที่ตรงข้ามกันระหว่างรุ่นในตระกูล Llama 3 กับ Qwen3 6
คำตอบคือยังไม่ได้ทั้งหมด โมเดลที่เสริมระบบป้องกัน 5 รุ่น ซึ่งรวมถึงรุ่นที่ใช้ ReFAT และ Circuit Breaking ก็ยังเปราะบางต่อชุดการโจมตีของ TamperBench เช่นกัน ระบบเหล่านี้ช่วยเพิ่มความต้านทานได้ในบางสถานการณ์ แต่ยังไม่สามารถป้องกันการถอดระบบความปลอดภัยได้อย่างสม่ำเสมอเมื่อเจอกับภัยคุกคามทุกรูปแบบที่ทดสอบ 2
5
งานวิจัยระบุว่า Triplet เป็นหนึ่งในแนวทางที่มีความแข็งแกร่งและรักษาความสามารถของโมเดลไว้ได้ดีเมื่อเทียบกับวิธีอื่นในการประเมิน อย่างไรก็ตาม นี่เป็นสัญญาณที่มีความหวังสำหรับงานวิจัย ไม่ใช่หลักประกันด้านความปลอดภัย เพราะผลลัพธ์สำคัญของการทดสอบยังคงเป็นว่า ไม่มีระบบป้องกันใดที่กำจัดปัญหาการดัดแปลงได้ตลอดชุดการโจมตีทั้งหมด 6
ผลการศึกษานี้ไม่ได้หมายความว่าโมเดลแบบเปิดน้ำหนักไม่มีคุณค่า การเปิดเผยน้ำหนักช่วยสนับสนุนการวิจัย การตรวจสอบ และความรับผิดรับชอบต่อสาธารณะ บทเรียนที่แคบและตรงประเด็นกว่าคือ การผ่านการประเมินความสอดคล้องหรือความปลอดภัยก่อนเปิดตัว ไม่ควรถูกตีความว่าโมเดลจะยังปลอดภัยหลังจากผู้ใช้สามารถแก้ไขน้ำหนักได้อย่างอิสระ 5
โมเดลเชิงพาณิชย์แบบปิดหรือบริการผ่าน API ก็อาจเผชิญคำถามเกี่ยวกับการปรับจูนและความปลอดภัยหลังการฝึกเช่นกัน แต่ผู้ให้บริการยังควบคุมกระบวนการฝึกและสภาพแวดล้อมการใช้งานได้มากกว่า จึงมีทางเลือกในการใส่มาตรการป้องกันระหว่างการปรับจูนหรือหลังการปรับแต่ง ซึ่งทำได้ยากกว่ามากเมื่อมีการเผยแพร่น้ำหนักให้ผู้ใช้ดาวน์โหลดและนำไปแจกจ่ายต่อ 2
5
ความเสี่ยงที่ TamperBench ชี้ให้เห็นไม่ได้จำกัดอยู่ที่การค้นพบพรอมป์ตเพียงหนึ่งชุดเพื่อทำให้โมเดลปฏิเสธคำขอไม่สำเร็จ หากการดัดแปลงยังรักษาความสามารถที่มีประโยชน์ไว้ได้ โมเดลที่ถูกแก้ไขอาจถูกนำไปใช้งานซ้ำในวงกว้างกับภารกิจที่เป็นอันตราย เช่น การเผยแพร่ข้อมูลบิดเบือนจำนวนมาก การหลอกลวงหรือฟิชชิง และการให้คำแนะนำทางเทคนิคที่ก่ออันตราย
นักวิจัยนำเสนอเรื่องเหล่านี้ในฐานะผลกระทบที่อาจเกิดขึ้นจากการถอดกลไกป้องกันโดยยังคงความสามารถของโมเดลไว้ ไม่ใช่การวัดการนำโมเดลไปก่อเหตุจริงโดยตัวการทดสอบเอง 5
สำหรับองค์กรที่กำลังเลือกโมเดล AI บทเรียนเชิงปฏิบัติคือควรแยกการประเมินออกเป็น 2 ประเภท
นักวิจัยเรียกร้องให้พัฒนาวิธีวัดความต้านทานต่อการดัดแปลงให้แข็งแกร่งขึ้น จัดทำการประเมินเชิงปฏิปักษ์ที่เป็นมาตรฐาน เช่น TamperBench ก่อนการเปิดตัว และยกระดับการประเมินรวมถึงการจัดซื้อ AI ให้ยึดหลักฐานมากขึ้น 2
5
ข้อเสนอเหล่านี้มีความสำคัญเป็นพิเศษในภาคส่วนที่มีผลกระทบสูง เช่น สาธารณสุข การตรวจจับการฉ้อโกง การศึกษา และบริการสาธารณะ เพราะพฤติกรรมของโมเดลหลังถูกนำออกไปใช้งานอาจสำคัญไม่แพ้ประวัติความปลอดภัยในวันที่เปิดตัว
TamperBench ไม่ได้พิสูจน์ว่าโมเดลแบบเปิดน้ำหนักทุกตัวจะถูกนำไปใช้ในทางที่ผิด แต่แสดงให้เห็นว่า ในโมเดลทั้ง 21 รุ่นที่ทดสอบ ระบบความปลอดภัยยังไม่ใช่หลักประกันที่เชื่อถือได้เมื่อผู้โจมตีสามารถดัดแปลงโมเดลได้
การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝงมักเป็นกลุ่มการโจมตีที่ได้ผลมากที่สุด ระบบป้องกันเพิ่มเติมช่วยได้ในบางกรณี แต่ยังไม่สามารถปิดช่องว่างได้ทั้งหมด และหลักฐานที่มีอยู่ก็ไม่รองรับการระบุเปอร์เซ็นต์การเพิ่มขึ้นของความเป็นอันตรายแบบเจาะจงสำหรับ Llama หรือ Qwen3 รุ่นใดรุ่นหนึ่ง
สำหรับการเผยแพร่โมเดลแบบเปิดน้ำหนัก การประเมินความปลอดภัยจึงควรตรวจสอบไม่เพียงว่าโมเดลทำอะไรได้ตั้งแต่เริ่มเปิดตัว แต่ต้องตรวจสอบด้วยว่าพฤติกรรมด้านความปลอดภัยเหล่านั้นยังคงอยู่มากน้อยเพียงใดหลังถูกแก้ไข
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10%
TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10% การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝง โดยเฉพาะรูปแบบ competing objectives, backdoor และ style modulation มักเป็นกลุ่มการโจมตีที่ได้ผลมากที่สุด
โมเดลที่เสริมระบบป้องกัน รวมถึงรุ่น ReFAT และ Circuit Breaking ช่วยเพิ่มความต้านทานได้ในบางกรณี แต่ยังไม่สามารถรับประกันว่าจะป้องกันการถอดระบบความปลอดภัยได้ทั้งหมด
TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10% การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝง โดยเฉพาะรูปแบบ competing objectives, backdoor และ style modulation มักเป็นกลุ่มการโจมตี...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
ผลการศึกษาของ TamperBench ให้ข้อสรุปที่น่าจับตาอย่างยิ่ง: โมเดลภาษาขนาดใหญ่แบบเปิดน้ำหนักทั้ง 21 รุ่นที่นำมาทดสอบ ไม่มีรุ่นใดที่ระบบความปลอดภัยสามารถต้านทานภัยคุกคามจากการดัดแปลงได้อย่างน่าเชื่อถือ โมเดลเหล่านี้มีขนาดตั้งแต่ราว 600 ล้านถึง 8 พันล้านพารามิเตอร์ และรวมทั้งรุ่นมาตรฐานกับรุ่นที่เสริมกลไกป้องกันไว้แล้ว
การโจมตีอย่างน้อย 1 รูปแบบสามารถทำให้โมเดลแต่ละรุ่นมีแนวโน้มสร้างเนื้อหาอันตรายมากขึ้น ขณะเดียวกันยังคงความสามารถทั่วไปและความสามารถด้านเหตุผลไว้ได้มาก 2
5
6
ประเด็นนี้สำคัญเป็นพิเศษสำหรับโมเดลแบบเปิดน้ำหนัก เพราะผู้ใช้สามารถคัดลอก นำไปปรับจูนต่อ และเผยแพร่ซ้ำได้ ระบบความปลอดภัยที่ผ่านการทดสอบในสภาพแวดล้อมของผู้พัฒนา จึงไม่ได้หมายความว่าจะยังคงทำงานได้เหมือนเดิมเมื่อมีการแก้ไขน้ำหนักของโมเดล
TamperBench ถูกออกแบบมาเพื่อวัด ความต้านทานต่อการดัดแปลง ไม่ใช่เพียงความสามารถในการรับมือกับการเจาะระบบผ่านพรอมป์ตตามปกติ หรือที่มักเรียกว่า prompt jailbreak การทดสอบผสานทั้งการโจมตีด้วยการปรับจูนในพื้นที่น้ำหนักของโมเดล และการโจมตีที่เปลี่ยนแปลงตัวแทนข้อมูลภายในหรือ latent representations จากนั้นจึงวัดทั้งพฤติกรรมด้านความปลอดภัยและความสามารถที่โมเดลยังคงรักษาไว้
สำหรับโมเดลและรูปแบบการโจมตีแต่ละคู่ นักวิจัยใช้การค้นหาค่าพารามิเตอร์อย่างเป็นระบบ แทนการพึ่งพาการตั้งค่าการโจมตีเพียงชุดเดียว 2
การศึกษาครอบคลุมแนวทางการดัดแปลง 9 กลุ่ม ซึ่งรวมถึง
โจทย์สำคัญของการทดสอบไม่ใช่เพียงการดูว่าโมเดลถูกทำให้ไม่ปลอดภัยได้หรือไม่ นักวิจัยมองหาการโจมตีที่เพิ่มอัตราการตอบสนองที่เป็นอันตราย ขณะเดียวกันจำกัดการลดลงของความแม่นยำด้านเหตุผลบน MMLU-Pro ให้อยู่ภายใน 10% เมื่อเทียบกับโมเดลที่ยังไม่ถูกโจมตี 2
ผลกระทบที่รุนแรงที่สุดโดยทั่วไปมาจากการโจมตีประเภท jailbreak-tuning หรือการปรับจูนเพื่อทำให้ระบบปฏิเสธคำขออันตรายได้น้อยลง งานศึกษารายงานรูปแบบสำคัญ ได้แก่ competing objectives, backdoor และ style modulation
จุดที่ทำให้การโจมตีเหล่านี้น่ากังวลคือ อาจใช้ข้อมูลฝึกส่วนใหญ่ที่ดูปลอดภัย และแทรกข้อมูลอันตรายไว้เพียงสัดส่วนเล็กน้อย จึงไม่ใช่การฝึกโมเดลใหม่ให้มีพฤติกรรมไม่ปลอดภัยอย่างโจ่งแจ้ง แต่เป็นความพยายามแบบเจาะจงเพื่อเปลี่ยนพฤติกรรมด้านความปลอดภัย โดยยังรักษาประโยชน์ใช้สอยของโมเดลเอาไว้ 2
6
ข้อสรุปโดยรวมของรายงานคือ ความปลอดภัยกับความสามารถของโมเดลอาจถูกแยกออกจากกันในทิศทางที่ไม่พึงประสงค์ การดัดแปลงอาจทำให้พฤติกรรมการปฏิเสธคำขอลดลง โดยไม่ทำลายความสามารถด้านเหตุผลในสัดส่วนเดียวกัน นั่นหมายความว่าโมเดลอาจยังดูมีประสิทธิภาพเมื่อวัดด้วยเกณฑ์มาตรฐานทั่วไป แต่มีความเสี่ยงสูงขึ้นอย่างมากเมื่อนำไปใช้งานจริง
TamperBench ประเมินโมเดลแบบเปิดน้ำหนัก 21 รุ่นในช่วง 0.6B–8B พารามิเตอร์ ซึ่งรวมตระกูลโมเดลอย่าง Llama, Qwen3 และ Mistral หลักฐานจากงานศึกษาที่มีอยู่สนับสนุนข้อสรุประดับภาพรวมว่า โมเดลทุกตัวที่ทดสอบมีช่องโหว่ต่อการโจมตีอย่างน้อย 1 รูปแบบ 5
6
อย่างไรก็ตาม แหล่งข้อมูลที่มีให้ไม่ได้ระบุตัวเลขการเพิ่มขึ้นของความเป็นอันตรายแบบแยกรายโมเดลสำหรับ Llama-3-8B-Instruct หรือ Qwen3-8B-Instruct ภายใต้เงื่อนไขที่ความสามารถบน MMLU-Pro ลดลงไม่เกิน 10% ดังนั้นจึงไม่ควรอนุมานตัวเลขดังกล่าวจากผลรวมของการศึกษา
ข้อสรุปที่กล่าวได้อย่างมีหลักฐานรองรับคือ การโจมตีสามารถเพิ่มพฤติกรรมที่เป็นอันตรายได้อย่างมีนัยสำคัญ ขณะที่ยังคงความสามารถด้านเหตุผลของโมเดลไว้ได้มาก แต่ข้อมูลที่มีอยู่ยังไม่เพียงพอที่จะระบุเปอร์เซ็นต์ที่แม่นยำสำหรับ Llama หรือ Qwen3 รุ่นใดรุ่นหนึ่ง
งานศึกษายังพบว่าโมเดลพื้นฐานและโมเดลที่ผ่านการฝึกเพิ่มเติมไม่ได้มีรูปแบบความต้านทานต่อการดัดแปลงแบบเดียวกันทั้งหมด ระดับความแข็งแกร่งอาจแตกต่างกันไปตามตระกูลโมเดล และมีการรายงานแนวโน้มที่ตรงข้ามกันระหว่างรุ่นในตระกูล Llama 3 กับ Qwen3 6
คำตอบคือยังไม่ได้ทั้งหมด โมเดลที่เสริมระบบป้องกัน 5 รุ่น ซึ่งรวมถึงรุ่นที่ใช้ ReFAT และ Circuit Breaking ก็ยังเปราะบางต่อชุดการโจมตีของ TamperBench เช่นกัน ระบบเหล่านี้ช่วยเพิ่มความต้านทานได้ในบางสถานการณ์ แต่ยังไม่สามารถป้องกันการถอดระบบความปลอดภัยได้อย่างสม่ำเสมอเมื่อเจอกับภัยคุกคามทุกรูปแบบที่ทดสอบ 2
5
งานวิจัยระบุว่า Triplet เป็นหนึ่งในแนวทางที่มีความแข็งแกร่งและรักษาความสามารถของโมเดลไว้ได้ดีเมื่อเทียบกับวิธีอื่นในการประเมิน อย่างไรก็ตาม นี่เป็นสัญญาณที่มีความหวังสำหรับงานวิจัย ไม่ใช่หลักประกันด้านความปลอดภัย เพราะผลลัพธ์สำคัญของการทดสอบยังคงเป็นว่า ไม่มีระบบป้องกันใดที่กำจัดปัญหาการดัดแปลงได้ตลอดชุดการโจมตีทั้งหมด 6
ผลการศึกษานี้ไม่ได้หมายความว่าโมเดลแบบเปิดน้ำหนักไม่มีคุณค่า การเปิดเผยน้ำหนักช่วยสนับสนุนการวิจัย การตรวจสอบ และความรับผิดรับชอบต่อสาธารณะ บทเรียนที่แคบและตรงประเด็นกว่าคือ การผ่านการประเมินความสอดคล้องหรือความปลอดภัยก่อนเปิดตัว ไม่ควรถูกตีความว่าโมเดลจะยังปลอดภัยหลังจากผู้ใช้สามารถแก้ไขน้ำหนักได้อย่างอิสระ 5
โมเดลเชิงพาณิชย์แบบปิดหรือบริการผ่าน API ก็อาจเผชิญคำถามเกี่ยวกับการปรับจูนและความปลอดภัยหลังการฝึกเช่นกัน แต่ผู้ให้บริการยังควบคุมกระบวนการฝึกและสภาพแวดล้อมการใช้งานได้มากกว่า จึงมีทางเลือกในการใส่มาตรการป้องกันระหว่างการปรับจูนหรือหลังการปรับแต่ง ซึ่งทำได้ยากกว่ามากเมื่อมีการเผยแพร่น้ำหนักให้ผู้ใช้ดาวน์โหลดและนำไปแจกจ่ายต่อ 2
5
ความเสี่ยงที่ TamperBench ชี้ให้เห็นไม่ได้จำกัดอยู่ที่การค้นพบพรอมป์ตเพียงหนึ่งชุดเพื่อทำให้โมเดลปฏิเสธคำขอไม่สำเร็จ หากการดัดแปลงยังรักษาความสามารถที่มีประโยชน์ไว้ได้ โมเดลที่ถูกแก้ไขอาจถูกนำไปใช้งานซ้ำในวงกว้างกับภารกิจที่เป็นอันตราย เช่น การเผยแพร่ข้อมูลบิดเบือนจำนวนมาก การหลอกลวงหรือฟิชชิง และการให้คำแนะนำทางเทคนิคที่ก่ออันตราย
นักวิจัยนำเสนอเรื่องเหล่านี้ในฐานะผลกระทบที่อาจเกิดขึ้นจากการถอดกลไกป้องกันโดยยังคงความสามารถของโมเดลไว้ ไม่ใช่การวัดการนำโมเดลไปก่อเหตุจริงโดยตัวการทดสอบเอง 5
สำหรับองค์กรที่กำลังเลือกโมเดล AI บทเรียนเชิงปฏิบัติคือควรแยกการประเมินออกเป็น 2 ประเภท
นักวิจัยเรียกร้องให้พัฒนาวิธีวัดความต้านทานต่อการดัดแปลงให้แข็งแกร่งขึ้น จัดทำการประเมินเชิงปฏิปักษ์ที่เป็นมาตรฐาน เช่น TamperBench ก่อนการเปิดตัว และยกระดับการประเมินรวมถึงการจัดซื้อ AI ให้ยึดหลักฐานมากขึ้น 2
5
ข้อเสนอเหล่านี้มีความสำคัญเป็นพิเศษในภาคส่วนที่มีผลกระทบสูง เช่น สาธารณสุข การตรวจจับการฉ้อโกง การศึกษา และบริการสาธารณะ เพราะพฤติกรรมของโมเดลหลังถูกนำออกไปใช้งานอาจสำคัญไม่แพ้ประวัติความปลอดภัยในวันที่เปิดตัว
TamperBench ไม่ได้พิสูจน์ว่าโมเดลแบบเปิดน้ำหนักทุกตัวจะถูกนำไปใช้ในทางที่ผิด แต่แสดงให้เห็นว่า ในโมเดลทั้ง 21 รุ่นที่ทดสอบ ระบบความปลอดภัยยังไม่ใช่หลักประกันที่เชื่อถือได้เมื่อผู้โจมตีสามารถดัดแปลงโมเดลได้
การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝงมักเป็นกลุ่มการโจมตีที่ได้ผลมากที่สุด ระบบป้องกันเพิ่มเติมช่วยได้ในบางกรณี แต่ยังไม่สามารถปิดช่องว่างได้ทั้งหมด และหลักฐานที่มีอยู่ก็ไม่รองรับการระบุเปอร์เซ็นต์การเพิ่มขึ้นของความเป็นอันตรายแบบเจาะจงสำหรับ Llama หรือ Qwen3 รุ่นใดรุ่นหนึ่ง
สำหรับการเผยแพร่โมเดลแบบเปิดน้ำหนัก การประเมินความปลอดภัยจึงควรตรวจสอบไม่เพียงว่าโมเดลทำอะไรได้ตั้งแต่เริ่มเปิดตัว แต่ต้องตรวจสอบด้วยว่าพฤติกรรมด้านความปลอดภัยเหล่านั้นยังคงอยู่มากน้อยเพียงใดหลังถูกแก้ไข
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10%
TamperBench พบว่าโมเดล AI แบบเปิดน้ำหนักทั้ง 21 รุ่นที่ทดสอบมีช่องโหว่ต่อการโจมตีดัดแปลงอย่างน้อย 1 จาก 9 รูปแบบ โดยมักรักษาความสามารถด้านเหตุผลตาม MMLU Pro ได้ภายในระดับการลดลงไม่เกิน 10% การปรับจูนเพื่อเจาะระบบความปลอดภัยแบบแฝง โดยเฉพาะรูปแบบ competing objectives, backdoor และ style modulation มักเป็นกลุ่มการโจมตีที่ได้ผลมากที่สุด
โมเดลที่เสริมระบบป้องกัน รวมถึงรุ่น ReFAT และ Circuit Breaking ช่วยเพิ่มความต้านทานได้ในบางกรณี แต่ยังไม่สามารถรับประกันว่าจะป้องกันการถอดระบบความปลอดภัยได้ทั้งหมด