TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน... นักวิจัยจึงมองว่าแนวทางป้องกันในปัจจุบันยังไม่อาจรับประกันความปลอดภัยของโมเดลที่เปิดให้ผู้ใช้นำเ...
เผยแพร่โดยรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
งานวิจัย TamperBench ซึ่งนำเสนอในงานประชุม ACM KDD ’26 พบว่า โมเดลภาษาขนาดใหญ่แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันความปลอดภัยที่แข็งแกร่งพอจะรับมือกับการดัดแปลงน้ำหนักโมเดลหรือการโจมตีพื้นที่แฝงได้อย่างน่าเชื่อถือ
โมเดลในการทดสอบครอบคลุมหลายตระกูล เช่น Llama, Qwen3 และ Mistral มีขนาดตั้งแต่ 600 ล้านถึง 8 พันล้านพารามิเตอร์ รวมถึงโมเดลที่เสริมระบบป้องกันโดยเฉพาะด้วย 2
5
ผลลัพธ์หลักคือ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มตอบสนองต่อคำขอที่เป็นอันตรายเพิ่มขึ้นอย่างมาก ขณะเดียวกันยังรักษาความสามารถด้านเหตุผลไว้ได้เป็นส่วนใหญ่ นักวิจัยจึงสรุปว่า ระบบป้องกันในปัจจุบันยังไม่ใช่หลักประกันที่เพียงพอสำหรับโมเดลที่เปิดให้ผู้อื่นเข้าถึงและแก้ไขน้ำหนักได้ 2
5
TamperBench ประเมินภัยคุกคามจากการดัดแปลง 9 รูปแบบ ครอบคลุมตั้งแต่การปรับจูนที่ดูเหมือนเป็นงานทั่วไป การปรับจูนด้วยข้อมูลอันตรายโดยตรง การปรับจูนแบบแอบแฝงคล้ายการวางช่องโหว่ ไปจนถึงการปรับจูนหลายภาษาและการโจมตีการฝังข้อมูลหรือการแทนค่าภายในของโมเดล 2
เพื่อให้การเปรียบเทียบสะท้อนความเสี่ยงในโลกจริง งานวิจัยเลือกการโจมตีที่เพิ่มคะแนนการตอบสนองที่เป็นอันตรายได้มากที่สุด โดยจำกัดให้ความแม่นยำด้านการให้เหตุผลในชุดทดสอบ MMLU-Pro ลดลงไม่เกิน 10% เมื่อเทียบกับโมเดลที่ยังไม่ถูกโจมตี 2
กลุ่มที่มักให้ผลรุนแรงที่สุดคือ การเจลเบรกผ่านการปรับจูนแบบแอบแฝง หรือ covert jailbreak-tuning โดยเฉพาะ 3 รูปแบบต่อไปนี้
จุดที่น่ากังวลคือ การโจมตีเหล่านี้อาจใช้ข้อมูลที่เป็นอันตรายเพียงส่วนน้อย ขณะที่ข้อมูลส่วนใหญ่ยังดูเป็นข้อมูลทั่วไปหรือไม่เป็นพิษเป็นภัย 2
หลักฐานที่มีอยู่ไม่ได้ระบุตัวเลขการเพิ่มขึ้นของความเป็นอันตรายสำหรับ Llama-3-8B-Instruct หรือ Qwen3-8B-Instruct แยกเป็นรายโมเดล ดังนั้นจึงยังไม่ควรอ้างตัวเลขเฉพาะของสองรุ่นนี้
โมเดลที่ได้รับการเสริมระบบป้องกัน 5 รุ่น รวมถึงรุ่นที่ใช้แนวทาง ReFAT และ Circuit Breaking ก็ยังถูกโจมตีได้เช่นกัน แม้วิธีป้องกันบางแบบจะช่วยเพิ่มความต้านทานได้ในบางสถานการณ์ แต่ยังไม่สามารถป้องกันการถอดระบบความปลอดภัยได้อย่างสม่ำเสมอตลอดชุดการโจมตีที่ทดสอบ 2
5
งานวิจัยยังชี้ว่า ความต้านทานต่อการดัดแปลงอาจแตกต่างกันระหว่างโมเดลพื้นฐานกับโมเดลที่ผ่านการฝึกเพิ่มเติมแล้ว และแนวโน้มดังกล่าวไม่ได้เหมือนกันในทุกตระกูลโมเดล 8
เมื่อผู้พัฒนาเปิดเผยน้ำหนักโมเดลสู่สาธารณะ ผู้ใช้รายอื่นสามารถคัดลอก นำไปปรับจูน และเผยแพร่ต่อได้ โดยผู้พัฒนาเดิมไม่สามารถควบคุมกลไกความปลอดภัยในทุกการใช้งานปลายทางได้อีกต่อไป 2
นักวิจัยไม่ได้เสนอให้ยุติการพัฒนาโมเดลแบบโอเพนเวตก์ เพราะการเปิดกว้างยังมีคุณค่าต่อการวิจัย ความโปร่งใส และความรับผิดชอบ อย่างไรก็ตาม การที่โมเดลผ่านการทดสอบการจัดแนวความปลอดภัยตามปกติก่อนเปิดตัว ไม่ควรถูกตีความว่าโมเดลนั้นจะยังปลอดภัยหลังถูกนำไปดัดแปลง 5
ความเสี่ยงนี้อาจนำไปสู่การใช้งานในวงกว้าง เช่น การผลิตข้อมูลบิดเบือนจำนวนมาก การหลอกลวงหรือฟิชชิงที่ซับซ้อนขึ้น และคำแนะนำทางเทคนิคที่ก่ออันตราย โดยไม่จำเป็นต้องอาศัยแรงงานจากมนุษย์ทีละราย 5
ทีมวิจัยเรียกร้องให้มีการพัฒนาเทคนิคต้านการดัดแปลงที่แข็งแกร่งขึ้น ใช้การประเมินเชิงรุกแบบมาตรฐาน เช่น TamperBench ก่อนเปิดตัวโมเดล และเพิ่มการประเมิน AI ที่อิงหลักฐานในการจัดซื้อหรือเลือกใช้งาน โดยเฉพาะเมื่อหน่วยงานรัฐนำ AI ไปใช้ในสาธารณสุข การตรวจจับการฉ้อโกง การศึกษา และบริการสาธารณะด้านอื่น ๆ 2
5
สำหรับโมเดลเชิงพาณิชย์ที่ให้บริการผ่าน API ความเสี่ยงอาจมีลักษณะคล้ายกัน แต่ผู้ให้บริการยังควบคุมขั้นตอนการปรับจูนและการนำไปใช้งานได้ จึงสามารถใช้มาตรการป้องกันระหว่างหรือหลังการปรับจูนได้มากกว่าโมเดลที่ถูกแจกจ่ายเป็นน้ำหนักแบบเปิด 2
5
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน...
TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน... นักวิจัยจึงมองว่าแนวทางป้องกันในปัจจุบันยังไม่อาจรับประกันความปลอดภัยของโมเดลที่เปิดให้ผู้ใช้นำเวตไปแก้ไขได้
การทดสอบครอบคลุมวิธีดัดแปลงน้ำหนักโมเดลและการโจมตีพื้นที่แฝง 9 รูปแบบ โดยการโจมตีแบบเจลเบรกผ่านการปรับจูนอย่างแอบแฝงมักให้ผลรุนแรงที่สุด [2]
TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน... นักวิจัยจึงมองว่าแนวทางป้องกันในปัจจุบันยังไม่อาจรับประกันความปลอดภัยของโมเดลที่เปิดให้ผู้ใช้นำเ...
เผยแพร่โดยรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
งานวิจัย TamperBench ซึ่งนำเสนอในงานประชุม ACM KDD ’26 พบว่า โมเดลภาษาขนาดใหญ่แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันความปลอดภัยที่แข็งแกร่งพอจะรับมือกับการดัดแปลงน้ำหนักโมเดลหรือการโจมตีพื้นที่แฝงได้อย่างน่าเชื่อถือ
โมเดลในการทดสอบครอบคลุมหลายตระกูล เช่น Llama, Qwen3 และ Mistral มีขนาดตั้งแต่ 600 ล้านถึง 8 พันล้านพารามิเตอร์ รวมถึงโมเดลที่เสริมระบบป้องกันโดยเฉพาะด้วย 2
5
ผลลัพธ์หลักคือ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มตอบสนองต่อคำขอที่เป็นอันตรายเพิ่มขึ้นอย่างมาก ขณะเดียวกันยังรักษาความสามารถด้านเหตุผลไว้ได้เป็นส่วนใหญ่ นักวิจัยจึงสรุปว่า ระบบป้องกันในปัจจุบันยังไม่ใช่หลักประกันที่เพียงพอสำหรับโมเดลที่เปิดให้ผู้อื่นเข้าถึงและแก้ไขน้ำหนักได้ 2
5
TamperBench ประเมินภัยคุกคามจากการดัดแปลง 9 รูปแบบ ครอบคลุมตั้งแต่การปรับจูนที่ดูเหมือนเป็นงานทั่วไป การปรับจูนด้วยข้อมูลอันตรายโดยตรง การปรับจูนแบบแอบแฝงคล้ายการวางช่องโหว่ ไปจนถึงการปรับจูนหลายภาษาและการโจมตีการฝังข้อมูลหรือการแทนค่าภายในของโมเดล 2
เพื่อให้การเปรียบเทียบสะท้อนความเสี่ยงในโลกจริง งานวิจัยเลือกการโจมตีที่เพิ่มคะแนนการตอบสนองที่เป็นอันตรายได้มากที่สุด โดยจำกัดให้ความแม่นยำด้านการให้เหตุผลในชุดทดสอบ MMLU-Pro ลดลงไม่เกิน 10% เมื่อเทียบกับโมเดลที่ยังไม่ถูกโจมตี 2
กลุ่มที่มักให้ผลรุนแรงที่สุดคือ การเจลเบรกผ่านการปรับจูนแบบแอบแฝง หรือ covert jailbreak-tuning โดยเฉพาะ 3 รูปแบบต่อไปนี้
จุดที่น่ากังวลคือ การโจมตีเหล่านี้อาจใช้ข้อมูลที่เป็นอันตรายเพียงส่วนน้อย ขณะที่ข้อมูลส่วนใหญ่ยังดูเป็นข้อมูลทั่วไปหรือไม่เป็นพิษเป็นภัย 2
หลักฐานที่มีอยู่ไม่ได้ระบุตัวเลขการเพิ่มขึ้นของความเป็นอันตรายสำหรับ Llama-3-8B-Instruct หรือ Qwen3-8B-Instruct แยกเป็นรายโมเดล ดังนั้นจึงยังไม่ควรอ้างตัวเลขเฉพาะของสองรุ่นนี้
โมเดลที่ได้รับการเสริมระบบป้องกัน 5 รุ่น รวมถึงรุ่นที่ใช้แนวทาง ReFAT และ Circuit Breaking ก็ยังถูกโจมตีได้เช่นกัน แม้วิธีป้องกันบางแบบจะช่วยเพิ่มความต้านทานได้ในบางสถานการณ์ แต่ยังไม่สามารถป้องกันการถอดระบบความปลอดภัยได้อย่างสม่ำเสมอตลอดชุดการโจมตีที่ทดสอบ 2
5
งานวิจัยยังชี้ว่า ความต้านทานต่อการดัดแปลงอาจแตกต่างกันระหว่างโมเดลพื้นฐานกับโมเดลที่ผ่านการฝึกเพิ่มเติมแล้ว และแนวโน้มดังกล่าวไม่ได้เหมือนกันในทุกตระกูลโมเดล 8
เมื่อผู้พัฒนาเปิดเผยน้ำหนักโมเดลสู่สาธารณะ ผู้ใช้รายอื่นสามารถคัดลอก นำไปปรับจูน และเผยแพร่ต่อได้ โดยผู้พัฒนาเดิมไม่สามารถควบคุมกลไกความปลอดภัยในทุกการใช้งานปลายทางได้อีกต่อไป 2
นักวิจัยไม่ได้เสนอให้ยุติการพัฒนาโมเดลแบบโอเพนเวตก์ เพราะการเปิดกว้างยังมีคุณค่าต่อการวิจัย ความโปร่งใส และความรับผิดชอบ อย่างไรก็ตาม การที่โมเดลผ่านการทดสอบการจัดแนวความปลอดภัยตามปกติก่อนเปิดตัว ไม่ควรถูกตีความว่าโมเดลนั้นจะยังปลอดภัยหลังถูกนำไปดัดแปลง 5
ความเสี่ยงนี้อาจนำไปสู่การใช้งานในวงกว้าง เช่น การผลิตข้อมูลบิดเบือนจำนวนมาก การหลอกลวงหรือฟิชชิงที่ซับซ้อนขึ้น และคำแนะนำทางเทคนิคที่ก่ออันตราย โดยไม่จำเป็นต้องอาศัยแรงงานจากมนุษย์ทีละราย 5
ทีมวิจัยเรียกร้องให้มีการพัฒนาเทคนิคต้านการดัดแปลงที่แข็งแกร่งขึ้น ใช้การประเมินเชิงรุกแบบมาตรฐาน เช่น TamperBench ก่อนเปิดตัวโมเดล และเพิ่มการประเมิน AI ที่อิงหลักฐานในการจัดซื้อหรือเลือกใช้งาน โดยเฉพาะเมื่อหน่วยงานรัฐนำ AI ไปใช้ในสาธารณสุข การตรวจจับการฉ้อโกง การศึกษา และบริการสาธารณะด้านอื่น ๆ 2
5
สำหรับโมเดลเชิงพาณิชย์ที่ให้บริการผ่าน API ความเสี่ยงอาจมีลักษณะคล้ายกัน แต่ผู้ให้บริการยังควบคุมขั้นตอนการปรับจูนและการนำไปใช้งานได้ จึงสามารถใช้มาตรการป้องกันระหว่างหรือหลังการปรับจูนได้มากกว่าโมเดลที่ถูกแจกจ่ายเป็นน้ำหนักแบบเปิด 2
5
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน...
TamperBench พบว่าโมเดล AI แบบโอเพนเวตก์ทั้ง 21 รุ่นที่ทดสอบยังไม่มีระบบป้องกันที่แข็งแกร่งพอจะต้านภัยคุกคามจากการดัดแปลงได้ โมเดลทุกตัวสามารถถูกทำให้มีแนวโน้มสร้างเนื้อหาอันตรายเพิ่มขึ้นอย่างมาก โดยยังคงความสามารถด้าน... นักวิจัยจึงมองว่าแนวทางป้องกันในปัจจุบันยังไม่อาจรับประกันความปลอดภัยของโมเดลที่เปิดให้ผู้ใช้นำเวตไปแก้ไขได้
การทดสอบครอบคลุมวิธีดัดแปลงน้ำหนักโมเดลและการโจมตีพื้นที่แฝง 9 รูปแบบ โดยการโจมตีแบบเจลเบรกผ่านการปรับจูนอย่างแอบแฝงมักให้ผลรุนแรงที่สุด [2]