OpenAI ระบุว่า GPT 6 Astra มีข้อผิดพลาดด้านข้อเท็จจริงน้อยกว่า และต้าน jailbreak กับ prompt injection ได้ดีกว่า GPT 5.6 Sol อย่างมีนัยสำคัญ รวมถึงการโจมตีที่ปรับตัวต่อเนื่องหลายรอบ สนามทดสอบ IPI Arena ของ Gray Swan พบว่าไม่มีโมเดลใดที่ทดสอบมีภูมิคุ้มกันต่อคำสั่งแฝง โดยครอบคลุม 13 โมเดลแนวหน้า 41 สถานการณ์ และความพยา...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI ระบุว่า GPT-6 Astra มีพัฒนาการด้านความปลอดภัยที่สำคัญเมื่อเทียบกับ GPT-5.6 Sol: ตอบผิดด้านข้อเท็จจริงน้อยลง ต้าน prompt injection ได้ดีขึ้น และรับมือการ jailbreak ได้แข็งแกร่งกว่ามาก รวมถึงการโจมตีที่ค่อย ๆ ดำเนินไปหลายขั้นตอนหรือหลายรอบสนทนา 25
30
อย่างไรก็ดี จุดสำคัญอยู่ที่ บริบทการนำไปใช้งาน โมเดลที่ป้องกันตัวดีขึ้นไม่ได้หมายความว่า AI เอเจนต์จะมีภูมิคุ้มกันต่อคำสั่งอันตรายที่ซ่อนอยู่ในเว็บเพจ เอกสาร อีเมล โค้ดรีโพซิทอรี หรือผลลัพธ์จากเครื่องมือที่เอเจนต์อ่านอยู่ การทดสอบ indirect prompt injection (IPI) ของ Gray Swan พบว่าไม่มีโมเดลใดในชุดที่ทดสอบปลอดภัยจากการโจมตีลักษณะนี้โดยสมบูรณ์ 4
OpenAI ระบุว่า Astra ต้านการ jailbreak ได้ดีกว่า GPT-5.6 Sol อย่างมีนัยสำคัญ รวมถึงการโจมตีบนเส้นทางการทำงานที่ยาวขึ้น 25 ประเด็นนี้สำคัญ เพราะผู้โจมตีที่มีความซับซ้อนไม่จำเป็นต้องใช้คำสั่งโจมตีชัด ๆ เพียงครั้งเดียว แต่สามารถปรับวิธีการระหว่างบทสนทนาหลายรอบ และอาศัยบริบทที่สะสมขึ้นเพื่อหาทางชักนำโมเดลได้
บริษัทยังรายงานว่า Astra มีความทนทานต่อ prompt injection มากขึ้นในบริบทการท่องเว็บและการทำงานในสำนักงาน พร้อมมีข้อผิดพลาดด้านข้อเท็จจริงน้อยกว่า Sol 25
30 แต่ตัวเลขเรื่องความถูกต้องควรตีความอย่างระมัดระวัง เพราะการทดสอบการทำซ้ำข้อผิดพลาดใช้บทสนทนา ChatGPT ที่ผู้ใช้เคยแจ้งว่าได้คำตอบผิดอยู่แล้ว จึงไม่ใช่อัตราการหลอนหรือให้ข้อมูลผิดในงานทั่วไปทั้งหมด
30
ความก้าวหน้าเหล่านี้มีความหมายมากสำหรับเอเจนต์ที่ต้องค้นคว้า เขียนโค้ด ท่องเว็บ และทำงานหลายขั้นตอน โดยบันทึกการออกรุ่นของ OpenAI ระบุว่า Astra ทำงานซับซ้อนแบบหลายขั้นตอน และสร้างเอกสาร สเปรดชีต หรือสไลด์นำเสนอตามเทมเพลตและคำสั่งได้ 19
หลักฐานที่ให้มายังไม่เพียงพอสำหรับข้อสรุปว่า Astra ปลอดภัยกว่า Claude Opus 5 ของ Anthropic ในทุกมิติ ไม่ว่าจะเป็นความแม่นยำ การรับมือ jailbreak โดยตรง หรือ indirect prompt injection
การจัดอันดับข้ามโมเดลอย่างเป็นธรรมต้องใช้ชุดทดสอบเดียวกัน เครื่องมือที่เอเจนต์เข้าถึงเท่ากัน system instruction เดียวกัน นิยามความสำเร็จของการโจมตีตรงกัน และเปิดโอกาสให้ผู้โจมตีปรับกลยุทธ์ในระดับที่เทียบกันได้ การประเมินจากผู้พัฒนาแต่ละรายและการแข่งขัน red team สาธารณะอาจต่างกันในทุกเงื่อนไขเหล่านี้ แม้ Gray Swan จะระบุ Claude Opus 5 เป็นหนึ่งในโมเดลบน Arena แต่ผลที่มีไม่ได้ให้ตารางคะแนนเปรียบเทียบ Astra กับ Opus 5 แบบเงื่อนไขเดียวกัน 1
4
ข้อสรุปที่ยืนยันได้จึงแคบกว่า: หลักฐานที่แข็งแรงที่สุดของ OpenAI คือ Astra ดีขึ้นจากรุ่นก่อนของตัวเอง คือ GPT-5.6 Sol
การ jailbreak โดยตรงเริ่มจากคำขอที่ผู้โจมตีส่งให้โมเดลอย่างเปิดเผย เช่น พยายามสั่งให้ข้ามกฎ หรือชักนำให้ทำสิ่งต้องห้าม ผลที่ OpenAI รายงานว่า Astra รับมือการโจมตีระยะยาวได้ดีขึ้น จึงเกี่ยวข้องโดยตรงกับผู้โจมตีที่พยายามปรับเปลี่ยนวิธีล่อหลอกไปเรื่อย ๆ 25
ส่วน indirect prompt injection หรือการฉีดคำสั่งทางอ้อม เกิดจากเนื้อหาที่เอเจนต์กำลังอ่าน คำสั่งอันตรายอาจถูกฝังในเว็บเพจ อีเมล เอกสาร ผลการค้นหา ร่องรอยการทำงานของเอเจนต์เขียนโค้ด หรือผลลัพธ์จากเครื่องมือ เพื่อเบี่ยงเอเจนต์ออกจากเป้าหมายที่ผู้ใช้ตั้งไว้ การแข่งขัน IPI ของ Gray Swan มุ่งทดสอบคำสั่งที่ซ่อนอยู่ในสภาพแวดล้อมสมจริง เช่น เว็บ เนื้อหาจากเครื่องมือ และร่องรอยของ coding agent 5
ความต่างที่น่ากังวลคือ ผู้ใช้ที่กำลังใช้งานเอเจนต์อาจไม่เคยเห็นคำสั่งอันตรายนั้นเลย
Gray Swan รายงานว่า IPI Arena มี 13 โมเดลแนวหน้า ผู้ทำ red team 464 คน 41 สถานการณ์ และความพยายามโจมตีกว่า 272,000 ครั้ง โดยข้อสรุปของบริษัทคือ ไม่มีโมเดลที่ทดสอบใดมีภูมิคุ้มกันต่อ indirect prompt injection 4
ผลนี้เป็นหลักฐานหนักแน่นว่า IPI ยังเป็นปัญหาที่แก้ไม่ตกสำหรับการใช้งาน AI เอเจนต์ แต่ไม่ได้เป็นตารางจัดอันดับที่เป็นกลางและครอบคลุมทุกมิติความปลอดภัย จึงไม่ควรตีความว่าแต่ละโมเดลล้มเหลวในอัตราเท่ากัน หรือใช้แทนการประเมินเฉพาะรุ่นเรื่องความถูกต้องและความต้านทาน jailbreak โดยตรง
สำหรับแชตบอตทั่วไป การถูกฉีดคำสั่งสำเร็จอาจลงเอยด้วยคำตอบที่ชวนให้เข้าใจผิด แต่สำหรับ AI เอเจนต์ในองค์กรที่เชื่อมต่อระบบธุรกิจ ผลกระทบอาจขยายใหญ่กว่านั้นมาก
OpenAI จัด Astra ว่าแตะเกณฑ์ความสามารถด้านความมั่นคงปลอดภัยไซเบอร์ระดับ Critical ภายใต้ Preparedness Framework ของบริษัท โดยระบุว่า หากมีเครื่องมือและสิทธิ์เข้าถึงที่เหมาะสม Astra สามารถค้นหาช่องโหว่ที่ไม่เคยรู้จักมาก่อน และพัฒนาแนวทางใช้ประโยชน์จากช่องโหว่เหล่านั้นในระบบที่มีการป้องกันสูงหลายแห่งได้ โดยไม่ต้องมีมนุษย์คอยชี้แนะทีละขั้น 27
ความสามารถนี้อาจมีประโยชน์ต่อการป้องกันระบบที่ได้รับอนุญาต แต่ก็เพิ่มความรุนแรงของผลลัพธ์หากเวิร์กโฟลว์เอเจนต์ถูกชักนำผ่านเนื้อหาที่ไม่น่าเชื่อถือ ผู้โจมตีอาจพยายามมีอิทธิพลต่อสิ่งที่เอเจนต์ค้นหา เครื่องมือที่เอเจนต์เรียกใช้ หรือการกระทำที่เอเจนต์เสนอ ความเสี่ยงจะสูงขึ้นเมื่อเอเจนต์เข้าถึงข้อมูลอ่อนไหว รีโพซิทอรีโค้ด ระบบคลาวด์ เบราว์เซอร์ หรือแอปพลิเคชันธุรกิจ
ควรมองความสามารถต้าน prompt injection เป็นเพียงชั้นป้องกันหนึ่ง ไม่ใช่เส้นแบ่งความปลอดภัยหลัก สำหรับเวิร์กโฟลว์เอเจนต์ที่มีผลกระทบสูง องค์กรควร:
OpenAI เองได้กล่าวถึงการแยกสภาพแวดล้อมที่เข้มงวดขึ้น การจำกัดเครือข่ายและการเข้าถึงเครื่องมือ การเฝ้าระวัง และการรันงานใน sandbox ว่าเป็นมาตรการป้องกันสำหรับระบบที่มีความสามารถสูงขึ้น 34
Astra ที่ OpenAI รายงานว่ามีข้อผิดพลาดด้านข้อเท็จจริงลดลง และต้าน jailbreak โดยตรงได้ดีขึ้น จึงเป็นรุ่นต่อยอดที่แข็งแกร่งกว่า GPT-5.6 Sol 25
30 แต่หลักฐานที่มีไม่ได้รองรับการประกาศว่า Astra ปลอดภัยกว่า Claude Opus 5 อย่างเด็ดขาดในทุกบริบท และ indirect prompt injection ยังเป็นจุดอ่อนสำคัญของระบบนิเวศ AI เอเจนต์
4
สำหรับองค์กร บทเรียนเชิงปฏิบัติคือ เลือกโมเดลที่แข็งแกร่งที่สุดได้ แต่ต้องออกแบบระบบรอบตัวมันให้เอกสารหรือเว็บเพจที่เป็นอันตรายไม่สามารถเปลี่ยนความสามารถของโมเดลและเครื่องมือที่เชื่อมต่ออยู่ ให้กลายเป็นช่องทางที่ผู้โจมตีควบคุมได้
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
OpenAI ระบุว่า GPT 6 Astra มีข้อผิดพลาดด้านข้อเท็จจริงน้อยกว่า และต้าน jailbreak กับ prompt injection ได้ดีกว่า GPT 5.6 Sol อย่างมีนัยสำคัญ รวมถึงการโจมตีที่ปรับตัวต่อเนื่องหลายรอบ
OpenAI ระบุว่า GPT 6 Astra มีข้อผิดพลาดด้านข้อเท็จจริงน้อยกว่า และต้าน jailbreak กับ prompt injection ได้ดีกว่า GPT 5.6 Sol อย่างมีนัยสำคัญ รวมถึงการโจมตีที่ปรับตัวต่อเนื่องหลายรอบ สนามทดสอบ IPI Arena ของ Gray Swan พบว่าไม่มีโมเดลใดที่ทดสอบมีภูมิคุ้มกันต่อคำสั่งแฝง โดยครอบคลุม 13 โมเดลแนวหน้า 41 สถานการณ์ และความพยายามโจมตีกว่า 272,000 ครั้ง
ข้อมูลที่มีอยู่ยังไม่ใช่การทดสอบเงื่อนไขเดียวกัน จึงไม่อาจจัดอันดับชี้ขาดว่า Astra หรือ Claude Opus 5 ดีกว่ากันในด้านความถูกต้อง การต้าน jailbreak หรือ indirect prompt injection ทุกสถานการณ์ได้