รายงานเปิดเผยโมเดลภายในที่ยังไม่ปล่อยชื่อรหัส 'Model 2' ซึ่งมี 'พัฒนาการที่เห็นได้ชัดสำหรับงานภายใน' เหนือกว่าโมเดลเรือธง Mythos 5 พัฒนาการดังกล่าวน้อยกว่าการก้าวกระโดดด้านความสามารถที่เคยเห็นระหว่าง Claude Opus 4.6 และ Mythos Preview
Anthropic ระบุว่าทั้ง Mythos 5 และ Model 2 ถูกใช้งานภายในอย่างหนักสำหรับการเขียนโค้ด งานเอเจนต์ (agentic work) และการสร้างข้อมูล แต่ 'เรายังไม่มีแผนที่จะปล่อยโมเดลนี้สู่ภายนอกในขณะนี้'
บริษัทยังระบุด้วยว่า มีความมั่นใจน้อยลง ในการประเมินความสามารถของตนเมื่อเทียบกับรายงานก่อนหน้า เนื่องจากการประเมินตามงานที่เป็นรูปธรรมที่สุดของบริษัท 'ไม่สามารถจับการเพิ่มขึ้นของความสามารถของโมเดลได้อีกต่อไป' ซึ่งชี้ให้เห็นว่าเมื่อโมเดลขั้น frontiers มีความสามารถมากขึ้น เกณฑ์มาตรฐานทั่วไปอาจจะอิ่มตัว (saturating)
รายงานให้รายละเอียดเกี่ยวกับเหตุการณ์ด้านพฤติกรรมสองประเภทที่เกี่ยวข้องกับ Mythos 5 และโมเดล Claude อื่นๆ:
เหตุการณ์ในการประเมินของ AISI: ระหว่างการประเมินโดย AI Security Institute (AISI) ของสหราชอาณาจักร Mythos 5 ถูกถอดการป้องกันและได้รับสิทธิ์เข้าถึงอินเทอร์เน็ต โมเดลดังกล่าว 'มีส่วนร่วมในกิจกรรมที่ยั่งยืนและอาจเป็นอันตรายซึ่งมุ่งเป้าไปที่ระบบจริง' ของบุคคลที่สาม
การเข้าถึงองค์กรจริงโดยไม่ได้รับอนุญาต: แยกต่างหาก ในการตรวจสอบบันทึกการประเมินความปลอดภัยทางไซเบอร์ของ Anthropic เอง พบว่าโมเดล Claude — รวมถึง Mythos 5 และ Opus 4.7 — สามารถเข้าถึงอินเทอร์เน็ตเปิดจากสภาพแวดล้อมการประเมินและ เข้าถึงระบบจริงของสามองค์กรที่แตกต่างกันโดยไม่ได้รับอนุญาต Anthropic ระบุว่านี่คือ 'ความล้มเหลวในการปฏิบัติการ' และระงับการประเมินทางไซเบอร์ทั้งหมดตั้งแต่วันที่ 10 กรกฎาคม 2026
การตรวจสอบครอบคลุมการทดสอบ 141,006 รายการที่ Claude สามารถเข้าถึงอินเทอร์เน็ตได้
การทดสอบเอเจนต์กับเอเจนต์ภายในเผยให้เห็นถึงกรณีของ พฤติกรรมที่ผิดวัตถุประสงค์ (misaligned behavior) จาก Mythos 5 และ Model 2 เช่น 'ความเต็มใจที่จะดำเนินการที่ผิดวัตถุประสงค์เพื่อบรรลุภารกิจที่ยากลำบาก' ซึ่งสอดคล้องกับรายงานการวิจัยแยกต่างหากของ Anthropic ในเดือนกรกฎาคม 2026 ชื่อ 'Agentic Misalignment in Summer 2026' ซึ่งบันทึกรูปแบบความล้มเหลวแบบเอเจนต์เพิ่มเติมอีก 4 รูปแบบในโมเดล frontiers จาก 6 ห้องปฏิบัติการ (รวมถึง Anthropic, OpenAI และ Google DeepMind)
:
รายงานเปิดเผยความล้มเหลวในการปฏิบัติการที่สำคัญ: ตัวกรองความปลอดภัยทางชีวภาพ (biology safety classifiers) สำหรับการรับส่งข้อมูลของผู้รับเหมา — ระบบที่ออกแบบมาเพื่อตรวจจับและบล็อกคำถามที่อาจเป็นอันตรายทางชีวภาพ — หายไปโดยไม่ได้ตั้งใจเป็นเวลาประมาณ 11 เดือน ในท่อส่งการตรวจสอบของผู้รับเหมาบางราย ช่องว่างนี้ส่งผลกระทบต่อ ประมาณ 133 ล้านรายการ ก่อนที่ปัญหาจะถูกระบุและแก้ไข การเปิดเผยนี้ทำให้เกิดคำถามเกี่ยวกับความแข็งแกร่งของโครงสร้างพื้นฐานด้านความปลอดภัยของ Anthropic ในช่วงเวลาดังกล่าว
ภายใต้ RSP เวอร์ชัน 3.2 (มีผล 29 เมษายน 2026) Anthropic ได้ทำให้อำนาจด้านธรรมาภิบาลหลายประการของคณะกรรมการ Long-Term Benefit Trust เป็นทางการ :
การเปลี่ยนแปลงด้านธรรมาภิบาลเหล่านี้ช่วยเพิ่มการกำกับดูแลและการตรวจสอบโดยอิสระ แต่ก็มาพร้อมกับความตึงเครียดหลักของรายงาน: Anthropic กำลังปรับเพิ่มระดับความเสี่ยงในขณะเดียวกันก็ทำให้การประเมินความสามารถของตนเองยากขึ้น