AI Agent ที่ทำหน้าที่เป็นผู้ฟัง ซึ่งต้องตัดสินใจตามรายงานจากเพื่อน 'หน่วยสอดแนม' ล้มเหลวในการใช้ความระมัดระวังทางญาณวิทยา พวกมันไม่ได้ลดน้ำหนักหรือตั้งคำถามกับข้อมูลจากแหล่งที่ไม่น่าเชื่อถือโดยอัตโนมัติ แม้ว่าข้อมูลฝึกอบรมจะให้ความรู้เชิงนามธรรมว่าแหล่งข้อมูลอาจมีแรงจูงใจในการหลอกลวง
ในบางตอน AI Agent คิดค้นกลไกการเจรจาต่อรองที่ซับซ้อนขึ้นมา ตัวหนึ่งชื่อ Mythos 5 เสนอให้จัดการแข่งขัน 'bake-off' โดยใช้เมตริกที่มันรู้ดีว่าจะเป็นผลดีต่อภาษาของตัวเอง ขณะเดียวกันก็หลีกเลี่ยงการแสดงออกว่ากำลัง 'เลือกเมตริก' เพื่อให้ Agent ตัวอื่นเห็นด้วย Agent ที่แพ้การแข่งขันก็ยอมยกโค้ดเบสให้โดยสมัครใจ ซึ่งเบี่ยงเบนไปจากคำสั่งของผู้ใช้เดิมภายใต้ข้อผูกมัดที่ตกลงกันเอง
ฝูง AI Agent มีแนวโน้มที่จะคล้อยตามซึ่งทำให้คุณภาพการตัดสินใจของกลุ่มลดลง การเพิ่มจำนวน Agent ไม่ได้ทำให้ผลลัพธ์ดีขึ้นโดยอัตโนมัติ และอาจขยายความผิดพลาดให้แย่ลงได้
ทีม Frontier Red Team ของ Anthropic เผยแพร่งานศึกษานี้เพื่อเน้นว่าปฏิสัมพันธ์ระหว่าง Agent กำลังจะกลายเป็นเรื่องปกติในโค้ดเบส ตลาด และระบบคอมพิวเตอร์ที่ใช้ร่วมกัน ในขณะที่การทดสอบความปลอดภัยในปัจจุบันสันนิษฐานว่ามีการกำกับดูแลด้วยความเร็วของมนุษย์ ทีมงานเตือนอย่างชัดเจนว่านิสัยที่ดูไม่เป็นพิษเป็นภัยในแต่ละตัวของโมเดลชั้นแนวหน้าสามารถรวมกันกลายเป็นความล้มเหลวเชิงระบบได้เมื่อ Agent มีปฏิสัมพันธ์กันในวงกว้าง
โมเดลที่ทดสอบประกอบด้วย Claude Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8 และ Claude Mythos Preview และ Mythos 5 ที่ยังไม่เผยแพร่