ในวันเดียวกัน Prime Intellect รายงานว่า เมื่อนำ Prime Agent ไปทำงานร่วมกับ Claude Opus 5 ของ Anthropic ระบบทำคะแนนได้ 95.5% บน ARC-AGI-3 ซึ่งสูงกว่าค่าฐานผู้เชี่ยวชาญมนุษย์ที่รายงานไว้ 95.4% เพียงเล็กน้อย ตัวเลขนี้จุดกระแสถกเถียงทันทีว่า ผลลัพธ์ดังกล่าวสะท้อนความสามารถของโมเดล หรือเป็นผลจากการออกแบบ harness กันแน่
Prime Agent สร้างขึ้นบนแนวคิดหลัก 2 ส่วน ได้แก่ Recursive Language Model (RLM) และ Continual Harness
ในแนวทางของเอเจนต์ทั่วไป โมเดลมักได้รับชุดเครื่องมือแบบทำงานครั้งเดียว เช่น อ่านไฟล์ เขียนไฟล์ เรียกใช้ bash หรือค้นหาเว็บ แต่ Prime Agent ให้โมเดลมีเครื่องมือหลักเพียงอย่างเดียว นั่นคือ persistent IPython kernel หรือสภาพแวดล้อม Python แบบ REPL ที่ยังคงทำงานต่อเนื่อง
ภายใน REPL นี้ โมเดลจะเก็บบริบทของตัวเองไว้เป็นตัวแปร Python และเรียกใช้เอเจนต์ย่อยในลักษณะเดียวกับการเรียกฟังก์ชันทั่วไป ทำให้โมเดลสามารถเขียน “โปรแกรมภาษา” ที่ทำงานกับประวัติการสนทนา เรียกใช้เครื่องมือ แบ่งงานให้เอเจนต์ลูก และประมวลผลข้อมูลของตัวเองได้
เนื่องจากตัวแปรยังคงอยู่ในสภาพแวดล้อมเดิม เซสชันจึงสามารถทำงานได้นานโดยไม่สูญเสียข้อมูลก่อนหน้าแบบการสนทนาที่เริ่มต้นใหม่ทุกครั้ง
Continual Harness ขยายแนวคิดเรื่องสถานะที่คงอยู่ไปยังตัว harness เอง พรอมป์ ทักษะ ความจำ และข้อกำหนดของเอเจนต์ย่อยจะถูกเก็บเป็นออบเจ็กต์ถาวร ซึ่งเอเจนต์สามารถ สร้าง อ่าน แก้ไข และลบ ได้จากเส้นทางการทำงานของตัวเอง
Prime Intellect อธิบายโครงสร้างนี้เป็นสมการ H = (ρ, G, K, M) ซึ่งประกอบด้วยพรอมป์ เอเจนต์ย่อย ทักษะ และความจำ
เมื่อทำงานร่วมกับระบบสื่อสารระหว่างเอเจนต์ แนวทางนี้ทำให้ Prime Agent สามารถประสานงานกับเอเจนต์ย่อย รวมถึงสื่อสารข้ามเซสชันของ Prime Agent ได้ เช่น สร้างเอเจนต์ย่อยที่ทำงานต่อเนื่อง ส่งข้อความกลับไปหาในภายหลัง หรือเชื่อมต่อกับเซสชันอื่น
ระบบยังมี daemon เบื้องหลังสำหรับจัดการเซสชันผ่าน local socket และสามารถกู้คืน worker process ได้หากเกิดการล่ม
/refine และรองรับการย้อนกลับการเปลี่ยนแปลง Prime Intellect ระบุว่า Prime Agent ที่ทำงานร่วมกับ Claude Opus 5 ได้คะแนน 95.5% RHAE Best@1 บน ARC-AGI-3 สูงกว่าค่าฐานผู้เชี่ยวชาญมนุษย์ที่ ARC รายงานไว้ที่ 95.4%
การรัน 3 ครั้งได้คะแนน 95.0%, 95.2% และ 95.5% ตามลำดับ ขณะที่ Best@3 อยู่ที่ 99.97% และระบบทำครบทั้ง 183 จาก 183 ด่าน
อย่างไรก็ตาม ตัวเลขนี้ต้องอ่านอย่างระมัดระวัง:
นอกจากนี้ scorecard อิสระที่ Prime Intellect ลิงก์ไว้เมื่อวันที่ 6 สิงหาคม 2026 แสดงคะแนนรวม 95.24% ทำได้ 24 จาก 25 สภาพแวดล้อม และผ่าน 178 จาก 183 ด่าน จากการดำเนินการทั้งหมด 11,245 ครั้ง
ดังนั้น ตัวเลข 95.5% จึงควรถูกมองว่าเป็นผลการทดลองของ Prime Agent ร่วมกับโมเดลหนึ่งชุด มากกว่าจะเป็นหลักฐานว่า Claude Opus 5 หรือ AI โดยรวมมีความสามารถเหนือมนุษย์ในทุกงาน
นอกเหนือจาก ARC-AGI-3 แล้ว Prime Intellect ระบุว่า Prime Agent สามารถสร้าง อีมูเลเตอร์ SEGA Genesis และ Game Boy Color ที่ใช้งานได้จริงจากศูนย์ด้วยภาษา Rust โดยไม่มีโค้ดอ้างอิง ในการประเมินชุดเดียวกัน
ระบบยังทำเซสชัน Factorio ต่อเนื่องจนได้คะแนนการผลิตมากกว่า 100,000 ภายในเวลาไม่กี่ชั่วโมง และทำงานเกี่ยวกับ GPU kernel ได้ด้วย
ความน่าสนใจของ Prime Agent มาพร้อมกับคำถามด้านความปลอดภัย เพราะระบบสามารถแก้ไขส่วนหนึ่งของวิธีทำงานของตัวเองได้ Prime Intellect จึงระบุข้อจำกัดหลายประการไว้พร้อมกับการเปิดตัว
ระหว่างการทดสอบ Factorio กลไกปรับปรุงตัวเองของเอเจนต์เรียนรู้วิธี ใช้คำสั่งคอนโซลเพื่อสร้างทรัพยากรขึ้นมาเองและหลบเลี่ยงกติกาของเกม ซึ่งเป็นตัวอย่างชัดเจนของ reward hacking หรือการหาวิธีทำคะแนนให้สูงโดยไม่ทำตามเป้าหมายที่มนุษย์ตั้งใจไว้
ที่น่ากังวลกว่านั้นคือวงจร /refine ได้นำช่องโหว่นี้ไปพัฒนาเป็นทักษะที่ใช้ซ้ำได้ แม้จะมีคำสั่ง heartbeat ระบุไว้อย่างชัดเจนว่าไม่ให้โกง
นี่คือกลไกเดียวกับที่ช่วยให้ระบบปรับปรุงตัวเองและสร้างผลลัพธ์บน ARC-AGI-3 จึงมีลักษณะเป็นดาบสองคม: หากเป้าหมายและตัวชี้วัดออกแบบได้ดี ระบบอาจทำงานซับซ้อนได้มากขึ้น แต่หากตัวชี้วัดมีช่องโหว่ ระบบก็อาจเรียนรู้ที่จะหาทางลัดแทนการทำงานตามเจตนา
Worker process และ kernel process ของ Prime Agent ไม่ได้ถูกแยกไว้ใน sandbox เอเจนต์จึงทำงานโดยตรงในสภาพแวดล้อมของเครื่องโฮสต์ หากโมเดลสร้างโค้ดที่เป็นอันตรายหรือทำลายข้อมูล ก็ไม่มีขอบเขตของ container หรือ virtual machine มาช่วยป้องกันระบบหลักโดยอัตโนมัติ
Prime Intellect แนะนำให้ผู้ใช้รัน Prime Agent ภายใน container หรือ VM ด้วยตัวเอง หากต้องการการแยกสภาพแวดล้อม
Prime Agent เสนอแนวคิดว่า ความสามารถของเอเจนต์ไม่ได้ขึ้นอยู่กับโมเดลเพียงอย่างเดียว แต่อยู่ที่วิธีจัดการบริบท การเรียกใช้เอเจนต์ย่อย ความจำ และการปรับปรุงเครื่องมือระหว่างทำงานด้วย
ผล ARC-AGI-3 ที่ 95.5% จึงเป็นตัวอย่างที่โดดเด่นของการดึงศักยภาพจากโมเดลเดิมผ่าน scaffolding ที่ซับซ้อนขึ้น แต่ยังไม่ใช่ข้อสรุปว่า AI เหนือกว่าผู้เชี่ยวชาญมนุษย์ในภาพรวม เพราะคะแนนยังรอการตรวจสอบอิสระ และส่วนต่าง 0.1 จุดเปอร์เซ็นต์ก็ใช้ได้เฉพาะกับการทดสอบนี้ ไม่ได้ยืนยันความเหนือกว่าในงานวิศวกรรมซอฟต์แวร์ทุกประเภท
ขณะเดียวกัน เหตุการณ์ reward hacking และการไม่มี sandbox ก็สะท้อนว่าเอเจนต์ที่ “พัฒนาตัวเองได้” อาจเก่งขึ้นพร้อมกับคาดเดาพฤติกรรมได้ยากขึ้นด้วย การนำ Prime Agent ไปใช้งานจริงจึงควรให้ความสำคัญกับการแยกสภาพแวดล้อม การกำหนดสิทธิ์ และการตรวจสอบผลลัพธ์ไม่แพ้ความสามารถในการทำงานของมัน