ภายในสภาพแวดล้อมนี้ บริบทสนทนา ซับเอเจนต์ เครื่องมือ และการตั้งค่าของฮาร์เนส ล้วนเป็นอ็อบเจ็กต์ที่เขียนโปรแกรมและแก้ไขได้ บริษัทอ้างว่า Prime Agent ที่ใช้ Claude Opus 5 ทำคะแนน 95.5% Best@1 บน ARC-AGI-3 ซึ่งเป็นเบนช์มาร์กด้านการให้เหตุผลแบบโต้ตอบ สูงกว่าค่ามาตรฐานผู้เชี่ยวชาญมนุษย์ที่รายงานไว้ 95.4%
อย่างไรก็ตาม ผลดังกล่าวยัง ไม่ได้รับการตรวจสอบโดยชุมชน ARC อย่างเป็นอิสระ และนักวิจารณ์บางรายมองว่าคะแนนที่เพิ่มขึ้นอาจมาจากการปรับฮาร์เนสให้หาประโยชน์จากกติกาของเบนช์มาร์ก มากกว่าจะเป็นการยกระดับความสามารถในการให้เหตุผลของโมเดลโดยตรง
Prime Agent ตั้งอยู่บนแนวคิดหลัก 2 ส่วน ได้แก่ Recursive Language Model (RLM) และ Continual Harness
ในสถาปัตยกรรม RLM ประวัติการสนทนาไม่ได้เป็นเพียงข้อความที่โมเดลได้รับแบบอ่านอย่างเดียว แต่ถูกจัดให้เป็น ตัวแปร ที่โมเดลสามารถตรวจสอบ แปลง และจัดการผ่าน IPython REPL ได้
การเรียกใช้ซับเอเจนต์ก็ทำในรูปแบบฟังก์ชัน Python ทั่วไป เช่น การเรียก rlm("sub-task") จะสร้างเซสชันลูกที่มีโมเดล เคอร์เนล และประวัติการสนทนาของตัวเอง วิธีนี้ทำให้โมเดลสามารถเขียนโปรแกรมภาษาเพื่อจัดการบริบทของตัวเอง แบ่งงานให้เอเจนต์ย่อย และนำผลลัพธ์กลับมาประกอบเป็นคำตอบได้
ระบบ daemon ยังช่วยรักษาเซสชันให้ทำงานต่อเนื่องระหว่างภารกิจที่ใช้เวลานาน
Continual Harness นิยามสถานะของฮาร์เนสเป็น H = (ρ, G, K, M) ซึ่งประกอบด้วยพรอมต์ ซับเอเจนต์ สกิล และหน่วยความจำ โดยแต่ละส่วนรองรับการสร้าง อ่าน แก้ไข และลบ หรือ CRUD ได้จาก Python
คำสั่งสำคัญคือ /refine ซึ่งให้เอเจนต์ย้อนดูเส้นทางการทำงานของตัวเอง แล้วปรับสถานะเสริมของฮาร์เนสจากหลักฐานที่เกิดขึ้นระหว่างการทำงาน เช่น เพิ่มบันทึกความจำ ปรับคำอธิบายสกิล หรือแก้การกำหนดหน้าที่ของซับเอเจนต์
จุดที่ควรทำความเข้าใจคือ พรอมต์ระบบพื้นฐานยังถูกล็อกไว้ คำสั่ง /refine ไม่สามารถเขียนทับพรอมต์หลักได้ แต่จะแก้เฉพาะสถานะเสริมรอบ ๆ พรอมต์นั้น การปรับแต่ละครั้งมีรหัสกำกับและสามารถย้อนกลับได้
ส่วนคำสั่ง /compact เปิดให้โมเดลย่อหรือจัดระเบียบบริบทด้วยตัวเองเมื่อจำเป็น
ปรัชญาหลักของ Prime Agent คือ “Everything is Python” อินเทอร์เฟซทั้งหมดเป็น Python REPL ไม่ใช่สคีมาชุด tool call แบบตายตัว
โมเดลจึงไม่ได้เลือกเครื่องมือจากเมนูที่นักพัฒนากำหนดไว้ล่วงหน้า แต่สามารถเขียน Python เพื่ออ่านข้อมูล เรียกใช้ซับเอเจนต์ แปลงบริบท จัดการไฟล์ รันคำสั่งของโปรเจกต์ และเปิดเซสชันโมเดลใหม่ได้
Prime Intellect ระบุว่าแนวทางนี้อาจประหยัดโทเคนกว่าเครื่องมือแบบเดิม เพราะฟังก์ชันสามารถทำงานกับข้อมูลโดยตรง แทนการส่งข้อมูลออกมาให้โมเดลอ่านผ่านการเรียกเครื่องมือทีละขั้น
แต่คำว่า “self-improving” ไม่ได้หมายความว่าโมเดลกำลังฝึกตัวเองใหม่ ไม่มีการเทรนพารามิเตอร์ของโมเดลในระหว่างงาน ความหมายที่แท้จริงคือฮาร์เนสสามารถปรับพรอมต์เสริม สกิล และหน่วยความจำของตัวเองระหว่างทำภารกิจ
ตัวเลขทั้งหมดในส่วนนี้เป็น ผลที่ Prime Intellect รายงานเอง และยังไม่ได้รับการตรวจสอบโดยหน่วยงานหรือชุมชนภายนอกอย่างเป็นอิสระ
| ตัวชี้วัด | คะแนน | รายละเอียด |
|---|---|---|
| Best@1 ด้วย Opus 5 | 95.5% | สูงกว่าค่ามาตรฐานผู้เชี่ยวชาญมนุษย์ที่รายงาน 95.4% |
| ความสม่ำเสมอของการรัน | 95.0%, 95.2%, 95.5% | ทำครบทั้ง 183 จาก 183 ระดับ |
| Best@3 | 99.97% | |
| เมื่อเทียบกับคะแนนทางการสูงสุด | 30.2% เทียบกับ 95.5% | ใช้โมเดลเดียวกัน แต่เปลี่ยนฮาร์เนส |
ช่องว่างระหว่างคะแนนทางการราว 30.2% กับผลของ Prime Agent เกิดจากชั้นฮาร์เนสเป็นหลัก โดย Prime Intellect ระบุเองว่า โมเดลไม่ได้เปลี่ยน มีเพียง scaffolding หรือโครงสร้างสนับสนุนการทำงานที่เปลี่ยนไป
องค์กร ARC Prize ไม่นำผลที่เปลี่ยนเฉพาะฮาร์เนสลักษณะนี้ไปรวมในลีดเดอร์บอร์ดทางการ นอกจากนี้ scorecard หนึ่งของบริษัทบันทึกค่ามัธยฐานของการรันไว้อีกแบบที่ 95.24% จึงควรแยกตัวเลขแต่ละชุดออกจากกัน และไม่ควรตีความว่าระบบเหนือกว่าผู้เชี่ยวชาญมนุษย์ในวงกว้าง
Prime Agent ที่ใช้ Opus 5 รายงานว่าทำคะแนนสูงกว่า Claude Code และ Codex ในการทดสอบบริบทและภารกิจระยะยาวหลายรายการ เช่น OOLONG, LongBenchPro, LongBenchv2 และ OBLIQ-Bench
สำหรับโมเดลโอเพนเวต GLM-5.2 ในโหมด high บริษัทระบุว่า Prime Agent เอาชนะ Pi-mono ได้ในการประเมินบริบทระยะยาว 8 จาก 9 รายการ
| โมเดล | ผลเมื่อใช้ Prime Agent เทียบกับฮาร์เนสดั้งเดิม |
|---|---|
| Opus 5 | ราว 3 เท่าบน ARC-AGI-3 จาก 30.2% เป็น 95.5% |
| DeepSeek V4 Flash | ทำโจทย์เขียนโค้ดครบ 8 จาก 8 ข้อ โดยใช้ 4.17 ล้านโทเคน |
| GLM-5.2 | ชนะฮาร์เนสแบบกรรมสิทธิ์ในเกือบทุกการประเมินบริบทระยะยาว |
โดยรวม Prime Intellect รายงานว่า เมื่อใช้กับ GLM-5.2, Opus 5 และ GPT-5.6 Sol ระบบมักทำคะแนนสูงสุดได้ดีกว่าฮาร์เนสดั้งเดิมของแต่ละโมเดล ขณะที่ใช้โทเคนรวมต่ำกว่า
ตัวเลข 95.5% บน ARC-AGI-3 ยังไม่ผ่านการยืนยันจากชุมชน ARC อย่างอิสระ ขณะที่คะแนนสูงสุดบนลีดเดอร์บอร์ดทางการยังอยู่ที่ประมาณ 30.2%
นอกจากนี้ การเปรียบเทียบดังกล่าวเป็นการใช้โมเดลเดียวกันกับฮาร์เนสคนละแบบ จึงสะท้อนความสำคัญของโครงสร้างควบคุมและการจัดการบริบท มากกว่าจะพิสูจน์ว่า Opus 5 เองมีความสามารถในการให้เหตุผลเพิ่มขึ้น
/refine สามารถแก้ไขพรอมต์ สกิล และหน่วยความจำระหว่างทำงานได้ หากเอเจนต์เข้าสู่ลูปป้อนกลับที่ผิดพลาด ก็มีความเสี่ยงเกิด การปรับตัวเองแบบไร้จุดจบ หรือสะสมแนวทางที่ดูเหมือนให้ผลดีในระยะสั้นแต่เป็นอันตรายในระยะยาว
การที่พรอมต์พื้นฐานแก้ไม่ได้ช่วยลดความเสี่ยงบางส่วน แต่สถานะเสริมของฮาร์เนสยังเขียนทับได้ทั้งหมด และระบบไม่ได้มีเครื่องมือตรวจจับการปรับปรุงที่เป็นอันตรายโดยอัตโนมัติ
ยิ่งไปกว่านั้น กระบวนการ worker และ kernel ทำงานด้วยสิทธิ์ของผู้ใช้ในเครื่อง ไม่ได้ถูกแซนด์บ็อกซ์โดยค่าเริ่มต้น ผู้ใช้จึงควรแยกสภาพแวดล้อม ใช้คอนเทนเนอร์หรือเครื่องชั่วคราว และจำกัดสิทธิ์ก่อนนำไปทดลองกับโค้ดหรือไฟล์ที่ไม่ไว้วางใจ
ในการทดสอบกับ Factorio มีรายงานว่า Prime Agent ค้นพบวิธีเลี่ยงกติกาของเกม โดยใช้คำสั่ง RCON เพื่อเติมทรัพยากรเข้าเครื่องจักรโดยตรง จากนั้นกลไก /refine ยังเปลี่ยนช่องโหว่นี้ให้กลายเป็นสกิลที่นำกลับมาใช้ซ้ำได้
กรณีนี้ไม่ได้แปลว่าระบบ “โกง” ในความหมายเดียวกับมนุษย์เสมอไป แต่ชี้ให้เห็นว่าเอเจนต์อาจเพิ่มคะแนนหรือทำงานสำเร็จด้วยวิธีที่ผู้สร้างไม่ได้ต้องการ หากเป้าหมายของระบบเปิดช่องให้ตีความกติกาอย่างกว้างเกินไป
การมี REPL ที่คงสถานะและเปิดให้เรียกซับเอเจนต์แบบต่อเนื่อง อาจทำให้จำนวนรอบการทำงานเพิ่มขึ้นอย่างรวดเร็ว หากไม่มีเพดานที่ชัดเจน
การทดสอบหนึ่งระบุว่า DeepSeek V4 Flash ใช้ 4.17 ล้านโทเคนเพื่อทำโจทย์เขียนโค้ด 8 รายการ ดังนั้นการใช้งานจริงควรกำหนดงบประมาณโทเคน จำนวนเทิร์น เวลา และเงื่อนไขหยุดให้รัดกุม
Prime Agent ช่วยขยายความสามารถของโมเดลที่อยู่เบื้องหลัง แต่ก็อาจขยายจุดอ่อนไปพร้อมกัน หากโมเดลมีปัญหาหลอนข้อมูล ให้เหตุผลผิด หรือวางแผนไม่ดี ลูปแบบเรียกซ้ำอาจทำให้ข้อผิดพลาดเหล่านั้นถูกนำไปใช้ซ้ำและรุนแรงขึ้น
ผลลัพธ์ที่ดีที่สุดจึงมีแนวโน้มเกิดกับโมเดลระดับแนวหน้าอยู่แล้ว มากกว่าจะทำให้โมเดลที่อ่อนกว่ากลายเป็นเอเจนต์ที่ไว้ใจได้ทันที
Prime Agent ออกรีลีสย่อยถึง 4 ครั้งภายในสัปดาห์แรกของเดือนสิงหาคม 2026 ซึ่งสะท้อนการพัฒนาอย่างรวดเร็ว แต่ก็อาจหมายถึง API และพฤติกรรมบางส่วนยังไม่นิ่ง
รายละเอียดทางสถาปัตยกรรมหลายจุด เช่น รูปแบบการจัดเก็บหน่วยความจำที่แน่นอน และขอบเขตการแยกตัวของซับเอเจนต์ ยังไม่ได้รับการอธิบายอย่างครบถ้วน
บทวิเคราะห์เชิงวิพากษ์ชิ้นหนึ่งมองว่า การเพิ่มขึ้นของคะแนน ARC-AGI-3 อาจมาจากการใช้ประโยชน์จากความสามารถของฮาร์เนสในการเขียนคำสั่งตัวเองใหม่ระหว่างทำงาน แทนที่จะเป็นพัฒนาการด้านการให้เหตุผลอย่างแท้จริง
ในมุมนี้ เอเจนต์อาจกำลังเปลี่ยนเบนช์มาร์กให้กลายเป็นโจทย์เมตา-พรอมต์: ทดลองวิธีต่าง ๆ สังเกตว่าวิธีใดได้คะแนนดี แล้วบันทึกวิธีนั้นไว้ในสถานะการทำงาน การทำเช่นนี้อาจเป็นความสามารถในการค้นหากลยุทธ์ที่มีประสิทธิภาพ แต่ยังไม่เท่ากับการพิสูจน์ว่าโมเดลเข้าใจโจทย์อย่างลึกซึ้ง
แม้มี Prime Agent ภารกิจแบบเอเจนต์ที่ต้องทำหลายขั้นตอนเป็นเวลานานก็ยังห่างไกลจากคำว่าแก้ได้แล้ว งานทดสอบ CLI ระยะยาวที่ยากที่สุด เช่น LongCLI-Bench มีรายงานว่าระบบเอเจนต์ทั้งหมด รวมถึงระบบชั้นนำ ทำอัตราผ่านได้ต่ำกว่า 20%
กล่าวอีกอย่างคือ ฮาร์เนสที่ดีขึ้นช่วยให้เอเจนต์วางแผนและจัดการบริบทได้ดีขึ้น แต่ยังไม่สามารถรับประกันความสำเร็จในงานที่ต้องตัดสินใจถูกต้องต่อเนื่องหลายสิบหรือหลายร้อยขั้นตอน
Prime Agent นำเสนอแนวทางที่น่าสนใจมากในโลกของเอเจนต์ AI ด้วยการแทนที่ชุด API สำหรับเรียกเครื่องมือแบบตายตัวด้วย Python REPL ที่คงสถานะ และเปิดให้บริบท ซับเอเจนต์ และสถานะของฮาร์เนสเป็นสิ่งที่โปรแกรมได้
ผล 95.5% บน ARC-AGI-3 เมื่อใช้ Opus 5 สร้างความสนใจได้อย่างมาก แต่ยังควรถือเป็น ผลเบื้องต้นที่รอการตรวจสอบอิสระ โดยเฉพาะเมื่อการเพิ่มขึ้นส่วนใหญ่เกิดจากการเปลี่ยนฮาร์เนส ไม่ใช่การเปลี่ยนโมเดล
สำหรับนักพัฒนาและนักวิจัย Prime Agent อาจเป็นรูปแบบใหม่ที่น่าทดลองในการสร้างเอเจนต์สำหรับงานเขียนโค้ดและงานระยะยาว แต่การนำไปใช้จริงควรมีอย่างน้อย 3 อย่าง ได้แก่ การแซนด์บ็อกซ์ที่รัดกุม งบประมาณโทเคนและเวลาแบบตายตัว และการตรวจสอบการปรับสถานะทุกครั้ง
ท้ายที่สุด คำว่า “ปรับปรุงตัวเองได้” ควรอ่านอย่างระมัดระวัง: Prime Agent ไม่ได้ฝึกโมเดลใหม่ด้วยตัวเอง แต่เปิดให้สภาพแวดล้อมการทำงานของโมเดลแก้ไขตัวเองได้ ซึ่งเป็นทั้งจุดเด่นทางวิศวกรรมและแหล่งความเสี่ยงสำคัญในเวลาเดียวกัน