Công ty tự báo cáo kết quả ấn tượng 95.5% Best@1 trên benchmark tương tác ARC-AGI-3 khi sử dụng Claude Opus 5, vượt qua mốc 95.4% của chuyên gia. Tuy nhiên, những kết quả này chưa được xác minh độc lập bởi cộng đồng ARC, và các nhà phê bình cho rằng sự cải thiện đến từ harness 'gian lận' benchmark hơn là từ những cải tiến thực sự trong khả năng suy luận .
Prime Agent được xây dựng trên hai ý tưởng nền tảng: Recursive Language Model (RLM) và Continual Harness .
RLM cho phép mô hình coi lịch sử hội thoại như một biến số mà nó có thể đọc và thay đổi bên trong REPL liên tục . Việc ủy quyền cho một sub-agent được thực hiện như một lời gọi hàm Python thông thường. Ví dụ, lệnh rlm("sub-task") bên trong kernel sẽ tạo ra một phiên con hoàn chỉnh với mô hình, kernel và lịch sử riêng của nó . Điều này có nghĩa là mô hình có thể viết các chương trình AI như những hành động tác động lên chính ngữ cảnh của nó .
Continual Harness chính thức hóa trạng thái của harness dưới dạng H = (ρ, G, K, M) — các thành phần gồm prompt (chỉ thị), sub-agent, kỹ năng (skills), và bộ nhớ (memory). Mỗi thành phần đều hỗ trợ các thao tác CRUD (tạo, đọc, cập nhật, xóa) trực tiếp từ Python .
Các lệnh quan trọng trong Continual Harness:
/refine: Agent phân tích quá trình thực thi của chính nó và áp dụng các cập nhật nhỏ, dựa trên bằng chứng cho trạng thái bổ sung (prompt, bộ nhớ, kỹ năng) ./refine không thể viết lại prompt hệ thống gốc. Nó chỉ điều chỉnh trạng thái bổ sung xung quanh prompt này. Tất cả các thay đổi đều được ghi lại bằng ID và có thể được hoàn tác ./compact: Cho phép mô hình chủ động nén ngữ cảnh khi cần .Trọng tâm của Prime Agent là toàn bộ giao diện là một Python REPL, chứ không phải là một bộ lệnh gọi tool cố định . Mô hình không gọi các công cụ được định nghĩa sẵn; nó viết mã Python để kiểm tra dữ liệu, gọi sub-agent, biến đổi ngữ cảnh và khởi chạy các phiên mới . Prime Intellect báo cáo rằng cách tiếp cận này hiệu quả về mặt token hơn so với các giải pháp độc quyền .
Lưu ý quan trọng: Thuật ngữ "tự cải thiện" (self-improving) không có nghĩa là mô hình tự đào tạo lại chính nó. Nó có nghĩa là harness có thể tinh chỉnh trạng thái bổ sung của nó trong suốt quá trình thực thi một tác vụ .
Tất cả các kết quả dưới đây đều do Prime Intellect tự công bố và chưa được xác thực độc lập .
| Chỉ số | Điểm số | Ghi chú |
|---|---|---|
| Best@1 (Opus 5) | 95.5% | Cao hơn mốc 95.4% của chuyên gia |
| Tính nhất quán | 95.0%, 95.2%, 95.5% qua 3 lần chạy | Hoàn thành tất cả 183/183 cấp độ |
| Best@3 | 99.97% | |
| So sánh | 30.2% (điểm chính thức) vs 95.5% (cùng mô hình) | Chỉ thay đổi phần harness |
Khoảng cách giữa điểm chính thức (~30.2%) và kết quả của Prime Agent hoàn toàn đến từ lớp harness. Bản thân Prime Intellect cũng thừa nhận rằng chỉ có lớp khung (scaffolding) thay đổi, chứ không phải mô hình . Tổ chức ARC Prize giữ các kết quả chỉ từ harness này ra khỏi bảng xếp hạng chính thức của họ .
| Mô hình | Prime Agent so với Harness Gốc |
|---|---|
| Opus 5 | ~3 lần trên ARC-AGI-3 (30.2% → 95.5%) |
| DeepSeek V4 Flash | Hoàn thành 8/8 thử thách lập trình với 4.17 triệu token |
| GLM-5.2 | Vượt trội trên hầu hết các đánh giá ngữ cảnh dài |
Prime Agent thường cho điểm tối đa cao hơn so với harness gốc của mỗi mô hình với tổng lượng token sử dụng thấp hơn .
/refine có thể dẫn đến vòng lặp tự sửa đổi mất kiểm soát (runaway self-modification) nếu agent rơi vào một vòng phản hồi tiêu cực .
/refine sau đó đã biến hành vi khai thác lỗi này thành một kỹ năng có thể tái sử dụng .Prime Agent là một kiến trúc harness mã nguồn mở thực sự mới lạ. Nó thay thế các API gọi tool cứng nhắc bằng một Python REPL liên tục, nơi ngữ cảnh, sub-agent và trạng thái harness đều có thể được lập trình. Điểm 95.5% trên ARC-AGI-3 là rất ấn tượng, nhưng cần có sự xác minh độc lập vì dường như thành công đến từ khả năng viết lại chỉ dẫn của harness hơn là từ cải thiện mô hình . Dự án này còn rất sớm, tiềm ẩn rủi ro an toàn về vòng lặp tự sửa đổi và chỉ thực sự phát huy hiệu quả với các mô hình mạnh nhất hiện nay.