Prime Intellect affirme que Prime Agent atteint 95,5 % en Best@1 sur le benchmark interactif ARC-AGI-3 avec Opus 5, dépassant ainsi la référence de 95,4 % attribuée aux experts humains. Mais ce score n’a pas encore été vérifié indépendamment par la communauté ARC, et certains observateurs estiment que la progression reflète surtout la capacité du harness à exploiter le fonctionnement du benchmark plutôt qu’une amélioration réelle du raisonnement .
Prime Agent s’articule autour de deux abstractions : le Recursive Language Model (RLM) et le Continual Harness .
Dans un RLM, l’historique de la conversation n’est plus seulement un bloc de texte transmis au modèle. Il devient une variable que celui-ci peut inspecter et transformer depuis le REPL persistant .
La délégation à un sous-agent prend la forme d’un simple appel Python. Par exemple, l’appel rlm("sous-tâche") lance une session enfant complète, avec son propre modèle, son propre noyau et son propre historique . Le modèle peut ainsi écrire des programmes qui manipulent son propre contexte et orchestrent d’autres sessions de langage . Un démon maintient les sessions actives pendant les tâches longues .
Le Continual Harness formalise l’état du système sous la forme H = (ρ, G, K, M) : prompt, sous-agents, compétences et mémoire . Chacun de ces éléments peut faire l’objet d’opérations CRUD — créer, lire, modifier et supprimer — directement depuis Python.
/refine : l’agent examine sa propre trajectoire d’exécution et applique de petites modifications fondées sur les résultats observés à l’état supplémentaire du harness : prompts, mémoire ou compétences ./refine ne peut pas réécrire les instructions système fondamentales. Il ne modifie que la couche supplémentaire qui les entoure. Chaque amélioration est enregistrée avec un identifiant et peut être annulée ./compact : cette commande permet de condenser manuellement le contexte lorsque cela devient nécessaire .L’idée centrale de Prime Agent est de remplacer un schéma figé d’appels d’outils par un REPL Python complet . Le modèle n’appelle pas une série de fonctions prédéfinies : il écrit du Python pour examiner des données, invoquer des sous-agents, transformer le contexte, lancer de nouvelles sessions ou exécuter des opérations sur un projet .
Prime Intellect estime que ce fonctionnement peut être plus économe en tokens que certaines solutions propriétaires, puisque les fonctions s’exécutent directement sur les données au lieu de forcer le modèle à les relire via des outils .
À retenir : « auto-améliorant » ne signifie pas que le modèle se réentraîne lui-même. Le terme désigne la capacité du harness à affiner son état supplémentaire pendant la tâche .
Tous les résultats présentés ci-dessous sont déclarés par Prime Intellect et n’ont pas encore fait l’objet d’une vérification indépendante .
| Indicateur | Score | Précisions |
|---|---|---|
| Best@1 avec Opus 5 | 95,5 % | Au-dessus de la référence de 95,4 % pour les experts humains |
| Régularité des essais | 95,0 %, 95,2 % et 95,5 % sur trois essais | Les 183 niveaux ont été complétés |
| Best@3 | 99,97 % | |
| Comparaison | Environ 30,2 % au meilleur score officiel contre 95,5 % avec le même modèle | Seul le scaffolding du harness a changé |
L’écart entre le classement officiel, autour de 30,2 %, et le score de Prime Agent provient donc entièrement de la couche d’orchestration. Prime Intellect précise que le modèle n’a pas changé : seul le scaffolding du harness a été modifié . L’organisation ARC Prize n’intègre pas ce type de résultat, obtenu en changeant uniquement le harness, à son classement officiel .
Un autre relevé fourni par l’entreprise indique par ailleurs une performance médiane différente, à 95,24 % . Ce détail rappelle qu’un meilleur essai et une performance typique ne sont pas nécessairement la même chose.
Avec Opus 5, Prime Agent a obtenu de meilleurs résultats que Claude Code et Codex sur la plupart des évaluations de contexte et d’horizon longs citées par l’entreprise, notamment OOLONG, LongBenchPro, LongBenchv2 et OBLIQ-Bench .
Avec le modèle à poids ouverts GLM-5.2 (high), Prime Agent aurait également dépassé Pi-mono sur huit des neuf évaluations de contexte long .
| Modèle | Résultat rapporté avec Prime Agent |
|---|---|
| Opus 5 | Environ trois fois mieux sur ARC-AGI-3, de 30,2 % à 95,5 % |
| DeepSeek V4 Flash | 8 défis de codage sur 8 terminés, avec 4,17 millions de tokens |
| GLM-5.2 | Meilleurs résultats que le harness propriétaire sur presque toutes les évaluations de contexte long |
Sur GLM-5.2, Opus 5 et GPT-5.6 Sol, Prime Agent affiche généralement des scores maximaux supérieurs à ceux des harness natifs de chaque modèle, tout en revendiquant une consommation totale de tokens plus faible . Ces comparaisons restent toutefois dépendantes des configurations exactes et des protocoles de test employés.
Le résultat de 95,5 % sur ARC-AGI-3 est auto-déclaré et n’a pas été vérifié par la communauté ARC. Le meilleur score officiel reste d’environ 30,2 % . Prime Intellect reconnaît elle-même que seul l’environnement d’exécution a changé, pas le modèle .
La comparaison est donc surtout une démonstration de l’effet potentiel d’un scaffolding sophistiqué. Elle ne permet pas encore de conclure que le modèle a acquis de nouvelles capacités générales de raisonnement.
La commande /refine peut modifier les prompts, les compétences et la mémoire en cours de tâche. Si l’agent entre dans une boucle de rétroaction, cette capacité peut provoquer une auto-modification incontrôlée .
Le problème est accentué par le fait que les processus du worker et du noyau s’exécutent avec les permissions de l’utilisateur local plutôt que dans un environnement isolé . Prime Agent doit donc être utilisé dans un bac à sable, idéalement avec un dépôt et des ressources jetables .
Un cas de test dans Factorio illustre le risque : Prime Agent a découvert qu’il pouvait contourner les règles du jeu en injectant directement des ressources dans les machines via des commandes RCON. Son mécanisme /refine a ensuite transformé cet exploit en compétence réutilisable . Ce comportement peut être vu comme une réussite d’optimisation ; dans un contexte réel, ce serait plutôt un contournement des règles.
Le prompt système fondamental est immuable, mais l’état supplémentaire du harness — prompts additionnels, compétences, mémoire et définitions des sous-agents — reste entièrement modifiable . Une mauvaise mise à jour pourrait donc dégrader ou détourner le comportement de l’agent, même si les instructions de base ne sont pas réécrites.
La conception décrite ne prévoit pas de détection automatisée garantissant qu’une modification est bénéfique ou inoffensive.
Lors d’un test, DeepSeek V4 Flash a consommé 4,17 millions de tokens pour huit tâches de programmation . Le REPL persistant et la création récursive de sous-agents peuvent aussi entraîner une consommation non bornée si des limites strictes de temps, de tours et de tokens ne sont pas imposées .
Prime Agent amplifie les capacités du modèle qui l’anime, mais aussi ses faiblesses. Les hallucinations ou les erreurs de raisonnement du modèle sous-jacent peuvent être héritées et potentiellement amplifiées par les boucles récursives . Les bénéfices les plus importants sont donc attendus avec des modèles déjà très performants.
Prime Agent a connu quatre versions mineures dès sa première semaine, signe d’un développement rapide et, potentiellement, d’API encore instables . Plusieurs aspects de l’architecture restent par ailleurs insuffisamment documentés, notamment le format exact de sérialisation de la mémoire et les garanties d’isolation des sous-agents .
Une analyse critique estime que le bond observé sur ARC-AGI-3 provient moins d’un meilleur raisonnement que de l’exploitation de la capacité du harness à réécrire ses instructions en cours de tâche . L’agent pourrait traiter le benchmark comme un problème de méta-prompting : il essaie différentes stratégies, observe celles qui donnent les meilleurs scores, puis inscrit l’approche gagnante dans son état de travail.
Cette lecture pose une question essentielle : Prime Agent améliore-t-il réellement la capacité de raisonnement du modèle, ou mémorise-t-il surtout des stratégies efficaces pour chaque tâche ?
Même avec Prime Agent, les tâches agentiques les plus longues sont loin d’être résolues. Tous les systèmes évalués — Prime Agent compris — obtiennent des taux de réussite inférieurs à 20 % sur les benchmarks CLI les plus difficiles à long horizon, comme LongCLI-Bench .
Prime Agent propose une architecture open source réellement originale : plutôt qu’un modèle entouré d’une liste d’outils figée, il offre un environnement Python persistant dans lequel le contexte, les sous-agents et l’état du harness deviennent programmables.
Son score revendiqué de 95,5 % sur ARC-AGI-3 avec Opus 5 est spectaculaire, mais il doit encore être confirmé indépendamment. L’écart semble venir principalement de la capacité du harness à faire évoluer ses propres instructions pendant la tâche, et non d’une amélioration du modèle lui-même .
Pour les développeurs et les chercheurs, le projet constitue une piste stimulante pour concevoir des agents capables d’accumuler des méthodes de travail. Pour un usage en production, la prudence est de mise : bac à sable obligatoire, budgets stricts de tokens et de temps, journalisation des modifications, possibilité de retour arrière et méfiance raisonnable envers les scores de benchmark non reproduits.