Inherent affirme que Faraday, son agent de 27 milliards de paramètres, a dépassé Claude Opus 4.8 et GPT 5.5 dans une tâche spécifique de réplication scientifique, sans démontrer pour autant une capacité à faire de nou... Le benchmark Replica comprend 310 tâches issues de 100 articles de recherche en apprentissage au...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Le laboratoire londonien Inherent, fondé par d’anciens membres de Google DeepMind, affirme que son agent scientifique Faraday peut reproduire les résultats d’articles publiés sans connaître les réponses à l’avance. Selon l’entreprise, il a également dépassé Claude Opus 4.8 d’Anthropic et GPT-5.5 d’OpenAI sur cette tâche précise. 259
Si elle se confirme lors d’évaluations plus larges et indépendantes, la performance serait notable. Elle doit toutefois être replacée dans son contexte : Faraday a été testé sur la reproduction de résultats existants, et non sur la découverte autonome de connaissances scientifiques inédites.
Pour évaluer son système, Inherent a créé Replica, un benchmark fondé sur 100 articles consacrés à l’apprentissage automatique et à l’IA pour les sciences. Ces articles ont été transformés en 310 tâches de réplication. Dans chacune d’elles, l’agent doit recréer une figure particulière d’un article, avec un temps et des ressources informatiques limités, sans avoir accès au graphique original. 34
L’exercice ne consiste donc pas simplement à résumer un article ou à reproduire un graphique déjà publié. L’agent doit comprendre les travaux, implémenter les expériences nécessaires, choisir la meilleure façon d’utiliser ses ressources et obtenir un résultat suffisamment proche de celui décrit dans l’étude pour être considéré comme une réplication.
Inherent indique que Faraday a surpassé Claude Opus 4.8 et GPT-5.5 sur ce benchmark, alors même qu’il repose sur un modèle de 27 milliards de paramètres, bien plus petit que ces systèmes de pointe. 158 Cette comparaison doit être interprétée comme un résultat lié à Replica, et non comme un classement général des modèles en matière de science ou de programmation.
Pour Inherent, un bon travail scientifique ne se résume pas à obtenir un graphique qui ressemble à l’original. Un chercheur doit aussi déterminer quelles expériences valent la peine d’être menées, les concevoir correctement, interpréter des résultats parfois ambigus et changer de stratégie lorsqu’une piste échoue. L’entreprise regroupe ces capacités sous l’expression « research taste », que l’on pourrait traduire par « flair scientifique » ou « sens de la recherche ». 47
Cette nuance est importante : un modèle peut produire un résultat plausible sans suivre une démarche scientifique fiable. Inherent affirme avoir entraîné Faraday, grâce à un apprentissage par renforcement sur des séquences longues, à développer des comportements plus proches de ceux d’une véritable investigation : formuler des hypothèses, les tester, tirer des leçons des échecs et sélectionner les prochaines étapes les plus prometteuses. 4
La réplication sert ici de terrain d’entraînement. Pour reproduire un résultat publié, l’agent doit souvent retrouver une partie des essais et erreurs pratiques qui ne figurent pas toujours dans l’article. La thèse d’Inherent est que cette capacité à naviguer dans un processus de recherche pourrait, à terme, aider les agents à passer de la vérification de résultats connus à des travaux plus ouverts. 49
Faraday n’est pas présenté comme un agent de programmation autonome conçu pour remplacer les outils les plus puissants. Il joue plutôt le rôle d’une couche scientifique de supervision qui dirige GPT-5.5 Codex d’OpenAI pendant les tâches de réplication. Inherent compare cette organisation à celle d’un scientifique humain utilisant un assistant de programmation : Faraday planifie les travaux et apporte le jugement scientifique, tandis que Codex réalise une grande partie de l’implémentation. 39
Cette architecture déplace le débat au-delà du nombre de paramètres. Un modèle plus petit peut apporter une réelle valeur en décidant quoi demander à un outil plus puissant, quand modifier l’approche et comment évaluer les résultats obtenus. L’avantage revendiqué par Faraday relève donc en partie de l’orchestration : l’association d’une planification scientifique spécialisée et d’une capacité de programmation avancée. Elle ne prouve pas que son modèle de 27 milliards de paramètres soit, dans tous les domaines, plus performant que des systèmes plus volumineux.
Inherent dit vouloir construire des agents capables de collaborer avec les chercheurs comme des coéquipiers. Le système visé pourrait aider à planifier, exécuter, critiquer et recommencer des expériences, tout en laissant aux humains la direction du projet et la supervision. 45
Faraday doit donc être considéré comme une première version de cette vision : un modèle chargé de fournir une intuition scientifique et de gérer le processus de recherche, au-dessus d’outils de programmation généralistes. L’ambition affichée à long terme est de créer des agents capables de contribuer à la découverte de nouvelles connaissances, mais le résultat présenté aujourd’hui porte sur la réplication, pas sur la découverte. 34
La distinction est essentielle. Reproduire fidèlement un résultat connu constitue un test utile de fiabilité scientifique. Cela ne suffit pas à démontrer qu’un agent peut formuler des questions originales et importantes, générer des hypothèses véritablement nouvelles ou valider une découverte dans le monde réel.
Inherent est sortie de son mode furtif avec une levée de fonds d’amorçage annoncée de 50 millions de dollars. Le laboratoire londonien se présente comme une équipe spécialisée, fondée par d’anciens membres de Google DeepMind. 25 Sa stratégie consiste à travailler sur des capacités que les modèles généralistes n’acquièrent pas nécessairement seuls : le jugement expérimental, la prise de décision sur le long terme, l’évaluation et la coordination entre chercheurs et outils logiciels.
Cela explique aussi pourquoi l’entreprise met en avant l’utilisation d’un outil de programmation externe. Plutôt que de vouloir concentrer toutes les compétences dans un seul modèle, Inherent cherche à entraîner une couche spécialisée capable de rendre les outils de pointe existants plus efficaces pour la recherche scientifique. 39
Le bilan immédiat reste donc mesuré, mais intéressant : Inherent affirme qu’un modèle de supervision relativement compact, entraîné par apprentissage par renforcement, peut dépasser de grands systèmes de pointe sur un benchmark de réplication soigneusement défini. La question la plus importante — cette approche permettra-t-elle un jour de produire des contributions scientifiques originales et fiables ? — reste entièrement ouverte.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Inherent affirme que Faraday, son agent de 27 milliards de paramètres, a dépassé Claude Opus 4.8 et GPT 5.5 dans une tâche spécifique de réplication scientifique, sans démontrer pour autant une capacité à faire de nou...
Inherent affirme que Faraday, son agent de 27 milliards de paramètres, a dépassé Claude Opus 4.8 et GPT 5.5 dans une tâche spécifique de réplication scientifique, sans démontrer pour autant une capacité à faire de nou... Le benchmark Replica comprend 310 tâches issues de 100 articles de recherche en apprentissage automatique et en IA pour les sciences.
Faraday fournit la planification et le jugement scientifique, tandis que GPT 5.5 Codex prend en charge une grande partie du travail de programmation.