Inherent affirme que Faraday, basé sur le modèle Qwen 3.6 de 27 milliards de paramètres, a mieux reproduit des résultats scientifiques publiés que Claude Opus 4.8 et GPT 5.5. L’agent est entraîné par renforcement pour développer un « instinct de recherche » : choisir les expériences pertinentes, les concevoir et sav...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Le laboratoire londonien Inherent, fondé par d’anciens chercheurs de Google DeepMind, affirme que son nouvel agent scientifique Faraday a dépassé Claude Opus 4.8 d’Anthropic et GPT-5.5 d’OpenAI dans une tâche bien délimitée : reproduire de manière autonome les résultats d’articles scientifiques publiés, sans connaître la réponse à l’avance. 25
Le résultat attire l’attention pour une raison supplémentaire : Faraday repose sur Qwen 3.6, un modèle de 27 milliards de paramètres, nettement plus compact que les systèmes de pointe auxquels il a été comparé. 15
Il faut toutefois garder la mesure de cette annonce. Il s’agit du résultat revendiqué par Inherent sur une évaluation de réplication d’articles, et non de la preuve indépendante que Faraday serait, dans l’ensemble, plus performant que Claude ou GPT-5.5.
L’évaluation portait sur la réplication scientifique. À partir d’une étude publiée, l’agent doit reconstruire suffisamment la méthode et les expériences pour retrouver les résultats annoncés. Il ne s’agit donc ni de résumer l’article ni de deviner une réponse déjà fournie. Inherent affirme que Faraday a obtenu de meilleurs résultats que Claude Opus 4.8 et GPT-5.5 dans ce cadre. 5
Un compte rendu technique présente Replica comme un banc d’essai de 310 tâches consacré à la reproduction de figures scientifiques. 8 Cette précision est essentielle : une réussite dans un flux de travail spécialisé peut révéler des capacités utiles sans permettre de conclure sur le raisonnement général, le développement logiciel, la rédaction ou la découverte scientifique.
Faraday fonctionne sur Qwen 3.6, avec 27 milliards de paramètres. Inherent met en avant l’écart de taille entre ce modèle et les systèmes de pointe utilisés pour la comparaison. 15
La conclusion défendue par l’entreprise n’est pas que Qwen 3.6, pris isolément, aurait remplacé les meilleurs modèles généralistes. Faraday est un système agentique : ses performances dépendent du modèle de base, de son entraînement complémentaire, de son organisation de recherche, de ses outils et du partage des tâches entre planification et exécution.
Autrement dit, un modèle plus petit peut se montrer compétitif sur un problème précis si tout l’environnement est optimisé pour ce problème. C’est le pari stratégique d’Inherent : plutôt que de construire le plus grand modèle généraliste possible, le laboratoire cherche à donner à un modèle compact une meilleure capacité de pilotage scientifique.
Inherent parle de « research taste », que l’on peut traduire par un véritable instinct de recherche : savoir quelles expériences valent la peine d’être tentées, comment les concevoir, reconnaître un résultat peu concluant et décider quand réorienter les travaux. 4
Pour développer cette capacité, l’entreprise dit avoir utilisé l’apprentissage par renforcement. Au lieu de dicter chaque étape à l’agent, cette méthode récompense la qualité du processus et du résultat final. L’objectif diffère donc de celui d’un benchmark de réponses courtes, où la bonne réponse est déjà définie.
Faraday n’a pas non plus besoin de réaliser seul chaque étape technique. Il peut utiliser des agents de programmation, notamment GPT-5.5 Codex, comme outils. Dans cette organisation, Faraday agit davantage comme un directeur de recherche : il établit la stratégie scientifique et les priorités, tandis qu’un système spécialisé transforme ce plan en expériences exécutables. 6
L’avantage revendiqué concerne ainsi l’ensemble du système, et pas nécessairement le modèle Qwen 3.6 de 27 milliards de paramètres lorsqu’il est considéré seul.
La réplication offre à un agent une manière concrète de s’exercer à la démarche scientifique. Il doit interpréter un article, formuler des hypothèses sur la méthode employée, choisir des expériences, gérer les échecs et comparer ses résultats avec ceux de la publication.
Le point de départ d’Inherent est que l’article final ne montre qu’une petite partie du travail accompli. Les essais et erreurs, les pistes abandonnées et les choix pratiques qui ont conduit au résultat sont généralement absents du texte publié. Reconstituer ce processus caché peut donc servir de terrain d’entraînement contrôlé pour le raisonnement scientifique. 5
La réplication est aussi plus facile à évaluer qu’une découverte véritablement originale. Elle offre une cible externe : on peut vérifier si l’agent retrouve le résultat publié et si ses décisions expérimentales sont défendables sur le plan scientifique. Pour Inherent, c’est une étape intermédiaire avant de confier à une IA des questions dont personne ne connaît encore la réponse.
La réplication d’articles n’est pas présentée comme l’objectif final. Inherent décrit Faraday comme une première étape vers des « scientifiques IA » capables de travailler dans plusieurs disciplines et, à terme, de contribuer à la production de connaissances réellement nouvelles. 13
Cette ambition dépasse largement la réussite à un benchmark. Reproduire un résultat publié montre qu’un système sait adopter certains comportements de recherche. Découvrir exige en plus de repérer des questions importantes encore sans réponse, de proposer des hypothèses inédites, de concevoir des tests fiables et de produire des résultats capables de résister à l’examen des chercheurs.
L’évaluation de Faraday doit donc être comprise comme un indice sur une partie de cette trajectoire, pas comme la démonstration que l’IA scientifique autonome est déjà là.
Inherent est sorti du mode furtif avec une levée de fonds d’amorçage annoncée de 50 millions de dollars et construit son équipe à Londres. 5 L’entreprise, qui comptait environ une douzaine de personnes, aurait prévu de passer à 20 ou 25 salariés. Cette trajectoire correspond davantage à une équipe réduite et très spécialisée qu’à une course aux effectifs ou aux budgets d’entraînement des plus grands laboratoires d’IA.
Le cofondateur et directeur scientifique Edward Hughes a critiqué les règles britanniques de « garden leave », ces périodes durant lesquelles un salarié doit parfois rester éloigné de son nouvel employeur avant de pouvoir le rejoindre. Selon Inherent, ces restrictions peuvent ralentir le recrutement de chercheurs expérimentés, notamment face à des entreprises et des laboratoires mieux financés. 6
La stratégie est donc fondée sur la concentration plutôt que sur la démesure : une petite équipe, un apprentissage par renforcement axé sur le jugement scientifique et l’utilisation d’outils externes de plus en plus puissants. Si cette approche se confirme au-delà de l’évaluation initiale, elle pourrait offrir aux jeunes pousses une autre façon de rivaliser dans la recherche en IA sans entraîner le plus grand modèle du marché.
Inherent affirme que Faraday a dépassé GPT-5.5 et Claude Opus 4.8 pour reproduire de manière autonome des résultats scientifiques publiés, malgré un modèle Qwen 3.6 de seulement 27 milliards de paramètres. L’idée la plus importante n’est toutefois pas simplement qu’un petit modèle ait remporté une comparaison.
L’enjeu est de savoir si la planification de recherche, l’apprentissage par renforcement sur des tâches longues et la coordination d’outils spécialisés peuvent compter autant que la taille brute du modèle dans les travaux scientifiques.
À ce stade, les éléments disponibles permettent surtout de retenir une conclusion plus prudente : Faraday semble prometteur pour la tâche de réplication évaluée par Inherent. Rien ne permet encore d’établir sa supériorité générale sur les modèles d’Anthropic ou d’OpenAI, et la réplication ne suffit pas, à elle seule, à démontrer une capacité de découverte scientifique autonome.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Inherent affirme que Faraday, basé sur le modèle Qwen 3.6 de 27 milliards de paramètres, a mieux reproduit des résultats scientifiques publiés que Claude Opus 4.8 et GPT 5.5.
Inherent affirme que Faraday, basé sur le modèle Qwen 3.6 de 27 milliards de paramètres, a mieux reproduit des résultats scientifiques publiés que Claude Opus 4.8 et GPT 5.5. L’agent est entraîné par renforcement pour développer un « instinct de recherche » : choisir les expériences pertinentes, les concevoir et savoir quand changer de piste.
Faraday peut déléguer l’écriture du code à des outils spécialisés, notamment GPT 5.5 Codex, tandis qu’il joue le rôle de directeur scientifique.