Inherent claimt dat Faraday, gebaseerd op het 27 miljard parameters tellende Qwen 3.6, beter presteerde dan Claude Opus 4.8 en GPT 5.5 bij het zelfstandig reproduceren van gepubliceerde onderzoeksresultaten. De winst draait volgens het bedrijf vooral om ‘research taste’: met versterkend leren leert Faraday inschatte...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
De Londense AI-lab Inherent, opgericht door voormalige onderzoekers van Google DeepMind, zegt dat zijn nieuwe onderzoeksagent Faraday beter heeft gepresteerd dan Anthropic’s Claude Opus 4.8 en OpenAI’s GPT-5.5 bij een specifieke taak: zelfstandig de resultaten uit gepubliceerde wetenschappelijke artikelen reproduceren zonder vooraf het antwoord te krijgen. 25
Dat klinkt als een grote overwinning voor een relatief klein model. Faraday draait namelijk op Qwen 3.6, een model met 27 miljard parameters — aanzienlijk kleiner dan de grootschalige modellen waarmee het werd vergeleken. 25
De cruciale kanttekening: dit is Inherents eigen gerapporteerde resultaat op een evaluatie voor onderzoeksreplicatie. Het bewijst niet dat Faraday in het algemeen capabeler is dan Claude of GPT-5.5.
De test ging niet over het samenvatten van een wetenschappelijk artikel of het geven van een antwoord dat al bekend is. De agent kreeg een gepubliceerd onderzoek en moest voldoende van de methode reconstrueren om de bevindingen opnieuw te produceren.
Een technische beschrijving van de evaluatie noemt Replica, een benchmark met 310 taken die zich richt op het reproduceren van wetenschappelijke figuren. 8 Dat maakt de uitkomst interessant, maar ook duidelijk afgebakend: goed presteren in een gespecialiseerde onderzoeksworkflow zegt nog niets over algemene prestaties op bijvoorbeeld schrijven, programmeren, wiskunde of originele wetenschappelijke ontdekkingen.
Faraday is gebouwd rond Qwen 3.6 met 27 miljard parameters. Inherent presenteert dat als een opvallend contrast met de veel grotere, zogenoemde frontier-modellen van Anthropic en OpenAI. 15
De claim is dus niet dat Qwen 3.6 als losstaand basismodel alle concurrenten heeft ingehaald. Faraday is een compleet agentsysteem waarvan de prestaties afhangen van het onderliggende model, de aanvullende training, de onderzoeksworkflow en het gebruik van hulpmiddelen.
Een kleiner model kan daardoor op een gespecialiseerde taak concurreren met een groter model als het systeem eromheen specifiek voor die taak is geoptimaliseerd. Inherent zet daarmee in op een andere route dan het bouwen van het grootste algemene model: een compact model dat als onderzoeksregisseur betere keuzes leert maken en gespecialiseerde tools aanstuurt.
Inherent omschrijft de gewenste vaardigheid als research taste, oftewel onderzoeksgevoel. Het gaat om het kunnen inschatten welke experimenten de moeite waard zijn, hoe ze moeten worden ontworpen, wanneer een resultaat niet overtuigend is en wanneer een andere richting nodig is. 4
Het bedrijf zegt versterkend leren te hebben gebruikt om dat gedrag te ontwikkelen. Daarbij wordt niet iedere stap vooraf voorgeschreven; de kwaliteit van het uiteindelijke onderzoeksproces en resultaat bepaalt in belangrijke mate de beloning. Dat verschilt van een korte benchmarkvraag waarbij het juiste antwoord al vaststaat.
Faraday hoeft bovendien niet al het uitvoerende werk zelf te doen. De agent kan programmeeragents inzetten, waaronder OpenAI’s GPT-5.5 Codex. Faraday fungeert in die opzet meer als onderzoeksdirecteur: het bepaalt de wetenschappelijke aanpak en maakt keuzes, terwijl een gespecialiseerde programmeertool helpt om experimenten daadwerkelijk uitvoerbaar te maken. 6
De vergelijking met GPT-5.5 en Claude moet daarom als een vergelijking tussen complete workflows worden gelezen. De gerapporteerde voorsprong behoort niet noodzakelijk toe aan het 27B-basismodel in isolatie.
Het opnieuw uitvoeren van bestaand onderzoek geeft een AI-agent een concreet doel. Het systeem moet een artikel interpreteren, hypotheses vormen over de onderliggende methode, experimenten kiezen, omgaan met mislukte pogingen en de eigen resultaten naast de gepubliceerde bevindingen leggen.
Volgens Inherents uitgangspunt blijft een groot deel van het echte onderzoekswerk verborgen in het uiteindelijke artikel. Proefondervindelijk zoeken, afgewezen aanpakken en praktische keuzes die tot het eindresultaat leidden, worden meestal niet volledig beschreven. Juist dat verborgen proces reconstrueren kan dienen als gecontroleerde training in wetenschappelijk redeneren. 5
Replicatie is bovendien eenvoudiger te beoordelen dan een volledig nieuwe ontdekking. Er is een extern doel: de agent kan worden getest op de vraag of hij het resultaat reproduceert en of de gekozen experimenten wetenschappelijk verdedigbaar zijn. Dat maakt replicatie een mogelijke tussenstap voordat een AI-systeem vragen moet onderzoeken waarvan het antwoord nog onbekend is.
Voor Inherent is het reproduceren van artikelen geen eindstation. Het bedrijf ziet Faraday als een eerste stap richting AI-wetenschappers die in meerdere wetenschappelijke disciplines kunnen werken en uiteindelijk kunnen helpen om echt nieuwe kennis te produceren. 13
Dat is een veel grotere belofte dan het winnen van één benchmark. Een systeem dat een bestaand resultaat kan reproduceren, toont nuttig onderzoeks gedrag, maar originele ontdekkingen vereisen ook het vinden van waardevolle open vragen, het formuleren van nieuwe hypotheses, het ontwerpen van betrouwbare tests en het opleveren van resultaten die kritische controle doorstaan.
De Faraday-evaluatie kan daarom het best worden gezien als bewijs voor één onderdeel van die ontwikkeling — niet als bewijs dat autonome wetenschappelijke ontdekking al is bereikt.
Inherent kwam onlangs uit stealth — de fase waarin een start-up weinig publieke informatie deelt — met een gemelde seed-investering van 50 miljoen dollar. Het bedrijf bouwt zijn team in Londen, dicht bij het talentnetwerk waar ook de oprichters uit voortkomen. 5
De plannen om van ongeveer twaalf medewerkers door te groeien naar circa twintig à 25 mensen wijzen op een kleine, onderzoeksintensieve aanpak. Inherent lijkt daarmee niet rechtstreeks te willen concurreren met de grootste AI-labs via meer personeel of een groter trainingsbudget.
Medeoprichter en hoofdwetenschapper Edward Hughes heeft kritiek geuit op de Britse regels rond garden leave. Daarbij moet een werknemer na vertrek soms nog een periode wachten voordat hij of zij bij een nieuwe werkgever aan de slag mag. Volgens Inherent kan dat de overstap van ervaren AI-onderzoekers naar start-ups vertragen, juist wanneer het bedrijf talent uit de DeepMind-omgeving probeert aan te trekken en moet concurreren met kapitaalkrachtigere spelers. 6
De strategie is daardoor geconcentreerd in plaats van schaalgedreven: een klein team, veel aandacht voor versterkend leren en wetenschappelijk oordeel, en een kleiner basismodel dat wordt gecombineerd met steeds krachtigere externe tools. Als die aanpak ook buiten de eerste evaluatie standhoudt, kan hij start-ups een alternatief bieden voor de klassieke wedloop om het grootste model.
Inherent zegt dat Faraday GPT-5.5 en Claude Opus 4.8 heeft overtroffen bij het zelfstandig reproduceren van gepubliceerde wetenschappelijke bevindingen, ondanks het gebruik van een 27B-model van Qwen 3.6.
De interessantere boodschap gaat mogelijk niet over de overwinning van een klein model op grotere concurrenten, maar over de rol van onderzoeksplanning, langetermijntraining en het slim coördineren van tools. Voor wetenschappelijke toepassingen kan die combinatie soms net zo belangrijk zijn als de ruwe omvang van het basismodel.
Voorlopig ondersteunt het beschikbare bewijs een beperktere conclusie: Faraday is een veelbelovend onderzoeksagentsysteem voor de taak die Inherent heeft geëvalueerd. Er is nog geen bewijs voor brede superioriteit ten opzichte van de modellen van Anthropic of OpenAI, en replicatie alleen staat niet gelijk aan autonome wetenschappelijke ontdekking.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent claimt dat Faraday, gebaseerd op het 27 miljard parameters tellende Qwen 3.6, beter presteerde dan Claude Opus 4.8 en GPT 5.5 bij het zelfstandig reproduceren van gepubliceerde onderzoeksresultaten.
Inherent claimt dat Faraday, gebaseerd op het 27 miljard parameters tellende Qwen 3.6, beter presteerde dan Claude Opus 4.8 en GPT 5.5 bij het zelfstandig reproduceren van gepubliceerde onderzoeksresultaten. De winst draait volgens het bedrijf vooral om ‘research taste’: met versterkend leren leert Faraday inschatten welke experimenten de moeite waard zijn en hoe ze moeten worden opgezet.
Inherent ziet replicatie als een oefenterrein voor AI wetenschappers, met als uiteindelijke ambitie om systemen te ontwikkelen die in verschillende vakgebieden nieuwe wetenschappelijke kennis helpen voortbrengen.