Inherent hävdar att Faraday, som bygger på Qwen 3.6 med 27 miljarder parametrar, presterade bättre än Anthropics Claude Opus 4.8 och OpenAI:s GPT 5.5 på att självständigt reproducera publicerade forskningsresultat. Agentens särskilda roll är att styra forskningen: med förstärkningsinlärning har Inherent tränat Farad...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inherent, ett Londonbaserat AI-laboratorium grundat av tidigare Google DeepMind-forskare, säger att den nya forskningsagenten Faraday slog Anthropics Claude Opus 4.8 och OpenAI:s GPT-5.5 på en specifik uppgift: att självständigt återskapa resultat från publicerade vetenskapliga artiklar utan att få facit i förväg. 25
Det uppseendeväckande är att Faraday bygger på Qwen 3.6, en förhållandevis liten modell med 27 miljarder parametrar – inte på ett av de allra största så kallade frontier-systemen. 25
Men det finns en viktig brasklapp: resultatet är Inherents egen redovisning av ett test för reproduktion av forskning. Det är inte ett oberoende belägg för att Faraday generellt är mer kapabel än Claude eller GPT-5.5.
Testet handlade om vetenskaplig reproduktion. Agenten får en publicerad studie och ska rekonstruera tillräckligt mycket av arbetet för att återskapa dess resultat. Det är alltså något annat än att sammanfatta en artikel eller gissa ett redan känt svar. Inherent uppger att Faraday presterade bättre än både Claude Opus 4.8 och GPT-5.5 i denna miljö. 5
En teknisk beskrivning av utvärderingen kallar testet Replica och beskriver det som ett riktmärke med 310 uppgifter, inriktat på att återskapa vetenskapliga figurer. 8 Det är en viktig detalj. Ett bra resultat i ett noggrant avgränsat forskningsflöde kan visa på användbara förmågor utan att säga särskilt mycket om allmän problemlösning, programmering, skrivande eller helt nya vetenskapliga upptäckter.
Faraday körs på Qwen 3.6 med 27 miljarder parametrar. Inherent framhåller det som en tydlig storleksskillnad jämfört med de betydligt större systemen som användes i jämförelsen. 15
Poängen är dock inte att Qwen 3.6 ensamt har ersatt de ledande generalistmodellerna. Faraday är ett agentsystem där resultatet påverkas av grundmodellen, efterträningen, arbetsflödet, verktygsanvändningen och uppdelningen mellan planering och genomförande.
En mindre grundmodell kan därför konkurrera i en specialiserad uppgift om hela systemet runt modellen är optimerat för just den uppgiften. Inherent satsar i stället för att träna marknadens största generalistmodell på att kombinera en kompakt modell med bättre vetenskaplig styrning och specialiserade verktyg.
Inherent beskriver den eftersträvade förmågan som ”research taste”, ungefär forskarblick eller forskningsomdöme. Det handlar om att avgöra vilka experiment som är värda att genomföra, hur de ska utformas, när ett resultat är oklart och när det är dags att byta spår. 4
För att utveckla detta beteende säger bolaget att det har använt förstärkningsinlärning. I stället för att föreskriva varje enskilt steg belönas kvaliteten på den samlade forskningsprocessen och slutresultatet. Det skiljer sig från att enbart optimera mot ett kort benchmarktest där rätt svar redan är definierat.
Faraday behöver inte heller göra varje praktiskt steg själv. Agenten kan använda kodningsagenter, däribland OpenAI:s GPT-5.5 Codex, som verktyg. Tanken är att Faraday fungerar mer som en forskningsledare: den står för planering och vetenskapligt omdöme, medan ett specialiserat kodningssystem hjälper till att omsätta planen i körbara experiment. 6
Det gör jämförelsen mer nyanserad. Den rapporterade fördelen gäller hela agentens arbetsflöde – inte nödvändigtvis Qwen-modellen på egen hand.
Att reproducera en studie ger en AI-forskare ett konkret sätt att träna vetenskapligt arbete. Agenten måste tolka en artikel, formulera hypoteser om metoden, välja experiment, hantera misslyckade försök och jämföra sina resultat med de publicerade.
Inherents utgångspunkt är att den färdiga artikeln bara visar en liten del av arbetet. Testandet, återvändsgränderna och de praktiska valen som ledde fram till slutresultatet finns oftast inte med. Att återskapa denna dolda process kan därför fungera som en kontrollerad träningsmiljö för vetenskapligt tänkande. 5
Reproduktion är dessutom lättare att utvärdera än verkligt nya upptäckter. Det finns ett yttre mål: lyckades agenten återskapa resultatet, och var experimentbesluten vetenskapligt rimliga? Det gör uppgiften till ett möjligt mellansteg innan en AI får i uppdrag att undersöka frågor där svaren ännu inte är kända.
Inherent beskriver inte reproduktion av forskningsartiklar som slutmålet. Bolaget ser Faraday som ett tidigt steg mot AI-forskare som kan arbeta inom flera vetenskapsområden och så småningom bidra till genuint ny kunskap. 13
Det är ett betydligt större påstående än att vinna ett benchmarktest. Att kunna återskapa ett publicerat resultat visar på användbara forskningsbeteenden, men originell forskning kräver också att systemet hittar viktiga obesvarade frågor, formulerar nya hypoteser, utformar tillförlitliga tester och producerar resultat som klarar granskning.
Faraday-testet bör därför ses som belägg för en del av den utvecklingsvägen – inte som ett bevis för att målet om autonoma vetenskapliga upptäckter redan är nått.
Inherent lämnade nyligen sin så kallade stealth-fas med en rapporterad såddinvestering på 50 miljoner dollar och bygger verksamheten i London. 5 Bolagets plan att växa från omkring ett dussin anställda till cirka 20–25 pekar mot ett litet och forskningsintensivt team snarare än en tävling om flest anställda eller störst budget för modellträning.
Medgrundaren och forskningschefen Edward Hughes har kritiserat Storbritanniens regler om så kallad garden leave. De kan innebära att anställda måste stanna kvar i en uppsägningstid utan att börja hos en ny arbetsgivare, vilket bromsar forskare som vill byta jobb eller gå till en startup. Inherent ser detta som en konkurrensnackdel när bolaget försöker rekrytera erfarna AI-forskare, bland annat från DeepMind, mot företag med större resurser. 6
Strategin blir därmed koncentrerad snarare än skaldriven: ett litet team ska investera i förstärkningsinlärning och vetenskapligt omdöme, samtidigt som en mindre grundmodell kombineras med allt kraftfullare externa verktyg. Om metoden fungerar även utanför den första utvärderingen kan den ge startups ett alternativ till att bygga marknadens största AI-modell.
Inherent säger att Faraday överträffade GPT-5.5 och Claude Opus 4.8 på att självständigt reproducera vetenskapliga resultat, trots att agenten bygger på en Qwen 3.6-modell med 27 miljarder parametrar.
Den mer intressanta lärdomen är inte bara att en mindre modell vann en jämförelse. Det är att forskningsplanering, långsiktig förstärkningsinlärning och samordning av verktyg kan vara minst lika viktigt som ren modellstorlek i vetenskapligt arbete.
Den försiktiga slutsatsen är att Faraday verkar vara ett lovande forskningsagentsystem för den uppgift Inherent har utvärderat. Resultatet visar däremot inte att Faraday generellt är bättre än Anthropics eller OpenAI:s modeller – och att reproducera tidigare forskning är fortfarande inte samma sak som att göra självständiga vetenskapliga upptäckter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent hävdar att Faraday, som bygger på Qwen 3.6 med 27 miljarder parametrar, presterade bättre än Anthropics Claude Opus 4.8 och OpenAI:s GPT 5.5 på att självständigt reproducera publicerade forskningsresultat.
Inherent hävdar att Faraday, som bygger på Qwen 3.6 med 27 miljarder parametrar, presterade bättre än Anthropics Claude Opus 4.8 och OpenAI:s GPT 5.5 på att självständigt reproducera publicerade forskningsresultat. Agentens särskilda roll är att styra forskningen: med förstärkningsinlärning har Inherent tränat Faraday i så kallad ”research taste” – att avgöra vilka experiment som är värda att genomföra och hur de bör utformas.
Inherent ser reproduktion av tidigare forskning som ett träningssteg mot AI forskare som i framtiden kan bidra till verkligt nya vetenskapliga upptäckter.