Inherent hævder, at Faraday, som bygger på Qwen 3.6 med 27 milliarder parametre, klarede sig bedre end Anthropic’s Claude Opus 4.8 og OpenAI’s GPT 5.5 i en specifik test af videnskabelig reproduktion. Faradays særlige rolle er at lede forskningen: Ved hjælp af reinforcement learning er agenten trænet til at vurdere,...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Det London-baserede AI-laboratorium Inherent, der er grundlagt af tidligere Google DeepMind-forskere, siger, at den nyudgivne agent Faraday har slået Anthropic’s Claude Opus 4.8 og OpenAI’s GPT-5.5 i en afgrænset opgave: selvstændigt at genskabe resultater fra offentliggjorte videnskabelige artikler uden at få svaret på forhånd. 25
Det opsigtsvækkende er, at Faraday bygger på Qwen 3.6, en forholdsvis lille model med 27 milliarder parametre, og ikke på et af de meget større frontlinjesystemer fra OpenAI eller Anthropic. 15
Der er dog en vigtig begrænsning: Resultatet er Inherents egen rapportering fra en test af reproduktion af forskning. Det er ikke i sig selv dokumentation for, at Faraday generelt er en mere kapabel model end Claude eller GPT-5.5.
Opgaven handlede om videnskabelig reproduktion. En agent får en offentliggjort undersøgelse og skal rekonstruere tilstrækkeligt af forskernes arbejde til at genskabe resultaterne. Den skal altså ikke blot opsummere artiklen eller gætte et kendt facit.
Inherent siger, at Faraday klarede sig bedre end Claude Opus 4.8 og GPT-5.5 i denne sammenhæng. 5 Den tekniske beskrivelse af evalueringen omtaler Replica som en benchmark med 310 opgaver, der fokuserer på at genskabe figurer fra videnskabelige undersøgelser. 8
Det er en vigtig detalje. En agent kan være særdeles stærk i et afgrænset forskningsforløb uden dermed at være bedst til generel problemløsning, programmering, tekstproduktion eller egentlig videnskabelig opdagelse.
Faraday kører på Qwen 3.6 med 27 milliarder parametre. Inherent fremhæver størrelsesforskellen mellem denne model og de langt større systemer, som agenten blev sammenlignet med. 15
Pointen er dog ikke, at Qwen 3.6 alene har erstattet de førende generelle AI-modeller. Faraday er et samlet agentsystem, hvor resultatet også afhænger af eftertræning, arbejdsproces, værktøjsbrug og fordelingen mellem planlægning og udførelse.
En mindre grundmodel kan derfor godt konkurrere på en specialiseret opgave, hvis systemet omkring den er optimeret til netop denne opgave. Inherent satser på, at en kompakt model med bedre videnskabelig styring kan koordinere specialiserede værktøjer og træffe mere nyttige eksperimentelle beslutninger.
Inherent beskriver den ønskede evne som “research taste” – på dansk nogenlunde forskningsmæssig dømmekraft. Det handler om at kunne vurdere, hvilke eksperimenter der er værd at gennemføre, hvordan de bør designes, hvornår et resultat er uklart, og hvornår man bør skifte retning. 4
Virksomheden siger, at den har brugt reinforcement learning, altså forstærkende læring, til at udvikle denne adfærd. I stedet for at diktere hvert enkelt trin belønner træningen kvaliteten af den samlede forskningsproces og dens resultat.
Det adskiller sig fra at optimere en model til en kort benchmarkopgave, hvor det korrekte svar allerede er defineret.
Faraday behøver heller ikke selv at udføre alle praktiske trin. Agenten kan bruge kodeagenter – blandt andet OpenAI’s GPT-5.5 Codex – som værktøjer. Faradays rolle bliver dermed mere som en forskningsleder: Den lægger den videnskabelige plan og træffer de overordnede valg, mens et specialiseret kodesystem hjælper med at omsætte planen til konkrete eksperimenter. 6
Sammenligningen skal derfor læses med nuancer. Den rapporterede fordel tilhører den komplette agentarbejdsgang og ikke nødvendigvis Qwen-modellen isoleret set.
At reproducere en undersøgelse giver en AI-forsker en konkret måde at øve sig på. Agenten skal fortolke en artikel, opstille hypoteser om metoden, vælge eksperimenter, håndtere mislykkede forsøg og sammenholde sine resultater med de offentliggjorte resultater.
Inherents grundidé er, at den færdige artikel kun viser en lille del af arbejdet. Forsøgende og fejlslagne tilgange, fravalgte metoder og praktiske beslutninger er ofte ikke med i den endelige tekst. Ved at rekonstruere denne skjulte proces kan en agent få et kontrolleret træningsområde for videnskabelig tænkning. 5
Reproduktion er samtidig nemmere at evaluere end ægte ny forskning. Der findes et eksternt mål: Man kan undersøge, om agenten genskaber resultatet, og om dens eksperimentelle valg er videnskabeligt forsvarlige.
Det gør opgaven til et muligt mellemtrin, før man beder en AI om at undersøge spørgsmål, hvis svar endnu ikke er kendt.
Inherent beskriver ikke reproduktion af artikler som slutmålet. Virksomheden ser Faraday som et tidligt skridt mod AI-forskere, der kan arbejde på tværs af videnskabelige områder og på længere sigt bidrage til at skabe ny viden. 13
Det er en langt større ambition end at vinde en benchmark. En agent, der kan genskabe et offentliggjort resultat, demonstrerer nyttig forskningsadfærd. Original forskning kræver imidlertid også, at systemet kan finde værdifulde ubesvarede spørgsmål, formulere nye hypoteser, designe pålidelige tests og levere resultater, der kan tåle faglig kontrol.
Faraday-testen bør derfor ses som dokumentation for én del af denne udvikling – ikke som bevis på, at målet om autonom videnskabelig opdagelse allerede er nået.
Inherent kom ud af stealth-fasen med en rapporteret seed-investering på 50 millioner dollar og bygger virksomheden i London. 5 Startupvirksomheden skulle efter planen vokse fra omkring et dusin ansatte til cirka 20-25 personer. Det peger på en lille, forskningsintensiv organisation frem for et kapløb om at matche de største AI-laboratoriers medarbejderstyrke og træningsbudgetter.
Medstifter og chefforsker Edward Hughes har kritiseret Storbritanniens regler om “garden leave”. Begrebet dækker over perioder, hvor en medarbejder efter sin opsigelse fortsat er ansat, men ikke må begynde hos en konkurrent. Ifølge Inherent kan sådanne begrænsninger gøre det langsommere for erfarne AI-forskere at skifte til en startup. 6
Det er relevant i konkurrencen om medarbejdere med baggrund i DeepMind, især når en mindre virksomhed skal konkurrere med bedre finansierede selskaber.
Strategien er derfor fokuseret snarere end skaleret: Et lille team investerer i reinforcement learning og videnskabelig dømmekraft og kombinerer en mindre grundmodel med stadig bedre eksterne værktøjer. Hvis tilgangen også fungerer uden for den første evaluering, kan den give startups en anden måde at konkurrere på end blot at træne markedets største model.
Inherent siger, at Faraday klarede sig bedre end GPT-5.5 og Claude Opus 4.8 til selvstændigt at genskabe offentliggjorte videnskabelige resultater – på trods af at agenten bygger på en Qwen 3.6-model med 27 milliarder parametre.
Den mere interessante pointe er ikke kun, at en mindre model vandt en sammenligning. Det er også, at forskningsplanlægning, langsigtet reinforcement learning og koordinering af værktøjer kan være lige så vigtigt som rå modelstørrelse i videnskabeligt arbejde.
Indtil videre understøtter evidensen en mere snæver konklusion: Faraday ser lovende ud som forskningsagent på den opgave, Inherent har evalueret. Resultatet dokumenterer ikke en generel overlegenhed over Anthropics eller OpenAIs modeller, og reproduktion af eksisterende forskning er ikke det samme som selvstændig videnskabelig opdagelse.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent hævder, at Faraday, som bygger på Qwen 3.6 med 27 milliarder parametre, klarede sig bedre end Anthropic’s Claude Opus 4.8 og OpenAI’s GPT 5.5 i en specifik test af videnskabelig reproduktion.
Inherent hævder, at Faraday, som bygger på Qwen 3.6 med 27 milliarder parametre, klarede sig bedre end Anthropic’s Claude Opus 4.8 og OpenAI’s GPT 5.5 i en specifik test af videnskabelig reproduktion. Faradays særlige rolle er at lede forskningen: Ved hjælp af reinforcement learning er agenten trænet til at vurdere, hvilke eksperimenter der er værd at gennemføre, mens værktøjer som GPT 5.5 Codex kan håndtere kodnin...
Inherent ser reproduktion af eksisterende forskning som træning på vejen mod AI forskere, der på længere sigt kan bidrage til at skabe ny videnskabelig viden.