Inherentin mukaan Qwen 3.6 malliin perustuva Faraday suoriutui Claude Opus 4.8:aa ja GPT 5.5:tä paremmin julkaistujen tutkimustulosten itsenäisessä toisintamisessa. Faradayn vahvuudeksi yhtiö nostaa niin sanotun tutkimusvaiston: kyvyn päättää, mitä kokeita kannattaa tehdä ja miten ne suunnitellaan.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Lontoolainen tekoälylaboratorio Inherent kertoo uuden Faraday-tutkimusagenttinsa päihittäneen Anthropic-yhtiön Claude Opus 4.8:n ja OpenAI:n GPT-5.5:n yhdessä tarkasti rajatussa tehtävässä: julkaistujen tieteellisten tutkimusten tulosten itsenäisessä toisintamisessa. Agentille ei annettu oikeaa vastausta etukäteen, vaan sen piti päätellä tutkimuksen menetelmä ja rakentaa kokeet uudelleen itse. 25
Väitteessä on yksi olennainen rajaus. Kyse on Inherentin ilmoittamasta tuloksesta tutkimusten toisintamiseen keskittyvässä arvioinnissa – ei riippumattomasti vahvistetusta johtopäätöksestä, jonka mukaan Faraday olisi yleisesti Claudea tai GPT-5.5:tä kyvykkäämpi tekoälymalli.
Vertailu koski tieteellistä toisintamista. Agentti saa eteensä julkaistun tutkimuksen ja yrittää tuottaa riittävän osan työstä uudelleen, jotta alkuperäiset havainnot voidaan saavuttaa. Tehtävä eroaa esimerkiksi tutkimuksen tiivistämisestä tai ennalta tunnetun vastauksen ennustamisesta.
Teknisen kuvauksen mukaan Replica-arviointi koostuu 310 tehtävästä, joissa tavoitteena on toisintaa tieteellisissä julkaisuissa esitettyjä kuvioita ja tuloksia. 8 Tällainen testi voi paljastaa hyödyllisiä kykyjä tutkimustyössä, mutta se ei vielä kerro suorituskyvystä yleisessä päättelyssä, ohjelmoinnissa, kirjoittamisessa tai uuden tieteen tekemisessä.
Faraday perustuu Qwen 3.6 -malliin, jossa on 27 miljardia parametria. Se on huomattavasti pienempi perusta kuin vertailussa käytetyillä suurilla, niin sanotuilla eturintaman malleilla. 15
Inherent ei siis väitä, että Qwen 3.6 yksin olisi korvannut markkinoiden johtavat yleismallit. Faraday on kokonainen agenttijärjestelmä, jonka tulokseen vaikuttavat perusmallin lisäksi jälkikoulutus, tutkimuksen työnkulku, työkalujen käyttö sekä suunnittelun ja toteutuksen välinen työnjako.
Tässä piilee yhtiön strateginen ajatus: pienempi perusmalli voi pärjätä suuressa mallissa, jos sen ympärille rakennettu järjestelmä on optimoitu tiettyä tehtävää varten. Inherent pyrkii kouluttamaan Faradaysta tutkimuksen ohjaajan, joka osaa tehdä järkeviä kokeellisia valintoja ja hyödyntää erikoistuneita työkaluja.
Inherent kuvaa tavoiteltua ominaisuutta englanninkielisellä ilmauksella research taste, jonka voisi suomentaa tutkimusvaistoksi tai tutkimukselliseksi harkinnaksi. Sillä tarkoitetaan kykyä arvioida, mitkä kokeet ovat vaivan arvoisia, miten ne kannattaa suunnitella, milloin tulokset jäävät epäselviksi ja milloin tutkimussuuntaa pitäisi vaihtaa. 4
Yhtiö kertoo käyttäneensä vahvistusoppimista tämän käyttäytymisen kehittämiseen. Mallille ei siis pyritä määräämään jokaista työvaihetta etukäteen, vaan sitä palkitaan tutkimusprosessin ja lopputuloksen laadusta. Tavoite on erilainen kuin lyhyessä kysymys–vastaus-testissä, jossa oikea vastaus on jo määritelty.
Faraday ei myöskään tee kaikkea käytännön toteutusta itse. Se voi käyttää ohjelmointiin tarkoitettuja agentteja, kuten OpenAI:n GPT-5.5 Codexia, työkaluina. Faraday toimii tällöin enemmän tutkimusjohtajana: se suunnittelee tieteellisen lähestymistavan ja tekee keskeisiä päätöksiä, kun taas erikoistunut koodausjärjestelmä auttaa muuttamaan suunnitelman suoritettaviksi kokeiksi. 6
Siksi vertailua on tulkittava kokonaisen työnkulun tasolla. Inherentin ilmoittama etu kuuluu Faraday-agentille, ei välttämättä sen 27 miljardin parametrin perusmallille yksinään.
Valmiin tutkimuksen toisintaminen tarjoaa tekoälylle konkreettisen tavan harjoitella tieteellistä työtä. Agentin täytyy tulkita julkaisu, muodostaa oletuksia menetelmän toiminnasta, valita kokeita, käsitellä epäonnistuneita yrityksiä ja verrata lopputulosta alkuperäisiin havaintoihin.
Julkaistu tutkimus kertoo yleensä vain osan siitä työstä, joka johti lopulliseen tulokseen. Kokeilu ja erehdys, hylätyt lähestymistavat ja käytännön kompromissit jäävät usein artikkelin ulkopuolelle. Näiden piiloon jäävien vaiheiden rekonstruointi voi tarjota kontrolloidun harjoituskentän tieteelliselle päättelylle. 5
Toisintamista on myös helpompi arvioida kuin aidosti uutta löytöä. Tehtävällä on ulkoinen tavoite: voidaan tutkia, onnistuiko agentti saavuttamaan julkaistun tuloksen ja olivatko sen kokeelliset ratkaisut tieteellisesti perusteltuja. Se tekee toisintamisesta luontevan välivaiheen ennen tehtäviä, joissa vastausta ei vielä tiedetä.
Inherent ei pidä tutkimusten toisintamista päätepisteenä. Yhtiö kuvaa Faradayn varhaiseksi askeleeksi kohti tekoälytutkijoita, jotka voisivat työskennellä eri tieteenaloilla ja auttaa tuottamaan aidosti uutta tietoa. 13
Tämä on huomattavasti suurempi tavoite kuin yhden testin voittaminen. Julkaistun tuloksen toisintaminen osoittaa hyödyllistä tutkimuskäyttäytymistä, mutta alkuperäinen tieteellinen löytö edellyttää myös kiinnostavien avoimien kysymysten tunnistamista, uusien hypoteesien kehittämistä, luotettavien testien suunnittelua ja tuloksia, jotka kestävät asiantuntijoiden tarkastelun.
Faradayn arviointi onkin parasta nähdä yhtenä osana tätä kehityspolkua – ei todisteena siitä, että autonominen tieteellinen löytö olisi jo ratkaistu ongelma.
Inherent nousi hiljattain julkisuuteen 50 miljoonan dollarin siemenrahoituksella. Yhtiö toimii Lontoossa ja aikoo kasvattaa henkilöstöään noin tusinasta noin 20–25 työntekijään. 5 Suunnitelma viittaa pieneen ja tutkimuspainotteiseen organisaatioon, ei kilpailuun suurimpien tekoälylaboratorioiden henkilöstö- tai mallikoulutusbudjeteilla.
Yksi perustajista ja yhtiön päätutkija Edward Hughes on arvostellut Britannian garden leave -käytäntöä. Sillä tarkoitetaan työntekijän irtisanomisajan jaksoa, jolloin hän ei yleensä saa aloittaa uudessa työssä. Rajoitukset voivat hidastaa tutkijoiden siirtymistä työnantajalta toiselle tai startup-yrityksiin.
Inherent pitää tätä kilpailutekijänä, kun se yrittää rekrytoida kokeneita tekoälytutkijoita muun muassa DeepMindista ja kilpailee paremmin rahoitettujen yritysten kanssa. 6
Yhtiön strategia on siten keskittynyt eikä perustu pelkkään kokoon: pieni tiimi, vahvistusoppiminen, tieteellinen harkinta ja ulkopuoliset ohjelmointityökalut yhdistetään suhteellisen kompaktiin perusmalliin. Jos lähestymistapa toimii myös alkuperäistä arviointia laajemmin, se voi tarjota startup-yrityksille uuden tavan kilpailla tekoälytutkimuksessa ilman markkinoiden suurimman mallin rakentamista.
Inherent sanoo Faradayn suoriutuneen julkaistujen tieteellisten tulosten itsenäisessä toisintamisessa paremmin kuin GPT-5.5 ja Claude Opus 4.8, vaikka järjestelmän perusta on vain 27 miljardin parametrin Qwen 3.6 -malli.
Kiinnostavin johtopäätös ei kuitenkaan ole yksinkertaisesti se, että pieni malli voitti suuremmat kilpailijansa. Tapaus nostaa esiin ajatuksen, että tutkimuksen suunnittelu, pitkän aikavälin vahvistusoppiminen ja työkalujen koordinointi voivat olla tieteellisessä työssä yhtä tärkeitä kuin mallin koko.
Nykyinen näyttö tukee silti vain rajatumpaa päätelmää: Faraday vaikuttaa lupaavalta tutkimusagentilta Inherentin arvioimassa toisintamistehtävässä. Se ei osoita yleistä ylivoimaa Anthropicin tai OpenAI:n malleihin nähden, eikä tutkimuksen toisintaminen yksinään tarkoita, että järjestelmä osaisi tehdä autonomisesti uusia tieteellisiä löytöjä.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherentin mukaan Qwen 3.6 malliin perustuva Faraday suoriutui Claude Opus 4.8:aa ja GPT 5.5:tä paremmin julkaistujen tutkimustulosten itsenäisessä toisintamisessa.
Inherentin mukaan Qwen 3.6 malliin perustuva Faraday suoriutui Claude Opus 4.8:aa ja GPT 5.5:tä paremmin julkaistujen tutkimustulosten itsenäisessä toisintamisessa. Faradayn vahvuudeksi yhtiö nostaa niin sanotun tutkimusvaiston: kyvyn päättää, mitä kokeita kannattaa tehdä ja miten ne suunnitellaan.
Tulos kertoo erikoistuneen agenttijärjestelmän suorituskyvystä, ei siitä, että Faraday olisi yleisesti Claudea tai GPT 5.5:tä kyvykkäämpi.