Inherent sostiene che Faraday, modello da 27 miliardi di parametri, abbia superato Claude Opus 4.8 e GPT 5.5 nella replica di risultati scientifici pubblicati, senza conoscere in anticipo la risposta. Il benchmark Replica comprende 310 attività ricavate da 100 articoli di machine learning e AI applicata alla scienza...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Inherent, laboratorio londinese di intelligenza artificiale fondato da ex ricercatori di Google DeepMind, afferma che il suo agente Faraday, basato su un modello da 27 miliardi di parametri, sia in grado di riprodurre i risultati di articoli scientifici pubblicati senza ricevere in anticipo la risposta. Secondo l’azienda, Faraday ha inoltre superato Claude Opus 4.8 di Anthropic e GPT-5.5 di OpenAI in questo specifico compito di replica della ricerca. 259
È un risultato potenzialmente rilevante, se confermato da valutazioni più ampie e indipendenti. Ma il titolo va ridimensionato: Faraday è stato testato sulla riproduzione di risultati già noti, non sulla scoperta autonoma di nuove conoscenze scientifiche.
Inherent ha creato Replica, un benchmark composto da 100 articoli di machine learning e di AI applicata alla scienza, trasformati in 310 attività di replica. In ciascuna prova, l’agente deve ricreare una figura specifica dell’articolo entro limiti di tempo e di potenza di calcolo, senza poter consultare il grafico originale. 34
Non si tratta quindi di chiedere a un modello di riassumere un paper o di copiare un grafico già pubblicato. L’agente deve interpretare la ricerca, implementare gli esperimenti necessari, decidere come impiegare le risorse disponibili e produrre un risultato abbastanza vicino a quello riportato dagli autori da poter essere considerato una replica.
Inherent sostiene che Faraday abbia superato Claude Opus 4.8 e GPT-5.5 in questo benchmark, pur utilizzando un modello da 27 miliardi di parametri, molto più piccolo dei sistemi di frontiera con cui è stato confrontato. 158 Il dato va però letto come un’affermazione legata a quel benchmark, non come una classifica generale delle capacità dei tre sistemi in ambito scientifico o di programmazione.
Per Inherent, fare buona scienza non significa soltanto arrivare a un risultato finale. Un ricercatore capace deve capire quali esperimenti valga la pena eseguire, progettarli in modo sensato, interpretare risultati ambigui e cambiare strategia quando un approccio non funziona. L’azienda riassume questo insieme di capacità con l’espressione inglese “research taste”, traducibile come «fiuto» o «giudizio per la ricerca». 47
La distinzione è importante perché un modello può produrre un risultato dall’aspetto plausibile senza aver seguito un processo scientifico affidabile. Inherent afferma di aver addestrato Faraday a sviluppare comportamenti utili nelle indagini di lungo periodo: formulare ipotesi, metterle alla prova, imparare dagli insuccessi e scegliere i passaggi successivi più produttivi. 4
Il reinforcement learning, cioè l’addestramento per rinforzo, dovrebbe servire proprio a sviluppare questo tipo di giudizio nel tempo, anziché ottimizzare soltanto la somiglianza superficiale tra l’output del modello e il risultato atteso. La replica di studi già pubblicati diventa così una palestra: per ricostruire un risultato, l’agente deve spesso recuperare una parte del tentativo e dell’errore pratici che un articolo non descrive nei dettagli.
La tesi più ampia di Inherent è che imparare a muoversi in questo processo possa aiutare gli agenti a passare, in futuro, dalla verifica di risultati noti a forme di ricerca più aperte. 49
Faraday non viene presentato come un sostituto autonomo di un potente agente di programmazione. Durante le attività di replica, svolge piuttosto il ruolo di livello scientifico di supervisione e dirige GPT-5.5 Codex, lo strumento di coding di OpenAI. Inherent paragona il sistema a uno scienziato umano che si avvale di un assistente per scrivere ed eseguire il codice: Faraday contribuisce alla pianificazione e al giudizio scientifico, mentre Codex svolge gran parte del lavoro operativo. 39
Questo approccio sposta l’attenzione dalla sola dimensione del modello. Un sistema più piccolo può aggiungere valore decidendo che cosa chiedere allo strumento più grande, quando cambiare tattica e come valutare i risultati ottenuti.
L’eventuale vantaggio di Faraday è quindi almeno in parte un vantaggio di orchestrazione: nasce dalla combinazione tra pianificazione scientifica e capacità di programmazione avanzata, non dimostra che il modello da 27 miliardi di parametri sia universalmente più capace dei sistemi più grandi.
Inherent dice di voler costruire agenti AI capaci di collaborare con i ricercatori come veri e propri compagni di squadra. Il sistema ideale dovrebbe aiutare a pianificare, eseguire, criticare e ripetere gli esperimenti, lasciando alle persone la direzione del lavoro e la supervisione. 45
Faraday è quindi meglio interpretato come una prima versione di questa idea: un modello addestrato a fornire intuizione scientifica e gestione del processo di ricerca sopra strumenti di programmazione generalisti. L’ambizione dichiarata nel lungo periodo è sviluppare agenti capaci di contribuire alla scoperta di nuove conoscenze, ma il risultato attuale riguarda la replica, non la scoperta. 34
Il confine è sostanziale. Riprodurre un risultato noto è un test prezioso di affidabilità scientifica, ma non dimostra da solo che un agente sappia formulare domande originali e importanti, generare ipotesi davvero nuove o validare scoperte nel mondo reale.
Inherent è uscita dalla modalità stealth con una raccolta seed dichiarata da 50 milioni di dollari e si presenta come un laboratorio londinese focalizzato sulla ricerca, fondato da ex membri di Google DeepMind. 25 La sua strategia consiste nel concentrarsi su capacità che i modelli generalisti potrebbero non sviluppare automaticamente: giudizio sperimentale, decisioni su orizzonti temporali lunghi, valutazione dei risultati e coordinamento tra ricercatori e strumenti software.
Anche la scelta di usare un sistema esterno per il coding riflette questa impostazione. Invece di concentrare ogni capacità in un unico modello, Inherent prova a costruire un livello specializzato che renda più efficaci gli strumenti AI di frontiera nel lavoro scientifico. 39
La conclusione, per ora, è prudente ma interessante: Inherent sostiene che un modello supervisore relativamente piccolo, addestrato con reinforcement learning, possa superare sistemi più grandi in un benchmark definito con precisione. La domanda decisiva resta aperta: questo approccio riuscirà a produrre contributi scientifici originali e affidabili, o sarà soprattutto un modo più efficace di verificare ciò che già conosciamo?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent sostiene che Faraday, modello da 27 miliardi di parametri, abbia superato Claude Opus 4.8 e GPT 5.5 nella replica di risultati scientifici pubblicati, senza conoscere in anticipo la risposta.
Inherent sostiene che Faraday, modello da 27 miliardi di parametri, abbia superato Claude Opus 4.8 e GPT 5.5 nella replica di risultati scientifici pubblicati, senza conoscere in anticipo la risposta. Il benchmark Replica comprende 310 attività ricavate da 100 articoli di machine learning e AI applicata alla scienza: l’agente deve ricreare una figura senza vedere il grafico originale.
Faraday fornisce pianificazione e giudizio scientifico, mentre usa GPT 5.5 Codex per gran parte dell’esecuzione e della programmazione.