Inherent 表示,270 億參數嘅 Faraday 喺研究複現任務中勝過 Claude Opus 4.8 同 GPT 5.5;不過呢個結果未證明 Faraday 可以獨立作出新科學發現。 Faraday 透過長程強化學習訓練,喺 Replica 基準中,根據已發表嘅機器學習及 AI 科學論文重現圖表,而且事前睇唔到原圖。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
倫敦 AI 實驗室 Inherent 表示,旗下 270 億參數 AI 代理 Faraday,可以喺事前唔知道答案嘅情況下,重現已發表科學論文入面嘅研究結果。公司又指,Faraday 喺呢項特定嘅研究複現任務中,表現勝過 Anthropic 嘅 Claude Opus 4.8 同 OpenAI 嘅 GPT-5.5。 259
如果之後有更大規模、由獨立團隊進行嘅測試確認,呢個結果會相當值得注意。不過,標題所講嘅「擊敗」要睇清楚範圍:今次測試係複現已知結果,唔係由零開始發現全新科學知識。
Inherent 建立咗 Replica 基準,收錄 100 篇機器學習及 AI for Science 論文,再整理成 310 個複現任務。每個任務要求 AI 代理,喺有限時間同計算資源之下,根據論文內容重現其中一幅圖表,而且唔可以直接睇原本嘅圖。 34
所以,呢個挑戰唔係叫模型簡單解釋一篇論文,或者照抄一張已發表圖表。代理要先理解研究內容,再自行寫程式、設計同執行必要實驗、分配有限資源,最後整出一個足夠接近原研究結果嘅版本,先算複現成功。
Inherent 表示,Faraday 喺呢個基準上超越 Claude Opus 4.8 同 GPT-5.5,儘管佢使用嘅模型規模只有 270 億參數。 158 不過,呢個比較應該理解為針對 Replica 嘅基準測試結果,唔可以直接當成 Faraday 喺所有科學研究或程式編寫工作上都全面勝過對手。
Inherent 認為,做好科學研究唔係淨係追求最後幅圖表似唔似。真正有能力嘅研究者,仲要識判斷邊啲實驗值得做、點樣合理設計實驗、點樣解讀含糊結果,以及一條路行唔通時幾時應該轉方向。公司將呢一系列判斷力稱為「研究品味」(research taste)。 47
呢個分別相當重要,因為一個模型就算整到一個睇落合理嘅結果,都唔代表佢係用可靠嘅科學方法得出答案。Inherent 表示,Faraday 透過長程強化學習,訓練形成較長線嘅研究行為,包括提出假設、測試方法、從失敗中吸取經驗,再揀下一步最有機會成功嘅實驗。 4
公司將研究複現視為訓練呢種能力嘅起點。要重現一項已發表結果,代理往往要自己摸索論文未必完整記錄嘅實際試錯過程。Inherent 嘅較大構想係,如果 AI 學識點樣處理呢種研究流程,將來或有機會由「驗證已知結果」逐步走向更加開放式嘅研究。 49
Faraday 並唔係一個完全獨立、取代大型編程代理嘅系統。喺複現任務入面,Faraday 充當上層嘅科學監督模型,負責指揮 OpenAI 嘅 GPT-5.5 Codex。Inherent 將兩者嘅關係比喻成人類科學家使用編程助手:Faraday 負責規劃同科學判斷,Codex 就處理大量實作工作。 39
呢種設計令焦點由「模型有幾大」轉向「模型點樣協作」。一個較細嘅模型,仍然可以透過決定大型工具要做乜、幾時改策略,以及點樣評估結果,發揮關鍵作用。
因此,Faraday 聲稱嘅優勢,部分其實係編排同協調能力:將科學規劃同前沿編程能力結合,而唔係證明一個 270 億參數模型本身喺所有方面都比更大型系統強。
Inherent 表示,公司想建立嘅係可以同研究人員合作嘅 AI「隊友」。理想狀態下,系統可以協助規劃、執行、批判同反覆修改實驗,但研究方向同監督仍然由人類掌握。 45
Faraday 可以視為呢個構想嘅早期版本:將科學直覺同研究管理能力,加到一般用途嘅編程工具之上。公司長遠希望建立可以協助發現新知識嘅 AI 代理,但目前展示到嘅,仍然係研究複現,而唔係科學發現。 34
呢條界線唔可以忽略。複現已知結果,係測試 AI 科學可靠性嘅重要一關;但單靠複現成功,仍然唔足以證明代理可以提出重要而原創嘅問題、產生真正新穎嘅假設,或者喺現實世界驗證新發現。
Inherent 係一間位於倫敦、由 Google DeepMind 前員工創立嘅 AI 實驗室,據報喺由隱身模式出現時完成咗 5,000 萬美元種子輪融資。 25 公司將重點放喺一般大型模型未必會自動掌握嘅能力,包括實驗判斷、長線決策、研究評估,以及人類同軟件工具之間嘅協作。
呢個策略亦解釋咗點解 Faraday 會使用外部編程系統。Inherent 並非試圖將所有能力塞入同一個模型,而係訓練一層專門嘅科學監督能力,令現有前沿工具更適合處理研究工作。 39
目前最穩妥嘅結論係:Inherent 聲稱,一個相對細小、以強化學習訓練嘅監督模型,可以喺一個定義清晰嘅研究複現基準上,勝過更大型嘅前沿系統。至於呢種方法最終能唔能夠帶來可靠、原創嘅科學貢獻,答案仍然有待更廣泛而獨立嘅驗證。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Inherent 表示,270 億參數嘅 Faraday 喺研究複現任務中勝過 Claude Opus 4.8 同 GPT 5.5;不過呢個結果未證明 Faraday 可以獨立作出新科學發現。
Inherent 表示,270 億參數嘅 Faraday 喺研究複現任務中勝過 Claude Opus 4.8 同 GPT 5.5;不過呢個結果未證明 Faraday 可以獨立作出新科學發現。 Faraday 透過長程強化學習訓練,喺 Replica 基準中,根據已發表嘅機器學習及 AI 科學論文重現圖表,而且事前睇唔到原圖。
Faraday 並非單打獨鬥,而係負責科學規劃同判斷,再指揮 GPT 5.5 Codex 執行大量編程工作。