Inherent 表示,27B 參數的 Faraday 在特定研究複現任務上勝過 Claude Opus 4.8 與 GPT 5.5;但這項結果尚未證明 Faraday 能獨立提出並驗證新的科學發現。[2][5][9] Faraday 透過長時程強化學習訓練,並在 Replica 基準上重現 100 篇機器學習與 AI for Science 論文中的 310 項任務;代理必須在有限時間與算力下重畫論文圖表,且不能查看原始圖表。[3][4] Faraday 並非自行包辦所有程式撰寫,而是提供科學規劃與判斷,指揮 OpenAI 的 GPT 5.5 Codex 執行大量編碼工作。[3][9]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
倫敦 AI 實驗室 Inherent 近日推出 Faraday,宣稱這個擁有 270 億參數的 AI 科學代理,能在事前不知道答案的情況下,重現已發表科學論文中的研究結果。公司並表示,Faraday 在這項特定任務上擊敗了 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.5。259
如果這項結果能在更大規模、由獨立團隊進行的測試中成立,確實值得關注。不過,標題中的「擊敗」應該加上清楚的限定:Faraday 目前展示的是複現既有研究成果,而不是獨立發現全新的科學知識。
Inherent 建立了名為 Replica 的基準,內容涵蓋 100 篇機器學習與 AI for Science 論文,並轉換為 310 項複現任務。每項任務都要求 AI 代理從論文內容出發,在有限時間與算力下,重現其中一張研究圖表;代理不能直接查看論文原本的圖表。34
這並不是單純要求模型摘要論文,或把已發表的圖表照抄一次。代理必須先理解研究方法,再撰寫並執行必要的實驗,判斷有限資源應該用在哪裡,最後產出足夠接近原始研究結果的圖表,才算完成複現。
Inherent 表示,Faraday 在 Replica 上的表現優於 Claude Opus 4.8 與 GPT-5.5,儘管它本身只使用 270 億參數的模型。158 這項比較應被理解為基準測試中的結果,而不是對三個系統在所有科學、程式設計或推理工作上的全面排名。
Inherent 的核心論點是,科學研究不只是得到一個看似正確的最終結果。研究者還需要判斷哪些實驗值得進行、如何設計實驗、怎麼解讀模糊或不完整的結果,以及在方法失敗時何時調整方向。公司把這一整套判斷能力稱為「研究品味」(research taste)。47
這個差異相當重要。AI 可能產出外觀合理的圖表,卻未必採用了可靠的研究流程。Inherent 表示,Faraday 透過長時程強化學習,訓練的是更具延續性的調查能力:提出假說、測試不同方法、從失敗中學習,並選擇下一個更有希望的步驟。4
在公司構想中,複現研究正好提供了訓練這類能力的環境。論文通常不會完整記錄研究過程中的所有試錯;要重現論文結果,AI 往往必須自行補回那些未被明寫的實務判斷。Inherent 認為,若代理能掌握這種研究流程,未來或許能從驗證既有成果,逐步走向更開放式的研究工作。49
但「或許」仍是關鍵字。複現已知結果是衡量科學可靠度的重要測試,卻不能單獨證明 AI 能提出重要的原創問題、生成真正新穎的假說,或在現實世界中驗證新發現。
Faraday 並不是一個完全獨立、取代強大程式設計代理的系統。它扮演的是上層的科學監督角色,負責在複現任務中指揮 OpenAI 的 GPT-5.5 Codex。Inherent 將這種架構比喻為人類科學家使用程式設計助理:Faraday 提供規劃與科學判斷,Codex 則處理大量實作工作。39
這使得焦點不再只是模型有多少參數。較小的模型也可能透過決定大型工具該做什麼、何時更換策略,以及如何評估結果,創造額外價值。因此,Faraday 所宣稱的優勢,部分來自「協調與編排」能力——也就是科學規劃和前沿程式設計能力的結合——而不是證明 270 億參數模型在所有工作上都比更大型系統更強。
Inherent 表示,公司希望建立能與研究人員合作的 AI 代理,像團隊中的科學隊友一樣協助規劃、執行、批判與反覆調整實驗,同時由人類保留研究方向與監督權。45
從這個角度看,Faraday 比較像是這項構想的早期版本:它把科學直覺與研究管理能力,疊加在通用程式設計工具之上。公司的長期目標,是讓 AI 代理能參與新知識的發現;但目前公開的成果仍停留在研究複現,而非科學發現。34
這條界線不能被忽略。能在不知道答案的前提下重現論文結果,代表代理可能具備一定程度的研究理解與執行能力;但要成為真正的科學夥伴,還必須面對原創性、可驗證性、跨領域遷移,以及現實實驗條件等更高難度問題。
Inherent 是一家位於倫敦、由 Google DeepMind 校友創立的 AI 實驗室,從隱身模式現身時據報完成 5,000 萬美元種子輪融資。25 它沒有把重點放在打造一個包辦所有能力的單一巨型模型,而是聚焦於通用模型未必能自動掌握的部分:實驗判斷、長期決策、研究評估,以及人類與軟體工具之間的協作。34
Faraday 使用外部程式設計系統,也反映了這種取捨。Inherent 試圖訓練一個專門負責科學判斷的上層模型,讓現有的前沿工具更有效地服務研究工作,而不是自行重建每一項能力。39
目前較穩妥的結論是:Inherent 宣稱,一個相對小型、經長時程強化學習訓練的監督模型,能在定義明確的研究複現基準上勝過更大型的前沿系統。這說明模型規模之外,研究規劃與工具編排也可能是 AI 科學代理的重要能力。
至於這套方法能否進一步帶來可靠、原創的科學貢獻,則仍需要更廣泛的基準、獨立複驗,以及真正開放式研究任務來回答。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Inherent 表示,27B 參數的 Faraday 在特定研究複現任務上勝過 Claude Opus 4.8 與 GPT 5.5;但這項結果尚未證明 Faraday 能獨立提出並驗證新的科學發現。[2][5][9]
Inherent 表示,27B 參數的 Faraday 在特定研究複現任務上勝過 Claude Opus 4.8 與 GPT 5.5;但這項結果尚未證明 Faraday 能獨立提出並驗證新的科學發現。[2][5][9] Faraday 透過長時程強化學習訓練,並在 Replica 基準上重現 100 篇機器學習與 AI for Science 論文中的 310 項任務;代理必須在有限時間與算力下重畫論文圖表,且不能查看原始圖表。[3][4]
Faraday 並非自行包辦所有程式撰寫,而是提供科學規劃與判斷,指揮 OpenAI 的 GPT 5.5 Codex 執行大量編碼工作。[3][9]