
Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
倫敦 AI 實驗室 Inherent 宣稱,新推出的研究代理人 Faraday 在一項特定任務中,擊敗 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT-5.5:不先知道答案,仍能獨立重現已發表科學論文中的研究結果。25
這項消息之所以受到關注,並不只是因為「小模型擊敗大模型」,而是 Faraday 的底層模型 Qwen 3.6 只有 270 億參數,與用來比較的前沿級系統相比,規模小得多。15
不過,這裡的關鍵限定不能省略:上述結果是 Inherent 對特定論文重現評測所做的公布,並不等於已經獨立證明 Faraday 在整體推理、寫作、編程或科學發現能力上都優於 Claude 或 GPT-5.5。
這場比較聚焦於「科學研究重現」。代理人拿到一篇已發表的研究,必須理解其中的方法,重新規劃並執行足夠的實驗,最後重現論文中的發現,而不是單純摘要內容,或猜測一個已知答案。5
技術資料將這項評測稱為 Replica,包含 310 項、以重現科學圖表為主的任務。8 這種設計能檢驗代理人是否具備解讀研究、提出假設、安排實驗、處理失敗並比對結果的能力;但它仍是一個範圍明確的研究工作流程,不能直接推論到所有通用 AI 任務。
Faraday 建立在 Qwen 3.6 的 270 億參數版本之上。Inherent 強調,這與拿來比較的 Claude Opus 4.8 和 GPT-5.5 形成明顯的模型規模差距。15
但更準確的解讀不是「Qwen 3.6 單獨取代了頂尖通用模型」,而是:在一項專門研究任務中,小型基礎模型若搭配合適的後訓練、工作流程、工具與代理架構,可能勝過規模更大的競爭系統。
Faraday 的成績來自完整的代理人系統,而非 27B 模型裸機運作的結果。它負責研究規劃與判斷,再把部分實作工作交給更適合編程的工具。這也正是 Inherent 的策略核心:不盲目追求最大的通用模型,而是嘗試用更精準的科學指揮能力,放大小型模型的效用。
Inherent 將目標能力稱為「研究品味」(research taste):研究者能判斷哪些實驗值得投入、如何設計實驗、何時結果仍不足以下結論,以及何時應該改變方向。4
這類能力很難靠一份有固定答案的短題目完整衡量。公司表示,它使用強化學習來訓練 Faraday,重點不是規定代理人每一步該怎麼做,而是根據最終研究流程與成果給予回饋,讓系統逐步學習更好的實驗選擇與研究策略。
Faraday 也不必親自完成所有編程工作。它可以把 OpenAI 的 GPT-5.5 Codex 等編程代理當成工具:Faraday 比較像研究主任,負責提出方向、安排方法與做出判斷;專業編程系統則協助把計畫轉化為可執行的實驗。6
因此,Faraday 所謂的「勝出」應理解為整套研究代理流程的成果,而不是單純表示其底層 27B 模型在所有面向都比對手更強。
一篇完成的論文通常只呈現最後的方法和結果,研究過程中反覆試錯、被放棄的方向,以及許多實務判斷,往往不會完整寫進去。對 AI 代理人而言,重現研究成果等於要設法補回這段隱藏的過程。5
這使論文重現成為一種相對可控的科學訓練:代理人必須讀懂研究、提出假設、選擇實驗、面對失敗,再檢查自己的結果是否與原研究一致。由於原論文提供了外部參照,評測者也較容易判斷代理人的成果是否成功,以及實驗決策是否合理。
Inherent 因此把重現視為邁向 AI 科學家的起點,而非終點。先學會可靠地重新建立已知成果,再進一步處理答案尚未存在的問題,是從研究助理走向自主研究者的一條可能路徑。
Inherent 的長期目標,是打造能跨不同科學領域工作的 AI 科學家,最終協助產生真正的新知識。13
但「重現一項已發表結果」與「發現新科學」之間仍有很大距離。後者還需要找出值得研究、但尚未解答的問題,提出新假設,設計可靠的驗證方法,並產出能經得起專家與後續研究檢驗的結果。
所以,Faraday 這次的評測較適合被視為其中一塊拼圖:它顯示研究規劃、長時間跨度的強化學習與工具協作可能具有價值,但尚未證明 AI 科學家的完整願景已經實現。
Inherent 由前 Google DeepMind 研究人員創立,據報在結束「隱身模式」後取得 5,000 萬美元種子輪融資,並在倫敦建立團隊。5 公司目前約有十多人,計畫擴大至約 20 至 25 人,顯示它更傾向以小而密集的研究團隊推進,而非與大型 AI 實驗室比拚人數或模型訓練預算。
共同創辦人兼首席科學家 Edward Hughes 曾批評英國的 garden leave 制度。這類離職後限制可能延後研究人員轉職,或加入新創公司的時間;對 Inherent 而言,在爭取 DeepMind 等地的資深 AI 人才時,這會成為與資金更充足的公司競爭時必須面對的問題。6
這也勾勒出 Inherent 的整體押注:以精簡的倫敦團隊,集中投資強化學習與科學判斷,再結合日益強大的外部編程工具,尋找不必自行訓練最大模型也能參與 AI 科學競賽的方法。
Inherent 表示,Faraday 以 Qwen 3.6 的 270 億參數模型為基礎,在獨立重現已發表科學研究成果的任務上勝過 GPT-5.5 與 Claude Opus 4.8。真正值得關注的,或許不是一個小模型在單一比較中勝出,而是研究規劃、長期訓練與工具協作,可能與參數規模同樣影響 AI 在科學工作的表現。
就目前證據而言,較穩妥的結論是:Faraday 在 Inherent 評估的論文重現任務上展現潛力。這項結果尚不足以證明它全面優於 OpenAI 或 Anthropic 的模型,也不能僅憑研究重現就宣稱它已具備自主科學發現能力。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Inherent 表示,基於 270 億參數 Qwen 3.6 的 Faraday,在不預先取得答案的情況下,獨立重現已發表科學研究成果,表現勝過 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT 5.5。[2][5]
Inherent 表示,基於 270 億參數 Qwen 3.6 的 Faraday,在不預先取得答案的情況下,獨立重現已發表科學研究成果,表現勝過 Anthropic 的 Claude Opus 4.8 與 OpenAI 的 GPT 5.5。[2][5] Faraday 的關鍵不只是底層模型,而是透過強化學習培養所謂的「研究品味」:判斷哪些實驗值得做、如何設計,以及何時調整方向;GPT 5.5 Codex 等編程代理則可作為執行工具。[4][6]
Inherent 把論文重現視為 AI 科學家的訓練起點,長期目標是讓 AI 跨領域協助產生真正的新科學知識;目前結果仍不足以證明 Faraday 在一般能力上全面領先競爭模型。