Inherent 稱,以 270 億參數 Qwen 3.6 為核心的 Faraday,在獨立重現已發表研究結果的任務上,表現優於 Anthropic Claude Opus 4.8 及 OpenAI GPT 5.5。 Faraday 的重點不只在答中答案,而是透過強化學習培養「研究品味」:判斷哪些實驗值得做、怎樣設計,以及何時需要轉換方向;編程智能體如 GPT 5.5 Codex 則可協助執行技術工作。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
倫敦 AI 實驗室 Inherent 表示,旗下新推出的研究智能體 Faraday,在一項獨立重現已發表科學論文研究結果的測試中,擊敗 Anthropic 的 Claude Opus 4.8 及 OpenAI 的 GPT-5.5。最受關注的是,Faraday 並非建基於同等規模的前沿模型,而是以只有 270 億參數的 Qwen 3.6 為核心。25
不過,呢個結果要睇清楚適用範圍:目前只是 Inherent 就特定論文重現評估所公布的結果,並非已經有獨立證據證明 Faraday 整體能力高過 Claude 或 GPT-5.5。
今次比較的不是一般聊天、寫作或問答,而是「科學重現」:智能體會收到一篇已發表的研究,之後要自行理解方法、設計實驗及重建足夠的研究流程,嘗試重現原文結果,而且事前唔會獲知答案。5
技術資料將相關評估描述為 Replica,一個包含 310 項任務、專注於重現科學圖表的基準測試。8 呢個定位十分重要,因為在一個界線清晰的科研流程中表現出色,只能反映該項工作的能力,未足以推論模型在一般推理、寫程式、寫作或原創科學發現方面同樣領先。
Faraday 運行於 Qwen 3.6,模型有 270 億參數。相對於用作比較的 Claude Opus 4.8 及 GPT-5.5 等大型前沿系統,呢個規模明顯細得多。15
但 Inherent 想帶出的重點,並不是 Qwen 3.6 單獨已經取代所有頂尖通用模型。Faraday 是一套智能體系統,結果取決於底層模型、後訓練方式、研究流程、工具使用,以及規劃和執行工作點樣分工。換句話講,細模型只要配合針對性系統設計,亦可以在專門任務上追過更大型模型。
呢個分別正正係 Inherent 的策略核心:公司唔係一味追求訓練最大型的通用模型,而是希望用較小的模型負責科研方向和判斷,再協調更專門的外部工具,作出更有用的實驗決策。
Inherent 將目標能力稱為「研究品味」(research taste),即研究人員用來判斷一個問題值唔值得追、某項實驗應唔應該做、實驗應該點設計、結果未如理想時是否需要改變方向的實際判斷力。4
公司表示,Faraday 透過強化學習培養呢種行為。訓練並非逐步規定智能體每一個動作,而是更重視最終研究過程及結果的質素。呢種取向有別於只針對短答案基準測試作最佳化,因為後者通常一早已經設定好正確答案。
Faraday 亦唔需要親自包辦所有技術執行工作。它可以將包括 OpenAI GPT-5.5 Codex 在內的編程智能體當成工具使用。在呢個分工下,Faraday 更似一位研究總監:負責科學規劃及判斷,專門的編程系統就協助將計劃變成可以運行的實驗。6
所以,Faraday 所謂的優勢屬於整套智能體工作流程,未必等同於 270 億參數的底層模型單獨就比對手強。
對 AI 研究員來講,重現已發表研究是一個相對具體、亦較容易評估的科學訓練場。智能體需要理解論文、推測背後方法、提出假設、選擇實驗,遇到失敗時調整做法,最後再將結果與原有研究比較。
Inherent 的前提是,論文通常只呈現最後留下來的成果,當中的反覆試驗、放棄過的方向,以及研究人員作出的實際取捨,大多數唔會完整寫入文章。重建呢段被省略的過程,就可以讓智能體在受控環境下練習科學推理。5
重現亦比真正的原創發現更容易評估,因為任務有一個外部目標:智能體是否成功重現原文結果,以及它所作的實驗決定是否合理。對 Inherent 而言,呢個可能是由「驗證已知成果」走向「探索未知問題」之前的一個中間階段。
Inherent 並無將論文重現視為終點,而是把 Faraday 描述為邁向 AI 科學家的早期一步。公司長遠希望建立可以跨越不同科學領域工作的智能體,最終協助產生真正嶄新的知識。13
不過,呢個目標遠比贏一項基準測試困難。能夠重現已發表結果,代表系統展現出一定的研究行為;真正的科學發現,還要識別值得追查而且未有答案的問題、提出新假設、設計可靠測試,並產出經得起專家審視的結果。
因此,今次 Faraday 評估最多只可以視為呢條路線其中一部分的證據,唔應該被當成 AI 已經能夠自主發現科學新知的證明。
Inherent 近日結束隱身模式,據報完成 5,000 萬美元種子輪融資,並在倫敦建立團隊。公司計劃由大約十多人增至約 20 至 25 人,反映的似乎是小而集中、研究密度高的路線,而唔係同大型 AI 實驗室鬥人數或模型訓練預算。5
共同創辦人兼首席科學家 Edward Hughes 曾批評英國的 garden leave(離職留任期)限制。呢類安排可能令研究人員在轉工或加入初創前,需要一段時間暫停為新僱主工作;對要同資源更充裕的公司爭奪資深 AI 人才的 Inherent 來講,會影響招聘速度。6
因此,公司的整體押注相當集中:以精簡團隊投入強化學習及科研判斷,再將細型底層模型同日益強大的外部工具組合起來。如果呢套方法可以在初步評估以外持續奏效,初創公司或許唔需要先造出市場上最大模型,都有另一條路參與 AI 科研競爭。
Inherent 稱,Faraday 以 270 億參數 Qwen 3.6 為核心,在獨立重現已發表科學研究結果的任務上,表現優於 GPT-5.5 及 Claude Opus 4.8。真正值得留意的,唔單止係「細模型贏大模型」,而是研究規劃、長時間跨度的強化學習,以及工具協調,可能同模型本身的規模一樣,影響 AI 處理科研工作的能力。
但現階段較穩妥的結論仍然有限:Faraday 是一套在 Inherent 所評估的論文重現任務上具潛力的研究智能體系統。現有資料未能證明它在更廣泛範圍普遍優於 Anthropic 或 OpenAI 的模型,而重現既有研究本身亦不等於已經做到自主科學發現。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Inherent 稱,以 270 億參數 Qwen 3.6 為核心的 Faraday,在獨立重現已發表研究結果的任務上,表現優於 Anthropic Claude Opus 4.8 及 OpenAI GPT 5.5。
Inherent 稱,以 270 億參數 Qwen 3.6 為核心的 Faraday,在獨立重現已發表研究結果的任務上,表現優於 Anthropic Claude Opus 4.8 及 OpenAI GPT 5.5。 Faraday 的重點不只在答中答案,而是透過強化學習培養「研究品味」:判斷哪些實驗值得做、怎樣設計,以及何時需要轉換方向;編程智能體如 GPT 5.5 Codex 則可協助執行技術工作。
Inherent 視論文重現為訓練 AI 科學家的起點,長遠希望智能體能夠跨學科提出假設、進行實驗,並協助產生真正嶄新的科學知識。