Inherent 称,基于 270 亿参数 Qwen 3.6 的 Faraday,在不提前获知答案的情况下独立复现已发表科学研究成果,表现超过 Claude Opus 4.8 和 GPT 5.5。[2][5] Faraday 的优势并不只来自底层模型,而在于通过强化学习培养“研究品味”,并让 GPT 5.5 Codex 等编码智能体负责部分实现工作。[4][6] Inherent 将论文复现视为训练 AI 科学家的起点,但这项测试尚不足以证明 Faraday 在通用能力或原创科学发现上全面领先。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
伦敦 AI 实验室 Inherent 表示,其新推出的科研智能体 Faraday 在一项特定任务中击败了 Anthropic 的 Claude Opus 4.8 和 OpenAI 的 GPT-5.5:在没有提前获知答案的情况下,独立复现已发表科学论文中的研究结果。25
这项结果之所以受到关注,是因为 Faraday 并非建立在超大规模前沿模型上,而是运行于拥有 270 亿参数的 Qwen 3.6。需要强调的是,这只是 Inherent 针对论文复现评测公布的结果,并不能据此得出 Faraday 在所有通用任务上都强于 Claude 或 GPT-5.5 的结论。
这里比较的不是论文摘要能力,而是“科学复现”:智能体需要阅读一项已发表研究,理解其方法,自行提出实验方案并执行,最终尽可能重现论文中的发现或图表,而不是直接预测一个已知答案。5
相关技术资料将这项评测称为 Replica,一个包含 310 项任务、重点考察科学图表复现能力的基准测试。8 这一区分很重要——在一个边界清晰的科研工作流中取得好成绩,能够说明智能体具备某些有价值的研究能力,但不能代表它在通用推理、编程、写作或原创科学发现方面同样领先。
Faraday 的底层模型是 Qwen 3.6,拥有 270 亿参数。相比之下,参与比较的 Claude Opus 4.8 和 GPT-5.5 都被视为规模更大的前沿系统。15
因此,Inherent 想强调的并不是“Qwen 3.6 单独取代了顶级通用模型”,而是:一个规模相对较小的基础模型,如果配合合适的后训练、任务流程、工具和分工,也可能在特定任务上击败更大的系统。
Faraday 本身是一个完整的智能体系统。它的表现取决于底层模型、强化学习训练、研究流程、工具调用,以及规划与执行之间的协作方式。换句话说,评测中的胜负属于整个工作流,而不一定属于 270 亿参数模型单独运行时的能力。
Inherent 将目标能力称为“研究品味”(research taste):判断哪些实验值得开展、如何设计实验、何时结果仍然不明确,以及什么时候应当调整研究方向。4
这类能力很难像普通问答那样直接写成标准答案。Inherent 表示,公司使用强化学习,让 Faraday 根据最终的研究过程和结果获得反馈,而不是把每一步操作都预先规定好。
这与单纯追求短答案基准分数有所不同。一个模型可能知道如何给出看似正确的回答,却未必知道在资源有限、实验可能失败的情况下,下一步究竟该测试什么。
Faraday 也不需要亲自完成所有编码和实现工作。它可以调用包括 OpenAI GPT-5.5 Codex 在内的编码智能体作为工具:Faraday 更像负责科学方向的“研究负责人”,提出计划、判断取舍;专业编码系统则帮助把计划转化为可执行的实验。6
复现论文为 AI 研究员提供了一个相对具体、可评估的科学训练场。智能体需要理解论文、推测方法背后的关键因素、选择实验、处理失败结果,并将自己的发现与原论文进行比较。
Inherent 的基本判断是,最终发表的论文只呈现了研究成果的一小部分。研究过程中反复试错、被放弃的方案,以及促成最终结果的实际选择,往往不会完整写入论文。让 AI 重建这段“看不见的过程”,就能在可控环境中训练其科学推理能力。5
复现任务也比真正的原创发现更容易验证。它有一个外部目标:智能体能否重现论文结果,实验选择是否合理,研究过程是否经得起科学判断。对于希望构建 AI 科学家的人来说,这可能是从“验证已知成果”走向“探索未知问题”的中间阶段。
Inherent 并未将论文复现视为终点。公司把 Faraday 描述为迈向 AI 科学家的早期一步,希望未来让这类系统跨越不同科学领域,协助提出真正新的知识和发现。13
但这显然比赢得一次基准测试困难得多。原创科学发现还要求系统能够识别有价值的未知问题,提出新假设,设计可靠的验证方式,并产出经得起进一步审查的结果。
因此,目前的 Faraday 证据更适合被理解为这一长期目标中的一个环节,而不是 AI 已经实现自主科学发现的证明。
Inherent 在隐身运营结束后公布了 5000 万美元种子轮融资,并在伦敦开展业务。5 公司据报道计划从目前约十几人的团队扩大到约 20 至 25 人。这种规模显示出一种小而专注的研发路线,而不是试图用人员数量或训练预算正面追赶大型 AI 实验室。
Inherent 联合创始人兼首席科学家 Edward Hughes 曾批评英国的“园艺假”(garden leave)限制。该做法可能要求员工在离职后的一段时间内暂不加入新雇主,从而拖慢研究人员转投其他公司或创业团队的速度。对于需要与资金更充足的企业争夺 DeepMind 等机构资深人才的初创公司而言,这被 Inherent 视为竞争劣势。6
这也解释了公司的整体策略:依靠精干团队,重点投入强化学习和科学判断能力,再结合不断增强的外部编码工具,而不是自行训练市场上规模最大的通用模型。如果这种方法能够在更多科研任务中得到验证,规模较小的 AI 初创公司或许可以找到一条不依赖“堆参数”来参与前沿竞争的路径。
Inherent 称,使用 270 亿参数 Qwen 3.6 构建的 Faraday,在独立复现已发表科学研究成果的任务中超过了 GPT-5.5 和 Claude Opus 4.8。真正值得关注的,或许不只是“小模型赢了大模型”,而是研究规划、长周期强化学习和工具协同,可能与模型规模同样重要。
不过,目前证据支持的结论仍然较为有限:Faraday 是一个在 Inherent 所评估的论文复现任务上表现出潜力的科研智能体。这项结果尚未证明它在通用能力上全面优于 OpenAI 或 Anthropic 的模型,也不能仅凭论文复现就证明它已经具备自主原创科学发现能力。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Inherent 称,基于 270 亿参数 Qwen 3.6 的 Faraday,在不提前获知答案的情况下独立复现已发表科学研究成果,表现超过 Claude Opus 4.8 和 GPT 5.5。[2][5]
Inherent 称,基于 270 亿参数 Qwen 3.6 的 Faraday,在不提前获知答案的情况下独立复现已发表科学研究成果,表现超过 Claude Opus 4.8 和 GPT 5.5。[2][5] Faraday 的优势并不只来自底层模型,而在于通过强化学习培养“研究品味”,并让 GPT 5.5 Codex 等编码智能体负责部分实现工作。[4][6]
Inherent 将论文复现视为训练 AI 科学家的起点,但这项测试尚不足以证明 Faraday 在通用能力或原创科学发现上全面领先。