Inherent 表示,27 亿参数的 Faraday 在复现已发表科学研究的专项任务中超过 Claude Opus 4.8 和 GPT 5.5,但这一结果尚不能证明它能独立发现新的科学知识。[2][5][9] Faraday 通过长期强化学习训练,并在 Replica 基准上完成 310 项任务:在看不到原始图表的情况下,复现机器学习和“AI for Science”论文中的特定图形。[3][4] Faraday 负责科研规划与判断,同时调用 OpenAI 的 GPT 5.5 Codex 执行大量编码工作;Inherent 希望借此打造人机协作的科研“队友”。[3][9]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
伦敦 AI 实验室 Inherent 表示,其拥有 270 亿参数的 Faraday 智能体能够在事先不知道答案的情况下,复现已发表科学论文中的研究结果。该公司还称,在这一特定的科研复现任务上,Faraday 的表现超过了 Anthropic 的 Claude Opus 4.8 和 OpenAI 的 GPT-5.5。259
如果这一结果能在更大规模、由独立机构开展的测试中得到验证,它无疑颇具看点。但需要先划清边界:Faraday 目前接受的是“复现已知结果”的评估,而不是独立提出问题、发现全新科学知识的测试。
Inherent 构建了名为 Replica 的基准,收录了 100 篇机器学习和“AI for Science”论文,并将其转化为 310 项复现任务。每项任务都要求智能体在有限的时间和计算资源内,重新生成论文中的某一幅图表,同时无法查看原始图形。34
这比让模型概述论文内容,或照着论文复制一张已发表的图表,要难得多。智能体必须理解研究方法、编写并运行必要的实验,决定如何分配有限资源,并生成足够接近论文结论的结果,才算完成复现。
Inherent 称,尽管 Faraday 的模型规模只有 270 亿参数,但它在这一基准上超过了 Claude Opus 4.8 和 GPT-5.5。158不过,这应当被理解为针对特定基准的比较,而不是对这些系统在所有科研、编程或推理任务上的综合排名。
Inherent 的核心观点是,科研能力不只是得到一个看起来正确的最终结果。优秀研究者还需要判断哪些实验值得开展、如何合理设计实验、如何解释含糊不清的结果,以及在某条路线失败后何时调整方向。公司把这组判断能力称为“研究品味”(research taste)。47
这一点很重要,因为模型有可能生成外观合理的结果,却没有遵循可靠的科学过程。Inherent 表示,Faraday 通过训练学习更长期的研究行为:提出假设、进行检验、从失败中吸取信息,并选择下一步更有希望的实验。4
公司将科研复现视为训练这些能力的合适起点。要复现一项已发表成果,智能体往往必须重新经历论文没有完整记录的实际试错过程。Inherent 的更大设想是,如果智能体学会驾驭这一过程,未来就可能从验证已知结论,逐步走向更加开放式的科研工作。49
Faraday 并不是一个完全独立、能够包办所有编程工作的科研模型。相反,它在复现任务中充当监督层,调用并指挥 OpenAI 的 GPT-5.5 Codex。Inherent 将这种关系类比为科学家使用编程助手:Faraday 负责规划和科研判断,Codex 则承担大量具体实现工作。39
这套设计把重点从模型参数规模本身转向了“如何分工”。一个规模更小的模型,也可能通过决定大型工具该做什么、何时更换策略,以及如何评估实验结果而发挥价值。
因此,Faraday 所谓的优势部分来自工具编排能力——也就是科研规划与前沿编程能力的结合——并不能证明它的 270 亿参数模型在所有方面都普遍强于规模更大的系统。
Inherent 表示,公司希望打造能够与研究人员协作的 AI 科研队友。理想中的系统将帮助人类规划、执行、批评和迭代实验,同时由研究人员保留研究方向与监督权。45
Faraday 更适合被理解为这一愿景的早期版本:它在通用编程工具之上,增加了科研直觉和研究管理能力。Inherent 的长期目标是开发能够参与新知识发现的智能体,但目前公布的成果证明的仍是“复现”,而不是“发现”。34
这一区别不容忽视。复现已知结果是检验科研可靠性的重要方式,但它本身并不能证明智能体能够提出重要而原创的问题、生成真正新颖的假设,或在现实世界中验证一项新发现。
Inherent 是一家总部位于伦敦、由前 Google DeepMind 成员创立的 AI 实验室。据报道,公司以 5000 万美元种子轮融资结束隐身状态。25
它的路线并不是把所有能力都塞进一个模型,而是专注于通用模型可能不会自动掌握的部分:实验判断、长期决策、评估,以及人与软件工具之间的协作。34
这也解释了 Faraday 为什么使用外部编程系统。Inherent 试图训练一个专业化的科研监督层,让现有的前沿工具在科学工作中发挥更大作用,而不是重新打造一个包揽所有能力的单一模型。39
眼下更稳妥的结论是:Inherent 声称,一个规模相对较小、经过强化学习训练的监督模型,在定义清晰的科研复现基准上超过了更大型的前沿系统。至于这种方法能否最终带来可靠、原创的科学贡献,仍需要更广泛且独立的验证。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Inherent 表示,27 亿参数的 Faraday 在复现已发表科学研究的专项任务中超过 Claude Opus 4.8 和 GPT 5.5,但这一结果尚不能证明它能独立发现新的科学知识。[2][5][9]
Inherent 表示,27 亿参数的 Faraday 在复现已发表科学研究的专项任务中超过 Claude Opus 4.8 和 GPT 5.5,但这一结果尚不能证明它能独立发现新的科学知识。[2][5][9] Faraday 通过长期强化学习训练,并在 Replica 基准上完成 310 项任务:在看不到原始图表的情况下,复现机器学习和“AI for Science”论文中的特定图形。[3][4]
Faraday 负责科研规划与判断,同时调用 OpenAI 的 GPT 5.5 Codex 执行大量编码工作;Inherent 希望借此打造人机协作的科研“队友”。[3][9]