Inherentは、27 billionパラメータのFaradayが、既存論文の研究結果を再現する課題でClaude Opus 4.8とGPT 5.5を上回ったと説明している。ただし、新しい科学的発見を独自に行えることを示した結果ではない。[2][5][9] Faradayは、機械学習およびAI for Science分野の100本の論文から作られた310件のタスクで、元の図を見ずに論文中の図を再現するよう訓練・評価された。[3][4] Faradayは科学的な計画や判断を担う監督モデルとして動作し、実装やコーディングの多くをOpenAIのGPT 5.5 Codexに任せる構成を採用している。[3][9]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
ロンドンを拠点とするAI研究所Inherentは、27 billionパラメータのAIエージェント「Faraday」が、公開済み論文の研究結果を、事前に答えを知らされない状態で再現できると発表した。同社によれば、Faradayはこの特定の研究再現タスクで、AnthropicのClaude Opus 4.8とOpenAIのGPT-5.5を上回ったという。259
もっとも、この発表は「Faradayがあらゆる科学研究で両モデルを上回った」という意味ではない。評価対象は、すでに発表された結果の再現だ。独立した新しい問いを立て、未知の発見を生み出せることまで実証したわけではない。
Inherentは、機械学習とAI for Science(科学研究へのAI活用)分野の論文100本をもとに、310件の研究再現タスクからなるベンチマーク「Replica」を作成した。各タスクでは、エージェントが論文に掲載された特定の図を、元のプロットを見ずに再現する。利用できる時間と計算資源にも制限が設けられている。34
これは、論文の内容を要約したり、公開されたグラフをそのまま写したりする作業ではない。エージェントは研究の意図を読み取り、必要な実験を実装し、限られたリソースをどこに振り向けるか判断し、最終的に論文の報告結果に十分近い出力を作らなければならない。
Inherentは、このベンチマークでFaradayがClaude Opus 4.8とGPT-5.5を上回ったとしている。しかもFaradayの基盤モデルは、27 billionパラメータと、比較対象のフロンティアモデルより小さい。158 ただし、これはあくまで研究再現というベンチマーク上の比較であり、科学やコーディング全般における総合的なランキングではない。
Inherentが強調するのは、最終的なグラフを似せる能力だけではない。実際の研究では、どの実験に取り組む価値があるのかを見極め、妥当な設計を考え、曖昧な結果を解釈し、うまくいかなければ方針を変える必要がある。同社は、こうした一連の判断力を「research taste(研究の勘、研究センス)」と表現している。47
見た目にはもっともらしい結果を出せても、そこに至る科学的なプロセスが信頼できるとは限らない。Inherentによれば、Faradayは長期的な強化学習によって、仮説を立て、試行し、失敗から学び、次に進むべき有望な実験を選ぶ行動を身につけるよう訓練されている。4
論文には、研究者が実際に試した小さな工夫や、うまくいかなかった試行錯誤のすべてが記録されているとは限らない。結果を再現するには、そうした実務的な判断をある程度たどり直す必要がある。Inherentは、このプロセスを学ぶことが、既知の結果の検証から、より自由度の高い研究へ進むための訓練になると考えている。49
Faradayは、強力なコーディングエージェントを置き換える単独のシステムとして位置づけられているわけではない。研究の計画や判断を担う監督役として動作し、実行段階ではOpenAIのGPT-5.5 Codexをツールとして指揮する。Inherentは、人間の研究者がコーディングアシスタントを使う関係に近いと説明している。39
この構成が示すのは、モデルの規模だけでは測れない性能の可能性だ。比較的小さなモデルでも、より大きなツールに何をさせるか、いつ戦略を変えるか、結果をどう評価するかを適切に判断できれば、研究全体の成果を高められるかもしれない。
したがって、Faradayの優位性は、27 billionパラメータのモデル単体がGPT-5.5より普遍的に高性能だという証拠ではない。科学的な計画を立てる層と、最先端のコーディング能力を組み合わせる「オーケストレーション」の強みとして理解するのが適切だ。
Inherentが描く将来像は、研究者と協働するAIエージェントだ。研究の計画、実験の実行、結果への批評、方針の反復を支援しながら、最終的な方向づけと監督は人間が担う。45
Faradayは、その構想の初期段階にあたる。汎用コーディングツールの上に、科学的な直感や研究管理の機能を重ねるモデルだ。Inherentは将来的に新しい知識の発見へ貢献できるエージェントを目指しているが、今回示されたのはあくまで既存研究の再現能力である。34
この線引きは重要だ。既知の結果を再現できることは、AIが科学的に信頼できるかを測る有用な試験になる。一方で、それだけでは、重要で独創的な研究課題を設定できること、真に新しい仮説を生み出せること、現実世界で発見を検証できることまでは証明できない。
Google DeepMindの卒業生が設立したロンドンのAI研究所Inherentは、ステルス状態から姿を現した際、5,000万ドルのシード資金を調達したと報じられている。25 同社は、汎用モデルが自動的に獲得するとは限らない実験判断、長期的な意思決定、評価、人間とソフトウェアツールの連携に焦点を当てている。
外部のコーディングシステムをFaradayに組み込んだのも、この方針の表れだろう。すべての能力を1つの巨大モデルに詰め込むのではなく、既存のフロンティアツールを科学研究向けにより有効活用する専門的な層を作ろうとしている。39
現時点での結論は、慎重ながらも興味深い。Inherentは、比較的小さな強化学習モデルが、科学的な計画を担う監督役として機能することで、明確に定義された研究再現ベンチマーク上では、より大規模なモデルを上回れると主張している。
ただし、そのアプローチが、信頼できる独創的な科学的貢献につながるかはまだ未検証だ。Faradayが「論文の結果を再現するエージェント」から「新しい知識を生み出す研究の仲間」へ進めるかどうかは、今後のより広範で独立した評価にかかっている。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Inherentは、27 billionパラメータのFaradayが、既存論文の研究結果を再現する課題でClaude Opus 4.8とGPT 5.5を上回ったと説明している。ただし、新しい科学的発見を独自に行えることを示した結果ではない。[2][5][9]
Inherentは、27 billionパラメータのFaradayが、既存論文の研究結果を再現する課題でClaude Opus 4.8とGPT 5.5を上回ったと説明している。ただし、新しい科学的発見を独自に行えることを示した結果ではない。[2][5][9] Faradayは、機械学習およびAI for Science分野の100本の論文から作られた310件のタスクで、元の図を見ずに論文中の図を再現するよう訓練・評価された。[3][4]
Faradayは科学的な計画や判断を担う監督モデルとして動作し、実装やコーディングの多くをOpenAIのGPT 5.5 Codexに任せる構成を採用している。[3][9]