Inherentは、27 billion(270億)パラメータのQwen 3.6を基盤とするFaradayが、公開論文の研究結果を独立に再現する課題で、AnthropicのClaude Opus 4.8とOpenAIのGPT 5.5を上回ったと主張しています。 Faradayの特徴は、実験を自らすべて実装することではなく、強化学習で「どの実験を行うべきか」「どう設計すべきか」を判断する「research taste(研究の勘)」を身につけ、GPT 5.5 Codexなどのコーディングエージェントを道具として使う点です。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ロンドンを拠点とするAI研究企業Inherentが、新しい研究エージェント「Faraday」を発表しました。同社によると、Faradayは公開済みの科学論文を読み、事前に正解を知らされない状態で研究結果を再現するタスクにおいて、AnthropicのClaude Opus 4.8とOpenAIのGPT-5.5を上回ったといいます。25
注目を集めているのは、Faradayの基盤モデルが、最先端の大規模モデルではなく、比較的小さな27 billion(270億)パラメータの「Qwen 3.6」だという点です。15
ただし、この結果から「FaradayがClaudeやGPT-5.5より全般的に高性能だ」と結論づけることはできません。今回示されたのは、あくまでInherentが実施した、範囲の限定された論文再現評価での成果です。
比較の対象となったのは、科学論文の要約や既知の答えの予測ではありません。エージェントは公開論文を受け取り、そこに記された研究結果を再現するために、手法を読み解き、仮説を立て、実験を選び、結果を論文と照合する必要があります。Inherentは、この環境でFaradayがClaude Opus 4.8とGPT-5.5より良い成績を収めたと説明しています。5
技術的な説明によれば、評価に使われた「Replica」は、科学論文に掲載された図表の再現を中心とする310件のタスクで構成されたベンチマークです。8 これは重要な条件です。特定の研究ワークフローで優れた結果を出したことは、実用的な能力を示す可能性があります。しかし、それだけで一般的な推論、コーディング、文章作成、あるいは未知の科学的発見における性能まで証明するものではありません。
Faradayは、27 billionパラメータのQwen 3.6を基盤に動作します。Inherentは、比較対象となったAnthropicやOpenAIの大規模なフロンティアモデルとの間に、モデル規模の大きな差があることを強調しています。15
ここでのポイントは、Qwen 3.6単体が汎用モデルとして最先端モデルを置き換えたということではありません。Faradayは、基盤モデルに加えて、追加学習、研究用のワークフロー、ツール利用、計画と実装の分担を組み合わせた「エージェントシステム」です。特定の目的に合わせて周辺の仕組みを最適化すれば、小型の基盤モデルでも専門的な課題で大きなモデルと競える可能性があります。
これは、Inherentの事業戦略にも直結しています。同社は最大規模の汎用モデルを一から訓練するのではなく、科学研究の方向づけに長けた比較的小さなモデルで専門ツールを連携させ、実験上の意思決定を改善する道を選んでいます。
InherentがFaradayに身につけさせようとしている能力は、「research taste(研究の勘、研究者としての見立て)」と表現されています。どの実験に価値があるのか、どう設計すればよいのか、結果が不十分なときにどう判断するのか、そしていつ方針を変えるのか――そうした実務的な判断力を指します。4
同社は、この能力を強化学習によって育てたと説明しています。手順を一つずつ固定的に教えるのではなく、最終的な研究プロセスと成果の質を評価し、その結果に応じて報酬を与える考え方です。正解があらかじめ定められた短答式ベンチマークの最適化とは、異なる目標設定といえます。
また、Faradayは研究に必要な実装作業をすべて自分で担うわけではありません。OpenAIのGPT-5.5 Codexを含むコーディングエージェントをツールとして利用できます。この構成では、Faradayが研究計画や科学的な判断を担当し、専門のコーディングシステムが計画を実行可能な実験へ落とし込みます。6
したがって、今回報告された優位性は、27Bの基盤モデル単体ではなく、計画、判断、ツール利用、実装を組み合わせた一連のエージェントワークフローに帰属するものです。
論文の再現は、AIが科学研究の基本的な進め方を学ぶための、具体的で評価しやすい課題です。エージェントは論文の内容を解釈し、方法の背後にある仮説を考え、実験を選び、失敗に対処し、最終的に公表済みの結果と自分の成果を比較しなければなりません。
完成した論文に残されるのは、最終的に採用された手法や結果の一部です。その裏側にある試行錯誤、採用されなかった方針、実験上の細かな選択は、多くの場合、詳しく記録されません。Inherentは、こうした見えにくい研究プロセスを再構築することが、科学的推論を訓練するための管理された環境になると考えています。5
再現には、独創的な発見よりも評価しやすいという利点もあります。外部に既知の目標があるため、エージェントが結果を再現できたか、実験の選択が科学的に妥当だったかを確認できます。未知の問いに取り組ませる前の、中間的な訓練課題として位置づけやすいわけです。
Inherentにとって、論文再現はゴールではありません。同社はFaradayを、将来のAI科学者へ向かう初期段階と位置づけ、複数の科学分野で研究を進め、最終的には本当に新しい知識の創出を支援することを目指しています。13
これは、単一のベンチマークで勝つことよりはるかに大きな目標です。公表済みの結果を再現できることは、有用な研究行動の一部を示します。しかし独創的な発見には、価値のある未解決問題を見つけ、新しい仮説をつくり、信頼できる検証方法を設計し、他の研究者による精査にも耐える結果を出す必要があります。
その意味で、今回のFaraday評価は、AI科学者への道筋の一部分を示す証拠と見るのが適切です。自律的な科学的発見がすでに実現したことを示す証明ではありません。
Inherentは、約12人規模のチームと報じられており、ステルス状態を終えた際には5,000万ドルのシード資金を調達していました。5 今後は人員を約20〜25人へ増やす計画とされ、大手AI研究所のような大規模な採用競争やモデル開発競争ではなく、少人数で研究に集中する方針がうかがえます。
創業者の一人で最高科学責任者でもあるEdward Hughesは、英国の「ガーデンリーブ」制度を批判しています。ガーデンリーブとは、退職を申し出てから実際に次の職場で働き始めるまで、一定期間の就業を制限する慣行です。Hughesは、DeepMindを含む経験豊富なAI研究者を、資金力のある企業と競って採用するうえで、こうした制限が人材移動を遅らせる問題になると見ています。6
Inherentの戦略は、規模を追いかけるのではなく、ロンドンの人材基盤に近い場所で少数精鋭のチームをつくり、強化学習と科学的判断力に投資し、外部のコーディングツールを組み合わせるというものです。この方法が今回の評価を超えて通用するなら、最大のモデルを開発しなくてもAI研究で競争する、スタートアップ向けの別の道を示す可能性があります。
Inherentは、27BモデルのQwen 3.6を基盤とするFaradayが、正解を事前に与えられない論文再現タスクで、GPT-5.5とClaude Opus 4.8を上回ったと主張しています。
より重要なのは、「小さなモデルが大きなモデルに勝った」という見出しだけではありません。科学研究では、モデルの規模だけでなく、長期的な強化学習、実験計画、研究上の判断、そして専門ツールとの連携が成果を左右する可能性があります。
現時点で evidence が支持する結論は、より限定的です。Faradayは、Inherentが評価した論文再現という課題において有望な研究エージェントだといえます。しかし、ClaudeやGPT-5.5に対する汎用的な優位性や、Faradayが自律的に新発見を生み出せることまで、今回の結果が示したわけではありません。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Inherentは、27 billion(270億)パラメータのQwen 3.6を基盤とするFaradayが、公開論文の研究結果を独立に再現する課題で、AnthropicのClaude Opus 4.8とOpenAIのGPT 5.5を上回ったと主張しています。
Inherentは、27 billion(270億)パラメータのQwen 3.6を基盤とするFaradayが、公開論文の研究結果を独立に再現する課題で、AnthropicのClaude Opus 4.8とOpenAIのGPT 5.5を上回ったと主張しています。 Faradayの特徴は、実験を自らすべて実装することではなく、強化学習で「どの実験を行うべきか」「どう設計すべきか」を判断する「research taste(研究の勘)」を身につけ、GPT 5.5 Codexなどのコーディングエージェントを道具として使う点です。
Inherentは論文再現をAI科学者の訓練段階と位置づけ、将来的には分野をまたいで未知の科学的知識を生み出すエージェントを目指しています。