Inherent는 270억 개 매개변수의 Qwen 3.6 기반 Faraday가 공개 과학 논문의 연구 결과를 독립적으로 재현하는 과제에서 Anthropic의 Claude Opus 4.8과 OpenAI의 GPT 5.5보다 높은 성과를 냈다고 밝혔다. Faraday의 핵심은 모델 규모보다 연구 방향 설정에 있다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
런던에 기반을 둔 AI 연구소 Inherent가 새롭게 공개한 과학 연구 에이전트 ‘Faraday’가 특정 논문 재현 평가에서 Anthropic의 Claude Opus 4.8과 OpenAI의 GPT-5.5를 앞섰다고 주장했다. Faraday는 사전에 정답을 제공받지 않은 상태에서 공개 과학 논문의 연구 결과를 직접 재현하는 과제를 수행했다. 25
주목할 점은 Faraday가 거대 프런티어 모델이 아니라 270억 개 매개변수의 Qwen 3.6을 기반으로 한다는 사실이다. 15 다만 이번 결과는 Inherent가 보고한 특정 연구 재현 평가의 성과다. 이를 근거로 Faraday가 Claude나 GPT-5.5보다 전반적으로 더 뛰어난 모델이라고 결론 내릴 수는 없다.
이번 비교의 대상은 과학적 ‘재현’이다. 에이전트는 연구 논문을 읽고, 논문에 제시된 방법을 추론한 뒤 필요한 실험을 직접 설계·실행해 기존 결과를 재현해야 한다. 단순히 논문을 요약하거나 이미 알려진 답을 맞히는 과제와는 다르다. Inherent는 이 평가에서 Faraday가 Claude Opus 4.8과 GPT-5.5보다 좋은 결과를 냈다고 밝혔다. 5
기술적 평가 설명에 따르면 사용된 Replica 벤치마크는 과학 논문의 도표와 연구 결과 재현을 중심으로 한 310개 과제로 구성됐다. 8 이런 평가에서의 성공은 특정 연구 업무를 수행하는 능력을 보여줄 수 있지만, 일반적인 추론·코딩·글쓰기 또는 새로운 과학적 발견 전반에서의 우위를 의미하지는 않는다.
Faraday의 기반 모델은 270억 개 매개변수의 Qwen 3.6이다. Inherent는 이를 비교 대상인 대형 프런티어 시스템과 대비되는 중요한 특징으로 내세웠다. 15
그렇다고 Qwen 3.6 자체가 모든 영역에서 최고 성능 모델로 대체됐다는 뜻은 아니다. Faraday는 기반 모델에 후속 학습, 연구 절차, 도구 사용, 계획과 실행의 역할 분담을 결합한 에이전트 시스템이다. 특정 과제에 맞춰 시스템 전체를 최적화하면 상대적으로 작은 모델도 전문 영역에서 경쟁력을 가질 수 있다는 것이 이번 사례의 핵심이다.
Inherent의 전략도 여기에 맞춰져 있다. 가장 큰 범용 모델을 직접 훈련하기보다, 과학적 판단 능력을 강화한 소형 모델이 전문 도구를 조율하고 더 나은 실험 결정을 내리도록 하겠다는 접근이다.
Inherent는 Faraday가 갖춰야 할 능력을 ‘research taste’, 즉 ‘연구 감각’이라고 설명한다. 어떤 실험을 할 가치가 있는지, 실험을 어떻게 설계해야 하는지, 결과가 불확실할 때 어떻게 판단하고 언제 방향을 바꿔야 하는지를 결정하는 능력이다. 4
회사는 이 행동을 강화학습으로 개발했다고 밝혔다. 모든 단계를 미리 규칙으로 지정하는 대신, 최종적인 연구 과정과 결과의 품질을 기준으로 보상하는 방식이다. 정답이 정해진 짧은 답변형 벤치마크에서 점수를 높이는 것과는 다른 목표다.
Faraday가 모든 구현 작업을 직접 처리하는 것도 아니다. OpenAI의 GPT-5.5 Codex 같은 코딩 에이전트를 도구로 사용할 수 있다. 이 구조에서 Faraday는 연구 책임자처럼 과학적 계획과 판단을 맡고, 전문 코딩 시스템은 계획을 실제로 실행 가능한 실험으로 옮기는 역할을 한다. 6
따라서 이번 비교에서 앞섰다는 성과는 Qwen 3.6 기반 모델 단독의 결과라기보다, 연구 계획과 외부 도구 활용을 포함한 전체 에이전트 워크플로의 결과로 보는 편이 정확하다.
논문 재현은 AI 연구자가 과학적 탐구 과정을 연습할 수 있는 구체적인 방법이다. 에이전트는 논문을 해석하고, 연구 방법에 대한 가설을 세우며, 실험을 고르고, 실패한 시도를 다루고, 자신의 결과를 기존 연구와 비교해야 한다.
Inherent가 주목하는 지점은 최종 논문에 연구의 전 과정이 담기지 않는다는 사실이다. 논문에는 결과를 얻기까지의 시행착오, 폐기된 접근법, 실험 과정에서 내린 실질적인 선택이 대부분 생략된다. 따라서 그 숨은 과정을 다시 구성하는 일은 과학적 추론을 훈련하는 통제된 환경이 될 수 있다. 5
재현은 완전히 새로운 발견보다 평가하기도 쉽다. 에이전트가 기존 결과를 재현했는지 확인할 외부 기준이 있고, 실험 선택이 과학적으로 타당했는지도 검토할 수 있기 때문이다. 이는 아직 답이 알려지지 않은 질문을 AI에게 맡기기 전에 거칠 수 있는 중간 단계다.
회사는 논문 재현을 최종 목표로 제시하지 않는다. Faraday를 여러 과학 분야에서 활동하고 궁극적으로 새로운 지식을 만들어내는 AI 과학자로 가는 초기 단계로 설명한다. 13
다만 이는 벤치마크에서 승리하는 것보다 훨씬 큰 목표다. 기존 결과를 재현하는 시스템은 유용한 연구 행동을 보여주지만, 독창적인 발견을 위해서는 가치 있는 미해결 문제를 찾고, 새로운 가설을 세우며, 신뢰할 수 있는 검증 방법을 설계하고, 다른 연구자들의 검토를 견디는 결과를 내야 한다.
따라서 이번 Faraday 평가는 그 여정의 한 부분을 뒷받침하는 증거로 보는 것이 적절하다. AI 과학자라는 더 넓은 목표가 이미 달성됐다는 증거는 아니다.
Inherent는 약 5,000만 달러의 시드 투자를 유치한 뒤 최근 비공개 개발 단계에서 모습을 드러냈으며, 런던에서 사업을 확장하고 있다. 5 현재 약 12명 규모의 팀을 20~25명 수준으로 키우려는 계획은 거대 AI 연구소와 인력·모델 규모 경쟁을 벌이기보다 소수 정예 연구팀을 지향한다는 점을 보여준다.
공동 창업자이자 최고과학자인 에드워드 휴스는 영국의 ‘가든 리브(garden leave)’ 관행을 비판해 왔다. 가든 리브는 퇴사 통보 후 일정 기간 실제 업무를 하지 못하게 하는 제도로, 연구자가 다른 회사나 스타트업으로 이동하는 시점을 늦출 수 있다. Inherent는 DeepMind 출신을 비롯한 숙련 AI 연구자를 더 많은 자원을 가진 기업과 경쟁하며 영입할 때 이를 불리한 요소로 보고 있다. 6
결국 회사의 전략은 규모보다 집중에 가깝다. 작은 팀으로 강화학습과 과학적 판단에 투자하고, 소형 기반 모델과 점점 강력해지는 외부 도구를 결합하는 방식이다. 이 접근이 초기 평가를 넘어선다면, 스타트업이 시장에서 가장 큰 모델을 직접 만들지 않고도 AI 연구 경쟁에 참여할 수 있는 또 다른 경로가 될 수 있다.
Inherent의 주장대로라면 Faraday는 270억 개 매개변수의 Qwen 3.6을 기반으로 공개 과학 연구 결과를 독립적으로 재현하는 과제에서 GPT-5.5와 Claude Opus 4.8을 앞섰다. 더 중요한 메시지는 단순히 ‘작은 모델이 큰 모델을 이겼다’는 데 있지 않다. 과학 연구에서는 모델의 규모 못지않게 연구 계획, 장기 강화학습, 실험 판단, 도구 조율이 중요할 수 있다는 점이다.
현재 확인되는 결론은 제한적이다. Faraday는 Inherent가 평가한 논문 재현 과제에서 가능성을 보인 연구 에이전트다. 그러나 이번 결과만으로 Anthropic이나 OpenAI의 모델보다 전반적으로 우수하다고 볼 수 없으며, 논문 재현 능력만으로 자율적인 과학적 발견을 입증했다고 보기도 어렵다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Inherent는 270억 개 매개변수의 Qwen 3.6 기반 Faraday가 공개 과학 논문의 연구 결과를 독립적으로 재현하는 과제에서 Anthropic의 Claude Opus 4.8과 OpenAI의 GPT 5.5보다 높은 성과를 냈다고 밝혔다.
Inherent는 270억 개 매개변수의 Qwen 3.6 기반 Faraday가 공개 과학 논문의 연구 결과를 독립적으로 재현하는 과제에서 Anthropic의 Claude Opus 4.8과 OpenAI의 GPT 5.5보다 높은 성과를 냈다고 밝혔다. Faraday의 핵심은 모델 규모보다 연구 방향 설정에 있다. Inherent는 강화학습으로 어떤 실험을 수행하고 어떻게 설계할지 판단하는 이른바 ‘연구 감각’을 학습시켰으며, 코딩 에이전트인 GPT 5.5 Codex도 도구로 활용한다.
Inherent는 논문 재현을 미래의 AI 과학자를 위한 훈련 과정으로 보고, 장기적으로 여러 분야에서 새로운 과학 지식을 만들어내는 시스템을 개발한다는 목표를 내세우고 있다.