Inherent는 270억 개 파라미터의 Faraday가 논문에 제시된 연구 결과를 사전 정답 없이 재현하는 과제에서 Claude Opus 4.8과 GPT 5.5를 앞섰다고 밝혔다. Faraday는 장기 강화학습으로 훈련됐으며, 100편의 머신러닝·AI 과학 논문에서 만든 310개 Replica 과제에서 원본 그래프를 보지 않고 특정 도표를 재현하도록 평가됐다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
영국 런던의 AI 연구소 Inherent가 270억 개 파라미터를 갖춘 과학 연구 에이전트 Faraday를 공개했다. 회사는 Faraday가 정답을 미리 제공받지 않은 상태에서 과학 논문에 실린 연구 결과를 재현할 수 있으며, 자체 벤치마크에서 Anthropic의 Claude Opus 4.8과 OpenAI의 GPT-5.5를 앞섰다고 밝혔다. 259
다만 이 발표를 ‘Faraday가 더 뛰어난 과학자’라는 의미로 확대 해석해서는 안 된다. 현재 입증된 것은 기존 연구 결과의 재현(replication) 능력이다. 새로운 과학 지식을 독자적으로 발견했다는 증거와는 거리가 있다.
Inherent는 머신러닝과 AI 과학 분야 논문 100편을 바탕으로 Replica라는 벤치마크를 만들고, 이를 310개의 재현 과제로 구성했다. 각 과제에서 에이전트는 제한된 시간과 컴퓨팅 자원 안에서 논문에 등장하는 특정 도표를 다시 만들어야 한다. 이때 원래 논문의 그래프는 볼 수 없다. 34
단순히 논문 내용을 요약하거나 이미 공개된 차트를 복사하는 방식과는 다르다. 에이전트는 연구의 의도를 해석하고, 필요한 실험을 직접 구현하며, 한정된 자원을 어디에 투입할지 결정해야 한다. 이후 얻은 결과가 논문에서 보고된 결과와 충분히 일치하는지도 판단해야 한다.
Inherent는 이 벤치마크에서 Faraday가 Claude Opus 4.8과 GPT-5.5를 능가했다고 주장했다. 특히 Faraday 자체는 270억 파라미터 모델을 기반으로 해, 비교 대상인 대형 프런티어 모델보다 규모가 작다. 158 그러나 이는 어디까지나 연구 재현이라는 특정 과제에서의 비교다. 모든 과학 연구나 코딩 작업에서 Faraday가 더 뛰어나다는 의미는 아니다.
Inherent가 강조하는 핵심 개념은 ‘연구 감각(research taste)’이다. 좋은 연구자는 단순히 최종 결과를 얻는 데 그치지 않는다. 어떤 실험을 해볼 가치가 있는지 판단하고, 실험을 합리적으로 설계하며, 모호한 결과를 해석하고, 접근이 실패했을 때 다음 방향을 정해야 한다. 47
겉보기에는 그럴듯한 그래프를 만들어내는 것만으로는 과학적으로 신뢰할 수 있는 연구 과정이 보장되지 않는다. Inherent는 Faraday가 가설을 세우고, 이를 시험하고, 실패에서 배우며, 다음에 시도할 생산적인 경로를 선택하는 장기적 행동을 학습하도록 훈련했다고 설명한다. 4
회사는 장기 강화학습이 이러한 판단력을 기르는 데 도움이 된다고 본다. 논문에는 최종 결과와 핵심 방법이 담기지만, 연구자가 실제로 겪은 수많은 시행착오와 방향 전환이 모두 기록되지는 않는다. 기존 결과를 재현하려면 에이전트가 그 실무적 과정을 상당 부분 다시 찾아내야 한다는 설명이다. Inherent의 더 큰 가설은 이 능력이 향후 검증을 넘어 개방형 연구로 나아가는 기반이 될 수 있다는 것이다. 49
Faraday는 강력한 코딩 에이전트를 자체적으로 대체하는 모델로 소개된 것이 아니다. 대신 과학적 판단을 담당하는 감독 계층으로 작동하며, 연구 재현 과정에서 OpenAI의 GPT-5.5 Codex를 도구로 지휘한다. Inherent는 이를 과학자가 코딩 보조 도구를 활용하는 방식에 비유한다. Faraday가 계획과 연구 판단을 제공하고, Codex가 상당 부분의 구현 작업을 맡는 구조다. 39
이 방식은 모델의 파라미터 수만으로 성능을 판단하기 어렵게 만든다. 상대적으로 작은 모델이라도 더 큰 도구에 무엇을 시킬지, 언제 전략을 바꿀지, 결과를 어떻게 평가할지를 잘 결정한다면 전체 시스템의 성능을 높일 수 있다는 논리다.
따라서 Faraday의 성과는 270억 파라미터 모델 자체가 모든 면에서 더 뛰어나다는 증거라기보다, 과학적 계획 능력과 고성능 코딩 모델을 결합한 오케스트레이션의 성과로 보는 편이 정확하다.
Inherent가 그리고 있는 최종 모습은 사람을 대체하는 완전 자율형 과학자가 아니다. 회사는 연구자와 협력하는 AI 동료를 만들고자 한다고 설명한다. 이 시스템은 실험을 계획하고 실행하며, 결과를 비판적으로 검토하고, 다음 실험을 반복해서 제안할 수 있지만 연구의 방향과 최종적인 감독은 사람이 맡는 방식이다. 45
현재 Faraday는 그 구상의 초기 단계에 해당한다. 범용 코딩 도구 위에 과학적 직관과 연구 관리 능력을 더하는 모델인 셈이다. Inherent가 장기적으로 새로운 지식의 발견에 기여하는 AI 에이전트를 목표로 하고 있지만, 이번 결과가 보여주는 것은 기존 연구의 재현이다. 34
이 구분은 중요하다. 기존 결과를 재현하는 능력은 과학적 신뢰성을 평가하는 유용한 시험이지만, 그것만으로 에이전트가 중요한 독창적 질문을 만들거나 완전히 새로운 가설을 세우고, 현실 세계에서 이를 검증할 수 있다고 결론 내릴 수는 없다.
Google DeepMind 출신 인사들이 설립한 런던 기반 AI 연구소 Inherent는 5,000만 달러 규모의 시드 투자를 유치한 뒤 비공개 개발 단계에서 모습을 드러냈다. 25 회사는 범용 모델이 자동으로 익히기 어려운 영역, 즉 실험적 판단과 장기 의사결정, 평가, 사람과 소프트웨어 도구 사이의 협업에 집중하고 있다.
외부 코딩 시스템인 GPT-5.5 Codex를 활용하는 것도 이 전략과 맞닿아 있다. 모든 능력을 하나의 거대 모델에 담기보다, 이미 존재하는 프런티어 도구를 과학 연구에 더 효과적으로 활용하도록 전문적인 감독 계층을 학습시키려는 접근이다. 39
현재 시점에서의 결론은 신중하지만 의미 있다. Inherent의 주장대로라면 상대적으로 작은 강화학습 기반 감독 모델도 정교하게 설계된 연구 재현 벤치마크에서 더 큰 프런티어 시스템을 앞설 수 있다. 하지만 이 접근이 실제로 신뢰할 수 있는 독창적 과학 성과로 이어질지는 아직 검증해야 할 질문으로 남아 있다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Inherent는 270억 개 파라미터의 Faraday가 논문에 제시된 연구 결과를 사전 정답 없이 재현하는 과제에서 Claude Opus 4.8과 GPT 5.5를 앞섰다고 밝혔다.
Inherent는 270억 개 파라미터의 Faraday가 논문에 제시된 연구 결과를 사전 정답 없이 재현하는 과제에서 Claude Opus 4.8과 GPT 5.5를 앞섰다고 밝혔다. Faraday는 장기 강화학습으로 훈련됐으며, 100편의 머신러닝·AI 과학 논문에서 만든 310개 Replica 과제에서 원본 그래프를 보지 않고 특정 도표를 재현하도록 평가됐다.
Faraday는 자체 코딩 도구 대신 OpenAI의 GPT 5.5 Codex를 실행 도구로 사용한다. Faraday가 연구 방향과 실험 판단을 맡고 Codex가 코딩 중심의 실행을 담당하는 구조다.