이 놀라운 성과는 다중 에이전트 워크플로우를 통해 이루어졌으며, 이는 Anthropic의 연구자들조차 놀라게 했습니다:
두 명의 사내 수학자 — Levent Alpöge와 Ralph Furmaniak — 가 증명을 검토하고 확인했습니다 . 그런 다음 논증은 대화형 정리 증명기인 Lean에서 형식화되어 기계가 확인 가능한 정확성 인증서를 생성했습니다
. 이 이중 검증(전문가 인간 검토 + 형식적 검증)은 AI가 생성한 수학적 결과에 대한 모범 사례로 널리 간주됩니다.
Claude의 리만 하한선 개선은 고립된 사건이 아닙니다. 2026년은 AI 주도의 수학적 돌파구가 가속화된 해였습니다:
여러 논평가들은 2026년 중반에 이 분야가 한계를 넘었다고 지적합니다. AI 시스템이 경쟁 수준의 수학을 푸는 단계에서 출판 가능한 공개 난제 수준의 연구를 생성하는 단계로 전환했다는 것입니다 .
AI 생성 수학의 급속한 발전은 격렬한 논쟁을 촉발했습니다:
Anthropic의 리만 결과는 몇 가지 구체적인 방식으로 논의를 진전시킵니다:
60개 하위 에이전트에 걸쳐 650개의 아이디어를 테스트한 것은 다중 에이전트 아키텍처가 어떤 인간 연구 그룹도 같은 시간 내에 따라잡을 수 없는 규모로 체계적인 탐색을 수행할 수 있음을 보여줍니다 . 이제 질문은 "AI가 수학을 할 수 있는가?"에서 "과학 발견 파이프라인에 AI 차원의 탐색을 어떻게 통합해야 하는가?"로 전환됩니다.
수학적 훈련을 받지 않은 모델이 2000년 Bombieri 논문과 최신 결과를 결합한 것 — 이는 어떤 인간도 보지 못한 조합입니다 — 은 AI가 서로 다른 문헌에 걸쳐 명백하지 않은 개념적 연결을 만들 수 있음을 보여줍니다 . 이 능력은 LLM이 단순히 보간하는 것인지 아니면 진정으로 발견할 수 있는지에 대한 핵심 우려를 직접적으로 다룹니다.
Lean 형식화는 결과가 "블랙 박스" 주장이 아님을 의미합니다. 이는 증명 가능하게 올바른 정리이며, 모든 수학자가 기계적으로 검사할 수 있습니다 . 이는 AI 생성 과학 결과를 검증 가능하게 만드는 방법에 대한 템플릿을 제공하며, AI 주도 발견에 대한 가장 강력한 반론 중 하나를 해결합니다.
놀라운 결과(DeepMind, OpenAI, Anthropic)와 커뮤니티 주도의 제도적 대응(라이덴 선언)이 동시에 등장한 것은 수학 커뮤니티가 퇴각하기보다는 적응하고 있음을 시사합니다 . 현재 논의는 AI 결과물을 전면 거부하는 것이 아니라 규범과 크레딧에 초점을 맞추고 있습니다.
OpenAI Astra 결과의 2,000달러 연산 비용과 Claude 리만 하한선 개선의 36시간 소요는 출판 가능한 수학적 발견의 한계 비용이 거의 0에 가까워지고 있음을 시사합니다 . 이는 연구자들이 추구할 질문과 수학 연구에 참여할 수 있는 사람에 대해 심대한 영향을 미칩니다.
Anthropic의 리만 하한선 개선은 AI 시스템이 이제 150년 된 공개 난제를 진전시키는 출판 가능하고 형식적으로 검증 가능한 수학적 결과를 자율적으로 발견할 수 있음을 보여주는 획기적인 사례입니다. 2026년의 유사한 돌파구 연속과 함께, 이는 논의를 "AI가 과학 발견에 기여할 수 있는가"에서 "과학 커뮤니티가 새로운 종류의 AI 공동 발견자에 대한 인센티브, 저자 표기, 검증을 어떻게 구조화해야 하는가"로 전환시킵니다.