OpenAI가 2026년 10월 6일 AI가 작성한 수학 원고를 대량 공개한 뒤, Association for Human Mathematics(AHM)가 수학자들에게 OpenAI와의 협력을 중단하라고 촉구했습니다. AHM의 핵심 문제 제기는 원고 가운데 일부 증명이 틀릴 수 있다는 데 그치지 않습니다. 기업 모델이 한꺼번에 내놓은 결과물이 검증과 기록, 학술적 토론을 거치지 않은 채 과학적 성과로 받아들여져서는 안 된다는 것입니다.
45
46
이번 공개에는 의미 있는 결과가 포함됐을 가능성이 있습니다. 하지만 원고의 수나 증명 파일, 눈길을 끄는 주장이 있다는 사실만으로 결과가 확인된 것은 아닙니다. 모델에 누가 접근할 수 있는지, 결과를 누가 검토하는지, 검증에 드는 노동은 누가 맡는지도 논란의 일부입니다.
OpenAI가 공개한 자료는 무엇인가
OpenAI의 최초 발표는 수학 17개 분야의 원고 722편을 소개했습니다. 원고들은 서로 관련된 결과 372개 묶음으로 정리돼 있습니다. 따라서 722편을 서로 독립적인 발견 722건으로 볼 수는 없습니다. 공개 저장소에는 원고와 증명을 뒷받침하는 자료가 들어 있으며, Apache-2.0 라이선스로 배포됐습니다.
7
15
OpenAI는 모델이 약 4,000개의 문제를 시도했고, 결과 하나당 평균 계산량은 ChatGPT Pro의 Thinking 기능을 약 3시간 사용하는 것에 해당한다고 밝혔습니다. 모델의 추론 과정을 축약한 요약 10개와 일부 증명의 Lean 형식화도 공개했습니다.
7
12
16 Lean은 수학적 증명을 컴퓨터로 확인할 수 있도록 형식화하는 도구입니다.
다만 저장소는 결과마다 검증 단계가 다르고, 모든 결과에 Lean 형식화가 있는 것은 아니라고 설명합니다. 현재 저장소 목록에는 최초 발표의 722편이 아니라 원고 719편이 표시돼 있습니다.
10
11
원고에는 마흘러 추측과 원주율 π의 정확한 무리수 지수 등에 관한 주장도 포함돼 있습니다. 그러나 주목할 만한 수학적 문제를 다룬 원고라는 이유만으로, 그 결과를 확정된 사실로 받아들여서는 안 됩니다.
5
21
AHM은 왜 반발했나
AHM은 성명에서 수학자들이 “이 작업을 해 달라고 요청한 적이 없다”고 밝혔습니다. 또 수백 개 파일을 한꺼번에 공개한 것은 학문적 성과라기보다 “힘의 과시”라고 표현했습니다. AHM은 기업이 내놓은 결과를 서둘러 받아들이거나 일괄적으로 처리하기보다, 회의적인 태도와 사람을 중심에 둔 연구가 필요하다고 주장합니다.
45
46
실무적인 부담도 큽니다. 원고를 평가하려면 전문가들이 내용을 읽고 증명을 검토한 뒤 기존 연구와 비교해야 합니다. 공개 저장소는 연구자들에게 검토할 자료를 제공하지만, 그 검토 작업 자체를 대신하지는 않습니다. 오히려 많은 경우 그 부담을 연구 공동체로 넘깁니다.
AHM은 수학·인공지능 자문그룹의 경고도 언급했습니다. 고등연구소(Institute for Advanced Study)를 기반으로 활동하는 이 그룹은 AI 기업과 수학 연구 공동체의 관계에 조언하기 위해 만들어졌습니다. AHM의 성명에 따르면, 이 그룹은 기업 내부 모델로 첨단 수학 문제를 시험하는 데 반대하는 취지의 경고를 내놓은 바 있습니다.
45
48
Lean 형식화가 확인해 주는 것, 확인해 주지 않는 것
Lean 형식화는 중요한 검증 수단입니다. 증명이 실제로 시스템에 옮겨져 있다면 컴퓨터로 논리적 절차를 확인할 수 있습니다. OpenAI는 원고 162편의 주요 명제가 형식화돼 있다고 밝혔습니다.
5 이는 해당 결과를 검토하는 데 도움이 되지만, 모든 원고의 모든 주장을 자동으로 입증하는 것은 아닙니다.
형식화가 없는 결과는 사람이 논증을 읽고 직접 확인해야 합니다. 저장소도 원고마다 검증 단계가 다르며, 모든 결과에 Lean 형식화가 제공되는 것은 아니라고 명시합니다.
10
11 따라서 전체 묶음을 한꺼번에 ‘입증됐다’거나 ‘쓸모없다’고 단정하기보다, 각 결과를 개별적으로 살펴보는 것이 타당합니다.
공개된 정보는 늘었지만, 과정이 모두 드러난 것은 아니다
문제 약 4,000개를 시도했다는 설명, 결과당 평균 계산량, 추론 요약 10개는 결과가 만들어진 과정에 대한 일부 정보를 제공합니다.
7
12
16 하지만 각 결과가 나온 전체 이력을 공개한 것은 아닙니다. 결과를 만든 모델은 내부용으로, 외부 연구자가 직접 살펴볼 수 없습니다.
7
11
시도한 문제의 총수만으로는 모델이 명확히 정의된 고난도 문제 집합에서 얼마나 자주 성공했는지도 알기 어렵습니다. 성능과 재현 가능성을 평가하려면 결과가 만들어진 구체적인 방법과 절차에 관한 정보가 더 필요합니다.
OpenAI는 중요한 결과를 검토하기 위한 워크숍과 학술 행사를 계획한다고 밝혔습니다.
7 이런 자리는 검증을 돕겠지만, 다른 연구자들이 증명이 어떻게 나왔는지 독립적으로 평가할 수 있도록 충분한 자료를 공개하는 일을 대신하지는 못합니다.
이번 논란이 수학 연구에 던지는 질문
이 논쟁에는 단순한 결론이 없습니다. AI가 만든 논증 묶음에 실제 수학적 진전이 포함될 수는 있습니다. 하지만 그 가치는 공개된 원고의 수나 다루는 문제의 유명세가 아니라, 결과가 독립적인 검토를 견뎌내는지에 따라 판단해야 합니다.
7
10
한편 AHM의 반발은 기존 인간 연구의 공로를 어떻게 인정할지, 새로운 결과를 평가하는 데 드는 비용을 누가 부담할지, 인간의 수학 연구에 대한 관심과 지원이 줄어들 가능성이 있는지에 대한 질문을 부각합니다. 원고 공개 자체가 이런 문제에 답을 주는 것은 아니지만, 논의를 더 시급하게 만들었습니다.
45
46
핵심은 수학적 주장을 대량으로 생성하는 능력과 그 주장을 과학적으로 검증하는 일을 구분하는 것입니다. 이번 논란은 AI가 수학에 무엇을 보탤 수 있는지뿐 아니라, 그 기여가 검증 가능하고 투명하며 연구 공동체에 의미 있게 받아들여지려면 어떤 규범이 필요한지를 묻고 있습니다.