오픈AI가 2026년 10월 6일 수학 원고 722편을 공개했습니다. 원고는 서로 연관된 결과를 묶은 372개 결과군으로 정리돼 있습니다. 이번 공개는 AI가 연구를 대규모로 수행할 수 있음을 보여주는 동시에, 핵심적인 검증 과제를 드러냅니다. 증명 보조 프로그램이 형식화된 논리를 확인하더라도, 그 형식적 명제가 원고에 적힌 주장과 일치하는지는 별도로 살펴야 합니다. 따라서 이 자료는 평가와 검토가 필요한 연구 묶음이지, 독립적으로 확립된 발견 722건으로 볼 수는 없습니다.
12
7
원고 수가 곧 확인된 성과 수는 아니다
오픈AI는 공개된 원고가 출시되지 않은 내부 모델에서 나왔으며, 결과 하나당 평균 약 3시간의 연산을 사용했다고 밝혔습니다. 평가 과정에서 약 4,000개의 문제를 제시했다는 설명도 내놨습니다. 이 수치들은 작업 규모와 회사가 보고한 연산량을 보여주지만, 각각의 결과가 정확하거나 중요하다는 점까지 입증하지는 않습니다.
1
3
7
또한 원고는 결과군 단위로 묶여 있습니다. 따라서 722라는 숫자를 서로 무관하고 독립적으로 검증된 돌파구의 수로 읽어서는 안 됩니다. 개별 주장의 타당성은 실제 논증이 무엇을 보이는지, 수학자들의 검토를 어떻게 통과하는지에 달려 있습니다.
7
12
나비에–스토크스 사례가 보여주는 ‘명제의 일치’ 문제
오픈AI의 앞선 나비에–스토크스 연구와 관련해 제기된 구체적인 쟁점은 보조정리 8.6(Lemma 8.6)입니다. 사람이 읽는 원고에는 도함수가 m + 4차까지 포함되는 정칙성 조건을 둔 추정식이 나옵니다. 이에 대응하는 Lean 형식화에서는 조건이 m + 5차까지로 적혀 있습니다. 추가 도함수를 요구하면 더 강한 가정을 두는 것이므로, 형식화된 추정식은 적용 범위가 좁고 원고에 적힌 주장을 그대로 확인한다고 보기 어렵습니다.
2
이 차이만으로 어느 한쪽이 틀렸다고 결론 내릴 수는 없으며, 전체 결과의 유효성이 판가름 나는 것도 아닙니다. 다만 컴퓨터 검사를 통과했다는 사실만으로 원고의 더 강한 주장이 확인됐다고 해석할 수는 없습니다. 검토자는 논문이 주장하는 내용과 형식 코드가 실제로 표현하는 내용을 대조해야 합니다.
2
형식 검증의 일반적인 한계도 여기에 있습니다. Lean 같은 증명 보조기는 형식 언어로 표현된 명제를 검사합니다. 그 명제가 논문에서 의도한 주장과 충실하게 대응하는지는 번역 과정도 살펴야 알 수 있습니다. 불일치는 면밀한 검토가 필요하다는 신호이지, 누군가 의도적으로 주장을 약화했다는 증거나 AI가 만든 모든 증명에 같은 문제가 있다는 뜻은 아닙니다.
2
계산은 빨라도 검토에는 시간이 든다
오픈AI가 보고한 결과당 평균 약 3시간의 연산량은 시스템이 결과를 내놓는 속도를 가늠하게 합니다. 이와 별도로, 앞선 나비에–스토크스 연구에서는 에이전트가 약 88시간 작동했다는 보도가 있습니다. 서로 다른 연구에 관한 수치이며, 어느 쪽도 수학자들이 결과를 독립적으로 검증하는 데 걸리는 시간을 말해주지는 않습니다.
1
3
7
앞선 나비에–스토크스 증명을 살펴보는 데 한 연구팀이 약 2주를 썼다는 보도도 있습니다. 이는 막 공개된 10월 6일 원고 묶음을 2주 동안 검토했다는 뜻이 아닙니다. 원고를 생성하는 일과 그 수학을 독립적으로 확인하는 일은 서로 다르며, 공개 자료가 이처럼 많으면 검토 부담도 커집니다.
2
Lean은 유용하지만 모든 질문에 답해 주지는 않는다
Lean으로 형식화하면 증명에 담긴 논리적 단계를 소프트웨어로 검사할 수 있습니다. 그러나 오픈AI가 공개한 결과는 검증 단계가 서로 다르고, 모든 원고에 Lean 형식화가 함께 제공된 것은 아닙니다. 회사는 형식화를 계속 추가하겠다고 밝혔습니다.
7
12
형식 코드가 있고 검사를 통과했더라도, 그 코드가 원고와 같은 명제를 증명하는지, 결과가 수학적으로 의미 있는지는 따져봐야 합니다. 기존 연구와 어떤 관계에 있는지 판단하는 일도 사람의 검토가 필요합니다. 형식 검사가 성공했다는 사실만으로 이런 질문까지 해결되지는 않습니다.
2
7
핵심은 숫자보다 개별 결과의 검증
이번 공개는 AI가 수학 연구물을 대규모로 만들어낼 수 있다는 증거이지, 수학적 검토를 대신할 수 있다는 뜻은 아닙니다. 결과마다 무엇을 주장하는지 정확히 확인하고, 글로 쓴 증명과 형식화를 대조하며, 컴퓨터가 검사한 명제와 수학자들이 독립적으로 타당성을 확인한 결과를 구분하는 것이 중요합니다.
2
7
12
보조정리 8.6에서 드러난 차이는 왜 이 구분이 필요한지 보여줍니다. AI가 연구의 속도를 높일 수는 있지만, 신뢰는 원고 수나 연산량만으로 생기지 않습니다. 주장을 투명하게 제시하고 꼼꼼히 검증하는 과정이 뒷받침돼야 합니다.