OpenAI는 AI가 생성한 수학 원고 722편을 공개한 지 하루도 채 지나지 않은 10월 7일, 그중 3편을 철회했다. 한 논문에서 부호를 잘못 쓴 탓에 핵심 논증이 성립하지 않았고, 그 논증에 기대고 있던 다른 두 논문도 함께 영향을 받았다. 원고를 공개하는 일과 그 주장을 독립적으로 검증하는 일은 다르다는 점을 보여준 사례다.
24
35
722편은 722개의 독립된 결과가 아니었다
OpenAI는 10월 6일, 외부에 공개하지 않은 내부 모델이 작성한 수학 원고를 GitHub에 올렸다. 분야는 대수학과 기하학, 컴퓨터과학 등이며, 원고들은 372개 ‘계열’로 묶였다. 한 계열에는 중심 결과를 다룬 논문뿐 아니라 보조 논증, 결과의 응용이나 다른 증명도 포함될 수 있다.
1
35
38
따라서 722편을 서로 무관한 발견 722개로 보면 안 된다. 일부 원고는 같은 계열에 속한 다른 논문의 논증이나 구성에 의존했고, 바로 그 연결 관계가 이번 철회의 배경이 됐다.
1
24
부호 하나가 흔든 논문 세 편
문제는 Algebraicity of Weil classes on split abelian eightfolds에서 발견됐다. 핵심 논증에서 특정 기하학적 연산의 부호를 +1로 적었지만, 논문이 정한 규약에 따르면 −1이어야 했다. 이 오류로 상쇄를 이용해 주장을 뒷받침하던 논증이 무너졌다.
21
24
27
나머지 두 논문인 Algebraicity of Kuga–Satake Correspondences for K3 Surfaces와 The rational Hodge conjecture for products of K3 surfaces는 문제의 논문에 의존하고 있었다. 기초가 된 논증이 성립하지 않자, 그 논증을 근거로 내세운 주장도 뒷받침할 수 없게 됐고 OpenAI는 세 편을 모두 철회했다. 이는 해당 논문들의 증명에 문제가 생겼다는 뜻이지, 논문이 다루던 추측 자체가 반증됐다는 뜻은 아니다.
21
24
35
저장소에는 무엇이 바뀌었나
10월 7일 갱신 내역에는 논문 3편의 철회와 함께 다른 원고 14편의 수정, 관련 논문 13편의 참고 문헌 갱신이 기록됐다. 목록은 722편에서 719편으로 줄었고, 원고를 묶는 계열 수는 372개로 유지됐다.
1
24
28
저장소와 OpenAI의 공개 자료는 원고마다 검증 단계가 다를 수 있으며 오류가 있을 수 있다고 안내한다. OpenAI는 수학·인공지능 자문 그룹과 협의한 내용을 공개 방식에 반영했다고 밝혔다. 따라서 이번 원고들은 확정된 성과라기보다 검토와 검증이 필요한 연구 자료로 보는 편이 타당하다.
1
33
39
Lean 형식화가 확인해 주는 것, 확인해 주지 않는 것
일부 결과에는 Lean 형식화가 함께 제공됐다. Lean은 수학 증명을 형식화해 컴퓨터가 논리 전개를 검사할 수 있도록 하는 증명 보조 도구다. 다만 공개된 자료마다 집계 단위가 다르다. 한 요약은 719개 주요 결과 중 약 300개가 형식화됐다고 설명하고, 다른 자료는 전체 원고 722편 가운데 162편에 주요 결과의 형식화가 있다고 집계한다. 두 수치는 서로 다른 단위를 세므로, 어느 쪽도 해당 논문의 모든 주장이 독립적으로 검증됐다는 뜻으로 읽어서는 안 된다.
25
33
36
자문 그룹과의 협의, 형식화된 증명의 존재는 공개된 결과를 평가할 때 참고할 만한 맥락이다. 그렇다고 논문의 서술된 논증이나 주장의 범위까지 모두 검증됐다는 뜻은 아니다. 이번 철회는 논문 간 의존 관계를 살펴야 하는 이유도 보여준다. 공유된 논증 하나의 오류가 여러 원고에 영향을 줄 수 있다.
24
33
39
남은 원고도 각각 검증이 필요하다
이번 철회로 확인된 것은 특정 논증이 성립하지 않았고, 그 논증에 기대던 두 논문도 그 근거만으로는 주장을 뒷받침할 수 없다는 점이다. 그렇다고 나머지 원고가 틀렸다는 뜻도, 반대로 옳다는 뜻도 아니다. 각 결과는 증명과 전제, 관련 연구에 대한 의존 관계를 살펴 하나씩 평가해야 한다.
1
21
35