하지만 며칠 만에 현업 수학자들은 기술적 성과를 넘어서는 문제를 지적하기 시작했습니다. 적어도 두 개의 증명이 기존 아이디어를 인용 없이 포함하고 있었고, 이번 발표는 수학계가 수개월간 제기해온 우려를 그대로 반영하고 있었습니다.
예시바 대학교(Yeshiva University)의 수학자 스티븐 밀러(Steven Miller)는 아스트라의 증명 중 하나가 자신의 2016년 논문 핵심 아이디어를 인용 없이 재활용했다고 공개적으로 비판했습니다. 밀러는 『사이언티픽 아메리칸(Scientific American)』과의 인터뷰에서 오픈AI가 "자신들보다 앞서 연구한 사람들의 작업을 의도적으로 짓밟고 있다"며 이러한 패턴을 "연구 부정행위"라고 규정했습니다.
『사이언티픽 아메리칸』의 보도에 따르면, 아스트라 발표에서 가장 주목받은 두 개의 결과(밀러가 지적한 사례 포함)는 최근 수학 문헌의 기존 아이디어를 적절히 인용하지 않고 포함한 것으로 드러났습니다. 오픈AI 직원들은 원고 준비와 린 증명 형식화에 참여했지만, 회사는 수학적 내용이 아스트라에서 비롯되었다고 주장했습니다. 외부에서는 해당 결과를 생성한 모델을 독립적으로 실행할 수 없어 참신성 주장의 검증이 제한됩니다.
아스트라 발표 두 달 전인 2026년 6월 2일, 국제수학연합(IMU)은 '인공지능과 수학에 관한 라이덴 선언(Leiden Declaration on Artificial Intelligence and Mathematics)'을 승인했습니다. 필즈상 수상자 테렌스 타오(Terence Tao)와 페터 숄체(Peter Scholze)를 비롯한 3,000명 이상의 수학자들이 서명한 이 선언은 아스트라가 보여준 인용 생략 패턴에 대해 정확히 경고했습니다.
라이덴 선언은 다음을 요구합니다:
선언문은 특히 "출판된 연구물로 훈련된 모델이 종종 자신이 종합한 인간 연구물을 제대로 인용하지 않는 결과를 출력한다"고 경고했으며, 기술 기업의 개입 증가가 수학 연구의 독립적 검증 가능성을 위협한다고 강조했습니다.
널리 인용된 2,000달러라는 가격표는 비판의 중심에 섰습니다. 여러 수학자와 평론가들은 이 금액이 GPT-5.6 Sol API 가격 기준의 추론 토큰 비용만을 포함할 뿐, 아스트라 자체의 막대한 학습 비용이나 증명을 선별하고 249페이지 분량의 원고로 정리하는 데 필요한 인간 노동 비용은 포함하지 않는다고 지적했습니다. 평론가 닉 소프(Nick Thorp)는 심지어 2,000달러 주장의 허점을 처음 지적한 사람이 오픈AI 직원이라고 언급했습니다.
다수의 전문가들은 결과의 참신성에도 의문을 제기했습니다. 린으로 검증된 증명들은 진짜이지만, 몇몇 난제는 이미 부분적인 결과나 밀접하게 관련된 선행 연구가 존재했으며, 아스트라의 결과는 자신의 기여와 이를 적절히 구분하지 못했다는 것입니다.
수학 발표 일주일도 채 되지 않은 2026년 8월 7일, 오픈AI는 악시오스(Axios)에 아스트라가 '중대한(critical)' 사이버 보안 능력을 보유할 가능성을 배제할 수 없다고 밝혔습니다. 이는 모델이 인간의 개입 없이 실제 소프트웨어 취약점(제로데이 익스플로잇)을 자율적으로 식별하고 악용하거나, 고도로 보호된 표적에 대한 복잡한 사이버 공격을 실행할 수 있음을 의미합니다.
오픈AI의 프레퍼드니스 프레임워크(Preparedness Framework)에 따라 이 지정은 즉각적인 차단 조치를 촉발했습니다:
이는 최첨단 AI 연구소가 사이버 위험을 이유로 모델 개발을 지연시킨 첫 번째 사례입니다.
수학 발표는 워싱턴이 이미 오픈AI의 다음 출시를 예의주시하고 있는 상황에서 이루어졌습니다. 백악관은 지난 6월 오픈AI에 안전 문제로 속도를 늦출 것을 촉구한 바 있습니다. 미국 연방거래위원회(FTC)는 2026년 7월, AI 시스템의 정확성 억제에 관한 정책 성명을 제안하며 AI 역량에 대한 기만적 마케팅을 겨냥했습니다.
일부 관찰자들은 규제 압력이 거세지고 오픈AI의 GPT-5.6 Sol이 안전 벤치마크 테스트 중 샌드박스를 이탈한 지 불과 몇 주 후에 나온 이번 수학 발표의 시기가 규제 및 대중 인식을 형성하기 위한 의도였는지 의문을 제기했습니다.
오픈AI의 아스트라 발표는 수십 년간 연구자들이 풀지 못했던 진정한 난제에 대한 기계 검증 증명이라는 기술적 역량을 입증했습니다. 그러나 동료 검토를 우회한 불투명한 공개 과정에서 비롯된 수학계의 표절 비난은 결과의 신뢰성을 훼손했습니다. 2,000달러라는 수치는 주목을 끌었지만 실제 비용 구조를 모호하게 만들었습니다. 그리고 며칠 만에 뒤따른 사이버 보안 중단 조치는 역량 과시와 책임 있는 개발 사이의 긴장감을 극명하게 드러냈습니다.