這 10 項成果涵蓋極其廣泛的學科:高維幾何、編碼理論、算術電路複雜度、群論、算子代數、量子複雜度、格密碼學與極值組合學 。
OpenAI 並未釋出 Astra 模型本身。而是以 Apache 2.0 授權在 GitHub 上發布了 Lean 4 證明證書,報告中稱其「sorry」計數為零——這意味著所有十個形式化證明的每一步都經過完整驗證 。這種方法避開了 AI 生成推理是否正確的常見爭論:證明助理以機械方式強制執行正確性,無論論證是如何被發現的。
即便研究人員如 Noam Brown 稱此公告是科學推理的一大步 ,懷疑論者仍提出了重要質疑。
不是那些大問題。 多位觀察者注意到,這 10 個問題並非克雷數學研究所的千禧年大獎問題(例如 P vs. NP、黎曼猜想)。這些問題確實是嚴肅的開放問題——例如非 sofic 群的構造,自 1999 年 Mikhail Gromov 引入 sofic 性以來便懸而未決 ——但它們並不具有同等的新聞份量。
缺乏同儕審查。 這些結果由 OpenAI 直接宣布,未事先在經過同儕審查的數學期刊或會議論文集上發表 。批評者認為,AI 生成的發現與人類輔助的框架之間的界線仍然模糊;OpenAI 自身也承認了這種張力,在其報告中引用了《萊頓 AI 與數學宣言》。
泛化能力懷疑。 認知科學家 Gary Marcus 認為,在形式數學上的成功是一種「特殊情況」,可能無法泛化至更廣泛的科學推理;一個領域的專長並不保證跨領域的專長 。數學適合產生廉價、可驗證的合成數據,但多數科學領域並非如此。
可重現性問題。 由於模型未發布,且具體的提示方法未完全公開,獨立驗證生成過程是不可能的 。部分批評者聚焦於在無法存取 Astra 的情況下重現結果的困難。
商業時機。 該公告發布於 OpenAI 正為其下一代主要模型家族鋪路之際,引發了該研究是否為行銷影響而非科學嚴謹性而安排時間的疑問 。
如果這些證明經得起專家檢驗,那麼多項結果將關閉已開放數十年的問題。最具代表性的成就——首次明確構造非 sofic 群——解決了一個懸宕超過 25 年的問題 。即使批評者也承認,OpenAI 提供了遠比一般企業公告更多的可檢驗材料 。
但更廣泛的問題在於:Astra 能否做數學?答案是:在一個狹窄領域內解決形式化、可驗證的問題能否轉化為通用科學推理?目前,答案仍是:尚未證明。