OpenAI 在 2026 年 10 月 6 日公開 722 份數學稿,並將它們歸入 372 個結果系列。這批成果展示 AI 能以大規模方式協助數學研究,同時亦帶出一個核心問題:Lean 等證明助理可以檢查形式化後的論證,但研究者仍要確認,程式實際證明的命題,是否與論文聲稱的一致。這批稿件應視為有待評估的研究材料,而不是 722 項已獨立確立的發現。
12
7
數量大,不代表每項結果都已確認
OpenAI 表示,這批數學稿由一個未公開的內部模型產生;評估期間,模型大約處理了 4,000 道問題,而每項結果平均使用約三小時運算。這些數字反映工作規模及公司所報告的運算投入,單憑數字本身,不能證明每項論證正確,亦不能判定其數學重要性。
1
3
7
此外,722 份稿件被整理成 372 個結果系列,因此不應把稿件總數直接理解為 722 項互不相關、已獲獨立核實的突破。個別主張是否成立,仍要看論證本身,以及它能否經得起數學界的檢視。
7
12
Navier–Stokes 例子:形式化證明要和論文對得上
針對 OpenAI 早前公布的 Navier–Stokes 工作,有研究者指出 Lemma 8.6 存在一處值得留意的差異:人類可讀的論文版本中,估計式涉及最高至 m + 4 階導數的正則性要求;相應的 Lean 版本則寫成 m + 5。要求多一階導數,代表形式化版本的估計較弱:它需要更強的前提,未能直接核實論文原文所述的較強主張。
這個差異本身並不能證明其中一個版本無效,也不足以裁定整項結果是否成立。但它代表,不能單憑電腦成功檢查 Lean 程式,就說論文中較強的表述已獲確認。研究者仍須逐項比對論文聲稱甚麼,以及形式化程式實際編碼了甚麼。
這亦是形式化驗證的一般限制:證明助理檢查的是以形式語言表達的命題;除非有人核對翻譯過程,否則程式本身無法保證該命題忠實對應論文內容。出現不一致,應視為需要仔細調查的理由;單憑這一點,既不能證明有人刻意削弱論證,也不能推論所有 AI 生成證明都有同類問題。
產出可以快,數學審核仍要花功夫
OpenAI 報告的平均數字,是每項結果約三小時運算;另有報道指,早前的 Navier–Stokes 工作曾讓 AI agents 運作約 88 小時。兩個數字涉及不同工作,亦都不能代表獨立數學家需要多少時間才能核實論證。
1
報道亦提到,有團隊花了約兩星期檢視早前的 Navier–Stokes 證明。那不是對 10 月 6 日才公開的整批數學稿進行兩星期審核。撰寫論文與獨立檢查數學內容,是兩項不同工作;當稿件以這種規模公開,核實工作自然亦會相當繁重。
Lean 有用,但並非回答所有問題
Lean 是一種可用來形式化數學證明的工具,讓軟件逐步檢查程式所表達的邏輯推導。不過,OpenAI 這批結果處於不同驗證階段,並非每份稿件都有配套的 Lean 形式化版本。公司表示,會繼續為更多結果加入形式化證明。
7
12
即使有形式化程式,而且程式成功通過檢查,讀者仍要確認它證明的是否與論文同一命題,也要判斷結果在數學上的意義。論證與前人工作的關係,同樣需要人手評估;單靠形式化檢查,不能代替這些判斷。
2
7
關鍵不只是 AI 做得多快
這次公開顯示,AI 有能力大規模產出數學研究材料,但不代表它可以取代數學審核。較穩妥的做法,是逐項檢視結果:先弄清楚主張的具體內容,再比較論文論證與任何形式化版本,並分清楚「電腦檢查過的命題」和「已由數學家獨立確認的結果」。
2
7
12
Lemma 8.6 的差異正好說明,為甚麼這個分別重要。AI 或可加快探索和產出,但要建立可信度,仍要靠清楚交代主張、讓文字與形式化版本互相對照,以及認真核實;稿件數目和運算時間本身並不足夠。