他所解決的問題是Crouzeix猜想,由法國數學家Michel Crouzeix在2004年提出。該猜想指出:對於任何方陣複數矩陣 A 和多項式 p,算子範數 ||p(A)|| 最多不超過 |p| 在數值域 W(A) 上最大值的兩倍。精確常數2的證明已懸而未決22年;過去的最佳界限僅達到約2.414
。
設定完成後,金山木就離開讓系統自行運作。「他把模型鎖在斷網狀態,啟動它,然後離開。16小時後,它就給出了證明。」報導指出。在這16小時內,GPT-5.6-Sol執行了數千次的假設生成、測試與修正循環
。
結果是Crouzeix猜想被證明為真:常數2是正確的。這份證明於2026年7月27日以預印本形式發布,標題為《數值域是一個2-譜集》(The Numerical Range Is a 2-Spectral Set)。
驗證過程非常嚴謹。Michel Crouzeix本人——即2004年提出該猜想的數學家——審查了論證並確認其正確。數值分析專家也檢視了這份證明
。金山木還將所有研究資料公開在GitHub上,包括最終論文、提示詞、歷次迭代草稿、Lean 4形式化證明程式碼以及審計報告
。
金山木的成就引人注目,不僅因為問題本身的難度,更在於他的背景和方法。一位沒有正規高等數學學位的神經外科住院醫師,利用AI模型自主運行16小時,解決了一個困擾數學家20年的問題。
這個故事凸顯了一種新的研究模式:人類設計實驗條件和推理框架,而AI模型則大規模、自主地探索數學空間。這具體證明了AI可以成為數學研究中真正的夥伴——不僅是計算或搜尋的工具,而是能夠產生原創證明的系統。
這種方法是否能成為數學研究的標準流程,仍有待觀察。但就目前而言,金山木的成果無疑是2026年AI增強發現領域中最引人注目的例子之一。