10の成果は、高次元幾何学、符号理論、算術回路計算量、群論、作用素環論、量子計算量、格子暗号、極値組合せ論という異例に幅広い分野にまたがる。
OpenAIはAstraモデル自体を公開せず、代わりにGitHub上でApache 2.0ライセンスのLean 4証明証明書を公開した。報告によると「sorry」カウントはゼロ、つまり10の形式化された証明すべての全ステップが完全に検証されている。このアプローチは、AIが生成した推論が正しいかどうかの通常の議論を回避する。すなわち、証明アシスタントが発見方法に関係なく機械的に正しさを強制するからだ。
Noam Brown氏のような研究者が科学的推論の大きな一歩と称賛する一方、懐疑論者からは重要な疑問が提起された。
「超大物」ではない。 複数の観測者は、10の問題の中にClayミレニアム問題(P vs. NP問題やリーマン予想など)は一つも含まれていないと指摘した。これらの問題は確かに重要な未解決問題だが、同じような注目度ではない。
査読なし。 成果は査読付き数学雑誌や学会 proceedings での事前発表なしにOpenAIから直接発表された。批判者は、AIによる発見と人間による枠組みの線引きは依然として曖昧だと主張。Openai自身も、AIと数学に関するライデン宣言に言及することでこの緊張関係を認めている。
汎用性への懐疑。 認知科学者のGary Marcus氏は、形式数学への成功は「特殊ケース」であり、より広範な科学的推論に汎化するとは限らないと主張。数学は安価で検証可能な合成データを生成しやすいが、これはほとんどの科学分野には当てはまらないと指摘した。
再現性への懸念。 モデルが未公開であり、具体的なプロンプト手法が完全には開示されていないため、生成プロセスの独立した検証は不可能だ。一部の批評家は、Astra自体にアクセスできない状態での結果再現の難しさに焦点を当てた。
商業的タイミング。 この発表はOpenAIが次期モデルファミリーのポジショニングを進めるタイミングで行われ、研究成果が科学的厳密性よりもマーケティング効果のためにタイミングを図られたのではないかとの疑問が生じている。
もし証明が専門家の精査に耐えれば、複数の成果は数十年にわたって開かれたままだった問題を閉じることになる。特に、非sofic群の初の明示的構成は、Mikhail Gromovが1999年にsoficityを導入して以来25年以上にわたって未解決だった問題を解決する。批判者でさえ、OpenAIは通常の企業発表よりもはるかに検証可能な資料を提供したことを認めている。
しかし、より広い問いは、Astraが数学をできるかどうかではない。形式的で検証可能な問題を狭い領域で解くことが、汎用的な科学的推論に変換されるかどうかである。現時点での答えは、まだ証明されていない。