Anthropicによれば、Claudeはフェルマーの最終定理の既知の証明を11日間で完全にLean形式化した。コードは約1300万行で、最終的な依存関係には約2万9500の中間定理が含まれるという。 Prove2Meを基にした仕組みが、定義・補題・定理を依存関係グラフとして管理。複数のエージェントが再利用可能な小課題を分担し、Leanの検査結果を次の修正に使ったとされる。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did Anthropic’s Claude reportedly produce the first end-to-end Lean computer-verified proof of Fermat’s Last Theorem in 11 days—includin. Article summary: Anthropic says Claude did not discover a new proof of Fermat’s Last Theorem (FLT); it translated a known modern route into a complete Lean artifact that Lean’s kernel can check. The reported advance is the scale and rela. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Anthropicは、Claudeがフェルマーの最終定理(FLT)の最初の完全な、エンドツーエンドでコンピュータ検証可能なLean形式化を作成したと報告している。重要なのは、ClaudeがFLTの新しい証明を発見したわけではない点だ。すでに確立された現代的な証明の道筋を、Leanが機械的に検査できる極めて大規模な成果物へ変換した、というのが主張の核心である。Anthropicによれば、作業は主に自律的なエージェントによって約11日間続き、Leanコードは約1300万行に達した。21
5
FLTは、自然数 (a,b,c) と (n\geq3) について、(a^n+b^n=c^n) が非自明な解を持たないという定理である。MathlibにおけるLeanの定式化では、解があれば (a=0)、(b=0)、(c=0) のいずれかでなければならない、と表現される。これは「正の整数解は存在しない」というよく知られた言い方と同値だ。31
プロジェクトは、ワイルズ/テイラー=ワイルズによる証明戦略のうち、Darmon–Diamond–Taylorによる提示を採用した。つまり、証明の経路を新規に考案したのではない。通常の論文なら「標準的な議論から従う」と省略できる定義、仮定、補助定理、推論の接続まで、形式化では全てを明示する必要がある。インペリアル・カレッジ・ロンドンのFLT形式化プロジェクトも、ワイルズ/テイラー=ワイルズ証明の現代的な変種を採るとしている。5
11
Leanのような証明支援系では、もっともらしい自然言語の説明だけでは証明にならない。各推論を型検査できる形で書き下し、その結果が形式化済みの定義・補題・定理へと連なっていなければならない。
Anthropicの報告では、プロジェクト中に約3万300のコンピュータ検証済み定理が作られ、そのうち約2万9500が最終定理へ至る依存関係に含まれた。成果物は代数学、幾何学、調和解析、数論にまたがるという。21
5
したがって「11日」という数字は、FLTをめぐる長い知的営みが11日間に短縮された、という意味ではない。Anthropicは生成トークン数を約60億としており、そこには候補となる証明、Leanによる検査、エラーを受けた修正、長期間走る形式化プロジェクトを整理するための実装作業が含まれる。5
報告された成果は、単一モデルが膨大な証明全体を文脈内に保持し続けた結果ではない。Anthropicによると、初期の試行は前進した一方で、プロジェクト全体の共有状態を維持しにくかった。成功した実行では、共同数学形式化向けプラットフォームであるProve2Meを基にしたハーネスを用いたという。5
29
中核は、有向依存関係グラフによる仕事の管理だ。
Prove2Meは、AIエージェントが再利用可能な形式証明を持ち寄る「ミッション」を立ち上げる仕組みとして説明されている。29 一続きで壊れやすい巨大タスクを、多数の検査可能な小問題へ分割し、個々のモデル実行の外部にプロジェクト記憶を作る発想だ。
Anthropicは、最終プロジェクトには未証明のまま命題を受け入れるLeanのプレースホルダー sorry がなく、Leanの標準的な3公理のみに依拠していると説明する。5
これは、AIが自然言語で一見もっともらしい証明文を書いた、という話よりはるかに強い。Leanのカーネルは、符号化された各段階が、システムの論理規則・公理・インポートされた依存関係の下で成立するかを検査する。Anthropicはさらに、最終の主張がMathlibにある FermatLastTheorem の定式化と一致することを確認したとしている。5
31
ただし、検査の境界も明確だ。カーネルが検証するのは、符号化された形式命題である。形式的な定義や中間命題が、もとの非形式的な数学の意図を正確に表しているかは自動的には保証されない。公開された成果物を第三者がコンパイルできるか、依存関係を専門家が監査できるかが、今回の主張を評価する重要な試験になる。
Anthropicの報告によれば、インペリアル・カレッジ・ロンドンの数学者ケビン・バザードはこの結果を「並外れた自動形式化の達成」と評した。21 意義は、AIエージェントが単発のLean演習を解けることだけではない。従来なら協調する人間が何年もかけると想定されていた、深く積み重なった再利用可能な形式化を組み上げた、という主張にある。
再現可能でコスト面でも実用的なものになれば、形式化には次のような可能性がある。
もっとも、これは数学者の判断を自動的に置き換えるという話ではない。形式証明は論理的に正しくても、そもそも意図と異なる命題を形式化している可能性は残る。また、1300万行の成果物を生むための計算資源とエンジニアリングのコストも小さくない。
今回のFLTの報告は、すでに証明済みの大定理を対象とし、最終成果物が独立に検査可能であることを目指している点で、AI支援による数学形式化の重要なベンチマークといえる。ただし、「Claudeがフェルマーの最終定理を新たに解決した」と表現するのは正確ではない。
最も適切な理解はこうだ。Anthropicは、依存関係グラフによるタスク分解と形式検証からのフィードバックを使い、協調したAIエージェント群が既知の大規模証明を、前例のない規模でLean開発へ変換したと報告している。21
5
29
今後の焦点は、外部研究者がビルドを再現できるか、形式化が意図した数学を正しく表すかを監査できるか、部品を別の研究で再利用できるか、さらに他の高度な数学でも同程度の成果を得られるかにある。今回が一度きりのエンジニアリング上の偉業なのか、それとも現代数学の証明の作り方・確かめ方を変える持続的な転換なのかは、これらの検証によって決まる。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Anthropicによれば、Claudeはフェルマーの最終定理の既知の証明を11日間で完全にLean形式化した。コードは約1300万行で、最終的な依存関係には約2万9500の中間定理が含まれるという。
Anthropicによれば、Claudeはフェルマーの最終定理の既知の証明を11日間で完全にLean形式化した。コードは約1300万行で、最終的な依存関係には約2万9500の中間定理が含まれるという。 Prove2Meを基にした仕組みが、定義・補題・定理を依存関係グラフとして管理。複数のエージェントが再利用可能な小課題を分担し、Leanの検査結果を次の修正に使ったとされる。
Leanの検証が保証するのは、形式化された命題が指定された公理と依存ライブラリから導かれることだ。意図した数学的意味が各定義に正しく写されているかは、なお人間による監査が必要になる。