top of page

GPT-5.4がFrontierMathベンチマークから初の未解決数学問題を解決

更新日:6月17日

GPT-5.4 solves its first open math problem from FrontierMath benchmark

GPT-5.4 Proの評価からの最近のログ 大規模言語モデルが複雑で未解決の数学を扱う方法の変化を示しています。FrontierMathベンチマーク(数百のオリジナルで研究レベルの問題のコレクション)に関わる特定の事例で、モデルはハイパーグラフ構築に関連する未解決の問題に成功裏に対処しました。この結果は、AIが学生レベルのコンペティションを解くだけでなく、新しい数学的限界の発見にも貢献していることを示しています。

FrontierMathEpoch AIによって開発されたIMO金メダリストやフィールズ賞受賞者との共同で設計された「情報漏洩防止」を目指したものです。モデルがトレーニングデータからのパターンマッチングに依存することが多いMATHやGSM8Kデータセットとは異なり、FrontierMathの問題は未公開であり、数時間または数日間の計算推論を必要とします。GPT-5.4が解決した問題は、特定のハイパーグラフの構築と、H(n)と表されるシーケンスの下限を見つけることです。

なぜFrontierMathティア4チャレンジはo1のような以前のモデルを停止させたのか

Why FrontierMath Tier 4 challenges stopped previous models like o1

o1やo3といった以前のベンチマークは、従来の数学コンテストで高い能力を示しましたが、「Tier 4」問題、つまり現役の数学研究レベルとされるFrontierMathセットの問題に直面すると、そのパフォーマンスは著しく低下しました。2024年後半、OpenAIのo1のようなモデルは、このデータセットで約2%の正答率を維持していました。2025年末までに、o3はこの数値を25%に改善しました, しかし、評価者が答えを知らない「オープン」な問題を解決することは、依然として課題として残っていました。

論理チェーンの複雑さに難しさがあります。標準的な推論モデルは、証明に数十回の遷移以上が必要な場合、中間ステップを幻覚させることがよくあります。FrontierMathは数千回の論理ステップを要求し、しばしばモデルに組み合わせ論やアルゴリズムの複雑さのような異なる分野を橋渡しすることを要求します。GPT-5.4は、純粋なテキストベースの推論から離れ、代わりにコード実行と形式検証のための統合環境を利用することでこれを乗り越えました。

PythonとLeanを使用したGPT-5.4のソリューションの仕組み

GPT-5.4のログから得られた重要な技術的教訓は、モデルが形式証明言語と組み合わせた「総当たり」アルゴリズム発見に依存していることです。英語で記号証明を書こうとする代わりに、モデルは3段階のワークフローに従いました。

  1. アルゴリズム構築: モデルはいくつかのPythonスクリプトを書いて、さまざまなハイパーグラフ構成を生成しました。これにより、数秒で数千の潜在的な構成をテストすることができました。

  2. 反復的改善: 初期スクリプトがH(n)の必要な下限を満たせなかった場合、モデルは失敗を分析し、構成パラメータを調整しました。

  3. 形式化: Python経由で候補構成が見つかると、モデルは形式検証言語であるLeanを使用して証明を記述しました。これにより、構成の論理的基盤が堅牢であり、自動カーネルによって検証可能であることが保証されました。

この方法は、以前のLLMで見られた「推論疲労」を回避します。Pythonに計算をオフロードし、Leanで検証することで、GPT-5.4は頭の中で問題を解決しようとする学生というよりは、専門的なツールのセットを管理するリサーチリードのように振る舞いました。

パターンマッチングから総当たりアルゴリズムの発見まで

From pattern matching to brute-force algorithm discovery

問題となったのは、ハイパーグラフ理論における特定のバウンドに関するものでした。以前は、数学者たちはnlog⁡2(n)が下限であると確立していましたが、多くの人がnln⁡(n)が実際の限界であると疑っていました。GPT-5.4は、2022年の研究論文(NSF-PAR 10338368)で見つかった既存の構成を一般化する方法を特定しました。

この既存のロジックを拡張することで、モデルは疑われていたバウンドに一致する構成を提供しました。これは人間の意味での「創造的なひらめき」ではなく、可能な数学的拡張の空間を非常に効率的に探索したものでした。モデルは、特定の条件が満たされれば、2022年の論文の方法論をより高次元のケースに適用できることを認識し、それを証明するコードを作成しました。

nlog⁡2(n)ハイパーグラフ下限の検証

解決策の最も注目すべき部分の1つは、証明の「bashy」または計算的な側面をモデルが処理できた能力でした。高度な数学では、多くの問題が、人間の数学者が潜在的な道筋を見ることができるが、何千もの順列を手動で検証する時間が不足しているという段階に達します。GPT-5.4はこのギャップを埋めました。

Python検証スイートを実行するためのbashスクリプトを生成し、研究の「退屈な」部分を効果的に自動化しました。Epoch AIのGreg Burnham解決策は正しいように見えるが、最終的な検証は元の問題の著者に委ねられると指摘しました。これは新しい現実を浮き彫りにしています。AIは今や、最終的な答えだけでなく、モデルのコードとLean形式化をチェックするという特定の種類の専門家レビューを必要とする数学を生成しています。

AI主導の数学研究における現実世界への影響

Real-world implications for AI-driven mathematical research

この出来事はAIにおける「進歩」の定義を変える。我々はもはや、モデルが微積分学の教科書をどれだけうまく繰り返せるかを測定しているのではない。未知の情報フロンティアをナビゲートする能力を測定しているのだ。技術分野のユーザーにとって、これらのモデルを使用する「専門家」アプローチは明確になった。AIに独自の検証コードを作成・実行する能力を与えることである。

GPT-5.4がこの事例で成功したことは、ボトルネックが科学におけるAIは単なる「知性」ではなく、フィードバックループの欠如でした。モデルがコードを通じて自身の試行を検証できるようになれば、人間の介入なしに自身の誤りを修正できます。これにより、モデルは受動的な参照ツールではなく、研究における能動的な参加者となります。

これらの結果がFrontierMathサブセットの残りの13の未解決問題全体で有効であれば、特定の科学分野におけるAGIのタイムラインは以前の推定よりも短くなる可能性があります。研究機関の焦点は、答えは不明だが、正しい答えの基準が厳密に定義されているFrontierMathのような、「検証可能な」環境の作成へと移行する可能性が高いです。

よくある質問

FrontierMathベンチマークとは何ですか?

FrontierMathはEpoch AIによって作成された高難易度の数学データセットです。これは、既存のトレーニングセットには見られない、研究レベルの数学をAIでテストするために設計された350のオリジナル問題で構成されています。

GPT-5.4はどのようにして未解決問題を解決したのですか?

このモデルは、Pythonを使用して構造を生成し、Leanを使用して形式検証を行いました。問題の要件を満たすハイパーグラフ構造が見つかるまで、さまざまなアルゴリズムアプローチを繰り返しテストしました。

GPT-5.4の数学的解は公式に検証されていますか?

この解は、Epoch AIの研究者による初期の自動チェックと内部レビューを通過しましたが、最終的な確認には、隠れた論理的欠陥がないことを保証するために、問題の著者が直接レビューすることが通常必要です。

GPT-5.4は数学のパフォーマンスにおいてo1とどのように異なりますか?

GPT-5.4は、o1の2%の精度と比較して、ティア4の問題(研究レベル)でより高い精度を示します。また、解を見つけるために複数のスクリプトを作成して実行するなど、長期間にわたるタスクに対する能力も向上しています。

AI数学においてLeanはなぜ重要ですか?

Leanは、数学的証明のすべてのステップが論理的に健全であることをコンピューターが検証できる形式証明言語です。Leanを使用することで、AIモデルは「保証された」証明を提供できます自然言語出力に共通する幻覚を起こさない。

モデルは具体的にどのような数学の問題を解きましたか?

モデルはハイパーグラフ構築と数列 H(n) の下限に関する問題を解決し、2022年の研究論文で知られている構築を成功裏に拡張して、新しい、より高い上限に到達しました。


 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page