top of page

OpenAIの数学原稿が分野に殺到、数学者たちは反発

19 時間前
読了時間: 18分

OpenAIは10月6日、700本を超える数学原稿を公開し、AI生成研究に関する同社史上最大の主張とともに、検証をめぐる危機を生み出した。

OpenAIの数学原稿は、数論、幾何学、位相幾何学、計算機科学などの分野にまたがる数百の関連成果を扱う。これらは、約4,000件の未解決問題を対象にテストされた、未公開の社内モデルから生まれた。

OpenAIはこのコレクションを人類の知識への貢献として提示した。しかし多くの数学者は、民間の研究所が膨大な査読負担を公共の研究コミュニティへ移転したものだと受け止めた。

この対立は、原稿数そのものより重要だ。研究者はいま、どの論証が正しく、どの結果が独創的で、どの論文に注目すべきかを判断しなければならない。その一方で、自身のプロジェクト、学生、キャリアを守る必要もある。

今回の公開は、AI生成数学をめぐる未解決の論争のさなかに行われた。以前のOpenAIの発表も、帰属、未公表の人間による研究、そして証明を生み出すことと理解を創出することの違いをめぐる疑問をすでに提起していた。

数学コミュニティのブログ、Proofs and Promptsには、数日以内に100件を超える反応が集まった。回答は高揚感から悲嘆、怒り、職業上の不安まで幅広かった。

中心的な対立は、単純に人間対機械というものではない。OpenAIの大量成果生産モデルと、説明、批判、教育、共有された所有意識という、より緩やかなプロセスとしての数学との衝突である。

OpenAIの数学原稿は査読システムに先行して到来した

OpenAIは、専門家が検討すべき一つの著名な証明を発表したのではない。一度に研究アジェンダ全体を公開した。

同社は当初、372の成果ファミリーに分類された722本の原稿を公開した。各ファミリーには、主要な結果、補助的な論証、帰結、代替証明が含まれうる。

現在の公開リポジトリには、同じ372ファミリーに719本の原稿が掲載されている。この変化は、コレクションがすでに改訂されていることを示している。

OpenAIによると、論文と補助的な成果物は、未公開の社内フロンティアモデルによって作成された。同社は、既存の数学テストが容易になりすぎた後、このモデルを評価した。

評価では約4,000件の問題が提示された。OpenAIによれば、平均的な結果一つあたり、ChatGPT Proの推論3時間分に相当する計算能力が消費された。

これらの数字は、並外れた処理量を示している。しかし、すべての原稿が正確で、新規性があり、読みやすく、重要であることを裏付けるものではない。

OpenAIは、コレクションに異なる検証段階の研究が含まれることを明示的に認めている。また、形式化されていない結果の一部には問題が含まれる可能性があると警告している。

形式化とは、証明検査ソフトウェアが一行ずつ検証できる言語へ論証を翻訳することだ。OpenAIはその目的のために設計されたプログラミング言語兼証明支援系であるLeanを使用した。

リポジトリによれば、最上位の結果のおよそ42パーセントが形式化されている。これは相当な割合だが、注目を集める結果の大半はその検証カテゴリーの外に残されている。

Leanによる検査が成功しても、研究上の問いの一部にしか答えない。定義と形式的な記述が意図した定理を適切に捉えていることを前提に、符号化された論理的論証を検証できる。

新規性、重要性、適切な帰属、有用な解説を自動的に確立するわけではない。そうした判断は依然として、人間による文献知識に依存する。

リポジトリには、10件の簡略化された推論要約も含まれている。これらは、円周率の無理数指数や行列乗算などに関する選択された結果を扱う。

10件の要約では、数百に及ぶ成果ファミリーの知的地図を提供できない。研究者は依然として、専門分野ごとに重要性が大きく異なる未知のカタログに向き合うことになる。

公開声明でOpenAIは、この研究が人類の知識を前進させることを望むと述べた。また、改訂プロトコル、引用に関する指針、さらなる形式化を約束した。

同社は今後の公開で、引用、解説、提示方法を改善すると述べた。この約束は、現行パッケージの弱点を暗に認めるものでもある。

OpenAIはInstitute for Advanced Studyの独立した諮問グループにも相談した。しかし、こうした協議があっても、研究者が公開プロセスを圧倒的だと表現することを防ぐことはできなかった。

この規模は、ただちに中心的な緊張を生んだ。モデルは、関連分野の専門家が読んで文脈化し説明するよりも速く、候補となる結果を生成できる。

したがって公開は、最初の一歩にすぎなかった。未解決の問いは、その後に続くすべてのコストを誰が負担するのかということだ。

検証の負担は数学者へ移った

OpenAIが供給を生んだモデルへの統制を維持する一方で、この公開は専門家の注意を希少資源へと変えている。

従来の論文は、特定可能な著者、分野ごとのコミュニティ、セミナー、査読を中心に構築されたシステムに入る。これらの仕組みは完全ではないが、責任を分散する。

通常、著者は手法を説明し、異議に答え、不明瞭な箇所を改訂し、知識を持つ聴衆の前で主張を擁護する。読者は、特定の補題がなぜ重要なのか、あるいはアイデアがどのように生まれたのかを尋ねられる。

OpenAIの数学原稿は、その関係を断ち切る。名目上の著者は実質的に企業であり、モデルは外部研究者には利用できないままである。

不透明な論証を発見した数学者は、それを生成したシステムに質問できない。OpenAIの従業員が説明を提供することはあっても、すべての内部推論経路を再構成することはできない。

この問題は、規模が大きくなるほど深刻になる。人間の専門家が書いたものであっても、難解な論文には数週間から数カ月にわたる集中した読解が必要になりうる。

数百本の論文は、検証が始まる前からトリアージの問題を生む。研究者は、限られた時間を割くに値するほど信頼できる主張を選ばなければならない。

一部の原稿は、人生をかけた研究を形作ってきた問題に関わる。助成金申請、博士論文、将来の出版物がその結果に左右される場合、専門家は解決を主張する論文を単に無視できない。

これは非対称なインセンティブを生む。結果が精査を生き残ればOpenAIは利益を得る一方、独立した研究者は誤りを発見するコストの大部分を負担する。

Enrico Fatighentiは、質の低い人間の投稿であればすぐに却下されるかもしれないと論じた。これに対してAI生成の研究は、モデルの能力が高いと認識されているため、専門家に意味の再構築を迫りうる。

Tristan Humbertは、博士論文の中心にある問題について、読めないと考えた資料に遭遇したと説明した。また、ポスドク研究の計画も見直さなければならなかった。

これらの反応は、自動化された研究がもたらす実務的な帰結を示している。原稿の生成が安価になったからといって、検証が無料になるわけではない。

ボトルネックは、テキストの作成から信頼の確立へ移る。この移行はすでにソフトウェアでも見られ、コードを生成することは、レビュー、セキュリティ確保、保守より容易になっている。

数学はさらに厳しい基準を課す。論文は、形式的な結果を既存理論、関連する引用、理解可能なアイデアの連鎖と結び付けなければならない。

OpenAIは、改訂を記録し、旧版を保存すると述べている。これは、特に原稿が消えたり変更されたりする場合、監査可能性にとって有用だ。

しかし、バージョン履歴は説明責任を伴う学術的対話の代わりにはならない。研究者には、意図、依存関係、関連研究についての詳細な問いに答えられる人が依然として必要だ。

コミュニティの反応は、この負担が均等に分配されていないことを示している。主張された結果に最も近い専門家ほど、それを調査する最大の圧力を感じる。

彼らが得る見返りは不確実なままだ。OpenAIの研究を確認すれば同社の主張を強める可能性があり、誤りを正しても、当初の発表ほどの評価を得られないかもしれない。

選別の問題もある。専門家は目を引く主張を優先し、より目立たない有効な結果にはほとんど注意が向かない可能性がある。

そのため、このコレクションには重要な数学と、検討されないまま残る誤りの両方が含まれうる。量の多さは、それらを見分けることをより難しくする。

これが、原稿数が科学的進歩の弱い尺度である理由だ。使える結果には、検証、文脈、説明、そしてそれを受け継げるコミュニティが必要である。

証明の豊富さは数学的理解と衝突している

OpenAIは証明の豊富さを生み出したが、数学者たちは、その豊富さが知識を生むのか、それとも処理すべき対象を増やすだけなのかを問いかけている。

複数の反応は、この公開を能力の真の転換を示す証拠として扱った。Roman Sauerは、自身が開発した技法が、非常に異なる二つの問題の解答に現れていることを認識した。

彼はその応用を深く創造的だと呼び、驚愕したと語った。この反応は、原稿が単なる自動化された模倣にすぎないという単純な主張を退けるものだ。

Ben Greenは、大型研究助成の背後にあるアジェンダの多くに触れる結果を見つけたとされる。彼はコレクションの側面を衝撃的だと表現した。

Alvaro Lozano-Robledoは、重要な区別を保ちながら、モデルがリーマン予想に向けて進展している点を強調した。準リーマン結果は重要かもしれないが、元の予想を解決するものではない。

この区別はカタログ全体で重要だ。原稿は、著名な親問題を解くことなく、特殊な場合を決着させたり、評価を改善したり、条件付き定理を確立したりする可能性がある。

見出しは、こうした違いを「未解決問題を解いた」という表現に圧縮できる。研究者にはできない。

最も前向きな解釈は、AIが個々の研究者には利用できない規模で数学的可能性を探索できるようになったというものだ。アプローチを試し、技法を組み合わせ、専門分野をまたぐ候補論証を生み出せる。

この能力は、数学者が他の方法では見つけられなかったつながりを見出す助けになるかもしれない。また、見過ごされてきた問題に新しい手法をもたらす可能性もある。

Danny Calegariは、人間とAIの協働を祝う理由があると述べた。あるプロジェクトでは、AnthropicのClaudeが音楽付きの数学アニメーション用コードを書いた。

Constantin Koglerは、高度なモデルと協働し、必要に応じて新しいアイデアに出会えることへの期待を表明した。アクセスできる研究者にとって、その体験は拡張された創造的環境のように感じられるかもしれない。

懐疑的な解釈は、生成が終わる地点から始まる。Stephen Wolframは、膨大な数の定理を生み出しても、人々がどれを価値あるものと見なすかは特定できないと指摘した。

数学的重要性は、部分的には趣味や審美眼に依存する。研究者が問いを選ぶのは、答えが構造を照らし出し、分野を結び付け、生産的な新問題を生み出すからだ。

利用可能な予想を解くよう最適化されたモデルは、人間が作った研究アジェンダを継承する。したがって、その成功は探索能力を測ることはあっても、独立した数学的判断を示すものではない。

Johannes Schmittは関連する解釈を示した。OpenAIは、より単純な評価ではフロンティアモデルを試せなくなったため、主に未解決問題を利用した可能性がある。

この見方では、論文は学術コミュニティへの貢献である以前に、モデル開発の出力である。これらの活動のインセンティブは異なる。

ある研究所は、難易度の高いベンチマーク、測定可能な進歩、そして汎用的な推論能力の証拠を求める。数学者が求めるのは、同僚が検証し、教え、発展させられる説明だ。

その結果は技術的に印象的であっても、こうした社会的機能を支えられない場合がある。これこそが、OpenAIの数学論文群の背後にある、より深い対立である。

Terence Taoは、研究者が咀嚼すれば実りあるものになり得る巧妙なアイデアを目にしたと報じられている。同時に、研究を発表し教えることのできる人々が不在であることにも苛立ちを示した。

Ian Agolは、この課題をグリゴリー・ペレルマンによるポアンカレ予想の研究への反応になぞらえた。チームは何年もかけて、ペレルマンの簡潔な論文を拡充し、明確化した。

この歴史的な比較には限界がある。ペレルマンは一貫した知的プログラムを持つ人間の著者であり、数百本の論文を生み出すシステムではなかった。

それでも、この比較は、出版と共同体による理解がこれまでも同一ではなかったことを示している。AIは規模を変えることで、その隔たりをさらに広げる。

問われているのは、モデルが本格的に見える数学を生み出せるかどうかではない。より差し迫った問題は、制度がその出力を永続的な知識へと変換できるかどうかだ。

反発の背景にあるのは、キャリア、功績、そして統制だ

多くの数学者が拒んでいるのは自動化そのものではない。権限を共有せずにキャリアの序列を変え得る公開モデルに反対しているのだ。

Hugo Duminil-Copinは、機械がいずれ何らかの面で研究者を上回ると予想していたと書いた。しかし、これほど多くの大問題が一度の発表で扱われるとは想定していなかった。

彼の反応は、この出来事における感情的な非対称性を捉えている。研究所にとって公開は実証だった一方、研究者にとっては自らの人生を突如変える出来事だった。

Matt Zaremskyは、長年にわたる慎重な進歩を考古学的発掘にたとえた。彼の比喩では、裕福な企業が現れ、爆薬を使い、骨格を持ち去って立ち去る。

不満は、完全な骨格に価値がないことではなかった。その過程が、研究に職業的・知的な意味を与えていた緩やかな発見の過程を消し去ったことにある。

Tasmin Chuも同様の区別を示した。ある命題が真かどうかを知ることと、その問題を自ら考え抜く時間を持つことは異なる。

多くの研究者にとって、その思考は付随的な労働ではない。それこそが彼らを数学へ引き寄せた活動である。

博士課程の学生は、この対立をより鋭い形で経験する。彼らの資格は、限られた期間に独創的な研究を生み出すことに依存している。

AI生成の論文は、警告なく同じ問題に到達し得る。誤った主張であっても、専門家が解決するまで学生に研究方針の変更を強いる可能性がある。

ポスドク採用は不確実性をさらに増幅させる。応募者は将来の研究計画を説明しなければならないが、大規模な民間モデルが、彼らの計画領域全体にまたがる主張を突如発表し得る。

シニア研究者には、適応を助ける評判とネットワークがある。キャリア初期の数学者は保護が少なく、新しい研究が検証される前に評価されるかもしれない。

功績の帰属もまた、もう一つの断層線を生む。論文群は、公開済みの数学、既存の予想、そして数十年にわたる人間の研究で育まれた技法に依拠している。

OpenAIは引用情報を提供しているが、適切な帰属には参考文献リストを生成する以上のことが必要だ。どのアイデアが真に新しく、どれが既知の議論を再包装したものなのかは、専門家が判断しなければならない。

先のNavier-Stokesをめぐる論争は、この懸念を強めた。研究者らは、OpenAIの研究が未発表の人間による研究と交差していると主張し、優先権に関する疑問を提起した。

今回の公開は、個々の論文における不正行為を証明するものではない。しかし、数学者たちがこのカタログに限定的な信頼しか寄せなかった理由は説明している。

Henry Wiltonは、名前を明かした人間の著者や詳細な失敗率の情報がないことを批判した。彼にとって、その提示の仕方は、数学がもはや人間の営みとして扱われていないことを示唆していた。

OpenAIは、およそ4,000件の問題に取り組んだことを開示している。また、論文がどのように結果のファミリーへ集約されたかも説明している。

しかし、その数字には依然として重要な疑問が残る。読者は選定基準、失敗したアプローチ、破棄された出力、あるいは公開の背後にある人間の判断を容易には再構成できない。

この不透明性は、成功をどう解釈すべきかに影響する。数千回の試行から数百件の有望な結果を生み出すモデルは印象的だが、その比率だけではほとんど語れない。

研究者は、問題がどう選ばれ、出力がどうフィルタリングされたかを知る必要がある。また、正確性と独創性について独立した検証も必要だ。

最も厳しい批判は、研究課題の統制に向けられている。Martin Bridsonは、AI研究所にどの成果が共同体の注目に値するかを決めさせることに警鐘を鳴らした。

これは理論上のリスクではない。研究者はすでに、民間で生成された研究を読み、検証し、説明することへ時間を振り向けている。

その注目は、知的、教育的、または社会的な価値に基づいて選ばれた問題を押しのける可能性がある。また、モデルが最も効率的に取り組めるベンチマークを持つ分野に報酬を与えることにもなり得る。

OpenAIは、主要なAI生成結果の理解をめぐるワークショップ、会議、特別プログラムに資金を提供する計画だとしている。こうした支援は負担の一部を軽減し得る。

同時に資金提供は、対応に対する同社の影響力を強める。論文を生み出し、モデルを管理し、それを解釈する取り組みに資金を出すのは同じ機関だからだ。

根底にある問題はガバナンスである。誰が問題を選び、主張を検証し、功績を割り当て、いつ結果が公の注目に値する状態になったと決めるのか。

統制が共有されなければ、証明の豊富さは依存へと変わり得る。数学者は出力にアクセスできても、自分たちの分野を形作る条件への影響力を失う。

この公開が数学の転換点と見なされる前に必要なこと

このコレクションが永続的な研究となるか、巨大で不安定な実証にとどまるかは、三つのシグナルが決める。

第一のシグナルは独立した検証だ。専門家はOpenAIの内部評価だけに頼らず、代表的な注目結果を確認しなければならない。

Leanによる形式化は、このプロセスを支援できる。ただし査読者は、形式的な記述が、読者が確立されたと考える数学的主張に対応していることも確認しなければならない。

OpenAIは、形式的成果物と訂正履歴の公開を継続すべきだ。外部グループは、透明な構成と記録された依存関係を用いて検証を再現すべきである。

複数の論文が撤回または改訂されても、コレクション全体が無効になるわけではない。科学研究は査読の過程で変化する。

それでも、高い訂正率は自律的な研究の信頼性に関する主張を弱めるだろう。多様な分野で低い訂正率が維持されれば、その主張は大きく強化される。

第二のシグナルは、数学者がアイデアを継承できるかどうかだ。それには講演を行い、より明快な解説を書き、再利用可能な技法を特定し、後続研究を生み出すことが含まれる。

誰にも説明できない正しい証明は、生きた学問分野に統合することが依然として難しい。それは命題を解決しても、生産的な研究プログラムを生み出さないかもしれない。

Proofs and Promptsは、この咀嚼のプロセスに関する初期の記録を提供している。集められた反応には、技術的な興奮、問題ごとの批判、そして職業上の帰結に関する考察が含まれる。

反応の概要はまた、公的な報道が反応を恐怖へと矮小化すべきでない理由を示している。研究者たちは、研究の質と意味の両方について意見が分かれている。

特定の結果ファミリーに焦点を当てたセミナーや独立した概説論文に注目したい。こうした成果は、共同体が論文を共有された理解へと変換できることを示すだろう。

そのような研究がなければ、生産が吸収を追い越したことを示唆する。論文は技術的に興味深くても、文化的には切り離されたままかもしれない。

第三のシグナルは、OpenAIのモデル公開方針だ。同社は、結果を生成したシステムを責任ある形で公開する方向で取り組んでいるとしている。

アクセスが得られれば、研究者は新たな問題を試し、失敗パターンを調べ、協働的な利用と自律的なバッチ生成を比較できる。

アクセスが制限されれば、現在の不均衡は維持される。OpenAIが主たる生産者であり続け、大学と独立研究者は下流の査読者として機能することになる。

実用的な公開には、有意義な評価に足る方法論上の詳細も必要だ。ブランド化されたインターフェースだけでは、科学的再現可能性は提供されない。

ここでは競争も重要になる。Anthropic、Google DeepMind、そして専門的な定理証明プロジェクトも、高度な数学向けシステムを開発している。

異なる公開モデルは、より良いアクセス、より強固な来歴情報、あるいはより説明責任のある公開慣行をOpenAIに提供するよう圧力をかける可能性がある。一方で、量の問題を悪化させる可能性もある。

外部分析は、AIが支援から自律的な生産へと急速に移行したソフトウェア開発と数学を比較している。

この比較は有用だが、数学における成功は出力だけで測ることはできない。定理には、本番環境でプログラムを実行することに相当するデプロイテストは存在しない。

その価値は、証明検証、解釈、引用、教育、そしてさらなる発見を通じて育まれる。議論が正しくても、これらのプロセスには時間がかかる。

したがって読者は、二つの早計な結論を避けるべきだ。この公開は、数百の有名問題が決定的に解決されたことを立証するものではない。

また、数学者が提示の仕方を嫌っているというだけで、無意味なテキストとして退けることもできない。複数の専門家は、真に重要と思われる結果や技法を特定している。

OpenAIの数学論文群は、数学的推論に関する実験であると同時に、自動化された研究出版に関する実験でもある。モデルが論文を生成したが、その後どうなるかを決めるのは制度である。

開発者やナレッジワーカーにとって、この教訓は数学を超える。低コストの生成は、レビュー、来歴情報、文脈に基づく判断の価値を下げるのではなく、むしろ高める。

大学にとって当面の課題は、独立した検証能力を整えながら、キャリア初期の研究者を守ることだ。すべての主張が決着するのを待てば、学生は無防備なままになる。

OpenAIに求められる基準は、もはや別のカタログを生み出すことを超えている。研究者が無給の管理人になることなく、研究を検証し、異議を唱え、理解し、その上に積み上げられることを示さなければならない。

今後数カ月は、具体的な問いに答えるはずだ。これらの論文は新たな探究共同体を生み出すのか、それとも専門家が出力キューを整理し続けるだけなのか。

その答えが、10月6日が新たな数学的協働の形を示す日となるのか、それとも注意力の危機の始まりとなるのかを決める。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page