XiaohongshuのdotsモデルがIMO 2026で満点獲得を主張、しかし真の試金石は検証
Xiaohongshuは、同社のdots-note 3.0モデルが2026年国際数学オリンピックの問題で42点満点を獲得したと発表した。XiaohongshuのdotsモデルがIMO 2026で満点を獲得したという主張は全6問を対象としており、首位タイと報じられた7人の人間の出場者に並ぶ。
この結果が事実であれば、AIの数学的推論は、Google DeepMindとOpenAIが2025年に打ち立てた節目を超えることになる。両社の実験的システムは、完全解答5問に相当する35点で金メダル水準に到達した。満点答案は、この特定の試験における最後の目に見える隔たりを解消する。
ただし、dots-note 3.0は学生競技に出場者として参加したわけではない。Xiaohongshuは社内モデルを大会問題で評価し、その結果をdots研究チームを通じて公表した。この違いは重要だ。得点だけでは、モデルが利用できた情報、計算資源、プロンプト、選択プロセス、採点手順が明らかにならないからだ。
したがって中心的な問いは、AIが説得力のある6つの証明を生成したかどうかだけにとどまらない。その評価が、人間の出場者、Gemini Deep Think、OpenAIの実験的システム、そして将来の公開モデルとの有意義な比較を可能にするほど厳密に管理されていたかどうかである。
Xiaohongshuが主張するdots-note 3.0の成果
報告された42点という結果が重要なのは、満点と、最初から最後まで自然言語で処理するアプローチを両立しているためだ。
dotsチームによると、dots-note 3.0にはIMO 2026の全6問について、オリジナルのLaTeX版が与えられた。LaTeXは、数式や技術的な表記を表現するために一般的に使用される文書形式である。システムは各問題を形式的な定理証明言語に変換することなく、完全な解答を生成したとされる。
チームのモデルに関する説明によると、dots-note 3.0はすべての問題で満点を獲得した。これにより、最高得点となる42点を記録した。IMOでは各問題に7点が配分され、出場者は2日間の各試験日に3問ずつ解く。
第67回IMOは上海で開催され、試験は7月15日と7月16日に実施された。2026年の規則では、Shanghai High Schoolが試験会場として指定され、各日の試験時間は4時間30分と定められている。
Xiaohongshuは、dots-note 3.0をdots3ファミリーで最も軽量なモデルと説明している。同社は、「最も軽量」という表現を、パラメータ数、アクティブパラメータ数、推論コスト、メモリ使用量、実処理時間の観点から比較できるだけの技術的詳細を開示していない。また、モデルの重みも公開していない。
チームによると、このモデルは再帰的な自己批評を利用している。このプロセスでは、システムが中間的な推論を見直し、考えられる誤りを特定し、最終回答を生成する前にアプローチを修正する。この手法は、1回の途切れない応答というより、内部でレビューを繰り返す方法に近い。
この仕組みは、見込みのある解法であっても、裏付けのない1つのステップによって破綻し得るオリンピック数学に適している。モデルは論証を見つけ、内部的な整合性を検証し、不備を修正し、専門家が採点できるほど明確に最終的な証明を表現しなければならない。
報告された結果は、答えだけを求める数学ベンチマークとも異なる。IMOの問題では証明が求められるため、正しい数値的結論に到達するだけでは不十分だ。重要な推論はすべて正当化されなければならず、隠れた欠陥があれば、一見完全な解答でも部分点にとどまる可能性がある。
Xiaohongshuによると、dots-note 3.0はこのプロセスを最初から最後まで完遂した。ただし、公開された説明では、すべてのプロンプト、出力、タイムスタンプ、再試行、計算資源の制限、採点者の身元を網羅した完全な評価資料はまだ提供されていない。
この資料が欠けているからといって、結果が虚偽だということにはならない。ただし、読者は42点満点という結果を、より完全な独立検証を待つ企業報告のベンチマーク結果として扱うべきである。
満点がAI数学競争を変える理由
金メダル水準の成績は、モデルがIMO答案の大半を解けることを示した一方、満点という主張は、同じ試行ですべての問題を突破できることを意味する。
2025年、Google DeepMindの高度なGemini Deep Thinkシステムは6問中5問を解き、35点を獲得した。IMOのコーディネーターは、学生の解答に用いるものと同じ採点基準に基づいて、その自然言語による証明を採点した。
同社のDeep Thinkの評価は、2024年のシステムからの飛躍的な進歩を示した。AlphaProofとAlphaGeometry 2は28点を獲得していたが、専門的な形式言語に依存し、数日間の計算を必要としていた。
一方、Geminiの2025年システムは、公式の問題文を読み、大会の制限時間である4時間30分以内に自然言語で証明を書いた。並列推論を使用し、複数の可能なアプローチを探索して組み合わせた。
OpenAIも2025年、実験的な汎用推論モデルで35点を獲得したと報告した。その発表は、IMOによる調整済みの情報公開プロセスが完了する前に行われたため、精査の対象となった。Googleの提出物は、IMOの採点者から明示的な認定を受けた。
公式のメダルとメダル水準の成績との違いは、見失われやすくなった。専門家が解答を評価した場合でも、AIシステムは通常の学生出場者ではなかった。その得点は、成果が出場者の答案と比べてどの程度だったかを示すものであり、機械がナショナルチームに参加したことを意味するものではない。
同じ厳密さが、XiaohongshuのdotsモデルによるIMO 2026満点獲得の主張にも当てはまる。意味のある主張は、dots-note 3.0がチームの評価条件下で42点に値する証明を生成したとされることだ。人間の出場者を順位表から押しのけたわけでも、学生メダルを受け取ったわけでもない。
それでも、6問を解くことは単なる7点の上積み以上の意味を持つ。最終問題は、多くの場合、問題全体の中でも特に難しく、金メダル水準のモデルは比較的解きやすい5問を解くことでその得点に到達できる。満点を獲得するには、問題セット全体で成功しなければならない。
2026年には、7人の人間の出場者が満点を獲得したと報じられている。これは、主張されたモデルの結果が、金メダルの基準をわずかに上回るというより、人間の得点分布の頂点に位置することを意味する。
また、他の研究機関にとっての競争目標も変わる。前年の35点に並ぶだけでは、もはやトップの結果とは見なされなくなる。代わりにAI開発者には、答案全体、安定した再現成績、そして能力と大規模な探索とを区別できる管理された評価を報告する圧力がかかるだろう。
この圧力はGoogleとOpenAIだけにとどまらない。オープンウェイトの推論モデルの開発者も、検証すべき具体的な主張を得た。より小規模なモデルが満点の成績を再現できれば、最も強力な数学的推論には最大規模のプロプライエタリシステムが必要だという前提が覆されることになる。
重要なのは「満点の成績を再現する」という部分だ。1回の成功は可能性を証明できるが、信頼性までは証明できない。科学や商業の利用者が重視するのは、答えがまだ分かっていない場合に正しい証明を得られる確率である。
競争の次の舞台はそこに移る。見出しとなる得点は42点だ。より難しいベンチマークは、別の評価者が同じ結果を再び得られるかどうかである。
再帰的な自己批評が証明作成の最難関に対処する仕組み
Dots-note 3.0は修正を通じて推論を改善するよう設計されているとみられるが、その成果は候補がどのように生成、評価、選択されるかに左右される。
標準的な言語モデルは、トークンの並びを予測することでテキストを生成する。長い推論は問題を分解する助けになり得るが、長さだけで正しさが保証されるわけではない。モデルは、初期の誤りを自信を強めながら繰り返す可能性がある。
自己批評では、レビュー段階が追加される。モデルは提案された論証を調べ、不備や反例を探し、修正版の作成を試みる。再帰とは、このレビューが1回の批評で止まらず、複数の段階にわたって繰り返されることを意味する。
このアプローチは数学的証明の作成に適している。幾何学的な構成は特殊なケースで成立しないことがある。不等式は明示されていない符号条件に依存する場合がある。組合せ論の論証では、同じ対象を二重に数えることがある。再確認によって、提出前にこうした失敗を発見する機会が生まれる。
この手法は、経験豊富な数学者の取り組み方にも似ている。数学者は複数の表現を試し、魅力的に見える行き止まりを捨て、境界事例を検証し、成功した論証を書き直す。この類似は作業手順に関するものであり、モデルが人間のように数学を理解していることの証明ではない。
Xiaohongshuによると、同社のモデルはオリジナルのLaTeX問題を直接処理した。これが確認されれば、人間による介入の原因の1つが取り除かれる。従来の形式的システムでは、解答を始める前に、専門家が非形式的な大会問題の文章を機械可読な命題へ変換する必要がある場合が多かった。
自然言語による推論には柔軟性がある。すべての概念を定理証明器でエンコードする必要がなく、図、非形式的な記述、証明戦略を扱える。また、人間の採点者が直接読める解答も生成する。
形式的手法には別の利点がある。証明支援系は、すべての論理的ステップが受け入れられた規則から導かれているかどうかを機械的に検証できる。自然言語による証明には、本物の欠陥を説得力のある表現で覆い隠してしまう脆弱性が残る。
ここから、この話における主要な技術的対立軸が生まれる。自然言語による自己批評対、形式的に検証された推論である。Xiaohongshuの結果は自然言語によるアプローチを後押しするが、勝負を決着させるものではない。
再帰的な批評役は、解答役と同じ盲点を共有する可能性がある。両方の段階が同じモデルによって担われる場合、評価役は共通の内部的な誤解を反映した論証を承認してしまうかもしれない。複数の解答候補はこのリスクを減らすが、それは選択手法が微妙な誤りを識別できる場合に限られる。
外部検証によって、その識別が可能になる。別のモデル、形式的証明システム、独立した数学者が最終解答を検証できる。どの選択肢も、報告された得点の背後にあるリソースを変える。
だからこそ、評価の詳細は事務的な但し書きではなく、結果そのものの一部となる。1万件の解答をサンプリングしてから専門家が選択する方法は、1つのモデルが各問題につき1つの採用可能な解答を生成する場合とは異なる能力を示す。
同じことがプロンプト設計にも当てはまる。自分の作業を確認するよう求める一般的な指示は、研究者が問題を検討した後に作成した問題固有のヒントとは異なる。どちらも有効な証明を生成できるが、自律的推論の異なる度合いを測定している。
計算資源も重要である。再帰的な自己批評では、難しい問題に追加の推論リソースを費やせる。応答速度より正確さが重要な科学的作業では、それが望ましい場合もある。それでも、研究機関が時間と計算資源の予算を公表しない限り、比較は誤解を招く。
長い推論予算を与えられた軽量モデルは、1回の短い応答に制限されたより大規模なモデルを上回る可能性がある。パラメータ数だけでは結果を説明できない。探索、批評、検証、選択を含む推論システム全体が、その能力を規定する。
この教訓は実際の研究にも当てはまる。技術者による論証の確認を支援するモデルは、もっともらしい回答を生成するだけであってはならない。前提を記録し、却下した代替案を保存し、最終的な根拠を追跡可能にする必要がある。
ナレッジワーカーも、モデルの出力を社内文書と比較する際に、同様の課題に直面します。検索可能なエンジニアリングナレッジベースがあれば、生成された結論を検証するために必要な仕様や過去の意思決定を保存できます。
したがって、dotsのアプローチは、独立した再現が行われる前の段階でも興味深いものです。難しい推論の中心に修正プロセスを据えているからです。未証明のまま残っているのは、後からオリンピックの採点者が答えを認識できない状況でも、その批評役が信頼できるかどうかです。
Xiaohongshu dots ModelのIMO 2026満点には、依然として再現可能な評価が必要
報告された結果としては印象的なスコアですが、現時点の証拠だけでは、独立して確立されたモデル記録として扱うことはできません。
最初の検証項目は、問題へのアクセスです。厳密な評価では、モデルと研究者が公式問題を受け取った時点、インターネットアクセスが無効化されていたかどうか、検索・取得された資料がコンテキストに含まれていたかどうかを明らかにする必要があります。
IMOの問題は新作であるため、直接的な記憶の可能性は限定されます。しかし、既存の手法を基礎としており、試験後すぐにオンライン上で議論が現れる可能性があります。そのため、タイムスタンプ付きの実行記録が重要です。
2つ目の問題は、人間による支援です。研究者は、人間がプロンプトを選択したか、ヒントを与えたか、出力を却下したか、証明を編集したか、候補となる解答から選別したかを開示すべきです。人間が誘導するシステム内でもモデルの功績は認められますが、そのシステムを完全自律型と表現すべきではありません。
3つ目の問題はサンプリングです。各問題につき1つの解答だけを生成する場合は、直接的な信頼性を評価できます。数百回試行した後に選別する場合は、モデルが確率分布のどこかで正解を生成できるかを評価することになります。どちらも有用ですが、異なる測定です。
4つ目の問題は採点です。IMOの解答には部分点が与えられることが多く、7点を付与するには必要な手順がすべて含まれているという確信が必要です。独立した採点者は、再構成された解答ではなく、編集されていない正確な出力を見るべきです。
公式のIMO results archiveは、人間の出場者とメダル獲得基準についての権威ある情報源です。しかし、企業が別途実施したAI評価を自動的に検証するものではありません。dots-note 3.0を認証するには、独自に文書化されたプロセスが必要です。
この区別には前例があります。Google DeepMindは2025年、IMOのコーディネーターがGeminiの解答を公式に採点・認証したと発表しました。同社はモデルの証明文書も公開しました。この開示ですべての実装詳細が明らかになったわけではありませんが、スコアを検証するためのより強固な基盤が形成されました。
OpenAIの2025年の結果は、情報発信に伴うリスクを浮き彫りにしました。専門家の採点者がその解答を金メダル相当と評価したと報じられたにもかかわらず、早期の発表によって、発表時期と公式な位置づけを巡る論争が生じました。Natureの報道は、両社の研究を推論能力における大きな節目として扱いつつ、それぞれの評価方法の違いを明確にしています。
Xiaohongshuは、簡潔な証拠パッケージを公開することで、現在の検証上の隔たりの大部分を埋められます。そこには、6問分の未加工の出力、完全なシステム指示、実行時刻、計算量の上限、サンプリング回数、採点記録を含めるべきです。
モデルの重みを公開すれば、さらに前進します。しかし、重みだけでは不十分です。再帰的な自己批評がベースモデル外部のオーケストレーションに依存している可能性があるため、研究者には推論手順も必要です。
チームは、dots-note 3.0をオープンソース化する予定だと述べています。ライセンス、リポジトリ、重み、実行可能な評価コードが公開されるまでは、読者が検証できる機能ではなく、将来に向けた約束にとどまります。
潜在的なデータ汚染についても慎重に扱う必要があります。モデルの学習データの締切日が大会より前であったと仮定すれば、通常の事前学習時に2026年の問題を利用することはできませんでした。しかし、大会後の評価では、検索、更新されたデータ、人間によるプロンプトを通じて解答に接触する可能性があります。
現在、これが起きたことを示す公開証拠はありません。ここで重要なのは方法論です。満点には、隠れた支援を露呈させる得点上の余地が残されていないため、より厳格な統制が求められます。
ベンチマークの飽和という問題もあります。複数の研究所がオリンピックでの成績に直接最適化するようになると、IMOは一般的な知能の尺度としての有用性が低下します。チームは、ほかの領域での信頼性を向上させることなく、専門化された推論方策を訓練できるからです。
IMO proof benchmarksに関する研究では、専門家が精査した課題と独立した評価セットによって、この問題への対処を試みています。しかし、そのようなベンチマークでさえ、問いがオープンエンドで正解がまだ存在しない可能性のある科学研究での性能を完全には予測できません。
したがって、オリンピックでの満点が裏付けるのは、範囲は狭いものの重要な結論です。報告によれば、このモデルはチームの設定下で非常に高度な競技数学の証明を生成できます。しかし、それによって完全無欠な数学能力、自律的な発見、あらゆる専門的状況での信頼できる推論が立証されるわけではありません。
こうした慎重さは、結果の価値を損なうのではなく、守るものです。評価の境界を明確にすれば、その後の再現実験によって主張を強化できます。誇張された表現は、欠けているすべての詳細を反証のように見せてしまいます。
主張が裏付けられた場合、誰が圧力を受けるのか
再現可能な結果であれば、プロプライエタリなフロンティア研究所、オープンモデルの開発者、ベンチマーク設計者に同時に圧力をかけることになります。
Google DeepMindは、Gemini Deep Thinkが2025年に最もよく知られた、公式採点済みの自然言語による成果を打ち立てたため、最も直接的な比較対象となります。その35点は、dots-note 3.0が残る1問を解くことで上回ったと主張する基準となりました。
Googleは、同様に文書化された条件下で2026年の評価を実施することで応じられます。同じ満点を獲得すれば、この成果がもはや孤立したものではないことが示されます。より低いスコアだったとしても、計算量やプロンプトの規則が同等でなければ、解釈は依然として困難です。
OpenAIも同様の圧力に直面します。特に、その2025年のシステムはオリンピック専用ソルバーではなく、汎用推論モデルとして説明されていました。新たな比較により、汎用的なスケーリングが、専門化された自己批評システムの進歩に追随できるかが試されます。
オープンウェイトモデルの開発者は、異なる課題に直面します。Xiaohongshuがdots-note 3.0を公開すれば、外部チームはその推論プロセスを検証し、応用できるようになります。そうなれば、この結果は、米国最大手の研究所による実験的システムにアクセスできない研究者にとっても重要になります。
ここでは、報告されているモデルの規模区分が特に重要です。Xiaohongshuはこれをdots3の最軽量メンバーと呼んでいますが、効率を評価するために必要な指標は提示していません。パラメータ数と計算量のデータを公開すれば、スコアを巡る話をアーキテクチャの話へと発展させられます。
ベンチマーク設計者も圧力に直面します。42点のモデルが登場すれば、その1つの試験では今後改善する余地がありません。未知の問題に対する一貫性、摂動への感度、証明の検証、リソース使用量を測る、より広範なテストが必要になります。
有用な設計の1つは、固定された計算量で、複数の新しい競技にわたってモデルを評価することです。もう1つは、数学的内容を変えずに問題文を変更する方法です。表面的なパターンに依存するシステムは、そのような変更に対して不安定になるでしょう。
研究者は、反復実行における成功率も比較すべきです。モデルが100回の試行で1度だけ問題を解けた場合、有効な経路を発見したとはいえ、依然として信頼性に欠けます。90回成功するなら、その能力は実用レベルにはるかに近いといえます。
人間との比較にも、同様の注意が必要です。上海では7人の出場者が42点を獲得したと報告されていますが、人間とモデルでは利用できるリソースが異なります。生徒には試験時間の制限があり、コンピューターも使用できません。一方、AIシステムは大規模なデータセンターと広範な並列サンプリングを利用する可能性があります。
だからといって、モデルとの比較が無意味になるわけではありません。そのスコアが測定するのは、明示された条件下での出力品質であり、認知能力やリソース使用量の平等性ではないということです。
開発者にとって、より広い意味を持つのは推論インフラです。勝因となる要素は、より大きなベースモデルではないかもしれません。時間を配分し、代替案を生成し、誤りを批評し、証明が完成した時点を判断するループである可能性があります。
企業の購入担当者にとって、これはより適切な評価項目を示唆します。どのモデルが単一のリーダーボードで首位に立っているかではなく、システム全体が根拠を示し、結果を再現し、失敗を検出し、許容可能な制約内で動作できるかを問うべきです。
個人ユーザーによるAI支援研究にも、同じ原則が当てはまります。洗練されたモデルの回答は、検証の代替物ではなく、出発点であるべきです。personal knowledge baseに情報源を保存しておけば、それを裏付ける文書と照合して主張を検証しやすくなります。
Xiaohongshu dots modelのIMO 2026満点という主張は、この原則に強いスポットライトを当てています。出力が優れて見えるほど、その来歴はより重要になります。
結果が長期的に評価されるかを決める3つのシグナル
次の段階で必要なのは、さらなる発表ではなく、企業の主張を持続的な証拠へと変える一連の情報開示と再現実験です。
最初のシグナルは、6問すべての完全な記録の公開です。Xiaohongshuは、編集による修正を加えず、生成されたとおりの正確なモデル出力を公開すべきです。そうすれば、独立したオリンピックの採点者が隠れた欠落を特定し、同じテキストから採点できます。
この公開内容には、プロンプトと指示も含めるべきです。各問題を解いて検証するという一般的な指示であれば、自律性の主張を裏付けます。詳細なヒント、手動介入、選択的な再提出があれば、その主張の範囲は狭まります。
独立した採点者も42点を与えれば、中心となるスコアの主張は大幅に強化されます。重大な証明の欠落が見つかれば、物語の焦点は完全な推論から評価の不整合へと移ります。
2つ目のシグナルは、再現可能なdots-note 3.0のリリースです。チームはモデルをオープンソース化する予定だと示していますが、ユーザーに必要なのはダウンロード可能な重みだけではありません。
意義あるリリースでは、ライセンス、パラメータ構成、トークナイザー、推論設定、批評ループ、サンプリング方針、計算要件を明示すべきです。また、非公開のサービスを使わずに評価を再現できるスクリプトも提供すべきです。
外部での再現により、公開されたシステムが社内モデルに似ているだけではなく、同等の証明を生成するかを検証できます。複数の研究所で安定した結果が得られれば、再帰的な自己批評が1回の統制された実行を超えて機能するという主張が強化されます。
公開されなくても、スコア自体が否定されるわけではありません。しかし、効率性とオープン性に関する説明は、裏付けのないままとなります。
3つ目のシグナルは、独立して管理された新しい数学問題における性能です。IMO 2026はすでに公開されているため、その後のすべての実行にはデータ汚染のリスクが高まり続けます。最も強力な追試は、評価者に直接提供される未公開問題を使用することです。
これらのテストでは、オリンピックのパターン以外も扱うべきです。証明の検査、反例の構成、曖昧な前提、提示された定理が誤りである課題などを含める必要があります。プロンプトの内容を常に証明しようとするシステムは、敵対的な研究課題で深刻な失敗を起こす可能性があります。
見出しとなるスコアには、反復試行の結果も添えるべきです。成功率、計算予算、エラーの分類を示すことで、dots-note 3.0が一貫して高い能力を持つのか、それとも広範な探索の末に時折成功するだけなのかが明らかになります。
同じテストで、自然言語による検証経路と形式的な検証経路も比較すべきです。自己批評は創造的な証明候補を素早く生成し、定理証明器は最終的な論理を検証できます。ハイブリッドシステムは、いずれか一方のみを用いる場合を上回る可能性があります。
リリースと再現が成功すれば、記事の中心的な判断、すなわちXiaohongshuが数学的推論の開発者の先頭集団に加わったことが裏付けられるだろう。情報開示が不十分であったり、再現性が不安定であったりすれば、この結果は興味深い社内デモンストレーションにとどまる。
いずれの結果になっても、この分野に有益な知見をもたらすだろう。検証済みの42点の答案は、自然言語による数学的推論の新たな基準を確立する。一方、議論の余地がある答案は、完全な評価過程がなければベンチマークの数値がほとんど何も物語らないことを浮き彫りにするだろう。
したがって、Xiaohongshu dots model IMO 2026 perfect scoreは、能力に関する主張であると同時に、検証への挑戦として捉えるべきである。開発者は、生の証明、実行可能なコード、ブラインド評価の公開を注視できる。研究者は、モデルもその運用者も問題を事前に見ていない状況で、システムが繰り返し成功できるかを問うことができる。
AIを使って技術資料を推論するすべての人にとって、実践的な教訓は明白である。出典を保存し、前提を精査し、問いから結論に至る再現可能な道筋を求めることだ。Xiaohongshuがその道筋を提示すれば、その満点は一つのオリンピック答案をはるかに超える意味を持つだろう。



