Xiaohongshu dots 模型宣称在 IMO 2026 中获得满分,但验证才是真正的考验
Xiaohongshu 表示,其 dots-note 3.0 模型在 2026 年国际数学奥林匹克竞赛题目中获得了 42 分满分。Xiaohongshu dots 模型在 IMO 2026 中获得满分的说法涵盖全部六道题,与据报道并列第一的七名人类参赛者成绩相同。
这一结果将使 AI 数学推理超越 Google DeepMind 和 OpenAI 在 2025 年创下的里程碑。它们的实验性系统以 35 分达到金牌水平,相当于完整解出五道题。满分答卷消除了这项特定测试中最后一个可见差距。
然而,dots-note 3.0 并未以参赛者身份参加学生竞赛。Xiaohongshu 使用竞赛题目评估了一个内部模型,并通过其 dots 研究团队公布了结果。这一区别很重要,因为仅凭分数无法揭示模型可访问的信息、算力、提示词、筛选流程或评分程序。
因此,核心问题不只是 AI 是否生成了六份令人信服的证明,而是评估是否受到足够严格的控制,从而能够与人类参赛者、Gemini Deep Think、OpenAI 的实验性系统以及未来的公开模型进行有意义的比较。
Xiaohongshu 声称 dots-note 3.0 取得了哪些成果
据报道,这一 42 分的结果之所以重要,是因为它将满分成绩与端到端自然语言方法结合在了一起。
dots 团队表示,dots-note 3.0 收到了六道 IMO 2026 题目的原始 LaTeX 版本。LaTeX 是一种常用于表达方程和技术符号的文档格式。据报道,该系统无需先将每道题转换为形式化定理证明语言,就生成了完整解答。
根据该团队的模型介绍,dots-note 3.0 在每道题上都获得了满分,最终取得最高可能分数 42 分。每道 IMO 题目为七分,参赛者在两天的考试中每天解答三道题。
第 67 届 IMO 在上海举行,考试时间为 7 月 15 日和 7 月 16 日。2026 年竞赛规则将上海中学列为考试地点,并规定每天的考试时长为四个半小时。
Xiaohongshu 将 dots-note 3.0 描述为 dots3 系列中最轻量的模型。该公司尚未披露足够的技术细节,因此无法通过参数量、激活参数量、推理成本、内存占用或实际运行时间来比较“最轻量”的含义。它也尚未发布模型权重。
该团队表示,模型依赖递归式自我批判。在这一过程中,系统会审查中间推理、识别潜在错误,并在生成最终答案前修改其方法。这种方法更接近反复进行内部审查,而不是一次性生成不间断的回答。
这一机制与奥林匹克数学密切相关,因为一个看似很有希望的解法可能会因某个缺乏支撑的步骤而失败。模型必须找到论证方法、检验其内部一致性、修补漏洞,并足够清晰地表达最终证明,以便专家评分。
据报道,这一结果也不同于只需给出答案的数学基准测试。IMO 题目要求提供证明,因此仅得出正确的数值结论并不足够。每一个关键推论都必须得到论证,而一个隐藏的缺陷就可能使看似完整的解答只能获得部分分数。
Xiaohongshu 表示,dots-note 3.0 端到端地完成了这一过程。然而,公开介绍目前尚未提供涵盖全部提示词、输出、时间戳、重试次数、算力限制和评分者身份的完整评估材料。
缺少这套材料并不意味着结果是虚假的,但这确实意味着,读者应将 42 分满分视为一项由公司报告、仍有待更全面独立审查的基准测试结果。
为什么满分改变了 AI 数学竞赛的格局
金牌水平的表现证明模型可以解出 IMO 试卷中的大部分题目,而满分则意味着它们可以在同一次尝试中攻克所有题目。
2025 年,Google DeepMind 的高级 Gemini Deep Think 系统解出了六道题中的五道,获得 35 分。IMO 协调员按照与学生解答相同的评分标准,对其自然语言证明进行了评分。
该公司的Deep Think 评估显示,与其 2024 年的系统相比,这是一次显著进步。AlphaProof 和 AlphaGeometry 2 曾获得 28 分,但它们依赖专门的形式语言,并且需要数天的计算时间。
相比之下,Gemini 的 2025 年系统直接读取官方题目描述,并在竞赛规定的四个半小时时限内用自然语言写出证明。它采用并行推理来探索和组合多种可能的方法。
OpenAI 也在 2025 年报告称,一个实验性通用推理模型取得了 35 分。由于其公告是在 IMO 协调披露流程结束前发布的,因此引发了质疑。Google 提交的结果则获得了 IMO 评分人员的明确认证。
官方奖牌与奖牌水平表现之间的区别很容易被忽略。即使专家评估了 AI 系统的答案,这些系统也不是正式的学生参赛者。它们的分数表明其成果与参赛者提交的解答相比处于什么水平,并不意味着机器加入了某支国家队参赛。
同样的严谨表述也适用于 Xiaohongshu dots 模型在 IMO 2026 中获得满分的说法。真正有意义的说法是,据报道,在该团队的评估条件下,dots-note 3.0 生成了价值 42 分的证明。它并未在排名中取代任何人类参赛者,也没有获得学生奖牌。
尽管如此,解出六道题所代表的意义远不止增加七分。最后一道题通常属于整张试卷中最难的题目之一,而达到金牌水平的模型可以通过解出较容易的五道题获得相应总分。满分则要求在整套题目中全部成功。
据报道,2026 年有七名人类参赛者获得满分。这使该模型声称取得的成绩处于人类分数分布的顶端,而不仅仅是略高于金牌分数线。
这也改变了其他实验室的竞争目标。达到去年的 35 分将不再代表领先成绩。AI 开发者将面临更大压力,需要报告完整答卷、稳定的重复表现,以及能够区分真实能力与大规模搜索的受控评估。
这种压力并不仅限于 Google 和 OpenAI。开放权重推理模型的开发者现在有了一个明确的目标可供检验。如果一个更小的模型能够复现满分表现,就会挑战这样一种假设:最强的数学推理能力必须依赖规模最大的专有系统。
关键在于“复现满分表现”。一次成功运行可以证明这种可能性,但无法证明其可靠性。科学和商业用户关心的是,在答案尚未得知时,获得正确证明的概率有多高。
这正是下一阶段竞争的方向。醒目的分数是 42 分,而更难的基准是另一位评估者能否再次得到这一结果。
递归式自我批判如何应对证明写作中最困难的部分
dots-note 3.0 似乎旨在通过修订来改进推理,但结果取决于候选解答如何生成、评判和筛选。
标准语言模型通过预测一系列词元来生成文本。更长的推理过程有助于它分解问题,但长度本身并不能保证正确性。模型可能会越来越自信地重复早期错误。
自我批判增加了一个审查阶段。模型会检查提出的论证、寻找漏洞或反例,并尝试生成修正版本。递归意味着这种审查可以在多个层级上重复进行,而不是在一次批判后停止。
这种方法很适合数学证明写作。几何构造可能在特殊情况下失效,不等式可能依赖一个未明确说明的符号条件,组合数学论证也可能重复计算同一个对象。反复检查为在提交前发现这些问题创造了机会。
这种方法也类似于经验丰富的数学家的工作方式。他们会尝试多种表述、排除看似诱人的死胡同、检验边界情况,并重写成功的论证。这种相似性仅涉及工作流程,并不能证明模型像人一样理解数学。
Xiaohongshu 表示,其模型直接处理原始 LaTeX 题目。如果得到证实,这将消除一种人为干预来源。早期的形式化系统通常要求专家先将非形式化的竞赛语言转换为机器可读的陈述,然后才能开始求解。
自然语言推理具有灵活性。它无需将每个概念都编码进定理证明器,便能处理图形、非形式化描述和证明策略。它还能生成可供人类评分者直接阅读的答案。
形式化方法则具有另一种优势。证明助手可以机械地验证每一个逻辑步骤是否都遵循公认规则。自然语言证明仍可能用具有说服力的措辞掩盖真实的漏洞。
这形成了这个故事中的主要技术对手:自然语言自我批判与形式化验证推理。Xiaohongshu 的结果支持自然语言路线,但尚未为这场竞争盖棺定论。
递归式批判者可能与求解器存在相同的盲点。如果两个阶段都由同一个模型完成,评估者可能会认可一个反映共同内部误解的论证。多个候选解答可以降低这种风险,但前提是筛选方法能够识别细微错误。
外部验证可以提供这种辨别能力。另一个模型、形式化证明系统或独立数学家都可以对最终答案提出质疑。每一种方案都会改变支撑报告分数的资源构成。
这就是为什么评估细节本身就是结果的一部分,而不是行政层面的附属说明。采样一万份解答后再由专家筛选,与一个模型为每道题生成一份获认可的答案,代表的是不同的能力。
提示词设计同样如此。要求检查工作的通用指令,不同于研究人员研究题目后编写的针对性提示。两者都可能生成有效证明,但衡量的是不同程度的自主推理能力。
算力也很重要。递归式自我批判可以在困难题目上投入额外推理资源。这对于准确性比响应速度更重要的科学工作而言可能是可取的。然而,除非实验室公布其时间和算力预算,否则这种做法仍会导致比较失真。
一个拥有较长推理预算的轻量模型,可能胜过一个仅限生成一次简短回答的大型模型。仅凭参数量无法解释这一结果。包括搜索、批判、验证和筛选在内的整个推理系统共同定义了其能力。
这一经验也适用于现实研究。帮助工程师检查论证的模型不应只是生成一个看似合理的答案。它应记录假设、保留被否决的替代方案,并让最终证据可供追溯。
知识工作者在将模型输出与内部文档进行比较时,也面临着类似的挑战。可搜索的工程知识库可以保存核查生成结论所需的规范和过往决策。
因此,即使尚未经过独立复现,dots 方法也颇具吸引力。它将修正置于复杂推理的核心。尚未得到证明的是:当事后没有奥林匹克竞赛阅卷人能够识别答案是否正确时,它的批评机制是否依然可靠。
Xiaohongshu dots 模型在 IMO 2026 获得满分,但仍需可复现的评估
作为一项公开报告的结果,这一分数令人印象深刻,但目前的证据还不足以将其视为一项经独立确认的模型纪录。
第一个验证问题涉及题目获取。规范的评估应明确模型和研究人员何时获得官方题目、是否禁用了互联网访问,以及是否有任何检索材料进入上下文。
IMO 题目是全新的,这限制了直接记忆的可能性。然而,它们会运用已有的方法,而且考试结束后,网上可能很快出现相关讨论。因此,带时间戳的运行记录非常重要。
第二个问题涉及人类协助。研究人员应披露是否有人选择提示词、提供提示、淘汰输出、编辑证明,或在候选解答中进行选择。在人类引导的系统中,模型仍然可以获得应有的认可,但不应将该系统描述为完全自主。
第三个问题是采样。每道题只生成一个答案,测试的是直接可靠性。生成数百次再进行筛选,测试的是模型能否在其输出分布中的某处产生正确解答。这两种测量都有价值,但含义不同。
第四个问题是评分。IMO 解答通常会获得部分分,而评为七分需要确信所有必要步骤都已具备。独立阅卷人应查看完整、未经编辑的原始输出,而不是重构后的解答。
官方IMO 成绩档案是人类参赛者成绩和奖牌分数线的权威来源。但它不会自动验证某家公司单独开展的 AI 评估。对 dots-note 3.0 的任何认证都需要有其自身记录完备的流程。
这种区别已有先例。Google DeepMind 在 2025 年表示,IMO 协调员对 Gemini 的解答进行了正式评分和认证。该公司还公布了模型的证明文档。这些披露并未揭示所有实现细节,但为审查该分数提供了更坚实的基础。
OpenAI 在 2025 年的结果展示了沟通方面的风险。其早期公告引发了关于时机和官方地位的争议,尽管据报道,专家阅卷人认为这些解答足以达到金牌水平。Nature的报道将两家公司的成果均视为推理能力的重大里程碑,同时保留了它们在评估方式上的差异。
Xiaohongshu 可以通过发布一套精简的证据材料,弥合当前大部分验证缺口。其中应包括六道题的原始输出、完整的系统指令、运行时间戳、计算资源限制、采样次数和评分记录。
发布模型权重会更进一步,但仅有权重仍不够。研究人员还需要推理流程,因为递归式自我批评可能依赖基础模型之外的编排机制。
该团队表示,dots-note 3.0 预计将开源。在许可证、代码仓库、权重和可运行的评估代码真正发布之前,这仍是对未来的承诺,而不是读者目前可以检验的特性。
潜在的数据污染同样值得谨慎对待。假设模型的训练截止时间早于赛事,2026 年的题目在常规预训练期间并不可用。然而,赛后评估仍可能通过检索、更新后的数据或人类提示接触到解答。
目前没有公开证据表明这种情况确实发生。这里强调的是方法论:满分需要更严格的控制,因为已经没有剩余的失分空间可以暴露隐蔽的协助。
此外还存在基准饱和问题。一旦多个实验室开始直接针对奥林匹克竞赛表现进行优化,IMO 作为衡量通用智能的指标,其价值就会降低。团队可以训练专门的推理策略,却未必能提升模型在其他领域的可靠性。
关于IMO 证明基准的研究试图通过专家审核的任务和独立评估集来解决这一问题。即使是这些基准,也无法完全预测模型在科学研究中的表现,因为科学研究中的问题通常是开放式的,而且正确答案可能尚不存在。
因此,奥林匹克竞赛满分支持的是一个范围有限但十分重要的结论。据团队报告,在其设定下,该模型能够生成高度复杂的竞赛证明。但这并不能证明它在数学上毫无错误、能够自主发现,或在所有专业场景中都能可靠推理。
这种克制是在保护这项成果,而不是削弱它。明确的评估边界能够让后续复现进一步巩固这一主张。夸大的措辞则会让每个缺失的细节看起来都像反面证据。
如果该主张经得起验证,谁将面临压力
一项可复现的结果将同时给专有前沿实验室、开放模型开发者和基准设计者带来压力。
Google DeepMind 面临最直接的比较,因为 Gemini Deep Think 在 2025 年创下了最知名的、经官方评分的自然语言解题成绩。它获得的 35 分构成了 dots-note 3.0 声称通过解出剩余题目而超越的基准。
Google 可以在同样有完整记录的条件下开展 2026 年评估作为回应。如果同样获得满分,就说明这项成就不再是孤例。即使分数更低,如果计算资源和提示规则并不等同,仍然很难解释其意义。
OpenAI 面临着类似的压力,尤其是其 2025 年的系统被描述为通用推理模型,而非奥林匹克竞赛专用求解器。新的比较将检验通用模型的规模扩展能否跟上专门的自我批评系统。
开放权重模型开发者面临的是另一种挑战。如果 Xiaohongshu 发布 dots-note 3.0,外部团队便可以检查并调整其推理流程。这将使该成果对那些无法使用美国最大型实验室实验系统的研究人员产生实际意义。
该模型据称所属的规模级别在这里尤其重要。Xiaohongshu 称其为 dots3 中最轻量的成员,但尚未提供评估效率所需的指标。公布参数量和计算资源数据,可以让这个关于分数的故事转变为一个关于架构的故事。
基准设计者同样面临压力。获得 42 分的模型让这张试卷本身不再有任何提升空间。他们需要更广泛的测试,以衡量模型在未见题目上的一致性、对扰动的敏感度、证明验证能力和资源使用情况。
一种有用的设计是让模型在固定计算资源下参加多场全新的竞赛。另一种方法是在不改变数学内容的前提下修改题目表述。依赖表面模式的系统在这些变化下会变得不那么稳定。
研究人员还应比较多次运行的通过率。如果模型在 100 次尝试中仅有一次解出问题,它确实发现了一条有效路径,但仍不可靠。如果它成功 90 次,那么这种能力就更接近实际应用。
与人类进行比较时也需要同样谨慎。据报道,有七名参赛者在上海获得了 42 分,但人类与模型所使用的资源不同。学生的考试时间有限且不能使用计算机,而 AI 系统可能会使用大型数据中心并进行大规模并行采样。
这并不意味着模型比较毫无意义。它意味着该分数衡量的是在明确条件下的输出质量,而不是认知能力或资源使用完全对等。
对开发者而言,更广泛的启示涉及推理基础设施。取胜的关键组件可能并不是更大的基础模型,而是负责分配时间、生成替代方案、批评错误,并判断证明何时完成的循环机制。
对企业买家来说,这意味着应提出更好的评估问题。与其询问哪个模型位居某个排行榜榜首,不如询问完整系统能否展示来源、重复结果、检测失败,并在可接受的限制内运行。
对个人用户而言,同样的原则也适用于 AI 辅助研究。模型给出的精致答案应当是验证的起点,而不是验证的替代品。将源材料保存在个人知识库中,可以更轻松地根据支撑结论的文档核查相关主张。
Xiaohongshu dots 模型在 IMO 2026 获得满分的主张,让这一原则受到了高度关注。输出看起来越出色,其来源就越重要。
决定这项成果能否经受时间考验的三个信号
下一阶段需要的不是另一份公告,而是一系列能够将公司主张转化为持久证据的披露与复现。
第一个信号是公布全部六道题的完整记录。Xiaohongshu 应发布模型生成的原始输出,不做任何编辑性修补。独立的奥林匹克竞赛阅卷人随后可以识别任何隐藏的缺口,并根据同一文本给出评分。
此次发布还应包括提示词和指令。要求解答并验证每道题的通用指令,将有助于支持其自主性主张。详细提示、人工干预或选择性重新提交则会缩小这一主张的适用范围。
如果独立阅卷人同样评出 42 分,核心分数主张将得到显著加强。如果他们发现证明中存在重大缺口,叙事重点就会从完美推理转向评估不一致。
第二个信号是可复现的 dots-note 3.0 发布。该团队已表示模型预计将开源,但用户需要的不只是可下载的权重。
一项有意义的发布应明确许可证、参数配置、分词器、推理设置、批评循环、采样策略和计算资源要求。它还应提供无需未披露服务即可重现评估的脚本。
外部复现将检验所发布的系统能否生成相当水平的证明,而不是仅仅与内部模型相似。如果多个实验室都能获得稳定结果,将强化递归式自我批评能够超越单次受控运行、实现有效迁移的主张。
未能发布并不能否定该分数,但会让关于效率和开放性的叙事缺乏支撑。
第三个信号是在全新、由独立机构控制的数学测试中的表现。IMO 2026 题目已经公开,因此之后的每次运行都面临日益增加的数据污染风险。最有力的后续测试是使用直接交付给评估人员的未见题目。
这些测试不应仅涵盖奥林匹克竞赛模式,还应包括证明检查、反例构造、含糊假设,以及所给命题为假的任务。一个总是试图证明提示中命题的系统,在对抗性研究问题上可能会严重失败。
标题分数还应配合重复试验。通过率、计算预算和错误类别将揭示 dots-note 3.0 是具备稳定能力,还是仅在大量搜索后偶尔成功。
同样的测试还应比较自然语言与形式化验证路径。自我批评或许能快速生成富有创意的候选证明,而定理证明器则负责检查最终逻辑。混合系统可能会超越单独使用任何一种路径的表现。
一次成功的发布和复现将进一步印证本文的核心判断:Xiaohongshu 已跻身数学推理开发者的领先阵营。信息披露不足或复现结果不稳定,则会让这一成果沦为一次引人关注的内部演示。
无论结果如何,都将为该领域带来有益启示。一篇经验证获得 42 分的答卷,将为自然语言数学推理树立新的标准。一篇存在争议的答卷,则会揭示:如果没有完整的评测轨迹,一个基准测试分数所能说明的其实非常有限。
因此,Xiaohongshu dots model 在 IMO 2026 中获得满分一事,既应被视为一项能力声明,也应被视为一项验证挑战。开发者可以关注原始证明、可运行代码和盲测评估。研究人员则可以追问:当模型及其操作人员都未曾见过这些题目时,该系统能否反复取得成功。
对于所有使用 AI 推理技术材料的人来说,实践层面的启示十分直接。保存原始来源,审查假设,并要求提供一条从问题到结论的可复现路径。如果 Xiaohongshu 能够提供这条路径,其满分成绩的意义将远远超越一份奥林匹克竞赛答卷。



