top of page

Schema Harness 在 ARC-AGI-3 公开集上达到 98.98%,但真正的测试仍未公开

已更新:7月20日

Schema Harness 表示,尽管使用的是现有前沿模型且未改变其权重,它仍在 ARC-AGI-3 公开集上取得了 98.98% 的成绩。Schema Harness 的这一 ARC-AGI-3 成绩,在全部 25 个公开环境中几乎达到了该基准的人类效率目标。

这一结果形成了令人震惊的反差。ARC Prize 独立测得 GPT-5.6 Sol 在公开集上的成绩为 13.33%,在其半私有评测中的成绩为 7.78%。Schema Harness 报告称,将同一模型系列置于结构化推理和验证循环中后,成绩达到了 95.35%。

这并不能证明 ARC-AGI-3 已被攻克。Schema 的成绩仍是自行报告的,而且公开环境可供查看和反复开发。不过,已发布的运行轨迹使这一说法比单独的截图或社交媒体帖子更具可信度。

因此,核心故事并不是一个新模型击败旧模型,而是一个专用框架似乎从 ARC Prize 已经测试过的模型中激发出了截然不同的表现。

这将关注点从模型权重转向了围绕模型构建的机制。同时,它也提出了一个更棘手的问题:当开发者可以反复研究每个环境时,公开基准测试的表现究竟衡量的是什么。

Schema Harness 的 ARC-AGI-3 成绩进入人类水平区间

Schema Harness 报告称,它在完整公开集上实现了接近人类的操作效率,而不仅仅是在少数游戏演示中成功。

该项目的 Schema Harness 结果 报告了针对 ARC-AGI-3 的 25 个公开环境进行的两项独立评测。一项使用 Claude Opus 4.8 和 Claude Fable 5,另一项使用 GPT-5.6 Sol。

据报告,Claude 和 Fable 组合完成了全部 183 个可用关卡。其平均相对人类操作效率(RHAE)达到 98.98%。

GPT-5.6 Sol 组合通过 24 条获胜轨迹完成了 183 个关卡中的 182 个,平均 RHAE 为 95.35%。

RHAE 并不只是统计胜利次数。它会衡量已完成的关卡,并将智能体在每个关卡中的操作次数与人类基准进行比较。

因此,低效的胜利所得分数低于高效的胜利。遗漏关卡也会受到完成度惩罚,从而防止不完整的运行获得具有误导性的高平均分。

ARC Prize 引入这一结构,是因为 ARC-AGI-3 测试的是通过交互进行学习的能力。智能体不会收到每个环境的书面规则、明确目标或教程。

它必须发现哪些对象至关重要,推断操作如何改变场景,识别目标,并执行成功的策略。分数反映了智能体在这一过程中需要进行多少次交互。

该基准的 评分方法 将每个关卡的最高分设为 115%,从而允许表现极其高效的关卡抵消其他关卡中的较弱表现。每个完整游戏的得分上限仍为 100%。

因此,98.98% 的平均分不仅意味着广泛完成了任务。根据该项目的评分记录,Claude 和 Fable 系统的操作效率通常接近人类参考水平。

该团队还通过一个独立的数据托管平台发布了 50 条游戏轨迹。评测轨迹 包括运行元数据、事件日志、快照、评分输入和各环境的结果。

这些资料让外部研究人员能够检查运行过程,并执行其中包含的评分工具。它们为报告中的计算方式和智能体行为提供了有价值的透明度。

不过,可复现的计算并不等同于独立的基准验证。这些运行仍然针对开发者可以查看、重放和定向优化的环境。

这一区别非常重要,因为 ARC-AGI-3 最初是作为对未知环境适应能力的测试而推出的。一旦环境公开,反复开发就可能引入首次参加测试者永远不会拥有的知识。

这一局限并不会让结果失去意义。它改变的是该结果能够回答的问题。

Schema Harness 提供了相关证据,说明结构化系统可以在不重新训练基础模型的情况下,多么有效地掌握已知的基准环境。但它尚未证明自己对未见环境具备同等水平的适应能力。

同样的模型在框架中呈现出截然不同的表现

据报告,最大的提升来自围绕模型重新组织推理、记忆和验证机制,而不是训练更强大的模型。

ARC Prize 于 2026 年 3 月发布 ARC-AGI-3,并刻意设置了极为严苛的基准线。人类能够解决所有环境,而前沿 AI 系统的平均成绩仅为 0.51%。

基准发布公告 介绍了数百个围绕探索、目标发现、规划和持续学习设计的回合制环境。其公开演示集包含 25 个环境。

模型表现自发布后有所提升,但常规配置下的前沿模型仍远远落后于人类。GPT-5.6 Sol 是近期最明显的例子。

ARC Prize 报告称,在最高推理强度下,Sol 在公开环境中的平均成绩为 13.33%。它也是首个在直接测试中完整通关一款公开游戏的前沿模型。

在半私有集上,其验证成绩为 7.78%。官方的 GPT-5.6 评测 将 Sol 描述为特别擅长在陌生场景中确定自身处境,并修正失败的假设。

Schema Harness 报告称,使用 Sol 取得了 95.35% 的成绩。这与 ARC Prize 对基础智能体配置的公开测量结果相比,存在 82.02 个百分点的差距。

这一比较并非严格的科学消融实验。不同的工具、提示词、执行限制、上下文管理方式和开发历程都可能影响结果。

尽管如此,如此巨大的差距让人无法忽视周边系统的作用。模型的基准成绩正越来越成为模型与框架组合的共同属性。

框架是管理智能体上下文、工具、状态、执行循环和恢复行为的软件层。它决定模型能看到什么,以及接下来可以做什么。

这一层可以防止智能体出现常见故障。模型经常会忘记先前的证据、把一次观察误认为规则,或在假设已经自相矛盾后仍继续行动。

简单的聊天循环将负担全部放在模型的文本推理上。模型必须在不断扩展的对话中记住观察结果、维持假设、规划行动并发现矛盾。

Schema Harness 改变了这种安排。它要求模型维护一个可编辑程序,用来表示其当前对环境的理论。

该程序会成为一个符号化世界模型,即对对象、状态、操作和转换规则的显式表示。随着证据变化,智能体可以检查并修改它。

据报告,这种方法同时处理状态归因和机制发现。状态归因旨在识别哪些隐藏变量能够解释当前观察结果。

机制发现则研究操作如何改变这些变量。在同一个可执行表示中处理这两个问题,可以缩小描述场景与预测其下一状态之间的差距。

这一区别有助于解释为什么能力强大的模型在缺少该框架时可能表现不佳。语言模型或许能够识别可见模式,却无法在多次交互中维持一致的因果解释。

该框架并不会向模型权重中添加新知识。它约束模型将在运行期间形成的知识外显化、测试并修正。

这不像宣布一个更大的模型那样引人注目,但对在真实工作流程中部署智能体的团队而言,它可能更为重要。

负责软件、研究或运营工作的智能体必须在多个步骤中保持状态。当一个错误假设就可能破坏之后的所有行动时,流畅的推理远远不够。

可编辑世界模型改变了智能体的任务

Schema Harness 将环境理解转化为程序测试问题,为模型提供了一个能够明确失败并被修复的具体对象。

ARC-AGI-3 让智能体面对规则被隐藏起来的视觉环境。一次移动可能会改变某个对象、解锁一条路径、消耗一种资源,也可能不会产生立即可见的效果。

智能体必须将观察与解释区分开来。它还必须避免把第一个看似合理的理论当作已经证实的事实。

据报告,Schema Harness 使用的是通过合成进行分析的方法。在这种方法下,系统通过构建一个能够复现观察结果的机制来解释这些观察。

智能体会编写一个状态转换程序,通常被描述为 step() 函数。该函数预测选择某个操作后,环境将如何变化。

随后,框架会根据记录的交互历史检查该程序。如果预测状态与观察状态不一致,当前理论就没有通过具体测试。

模型必须随之修改变量、规则或对象归属。这一循环将模糊的反思转化为可执行的调试过程。

假设一个网格中包含一个可移动棋子、一扇门和若干彩色单元格。基于聊天的智能体可能会得出结论:触碰彩色单元格可以打开门。

在一次交互后,这种解释听起来可能很合理。然而,第二次尝试或许会表明,只有按特定顺序激活两个单元格,门才会打开。

可编辑程序会暴露这个缺失的条件。它的预测状态将与记录的画面产生偏差,从而为智能体提供更新机制的明确理由。

当转换模型能够拟合现有历史后,系统便可以利用它进行规划。据报告,它会先在模拟世界中搜索可能的操作序列,再向基准环境提交操作。

这一规划步骤十分重要,因为 RHAE 会惩罚不必要的交互。随机探索或许最终也能发现目标,但过多操作会大幅降低最终得分。

该基准在关卡评分阶段会对人类与智能体操作次数之间的比值取平方。一个使用了人类十倍操作次数的智能体,可能只能获得人类参考分数的一小部分。

因此,Schema 报告的表现同时依赖于模型准确性和有纪律的探索。系统必须在避免漫无目的行动的同时学到足够的信息。

这种方法与 ARC-AGI-3 社区其他地方关于可执行世界模型的研究相似。研究人员已经证明,显式程序和结构化状态探索的表现优于不受约束的智能体对话。

一个已发布的基准系统构建了可执行的 Python 模型,并在没有环境专用代码的情况下通过这些模型进行规划。另一个系统使用基于图的探索来追踪状态、转换关系和未经测试的操作。

Schema Harness 似乎进一步推进了这一类思路。它将一个统一的可编辑表示置于观察、解释、验证和规划的核心位置。

它所报告的 Claude Code 基准也提供了另一个有用的对比。据该项目称,一个更简单的编码智能体配置在同一公开集上取得了 42.83% 的成绩。

这一基准已经超过许多早期公开结果,但它仍比 Claude 和 Fable 的 Schema 配置低 56 个百分点以上。

这一比较表明,仅仅能够执行代码还不够。真正重要的是,框架如何引导代码用于因果建模和持续的一致性检查。

这对智能体开发者而言是一条意义重大的设计启示。更多 token 或更广泛的工具访问权限,并不会自动带来更出色的长程行为。

智能体需要一种持久化的方式来表示自身信念。它们还需要一种机制,迫使这些信念接受累积证据的检验。

同样的原则也适用于抽象游戏之外的场景。软件智能体应当根据代码仓库状态和测试结果校准其计划。

研究智能体应当将主张与检索到的证据关联起来,并在来源相互冲突时修正结论。运维智能体应当将预期的系统变化与观察到的结果进行比较。

在每种情况下,框架都可以将记忆从对话记录转化为可编辑的模型。该模型为智能体提供了可供验证的具体对象。

对于管理大量技术证据的团队,可搜索的工程知识库可以为这一流程中的人工环节提供支持。不过,仅靠检索并不能提供 Schema 的可执行因果层。

其更广泛的启示并不是每个智能体都需要游戏模拟器,而是可靠的智能体需要与其必须控制的状态变化相匹配的表示方式。

98.98% 的公开得分并不等同于经过验证的 AGI 成果

公开得分测试的是一个经过开发的系统在可见环境中的表现,而 ARC-AGI-3 最有力的主张取决于受控首次接触条件下的表现。

该项目已经发布了详细证据,以支持其报告的得分。然而,截至本文撰写时,ARC Prize 尚未将 Schema Harness 列为经过验证的半私有测试结果。

这一差距应当始终处于任何解读的核心。ARC-AGI-3 旨在衡量智能体在最初不了解环境、机制和目标时的适应能力。

公开环境无法无限期地维持这一条件。开发者可以检查其文件、重放交互、比较失败案例,并围绕反复出现的结构优化框架。

即使没有硬编码解决方案,反复迭代也可能引入针对特定基准的假设。工具描述、提示词、规划流程或状态表示都可能编码从公开测试集中学到的经验。

ARC Prize 通过半私有和完全私有测试集来解决这一问题。技术报告描述了 25 个公开环境、55 个半私有环境和 55 个完全私有环境。

半私有测试集通过外部模型 API 支持受控评估。完全私有测试集则提供用于竞赛的更严格留出测试。

ARC Prize 的验证政策还会监控公开得分与半私有得分之间的一致程度。该政策预期 ARC-AGI-3 的半私有得分会更高,因为公开演示集难度更大。

根据该政策,相差不超过 15 个百分点即代表具有良好一致性。因此,如果受控评估能够产生相近的半私有得分,Schema 的公开结果将变得更具分量。

与 GPT-5.6 Sol 的对比说明了这一测试为何重要。在 ARC Prize 自己的智能体配置下,Sol 的公开得分为 13.33%,半私有得分为 7.78%。

Schema Harness 报告称,使用 Sol 获得了 95.35% 的公开得分。这一结果可能反映了更优秀的推理架构、针对公开测试集进行的大量适配,或两者兼有。

只有全新的留出测试才能令人信服地区分这些解释。仅凭已发布的公开轨迹无法解决泛化能力问题。

此外还存在其他不确定性。Schema 在其表现最强的结果集中使用了两个 Anthropic 模型,而不是由一个固定模型处理所有环境。

因此,其路由逻辑和模型选择流程值得审视。研究人员需要了解,模型选择是在每次运行前完成、在探索性尝试后完成,还是采用了其他评估协议。

即使不讨论价格,计算量也很重要。一个反复编写程序、重放历史记录并搜索动作序列的智能体,可能比直接调用模型消耗多得多的推理资源。

ARC-AGI-3 衡量的是环境内部的动作效率。它未必能够体现动作之间执行的全部计算量。

这并非 Schema 独有的缺陷。测试时计算是现代推理基准中的一个核心变量。

不过,比较结果应当报告模型调用次数、token 数量、实际耗时、失败尝试以及选择流程。否则,高效的动作轨迹可能掩盖代价高昂的内部搜索。

可复现性还带来了另一项区别。轨迹发布使研究人员能够验证输出和得分,但完整复现需要完整的框架实现和评估流程。

轨迹展示了一次成功运行期间发生的事情,却不一定能揭示在已发布的结果集之前进行了多少种其他配置尝试或舍弃了多少次运行。

这些注意事项都不会否定所报告的 98.98%。它们界定了在将这一结果视为自适应智能领域的广泛进展之前,仍然需要哪些证据。

负责任的结论范围有限,但十分重要。Schema Harness 似乎通过显式世界建模而非权重更新,以惊人的效率掌握了可见的 ARC-AGI-3 环境。

同样的方法能否泛化到未见过的环境,仍然没有答案。这个问题才是该基准真正的重心所在。

这一结果给模型制造商和基准设计者带来了压力

Schema Harness 将竞争压力转向系统设计,同时迫使基准区分模型本身的能力与框架辅助下的表现。

前沿模型提供商通常通过模型版本的改进来展示推理能力的进步。Schema 报告的结果表明,部署后架构的变化也能带来相当甚至更大的提升。

这从两个方面给模型制造商带来了压力。首先,客户可能不再将原始模型排名视为智能体表现的充分证据。

其次,提供商可能需要提供更优秀的基础能力,以支持持久状态、代码执行、模拟、验证和受控上下文管理。

一个能够写出令人信服解释的模型,在其内部假设发生偏移时仍可能失败。能够捕捉这种偏移的框架,可能胜过在较弱循环中运行、名义上更强大的模型。

因此,开发者应当评估完整系统。相关评估单元包括模型、工具、记忆策略、状态表示、验证器、规划器和恢复行为。

这一结果也给智能体平台供应商带来了压力。围绕工具调用和对话记忆构建的通用循环,可能难以与围绕特定任务的可执行表示设计的系统竞争。

这并不意味着每个应用都需要专用框架,而是意味着框架必须反映工作的结构。

对于 ARC-AGI-3,关键结构是一个由隐藏状态转移规则支配且不断变化的世界。符号模拟器直接针对这一结构。

对于编程,相应的结构可能是文件、依赖项、测试和运行时行为。对于研究,则可能是主张、来源、日期和相互矛盾的证据。

这使框架设计成为一种产品工程,而非提示词装饰。系统必须定义存在哪些状态、状态如何变化,以及错误信念如何显现。

基准设计者面临着相关挑战。公开测试集支持研究、调试和比较,但随着时间推移,它们作为首次接触适应能力衡量手段的效力会逐渐减弱。

ARC Prize 已经意识到这一区别。其私有评估层并非行政细节,而是为了保护基准的科学意义。

Schema Harness 的 ARC-AGI-3 结果展示了公开评估的两面性。开放环境使研究人员能够发现一种有效架构,并发布可供检查的轨迹。

同样的开放性也使最终得分无法证明该架构能够迁移到未见过的环境。进步和过拟合可能产生相似的公开得分。

社区中的比较进一步强化了这一观点。早期系统使用了图探索、可执行 Python 模型、持续学习、记忆文件和多智能体编排。

这些方法取得了显著提升,但远未达到 Schema 报告的平均水平。该领域已逐步摆脱仅仅要求模型依靠无外部支持的推理来解决每个环境的思路。

Schema 将这一趋势凝练为一个更清晰的论点:当智能体能够构建、执行、证伪并修复其所处世界的外部模型时,其能力就会提升。

如果这一论点经受住私有测试,模型提供商将面临新的竞争格局。更强大的基础推理能力仍然重要,但与框架的兼容性也将同样重要。

如果私有得分大幅下降,结论则会有所不同。Schema 仍将是一个有效的公开测试集求解器,但其关于通用机制发现的更广泛主张将被削弱。

无论结果如何,都将增进人们的理解。目前的公开结果最有价值之处,在于它提出了一个关于智能体架构的有力且可检验的假设。

三个信号将决定 Schema Harness 究竟证明了什么

接下来的证据必须检验迁移能力、可复现性和资源使用情况,而不是再产生一个经过优化的公开得分。

第一个信号是受控的 ARC-AGI-3 半私有评估。这是检验 Schema 的世界建模循环能否迁移到开发期间所用环境之外的最直接方法。

如果得分接近所报告的公开区间,将强化“该框架能够在首次接触期间发现机制”这一主张。若得分大幅下降,则说明其可能专门适配了公开测试集。

第二个信号是发布完整、可复现的框架,并附带固定的评估协议。研究人员需要获得提示词、工具、路由规则、重试限制、模型选择流程和评分管线。

独立团队应当能够在不手动修正其世界模型的情况下运行相同配置。若能在不同模型提供商之间复现结果,便会进一步增强这一架构层面的主张。

现有轨迹是一个有意义的起点。它们公开了 50 次运行以及足以检验所报告结果的评分数据。

然而,完整复现需要生成这些轨迹的整套机制,还需要披露失败的运行,以及发布前应用的任何筛选标准。

第三个信号是一份涵盖环境动作之间计算量的效率报告。RHAE 衡量相对于人类的动作效率,这是 ARC-AGI-3 设计的核心。

它并未描述每一次模型调用、模拟步骤或搜索分支。这些指标决定了该方法是否实用,以及不同对比是否采用了相似的推理预算。

框架通过增加内部计算来减少高风险外部动作,可能理应得到肯定。这种权衡在软件部署、实验室控制或成本高昂的运维工作流中可能很有价值。

但研究人员仍需要清楚地了解这种权衡。只报告最终的环境动作,会隐藏一个重要维度。

这些信号比在相同 25 个环境上再获得一个醒目的得分更重要。公开测试集已经表明,Schema 能够将前沿模型组织成一个有效的求解器。

尚未得到解答的问题是,它是否掌握了一套可复用于学习陌生系统的流程。这远比高效重放已知游戏结构的门槛更高。

对开发者而言,眼下的启示务实但需要保持克制。不要假设模型的默认智能体得分就代表其可用能力。

测试显式状态模型、可执行预测、历史验证和预设恢复方案,是否能改进你真正关心的工作流。衡量失败,而不仅仅是成功的输出。

对于基准测试的读者,请明确评估边界。98.98% 的公开得分是一项令人印象深刻的系统成果,但它并不代表在未见过的 ARC-AGI-3 环境中经过验证的 98.98% 得分。

首先关注半私有评估,其次是可复现版本的发布,第三是完整的推理成本核算。这些结果结合起来,将揭示 Schema Harness 找到的是一种通用的智能体机制,还是一个针对公开数据集的卓越解决方案。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page