top of page

OpenAI 称两项 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分提升近三倍

OpenAI 调整了两项 API 设置,使 GPT-5.6 Sol 的 ARC-AGI-3 公开得分从 13.3% 提升至 38.3%,接近三倍。OpenAI 的说明聚焦于保留推理和压缩,这两项可通过 Responses API 实现的上下文管理选择。OpenAI 表示,两者结合还将输出 token 用量降至原来的六分之一。

这一结果让人难以再按惯常方式解读 AI 基准测试。受测模型没有获得新的训练、更大的推理预算或针对游戏的专用工具。相反,OpenAI 改变了测试框架,也就是在模型与基准测试之间传递观测、动作和对话历史的软件层。

因此,核心对比并非 GPT-5.6 Sol 与另一模型之间的竞争,而是通用的标准化测试框架与面向特定模型的生产级测试框架之间的差异。前者强调可比性,让智能体面对相同的基础接口;后者则保留了 OpenAI 所称其推理模型在长期交互任务中所需的状态。

这一区别很重要,因为 ARC-AGI-3 并不要求给出一个最终答案。它会提供没有自然语言说明的陌生游戏。智能体必须推断每个游戏的规则、发现目标、检验假设、记住失败,并在多次操作中不断调整。

每一步之后都会遗忘自身推理的系统,面对的任务不同于能够保留持续演化计划的系统。同样,当上下文填满时丢失最早观测的智能体,与获得紧凑摘要的智能体所经历的也不是同一个游戏。

OpenAI 的结果并未判定哪种测试框架能产生最公平的排行榜。它确实表明,测试框架设计对测得能力的影响可能超过许多模型升级。这也促使基准测试运营方、模型开发者和企业评估团队记录完整的受测系统。

OpenAI 说明得分为何跃升

模型保持不变,改变的是它的记忆路径。

OpenAI 在调查 GPT-5.6 Sol 意外偏弱的结果后,于 2026 年 7 月 29 日发布了分析。其最初的担忧很直接:一款能够处理高难度数学问题和长时间游戏会话的模型,在看似简单的二维环境中却显得并不有效。

最初的差异涉及多个得分数据。OpenAI 指出,GPT-5.6 Sol 的 ARC-AGI-3 总体得分为 7.8%,而 GPT-5.5 为 0.4%。在用于受控比较的公开任务集上,GPT-5.6 Sol 使用官方测试框架时得分为 13.3%。

随后,OpenAI 通过其 Responses API 重建了评估。修订后的测试框架在动作之间保留推理,并以压缩替代滚动截断。根据该公司的基准分析,这一配置将公开任务集得分提高至 38.3%。

该得分采用相对人类动作效率(Relative Human Action Efficiency,RHAE)。这一指标将成功进展与人类所需动作数量进行比较。智能体若以低效率方式解决任务,获得的认可会更少,因此盲目探索和重复犯错都会带来可量化的代价。

OpenAI 估计,平均人类测试者按同一标准得分为 48%。这一估计来自官方游戏日志,并不意味着每一位人类都能得到 48%。ARC Prize 则单独将 100% 描述为以与人类基线同等效率通关所有游戏的得分。

因此,38.3% 的结果并未弥合与人类之间的差距。但它确实让 GPT-5.6 Sol 更接近 OpenAI 估计的平均测试者水平。更重要的是,这一变化并未伴随模型更新。

输出 token 的发现还带来了另一层反转。更长的记忆听起来可能更昂贵,因为智能体携带了更多上下文。然而,OpenAI 报告称,修订后的配置使用的输出 token 少了六倍。模型不再需要反复输出内容来重建已经形成的规则和计划。

一次游戏回放提供了具体示例。OpenAI 展示了一个环境,在相关排行榜中,没有任何前沿模型能够完成第一关之后的内容。据称,其修订后的 Responses API 测试框架让 GPT-5.6 Sol 完成了全部六关。

ARC Prize 的验证结果提供了有用背景。其 GPT-5.6 评分卡列出,Sol 在最高推理设置下的半私有 ARC-AGI-3 得分为 7.78%。其中还记录了公开游戏 FT09 上的 87% 成绩;这是首个被模型攻克的公开 ARC-AGI-3 游戏。

这些数据描述的是不同的数据集和评估视角,因此读者不应将它们合并为一个性能数字。13.3% 至 38.3% 的受控比较,才是支持 OpenAI“两项设置”主张的相关证据。

在基准测试报道中,这一区别很容易被忽视。公开任务集实验、半私有验证得分和单个游戏的结果,回答的是不同的问题。OpenAI 的实验具体考察的是:当测试框架保留更多工作状态时,同一模型会如何表现。

答案引人注目,但也有明确边界。保留推理和压缩在 OpenAI 的实现下,改善了这款模型在这一公开任务集上的表现。该结果并不能证明每种模型、智能体、上下文长度或生产工作负载都会获得相同增益。

官方测试框架也在测试遗忘能力

ARC-AGI-3 衡量的不仅是智能体,也包括围绕它的信息架构。

ARC-AGI-3 不同于模型接收问题并返回一个答案的静态基准测试。它由交互式环境构成,要求反复进行感知、规划、操作和修正。其基准概述强调目标获取、可适应的世界模型、长程规划以及由经验驱动的学习。

该基准没有自然语言指令来解释每个游戏。智能体会获得当前画面的表示和一组可选动作。它必须判断哪些对象重要、动作如何改变环境,以及何为进展。

这种设置让记忆成为受评能力的一部分。有价值的假设可能在多次失败动作之后才会出现。后续观测可以证实或推翻该假设。如果测试框架删除了连接这些事件的推理,智能体就不得不依据更单薄的记录重建自己的理解。

OpenAI 发现,官方测试框架会在每次游戏动作后丢弃私有推理。模型仍能看到先前动作和简短备注,但无法访问促成这些动作的计划、发现或假设。

该测试框架还采用滚动截断。一旦对话超过 175,000 个字符,最早的消息就会被移除。因此,长时间运行可能会抹去早期观测和动作,即使这些事件对当前关卡仍然相关。

这些行为是通用设计的有意结果,而非基准测试存在缺陷的证据。ARC Prize 倾向于采用相对简单的测试框架,因为这能暴露模型局限,并支持跨供应商比较。商业部署通常会使用难以在不同 API 之间直接映射的供应商特定功能。

由此形成了本文的主要对立:标准化评估与贴近生产环境的评估。

标准化测试框架关注的是,哪款模型能通过共同接口获得最佳表现。这种方式限制特殊待遇,也降低某一供应商的私有优化主导比较的可能性。

贴近生产环境的测试框架关注的是,当模型按照其创造者建议的方式部署时,表现究竟如何。这种方式更接近真实应用,但也可能模糊模型能力与系统工程之间的边界。

两种问题都并非没有意义。它们只是产生不同的衡量结果。

当排行榜得分被表述为模型本身的属性时,问题便出现了。如果一种测试框架反复删除另一模型预期保留的状态,那么测试也在衡量模型训练与评估基础设施之间的兼容性。

ARC Prize 已承认这些环境仍然极具挑战。其技术报告指出,截至 2026 年 3 月,人类解决了 100% 的受测环境,而前沿系统得分低于 1%。该基准旨在揭示适应性效率方面的巨大差距。

GPT-5.6 Sol 后续的得分显示出进展,尤其是在个别公开游戏中。然而,38.3% 的公开任务集结果距离人类水平的效率仍有很大差距。而且,该结果来自模型开发者自身的测试框架和分析。

教训并不是 ARC-AGI-3 变得容易了,而是交互式基准测试可能会在规划和探索之外,意外测试人为造成的失忆。

这一问题并不局限于游戏。编程智能体必须跨工具调用记住架构决策。研究智能体必须保留哪些来源支持或反驳某项主张。客户服务系统必须维持对话早期引入的约束。

若企业团队在评估这些系统时反复丢弃其内部状态,可能会低估其有用性能。若团队允许不受限制的供应商特定优化,则可能产生难以比较或复现的结果。

更好的回应是进行更完整的披露。基准测试报告应说明模型版本、推理强度、上下文策略、保留的响应项目、压缩行为、提示词、工具、动作预算和评分方法。缺少这些信息,得分就缺乏必要的运行背景。

保留推理让智能体不必从头开始

保留推理让 GPT-5.6 Sol 在多次动作之间保持连续性,减少了重复理解工作。

推理模型会在生成可见文本或工具调用之前,生成内部推理项目。这些项目不同于面向用户的解释。它们构成模型在多步骤交互过程中的部分工作状态。

在 OpenAI 所研究的官方测试框架中,每次游戏动作实际上都会结束这一状态。下一次请求会包含先前动作和简短备注,却会丢弃将它们连接起来的推理。GPT-5.6 Sol 因而反复面对相同的解释负担。

设想一个正在探索带有彩色物体网格的智能体。它测试某种颜色是否标记障碍物,随后发现该颜色会在一次成功移动后变化。这个观测可能推翻它的第一种理论,并确立一条新规则。

动作日志记录了智能体点击了什么,却不一定保留它为何点击、排除了哪些替代方案,或结果画面意味着什么。这些细节可能决定下一步动作是推进策略,还是重犯先前的错误。

OpenAI 使用 Responses API,并在每轮之间传递前一响应的标识符。其当前模型指南说明,GPT-5.6 可以在多轮之间复用可用的推理项目。开发者还可通过推理上下文设置,控制多少先前推理仍被视为相关。

根据 OpenAI 的说法,保留推理以两种方式改变了 GPT-5.6 Sol 的行为。模型在每次动作前花费的思考时间更少,并在更长的运行过程中采用了更连贯的策略。它不再需要在每次移动后从头重新解释游戏。

这解释了为何 token 使用量可能下降,而保留的状态却在增长。输出 token 包括模型新生成的推理和回复。如果先前的洞见仍然可用,模型就无需再次生成冗长的重建过程。

这种区别类似于项目团队保留决策记录,与只收到一份已完成任务清单之间的差异。任务清单展示了发生过什么,却不会保留塑造当前计划的被否决方案、约束条件或证据。

对于知识工作者而言,当 AI 助手处理一项长期调查时,也会出现同样的问题。每一份检索到的文档都会改变当前的工作假设。如果系统只保留链接和简短回答,后续结论就可能失去让这些来源变得相关的推理过程。

这正是外部可搜索知识库可以补充模型上下文的地方。即使 agent 压缩了临时工作状态,持久化的来源记录仍应可供检查。

保留推理仍会带来权衡。任务发生变化后,旧推理可能过时;如果系统从未将其标记为已否决,早期错误的理论可能会影响后续步骤。更多记忆并不自动意味着更好的记忆。

OpenAI 的 API 指引反映了这一问题。当目标保持稳定时,它允许开发者跨所有轮次保留推理;而当早期推理已失去相关性时,则可聚焦当前轮次。该选择应由工作流决定,而不是遵循一刀切的规则。

ARC-AGI-3 游戏为连续性提供了有利场景。目标和环境在多个动作之间保持关联,因此早期假设通常仍然重要。突然切换话题的客服对话,则呈现出不同的上下文管理问题。

安全和隐私政策同样影响实现方式。一些组织无法无限期存储回复历史;另一些则使用无状态或零保留配置。这些团队必须谨慎管理继续执行所需的加密推理项目和其他回复对象。

因此,保留推理描述的是一种系统行为,并不意味着可以暴露私有的思维链内容。应用应通过 API 保留受支持的回复项目,同时向用户呈现简洁、恰当的解释。

OpenAI 的实验还提出了一个实用的评估问题。如果一个 agent 在执行三十步后失败,评审者应检查:是它的计划本身错误,还是 harness 移除了继续执行该计划所需的状态。

这些失败模式需要不同的修复方式。推理失败需要更好的模型、提示词或策略;状态管理失败则需要不同的基础设施。将两者都视为模型智能问题,会掩盖工程投入真正应落在何处。

压缩在不携带一切的前提下保留过去

压缩并非粗暴删除,而是用仍保留关键信息的更短历史表示来替代它。

每个长期运行的 agent 最终都会遇到上下文限制或成本限制。保留每一条观察、工具结果和中间思路,可能使后续请求变慢且失去焦点。仅保留推理无法解决上下文无限增长的问题。

官方 ARC-AGI-3 harness 通过滚动截断来处理增长。一旦历史记录超过阈值,它就移除最早的内容。这一策略可预测且不依赖特定提供商,但它假设旧信息因为更早出现而较不重要。

交互式游戏违背了这一假设。一次早期动作可能揭示目标;在开头看到的线索,可能解释很久之后遇到的符号。按时间顺序删除,可能会抹去基础知识,同时保留近期却重复的画面。

压缩采用不同策略。它将早期上下文浓缩为更小的表示,同时保留相关状态。agent 可以在可管理的上下文中继续执行,而无需携带每一个原始 token。

OpenAI 表示,其 ARC 实现使用了 175,000 token 的压缩上限。官方 harness 则使用 175,000 个字符作为截断上限。OpenAI 认为,这两个阈值大致可比,因为动作网格的 token 化比例约为每个字符一个 token。

这一实现细节很重要。如果上限存在显著差异,分数提升可能反映的是更大的有效上下文,而非更好的记忆策略。OpenAI 的比较尝试在改变旧信息留存方式的同时,维持接近的阈值。

该公司的压缩文档将压缩描述为一种在长期 Responses API 工作流中降低上下文大小的方法。由此产生的压缩状态可支持继续执行,无需应用重新发送无限长的完整记录。

压缩并非无损存储。摘要可能遗漏细节、弱化不确定性,或保留错误的解释。它的价值取决于是否选出了未来动作所需的信息。

ARC-AGI-3 对这种选择提出了严苛考验。agent 必须保留已发现的规则、目标、对象含义、失败的假设、关卡进度和计划中的动作。重复网格和冗余推理则可以获得较少关注。

OpenAI 报告称,压缩后的 harness 在更长的运行中保留了学习成果,并生成了更少的输出 token。其比较动画显示,改进后的 agent 每次动作所需思考更少,通关速度也更快。

即使不讨论货币价格,输出 token 减少六倍也具有运营意义。更低的输出量可以降低延迟,并释放容量用于更多评估。只要压缩状态仍足够具有信息量,它也能让 agent 轨迹更易于检查。

不过,读者应将该数字视为特定工作负载下的结果。ARC-AGI-3 会产生重复的文本网格和大量连续动作。法律审查、医疗工作流或金融分析可能包含难以激进总结的细节。

评估团队应将压缩质量与最终任务成功率分开测试。他们可以比较保留的约束、事实一致性、中断后的恢复能力,以及 agent 解释哪些证据塑造决策的能力。

一种有用的测试是在早期引入一项关键事实,用后续活动填满上下文,然后检查 agent 是否正确应用该事实。另一种测试是在中途修改一项要求,并验证压缩是否保留修订内容,而不是原始指令。

这些测试揭示了核心权衡。滚动截断提供透明的损失,因为评审者明确知道哪些消息消失了。压缩则提供选择性的连续性,但其遗漏可能更难被发现。

对于生产环境的 agent,选择性连续性通常更贴合任务。人类不会记住每一个视觉画面或句子,而是维持一个优先关注目标、约束、发现和未解决问题的工作模型。

这种类比不应成为隐藏失败的借口。开发者需要轨迹、回放工具和受控评估,以了解压缩是否保留了正确状态。否则,一个自信的最终回答可能掩盖了遗漏的早期约束。

因此,OpenAI 的做法并不主要关乎让上下文窗口变得更大,而是关乎在窗口容纳不下一切时,改变哪些信息能够留存。

三倍分数并不能证明什么

由开发者运行的公开任务集实验,无法确定最公平的通用基准配置。

OpenAI 的证据支持一个狭窄但有价值的结论:在 OpenAI 的 ARC-AGI-3 实现中,当保留推理并以压缩取代滚动截断时,GPT-5.6 Sol 的表现更好。

这并不能证明官方 harness 无效。官方设置服务于不同目标:通过可由各提供商的基准参与者复现的通用接口,展示模型行为。

提供商特有功能使公平比较变得复杂。OpenAI 可以通过 Responses API 保留其原生推理项目。另一家提供商可能以不同方式表示内部状态、提供不同的继续执行控制,或依赖另一种记忆架构。

允许每家公司优化私有 harness,可能会将模型基准测试变成系统竞赛。这种形式仍可衡量某些有用的东西,尤其适用于选择完整 agent 系统的买家。但它不再能如此清晰地隔离模型行为。

该结果同样来自 OpenAI 的公开任务集实验。公开游戏可供检查和开发,因此为 harness 调优创造了更多机会。半私有结果能更有力地检验是否存在直接针对特定任务的调整。

ARC Prize 的验证排行榜仍显示,GPT-5.6 Sol 在最大推理设置下于半私有任务集获得 7.78%。这一分数领先于其中列出的其他 GPT-5.6 系列变体,但仍远低于人类的完成度和效率。

OpenAI 公开比较中的 38.3% 与验证半私有评估中的 7.78% 之间的差距,需要谨慎解读。由于任务集不同,这并不自动与 harness 发现相矛盾。但它说明,单一公开任务集上的改进不应演变成关于类人游戏学习的普遍主张。

OpenAI 对普通人类测试者 48% 的估计提供了背景,但不代表等价。人类和模型可能以不同方式失败、使用不同的动作模式,并对陌生界面做出不同反应。RHAE 将这些行为压缩为一个分数。

该实验还结合了两项变化。保留推理和压缩在核心比较中同时启用。OpenAI 描述了每项变化的行为影响,但公开的核心数字并未完全隔离各设置的贡献。

更完整的消融实验应报告四种配置:两项设置均不用、仅保留推理、仅压缩,以及两者同时使用。重复运行将有助于量化方差,尤其是在 agent 探索可能走向不同路径的情况下。

输出 token 的比较同样值得严格审视。更少的 token 表明在该 harness 下效率有所提升,但并未揭示总延迟、输入 token 处理、压缩开销,或维护状态所需的工程工作。

基准运营方如今面临来自两个方向的压力。如果保留通用 harness,他们应说明排行榜结果可能低估生产环境配置;如果接受优化的 harness,他们应披露哪些能力来自模型,哪些来自周边代码。

模型提供商承担着相应责任。他们应发布可复现的配置、提示词、上下文阈值、动作预算和评分卡。独立团队能够复现时,有关设置的主张会更有价值。

企业买家不应在通用测试与优化测试之间二选一,而是需要两者兼具。

通用测试展示候选模型在常见约束下的表现。代表生产环境的测试则展示完整系统能否在买家的实际工作流中成功。两种结果之间的差异衡量的是集成敏感性。

这种敏感性本身就是业务风险。一个只有通过特定状态管理栈才能表现良好的模型,可能更难迁移;一个剥离关键能力的通用 harness,则可能出于错误原因让团队选择了更弱的模型。

真正相关的问题不是基准测试还是 OpenAI 正确,而是每个分数描述的是哪一条系统边界。

OpenAI 的 ARC-AGI-3 结果之后值得关注的三个信号

独立复现、半私有测试和更完善的 harness 报告,将决定该结果是否会改变评估实践。

第一个信号,是独立复现这 13.3% 至 38.3% 的提升。可信的复现应采用相同的公开游戏、推理强度、行动限制、上下文阈值和评分方法,并报告不同运行之间的波动。

复现将增强 OpenAI 的主张,即状态处理解释了观察到的性能差距中的很大一部分。若提升幅度明显更小,则表明未公开的实现细节、提示方式或评估器选择的影响,可能大于这两项明确指出的设置。

第二个信号,是采用保留推理与压缩机制的半私有评估。公开任务有助于开发者诊断行为,但未公开或受限的环境更能检验泛化能力。在这类环境中获得类似提升,将表明该测试框架的改进能够迁移到熟悉的公开游戏之外。

半私有评估中的小幅提升会削弱这一广泛解读。这可能意味着,更好的记忆只是在帮助模型执行已知策略,而未能解决获取新目标和规则这一更深层的挑战。

第三个信号,是基准披露标准的转变。未来的排行榜应在分数旁公布上下文管理政策。报告应说明推理内容是否在行动之间得以保留、如何删除或压缩旧历史,以及启用了哪些提供商特定功能。

这种报告将让读者比较两种有价值的视角。一种视角通过标准化接口衡量模型。另一种视角则衡量按照提供商指导配置的完整系统。

开发者也应以同样的严谨态度开展自身评估。在更改设置之前保留基线,然后在具有代表性的工作负载上,分别测试保留推理、压缩,以及两者结合的效果。

衡量指标不应仅限于最终成功率。还应跟踪输出 token、输入增长、延迟、重复操作、约束保留情况、从失败假设中的恢复能力,以及由过时记忆造成的错误。如果评估只关注终点,更高的分数可能会掩盖新的失败模式。

团队还应检查连续性在哪些场景中有帮助。长时间编码任务、交互式研究、浏览器智能体和多阶段分析,往往依赖于累积的发现。简短的分类或提取请求则可能很难从持久推理中获益。

OpenAI 的这一发现发出了明确警示:智能体评估可能会因评估者施加的记忆政策而惩罚模型;也可能通过竞争对手无法复现的基础设施,让模型显得更出色。

下一步有价值的做法,不是宣称其中任一测试框架正确,而是同时运行两者、准确标注它们,并公布足够的细节,让其他人理解其中差异。

对于任何正在构建长期运行智能体的人来说,眼前的问题很实际:你的系统是否保留了下一步行动所需的目标、证据和已被否定的假设?在责怪模型之前先测试这种连续性,并在每次更改压缩或上下文政策后再次测试。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page