top of page

随着 MineExplorer 任务复杂度提升,Claude Opus 4.6 暴跌 65 个百分点

Anthropic 的 Claude Opus 4.6 在 MineExplorer 中领跑,但其成功率从单跳任务的 77% 降至四跳任务的 12%。根据美团 LongCat 团队公布的结果,该模型在整个基准测试中的完成率仅为 41%。

这一下滑,才是 Anthropic MineExplorer 结果真正值得关注的地方。目标只需一个直接步骤时,Claude 表现出色;而当成功取决于在不断变化的世界中发现并协调多个未明说的前提条件时,它便陷入困境。

MineExplorer 通过 813 个经人工验证、最长持续三分钟的 Minecraft 场景衡量这一差距。它测试了来自八个模型家族的 18 个多模态模型,其中包括 Claude、GPT 和 Gemini 系统。该基准测试的作者已发布代码、数据集、任务生成流程和评估环境。

这一结果挑战了人们对多模态智能体的一个常见假设:能够识别威胁、物体或资源,并不意味着模型能在环境变化时维持有效计划。MineExplorer 将这种差异转化为一条可量化的失败曲线。

早期的 Minecraft 基准测试考察过规划、指令遵循、建造或游戏知识。MineExplorer 则排除了许多高度依赖 Minecraft 特定规则的任务。其明确目标更为广泛:在持续轨迹中结合感知、推理与行动的探索能力。

该基准测试目前仍是一篇预印本,Minecraft 也无法代表所有物理环境。然而,这些发现立刻对一种说法施加了压力:更强的视觉能力和更长的上下文会自动带来可靠的自主智能体。

MineExplorer 将三分钟变成一场严肃的智能体测试

MineExplorer 将评估目标从识别场景,转变为在一连串相互依赖的决策中完成任务。

LongCat 团队在一篇 2026 年 5 月的预印本中介绍了 MineExplorer。第二个版本于 6 月 12 日发布,美团技术团队则在 7 月公布了详细的结果摘要。

每个回合最多可运行 1,800 个环境步骤。每一步代表 0.1 秒,形成三分钟的连续交互。世界会在每次行动后更新,因此模型必须反复重新判断自己所见的内容,以及下一步应做什么。

以人类标准衡量,这样的时长听起来很短。但对于必须观察图像、维持状态、选择行动,并在数百次交互中从失误中恢复的智能体而言,这已相当漫长。

任务按跳数划分。单跳任务给出的目标不要求智能体推断未明确说明的子任务。双跳至四跳场景则增加了必须通过环境发现的隐藏前提条件。

设想一个被要求抵达受保护地点的智能体。直接路线可能被封锁,所需工具可能在别处,敌对实体也可能限制移动。指令点明了目的地,却没有列出到达那里所需的每一步行动。

MineExplorer 用初始状态、自然语言指令、依赖图和基于规则的里程碑表示每项复合任务。依赖图记录隐藏的任务结构,而模型永远不会获得这张完整图。

里程碑让评估者无需让另一个语言模型判断整段轨迹,也能衡量部分进展。一个里程碑可能检测智能体是否找到了物体、进入了区域,或完成了必要的中间行动。

作者将这些自动化结果与人工对 Claude Opus 4.6 轨迹的评分进行了比较。完成的里程碑集合获得的平均人工评分接近五分制中的四分;完全失败的集合则低于三分。

这种一致性并不意味着评估器完美无缺。但它提供了证据,表明里程碑完成情况捕捉到了有意义的进展,而非任意的游戏事件。

团队还试图将探索能力与记忆中的 Minecraft 专业知识区分开来。候选原子任务会接受筛选,以判断其是否依赖游戏特有惯例。由专业知识主导的任务会被移除。

这一设计选择很重要,因为智能体无法完成 Minecraft 目标,可能有两种截然不同的原因:它可能缺少游戏 wiki 中的配方知识,也可能无法将可见证据连接为可行计划。

MineExplorer 试图强调第二类问题。其 14 个能力类别涵盖感知、推理和行动,包括空间与时间感知、实体跟踪、资源意识、因果推理、移动、收集、放置、合成和战斗。

公开的 813 个示例涵盖从单跳到四跳的依赖关系。开放数据集包括任务文本、场景设置命令、选定的原子任务、里程碑、依赖图和设计说明。

这不只是一套静态问答题。研究人员可以检查场景的构建方式、重新运行评估、创建更难的变体,或将该环境用于训练。

这种开放性让该基准测试有机会影响智能体开发。对于一个对探索能力作出广泛主张的基准测试而言,它也使其假设更容易受到挑战,这一点十分重要。

Anthropic 在 MineExplorer 中领跑,仍是一个警示

Claude Opus 4.6 赢得了这项比较,但其领先优势揭示出:所有受测模型距离可靠的长程行为仍有很大差距。

该基准测试评估了来自八个家族的 18 个先进多模态模型。Claude Opus 4.6 取得最高的整体任务成功率,达到 41%。

若只看排行榜位置,41% 的结果似乎还算可观。但按任务深度拆分后,它就显得弱得多。

Claude Opus 4.6 完成了 77% 的单跳任务;在四跳任务上,其成功率降至 12%。65 个百分点的降幅表明,增加依赖关系带来的不只是些许难度。

每一个隐藏前提条件都会增加一次丢失计划的机会。模型必须注意到相关证据、推断中间目标、正确执行,并维持其与最终目标之间的联系。

早期失误可能在整个回合中扩散。错过所需资源会阻断下一步行动;选择错误路线会消耗步骤,并改变智能体的视野。之后的观察便可能基于已经错误的内部状态被解读。

这正是 Anthropic MineExplorer 结果施压对象不止 Anthropic 的原因。Claude 是该测试中最强的模型。因此,它的失败曲线是这种特定设置下的性能上限,而不是 Claude 存在孤立弱点的证据。

这些发现也令标准的模型规模化叙事变得更复杂。论文报告称,更大的模型和专用思考模式并未始终带来性能提升。

更多参数可以增强受限提示中的感知或推理能力。但动态环境还要求另一种能力:在记忆、当前观察与变化目标之间维持有效对齐。

更长的上下文并不保证这种对齐。它可能保留已无法描述当前场景的旧图像。这些观察可能与更新鲜的证据竞争,而不是帮助模型。

作者通过增加历史视觉帧数量来测试这一问题。随着过时观察干扰模型对当前状态的理解,性能最终出现下降。

他们还考察了模型是否只是需要更多时间。即使回合允许最多 1,800 步,未成功的智能体依然失败。可解任务通常更早完成,而额外交互并未挽救许多已经偏离的轨迹。

这些结果削弱了两种简单修复方案。给智能体更多上下文,并不等同于赋予它更好的记忆;给它更多行动机会,也不等同于赋予它更好的计划。

这种压力也延伸到构建计算机操作智能体、机器人系统和自动化研究工具的开发者。这些产品并非在固定截图之外运行;它们的环境会响应智能体行为和外部事件而变化。

一个浏览器智能体可能需要找到记录、修改筛选条件、解读更新后的页面,并验证最终提交。一个仓库机器人可能在发现通道被阻塞后需要重新规划路线。一个研究智能体可能在发现相互矛盾的证据后需要修正搜索方向。

在每种情况下,可见目标都隐藏着前置决策。模型可以正确执行每一个孤立动作,却仍然无法完成整项工作。

MineExplorer 并不能证明失败率会直接迁移至浏览器或机器人。它表明,一旦隐藏依赖不断累积,在短时多模态测试中取得成功只能提供有限保证。

这种差异应当影响采购和部署决策。购买方应询问智能体在完整工作流程中的表现,而不应只看其模型是否能识别屏幕或生成看似合理的下一步行动。

真正的问题是导航,而非视觉识别

Claude Opus 4.6 近 60% 的失败被归因于导航,使有状态移动成为该基准测试最明显的瓶颈。

LongCat 团队的失败分析将导航错误与物体交互、任务推理等问题分开。导航占已分析失败案例的近 60%。

这一数字并不意味着模型只是缺乏方向感。开放世界中的导航结合了空间记忆、视觉识别、行动控制和目标管理。

智能体必须知道自己身在何处、记得自己去过哪里,并判断移动是否产生了预期结果。它还必须决定何时放弃一条路线,或探索替代方案。

静态视觉测试只隔离了这一循环中的一部分。模型看到一张图像并回答问题。场景不会因其回答而变化,一次错误回答也不会扭曲下一次观察。

Minecraft 会产生反馈。如果智能体转向错误方向,下一张图像就会包含不同证据。如果它被障碍物卡住,重复的移动命令会消耗时间,却无法推进任务。

随后,模型需要诊断是路线失败、行动失败,还是原始计划出了问题。当观察以彼此分离的帧而非稳定的内部地图形式到来时,这种区分十分困难。

MineExplorer 的能力得分进一步印证了这一解读。Claude Opus 4.6 的感知得分为 61.91,推理得分为 54.71。在大多数受评模型中,感知能力高于行动能力,行动能力又高于推理能力。

模型往往能够识别相关细节。但它们更难将这些细节转化为能够经受环境变化的协调策略。

这带来了多模态进展通常呈现方式上的一个重要反转。更好的图像理解扩大了智能体能够注意到的内容,但也暴露了处理这些观察的规划系统的弱点。

即使模型检测到十个相关物体,仍需决定此刻哪一个最重要。它必须把这一选择与最终目标连接起来,并在视角改变后保留这种联系。

该基准测试借鉴了 ReAct 方法,将推理与行动和新观察交织进行。最初的 ReAct framework旨在让模型通过环境反馈修正其推理。

MineExplorer 展示了这一循环如何会在更长的轨迹中断裂。推理可能脱离当前状态,行动不再服务于最初目标,或新的观察结果未能触发必要修正。

导航会放大这三类问题。位置错误的智能体会看到错误证据,建立错误的状态估计,并从已经受损的位置继续选择后续行动。

这比生成更长的思维链更难。智能体需要对持续存在的实体、位置、已完成里程碑、失败路线和未解决依赖关系进行结构化表示。

原始视觉历史是较弱的替代方案。它记录的是摄像头看到了什么,而不是智能体应该记住什么。

同样的区别也适用于企业智能体。每个先前屏幕的记录并不会自动形成可靠的工作流状态。智能体必须知道哪个表单已提交、哪个筛选条件仍在生效,以及哪项要求尚未解决。

对于具身系统而言,导航同时成为物理和认知层面的考验。模型必须在空间中移动,同时保持任务的逻辑结构。

因此,MineExplorer 中导航占 60% 的失败比例,指向了系统层面的工作。更好的局部控制器、显式地图、因果记忆、进度监控和恢复策略,可能与更强的基础模型同样重要。

该基准测量什么,以及不测量什么

MineExplorer 提供了有用的压力测试,但其结果仍受限于一个模拟世界和研究人员定义的任务分布。

最有力的质疑涉及外部有效性。Minecraft 提供了具有一致规则的动态 3D 世界,但它并不能复现家庭、工厂、办公室或公共空间中所有的困难。

真实机器人要面对不确定的物理规律、传感器噪声、物理损坏和安全约束。计算机使用智能体则会遇到隐藏的应用状态、身份验证障碍、弹窗和不断变化的界面。

Minecraft 消除了许多此类复杂性。它的对象是离散的,物理规律可重复,环境可以精确重置。

这种可控性也是一种优势。研究人员可以在相同条件下比较模型,并在不危及设备或用户的情况下追踪失败原因。

关键在于将 MineExplorer 视为诊断工具,而非具身智能的通用评分。41% 的结果并不意味着 Claude 能完成 41% 与之无关的真实世界工作流。

该基准的知识过滤也需要审视。作者使用语言模型判断,将原子任务归类为主要依赖通用知识还是 Minecraft 特定惯例。

这一过程减少了明显的游戏知识混杂因素,但无法保证每个保留任务都不受熟悉度效应影响。

在 Minecraft 视频、指南或游戏讨论上训练过的模型,仍可能识别常见布局和行为。不同模型家族接触过此类材料的程度也可能不同。

根据其 arXiv 记录,该基准本身仍在持续完善。未来修订可能改变任务、提示词、控制器或评估程序。

控制器设计尤为重要。多模态模型很少只通过抽象推理来操控游戏。周边智能体系统会将模型输出转换为移动和交互指令。

因此,性能同时反映了底层模型及其支撑框架。更好的地图系统或底层控制器,可能无需改变模型就能提升结果。

基准作者还承认另一项限制。MineExplorer 目前聚焦于实证评估,尽管其基础设施也可用于训练。

在基准环境上训练也会带来自身风险。一旦开发者直接针对公开任务进行优化,排行榜提升可能反映的是基准专项化,而非通用探索能力。

完全开源的 MineExplorer 代码 让复现和扩展更容易,也使污染和过拟合问题对后续模型发布变得更加重要。

独立评估应保留隐藏测试场景,并应改变场景布局、依赖结构、控制器实现和提示词格式。

历史背景支持这种谨慎态度。MinePlanner 此前发布了 45 个用于长时程规划的 Minecraft 任务,发现成熟规划器在包含大量对象的大型环境中表现吃力。

MinePlanner 基准 聚焦于命题和数值规划,而非交互式多模态探索。其结果仍表明,Minecraft 能暴露出较小规划领域所隐藏的扩展性问题。

其他系统研究了指令遵循、建造、记忆和开放式技能。这些项目使用同一游戏研究不同问题,因此不应直接比较其核心评分。

MineExplorer 的具体贡献,在于结合了持续视觉交互、隐藏前提条件、多跳任务构建和基于规则的里程碑评估。

它的“首个”声明应在这一界定下理解。在 MineExplorer 之前,Minecraft 就已承载长时程研究。团队的新颖性主张,针对的是其特定评估结构下分钟级的开放世界多模态探索。

另一个限制是,发布后不久缺乏广泛的独立反响。目前大多数详细解读都来自作者及其关联技术渠道。

测得的结果可供检视,但因果解释仍部分属于诠释。例如,导航的大量失败占比并未完全分离根本原因究竟是地图构建、记忆、规划还是行动执行。

这些不确定性并未抹去核心发现:随着隐藏前提条件不断累积,成功率会急剧下降。它们界定了后续实验必须区分的内容。

开源让 MineExplorer 不只是一个排行榜

这一发布很重要,因为研究人员可以检验更好的记忆、控制器或训练方法是否能让长时程失败曲线趋于平缓。

团队使用多智能体工作流构建基准实例。五个专业智能体在协调器控制的顺序下协作。

工作流始于初始任务草案。随后,专业和验证智能体会讨论设计、识别不一致之处,并修订场景、依赖图和里程碑评估器。

根据作者的人类评估,这一过程相较单智能体基线将实例有效性提高了约 30 个百分点。它还将质量评分提高了约 0.5 分,对四跳任务的收益最大。

最终发布包含 813 个经人工验证的实例。另有一个高难度子集,提供了 100 个难度更高的场景。

这一生成流程解决了基准测试中的长期问题。手工构建数百个交互式环境十分缓慢,而不受约束的模型生成任务往往包含无法完成的目标或失效的评估。

将自动化合成与人工验证结合,提供了一条中间路径。这种方法可以产生更多任务,同时保留质量把关机制。

同一方法不仅能生成测试案例,也能生成训练场景。研究人员可以创建依赖图、实例化沙盒场景,并附加确定性的里程碑检查。

这很重要,因为长时程智能体需要练习那些随时间展开的失败情形。静态视觉数据集无法教会它们如何从走错路或遗漏前提条件中恢复。

开放基础设施也鼓励端到端模型扩展之外的替代方案。团队可以保持基础模型不变,测试显式空间地图、情景记忆、因果图或分层规划器。

另一项实验可以将高层规划与低层移动分离。模型负责选择目标,而专用控制器负责避障和路线执行。

研究人员随后可以探究,导航失败究竟反映了智能不足、运动控制不足,还是两者之间接口不稳定。

该基准还可能支持课程设计。智能体可以从单跳任务开始,待完成率稳定后,再逐步进入更深的依赖图。

不过,训练集和评估集必须保持区分。复用公开场景会让 MineExplorer 变成记忆测试。

未来最具信息量的结果不会是排行榜上的小幅提升,而是从单跳到四跳任务时更平缓的下降曲线。

一个提高整体成功率、却保持相同崩塌曲线的系统,改善的是局部能力。一个在依赖加深时仍能保持性能的系统,改善的则是长时程协调能力。

这一区别应塑造未来的报告方式。总体任务成功率将多种行为压缩为一个数字。按跳数划分的性能则揭示了智能体从何处开始无法可靠运作。

开放发布为外部团队提供了检验这些主张的工具,也让他们能够在无需重建完整 Minecraft 技术栈的情况下提出更难的评估。

Anthropic MineExplorer 结果发布后值得关注什么

下一阶段应聚焦独立复现、改进导航系统,以及在未见多跳任务上保持稳定性能。

第一个信号是独立复现 41% 的总体得分,以及从 77% 降至 12% 的表现下滑。研究人员应在已记录的控制器、提示词和环境设置下,重新运行 Claude Opus 4.6 及其他模型。

接近的复现结果将加强这样一种主张:隐藏前提条件驱动了普遍的失败模式。较大差异则表明,智能体支撑框架的贡献可能比初始排行榜所显示的更大。

第二个信号是,显式状态和导航系统能否减少占主导地位的失败类别。有价值的实验应比较原始帧历史与地图、结构化记忆、因果任务图和路线恢复策略。

有意义的改进应在不牺牲推理或行动性能的情况下减少导航失败。仅仅增加上下文窗口,并不能回应该基准的核心批评。

第三个信号是新模型在保留的四跳场景上的表现。开发者应按跳数报告任务成功率,而不只是报告总体平均值。

如果一个模型在单跳任务上得分更高,却在四跳任务上仍接近 12%,它并未弥合长时程差距。未见依赖结构上的更强结果,将为通用探索提供更好的证据。

读者还应关注模型开发者是否在官方系统卡中采用 MineExplorer 或相关评估。若被纳入,这将表明长时间运行的多模态交互正在成为标准能力目标。

对开发者而言,实际教训已经很清楚。不要只通过孤立行动或精美演示来评估智能体。

应测试具有隐藏前提条件、状态变化和恢复机会的完整工作流。衡量智能体在何处失去对目标的追踪,并区分感知错误与导航、推理和控制失败。

企业采购方也应要求同样的证据。模型的基准排名几乎无法说明集成式智能体能否持续完成多阶段流程。

MineExplorer 并未终结具身 AI 的争论。它提供了一种可复现的方法,让人们更难忽视其中的一项弱点。

Anthropic 的 MineExplorer 结果尤其具有启发性,因为 Claude Opus 4.6 获得了第一名。这个受测模型中最强的系统,仍在任务深度从单跳升至四跳时损失了 65 个百分点。

这正是该基准的核心反转。当前多模态模型往往能够描述一个世界,却无法可靠地在其中导航。

因此,下一个可信的智能体里程碑,并不是再给出一张完美的截图答案,而是在陌生环境中持续取得进展,包括能够察觉自己走错了路,并在任务结束前及时纠正。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page