top of page

MineExplorer 显示:随着任务深度增加,多模态智能体表现失速

Anthropic 的 Claude Opus 4.6 在 MineExplorer 测试中位居榜首,但其成功率从单跳任务的 77% 降至四跳任务的 12%。根据美团 LongCat 团队公布的结果,该模型在整个基准测试中的完成率仅为 41%。

这种断崖式下滑,才是 Anthropic MineExplorer 结果真正值得关注的地方。当目标只需一步直接操作时,Claude 表现良好;但当成功依赖于在不断变化的世界中发现并协调多个未明示的前置条件时,它便陷入困难。

MineExplorer 通过 813 个经过人工验证、最长持续三分钟的 Minecraft 场景来衡量这一差距。它测试了来自八个模型家族的 18 个多模态模型,其中包括 Claude、GPT 和 Gemini 系统。该基准测试的作者已发布其代码、数据集、任务生成流程和评估环境。

这一结果挑战了人们对多模态智能体的一个常见假设:能够识别威胁、物体或资源,并不意味着模型能够在环境变化时维持有效计划。MineExplorer 将这种区别转化为一条可量化的失败曲线。

此前的 Minecraft 基准测试考察过规划、指令遵循、建造或游戏知识。MineExplorer 则剔除了许多高度依赖 Minecraft 专属规则的任务。其明确目标更为广泛:考察在持续轨迹中融合感知、推理和行动的探索能力。

该基准测试目前仍是一篇预印本,Minecraft 也无法代表所有物理环境。不过,这些发现立即对一种说法施加了压力:更强的视觉能力和更长的上下文会自动带来可靠的自主智能体。

MineExplorer 将三分钟变成一项严肃的智能体测试

MineExplorer 将评估目标从识别场景,转向在一连串相互依赖的决策中持续完成任务。

LongCat 团队在一篇 2026 年 5 月预印本中提出了 MineExplorer。第二个版本于 6 月 12 日发布,美团技术团队则在 7 月公布了一份详细的结果摘要。

每个任务回合可运行 1,800 个环境步。每一步代表 0.1 秒,因此可形成三分钟的持续交互。世界会在每次操作后更新,因此模型必须反复重新判断自己看到了什么,以及下一步该做什么。

按人类标准看,这一时长似乎不长;但对需要观察图像、维持状态、选择动作,并在数百次交互中从错误中恢复的智能体而言,这已是很长的过程。

任务按跳数划分。单跳任务给出一个目标,智能体无需推断任何未明示的子任务。两跳至四跳场景则加入必须通过环境发现的隐藏前置条件。

设想一个智能体被要求到达受保护地点:直接路线可能受阻,所需工具可能在别处,敌对实体也可能限制移动。指令说明了目的地,却没有列出抵达所需的每一步操作。

MineExplorer 用初始状态、自然语言指令、依赖图和基于规则的里程碑来表示每项复合任务。依赖图记录隐藏的任务结构,但模型永远不会收到这张完整图。

里程碑让评估者无需让另一个语言模型裁判整个轨迹,也能衡量部分进展。某个里程碑可能检测智能体是否找到了物体、进入某个区域,或完成所需的中间操作。

作者将这些自动化结果与人类对 Claude Opus 4.6 轨迹的评分进行了比较。完成里程碑集合的轨迹,平均人工评分接近五分制中的四分;完全失败的集合则始终低于三分。

这种一致性并不意味着评估器完美无缺。但它提供了证据,表明里程碑完成情况捕捉到了有意义的进展,而非任意的游戏事件。

团队还试图将探索能力与记忆化的 Minecraft 专业知识区分开来。候选原子任务会接受筛选,以判断其对游戏特定惯例的依赖程度;主要由专业知识主导的任务会被剔除。

这一设计选择很重要,因为智能体无法完成 Minecraft 目标,可能有两种截然不同的原因:它可能缺少游戏百科中的配方知识,也可能无法将可见证据连接为可执行的计划。

MineExplorer 试图突出第二类问题。其 14 个能力类别涵盖感知、推理和行动,包括空间与时间感知、实体追踪、资源意识、因果推理、移动、收集、放置、制作和战斗。

公开的 813 个示例涵盖单跳至四跳依赖关系。开放数据集包含任务文本、场景设置命令、选定的原子任务、里程碑、依赖图和设计说明。

这不只是一个静态题集。研究人员可以检查场景构建方式、重新运行评估、创建更高难度的变体,或将该环境用于训练。

这种开放性让该基准测试有机会影响智能体开发。它也使其假设更容易受到质疑——对于一个就探索能力提出广泛主张的基准测试而言,这是一项重要特性。

为什么 Anthropic MineExplorer 的领先仍是一个警示

Claude Opus 4.6 赢得了这项比较,但它的领先恰恰揭示出:所有受测模型距离可靠的长程行为仍有多远。

该基准测试评估了来自八个家族的 18 个先进多模态模型。Claude Opus 4.6 以 41% 的总体任务成功率居首。

如果只看排行榜位置,41% 的结果似乎尚可;但按任务深度拆分后,它就显得弱得多。

Claude Opus 4.6 完成了 77% 的单跳任务,但在四跳任务上的成功率降至 12%。这 65 个百分点的下降表明,增加依赖关系远不只是略微增加难度。

每个隐藏前置条件都会带来一次丢失计划的机会。模型必须注意到相关证据、推断中间目标、正确执行,并维持其与最终目标之间的联系。

早期失误可能贯穿整个任务回合。错过一个必需资源会阻断下一步操作;选择错误路线会消耗步骤并改变智能体的视野。之后的观察就可能在已经错误的内部状态下被解读。

因此,Anthropic MineExplorer 的结果施压的不只是 Anthropic。Claude 是测试中最强的模型,因此其失败曲线对于这一特定设置而言构成上限,而非证明 Claude 存在孤立弱点。

这些发现也使标准的模型规模叙事变得更复杂。论文报告称,更大的模型和专门的思考模式并未稳定地提升性能。

更多参数可以增强受限提示中的感知或推理能力。但动态环境还要求另一种能力:在记忆、当前观察和变化的目标之间维持有效对齐。

更长的上下文并不能保证这种对齐。它可能保留不再描述当前场景的旧图像;这些观察可能会与更新鲜的证据竞争,而非帮助模型。

作者通过增加历史视觉帧数量来测试这一问题。随着过时观察干扰模型对当前状态的理解,性能最终反而下降。

他们还考察了模型是否只是需要更多时间。即便任务回合允许最多 1,800 步,未成功的智能体仍然失败。可解决的任务往往更早完成,而额外交互并未挽救多少已经偏离的轨迹。

这些结果削弱了两种简单修补方案。给智能体更多上下文,不等于赋予它更好的记忆;给它更多动作机会,也不等于赋予它更好的计划。

这种压力延伸至构建计算机使用智能体、机器人系统和自动化研究工具的开发者。这些产品并不在固定截图中运行;其环境会同时响应智能体行为和外部事件而变化。

浏览器智能体可能需要定位记录、更改筛选条件、解读更新后的页面,并验证最终提交。仓储机器人发现通道被阻后,可能需要重新规划路线。研究智能体在发现矛盾证据后,可能需要调整搜索策略。

在每种情况下,可见目标都隐藏着前置决策。模型即使能正确执行每个孤立动作,仍可能无法完成整项工作。

MineExplorer 并未证明这些失败率会直接迁移到浏览器或机器人场景。它表明,一旦隐藏依赖不断累积,在简短多模态测试中的成功只能提供有限保证。

这种差异应影响采购和部署决策。买方应询问智能体在完整工作流中的表现,而不只是它的模型能否识别屏幕或生成看似合理的下一步操作。

真正的问题是导航,而非视觉识别

Claude Opus 4.6 近 60% 的失败被归因于导航,这使有状态的移动成为该基准测试最明显的瓶颈。

LongCat 团队的失败分析将导航错误与物体交互、任务推理等问题区分开来。导航占所分析失败案例的近 60%。

这一数字并不意味着模型只是缺少方向指引。开放世界中的导航结合了空间记忆、视觉识别、动作控制和目标管理。

智能体必须知道自己身在何处、记住已经去过哪里,并判断移动是否产生了预期结果。它还必须决定何时放弃一条路线,或探索替代路径。

静态视觉测试只隔离了这一闭环的一部分。模型看到图像并回答问题;场景不会因其回答而改变,一次错误回答也不会扭曲下一次观察。

Minecraft 会形成反馈。如果智能体转向错误方向,下一张图像便会包含不同证据;如果它被障碍物卡住,重复的移动指令会消耗时间,却无法推进任务。

模型随后需要诊断:是路线失败、动作失败,还是原始计划本身错误。在观察以独立帧而非稳定内部地图的形式到来时,这种区分尤为困难。

MineExplorer 的能力评分强化了这一解读。Claude Opus 4.6 的感知得分为 61.91,推理得分为 54.71。在大多数受评模型中,感知优于行动,行动又优于推理。

这些模型往往能够识别相关细节,却更难将这些细节转化为能够经受环境变化的协调策略。

这构成了多模态进展通常呈现方式的一次重要反转。更好的图像理解扩大了智能体能够注意到的信息范围,但也暴露出处理这些观察的规划系统存在弱点。

能够检测十个相关物体的模型,仍需要决定哪个当下最重要。它必须将这一选择与最终目标相连,并在视角变化后保留这种联系。

该基准测试借鉴了 ReAct 方法,即将推理与行动和新观察交错进行。最初的 ReAct framework旨在让模型通过环境反馈修正其推理。

MineExplorer 展示了这一循环如何会在更长的轨迹中断裂。推理会脱离当前状态,行动不再服务于原始目标,或新的观察未能触发必要的修正。

导航会放大这三类问题。位置错误的智能体会看到错误证据,建立错误的状态估计,并从已经劣化的位置继续选择行动。

这比生成更长的思维链更难。智能体需要对持续存在的实体、位置、已完成的里程碑、失败路线和未解决的依赖关系进行结构化表示。

原始视觉历史并不是理想替代品。它存储的是摄像头看到的内容,而不是智能体应当记住的内容。

同样的区别也适用于企业智能体。每个先前屏幕的记录并不会自动形成可靠的工作流状态。智能体必须知道提交了哪份表单、哪个筛选条件仍然生效,以及哪项要求尚未解决。

对于具身系统而言,导航既是物理测试,也是认知测试。模型必须在空间中移动,同时保持任务的逻辑结构。

因此,MineExplorer 中导航占 60% 的失败比例指向了系统层面的工作。更好的局部控制器、显式地图、因果记忆、进度监控和恢复策略,可能与更强的基础模型同样重要。

该基准测试衡量什么,又没有衡量什么

MineExplorer 提供了有用的压力测试,但其结果仍受限于一个模拟世界以及研究人员定义的任务分布。

最有力的质疑在于外部有效性。Minecraft 提供了规则一致的动态 3D 世界,但它并未复现家庭、工厂、办公室或公共空间中的所有困难。

真实机器人要面对不确定的物理规律、传感器噪声、物理损坏和安全限制。计算机操作智能体则会遇到隐藏的应用状态、身份验证障碍、弹窗和不断变化的界面。

Minecraft 消除了许多此类复杂因素。它的对象是离散的,物理规律可重复,环境也可以被精确重置。

这种可控性也是一种优势。研究人员可以在相同条件下比较模型,并在不危及设备或用户的情况下追踪失败原因。

关键在于,应将 MineExplorer 视为诊断工具,而非具身智能的通用评分。41% 的结果并不意味着 Claude 能完成 41% 的无关现实世界工作流。

该基准测试的知识过滤也需要审视。作者使用语言模型判断,将原子任务分类为主要依赖通用知识,还是依赖 Minecraft 特有惯例。

这一过程减少了明显的游戏知识混杂因素,但无法保证每个保留任务都完全不受熟悉度效应影响。

在 Minecraft 视频、指南或游戏讨论材料上训练过的模型,仍可能识别常见布局和行为模式。不同模型家族接触过这类材料的数量也可能不同。

根据其 arXiv 记录,该基准测试本身仍在持续完善中。未来的修订可能会改变任务、提示词、控制器或评估流程。

控制器设计尤为重要。多模态模型很少仅通过抽象推理来操控游戏,外围智能体系统会将模型输出转换为移动和交互指令。

因此,性能既反映底层模型,也反映其支撑框架。更好的映射系统或低层控制器可能无需改变模型就能提升结果。

基准测试作者还承认另一项限制。MineExplorer 目前聚焦于实证评估,尽管其基础设施同样能够支持训练。

在基准测试环境中训练也会产生自身风险。一旦开发者直接针对公开任务进行优化,排行榜提升可能反映的是基准测试专项化,而非通用探索能力。

完全开源的 MineExplorer code 让复现和扩展变得更容易。它也使得后续模型发布中的污染和过拟合问题更加重要。

独立评估应保留隐藏测试场景,还应改变场景布局、依赖结构、控制器实现和提示词格式。

历史背景也支持这种谨慎态度。MinePlanner 此前发布了 45 个用于长程规划的 Minecraft 任务,发现成熟规划器在包含大量对象的大型环境中表现吃力。

MinePlanner benchmark 聚焦于命题式和数值规划,而不是交互式多模态探索。但其结果仍显示,Minecraft 能暴露出较小规划领域所掩盖的扩展性问题。

其他系统研究了指令遵循、建造、记忆和开放式技能。这些项目用同一款游戏回答不同问题,因此不应直接比较它们的核心分数。

MineExplorer 的具体贡献在于,将连续视觉交互、隐藏前置条件、多跳任务构建和基于规则的里程碑评估结合起来。

其“首次”主张应在这一定义范围内理解。在 MineExplorer 之前,Minecraft 已承载过长程研究。该团队的新颖性主张针对的是其特定评估结构下、分钟级的开放世界多模态探索。

另一项限制是,发布后如此之短的时间内,缺乏广泛的独立反馈。目前大多数详细解读仍来自作者及其关联技术渠道。

测量结果可供审查,但因果解释仍部分属于解读。例如,导航占比较大的失败比例,并未完全区分根本原因究竟是建图、记忆、规划还是动作执行。

这些不确定性并不会抹去核心发现。随着隐藏前置条件不断累积,成功率会急剧下降。它们界定了后续实验必须拆分的问题。

开源让 MineExplorer 不只是一个排行榜

此次发布之所以重要,是因为研究人员可以检验更好的记忆、控制器或训练方法,是否能让长程失败曲线趋于平缓。

该团队使用多智能体工作流来构建基准测试实例。五个专门智能体在控制其顺序的编排器下协作。

工作流从初始任务草案开始。随后,专业智能体和验证智能体会讨论设计、识别不一致之处,并修订场景、依赖图和里程碑评估器。

根据作者的人类评估,这一过程相较单智能体基线,将实例有效性提高了约 30 个百分点。质量评分也提高了约 0.5 分,其中四跳任务的收益最大。

最终发布版本包含 813 个人工验证实例。另有一个高难度子集,提供了 100 个经过筛选、难度更高的场景。

这一生成流程解决了基准测试长期存在的问题。手动构建数百个交互式环境速度缓慢,而不受约束的模型生成任务往往包含无法完成的目标或失效的评估。

将自动化生成与人工验证结合,提供了一条中间路径。这种方法可以产出更多任务,同时保留质量关卡。

同样的方法不仅能生成测试用例,也能生成训练场景。研究人员可以创建依赖图、实例化沙盒场景,并附加确定性的里程碑检查。

这很重要,因为长程智能体需要练习那些会随时间展开的失败情况。静态视觉数据集无法教会它们如何从走错路或遗漏前置条件中恢复。

开放基础设施也鼓励端到端模型扩展之外的替代方案。团队可以固定基础模型,测试显式空间地图、情景记忆、因果图或分层规划器。

另一项实验可以将高层规划与低层移动分开。模型可以选择目标,而由专门控制器处理避障和路线执行。

随后,研究人员便可以询问:导航失败反映的是智能不足、运动控制不足,还是两者之间不稳定的接口。

该基准测试还可能支持课程设计。智能体可以从单跳任务开始,随后在完成率稳定后逐步进入更深的依赖图。

不过,训练集和评估集必须保持区分。复用公开场景会让 MineExplorer 变成记忆测试。

未来最具信息价值的结果,不会是排行榜上的微小提升,而是从单跳到四跳任务时更平缓的下降曲线。

若一个系统提高总体成功率,却保持相同的崩塌曲线,它提升的是局部能力。若一个系统能在依赖关系加深时保持性能,它提升的则是长程协同能力。

这一差异应塑造未来的报告方式。总体任务成功率将多种行为压缩为一个数字,而按跳数划分的性能则揭示了智能体从何处开始无法可靠运作。

开源发布为外部团队提供了检验这些主张的工具,也让它们无需重建完整 Minecraft 技术栈,便能提出更难的评估方案。

Anthropic MineExplorer 结果后值得关注什么

下一阶段应聚焦于独立复现、改进导航系统,以及在未见过的多跳任务上保持稳定性能。

第一个信号是独立复现 41% 的总体分数,以及从 77% 降至 12% 的趋势。研究人员应在有记录的控制器、提示词和环境设置下,重新运行 Claude Opus 4.6 及其他模型。

接近的复现结果将强化这样一种主张:隐藏前置条件会驱动一种普遍的失败模式。显著差异则表明,智能体支撑框架的影响可能大于初始排行榜所显示的程度。

第二个信号是,显式状态和导航系统是否能降低占主导地位的失败类别。有用的实验应比较原始帧历史与地图、结构化记忆、因果任务图和路线恢复策略。

有意义的改进应当在不牺牲推理或行动性能的情况下减少导航失败。仅仅增加上下文窗口,并不能回应该基准测试的核心批评。

第三个信号是,新模型在留出的四跳场景上的表现。开发者应按任务跳数报告成功率,而不只是报告总体平均值。

如果一个模型在单跳任务上得分更高,却在四跳任务上仍接近 12%,那么它尚未弥合长程差距。在未见过的依赖结构上取得更强结果,才能为通用探索能力提供更有力证据。

读者还应关注模型开发者是否会在官方系统卡中采用 MineExplorer 或相关评估。若被纳入其中,便意味着长时间运行的多模态交互正成为标准能力目标。

对于开发者而言,实际教训已经很清楚。不要只通过孤立行动或精美演示来评估智能体。

应测试包含隐藏前置条件、变化状态和恢复机会的完整工作流。衡量智能体在哪一步失去对目标的追踪,并区分感知错误与导航、推理和控制失败。

企业采购方也应要求同样的证据。模型的基准测试排名几乎无法说明,一个集成式智能体能否稳定完成多阶段流程。

MineExplorer 并未终结具身 AI 之争。它提供了一种可复现的方法,让其中一项弱点更难被忽视。

Anthropic MineExplorer 结果尤其具有启发性,因为 Claude Opus 4.6 获得了第一名。随着任务深度从单跳增加至四跳,接受测试的最强模型仍损失了 65 个百分点。

这正是该基准测试带来的核心反转:当前多模态模型往往能够描述一个自己却无法可靠导航的世界。

因此,下一个可信的智能体里程碑,并非又一个完美的截图式回答,而是在陌生环境中持续推进的能力——包括能够察觉走错路,并在任务结束前及时恢复。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page