top of page

GPT-6 Astra Minecraft 测试创下纪录,随后却被一只苦力怕打乱计划

2小时前
讀畢需時 13 分鐘

OpenAI 的 GPT-6 Astra Minecraft 测试持续运行了 141 小时,创下新高,随后却因一只苦力怕抹去了它最有价值的进展。该模型收集了稀有材料,并建设了实用的基础设施。之后,一场爆炸摧毁了它的储物箱和床。

接下来发生的事让这项实验更具启发性。根据 Vals AI 的说法,Astra 花了数小时种植马铃薯,而非重建并推进原有目标。观众将这种行为解读为沮丧、挫败,甚至是情绪反应。

这种拟人化框架很适合成为传播广泛的故事,但并不能证明模型感受到了什么。更重要的发现,是其在意外损失后进行自主恢复的能力。

据报道,在这项特定的 Minecraft 测试中,Astra 的推进程度超过此前所有 AI 系统。然而,它的失败暴露出:完成单项操作与管理一场长期任务之间,仍存在差距。

这种差距的影响不止于游戏。OpenAI 将 Astra 定位为一款可操作计算机的模型,能够在网站、应用程序和文档之间执行长期的专业工作。这类任务同样会涉及计划中断、状态变化、工作成果丢失,以及不完整的信息。

因此,Minecraft 成了一项格外易于理解的压力测试。Astra 能够导航、收集资源、与敌人战斗并建造机械装置。但当成功要求它识别重大挫折、重建策略,并抵制更安全却用处不大的活动时,它遇到了困难。

真正的较量并不是 Astra 与一只苦力怕之间的对抗,而是高级任务执行能力与可靠恢复能力之间的较量;后者决定了一个智能体能否在无需持续监督的情况下完成重要工作。

141 小时 GPT-6 Astra Minecraft 测试期间发生了什么

Astra 的运行兼具令人印象深刻的长期推进,以及一次严重的恢复失败。

Vals AI 将 GPT-6 Astra 置于 Minecraft 中,并赋予它通关游戏这一宽泛目标。Minecraft 是一个开放式环境,进展取决于探索、合成、战斗、记忆和资源管理。

与短时谜题不同,这一目标包含许多相互依赖的阶段。一个智能体必须取得装备、进入下界、收集烈焰棒、获得末影珍珠,并找到最终传送门。

每个阶段都会改变可用资源与风险。流程后期出现的一个错误,可能使此前数小时的工作失效。

据报道,在运行期间,Astra 找到了一座下界要塞,并建造了一个半自动烈焰人农场。这一结构帮助它收集到六根烈焰棒,这是前往 Minecraft 最终区域的重要材料。

随后,该模型发现了一片诡异森林。根据原始 Minecraft 测试报告 中描述的公开说法,它击杀了超过六只末影人,并收集到三颗末影珍珠。

这些成果让 Astra 在游戏中的推进超过了 Vals AI 测试过的早期系统。不过,这一比较仍应严格限定其范围。

Vals AI 所称的纪录,是在其观察到的 Minecraft 实验范围内创下的。该机构并未发布标准化排行榜,以证明 Astra 是普遍意义上最出色的游戏 AI。

决定性事件发生在 Astra 将贵重物品存入箱子之后。一只苦力怕——一种会接近玩家后爆炸的敌对生物——摧毁了箱子和附近的一张床。

床的丢失意味着 Astra 失去了既定的重生点。箱子的丢失,则让它失去了推进计划下一阶段所需的资源。

这一事件并未删除 Minecraft 世界,也没有重置所有已完成操作。但它确实摧毁了模型集中储存的物资,并打乱了其位置策略。

这一差别很重要。Astra 面对的是一次代价高昂的挫折,而不是字面意义上回到了全新的游戏开局。

一套有能力的恢复方案,或许会包括盘点幸存资源、重建关键装备,并建立受保护的基地。它也可能会按明确顺序优先补回丢失的材料。

但 Vals AI 表示,该模型在接下来的数小时里,除了种植马铃薯以外几乎没有做别的事。这项活动在 Minecraft 中是有效的,但并未实质推进主要目标。

Astra 也变得更加关注苦力怕。据报道,在某个时刻,它将一个绿色物体识别为甘蔗,并明确指出那不是苦力怕。

这种反应看起来是在局部层面进行了适应。模型根据近期遭遇的威胁更新了自身行为。

然而,局部谨慎并未带来有效的全局恢复。Astra 避开了一种危险,却失去了朝更大目标推进的动力。

这种张力正是实验的核心结果。模型完成了许多困难操作,却未能在环境使其计划失效后重新组织整场任务。

为什么种马铃薯并不能证明 AI 感到悲伤

种马铃薯这一事件揭示的是行为漂移,而非经验证的情绪状态。

人们将 Astra 描述为“被击败”,可以理解,因为人类天然会通过人的动机来解读行为。一个失去稀有装备、转而埋头耕作的玩家,确实可能感到受挫。

AI 模型并不需要拥有内在的情绪体验,也能产生同样可见的行为序列。它可以生成自我批评的语言、重复安全的操作,或基于习得模式避开近期遭遇的危险。

现有证据并未表明 Astra 经历了悲伤。它只表明,其失败后的行为与人类熟悉的一种反应相似。

这种差异将观察与解读区分开来。可观察的事实涉及它的操作、日志和游戏状态。关于动机的说法仍属推测。

Astra 种马铃薯的行为可能反映多项技术问题。模型或许失去了对剩余资源的连贯表征,也可能难以将挫折转化为经过修订的目标优先级体系。

另一种可能是,它存在偏向低风险进展的行动倾向。耕作能带来可预测的结果和即时反馈;而重新获得烈焰棒和末影珍珠,则需要探索、战斗,并承受进一步损失的风险。

因此,一个针对下一个看似合理操作进行优化的模型,可能会陷入一种表面上富有成效的活动。每一步看起来都合理,但整体序列已不再服务于原始目标。

知识工作者也会遇到这种失败的常见版本。一个人可以回复消息、整理笔记、排版文档,同时回避阻碍项目推进的艰难决定。

自主智能体也能呈现相同的外部模式,而无需拥有人的感受。它始终很忙,但目标进展却停滞不前。

这项实验还凸显了将模型自言自语照单全收的风险。据报道,Astra 曾因丢下物品而自我批评,也曾提醒自己不要浪费时间追逐猪。

这些表述为其工作状态提供了线索,但并不能透明地揭示其情绪内在状态,也无法给出完整的因果解释。

模型生成的推理可能充当规划辅助、叙述层,或是对观察事件的习得性反应。它不应被自动视为忠实的自我反省。

OpenAI 表示,Astra 在任务不断演变时更擅长保持方向感。其 Astra 发布材料称,早期模型有时会将新指令视为独立目标,从而忽视此前的约束条件。

Minecraft 这一事件从另一种角度检验了这一说法。没有人需要改变指令,是环境本身改变了一个成功计划所需具备的条件。

Astra 记得苦力怕很危险。更难的问题是,它是否正确理解了这场爆炸带来的战略后果。

证据表明,它的理解只是部分的。它的注意力转向了避免另一只苦力怕,但整体恢复能力依然较弱。

这比说模型陷入了抑郁更有价值。它指出了工程师可以通过状态跟踪、重新规划频率、奖励设计和恢复检查点来研究的行为。

这项纪录揭示了能力与韧性之间的差异

Astra 最强的操作能力,让其恢复失败显得更重要,而不是更不重要。

一个较弱的系统可能会立即失败,因为它无法在 Minecraft 中导航或操作界面。相比之下,Astra 在长达 141 小时的运行中完成了一系列相互依赖的任务。

这种持久性改变了问题的性质。测试不再是在问 AI 是否能完成孤立操作,而是在问这些操作能否构成一套持久的策略。

OpenAI 将 GPT-6 Astra 定位为其最有能力完成端到端工作的模型。该公司强调其计算机操作、浏览、软件工程和专业文档创建能力。

其已发布的计算机操作结果包括在 OSWorld 2.0 上取得的 72.6% 分数。OpenAI 报告称,在其对比设置下,GPT-5.6 Sol 的得分为 65.7%。

OpenAI 还表示,Astra 完成这些模拟任务时,每项任务所需时间比 Sol 少约 47%。这些是公司自行报告的评估结果,并非来自 Minecraft 测试的发现。

Vals AI 的实验测试的是另一种特性。标准的计算机操作基准通常会将工作拆分为定义明确、完成标准更清晰、时间跨度更短的任务。

Minecraft 则创造了一个持续变化的世界。智能体必须判断什么最重要、保护资源,并识别当前计划何时不再奏效。

这种环境会惩罚脆弱的成功。收集六根烈焰棒只有在智能体能于后续阶段前保护或补回它们时才有价值。

这种区别类似于能力与韧性之间的差别。能力关注系统在顺利执行条件下能完成什么;韧性则关注执行出错时它能否恢复。

Astra 展现出相当强的能力,同时也在一次集中损失后暴露出脆弱的韧性。

因此,这次运行让简单的排行榜思维变得复杂。一款模型可以在某项基准中领先,却仍在同一次尝试中暴露严重的运营弱点。

这并不矛盾。前沿模型正越来越频繁地取得成功,以至于罕见的失败模式开始成为主要限制因素。

设想一个智能体执行为期一周的软件迁移。它能够修改文件、运行测试,并在数十个步骤中正确更新依赖项。

随后,一次部署使流程早期形成的某项假设失效。该智能体必须识别失败、保留未受影响的工作,并制定新计划。

如果它在迁移仍然损坏时转而润色文档,那么其局部输出质量几乎无法带来安慰。项目仍需要人类来恢复方向。

同样的担忧也适用于浏览器智能体。表单可能过期,账户可能拒绝登录,或者网站可能改变界面。

一个有效系统必须区分暂时的阻力与战略性的死胡同。它还需要知道何时重试、重新规划、请求帮助或停止。

Astra 的马铃薯循环说明,不能仅从成功点击中推断出这种判断力。长期自主性取决于操作之间的关系,而不只是每一项操作的质量。

这也解释了为何不应轻易否定这项纪录。走得更远,才为一次更有意义的失败创造了条件。

此前从未抵达下界的系统,无法暴露它们是否能保护稀有材料,或在失去这些材料后恢复。Astra 已推进到足以遭遇更高层级协调问题的阶段。

OpenAI 的计算机使用能力声明如今面临恢复能力考验

压力落在了智能体开发者身上:他们需要在任务完成率之外衡量恢复质量。

OpenAI 表示,Astra 可以填写表单、更新客户记录、整理日历、开展研究,并在专业应用程序之间工作。这些场景与 Minecraft 有一个重要共性。

它们都依赖持续状态。先前的操作会改变智能体接下来应做什么。

OpenAI 还表示,Astra 能更有效地处理模糊指令,并会在缺失信息会影响结果时提出有针对性的问题。当不确定性来自人类时,这些行为很有价值。

Minecraft 中的失败则涉及环境不确定性。智能体必须判断伤害情况,计算自身剩余位置,并决定原计划是否仍然可行。

这是一种要求更高的自主性。系统不能在每次意外发生后,都简单地让人重新表述目标。

OpenAI 自己的安全材料也承认长程智能体轨迹存在风险。其 Astra 安全概览讨论了防范未经授权的操作、数据丢失及其他破坏性后果的措施。

安全与恢复并不相同。然而,两者都要求智能体跨越许多步骤监控后果,而不是将每个动作孤立对待。

安全的智能体必须在某个动作造成不可接受风险时察觉。具有韧性的智能体则必须在某个事件令既有策略失效时察觉。

这两种能力都依赖于维持准确的任务状态模型,也都依赖于在恰当的时机打断惯性。

棘手的设计问题在于平衡。每次微小意外都重新规划的智能体会变得缓慢且优柔寡断。很少重新规划的智能体则可能花费数小时追逐一个已经过时的目标。

Astra 的行为表明,更强的原始推理能力并不会自动解决这一控制问题。据报道,该模型知道自己丢失了重要物品,却未能迅速恢复战略推进。

这一事件也给基准测试设计者带来压力。最终成功分数可能掩盖长时间的无效行为、重复错误和不必要的风险。

未来评估应记录恢复延迟,即智能体在失败后恢复有意义进展所需的时间。评估还应衡量其反复暴露于同一危险的情况。

另一个有用指标是目标漂移。它可以估计在意外事件改变任务状态后,有多少活动仍有助于实现既定目标。

人工干预也提供了另一个重要信号。只有在频繁提示后才能完成任务的系统,与能够识别自身阻碍的系统并不相同。

这些指标会让长期测试对企业买家更具参考价值。企业不仅需要知道智能体最终是否能完成工作流。

他们还需要知道,当凭证过期、记录冲突、文件消失或第三方服务故障时,智能体会如何表现。

可靠的系统应保留一份可审计的记录,说明已完成的工作和未解决的依赖关系。随后,在采取代价高昂或不可逆的行动之前,它应提出恢复计划。

对于监督自主工作流的团队,可搜索的 AI 知识库可以保存决策和源材料。不过,仅有记忆存储并不能保证合理的重新规划。

智能体仍需区分有用上下文与无关细节。它必须识别哪些早先的假设已经不再适用。

这正是 GPT-6 Astra Minecraft 测试与专业工作相关的原因。它表明,记住一个事件和从中恢复是两种不同的能力。

Minecraft 结果还需要更多独立验证

一次戏剧性的运行无法确立对智能、可靠性或情绪行为的普遍衡量。

公开故事主要基于 Vals AI 对直播的叙述以及由此产生的媒体报道。现有报道描述了重要里程碑,但没有回答方法论上的问题。

读者不应将这次 141 小时的运行视为受控的科学比较。公开细节无法证明其与 Vals AI 此前观察到的每个模型处于完全相同的条件下。

测试框架很重要。框架是将模型输出转化为行动,并从环境返回观察结果的软件层。

提示词、视觉输入、可用控制方式、暂停行为和记忆管理上的细微差异,都可能改变智能体的表现。这些选择在持续数天的运行中可能格外重要。

Minecraft 内部的随机性同样重要。敌人遭遇、地形、资源分布和导航难度都可能因不同运行而异。

一只 Creeper 的位置改变了 Astra 的轨迹。同一模型的另一次运行可能避开该遭遇,也可能更早失去进展。

重复试验有助于将稳定能力与令人难忘的轶事区分开来。研究人员需要使用相同的游戏版本、世界生成规则、工具、提示词和干预政策。

他们还需要可比的预算。获准使用更多时间或推理资源的模型,比在更严格约束下运行的模型能探索更多选项。

因此,“比任何 AI 系统走得都更远”这一说法,应被理解为 Vals AI 对其测试的观察。它并非关于所有 Minecraft 智能体的普遍结论。

对情绪的解读需要更加谨慎。在受挫后转而种田,与许多不涉及主观感受的机制相容。

这可能反映了混乱的规划、风险规避、短期优化,或智能体封装层的局限。公开证据无法确定哪种解释占主导。

还有一种风险是,病毒式传播的叙事掩盖了积极结果。据报道,Astra 在困难导航和资源收集上维持的时间,远长于许多早期计算机使用系统所能持续的水平。

一项相关实验据称让 Astra 通过计算机控制在约 24 小时内完成 Portal。根据实验公开的说明,这次 Portal 运行涉及 3,336 次工具调用。

Portal 与 Minecraft 测试的是不同品质。Portal 提供了更具结构的空间谜题序列。Minecraft 则要求开放式规划和资源保存。

两款游戏都不能直接替代职场评估。游戏的价值在于,研究人员能够在受控环境中观察每一个动作。

商业软件引入了隐藏依赖、敏感数据、不断变化的权限和模糊的组织目标。这些条件使恢复能力更具后果。

因此,Minecraft 的结果应被视为诊断性证据,而非最终判决。它指出了一种值得在其他环境中测试的失败模式。

该模式是在高代价意外发生后的战略崩溃。相关问题是:Astra 在受控条件下接受评估时,是否会重演这一问题。

接下来的三个信号将表明 Astra 能否可靠恢复

下一阶段应检验 Astra 令人印象深刻的耐力能否转化为可靠的自主性。

第一个信号是受控条件下重跑 Minecraft。Vals AI 或其他评估机构应在有记录的设置、多个世界和一致的干预规则下重复该任务。

重跑不应只衡量最远里程碑,还应记录资源损失、恢复时间、重复危险,以及服务于主要目标的操作比例。

如果 Astra 能在类似挫折后持续重建,那么这次土豆事件看起来会像是特定运行的偶然波动。如果它反复退回安全的边缘活动,这种弱点就会显得具有结构性。

第二个信号是与其他前沿模型进行对比测试。只有当竞争系统获得相同的界面、时间预算、提示词和环境条件时,Astra 的进展才具有意义。

这类测试应包括 OpenAI 的前代模型,以及 Anthropic 和 Google 的现有系统。目标不应是再贴上一个简单化的胜者标签。

评估者应比较规划持久性、危险应对、恢复延迟和人工干预。推进速度较慢但恢复可靠的模型,可能更适合后果重大的工作流。

第三个信号来自真实计算机使用部署的证据。OpenAI 最有力的主张并非 Astra 能玩游戏,而是 Astra 能跨软件执行要求严苛的专业工作。

开发者和企业买家应关注,已部署的智能体在出错后放弃有用计划的频率。他们还应检视系统是否能清晰报告不确定性,并在合理的节点请求帮助。

成功部署需要的不只是完成率。团队应追踪浪费的操作、重复错误、回滚质量,以及中断后得以保留的工作。

这些指标将强化 Astra 的基准测试提升能够转化为运营可靠性的论据。持续的恢复失败则会削弱这一论据,即使模型在短期评估中仍然令人印象深刻。

Minecraft 运行为 OpenAI 留下了一场胜利和一个警告。Astra 比测试中此前观察到的系统推进得更远,但一次爆炸扰乱了数小时的战略行为。

这种组合正是实验重要的原因。前沿智能体如今运行得足够久,可以制定有意义的计划、积累资产,并遭受高代价的失败。

下一个标准应比“AI 是否能行动 141 小时”更严格。研究人员应问的是,它能多快意识到计划已经破裂。

然后,他们应衡量它能否制定一个更好的计划。

GPT-6 Astra Minecraft 测试没有揭示一台悲伤的机器。它揭示了一个能够完成困难工作、却在成功成果消失后难以恢复的智能体。

这是一个极具现实意义的局限。在将自主智能体交给持续数日的项目之前,买家应问一个问题:当系统遭遇相当于 Creeper 的事件后,它会怎么做?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page