OpenAI 的 GPT-6 Astra Portal 通关了,但实验设置同样重要
OpenAI 的 GPT-6 Astra 在 Portal 中运行近 24 小时、进行了 3,336 次工具调用后,最终到达了游戏的制作人员名单。报道称,在实际游戏过程中,没有人操控角色。不过,一名爱好者提供了专用接口,使 Astra 每当需要思考时都能暂停游戏。
这一结果比 AI 按照文字攻略行事更具意义。Portal 要求玩家在三维环境中移动、解读视觉信息、保持空间记忆、操控物体并规划多步骤谜题。失误还可能令玩家受困、迷失方向或死亡。
但这并非一次普通的游戏过程。Astra 通过自定义控制器获得截图、位置数据和摄像机角度。只有在模型提交规划好的输入序列后,游戏才会继续推进。
这一差异界定了实验的真正价值。这次运行表明,通用模型可以通过精心设计的工具层控制陌生软件。它并不能证明 Astra 能够独立掌握摆在面前的任何游戏。
相反,这项实验详细预示了智能体式计算机使用,即 AI 系统能够感知软件、选择行动、检查结果,并在无需持续人工指引的情况下继续执行。它也揭示了,这种自主性目前仍需要多少基础设施、时间和验证工作。
GPT-6 Astra 的 Portal 运行到达了制作人员名单
最明确的结果很简单:据报道,Astra 在没有人类接管游戏操作的情况下,从 Portal 的开场测试室一路完成至制作人员名单。
爱好者 CozyBlaze 进行了这项实验,并于 2026 年 9 月 5 日公布结果。报道的运行细节显示,完整会话耗时约 24 小时。
剪辑版展示要短得多,因为其中移除了长时间的推理暂停。CozyBlaze 还发布了一个剪辑版运行视频,供不想观看每一次中断的观众查看。
所运行的游戏是 Valve 于 2007 年推出的原版 Portal。其紧凑的战役模式将玩家置于一系列测试室中,围绕相连的传送门、开关、方块、移动平台和环境危害展开。
Portal 游戏页面将其描述为一款围绕操纵空间、重新思考传统移动方式打造的作品。这些机制使其成为比菜单驱动型游戏更具挑战性的视觉控制任务。
Astra 必须判断自己所在的位置,识别相关物体,并选择能够改变环境的行动。随后,它还需要观察这些行动是否产生了预期结果。
这一循环贯穿整个战役。据 CozyBlaze 称,智能体在获得初始目标后便处理了游戏过程。之后唯一的指令,据称是让它保持制作人员名单继续播放。
运行期间曾因服务容量问题而中断。CozyBlaze 在发生这些错误后恢复了会话,并更改了处理模式。这一干预维持了技术会话,但并未直接解决谜题或移动角色。
区分运维协助与游戏协助很重要。重启失败的连接,与告诉模型该把传送门放在哪里是不同的。不过,两者都会影响研究人员应如何描述这次运行的自主性。
公开证据包括剪辑视频、更长的录像、控制器代码、配置材料以及经过清理的会话日志。这远比一则声称成功的社交媒体帖子更有说服力。
但它仍不足以构成独立评估。外部研究人员尚未在固定条件下复现该会话,审计每一项隐藏依赖,或在完全相同的控制条件下将 Astra 与其他模型进行比较。
CozyBlaze 也警告,不应将这次通关视为正式基准。Portal 并非由中立测试机构选定、配置和评分。
这种谨慎反而增强了报道的可信度。基准测试需要可重复的规则、受控变量、有记录的失败标准和多次试验。这项实验提供的则是一个引人注目的案例研究。
令人印象深刻的事实不只是 AI 完成了一款知名游戏,而是一个语言模型在异常漫长的任务中维持了感知、规划、行动和纠正的循环。
这也构成了核心张力。Astra 的持久性令人印象深刻,但专用环境完成了模型自身无法独立完成的重要工作。
Astra 如何通过 MCP 控制 Portal
Astra 并不像人类一样操作键盘;它通过一座专门构建的桥梁控制 Portal,将计划转换为定时的游戏输入。
CozyBlaze 在一个公开仓库中发布了该设置。其中包括控制器、游戏配置、SourcePauseTool 修改内容、技术文档以及经清理的会话证据。
控制器通过 MCP,即 Model Context Protocol,将 Astra 连接至 Portal。MCP 是一种标准接口,使 AI 模型能够调用外部工具并与其交换结构化信息。
在这一设置中,本地 MCP 服务器与经过修改的 SourcePauseTool 版本通信。该工具可以让 Portal 按选定数量的模拟 tick 推进,然后再次暂停。
游戏暂停时,Astra 会收到一张截图。它还会获得玩家的位置和摄像机朝向,从而减少对三维场景的不确定性。
随后,模型生成包含下一段输入序列的 JavaScript 计划。SourcePauseTool 恢复游戏、执行该序列,并在请求的时间间隔结束时再次暂停。
新的观察结果会返回给模型。Astra 可以将新状态与预期结果进行比较,修改计划,并发出另一条命令。
这实际上是一个慢动作控制循环。由于模拟会在推理期间等待,模型无需以正常游戏速度持续作出反应。
这一暂停机制是理解该成就的关键。Portal 包含精确跳跃、移动平台、定时门,以及输入延迟可能导致失败的场景。
人类玩家通过持续感知和即时运动控制来应对这些情形。Astra 则将感知、审议和执行拆分为不同阶段。
因此,这一设置测试的更多是模型在视觉与空间不确定性下的规划能力,而非反应速度。它让模型有足够时间在执行另一段行动序列前分析每个状态。
这并不意味着测试变得简单。暂停的画面仍可能存在歧义,尤其当单张图像隐藏了深度、障碍物,或镜头后的目的地时。
位置和摄像机数据有助于模型保持方向感,但不会直接指出正确的谜题解法。Astra 仍需将视觉观察与游戏机制联系起来。
工具层还要求模型将抽象意图转化为可执行控制。“到达平台”不是一段输入序列。智能体必须选择移动、瞄准和放置传送门的动作。
长序列又带来了另一项挑战。一项从截图看似合理的计划,可能因碰撞几何、动量、时机或错误的深度估计而失败。
Astra 可以通过检查下一状态来恢复。这一纠正过程比一次提示生成精致答案更接近真实的智能体式工作。
许多实际软件任务遵循相同结构。智能体打开应用程序、执行操作、检查结果,并在界面出现意外响应时进行调整。
Portal 将这些失败直观地展现出来。一次错误操作可能让角色落在错误的平台上,或将其送入危险区域。在商业软件中,对应的错误可能更为隐蔽。
实验也受益于 Portal 稳定的环境。按钮仍停留在设计者放置的位置,物理规则保持一致,界面也不会突然弹出登录提示。
真实的桌面工作包含弹窗、访问限制、不断变化的数据、模糊的指令和不可逆操作。这些条件会对智能体的判断能力施加更大压力。
不过,这一机制的意义超出了游戏领域。它表明,模型可以在数千次交互中与确定性的本地控制器协同,而不放弃原始目标。
OpenAI 的 Astra 发布材料强调计算机使用、浏览、软件工程和专业工作流。Portal 运行提供了一个外部实例,它与这些主张相似,但并非对官方演示的简单复刻。
最重要的启示在于架构。实用的自主性并非仅来自模型本身,而是源于模型、观察格式、工具定义、执行环境、暂停策略和恢复流程的协同运作。
为什么这次运行给计算机使用基准带来压力
一场漫长而复杂的游戏会话揭示了短基准任务可能遗漏的能力,同时也暴露出基准测试本应控制的变量。
计算机使用评估通常将软件工作拆分为可明确评分的任务。智能体可能需要更改设置、查找信息、编辑文档,或在桌面应用程序中完成一个步骤序列。
这些评估提供了比较基础。研究人员可以在相似条件下测试多个模型,并计算每个模型实现既定目标的频率。
Portal 提供了另一种压力测试。最终目标很容易识别,但达成目标需要在持续存在的环境中作出大量局部决策。
智能体必须在成功、失误、加载转换、重复出现的视觉模式和工具响应之间保持上下文。一处错误并不一定会终止测试。
这种持续性很重要,因为实际自动化很少由一个完美动作构成。真实工作往往涉及部分进展、令人困惑的反馈、重试和调整。
OpenAI 的 官方模型文档将 Astra 描述为适用于复杂推理、编码、计算机使用、研究和文档创建的模型。它还支持图像输入、工具调用、MCP 和托管执行工具。
Portal 实验结合了其中多项能力。视觉有助于理解游戏,推理支持规划,MCP 提供控制接口,重复的工具调用则将计划连接到外部环境。
不过,这次运行也表明,仅有完成结果并不足够。研究人员需要衡量多少支撑条件促成了这一完成,以及智能体使用这些条件的效率。
该会话需要 3,336 次工具调用。这一数字体现了持久性,但也表明模型多么频繁地需要进行新的观察或行动循环。
较低的调用次数并不必然意味着更优秀的智能体。更长的行动可能造成更大的错误,而频繁观察则可能使控制更安全、更精确。
相关的衡量指标是在可比条件下的任务效率。这包括经过时间、模型延迟、工具延迟、失败操作、重启次数、观察质量和干预规则。
该运行报告的 API 成本估算之所以引发关注,是因为完成一款游戏的费用显得很高。CozyBlaze 随后澄清,该会话是在现有 Codex 订阅额度内运行的。
这两种说法描述的是不同的经济视角。按目录价格估算,代表的是模型活动的计量价值。用户实际新增支付的费用,在订阅访问模式下可能有所不同。
这两个数字都无法回答商业层面的问题。服务提供商可以补贴实验性工作负载、施加使用限制,或随着需求增长调整包含的容量。
对企业而言,重要的并不只是 token 数量,而是以可接受的速度、准确性和监督成本完成一项有用任务的总成本。
Portal 的结果很清晰:积分要么出现,要么不出现。办公自动化则会带来更棘手的问题,因为一份已完成的表单仍可能包含错误数据。
这款游戏也允许重试。重复一次跳跃或重新放置一个传送门,通常造成的影响有限。重复执行一次薪资操作或客户记录更新,却可能产生重复交易。
这意味着,该运行从两个方向给基准测试设计者带来压力。他们既需要能揭示持续自主能力的更长任务,也需要更严格的控制机制来暴露隐性协助。
一项有价值的后续评测,应让多个模型通过同一个控制器完成任务。评测应固定观察格式、游戏版本、推理预算、暂停策略和恢复流程。
研究人员还需要进行多次试验。一次成功完成无法反映典型表现、方差,或一个新会话达到相同结果的概率。
恰当的比较应纳入失败状态,而不只是成功录制。它应记录放弃的尝试、容量中断、人工重置以及任何经过修改的提示词。
因此,GPT-6 Astra 的 Portal 运行最好被视为对现有评测设计的一次挑战。它表明,长时程交互任务已变得足够可行,值得认真测试。
Portal 实验并未证明什么
这次完成并不能证明通用智能、独立发现谜题解法、达到人类水平的游戏操控能力,或在高风险软件中可靠的自主性。
Portal 是一款知名游戏,拥有大量公开文档。多年来,攻略、视频、地图、讨论和速通资料一直存在于网上。
大型模型可能在训练期间接触过有关 Portal 的描述。外部观察者无法确定其中包含了哪些细节、这些细节对运行产生了多大影响,或 Astra 是否回忆起了具体解法。
这种不确定性很重要,因为解谜可能涉及两种不同能力:一种是从观察中推导解法,另一种是识别熟悉情境并提取可能的答案。
会话证据可以展现部分行为,但无法检视模型的完整训练历史。一次成功的操作序列,可能结合了空间推理、已学得的游戏知识和基于试错的修正。
Portal 还遵循一个大体固定的战役流程。关卡有已知布局和预设解法。这不同于每次尝试都会呈现新颖几何结构的程序化生成环境。
更强的新颖性测试,应当包含在 Astra 训练截止日期之后创建的未见关卡。这些关卡应使用熟悉的机制,同时将其设计隐藏于公开来源之外。
研究人员随后可以比较模型在原始战役和私有关卡中的表现。若两者差距很大,将表明先前接触可能发挥了重要作用。
该实验也没有展示正常速度下的游玩。Astra 推理时游戏始终暂停,移除了人类玩家所面对的大部分持续时序压力。
这种设计适合测试高层控制能力,但不应与竞技游戏、机器人技术或实时物理系统所需的感觉运动技能混为一谈。
提供的位置和摄像机角度数据带来了另一项优势。人类从连续视觉体验中推断这些属性,而 Astra 则以结构化状态直接获得它们。
移除这些信息会让任务更困难,但也会测试一个不同的问题。当前实验关注的是通过工具进行规划,而非纯粹仅依赖视觉的控制。
界面本身也限制了动作空间。Astra 无需摸索如何安装 Portal、配置图形设置、映射按键、启动游戏,或恢复操作系统。
这些被省略的步骤在通用计算机使用中很重要。部署在真实机器上的智能体,必须跨越应用边界,并处理与其主要任务无关的环境故障。
容量中断也是另一项限制。服务错误发生时,CozyBlaze 恢复了运行,并调整了处理模式。
这种协助并没有解决 Portal 的关卡。然而,它表明长时间运行的智能体仍依赖外部运维支持。
一个能够完成其逻辑目标、却无法经受常规服务中断的自主系统,在系统层面并不算完全自主。
模型自主性与系统自主性之间的区别至关重要。Astra 控制了游戏过程,而更广泛的整体设置依赖于人类构建的工具、服务访问以及人工连续性管理。
这里还存在选择效应。成功实验会被广泛传播,而失败尝试往往不会公开,或受到较少关注。
如果没有此前试验的完整记录,读者无法计算成功率。他们看到的是一条完成的轨迹,而不是全部结果的分布。
经过脱敏的日志也带来另一种权衡。移除私人信息能让公开发布更安全,但可能限制对每一条提示词和环境细节的独立审查。
这些限制都不会抹去结果。它们界定了这一结果能够支持什么结论。
最有力且站得住脚的说法是,Astra 在 CozyBlaze 记录在案的智能体框架内完成了 Portal。现有证据支持其在这一预备环境中实现了持续的自主游戏操作。
最弱的解读认为,这次运行只是一次脚本化重放。公开材料则描述了反复的观察、规划、执行和修正。
最强的解读则认为,这次运行证明了广泛的智能自主性。未控制变量、可能的训练暴露、专用状态数据和缺乏复现,都不支持这一结论。
谨慎的解读介于这两个极端之间。Astra 似乎具备长时程交互控制能力,但框架和任务设计仍与这一成就密不可分。
真正的竞争是模型智能与系统设计之间的竞争
这项实验将注意力从孤立的模型分数转向工程系统:正是这些系统让智能体能够在数千次操作中保持可靠。
AI 演示常常促使观众将每一次成功都归因于模型。这种表述忽略了工具对模型感知与行动能力的深刻塑造。
CozyBlaze 的控制器将 Portal 转化为一连串可管理的决策。它冻结环境、暴露选定的状态数据、接收结构化计划,并返回新的证据。
每一项选择都降低了不确定性。更好的观察帮助 Astra 保持方向感。受控执行则避免了推理延迟直接演变为错失时机。
这并非不公平的技巧。工具设计是构建实用智能体的核心部分。
人类同样依赖能暴露状态并防止代价高昂错误的界面。自动保存、撤销命令、验证规则、交易预览和访问控制都会提升表现。
重要的问题在于,智能究竟存在于何处。在这次 Portal 运行中,能力分布在 Astra、MCP server、SourcePauseTool、Portal 稳定的模拟环境以及 CozyBlaze 的配置之间。
这种分布与企业自动化相似。模型可能规划一项客户支持工作流,而 API 负责执行权限,应用规则决定哪些操作有效。
可靠的智能体需要的不只是推理能力。它还需要具有明确边界的工具契约、可观察的结果、安全的重试、超时机制和清晰的失败信息。
Portal 控制器提供了其中若干属性。它将开放式的物理移动转换为有边界的动作序列,并在每个序列后创建清晰的检查点。
知识工作者应当注意这种检查点模式。当智能体记录其尝试内容、发生的变化以及下一步计划时,长任务会更容易获得信任。
同样的原则适用于研究、编程、文档准备和项目协调。最终答案会掩盖过程轨迹,而检查点能揭示进展和错误。
这正是可搜索的知识库变得相关的地方。当智能体跨越文档、工具和较长时间线工作时,团队需要持久化的证据。
Portal 会话还表明,界面设计可以将缓慢的推理转化为可用行动。暂停游戏给予 Astra 实时控制器无法获得的时间。
商业软件可以提供类似便利。应用程序可以等待确认、提供结构化字段,或公开 API,而不是强迫用户通过像素级导航操作。
智能体将在为机器参与而设计的环境中表现得更好。这并不意味着要用 API 取代每一个界面,但它有利于可观察且可逆的工作流。
另一条路径是让模型在任意屏幕上模仿人类鼠标和键盘行为。这种方法提供了广泛兼容性,却继承了模糊性和脆弱的视觉控制。
结构化工具牺牲部分通用性以换取可靠性。基于像素的计算机使用则牺牲部分可靠性以换取覆盖范围。
Portal 实验结合了两条路径。Astra 使用视觉截图进行解释,同时接收结构化位置数据,并通过专用工具发出命令。
这种混合架构可能比游戏新闻标题更重要。它展示了开发者如何将广泛的模型判断与确定性执行结合起来。
OpenAI 面临着将此类能力转化为可重复产品性能的压力。一次引人注目的演示会带来预期:日常智能体应能在不丢失上下文的情况下完成长任务。
竞争模型提供商同样面临这种压力。比较将越来越依赖于框架质量、工具集成、延迟和恢复行为,而非单纯的推理分数。
应用开发者也获得了更大的发挥空间。设计良好的工具层,无需重新训练底层模型,就能提升智能体表现。
这使智能体工程本身成为一个竞争领域。团队必须决定哪些内容应由模型推断、哪些应由软件提供,以及哪些操作需要人工批准。
Portal 提供了宽容的答案,因为失败是可见且可逆的。在授予类似自主性之前,企业部署需要更严格的边界。
三个信号将表明这一结果能否泛化
下一批有意义的证据必须来自复现、新颖环境,以及任务效率的可测量提升。
第一个信号是独立复现。另一位研究人员应使用已发布的控制器,让 Astra 完成相同战役,并公开完整的成功和失败数据。
复现将增强人们对该结果并非罕见轨迹的信心。它也会揭示,细微的配置差异是否会实质性改变表现。
比较应包括重复试验,而不是一次展示。研究人员需要完成率、中位用时、干预次数和常见失败类别。
第二个信号是在私有或新创建关卡上的表现。未公开的房间将降低模型从训练数据中回忆解法的可能性。
这些测试应保留 Portal 的基本机制,同时改变布局和谜题顺序。成功将为真正的空间规划与迁移能力提供更有力的证据。
失败并不会否定最初的通关结果。它只会将解读范围收窄到识别、既有知识或特定任务熟悉度。
第三个信号是跨长时程计算机任务的效率。未来系统应减少不必要的操作,在服务中断后自动恢复,并提供更清晰的审计轨迹。
效率并不意味着不计代价地最小化工具调用。它意味着选择足够的观察以维持可靠性,而不是将大部分过程花在纠正本可避免的错误上。
开发者还应关注 OpenAI 是否会发布标准化的长时程评估。官方基准目前提供了有价值的比较,但独立的交互式测试可能暴露不同的弱点。
Astra 完成 Portal 值得关注,因为它在一次可见实验中结合了感知、规划、工具使用和持久性。很少有常规基准分数能如此清晰地传达这种组合能力。
它同样值得谨慎看待。该模型在经过精心准备的环境中运行,获得了结构化状态信息,在推理时暂停了时间,并且只完成了一次有文档记录的战役。
最恰当的结论既不是这次运行只是障眼法,也不是通用机器智能已经到来。而是,长时程视觉智能体如今值得接受更严苛的测试。
对开发者而言,实际问题迫在眉睫:同一架构能否以可重复的结果和可控风险完成有价值的工作?不妨先审视一个已经具备明确输入、可逆操作和客观完成测试的工作流。
对 AI 用户而言,应关注证据,而非剪辑后的高光片段。请观察未来 GPT-6 Astra 的计算机使用实验是否会公布完整轨迹、失败运行记录、人工干预规则和可比较的基线。
如果这些衡量指标能够同步提升,GPT-6 Astra 的 Portal 通关将会成为早期系统能力的里程碑。否则,它仍将是一场围绕异常有利支撑条件打造的令人印象深刻的演示。



