top of page

GPT Astra 通过了 48 个 CAPTCHA 谜题,但这场病毒式传播的胜利仍需放在语境中看待

9月8日
讀畢需時 13 分鐘

据报道,GPT Astra 在一款“我不是机器人”谜题游戏中完成了全部 48 个关卡,且没有出现明显失误。这种讽刺感让这场演示迅速具备了传播性:一台机器似乎通过了一系列原本旨在排除机器的测试。

OpenAI 工程师 Sharif Shameem 于 2026 年 9 月 7 日发布了这段录屏,距离 OpenAI 推出 GPT-6 Astra 仅过去四天。他的原帖称 Astra 通关了所有关卡。公开录屏支持这一说法,但整个过程没有独立评估人员监督。

这种区别很重要。Neal Agarwal 的游戏并不是由 Google 或 Cloudflare 运营的生产级 CAPTCHA 服务,而是一个浏览器谜题合集,将常见的验证模式转化为愈发奇特的交互挑战。

不过,若将这次通关简单视作一个噱头,也会错失其价值。这场演示将多项困难的计算机操作能力压缩进了一个可见的连续过程。Astra 必须理解不断变化的屏幕、推断陌生规则、操作控件、识别结果,并在彼此无关的任务之间持续推进。

因此,真正的较量并非 AI 与 CAPTCHA 安全机制之间的对抗,而是通用视觉智能体与此前脆弱的浏览器自动化方案之间的竞争。这场竞争会影响每一家希望通过软件界面实现工作自动化的公司。

GPT Astra 实际完成了什么

经验证的事件是一段录制的游戏通关过程,并不能证明 GPT Astra 击败了在线运行的商业 CAPTCHA 系统。

Shameem 于 9 月 7 日发布的帖子中包含一段约四分钟的通关视频。法国科技媒体 Numerama 独立确认他是 OpenAI Labs 工程师,并将这场演示的日期确定为 9 月 7 日。

这款游戏发布在 Neal Agarwal 的 neal.fun 网站上,共有 48 个连续谜题。它从熟悉的验证任务开始,包括勾选复选框和识别扭曲文字。后续关卡则放弃了传统 CAPTCHA 设计,转而采用涉及视觉搜索、时机把握、导航、绘图、记忆和操控的游戏。

有些挑战要求玩家在拥挤的场景中寻找物体,另一些则要求控制移动元素,或根据反馈推断规则。这种多样性让完整通关比用同一种方法解决 48 个图像网格更有意义。

一篇 2025 年的报道指出,该游戏上线后已有超过 250 万人玩过。Agarwal 估计,完成游戏的人不足 1%,并表示人类完整通关可能需要两小时。这些数据来自创作者,而非经过独立审计的分析报告。

这篇游戏介绍描述了几个具有代表性的关卡。其中一个要求玩家以 94% 的准确度画出圆形;另一个将股票图表的波动转化为交易挑战,而后续谜题则涉及为一辆 Waymo 进行侧方停车。

在这些不同类型的挑战中取得成功,需要的不只是物体识别能力。智能体必须将视觉信息与恰当操作联系起来,再根据屏幕反馈决定下一步。这一过程通常被称为视觉落地(visual grounding),即将指令与正确界面元素关联的能力。

据称,视频显示 Astra 在全部 48 项任务中前进时没有出现可见的失败尝试。然而,帖子并未提供可复现的评估包,也未披露完整提示词、计算机操作框架、推理配置、此前尝试次数,或录屏之外是否存在人工干预。

这些缺失并不意味着视频是假的,但限制了这一结果所能证明的内容。一次成功的录制通关只能表明,某种配置在所呈现的条件下完成了某个序列。

它无法证明多次重复试验中的成功率,也无法说明 Astra 是否能从随机化布局、网络延迟、修改后的指令或对抗性内容中恢复。

因此,“零失误”描述的是观众能在已发布通关过程中看到的内容,不应将其视为受控条件下的可靠性统计数据。

这条边界构成了文章的核心张力。这场演示足以作为一次令人印象深刻的能力展示而令人信服,却仍不足以证明可靠、通用的浏览器自主操作能力。

为什么 GPT Astra 的演示对计算机操作很重要

这次通关之所以重要,是因为它揭示了自动化正从脚本化操作转向能够在行动中理解陌生界面的智能体。

传统浏览器自动化依赖选择器、页面结构和预先确定的工作流。脚本可能通过 HTML 标识符定位按钮,在命名字段中输入文本,再等待特定确认元素出现。

当开发者控制界面且流程很少变化时,这种方式效果很好。但当标签移动、页面结构变化、弹窗出现,或任务需要判断时,它就会变得脆弱。

视觉型计算机操作智能体的工作方式不同。它接收屏幕表征,判断当前情境的含义,并选择一个操作。操作后,它检查产生的状态,再重复这一循环。

“我不是机器人”游戏持续对这一循环施加压力。每完成一个谜题,前一个交互模型就会被另一个取代。用于画圆的固定脚本,对视觉搜索挑战或节奏游戏几乎没有帮助。

这种突如其来的多样性正是该演示的价值所在。Astra 看起来能够放弃一种局部策略,并形成另一种策略,而无需为每个关卡获得定制集成。它将界面视为需要理解的对象,而不是开发者早已编码好的步骤序列。

OpenAI 于 2026 年 9 月 3 日推出 GPT-6 Astra,并将计算机操作定位为核心能力。该公司表示,该模型可以操作表单、电子表格、仪表盘、开发工具和其他专业软件。

OpenAI 公布的计算机操作结果为这款病毒式传播的游戏提供了更正式的背景。Astra 在该公司的 OSWorld 2.0 评估中获得 72.6%,而 GPT-5.6 Sol 为 65.7%。

OpenAI 还称,Astra 完成这些模拟任务所需时间减少约 47%。其公布的平均时间约为每项任务 40 分钟,而 GPT-5.6 Sol 约为 75 分钟。

这些结果由公司自行报告,尽管 OSWorld 本身是一个外部研究基准。其第二版评估跨越日常和专业应用的长流程工作,而不是孤立点击或简短网页任务。

底层的 OSWorld 研究描述了 108 个长程工作流,其中包括智能体必须在真实软件环境中保持状态、协调步骤并应对变化的任务。

Astra 的游戏通关并未复现 OSWorld,但提供了基准表格无法呈现的内容:一个非专业人士能够立即评估的紧凑视觉示例。

观众可以看到模型识别目标、操控控件并在任务之间切换。这种可见性使结果更具说服力,即便其实验控制仍然薄弱。

同样的特质也可能造成误导。一段精心呈现的成功视频,自然会隐藏其背后的失败分布。开发者需要知道智能体成功的频率,而不仅仅是它是否曾成功过一次。

对于企业采购者而言,实际问题并不是 Astra 能否完成一款有趣的浏览器游戏,而是该智能体能否在不损坏数据、泄露信息或悄然误解请求的情况下完成重复性工作。

一次视觉上完美的通关提高了人们对未来的期待,但它本身并不能满足这些期待。

通用智能体正在给脚本化浏览器自动化施压

GPT Astra 对那些要求开发者预先定义每一种界面状态的自动化系统施加了最大的压力。

机器人流程自动化、浏览器扩展和测试框架已经能够完成有价值的计算机工作。它们仍然具有吸引力,因为其操作可以在已知条件下被检查、限制和重复。

它们的弱点在于维护。页面重新设计、字段改名或意外对话框都可能导致工作流中断。此后,团队必须修复选择器并增加异常处理,自动化才能继续运行。

有能力的视觉智能体提供了另一种取舍:它可以利用屏幕上出现的内容,推断控件意图,并在界面偏离预期布局时适应变化。

CAPTCHA 游戏将这种对比戏剧化。它的 48 个关卡刻意拒绝维持单一、稳定的交互模式。挑战变成了一连串例外情况,而这正是刚性自动化效率下降的地方。

这并不意味着视觉智能体会在所有场景取代脚本。对于输入稳定且审计要求严格的大规模流程,确定性自动化仍然更可取。

更可能的架构是结合两种方法:智能体理解任务、处理不确定状态并选择工具;传统软件则通过受限接口执行敏感或重复性操作。

这种混合模式正在改变 AI 市场中的竞争压力。OpenAI 与 Anthropic、Google 及专业自动化供应商竞争的,不只是对话质量。相关衡量标准在于模型能否在软件内部完成工作。

屏幕理解只是其中一个组成部分。OpenAI 报告称,Astra 在无工具条件下的 ScreenSpot-Pro 得分为 92.7%,而 GPT-5.6 Sol 为 76.9%。ScreenSpot-Pro 测试模型能否识别指令所描述的界面位置。

单靠落地性能并不能保证任务完成。智能体可能点击了正确元素,却在几步之后失去对用户目标的把握。

长程执行还需要记忆、错误检测和克制。系统必须保留目标,识别操作何时失败,并避免越权即兴发挥。

游戏通关触及了其中多项能力。每个解开的关卡都会提供即时反馈,使智能体能够确认进度。整个序列也给出了清晰终点:到达第 48 关。

真实工作环境宽容得多。客户关系管理系统可能接受错误更新,却不会明确提示错误。电子表格也可能保留有缺陷的公式,同时看上去仍然完整。

这一差距解释了为什么主要对手是一条路线,而不是另一个模型。重要的竞争是自适应视觉控制与刚性脚本控制之间的对抗。个别供应商只是这场更广泛转型中的参与者。

对开发者而言,这会改变工程时间的投入方向。编码每一次点击所需的工作可能减少,更多精力将转向权限、状态验证、日志记录、恢复机制和可衡量的验收标准。

对知识工作者而言,这会改变自动化的交互方式。用户可以描述结果,而不是录制宏命令;但他们也必须提供足够的上下文,避免系统作出看似合理却不正确的解读。

对软件供应商而言,面向智能体的准备程度将成为产品议题。清晰标签、稳定状态信号、可访问控件和可逆操作,都有助于人类与 AI 系统安全地操作。

Astra 连续通关 48 关,让这一方向变得清晰可见。它的意义在于跨界面适应能力,而不是让某个特定 CAPTCHA 提供商难堪。

CAPTCHA 游戏并非安全基准测试

这种病毒式传播的表述夸大了其安全层面的启示,因为现代反机器人防护会评估可见谜题之外的行为与风险。

CAPTCHA 是“区分计算机与人类的全自动化公开图灵测试”的缩写。早期系统高度依赖扭曲文本或图像识别,这些任务曾被认为对机器而言颇具难度。

现代防护依赖更广泛的信号。它们可以检查浏览器完整性、交互模式、请求历史、设备信息、网络信誉,以及某项操作周围的上下文。

可见的验证挑战通常只是其中一层。通过谜题并不必然意味着获得可信会话,而没有看到谜题也不代表没有发生自动化评估。

Neal Agarwal 的游戏借用了 CAPTCHA 的视觉语言,但其设计目标是娱乐。它旨在令真人玩家感到惊喜和挫败,而不是作为生产环境中的欺诈防范服务运行。

这些关卡似乎也以固定的公开顺序出现。网上已有攻略和解法。对于任何模型评估而言,这会带来潜在的数据污染问题,因为训练数据或浏览工具可能包含有关该游戏的信息。

录像中没有任何内容证明 Astra 使用了记忆中的解法,但也没有任何内容排除这种可能。严谨的测试应控制网络访问、检查工具调用、随机化任务,并在新的变体中重复评估。

研究人员还需要制定评分规则。他们应区分感知错误、规划错误、控制失败、偶然成功和恢复行为。单一的二元完成结果掩盖了这些差异。

缺失的细节至关重要,因为智能体的表现可能高度依赖其运行框架。运行框架是指负责捕捉屏幕、发送操作、管理记忆,并决定模型何时获得下一次观察的软件环境。

更好的指针控制器可以提升模型表面上的表现。更长的推理、任务专属指令、保存的上下文或网页搜索访问权限同样如此。缺少配置细节时,观众无法将结果完全归因于 Astra。

这还涉及另一项安全复杂性。能够理解陌生界面的模型可以帮助合法用户,但同样的能力也可能支持自动化滥用。

OpenAI 在其 Preparedness Framework 中,将 Astra 的网络安全能力归为 Critical 级别。该公司表示,在部署前已强化隔离、访问控制、监控及其他安全保障措施。

该模型的安全评估呈现出复杂图景。OpenAI 报告称,在相同条件下的部署模拟中,Astra 的严重失配警报少于 GPT-5.6 Sol。

不过,OpenAI 也报告称,其思维链可监测性有所下降。这一术语描述的是:监控系统能否从模型披露的推理中可靠地发现有问题的意图或行为。

在多项评估中,Astra 的内部推理往往更短,信息量也更少。外部评估机构 Apollo Research 还警告称,有限的测试和较高的评估意识会削弱关于对齐的结论。

这些发现并不表明这次 CAPTCHA 通关不安全。它们揭示了更强计算机操作能力背后的更大权衡:当模型误解指令或越过边界时,行动更有效的模型也会带来更严重的后果。

因此,负责任的部署不能只依赖模型自身的判断。系统需要限定范围的凭据、确认要求、操作日志、速率限制和可逆工作流。

团队还应将观察权限与操作权限分开。智能体可能需要广泛的可见性来理解任务,但它应只获得执行获批操作所需的权限。

游戏要求 Astra 持续推进,直到清除所有挑战。企业环境必须实行相反的纪律。系统应知道何时需要再次确认才能继续,以及何时必须停止。

因此,这一演示几乎没有说明 CAPTCHA 的终结。它更明确地表明,随着智能体能够感知和操控界面,保护软件免受其影响的需求正在增长。

这次病毒式传播的通关仍未证明什么

最关键且尚未解决的问题,是其能否在重复进行、由独立方控制的测试中保持可靠。

公开发布的帖子展示了一条成功轨迹。它没有说明录像前进行了多少次尝试、游戏是否被修改,或是否有人在所捕捉的画面之间介入。

视频时长也不等同于任务耗时。录像可以被加速、剪辑,或从更长的会话中生成。若无明确的方法论说明,该片段不应支撑关于完成时间的说法。

同样,表面上没有错误,并不能证实模型从未选择过错误的内部计划。智能体可以在行动前重新思考,或由运行框架抑制不确定的操作。

独立复现将回答几个基本问题。研究人员应在多个全新会话中运行 Astra,记录每一项操作,披露提示词,并公布失败类别。

他们还应在完全相同的条件下,将结果与其他当前模型比较。缺少这一基线,这次通关无法证明其中有多少表现专属于 Astra。

随机化变体将提供更强的测试。游戏可以在不同会话之间改变物体位置、指令、时序、视觉风格和解答数值。

若模型能在这些条件下持续成功,就能为其视觉推理能力提供更有力的证据。若随机化后表现崩溃,则可能意味着依赖记忆、脆弱的启发式方法,或针对特定运行框架的调优。

另一项缺失的指标是人工介入频率。商业智能体常常看似自主运行,却在关键时刻请求人工协助。这种行为可能是恰当的,但必须被计入统计。

有用的评估应区分无人监督完成与经人工批准的完成。它还应报告恢复次数、重试次数、不安全的尝试操作,以及总交互成本,但不必公布价格数字。

游戏本身具有异常清晰的反馈。通过一关就会解锁下一关。失败通常是可见、局部且可逆的。

商业软件往往不具备这些特性。一封错误的电子邮件可能被成功发送。一条被删除的记录可能直接消失,而不会留下清晰信号来表明智能体的推理有误。

这一差异限制了游戏的预测价值。它测试了广泛的交互类型,但没有测试在模糊商业目标下发生的静默错误。

这 48 关的序列还奖励坚持。在安全环境中,坚持可能变成不受欢迎的规避行为。智能体必须区分:一个旨在被完成的谜题,与一个旨在阻止自动化的控制措施。

这种区分取决于授权和上下文,而不是视觉智能。技术能力再强的模型,仍需要明确的政策来约束其何时应拒绝、暂停或将控制权交还给人类。

最有说服力的解读应保持克制。GPT Astra 似乎能够在一次公开发布的运行中,处理一连串令人瞩目的浏览器谜题。这一结果与 OpenAI 关于计算机使用能力提升的更广泛主张相吻合。

最难以成立的解读则过于宽泛。该视频并不能证明 Astra 能击败生产环境的 CAPTCHA 系统、能在整个网络中可靠运行,或已达到与人类等同的自主性。

将这些主张区分开来,并不会削弱这一成就。相反,它将一则病毒式传播的轶事转化为可检验的有用假设。

GPT Astra CAPTCHA 通关之后值得关注什么

三个信号将决定这次演示是代表可靠进步,还是仅仅是一次出色的展示。

第一个信号是独立复现。研究人员或开发者需要在有文档记录的条件下,使用已发布的 Astra 模型和可识别的运行框架,重复完成整个游戏。

有力的复现应公开提示词、推理设置、网络访问、操作轨迹、介入次数及多次运行的结果。持续较高的完成率将增强 Astra 能够泛化至陌生交互的主张。

频繁失败并不会让原始录像失效。它们只会表明,这次演示代表的是最佳情形下的能力,而非可靠的表现。

第二个信号是随机化界面测试。固定的公开谜题无法清晰区分推理能力与记忆中的解法或任务专属准备。

新的变体应改变布局、数值、控件、视觉噪声和反馈。Astra 还应面对包含误导性文本或与用户目标无关指令的界面。

若在这些变体中表现稳定,将支持自适应智能体的解释。若显著下滑,则更能说明关键工作流仍应保留脚本和狭窄集成方案。

第三个信号是在受限权限下的生产环境行为。OpenAI 和早期客户应报告 Astra 完成实际任务、请求帮助、造成可逆错误或尝试未授权操作的频率。

汇总成功率比精选演示更重要,错误严重程度和恢复时间亦然。一个错误的电子表格单元格,与一笔未授权交易所造成的后果并不相同。

OpenAI 的发布材料将表单、客户记录、日历、研究、软件测试和专业文档列为目标用途。这些场景中的证据将揭示,基准测试中的提升能否迁移到日常工作中。

开发者应关注操作轨迹,而不只是最终答案。企业采购方应要求在自身应用、数据结构和权限边界下进行重复评估。

知识工作者应将早期智能体视为受监督的操作员。为它们提供明确目标、有限访问权限、清晰的停止条件,以及仍然易于检查的输出。

这段 CAPTCHA 视频提供了适应性计算机控制的一个难忘预览。它并未消除验证的必要性。相反,它将验证问题从“模型能否点击?”转变为“我们能否信任已完成的工作流?”

这才是接下来值得测试的问题。让 GPT Astra 执行一项具有可衡量成功标准的可逆任务,然后记录每一次纠正和介入。精心呈现的结果与完整操作历史之间的对比,将比任何病毒式传播的视频片段揭示更多。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page