top of page

Anthropic a16z 数据称智能体胜过人类,但基准测试掩盖了更棘手的现实

8月11日
讀畢需時 13 分鐘

Anthropic a16z 数据如今将 Claude Fable 5 在 OSWorld-Verified 上的成绩定为 85%,高于被广泛引用的 72.36% 人类得分。一年前,公开报告中的最佳智能体成绩还在 42% 左右。这一提升表明,计算机使用智能体已跨过此前看似遥远的一道门槛。

但这一比较也附带了重要注脚。人类得分来自最初的 OSWorld 研究,而 85% 的结果采用的是修订后的 OSWorld-Verified 评测。这些数字描述的是相关测试,但并未构成 Claude Fable 5 与人类之间受控条件下的直接对决。

这种区别很重要,因为计算机智能体正从演示走向错误会带来实际后果的工作流程。OpenAI、Google、Anthropic 及专业开发商都希望智能体能够操作浏览器、桌面应用和业务系统。即使尚不能证明这些系统能否完成普通工作日的任务,高分也会改变买家的预期。

Anthropic a16z 数据展现惊人的一年跃升

最重要的变化并不是某个模型达到 85%,而是一项高难度计算机使用基准测试在约一年内从约 42% 提升至 85%。

a16z 强调的计算机智能体评分卡显示,OSWorld-Verified 的成绩大幅上升。Claude Fable 5 以 85% 领跑公开结果。该图表将计算机交互列为应用 AI 进步最快的领域之一。

OSWorld 测试的是智能体能否在真实软件环境中完成任务。智能体并非只是回答问题,而是必须查看屏幕并决定下一步操作,随后通过类似鼠标和键盘控制的界面执行动作。

一项任务可能要求编辑文档、更改应用设置、处理文件,或在程序间转移信息。成功并不只取决于语言生成能力。智能体还必须识别界面元素、保持状态、规划多个步骤,并判断自身操作是否奏效。

最初的 OSWorld 基准测试包含 369 项任务,涉及 Chromium、LibreOffice、Thunderbird、GIMP、VLC 和 Visual Studio Code 等应用。由于 8 项 Google Drive 任务需要手动配置,因此可将其排除,形成 361 项任务的评测。

研究人员在 2024 年推出该基准时报告,最佳模型的成功率为 12.24%。不熟悉这些软件的人类参与者完成了 72.36% 的任务。如此巨大的差距让 OSWorld 成为有价值的测试,因为它暴露了对话式基准测试所掩盖的弱点。

智能体在图形用户界面定位方面表现不佳,也就是无法将视觉目标与正确的屏幕位置准确对应。它们也缺乏关于应用如何运行的操作知识。模型或许理解指令,却仍可能点击错误的控件,或失去对对话框的追踪。

后来的 OSWorld-Verified 工作解决了原始任务集中的错误或不稳定任务。基准维护很重要,因为网站会变化、应用会更新,评测脚本也可能误判有效结果。更干净的测试能更一致地衡量智能体。

不过,改变基准测试也会改变其分数的含义。移除损坏任务能够提升有效性,但除非在相同条件下重新运行所有旧系统,否则无法进行简单的历史比较。智能体设置、动作限制、屏幕分辨率和评测框架也必须保持一致。

因此,42% 至 85% 的曲线最好被理解为快速进步的信号,而不是智能体能力恰好翻倍的受控估计。趋势很强劲,但其精确幅度仍不确定。

85% 这一数字依然意义重大。计算机使用系统必须反复将视觉观察转化为动作,因此错误会沿着任务轨迹不断累积。提升完成率需要感知、推理、记忆和恢复能力的改进。

这让结果不只是一次模型质量更新。它表明,开发者正在更擅长搭建完整的执行闭环。更好的模型有所帮助,但提示词、屏幕表示、反思步骤和专用定位组件同样会影响结果。

因此,Anthropic a16z 的比较确实捕捉到了一种转变。计算机使用智能体不再几乎必然会在普通桌面任务上失败。更难的问题是,如今通过基准测试,是否能够预测它在受控环境之外工作的可靠性。

“人类水平”的标题结合了两项不同测试

Claude Fable 5 看似超过了一个著名的人类基线,但现有证据并未建立起等价的人类与智能体比较。

72.36% 的数字来自为最初 OSWorld 论文进行的人类测试。85% 的数字则与 OSWorld-Verified 相关,后者采用了修订后的任务集和评测流程。将两者视为可互换的结果,抹去了这些数字背后的方法论背景。

就连“人类”一词也需要限定。最初研究测试的是不熟悉相关软件的人。其得分并非人类表现的理论上限。经验丰富的用户、更充裕的时间或更清晰的入门指导,都可能产生不同结果。

智能体得分同样取决于其运行条件。计算机使用评测会因屏幕分辨率、可用动作历史、最大步数、重试策略和推理预算而不同。允许进行更多推断或反思的智能体,可能完成更多任务,但也会消耗更多时间和计算资源。

通过率也可能基于单次尝试或多次尝试报告。一个系统在多次运行中成功一次,与一个系统首次尝试就能稳定成功,带来的产品体验截然不同。业务自动化通常需要后者。

另一个问题是任务轨迹数据。基准任务和成功的交互轨迹可能会影响后续模型训练或智能体设计。接触这些数据并不会自动使结果失效,但会削弱“该分数衡量通用计算机能力”的说法。

最初的 OSWorld 团队发现,更长的文本式轨迹历史能提升表现。这些历史记录为智能体提供了更多关于先前决策的信息。不过,随着推理上下文增长,它也带来了效率挑战。

屏幕分辨率同样重要。更高分辨率的截图通常能提升结果,因为模型能更准确地定位较小的控件。这一发现说明,当环境未对齐时,两项名义上相似的评测为何可能产生不同分数。

85% 的分数也意味着仍存在显著失败率。在 361 项任务中,如果每项任务权重相同,15% 的失败率约对应 54 项未成功任务。这个估算说明了实际操作中的差距,尽管公开的基准协议可能会以不同方式汇总多次运行。

对于消费者实验而言,偶尔失败或许可以接受。但对于薪资、合规、账户管理或客户记录而言,每七项任务失败一项就是部署约束。成本取决于系统是安全停止,还是留下错误状态。

这并不意味着该基准毫无意义。OSWorld-Verified 衡量的是一项重要能力:智能体能否在配置好的计算机环境中执行一条边界明确的指令。它比静态问答提供了更贴近现实的挑战。

问题始于这种测试中的成功被扩大为一般性职场自主能力的主张。真实工作包含模糊请求、被中断的会话、不断变化的权限、缺失的信息,以及无法通过重置虚拟机来消除的后果。

人类也知道何时指令与上下文冲突。他们会要求澄清、注意到可疑变化,并将外部知识带入任务。计算机智能体通常会优化完成表面指令,即使正确做法本应是暂停。

因此,anthropic a16z 的标题在方向上具有参考价值,但在数字上较为脆弱。它告诉我们,Claude Fable 5 及其配套智能体系统能够完成许多标准化桌面任务。它并未证明该系统在真实工作流程中比经验丰富的员工更有能力。

更严谨的“人类水平”主张,需要人类和智能体在可比较的限制条件下尝试相同的已验证任务。研究人员还需报告完成情况、耗时、重试、人工干预和有害错误。没有这些控制条件,85% 对 72.36% 仍只是相关测量之间一个引人注目的比较。

计算机智能体如今对每种自动化策略施加压力

这一得分对围绕 API、脚本和固定工作流程构建自动化的公司形成压力,因为界面级智能体能够触及这些方法无法覆盖的软件。

传统自动化在系统提供结构化接口时效果最佳。开发者将应用程序编程接口,即 API,连接到另一项服务。机器人流程自动化工具则遵循预定义的界面步骤和规则。

两种方法都可能有效,但集成工作会造成阻力。一些内部工具没有 API。旧软件可能只提供不完整的接口,而工作流程的小幅变化可能就需要开发者或顾问重新构建自动化。

计算机使用智能体提供了另一条路径。它会解读人类看到的同一屏幕,然后通过现有界面执行操作。理论上,这让组织无需等待每家供应商提供专用集成,也能实现软件自动化。

Anthropic 围绕这一理念推出了其计算机使用能力。其计算机使用文档描述了一个循环:应用提供截图,并执行所请求的鼠标或键盘动作。模型会观察每个新状态,再选择下一项动作。

这种结构颇具吸引力,因为它将推理与执行分开。公司可以将模型置于受控环境中,并决定允许哪些操作。智能体不必获得对员工实体计算机的不受限制访问。

更强的 OSWorld-Verified 成绩提高了建设这类基础设施的预期回报。一个任务成功率不足一半的系统需要持续监督。达到 85% 时,定向部署开始显得更可行,尤其是在失败容易被检测的情况下。

这种转变给多个群体带来压力。

企业软件供应商必须决定,是让智能体操作其图形界面,还是使用受支持的 API。界面访问扩大了覆盖范围,但也可能带来不可预测的负载,并绕过为人工审核设计的产品流程。

自动化供应商必须证明确定性工作流程为何仍具价值。它们的优势在于可重复性、可审计性和明确规则。计算机智能体则凭借处理变化和非结构化指令的能力展开竞争。

模型提供商面临的压力不止于提高基准准确率。客户需要身份控制、操作日志、权限边界,以及可靠中断执行的方式。能看见正确按钮的模型,只是可部署智能体的一个组成部分。

OpenAI 和 Google 也在这一领域展开竞争。它们的系统采用了不同组合的视觉模型、浏览器、工具和执行环境。基准测试排名固然重要,但产品的实际覆盖范围取决于这些组件能否安全协同工作。

专业型智能体开发者仍可通过缩小运行环境的范围,胜过通用模型。为单一应用设计的系统可以包含定制解析器、恢复规则和验证检查。通用计算机操作覆盖的任务更多,而专用自动化则可提供更强的可预测性。

这种权衡将影响市场采用。一个通用智能体可能会在一次会话中起草邮件、更新电子表格并上传文件。一个专业系统则可能处理单一理赔流程,同时执行更严格的检查并提供更清晰的责任追溯。

企业应预期会出现混合式设计。智能体可以理解请求并在陌生状态中导航,而 API 则执行敏感交易。确定性验证器可以在任何不可逆操作发生前检查结果。

这种设计降低了单一排行榜的重要性。真正有商业价值的问题,不是 Anthropic 的 computer use 是否达到 85%,而是经过配置的系统能否在企业可接受的风险范围内完成其任务分布。

组织还需要获得相关上下文。操作软件的智能体必须知道应适用哪个文件、客户记录、政策或消息。可搜索的 AI knowledge base 可以帮助人们整理这些上下文,尽管这并不能替代执行控制措施。

新的基准测试结果改变了起始假设。买方不再需要追问界面级自动化是否根本可行。他们需要识别它在哪些场景下能稳定工作、在哪些场景下需要审批,以及在哪些场景下 API 仍然更安全。

85% 得分未衡量的内容

反驳广泛自主性的最有力证据来自更长的任务:智能体仍会丢失上下文、漏掉变化,并且无法验证自己的工作。

OSWorld 的原始任务通常约包含 30 个操作。这足以暴露定位和理解失败,但相较于许多专业工作流仍短得多。真实任务可能跨越多个应用、文档、账户和决策节点。

OSWorld 2.0 的设计目标就是测试这种更困难的场景。其长时程基准测试包含横跨专业和日常领域的 108 个工作流。熟练人员完成一项任务的时间中位数约为 1.6 小时。

这些工作流涵盖研究、工程、创意制作、金融、运营、行政、合规和医疗保健。约 69.6% 的任务需要熟练用户花费超过一小时。它们包含动态信息、隐藏状态以及分散在多个来源中的事实。

其中一个例子是提交报销申请。智能体必须阅读教程、检查收据、核对银行和邮件记录、处理新消息、找回员工信息,并解决其中的不一致之处。正确点击只是开始。

在 OSWorld 2.0 上,报告中表现最佳的系统按主要二元指标仅完成了 20.6% 的任务。其部分得分达到 54.8%,这意味着它经常取得进展,却未能正确完成整个工作流。

这一结果带来了核心反转。计算机智能体可以在较短、经过验证的任务上表现得近乎超人,但在较长的专业任务中仍远低于可靠水平。这两项发现可以同时成立,因为它们衡量的是不同的时间跨度。

随着任务变长,性能急剧下降。对于需要人类花费 137 至 163 分钟的工作流,没有任何受测模型的二元完成率超过 10%。超过 163 分钟后,保留的模型没有完成任何任务。

失败模式也发生了变化。智能体的主要失败原因并非无法操作基本控件,而是丢失了对约束条件的追踪、忽略新信息、以猜测代替提问,以及跳过最终验证。

这些都是严重的职场失误。员工通常可以立即修正一次误点击。但一个忘记政策条件或忽略更新邮件的系统,可能产生看似完成、实质却错误的结果。

效率带来了另一道差距。OSWorld-Human study考察了与人类设计的操作轨迹相比,智能体需要多少步骤。研究发现,领先系统使用的操作次数明显多于必要数量。

研究人员还指出,用于规划、反思和判断的模型调用是延迟的主要来源。随着轨迹扩展,后续步骤所需时间可能是早期步骤的三倍。更多推理改善了部分决策,同时也让工作流变得更慢。

在一个例子中,将两段文字改为双倍行距花了智能体 12 分钟。具备入门级计算机经验的人可在 30 秒内完成同样操作。仅看是否完成,无法体现这种实际差异。

该研究报告称,所分析错误中有 23% 源于较差的视觉定位。这些错误可为一项任务增加多达 30 个不必要的步骤。恢复行为往往消耗资源,却不能保证得到正确结果。

这以一种有益的方式使 anthropic a16z 的叙事变得更复杂。85% 的得分反映了短时程执行能力的真实进步。较新的证据则指出了这种进步不再能够迁移的边界。

成本仍是另一个缺失维度。智能体可能通过使用更多输出 token、更多尝试次数或更深入的反思来提高完成率。OSWorld 2.0 发现,token 效率与最高完成率之间存在明确权衡。

得分最高的 Claude 配置使用的输出预算远大于更高效的 GPT 系统。买方需要同时考察这两项指标,因为最佳基准得分未必能在大规模应用中带来最佳经济效益。

安全性同样无法通过简单的完成率百分比来捕捉。智能体可能在技术上完成任务,却在过程中采取不可接受的行动。它可能暴露敏感信息、接受意外提示,或未经批准进行不可逆更改。

基准环境也都从受控状态开始。生产环境中的计算机会积累通知、扩展程序、缓存会话、权限提示和界面差异。微小差别就可能破坏原本在标准虚拟机中有效的执行策略。

网页内容会带来对抗性风险。页面可能包含试图重定向智能体或索要凭据的文本。系统需要能够可靠地区分用户指令与任务过程中显示的不可信内容。

因此,计算机操作智能体需要分层防御。组织可以隔离会话、限制域名、收紧权限、要求确认,并通过独立系统验证输出。这些控制措施能降低风险,但也缩小了自主操作的含义。

基准得分应当用于界定部署边界,而非抹去这些边界。近期最有力的应用场景是范围明确、可逆且易于检查的任务。高影响操作仍应经过确定性检查或人工审批。

三个信号将显示该结果是否能够迁移

下一阶段将由长任务完成率、首次尝试可靠性和可衡量的生产环境采用情况决定,而非又一项孤立的排行榜纪录。

第一个信号是在 OSWorld 2.0 或其他可比长时程基准测试上的表现。如果 Claude Fable 5 的 85% OSWorld-Verified 成绩,也能推动扩展工作流中 20.6% 的完成率前沿,这一结果将更具说服力。

部分进展还不够。专业任务通常只有在每个必要步骤都完成并经过验证后才能创造价值。研究人员应同时报告二元完成率、部分得分、token 使用量、操作次数和人工干预频率。

长任务上的大幅提升,将强化模型能够在不断变化的环境中保持目标和约束的论点。提升有限则意味着,85% 的结果主要依赖于较短且边界明确的交互。

第二个信号是在标准化条件下的首次尝试可靠性。提供商应公布其得分背后的运行次数、操作限制、推理设置和评估框架。独立复跑将使模型比较更可信。

方差很重要,因为用户体验到的不是平均基准表现,而是一次次独立执行。即使平均结果看似很强,一个在成功与失败之间摇摆的系统仍会带来监督成本。

报告还应将模型本身的直接性能与智能体框架带来的改进区分开来。规划器、视觉定位器、重试机制和验证器都可能提高最终得分。买方需要知道哪些组件带来了提升,以及这些提升能否复现。

稳定的一次通过结果将强化“达到人类水平”的论点。若得分依赖重复尝试或异常庞大的推理预算,其对日常部署的说服力就会下降。

第三个信号是来自受限业务工作流的生产证据。有价值的报告应包括完成率、平均执行时间、升级处理频率,以及由人工修正的输出占比。

最具信息价值的部署将涉及缺少便捷 API 的软件。在这些场景中,界面级智能体相对于传统集成方案的优势最为清晰。同时,界面变更也最容易暴露其脆弱性。

关注组织是否将智能体从观察扩展到行动。一个收集信息并准备草稿的系统,风险低于一个提交付款、修改权限或联系客户的系统。

向更高影响行动的扩展,将表明人们对该技术及其控制措施的信任正在增加。若持续局限于草稿和只读任务,则说明基准进步尚未消除运营层面的担忧。

anthropic a16z 的数据值得关注,因为计算机操作智能体的进步速度远快于最初 OSWorld 结果所暗示的水平。Claude Fable 5 报告的 85% 得分,标志着短时程能力出现了可信的变化。

但这并不能证明智能体如今已在一般意义上的计算机使用能力上超过人类。得出这一结论需要等价测试、高效执行、稳定的首次尝试表现,以及在长工作流中的成功。

对于开发者和买方而言,务实的回应既不是否定,也不是立即赋予自主权。应在具有代表性的任务上测试智能体,衡量每一次干预,并将可逆操作与后果重大的操作区分开来。然后提出真正重要的问题:anthropic a16z 的结果能否经受住你实际工作的检验?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page