top of page

Anthropic Claude Opus 4.5 提升了对真正计算机使用的希望

Anthropic 发布了 Claude Opus 4.5,其新增的计算机控制功能可让模型移动光标、点击按钮并在应用中输入文字。该更新针对以往需要人工操作的任务,例如填写表单或在屏幕上重新排列文件。早期测试显示,模型无需持续提示即可完成简单序列。

公告的核心在于一次转变。 Anthropic 表示,该模型现在可在多个屏幕操作中保持状态,而非每步后重置。用户反馈单次会话中任务中断的情况减少。此次发布正值行业向能操作整个桌面的智能体转型,而非仅限于单一网站或代码仓库。金融、法律和创意团队已迅速开始测试新功能是否能减少重复性手动工作。行业观察者指出,这标志着与早期聊天机器人式界面的转变,此前用户需手动将输出复制粘贴到其他程序中。而现在,模型可直接在人类操作员使用的同一视觉画布上执行操作。

私人预览参与者的早期反馈既充满兴奋也保持谨慎。一家中型会计事务所的工程主管描述了让智能体通宵运行以核对三个不同桌面应用中的银行对账单;整个过程仅需两次人工干预。其他测试者强调,模型对实时屏幕截图的推理能力减少了对脆弱脚本语言的依赖,而这些脚本此前用于自动化相同步骤。然而,这些早期成功来自屏幕布局数日内保持一致的严格受控环境。

更广泛的承诺是,知识工作者最终可以委托整个端到端流程——发票处理、合同修订或营销素材准备——而无需编写一行传统自动化代码。但许多从业者仍将当前版本视为实验工具,而非可直接替代人工劳动的方案。演示视频与日常生产使用之间的差距,仍体现在所需人工检查点的频率上。

计算机使用界面的实际工作原理

Claude Opus 4.5 引入了一个界面层,该层定期捕获屏幕截图,通过视觉编码器处理它们,并将识别的 UI 元素转换为鼠标坐标和键盘事件。然后,模型输出结构化操作,例如“将光标移动到 (x, y)”或“输入字符串 ‘Q3 revenue’”。只要代理仍控制桌面会话,此循环就会持续运行。

开发者可以通过 Anthropic API 调用新功能,方法是传递一个特殊的 “computer_use” 工具定义。一旦启用,模型会在同一请求中接收文本指令和最新的屏幕捕获。响应包含操作列表,客户端在本地执行这些操作,然后返回下一个屏幕截图。每个周期的延迟通常在 800 毫秒到两秒之间,具体取决于网络条件和图像压缩设置。详情请参阅 Anthropic 的官方计算机使用文档

由于该系统在像素级别运行,而不是通过应用程序 API,因此它可以与人类能看到的任何图形软件交互。没有现代 REST 端点的传统企业应用程序变得可访问。同时,该方法继承了影响人类用户的每一个视觉歧义:重叠窗口、动态高亮和抗锯齿伪影都需要模型来解释不完美的视觉数据。

实际上,团队会将客户端配置为在传输前将图像调整为 1024×768 或 1280×720 像素,以平衡识别准确性和令牌成本。更高的分辨率可提高小文本的可读性,但会增加延迟和 API 支出。该操作循环还支持“思考”步骤,模型可以在提交鼠标或键盘输出之前暂停并描述其下一个计划序列。此中间推理跟踪可用于审计目的或用于调试代理为何选择特定坐标。

实施者还报告说,在将图像发送到模型之前添加轻量级本地 OCR 过程有时会改善以文本为主的工作流,尽管此步骤并非官方要求。原生视觉处理与可选 OCR 的结合在密集的财务电子表格或法律展品上产生最可靠的结果。

屏幕上的模型操作

早期开发者测试专注于电子表格更新和邮件起草。在受控演示中,当布局在迭代中保持不变时,Claude Opus 4.5 成功选择了范围、应用了公式并撰写了消息。该模型学会了通过读取屏幕上渲染的文本来定位列标题,而不是依赖固定坐标。

屏幕尺寸变化或弹出窗口仍会导致失败。 当模态对话框意外出现时,该模型通常会暂停并等待额外的人类指导,而不是尝试自主恢复。测试人员还观察到,多显示器设置会引入坐标映射错误,除非代理收到每个显示器分辨率和相对位置的明确描述。

操作空间包括左键单击、右键单击、双击、拖放、滚动以及带修饰键的文本输入。时序参数允许模型在继续之前等待动画或加载微调器。这些原语组合成更高级别的序列,例如“将前十行复制到新工作簿中并将标题行格式化为蓝色。”高级用户已开始将数十个此类原语链接到可重用 playbook 中,这些 playbook 可以进行版本控制并在团队间共享。

几个试点小组维护这些 playbook 的内部库,每个条目包括序列验证所依据的确切软件版本和屏幕分辨率假设。当操作系统补丁更改对话框时,工程师可以快速识别并仅更新受影响的 playbook,而不是重建整个工作流。

承诺与限制的交汇处

Anthropic 报告称,超过 200,000 个 token 的上下文窗口使模型能够保留数十步之前的屏幕状态和输入值。在发布时分享的内部评估中,该代理无需中间提示即可完成基本的数据录入例程和文件系统操作,如 computer-use technical announcement 中所述。一次内部测试涉及将 47 份 PDF 发票处理到共享电子表格中;模型在整个批次中正确保持了行编号和货币格式。

真实使用引入了模型无法控制的变量。 网络延迟峰值、自动软件更新或用户特定的文件夹结构会导致序列偏离训练示例。当文件保存对话框出现在意外位置,或企业 VPN 更改窗口边框时,代理必须猜测或停止。运行无人值守夜间作业的团队发现,他们需要每三到五分钟插入检查点提示以验证中间结果。没有这些防护措施,连续运行十分钟后错误率急剧上升。几个试点组现在只在低变异性窗口(如夜间批处理完成后)安排代理。

更长的会话还暴露了 token 预算限制。即使有 200k 上下文窗口,每次新的屏幕截图都会消耗数百个 token,导致模型最终丢弃早期的视觉历史。团队通过用纯文本总结已完成的步骤并将该摘要反馈到提示中来缓解此问题,有效地将视觉记录提炼为模型可以继续使用的紧凑叙述。

上下文供应问题

该功能预设模型接收到关于用户目标和每个打开窗口当前状态的完整信息。实际上,文件层次结构、命名约定和决策历史仅存在于用户的脑海中。因此,每次新会话都需要操作员在有意义的工作开始前重述项目背景。

团队通常集成外部检索系统,以便代理可以自动拉取相关背景。Anthropic’s developer guide on long-context agents 概述了如何在计算机使用会话开始前将检索到的摘要注入提示中。操作员不再需要在每次启动时重复相同的背景信息。其他代理平台中也存在类似的记忆层,但大多数仍需要在 Claude Opus 4.5 咨询它们之前进行显式集成工作。

没有持久记忆的通用代理迫使每次新任务都重复相同的设置工作。 Claude Opus 4.5 改进了动作控制,但仍依赖用户提供的新鲜上下文。持久记忆桥接仍属于外部责任,而非内置能力。因此,早期采用者将记忆集成视为一级工程任务,而非事后考虑。一些组织已开始嵌入检索增强生成管道,在每次主要代理运行前查询内部 wiki 或工单系统,从而减轻人工操作员的认知负担。

与其他计算机控制代理的比较

多个研究团队和初创公司已探索基于像素的控制。OpenAI 早期使用强化学习代理的实验以及 Adept 的 ACT-1 模型展示了类似的鼠标和键盘原语。这些系统通常需要针对特定任务进行微调或大量人工演示。Claude Opus 4.5 试图通过规模和对截图的思维链推理来绕过繁重的微调。

在并排试验中,GPT-4o 结合浏览器自动化工具在纯 Web 工作流上实现了更高的吞吐量,因为专用的 DOM 访问可消除视觉噪声。相比之下,Claude Opus 4.5 在目标应用缺乏 API 或仅作为桌面二进制文件运行时表现更出色。这种权衡在长期运行的企业流程中最为明显,此时视觉鲁棒性比原始速度更重要。将规划和执行拆分到不同模型上的多代理框架也显示出潜力,但它们增加了许多团队希望避免的编排复杂性。

GitHub 上发布的社区基准显示,Claude Opus 4.5 在 50 个标准化桌面任务上实现了 68% 的成功率,而经过微调的开源基线达到了 54%。当任务涉及高度动态的 Web 应用时,差距会缩小,这强化了像素级代理仍以通用性换取访问遗留软件能力的观察。

Real-World Use Cases

财务团队已经对月末结账流程进行了原型设计,这些流程涉及将 ERP 导出中的数字复制到标准化模板中。在有足够检查点的情况下,代理可以处理重复的格式化和交叉引用。法律运营团队测试了在数百个 PDF 附件中删除敏感条款;成功取决于一致的文档布局和预加载的描述删除规则的指令。

创意工作室探索了在设计应用中批量重命名资产文件和元数据标记。早期结果显示,对于高度重复的流程很有前景,但当版本号或客户特定命名方案在项目间发生变化时,会暴露出脆弱性。采购部门已开始测试发票摄取工作流,该工作流读取供应商 PDF、提取行项目并将其过账到会计系统,在模板稳定的情况下,将手动处理时间从数小时缩短至数分钟。

一家医疗计费公司报告称,在锁定的虚拟机中使用该代理在一个周末处理了 1,200 份索赔。员工仅审查了模型标记为低置信度的 4% 案例,展示了即使在达到完美自主之前也能实现可衡量的劳动力减少。

团队的实际影响

投资于屏幕控制代理的组织还必须为错误处理脚本和上下文准备例程预算工程时间。边际生产力提升仅在每个主要工作流数天的初始设置期之后才会显现。一旦建立,只要界面变化不频繁,代理就可以在稳定任务上减少 60–80% 的手动执行时间。

团队报告称,将代理与人工审核员配对处理第一步和最后一步,可产生最可靠的结果。完全自主在狭窄受限的环境(如具有锁定软件版本的隔离虚拟机)之外仍然罕见。前瞻性部门现在将代理维护职责纳入自动化工程师的职位描述中,标志着桌面流程人员配置方式的永久转变。

限制与风险

像素级控制带有安全隐患。被授予桌面访问权限的代理理论上可以读取任何可见文档或执行任意按键操作。因此,企业会在具有受限网络出口的沙箱虚拟机中运行此类代理。审计日志变得至关重要;每次鼠标点击和按键操作都应记录以供合规审查。

视觉脆弱性也带来新一类的维护开销。每当上游供应商发布 UI 更新时,之前有效的代理脚本就需要重新验证或添加更多训练示例。这种 recurring 成本类似于维护大型 UI 测试自动化套件的经典挑战。偏见和幻觉风险依然存在。模型可能会误读屏幕上的数字,并将错误传播到下游计算中而不标记不确定性。人工监督检查点仍然必要,正是因为代理无法可靠地传达其对视觉解释的置信水平。

未来信号追踪

关注布局变化时的错误恢复速度更新。Anthropic 已表示正在持续开发自动重试策略,以检测常见失败模式(如意外对话框)。检查技术报告中是否提供了超过十分钟测试的已发布准确率数据。

观察团队如何将屏幕控制与存储的项目历史结合。 已经持有该历史的工具可降低重复设置的需求。在下一次模型更新后比较结果,以确定从小型界面变化中恢复是否足以减少检查点频率。行业分析师还建议监控复制计算机使用循环的开源项目,因为社区实现可能比供应商发布更快地展现鲁棒性改进。

常见问题

Claude Opus 4.5 仍需要多少人工监督?

大多数生产试点仍保留人在回路中进行最终验证和处理意外弹窗。超过十五分钟的完全自主运行在严格控制的测试环境之外仍然不常见。

该模型能否跨多个显示器工作?

是的,一旦客户端提供每个显示器的坐标和尺寸。当代理在会话开始时收到显示器排列的明确图表时,准确性会提高。

该功能是否在虚拟机内工作?

只要启用了屏幕捕获权限且网络延迟保持较低,它就能在 VMs 内运行。许多注重安全的部署故意选择这种配置。

未来版本会减少对用户提供上下文的依赖吗?

Anthropic 持续研究长期记忆模块,但当前版本仍将持久上下文视为外部集成点而非原生能力。

关注快速发展的技术故事的团队通常需要一个地方来保存源笔记、会议上下文和后续问题。轻量级的 AI 知识库 可以让这些变动部分在新闻周期变化后更容易重温。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page