top of page

OpenAI Codex 现可控制您的桌面:这对 AI 编码代理竞赛意味着什么

已更新:6月17日

4月16日,OpenAI 发布了一项 Codex 更新,该工具可以打开 Mac 上的任何应用、移动光标、点击按钮并输入内容,而无需触摸键盘。三周前,Anthropic 已通过 Claude Code 完成了同样的事情,TechCrunch 曾将其描述为“许多企业的首选工具”。OpenAI 正在追赶,而 4 月 16 日的发布是迄今为止最明确的信号,表明它深知这一点。

这不仅仅是一个功能发布。实际上正在发生的是,AI coding agent(帮助开发者编写、测试和发布代码的软件)的定义正在被实时改写。该类别正在从自动补全工具转变为自主桌面操作器,而全球两家资金最雄厚的 AI 公司正在竞相定义消费者订阅级别的形态。

本文将深入分析 4 月 16 日更新的实际交付内容、其在营销文案之外的重要性、Codex 与 Claude Code 之间竞争的真实数据对比,以及安全社区一直在讨论的、而 OpenAI 新闻稿中未曾提及的内容。

事件回顾

OpenAI 的“Codex 适用于(几乎)一切”发布中的核心能力是 Background Computer Use,这项功能让 Codex 能够使用自己的光标自主操作 macOS 应用程序。它可以查看屏幕、点击界面元素并在任何应用中输入内容,包括那些没有 API 的应用。多个 Codex 代理可以在后台并行运行,而不会干扰用户在前台的操作。根据 OpenAI 的开发者文档,代理在隔离的进程中运行,并与主应用程序进行异步通信。

这是计算机使用 AI(即 AI 通过屏幕截图和模拟输入控制桌面 GUI 的范式)首次在大规模面向消费者的订阅级产品中正式推出。Anthropic 在 2024 年 10 月作为研究预览版率先提出了这一概念。到 2026 年 4 月,两家公司都已将其转化为每月 20 美元的订阅服务。

4 月 16 日的更新在 Background Computer Use 之外还捆绑了五项额外功能。一个 in-app browser,允许用户对实时网页进行评论标注,为 Codex 在前端和设计工作流中提供点选级别的精度。一个 Memory preview,用于跟踪过去的操作会话、技术栈偏好和循环工作流,并为接手之前的项目提供建议。 Image generation,通过 gpt-image-1.5 让 Codex 能够在同一工作流中生成 UI 原型、游戏资产和占位图。超过 90 plugins,基于最初由 Anthropic 引入的开放标准 Model Context Protocol (MCP) 构建,现在将 Codex 连接到 Atlassian Rovo、GitLab Issues、Slack、Microsoft Suite、Google Calendar 以及其他 80 多项服务。此次更新还发布了 GPT-5-Codex,这是 GPT-5 的一个版本,专门针对智能体编程任务进行了优化。

为了让这一点更具体:想象一下三个 Codex 智能体在同一台机器上同时运行。第一个正在仓库中编写功能代码。第二个正在执行测试套件。第三个正在根据设计简报生成 UI 图像资产。与此同时,开发者正在第四个窗口中编写文档,这些智能体之间互不干扰,也不会干扰前台应用程序。这并非虚构的场景;OpenAI 在发布公告和开发者文档中将其描述为一种受支持的工作流。

此次发布背后的增长数据非常显著。OpenAI 引用了截至 2026 年 4 月的数据,Codex 上的每周活跃开发者超过 300 万,几乎是 3 月初报告的 160 万的两倍。根据 AI Code Detector 发布的数据,Codex CLI 的 npm 下载量从 2025 年 4 月的 8.2 万次增长到 2026 年 3 月的 1453 万次(增长了 177 倍)。据 Fortune 报道,截至 2026 年第一季度,Token 使用量每月增长超过 70%。

为什么这很重要

4 月 16 日更新所代表的转变并非渐进式的。AI 编程智能体这一类别始于 2021 年 GitHub Copilot 这种更智能的自动补全工具,而现在已经跨越到了 AI 可以代表你自主操作整台电脑的领域。这是一种本质上不同的软件,它改变了开发者(以及越来越多的非开发者)对这些工具的期望。

工作流自动化公司 Temporal 正在使用 Codex 来加速功能开发、调试问题、编写和执行测试以及重构大型代码库,团队报告迭代周期缩短了 2-3 倍。电子邮件客户端 Superhuman 正在使用 Codex 让产品经理能够直接贡献轻量级代码更改,而无需拉入工程师,从而弥补了历史上通常需要专门的工程冲刺或漫长待办事项等待的差距。

非开发者的视角可能比开发者生产力的故事更具意义。Hacker News 讨论中引用的一位 CEO 据报道使用 Claude Code 的等效计算机使用工作流,在两小时内完成了一个“原本需要 3-4 周”的社交媒体活动。另一位 Hacker News 评论者描述了一位非技术家庭成员在完全不了解 Python 语言的情况下,通过 AI 辅助实现算法,成功解决了复杂的调度优化问题。这些并非极端案例。它们是桌面自动化 AI 正在消除技术与非技术工作边界的早期信号。

根据 AI Automation Global 引用的数据,截至 2026 年年中,据报道 73% 的专业开发者每天都会使用 AI 编程代理。AI 编程市场预计将达到2030 年 260 亿美元。这些数字庞大,但它们强调了一种结构性转变:在不到两年的时间里,AI 辅助开发已从早期采用者的好奇尝试转变为默认的工作流假设。

Sam Altman 在 The Neuron AI 报道的一次媒体电话会议中阐述了 OpenAI 的战略逻辑:“如果你真的想在复杂的事情上做尖端工作,[GPT-5.2] 是目前最强大的模型。然而,它一直比较难用,因此我们认为,将这种级别的模型能力放入一个更灵活的界面中将非常重要。”这种表述很有启发性:其野心不是一个更好的代码编辑器,而是一个用于复杂知识工作的通用界面层。

对于在工作日中管理多种工具和上下文的开发者来说,这也提出了一个实际挑战:随着这些代理变得更加自主,如何保持它们所需的底层知识和上下文(文档、代码库理解、团队工作流)有序且易于访问,成为了一个值得解决的独立问题。我们将在结尾回到这一点。

没人想谈论的安全问题

在 OpenAI 发布 4 月 16 日版本的同一天,Help Net Security 发表了一篇题为《Codex 现在可以在应用程序之间操作。边界在哪里?》的分析。这是一个没人能给出很好回答的问题,它指向了比产品局限性更严重的事情。

当一个 AI 编程代理可以打开你的电子邮件客户端、点击进入浏览器、读取你的日历并在任何应用程序中输入时,该代理的攻击面就不再是代码仓库,而是你的整个桌面。OpenAI 官方的开发者文档直接承认了这一点,将提示词注入、代码或密钥泄露、包含恶意软件或漏洞以及违反许可证限制列为“高风险”,特别是在启用互联网访问时。其官方指南指出:“仅允许必要的域名和方法,并始终审查 Codex 的输出和工作日志。”

这一指南并没有错。它同时也承认了在不经审查的情况下使用该工具是具有风险的。

在 4 月 16 日的更新发布之前,理论上的风险就已经变成了被证实的漏洞。2025 年 12 月,BeyondTrust 旗下 Phantom Labs 的安全研究人员在 Codex 的 CLI、SDK 和开发环境集成中发现了一个严重的命令注入漏洞。攻击向量非常精准:在 GitHub 分支名称中嵌入恶意命令。当 Codex 在没有进行充分输入消毒的情况下处理该分支时,它会执行有效负载并泄露用户的 GitHub 身份验证令牌。由于这种攻击可以在共享仓库中自动执行,对企业的潜在影响范围非常大;单个受损的项目可能会传播给每一位贡献者。OpenAI 于 2026 年 2 月 5 日修复了该漏洞,距离 BeyondTrust 的首次报告已过去 50 多天。

关于 4 月 16 日公告的 Hacker News 讨论帖浮现出了一个更深层的结构性担忧。一位评论者精准地阐述道:在智能体(agentic)语境下,“数据实际上变成了可执行文件”。这并非比喻。当 AI 智能体能够阅读电子邮件、查看网页并根据其内容采取行动时,任何可见的内容都成为了潜在的指令。恶意攻击者不需要直接攻破智能体;他们只需要在智能体会读取的内容中放入提示词注入。这可以是一个智能体浏览的网页、一个它打开的文档,或者一个它看到的通知。攻击面不再由 AI 可以访问的内容定义,而是由 AI 可以感知的一切内容定义。

Hacker News 讨论中的第二个担忧是产品层面的信任问题。非技术用户通常期望 AI 智能体能像一名干练的行政助理一样工作,处理模糊的指令、推断意图并在不需要持续监督的情况下完成任务。根据讨论帖中的怀疑论者,目前的语言大模型在无监督的自主场景中并不能可靠地满足这一期望。营销语言(“在你工作时后台运行的智能体”)与处理模糊任务的实际可靠性之间存在差距,而这种差距在非开发者用户群中最为明显。

值得注意的是,Codex 的操作系统级沙箱架构(在 Linux/WSL2 上使用 bubblewrap (bwrap),在 Windows 上使用 Windows Sandbox)提供了比 Claude Code 的应用层钩子更强的进程隔离。沙箱限制了智能体向其工作区目录之外写入内容的能力,且网络访问默认是禁用的。但沙箱的存在本身就是一个信号:OpenAI 构建这些约束是因为不受限的桌面访问会产生真实的风险,而非假设的风险。

OpenAI 还推出了一款名为Codex Security 的独立产品, 该工具扫描了 120 万次代码提交,据报道发现了 10,561 个高严重性问题。其定位是相同的 agentic 层可以识别“其他 agentic 工具遗漏的复杂漏洞”。这种双重定位(利用 AI agents 提高生产力,同时利用另一种 AI agent 扫描由此产生的安全问题)准确地反映了行业现状。

Codex vs. Claude Code:竞赛背后的数据

基准测试的情况比任何一家公司的营销宣传都要复杂,理解其中的差异对于选择适合特定工作流的工具至关重要。

无论是 Codex 还是 Claude Code 都没能在所有维度上胜出;它们在不同领域各具领先优势,且差距大小取决于衡量指标。 在 SWE-bench(自主软件工程任务的标准基准测试)上,据报道 Claude Code 的得分为 72.5%,而 Codex 约为 49%。在这一被广泛引用的指标上,两者的差距非常显著。在衡量命令行任务性能的 Terminal-Bench 2.0 上,GPT-5.3-Codex 的得分为 77.3%,而 Claude Code 为 65.4%。GitHub Copilot 在 SWE-bench 上的得分为 56%,Cursor 为 52%;两者都落后于这两位领跑者,且关键在于,目前两者都不提供桌面级计算机使用功能。

这场竞赛的时间线与基准测试一样具有启发性。Anthropic 于 2026 年 3 月 24 日推出了 macOS 桌面控制功能。OpenAI 在三周后的 4 月 16 日紧随其后。更针锋相对的是:在 OpenAI 发布公告的两天前,即 4 月 14 日,Anthropic 发布了重新设计的 Claude Code 桌面应用,支持并行会话和自动化 Routines(可通过 API 或 GitHub 事件触发的定时工作流)。这一系列动作看起来并非巧合,更像是 Anthropic 预判了竞争对手的公告,并在 OpenAI 定调之前抢先塑造舆论叙事。

在产品差异化方面,这两款工具各有千秋。Claude Code 的 100 万 token 上下文窗口(在 Opus 4.6 beta 中)使其在大型代码库推理和多文件重构方面具有显著优势,而在这些任务中,窄上下文窗口往往会导致结果不完整或不一致。Codex 声称在同等任务下具有约 3 倍的 token 效率优势,这直接转化为大规模使用时的成本优势。目前 Codex 的插件生态系统拥有 90 多个集成,更为广泛,尽管 Claude Code 也支持相同的 MCP 标准且正在迅速扩张。

价格尚未成为差异化因素。这两款工具的基础方案均为每月 20 美元,高级方案均为每月 100 美元。OpenAI 推出了一项新的 $100 Pro 档位,4月9日专门针对重度 Codex 用户,提供比基础计划多 5 倍的使用量。Anthropic 的 Max 计划同样为 $100,以更高的限制提供对 Claude Code 的同等访问权限。价格战尚未开始,功能竞赛已经拉开帷幕。

来自 Cognition 的 Devin 仍然是市场上最完全自主的选择(它运行自己的 shell、浏览器和编辑器),但定位在企业端,被 Nubank 等公司用于大规模 ETL 重构,据称效率提升了 12 倍。对于个人开发者来说,Devin 并不是首要考虑的对象。对大多数从业者来说,真正重要的竞争是在 Codex 和 Claude Code 之间。

下一步计划

OpenAI 和 Anthropic 在 2026 年 4 月发布的产品代表了一个门槛的跨越:计算机使用 AI 已从研究预览版转向消费者订阅标准。未来六个月的发展将受到几种趋同压力的影响。

计算机使用功能集将不断扩展并标准化。Codex 的 Background Computer Use 目前仅限于 macOS;4 月 16 日的发布中未包含 Windows 支持,尽管 Codex CLI 通过 WSL2 支持 Windows。欧盟和英国市场已被标记为即将推出。随着两家公司都致力于实现跨平台的完全对等,桌面级 AI 控制将成为基准预期,而非差异化功能。问题将从“哪个工具具有计算机使用功能?”转向“哪个工具执行起来更可靠、判断力更好?”

多智能体协作是下一个架构前沿。OpenAI 和 Anthropic 都已经发布了并行智能体执行,这意味着多个智能体可以同时运行不同的任务。随后的挑战是智能体间的协作:不仅是平行的独立运行,而是智能体可以相互委派子任务、报告结果并在共同目标下进行协调。Anthropic 的 Routines 功能允许 Claude Code 由 GitHub 事件或 API 调用按计划触发,是朝这个方向迈出的早期一步。

非开发者市场是更大的增长向量。专业开发者已经是饱和的采用者;73% 的日常使用报告意味着该群体内的渗透率已接近天花板。增量市场是产品经理、设计师、内容策略师和运营团队,他们目前依赖工程排期来完成任务,而自主桌面智能体现在可以直接执行这些任务。这并非小众场景。Superhuman 让 PM 能够在没有工程干预的情况下发布代码更改,这是跨职能团队工作方式结构性转变的预演。

监管框架尚未跟上。欧盟 AI 法案和类似的治理结构是围绕生成内容或提供建议的 AI 设计的,而不是自主操作用户桌面的 AI。这种规模的消费级产品中的计算机使用 AI 是 2026 年的新发展。下半年,围绕智能体语境下的监督、责任和数据控制的政策讨论将加速,目前提供这些能力的公司将成为主要的参考点。

AI 编程智能体与通用 AI 智能体之间的类别界限正在被主动消除。The New Stack 将 OpenAI 的策略描述为构建一个“开发者超级应用”:将 Codex 作为整个开发工作流的操作层,而非一个狭窄的编程工具。这种定位正日益适用于 Codex 和 Claude Code。当 AI 能够控制任何应用、访问任何服务并跨会话保持记忆时,“编程智能体”这个称呼就显得保守了。正在构建的东西更接近于一个自主计算层。

当你的 AI 智能体无所不能时,如何保持方向感

Hacker News 上的一位评论者指出,在智能体语境下“数据实际上变成了可执行文件”,这揭示了一个比安全问题更普遍的现象。当 AI 编程智能体在你的整个桌面上运行时,其工作质量直接取决于它所能访问的上下文质量:你的文档、代码库规范、团队当前的优先级以及你过去的决策。

在缺乏结构化上下文的情况下运行的智能体,其决策会更差,产出的连贯性更低,并且需要更多的人工审查来发现错误。Temporal 和 Superhuman 所描述的生产力提升,不仅仅源于智能体本身的能力;它们反映了团队围绕智能体构建的组织支架:清晰的文档、明确的边界以及经过审查的输出。

对于在工作流中导航多个 AI 工具的开发者和知识工作者来说,构建一个可搜索的知识库,是技术栈中非预装的部分。随着 AI 编程智能体变得更加自主,它们所依赖的知识层(以及该层是有序的还是碎片化的)将决定这种自主性在多大程度上真正发挥作用。在智能体变得更强大之前,这才是现在值得思考的问题。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page