OpenAI 的 Codex Agents 如今主导其内部 AI Token 使用
OpenAI 表示,Codex 目前生成了其内部每周输出 token 的 99.8%。近期一则有关企业 AI 支出的 Google News 报道凸显了这一转变。
这一数字并不代表支出、营收或生产力。它衡量的是销售该技术的公司内部,由模型生成的文本片段——即输出 token。尽管如此,它仍反映出 OpenAI 员工使用 AI 的方式发生了重大变化。
ChatGPT 曾承担大部分内部 AI 工作。如今,能够执行更长任务并使用工具的 agent Codex,已主导工程、法务、财务和招聘等领域的活动。
关键竞争已不再是 OpenAI 与其他模型提供商之间的竞争,而是基于聊天的辅助与委托给 agent 的工作之间的竞争。聊天机器人会回答请求,而 agent 可以检查文件、调用工具、调整方法,并持续运行数分钟甚至数小时。
OpenAI 将这一转变视为富有成效的工作正向 agents 迁移的证据。同样的转变也让 AI 消耗变得更难预测、归因、保护和评估。
因此,企业买方面临的问题比 Google News 标题所暗示的更尖锐。他们必须判断,持续增长的 token 使用量究竟代表有价值的委托工作,还是一个成本高昂、只有活动却没有相应成果的循环。
OpenAI 的 Token 转变实际说明了什么
OpenAI 的内部数据表明,行为模式已发生决定性转变,但并不能证明每家企业都能取得相同结果。
OpenAI 于 2026 年 8 月 12 日发布了相关分析。该公司考察了个人客户、组织用户以及自身员工中的 Codex 活动情况。
截至 2025 年 8 月,OpenAI 普通员工分配给 Codex 的 token 不足其总量的 10%。在那段时期,ChatGPT 仍是内部 AI 使用的默认界面。
随着 Codex 获得更长时间的执行能力、更好的模型以及对并行任务的支持,使用格局发生了变化。OpenAI 表示,普通员工如今超过 85% 的输出 token 都通过 Codex 生成。
根据 OpenAI 的 agent adoption data,Codex 占公司每周输出 token 的 99.8%。这两个数字之间的差异很重要。
第一个数字描述的是普通员工在 Codex 与 ChatGPT 活动之间的使用构成。第二个数字反映所有生成 token 的总量,因此会受到重度 agent 用户的显著影响。
Agents 天然会比传统聊天生成更多 token。它们会反复读取上下文、规划行动、检查结果、调用工具并修订工作。
一名员工也可以同时运行多个 agents。因此,输出 token 占比衡量的是计算活动,而不是员工人数或已完成任务的直接数量。
OpenAI 最重度的内部用户说明了这种差异。到 2026 年 6 月,处于第 99 百分位的员工每天经常产生超过 60 小时的 Codex agent 回合。
这并不意味着一个人工作了 60 小时。它反映的是多个 agents 在并行运行,而人类操作者负责指导或审查这些工作。
在被抽样的个人用户中,较长任务也变得普遍。到 2026 年 5 月,80.6% 的用户至少提交过一项 OpenAI 估计相当于超过 30 分钟人工工作的 Codex 请求。
另有 70.2% 的用户提交过一项估计超过一小时的请求。还有 25.6% 的用户至少提交过一项估计超过八小时的请求。
这些估计涉及任务关联的人类工作量,而不一定是 agent 的运行时长或被消除的劳动量。OpenAI 的分类方法也无法证明每个生成结果都被采纳或确实有用。
即便存在这些局限,方向已很明确。用户正要求 AI 处理更大的工作单元,而不是请求孤立的答案。
一次聊天交互可能生成摘要、草稿或代码片段。一个 agent 则可以检查代码仓库、修改多个文件、运行测试、解读失败情况,并尝试修复。
这一差异解释了为何企业 AI 活动的增长速度可能远快于员工人数或消息量。每项委托工作都包含多次模型交互,而这些交互隐藏在一次用户请求背后。
这是此次事件的核心逆转。可见的提示词正成为工作中更小的一部分,而自主执行消耗的计算占比则越来越大。
对组织而言,这改变了 AI 采用的含义。统计许可证数量和消息数量,已无法描述模型参与运营工作的深度。
它也改变了风险边界。聊天机器人通常只是提出答案,而 agent 可以在互联系统中执行操作。
这种更广泛的权限意味着,权限设计、审计记录、审核关卡和成本控制都成为部署的一部分。它们不再只是次要的管理细节。
为什么 Google News 信号指向聊天机器人之外
Google News 的报道之所以重要,是因为 OpenAI 的数据将不断上升的 token 需求,与 agents 扩展到软件工程以外的领域联系起来。
Codex 最初是一款与编程相关的产品。工程师是最早将大部分 OpenAI 使用量从 ChatGPT 转向该 agent 的员工群体。
普通 OpenAI 工程师在 2025 年 12 月前后跨越了这一门槛。OpenAI 现在表示,普通工程师 99% 的输出 token 是通过 Codex 而不是 ChatGPT 生成的。
更具启示性的转变发生在其他领域。继工程师已经形成这一模式后,法务、财务和招聘人员大约在 2026 年 4 月转向以 Codex 为主的使用方式。
OpenAI 报告称,普通律师或招聘人员如今超过 85% 的输出 token 都通过 Codex 生成。这并不意味着这些员工大部分时间都在编程。
相反,Codex 已成为通用执行环境。非技术用户将其用于自动化、结构化分析、数据转换、调试和内部工具开发。
OpenAI 的职业构成数据强化了这一解释。业务职能员工生成的 Codex 工作中,超过四分之一属于工程或编程类别。
在财务和业务运营领域,工程或编程占已分类 Codex 输出的 31%。知识工作占 34%,财务分析占 16%。
对于产品、营销和运营员工,知识工作占已分类输出的 51%。工程或编程又占 25%。
这些类别表明,agents 正在降低从提出技术工作需求到直接尝试执行之间的实际门槛。它们并不说明专业人员已不再需要。
招聘人员可能会让 agent 将多个来源的数据转换为内部工作流。财务人员可能让它核对文件、构建可重复使用的分析流程,或测试一个小型工具。
员工仍要对上下文、判断、授权和审查负责。不过,执行路径可以包含代码,而无需采用传统的软件项目形式。
在 OpenAI 研究的三类人群中,非开发者的采用速度都很快。从 2025 年 8 月到 2026 年 6 月初,个人用户中的每周非开发者用户数量增长了 137 倍。
OpenAI 报告称,组织用户增长了 189 倍,其自身员工队伍中增长了 12 倍。这些倍数起点不同,因此不应视为相同的采用水平进行比较。
但它们仍支持相同的方向性结论。Agent 使用正在扩展到最初采用 Codex 的技术受众之外。
这一模式也符合 OpenAI 更广泛的企业报告。其 enterprise usage study 表示,ChatGPT 消息量增长了八倍,而每个 API 组织的推理 token 消耗同比增长约 320 倍。
这项早期研究涵盖的不只是 Codex。它包括 OpenAI 企业产品的汇总使用情况,以及对近 100 家组织中 9,000 名员工的调查。
OpenAI 还报告称,其企业客户超过 100 万家,工作场所席位超过 700 万个。近 200 家组织分别处理了超过一万亿个 token。
这些数据共同描绘出两条采用曲线。面向人的消息量正在增长,但集成式、多步骤工作流中的计算增长速度快得多。
这就是为什么聊天正成为衡量企业 AI 的不完整单位。一条消息可以启动一长串推理、检索、工具使用、验证和修订。
这一转变同时给多个团队带来压力。财务团队必须预测可变消耗。安全团队必须治理系统访问。管理者必须决定哪些工作值得持续投入容量。
员工也面临一种新的运营责任。运行许多 agents 可能看上去很高效,但并行活动并不等同于已完成且被接受的工作。
组织需要关于 agent 运行期间发生了什么的共享证据。一个可检索的 AI knowledge base 可以保留相关上下文,但无法取代权限机制或正式评估。
机会是真实存在的。Agents 可以帮助员工跨越技术边界,完成过去会滞留在其他团队队列中的任务。
管理挑战同样真实。企业必须识别哪些场景中的自主性能够产生可重复的价值,哪些场景只是在增加模型调用次数。
聊天辅助与 Agent 执行遵循不同的经济规律
Agents 将企业 AI 从主要由用户节奏驱动的服务,转变为一种消耗取决于执行行为的可变工作负载。
传统聊天对活动设有天然限制。人提出问题、等待答案、评估答案,然后决定是否继续。
Agent 执行消除了其中一部分停顿。系统可以选择下一步行动,将先前结果重新带入上下文,并持续运行直至达到停止条件。
每个循环都会增加输入 token,因为 agent 会重新阅读指令、文件、工具响应和累积的历史记录。输出 token 只反映了总工作负载的一部分。
长任务还会遇到分支。一个 agent 可能尝试一种实现方式、检查错误、修订计划,然后运行另一项测试。
这些重试可能富有成效,因为现实工作很少完全遵循一次成功的计划。当 agent 缺乏完成任务所需的信息、权限或能力时,它们也可能成为浪费。
这使得“最便宜的模型”成为成本控制中不完整的答案。能力较弱的模型每次调用可能消耗更少资源,但可能需要更多尝试和更多人工修正。
OpenAI 在其 AI investment guidance 中提出了这一观点。该公司建议衡量完成的任务、节省的时间、改善的决策以及可扩展的工作流。
该公司表示,GPT-4 到 GPT-5.4 期间,每百万 token 的价格下降了 97%。它还表示,GPT-5.6 在一项 coding-agent 指数中使用的输出 token 减少了 54%,完成任务的速度提高了 57%。
这些是 OpenAI 报告的基准测试结果,并非对每个客户工作负载的保证。公司的自身上下文、工具、评估标准和失败成本都可能改变结果。
单位成本下降并不必然降低总支出。使用量的增长可能快于效率提升,尤其是在智能体运行时间更长、并发执行时。
这种动态更像云计算,而非传统的软件许可。需求取决于运行时行为、工作负载设计、模型选择、上下文规模和重复执行情况。
它也带来了衡量问题。高 Token 数量可能意味着有价值的自动化、困难任务、不必要的上下文、反复失败,或一个无法高效停止的智能体。
独立研究让买方有理由谨慎看待消耗量。一篇研究编程任务的 2026 年论文发现,智能体工作负载使用的 Token 远多于代码聊天或代码推理。
研究人员报告称,在其实验环境中,消耗量差异最高可达 1,000 倍。同一任务的不同运行之间,差异最高可达 30 倍。
更多 Token 使用并未稳定带来更高准确率。性能往往在中等消耗水平达到峰值,随后随着消耗增加而趋于平缓。
该研究还发现,模型难以预测自身的 Token 需求。报告中的相关系数最高仅为 0.39,且估算值系统性低估了实际使用量。
这些发现来自一组特定的编程任务和模型。不应将其泛化为适用于所有企业智能体的通用倍数。
但它们确实说明,按每次提示词设定简单预算为何并不可靠。同一请求可能产生实质不同的执行路径和资源需求。
企业的应对已经显现。OpenAI 于 2026 年 6 月在其 Global Admin Console 中新增了 ChatGPT 和 Codex 积分消耗的整合视图。
管理员可以按用户、产品和模型查看使用情况。他们还可以通过公司的 支出控制工具 设置工作区默认值、群组限额和个人覆盖规则。
Databricks 在其 Unity AI Gateway 中引入了类似控制措施。该系统可以施加限制、检测失控消耗,并为适合的工作推荐成本更低的模型。
这一新兴控制层揭示了市场的发展方向。仅有模型访问权限,正变得不足以支撑企业部署。
组织需要围绕这种访问权限建立归因、政策、评估和干预机制。它们必须将消耗量关联到负责团队和明确的业务流程。
因此,最有力的衡量单位不是 Token,而是在既定质量、风险和审查要求下完成的结果。
对于编程智能体,这可能是通过测试和安全审查的已接受变更。对于财务工作,这可能是一份输入可追溯的已核对报告。
对于招聘,这可能是一项减少行政工作量、却不会对候选人作出未经授权决策的工作流程。每种结果都需要不同的证据。
这一经济模型有利于频繁重复且可被清晰评估的工作流程。它会惩罚那些成功与否依赖主观印象的模糊任务。
智能体转变并未让 Token 衡量变得无用。它让 Token 数量成为多个运营信号之一,而不再是商业价值的替代指标。
Token 数字无法证明什么
OpenAI 引人注目的内部采用数据展示了需求和强度,但生产力、质量与安全结果仍未得到解答。
第一个局限在于样本选择。OpenAI 是 Codex 的开发者,雇用了熟悉实验性 AI 的员工,并能为他们提供异常直接的产品支持。
其员工队伍并不能代表银行、医院、政府机构、制造商或小型企业。这些组织面临不同的技术和监管约束。
当客户将更高使用量解读为更深入采用的证据时,OpenAI 同样会受益。其数据值得关注,但读者应区分可测量的行为与该公司的更广泛预测。
第二个局限涉及将 Token 作为成功指标。输出量表明模型生成了文本或代码,却无法说明用户实际保留了多少成果。
智能体可能生成一个被开发者拒绝的大型补丁。它可能生成一份被员工重写的分析,或创建一项始终未能进入生产环境的自动化。
OpenAI 对长周期任务的估算也有类似保留条件。一项被归类为需要八小时人工工作的任务,并不自动节省八小时。
用户可能仍需花时间准备输入、监控运行、核查来源、解决错误,并整合结果。有些工作如果没有智能体,原本或许根本不会发生。
这种扩大的输出仍可能有价值。然而,避免的人工劳动只是可能收益之一,而且需要直接衡量。
第三个局限是可靠性。更长的任务会创造更多出错机会,包括过时假设、错误的工具选择,或影响后续步骤的早期错误。
能够访问企业系统的智能体还会扩大安全边界。有缺陷的回答固然有害,但未经授权的操作可能更难撤销。
因此,权限应与任务相匹配,而不是与智能体的最大能力相匹配。读取权限、写入权限、对外通信和不可逆操作应当分别控制。
安全团队还需要将人工请求与每项工具操作关联起来的记录。缺少这条链路,事件响应和问责都会变得困难。
成本监控可能带来另一种张力。公司需要足够的可见性来识别浪费和被盗用的凭证,但对员工进行细致监控可能削弱信任。
管理员可能需要知道某个工作流程反复调用昂贵模型,但并不一定需要不受限制地访问敏感内容。
良好的治理会尽可能将运营元数据与业务内容分离。它还会明确谁可以查看每一层信息,以及可在何种情况下查看。
第四个局限涉及超出编程领域的泛化。Codex 可以协助非开发人员,但 OpenAI 的数据仍显示,编程和工程是主要类别。
结构化技术工作提供了相对清晰的验证方式。测试可以运行,文件可以比较,错误可以触发再次尝试。
法律分析、招聘支持、战略和财务解读通常包含更多主观要求。由于自动验证较弱,错误可能存续更久。
随着智能体进入业务职能,这种差异使结果评估变得更加重要。企业不应假定采用速度等同于准备就绪程度。
公众态度已经转向强调这种区别。一篇于 7 月发布的 AI 支出分析描述了对“tokenmaxxing”日益增长的抵触情绪——即把高消耗量视为成就的做法。
Moody's 分析师 Vincent Gusdorf 警告称,AI 可能让组织轻易创造自己并不需要的工作。这一批评直指基于 Token 的地位信号的弱点。
当智能体产出有价值的结果时,高消耗可能是合理的。但如果没有负责人能将这项活动关联到已接受的结果,这种消耗就更难辩护。
正确的怀疑立场并不是认为智能体只是浪费资源的聊天机器人。OpenAI 的采用数据规模太大,不能以这种方式一笔勾销。
更站得住脚的结论更为有限。智能体扩大了 AI 能够尝试的工作量和工作范围,但有关已实现企业价值的证据仍不均衡。
因此,公司应在自身环境中检验 OpenAI 的论点。这需要基线、评估集、审查成本、失败率和可衡量的结果。
它还应将智能体工作流程与现实的替代方案进行比较。这些替代方案包括人工执行、传统软件、更短的聊天交互,以及更小的模型。
只有这样,领导者才能判断 Token 使用量上升代表的是杠杆效应还是摩擦成本。OpenAI 的内部比例无法替他们回答这个问题。
企业买方接下来应关注的三个信号
下一阶段将由结果报告、非技术人员留存和安全控制决定,而不是又一次创纪录的 Token 数量。
第一个信号是,供应商是否将智能体消耗与已完成的业务结果关联起来。当前的使用情况仪表板强调积分、用户、模型和趋势。
这些视图有助于管理员发现意外需求,但仍无法说明某个工作流程是否产出了被接受的结果。
买方应关注与获批代码变更、已解决支持案例、已完成分析或其他领域特定输出挂钩的报告。每个已接受结果的成本会让比较更有意义。
如果供应商能够提供可信的结果归因,OpenAI 的论点将更有说服力。当产生的价值清晰可见时,企业就可以为高消耗工作流程提供资金。
如果报告仍以 Token 和预估时间为中心,怀疑情绪将加剧。组织将难以区分高强度的生产性工作与高强度的失败工作。
第二个信号是工程领域之外对 Codex 的持续使用。OpenAI 报告称,法务、财务、招聘、营销和运营员工的增长十分显著。
下一个问题是,这些用户是否会在早期试验后继续使用。相比从较小起点快速增长,留存更重要。
企业应观察哪些非技术任务会变成可重复的工作流程。它们还应追踪专业人员需要多频繁地挽救或重建由智能体生成的工作。
在质量稳定的情况下持续使用,将支持 OpenAI 关于智能体让员工跨越职能边界的说法。留存下降则表明,最强的价值仍集中在技术团队。
第三个信号是围绕智能体操作的控制成熟度。支出限制正在迅速到来,但成本只是运营风险的一部分。
组织还需要任务级权限、审批检查点、可审计的工具调用、凭证隔离,以及当行为偏离既定边界时可靠终止的能力。
这些保障措施必须能跨多个模型和工具发挥作用。企业很少会永远将所有工作流程标准化到一家供应商。
这方面的进展将使更广泛的委派更容易获得正当性,尤其是在受监管行业。薄弱或碎片化的控制措施,无论模型能力如何都会拖慢采用。
这三个信号彼此关联。结果报告解释了智能体为何值得获得资源。留存表明员工在新鲜感消退后是否仍觉得它有用。
安全和治理决定组织能否允许该智能体执行具有重要影响的工作。三者缺少任何一项,都可能阻碍成功部署。
Google News 的标题捕捉到了从聊天转向智能体的真实变化,但 Token 份额只是故事的开端,并非最终得分。
OpenAI 已表明,其员工正日益将漫长而复杂的任务委托给 Codex。它尚未表明,99.8% 的输出 Token 带来了等比例的组织价值。
企业买方在庆祝或限制这种消耗之前,应当提出一个务实的问题:哪些已完成的结果因此成为可能,又有什么证据证明它们值得承担风险?
这个问题比单看 Token 数量提供了更好的指引。它让组织能够扩展有效的工作流程,约束偏离方向的流程,并根据结果而非活动来评判智能体采用。



