持续型 AI 同事标志着 OpenAI 提出的第三时代
- Olivia Johnson

- 6天前
- 讀畢需時 14 分鐘
尽管持续型 AI 同事目前仍更像一种愿景而非成熟产品,OpenAI 已勾勒出其产品的第三时代。这一说法通过一则 google news 标题触达了许多读者,但其影响远不止于又一项职场功能。
OpenAI 负责 Codex 和 ChatGPT Work 的产品负责人 Tara Seshan 在 8 月 30 日做客 Lenny’s Podcast 时介绍了三个阶段:首先是聊天,其后是能够完成任务的智能体,接下来则是持续型同事。
这一演进构成了核心张力。OpenAI 希望 AI 成为工作中的持续参与者,但可靠性、授权、记忆和团队协作等问题仍未解决。Anthropic、Microsoft 及其他企业级供应商也在推进类似理念,这场竞争的焦点是未来职场界面。
OpenAI 对第三时代究竟说了什么
OpenAI 对第三时代的界定,描述的是持续的工作关系,而非一名刚刚发布的自主员工。
Seshan 的评论出自一场关于产品开发、Codex、ChatGPT Work 以及知识工作者角色变化的访谈。这期播客时长约 82 分钟,于 2026 年 8 月 30 日发布。
她将 AI 产品的演进分为三个时期。第一阶段以聊天为核心,用户提出问题并获得回答。第二阶段引入了能够追求目标、完成多步骤任务的智能体。
拟议中的第三阶段涉及持续型 AI 同事。这类系统会持续连接项目、保留相关工作上下文,并在更长周期内开展协作。用户再次返回时,它们不会每次都从空白提示词开始。
Seshan 将这一阶段称为“可能很快到来”的方向,而非一个规格已经确定的成熟产品类别。这一区别很重要,因为最初报道将一场覆盖广泛的讨论压缩成了确定性的标题。
google news 的读者完全可能将该标题理解为 OpenAI 的正式公告。但原始来源支持更审慎的结论:一位高级产品负责人描述了她预期 AI 界面将走向的方向。
“持续”一词包含多种可能含义。它可以指跨会话记忆、持续执行、定期安排的工作,或对共享项目资料的访问。它也可以描述一种会定期与人类协作者核对进展的智能体。
OpenAI 尚未发布一个覆盖这一愿景各个部分的统一技术定义。相反,这场访谈将多项既有能力与一个尚未完成的产品方向联系起来。
ChatGPT Work 已能跨文件和已连接应用处理较长任务。Codex 可以在并行智能体之间分配技术工作。Projects 和同步对话则能在不同设备和会话间保留更多上下文。
这些组件指向持续性,但尚不足以真正打造一位 AI 同事。一名真正的同事必须理解不断变化的目标、识别组织边界,并解释自己做了什么。它还必须知道何时应当停止。
这一拟议界面改变了交互单位。聊天从一条消息开始,智能体从一项委派任务开始,而持续型同事则会从一项持续责任开始,并围绕它维持工作关系。
以产品发布为例。聊天助手可能会总结客户访谈;智能体可能分析这些访谈并起草报告;持续型同事则会跟踪发布进展、更新分析、标记矛盾之处,并参与后续规划周期。
这种持续角色使该理念比又一次聊天机器人升级更具影响力,也让不完整上下文或过度访问权限更容易造成错误。
因此,这一标题抓住了 OpenAI 的真实论点,却并不意味着转型已完成。第三时代是 OpenAI 正通过 Work、Codex、apps、记忆和协作界面逐步迈向的目标。
为什么持续型 AI 同事此刻重要
这一转变之所以重要,是因为 OpenAI 正从回答员工的问题,转向参与产出完整业务成果的工作流程。
OpenAI 于 2026 年 7 月 9 日推出 ChatGPT Work。该公司称,这一智能体能够跨应用和文件操作,持续处理一个项目数小时,并生成完成后的材料。
这些成果包括文档、电子表格、演示文稿、报告和网站。用户可以跟进进度、回答问题、调整工作方向,并批准重要操作。
这与在对话中生成文本不同。智能体必须收集信息、决定应采取哪些步骤、使用外部软件,并维持足够的状态以完成一项较长的任务。
OpenAI 的Work 公告将该产品定位为处理雄心勃勃任务的伙伴。这种表述开始接近持续型同事的论点,尽管 Work 目前仍围绕由用户发起的任务运作。
Seshan 还描述了一个较短的产品开发周期。她的团队会尝试为预计在两三个月内出现的模型能力进行设计。只针对当前能力设计会导致界面过时,而预测一年后的情况则会变得过于推测性。
这解释了为何 OpenAI 会在所有支撑能力尚未成熟前讨论第三时代。产品团队必须为仍在到来的能力准备交互模型。
这一时机也反映出 OpenAI 内部使用方式的变化。该公司称,Codex 已从主要服务工程团队的工具,扩展到法务、财务、招聘及其他部门的工作中。
据称,2026 年 5 月,超过 70% 的用户将原本需要人类超过一小时才能完成的工作交给 Codex。到 6 月,处于第 99 百分位的用户每天通过并行任务产生了超过 60 小时的智能体活动。
这些数据来自 OpenAI 自身分析,因此不应视为独立测量结果。但它们仍揭示了该公司认为具有战略重要性的行为模式。
Codex 使用情况研究称,2025 年 8 月后,非开发者的采用增长快于开发者。测量期内,OpenAI 内部的研究使用量也显著上升。
较长任务会对连续性形成压力。如果每次会话都需要重新构建项目、相关决策和组织约束,用户就无法高效监督多个智能体。
持续性承诺减少这种开销。能够记住已批准目标、近期工作和待解决问题的智能体,可以在更少解释的情况下恢复工作。共享上下文也让团队协作中的委派更加容易。
这类似于个人知识库的用途:当系统能在活跃工作中检索到恰当上下文时,已存储的信息才会真正发挥价值。
然而,组织记忆比个人检索更困难。公司内部存在相互矛盾的文件、不断变化的政策、访问限制和非正式决策。一位 AI 同事必须区分现行指引与过时材料。
团队还需要了解智能体从何处获得上下文。当审阅者无法追溯其假设,或无法确定哪一来源主导了决策时,再精美的产出也会失去价值。
因此,持续型智能体会给若干现有软件类别带来压力。项目管理系统必须容纳机器参与者,知识平台必须提供实时上下文,身份系统则必须表达委派权限。
业务应用同样面临新的界面问题:它们可以继续只是人们执行工作的目的地,也可以成为由智能体在监督下操作的服务。
这正是第三时代框架值得关注的原因。OpenAI 预测的不只是更好的回答,而是一个围绕持续目标来组织人员、模型、数据和工具的职场界面。
Google News 捕捉了这一说法,却没有呈现产品差距
google news 的表述让这一转变听起来已经完成,而 OpenAI 自己的表述则描述了一个仍有重大缺失环节的方向。
新闻聚合偏好简洁的宣言。“持续型 AI 同事是 OpenAI 的第三时代”比一场对未来界面、产品实验和模型规划周期的限定性讨论更容易传播。
这种压缩有助于发现信息,却不利于理解买家今天究竟能部署什么。
ChatGPT Work 可以执行耗时较长的任务,但任务并不等同于持久角色。Codex 可以运行并行智能体,但协调执行并不会自动形成共享的组织理解。
记忆也仍然比人类连续性更有限。系统可以保存对话历史或项目文件,却未必理解哪些过去的决定仍具有约束力。检索与判断是两个不同的问题。
在重复性工作中,这一区别尤为清晰。设想一个智能体根据访谈、支持消息、分析数据和工程笔记准备每周产品更新。
首次运行需要访问权限、指令、输出标准,以及对重要指标的定义。持续型同事应能在后续运行中复用这些设置,同时避免固化已经过时的假设。
它应当注意到发布计划何时发生变化,也应询问新指标是否取代了旧指标。它应保留早期证据,同时避免沿用不再适用的结论。
它还必须与多个人协调。产品经理、设计师和工程师可能会对优先级存在分歧。共享访问权限并不能告诉智能体,谁的指令应主导最终成果。
Seshan 将未来界面描述为多人协作模式。多组人员将在共享信息和工作成果的基础上,引导多组智能体。这一模式超越了一个用户指挥一个助手的熟悉范式。
多人协作带来了归属问题。必须有人知道哪个智能体创建了某项成果、哪位人类批准了它,以及哪个系统提供了底层数据。
当智能体收到相互重叠的职责时,冲突将不可避免。两个智能体可能编辑同一份演示文稿、联系同一位客户,或对一项政策作出不同解读。
软件团队已经通过版本控制、访问规则、审查和审计日志来处理类似协作问题。持续型同事也需要在结构较弱的知识工作中具备相应控制机制。
这有助于解释 Seshan 对“掌舵”和“划桨”的区分。智能体正越来越多地承担执行,而人们负责选择方向、评估取舍并作出带有判断力的决定。
这一比喻很有吸引力,但当执行过程难以审查时,掌舵可能需要投入更多注意力。一位监督多个不透明智能体的管理者,花在验证上的时间可能比亲自产出工作更多。
当 AI 生成完成材料时,这一风险尤为相关。错误可能在被发现前,就从一个回答进入电子表格、演示文稿、客户信息或运营系统。
因此,一个有用的常驻型协作者需要的不只是更长的运行时间。它还需要持久的上下文、明确的授权、可见的溯源、可控的行动,以及可靠的升级机制。
OpenAI 已拥有这套能力栈中的部分组件。ChatGPT apps 可连接外部信息源。Work 支持审批。Codex 提供结构化任务执行。企业级控制则限制用户可访问的资源范围。
产品缺口在于,如何将这些组件整合为一种可靠的协作关系,使其能跨越项目、人员与不断变化的条件持续存在。
通过 google news 进入这篇报道的读者,应将“第三时代”这一标签视为战略路线图。它并不证明一个通用型数字同事已经到来。
OpenAI 正在争夺协作者界面的主导权
核心竞争在于持久化 AI 协作与当前孤立、基于任务的智能体模式之间的较量。
OpenAI 最接近的对手并非某一家企业,而是当前占主导地位的交互模式:用户打开一个工具,分配一项任务,检查结果,然后重新开始。
这种模式限制了自主性,但也将故障控制在一定范围内。智能体获得的是临时上下文,在受限会话中运行,并且通常会在交付答案或成果后停止。
持久化会移除其中部分边界。智能体获得更多时间、更多上下文,并可能拥有更多访问权限。这些增加的能力可以提升实用性,但也会提高错误的代价。
OpenAI 希望通过连接聊天、知识工作与编程的产品,让持久化变得可控。Seshan 将 Chat、Work 和 Codex 描述为适用于不同类型活动的独立模式。
Chat 仍适用于搜索、分析和对话。Work 处理范围更广的知识型任务。Codex 则专注于软件开发与技术执行。
未来,常驻型协作者或许可以在这些模式之间切换。它可能先在 Chat 中讨论目标,通过 Work 构建分析,再让 Codex 创建配套自动化。
这条整合路径赋予 OpenAI 一项重要优势。该公司能够把广泛使用的对话界面,与智能体执行、开发者工具和工作场所数据连接起来。
不过,Anthropic 也在追求类似的长周期行为。其 Claude 产品强调跨会话记忆、延展性工作、编程智能体和企业工作流。
Anthropic 表示,Claude Opus 4.7 能够跨会话保持上下文,并管理持续多日的项目。与 OpenAI 的说法一样,这一描述来自供应商,仍需在具体环境中加以评估。
Microsoft 同样通过应用程序、企业身份体系和 Copilot agents 切入市场。它在 Microsoft 365 中的分发能力,使其能够直接接触文档、会议、电子邮件和组织权限。
这场竞争并不只是模型分数之争。谁能成为工作场所的协调层,谁就能影响智能体如何查看数据、请求审批并产出成果。
信任的重要性可能高于纯粹的自主性。企业买家需要能够反映既有身份体系、保留政策、监管义务及部门隔离要求的控制机制。
上下文质量同样重要。即使拥有广泛访问权限,模型仍可能选错文档,或遗漏某次未被记录会议中作出的决定。
这为在智能体行动前组织个人与团队信息的知识系统创造了机会。一套可靠的 AI workflow 需要清晰的信息源和审查节点,而不只是更长的提示词。
即使不讨论具体商业条款,OpenAI 的产品战略也在挑战传统的软件定价和使用模式。软件过去通常按人类用户席位销售。常驻型智能体会持续消耗资源,也可能跨多个应用执行工作。
供应商必须决定,智能体应被视为用户、集成、自动化,还是一个新类别。客户则必须确定谁拥有其产出,以及由哪个部门为底层活动付费。
这也是一场文化层面的竞争。基于任务的智能体符合既有的委派习惯。常驻型协作者则要求团队将软件视为承担持续职责的参与者。
这种转变需要新的管理实践。团队需要明确职责范围、审查产出、记录决策,并在职责变化时撤销访问权限。
OpenAI 可以提供界面,但雇主必须围绕它重新设计运营模式。如果组织无法说明最终由谁承担责任,采用进程就会停滞。
胜出的方案将让持久化显得可控。用户必须能够检查持续进行的工作、纠正假设、限制权限,并在不重启整个项目的情况下从错误中恢复。
这比做出令人印象深刻的演示有更高门槛。它要求系统在日常、混乱和对抗性的工作场所环境中都保持可靠。
持久化同时扩展能力与风险
每一项让 AI 协作者更有用的功能,也会让错误和攻击拥有更多时间扩散。
聊天错误通常只影响一条回复。常驻型智能体的错误则可能塑造后续决策,因为系统可能会存储、检索并以错误结论为基础继续构建。
错误记忆是一项担忧。智能体可能将初步决定保存为最终决定,保留过时的客户信息,或将某项指令关联到错误项目。
访问权限会带来另一项问题。一个需要跨电子邮件、文档、日历和内部数据库准备报告的协作者,必须拥有广泛可见性。若权限范围划分不当,这种可见性可能暴露敏感材料。
行动权限会进一步提高风险。读取客户记录不同于编辑记录。起草邮件不同于发送邮件。准备代码不同于部署代码。
常驻型协作者还会处理不受信任的内容。电子邮件、网站、文档和消息可能包含旨在通过间接提示注入操纵智能体的文字。
NIST 将智能体劫持描述为一种攻击:恶意指令出现在智能体处理的数据中。系统随后可能在自认为完成用户任务的同时,执行非预期行动。
在一项 NIST 评估中,重复尝试将选定攻击的平均成功率从 57% 提高至 80%。这些结果来自特定实验设置,并不代表所有已部署智能体。
这一发现仍揭示了持久化问题。长期运行的系统接触更多内容,相比短暂且孤立的对话,也为攻击者提供了更多机会。
NIST 的 agent security work 强调了间接提示注入、数据投毒、规格投机,以及在没有对抗性输入时发生的有害行动。该机构正在为单智能体和多智能体系统制定指导意见。
身份与授权成为核心防线。每个智能体都需要可识别的角色、受限权限,以及能够显示其在谁的授权下采取了哪些行动的记录。
常驻型协作者不应继承其主管拥有的全部权限。它应只获得完成所分配职责所需的最低访问权限。
审批检查点也需要具备上下文。若模糊的确认框隐藏了拟议行动、目标位置、涉及的数据及下游影响,就无法保护用户。
OpenAI 表示,ChatGPT Work 允许用户批准重要行动。这是一项有意义的控制机制,但该公司尚未证明每一项具有重大后果的工作场所行动都能被正确分类。
人工审查也有局限。频繁且低质量的审批请求会造成疲劳。尤其当智能体此前多次正确完成步骤时,用户可能会自动批准行动。
长工作流会使评估更加复杂。最终文档可能看起来准确,却依赖于数小时前引入的错误假设。审查者需要中间决策的溯源,而不只是最终成果。
持久化也带来隐私问题。有用的记忆需要保留,但不必要的保留会增加暴露风险。团队需要具备删除、纠正、过期以及项目间隔离的控制机制。
多人协作模式又增加了一层复杂性。一个智能体的输出可能成为另一个智能体的输入,从而形成一条链路,使最初的错误更难定位。
因此,组织应将常驻型协作者视为系统,而非模型来评估。测试必须覆盖连接器、权限、记忆、人工审批、可审计性和恢复行为。
OpenAI 已描述企业部署的安全与治理控制措施。然而,广泛的第三时代愿景尚未在典型组织中获得独立验证。
审慎的结论并不是常驻型智能体无法使用,而是持久化改变风险模型的程度,与它改变生产力模型的程度一样大。
google news 的标题强调的是目的地。企业采用将取决于证据是否表明,这条路径具备可靠控制、可衡量的故障率和清晰的责任归属。
三个信号将显示第三时代是否正在到来
只有当持久化、多人协调和可控自主性出现在真实部署中,OpenAI 的第三时代论点才会变得可信。
第一个信号,是一款能够跨数日维持项目状态、而无需用户反复重建上下文的产品。ChatGPT Work 已能延续长期任务,但持久协作者行为还需要更多能力。
应关注系统对记忆内容、持续具备权威性的来源,以及已存储上下文何时过期是否提供明确控制。纠正应当能够传播,同时不抹除问责所需的历史记录。
如果 OpenAI 推出带有可见溯源的这些控制机制,第三时代的说法便会获得支持。若持久化仍只是对话历史加上广泛检索,它与现有助手之间的差异仍将较弱。
第二个信号,是一个真正的多人协作界面。Seshan 描述了由多人引导多组智能体的模式,但大多数商业交互仍以一个人和一个活跃智能体为中心。
一个令人信服的实现应展示共享所有权、基于角色的指令、冲突解决、智能体身份和审查队列。它还应防止两个智能体在无声无息间覆盖彼此的工作。
该界面必须能在受控演示之外运作。团队应能看到是谁改变了方向、哪个智能体采取了行动,以及哪个成果代表已被接受的结果。
成功的多人协调将强化 OpenAI 关于 AI 正在成为协作者的论点。失败则会表明,智能体仍只是附属于个人账户的个人工具。
第三个信号,是有关可靠性与安全性的独立证据。供应商案例研究展示产品能够实现什么,但买家需要了解真实条件下的故障率。
应关注涉及提示注入、过时记忆、冲突指令、已撤销权限,以及工作流中断后的恢复的评估。审计应衡量具有实际后果的错误,而不只是任务完成情况。
监管与标准活动也会影响采用。NIST 正在研究智能体身份、授权、监控和安全控制。明确的标准将帮助客户基于共同预期比较不同系统。
竞争对手在这三个信号中的回应都很重要。如果 Anthropic 和 Microsoft 在 OpenAI 完成其整合愿景之前,提供更可靠的记忆、治理或协调能力,就可能削弱 OpenAI 的地位。
OpenAI 的优势在于其产品覆盖面的广度。它面临的挑战,是将 Chat、Work、Codex、apps 和企业控制整合为一种连贯的协作关系。
对知识工作者而言,实际问题并不是 AI 是否配得上“同事”这一称号。更值得追问的是:它能够承担哪些职责,而不会让监督工作比执行工作本身更困难。
应从一个可重复、可审查的工作流程开始。明确其信息来源、权限、审批节点和责任人。随后在多次运行中衡量纠正所需时间、遗漏的上下文以及具有实质影响的错误。
这一过程检验了 Google News 相关说法背后的实质。只有当持久化 AI 同事能够在保留上下文的同时不保留错误,它们才真正代表第三个时代。
它们必须能够协调工作而不模糊责任,并在不越权的前提下采取行动。在这些条件得到验证之前,OpenAI 所称的第三个时代仍是一项严肃的产品论题,而非已经完成的职场转型。


