OpenAI 将 AI 副驾驶推向日常工作流程之外
- Sophie Larsen

- 6月12日
- 讀畢需時 9 分鐘
OpenAI 发布了新功能,使其副驾驶超越对话,直接进入工作流操作。此次更新允许模型创建文档、更新电子表格,并在常用办公套件中触发自动化。此举将 OpenAI 置于与成熟生产力平台直接竞争的位置。
这一变化到来之际,许多团队已在测试 AI 用于日常工作。早期试点显示,基础任务可节省时间。然而,相同试点也揭示了模型在缺乏监督时反复出错的问题。那些在没有结构化审查流程的情况下匆忙采用 AI 的组织发现,一旦纠错周期累积,速度优势迅速消失。最终结果往往让团队质疑,生产力承诺是否值得增加的监督负担。能力与控制之间的这种张力,定义了当前企业 AI 部署的状态。
真实世界的部署进一步说明了这一模式。一家中型咨询公司将报告生成时间从四小时缩短至九十分钟,但前提是对每项财务预测实施强制人工检查点。另一家物流公司的试点在共享仪表板上自动化了发货状态更新,却需要额外三名全职人员来审核偶尔错误分类交付异常的模型生成摘要。这些例子强调了为何原始速度若无经过深思熟虑的流程再设计,很少能转化为可持续收益。
OpenAI 推出工作流操作
OpenAI 添加了操作端点,允许副驾驶编辑文件并调用外部服务。用户为每项任务授予有限权限。系统记录每一步以供后续审查。
团队可通过 ChatGPT Enterprise 和 API 层级的更新获得访问权限。这些功能从五月底开始分阶段推出。早期测试者报告称报告和幻灯片草稿的起草速度更快。这些早期报告来自内部数据治理已较为完善的组织。缺乏此类基础的团队在尝试扩展相同功能时遇到了更多摩擦。
这些举措标志着从仅聊天界面的明显转变。OpenAI 现在将模型定位为日常输出的积极参与者。这一转变类似于早期平台变化,即文字处理器从独立的桌面工具转变为可自动触发下游工作流的云连接套件。在这两种情况下,核心价值主张都集中在降低知识工作者的上下文切换成本。然而,这一转变也引入了围绕意外更改和可审计性的新风险类别。
分阶段推出本身提供了关于企业优先事项的线索。初始可用性侧重于文档和电子表格操作,随后扩展到日历和 CRM 触发器。这一顺序表明 OpenAI 认识到财务和日程数据比叙述性内容具有更高的合规风险。据与企业客户分享的内部基准显示,一旦权限范围稳定,任务完成时间可减少 40%,但相同数据也显示在前六周使用期间,下游验证时间增加了 12%。
除了最初的企业渠道外,OpenAI 还通过定向开发者预览扩展了访问权限,允许技术团队在广泛可用之前使用自定义操作模式进行实验。这种方法有助于发现多租户数据隔离和跨区域延迟等边缘情况,这些情况会使更大规模的部署复杂化。这些预览的反馈促使 OpenAI 引入与常见 SIEM 平台兼容的细粒度审计导出格式,展示了其对安全团队面临的运营现实的响应能力。
OpenAI 的操作端点如何工作
该技术架构依赖于范围化的 OAuth 式权限,并结合对不可逆步骤的明确用户确认。当模型提出操作时,界面会显示一个预览面板,突出显示电子表格中更改的单元格或文档中修改的段落。用户可以在执行前批准、拒绝或编辑拟议更改。在后台,OpenAI 会记录每个决策,包括时间戳、模型版本标识符以及用于生成建议的确切提示上下文。
开发者可以通过 Assistants API 注册自定义工具来进一步扩展此系统。销售运营团队可能会公开一个端点,从其 CRM 中提取最新的管道数据,并将摘要指标写入共享仪表板。然后,模型可以在起草季度业务审查时引用该仪表板。由于每个工具注册都需要明确的模式定义,组织可以对离开其环境的数据以及模型可能启动的操作进行细粒度控制。
除了基本的 CRUD 操作外,端点还支持条件逻辑。可以指示模型标记而非执行任何预计收入超过预定义阈值的行,将项目路由以供人工批准。该架构还包括速率限制默认值,以防止失控的自动化循环,这是早期企业测试者在一次试点意外触发数百个重复日历邀请后请求的功能。这些分层控制说明了 OpenAI 如何尝试在基础设施层面平衡自主性与问责制。
另一项安全措施涉及沙箱执行环境,该环境将模型发起的更改与生产数据隔离,直到最终批准。在一次与医疗保健相关的合规试点中,此机制被证明很有价值,当时临时计算需要在合并到患者调度系统之前进行审查。沙箱还记录拟议状态与最终状态之间的差异变化,为审计员提供更清晰的洞察,了解人工编辑如何改变了模型建议。
知识团队面临更高风险
销售、产品和运营团队面临最大压力。他们处理大量可重复的文档和更新。任何监督时间的减少都将释放出用于客户工作的能力。
财务和法律团队行动较慢。他们引用要求对每项更改进行人工签字的审计要求。他们当前的工具已包含严格的版本控制。采用速度的差异造成了内部分歧,一些部门以 AI 增强的速度运行,而其他部门则维持传统的审查周期。随着时间的推移,除非治理框架弥合差距,否则这可能导致流程碎片化。
承诺与当前实践之间的差距集中在验证步骤上。管理者希望获得速度而不增加新的审查负担。OpenAI 必须展示其操作日志如何适应现有的合规流程。许多企业已经在运行期望机器可读日志的治理、风险和合规平台。如果没有直接馈入这些系统的原生连接器,组织就必须构建自定义 ETL 管道,以维持其现有的审计态势。
跨部门试点揭示了额外的摩擦点。营销团队通常优先考虑创意输出量,并接受更高的事实偏差容忍度,而运营团队则通过影响客户体验的下游错误率来衡量成功。在单一 AI 治理政策下协调这些不同的成功指标需要高管赞助,通常需要六到九个月的迭代政策完善。
一家跨国零售商将副驾驶应用于区域仓库的库存对账。销售组织庆祝每周报告时间减少了 35%,但财务团队花费了同等时间将模型生成的预测与法定报告标准进行对账。由此产生的紧张局势促使成立了一个联合 AI 指导委员会,该委员会现在每两周开会一次,以协调可接受的风险阈值。
根据 彭博社关于企业 AI 采用的报道,将自动化与专用监督角色相结合的公司比那些仅专注于速度的公司实现了更持久的收益。
防护措施与原始能力
OpenAI 声称新控制措施为团队提供了足够的监督。批评者指出,这些控制措施仍依赖于操作运行后的手动检查。这在广告宣传的自主性与日常使用之间造成了差距。
采用早期副驾驶的团队报告称,花费额外时间纠正模型输出。这些纠正通常涉及模型遗漏或虚构的事实。此处的防护措施不仅仅是权限设置。有效的防护措施还需要持续监控模型漂移、定期根据真实数据进行校准,以及在出现异常时定义升级路径。
核心张力在于模型主动性与持久上下文需求之间。无法访问用户完整历史的模型会重复问题并错过过去的决策。持久记忆成为可靠主动性的先决条件,而非可有可无的功能。没有它,每次新会话都会重新启动上下文收集过程,侵蚀工具所承诺的效率提升。
进一步 complicating 采用的是,遗留企业身份提供商有时会施加会话超时,从而中断长时间运行的代理工作流。当模型操作跨越多个应用程序时,重新身份验证提示可能会破坏审计日志旨在保留的保管链。尝试联合身份联合的组织已开始试点短期服务账户,这些账户的范围仅限于 AI 代理,以减轻这种摩擦。
真实使用显示差距
一个营销团队测试了自动活动简报生成。模型提取了最近的会议记录,但省略了几周前设定的预算限制。草稿在分发前需要两轮修改。
另一组尝试了与 CRM 数据关联的电子表格更新。模型在国际条目上应用了错误的汇率。仅在人工审查发现错误后,一行代码更改才解决了问题。
这些案例说明了为何仅靠原始能力是不够的。员工需要一个能保留长期上下文而无需反复提醒的代理。当团队必须不断重新提供缺失的细节时,自动化所承诺的时间节省就成了幻觉。
法律文档工作流中的其他试点显示,模型有时会插入过时的监管引用,因为它们无法访问公司最新的内部政策更新。在一个实例中,一项引用已废止税务条款的合同条款直到外部律师进行最终人工审查时才被发现,导致整个交易延迟了四天。此类事件强化了,具备操作能力的副驾驶必须嵌入持续更新的知识库中,而不是在静态训练数据上运行。
上下文工具填补差距
remio 将会议、文档和电子邮件存储在单一记忆层中。它允许用户请求报告,并接收已反映先前决策的输出。任务之间不会发生会话重置。
差异体现在研究工作流程中。用户可以请求对数月笔记进行综合,并获得准确的参考。通用副驾驶通常每次都需要再次提供相同的上下文。经过多次迭代,这种上下文税会累积成显著的生产力流失。
使用两个系统的团队报告称 remio 减少了验证负担。持久记忆充当了许多工作流程仍然缺乏的护栏。下载 remio 以在您自己的文件上测试上下文感知代理。
企业的实际影响
采用具备行动能力的副驾驶将改变预算编制、人员配置和合规规划。财务团队现在不仅需要预测软件许可成本,还需预测验证人工和潜在返工的内部成本。人力资源部门面临围绕提示工程和 AI 输出审计的新技能要求。法律部门需要更新政策,以规范在客户交付物和监管备案中使用自动化内容的许可范围。
将副驾驶视为简单效率工具的组织,可能会低估这些次要影响。而那些及早建立专门 AI 治理角色的组织,则能更好地捕捉收益,同时控制下行风险。早期采用者通过建立跨职能 AI 委员会,报告称政策迭代周期比仅通过现有 IT 指导委员会管理治理的同行快 30%。
局限性与风险
当前的行动端点仍缺乏健壮的回滚机制。一旦电子表格公式被覆盖或邮件被安排发送,撤销更改通常需要手动重建。实时工作流任务的错误率尚未公布。公开基准侧重于聊天准确性,行动成功率仍不透明。当模型在没有标准化日志格式的情况下处理财务或 HR 数据时,监管审查可能会加强。影响员工薪酬或供应商付款的自动化决策所涉及的法律责任问题,尚未在法庭上得到检验。
与竞争对手的比较
Microsoft Copilot 直接集成到 Microsoft 365 租户中,基于图的上下文可覆盖电子邮件、日历和 SharePoint。Google Workspace 在 Docs 和 Sheets 中提供类似的工作流操作,并具备强大的实时协作功能。这两个生态系统都受益于更深层的数据驻留控制,这是一些企业更青睐的。OpenAI 的优势在于模型质量和 API 灵活性,但它必须依赖第三方连接器来对接许多企业系统。由此产生的架构增加了集成表面积,从而提高了权限或身份验证失败的概率。
最近的 Google Workspace update 强调了在规模化部署代理功能时,对实时协作控制的类似重视。
值得关注的信号
关注下一次季度更新中的企业采用数据。活跃席位的上升将表明团队接受了当前的护栏。数据持平则表明验证摩擦仍居高不下。
跟踪竞争对手的响应。Google 和 Anthropic 可能会发布类似的行动功能。其监督工具的速度和质量将影响买家的选择。
监控与现有合规平台的集成深度。与 Salesforce 或 NetSuite 等工具的深度链接可减少手动交接。浅层链接则将审查负担留在用户身上。
根据 The Verge 的行业分析,优先进行深度合规集成的组织,比依赖手动审计流程的组织,能更快实现生产力指标的稳定。
团队的后续步骤
知识工作者可以在相同任务上同时测试原始副驾驶和上下文优先的代理。结果将揭示护栏在哪些环节增加的价值最大。持久记忆往往是重复工作流中缺失的关键部分。
准备好减少重复上下文共享的团队可以从免费层级开始。付费计划将解锁更深的连接器和团队记忆层。
FAQ
团队多久能看到可衡量的节省时间?
已保持良好数据卫生的团队,通常在第一个月内就能看到日常文档工作减少 15–25%。数据源分散的团队往往需要三到四个月的清理工作,才能出现类似的收益。
OpenAI 是否存储它编辑的文件内容?
文件保留在用户环境中。OpenAI 仅接收执行已批准操作所需的最小上下文。企业可以通过 Azure OpenAI 或专用私有实例路由流量来强制执行数据驻留。
当模型做出错误更改时会发生什么?
大多数操作支持宿主应用程序内的版本历史,允许手动回滚。组织仍应实施自动备份策略作为额外保障。


