top of page

长时间运行的 AI Agent 正在推高成本,而价值账并不简单

Google News 在 8 月 2 日抛出了一个直白的警告:长时间运行的 AI Agent,“计费表正在转动”。这一标题出现在《AI: Reset to Zero》第 1166 期。其矛盾很清楚:Agent 工作得越久,每一次规划、工具调用、重试和评估都会消耗资源。

这一警告出现之际,领先的 AI 公司正鼓励客户超越简短的聊天机器人对话。Google、Anthropic 和 OpenAI 现在都在描述能够跨应用运行、保留任务状态,并在用户离开后继续工作的 Agent。

更长时间的运行能创造新价值,但也改变了采购问题。买方必须衡量已完成的成果,而不是令人惊叹的演示或孤立的模型调用。如今的核心较量,是自主性与可问责性之间的较量。

这场较量之所以重要,是因为 AI 的经济单位正在发生变化。聊天机器人生成一个由人立即审核的答案。而 Agent 则可以启动多个流程、委派工作、检查结果,并重复失败的步骤。

每增加一个动作,成本或错误就多了一个可能被放大的环节。计费表衡量的不只是智能本身,也记录了系统在交付有用成果前尝试过的一切。

Google News 的标题实际传递了什么信号

重要的发展并非某一则新闻简报的标题,而是 Agent 运营成本正成为主流科技话题。

Google News 将《AI: Reset to Zero》的这篇内容汇入其 AI 模型报道之下。这样的展示并不意味着 Google 认同作者的观点。Google News 是发现与聚合平台,而非原始发布者。

不过,聚合仍然重要,因为它显示出哪些问题正在走出专业圈层。Token 消耗过去主要出现在 API 文档和工程仪表板中,如今它正在影响有关人力规划、软件预算和企业采购的讨论。

另一份名为 CO/AI 的简报也在其成本论述中使用了同样的计费表隐喻。其观点是,随着 AI 使用变得可见且可量化,受到补贴的智能时代正在结束。这篇文章将按量计费的 AI 描绘为可与人类工作进行经济比较的对象。

这种比较颇具挑衅性,但也可能造成误导。一个持续运行的 Agent 并不天然等同于一名员工。它无法独立承担组织责任、理解所有未明说的约束,或承受错误决策带来的后果。

Agent 还依赖于人力成本比较常常忽略的基础设施。它们需要模型、工具集成、身份控制、数据访问、监控、评估和升级路径。一项严肃的核算必须把这些支撑系统计算在内。

因此,这个标题只捕捉了故事的前半部分。没错,计费表正在转动。尚未回答的问题是:它衡量的是生产性工作、失败的探索、重复劳动,还是三者兼而有之。

这一区别,决定了一个 Agent 是有用的,还是一个昂贵的循环。一个系统可能连续活跃数小时,却几乎没有产生持久价值;另一个系统则可能通过一小段经过验证的操作,省去数天的人工协调。

持续时间本身并不能证明生产率。Token 数量也不能证明质量。即使任务已经完成,如果检查和修复输出所消耗的精力超过自动化节省的精力,它在经济上仍可能是负收益。

Google News 正在帮助更广泛的受众看见这一张力。讨论正在从 Agent 能否执行长任务,转向组织能否以经济上可控的方式治理这些任务。

长时间运行的 AI Agent 正在成为真实工作流

长时间运行的 Agent 正从实验室演示进入能够暂停、恢复并跨越组织边界的工作流。

Google 的 Agent Development Kit 说明了这一转变。2026 年 5 月的一份Agent 工作流指南描述了能够持续数周、同时保留状态的流程。

示例围绕员工入职展开。Agent 发送文件、等待签字、委派技术配置工作、跟踪硬件交付,并准备第一天的日程。

这不是一次漫长的模型回复,而是一个由活跃工作、已保存状态和闲置时段组成的持久工作流。Agent 必须知道哪些事项已经完成、哪些仍被阻塞,以及哪些操作需要审批。

这种架构改变了理解运营成本的方式。等待签字的 Agent 不应持续消耗模型资源;它应保存状态、暂停执行,并在经过验证的事件发生后恢复。

设计不佳的 Agent 可能恰恰相反。它们可能不必要地轮询系统、在每次中断后重建上下文,或反复要求模型解读未发生变化的信息。这些模式会把流逝的时间转化为本可避免的使用量。

编码场景中也存在同样的问题。Anthropic 描述了跨越多个上下文窗口工作的 Agent,因为规模较大的软件项目无法容纳在一次会话中。每次新会话都需要从前一次会话获得可靠交接。

Anthropic 的长周期 Agent 研究采用了初始化器和增量式编码流程。Agent 会留下说明已完成工作、并为后续会话提供指引的产物。

这些产物并非行政装饰,而是一种经济控制手段。清晰的任务台账可降低新会话重复分析、重新讨论已定决策或重建已完成组件的概率。

长时间运行的工作也受益于明确的测试。编码 Agent 需要一个客观信号来判断其改动是否有效。没有这一信号,模型可能继续修改一个正确答案,或自信地接受一个已损坏的答案。

科学计算提供了另一个具体案例。Anthropic 曾报告一个跨越约 2,000 个会话运行的编译器项目。其后续指南强调了进度文件、测试预言机和结构化编排对于多日研究任务的重要性。

这些例子展现了真实的能力,也揭示了为何计费表可能迅速加速。连续性需要反复构建上下文、验证和协调。Agent 为了在时间跨度中保持连贯,正在支付一笔运营税。

这笔税有时是合理的。一个原本需要数周专家投入的项目,可以承受可观的计算和审核成本;而常规行政任务的容忍空间则窄得多。

因此,“长时间运行的 AI Agent”涵盖了两个不同维度。其一是经过时长,包括等待所花的时间;其二是活跃的计算深度,包括推理、工具使用和重试。

企业买家必须将二者区分开来。一个持续两周的工作流,如果只在有意义的事件发生时被唤醒,可能很高效;一个十分钟的流程,如果进入失控循环,则可能十分浪费。

为什么 Agent 成本难以简单预测

当模型自行选择路径,而非遵循固定序列时,Agent 支出就会变得不可预测。

传统软件的执行模式相对稳定。一个请求进入,已知代码运行,系统返回结果。工程师可以依据流量和基准数据估计资源使用情况。

Agent 的行为则不同。它会规划、行动、观察和修正。两个相似请求可能产生不同数量的模型调用、工具调用、委派任务和验证步骤。

这种差异源于有用的灵活性。当网站发生变化、数据库返回不完整信息,或首次尝试失败时,Agent 可以恢复;固定自动化在同样条件下往往会停止。

灵活性也会带来波动。Agent 可能选择错误的工具、误读错误信息,或在不改变方法的情况下重试操作。一个错误的规划决策随后可能影响每一个下游步骤。

Google Cloud 在讨论其 Agent Development Kit 的可观测性时强调了这些风险。其监控指南列出了循环、重试、交接失败、意外成本和安全问题。

循环尤其能说明问题。模型可能将一次失败的工具调用理解为临时问题,并再次尝试。如果根本原因是缺少权限,重复多少次都无法解决。

人工操作员会识别出这种模式并升级处理。约束不足的 Agent 则会持续消耗资源,同时产生更多失败数据。自主性会将一个小型配置问题变成一笔浮动的运营账单。

多 Agent 系统会放大这一效应。规划者将工作委派给研究者,研究者将材料交给撰稿者,撰稿者再将输出交给评估者。每一次交接都可能增加上下文、延迟,以及一次新的误解机会。

评估者可以提升质量,但也会消耗资源。如果它给出模糊反馈,产出 Agent 可能修改整个产物,而非解决一个缺陷。评估循环随之扩大,却未带来成比例的改进。

Anthropic 在长时间运行的应用开发中测试了这一权衡。其多 Agent 框架在数小时会话中使用规划者、生成者和评估者角色。该系统生成的应用优于一次较短的单 Agent 运行。

不过,Anthropic 报告称,更完整的流程成本超过后者的 20 倍。这一结果不应被视为普遍比例,它展示了编排能够在多大程度上改变单项任务的成本结构。

关键比较并非孤立地比较完整框架与单 Agent。买家需要比较可用成果。一次廉价运行若产生无法使用的软件,几乎没有经济价值;一次昂贵运行仍可能胜过人工项目。

这就是为什么每 Token 效率无法终结这场讨论。能力更强的模型可能消耗更少 Token,因为它能更快走上正确路径;更便宜的模型则可能需要额外的重试、评估者和人工修复。

OpenAI 在其 2026 年 7 月关于AI 投资管理的指南中提出了这一观点。该指南认为,最低的 Token 价格未必意味着最低的总成本。

这一观察给模型路由器和企业平台带来压力。当较弱的决策造成更大的下游工作量时,将每个步骤都路由到最便宜的模型可能适得其反。

相反的策略同样浪费资源。将最强大的模型用于每一项分类、检索或格式化步骤,忽略了小型系统也能可靠处理的任务。

高效编排需要对任务敏感的路由。复杂规划可能值得使用更强的推理能力;确定性转换可能根本不需要生成式模型。高风险操作比可逆的研究步骤需要更多验证。

挑战在于,团队必须在尚未拥有太多生产数据之前设计这些策略。早期部署往往依赖基准准确率,但基准测试很少复现真实的工具故障、过期权限或含糊的内部指令。

这使企业面临预测缺口。他们知道单次模型调用的成本,却还不知道一项被接受的业务成果的稳定成本。

自主性与问责制才是真正的较量

只有当组织能够将每一项行动关联到负责人、目的、预算和结果时,长时运行的 AI Agent 才具备经济价值。

“AI:归零重置”这一标题将问题描述为一块持续跳动的仪表。只有当团队能够追溯是什么推动了这块仪表、又为何如此时,这一框架才具备可操作性。

Google Cloud 当前的 agent 可观测性 模型强调日志、指标和追踪。日志记录事件与错误,指标汇总延迟和 token 使用情况。

追踪可重建执行路径。它能够显示发生了多少次模型调用、选择了哪些工具,以及工作流在哪些位置发生分支。这些细节对于调试成本和行为都至关重要。

月度总额无法识别浪费的原因。同样的总额,可能代表十次高价值调查,也可能是数千次无意义的重试。汇总支出只能在事后提供控制。

按工作流进行追踪能够支持一个更好的问题:哪一系列步骤产生了被接受的输出?团队随后便可比较成功、失败和被放弃的运行,而不会将它们的资源消耗视为等同。

经济衡量单位应当成为经过验证的结果。对于编程而言,这可能是一项已合并且通过测试的变更;对于客户运营而言,这可能是一个已解决且未再次开启的案例。

对于研究而言,结果可能是一份在审查中经得起引用核验的决策备忘录。对于入职流程而言,则可能是一份包含所有审批记录的完整员工档案。

这种以结果为导向的方法也会改变内部激励机制。因降低 token 使用量而获得奖励的团队,可能会部署较弱的模型,进而带来更多人工收尾工作。仅因完成任务而获得奖励的团队,则可能忽视过度重试。

有用的指标应结合质量、成本与时间,也应反映风险。错误发送内部摘要的 Agent,与批准付款或修改生产基础设施的 Agent,风险并不相同。

自主性只应在证据支持的范围内提升。低风险任务可以容忍更广泛的探索;影响重大的行动则需要权限边界、确认步骤,并尽可能采用可逆执行。

Anthropic 将 Agent 定义为能够自行引导其流程与工具使用的模型。其 Agent 治理框架 强调,行为取决于模型、运行框架、工具和环境。

这一更广泛的视角对成本控制同样重要。强大的模型仍可能在配置不佳的运行框架中浪费资源。正确的计划也可能因工具暴露出不明确的错误而失败。

环境决定风险等级。拥有文档集合只读权限的 Agent 可以安全探索。连接到电子邮件、财务和部署系统的同一 Agent,则需要严格得多的限制。

问责制还需要持久记忆。工作流应保留决策、审批、来源和未解决的义务。然而,持久记忆也会引入自身风险,包括过时指令和被错误提升为事实的假设。

长上下文本身无法解决这一问题。将完整历史放入模型上下文窗口,可能增加处理量,同时使重要事实更难定位。保留更多文本并不等于拥有治理更完善的状态。

结构化知识层可以帮助将经过验证的决策与原始对话分离。对于知识工作者而言,个人知识库 能够保留源材料,而无需迫使每次 Agent 运行都重新阅读全部内容。

Agent 应只检索当前步骤所需的信息,也应记录每项关键决策所依据的来源。这种方法可降低上下文负载并提升可审计性。

因此,问责制并非自主性的刹车,而是使自主性在商业上站得住脚的基础设施。没有它,更长时间的运行大多只会扩大每项结果周围的不确定性。

仪表仍无法告诉买家的事情

使用数据可以揭示资源流向,却无法证明 Agent 创造了价值,或值得被授予更大的权限。

Anthropic 2026 年 6 月发布的 Economic Index 反映出使用模式变化之快。通过 Claude Code 和 Cowork,Claude 会话越来越多地包含长时运行任务。

该报告发现,更复杂的输出往往比简单回答消耗更多 token。与构建应用相关的对话,使用的 token 数量超过中位数对话的三倍。

报告还发现,token 使用量与所映射职业的经济价值之间存在关联。与薪酬较高工作相关的对话,往往包含更多输出、更多用户参与,以及略多的延展推理。

这些发现支持一种合理直觉:更困难的工作通常需要更多计算。若不考虑任务复杂度便削减使用量,可能毁掉价值,而非提升效率。

然而,相关性并不等于生产力的证明。被映射到高薪职业的对话,并不会自动产生与该职业市场价值相当的工作成果。

模型可能生成有用的草稿、错误的产物,或看似合理但需要专家验证的答案。token 消耗描述的是活动,而非用户仍需承担多少责任。

Anthropic 的报告本身提供了重要线索。即便 Claude 生成了更多输出,用户在高价值任务中的参与程度依然更高。这种模式更像是增强,而非对人力的完全替代。

这一发现使得将一个 Agent 席位直接与一个人类职位相比较变得更复杂。Agent 可能提升专家的产出,却仍依赖该专家进行指导、判断和问责。

因此,最佳部署方式或许仍是让人深度参与。领域专家可以定义验收标准、识别细微错误,并判断何时继续探索已不再值得其成本。

更长时的自主性不应被视为无条件目标。Anthropic 2 月的研究发现,在三个月内,最长的 Claude Code 会话已从不足 25 分钟增长至超过 45 分钟。

这近乎翻倍的时长表明能力和用户信任正在扩大,但并未说明额外的每一分钟都改善了结果。更长的会话可能既包含富有成效的持续推进,也包含低效的游移。

还存在选择偏差问题。用户可能会将更长的运行时间授予具有明确测试标准的任务,例如软件编译。涉及谈判、战略或模糊审美的工作,则提供较弱的停止信号。

拥有测试套件的 Agent 知道软件何时失败。起草战略文档的 Agent 则可能持续进行文风修改,因为没有二元判定器告诉它何时停止。

评估 Agent 提供了一种答案,但其判断可能与生成器共享相同弱点。Anthropic 曾指出,模型往往对自己的工作评分过于宽松,尤其是在主观任务上。

将生成与评估分离能够改善设计,但不会使评估变得客观。两个 Agent 仍可能更青睐流畅的语言而非事实深度,或接受同一项隐藏假设。

当错误会带来实质性后果时,人工审查仍然必要。审查负担必须纳入经济计算。否则,组织会将模型输出计作完成的工作,却掩盖验证它所需的人力。

安全性又增加了一个尚未定价的变量。长时运行的 Agent 会接触更多文档、消息、网站和工具响应。每一项额外输入都可能携带误导性指令或提示注入尝试。

更多工具访问权限会增加潜在损害。失控的研究循环会浪费计算资源;遭入侵的运营 Agent 则可能在任何人注意到之前泄露数据、发送消息或更改系统。

成本上限是有用但不完整的保障。工作流即便没有超出预算,也可能造成严重伤害。权限设计、行动确认和异常检测必须与资源控制协同运行。

因此,仅靠仪表无法回答最重要的管理问题。它可以显示 Agent 消耗了什么,却无法判断组织是否应当信任该 Agent 并交给它更多工作。

Google News 读者接下来应关注什么

下一阶段将由结果核算、持久执行,以及能够在真实生产故障下发挥作用的硬性限制决定。

第一个信号是,供应商是否公开每项经验证结果的成本。token 总量和模型调用次数是有用的工程数据,但买家需要与已接受结果挂钩的工作流级指标。

平台应区分成功、失败、重试和人工救援的运行,还应显示哪种模型、工具或分支对最终成本贡献最大。

如果这些控制机制成为标准,Google News 标题背后的论点将以更具建设性的方式得到加强。仪表将成为优化工具,而非警示灯。

如果供应商继续强调笼统的使用总量,企业团队将难以比较不同部署。他们可能会不加区分地缩减访问权限,因为无法识别哪些工作流正在创造价值。

第二个信号是持久执行模式的采用。Google 的暂停与恢复架构提供了一个示例。Agent 应在闲置期间持久化状态,并从经验证的事件恢复运行。

这一架构也必须能够经受故障。重新启动的进程应知道哪些行动已经发生,不应重复发送同一消息、重新打开已完成的工单,或重复执行外部交易。

进度账本、幂等工具和明确的审批记录不如模型智能那样显眼,却将决定长时运行的 AI Agent 能否在不制造运营混乱的情况下连续运行数日。

这些模式的更广泛使用,将支持长时自主性的论点。持续故障和重复行动则会削弱这一论点,无论基准测试如何改进。

第三个信号是可强制执行的资源和权限边界出现。一个在完成后报告过度消耗的仪表板,并非硬性限制。

团队需要能够在工作流超出预期步骤、重复工具调用、过于频繁地改变计划,或接近既定资源预算时暂停它的控制机制。

暂停应保留供审查的证据。运营人员需要看到 Agent 最后一个经验证状态、未解决目标、近期工具响应,以及升级处理的原因。

权限边界也应以同样方式运作。Agent 可以研究采购事项,但不能下单;可以准备电子邮件,但不能发送;可以提出部署建议,但不能修改生产环境。

如果平台能让这些边界变得简单且可靠,企业便可逐步授予自主性。如果控制机制仍是定制化工程项目,采用将集中于拥有大型基础设施团队的组织。

Google News 很可能会刊载更多关于 Agent 替代任务、连续工作数小时以及跨软件运行的报道。读者应越过时长表象,追问是什么让工作流停止。

它是因为目标得到验证而停止,因为有人批准结果而停止,还是因为预算耗尽而停止?这些是具有实质差异的结果。

仪表这一隐喻很有用,因为它让隐藏的消耗变得可见。它的弱点在于,将复杂工作简化为一个不断累积的数字。

成熟的 Agent 市场需要多块仪表。一块应追踪资源,另一块应追踪已接受结果,第三块则应追踪风险、人工干预和可逆性。

知识工作者可以通过保留智能体所需的源材料和决策记录来做好准备,而不是为每项任务重新构建上下文。一个可搜索的第二大脑能让这类交接更具针对性,也更便于审计。

实际问题已不再是长时间运行的 AI 智能体能否持续工作。Google News 让一个更棘手的问题进入公众视野:在计费停止之前,是否有人能解释清楚该智能体究竟完成了什么?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page