top of page

AI 投资回报陷阱:任务层面的收益可能掩盖企业成本

Google News 在 2026 年 8 月 6 日呈现出一场尖锐的 AI 分歧:企业报告工作效率更高,但许多企业仍无法将这些收益与财务回报联系起来。相关标题聚焦于一种 AI 投资回报陷阱,即狭窄的成功指标掩盖了贯穿整个工作流程后才显现的成本。

这种张力之所以重要,是因为可信的研究确实显示,生成式 AI 带来了可量化的改善。客服人员解决更多问题,开发者完成更多任务,顾问也能更快完成工作。这些发现是真实的,但它们衡量的是受控活动,而不是运营一家由 AI 赋能的企业所涉及的完整经济账。

正在浮现的对立面并非 AI 支持者与 AI 怀疑者之间的对抗,而是任务层面的生产力与企业层面价值之间的矛盾。一种工具可以提升某位员工的产出,却可能在其他环节增加审核、集成、治理和协同成本。

真正的考验在于,更快的工作是否改变了收入、运营费用、客户结果或组织能力。如果这些影响从未反映在财务报表中,那么生产力主张仍是有用的证据,但并不是完整的回报计算。

Google News 的标题指向一场更广泛的衡量之争

AI 投资回报的争论已从生成式 AI 是否有效,转向企业是否在衡量其完整的经济影响。

Google News 的标题并非产品发布或季度公告。它反映了强有力的局部生产力证据与薄弱的企业整体财务证据之间日益扩大的冲突。这种冲突如今正影响技术预算、劳动力规划和高管预期。

这种差异始于衡量单位。许多 AI 评估考察的是个人完成一项明确任务,例如起草文本、编写代码或回复支持请求。企业回报计算则必须追踪由此产生的工作在每一个依赖流程中的表现。

更广的视角会改变何为收益。节省初稿撰写时间的价值有限,尤其当节省下来的工时没有被重新利用时。若企业能增加产出、缩短交付时间、避免新增招聘,或将员工重新配置到更高价值的工作上,其价值则会更大。

同样的规则也适用于质量。模型可以在每小时生成更多内容,却同时增加事实审核、政策审核或客户补救工作。只衡量产出而不衡量纠错成本,可能让昂贵的工作流程看上去很高效。

受控研究为认真对待生产力收益提供了充分理由。一项 NBER 现场研究考察了 5,179 名使用生成式 AI 助手的客服人员。使用该工具后,平均每小时解决的问题数量提高了约 14%。

这种影响并不均匀。经验较少、技能较弱的客服人员获益更大,而经验最丰富的员工提升较小。该助手似乎将部分与高绩效员工相关的工作方法传递给了新员工。

这一结果具有直接的商业意义。更快的问题解决速度可以提升客服能力、减少等待时间,并改善服务一致性。然而,生产力指标本身并未揭示部署和维护该系统所需的全部成本。

企业仍需准备知识内容、连接系统、保护客户数据、监控输出、培训员工并更新工具。它还必须处理那些看似合理却并不正确的答案。这些活动会消耗人力和基础设施,即使它们不出现在客服团队的仪表盘上。

软件开发领域也存在类似证据。Microsoft、Accenture 和一家未具名《财富》100 强公司的三项随机现场实验涵盖了 4,867 名开发者。综合结果显示,配备 AI 编程助手的开发者完成任务的数量提高了 26.08%。

同行评审的开发者实验同样发现,组织和员工之间存在差异。经验较少的开发者更频繁地采用该助手,获得的收益也更大。

完成的任务具有意义,但仍只是中间指标。完整的业务评估还必须考察缺陷率、安全发现、维护需求、审核时间和交付结果。更多代码只有在有助于构建可靠产品时才有价值。

因此,Google News 的表述揭示了一个衡量边界。研究可以证明某种 AI 工具改善了一项明确活动,但无法证明每一次部署都能带来正向的企业回报。这两种结论可以同时成立。

这构成了 AI 投资回报故事中的第一次反转。模型性能的提升让衡量变得更难,而非更容易。企业如今可以发现真实的生产力收益,却仍可能忽略决定这些收益是否具有财务意义的成本。

任务层面的 AI 生产力并不等同于企业投资回报

只有当组织通过能力、成本、收入或风险的变化捕获生产力收益时,它才会转化为财务价值。

投资回报将一项计划创造的价值与其完整成本进行比较。对于企业 AI 而言,这一计算的两端都包含任务层面研究无法解决的假设。

设想一名员工过去需要花十小时准备一份定期分析。AI 助手将这项工作缩短至七小时。企业衡量出了三小时的潜在产能,但并未自动减少一项支出。

这名员工可能将这些时间投入另一项有价值的工作。团队可能无需增加人员就能处理更多请求。企业也可能更早交付分析,从而做出更好的决策。

每一种结果都具有不同的经济价值。如果组织没有做出任何运营调整,这三小时仍只是生产力估计,而非已实现的节省。将员工的时薪赋予每一小时节省下来的时间,会高估回报。

相反的错误也会发生。当财务报告只计算即时的人员削减时,可能会低估 AI 的价值。更高质量的工作可能改善客户留存、缩短周期时间,或增加团队可以开展的实验数量。

这些收益需要明确的结果指标。客服团队可以追踪问题解决情况、重复联系、升级处理、满意度和留存率。工程团队可以考察部署频率、交付周期、事故、返工和产品交付。

知识型工作更难衡量,因为其产出往往会经过多个人。一份更快完成的研究摘要可能加速决策,也可能只是更早地进入另一个人的待办队列。局部速度并不保证系统整体速度。

哈佛商学院研究人员通过一项涉及 758 名顾问的实验,说明了任务衡量的优势与局限。参与者在写作、分析、创造力和说服任务中使用了生成式 AI。

这项顾问研究发现,使用 AI 的人员完成任务的速度提高了 25.1%。在模型能力范围内的任务上,他们的工作质量评分也提高了 40% 以上。

不过,该研究也描述了能力边界。当参与者依赖模型处理超出该边界的任务时,其表现会受损。更快的产出并不能避免他们自信地采用不合适的答案。

这种模式使企业仪表盘的解读更加复杂。平均节省时间可能看起来很可观,但少数代价高昂的错误就可能抵消部分收益。合适的指标取决于出错的后果。

一份存在缺陷的内部草稿可能只需几分钟即可修正。一则存在缺陷的客户沟通内容则可能引发投诉或退款。不正确的法律、医疗、安全或金融内容可能带来更严重的后果。

这意味着,诚实的 AI 投资回报模型至少需要四层结果指标。

首先,它应衡量即时任务。相关指标包括完成时间、吞吐量、采用率、准确性和员工投入。这些指标揭示工具是否改变了工作完成方式。

其次,它应衡量完整工作流程。这包括交接、审核队列、返工、升级处理以及关联团队中的延误。一个环节的收益可能在下一个瓶颈处消失。

第三,它应衡量业务结果。这些结果可以包括收入、运营能力、客户留存、质量和可避免的损失。这一层将运营变化与组织价值联系起来。

第四,它应纳入经风险调整后的成本。安全控制、模型错误、合规工作、对供应商的依赖以及事件响应都应纳入计算。忽略它们,就是将不确定性视为无成本。

企业还需要可信的基线。团队经常在衡量旧流程之前就部署助手。之后,他们会将新工作流程与对过去工作耗时的非正式记忆相比较。

基线应在部署前记录工作量、人力、质量、等待时间和例外情况。它还应考虑季节性变化和无关的流程改进。否则,AI 系统会因并非由其造成的变化而获得功劳。

这正是为什么 Google News 对 AI 投资回报的关注不仅反映高管的不耐烦。这些争论涉及归因,也就是确定哪项干预措施导致观察到的结果。薄弱的归因会让仪表盘沦为有说服力的叙事,而非可靠的证据。

当 AI 超越试点阶段,隐性成本会不断增加

最大的 AI 成本往往出现在成功演示之后:当受控工具变成需要维护的生产系统时。

试点预算通常强调模型访问权限、有限的集成以及小规模用户群。进入生产阶段会改变成本结构,因为组织必须支持真实数据、真实权限和真实后果。

数据准备是一个主要类别。企业信息可能存在重复、过时、标签不一致,或受角色限制的问题。将 AI 系统连接至这些信息需要数据清理、访问控制、保留政策和持续的责任归属。

集成带来了另一层成本。一个有用的助手很少独立运行。它可能需要接入身份系统、客户记录、文档库、工单平台、分析工具和审批工作流程。

每一项连接都可能失败或发生变化。供应商会更新接口,内部架构会演进,业务流程也会出现新的例外。维护因此成为持续性工作,而非一次性实施任务。

评估同样需要资金和时间。模型在通用基准上的得分无法证明其能否在某家企业的数据和决策场景中可靠运行。团队需要有代表性的测试集、故障类别,以及与运营风险相关的阈值。

评估不能在上线时停止。模型版本、提示词、检索来源和用户行为都会变化。一个在试点期间表现可接受的系统,可能随着环境变化而逐渐偏离预期。

人工审核是另一项隐性投入。许多组织称 AI 能节省人力,却同时安排员工检查每一项重要输出。这种审核可能是必要的,但其耗时应计入总成本。

审查也可能带来沉重的认知负担。人们必须在阅读通常正确的材料时保持专注。在流畅文本中发现罕见但后果严重的错误,可能比直接给出常规答案需要更多集中力。

接下来是返工。纠正可能不只是编辑一条回复。团队可能需要追溯来源、更新提示词、更改检索文档、通知用户,并重新评估类似输出。

安全与隐私控制也会增加工作量。员工可能会将机密信息输入未经批准的工具,而获批系统则需要身份管理、日志记录、数据边界和事件处置流程。

因此,治理是一项运营职能,而不是一份政策文件。必须有人决定允许哪些用途、需要哪些证据、由谁承担剩余风险,以及系统何时应停止运行。

基础设施成本也可能随使用方式而变化。AI 工作负载因模型、上下文大小、输出长度、检索活动和请求量而异。一个提示词可预测的试点,未必能代表数千名员工使用时的行为。

智能体会使这一挑战更加突出。AI 智能体是指为实现某一目标而规划并执行多项行动的系统。一次用户请求可能触发多次模型调用、搜索、工具操作、重试和验证步骤。

界面可能会让这条链路看起来像一次操作。财务报告看到的却是累积的计算、数据访问、编排和监控成本。没有追踪,团队就无法将这些成本与产生它们的工作流关联起来。

NIST 强调,应将 AI 作为已部署的系统来评估,而不只是作为孤立模型。其 ARIA 评估采用测量框架,将系统有效性、影响和现实世界背景联系起来。

这种方法弥补了一个常见的核算缺口。模型可能在测试中给出准确答案,却会在数据不完整、职责不清或激励机制不适当的工作流中失效。

培训和采用也应得到明确对待。购买访问权限并不能保证员工会恰当地使用工具。团队需要关于适用任务、验证、升级处理以及机密信息的指导。

采用率低可能摧毁商业案例。不加批判的采用则可能通过增加错误或合规风险带来另一类问题。这两种结果都说明,席位激活率并不是完整的成功指标。

组织还应计算内部机会成本。被安排去连接和监督 AI 工具的工程师,就无法投入其他项目。参与治理和流程重构的管理者也面临同样的取舍。

这些成本都不意味着 AI 投资不明智。它们说明,许可证、模型调用或试点预算并不是完整的分母。经过全面核算后,回报仍可能具有吸引力,但管理层需要进行这种核算。

对于构建可搜索内部知识的团队,严谨的信息组织可以减轻部分负担。明确的知识工作流有助于在 AI 生成的答案进入日常工作之前,厘清来源、访问权限和检索方式。

当企业将这些支撑活动视为无关的间接成本时,AI ROI 陷阱便会出现。它们是让宣传中的生产力成为可能的系统组成部分。

真正的对手是局部效率与已捕获价值之间的差距

企业 AI 的成功,取决于更快完成任务是否改变了周边工作流,而不是仪表盘是否仅仅记录了节省的分钟数。

AI 生产力最有力的证据来自边界明确的工作。客服对话有可衡量的解决结果。编码系统会记录已完成的任务。实验可以比较使用辅助与未使用辅助的群体。

企业价值则流经控制较少的系统。一个团队的产出会成为另一个团队的输入。决策取决于预算、授权、激励、客户需求,以及技术本身无法改变的流程。

这解释了为什么组织可能一边报告用户热情高涨,一边只看到有限的财务效果。员工确实感受到便利,但公司尚未重组工作来捕获可用产能。

麦肯锡 2025 年的一项全球调查发现,AI 采用广泛,但对企业整体的影响有限。88% 的受访者表示,其组织至少在一项业务职能中使用了 AI。只有 39% 的受访者将任何程度的企业 EBIT 影响归因于 AI。

在报告出现影响的受访者中,大多数表示 AI 对 EBIT 的贡献不足 5%。这项全球 AI 调查还发现,约三分之一的组织已开始规模化推进 AI 项目。

这些发现来自自报式调查数据,因此并不能提供经审计的回报计算。但它们仍说明,使用 AI 与捕获企业级财务价值之间的距离正在扩大。

另一篇 2026 年 NBER 工作论文调查了美国、英国、德国和澳大利亚近 6,000 名高级企业高管。研究发现,69% 的企业正在积极使用 AI。

高管们预计未来的影响会强于过去三年所观察到的影响。因此,这些企业数据描述了一种熟悉的技术模式:采用和预期先行于可衡量的总体结果。

一种解释是,组织需要时间来学习。通用技术通常需要配套投资、流程重构和新技能,才能让其收益广泛显现。

另一种解释则不那么令人舒适。一些部署瞄准的是显眼且易于展示的工作,而不是与有价值约束相关的工作。更快地起草内容看起来令人印象深刻,但当审批仍是瓶颈时,其意义并不大。

这正是 Google News 讨论中的核心对手。任务层面的生产力关注某个人是否做得更快或更好。已捕获价值则关注组织是否将这种差异转化为其重视的结果。

这种区别会影响劳动力相关的说法。假设 AI 让一名客服人员能够处理更多对话。公司可以利用这部分产能缩短等待时间、服务更多客户,或避免额外招聘。

每种选择都会产生可衡量的结果。如果需求固定且人员配置不变,运营收益可能提升韧性,却未必降低支出。将每一分钟节省都称为现金节省,会具有误导性。

同样的推理也适用于开发者。完成更多任务可以缩短发布周期、减少待办积压,或支持更多产品实验。当团队为产出量进行优化时,这也可能增加审查和维护工作。

因此,领导者需要识别受约束的资源。如果客户需求超过客服承载能力,更快的解决速度可以立即创造价值。如果产品发布在等待安全审批,更快生成代码可能只会扩大队列。

工作流重构之所以重要,是因为它会改变这些约束。团队可以围绕新能力修订角色、审批规则、服务水平和产能计划。没有这些工作,AI 就会成为不变流程上的又一层。

麦肯锡此前的采用研究发现,在考察的 25 项组织属性中,工作流重构与报告的 EBIT 影响之间的关系最强。相关性并不能证明重构导致了这种影响,但这种关系符合其运营机制。

这一机制也解释了为什么看似成功的试点会在扩展时失败。试点隔离了积极主动的用户和明确的任务。规模化会引入多样化工作、技能不均、遗留系统和相互竞争的激励。

因此,可信的商业案例应在部署前说明价值将如何被捕获。它应明确受影响的工作流、基线、预期的运营变化、财务关联以及责任人。

它还应定义反事实,即如果没有 AI 投资会发生什么。否则,增长、流程改进和人员变化可能会夸大工具表面上的贡献。

目标并不是把每项收益都压缩成一个财务数字。一些结果,包括韧性、学习和风险降低,需要单独衡量。组织应清晰识别它们,而不是将其隐藏在推测性的节省之中。

更好的指标仍可能制造虚假信心

更全面的仪表盘可以提升可见性,但无法消除不确定性,也无法将相关性变成证据。

对更好 AI 衡量的呼吁,往往会带来更长的指标清单。团队加入采用率、满意度、节省时间、输出质量和估算财务价值。仪表盘看起来更完整,但其底层假设可能依然薄弱。

自报的时间节省尤其脆弱。员工可能将使用辅助后的工作与一段异常困难的记忆相比较、进行不一致的估算,或忽略检查输出所花的时间。调查结果仍可揭示态度,但不应自动被视为成本节省。

使用量是另一个含义有限的领先指标。频繁使用可能表明工具有用,也可能反映管理压力、新鲜感,或工具界面被置于无法绕开的工作流中。

输出量也会产生类似的歧义。更多文档、消息、代码或分析可能表明产能提高,也可能将阅读、审查和协调工作转移给同事。

质量评分需要谨慎,因为评估者至关重要。自动评分可能与被评审模型具有相同弱点。人工评分者则可能偏好流畅的回答,即使其中包含细微错误。

财务归因则更加困难。收入可能因定价、需求、季节性、销售活动、产品改进或经济状况而变化。AI 部署可能有所贡献,但并非唯一原因。

随机实验能提供更强的归因,但企业无法将每项运营决策都随机化。在可行的情况下,它们仍可采用分阶段推广、匹配团队、保留对照组和中断时间序列分析。

测量周期也会影响结果。早期部署包含培训和实施成本。短期评估可能低估长期收益,而乐观的预测可能忽略持续维护。

企业在不同阶段需要不同指标。试点应测试可行性、质量、用户行为和工作流契合度。生产环境推广应考察可靠性、单位经济效益、业务结果和总拥有成本。

单位经济效益衡量一个活动单位所关联的收入或价值,与产出该单位的成本之间的关系。对于 AI,这个单位可能是一宗已解决的案例、一份已审阅的文档、一笔已完成的交易,或一次被接受的代码变更。

这种方法比衡量席位或模型请求更有力。它将成本与业务事件联系起来,也能暴露出那些因反复重试或人工审查而变得不经济的工作流。

即便这一框架也有局限。一些 AI 投资构建的能力会支持未来多个产品。将所有共享基础设施成本分配给第一个用例,可能会让一项合理的平台投资看起来不成功。

反过来也可能如此。将成本分摊到假设中的未来用途,可能会让当前部署显得人为地更具吸引力。财务和技术领导者需要明确的分配方法。

风险调整后的衡量会引入更多假设。团队可以估算模型错误、隐私事件或服务故障的发生频率及后果。但基于有限经验,罕见事件仍难以预测。

这些不确定性不应被掩盖。商业案例可以呈现一系列可能结果,并指出哪些假设会造成最大的差异。与一个精确的回报数字相比,敏感性分析更诚实。

对于将衡量扩展得过远,也存在一种持怀疑态度的观点。追踪所有可能结果可能会制造官僚流程,拖慢有价值的实验。衡量本身也会消耗工程师、分析师和员工的时间。

答案在于适度。低风险的起草助手不需要与能够修改客户记录的智能体采用同样的评估方案。严谨程度应与失败的规模、可逆性和后果相匹配。

团队还需要设定停止条件。试点项目应在扩大之前定义最低质量、采用率、运营影响和成本表现标准。反复延长结论未明的实验,本身也会产生隐性成本。

这一点避免该论点沦为无休止支出的借口。“价值会在以后到来”并不是证据。组织需要设定有明确日期的里程碑,并要求结果能够证伪最初的论点。

相反的观点同样值得审视。企业回报较弱,并不能证明模型没有价值。它可能表明用例不佳、集成失败、采用率低,或工作流程从未真正改变。

因此,Google News 的讨论容易受到两种夸大说法的影响。AI 供应商可能将单项任务收益描述为完整的业务回报。怀疑者则可能将有限的财务影响视为生成式 AI 没有生产价值的证据。

证据并不支持任何一种极端观点。AI 可以显著改善明确界定的任务,但企业回报取决于配套系统和管理决策。衡量必须保留这种区分。

三个信号将表明 AI ROI 是否正在变得真实

AI 采用的下一阶段将由工作流程结果、完全计入成本的单位成本,以及局部收益是否转化为财务结果的证据来评判。

第一个信号,是从采用情况报告转向工作流程报告。公司应披露完整流程发生了什么变化,包括周期时间、质量、异常情况和客户结果。

这将增强企业 AI 的论据,因为它把使用情况与运营机制联系起来。若持续强调席位数、提示词数量或员工热情,则会削弱这一论据。

第二个信号,是生产环境 AI 智能体具备可靠的单位经济效益。组织需要将模型调用、检索、工具操作、人工审核和失败情况,与已完成的业务事件联系起来。

每个成功结果的成本下降,将表明系统会随着规模扩大而改善。成本上升、重试增多或审核需求增加,则会显示试点阶段的经济性未能在生产环境中延续。

第三个信号,是更有力的公司层面生产率和财务证据。研究人员已经发现任务层面的收益,但企业调查显示,感知到的收益与可衡量的结果之间仍存在滞后。

未来的调查、受控推广和企业报告应揭示,AI 是否改变了产出、就业构成、利润率或增长。若这一差距持续存在,将削弱“生产率会自动向上传导”的说法。

读者还应关注公司如何处理节省下来的时间。重新配置资源是协助与价值之间的桥梁。无法解释释放出的产能流向何处的团队,很可能也无法证明其财务回报。

一份实用的 AI 评分卡应从业务约束而非工具开始。它应记录基线、完整工作流程、完全计入成本、期望结果以及停止的阈值。

对于知识工作者,同样的纪律适用于更小的尺度。更快的搜索、起草或分析,只有在改善决策或创造有用产能时才有意义。统计生成的字数几乎说明不了什么。

Google News 的标题捕捉到了一场将持续超过一个新闻周期的辩论。问题已不再是 AI 能否加速工作。可靠研究已经证明,它可以做到。

尚未解决的问题是,在集成、审核、风险和维护都被纳入考量后,组织能否真正获取这种加速带来的收益。答案会因工作流程而异,即使是在同一家公司内部也是如此。

在批准下一次 AI 扩张之前,请直接问一个问题:在计入每一项相关成本后,究竟哪项业务结果发生了变化?如果团队能以基线、因果联系和生产环境证据作答,回报正变得真实。如果其回答仅是使用量、生成内容或估算工时,AI ROI 陷阱依然存在。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page