top of page

近四成 CFO 预计生成式 AI 将在两年内带来回报

PYMNTS 登上 Google News,带来一项引人注目的发现:近四成受访 CFO 预计生成式 AI 将在两年内带来非常积极的回报。这种信心听起来像是企业 AI 的一场胜利,但底层数据呈现的故事更为复杂。

财务领导者正从聚焦型应用中看到更强的成效,同时也在延长将生成式 AI 嵌入整个组织所需的时间。表面上的矛盾,区分了早期运营价值与完整财务回报。

这项企业 CFO 调查覆盖了美国年营收至少 10 亿美元企业的 60 位财务主管。PYMNTS Intelligence 于 2025 年 12 月 15 日至 12 月 19 日开展调查。其发现描述的是一小群集中分布的大型企业,而非所有美国企业。

这些 CFO 报告称,从自动化工作流到客户响应等任务的成效均有所提升。他们认为,相比六个月前,生成式 AI 的缺点也更少了。然而,他们对全面集成的预期时间几乎翻倍。

这种张力比标题中的百分比更重要。CFO 不只是在问模型能否起草文本、分析记录或生成预测;他们在判断 AI 能否在受治理的工作流中运行,并创造持久的经济价值。

因此,主要的较量并非 AI 乐观派与怀疑派之间的对抗,而是快速、定向的成果承诺与缓慢组织变革现实之间的冲突。胜出者将把这两条时间线连接起来,而不会将生产力估算当作经审计的回报。

Google News 标题实际揭示了什么

这项调查显示,市场对特定 AI 应用的信心正在增强,并不意味着企业级转型已接近完成。

PYMNTS 发现,到 2025 年 12 月,CFO 对生成式 AI ROI 的预期变得更加分散。更大一部分人预计会在一两年内获得非常积极的回报;另一部分人则预计,实现完整经济回报的道路要长得多。

这种分布比单一平均值更有参考意义。它表明,财务领导者不再将每个生成式 AI 项目视为同一种投资。文档助手与全公司的预测系统,承担着不同的成本、风险与实施要求。

这一差异也解释了,为何看好的 ROI 预期上升的同时,集成预测却变得更长。一个团队可以在公司重构整个财务流程之前,就通过研究或报告节省时间。早期价值并不需要立即实现制度性转型。

PYMNTS 报告称,在受访企业已部署的各类用例中,满意度达到 80% 至 100%。代码生成、自动化工作流、产品创新和实时客户响应的评分提升尤为明显。这些数据反映的是受访者的评估,而非独立审计的财务回报。

受访 CFO 也表示,感知到的缺点更少了。平均缺点数量从 2025 年 7 月的 6.92 项降至 12 月的 4.23 项。在规模最大的企业中,平均值从 7.52 项降至 3.44 项。

多项运营担忧也随之下降。提及错误和输出问题的比例从 80% 降至 35%;集成与实施方面的担忧从 70% 降至 45%,成本与维护方面的担忧则从 78.3% 降至 23.3%。

这些变化支持一种可信的解读:经验正帮助大型企业解决早期试点阶段看似棘手的一些问题。团队正在建立控制机制、选择更聚焦的用例,并学习哪些环节仍必须保留人工审查。

不过,报告中的担忧减少,并不意味着这些问题已经消失。在财务报告、合规或资金管理中,35% 的错误担忧仍不可忽视;45% 的集成担忧仍表明,系统与数据之间还有大量工作要做。

该研究还依赖于 60 位高管的自我报告感受。这种设计可以识别情绪与实践的变化,但无法确定因果关系。它无法证明生成式 AI 带来了某项特定的利润率改善。

因此,这一标题应被解读为预期日趋成熟的证据。近四成 CFO 预见到强劲的短期回报,是因为他们能够区分有用的部署与广泛的转型。他们的乐观变得更具选择性,而非不再严肃。

这是 PYMNTS CFO 调查中的第一个重要转变。财务领导者日益相信,生成式 AI 能在明确场景中发挥作用。如今,他们正面对更困难的问题:这些场景能否成为可重复、可控的运营系统。

快速 AI 成果正与缓慢集成发生碰撞

当企业限定任务范围、明确基线,并由承担责任的员工负责时,生成式 AI ROI 往往显现得最快。

聚焦型用例具有清晰的边界。财务团队可以衡量定期报告在部署前所需的时间,并将这一基线与后续结果比较。团队还可以记录修正次数、审查时间以及运行模型的成本。

企业级集成则没有这么简单。它涉及访问权限、数据定义、审批链、软件合同、员工角色与监管义务。即使模型表现良好,周边流程也可能仍不适合自动化。

这种差异有助于解释 PYMNTS 研究中更长的时间线。到 2025 年 12 月,受访者预计全面集成所需时间几乎是他们在 7 月至 9 月间预期的两倍。更多经验带来了对用例更强的信心,也带来了对规模化更高的谨慎。

Deloitte 在其AI ROI 研究发现中发现了类似的分化。该研究涵盖欧洲和中东地区的 1,854 位高管,并由 24 次深入访谈提供支持。

在该研究中的生成式 AI 用户里,15% 表示已经实现显著、可衡量的 ROI;另有 38% 预计将在投资后一年内获得此类回报。然而,62% 表示,典型 AI 用例达到令人满意的 ROI 通常需要两到四年。

这一分布凸显了一个关键的衡量问题:“显著”和“令人满意”的回报可能代表不同的门槛。企业可以在收回实施与组织变革的全部成本之前,就确认有用的生产力提升。

Agentic AI 让时点问题更加突出。AI agent 是可在既定权限下规划并执行多步骤操作的软件。Deloitte 发现,57% 的受访者正在使用 agentic AI,但只有 10% 报告已获得显著的当前 ROI。

其中一半的 agentic AI 用户预计将在三年内获得回报,另有三分之一预计时间线为三到五年。更高的自主性提升了潜在价值,但也增加了集成与控制要求。

财务职能说明了其中的原因。模型可以在有限访问权限和强制审查下总结差异说明;而能够修改预测或发起调整的 agent,则需要权限、验证规则、日志与明确的责任人。

企业还必须决定何为价值。PYMNTS 发现,到 12 月,改善客户体验和利润率已成为主要 ROI 衡量指标。成本降低、营收扩张与资本支出减少也正获得更多关注。

裁员成为较少使用的衡量标准。这一变化削弱了最简单的自动化叙事。CFO 日益通过更快的周期、更优的决策和更好的服务来理解价值,而不只是直接减少人力。

这些收益依然难以比较。节省的工时并不会自动转化为利润。更快的分析只有在员工将这些时间重新用于有价值的决策或额外工作时才有意义。

因此,可信的生成式 AI ROI 模型必须考虑被接受的输出、审查投入、失败率以及下游业务影响。它还应纳入基础设施、集成、治理、培训和供应商管理。忽略这些成本,会得出一个看似吸引人但并不完整的结果。

这也是为什么知识获取在日常部署中至关重要。员工需要可靠的上下文,AI 才能产出有用的工作成果。可检索的AI 知识库可以减少信息检索阻力,但人工核验仍能保护关键决策。

如果团队认真衡量,早期成果是真实存在的。当领导者假定这些成果无需重构工作流便可规模化时,碰撞就开始了。每增加一个系统、一项权限和一个利益相关方,成功就多了一个条件。

CFO 现在必须同时捍卫速度与控制

财务领导者面临压力:既要快速为 AI 提供资金,也要保留让财务系统值得信赖的控制机制。

CFO 传统上会质疑缺乏可衡量回报的投资。生成式 AI 让他们处于一个不同寻常的位置:他们既要充当资本把关人,又要面对竞争对手、董事会和运营团队对更快采用的要求。

这种压力已经显现。一项 2026 年 7 月调查报告称,92% 的 CFO 和高级财务高管感到压力,必须证明 AI 回报可以接受。这项财务领导者压力研究覆盖了四个国家的 1,505 位高管。

其中一半受访者表示,其 AI agents 仅带来了有限的可衡量 ROI。只有 7% 表示,其组织将 AI 治理置于采用速度之上。这些结果揭示了让部署进度超过问责机制的风险。

只有 44% 的人完全有信心向审计师或监管机构解释 AI agent 的行为。另有 30% 表示,过去一年中内部控制并未更新。当软件开始影响交易或财务判断时,这些缺口至关重要。

可审计性意味着企业能够重建系统做了什么、使用了哪些信息,以及谁批准了结果。传统软件遵循预定义逻辑;生成式系统则可能产生可变输出,因此组织需要围绕提示词、来源、修订与批准保留更完善的记录。

同一项调查发现,只有 28% 要求提供记录在案的审计日志,以展示 AI agent 如何得出决策。另有 23% 表示,AI 错误的责任归属将不清晰,或无人负责。这些是治理缺陷,而非无关紧要的技术细节。

内部草稿中的模型错误,后果尚可管理;税务、报告或合规中的无法解释错误,则可能带来财务与法律风险。控制环境必须与行动的影响相匹配。

这并不意味着每个用例都需要相同的限制。低风险摘要工作可以采用比资本配置或对外报告更轻的审查。基于风险的控制措施让企业能够在后果仍受控的领域快速推进。

CFO 还必须解决所有权问题。技术团队可以运行模型,但无法定义每一种可接受的财务结果。财务团队了解重要性与审批要求,而安全团队了解访问权限与数据暴露。

成功的治理需要在部署前统筹这些责任。业务负责人界定目标和可容忍的错误范围。技术团队维护系统,风险职能部门则检验控制措施是否按预期运行。

PYMNTS 的发现表明,大型企业正在改进这项工作。它们报告的错误、成本和实施方面的担忧在六个月内显著下降。有效性评分的提升显示,受控使用能够建立机构信心。

然而,当信心取代测试时,就可能变得危险。自报的满意度无法揭示员工在多大程度上默默修正了输出结果。它也可能排除已被放弃的试点项目,从而使仍在运行的部署看起来更强劲。

组织应追踪完整漏斗,包括尝试的任务、完成的输出、被接受的输出、修订、升级处理和失败情况。一个能够快速生成草稿、却需要大量核查的模型,可能只是转移了工作,而非消除了工作。

随着预算增加,CFO 面临的压力将加剧。Bain 对逾 100 名全球 CFO 的调查发现,83% 计划在两年内将企业 AI 支出提高 15% 以上。其 AI 支出计划还显示,42% 预计增幅将超过 30%。

根据 Bain 的数据,只有 15% 至 25% 的受访者已在财务职能范围内规模化部署 AI。总体而言,31% 对结果感到满意。在 AI 成熟度位居前四分位的公司中,满意度超过 60%。

这一差距使运营成熟度成为决定性因素。购买更多访问权限并不会自动带来成熟的数据、工作流或控制措施。CFO 必须为将模型转化为可靠能力所需的组织建设工作提供资金。

这些数字仍未能证明什么

这些证据支持谨慎乐观,但并不能证明生成式 AI 投资回报存在一个普适的两年期限。

PYMNTS 的样本在设计上较为狭窄。每位受访者都是年营收至少 10 亿美元的美国公司财务负责人。大型企业拥有的资源、数据和技术团队,可能是规模较小的组织所不具备的。

该样本也仅包含 60 位 CFO。一位受访者约占 1.7 个百分点。因此,回答上的微小变化就可能导致报告占比出现明显波动。

这一限制并不意味着该研究无效。它意味着读者不应将其结果直接转化为对所有企业的预测。该调查最适合被视为了解大型企业财务领导层的一扇窗口。

时间表述同样值得谨慎对待。受访者被问及回报何时会变得“非常积极”,而不是所有实施成本何时能够收回。不同高管可能会为这一表述设定不同门槛。

PYMNTS 报告了更广泛的 ROI 衡量指标组合,包括利润率、客户体验、成本削减和营收。这种方法反映了企业实际创造价值的方式。但除非每家公司都一致地定义其计算方法,否则也会使比较变得更困难。

客户体验的提升可能具有财务意义,但这种关联需要证据。领导者需要展示,更好的服务是否改变了留存率、转化率、支持成本或其他可衡量的结果。否则,这项收益仍只是一个中间指标。

该调查的时间线还带来另一层提醒。PYMNTS 在 2025 年 12 月的五天内收集了回复。该标题后来进入当前 Google News 周期,但底层回复只是一份快照。

自那次调研以来,模型、合同和企业战略都已发生变化。一些项目取得了进展,另一些则遇到了成本或安全问题。当前的标题不应掩盖调查日期。

独立研究也呈现出显著不同的成功水平。Wharton 和 GBK Collective 的一项企业采用研究在 2025 年调查了 801 名企业决策者。研究发现,72% 的受访者正式衡量了生成式 AI 的 ROI。

该研究中,四分之三的受访者报告了正向回报。五分之四预计投资将在约两到三年内获得回报。这些发现强化了乐观情绪,同时将预期周期延长至标题所称两年窗口之外。

Wharton 的研究还发现,82% 的受访者至少每周使用一次生成式 AI,46% 每天使用。定期使用显然已在企业决策者中变得普遍。然而,采用率并不等同于经济影响。

该研究还指出了一项人为约束。89% 的受访者同意生成式 AI 提升了员工技能,但 43% 认为存在技能熟练度下降的风险。如果员工停止练习关键任务,AI 可能在提高产出的同时削弱专业能力。

财务领导者必须考虑这种可能性。能够更快完成工作且保有判断力的分析师,代表着持久价值。一个加快流程、却削弱识别错误能力的系统,会制造隐性负债。

其他研究发现,即使回报看起来可观,运营层面仍存在明显缺口。一项 2026 年财务调查报告称,受访者的 AI 采用率达 97%,超过 75% 的投资带来了正向回报。然而,45% 的人仍将超过 60% 的时间花在手动任务上。

这一财务采用缺口表明,宽泛的说法需要放在背景中理解。一个财务部门可以报告 AI 带来正向回报,同时仍依赖电子表格、手动对账和劳动密集型报告。

最怀疑的解读是,乐观调查比起衡量整体转型,更容易衡量预期和经筛选的成功案例。最有利的解读是,针对性的价值会先于可见的组织变化到来。

两者都可能成立。生成式 AI 可以带来有价值的回报,而不必重塑整个财务部门。错误在于将早期成功视为所有流程现在都应自动化的证明。

CFO 应在用例层面要求证据,并在投资组合层面进行汇总。失败的实验应与成功部署一同纳入计算。排除失败项目会夸大整体项目的表观表现。

他们还应区分经常性改进与一次性收益。模型或许能帮助清理积压任务,但这种收益不会无限重复。持久的 ROI 需要持续的工作改进、更低的经常性成本、更好的决策或持续的营收影响。

这个标题之所以有用,是因为它捕捉到了高管情绪的真实转变。只有在剥离样本限制、衡量选择和更长的整合时间线后,它才会变得具有误导性。这些细节决定了两年预期是否可信。

三个信号将检验两年回报

下一阶段将由经审计的运营结果、生产规模的采用,以及控制措施是否同步跟进的证据来评判。

第一个信号是公司报告 AI 价值方式的变化。生产率估计和员工调查在实验阶段发挥了作用。董事会将越来越期待与利润率、营收、营运资本、错误减少或已完成交易周期挂钩的指标。

更有力的披露应包括运营成本和人工审核。它应将节省的总工时与实现的财务价值区分开来。它还应说明结果是来自生成式 AI、传统自动化,还是更广泛的流程再造。

如果企业开始报告可重复的财务成果,PYMNTS 的近期预测就会获得支持。如果披露仍局限于使用情况和预计节省的工时,验证缺口将持续存在。

第二个信号是从试点转向受控生产。Bain 发现,只有 15% 至 25% 的受访 CFO 已在财务领域规模化部署 AI。这意味着实验与常态化运营之间仍有很长距离。

生产部署不应仅仅意味着全组织都能使用聊天机器人。它需要与获批数据的集成、明确的任务、监控、升级规则和指定负责人。员工还需要获得清晰指引,以便对不可靠的输出提出质疑。

规模化速度将揭示最强用例能否经受真实运营复杂性的考验。受治理、可重复部署的增长将强化两年论点。停滞试点项目清单的增加则会削弱它。

第三个信号是治理指标是否随采用率一同改善。7 月的财务调查发现,有记录的代理日志使用率较低,且问责归属存在广泛不确定性。随着系统获得更大的自主权,这些缺口将变得更加重要。

应关注更新后的内部控制、强制审计追踪、经过测试的事件应对计划,以及对 AI 错误的明确责任归属。这些措施并不能保证正向 ROI,但能降低一次失败抹去许多成功任务收益的可能性。

治理改进也会使财务衡量更可信。如果公司不记录系统行为、修正和例外情况,就无法准确计算价值。控制措施创造了支持 ROI 主张所需的证据。

因此,Google News 的标题标志着一个检查点,而非终点。近十分之四的 CFO 预计将在两年内获得非常积极的回报,而同一研究显示,全面整合需要更长时间。

这种分化是合理的。企业不必在从精选应用中获得价值前转型每一项工作流。但在将这种价值视为持久的企业回报前,它们确实需要严格的衡量。

对开发者而言,教训是要为可追溯性、审核和受限操作而设计。对企业买家而言,则是评估工作流成果,而不是模型演示。知识工作者应审视 AI 是否提升了他们的判断力,还是仅仅加速了初稿生成。

决定性问题不再是生成式 AI 能否帮助财务团队。它已在许多明确任务中发挥作用。问题在于,组织能否将这些收益转化为可重复、受治理的财务表现。

未来两年,应关注 CFO 在实施成本、修正和控制工作进入账本后报告了什么。那些证据将决定当下的乐观情绪会成为运营优势,还是又一次跑得比现实更快的预测。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page