2026 年企业 AI 部署成本飙升,管控措施却未能跟上
- Sophie Larsen

- 38分钟前
- 讀畢需時 14 分鐘
尽管模型变得更便宜,人工智能多年来也一直承诺提升运营效率,但企业 AI 部署成本仍在 2026 年大幅攀升。
这种矛盾如今已成为企业 AI 战略的核心。模型持续进步,但生产系统消耗更多 Token、接触更多数据,也需要更多人工支持。许多公司无法将不断扩张的成本与可衡量的回报联系起来。
Channel Dive 在一份 9 月汇总中记录了这一转变,覆盖了 2 月至 8 月间发布的报道。这些报道显示,企业正从不受限制的试验转向更严格的财务、运营和安全审查。
最重要的变化并非企业突然失去对 AI 的信心。企业仍认为这项技术具有战略重要性,许多管理者也计划增加投入。变化在于,证明价值的责任变重了。
CIO 现在必须解释,为何 AI 使用量的增长速度快于节省的成本、营收或生产力提升。他们还必须识别分散在云服务、软件订阅、模型提供商、内部项目和员工自建工作流中的成本。
这种压力使 AI 扩张与财务管控之间产生了直接冲突。企业正试图扩大那些消耗量可能剧烈波动的系统,而其管理流程仍类似于传统的年度预算模式。
这一冲突正使企业 AI 部署成本成为董事会层面的议题。它也为托管服务提供商、咨询机构、云服务专家和前置部署工程师创造了新的工作。
AI 成本叙事从模型转向整个系统
2026 年的成本清算,关注的是大规模运营 AI,而不只是为模型访问权限付费。
实验性的聊天机器人可能看起来并不昂贵,因为其边界较为有限。生产部署的成本覆盖面则大得多。
系统可能需要数据准备、检索基础设施、安全审查、测试、监控、评估,以及与业务应用的集成。它还可能需要能够重新设计工作流并解决故障的专业人员。
Agentic AI 又增加了一层复杂性。AI agent 是一种能够规划步骤、使用工具并在有限监督下采取行动的软件。因此,一项员工请求可能触发多次模型调用、搜索、数据库查询和验证步骤。
单次交互不再代表单一工作单元。它可能成为一连串决策,其长度会随任务、模型、数据和 agent 行为而变化。
这种可变性使预测变得困难。传统软件通常将成本与许可证、席位或相对稳定的基础设施容量挂钩。AI 工作负载则可能在执行过程中改变其资源消耗。
McKinsey 报告称,当 agent 执行相同任务时,Token 使用量的差异最高可达 30 倍。Token 是模型在读取提示词和生成回复时处理的文本单位。
同一分析还发现,与孤立使用阶段相比,企业范围采用带来的支出接近其四倍。其 5 月调查涵盖五个主要行业的 75 名合格受访者。
在这些组织中,62% 已从试验阶段进入主动部署阶段。然而,根据该公司的 AI demand analysis,93% 表示 AI 预算已经超支。
这些数据解释了为何更低的模型输入成本并未终结成本争议。单位成本下降可能会鼓励更多使用、更长的上下文、更复杂的推理和额外的自动化步骤。
Channel Dive 将此前阶段称为“tokenmaxxing”,即组织鼓励员工在缺乏明确限制的情况下尽量扩大使用。到年中,财务团队开始发现其后果。
这一问题类似于其他技术中出现的反弹效应。效率让每个单位变得更便宜,但更便利的获取方式会增加总体消耗。
AI 加剧了这一模式,因为更好的模型解锁了此前不切实际的任务。曾经只用于总结文档的团队,后来可能会在研究、编程、客户支持和内部运营中部署 agent。
每一次成功的试验都会带来增加用户和工作流的压力。每次扩张也会增加评估、治理和集成工作。
由此产生的账单是分散的,而非集中的。模型使用可能出现在云账户、嵌入式软件功能、API 合同、部门采购和实验环境中。
这种碎片化会掩盖全部成本,直到财务团队对多个系统进行核对。到那时,资源消耗已经发生。
因此,企业 AI 部署成本不能仅通过 Token 费率来理解。有意义的单位是完整工作流,包括其基础设施、监督、安全措施和可衡量的业务结果。
企业 AI 部署成本暴露了可见性缺口
许多组织在建立可靠的观察、归因或控制机制之前,就已增加了 AI 支出。
成本可见性,是指将资源消耗与团队、工作流、产品和业务结果关联起来的能力。缺少这些联系,仪表盘只能显示活动情况,却无法解释价值。
KPMG 在其第二季度研究中发现了这一差异。尽管 66% 的受访组织使用仪表盘,61% 拥有审批流程,但只有 26% 拥有实时成本洞察。
另有 35% 将 AI 成本管理和经济认知列为核心障碍。只有 36% 已对 Token 或使用量实施直接控制。
这些发现描述的是能够批准 AI 项目、却未必能在运营过程中观察其经济效益的组织。审批流程管理的是准入,而使用控制管理的是之后发生的事情。
当员工和业务部门能够独立启用 AI 时,这一缺口会变得危险。软件供应商正日益将生成式功能嵌入现有产品,使企业无需单独进行采购即可采用 AI。
开发者也可以通过 API 连接模型。业务用户能够利用低代码工具创建自动化工作流。部门可能在中央 IT 体系之外购买专业应用。
这种扩张带来了 AI 蔓延,即重叠的工具和部署在组织中扩散,却没有协调一致的所有权。影子 AI 则是其中未经授权的部分。
据 Channel Dive 重点提及的 Flexera 研究,近三分之二的组织缺乏足够的 IT 资产可见性来控制 AI 成本。这种薄弱的资产清单既会增加财务管理难度,也会影响安全管理。
如果一家公司不了解所涉及的每个模型、数据源和应用,就无法将成本分配给某个工作流。它也无法判断多个团队是否正在购买功能相近的能力。
McKinsey 估计,由于投资仍然碎片化,AI 支出中通常有 20% 至 30% 未被计入。该类别包括模型合同、AI 赋能软件、云资源和部门试验。
这并不意味着资金消失了,而是意味着组织无法可靠地将其与责任归属、资源消耗或业务表现联系起来。
IBM 旗下 Apptio 在技术财务管理中发现了类似弱点。其研究覆盖了 1,500 多名从事财务管理和 FinOps 工作的决策者。
FinOps 是将技术资源消耗与财务责任联系起来的实践。它起源于云成本管理,但 AI 带来了更难预测的工作负载和更分散的采购方。
十分之九的 Apptio 受访者表示,对价值的怀疑会影响技术投资决策。近半数认为这种影响很大。
与此同时,80% 的受访者指出,数据孤岛妨碍了证明支出合理性所需的洞察。因此,糟糕的数据既影响 AI 系统本身,也影响支持其投入的财务论证。
只有 13% 的受访者表示,他们正在积极优化 AI 和机器学习的云成本。这使得追踪费用与通过改变工作负载来减少浪费之间存在巨大差距。
资金来源又增加了一层压力。三分之二的 AI 投资来自对现有预算的重新分配,高于前一年的一半。
这意味着 AI 扩张经常与其他技术优先事项竞争。它并不受到无限新增资本池的保护。
每一次超支都可能延迟现代化改造、网络安全、云迁移或应用开发工作。因此,争论的范围远不只是某一项 AI 工具看起来是否有用。
可见性问题还会削弱内部信任。财务领导者看到资源消耗不断上升,而产品团队则指出可能难以衡量的收益。
双方都可能是对的。员工或许能更快完成某些任务,但公司可能无法将这些收益转化为更低成本或更高产出。
这种错配使归因成为核心挑战。管理者需要知道某个工作流是否改变了运营指标,而不仅仅是员工是否使用了它。
核心逆转:能力更强,可预测性却更低
更强大的 AI 系统扩大了企业可自动化的范围,但也让需求更难预测。
早期的 AI 商业案例通常假设,模型改进会降低完成固定任务的成本。只有在任务和使用量保持稳定时,这种计算才成立。
广泛采用后,这两个条件都不复存在。员工更频繁地使用改进后的模型,开发者则赋予它们更长、更复杂的任务。
Agent 加深了不确定性,因为它们会在运行过程中决定中间步骤。两次运行可能采取不同路径、调用不同工具,并消耗不同数量的算力。
模型路由可以提供帮助。路由会根据请求难度将其发送至合适模型,而不是让每项任务都使用能力最强的选项。
缓存也可以通过复用先前结果来减少重复工作。较小的模型可以在较大模型进入工作流前处理分类、提取或常规搜索。
这些技术能够减少浪费,但需要工程能力和治理。它们还会创造另一套必须测试、监控和维护的系统。
因此,成本挑战发生了转移,而非消失。组织可能减少推理支出,却增加架构、评估和专业劳动力方面的投入。
这正是承诺与现实之间冲突变得清晰的地方。AI 的部分卖点是减少人力并加快交付。
在生产环境中,企业往往需要新的专业人员来确保这些系统可靠运行。他们需要数据工程师、安全专业人员、产品经理、领域专家,以及能够重新设计流程的人。
前置部署工程师已成为一种应对方式。这些专业人员在客户环境中工作,将供应商技术与具体业务运营连接起来。
Gartner 预计,到 2026 年底,超过 85% 的技术提供商将推出前置部署工程计划。这种方式旨在压缩部署周期并弥补企业技能缺口。
Microsoft、Amazon Web Services、Google、OpenAI、Anthropic、Accenture 和 Deloitte 都已采用这一模式的不同版本。Palantir 被广泛认为确立了这种方法。
Travelers Insurance 提供了一个务实的案例。其核心 AI 专家会轮岗加入由工程师、产品经理和业务负责人组成的跨职能团队。
这些专家帮助团队解决明确的问题,随后将可复用组件回流至共享 AI 平台。该设计旨在避免各部门重复构建相同能力。
这种模式可以加快部署,但并不能免除长期所有权要求。内部团队仍需具备足够专业能力,以运营、评估和修改外部专家创建的成果。
Gartner 曾警告称,十分之七的企业将被迫放弃由驻场支持模式主导的智能体项目。其指出的风险包括高成本和内部技能不足。
这一警告使服务模式成为成本讨论的一部分。专家可以加快实施,但依赖外部专业能力可能抬高持续变更的成本。
同样的矛盾也适用于供应商。他们希望客户快速采用 AI,但复杂部署需要比传统软件销售更多的实操支持。
Omdia 的 Peter Bryant 向 Channel Dive 表示,驻场工程师将是将机会转化为收入的关键。模型持续变化之际,客户无法等待合作伙伴完成培训。
这给整个渠道带来了压力。托管服务提供商既要建立 AI 实施能力,也要学习治理、安全和成本归因。
传统支持服务已不够用。客户需要能够识别高价值工作流、完成集成、衡量效果并控制使用量的合作伙伴。
结果是,早期自动化叙事被颠倒了。AI 不只是替代工作;它还催生了一套新的运营纪律,用于决定该采用何种智能能力。
回报确实存在,但往往出现在错误的地方
企业 AI 最棘手的问题,不在于员工是否从中获益,而在于组织能否将这些价值真正捕获。
员工或许可以更快起草文档,或更早找到信息。这些改进很重要,但并不会自动反映在财务报表上。
如果节省下来的时间变成额外会议、闲置产能或未被跟踪的试验,公司只会记录更高的软件成本,却没有相应的运营收益。
一些收益也会出现在最初商业案例之外。Channel Dive 引述的 SAP 研究发现,企业在客户互动和商业洞察方面获得了帮助。
同一批受访者不一定报告了预期中的时间或成本下降。AI 创造了价值,但并不总是出现在规划者预测的位置。
这一区别很重要,因为商业案例往往依赖单一指标。客服部署可能以缩短处理时间为目标,却反而主要带来了更好的问题识别能力。
编程助手可能加快个人任务,却为团队带来更多需要审查、保护和维护的代码。研究智能体可能找到更多证据,同时增加核验工作。
这些结果本身并不等于失败。当领导者持续衡量错误结果,或无法识别任何实质性改善时,它们才会成为失败。
Gartner 的 2026 年调查显示,大规模扩展仍然有限。只有 22% 的组织成功将 AI 扩展至多个业务部门,或采取了 AI 优先的方法。
该调查覆盖了 1,303 名来自年收入规模较大组织的受访者。其中 11% 的人不知道其职能部门在 2025 年 AI 支出多少。
尽管存在这种不确定性,85% 的职能负责人计划在 2026 年增加支出。前一年,他们平均将职能预算的 12% 投向 AI。
这种组合颇具启示性。投资增长速度快于组织对成本和回报的认知提升速度。
Gartner 还发现了显著的绩效差距。高绩效组织会持续追踪回报、将 AI 视为投资组合,并将资源从薄弱项目重新分配出去。
这些组织的 81% AI 项目报告了正向回报。低绩效组织则无法识别 29% 项目的回报。
这种差异并不能证明单靠衡量就能创造价值。管理能力更强的组织也可能拥有更好的数据、人才和流程设计。
不过,这种相关性支持一个务实结论:AI 投资组合需要积极决策,判断哪些项目应扩大、重新设计或停止。
这令人不适,因为停止项目看起来可能意味着战略退缩。竞争焦虑让这种决策更加困难。
许多高管认为,投资不足带来的风险大于超支。因此,团队可能让薄弱试点继续存活,以保留选择空间或展示行动成果。
Channel Dive 将此称为“试点炼狱”。项目的可见度足以持续消耗资源,却始终无法成为核心运营中可靠的一部分。
技术债务使问题进一步恶化。老旧应用、碎片化数据和不一致的流程,限制了 AI 层所能实现的效果。
模型或许能给出不错的建议,但周边工作流缺乏可靠数据或执行权限。于是,人工审查者只能吸收尚未解决的复杂性。
这也是为什么模型性能更快并不保证运营成本更低。瓶颈往往位于业务流程,而非模型本身。
企业需要在工作流层面衡量结果。有用的指标包括周期时间、错误率、客户问题解决率、转化率、产出质量和避免返工的情况。
使用指标对于诊断仍然有用,但并不能证明价值。更多提示词可能意味着采用率提升、困惑、自动化循环,或低效的工作流设计。
对 2026 年成本调查保持审慎解读同样重要。许多调查由供应商赞助、基于自我报告,或采用较小样本。
不同研究对部署、回报、成熟度和 AI 支出的定义各不相同。它们的百分比不应被合并为单一市场估算。
不过,多个独立报告呈现的方向仍然一致:支出正在上升、可见性有限,而回报高度依赖管理纪律。
治理与安全如今应出现在同一张账单上
忽视治理的 AI 部署并未消除成本;它只是将成本推迟为风险和补救。
治理界定了谁可以使用 AI 系统、其能够访问哪些数据、可以执行哪些操作,以及如何审查其输出。
这些决策会直接影响成本。过度授权会增加风险暴露,而薄弱的监控会使故障更难发现和调查。
影子 AI 形成了尤其棘手的组合。未经授权的工具既可能产生未被跟踪的使用量,也可能将敏感信息移出获批准的系统。
Channel Dive 引述的一项 WitnessAI 调查显示,47% 的企业决策者认为,IT 和基础设施是影子 AI 的主要来源。
这一发现挑战了这样一种假设:未经授权的使用主要来自粗心员工。技术团队在测试模型或基础设施时,也可能自行创建未经批准的部署。
安全事件带来的成本随即超出模型使用量本身。调查、法律审查、客户通知、系统改动和生产力损失,都属于部署的经济足迹。
治理也可能提高短期支出。审查、访问控制、审计日志、红队测试和政策执行都需要工具及专业人力。
这并不意味着治理是可选项。它意味着一份可信的商业案例必须从一开始就纳入这些要求。
一刀切的方法可能浪费资源。低风险摘要工具不需要与修改客户记录的智能体相同的控制措施。
组织需要将控制措施与每个工作流的数据、权限和后果相匹配。Gartner 分析师 Shiva Varma 曾主张,应在智能体和流程层面评估可信度。
这种方法既能保护高风险系统,又不会阻碍每一种使用场景。它也使成本分配更精确,因为控制措施会随工作负载而定。
数据治理同样值得重视。基于重复、过时或权限管理不佳的信息运行的 AI 系统,将产生额外的审查工作。
当底层知识环境才是真正限制因素时,团队可能会责怪模型。反复的检索失败随后会增加 token 使用量,却不改善结果。
因此,治理同时支持安全性和经济性。清晰的所有权可减少重复工具,而获批准的数据路径可减少不可预测的补救工作。
最强的成本管理体系会连接财务、运营和安全数据。团队应能看到一个工作流消耗了什么、产出了什么,以及引入了哪些风险。
这种整合视角也有助于渠道合作伙伴。客户日益需要横跨基础设施、安全、数据、应用设计和财务管理的指导。
只专注于模型选择的合作伙伴,会忽视部署成本的大部分。只专注于降本的合作伙伴,则可能削弱质量或安全性。
真正的优化目标是在可接受约束下实现有用产出。这要求平衡模型能力、延迟、准确性、安全性和整个工作流的消耗。
三个信号将表明 AI 成本是否正在得到控制
下一阶段将由成本归因、项目纪律和持久的内部所有权决定。
第一个信号是采用工作流级别的 AI 成本报告。组织需要的不只是汇总的月度总额。
一个有用的控制平面应将模型调用、云资源、软件功能和人工审查与业务流程关联起来,同时记录质量和结果指标。
McKinsey 报告称,只有 20% 至 25% 的公司具备成熟的 AI FinOps 能力。其分析表明,预测成熟度更强的组织可额外节省 10% 的 AI 支出。
这些数字让成熟度成为可衡量的检验。如果未来数月实时归因得到扩大,2026 年的成本冲击就将催生运营层面的应对。
如果公司仍依赖电子表格和滞后账单,超支依然难以防止。消费发生后的控制措施无法在执行过程中塑造智能体行为。
第二个信号是领导者是否淘汰薄弱试点。投资组合纪律要求停止那些在既定评估期后仍无法证明价值的项目。
Gartner 的发现表明,高绩效组织已经以这种方式运作。他们追踪回报、重新评估计划,并将资源转向更强的机会。
关注企业是否报告更少的试点、但更多的生产工作流。这种模式将表明,资源正向拥有明确负责人和结果的项目集中。
试点数量增加则会传递相反信号。这意味着试验依然比流程重构或终止项目更容易。
第三个信号是企业能否在外部专家离开后保留所有权。驻场工程师可以解决即时部署问题,但客户需要持久的内部能力。
Travelers 通过核心专家与嵌入式跨职能团队相结合的方式,提供了一种模式。可复用组件会回流至共享平台,而不是保持孤立。
重要的检验不在于供应商能多快推出一个智能体,而在于客户六个月后能否运营、治理并改进该系统。
对外部工程服务的高度续约依赖将强化对持续成本的担忧。成功的知识转移则会削弱这种担忧。
模型服务商将继续降低部分单位成本,新的优化工具也会改善路由、缓存和可观测性。这些进展很重要,但无法解决责任归属碎片化的问题。
企业 AI 部署成本归根结底是一个通过技术呈现出来的管理问题。当组织在尚未明确责任、衡量标准和运营边界前就扩大使用规模,账单便会不断增长。
企业无需停止 AI 投资,但需要以审慎的投资组合决策取代不受限制的消耗。
每一项生产工作流都应有明确负责人、可衡量的成果、获批的数据路径和使用限额;还应设定一个条件,一旦满足该条件,组织就会停止为其继续投入资金。
2026 年的账单并不意味着企业 AI 已经失败。它表明,采用速度快于让其经济效益变得清晰可见所需的控制机制。
因此,下一个预算周期的问题十分明确:每一项 AI 工作流能否说明自己消耗了什么、改变了什么,以及当实验演变为基础设施时,谁仍将对此负责?


