top of page

更便宜的 AI 正在降低业务自动化成本——但并未消除其最大瓶颈

Google News 本周带出了一个引人注目的观点:尽管前沿模型和数据中心背后投入巨大,AI 正在变得更便宜。

这一基本趋势确实存在,尽管原文通过其联合发布页面提供的证据有限。独立研究显示,如今运行具备相当能力的 AI 所需成本已大幅下降。更小的模型也能够完成过去只有更大系统才能胜任的任务。

这一变化正在冲击一种常见的商业假设。企业往往将模型费用视为自动化常规知识工作的一大障碍。推理成本下降削弱了这一论点,但并不会让可靠的自动化自然而然地实现。

新的较量并不只是 Google 与 OpenAI、Anthropic 或其他模型提供商之间的竞争,而是低成本模型访问与将模型输出转化为可靠业务行动所需的高昂组织投入之间的较量。

这一差异会影响客户支持、文档处理、研究、软件开发、销售运营和内部知识管理。较低的模型账单可以让试验更容易开展,却无法解决数据质量差、职责不清、评估不可靠或审批流程设计不佳的问题。

Google News 突出了可量化的成本变化

重要的变化并不是所有 AI 模型都变得便宜,而是获得相当能力水平的成本大幅下降。

Stanford 2025 AI Index 在固定性能门槛下衡量了推理成本。推理是指训练完成的模型响应请求时所需的计算工作。

推理成本数据显示,从 2022 年 11 月到 2024 年 10 月,成本下降超过 280 倍。该比较采用的是在 MMLU 知识基准测试中达到约 GPT-3.5 水平性能的系统。

这一方法很重要,因为单纯比较模型价格可能会产生误导。较新的系统可能每个 token 收费更高,却能以更少的 token 或更少的重试完成同一任务。

固定性能比较提出了一个更有用的商业问题:企业如今要花多少钱,才能获得接近早期某一能力水平的结果?

对于若干常见语言任务,答案是成本已迅速下降。Stanford 还报告称,视基准测试和任务而定,年成本降幅介于 9 倍至 900 倍之间。

多种因素正在共同发挥作用。更小的模型能力增强,硬件性能提升,提供商也优化了训练模型处理请求的方式。

模型架构也发生了变化。混合专家系统会针对每个请求激活模型的部分组件,而不是每次都使用全部参数。量化则降低了许多计算所需的数值精度。

缓存可以避免系统反复处理相同的上下文。批量推理将请求分组,使提供商能更高效地利用计算资源。

这些方法并不会在每种应用中带来完全相同的节省。长链推理任务、图像生成、视频处理和大上下文分析仍可能需要大量计算资源。

不过,这一趋势很难忽视。Artificial Analysis 独立追踪各提供商的模型质量、速度和运行要求。其效率趋势显示,达到既定智能水平的成本仍在持续下降。

顶级模型之间的性能也在收敛。Stanford 2026 AI Index 将 Anthropic、xAI、Google、OpenAI、Alibaba 和 DeepSeek 的模型列入了一个相对接近的性能区间。

这种收敛使竞争重心转向可靠性、延迟、部署控制以及每项完成任务的成本。提供商已无法完全依赖拥有最高的通用基准分数。

Google News 并未创造这一趋势。它揭示了更多商业领袖如今需要回答的一个问题。

如果可用的智能变得充裕,下一步有哪些流程会在经济上适合自动化?

更便宜的 AI 改变了自动化门槛

更低的推理成本扩大了值得测试的任务范围,尤其是大型组织中高频重复的任务。

每项自动化提案都有一个经济门槛。预期的人工节省、速度、质量和收入提升,必须超过开发、运营、审查和故障成本。

模型使用只是这项计算中的一个部分。然而,当工作流需要处理数百万份文档、消息、通话或交易时,它也可能成为一笔可观开支。

更低的模型费用改善了高量任务的经济性,也让团队拥有更多空间开展评估、比较输出和重试失败步骤。

以保险公司对收到的文档进行分类为例。系统可以识别文档类型、提取字段,并将不确定的案例转交给员工。

模型并不需要自主裁定理赔。它只需在不遗漏异常案例的前提下,减少分类工作量。

零售商可以将同样的模式应用于商品描述、客户消息或供应商记录。软件团队则可以在将 bug 报告分配给正确的代码仓库前先进行分类。

销售运营团队可以汇总客户活动并起草后续跟进记录。法务团队可以在已批准的文档集合中定位条款,同时仍由具备资质的审阅者负责解释。

在最近一轮成本下降之前,这些事情在技术上就已可行。更便宜的推理改变的是企业可以处理多少记录,以及能够多频繁地复核结果。

它也支持模型路由。路由系统将简单请求发送给较小的模型,并将更强大的系统留给复杂案例。

这种设计类似于组织在初级员工、专家和管理者之间分配工作。不同之处在于,路由规则必须根据真实的错误模式进行测试。

更低的成本还可以支持并行验证。两个模型可以处理同一个敏感请求,而另一组件则比较它们的结论。

这种方法会增加计算工作量。但当单次调用变得便宜时,它仍可能具备经济性。

最有潜力的早期候选任务具有若干共同特征:输入可衡量、重复频繁、能够接受结构化审查,并且错误可恢复。

涉及不可逆决策的任务需要采用不同标准。雇佣行动、信贷决策、医疗判断和法律承诺,需要比常规分类更严格的治理。

企业采用范围已经在扩大。Stanford 的企业采用研究结果称,88% 的受访组织在 2025 年使用了 AI。

同一研究称,70% 的组织至少在一个业务职能中使用了生成式 AI。然而,几乎所有职能中的智能体部署比例仍只有个位数。

这一差距才是更便宜 AI 背后的真正故事。企业广泛使用模型,却很少将持续、独立的行动托付给它们。

因此,自动化的下一阶段取决于能否缩小生成内容与完成受控工作之间的距离。

低价模型面对高成本工作流

模型访问正逐渐成为一种商品,而工作流设计仍具有高度特定性、劳动密集性且难以复制。

模型可以总结合同,却不了解谁有权批准其建议。它可以起草客户回复,却不知道哪些退款需要升级处理。

这些规则存在于政策、数据库、团队习惯和未记录的例外情况中。它们很少以适合自动化的清晰格式出现。

可靠的工作流必须连接多个层面:正确的数据、权限、提示词、工具、验证规则、日志和恢复路径。

每一层都会带来故障模式。模型可能检索到过时的政策、调用错误的工具、误读含糊的请求,或以无效结构返回看似有效的文本。

组织必须决定下一步如何处理。系统应当重试、请求澄清、升级处理,还是停止?

这一决策无法从通用模型基准中得出。它取决于具体业务流程以及出错的后果。

数据准备往往成为第一个高成本瓶颈。企业信息分散在文档、聊天系统、工单工具、本地文件和员工记忆之中。

重复文档会导致相互矛盾的答案。缺乏明确的责任归属,会使人无法判断哪个来源应当主导决策。

这也是为什么知识管理仍与自动化紧密相关。可靠的智能体需要访问最新信息,但也需要对这种访问设置边界。

诸如个人知识库之类的工具可以改善研究和个人工作流中的检索能力。企业自动化还需要额外的权限、保留和审计控制。

评估构成了另一个成本中心。团队不能仅凭几次令人印象深刻的演示来判断生产系统。

他们需要具有代表性的测试案例,包括罕见输入和对抗性请求,也需要清晰定义何为可接受的行为。

准确率本身可能无法反映运营风险。一个支持智能体即使能正确回答大多数问题,仍可能在少数情况下作出未经授权的承诺。

这种罕见错误可能抵消数千次成功回复的价值。因此,企业必须衡量严重程度,而不仅是发生频率。

人工审查同样存在设计成本。要求审批每一项输出,可能会消除自动化带来的效率提升。

完全取消审批则可能使企业暴露于不可接受的错误之中。有效的系统会围绕不确定性、重大后果和异常活动设置审查机制。

集成工作会进一步增加成本。许多业务系统是为可预测的软件构建的,而不是为概率性的智能体而设计。

传统软件遵循明确规则。生成式模型即使面对看似相同的输入,也会生成措辞和推理路径各异的答案。

开发人员必须将这些输出转化为受控行动。结构化模式、受限的工具权限和确定性的政策检查有助于降低不确定性。

上线后仍必须持续监控。模型提供商会更新系统,内部数据会变化,用户行为也会发生转移。

一个在测试期间表现良好的工作流,可能会在出现新产品名称或新政策时退化。推理成本下降并不能消除这种维护负担。

它甚至可能因鼓励更多试验而加重这一负担。企业可能迅速积累数十个彼此割裂、缺乏一致责任归属或评估机制的助手。

最终胜出的组织,不会是调用模型次数最多的组织。它们将建立可重复的方法,把低成本调用转化为受治理的结果。

业务自动化从辅助走向行动

最具影响力的变化始于 AI 从起草答案转向改变记录系统。

许多当前部署都在辅助员工,却并不独立采取行动。它们总结会议、起草电子邮件、建议代码或检索文档。

这些应用在模型与最终决策之间保留了人工环节,因此能够创造价值。错误会在触及客户或运营系统之前被发现。

具备自主能力的工作流跨越了这条边界。AI 智能体是一种为实现目标而选择并执行步骤的软件,通常会调用外部工具。

一名服务智能体可能会检索订单、核查政策、提供获批的解决方案,并更新支持工单。采购智能体则可能会将请求与采购规则进行比对。

更低的推理成本为这类工作流提供了支持,因为智能体往往需要多次调用模型才能完成一项任务。它可能需要制定计划、检索信息、验证细节,并检查自身结果。

相关指标不再是每个 token 的成本,而是经过重试、审核和纠正后,每项成功完成任务的成本。

看似便宜的模型,如果反复失败,最终可能成本高昂。能力更强的模型若能以更少步骤稳定完成任务,反而可能更具经济性。

因此,企业应评估完整工作流,而非孤立的提示词。他们需要衡量完成率、异常率、审核时间、延迟以及下游错误。

小型模型与前沿模型之间的比较也会变得因任务而异。紧凑型模型或许能很好地处理分类,但难以应对含糊不清、多步骤的请求。

路由机制可以结合两种方法。简单案例可以使用较小的系统,而异常案例则交由更强的模型或员工处理。

这种结构让自动化可以循序渐进。企业无需在人工工作与完全自主之间二选一。

他们可以先从提供建议开始,再允许受约束的操作。只有在经过衡量的表现证明可行后,才应赋予更广泛的权限。

软件工程提供了一个有用的例子。模型已经能够起草代码、解释代码库、生成测试并调查错误。

允许智能体修改生产基础设施的风险要高得多。该工作流需要隔离环境、测试、访问限制和回滚机制。

客户支持也遵循同样的演进路径。起草回复不同于发放退款、注销账户或修改合同。

知识工作同样存在隐藏的依赖关系。一项研究任务可能需要区分已获认可的证据与推测。

更便宜的 AI 让反复搜索和综合分析变得更具经济性。但这并不能保证系统能够识别权威来源。

这种差异给模型提供商和企业软件供应商带来了压力。提供商必须证明其系统能够交付可靠结果,而不只是展示亮眼的基准测试分数。

软件供应商必须说明权限、可观测性和人工升级机制如何运作。仅有对话式界面并不等同于业务自动化。

员工也将面临不断变化的预期。当模型能够快速产出可接受的初稿时,常规起草工作的价值会下降。

判断力、异常处理、来源验证和流程所有权将变得更为重要。这些技能决定了自动化何时应继续、何时应停止。

自动化前沿将以不均衡的方式推进。结构化的后台工作通常会率先推进,而模糊且高责任风险的决策将保留更强的人类控制。

成本下降未能揭示的内容

更低的推理成本减少了一项支出,但也可能增加整个组织的使用量、风险暴露和基础设施需求。

第一个不确定性在于衡量方式。某一基准门槛下成本的大幅下降,并不意味着每种现代工作负载的成本都以同等幅度降低。

MMLU 通过多项选择题衡量广泛的学术知识。它并不直接测试工具使用、长时间运行的研究、政策合规性或生产环境可靠性。

推理模型可能在生成答案前消耗大量 token。自主工作流可能产生漫长的调用链和工具交互。

因此,更低的单位成本可以与更高的总账单并存。这类似于效率提升使资源更易消耗时出现的反弹效应。

需求增长的速度可能快于效率改善。更多员工会使用系统,更多产品会嵌入它,工作流也会从偶尔运行变为持续运行。

基础设施需求依然十分可观。国际能源署预计,到 2030 年,数据中心需求将增长逾一倍。

该机构指出,AI 是这一增长最重要的驱动因素。即使单次模型调用变得更高效,地方电网限制仍可能延迟容量扩张。

随着自动化规模扩大,风险成本也可能上升。一个每执行一千次操作就出现一次严重错误的系统,在执行数百万次操作时会变得更危险。

生成式系统可能产生虚假声明、泄露敏感信息,或遵循隐藏在检索内容中的恶意指令。

提示词注入就是一个例子。攻击者将指令放入 AI 系统之后会读取的数据中,试图覆盖原本预定的工作流。

受限工具和确定性检查可以限制损害。但没有任何单一防御措施能够消除监控和事件响应的必要性。

NIST 的生成式 AI 概况为聚焦成本的讨论提供了有益的平衡视角。它强调 AI 生命周期中的治理、衡量和风险管理。

企业还必须考虑供应商依赖问题。较低的初始成本可能吸引那些日后难以迁移的工作负载。

模型在输出格式、工具接口、安全行为和上下文处理方面各不相同。更换提供商可能需要进行新的评估和工作流调整。

开放权重模型提供了另一条路径。企业可以通过云服务或受控基础设施部署它们,从而在数据处理和定制方面获得更大灵活性。

这种灵活性会将运营责任转移给企业。团队必须管理托管、更新、安全性和性能。

对劳动力的影响同样仍不确定。更便宜的自动化并不会直接转化为成比例的岗位减少。

企业往往会先重组任务,再调整人员规模。员工可能会减少起草时间,把更多时间用于审核、协调或处理异常。

设计不佳的自动化甚至可能制造额外工作。员工可能需要纠正那些比明显失败更难察觉、却看似合理的错误。

领导者应将更低的模型成本视为更谨慎测试的许可,而不是取消控制措施的许可。经济机会确实存在,但验证缺口也同样存在。

三个信号将揭示企业下一步自动化什么

下一阶段将通过工作流完成率、企业软件控制能力,以及持续运营价值的证据显现出来。

第一个信号是生产环境中的任务级表现。关注企业是否报告已完成的成果,而非模型采用情况或员工访问权限。

有用的指标包括成功案例解决率、异常发生频率、审核时间、回滚率和客户纠正情况。

越来越多的可靠完成案例将强化“更便宜的 AI 推动自动化扩张”的论点。持续偏高的升级处理率则会削弱这一论点。

第二个信号是企业平台如何打包智能体控制能力。供应商正越来越多地提供工具权限、评估系统、审计日志和人工审批步骤。

这些功能比又一个对话式界面更重要。它们决定了企业能否在不失去问责能力的前提下,赋予模型有限权限。

标准化控制措施将减少许多用例中的部署工作。碎片化的控制措施则会让每个项目都保持高成本和低效率。

第三个信号是持久财务价值的证据。企业应将自动化与周期时间、服务质量、收入或可衡量的运营节省联系起来。

单凭模型使用量并不能证明价值。围绕异常干净示例构建的演示也同样不能。

如果多个季度持续取得收益,便说明组织解决的不只是推理经济学问题。这将表明其在流程再设计、数据质量和采用方面取得了进展。

疲弱或不一致的收益则意味着,廉价模型主要增加了试验活动。这种结果仍会使提供商受益,但不会证实广泛的自主自动化。

Google News 将持续推送有关模型成本下降的报道,因为这些数字确实引人注目。企业领导者应将这些数字视为分析的起点。

决定性的问题不是一次 AI 请求是否变得更便宜,而是整个工作流是否已足够可靠,能够反复执行。

团队现在就可以采取行动,而无需授予广泛自主权。他们可以选择一个高频流程,界定其失败边界,并衡量每一次交接。

他们可以根据已完成任务的结果比较不同规模的模型。也可以识别哪些决策必须保持确定性,或需要人工批准。

那些完成这项工作的企业,将比一味追逐最便宜模型的企业更能从成本下降中获益。他们会知道低成本智能在哪些地方能够创造杠杆效应。

你所在的组织中,哪个流程具备足够的规模、证据基础和可逆性,值得开展一次受控自动化测试?从那里开始,衡量完整结果,并仅在证据支持时扩大范围。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page