top of page

企业为何难以为 AI 定价

Google News 在 8 月 4 日推送了一篇 BBC 报道,揭示了人工智能领域日益加剧的一场矛盾:企业仍无法确定一款 AI 产品究竟值多少钱。

这种不确定性如今影响着模型开发商、软件供应商、企业买家,以及批准部署方案的财务团队。AI 可以按用户、token、操作、对话、容量或业务结果出售。每一种选择都以不同方式转移成本与风险。

随着 AI 超越聊天功能,这一问题变得更加棘手。OpenAI 和 Anthropic 推广了基于 token 的访问方式,而 Microsoft 和 Salesforce 则将智能体引入成熟的企业软件。智能体在完成一次请求前,可能会进行多次模型调用、搜索公司数据、使用工具,并修订自己的工作结果。

传统软件定价假设,增加一名用户几乎不会带来额外运营成本。AI 打破了这一假设,因为每一次生成回复都会消耗计算资源。智能体系统会针对每项任务进行难以预测的工作量,使这种错配更加明显。

结果便是在可预测的订阅制与浮动的按量消费之间展开较量。供应商需要收入能跟随计算成本变化。客户则需要可预测的账单,以及能够证明其合理性的价值。双方都不愿承担全部不确定性。

Google News 的报道表明,市场仍在试验其商业模式

重要的变化并不是某个新价格,而是整个行业正在放弃一种单一、可靠的软件销售方式。

数十年来,软件公司一直让订阅制易于理解。企业统计员工人数、选择功能,并协商合同。使用量可以波动,但账单不会发生大幅变化。

生成式 AI 在客户活动与供应商支出之间建立了直接联系。token 是用于处理和生成文本的小单位,代表模型所完成的工作。更长的提示词、更大的文档、更深入的推理以及重复的工具调用,都会增加消耗量。

该体系看似精确,但精确并不保证清晰。大多数员工并不知道一项任务需要多少 token。采购团队也难以轻易将 token 换算为已完成的报告、已解决的工单或更快的产品决策。

当智能体处理任务时,挑战会进一步扩大。普通聊天机器人可能只回答一次。智能体则可以规划、检索记录、调用外部系统、评估结果并再次尝试。因此,一个可见的请求可能产生许多隐藏的模型操作。

OpenAI 的企业选项体现了这种区别。其 capacity model 允许 API 客户为特定模型快照预留 token 吞吐量。这有助于管理可用性,但买家仍必须估计其应用需要多少容量。

Microsoft 采用了另一层抽象方式。部分 Copilot 和智能体功能采用按量计费,而某些部署仍可使用预付容量。其文档指出,推理模型可在一次交互中启用不止一个计费计量项。

这些做法本身并不不公平。它们反映的是生产成本浮动的服务。然而,在客户尚未完全了解未来使用情况前,它们便将预测工作推给了客户。

经由 Google News 传播的 BBC 标题之所以重要,是因为它描述的是结构性问题,而非暂时性的促销周期。AI 供应商正在试验如何将计算成本、客户价值与易于理解的合同联系起来。这三项要素很少能够同步变化。

更便宜的模型可以降低单次调用的成本,但并不会自动让多步骤工作流变得可预测。高效的智能体可以用更少的调用完成工作,而设计不佳的智能体则可能消耗更多资源,却无法给出更好的答案。

因此,定价成为产品设计问题。计费方式会影响开发者如何构建工作流、用户依赖它们的频率,以及管理者是否允许自主运行。它还决定了哪些失败会带来财务上的痛点。

固定订阅鼓励尝试,但会让供应商暴露在重度用户的风险之下。按 token 计费保护供应商,却可能抑制采用。按结果计费听起来与价值一致,但它要求双方就成功的定义达成一致。

没有任何一种模式能够消除风险。它只是在决定由谁承担风险。

按席位收费的软件与浮动的 AI 成本发生碰撞

AI 供应商希望保留订阅制的简单性,但推理的经济性不断将他们推向按量计费。

按席位定价针对每位获授权用户收费。当软件作为员工直接操作的工具时,这种方式运作良好。客户可通过统计用户人数来估算支出,供应商则从经常性收入中受益。

AI 智能体使这一逻辑变得复杂,因为它们可以在没有持续人工输入的情况下完成工作。一名员工可能启动一个智能体完成一次简单查询;另一名员工则可能启动一套审阅数百份文档、并多次修改输出的工作流。

对两名用户收取相同费用,可能使收入与运营成本脱钩,也使价格与实际交付的工作脱钩。运行较大工作负载的客户获得了更多服务,尽管两个席位表面上看起来完全相同。

相反的模式是按消耗量收费。供应商可以计量 token、消息、模型调用、操作或处理容量。这样一来,收入便能更紧密地跟随技术活动。

Microsoft 的 agent billing guidance 展示了其中可能涉及的细节。不同的智能体功能消耗的量不同,具备推理能力的模型还可能启用独立的计量项。这种细粒度有助于回收成本,但也让预算依赖于工作流的行为。

客户可以监控使用量、设置限额并优化提示词。这些控制措施能在部署后发挥作用,却无法解决更早的问题:一项未经验证的工作流在规模化运行时会消耗多少资源。

这对于知识工作尤其困难。重复性的分类任务具有相对稳定的输入和输出。研究、编程、合同分析和客户支持则充满例外情况,可能使智能体走上更长的处理路径。

支持智能体可能通过一次检索就解决常见请求;罕见的账户问题则可能需要多次数据库查询、政策核查和转交处理。基于活动的计费能够捕捉这种差异,但也意味着当系统遇到棘手案例时,客户要支付更高费用。

这可能形成不良激励。如果智能体工作效率低下,供应商可能赚得更多,而客户承担额外成本。供应商可以通过透明日志、效率目标和支出控制来缓解这一担忧。不过,信任仍会成为商业协议的一部分。

固定订阅则反转了这种激励。当模型和工作流变得更高效时,供应商会受益,因为收入保持稳定,而计算支出下降。然而,无限访问会在用户自动化大型任务或持续运行智能体时带来风险敞口。

混合定价试图分担风险。企业可能在许可证中包含常规使用,然后对高级操作或更高用量单独收费。这既保留了熟悉的入门方式,也限制了供应商无上限的成本。

混合结构也带来自身的复杂性。买家必须了解哪些活动包含在内,哪些会触发新的计量项。如果边界只在部署后才显现,简单的订阅制就会变成不可预测的浮动合同。

这种冲突对成熟软件公司压力最大。它们此前让客户习惯于稳定的按用户合同。现在,它们必须引入浮动计费,同时又不让产品显得像陌生的云基础设施。

模型提供商面临不同的问题。它们的生产单位更容易衡量,但其服务正日益与更便宜的模型竞争。客户可以将简单任务路由给更小的系统,并将高端模型留给要求更高的工作。

这种路由方式削弱了供应商收取广泛溢价的能力。它也让应用层变得更加重要,因为编排决定了由哪个模型执行每项任务。

因此,Google News 的报道不仅仅关乎选择一个数字。企业必须决定自己出售的是访问权、计算能力、劳动力,还是结果。答案会改变计量方式、客户关系和产品本身。

AI 按结果定价听起来公平,直到有人定义成功

按结果定价在理论上将付款与价值挂钩,但归因问题会将这个看似可行的方案变成另一场谈判。

按结果模式会在系统产出约定结果时收费。一家客户服务供应商可能将计费与已解决的对话挂钩。销售产品则可能采用已完成的工作或其他经验证的事件作为依据。

这种做法具有直接吸引力。客户并不想为了 token 本身而购买 token。他们想要的是更少未解决的请求、更快的分析、更好的服务,或已完成的业务流程。

供应商也能获得更清晰的价值叙事。它们无需为不可见的计算单位辩护,而是可以将付款与管理者已经在衡量的事项联系起来。

Salesforce 目前提供多种 Agentforce 结构,而不是一个通用答案。其 Agentforce options 包含基于对话的计费方式和灵活的积分系统。Salesforce 在最初的方法被证明无法适用于所有工作流后,推出了后者。

这一演变说明了为何按结果定价会变得困难。一段对话可能很短,也可能很长;一次操作可能微不足道,也可能影响重大;一次解决可能源于智能体、客户自身的努力、人类员工,或多个系统的共同协作。

双方首先必须定义可计费事件。随后还需要针对重复请求、重新开启的工单、部分完成、客户放弃、人工干预和错误结果制定规则。

质量又增加了一层复杂性。智能体可能关闭支持工单,却让客户仍感到不满意。它可能将潜在客户归类为合格,却没有带来收入。它也可能起草一份节省时间的合同,但仍需进行大量法务审查。

如果计费依据是首个可见的完成事件,供应商就可能为结案而非持久价值进行优化。如果付款取决于后续业务结果,外部因素则可能淹没智能体的贡献。

按结果定价还会改变责任划分。只在成功时收款的供应商,看似承担了更多绩效风险。实际中,合同可能会缩小成功的定义、排除不确定案例,或要求客户维持特定的数据和流程。

这些条件可能是合理的。智能体无法依靠缺失记录、相互冲突的政策或无法访问的系统交付可靠结果。不过,每一项条件都会削弱“价格只是随价值而定”的说法。

独立买家必须询问:谁控制结果数据?当供应商定义计量方式、运营智能体并报告成功时,客户需要可审计性。他们应能够检查触发计费的事件,并对错误分类提出质疑。

第二个问题涉及优化。智能体是在达到可计费门槛时停止,还是在实现客户实际目标时停止?这两个时点并不总是一致。

第三个问题涉及失败。一个智能体可能消耗大量计算资源,却未能完成任务。在按结果计价的模式下,供应商承担这部分直接成本。可能的应对方式是限制高难度工作流、在合同中计入不确定性成本,或将边界案例转交给人工处理。

这意味着,按结果计费并不会消除技术成本。它只是将成本隐藏在某项业务事件背后,并将风险转移到资格规则中。

对于定义明确、处理量大的工作流,这种模式可以行得通。双方都能衡量事件、审查例外情况并估算发生频率。但对于质量带有主观性的开放式知识工作,这种安排会更困难。

研究备忘录、产品战略或软件设计,通常没有单一的二元成功节点。它们的价值会在之后通过人的决策逐渐显现。按结果收费将需要对质量或影响作出可能引发争议的判断。

这一局限让按使用量和按席位计价得以延续。它们或许并不完美,但计量的是可观察的事物。按结果计价最适用于结果同样可观察且可归因的场景。

更便宜的模型加大压力,但无法弥合预测缺口

竞争可以降低智能的成本,但更低的单位成本并不会让自主工作负载变得可预测。

开放模型和更小型的专业系统赋予企业更强的议价能力。开发团队可以将高端模型用于困难推理,再把常规分类或提取任务交给成本更低的选项。

这种多模型方法降低了对单一供应商的依赖,也让模型选择成为运营决策,而非永久承诺。

这一转变迫使 OpenAI、Anthropic、Google、Microsoft 及其他供应商证明高端服务的价值。当较小模型能够可靠完成客户的实际任务时,原始基准测试领先地位的重要性就会下降。

IDC 认为,AI 竞争正在转向可衡量的结果。其结果分析指出,当企业难以将试点项目推进到核心工作流时,运营准备度仍然是一项主要限制因素。

这一区别至关重要。更低的 token 费率只有在工作负载、提示词、检索系统和工具调用仍然有效时才有帮助。一个需要反复纠正的廉价回答,成本可能高于一次高质量的初步尝试。

智能体设计决定了最终账单的很大一部分。开发者选择提供多少上下文、何时检索文档、调用哪些工具,以及允许多少次重试。他们还决定某项任务是否需要高级推理模型。

提示词缓存提供了一个架构节省的例子。它让应用程序能够复用先前处理过的提示词内容,而无需重新计算相同材料。OpenAI 的缓存文档说明,重复的提示词前缀可以获得与未缓存输入不同的处理方式。

当应用程序反复发送稳定的指令或参考材料时,缓存很有帮助。但当每项任务都使用不同记录或需要新的上下文时,其帮助就较小。

检索可以减少发送给模型的信息量,但低质量检索会带来其他成本。如果系统选择了不相关的文档,模型可能给出较弱的回答,或需要再尝试一次。

人工审查也必须纳入计算。一个 AI 系统在 API 层面看起来可能很便宜,却将验证工作转移给员工。一个有用的成本指标应包含部署、监控、纠正、安全和治理。

这就是为什么仅基于 token 的比较可能误导买家。Token 是一种生产衡量指标,而非对有用工作量的完整衡量。

同样的问题也影响订阅方案比较。名义上无限量的方案可能包含速率限制、模型限制或会改变重度用户可获得服务量的政策。企业需要服务保障和工作负载测试,而不只是一个方案标签。

Google News 的报道越来越多地反映出模型成本下降与总体使用量上升之间的这种张力。随着智能体执行更长的任务,效率提升可能推动更多消耗。每一步成本降低,并不保证总支出降低。

这一模式类似于云计算。更便宜的存储和处理能力扩大了企业构建的内容范围,但总体云账单仍需要积极管理。AI 引入了额外不确定性,因为模型行为和工作流长度具有概率性。

确定性程序遵循定义好的序列。智能体可能会为相似请求选择不同路径。这种灵活性创造了价值,但也使容量规划更加复杂。

企业可以通过任务预算来应对。为智能体设定最大步骤数、工具调用次数或 token 数量。达到限制时,它必须停止、请求批准,或将工作交给人工。

企业也可以按复杂度路由任务。轻量模型处理普通工作,而能力更强的系统只接收困难案例。评估数据应决定这些路由规则。

对于知识密集型工作,维持可靠上下文同样重要。组织良好的知识工作流可以减少不必要的搜索和重复文档处理。不过,信息质量仍需要在实际应用中进行测试。

竞争的最终胜者不会自动属于最便宜的模型,而会属于那些能将可变智能成本转化为可控、可靠工作的系统。

AI 定价指标仍未能揭示什么

每一种现行定价模式都遗漏了价值链的一部分,因此买家应警惕任何声称单一计量方式能够完全协调激励的说法。

Token 定价衡量模型活动量,却不衡量回答是否准确、有用或必要。一个应用程序可以消耗更少 token,却仍然无法完成任务。

席位定价衡量获授权的访问权限,却无法揭示系统完成了多少工作,也无法反映员工是否实际采用它。一家公司可以为许多用户购买许可,却获得很少的运营价值。

按操作定价衡量已执行的步骤。即使更短的路径更好,它也可能激励系统做更多工作。操作的定义也可能因产品而异。

按对话定价创造了一个易于识别的客户服务单位。然而,对话在长度、复杂性和结果上各不相同。重新开启的案例可能暴露出原始互动是否成功这一问题的模糊性。

按结果定价衡量声明的结果。它在归因、质量、延迟效应和外部因素方面面临困难,也容易引发谁控制衡量方式的争议。

没有一种计量方式能涵盖一切。因此,买家需要一组技术和业务指标。

技术层面应包含按工作流、模型、环境和任务类型划分的消耗情况。团队需要关注失败率、重试次数、延迟、工具调用和人工升级。

业务层面应包含完成质量、节省时间、采用情况、客户反馈和监督成本。这些指标应与 AI 部署前设定的基线相连接。

没有基线,供应商和客户都可以声称成功。供应商会指向活动量,客户会指向没有变化的业务结果。双方都无法证明系统究竟改善了什么。

受控试点不应只回答智能体能否完成任务,还应显示简单和困难案例之间的消耗分布。

平均值会掩盖危险的波动。一个智能体可能在大多数请求上很经济,却在一小部分例外情况下成本极高。部署后,这些例外情况可能主导总支出。

买家还需要测试对抗性和格式异常的输入。一个陷入循环、反复调用工具或处理意外大型文档的智能体,可能消耗资源却不交付价值。

支出限制必不可少,但粗放的限制可能中断业务流程。团队应将全局限制与工作流专属控制和告警结合起来。

治理之所以重要,是因为员工往往看不到自身操作带来的商业影响。用户看到的是一个按钮,而背后的系统可能调用多个模型和企业服务。

清晰的界面应披露某项任务何时使用高端推理、大量上下文或自主工作流。目标不是让每位用户都承担 token 记账负担,而是帮助他们理解具有重要影响的选择。

供应商应以客户能够据此采取行动的层级提供计费数据。每月总额并不够。团队需要识别是哪个智能体、工作流或功能导致了变化。

客户也应避免虚假的精确性。一套详细的积分系统可能看起来透明,却仍难以与实际计算活动建立联系。积分有助于打包技术复杂性,但前提是其转换规则保持稳定且有文档说明。

持怀疑态度的观点认为,AI 定价将持续处于未定状态,因为底层产品本身仍在变化。模型能力不断变化,推理方法不断改进,智能体承担新的任务。当价值单位持续变化时,稳定的计量方式难以形成。

这并不意味着企业采用无法实现。它意味着合同应保留灵活性。随着工作流成熟,买家需要能够监控消耗、更换模型、调整限制并重新审视定价。

与此同时,供应商必须避免将复杂性作为掩护。如果客户反复收到意外账单,或无法在内部解释费用,采用速度将放缓,无论模型质量多高。

信任将取决于企业能否在规模化之前预测支出,并在事后完成核对。

三个信号将显示 AI 定价的下一步走向

胜出的定价模式,将是在不让付款脱离有用工作的前提下,使智能体成本变得可预测的模式。

第一个信号是,主要软件供应商是否会在实际企业部署后简化其计量方式。Salesforce 已提供按用户、按对话和灵活消耗选项。Microsoft 则在其智能体产品中结合了许可、预付容量和按需付费结构。

更多选择可以支持不同工作负载,也可能表明供应商尚未找到一个稳定的价值单位。

关注这些公司是否整合其选项,还是继续增加更多区分。整合意味着买家和供应商已识别出可重复的模式。更多层次则表明,智能体行为仍然过于多样,难以适用统一合同。

第二个信号是使用控制的质量。计费仪表板应从按月报告转向工作流级预测、自动异常检测和可执行的任务预算。

这比又一次名义上的降价更重要。当支出可解释时,财务团队可以管理一项相对昂贵的服务;面对一项更便宜但风险敞口不可预测的服务,他们会犹豫。

更好的控制将强化消耗定价。当客户能够追踪、预测并限制活动时,他们可能接受浮动账单。薄弱的控制则会将买家推回固定订阅或范围严格限定的试点项目。

第三个信号是,按结果定价能否经受住混乱业务流程的考验。客户支持提供了最清晰的测试之一,因为对话、解决、重新开启和升级都可以被记录。

如果供应商与客户能够就持久的定义达成一致、高效审计争议并保持服务质量,按结果计费就可以扩展到其他结构化工作流。

如果合同不断累积排除条款,且买家对何谓成功提出争议,按结果定价将仍是一种选择性方案,而非默认模式。

对企业部署的独立分析会比厂商公告更有价值。买方应寻找涵盖总体运营成本的证据,而不只是模型消耗成本。这包括集成、监控、人工审核以及失败任务。

下一代智能体产品很可能支持多种商业模式。日常员工辅助可纳入用户许可证。高吞吐量自动化可采用按量计费。结果可验证的窄流程则可支持按成果计费。

这种混合式未来不如单一通用答案优雅,但也更现实,因为 AI 产品承担的是不同类型的工作。

对开发者而言,定价架构如今已成为系统设计的一部分。模型路由、缓存、上下文管理、重试策略和审批关卡都会影响商业产品。

对企业买方而言,采购不能再在实施开始前就结束。合同条款必须反映实际观察到的工作负载行为,技术团队也需要获得计费数据。

对知识工作者而言,问题不在于每条提示是否都有可见收费,而在于当出现意外消耗后,组织是否会限制有用的工具。

Google News 突出了 AI 经济中一条真实的分界线。供应商正在销售一种软件:其运营成本类似基础设施,而其承诺价值则类似劳动力。传统定价模式都无法完全适配。

决定性的问题很实际:你的组织能否将每项 AI 工作负载与可控成本和可衡量结果关联起来?在供应商让这个答案更容易获得之前,最稳妥的做法是有限部署、透明计量,并且只有在经济性经受真实使用考验后再扩大规模。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page