top of page

Epoch AI 成本报告发现,AI 价格下降速度快于摩尔定律

4天前
讀畢需時 12 分鐘

Epoch AI 表示,自 2023 年以来,达到固定 AI 性能水平的成本每季度下降了 47%。这份新的 Epoch AI 成本报告将这一速度换算为年度成本下降 13 倍,远快于计算硬件在历史上的改进速度。

这一发现并不意味着每一笔 AI 账单都会以相同幅度下降。它衡量的是在涵盖数学、科学和游戏的五项基准测试中,达到既定分数的最便宜可用方式。这一区别很重要,因为较新的模型可以在消耗更少资源或使用更低成本基础设施的情况下,提供相近结果。

与摩尔定律的对比仍然引人注目。数十年来,计算成本持续下降,推动了个人电脑、智能手机和云服务的发展。Epoch AI 认为,经性能调整后的 AI 价格目前下降速度是历史计算成本下降速度的六倍。

直接受益者是能够在不同模型之间迁移工作负载的开发者和组织。压力则落在需要持续收入的 OpenAI、Anthropic、Google 以及第三方 AI 服务商身上。高端模型可以建立领先地位,但其经济优势可能在数月内消失。

这形成了核心矛盾。更廉价的智能支持更广泛的采用,但同样的价格下降会削弱基于价格的忠诚度,并压缩单纯模型访问的价值。更持久的商业价值或许存在于模型层之上,即产品能够保留上下文、工作流集成、信任和专有数据的地方。

Epoch AI 成本报告实际衡量了什么

Epoch AI 衡量的是获得结果的成本下降,而不只是 AI token 的标价。

这家研究机构于 2026 年 9 月 22 日发布了成本分析。研究人员 Luke Emberson 和 David Roodman 考察了自 2023 年以来五项基准测试中的模型性能与成本。

这些基准测试涵盖数学、研究生级科学、国际象棋及其他技能型游戏中的高难度问题。随后,Epoch AI 估算了在不同时间点达到各个可实现性能水平的最低成本路径。

这条边界被称为帕累托前沿。它代表了在给定成本下能够提供当前最佳性能的模型。处于该前沿之外的模型成本更高,却无法提供更好的结果。

该方法还考虑了推理预算。推理模型可以花费更多输出 token 来思考问题,从而提高答对的概率。因此,单纯的 token 价格并不能揭示完成一项任务的完整成本。

Epoch AI 使用评估记录来估算不同预算限制下性能的变化。该方法遵循联邦 AI 标准与创新中心(CAISI)的研究工作。它为每个模型生成成本—性能曲线,而不是将模型简化为单一标价。

当两个模型使用 token 的方式不同,这一区别就变得重要。token 更便宜的模型在完成任务前可能会生成更多 token。当从提出问题到获得正确答案来衡量时,其表面价格优势可能消失。

在五项基准测试中,Epoch AI 计算得出的平均经性能调整后的成本降幅为每季度 47%。若这一趋势持续复利计算,相当于一年内成本大约降低 13 倍。

不同领域的速度有所差异。基于游戏的谜题价格每季度下降约 39% 至 43%。数学基准测试的下降更快,每季度约为 50% 至 52%。

一个例子说明了这一规模,而无需依赖 token 标价。Epoch AI 比较了两款发布时间相隔不足 18 个月的 OpenAI 模型。据报道,后者以约为前者成本七百二十五分之一的代价,达到了相同的 GPQA Diamond 分数。

GPQA Diamond 是一项围绕物理、化学和生物研究生级问题设计的多项选择基准测试。它捕捉了一种高要求的推理能力,但并不涵盖全部有用工作的范围。

因此,这一头条数字最好被理解为衡量已测能力的价格指数。它并不描述训练成本、企业支出或每位客户的账单。它追踪的是从当前最具成本效益的可用模型处购买某项基准测试结果所需的最低成本。

这一结果也与此前证据一致。Stanford 的 AI Index发现,在 2022 年 11 月至 2024 年 10 月之间,达到 GPT-3.5 水平性能的成本下降了超过 280 倍。

Stanford 的发现使用的是广泛知识基准 MMLU,而非 Epoch AI 的完整成本—性能曲线集合。不同方法会得出不同的速度,但二者都指向一个异常陡峭的下降趋势。

这种一致性比任何单一估算都更重要。独立数据集日益显示,有用的 AI 能力正以远快于其底层硬件成本的速度变得更便宜。

为什么 AI 性能价格下降如此之快

这种下降结合了更优算法、更小但能力更强的模型、改进的硬件,以及供应商之间激烈的竞争。

摩尔定律描述了晶体管密度随时间增长的历史趋势。这个说法也常与计算成本下降相关联,尽管晶体管数量与客户价格并不是相同的衡量标准。

Epoch AI 估计,1940 年至 2001 年间,计算价格以每年约 1.51 倍的复合速度下降。其估算显示,自 2023 年以来,AI 性能价格每年约下降 13 倍。

差异的存在是因为 AI 受益于的不只是半导体进步。模型开发者同时改进架构、训练方法、数据选择、量化、推理软件和硬件利用率。

量化降低了用于存储和运行模型的数值精度。在谨慎应用的情况下,它能降低内存和计算需求,同时保留模型大部分有用性能。

专家混合系统提供了另一条路径。它们针对每个输入仅激活模型的部分组成,而不是使用全部参数。这种设计可以提高能力,而无需让整个网络处理每一次请求。

蒸馏将更大模型中的有用行为迁移到更小模型中。较小模型随后能够以更低延迟和资源消耗处理常规任务。组织可以将更大模型留给那些其额外能力会改变结果的问题。

竞争放大了这些工程收益。供应商不断发布更小的模型,目标是接近早期旗舰模型的性能。开放权重模型也让独立托管方能够在服务效率上展开竞争。

一篇 2026 年的研究论文 The Price of Progress使用 Epoch AI 和 Artificial Analysis 数据得出了更保守的结论。该论文估算,可比较基准性能的年度成本下降幅度为五倍至十倍。

作者将这种下降归因于硬件效率、算法收益和经济竞争。在尝试区分硬件与市场因素后,他们估计算法效率带来的年度进步约为三倍。

这一估计低于 Epoch AI 每年下降 13 倍的头条速度。差距并不意味着任一分析毫无用处。它表明,结果高度取决于基准测试、性能阈值、模型集合和前沿定义。

Epoch AI 的指标偏向于每个能力水平下最便宜的可用模型。这一框架假设买方非常活跃,会定期重新评估市场,并切换至当前成本领先者。

实际组织的行为有所不同。它们要花时间测试模型、重写提示词、检查安全性、更新评估并重新谈判合同。这些切换成本使许多用户无法获得完整的理论降幅。

该研究还发现,性能水平首次出现后,价格下降最快。在其五项主要基准测试中,接近前沿的性能在初期每季度便宜了 66%。

在某一性能水平首次出现两年后,估计季度降幅放缓至 32%。这仍代表快速的年度成本下降,但不如初期竞赛那样显著。

Epoch AI 表示,新能力会在短期内获得溢价。随后,竞争对手会复制或接近这种能力,而原供应商则优化服务成本。随着该能力变得普遍,溢价便会缩小。

这种模式解释了为什么总体降幅能够快于摩尔定律。市场并不等待新一代芯片。它将软件、模型、基础设施和竞争改进叠加在持续的硬件收益之上。

它也解释了为何 AI 公司在数据中心投入更多资金的同时,这一趋势仍可持续。训练最强模型与为既有能力提供服务,是两种不同的经济活动。

前沿实验室可以向研究投入不断增加的资源,而客户为昨日性能支付的费用却在下降。这个行业正在同时让前沿能力的创造成本更高,也让既有能力的消费成本更低。

更便宜的智能令模型供应商承压

快速的价格下降使原始模型能力成为一种持续贬值的产品,其获得溢价回报的窗口正在缩短。

OpenAI、Anthropic、Google 及其他模型开发者都在竞争,以确立性能前沿。这一地位能够吸引关注、企业试用,以及寻求当前最强系统的开发者。

Epoch AI 的发现表明,这种领先地位会迅速失去经济价值。在五项基准测试中,最快的降幅出现在新近实现的性能水平附近。随着竞争对手追上,领先结果附带的溢价随之减弱。

这带来了艰难的收入问题。实验室需要大量投资来训练、评估、保障安全并运营前沿模型。然而,在该模型获得长期商业生命之前,客户愿意为固定能力支付的价格就可能下降。

原始新闻分析强调了由此给客户忠诚度带来的挑战。如果在数月内就有性能相当的模型变得更便宜,买方就有理由持续保留替代选择。

第三方 AI 服务面临的问题更加尖锐。一个仅仅转售单一模型访问权限的产品,可能被使用更新模型的另一项服务压价。

客户也可能质疑是否应长期承诺于任何单一供应商。今天更受青睐的模型,可能在下一轮发布周期后失去优势。固定架构会将上游成本下降转化为迁移压力。

市场反应已体现在产品设计中。供应商越来越多地通过编程环境、智能体、文件系统、连接器、记忆、安全控制和部署选项展开竞争。

这些功能创造了基准测试无法衡量的价值。当周边服务理解一家公司的权限、术语、文档和审核流程时,切换模型就会更加困难。

可靠性同样重要。当一个更便宜的答案会触发更多人工审查时,企业并不会从中获益。真正有用的指标是完成可接受工作的总成本,其中包括失败和监督成本。

延迟带来了另一层差异。两个模型可能取得相近的基准测试分数,但响应所需时间不同。交互式产品往往更看重可预测的速度,而非推理成本的小幅降低。

隐私和治理也可能比价格更重要。买家需要知道数据流向何处、提供商保留数据多久,以及管理员能否执行访问规则。

这些因素为成熟厂商提供了抵御纯价格竞争的防线。熟悉的界面、既有集成、安全审批以及积累的用户上下文,都会形成实际的切换成本。

然而,这些防线只有在产品提供模型选择之外的价值时才有效。面对大量能力足够的替代品,一个只有通用提示词的轻量包装几乎没有保护力。

最强的独立服务很可能会将模型视为可替换的基础设施。它们可以将简单任务路由到高效系统,并将高端能力留给困难的工作。

这种方法需要评估,而不是忠诚。开发者需要针对自身使用场景建立有代表性的测试,包括质量、延迟、失败率和端到端资源消耗。

这也改变了组织看待 AI 采购的方式。问题不再是哪一个单一模型赢得每一项基准测试,而是哪一种组合能够在不同任务中交付可接受的结果。

知识密集型产品还有另一项优势。能够组织用户可信信息的系统,即使底层模型发生变化,仍可保有价值。积累的上下文属于工作流,而非某一代模型。

这正是 AI 知识库 能够比原始聊天访问更具持久性的原因。它的价值来自检索、组织、权限管理,以及跨重复工作任务的连续性。

模型成本下降可以改善这类产品的利润率。它们可以在不提高面向客户成本的情况下使用更强的模型,或将 AI 应用于工作流中的更多步骤。

同样的下降趋势也可能伤害那些主要依靠访问权限竞争的服务。随着人工智能变得更便宜,差异化将转向专有上下文、可靠执行和可衡量的业务成果。

这些数字无法证明什么

经基准测试调整后的价格下降是真实证据,但并非衡量有用或可信工作成果的通用标准。

Epoch AI 直接说明了多项局限性。其主要数据集覆盖约三年,包含不完整的模型与基准测试组合,并且存在噪声估计。

对于与以数十年为尺度衡量的技术进行比较而言,这是一个很短的时间窗口。计算、电池、测序和电力也对应不同的产品、市场和性能定义。

这些比较仍提供了历史尺度。不过,与一单位电力或电池容量相比,基准测试答案的物理标准化程度更低。

基准测试优化带来了另一项担忧。开发者可能有意或无意地在与热门评测相似的任务上训练模型。于是,模型在测试中的表现可能比在陌生的真实场景中提升得更快。

Epoch AI 将这种风险称为 benchmaxxing。随机化的基准测试元素可以降低识别和记忆的可能性,但无法消除所有形式的污染或针对性优化。

高分也不能保证可靠的工作表现。GPQA Diamond 衡量的是对高难度科学问题的回答。它并不衡量模型能否维护一个项目、遵循公司政策,或避免代价高昂的错误。

NIST 的评估指南强调,模型比较取决于任务设置、工具、提示词、推理等级、样本数量和评分方法。细微的配置差异都可能改变性能与成本。

CAISI 评估也说明了为何端到端测量至关重要。令牌费率较低的模型可能消耗更多令牌、使用更多工具调用,或更频繁地失败。因此,它的总任务成本可能高于表面上昂贵的竞争对手。

真实用户也不会像 Epoch AI 的前沿方法所假定的那样高效地切换模型。迁移需要测试、集成工作、风险审查和员工培训。

一家企业可能理性地继续使用价格更高的提供商,因为该提供商已满足安全要求。另一家企业可能重视稳定的输出,因为变化会扰乱自动化工作流。

需求可能会吸收部分节省。当 AI 任务变得更便宜时,开发者往往会更频繁地运行它、扩大上下文、请求更多候选结果,或增加验证阶段。

这是杰文斯效应的一种形式。效率提高会降低每单位的成本,但总消费量可能增加到足以维持甚至提高整体支出。

推理模型会强化这一效应。更高效的基础模型可以投入额外计算来检查答案或探索替代方案。用户获得更好的结果,却不一定会看到总使用量按比例下降。

该报告也没有表明前沿模型开发已变得廉价。训练一个新的领先模型,与提供已知能力所需的资源不同。

研究团队需要为实验、专业劳动力、数据准备、评估和基础设施付费。即使成熟任务的推理成本大幅下降,这些成本仍可能上升。

这种区别化解了一个表面上的矛盾。模型提供商可以宣布规模巨大的基础设施计划,同时其输出按性能调整后的价格仍在持续下降。

因此,该报告支持一个范围有限但重要的结论:在市场前沿,可比较的已测量能力已经变得便宜得多。

它并不能证明每一种工作负载都以相同速度改善,也不能保证安全性、可靠性、隐私、延迟或集成质量等同。

买家应将 47% 的季度降幅视为市场信号,而非预算预测。其方向似乎得到了充分支持,但确切速度仍对衡量选择和用户行为敏感。

将检验 AI 成本下降的三项信号

下一项考验在于,基准测试节省能否经受真实工作负载、厂商经济性和日常切换行为的检验。

第一项信号是独立测量的端到端任务成本。更多评估应比较成功完成编程、研究、客户支持和文档工作流所需的总成本。

这些测试需要稳定的任务集、受控的工具和明确的质量门槛。它们应纳入重试、推理令牌、工具调用、延迟和人工审查。

如果这些测量结果以接近 Epoch AI 估计的速度下降,该报告的商业影响将得到强化。若下降显著更慢,则说明基准测试节省夸大了实际收益。

第二项信号是厂商定价和产品打包方式。模型提供商可以通过降低费率、提高使用额度,或将能力捆绑进更广泛的订阅服务来应对推理价格下降。

它们还可以通过智能体平台、企业控制、存储和专有工具保护收入。这些补充将证明竞争正在从基础模型之上展开。

关注提供商将高级功能替换为标准访问的频率。若旗舰级独占功能迅速迁移至更小的模型,将支持 Epoch AI 关于前沿溢价转瞬即逝的发现。

第三项信号是客户切换。前沿计算假定买家会反复选择最便宜且能力足够的模型。真实的采用数据将显示他们是否确实如此行事。

开发者可能会采用路由系统,将每项任务发送给合适的模型。企业可能会在作出长期承诺前,要求加入可移植性条款和标准化评估。

或者,集成式工作流可能会让客户即使面对巨大价格差异,仍留在同一家提供商。这种结果会削弱这样一种主张:性能价格下降会自动摧毁厂商忠诚度。

开放权重模型将影响这三项信号。它们让独立托管方能更自由地优化部署,并在成本上挑战封闭式提供商。但它们也将更多安全、维护和评估责任转移给运营方。

最可能的结果并非统一地竞逐最低费率。AI 市场将分化为不同层级。

在模型层面,可比较的能力应继续面临价格压力。在应用层面,厂商将通过上下文、工作流所有权、信任和执行质量展开竞争。

对于开发者而言,实际的应对方式是保留选择空间。保持模型接口模块化,维护评估集,并衡量任务是否成功完成,而非只衡量令牌消耗。

企业买家也应缩短对成本稳定性的预期。今天看似高效的合同可能很快失去竞争力,即便其底层服务仍然具备能力。

知识工作者应预期 AI 功能将扩展到更多产品中。更低的推理成本,使摘要、检索、起草、分类和后台处理在更多场景下变得经济可行。

Epoch AI 成本报告并未定论该行业将变得多么盈利。它确实表明,获得固定水平的已测量智能正以前所未有的速度失去稀缺性。

现在,每个 AI 产品都面临一个具体问题:如果模型能力能在一年内便宜 13 倍,什么价值仍然独特?拥有可信上下文和可靠工作流的产品已有答案。除模型访问外几乎不提供其他价值的服务,仍需要找到答案。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page