top of page

Stanford AI Index 显示更便宜的模型、更激烈的竞争

Stanford AI Index 显示更便宜的模型、更激烈的竞争

2026 年 Stanford AI Index 报告显示,前沿模型的训练成本同比下降 30%。前五名系统在大多数基准测试上的性能差距缩小至个位数百分比。提供商现在在速度、可靠性和集成方面展开竞争,而非原始能力。

这一转变改变了激励机制。较低的成本降低了新进入者的门槛。较小的差异迫使买家评估总拥有成本,而非标题分数。报告指出:“训练前沿模型的成本同比下降约 30%,这得益于硬件效率和利用率的提升。”Stanford AI Index 2026, Section 2.3

Stanford AI Index数据显示,每百万 token 的中位推理价格从 2024 年的 2.10 美元降至 2025 年的 0.85 美元。同一报告列出了 26 家发布模型达到 2023 年 GPT-4 水平的机构。没有单一实验室在每项任务上都保持决定性领先。

Training Expense Trends Signal Volume Over Moat

2025 年年中,最大模型的训练运行成本约为 1.2 亿美元。这一数字是两年前同等运行估计支出的二分之一。云提供商将新一代 GPU 和利用率提升带来的节省直接传递给客户。

这一下降将收益集中在应用层。曾经预算数亿美元的团队现在每季度可运行多次实验。资本要求不再保护现有企业。

Stanford AI Index数据还追踪了每次训练运行的能耗。2024 年至 2025 年间,模型的平均能耗下降 22%。效率提升主要来自软件调度,而非仅靠硬件。

Performance Convergence Raises Differentiation Questions

报告中的基准表格显示,在大多数学术任务上,得分最高的五个系统的置信区间重叠。MMLU、GPQA 和 HumanEval 的差距在四个百分点以内。

因此,买家开始审视次要指标。固定吞吐量下的延迟、上下文窗口价格以及微调稳定性现在成为决策驱动因素。一家大型银行的分析师表示,模型选择在六个月内从排行榜排名转向采购电子表格。

报告指出,开源权重模型在相同任务上缩小了与闭源模型 85% 的差距。这种 parity 消除了企业接受更高价格的一个传统理由。

Buyers Shift Focus To Integration And Reliability

企业采购团队报告称,每个新工作流会测试三种或更多模型。他们表示,一旦达到能力阈值,合同灵活性和供应商支持响应时间将成为首要选择标准。例如,JPMorgan Chase 在审阅 Index 中记录的性能差距缩小后,更新了 2025 年供应商 RFP,要求双提供商部署并进行季度可靠性审计。

Stanford AI Index调查数据显示,62% 的组织现在在生产环境中至少运行两个提供商。主要原因是担心速率限制变化,而非质量差异。

报告中的可靠性指标包括峰值负载期间的正常运行时间以及长上下文下的性能下降。即使标题准确率落后,每周发布这些数据的提供商也获得了份额。

Open Questions Around Data And Evaluation Quality

指数作者指出,许多新基准重复使用了早期模型的训练数据。流行排行榜的重叠估计在 15% 到 35% 之间。这种重复压缩了表面上的进步。

报告中引用的独立研究人员呼吁收集 2025 年后的全新留出集。在这些数据集出现之前,已发布的增益存在未量化的向上偏差。

两个司法管辖区的监管机构已开始要求提供用于公共服务的模型的方法细节。Stanford 团队预计,明年披露要求将扩大。

Watch Training Cost Curves And Procurement RFPs

三大云提供商下季度财报电话会议将显示推理价格削减是否继续。持续的季度 20% 降幅将加速指数中已显现的量策略。

十大银行和零售商的采购通知将揭示多提供商授权是否成为标准合同语言。早期模式表明它们会。

Stanford AI Index 下一版定于 2027 年 4 月发布。它将新增一个关于评估污染的部分。该部分将确定当前收敛数字在更严格条件下是否成立。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page