Anthropic Ars 价格战报告显示:中国 AI 对手正在挤压美国实验室
- Aisha Washington

- 5天前
- 讀畢需時 13 分鐘
Anthropic 在推广高端智能的同时,下调了 Claude Sonnet 5 的计划价格;OpenAI 也大幅降低了两款 GPT-5.6 模型的成本。Anthropic Ars 价格战故事揭示了一场已超出单一公司定价页面的冲突。中国开放权重模型正在缩小性能差距,并削弱“领先的美国实验室能够长期收取溢价”这一假设。
OpenAI 和 Anthropic 仍然拥有业界能力最强的一些系统。然而,许多开发者已不再需要在工作流的每一个环节都使用最佳模型。他们可以将常规编程、研究、分类和文档处理任务路由至更便宜的替代方案。
这一变化改变了商业竞争格局。主要战场不再是 OpenAI 与 Anthropic 争夺单一的前沿王冠,而是封闭的美国平台与一个不断扩大的、低价、可互换且往往开放权重的智能市场之间的竞争。
包括 DeepSeek、Moonshot AI、Z.ai 和 Alibaba 在内的中国开发者,已成为这一市场的核心力量。即使其模型在更广泛的评估中落后于领先者,它们也越来越能够为实际工作提供足够的质量。
OpenAI 和 Anthropic 现在必须捍卫比基准测试领先地位更难的东西。他们必须证明:当可接受的智能能力广泛可得时,客户仍会持续为其平台付费。
Anthropic Ars 价格战报告揭示了什么
直接变化在于,两家领先的美国实验室都开始将可负担性视为一项前线产品特性。
OpenAI 于 7 月 30 日宣布降低 GPT-5.6 Luna 和 Terra 的使用成本。Luna 面向快速、高吞吐量任务,而 Terra 服务于日常知识工作。两者均可通过 OpenAI 的 API、Codex 和 ChatGPT Work 使用。
该公司的效率公告描述了模型行为、推理软件、路由和上下文管理方面的改进。推理是指运行训练完成的模型以生成答案的过程。更高的推理效率让服务提供商能够利用相同的计算能力完成更多有用工作。
OpenAI 还表示,GPT-5.6 帮助优化了其部分服务基础设施。该公司称,模型辅助的内核工作降低了 GPT-5.6 服务的端到端成本。其自动化实验也提升了 token 生成效率。
这些说法尚未获得广泛的独立验证。不过,它们揭示了降价背后的商业逻辑。OpenAI 希望客户相信,较低收费源于工程进步,而非暂时性补贴。
Anthropic 则采取了不同路径。Claude Sonnet 5 以介绍性价格推出,原计划在 8 月后上调。8 月 10 日,Anthropic 将这一较低价格永久化。
修订后的Sonnet 5 发布公告描述了一款旨在覆盖比 Sonnet 4.6 更多成本与性能配置的模型。Anthropic 表示,当用户提高模型的 effort 设置时,Sonnet 5 在某些评估中可接近其更高端的 Opus 模型。
这很重要,因为 effort 设置让开发者能够以额外计算换取更好的结果。客户可以在常规工作中使用较低 effort,并将更高 effort 留给困难的研究或智能体任务。
不过,Anthropic 披露了一项重要限定。Sonnet 5 使用了更新后的 tokenizer,它会将文本转换为模型处理的单位。相同材料产生的 token 数量可能高于 Sonnet 4.6。
因此,较低的单 token 收费并不保证任务最终成本会等比例下降。开发者必须衡量完整任务,包括 token 使用量、重试、工具调用,以及获得正确结果的概率。
这正是 Anthropic Ars 框架重要的原因。OpenAI 和 Anthropic 并非仅仅修订孤立的商业条款。由于客户拥有更多可信替代方案,它们正围绕每美元产出比较重新设计产品。
这一事件形成了文章的核心张力。美国实验室正投入巨资推进前沿智能,但市场越来越青睐那些仅仅“足够好”的模型。
中国开放权重模型正在改变买家的基准
中国 AI 公司正通过改变开发者对质量、控制力和成本可接受组合的判断来施加压力。
DeepSeek 最早展示了这一策略的影响力,其模型凭借高效训练和低成本部署吸引了国际关注。其较新的 V4 系列继续瞄准编程和智能体任务,在这些领域,重复的模型调用会放大微小的成本差异。
Moonshot AI 通过 Kimi K3 施加了类似压力。Z.ai 推进了 GLM 系列,而 Alibaba 扩展了 Qwen。各家公司遵循不同的技术和商业策略,但它们的集体效应十分清晰。
开发者如今无需重建整个应用,就能测试多款中国模型。许多模型是开放权重模型,这意味着其训练参数可由外部组织下载或部署。开放权重并不会自动提供训练数据或完整开发过程,但它们比封闭 API 提供更多控制力。
这种控制力对于担忧数据所在地、服务连续性、定制化或依赖单一供应商的公司而言十分重要。企业可以通过云服务商、专业推理服务或自有基础设施托管开放权重模型。
中国模型的扩张也带来了可量化的采用迹象。AP 报道称,在最近一个月中,中国模型占据了 OpenRouter 最受欢迎的五个位置。
OpenRouter 提供来自众多开发者的模型访问,并记录其平台上的使用情况。其排名并不代表整个 AI 市场。不过,它们提供了一个有用视角,反映出愿意在不同供应商之间切换的开发者群体。
根据 AP 援引的 Sensor Tower 估计,Kimi 在 K3 于 7 月发布后的一周内录得超过 93 万次下载,较前一周增长 200%。
同期,美国下载量约为 8.6 万次,周增长率估计为 387%。由于需求接近其容量上限,Moonshot 一度暂停接受新订阅。
这些数字并不能证明企业会长期采用。应用下载量可能反映好奇心、促销活动或暂时的关注。OpenRouter 也吸引技术用户,他们的行为可能不同于大型企业买家。
即便如此,这一模式削弱了高端模型常见的一种辩护。开发者不仅仅是在讨论中国替代方案;他们正在评估这些方案、将工作负载路由给它们,并且有时发现结果满足实际需求。
一位北卡罗来纳州科技高管告诉 AP,他越来越多地使用 DeepSeek 进行潜在客户研究和销售相关工作。他的理由很直接:大多数用户在大多数任务上并不需要前沿模型。
这一区别对智能体尤为重要。智能体系统通过规划、调用工具、审查结果并持续推进直至达成目标,来执行多步骤工作。一次用户请求可能产生数十次模型调用。
单次响应中不大的差异,在智能体循环中会变成大得多的运营差异。这使得性价比比排行榜的最高分更重要。
结果是一个新的买家基准。封闭模型必须通过可靠性、安全性、集成能力或显著更好的任务完成效果来证明其溢价。仅凭声誉正变得越来越缺乏说服力。
OpenAI 和 Anthropic 面临“足够好”智能难题
核心逆转在于,AI 能力的提升正让模型忠诚度变得更没有价值,而不是更有价值。
多年来,前沿实验室可以假设,更好的模型将吸引用户并支撑更强的定价。客户容忍平台差异,因为能力差距显而易见。放弃领先者往往意味着接受明显较差的结果。
这种关系正在改变。随着多款模型跨过常见工作所需的质量门槛,客户可以基于速度、部署控制力、可用性和任务总成本在它们之间进行选择。
支持分类器不需要卓越的科学推理能力。编程智能体可以用前沿模型完成架构设计,然后将实现和测试委派给更小的系统。研究产品可以将简单的检索和提取任务从其能力最强的模型中分流出去。
OpenAI 现在直接推广这种分层方法。它建议将 GPT-5.6 Sol 用于不确定性处理和规划,再将 Luna 用于定义明确的实现工作。该公司实际上是在主张,其自有的高端智能不应处理每一个 token。
这一架构也解释了为什么独立模型路由器正获得关注。路由器会评估每项请求,并将其发送给最适合该任务的提供商。选择可取决于质量、延迟、隐私规则或预算。
路由降低了应用与单一模型开发商之间独家关系的价值。如果应用能够在同一接口后替换另一款模型,底层智能就更像一个组件。
前 OpenAI 高管 Zack Kass 将这一动态称为“模型回报递减”。其含义是,一旦现有模型已满足大多数客户需求,每一代新模型的重要性都会下降。
AI 商品化辩论使这一风险变得具体。Axios 报道称,DeepSeek 的 V4 Flash 在复杂编程和自主软件评估中接近 Claude Opus 4.8。
一项众包评估将 DeepSeek 模型排在前端编程项目的前面。基准测试结果可能随提示词、评分方法和模型设置而变化。没有任何单一结果能够证明普遍优势。
不过,接近的结果在商业上可能具有重要意义。买家并不要求替代方案赢得每一项基准测试;他们需要的是,它能在自身特定工作负载上提供可接受的结果。
因此,Anthropic 的高端定位不止依赖模型智能。它需要 Claude 在长任务中保持稳定表现、准确遵循指令、安全使用工具,并与企业系统集成。
OpenAI 在更大规模上面临同样挑战。其消费者覆盖范围和开发者平台带来了强大的分发能力。不过,分发必须转化为足够的使用量,以支持对模型和基础设施的持续投资。
这一压力也影响知识工作产品。团队越来越围绕结果而非模型身份设计AI 工作流。当流程保留上下文和源材料时,替换一个模型会变得更容易。
因此,Anthropic Ars 故事并非简单的 OpenAI 对 Claude 比较。它反映的是一个应用可以组合多个模型、且无需改变整体用户体验便可更换供应商的市场。
对于任何寻求持久定价权的实验室而言,这都是一个困难的环境。暂时的能力领先仍可吸引用户,但它已不再保证长期依赖。
高端模型仍具备廉价基准测试忽视的防线
更低的成本为买方带来更多议价空间,但并未消除成熟前沿平台在运营层面的优势。
基准测试分数为不同模型提供了受控条件下的比较。生产系统则提出了不同要求,包括正常运行时间、速率限制、数据治理、支持服务、可审计性,以及更新后的可预测行为。
一个在测试中表现优异的模型,仍可能在长期运行的工作流中失效。它可能调用错误的工具、忽略指令,或产出需要更多人工审核的结果。
这些失误都有成本。当工程师必须增加验证、重复请求或修复不可靠的输出时,廉价模型可能反而成为更昂贵的选择。真正相关的衡量标准是成功完成一项任务的成本,而非单个 token 的收费。
OpenAI 在其 GPT-5.6 相关材料中强调了这一差异。该公司披露了早期客户在速度、上下文利用和任务级效率方面的测量结果。这些案例具有参考价值,但它们来自经过筛选的合作伙伴,而非中立的对比试验。
Anthropic 则通过安全性和精确性提出了类似论点。Claude 的吸引力往往建立在编程质量、长上下文任务能力,以及对敏感任务的审慎处理之上。如果这些特性能够降低失败率,企业可能愿意接受更高的运营成本。
Sonnet 5 还包含在使用过程中识别并阻止危险活动的网络安全防护措施。Anthropic 表示,由于其判断 Sonnet 的整体网络风险较低,这些保护措施比应用于其最敏感模型的限制更少。
此类控制措施可帮助受监管客户,但也会带来权衡。限制可能阻碍合法的安全研究,或使自动化工作变得复杂。买方必须判断这种保护是否符合自身的威胁模型。
中国开放权重模型也存在自身的不确定性。在内部托管模型能够提升控制力,但组织也因此承担基础设施、访问策略、监控、更新和安全测试的责任。
监管担忧同样可能限制采用。美国政策制定者仍在讨论与中国 AI 系统、数据流动和政府使用有关的限制。如果采购规则发生变化,一款技术上合适的模型也可能变得具有商业风险。
开放权重同样无法消除信任问题。组织仍需审查模型行为、许可条件、开发来源,以及用于提供模型服务的软件。
低廉的商业价格也无法保证长期稳定。提供商可能最初优先推动采用,随后随着需求上升或融资环境变化而调整条款。中国和美国开发者都面临同样的可持续性问题。
中国公司面临激烈的国内竞争和巨额亏损。AP 报道称,Z.ai 的收入在上一年增长了 132%,而净亏损增长了 60%。该公司的亏损仍是其收入的数倍。
这种失衡说明,廉价智能并不天然等于有盈利能力的智能。一家公司可以获得用户,同时削弱其为未来训练和基础设施提供资金的能力。
这一审慎结论同样适用于 OpenAI。较低收费可以刺激使用量,但增长的规模必须足以抵消更薄的利润率。一旦客户学会在不同提供商之间调度工作负载,他们也可能对价格变得更加敏感。
Anthropic 将 Sonnet 的调整永久化也带来同样的不确定性。该公司展现出响应市场的意愿,但 tokenizer 的变化使其与上一代模型的直接比较变得复杂。
开发者应使用完整的生产追踪记录自行评估。他们应在具有代表性的任务中衡量准确性、总 token 消耗、延迟、重试次数和人工干预。
价格战显然已经开始。但谁会胜出仍不确定,因为公开费率几乎无法揭示利润率、补贴、基础设施效率或客户留存情况。
万亿美元雄心如今取决于规模
廉价模型对支撑巨额 AI 投资的经济逻辑构成的威胁,大于对任何一次单一产品发布的威胁。
前沿实验室需要为芯片、数据中心、能源、网络、研究和专业人才投入巨额资本。它们的投资者期待这些投入创造的价值不止是短暂的技术领先。
传统软件模式拥有高利润率,因为服务一位额外客户通常成本很低。生成式 AI 则不同。每一次响应都会消耗计算资源,而高级推理可能需要更多推理时间。
智能体应用加重了这一负担。单项任务可能涉及规划、浏览器使用、代码执行、验证和反复纠错。更高的采用率会带来更多收入,但也会产生显著的服务成本。
OpenAI 的战略依赖于效率与需求同步改善。该公司表示,更好的模型有助于优化运行它们的系统,从而在能力提升与运营成本降低之间形成反馈循环。
如果这一机制能够规模化运作,较低收费就能扩大市场。此前成本过高的任务会变得可行,额外的使用量能够弥补单位收入下降。
OpenAI CEO Sam Altman 曾公开表示,庞大的模型使用量可以支持训练,而无需依赖极高利润率。这是一种规模论点,类似于通过规模和利用率获利的基础设施业务。
风险在于,竞争对手也会获得同样的需求扩张。客户可能将新增工作负载分散到多家提供商,而非集中交给 OpenAI。
Anthropic 面临的是这一问题的较窄版本。Claude 已在编程和企业知识工作中建立了强势地位。然而,这些工作负载同样适合被调度,因为其中许多步骤的难度差异很大。
一个智能体可以将 Claude 留给困难的规划或审核,同时把常规工具调用分配到其他地方。Anthropic 保留了高价值工作,但失去了可能支撑基础设施经济性的高流量。
更广泛的竞争格局进一步加大了压力。Google 可以将模型与云基础设施和办公软件结合。Meta 可以通过广告和社交平台补贴 AI。SpaceX 和 xAI 则能够利用资本、计算资源和专有数据。
Meta 和 xAI 最近发布的模型进一步缩小了差距。它们的进展表明,中国实验室并非唯一能够削弱双公司格局的挑战者。
这正是“价格战”一词可能产生误导的原因。冲突不仅关乎哪家供应商提供最低的使用费率,还关乎哪家公司能在客户拥有更多议价能力时,为持续智能提供资金支持。
anthropic ars 分析还提出了一个估值问题。极高的企业雄心假定前沿能力能够创造可防御的价值,而商品化在模型层面挑战了这一假设。
防线仍可能在其他地方形成。提供商可以通过分发渠道、企业合同、开发者工具、安全认证、专有数据或深度集成的应用建立持久价值。
OpenAI 的 ChatGPT 和 Codex 生态系统提供了此类防线。Anthropic 则拥有 Claude Code、企业关系,以及受到高要求用户青睐的模型行为声誉。
然而,这些优势必须足够强大,才能抵御替代。如果一个应用将模型隐藏在自身界面之后,实验室的品牌对最终用户就会变得不那么显眼。
因此,这场经济竞争将向上延伸至应用层,并向下深入基础设施层。独立模型 API 面临成为被压缩的中间层的风险。
这并不意味着美国前沿实验室注定失败。它意味着,其万亿美元雄心需要的不仅是推出下一个基准测试最高分。
它们必须将智能转化为持续性的工作流、可信的平台,以及足以使持续投资得以维持的需求规模。
三个信号将揭示谁真正获胜
下一阶段将由生产环境中的表现、任务级经济性和客户留存决定,而不是发布日的比较。
第一个信号是中国模型在本土市场之外的持续使用情况。下载量激增和 OpenRouter 排名显示出兴趣,但企业部署提供了更有力的证据。
关注美国开发者在初步测试后,是否仍持续将编程、研究和智能体工作负载路由至 DeepSeek、Kimi、GLM 和 Qwen。持续使用将强化模型供给正变得可互换的论点。
如果出现回撤,这一论点就会被削弱。这可能表明,治理担忧、可靠性差距、容量问题或政策风险超过了最初的节省。
第二个信号是 Anthropic 在将 Sonnet 5 的初始费率永久化后的反应。该公司可以通过更好的任务完成率、更强的集成能力和更高的速率限制来捍卫自身地位。
开发者应在采用 Sonnet 5 前后比较完整的任务追踪记录。tokenizer 的变化意味着,标题式的比较无法呈现全部结果。
如果 Claude 在降低总任务成本的同时,仍保留高要求的编程和研究工作负载,Anthropic 的高端战略便仍具可信度。如果客户越来越多地只在特殊情况下保留 Claude,调度机制就已经削弱了其商业地位。
第三个信号是 OpenAI 将更低成本转化为更大规模使用量的能力。API 消耗、Codex 活跃度、企业采用和基础设施利用率将比基准测试胜利更重要。
更高的使用量将支持 OpenAI 关于效率创造更大市场的论点。使用量持平则意味着,降价主要是向现有客户转移价值。
竞争对手也会影响这一检验。DeepSeek、Moonshot、Z.ai、Alibaba、Google、Meta 和 xAI 都可通过新模型或更高效的部署选项迫使市场作出进一步回应。
结果不会是单一赢家。不同提供商可以在前沿推理、常规智能体、私有部署、消费者分发或企业治理方面领先。
不过,有一种结构性转变已经显得持久:客户已经认识到,他们可以将工作流拆分到多个模型之间。即使有一家公司重新获得明确的技术领先,这种认知也不会消失。
anthropic ars 的价格战故事最终关乎议价能力。OpenAI 和 Anthropic 仍在制定重要的技术标准,但买方如今拥有可信的替代方案和更好的调度工具。
对开发者和企业团队而言,实际应对方式是严格评估。用真实工作测试模型,衡量完成的结果,避免将基准排名或宣传成本中的任何一项视为完整答案。
对美国实验室而言,考验更为严峻。它们必须证明,廉价智能能够足够快地扩大需求,以资助下一代发展。
在未来几个月里,关注热潮消退后生产流量最终落在哪里。如果用户持续切换模型而不牺牲结果,前沿实验室将需要比降价更深厚的防线。


