Anthropic 将 Claude Sonnet 5 的发布定价永久化
- Ethan Carter

- 8月11日
- 讀畢需時 15 分鐘
Anthropic 取消了原定于 9 月上调 Claude Sonnet 5 价格的计划,将临时发布折扣转为该模型的永久价格。这则关于 Anthropic 的 Techmeme 标题体现了一次值得关注的政策逆转,但其意义不止于更低的 API 账单。Anthropic 改变了开发者评估其主力生产模型时所依据的基准。
该公司于 6 月 30 日推出 Sonnet 5,并将入门定价设定为在 8 月 31 日后到期。Anthropic 最初的公告称,更高的标准价格将于 9 月 1 日生效。其最新社交媒体帖子如今表示,入门价格将保持不变,在原定涨价生效前取消了这一安排。
这一决定给 OpenAI、Google 以及争夺持续性 Agent 工作负载的低价模型提供商带来压力。它也检验了 Anthropic 最初的论点:Sonnet 5 是否足以支撑更高的标准价格。该公司仍在保留折扣,同时将该模型宣传为适用于编程和自主工作的 Opus 级选项。
Anthropic 在截止日期前调整了什么
Anthropic 将一项临时激励措施转变为 Claude Sonnet 5 永久的经济基础。
修订后的政策很直接。Sonnet 5 将保留发布时推出的相同输入和输出 token 费率。此前计划于 9 月 1 日生效的更高价格将不会实施。
Token 定价决定了开发者通过应用程序编程接口,即 API,处理和生成文本所需支付的费用。输入 token 代表指令和提供的上下文。输出 token 则代表模型生成的回复。
Anthropic 于 8 月 10 日通过官方 Claude 账户宣布了这一调整。该帖子称,公司将把 Sonnet 5 的入门定价永久化,发布价格将保持不变。该消息没有进一步详细解释这一决定。
这种有限的说明值得注意。Anthropic 并未将此次调整描述为另一项临时促销、批量折扣或新的定价层级。根据 Claude 官方帖子,该公司永久取消了原定的涨价。
这一时机也使其不只是常规的价格维护。Anthropic 在价格切换前数周采取行动,让开发者有时间在更高费率反映到生产账单前更新预测。已经将涨价纳入模型的团队现在可以修正这些假设。
最初的 Sonnet 5 发布公告提供了关键对比。Anthropic 将发布价格描述为入门价,并明确公布了截止日期。它还展示了按计划中的标准价格计算的性能图表,将涨价视为产品预期经济性的一部分。
这些图表仍有助于理解最初的定位。Anthropic 认为,Sonnet 5 覆盖的成本与性能选择范围比 Sonnet 4.6 更广。该公司称,在某些任务上,较高的 effort 设置可以接近 Opus 4.8。
因此,永久发布价格改善了 Anthropic 自身比较中的成本维度。它并未改变模型本身、上下文处理方式、安全控制或基准测试分数。产品保持不变,变化的是其长期商业条款。
这则关于 Anthropic 的 Techmeme 报道也凸显了一种不寻常的 AI 公告类型。大多数模型新闻围绕发布、基准测试或新能力展开。此次事件则关乎客户未来将不再承担的一项费用。
这种“不再发生”依然会改变行为。软件团队可以继续使用 Sonnet 5,而无需为自动涨价做准备。初创公司可以估算模型成本,而不用把 8 月视为人为的分界线。企业买家可以基于同一个公开基准比较长期合同。
这一决定也简化了迁移规划。Sonnet 5 使用更新后的 tokenizer,它会将文本转换为模型计费和处理的单位。Anthropic 表示,相同内容在新 tokenizer 下可能会变成更多 token,具体取决于内容格式。
发布时,Anthropic 表示,入门价格旨在使从 Sonnet 4.6 的迁移在成本上大致保持中性。将这一价格永久化,就无限期延长了迁移缓冲期。它也提出了此次逆转背后的核心问题:如果较低价格可以持续,为何此前还计划采用更高费率?
为什么 Anthropic 的 Techmeme 政策逆转很重要
永久定价将竞争承诺从“现在试用 Sonnet 5”变为“围绕这一成本结构进行构建”。
入门定价会鼓励测试,因为买家知道它有截止日期。永久定价则支持部署,因为团队可以将其视为产品设计的持续性投入。当 AI 从偶发聊天转向持续运行的 Agent 执行时,这一区别变得尤为重要。
Agent 模型可以规划任务、调用工具、检查结果,并在较少逐步指导的情况下继续工作。这类工作流通常比一次问答消耗更多 token。它们可能会读取代码仓库、浏览文档、修改计划,并重试失败操作。
Anthropic 明确为这种模式打造了 Sonnet 5。该公司称,该模型可以使用浏览器和终端、持续开展编程工作,并执行多步骤任务。发布时,它成为 Claude Free 和 Pro 用户的默认模型,同时也进入了 Claude Code 和 Claude Platform。
永久费率让 Anthropic 能向构建这类系统的开发者提出更清晰的主张。一个在编程工具、研究 Agent 或业务自动化中反复运行的模型,必须以可控的总成本产出可预测的结果。
这一总成本不止包括公开的 token 费率。它还包括重试、工具调用、生成代码、验证、延迟、人工审核,以及需要再次运行的失败操作。不过,token 费率仍是采购团队最容易比较的数字。
这项调整从两个方向给提供商施压。OpenAI 和 Google 必须捍卫各自在速度、能力、上下文和成本方面的组合。较小的提供商则必须证明,更低的标价能转化为可靠的任务完成能力和企业支持。
市场已经转向更精细的模型选择。开发者很少为所有工作负载选择单一提供商。他们会将简单分类任务路由至更小的模型,将编程任务交给更强的模型,并将敏感任务交由满足特定安全要求的系统处理。
将 Sonnet 5 的发布价格永久化,有助于 Anthropic 留在这一模型路由的讨论之中。原定涨价本会形成一个自然的评估节点。客户可能会将 9 月预算作为评测替代方案的理由。
取消涨价消除了这一触发因素。团队仍然可以切换,但 Anthropic 不再通过自动商业调整促使他们重新考虑。留存的重要性或许不亚于新增采用。
这一决定也强化了 Sonnet 产品线的角色。Anthropic 将 Sonnet 定位在轻量模型与其最强大的 Opus 系统之间。Sonnet 必须足以胜任实际工作,同时又要足够经济,适合高频使用。
随着竞争对手的模型家族不断扩展,这种平衡变得更难维持。OpenAI 为开发者提供多种推理与性能选择。Google 将其 Gemini 模型与云端分发和长上下文工作流结合。中国模型开发者和开放权重模型开发者则持续推动成本更低的替代方案。
Axios 将 Sonnet 5 描述为旨在把更多 Agent 能力带入日常工作的模型。其 发布分析还指出,随着推理成本受到更多关注,一些开发者和企业正转向价格更低的中国模型。
Anthropic 的行动在不发布新模型的情况下回应了这种压力。它实际上提升了现有产品的长期价值主张。如今,每一种受支持的工作负载,其预期成本都低于 Anthropic 最初宣布将于 9 月实施的价格。
Anthropic 的 Techmeme 框架可能会让这一事件看起来只是一个简单的折扣故事。更重要的解读在于承诺。Anthropic 正要求开发者将一项入门商业条件视为持久条件。
这种承诺可能影响产品架构。团队通常会决定发送多少上下文、允许 Agent 执行多少步骤,以及何时升级到更大的模型。稳定的费率让这些控制机制更容易在更长时期内进行调优。
它也可能影响原型能否通过部署评审。一项实验可能表现良好,却会在促销期结束后因内部成本预测而无法通过。Anthropic 已为 Sonnet 5 消除了这一特定障碍。
真正的竞争是每项完成任务的成本
更低的 token 费率并不能证明 Sonnet 5 是完成一项工作成本最低的模型。
公开费率提供了清晰的比较,但 Agent 工作负载并不简单。两个模型可能接收到相同任务,却消耗不同数量的上下文、推理、工具输出和生成文本。一个可能立即完成,另一个则会重复步骤。
Anthropic 在其发布材料中承认了这一问题的一部分。Sonnet 5 使用的 tokenizer 可能会将相同输入映射为比前代更多的单位。该公司估计,token 数量会随内容而增加,这可能抵消一部分较低的单位费率优势。
Effort 设置又引入了另一个变量。Anthropic 允许用户选择模型投入多少计算 effort。较高的 effort 可以提升复杂任务的结果,但也可能增加 token 消耗和响应时间。
这就是为何每项完成任务的成本应成为标价信息的主要对手。相关问题不仅是一枚 token 的价格,而是在执行、检查和任何必要重试之后,一个经过验证的结果需要多少成本。
以软件维护 Agent 为例。它必须检查陌生的代码仓库、复现 bug、编辑代码、运行测试并解释所做的修改。如果补丁失败或忽略了隐藏依赖,廉价的首次回复价值不大。
Anthropic 分享了一个早期访问案例:Sonnet 5 调查了一个 bug,编写了复现测试,实施修复,并验证移除该修改后问题会恢复。尽管该案例来自发布合作伙伴而非独立评估者,但它说明了预期的经济机制。
另一家合作伙伴称,该模型完成了一个涉及账户更新和对外沟通的两部分 Salesforce 工作流。其所称的差异在于执行到底。早期系统据称会在完成整个序列前停止。
这些案例表明,单位费率更高的模型仍可能降低整体人工或重试成本。但它们并不能证明这一结果适用于所有组织。发布合作伙伴代表的是经过选择的工作负载、集成方式和运行条件。
独立基准测试同样很困难。Agent 评估会因提示词、脚手架、工具、时间限制、重试策略和 token 预算而变化。模型在排行榜上的得分无法自动预测其在企业生产技术栈中的表现。
Anthropic 自身在发现一项 BrowseComp 评估采用的方法比其标准 Agent 搜索设置更简单后,修订了一张发布图表。该公司更新了分析,改用具有压缩功能和程序化工具调用的更大 token 预算。
这一调整之所以重要,是因为它说明了方法论如何影响表面上的成本效益边界。上下文压缩会总结或缩减累积的上下文,使智能体能够在实际限制内继续运行。工具调用设计同样会改变成功率和资源消耗。
Sonnet 5 system card 报告了更广泛的能力与安全评估,但这些评估在很大程度上仍由 Anthropic 控制。买方应将结果视为测试依据,而非替代自身测量的工具。
一项有价值的评估应记录成功完成率、总 token 数、实际耗时、工具调用次数、重试次数以及人工修正情况。它还应使用真实任务,而非经过精心打磨的演示。团队需要了解失败分布,而不只是平均分数。
对于编程,这意味着衡量测试是否通过,以及审阅者是否接受改动。对于研究,这意味着检查来源质量与事实支撑。对于文档工作,这意味着衡量输出是否保留了必需细节。
构建 AI workflows 的组织还应将检索成本与生成成本区分开来。模型无法仅靠更长时间的推理来弥补缺失、过时或选择不当的上下文。
这种审慎的区分并不抹杀 Anthropic 此举的价值。相较于此前公布的计划,永久降低单位费率几乎改善了所有 Sonnet 5 部署的经济性。它只是无法据此得出与竞争系统相比的结论。
OpenAI 和 Google 如今面对更棘手的 Sonnet
Anthropic 已经消除了一个可预期的节点:客户原本可能会重新评估 Sonnet 5,并测试竞争模型。
AI 提供商竞争的不只是模型质量,还包括开发者工具、云端可用性、速率限制、上下文管理、缓存、企业控制能力,以及切换的运营成本。
Sonnet 5 通过 Anthropic 的 API 和 Claude Code 面向客户提供。Anthropic 还通过主要云平台分发 Claude,让企业能够利用现有基础设施与采购关系。
OpenAI 通过其编程产品和广泛的开发者平台施加压力。Google 可以将 Gemini 与其云服务、生产力工具及数据基础设施结合。两家公司都可以作出回应,而不必在某一项公开费率上与 Anthropic 完全匹配。
竞争对手可能提供更快的生成速度、更好的缓存、更长的可用上下文,或更高效的任务完成能力。它也可能将模型与云支出承诺打包。这些差异使直接比较比单一费率表所暗示的更复杂。
不过,Anthropic 的举措改变了起点。竞争对手如今必须无限期地面对处于发布时经济性水平的 Sonnet 5。原定于 9 月实施的涨价,已无法自动改善它们的相对位置。
这一逆转也可能表明,竞争环境在 6 月之后发生了变化。Anthropic 尚未公开将该决定与某个具体竞争对手的发布或客户反应联系起来。任何关于其内部动机的说法都仍属推断。
市场压力是最合理的外部解释。开发者可以评估多个能力出色的模型家族,而模型路由服务降低了测试替代方案所需的投入。提高费率的提供商必须展示已完成任务经济性方面可见的提升。
客户预期也发生了变化。买方越来越希望 AI 支出可预测,尤其是对于可能长时间运行的智能体。当模型自行决定任务需要多少步骤时,使用量就更难预测。
永久费率本身并不能让使用量变得可预测。不过,它消除了一个已知的未来波动来源。团队仍需要为自主运行设置预算、token 限制、可观测性和终止规则。
Anthropic 的战略挑战在于维持 Sonnet 与 Opus 之间有意义的区隔。如果 Sonnet 在特定任务上的表现接近 Opus,同时成本更低,开发者可能会将 Opus 留给范围更窄的一组复杂工作负载。
如果 Sonnet 的总使用量增长,这一结果可能有利于 Anthropic。但它也会使高端模型的定位更加复杂。该公司必须说明,何时 Opus 能产生足够额外价值,以证明升级使用它是合理的。
因此,Sonnet 的永久费率可能会对 Anthropic 自身产品目录中的另一位竞争者施压。模型路由不会遵守产品营销边界。开发者会选择能够可靠满足其验收标准的最低成本选项。
同样的逻辑也适用于更小型的 Claude 模型。当 Sonnet 变得更实惠时,轻量模型必须在速度或效率上保有优势。否则,客户可能会集中使用能力更强的默认选项。
anthropic techmeme 事件最好被理解为这场更广泛竞争中的一项留存举措。Anthropic 降低了离开 Sonnet 的动机,同时提高了所有替代方案证明可量化运营节省的门槛。
竞争仍应让买方受益。提供商有多种应对方式。它们可以降低费率、提高模型效率、扩大缓存折扣、提高速率限制,或发布能以更少步骤完成任务的模型。
它们无法再依赖 Anthropic 此前计划中的涨价。这个窗口已经关闭。
Anthropic 的公告并未证明什么
这一逆转确认的是一项定价决定,而非 Anthropic 对模型性能、效率或客户成果的主张。
Anthropic 表示,Sonnet 5 在某些智能体任务上接近 Opus 4.8。它还表示,与 Sonnet 4.6 相比,该模型在推理、编程、工具使用和知识工作方面均有提升。这些说法值得报道,但需要独立验证。
该公司的发布证据包括内部评估和部分合作伙伴的评价。这类材料可以指出有前景的使用场景,但无法确立其在不同代码库、数据环境、语言和合规要求下的典型表现。
基准设计仍是一项不确定性来源。智能体结果高度依赖于周边的运行框架,即控制提示词、工具、记忆和重试的软件。更强的框架可以让同一个底层模型看起来更有能力。
token 化带来了另一项不确定性。Anthropic 表示,Sonnet 5 可能会将相同材料转换为比 Sonnet 4.6 更多的 token。因此,稳定的单位费率并不保证迁移后的支出稳定。
输出行为同样重要。即使费率保持不变,撰写更长答案的模型也可能产生更高账单。进行不必要探索的智能体可能会消耗工具和上下文,却无法改善最终结果。
安全控制也可能影响部署选择。Anthropic 表示,Sonnet 5 的危险网络能力低于其当前的 Opus 模型,并且未被专门训练用于高级网络安全任务。该公司默认启用了网络安全防护措施。
其评估发现,在 Firefox 测试中,两款 Sonnet 模型都没有生成完整可用的漏洞利用。根据 Anthropic 的说法,Sonnet 5 的部分成功率略高于 Sonnet 4.6。该公司将这一差异归因于更广泛的能力提升。
这些细节对安全团队很重要。较低的网络能力可以降低某些滥用风险,但也可能使 Sonnet 不太适合经授权的防御性工作。Anthropic 建议,对于需要减少防护限制的网络安全任务使用 Opus。
总体安全表现也并非全面更好。Anthropic 报告称,Sonnet 5 整体上比 Sonnet 4.6 出现更少不理想行为,但在一项自动化行为审计中,其比率高于 Opus 4.8 和 Mythos Preview。
这一细微差异应限制关于 Sonnet 5 更安全的笼统说法。它在一些由公司运行的指标中表现更好,但在另一项指标中不如更强的模型。生产环境中的行为将取决于提示词、工具、权限和监控。
企业买方还需要审查数据处理、区域可用性、服务可靠性和合同控制措施。API 费率仅涉及采购决策的一部分。
对于个人开发者而言,关键风险是对头条新闻反应过度。永久费率改善了该模型相对于 Anthropic 早期计划的经济性,但并不意味着每个现有工作负载都应立即迁移。
受控评估仍是更好的应对方式。开发者应选择具有代表性的任务,在测试前定义成功标准,并比较总体资源使用情况。他们应纳入棘手的失败案例,而非只测试模型已经能很好处理的任务。
处理大量本地文档集合的团队可以使用 searchable knowledge base,在调用任何模型前改善上下文选择。无论提供商是谁,更好的检索都能减少浪费的 token 和缺乏支撑的答案。
最可信的解读虽有限,却具有意义。Anthropic 已将 Sonnet 5 的价格降至低于其自行公布的 9 月计划。对于已完成的生产工作而言,它是否比竞争对手更便宜,仍是一个需要实证回答的问题。
Anthropic Techmeme 头条之后需要关注的三个信号
下一阶段将由实际使用数据、竞争回应以及 Anthropic 对其模型阵容的处理方式决定。
第一个信号是 9 月 1 日之后 Sonnet 5 的采用情况。该日期原本应引入更高的标准费率,如今则成为检验永久发布定价是否支持持续生产使用的清晰测试。
直接采用数据可能不会公开,但间接信号仍有帮助。开发者可以关注提供商状态数据、速率限制变化、云端可用性、合作伙伴公告,以及提供多种模型选择的工具更新。
如果 Anthropic 提升容量或扩大 Sonnet 集成范围,这将支持永久定价刺激了持久需求的观点。如果用户尽管费率较低,仍持续报告较高的任务成本,那么目录价格优势看起来就不会那么决定性。
第二个信号是 OpenAI、Google 或主要模型路由平台的回应。直接调整价格将是最明确的反应,但并非唯一值得追踪的变化。
新的缓存政策、更快的模型、更高的包含使用量,或更好的编程智能体结果,都可能削弱 Anthropic 的地位。竞争对手还可以发布任务层面的评估,旨在表明其模型能以更少的生成 token 完成工作。
强有力的回应将确认 Anthropic 的举措改变了市场基线。若没有明显回应,则表明竞争对手认为其现有产品仍通过性能、分发能力或捆绑服务保持差异化。
第三个信号是 Anthropic 的下一项模型与定价决定。Sonnet 5 目前采用了最初被描述为临时性的永久费率。未来 Claude 的发布将揭示,这究竟是一项针对单一模型的修正,还是更广泛的战略变化。
关注 Anthropic 如何定位下一代 Haiku、Sonnet 和 Opus 的发布。这些系列之间的差距与任何外部竞争对手的比较同样重要。买方需要一个明确理由,才会从一个等级升级到另一个等级。
如果未来发布再次采用临时费率,除非 Anthropic 更清楚地解释转换条件,否则将引发质疑。开发者可能会认为,已宣布的涨价可以协商,或者很可能会在竞争压力下消失。
相反,若后续模型均采用稳定的发布定价,将强化这样一种解读:Anthropic 正在优先考虑可预测的部署经济性。这也会让采购团队对长期预测更有信心。
该公司自身披露的基准测试结果同样值得关注。Anthropic 在发现方法不匹配后,修正了一项发布评估。若能进一步进行透明修订,将有助于买家理解 token 预算和智能体框架如何影响其宣传的结果。
独立的任务级测试仍是最有力的信号。开发者应寻找披露提示词、工具、重试次数、token 消耗及验收标准的评估。缺少这些细节的评分无法回答生产成本问题。
对企业团队而言,实际行动是在敲定秋季预算前重新运行工作负载评估。在不同服务商之间保持相同的任务、限制条件和成功衡量标准。比较经过验证的输出,而非首次回复。
对开发者而言,应记录智能体运行各阶段的消耗。将规划、工具输出、修复尝试和最终生成分别统计。这样可以揭示 Sonnet 5 的永久费率是否降低了完成有效工作所需的总成本。
anthropic techmeme 的逆转为 Sonnet 5 建立了更好的商业基线,但这条头条只是衡量的起点。Anthropic 已取消其计划中的涨价。用户现在必须判断,该模型完整的工作负载经济性是否足以证明继续使用它的合理性。
请在真正重要的任务上进行这一比较,包括当前系统处理不佳的失败案例。随后提出竞争对手必须回答的问题:另一款模型能否以更少的时间、更少的重试次数或更低的总消耗,完成同样经过验证的工作?


