top of page

Anthropic 下调 Claude Sonnet 5.5 缓存定价,与 OpenAI 一致为 $0.10

5小时前
讀畢需時 12 分鐘

Anthropic 将 Claude Sonnet 5.5 的缓存定价下调了 50%,缓存读取价格从每百万 token $0.20 降至 $0.10。该公司表示,这项调整让 Sonnet 5.5 在大多数智能体工作负载中的成本降低约 20%,因为这类应用会反复复用较长的指令和上下文。

这一限定十分重要。Anthropic 并未下调该模型的标准输入或输出价格。它调整的是一个组件:当智能体反复发送相同的系统提示词、工具定义、代码库上下文或参考材料时,这一组件才会变得重要。

此举也让 Sonnet 5.5 的缓存读取价格与 OpenAI 的 GPT-6.1 Sol 持平。两款模型如今列出的标准输入、缓存输入和输出价格相同。这使竞争焦点从醒目的 token 单价,转向一个更棘手的问题:哪款模型能以更少的请求、更少的生成 token 和更少的返工,可靠地完成任务?

Claude Sonnet 5.5 缓存定价减半

这项即时调整的范围有限,但瞄准了长时间运行的智能体工作流中最大的持续成本之一。

Anthropic 于 2026 年 10 月 7 日宣布此次降价,同时发布 Claude Haiku 5.5。其模型公告称,Sonnet 5.5 的缓存读取现为每百万 token $0.10,而非 $0.20,并于当天生效。

当应用复用此前存储的提示词内容时,就会发生一次缓存读取。服务商无需再按完整输入价格重新处理这些内容,而是提取匹配的前缀,并按较低的缓存读取价格收费。

当请求包含大量稳定前缀时,这项功能最有价值。一个编程智能体可能会反复发送代码库指令、工具描述、编码规范和选定的源文件。一个研究系统则可能在许多问题中复用冗长的政策手册或文档集合。

客服智能体也可能采用同样的模式。它们经常在每一轮中携带稳定的系统提示词、产品目录、升级处理规则和工具 schema。变化的只有客户最新消息,以及智能体最新的工作状态。

按照 Sonnet 5.5 当前定价,Anthropic 列出的标准输入价格为每百万 token $2,输出价格为每百万 token $10。一次缓存命中如今的成本为标准输入价格的 5%,低于此前的 10%。

缓存写入仍比普通输入更贵,因为可复用内容必须先被存储。Anthropic 列出的五分钟缓存写入价格为每百万 token $2.50,一小时缓存写入价格为每百万 token $4。只有当应用充分复用已存储的前缀时,较低的读取价格才会带来回报。

设想一个简化的工作负载:在 100 次请求中发送 100,000 个稳定 token。不使用缓存时,这些重复 token 相当于 1,000 万标准输入 token。使用有效缓存后,首次请求会写入该前缀,后续请求则以缓存读取价格提取其中的大部分内容。

新价格将该示例中的读取部分成本减半。它不会降低新输入、缓存创建、模型输出、外部工具、重试或失败任务的成本。

因此,Anthropic 预计的 20% 降幅,描述的是该公司所谓的“大多数智能体工作”。它并非对每一次 Sonnet 5.5 请求都提供统一折扣。短提示词、较低的缓存命中率或输出占比高的工作负载,降幅都会更小。

此次降价紧随 Sonnet 5.5 于 9 月 28 日的发布。在最初的 Sonnet 5.5 发布公告中,Anthropic 将缓存读取定价为 $0.20,并表示该模型通常比 Sonnet 5 所需的 token 更少。

这一发布时的说法,已将效率定位在任务层面,而非仅仅是 token 层面。Anthropic 表示,Sonnet 5.5 每项任务的成本最高可比前代低 30%,输出生成速度则快 30% 以上。

不到两周后,缓存调整又增加了一项效率杠杆。它也进一步强化了 Anthropic 的观点:持续运行的智能体,而非孤立的聊天机器人回复,正成为真正重要的衡量单位。

为什么长时间运行的智能体让缓存命中更有价值

智能体会反复使用相同的上下文,因此缓存经济性可能比普通输入定价的小幅调整更重要。

传统聊天机器人请求可能只包含简短指令和一条用户消息。智能体应用通常会在每次模型调用中携带更多机制。

这些机制可能包括运行策略、数十项工具定义、任务历史、检索到的记录、软件文档,以及在先前步骤中整理出的计划。当智能体搜索、编辑文件、调用服务并验证结果时,许多组件始终保持不变。

提示词缓存会存储请求中可复用的前缀。后续调用可以按较低价格提取匹配内容,而无需将每个 token 都作为新输入计费。

缓存并不意味着模型会永久记住信息。它是在规定缓存生命周期内,对匹配提示词内容进行计费和处理的机制。如果前缀发生变化、过期,或不符合服务商的缓存规则,应用就必须再次写入。

这一差异带来了三个实际变量。

首先,开发者需要较高的缓存命中率。稳定的指令和工具应放在频繁变化消息之前。对缓存前缀进行不必要的修改,可能会使复用失效。

其次,应用需要足够多的重复调用,才能收回缓存写入的溢价。一个仅使用一次的前缀不会带来读取节省;一个被使用数百次的前缀,则可让读取价格成为主要成本组成部分。

第三,输出生成仍然重要。Sonnet 5.5 的输出价格为每百万 token $10,是其新缓存读取价格的 100 倍。一个生成长篇解释、反复重复内容或陷入重试循环的智能体,可能会抵消更便宜缓存上下文带来的收益。

这就是为什么降幅会因应用而异。Anthropic 所称的 20%,意味着缓存读取在原始账单中占据了相当大、但并非主导的份额。

一个简单的成本模型可以更清楚地说明这种关系。假设缓存读取此前占某项工作负载模型支出的 40%。将该部分价格减半,会使总成本降低 20%。如果缓存读取仅占 10%,同样的价格调整只会使总支出减少 5%。

这两个示例都无法预测某个具体客户的账单。它们只是说明,要使 Anthropic 的平均说法成立,必须满足什么条件。

最大的受益者,很可能是拥有较长、可复用前缀且需要大量连续调用的系统。编程智能体符合这一模式,因为代码库指令和工具定义通常会在整个任务期间持续存在。

文档分析也可能受益。团队可以将大型合同、技术规范或研究资料包放入缓存前缀,然后提出一系列聚焦的问题。

知识工作智能体也有类似需求。它们可能在生成报告时,反复查阅稳定的公司政策、会议记录或项目文档。构建此类系统的团队仍需保持严格的上下文筛选,就像维护一个可搜索的工程知识库。

缓存组织混乱的上下文,并不会让它变得有用。它只会让重复传输变得更便宜。糟糕的检索仍可能让提示词充满无关材料,并迫使模型花费输出 token 来消除歧义。

Anthropic 自身的提示词缓存文档建议将静态内容放在提示词开头附近,将动态内容置于后面。这种结构可提高后续请求匹配已存储前缀的概率。

开发者还应分别监控缓存创建和读取计数。较低的读写比可能揭示缓存生命周期过短、前缀不稳定、路由变化,或请求从未复用其存储上下文。

新的 Claude Sonnet 5.5 缓存定价让这些工程决策变得更有价值,但并未消除衡量它们的必要性。

Anthropic 和 OpenAI 现已采用相同的标价

此次降价抹平了 OpenAI 明显的价格优势,并迫使买家比较完成完整任务的成本。

OpenAI 推出 GPT-6.1 Sol 时,其输入价格为 $2、输出价格为 $10,与 Anthropic 对 Sonnet 5.5 的收费相同。不过,GPT-6.1 Sol 上线时的缓存输入价格为每百万 token $0.10。

在 Anthropic 降价之前,如果应用仅比较这三项价格表字段,就能看到明显差异:Sonnet 5.5 的缓存输入成本高出一倍。

如今,这一差异已经消失。Sonnet 5.5 和 GPT-6.1 Sol 均列出:

  • 标准输入为每百万 token $2

  • 缓存输入为每百万 token $0.10

  • 基础缓存时长的缓存写入为每百万 token $2.50

  • 输出为每百万 token $10

OpenAI 表示,GPT-6.1 Sol 的缓存输入成本为其标准输入价格的 5%。其模型文档还列出了 105 万 token 的上下文窗口,以及对多种推理强度设置的支持。

价格一致使简单的价格比较变得不那么有用。两个智能体即使使用 token 单价完全相同的模型,最终账单也可能大不相同。

一个模型可能用 8 次调用解决编程问题,另一个则可能需要 15 次调用,生成更多推理 token、调用更多工具,或重复一次未成功的补丁。尽管价格表相同,后者的成本仍可能更高。

可靠性会再次改变计算方式。如果仍需人工识别错误、恢复受损工作并重新运行任务,那么廉价的首次尝试价值有限。经济上真正相关的指标,是获得可接受结果的成本。

延迟同样具有成本。一个能以更少连续步骤完成工作的智能体,可以释放计算容量并缩短用户等待时间。对于交互式产品而言,这一点可能比 token 支出上的微小差异更重要。

Anthropic 正试图围绕这一任务层面指标来定位 Sonnet 5.5。该公司报告称,其在 Terminal-Bench 4.0 上取得了 70.6% 的成绩;该基准测试评估命令行环境中的多步骤专业任务。

Anthropic 还表示,Sonnet 5.5 的运行速度比 Sonnet 5 快 30% 以上,并且完成相同工作时可使用更少 token。这些均为公司自行报告的结果,生产环境表现取决于智能体框架、提示词、工具和任务分布。

OpenAI 也针对 GPT-6.1 Sol 提出了自己的性能和效率说法。其发布公告将该模型描述为以更低标准 token 价格接近 GPT-6 Astra 的能力。

两家公司的基准测试套件都无法给出普适的胜者。Anthropic 的测试采用特定的投入设置和智能体配置。OpenAI 的评估则使用其自身研究环境,并承认 API 行为可能有所不同。

对于企业买家而言,如今的实际比较需要一套具有代表性的评估任务。团队需要衡量成功完成率、人工验收、工具调用、缓存 token、非缓存输入、输出、延迟和重试。

他们还应在相同的运行约束下进行测试。若给某个模型额外工具、不同的上下文包,或更宽松的推理设置,成本比较就会失去可靠性。

主要竞争已不再是 Sonnet 的缓存价格与 OpenAI 的较量,而是 Anthropic 所称的高效任务完成能力,能否经受住每位客户生产工作负载现实的检验。

20% 节省承诺存在重要限制

Anthropic 的估算对高度依赖缓存的智能体而言是可信的,但不应将其视为总运营成本的自动下降。

第一个限制是缓存资格。只有请求实际命中缓存时,应用才能获得更低价格。相似内容并不一定意味着完全相同的内容。

调整工具定义、更改时间戳、重新排序检索到的文档,或修改靠前的系统指令,都可能破坏可复用前缀。因此,细微的架构选择可能决定宣传中的价格是否适用。

第二个限制是缓存生命周期。Anthropic 支持不同的存储时长,对应不同的写入价格。请求之间间隔较长的系统可能需要反复写入缓存,从而降低净节省额。

第三个限制是输出成本。缓存读取如今价格低廉,但生成的 token 仍然昂贵得多。较长的推理轨迹、冗长回复和反复修正,可能主导最终账单。

第四个限制是编排开销。智能体经常调用搜索系统、浏览器、数据库、代码执行环境或第三方 API。Anthropic 下调模型价格并不会降低这些费用。

第五个限制是人工审核。一个产出便宜但不可靠的模型,可能增加人力成本。这一风险对于软件变更、受监管工作流以及会影响客户数据的操作尤为重要。

就连 Anthropic 最初发布 Sonnet 5.5 的公告也提醒,基准测试只能反映模型能力的一个侧面。该公司表示,Opus 5.5 在需要持续判断的复杂、开放式任务上仍然更强。

这带来了路由权衡。开发者可以将常规、边界清晰的工作交给 Sonnet 5.5,同时把更困难的决策留给更大的模型。然而,如果路由错误,Sonnet 可能在系统升级处理之前反复失败。

设计不佳的路由器浪费的钱,可能超过缓存折扣节省的金额。团队应衡量完整路径,包括失败尝试和升级调用。

与 GPT-6.1 Sol 的比较还有另一层复杂性。标价相同,并不意味着两家提供商以相同方式实现缓存。

OpenAI 的缓存指南指出,较新的模型会根据具体模型支持显式或隐式断点。指南还说明了会影响哪些 token 符合资格的最短提示长度和统计规则。

Anthropic 使用自己的缓存控制、时长、断点和用量报告机制。在提供商之间迁移智能体时,可能需要重构提示词,缓存命中率才会变得可比。

云端分发还可能进一步增加复杂性。Sonnet 5.5 可通过 Anthropic 及合作伙伴平台使用,但不同提供商的定价、区域可用性和功能上线时间可能存在差异。

因此,应在生产环境实际使用的特定端点上验证宣布的 $0.10 费率。通过云市场运行的公司不应假设每项区域服务都同时采用了这一变化。

20% 这一说法背后还存在一个衡量问题。Anthropic 尚未公布详细分布,说明不同客户工作负载中的缓存消耗情况。“大多数智能体工作”将编程、研究、浏览器使用、客户支持及其他具有不同 token 特征的模式归为一类。

最稳妥的解读很直接:Anthropic 将一项经过验证的单价减半。更广泛的百分比代表该公司建模或观察到的工作负载组合,而不是对客户结果的保证。

团队可以通过比较数周用量来验证这一说法。有用的指标包括每次请求的缓存命中 token、缓存写入频率、未缓存输入、输出、成功完成的任务,以及每项被接受任务的总支出。

如果缓存支出下降,却没有看到任务成本出现类似下降,就说明还存在其他瓶颈。这个瓶颈可能是输出长度、失败尝试、外部工具,或人工修正时间。

开发者和 AI 采购方接下来应关注什么

下一阶段将检验较低的缓存费率,究竟能改善生产环境的经济性,还是仅仅成为竞争性智能体平台的新基准。

第一个信号是 Anthropic 更新后的计费数据。开发者应确认自己的 Sonnet 5.5 请求获得了新的缓存读取费率,并确认合作伙伴平台也提供了相同变更。

如果客户无需改动应用,就能看到每项已完成任务的支出下降,这将强化 Anthropic 的论点。若大多数工作负载仅显示小幅下降,则会削弱更广泛的 20% 主张。

第二个信号是竞争性定价。OpenAI 为 GPT-6.1 Sol 提供的匹配费率,似乎已消除了 Anthropic 对缓存上下文收取两倍价格的空间。

Google 和其他模型提供商如今面临同样压力。采购方越来越期待缓存输入的成本仅为普通输入的一小部分,尤其是对于围绕持久上下文设计的智能体。

进一步的价格响应将表明,低成本上下文复用已成为标准竞争特性。若没有回应,则意味着提供商仍通过模型质量、基础设施或不同的缓存系统来形成差异化。

第三个信号是独立的任务级测试。Token 价格揭示了提供商如何计算账单,但并不显示一个模型完成工作需要多少工作量。

有用的评估应报告每个被接受结果的成本,而不仅是基准准确率或每百万 token 的价格。它们还应披露工作强度设置、工具访问权限、重试策略、缓存命中率和人工审核标准。

对开发者而言,眼下应采取的行动是检查实际用量,而不是用 token 价格乘以理论提示词长度。应针对代表性任务,分别统计缓存读取、缓存写入、未缓存输入和输出。

随后将这些数字与结果关联起来。跟踪智能体是否完成任务、是否被人工接受,以及系统是否需要升级处理或修复。

缓存优化应从最大的稳定前缀开始。保持系统指令和工具定义一致,将动态内容放在后面,避免在可复用材料之前注入会变化的元数据。

团队还应测试缓存过期行为。五分钟缓存可能适合密集的智能体循环,却不适合存在较长审批暂停的工作流。当它能避免重复写入时,更昂贵的一小时选项可能反而降低总成本。

最终采购决策至少应在同一组内部任务上比较两个模型。Claude Sonnet 5.5 的缓存定价与 GPT-6.1 Sol 的定价一致,使这一实验更容易解读,但并不能决定谁胜出。

Anthropic 的降价具有意义,因为智能体工作负载复用上下文的频率远高于普通聊天会话。这也证实,模型供应商如今将缓存上下文视为竞争战场。

悬而未决的问题是,较低的缓存价格是否会带来更低成本的成功工作。在接下来的一个月中,衡量你的缓存命中率、重试次数、输出量和被接受结果。如果每项已完成任务的总成本接近 Anthropic 的估算值下降,降价就改变了你的经济性;如果没有,那么你的智能体最昂贵的部分就在别处。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page