top of page

Anthropic Google Cloud 推进将 Fable 5.1 的编程经济性置于考验

9月3日
讀畢需時 14 分鐘

Anthropic 发布 Claude Fable 5.1 时,核心矛盾十分明确:其能力最强的公开模型如今必须通过更出色的编程表现来证明自身成本合理。Anthropic 与 Google Cloud 的合作让这项考验尤为重要,因为企业可以通过现有云基础设施使用该模型。

Fable 5.1 于 2026 年 9 月 1 日通过 Anthropic 的 API 及多个主要云平台正式全面上线。Anthropic 表示,该模型提升了长周期编程、研究和文档处理能力,同时降低了反复读取缓存信息的成本。

这一组合直指自主 AI 系统的一个现实弱点。模型或许能够解决困难问题,但如果智能体反复扫描代码仓库、规格说明、工具结果和对话历史,其经济性便会迅速恶化。如今,Google、OpenAI 和 Anthropic 的竞争焦点,已不仅是基准测试分数,也包括完成工作的经济效益。

Fable 5.1 改变长周期编程的成本结构

Fable 5.1 的设计目标是让困难、持续时间长的任务更具可行性,而不只是让模型在孤立测试中给出更好的答案。

Anthropic 将 Claude Fable 5.1 描述为其最强的正式全面可用模型。它面向高要求推理和长周期智能体工作,即需要规划、工具调用、验证和反复修订的任务。

该模型支持一百万 token 的上下文窗口,最多可生成 128,000 个输出 token。上下文窗口是指模型在一次交互中能够考虑的信息量。这些限制为智能体处理大型代码仓库、研究资料集或文档集合提供了空间。

Fable 5.1 保留了 Fable 5 的基础输入和输出费率。关键的经济性变化在于缓存读取:根据 Fable model documentation,其成本现已降至此前的四分之一。

提示词缓存让应用能够复用模型已经处理过的信息。处理代码仓库的智能体可能会反复引用相同的架构说明、代码文件和运行规则。更低的缓存读取成本降低了持续保留这些稳定上下文的代价。

这一差别很重要,因为仅凭模型定价无法反映完成一项任务的实际成本。如果模型能更快完成工作、减少重试次数,或避免不必要的工具调用,那么即使表面上昂贵,也可能具备经济性。

反之亦然。如果模型推理时间过长、读取过多上下文,或在请求范围之外进行修改,即便能力出色也会消耗更多资源。因此,团队需要进行任务层面的评估,而非只比较公开费率。

Anthropic 的发布材料包含多个客户案例,用以支撑其“完成工作成本”的论点。Cognition 表示,Fable 5.1 在其测试中与 Fable 5 表现相当或略胜一筹,同时每项任务的成本更低。

Cognition 还表示,缓存方面的变化使该模型能够承担此前交给 Opus 的工作负载,首先便是代码审查。这是 Anthropic 引述的客户说法,并非受控的独立评估。

Red Hat 报告称,Fable 5.1 找出了其内部测试集里每个构建失败的根本原因。该公司还表示,相比早期 Anthropic 模型,该模型提供了更清晰的进度更新。

MongoDB 描述了一个由该模型历时数天开发的原型。根据该客户的说法,Fable 研究了内部服务和文档、实现了设计方案,并以可视化证据展示了结果。

这些案例指向了 Anthropic 的目标应用场景。Fable 5.1 并未被定位为每项请求的默认答案。Anthropic 自身的指导建议,大多数开发者应先从 Opus 5 开始,只有在更困难的评估证明其价值时再转向 Fable。

这一建议形成了有益的约束。团队应将 Fable 5.1 留给那些规划质量、持续执行能力和错误恢复能力足以抵消其较慢响应特征的任务。

因此,这次发布改变的不只是模型能力。它还为工程团队提供了另一种模型组合分工方式:用更便宜的模型处理常规任务,用 Fable 处理失败代价高的任务。

为什么 Anthropic Google Cloud 的可用性提高了赌注

Anthropic Google Cloud 的分发方式,使 Fable 5.1 从一次专业 API 发布变成了企业采购决策。

Fable 5.1 可通过 Anthropic 的 API、Amazon Bedrock、Google Cloud、Microsoft Foundry,以及 Anthropic 在 AWS 上的平台使用。这种覆盖范围让买家无需重建每一套身份、计费和治理流程,便可测试该模型。

对于 Google Cloud 客户而言,Claude 可在更广泛的 Vertex AI 环境中与 Google 的 Gemini 模型并列使用。Vertex AI 是 Google Cloud 用于构建、评估和运营机器学习应用的托管平台。

这种安排使 Google 既是分发合作伙伴,也是重要的竞争参照对象。即使客户选择的是 Anthropic 的模型,只要更多 AI 工作负载运行在其基础设施上,Google 便能从中受益。

与此同时,Gemini 也在争夺这些工作负载。Google 一边扩大自有低成本模型阵容,一边持续开发面向编程、推理和多模态工作的前沿系统。

由此形成了分层竞争。Anthropic 竞争的是模型选择,而 Google 竞争的是承载应用的云环境。买家正越来越能够将这两类决策分开。

这种分离降低了切换阻力。已经使用 Google Cloud 的企业可以在熟悉的运营边界内比较 Claude 和 Gemini,随后将不同任务路由给不同模型。

Anthropic 与 Google 的合作也为企业买家提供了更清晰的路径,以处理访问控制和区域基础设施要求。这些顾虑往往决定一款有前景的模型能否从试点阶段继续推进。

不过,云端可用性并不意味着完美的可移植性。不同模型的 API 在工具定义、推理控制、缓存行为、安全响应和支持内容格式上各不相同。

Fable 5.1 也引入了若干自身的迁移细节。强制工具调用可能返回错误,早期模型无法读取其 thinking blocks,编辑此前轮次也可能使这些区块失效。

Thinking blocks 用于存储模型推理状态,应用可以在多轮交互中保留它们。它们并非普通文本回复,开发者在复用时必须遵循提供商的规则。

Fable 5.1 还增加了按消息设置的 effort 控制、限定轮次范围的系统消息,以及工具调用之间可读的更新信息。每项功能都可能改善编排,但也都需要进行应用测试。

Claude partner guidance 说明了 Google Cloud 客户如何通过 Vertex AI 使用 Anthropic 模型。企业层面的优势来自托管访问,而非不同提供商之间完全一致的行为。

这给 Google 的 Gemini 团队带来了压力。客户无需离开 Google Cloud,便可评估 Anthropic 最强的公开模型,同时仍可将 Gemini 作为替代方案。

这同样给 Anthropic 带来压力。更广泛的可用性会让 Fable 5.1 接受更多内部评估,其中包括围绕真实代码仓库和业务工作流设计的测试。一旦买家能够衡量自身成果,营销基准测试的分量便会下降。

对开发者而言,即使没有一个放之四海而皆准的赢家,竞争效应依然有利。更易获得的模型选择,使任何一家提供商都更难依赖单一基准测试或封闭分发渠道。

真正有意义的问题并非 Claude 是否会出现在 Gemini 旁边,而是在两者都能在相近的企业控制条件下使用时,Anthropic 能否赢得那些困难任务。

更好的编程取决于工作本身,而非单一分数

Anthropic 表示 Fable 5.1 在高要求编程工作上领先,但真正有价值的证据在于任务行为,而非通用排名。

该公司表示,Fable 5.1 改进了编程、知识工作和长周期问题解决能力。其发布基准测试将该模型与 Fable 5、Opus 5 及 OpenAI 的 GPT-5.6 Sol 进行了比较。

Anthropic 也指出了这些比较的局限性。一些安全干预导致模型在特定任务中获得零分,而另一些被标记的任务则通过备用模型完成。

该公司进一步警告称,其 OSWorld 2.0 结果采用的是 2026 年 8 月发布的任务版本。这些结果不能与使用该基准测试早期版本公布的分数直接比较。

这一说明十分重要。基准测试可能会因任务更新、不同的智能体框架、改变的工具权限和不同的推理设置而变化。微小的分数差距可能在另一套设置下消失。

Terminal-Bench-Science 就说明了这种不确定性。Anthropic 报告称,该评估中每个模型的标准误差介于 3.5 至 4.5 分之间。因此,一些看似存在的差距可能处于统计噪声范围内。

在公开编程测试中领先的模型,仍可能在企业代码仓库中表现不佳。内部代码包含基准测试很少能复现的未记录惯例、不完整测试、依赖冲突和权限限制。

长周期行为也会产生新的失败模式。智能体可能解决了核心问题,却修改了无关文件;也可能添加不必要的文档、创建重复的自动化流程,或耗费资源去验证低风险决策。

因此,最好的评估单位是完整的工程任务。团队应衡量补丁是否有效、测试是否通过、仍需多少人工审查,以及模型多常超出任务范围。

Anthropic 的客户案例提供了有用场景,尽管它们仍属于经过筛选的发布证据。Millennium 描述了一次罕见崩溃:它大约每一百万次执行出现一次,多年来始终无法解释。

根据该说法,Fable 5.1 检查了外部供应商库,将其与核心转储进行比较,并将崩溃追溯至该库。这个案例展示了 Anthropic 希望买家测试的那类长时间调查任务。

Square 在一个持续 30 天的模拟商业环境中评估了该模型。模型可以与模拟工具、客户、员工和供应商互动。Square 表示,在该环境中,它比 Opus 5 更高效地使用 token。

Jane Street 表示,该模型解决的编程问题数量超过 Fable 5 或 Opus 5。该公司还报告称,在持续、多步骤工作中,该模型依然更容易跟踪。

这些说法支持的是一个具体论点,而非普遍结论。Fable 5.1 似乎面向那些结合大量上下文、工具调用和多轮验证的任务。

小规模代码补全或直接的单元测试可能并不需要这种能力。对于边界明确的工作,更快的模型可以提供更好的用户体验和更低的总成本。

Fable 5.1 也被列为比 Anthropic 当前其他模型更慢。即使这种延迟对隔夜迁移影响较小,当开发者在编辑器中等待时,它仍然重要。

团队应将交互式和异步式评估分开。交互式工作重视快速反馈和简洁修改;异步工作重视规划、持续执行、恢复能力和清晰的状态报告。

这正是配套基础设施变得重要的地方。一个可搜索的工程知识库可以帮助团队在模型评估期间提供一致的架构与政策背景。

模型仍然需要清晰的边界。代码库说明应明确可接受的文件、必需的测试、升级处理规则以及停止工作的条件。更强的推理能力并不能消除对运营约束的需求。

关于编程能力的说法,必须通过反复的生产结果才能变得可信。独立团队需要在不同代码库、语言和工具环境中复现更低的单次成功任务成本。

真正的机制是记忆复用与受控投入

Fable 5.1 的经济性建立在高效复用上下文,并仅在任务需要时投入更深层推理的基础上。

智能体式编程不同于单次提示,因为模型会反复观察并采取行动。它会读取文件、制定计划、编辑代码、运行测试、解读失败结果,并调整方法。

每一轮循环都可能重新引入相同的背景信息。代码库地图、编码规范、接口定义和先前决策,在智能体工作期间可能始终没有变化。

提示缓存降低了这种重复的成本。因此,Fable 5.1 较低的缓存读取费率,对于拥有大量稳定上下文的长时间会话尤为重要。

当每个请求都使用新信息时,这项优势意义较小。当应用因频繁修改提示或消息构造不一致而使缓存失效时,优势也会下降。

开发者需要将提示设计为稳定组件与可变组件。稳定说明应保留在可复用的位置,而任务特定材料应在不扰动共享前缀的情况下添加。

Fable 5.1 的逐消息投入控制则针对另一种浪费来源。投入决定模型在特定轮次中使用多少计算资源。

智能体在规划迁移或诊断陌生故障时可能使用更高投入,随后则可降低投入,用于状态更新、简单搜索和常规编辑。

这种控制可以改善任务经济性,但也增加了一个调优决策。始终使用最高投入的智能体,可能在不改善结果的情况下消耗更多时间和资源。

模型可读的进度更新也针对一个实际的采用障碍:当用户无法看到智能体正在做什么时,长时间运行的智能体看起来可能像是卡住了。

进度消息让应用能够在工具调用之间展示活动状态。有效的更新应说明当前任务、相关证据和下一项决策,而不暴露私密推理过程。

清晰的进度有助于监督。开发者可以停止那些进入错误目录、误解任务要求或开始不必要工作的智能体。

视觉能力增加了另一条验证路径。Anthropic 表示,Fable 5.1 可以解读图表、表格、图示以及嵌入文件或 PDF 中的内容。

在界面工作中,模型可以将渲染结果与设计稿或既定目标进行比较。这形成了一个将代码变更与可见输出连接起来的反馈循环。

同样的机制也适用于文档密集型工作。智能体可以检查源材料、生成草稿,并评估最终形成的电子表格或幻灯片。

Anthropic 的Fable 发布页面将这些能力描述为一个用于多阶段知识工作的统一系统。然而,模型的持续运行能力依赖于可靠的工具和结构良好的反馈。

一个错误报告成功的测试命令可以欺骗任何模型。缺失权限可能导致反复重试。标签不清晰的文档可能让智能体检索到错误证据。

因此,周边系统仍然是产品的一部分。模型质量、工具可靠性、上下文设计和评估规则共同决定最终结果。

这套机制解释了为何此次发布比一次基准更新更具影响力。Anthropic 正试图在改进控制机制的同时,降低持续推理的运营成本。

Google 和其他云平台让这种机制更容易在组织规模上测试。它们也让比较变得更直接,因为替代模型可在同一基础设施中使用。

更低的摩擦并未消除安全与隐私权衡

Fable 5.1 减少了一些运营摩擦,但 Anthropic 仍会在默认安全政策下路由敏感请求并保留数据。

Anthropic 表示,Fable 5.1 产生的不必要安全干预少于 Fable 5。安全干预发生在独立分类器识别出潜在滥用,并限制或重定向请求时。

公司采用这些控制措施,是因为先进模型能够协助完成网络安全、生物学和化学任务,而这些任务带有严重的滥用风险。

当分类器标记某些请求时,系统可以将其路由至 Opus 模型。用户可能仍会获得有能力的回复,但他们评估的已不再是 Fable 5.1 本身。

这种回退行为令基准解释变得复杂。客户可能认为自己在衡量一个模型,而安全系统却悄然改变了实际的模型路径。

Anthropic 表示,发生回退时用户会收到通知。应用仍应记录模型路由、干预频率、延迟和任务结果。

Axios 报道称,Anthropic 预计良性的医疗、生物学和网络安全会话将出现显著更少的干预。这些安全措施调整是对开发者投诉的回应:他们的合法工作触发了限制。

更少的误报可以改善安全和生命科学团队的采用情况。不过,提供商公布的干预率无法预测每个客户的工作负载。

防御性安全团队可能使用类似进攻活动的语言。制药研究人员可能讨论会触发额外审查的生物机制。这些用户需要针对其工作负载的测试。

数据保留构成第二项权衡。Anthropic 表示,Fable 默认会为安全监控保留数据 30 天。

符合条件的企业客户可以使用额外保障措施,将数据保留在自己的云基础设施中。Anthropic 表示,此时默认由客户处理人工审查。

在该系统广泛可用之前,一些符合条件的客户可以使用零数据保留。零数据保留意味着,根据适用服务条款,提示和回复在处理后不会被存储。

TechCrunch 报道称,Anthropic 计划在秋季扩展其 Enterprise Frontier Safeguards。这些企业隐私控制是该模型吸引企业客户的核心因素。

买家应在发送敏感代码前核实确切条件。仅有云端可用性并不保证零保留、客户管理的审查,或各地区均具备相同控制措施。

内容溯源带来了另一个悬而未决的问题。Fable 5.1 增加了旨在识别或追踪生成内容的机制。

溯源可以帮助组织审计自动化内容并调查滥用行为。当检测系统错误推断 AI 作者身份时,它也可能引发担忧。

工程团队应确定溯源是否会影响代码、注释、文档,还是仅影响特定输出。他们还应测试生成材料在经过人工编辑后的表现。

最重要的质疑点涉及任务级成本。更便宜的缓存访问并不保证每次 Fable 5.1 运行都比 Fable 5 或 Opus 更低成本。

模型可能使用更多 token、花更长时间推理,或进行额外工具调用。早期用户报告对于新版本是否在特定评估中消耗更多资源,已经存在分歧。

这些报告并未否定 Anthropic 的说法。它们说明了为何组织需要使用自身的任务分布进行受控测量。

公平的测试应保持代码库快照、提示、工具权限和成功标准不变。它应同时记录失败尝试与成功完成。

人工审查时间也应纳入计算。一项较便宜的运行若生成了庞杂的补丁,在工程师检查和修复后可能成本更高。

Fable 5.1 的发布逻辑仍然合理,但附带条件。该模型必须节省足够的重试、审查和失败工作,才能抵消其可能执行的额外推理。

三项信号将决定 Fable 5.1 是否兑现承诺

Anthropic 与 Google 之间竞争的下一阶段,将由生产评估、企业保障措施和竞争模型的回应决定。

第一项信号是独立的单次成功编程任务成本。团队应发布或分享包含重试、工具调用、延迟、token 消耗和人工审查的评估结果。

只有当这些完整指标下降时,较低的缓存读取费率才会强化 Anthropic 的论点。若 Fable 5.1 需要更多推理或更大范围的编辑,其优势可能消失。

最有力的证据将来自跨多个代码库的重复任务。一个令人印象深刻的调试案例可以证明能力,但无法建立可预测的运营特征。

Cognition 决定将部分 Devin 流量转移过来,提供了早期生产指标。重要的后续观察点是,在经历数周真实客户工作后,这种路由是否会扩大。

第二项信号是 Enterprise Frontier Safeguards 的推出。Anthropic 需要证明,更强的隐私控制可以与有效的滥用监控共存。

受监管企业的采用情况将揭示这种平衡是否有效。安全审查、区域可用性和客户管理的监督,将比宽泛的隐私表述更重要。

干预率同样值得关注。误报下降将强化 Anthropic 的说法,即 Fable 5.1 在不削弱必要控制的前提下更易使用。

意外拒绝或频繁的回退路由,会削弱该模型在敏感技术工作中的价值。客户应同时审视这些干预的数量和背景。

第三项信号是 Google 和 OpenAI 的回应。Google 可以通过更便宜的 Gemini 模型、更强的前沿版本,或 Vertex AI 内更好的跨模型路由来竞争。

OpenAI 可以通过编程性能、智能体控制,或长上下文工作的更优经济性作出回应。只有在客户测试这些替代方案后仍能保持领先,Anthropic 的领先才有意义。

Anthropic 与 Google Cloud 的关系让这种回应格外可见。Google 可以分发 Claude,同时了解客户更愿意将哪些工作负载留给 Gemini。

这种动态阻止了一个简单的供应商对供应商叙事。云平台正日益表现得像模型市场,而其所有者仍在持续构建竞争模型。

对买家而言,这支持采用组合策略。常规编程、交互式协助、深度调试和长期迁移不需要使用同一种模型。

团队应根据测得的结果路由任务。他们也应保留评估集,防止提供商更新悄然改变质量、成本或安全行为。

Fable 5.1 值得关注,因为它瞄准了编程智能体真正的瓶颈:在无需反复监督或失控支出的情况下完成困难工作。

它的发布并未解决 Anthropic 是否拥有最佳编程模型的问题。它确立了一个竞争对手和企业客户可以复现的、更清晰的测试。

选择一项具有代表性的代码仓库任务,在运行前明确成功标准,并比较 Claude、Gemini 及其他获批模型完成任务所需的总投入。评估应纳入审查时间、重试、人工干预和非预期修改。随后,随着各提供商更新其系统,重复进行测试。与其作为一则新闻标题,Anthropic 与 Google 的故事更重要的意义在于:它将成为真实工程团队内部的一项运营决策。未来几个月应能揭示,Fable 5.1 是否能够稳定赢得最具挑战性的任务,还是其提升仍主要集中于特定演示场景。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page