top of page

Claude Opus 5 让 Fable 更难自圆其说

Anthropic 于 7 月 24 日推出 Claude Opus 5,距离 Opus 4.8 发布仅两个月,随即让其旗舰 Fable 模型的合理性变得更复杂。Anthropic TechCrunch 报道的核心发现不只是 Opus 有所提升。据报道,Opus 5 的性能已接近 Fable 5,却面临更少限制,并且每完成一项任务消耗的资源更少。

这种组合带来了不同寻常的反转。Fable 5 仍然是 Anthropic 的前沿模型,尤其适用于高级生物学和网络安全工作。然而,Opus 5 现在看来更适合编程、研究、计算机操作和业务自动化。

Anthropic 表示,Opus 5 在多项公开评测中与 Fable 5 持平或超过后者。独立测试也显示,它在部分智能体知识工作任务中领先。如果这些结果经得起更广泛使用的检验,Fable 可能会沦为专业模型,而不再是高难度工作的默认选择。

Anthropic TechCrunch 报道称发生了哪些变化

Opus 5 将 Fable 的大部分实用性能压缩进了一个面向常规部署设计的模型。

Opus 5 发布公告将该模型描述为善于思考、积极主动,并且其智能水平接近 Fable 5。Anthropic 于 7 月 24 日在其应用、编程产品和 API 中发布了它。它也成为部分付费 Claude 体验的默认模型。

此次发布处于 Anthropic 产品周期中一个异常快速的节点。Opus 4.8 于 5 月 28 日发布,而 Mythos 5、Fable 5 和 Sonnet 5 则在 6 月陆续推出。因此,Opus 5 并非年度平台换代,而是两个月内又一次重大模型发布。

这一时间点很重要,因为 Fable 5 几乎还未在 Anthropic 产品线顶端站稳脚跟。客户仍在了解,其额外的智能在什么场景下足以证明更高的运营要求是合理的。如今,在许多部署尚未稳定之前,Opus 5 已要求他们重新审视这一决定。

原始报道强调了影响实际采用的两项差异。Opus 5 的资源密集程度低于 Fable,其安全分类器的干预频率也应显著更低。Anthropic 预计,这些分类器的激活频率将比 Fable 5 的分类器低约 85%。

分类器是一种监测系统,会在允许模型回答前检查请求是否包含潜在危险内容。这些系统可以减少滥用,但也可能中断正当的安全、科学或技术工作。因此,减少干预改变的不只是用户便利性。

Opus 5 仍会阻止多项敏感网络安全活动。在通用访问条件下,它无法执行基于二进制文件的漏洞扫描、渗透测试或漏洞利用生成。不过,它可以在源代码中搜索漏洞,Anthropic 认为这更可能支持防御性工作。

这种区分扩大了开发者可以使用模型开展工作、而不会立即遭到请求拒绝的范围。它也降低了普通编程工作流因分类器将调试解读为攻击性活动而中断的可能性。

Anthropic 为仍会触发安全防护的请求加入了自动回退机制。该可选系统会将被标记的请求路由到另一可用模型,而非只返回错误。这种方式将模型选择视为一项运营路由决策,而不是需要用户手动管理的责任。

没有特殊的数据保留要求,也让 Opus 5 与 Fable 5 有所区别。通用 Opus 访问遵循与 Opus 4.8 相同的数据保留政策。对于正在评估敏感文件、专有源代码或受监管工作流的组织而言,这一差异十分重要。

综合来看,这些变化解释了此次发布真正的重要性。Anthropic 并非只是提高了一项评测分数,而是打造了一个能够进入更多工作流、遭遇更少中断,并且仍接近公司最高性能层级的模型。

Fable 5 如今面临来自 Anthropic 内部的压力

Fable 5 面临的最强压力,来自同一家公司打造的一款更便宜、限制更少的模型。

模型公司通常会通过可预测的阶梯来划分产品。较小的模型处理高频任务,而较大的模型处理值得额外成本和延迟的困难请求。每一级都需要有可见的提升,否则客户会选择效率更高的选项。

Opus 5 缩小了 Anthropic 顶级两级产品之间的差距。Anthropic 表示,在最高工作强度下,新模型的 CursorBench 峰值结果与 Fable 5 相差不到 0.5%。CursorBench 衡量编程智能体在真实软件开发环境中的表现。

当客户评估已完成的工作而非原始模型声望时,差距会进一步缩小。在用于评估控制计算机界面的 OSWorld 2.0 上,Anthropic 表示,Opus 5 超过了 Fable 5 的最佳成绩,同时每项任务使用的资源约为后者的三分之一。

在评估端到端业务流程的 Zapier AutomationBench 上,据报道,Opus 5 在相近任务成本下实现了约为次佳模型 1.5 倍的通过率。即使是其最低工作强度设置,在 Anthropic 公布的对比中通过的任务也多于竞争模型。

这些结果指向模型采购方式的一项重大变化。企业购买的不是抽象分数所代表的智能,而是成功完成的代码修改、报告、调查、支持操作和后台流程。

即使理论能力上限较低,需要更少干预的模型在经济性上也可能优于能力更强的模型。重试、拒答、延迟和人工审核都会增加已部署系统的成本。API 账单只反映其中一部分。

Anthropic 的工作强度设置强化了这一逻辑。它让客户能够调整模型为请求投入多少推理。团队可以将最高工作强度留给困难任务,并在速度或效率更重要时采用较低设置。

这种灵活性让 Opus 5 有机会在同一工作流中替代多个模型。团队可能会在日常代码维护中使用较低工作强度,然后在架构变更或复杂调试时提高设置。只有当 Opus 持续失败或达到可衡量的能力边界时,Fable 才会成为必要选择。

因此,Anthropic TechCrunch 的论述挑战了一个常见假设:旗舰模型是重要工作的最稳妥默认选项。Fable 可能仍是专业研究的正确选择,但它似乎不再是大多数高级商业任务的显而易见之选。

这种压力超出了模型选择本身。Anthropic 现在必须解释,客户为何应接受 Fable 更严格的安全防护和数据保留规则。在狭窄领域中的优异表现可以支撑这一论点,但在通用工作上的微小提升可能不足以做到这一点。

结果是一个棘手的产品定位问题。如果 Anthropic 让 Fable 更易使用,就会缩小 Opus 5 的差异化空间。如果它保持 Fable 的限制性,客户就会多一个标准化采用 Opus 的理由。

为什么 Opus 5 即使不是 Anthropic 最聪明的模型也能胜出

能够以更少中断完成更多实用工作的模型,往往胜过能力上限最高的模型。

Anthropic 最有力的说法涉及 Opus 5 在长期、未完成任务中的表现。该公司表示,模型会更仔细地检查自己的工作,并持续迭代,直到取得可用结果。这种行为对智能体尤为重要,因为智能体通过工具执行一系列操作,而不是只生成一次回答。

在一项 Frontier-Bench 测试中,Opus 5 收到了一张机械零件图和在 FreeCAD 中重建它的指令。测试没有提供直接查看图像的工具。Anthropic 表示,模型通过编写计算机视觉管线、从原始像素中提取几何信息并重建零件来应对。

据报道,没有竞争模型能在五次尝试内完成同样的设置。这仍是公司报告的示例,并不能证明 Opus 能解决任意工程任务。不过,它说明了 Anthropic 希望客户注意到的行为。

重要的特征不只是图像识别,而是模型决定构建缺失能力,而不是在识别出限制后停止。这种主动性可以改善编程智能体、研究助手和工作流自动化。

Anthropic 给出了第二个涉及开源包管理器真实漏洞的例子。据报道,Opus 5 找到了根本原因,并修复了现有社区补丁遗漏的边界情况。一个竞争模型处理了表面症状,并错误地宣布问题已解决。

这些例子支持了一种基于验证的机制。许多智能体失败发生在模型产出看似合理的工作之后、测试该工作是否真正解决问题之前。能够验证自身假设的模型,可以减少错误的完成报告。

早期访问客户描述了类似模式,不过他们的证词应被视为经过筛选的发布证据。Zapier 表示,Opus 5 完成了一项涉及风险识别、负责人通知和留存摘要的账户健康工作流。据报道,之前的模型无法完成整个流程。

一家交易公司也使用该模型为一家新交易所创建市场数据源。Anthropic 称,Opus 5 发现没有可用于验证的实时数据源后,构建了测试工具。模型使用该工具检查其解析器是否正确处理预期数据。

这些案例表明,单次成功任务成本为何比单个 token 成本更重要。如果一次成本较低的尝试反复失败,其价值很有限。当昂贵模型对简单工作过度思考,或触发本可避免的限制时,它同样会变得低效。

独立结果为 Anthropic 的定位提供了一些支持。Artificial Analysis 的一项智能体基准测试将 Opus 5 列为 AA-Briefcase 第一名。该评测使用私有文件,并要求模型生成报告、演示文稿和电子表格。

在最高工作强度下,Opus 5 在该基准上获得了 1,720 的 Elo 分数。Fable 5 得分为 1,574,相差 146 分。Artificial Analysis 还发现,多个较低的 Opus 工作强度设置仍保持竞争力,同时每项完成任务消耗的资源更少。

一项基准测试无法定论模型之间的比较。其任务组合、评估流程和工具环境都会影响排名。不过,由独立机构管理的结果降低了对 Anthropic 发布图表的依赖。

对于知识工作者而言,实际含义很直接。更好的模型,是能够收集上下文、保留指令、使用工具并交付正确产物的模型。管理大量项目材料的团队,可以将这些智能体与个人知识库结合,以便持续提供源文件供审查。

Opus 5 似乎正围绕这一完整工作流而设计。它不需要在每一项智力测试中击败 Fable。它需要完成足够多的高价值任务,使切换到 Fable 成为例外。

基准领先并未消除风险

Opus 5 的发布证据令人鼓舞,但其中很大一部分仍来自受控测试和经过筛选的早期访问合作伙伴。

基准测试分数概括的是特定条件下的表现。生产系统则会遇到不完整的数据、不断变化的软件、相互冲突的指令、权限边界,以及无法清晰描述目标的用户。这些条件可能暴露出发布评估未能发现的失效模式。

Anthropic 也承认至少存在一项重要限制。Opus 5 在长期自主生物研究方面仍面临挑战:模型必须在较长周期内规划并修订工作。该公司表示,Mythos 5 在这一类别中仍然更强。

网络安全的边界也比“限制更少”这一简单说法复杂得多。Opus 可以检查源代码中的漏洞,但通用访问权限会阻止其他若干安全活动。当任务看起来类似攻击性工作时,合法研究人员仍可能遭遇拒绝。

Anthropic 为获批企业和需要较少限制的研究人员提供 Cyber Verification Program。该流程可以帮助符合条件的用户,但也引入了访问权限上的差异。基准测试无法反映这种差异会造成多大的行政摩擦。

自动回退也带来另一项权衡。将被阻止的请求路由到另一款模型,比直接返回错误更好,但可能让行为变得更不可预测。回退模型可能给出不同答案、采用不同推理方式,或在该任务上的表现更差。

团队需要记录每项请求由哪款模型完成。否则,他们可能会将成功结果归因于 Opus 5,而实际处理被标记部分的是另一款模型。模型路由将成为应用审计轨迹的一部分。

系统卡也在很大程度上依赖 Anthropic 的内部评估。该公司报告称,其总体失配行为评分为 2.3,是近期模型中的最低值。Anthropic 还表示,Opus 5 对 Claude Constitution 的遵循更好,欺骗性行为也更少。

这些发现值得关注,但并不能证明其具有普遍安全性。自动化行为审计取决于测试设计、威胁假设,以及评估者识别有害行为的能力。仍有必要进行独立复现。

同样的谨慎也适用于科学结果。Anthropic 报告称,其内部有机化学基准测试提升了 10.2 个百分点,在蛋白质变异任务上提升了 7.7 分。这些数字表明其评估套件内取得了进展,并不保证在真实实验室中的准确性。

科学用户应根据成熟工具、原始文献和领域专家来验证输出。更强的推理能力可能让错误答案显得更有说服力。模型解释自身的能力,并不能确保其解释反映了实际机制。

用户反馈也显示,安全防护行为仍未稳定。一些早期用户报告称,尽管 Anthropic 预计干预会减少,但普通提示词仍触发了 Opus 5 的限制。发布当天的报告只是轶事,但指出了一个值得衡量的问题。

关键问题并不在于分类器是否恰好比 Anthropic 测试中少干预 85%。而在于,合法用户在具有代表性的工作负载中是否遇到更少被阻止的任务。安全团队、软件维护者和研究人员需要不同的衡量标准。

使用限额构成了另一项采用变量。一款模型即使在基准测试中领先,如果订阅用户很快耗尽访问额度,仍可能令人沮丧。API 客户可以直接衡量消耗量,但个人用户通常只能通过不够透明的产品规则感受到限制。

这正是 Anthropic TechCrunch 论点需要经受检验的地方。当相近的性能、更低的任务成本、更轻的安全防护和常规的数据保留规则同时出现时,Opus 5 看起来更可取。上述任一优势都可能在生产条件下被削弱。

如果 Fable 的性能优势在极其困难的工作中变得明显,它仍保有合理的角色。如果自动回退引入不一致的结果,或者分类器继续中断常见任务,Opus 同样会失去优势。

此次发布提出了一个可信的假设,而非最终结论。只有当独立测试和持续使用证实 Anthropic 的说法时,Opus 5 才会成为实用的默认选择。

Opus 5 也加大了 OpenAI 和 Google 面临的压力

Anthropic 的内部模型竞争迫使竞争实验室围绕已完成的工作展开竞争,而不只是比拼基准智能。

OpenAI、Google 和 Anthropic 都围绕推理能力、速度与运营成本的不同组合扩展了各自的模型目录。这为开发者提供了更多选择,但也带来了评估负担。每增加一款模型,都需要测试、路由规则、监控和回退行为。

Opus 5 试图通过覆盖更广的性能范围来简化这一决策。它的工作强度控制使单一模型能够同时处理常规和困难任务。其工具切换功能还允许开发者在对话过程中改变可用工具,而不会使缓存上下文失效。

这一能力对于处理分阶段流程的智能体很重要。研究智能体可以先使用搜索和文档工具,然后在收集证据后获得电子表格访问权限。保留既有上下文可以减少重复处理,并让工作流保持连贯。

如果 Opus 5 能以更少重试稳定完成这类工作流,OpenAI 和 Google 将面临压力。它们的回应不一定需要是一款更大的单一模型。更好的路由、更强的工具使用、改进的上下文管理或更简单的部署,都可能产生相同的商业效果。

云端分发将影响这场竞争。Bedrock availability为 AWS 客户提供了另一条路径,使其能够在既有基础设施和治理控制中使用 Opus 5。通过成熟云平台进行分发,减少了企业试用所需的工作。

不过,企业不太可能立即实现标准化。许多企业已经同时使用多个供应商,以平衡性能、可靠性、数据治理和议价能力。Opus 5 最初将进入与当前生产模型的受控比较。

这些评估应聚焦完整工作流。编程团队可以衡量被接受的补丁、回归率、审查时间和工具调用次数。研究团队可以衡量来源准确性、缺乏支撑的主张、修订次数以及最终交付物质量。

业务自动化团队应跟踪完成率和人工干预情况。他们还应记录自动回退何时发生,以及被路由模型是否改变结果。平均值可能掩盖敏感场景中代价高昂的失败。

这种方法让竞争问题变得更具体。Opus 5 不需要赢得每一项基准测试,便能给 OpenAI 或 Google 施压。它只需要在保持可接受质量的同时,减少客户必须运营的模型数量。

同样的标准也适用于 Fable。如果 Opus 几乎能够处理所有工作流,Fable 就会成为一条高能力升级路径。这一角色仍可能有价值,但其使用量会低于默认模型。

Anthropic 快速的发布节奏进一步提高了整个市场的预期。如果每隔几周就有替代品出现,客户可能会推迟长期迁移。因此,模型提供商除了频繁更新能力外,还必须提供稳定接口和实用的迁移路径。

最终胜出的产品不会只是发布最高分数。它必须让团队能够采用改进,而无需反复重建提示词、安全防护、监控和评估系统。

Opus 5 前三个月需要关注什么

三个信号将决定 Opus 5 会成为 Anthropic 实用的旗舰模型,还是仍只是一场令人印象深刻的发布日比较。

第一个信号是其在持续智能体工作流中的独立表现。Artificial Analysis 已报告其在智能体知识工作方面领先,但仍需要更多评估来复现这一模式。编程、计算机操作、研究和办公自动化都应获得单独测试。

关键指标是在计入重试、延迟、工具调用和人工修正后的成功完成率。如果 Opus 在这些条件下保持领先,日常工作中选择 Fable 的理由将被削弱。如果优势消失,Anthropic 的基准叙事就会显得更为狭窄。

第二个信号是真实的安全防护行为。Anthropic 预计 Opus 分类器的干预频率将比 Fable 低约 85%。开发者应按任务类型检查干预率,尤其是网络安全、软件调试和科学研究。

自动回退率同样值得关注。频繁回退能让工作流持续运行,但也意味着 Opus 本身仍比用户预期更受限制。低回退率且结果稳定,将强化 Opus 作为通用默认模型的理由。

第三个信号是 Anthropic 及其竞争对手如何重新定位产品线。Anthropic 可以明确 Fable 的专家角色、减少其限制,或强调 Opus 仍然不足的任务。每一种回应都将揭示该公司如何解读早期采用情况。

OpenAI 和 Google 可以通过模型更新、更好的智能体工具或更激进的效率改进来回应。快速回应将表明 Opus 5 正在影响竞争路线图。有限回应则可能意味着竞争对手认为其优势仅限于特定基准。

Anthropic TechCrunch 的故事归根结底更关乎产品经济性,而非模型排行榜。Opus 5 将接近前沿的能力与更少的运营约束结合起来,使其更容易在常见工作负载中获得合理采用。Fable 现在必须证明,其剩余优势是否足够经常地发挥价值,以抵消这些约束。

开发者和企业采购方不应只根据发布声明做选择。选择若干具有代表性的任务,在 Opus、Fable 和当前生产替代方案之间运行,然后衡量被接受的结果。决定性的问题很简单:哪款模型能可靠完成有价值的工作,而不会带来新的审查、隐私或路由负担?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page