Anthropic Simon 鹈鹕测试:Claude Fable 5.1 表现更佳,但思考时间也长得多
Anthropic 发布了 Claude Fable 5.1,据称其科学基准测试得分为 52.6%,但 Anthropic Simon 鹈鹕测试展现了另一种性能图景。Simon Willison 要求该模型生成一只骑自行车的鹈鹕 SVG。只有在最大推理强度下投入大幅更多时间和输出 token 后,它才给出了最令人信服的结果。
这种反差让这项实验比其荒诞的设定更有价值。Anthropic 将 Fable 5.1 定位为适用于编程、知识工作和长时任务的模型。Willison 的鹈鹕测试则检验了:当这些能力面对一个具有明确物理约束的小型视觉编程任务时,会发生什么。
这一结果并不能替代 Anthropic 的正式评估。它更像是对其背后权衡的一次紧凑演示。Fable 5.1 能检查、修改并改进自己的工作,但增加推理并不会带来均匀的提升。最佳输出需要显著更高的计算投入,而较低设置几乎没有显示出明显的审慎推演。
Anthropic 推出了一款旨在持续工作的模型
Claude Fable 5.1 的重点不在于快速回答单个提示,而在于持续处理任务,直到各项细节都经得起推敲。
Anthropic 于 2026 年 9 月 1 日推出 Claude Fable 5.1 和 Claude Mythos 5.1。该公司将两者描述为具有不同安全防护措施的同一底层模型。Fable 已全面可用,而 Mythos 仅限获批的研究项目使用。
该公司的发布材料聚焦于编程、研究和长期知识工作。Anthropic 表示,Fable 5.1 能避免流于表面的修复方式,检查自身工作,并在跨越数小时或多个应用程序的项目中保持有效。
这些说法之所以重要,是因为许多当前 AI 的失败往往发生在一个看似不错的开端之后。模型可以写出合理的计划、生成可运行的代码,却仍可能在后续修改中失去对约束条件的把握。长期任务表现取决于维持状态、测试中间结果,以及在不破坏先前工作的前提下纠正错误。
Anthropic 的基准测试结果显示,其在多项既有测试中取得了温和提升。报告中最大的增幅出现在 Terminal-Bench-Science 0.1,这是一项评估通过终端环境完成科学任务能力的测试。
在 Anthropic 的设置下,Fable 5.1 得分为 52.6%。该公司报告称,在同一对比条件下,Fable 5 为 24.7%,Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%。Anthropic 还披露,每个模型的标准误差介于 3.5 至 4.5 个百分点之间。
其他结果的提升幅度较小。Fable 5.1 在 Terminal-Bench 4.0 上达到 55.8%,而 Fable 5 为 42.0%。它在 AutomationBench 上得分 31.4%,Fable 5 则为 17.1%。
这些是公司报告的数据,并非衡量模型质量的普适标准。Anthropic 还指出,安全防护措施影响了部分评估任务。一些被标记的请求得到零分,另一些则被路由至不同的 Claude 模型。
这一披露使直接比较变得更复杂。基准测试可能衡量的是底层模型、已部署的安全系统、智能体框架,或三者的某种组合。企业用户接触的是整合后的产品,因此这些运营细节应纳入任何性能讨论。
Anthropic 的早期客户提供了支持性案例。MongoDB 表示,该模型在用数天时间构建原型前,先研究了其服务与文档。Millennium 表示,Fable 5.1 在此前模型未能找出原因后,将一次罕见崩溃追溯到了外部库。
这些报告具有参考价值,但它们来自精选的发布合作伙伴。它们展示的是成功部署可能呈现的样子,而非所有代码库或工作流程中的平均结果。
Willison 的鹈鹕测试则处于评估范围的另一端。它不涉及企业系统、研究实验室或大型文档集。其价值在于让模型的行为变得可见。
为什么 Simon Willison 仍让模型画鹈鹕
鹈鹕提示的价值在于:即使任务听起来微不足道,要成功也需要许多细小关系同时成立。
Willison 曾多次要求语言模型生成一只骑自行车鹈鹕的 SVG。SVG 是一种基于文本的图像格式,因此语言模型可以通过编写结构化标记和绘图指令来创建完整图像。
一个看起来合理的结果需要有可辨识的车轮、自行车车架、车把、踏板和鹈鹕。一个好的结果还必须将它们正确连接。鸟的脚应能踩到踏板,翅膀应接触车把,身体应位于车架上方。
这些关系构成了对规划和空间一致性的紧凑测试。模型可以生成有效的 SVG 代码,却无法呈现实际场景。它可能画出断开的腿部、错位的车轮、不可能的连接,或者一只只是漂浮在自行车上方的动物。
这项测试之所以流行,是因为早期改进很容易被看出来。更强的模型往往能生成更整洁的代码、更连贯的几何结构,以及更好的提示遵循度。一张图像就能暴露出长篇基准测试报告可能藏在综合评分背后的错误。
后来,Willison 对这种关联不再那么确信。在他的7 月重新评估中,他认为鹈鹕质量已不像过去那样可靠地反映模型的整体质量。图像生成风格、训练偏好和推理设置正日益影响结果。
这一局限改变了该基准测试的用途。它不足以作为宣称某一模型在所有方面都优于另一模型的有力证据。但它仍适用于在相似条件下比较相关模型、推理等级和重复运行结果。
Claude Fable 5.1 实验遵循了这种更狭义的方法。Willison 测试了五种推理设置:低、中、高、超高和最大。Fable 5.1 没有提供完全关闭推理的设置。
在低强度下,模型生成了一幅干净、可辨识的插图。Willison 记录的转录内容没有显示推理摘要,尽管响应包含 1,998 个输出 token,耗时 23.8 秒。
中等强度的表现相似。输出使用了 1,977 个 token,耗时 23 秒,同样没有显示推理摘要。最终图像相比低强度结果没有展现出明显优势。
高强度终于暴露出一些简短的规划痕迹。模型描述了预期场景,包括自行车、鹈鹕、背景、车轮和身体位置。它使用了 2,612 个输出 token,并在 29.6 秒后完成。
可见的提升依然有限。这一点很重要,因为推理控制常被描述为简单的质量调节旋钮。在这项实验中,从低强度升至高强度并没有带来成比例的提升。
超高强度则显著改变了行为。模型生成了 36,767 个输出 token,并工作了 7 分 51 秒。其推理讨论了鸟的比例、脚部、踏板、翅膀位置和视觉特征。
最大强度则进一步延长了这一过程。它使用了 65,927 个输出 token,耗时 13 分 54 秒。Willison 称其为自己从 Anthropic 模型中见过的最佳鹈鹕。
图像包含蓝色头盔、装鱼的篮子、结构连贯的自行车,以及鸟与机器之间更谨慎的接触关系。其视觉细节反映出反复检查,而非一次性生成。
这种递进才是实验的核心。提示保持稳定,变化的是模型可用的审慎推演空间。Fable 5.1 并非在每个更高设置下都只是画出更好的鹈鹕;在接近最高档时,它进入了不同的工作模式。
Anthropic Simon 测试揭示了投入差距
最佳鹈鹕展现出更强的自我纠错能力,但也暴露出质量对推理投入的依赖程度可能非常高。
若将 Anthropic Simon 测试看作同一模型家族内部的比较,它最具参考价值。低、中、高设置都生成了可接受的插图,彼此之间可见差异有限。超高和最大设置则触发了更长的推理和更审慎的修改。
在最大强度下,模型所做的不只是列出需要绘制的对象。它还考虑了这些对象应如何互动。推理轨迹检视了头盔位置、鸟喙重叠、羽毛形状、车把细节,以及自行车前叉的曲线。
这种行为类似迭代式设计评审。模型生成一个结构,检查可能存在的缺陷,并调整单个组件。它也会在不必要的添加威胁清晰度时予以拒绝。
一段推理轨迹显示,模型重新考虑了自行车头盔,因为它可能干扰鹈鹕标志性的冠羽。另一段则发现前叉的曲线方向不正确,并修改了控制点以改善方向。
这些决定虽小,却说明了一种更大的能力。实用的长期运行智能体必须能识别出自己的第一次尝试仅仅是看似合理。随后,它们需要定位弱点并加以修改,同时不让其他部分失去稳定。
这一机制将鹈鹕测试与真实编程工作联系起来。软件智能体可能创建了一个能通过基础测试的功能,却违反了架构约束。研究智能体可能完成了一项分析,之后才发现某个假设已破坏结论。
更难的问题不在于生成更多文本,而在于将额外计算用于恰当的检查。Fable 5.1 的最大强度轨迹表明,至少在这项视觉编程任务中,它在这种行为上有所进展。
不过,实验也揭示出不均衡的投入曲线。尽管属于更高设置,中等强度并未以有意义的方式优于低强度。高强度增加了一些规划,却没有彻底改变图像。大部分可见提升出现在更晚阶段。
因此,开发者不应假设每一步推理都能带来等量的质量提升。某项工作负载可能低于一个阈值,额外投入几乎不会改变结果。另一项工作负载可能只有在模型拥有足够空间进行反复检查时才能受益。
这带来了评估挑战。如果团队只测试默认设置,可能会低估模型的能力。如果只测试最大强度,则可能衡量了一个对日常使用而言过慢的配置。
Anthropic 表示,Claude Code 中 Fable 5.1 的默认推理强度为高,而其他 Claude 界面使用中等强度。Willison 的结果表明,界面默认设置能够塑造用户对模型的整体印象。
该测试还将输出质量与运行效率区分开来。最大强度下的鹈鹕更好,但它所需的 token 和时间远高于低强度版本。即使文章不讨论具体价格,这种权衡也很重要。
长期运行智能体会在规划、检查文件、调用工具、运行测试和修改工作时消耗计算资源。对于困难任务,成功结果可以证明这些投入是合理的。对于一次性插图或常规转换,同样的过程则显得过度。
实际问题并不是最大推理是否优秀,而是额外工作能否改变决策、减少后续审查,或避免代价高昂的错误。
这种差异给 Anthropic 及其竞争对手带来了压力。OpenAI、Google 和其他模型提供商正越来越多地开放推理控制选项,或自动分配计算资源。买家需要证据证明,这些控制能够清晰对应到实际工作负载的价值。
这只鹈鹕表明,这种对应关系仍不规则。更高的标签并不保证结果会明显更好,而最高设置的表现可能像是一个实质上不同的产品。
科学基准提高了赌注
Anthropic 的科学得分让 Fable 5.1 变得重要,但这只鹈鹕也解释了为何该得分需要放在实际运行语境中理解。
Terminal-Bench-Science 0.1 围绕智能体在终端环境中执行的科学工作流设计。其任务覆盖生物学、化学、物理学、地球科学、数学和工程等领域。
科学基准在 Fable 5.1 发布前不久推出。它包含由科学家贡献的 70 项任务,结果可在受控环境中检验。
这种结构比评判一幅插画更严谨。任务要求智能体操作软件、处理数据、使用科学工具,并得出可验证的结果。其设计旨在模拟真实科研工作的一部分。
Anthropic 的 52.6% 成绩引人注目,因为它比该公司公布的 Fable 5 的 24.7% 得分高出一倍以上。两者差距仍远大于披露的标准误差。
这一比较仍需谨慎看待。Anthropic 使用自己的评测配置复现了早期模型的结果。公开排行榜显示 Opus 5 为 30.0%、Fable 5 为 21.4%,而 Anthropic 测得的结果分别为 29.0% 和 24.7%。
该公司表示,这些差异处于预期的统计噪声范围内。即便如此,读者仍应区分公开排行榜运行与厂商自行运行的对比结果。
新的基准历史也较为有限。研究人员尚未观察到开发者会以多快速度围绕其任务优化提示词、测试框架和工具。他们同样缺乏长期记录,以证明基准提升与可量化的科学产出之间存在关联。
这并不意味着结果不重要。它意味着该结果是一个早期信号,而非定论。
官方基准与鹈鹕测试衡量的是不同事物。Terminal-Bench-Science 关注智能体能否完成定义明确的科学工作流。鹈鹕则揭示模型在解决可见的约束问题时如何分配投入。
两者共同支持一个更审慎的结论。Fable 5.1 在持续性的工具驱动工作中似乎表现更佳,而其最强表现会在拥有足够计算资源来检查中间结果时出现。
Anthropic 还提供了基准以外的多个科学案例。该公司称,其模型参与了蛋白质结合体、行星测绘,以及生物模型 GPU 优化等工作。这些说法将模型输出与外部工具结合,在部分情况下还包括实验室验证。
该公司还称,Fable 5.1 训练了一个神经网络,生成了一张覆盖金星三分之一面积、分辨率更高的高程图。Anthropic 表示,该地图可解析两到三公里尺度的细节,而此前为 10 至 20 公里。
这类案例比一次性提示词更值得深入审视。科学结果取决于数据选择、工具配置、验证方法和人工监督。模型可能完成了重要工作,但未必应对整个发现过程负责。
这种区分对企业采用至关重要。买家部署的不是一个基准分数,而是嵌入拥有权限、专有数据、审核人员、预算、安全防护和故障处理流程的系统中的模型。
最有力的证据将来自可重复的工作流,团队能够比较完成率、纠正耗时和人工审核需求。一个得分更高却需要大量验证的模型,可能带来的价值低于预期。
反过来,如果较慢的模型能够避免难以处理的错误,它也可能物有所值。Anthropic 的发布合作伙伴强调了涉及罕见故障、跨服务代码变更和无人值守研究的案例。这些正是额外推理可能带来合理回报的场景。
科学基准加大了 OpenAI 和 Google 的压力,因为它在新的智能体评测中确立了可见领先优势。但更大的竞争并非某一个排行榜,而是模型能否将延长推理转化为可靠、可审计的工作。
鹈鹕测试无法证明什么
一份精致的 SVG 是一次成功运行的证据,并不能证明 Claude Fable 5.1 能在不相关任务中可靠推理。
第一个局限是样本量。Willison 展示了在五种投入设置下的一组输出序列。即使提示词和配置保持不变,模型输出在不同运行间也可能有所差异。
更有力的比较应当让每种设置重复运行多次。评测者随后可对物理一致性、代码有效性、视觉质量、执行时间和输出长度评分。这将揭示最高设置的结果是典型表现,还是异常出色的一次。
第二个局限是主观判断。大多数观察者可能同意最高设置下的鹈鹕看起来更完整,但视觉吸引力并非单一、可量化的属性。有人可能偏好极简插画,另一些人则会奖励装饰性细节。
第三个局限是污染问题。鹈鹕提示词已长期公开传播。模型开发者能够看到这些示例,相关图像也可能出现在训练或评测数据中。
没有证据表明 Anthropic 专门为这一提示词优化了 Fable 5.1。不过,一旦大量输出和讨论公开,一个熟悉的测试作为独立衡量标准的价值就会下降。
Willison 已承认,该基准与模型整体质量之间的关联已经减弱。它最有价值的剩余用途是受控比较,尤其是在同一家提供商的模型家族内部。
第四个局限涉及可见推理。没有显示推理摘要,并不能证明模型没有进行内部推理。产品可能隐藏、压缩或选择性展示推理轨迹。
Willison 谨慎地将低和中等设置描述为似乎跳过了推理。这种报道层面的区分应当保留。记录到的界面行为可以观察,但模型内部过程并未完全公开。
第五个局限是,冗长的轨迹可能制造虚假的信心。一个讨论大量细节的模型仍可能犯下基本错误。更多审慎思考可以改善错误检测,但也可能产生不必要的修改,或为有缺陷的方法寻找合理化解释。
这个风险在动画后续测试中变得可见。一则 Hacker News 请求询问是否可以为已完成的鹈鹕添加动画。Willison 将最高设置生成的 SVG 回传给高投入模式下的 Fable 5.1,并要求其制作动画。
该模型使用了 26,201 个输出 token 生成了动画版本。Willison 指出,转换为视频后,车轮似乎朝错误方向旋转,尽管原始 SVG 看起来是正确的。
这一后续测试不只是玩笑。它检验了模型能否在添加行为的同时保留可用的成果物。这一模式类似于软件维护:新功能可能暴露原始实现中未曾出现的问题。
Willison 的完整鹈鹕实验也说明了为何最终成果物需要直接检查。有效的 SVG、连贯的推理轨迹和成功的动画命令,并不保证每一种视觉关系都在导出后得以保留。
第六个局限来自基准对齐问题。鹈鹕主要考察 SVG 生成、空间关系和迭代设计。它几乎无法说明事实可靠性、安全决策、科学判断或在私有企业数据上的表现。
Anthropic 的正式评测涵盖其中一些领域,但许多结果仍由厂商自行报告。发布合作伙伴的推荐评价同样描述的是经过选择的成功案例,而非受控的失败率。
这留下了一个重要的验证缺口。Fable 5.1 看起来具备开展更持久工作的能力,但团队仍需要基于自身任务构建独立测试。他们应衡量模型正确完成任务的频率,而不是其最佳一次会话看起来有多令人惊艳。
有用的评测应包括含糊的需求、工具故障、过时文档和对抗性内容。长时间运行的智能体必须能够应对这些条件,而不会悄然改变目标。
因此,核心矛盾仍未解决。Fable 5.1 可以花费更长时间改进输出,但用户需要可靠的方法来判断这种投入何时合理,以及模型何时应当停止。
三个信号将显示 Fable 5.1 是否兑现承诺
接下来的检验在于,Fable 5.1 的基准与演示优势能否经受重复测试、真实工作流和竞争压力的考验。
第一个信号是对 Terminal-Bench-Science 0.1 的独立复现。研究人员应使用有文档记录的测试框架和可比的工具访问条件,让 Fable 5.1 进行多轮测试。
接近 Anthropic 52.6% 数字的结果将强化该公司的说法。若公开得分显著更低,则可能意味着评测配置、提示词或私有设置对结果的贡献比标题所暗示的更大。
不同运行之间的方差同样重要。平均表现良好但失败不可预测的模型,其运行特征与得分略低但更稳定的模型截然不同。
第二个信号是来自开发者和企业团队的工作负载级证据。最具揭示性的指标将包括成功完成率、审核时间、修复后的缺陷、中断运行次数,以及人工介入频率。
团队应在相同的内部任务上比较高推理和最高推理设置。他们也应记录额外投入毫无改变,或令结果变差的情况。
这些证据将把 Anthropic-Simon 投入差距转化为一个运营问题。如果最高推理能持续避免高成本故障,那么更长的运行时间就有了合理性。如果收益只出现在精选演示中,最高设置仍将难以证明其价值。
第三个信号是竞争模型如何应对。Anthropic 的科学对比显示,OpenAI 的 GPT-5.6 Sol 落后于 Fable 5.1,而 Google 的模型在视觉表现力强的 SVG 生成方面依然强劲。
竞争对手可以通过多种方式回应。它可以在公开科学排行榜上超过 Fable,改进自动推理资源分配,缩短取得相当结果所需的时间,或发布更有力的独立工作流评测。
最有意义的回应将把质量与可预测性结合起来。开发者所需的不只是能够产出非凡成果物的模型,还需要能够说明任务获得了多少投入、以及系统为何停止的控制机制。
对知识工作者而言,同样的原则适用于研究和文档分析。更长的答案不一定是更好的答案。有用的系统应当能够核查证据、发现遗漏的约束,并清晰呈现不确定性。
Anthropic Simon 鹈鹕测试为 Claude Fable 5.1 提供了一个令人印象深刻的演示,但其启示并非基准已经被攻克。真正的启示是,持续自我审查如今能产出明显更好的工作,而这种审查的成本仍不均衡。
开发者应使用自己能够检查的成果物,以及已经理解的故障模式来测试该模型。在多个投入级别下运行同一任务,比较最终结果,并记录额外推理在哪些地方改变了结果。
下一个有说服力的演示,不应再是一只完美的鸟。它应当展示:Fable 5.1 能够在重复且关键的工作中持续提供同样细致的修正,而无需每次都付出最大努力。



