top of page

Cursor 证实 Claude Fable 5 在 CursorBench 上创下 72.9% 的新高,但真正的考验才刚刚开始

已更新:7月20日

Cursor 证实 Claude Fable 5 在 Max effort 设置下于 CursorBench 上达到 72.9%,创下其内部编程基准测试的新高。这一结果之所以重要,是因为 CursorBench 测试的是源自真实开发会话、指令模糊且涉及多个文件的任务。这些任务所要求的,远不只是根据详细规范生成正确代码。

负责 Cursor 模型评估与行为研究的工程师 Nate Schmidt 描述了一个在处理困难工作时不太需要指导的模型。他的说法表明,Fable 5 能够推断未明确表达的目标、重新审视错误假设,并在一长串操作中始终维持既定计划。

与单纯登顶另一个编程排行榜相比,这是一个影响更为深远的主张。Claude Fable 5 被定位为能够突破 Claude Opus 等早期模型所受限的局部、反应式推理。尚未解决的问题是,这种行为在 Cursor 的受控测试和 Schmidt 的个人实验之外能否依然可靠。

Cursor 提供的证据指向了从代码生成向任务级推理的转变。然而,CursorBench 仍是由内部设计的基准测试,而关于这一结果的主要叙事由 Anthropic 发布。开发者应将 72.9% 视为一个强有力的产品信号,而不是衡量软件工程能力的通用指标。

Cursor 证实 Claude Fable 5 在 CursorBench 上达到 72.9%

这一头条结果衡量的是智能体处理不完整指令的能力,而不是它回答常规编程问题的水平。

Cursor 在注意到公开基准测试分数与开发者在实际工作中偏爱的模型之间存在差距后,构建了 CursorBench。传统测试通常会明确问题、约束、相关文件和预期结果。现实中的提示词很少会以如此整洁的形式出现。

CursorBench 排行榜将 3.1 版本描述为一项针对真实 Cursor 会话中模糊、多文件任务的评估。其题目重点考察代码库理解、规划、错误检测、代码审查、重构和修复。分数越高,代表模型在这些任务中的综合表现越好。

一个典型任务可能只包含一段堆栈跟踪信息和一句“修复”的指令。智能体必须判断开发者的意图、识别底层故障、修改正确的代码,并验证自己的工作。另一个任务则会故意将问题归咎于错误的模块,以测试模型是否会质疑这一前提。

Fable 5 在该基准测试的 Max effort 设置下取得了 72.9% 的成绩。此配置允许模型投入更多计算资源,并在任务中执行更多步骤。因此,它代表的是高投入条件下的性能上限,而不是每位开发者在所有设置下都能获得的体验。

同一排行榜显示,Fable 5 在较低投入级别下的分数也更低。这一规律表明,模型的成绩在一定程度上取决于智能体能够使用多少推理能力。因此,不应脱离其运行配置单独看待这一领先分数。

Cursor 还提醒称,基准测试结果存在波动。其排行榜指出,细微的分数差异可能不具备统计学意义。读者在比较成绩接近的模型时应注意这一点,不过 Fable 5 相对于此前顶尖模型的领先幅度显然不只是四舍五入造成的误差。

该基准测试还同时展示了准确率以外的运行指标,包括 token 数量和智能体步骤数。Max effort 比较低设置消耗了更多资源。该模型并非在所有条件下都以更高效率完成同样的工作。

Cursor 在 6 月的发布公告中表示,72.9% 的成绩比此前最佳成绩高出八个百分点。其当前的基准测试页面提供了更有用的对比,因为它将多个模型及其不同投入设置并列展示。这些背景信息让这一提升更容易解读。

这一结果表明,在 Cursor 的智能体环境中,模型能力确实取得了提升。但它并不能证明 Fable 5 会在所有编程工具、代码库类型或独立基准测试中都处于领先地位。智能体设计、可用工具、提示词和评估规则都会影响测得的结果。

这一区别至关重要。CursorBench 评估的是运行于工作系统中的模型,模型可以在其中检查文件并执行操作。该分数反映的是模型行为、智能体框架、工具访问能力和评分机制共同作用的结果。

尽管如此,这项测试确实触及了早期编程基准测试中的一个重要弱点。开发者经常需要花费时间,将一个混乱的问题转化为模型能够遵循的指令。如果智能体在完成这种转化之前就能表现良好,那么自动化发挥作用的边界将随之改变。

因此,Cursor 的主张虽然具体,却意义重大。在 Cursor 所定义的模糊软件开发任务中,Claude Fable 5 的表现优于接受测试的其他模型。接下来的问题是,究竟是什么行为带来了这一提升。

提升源自全局推理,而非更快的代码补全

Schmidt 的证据表明,Fable 5 的提升来自对整体目标的推理,而不是只优化眼前的下一步。

Cursor 评估记录中,Schmidt 区分了局部推理和全局推理。局部推理会对最新错误或当前操作作出反应。全局推理则会将最终目标、系统约束和中间证据联系起来。

当编程任务中包含误导性假设时,这种差异便会显现出来。采用局部反应方式的智能体可能会遵循用户提出的诊断,直接编辑被点名的模块。而具备全局视角的智能体则应检查更广泛的系统、验证该假设,并在证据与假设不符时调整修复方向。

CursorBench 试图通过信息不完整的提示词来捕捉这种差异。正确的补丁只是评估的一部分。智能体还必须推断实际请求、找出问题原因、实施修改、验证结果,并说明完成情况。

Schmidt 表示,他的团队最初曾怀疑 Fable 5 是否可能在利用评估机制。他们检查了模型的轨迹,也就是任务过程中记录下来的推理与操作序列。他称,他们发现该模型解决了一些此前模型未能解决的困难案例。

这项审查十分重要,因为基准测试分数本身无法解释背后的行为。模型有时可能通过测试特定模式、评分漏洞或偶然的成功执行获得更高分数。检查轨迹为评估人员提供了另一种方式,用于确认其过程是否符合目标能力。

Cursor 的报告称,在 Schmidt 的日常工程工作中,Fable 5 同样减少了对重复指导的需求。他不再觉得有必要反复说明上下文、指定解决方案,或持续审查中间操作。这种体验仍属于个人观察,但它支持了该基准测试希望衡量的能力。

关键变化并非实现完美自治,而是减少开发者在有用工作开始前必须提供的结构化信息。这将部分规划工作从人类操作者转移给了模型。

对于路径不明确的任务,这一点最为重要。已经知道每一处必要修改的开发者,可以将更快的模型用作执行引擎。而困难的迁移、架构修复或陌生故障,则需要在实施之前先进行探索。

Fable 5 似乎正是为第二类任务设计的。Anthropic 的Fable 5 概述将其描述为一个面向长期编程和知识工作的模型。该公司表示,它能够跨阶段规划、测试自己的输出,并在长时间的智能体会话中持续运行。

这些说法来自 Anthropic 及其客户,因此不应视为独立证实。不过,Cursor 的基准测试为同一产品策略提供了一个具体案例。两者都强调持续判断,而非孤立的代码生成。

这一机制也解释了 Max effort 设置的重要性。全局规划要求模型检查更多上下文、比较可能的路径、运行检查,并修正其处理方式。限制这些操作可能会削弱该基准测试正要奖励的行为。

这在智能水平与响应速度之间形成了实际区别。对于熟悉的修改,开发者通常更喜欢快速回答。而当一个速度较慢的智能体能够在无需反复干预的情况下解决困难问题时,他们也愿意接受这种等待。

由此形成的工作流程类似于工程团队内部的任务升级机制。常规任务交给较轻量的模型,而 Fable 5 则负责处理以不确定性为主要制约因素的案例。Cursor 表示,其评估人员已经在以这种方式组合使用模型。

这种分层方式也给那些将单一模型宣传为所有任务默认选择的供应商带来了压力。最终胜出的产品或许不会将所有请求都交给其最强模型处理,而是能够识别何时值得投入额外时间和资源进行更深入的推理。

72.9% 的分数支持了这种路由策略。它所说明的与其说是普遍优越性,不如说是高投入推理应在何处发挥价值。Schmidt 的登月实验格外清晰地展现了这种区别。

一次登月任务暴露了局部计划与全局计划之间的差异

最具启发性的案例并非软件补丁,而是一个模拟器实验:Fable 5 将早期失败视为有计划的研究。

在测试 Fable 5 之前,Schmidt 将 Claude Opus 连接到一个可编程的太空飞行模拟器。他只给出了一条指令:建造一枚火箭并将其降落到月球上。该模型必须自行探索模拟器、设计飞行器、进行测试并改进方案。

据 Schmidt 所述,Opus 运行了十二到十六个小时,仍未完成任务。它的火箭在轨道上耗尽了燃料。模型的应对方式是增加燃料,但这又导致飞行器过重,无法飞出大气层。

这一过程体现了局部优化。Opus 处理了最新出现的显性故障,却没有充分地重新审视整个系统。增加燃料解决了一个孤立的约束,却加剧了另一个问题。

随后,Schmidt 向 Fable 5 提供了同样从零开始的指令。它的第一枚火箭进入了低轨道,随后返回,并未尝试登月。乍看之下,这似乎又是一次失败。

但记录显示了一个不同的计划。据称,Fable 5 主动将这次轨道飞行设定为遥测任务。它希望先收集信息,再尝试完成更宏大的目标。

经过多次尝试后,该智能体成功将一个着陆器送上了月球。Schmidt 表示,整个过程耗时数小时。相比之下,Opus 在超过十二小时后仍未成功登月。

这是一次个人实验,并非标准化的科学评估。报告没有公开完整的实验方案、重复试验、模拟器配置或独立复现结果。因此,不应将其转化为普遍适用的性能统计数据。

它的价值在于所展现的行为。Fable 5 似乎将一次中间任务理解为收集证据,而不是直接的失败。它在维持最终目标的同时,设计出一系列规模更小的实验。

这与工程师处理陌生系统的方式十分接近。他们很少通过一条不间断的推理链就解决复杂的生产故障。相反,他们会检查、添加监测、测试、修正假设,并逐步减少不确定性。

具备这种循环能力的智能体能够处理更广泛的任务。即使用户还不知道正确的实现路径,它也可以开始工作。当第一个方案被证明有误时,它同样能够恢复并调整方向。

恢复能力可能比首次尝试的准确性更重要。长时间运行的智能体必然会遇到依赖损坏、误导性日志、工具故障以及错误假设。一个实用的系统必须能够识别当前计划何时已无法奏效。

月球模拟也说明了为什么单纯的运行时长可能造成误导。Opus 在这个问题上花费了更多时间,但其行动始终困在一个薄弱的策略中。据报道,Fable 5 使用的总时间更少,因为它的实验改进了计划。

这并不意味着每一次长时间运行的 Fable 5 都会收敛。智能体可能围绕一个错误目标构建出一套精巧的测试流程。它也可能通过不充分的检查来验证自己的工作。

因此,人工监督并未消失,而是改变了形式。开发者不再需要指导每一次编辑,而是必须定义验收标准、检查影响重大的变更,并决定智能体可以安全修改哪些环境。

将大型项目委派给智能体的团队还需要持久的上下文。需求、架构决策、测试预期以及先前的调查结果必须在长时间会话中始终可访问。一个可搜索的工程知识库可以降低智能体依据碎片化记录开展工作的风险。

登月之所以令人难忘,是因为它将这一工作流浓缩成了一个清晰可见的结果。智能体收集证据、更新计划,并完成了一项此前设置无法完成的任务。

然而,一次演示无法为更广泛的问题盖棺定论。更有力的证据仍然是 CursorBench,而模拟器则为这一分数提供了直观解释。两者依然存在重要的验证局限。

72.9% 的结果推动编码智能体应对模糊性

Claude Fable 5 将标准从遵循详细指令提升到了发现软件问题的真正本质。

编码助手最初比拼的是补全质量、响应速度以及生成可运行函数的能力。智能体产品则加入了文件访问、终端命令、测试和多步骤编辑。Cursor 的最新结果将竞争推向了管理尚未明确的目标。

这一转变给模型提供商带来了压力,因为编码界面越来越能暴露聊天基准所掩盖的行为差异。一个模型可能很擅长回答编程问题,却无法在被要求探索陌生代码库时取得成功。

它也给编码工具开发者带来了压力。如果模型能够规划整个任务,智能体框架就必须提供安全可靠的工具。糟糕的文件检索、脆弱的终端控制或缺失的反馈,都可能浪费模型的推理能力。

Cursor 的位置很有意思,因为它除了支持自有系统,还支持多家提供商的模型。它的基准测试可以影响开发者在产品内部选择哪些模型。与此同时,只要有任何模型能在其环境中表现出色,Cursor 都会从中受益。

这使 Cursor 成为了一个有价值的评估者,但并非完全独立的实验室。它的基准测试反映了 Cursor 希望改善的产品体验。该公司掌控着智能体实现、任务、评分和结果呈现。

Anthropic 也直接受益于这一叙事。Fable 5 的核心产品承诺聚焦于雄心勃勃且长时间运行的工作。CursorBench 的测试与这一定位高度契合,而 Anthropic 还发布了 Schmidt 的详细叙述。

这些都不会使结果失效,但它们界定了该结果能够证明什么。Fable 5 在一个由主流编码智能体平台设计、并在该平台条件下运行的基准测试中非常有效。

这种压力也延伸到了 Claude Opus,因为 Schmidt 将其作为历史参照。Opus 可以连续数小时执行本地操作,但据报道,它无法维持正确的任务策略。Fable 5 的优势被描述为规划质量,而不仅仅是坚持更久。

更快、更轻量的模型仍然有明确的用途。Schmidt 表示,当从当前状态到目标结果的路径已经明确时,团队应该使用这些模型。当目的地或路线仍不清晰时,Fable 5 就更具吸引力。

这种分工为 AI 编码创造了一种组合模式。轻量级系统处理常见修复、格式调整、小型功能和定义明确的测试。更深度的模型则负责迁移、架构调查和顽固故障。

Cursor 表示,它将 Fable 5 与更轻量的模型搭配使用,以平衡性能和资源消耗。这比把每一个请求都交给基准得分最高的模型更符合实际的运营模式。

这也改变了买家评估编码智能体的方式。单一平均分可能掩盖日常工作与最困难任务之间的巨大差异。团队需要了解哪些任务得到了改善,以及这些任务出现的频率。

Cursor 的叙述反复强调工程问题中的“p99”,即工作负载中异常困难的长尾部分。这些问题可能很少见,但会占用不成比例的注意力,并拖延重要项目。

即使一个模型对于日常编辑而言大材小用,只要它能缩短这些任务的处理时间,就可以创造价值。解决问题所需的总时间变得比响应时间更重要。真正应该比较的是完整的调查过程,而不是生成的第一个补丁。

这并不意味着不再需要专业人员。复杂的生产环境工作涉及任何代码库都无法完整承载的组织知识。工程师仍然了解客户限制、以往事故、部署风险和各方利益权衡。

不过,Fable 5 可以降低启动长期搁置工作的门槛。团队经常回避重写,因为最初的分析和协调看起来成本过高。一个能够构建并验证计划的智能体,可以让这些项目更容易启动。

Cursor 还提到,在修改共享代码前,会使用智能体检查团队成员最近的提交。这种做法将协作产物转化为机器可读的上下文,无需再开一次会议,就能标记潜在冲突。

这正是智能体能力与知识管理相交之处。长时间运行的工作依赖于将代码与决策、讨论及运维历史连接起来。知识融合等工具可以帮助人们在委派影响重大的工作之前,整合这些更广泛的上下文。

竞争问题已经不再是模型能否编写代码。大多数领先模型都能做到。新的竞争焦点是:当证据、工具和计划不断变化时,智能体能否始终保持原有意图。

CursorBench 分数无法证明什么

72.9% 的分数在 Cursor 的测试中是可信的,但公开证据尚不足以支持有关自主工程能力的普遍性结论。

CursorBench 是一个基于真实 Cursor 会话构建的内部基准测试。这一来源增强了实际相关性,却限制了外部审查。公众可以看到相关说明、分数和运行指标,但无法独立审核每项任务和评分决策。

将部分评估数据保密可以减少数据污染。如果基准任务进入训练集,模型可能只是复现预期解法,而没有展现通用能力。然而,完全保密也会使方法论和可复现性更难得到检验。

最可靠的基准测试项目会在这两种需求之间取得平衡。它们会披露任务构建方式、样本量、评分规则、不确定性、执行环境和污染控制措施。它们可以在隐藏测试用例的同时,公开足够的信息供外界进行有意义的审查。

Cursor 承认结果存在波动,并提醒人们不要过度解读微小的分数差异。这是负责任的做法,但公开页面并未提供各项结果的置信区间。读者无法准确判断 72.9% 这一估计值在多次运行中的稳定程度。

Max 工作强度标签也需要谨慎解读。它代表一种使用更多资源的特定推理配置。选择较低设置的开发者将获得不同的延迟、计算量、步骤数和准确率平衡。

排行榜显示,Fable 5 在多个工作强度设置下依然表现强劲。不过,标题中的数字描述的是最高配置。忽略这一条件的文章会夸大普通会话必然能够达到的表现。

这里还存在另一个计量单位问题。CursorBench 评估的是与模型配对的智能体,而不是孤立的语言模型。文件工具、提示词、上下文管理、执行策略和重试逻辑都会影响结果。

如果目标是评估产品,这并不是缺陷。开发者使用的是完整系统。只有当智能体分数被当作底层模型能力的纯粹证据时,它才会成为问题。

登月演示的证据价值更加有限。Schmidt 亲自进行了该实验,而 Anthropic 报道了他的叙述。目前并没有公开发布的独立复现结果,也没有多次重复试验的结果分布。

因此,这个示例应被视为一种机制说明。它展示了全局推理成功时的样子,却无法说明相同的规划行为在未知环境中出现的频率。

长周期自主运行还会产生更多故障模式。智能体可能让早期误解不断累积,进行能够通过不完整测试的大范围变更,或者在报告自己陷入困境之前消耗大量资源。

它也可能为错误决策生成颇具说服力的解释。更连贯的叙述并不意味着更好的工程判断。团队需要不依赖于执行工作的同一个模型的外部检查机制。

Fable 系统卡补充了更广泛的评估和安全背景。然而,即使包含详细的方法论,系统卡仍然是由供应商制作的文档。

安全路由机制带来了另一项复杂因素。Anthropic 表示,部分网络安全和生物学请求会被转交给较早的模型。因此,根据任务分类,用户实际体验到的底层能力可能有所不同。

Anthropic 的安全防护详情说明,该公司的目标是阻止能够显著提升能力的漏洞发现和自动化漏洞利用生成。防御性任务仍在允许范围内,但具体边界由分类器决定。

对于能力强大的编码模型而言,这一政策可以理解。但它也意味着,基准测试表现无法预测所有真实的安全工作流。某些合理请求可能会受到不同于普通软件任务的处理。

隐私和数据保留要求同样值得关注。长时间运行的智能体可能会处理专有代码库及相关文档中的大量内容。团队必须了解这些上下文会被传输到哪里、保留多久,以及适用哪些提供商政策。

正确的结论应当保持克制。Cursor 证实 Claude Fable 5 在 CursorBench 上取得了 72.9% 的成绩,这一结果支持其拥有更强全局规划能力的假设。但它并未消除对独立基准测试、重复试验或生产控制措施的需求。

三个信号将表明 Fable 5 是否会改变工程工作

下一阶段应根据持续的无人值守运行、独立复现,以及在困难项目中得到有效采用的证据来评判。

第一个信号是 Cursor 提议开展的持续数天到数周的后端实验。Schmidt 希望测试 Fable 5 能够在无人干预的情况下管理后端系统多长时间。这是对 CursorBench 所突显行为的直接延伸。

成功不应仅仅意味着持续运行。智能体必须保持需求一致、从失败中恢复、避免损害无关系统,并提供可供审查的证据。它还应认识到何时需要人类依据不确定性作出判断。

一次可靠的多日运行将强化全局推理这一论点。频繁偏离、反复返工或隐藏的回归问题则会削弱它。只有当智能体的判断始终连贯时,持续时间才有意义。

第二个信号是独立复现。研究人员和相互竞争的编码平台应采用公开的方法,在隐藏的仓库级任务上测试 Fable 5。重复试验将揭示该分数在多大程度上依赖 Cursor 的运行框架。

最佳对比会将模型行为与产品行为区分开来。它们应记录工具、系统提示词、投入程度设置、运行次数、评分规则和失败类别。单一的汇总分数无法解释智能体在哪些方面取得成功。

独立测试还应衡量恢复能力。模型是否诊断了失败的计划,还是运行框架仅仅进行了重试?它是否验证了正确的属性,还是仅仅满足了一个狭窄的测试套件?

如果外部评估发现其在模糊任务上具有相同优势,Cursor 的结果就会成为通用能力发生转变的证据。如果结果因运行框架而存在显著差异,那么主要启示将与系统设计和路由有关。

第三个信号是此前被推迟工作的生产采用情况。Cursor 表示,Fable 5 降低了困难重写和调查工作的门槛。团队现在应展示这些项目能否在审查工作量可接受的情况下完成部署。

有效的采用会产生可识别的结果。工程师用于反复说明意图的时间将会减少,以废弃分支告终的尝试将会减少,困难的变更也将更快通过审查。随着自主性提高,缺陷率不能随之上升。

供应商的客户证言只是早期指标,而非最终衡量标准。更有力的证据将来自有记录的工作流程、中立的案例研究,以及新鲜感消退后的持续使用情况。

竞争将提供另一项实际检验。其他模型提供商可以瞄准同一类长周期问题,而智能体平台则会围绕每个模型改进规划、记忆和验证能力。Fable 5 当前的领先地位并不受该基准测试本身的保护。

开发者应避免将一次排行榜结果变成永久性的模型排名。更有价值的结论应更为有限:模糊性已成为一项可衡量的产品要求,而 Claude Fable 5 目前在这方面表现良好。

评估该模型的团队可以从一项范围受控的困难任务开始。选择成功条件明确但实现路径不确定的工作,例如诊断持续存在的测试失败。保留完整轨迹,并将总审查时间与现有工作流程进行比较。

不要一开始就授予不受限制的生产环境访问权限。应使用隔离分支、有限范围的凭据、完整的测试和一名人类负责人。衡量智能体是否缩短了从开始到解决问题的整体时间,而不是其首次回应听起来是否令人信服。

Cursor 证实 Claude Fable 5 在 CursorBench 上取得了 72.9% 的成绩,但该基准测试只是初步证据,而非最终结论。应关注长时间无人值守的运行能否保持连贯、独立测试能否复现其领先优势,以及困难项目能否安全投入生产。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page