Grok 4.6 在 Cursor xAI 基准测试中登顶,但优势微弱
- Sophie Larsen

- 58分钟前
- 讀畢需時 13 分鐘
Grok 4.6 在 Cursor xAI 基准测试的竞争中夺得第一,其 Extra High 推理模式得分为 70.8%。Elon Musk 在一条置顶的 X 帖文中强调了这一排名,引发外界对 xAI 最新争取专业开发者举措的关注。
这一结果确实存在于 Cursor 当前的排行榜上,但这场胜利需要谨慎解读。Grok 仅以 0.3 个百分点领先 Fable 5 Max,而 Cursor 也警告称,较小的差异可能不具备统计学意义。
这一微弱差距构成了核心张力。Grok 4.6 位居一个基于真实编程会话构建的基准测试榜首,但这一排名并不能证明它在所有场景中都更出色。
更具影响力的结果出现在头条分数之下。Grok 在取得相近结果的同时,使用的 token 和代理步骤均少于最接近的竞争对手。这一组合给其他编程模型带来压力,尤其是那些需要更长执行路径才能完成类似工作的模型。
这也对 Cursor 与 xAI 的关系提出了更棘手的问题。CursorBench 衡量的是 Cursor 环境内的代理,而 Grok 4.6 则是在多种代理 harness 中训练,并直接通过 Cursor 发布。因此,该分数反映的是一个完整的工作系统,而不是孤立模型对静态问题作出的回答。
Grok 4.6 登顶 CursorBench
已得到验证的事件是 CursorBench 榜首成绩,而非证明 Grok 4.6 在所有地方都是最强的编程模型。
xAI 于 2026 年 8 月 12 日发布 Grok 4.6。公司将其定位为面向编程、知识工作、长时间运行的代理以及交互式应用开发的模型。
该模型在发布当天便通过 Cursor 和 Grok Build 上线。随后,它进入 GitHub Copilot,扩大了在另一主要开发者环境中的覆盖范围。
Cursor 目前在 CursorBench 3.2 中将 Grok 4.6 Extra High 列为第一。该模型的正确率为 70.8%,每项任务平均使用 41,136 个 token 和 46 个步骤。
Fable 5 Max 以 70.5% 紧随其后。Opus 5 Max 达到 70.0%,而 Grok 4.6 High 为 69.9%。
High 与 Extra High 之间的区别很重要。xAI 最初的发布材料强调的是 High 结果,而该配置并未夺得第一。在这一比较中,Fable 5 Max 仍领先 0.6 分。
Extra High 改变了排名。它采用更多推理投入,使 Grok 提升 0.9 分,足以超过 Fable 和 Opus。
Musk 的置顶帖聚焦于这一最高投入配置。截至 8 月 22 日,Cursor 的实时排行榜支持其核心说法,尽管该帖子本身属于宣传性放大。
此次发布发生在 WallstreetCN 条目于 8 月 22 日出现前十天。因此,底层事件并非当天早晨的新模型发布,而是围绕既有基准测试结果的再度关注。
该模型相较前代的提升,比与竞争系统的比较更为明确。Grok 4.5 High 的得分为 66.7%,而 Grok 4.6 High 达到 69.9%。
这意味着在相同名称的推理等级下提升了 3.2 分。Extra High 设置则将相较 Grok 4.5 High 的提升扩大至 4.1 分。
xAI 将这些变化归因于更长的补充训练周期。其 Grok 4.6 发布说明描述了精选的模型生成数据、工程数据、监督微调,以及跨代理环境的强化学习。
公司还使用 Grok 4.5,在多个推理等级和代理 harness 中重新生成训练轨迹。基于模型的检查筛除了 xAI 认为存在问题的轨迹。
这些细节为更好的编程代理行为提供了合理机制,但并不能独立验证每项训练调整对排行榜结果的具体贡献。
这一区别很重要,因为 xAI 的发布图表展示了复杂的竞争格局。Grok 4.6 在多项代理评估中表现强劲,但并未领先每一个基准测试。
在 DeepSWE 1.1 上,Grok 4.6 High 得分为 65.9%。GPT-5.6 Sol Max 达到 73%,Fable 5 Max 则达到 70%。
在 Terminal-Bench 3.0 上,Grok 得分为 26%。GPT-5.6 Sol Max 和 Fable 5 Max 均超过 34%。
因此,Grok 在 CursorBench 上的第一名代表一种特定优势。它并不能抹去其在其他编程和终端评估中较弱的排名。
这一更广泛的记录使事件从一次简单的排行榜胜利,转变为围绕部署环境的竞争。当模型、工具和 Cursor 环境协同工作时,Grok 的表现最为突出。
Cursor xAI 的结果为何给竞争代理带来压力
直接压力落在那些需要投入更多工作、才能达到大致相同基准质量的竞争编程代理身上。
Fable 5 Max 仅以 0.3 分落后 Grok 4.6 Extra High。然而,它在同一排行榜上平均使用 103,525 个 token 和 72 个步骤。
Opus 5 Max 落后 0.8 分。它每项任务使用 61,838 个 token 和 78 个步骤。
Grok 的 41,136 个 token 和 46 个步骤,使其执行路径明显更短。分数差距很小,但执行差距并非如此。
代理步骤代表编程工作流中的连续操作,其中可能包括读取文件、搜索代码库、修改代码、运行命令、检查失败结果以及再次尝试。
更低的步骤数并不自动意味着体验更好。某些任务需要额外验证,而过早停止的代理可能会遗漏隐藏缺陷。
不过,较长的执行路径会带来模型计费之外的实际成本。它们会增加等待时间、扩大上下文、产生更多工具调用,并创造更多代理偏离目标的机会。
这正是 Cursor xAI 的结果会给 OpenAI、Anthropic 及其他模型开发者的系统带来压力的原因。它们的竞争目标不再只是单一的正确率分数。
开发者越来越看重编程代理能否在无需反复干预的情况下完成任务。他们也关心延迟、不必要的修改、工具可靠性,以及审查生成变更所需的工作量。
Cursor 自己的评估框架也承认这一现实。公司将正确率与完成任务所用 token 绘制在一起,因为质量和计算投入会共同影响可用性。
Grok 的结果落在这一权衡中较有利的位置。它的得分略高于最接近的模型,同时使用的 token 明显少于 Fable 5 Max。
与 GPT-5.6 Sol Max 的比较更为复杂。GPT-5.6 Sol 使用 28,320 个 token 和 48 个步骤,token 少于 Grok Extra High,但得分为 67.2%。
因此,Grok 以更高的 token 使用量换取了额外 3.6 个基准分数,同时平均完成任务时少用两个步骤。这种交换是否值得取决于具体任务。
Medium 和 High 两种 Grok 配置使竞争压力更加广泛。Grok 4.6 Medium 以 17,942 个 token 和 29 个步骤取得 67.1%。
这一得分几乎追平 GPT-5.6 Sol Max,同时使用更少的 token 和少 19 个步骤。Grok High 则以 32,449 个 token 和 39 个步骤达到 69.9%。
这形成了一条可配置的性能阶梯。团队可以为日常工作选择中等推理,再为需要更深入探索的任务保留 Extra High。
这种灵活性对企业部署很重要。企业不希望每一次重命名、文档更新或测试修复,都触发模型的最高推理预算。
它们希望在代码库范围的迁移、复杂调试、架构变更和陌生代码任务上获得更强的推理投入。一个能跨越这些工作规模扩展的模型家族,可以简化内部工具体系。
压力也传导至 Cursor 本身。该公司提供来自多家开发商的模型,因此其可信度取决于能否呈现对不同供应商都保持实用价值的比较。
Cursor 不能将任何一个模型的领先视为永久。随着编程代理获得新工具、上下文策略和执行模式,基准测试也会变化。
CursorBench 3.2 于 7 月 8 日推出,新增了遵循指令和高级工具使用问题。由于任务分布发生变化,旧版本的结果不能直接比较。
这种持续更新降低了某些形式的基准饱和风险。但这也意味着第一名描述的是一个持续变化的测试,而不是固定的科学记录。
对买方而言,实际教训很直接。模型选择应在团队将实际部署的推理等级和 harness 配置下进行。
将 Grok Medium 与竞争对手的最高配置比较,可以回答一种运营问题。将所有模型都在最高投入下比较,则可以回答另一种问题。
两种比较都无法涵盖安全审查、代码所有权、集成可靠性或开发者接受度。这些因素决定了基准优势能否在生产代码库中经受现实检验。
真正的竞争是代理系统,而非基础模型
CursorBench 奖励的是通过代理 harness 工作的模型,因此该排名衡量的是集成系统,而非孤立的编程知识。
harness 是为模型提供提示、工具、代码库上下文、执行规则和反馈的软件层。它决定模型能看到什么,以及如何行动。
现代编程代理高度依赖这一层。当可用工具、搜索策略、系统提示或上下文策略发生变化时,同一模型可能表现不同。
CursorBench 试图捕捉这种集成行为。其任务来自真实的 Cursor 会话,涉及模糊请求和跨多个文件的修改。
Cursor 表示,许多任务源自内部代码和受控来源。这种设计减少了接触公开训练数据的可能性,而公开训练数据可能会抬高开放代码库基准测试中的结果。
公司的评估方法也采用有意简短的任务描述。这些提示比带有明确验收标准的详细问题报告,更接近日常开发者请求。
代理式评测器会评估解决方案是否满足预期结果。与只识别单一参考补丁的测试不同,这种方法允许存在多种有效实现。
这一设计回应了既有编程基准测试的多项弱点。公开任务可能会变得为模型开发者所熟悉,而狭窄的测试可能会惩罚合理的替代方案。
然而,私有任务带来了另一类问题。外部研究人员无法检查完整数据集、复现每一次运行,或评估任务选择可能产生的影响。
Cursor 发布了分数、token 数、步骤数、模型设置和流程说明。这构成了有意义的透明度,但并非完全可复现的独立审计。
Cursor 与 xAI 的合作关系又增加了一层不确定性。Grok 4.6 在 Cursor 内部发布,其训练包含跨代理 harness 的轨迹。
这并不能证明它针对 CursorBench 进行了不当优化。但这确实意味着,该模型的训练目标与 Cursor 的代理环境可能存在异常良好的契合。
这种契合对客户可能很有价值。如果开发者计划在 Cursor 中使用 Grok,那么它在这一特定环境中的表现,比抽象的模型纯粹性更具相关性。
但这一结果不应泛化到所有编程界面。通过另一种编辑器、命令行代理或定制企业 harness 运行的 Grok,可能会走出不同的执行轨迹。
Cursor 本身也将离线基准测试视为评估的一部分。它通过使用实时产品信号进行受控在线实验来补充 CursorBench。
这些实验能够发现自动评分器忽略的问题。一个补丁可能看似正确,却会因改动过多、解释令人困惑或交互选择不佳而让开发者感到挫败。
这正是 Musk “第一名”说法背后的关键反转。该排名之所以重要,是因为 CursorBench 接近真实工作;但这种真实性也让分数更依赖 Cursor。
公开基准通常试图在标准化条件下隔离模型能力。CursorBench 则考察完整的智能体是否能在特定的生产式环境中取得成功。
这两个问题都很重要,但不能互相替代。一个为模型科学提供参考,另一个则为产品决策提供依据。
Grok 4.6 的训练策略强化了这种系统层面的解读。xAI 表示,强化学习覆盖了通用编程、Web 开发、内核优化以及其他智能体环境。
该模型还在不同推理强度和执行框架下获得了重新生成的监督轨迹。这类训练会鼓励规划、工具使用、恢复和验证等行为。
xAI 报告称,Grok 在更长的轨迹中表现出更多自我测试。这对于必须运行代码并检查自身输出的智能体来说,是一种有价值的行为。
但这仍是公司的观察,并非经独立测量的保证。开发者应验证自我测试是否能发现有意义的缺陷,而不是仅仅增加活动量。
系统视角也解释了为何基准领先地位可能迅速变化。一种新的检索方法或编辑工具,就能提升未改变模型的实际表现。
反过来,上下文管理方面的回归也会让一个能力出色的模型看起来更弱。长会话会放大记忆、工具选择和恢复策略中的细小错误。
因此,模型竞赛正在成为系统竞赛。提供商通过训练竞争,而智能体公司则通过编排、上下文、工具和评估竞争。
Grok 的领先表明,xAI 已成功针对这一更广泛的环境进行了优化。但这并不能说明究竟是哪一个组件带来了最终优势。
CursorBench 的数字无法证明什么
70.8% 的得分在方向上表现强劲,但排行榜不足以支持关于编程质量的普遍性结论。
第一个限制是统计层面的。Cursor 明确警告,结果存在方差,较小的分数差异可能不具备统计意义。
Grok 相比 Fable 5 Max 仅领先 0.3 分,相比 Opus 5 Max 领先 0.8 分。
在没有公布置信区间或重复运行分布的情况下,读者无法判断这些差距是否代表稳定排序。前三个模型应被视为一个实力接近的集群。
第二个限制是任务覆盖范围。CursorBench 3.2 聚焦于来自真实 Cursor 会话、含糊且涉及多个文件的工作。
这比仅测试狭义的修复 bug 更具代表性,但它仍然反映了 Cursor 的用户、代码库、工具以及对成功工作的定义。
一家开发移动应用的公司,可能会得出与维护分布式基础设施的团队不同的结果。代码库规模、语言组合、构建系统和测试质量都会改变智能体行为。
第三个限制是基准的私密性。私有任务降低了数据污染风险,却也妨碍了广泛的独立审查。
研究人员难以测试这些任务是否过度代表了对某一执行框架有利的工作流。他们也无法检查每一项评分决策,或复现存在争议的案例。
第四个限制是,最大推理强度会改变产品体验。Extra High 提高了 Grok 的得分,但也将平均 token 使用量从 32,449 增加到 41,136。
平均步骤数从 39 增至 46。这意味着更多的思考和操作,尽管排行榜并未公布完整的延迟分布。
团队必须判断,相比 Grok High 提升 0.9 分是否值得额外的工作量。日常开发往往更重视速度和可预测性,而非最高的综合得分。
Grok Medium 进一步增加了选择的复杂性。它以 17,942 个 token 和 29 个步骤取得 67.1% 的分数,所用 token 不到 Extra High 的一半。
Medium 与 Extra High 之间相差 3.7 分。这形成了真实的运营权衡,而不是简单地要求选择最高推理设置。
第五个限制来自跨基准表现。在 xAI 公布的对比中,Grok 并未在 Terminal-Bench 3.0 或 DeepSWE 1.1 上领先。
Terminal-Bench 在不同的执行框架和任务分布下评估基于终端的智能体工作。DeepSWE 则衡量软件工程能力的另一部分。
这些结果表明,模型排名取决于环境。当工具、提示词、任务或评分器改变时,一个在 Cursor 内表现出色的系统可能落后于竞争对手。
真实用户报告能提供更多细节,但并非受控证据。一些开发者称,Grok 4.6 在范围明确的编辑和规划方面表现强劲。
另一些人则报告了文件改动过多、运行时间过长,或模型版本意外切换等问题。这些轶事能指出有用的测试案例,但无法确定整体失败率。
因此,组织应运行针对自身代码库的评估。一项有价值的试用应包含熟悉的维护任务、新功能开发、失败测试、迁移以及刻意描述不充分的请求。
评审者应跟踪被接受的改动、遗漏的缺陷、完成时间、不必要的编辑以及人工修正工作量。仅凭 token 总数无法反映这些结果。
安全性值得单独衡量。xAI 表示,Grok 4.6 接受了其最广泛的部署前安全测试,其中包括与漏洞修复相关的工作。
这一说法不能替代组织自身的控制措施。编程智能体可以访问敏感源代码、执行命令,并提出会影响生产系统的改动。
无论模型排名如何,团队都需要权限边界、审查要求、日志记录和测试。更高的基准准确率并不能消除运营风险。
同样的谨慎也适用于编程之外的知识工作。根据 API release notes,Grok 4.6 支持 500,000-token 的上下文窗口。
较大的上下文窗口使模型能够摄取更多材料。它并不能保证模型会检索到每一个相关事实,或在长会话中保持对指令的遵循。
长上下文还可能包含相互冲突的文档、过时的决策和敏感信息。有效使用仍需要谨慎的来源选择与验证。
因此,第一名的说法最好被理解为一个强烈的产品信号。Grok 跻身领先的编程智能体之列,其效率特征值得关注。
这项说法不应变成一项一概而论的推荐。团队需要从自身的代码库、工具、安全规则和审查实践中获得证据。
三个信号将表明 Grok 的领先是否持续
接下来的考验是,Grok 的基准优势能否经受独立环境、常规推理设置和持续开发者使用的检验。
第一个信号是 Cursor 之外的表现。Grok 4.6 在更广泛发布两天后的 8 月 14 日上线 GitHub Copilot。
这次部署为开发者提供了另一个测试同一模型的环境。Copilot 使用不同的提示词、工具、界面和上下文管理选择。
如果其在该环境中持续表现强劲,将支持 Grok 的提升主要源自模型本身这一观点。若表现显著下降,则会强化执行框架对齐的解释。
公开评估还应使用标准化的智能体框架测试 Grok。重复运行和公布分布将有助于澄清其微弱的 CursorBench 领先是否稳定。
第二个信号是 Medium 和 High 推理模式的采用情况。Extra High 制造了头条,但大多数团队将更关注日常可靠性和响应速度。
Grok Medium 已经凭借更短的执行路径接近 GPT-5.6 Sol Max 在 CursorBench 上的表现。这可能比在最大努力设置下取得第一名更具现实意义。
使用模式可以显示开发者在试验后保留了哪种配置。若频繁从 Extra High 降级,可能表明延迟或资源消耗超过了其分数优势。
若在复杂工作中持续使用 High 或 Extra High,则说明情况不同。这将表明开发者认为更深度的推理足以抵消更长运行时间。
第三个信号是 Cursor 在线评估的变化。Cursor 表示,其实时实验会跟踪离线评分器可能遗漏的交互和输出质量信号。
如果 Grok 在减少修正、重复提示和被放弃运行的同时提升任务完成率,那么排行榜结果将获得更强的实践可信度。
如果在线行为仍然表现不一,70.8% 的分数将更像是特定基准上的峰值。Cursor 尚未公开足够的产品级细节来回答这个问题。
同期的竞争性回应也将很重要。OpenAI、Anthropic、Cursor 和其他开发者可以迅速调整模型、推理控制、工具和编排方式。
竞争对手不必仅仅在同一得分上击败 Grok。它可以通过更快的执行、更好的审查行为、更清晰的计划或更少不必要的改动来竞争。
Cursor 也可能更新其任务套件。随着智能体能力扩展,该基准已从 3.1 版升级至 3.2 版。
新版本可能通过加入更长的任务、更严格的验证要求或更多与外部服务的交互来改变排名。这类变化将检验 Grok 的优势是否具有普适性。
对开发者而言,正确的回应既不是轻视,也不是自动迁移。Grok 4.6 已经值得在真实工作流中接受认真评估。
应从正确结果已知的任务开始。使用相同的代码库状态和验收标准,对比 Medium、High 和 Extra High 设置。
记录每次运行需要人工修正的频率。检查智能体是否只编辑相关文件、运行有意义的测试,并解释剩余的不确定性。
将基准记录与架构决策和模型评估放在一起。一个可检索的工程知识库可以保存提示词、结果、失败案例和评审者判断。
Cursor 与 xAI 的头条在一个重要环境中指出了一位可信的领先者。下一项决策属于开发者:当 Grok 遇到你的代码、工具和标准时,它还能保持第一吗?


