top of page

Artificial Analysis Coding Agent Index 将 Claude 列为第一,但成本重排了领先者

6天前
讀畢需時 15 分鐘

Artificial Analysis 以 68 分将 Claude Sonnet 5.5 排在首位,但其最新编码代理结果揭示了一个并不那么轻松的成本故事。

Artificial Analysis Coding Agent Index 显示,采用最高努力级别 Sonnet 5.5 的 Claude Code 领先于 Gemini 4 Argon 和 GPT-6.1 Sol。然而,相比最接近的新竞争对手,这一获胜者在每项任务中消耗了更多时间、token 和 API 支出。

这一差异改变了开发团队的实际决策。Claude 在综合基准测试中领先,而搭载 GPT-6.1 Sol 的 Codex 则以一小部分实测资源,提供了几乎可比的结果。Gemini 4 Argon 位于两者之间:它兼具强劲的综合得分,并在长周期软件任务上拥有显著优势。

原始基准测试帖子将这三次发布称为新的领先者。底层结果支持其重要性,但并不构成一个简单的三席领奖台。包括 Claude Opus 5.5 在内的其他配置也位居前列。

更重要的是,每项结果都归属于特定模型、推理设置和代理框架。该排行榜并非仅测试抽象的模型智能,而是测试 Claude Code、Codex 和 Antigravity CLI 等完整编码系统。

这一区别正是故事的核心。团队如今选择的不再只是得分最高的模型,而是要衡量多拿一个基准测试分数,究竟值不值得付出额外的时间和算力。

Artificial Analysis Coding Agent Index 有何变化

最新结果比以往的模型比较更清晰地区分了基准测试领先地位与运营效率。

Artificial Analysis 在端到端工作流中评估编码代理,而非孤立的代码补全问题。其指数将代码库修改、终端操作和代码库理解整合为一个分数。

以最高努力级别运行 Sonnet 5.5 的 Claude Code 以 68 分领先。其分项结果为:DeepSWE v1.1 得分 72%,Terminal-Bench 4.0 得分 66%,SWE-Atlas-QnA 得分 67%。

运行 Gemini 4 Argon 的 Antigravity CLI 得分为 64。它在 DeepSWE 上达到 79%,在 Terminal-Bench 上为 56%,在代码库问答上为 56%。

以 xhigh 努力级别运行 GPT-6.1 Sol 的 Codex 得分为 63。该配置在 DeepSWE 上取得 73%,在 Terminal-Bench 上取得 55%,在 SWE-Atlas-QnA 上取得 61%。

Claude 与 Sol 的总分仅相差五分。然而,Artificial Analysis 测得 Claude 配置的每项任务 token 用量约为前者的 8.7 倍,运行时间也接近其六倍。

实测 API 成本显示出更大的差距。最高努力级别的 Claude 配置,每项任务的成本约为 Codex 中 xhigh Sol 的 13.6 倍。

Gemini 4 Argon 介于这两个极端之间。其测得成本约为 Sol 的 5.6 倍,指数优势却只有一分;它消耗的 token 约为 Sol 的 4.3 倍,耗时超过两倍。

因此,基准测试对比讲述了两个故事:Claude 拥有最高综合得分,而在这三种配置中,Sol 提供了最强的实测得分成本比。

Artificial Analysis 还报告了 Sonnet 5.5 的多种努力设置。这一点很重要,因为最高努力级别并不是 Claude Code 的默认设置。

xhigh 努力级别的 Sonnet 5.5 得分为 63,与 Sol 的主打得分持平。它使用的 token 超过 Sol 的两倍,实测成本则高出三倍以上。

在 high 努力级别下,Sonnet 得分为 55;在 Claude Code 的默认 medium 努力级别下,得分为 46。这些结果表明,推理预算会在多大程度上改变所评估的产品。

同样的模式也出现在 Sol 的结果中。medium 努力级别的 GPT-6.1 Sol 得分为 61,仅比其 xhigh 配置低两分;其实测成本和运行时间也显著下降。

最大推理并不必然带来最佳结果。在已发布的评估中,Sol 的 xhigh 结果比其最高努力级别结果高出三分。

这一看似反直觉的结果提醒我们,代理基准测试存在方差。更长的推理时间可能有所帮助,但也可能导致更长的轨迹、不必要的工具调用或无效的反复考量。

头名仍然是采用最高努力级别 Sonnet 5.5 的 Claude Code。更具影响力的变化在于,买家现在可以看到其最后五分的代价有多高。

该基准测试衡量的是系统,而非模型本身

编码代理得分反映了模型、其框架、工具和推理预算之间的相互作用。

Coding Agent Index v1.5 采用三个权重相等的组成部分。根据公开的指数方法论,每个部分测试软件工作中的不同环节。

DeepSWE v1.1 包含 113 项长周期任务。代理必须修改现有代码库,再由独立的验证环境判断其提交的补丁是否通过。

Terminal-Bench 4.0 包含 66 项任务,涵盖软件工程、机器学习、安全和系统管理等领域。代理在命令行环境中完成工作,随后由测试套件对结果评分。

SWE-Atlas-QnA 包含 124 个代码库问题。这些任务衡量代理能否追踪陌生代码并准确解释其行为。

每项任务都会获得三次尝试机会。Artificial Analysis 计算每个组成部分的 pass-at-one 结果,然后在综合指数中给予三个部分相同权重。

这种结构比传统代码生成测试更广泛。它奖励那些能够检查代码库、选择工具、操作终端、维持上下文并从错误中恢复的代理。

这也使框架变得重要。框架是将模型与文件、终端、指令、上下文管理和工具执行连接起来的软件层。

Claude Code、Codex 和 Antigravity CLI 并未提供完全相同的工作流。它们可能以不同方式打包上下文、鼓励不同的工具使用模式,或施加不同限制。

因此,该基准测试无法证明 Sonnet 5.5 始终是比 GPT-6.1 Sol 更好的编码模型。它所证明的是,一个经过测试的 Claude Code 配置得分高于一个经过测试的 Codex 配置。

这种区别在分项得分中清晰可见。尽管 Gemini 4 Argon 的总排名低于 Claude,但它以 79% 的成绩领跑这三者的 DeepSWE。

Sol 在 DeepSWE 上以微弱优势超过最高努力级别的 Sonnet。Claude 则通过 Terminal-Bench 和 SWE-Atlas-QnA 建立总体领先优势,在这两项上拉开了更大差距。

因此,结果描述的是不同的能力画像。Gemini 在该基准测试的长周期代码库修改中似乎最强;Claude 则在终端工作和代码库理解方面表现得更加均衡。

Sol 在三项中均保持竞争力,同时使用更少的实测资源。它没有在任何一项纳入测试的组成部分中同时战胜两位对手,但也避免了明显短板。

这种平衡对生产使用至关重要。维护大型代码库的团队可能比起回答代码库问题,更重视补丁完成率;另一个团队则可能需要在多种环境中可靠地完成终端工作。

该指数的单一分数有助于读者快速浏览格局,但在为明确工作负载选择工具时,不应取代分项结果。

Artificial Analysis 还汇总了同一基准测试套件中的 token、成本和时间数据。缺失的遥测数据会从相关平均值中排除,而不会按零处理。

当供应商对普通输入、缓存输入、缓存写入、推理和输出 token 分别定价时,其成本计算会将这些类别一并纳入。它代表按 token 计费的 API 成本,而非订阅价格。

报告的成本还排除了若干运营费用,包括工程集成、人工审核、环境设置、安全控制,以及错误补丁造成的后果。

这些排除项并不削弱比较的价值,而是界定了它能回答的问题:在这项测试中,受评估代理消耗了多少模型使用量。

它们也解释了为什么成本最低的基准测试运行,并不总能产生成本最低的获接受拉取请求。较弱的结果可能带来额外的审核、修正和重跑成本。

因此,团队应同时评估直接推理成本和每次成功结果的成本。已发布的指数提供了有用的组成要素,但并未计算这一完整的商业指标。

Claude Sonnet 5.5 以高昂的效率溢价赢得性能

Claude 在这一基准测试中的领先地位是真实的,但最高努力级别将有限的得分优势转化为大量资源投入。

Anthropic 于 2026 年 9 月 28 日发布 Sonnet 5.5。该公司将其定位为 Opus 5.5 更快速、成本更低的补充,适用于范围明确的日常任务、调试和文档创建。

Anthropic 的模型发布详情强调可调节的努力级别。较低设置优先考虑速度和经济性,较高设置则给予模型更多时间进行推理和检查工作。

Artificial Analysis 的结果展示了这种设计的两面。将 Sonnet 从 medium 提升至最高努力级别后,其指数从 46 提升至 68。

这 22 分的提升相当显著,但也伴随着约 21 倍的 token 用量、十倍以上的运行时间,以及接近 23 倍的实测 API 成本。

最高努力级别还会产生非常长的代理轨迹。Artificial Analysis 记录到,领先配置平均每项任务约有 266 个回合和 2,770 万总 token。

这些数字并不意味着每一项真实任务都会消耗相同资源。它们反映的是,在包含数百次任务尝试的高难度基准测试套件中,这一配置的平均行为。

它们也揭示了模型的获胜方式。表现最佳的配置并非在相同预算下简单地给出更聪明的答案,而是在与环境互动上投入了更多时间。

这一策略在综合得分上得到了回报。Claude 比 Gemini 高四分,比 Sol 高五分;它还在三个分项基准中的两项取得这三者中最好的成绩。

当 Claude 的较低努力设置被纳入比较后,这一溢价就更难以证明合理。xhigh 努力级别的 Sonnet 与 Sol 的 63 分持平,却消耗更多 token、时间和实测支出。

在 high 努力级别下,Claude 比 xhigh Sol 低八分。它的资源使用量更接近 Sol,但性能差距开始变得显著。

在 medium 努力级别下,Claude 比其最高配置便宜得多、速度也快得多。然而,它的得分比 xhigh Sol 低 17 分,比 Gemini 低 18 分。

这些结果并不矛盾。Anthropic 让用户可以购买更多测试时推理,而基准测试显示,额外推理能够提高任务完成率。

权衡在于规模。个人开发者可能愿意为一次困难的迁移接受漫长且昂贵的运行;而处理数千项常规变更的公司,面对的是不同的计算方式。

最佳设置也可能因同一工作流的阶段而异。团队可以将 medium 努力级别用于探索,将 high 努力级别用于实现,只在棘手失败时使用最高努力级别。

这种路由策略既能保留 Claude 的峰值能力,又不必将其最高资源预算应用于每一张工单。前提是进行测量,并制定明确的升级规则。

因此,Claude 的基准测试胜出最适用于完成质量压倒其他所有约束的任务。例如,跨仓库的高难度修复、脆弱的迁移项目,或失败成本极高的事故处理。

对于高频维护工作,这一优势则没有那么决定性。依赖更新、小型重构、测试生成和常规缺陷修复,往往更看重以可预测的成本获得可接受的质量。

这也是为什么 Artificial Analysis Coding Agent Index 不应成为采购决策的捷径。68 分的结果代表的是一种上限配置,而非自动适用的默认选择。

GPT-6.1 Sol 和 Gemini 4 Argon 从不同方向向 Claude 施压

Sol 在效率上挑战 Claude,而 Argon 则在长周期仓库任务上发起挑战。

OpenAI 于 9 月 29 日发布 GPT-6.1 Sol,距 Anthropic 发布 Sonnet 5.5 仅一天。Google 随后于 9 月 30 日推出 Gemini 4 Argon。

这一时间安排让 Artificial Analysis 能够在数天内比较三种新的前沿配置。它们在基准测试中的位置显示出,比发布介绍所暗示的更明显的差异化。

OpenAI 将 Sol 描述为一款面向编程、计算机操作和专业工作的准旗舰模型,且成本更低。其 Sol 模型卡 支持从低到最高的五档推理设置。

在 Coding Agent Index 中,xhigh 是 Sol 测试表现最好的设置,得分为 63;最高推理强度的得分则为 60。

这一结果削弱了“最大推理预算始终最稳妥”的假设。它表明,团队应测试不同的推理强度设置,而不是默认选择最高标签。

Sol 的主要优势在于单位资源投入下的稳定性。xhigh 配置完成一个平均任务约需 15.5 分钟,消耗 320 万 tokens。

最高推理强度的 Claude 约需 90 分钟和 2770 万 tokens。Gemini 则约需 34.5 分钟和 1370 万 tokens。

Sol 在各个组成部分上也具备竞争力。其 DeepSWE 得分为 73%,超过 Claude 的 72%,但落后于 Gemini 的 79%。

其 Terminal-Bench 和仓库问答得分仍低于 Claude。这些差距构成了综合得分上 5 分的落后。

对许多组织来说,这一差距可以接受。Sol 较低的资源消耗,使其能够在相同预算内进行更多尝试、更广泛部署或增加额外验证。

这一比较并不能证明 Sol 在任何情况下都更具经济性。供应商定价可能变化,缓存模式各不相同,内部工作负载也可能带来不同的 token 分布。

但它确实提出了一个值得检验的强假设。如果团队任务与该基准类似,搭配 Sol 的 Codex 可能比最高推理强度的 Claude 提供更好的成本性能平衡。

Gemini 4 Argon 带来了另一类压力。Google 将 Argon 定位为能够在复杂专业工作流中持续推理的模型。

Google 的 Argon 发布公告 提到其内部用途包括代码迁移、内存优化、研究和网络安全。在未获独立复现前,这些例子仍属于企业自身的说法。

Coding Agent Index 为这类说法中的一部分补充了第三方证据。Argon 的 DeepSWE 得分为 79%,在这三个重点系统中最强。

这一结果与 Google 对长周期工作的强调相符。它表明,即使 Claude 在总榜领先,Argon 仍值得用于评估长时间跨度的仓库改动任务。

Argon 较弱的仓库问答得分拉低了其综合成绩。其 56% 的结果比 Sol 低 5 个百分点,比 Claude 低 11 个百分点。

该模型也没有 Sol 所展现的测量效率。Argon 的综合得分仅比 Sol 高 1 分,但每个任务所需 token 超过后者四倍。

这并不意味着该配置不合理。对于面临高难度实施工作的组织,更高的 DeepSWE 完成率可能比资源消耗更重要。

关键问题在于工作负载匹配。Sol 似乎适合作为高效的通用型选择,而 Argon 则在长周期仓库修改上释放出更强信号。

Claude 在最激进的设置下仍是综合性能领导者。市场压力来自竞争对手,它们让这种领先的不同部分变得不那么有价值。

这比单一的通用排名更能反映健康的竞争格局。它为工程团队提供了明确不同的选择,而不是三个几乎可以互换的模型品牌。

这也凸显了维护可移植工作流的重要性。除非收益可被量化,团队应避免将提示词、审查实践和上下文准备绑定到单一模型。

可搜索的需求、决策和既往变更记录,能让这些比较更具一致性。团队可以使用工程知识库,在不同代理试验间保留这些上下文。

目标不是每周都更换模型,而是在性能前沿发生变化时,确保切换和评估成为可能。

这些数字无法证明什么

5 分的基准测试领先,并不能保证在真实组织中带来更好的代码、更安全的部署,或更低的总体工程成本。

Artificial Analysis 比许多排行榜运营方公开了更多方法论细节。其组成任务、尝试次数、评分方法和效率定义均有文档说明。

即便如此,基准测试仍然只是一个样本。它无法代表所有编程语言、仓库形态、依赖环境、安全策略或审查标准。

该指数对三个组成部分赋予相同权重。而真实公司几乎不会以完全相同的比例看待仓库问答、终端操作和补丁完成。

一家组织可能大部分时间都在处理拥有广泛测试覆盖的 TypeScript 服务。另一家则可能维护嵌入式 C 代码、数据管道或受监管的金融系统。

它们的内部排名可能与公开排行榜不同。即使某模型在 DeepSWE 上表现出色,也可能难以应对专有框架或文档欠缺的遗留代码。

Pass-at-one 评分同样压缩了重要的质量差异。两个补丁都可能通过自动验证器,却在可维护性、安全性、可读性或架构契合度上存在显著不同。

反向情况也可能发生。一个有用的部分解决方案可能因未满足某项验证条件而失败,并与完全不可用的尝试得到相同的二元结果。

SWE-Atlas-QnA 引入了另一项依赖。Artificial Analysis 使用自动评审器判断仓库答案是否满足所有必要标准。

自动评审支持大规模评估。但它仍可能继承歧义、模型偏见或评分错误,尤其是在存在多种有效表述的解释性回答中。

基准测试汇总后的平均值也掩盖了离散程度。平均成本无法揭示,大多数任务是否可预测,而少量任务是否会形成极长的执行轨迹。

这种方差对预算至关重要。一项服务可以承受中等平均值,却仍可能因为个别运行消耗过多 tokens 或长时间占用环境而受损。

产品更新后,代理行为也可能发生改变。工具选择、上下文压缩、重试逻辑和隐藏的系统指令,都可能在没有新的公开模型名称时发生变化。

因此,应将该基准视为带有时间戳的测量结果。它不是 Claude Code、Codex、Antigravity CLI 或其底层模型的永久属性。

最高推理强度的 Claude 展示了将上限结果误读为默认体验的风险。该测试配置的资源密集程度远高于 Claude Code 的中等默认设置。

该指数还比较了按 token 计费的 API 支出。订阅限制、协商后的企业费率、区域处理以及内部基础设施,都可能改变团队的实际经济账。

人力成本同样缺失。如果代理异步运行,速度较慢也可能可以接受。当开发者正在等待反馈时,速度更快的代理则可能更有价值。

审查负担是另一项尚未解决的变量。一个需要大量检查的低成本补丁,其总体成本可能高于经短暂审查即可接受的高成本补丁。

安全性也应得到同等谨慎的对待。没有任何一项头部得分能够单独证明,一个代理遵循最小权限访问、能够抵御恶意仓库指令,或不会泄露敏感上下文。

Google 在开展分阶段安全工作期间限制了 Argon 的初始可用性。这一发布方式意味着,其公开使用证据可能仍比基准测试关注度所暗示的更为有限。

供应商的主张也需要谨慎归因。Anthropic、OpenAI 和 Google 都突出展示了来自不同测试套件和设置的有利评估结果。

这些结果可以准确,却未必能够直接比较。不同的测试框架、任务集、预算和评分规则往往会产生不同的领先者。

Artificial Analysis 通过在同一个框架中运行配置来提高可比性。但它无法消除专有代理和模型接口带来的全部差异。

工程负责人应在标准化之前复现一项小规模内部试验。一套有用的测试集应包括已完成的工单、已知失败案例和具有代表性的仓库约束。

审查人员应评估正确性、不必要的改动、安全性、测试覆盖率、解释质量和获得接受所需时间。token 支出应与这些结果一同记录。

最终指标应是每美元的已接受工作量,或每工程师小时的已接受工作量。公开综合分数可用于引导候选方案选择,但无法替代这一测量。

三个信号将决定 Claude 的领先是否重要

下一阶段将由默认设置下的性能、已接受变更的经济性,以及更新后的基准稳定性决定。

第一个信号,是实用推理强度设置下的性能。最高配置容易吸引头条关注,但默认设置决定了绝大多数日常使用体验。

Sonnet 5.5 在中等推理强度下的得分远低于其最高结果。在已发布数据中,Sol 从 xhigh 降至中等设置时仅损失 2 分。

如果 Anthropic 缩小这一默认设置差距,Claude 的 68 分上限表现将与普通团队更相关。如果差距持续存在,Sol 的效率优势将进一步增强。

第二个信号,是每项已接受变更的成本。公开基准目前衡量的是单任务 API 支出,而不是从需求到代码合并的完整路径。

团队应关注供应商或独立评估方是否发布经过审查调整的结果。其中应包括重跑、人类修正时间,以及验证后发现的回归问题。

如果 Claude 的补丁需要更少审查,其溢价就更容易得到辩护。如果 Sol 较低的推理消耗不会带来额外修正工作,其优势就会更强。

如果 Argon 的 DeepSWE 优势能够迁移至生产环境,它可能会在复杂仓库变更上领先这一指标。单凭其综合得分无法回答这个问题。

第三个信号,是排名稳定性。编程代理会随着模型更新、测试框架修订、工具策略和上下文管理改进而变化。

稳定的领先者应在重复运行和不同基准版本中保持位置。若微小系统更新后分数出现大幅变化,人们对狭小分差的信心将下降。

Artificial Analysis 已经公开了组成部分结果、效率指标和方法论修订。未来的重跑将显示,5 分的差距代表的是持久分离,还是暂时的配置效应。

开发团队不必等待完美的基准测试。现在就可以做出有边界的决策。

先从一组具有代表性的内部任务开始。在访问条件允许的情况下,对比 Claude 的多个推理强度设置与 Sol 和 Argon。

保持代理权限、代码库快照和成功标准一致。记录实际耗时、token 用量、失败情况、审查时间,以及最终改动是否被接受。

只有当任务确实需要升级时,才使用高强度配置。常规工作应从满足团队验收门槛的最低成本设置开始。

在模型或测试框架重大更新后,重新进行比较。Artificial Analysis Coding Agent Index 的价值恰恰在于,前沿格局仍在快速变化。

目前,它传递的信息很清晰。Claude Sonnet 5.5 在这三种新配置中拥有最高的公开得分,但它并不在所有实际意义上的“第一名”定义中占优。

GPT-6.1 Sol 具备颇具吸引力的效率表现,而 Gemini 4 Argon 则在长期代码库工作方面领跑三者。正确选择取决于团队最重视哪种结果。

贵组织是否愿意为额外五个指数点支付高昂的资源溢价,还是会选择用 Sol 支持更多尝试与验证?在选定默认方案前,请用你们自己已合并的工作来检验这个问题。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page