top of page

Claude Sonnet 5.5 首次亮相 Agent Arena 位列第三,但未进入帕累托前沿

5天前
讀畢需時 13 分鐘

Claude Sonnet 5.5 以 12.5% 的净提升得分进入 Agent Arena 第三名,尽管未能进入其成本效率帕累托前沿。这一结果让 Anthropic 模型包揽前三席位,也在 Anthropic 自身产品阵容中形成了一个尴尬的对比。

Arena 的发布快照显示,Sonnet 的单任务成本中位数比第二名 Claude Opus 5.5 高出约 73%。Opus 的总体得分也更高。这意味着,在这一特定配置下,Sonnet 既没有取得更高结果,也没有提供更低成本。

因此,Claude Sonnet 5.5 的 Agent Arena 成绩讲述了两个故事。Anthropic 又打造出一款极具竞争力的智能体模型,但其 Max 配置并未提供买家可能期待的、Sonnet 应有的清晰性价比优势。真正的竞争是 Sonnet 5.5 Max 对阵 Opus 5.5 High,而非 Anthropic 与其他模型供应商之间的较量。

这一差异很重要,因为 Anthropic 将 Sonnet 定位为 Opus 更快、成本更低的补充。Arena 的实时行为评估衡量的不同于 token 定价或受控实验室基准测试。它衡量的是完整智能体会话的实际表现,包括任务时长、工具使用、修正过程和输出结果。

Claude Sonnet 5.5 的 Agent Arena 成绩让 Anthropic 占据主导

Sonnet 首次亮相即排名第三,让 Anthropic 包揽 Agent Arena 前三名,但排名本身掩盖了内部权衡。

Arena 宣布,Claude Sonnet 5.5 Max 首次亮相时的净提升得分约为 12.5%。净提升用于估计所选模型相对于 Arena 基准分布,对多个用户结果信号带来的改变幅度。

该模型在总榜中位列 Claude Fable 5.1 Max 和 Claude Opus 5.5 High 之后。结果出现时,Arena 的实时页面显示,数十款模型已累计完成超过 200 万次智能体会话。

根据 Arena 的公告,Sonnet 5.5 相较 Sonnet 5 High 的提升也达到 8.1 个百分点。旧模型在总榜上的排名明显更低。即使两个条目使用不同的投入设置,这一代际提升依然具有意义。

最强的类别表现来自 Chat。根据官方排名快照,Sonnet 5.5 在该类别中以 15.6% 的净提升得分位居第一,Fable 5.1 和 Opus 5.5 随后位列其后。

其表现并不限于对话任务。在首次亮相前后,该模型也领跑 Arena 的 bash 恢复信号。Bash 恢复衡量智能体在命令失败后进行有效恢复的能力。

这一能力在编程、研究和文档工作流中至关重要。真实智能体经常会遇到缺失文件、不可用的软件包、无效命令,或返回意外输出的工具。能够识别失败并进行调整的模型,可以挽救原本仍有价值的工作流。

Sonnet 的工具幻觉率也较低。在这一语境中,工具幻觉是指尝试调用智能体实际上并不具备的工具。即便不常发生,此类错误也可能中断自动化工作流或令用户困惑。

综合排名结合了多种此类信号,而非衡量单一成功标准。一个模型可能在恢复能力上表现出色,却在其他方面落后,包括可控性或经确认的任务完成度。

Arena 的排行榜报告了数千次 Sonnet 5.5 会话。这构成了有意义的行为样本,但该模型的观测数量仍少于运行时间最长的领先模型。报告得分旁仍显示了置信区间。

这些区间避免了对排名作出过于简单的解读。第三名是展示出的排名,但相近估计值之间仍存在统计不确定性。这一结果是强有力的早期信号,而非永久性结论。

排行榜也在动态变化。模型会获得更多会话,用户行为会改变,评估方法也可能演进。Arena 的公开数据在发布帖出现后已经有轻微变动。

这种波动并不会否定公告本身。它说明,关于实时排行榜的每项主张都需要注明日期和配置。“Sonnet 5.5 排名第三”描述的是一个快照,而不是该模型不可改变的属性。

为什么帕累托前沿不包括 Sonnet 5.5

Sonnet 5.5 Max 未进入帕累托前沿,因为 Opus 5.5 High 在总体得分更高的同时,单任务成本中位数更低。

帕累托前沿包含在所衡量维度上未被支配的选项。这里的维度是净提升和单任务成本中位数。

如果没有任何竞争条目同时更便宜且更有效,一个模型就属于该前沿。当另一个条目在不牺牲另一维度的情况下改善某一维度时,该模型便会落在前沿之外。

Opus 5.5 High 恰好为 Sonnet 5.5 Max 造成了这个问题。Arena 的公告显示,Opus 的净提升更高,而 Sonnet 的单任务成本中位数约高出 73%。

这一比较并不意味着 Opus 始终成本更低。它意味着,在 Arena 所衡量的会话和选定投入配置中,Opus 产生了更好的成本性能结果。

这是本文的核心反转。Anthropic 将 Sonnet 5.5 描述为 Opus 5.5 更快、成本更低的补充,但 Arena 观察到的任务经济性颠倒了这两个排行榜条目之间的关系。

配置很重要。Sonnet 以 Max 投入运行,而 Opus 以 High 投入运行。投入设置决定模型在完成任务前应用多少计算和推理。

更高投入可以改善困难任务的输出,但也可能延长响应并增加 token 消耗。Arena 的任务级数据包含了这些选择带来的后果。

Anthropic 自己的Sonnet 5.5 公告也提出了相关观点。该公司表示,Sonnet 在较低投入设置下最能有效补充 Opus,此时任务成本会下降。

这一限定有助于调和这两种叙述。Sonnet 的公开 token 费率可以更低,但在 Max 投入下完成任务的成本可能更高。Token 价格与任务成本相关,但二者并不能互换。

即使每个 token 的费率更低,包含长时间推理、重复工具调用或大量输出的任务也可能成本更高。智能体工作流会放大这一差异,因为模型会自行决定执行多少工作。

Arena 报告称,Sonnet 5.5 Max 的单任务输出 token 数中位数远高于 Opus 5.5 High。这一差距为更高的任务成本提供了合理机制。

但这并不能证明其存在浪费。更长的响应可能包含更完整的工作、更丰富的产物,或不必要的铺陈。综合排行榜无法揭示哪一种解释适用于每一次会话。

帕累托前沿也只回答了一个狭窄的问题。它识别的是 Arena 已观察数据中的高效选择,而非每个组织在所有场景下的普遍最佳模型。

延迟、安全控制、部署可用性、上下文长度和输出风格都会影响生产决策。没有任何一个点因为落在二维前沿之外,就让这些因素消失。

不过,买家不应忽视支配关系。当一种配置在相同评估环境中得分更高且成本更低时,举证责任便转移到被支配的选项上。

Sonnet 5.5 Max 需要具备特定工作负载的优势,才能证明其相较 Opus 5.5 High 的选择合理性。其 Chat 领先表现、速度、输出风格或恢复行为可能提供这一优势,但仅凭总体排名并不能说明这一点。

Agent Arena 的方法改变了“更好”的含义

Agent Arena 从实时工作流中衡量行为,因此其得分共同反映模型选择、用户反应、工具和会话动态。

传统基准测试通常提供一组固定的问题或任务。研究人员随后将答案与预定解答、专家判断或自动化测试进行比较。

Arena 的智能体评估采取了不同方法。其评估方法论从真实的 Agent Mode 会话中提取信号,而不是使用经过策划的测试集。

这些会话可以跨越多个回合。用户会要求模型构建产物、研究主题、编写代码、分析文件,并从失败中恢复。他们之后的操作也成为评估数据的一部分。

Arena 跟踪显式反馈,包括用户报告的任务成功情况。它还提取隐式信号,例如赞扬、抱怨、修正、产物下载、工具幻觉和命令恢复。

随后,该平台会估计与每个智能体组件相关联的处理效应。Arena 将这种方法称为因果追踪。编排器模型是其中一个组件,工具和 harness 选择也可以成为额外组件。

这种设计试图将模型效应与每个模型所接收流量的差异区分开来。它比简单计算点赞平均值更具雄心。

最终得到的净提升得分是一项综合指标。Arena 会计算各个信号的效应,再将其合并为排行榜指标。

这种方法能够捕捉静态测试遗漏的行为。一个模型可能知道正确答案,却无法完成工作流。它可能调用不存在的工具、忽视修正,或声称未完成的工作已经完成。

真实使用可以暴露这些失败。Arena 表示,其轨迹还会揭示用户是否委托完整工作、是否在初始响应后收紧控制,以及是否下载了最终产物。

随附的Agent Mode 概览称,编程是其早期工作负载组合中最大的任务类别。研究和规划也占据了相当大的比例。

这一分布有助于解释为何 bash 恢复和工具可靠性会影响排名。Agent Arena 并非孤立评估聊天质量,而是在评估模型如何在一个启用了工具的系统中运行。

这种方法也带来局限性。Arena 用户属于自我选择群体,他们的任务并不代表所有企业工作负载。热门使用场景对综合结果的影响可能大于罕见但关键的场景。

用户反馈存在噪声。下载产物可能表示满意、好奇,或只是想检查结果。自然语言中的赞扬并不总意味着底层工作正确。

因果调整有助于处理分配不均,但无法将观察性轨迹转变为针对每种能力的受控测试。Arena 的方法论应补充可复现基准测试,而非取而代之。

Harnes 也同样重要。工具描述、系统提示词、沙箱行为、时间限制和界面设计都可能影响结果。采用不同组件的生产智能体,其行为可能不同于 Arena 中的对应版本。

因此,应将 Claude Sonnet 5.5 的 Agent Arena 结果理解为系统层面的观察。它并未将原始模型与其周围环境完全隔离。

在比较 Arena 与 Anthropic 的评估时,这一区别尤其重要。Anthropic 在有文档记录的模型设置下报告固定基准得分;Arena 则观察由其用户创建的开放式工作。

两者都回答了有价值的问题。一个问题是模型能否解决已定义的评估任务,另一个问题是当人们通过特定平台将实际工作交给智能体时,它会如何表现。

真正的竞争是 Sonnet Max 对阵 Opus High

在这项结果中,Anthropic 最强的竞争对手其实是 Anthropic 自己,因为 Opus 挑战了 Sonnet 预期承担的效率角色。

Claude 产品家族历来为买家提供了清晰可辨的层级:Opus 面向要求最高的工作,Sonnet 平衡性能与运行成本,Haiku 则服务于更高吞吐量的使用场景。

Anthropic 在 Sonnet 5.5 的材料中延续了这一定位。该公司将该模型定位为适用于边界明确的日常任务、错误修复、精致文档、演示文稿和电子表格。

Opus 5.5 仍是处理复杂、开放式工作并需要持续判断力时的选择。Anthropic 表示,内部和外部测试仍发现 Opus 在这类情境下表现更强。

Agent Arena 的排名支持了这种区分中与能力相关的部分。Opus 的总体排名高于 Sonnet。令人意外的是观察到的单任务成本关系。

在 Max effort 下,Sonnet 花费了足够多的时间或 token,因而失去了效率优势。这使得 effort 设置成为产品决策的一部分,而非无关紧要的实现细节。

只比较模型名称而不考虑配置的买家会忽略这一点。“Sonnet 对比 Opus”的范围过于宽泛。真正相关的问题是:哪种模型、effort 级别、提示词、工具集和停止规则,最适合特定工作负载。

Anthropic 提供 effort 控制,让开发者能够平衡质量、速度和资源消耗。其模型文档还介绍了较大的上下文窗口和可观的输出容量。

这些能力使长流程成为可能,但并不保证更长的推理会带来成比例更好的结果。

当编码代理编辑复杂代码仓库时,额外的审查步骤可能有所帮助。但当它修复一个范围清晰的小缺陷时,相同行为可能变成不必要的开销。

研究代理可能需要针对存在争议的主张进行多次搜索和来源核查,但不应将同样的流程用于简单的事实查询。

因此,组织需要按工作负载进行路由。常规任务可以从较低 effort 开始,而不确定性高或影响重大的工作则升级至更强的配置。

Chat 类别的结果以一种有益的方式让这条规则变得更复杂。Sonnet 虽然总体排名第三,却在 Chat 类别领先。专注于交互式工作的团队,可能更看重它的对话表现,而非综合排名。

Bash 恢复能力则提供了另一项可能的差异化因素。运行脆弱命令行工作流的开发者,可能更偏好能在命令失败后有效恢复的模型。

不过,这些优势需要在本地环境中验证。Arena 并不公布各组织的提示词、私有工具、安全边界或验收测试。

Anthropic 包揽前三也给竞争对手带来压力。OpenAI、Google、DeepSeek、Moonshot 及其他实验室,需要与一系列 Claude 配置展开竞争。

但这一包揽不应被解读为永久的市场控制。随着新模型推出和更多会话积累,Agent Arena 的排名会发生变化。

成本更低的竞争对手无需夺得第一名,也能重塑帕累托前沿。它只需为不需要绝对领先分数的买家提供更优的效率点。

这种动态比领奖台图表更重要。代理市场会奖励那些以可预测行为和可控资源使用实现可接受结果的模型。

Anthropic 的内部竞争可以强化这一市场。Opus 建立高质量标杆,而 Sonnet 必须通过速度、交互质量或经调优的效率来证明自身价值。

对买家而言,这一结果警示我们不要基于产品家族作出假设。产品定位只能提供初始假设;已完成任务的测量结果,才能决定这一假设能否经受真实工作的检验。

该排名无法证明什么

该排行榜并不能证明 Sonnet 在整体上不如 Opus 经济,因为结果覆盖的是特定配置和不断变化的用户会话。

最明确的不确定性在于 effort。Arena 比较的是 Max 下的 Sonnet 与 High 下的 Opus,而非在相同推理预算下比较两款模型。

对于实时排行榜而言,这种配置不匹配是合理的,因为用户接触到的正是实际产品变体。但若要分离底层模型本身的影响,这种比较的帮助较小。

严格可比的比较应在同一任务集上测试多个 effort 级别,并记录任务成功率、延迟、工具调用、输入量、输出量以及所需人工修正。

Arena 的实时数据回答的是另一个问题:它展示了通过平台分配、自然发生的会话中实际出现了什么情况。

样本成熟度带来另一项限制。新模型初期的会话数量较少,不确定性区间也比成熟条目更宽。随着使用量增长,其排名可能发生变化。

发布时的数据与后续实时排行榜已经显示出适度差异。单任务成本中位数是在滚动周期内计算的,因此变化中的工作负载构成可能改变这一数字。

一波复杂编码任务可能同时增加 token 使用量和单任务成本;随后如果会话主要由更短的 Chat 任务构成,两者则可能下降。

因此,报告中的 73% 溢价最好被视为一个快照比例。它足以解释发布时被排除在帕累托前沿之外,但不足以作为长期预算依据。

评分本身也是多维的。单一综合指标可能掩盖模型在某个信号上的优势,以及在另一个信号上的弱点。

Sonnet 在 Chat 和 bash 恢复方面领先的结果正说明了这一点。团队完全可以基于这些特性理性地选择它,同时接受较低的总体排名。

工具幻觉率同样需要谨慎解读。微小的百分比差异可能具有统计或运营意义,但无法说明每次错误的严重程度。

调用错误的搜索工具只是麻烦;尝试无效的破坏性操作则更为严重。单一比率无法传达这种差别。

任何公开排行榜都无法完全测试保密的企业环境。模型面对私有代码仓库、长篇内部文档、专有 API 和组织特定指令时,表现会有所不同。

安全和合规要求还会增加更多限制。模型排名无法决定其部署路径是否满足数据驻留、保留或访问控制要求。

Anthropic 的若干性能和效率主张也基于其自身测试。由于供应商设计了测试并控制了环境,这些主张应采用审慎的报道措辞。

该公司称,Sonnet 5.5 通常比其前代模型需要更少的 token。但这一比较无法解释,为何 Sonnet Max 在 Arena 观察到的会话中比 Opus High 使用了更多资源。

最可信的结论应保持狭窄:Sonnet 5.5 首发表现强劲,但经过测试的 Max 配置并未展现出相对于 Opus 5.5 High 的成本性能优势。

任何更宽泛的结论都需要更多证据。声称 Sonnet 天生低效,或 Opus 始终是更划算的选择,都超出了 Arena 数据所能支持的范围。

三项信号将决定 Sonnet 的权衡是否成立

较低 effort 下的结果、稳定的单任务成本差距,以及在可重复工作负载上的表现,将决定 Sonnet 的发布画像究竟是结构性的还是暂时的。

第一项信号是 Sonnet 5.5 在较低 effort 设置下的表现。Anthropic 表示,当以较低 effort 运行时,该模型能最有效地补充 Opus。

如果较低 effort 的 Sonnet 条目能保留其大部分净提升,同时降低单任务资源消耗,那么当前被排除在帕累托前沿之外的情况将显得是配置特定的。这一结果将强化 Anthropic 的产品定位。

如果 Sonnet 随着 effort 降低而损失过多性能,那么 Max 的结果就会变得更为重要。买家将不得不在 Sonnet 最强表现与其预期效率角色之间作出更艰难的选择。

第二项信号是滚动中位数单任务成本关系。Arena 应继续为 Sonnet 5.5 和 Opus 5.5 积累更多会话。

若差距持续存在,同时 Opus 保持更高分数,那么支配性结论将得到强化。Sonnet 将需要依靠类别特定优势来证明其位置合理。

如果差距收窄或反转,发布时的解读就会被削弱。这可能表明初始 Sonnet 会话异常漫长、用户行为发生变化,或模型获得了调优更新。

读者应在关注标题排名的同时查看置信区间。当不确定性范围大幅重叠时,微小的名次变化意义较小。

第三项信号是在可重复代理工作负载上的独立测试。团队需要评估,在两款模型上重放相同的编码、研究和文档任务。

这些测试应评估最终产物,而不仅是回答本身。还应记录修正次数、失败恢复、完成时间和资源消耗。

首次尝试就完成任务的代理,可能比 token 费率更低但需要三次修正的代理更便宜。人工审查时间也应纳入同一计算。

组织应从自身工作流中构建具有代表性的任务集。移除私有数据可以使这些任务适合反复评估。

评估记录也需要上下文。一个可搜索的知识库可以保留提示词、模型设置、源文件、审阅者备注和已接受的输出,以供后续比较。

这项实践之所以重要,是因为实时模型和平台会变化。基于某个 10 月排行榜快照作出的决策,可能在模型更新或路由变更后失效。

团队应从狭窄的试点开始。在成功能够客观审查的任务上比较 Sonnet 和 Opus,再在衡量失败模式后扩大范围。

对于对话式代理,应纳入后续修正和模糊请求。对于编码代理,应纳入失败命令、不完整测试和代码仓库特定规范。

对于研究代理,应测试引文质量、来源选择、矛盾处理,以及模型是否清楚标示尚未解决的主张。一篇措辞精致的长答案并不自动意味着正确。

Claude Sonnet 5.5 在 Agent Arena 的首次亮相表明,该模型属于代理市场的前列。但这并不能证明 Max effort 是其最佳运行点。

这正是买家如今需要测试的决策:Sonnet 能否在更低 effort 下保留其 Chat 和恢复能力优势,还是 Opus 依然更强且更经济?

下一次排行榜更新将提供一种答案。基于你实际工作构建的受控评估,将提供真正重要的答案。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page