top of page

GPT-6.1 Sol 在 Agent Arena 首秀中位列第 5,同时改写成本曲线

6天前
讀畢需時 12 分鐘

根据 Arena 10 月 2 日的公告,OpenAI 的 GPT-6.1 Sol 在 Agent Arena 首秀中以 11.23% 的净提升分数位列第 5。仅凭这一排名就已颇为引人注目。更尖锐的挑战在于,Sol 在每项已完成任务消耗显著更少算力的情况下,性能已十分接近成本更高的领先模型。

Arena 表示,处于 Max 推理模式的 GPT-6.1 Sol 已进入其帕累托前沿,即在性能和任务成本两项指标上均未被其他模型超越的模型集合。这一位置意味着,Sol 不只是又一款排名靠前的 OpenAI 新模型。它检验了买方是否仍需要为每一种高要求智能体工作流使用最昂贵的模型配置。

这一比较给 OpenAI 和 Anthropic 的高端模型都带来了压力。在 Arena 公告发布时的快照中,GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 和 Claude Sonnet 5.5 仍排在前面。不过,它们的性能领先幅度足够小,以至于成本差距变得难以忽视。

GPT-6.1 Sol Agent Arena 结果改变了采购问题

GPT-6.1 Sol 并未夺得第一名,但它让第一名对许多生产决策而言不再那么具有决定性。

Arena 的智能体排名显示,在该机构公布首批 Agent Arena 结果时,GPT-6.1 Sol 位列第 5。其 11.23% 的净提升分数使该模型跻身通过实时智能体活动衡量的最强系统之列。

净提升并不是传统意义上的考试分数。Arena 会根据多项行为信号,将每个模型与平均模型基线进行比较。正向结果表明,使用该模型替代基线模型后,测得的结果相较基线有所改善。

因此,第五名并不意味着 GPT-6.1 Sol 恰好多完成了 11.23% 的任务。它反映的是 Arena 所追踪行为中的综合相对效应。这些行为包括已确认的任务完成情况、用户反应、可引导性、命令行恢复能力和工具可靠性。

Arena 的发布帖强调,在该快照中,GPT-6.1 Sol 与领先模型的差距约为三个百分点。它与其他几种高端配置的差距更小。

该模型落后于 Max 推理模式下的 Claude Fable 5.1 3.08 个百分点。它与 High 推理模式下的 Claude Opus 5.5 相差 2.59 个百分点。它仅落后于 Max 推理模式下的 Claude Sonnet 5.5 1.29 个百分点。

OpenAI 内部模型之间的比较同样重要。Arena 报告称,GPT-6.1 Sol 的得分比 GPT-6 Sol 高 1.52 个百分点,同时将任务成本降低了 39%。它与 GPT-6 Astra 的差距也仅为 1.04 个百分点,而任务成本降低了 81%。

这些数据在最佳测得结果和最佳经济性结果之间形成了实际区别。只按排名选择的买方仍会选择排在 Sol 之前的模型之一。但若将重复任务、重试和运营预算纳入考量,买方如今面临的是另一套计算方式。

这种区别很重要,因为智能体成本的累积方式不同于普通聊天机器人成本。智能体可以搜索网页、检查文件、执行命令、修正错误,并回溯先前材料。每增加一个动作,任务所消耗的总资源都会扩大。

Token 费率仍然重要,但它们无法涵盖整个工作流。两款公开费率相近的模型,若其中一款需要更多步骤、生成更长输出,或反复调用未成功的工具,实际任务成本就可能不同。

因此,Arena 将每项任务的成本中位数作为补充衡量指标。该数值描述的是已完成工作单元的实际支出,而不是根据单次回复估算成本。这使 GPT-6.1 Sol 的 Agent Arena 结果与大规模部署智能体的团队相关。

当应用于数千项研究、编程或文档处理工作时,微小的差异也会变得显著。排名第一的模型仍可能是最困难任务的正确选择。但这不再意味着同一模型应当处理每一步工作。

这正是核心变化。GPT-6.1 Sol 并未消除性能层级,而是压缩了高端能力与成本更低替代方案之间的有效差距。

Agent Arena 衡量的是工作,而不只是更受偏好的答案

这一结果之所以有分量,是因为 Agent Arena 会评估长流程中的行为,但其方法论仍有重要局限。

许多公开模型排行榜比较的是孤立的回答。用户提交提示词、查看两份回复,再投票选出自己偏好的那一份。这种方法覆盖面广,但无法完整反映模型在较长任务中控制工具时会发生什么。

Agent Arena 评估的是编排器模型,也就是负责决定使用哪些工具以及如何安排动作顺序的模型。Arena 的 Agent Mode 可提供网页搜索、文件处理、图像生成、编程工具和沙盒化命令行。

这些能力让用户可以尝试完成项目,而不只是进行单轮交流。例如,研究某个主题、编辑一项成果、调试代码或搭建一个小型网站。每个项目都可能暴露短回答中难以发现的失败。

Arena 的评估方法论始于随机化模型分配。会话被发送给不同模型,使 Arena 能够估算使用某一模型而非平台平均模型的效果。

排行榜的核心结果结合了五项信号。已确认成功记录用户是否明确标记任务已完成。表扬与抱怨则捕捉工作流中的直接正面或负面反应。

可引导性衡量模型在被纠正后响应的有效程度。Bash 恢复能力追踪其解决命令行错误的速度。工具幻觉衡量智能体是否尝试调用自己并不具备的工具。

每项信号在综合结果中权重相同。Arena 随后将模型表现表示为相对于随机化基线的百分点差异。这一构造解释了为何公布的数值不应被视为传统准确率分数。

各项单独指标也揭示了为什么智能体质量不同于回复质量。一份看似成熟的回答仍可能来自低效过程。反过来,智能体也可能在纠正中途错误后产出有用成果。

Arena 表示,其方法论取材于自然产生的用户轨迹,而非固定的一套合成提示词。这一选择提升了真实性,因为任务反映了人们会借助现有模型尝试什么。它也引入了受控基准测试会消除的变动性。

用户带着不同的期望、技能水平和成功定义而来。有些任务很简单,另一些则需要长上下文、多种工具或反复修改。将它们汇总的排行榜描述的是平台表现,而非每一种企业部署情况。

随着 Arena 加入更强模型并收到新的会话,基线也会变化。即使某个模型的底层行为没有变化,其净提升也可能下降。当平均模型变得更有能力时,就可能发生这种情况。

排名同样只是快照。Arena 的实时榜单会随着新模型加入、置信区间收窄或任务组合变化而改变。第 5 名描述的是公告发布期间的情况,而不是附着于 GPT-6.1 Sol 的永久标签。

成本也有类似的背景因素。Arena 根据自身智能体环境计算实际支出。使用不同系统提示词、工具框架、缓存策略或重试策略的公司,可能会观察到不同结果。

信号定义让这些区别变得格外清晰。例如,已确认成功要求用户明确回答 Arena 的完成提示。单独的表扬并不足以满足这一特定信号。

这种精确性有助于读者解读排名,也抑制了最容易出现的过度主张。GPT-6.1 Sol 的排名支持这样一种观点:它在 Arena 所观察到的工作流中表现出色,但这并不能证明其具备普遍优越性。

最站得住脚的结论更为有限:在一个大型实时评估系统中,Sol 在行为结果和实际观测到的任务效率之间实现了强劲结合。

更低的智能体成本让高端模型承压

主要竞争不再只是 OpenAI 对阵 Anthropic,而是高端性能与经济上足够的性能之间的竞争。

在 Arena 的快照中,Max 推理模式下的 Claude Fable 5.1 保持第一名。High 推理模式下的 Claude Opus 5.5 和 Max 推理模式下的 Claude Sonnet 5.5 也仍领先于 GPT-6.1 Sol。

Sol 并未否定这些模型。它改变了买方在为其优势付费前所需的证据。如今,微小的性能领先必须证明大得多的成本差异是合理的。

Arena 表示,与排名第一的 Claude Fable 配置相比,GPT-6.1 Sol 的任务成本降低了 88%。测得的性能差距为 3.08 个百分点。这一比较构成了本文的主要张力。

同样的模式也出现在其他比较中。Arena 报告称,相较于 High 推理模式下的 Claude Opus 5.5,Sol 的成本降低了 65%,性能差距为 2.59 个百分点。与 Max 推理模式下的 Claude Sonnet 5.5 相比,其成本降低了 80%,性能差距为 1.29 个百分点。

这些数据并不意味着更便宜的模型会赢得每一个采购决策。较小的平均差异可能掩盖特定任务上的巨大差别。当一次失败运行会带来严重后果时,领先模型或许值得其成本。

复杂代码迁移就是一个例子。能够避免细微回归的模型,可能节省远超其额外推理成本的开支。同样的逻辑也适用于安全分析、受监管文档以及不可逆的基础设施变更。

常规工作流则构成相反情形。研究分流、初步数据整理、文档比对和草稿生成通常能够接受人工审核。对于这类工作,较小的平均质量提升,其价值可能低于更高的吞吐量。

在这种模式下,模型路由变得更具吸引力。团队可以将大多数任务交给 Sol,并将困难案例升级到 Astra 或其他高端模型。人工审核人员也可以在低成本尝试显示出不确定性时重新分配工作。

OpenAI 对 GPT-6.1 Sol 的定位也与此类似。其模型文档称,Sol 在复杂编程、计算机使用和专业工作方面接近 Astra,同时降低成本。

该模型支持多种推理强度设置,包括 Max。推理强度决定模型在生成回答或采取行动前可投入多少内部计算。Arena 在所报告的比较中评估的是 Max 配置。

GPT-6.1 Sol 还通过 OpenAI 的 Responses API 支持工具调用。可用能力包括网页搜索、文件搜索、代码执行、托管 Shell 访问、计算机使用和 Model Context Protocol 连接。

这些功能使 Arena 的结果与已部署智能体更直接相关。Sol 的竞争并不只局限于文本生成器。它被定位为与 Arena 所观察工作流相似的流程编排器。

不过,框架仍然重要。框架是围绕模型提供工具、提示词、权限、记忆和恢复逻辑的软件层。改变这一层可能同时改变成功率和资源消耗。

在 Arena 的评测框架中表现高效的模型,在企业内部系统中可能会采用不同的路径。工具描述可能不够清晰,权限可能更受限,数据检索也可能带来延迟或不可靠的结果。

因此,这些百分比应当成为评估的起点,而非终点。它们为测试 Sol 与高级配置之间的表现差异提供了可信理由,但无法替代针对特定工作负载的证据。

因此,Anthropic 和 OpenAI 的高端模型承受的压力既来自商业层面,也来自架构层面。它们都必须证明,其剩余的性能优势能否创造足够的运营价值,以弥补效率差距。

这种压力同样延伸至产品团队。将每项任务都发送给当前最强模型的固定策略,如今已越来越难以辩护。动态路由、升级机制和任务分段提供了更理性的应对方式。

对开发者而言,关键比较不只是 GPT-6.1 Sol 与 Claude 的对决,而是以 Sol 为首选的路由策略与仅使用高级模型的路由策略之间的比较。Arena 的结果为前者提供了证据,但并未宣称其在所有场景下都更优。

GPT-6.1 Sol 排名无法证明什么

帕累托位置是在已测环境中效率的有力证据,而非对可靠性、安全性或所有工作负载的保证。

当没有任何已测替代方案能够同时实现更高性能和更低成本时,该模型便处于帕累托前沿。这个地位很有价值,因为它能从二维比较中剔除那些明显处于劣势的选择。

但它并不能确定一个放之四海皆准的赢家。多个模型可以位于同一前沿上的不同位置。较低成本的模型可能最适合某位买家,而性能更高的模型对另一位买家仍然是最优选择。

前沿也取决于所选的衡量轴。Arena 将其综合净改善评分与观测到的任务成本进行比较。一个组织可能更在意其他维度,例如延迟、区域可用性、隐私、可审计性或可预测的输出结构。

合规团队可能比起平均用户满意度,更重视可复现性。编码团队可能更关注特定代码库中的测试通过率。客户支持业务则可能优先考虑语气和政策遵循情况。

Agent Arena 的自然流量无法完整代表这些环境中的每一种。其任务分布来自主动选择使用 Arena 的人群,而这一群体可能不同于企业员工、客户或自动化系统。

评估中的行为信号也部分依赖用户反馈。确认成功需要明确反馈;赞扬与投诉只会在用户表达时出现。沉默的满意与沉默的放弃都可能难以解读。

Arena 通过信号定义和因果比较来处理这些问题。不过,再先进的统计方法也无法将一个平台上的活动转化为完整的智能体行为地图。

置信区间同样重要。接近的头部得分可能意味着真实的相似性,而非稳定的排序。当区间重叠时,单个名次的差异应当获得比公布榜单所暗示的更少关注。

因此,11.23% 的结果应被视为与 Arena 的模型池和数据窗口相关的估计值。未来的会话可能会改变这一估计,更强的新参与者也可能改变用于比较的基线。

出于类似原因,成本比较也可能发生变化。任务成本中位数取决于任务长度、工具使用、输出量以及模型选择的执行轨迹。不同的工作组合可能产生不同的中位数。

OpenAI 自身的安全材料还增加了一个维度。该公司的系统卡附录称,其将 GPT-6.1 Sol 视为具备关键网络安全能力,以及较高的生物和化学能力。

OpenAI 表示,Sol 使用与 GPT-6 Astra 相同的安全防护体系。这些声明描述的是该公司的评估和部署决策,并不意味着买家可以把较高的基准测试排名视为每种智能体配置都安全的证据。

工具权限仍然是一个重要控制点。即使底层模型能力强且对齐良好,被允许执行命令、访问私有文件或操作外部服务的智能体仍可能造成损害。

因此,团队应将模型选择与权限设计分开考虑。Sol 的效率可能支持更广泛的部署,但更广泛的访问权限也会提升对范围受限凭据、审批关卡、日志和回滚路径的要求。

实用的评估应在预期的评测框架下重放具有代表性的任务。它应记录完成质量、人工修正、工具故障、延迟和总资源使用情况。测试还应包括对抗性或模糊的指令。

该基准提供了一个有用的先验判断:GPT-6.1 Sol 值得在复杂智能体工作中被认真考虑。但它并不能免除内部测试的必要性。

这一区别保护了分析的两面。因为结果并非普适而否定它,会忽视有意义的真实使用证据;将其视为最终证明,则会赋予该基准超出其设计所能支持的权威。

三个信号将表明 Sol 的优势能否持续

下一项考验在于:随着使用规模扩大、竞争者作出回应、评估变得更专业化,GPT-6.1 Sol 能否保持其效率。

第一个信号是排行榜稳定性。随着 Arena 收集更多会话、其置信区间收窄,GPT-6.1 Sol 需要维持在榜单前列。持久的领先位置将强化这样一种判断:该结果反映的是可重复的行为。

单纯的名次变动并不必然意味着性能退步。Agent Arena 的基线会随着参与模型和任务分布而变化。真正有用的问题是,Sol 能否在连续的快照中保持在帕累托前沿。

从第五名降至第六名,远不如被另一模型支配来得重要。如果某个竞争对手以更低的观测任务成本实现更高的净改善,Sol 的核心优势就会减弱。

第二个信号是类别表现。Arena 将智能体工作划分为代码、聊天和工作等领域。综合评分可能掩盖一种情况:某模型在一个类别中表现出色,却在另一个类别中明显落后。

如果 Sol 的整体结果能在各类别中重复出现,其价值就会更高。一致的排名将支持更广泛的默认使用;不均衡的结果则更适合基于任务类型进行定向路由。

开发者应尤其关注编码工作流。这些任务会暴露工具选择、命令执行、恢复和验证行为。微小的可靠性差异会在长执行轨迹中不断累积。

企业买家应关注工作类别的结果。研究、文件处理、分析和产物生成与许多内部自动化项目相似。这些领域的强劲表现,将使效率主张在开发者工具之外也具有现实意义。

第三个信号是竞争性回应。Anthropic、Google 和其他模型提供商可以通过新版本、修订后的推理模式或更高效的智能体行为作出回应。OpenAI 也可以通过更新 Sol 进一步缩小差距。

最重要的回应未必来自排名第一的模型。若竞争对手以更低任务成本匹配 Sol 的得分,将直接挑战其帕累托位置。另一个竞争者则可能通过显著更高的可靠性优势,证明更高成本的合理性。

评测框架的改进可能与模型发布同样重要。更好的工具描述、记忆控制、上下文压缩和恢复策略,都可以减少不必要的步骤。这些变化无需改变底层模型,便可重塑任务经济性。

买家还应关注 OpenAI 接近 Astra 的定位能否经受独立部署的验证。若内部评估复现了较小的质量差距,将支持以 Sol 为首选的路由策略;若出现较大的特定工作负载差距,则会削弱这一判断。

目前,GPT-6.1 Sol 在 Agent Arena 中的结果支持一个审慎的结论:OpenAI 已将一款模型推至足够接近领先者的位置,以至于经成本调整后的选择已不能再被视为次要问题。

这个故事并不是第五名暗中等于第一名,而是单靠排名已无法回答生产环境中的问题。真正相关的选择取决于每增加一个性能点究竟能创造多少价值。

评估 AI 智能体的团队现在应将 Sol 与当前的高级模型并置,在相同的代表性工作上运行。衡量成功完成率、修正次数、重试次数、延迟和总任务消耗,然后识别高级选项在哪些情形下值得额外的资源投入。

这一过程将公开排行榜转化为部署决策,同时不会混淆二者。如果 Sol 保持其前沿位置,它将强化分层模型路由的理由;如果竞争对手抹平优势,同样的测量也会揭示这一变化。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page