SWE-1.7 的智能水平逼近 GPT-5.5 与 Opus,但基准差距只揭示了一半真相
- Ethan Carter

- 16小时前
- 讀畢需時 16 分鐘
Cognition 发布了 SWE-1.7,在三项编程评测中取得了接近 GPT-5.5 和 Claude Opus 4.8 的成绩。根据该公司公布的结果,其专用模型在其中一项基准测试中与 GPT-5.5 仅相差 0.7 个百分点。如此微小的差距意味着,“SWE-1.7 的智能水平逼近 GPT-5.5 与 Opus”不只是一则吸引眼球的标题。
该模型并未在所有测试中领先。在公布的三项评测中,它都落后于 Opus 4.8,并在其中两项中不及 GPT-5.5。不过,据称 SWE-1.7 在 Devin 内部的运行速度可达每秒 1,000 个 token,主要面向耗时较长的异步软件任务。
这种组合才是真正带来压力的地方。Cognition 试图证明,应用公司可以从一个开放权重基础模型出发,通过专门的强化学习,逼近全球最大 AI 实验室打造的模型。问题不只是 SWE-1.7 与 GPT-5.5 或 Opus 之间的较量,而是聚焦式后训练与完整掌控前沿基础模型之间的竞争。
SWE-1.7 在三项编程测试中的智能水平逼近 GPT-5.5 与 Opus
Cognition 公布的结果显示,SWE-1.7 已跻身前沿编程模型之列,但尚不足以证明它是综合表现最强的模型。
Cognition 于 2026 年 7 月 8 日发布 SWE-1.7,并称其为公司迄今训练出的能力最强模型。该公司的技术报告公布了 FrontierCode 1.1 Main、Terminal-Bench 2.1 和 SWE-Bench Multilingual 三项测试的结果。
在 FrontierCode 1.1 Main 上,SWE-1.7 的通过率为 42.3%。GPT-5.5 达到 43.0%,Opus 4.8 则达到 46.5%。SWE-1.7 也超过了得分 38.5% 的 Opus 4.7,并大幅领先作为其基础模型、得分为 30.1% 的 Kimi K2.7 Code。
在测试智能体终端环境操作能力的 Terminal-Bench 2.1 上,比较结果略有不同。SWE-1.7 得分为 81.5%,GPT-5.5 和 Opus 4.8 分别为 84.2% 和 86.9%。Opus 4.7 得分为 83.0%,因此在这项测试中,SWE-1.7 落后于上述三个闭源模型。
SWE-Bench Multilingual 给出了 SWE-1.7 相对 OpenAI 最明确的优势。SWE-1.7 达到 77.8%,高于 GPT-5.5 的 76.8%。Opus 4.8 仍以 84.4% 保持领先,而 Opus 4.7 得分为 80.5%。
这些数据支持一个范围有限的结论:在 Cognition 选取的编程工作负载以及其披露的评测配置下,SWE-1.7 的表现已接近 GPT-5.5 与 Opus。
但它们并不足以证明 SWE-1.7 在通用智能方面能够媲美这两个模型。Cognition 将 SWE-1.7 设计为服务于智能体式软件工程,即需要模型检查代码仓库、使用工具、执行命令并反复修改成果的软件任务。
测试框架同样不容忽视。Cognition 使用 Claude Code 评测 Anthropic 模型,使用 Codex 评测 OpenAI 模型,其他模型则通过 Devin CLI 进行评测。每个模型均采用最高推理设置,并可在 Terminal-Bench 任务上运行最多四小时。
这种方法试图让每个模型都在各自最适配的智能体环境中运行,但也使模型之间的比较无法脱离周边软件单独成立。测试结果可能反映模型本身、测试框架、工具指令、重试机制、上下文管理,或这五个因素之间的相互作用。
FrontierCode 还存在另一项限制:该基准测试由 Cognition 自行创建。公司推出它的目的,是衡量编程智能体生成的改动是否真正值得开发者合并,而非仅仅产出能够通过测试的补丁。
其基准设计强调正确性、范围控制、代码质量和工程判断。这些指标具有价值,但在其排名具备成熟标准应有的公信力之前,该基准仍需得到更广泛的独立应用。
公开的终端排行榜提供了一个更具外部性的参考。即便如此,配置差异仍可能影响结果,因为编程智能体是完整系统,而非孤立的文本模型。
因此,审慎解读后得出的结论虽然重要,却也有明确边界:在多项高难度编程评测中,SWE-1.7 的智能水平已逼近 GPT-5.5 与 Opus。至于它能否在陌生的生产级代码仓库中提供同等可靠性,仍是一个有待实际部署检验的问题。
压力正在落到前沿模型的经济性上
SWE-1.7 无需 Cognition 预训练全新的基础模型,便缩小了专用模型的性能差距,从而对 OpenAI 和 Anthropic 形成压力。
OpenAI 和 Anthropic 可以将基础模型的开发成本分摊至编程、写作、研究、分析和消费者应用等多个领域。Cognition 选择了一条更聚焦的路线:它需要的是一个能在 Devin 内部表现出色,尤其擅长长时间运行的软件开发任务的模型。
这种专业化改变了竞争格局。一个模型无需在所有认知任务上超越 GPT-5.5,也能成为工程工作流中的可靠替代方案。它只需具备足够高的编程准确率、可靠的工具调用能力、可控的延迟和可接受的运营成本。
Cognition 表示,SWE-1.7 推进了这种成本与性能之间的平衡。该公司并非只是在不改变模型的情况下优化推理,而是在一个已经接受过广泛后训练的基础模型上,又实施了一轮大规模强化学习。
如果这些提升能在生产环境中得到验证,前沿实验室将面临来自下方的竞争压力:当一个聚焦型模型足以处理买家的实际工作负载时,它们的通用模型就必须证明,更广泛的能力和更高的资源需求物有所值。
受到影响的不只是模型提供商。编程智能体公司往往基于第三方模型构建产品,并随着质量、速度和可用性的变化在不同模型之间切换。如今,Cognition 对其产品内部的智能层拥有了更强的掌控力。
这种掌控力使其能够针对 Devin 的运行环境、失败模式和任务结构开展训练。它可以围绕长时间会话塑造模型,而不必将通用模型的既有行为视为不可改变的前提。
这类似于垂直整合,但起点并不寻常。Cognition 并未从原始数据开始,自下而上构建完整的模型技术栈,而是以 Kimi K2.7 Code 为基础,将资源集中在最贴近自身产品的一层。
Kimi 属于混合专家模型家族,这类模型在处理每个 token 时只会激活总参数中的一部分。此前的 Kimi K2 论文介绍了一种拥有 1.04 万亿参数、每次约激活 320 亿参数的架构。
该架构在推出时已经完成面向智能体的后训练,其中包含工具使用数据、强化学习,以及来自合成环境和真实环境的经验。因此,Cognition 的起点是一个能力成熟的基础模型,而非未经训练的检查点。
这种策略预示着一种新的分工方式:少数组织负责为大规模预训练提供资金,而产品公司则面向特定环境,对开放权重模型进行专业化改造。
这并不意味着基础模型实验室会变得无关紧要。基础模型的质量依然决定着后训练团队能够获得怎样的原材料。OpenAI 和 Anthropic 也在持续改进自身的编程产品、评测框架和工具使用策略。
不过,SWE-1.7 改变了应用公司能够合理尝试的边界。它们可以成为模型开发者,而无需转型为全栈基础模型实验室。
这种可能性迫使前沿模型提供商作出回应。它们必须不断提升编程性能,同时确保自身模型对应用公司仍有足够吸引力,使后者不愿将其替换。
应对方式可以有多种。模型提供商可以提供更强的定制能力、更快的推理速度、更完善的编程框架,或专门面向特定智能体工作负载的模型。它们也可以凭借可靠性和能力广度,让通用模型变得难以替代。
Cognition 的成果尚未为这场竞争盖棺定论,但它已表明,专业化后训练已经成为可信的竞争压力来源,而不再只是一个次要的收尾环节。
更多强化学习才是关键机制,而非更换基础模型
SWE-1.7 最具影响力的主张是:即便 Kimi K2.7 已接受过广泛的后训练,强化学习仍能从中挖掘出显著提升。
强化学习(RL)通过奖励成功行为来训练模型,而不只是教模型模仿示例。对于编程智能体,奖励可能来自测试、任务验证器、安全检查,以及对代码仓库最终改动的评估。
经过大量后训练的模型可能会逐渐减少探索。其概率分布会收窄,重复训练带来的收益不断递减,性能最终进入平台期。这种现象支持了“后训练存在上限”的观点。
Cognition 认为,其成果对这一上限提出了挑战。SWE-1.7 在 FrontierCode 上的表现从 Kimi K2.7 Code 的 30.1% 提升至 42.3%;Terminal-Bench 的成绩从 72.7% 提升至 81.5%;SWE-Bench Multilingual 则从 73.5% 提升至 77.8%。
这些提升来自四项相互关联的改进:训练稳定性、分布式基础设施、更高质量的任务数据,以及更长的任务时间跨度。
稳定性方面的工作重点是熵,即衡量模型在下一步可能采取的行动中还保留多少不确定性的指标。当熵发生坍缩时,模型便会停止探索替代策略,奖励也可能进入平台期。
Cognition 在训练期间采用 top-p 采样,将采样范围限制在一组概率足够高的 token 内。公司还将其与采样分布重放结合使用;后者会记录 rollout 期间可用的 token 集合,并在训练时重建该分布。
这种组合旨在解决生成样本的策略与从样本中学习的策略之间的不匹配。Cognition 表示,该方法在限制训练与推理之间差异的同时,使熵大致保持稳定。
基础设施设计将中央训练器与负责生成 rollout 的推理系统分离。Cognition 将这些 rollout 系统部署在横跨三大洲的四个数据中心。
系统不会在每次更新后传输整个模型,而是发送相邻权重版本之间经过压缩的差异。Cognition 表示,这使传输数据量减少了 99% 以上。
该公司称,其万亿参数模型的跨洲更新耗时一至两分钟。应用更新会使推理暂停三至四秒,而更广泛的 rollout 流水线仍可继续运行。
容错能力同样重要,因为长时间运行的强化学习训练会经常遭遇硬件故障。Cognition 让推理工作节点基本保持无状态,并将模型版本存储在对象存储中。
中央训练器仍是紧密耦合的组件。其节点会在每一步将状态保存在本地,并将该状态复制到其他节点,使训练能够恢复,而无需重启整个 rollout 集群。
这一架构之所以重要,是因为它改变了训练算力的获取方式。即使公司没有一个超大规模集群,也可以整合分布在不同地区的较小集群,前提是其训练算法能够容忍异步生成 rollout。
数据质量构成了这一机制的另一半。编程任务需要验证器来区分真正正确的解决方案,与那些仅仅利用薄弱测试机制的补丁。
Cognition 表示,它过滤了学习信号过少的任务,并强化了评测环境,防止奖励欺骗。沙箱无法访问网络、Git 历史记录,也不包含可能泄露预期解决方案的参考文件。
任何被检测到的作弊尝试都将获得零奖励,无论其是否成功。其目标是让模型学习完整的任务行为,而不是通过捷径虚增基准测试分数。
这些控制措施也塑造了 SWE-1.7 探索代码仓库的方式。Cognition 报告称,在 FrontierCode 上,该模型调用工具、读取文件和执行搜索的次数均多于 GPT-5.5、Opus 4.8 或 Kimi K2.7 Code。
据称,该模型会先调查错误症状,再修改代码。它会搜索相关逻辑,使用小型脚本验证存在歧义的假设,并考虑隐藏需求或对抗性输入。
这种行为为其更好的编码成绩提供了一种合理解释。仓库级软件工程往往要求先找到正确的代码并理解其关联关系,之后才能生成补丁。
SWE-1.7 还采用了自我压缩机制,使智能体能在接近上下文上限时总结当前工作状态。随后,模型会基于自己的摘要继续工作,而不必保留完整的交互历史。
Cognition 直接训练了这种行为,而非仅通过 Devin 的编排层加以实现。据称,其训练 rollout 最长可持续六小时,远超单个原始上下文窗口的容量。
一种交替长度惩罚机制在简单任务上抑制不必要的推理,同时保留处理困难任务时的长程行为。部分训练阶段只优化任务成功率,另一些阶段则会惩罚过多的 token、工具耗时和智能体轮次。
这些技术共同解释了 SWE-1.7 为何能在特定领域接近 GPT-5.5 和 Opus 的智能水平。Cognition 围绕同一种工作类型,对模型、数据、评估器和运行环境进行了统一对齐。
这种对齐也限制了结论的适用范围。该模型的提升可能依赖 Devin 工具框架及其训练分布。当工具、代码仓库、编程语言或组织实践不同于这些条件时,其性能可能会下降。
更广泛的探索带来了范围控制问题
据称,SWE-1.7 最突出的行为也是其最明确的运营风险:模型调查得更多,随后改动得也更多。
Cognition 承认,SWE-1.7 往往会扩大补丁范围。它会编写额外测试,并修改超出任务严格要求的更多文件。
当错误报告只指出更大缺陷的一个症状时,这种行为可能有所帮助。过于保守的智能体可能只修补可见故障,却让底层问题继续存在。
更广泛的调查可以发现共享逻辑、不安全的假设或相关调用方,也能识别原始 issue 中未明确写出、但可从代码仓库推断出的需求。
然而,每多改动一个文件,审查范围都会扩大。修改无关代码的补丁可能引入回归、增加归属管理难度,并使回滚更加困难。
这种矛盾在大型组织中尤为重要。成熟的代码仓库往往存在隐含边界,而自动化智能体无法仅从源代码中推断出这些边界。
一个看似无害的重构可能影响发布节奏不同的团队。新增测试可能固化维护者从未打算保证的假设。一次代码清理也可能使可见仓库之外维护的内部补丁失效。
因此,基准测试需要回答的不只是任务是否通过。团队还需要知道智能体选择的变更边界是否恰当。
FrontierCode 试图通过评估范围和可合并性来衡量这一维度。然而,Cognition 既开发了 SWE-1.7,也设计了凸显其行为特征的基准测试。
这并不会使结果失效,但意味着独立复现应当占据相当大的权重,尤其是在所谓优势涉及定性工程判断时。
基准测试质量已成为整个行业面临的问题。在 SWE-1.7 发布的同一天,OpenAI 发布了一份编码基准审计,估计 SWE-Bench Pro 约有 30% 的任务存在破坏测试有效性的问题。
OpenAI 指出了过于严格的测试、信息不足的提示、覆盖不充分以及误导性指令。其审计针对的是另一个基准,但这一教训具有普遍意义。
当任务本身存在缺陷时,编码分数可能夸大或掩盖真实能力。隐藏测试可能拒绝有效方案,也可能接受不完整的方案。模型可能因为评估器奖励谨慎而显得谨慎,也可能因为测试忽视后果而显得能力出众。
Cognition 的方法既包含公司自行运行的结果,也包含一些竞争对手自行报告的数据,同时还让不同模型运行在不同工具框架中。这些选择使比较更具可操作性,但也引入了更多变量。
因此,“SWE-1.7 接近 GPT-5.5 和 Opus 的智能水平”这一说法必须限定范围。现有证据涉及特定评估条件下编码智能体的表现,而非整体推理能力、安全性或生产环境可靠性。
Cognition 还另行发布了一项可信度评估,将 SWE-1.7 与其 Kimi 基础模型及前沿模型进行了比较。该公司表示,定向后训练减少了基础模型中发现的问题行为。
这项工作具有现实意义,因为企业编码智能体可能访问敏感代码仓库并执行工具。然而,该评估仍由公司自行撰写,尚未得到广泛的独立复现。
团队还应区分模型对齐与系统安全。一个会拒绝恶意请求的模型,仍可能无意中生成存在漏洞的代码;一个安全的工具框架,也仍可能因工具配置错误或凭证权限过宽而泄露数据。
合适的应对方式是开展受控验证。工程负责人可以在具有代表性的代码仓库中测试该模型,检查补丁范围,衡量回归率,并将审查工作量与现有智能体进行比较。
对于涉及身份验证、数据访问、基础设施、财务逻辑或公共 API 的变更,人工审查仍然至关重要。更高的基准分数并不能消除明确责任归属和保留审计记录的必要性。
最有价值的部署指标或许不应只是通过率,而应是根据返工量和漏网缺陷调整后的每审查工时获接受变更数。
这一指标可以揭示,更广泛的探索究竟节省了工程时间,还是仅仅把工作量从实现阶段转移到了审查阶段。
真正的转变是从选择模型走向塑造模型
SWE-1.7 表明,编码智能体公司可以围绕自身产品塑造模型行为,而不必无休止地在外部供应商之间切换。
第一代编码智能体往往将模型视为外部依赖。产品团队会选择表现最好的通用模型,再围绕它构建提示词和工具。
这种策略仍然具有灵活性。公司可以在不同供应商之间路由任务,并迅速采用新版本。
但它也存在局限。产品开发者无法直接训练模型,使其适应自身的上下文系统、工具接口或故障模式,只能通过提示词、重试和编排来弥补。
Cognition 已将部分适配工作移入模型训练。SWE-1.7 在 Devin 工具框架内完成学习,其中包括 Devin 的工具和长时间运行的任务结构。
这形成了更紧密的反馈闭环。生产环境中的失败可以转化为新的训练任务,改进后的验证器可以奖励更好的行为,运行时约束则可以塑造模型偏好的推理长度。
这种方式类似于搜索、推荐和机器人系统通过交互数据实现改进。产品既是部署环境,也是训练信号的来源。
不过,这一策略也会带来集中化风险。针对单一工具框架优化的模型可能变得不易迁移。客户或许能在 Devin 内获得更好的性能,却失去在其他环境中复现其行为的能力。
封闭部署也限制了外部审查。Cognition 基于开放权重模型构建了 SWE-1.7,但最终模型通过 Devin 提供,而不是以可下载 checkpoint 的形式发布。
这一区别对于更广泛的开放模型论述十分重要。SWE-1.7 展示了开放基础模型的价值,但其改进并不会自动回馈开放生态。
Moonshot 提供了基础能力,Cognition 则加入了专有的强化学习、评估数据和基础设施。客户获得的是以服务形式交付的整套组合系统。
这种混合技术栈可能会变得普遍。开放权重实验室可以提供强大的通用基础模型,而应用公司则围绕专业工作流构建私有变体。
其经济优势将取决于可重复性。一个模型的成功,并不能证明每一家应用公司都能复现 Cognition 的成果。
Cognition 构建了定制容错机制、全球发布基础设施、数据质量系统和任务验证器。即使没有进行新的预训练,这些也都是相当可观的技术投入。
数据挑战可能比算力挑战更加棘手。专业模型需要足够困难的任务来习得有价值的行为,同时这些任务还必须足够精确,才能奖励正确结果。
软件工程能够提供异常强大的反馈,因为代码可以执行和测试。其他专业任务往往缺乏客观验证器。
这使编码成为强化学习特别有利的领域。法律分析、战略工作和产品决策都包含无法简化为测试套件是否通过的模糊性。
即使在编码领域,测试成功也并不完整。可维护性、架构契合度、安全性和组织惯例都需要判断,而自动化奖励很难表达这些判断。
因此,Cognition 的成果指向的是专业化模型塑造,而非轻松定制。拥有产品环境、高质量反馈和可验证任务的公司,将获得最强的机会。
对开发者而言,实际结果将是模型市场更加多元。最佳编码模型可能会越来越取决于智能体环境和任务类型,而非某个统一排行榜。
对于陌生技术、跨领域推理或模糊的设计工作,通用前沿模型仍可能更为合适;对于与训练分布一致、重复执行的代码仓库任务,专业模型则可能领先。
采购方需要围绕自身工作流构建评估。单一公开排名无法涵盖工具权限、代码仓库规模、审查实践、语言组合或故障容忍度。
完整的智能体系统正在成为竞争单元。模型仍居于核心位置,但上下文管理、执行工具、验证器和反馈闭环正日益决定实际可用的性能。
三个信号将表明 SWE-1.7 的领先能否持续
独立评估、真实补丁接受率以及竞争对手的回应,将决定 SWE-1.7 代表的是持久转变,还是仅限于特定基准测试的成功。
第一个信号,是能否在外部编码基准和陌生代码仓库中得到独立复现。研究人员应使用 Cognition 未创建、也未在训练期间使用的任务集来测试该模型。
如果结果保持一致,将增强 Cognition 关于进一步强化学习释放了通用软件工程能力的主张。如果性能大幅下降,则表明其对 Devin 工具框架或基准分布的依赖更强。
评估不应只看通过率。审查者还应衡量不必要的文件变更、架构一致性、安全缺陷,以及人工修正每个补丁所花费的时间。
第二个信号是生产环境中的接受率。Cognition 需要证明,团队能够以较高比例合并 SWE-1.7 的成果,同时不会相应增加审查负担或回归问题。
这一指标直接检验了模型在探索上的取舍。只有当更多搜索与测试能够带来更安全、更完整的改动时,它们才真正有价值。
一份可信的生产环境分析应当区分不同的任务类别。Bug 修复、迁移、测试创建、功能开发和依赖项更新,在不确定性与风险方面各不相同。
分析还应区分初次验收与长期质量。一个补丁在审查时可能看起来完全正确,却仍可能在数月后带来维护成本。
如果获准合并的改动增加,而审查者投入的时间减少,Cognition 的专业化策略将得到有力支持。如果审查工作量随补丁范围扩大,那么其基准测试中的领先优势就没有宣传所称的那么有价值。
第三个信号来自 OpenAI、Anthropic 及其他编码智能体提供商的回应。它们可以通过更好的模型、更紧密的智能体集成、更快的执行速度或更强的定制能力来回应 SWE-1.7。
如果基准测试差距迅速缩小,就会削弱 Cognition 已建立持久优势的说法。但这仍将印证一个更广泛的判断:编码领域的竞争已经转向模型与智能体运行框架的协同设计。
也可能有更多应用公司选择基于开放权重模型构建产品。即使 SWE-1.7 本身不再保持领先,这也会强化其背后的战略启示。
出于同样的原因,Cognition 的下一次模型发布至关重要。SWE-1.7 相比 SWE-1.6 实现了大幅提升,其中在 FrontierCode 1.1 Main 上的成绩从 9.4% 跃升至 42.3%。
要延续这样的提升轨迹将越来越困难。未来版本必须在提高准确率的同时,减少不必要的改动并保持执行速度。
开发者应关注 Cognition 是否会公布更严谨的评测方法、更广泛的任务覆盖,以及可复现的评估细节。随着基准测试差异逐渐缩小,透明度将变得愈发重要。
不到一个百分点的差距,可能因任务波动、智能体运行框架更新或评分方式变化而消失。要获得稳定的排名,需要多次重复运行,并对数据集进行精心维护。
对于工程团队而言,当下的启示并不是替换所有编码模型,而是结合具有代表性的实际工作,对完整的智能体系统进行评估。
应使用真实代码仓库、符合实际情况的权限设置,以及与人类提交改动相同的审查标准。同时记录获准合并的补丁、修正耗时、回滚频率和安全问题。
团队还可以将实施决策、Issue 背景和审查结果保存在可搜索的工程知识库中。与孤立的基准测试相比,这些历史记录能让持续开展的智能体评估更具价值。
SWE-1.7 的智能水平已经足够接近 GPT-5.5 和 Opus,足以改变竞争格局。Cognition 尚未证明专业化后训练能够在所有场景中胜出,但它已经表明,单靠预训练规模已无法继续守住这一差距。
接下来的问题将由用户、研究人员和竞争对手回答:SWE-1.7 能否持续产出让团队愿意合并、信任并长期维护的改动,还是其更广泛的推理只会带来更大的审查范围?


