top of page

GPT-5.1-Codex-Max 分析: 智能体编码的新标准

已更新:6月17日

GPT-5.1-Codex-Max Analysis: A New Standard for Agentic Coding


GPT-5.1-Codex-Max 的发布标志着大型语言模型与软件工程交互方式的一次特定且深思熟虑的转变。我们正在告别只能生成代码片段的“聊天机器人结对编程”时代,迈入 agentic coding(智能体化编程)时代——即能够维持数天而非数分钟上下文关联的系统。

对于开发者和技术主管来说,2025年11月19日的这场发布会并不仅仅关乎一个更高的版本号。它旨在解决 AI 辅助开发中最令人疲惫的问题:内存墙。之前的模型在解决孤立的 LeetCode 问题时表现出色,但在要求重构跨越数十个文件的遗留代码库时往往力不从心。GPT-5.1-Codex-Max 专门针对这一痛点,通过架构调整,为长期运行的自主工程任务而设计。

迈向 GPT-5.1-Codex-Max 的 Agentic Coding 时代

The Shift to Agentic Coding with GPT-5.1-Codex-Max

Agentic coding 与我们习以为常的自动补全建议有着本质的不同。它意味着一个循环:AI 编写代码、执行代码、读取错误日志,并在每一步都无需人工干预的情况下修复自己的错误。为了实现这一点,模型不能“忘记”它三小时前做了什么。

GPT-5.1-Codex-Max 引入了原生上下文压缩(native context compaction)来解决这个问题。在传统的 RAG(检索增强生成)设置中,开发人员通常必须手动筛选 AI 看到的文件,以防止超出上下文窗口。Codex-Max 在内部处理这一过程。当会话接近限制时,模型会总结核心状态——变量定义、架构决策和当前的 bug——并将该摘要带入新的窗口。

这实现了 24 小时连续工作流。在 OpenAI 的内部测试中,该模型可以维持超过一天的连贯开发流。对于 DevOps 工程师来说,这意味着你理论上可以在早上给模型分配一个“将此微服务迁移到新集群”的任务,到下午进入部署阶段时,它仍然能理解几小时前发现的特定网络限制。

解决代理式编程中的“上下文漂移”问题

的主要失败模式是 代理式编程在前几代模型(如 GPT-4 或早期的 Claude 3 版本)中,常见的问题是上下文漂移。模型会修复 file_A.js 中的 bug,却破坏了 file_B.js 中的依赖关系,因为它实际上已经“滚动忽略”了相关的依赖信息。

GPT-5.1-Codex-Max在 SWE-Lancer IC 基准测试中得分 79.9%,该测试旨在模拟真实的软件工程工单,而非孤立的逻辑谜题。这表明该模型不仅更聪明,而且更专注。“压缩”功能不仅仅是删除旧文本,而是有选择地保留先前操作的意图。这创造了一种稳定性,使其感觉不像是一个概率生成器,而更像是一个正在查阅自己笔记的有条不紊的工程师。

Token 成本效率与经济可行性

此次发布中一个较为低调但影响深远的细节是token 成本效率. 运行自主智能体(autonomous agent)的成本非常高昂。为了解决一个难题,智能体可能会在“编写-测试-修复”循环中往复五十次。如果模型效率低下,API 账单带来的开销将抵消生产力的提升。

GPT-5.1-Codex-Max 完成任务所需的思考 Token 比其前代产品减少了约 30%。它能更快地得出答案,且幻觉和逻辑死循环更少。结合缓存输入定价(每百万 Token 0.13 美元),agentic coding 的经济效益开始对小型团队产生吸引力,而不再仅仅是企业巨头的专利。

这种效率部分归功于模型对“负面”示例的训练——专门学习在 CI/CD 流水线中不该做什么——从而减少了获得绿色构建(green build)所需的重试次数。

GPT-5.1-Codex-Max 的实战基准测试

Benchmarking GPT-5.1-Codex-Max Against Reality

虽然市场宣传侧重于功能,但基准测试让我们能够冷静地审视现状。

  • SWE-Bench Verified: 复杂问题解决率达 77.9%。

  • Terminal-Bench 2.0: 58.1%。

SWE-Bench 的分数是亮点,但 Terminal-Bench 的分数才是现实的写照。与以往个位数的表现相比,在终端命令上达到 58% 的水平令人印象深刻,但这也凸显出在大约 40% 的情况下,模型在面对命令行界面中那些晦涩且充满阻碍的实际操作时依然感到吃力。

然而,GPT-5.1-Codex-Max 的卓越之处在于 多文件代码修复。大多数基准测试只考察单文件逻辑。而实际开发涉及在一个文件中更改数据库模式,在另一个文件中更新 API 端点,并在第三个文件中重写前端类型定义。该模型的架构似乎专门针对追踪这些依赖关系进行了优化。评论者称其“表现得像一名有条不紊的工程师”,很可能正是对其这种能够遍历文件树而不丢失思路的能力的认可。

Windows PowerShell 支持:一项期待已久的功能

多年来,AI 编程模型一直严重偏向 Unix/Linux 环境。如果你让 AI 编写部署脚本,它会默认使用 Bash。如果你要求设置本地环境,它会假设你在使用 macOS

GPT-5.1-Codex-Max 通过针对 Windows 特定操作的专门训练打破了这一模式。这包括强大的 Windows PowerShell 支持。它理解 PowerShell 语法的细微差别(这与 Bash 有很大不同),并且能够处理 Windows 文件系统和权限结构。

这为 代理式编程 (agentic coding)面向依赖 .NET 和 Windows Server 环境的庞大企业市场。在 Windows 上运行“沙箱”的能力意味着模型可以安全地执行 PowerShell 脚本来测试其自身代码,这一功能在旧版本中曾具有风险或无法正常运行。

安全与自主代理的风险

在赋予 AI 执行终端命令的权限时,安全性是无法回避的核心问题。OpenAI 为 GPT-5.1-Codex-Max 设定了“中等备灾(medium preparedness)”评级。

该模型在基准测试中拒绝了 100% 的合成恶意代码提示,并且在编码过程中对提示注入(prompt injection)具有极高的抵抗力。如果用户(或代码库中的恶意文件)试图诱导代理删除根目录或窃取 API 密钥,训练机制会介入并停止操作。

然而,“中等”评级也暗示了谨慎。虽然它被推荐用于防御性用途——修复漏洞、审查代码安全缺陷——但明确 建议用于攻击性安全研究。它可能缺乏白帽渗透测试所需的横向思维,并且仍可能被高度新颖的攻击向量所欺骗。

GPT-5.1-Codex-Max 对比竞争对手

GPT-5.1-Codex-Max vs. The Competition

与 Claude 3.5 或 Google 的 Gemini 系列等重量级模型相比,它的表现如何?

GPT-5.1-Codex-Max 似乎更像是一个专才而非全才。用户反馈在创意写作或通用推理方面,其他模型可能仍具有优势。但在 agentic coding 方面,“Context Compaction” 功能赋予了 Codex-Max 在持久性上的特定优势。

一些早期评论提到,在处理超大型项目时,GPT-5.1-Codex-Max 可能比 Gemini 慢。其“思考”过程虽然节省 token,但需要大量的计算时间。如果你需要即时代码片段,轻量级模型可能更合适;如果你需要一个能在你睡觉时“修复计费模块”的系统,Codex-Max 是目前的领先者。

社区评论中提到的间歇性质量下降,可能源于压缩过程本身。如果模型对上下文的总结 过于 过于激进,它可能会丢失稍后变得重要的微妙细节。这是一个权衡:你获得了无限的记忆长度,但这种记忆的“分辨率”可能会随着时间的推移而略微模糊。

集成与未来工作流

部署 GPT-5.1-Codex-Max 到 IDE 扩展(VS Code、JetBrains)和 CLI 标志着 OpenAI 希望将其作为一个基础设施层,而不不仅仅是一个网页聊天。

我们很可能会看到开发者工作方式的分歧。

  1. 架构师: 人类定义范围,设置 context compaction 参数,并审查高层策略。

  2. 智能体: GPT-5.1-Codex-Max 执行 24 小时连续工作流,处理 多文件代码修复、测试和重构等繁琐工作。

这种分离实现了“异步开发”。你在下午 5 点定义任务,智能体便会彻夜工作,利用其 Windows PowerShell support 或 Linux 终端访问权限来验证其工作成果。

结论

Conclusion

GPT-5.1-Codex-Max 不仅仅是一个更聪明的聊天机器人;它是专为 代理式编程 (agentic coding) 设计的引擎。通过利用 上下文压缩 (context compaction) 解决上下文保留问题,并凭借更优的 Token 成本效率 解决成本问题,它使自主工程在生产环境中变得切实可行。

虽然它并不完美——用户应留意大型项目中的延迟,并验证“摘要”逻辑——但它代表了这样一个时刻:AI 工具不再仅仅是“加强版的自动补全”,而是开始成为真正的自主代理。对于处理遗留代码库或复杂重构的团队来说,这已成为新的默认选择。

常见问题

问:GPT-5.1-Codex-Max 处理上下文的方式与之前的模型有何不同?

答:它使用原生上下文压缩技术。当达到限制时,模型不再是简单地截断旧文本,而是总结会话的关键数据和技术决策,并将此摘要带入新的上下文窗口,以在长任务中保持连续性。

问:GPT-5.1-Codex-Max 真的可以自主编程 24 小时吗?

答:是的,该架构专为24 小时连续工作流而设计. 只要 API 连接保持稳定,它就可以在漫长的调试或重构会话中持续运行,而不会崩溃或丢失原始指令集。

问:运行 GPT-5.1-Codex-Max 是否比 GPT-4o 或 Codex 更便宜?

答: 通常情况下是的。它实现了更高的 Token 成本效率,完成任务所需的 Token 数量减少了约 30%。结合缓存输入定价,它显著降低了长时间运行的智能体循环(agentic loops)的成本。

问:该模型支持 Windows 特定的开发吗?

答: 是的,它包含了针对 Windows PowerShell 支持 以及 Windows 文件系统。这填补了以往模型优先考虑 Linux/Unix 环境所留下的重大空白,使其能够胜任 .NET 和 Windows Server 的工作流。

问:GPT-5.1-Codex-Max 用于自主代码库访问是否安全?

答: 它比前几代产品更安全,具有极高的抗提示注入能力和严格的沙箱限制。然而,OpenAI 将其评级为“中等准备程度”,这意味着它仍需受到监督,且在防御性或建设性任务中的表现优于安全测试任务。

问:用户反馈的主要缺点有哪些?

答: 用户注意到 GPT-5.1-Codex-Max 在处理大型项目时可能比 Gemini 等竞争对手慢。此外,也有报告称其质量偶尔会出现波动,在处理极度冷门的编程任务时,上下文摘要可能会遗漏细微之处。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page