Grok 4 在代码基准测试中击败 GPT-5:这对开发者意味着什么
根据 xAI 本周发布的基准测试结果,Grok 4 在多项编码基准测试中得分高于 GPT-5,包括 HumanEval、SWE-Bench和LiveCodeBench。xAI和 OpenAI 的官方公告证实了此次发布。The Verge指出,这些结果凸显了真实世界编码中的训练差异。
结果涵盖 HumanEval、SWE-Bench 和 LiveCodeBench。Grok 4 在每一项上均领先。开发者现在在选择日常工作工具时会权衡这些数据。
xAI 在训练 Grok 4 时更侧重于仓库规模的任务(例如,跨大型企业代码库的多文件依赖解析,涉及数百个相互依赖的模块)。OpenAI 则让 GPT-5 专注于孤立问题的广泛能力。这种差异体现在基准测试数据中。HumanEval 通过文档字符串评估合成函数补全,但受限于其人为范围,缺乏真实的依赖图。SWE-Bench 来自 12 个仓库的实际 GitHub 拉取请求,但仅涵盖流行 Python 项目 2019 年后的 issue,可能低估了遗留或小众代码。LiveCodeBench 测试每月更新的实时竞赛问题,但不包括生产规模的重构。这些方法论解释了为何专注于仓库的模型获得优势,正如9to5Google所报道。
Grok 4 versus GPT-5 on code benchmarks
Grok 4: 94.2 percent on HumanEval
GPT-5: 91.8 percent on HumanEval
Grok 4: 68.1 percent on SWE-Bench
GPT-5: 63.4 percent on SWE-Bench
Grok 4 在需要理解整个代码库的任务上具有明显优势。这些任务与大多数专业开发者每天执行的工作相符。
差距在 SWE-Bench 上最大,该测试基于真实的 GitHub issue 构建。Grok 4 无需额外提示即可解决更多问题。
管理大型项目的开发者现在面临直接选择。他们可以继续使用熟悉的 OpenAI 工具,也可以测试在当前基准测试中得分更高的 xAI 模型。
早期采用者报告称,在 IDE 中使用 Grok 4 时,重构工作的完成速度更快;r/MachineLearning 子版块的一位开发者描述,用两小时完成了一个 12 文件的遗留重构,而使用之前的工具需要六小时。一位金融科技公司的软件工程师在最近的 X 线程中表示:“Grok 4 处理了我们 40k 行单体应用的依赖图,没有幻觉导入,而 GPT-5 在同一任务上需要三次澄清提示。”尝试过两种模型的团队指出,使用 Grok 4 时需要的后续提示更少,这与 @fullstackdevs 在最近 X 线程中的评论相呼应。Reddit 的 r/cscareerquestions 版块的另一位工程师分享称,在每日并行测试后,使用 Grok 4 完成多服务迁移的速度快了 40%。
基准测试发布给 OpenAI 带来压力。过去的周期显示,该公司会在出现类似分数差距后的几个月内发布更新。
Grok 4 的训练重点不同。xAI 在预训练期间纳入了更多多文件推理示例。该模型在代码微调期间还使用了更长的上下文窗口。
OpenAI 在 GPT-5 中增加了安全对齐。这种选择可能会限制某些调试模式的输出。这种权衡体现在当前分数中。
许多开发者现在并行运行两种模型。他们将仓库级任务路由到 Grok 4,将更简单的查询路由到 GPT-5。这种模式出现在 Hacker News 和 Reddit 的早期论坛讨论中。
工具供应商密切关注这些数据。多家 IDE 扩展计划在下个季度添加 Grok 4 端点。
怀疑者指出,基准测试并未涵盖所有生产环境。一些人指出,对许多团队而言,真实世界的延迟和成本仍比原始准确性更重要。
xAI 尚未发布完整的训练细节。关于该模型如何处理冷门语言或遗留系统的问题仍然存在。
未来的发布将测试当前差距是否持续。OpenAI 计划进行编码专项更新。xAI 已表示将继续专注于代理式代码任务。
开发者应跟踪 SWE-Bench 和 LiveCodeBench 上的下一次基准测试运行。这些运行将显示排名是否发生变化。
对于代码密集型团队而言,模型的选择现在对交付速度产生了可衡量的影响。



