top of page

DeepSeek V4 Pro 基准测试结果喜忧参半

8月14日
讀畢需時 14 分鐘

DeepSeek 发布了更新后的 V4 Pro 模型,但其首轮基准测试表现并非一场毫无争议的胜利。这则 Google News 标题概括了其中的张力:强劲的编程代理得分,与较弱的独立评估结果和不确定的实际表现并存。

这项标识为 DeepSeek-V4-Pro-0813 的 8 月 13 日更新,已上线 DeepSeek 的应用、Web 服务和 API。DeepSeek 表示,该模型改进了工具使用、软件工程以及长时运行的代理任务。这些说法使其直接与 Anthropic、OpenAI、Google 和中国竞争对手 Moonshot AI 的领先模型展开竞争。

然而,不同基准测试讲述了不同的故事。DeepSeek 自己的测试显示,V4 Pro 在终端操作和软件开发方面极具竞争力。针对更广泛 V4 系列的独立评估则显示,其在推理、代理可靠性以及部分安全相关任务上仍存在持续差距。

这种分歧比任何单一排行榜排名都更重要。开发者正越来越多地使用模型编辑代码仓库、操作命令行工具,并完成多步骤工作流。一个在受控测试中获胜的模型,仍可能在工具、提供商、提示词或任务长度发生变化时失败。

这正是此次发布值得获得超越简单排名叙事的关注的原因。DeepSeek 推出了一款严肃的编程模型,但现有证据尚不足以证明其具备稳定领先地位。真正的竞争,是基准测试实力与基准测试框架之外可靠表现之间的较量。

DeepSeek V4 Pro 0813 有哪些变化

DeepSeek 将 V4 Pro 从 4 月的预览版推进为更广泛的生产版本,重点聚焦编程代理与工具驱动型工作。

DeepSeek 将这次正式可用更新定于 2026 年 8 月 13 日。该公司表示,已在其应用、网站和 API 中全面推出该模型。现有 API 用户可通过 deepseek-v4-pro 模型名称访问它。

此次更新建立在 4 月发布的 V4 系列之上。该系列包括作为更大旗舰模型的 V4 Pro,以及为更快运行而设计的较小型号 V4 Flash。DeepSeek 将两款模型定位为 V3 一代的继任者。

根据官方 V4 model card,V4 Pro 采用混合专家架构。这种设计会为每个 token 仅激活完整网络的一部分。该模型总参数量为 1.6 万亿,推理期间激活参数为 490 亿。

其公布的上下文窗口可达 100 万 token。上下文窗口是指模型在一次请求中能够考虑的材料量。该容量面向大型代码仓库、庞大的文档集合和冗长的代理历史记录。

8 月版本新增了三种推理强度设置:low、high 和 max。这些控制项让应用可在更快响应与更长的内部计算之间进行取舍。它们也让基准测试比较更复杂,因为不同强度等级可能产生实质不同的结果。

DeepSeek 还扩大了对面向代理接口的支持。其 API change log 描述了通过熟悉的聊天补全模式和更新的响应工作流进行访问。这些接口可帮助模型调用工具、保留状态并返回结构化结果。

最引人注目的主张涉及编程代理。DeepSeek 报告称,其在 Terminal-Bench 2.1 上得分为 87.9,在 DeepSWE 上得分为 62.7。Terminal-Bench 评估 AI 代理能否在终端环境中完成实际任务。DeepSWE 则聚焦软件工程工作。

这些结果值得关注,因为代理基准测试考察的不只是代码补全。模型必须检查环境、选择操作、使用工具、解读失败原因,并持续推进直至任务成功。

不过,这些数字仍是公司自行报告的结果。提示词设计、工具配置、推理强度、重试规则和任务选择都会改变评估分数。因此,公开数字应被视为能力证据,而非优越性的最终证明。

最初的 Google News 表述将结果描述为喜忧参半。这是准确的,因为此次更新强化了 DeepSeek 的编程能力论点,却没有消除围绕更广泛 V4 评估记录的早期疑虑。

DeepSeek 改变了竞争基线。一个大型开放权重模型如今提供了可信的代理性能和广泛的部署选项。尚未改变的是:仍需在独立条件下复现这些结果。

为什么 Google News 的基准测试报道很重要

此次发布给前沿模型提供商带来压力,因为 DeepSeek 竞争的是实用代理工作,而不只是学术问答。

早期的模型比较通常强调考试、数学或孤立的编程问题。编程代理面对的是另一种标准:它们必须在杂乱的环境中导航,那里文件会冲突、命令会失败、需求也并不完整。

这种转变提高了 Anthropic、OpenAI、Google、Moonshot AI 及其他模型开发者的赌注。它们的产品正越来越多地在编程助手、终端代理、工作流工具和企业自动化系统中竞争。

DeepSeek 报告中最强的结果恰好针对这些工作负载。Terminal-Bench 衡量在命令行环境中的任务完成情况。软件工程评估则考察模型能否理解代码仓库并实现可运行的更改。

这些领域中可信的结果能迅速影响开发者采用决策。团队可以替换代理背后的模型,而无需重建整个应用程序。与常见 API 格式的兼容性降低了测试所需的工作量。

因此,模型提供商面临的压力是即时的,而企业采购方的节奏则更慢。提供商必须以更强模型、更好的工具集成或更清晰的可靠性证据作出回应。采购方在将生产工作迁移之前,仍需要进行内部评估。

DeepSeek 还凭借开放权重策略参与这场竞争。在适用许可证约束下,开放权重允许组织检查和托管模型参数。对于具有隐私、延迟、定制化或基础设施要求的团队而言,这一选项很重要。

4 月的 V4 发布已经表明,DeepSeek 能够在选定任务上接近前沿水平。新版本则将其叙事收窄至代理执行。现在,仅仅询问 V4 是否能够回答一个困难提示词已不再足够。

更好的问题是,V4 Pro 能否可靠地完成一项多步骤工作。这包括选择工具、从错误中恢复、遵守约束,以及产出可验证的结果。

这一区别解释了为何这则 Google News 报道不仅与开发者有关,也与知识工作者有关。代理模型正越来越多地总结研究、操作文档,并在应用之间协调信息。第八步的失败,可能使此前七个正确步骤全部失效。

对于构建 AI workflow 的组织而言,醒目的分数只能作为起点。模型必须能够与组织的文档、指令、集成和审查要求协同工作。

长上下文也增添了关注理由。100 万 token 的上限听起来适合整个代码库或大型知识集合。然而,容量并不保证模型能在如此完整的范围内准确检索。

模型可能遗漏相关细节、过度看重近期指令,或失去对依赖关系的追踪。长上下文测试必须衡量可用的回忆和推理能力,而不只是系统是否能接受大量输入。

DeepSeek 正从两条战线向竞争对手施压。它一边宣称具备强劲代理性能,一边保留与开放权重相关的部署灵活性。对于愿意验证它的团队而言,这种组合构成了一个真实的替代选择。

不过,主张的范围越大,举证责任也越重。一项编程基准测试可以证明某个框架内的能力,却无法单独证明其能在不同提供商、代码仓库、语言或企业政策中持续保持表现。

DeepSeek 的高分遭遇独立评估阻力

核心反转很简单:DeepSeek 在其发布最突出的领域看起来最接近前沿,但当评估者扩大测试集时,其主导性就没那么明显。

DeepSeek 的官方结果强调终端和软件工程任务。它们表明,8 月模型在选定代理排行榜上接近顶尖水平。这些分数也强化了 V4 Pro 实用价值的叙事。

独立研究呈现出更为克制的图景。5 月,美国 AI 标准与创新中心发布了对 4 月 V4 Pro 版本的评估。该机构通常被称为 CAISI,隶属于美国国家标准与技术研究院。

CAISI 发现,V4 Pro 在其更广泛的评估中与 GPT-5 表现相近。当时 GPT-5 大约已发布八个月。该发现并不支持 DeepSeek 对更新前沿系统所作的最强比较。

该机构还报告称,在 DeepSeek 技术报告未涵盖的测试中,结果较弱。其 independent evaluation 覆盖半私有推理、保留集软件工程和网络安全任务。

这并不直接否定 8 月更新。CAISI 测试的是早期 V4 Pro 版本,而非 0813 生产版本。不过,其发现表明,在接受供应商比较结果之前,独立测试为何至关重要。

模型卡本身也显示出不均衡的能力特征。V4 Pro 的基础模型在多项知识和长上下文指标上较 V3.2 有明显提升。它在 HumanEval、GSM8K 和 MATH 上也取得进步。

但这种模式并不普遍。公布的基础模型结果显示,V4 Pro 在 MGSM 和 CMath 上落后于 V4 Flash。尽管它在其他方面优于前代,但在 BigCodeBench 上仍低于 V3.2。

这些差异并不意味着 V4 Pro 是一款弱模型。它们表明模型进步是多维的。更多参数和更强的平均结果,并不意味着它会在每一种工作负载上给出最佳答案。

同样的谨慎也适用于综合指数。Artificial Analysis 在更广泛的推理、编程和代理任务中评估了 4 月的 V4 系列。其 model assessment 将 V4 Pro 列为领先的开放权重系统之一,但总体上低于最强的闭源模型。

这一组合支持的结论,比 DeepSeek 发布时的比较更为收窄。V4 Pro 具有竞争力,尤其是在开放权重领域。它尚未显示出对每一款领先专有模型的一致优势。

基准测试方法解释了部分差距。供应商了解自己的系统,并可选择有利的推理设置。他们可能使用自定义提示词、广泛的推理预算或针对特定任务的代理框架。

独立评估者通常施加标准化设置,以便公平比较多种模型。这些设置提升了一致性,但未必能够提取每个模型可能达到的最高性能。

两种方法都不必然是错误的。供应商测试回答的是:“该系统在有利配置下能表现多好?”独立测试回答的是:“在共同规则下,它与其他系统相比表现如何?”

用户需要两种答案。对于经过精心工程化部署的场景,极致能力至关重要。对于没有时间围绕单一提供商优化提示词和智能体的团队而言,标准化性能同样重要。

只有当读者将“mixed”视为失败判决时,这条 Google 新闻标题才会产生误导。“结果不一”实际上描述的是:一款模型具备明显优势,但验证尚不完整,且不同任务之间的性能存在显著差异。

这些数字未能揭示什么

基准测试将复杂系统压缩为单一分数,掩盖了决定智能体是否值得信任的失败模式。

终端分数无法揭示模型是如何失败的。一次未成功的运行可能只是轻微的格式错误;另一次则可能删除错误文件、误读需求,或悄然生成错误代码。

这种差异在生产环境中尤为重要。团队可以以较低成本从格式异常的回复中恢复;但当智能体做出看似合理却错误的改动,并报告任务成功时,风险会大得多。

智能体性能还取决于周边运行框架。框架提供工具、管理上下文、处理命令输出,并决定模型能否重试。更好的框架可以提升同一底层模型的得分。

不同提供商又引入了另一个变量。开放权重模型可能采用不同的量化方式、硬件、上下文限制或采样设置提供服务。量化通过降低数值精度来减少内存占用,也可能改变性能表现。

即使名义上相同的 DeepSeek 端点,在不同托管方之间的行为也未必一致。吞吐限制、路由策略和隐藏的系统指令都可能影响结果。团队应在评估时记录确切的模型版本和提供商。

推理强度设置则让比较更加复杂。最高强度的运行可能比低强度运行消耗更多时间和生成 token。若不提供这些细节,分数比较可能掩盖实际运营中的权衡。

8 月发布时,社区也出现了有关行为不一致的报告。一些早期用户称,推理过程似乎异常简短,或服务在上线后发生了变化。这些观察尚未得到独立验证。

这类报告不应被视为模型回滚或缺陷的证据。但它们确实指出了一个实际的验证问题:API 别名可能指向更新后的构建版本,却不给用户永久的版本标识符。

这种不确定性削弱了可复现性。开发者稍后重复测试时,可能无法获得相同的模型行为。稳定的标识符、发布说明和评估日志将使比较结果更值得信赖。

安全性值得单独关注。评估 4 月模型的独立研究人员发现,攻击性提示词可能大幅提高有害回复率。这些发现涉及对抗性行为,而非正常编码质量。

但它们对智能体部署仍然重要。能够使用工具的模型比单纯生成文本的聊天机器人更有能力影响系统。权限、沙箱、审批和审计日志必须始终置于模型控制范围之外。

CAISI 的发现还凸显了标准厂商图表可能遗漏的能力差距。半私有测试可降低基准题目已出现在训练数据中的可能性。保留任务更接近陌生问题。

基准污染很难证明或排除。公开测试集广泛流传,模型开发者可能有意或间接地针对它们进行优化。当优异结果能够迁移到新的私有任务时,其说服力会更强。

因此,企业不应仅凭一个公开排行榜选择模型。一项有用的内部评估应涵盖有代表性的文档、真实代码库、常用工具和已知失败案例。

对于软件工作,团队应分别测试缺陷发现、实现准确性、避免回归和指令遵从能力。一款模型可能发现更多缺陷,而另一款模型可能写出更安全的修复方案。

知识工作同样需要类似的拆分。模型可以准确总结,却引用不佳;它可以检索到正确文档,却混合不同日期的主张;它可以生成流畅分析,却忽略相互矛盾的证据。

可搜索的知识库有助于保留来源上下文,但不能消除验证需求。模型输出应始终能够追溯至原始材料。

因此,最稳妥的解读应是有条件的:DeepSeek V4 Pro 0813 看起来很有希望用于编码智能体。其更广泛的可靠性、安全特征以及跨提供商一致性仍是悬而未决的问题。

DeepSeek V4 Pro 与前沿模型阵营之比较

DeepSeek 最清晰的优势在于战略灵活性,而专有模型竞争对手在持续、稳定的前沿性能方面仍拥有更强证据。

Anthropic 围绕编码和长时运行的智能体任务建立了 Claude 的声誉。OpenAI 将其模型与编码工具和结构化响应 API 紧密结合。Google 则将 Gemini 模型与广泛的云服务和开发者平台相结合。

Moonshot AI 和 Zhipu AI 也为中国快速演进的模型市场增添压力。它们的系统在推理、编码、上下文长度和智能体行为方面展开竞争。这使 DeepSeek 面临的挑战远不止中美之间的比较。

DeepSeek 的开放权重发布方式改变了技术团队的决策路径。组织可以研究模型、调整部署基础设施,并保留对数据流动更多的控制权。闭源模型通常对权重和训练提供较少可见性。

这种灵活性也伴随着运营工作。托管一个总参数量达 1.6 万亿的模型需要大量基础设施,尽管每个 token 仅激活其中 490 亿参数。高效服务依赖于专家路由、内存管理和优化内核。

云 API 减轻了大部分这类负担,但也重新引入了对提供商的依赖和版本不确定性。团队必须针对每种工作负载决定:控制权还是便利性更重要。

Anthropic、OpenAI 和 Google 还可以围绕其模型优化整个产品栈。它们的编码智能体可能受益于专有工具、隐藏提示词和集成反馈系统。基础模型的比较无法捕捉每一项产品层面的优势。

DeepSeek 的机会在于可移植性。开发者可以通过通用接口集成该模型,或在受控环境中托管开放权重。这为智能体构建者提供了更大空间,以调整提示词、工具和策略。

4 月发布奠定了更广泛的背景。在 OpenAI 推出又一次前沿更新后不久,DeepSeek 发布了 V4,加剧了中美开发者之间的比较。一份4 月发布报道称,V4 是 R1 所开启竞争的重要延续。

R1 在 2025 年的到来改变了预期,因为 DeepSeek 将强劲的推理主张与不同的成本和分发模式结合在一起。V4 将这种挑战延伸至通用智能、长上下文和智能体运行。

8 月更新进一步将竞争聚焦于软件工作。DeepSeek 无需在每项基准测试中领先,也能影响市场。它只需表现得足够好,让开发者认真将其作为替代方案进行测试。

这一门槛低于全面领先。模型可以通过在大多数任务上足够胜任、在少数高价值任务上表现卓越来赢得采用。部署控制权可以弥补综合得分上的小幅差距。

反过来,高基准成绩也不能保证迁移。团队已围绕现有提供商积累了提示词、监控系统和评估数据。即使 API 看起来兼容,切换模型仍会产生测试和维护成本。

因此,核心竞争在于基准承诺与运营现实之间。DeepSeek 的数据使其值得纳入评估;而在客户重视稳定行为、成熟工具和广泛独立测试的领域,竞争对手仍具优势。

结果不一应促使人们进行更好的比较,而不是仓促选出胜者。每个模型都应面对相同的代码库、工具权限、重试策略和验收测试。评估者还应记录延迟、token 用量和失败严重程度。

公平的试验应涵盖每项任务的多次运行。智能体系统在不同尝试间可能出现差异,因为生成具有概率性,工具输出也会变化。一次成功演示能揭示能力,反复成功才能揭示可靠性。

对买方而言,实际选择很少会是一款模型包办所有工作。团队可以将日常分析路由至更快的模型,并将困难的实现工作留给更强的模型;也可以对高影响操作要求人工审批。

DeepSeek V4 Pro 契合这种多模型未来。其智能体得分使其成为高要求工作的候选方案;其不均衡的评估历史则意味着,不应将其视为自动默认选项。

将决定 DeepSeek 基准测试争议的三项信号

下一轮判断应来自可复现的证据、稳定的生产行为和真实采用,而不是又一张发布图表。

第一项信号是对确切 0813 构建版本的独立评估。CAISI 的工作提供了重要基线,但覆盖的是 4 月模型。评估者现在需要对 DeepSeek-V4-Pro-0813 进行版本锁定的测试。

该测试应包括 Terminal-Bench、保留的软件工程任务、长上下文检索和对抗性安全任务。在许可允许的情况下,还应公布提示词、推理设置、工具定义和重试策略。

若独立得分接近 DeepSeek 公布的结果,该公司的前沿编码主张将大为增强。若差距显著,则会强化这样一种观点:发布配置对模型有所偏向。

第二项信号是 DeepSeek 的应用、Web 服务和 API 之间的版本稳定性。开发者需要知道,一个具名端点是否持续提供同一构建版本;当路由或推理设置变化时,他们也需要得到通知。

稳定的版本标识符能让团队复现事故,并随着时间推移比较结果。缺少这些标识符时,性能改善或退化将难以与提供商侧的变化区分开来。

即使部分基准得分仍低于竞争对手,一致的生产行为也会加强 DeepSeek 的论据。频繁且无法解释的波动则会削弱它,尤其是在自主工作流中。

第三项信号是在真实代码库和企业试点中的持续使用。采用本身无法证明模型质量,但重复使用会产生有关失败模式的证据。公开复盘和受控案例研究将尤其有用。

开发者应关注 V4 Pro 是否能在不引入回归的情况下完成多文件修改,也应衡量它是否遵循代码库规范、正确使用工具,以及能否识别自身何时缺乏足够信息。

企业买家应考察审查时间,而不仅是任务完成情况。一个产出更多、却需要大量检查的智能体未必能节省人力。最好的模型往往是造成高成本错误更少的那一个。

知识工作者也应采用同样标准:在当前文档、相互矛盾的来源以及需要精确引用的请求上测试模型,并衡量审阅者能将主张追溯回证据的频率。

Google 新闻叙事目前应在此告一段落。DeepSeek 推出了一次具有可信优势的重要模型更新,但现有证据仍支持有条件的判断,而非决定性的排名。

此次发布给 Anthropic、OpenAI、Google 和其他开发者带来压力,因为它扩展了可信的开放权重模型阵营;它也促使 DeepSeek 需要记录此次更新,并支持独立复现。

读者应避免得出两个简单结论:结果好坏参半并不意味着该模型失败;发布时的高分也不代表它已经超越了所有替代方案。

请运行对你最重要的那一套确切工作负载。保持模型版本、提供商、提示词、工具和验收标准不变。每项任务重复足够多次,以暴露结果波动。

随后比较完整结果,包括修正和人工审查。这个过程能将 Google News 基准测试的一则标题,转化为你可以据此采取行动的证据。在这些结果出炉之前,DeepSeek V4 Pro 应被列入候选名单,而非自动置于首位。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page