DeepSeek Pro 在 Minimal 模式下表现惊艳。这也正是问题所在
- Ethan Carter

- 4天前
- 讀畢需時 13 分鐘
DeepSeek pro 于 8 月 13 日正式全面上线,但其最强的公开表现,似乎只在用户复现一种极为特定的智能体配置后才出现。
该配置是 DeepSeek Harness 中的 Minimal 预设。DeepSeek Harness 是该公司新推出的、面向可调用工具 AI agents 的运行时环境。社区测试称,这一预设能将表现不稳定的编程模型,变得更接近 DeepSeek 在基准测试中展示的水平。
这一改进尚未在受控且任务多样的测试集上得到独立测量。不过,即便最引人注目的演示无法被复现,这场争议仍值得关注。DeepSeek 自己的材料将智能体表现与特定提示词、工具、推理设置和执行环境联系在一起。
因此,真正的问题并不只是 DeepSeek-V4-Pro “好”还是“坏”。而是:如果一个模型的能力只能在与训练环境一致的 harness 中稳定展现,它是否应获得全部能力评价?
Anthropic、OpenAI 和其他模型供应商在其模型通过 Claude Code、Codex 或其他智能体运行时运行时,也面临同样的问题。DeepSeek 只是让这种依赖关系变得格外明显。
DeepSeek Pro GA 上线伴随着智能体性能争议
8 月 13 日的发布改变了可用模型,但并未厘清究竟在评估哪一个系统。
DeepSeek 于 2026 年 8 月 13 日正式在其 app、网站和 API 上推出 V4-Pro 的正式可用版本。该公司的 GA release 强调了智能体升级、三个推理力度等级,以及对 OpenAI Responses API 的原生支持。
低力度面向简单任务。高力度处理常规智能体工作流,而最高力度则为复杂工作分配更多推理资源。此次发布还增加了面向 Codex 的配置路径,但没有改变 V4-Pro 的 API 模型名称。
这一公告紧随 V4 系列于 4 月 24 日发布的预览版之后。DeepSeek 将 V4-Pro 描述为一个混合专家模型,总参数量为 1.6 万亿,推理时激活 490 亿参数。
混合专家模型会让每个 token 仅经过网络的一部分。这种设计能够在不为每个请求激活所有参数的前提下提升总容量。
该模型支持一百万 token 的上下文窗口。DeepSeek 称,它在超过 32 万亿 token 上完成预训练,随后经历了监督学习、强化学习和 on-policy 蒸馏。
这些规格并未引发争议。摩擦始于 GA 上线后,早期用户将 DeepSeek 的智能体基准测试主张与自己的实际结果进行比较。
一些社区报告提到,模型的推理轨迹较短、规划能力较弱,工具使用也不稳定。一则被广泛传播的观点称此次发布令人失望,并暗示部署或服务器端配置问题可能压制了模型本应展现的行为。
这些观察都只是轶事。它们来自不同的提示词、账户、工具、操作系统和请求路径,无法确立整体性能水平。
随后,第二波报告出现。用户表示,在 Linux 或 Windows Subsystem for Linux 上通过 DeepSeek Harness Minimal 运行时,同一模型的能力会显著提升。
一项社区测试称,多名用户复现了这一改进。作者仍认为该模型不及领先的对比模型,并批评了其视觉审美。
这一限定很重要。该观点并非认为 Minimal 模式修复了所有弱点,而是认为这一预设展现出许多常规会话中缺失的编程行为水平。
另一篇代码库分析将 Minimal 模式与 8 月 10 日的一次提交联系起来。根据该分析,该提交让预设与强化学习期间使用的智能体组合保持一致。
该分析描述了一个范围狭窄的环境,其中包含克制的系统提示词、持久 shell 访问、指定文件编辑器,以及特定的上下文压缩策略。它还称,该预设排除了可能污染系统提示词的无关工具描述。
这一解读仍是社区对公开代码和文档的理解。DeepSeek 尚未发布证据证明 V4-Pro 在 Minimal 模式之外会失效,也未证明它曾被刻意针对某一公开预设进行优化。
不过,相关时间线是明确的。DeepSeek 在 8 月 13 日发布 V4-Pro GA,推出开发者预览版 harness,并公开了一个与智能体评估密切相关的环境。
紧张关系来自这些部分如何组合。如果模型的最佳表现需要该环境,用户购买的就是一个模型-harness 系统,而不是一个可互换的模型端点。
为什么 DeepSeek Harness 改变了基准测试的含义
智能体基准测试衡量的是模型、提示词、工具、记忆策略和运行时的整体,即使排行榜上只显示一个模型名称。
智能体 harness 是让语言模型能够检查文件、运行命令、调用工具、保留状态并决定下一步操作的软件层。它将文本预测转化为一个运行循环。
这个循环会作出许多重要选择:格式化系统提示词、定义工具 schema、返回错误、截断历史记录、总结此前工作,并决定何时让模型获得下一轮交互。
细微变化就可能产生巨大的性能差异。模型或许理解任务,但会因工具描述含糊而失败;也可能因为上下文压缩移除了先前的约束,而编辑了错误的文件。
模型还可能在收到嘈杂的状态消息后浪费推理预算。另一种 harness 则可能通过保持提示词简洁并保留正确状态,避免同样的失败。
DeepSeek 的官方代码库将 DeepSeek Harness 描述为一个开源智能体运行时,其中一切皆为插件。该项目仍处于开发者预览阶段,并警告会发生破坏兼容性的变更。
其插件架构能够替换或重新组合功能,而非将用户锁定在单一固定的智能体设计中。这种灵活性让项目颇具价值,但也使任何关于“DeepSeek-V4-Pro 性能”的主张更加复杂。
哪些插件处于激活状态?加载了哪个预设?使用了什么系统提示词?对话历史如何压缩?shell 是否在轮次之间保持存活?
这些细节并非实现层面的琐事。它们塑造了模型在每一步可获得的信息与可执行的操作。
DeepSeek 的模型文档让这种系统依赖变得清晰可见。该公司建议,对高要求的智能体任务使用最高推理力度,并在该模式下至少提供 384,000 token 的上下文。
其模型卡也显示,不同推理设置之间存在显著差异。在 Terminal Bench 2.0 上,DeepSeek 列出的 V4-Pro 分数为:非思考模式 59.1,高力度 63.3,最高力度 67.9。
在 SWE-bench Verified 上,报告的分数依次为 73.6、79.4 和 80.6。在 BrowseComp 上,高力度和最高力度分别为 80.4 与 83.4,而未列出非思考模式的结果。
这些是 DeepSeek 自己的评估,并非独立复现。不过,它们表明该公司认为推理配置会实质性地改变测得的能力。
技术报告进一步解释了评估环境。对于代码智能体任务,DeepSeek 使用了一组精简工具,包括 shell 访问和文件编辑。
对于搜索智能体任务,该公司使用了内部 harness。这意味着报告中的智能体分数从来都不代表一个仅回答孤立提示词的裸模型。
这本身并无不妥。智能体模型需要工具,而基准测试必须提供某种运行时。每家厂商都会作出选择。
问题始于某个特定 harness 下的分数被当作模型在各类产品中通用能力的简写。使用持久 shell 和训练对齐压缩策略得出的结果,并不会自动迁移到另一款编辑器扩展中。
使用 Anthropic-compatible 客户端的开发者,可能会发送结构不同的工具结果。企业平台也可能注入安全指令、审计消息、检索结果和审批关卡。
这些添加在生产环境中可能必不可少,但也可能让提示词远离强化学习期间使用的环境。
因此,Minimal 模式所做的不只是改善一次演示。它揭示了模型分数背后隐藏着多少基础设施。
这正是 DeepSeek pro 争议超越单次发布而具有意义的原因。模型卡上写的是 DeepSeek-V4-Pro,但智能体任务中的实际工作单元是 DeepSeek-V4-Pro 加上一套 harness 配置。
一旦这一差异被明确,排行榜就需要同时报告这两部分。
训练对齐并不自动意味着过拟合
公开证据支持配置敏感性的判断,但尚不足以证明 DeepSeek-V4-Pro 对某一 harness 发生了过拟合。
过拟合有严格含义。当一个系统学习到的模式在训练分布中表现良好,却无法泛化到具有实质差异的输入时,它便发生了过拟合。
在这里,被怀疑的训练分布不仅包括编程问题,还可能包括智能体的提示词结构、工具名称、响应格式、shell 行为和上下文管理策略。
如果强化学习反复奖励某一种组合中的成功,模型自然会适应这一组合。一致的工具语义会减少不确定性,也让奖励信号更容易学习。
这种适应可能是有益的。人类同样会在熟悉的界面、可靠的工具和稳定的工作流中表现得更好。
一个经过训练、能够使用可预测文件编辑器的模型,理应优于被迫推断未记录编辑器行为的模型。若把每一种此类提升都称为“过拟合”,这个术语几乎会失去意义。
更强的指控需要更广泛的失败模式。即使底层任务保持等价,V4-Pro 也必须在无关环境细节变化时表现出异常陡峭的性能下降。
例如,研究人员可以在保留工具描述和行为的前提下重命名工具;可以调整工具 schema 的顺序、改变无害的措辞、以等效界面替换编辑器,或调整压缩策略而不移除必要事实。
一个通用智能体应能容忍其中许多变化。一个受 harness 绑定的模型,即便获得同样的实际能力,也会出现显著性能损失。
目前尚无公开研究在足够多的任务和随机试验中证实这一模式。截图、视频和个人编程会话可以发现一个研究问题,但无法衡量泛化能力。
“Minimal 解锁了真实模型”的说法也存在若干替代解释。
首先,Minimal 模式可能减少了提示词杂乱。冗长的工具手册和相互重叠的指令,往往会让智能体行为变差,尤其是在长时间会话中。
其次,它可能更有效地保留了状态。持久 shell 让模型可以维持工作目录、环境状态和运行中的进程,而不必重新构建它们。
第三,预设配置可能暴露了后训练期间使用的工具接口。这会带来分布对齐,但不一定意味着对基准测试的记忆。
第四,早期 GA 请求可能遇到了部署差异。社区报告提到异常简短的推理,以及可能的路由变化,尽管 DeepSeek 并未证实存在紧急回滚。
第五,用户可能会挑选并传播最引人注目的成功运行结果。正面演示会迅速扩散,而失败的复现则较少受到关注。
相反的偏差同样存在。失望的用户可能会从一次失效会话中得出普遍结论,尤其是在读到抬高预期的基准测试声明之后。
DeepSeek 的官方结果确实留有怀疑空间。该公司称,V4-Pro Max 在 SWE-bench Verified 上解决了 80.6% 的问题,并在 Terminal Bench 2.0 上获得 67.9 分。
它还报告了 3206 的 Codeforces 评分,以及 LiveCodeBench 上 93.5 的通过率。这些数字将该模型呈现为在所述评估设置下的高端编程系统。
独立评估提供了更有用的参照。美国政府的人工智能标准与创新中心使用开发者推荐的设置,对预览版模型进行了评估。
在其独立评估中,CAISI 在 H200 和 B200 GPU 上运行了 DeepSeek V4。它保留了内部推理,并使用了推荐的上下文、采样、系统提示词和最大思考值。
CAISI 还复现了 DeepSeek 自报的 GPQA-Diamond 结果,降低了该基准上存在基础推理配置错误的可能性。不过,在代理测试中,它使用的是 Inspect 内置的 ReAct agent,而不是 DeepSeek Harness Minimal。
这正是未来分析应当审视的差异。模型可以匹配静态推理基准,同时仍然对其周围的代理循环高度敏感。
因此,现有证据支持一个谨慎的结论。DeepSeek-V4-Pro 对环境敏感,而 DeepSeek 围绕已知配置优化了其代理工作流。
这些证据并不能证明 DeepSeek 记住了公开基准任务,也无法证明存在蓄意操纵。
如今就称该模型存在过拟合,是超前于数据的判断。称该 harness 无关紧要,则忽视了 DeepSeek 文档和社区测试共同展示的情况。
真正的竞争:训练对齐的代理与可移植模型
DeepSeek 面临的当务之急不是击败某一个竞争模型,而是证明其能力在偏好的运行环境之外依然有效。
模型供应商正日益优化完整的代理系统。模型仍然重要,但编排决定了其推理能否产出有用的成果。
OpenAI 将模型与 Codex 配对。Anthropic 在开发模型的同时打造 Claude Code。Google 在 Gemini 的编程产品中控制模型行为,而独立运行时则加入各自的提示词和工具。
DeepSeek 现在也拥有同样的战略选择。它可以将 V4-Pro 与 DeepSeek Harness 协同设计,端到端衡量失败情况,并将这些轨迹用于强化学习。
与将 API 视为孤立的文本生成器相比,这种方式可以带来更好的实际结果。由于公司控制着交互的两端,它也能加快调试速度。
稳定的 harness 为训练团队提供了可重复的环境。他们可以奖励正确的命令使用,验证文件修改,惩罚未完成的工作,并测试长时间运行的会话。
代价是可移植性。企业很少会在供应商未经改动的参考环境中部署模型。
它们会加入权限检查、私有检索、日志记录、策略过滤、人工审批,以及组织特有的工具。开发者则带来既有编辑器、命令行代理和自动化框架。
每一项新增内容都会改变交互分布。一个依赖稀疏系统提示词的模型,可能会在企业安全策略增加数千个 token 后出现性能回退。
围绕一种文件编辑协议训练的模型,可能会错误处理另一种协议的报错信息。适用于编程的压缩策略,可能会丢弃法律或分析任务所需的证据。
可移植能力意味着在这些变化下保持性能。它不要求在所有环境中取得完全相同的分数,但要求性能平稳退化。
训练对齐能力提供的是另一种承诺。供应商提供一套具有已知设置的推荐系统,用户通过采用整套技术栈获得宣传中的性能。
两种方式都不存在普遍优势。紧密集成的系统可以为愿意围绕其实现标准化的团队带来更好的结果。
可移植模型则给予平台构建者更多自由,也让不同运行时之间的基准结果更容易比较。
DeepSeek 当前的表述试图兼得两种优势。V4-Pro 可通过多种 API 格式使用,并被描述为兼容主流代理产品。
与此同时,其最强的报告表现似乎与最大推理和专门的 harness 配置密切相关。这一差距给可移植性主张带来了压力。
官方预览公告称,DeepSeek 已针对 Claude Code、OpenClaw、OpenCode 和其他代理产品优化 V4。公告还称,公司正在内部使用 V4 进行代理式编程。
这些说法暗示了比单一 Minimal 预设更广泛的适配。DeepSeek 可以通过在多个独立运行时中、以匹配预算发布结果来支持这些说法。
比较必须控制的不只是最终分数。研究人员应报告 token 使用量、运行时间、完成率、工具错误、重试次数和失败类别。
他们还应将模型失败与 harness 失败区分开来。如果编辑器拒绝了格式错误的补丁,轨迹应显示是 schema、解析器还是模型导致了缺陷。
这种报告水平将改善整个代理市场。当前的排行榜常常将复杂系统压缩成模型名称旁边的一个百分比。
这种呈现方式鼓励买家比较模型端点,同时忽视编排。它也让供应商能够选择有利的 harness,而不展示结果对配置的敏感程度。
如果 DeepSeek 通过其插件设计进行受控消融实验,DeepSeek Harness 或许能帮助解决这个问题。团队可以一次替换一个组件,并公布由此产生的分数变化。
消融测试会移除或改变一个元素,以衡量其贡献。在这里,它可以量化持久 shell 状态、压缩策略、工具命名或系统提示词长度的价值。
如果 Minimal 模式获胜是因为它移除了无关指令,其他 harness 开发者可以借鉴这一经验。如果它获胜是因为模型期待精确的训练时 token,那么对可移植性的担忧会更强。
无论哪种结果,都比又一次展示性运行更具信息价值。这场争议需要的是测量,而不是热情片段与沮丧帖子之间的竞赛。
什么能够证实或削弱对 DeepSeek Pro 的担忧
三个可观察信号可以判断 Minimal 模式是合理的参考设置,还是一种性能依赖。
第一个信号是对 0813 模型进行受控的跨 harness 评估。它应通过 DeepSeek Harness Minimal、其标准预设以及至少两种独立代理运行时运行相同任务。
每种配置都需要采用相同的推理等级、token 预算、采样策略、工具能力和重试额度。评估者应进行多次试验,因为代理结果会因运行而异。
如果 Minimal 的优势很大,将强化对配置依赖性的担忧。如果在等效运行时中结果相近,则会削弱过拟合理论,并表明早期失败源于设置或部署问题。
第二个信号是在无害接口变化下的韧性。评估者应重命名工具、调整 schema 顺序、改写指令,并替换功能等效的编辑器。
在信息和可用操作保持不变时,性能应当总体稳定。若出现明显下降,则表明模型依赖表面特征,而非对工具的通用理解。
这一测试比比较一个供应商的 harness 与另一个更重要。不同产品会同时引入许多变量,使得分数变化的原因难以隔离。
第三个信号是 DeepSeek 自身的披露。该公司应公布每个重点基准背后的确切代理配置,包括提示词、工具 schema、压缩规则和推理设置。
它还应区分预览版模型与 8 月 13 日的 GA checkpoint。没有按版本划分的结果,用户无法判断较早的分数是否适用于他们正在调用的端点。
DeepSeek 无需披露私有训练数据,也能提供这种透明度。可复现的评估脚本和完整的运行时配置将回应核心问题。
随后,独立研究人员可以测试所声称的增益是否能在其他代码库、语言、任务长度和安全约束下延续。企业买家则可判断采用参考 harness 是否适合自己的系统。
对开发者而言,实际教训已经很明确。不要通过一个聊天窗口评估 DeepSeek pro,也不要将一次 Minimal 模式下的成功视为普遍结果。
测试将投入生产的确切模型-harness 组合。记录推理设置、上下文策略、工具定义、重试和任务完成情况,而不是只评判最终文本。
对基准发布者而言,应将配置作为一级条目报告。“使用 DSH Minimal 的 DeepSeek-V4-Pro”比仅标注“DeepSeek-V4-Pro”的一行更诚实。
对 DeepSeek 而言,机会远不止为一次发布辩护。该公司可以将这场争议转化为评估代理系统的更清晰标准。
最有力的结果并不是证明 Minimal 模式让 V4-Pro 显得格外出色,而是证明当真实组织用自己复杂的环境替代 Minimal 时,该模型依然有用。
在这些结果到来之前,“过拟合”仍是一项未经证实的诊断。配置依赖性是已确立的担忧,而且它本身就足够重要。
如果你正在测试 0813 版本,请至少通过两种 harness 运行相同的代码库任务,并重复每次运行。保留轨迹,统一预算,并在发布成功案例时一并发布失败案例。这些证据将告诉我们,DeepSeek pro 学到的是可迁移的代理行为,还是一种异常熟悉的工作流。


