top of page

DeepSeek Flash 刚刚在智能体测试中超过 V4 Pro Preview,但真正的难题才刚开始

DeepSeek Flash 于 7 月 31 日进入公开测试,并提出了一项引人注目的主张:其更新后的智能体得分如今已在所有披露的测试中超过更大的 V4 Pro Preview。

该公司还新增了原生 Responses API 支持,这是 OpenAI 的 Codex 编程智能体所使用的接口。这使 DeepSeek-V4-Flash 从一个开发者可部署在智能体背后的高速模型,转变为一个可在成熟智能体客户端内部运行的模型。

这一反转意义重大,因为 DeepSeek 最初将 Flash 定位在 V4 Pro 之下。较小的模型主打速度,而 Pro 则承担更强的智能体能力叙事。在不改变 Flash 架构的情况下,后训练显然缩小了这种层级差异,甚至可能已将其逆转。

不过,这些数据来自 DeepSeek 自己的评测。其中两项测试为内部测试,若干结果依赖尚未发布的测试框架,独立开发者也才刚开始测试新端点。因此,公开测试对更大型的编程模型构成了可信挑战,但尚未为这场竞争定论。

DeepSeek Flash 公开测试更新了什么

DeepSeek 升级了现有 Flash 架构周围的行为能力,而非推出一个更大的替代模型。

根据 DeepSeek 的基准测试公告,DeepSeek-V4-Flash-0731 保留了预览版模型的架构和规模。该公司表示,仅进行了额外后训练——这一阶段决定了训练完成的模型如何推理、遵循指令和使用工具。

这一区别是此次发布的核心。DeepSeek 并非认为更多参数带来了所报告的改进,而是主张较小模型通过更具针对性的训练,成为了更出色的智能体。

DeepSeek-V4-Flash 的总参数量为 2840 亿,每个 token 激活 130 亿参数。混合专家架构会在每个推理步骤中仅选择模型的一部分。V4 Pro 则大得多,总参数量为 1.6 万亿,激活参数量为 490 亿。

两款模型最初均于 4 月 24 日以预览版形式发布。DeepSeek 将 Flash 描述为快速高效的选项,其推理能力接近 Pro,在简单智能体任务上的表现也相近。其 V4 发布说明还为两款模型提供了 100 万 token 的上下文窗口。

此次更新改变了这种关系。DeepSeek 公布的公开测试结果为:Terminal Bench 2.1 得分 82.7、NL2Repo 得分 54.2、Cybergym 得分 76.7,以及 DeepSWE 得分 54.4。该公司还列出了 Toolathlon Verified 的 70.3 分和 Agent Last Exam 的 25.2 分。

DeepSeek 还报告称,在 Automation Bench 的公开部分获得 25.1 分。其两项内部编程测试中,DSBench-FullStack 得分为 68.7,DSBench-Hard 得分为 59.6。

这些数据涵盖了智能体工作的不同环节。终端基准测试衡量模型能否通过命令行交互完成任务。代码库测试考察其在既有代码库中的导航和修改能力。工具基准测试则测试模型能否跨多个步骤选择并操作外部功能。

DeepSeek 表示,更新后的 Flash 模型在全部九项披露的评测中都超过了 V4 Pro Preview。报告中最显著的变化出现在需要持续执行编程操作的任务上,而非简短回答或孤立的代码补全任务。

此次公开测试仅影响官方 Flash API。DeepSeek 表示,其网页应用、消费者应用和 V4 Pro API 均保持不变。使用这些产品的开发者不应假定自己已获得更新后的行为表现。

模型标识符仍为 deepseek-v4-flash,这减少了现有 API 用户的迁移工作。但这种便利也带来了版本管理问题。团队需要保留自己的评测记录,才能判断端点更新后模型行为是否发生变化。

这不只是一次常规的模型刷新,因为它挑战了一个常见假设:当后训练、工具格式和执行框架同时变化时,更大的模型并不一定仍是更好的智能体。

DeepSeek Flash 现在使用 Codex 所期待的语言

即便基准测试主张尚待独立验证,原生 Responses API 支持也让此次发布具备了实际运营层面的重要性。

编程模型在智能体中并非独立运作。周围的客户端会发送指令、声明工具、记录输出、管理上下文,并决定模型何时应继续执行。即使是微小的兼容性故障,也可能削弱原本有能力的模型。

OpenAI 的 Responses API 为这些交互提供了结构化接口。DeepSeek 现在表示,其 API 原生支持这一格式,使 Codex 客户端能够将 DeepSeek 作为替代模型提供商使用。

DeepSeek 官方的 Codex 配置说明涵盖 Codex CLI、ChatGPT 桌面应用和 Visual Studio Code 的 Codex 扩展。这些客户端共享一个配置文件,因此一次提供商设置即可在全部三个环境中启用该模型。

文档目前将 DeepSeek-V4-Flash 列为这一集成中唯一可用的 DeepSeek 模型。文档称,预计将在 2026 年 8 月初支持 V4 Pro。

DeepSeek 为 Codex 提供了描述 Flash 的模型目录。其中指定了 1,048,576 token 的上下文窗口、并行工具调用支持、三个推理强度级别,以及一个自由形式补丁工具。它还声明了客户端所需的 shell 和网页搜索接口。

该目录并非只是装饰性补充。智能体客户端必须了解每个模型的上下文限制、支持的工具形态和推理控制方式。错误的元数据可能导致任务被截断、请求无效,或客户端无法执行工具调用。

DeepSeek 提供自动化设置脚本和手动配置路径。该脚本会备份现有 Codex 配置、写入 DeepSeek 模型目录、添加提供商,并验证生成的文件。

直接集成带来了一个具体用例。开发者可以打开一个陌生的代码库,让智能体调查失败的测试,并让它搜索文件、编辑代码和运行命令。模型必须在整个序列中保持状态。

这种工作流比根据提示生成一个函数更难。智能体必须解读工具结果、发现错误假设、保留约束条件,并避免反复执行无效操作。它还需要生成适合该代码库的补丁,而不只是看起来合理的补丁。

Responses API 消除了 Flash 与 Codex 之间的一层适配工作。它并不保证模型会做出良好决策,但为开发者提供了一个标准客户端,可借此测试这些决策。

这给依赖专有客户端与模型捆绑方案的提供商带来了压力。如果 Codex 能通过相同工作流操作多个模型后端,开发者就能比较模型,而无需替换整个界面。

这同样给 DeepSeek 带来压力。原生兼容性让双向比较都更容易。用户可以在自己已经使用的代码库和命令上测试 Flash;如果其基准优势无法经受真实工作检验,也可以转向其他模型。

为什么更小的模型能够击败 V4 Pro Preview

报告中的跃升表明,驱动因素是后训练和智能体基础设施,而非模型规模突然扩大。

智能体性能不只取决于预训练中存储的知识。模型还必须学会何时调用工具、如何读取结果、何时修订计划,以及何时停止。这些行为可以通过可执行环境中的强化学习得到改进。

DeepSeek 此前介绍过一个名为 DeepSeek Elastic Compute(简称 DSec)的智能体训练系统。它通过统一的软件接口支持函数调用、容器、微型虚拟机和完整虚拟机。

根据对 V4 架构的技术分析,DSec 可以运行数十万个并发沙箱。这些环境使训练任务能够根据真实工具交互的结果给予奖励,而不是仅对文本进行判断。

V4 的设计也试图降低长智能体轨迹的成本。每条终端结果、文件摘录、错误信息和模型回复都会增加 token,后续步骤必须处理这段不断扩展的历史记录。

DeepSeek 在整个模型中结合了两种压缩注意力机制。Compressed Sparse Attention 会在选择相关区块前压缩序列;Heavily Compressed Attention 则创建一个更短得多的表示,供每个查询检查。

该分析报告称,在 100 万 token 的上下文下,V4 Flash 所需的单 token 推理计算量仅为 DeepSeek-V3.2 的 10%。它使用的 V3.2 键值缓存——即生成过程中保存先前上下文的内存——也仅为 7%。

这些数据适用于架构效率,而非 7 月的智能体更新本身。不过,它们解释了为何 Flash 是长时间运行智能体的合理基础。若每增加一步都会使推理变得不切实际,智能体便无法从大上下文窗口中获益。

当涉及工具时,V4 还会在用户消息之间保留推理内容。该行为面向这样一种工作流:智能体已经检查文件或执行命令后,开发者再补充指令。

工具格式同样重要。DeepSeek 为工具调用引入了专用 token 和基于 XML 的模式。这种方法将纯字符串与结构化参数分离,旨在减少嵌套请求中的转义错误。

据称,7 月更新没有改变任何这些架构基础,而是调整了 Flash 在其之上的行为。这表明 DeepSeek 在训练数据、奖励设计、工具轨迹或指令策略中发现了额外收益。

具体方案仍未公开。DeepSeek 尚未发布足够信息,无法区分更新后模型与评测框架各自的贡献。这一缺口使外部人士无法将分数提升归因于某一种技术。

即便如此,这一方向仍契合模型开发中更广泛的变化。提供商正越来越多地针对完整任务轨迹而非孤立回答优化模型。性能衡量单位正在变成成功完成的工作流。

当较小模型能够可靠行动时,这会对它们更有利。一个能选择正确工具并从错误中恢复的紧凑模型,可能胜过一个推理能力强却失去工作流控制的大型模型。

这也改变了工程团队评估 AI 编程智能体的方式。通用编程得分几乎无法说明模型能否在特定代码库中运行、遵循本地规范,并验证自己的补丁。

已经维护可搜索技术文档的团队,可以将智能体试验与现有的工程知识库连接起来。这使评估者能够将生成的改动与架构说明、决策记录和既往事故进行比较,而不是仅凭表面判断输出质量。

因此,小模型优势是有条件的。Flash 需要合适的客户端、工具定义、代码库上下文和执行权限。DeepSeek 已改进了这一技术栈的多个层面,但真实部署仍需补齐其余部分。

基准测试领先优势附带重要限制

DeepSeek 的结果是检验模型的重要证据,但并非其在生产环境中可靠性的独立证明。

第一项保留意见在于评估控制。DeepSeek 选择了模型设置、评测框架、任务限制和报告格式。供应商评估有助于展示预期优势,但很少能覆盖用户实际会遇到的所有失效情况。

DeepSeek 使用其所谓的 DeepSeek Harness,以最简模式测试了公开的编码代理任务。它采用最高努力程度设置,top_p 为 0.95,温度为 1.0。

该评测框架尚未发布。因此,独立研究人员无法复现这一确切设置,也无法判断它对结果贡献了多少。提示词、工具封装、超时设置或重试策略发生变化时,代理得分往往也会随之波动。

第二项保留意见涉及测试组合。DSBench-FullStack 和 DSBench-Hard 是内部数据集。外部评估者无法审查其任务分布、污染控制、评分规则或失败案例。

内部评估能够发现公开基准遗漏的弱点。然而,在任务本身或可信的审计流程公开之前,它们无法提供公共问责性。

第三个问题是基准饱和与优化。一旦公开任务被广泛使用,模型开发者便可以围绕其格式调整训练。更高的分数可能反映了有价值的学习、狭窄的专项优化,或两者兼而有之。

第四个问题是运行可靠性。模型可能在边界明确的基准上成功,却在持续数小时的任务中表现不稳定。生产环境中的代理需要面对模糊指令、不断变化的依赖项、不可用服务和权限边界。

安全性带来了另一项挑战。Cybergym 可以衡量网络安全推理的部分能力,但企业部署还需要围绕命令执行、密钥处理、网络访问和破坏性操作建立控制机制。模型能力不能取代受约束的运行环境。

在 4 月 V4 预览版发布后,独立分析师提出了类似担忧。Morningstar 分析师 Ivan Su 将 V4 称为一次有竞争力的后续更新,但表示在得出最终结论前仍需独立评估。

Omdia 分析师 Lian Jye Su 则给出了更积极的解读,称初步基准显示 V4 将与领先的美国模型竞争。这两种观点均出现在一份独立 V4 报告中。

这些观点并不矛盾。DeepSeek 可以是严肃的竞争者,同时其最强主张仍需外部测试。公开 beta 正是这些判断接受检验的阶段。

与 OpenAI、Anthropic 和 Google 的比较同样需要谨慎。不同供应商以不同的模型设置和代理脚手架报告结果。归因于某个模型的分数,往往反映的是一整套系统。

V4 Flash 更新还带来了额外的比较问题,因为 V4 Pro Preview 是一个不断变化的目标。DeepSeek 表示,官方 V4 Pro 版本将随后发布,其 Codex 文档则预计很快将提供集成支持。

因此,Flash 对预览模型的胜利可能只是暂时的。该比较仍然重要,因为它展示了定向后训练所取得的成果,但并不能确立永久的产品层级。

开发者还应关注回归问题。额外的强化学习可能提升工具调用的持续性,却也可能让模型变得更冗长、更不谨慎,或更愿意执行不确定的计划。

一项有用的评估应记录任务完成情况、人工修正时间、无效工具调用、重复操作、测试失败和非预期文件改动。延迟和上下文消耗同样重要,因为代理会反复调用模型。

最有力的证据将来自从未参与训练或基准流程的代码仓库。结果应包括失败任务,而不只是经过精心打磨的演示。

在这些评估结果出现之前,准确的结论应当保持有限。DeepSeek 报告称代理能力有大幅提升,开放更新后的端点供公众测试,并提供直接的 Codex 集成。它尚未证明这种优势同样存在于不受控的生产环境中。

谁将因 DeepSeek V4 Agent 升级而承受压力

最直接的压力将落在那些向开发者收取智能服务费用,同时将这种智能绑定在专有代理体验中的模型提供商身上。

OpenAI 围绕自身模型和 Responses API 构建了 Codex。DeepSeek 的原生支持使这一接口成为竞争点。客户端仍然熟悉,但底层提供商可以更换。

这并不意味着 DeepSeek 对每一种 Codex 工作负载都是可直接替换的等价方案。模型可能会以不同方式解读相同的工具定义,客户端功能也可能依赖于提供商特有的行为。不过,兼容性降低了开展严肃对比所需的工作量。

Anthropic 通过 Claude Code 面临相关挑战。DeepSeek 在 V4 预览期间已经记录了与 Claude Code、OpenCode、OpenClaw 及其他代理系统的集成方式。

Google 则通过基于 Gemini 的编码产品和开发者 API 参与竞争。其规模、多模态能力和云端分发仍是显著优势。然而,每家提供商如今都必须说明,为什么开发者应接受高度耦合的技术栈。

压力同样波及规模较小的编码模型供应商。DeepSeek Flash 结合了大型上下文窗口、官方 API、预览版发布的开放模型权重,以及对多个代理客户端的支持。

在这里,分发能力与基准表现同样重要。需要定制集成的高评分模型,获得的测试机会可能少于内置于熟悉工具中的稍弱模型。

DeepSeek 的策略似乎是在接口层降低切换阻力。开发者可以保留客户端,接入同一代码仓库,并比较结果。这使实际任务完成能力变得更重要。

该公司也在与自家的 V4 Pro 模型竞争。Flash 过去是面向速度敏感型工作的较小选项。新的分数给了开发者理由,在过去专属于 Pro 的任务上测试它。

这种内部竞争可以帮助 DeepSeek 更有效地划分工作负载。团队可能将常规代码仓库工作交给 Flash,而把需要更深入推理的任务留给 Pro。

但 DeepSeek 尚未证明这一分流策略能够稳定奏效。新的 Flash 结果聚焦于代理基准,而 Pro 可能仍在知识、推理和复杂规划方面保有优势。

企业考量的不只是原始能力。数据驻留、合规规则、供应商治理、支持承诺和地缘政治限制,都可能在基准表现之外阻碍采用。

DeepSeek 还因训练实践和安全政策受到审视。Anthropic 和 OpenAI 指控包括 DeepSeek 在内的中国实验室通过蒸馏提取能力。DeepSeek 尚未接受这些指控。

这场争议并不决定 Flash 的表现是否出色。但它会影响采购审查,尤其是在受监管组织和公共部门环境中。

对于独立开发者和小型团队而言,决策更为直接。他们可以运行具有代表性的任务,检查每一条命令,并比较最终补丁。beta 已提供足够的访问条件,可立即开始这项工作。

对于大型组织,更好的问题不是 Flash 是否赢得公开排行榜,而是该模型能否在不造成不可接受的安全或治理风险的前提下,降低总体工程投入。

这一标准同样适用于其竞争对手。DeepSeek 的发布通过让模型可互换性更具可行性而给市场施压,但每家提供商仍需要赢得生产环境的信任。

三个信号将决定 DeepSeek Flash 能否守住领先地位

下一阶段将由可复现性、官方 V4 Pro 发布,以及在真实代理工作流中的持续采用来决定。

第一个信号是 DeepSeek Harness 的发布。DeepSeek 表示,它在公开编码代理评估中以最简模式使用了这一框架,并计划将其公开。

公开的评测框架将允许研究人员重新运行测试、检查提示词,并在相似条件下比较 Flash 与其他模型。若结果相符,将强化 DeepSeek 关于后训练带来真实能力提升的主张。

若差异显著,则会削弱这一结论。这可能表明,隐藏的重试、任务特定提示词或执行策略对结果的贡献大于模型本身。

第二个信号是官方 V4 Pro 的发布。DeepSeek 表示 Pro 将很快推出,而其文档指出 Codex 支持将在 8 月初到来。

这次发布将检验本文的核心反转。如果最终的 Pro 模型重新取得明显的代理领先优势,Flash 就会成为高效的次级选项,而非新的性能标杆。

如果 Flash 仍然接近或领先,DeepSeek 将需要说明其规模更大模型的定位。除非 Pro 能够在最困难的任务上带来可衡量的优势,否则开发者可能会更倾向于 Flash。

第三个信号是来自 Codex 用户的真实采用数据。有价值的证据将包括完整的代码仓库轨迹、可复现的补丁,以及来自不同代码库的失败报告。

应关注 Flash 在命令失败后恢复的频率。跟踪它是否重复无效操作、编辑无关文件,或在验证前停止。这些行为决定了代理是否真正节省时间。

长期试验还将揭示,随着历史记录累积,百万 token 上下文是否仍然有用。仅有容量并不能保证模型在数百次工具交互后检索到正确细节。

开发者应从范围受控的任务开始。合适的试验可能包括定位缺陷、编写针对性补丁、运行现有测试并解释结果。代码仓库应使用版本控制、受限凭据和沙箱化运行环境。

团队随后可以使用相同的任务集,将 Flash 与当前模型进行比较。他们应保留失败运行记录和人工干预,因为只展示成功案例会掩盖实际运行负担。

DeepSeek Flash 公开 beta 值得关注,因为它结合了三项变化:更强的供应商报告代理分数、标准 Responses API 支持,以及直接的 Codex 兼容性。这些变化共同让该模型更容易在编码代理实际运行的环境中接受评估。

它们并未消除保持怀疑的必要性。该模型报告的领先地位依赖于公司自行运行的测试、两个内部基准,以及外部人士尚无法审查的评测框架。

下一步决定权属于开发者。选择若干代表真实工作的任务,在受控权限下运行它们,并衡量完成的结果,而非看似吸引人的回答。如果 DeepSeek Flash 能在那里保持领先,这个较小的模型做到的就不只是击败预览版基准。它还将挑战团队选择其代理背后智能能力的方式。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page