据报 DeepSeek V4 Flash 在智能体任务上胜过其更大的同系模型
- Martin Chen

- 8月3日
- 讀畢需時 14 分鐘
DeepSeek 称其轻量级 V4 Flash 模型在智能体任务上的得分高于规模大得多的 V4 Pro 预览版,随后将其推向公开测试。相关报道将其描述为一款击败体量数倍于己系统的模型,这一说法很快登上 Google News。
引人注目的不只是小模型在部分测试中取胜。DeepSeek 表示,V4 Flash 保留了其 2840 亿参数的架构,同时显著提升了智能体行为。这对一个常见假设构成了压力:更好的 AI 必须依赖不断增大的模型,并为每次请求投入更多计算资源。
这一比较需要谨慎解读。DeepSeek 公布的规格并不支持新闻标题中出现的所有简化尺寸比例。V4 Pro 的总参数量为 1.6 万亿,而 V4 Flash 为 2840 亿。因此,按总参数量计算,Pro 约为 Flash 的 5.6 倍,而非 8 倍。
更重要的是,基准测试领先与任务类型、推理设置、软件执行框架和评估方法有关。独立测试已经显示,DeepSeek 自己公布的基准结果可能优于私有测试所得结果。因此,更可信的结论更为有限,但影响也更大:专门的后训练可以让较小的模型在特定智能体任务上击败更大的同系模型。
Google News 标题未提及的内容
DeepSeek 并非只是将 V4 Pro 压缩为更小的版本,而是训练 V4 Flash 在工具驱动型工作中采取不同的行为方式。
DeepSeek 于 2026 年 4 月推出 V4 系列,其中包括两款开放权重的混合专家模型。混合专家模型会让每个 token 仅通过网络的一部分,从而减少生成每次响应所需的计算量。
V4 Pro 包含 1.6 万亿总参数,并为每个 token 激活 490 亿参数。V4 Flash 包含 2840 亿总参数,并为每个 token 激活 130 亿参数。根据该公司的 V4 发布说明,两者均支持最高 100 万 token 的上下文窗口。
最初的定位很清晰:Pro 是旗舰模型,Flash 则以较低的计算需求换取略低的分数。DeepSeek 称,Flash 在推理能力上接近 Pro,并在较简单的智能体任务中表现相近。
这一关系在 DeepSeek 于 7 月 31 日发布更新后的 V4 Flash checkpoint 时发生了变化。该公司表示,模型保持相同的架构和规模,但智能体能力获得大幅提升。它还通过公开测试开放了官方 API 访问。
智能体是连接了终端、浏览器、代码仓库或业务应用等工具的模型。它不会只生成一个答案,而是规划多个行动、执行这些行动、读取结果,并调整下一步。
DeepSeek 称,更新后的 Flash 模型如今在多项智能体基准测试中超过了早期的 V4 Pro 预览版。这些结果涵盖编辑代码仓库、操作终端、调用工具,以及完成较长的软件任务等工作。
这正是它受到 Google News 关注的基础。然而,压缩后的标题省略了三项限定。
首先,这一比较针对的是选定的智能体基准测试,而非所有智力指标。一个模型可以在软件任务中领先,同时在科学推理、事实知识或对抗性测试中落后。
其次,DeepSeek 将更新后的 Flash 版本与 Pro 的预览版本进行了比较。该结果并不能证明每一个小模型都能胜过每一个大模型,也不能证明 V4 Flash 领先所有当前前沿系统。
第三,模型规模不止一种定义。总参数描述整个网络,活跃参数则描述该网络中有多少部分参与处理每个 token。这两项指标本身都无法完整反映训练质量、推理成本或实际性能。
按公布的两项指标,DeepSeek V4 Flash 都小于 V4 Pro。不过,公开规格得出的比例约为:总参数量 5.6 倍,活跃参数量 3.8 倍。所谓八倍的说法需要另一种尚未得到明确记录的比较或测量方式。
这一差异并不会抹去这次更新的意义。但它确实意味着,读者应将所报道的比例视为一项新闻说法,而非已经确立的技术事实。
DeepSeek V4 Flash 将后训练推向舞台中央
模型架构未变表明,DeepSeek 是从训练和工具使用中挖掘了更多性能,而不是增加原始容量。
预训练通过让语言模型接触大量文本和代码,赋予其通用的统计理解能力。后训练则进一步塑造模型如何遵循指令、推理、使用工具,以及响应反馈。
这一第二阶段已成为编程模型竞争的核心。一个模型可能掌握正确的编程概念,却仍然无法胜任智能体。它可能过早停止、重复失败的命令、丢失对代码仓库的追踪,或误解工具返回的错误。
DeepSeek 的更新似乎正是围绕这些失败模式设计的。该公司称,V4 Flash 现已原生支持 Responses API 格式,使其更容易在较长工作流中保留工具调用和中间状态。
这一区别之所以重要,是因为软件工程基准测试考察的不只是代码补全。模型必须检查文件、制定计划、修改正确的组件、运行测试、诊断失败,并重复这一过程而不偏离请求。
DeepSeek 此前曾介绍名为 DSec 的强化学习环境。强化学习通过带评分的尝试来训练行为,而据报 DSec 提供容器、微型虚拟机和完整虚拟机,用于大规模基于工具的训练。
根据对 V4 架构的技术分析,DeepSeek 构建 DSec 是为了运行数十万个并发沙箱。该系统可以保留中断的轨迹,并在不重复已完成工具调用的情况下恢复执行。
这类基础设施使 DeepSeek 能够在不改变基础模型参数数量的前提下改进智能体。实验室可以生成更贴近现实的软件任务,收集失败案例,奖励成功恢复,并优化模型分配推理资源的方式。
这种方法也有助于解释为何基准收益会集中在智能体任务上。通用知识在很大程度上依赖预训练数据和模型容量;工具使用则更直接地依赖后训练、工作流设计、环境反馈和推理设置。
DeepSeek 为 V4 提供多种推理模式。其最高投入模式允许模型在产生答案或行动前,花费更多 token 来处理问题。这可以改善困难任务的结果,但也使其与采用较小推理预算的模型之间的比较更复杂。
周边软件同样重要。执行框架是将模型输出转换为工具调用、返回观察结果并管理任务状态的系统。同一个底层模型,在不同执行框架下可能得到不同分数。
DeepSeek 披露,其编程智能体结果采用了公司的最简执行框架和最高投入设置。这提供了有用背景,但独立评估者仍需要采用相同实现,才能复现所报告的优势。
这正是本次更新的意义超出单一排行榜的原因。它表明,模型开发者可以通过改变训练环境、行动格式和推理策略获得显著提升。增加参数数量只是其中一个杠杆。
对于企业买家而言,这一发现改变了模型选择方式。部署自动化编程工作流的团队需要测试整个系统,而非比较模型名称或参数总量。代码仓库设置、允许使用的工具、上下文管理、重试策略和人工审查,都可能决定智能体是否成功。
评估这些系统的团队还需要可靠地记录需求和既往决策。可搜索的工程知识库能够保存这类上下文,尽管它不能替代直接的模型测试。
小模型正在对“规模优先”策略施压
DeepSeek V4 Flash 对那些依赖模型规模和高端定位来证明产品价值的提供商构成了最大压力。
过去几年,主导性的发展路径是扩展规模。实验室在更大的数据集上训练更大的网络,随后将它们部署在不断扩展的加速器集群上。更多参数通常带来更强的通用性能,尽管财务和能源需求也随之攀升。
混合专家架构改变了这一计算方式。它们允许模型拥有庞大的参数总量,而不必为每个 token 激活整个网络。DeepSeek 在早期世代中采用了这种结构,并将其延续到两款 V4 模型中。
Flash 进一步强化了这一挑战,因为相对于 Pro,它同时降低了总容量和活跃容量。若这一较小系统能在常见智能体工作负载中匹配或超过较大系统,开发者就更少有理由仅因旗舰模型更大而选择它。
这并不意味着规模扩展已经失效。V4 Pro 保留了更多容量,最初的基准结果也显示,它在多项知识和推理测试中领先 Flash。较大系统还可能在后训练未瞄准的特殊任务上保留优势。
压力来自实际回报递减。许多公司并不需要平均得分最高的模型;它们需要的是能在延迟、可靠性、安全性和基础设施的可接受范围内完成重复性工作的模型。
编程智能体让这种权衡变得可见。与一款总体上更聪明、却难以采取行动的模型相比,一款能以更少失败工具调用完成更多代码仓库任务的模型,能够创造更大价值。买家看到的是完成的工作,而不是参数数量。
DeepSeek 并非唯一追求效率的公司。Google 围绕更快、资源需求更低的推理构建了 Gemini Flash 系列。OpenAI 为高吞吐量应用提供了更小的变体。包括 Moonshot AI、Alibaba 和 Zhipu AI 在内的中国实验室,也在使用稀疏架构和针对性的后训练。
Anthropic 仍是重要的比较对象,因为其 Claude 模型在编程和长时间运行的智能体工作中建立了良好声誉。DeepSeek 所报告的结果通过宣称一款具有开放可用权重的模型可提供相当性能,瞄准了这一优势。
开放权重允许开发者在许可证允许的范围内下载和运行模型,而不是将每次请求都发送到由供应商控制的服务。这可以帮助组织定制部署,并将部分工作负载保留在自身基础设施内。
开放权重并不会自动带来更便宜或更易用的系统。V4 Flash 仍包含 2840 亿参数,这使得在普通工作站上完整部署难以实现。量化、分布式推理和专用加速器也会引入各自的工程负担。
更大的转变在于议价能力。当多款模型在同一任务上都表现足够好时,应用开发者可以在不同提供商之间路由工作。他们可以为困难案例保留昂贵或较慢的模型,并将常规行动交给更轻量的系统。
这种结构削弱了基准领先地位与商业控制力之间的联系。实验室可能投入巨资提升前沿基准分数,却在数月后看到规模更小的竞争对手通过后训练缩小差距。
DeepSeek 已在 2025 年初凭借 R1 展现出这种压力。这款推理模型并未终结市场对西方前沿系统的需求,但它迫使市场重新思考:模型能力的生产与交付成本究竟应有多高。
V4 Flash 将这一论点从推理延伸到了智能体。它的主张不在于解答一道数学题,而在于能否在一系列行动中持续维持有用的行为。这更接近许多公司希望自动化的工作。
DeepSeek 的基准主张仍需独立测试
核心不确定性不在于 V4 Flash 是否有所提升,而在于其宣称的领先优势能否经受中立评测框架、私有任务和生产环境工作负载的检验。
公司自行发布的基准结果仍有参考价值,因为开发者最了解如何配置自家模型。他们可以选择推荐的系统提示词、推理模式、采样设置和工具格式。这些选择展示了模型在预期使用条件下的表现。
但同样的自由度也会带来风险。公司可以重点强调更适合自身系统的测试,采用对其有利的工具评测框架,或分配比竞争模型更多的推理 token。即使不存在刻意操控,细微的配置差异也可能改变排名。
美国一项针对 V4 Pro 的独立评估说明了为何需要保持谨慎。隶属于美国国家标准与技术研究院的人工智能标准与创新中心,测试了该模型在网络安全、软件工程、科学、推理和数学方面的表现。
DeepSeek 报告的结果将 V4 Pro 置于较新的美国前沿模型附近。CAISI 则发现,其综合能力更接近大约八个月前发布的系统。该机构在其独立评估中解释了这种差异。
这些结果并非一概疲弱。在 CAISI 的设置下,V4 Pro 在 SWE-bench Verified 上得分为 74%,而一个更小的 OpenAI 参考模型为 73%。它在多项科学和数学测试中也表现强劲。
较大的差异出现在私有或半私有评估中。V4 Pro 在 CAISI 的保留软件移植基准上得分为 44%,而 Anthropic 的 Opus 4.6 为 60%。在一套半私有抽象推理测试中,V4 Pro 达到 46%,Opus 则达到 63%。
这些结果涉及 V4 Pro,而非 7 月对 V4 Flash 的更新。因此,它们并不能反驳 DeepSeek 较新的主张。但它们确立了一个相关先例:公开、由开发者选择的基准测试,可能呈现出比保留评估更有利的图景。
V4 Flash 需要接受同类测试。评估者应先复现 DeepSeek 的配置,再一次只改变一个变量。他们应比较公司提供的评测框架与中立框架,并在可能的情况下统一推理预算。
生产测试还应衡量基准分数掩盖的失败模式。智能体可能完成任务,却做出高风险改动、暴露凭据、忽视项目约定,或生成后续维护成本高昂的补丁。
长上下文带来了另一项不确定性。两款 V4 模型都宣称支持一百万 token,但上下文容量并不保证完美回忆。模型必须从大量输入中检索出相关细节,并在恰当的步骤正确使用。
V4 架构通过压缩注意力机制降低了内存负担。一项分析称,在一百万 token 的上下文下,V4 Flash 所需的单 token 推理操作量仅为 DeepSeek V3.2 的 10%,键值缓存仅为其 7%。
键值缓存会储存早先 token 的信息,因此模型不必在每一步生成时重新计算整段对话。压缩这一缓存能够让长时间智能体会话更具实用性。
但压缩也可能丢弃有用细节。DeepSeek 报告的检索准确率会随着上下文接近一百万 token 的上限而下降。这使得涉及大型代码仓库的真实测试,比单纯的最大上下文数字更具参考价值。
安全同样值得关注。智能体可以执行命令,并处理来自不受信任文档、网站或问题追踪器的内容。持久性更强的模型可以完成更多工作,但同样的持久性也会放大错误或恶意指令的影响。
研究人员已经记录了间接提示注入:文档中的文本试图覆盖智能体原本应遵循的规则。即使是针对工具使用优化的轻量级模型,仍需要权限边界、隔离执行、日志记录,以及对敏感操作的人类审批。
因此,最稳妥的解读应当具体明确。DeepSeek 表示,经过新的后训练后,V4 Flash 在部分智能体基准上已经超越 V4 Pro 预览版。独立证据尚未证明它在各种任务和部署设置中具有普遍的性能领先优势。
DeepSeek V4 Flash 与它实际挑战的模型
真正有意义的竞争,是高效智能体性能与规模优先部署之间的较量,而非 DeepSeek 对每一个更大模型的全面胜利。
V4 Flash 直接挑战 V4 Pro,因为两款模型同属一个系列,拥有相同的上下文上限和大致相同的架构设计。这使得它们之间的比较,比无关系统之间的排行榜对决更具信息价值。
DeepSeek 在 4 月披露的数据显示,V4 Flash 的总参数量为 2840 亿,V4 Pro 为 1.6 万亿。两者的活跃参数量分别为 130 亿和 490 亿。因此,较小模型在处理每个 token 时,对其专家层的计算需求更低。
7 月的更新改变了智能体工作负载下的内部产品层级。开发者在两者之间选择时,不再能简单认为 Pro 提供最佳行为,而 Flash 仅以质量换取效率。
Anthropic 的 Claude 系列代表了另一种挑战。Claude 最强大的模型在软件工程、终端使用和长期自主任务中仍然占据重要地位。DeepSeek 希望 V4 Flash 也能被纳入这些相同工作负载的考虑范围。
早期报道显示,更新后的 Flash 模型在复杂编码和自主软件测试中接近 Claude Opus 4.8。据报道,它还在一个众包前端编码排行榜上排名更靠前。这些发现令人鼓舞,但单一排行榜无法判定整体可靠性。
Google 的 Gemini Flash 策略提供了最接近的产品类比。两家公司都用 Flash 标签指代围绕速度和效率设计的模型。Google 控制着广泛的云服务和应用分发网络,而 DeepSeek 则强调开放权重和独立部署。
Moonshot AI 的 Kimi 产品线从另一方向增加了压力。其近期模型采用稀疏激活和注意力技术,旨在降低长时间智能体会话中的内存需求。这表明 DeepSeek 的更新是更广泛架构竞争的一部分,而非孤立成果。
竞争将日益发生在模型层之上。智能体框架可以根据任务难度选择模型,将失败的尝试转交给更强的系统,并在共享工作流中保留结果。
这种路由模式限制了品牌忠诚度的价值。如果 V4 Flash 能处理大多数代码改动,却在棘手的架构问题上失败,应用程序可以只升级处理该请求。尽管多个模型共同参与,用户体验到的仍是一个产品。
模型提供商将通过改进集成,而不仅仅是提升基准分数来回应。稳定的工具格式、可观测性、缓存、权限和可预测行为,可能比公开测试中的微小优势更重要。
对知识工作者而言,同样的原则也适用于编程之外。较小的智能体可能足以有效地总结会议、分类文档或收集研究资料。较大模型则可以继续用于需要更深层综合判断的决策。
这种组合需要良好的信息管理。用户需要了解智能体答案依据了哪些来源、工作流中发生了什么变化,以及何时有人类批准结果。在具有清晰来源追踪的前提下,个人AI second brain可以支持这一记录。
因此,实际问题并不是 V4 Flash 是否是最聪明的模型,而是它的性能是否足以胜任某项明确工作,以及它的效率是否能构建出更好的整体系统。
DeepSeek Google News 热潮之后该关注什么
三个信号将决定 V4 Flash 的故事会成为持久变化,还是又一个短暂的基准新闻标题。
第一个信号是对 DeepSeek 智能体分数的独立复现。评估者需要获得公司承诺提供的最小评测框架、确切的模型检查点,以及有记录的推理设置。
成功复现将强化 DeepSeek 的核心主张:后训练使未改变的 Flash 架构在智能体任务上超越了 Pro 预览版。若在匹配条件下出现明显下降,则会削弱这一主张。
随后,中立测试应扩展到公开编码测试集之外。私有代码仓库、新编写的终端任务和保密的安全评估,能够降低训练数据影响结果的风险。
第二个信号是生产环境采用情况。下载量和网络热情反映的是好奇心,但持续使用才能揭示模型是否能交付可靠的工作。开发者应关注路由平台、云端部署、框架集成,以及团队在真实代码仓库中使用该模型时持续出现的报告。
采用情况将支持这样一种观点:较小的智能体模型可以在常规工作中取代旗舰系统。高弃用率、大量重试,或频繁升级至更大模型,则会暴露基准成绩与可用自动化之间更大的差距。
第三个信号是竞争对手的回应。如果 Anthropic、Google、OpenAI、Moonshot AI 或 Alibaba 围绕智能体行为调整其较小模型,而不是只继续扩大规模,DeepSeek 的成果就会变得更重要。
新的紧凑检查点、修订后的工具 API、更长且可靠的上下文,以及更强的沙箱训练,都将表明竞争者接受了 DeepSeek 的前提。若持续聚焦于更大的旗舰模型,则意味着提供商仍将容量视为取得可靠进步的更安全路径。
DeepSeek 自身下一款 Pro 版本的发布,也属于这一信号的一部分。当前比较的对象是一款预览版。全面更新的 Pro 模型可能恢复预期的层级,并表明 Flash 的优势来自不均衡的发布节奏。
Google News 会继续青睐这个故事最简洁的版本:一款轻量级 DeepSeek 模型击败了一款规模大八倍的模型。证据支持一个更精确的结论:在针对性的后训练之后,据报道 V4 Flash 在部分智能体测试中击败了其更大的同门模型,但公开的规模数据和独立验证仍不完整。
这一更狭义的发现依然重要。它将关注点从实验室能够堆叠多少参数,转向模型在真实环境中能够多有效地行动。
在改变生产技术栈之前,请用自己的任务测试 V4 Flash,统一推理预算,并记录每一次失败。随后比较完成的工作、延迟、监督和安全要求。当基准变成你的代码仓库、你的文档和你的风险时,这个较小模型还能保持优势吗?


