DeepSeek Flash 0731 跻身开放模型前三,但基准领先仍需检验
- Aisha Washington

- 8月1日
- 讀畢需時 13 分鐘
DeepSeek Flash 0731 在 Artificial Analysis Intelligence Index 上获得 50 分,使这款新发布的模型跻身开放权重系统前三。
根据独立测试,这一成绩比此前 DeepSeek V4 Flash 的得分高出 10 分。这一提升之所以重要,是因为 DeepSeek 保留了更小的 Flash 架构,同时将更新重点放在智能体行为上。
此次发布也加剧了对智谱 AI、Moonshot AI、阿里巴巴及其他中国实验室旗下大型开放模型的压力。它挑战了这样一种假设:更高的总参数量或激活参数量,始终是打造更强智能体的稳妥路径。
但综合分数无法一锤定音。DeepSeek 在若干已公布的编程评测中使用了自家尚未发布的智能体测试框架。其中两项被引用的评测也来自内部测试集。
因此,真正重要的竞争在于小型开放权重智能体与大型系统之间,而不是 DeepSeek 与某一家特定公司的较量。Flash 0731 让小模型路线更具可信度,但外部工作负载现在必须验证其宣称的效率。
DeepSeek Flash 0731 有何变化
DeepSeek 改变模型行为的幅度超过了基础架构,并以 MIT 许可证发布了成果。
DeepSeek 将 0731 描述为正式版 DeepSeek V4 Flash,用以取代此前的预览版本。其模型卡称,这次更新显著提升了智能体能力。
智能体模型不只是回答孤立的提示词。它会规划步骤、调用工具、检查结果,并在推进任务的过程中调整方法。
该模型保留 V4 Flash 的结构,总参数量为 2840 亿,每个 token 激活约 130 亿参数。这一设计采用专家混合模型(MoE),会将每个 token 路由至选定的专家组件。
这一区别很重要。总参数量反映模型的存储容量,而激活参数量则更能近似体现单次前向传播所需的计算量。
DeepSeek 还保留了其附带的推测解码模块 DSpark。推测解码允许草稿组件先提出多个 token,再由主模型验证;当预测被接受时,这一机制可提升生成速度。
发布的检查点采用混合 FP4 和 FP8 精度。其专家权重使用四位表示,而大多数其他参数使用八位表示。
较低的数值精度可减少存储和内存需求,不过硬件支持与运行时实现仍决定实际性能。该仓库已发布文件的总容量约为 167GB。
DeepSeek 在 MIT 许可证下发布了这些权重,该许可证通常允许修改、再分发和商业使用,附带的义务有限。对于未公开训练数据和完整训练代码的模型而言,“开源”仍是一个并不完全准确的标签。
“开放权重”更为准确。开发者可以检查、运行、调整和再分发该检查点,但无法仅凭发布材料完整复现其训练过程。
DeepSeek 还将更新后的模型接入其官方 API。现有调用方可以继续使用 deepseek-v4-flash 模型标识符,无需迁移至独立的 0731 端点。
该 API 支持兼容 OpenAI 和 Anthropic 的请求格式。这种兼容性降低了已使用常见聊天补全或智能体接口的团队的集成负担。
DeepSeek 表示,架构和商业条款仍与此前的 Flash 服务保持一致。因此,公司将 0731 定位为能力升级,而非新的高端产品。
这一组合构成了核心张力:开发者获得了据称更强的智能体能力,却不必接受更大的激活模型、受限的权重许可证或新的 API 集成。
为什么 50 分会改变开放模型竞赛
这一分数之所以重要,是因为它将一款激活规模相对较小的模型带入了此前通常与更大型开放系统相关联的梯队。
Artificial Analysis 报告称,DeepSeek Flash 0731 在其 Intelligence Index 上获得 50 分。此前的 DeepSeek V4 Flash 在同一机构的评测框架下得分为 40 分。
该指数汇总了多项推理、知识、数学和编程评测的表现。它提供了一个共同的比较点,但没有任何综合指标能够代表所有部署场景的工作负载。
10 分的提升足以改变模型选型讨论。这并非隐藏在测量噪声中的小幅修订。
据称,这一结果使该模型跻身该机构测量的最强三款开放权重产品之列。它也让 Flash 接近若干激活规模大得多的领先系统。
这立即给通过模型规模竞争的提供商带来压力。评估智能体的买家通常更在意任务完成情况、延迟、托管要求和可控性,而非总参数量。
如果质量经得起独立测试,更小的激活模型可以改善这些经济性。每生成一个 token 所需的计算更少,可能支持更高吞吐量或更低的基础设施需求。
不过,MoE 效率并不等于易于部署。全部 2840 亿参数仍需存储,实施方案还必须在加速器之间高效调度专家权重。
因此,官方检查点仍超出了普通消费级 GPU 的承载范围。DeepSeek 自己的部署示例使用了一个包含四张 GB300 加速器的单节点。
社区量化版本可以进一步降低内存需求,但也引入了另一个变量。激进量化可能改变准确率、工具行为和长上下文性能。
开放权重发布仍为团队提供了封闭 API 无法提供的选择。组织可以将提示词保留在受控基础设施内、修改推理行为,或构建面向特定领域的适配方案。
他们还可以在私有评测集上检查输出,而无需将敏感材料发送给外部模型提供商。这对处理专有代码仓库的编程智能体尤为有用。
此次发布还从另一个角度向大型开放模型施压。它们的开发者现在必须说明,为何额外的激活计算能够带来更好的可靠性、知识能力或复杂智能体执行表现。
更大的模型仍可能是正确选择。DeepSeek 自己的结果显示,Flash 并未击败所有专有系统或所有比较对象。
关键在于性能差距。当较小模型接近较大竞争对手时,买家会问,剩余的差距是否值得额外的硬件投入和运营复杂度。
这一问题对于重复性智能体工作负载尤为重要。一个模型可能在单项任务中生成数千个 token、多次调用工具,并保留较长的历史记录。
微小的效率差异会在这些步骤中不断累积。因此,在智能体循环中,一款可信的 130 亿激活参数模型可能比在简短聊天机器人交互中更具意义。
50 分并未加冕一个普遍赢家。它改变了那些消耗更多资源、却提供相近测量智能水平的模型所面临的举证责任。
DeepSeek Flash 升级背后的机制
DeepSeek 在未将 0731 定位为新基础架构的情况下,提升了后训练、推理控制和智能体执行能力。
该公司称,Flash 0731 与早期的 V4 Flash DSpark 模型采用相同结构。这意味着,报告中的增益主要来自训练和行为优化。
后训练塑造预训练模型如何遵循指令、进行推理、使用工具和响应反馈。它无需改变底层参数量,就能显著改变实际表现。
DeepSeek 尚未公布完整的 0731 训练方案。现有证据展示了结果和运行时接口,但并未涵盖每一项数据集或优化决策。
此次发布引入三种推理强度设置:低、高和最高。这些设置控制模型在给出最终答案前进行多少思考。
这种控制对智能体产品很重要。简单的格式化请求不应消耗与代码仓库调试或多步骤研究任务相同的推理预算。
DeepSeek 建议对高要求工作使用高或最高强度。根据模型说明,这些模式下还支持最长 384,000 个 token 的输出长度。
较高的输出上限并不意味着每项任务都应接近这一规模。更长的推理可能增加延迟,也会增加模型偏离任务的机会。
该模型还保留了 V4 系列的 100 万 token 上下文窗口。上下文是一次交互中可用的材料,包括提示词、文件、工具结果和此前的推理。
DeepSeek 最初的技术报告描述了旨在更高效处理长上下文的混合注意力方法。注意力机制决定了哪些先前 token 会影响当前计算。
100 万 token 的窗口可容纳大型代码库、长工具调用轨迹或技术文档集合。不过,有效的上下文容量仍取决于检索准确性和指令保持能力。
该架构结合使用压缩稀疏注意力与高度压缩注意力。这些方法可减少处理长序列所需的计算与内存。
DeepSeek 还使用了流形约束超连接,即 mHC,以稳定网络中的信息流。该术语指的是一种有别于传统残差连接的结构化替代方案。
V4 训练栈还采用了 Muon 优化器。优化器控制模型参数在系统最小化误差的训练过程中如何变化。
这些架构选择来自最初的 V4 预览版。0731 的重点在于 DeepSeek 从这一既有基础中进一步挖掘出了多少性能。
DSpark 提供了另一种效率机制。它会预测多个可能的下一个 token,并让主网络成组接受或拒绝这些预测。
官方 vLLM 配置一次提出七个推测 token。被接受的预测可提升输出速度,同时不取代主模型的验证。
部署仍需匹配的软件支持。DeepSeek 为 vLLM 和 SGLang 提供了部署路径,这两者都是服务大语言模型的常用引擎。
此次发布未包含常规的 Jinja 聊天模板。DeepSeek 转而提供 Python 编码脚本,用于将 OpenAI 风格的消息转换为模型要求的输入格式。
这一选择为直接部署权重的团队增加了集成工作。API 客户则无需承担同样的底层格式化责任。
实际的核心观点很直接:DeepSeek 通过稀疏计算、低精度权重、推测解码和更强的后训练,让 Flash 的竞争力超越其激活规模。
这些组件各自都有先例。如果能在 DeepSeek 偏好的测试框架之外得到复现,它们的组合效果将为小型开放智能体提供更有力的架构依据。
DeepSeek 的智能体基准需要独立审计
已发布的结果令人印象深刻,但其最强的主张依赖于外部评估者尚未完全复现的测试条件。
DeepSeek 报告称,Flash 0731 在 Terminal-Bench 2.1 上取得了 82.7 分。根据公司的对比数据,预览版得分为 61.8,V4 Pro 预览版为 72.1。
Terminal-Bench 评估智能体在命令行环境中完成任务的能力。它比静态的多项选择测试更接近真实的软件开发工作,但其周边测试框架会影响结果。
据 DeepSeek 称,Flash 0731 在 NL2Repo 上也取得了 54.2 分。预览版得分为 39.4,而更大的 Pro 预览版为 38.5。
在 CyberGym 上,DeepSeek 报告称得分从 38.7 提升至 76.7。CyberGym 在受控环境中评估与网络安全相关的智能体行为。
最大的报告变化似乎出现在 DeepSWE 上。Flash 0731 得分为 54.4,而 Flash 预览版为 7.3,Pro 预览版为 12.8。
这些数字表明,编码智能体的性能发生了显著变化。但它们无法单独说明其中有多少提升来自模型本身、提示词、推理预算或测试框架。
DeepSeek 表示,其使用 DeepSeek Harness 的最小模式评估了公开的代码智能体任务。该框架尚未发布。
公司还采用了最高推理强度以及指定的采样配置。其他提供商若使用更短的推理预算或不同的工具模式,可能会得到不同结果。
另外两项评估 DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的内部测试集。外部研究人员目前无法查看其完整构成,也无法独立复现其分数。
DeepSeek 报告称,模型在全栈测试集上得分 68.7,在高难度测试集上得分 59.6。两项成绩都大幅超过预览版结果。
内部基准测试并不天然无效。它们可以测试公开排行榜忽略的困难行为。
限制在于透明度。读者无法评估数据污染、任务选择、评分一致性,或结果对公司首选智能体配置的敏感程度。
Artificial Analysis 提供了有价值的独立参照。其 50 分的成绩证实,这种提升并非只存在于 DeepSeek 自己的表格中。
但该指数同样是一个综合指标。模型可能通过改善与团队实际工作流并不匹配的任务而获得分数提升。
早期用户反馈体现了这一差距。一些开发者认为其编码和研究能力更强,另一些人则报告称,在任务信息不完整时,它会表现得冗长或作出自信猜测。
这些报告属于轶事性证据。它们可作为测试假设,而不能替代受控评估。
在智能体系统中,冗长度尤其值得关注。推理时间更长的模型可能实现更高准确率,但也会增加延迟并消耗更多输出 token。
自信地完成任务是另一项风险。智能体经常会遇到缺失字段、不可用凭证、含糊需求,或返回不完整数据的工具。
正确的行为可能是暂停并提问。针对持续行动优化的模型,反而可能编造一个值、选择不安全的默认选项,或提交不可逆操作。
因此,团队测试的不应只是最终答案准确率。评估还应衡量不必要的工具调用、错误后的恢复能力、虚构状态、权限处理和停止行为。
安全测试同样不可或缺。开放权重让防御者拥有更多控制权,但并不保证模型能抵御提示注入或不安全的工具使用。
正确的结论并不是 DeepSeek 的基准测试主张错误。现有证据支持其取得了有意义的改进,但改进幅度仍取决于具体工作负载。
开放权重将基准测试结果转化为部署问题
MIT 发布许可让开发者能够在自己的基础设施上检验 DeepSeek 的主张,这使 0731 比仅限 API 的排行榜条目更具实际影响。
闭源模型要求用户接受提供商的服务环境、更新节奏、数据保留条款和区域可用性。开放权重提供了更多部署选择。
企业可以在自身安全边界内托管 Flash 0731,也可以限制网络访问、记录工具调用,并应用组织特定的审批规则。
这些控制措施对编码智能体非常重要。强大的模型可能读取源文件、执行命令、修改代码仓库,或访问内部文档。
自托管并不会消除运营风险,而是将更多责任转移给运行模型的组织。
团队必须修补推理软件、保护端点、管理凭证,并监控生成的操作。同时,他们还需要为完整检查点提供足够的加速器内存和带宽。
167GB 的仓库体积只是起点。运行时内存还包括缓存、临时激活值、服务器开销以及所选上下文长度。
键值缓存存储生成后续 token 所需的信息,避免重新计算完整历史记录。极长上下文可能使该缓存成为主要的内存消耗来源。
DeepSeek 在其 vLLM 示例中建议支持 FP8 缓存,同时使用专家并行,将 MoE 专家分布在多个加速器上。
这一配置突出了其中的权衡。每个 token 仅激活 130 亿参数,但完整的专家池仍需要协调访问。
对许多团队而言,使用云端 API 仍然更简单。DeepSeek 的 model endpoint 通过现有服务提供 Flash,无需进行权重转换或管理集群。
该 API 现已同时支持熟悉的聊天补全请求和 Responses API 格式。Responses 风格的接口有助于在智能体应用中协调工具、状态和多步骤输出。
API 的便利性也带来了关于数据处理、服务可用性和区域合规性的独立问题。采购方应将这些问题与基准测试质量分开评估。
当这些限制不可接受时,开放部署提供了替代方案。它也让模型行为更容易固定在特定检查点上。
这种版本控制很重要,因为托管标识符可能在应用不知情的情况下发生变化。DeepSeek 已将现有 Flash 标识符更新为指向 0731。
静默的能力提升听起来很有帮助,但生产团队需要回归测试。更强的推理能力仍可能改变格式、工具选择、延迟或拒答行为。
自托管用户可以将预览版和 0731 检查点并排保留,并在迁移前使用完全相同的提示词比较两种模型。
MIT 许可还允许进行专门化适配。组织可以针对内部代码规范、结构化工作流或狭窄的专业领域对模型进行微调。
微调也会带来自己的验证负担。对熟悉任务的改进可能降低通用性,或削弱其他场景中的安全行为。
因此,此次发布扩大了控制权,而非消除了权衡。开发者获得了验证、修改和部署模型的能力,同时也承担更多技术责任。
对于企业采购方,这种控制力可能至关重要。对于较小团队,官方 API 或可信托管服务商仍将是更实际的选择。
无论采用哪种方式,开放权重都将抽象分数转化为可测试的产物。竞争对手必须以相当的可访问性、更清晰的优势或更有力的可靠性证据作出回应。
三个信号将决定 0731 能否守住其位置
独立智能体测试、生产环境中的 token 行为以及竞争对手的回应,将决定 DeepSeek Flash 0731 是否代表一次持久的转变。
第一个信号是在中立智能体框架中的复现情况。研究人员需要在不使用 DeepSeek 尚未发布框架的情况下,让 Flash 0731 运行 Terminal-Bench、代码仓库任务和工具使用测试套件。
若能匹配公司的数字,将强化这样一种主张:后训练改变了模型本身。若出现明显下降,则表明测试框架承担了更大部分的提升。
测试应公开提示词、工具定义、推理设置、重试策略和评分流程。当这些控制条件被隐藏时,智能体分数很难解读。
第二个信号是生产效率。团队应衡量每小时完成的任务数、生成 token 总数、错误恢复能力和人工干预情况。
如果模型需要异常冗长的推理轨迹,50 分的智能水平评分就不那么重要。若 Flash 能以比更大竞争者更少的资源完成工作,这一成绩就更有意义。
开发者还应追踪无依据的假设。一个会编造缺失信息的快速智能体,可能比一个会主动请求澄清的较慢模型带来更多审核工作。
延迟需要在短上下文和长上下文中分别测量。随着智能体历史记录扩展,MoE 路由、缓存增长和推测式解码的表现可能有所不同。
第三个信号来自竞争性开放模型开发者的回应。Zhipu AI、Moonshot AI、Alibaba 和其他实验室如今面临压力,需要提升更小型、面向智能体的模型。
直接回应可能通过更强的后训练、更高效的推理、更广泛的权重发布,或独立验证的智能体评估来实现。
如果竞争对手需要显著更大的活跃模型才能夺回领先地位,DeepSeek 的效率论点将更具说服力。如果更小的竞争模型迅速超越 0731,这一分数将显得只是暂时的。
专有模型提供商仍是重要的补充背景。它们最好的模型仍在一些复杂编码和智能体评估中领先,其中包括 DeepSeek 发布的多项对比。
开放路线不需要赢得每一项基准测试。它需要达到足够可靠的程度,使控制权和部署灵活性能够超过剩余的质量差距。
未来三个月内,采购方不应将单一排名视为采购决策。他们应根据真实的代码仓库、工具、权限和故障条件构建评估。
应使用具有已知答案的任务,同时也纳入模糊案例。衡量智能体是否能识别信息缺失,并在采取不安全操作前停止。
记录每个模型版本和运行时设置。同一个公开模型名称可能指向已变更的托管检查点,而本地量化版本也可能产生不同的行为。
DeepSeek Flash 0731 值得认真关注,因为独立测试支持其取得了重大改进。其开放权重让更深入的验证成为可能,而不只是理论上的可能。
下一步取决于开发者和评估者。请使用最困难、可重复的工作流测试该模型,比较完成后的结果,并发布足够细节让其他人复现结果。
如果这些测试确认其基准排名,较小的活跃开放模型将成为许多智能体系统可信的默认选择。如果未能确认,0731 将仍是一项引人注目的分数,但部署叙事会更为有限。


