DeepSeek V4 Pro vs Flash:已发布内容、变更以及华为芯片
- Aisha Washington

- 6月5日
- 讀畢需時 10 分鐘
DeepSeek V4 已发布。经过从 2 月到 2026 年 4 月下旬的三次延期,这家中国 AI 实验室于 4 月 24 日发布了其新模型,开放权重在 HuggingFace 和 ModelScope 上,提供实时 API 端点和一份技术报告。
此次发布包含两个不同版本:DeepSeek-V4-Pro 是旗舰模型,目标是达到顶级闭源性能;DeepSeek-V4-Flash 则是更快、更经济的替代方案,适合对延迟敏感或高吞吐量的工作负载。两者均支持 100 万 token 的上下文窗口,并提供思考模式和标准非思考模式。
在正式发布前有一个细节 DeepSeek 未在公告中提及:路透社和 The Information 在 4 月初报道称,V4 是在华为 Ascend 芯片上训练的,而非 Nvidia。Nvidia CEO Jensen Huang 称,如果属实,这对美国将是“可怕的结果”。这一线索与技术故事并行,值得单独理解。
DeepSeek 发布的内容:V4-Pro 和 V4-Flash
DeepSeek 的官方公告将 V4-Pro 描述为主要性能模型,并将 V4-Flash 定位为成本高效的对应版本。
DeepSeek-V4-Pro(旗舰版):
Agent 能力:在 Agentic Coding 基准测试中达到当前最佳开源水平
内部评估:团队报告称,V4-Pro 在非思考模式下表现优于 Sonnet 4.5,并接近 Opus 4.6,在思考模式下与 Opus 4.6 仍有差距
世界知识:领先所有开源模型,仅次于 Gemini-Pro-3.1 等闭源模型
数学、STEM 和竞技编程:超越所有公开评估的开源模型
DeepSeek-V4-Flash(快速且经济版本):
参数量更小,每个 token 的激活更低,从而实现更快推理和更低 API 成本
推理性能在大多数任务上接近 V4-Pro
在简单 agent 任务上与 V4-Pro 相当;在高难度任务上仍有差距
两个模型均支持思考模式(通过 reasoning_effort 参数接受 high 或 max)和非思考模式。对于复杂的 agent 工作流,DeepSeek 推荐使用思考模式并将强度设为 max。
API 模型名称:deepseek-v4-pro 和 deepseek-v4-flash。旧模型名称 deepseek-chat 和 deepseek-reasoner 目前分别映射到 V4-Flash 非思考模式和 V4-Flash 思考模式,并将于 2026 年 7 月 24 日弃用。
DeepSeek 已明确针对与主要 agent 框架(包括 Claude Code、OpenClaw、OpenCode 和 CodeBuddy)的集成进行了优化。文档和代码生成任务被指出为有显著改进的领域。
如何立即访问 DeepSeek V4
聊天界面:登录 chat.deepseek.com 或官方 DeepSeek 应用,选择最新 V4 模型。V4-Pro 和 V4-Flash 均可立即使用。
API:基础 URL 保持不变。将 model 参数更新为 deepseek-v4-pro 或 deepseek-v4-flash 即可访问新模型。两者均支持 OpenAI 的 ChatCompletions 接口和 Anthropic 的接口,最大上下文长度为 100 万 token。要启用思考模式,请在请求中添加 reasoning_effort: "high" 或 "max"。DeepSeek 建议在复杂 agent 任务中使用 max。
迁移说明:如果您的应用当前使用 deepseek-chat 或 deepseek-reasoner,它已分别指向 V4-Flash 非思考模式和 V4-Flash 思考模式。这些名称将于 2026 年 7 月 24 日停止工作。请立即切换到显式模型名称,以避免强制迁移。
开源权重:两个模型均可在 HuggingFace 的 deepseek-ai/DeepSeek-V4-Pro 和 ModelScope 上获取,用于本地部署。技术报告也与权重一起发布在 HuggingFace 上。
实现 100 万 token 上下文窗口的架构
标准 transformer 模型在处理长上下文时会遇到困难,因为注意力计算随序列长度呈二次方增长。更多 token 意味着指数级增加的计算和内存。大多数生产模型的实际上限历来远低于 100 万 token。
DeepSeek V4 引入了一种在 token 维度上进行压缩的新注意力机制,并结合 DSA(DeepSeek Sparse Attention),这是一种稀疏注意力设计,仅选择性地处理相关 token 关系,而非完整的交叉乘积。结果是 100 万 token 上下文成为所有官方 DeepSeek 服务的标准配置,而非带额外费用的能力层级。
DeepSeek 将该架构描述为在大幅降低计算和内存需求的同时,实现了长上下文能力的全球领先水平。实际影响是:整个代码库、长篇研究文档或扩展的对话历史可以放入单个上下文,而无需分块或检索 workaround。
FindSkill.ai 的技术分析指出,MoE 设计每个 token 推理仅激活总参数的一小部分,即使总模型容量扩展到数万亿,单请求计算量仍大致相当于 370 亿参数的稠密模型。稀疏注意力和稀疏参数激活的结合,使 V4 能够以预计远低于同等闭源产品的定价提供前沿级能力。
华为芯片问题
DeepSeek 的官方发布公告未提及硬件。华为的故事来自路透社和 The Information,他们在 4 月初报道称 V4 是为在华为 Ascend 950PR 芯片上运行而设计的,而非 Nvidia GPU。
如果属实,这一说法具有特定意义。自 2019 年以来,美国出口管制已限制 Nvidia 的先进芯片到达中国买家。该政策假设是通过限制获取这些模型所需的硬件来减缓中国 AI 发展。在中国硅片上训练的前沿级模型直接挑战了这一假设。
据 The Next Web报道,Huang 表示,如果 AI 模型“以与美国技术栈截然不同的方式优化”,中国“将变得更强大”,并将这种情况描述为对美国的“可怕结果”。South China Morning Post报道称,Huang 的担忧既涉及硬件,也涉及 CUDA:开发者十五年来一直依赖的软件生态系统。不再依赖 CUDA 的中国实验室也不再受 CUDA 供应链的限制。
TechWire Asia 的分析指出,中国 AI 实验室转向华为 Ascend 基础设施的更广泛模式已经在进行中,而 V4 代表了任何实验室在这一能力水平上部署该基础设施的最远进展。V4 是否在规模上证明了这一概念,或暴露了华为当前产品的局限性,将由未来几周出现的性能数据来回答。
竞争格局:V4 的定位
DeepSeek 自己的内部基准框架因其具体性而值得注意。团队将 V4-Pro 直接与 Claude Sonnet 4.5 和 Opus 4.6 进行比较,而不是引用抽象的排行榜位置,这表明他们针对这些特定模型进行了受控评估。
得出的结论是:V4-Pro 在内部 agent 编码评估中击败 Sonnet 4.5。它在非思考模式下接近 Opus 4.6,在思考模式下落后于 Opus 4.6。在开源领域,它在数学、STEM 和竞技编程上声称领先地位。在世界知识方面,它领先所有开源模型,仅次于 Gemini-Pro-3.1。
V4-Flash 是较小的变体,以大幅降低的成本和延迟提供接近 V4-Pro 的推理。对于大多数生产用例,基准差异的几个百分点不如吞吐量和价格重要,V4-Flash 可能是默认选择。
开源发布强化了成本故事。权重可在 HuggingFace 和 ModelScope 上以开放许可获取。能够在本地或自己的云基础设施上运行推理的开发者可以完全避免 API 定价,并完全控制模型的部署方式。对于在 DeepSeek API 之上构建工作流的团队,一个实际提示是:旧模型名称 deepseek-chat 和 deepseek-reasoner 现在默认指向 V4-Flash,并将于 2026 年 7 月 24 日完全弃用。现在更新到显式的 deepseek-v4-pro 或 deepseek-v4-flash 模型名称可避免日后意外迁移。
DeepSeek V4 与 V3:实际变化
对于已经在生产中使用 DeepSeek V3 的团队,实际问题不是“V4 是什么”,而是“具体改变了什么,是否值得迁移”。
上下文窗口:V3 提供了强大的长上下文性能,但 100 万 token 并非标准默认。V4 使 100 万 token 成为所有官方服务(包括 API)的基线。这改变了您在单次调用中无需分块即可传递的内容。
架构:V4 引入了 DSA(DeepSeek Sparse Attention),这是一种新的注意力机制,在计算注意力之前在 token 维度上进行压缩。V3 使用了不同的方法。实际结果是在长上下文下获得更好性能,同时每个 token 的计算需求更低,这使得 100 万 token 默认配置在保持竞争力的价格点成为可能。
模型结构:V3 是单一模型。V4 发布为两个:V4-Pro 用于最大能力,V4-Flash 用于速度和成本效率。使用 V3 处理高吞吐量工作负载的团队可能会发现 V4-Flash 是更接近的等效版本,而使用 V3 处理复杂推理或 agent 任务的团队应评估 V4-Pro。
Agent 能力:差距是最重大的升级。V4-Pro 的内部评估结果(团队将其与 Sonnet 4.5 和 Opus 4.6 进行比较)代表了相对于 V3 agent 性能的重大改进。如果您一直在使用 V3 进行 agentic coding 工作流并接受其局限性,值得直接测试 V4-Pro。
API 迁移:基础 URL 相同。旧模型名称(deepseek-chat、deepseek-reasoner)现在指向 V4-Flash,并将于 2026 年 7 月 24 日到期。V3 到 V4 的迁移目前对大多数应用是透明的,但显式模型名称切换是需要采取的行动项。
这对开发者和知识工作者意味着什么
V4 的开放权重发布和 100 万 token 上下文窗口是立即改变实际开发者工作流的两个特性。
上下文窗口意味着以前需要拆分、分块或检索增强管道的长文档现在可以放入单个提示中。包含数百个文件的代码库、完整的研究文档、长的项目日志:所有这些都适合。模型可以跨整个输入进行推理,而不是选定的窗口。
开源许可意味着模型可以本地运行,供处理无法发送到第三方服务器的数据的开发者使用:机密代码库、NDA 下的客户工作、敏感研究。预计量化版本可在消费级硬件上运行,使前沿级模型触手可及,适用于在气隙或隐私受限环境中工作的个人开发者。
本地部署解决了一个约束,但又带来了另一个约束。本地部署的 DeepSeek V4 可以处理您放入提示中的任何内容。它无法访问不在提示中的内容:上周的会议、六个月浏览积累的研究、使您的工作具有特定性的上下文。每个会话都从零开始。
这就是 remio's local-first knowledge base 解决前沿模型留下的空白的地方。remio 被动捕获您的工作上下文:浏览的网站、本地记录和转录的会议、本地文件索引。当 DeepSeek V4 会话开始时,可以从 remio 检索相关上下文并直接传递给模型,而无需将上下文或模型输出发送到云服务。
将本地部署的 DeepSeek V4 与 remio 配对的工作流可将所有内容保留在您的硬件上。remio 构建上下文。模型处理它。两个步骤都不会离开您的机器。
考虑一位研究人员,他花了六个月积累关于特定领域的论文、注释和会议笔记。新的 DeepSeek V4 会话对这段历史一无所知。但 remio 已本地索引了它。研究人员向 remio 查询相关上下文,将其传入具有 100 万 token 窗口的 V4-Pro 会话,并获得反映六个月积累知识的分析,而不是空白的响应。100 万上下文窗口使这在规模上变得实用:整个积累的记录,而不是摘要或选择,都可以进入提示。
接下来
独立的基准验证是立即的下一步。DeepSeek 的内部评估是一个有意义的信号,但不等同于在标准条件下发布的独立验证结果。社区将针对 Claude Opus 4.7、GPT-5 和 Gemini 使用的相同基准运行 V4-Pro 和 V4-Flash,结果将确认或修改定位。DeepSeek 选择的框架(直接与 Sonnet 4.5 和 Opus 4.6 比较,而不是抽象排行榜)是对测试这些主张的邀请。这种测试已经在进行中。
迁移现有工作流的开发者也有近期的截止日期需要管理。旧 API 模型名称 deepseek-chat 和 deepseek-reasoner 将于 2026 年 7 月 24 日到期。在此之前,它们路由到 V4-Flash,这意味着现有应用无需任何更改即可使用新模型,但切换到显式模型名称值得在弃用日期之前进行,以避免意外行为。
关于硬件问题:如果华为芯片训练的故事通过独立报道或 DeepSeek 的技术披露得到证实,它将成为长期更重要的发展。不是因为它对 V4 具体说了什么,而是因为它为不依赖 Nvidia 的前沿模型开发路径建立了概念验证。其他中国实验室将密切关注,答案对美国出口管制作为政策工具的轨迹很重要。
DeepSeek 已表示,100 万上下文将成为所有官方服务的前进基线。这为同一领域的每个实验室设定了新期望,并提高了 2026 年“生产就绪”长上下文能力的门槛。对于开源社区而言,前沿级性能、开放许可和 100 万上下文窗口的组合是六个月前无法获得的一揽子方案。采用速度将很快。
常见问题
DeepSeek V4-Pro 和 V4-Flash 有什么区别?
V4-Pro 是旗舰模型,针对最大能力进行了优化:复杂推理、agentic coding 以及质量比速度更重要的任务。V4-Flash 更小、更快,API 成本更低,在简单任务上与 V4-Pro 匹配,在大多数推理任务上接近它。对于高吞吐量或对延迟敏感的应用,V4-Flash 是默认选择。对于复杂的 agent 工作流,请使用启用思考模式的 V4-Pro。
DeepSeek V4 可以免费使用吗?
chat.deepseek.com 的聊天界面是免费的。API 使用按 token 计费。DeepSeek 在发布时尚未公布 V4-Pro 和 V4-Flash 的最终定价,但预计该模型将比 Claude Opus 或 GPT-5 等同等闭源产品便宜得多。开源权重可免费用于自托管部署。
deepseek-chat 在 V4 发布后还能用吗?
目前可以。模型名称 deepseek-chat 和 deepseek-reasoner 目前分别路由到 V4-Flash 非思考模式和 V4-Flash 思考模式。它们将于 2026 年 7 月 24 日弃用。请切换到 deepseek-v4-pro 或 deepseek-v4-flash 以明确并避免意外迁移。
我可以在本地运行 DeepSeek V4 吗?
可以。V4-Pro 和 V4-Flash 的开源权重均可在 HuggingFace 和 ModelScope 上获取。预计 INT4 或 INT8 精度的量化版本可在消费级硬件上运行。确切的硬件要求取决于量化级别和模型变体,但完整模型可在大多数个人开发者可访问的多 GPU 设置上运行。
DeepSeek V4 与 Claude 和 GPT-5 相比如何?
根据 DeepSeek 的内部评估,V4-Pro 击败 Claude Sonnet 4.5,在非思考模式下接近 Claude Opus 4.6,在思考模式下落后于 Claude Opus 4.6。在数学、STEM 和竞技编程方面,它超越所有开源模型,并接近闭源领域的前列。独立的基准验证正在进行中。成本差异显著:V4 预计每 token 比 Opus 级闭源模型便宜 10-50 倍。
DeepSeek V4 已上线、开源,并在团队测试的大多数任务上与领先模型竞争。硬件故事尚未从源头验证,但已影响了行业对此次发布的解读。未来几周独立基准显示的结果将决定内部数字是否成立,以及模型是否赢得 DeepSeek 团队为其声称的位置。
现在对开发者的实际建议:将 API 集成从弃用的模型名称更新为显式的 V4 标识符,评估 V4-Flash 用于高吞吐量工作负载(在转向 V4-Pro 之前),并关注 100 万上下文窗口这一改变单次 API 调用可完成内容的特性。具有此上下文长度的模型仍然足够新,以充分利用它们的工作流仍在设计中。
remio 帮助开发者和知识工作者构建前沿模型产生基于真实工作输出的上下文层。无论模型在云端还是在您自己的硬件上运行,上下文问题都是一样的。


