top of page

DeepSeek V4 即将到来:1 万亿参数、开源,并在华为芯片上运行

当 DeepSeek V3 于 2024 年 12 月发布时,它在单个交易日内抹去了 Nvidia 约 5890 亿美元的市值,这是美国股市历史上单日市值损失最大的一次。现在 deepseek v4 即将到来,其模型规模更大,预估成本更低,且硬件堆栈完全绕过了 Nvidia。此次发布最具定义性的数字不是一万亿参数,而是 520 万美元与 10 亿美元之间的差距。

据报道,DeepSeek V4 拥有约一万亿总参数、一百万 token 的上下文窗口、原生支持文本、图像和视频的多模态能力,并采用 Apache 2.0 开源许可,据称全部在华为 Ascend 950PR 芯片上训练,而非任何 Nvidia GPU。这句话中的每一个元素在 2026 年都具有地缘政治意义。技术规格之下有两条主线:美国 AI 公司已正式指控 DeepSeek 使用 24,000 个虚假账户大规模获取其模型输出;如果 V4 在中国国产硬件上实现前沿性能,美国出口管制(限制 GPU 出口可减缓中国 AI 发展)的核心前提将面临可能无法通过的公开压力测试。

本文将拆解 V4 据称包含的内容、成本方程为何持续令投资者紧张、如何看待蒸馏指控、支撑万亿参数模型却无需万亿倍运行成本的技术架构、它与 GPT-5.4、Claude Opus 4.6 和 Llama 4 的对比,以及在独立基准发布前仍未解答的问题。

一个万亿参数模型、两次延期,以及一个非常刻意的硬件选择

DeepSeek V4 最早于 2026 年 1 月在中国科技媒体曝光,当时包括 Qbitai reported 在内的多家媒体预计将于农历新年发布。2 月 17 日的窗口期已过,却未见正式发布。3 月初,TechNode reported 称消息人士预计“本周”发布,该日期同样过去。随后在 3 月 9 日,一个未经宣布的“V4 Lite”版本(约 2000 亿参数)短暂出现在 DeepSeek 平台上,证实核心架构真实存在,尽管完整模型尚未就绪。

反复延期只有一个工程原因:将如此规模的模型从 Nvidia 的 CUDA 软件生态完整迁移至华为的 CANN(Compute Architecture for Neural Networks)框架。 至 4 月 3 日,Reuters citing The Information reported 称 deepseek v4 预计“数周内”发布,并将在华为 Ascend 芯片上运行。DeepSeek 创始人梁文锋据称向内部联系人表示,目标发布窗口为 4 月下旬。

这一硬件决定是刻意的,而非单纯务实。据多份报告,DeepSeek 在 V4 开发期间给予华为(而非 Nvidia)独家早期硬件访问权限。鉴于 Nvidia H100 和 Blackwell 系列均被禁止出口中国,在中国合法可用的最先进 Nvidia 芯片是 H20。选择围绕华为 Ascend 950PR 构建,传递出清晰的信号。为完成 CUDA 到 CANN 迁移而经历的数月延期,实际上是战略独立声明的代价。

这一信号已带动供应链变化。据报道,阿里巴巴、字节跳动和腾讯已预订数十万颗 Ascend 950PR 芯片,旨在模型发布后立即通过其云平台大规模销售推理服务。如此规模的预订并非基于猜测,而是反映出对发布即将到来且具备商业可行性的信心。

$5.2 Million vs. $1 Billion: The Cost Equation That Keeps Silicon Valley Up at Night

DeepSeek V3's official technical report 披露,在 H800 GPU 上以每 GPU 小时 2 美元的成本训练,训练费用约为 557.6 万美元,大约是训练 GPT-4 预估 1 亿美元的 5% 至 6%。deepseek v4 的预估训练成本据报道约为 520 万美元。该数字未经任何主要来源验证,应视为近似值,但与 V3 已确认的数字在方向上一致。

[Stanford FSI](https://cyber.fsi.stanford.edu/publication/taking-stock-deepseek-shock) framed the implication precisely: "DeepSeek's shock doesn't just mean a Chinese company outperforming American rivals; it challenges the assumption that advanced AI necessarily requires massive investment, and that assumption is the valuation basis of the current AI ecosystem." 如果 V4 在一万亿参数规模上维持这一成本效率,该假设不仅会动摇,更会彻底破裂。

影响向外扩散。对企业买家而言,报道的 API 定价约为每百万输入 token 0.30 美元、每百万输出 token 0.50 美元,这将使 deepseek v4 的价格约为 GPT-5.4 的二十分之一。三个具体的部署场景将具体说明这一价格差异在实践中的意义。

第一:大规模代码审查。一百万 token 的上下文窗口可一次性摄入整个代码库(包括 Linux 内核这样规模的代码库)。目前尚无开源模型能在这一参数规模下达到此上下文长度。第二:主权 AI 部署。无法使用美国云基础设施的司法管辖区内的政府机构和金融机构,可在华为服务器上完全运行 V4,无需依赖美国供应商,这一能力在全球受监管行业中具有明显吸引力。第三:成本驱动的规模。当推理定价下降二十倍时,在 GPT-5.4 定价下经济上边缘化的应用在 V4 定价下将变得可行,从而大幅扩大 AI 原生产品的可及市场。

Jensen Huang 据称已就 DeepSeek 和华为对 Nvidia 市场地位的联合竞争威胁发出警告。这一警告与 Nvidia 股价在 2025 年 1 月已表达的内容相呼应:V3 发布时 Nvidia 单日下跌约 17%,市值损失约 5890 亿美元。V4 的发布将检验这一反应是一次性的冲击,还是反复出现的模式。

24,000 Fake Accounts, 16 Million Conversations, and a Question No One Can Fully Answer

2026 年 2 月,Anthropic's congressional filing 称 DeepSeek、Moonshot AI 和 MiniMax 合计使用约 24,000 个虚假账户与 Claude 进行了超过 1600 万次交互,具体目的是大规模获取模型输出。OpenAI 提交了平行文件,指控 DeepSeek“继续尝试通过新的混淆方法蒸馏 OpenAI 和其他领先美国前沿实验室模型”。Anthropic 将此活动定性为国家安全威胁,警告威权政府可能将前沿 AI 能力用于进攻性网络行动和大规模监控。

为了理解指控的内容,有必要了解蒸馏的含义。 Distillation (knowledge distillation) in AI refers to the practice of using a stronger model's outputs to train a weaker model, so the weaker model learns to approximate the stronger model's reasoning style and knowledge at a fraction of the original training cost. Large-scale distillation attacks (running millions of carefully designed queries through a competitor's API and using the responses as training data) can close capability gaps cheaply and quickly. The accusation isn't about copying code. It's about using one model's cognition to shape another model's development.

但在将指控视为 V4 能力的解释之前,该指控值得三个反向框架。

反向框架一:没有人证明蒸馏是 V4 性能的来源。 指控针对的是与 V3 时代相关的活动。V4 的实际训练数据构成未知。即使蒸馏攻击完全如描述般发生,训练和组织一个万亿参数 MoE 模型、将其完全迁移到新的硬件和软件堆栈,并实现稳定的大规模推理,这些工程挑战并非蒸馏所能解释。将 DeepSeek 的整个能力轨迹归因于窃取的输出,需要接受一个先于证据的结论。

反向框架二:指控的时机值得审视。 Anthropic 和 OpenAI 同时向立法者提交文件,此时国会正在积极辩论 AI 芯片出口立法。美国 AI 公司在制定不利于中国竞争对手的监管框架方面有直接商业利益。这并不意味着基础指控是虚假的,但明确指出文件在安全关切框架之外的政策倡导维度是值得的。

反向框架三:开源战略与纯粹依赖蒸馏在结构上不一致。 如果 DeepSeek 的能力主要来自获取的模型输出,理性的商业举措应是保持权重专有并最大化竞争优势。然而,DeepSeek 一直以宽松许可发布完整权重并公布详细技术报告。V3 技术报告中的架构创新(Multi-head Latent Attention (MLA)、无辅助损失负载均衡、多 token 预测目标)已由研究人员独立审查并验证,发现真正的工程新颖性。一个单纯蒸馏竞争对手输出的组织不会投入精力撰写和发布可验证的技术报告。

根本的法律问题是真实且未解决的:在一个通过商业 API 大规模查询并将响应用作训练数据在技术上很简单 的时代,竞争性研究与知识产权侵权之间的界限在哪里?这一法律框架尚不存在。将指控视为已定判决会掩盖整个 AI 行业最终必须解决的真正模糊性。

Why a 1-Trillion-Parameter Model Doesn't Cost 1 Trillion Times More to Run

一万亿这个数字听起来在计算上难以承受,除非你理解 Mixture-of-Experts (MoE) 架构——一种将模型划分为专业化子网络的设计,任何给定输入仅激活其中一小部分。According to reports, the model carries approximately one trillion total parameters, but each token processed activates only around 37 billion of them, roughly 3.7% of the full model. 因此,每个 token 的实际计算成本更接近运行一个 370 亿参数的稠密模型,而非万亿参数模型。

直接对比 V3 和 V4 说明了这一设计理念。V3 拥有 6710 亿总参数,每个 token 激活 370 亿。V4 据报道将总知识容量翻倍至约一万亿参数,同时保持每个 token 的激活参数数仍为 370 亿。V4 拥有更多存储知识,但每个 token 的推理成本基本相同。效率提升来自扩展知识库,而非拓宽计算路径。

使这成为可能的硬件(华为 Ascend 950PR)比其在中国以外的低调形象所暗示的更具能力。According to TrendForce,其 FP4(4 位浮点)计算吞吐量达到 1.56 PFLOPS,约为 H20 FP4 性能的 2.8 倍。它配备 112GB HBM(高带宽内存),是 H20 容量的 1.16 倍,内存带宽约为每秒 1.4 TB。华为宣称多模态推理吞吐量比 H20 快约 60%。权衡在于功耗:600 瓦,而 H20 约为 400 瓦。

从软件角度看,V4 在历史上意义重大之处在于它是首个在其堆栈中完全没有 Nvidia CUDA 依赖的 DeepSeek 模型。 CANN (Compute Architecture for Neural Networks) is Huawei's proprietary software framework, analogous to CUDA in its role as the layer between AI software and hardware. The months of engineering work DeepSeek, Huawei, and Cambricon put into this migration produced something that didn't exist before: a fully functional, frontier-class Chinese AI technology stack, from chip to model, with no American software components. Whether or not V4's benchmarks match the reported numbers, that stack is real.

How DeepSeek V4 Stacks Up Against GPT-5.4, Claude Opus 4.6, and Llama 4

2026 年 4 月前沿 AI 模型的竞争格局在编码基准上高度集中。Claude Opus 4.6 在 SWE-bench Verified(标准编码评估)上得分为 80.8%。GPT-5.4 约为 80.0%。Gemini 3.1 Pro 为 80.6%。Deepseek v4 据报道在同一基准上得分为 80% 至 85%,这将使其处于或超越当前前沿,但这些数字来自内部测试,尚未独立验证。此处引用的所有 V4 基准数据均为据报道,等待外部评估。

  • GPT-5.4: ~80.0% SWE-bench, multimodal, closed-source, high API pricing

  • Claude Opus 4.6: 80.8% SWE-bench, text-primary, closed-source, high API pricing

  • Gemini 3.1 Pro: 80.6% SWE-bench, text + image + audio + video, closed-source, mid API pricing

  • DeepSeek V4 (reportedly): ~80–85% SWE-bench, native multimodal (text/image/video), Apache 2.0, ~$0.30/M tokens input

开源 AI 模型的竞争格局是最具决定性的比较。 在公开许可模型中,当前领域包括 Meta 的 Llama 4(提供千万 token 上下文窗口,但对超过 7 亿用户的部署有商业限制)和 Google 的 Gemma 4(最高 310 亿参数,注重效率而非原始能力)。DeepSeek 的开源模型历史一直推动参数上限:V3 在发布时以 6710 亿参数已是最大的完全开放权重模型。V4 以一万亿参数将大幅扩大这一领先优势。

Apache 2.0 许可的区别对企业采用的影响往往被低估。Apache 2.0 包含 MIT 所没有的明确专利许可保护,不要求衍生作品开源(与 GPL 不同),且无用户规模限制。企业在 Apache 2.0 下集成 deepseek 开源模型,可部署给任意数量用户、将其纳入商业产品并进行修改,而无需承担分享更改的义务,这一法律姿态是 Llama 4 许可在超过 7 亿用户门槛后无法完全复制的。

DeepSeek 从 V2 到 V4 的轨迹遵循一致模式:每一代以相当或更低的训练成本完成更多工作,同时扩展能力范围。V2 引入了 Multi-head Latent Attention。V3 在规模上验证了 370 亿激活参数 MoE 效率模型。R1 证明在同一基础架构上进行推理专用微调可登顶 App Store。V4 据报道在 V3 基础上将总知识库扩展 50%,同时完成 Nvidia 到华为的迁移。轨迹的一致性可能比任何单一基准数字都更重要。

Three Questions That Will Define What DeepSeek V4 Actually Means

第一个也是最直接的问题:独立基准能否复制内部数字?V3 的技术报告经受住了同行评审,其架构声明被外部研究人员验证,其性能声明在第三方评估下成立。V4 在更大规模、更新的硬件和新的软件堆栈上运行。Hugging Face 社区、MLPerf 和独立学术实验室将在模型公开发布后数日内开始运行评估。这些结果(而非内部数据)将决定 V4 是否属于前沿。

第二个问题涉及基础设施:华为的 Ascend 生态系统能否处理该模型将吸引的推理流量? When V3 launched, DeepSeek's API experienced repeated instability under demand. V4 is larger, runs on newer hardware that has not been stress-tested at global scale, and will attract substantially more attention than V3 given the geopolitical context. The Chinese cloud providers (Alibaba, Tencent, ByteDance) who pre-ordered Ascend 950PR units will serve as the distributed inference backbone. Whether that architecture holds under peak load is an open question that will be answered in the first 72 hours after launch.

第三个问题在结构上最为重要:V4 在中国国产硬件上的性能是否迫使美国出口管制逻辑进行修订?The CSIS has analyzed this directly,指出如果 DeepSeek V4 在 Ascend 950PR 上实现前沿性能,它将从根本上挑战限制 GPU 出口可有效减缓中国 AI 发展的前提。EUISS 将 DeepSeek 的出现描述为“AI 多极化的开端”。如果芯片限制策略已被证明无效,美国立法者将面临压力,要么升级管制(针对华为硬件和 CANN 软件),要么完全重新思考框架。两条路径都不简单。

对于关注这一领域的开发者和企业,实际指导很明确:关注 DeepSeek 的 GitHub 和 Hugging Face 页面以获取正式发布。当模型发布时,优先参考独立评估报告而非官方基准,这并非出于不信任,而是因为独立验证是前沿声明成为确认事实的方式。Apache 2.0 许可意味着你可以在发布前开始规划集成而无需法律风险。一百万 token 上下文窗口、原生多模态以及无商业使用限制的组合,将使某些工作流类别(长文档分析、多模态 RAG、大型代码库审查)在无论 SWE-bench 最终数字如何的情况下都变得更加易于获取。

如果你在思考 deepseek v4 等模型对知识工作者和开发者组织 AI 辅助工作流实际意味着什么,架构问题与基准同样重要。一百万 token 上下文窗口和原生多模态改变了为推理大型异构信息集构建工具的可能性。有关开源 AI 模型能力如何转化为个人和团队知识基础设施的实用视角,AI-native second brain 系统指南涵盖了这些架构转变(更长上下文、更低成本推理、开放权重)如何重塑知识管理层实际能做的事情。V3 开启了关于前沿 AI 是否需要十亿美元预算的对话。V4 即将把这一对话延伸至硬件独立性。答案将出现在基准中,而非新闻稿中。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page