top of page

DeepSeek V4.1 Flash 吓坏了内存投资者,但抛售潮忽略了关键细节

7天前
讀畢需時 14 分鐘

DeepSeek V4.1 Flash 将一种模型内存的占用减少了 75%,两家主要内存供应商的股价随即下跌。9 月 11 日,Samsung Electronics 在首尔下跌 3.53%,SK Hynix 下跌 2.21%。这一反应暴露出 AI 基础设施交易中的新裂痕。

DeepSeek 表示,与上一代相比,其模型的全局键值缓存所需高带宽内存仅为原来的四分之一,持久化缓存存储需求也仅为原来的八分之一。对于增长叙事依赖 AI 内存需求快速扩张的芯片制造商而言,这些数字听起来颇具威胁。

但这一技术主张的范围,比市场反应所暗示的要窄得多。键值缓存,即 KV cache,会在模型推理过程中存储中间注意力数据。它只是 AI 系统整体内存需求的一部分。

这一差异界定了真正的较量。DeepSeek 正试图降低完成每单位 AI 工作所需的内存;Samsung 和 SK Hynix 则押注于 AI 总活动量的增长速度将足以抵消这类效率提升。

DeepSeek V4.1 Flash 改变了内存计算方式

DeepSeek 降低了每个上下文 token 对应的内存占用,直接瞄准长期运行 AI 应用的一项主要服务成本。

DeepSeek 于 9 月 10 日发布 V4.1 Flash,将其定位为新架构系列中规模最小的成员。公司通过 API 提供该模型,原生支持视觉理解,并公布了模型权重供外部检视。

该模型采用混合专家架构,为每个 token 将计算路由至更大网络中的选定部分。DeepSeek 列出的骨干参数总量为 5520 亿,但输入处理时仅激活 80 亿参数,输出生成时激活 160 亿参数。

这种选择性激活能够减少计算量,但本身并不能完全解释市场反应。投资者关注的是该模型对 KV cache 的处理方式。

传统 Transformer 会反复为已处理的 token 存储键和值表示。这些表示使模型能够生成下一个 token,而无需重新计算整段对话。随着提示词、文档、工具结果和对话变长,缓存也会不断扩大。

DeepSeek 报告称,其全局 KV cache 占用为每个 token 890 字节。其发布的模型公告称,这相当于 V4 Flash 所需高带宽内存的四分之一。

这一缩减对需要保留大量上下文的工作负载尤为重要。编程智能体、研究系统、客户服务应用和文档分析工具,都可能在单项任务中积累大量历史记录。

DeepSeek 还表示,持久化缓存所需的固态存储仅为前代的八分之一。持久化缓存让服务能够在加速器内存之外保留可复用上下文,并在后续请求中将其恢复。

公司并未将 V4.1 Flash 视为一项有限实验。它已开始通过主要 Flash API 标识提供该模型,并淘汰了两个较早的 Flash 版本。9 月 14 日,DeepSeek 还开始将 V4 Pro 请求路由至新模型,同时筹备 V4.1 Pro。

这种迁移为开发者提供的是实际部署,而不只是纸面架构。它也让推理效率直接呈现在比较延迟、吞吐量和资源需求的客户面前。

不过,DeepSeek 的基准测试和效率数据仍属于公司主张。独立运营商仍需在不同硬件、上下文长度、并发水平和应用模式下复现这些结果。

这一差异之所以重要,是因为缓存效率可能取决于服务实现方式。通过 DeepSeek 软件栈取得的结果,并不一定能原样迁移到每一种推理引擎。

即便如此,这次发布改变了讨论方向。模型开发者不再只围绕参数规模、基准分数或训练资源竞争,也开始比拼每次推理请求所消耗的实时内存能有多低。

这一转变解释了为何一家中国 AI 实验室的技术发布,能在一个交易时段内影响韩国半导体制造商的股价。

为什么 Samsung 和 SK Hynix 的投资者反应如此迅速

此次抛售反映的是市场对 AI 内存需求预期的脆弱性,而非 DeepSeek 已经终结半导体扩张周期的证据。

Samsung 和 SK Hynix 在全球内存市场占据核心地位。它们供应传统 DRAM、NAND 存储以及高带宽内存 HBM;HBM 将内存芯片置于 AI 处理器旁,以实现更快的数据传输。

HBM 之所以变得格外重要,是因为现代加速器处理数据的速度已超过普通内存系统的供给速度。因此,更多加速器部署、更大模型和更长上下文,均支撑了内存需求持续增长的预期。

DeepSeek V4.1 Flash 看似对这一逻辑的一部分提出了挑战。如果未来模型在处理每个 token 时使用的缓存内存大幅减少,云服务商或许能依靠同样的已安装 HBM 容量处理更多请求。

最初的股价反应十分明确。据对内存股反应的报道,9 月 11 日,Samsung 下跌 3.53%,SK Hynix 下跌 2.21%。

这两只股票此前已经历了一段异常波动的时期。两家公司都已成为投资者表达对 AI 资本开支、内存稀缺性和数据中心建设信心的标的。

SK Hynix 在此前的调整期间承受了足够压力,以至于宣布了一项大规模股票回购计划。据一篇8 月市场报道,此前两个月的下跌已抹去大量市值。

这一背景使该板块对新的效率主张异常敏感。投资者并非孤立地评估 DeepSeek,而是在重新审视内存公司预测中已经计入了多少乐观预期。

9 月 11 日的交易时段还伴随着科技股走弱、债券收益率上升和油价上涨。这些更广泛的因素令任何关于 DeepSeek 单独造成股价下跌的说法都变得复杂。

美国市场的不同反应,又提供了一个谨慎判断的理由。尽管 Micron Technology 和 SanDisk 都与内存或存储需求相关,但在随后一个纽约交易时段中,它们的股价几乎没有变化。

不同的交易时间和投资者群体可能产生不同反应。不过,这种分歧表明,此次发布并未立即形成关于内存需求将崩塌的全球共识。

相反,市场发出了关于持仓配置的警告。Samsung 和 SK Hynix 已成为高度显眼的 AI 基础设施需求代理标的,因此,关于内存使用量大幅降低的标题具有异常强大的影响力。

这种影响力可能超过底层技术变化的经济意义。某一类缓存减少 75%,并不等于服务器内存采购减少 75%。

投资者关注的是发展方向。DeepSeek 表明,在芯片制造商依据当前需求假设完成产能建设之前,模型架构就可能降低内存密度。

对于 Samsung 和 SK Hynix 而言,必须作出的回应并非立刻减产,而是更有力地说明:随着模型效率提升,未来内存增长将来自何处。

DeepSeek V4.1 Flash 的 KV Cache 只是系统的一部分

V4.1 Flash 压缩了临时推理状态,但并未消除模型权重、训练内存、网络需求或存储需求。

KV cache 最适合被理解为模型的工作笔记本。它保留从早先 token 中推导出的信息,使系统能够继续生成文本,而不必从头重读所有内容。

当上下文长度很长时,这本“笔记本”会变得昂贵。如果一个智能体读取大型软件代码库、查阅文档、调用多项工具并重新查看早期结果,其活跃上下文会迅速增长。

DeepSeek 通过多项架构变更来解决这一问题。其因果编码器—解码器结构会创建可由后续层复用的共享编码表示。

该模型还采用 Compressed Sparse Attention 2。稀疏注意力限制每次生成步骤中获得最多计算资源的早期 token,而不是平等对待每一个先前 token。

分层索引器会缩小供后续注意力层考量的候选 token 范围。跨层复用则减少网络中重复的缓存数据。

最后,DeepSeek 使用 FP4(一种四位数值格式)存储主要 KV 数据。较低精度能减少内存使用,但也可能引入准确性或实现层面的权衡,仍需测试。

这些技术结合在一起,形成了报告中的每个 token 890 字节全局缓存占用。DeepSeek 发布的模型文档将该数据描述为约为 V4 Flash 的四分之一。

该架构还将独立的滑动窗口信息保存在另一个内存池中。滑动窗口注意力聚焦于有限数量的最近 token,并在需要时重建部分状态。

这一细节说明,单一比例无法描述模型完整的硬件占用。全局缓存压缩并不意味着所有内存组件均以相同比例下降。

模型权重仍需存储和访问。输入处理仍会消耗内存和计算资源。生成输出仍需要解码能力,而生产服务还需要网络、冗余、监控和备用资源。

训练则构成另一项区别。KV cache 优化主要针对推理,即为用户运行已训练模型的过程。训练和后训练具有不同的内存需求。

Samsung 和 SK Hynix 向多个工作负载销售不止一种类型的内存。HBM 支持加速器,传统 DRAM 服务处理器和服务器,NAND 则存储模型、数据集、缓存状态和应用数据。

因此,V4.1 Flash 对每个请求所需的内存量构成压力,但并未消除该请求周围更广泛的数据基础设施。

对开发者而言,这项改进仍有实际影响。服务可以在耗尽加速器内存前支持更长的会话,或容纳更多并发用户。

编程助手可以保留更多文件和工具结果。研究智能体可以保留更多来源,而无需丢弃早先的上下文。客户支持系统则可以保存更长的对话和更多账户历史。

这些应用将模型效率与知识密集型 AI 工作流联系起来。即使缓存内存成本降低,设计可搜索知识库的团队仍需要可靠的检索和上下文选择机制。

最可能的结果并不只是更小的服务器。运营商可以将节省的资源用于提高并发量、延长上下文、降低延迟,或打造能力更强的应用。

正是这种灵活性,使该模型同时对内存需求构成威胁并提供支撑。

效率与需求正朝相反方向拉扯

DeepSeek 降低了单次推理工作负载所需的内存,但更低成本的推理可能催生足够多的新工作负载,从而推高总体内存消耗。

这正是市场反应背后的核心逆转。投资者将更高的内存效率解读为需求走弱,但效率提升也可能扩大一项技术的可应用范围。

一家原本无法证明持续运行 AI 智能体具有成本效益的公司,可能会在其运营要求降低后部署此类智能体。现有应用也可能服务更多用户、处理更长文档,或让智能体保持更长时间活跃。

每个请求的内存密集度都会降低,但请求数量和持续时间可能上升。

经济学家常用“反弹效应”来描述这一模式:当一种资源的使用成本降低时,消费增长可能足以抵消部分效率节约。

AI 推理具备多项支持这种反弹的条件。需求仍受到运营成本、响应速度、上下文限制,以及服务可支持的并发用户数量制约。

降低缓存内存需求会缓解这些限制。它让运营商能够在相同硬件上容纳更多活跃序列,并降低保留长上下文的成本。

智能体应用会放大这一效应,因为它们会为一次用户请求生成大量模型交互。智能体在给出最终答案前,可能需要规划、搜索、阅读、写作、测试和修订。

如果每一步的成本下降,开发者就可以允许更多步骤。因此,更好的经济性可能推高生成 token 总量和内存活动。

DeepSeek 自身的部署选择也指向这一方向。该公司正以 V4.1 Flash 替换现有旗舰路由,而不是将其限定在低流量任务中。

其对图像的支持也拓宽了潜在使用场景。多模态输入可能形成更长的编码上下文,并带来涉及截图、扫描文档、图表和界面分析的新工作负载。

看多内存供应商的逻辑建立在这种规模效应之上。如果行业生成的 token、会话、智能体和多模态请求大幅增加,那么每个 token 的消耗降低就没有那么重要。

近期经营业绩显示了供应商为何仍坚持这一观点。Samsung 报告第二季度营业利润创纪录,SK Hynix 则报告季度营收创纪录。

Samsung 表示,AI 基础设施和智能体 AI 的采用正在支撑内存需求。其高管还表示,需求增长快于产量增长。

根据一份行业财报报道,两家公司合计生产约三分之二的全球存储芯片。它们的敞口远不止于某一家模型供应商。

看空逻辑依然可信。如果架构改进的普及速度快于 AI 使用量增长,云运营商就可以推迟采购产能。

如果多家实验室在同一投资周期内分别压缩缓存、减少活跃参数并提高加速器利用率,这一风险将更加严重。

云公司还可以将模型效率与更优调度、量化、批处理以及专用推理芯片相结合。累积节省的影响会大于任何单项技术。

结果取决于两个速度。第一个是每单位 AI 工作所需内存的下降速度。第二个是用户和应用所需 AI 工作总量的增长速度。

DeepSeek V4.1 Flash 为市场提供了关于第一个速度的证据,但并未确定第二个速度。

模型宣称仍未得到证明的内容

DeepSeek 已公布一条可信的技术路径,但外部测试必须确定其节省效果能否在真实生产环境中成立。

这一醒目的比例比较的是 V4.1 Flash 与较早的 DeepSeek 模型。它并非针对所有竞争架构或部署栈的通用比较。

这一限制很重要,因为运营商使用不同的上下文长度、批量大小、加速器、存储层级和延迟目标。在一种配置中测得的内存节省,可能会在其他环境中以不同方式体现。

890 字节这一数字还涵盖全局 KV 缓存。生产部署可能还需要为局部注意力状态、权重、激活缓冲区、请求批处理、推测解码和系统开销配置额外内存。

DeepSeek 报告的基准测试结果显示,V4.1 Flash 在多项任务上领先于 V4 Pro。在独立测试者复现这些结果前,它们应被视为公司自身的说法。

压缩还带来另一个问题。FP4 缓存存储使用更少位数,但降低精度可能在某些条件下影响输出。

关键测试不在于模型能否通过简短基准测试。运营商需要了解,它能否在长对话、重度检索任务、代码修改、视觉输入和重复工具调用中保持可靠性。

稀疏注意力还会选择性判断哪些较早 token 值得纳入考量。这可以提升效率,但当关键细节位于长上下文很靠前的位置时,可能出现失误。

法律助手可能遗漏早期文件中的某项条款。编码智能体可能忽略在修改前数千个 token 已设定的约束。研究工作流可能丢失附在较早来源上的限定条件。

这类问题可能在汇总基准得分中仍然不可见。开发者需要任务级评估,以衡量长会话中的召回率、一致性和错误恢复能力。

部署可及性构成另一项限制。V4.1 Flash 每个 token 只激活其网络的一部分,但完整模型仍然很大。

评估本地或私有部署的组织必须考虑模型存储、内存带宽、路由开销和兼容的推理软件。较小的 KV 缓存并不会自动让完整系统变得轻量。

开放权重有助于检查和实验,但并不保证每个运营商都能在容易获得的硬件上复现 DeepSeek 的服务经济性。

市场比较也仍不完整。Samsung 和 SK Hynix 尚未将客户需求的实质性变化归因于 V4.1 Flash。两家公司的客户也未公开宣布因该模型而大幅削减采购。

因此,9 月 11 日的股价下跌反映的是投资者解读,而非已确认的订单取消。

其他因素此前已在给这些股票施压。投资者一直质疑大规模制造投资、AI 支出的未来回报、日益增长的中国竞争,以及高企内存价格的可持续性。

这一更广泛的背景阻碍了得出清晰的因果结论。DeepSeek 在一个不稳定时期提出了鲜明的新叙事,交易员在商业证据出现前便作出反应。

这种反应值得关注,因为预期会先于营收变化。然而,它不应被误认为内存需求已经转向的证据。

DeepSeek 对阵 AI 内存扩张周期

主要较量并不是 DeepSeek 对阵 Samsung 或 SK Hynix,而是模型效率对阵 AI 消费增长速度。

Samsung 和 SK Hynix 并不直接与 DeepSeek 竞争。实验室构建并提供模型,而制造商则供应整个计算栈中使用的内存。

但它们的利益仍朝着不同方向拉动。DeepSeek 受益于以更少基础设施资源交付更多模型输出。内存供应商则受益于总容量需求持续扩张。

这种关系类似于强度与规模之间的拔河。效率降低每项任务的内存强度,采用则提高任务规模。

如果 V4.1 Flash 激励整个行业采用类似设计,强度下降可能加速。竞争实验室会有理由压缩缓存,因为长上下文推理仍然昂贵。

云服务商同样欢迎这一变化。更高的请求密度可提高利用率,并减少完成特定工作负载所需的加速器数量。

这些节省可能通过扩大访问范围而非降低支出传递给用户。供应商可能用相同的硬件预算支持更多客户或更复杂的智能体。

内存公司可以从这种扩张中受益,尤其是在新使用场景需要增加推理集群时。如果客户在部署时间安排上获得更多灵活性,它们也可能失去议价优势。

需求结构与总量同样重要。缓存压缩在推理期间直接影响 HBM 容量,而持久缓存缩减会影响 SSD 需求。

不断增长的模型权重、训练集群、多模态输入和企业数据,则可能从相反方向推动需求。HBM、DRAM 和 NAND 产品之间的平衡可能不同。

Samsung 的多元化业务使其覆盖多种内存类别。SK Hynix 则尤其与 HBM 领先地位及 AI 加速器供应链密切相关。

这种差异可能影响它们对模型效率的敏感度。降低实时加速器内存需求的变化,对以 HBM 为核心的投资逻辑影响可能大于对更广泛半导体营收的影响。

来自 Micron 的竞争又增加了一层复杂性。当客户需求可能因软件创新而变化时,三家供应商都必须决定以多快速度扩张昂贵产能。

建设太少可能错失供应短缺,建设太多则可能在架构改进降低内存强度后造成供给过剩。

DeepSeek 让这一规划问题变得更加困难。芯片制造商必须预测 AI 使用量,以及模型设计者降低硬件需求的速度。

此次发布也让人想起 2025 年初市场对 DeepSeek R1 的反应。该模型引发了疑问:具备竞争力的 AI 系统是否需要西方市场假设的那种支出水平。

基础设施需求随后依然强劲,这提醒人们不要把一个高效模型视为硬件增长的终点。但这并不保证这次会出现同样的结果。

V4.1 Flash 更直接瞄准推理经济性。随着已部署应用在训练结束后持续生成工作负载,推理正变得愈发重要。

这使新模型即使不改变当前订单也仍具相关性。它提供了一个具体案例:在大规模产能扩张期间,软件正在攻克硬件瓶颈。

投资者如今需要将两方面结合起来评估。内存需求不能只通过计算模型、加速器或数据中心数量来预测,架构效率也应纳入计算。

三个信号将决定此次抛售是否合理

接下来的证据必须来自生产部署、内存公司的订单和竞争模型架构,而不是又一个股价波动日。

第一个信号是对 V4.1 Flash 的独立测试。开发者应关注其在长上下文、高并发、视觉输入和智能体工作流中的内存使用情况。

复现出的节省效果将增强 DeepSeek 的论点。明显的准确性损失、软件限制或隐藏的内存开销则会削弱它。

最有价值的评估将比较完整系统,而不是孤立的缓存数字。它们应包括吞吐量、延迟、输出质量、存储需求和加速器利用率。

第二个信号是 Samsung、SK Hynix 和主要云运营商报告的客户行为。订单承诺、库存变化、产能计划和 HBM 出货指引,将揭示效率是否正在影响采购。

与推理优化相关的采购削减或延迟将支持看空解读。持续短缺和扩大长期协议则将有利于规模增长的逻辑。

季度业绩比单日抛售更重要,因为它们能显示客户是否改变了支出计划。管理层评论仍应结合出货量和库存情况进行检验。

第三个信号是,竞争对手的模型开发商是否采用类似的缓存压缩技术。单一模型可能仍是例外。共同的架构方向则可能重塑基础设施规划。

如果其他实验室报告了类似的降幅且未牺牲质量,那么相当一部分推理工作负载的内存密集度可能会下降。

反之,如果竞争对手转而追求更大的活跃模型、更长的上下文或更重的多模态处理,其额外需求可能会抵消 DeepSeek 的节省效果。

DeepSeek V4.1 Flash 已经带来了一个持久影响:它迫使投资者将模型架构视为内存预测中的一个变量。

9月11日的抛售并非对 Samsung 或 SK Hynix 的定论,而是市场为一种技术可能性提前标出的价格。

开发者和企业买家现在应测试其实际影响。更低的缓存使用量是否会带来更可靠、更经济的智能体,还是仅仅将成本转移到技术栈的其他环节?

在接下来的一个季度里,关注独立部署、供应商订单和竞争对手发布的产品。这些信号将表明,DeepSeek 的内存效率究竟会减少芯片需求,还是会释放足够多的 AI 使用量,从而扩大芯片需求。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page