top of page

DeepSeek 的开放权重给封闭式 AI 提供商带来持续压力

9月4日
讀畢需時 15 分鐘

尽管实际情况远比标题所暗示的复杂,DeepSeek 还是凭借又一项关于自身影响力的宏大说法重返 google news。它真正的成就并非在每项基准测试中取代 OpenAI、Anthropic 或 Google 位居榜首,而是改变了开发者对公开可用模型能力的预期。

这一转变始于 2024 年 12 月发布的 DeepSeek-V3,并在 2025 年 1 月 DeepSeek-R1 推出后加速。该公司发布了可下载的模型权重,披露了重要训练方法,并允许广泛复用。能力出色的推理模型不再仅限于由少数美国提供商控制的付费界面。

最新报道将 DeepSeek 描绘为不断变化的全球模型市场中长期存在的挑战者。不过,其持久影响更应通过模仿者、部署选择和成本压力来衡量。这场竞争如今是开放权重与封闭访问之间的较量,而不只是中国与美国之间的竞争。

为什么 DeepSeek 再次登上 Google News

DeepSeek 仍具新闻价值,因为其模型发布改变了竞争对手、开发者和企业买家的行为。

直接的新闻由头来自 AI Magazine 一篇评估 DeepSeek 在全球开放模型市场地位的文章。其更广泛的论点并不陌生:中国开发者正在提供能力日益增强、可下载权重且定制限制更少的模型。

该文章中的一些说法需要谨慎看待。文中讨论了若干模型名称和基准排名,但缺乏足够独立且稳定的文档支持,难以进行可靠比较。模型排行榜的变化也很快,单一排名并不是判断长期影响力的坚实依据。

更有力的证据来自研究人员已经审视过的发布内容。DeepSeek 于 2024 年 12 月发布 V3,随后于 2025 年 1 月发布 R1。两者都提供了足够的技术材料,使外部开发者能够检查、运行、适配和测试系统的重要部分。

DeepSeek-V3 采用混合专家架构。该设计包含许多参数组,但每个 token 只激活其中一部分。该模型总参数量为 6710 亿,每个 token 处理期间会激活 370 亿参数。

根据该公司的 V3 technical report,训练消耗了 278.8 万 Nvidia H800 GPU 小时。DeepSeek 还表示训练使用了 14.8 万亿个 token。这些数字描述的是最终模型的训练过程,而非该项目背后所有研究成本。

这一区别很重要。公开讨论经常将 GPU 小时估算直接视为 DeepSeek 开发成本的完整核算,但这些数字从未支持这种解读。研究人员薪酬、失败的实验、数据工作、基础设施以及早期模型,都不在这项狭义计算之内。

R1 带来了第二个关注点。DeepSeek 使用强化学习——一种奖励期望输出的训练过程——来增强推理行为。该公司还发布了更小的蒸馏模型,将 R1 的部分推理行为迁移到更易于管理的架构中。

同行评审后的 R1 research paper 随后确认,DeepSeek-R1 和 R1-Zero 的权重以 MIT 许可证提供。论文还记录了该模型的强化学习过程和评估方法。这篇发表的论文为原始发布带来了仅靠发布公告无法提供的可信度。

“开源 AI”这一说法仍需限定。DeepSeek 发布了模型权重和有用的技术信息,但并未披露全部训练数据集或每一个生产组件。与完全开源相比,“开放权重”更准确地描述了这次发布。

这一区别并不会抹去此次发布的价值。可下载的权重让组织能够在不将提示词发送至 DeepSeek 托管服务的情况下运行模型。研究人员可以检查其行为,开发者也能为本地需求调整部署控制措施。

这种组合解释了为何该故事持续回到 google news。DeepSeek 已成为更广泛结构性转变的参照点。能力强大的开放模型如今已成为市场的预期组成部分,而不再只是封闭系统的遥远替代方案。

开放权重将模型访问转化为筹码

DeepSeek 最大的贡献,是将模型访问从研究优势转化为商业筹码。

在 R1 之前,许多企业将前沿推理能力视为从封闭提供商购买的一项服务。提供商控制权重、界面、使用政策和发布节奏。客户可以改变提示词和周边软件,却无法改变底层模型。

DeepSeek 展示了另一条路径。团队可以下载权重、选择推理提供商,并将敏感提示词保留在受控基础设施中。团队还可以微调模型、调整安全措施,或研究失败模式,而无需等待供应商许可。

这并不意味着自托管很简单。大型模型需要专用硬件、推理专业能力、监控和安全控制。对许多普通团队而言,完整的 DeepSeek 架构仍不适合直接运营。

较小的蒸馏版本降低了这一门槛。蒸馏将较大教师模型的行为迁移至较小的学生模型中。其结果通常是在牺牲部分能力的同时,降低内存和基础设施需求。

即便公司从未部署 DeepSeek,这种灵活性也会改变采购讨论。封闭提供商现在必须解释,为何其受控服务值得优先选择。可靠性、支持、安全性、工具能力和更优性能,都成为答案中不可或缺的部分。

压力同样传导至云平台和模型托管商。如果多个提供商能够提供兼容的开放权重服务,客户就拥有更大的议价空间。工作负载也更容易迁移,尽管基础设施和优化上的差异仍会带来转换成本。

开放模型同样改善了实验条件。初创公司可以在承诺使用某一供应商前比较多种架构。大学实验室可以研究模型行为,而无需完全依赖远程应用程序编程接口。

同样的访问能力支持在受监管或敏感场景中的私有部署。法务团队可以在自身环境中评估文件。工程团队可以分析内部代码,而不必将代码库发送到外部模型端点。

这些示例需要治理,而不仅仅是下载一个模型。团队仍须控制权限、评估输出,并追踪进入检索系统的信息。一个可搜索知识库可以帮助组织本地资料,但并不能消除模型风险。

因此,这一变化更多关乎议价能力,而非普遍自托管。DeepSeek 为买方提供了可信的备选方案,也为开发者提供了另一个实验基础。这两种结果都削弱了这样一种假设:先进推理能力必须留在某一家公司的云端。

Meta 此前已通过 Llama 将开放权重确立为重要的分发策略。Alibaba 的 Qwen 系列同样建立了庞大的国际开发者受众。Mistral 则展示了一家欧洲公司也可以通过可下载模型和商业服务参与竞争。

DeepSeek 为这一趋势增添了更有力的推理叙事。它的发布正值推理成为封闭提供商领先产品类别之时。让可比技术可供检查,进一步凸显了不同访问模式之间的对比。

这种对比解释了为何 DeepSeek 的影响超越了任何单一排行榜位置。一款模型可能在数月内落后,但其发布策略仍会持续影响市场。即使基准排名发生变化,开发者仍会记住这一新选择。

Google news 的报道常将这场竞争框定为一场只有一个赢家的竞赛。开放模型竞争并非如此运作。其价值在于增加可信选择的数量,并降低对单一界面的依赖。

高效训练挑战了“蛮力制胜”的假设

DeepSeek 表明,工程效率的重要性可以不亚于获得尽可能庞大的计算集群。

DeepSeek-V3 并未避免使用海量计算资源。数百万 GPU 小时仍代表着可观的基础设施投入。关键在于,DeepSeek 描述了多种旨在更高效利用这些基础设施的技术。

其混合专家设计会从规模更大的参数集合中,为每个 token 激活 370 亿参数。与激活全部参数相比,这降低了每个 token 所需的计算量。不过,完整模型在存储和协调方面仍然规模庞大。

DeepSeek 还使用了 Multi-head Latent Attention,这是一种压缩注意力机制所需信息的方法。注意力机制让模型能够权衡 token 之间的关系。降低其内存需求可以减少推理要求,尤其是在处理较长上下文时。

该公司使用 FP8 数值精度训练 V3。FP8 在计算的重要部分使用紧凑的八位数值。较低精度可提升速度和内存利用率,但开发者必须防止不稳定性和不可接受的精度损失。

另一项技术处理了机器间通信问题。大型混合专家模型必须在许多加速器之间路由信息。DeepSeek 表示,其将通信与计算重叠进行,从而减少硬件等待数据传输的时间。

这些方法之所以重要,是因为计算限制会塑造模型设计。美国出口管制限制了中国获取部分先进加速器的渠道。DeepSeek 表示使用了 Nvidia H800 处理器,该产品是在早期限制对华芯片销售的规定下设计的。

限制可能促进优化,但不会自动产生更好的系统。DeepSeek 受益于积累的研究成果、现有硬件、熟练工程师和早期模型世代。其结果不应被简单归因于资源稀缺。

该公司报告的 GPU 使用量也需要谨慎解读。它描述的是一次明确的训练运行,而非建立该组织能力所需的全部资源。该独立成本审查指出,早期研究和实验未被纳入计算。

这一限制并不会否定技术工作的价值。它改变的是比较方式。DeepSeek 提供的是高效最终训练过程的证据,而不是前沿模型开发几乎不需要资本的证明。

行业仍然吸收了其中的核心信息。更大的集群不再是通往竞争性成果的唯一可见路径。架构、训练目标、数值格式和基础设施协调,都可能改变每个加速器所产出的有效能力。

R1 将这一经验延伸到后训练阶段。强化学习会奖励遵循可验证推理模式的输出。DeepSeek-R1-Zero 在没有通常监督微调阶段的情况下起步,并在训练中形成了更长的推理行为。

DeepSeek 的论文描述了一个“顿悟时刻”(“aha moment”):一个中间模型开始更频繁地使用类似反思的语言。这一观察之所以受到关注,是因为这种行为是通过奖励驱动训练自然出现的。但这并不能证明模型具有人类般的理解能力或意识。

随后,R1 将强化学习与监督示例结合,以提升可读性和指令遵循能力。这种权衡十分重要。纯粹的奖励优化产生了有趣的推理模式,但用户仍需要易于理解且可控的回答。

这一机制从两方面给封闭实验室带来压力。它揭示了外部研究人员可以复现或质疑的技术选择;同时也促使竞争者说明,专有方法究竟能带来多少额外价值,足以证明限制访问的合理性。

这正是 DeepSeek 影响全球开放 AI 的最深层原因。它的论文为市场提供的是工程层面的论据,而不只是一个地缘政治符号。效率成为其他开发者可以研究的产品战略。

开放模型向 OpenAI、Anthropic 和 Google 施压

核心竞争在于开放权重与封闭访问之间:一方强调控制,另一方强调可移植性。

OpenAI、Anthropic 和 Google 仍保有显著优势。它们的托管产品将模型与安全系统、工具、多模态界面、企业管理和支持服务结合在一起。客户付费购买的是完整服务,而不只是 token 生成能力。

封闭式开发也可以简化更新流程。提供商无需客户自行管理新权重或重建基础设施,即可部署改进。它们还能在共享服务中监测滥用行为,并迅速响应新发现的漏洞。

开放权重提供了另一组优势。开发者可以更直接地检查模型行为,控制推理发生的位置,并自定义部署方式。组织也能保留特定模型版本,而不是被动接受提供商的每次更新。

没有哪一种路径适合所有工作负载。小型公司可能更偏好托管服务,因为基础设施工作会拖慢产品开发。政府机构则可能优先选择本地运行,因为其信息不能离开受控环境。

DeepSeek 提升了第二条路径的可信度。它无需超越所有封闭模型,只要表现足够出色,让组织在采购过程中认真考虑开放部署即可。

更广泛的统计数据也支持这一市场变化。Stanford 的 AI Index findings 显示,2023 年发布的基础模型中,有 65.7% 为开源模型;而这一比例在 2021 年仅为 33.3%。

同一份报告发现,美国机构在 2024 年产出了 40 个重要 AI 模型,中国则为 15 个。按这一指标衡量,美国仍处于领先地位。DeepSeek 改变了人们对差距的看法,但并未消除这一差距。

整个行业的模型使用成本也大幅下降。Stanford 报告称,在大约 18 个月内,查询达到 GPT-3.5 水平 MMLU 表现的模型成本下降了 280 倍以上。竞争和工程改进都推动了这一变化。

这些趋势给每一家封闭模型提供商都带来压力。若开放模型具备足够能力,高端服务就必须通过可靠性和完整工作流竞争。当更便宜或可控的模型能够完成实际任务时,单纯的基准测试领先地位就不再那么有说服力。

OpenAI 面临直接压力,因为 R1 瞄准了推理能力——这正是其最具差异化系统所关联的领域。Anthropic 必须通过安全性、代码质量和企业信任来捍卫 Claude。Google 则可以将 Gemini 与搜索、生产力软件、设备和云基础设施结合起来。

Meta 的处境更为复杂。Llama 帮助可下载权重成为常态,因此 DeepSeek 验证了 Meta 战略的一部分。但更优秀的开放替代方案同样会争夺开发者注意力、云端优化资源和下游应用。

Alibaba、Moonshot AI 以及其他中国实验室也面临类似压力。DeepSeek 并不只是挑战美国公司;它还提高了中国本土市场对模型文档、许可、推理能力和部署灵活性的期待。

这种竞争可以让开发者受益。当某个提供商调整政策或下架模型时,更强大的模型会带来替代选项。团队可以针对多个系统测试同一应用,降低对单一路线图的依赖。

不过,模型可移植性从来都不完整。提示词行为各不相同,工具调用格式存在差异,安全政策也会产生不同输出。评估应衡量应用的真实任务,而非将公开排行榜当作采购决策。

这也是为什么 Google 新闻式的叙事可能具有误导性。DeepSeek 的影响并非一次对美国 AI 的单点胜利,而是持续冲击这样一种观念:先进模型必须保持封闭,才具有商业价值。

开放权重并不保证透明度

DeepSeek 扩大了对模型权重的访问,但数据、安全、治理和整体开发资源等重大问题仍未得到解答。

这是核心权衡。可下载模型提供了有意义的技术自由,但并不会自动揭示训练数据如何收集、劳动力如何管理,或环境影响如何衡量。

Stanford 的 transparency assessment 区分了开放性与透明度。当模型权重可用时,模型是开放的;当公司披露开发和部署中的重要实践时,公司才是透明的。

该评估发现,整个模型行业都存在显著的信息缺口。它指出,训练数据、训练算力、下游使用和社会影响始终是不透明领域。DeepSeek 是受到批评的多家有影响力开发者之一。

这一细微差别对企业采用至关重要。公司可以在自己的网络内部托管 DeepSeek 权重,避免将数据发送至 DeepSeek 的服务器。这一选择减少了一类风险暴露,但无法解答所有合规问题。

组织仍需调查模型的训练来源、许可义务、输出风险和评估表现,还必须保护周边推理栈。配置不当的日志记录、检索或访问控制,都可能让本地模型泄露数据。

因此,托管部署和自托管部署呈现不同的风险特征。将提示词发送至外部服务会引发有关存储和司法管辖权的问题;在内部运行权重,则将更多安全责任转移给组织自身。

安全也是另一项关切。开放权重让研究人员能够检查和改进防护措施,有利于独立研究。同样的访问能力也可能让恶意用户移除限制,或将模型改造用于有害目的。

封闭系统并不会消除滥用。它们只是将执法集中在提供商内部,并限制外部审查。用户必须信任内部测试,而这类测试可能不会披露每一个数据集、事件或缓解措施。

DeepSeek-R1 的技术工作也暴露了行为层面的弱点。最早的强化学习模型产生的推理难以阅读,并且混用了多种语言。DeepSeek 增加监督数据,部分原因正是为了改善指令遵循和呈现效果。

基准测试实力还带来另一种不确定性。分数会随着提示词、推理设置和测试污染而变化。高分并不能保证模型在私有文档、实时软件系统或专业工作中表现可靠。

因此,开发者应在目标环境中复现评估。他们应衡量准确性、延迟、硬件需求、故障恢复和安全性。某个代码基准测试中的最佳模型,未必是面向客户助手的最安全选择。

有关训练数据的问题尤其敏感。DeepSeek 没有披露完整的数据集清单。批评者曾提出担忧,认为其他商业模型的输出是否影响了其训练,但公开证据尚未解决这一问题。

这一争议不应被表述为已被证实的不当行为。语言模型有时会错误识别自身,或重复训练材料中的品牌名称。仅凭此类输出,无法证明特定数据是如何进入模型的。

狭义的训练成本叙事也带来相关问题。DeepSeek 记录了 V3 各训练阶段的 GPU 小时数,但并未提供涵盖硬件采购、前期实验、人员和基础设施的完整审计预算。

开放权重也有现实限制。完整的 6710 亿参数系统需要可观的存储和分布式服务资源。每个 token 激活更少参数可以改善计算效率,但并不会让完整模型变得轻量。

更小的蒸馏模型可以在更易获得的硬件上运行,但它们在能力和行为上也与完整系统不同。将每一个衍生模型都称为“DeepSeek-R1”,可能会掩盖重要的部署差异。

恰当的结论应保持审慎。DeepSeek 为开发者提供了有价值的访问能力和有用的技术证据,但它并未仅靠许可方式解决透明度、安全或基础设施治理问题。

这一差异避免了两种夸大。DeepSeek 既不是封闭 AI 已经落败的证明,也不是空洞的营销故事。它是一位重要的开放权重竞争者,同时仍面临尚未解决的运营和治理问题。

DeepSeek 对全球开放 AI 的影响

DeepSeek 改变了人们的预期,其影响比改变模型提供商的最终排名更为决定性。

它的第一个持久影响是架构模仿。开发者可以研究混合专家路由、压缩注意力、低精度训练和强化学习方法。竞争实验室可以测试类似思路,或发布证据证明其他方法效果更好。

第二个影响是商业层面的。买家如今会问:某项工作负载是否真的需要高端封闭模型?这一问题会推动提供商提升质量、降低推理需求,或将模型与有价值的工具和支持服务捆绑。

第三个影响是地理层面的。DeepSeek 表明,尽管受到硬件限制,中国实验室仍能塑造国际技术议程。它也加强了市场对 Qwen 和其他中国开放权重模型家族的兴趣。

这种影响并不意味着国家层面的领导地位已经逆转。美国公司仍掌控主要云平台、加速器需求、广泛使用的应用程序以及许多领先模型。中国同样持续面临先进半导体技术的获取限制。

相反,市场变得更加多元。OpenAI、Anthropic 和 Google 通过整合服务竞争;Meta、DeepSeek、Alibaba、Mistral 以及其他开发者,则通过开放权重、托管访问和研究发布的组合竞争。

对软件团队而言,实际结果是模型组合更加广泛。应用可以将敏感工作路由至本地托管模型,并在其他场景使用托管系统;也可以在确定采用某一提供商前比较输出结果。

对企业买家而言,结果是拥有更强的议价能力,同时也需要开展更多评估工作。选择增加了,但责任也更多地转向客户。团队必须理解基础设施、治理和特定模型的失效模式。

知识工作者会间接受到这一变化影响。更多提供商可以将强大的推理能力嵌入搜索、文档分析、编码和笔记系统。不过,上下文和权限的质量往往比底层模型的公开排名更重要。

缺乏相关信息的模型仍会给出薄弱的答案。接入治理不善数据的模型,可能会向错误的用户泄露资料。这些问题需要深思熟虑的信息架构和知识融合,而不是又一个排行榜冠军。

研究人员将获得最直接、最明确的收益。他们可以检查训练权重,复现实验中的部分结果,并构建安全性改进方案。随后,同行评审便能质疑那些原本会被封闭实验室遮蔽的主张。

有三个信号可以表明 DeepSeek 的影响力是否仍在持续。

首先,关注未来 DeepSeek 发布内容背后是否存在可由独立团队复现的证据。技术报告应说明模型架构、训练资源、评测结果以及已知局限。扎实的文档将巩固 DeepSeek 作为工程参考的角色。

薄弱或延迟发布的文档则会削弱这种影响力。开发者只能复制他们能够理解和验证的内容。模型权重本身提供了访问途径,但详尽的方法说明才能带来更广泛的研究影响。

其次,关注封闭式提供商如何回应开放权重的推理模型。更低的使用门槛、更小且可部署的模型,以及更灵活的企业控制能力,都将表明竞争压力已传导至产品战略。

持续走向受限访问,并不会抹去 DeepSeek 的贡献。它只会表明,封闭式提供商认为可靠性和集成服务仍比可移植性更具差异化优势。

第三,关注企业在公开聊天机器人之外的采用情况。最有力的证据将来自编码、研究、内部搜索和受监管工作流中的可重复部署。下载量和社交关注度能反映兴趣,但持续的生产环境使用才能证明价值。

安全事件会削弱快速采用的理由。出乎意料的高基础设施要求,或在真实组织任务中的表现不佳,也同样如此。独立评测必须将模型能力与发布热度区分开来。

根本问题已不再是 DeepSeek 是否曾在 Google 新闻中赢得一时关注,而是开放权重是否持续改变组织采购、部署和治理先进 AI 的方式。

开发者应在自己的工作负载上检验这一主张。将开放模型与托管替代方案进行比较,衡量完整的运营负担,并记录每个系统的失效之处。下一阶段的竞争将在这些部署中决定,而非取决于一则标题或单项基准测试。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page