top of page

据报道,DeepSeek 的 1GW 数据中心计划考验其效率优先战略

据报道,DeepSeek 计划在内蒙古建设一座一吉瓦数据中心,这让一则 Google News 标题直接挑战了其以效率优先著称的声誉。拟建园区将使这家中国 AI 开发商跻身于追求电厂级基础设施的公司之列。

DeepSeek 尚未公开确认该计划。项目报道称,该公司希望在乌兰察布建设该设施,并于 2027 年末或 2028 年初启动部分运营。这些细节来自未具名的项目知情人士。

这一区别至关重要。一个计划、一栋完成送电的建筑,以及一个满负荷运行的 AI 集群,代表的是三个截然不同的里程碑。现有报道未披露选址、购电协议、建设合作伙伴、芯片供应商或最终部署时间表。

尽管如此,报道中的规模改变了围绕 DeepSeek 的讨论。它的崛起曾表明,更好的模型架构可以减少与规模更大的美国实验室竞争所需的计算资源。一座一吉瓦园区则表明,效率并未消除对更多基础设施的需求。

因此,核心张力并非 DeepSeek 与某一家美国竞争对手之间的较量,而是 DeepSeek 的效率叙事与训练和服务日益强大模型所需的实体条件之间的矛盾。

OpenAI 的 Stargate 项目已将超大型园区纳入其公开战略。DeepSeek 似乎代表了相反的路径:更高效地利用受限硬件。新报道显示,两条路径最终都会汇聚到同样稀缺的资源上:电力、加速器、内存、冷却、网络和资本。

据报道,DeepSeek 正在规划什么

标题中的说法很具体,但支撑它的证据仍然有限。

据报道,DeepSeek 正在考虑在中国内蒙古乌兰察布建设一座容量为一吉瓦的数据中心。一吉瓦等于 1,000 兆瓦,不过报道中的园区容量并不一定意味着始终保持这一水平的计算需求。

据报道,该项目将分阶段投产。原始报道引用的消息人士预计,部分运营将在 2027 年末或 2028 年初左右启动。DeepSeek 尚未发布任何公开声明确认这两个目标中的任何一个。

对于如此大型的设施而言,分阶段交付很常见。开发商可以分别完成变电站、数据大厅、冷却系统和计算集群。因此,一个园区可能已部分投入运营,而其大部分规划容量仍未完工。

“规划”一词也涵盖范围广泛的活动。它可能指早期选址研究、电力谈判、初步工程设计,或一项资金已落实的建设计划。当前报道并未明确 DeepSeek 处于这一范围中的哪个阶段。

更早的证据支持了更广义的选址说法。据招聘报道,DeepSeek 于 2026 年 4 月在内蒙古发布了数据中心职位招聘。招聘岗位包括一名工程师和一名交付经理,工作内容涉及服务器、网络、建设、合规和最终运营。

这些招聘广告标志着 DeepSeek 首次公开披露数据中心所在地。它们表明该公司希望获得当地的运营专业能力。然而,仅凭两个职位空缺,尚不足以证明存在一个一吉瓦项目。

交付岗位尤其值得关注,因为据报道,其职责从项目启动一直延伸至建设和调试。这一职责范围表明,DeepSeek 正在准备管理实体基础设施,而不只是租用现有集群。

乌兰察布是开展此类工作的合理地点。中国一直推动在西部和北部地区开展大型计算项目,因为这些地区能够提供土地、能源资源和更凉爽的气候。乌兰察布也位于北京周边需求中心的辐射范围内。

凉爽的条件可在一年中的部分时段降低机械制冷需求。这一优势有助于提高运营效率,但并不能免除对工程化热管理系统的需求。高密度加速器机架产生的集中热量,单靠环境温度无法处理。

该地点也符合中国“东数西算”倡议。该国家计划鼓励企业将适合的工作负载部署在西部地区,同时服务更东部的经济中心。

大型 AI 训练任务比交互式应用能够容忍更长的距离。训练过程会在较长时间内处理海量数据集,而面向用户的推理通常受益于更短的网络路径。推理是指模型训练完成后生成答案的过程。

DeepSeek 可以将内蒙古园区用于训练、批处理或对延迟不太敏感的推理任务。它也可以将该设施与更靠近用户的小型部署连接起来。具体工作负载组合尚未披露。

因此,一吉瓦这一数字应被视为报道中的容量上限或园区目标。它并不能证明 DeepSeek 已拥有足够多的加速器来消耗这些电力。

为什么 Google News 的报道此刻重要

Google News 的报道之所以重要,是因为 DeepSeek 正从模型设计扩展到掌控整个计算栈。

DeepSeek 在 2025 年初发布了一系列在显著硬件约束下仍可与领先系统竞争的模型后,获得了国际关注。其技术工作强调高效训练、选择性参数激活以及加速器之间的优化通信。

这一战略挑战了一项常见假设。许多投资者和科技公司曾将更大规模的集群视为通往更强模型的最明确路径。DeepSeek 表明,工程选择可以改变投入、计算资源与模型性能之间的关系。

效率并不意味着计算变得不再必要。它意味着 DeepSeek 能从可用硬件中提取更多有效工作。当需求增长时,这些节省可支持更多用户、更长上下文、更大规模实验以及更频繁的模型更新。

这正是该报道核心所在的反弹效应。每项任务的资源使用量降低,可能会减少总体需求,但也可能让更多任务在经济上变得可行。AI 开发商可能将节省下来的容量投入额外的推理或训练。

DeepSeek 自身的模型文档说明了这一区别为何重要。其 V3 技术报告描述了一种混合专家架构,其中每个 token 仅激活模型的一部分。与每个 token 都激活全部参数相比,这种设计可减少计算量。

此类技术改善了单个工作负载的经济性。但它们并未为 DeepSeek 希望运行的工作负载数量设定固定上限。更多用户以及能力更强的推理模式可以迅速消耗容量。

模型开发商还需要基础设施来支持一次重点训练运行之外的活动,包括数据准备、实验、评估、安全测试、微调和重复的检查点运行。产品服务在发布后还会带来持续的推理需求。

据报道,DeepSeek 正在研发定制推理芯片,这进一步强化了这一解读。芯片研发报道称,该项目面向推理而非训练。

面向推理的设计可以围绕可预测的模型操作优化硬件。这种做法能够减少对通用加速器的依赖,并提高高吞吐量服务的能效。但它同样需要时间、制造渠道、内存、软件和部署专业能力。

同时建设芯片和数据中心,将使 DeepSeek 能够更好地控制这些组件之间的协同方式。该公司可以将模型架构、编译器、网络、内存和冷却作为一个整体系统进行优化。

这种纵向整合在最大的 AI 平台中很常见。Google 为其服务开发 tensor processing units。Amazon 和 Microsoft 在使用 Nvidia 和 AMD 供应芯片的同时,也采用内部加速器。Meta 也已为特定 AI 工作负载开发硬件。

DeepSeek 面临不同的约束。美国出口管制限制了中国获得最先进美国 AI 处理器的渠道。该公司必须围绕不确定的供应、国产替代方案以及监管可能发生的变化进行规划。

专用园区并不能解决这一问题。空置的数据大厅无法训练模型。只有当 DeepSeek 能够确保充足的加速器、高带宽内存、网络硬件和电气设备时,该项目才具有战略价值。

这就是为什么 Google News 的标题比一则普通建设新闻更具分量。它将此前相互独立的四个信号联系起来:本地招聘、模型扩展、芯片研发,以及据报道达到吉瓦级的园区。

这些信号共同描绘出一家寻求基础设施自主性的公司。但它们也让 DeepSeek 面临仅靠软件研究不会带来的建设、供应链和执行风险。

效率与吉瓦级规模并不矛盾

DeepSeek 据报道的扩张并不能否定高效 AI,但它确实否定了“效率会自动降低总体基础设施需求”的观点。

表面上的矛盾源于两种不同的衡量方式。模型效率描述的是完成特定训练或推理任务所需的资源。园区规模描述的则是面向众多任务和用户可用的总体基础设施。

一家公司可以改善前一种指标,同时扩大后一种指标。如果每次查询所需的计算工作更少,DeepSeek 就能用同样的硬件服务更多查询。它还可以在不按比例增加每次请求成本的情况下,支持更长的回答或更复杂的推理。

因此,更高的效率可能使扩张更具吸引力。一块得到充分利用的加速器能产出更多结果,从而改善新增另一块加速器的商业逻辑。数十年来,同样的逻辑一直塑造着计算市场。

报道中的项目也需要置于背景中理解。一吉瓦已成为 AI 基础设施竞赛中的战略单位。它不再仅仅描述一栋非常大的建筑,而是指拥有多处设施和专门供电战略的园区。

OpenAI 的 Stargate 计划提供了最清晰的对比。该项目讨论过数个能够支持一吉瓦或更高容量的园区。OpenAI 将这些设施定位为训练和服务未来模型的基础。

DeepSeek 最初似乎削弱了这一论点。其高效模型让一些观察人士质疑,行业是否需要如此庞大的设施。然而,OpenAI CEO Sam Altman 曾表示,更便宜的计算不会消除对大型集群的需求。

据报道的内蒙古项目支持了 Altman 论点的一部分。即便是一家以效率闻名的实验室,显然也看到了吉瓦级容量的战略价值。不过,这并不能验证每一座拟建 AI 园区或每一项预测。

DeepSeek 和 OpenAI 仍走在不同的机构发展路径上。OpenAI 高度依赖基础设施供应商、芯片企业和资金支持方的合作关系。DeepSeek 则以更低调的姿态运营,公开披露的商业合作关系也更少。

两者的模型分发策略也不同。DeepSeek 在宽松条款下发布了模型权重,允许第三方独立运行部分系统。OpenAI 则主要通过托管产品和应用程序接口提供访问。

这些差异会影响推理发生的位置。可下载模型会将部分需求分散到外部云服务、企业和本地机器上。集中托管的模型则会将更多需求集中在提供商自身的基础设施内。

不过,开放模型分发并不会消除第一方需求。用户仍会出于便利性、可靠性、速度和托管式扩展能力选择托管服务。开发者也需要内部集群来打造下一代可下载模型。

核心矛盾仍是承诺与现实之间的落差。承诺是,算法效率提升将削弱模型进步与基础设施规模之间的绑定关系。现实则是,竞争压力会促使企业将每一份效率收益都转化为更强的能力。

这并不意味着效率没有意义。高效系统可以降低固定工作负载下的用电量,并扩大 AI 的可及性。它们也可能决定哪些企业能在供应受限的环境中实现盈利运营。

这种区分对企业采购方尤为重要。模型的训练经历几乎无法说明其在实际使用时可提供多少容量。采购方关心的是延迟、正常运行时间、速率限制、数据治理、部署选项以及可预测的性能。

大型园区可能会增强 DeepSeek 为高流量应用提供服务的能力。但它也可能让公司更依赖单一区域、复杂的能源安排,以及可能在建设完成前就已过时的硬件。

对开发者而言,这一报道中的项目表明,模型架构与基础设施设计正变得密不可分。软件优化越来越依赖其底层精确的内存、网络和加速器配置。

对知识工作者而言,直接影响则没那么明显。更多基础设施可以提升响应速度和可用性,但并不保证答案更好。模型质量仍取决于训练数据、后训练、评估和产品设计。

评估 AI 系统的团队,应独立于任何单一模型提供商保存自己的源材料和决策记录。可检索的 AI knowledge base 能在模型、限制或托管安排发生变化时,保留组织语境的可用性。

芯片问题是该项目最严峻的约束

电力可以支撑一个吉瓦级园区,但加速器决定这些电力能否转化为有效的 AI 算力。

现有报道没有指出 DeepSeek 计划使用的硬件。这一遗漏至关重要,因为中国 AI 开发商正受到影响先进 Nvidia 处理器和半导体制造设备的管制。

一名美国高级官员在 2 月称,DeepSeek 使用 Nvidia Blackwell 芯片训练了一款近期模型。根据出口管制报道,该官员还表示,这些处理器可能集中部署在内蒙古。

DeepSeek 没有证实这一说法。该官员没有披露政府如何获得这项信息,也没有说明这些芯片据称如何进入中国。Nvidia 拒绝就这一具体说法发表评论。

因此,这一说法应与已确认的招聘信息和被报道的园区计划分开看待。它提出了一个严肃问题,但并未提供经核实的硬件清单。

DeepSeek 曾公开记录过早期使用 Nvidia H800 处理器的情况。这些芯片是在华盛顿于 2023 年末收紧管制之前为中国市场设计的。该公司也已为 Huawei 的 Ascend 硬件调整软件。

两条路径都无法提供完全确定性。获取先进 Nvidia 产品取决于出口政策及其执行情况。国产加速器则必须克服制造、高带宽内存、软件兼容性和大规模集群可靠性方面的限制。

高带宽内存是一种部署在加速器附近的专用内存,使模型能够以极高速度移动数据。即使处理器具备足够的算术性能,大型 AI 系统仍可能受到内存瓶颈限制。

网络是另一项约束。在数千个加速器上进行训练,需要快速且协调的通信。缓慢的连接或不可靠的软件,可能让昂贵的处理器处于等待状态,而非进行计算。

一个吉瓦级园区会放大这些挑战。当通信和故障率成为瓶颈时,增加处理器并不会带来线性性能增长。更大的集群需要先进的调度、存储、监控和恢复系统。

DeepSeek 拥有与这一问题相关的技术经验。其先前研究聚焦于通信效率,以及限制处理器之间必须传输的信息量的方法。随着集群规模扩大,这些优化的价值会更高。

不过,定制推理芯片不会立即解决训练约束。推理硬件负责基于已有模型生成输出,而训练硬件负责执行创建或更新模型所需的重复计算。

DeepSeek 可以拆分这些角色。它可能使用国产或进口加速器进行训练,同时部署定制芯片用于生产推理。它也可能在同一园区内混用多个处理器系列。

混合环境带来灵活性,但也会提高软件成本。工程师必须为每个平台维护编译器、内核、模型格式和监控工具。不同工作负载之间的性能可能存在显著差异。

制造环节带来另一项不确定性。设计一款处理器并不保证能获得有竞争力的代工能力或充足的内存供应。芯片项目还需要封装、测试、固件、驱动程序和可靠的规模化生产。

时间节点在这里也很重要。计划在 2027 年末或 2028 年初部分投入运营的园区,需要围绕更早作出的硬件决策进行设计。然而,AI 处理器和机架设计可能在更短周期内发生变化。

DeepSeek 必须要么尽早作出承诺,要么设计灵活的基础设施。灵活性可能增加建设复杂度,因为不同机架需要不同的供电、冷却和网络安排。

液冷很可能是高密度现代加速器的一项要求。这项技术通过计算组件附近的液体传递热量,而非完全依赖在机房中输送冷空气。

报道没有说明 DeepSeek 是否计划采用液冷、direct-to-chip 系统或其他设计,也没有披露预计机架密度、用水需求或备用发电配置。

在缺少这些细节的情况下,读者不应将一吉瓦直接换算为处理器数量。设施用电还包括冷却、存储、网络、照明、转换损耗和其他系统。硬件选择也会进一步改变每兆瓦可交付的计算产出。

一吉瓦说法并不能证明什么

该项目仍是一项被报道的雄心,而非融资、建设、硬件供应或运营能力的证明。

第一个不确定性是 DeepSeek 是否已获得选址。大型园区需要大量土地、光纤线路、水资源或替代冷却资源、电网连接和环境审批。该项目尚未公开确认任何一项。

第二个是电力。一吉瓦连接所需的不只是有利的区域能源条件。公用事业公司还必须研究输电容量、建设变电站、采购变压器,并安排分阶段送电。

电力设备通常有很长的制造交付周期。即使土地和融资到位,电网并网也可能成为关键路径。目前报道没有披露与公用事业公司或能源供应商达成的协议。

第三个不确定性是资金。报道称,DeepSeek 在多年依赖与创始人梁文锋的 High-Flyer 组织相关支持后,已探索外部投资。不过,园区预算和融资结构仍未披露。

不应仅根据电力规模推断出任何可信的成本估算。项目成本会随土地、能源基础设施、处理器选择、冷却设计、建设标准以及每个阶段包含的容量而变化。

第四个不确定性是利用率。已建成的建筑外壳可能没有足够的处理器填满。部分运营的园区可能多年只消耗其规划容量的一小部分。

这一区别已经使其他吉瓦级项目的讨论变得复杂。7 月有报道称,中国 AI 公司 Z.ai 已开始运营一座使用国产芯片的一吉瓦设施中的一部分。有关其位置、已启用容量和硬件供应商的公开细节仍然有限。

第五个不确定性涉及 2027 年或 2028 年的时间表。数据中心进度可能因审批、供电交付、设备短缺、设计变更或融资问题而延后。DeepSeek 尚未公开确认该日期。

第六个涉及环境表现。内蒙古拥有丰富的可再生能源资源,但仅凭区域位置不足以确定项目的电力结构。实际与用电相关的排放取决于逐小时发电情况和电网条件。

凉爽天气可以改善电力使用效率,即比较设施总能耗与计算设备能耗的指标。但这无法回答有关用水、备用发电机、土地利用或输电建设的问题。

集中部署容量也会带来韧性风险。大型区域园区可以简化运营并受益于共享基础设施,但也会增加对当地停电、光纤中断、极端天气和监管行动的暴露。

DeepSeek 可以通过冗余输电线路、分布式服务和次级区域来管理这一风险。目前尚未有报道披露这些安排。

还存在市场风险。模型和处理器设计可能会在第一阶段启用前发生变化。若未来系统需要不同的冷却或网络方案,为一种架构优化的基础设施计划可能会失去效率。

开放模型的采用使需求更难预测。当第三方部署 DeepSeek 的模型时,DeepSeek 可以获得影响力,但这些部署不一定会在 DeepSeek 自身设施中产生工作负载。

相反,受欢迎的托管服务可能突然带来推理需求。消费级应用可能产生不可预测的峰值,而企业客户则期待服务承诺和稳定容量。

持怀疑态度的解读很直接。DeepSeek 可能正在探索一个雄心勃勃的园区,但尚未解决其芯片、电力或融资依赖问题。公开证据不足以证明该项目正在建设中。

积极的解读同样清晰。招聘在一吉瓦报道出现前数月就已开始,而该公司据称正在推进自研推理芯片。这些举措构成了一项连贯的战略,即进一步掌控自身基础设施。

两种解读都没有足够证据成为结论。恰当的描述仍应是“据报道正在规划”。

Google News 标题之后值得关注的三个信号

故事的下一阶段取决于可验证的承诺,而不是重复同一个一吉瓦数字的更多报道。

第一个信号是披露选址或电力协议。明确的地块、公用事业合作伙伴、变电站规划或监管申报文件,将使该项目超越笼统的规划阶段。

电力相关文件也将澄清“一吉瓦”的具体含义。它可能指最终园区目标、预留的电网接入容量,或首期建设计划的容量。

如果 DeepSeek 或当地主管部门确认分阶段送电,项目时间表的可信度将提高。如果迟迟没有这类文件出现,对 2027 年或 2028 年目标的信心应当减弱。

第二个信号是硬件披露。DeepSeek 无需公布完整清单,但技术文件可以揭示其支持的加速器、网络系统以及自研芯片的进展。

一款可投入生产的推理芯片,将增强这样一种判断:DeepSeek 能以围绕自家模型设计的硬件填补相当大的算力容量。芯片延期则会让该公司更依赖 Huawei,并继续面临 Nvidia 获取渠道的不确定性。

读者还应关注后续的模型报告。技术说明通常会标明用于训练和推理的处理器系列。这些信息能够显示,国产硬件究竟只是承担部分工作负载,还是已支撑完整部署。

第三个信号是实际建设和运营的证据。承包商公告、设备订单、卫星影像、地方申报文件,或持续招聘运营岗位,都将比匿名的规划消息提供更有力的确认。

运营里程碑比仪式性公告更重要。真正有意义的检验在于:建筑是否获得供电、机架是否到位、集群是否通过验收测试,以及生产流量是否开始运行。

这些信号应按这个顺序出现。选址和电力承诺确立可行性。硬件披露确立计算价值。运营证据则确立执行能力。

缺少其中一个信号,并不能立即证明项目不存在。DeepSeek 历来很少披露其运营情况。但保密同样意味着,外部读者应采用更高的验证标准。

通过 Google News 跟进这一事件时,这一点尤其重要。聚合后的标题可能让多篇基于同一原始报道的文章,看起来像是相互独立的确认。读者应将每一项说法追溯至最早可识别的来源。

更大的判断其实已经更清晰了。DeepSeek 的效率工作并未终结基础设施竞赛。它改变的是,开发者能从每单位基础设施中提取多少能力。

如果乌兰察布园区取得进展,DeepSeek 将迈入吉瓦时代,同时坚持认为架构仍然重要。这种组合会给美国 AI 实验室和中国硬件供应商都带来压力。

美国开发者将失去这样一种简单论断:超大规模园区是其战略区别于 DeepSeek 的标志。中国芯片厂商则将面对一位要求严苛的客户:该客户可能在大规模测试国产替代方案的同时,开发自己的推理芯片。

开发者应关注新增容量是否提升模型可用性、上下文处理能力和推理速度。企业买家则应关注部署地区、数据控制、可靠性和硬件透明度。

其他所有人都应关注已宣布容量与实际可用算力之间的差距。只有当电力输送到能够可靠运行有用工作负载的处理器时,一吉瓦才具有实际意义。

Google News 的标题开启了这项调查,而非为其画上句号。决定性问题不再是 DeepSeek 是否重视效率或规模,而是该公司能否在严苛的硬件与供应约束下兼顾二者。

到 2027 年底,最有力的证据不会是另一个匿名数字,而将是一套正在运行的集群、一项有据可查的芯片战略,以及能够将基础设施转化为可靠 AI 输出的服务。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page