中国算力大会揭示 AI 产能与有效产出之间的差距
中国算力大会公布的数据显示出明显错配:仅有七个中国省份的算力容量投用率超过 75%。
这一发现出现在中国报告基础设施实现历史性增长之际。截至 2026 年 6 月,中国以 FP16 精度计的智能算力达到 2,185 EFLOPS,同比增长 177%。但装机容量本身,并不能说明一个集群实际完成了多少有价值的 AI 工作。
如今塑造中国 AI 基础设施市场的矛盾,已不再是稀缺与充裕之争,而是标称容量与有效产出之争。云服务商、电信运营商、独立数据中心公司和模型开发商,都必须证明其昂贵的集群能够持续高效运转。
中国算力大会于 9 月 11 日至 9 月 13 日在河北廊坊举行。发言者反复将重点从硬件部署转向工作负载调度、网络性能、能源供应和运营可靠性。
这种变化给仍将规模作为主要卖点的每一家运营商带来压力。一座设施即使拥有数千颗加速器,如果其软件、网络、冷却系统或客户需求管道无法让它们保持高效运行,依然可能表现不佳。
大会将利用率置于扩张之前
中国的基础设施里程碑,也暴露出仅统计加速器、机架或理论运算能力的局限。
大会于 9 月 12 日在廊坊开幕,议程聚焦于建设和运营全国算力网络。主办方此前确认,整个活动将持续三天。
会议议程涵盖基础设施、核心技术、行业应用,以及区域算力资源之间的协同。这一范围反映出市场正走出首轮建设周期。
核心数据依然可观。2026 年综合算力全景分析报告显示,截至 6 月,已投入使用的智能算力达到 2,185 EFLOPS。EFLOPS 指每秒百亿亿次浮点运算,尽管实际性能取决于工作负载和数值格式。
同一份分析报告称,已投入使用的标准机架达到 1,556 万个,存储容量超过 2,000 EB。报告从算力、存力、运力和运行环境等维度,评估了全部 31 个省级地区。
这些指标之所以重要,是因为 AI 集群并不是孤立的芯片集合。它需要能够持续供给数据的存储系统、能够同步工作的网络,以及能够高效分配资源的软件。
报告中最具启示性的统计数据并非全国增长率。根据活动上公布的结果,仅七个省份的机架部署率超过 75%。
机架部署率描述的是可用数据中心容量中实际完成填充和启用的比例。它并不直接衡量加速器利用率或已完成的 AI 工作量。
这种区别至关重要。一座设施可以将服务器装入机架,却无法让它们持续承担高效工作负载。反过来,专用集群即使并非每个组件都持续运行,也可以交付有价值的工作。
因此,七省这一数字应被视为预警信号,而非完整的全国利用率评分。它表明,基础设施供给与市场需求之间仍存在不均衡的匹配关系。
省级分析指出,河北、广东、江苏、上海和北京在多个算力维度上具备优势,而它们的优势来源各不相同。
北京、上海和广东在模型开发、生成式 AI 服务及相关产业活动方面领先。广东、河北和上海则拥有相对较强的存储基础。
江苏、浙江和广东在网络协同方面表现良好。新疆、甘肃和青海则受益于能源、气候和土地条件。
这些差异解释了为何单一的全国算力数据可能掩盖地方瓶颈。需求、电力、可用土地、网络时延、技术人才和软件生态并不集中于同一地区。
因此,大会最重要的变化在于观念层面。主管部门和运营商公开将生产性产出视为比建设规模更重要的竞争指标。
这一判断带来了更严苛的考验。建设一座设施是可见且可量化的;证明它能稳定、经济地提供 AI 产出,则需要持续的运营证据。
为什么中国算力大会数据改变了竞争标准
新的竞争核心是有效算力,也就是系统在运营损耗与约束之后实际交付的有用产出。
有效算力并非简单地将芯片理论性能乘以已安装加速器数量。它反映了在通信延迟、故障、调度冲突、内存限制和闲置时间之后,真正得以保留的可用工作量。
中国信息通信研究院算力与能源专家王玥介绍了影响这一产出的多项运营因素,包括并行化、任务划分、拥塞控制、故障恢复、负载均衡和资源编排。
并行化是将大型任务分配给多个处理器。划分不佳会导致部分设备处于等待状态,而其他设备承担过重负载。
随着集群规模扩大,通信效率愈发重要。加速器必须交换参数和中间结果,通常在一次训练步骤中需要多次进行。
缓慢或拥塞的链路会迫使昂贵的处理器等待。集群依然已部署且通电,但实际吞吐量会低于其宣称的容量。
故障管理带来另一种差距。大型集群包含足够多的组件,因此硬件和网络故障会成为日常运营事件,而非罕见例外。
具备韧性的系统可以以有限延迟重新路由工作或恢复检查点。能力较弱的系统则可能损失数小时的处理时间,或不得不重启大型任务。
资源编排决定哪项工作负载获得哪些处理器、内存、网络容量和存储访问权限。编排能力不足,可能让可用硬件闲置,同时客户仍在等待兼容的配置。
在中国政策目前设想的规模下,这些问题会更加复杂。9 月 7 日的一项行业规划要求有序部署包含 1 万、10 万或更多加速器的集群。
该规划还强调,建设与具体场景匹配的推理基础设施,并进一步适配国产芯片。推理是运行已训练模型以生成输出的过程。
训练与推理对基础设施提出不同需求。训练通常偏好大型、紧密互联的集群,以处理长时间运行的任务。
推理需求则更为碎片化。它可能要求低时延、可预测的响应时间、地理位置邻近,并能随用户流量变化快速扩缩容。
IDC 中国研究副总裁周政刚向财联社表示,AIDC 市场面临的是结构性稀缺,而非普遍短缺。AIDC 指围绕 AI 工作负载设计的数据中心。
周政刚表示,通用训练算力扩张很快,高质量推理算力以及面向 AI Agent 的资源则依然偏紧。
这一判断令“普遍过剩”或“全面短缺”的说法都变得复杂。这两种情况可以同时存在于不同硬件类型、地区、软件栈和客户细分市场中。
一家电信运营商可能拥有可用机架,却缺少模型公司所需的软件环境。一座西部集群可能提供更低的电力成本,却无法为东部客户提供合适的时延。
一家云服务商可能将最优质的容量留给内部模型和既有客户。独立运营商随后可能难以同时获得合适的硬件和可靠的需求。
最初的行业报道反映了这种分化。一位从业者称,需求不像最早扩张阶段那样过热,但大型科技公司仍面临供应紧张。
中国联通华北数据中心则展现了这一图景的另一面。其管理层表示,在规划中的设施开工建设前,客户便已表达购买意向。
据运营商介绍,廊坊园区拥有六栋在运营的数据中心大楼、18,600 个机架和约 66 万台已部署服务器。其现有智能算力据称达到 3,425 PFLOPS。
该园区计划在 2026 年新建三栋智能计算大楼。披露的项目包括 315 MW 的数据中心容量,以及通用算力和智能算力的显著提升。
这些计划表明,建设并未停止。市场正在区分“某处存在的容量”与“能够满足客户实际技术要求的容量”。
对运营商而言,有效算力让软件和运营能力成为销售基础设施。较低的标称容量,只要能稳定完成更多工作负载,也可能具有更高的商业价值。
对客户而言,这种变化促使采购环节提出更细致的问题。买方需要考察实际交付吞吐量、排队时间、故障率、网络性能和软件兼容性。
引用的加速器数量无法回答这些问题。建筑物规模或已安装机架数量同样无法回答。
云服务商与电信运营商凭借不同优势入场
云服务商拥有软件与客户优势,而电信运营商掌握设施和全国网络资产。
这种分工构成了大会利用率讨论背后的主要竞争张力。两类企业都能建设集群,但它们从不同起点着手提升有效产出。
大型云服务商将基础设施与模型、开发者工具、公有云客户及成熟的软件平台相连接。它们能够将内部和外部需求导向自有设施。
Alibaba Cloud、Tencent Cloud 和 ByteDance 也运营着能够持续产生 AI 工作负载的服务。对需求的可见性可以降低建设无客户集群的风险。
其全栈布局还带来另一项优势。云服务商可以协同调优模型框架、调度软件和基础设施。
当客户需要专用推理或 Agent 工作负载时,这种整合尤为重要。运营商可以跨应用、模型、运行时和硬件层进行优化。
电信运营商则拥有广泛的数据中心资产、骨干网络、电力接入和区域覆盖。China Mobile、China Telecom 和 China Unicom 可以连接多个城市的设施。
不过,电信运营商在模型和 AI 软件生态方面通常弱于大型云服务商。周政刚认为,它们可以为云服务商和模型提供商承接定制化基础设施外包服务。
这并不意味着电信运营商会沦为被动的“房东”。当工作负载需要跨多个地区实现可预测的低延迟时,其网络的价值反而会提升。
中国算力平台现已接入全国 31 个省级地区的省级平台。官方将该系统描述为面向算力存量、运行状态和资源可用性的国家级监测层。
该平台已有超过 1 万家注册企业用户、逾 2,000 项上架算力产品以及 300 多个接入模型,并积累了数十亿条监测记录。
国家平台提升了可见性,但可见性不等于工作负载迁移成功。市场上架并不能消除延迟、数据治理或软件兼容性方面的限制。
独立 AIDC 提供商面临的处境更为困难。拥有核心云客户的大型运营商可以实现专业化运营,或争取长期合同。
小型提供商的资本更少,获取电力资源的能力较弱,且缺乏稳定的客户保障。它们可能沦为分包商,或只能服务狭窄的区域及行业市场。
模型开发商构成第四类参与者。领先企业可以自建集群,以保障训练算力并管理长期供应风险。
不过,它们仍可能从外部提供商采购推理算力或基于 token 的服务。Token 服务出售的是模型输出,而不是对硬件的原始访问权限。
这种分离可以提高灵活性,但也改变了基础设施客户的比较标准。他们不再那么在意是否拥有某个特定机架,而更关注可用模型输出的成本和可靠性。
竞争边界仍将保持流动。云公司可以租用电信运营商的设施,而电信运营商则可提供网络服务和定制硬件。
独立提供商可以专注于对数据所在地有严格要求的行业。模型公司可以将内部算力留给训练,同时把不可预测的推理流量外包出去。
胜者未必拥有最大的实体规模。它将以最少的运营损耗连接需求、硬件、软件、电力和网络。
这一标准也提升了透明测量的重要性。不同提供商对算力的定义可能不同,尤其是在处理器类型和数值精度方面。
以 FP16 衡量的 EFLOPS 数值,不能随意与采用其他格式衡量的数值进行比较。真实工作负载还取决于内存带宽、互连能力和软件优化。
客户需要工作负载层面的证据。有效指标包括已完成的训练步数、生成的 token 数量、响应延迟、任务完成率,以及每项任务的能耗。
如果缺乏一致的报告标准,有效算力可能沦为又一个宣传标签。只有运营商将其与可观察的生产结果联系起来,这一概念才有价值。
七省数据仍留下重要疑问
机架部署揭示了区域间的不平衡,但并不能证明每一台在运行的服务器都在完成有价值的 AI 工作。
75% 的门槛很容易被误读。它衡量的是可用数据中心机位是否已被填充,而不是加速器是否始终得到充分利用。
本文审阅的公开会议报道也未披露这七个省份的具体名单。配套的区域分析仅指出,山西、青海和新疆在机架部署方面表现突出。
这一缺失限制了比较。读者无法判断其他省份距离 75% 有多远,也无法确认各地区的统计是否采用了完全一致的设施样本。
历史数据提供了一些背景。2023 年中国信息通信研究院的一份白皮书显示,截至 2022 年末,部署率最高的十个省份均超过 55%。
早期基准将整体部署率偏低的部分原因归于区域定位不清晰和产业生态不完整,并建议通过协调规划,在投资与利用率之间取得平衡。
较新的 75% 统计数据表明领先地区已有改善,但它并未建立全国性的时间序列。门槛、设施总体和报告方法仍需统一。
第二个不确定性涉及“在用智能算力”这一表述。已发布报道在提示机架部署问题的同时,给出了 2,185 EFLOPS 的数据。
“在用”可能是指已投运的基础设施,而非持续产生价值的利用率。它不应被解读为每项运营都在服务客户工作负载的证明。
第三个问题是工作负载质量。一个集群即使利用率很高,也可能运行低价值任务、低效软件,或主要依靠补贴来填满容量的工作负载。
具有商业价值的产出不仅需要活跃度。相关工作还必须以可持续的运营成本满足客户需求。
会议报告指出了三项广泛制约因素:区域发展差距、与行业场景融合不足,以及跨区域调度障碍。每一项都可能以不同方式压低有效产出。
区域差距使需求与基础设施分布在不同地点。东部省份集中了许多模型开发商和用户,但能源与土地限制更为严格。
西部地区可提供可再生电力、更凉爽的气候以及建设大型设施的空间。距离则会带来延迟和数据传输限制。
训练任务和冷存储对距离的容忍度高于交互式推理。面向客户的 AI 智能体可能需要足够快地响应,以至于地理位置成为决定性因素。
跨区域调度同样带来安全和治理方面的担忧。移动数据或中间结果,可能与客户政策、监管义务或带宽限制相冲突。
行业融合则是另一项挑战。建设集群并不会自动带来制造商、医院、金融机构或地方政府的需求。
这些机构需要兼容的模型、干净的数据、采购批准以及重新设计的工作流程。硬件可能在这些要素准备就绪之前很久便已部署到位。
最有力的反例来自主办省河北。官方称,该省拥有 556 EFLOPS 智能算力和 250 万个在运营的标准机架。
河北还称其利用率超过 80%。该省将基础设施计划与覆盖 26 个行业的 441 个垂直大模型和 98 个智能体相结合。
这些均为地方官方说法,而非经独立审计的工作负载测量数据。不过,它们展示了其他省份正被鼓励建立的需求联动类型。
廊坊提供了尤其审慎的策略。该市距离北京足够近,因此可以发展低延迟推理,而不是复制西部训练中心的模式。
官方表示,数据约可在一毫秒内抵达北京核心节点。廊坊称拥有 36 个大型在运营数据中心,以及超过 20 万 PFLOPS 的智能算力供给。
其区位支撑了一种互补模式:北京可以集中科研和应用,而邻近的廊坊承担实时计算。西部枢纽则可服务对延迟不那么敏感的工作负载。
这种专业化定位比将每个省份都视为可互换的集群选址更可信。它使设施设计与客户需求及网络条件相匹配。
即便如此,这一方法仍须证明本地需求会随供给一同增长。补贴、算力券和模型券可以加快采用,但也可能掩盖潜在的经济性问题。
因此,会议提出的有效算力框架应被视为一个可检验的方向。它尚不是标准化的国家级绩效衡量指标。
电力、冷却和网络如今定义可用算力
当电力、热管理系统或数据链路成为限制性资源时,集群便无法提供有效算力。
AI 基础设施对这三类系统都施加了不同寻常的压力。高密度加速器机架比传统企业服务器消耗更多电力,也释放更多热量。
与会者表示,绿电占比、机架功率密度和液冷能力已取代土地面积与机架数量,成为关键估值指标。
液冷通过处理器附近的液体传递热量。它可支持比传统风冷更高的机架密度,尽管实施和维护仍较为复杂。
电力可得性影响扩容速度和运营成本。大型项目日益需要数百兆瓦电力,而规模最大的国际提案已接近吉瓦级供电。
因此,区域电价可能重塑竞争格局。中国联通怀来设施称,其电价接近每千瓦时 0.62 元。
该运营商将这一费率与内蒙古超过 0.40 元、山西超过 0.50 元的电价进行比较。据报道,一些西部项目获得了更低的补贴电价。
这些数据来自公司声明,可能取决于合同、补贴和用电模式。不过,它们仍说明了为何相同硬件可能具有不同的运营经济性。
高能源成本会降低每项已完成 AI 任务的商业价值,也可能阻碍客户将工作负载部署到某一地区。
运营商正通过直接可再生能源安排、电力交易和灵活负荷调度加以应对。灵活调度会将适合的工作转移到电力更充足的时段或地点。
国家政策方向支持这一做法。中国的基础设施规划要求统筹算力、存储、网络、电力和碳核算。
基础设施政策还推动算力网络、异构资源协同,以及与行业需求相匹配的部署。这些优先事项早于 2026 年会议提出,但如今具有更强的运营紧迫性。
网络同样至关重要。中国称,已有超过 70 条传输线路连接国家算力枢纽和其他重点地区。
官方还称,17 个国家算力互联区域节点已获批。河北区域节点在会议期间开始运营。
这些项目改善了资源发现和连接能力,但并不保证每项工作负载都能在区域间以经济的方式迁移。
网络延迟可被异步模型训练或数据处理所容忍。交互式推理和多智能体系统通常需要更严格的响应目标。
当训练数据集或模型检查点达到庞大规模时,带宽成本也很重要。迁移工作本身可能抵消较低电价带来的节省。
中国工程院院士吴何全提出结合本地与远程计算。系统可以先在本地执行初始任务,再将更重的处理发送到其他地点。
他还讨论了拆分不同推理阶段,以及使用加密或数据脱敏。这类设计旨在平衡延迟、能源与安全。
另一项提议涉及更扁平的光网络,以实现更快调度和更低能耗。这些技术仍需从演示走向稳定的生产环境。
运营可靠性仍是最后一层。中国移动京津冀设施展示了多项电力保障措施,包括独立市电馈线、柴油发电机和不间断电源系统。
据称,该设施配备 15 台额定功率为 2,000 千瓦的柴油发电机,并设有专用燃料储备。这类备用系统保障可用性,但也增加了资本、维护和环境成本。
每一层支撑体系都会影响实际可用的产出。无论理论速度多快,如果加速器等待数据、过热、断电或反复重启,其贡献都微乎其微。
这正是有效算力转变为何超越芯片供应商的原因。它改变了网络设备、存储、冷却、电源管理和集群软件的采购优先级。
它也会奖励那些能够妥善记录基础设施决策和运行事故的团队。复杂集群会产生大量日志、设计说明和故障排查记录。
工程团队可以将这些材料转化为可搜索的技术知识库。更快地获取过去的修复方案,有助于减少重复的诊断工作,尽管这无法替代成熟的运维体系。
三项信号将决定有效算力能否胜出
下一项考验在于,会议上的表述能否转化为利用率、工作负载交付和区域专业化方面可衡量的变化。
第一个信号是省级利用率披露。未来的报告需要列明具体地区的结果,采用一致的定义,并对机架部署和加速器使用情况提供可比较的衡量标准。
如果更多省份在不依赖模糊容量分类的情况下跨过75%这一门槛,这些证据将强化有效算力的论点。如果报告仍过于有限、难以验证,则会削弱这一论点。
第二个信号是真实的跨区域工作负载流量。该国家级平台如今已覆盖31个省级地区、数千种产品和数百个已连接模型的监控。
关键不在于资源目录中显示了多少资源,而在于有多少生产工作负载能够在不同地区之间成功迁移,同时满足延迟、安全性、可靠性和成本要求。
已完成的跨区域任务增长,将表明该网络正在减少供需错配。如果生成式AI应用仍持续集中于北京、上海和广东,则会暴露其局限性。
第三个信号是服务商如何打包推理和智能体能力。云计算公司、电信运营商和独立设施正凭借不同资产,向同一批客户靠拢。
应关注以 token、实际交付吞吐量、延迟和服务可靠性为基础的合同。这些条款比机架或加速器数量更直接地将基础设施投入与客户成果联系起来。
还应关注哪些运营商赢得持续性的推理工作负载。训练项目规模可能很大,但往往是暂时性的;而推理需求会随着应用的日常使用而增长。
中国算力大会明确提出了一项判断:建设规模已不足以衡量进展。七省统计数据使这一判断难以忽视。
中国在多个市场仍需要更多专业化的AI算力。同时,现有算力必须更易于被发现、调度、供电、冷却和连接。
对开发者和企业采购方而言,实际问题很简单:服务商提供的是理论容量,还是能够证明真实工作负载实际获得的性能?
对基础设施运营商而言,挑战则更为艰巨。他们必须将芯片、建筑、电力、网络和软件转化为可靠产出,同时保持客户业务持续运行。
未来三个月,请不要只关注新的集群公告。应跟踪已披露的利用率、已完成的跨区域工作负载,以及与实际交付AI产出挂钩的合同。
这些指标将揭示,有效算力究竟会成为一种运营准则,还是仍只是一句会议口号。



