LineShine 赢得了一场已不再只有一个终点的超级计算机竞赛
Tom Hardware 的报道将中国的 LineShine 推向了一场排名争议的中心,尽管它以 2.198 exaflop 的成绩创下 TOP500 纪录。这台位于深圳的机器,是在该榜单定义性测试中公开提交的最快系统。不过,它并非在所有相关指标上都处于领先位置。它也置身于一场规模日益扩大的私有 AI 基础设施竞赛之外,而这场竞赛往往完全忽略 TOP500。
这一区别改变了标题的含义。LineShine 在高性能 Linpack(High Performance Linpack,HPL)测试中取代了美国的 El Capitan;该测试衡量系统在求解稠密线性方程时的双精度性能。然而,El Capitan 在一项面向 AI 的混合精度测试中仍然领先。更小型的系统也能以每瓦更高的能耗效率提供 HPL 性能。
旧时代的竞赛奖励的是一个经过公开验证的分数。新兴的竞赛则要考察一套系统能否训练模型、服务用户、运行科学应用、控制能源成本并保持高利用率。Microsoft 和 xAI 等公司围绕这些结果进行优化。对它们而言,为追逐一次 HPL 提交而暂停高价值基础设施,看起来可能更像是一种干扰,而非验证。
LineShine 改写了 TOP500 纪录,而非领导地位的定义
LineShine 赢得了一场明确的基准测试胜利,但这场胜利只适用于特定工作负载,以及一个自愿参赛的竞争者群体。
第 67 期 TOP500 榜单于 6 月 23 日在德国汉堡举行的 ISC 2026 上公布。LineShine 直接以第一名进入榜单,终结了 El Capitan 的榜首连任。其 HPL 成绩达到 2.198 exaflops,而劳伦斯·利弗莫尔国家实验室系统 El Capitan 的成绩为 1.809 exaflops。
一 exaflop 代表每秒百亿亿次浮点运算。因此,在这项基准测试期间,LineShine 每秒持续完成超过两百亿亿次双精度运算。它成为首台在不使用专用 GPU 加速器、仅依靠 CPU 的情况下突破 2 exaflops 的上榜机器。
该系统部署于深圳国家超级计算中心,由深圳云计算中心建设。据官方 TOP500 公告称,它采用定制的 304 核 LX2 处理器,共计 13,789,440 个核心。这些处理器运行频率为 1.55 GHz,并通过专有的 LingQi 互连连接。
LineShine 达到了其标称 2.736-exaflop 理论峰值的约 80%。这一转化率很重要,因为峰值规格描述的是已安装硬件在理想条件下可能提供的性能。HPL 衡量的则是完整机器在执行一项高强度计算时所持续实现的性能。
这一结果也具有地缘政治意义。自 Sunway TaihuLight 在 2018 年失去榜首位置以来,中国一直未能在 TOP500 榜首部署系统。中国机构大多已停止提交其最强系统,使得国家间比较愈发带有推测性质。
LineShine 的出现消除了部分不确定性。其提交结果确认,中国能够组装出一套在公开验证下达到 exascale 性能的纯 CPU 系统。它也展示了在处理器、互连、系统架构和 Kylin 操作系统上的显著本土整合能力。
不过,TOP500 并不识别每一台正在运行的超级计算机。所有者必须运行 HPL、记录系统配置,并提交可接受的结果。一个从未参赛的私有集群,不会输掉一场排名竞赛。
这一限定条件是这篇 Tom Hardware 报道背后 排名分析的核心。LineShine 拥有一项重要纪录,但这项纪录已不再支持关于谁掌控最具影响力计算基础设施的普遍性论断。
Tom Hardware 的数据揭示了多个不同的赢家
6 月排名并未产生唯一冠军,因为每项基准测试奖励的都是机器的不同属性。
HPL 仍然是 TOP500 的基础。它偏向那些能够执行大量 64 位浮点运算、同时高效地在众多节点间移动数据的系统。这类精度对于数值微小误差可能累积的模拟仍然至关重要。
天气建模、流体动力学、材料研究和核模拟都可能需要这种能力。HPL 还提供了长期运行的标准化测量,因此可以进行历史比较。这些优势解释了它为何在多年批评后依然存在。
LineShine 还通过夺得高性能共轭梯度(High Performance Conjugate Gradients,HPCG)第一名,进一步巩固了自身实力。HPCG 使用与稀疏科学计算相关的模式,在这类计算中,处理器会反复访问分散在内存各处的数据。它旨在反映更多真实应用中常见的内存访问和通信压力。
该机器在 HPCG 中取得了 22 petaflops。El Capitan 以 17.41 petaflops 紧随其后,日本的 Fugaku 达到 16 petaflops。这一结果削弱了任何关于 LineShine 只是在异常有利的 HPL 实现中表现出色的说法。
不过,在混合精度下,排名格局发生了变化。AI 系统通常使用 16 位、8 位甚至更低的数值格式,因为模型训练并不需要每项操作都具备 64 位精度。更低精度可让专用加速器在占用更少内存和能耗的情况下完成更多运算。
HPL-MxP 衡量混合精度计算,同时通过数学迭代优化来保持最终解的精度。在该测试中,El Capitan 以 16.7 exaflops 保持第一。Aurora 达到 11.6 exaflops,Frontier 为 11.4,而 LineShine 以 7.92 位列第四。
官方 混合精度结果还展示了一个值得注意的倍数。LineShine 的 HPL-MxP 运行速度约为其常规 HPL 结果的 3.6 倍。El Capitan 的混合精度得分则超过其标准结果的九倍。
这一差距反映了架构优先级的不同。LineShine 拥有数量庞大的通用 CPU 核心。El Capitan 则将 AMD EPYC 处理器与 Instinct MI300A 加速器结合,后者能更有效地处理低精度并行计算。
能效构成了另一套排名。根据 TOP500 数据,LineShine 在运行 HPL 时耗电约 42.2 megawatts,其能效为每瓦 52.07 gigaflops。El Capitan 在报告耗电 29.685 megawatts 的情况下,记录为每瓦 60.94 gigaflops。
两套系统都未领跑 Green500。该榜单按每瓦 HPL 性能而非总输出对机器进行排名。采用 Nvidia Grace Hopper 技术、规模小得多的法国系统 KAIROS 以每瓦 73.28 gigaflops 领跑。
规模使这种比较变得复杂,因为更大的系统必须在更多设备之间移动数据。通信和冷却开销通常会随规模上升。因此,Green500 偏向高效架构,但它并不能回答哪台机器能最快完成最大的任务。
6 月排名详情直观展现了这一冲突:
双精度 HPL
LineShine:2.198 exaflops,第一名
El Capitan:1.809 exaflops,第二名
面向应用的 HPCG
LineShine:22 petaflops,第一名
El Capitan:17.41 petaflops,第二名
混合精度 HPL-MxP
LineShine:7.92 exaflops,第四名
El Capitan:16.7 exaflops,第一名
HPL 能效
LineShine:每瓦 52.07 gigaflops
El Capitan:每瓦 60.94 gigaflops
KAIROS:每瓦 73.28 gigaflops,第一名
因此,按照 TOP500 的正式定义,LineShine 是最快的超级计算机。El Capitan 则在与混合精度 AI 算术最密切相关的排名中更快。KAIROS 在已提交的 HPL 工作负载上效率更高。
这些结果并不相互抵消。它们描述的是围绕不同约束条件设计的机器。将其中一项结果视作对科学、商业和 AI 计算领导力的完整说明,才是错误所在。
公开基准测试如今面临私有算力经济
更大的逆转并非 LineShine 超越 El Capitan,而是私营公司正在建设无需获得公开排名认可的庞大系统。
在 TOP500 历史的大部分时期,最大的计算机归国家实验室、研究机构和政府支持项目所有。这些所有者有动力公布基准测试结果。排名能够展示技术进步、支持资金论证,并吸引科学用户。
AI 时代改变了所有权模式。前沿模型开发者将算力视作生产基础设施和竞争情报。集群规模可能透露资本支出、芯片获取能力、网络容量,以及一家机构训练未来模型的能力。
公布详细配置所提供给竞争对手的信息,可能超过其营销价值所能证明的合理程度。运行 HPL 也可能占用数千个加速器的时间,而这些加速器原本可以训练模型或服务付费客户。
Epoch AI 的研究发现,2025 年企业控制了约 80% 的已测量 AI 超级计算机性能;2019 年这一比例约为 40%。公共部门系统有所增长,但私有算力集群扩张得更快。
Epoch 的算力研究估计,领先 AI 超级计算机的性能大约每九个月翻一番。研究还发现,配备超过 10,000 枚 AI 芯片的系统已从罕见的例外,变成常规的前沿基础设施。
这些集群无法与 TOP500 直接对应。HPL 强调 64 位算术,而 AI 加速器将更多硅面积投入低精度张量计算。为模型训练优化的机器,相比其真实的经济重要性,可能会交出并不起眼的 HPL 成绩。
xAI 的 Colossus 说明了这种分歧。该公司表示,其 Memphis 系统在加速扩建后达到了 200,000 枚 H100 级 GPU。其公开的 Colossus 介绍重点关注 GPU 数量、总内存带宽、网络、存储和建设时间。
这些并不是 TOP500 的核心衡量指标。它们才是决定一次训练任务能否高效分配工作、从故障中恢复、向加速器供给数据,以及按计划产出模型的约束条件。
Microsoft 对其位于 Wisconsin 的 Fairwater 基础设施采用了类似的表述。该公司称,数十万枚 Nvidia GPU 被连接为一个 AI 系统。它从模型训练性能、网络覆盖范围、水资源管理和电网整合等角度介绍这座设施。
Microsoft 的 Fairwater 描述称其为公司耦合最紧密的 AI 超级计算机。该说法无法与 LineShine 经验证的 HPL 纪录直接比较,因为 Microsoft 没有提供相同的基准测试结果。
验证缺口很重要。供应商关于“最大”或“最强大”的说法,往往采用未公开的定义。GPU 数量也可能合并了多个建筑、部署阶段或无法作为一台机器运行的集群。
然而,排除这些设施会造成另一种失真。一份已提交的 HPL 成绩榜单可以在自身规则内保持严谨,却遗漏了训练领先模型所需的大量算力。不完整样本中的精确性,并不意味着该样本具有全面性。
这由此形成了两套正当性体系。公共 HPC 中心通过标准化、可复现的提交来证明性能;私营 AI 运营商则通过训练模型、服务容量、营收和部署速度来证明价值。
任何一种模式单独来看都不充分。公共基准测试提供了营销说辞无法替代的比较;生产结果则揭示了合成基准无法捕捉的能力。
Tom Hardware 的论述在这一交汇点上最有说服力。TOP500 并未变得毫无用处;它的称号只是比“全球最快超级计算机”这一表述所暗示的范围更窄。
运行 HPL 可能与集群建成时的任务发生冲突
当完成一项基准测试会延误为机器提供资金支持的工作时,这项基准测试的吸引力就会下降。
一次全规模 HPL 测试并不是轻量级诊断。运营方必须配置软件、预留系统的大部分资源、调优通信、处理故障,并在结果不理想时重复运行。在这些资源被预留期间,机器无法执行正常的生产工作。
在国家实验室中,这种成本的意义有所不同。基准测试通常是验收测试和公共问责的一部分。系统的使命包括提供科学研究访问、评估架构,以及证明公共投资实现了合同约定的能力。
商业 AI 集群则遵循另一种节奏。其加速器可能支持持续数周的训练任务、强化学习作业、模型评估、微调和持续推理。闲置容量具有直接的机会成本。
HPL 还可能奖励那些无法改善这些任务的决策。密集线性代数运行会给规律计算和高度优化的通信带来压力。大语言模型训练则结合了张量运算、内存移动、集合通信、检查点保存和数据处理。
模型训练还面临不均衡的工作负载。序列长度各不相同,硬件会发生故障,网络拥塞也会变化。系统必须协调并行工作,同时保存足够的状态,以便在不重启昂贵任务的情况下恢复。
一项创纪录的 HPL 成绩无法回答:有多少时候加速器因数据延迟到达而处于闲置状态。它无法衡量软件栈在节点故障后能否顺利恢复,也无法揭示需求激增期间的推理延迟。
这并不意味着合成基准没有价值。受控测试能够隔离瓶颈,并让工程师在不共享专有模型或数据集的情况下比较系统。HPL 的长期存在还提供了一份任何商业 AI 指标都无法匹敌的历史记录。
问题在于适用范围。当读者了解其衡量的属性时,基准测试仍然具有参考价值;当排名被用作各种计算能力的简写时,它就会产生误导。
HPCG 的创建,部分原因正是 HPL 无法很好地代表受内存限制的科学应用。随着低精度硬件变得重要,HPL-MxP 应运而生。Green500 则加入了能效考量,因为脱离功耗背景的性能掩盖了日益严峻的运营约束。
这些榜单的存在本身就证明,单一数字已经不再适用。每项新基准都在修正一个盲点,同时也引入另一组假设。
AI 带来了更棘手的测量问题。训练性能取决于模型、数值格式、批次大小、网络设计、软件以及可接受的精度。一个系统在某种架构上表现出色,在另一种架构上可能表现不同。
MLPerf 等行业基准通过定义工作负载和提交规则提供帮助。即便如此,供应商仍会大量投入优化,并非所有私营集群都会参与。结果描述的是经过测试的配置,而非每一种生产环境。
对于企业买家而言,有用的问题很少是哪一套设施保持全球纪录。买家关心的是任务完成时间、可用性、安全性、数据位置、模型兼容性和总能耗。他们还需要可预测的容量访问。
开发者也面临类似取舍。如果网络争用导致大量加速器无法高效工作,名义上庞大的加速器数量意义不大。一套排名较低、但调度和软件更好的集群,可能更早产出结果。
LineShine 的纯 CPU 架构值得在这一更广泛框架下关注。通用处理器能够支持多样的科学工作负载,而无需迫使每个应用都转向面向 GPU 的代码。其 HPCG 领先地位表明,它具备强大的内存和通信能力。
它在 HPL-MxP 中排名第四,也指出了其在适合加速器的混合精度工作方面的局限性。这并不能证明 LineShine 在所有 AI 工作负载上表现不佳;它说明了为何 HPL 胜利无法决定 AI 方面的比较。
排名仍无法验证的内容
私营领域的保密性削弱了 TOP500 的完整性,但也使外部人士无法验证 AI 基础设施所有者提出的主张。
人们很容易断言,Colossus、Fairwater 或其他超大规模设施会击败 LineShine。GPU 数量和低精度峰值规格让这一结论看似显而易见。但若没有等效、经审计的测试运行,这种比较仍属假设。
已安装的硬件并不等同于可用的集群性能。一个地点可以拥有数千个加速器,却未必作为一套紧密耦合的系统运行。电力供应、冷却限制、网络拓扑和软件稳定性,都可能降低实际可用配置。
公开说明往往模糊这些边界。一家公司可能引用整个园区的规划容量,而其中只有一个阶段已经投入运行。它也可能汇总用于训练和推理的芯片,尽管这些资源池服务于不同任务。
LineShine 的结果具有不同的证据地位。TOP500 接受了特定配置和持续性能测量。其排名可以因相关性有限而受到批评,但报告的 HPL 分数比未定义的企业最高级宣传更容易检验。
同样的谨慎也适用于国家间比较。LineShine 让中国在已提交 HPL 系统中重回第一,但这并不能证明中国拥有的 AI 总算力超过美国。
Epoch AI 估计,在其 2025 年数据集中,美国承载了约 75% 的已观测 AI 超级计算机性能,中国约占 15%。研究人员也警告称,公开覆盖并不完整且分布不均。
这些估计回答的是另一个问题。它们试图衡量公共和私营所有者的整体 AI 基础设施;TOP500 衡量的则是已提交系统在单一双精度工作负载上的性能。
读者也应避免将基准性能等同于模型能力。更多算力能够支持更大规模的训练和更快的实验,但数据质量、算法、模型设计和工程执行仍会影响最终系统。
能耗比较同样需要严谨。LineShine 的 42.2 兆瓦 HPL 测量值相当可观,但不能直接与多栋建筑 AI 园区的完整供电能力相比较。一个数字描述的是经基准测试的机器;另一个可能包含冷却、存储、网络和扩容余量。
Green500 提供了标准化的效率视角,尽管它仍与 HPL 绑定。生产 AI 的效率或许更适合通过已完成的训练工作量、有效 token,或单位能耗所服务的请求数来衡量。每种选择都隐含了对质量和工作负载的假设。
负责任的结论,比任何一方偏好的口号都更为收敛。LineShine 是全球最快的已提交 HPL 系统,也是 HPCG 领先者。El Capitan 领跑 HPL-MxP,而规模更小的架构领跑 Green500。
私营 AI 集群可能拥有比榜单机器更多的低精度计算能力。但仅凭芯片发布公告,无法独立确立其确切优势。
这种不确定性并不会削弱 LineShine 的工程成就;它限制的是附加在该成就之上的更广泛主张。
三个信号将显示 TOP500 是否仍具影响力
超级计算机竞赛的下一阶段,将由参与度、工作负载证据和运营效率决定,而非单一的新纪录。
第一个信号是 2026 年 11 月发布的 TOP500 榜单。另一项重大提交可能挑战 LineShine;而 HPCG 和 HPL-MxP 参与度的扩大,将揭示系统所有者是否重视更广泛的公开比较。
LineShine 本身仍将提供信息。新的应用报告能够显示其不同寻常的纯 CPU 规模,是否能转化为持续的科学产出、可靠的利用率和高效的 AI 推理。公开的工作负载研究将使其主张超越基准领先地位。
若没有新的提交,则会支持相反的结论。这将表明,全球获得资金最多的算力运营商认为参与这场正式竞赛几乎没有收益。
第二个信号是,私营 AI 公司是否发布外部人士可以复现的结果。HPL 分数并非唯一可接受的证据。大规模 MLPerf 提交、详细的训练效率数据,或独立审查的系统研究,都可以建立有意义的比较。
关注企业如何定义集群边界。当主张明确指出实际运行的芯片数量、数值格式、网络、功耗、软件版本和工作负载完成时间时,可信度会更高。
如果 xAI、Microsoft、Meta、Google 或其他运营商提供这些细节,公共 HPC 与私营 AI 测量之间的鸿沟将缩小。如果披露仍局限于峰值规格和园区规模,验证鸿沟将持续存在。
第三个信号是按能耗归一化的生产产出。电力正成为国家实验室和商业 AI 园区的刚性约束。领先架构必须把稀缺电力转化为有用工作,而不只是理论运算量。
TOP500 和 Green500 已经展示了这种取舍的一种形式。LineShine 赢得总 HPL 性能,而更偏重加速器的系统可以实现更好的每瓦性能。AI 运营商必须为训练和推理制定同样清晰的衡量方式。
对于开发者,教训是将排名视为诊断工具。使用 HPL 理解密集双精度性能;使用 HPCG 衡量内存密集型科学行为,使用 HPL-MxP 衡量混合精度,使用 Green500 衡量 HPL 效率。
对于企业买家,应询问测量的是哪种工作负载,以及测试系统是否与所提供的容量相匹配。一项全球头衔几乎无法保证排队时间、服务可靠性,或完成实际任务的成本。
对于政策制定者,排名仍能为国内工程能力提供有价值的证据。它应与芯片供应、电力容量、软件成熟度、私人投资和真实应用产出一并考量。
下一项纪录仍会成为新闻标题。只是它不会恢复过去的简单性。Tom Hardware 的读者应将 LineShine 视为一位名副其实的冠军,同时也将其视为“最快”如今需要加限定语的证明。
哪一项指标配得上桂冠,取决于社会希望这些机器完成什么工作。更好的问题不再是谁赢得了一项基准测试,而是谁能以持续的规模,把算力、能源、软件和时间转化为有用成果。



