top of page

NVIDIA 超级计算机正式启用,海军测试本地部署 AI

NVIDIA 于 7 月 22 日在美国军方内部启用了首台 DGX GB300,为海军研究人员提供了一种有别于云端 AI 计算的新选择。这台 NVIDIA 超级计算机目前正在加利福尼亚州蒙特雷的美国海军研究生院运行,支持模型训练、推理、模拟,以及涉及敏感作战问题的研究。

NVIDIA 创始人兼首席执行官 Jensen Huang 在为期三天的 Converge @ NPS 活动期间,与校方领导共同出席了启用仪式。此次仪式标志着一项于 2025 年首次宣布的部署计划正式完成,当时 NVIDIA 表示将通过美国海军研究生院基金会捐赠该系统。

硬件本身意义重大,但更重要的变化在于军事 AI 开发将在何处进行。NPS 现在可以在校园内训练和评估模型,而不再默认依赖大型商业设施或国家级设施。这一转变使研究人员能够更好地控制数据、访问权限、实验过程和基础设施调度。

但这也带来了一项更严峻的考验。拥有先进算力并不会自动产生可靠的模型、实用的作战工具或负责任的决策。NPS 现在必须证明,本地访问能够缩短研究周期,同时不削弱评估、安全性或人工监督。

蒙特雷究竟启用了什么

NPS 已从规划 AI 设施迈入实际运营阶段,开始运行一套拥有强大计算能力的共享军事研究系统。

启用公告称,DGX GB300 将为超过 1,500 名在校学生和 600 名教职员工提供服务。获批的研究合作伙伴也可通过符合国防优先事项的合作项目使用该系统。

NVIDIA 将 DGX GB300 捐赠给了美国海军研究生院基金会。该基金会负责在 NPS 安装系统,并为需要其算力和内存容量的研究提供资金。DDN、VAST Data 和 Vertiv 则在存储、基础设施、冷却、安装支持和技术专业知识方面作出了贡献。

该系统包含 72 个 Blackwell Ultra 图形处理单元和 36 个 Grace 中央处理单元。GPU 能够并行处理大量计算,因此非常适合模型训练和科学模拟。CPU 则负责更广泛的计算任务并协调工作负载。

这些处理器分布在 18 个计算托盘中。NPS 列出的密集 FP4 张量性能为 1,080 petaflops,稀疏性能为 1,440 petaflops。FP4 是一种低精度数值格式,旨在加速特定 AI 计算,同时降低内存和处理需求。

该系统还配备约 20 TB 的高带宽内存,以及约 37 TB 的高速系统总内存。其约半 PB 的存储环境为研究人员提供了存放模型、检查点、模拟结果和大型研究数据集的空间。

这些规格之所以重要,是因为 AI 实验很少只依赖处理器。数据必须快速传输至 GPU,训练任务需要协调,而失败的工作负载必须能够重启,避免浪费数天时间。一套高效的系统需要将计算、存储、网络、冷却和管理软件结合起来。

NVIDIA Mission Control 负责管理这一集成环境。该软件可处理整个基础设施的资源配置、运行状况监控、任务调度、诊断和恢复。它同时支持 Slurm 和 Kubernetes,这两种系统通常用于为研究工作负载分配计算资源。

DGX 的安装符合学校现有的电力和供水能力。根据 NPS 系统概览,其计算组件在峰值使用时的功耗约为 135 千瓦。预计日常运行功耗将维持在峰值的 50% 至 80% 之间。

封闭式液冷系统负责带走计算组件产生的热量。第二套水循环则将这些热量输送至屋顶冷却设备。系统的辅助组件由风扇冷却。

这种物理规模使此次部署不同于普通的服务器采购。NPS 安装的是一座小型 AI 工厂,即一套用于将数据转化为训练模型和推理结果的集成设施。它必须像研究基础设施一样运行,而不能只是一台用于仪式展示的机器。

7 月的启用仪式也正式确立了双方早已展开的合作关系。NPS 与 NVIDIA 于 2024 年 12 月签署了一项合作研究与开发协议。该协议将 NVIDIA 技术与学校的国防教育、应用研究和领导力培养项目连接起来。

因此,眼前的变化十分明确。研究人员现在拥有的是一项正在运行的校园资源,而不是未来的算力配额或临时云账户。接下来的关键在于,这种本地控制究竟能够带来什么成果。

为什么 NVIDIA 超级计算机改变了研究瓶颈

其核心优势并不只是原始速度,而是能够在研究人员、数据和作战专业知识汇聚的地方反复开展实验。

大型 AI 工作负载可能会连续数小时或数天占用稀缺的计算资源。使用外部环境的研究人员必须迁移数据、满足访问要求、预留资源,并配合其他运营方的日程安排。每一项依赖都会增加实验阻力。

本地访问能够减少部分阻力。研究海洋状况的学生可以调整模型、重新运行模拟并比较输出,而无需再次提交基础设施申请。网络安全团队可以在专为 NPS 研究而管理的环境中测试防御模型。

本地控制还有助于研究人员保护不应通过通用云端工作流程传输的材料。它并不意味着所有数据集都可以使用,也不会自动创建机密环境。但它为 NPS 控制获批的工作负载和用户提供了更直接的基础。

学校将 DGX GB300 定位为一种共享能力。教职员工、学生、政府组织、作战司令部、实验室以及选定的行业合作伙伴,都可以通过获批的合作项目获得访问权限。这种结构使资源分配政策成为决定系统价值的重要因素。

如果访问权限集中在少数成熟团队手中,这台机器将更像一项专业实验室资产。如果 NPS 能够支持小型项目和课堂教学,它就可能改变军官学习如何评估 AI 的方式。这些结果需要不同的调度、支持和治理方案。

其教育影响可能十分显著。只通过演示接触 AI 的军官,学到的只是成品界面看起来能做什么。而亲自训练、测试并让模型暴露问题的军官,则能够看到数据质量问题、不稳定行为、计算限制和评估缺口。

这种经验非常重要,因为军事领导者往往需要批准或监督并非由他们亲自构建的系统。他们需要具备足够的技术素养,才能质疑性能声明、识别不恰当的使用方式,并理解何时仍然必须进行人工审查。

Samuel Paparo 上将从这一责任角度阐述了此次部署的意义。他表示,NPS 学生必须同时理解先进计算带来的机遇与责任。他的观点将教育与作战速度置于同等重要的位置,而不是把更快决策视为唯一目标。

NVIDIA 超级计算机也为 NPS 提供了开展跨学科研究的平台。海洋科学家、计算机科学家、运筹学研究人员和网络安全专家可以使用同一套基础设施。共享访问能够让物理模型、作战约束和机器学习更容易结合起来。

这种结合通常比训练一个通用聊天机器人更有价值。海军气象系统必须遵循大气和海洋物理规律。规划模型必须体现后勤、随机性和对抗行为。网络模型则必须能够应对不断变化的威胁和不完整的证据。

此次部署对云优先研究模式形成了压力,因为它为高要求的工作负载提供了另一条路径。公有云平台对于弹性容量、协作以及 NPS 本地不运营的服务仍然很有用。新系统并不会消除这些优势。

相反,NPS 可以决定哪些工作负载应留在校园内,哪些应使用外部资源。敏感实验、持续的模型开发和紧密耦合的模拟将更适合在本地执行。短期或变化幅度很大的工作负载仍可能更适合云基础设施。

这种混合决策才是真正的竞争边界。问题并不在于每个组织是否都应拥有一套 DGX 系统,而在于那些拥有持续、专业化工作负载的机构,是否能通过将算力部署在研究人员和数据附近来获得更强的控制力。

本地算力挑战云端依赖

DGX GB300 让 NPS 获得了控制权,但也将基础设施责任从云服务运营商转移到了学校。

云计算将资本设备转化为团队可按需申请的服务。服务提供商负责维护硬件、更换故障组件、更新平台的大部分内容,并在客户之间分配容量。用户以牺牲直接控制为代价,换取灵活性和托管运营。

本地部署的 AI 系统在很大程度上逆转了这种安排。NPS 可以控制调度、网络边界、存储和软件配置。但它也必须确保这一计算密度极高的平台持续可用、获得数据供给、得到冷却、及时修补并受到监控。

Mission Control 旨在减轻这一负担。NVIDIA 表示,其管理软件可以自动执行资源配置、检测基础设施问题、协调任务并恢复失败的工作负载。这些属于厂商声明,实际性能将取决于 NPS 的配置和运营实践。

该软件包含用于跟踪系统运行状况和资源使用情况的遥测功能。它还可以应用功耗配置,在 GPU 性能与能源需求之间取得平衡。考虑到预期运行功耗将占 135 千瓦计算峰值的很大一部分,这些控制措施十分重要。

利用率将成为衡量成功的一项指标,但不能成为唯一标准。一台满负荷运行的机器,可能是在支持有价值的研究,也可能是在运行设计不佳的实验,或者执行永远无法投入实际应用的任务。较低的利用率则可能反映出严格的访问控制或人员支持不足。

研究成果才是更好的检验标准。NPS 应当能够展示更短的实验周期、更高要求的模拟、可复现的评估以及更深入的协作。它还应记录项目如何从原型阶段进入更广泛的测试或作战审查阶段。

云系统仍然构成竞争压力。Amazon Web Services、Microsoft Azure、Google Cloud 以及专业服务提供商可以添加新的加速器,而无需大学更换整套设施。它们还提供托管数据库、模型服务和分布式容量。

对于这部分工作负载,NPS 选择了不同的优先方向。学校希望持续访问一套明确的硬件和软件环境。这种稳定性可以帮助团队长期比较实验结果,并保持对模型产物的控制。

这一权衡也包括技术集中度。新环境整合了 NVIDIA 处理器、网络、管理软件和开发库。研究人员获得了一个集成式技术栈,但其工作流也可能与单一供应商的架构和工具紧密绑定。

这种依赖并非 NPS 独有。许多 AI 实验室使用 NVIDIA 的 CUDA 软件平台,因为它支持广泛使用的机器学习框架。将成熟工作负载迁移到其他加速器,可能需要修改代码、进行性能调优并重新验证。

对于一所军事研究生院而言,这个问题不只关乎议价能力。未来的系统可能需要跨数据中心、舰船、飞机、边缘设备和合作伙伴环境运行。在 DGX GB300 上开发的模型最终必须证明,它能够在这些约束条件下运行。

因此,校内部署的系统应作为开发和评估基地,而不应被视为最终部署环境的预设。研究人员可以集中训练大型模型,然后对其进行压缩或适配,使其能在更小型的硬件上运行。他们还可以测试当内存、电力或连接能力受限时,性能会发生怎样的变化。

这正是本地与云端之争变得更加微妙之处。DGX 系统在开发阶段提供控制力,而后续的实际运行环境会施加自身限制。能否在不把实验室性能等同于实战就绪度的前提下衔接这两个阶段,将决定 NPS 能否取得成功。

能够证明这项投资价值的工作负载

天气模型、数字孪生、网络安全研究和对抗性模拟将揭示本地计算能否改变 NPS 所能实现的成果。

天气预测是一项天然的测试,因为海军行动取决于大气、海面、水下和海床条件。微小的预报误差就可能影响航线、传感器、航空作业和人员安全。高分辨率建模需要大型数据集和反复模拟。

NPS 研究人员可以使用 DGX GB300 训练模型,为基于物理规律的预测提供补充。目标并不仅仅是取代成熟的数值方法。AI 可以帮助识别模式、加速特定计算,或在观测数据仍不完整时估计相关条件。

网络安全提供了另一种高要求的工作负载。研究人员可以训练模型来检测异常活动、生成逼真的测试流量,或研究自动化防御如何应对不断变化的攻击。这些实验需要在受控环境中进行,因为相关数据和技术可能具有敏感性。

结果不能仅限于静态数据集上的检测分数。实用的网络安全模型应能应对新战术、抵御经过操纵的输入,并对其输出提供足够解释,以便分析人员开展调查。它还应避免因误报过多而使团队不堪重负。

数字孪生构成了第三个试验场。数字孪生是物理系统或环境的计算表示,会随数据和模拟条件而变化。NPS 已与 MITRE 合作,利用 NVIDIA Omniverse 库构建环境。

研究人员可以创建舰船、港口、设施或航行空间的模拟环境。随后,他们可以测试自主系统、规划和决策工具如何应对天气变化、设备故障、不确定的传感器数据或对抗行为。模拟可以支持反复试验,而不会让人员或设备承受物理风险。

NPS 部署详情还将运筹学、灾害韧性和响应规划列为目标领域。这些领域涉及在条件不断变化时分配有限资源。

灾害响应模拟可能会结合天气预报、受损基础设施、运输能力和通信故障。团队可以在数千种模拟条件下比较不同方案。有价值的输出应是对各种权衡更深入的理解,而不是不加质疑地接受机器建议。

基础模型研究将受到关注,因为该系统能够在校园内训练和适配大型模型。NPS 此前曾讨论开发一个名为 NPS GPT 的内部生成式模型。新基础设施为这一构想提供了更大的技术空间,但目前尚未公布任何部署结果。

内部模型可以帮助研究人员搜索获准使用的文档、总结技术材料,或串联不同项目中的证据。其价值将在很大程度上取决于来源质量、权限、引用以及针对实际研究任务的评估。

同样的经验也适用于日常知识工作。当模型能够检索可信的会议内容、文档、笔记和早期决策时,它会变得更加有用。研究人员还需要规范的信息采集,以免实验背景在不同模型运行之间丢失。

多智能体模拟是一种更专业的用途。多个 AI 系统可以在场景中代表协作或竞争的参与者。研究人员可以研究舰队战术、资源分配、自主协调以及对自适应对手的响应。

然而,模拟智能体会反映其训练数据、目标和环境中隐含的假设。视觉上令人信服的场景仍可能错误呈现人类判断、对手行为或物理条件。扩大规模增加的是试验次数,而不是薄弱假设的真实性。

最有力的证据将来自对比结果。NPS 可以衡量 DGX 系统是否缩短了训练时间、支持更高保真度的模拟,或实现了其此前的 Hamming 超级计算机无法处理的实验。随后,它还可以考察这些技术提升是否改善了研究结论。

公布评估结果将有助于外部观察者区分实际能力与潜在能力。可复现的基准测试、记录在案的局限性和经过同行评审的研究结果,将比演示更具说服力。硬件已经就位;经过验证的成果将是下一个里程碑。

算力并不等同于可信 AI

最大的不确定性在于,更快的实验能否产出在实际运行压力下依然可靠、安全且可问责的系统。

当实际条件与训练数据不同时,AI 模型可能失效。天气模式会变化,传感器会退化,网络会失去连接,对手也会故意操纵输入。在实验室中表现良好的系统,到了对抗环境中可能变得不可靠。

大型模型还会生成看似合理但缺乏依据的输出。这种行为在某些课堂练习中尚可应对,但当用户将生成的文本视为行动依据时,就会变得危险。本地部署并不能消除幻觉、偏见或脆弱的推理。

数据治理带来了另一项挑战。本地系统降低了对外部基础设施的依赖,但仍需要制定规则,规定哪些数据可以进入各个项目。研究人员必须控制访问、数据来源、保留策略,以及数据在具有不同安全要求的网络之间的流动。

“本地部署”这一说法可能会造成虚假的安全感。安全还取决于身份管理、软件供应链、管理员权限、网络分段、模型访问和监控。遭到入侵的本地系统可能暴露集中存储的数据和计算资源。

NPS 领导者已经认识到这种区别。该校作战研究副教务长 Michael Owen 上校表示,未来的领导者必须充分理解先进技术,才能评估其局限性并负责任地应用这些技术。

这种责任应当塑造模型评估方式。基准测试中的准确率是一项衡量指标,但事关重大的系统需要更广泛的测试。团队必须审查可靠性、韧性、可解释性、隐私、滥用风险,以及系统在对抗条件下的表现。

美国国家标准与技术研究院发布的 AI 风险框架围绕四项职能组织这项工作:治理、映射、衡量和管理。该框架将风险管理视为贯穿 AI 系统整个生命周期的持续过程。

NPS 可以通过红队演练和实际运行模拟直接应用这些原则。研究人员可以让模型面对误导性提示、遭到破坏的传感器数据流、陌生环境和相互冲突的目标。他们可以在任何人将原型视为可靠系统之前,记录其失效条件。

人类监督必须具体落实,而不能流于形式。声称“人类始终参与决策流程”,并未说明由谁审查输出、审查者会获得哪些证据,或他们是否可以暂停系统。这些细节决定了监督是否真正有效。

还存在自动化偏见的风险,即使存在相互矛盾的证据,人们仍倾向于相信系统的建议。先进界面可能会加剧这种偏见,因为流畅的输出显得很有信心。因此,培训中应包含模型出错且必须由人类提出质疑的示例。

数字孪生也存在类似的不确定性。模拟能够探索比实体演练更多的场景,但每项结果都取决于其对世界的建模。变量缺失或不切实际的对手模型,可能会为错误的问题给出精确答案。

该系统作为军方首套同类系统的地位,不应与实际运行采用相混淆。NPS 是一所教育和研究机构。在那里开发的项目必须经过进一步测试、安全审查、集成和授权,才能支持真实任务。

供应商的说法同样需要审视。NVIDIA 提供硬件、核心软件以及围绕此次部署的公开叙事。NPS 应独立衡量可靠性、利用率、作业恢复能力和研究生产力,而不应假设宣传中的优势能够直接实现。

这些担忧都不是反对安装该系统的理由。它们界定了使其发挥作用所需开展的工作。本地算力使 NPS 有更多机会在受控条件下测试模型,然后再将其应用于影响更重大的环境。

最理想的成果并不是一台总能给出答案的机器,而是一种研究文化:它知道答案何时有依据、何时仍存在不确定性,以及何时不应使用该系统。

未来三个月值得关注的事项

下一阶段应根据访问情况、经过验证的研究成果,以及安全测试是否与模型开发同步推进的证据来评判。

第一个信号是研究人员的实际访问情况。NPS 将 DGX GB300 描述为共享资源,但分配细节将决定其覆盖范围。注册量、活跃项目数、课堂使用情况和调度等待时间将显示该系统是否改变了日常研究。

广泛开放访问将强化这样一种观点:校内算力能够改善 AI 教育。持续存在的瓶颈,或仅向少数团队开放,则会削弱这一观点。技术支持也至关重要,因为许多领域专家并非基础设施工程师。

第二个信号是出现一项有文档记录、超越以往能力的工作负载。天气建模、网络安全实验或高保真度数字孪生都能提供有价值的证明。最有力的证据是将时间、规模或准确率与 NPS 早期系统进行比较。

并非每个国防项目都需要公开基准测试。然而,NPS 可以公布研究方法、非涉密研究结果、教育成果和基础设施汇总指标。这些证据将表明,此次系统启用带来的不只是额外的理论算力。

第三个信号是 NPS 如何评估风险。关注红队项目、模型卡、对抗性测试、有记录的人工审核程序,或专注于 AI 安全与韧性的研究。这些实践将表明,治理正在与计算环境同步发展。

即使没有这些公开信息,也不能证明缺乏保障措施,因为部分工作可能仍在内部进行。但这会让外界更难评估核心主张。先进的基础设施理应配备同样严谨的评估实践。

NVIDIA 超级计算机也为其他军事院校和政府实验室提供了参考部署。如果 NPS 发布可信的结果,类似机构便可将本地系统与云资源及现有高性能计算中心进行比较。

这类比较不应只涵盖处理器规格。决策者需要关于人员配置、能源、存储、软件维护、研究人员生产力,以及从原型转向经过验证的应用等方面的证据。这些因素决定了本地 AI 基础设施的长期价值。

对于开发者和企业买家而言,Monterey 呈现的是同一决策的缩小版。考虑采用本地 AI 的组织需要询问其数据存放在哪里、工作负载是否稳定,以及自身能否运营完整系统。硬件容量只是其中一部分。

知识工作者则应关注另一个层面。更好的模型无法修复零散的文档、模糊的权限、缺失的实验记录或未记录的决策。周边信息环境的质量仍会影响每一次模型输出。

NPS 现在已经具备在校园内训练模型、运行推理和模拟复杂条件的计算能力。但目前尚未公开此次部署的成果记录。这一区别应成为未来几个月相关报道的关注重点。

此次启用之所以重要,是因为它让军事 AI 研究更贴近那些正在研究实际作战问题的人。最终评价将取决于这些团队构建了什么、测试有多严谨,以及其研究发现能否经受住现实约束的检验。

应关注首批完成的研究周期,而非剪彩照片。如果 NPS 发布可复现的结果和有意义的失败分析,这台 NVIDIA 超级计算机将代表国防 AI 教育的一种新模式。如果证据仍仅限于算力主张,那么最重要的承诺仍有待验证。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page