top of page

NVIDIA Earth-2 空气污染预测挑战英国高算力建模路径

9月17日
讀畢需時 14 分鐘

尽管大气化学对算力要求极高,NVIDIA Earth-2 空气污染预测研究仍在两天训练后产出了覆盖全英国的模型。University of Manchester 的研究人员改造了 NVIDIA 的天气 AI,以约 2 至 3 平方公里的报告分辨率生成污染分布场。这项工作将部分空气质量建模从国家级超级计算基础设施转移到桌面 AI 系统上。

这一转变才是真正的重点。传统化学传输模型计算污染物如何反应、移动、扩散并离开大气。它们仍是运行级预测的核心,但计算需求限制了分辨率、更新频率,以及研究人员能够测试的情景数量。

Manchester 项目提出了另一种平衡方式。研究人员使用成熟的化学-气候模拟作为训练数据,再让生成式模型学习复现并延展其空间模式。NVIDIA 表示,由此形成的工作流支持全国尺度建模、随时间变化的预测,以及在其 DGX Spark 桌面系统上进行较小规模的再训练。

这项公告并未证明 AI 能取代成熟的运行级模型。它表明,一个研究团队可以在有限训练时间内,将面向天气的生成式工具迁移至大气化学工作流。罕见事件中的准确性、不确定性估计以及独立的运行验证,仍都是悬而未决的问题。

NVIDIA Earth-2 空气污染预测从天气走向化学

University of Manchester 为污染研究改造了两款 Earth-2 模型,将天气 AI 转化为候选的空气质量预测工作流。

Professor David Topping 和博士研究员 Hao Zhang 与 NVIDIA 合作,将 CorrDiff 和 StormCast 应用于英国污染分布场。该公司在其 2026 年 9 月 15 日发布的污染研究项目中介绍了这一项目。

CorrDiff 是一种生成式降尺度模型,即将粗粒度的大气信息转化为更精细的空间细节。NVIDIA 的 CorrDiff documentation将其描述为两阶段系统:先预测平均结果,再施加基于扩散的校正。

这一架构最初是为天气变量设计的。Manchester 的研究人员则利用现有化学-气候模拟生成训练数据。这些源模拟已涵盖天气、排放、传输和大气反应之间的关系。

团队使用了一年按小时采样的英国模拟污染数据。NVIDIA 表示,所得模型以约 2 至 3 平方公里的分辨率覆盖全国,并在 Isambard-AI 的一个八 GPU 节点上完成了两天训练。

Isambard-AI 是位于 University of Bristol 的英国国家级 AI 超级计算机。该系统配备 5,448 个 NVIDIA GH200 Grace Hopper Superchips,据称可提供 21 exaflops 的 AI 性能。这些规格说明了基础设施背景,但 Manchester 的实验仅使用了一个节点。

研究人员随后加入了 Earth-2 系列中的另一款模型 StormCast。StormCast 支持可整合空气质量观测数据的时变预测。这一补充让项目从静态重建迈向对随时间变化条件的预测。

团队还在 DGX Spark 上展示了测试、训练和推理工作流。推理是指利用已训练模型根据新输入生成输出的过程。NVIDIA 表示,这一桌面系统能够运行污染工作流,并支持较小规模的再训练任务。

这些步骤代表的是技术迁移,而非运行级部署。一个为天气变量开发的框架被重新用于污染物浓度。研究人员并未完全抛弃物理建模,而是继续以模拟大气数据为基础。

这一区别很重要。该系统从化学-气候模拟中学习,因此传统建模仍处于工作流之中。Earth-2 充当模拟器和降尺度层,可在训练后以更低成本生成输出。

因此,眼下的变化并非物理机制被消除,而是将重复性的预测和情景生成转入更快速的统计模型。这可让获取国家级计算资源有限的研究人员开展更多实验。

团队称,初始 CorrDiff 模型在首次训练尝试中便成功运行。这一结果表明该架构迁移较为顺利,但并未提供正式的准确性基准。NVIDIA 的公告也未附带同行评审评估。

该项目仍确立了一个有价值的概念验证。它表明,大气化学输出可以纳入已用于天气的生成式框架,也展示了一个横跨国家级基础设施与桌面 AI 计算机的工作流。

这种组合对一种既有假设构成挑战:细致的污染分析必须依赖大型且难以频繁获取的计算系统。

空气污染的健康负担让预测速度至关重要

更快的预测之所以重要,是因为暴露情况会随小时和社区而变化,而公共卫生决策往往需要在污染达到峰值前采取行动。

根据 Royal College of Physicians 的健康负担估计,空气污染在 2025 年造成了约 30,000 例英国死亡的等效影响。该组织还估计,医疗保健、生产率损失和生活质量下降带来的年度经济成本超过 270 亿英镑。

这些数字描述的是人口层面的危害,而非可逐一确认的死亡案例。它们反映了可归因于长期暴露的死亡率统计估计。这一区别并不降低其政策重要性,但避免了对该数字作过于字面的解读。

暴露情况在空间上的差异也十分显著。交通走廊、工业区域、天气模式、地形和建筑密度,都可能使同一座城市中出现不同状况。全国平均值无法告诉哮喘患者明天其所在社区将面临什么情况。

传统化学传输模型通过在地理网格上表示污染来解决这一问题。它们模拟排放、化学反应、大气运动和清除过程。然而,更精细的网格需要更多计算,尤其是在研究人员模拟多种化学物种时。

将化学过程加入天气建模会增加另一层复杂性。每个时间步都必须考虑污染物与环境条件之间的相互作用。提高空间分辨率会成倍增加需要计算这些关系的网格单元数量。

这造成了一种实际妥协。机构可以降低详细模型的运行频率,使用更粗的网格,简化其化学过程,或仅针对特定问题保留高强度情景。没有一种选择能完全满足频繁提供本地指导的需求。

Topping 将计算需求视为该项目的核心限制。他的团队提出的问题是,生成式天气模型能否学习污染分布场并更快地重现它们。这一框架将 Earth-2 直接与公共卫生中的调度问题联系起来,而不是将其作为一般性的 AI 演示。

一种拟议用途是,医疗保健机构在空气质量恶化前联系脆弱患者。区域服务机构可能提醒哮喘患者,次日或下一周预期的空气状况。患者可据此调整户外活动,或遵循既有的临床指导。

这一设想仍处于前瞻阶段。NVIDIA 的公告并未描述 NHS 部署、临床研究或实时预警服务。它呈现的是一种潜在应用,前提是预测系统达到足够的准确性与可靠性。

另一种情景涉及野火期间的快速响应。研究人员正在探索将该模型与边缘 AI 传感器连接;这类传感器可在观测点附近处理数据。随着烟雾状况变化,新的测量数据可以更新预测。

这一工作流所需的不只是快速推理。传感器校准、地理覆盖范围、通信可靠性和数据同化都会影响结果。应急决策者还需要不确定性信息,而不只是单一的预测浓度。

政策模拟是更接近现实的研究用途。更快的模型可以生成大量涉及交通规则、工业排放、供暖或其他干预措施的情景。分析人员无需针对每种变化重新运行完整的化学模型,便可比较潜在结果。

生成速度也可能支持集合预测,即由不同输入或模型条件构成的一组预测。集合预测可通过展示一系列合理结果来帮助估计不确定性。成本较低的模拟器可在相同计算预算内生成更多成员。

因此,其意义并不止于绘制一张色彩鲜明的污染地图。更快的处理可提升预测频率、情景数量和本地细节。只有当预测仍具备卫生与政策决策所需的科学可靠性时,这些提升才有价值。

核心较量在于 AI 模拟与完整化学模拟

Earth-2 降低了生成污染分布场的成本,但完整化学模型保留了数据驱动系统可能难以泛化的物理关系。

化学传输模型仍是网格化空气质量预测的成熟路径。它们在三维空间中表示排放、大气传输、化学转化和沉降。其方程提供了物理基础,可用于测试历史记录之外的条件。

这种结构在政策变化改变排放时尤为有用。模型可以估算减少某一种污染物或改变其地理来源的后果,也可以表示排放后形成二次污染物的化学相互作用。

计算成本直接源于这些细节。更多污染物、反应、垂直层和网格单元意味着需要更多处理能力。研究人员还必须运行天气输入,并在生成预测前更新排放清单。

Earth-2 改变了这些成本发生的位置。Manchester 团队首先利用现有化学-气候模拟生成训练数据集。随后,研究人员承担集中式训练成本,使 AI 模型能够更高效地生成后续输出。

CorrDiff 提供了更高分辨率的空间结构。其第一个组件预测预期的精细尺度分布场,而扩散组件则增加逼真的变异性。该方法可以生成多个合理结果,而非仅输出一个平滑估计。

StormCast 则加入了时间行为和对观测数据的直接利用。这一点很重要,因为空气污染是不断演变的,而非一张张彼此独立的日度地图。预测需要在相邻时间步之间保持一致性。

该工作流类似于一种代理模型,用于近似较慢的科学计算。当用户需要评估大量情景时,代理模型很有价值。它的弱点在于依赖训练期间所涵盖的数据与条件。

物理模型同样可能出错。排放清单可能已经过时,边界条件可能存在不确定性,简化的化学过程也可能引入偏差。当网格无法解析道路、建筑物或小型排放源时,局地预测尤其困难。

AI 模型的失效模式则不同。它们可能从被视作训练真值的模拟结果中学习偏差,也可能生成看似可信、却不遵循守恒定律或已知化学规律的模式。

因此,这场竞争并不只是旧软件与新软件之间的较量,而是完整计算与学习型近似之间的比较。两条路径各自提供了对方所缺少的能力。

一项 2023 年的混合预测研究展示了另一条路径。研究人员通过集合卡尔曼滤波器,将机器学习预测与 GEOS-Chem 输出结合起来。该系统利用观测数据提升局地准确性,同时保留化学模型提供的连续网格覆盖。

这种混合方法为曼彻斯特项目提供了有益的参照。纯机器学习在监测数据密集的地区可以表现出色。化学模型能够填补地理覆盖空白,但仍会保留系统性偏差。

曼彻斯特使用模拟训练数据的做法,已经以间接方式结合了两种传统。AI 学习由化学模型产生的空间关系,而 StormCast 随后引入观测数据,将预测拉向实测状况。

压力将首先落在研究工作流上,而不是国家级预报服务。大学团队往往面临有限的计算资源配额和漫长的排队时间。可在桌面系统运行的模型,能够缩短从一个想法、一次实验到修订模型之间的周期。

桌面运行也改变了使用门槛。据报道,Topping 可以在自己的办公室重新训练模型,而无需在每个步骤都依赖专用超级计算机配额。即使最初的全国尺度训练仍可受益于 Isambard-AI,这也让迭代测试变得更容易。

该项目还可能将参与范围扩展至大气建模专家之外。Earth-2 提供可复用的模型架构、库和部署工具。研究人员仍需要领域知识,但不必从零开始构建每一个机器学习组件。

运营机构面临更高标准。它们需要可预测的更新频率、长期维护、经过验证的不确定性,以及在危险事件期间的可靠表现。它们还必须说明预警为何发生变化,以及模型是否依然可信。

因此,Earth-2 更可能先增强化学传输模型,而非取代它们。它可以加速降尺度、情景探索和集合预报生成。完整模型则可继续生成训练数据,并提供物理参考基准。

如果 AI 工作流被证明准确,最大的变化将是经济层面的。研究人员可以将昂贵的化学模拟留给创建参考数据集和测试新条件,并在两次模拟之间使用模拟器进行重复分析。

这种分工将推动大气科学朝天气预报中已出现的模式发展:大型数值系统提供训练和初始化数据,而 AI 模型生成快速预报与局地产品。曼彻斯特项目正在检验污染化学是否也能走上这条道路。

准确性、极端事件与街道尺度主张仍未得到解决

该项目报告了速度和可移植性,但尚未公布公共卫生或应急应用所需的验证证据。

NVIDIA 的介绍提供了若干具体工程结果。训练使用了一年的逐小时模拟数据,覆盖英国,在一台配有八块 GPU 的节点上耗时两天完成。其还报告了两到三平方公里的空间分辨率。

这些数字描述的是工作负载和输出颗粒度,而不是预报能力。该公告没有提供误差率、基线对比、按污染物划分的结果,也没有独立测试期的数据。

分辨率尤其容易被误读。模型可以为较小网格单元生成数值,却未必能准确捕捉单元内部的实际状况。输出分辨率衡量的是网格间距,而非经过验证的局地精度。

团队计划加入开放数据,并朝街道尺度建模迈进。街道环境会带来国家级网格通常无法解析的排放和气流模式。建筑物会形成狭窄的风道,而附近交通排放可能主导暴露水平。

因此,实现街道尺度不只是生成更小的像素。研究人员需要合适的排放数据、监测覆盖、土地利用信息和验证站点。模型还必须能够区分真实的局地结构与看起来合理的生成细节。

极端事件构成另一项考验。野火烟霾、异常高温、静稳空气和突发工业排放,可能落在常规训练条件之外。使用一年数据训练的模型,可能没有见过足够多的案例来学习所有危险组合。

一项 2025 年的预测综述将极端事件中的泛化能力列为深度学习的核心挑战。该研究还强调了不确定性诊断、可解释性,以及耦合过程中的累积误差。

这些担忧在此直接适用。模型的平均表现可能不错,却遗漏对公共预警最重要的事件。仅凭平均准确率不足以证明其已具备应用条件。

训练数据带来另一层依赖。曼彻斯特系统从化学—气候模拟中学习,因此这些模拟中的错误可能成为 AI 模型的一部分。基于观测的校正有所帮助,但监测网络存在空间空白和仪器局限。

因此,StormCast 对观测数据的使用很重要,但这种整合仍需评估。研究人员必须展示测量结果多快会影响预报,以及校正在监测站点之间是否保持稳定。他们还需要针对传感器数据缺失或故障制定程序。

不确定性的沟通同样重要。医疗机构不应收到一个看似精确、却没有置信范围的数字。决策者需要知道何时证据支持发布警报,以及何时模型分歧意味着应当保持谨慎。

可解释性对政策模拟同样重要。如果一项排放干预产生意外结果,分析人员必须判断这是否由大气化学过程所解释。仅凭统计关联未必足以支撑监管决策。

该公告还来自 NVIDIA,而该公司正是模型与硬件的提供方。其关于性能和可及性的表述应被视为企业自行报告的结果。同行评议论文或独立基准测试将提供更有力的证据。

曼彻斯特已经运营 ManUniCast,这是一个提供英国每日空气质量数据的教学预报门户。不过,该网站明确表示它是一项教学工具,而非运营中的预报服务。新的 Earth-2 工作不应被误认为公共预警系统。

这一界限同时保护研究人员和用户。实验模型需要有失败、改进和暴露弱点的空间。运营服务则必须优先保障连续性与审慎沟通。

监管机构和公共卫生部门也需要稳定的溯源记录。它们必须知道哪些数据训练了模型、哪个版本生成了预报,以及更新如何改变了性能。当指导意见影响公众行为时,可复现的记录就变得至关重要。

开放模型有助于接受审查。研究人员可以检查工作流、重跑实验并比较模型版本。开放本身并不保证科学可靠,但会降低独立测试的门槛。

最可信的下一步,是针对观测数据与现有英国预报开展透明评估。这项比较应涵盖多种污染物、季节、地区和罕见事件,也应区分插值能力与真正的预报能力。

在这些结果出现之前,Earth-2 应被视为一项前景可观的研究加速工具。其报告的速度具有意义,但速度无法替代校准、不确定性或外部验证。

NVIDIA Earth-2 空气污染预报接下来会发生什么

三项信号将决定该项目能否成为有用的基础设施:公开验证、运营合作伙伴关系,以及可信的街道尺度测试。

第一项信号是详细的科学评估。研究人员应报告其相对于留出监测数据和既有预报系统的表现。结果需要覆盖细颗粒物、二氧化氮和臭氧等常见污染物。

有力的评估将涵盖多个季节和异常事件,并衡量平均误差、峰值检测、地理偏差以及预报性能随时间的衰减。概率预报也应接受校准测试。

公开比较将增强 AI 模拟的论证基础。若模型在峰值期间表现较弱,则支持继续依赖传统模型发布预警。即使结果好坏参半,Earth-2 仍可能适用于情景分析或研究型降尺度。

第二项信号是运营合作伙伴关系。医疗服务机构、环境机构或地方政府可以在受控试点中测试预报。这类项目将揭示快速建模是否能改善实际决策。

试点不应从自动向患者发送警报开始。它可以先与现有系统并行静默运行,让专家在不影响公众的情况下比较预测。研究人员随后可以识别误报、漏报事件和区域不一致性。

如果这种影子评估取得成功,后续可以开展有限的咨询用途。医疗团队可将模型作为多项输入之一。环境分析人员则可在委托更昂贵的模拟之前比较干预情景。

第三项信号是街道尺度验证。NVIDIA 表示,曼彻斯特团队计划纳入更多开放数据并提高分辨率。关键结果不会只是一个更小的网格标签。

研究人员必须证明,更精细的输出与独立的局地测量相符。测试应覆盖道路、住宅区、工业区以及远离监测站的地点,还应检验模型表现是否会随社区贫困程度而变化。

成功的局地验证将强化公共卫生层面的论据。它可能支持更具针对性的指导,并揭示区域平均值所掩盖的污染差异。若失败,则说明生成式降尺度只增加了视觉细节,却没有提供可靠的局地信息。

硬件可及性仍将是故事的一部分。初始模型训练需要 Isambard-AI,但据报道,较小规模的工作可在 DGX Spark 上运行。其他研究团队还需要在自己的系统和数据集上复现这种可移植性。

Earth-2 空气污染预报还需要可持续的数据管道。逐小时观测、排放估算和天气输入按照不同的时间表到达。每个来源都需要质量控制和有据可查的更新。

部署后的模型维护同样重要。随着车队、工业活动和能源系统的发展,污染源会发生变化。即使软件仍在正常运行,AI 模型也可能变得陈旧。

研究人员应公开再训练触发条件和版本历史,也应报告更新所需的计算资源与能耗。低成本推理的说法,并不能涵盖训练和数据准备的完整生命周期。

更广阔的机会依然可观。更快的模型能够支持更多实验、更多集成成员,以及更精细的本地化分析。它们能帮助研究人员提出过去因成本过高而无法反复验证的问题。

不过,该项目的价值取决于严谨的定位。它并不证明生成式 AI 已经解决了大气化学问题,而是证明了经过学习的近似方法可以将高要求工作流迁移至更易获得的硬件上。

这一结果促使既有建模项目评估混合式设计。完整化学模型或许会成为参考引擎,而不再是每次预报唯一使用的引擎。AI 模型可以承担重复生成任务,而物理系统则为其行为提供约束与锚定。

曼彻斯特大学提供了这一架构的可信演示。NVIDIA 提供了开放模型框架和计算基础设施。接下来,独立评估必须确定该系统在哪些方面值得信任。

对研究人员而言,实际问题在于:这一工作流能否在不掩盖不确定性的前提下,产出更多有价值的实验。对公共机构而言,问题则是:更快的预报能否在真实运行条件下改善决策。

值得关注的是同行评审基准测试、受控的政府机构试点,以及独立测量的街区尺度结果。这些信号将共同表明,NVIDIA Earth-2 空气污染预测究竟正在成为公共基础设施,还是仍停留在具有启发意义的研究项目阶段。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page