top of page

Google DeepMind WeatherNext 为飓风预报员争取了额外一天

8月11日
讀畢需時 14 分鐘

根据发表在《Nature》上的一项同行评审评估,Google DeepMind 将飓风预报能力向前推进了约24小时。据称,其 WeatherNext 系统能够在提前三天时达到现有模型提前两天的准确度。

在飓风 Melissa 于2025年10月登陆牙买加之前,这一提升已得到实际体现。WeatherNext 在提前五天时给出了其以5级飓风强度登陆的80%概率,而成熟模型之间的一致性较低。

这一结果挑战了热带气旋预报中长期存在的分工。全球模型通常能够较好地预测风暴路径,而专门的区域模型则侧重于强度。WeatherNext 旨在通过单一概率系统同时预测两者。

这并不是 AI 与气象预报员之间的简单较量。真正有意义的竞争,是新的集合预报指导信息与支持人工预报的既有物理模型体系之间的比较。

这一差异很重要,因为 Google 的系统并未发布牙买加的预警。美国国家飓风中心(National Hurricane Center,NHC)将其输出与 HAFS 模型、卫星观测、飞机侦察和预报员判断结合使用。

因此,WeatherNext 是一种补充工具,而非国家气象服务机构的自动化替代品。它的价值取决于更早发出的信号能否在不同风暴、地区和异常大气条件下保持可靠。

Google DeepMind 将研究成果转化为业务化证据

WeatherNext 的重要性在于,预报员在真实飓风季中、尚未得知结果前,就已使用其预测。

Google DeepMind 和 Google Research 开发了这套气旋系统,并在2025年飓风季期间向 NHC 提供预报。该模型可生成最长提前15天的可能路径、强度、尺度、结构和形成情景。

这项新的 Nature study 对这一业务化预报工作进行了评估。其核心发现更适合被理解为有效预报提前量的提升,而不是所谓完美预测。

在整个评估中,WeatherNext 为热带气旋行为带来了约额外一天的预测能力。WeatherNext 提前三天的预报,达到了竞争系统提前两天时的大致准确度。

这种差异具有业务意义。随着风暴逼近,应急管理人员需要作出成本更高、影响更大的决策,包括疏散、启用避难所、医院准备和交通停运。

如果预报能提前一天达到有用的置信水平,这些行动便可从最后数小时提前部署。它也能让官员有更多时间向公众说明其中的不确定性。

WeatherNext 生成的是集合预报,即一组合理的未来情景,而非一个自称确定无疑的答案。这些情景之间的离散程度,能让预报员了解最可能的结果以及合理的替代情景。

在 Melissa 的早期发展阶段,该系统生成了50种情景。其中约80%指向其将在五天后以5级飓风强度登陆牙买加。

Google 表示,这一概率在登陆前三天升至接近100%。Melissa 随后于2025年10月28日以5级飓风强度袭击牙买加。

这项预报不只是识别登陆地点。模型还捕捉到了快速增强,即24小时内风速至少增加每小时35英里。

快速增强仍是最难预判的飓风行为之一。海洋热量、风切变、水汽以及风暴内部结构的微小变化,都可能迅速改变结果。

据 Google 的 Melissa case study 称,在一个系统风速仍为1级飓风水平时,NHC 过去从未预报过其将达到5级强度。这使得这项预报成为一次异常严苛的业务化测试。

Melissa 也是有记录以来登陆牙买加时强度最强的飓风。世界气象组织后来因该风暴在加勒比地区造成的破坏而将其名称退役。

不过,WeatherNext 并未单独在提前五天发布官方预警。NHC 将其信号与专门的飓风模型,以及来自卫星和飞机的直接观测一并纳入考量。

这一工作流程是故事的核心。进展来自于将 AI 指导信息置于专家预报流程之中,让人们能够将其与独立证据进行比较。

这一结果将 WeatherNext 从令人印象深刻的回顾性演示,转化为业务化证据。它并未解答所有问题,但提高了未来气旋模型的标准。

为什么多出一天会改变预报的利害关系

额外一天只有在具备足够置信度、能够支持更早且合理采取行动时才有意义。

应急准备并不是在飓风抵达海岸时才开始。官员必须决定何时开放避难所、转移脆弱群体、保护基础设施,以及调配食品或医疗物资。

每项决策都取决于多个不确定变量。风暴中心路径固然重要,但其风场、强度、降雨、移动速度以及登陆前可能发生的变化也同样关键。

传统指导信息往往带来实际取舍。全球数值模型能够捕捉大尺度大气引导形势,但其网格可能会平滑决定飓风强度的紧凑结构。

区域系统在风暴周围采用更高分辨率。它们能更清晰地表征对流和内核过程,但覆盖的全球背景较少,而且需要大量计算资源。

WeatherNext 通过联合训练来应对这一分工。它从全球大气分析数据和专门描述历史热带气旋的档案中学习。

Google 早期的技术介绍称,这一训练档案包含45年间观测到的近5,000个气旋。这些记录包括路径、强度、尺度和风圈半径信息。

该模型将这些风暴特征与周边全球大气结合起来。这一设计使其能够将气旋的内部演变与引导其路径的大尺度气流联系起来。

在覆盖2023年和2024年的测试中,Google 报告称,其提前五天的路径预报平均比 ECMWF 的全球集合预报更接近实际位置140公里。这些结果在 Melissa 预报之前就已发布。

同一项评估将 WeatherNext 提前五天的准确度,与物理集合预报提前三天半时的表现相当。这意味着额外约36小时的路径预报能力。

如今,这项同行评审工作将整体进步描述为:在业务化热带气旋预报中约提前24小时。这比此前最强的比较结果更保守,但依然显著。

更早的预警并不会自动导致更早的疏散。主管部门必须考虑运输能力、公众信任、地理条件,以及依赖后来可能变化的预报采取行动所带来的成本。

不必要的疏散可能使人们面临风险,并降低他们在未来风暴中的配合度。等待过久则可能让居民被困在拥堵道路上,或令应急机构失去准备时间。

概率有助于官员管理这种张力。由50个成员组成的集合预报可以显示,严重结果仅出现在少数情景中,还是主导了模型的概率分布。

Melissa 给出了更强的一类信号。每五个模拟情景中,就有四个指向其将在五天后以5级飓风强度登陆牙买加。

这并不意味着结果已成定局。它让预报员有理由将最坏结果视为首要可能性,同时继续核查新的观测数据。

随后,牙买加气象部门拥有了更多时间来传达危险并支持准备工作。Google 表示,更早的通知帮助官员调动资源并协调疏散。

没有任何模型能够证明一项预警避免了多少损失。准备工作的结果取决于政府能力、基础设施、公众反应以及风暴最终路径。

不过,提前量具有明确的业务价值。当预报能够在道路封闭、通信中断或危险条件开始前支持行动时,它就更有用。

WeatherNext 的结果将关注点从原始基准分数转向决策时机。它最重要的输出不只是更小的误差数字,而是更早、可采取行动的信号。

Google DeepMind 天气模型如何结合路径与强度

这项技术进步来自于将风暴及其周边大气作为一个概率系统进行预报。

数值天气预报以支配运动、热量、气压、水汽和其他大气过程的物理方程为起点。超级计算机在三维网格上反复求解这些方程的近似形式。

这一方法仍是业务化预报的基础。它也伴随着成本,尤其是在机构需要运行大量模拟以描述不确定性时。

AI 天气模型采取不同路径。它们从历史数据中学习反复出现的大气状态转变,并利用这些模式来预测下一状态。

早期机器学习系统在大尺度天气场和气旋路径方面表现良好。许多系统在飓风强度预测上遇到困难,因为粗粒度训练数据往往不足以呈现风暴最强的风力。

WeatherNext 通过在两个相互关联的数据源上训练来解决这一弱点。全球部分描述周边大气,而气旋记录则保留了通用数据集可能模糊处理的风暴特定特征。

这一架构使模型能够表征引导气流和强度。引导气流指的是推动气旋穿越海洋盆地的大尺度风。

该系统也是概率性的。它不会将一个初始条件延伸为一个未来结果,而是从同一起点生成许多在物理上相互关联的情景。

这些情景很有价值,因为天气不确定性会随预报时间增加而扩大。大气中的微小差异,数天后可能演变为明显不同的风暴路径或强度。

Google 于2025年在 Weather Lab 推出了首批实验性气旋预报。该公开界面让专家能够近乎实时地将 AI 预测与成熟的物理指导信息进行比较。

该公司表示,其实验模型可预测路径、强度、尺度、形状和潜在形成过程。它还发布了两年多的历史预报,供独立分析。

WeatherNext 2 扩展了这一底层方法。它使用 Functional Generative Network,这是一种旨在生成多样但内部一致的天气结果的系统。

Google 表示,WeatherNext 2 可以在单个张量处理单元上不到一分钟内生成数百种情景。基于物理的集合预报通常需要显著更多的计算时间。

速度改变了预报中心能够测试的内容。研究人员可以生成更大的集合预报、研究低概率结果,或在无需预留整台超级计算机的情况下重复运行实验。

然而,计算只是其中一项优势。更重要的技术问题是,这些情景是否具有经过校准的概率,并能在罕见、高影响事件中保持可信。

模型可以绘制出逼真的飓风图像,却仍然错误地判断其路径的可能性。它也可能预测对了路线,却低估最大风速。

WeatherNext 在梅丽莎上的表现之所以引人注目,是因为它将这两个维度结合起来。该系统既预判了在牙买加登陆,也预判了登陆前的极端快速增强。

该模型并非在没有物理信息的情况下运行。其全球训练数据来自基于观测和数值同化系统构建的大气分析资料。

这种依赖关系使“AI 已取代物理学”这类简单化说法变得复杂。该模型从由卫星、气象站、飞机、浮标和物理模型共同建立的科学数据基础设施中学习。

更准确的描述是,它构成了一层快速的新型预报能力。它将这些记录转化为额外的概率指引,供专家与传统输出结果进行比较。

这一机制解释了为何 Google DeepMind 的进展更可信地应被视为增强,而非自动化。AI 扩展了预报结果集合,而受过训练的气象学家仍负责解读其中的分歧。

既有预报系统承受压力,但并未过时

WeatherNext 促使单个预报模型改进,但也强化了对多元化指引体系的需求。

主要竞争对象并非某个特定气象机构,而是既有模型体系在综合路径和强度预报方面较短的有效提前期。

该体系包括 ECMWF 的 Integrated Forecasting System 等全球系统,以及 NOAA 的 Hurricane Analysis and Forecast System 等区域模型,后者简称 HAFS。

NHC 还会使用统计指引、共识产品、卫星分析、雷达、海洋观测和飓风猎人测量数据。人工专家将这些来源整合为一份官方预报。

在梅丽莎期间,传统指引并未发出一致信号。一些预测倾向于认为海地附近的系统较弱,而 WeatherNext 则日益聚焦于灾难性的牙买加登陆。

这种分歧让 AI 模型有机会提供额外信息。它也说明,预报员不能依赖于刚刚取得令人印象深刻成功的那一个模型。

NHC 风暴报告指出,在系统仍受风切变影响时,Google DeepMind 的指引最初将梅丽莎预报得较弱。随着条件演变,预报表现发生了变化。

同一报告称,梅丽莎的官方强度预报优于几乎所有可用指引。这一发现强化了人工综合判断的重要性。

Google 表示,在完整的 2025 年飓风季中,WeatherNext 成为路径和强度预报表现最好的单个指引模型。这一说法基于 NHC 的年度检验流程。

单个模型可以在某一季的排名中领先,但并不能取代官方预报。预报员往往能通过识别偏差并结合互补指引,胜过任何单一系统。

因此,WeatherNext 从三个方面加大了竞争压力。首先,它证明单个全球 AI 系统能够同时提供有用的路径和强度预测。

其次,其快速集合预报挑战了概率预报背后的计算假设。各机构可能无需匹配规模最大的传统计算预算,就能获得更多情景。

第三,其业务化部署提高了对证据的要求。未来的 AI 气象系统需要实时、前瞻性评估,而非精心挑选的历史风暴案例。

Microsoft 的 Aurora 提供了一个比较对象。其地球系统模型在涵盖多个地区的回溯测试中,优于数项官方路径预报。

ECMWF 也开发了其 Artificial Intelligence Forecasting System。其他研究团队还推出了包括 Pangu-Weather、FuXi 和 FourCastNet 在内的系统。

这些模型在训练数据、分辨率、架构、初始化方式和预期用途上各不相同。标题式比较可能掩盖这些差异,并造成这是一场简单竞赛的不公平印象。

业务气象学家很少会选定一个放之四海而皆准的赢家。模型表现会随海盆、提前期、风暴结构和大气形势而变化。

一个在大西洋路径预报上表现最佳的系统,可能难以应对西太平洋的强度预报。另一个系统可能擅长两天预报指引,却在五天后迅速失去技巧。

这种变异性表明,应将经过充分测试的 AI 系统纳入共识指引。它并不支持移除那些能够揭示 WeatherNext 是否为离群值的独立模型。

多样性还能保护预报业务免受共同失效模式的影响。多个在相似再分析产品上训练的 AI 模型,可能在陌生事件中重复出现同样的偏差。

基于物理的系统提供了另一条证据线。直接观测随后可以确认任一模型家族是否正确刻画了风暴。

WeatherNext 最强的贡献在于,它能够更早改变这种证据平衡。当其集合预报先于其他指引收敛时,预报员便获得了一个值得调查的明确信号。

该系统的影响力来自反复验证的准确性,而非其由 Google DeepMind 所有。业务机构将继续把它与所有可用替代方案进行衡量。

这些数字尚未证明什么

一场异常突出的飓风和一个表现强劲的季节,无法确立其在每个气旋海盆中的普遍可靠性。

梅丽莎具有说服力,因为该预报具有前瞻性并带来了实际后果。但它也是单一的极端事件,这限制了研究人员仅凭它所能得出的结论。

热带气旋在大西洋、太平洋和印度洋之间存在显著差异。观测质量、风暴结构、环境气流和历史数据覆盖度在这些区域均有所不同。

WeatherNext 从数千场过去的风暴中学习,但罕见事件在其训练记录中依然罕见。5 级登陆和快速增强过程提供的案例相对较少。

气候变化会进一步使历史学习复杂化。更温暖的海洋和变化中的大气模式,可能形成在旧数据中极少出现的组合。

这并不意味着模型会随着气候变化而失效。这意味着研究人员必须检验其在分布转变下的表现,即未来条件与训练记录不同时的表现。

概率校准尤其需要严格审查。一个 80% 的预报,在大量可比较的预测中,实际发生率应大致为十次中的八次。

梅丽莎一次正确的 80% 判断,并不能证明这种校准成立。研究人员需要规模大得多的预报集合,其中也应包括减弱或转向离开的风暴。

误报同样重要,因为官方预警会带来经济和社会成本。一个经常倾向于灾难性结果的模型,可能提供早期信号,却会削弱公众信任。

漏掉极端事件则会造成相反的危险。即使系统低估了最关键的风暴,平均准确率也可能看起来非常出色。

因此,研究人员必须考察条件性表现。这包括快速增强、登陆地点、风暴规模、降雨、风暴潮,以及接近山区时的变化。

Nature 的论文提升了 WeatherNext 的科学地位,但同行评审并非业务验证的终点。预报中心需要在实时条件下开展反复、按区域划分的测试。

2026 年 3 月的一篇Nature 评论呼吁,在公共机构广泛采用 AI 预报前进行更严格的评估。即便在一个成功的飓风季之后,这一担忧仍然适用。

透明度是另一个问题。预报员需要在紧急情况下信任模型之前,了解其已知偏差、输入依赖、更新时间表和失效模式。

开放访问可帮助独立团队复现结果,并测试 Google 未选择的案例。然而,仅有代码可用并不能保证完全可复现。

研究人员还需要训练规格、初始化数据、评估程序和充足的计算资源。只要其中任一组件发生变化,业务模型的表现就可能不同。

预报机构还必须考虑连续性。国家气象部门需在数十年间对预警负责,而商业研究的优先事项可能发生变化。

各机构需要稳定的访问权限、技术支持、归档预测,以及服务不可用时的明确程序。这些要求超出了模型准确率本身。

WeatherNext 也不会直接预报所有影响。强劲的路径和强度预测,仍需转化为对风暴潮、内涝、山体滑坡和基础设施风险的判断。

在这一阶段,本地专业知识尤为重要。牙买加的地形、住房、道路和应急能力,决定了同一风力预报会如何影响不同社区。

Google 明确表示,Weather Lab 的输出属于实验性结果,并非官方预警。用户应依赖国家气象主管机构作出安全决策。

这一警告并非无关紧要的免责声明。它界定了面向公众的 AI 工具与依法负责危险天气信息传播的机构之间应有的边界。

现有证据支持一个审慎的结论。WeatherNext 为梅丽莎提供了有价值的业务指引和非同寻常的早期信号,但可靠性必须在一个又一个季节中赢得验证。

WeatherNext 接下来的三项考验

下一阶段关乎可重复性、独立验证,以及在预报业务中的采用。

第一个值得关注的信号,是 WeatherNext 在整个 2026 年飓风季中的表现。完整的一年将揭示其 2025 年的优势能否在不同风暴中持续。

路径和强度评分应按海盆和提前期公布。快速增强案例应单独评估,因为平均值可能掩盖对最危险事件的失误。

如果 WeatherNext 在这些类别中仍保持领先模型地位,“多出一天”的说法将变得有力得多。若出现明显退步,则会将梅丽莎界定为一次非凡的成功。

第二个信号是 Google 和 NHC 之外的独立评估。菲律宾、台湾、印度尼西亚和越南等机构,正探索围绕该系统开展合作。

这些地区拥有多样的气旋行为和预报环境。若在那里也取得强劲结果,将表明该模型能够泛化到大西洋和东太平洋之外。

独立研究人员还需要获得历史预报、观测结果和评估代码。开放的方法能够在机构依赖它们之前暴露区域性偏差。

第三个信号是更深入的业务整合。WeatherNext 已经贡献预报指引,但各机构必须决定其概率结果应如何影响共识产品和预报讨论。

NOAA 正资助评估用于热带气旋业务的 AI 天气预测模型。这项工作涵盖路径、强度、生成、不确定性,以及与现有共识指引的整合。

当各机构公布一致的检验统计数据,并记录 AI 输出如何进入预报员工作流程时,业务采用将变得清晰可见。正式试验平台的结果将比产品演示更重要。

人工判断的作用应保持明确。梅丽莎之所以成功,是因为预报员将 AI 信号与 HAFS、卫星、飓风猎人数据及自身经验进行了比较。

这种混合系统具有实际优势。AI 可以快速扫描已学习到的大气模式,基于物理的模型提供独立模拟,而观测则追踪风暴的实际状态。

因此,Google DeepMind 的成果指向了一个分层式的预测未来。胜出的方案并不是由单一模型在未经审查的情况下发布预警。

而是由多种预测方法组成的系统,足够早地揭示一致之处、分歧和不确定性,让专业人员能够采取行动。WeatherNext 让这一系统更快,也可能提供更多信息。

只有通过值得信赖的机构将额外的一天传递给社区,它才会在大规模应用中变得有意义。预测准确性必须与清晰的预警、可获得的避难所、交通安排和本地准备工作相衔接。

对开发者和研究人员而言,当务之急是在那些不太令人印象深刻的案例中测试该模型,包括从未登陆的风暴。平静的成功案例和误报,都应成为证据的一部分。

对公共机构而言,问题在于:当 WeatherNext 与既有指引相冲突时,应给予它多大权重。答案应随着实测表现而变化,而不是受宣传影响。

对读者而言,最稳妥的应对方式依然很直接:将 AI 预测视为参考,遵循官方警报,并关注独立验证是否证实 Google DeepMind 的一天领先优势。

WeatherNext 已经跨越了一个重要门槛:它曾在一次真实的 5 级紧急事件中提供帮助。如今,它必须证明,Melissa 是可靠记录的开端,而非定义这一记录的例外。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page