top of page

Google DeepMind 气旋预报提前一天预警,但并未取代人工预报员

1小时前
讀畢需時 15 分鐘

Google DeepMind 已将其气旋预测延长至15天,并报告称平均预报提前量超过24小时。这套 Google DeepMind 气旋预报系统涵盖风暴路径、最大风速和风场结构,并将这些内容整合于同一概率系统中。这一组合很重要,因为早期 AI 天气模型通常在预测移动路径方面强于预测强度。

该系统名为 WeatherNext Cyclones,在经历2025年大西洋飓风季的实时运行后,如今登上了 Nature 封面。研究人员将其与领先的全球模型和飓风专项模型进行了对比评估。结果挑战了这样一种假设:准确的强度预报必须始于极高分辨率的大气网格。

然而,真正的较量并非 AI 与人类气象学家之间的竞争。WeatherNext 依赖观测分析、历史风暴记录和业务解读。其最强结果来自研究人员将其纳入美国国家飓风中心现有的综合预报体系,而非让其独立工作。

这一差异将有用的预报工具与自动化预警系统区分开来。WeatherNext 能快速生成众多可信的未来情景,但公共机构仍需决定哪些风险足以发布正式警报。

Google DeepMind 气旋预报延长预警窗口

WeatherNext Cyclones 通过同时预测风暴路径、强度和风场范围,将预报时长延伸至15天。

这项研究于2026年8月6日在 Nature 在线发表,随后登上该刊9月17日一期的封面。Nature 封面介绍了一套为美国国家飓风中心及全球其他机构提供预报指引的系统。

热带气旋模型必须回答几个相互关联的问题:风暴中心将向哪里移动?最大风速会增强到何种程度?危险风力将从中心向外延伸多远?

仅回答第一个问题并不够。即使路径预测准确,若风暴在登陆前迅速增强或扩大,紧急事务管理人员仍可能准备不足。

WeatherNext Cyclones,也称 WN-C,在一个学习型系统中同时预测全球大气状况和风暴专属属性。它生成路径位置、最大持续风速、中心气压以及多项风圈半径测量结果。

这些风圈半径描述了风暴的实际影响范围,有助于区分紧凑型气旋与会波及更多社区和基础设施的大型系统。

该模型以六小时为步长推进,并持续预测15天。由于大气具有混沌性,它不会只给出一个确定的未来,而是生成一个集合,即从相同初始条件出发得到的一组可信预报。

Google 表示,使用一个 Tensor Processing Unit 生成一份15天预报耗时不足一分钟。该公司已将业务集合规模从2025年的50个成员扩展至2026年的1,000种情景。

当极端结果发生概率较低时,更大的集合尤为重要。即便基础条件支持某种罕见的快速增强路径,它也可能不会出现在较小的情景集合中。

该模型使用近20太字节的全球大气分析数据和约10兆字节的专业气旋记录进行训练。后者来自 IBTrACS,即 International Best Track Archive for Climate Stewardship。

IBTrACS 汇集了全球预报机构的历史观测资料。Google 称,其训练材料包含近5,000场风暴,为系统提供了气旋行为的明确案例。

这种结合至关重要。全球大气数据让模型学习大尺度引导气流、湿度、气压和温度;经过整理的风暴记录则为粗糙全球网格无法充分呈现的属性提供直接学习信号。

根据经同行评审的气旋预报研究,WN-C 在路径预报方面比最强的全球模型提前超过一天达到相同精度。在强度指标上,它也优于 NOAA 的 Hurricane Analysis and Forecast System 等专项系统。

提前一天的预报优势,并不意味着系统能在15天前准确知道风暴的确切登陆点。它意味着,WN-C 大约能比对比模型提前一天达到某一给定精度水平。

这一说法更为严格,但在业务上意义重大。若三天预报能够达到此前两天预报的误差水平,实际上便将有用的决策门槛提前了。

这种改进也不止体现在单一指标上。研究报告了路径、最大风速和破坏性大风影响范围方面的提升。这种广度正是其分量超过又一次快速全球预报演示的原因。

该模型自2025年6月起实时运行,并向美国国家飓风中心提供实验性指引。这种业务环境下的检验很重要,因为回顾性测试无法复现实时数据和预报流程中的所有复杂情况。

因此,这一事件的意义不止于期刊基准测试。一个实验性 AI 系统已进入真实预报业务,而其开发者也已发布代码和模型权重,供更广泛的审查。

为什么多出一天会改变气旋决策

额外的一天极具价值,因为疏散、人员调配、物流和公共沟通都需要在确定性到来前作出决策。

气旋预报的作用不止是在地图上画出一条线。紧急事务管理人员需要部署物资、准备避难所、安排疏散、保护医院,并调动专业应急队伍。

港口可能需要暂停运营或转移船只。公用事业公司会在道路变得不安全前部署抢修人员。航空公司和航运企业则会调整跨越远大于风暴可见中心范围的区域航线。

这些决策涉及不对称风险。准备过度会带来切实成本,但等待确定性可能会失去最安全的选择。更长的有效预警窗口让官员有更多空间权衡这一取舍。

WeatherNext 不会创造确定性。它的贡献在于可能提供更优的概率分布,尤其是在不寻常且破坏性强的结果周围。

概率分布为多个可能的未来赋予相对可能性。当微小的大气差异会导致截然不同的登陆点或强度时,它比单一确定性路径更有用。

这正是1,000成员集合的重要所在。预报员可以查看在这些情景中,某一地点出现热带风暴级、飓风级或更强风力的频率。

范围宽广的聚类可能意味着存在显著不确定性。范围紧密的聚类则可能显示更强的一致性,尽管同一模型内部的一致性并不能消除系统性误差。

Google 将这一能力与2025年10月的飓风 Melissa 联系起来。该公司称,在风暴尚弱得多时,WeatherNext 就识别出其快速增强和对牙买加构成危险的登陆情景。

快速增强通常指最大持续风速在24小时内增加至少30节。这类过程难以预测,因为风暴核心周围的微小变化可能造成破坏潜力的巨大差异。

根据 Google 的Melissa 案例研究,实验性指引支持了异常早期的5级飓风预报。人类专家将这一信号与其他模型、观测资料及自身经验一并评估。

一次成功的风暴预报并不能证明其在所有海域都可靠。不过,它展示了集合系统如何在某个情景成为主导预期前,提前揭示一个后果重大的情景。

比起单独案例,更广泛的评估提供了更有力的证据。研究人员测试了2023年至2025年的风暴,所用模型版本仅基于各评估期开始前可获得的信息训练。

这一设计降低了直接用后来作为测试对象的风暴进行训练的风险。2025年的评估还纳入了实时预报,使证据更接近实际业务条件。

路径误差提供了一个具体例子。在五天预报时效下,WN-C 的平均误差约为230公里,而 ECMWF 集合基准约为370公里。

对于三天最大风速预报,其报告的平均误差比 NOAA 专项 HAFS 模型低3.75节。HAFS 是专门面向热带气旋构建的高分辨率、基于物理机制的飓风预报系统。

这些改进可与数值天气预报约十年的历史进步相提并论。这一比较指的是精度提升速度,而非声称一次 AI 发布就能取代十年的气象科学发展。

最大的业务增益出现在综合预报实验中。热带气旋中心通常会结合多个模型,因为它们的误差各不相同。

将 WN-C 纳入美国国家飓风中心的路径综合预报后,平均误差降低了28%。将其纳入强度综合预报后,平均误差降低了6%。

较小的强度提升同样具有启示意义。传统数值模型仍提供了大量信息,尤其是关于 AI 模型无法直接解析的过程。

这正是压力落在预报工作流程而非预报员本身的原因。各机构如今需要建立方法,来校准、加权、监测和传达另一种高技能模型的结果。

问题已不再是 AI 天气预测是否值得关注,而是业务中心应如何整合它们,同时不掩盖不确定性,也不削弱问责机制。

一个粗分辨率全球模型打破了分辨率假设

核心技术惊喜在于,WN-C 能从0.25度网格预测强度,尽管气旋核心包含尺度小得多的物理结构。

0.25度网格在赤道附近对应宽约28公里的单元。专业区域飓风模型通常以更精细得多的分辨率运行。

气象学家有充分理由重视精细网格。强度取决于对流、海洋热量、湿度、眼墙变化以及海气之间的交换。

其中许多过程发生在 WN-C 大气输入所代表的尺度以下。传统模型通过更密集的区域模拟中的物理方程和参数化方案来近似这些过程。

WeatherNext 采取了不同路径。它将粗分辨率大气场与对气旋存在、位置、气压、风速和风圈半径的显式表示结合起来。

在训练期间,研究人员会围绕每个记录在案的风暴中心布置平滑概率场,也会将风暴专属测量结果映射到周围网格上。

随后,神经网络学习同时预测全球天气和气旋属性。这一联合目标比仅训练系统复现大气变量提供了更直接的反馈。

在生成预报后,追踪程序会将这些预测场转换回风暴轨迹和表格化测量结果。同一种学习到的表示机制同时控制风暴中心、强度和风场结构。

这一设计避开了一个常见的两阶段局限。许多天气模型先预测大气状态,然后再使用独立算法在输出结果中定位风暴。

粗分辨率预报可能会系统性地平滑最低气压和最强风速。追踪器无法恢复模型从未学会保留的风暴细节。

当风暴属性预测错误时,WN-C 会受到明确惩罚。因此,它能够从与这些特征相关的大尺度大气模式中推断未解析的气旋特征。

这并不意味着模型秘密重建了每一朵云或眼墙过程。它意味着,大尺度条件所包含的强度预测信息,比研究人员此前利用的更多。

该模型还使用了 Functional Generative Networks。这些网络会采样不同的模型函数,使单一架构能够生成多样且内部一致的预报成员。

根据论文,Google 早期的 GenCast 系统在每个预报步骤中需要反复调用神经网络。WN-C 每步只需调用一次,参数量约为 1.8 亿。

这一变化使该系统的采样速度约为 GenCast 的八倍。当机构需要在下一轮预报周期前生成数百或数千种情景时,速度至关重要。

训练目标同样具有概率性质。研究人员优化了一种连续排序概率评分,其会奖励既准确又校准良好的概率分布。

校准考察的是,给出的概率是否与实际出现频率相符。如果一个模型反复给出 20% 的概率,那么该事件应当在约五分之一的情况下发生。

模型即使具有不错的平均误差,也可能校准不佳。它可能生成过于集中的集合预报,使预报员的信心超过证据所支持的程度。

DeepMind 概述称,WN-C 在路径、强度和风速概率方面取得了最强结果。论文将其强度预报和风速概率描述为技能水平很高且校准良好。

这些结果挑战了业界对分辨率的假设,但并未否定高分辨率建模。精细网格对于降雨、风暴潮、阵风、地形效应以及风暴核心的细致演变仍然重要。

更谨慎的结论更具说服力。高空间分辨率并非从全球大气数据中获得有用强度预测能力的绝对前提。

WeatherNext 2-mini 将这一理念进一步推进。这个较小模型以一度分辨率运行,约为 111 公里,仍能生成有意义的气旋预报。

Google 并未声称 mini 模型能与更大版本匹敌。公开仓库明确表示,它面向较低算力环境,不应被期待具备同等性能。

不过,mini 版本的发布开辟了一条务实的研究路径。大学和规模较小的预报团队无需运行全球超级计算机,也能研究该架构。

它也带来了一个科学谜题。如果粗分辨率模型能准确推断强度,研究人员就需要识别哪些大尺度信号承载了这些信息。

可能的信号包括水汽模式、垂直风切变、周边气压以及海气结构。已发表的结果并未确立单一解释。

理解其机制对于建立信任至关重要。气象学家必须知道这些学习到的关系何时会失效,尤其是在气候变化使环境超出历史数据所代表的分布范围时。

将 WeatherNext 与基于物理的预报对立起来,是错误的比较

WeatherNext 最适合作为独立的误差来源,而非取代物理模型或官方预报员。

AI 和数值天气预报在生成预报的方式上有所不同。数值模型求解支配大气和海洋的物理方程近似形式。

机器学习模型则从历史分析资料和观测中推断统计转变。由于它们在推理期间无需显式求解每一个物理过程,因此运行速度可以快得多。

这种对比很容易引向简单的竞赛,但业务预报很少依赖单一系统。各中心会对比全球模型、区域模型、集合预报、共识产品、卫星数据、飞机观测以及专家判断。

每种信息源的失效方式不同。若一个模型的错误不与其他成员趋同,即使其单独表现略弱,也可能改善共识预报。

WN-C 的共识结果展示了这一原则。当研究人员以优化权重将 WN-C 纳入后,路径误差会随预报时效不同下降 18% 至 38%。

平均降幅为 28%。不同预报时效下,强度误差下降 5% 至 14%,平均改善幅度为 6%。

这些数据并不说明 WN-C 让传统预报指导失去意义。它们表明,该 AI 系统贡献了现有共识预报所缺失的信息。

强度结果尤其清楚地说明了这种关系。共识预报提升 6%,意味着大部分预报价值仍分布在既有系统和人工实践之中。

美国国家飓风中心已在使用共识预报指导,因为没有任何模型能在每一场风暴和每个预报时效上占据主导。整合 AI 是对这一方法的延伸,而非推翻。

预报员还必须在真实观测背景下解读情景。侦察机、卫星、浮标、雷达和地面站可以揭示模型初始化时刻之后发生的变化。

WN-C 依赖高质量的初始大气分析,即将观测资料融合为一致的大气状态估计。起始点的误差可能传播至每一个集合成员。

该系统尚未直接同化原始观测资料。其作者将端到端数据同化列为重要研究方向。

官方预报还涵盖模型当前范围之外的影响。WN-C 不直接预测降雨、风暴潮、沿海洪水或精确的局地阵风。

这些灾害往往造成气旋的大部分破坏。因此,即使路径和强度预报准确,也只是可执行预警的一部分。

公众沟通又增加了一层复杂性。机构必须决定如何描述低概率、高影响的情景,既不能造成麻痹,也不能引发不必要的恐慌。

拥有 1,000 个成员的集合预报可提供更多尾部情景,但更多样本并不会自动带来更好的决策。机构需要校准记录、阈值和沟通政策。

它们还需要可靠的基础设施。研究代码可以容忍偶发中断,而业务预警系统需要稳定的数据源、有文档记录的更新和备用程序。

Google 通过在 WeatherNext repository 发布模型代码和权重,迈出了重要一步。该发布包含与论文相对应的版本,以及 2025 年风暴季期间使用的系统版本。

该仓库也附有审慎的免责声明。它将 WeatherNext 描述为实验性研究,并表示其输出不得替代政府气象机构发布的警报。

这一警告不仅仅是法律措辞。公共预报承担着模型输出本身不具备的机构责任。

气象机构会在不同区域、风暴类型、观测网络和业务约束下验证系统。它们还会与应急部门协调发布预警。

因此,恰当的比较并非 AI 对抗物理,而是多元化预报体系与缺少这一新型指导来源的体系之间的比较。

如果 WeatherNext 持续贡献独立的预报技能,业务中心将面临整合它的压力。但它们并不会面临必须理性地抛弃此前所有成果的要求。

这些数据仍未说明什么

已发表的精度提升十分显著,但并未解决所有海域、灾害类型和未来气候条件下的表现问题。

第一个不确定性涉及样本规模。与普通天气模式相比,热带气旋十分罕见,破坏性最强的类别则更为稀少。

研究人员通过结合数十年的大气分析资料和近 5,000 场历史风暴来应对这一稀缺性。然而,极端个例在训练材料中仍只占很小一部分。

历史记录的质量也不尽相同。卫星覆盖、飞机侦察、测量标准和机构实践会随时间变化,且不同海域之间存在差异。

模型可能会连同真实的大气关系一起学习这些不一致之处。谨慎评估必须将预报技能与档案中嵌入的伪影区分开来。

论文的方法减少了一个熟悉的问题。每年的模型仅使用截至前一年的数据训练,避免直接接触之后用于评估的风暴。

2025 年的实时运行增加了可信度。不过,一个活跃风暴季仍不足以证明其在每一种罕见的路径、强度和结构组合下都可靠。

气候变化带来另一项挑战。更暖的海洋和变化中的大气,可能会产生超出塑造模型的历史分布范围之外的条件。

机器学习系统能够泛化至单个案例之外,但随着环境关系发生变化,其局限将更难界定。

基于物理的模型在变化条件下也会存在偏差。不过,其显式方程为科学家提供了另一条诊断模拟结果为何如此表现的路径。

WeatherNext 的粗网格强度预测能力之所以令人印象深刻,部分原因在于其机制尚未被完全理解。这种不确定性应当推动研究,而不是否定结果。

第二项局限是地理一致性。大西洋地区的风暴观测尤其丰富,因为侦察飞行可提供详细测量。

其他海域更依赖卫星和不同机构的估计。全球平均表现可能掩盖特定海洋区域或预报中心内部的弱点。

第三项局限涉及以决策为中心的灾害。路径、最大风速和风圈半径支持重要决策,但并不能描述所有局地后果。

降雨取决于地形、风暴移动速度、水汽供应以及与其他天气系统的相互作用。风暴潮则取决于海岸线几何形态、海洋深度、潮汐、海浪和风向。

模型即使准确定位中心,也可能低估洪水风险。居民绝不应将准确的中心路径视为完整的风险地图。

第四项局限是集合成员的依赖性。WN-C 从大气分析资料出发生成所有成员,但并未明确采样初始条件中的不确定性。

其成员通过学习到的模型函数和大气演变来表示不确定性。它们并未覆盖起始观测中所有可能的误差。

当风暴观测不足时,这一区别尤为重要。由于成员共享同一个存在缺陷的初始状态,集合预报可能显得过于自信。

第五个问题是基准的演变。业务模型并非一成不变。ECMWF、NOAA、英国气象局和其他中心会定期更新分辨率、数据同化、物理参数化方案和集合预报系统。

因此,WeatherNext 必须与不断变化的目标竞争。与某一代模型相比表现优异,并不能保证在下一次业务升级后仍具备相同优势。

开源有助于解决其中若干问题。独立团队可以复现预报、测试区域表现、分析校准情况,并寻找失效模式。

然而,对于更大的模型而言,可复现性仍然需要大量数据和计算资源。轻量版本扩大了使用范围,但无法复现完整系统的准确性。

负责任的采用方式将要求各机构提供透明的验证报告,而不能只看模型开发者发布的结果。业务预报员需要覆盖完整季节且采用标准化基线的证据。

最可信的解读既不是全盘否定,也不是无条件接受。WeatherNext 已跨越重要的科学和业务应用门槛,但关于泛化能力和灾害覆盖范围的核心问题仍未解决。

三个信号将揭示额外一天的优势能否成立

只有当独立验证、开放测试和更广泛的灾害覆盖共同强化已发布的结果时,WeatherNext 才能赢得持久的业务应用角色。

第一个信号是其在整个 2026 年气旋季期间的表现。研究人员和机构应比较所有海域盆地的实时预报,而不应只关注令人印象深刻的风暴。

一项有价值的评估应衡量路径、强度、风圈范围、概率校准和快速增强表现,还应按预报时效和风暴强度分别分析结果。

持续的提升将强化 WeatherNext 具备持久预报提前期优势的说法。不同海域盆地之间的大幅波动,则意味着机构可能需要进行区域校准或采用不同的模型权重。

第二个信号是官方共识系统如何使用该模型。试验性接入并不等同于常规业务依赖。

应关注美国国家飓风中心及其他世界气象组织中心是否会将 WeatherNext 产品正式纳入其预报体系。它们的验证报告应揭示,该模型的误差是否持续保持有用的差异性。

对共识预报作出稳定贡献,比在单一基准测试中登顶更重要。这将表明,当模型与其他强有力的预报指导共同使用时,它能改善决策。

第三个信号是向路径和强度以外领域的扩展。降雨、风暴潮和局地阵风仍是主要缺口。

纳入这些灾害因素将需要更高分辨率的信息、专门的下游模型或新的训练目标。若能成功,WeatherNext 将更接近影响预报,即关注社区实际经历什么。

失败不会抹去当前的进展,但会将该模型定义为强大的气旋预报指导组成部分,而非完整的灾害预报系统。

开源发布让外部研究人员有机会对这三个信号进行严格检验。他们可以研究历史案例、构建本地适配版本,并比较完整模型与其较小版本。

这种审视还应检验系统在观测稀疏,或大气条件超出既有模式时的表现。仅凭平均得分无法回答这些问题。

Google DeepMind 交付的成果不只是更快的天气演示。它表明,一个粗粒度的全球 AI 模型能够为气旋移动和强度提供有用信息。

Google DeepMind 的气旋预报仍依赖于那些收集观测资料、维护物理模型、验证性能并传达公共风险的机构。只有当这些机构能够信任并解读这额外的一天时,它才有价值。

下一次危险风暴开始组织发展时,应关注整个预报体系,而非某一条戏剧性的预报线。关键问题在于,WeatherNext 是否能增加一个更早、经过校准的信号,让人工预报员能够有信心地将其转化为行动。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page