AI 加速飓风预报,但气象学家仍握有最终决定权
Google News 指出,飓风预报正出现明显转变:尽管在强度预测方面仍有严重局限,机器学习如今已能在数分钟内生成有价值的风暴指引。
Google DeepMind、NOAA 和欧洲中期天气预报中心正将 AI 预测与成熟的物理模型系统并行测试。这些模型生成多种可能风暴路径的速度,快于传统预报系统。
当墨西哥湾沿岸社区必须决定是否撤离、关闭港口、保护设备或调动应急队伍时,这种速度至关重要。但更快的模型输出,并不自动意味着面向公众的预报更安全。
这场正在展开的较量,并不只是 AI 对阵传统气象学,而是快速模式识别与具备细致物理描述的模拟之间的竞争,最终仍由人工预报员判断两者的结果。
AI 模型已展现出颇具前景的路径预测表现,包括对近期数场风暴更早发出信号。但它们在快速增强、降雨、风暴潮,以及训练历史中缺乏的异常条件方面仍然表现不佳。
这些缺口解释了为何美国国家飓风中心将 AI 视为补充性指引,而非自主预警系统。核心问题在于,AI 能否在不以看似自信的地图掩盖不确定性的前提下,增强整个预报链条。
Google News 读者应了解的预报转变
AI 飓风预报已从研究演示进入实时评估阶段,但尚未取代官方预报流程。
Google DeepMind 于 2025 年 6 月推出 Weather Lab,作为用于实验性 AI 天气预测的公共平台。其热带气旋系统会生成集合预报,即代表不同合理风暴结果的多组预测。
集合预报帮助预报员审视不确定性,而不是依赖单一路径预测。预测结果高度聚集可能表明一致性较高,而分布范围较宽则意味着存在实质性不确定性。
DeepMind 与国家飓风中心共同开发了其气旋模型。在 2025 年飓风季期间,专家将其输出与业务化指引一并评估,而非直接据此发布预警。
该公司报告称,在覆盖 2023 年和 2024 年大西洋及东太平洋风暴的回溯测试中,结果令人鼓舞。其五日路径预测与实际位置的平均距离,比 ECMWF 的物理集合预报近 140 公里。
这一数字来自 Google 的初步评估,并非独立机构宣告 AI 已解决飓风预报问题。该公司在其 cyclone prediction model 公告中公布了方法与局限。
该模型结合了两类历史信息。全球大气再分析资料描述过去的天气状态,而气旋记录则记载风暴的位置、路径和强度。
机器学习从这些记录中识别关系,并将其应用于新的大气状态。它不会通过与传统数值模型相同的方程,计算每一种物理相互作用。
这种差异在训练完成后大幅降低了计算负担。模型可以快速生成多种情景,让预报员在下一次发布预报通报的截止时间前获得另一组证据。
Google 更广泛的 GenCast 系统体现了这种速度优势。DeepMind 表示,使用单个 Cloud TPU v5 生成一次 15 天预报约需八分钟,集合成员则可并行生成。
已发表的 GenCast research 显示,在许多经测试的天气变量和预报时效上,其概率预报表现优于 ECMWF 的集合预报。热带气旋是该评估的一部分。
不过,全球天气预报能力与飓风专属的业务价值并不相同。模型可能擅长预测大尺度大气形势,却漏掉风暴紧凑的内核结构。
这一差异在登陆附近尤为关键。相对较小的路径误差,就可能让最强风、风暴潮和最强降雨落在不同社区。
因此,官方预报会结合观测资料、专业飓风模型、全球模型、统计指引和专家分析。AI 已作为另一项输入加入这一体系。
这一变化依然意义重大。预报员如今能足够早地获得可信的机器学习指引,并将其与传统模式结果比较,而不再只是在风暴结束后回顾 AI 的表现。
速度改变预报周期,而非天气规律
机器学习压缩了生成指引所需的时间,而传统模型仍提供 AI 系统往往缺乏的物理细节。
传统数值天气预报始于对当前大气状态的估计。随后,超级计算机求解代表运动、气压、热量、水汽、辐射及其他物理过程的数学方程。
这些计算需要大量计算资源。分辨率越高,需求越大,因为模型必须在更多网格点和更短时间步长上求解方程。
飓风预报又增加了难度。模型既要描述广阔的周边大气,又要解析包含风眼、眼墙、雨带及海洋相互作用的紧凑涡旋。
机器学习系统则采用另一条路径。它们研究多年历史大气数据,学习一种天气状态通常如何演变为另一种状态。
训练完成后,它们能从初始状态直接生成预报,无需反复求解完整的物理方程组。这使推理过程更快,也就是从训练完成的模型生成预测。
快速推理让大规模集合预报更具可行性。预报员可以分析数十条合理路径,并评估某一种危险结果是否仍有可能,即使它并非平均情景。
这一优势在登陆前数天尤为实用。应急规划人员关心现实结果的范围,因为重大准备工作必须在确定性到来之前启动。
单条预报线可能制造虚假的精确感。集合概率能更好地表达这样一个事实:微小的大气差异可能导致截然不同的路径。
DeepMind 以 Cyclone Alfred 为例。该模型在七天前预判其将减弱并在昆士兰登陆,同时维持了不同可能沿海登陆地点的概率分布。
这一结果展示的是预期机制,而非普遍可靠性。每场飓风都在不同组合的引导气流、海洋热量、干空气和垂直风切变条件下发展。
AI 系统同样会继承训练材料中的假设。再分析资料重建历史大气状况,但它仍是由观测和模型生成的估计。
历史气旋记录也存在不一致之处。数十年来,卫星覆盖、飞机侦察、传感器和分析方法均发生了显著变化。
因此,较早的风暴缺乏近期飓风所拥有的同等观测细节。在这种记录上训练的模型,既可能学到有意义的模式,也可能学到测量伪影。
物理模型也有自身误差。它们会近似处理网格分辨率以下发生的过程,并且仍对不完美的初始状态敏感。
实际选择并不是在完美的物理模型与神秘的 AI 替代品之间二选一。两种方法都会简化现实,也会以不同方式失效。
Google News 的报道可能会让这种速度比较看起来像一场算力竞赛。但业务价值实际上来自互补的误差,以及及时显现的分歧。
当 AI 与传统集合预报趋于一致时,预报员会获得更多信心依据。当两者出现分歧时,这种分歧会促使人们进行更深入的诊断。
这种诊断可以审查飞机侦察资料、卫星结构、海洋条件和已知的模型偏差。人类判断将更快的计算转化为经得起审视的公共预报。
核心竞争是模式识别与物理细节之争
AI 目前在大范围风暴移动预测方面最具优势,而细致的物理描述对强度和局地灾害预报仍不可或缺。
飓风路径在很大程度上取决于大尺度大气环流。高压系统、低压槽和周边风场会引导风暴穿越海洋。
这些大尺度模式在全球历史数据集中呈现得很清晰。机器学习模型能够识别其演变,并将之与可能的风暴移动联系起来。
强度预测是更难的问题。最强风在相对较小的内核中形成,雷暴在迅速变化的结构中传递热量和水汽。
海洋温度本身并不决定风暴是否增强。预报员还会评估海面以下热含量、风切变、干空气、眼墙循环和风暴内部组织结构。
全球 AI 模型可能能很好地描述周边大气,却会平滑中心气压或最大风速。这种平滑会削弱其对最危险特征的刻画。
快速增强构成最严峻的考验。国家飓风中心将其定义为最大持续风速在 24 小时内至少增加 30 节。
这种变化可能彻底改变撤离决策。原本为较弱飓风做准备的居民,可能在几乎没有额外时间的情况下,突然面对一场强大风暴。
专业物理模型通过更高分辨率和细致的海气相互作用应对这一挑战。NOAA 的 Hurricane Analysis and Forecast System 会在高分辨率移动区域内跟踪风暴。
飞机侦察同样不可或缺。Hurricane Hunter 机组会在卫星无法完全观测的风暴内部测量气压、风、温度和水汽。
投落送会在大气中下落,并返回垂直剖面数据。机尾多普勒雷达则绘制风暴核心周边的风场和降水分布。
这些观测改善了每种预报方法的初始状态。AI 不会仅仅因为处理数据更快,就能以稳定准确的方式推断未被观测到的眼墙置换循环。
机器学习仍可帮助专家更有效地利用观测资料。它可以识别与预报误差相关的模式,对结构变化进行分类,并生成概率分布。
2025 年的一项研究开发了一种概率神经网络,用于估算国家飓风中心的路径预报误差。这种方法关注的是预报置信度,而非试图替代整个预报系统。
这项研究之所以重要,是因为标准不确定性产品通常依赖前几个飓风季的误差数据。针对单场风暴的系统有望更直接地反映当前大气状况。
但可解释性仍然困难。预报员在高风险预报通报中采用某项指引前,需要理解其变化的原因。
传统模型允许专家检查物理场,并通过已知的气象过程追踪相互作用。神经网络可以生成表现出色的输出,却未必能提供同样透明的因果解释。
研究人员正在为这一缺口开发诊断工具。他们测试模型在输入条件变化时是否能做出合理响应,并分析哪些大气特征会影响预测。
目标并不是为每一次计算提供完美的文字解释。只要能在影响官方预报之前识别出脆弱行为,就已具备足够的透明度。
这使得主要对手成为两条互补预测路径之间的较量。模式识别提供速度和广泛的大气预测能力,而物理模拟则提供结构与因果约束。
没有任何一条路径能够完整捕捉飓风。最强的预报团队会在各自贡献最大信息价值的环节使用它们。
出色的路径成绩并未解决强度问题
有希望的平均表现,可能掩盖了风暴逼近墨西哥湾沿岸时最关键的罕见失误。
模型评估通常会汇总多个风暴和预报时段的表现。平均路径误差很有参考价值,但无法描述所有业务后果。
一个预报系统可能在常规情形下表现极佳,却仍会在异常快速增强事件中失效。这种失误足以主导整个飓风季的公共影响。
历史训练数据带来了一个特殊担忧。机器学习通常在新条件与训练数据中已有模式相似时表现最佳。
飓风正在更暖的气候和不断变化的海洋环境中发展。某些热量、水汽与风暴结构的组合,可能处于历史经验的边缘。
这并不意味着 AI 会在前所未有的天气条件下自动失效。它意味着,过去的平均表现无法证明其在所有未来条件下都可靠。
研究人员还会区分回报预报与实时预报。回报预报利用过去事件测试模型,并通过控制措施防止未来信息向过去泄漏。
由于最终风暴路径已知,回报预报可以提供有价值的比较。但它无法复现所有业务复杂因素,包括观测延迟、数据中断和不断变化的模型配置。
因此,实况季节测试更具分量。它能够展示预报指引在每个预报时刻实际可用信息下的表现。
美国国家飓风中心每年都会发布验证报告,将官方预报与预报指引模型进行比较。这些报告审视不同预报时效、海域、路径和强度下的误差。
其预报验证档案为判断某个模型的亮眼案例是否能够覆盖完整飓风季提供了恰当依据。
即便是季节平均值也需要结合背景理解。模型进入测试的时间不同、覆盖的风暴不同,有时还无法产生可用输出。
公平比较必须考虑这些缺失案例,也必须比较在相同时间、基于等效信息初始化的预报。
另一项不确定性涉及局地灾害。路径和最大风速并不能完整描述降雨、龙卷风、海浪或风暴潮。
风暴潮取决于风暴大小、风向、移动速度、海岸形状、水深、潮汐和海浪。路径的微小变化就可能重塑淹没格局。
降雨可以远离风眼延伸,并在风力减弱后持续。内陆洪水造成的严重飓风死亡案例,远超海岸线范围。
全球 AI 系统尚未成为完整的灾害平台。应急机构仍需要专业模型、本地观测、地理数据和预报员解读。
传达不确定性又增加了一层挑战。一张色彩鲜艳的集合预报图可能让观众不知所措,或促使他们聚焦于一条戏剧性的轨迹线。
官方预报锥并不展示所有灾害,也不标明破坏性风力的确切范围。它表示风暴中心路径周围可能存在的不确定性。
美国国家飓风中心的预报产品指南解释了为何必须综合阅读监视、警报、风场、降雨产品和风暴潮信息。
AI 生成的预报指引也应遵循同样的原则。当用户将一种情景误认为官方预报时,模型输出就会变得危险。
Google News 的搜索结果也可能放大孤立的成功案例。模型对某次令人印象深刻的飓风作出早期判断固然引人注目,但仍只是轶事证据。
更有力的论断需要跨越风暴、预报时效和失败案例的完整验证,也需要清晰披露测试期间进行的模型更新。
因此,恰当的怀疑应当具体而非笼统。AI 已展现出真实的预报能力,但其在强度和局地灾害方面的可靠性仍缺乏充分证明。
NOAA 与 Google 正在构建混合预报体系
最可能的业务化未来,将结合 AI 集合预报、基于物理的模型、直接观测和可追责的人类决策。
NOAA 已探索多条机器学习路线,而非依赖某一个外部系统。其工作涵盖全球 AI 模型、区域试验、误差预测、季节预报和合作项目。
这种多元化方法可避免预报流程依赖单一架构,也让研究人员能够比较使用不同数据和目标训练的系统。
Google DeepMind 重点关注全球中期预报和概率集合预报。ECMWF 则开发了自己的人工智能预报系统,即 AIFS。
ECMWF 已开始将业务化的 AIFS 预报与既有的综合预报系统一同提供。这让气象学家能够进一步比较学习到的模式与物理方程。
AIFS 预报系统利用 ECMWF 分析得到的大气状态生成全球机器学习预测。它的存在表明,AI 天气模型正在进入机构级预报基础设施。
私营公司也正在进入这一领域。NOAA 宣布与 Silurian AI 建立研究合作关系,以改善热带气旋路径和强度预测。
根据该协议,NOAA 的大西洋海洋与气象实验室提供飓风观测、数值数据和科学专业知识。Silurian 则提供其 Generative Forecast Transformer 模型。
这项预报合作专门面向从实验性研究迈向与业务相关测试的转变。
只要评估保持透明,这种竞争就有利于预报员。多个独立系统能够降低将单一模型反复出现的偏差误作共识的风险。
不过,模型多样性必须是真实的。即使网络设计不同,若多个系统使用相同的再分析数据训练,仍可能犯下相似错误。
一组 AI 预报并不自动构成独立证据。预报员需要知道每个成员采用了哪些训练数据集、初始条件和模型家族。
基于物理的集合预报也面临类似的依赖性。许多系统使用相似的观测和数值方法,因此表面上的一致也可能夸大确定性。
因此,混合体系必须追踪预报谱系。它应显示模型在哪些方面共享数据、假设有何不同,以及某项输出是否源自另一项输出。
业务可靠性涉及的不只是准确率,还包括工程能力。系统必须按时运行、经受住故障、保留版本历史,并安全分发产品。
实验模型错过一次运行周期不会造成公共后果。业务系统则必须在飓风最危险的时段满足严格要求。
版本控制很重要,因为机器学习模型在重新训练后可能发生重大变化。早期版本的验证结果并不会自动延续到其后续版本。
预报员还需要稳定的展示界面。他们需要比较不同运行结果、检查概率、叠加观测,并在紧迫时限内传达决策。
这些要求解释了为何采用过程会逐步推进。气象机构不能把一次基准测试改进当作普通的软件功能。
人类预报员仍要对整合证据负责。他们会评估模型是否遵循合理机制,以及最新观测是否支持其趋势。
他们还会将模型不确定性转化为监视、警报和通俗易懂的风险信息。这一角色结合了科学、本地知识、沟通能力和公共责任。
Google News 常常通过“替代人类”的视角解读自动化。飓风业务则展现出一种更可信的增强形式。
AI 扩大了合理情景的数量并提升了生成速度。气象学家决定哪些信号值得信任,以及不确定性应如何影响防护行动。
三项信号将显示 AI 是否赢得业务信任
下一阶段将由完整的季节验证、更好的强度预报,以及在官方业务中有记录的使用情况决定。
第一项信号是覆盖每一个符合条件风暴的完整季节表现。研究人员应在一致的预报时效下公布路径和强度误差,包括缺失或失败的预报。
如果收益在不同海域和风暴类型中持续存在,这些证据将加强 AI 的论据。若头条成功案例依赖于小样本,论据则会被削弱。
比较应包括美国国家飓风中心的官方预报、领先的基于物理的预报指引以及其他 AI 系统,还应区分回溯测试与真正的实时输出。
第二项信号是强度方面可测量的进展。路径预报能力已有更强的公开记录,而快速增强仍是影响更为重大的挑战。
一个有用的强度系统必须捕捉中心气压、最大风速、风暴大小和结构变化,也必须对新的飞机和海洋观测做出合理响应。
研究人员应报告眼墙置换周期和快速增强时段内的结果。仅凭平均误差无法证明系统已准备好应对这些困难转变。
全耦合系统尤其值得关注。多数早期 AI 天气模型会表征大气,却不会动态模拟每场风暴下方海洋的演变。
海洋耦合使模拟飓风能够冷却海水、混合更深层海水,并对自身经过作出响应。陆地相互作用同样会影响减弱过程和降雨。
NOAA 研究人员在连接 AI 预报与基于物理的陆地和海洋组件的工作中,强调了这些缺失的物理关系。
如果耦合 AI 系统能改善实时强度预报指引,混合方法将获得更多支持。若改进仍局限于路径,专业物理模型将继续承担更大角色。
第三项信号是有记录的业务化采用。预报办公室内的实验性展示,与直接用于官方预报决策并不相同。
气象机构应说明 AI 指引何时影响了预报、专家何时否决了它,以及哪些诊断信息支撑了这一判断。
这并不要求披露敏感的业务细节,而是要求具备足够透明度,以区分有用的整合与宣传式关联。
培训同样重要。预报员需要实际了解每个模型反复出现的优势、盲点,以及新版本带来的变化。
应急管理人员则需要关于恰当使用方式的单独指导。原始模型图绝不应取代官方监视、警报、疏散命令或地方指引。
公共沟通应强调概率与风险,而不是庆祝某个胜出的模型。紧急情况下,社区并不会从一场技术赛马中受益。
Google News 的受众也应区分天气预测与预警决策。前者估算大气结果,后者则权衡风险、不确定性、时机和公众行动。
AI 将通过在运营约束下反复展现的表现赢得信任。速度带来机会,但经验证的可靠性决定了这一机会能否真正保护人们。
近期最可信的结果并非一套自主飓风预报系统,而是更广泛的证据基础,并且能足够快地交付给经验丰富的专家使用。
对于墨西哥湾沿岸居民而言,行动依然很明确:关注当地官方预报,查看每一项风险预警产品,并在模型达成一致之前做好准备。
对科学家和技术采购者来说,问题则更为尖锐:下一个飓风季是否会展现出超越那些令人印象深刻的个案、且持续稳定的提升,尤其是在风暴意外增强时?
这一答案将决定机器学习是成为预报体系的核心层,还是继续作为宝贵的实验性指导,与气象学家已信赖的系统并行存在。



