DeepMind 的 WeatherNext 模型在气旋预报上取得突破
文章摘要
Google DeepMind 在《Nature》上发表论文,宣布其 WeatherNext 模型在预测热带气旋的路径、强度和风场结构三个维度上都达到了业界最优水平。核心结论用一句话概括:平均而言,模型给预报员多争取了整整一天的预测精度——它的三天预报,相当于此前模型只能提供的两天预报水准。DeepMind 称这个幅度的提升,大致相当于气象学领域十年的进步。热带气旋(也就是飓风、台风)是地球上最具破坏性的天气现象之一,过去 50 年在全球造成超过 70 万人死亡和 1.4 万亿美元经济损失。
这项工作由 Google DeepMind 与 Google Research 的研究者,联合美国国家飓风中心(NHC)、大气研究合作研究所(CIRA)、英国气象局以及全球多家气象机构的资深预报员共同完成。文章特别提到了真实世界的影响:2025 年飓风季,该模型帮助 NHC 对飓风 Melissa 做出了一次历史性预报——准确预测了风暴的快速增强和在牙买加的登陆,使 NHC 得以提前发布警报。2026 年他们进一步把集合规模扩大到对每个气旋预测 1,000 种可能情景。
技术上,WeatherNext 解决的是一个长期存在的取舍。气旋的路径由大尺度全球大气环流引导,传统上用较粗分辨率的全球模式效果最好;而气旋的强度由风暴核心周围高度局地的、精细尺度的热力学过程驱动,传统上需要专门的高分辨率区域模式。WeatherNext 用单一 AI 模型同时搞定了两件事。它采用双模态协同训练:一路是全球天气动力学数据(近 20 TB 全球大气数据),另一路是专家整理的历史气旋观测(IBTrACS 数据库,覆盖近 5,000 场历史风暴)。集合生成方面使用了 Functional Generative Networks(FGN,函数式生成网络),能在一块 TPU 上于一分钟内生成一次 15 天预报,去年一次产出 50 个成员(与全球物理模式相当),今年扩展到 1,000 个成员,从而能捕捉快速增强这类罕见但后果严重的尾部风险。
文中一个反直觉的发现是:一直以来业界认为极高的空间分辨率是准确强度预报的主要驱动因素,但 WeatherNext Cyclones 只需要 28×28 公里分辨率的数据,比传统模型粗 100 倍;更小的 WeatherNext 2-mini 在 111×111 公里的更粗分辨率上表现也相当出色。DeepMind 坦承这让科学家们感到意外,模型为何能在这种分辨率下产出如此准确的预测,仍是一个开放的研究问题,他们希望与研究社区一起搞清楚。
最受关注的是开源决定:DeepMind 同时开放了飓风季实际运行的 WeatherNext Cyclones、10 月上线的更新版 WeatherNext 2,以及可在免费公开 Colab 笔记本中用单块 TPU 运行的紧凑版 WeatherNext 2-mini 的代码和模型权重。他们同时提醒,官方天气预报和预警仍应以当地气象机构为准。
HN 评论精华
这条提交拿到 448 分,讨论相当热烈,而且并没有一边倒地叫好——最高赞的几条串反而在拆解「多一天」这个说法的水分,另有一大块讨论跑到了 Google 内部政治和股东回报上。
对「多争取一天」的质疑(本帖最有价值的技术辩论)
- TaupeRanger 给出了最精确的重新表述:这套系统并没有真的给你多一天的通知,更准确的说法是「模型在某个给定精度水平上,可以比以前早大约一天达到」。于是问题变成:是否存在这样的场景——我在三天前有 80% 把握这是五级飓风就能活,而只有 65% 把握就会死?他认为大概率不存在,因为即便在这篇 PR 文章自己举的例子里,NHC 在登陆前 5 天就已经在发布强有力的早期指引了。他还提醒 DeepMind 有大量「宣传稿吹得天花乱坠、真实使用中从未兑现」的历史记录。
- counters(帖中最专业的声音之一)说希望这条评论能被置顶,因为背景信息极其重要,会彻底重构对这项成果影响力的理解:用现代预报工具,我们在气旋威胁登陆前 5-10 天就已经能预期到它的生成,「两天 vs 三天」的技能提升更准确的解读是预报不确定性的适度收窄——飓风路径图上那个「锥形区」变窄了一点。地面上真正受影响的人并没有因此多出一天准备时间。他强调这不是贬低 DeepMind,而只是陈述当代天气预报本来就有多好,以及在 AI 预报模型五年前登场之前它就已经有多好。
- 反方也有力:IanCal 反问,你能想象从预警到完成疏散需要超过两天的场景吗?尤其一旦涉及老人、监狱、医院这类复杂问题。scarmig 说,想象你要疏散十万人,那多出来的一天极其宝贵。baq 举了更具体的例子:在这多出的 24 小时里你可以走 50 公里,如果你身处风暴潮区域且没有其他交通工具(当所有人都在同时疏散时这很常见),这能救你的命;他还说一周里能加固的东西远比两天多,关键是能把更多最值钱的东西移出风暴潮区。michaelbuckbee 的框定或许最中肯:两天 vs 三天对个人决策影响不大,但对国家级响应的决策有巨大好处。
- metanoia_ 举飓风 Maria 在不到 24 小时内从二级跳到五级为例,counters 立刻回应:那次快速增强其实几乎每个数值预报系统都提前好几天预报到了。
「AI 模型全靠政府数据」这条主线反复出现
- alternator 的长评获得高度认同:准确的天气预报是 20、21 世纪的重大成就之一,算力是核心一环,但政府采集地面真值数据的基础设施同样至关重要——从施放探空气球到运行全球气象卫星,NOAA/NWS(以及本例中的英国同行)的科学家和系统提供了关键的专业能力和数据。他直言,此前那些「工业界深度神经网络跑赢 NOAA」的宣传,很可能助长了特朗普政府对 NOAA 关键活动和专业中心的砍伐;「工业界比政府机构预报得更好」这一印象完全忽略了工业界模型的输入完全依赖政府数据。他还补充,你在 weather.com、电视上看到的几乎所有天气报道,都只是 NOAA 在 weather.gov 上免费提供的产品的轻度重新包装。
- counters 在另一处回应「在政府对科学投入不足的年代,这难道不是 Google 真正改变世界的方式吗」时给了一句极简的反驳:不是,因为 Google 训练模型所用的数据 100% 来自联邦研究投入。
- plantain 和 sunshinesnacks 解释了更细的依赖关系:历史观测数据是离散的,天气建模需要连续的状态场,目前是通过用历史观测做常规再预报来实现;几乎所有 AI 天气模型都训练在 ECMWF 的 ERA5 上,而 ERA5 是一种「再分析」——本质上像是一次 t=0 时刻的数值预报模式运行。tcumulus 补充说,因此 AI 天气模型极度依赖用于再分析和初始条件的 NWP/物理学;不过也有研究在尝试直接从原始数据(气象站、卫星)训练,绕过这一步。micro2588 举了 ECMWF 的实验性 AIFS-DOP(直接观测预测模型)为例,说它在部分指标上过去一年已能与物理模式 IFS 竞争。
为什么 ML 在天气上管用,在别处不太管用
- numbers_guy 说,过去五年凡是搞数值模拟的人(物理学家、工程师、化学家、生物物理学家)都试过 ML 代理模型,所以不是没人试;以他的经验这些模型都不太稳健,天气建模恰恰是极少数看起来效果还行的领域之一。
- SirHumphrey 的解释:单纯因为数据实在太多了——通常比任何相关问题多一个数量级;而且一般的天气预报本来就不算难,我们五十多年前就有半可用的预报。真正难的是长期预报、对流风暴的临近预报、其他极端天气,而那时候瓶颈往往在输入数据精度而不是模型本身。
- micro2588 指出一个常被忽略的事实:传统物理模式对次网格尺度过程(云、雨雪冰雹的微物理)也严重依赖物理参数化,所以即便是确定性物理模型,其中也包含大量从数据中学来的近似。jeffbee 补充得更犀利:传统物理模式同样严重依赖人类去看输出、评估并丢掉那些跑飞的成员,别装作现有的大气物理模型一直都在轨道上。
「不可解释」的隐忧
- derbOac 抓住了原文那句「这让科学家们感到意外,模型为何在这种分辨率下如此准确仍是开放问题」,说这同样疯狂:至少为了知道模型什么时候会失灵,理解它为什么这么做似乎很重要。alpaca9 直接回:你做不到,而这正是把 AI 用在任何事情上最大的问题之一。
- ghm2199 从贝叶斯统计背景提出更具体的顾虑:如果模型说不清它为什么在某处给出那个不确定性估计——或者更糟,之后又改了主意——你愿意让政府据此对飓风中心 30 英里外的地区下达疏散令吗?
跑题但热闹的 Google 内部政治
- HardCodedBias 抛出了帖中最有争议的观点:这正是 GDM 必须裁撤的原因,Google 现在处境这么艰难,却还在资助这种完全没有营收路径的项目,GDM 管理层真以为自己是慈善机构。vickychijwani 反问是不是在讽刺,并说即便 Google 真的艰难(其实并不),这类工作对世界有持久影响,不是所有好东西都得带来营收。PunchTornado 以股东身份表达不满,拿 AlphaFold 举例:几百亿投入、零营收,虽然给 Demis 挣了个诺贝尔奖。phi0 反击:作为股东我一年涨了 75%,AlphaFold 积累的经验让他们比任何人都更有可能在 Isomorphic Labs 上成功,改进翻译的研究给了我们 Transformer;如果你认为 AI 会赢但 Google 会一直输,现在有太多更好的地方配置你的资本。
- trescenzi 的一句话点破了整个争论的荒谬感:讽刺的是,此时此刻台风预报比那些聊天模型更有价值——这些预测关乎生死和数十亿美元的损失。sweezyjeezy 冷静补刀:有价值,同意,但赚钱吗?
其他实用信息
- jen729w 推荐 zoom.earth(iPhone app 很棒)看台风预报,并贴了实时预报文字,其中就出现了「JTWC 的强度预报除 Google DeepMind 外低于所有其他指引」这样把 DeepMind 当作常规参考模型之一的表述。trescenzi 推荐 tropicaltidbits.com 看更原始的数据。
- kashifr 贴出了自己在 NVIDIA physicsnemo 上的 PyTorch 复现 PR;rdli 说找不到 WeatherNext 的客户端,就让 Claude 写了一个简单的(weatherodds)。
- moktonar 说他们该去预测地震。cossatot 给了一个非常扎实的否定性回答:ML 预测地震在原理上可行,但受数据严重制约——全球大部分地区只有约 50 年像样的地震目录,而地震周期(大震、重新加载、同一断层段再次大震)通常是数千年;极少有断层段能观测到多次事件,超过 90% 的断层我们甚至不知道上一次地震发生在何时。地质方法能补一些,但劳动密集且误差常达数百到数千年。他认为希望在于把物理模拟器与 ML 和现有数据耦合,但那是前沿 HPC 工作,限制了研究节奏和研究者数量。