AI天气预报入门:用Hugging Face自己预测下周天气

AI天气模型正以更低能耗、更快速度成为传统物理预报的有力补充,但标准化工具与极端事件评估仍是待解难题。
本文整理自Hugging Face研究员Emma的公开直播,系统介绍了AI天气预报的原理与实践。AI天气模型与大语言模型思路相近,均以自回归方式逐步预测大气的下一时刻状态,但运行速度比传统数值天气预报快10倍、能耗低约1000倍。教程以微软Aurora为例,展示了通过EarthMover Marketplace按需获取气候数据、在普通CPU上运行模型的完整流程。文章同时指出当前的核心挑战:评估"真值"本身并不可靠,常规指标难以衡量极端事件,而每套模型环境各异、缺乏统一工具链导致气候领域研究者难以复用成果。Hugging Face正从基础设施与生态工具两个方向发力,推动天气模型的标准化与普及。
过去几十年里,天气预报一直是超级计算机和物理方程的天下。而近年来,基于神经网络的AI天气模型正在改变这个领域——它们运行更快、能耗更低,甚至可以在普通电脑上跑起来。在Hugging Face团队的一次公开直播中,研究员Emma围绕其博客《让AI天气预报模型易于运行》,系统讲解了AI天气预报的原理、工具链与实践方法。本文梳理其中的核心内容。
什么是天气预报,AI带来了怎样的范式转变
天气预报本身并不新鲜。Emma指出,人类做天气预报已经至少有50年历史,核心目标就是预测大气的状态。这次讨论聚焦的是"中期预报"(middle range forecast),也就是预测未来最长两周内的大气状况——你出门要不要带伞、夏天该穿什么,背后都是这类模型在支撑。
真正的转折点出现在2018年前后。在此之前,所有预报模型都基于物理:拿到某一时刻大气状态的"快照",输入到一个包含大量方程的庞大物理模型中进行推演。这套方法效果很好,但代价高昂——需要巨量的算力、能源和时间。每次想做点小实验、测试新想法,都是一项繁重的工程。
Emma强调,AI模型并没有取代物理模型,而是作为一种补充存在。它最大的优势在于效率:通常比物理模型快10倍、省1000倍的能源。这意味着研究者可以更频繁地运行自己的模型,快速迭代,探索改进方向。这正是Emma眼中最重要的变化。
传统物理天气预报的核心方法被称为"数值天气预报"(Numerical Weather Prediction,NWP)。其基本原理是将大气离散化为三维网格,在每个格点上求解描述流体运动的纳维-斯托克斯方程组以及热力学、湿度等方程,通过时间步进推演大气状态。目前最权威的物理预报系统包括欧洲中期天气预报中心(ECMWF)的IFS模型和美国国家气象局的GFS模型。这类系统通常需要在数千个CPU核心上并行运算数小时才能完成一次全球预报,每次运行的电力成本极高。AI模型则通过在海量历史气象数据上学习大气的演化规律,将这一推演过程"压缩"进神经网络的权重中,推理阶段只需少量算力即可完成,本质上是用大量前期训练替代了实时的物理计算。
AI天气模型与大语言模型的相似之处
有趣的是,AI天气模型和大语言模型(LLM)几乎在同一时期出现,二者共享不少底层思路。Emma解释,虽然具体架构各不相同——有的基于Transformer,有的用图方法(graph methods)或扩散模型(diffusion models)——但核心逻辑高度一致。
你可以把大气的初始状态类比为一个token或单词,把它作为输入送进模型,模型预测"下一个状态",比如6小时后的大气情况。如果想知道更久之后的天气,就把预测结果重新喂回模型,继续预测下一步。这与LLM逐token自回归生成的方式如出一辙。

不过输入输出层面也有关键差异。天气模型的输入是整个地球网格上每个点的多个变量:温度、风、降水、积雪覆盖等。Emma借用微软论文中的示意图说明流程——状态经编码器得到表征,模型对表征做推理,再解码回下一时刻的地球状态。她也坦言,天气数据的处理本身就是该领域一个非常有意思、且区别于LLM的难点。
天气模型在输入数据结构上面临的挑战显著区别于文本任务。全球大气通常被划分为经纬度网格(如0.25°分辨率对应约140万个格点),每个格点在垂直方向上有多个气压层,每层记录数十个物理变量,单一时间步的输入张量可达数GB。如何在保留空间结构的同时高效编码球面几何、处理极地区域的网格畸变,是各模型架构差异化的核心所在。例如Pangu-Weather采用三维Transformer并引入地球专用位置编码,GraphCast则将地球网格转换为图结构以建模远程大气遥相关,而扩散模型(如GenCast)则通过概率生成的方式天然支持集成预报。这些设计选择直接影响模型对极端事件的捕捉能力和计算效率的权衡。
数据从哪来:EarthMover Marketplace
运行一个天气模型,第一步是加载初始条件。Emma使用的是EarthMover Marketplace——一个在数据存储之上增加了管理层的平台,专门用来更方便地处理科学数据。对不熟悉气候数据的人来说,这大大降低了繁琐的配置成本。

EarthMover是一个数据市场,注册免费账号即可访问和别人相同的数据集,里面列有各种数据集,部分免费。它的一大优势是按需取数:你不必一次性下载所有变量,只在需要某个变量(如温度、风)的某个时刻时才去获取。因此,即便是在个人电脑上做观测和绘图,也只需要几GB内存,完全可行。数据格式采用适合科学数据的Zarr,通过Python三行代码即可登录并流式获取。
实际运行一个模型:以Aurora为例
教程中演示的是微软几年前发布的Aurora——最早展现出优秀性能的AI天气模型之一。此后微软又推出了更现代、更专门化的版本(如预测空气污染、气旋等),但Aurora作为基础模型出人意料地容易上手。
流程相当标准:先从EarthMover获取所需变量(如两米温度、风的两个分量等,具体要求写在模型文档和Hugging Face模型卡里),再用Hub库几行代码下载模型权重(首次运行需几分钟,之后会缓存),然后把数据整理成模型要求的batch格式,最后指定运行步数即可得到预测结果。
关于算力,Emma给出了实用数字:在GPU上,预测未来6小时(即一步)耗时不到1秒,非常快;在CPU上约需100秒(约一分半)一步,虽然慢但可行。如果想预测一周后的天气,意味着几十步的推演,用CPU会比较耗时。需要注意的是,Aurora目前不支持苹果芯片。
集成预报与评估:仍是开放难题
单个确定性模型(deterministic model)只给出一条预测,但大气中存在大量"蝴蝶效应"——微小因素可能引发巨大差异。为此,研究者引入了集成模型(ensemble models):对同一情形加入微小扰动运行多次(如10次),得到一系列预测再取平均,以期捕捉各种可能性。Emma以自己所在的苏黎世为例,展示了10条预测曲线虽各不相同,但平均后能很好地拟合真实值。

评估在气候科学中格外棘手。Emma坦言,所谓"ground truth"其实并不完全真实——我们无法在海洋中央或荒无人烟处实测温度和降水。业界通过"分析"(analysis)或"再分析"(reanalysis)——用物理或AI模型将有限观测点外推到整个网格——来构造近似真值,常见的如ERA5和IFS。
评估指标同样有局限。像RMSE、绝对误差这类指标对温度这种平滑变量效果不错,但对降水这类高度偏斜的变量就不理想,容易把结果"抹平"。结果是:模型在平滑指标上分数很好,可一旦要预测热浪、气旋、极端降水这类偶发事件,表现就明显偏弱。如何更好地评估这些模型,仍是一个开放的研究课题。
ERA5是ECMWF发布的全球大气再分析数据集,覆盖1940年至今,空间分辨率约为31公里,包含温度、风速、湿度等数百个变量。"再分析"的含义是:将历史上分布不均匀的观测数据(气象站、探空气球、卫星等)同化进物理模型,从而在统一的全球网格上重建过去的大气状态。ERA5被广泛用作AI天气模型的训练数据和评估基准,其本身并非直接观测而是模型推算的产物,这正是文中所说"ground truth并不完全真实"的根源所在。在AI天气预报领域,使用ERA5同时作为训练目标和评估参考,会引入一定的循环论证风险,如何构建更独立的评估体系是当前研究的重要方向之一。
工具生态与Hugging Face的方向

Emma认为,当前AI天气模型的最大痛点是缺乏标准化工具。这些高性能模型问世不过四五年,每个模型的配置、依赖库、初始化数据都各不相同——为一个模型搭好环境花掉一个月,换另一个模型又得再花一个月。更棘手的是,气候领域的研究者虽精通物理,却未必是AI专家,导致这些模型在很大程度上仍被开发它们的AI团队"垄断"。
在Hugging Face层面,团队从两方面发力。基础设施上提供计算(HF Jobs)、存储(buckets可对接EarthMover的Zarr格式)等能力,让用户能在个人电脑、集群或云上运行预报。生态工具上,Emma规划了三个方向:标准化推理流程;建立一个允许社区添加自定义评估指标(如热浪、极端降水)的基准;以及让模型微调变得简单。
其中一项进展来自同事Kashif,他正在把Google发布的Weather Next 2(Weather Next 3已在讨论期间发布)集成进Transformers库。这意味着LLM上熟悉的微调、推理及配套工具,未来都能用于天气模型,让测试与评估大幅简化。
写在最后
这场讨论最打动人的,是它把一个曾经高度专业化、门槛极高的领域,拆解成了普通开发者也能理解和动手的步骤。Emma最后向读者发出邀请:多给博客和项目反馈——无论是提问还是合作,都能推动这个年轻领域走得更远。对于想入门AI天气预报的人来说,现在或许正是动手的好时机。
相关推荐

AI SDK 发布版本更新:sandbox-just-bash 组件信息速览
AI SDK 生态组件 @ai-sdk/sandbox-just-bash 发布 1.0.147 补丁更新,同步 @ai-sdk/harness 依赖。本文梳理该发布记录的版本信息与升级建议。

@ai-sdk/sandbox-vercel 1.0.147 发布说明
@ai-sdk/sandbox-vercel 1.0.147 版本发布,这是一次补丁级更新,主要同步升级内部依赖 @ai-sdk/harness 至相同版本,通过 GitHub 可信签名验证。

ChatGPT洗碗记:一支叉子引发的AI过度推理反思
一支洗碗机没洗净的叉子,引发AI启动"深度研究"、消耗海量算力甚至挑战纳维-斯托克斯千禧难题的荒诞实验。这则ChatGPT洗碗讽刺视频,折射出AI过度推理、算力成本与场景错配的真实困境。