0
| 本文作者: 陳淑瑜 | 2026-06-29 18:15 | 專題:ICML:國際機器學習會議 |
原文鏈接:https://mp.weixin.qq.com/s/JPRTypKUYmzeO96AAGxMWw
隨著全球氣候變化的復雜化,氣象預測正成為機器學習領域最具挑戰性的賽道之一。近日,國際機器學習頂會 ICML 2026 接收了論文《Efficient Multi-Scale Transformer for Accumulative Context Weather Forecasting》。
這項研究提出的高效多尺度 Transformer 架構(EMFormer),不僅在氣象預測中實現了精度與效率的雙重飛躍,更打破了領域壁壘,在圖像分類、語義分割等視覺任務中展現出強大的泛化性能。
本文將深入解析這一模型背后的三大創新支柱,看它如何精準捕捉跨尺度的時空特征,并有效破解長期預測中的誤差累積難題。
氣象預測,尤其是多步長長期預測,一直面臨三大核心挑戰:
氣象預測,尤其是多步長長期預測,一直面臨三大核心挑戰:
多尺度特征難以高效捕捉:大氣系統中,從微小氣流到全球環流,不同尺度的特征相互影響,傳統模型難以在高效計算的前提下,全面提取多尺度信息;
長期預測誤差累積:隨著預測時間延長,誤差會不斷累積,導致長期預測精度大幅下降,同時難以保證時間一致性;
模型泛化能力不足:多數氣象預測模型僅針對特定任務設計,難以遷移到其他領域(如視覺任務),通用性較差。
針對這些痛點,來自HKUST和Shanghai AI Lab的研究團隊設計了EMFormer架構,通過三大核心創新,實現了氣象預測與視覺任務的雙向突破。

圖中包含三個階段的新型流程示意圖:
第一階段: 在大氣變量上預訓練 EMFormer。該過程采用了一種“修剪-恢復”架構,具體包括一個修剪模塊、一系列 EMFormer 塊以及一個恢復模塊;
第二階段: 累積上下文微調(Accumulative Context Finetuning);
第三階段: 預測階段,涵蓋氣象預報與臺風路徑預測。
團隊的核心思路是:以“高效多尺度特征提取”為核心,結合“累積上下文微調”和“自適應損失函數”,兼顧精度、效率與泛化能力。以下是三大創新點的詳細解析:
傳統多尺度模塊需堆疊多個卷積分支,計算成本高且梯度更新效率低。團隊設計的Multi-Convs Layer,通過融合三個不同尺度(1×1、3×3、5×5)的卷積核,在單次前向傳播中完成多尺度特征提取,同時通過自定義CUDA核解耦反向傳播,保證每個尺度的梯度獨立更新。

如圖3所示,Multi-Convs Layer(圖3c)相比傳統多尺度模塊(圖3a)和標準重參數化模塊(圖3b),在保證功能等價和梯度等價的前提下,將計算復雜度從O(N???????-H?-W?-r2)降至O(H?-W?-r???2),訓練時間減少25%以上。
理論證明(Theorem 2.1)表明,Multi-Convs Layer與傳統多尺度模塊在功能和梯度上完全等價,但計算效率提升顯著,為后續特征學習奠定了高效基礎。
為解決長期預測中的誤差累積問題,團隊提出累積上下文微調策略,通過緩存前序步驟的KV對,結合動態修剪機制,保留關鍵歷史信息,同時避免內存溢出。

如圖4所示,該策略通過三步實現KV緩存的動態更新與修剪:計算當前注意力得分、融合歷史得分與當前得分、修剪冗余KV對,確保模型在長期預測中能夠利用低誤差歷史狀態,提升時間一致性。
消融實驗表明,相比無微調、標準微調,累積上下文微調能顯著提升長期預測精度,10天預測的ACC提升至0.5389(如表3所示)。
氣象數據存在兩大特性:不同變量(如溫度、氣壓)的時間變化率差異大,不同緯度的網格區域面積不同。團隊設計了融合變量自適應損失與緯度自適應損失的混合損失函數,通過正弦加權機制,在訓練過程中平滑切換損失重點。
損失函數公式如下:
其中,
是緯度加權損失(考慮網格面積差異),
是變量自適應損失(為不同變量分配動態權重),
為可學習參數,實現訓練過程中從“地理校正”到“變量優化”的平滑過渡。
理論證明(Theorem 2.2)表明,
會從-π/2單調演化至π/2,確保損失重點的自適應切換,有效提升預測精度。
團隊在氣象預測、臺風路徑預測、圖像分類、語義分割四大任務中對EMFormer進行了全面驗證,所有實驗均優于現有基線模型,充分證明了模型的有效性與泛化能力。

在1.4°ERA5數據集上,團隊的模型(Ours(w/ finetuning))在6小時至10天的預測中,RMSE均為最低,ACC均為最高,全面超越Pangu-Weather、Graphcast、Oneforecast等基線模型(如表1所示)。

在0.25°ERA5數據集上,EMFormer同樣表現優異,在多變量預測中RMSE顯著低于基線模型(如圖5所示)。

在極端天氣預測場景中,團隊選取2024年10個臺風,對比9個基線模型(包括AIFS、ECMF、Pangu等),EMFormer取得了最低的平均路徑誤差(88.49km),遠低于次優模型的119.17km(如表2所示),尤其在長期臺風路徑預測中優勢顯著。
為驗證模型泛化能力,團隊將EMFormer應用于圖像分類(ImageNet-1K)和語義分割(ADE20K)任務,結果表明:
圖像分類

語義分割

本次中稿ICML 2026的工作,主要做出了以下三大貢獻:
提出Multi-Convs Layer,在保證功能和梯度等價的前提下,實現高效多尺度特征提取,大幅降低計算成本;
設計累積上下文微調策略,有效緩解長期預測的誤差累積,提升時間一致性,且可遷移至其他模型;
提出正弦加權混合損失函數,平衡多變量與地理特征的優化需求,同時實現EMFormer在氣象與視覺任務中的高效泛化。
從氣象預測到視覺任務,EMFormer的突破證明了多尺度Transformer架構在跨領域學習中的巨大潛力,也為后續多尺度特征學習與跨領域模型設計提供了新的思路。