近日,人工智能领域的顶级国际会议——AAAI 2026(The 40th Annual AAAI Conference on Artificial Intelligence)正式公布了论文录用结果。本届大会共收到23,680份有效投稿,最终接收论文4,167篇,录用率为17.6%。AAAI 2026将于2026年1月20日至27日在新加坡举行。

今天给大家解读一篇AAAI2026 时间序列主题论文:EMAformer,论文代码如有需要请自取。另外我整理了AAAI 2025 时间序列相关论文合集感兴趣的自取。

原文 资料 这里!

1. 【导读】

论文基本信息

论文标题:EMAformer: Enhancing Transformer through Embedding Armor for Time Series Forecasting

作者:Zhiwei Zhang, Xinyi Du, Xuanchi Guo, Weihao Wang, Wenjuan Han*

作者机构:1. School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China;2. Beijing Normal University, Beijing, China

论文来源:AAAI2026

论文链接:https://arxiv.org/pdf/2511.08396

项目链接:https://github.com/PlanckChang/EMAformer

2. 【论文速读】

多变量时间序列预测(MTSF)在多个领域至关重要。尽管Transformer架构的变体iTransformer取得了一定进展,但仍落后于最新的MLP-based模型。研究认为性能差距源于不稳定的通道间关系,为此提出EMAformer——一种通过辅助嵌入套件增强Transformer的模型,该套件类似“装甲”能强化模型能力。EMAformer引入全局稳定性相位敏感性跨轴特异性三大关键归纳偏置,在12个真实世界基准数据集上实现了最先进性能,将预测误差的MSE平均降低2.73%、MAE平均降低5.15%,显著提升了基于Transformer的方法在多变量时间序列预测中的实际适用性。

3.【MTSF领域困境与探索:从Transformer瓶颈到嵌入技术突破】

3.1 研究背景

  1. 任务重要性:多变量时间序列预测(MTSF)在工业、学术领域应用广泛,核心挑战是处理复杂的通道间依赖与时间动态性。
  2. Transformer的困境:Transformer虽为多领域标准架构,但在MTSF中表现不及简单的Linear/MLP模型;后续iTransformer通过“变量令牌化”(将单通道时间序列编码为变量令牌)改善适配性,却仍被CycleNet、TQNet等MLP模型超越。
  3. 性能差距根源:通过变异系数(CoV)分析发现,MTSF中通道间相关性随时间剧烈波动(CoV值常大于1),导致自注意力机制受误导、性能不佳;而Transformer擅长的NLP、CV领域,令牌语义/空间上下文更稳定。
  4. 解决方案方向:为解决通道间关系不稳定问题,需为Transformer引入包含关键归纳偏置的嵌入机制,强化其对MTSF动态特性的捕捉能力。

Coefficients of variation (CoV) of the interchannel correlations.

3.2 相关工作

3.2.1 MTSF的令牌化策略
  1. 时间令牌化:传统范式,将所有变量嵌入为时间令牌,依赖自回归机制预测未来步长,早期Transformer时间序列模型(如Autoformer)均遵循此思路,通过注意力建模时间依赖。
  2. 变量令牌化:突破传统思路,将单通道全时间序列嵌入为变量令牌,由DLinear首次隐含采用、iTransformer明确形式化;该策略下方法分两类:
    • 通道独立范式:各通道独立建模,不考虑通道间关联。
    • 通道依赖范式:建模通道间交互,EMAformer即属此类,以iTransformer为直接前驱,在不修改Transformer架构的前提下优化输入表示。
3.2.2 MTSF的嵌入技术
  1. 通用嵌入应用:嵌入技术在Transformer中广泛用于捕捉语义差异(如BERT的句子嵌入、ViT的补丁位置嵌入);MTSF中,令牌嵌入多为原始数据投影,辅助嵌入常用于时间令牌化(如Informer的时间戳嵌入、 positional embedding)。
  2. 变量令牌化下的嵌入探索:CycleNet曾引入残余周期预测技术注入周期信息,但对Transformer性能提升不稳定;EMAformer提出的“相位嵌入”可编码序列级周期模式,且经消融实验验证能稳定提升性能,其通道嵌入、联合通道-相位嵌入在MTSF领域暂无类似设计。

4.【EMAformer的“嵌入装甲”:三大核心嵌入与Transformer融合术】

4.1 问题定义

多变量时间序列预测(MTSF)任务旨在基于过去L个时间步的C个变量/通道观测数据,学习函数 f : R L × C → R H × C f: \mathbb{R}^{L ×C} \to \mathbb{R}^{H ×C} f:RL×CRH×C以预测未来H个时间步的数据,公式定义如下:
Y t + 1 : t + H = f ( X t − L + 1 : t ) Y_{t+1: t+H}=f\left(X_{t-L+1: t}\right) Yt+1:t+H=f(XtL+1:t)
其中, X t − L + 1 : t = [ x t − L + 1 , x t − L + 2 , . . . , x t ] X_{t-L+1: t} = \left[x_{t-L+1}, x_{t-L+2}, ..., x_{t}\right] XtL+1:t=[xtL+1,xtL+2,...,xt](历史观测序列,每个 x t ∈ R C x_{t} \in \mathbb{R}^{C} xtRC), Y ^ t + 1 : t + H = [ x ^ t + 1 , x ^ t + 2 , . . . , x ^ t + H ] \hat{Y}_{t+1: t+H}=\left[\hat{x}_{t+1}, \hat{x}_{t+2}, ..., \hat{x}_{t+H}\right] Y^t+1:t+H=[x^t+1,x^t+2,...,x^t+H](预测序列),简记 X t − L + 1 : t X_{t-L+1: t} XtL+1:t X X X Y ^ t + 1 : t + H \hat{Y}_{t+1: t+H} Y^t+1:t+H Y ^ \hat{Y} Y^

4.2 EMAformer整体框架

EMAformer的核心是为Transformer引入“嵌入装甲”——三种辅助嵌入(通道嵌入、相位嵌入、联合通道-相位嵌入),以注入全局稳定性相位敏感性跨轴特异性三大归纳偏置。整体流程为:将三种辅助嵌入与变量令牌嵌入融合,输入Transformer编码器,经处理后通过MLP与矩阵转置生成预测结果,不改变Transformer核心架构,仅通过嵌入优化输入表示。

Overview of EMAformer.

4.3 核心嵌入设计

4.3.1 变量令牌嵌入(基础嵌入)

基于iTransformer的变量令牌化思路,对输入矩阵转置后进行嵌入,将单通道全时间序列编码为变量令牌,公式为:
E x = X ⊤ W + b ∈ R C × d E_{x}=X^{\top} W+b \in \mathbb{R}^{C × d} Ex=XW+bRC×d
其中, E x E_{x} Ex为变量令牌嵌入结果, d d d为嵌入维度, W ∈ R L × d W \in \mathbb{R}^{L ×d} WRL×d b ∈ R d b \in \mathbb{R}^{d} bRd为可学习的变换参数。

4.3.2 通道嵌入(全局稳定性偏置)

为稳定通道局部表示、编码通道身份与全局语义属性,引入可学习的通道嵌入矩阵,公式为:

  1. 定义通道嵌入矩阵: Ω c ∈ R C × d \Omega_{c} \in \mathbb{R}^{C ×d} ΩcRC×d(每行对应一个通道的嵌入);
  2. 第i个通道的嵌入获取: E c i = L o o k u p ( Ω c , i ) ∈ R 1 × d E_{c}^{i}=Lookup\left(\Omega_{c}, i\right) \in \mathbb{R}^{1 × d} Eci=Lookup(Ωc,i)R1×d(通过查找操作提取对应通道嵌入);
    通过共享通道嵌入至所有时间步,构建全局稳定表示,抑制噪声与虚假关联。
4.3.3 相位嵌入(相位敏感性偏置)

为恢复时间细节、编码变量令牌在周期中的相位位置,基于预定义周期长度P设计可学习相位嵌入矩阵,公式为:

  1. 定义相位嵌入矩阵: Ω p ∈ R P × d \Omega_{p} \in \mathbb{R}^{P ×d} ΩpRP×d
  2. 第i个变量令牌的相位嵌入获取: E p i = L o o k u p ( Ω p , t m o d    P ) ∈ R 1 × d E_{p}^{i}=Lookup\left(\Omega_{p}, t \mod P\right) \in \mathbb{R}^{1 × d} Epi=Lookup(Ωp,tmodP)R1×d
    其中, t t t为最后一个观测步的绝对时间, t m o d    P t \mod P tmodP计算周期内相位,使嵌入捕捉序列级周期模式。
4.3.4 联合通道-相位嵌入(跨轴特异性偏置)

为解决通道嵌入(时间不变)与相位嵌入(通道不变)无法建模“通道-时间”交织依赖的问题,设计可学习的联合嵌入张量,公式为:

  1. 定义联合嵌入张量: Ω c p ∈ R C × P × d \Omega_{c p} \in \mathbb{R}^{C ×P ×d} ΩcpRC×P×d(通过通道索引与相位索引双重定位);
  2. 第i个变量令牌的联合嵌入获取: E c p i = L o o k u p ( Ω c p , i , t m o d    P ) ∈ R 1 × d E_{c p}^{i}=Lookup\left(\Omega_{c p}, i, t \mod P\right) \in \mathbb{R}^{1 × d} Ecpi=Lookup(Ωcp,i,tmodP)R1×d
    通过绑定通道全局特征与特定相位,注入细粒度信息,捕捉通道专属的时间周期模式。

4.4 嵌入融合与Transformer编码流程

4.4.1 嵌入融合

将变量令牌嵌入与三种辅助嵌入通过元素级求和融合,得到完整令牌表示,作为Transformer编码器输入,公式为:
Z 0 = E x + E c + E p + E c p ∈ R C × d Z_{0}=E_{x}+E_{c}+E_{p}+E_{c p} \in \mathbb{R}^{C × d} Z0=Ex+Ec+Ep+EcpRC×d
其中, Z 0 Z_{0} Z0为融合后的初始输入张量。

4.4.2 Transformer编码器计算

编码器由N个堆叠层组成,每层含多头自注意力(MSA)模块与位置前馈网络(FFN),并采用层归一化(LN)与残差连接,关键公式如下:

  1. 第l层计算(l从1到N):
    Z l ′ = L N ( M S A ( Z l − 1 ) + Z l − 1 ) Z_{l}'=LN\left(MSA\left(Z_{l-1}\right)+Z_{l-1}\right) Zl=LN(MSA(Zl1)+Zl1)
    Z l = L N ( F F N ( Z l ′ ) + Z l ′ ) Z_{l}=LN\left( FFN\left( Z_{l}'\right)+Z_{l}'\right) Zl=LN(FFN(Zl)+Zl)
    Z l ∈ R C × d Z_{l} \in \mathbb{R}^{C ×d} ZlRC×d为第l层输出张量);
  2. MSA模块计算:
    M S A = C o n c a t ( h e a d 1 , . . . , h e a d h ) W O MSA= Concat \left( head _{1}, ..., head _{h}\right) W^{O} MSA=Concat(head1,...,headh)WO
    h e a d k = A t t e n t i o n ( Z W k Q , Z W k K , Z W k V ) head _{k}=Attention\left(Z W_{k}^{Q}, Z W_{k}^{K}, Z W_{k}^{V}\right) headk=Attention(ZWkQ,ZWkK,ZWkV)
    其中, h h h为注意力头数, W k Q , W k K , W k V ∈ R d × d h W_{k}^{Q}, W_{k}^{K}, W_{k}^{V} \in \mathbb{R}^{d ×d_{h}} WkQ,WkK,WkVRd×dh d h = d / h d_{h}=d/h dh=d/h,单头维度)为投影参数, W O W^{O} WO为输出投影参数。

4.5 预测输出生成

经N层Transformer编码后,将最终输出张量 Z N Z_{N} ZN输入MLP进行映射,再通过矩阵转置得到与目标格式匹配的预测结果 Y ^ \hat{Y} Y^,即:
Y ^ = ( M L P ( Z N ) ) ⊤ ∈ R H × C \hat{Y}=\left(MLP\left(Z_{N}\right)\right)^{\top} \in \mathbb{R}^{H ×C} Y^=(MLP(ZN))RH×C

5.【EMAformer实战成绩单:12个基准数据集上的性能碾压与深度验证】

5.1 主实验性能:刷新12个基准SOTA

  1. 整体表现:在24个(12个数据集×2个指标)场景中,EMAformer斩获20个场景第一、3个场景第二,仅1个场景未进前二。
  2. 误差降低幅度:相较于次优模型,平均降低2.73% MSE、5.15% MAE;对通道数超100的数据集优化更显著,MSE降低5.07%、MAE降低7.57%,其中PEMS04、PEMS08数据集性能提升近10%。
  3. 典型数据集结果:如ETTh2数据集上,EMAformer MSE=0.373、MAE=0.395,优于TQNet(MSE=0.378、MAE=0.402)与iTransformer(MSE=0.383、MAE=0.407);ECL数据集上,其MSE=0.158、MAE=0.247,大幅领先DLinear(MSE=0.212、MAE=0.300)。

Performance comparison of multivariate long-term time series forecasting

原文 资料 这里!

5.2 消融实验:三大嵌入缺一不可

  1. 实验设计:以“仅变量令牌嵌入”为基础,逐步添加通道嵌入、相位嵌入、联合通道-相位嵌入,通过雷达图对比各变体MAE性能(经max-min归一化,离中心越远性能越优)。
  2. 关键结论
    • 完整模型(三种嵌入全加)性能最优,验证三大嵌入协同作用;
    • 单独添加任一嵌入均能提升性能,其中通道嵌入可稳定通道关联、相位嵌入可捕捉周期细节,联合嵌入则补充“通道-时间”交织依赖;
    • 不同数据集对嵌入的敏感性存在差异,但整体上融合嵌入能更全面捕捉归纳偏置。
      Ablation study

5.3 注意力熵分析:嵌入引导注意力聚焦

  1. 分析逻辑:通过计算Transformer最后一层注意力分数的熵(行平均熵),评估嵌入对注意力分布的引导作用(熵越低,注意力越集中于关键通道)。
  2. 核心发现
    • 原始模型(无辅助嵌入)熵值高(如ETT系列熵接近最大值2.81),注意力分布分散;
    • 加入通道嵌入后熵值降低,模型能更精准聚焦相关通道;
    • 加入完整嵌入(含相位)后熵值略高于仅通道嵌入,但仍低于原始模型,说明相位信息可帮助捕捉周期内有效变化,解释性能提升原因。
      Entropy of the attention score

5.4 泛化性验证:赋能其他Transformer与抗干扰测试

  1. Transformer变体优化:将EMAformer的嵌入策略应用于Reformer、Informer、Flowformer,在相同实验设置下,相较于仅用“变量令牌化”(+Inverted),添加嵌入(+Embedding)后进一步降低预测误差,证明嵌入策略的泛化有效性(如Traffic数据集上,Informer+Embedding较+Inverted提升23.65%)。
    Performance of Transformer variants with our embeddings.

  2. backbone替换测试:将Transformer替换为MLP,保持其他参数不变,结果显示:EMAformer的MLP版本仍优于多数MLP基线(仅PEMS07上略逊于TQNet,归因于未调参),且Transformer版本性能始终优于MLP版本,验证嵌入策略与Transformer架构的适配性。
    Comparison of our embedding strategy

  3. 去历史信息测试:将输入序列替换为均值(预处理后接近0,无历史信息),模型性能虽下降,但仍优于2022-2023年部分基线,证明嵌入能捕捉数据集级全局特征,具备一定抗干扰能力。
    Replacing the input series with its mean values to eliminate the history information

5.5 超参数与资源开销:高效且实用

  1. 周期长度P选择:对比日周期(如ETT系列P=24)与周周期(P=168),发现日周期在多数数据集(如ETTh1、ETTm2)上性能更优,周周期虽能隐含日周期,但样本量减少影响学习,最终根据实证性能选择P。
  2. 资源消耗:在消费级GPU上,辅助嵌入导致的训练/测试时间增加不显著(通道少的数据集几乎无差异),内存占用虽有上升,但整体成本可控,结合性能提升,资源开销具备性价比。
     Comparison of daily vs. weekly period lengths.

6.【总结展望】

本文针对多变量时间序列预测中Transformer架构因通道间相关性波动导致性能落后于MLP模型的问题,提出EMAformer模型,通过引入通道嵌入、相位嵌入、联合通道-相位嵌入三大辅助嵌入(注入全局稳定性、相位敏感性、跨轴特异性归纳偏置),在不改变Transformer核心架构的前提下稳定通道关系并保留时间动态性,其在12个真实世界基准数据集上实现state-of-the-art性能,平均降低2.73% MSE和5.15% MAE,且经多类实验验证了有效性与鲁棒性;未来将进一步探索多周期嵌套结构、研究自适应周期机制、引入通道显式拓扑结构,推动Transformer及LLM在时间序列分析领域的更广泛应用。

原文 资料 这里!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐