论文基本信息

项目内容
标题TimeBridge: Better Diffusion Prior Design with Bridge Models for Time Series Generation
中文标题基于桥模型的时间序列扩散先验设计
发表会议KDD 2026 (ACM SIGKDD Conference on Knowledge Discovery and Data Mining)
arXivarXiv:2408.06672v3 [cs.LG], 2025年12月24日
作者单位韩国高等研究院 (KIAS)、首尔国立大学 (SNU)
代码https://github.com/JinseongP/TimeBridge

一、研究背景与核心问题

1.1 时间序列生成的应用场景

时间序列生成在多个领域有重要应用:

  • 数据增强 — 扩充训练样本
  • 数据隐私 — 生成合成数据替代真实数据
  • 假设检验 — 模拟特定数据流模式
  • 插补 (Imputation) — 填补缺失值
  • 预测 (Forecasting) — 生成未来序列

1.2 扩散模型的核心局限:固定高斯先验

标准扩散模型的问题:
┌─────────────────────────────────────────────────────────┐
│  数据分布 p_data ──→ 加噪 ──→ 标准高斯 N(0,I)            │
│              (正向过程)      (固定先验)                    │
│                                                         │
│  问题:                                                  │
│  • 时间序列具有时序顺序、固定时间点等特性                  │
│  • 标准高斯先验缺乏数据特定的时序信息                     │
│  • 难以融入领域约束(如趋势、固定点等)                    │
│  • 反向过程难以控制,需要额外的引导机制                    │
└─────────────────────────────────────────────────────────┘

具体例子: 生成具有特定牛市/熊市模式的股票数据时,标准扩散模型需要复杂的嵌入或惩罚函数来引导采样。

1.3 现有方法的局限(表1对比)

模型采样器步数无条件生成约束生成分解层桥模型灵活先验
SSSDDDPM1000✅△❌❌❌
DiffTimeDDPM1000△✅❌❌❌
Diffusion-TSLangevin500/1000✅△✅❌❌
TimeBridgeDDBM119✅✅✅✅✅

TimeBridge 的优势: 更少的采样步数 (119 vs 1000)、支持灵活的先验选择、统一处理无条件和条件生成。


二、核心概念:扩散桥 (Diffusion Bridge)

2.1 从标准扩散到扩散桥

标准扩散模型:
dxt=f(xt,t)dt+g(t)dwtd\mathbf{x}_t = \mathbf{f}(\mathbf{x}_t,t)dt + g(t)d\mathbf{w}_tdxt​=f(xt​,t)dt+g(t)dwt​

  • 只能将数据映射到固定的标准高斯分布 pT=N(0,I)p_T = \mathcal{N}(0,I)pT​=N(0,I)

扩散桥模型:
dxt=[f(xt,t)+g(t)2h(xt,t,y,T)]dt+g(t)dwtd\mathbf{x}_t = \left[\mathbf{f}(\mathbf{x}_t,t) + g(t)^2 \mathbf{h}(\mathbf{x}_t,t,\mathbf{y},T)\right]dt + g(t)d\mathbf{w}_tdxt​=[f(xt​,t)+g(t)2h(xt​,t,y,T)]dt+g(t)dwt​

  • 可以将数据映射到任意目标分布 pT=ppriorp_T = p_{prior}pT​=pprior​
  • 通过 Doob 的 h-变换实现

关键洞察: 扩散桥 = 最优传输 between 任意两个分布,而非仅限于数据→高斯。

2.2 Schrödinger Bridge vs 扩散桥

Schrödinger Bridge扩散桥 (DDBM)
求解方式迭代优化 (IPF)非迭代,直接训练
计算成本高(每轮前向-反向积分)低(类似标准扩散)
与标准扩散兼容性差好
实际应用有限广泛

本文采用 DDBM (Denoising Diffusion Bridge Models) 作为采样器,兼顾理论优雅性和工程实用性。


三、TimeBridge 框架详解

3.1 整体架构(图1)

┌─────────────────────────────────────────────────────────┐
│                    TimeBridge 框架                         │
├─────────────────────────────────────────────────────────┤
│                                                         │
│  输入: 数据 x₀  +  先验 x_T (灵活选择)                     │
│              ↓                                          │
│  ┌─────────────────────────────────────────┐             │
│  │      数据驱动先验选择模块                 │             │
│  │  • 无条件: 数据依赖先验 / 时间依赖先验      │             │
│  │  • 条件: 趋势先验 / 固定点先验            │             │
│  └─────────────────────────────────────────┘             │
│              ↓                                          │
│  ┌─────────────────────────────────────────┐             │
│  │      DDBM 扩散桥采样器                   │             │
│  │  x_t = α_t·x₀ + σ_t·ε  (VP调度)          │             │
│  │  学习去噪器 D_θ(x_t, t, x_T)             │             │
│  └─────────────────────────────────────────┘             │
│              ↓                                          │
│  输出: 生成的时序样本 x̂₀                                  │
│                                                         │
└─────────────────────────────────────────────────────────┘

3.2 网络架构:基于 Diffusion-TS 的编码器-解码器 Transformer

核心设计 — 趋势-季节分解:

Dθ=Vtrt(θ,xt,t,xT)+∑i=1KSi,t(θ,xt,t,xT)+R(θ,xt,t,xT)D_\theta = V_{tr}^t(\theta, \mathbf{x}_t, t, \mathbf{x}_T) + \sum_{i=1}^{K} S_{i,t}(\theta, \mathbf{x}_t, t, \mathbf{x}_T) + R(\theta, \mathbf{x}_t, t, \mathbf{x}_T)Dθ​=Vtrt​(θ,xt​,t,xT​)+i=1∑K​Si,t​(θ,xt​,t,xT​)+R(θ,xt​,t,xT​)

组件功能实现方式
趋势合成 VtrtV_{tr}^tVtrt​捕捉长期趋势多项式回归器
季节合成 Si,tS_{i,t}Si,t​捕捉周期性模式傅里叶变换 (Top-K频率)
残差 RRR捕捉随机波动可学习残差

关键差异: 标准 Diffusion-TS 不依赖先验 xTx_TxT​,而 TimeBridge 显式将 xTx_TxT​ 作为条件输入。

3.3 训练目标

Lθ=Et,x0[wt(∥x0−Dθ(xt,t,xT)∥2+λ∥FFT(x0)−FFT(Dθ(xt,t,xT))∥2)]\mathcal{L}_\theta = \mathbb{E}_{t,\mathbf{x}_0}\left[w_t\left(\|\mathbf{x}_0 - D_\theta(\mathbf{x}_t, t, \mathbf{x}_T)\|^2 + \lambda\|FFT(\mathbf{x}_0) - FFT(D_\theta(\mathbf{x}_t, t, \mathbf{x}_T))\|^2\right)\right]Lθ​=Et,x0​​[wt​(∥x0​−Dθ​(xt​,t,xT​)∥2+λ∥FFT(x0​)−FFT(Dθ​(xt​,t,xT​))∥2)]

  • 第一项: 时域重建损失
  • 第二项: 频域一致性损失(傅里叶变换)
  • 直接预测 DθD_\thetaDθ​ 而非噪声 ϵ\epsilonϵ(适应时序数据的随机性)

四、先验设计策略(核心创新)

4.1 研究问题 (RQs)

RQ问题解决方案
RQ1数据依赖先验是否有效?数据依赖先验 N(μ,diag(σ2))\mathcal{N}(\boldsymbol{\mu}, \text{diag}(\boldsymbol{\sigma}^2))N(μ,diag(σ2))
RQ2如何建模时序动态?时间依赖先验(高斯过程 GP)
RQ3约束能否作为先验?尺度保持的条件先验
RQ4如何保留数据点?点保持采样 (Point-Preserving Sampling)

4.2 无条件生成:数据依赖 & 时间依赖先验

① 数据依赖先验 (Data-Dependent Prior)

xT∼N(μ,diag(σ2))\mathbf{x}_T \sim \mathcal{N}(\boldsymbol{\mu}, \text{diag}(\boldsymbol{\sigma}^2))xT​∼N(μ,diag(σ2))

  • μ\boldsymbol{\mu}μ 和 σ2\boldsymbol{\sigma}^2σ2 从训练数据按特征和时间戳独立计算
  • 例如 ETTh 数据集:μ\boldsymbol{\mu}μ 形状为 (24×7)(24 \times 7)(24×7)(24小时 × 7个特征)
  • 优势: 先验包含数据尺度信息,比 N(0,I)\mathcal{N}(0,I)N(0,I) 更接近数据分布
② 时间依赖先验:高斯过程 (GP Prior)

xT∼GP(m,Σ)\mathbf{x}_T \sim GP(\mathbf{m}, \mathbf{\Sigma})xT​∼GP(m,Σ)

  • 均值函数: m(Ω)=μ\mathbf{m}(\Omega) = \boldsymbol{\mu}m(Ω)=μ(对齐数据依赖先验)
  • 协方差函数: RBF 核 K(i,j)=ηexp⁡(−γ∣i−j∣2)\mathcal{K}(i,j) = \eta \exp(-\gamma|i-j|^2)K(i,j)=ηexp(−γ∣i−j∣2)
  • 优势: 捕捉时间连续性,避免独立高斯噪声破坏时序结构

4.3 条件生成:尺度保持先验

① 软约束:趋势条件 (Soft Constraints)
场景:生成遵循给定趋势的数据
┌─────────────────────────────────────────┐
│  标准扩散模型:                           │
│    • 将趋势作为条件嵌入                  │
│    • 需要额外的引导/校正机制             │
│    • 可能生成与条件不同尺度的数据        │
├─────────────────────────────────────────┤
│  TimeBridge:                            │
│    • 直接将趋势设为先验: x_T = y        │
│    • 学习从趋势到数据的"修正"            │
│    • 保持相同数据尺度(线性组合)         │
│    • 无需额外引导机制                    │
└─────────────────────────────────────────┘

数学原理: 由于 $ \hat{\mu}_t = \frac{SNR_T}{SNR_t}\frac{\alpha_t}{\alpha_T}\mathbf{x}_T + \alpha_t\mathbf{x}_0(1-\frac{SNR_T}{SNR_t}) $ 是 x0x_0x0​ 和 xTx_TxT​ 的线性组合,数据尺度自然保持。

② 硬约束:固定点条件 & 点保持采样 (Hard Constraints)

应用场景: 插补 (Imputation) — 已知观测值必须保留,只生成缺失值

问题: 标准扩散模型从 N(0,I)\mathcal{N}(0,I)N(0,I) 开始,无法保证固定点不被改变

解决方案 — 点保持采样 (Algorithm 1):

# 核心思想:对已知点不添加噪声
for i in reversed(range(Γ)):  # 反向采样
    # 标准扩散桥步骤
    dx = -f(x_t, t) + g²(t) * (score - h_transform)
    
    # 关键:用 mask 保护已知点
    x_{t-1} = x_t + dx ⊙ mask * dt + g(t) * sqrt(dt) * ε ⊙ mask
    
    # ⊙ 表示逐元素乘法
    # mask = 1 表示缺失值(允许更新)
    # mask = 0 表示观测值(保持不变)

插补先验构造: 线性样条插值
xT(k)=x(kj−1)+x(kj)−x(kj−1)kj−kj−1(k−kj−1),kj−1≤k<kjx_T(k) = x(k_{j-1}) + \frac{x(k_j) - x(k_{j-1})}{k_j - k_{j-1}}(k - k_{j-1}), \quad k_{j-1} \leq k < k_jxT​(k)=x(kj−1​)+kj​−kj−1​x(kj​)−x(kj−1​)​(k−kj−1​),kj−1​≤k<kj​


五、实验验证

5.1 数据集

数据集类型样本数特征数特点
Sines合成10,0005不同频率/相位的正弦函数
MuJoCo物理仿真10,00014多变量高级物理仿真
ETTh真实17,4207电力变压器温度
Stocks真实3,7736谷歌股价和交易量
Energy真实19,71128低能耗建筑设备能耗
fMRI真实10,00050血氧水平依赖功能磁共振

5.2 评估指标

指标含义计算方式
Context-FID分布质量TS2Vec嵌入后的Fréchet距离
Correlational时序依赖性交叉相关矩阵的绝对误差
Discriminative可区分性分类器区分真伪数据的准确率与0.5的差

5.3 无条件生成结果(表2,序列长度24)

方法Context-FIDCorrelationalDiscriminative平均排名
TimeVAE2.943 (8)3.285 (6)0.267 (7)—
TimeGAN0.521 (6)4.786 (7)0.198 (5)—
Diffusion-TS0.086 (3)0.383 (3)0.072 (3)3.0
TimeBridge0.059 (2)0.371 (2)0.061 (2)2.0
TimeBridge-GP0.051 (1)0.329 (1)0.059 (1)1.0

关键发现:

  • TimeBridge 相比 Diffusion-TS:Context-FID 降低 31.4%,Discriminative 降低 15.3%
  • TimeBridge-GP(GP先验)在所有指标上均最优
  • 数据/时间依赖先验显著提升生成质量

长序列生成(表3,长度64):

数据集方法Context-FIDCorrelationalDiscriminative
ETThDiffusion-TS0.2350.0610.078
TimeBridge-GP0.1100.0380.045
StocksDiffusion-TS0.9480.0050.149
TimeBridge-GP0.6930.0050.090
fMRIDiffusion-TS3.6624.5850.245
TimeBridge-GP0.5271.5690.211

→ fMRI 上提升最显著(Context-FID 降低 85.6%)

5.4 条件生成:趋势引导(表4)

方法线性趋势多项式趋势Butterworth
Context-FID
Trend Baseline0.17290.10000.7343
SSSD0.01370.02810.0575
Diffusion-TS0.00490.00280.0030
TimeBridge0.00280.00240.0023

→ TimeBridge 在 6/6 设置中取得最佳或次佳

5.5 插补任务(表5 & 表6)

MuJoCo 随机掩码(表5):

方法70%缺失80%缺失90%缺失
RNN11.3414.2119.68
CSDI0.24±.030.61±.104.84±.02
SSSD0.37±.031.00±.051.90±.03
Diffusion-TS0.19±.000.43±.030.73±.12
TimeBridge0.19±.000.26±.020.60±.02

ETTh & Energy 几何掩码(表6):

数据集缺失率SSSDDiffusion-TSTimeBridgeTimeBridge-75%
ETTh25%0.4960.4060.1590.146
50%0.5230.5610.2260.199
Energy25%108.82137.7717.0612.03
50%107.68163.8630.6423.07

关键发现:

  • TimeBridge-75%(仅用75%缺失率训练)甚至优于按缺失率分别训练的模型
  • 证明扩散桥的泛化能力:单一模型适应不同缺失率

5.6 可视化分析

t-SNE 分布对比(图4):

  • 红色 = 真实数据,蓝色 = 生成数据
  • TimeBridge 生成的样本与真实数据高度重叠
  • 在复杂数据集(Stocks、Energy)上表现尤为出色

采样路径(图5):

  • (a) 趋势条件:从趋势先验平滑过渡到真实数据
  • (b) 插补:点保持采样精确保留观测值(绿点),只填充缺失部分

注意力热力图对比(图8):

  • PCT(物理约束Transformer)的注意力图更亮、更有周期性结构
  • 说明物理约束帮助模型聚焦有意义的时序模式

5.7 消融实验(表7)

变体ETTh C-FIDEnergy C-FID说明
TimeBridge-GP0.0670.064完整模型
VE scheduler0.2560.184VP优于VE
F-matching0.0870.081噪声匹配不如直接预测
w/o Fourier0.0870.093傅里叶损失有贡献

Wasserstein 距离(表8):

任务先验ETThEnergy
无条件N(0,I)\mathcal{N}(0,I)N(0,I)14.28528.128
N(μ,Σ)\mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Sigma})N(μ,Σ) (Ours)2.3876.376
插补N(0,I)\mathcal{N}(0,I)N(0,I)8.00016.113
线性样条 (Ours)0.4851.494

→ 数据依赖先验显著降低最优传输距离,解释性能提升

5.8 计算效率(表12)

阶段Diffusion-TSTimeBridge对比
先验构建—0.09s (无条件) / 2.90s (插补)可忽略
训练/步0.081s0.086s (1.06×)几乎相同
总训练时间1458s1548s (1.06×)几乎相同
采样时间90.14s25.05s (0.28×)快3.6×

关键优势: 更少的采样步数(119 vs 1000+),采样速度提升 3.6倍


六、与前几篇论文的对比分析

维度TII-CFBAAAI-ST-RePNature-PCTKDD-TimeBridge
任务类型预测表示学习+预测预测生成
核心方法GCN+LSTMC-E-D TransformerTransformer+JS扩散桥
物理知识Pearson相关无KDE+JS散度先验分布设计
关键创新动态边权重重建+预测联合概率物理约束灵活先验选择
噪声处理多目标损失无特别处理JS约束桥模型天然适应
条件生成无无无趋势/固定点/插补
可解释性中低中高(分解结构)

TimeBridge 的独特定位:

  • 不是改进预测模型,而是重新设计生成模型的先验
  • 将"物理知识"从损失函数层面提升到先验分布层面
  • 统一的框架覆盖多种生成场景

七、方法论启示

7.1 扩散桥 vs 标准扩散的核心差异

┌─────────────────────────────────────────────────────────┐
│  标准扩散模型                                           │
│    数据 ←────────────→ 噪声(固定高斯)                   │
│         学习去噪                                        │
│    问题:单向、固定终点、难以控制                         │
├─────────────────────────────────────────────────────────┤
│  扩散桥模型                                             │
│    数据 A ←────────────→ 数据 B (任意先验)              │
│         学习翻译/转换                                    │
│    优势:双向、灵活终点、自然融入约束                     │
│                                                         │
│    先验可以是:                                          │
│    • 数据分布的统计摘要 (μ, σ²)                          │
│    • 时间结构 (高斯过程)                                  │
│    • 领域约束 (趋势、固定点)                              │
│    • 插值结果 (线性样条)                                  │
└─────────────────────────────────────────────────────────┘

7.2 先验设计的通用原则

场景先验选择原理
无条件生成数据依赖 N(μ,Σ)\mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Sigma})N(μ,Σ)匹配数据分布,降低传输距离
需要时序连续性GP 先验RBF核保持时间相关性
趋势引导生成趋势 = 先验尺度保持,无需额外引导
插补/固定点线性样条插值保护观测值,只填充缺失

7.3 与物理信息方法的联系

方法物理知识融入方式适用场景
PINNsPDE残差作为损失有明确控制方程
PCT (Nature)KDE分布+JS散度概率性关系
TimeBridge先验分布设计任意约束条件

TimeBridge 的泛化: 不仅限于物理知识,任何"期望的终点分布"都可以作为先验。


八、局限与未来工作

局限说明改进方向
架构继承使用Diffusion-TS骨干,未充分利用桥模型特性设计桥模型专用的Transformer
应用范围仅验证数据合成本身下游任务(预测、决策)验证
先验选择依赖人工设计自动先验学习/优化
高维扩展特征数增加时的可扩展性更高效的空间建模

九、总结

TimeBridge 的核心贡献可以概括为:

“将扩散模型的’终点’从固定的标准高斯,变为灵活可设计的先验分布,通过扩散桥实现数据与任意先验之间的最优传输”

这一范式转变带来了:

  1. 更高的生成质量 — 数据依赖先验更接近真实分布
  2. 更强的条件控制 — 约束即先验,无需复杂引导
  3. 更快的采样速度 — 119步 vs 1000+步
  4. 更广的适用场景 — 无条件、趋势、插补统一处理

对于时间序列生成任务,先验设计 可能是比网络架构更重要的研究方向。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐