最优传输扩散桥接生成框架TimeBridge
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题 | TimeBridge: Better Diffusion Prior Design with Bridge Models for Time Series Generation |
| 中文标题 | 基于桥模型的时间序列扩散先验设计 |
| 发表会议 | KDD 2026 (ACM SIGKDD Conference on Knowledge Discovery and Data Mining) |
| arXiv | arXiv:2408.06672v3 [cs.LG], 2025年12月24日 |
| 作者单位 | 韩国高等研究院 (KIAS)、首尔国立大学 (SNU) |
| 代码 | https://github.com/JinseongP/TimeBridge |
一、研究背景与核心问题
1.1 时间序列生成的应用场景
时间序列生成在多个领域有重要应用:
- 数据增强 — 扩充训练样本
- 数据隐私 — 生成合成数据替代真实数据
- 假设检验 — 模拟特定数据流模式
- 插补 (Imputation) — 填补缺失值
- 预测 (Forecasting) — 生成未来序列
1.2 扩散模型的核心局限:固定高斯先验
标准扩散模型的问题:
┌─────────────────────────────────────────────────────────┐
│ 数据分布 p_data ──→ 加噪 ──→ 标准高斯 N(0,I) │
│ (正向过程) (固定先验) │
│ │
│ 问题: │
│ • 时间序列具有时序顺序、固定时间点等特性 │
│ • 标准高斯先验缺乏数据特定的时序信息 │
│ • 难以融入领域约束(如趋势、固定点等) │
│ • 反向过程难以控制,需要额外的引导机制 │
└─────────────────────────────────────────────────────────┘
具体例子: 生成具有特定牛市/熊市模式的股票数据时,标准扩散模型需要复杂的嵌入或惩罚函数来引导采样。
1.3 现有方法的局限(表1对比)
| 模型 | 采样器 | 步数 | 无条件生成 | 约束生成 | 分解层 | 桥模型 | 灵活先验 |
|---|---|---|---|---|---|---|---|
| SSSD | DDPM | 1000 | ✅ | △ | ❌ | ❌ | ❌ |
| DiffTime | DDPM | 1000 | △ | ✅ | ❌ | ❌ | ❌ |
| Diffusion-TS | Langevin | 500/1000 | ✅ | △ | ✅ | ❌ | ❌ |
| TimeBridge | DDBM | 119 | ✅ | ✅ | ✅ | ✅ | ✅ |
TimeBridge 的优势: 更少的采样步数 (119 vs 1000)、支持灵活的先验选择、统一处理无条件和条件生成。
二、核心概念:扩散桥 (Diffusion Bridge)
2.1 从标准扩散到扩散桥
标准扩散模型:
dxt=f(xt,t)dt+g(t)dwtd\mathbf{x}_t = \mathbf{f}(\mathbf{x}_t,t)dt + g(t)d\mathbf{w}_tdxt=f(xt,t)dt+g(t)dwt
- 只能将数据映射到固定的标准高斯分布 pT=N(0,I)p_T = \mathcal{N}(0,I)pT=N(0,I)
扩散桥模型:
dxt=[f(xt,t)+g(t)2h(xt,t,y,T)]dt+g(t)dwtd\mathbf{x}_t = \left[\mathbf{f}(\mathbf{x}_t,t) + g(t)^2 \mathbf{h}(\mathbf{x}_t,t,\mathbf{y},T)\right]dt + g(t)d\mathbf{w}_tdxt=[f(xt,t)+g(t)2h(xt,t,y,T)]dt+g(t)dwt
- 可以将数据映射到任意目标分布 pT=ppriorp_T = p_{prior}pT=pprior
- 通过 Doob 的 h-变换实现
关键洞察: 扩散桥 = 最优传输 between 任意两个分布,而非仅限于数据→高斯。
2.2 Schrödinger Bridge vs 扩散桥
| Schrödinger Bridge | 扩散桥 (DDBM) | |
|---|---|---|
| 求解方式 | 迭代优化 (IPF) | 非迭代,直接训练 |
| 计算成本 | 高(每轮前向-反向积分) | 低(类似标准扩散) |
| 与标准扩散兼容性 | 差 | 好 |
| 实际应用 | 有限 | 广泛 |
本文采用 DDBM (Denoising Diffusion Bridge Models) 作为采样器,兼顾理论优雅性和工程实用性。
三、TimeBridge 框架详解
3.1 整体架构(图1)
┌─────────────────────────────────────────────────────────┐
│ TimeBridge 框架 │
├─────────────────────────────────────────────────────────┤
│ │
│ 输入: 数据 x₀ + 先验 x_T (灵活选择) │
│ ↓ │
│ ┌─────────────────────────────────────────┐ │
│ │ 数据驱动先验选择模块 │ │
│ │ • 无条件: 数据依赖先验 / 时间依赖先验 │ │
│ │ • 条件: 趋势先验 / 固定点先验 │ │
│ └─────────────────────────────────────────┘ │
│ ↓ │
│ ┌─────────────────────────────────────────┐ │
│ │ DDBM 扩散桥采样器 │ │
│ │ x_t = α_t·x₀ + σ_t·ε (VP调度) │ │
│ │ 学习去噪器 D_θ(x_t, t, x_T) │ │
│ └─────────────────────────────────────────┘ │
│ ↓ │
│ 输出: 生成的时序样本 x̂₀ │
│ │
└─────────────────────────────────────────────────────────┘
3.2 网络架构:基于 Diffusion-TS 的编码器-解码器 Transformer
核心设计 — 趋势-季节分解:
Dθ=Vtrt(θ,xt,t,xT)+∑i=1KSi,t(θ,xt,t,xT)+R(θ,xt,t,xT)D_\theta = V_{tr}^t(\theta, \mathbf{x}_t, t, \mathbf{x}_T) + \sum_{i=1}^{K} S_{i,t}(\theta, \mathbf{x}_t, t, \mathbf{x}_T) + R(\theta, \mathbf{x}_t, t, \mathbf{x}_T)Dθ=Vtrt(θ,xt,t,xT)+i=1∑KSi,t(θ,xt,t,xT)+R(θ,xt,t,xT)
| 组件 | 功能 | 实现方式 |
|---|---|---|
| 趋势合成 VtrtV_{tr}^tVtrt | 捕捉长期趋势 | 多项式回归器 |
| 季节合成 Si,tS_{i,t}Si,t | 捕捉周期性模式 | 傅里叶变换 (Top-K频率) |
| 残差 RRR | 捕捉随机波动 | 可学习残差 |
关键差异: 标准 Diffusion-TS 不依赖先验 xTx_TxT,而 TimeBridge 显式将 xTx_TxT 作为条件输入。
3.3 训练目标
Lθ=Et,x0[wt(∥x0−Dθ(xt,t,xT)∥2+λ∥FFT(x0)−FFT(Dθ(xt,t,xT))∥2)]\mathcal{L}_\theta = \mathbb{E}_{t,\mathbf{x}_0}\left[w_t\left(\|\mathbf{x}_0 - D_\theta(\mathbf{x}_t, t, \mathbf{x}_T)\|^2 + \lambda\|FFT(\mathbf{x}_0) - FFT(D_\theta(\mathbf{x}_t, t, \mathbf{x}_T))\|^2\right)\right]Lθ=Et,x0[wt(∥x0−Dθ(xt,t,xT)∥2+λ∥FFT(x0)−FFT(Dθ(xt,t,xT))∥2)]
- 第一项: 时域重建损失
- 第二项: 频域一致性损失(傅里叶变换)
- 直接预测 DθD_\thetaDθ 而非噪声 ϵ\epsilonϵ(适应时序数据的随机性)
四、先验设计策略(核心创新)
4.1 研究问题 (RQs)
| RQ | 问题 | 解决方案 |
|---|---|---|
| RQ1 | 数据依赖先验是否有效? | 数据依赖先验 N(μ,diag(σ2))\mathcal{N}(\boldsymbol{\mu}, \text{diag}(\boldsymbol{\sigma}^2))N(μ,diag(σ2)) |
| RQ2 | 如何建模时序动态? | 时间依赖先验(高斯过程 GP) |
| RQ3 | 约束能否作为先验? | 尺度保持的条件先验 |
| RQ4 | 如何保留数据点? | 点保持采样 (Point-Preserving Sampling) |
4.2 无条件生成:数据依赖 & 时间依赖先验
① 数据依赖先验 (Data-Dependent Prior)
xT∼N(μ,diag(σ2))\mathbf{x}_T \sim \mathcal{N}(\boldsymbol{\mu}, \text{diag}(\boldsymbol{\sigma}^2))xT∼N(μ,diag(σ2))
- μ\boldsymbol{\mu}μ 和 σ2\boldsymbol{\sigma}^2σ2 从训练数据按特征和时间戳独立计算
- 例如 ETTh 数据集:μ\boldsymbol{\mu}μ 形状为 (24×7)(24 \times 7)(24×7)(24小时 × 7个特征)
- 优势: 先验包含数据尺度信息,比 N(0,I)\mathcal{N}(0,I)N(0,I) 更接近数据分布
② 时间依赖先验:高斯过程 (GP Prior)
xT∼GP(m,Σ)\mathbf{x}_T \sim GP(\mathbf{m}, \mathbf{\Sigma})xT∼GP(m,Σ)
- 均值函数: m(Ω)=μ\mathbf{m}(\Omega) = \boldsymbol{\mu}m(Ω)=μ(对齐数据依赖先验)
- 协方差函数: RBF 核 K(i,j)=ηexp(−γ∣i−j∣2)\mathcal{K}(i,j) = \eta \exp(-\gamma|i-j|^2)K(i,j)=ηexp(−γ∣i−j∣2)
- 优势: 捕捉时间连续性,避免独立高斯噪声破坏时序结构
4.3 条件生成:尺度保持先验
① 软约束:趋势条件 (Soft Constraints)
场景:生成遵循给定趋势的数据
┌─────────────────────────────────────────┐
│ 标准扩散模型: │
│ • 将趋势作为条件嵌入 │
│ • 需要额外的引导/校正机制 │
│ • 可能生成与条件不同尺度的数据 │
├─────────────────────────────────────────┤
│ TimeBridge: │
│ • 直接将趋势设为先验: x_T = y │
│ • 学习从趋势到数据的"修正" │
│ • 保持相同数据尺度(线性组合) │
│ • 无需额外引导机制 │
└─────────────────────────────────────────┘
数学原理: 由于 $ \hat{\mu}_t = \frac{SNR_T}{SNR_t}\frac{\alpha_t}{\alpha_T}\mathbf{x}_T + \alpha_t\mathbf{x}_0(1-\frac{SNR_T}{SNR_t}) $ 是 x0x_0x0 和 xTx_TxT 的线性组合,数据尺度自然保持。
② 硬约束:固定点条件 & 点保持采样 (Hard Constraints)
应用场景: 插补 (Imputation) — 已知观测值必须保留,只生成缺失值
问题: 标准扩散模型从 N(0,I)\mathcal{N}(0,I)N(0,I) 开始,无法保证固定点不被改变
解决方案 — 点保持采样 (Algorithm 1):
# 核心思想:对已知点不添加噪声
for i in reversed(range(Γ)): # 反向采样
# 标准扩散桥步骤
dx = -f(x_t, t) + g²(t) * (score - h_transform)
# 关键:用 mask 保护已知点
x_{t-1} = x_t + dx ⊙ mask * dt + g(t) * sqrt(dt) * ε ⊙ mask
# ⊙ 表示逐元素乘法
# mask = 1 表示缺失值(允许更新)
# mask = 0 表示观测值(保持不变)
插补先验构造: 线性样条插值
xT(k)=x(kj−1)+x(kj)−x(kj−1)kj−kj−1(k−kj−1),kj−1≤k<kjx_T(k) = x(k_{j-1}) + \frac{x(k_j) - x(k_{j-1})}{k_j - k_{j-1}}(k - k_{j-1}), \quad k_{j-1} \leq k < k_jxT(k)=x(kj−1)+kj−kj−1x(kj)−x(kj−1)(k−kj−1),kj−1≤k<kj
五、实验验证
5.1 数据集
| 数据集 | 类型 | 样本数 | 特征数 | 特点 |
|---|---|---|---|---|
| Sines | 合成 | 10,000 | 5 | 不同频率/相位的正弦函数 |
| MuJoCo | 物理仿真 | 10,000 | 14 | 多变量高级物理仿真 |
| ETTh | 真实 | 17,420 | 7 | 电力变压器温度 |
| Stocks | 真实 | 3,773 | 6 | 谷歌股价和交易量 |
| Energy | 真实 | 19,711 | 28 | 低能耗建筑设备能耗 |
| fMRI | 真实 | 10,000 | 50 | 血氧水平依赖功能磁共振 |
5.2 评估指标
| 指标 | 含义 | 计算方式 |
|---|---|---|
| Context-FID | 分布质量 | TS2Vec嵌入后的Fréchet距离 |
| Correlational | 时序依赖性 | 交叉相关矩阵的绝对误差 |
| Discriminative | 可区分性 | 分类器区分真伪数据的准确率与0.5的差 |
5.3 无条件生成结果(表2,序列长度24)
| 方法 | Context-FID | Correlational | Discriminative | 平均排名 |
|---|---|---|---|---|
| TimeVAE | 2.943 (8) | 3.285 (6) | 0.267 (7) | — |
| TimeGAN | 0.521 (6) | 4.786 (7) | 0.198 (5) | — |
| Diffusion-TS | 0.086 (3) | 0.383 (3) | 0.072 (3) | 3.0 |
| TimeBridge | 0.059 (2) | 0.371 (2) | 0.061 (2) | 2.0 |
| TimeBridge-GP | 0.051 (1) | 0.329 (1) | 0.059 (1) | 1.0 |
关键发现:
- TimeBridge 相比 Diffusion-TS:Context-FID 降低 31.4%,Discriminative 降低 15.3%
- TimeBridge-GP(GP先验)在所有指标上均最优
- 数据/时间依赖先验显著提升生成质量
长序列生成(表3,长度64):
| 数据集 | 方法 | Context-FID | Correlational | Discriminative |
|---|---|---|---|---|
| ETTh | Diffusion-TS | 0.235 | 0.061 | 0.078 |
| TimeBridge-GP | 0.110 | 0.038 | 0.045 | |
| Stocks | Diffusion-TS | 0.948 | 0.005 | 0.149 |
| TimeBridge-GP | 0.693 | 0.005 | 0.090 | |
| fMRI | Diffusion-TS | 3.662 | 4.585 | 0.245 |
| TimeBridge-GP | 0.527 | 1.569 | 0.211 |
→ fMRI 上提升最显著(Context-FID 降低 85.6%)
5.4 条件生成:趋势引导(表4)
| 方法 | 线性趋势 | 多项式趋势 | Butterworth |
|---|---|---|---|
| Context-FID | |||
| Trend Baseline | 0.1729 | 0.1000 | 0.7343 |
| SSSD | 0.0137 | 0.0281 | 0.0575 |
| Diffusion-TS | 0.0049 | 0.0028 | 0.0030 |
| TimeBridge | 0.0028 | 0.0024 | 0.0023 |
→ TimeBridge 在 6/6 设置中取得最佳或次佳
5.5 插补任务(表5 & 表6)
MuJoCo 随机掩码(表5):
| 方法 | 70%缺失 | 80%缺失 | 90%缺失 |
|---|---|---|---|
| RNN | 11.34 | 14.21 | 19.68 |
| CSDI | 0.24±.03 | 0.61±.10 | 4.84±.02 |
| SSSD | 0.37±.03 | 1.00±.05 | 1.90±.03 |
| Diffusion-TS | 0.19±.00 | 0.43±.03 | 0.73±.12 |
| TimeBridge | 0.19±.00 | 0.26±.02 | 0.60±.02 |
ETTh & Energy 几何掩码(表6):
| 数据集 | 缺失率 | SSSD | Diffusion-TS | TimeBridge | TimeBridge-75% |
|---|---|---|---|---|---|
| ETTh | 25% | 0.496 | 0.406 | 0.159 | 0.146 |
| 50% | 0.523 | 0.561 | 0.226 | 0.199 | |
| Energy | 25% | 108.82 | 137.77 | 17.06 | 12.03 |
| 50% | 107.68 | 163.86 | 30.64 | 23.07 |
关键发现:
- TimeBridge-75%(仅用75%缺失率训练)甚至优于按缺失率分别训练的模型
- 证明扩散桥的泛化能力:单一模型适应不同缺失率
5.6 可视化分析
t-SNE 分布对比(图4):
- 红色 = 真实数据,蓝色 = 生成数据
- TimeBridge 生成的样本与真实数据高度重叠
- 在复杂数据集(Stocks、Energy)上表现尤为出色
采样路径(图5):
- (a) 趋势条件:从趋势先验平滑过渡到真实数据
- (b) 插补:点保持采样精确保留观测值(绿点),只填充缺失部分
注意力热力图对比(图8):
- PCT(物理约束Transformer)的注意力图更亮、更有周期性结构
- 说明物理约束帮助模型聚焦有意义的时序模式
5.7 消融实验(表7)
| 变体 | ETTh C-FID | Energy C-FID | 说明 |
|---|---|---|---|
| TimeBridge-GP | 0.067 | 0.064 | 完整模型 |
| VE scheduler | 0.256 | 0.184 | VP优于VE |
| F-matching | 0.087 | 0.081 | 噪声匹配不如直接预测 |
| w/o Fourier | 0.087 | 0.093 | 傅里叶损失有贡献 |
Wasserstein 距离(表8):
| 任务 | 先验 | ETTh | Energy |
|---|---|---|---|
| 无条件 | N(0,I)\mathcal{N}(0,I)N(0,I) | 14.285 | 28.128 |
| N(μ,Σ)\mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Sigma})N(μ,Σ) (Ours) | 2.387 | 6.376 | |
| 插补 | N(0,I)\mathcal{N}(0,I)N(0,I) | 8.000 | 16.113 |
| 线性样条 (Ours) | 0.485 | 1.494 |
→ 数据依赖先验显著降低最优传输距离,解释性能提升
5.8 计算效率(表12)
| 阶段 | Diffusion-TS | TimeBridge | 对比 |
|---|---|---|---|
| 先验构建 | — | 0.09s (无条件) / 2.90s (插补) | 可忽略 |
| 训练/步 | 0.081s | 0.086s (1.06×) | 几乎相同 |
| 总训练时间 | 1458s | 1548s (1.06×) | 几乎相同 |
| 采样时间 | 90.14s | 25.05s (0.28×) | 快3.6× |
关键优势: 更少的采样步数(119 vs 1000+),采样速度提升 3.6倍
六、与前几篇论文的对比分析
| 维度 | TII-CFB | AAAI-ST-ReP | Nature-PCT | KDD-TimeBridge |
|---|---|---|---|---|
| 任务类型 | 预测 | 表示学习+预测 | 预测 | 生成 |
| 核心方法 | GCN+LSTM | C-E-D Transformer | Transformer+JS | 扩散桥 |
| 物理知识 | Pearson相关 | 无 | KDE+JS散度 | 先验分布设计 |
| 关键创新 | 动态边权重 | 重建+预测联合 | 概率物理约束 | 灵活先验选择 |
| 噪声处理 | 多目标损失 | 无特别处理 | JS约束 | 桥模型天然适应 |
| 条件生成 | 无 | 无 | 无 | 趋势/固定点/插补 |
| 可解释性 | 中 | 低 | 中 | 高(分解结构) |
TimeBridge 的独特定位:
- 不是改进预测模型,而是重新设计生成模型的先验
- 将"物理知识"从损失函数层面提升到先验分布层面
- 统一的框架覆盖多种生成场景
七、方法论启示
7.1 扩散桥 vs 标准扩散的核心差异
┌─────────────────────────────────────────────────────────┐
│ 标准扩散模型 │
│ 数据 ←────────────→ 噪声(固定高斯) │
│ 学习去噪 │
│ 问题:单向、固定终点、难以控制 │
├─────────────────────────────────────────────────────────┤
│ 扩散桥模型 │
│ 数据 A ←────────────→ 数据 B (任意先验) │
│ 学习翻译/转换 │
│ 优势:双向、灵活终点、自然融入约束 │
│ │
│ 先验可以是: │
│ • 数据分布的统计摘要 (μ, σ²) │
│ • 时间结构 (高斯过程) │
│ • 领域约束 (趋势、固定点) │
│ • 插值结果 (线性样条) │
└─────────────────────────────────────────────────────────┘
7.2 先验设计的通用原则
| 场景 | 先验选择 | 原理 |
|---|---|---|
| 无条件生成 | 数据依赖 N(μ,Σ)\mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Sigma})N(μ,Σ) | 匹配数据分布,降低传输距离 |
| 需要时序连续性 | GP 先验 | RBF核保持时间相关性 |
| 趋势引导生成 | 趋势 = 先验 | 尺度保持,无需额外引导 |
| 插补/固定点 | 线性样条插值 | 保护观测值,只填充缺失 |
7.3 与物理信息方法的联系
| 方法 | 物理知识融入方式 | 适用场景 |
|---|---|---|
| PINNs | PDE残差作为损失 | 有明确控制方程 |
| PCT (Nature) | KDE分布+JS散度 | 概率性关系 |
| TimeBridge | 先验分布设计 | 任意约束条件 |
TimeBridge 的泛化: 不仅限于物理知识,任何"期望的终点分布"都可以作为先验。
八、局限与未来工作
| 局限 | 说明 | 改进方向 |
|---|---|---|
| 架构继承 | 使用Diffusion-TS骨干,未充分利用桥模型特性 | 设计桥模型专用的Transformer |
| 应用范围 | 仅验证数据合成本身 | 下游任务(预测、决策)验证 |
| 先验选择 | 依赖人工设计 | 自动先验学习/优化 |
| 高维扩展 | 特征数增加时的可扩展性 | 更高效的空间建模 |
九、总结
TimeBridge 的核心贡献可以概括为:
“将扩散模型的’终点’从固定的标准高斯,变为灵活可设计的先验分布,通过扩散桥实现数据与任意先验之间的最优传输”
这一范式转变带来了:
- 更高的生成质量 — 数据依赖先验更接近真实分布
- 更强的条件控制 — 约束即先验,无需复杂引导
- 更快的采样速度 — 119步 vs 1000+步
- 更广的适用场景 — 无条件、趋势、插补统一处理
对于时间序列生成任务,先验设计 可能是比网络架构更重要的研究方向。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)