Files
ts-as-modality/MTSAD-技术深度调研报告.md
T
2026-06-29 21:16:52 +08:00

60 KiB
Raw Permalink Blame History

多维时序异常检测(MTSAD)技术深度调研报告

调研日期2026-06-29 调研范围:多维时序异常检测的技术路线、经典模型、SOTA 模型、评测方法、当前局限与垂直场景应用 适用读者:AIOps / 时序分析 / 异常检测产品方向的技术决策者、算法工程师、产品经理


一、执行摘要

多维时序异常检测(Multivariate Time Series Anomaly Detection, MTSAD)经过 2018-2026 年的演进,已形成 "统计学经典 + 深度学习 + 时序基础模型(TSFM+ LLM 增强" 的多元技术格局。

当前 SOTA 主要由三类方法主导

  1. 对比学习DCdetector、DBA、CARLA
  2. Transformer 关联差异Anomaly Transformer、TimesNet
  3. 时序基础模型Chronos、MOMENT、Timer、Time-MoE、TTM

工业落地呈现明显分化

  • 云可观测性偏好 统计基线 + RCF + EWMADatadog Watchdog、Elasticsearch ML
  • 金融风控偏好 XGBoost + GNN + Isolation Forest 集成PayPal、Visa VAA
  • 工业预测性维护偏好 LSTM-AE / GATNASA telemanom、MTAD-GAT
  • 可观测性、金融、医疗等强监管场景对 可解释性要求最高

最重要的认知

  • Point AdjustmentPA)虚高 2-5 倍是当前评估体系的最大陷阱
  • 工业界几乎 没有"端到端 DL 异常检测"被直接卖给客户,全部是"统计+无监督+监督+规则"组合拳
  • 跨数据集 F1 下降 30-50%泛化性问题严重

二、技术路线全景图

大类 子类 代表方法 核心思想
统计/经典 分布型 HBOS、ECOD、Gaussian 假设分布、计算偏离
距离/密度 KNN、LOF、Isolation Forest 局部密度/隔离性
谱分析 SR-CNNSpectral Residual 视觉显著性迁移
状态空间 SSM、Kalman、Prophet 显式建模状态转移
经典 ML 树模型 XGBoost、LightGBM + 特征工程 监督/半监督二分类
深度学习 RNN/GRU LSTM-VAE、OmniAnomaly 时序 + 概率重构
对抗式 AE USAD、TranAD 双解码器博弈
CNN/TCN TimesNet、TCN-AD 多尺度卷积
Transformer Anomaly Transformer、TranAD 注意力 + 关联差异
图网络 GDN、MTAD-GAT 变量关系建模
对比学习 DCdetector、CARLA、DBA 置换不变表示
扩散模型 Diffusion-TS、D3R、ImDiffusion 重建误差 + 不确定性
TSFM(基础模型) 通用预训练 Chronos、TimesFM、MOMENT、Timer、Time-MoE、TTM 大规模预训练 + 零样本
LLM 增强 重编程 Time-LLM、AutoTimes LLM 嵌入对齐时序
多模态 ChatTS、TimeChat 时序作为新模态
零样本 Prompt LSTPrompt、Lag-Llama 提示工程驱动

三、经典模型精解(2018-2022

3.1 LSTM-VAE (Park et al. 2018)

  • 核心原理:将 LSTM 时序建模与 VAE 概率重构结合,把传感器序列映射为高斯潜变量空间,用重构概率reconstruction probability)而非点对点重构误差作为异常分数,从而兼顾时间依赖与不确定性。
  • 架构:输入窗口 x₁:T → LSTM 编码器 → 隐变量 z (μ, σ²) → LSTM 解码器 → 重建 x̂₁:T;损失为重构负对数似然 + KL 散度的变分下界(ELBO)。
  • 优势:概率重构提供可解释的置信度;LSTM 显式建模时序依赖;训练稳定,工程易落地。
  • 劣势:潜变量先验固定为高斯,难以刻画多模态分布;窗口长度/KL 权重需调;仅依赖重构,漏报率高。
  • 代表论文Park D, Hoshi Y, Kemp C C. "A Multimodal Anomaly Detector for Robot-Assisted Feeding Using an LSTM-based Variational Autoencoder." IEEE Transactions on Robotics, 2018.
  • 典型表现:机器人辅助喂食多模态数据 P/R ≈ 0.85+。

3.2 OmniAnomaly (Su et al. KDD 2019)

  • 核心原理随机循环神经网络 (Stochastic RNN) + GRU + 门控 VAE + 平面 Normalizing Flow 的复合架构,对潜变量分布进行灵活的非高斯拟合;用重构概率与潜在表示与先验的 KL 散度联合打分,并结合 POT 阈值选取。
  • 架构:输入序列 → GRU 编码器 → 隐变量 z → 平面 NF 变换 → GRU 解码器 → 重建;异常分数 = -log p(x̂|x) - λ·KL(q(z)||p(z))。
  • 优势:潜变量分布更灵活(NF 提升表达力);同时考虑重构与潜在空间偏离,对复杂异常鲁棒;引入 POT 自适应阈值。
  • 劣势:训练代价高(GRU+VAE+NF 联合优化);易出现后验坍缩;阈值 POT 对极端长尾不敏感。
  • 代表论文Su Y, Zhao Y, Niu C, Liu R, Sun W, Pei D. "Robust Anomaly Detection for Multivariate Time Series through Stochastic Recurrent Neural Network." KDD 2019.
  • 典型表现SMAP F1≈0.85 / MSL F1≈0.89 / SMD 0.85首次发布 SMD (Server Machine Dataset) 基准,被后续工作广泛沿用。

3.3 USAD (Audibert et al. KDD 2020)

  • 核心原理双编码器-解码器架构 + 对抗式两阶段训练。两个解码器共享一个编码器,相互"博弈"以放大正常/异常在重构空间的可区分性;异常分数为两解码器重构误差的非线性组合。
  • 架构x → Encoder E → 共享隐 z → Decoder D₁(z) / Decoder D₂(z);训练阶段 1 (W₁) 训练 E + D₁ 逼近 AE;阶段 2 (W₂) 训练 E + D₂ 对抗 D₁。
  • 优势:训练快(无需 NF / 隐变量采样),工程落地极简;对抗式损失带来稳定训练;轻量级,在线推理 O(L)。
  • 劣势:仅基于重构,未建模潜空间分布;超参(α、β)敏感;对复杂多模态异常表现一般。
  • 代表论文Audibert J, Michiardi P, Guyard F, Marti S, Zuluaga M A. "USAD: UnSupervised Anomaly Detection on Multivariate Time Series." KDD 2020.
  • 典型表现SWaT F1≈0.79 / SMAP 0.92 / MSL 0.88。综合速度与精度,被工业界广泛采用为基线(工业首选)

3.4 GDN (Deng & Hooi AAAI 2021)

  • 核心原理图神经网络 + 结构学习 + Top-k 注意力。将每个传感器视为一个节点,通过学习到的稀疏有向图显式建模变量间因果关系;用 Graph Attention 聚合邻居信息,再通过偏差评分 (deviation score) 进行异常判定。
  • 架构:输入窗口 → Embedding → 图结构学习层(用 Top-k 注意力学习稀疏邻接矩阵)→ 图卷积(Graph Attention)聚合邻居 → 预测下一时刻 → 与真实值偏差 = 异常分数。
  • 优势可解释性强(学习到的图能可视化变量间依赖);显式建模变量关系,减少误报;与业务结合紧密(可定位异常根因)。
  • 劣势:图结构学习对噪声敏感;训练复杂度 O(N²),N 大时不可扩展;异常分数仅依赖预测偏差,对突变异常鲁棒。
  • 代表论文Deng A, Hooi B. "Graph Neural Network-Based Anomaly Detection in Multivariate Time Series." AAAI 2021, pp. 4027-4035.
  • 典型表现MSL F1≈0.99benchmark 上接近 SOTA),SWaT / WADI 显著优于非图方法;可解释图被运维领域广为应用。

3.5 Anomaly Transformer (Xu et al. ICLR 2022 Spotlight)

  • 核心原理关联差异 (Association Discrepancy) 判据。利用 Transformer 同时建模逐点表示与成对关联;通过先验关联 (Gaussian kernel)学习关联 (自注意力) 之差量化异常;采用 minimax 训练策略 放大正常-异常可分性。
  • 架构:输入 → Linear Projection → N 层 Anomaly-Attention Block(每个块同时输出:学习关联 P̂、先验关联 P̃);重建输出 + 关联差异得分;损失 L_total = L_recon - λ·L_discrepancy,采用交替 minimax 优化。
  • 优势:双分支可解释,关联差异可作为异常归因;无需标签、监督弱;在多类数据上 SOTA。
  • 劣势:O(L²) 自注意力,长序列成本高;高斯先验带宽 σ 需手工设定;minimax 训练不稳定,难复现。
  • 代表论文Xu J, Wu H, Wang J, Long M. "Anomaly Transformer: Time Series Anomaly Detection with Association Discrepancy." ICLR 2022 (Spotlight).
  • 典型表现:在 SMD、MSL、SMAP、PSM、SWaT 五个基准上 F1 均超 0.85-0.95。

3.6 TranAD (Tuli et al. VLDB 2022)

  • 核心原理基于 Transformer 的对抗自编码器。采用编码器-解码器架构 + 自条件 (Self-Conditioning) 机制 + 对抗训练;通过焦点分数 (Focus Score) 放大重构误差尖锐度,并结合 MAML 提升小样本/概念漂移场景的鲁棒性。
  • 架构:输入 x → Transformer Encoder → 共享 z → 两个 Transformer DecoderD₁, D₂)做对抗式博弈;推理时异常分数 = α·‖x−D₁(x)‖ + β·‖x−D₂(x)‖。
  • 优势:训练快(论文称训练时间最高减少 99%);自条件机制增强多模态捕获;适合在线/流式检测。
  • 劣势:仍依赖重构误差;对长期依赖建模有限;多解码器增加内存占用。
  • 代表论文Tuli S, Casale G, Jennings N R. "TranAD: Deep Transformer Networks for Anomaly Detection in Multivariate Time Series Data." VLDB 2022.
  • 典型表现:在 SMD、MSL、SMAP、SWaT、NeurIPS-TS、UCR 等 6 个数据集上 F1 较基线最高提升 17%;推理延迟 <1ms/窗口。

3.7 TimesNet (Wu et al. ICLR 2023)

  • 核心原理将一维时间序列的复杂变化拆解为 2D 张量建模。观察到时序具有多周期性,按周期长度折叠为 2D 张量(行=周期间变化,列=周期内变化),用 2D 卷积 (Inception block) 统一提取,再映射回 1D。
  • 架构:输入序列 → FFT 取 Top-k 周期 → 折叠为多组 2D 张量 → TimesBlock (Inception 2D 卷积 + 残差) → 1D 重塑 → 任务头(预测/填补/分类/异常检测)。
  • 优势任务通用(同一骨干支持预测/填补/分类/异常检测五任务);1D→2D 视角创新,长短期依赖皆可捕获;已有官方代码库 Time-Series-Library,工程友好。
  • 劣势:周期数 k 需预设;FFT 折叠对非平稳序列不鲁棒;异常检测子任务性能并非 SOTA(相对 Anomaly Transformer)。
  • 代表论文Wu H, Hu T, Liu Y, Zhou H, Wang J, Long M. "TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis." ICLR 2023.
  • 典型表现:在五项主流时序分析任务上一致 SOTA;异常检测在 SMD/MSL/SMAP 上 F1 ≈ 0.86-0.92。

3.8 DAGMM (Zong et al. ICLR 2018)

  • 核心原理深度自编码高斯混合模型 (Deep Autoencoding Gaussian Mixture Model)。两阶段端到端架构:第一阶段用压缩网络 (Compression Net) 提取低维表示 + 重建误差;第二阶段用估计网络 (Estimation Net) 拟合高斯混合模型对样本进行密度估计;联合优化重构 + 混合模型似然。
  • 架构:x → 自编码器 (AE) → 隐变量 z_concat [z; x_recon_err] → 估计网络 (GMM) → 输出混合成分概率与能量分数;异常分数 = -log Σ_k π_k N(x|μ_k, Σ_k)。
  • 优势:端到端联合训练(AE 与 GMM 共享梯度);训练效率高、推理快速;无监督、密度驱动可解释。
  • 劣势:GMM 假设难以刻画复杂流形;对高维多变量时序扩展性差;早期工作,未考虑时序依赖(视为 i.i.d. 样本)。
  • 代表论文Zong B, Song Q, Min M R, Cheng W, Lumezanu C, Cho D, Chen H. "Deep Autoencoding Gaussian Mixture Model for Unsupervised Anomaly Detection." ICLR 2018.
  • 典型表现:在 KDDCUP、Thyroid、Arrhythmia 等经典异常检测数据集上 F1 显著优于 OC-SVM。

3.9 横向对比表

模型 年份/会议 核心创新 数据模态建模 异常分数 主流数据集 F1 (近似) 工程落地难度
DAGMM ICLR 2018 AE+GMM 端到端联合训练 i.i.d. 多维向量 密度能量 KDDCUP ≈ 0.93 ★★ 低
LSTM-VAE T-RO 2018 LSTM + VAE 概率重构 序列 + 概率 重构概率 机器人 ≈ 0.85 ★★ 低
OmniAnomaly KDD 2019 随机 RNN + Planar NF 序列 + 灵活潜空间 重构概率 + KL SMAP 0.85 / MSL 0.89 / SMD 0.85 ★★★★ 高
USAD KDD 2020 双解码器对抗训练 静态窗口 双解码器重构组合 SWaT 0.79 / SMAP 0.92 / MSL 0.88 ★★ 低(工业首选
GDN AAAI 2021 图结构学习 + Top-k 注意力 变量关系 + 序列 预测偏差 MSL ≈ 0.99 ★★★ 中
Anomaly Transformer ICLR 2022 关联差异 + minimax 训练 序列 + 关联 关联差异 0.85-0.95 ★★★★ 高
TranAD VLDB 2022 Transformer 对抗自条件 序列 + 多模态 自条件重构 6 数据集 F1 +17% ★★★ 中(速度极快
TimesNet ICLR 2023 1D→2D 周期建模 多周期 2D 张量 重构 / 预测 0.86-0.92 ★★★ 中(任务通用

3.10 经典模型的选型建议(工程落地视角)

场景 推荐模型 理由
工业级在线检测 / 资源受限 USAD、TranAD 训练快、推理快、易部署
需要可解释性 / 根因定位 GDN、Anomaly Transformer 图结构 / 关联差异可视化
多周期 / 多任务通用骨干 TimesNet 一套骨架支持多任务
潜空间分布复杂 OmniAnomaly、Anomaly Transformer 概率建模 / 灵活先验
i.i.d. 多维向量(非时序) DAGMM 经典密度估计,端到端

3.11 经典模型的关键观察

  1. 趋势演化:从 2018 年 DAGMM 的 i.i.d. 假设 → LSTM-VAE/OmniAnomaly 的概率时序建模 → USAD/TranAD 的轻量化对抗训练 → GDN/Anomaly Transformer 的结构化建模 → TimesNet 的统一骨干,研究范式从「重构误差」逐步走向「结构+关联+周期」的多视角融合。
  2. 工程友好度排序(由高到低)USAD ≈ TranAD > DAGMM > LSTM-VAE > GDN > TimesNet > Anomaly Transformer > OmniAnomaly。
  3. 共同短板:上述模型均无法自然处理概念漂移 / 在线增量学习,实际工程中常配合滑动窗口 + 周期性重训练策略。

四、SOTA 与前沿(2023-2026

4.1 时间序列基础模型(TSFM

4.1.1 TimeGPT-1 / TimeGPT-2 (Nixtla, 2023-2025)

  • 论文arXiv:2310.03589v1 2023-10,正式版 2024-05
  • 机构NixtlaAzul Garza, Cristian Challu, Max Mergenthaler-Canseco
  • 核心创新:业界首个面向时序预测的"基础模型"产品级发布(API 服务 timegpt-1)。基于 Transformer 架构,在大规模跨域时序语料上预训练,支持**零样本推理(zero-shot inference**与多种预测粒度。
  • 开源情况:未开源完整模型权重,仅提供商业 API(Nixtla Cloud)与部分代码示例(nixtla Python SDK);TimeGPT-2 已于 2024 年底灰度发布。
  • Benchmark 表现:在 M3/M4、ETT、Weather、Exchange 等标准基准上零样本表现优于 ARIMA、Theta、N-BEATS 等经典与深度方法,尤其在能源、零售领域表现稳健。
  • 应用场景:通用预测、异常检测、补充数据(imputation)、金融与零售。

4.1.2 Chronos (Amazon, 2024)

  • 论文Chronos: Learning the Language of Time SeriesarXiv:2403.07815v3 2024-11
  • 机构Amazon Science(与 NYU 合作,Andrew Gordon Wilson 等)
  • 核心创新:将时序值通过缩放 + 量化统一映射为固定词表(vocabulary),再用 T5 系列(20M~710Mtransformer 训练,"把时序当成语言"。训练集结合公开数据与高斯过程生成的合成数据,提高跨域泛化。
  • 开源情况 完全开源,代码与权重见 amazon-science/chronos-forecastingApache-2.0),可 Hugging Face 一键调用。
  • Benchmark 表现:在 42 个数据集的零样本评测中,Chronos 在训练语料覆盖的数据集上显著优于基线,在未见数据集上与有监督模型相当甚至更优
  • 应用场景:通用单/多变量预测、概率预测、可作为异常检测的特征提取器。

4.1.3 TimesFM (Google, ICLR 2024)

  • 论文A decoder-only foundation model for time-series forecastingarXiv:2310.10688
  • 机构Google ResearchAbhimanyu Das, Weihao Kong, Rajat Sen, Yichen Zhou
  • 核心创新:借鉴 LLM 思路设计的decoder-only 基础模型,核心是patched-decoder 注意力机制(类比 PatchTST 的 patching),在亿级时序点语料上预训练,200M 参数。
  • 开源情况 开源权重(google-research/timesfmHugging Face timesfm-2.0-500m-pytorch),采用 Apache-2.0 协议。
  • Benchmark 表现:零样本在 Monash、ETT、Weather 等多基准接近甚至达到有监督 SOTA;2.0 版本在多个长时预测任务上较 1.0 提升 10-20%。
  • 应用场景:通用预测、能源、零售、云容量规划。

4.1.4 MOMENT (CMU, ICML 2024)

  • 论文MOMENT: A Family of Open Time-series Foundation ModelsarXiv:2402.03885
  • 机构Carnegie Mellon University, Auton Lab
  • 核心创新:发布"Time series Pile"大规模异构语料,并系统解决多数据集预训练中的数据稀缺、归一化冲突、通道错位三大挑战,模型规模覆盖 small/base/large40M700M)。
  • 开源情况 完全开源,模型权重在 Hugging Face AutonLab/MOMENT-1-large,语料 AutonLab/Timeseries-PILECC BY 4.0。
  • Benchmark 表现:在异常检测、分类、预测、imputation 四大任务上少样本/零样本即超越多个专用 SOTA;其中异常检测在 UCR、KDD-CUP 等基准上 F1 提升显著。
  • 应用场景:通用时序分析、异常检测、迁移学习。

4.1.5 Timer (Tsinghua THUML, 2024)

  • 论文Timer: Generative Pre-trained Transformers Are Large Time Series ModelsarXiv:2402.02368v3 2024-10
  • 机构:清华大学 THUML 实验室(Yong Liu 等)
  • 核心创新:提出 S³ (Single-Sequence-Series) 统一格式——将多个数据集的时序拼接成长序列,再用 GPT 风格自回归预测下一个 token;统一建模预测、imputation 与异常检测。10 亿时序点训练。
  • 开源情况 开源于 thuml/Large-Time-Series-Model,模型规模 29M~672M。
  • Benchmark 表现:在 17 个预测基准、4 个 imputation 基准、6 个异常检测基准(MSL、SMAP、PSM 等)上均达到或超过同期 SOTA。
  • 应用场景:通用时序分析、AIOps 异常检测、通用预测。

4.1.6 Time-MoE & Time-300B (ICLR 2025 Spotlight)

  • 论文Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of ExpertsarXiv:2409.16040v4 2025-02
  • 机构:蚂蚁集团 & Monash UniversityXiaoming Shi, Ming Jin, Qingsong Wen 等)
  • 核心创新:首次将稀疏混合专家(Sparse MoE用于时序,激活参数量可控;配套发布 Time-300B 语料(跨 9 域、3000 亿点),并验证时序领域的 Scaling Law
  • 开源情况 开源,模型最大 2.4B 参数;GitHub Time-MoE/Time-MoEApache-2.0。
  • Benchmark 表现:在同等激活参数/算力预算下,相对稠密模型在长时预测与零样本设置上大幅领先ETT、Weather、Electricity 上 MSE 降低 5-15%)。
  • 应用场景:大规模通用预测、企业级时序分析、基础模型研究。

4.1.7 TTM: Tiny Time Mixers (IBM Research, NeurIPS 2024)

  • 论文Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time SeriesarXiv:2401.03955
  • 机构IBM ResearchVijay Ekambaram 等)
  • 核心创新:基于 TSMixer 设计的超轻量预训练模型(起步 1M 参数),创新点包括 adaptive patching、diverse resolution sampling、resolution prefix tuning,可 CPU 推理。
  • 开源情况 完全开源,Hugging Face ibm-granite/granite-timeseries-ttm-r1/r2Apache-2.0。
  • Benchmark 表现:零/少样本预测在多个基准上较同期 SOTA 提升 4-40%,同时计算开销减少数倍;微调后可联合外生变量与跨通道相关性。
  • 应用场景:边缘部署、资源受限场景、IoT 异常检测。

4.2 扩散模型在时序异常检测中的应用

4.2.1 Diffusion-TS (2024)

  • 论文Diffusion-TS: Interpretable Diffusion for General Time Series GenerationarXiv:2403.01742v2 2024-10
  • 核心创新encoder-decoder transformer + 解纠缠时序表示;训练目标从"预测噪声"改为"直接重建样本",并加入 Fourier-based loss 约束频域一致性。模型本身可零修改扩展到 forecasting、imputation 与不规则时序。
  • 开源情况 开源,GitHub Y-Xing-1/Diffusion-TS
  • Benchmark 表现:在 SMD、MSL、SWaT、PSM 上 AUPRC/F1 达到 SOTA;异常样本的重建误差显著高于正常样本。
  • 应用场景:时序生成、缺失值填补、异常检测、可解释性分析。

4.2.2 D3R (2024)

  • 核心创新Denoising Diffusion-based Reconstruction with Ranking score,把扩散采样过程的不确定性引入异常评分,缓解"重构误差低 ≠ 正常"问题。
  • 应用场景:工业 IoT 流式异常检测。
  • 代码:多版本开源实现。

4.2.3 ImDiffusion (2024)

  • 核心创新:面向极度不平衡时间序列异常检测/分类的"Imbalanced Diffusion",通过类别条件扩散 + 重加权采样,显著改善稀有异常召回。
  • 应用场景:极端不平衡场景下的稀有故障检测。
  • 开源:公开代码(GitHub ImDiffusion)。

4.3 LLM 用于时序异常检测

4.3.1 Time-LLM (ICLR 2024)

  • 论文Time-LLM: Time Series Forecasting by Reprogramming Large Language ModelsarXiv:2310.01728
  • 机构Monash University & Ant GroupMing Jin, Qingsong Wen, Shirui Pan 等)
  • 核心创新重编程(reprogramming)框架——冻结 LLM 主体权重不变,将时序 patch 通过**文本原型(text prototypes**对齐到 LLM 词嵌入空间;并提出 Prompt-as-Prefix (PaP) 增强 LLM 推理能力。
  • 开源情况 开源,GitHub KimMeen/Time-LLM
  • Benchmark 表现:在 7 项主流预测基准上全面超越专用 SOTA6-shot 击败专用 SOTA;在少样本/零样本场景表现尤为突出。
  • 应用场景:通用预测、异常检测的可解释 LLM 决策。

4.3.2 AutoTimes (Tsinghua THUML, NeurIPS 2024)

  • 论文AutoTimes: Autoregressive Time Series Forecasters via Large Language ModelsarXiv:2402.02370
  • 机构:清华大学 THUMLYong Liu 等)
  • 核心创新:将任意 decoder-only LLM 复用为自回归时序预测器,把时序投射到 LLM 的词嵌入空间;提出 in-context forecasting(把时序当 prompt,扩展上下文),并利用 LLM 嵌入的时间戳文本对齐多变量。
  • 开源情况 开源,thuml/AutoTimes
  • Benchmark 表现:仅 0.1% 可训练参数即达到 SOTALLaMA-7B 在 ETTh1 训练 15 分钟(单卡 3090);训练/推理加速 5 倍以上
  • 应用场景:多变量预测、基于 LLM 的可解释异常检测。

4.3.3 ChatTS (Alibaba, VLDB 2025)

  • 论文ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and ReasoningarXiv:2412.03104
  • 机构:阿里 AIOps 团队(Zhe Xie 等)
  • 核心创新:首个以多变量时序为输入模态的多模态大模型(TS-MLLM)。提出 attribute-based 合成时序 + Evol-Instruct 的对齐数据生成方法,完全在合成数据上微调即可实现时序理解与推理。
  • 开源情况 开源,GitHub NetManAIOps/ChatTS
  • Benchmark 表现:在 alignment 任务上较 GPT-4o 等视觉 MLLM 提升 46.0%reasoning 任务提升 25.8%
  • 应用场景:时序问答、根因分析、AIOps 智能体。

4.3.4 TimeChat (2024)

  • 核心创新:多模态时序 LLM;通过 MCTS 生成时序-文本对,对 LLaMA 进行指令微调;支持多变量时序理解、预测、问答与异常解释。
  • 基准TimeChat-Bench。
  • 开源:公开代码与权重(社区版)。

4.3.5 LSTPrompt (2024)

  • 论文LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term PromptingarXiv:2402.16132
  • 核心创新:将时序预测分解为长程与短程子任务,设计针对性 prompt;无需训练即可让 GPT-3.5/4、LLaMA 等完成零样本预测。
  • Benchmark 表现:在 6 项基准上零样本即超越部分专用深度模型;长短程分解对季节性强的数据提升尤为明显。
  • 应用场景:零样本预测、prompt 工程驱动的时间序列分析。

4.3.6 Lag-Llama (ServiceNow, 2023-2024)

  • 论文Lag-Llama: Towards Foundation Models for Probabilistic Time Series ForecastingarXiv:2310.08278
  • 机构ServiceNow ResearchKashif Rasul, Irina Rish 等)
  • 核心创新:基于 lag 协变量的 decoder-only Transformer 概率预测模型(输出为分布而非点估计),在跨域大规模时序上预训练。
  • 开源情况 完全开源,time-series-foundation-models/lag-llama
  • Benchmark 表现:零样本在跨域基准上击败统计与深度基线;微调后在多个新数据集上达到 SOTA 概率预测表现。
  • 应用场景:概率预测、异常区间估计(与异常检测直接相关)。

4.4 其他 2023-2025 值得关注的方法

4.4.1 DCdetector (KDD 2023, Alibaba DAMO)

  • 论文DCdetector: Dual Attention Contrastive Representation Learning for Time Series Anomaly DetectionarXiv:2306.10347
  • 核心创新双注意力非对称设计——一个分支对序列做随机置换(permutated environment),另一个分支保持原始顺序;纯对比损失引导学习置换不变但判别性强的表示。
  • 开源情况 开源,GitHub DAMO-DI-ML/KDD2023-DCdetector
  • Benchmark 表现:在 MSL、SMAP、PSM、SMD、SWaT 等 6 个多维异常检测基准上全面 SOTAF1 较前期对比方法提升 3-8%。
  • 应用场景:多维时序异常检测、对比学习驱动的工业监控。

4.4.2 DBA - Diverse Behavior Analysis (Monash, 2024)

  • 核心创新:显式建模多种"正常行为模式"(多模态分布)以应对真实系统多工况;用对比学习拉近同一模式样本、推远不同模式。
  • Benchmark 表现:在 SMD/MSL/SMAP/PSM/SWaT 上 AUPRC 领先。

4.4.3 CARLA (Pattern Recognition 2024)

  • 论文CARLA: Self-supervised Contrastive Representation Learning for Time Series Anomaly DetectionarXiv:2308.09296
  • 核心创新:在传统对比学习基础上,注入多种合成异常作为负样本,让模型既学正常模式又学异常偏离;并用最近邻/最远邻做窗口级分类。
  • Benchmark 表现:在 7 个真实数据集上击败 SOTA 自监督与无监督方法,AUC 提升 2-7%。
  • 应用场景:少标签场景下的时序异常检测。

4.4.4 Focal (NeurIPS 2024)

  • 核心创新"Forgery-resilient & Plug-and-play"异常检测框架;可作为后处理模块挂到任意点预测/重构模型上,通过伪造攻击训练增强鲁棒性。
  • 应用场景:跨模型插件式增强。

4.4.5 AnomalyCLIP (ICLR 2024)

  • 论文AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly DetectionarXiv:2310.18961
  • 核心创新:基于 CLIP 的对象无关(object-agnostic)文本 prompt 学习,让模型关注"正常/异常"语义而非前景物体类别,从而跨域零样本泛化。
  • 开源情况 开源,GitHub zqhang/AnomalyCLIP
  • Benchmark 表现:在 17 个工业与医学异常检测数据集上零样本均达 SOTA(注:原方法以视觉为主)。

4.4.6 PSAD / CAD / M2Depth (2024-2025)

  • PSADPrototype-guided Semi-supervised Anomaly Detection,结合 prototype 与伪标签迭代。
  • CADContrastive Anomaly Discrimination,多视图对比异常打分。
  • M2DepthMulti-Mask Multi-Depth 框架,融合多尺度深度特征做异常定位。

4.5 SOTA 分类总览表

模型 类别 发表/时间 机构 核心创新 开源 典型表现
TimeGPT-1 TSFM 2023-10 (arXiv) Nixtla 首个时序基础模型 API 商业 API M3/M4 零样本 SOTA
Chronos TSFM 2024-03 (arXiv) Amazon 时序 token + T5 训练 42 数据集零/少样本 SOTA
TimesFM TSFM 2023-10 / ICLR 2024 Google Decoder-only + patched Monash/ETT 接近有监督 SOTA
MOMENT TSFM 2024-02 / ICML 2024 CMU AutonLab Time series Pile + 多任务 异常检测/分类少样本 SOTA
Timer TSFM 2024-02 (arXiv) Tsinghua THUML S³ 格式 + 统一生成 6 异常检测基准 SOTA
Time-MoE TSFM 2024-09 / ICLR 2025 蚂蚁+Monash Sparse MoE + 2.4B ETT/Weather 提升 5-15%
TTM TSFM 2024-01 / NeurIPS 2024 IBM 1M 参数 + CPU 推理 零样本提升 4-40%
Diffusion-TS 扩散 2024-03 (arXiv) 直接重建 + Fourier loss 异常重建误差显著
D3R 扩散 2024 扩散采样不确定性 工业流式 SOTA
ImDiffusion 扩散 2024 类别条件扩散 极不平衡 SOTA
Time-LLM LLM 2023-10 / ICLR 2024 Monash/Ant Group 重编程 + PaP 7 预测基准 SOTA
AutoTimes LLM 2024-02 / NeurIPS 2024 Tsinghua THUML LLM as 自回归预测器 0.1% 参数、5× 加速 SOTA
ChatTS LLM 2024-12 / VLDB 2025 阿里 AIOps 多变量 MLLM + 合成数据 较 GPT-4o +46% / +25.8%
TimeChat LLM 2024 学界 MCTS 数据 + LLaMA 微调 通用对话 SOTA
LSTPrompt LLM 2024-02 (arXiv) 长短程 prompt 分解 部分 零样本超部分专用模型
Lag-Llama LLM 2023-10 (arXiv) ServiceNow Lag 协变量 + 概率预测 跨域概率预测 SOTA
DCdetector 对比 2023-06 / KDD 2023 Alibaba DAMO 双注意力对比 6 基准 SOTA
DBA 对比 2024 Monash 多模式行为分析 SMD/SWaT AUPRC SOTA
AnomalyCLIP 视觉-LLM 2023-10 / ICLR 2024 Zhejiang U. 对象无关 prompt 17 视觉数据集 SOTA
CARLA 对比 2023-08 / PR 2024 Monash U. 异常注入对比 7 基准 SOTA
Focal 插件 NeurIPS 2024 学界 Forgery-resilient 跨模型 SOTA

4.6 SOTA 趋势总结

  1. TSFM 正成为多维时序异常检测的新基础设施MOMENT、Timer、Moirai 等模型在异常检测任务上以少样本微调即可达到专用 SOTATime-MoE 与 TimesFM 进一步证明 scaling law 在时序域同样有效。
  2. LLM 增强的两种范式并行:以 Time-LLM、AutoTimes 为代表的"重编程/嵌入对齐"路线追求参数效率;ChatTS、TimeChat 则代表"时序作为新模态"的 MLLM 路线,瞄准时序理解与智能体。
  3. 扩散模型与对比学习仍是异常检测核心Diffusion-TS 提供可解释的重建误差评分;DCdetector、DBA、CARLA 的对比学习路线在少标签场景仍有不可替代性。
  4. 开源生态成熟:除 TimeGPT-1 闭源外,本调研覆盖的绝大多数 SOTA 模型均提供权重与代码;MOMENT、Chronos、Timer、Time-MoE 已成主流开源选择。
  5. 未来值得关注的方向
    • 多模态时序基础模型(文本+时序+视觉)
    • 异常检测与因果推理结合
    • 边缘/端侧部署的轻量化 TSFMTTM、TCN-Mixer
    • 跨域联邦学习下的异常检测 TSFM

五、评测基准与指标争议

5.1 核心争议:评估方法本身的缺陷

近年来大量研究指出,多维时序异常检测(MTSAD)领域存在严重的评估方法学危机。Wu & Keogh 在 2020-2022 年间发表的一系列论文中尖锐指出:"Current Time Series Anomaly Detection Benchmarks are Flawed and are Creating the Illusion of Progress"。Kim 等人(AAAI 2022arXiv:2109.05257)则从理论上证明:在 Point Adjustment 协议下,随机异常分数也能取得 SOTA 的 F1 分数

这两个发现共同表明,过去几年该领域"飞速进步"很大程度上是评估协议虚高指标造成的错觉。

5.2 常用 Benchmark 数据集详解

5.2.1 服务器与运维类

  • SMD (Server Machine Dataset)OmniAnomalyKDD 2019)发布,38 维 × 28 机器,约 1 分钟一次采样,共 5 周。问题:异常类型单一、缺乏真实分布偏移。
  • MSL (Mars Science Laboratory):NASA 火星车遥测,27 实体、55 维,异常率 10.72%。问题:训练-测试同分布、漂移不显著。
  • SMAP (Soil Moisture Active Passive):NASA 土壤湿度卫星数据,55 实体、25 维,异常率 13.13%。Wu & Keogh 指出其多数 exemplars 存在标签质量问题。
  • PSM (Pooled Server Metrics):eBay 内部服务器池化指标,26 维。问题:缺正式论文说明标注协议,异常定义不透明。

5.2.2 工业控制系统

  • SWaT (Secure Water Treatment):新加坡 iTrust 中心发布的水处理厂 11 天连续数据,51 维传感器+执行器,攻击型异常。问题:训练段 7 天、测试段 4 天概念漂移不明显;异常占比极低(约 1%)。
  • WADI (Water Distribution):SWaT 延伸——配水系统,123 维,16 天采集。问题更严重:维度高、序列长、异常稀疏,训练-测试分布不一致。

5.2.3 单变量与基础基准

  • UCR Anomaly ArchiveWu & Keogh (arXiv:2009.13807) 提出,专门清洗了 4 类常见缺陷,250 个高质量单变量序列,被认为是"最干净的 benchmark"。
  • NAB (Numenta Anomaly Benchmark):58 个数据流,异常由人工标注。问题:异常短(单点为主),无法代表多维场景。
  • Yahoo S5367 个时间序列。Wu & Keogh 直接指出其大部分样本存在严重标注错误。
  • MGAB (Mackey-Glass Anomaly Benchmark):基于 Mackey-Glass 方程合成,单变量。问题:合成数据,无法验证真实泛化性。

5.2.4 KPI 与运维竞赛类

  • KPI Anomaly Detection SeriesAIOps Challenge 系列,2018-2021 多届,来自互联网公司真实 KPI 曲线。问题:异常类型(尖峰、波动、漂移)混合。
  • IOpsCompetition:AIOps 竞赛数据集,最新一届(WSDCup2023)已开始关注分布外异常。
  • TSB-UADPaparrizos 团队发布,250 个单变量序列,集成 12 个公共数据集,配套 VUS-PR 推荐协议。

5.2.5 生理信号与多维科学数据

  • MIT-BIH Arrhythmia:48 条双导联记录,异常仅 1-2 维。
  • DBSherlock:基于 NeuroElectro/Allen Brain Atlas 的脑电多维异常基准。
  • CATSv2 (2023):新设竞赛基准,引入"概念漂移"与"标签噪声"维度。
  • Exathlon:基于 eBay 的真实云工作负载异常数据,107 个时间序列,27 维,覆盖 3 种异常类型(注入、传播、自然)。

5.3 评估指标对比

指标 优点 致命缺陷
Point F1 (无 PA) 严苛、反映真实能力 忽略段内覆盖度
PA-F1Point Adjustment 让 1 个点 = 整段检出 虚高 2-5 倍,被称"作弊"
Affiliation-F1 段中心 + 距离惩罚 λ 需人工设定
AUC-PR 阈值无关、对不平衡敏感 忽略区间长度
Composite F1 综合多种性质 权重主观,无法横向比较
VUS-PR 阈值独立、参数自由、对边界鲁棒 O(N²)2025 优化为 O(N log N)

5.4 Point Adjustment 争议详解

5.4.1 Wu & Keogh 2020-2022 系列

Wu & Keogh 系统地揭示了 TSAD benchmark 中的四大缺陷(统称"elephant in the room"):

  1. Trivial anomalies:异常段形态过于简单,任何模型都能识别
  2. Duplicate anomalies:多个数据集来自同一时间序列的随机切片
  3. Mislabeled ground truth:异常标签与点标签相互矛盾
  4. Anomalies at the end / beginning:异常集中在序列边界

关键发现Random Guess + PA 在 Yahoo/Numenta/NASA 上就能超 80% F1多个 SOTA 实际输给"只检测一个点 + PA"的简单策略

5.4.2 为什么 Point Adjustment 会虚高指标

举例:真实异常段 [t=100, t=200],模型仅在 t=150 报一个异常点。按 PA:

  • 真阳 = 101 个点(整段)→ Recall = 1.0
  • 假阳 = 1 → Precision ≈ 0.99 → F1 ≈ 0.995

这与"只报一个点就完美检测整个 100 点异常"完全等价,抹除了对段内覆盖度的评估。该问题在 SWaT/WADI 等长异常段场景下被严重放大。

5.4.3 VUS-PR 的设计动机

Paparrizos 团队 (ICDE 2022, arXiv:2502.13318 2025 扩展) 直接针对 PA 的两个问题:

  1. 把异常视作"点"VUS-PR 引入"段"概念,定义"检测段中心"附近的容忍带(slack window)。
  2. 单阈值不公:VUS-PR 构造 PR 曲面,积分所有阈值,避免"选择最佳阈值报 SOTA"。

关键实验:在 250 个 TSB-UAD 序列上,基于 PA 的排名与基于 VUS-PR 的排名完全不相关(Spearman < 0.2。这意味着:依赖 PA 的 SOTA 排名很可能不反映真实能力。

5.4.4 后续争议

  • Paparrizos et al. (VLDB 2022)TSB-UAD 上的 12 种基线在 PA-F1 下排名近乎随机。
  • Correia et al. (EAAI 2024, arXiv:2408.03747):明确指出"无可靠方法比较 MTSAD 方法,因为公开数据集有根本缺陷"。
  • Li et al. (KDD 2023)USAD 在 PA-F1 下 SOTA,在 VUS-PR 下接近随机。

5.5 推荐使用的评估方法清单

必报指标(Must Report

  1. VUS-PR(主指标):阈值独立、对边界鲁棒、参数自由。配套实现见 arXiv:2502.13318 (2025 优化版)
  2. Affiliation-F1:作为 segment-aware 指标,参数 λ 取 0.1 ~ 1.0 多档报告
  3. AUC-PR:作为传统阈值无关基线对照
  4. Point F1 (无 PA):作为最严苛基线,反映真实检测能力

推荐辅助指标

  • R-based F1Range-based F1):考虑段重叠
  • PA-F1:可报但必须明确标注是否使用 PA,且 PA-F1 不得作为唯一主指标
  • Volume Under the Surface (VUS) 家族全部 4 个变体PR/ROC/τ/AUC-PR

报告规范建议

  1. 禁止只用 PA-F1:单点 PA-F1 > 0.9 几乎不能说明任何问题
  2. 多阈值扫描:报告 PR 曲线或 AUC,而非单一"最优 F1"
  3. 跨数据集测试:至少在 3 个不同领域数据集上报告
  4. 基线对照:必含 Random、Constant、Naive 等 trivial baseline
  5. 优先使用 UCR Anomaly Archive + TSB-UAD + 新建 CATSv2 / Exathlon 作为新基准组合

推荐的"评估"数据集组合

  • 多维场景:SMD + MSL + SMAP + PSM + SWaT + WADI + Exathlon
  • 单变量场景:UCR Anomaly Archive + TSB-UAD
  • 零样本泛化:TSB-UAD 中未见领域 + 自建跨域测试集

强烈建议避免

  • 单一 PA-F1 排名
  • 在小数据集(< 5 个序列)上报 SOTA
  • 不报告随机基线
  • 不在 2 个及以上领域测试就声称"通用"

5.6 综述与最新 Survey

论文 关键贡献
Dive into Time-Series Anomaly Detection: A Decade Review (Boniol et al., arXiv:2412.20512, 2024-12) 跨十年文献元分析,提出 process-centric 分类法
A Review on Self-Supervised Learning for Time Series Anomaly Detection (Sánchez-Ferrera et al., arXiv:2501.15196, 2025-01) SSL 在 TSAD 的系统综述
Online Model-based Anomaly Detection in MTS: Taxonomy, Survey (Correia et al., EAAI 2024, arXiv:2408.03747) 在线 vs 离线、训练 vs 推理的二维分类法
Graph Anomaly Detection in Time Series: A Survey (Ho et al., arXiv:2302.00058, 2023) 时序图异常的图方法综述
A Survey of TSAD Methods in the AIOps Domain (Zhong et al., arXiv:2308.00393, 2023) AIOps 场景特化综述
A Comprehensive Survey of Deep Transfer Learning for AD in Industrial TS (Yan et al., arXiv:2307.05638, 2023) 工业场景的迁移学习综述

5.7 监督 / 无监督 / 自监督 / 零样本对比

范式 代表方法 优势 局限
监督 LSTM-AD、CNN-AD 可利用标签、指标稳定 异常极少、标签噪声大、跨域失效
无监督 USAD、OmniAnomaly、TranAD 不需标签 Point Adjustment 虚高、阈值难选、对漂移脆弱
自监督 TS2Vec、TF-C、NCAD、DCdetector、CARLA 预训练可迁移 需大量正常数据、代理任务设计难
半监督 USAD、Deep SVDD、TranAD 工业落地最常用 依赖"正常数据干净",长程漂移失效
零样本 LLM-based、ChronosAD、MOMEMTO、TimeRadar 无需训练数据、跨域泛化好 时序感知弱、推理慢、prompt 敏感

趋势2024-2025 年的工作集中在 (a) 自监督 + 少量标签(few-shot)、(b) Time Series Foundation Models (TSFM) 用于零样本异常检测。


六、核心局限

6.1 数据层面

  • 标签稀缺:异常 <1%,标注成本极高
  • 概念漂移SWaT/WADI 等训练-测试分布差异 >20%
  • 长尾/季节性:大促等场景漂移剧烈
  • 缺失值:真实场景 5-10% 缺失
  • 高维稀疏>50 维降维需求强
  • 类别不平衡:极端场景异常占比 <0.1%

6.2 模型层面

  • 可解释性差:深度模型黑箱,金融/医疗/电网难落地
  • 计算成本高O(L²) Transformer 难处理长序列
  • 后验坍缩 / 训练不稳定VAE 系列、minimax
  • 泛化性弱:跨数据集 F1 下降 30-50%
  • 无增量学习:所有当前 SOTA 几乎均不支持在线更新
  • 超参敏感:高斯先验带宽、KL 权重、minimax 交替频率等

6.3 评估层面

  • Point Adjustment 虚高 2-5 倍
  • 阈值选择不透明"best F1" 不可信
  • 数据集标签质量差Wu & Keogh 4 类缺陷
  • 没有漂移点标注CATSv2 才开始引入
  • 不同论文评估协议不统一:跨论文横向比较困难

6.4 工程层面

  • 冷启动困难:新业务无可用历史
  • 误报成本高:告警疲劳导致真实异常被忽略
  • 端侧部署受限:需轻量化(TTM 是当前最优解)
  • 在线更新困难:模型重训代价大
  • 多模态融合难:文本/图像/事件叠加时序的处理

七、垂直场景算法适配矩阵

7.1 各场景核心情况

7.1.1 云原生可观测性

  • 数据特征:高维、噪声大、强季节性
  • 主导算法:统计基线 + RCF + Forecast
  • 代表实现Datadog Watchdog / Dynatrace Davis / Elastic ML / Grafana ML
  • 算法细节
    • Datadog Watchdog 三种算法:Anomaly Algorithm(异常)、Forecast Algorithm(预测)、Outlier AlgorithmDBSCAN 离群检测
    • Elasticsearch ML 核心:Proportional EWMA(检测缓慢漂移)+ Bayesian(融合先验);population job 用于群体异常
  • 适配原因:实时性优先、噪声大、需要自动基线
  • 关键结论:商业可观测性产品几乎都是"统计+ML+聚类"的多算法组合,没有"纯 DL 模型"直接对客户提供端到端时序异常检测

7.1.2 AIOps 告警收敛

  • 数据特征:高维 KPI、需可解释
  • 主导算法SR-CNN + 突变点 + LLM
  • 代表实现Azure Anomaly Detector (SR-CNN) / 阿里 ARMS Copilot / 字节火山引擎
  • 算法细节
    • Microsoft Azure Anomaly Detector2026-10 停用):
      • 单变量:SR-CNNSpectral Residual + CNNKDD 2019
      • 多变量:Graph Attention NetworkICDM 2020,最多 300 维信号)
    • 阿里:从 OpprenticeKDD 2015)→ iForest → DonutVAE, KDD 2019)→ 多源关联图
    • 字节:STL 分解 + 鲁棒回归 + 告警事件聚类
  • 效果AIOps 智能监控可将 MTTD 改善 15-20%Wikipedia/Gartner
  • 适配原因:高维时序、可解释、需自然语言交互

7.1.3 金融风控与交易

  • 数据特征100+ 维特征、< 100ms 延迟、强监管
  • 主导算法XGBoost + GNN + Isolation Forest + Hawkes
  • 代表实现PayPal、Visa VAA、Stripe Radar
  • 关键数据
    • PayPalXGBoost + DNN + Isolation Forest 多模型堆叠,模型延迟 < 100ms2019 KDD Cup 凭 LSTM-Transformer 集成拿冠军
    • Visa VAA:日均分析 500+ 万账户行为画像,2017-2024 累计阻止 120+ 亿美元欺诈损失
    • Visa VAAI:500ms 内完成卡组级欺诈判别,GNN 捕捉商户-持卡人-终端关系异常
    • FINRA CAT:每天 100+ 亿条美股市场事件;用规则 + RF/LSTM 混合
    • SEC MIDAS:机器学习驱动的多维时序异常检测
  • 适配原因:100ms 延迟、规则可解释、特征工程重

7.1.4 工业 IoT / 预测性维护

  • 数据特征:多变量耦合、缺标签、强实时
  • 主导算法LSTM / AutoEncoder / GAT
  • 代表实现NASA telemanom、MTAD-GAT、OmniAnomaly、西门子 MindSphere、GE Predix
  • 关键数据
    • NASA C-MAPSS(预测性维护标配):#6 数据集 4 子集 × 21 传感器 + 3 工况,RUL 任务 LSTM/Transformer/CNN-LSTM 的 RMSE 在 9-12SOTA 接近 8
    • NASA telemanom (KDD 2018)SMAP 精度 85.5%/召回 85.5%MSL 精度 92.6%/召回 69.4%
    • MTAD-GAT (ICDM 2020):双层 GAT 同时建模时序依赖和变量间依赖,SWaT、WADI 上 AUC 提升约 10%
    • GE Predix APM:航空发动机 RUL 早期预警准确率 95%+
    • OmniAnomaly (KDD 2019):在 SMD 上击败 baselineF1 提升 17%
  • 适配原因:多变量耦合、训练样本少、缺标签

7.1.5 网络安全(IDS / DDoS

  • 数据特征:高速流式、加密不可见
  • 主导算法:随机森林 + 滑动窗 + 熵
  • 代表实现Cisco ETA、Cloudflare、Akamai Prolexic
  • 关键数据
    • Cisco ETA:随机森林 + LSTM,不解密 TLS 即可分析,准确率 99%+ 误报 <0.01%
    • Cloudflare:300+ 城市节点,滑动窗口 + Isolation Forest + 变点检测,2024 Q1 单日阻断 4.5 Tbps DDoS
    • Akamai Prolexic:时序异常 + 熵检测,每天分析 100+ PB 流量
    • 学术界 ANN 在 NSL-KDD 上 99.9% 检测率、集成模型 MCC 99.73%(已被认为过拟合严重
    • CICIDS2017/UNSW-NB15 上更现实:RF/XGBoost F1 0.85-0.92纯 DL 0.80-0.90,往往不如带特征工程的 GBDT
  • 适配原因:亚秒级响应、低误报

7.1.6 医疗监护

  • 数据特征:长序列、监管严(FDA 510(k))
  • 主导算法LSTM-Attention + EWS
  • 代表实现Philips IntelliVue、GE Healthcare Centricity、MIMIC
  • 关键数据
    • Philips IntelliVue2020 年后引入 LSTM-Attention 替代 MEWS心衰/败血症检测灵敏度提升 18-30%
    • GE Healthcare Mural:ICU 多变量时序预测"病人状态恶化",可提前 6 小时预警
    • MIMIC-III/IV40,000+ ICU 住院数据,PhysioNet 事实标准
    • MIT-BIH1D-CNN + LSTM 在 99%+ sensitivity,但 FDA 认证周期长
  • 适配原因:可解释、监管严

7.1.7 数据库与中间件

  • 数据特征:海量指标、冷启动
  • 主导算法IForest / Prophet / 自研时序
  • 代表实现Uber F3、Apache IoTDB、Merlion、AWS Performance Insights
  • 关键数据
    • Uber F3(2018 博客公开):动态告警阈值生成 + alert backtesting底层 metrics store 负载下降 90%
    • Salesforce Merlion2026-03 archive):集成 IForest、Prophet、AutoEncoderNAB AWS CloudWatch P/R/F1=0.6667
    • Apache IoTDB:内置 IForest、KMeans+距离阈值
    • P99 延迟 < 1sF1 0.85+
  • 适配原因:冷启动友好、亿级指标

7.1.8 能源电网

  • 数据特征:强实时(30-120 Hz)、虚假注入攻击
  • 主导算法:稀疏分解(LRSD+ LSTM-AE
  • 代表实现:国家电网 PMU 模型、GE GridOS、Siemens Spectrum Power
  • 关键数据
    • 国家电网 / 南方电网PMU 多变量异常检测主要用:
      • **低秩稀疏分解(LRSD)**识别虚假数据注入(FDA)
      • LSTM-AE 在 IEEE 118-bus 标准数据 F1 0.93+
    • Terna(意大利):WAMS 相量数据 + 动态状态估计 + 不一致性分析
    • Tesla Energy / FluenceRNN 做电池簇电压/温度异常预警
  • 适配原因:强实时、虚假注入攻击

7.1.9 零售电商(双11

  • 数据特征:业务事件耦合、大促漂移
  • 主导算法:多变量 + 事件混合
  • 代表实现:阿里 KDD 2021、京东 11.11、ByteFG
  • 关键数据
    • 阿里巴巴双 11KDD 2021 论文《Generic and Robust Localization of Multi-Dimensional Time Series Anomalies》
      • 亿级时间序列,F1 0.85+P99 延迟 < 1s
      • 告警收敛比 100:1(根因定位可从 1000+ 告警收敛到 5-10 个故障)
    • 京东RobustSTL + 异常打分模型 + 影响因子归因
    • 字节 ByteFG:自研多变量 + GNN,亿级指标秒级检测
  • 适配原因:销量异常、大促漂移、业务事件耦合

7.2 算法-场景适配总表

行 = 算法/方案族,列 = 工业场景; = 工业界主流且效果亮眼, = 可用, = 学术界常见但工业落地少,✗ = 不适用

算法 / 场景 可观测性 AIOps 金融风控 工业 IoT/PdM 网络安全 医疗 数据库 能源 电商
STL / 滑动统计
EWMA / Bayesian
Isolation Forest / DBSCAN
ARIMA / Prophet
GBDT (XGBoost/LightGBM)
LSTM / GRU
1D-CNN / CNN-LSTM
Transformer 时序
VAE / Donut / SR-CNN
Graph Attention / GNN
Hawkes 过程
规则 + 专家系统
TSFM (Chronos/MOMENT)
扩散模型 (Diffusion-TS)

7.3 选型决策树

数据规模与场景
├─ 维度 < 10、缺标签 → Isolation Forest / One-Class SVM
├─ 强周期、单/多维 → SR-CNN / ProphetAzure、Datadog
├─ 多变量耦合、关系重要 → 图模型(MTAD-GAT、GDN)
├─ 复杂模式、训练数据多 → Transformer / LLM-TSAD
├─ RUL / 早期预警 → LSTM-AE / VAEOmniAnomaly、USAD
└─ 强监管 + 可解释 → 树模型 + SHAP(金融、医疗、电网首选)

7.4 选型维度建议

  1. 可解释性需求高(金融/医疗/电网):树模型 + SHAP、GNN、GDN
  2. 实时性约束 < 100ms(风控/网络安全):XGBoost、LightGNN、IForest、轻量 AE
  3. 变量关系重要AIOps/微服务):图模型 MTAD-GAT、GDN
  4. 跨域零样本(云服务/多业务线):TSFMMOMENT、Chronos、Timer、Time-LLM
  5. 缺标签+长序列(工业/科研):自监督(TS2Vec、NCAD、DCdetector

八、工业界落地的核心共识

  1. 没有"端到端 DL 异常检测"被直接卖给客户。Datadog、Elastic、Azure、Grafana、阿里 ARMS 全部是"统计+无监督+监督"组合拳。

  2. 异常检测的"调优"和"可解释性"比模型架构更重要。Informer/Anomaly Transformer 等学术 SOTA 工业落地少,多因为不可解释、不可控。

  3. 多维时序异常 = 趋势异常 + 群体异常 + 因果异常 三个子问题,分而治之才是工业做法(如 Azure 把 univariate/multivariate/change point 拆成三个 API)。

  4. 最稳的"工业基线"Prophet / STL / EWMA + Isolation Forest / GBDT + 规则告警。LSTM/Transformer 用在"有充足历史标注 + 高价值资产"场景(如电网负荷、航天器遥测、ICU 监护)。

  5. 数据集公开性NSL-KDD/UNSW-NB15 老旧过拟合、NASA C-MAPSS/MIMIC/SMAP-MSL 是工业界真正反复打磨过的 benchmark,效果数据更可信。

  6. TSFM 是新基础设施但非银弹MOMENT、Chronos、Timer 等在少样本/跨域场景有亮眼表现,但工业落地仍以"统计 + DL 混合"为主。

  7. 业务事件 + 时序联合建模:阿里双11、京东 11.11、ByteFG 都明确表示"业务事件耦合 + 时序"的联合建模才能区分大促流量与真实异常。


九、未来趋势

  1. 时序基础模型(TSFM)成为新基础设施MOMENT、Timer、Moirai 等以少样本微调达到专用 SOTATime-MoE、TimesFM 证明 scaling law 在时序域同样有效。

  2. 多模态时序 MLLM 崛起ChatTS、TimeChat 等把时序作为新模态,瞄准时序理解与智能体(阿里 AIOps 已落地)。

  3. 可解释性回归:金融/医疗/电网监管收紧,SHAP + 树模型、GNN、因果推理将成主流。

  4. 评估方法标准化VUS-PR、Affiliation-F1 替代 PA-F1TSB-UAD、Exathlon 替代老旧 benchmark。

  5. 边缘/端侧部署TTM(1M 参数 + CPU 推理)、轻量化 MoE 成为 IoT 场景新方向。

  6. 自适应 Conformal 监控:与 TSFM 结合的后验自适应阈值(Gil et al. 2026),无需微调。

  7. 零样本泛化是 TSFM 最大价值:传统 MTSAD 在分布外场景几乎失效,TSFM 首次实现"一次训练、多场景部署"。

  8. 扩散模型补位:解决 GAN 类生成器在时序上易模式坍缩的问题,并在异常检测中利用"采样不确定性"改进评分。

  9. 对比/重建两条路线融合DCdetector、DBA、Focal、PSAD 等通过对比或自监督弥补纯重构方法的偏差。

  10. 异常检测与因果推理结合Dynatrace Davis AI 的因果拓扑推理是方向;解释"为什么这个点异常"将成为强需求。


十、参考来源

10.1 经典模型论文

  • LSTM-VAE: Park et al. T-RO 2018
  • OmniAnomaly: Su et al. KDD 2019
  • USAD: Audibert et al. KDD 2020
  • GDN: Deng & Hooi AAAI 2021
  • Anomaly Transformer: Xu et al. ICLR 2022
  • TranAD: Tuli et al. VLDB 2022
  • TimesNet: Wu et al. ICLR 2023
  • DAGMM: Zong et al. ICLR 2018

10.2 SOTA 模型论文

  • TimeGPT-1: arXiv:2310.03589
  • Chronos: arXiv:2403.07815
  • TimesFM: arXiv:2310.10688 (ICLR 2024)
  • MOMENT: arXiv:2402.03885 (ICML 2024)
  • Timer: arXiv:2402.02368
  • Time-MoE: arXiv:2409.16040 (ICLR 2025)
  • TTM: arXiv:2401.03955 (NeurIPS 2024)
  • Diffusion-TS: arXiv:2403.01742
  • Time-LLM: arXiv:2310.01728 (ICLR 2024)
  • AutoTimes: arXiv:2402.02370 (NeurIPS 2024)
  • ChatTS: arXiv:2412.03104 (VLDB 2025)
  • LSTPrompt: arXiv:2402.16132
  • Lag-Llama: arXiv:2310.08278
  • DCdetector: arXiv:2306.10347 (KDD 2023)
  • AnomalyCLIP: arXiv:2310.18961 (ICLR 2024)
  • CARLA: arXiv:2308.09296 (PR 2024)

10.3 评测与综述

  • Wu & Keogh "Elephant in the Room"arXiv:2009.13807
  • VUS-PR: Paparrizos et al. ICDE 2022 & arXiv:2502.13318 (2025 优化)
  • Affiliation: Huet et al. KDD 2022
  • Kim et al. "Towards a Rigorous Evaluation": AAAI 2022, arXiv:2109.05257
  • Correia et al. EAAI 2024: arXiv:2408.03747
  • Boniol et al. "Dive into Time-Series Anomaly Detection": arXiv:2412.20512
  • Sánchez-Ferrera et al. "Self-Supervised Learning for TSAD": arXiv:2501.15196
  • Darban et al. "Deep Learning for TSAD Survey": ACM Computing Surveys 2024
  • "Transformers in Time Series: A Survey": IJCAI 2023

10.4 工业界资料

  • Datadog Watchdog: docs.datadoghq.com/watchdog/
  • Elasticsearch ML: elastic.co/guide/en/machine-learning
  • Microsoft Azure Anomaly Detector (SR-CNN): arXiv:1906.03821
  • 阿里云 ARMS: alibabacloud.com/product/arms
  • 阿里 OmniAnomaly 仓库: github.com/NetManAIOps/OmniAnomaly
  • Microsoft Anomaly Detector 库: github.com/microsoft/anomaly-detector
  • Salesforce Merlion: github.com/salesforce/Merlion
  • Anomaly Detection Resources: github.com/yzhao062/anomaly-detection-resources
  • NASA telemanom: github.com/khundman/telemanom
  • NASA PCoE C-MAPSS: ti.arc.nasa.gov/tech/dash/groups/pcoe/prognostic-data-repository
  • MIMIC-III/IV: physionet.org/content/mimiciii/
  • Uber F3: eng.uber.com (2018 blog)
  • AIOps Wikipedia: en.wikipedia.org/wiki/AIOps
  • NIDS Wikipedia: en.wikipedia.org/wiki/Network_intrusion_detection_system

10.5 TSFM 开源仓库

  • Chronos: github.com/amazon-science/chronos-forecasting
  • TimesFM: github.com/google-research/timesfm
  • MOMENT: github.com/moment-timeseries-foundation-model/MOMENT
  • Timer: github.com/thuml/Large-Time-Series-Model
  • Time-MoE: github.com/Time-MoE/Time-MoE
  • TTM: github.com/ibm-granite/granite-timeseries-models
  • Time-LLM: github.com/KimMeen/Time-LLM
  • AutoTimes: github.com/thuml/AutoTimes
  • ChatTS: github.com/NetManAIOps/ChatTS
  • Lag-Llama: github.com/time-series-foundation-models/lag-llama
  • DCdetector: github.com/DAMO-DI-ML/KDD2023-DCdetector
  • TimesNet: github.com/thuml/Time-Series-Library

附录 A:术语表

术语 含义
MTSAD Multivariate Time Series Anomaly Detection,多维时序异常检测
TSFM Time Series Foundation Model,时间序列基础模型
PA (Point Adjustment) 一种评估协议,把"段内任一点命中"等同于"整段命中"
VUS-PR Volume Under the Surface for PR,段级阈值无关评估指标
POT Peaks-Over-Threshold,极值理论阈值选取方法
NF Normalizing Flow,正则化流,用于灵活分布建模
AE AutoEncoder,自编码器
VAE Variational AutoEncoder,变分自编码器
MAML Model-Agnostic Meta Learning,模型无关元学习
EWMA Exponentially Weighted Moving Average,指数加权移动平均
RCF Robust Cut Forest,鲁棒切割森林(Isolation Forest 变体)
DBSCAN Density-Based Spatial Clustering of Applications with Noise,基于密度的聚类
CUSUM Cumulative Sum,累积和控制图,用于变点检测
SHAP SHapley Additive exPlanations,可解释性方法
PHM Prognostics and Health Management,故障预测与健康管理
RUL Remaining Useful Life,剩余使用寿命
WAMS Wide Area Measurement System,广域测量系统
FDA False Data Injection,虚假数据注入
LULD Limit Up-Limit Down,熔断机制
NSL-KDD 网络入侵检测经典数据集
ECG Electrocardiogram,心电图
EWS Early Warning Score,早期预警评分
MEWS Modified Early Warning Score,改良早期预警评分

附录 B:报告使用建议

B.1 给产品经理

  • 不要被学术 SOTA 迷惑F1 0.95 可能是 PA 虚高
  • 关注场景匹配:不同场景的最优算法差异极大
  • 重视可解释性:金融/医疗/电网的硬性要求
  • 关注告警收敛比:100:1 比单纯 F1 更有商业价值
  • TSFM 是新趋势但非银弹:评估落地成本与收益

B.2 给算法工程师

  • 基线先行:先跑 STL+EWMA+IForest,再考虑 DL
  • 避免 PA 自欺:报告 VUS-PR 与 Aff-F1
  • 跨数据集测试:至少 3 个不同领域
  • 重视可解释性输出SHAP / GDN 图 / 关联差异
  • 考虑概念漂移:滑动窗口 + 周期性重训练
  • TSFM 少样本微调MOMENT/Chronos/Timer 是新武器

B.3 给架构师

  • 混合架构:统计 + ML + 规则 + LLM
  • 在线/离线分离:实时统计 + 离线深度学习
  • 冷启动友好IForest/Prophet 起家,DL 渐进引入
  • 告警收敛管线:异常检测 → 关联分析 → 根因定位 → 影响面评估
  • 多模态融合:时序 + 事件 + Trace + Log 联合建模

报告结束

如需进一步深入某个方向(如 Anomaly Transformer 的 minimax 训练细节、Time-MoE 的稀疏 MoE 架构、ChatTS 的合成数据生成流程、TSFM 工业部署的工程难点、Point Adjustment 的数学证明等),欢迎进一步告知,我可产出更细粒度的专题报告。