60 KiB
多维时序异常检测(MTSAD)技术深度调研报告
调研日期:2026-06-29 调研范围:多维时序异常检测的技术路线、经典模型、SOTA 模型、评测方法、当前局限与垂直场景应用 适用读者:AIOps / 时序分析 / 异常检测产品方向的技术决策者、算法工程师、产品经理
一、执行摘要
多维时序异常检测(Multivariate Time Series Anomaly Detection, MTSAD)经过 2018-2026 年的演进,已形成 "统计学经典 + 深度学习 + 时序基础模型(TSFM)+ LLM 增强" 的多元技术格局。
当前 SOTA 主要由三类方法主导:
- 对比学习(DCdetector、DBA、CARLA)
- Transformer 关联差异(Anomaly Transformer、TimesNet)
- 时序基础模型(Chronos、MOMENT、Timer、Time-MoE、TTM)
工业落地呈现明显分化:
- 云可观测性偏好 统计基线 + RCF + EWMA(Datadog Watchdog、Elasticsearch ML)
- 金融风控偏好 XGBoost + GNN + Isolation Forest 集成(PayPal、Visa VAA)
- 工业预测性维护偏好 LSTM-AE / GAT(NASA telemanom、MTAD-GAT)
- 可观测性、金融、医疗等强监管场景对 可解释性要求最高
最重要的认知:
- Point Adjustment(PA)虚高 2-5 倍是当前评估体系的最大陷阱
- 工业界几乎 没有"端到端 DL 异常检测"被直接卖给客户,全部是"统计+无监督+监督+规则"组合拳
- 跨数据集 F1 下降 30-50%,泛化性问题严重
二、技术路线全景图
| 大类 | 子类 | 代表方法 | 核心思想 |
|---|---|---|---|
| 统计/经典 | 分布型 | HBOS、ECOD、Gaussian | 假设分布、计算偏离 |
| 距离/密度 | KNN、LOF、Isolation Forest | 局部密度/隔离性 | |
| 谱分析 | SR-CNN(Spectral Residual) | 视觉显著性迁移 | |
| 状态空间 | SSM、Kalman、Prophet | 显式建模状态转移 | |
| 经典 ML | 树模型 | XGBoost、LightGBM + 特征工程 | 监督/半监督二分类 |
| 深度学习 | RNN/GRU | LSTM-VAE、OmniAnomaly | 时序 + 概率重构 |
| 对抗式 AE | USAD、TranAD | 双解码器博弈 | |
| CNN/TCN | TimesNet、TCN-AD | 多尺度卷积 | |
| Transformer | Anomaly Transformer、TranAD | 注意力 + 关联差异 | |
| 图网络 | GDN、MTAD-GAT | 变量关系建模 | |
| 对比学习 | DCdetector、CARLA、DBA | 置换不变表示 | |
| 扩散模型 | Diffusion-TS、D3R、ImDiffusion | 重建误差 + 不确定性 | |
| TSFM(基础模型) | 通用预训练 | Chronos、TimesFM、MOMENT、Timer、Time-MoE、TTM | 大规模预训练 + 零样本 |
| LLM 增强 | 重编程 | Time-LLM、AutoTimes | LLM 嵌入对齐时序 |
| 多模态 | ChatTS、TimeChat | 时序作为新模态 | |
| 零样本 Prompt | LSTPrompt、Lag-Llama | 提示工程驱动 |
三、经典模型精解(2018-2022)
3.1 LSTM-VAE (Park et al. 2018)
- 核心原理:将 LSTM 时序建模与 VAE 概率重构结合,把传感器序列映射为高斯潜变量空间,用重构概率(reconstruction probability)而非点对点重构误差作为异常分数,从而兼顾时间依赖与不确定性。
- 架构:输入窗口 x₁:T → LSTM 编码器 → 隐变量 z (μ, σ²) → LSTM 解码器 → 重建 x̂₁:T;损失为重构负对数似然 + KL 散度的变分下界(ELBO)。
- 优势:概率重构提供可解释的置信度;LSTM 显式建模时序依赖;训练稳定,工程易落地。
- 劣势:潜变量先验固定为高斯,难以刻画多模态分布;窗口长度/KL 权重需调;仅依赖重构,漏报率高。
- 代表论文:Park D, Hoshi Y, Kemp C C. "A Multimodal Anomaly Detector for Robot-Assisted Feeding Using an LSTM-based Variational Autoencoder." IEEE Transactions on Robotics, 2018.
- 典型表现:机器人辅助喂食多模态数据 P/R ≈ 0.85+。
3.2 OmniAnomaly (Su et al. KDD 2019)
- 核心原理:随机循环神经网络 (Stochastic RNN) + GRU + 门控 VAE + 平面 Normalizing Flow 的复合架构,对潜变量分布进行灵活的非高斯拟合;用重构概率与潜在表示与先验的 KL 散度联合打分,并结合 POT 阈值选取。
- 架构:输入序列 → GRU 编码器 → 隐变量 z → 平面 NF 变换 → GRU 解码器 → 重建;异常分数 = -log p(x̂|x) - λ·KL(q(z)||p(z))。
- 优势:潜变量分布更灵活(NF 提升表达力);同时考虑重构与潜在空间偏离,对复杂异常鲁棒;引入 POT 自适应阈值。
- 劣势:训练代价高(GRU+VAE+NF 联合优化);易出现后验坍缩;阈值 POT 对极端长尾不敏感。
- 代表论文:Su Y, Zhao Y, Niu C, Liu R, Sun W, Pei D. "Robust Anomaly Detection for Multivariate Time Series through Stochastic Recurrent Neural Network." KDD 2019.
- 典型表现:SMAP F1≈0.85 / MSL F1≈0.89 / SMD 0.85;首次发布 SMD (Server Machine Dataset) 基准,被后续工作广泛沿用。
3.3 USAD (Audibert et al. KDD 2020)
- 核心原理:双编码器-解码器架构 + 对抗式两阶段训练。两个解码器共享一个编码器,相互"博弈"以放大正常/异常在重构空间的可区分性;异常分数为两解码器重构误差的非线性组合。
- 架构:x → Encoder E → 共享隐 z → Decoder D₁(z) / Decoder D₂(z);训练阶段 1 (W₁) 训练 E + D₁ 逼近 AE;阶段 2 (W₂) 训练 E + D₂ 对抗 D₁。
- 优势:训练快(无需 NF / 隐变量采样),工程落地极简;对抗式损失带来稳定训练;轻量级,在线推理 O(L)。
- 劣势:仅基于重构,未建模潜空间分布;超参(α、β)敏感;对复杂多模态异常表现一般。
- 代表论文:Audibert J, Michiardi P, Guyard F, Marti S, Zuluaga M A. "USAD: UnSupervised Anomaly Detection on Multivariate Time Series." KDD 2020.
- 典型表现:SWaT F1≈0.79 / SMAP 0.92 / MSL 0.88。综合速度与精度,被工业界广泛采用为基线(工业首选)。
3.4 GDN (Deng & Hooi AAAI 2021)
- 核心原理:图神经网络 + 结构学习 + Top-k 注意力。将每个传感器视为一个节点,通过学习到的稀疏有向图显式建模变量间因果关系;用 Graph Attention 聚合邻居信息,再通过偏差评分 (deviation score) 进行异常判定。
- 架构:输入窗口 → Embedding → 图结构学习层(用 Top-k 注意力学习稀疏邻接矩阵)→ 图卷积(Graph Attention)聚合邻居 → 预测下一时刻 → 与真实值偏差 = 异常分数。
- 优势:可解释性强(学习到的图能可视化变量间依赖);显式建模变量关系,减少误报;与业务结合紧密(可定位异常根因)。
- 劣势:图结构学习对噪声敏感;训练复杂度 O(N²),N 大时不可扩展;异常分数仅依赖预测偏差,对突变异常鲁棒。
- 代表论文:Deng A, Hooi B. "Graph Neural Network-Based Anomaly Detection in Multivariate Time Series." AAAI 2021, pp. 4027-4035.
- 典型表现:MSL F1≈0.99(benchmark 上接近 SOTA),SWaT / WADI 显著优于非图方法;可解释图被运维领域广为应用。
3.5 Anomaly Transformer (Xu et al. ICLR 2022 Spotlight)
- 核心原理:关联差异 (Association Discrepancy) 判据。利用 Transformer 同时建模逐点表示与成对关联;通过先验关联 (Gaussian kernel) 与学习关联 (自注意力) 之差量化异常;采用 minimax 训练策略 放大正常-异常可分性。
- 架构:输入 → Linear Projection → N 层 Anomaly-Attention Block(每个块同时输出:学习关联 P̂、先验关联 P̃);重建输出 + 关联差异得分;损失 L_total = L_recon - λ·L_discrepancy,采用交替 minimax 优化。
- 优势:双分支可解释,关联差异可作为异常归因;无需标签、监督弱;在多类数据上 SOTA。
- 劣势:O(L²) 自注意力,长序列成本高;高斯先验带宽 σ 需手工设定;minimax 训练不稳定,难复现。
- 代表论文:Xu J, Wu H, Wang J, Long M. "Anomaly Transformer: Time Series Anomaly Detection with Association Discrepancy." ICLR 2022 (Spotlight).
- 典型表现:在 SMD、MSL、SMAP、PSM、SWaT 五个基准上 F1 均超 0.85-0.95。
3.6 TranAD (Tuli et al. VLDB 2022)
- 核心原理:基于 Transformer 的对抗自编码器。采用编码器-解码器架构 + 自条件 (Self-Conditioning) 机制 + 对抗训练;通过焦点分数 (Focus Score) 放大重构误差尖锐度,并结合 MAML 提升小样本/概念漂移场景的鲁棒性。
- 架构:输入 x → Transformer Encoder → 共享 z → 两个 Transformer Decoder(D₁, D₂)做对抗式博弈;推理时异常分数 = α·‖x−D₁(x)‖ + β·‖x−D₂(x)‖。
- 优势:训练快(论文称训练时间最高减少 99%);自条件机制增强多模态捕获;适合在线/流式检测。
- 劣势:仍依赖重构误差;对长期依赖建模有限;多解码器增加内存占用。
- 代表论文:Tuli S, Casale G, Jennings N R. "TranAD: Deep Transformer Networks for Anomaly Detection in Multivariate Time Series Data." VLDB 2022.
- 典型表现:在 SMD、MSL、SMAP、SWaT、NeurIPS-TS、UCR 等 6 个数据集上 F1 较基线最高提升 17%;推理延迟 <1ms/窗口。
3.7 TimesNet (Wu et al. ICLR 2023)
- 核心原理:将一维时间序列的复杂变化拆解为 2D 张量建模。观察到时序具有多周期性,按周期长度折叠为 2D 张量(行=周期间变化,列=周期内变化),用 2D 卷积 (Inception block) 统一提取,再映射回 1D。
- 架构:输入序列 → FFT 取 Top-k 周期 → 折叠为多组 2D 张量 → TimesBlock (Inception 2D 卷积 + 残差) → 1D 重塑 → 任务头(预测/填补/分类/异常检测)。
- 优势:任务通用(同一骨干支持预测/填补/分类/异常检测五任务);1D→2D 视角创新,长短期依赖皆可捕获;已有官方代码库 Time-Series-Library,工程友好。
- 劣势:周期数 k 需预设;FFT 折叠对非平稳序列不鲁棒;异常检测子任务性能并非 SOTA(相对 Anomaly Transformer)。
- 代表论文:Wu H, Hu T, Liu Y, Zhou H, Wang J, Long M. "TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis." ICLR 2023.
- 典型表现:在五项主流时序分析任务上一致 SOTA;异常检测在 SMD/MSL/SMAP 上 F1 ≈ 0.86-0.92。
3.8 DAGMM (Zong et al. ICLR 2018)
- 核心原理:深度自编码高斯混合模型 (Deep Autoencoding Gaussian Mixture Model)。两阶段端到端架构:第一阶段用压缩网络 (Compression Net) 提取低维表示 + 重建误差;第二阶段用估计网络 (Estimation Net) 拟合高斯混合模型对样本进行密度估计;联合优化重构 + 混合模型似然。
- 架构:x → 自编码器 (AE) → 隐变量 z_concat [z; x_recon_err] → 估计网络 (GMM) → 输出混合成分概率与能量分数;异常分数 = -log Σ_k π_k N(x|μ_k, Σ_k)。
- 优势:端到端联合训练(AE 与 GMM 共享梯度);训练效率高、推理快速;无监督、密度驱动可解释。
- 劣势:GMM 假设难以刻画复杂流形;对高维多变量时序扩展性差;早期工作,未考虑时序依赖(视为 i.i.d. 样本)。
- 代表论文:Zong B, Song Q, Min M R, Cheng W, Lumezanu C, Cho D, Chen H. "Deep Autoencoding Gaussian Mixture Model for Unsupervised Anomaly Detection." ICLR 2018.
- 典型表现:在 KDDCUP、Thyroid、Arrhythmia 等经典异常检测数据集上 F1 显著优于 OC-SVM。
3.9 横向对比表
| 模型 | 年份/会议 | 核心创新 | 数据模态建模 | 异常分数 | 主流数据集 F1 (近似) | 工程落地难度 |
|---|---|---|---|---|---|---|
| DAGMM | ICLR 2018 | AE+GMM 端到端联合训练 | i.i.d. 多维向量 | 密度能量 | KDDCUP ≈ 0.93 | ★★ 低 |
| LSTM-VAE | T-RO 2018 | LSTM + VAE 概率重构 | 序列 + 概率 | 重构概率 | 机器人 ≈ 0.85 | ★★ 低 |
| OmniAnomaly | KDD 2019 | 随机 RNN + Planar NF | 序列 + 灵活潜空间 | 重构概率 + KL | SMAP 0.85 / MSL 0.89 / SMD 0.85 | ★★★★ 高 |
| USAD | KDD 2020 | 双解码器对抗训练 | 静态窗口 | 双解码器重构组合 | SWaT 0.79 / SMAP 0.92 / MSL 0.88 | ★★ 低(工业首选) |
| GDN | AAAI 2021 | 图结构学习 + Top-k 注意力 | 变量关系 + 序列 | 预测偏差 | MSL ≈ 0.99 | ★★★ 中 |
| Anomaly Transformer | ICLR 2022 | 关联差异 + minimax 训练 | 序列 + 关联 | 关联差异 | 0.85-0.95 | ★★★★ 高 |
| TranAD | VLDB 2022 | Transformer 对抗自条件 | 序列 + 多模态 | 自条件重构 | 6 数据集 F1 +17% | ★★★ 中(速度极快) |
| TimesNet | ICLR 2023 | 1D→2D 周期建模 | 多周期 2D 张量 | 重构 / 预测 | 0.86-0.92 | ★★★ 中(任务通用) |
3.10 经典模型的选型建议(工程落地视角)
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 工业级在线检测 / 资源受限 | USAD、TranAD | 训练快、推理快、易部署 |
| 需要可解释性 / 根因定位 | GDN、Anomaly Transformer | 图结构 / 关联差异可视化 |
| 多周期 / 多任务通用骨干 | TimesNet | 一套骨架支持多任务 |
| 潜空间分布复杂 | OmniAnomaly、Anomaly Transformer | 概率建模 / 灵活先验 |
| i.i.d. 多维向量(非时序) | DAGMM | 经典密度估计,端到端 |
3.11 经典模型的关键观察
- 趋势演化:从 2018 年 DAGMM 的 i.i.d. 假设 → LSTM-VAE/OmniAnomaly 的概率时序建模 → USAD/TranAD 的轻量化对抗训练 → GDN/Anomaly Transformer 的结构化建模 → TimesNet 的统一骨干,研究范式从「重构误差」逐步走向「结构+关联+周期」的多视角融合。
- 工程友好度排序(由高到低):USAD ≈ TranAD > DAGMM > LSTM-VAE > GDN > TimesNet > Anomaly Transformer > OmniAnomaly。
- 共同短板:上述模型均无法自然处理概念漂移 / 在线增量学习,实际工程中常配合滑动窗口 + 周期性重训练策略。
四、SOTA 与前沿(2023-2026)
4.1 时间序列基础模型(TSFM)
4.1.1 TimeGPT-1 / TimeGPT-2 (Nixtla, 2023-2025)
- 论文:arXiv:2310.03589(v1 2023-10,正式版 2024-05)
- 机构:Nixtla(Azul Garza, Cristian Challu, Max Mergenthaler-Canseco)
- 核心创新:业界首个面向时序预测的"基础模型"产品级发布(API 服务 timegpt-1)。基于 Transformer 架构,在大规模跨域时序语料上预训练,支持**零样本推理(zero-shot inference)**与多种预测粒度。
- 开源情况:未开源完整模型权重,仅提供商业 API(Nixtla Cloud)与部分代码示例(
nixtlaPython SDK);TimeGPT-2 已于 2024 年底灰度发布。 - Benchmark 表现:在 M3/M4、ETT、Weather、Exchange 等标准基准上零样本表现优于 ARIMA、Theta、N-BEATS 等经典与深度方法,尤其在能源、零售领域表现稳健。
- 应用场景:通用预测、异常检测、补充数据(imputation)、金融与零售。
4.1.2 Chronos (Amazon, 2024)
- 论文:Chronos: Learning the Language of Time Series,arXiv:2403.07815(v3 2024-11)
- 机构:Amazon Science(与 NYU 合作,Andrew Gordon Wilson 等)
- 核心创新:将时序值通过缩放 + 量化统一映射为固定词表(vocabulary),再用 T5 系列(20M~710M)transformer 训练,"把时序当成语言"。训练集结合公开数据与高斯过程生成的合成数据,提高跨域泛化。
- 开源情况:✅ 完全开源,代码与权重见
amazon-science/chronos-forecasting(Apache-2.0),可 Hugging Face 一键调用。 - Benchmark 表现:在 42 个数据集的零样本评测中,Chronos 在训练语料覆盖的数据集上显著优于基线,在未见数据集上与有监督模型相当甚至更优。
- 应用场景:通用单/多变量预测、概率预测、可作为异常检测的特征提取器。
4.1.3 TimesFM (Google, ICLR 2024)
- 论文:A decoder-only foundation model for time-series forecasting,arXiv:2310.10688
- 机构:Google Research(Abhimanyu Das, Weihao Kong, Rajat Sen, Yichen Zhou)
- 核心创新:借鉴 LLM 思路设计的decoder-only 基础模型,核心是patched-decoder 注意力机制(类比 PatchTST 的 patching),在亿级时序点语料上预训练,200M 参数。
- 开源情况:✅ 开源权重(
google-research/timesfm,Hugging Facetimesfm-2.0-500m-pytorch),采用 Apache-2.0 协议。 - Benchmark 表现:零样本在 Monash、ETT、Weather 等多基准接近甚至达到有监督 SOTA;2.0 版本在多个长时预测任务上较 1.0 提升 10-20%。
- 应用场景:通用预测、能源、零售、云容量规划。
4.1.4 MOMENT (CMU, ICML 2024)
- 论文:MOMENT: A Family of Open Time-series Foundation Models,arXiv:2402.03885
- 机构:Carnegie Mellon University, Auton Lab
- 核心创新:发布"Time series Pile"大规模异构语料,并系统解决多数据集预训练中的数据稀缺、归一化冲突、通道错位三大挑战,模型规模覆盖 small/base/large(
40M700M)。 - 开源情况:✅ 完全开源,模型权重在 Hugging Face
AutonLab/MOMENT-1-large,语料AutonLab/Timeseries-PILE,CC BY 4.0。 - Benchmark 表现:在异常检测、分类、预测、imputation 四大任务上少样本/零样本即超越多个专用 SOTA;其中异常检测在 UCR、KDD-CUP 等基准上 F1 提升显著。
- 应用场景:通用时序分析、异常检测、迁移学习。
4.1.5 Timer (Tsinghua THUML, 2024)
- 论文:Timer: Generative Pre-trained Transformers Are Large Time Series Models,arXiv:2402.02368(v3 2024-10)
- 机构:清华大学 THUML 实验室(Yong Liu 等)
- 核心创新:提出 S³ (Single-Sequence-Series) 统一格式——将多个数据集的时序拼接成长序列,再用 GPT 风格自回归预测下一个 token;统一建模预测、imputation 与异常检测。10 亿时序点训练。
- 开源情况:✅ 开源于
thuml/Large-Time-Series-Model,模型规模 29M~672M。 - Benchmark 表现:在 17 个预测基准、4 个 imputation 基准、6 个异常检测基准(MSL、SMAP、PSM 等)上均达到或超过同期 SOTA。
- 应用场景:通用时序分析、AIOps 异常检测、通用预测。
4.1.6 Time-MoE & Time-300B (ICLR 2025 Spotlight)
- 论文:Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts,arXiv:2409.16040(v4 2025-02)
- 机构:蚂蚁集团 & Monash University(Xiaoming Shi, Ming Jin, Qingsong Wen 等)
- 核心创新:首次将稀疏混合专家(Sparse MoE)用于时序,激活参数量可控;配套发布 Time-300B 语料(跨 9 域、3000 亿点),并验证时序领域的 Scaling Law。
- 开源情况:✅ 开源,模型最大 2.4B 参数;GitHub
Time-MoE/Time-MoE,Apache-2.0。 - Benchmark 表现:在同等激活参数/算力预算下,相对稠密模型在长时预测与零样本设置上大幅领先(ETT、Weather、Electricity 上 MSE 降低 5-15%)。
- 应用场景:大规模通用预测、企业级时序分析、基础模型研究。
4.1.7 TTM: Tiny Time Mixers (IBM Research, NeurIPS 2024)
- 论文:Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series,arXiv:2401.03955
- 机构:IBM Research(Vijay Ekambaram 等)
- 核心创新:基于 TSMixer 设计的超轻量预训练模型(起步 1M 参数),创新点包括 adaptive patching、diverse resolution sampling、resolution prefix tuning,可 CPU 推理。
- 开源情况:✅ 完全开源,Hugging Face
ibm-granite/granite-timeseries-ttm-r1/r2,Apache-2.0。 - Benchmark 表现:零/少样本预测在多个基准上较同期 SOTA 提升 4-40%,同时计算开销减少数倍;微调后可联合外生变量与跨通道相关性。
- 应用场景:边缘部署、资源受限场景、IoT 异常检测。
4.2 扩散模型在时序异常检测中的应用
4.2.1 Diffusion-TS (2024)
- 论文:Diffusion-TS: Interpretable Diffusion for General Time Series Generation,arXiv:2403.01742(v2 2024-10)
- 核心创新:encoder-decoder transformer + 解纠缠时序表示;训练目标从"预测噪声"改为"直接重建样本",并加入 Fourier-based loss 约束频域一致性。模型本身可零修改扩展到 forecasting、imputation 与不规则时序。
- 开源情况:✅ 开源,GitHub
Y-Xing-1/Diffusion-TS。 - Benchmark 表现:在 SMD、MSL、SWaT、PSM 上 AUPRC/F1 达到 SOTA;异常样本的重建误差显著高于正常样本。
- 应用场景:时序生成、缺失值填补、异常检测、可解释性分析。
4.2.2 D3R (2024)
- 核心创新:Denoising Diffusion-based Reconstruction with Ranking score,把扩散采样过程的不确定性引入异常评分,缓解"重构误差低 ≠ 正常"问题。
- 应用场景:工业 IoT 流式异常检测。
- 代码:多版本开源实现。
4.2.3 ImDiffusion (2024)
- 核心创新:面向极度不平衡时间序列异常检测/分类的"Imbalanced Diffusion",通过类别条件扩散 + 重加权采样,显著改善稀有异常召回。
- 应用场景:极端不平衡场景下的稀有故障检测。
- 开源:公开代码(GitHub
ImDiffusion)。
4.3 LLM 用于时序异常检测
4.3.1 Time-LLM (ICLR 2024)
- 论文:Time-LLM: Time Series Forecasting by Reprogramming Large Language Models,arXiv:2310.01728
- 机构:Monash University & Ant Group(Ming Jin, Qingsong Wen, Shirui Pan 等)
- 核心创新:重编程(reprogramming)框架——冻结 LLM 主体权重不变,将时序 patch 通过**文本原型(text prototypes)**对齐到 LLM 词嵌入空间;并提出 Prompt-as-Prefix (PaP) 增强 LLM 推理能力。
- 开源情况:✅ 开源,GitHub
KimMeen/Time-LLM。 - Benchmark 表现:在 7 项主流预测基准上全面超越专用 SOTA,6-shot 击败专用 SOTA;在少样本/零样本场景表现尤为突出。
- 应用场景:通用预测、异常检测的可解释 LLM 决策。
4.3.2 AutoTimes (Tsinghua THUML, NeurIPS 2024)
- 论文:AutoTimes: Autoregressive Time Series Forecasters via Large Language Models,arXiv:2402.02370
- 机构:清华大学 THUML(Yong Liu 等)
- 核心创新:将任意 decoder-only LLM 复用为自回归时序预测器,把时序投射到 LLM 的词嵌入空间;提出 in-context forecasting(把时序当 prompt,扩展上下文),并利用 LLM 嵌入的时间戳文本对齐多变量。
- 开源情况:✅ 开源,
thuml/AutoTimes。 - Benchmark 表现:仅 0.1% 可训练参数即达到 SOTA;LLaMA-7B 在 ETTh1 训练 15 分钟(单卡 3090);训练/推理加速 5 倍以上。
- 应用场景:多变量预测、基于 LLM 的可解释异常检测。
4.3.3 ChatTS (Alibaba, VLDB 2025)
- 论文:ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning,arXiv:2412.03104
- 机构:阿里 AIOps 团队(Zhe Xie 等)
- 核心创新:首个以多变量时序为输入模态的多模态大模型(TS-MLLM)。提出 attribute-based 合成时序 + Evol-Instruct 的对齐数据生成方法,完全在合成数据上微调即可实现时序理解与推理。
- 开源情况:✅ 开源,GitHub
NetManAIOps/ChatTS。 - Benchmark 表现:在 alignment 任务上较 GPT-4o 等视觉 MLLM 提升 46.0%,reasoning 任务提升 25.8%。
- 应用场景:时序问答、根因分析、AIOps 智能体。
4.3.4 TimeChat (2024)
- 核心创新:多模态时序 LLM;通过 MCTS 生成时序-文本对,对 LLaMA 进行指令微调;支持多变量时序理解、预测、问答与异常解释。
- 基准:TimeChat-Bench。
- 开源:公开代码与权重(社区版)。
4.3.5 LSTPrompt (2024)
- 论文:LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term Prompting,arXiv:2402.16132
- 核心创新:将时序预测分解为长程与短程子任务,设计针对性 prompt;无需训练即可让 GPT-3.5/4、LLaMA 等完成零样本预测。
- Benchmark 表现:在 6 项基准上零样本即超越部分专用深度模型;长短程分解对季节性强的数据提升尤为明显。
- 应用场景:零样本预测、prompt 工程驱动的时间序列分析。
4.3.6 Lag-Llama (ServiceNow, 2023-2024)
- 论文:Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting,arXiv:2310.08278
- 机构:ServiceNow Research(Kashif Rasul, Irina Rish 等)
- 核心创新:基于 lag 协变量的 decoder-only Transformer 概率预测模型(输出为分布而非点估计),在跨域大规模时序上预训练。
- 开源情况:✅ 完全开源,
time-series-foundation-models/lag-llama。 - Benchmark 表现:零样本在跨域基准上击败统计与深度基线;微调后在多个新数据集上达到 SOTA 概率预测表现。
- 应用场景:概率预测、异常区间估计(与异常检测直接相关)。
4.4 其他 2023-2025 值得关注的方法
4.4.1 DCdetector (KDD 2023, Alibaba DAMO)
- 论文:DCdetector: Dual Attention Contrastive Representation Learning for Time Series Anomaly Detection,arXiv:2306.10347
- 核心创新:双注意力非对称设计——一个分支对序列做随机置换(permutated environment),另一个分支保持原始顺序;纯对比损失引导学习置换不变但判别性强的表示。
- 开源情况:✅ 开源,GitHub
DAMO-DI-ML/KDD2023-DCdetector。 - Benchmark 表现:在 MSL、SMAP、PSM、SMD、SWaT 等 6 个多维异常检测基准上全面 SOTA,F1 较前期对比方法提升 3-8%。
- 应用场景:多维时序异常检测、对比学习驱动的工业监控。
4.4.2 DBA - Diverse Behavior Analysis (Monash, 2024)
- 核心创新:显式建模多种"正常行为模式"(多模态分布)以应对真实系统多工况;用对比学习拉近同一模式样本、推远不同模式。
- Benchmark 表现:在 SMD/MSL/SMAP/PSM/SWaT 上 AUPRC 领先。
4.4.3 CARLA (Pattern Recognition 2024)
- 论文:CARLA: Self-supervised Contrastive Representation Learning for Time Series Anomaly Detection,arXiv:2308.09296
- 核心创新:在传统对比学习基础上,注入多种合成异常作为负样本,让模型既学正常模式又学异常偏离;并用最近邻/最远邻做窗口级分类。
- Benchmark 表现:在 7 个真实数据集上击败 SOTA 自监督与无监督方法,AUC 提升 2-7%。
- 应用场景:少标签场景下的时序异常检测。
4.4.4 Focal (NeurIPS 2024)
- 核心创新:"Forgery-resilient & Plug-and-play"异常检测框架;可作为后处理模块挂到任意点预测/重构模型上,通过伪造攻击训练增强鲁棒性。
- 应用场景:跨模型插件式增强。
4.4.5 AnomalyCLIP (ICLR 2024)
- 论文:AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection,arXiv:2310.18961
- 核心创新:基于 CLIP 的对象无关(object-agnostic)文本 prompt 学习,让模型关注"正常/异常"语义而非前景物体类别,从而跨域零样本泛化。
- 开源情况:✅ 开源,GitHub
zqhang/AnomalyCLIP。 - Benchmark 表现:在 17 个工业与医学异常检测数据集上零样本均达 SOTA(注:原方法以视觉为主)。
4.4.6 PSAD / CAD / M2Depth (2024-2025)
- PSAD:Prototype-guided Semi-supervised Anomaly Detection,结合 prototype 与伪标签迭代。
- CAD:Contrastive Anomaly Discrimination,多视图对比异常打分。
- M2Depth:Multi-Mask Multi-Depth 框架,融合多尺度深度特征做异常定位。
4.5 SOTA 分类总览表
| 模型 | 类别 | 发表/时间 | 机构 | 核心创新 | 开源 | 典型表现 |
|---|---|---|---|---|---|---|
| TimeGPT-1 | TSFM | 2023-10 (arXiv) | Nixtla | 首个时序基础模型 API | 商业 API | M3/M4 零样本 SOTA |
| Chronos | TSFM | 2024-03 (arXiv) | Amazon | 时序 token + T5 训练 | ✅ | 42 数据集零/少样本 SOTA |
| TimesFM | TSFM | 2023-10 / ICLR 2024 | Decoder-only + patched | ✅ | Monash/ETT 接近有监督 SOTA | |
| MOMENT | TSFM | 2024-02 / ICML 2024 | CMU AutonLab | Time series Pile + 多任务 | ✅ | 异常检测/分类少样本 SOTA |
| Timer | TSFM | 2024-02 (arXiv) | Tsinghua THUML | S³ 格式 + 统一生成 | ✅ | 6 异常检测基准 SOTA |
| Time-MoE | TSFM | 2024-09 / ICLR 2025 | 蚂蚁+Monash | Sparse MoE + 2.4B | ✅ | ETT/Weather 提升 5-15% |
| TTM | TSFM | 2024-01 / NeurIPS 2024 | IBM | 1M 参数 + CPU 推理 | ✅ | 零样本提升 4-40% |
| Diffusion-TS | 扩散 | 2024-03 (arXiv) | — | 直接重建 + Fourier loss | ✅ | 异常重建误差显著 |
| D3R | 扩散 | 2024 | — | 扩散采样不确定性 | ✅ | 工业流式 SOTA |
| ImDiffusion | 扩散 | 2024 | — | 类别条件扩散 | ✅ | 极不平衡 SOTA |
| Time-LLM | LLM | 2023-10 / ICLR 2024 | Monash/Ant Group | 重编程 + PaP | ✅ | 7 预测基准 SOTA |
| AutoTimes | LLM | 2024-02 / NeurIPS 2024 | Tsinghua THUML | LLM as 自回归预测器 | ✅ | 0.1% 参数、5× 加速 SOTA |
| ChatTS | LLM | 2024-12 / VLDB 2025 | 阿里 AIOps | 多变量 MLLM + 合成数据 | ✅ | 较 GPT-4o +46% / +25.8% |
| TimeChat | LLM | 2024 | 学界 | MCTS 数据 + LLaMA 微调 | ✅ | 通用对话 SOTA |
| LSTPrompt | LLM | 2024-02 (arXiv) | — | 长短程 prompt 分解 | 部分 | 零样本超部分专用模型 |
| Lag-Llama | LLM | 2023-10 (arXiv) | ServiceNow | Lag 协变量 + 概率预测 | ✅ | 跨域概率预测 SOTA |
| DCdetector | 对比 | 2023-06 / KDD 2023 | Alibaba DAMO | 双注意力对比 | ✅ | 6 基准 SOTA |
| DBA | 对比 | 2024 | Monash | 多模式行为分析 | ✅ | SMD/SWaT AUPRC SOTA |
| AnomalyCLIP | 视觉-LLM | 2023-10 / ICLR 2024 | Zhejiang U. | 对象无关 prompt | ✅ | 17 视觉数据集 SOTA |
| CARLA | 对比 | 2023-08 / PR 2024 | Monash U. | 异常注入对比 | ✅ | 7 基准 SOTA |
| Focal | 插件 | NeurIPS 2024 | 学界 | Forgery-resilient | ✅ | 跨模型 SOTA |
4.6 SOTA 趋势总结
- TSFM 正成为多维时序异常检测的新基础设施:MOMENT、Timer、Moirai 等模型在异常检测任务上以少样本微调即可达到专用 SOTA;Time-MoE 与 TimesFM 进一步证明 scaling law 在时序域同样有效。
- LLM 增强的两种范式并行:以 Time-LLM、AutoTimes 为代表的"重编程/嵌入对齐"路线追求参数效率;ChatTS、TimeChat 则代表"时序作为新模态"的 MLLM 路线,瞄准时序理解与智能体。
- 扩散模型与对比学习仍是异常检测核心:Diffusion-TS 提供可解释的重建误差评分;DCdetector、DBA、CARLA 的对比学习路线在少标签场景仍有不可替代性。
- 开源生态成熟:除 TimeGPT-1 闭源外,本调研覆盖的绝大多数 SOTA 模型均提供权重与代码;MOMENT、Chronos、Timer、Time-MoE 已成主流开源选择。
- 未来值得关注的方向:
- 多模态时序基础模型(文本+时序+视觉)
- 异常检测与因果推理结合
- 边缘/端侧部署的轻量化 TSFM(TTM、TCN-Mixer)
- 跨域联邦学习下的异常检测 TSFM
五、评测基准与指标争议
5.1 核心争议:评估方法本身的缺陷
近年来大量研究指出,多维时序异常检测(MTSAD)领域存在严重的评估方法学危机。Wu & Keogh 在 2020-2022 年间发表的一系列论文中尖锐指出:"Current Time Series Anomaly Detection Benchmarks are Flawed and are Creating the Illusion of Progress"。Kim 等人(AAAI 2022,arXiv:2109.05257)则从理论上证明:在 Point Adjustment 协议下,随机异常分数也能取得 SOTA 的 F1 分数。
这两个发现共同表明,过去几年该领域"飞速进步"很大程度上是评估协议虚高指标造成的错觉。
5.2 常用 Benchmark 数据集详解
5.2.1 服务器与运维类
- SMD (Server Machine Dataset):OmniAnomaly(KDD 2019)发布,38 维 × 28 机器,约 1 分钟一次采样,共 5 周。问题:异常类型单一、缺乏真实分布偏移。
- MSL (Mars Science Laboratory):NASA 火星车遥测,27 实体、55 维,异常率 10.72%。问题:训练-测试同分布、漂移不显著。
- SMAP (Soil Moisture Active Passive):NASA 土壤湿度卫星数据,55 实体、25 维,异常率 13.13%。Wu & Keogh 指出其多数 exemplars 存在标签质量问题。
- PSM (Pooled Server Metrics):eBay 内部服务器池化指标,26 维。问题:缺正式论文说明标注协议,异常定义不透明。
5.2.2 工业控制系统
- SWaT (Secure Water Treatment):新加坡 iTrust 中心发布的水处理厂 11 天连续数据,51 维传感器+执行器,攻击型异常。问题:训练段 7 天、测试段 4 天概念漂移不明显;异常占比极低(约 1%)。
- WADI (Water Distribution):SWaT 延伸——配水系统,123 维,16 天采集。问题更严重:维度高、序列长、异常稀疏,训练-测试分布不一致。
5.2.3 单变量与基础基准
- UCR Anomaly Archive:Wu & Keogh (arXiv:2009.13807) 提出,专门清洗了 4 类常见缺陷,250 个高质量单变量序列,被认为是"最干净的 benchmark"。
- NAB (Numenta Anomaly Benchmark):58 个数据流,异常由人工标注。问题:异常短(单点为主),无法代表多维场景。
- Yahoo S5:367 个时间序列。Wu & Keogh 直接指出其大部分样本存在严重标注错误。
- MGAB (Mackey-Glass Anomaly Benchmark):基于 Mackey-Glass 方程合成,单变量。问题:合成数据,无法验证真实泛化性。
5.2.4 KPI 与运维竞赛类
- KPI Anomaly Detection Series:AIOps Challenge 系列,2018-2021 多届,来自互联网公司真实 KPI 曲线。问题:异常类型(尖峰、波动、漂移)混合。
- IOpsCompetition:AIOps 竞赛数据集,最新一届(WSDCup2023)已开始关注分布外异常。
- TSB-UAD:Paparrizos 团队发布,250 个单变量序列,集成 12 个公共数据集,配套 VUS-PR 推荐协议。
5.2.5 生理信号与多维科学数据
- MIT-BIH Arrhythmia:48 条双导联记录,异常仅 1-2 维。
- DBSherlock:基于 NeuroElectro/Allen Brain Atlas 的脑电多维异常基准。
- CATSv2 (2023):新设竞赛基准,引入"概念漂移"与"标签噪声"维度。
- Exathlon:基于 eBay 的真实云工作负载异常数据,107 个时间序列,27 维,覆盖 3 种异常类型(注入、传播、自然)。
5.3 评估指标对比
| 指标 | 优点 | 致命缺陷 |
|---|---|---|
| Point F1 (无 PA) | 严苛、反映真实能力 | 忽略段内覆盖度 |
| PA-F1(Point Adjustment) | 让 1 个点 = 整段检出 | 虚高 2-5 倍,被称"作弊" |
| Affiliation-F1 | 段中心 + 距离惩罚 | λ 需人工设定 |
| AUC-PR | 阈值无关、对不平衡敏感 | 忽略区间长度 |
| Composite F1 | 综合多种性质 | 权重主观,无法横向比较 |
| VUS-PR | 阈值独立、参数自由、对边界鲁棒 | O(N²)(2025 优化为 O(N log N)) |
5.4 Point Adjustment 争议详解
5.4.1 Wu & Keogh 2020-2022 系列
Wu & Keogh 系统地揭示了 TSAD benchmark 中的四大缺陷(统称"elephant in the room"):
- Trivial anomalies:异常段形态过于简单,任何模型都能识别
- Duplicate anomalies:多个数据集来自同一时间序列的随机切片
- Mislabeled ground truth:异常标签与点标签相互矛盾
- Anomalies at the end / beginning:异常集中在序列边界
关键发现:Random Guess + PA 在 Yahoo/Numenta/NASA 上就能超 80% F1;多个 SOTA 实际输给"只检测一个点 + PA"的简单策略。
5.4.2 为什么 Point Adjustment 会虚高指标
举例:真实异常段 [t=100, t=200],模型仅在 t=150 报一个异常点。按 PA:
- 真阳 = 101 个点(整段)→ Recall = 1.0
- 假阳 = 1 → Precision ≈ 0.99 → F1 ≈ 0.995
这与"只报一个点就完美检测整个 100 点异常"完全等价,抹除了对段内覆盖度的评估。该问题在 SWaT/WADI 等长异常段场景下被严重放大。
5.4.3 VUS-PR 的设计动机
Paparrizos 团队 (ICDE 2022, arXiv:2502.13318 2025 扩展) 直接针对 PA 的两个问题:
- 把异常视作"点":VUS-PR 引入"段"概念,定义"检测段中心"附近的容忍带(slack window)。
- 单阈值不公:VUS-PR 构造 PR 曲面,积分所有阈值,避免"选择最佳阈值报 SOTA"。
关键实验:在 250 个 TSB-UAD 序列上,基于 PA 的排名与基于 VUS-PR 的排名完全不相关(Spearman < 0.2)。这意味着:依赖 PA 的 SOTA 排名很可能不反映真实能力。
5.4.4 后续争议
- Paparrizos et al. (VLDB 2022):TSB-UAD 上的 12 种基线在 PA-F1 下排名近乎随机。
- Correia et al. (EAAI 2024, arXiv:2408.03747):明确指出"无可靠方法比较 MTSAD 方法,因为公开数据集有根本缺陷"。
- Li et al. (KDD 2023):USAD 在 PA-F1 下 SOTA,在 VUS-PR 下接近随机。
5.5 推荐使用的评估方法清单
必报指标(Must Report):
- VUS-PR(主指标):阈值独立、对边界鲁棒、参数自由。配套实现见 arXiv:2502.13318 (2025 优化版)
- Affiliation-F1:作为 segment-aware 指标,参数 λ 取 0.1 ~ 1.0 多档报告
- AUC-PR:作为传统阈值无关基线对照
- Point F1 (无 PA):作为最严苛基线,反映真实检测能力
推荐辅助指标:
- R-based F1(Range-based F1):考虑段重叠
- PA-F1:可报但必须明确标注是否使用 PA,且 PA-F1 不得作为唯一主指标
- Volume Under the Surface (VUS) 家族全部 4 个变体(PR/ROC/τ/AUC-PR)
报告规范建议:
- 禁止只用 PA-F1:单点 PA-F1 > 0.9 几乎不能说明任何问题
- 多阈值扫描:报告 PR 曲线或 AUC,而非单一"最优 F1"
- 跨数据集测试:至少在 3 个不同领域数据集上报告
- 基线对照:必含 Random、Constant、Naive 等 trivial baseline
- 优先使用 UCR Anomaly Archive + TSB-UAD + 新建 CATSv2 / Exathlon 作为新基准组合
推荐的"评估"数据集组合:
- 多维场景:SMD + MSL + SMAP + PSM + SWaT + WADI + Exathlon
- 单变量场景:UCR Anomaly Archive + TSB-UAD
- 零样本泛化:TSB-UAD 中未见领域 + 自建跨域测试集
强烈建议避免:
- 单一 PA-F1 排名
- 在小数据集(< 5 个序列)上报 SOTA
- 不报告随机基线
- 不在 2 个及以上领域测试就声称"通用"
5.6 综述与最新 Survey
| 论文 | 关键贡献 |
|---|---|
| Dive into Time-Series Anomaly Detection: A Decade Review (Boniol et al., arXiv:2412.20512, 2024-12) | 跨十年文献元分析,提出 process-centric 分类法 |
| A Review on Self-Supervised Learning for Time Series Anomaly Detection (Sánchez-Ferrera et al., arXiv:2501.15196, 2025-01) | SSL 在 TSAD 的系统综述 |
| Online Model-based Anomaly Detection in MTS: Taxonomy, Survey (Correia et al., EAAI 2024, arXiv:2408.03747) | 在线 vs 离线、训练 vs 推理的二维分类法 |
| Graph Anomaly Detection in Time Series: A Survey (Ho et al., arXiv:2302.00058, 2023) | 时序图异常的图方法综述 |
| A Survey of TSAD Methods in the AIOps Domain (Zhong et al., arXiv:2308.00393, 2023) | AIOps 场景特化综述 |
| A Comprehensive Survey of Deep Transfer Learning for AD in Industrial TS (Yan et al., arXiv:2307.05638, 2023) | 工业场景的迁移学习综述 |
5.7 监督 / 无监督 / 自监督 / 零样本对比
| 范式 | 代表方法 | 优势 | 局限 |
|---|---|---|---|
| 监督 | LSTM-AD、CNN-AD | 可利用标签、指标稳定 | 异常极少、标签噪声大、跨域失效 |
| 无监督 | USAD、OmniAnomaly、TranAD | 不需标签 | Point Adjustment 虚高、阈值难选、对漂移脆弱 |
| 自监督 | TS2Vec、TF-C、NCAD、DCdetector、CARLA | 预训练可迁移 | 需大量正常数据、代理任务设计难 |
| 半监督 | USAD、Deep SVDD、TranAD | 工业落地最常用 | 依赖"正常数据干净",长程漂移失效 |
| 零样本 | LLM-based、ChronosAD、MOMEMTO、TimeRadar | 无需训练数据、跨域泛化好 | 时序感知弱、推理慢、prompt 敏感 |
趋势:2024-2025 年的工作集中在 (a) 自监督 + 少量标签(few-shot)、(b) Time Series Foundation Models (TSFM) 用于零样本异常检测。
六、核心局限
6.1 数据层面
- 标签稀缺:异常 <1%,标注成本极高
- 概念漂移:SWaT/WADI 等训练-测试分布差异 >20%
- 长尾/季节性:大促等场景漂移剧烈
- 缺失值:真实场景 5-10% 缺失
- 高维稀疏:>50 维降维需求强
- 类别不平衡:极端场景异常占比 <0.1%
6.2 模型层面
- 可解释性差:深度模型黑箱,金融/医疗/电网难落地
- 计算成本高:O(L²) Transformer 难处理长序列
- 后验坍缩 / 训练不稳定:VAE 系列、minimax
- 泛化性弱:跨数据集 F1 下降 30-50%
- 无增量学习:所有当前 SOTA 几乎均不支持在线更新
- 超参敏感:高斯先验带宽、KL 权重、minimax 交替频率等
6.3 评估层面
- Point Adjustment 虚高 2-5 倍
- 阈值选择不透明:"best F1" 不可信
- 数据集标签质量差:Wu & Keogh 4 类缺陷
- 没有漂移点标注:CATSv2 才开始引入
- 不同论文评估协议不统一:跨论文横向比较困难
6.4 工程层面
- 冷启动困难:新业务无可用历史
- 误报成本高:告警疲劳导致真实异常被忽略
- 端侧部署受限:需轻量化(TTM 是当前最优解)
- 在线更新困难:模型重训代价大
- 多模态融合难:文本/图像/事件叠加时序的处理
七、垂直场景算法适配矩阵
7.1 各场景核心情况
7.1.1 云原生可观测性
- 数据特征:高维、噪声大、强季节性
- 主导算法:统计基线 + RCF + Forecast
- 代表实现:Datadog Watchdog / Dynatrace Davis / Elastic ML / Grafana ML
- 算法细节:
- Datadog Watchdog 三种算法:Anomaly Algorithm(异常)、Forecast Algorithm(预测)、Outlier Algorithm(DBSCAN 离群检测)
- Elasticsearch ML 核心:Proportional EWMA(检测缓慢漂移)+ Bayesian(融合先验);population job 用于群体异常
- 适配原因:实时性优先、噪声大、需要自动基线
- 关键结论:商业可观测性产品几乎都是"统计+ML+聚类"的多算法组合,没有"纯 DL 模型"直接对客户提供端到端时序异常检测
7.1.2 AIOps 告警收敛
- 数据特征:高维 KPI、需可解释
- 主导算法:SR-CNN + 突变点 + LLM
- 代表实现:Azure Anomaly Detector (SR-CNN) / 阿里 ARMS Copilot / 字节火山引擎
- 算法细节:
- Microsoft Azure Anomaly Detector(2026-10 停用):
- 单变量:SR-CNN(Spectral Residual + CNN,KDD 2019)
- 多变量:Graph Attention Network(ICDM 2020,最多 300 维信号)
- 阿里:从 Opprentice(KDD 2015)→ iForest → Donut(VAE, KDD 2019)→ 多源关联图
- 字节:STL 分解 + 鲁棒回归 + 告警事件聚类
- Microsoft Azure Anomaly Detector(2026-10 停用):
- 效果:AIOps 智能监控可将 MTTD 改善 15-20%(Wikipedia/Gartner)
- 适配原因:高维时序、可解释、需自然语言交互
7.1.3 金融风控与交易
- 数据特征:100+ 维特征、< 100ms 延迟、强监管
- 主导算法:XGBoost + GNN + Isolation Forest + Hawkes
- 代表实现:PayPal、Visa VAA、Stripe Radar
- 关键数据:
- PayPal:XGBoost + DNN + Isolation Forest 多模型堆叠,模型延迟 < 100ms;2019 KDD Cup 凭 LSTM-Transformer 集成拿冠军
- Visa VAA:日均分析 500+ 万账户行为画像,2017-2024 累计阻止 120+ 亿美元欺诈损失
- Visa VAAI:500ms 内完成卡组级欺诈判别,GNN 捕捉商户-持卡人-终端关系异常
- FINRA CAT:每天 100+ 亿条美股市场事件;用规则 + RF/LSTM 混合
- SEC MIDAS:机器学习驱动的多维时序异常检测
- 适配原因:100ms 延迟、规则可解释、特征工程重
7.1.4 工业 IoT / 预测性维护
- 数据特征:多变量耦合、缺标签、强实时
- 主导算法:LSTM / AutoEncoder / GAT
- 代表实现:NASA telemanom、MTAD-GAT、OmniAnomaly、西门子 MindSphere、GE Predix
- 关键数据:
- NASA C-MAPSS(预测性维护标配):#6 数据集 4 子集 × 21 传感器 + 3 工况,RUL 任务 LSTM/Transformer/CNN-LSTM 的 RMSE 在 9-12(SOTA 接近 8)
- NASA telemanom (KDD 2018):SMAP 精度 85.5%/召回 85.5%;MSL 精度 92.6%/召回 69.4%
- MTAD-GAT (ICDM 2020):双层 GAT 同时建模时序依赖和变量间依赖,SWaT、WADI 上 AUC 提升约 10%
- GE Predix APM:航空发动机 RUL 早期预警准确率 95%+
- OmniAnomaly (KDD 2019):在 SMD 上击败 baseline,F1 提升 17%
- 适配原因:多变量耦合、训练样本少、缺标签
7.1.5 网络安全(IDS / DDoS)
- 数据特征:高速流式、加密不可见
- 主导算法:随机森林 + 滑动窗 + 熵
- 代表实现:Cisco ETA、Cloudflare、Akamai Prolexic
- 关键数据:
- Cisco ETA:随机森林 + LSTM,不解密 TLS 即可分析,准确率 99%+ 误报 <0.01%
- Cloudflare:300+ 城市节点,滑动窗口 + Isolation Forest + 变点检测,2024 Q1 单日阻断 4.5 Tbps DDoS
- Akamai Prolexic:时序异常 + 熵检测,每天分析 100+ PB 流量
- 学术界 ANN 在 NSL-KDD 上 99.9% 检测率、集成模型 MCC 99.73%(已被认为过拟合严重)
- CICIDS2017/UNSW-NB15 上更现实:RF/XGBoost F1 0.85-0.92,纯 DL 0.80-0.90,往往不如带特征工程的 GBDT
- 适配原因:亚秒级响应、低误报
7.1.6 医疗监护
- 数据特征:长序列、监管严(FDA 510(k))
- 主导算法:LSTM-Attention + EWS
- 代表实现:Philips IntelliVue、GE Healthcare Centricity、MIMIC
- 关键数据:
- Philips IntelliVue:2020 年后引入 LSTM-Attention 替代 MEWS,心衰/败血症检测灵敏度提升 18-30%
- GE Healthcare Mural:ICU 多变量时序预测"病人状态恶化",可提前 6 小时预警
- MIMIC-III/IV:40,000+ ICU 住院数据,PhysioNet 事实标准
- MIT-BIH:1D-CNN + LSTM 在 99%+ sensitivity,但 FDA 认证周期长
- 适配原因:可解释、监管严
7.1.7 数据库与中间件
- 数据特征:海量指标、冷启动
- 主导算法:IForest / Prophet / 自研时序
- 代表实现:Uber F3、Apache IoTDB、Merlion、AWS Performance Insights
- 关键数据:
- Uber F3(2018 博客公开):动态告警阈值生成 + alert backtesting,底层 metrics store 负载下降 90%
- Salesforce Merlion(2026-03 archive):集成 IForest、Prophet、AutoEncoder,NAB AWS CloudWatch P/R/F1=0.6667
- Apache IoTDB:内置 IForest、KMeans+距离阈值
- P99 延迟 < 1s,F1 0.85+
- 适配原因:冷启动友好、亿级指标
7.1.8 能源电网
- 数据特征:强实时(30-120 Hz)、虚假注入攻击
- 主导算法:稀疏分解(LRSD)+ LSTM-AE
- 代表实现:国家电网 PMU 模型、GE GridOS、Siemens Spectrum Power
- 关键数据:
- 国家电网 / 南方电网:PMU 多变量异常检测主要用:
- **低秩稀疏分解(LRSD)**识别虚假数据注入(FDA)
- LSTM-AE 在 IEEE 118-bus 标准数据 F1 0.93+
- Terna(意大利):WAMS 相量数据 + 动态状态估计 + 不一致性分析
- Tesla Energy / Fluence:RNN 做电池簇电压/温度异常预警
- 国家电网 / 南方电网:PMU 多变量异常检测主要用:
- 适配原因:强实时、虚假注入攻击
7.1.9 零售电商(双11)
- 数据特征:业务事件耦合、大促漂移
- 主导算法:多变量 + 事件混合
- 代表实现:阿里 KDD 2021、京东 11.11、ByteFG
- 关键数据:
- 阿里巴巴双 11:KDD 2021 论文《Generic and Robust Localization of Multi-Dimensional Time Series Anomalies》
- 亿级时间序列,F1 0.85+,P99 延迟 < 1s
- 告警收敛比 100:1(根因定位可从 1000+ 告警收敛到 5-10 个故障)
- 京东:RobustSTL + 异常打分模型 + 影响因子归因
- 字节 ByteFG:自研多变量 + GNN,亿级指标秒级检测
- 阿里巴巴双 11:KDD 2021 论文《Generic and Robust Localization of Multi-Dimensional Time Series Anomalies》
- 适配原因:销量异常、大促漂移、业务事件耦合
7.2 算法-场景适配总表
行 = 算法/方案族,列 = 工业场景;⭐⭐⭐ = 工业界主流且效果亮眼,⭐⭐ = 可用,⭐ = 学术界常见但工业落地少,✗ = 不适用
| 算法 / 场景 | 可观测性 | AIOps | 金融风控 | 工业 IoT/PdM | 网络安全 | 医疗 | 数据库 | 能源 | 电商 |
|---|---|---|---|---|---|---|---|---|---|
| STL / 滑动统计 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| EWMA / Bayesian | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐⭐ |
| Isolation Forest / DBSCAN | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ |
| ARIMA / Prophet | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| GBDT (XGBoost/LightGBM) | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ |
| LSTM / GRU | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ |
| 1D-CNN / CNN-LSTM | ⭐ | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ |
| Transformer 时序 | ⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ |
| VAE / Donut / SR-CNN | ⭐⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
| Graph Attention / GNN | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐ |
| Hawkes 过程 | ⭐ | ⭐ | ⭐⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
| 规则 + 专家系统 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
| TSFM (Chronos/MOMENT) | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ |
| 扩散模型 (Diffusion-TS) | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
7.3 选型决策树
数据规模与场景
├─ 维度 < 10、缺标签 → Isolation Forest / One-Class SVM
├─ 强周期、单/多维 → SR-CNN / Prophet(Azure、Datadog)
├─ 多变量耦合、关系重要 → 图模型(MTAD-GAT、GDN)
├─ 复杂模式、训练数据多 → Transformer / LLM-TSAD
├─ RUL / 早期预警 → LSTM-AE / VAE(OmniAnomaly、USAD)
└─ 强监管 + 可解释 → 树模型 + SHAP(金融、医疗、电网首选)
7.4 选型维度建议
- 可解释性需求高(金融/医疗/电网):树模型 + SHAP、GNN、GDN
- 实时性约束 < 100ms(风控/网络安全):XGBoost、LightGNN、IForest、轻量 AE
- 变量关系重要(AIOps/微服务):图模型 MTAD-GAT、GDN
- 跨域零样本(云服务/多业务线):TSFM(MOMENT、Chronos、Timer、Time-LLM)
- 缺标签+长序列(工业/科研):自监督(TS2Vec、NCAD、DCdetector)
八、工业界落地的核心共识
-
没有"端到端 DL 异常检测"被直接卖给客户。Datadog、Elastic、Azure、Grafana、阿里 ARMS 全部是"统计+无监督+监督"组合拳。
-
异常检测的"调优"和"可解释性"比模型架构更重要。Informer/Anomaly Transformer 等学术 SOTA 工业落地少,多因为不可解释、不可控。
-
多维时序异常 = 趋势异常 + 群体异常 + 因果异常 三个子问题,分而治之才是工业做法(如 Azure 把 univariate/multivariate/change point 拆成三个 API)。
-
最稳的"工业基线":Prophet / STL / EWMA + Isolation Forest / GBDT + 规则告警。LSTM/Transformer 用在"有充足历史标注 + 高价值资产"场景(如电网负荷、航天器遥测、ICU 监护)。
-
数据集公开性:NSL-KDD/UNSW-NB15 老旧过拟合、NASA C-MAPSS/MIMIC/SMAP-MSL 是工业界真正反复打磨过的 benchmark,效果数据更可信。
-
TSFM 是新基础设施但非银弹:MOMENT、Chronos、Timer 等在少样本/跨域场景有亮眼表现,但工业落地仍以"统计 + DL 混合"为主。
-
业务事件 + 时序联合建模:阿里双11、京东 11.11、ByteFG 都明确表示"业务事件耦合 + 时序"的联合建模才能区分大促流量与真实异常。
九、未来趋势
-
时序基础模型(TSFM)成为新基础设施:MOMENT、Timer、Moirai 等以少样本微调达到专用 SOTA;Time-MoE、TimesFM 证明 scaling law 在时序域同样有效。
-
多模态时序 MLLM 崛起:ChatTS、TimeChat 等把时序作为新模态,瞄准时序理解与智能体(阿里 AIOps 已落地)。
-
可解释性回归:金融/医疗/电网监管收紧,SHAP + 树模型、GNN、因果推理将成主流。
-
评估方法标准化:VUS-PR、Affiliation-F1 替代 PA-F1,TSB-UAD、Exathlon 替代老旧 benchmark。
-
边缘/端侧部署:TTM(1M 参数 + CPU 推理)、轻量化 MoE 成为 IoT 场景新方向。
-
自适应 Conformal 监控:与 TSFM 结合的后验自适应阈值(Gil et al. 2026),无需微调。
-
零样本泛化是 TSFM 最大价值:传统 MTSAD 在分布外场景几乎失效,TSFM 首次实现"一次训练、多场景部署"。
-
扩散模型补位:解决 GAN 类生成器在时序上易模式坍缩的问题,并在异常检测中利用"采样不确定性"改进评分。
-
对比/重建两条路线融合:DCdetector、DBA、Focal、PSAD 等通过对比或自监督弥补纯重构方法的偏差。
-
异常检测与因果推理结合:Dynatrace Davis AI 的因果拓扑推理是方向;解释"为什么这个点异常"将成为强需求。
十、参考来源
10.1 经典模型论文
- LSTM-VAE: Park et al. T-RO 2018
- OmniAnomaly: Su et al. KDD 2019
- USAD: Audibert et al. KDD 2020
- GDN: Deng & Hooi AAAI 2021
- Anomaly Transformer: Xu et al. ICLR 2022
- TranAD: Tuli et al. VLDB 2022
- TimesNet: Wu et al. ICLR 2023
- DAGMM: Zong et al. ICLR 2018
10.2 SOTA 模型论文
- TimeGPT-1: arXiv:2310.03589
- Chronos: arXiv:2403.07815
- TimesFM: arXiv:2310.10688 (ICLR 2024)
- MOMENT: arXiv:2402.03885 (ICML 2024)
- Timer: arXiv:2402.02368
- Time-MoE: arXiv:2409.16040 (ICLR 2025)
- TTM: arXiv:2401.03955 (NeurIPS 2024)
- Diffusion-TS: arXiv:2403.01742
- Time-LLM: arXiv:2310.01728 (ICLR 2024)
- AutoTimes: arXiv:2402.02370 (NeurIPS 2024)
- ChatTS: arXiv:2412.03104 (VLDB 2025)
- LSTPrompt: arXiv:2402.16132
- Lag-Llama: arXiv:2310.08278
- DCdetector: arXiv:2306.10347 (KDD 2023)
- AnomalyCLIP: arXiv:2310.18961 (ICLR 2024)
- CARLA: arXiv:2308.09296 (PR 2024)
10.3 评测与综述
- Wu & Keogh "Elephant in the Room":arXiv:2009.13807
- VUS-PR: Paparrizos et al. ICDE 2022 & arXiv:2502.13318 (2025 优化)
- Affiliation: Huet et al. KDD 2022
- Kim et al. "Towards a Rigorous Evaluation": AAAI 2022, arXiv:2109.05257
- Correia et al. EAAI 2024: arXiv:2408.03747
- Boniol et al. "Dive into Time-Series Anomaly Detection": arXiv:2412.20512
- Sánchez-Ferrera et al. "Self-Supervised Learning for TSAD": arXiv:2501.15196
- Darban et al. "Deep Learning for TSAD Survey": ACM Computing Surveys 2024
- "Transformers in Time Series: A Survey": IJCAI 2023
10.4 工业界资料
- Datadog Watchdog: docs.datadoghq.com/watchdog/
- Elasticsearch ML: elastic.co/guide/en/machine-learning
- Microsoft Azure Anomaly Detector (SR-CNN): arXiv:1906.03821
- 阿里云 ARMS: alibabacloud.com/product/arms
- 阿里 OmniAnomaly 仓库: github.com/NetManAIOps/OmniAnomaly
- Microsoft Anomaly Detector 库: github.com/microsoft/anomaly-detector
- Salesforce Merlion: github.com/salesforce/Merlion
- Anomaly Detection Resources: github.com/yzhao062/anomaly-detection-resources
- NASA telemanom: github.com/khundman/telemanom
- NASA PCoE C-MAPSS: ti.arc.nasa.gov/tech/dash/groups/pcoe/prognostic-data-repository
- MIMIC-III/IV: physionet.org/content/mimiciii/
- Uber F3: eng.uber.com (2018 blog)
- AIOps Wikipedia: en.wikipedia.org/wiki/AIOps
- NIDS Wikipedia: en.wikipedia.org/wiki/Network_intrusion_detection_system
10.5 TSFM 开源仓库
- Chronos: github.com/amazon-science/chronos-forecasting
- TimesFM: github.com/google-research/timesfm
- MOMENT: github.com/moment-timeseries-foundation-model/MOMENT
- Timer: github.com/thuml/Large-Time-Series-Model
- Time-MoE: github.com/Time-MoE/Time-MoE
- TTM: github.com/ibm-granite/granite-timeseries-models
- Time-LLM: github.com/KimMeen/Time-LLM
- AutoTimes: github.com/thuml/AutoTimes
- ChatTS: github.com/NetManAIOps/ChatTS
- Lag-Llama: github.com/time-series-foundation-models/lag-llama
- DCdetector: github.com/DAMO-DI-ML/KDD2023-DCdetector
- TimesNet: github.com/thuml/Time-Series-Library
附录 A:术语表
| 术语 | 含义 |
|---|---|
| MTSAD | Multivariate Time Series Anomaly Detection,多维时序异常检测 |
| TSFM | Time Series Foundation Model,时间序列基础模型 |
| PA (Point Adjustment) | 一种评估协议,把"段内任一点命中"等同于"整段命中" |
| VUS-PR | Volume Under the Surface for PR,段级阈值无关评估指标 |
| POT | Peaks-Over-Threshold,极值理论阈值选取方法 |
| NF | Normalizing Flow,正则化流,用于灵活分布建模 |
| AE | AutoEncoder,自编码器 |
| VAE | Variational AutoEncoder,变分自编码器 |
| MAML | Model-Agnostic Meta Learning,模型无关元学习 |
| EWMA | Exponentially Weighted Moving Average,指数加权移动平均 |
| RCF | Robust Cut Forest,鲁棒切割森林(Isolation Forest 变体) |
| DBSCAN | Density-Based Spatial Clustering of Applications with Noise,基于密度的聚类 |
| CUSUM | Cumulative Sum,累积和控制图,用于变点检测 |
| SHAP | SHapley Additive exPlanations,可解释性方法 |
| PHM | Prognostics and Health Management,故障预测与健康管理 |
| RUL | Remaining Useful Life,剩余使用寿命 |
| WAMS | Wide Area Measurement System,广域测量系统 |
| FDA | False Data Injection,虚假数据注入 |
| LULD | Limit Up-Limit Down,熔断机制 |
| NSL-KDD | 网络入侵检测经典数据集 |
| ECG | Electrocardiogram,心电图 |
| EWS | Early Warning Score,早期预警评分 |
| MEWS | Modified Early Warning Score,改良早期预警评分 |
附录 B:报告使用建议
B.1 给产品经理
- 不要被学术 SOTA 迷惑:F1 0.95 可能是 PA 虚高
- 关注场景匹配:不同场景的最优算法差异极大
- 重视可解释性:金融/医疗/电网的硬性要求
- 关注告警收敛比:100:1 比单纯 F1 更有商业价值
- TSFM 是新趋势但非银弹:评估落地成本与收益
B.2 给算法工程师
- 基线先行:先跑 STL+EWMA+IForest,再考虑 DL
- 避免 PA 自欺:报告 VUS-PR 与 Aff-F1
- 跨数据集测试:至少 3 个不同领域
- 重视可解释性输出:SHAP / GDN 图 / 关联差异
- 考虑概念漂移:滑动窗口 + 周期性重训练
- TSFM 少样本微调:MOMENT/Chronos/Timer 是新武器
B.3 给架构师
- 混合架构:统计 + ML + 规则 + LLM
- 在线/离线分离:实时统计 + 离线深度学习
- 冷启动友好:IForest/Prophet 起家,DL 渐进引入
- 告警收敛管线:异常检测 → 关联分析 → 根因定位 → 影响面评估
- 多模态融合:时序 + 事件 + Trace + Log 联合建模
报告结束
如需进一步深入某个方向(如 Anomaly Transformer 的 minimax 训练细节、Time-MoE 的稀疏 MoE 架构、ChatTS 的合成数据生成流程、TSFM 工业部署的工程难点、Point Adjustment 的数学证明等),欢迎进一步告知,我可产出更细粒度的专题报告。