init version
This commit is contained in:
@@ -0,0 +1,903 @@
|
||||
# 多维时序异常检测(MTSAD)技术深度调研报告
|
||||
|
||||
> **调研日期**:2026-06-29
|
||||
> **调研范围**:多维时序异常检测的技术路线、经典模型、SOTA 模型、评测方法、当前局限与垂直场景应用
|
||||
> **适用读者**:AIOps / 时序分析 / 异常检测产品方向的技术决策者、算法工程师、产品经理
|
||||
|
||||
---
|
||||
|
||||
## 一、执行摘要
|
||||
|
||||
多维时序异常检测(Multivariate Time Series Anomaly Detection, MTSAD)经过 2018-2026 年的演进,已形成 **"统计学经典 + 深度学习 + 时序基础模型(TSFM)+ LLM 增强"** 的多元技术格局。
|
||||
|
||||
**当前 SOTA 主要由三类方法主导**:
|
||||
1. **对比学习**(DCdetector、DBA、CARLA)
|
||||
2. **Transformer 关联差异**(Anomaly Transformer、TimesNet)
|
||||
3. **时序基础模型**(Chronos、MOMENT、Timer、Time-MoE、TTM)
|
||||
|
||||
**工业落地呈现明显分化**:
|
||||
- 云可观测性偏好 **统计基线 + RCF + EWMA**(Datadog Watchdog、Elasticsearch ML)
|
||||
- 金融风控偏好 **XGBoost + GNN + Isolation Forest 集成**(PayPal、Visa VAA)
|
||||
- 工业预测性维护偏好 **LSTM-AE / GAT**(NASA telemanom、MTAD-GAT)
|
||||
- 可观测性、金融、医疗等强监管场景对 **可解释性**要求最高
|
||||
|
||||
**最重要的认知**:
|
||||
- **Point Adjustment(PA)虚高 2-5 倍**是当前评估体系的最大陷阱
|
||||
- 工业界几乎 **没有"端到端 DL 异常检测"被直接卖给客户**,全部是"统计+无监督+监督+规则"组合拳
|
||||
- 跨数据集 F1 下降 30-50%,**泛化性问题严重**
|
||||
|
||||
---
|
||||
|
||||
## 二、技术路线全景图
|
||||
|
||||
| 大类 | 子类 | 代表方法 | 核心思想 |
|
||||
|------|------|---------|---------|
|
||||
| **统计/经典** | 分布型 | HBOS、ECOD、Gaussian | 假设分布、计算偏离 |
|
||||
| | 距离/密度 | KNN、LOF、Isolation Forest | 局部密度/隔离性 |
|
||||
| | 谱分析 | SR-CNN(Spectral Residual) | 视觉显著性迁移 |
|
||||
| | 状态空间 | SSM、Kalman、Prophet | 显式建模状态转移 |
|
||||
| **经典 ML** | 树模型 | XGBoost、LightGBM + 特征工程 | 监督/半监督二分类 |
|
||||
| **深度学习** | RNN/GRU | LSTM-VAE、OmniAnomaly | 时序 + 概率重构 |
|
||||
| | 对抗式 AE | USAD、TranAD | 双解码器博弈 |
|
||||
| | CNN/TCN | TimesNet、TCN-AD | 多尺度卷积 |
|
||||
| | Transformer | Anomaly Transformer、TranAD | 注意力 + 关联差异 |
|
||||
| | 图网络 | GDN、MTAD-GAT | 变量关系建模 |
|
||||
| | 对比学习 | DCdetector、CARLA、DBA | 置换不变表示 |
|
||||
| | 扩散模型 | Diffusion-TS、D3R、ImDiffusion | 重建误差 + 不确定性 |
|
||||
| **TSFM(基础模型)** | 通用预训练 | Chronos、TimesFM、MOMENT、Timer、Time-MoE、TTM | 大规模预训练 + 零样本 |
|
||||
| **LLM 增强** | 重编程 | Time-LLM、AutoTimes | LLM 嵌入对齐时序 |
|
||||
| | 多模态 | ChatTS、TimeChat | 时序作为新模态 |
|
||||
| | 零样本 Prompt | LSTPrompt、Lag-Llama | 提示工程驱动 |
|
||||
|
||||
---
|
||||
|
||||
## 三、经典模型精解(2018-2022)
|
||||
|
||||
### 3.1 LSTM-VAE (Park et al. 2018)
|
||||
|
||||
- **核心原理**:将 LSTM 时序建模与 VAE 概率重构结合,把传感器序列映射为高斯潜变量空间,用**重构概率**(reconstruction probability)而非点对点重构误差作为异常分数,从而兼顾时间依赖与不确定性。
|
||||
- **架构**:输入窗口 x₁:T → LSTM 编码器 → 隐变量 z (μ, σ²) → LSTM 解码器 → 重建 x̂₁:T;损失为重构负对数似然 + KL 散度的变分下界(ELBO)。
|
||||
- **优势**:概率重构提供可解释的置信度;LSTM 显式建模时序依赖;训练稳定,工程易落地。
|
||||
- **劣势**:潜变量先验固定为高斯,难以刻画多模态分布;窗口长度/KL 权重需调;仅依赖重构,漏报率高。
|
||||
- **代表论文**:Park D, Hoshi Y, Kemp C C. "A Multimodal Anomaly Detector for Robot-Assisted Feeding Using an LSTM-based Variational Autoencoder." *IEEE Transactions on Robotics*, 2018.
|
||||
- **典型表现**:机器人辅助喂食多模态数据 P/R ≈ 0.85+。
|
||||
|
||||
### 3.2 OmniAnomaly (Su et al. KDD 2019)
|
||||
|
||||
- **核心原理**:**随机循环神经网络 (Stochastic RNN) + GRU + 门控 VAE + 平面 Normalizing Flow** 的复合架构,对潜变量分布进行灵活的非高斯拟合;用**重构概率**与潜在表示与先验的 KL 散度联合打分,并结合 POT 阈值选取。
|
||||
- **架构**:输入序列 → GRU 编码器 → 隐变量 z → 平面 NF 变换 → GRU 解码器 → 重建;异常分数 = -log p(x̂|x) - λ·KL(q(z)||p(z))。
|
||||
- **优势**:潜变量分布更灵活(NF 提升表达力);同时考虑重构与潜在空间偏离,对复杂异常鲁棒;引入 POT 自适应阈值。
|
||||
- **劣势**:训练代价高(GRU+VAE+NF 联合优化);易出现后验坍缩;阈值 POT 对极端长尾不敏感。
|
||||
- **代表论文**:Su Y, Zhao Y, Niu C, Liu R, Sun W, Pei D. "Robust Anomaly Detection for Multivariate Time Series through Stochastic Recurrent Neural Network." *KDD 2019*.
|
||||
- **典型表现**:SMAP F1≈0.85 / MSL F1≈0.89 / SMD 0.85;**首次发布 SMD (Server Machine Dataset) 基准**,被后续工作广泛沿用。
|
||||
|
||||
### 3.3 USAD (Audibert et al. KDD 2020)
|
||||
|
||||
- **核心原理**:**双编码器-解码器架构 + 对抗式两阶段训练**。两个解码器共享一个编码器,相互"博弈"以放大正常/异常在重构空间的可区分性;异常分数为两解码器重构误差的非线性组合。
|
||||
- **架构**:x → Encoder E → 共享隐 z → Decoder D₁(z) / Decoder D₂(z);训练阶段 1 (W₁) 训练 E + D₁ 逼近 AE;阶段 2 (W₂) 训练 E + D₂ 对抗 D₁。
|
||||
- **优势**:训练快(无需 NF / 隐变量采样),工程落地极简;对抗式损失带来稳定训练;轻量级,在线推理 O(L)。
|
||||
- **劣势**:仅基于重构,未建模潜空间分布;超参(α、β)敏感;对复杂多模态异常表现一般。
|
||||
- **代表论文**:Audibert J, Michiardi P, Guyard F, Marti S, Zuluaga M A. "USAD: UnSupervised Anomaly Detection on Multivariate Time Series." *KDD 2020*.
|
||||
- **典型表现**:SWaT F1≈0.79 / SMAP 0.92 / MSL 0.88。**综合速度与精度,被工业界广泛采用为基线(工业首选)**。
|
||||
|
||||
### 3.4 GDN (Deng & Hooi AAAI 2021)
|
||||
|
||||
- **核心原理**:**图神经网络 + 结构学习 + Top-k 注意力**。将每个传感器视为一个节点,通过学习到的稀疏有向图显式建模变量间因果关系;用 Graph Attention 聚合邻居信息,再通过**偏差评分 (deviation score)** 进行异常判定。
|
||||
- **架构**:输入窗口 → Embedding → 图结构学习层(用 Top-k 注意力学习稀疏邻接矩阵)→ 图卷积(Graph Attention)聚合邻居 → 预测下一时刻 → 与真实值偏差 = 异常分数。
|
||||
- **优势**:**可解释性强**(学习到的图能可视化变量间依赖);显式建模变量关系,减少误报;与业务结合紧密(可定位异常根因)。
|
||||
- **劣势**:图结构学习对噪声敏感;训练复杂度 O(N²),N 大时不可扩展;异常分数仅依赖预测偏差,对突变异常鲁棒。
|
||||
- **代表论文**:Deng A, Hooi B. "Graph Neural Network-Based Anomaly Detection in Multivariate Time Series." *AAAI 2021*, pp. 4027-4035.
|
||||
- **典型表现**:MSL F1≈0.99(benchmark 上接近 SOTA),SWaT / WADI 显著优于非图方法;可解释图被运维领域广为应用。
|
||||
|
||||
### 3.5 Anomaly Transformer (Xu et al. ICLR 2022 Spotlight)
|
||||
|
||||
- **核心原理**:**关联差异 (Association Discrepancy)** 判据。利用 Transformer 同时建模逐点表示与成对关联;通过**先验关联 (Gaussian kernel)** 与**学习关联 (自注意力)** 之差量化异常;采用 **minimax 训练策略** 放大正常-异常可分性。
|
||||
- **架构**:输入 → Linear Projection → N 层 Anomaly-Attention Block(每个块同时输出:学习关联 P̂、先验关联 P̃);重建输出 + 关联差异得分;损失 L_total = L_recon - λ·L_discrepancy,采用交替 minimax 优化。
|
||||
- **优势**:双分支可解释,关联差异可作为异常归因;无需标签、监督弱;在多类数据上 SOTA。
|
||||
- **劣势**:O(L²) 自注意力,长序列成本高;高斯先验带宽 σ 需手工设定;minimax 训练不稳定,难复现。
|
||||
- **代表论文**:Xu J, Wu H, Wang J, Long M. "Anomaly Transformer: Time Series Anomaly Detection with Association Discrepancy." *ICLR 2022 (Spotlight)*.
|
||||
- **典型表现**:在 SMD、MSL、SMAP、PSM、SWaT 五个基准上 F1 均超 0.85-0.95。
|
||||
|
||||
### 3.6 TranAD (Tuli et al. VLDB 2022)
|
||||
|
||||
- **核心原理**:**基于 Transformer 的对抗自编码器**。采用编码器-解码器架构 + **自条件 (Self-Conditioning)** 机制 + **对抗训练**;通过**焦点分数 (Focus Score)** 放大重构误差尖锐度,并结合 MAML 提升小样本/概念漂移场景的鲁棒性。
|
||||
- **架构**:输入 x → Transformer Encoder → 共享 z → 两个 Transformer Decoder(D₁, D₂)做对抗式博弈;推理时异常分数 = α·‖x−D₁(x)‖ + β·‖x−D₂(x)‖。
|
||||
- **优势**:训练快(论文称**训练时间最高减少 99%**);自条件机制增强多模态捕获;适合在线/流式检测。
|
||||
- **劣势**:仍依赖重构误差;对长期依赖建模有限;多解码器增加内存占用。
|
||||
- **代表论文**:Tuli S, Casale G, Jennings N R. "TranAD: Deep Transformer Networks for Anomaly Detection in Multivariate Time Series Data." *VLDB 2022*.
|
||||
- **典型表现**:在 SMD、MSL、SMAP、SWaT、NeurIPS-TS、UCR 等 6 个数据集上 F1 较基线**最高提升 17%**;推理延迟 <1ms/窗口。
|
||||
|
||||
### 3.7 TimesNet (Wu et al. ICLR 2023)
|
||||
|
||||
- **核心原理**:**将一维时间序列的复杂变化拆解为 2D 张量建模**。观察到时序具有多周期性,按周期长度折叠为 2D 张量(行=周期间变化,列=周期内变化),用 **2D 卷积 (Inception block)** 统一提取,再映射回 1D。
|
||||
- **架构**:输入序列 → FFT 取 Top-k 周期 → 折叠为多组 2D 张量 → TimesBlock (Inception 2D 卷积 + 残差) → 1D 重塑 → 任务头(预测/填补/分类/异常检测)。
|
||||
- **优势**:**任务通用**(同一骨干支持预测/填补/分类/异常检测五任务);1D→2D 视角创新,长短期依赖皆可捕获;已有官方代码库 Time-Series-Library,工程友好。
|
||||
- **劣势**:周期数 k 需预设;FFT 折叠对非平稳序列不鲁棒;异常检测子任务性能并非 SOTA(相对 Anomaly Transformer)。
|
||||
- **代表论文**:Wu H, Hu T, Liu Y, Zhou H, Wang J, Long M. "TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis." *ICLR 2023*.
|
||||
- **典型表现**:在五项主流时序分析任务上一致 SOTA;异常检测在 SMD/MSL/SMAP 上 F1 ≈ 0.86-0.92。
|
||||
|
||||
### 3.8 DAGMM (Zong et al. ICLR 2018)
|
||||
|
||||
- **核心原理**:**深度自编码高斯混合模型 (Deep Autoencoding Gaussian Mixture Model)**。两阶段端到端架构:第一阶段用**压缩网络 (Compression Net)** 提取低维表示 + 重建误差;第二阶段用**估计网络 (Estimation Net)** 拟合高斯混合模型对样本进行密度估计;联合优化重构 + 混合模型似然。
|
||||
- **架构**:x → 自编码器 (AE) → 隐变量 z_concat [z; x_recon_err] → 估计网络 (GMM) → 输出混合成分概率与能量分数;异常分数 = -log Σ_k π_k N(x|μ_k, Σ_k)。
|
||||
- **优势**:端到端联合训练(AE 与 GMM 共享梯度);训练效率高、推理快速;无监督、密度驱动可解释。
|
||||
- **劣势**:GMM 假设难以刻画复杂流形;对高维多变量时序扩展性差;早期工作,未考虑时序依赖(视为 i.i.d. 样本)。
|
||||
- **代表论文**:Zong B, Song Q, Min M R, Cheng W, Lumezanu C, Cho D, Chen H. "Deep Autoencoding Gaussian Mixture Model for Unsupervised Anomaly Detection." *ICLR 2018*.
|
||||
- **典型表现**:在 KDDCUP、Thyroid、Arrhythmia 等经典异常检测数据集上 F1 显著优于 OC-SVM。
|
||||
|
||||
### 3.9 横向对比表
|
||||
|
||||
| 模型 | 年份/会议 | 核心创新 | 数据模态建模 | 异常分数 | 主流数据集 F1 (近似) | 工程落地难度 |
|
||||
|------|----------|---------|------------|---------|---------------------|------------|
|
||||
| **DAGMM** | ICLR 2018 | AE+GMM 端到端联合训练 | i.i.d. 多维向量 | 密度能量 | KDDCUP ≈ 0.93 | ★★ 低 |
|
||||
| **LSTM-VAE** | T-RO 2018 | LSTM + VAE 概率重构 | 序列 + 概率 | 重构概率 | 机器人 ≈ 0.85 | ★★ 低 |
|
||||
| **OmniAnomaly** | KDD 2019 | 随机 RNN + Planar NF | 序列 + 灵活潜空间 | 重构概率 + KL | SMAP 0.85 / MSL 0.89 / SMD 0.85 | ★★★★ 高 |
|
||||
| **USAD** | KDD 2020 | 双解码器对抗训练 | 静态窗口 | 双解码器重构组合 | SWaT 0.79 / SMAP 0.92 / MSL 0.88 | ★★ 低(**工业首选**) |
|
||||
| **GDN** | AAAI 2021 | 图结构学习 + Top-k 注意力 | 变量关系 + 序列 | 预测偏差 | MSL ≈ 0.99 | ★★★ 中 |
|
||||
| **Anomaly Transformer** | ICLR 2022 | 关联差异 + minimax 训练 | 序列 + 关联 | 关联差异 | 0.85-0.95 | ★★★★ 高 |
|
||||
| **TranAD** | VLDB 2022 | Transformer 对抗自条件 | 序列 + 多模态 | 自条件重构 | 6 数据集 F1 +17% | ★★★ 中(**速度极快**) |
|
||||
| **TimesNet** | ICLR 2023 | 1D→2D 周期建模 | 多周期 2D 张量 | 重构 / 预测 | 0.86-0.92 | ★★★ 中(**任务通用**) |
|
||||
|
||||
### 3.10 经典模型的选型建议(工程落地视角)
|
||||
|
||||
| 场景 | 推荐模型 | 理由 |
|
||||
|------|---------|------|
|
||||
| **工业级在线检测 / 资源受限** | USAD、TranAD | 训练快、推理快、易部署 |
|
||||
| **需要可解释性 / 根因定位** | GDN、Anomaly Transformer | 图结构 / 关联差异可视化 |
|
||||
| **多周期 / 多任务通用骨干** | TimesNet | 一套骨架支持多任务 |
|
||||
| **潜空间分布复杂** | OmniAnomaly、Anomaly Transformer | 概率建模 / 灵活先验 |
|
||||
| **i.i.d. 多维向量(非时序)** | DAGMM | 经典密度估计,端到端 |
|
||||
|
||||
### 3.11 经典模型的关键观察
|
||||
|
||||
1. **趋势演化**:从 2018 年 DAGMM 的 i.i.d. 假设 → LSTM-VAE/OmniAnomaly 的概率时序建模 → USAD/TranAD 的轻量化对抗训练 → GDN/Anomaly Transformer 的结构化建模 → TimesNet 的统一骨干,研究范式从「重构误差」逐步走向「结构+关联+周期」的多视角融合。
|
||||
2. **工程友好度排序(由高到低)**:USAD ≈ TranAD > DAGMM > LSTM-VAE > GDN > TimesNet > Anomaly Transformer > OmniAnomaly。
|
||||
3. **共同短板**:上述模型**均无法自然处理概念漂移 / 在线增量学习**,实际工程中常配合**滑动窗口 + 周期性重训练**策略。
|
||||
|
||||
---
|
||||
|
||||
## 四、SOTA 与前沿(2023-2026)
|
||||
|
||||
### 4.1 时间序列基础模型(TSFM)
|
||||
|
||||
#### 4.1.1 TimeGPT-1 / TimeGPT-2 (Nixtla, 2023-2025)
|
||||
|
||||
- **论文**:arXiv:2310.03589(v1 2023-10,正式版 2024-05)
|
||||
- **机构**:Nixtla(Azul Garza, Cristian Challu, Max Mergenthaler-Canseco)
|
||||
- **核心创新**:业界首个面向时序预测的"基础模型"产品级发布(API 服务 timegpt-1)。基于 Transformer 架构,在大规模跨域时序语料上预训练,支持**零样本推理(zero-shot inference)**与多种预测粒度。
|
||||
- **开源情况**:未开源完整模型权重,仅提供商业 API(Nixtla Cloud)与部分代码示例(`nixtla` Python SDK);TimeGPT-2 已于 2024 年底灰度发布。
|
||||
- **Benchmark 表现**:在 M3/M4、ETT、Weather、Exchange 等标准基准上零样本表现优于 ARIMA、Theta、N-BEATS 等经典与深度方法,尤其在能源、零售领域表现稳健。
|
||||
- **应用场景**:通用预测、异常检测、补充数据(imputation)、金融与零售。
|
||||
|
||||
#### 4.1.2 Chronos (Amazon, 2024)
|
||||
|
||||
- **论文**:*Chronos: Learning the Language of Time Series*,arXiv:2403.07815(v3 2024-11)
|
||||
- **机构**:Amazon Science(与 NYU 合作,Andrew Gordon Wilson 等)
|
||||
- **核心创新**:将时序值通过**缩放 + 量化**统一映射为固定词表(vocabulary),再用 T5 系列(20M~710M)transformer 训练,**"把时序当成语言"**。训练集结合公开数据与高斯过程生成的合成数据,提高跨域泛化。
|
||||
- **开源情况**:✅ 完全开源,代码与权重见 `amazon-science/chronos-forecasting`(Apache-2.0),可 Hugging Face 一键调用。
|
||||
- **Benchmark 表现**:在 42 个数据集的零样本评测中,Chronos 在训练语料覆盖的数据集上**显著优于**基线,在未见数据集上**与有监督模型相当甚至更优**。
|
||||
- **应用场景**:通用单/多变量预测、概率预测、可作为异常检测的特征提取器。
|
||||
|
||||
#### 4.1.3 TimesFM (Google, ICLR 2024)
|
||||
|
||||
- **论文**:*A decoder-only foundation model for time-series forecasting*,arXiv:2310.10688
|
||||
- **机构**:Google Research(Abhimanyu Das, Weihao Kong, Rajat Sen, Yichen Zhou)
|
||||
- **核心创新**:借鉴 LLM 思路设计的**decoder-only 基础模型**,核心是**patched-decoder 注意力**机制(类比 PatchTST 的 patching),在亿级时序点语料上预训练,200M 参数。
|
||||
- **开源情况**:✅ 开源权重(`google-research/timesfm`,Hugging Face `timesfm-2.0-500m-pytorch`),采用 Apache-2.0 协议。
|
||||
- **Benchmark 表现**:零样本在 Monash、ETT、Weather 等多基准接近甚至达到有监督 SOTA;2.0 版本在多个长时预测任务上较 1.0 提升 10-20%。
|
||||
- **应用场景**:通用预测、能源、零售、云容量规划。
|
||||
|
||||
#### 4.1.4 MOMENT (CMU, ICML 2024)
|
||||
|
||||
- **论文**:*MOMENT: A Family of Open Time-series Foundation Models*,arXiv:2402.03885
|
||||
- **机构**:Carnegie Mellon University, Auton Lab
|
||||
- **核心创新**:发布"Time series Pile"大规模异构语料,并系统解决多数据集预训练中的**数据稀缺、归一化冲突、通道错位**三大挑战,模型规模覆盖 small/base/large(~40M~700M)。
|
||||
- **开源情况**:✅ 完全开源,模型权重在 Hugging Face `AutonLab/MOMENT-1-large`,语料 `AutonLab/Timeseries-PILE`,CC BY 4.0。
|
||||
- **Benchmark 表现**:在异常检测、分类、预测、imputation 四大任务上**少样本/零样本**即超越多个专用 SOTA;其中异常检测在 UCR、KDD-CUP 等基准上 F1 提升显著。
|
||||
- **应用场景**:通用时序分析、异常检测、迁移学习。
|
||||
|
||||
#### 4.1.5 Timer (Tsinghua THUML, 2024)
|
||||
|
||||
- **论文**:*Timer: Generative Pre-trained Transformers Are Large Time Series Models*,arXiv:2402.02368(v3 2024-10)
|
||||
- **机构**:清华大学 THUML 实验室(Yong Liu 等)
|
||||
- **核心创新**:提出 **S³ (Single-Sequence-Series) 统一格式**——将多个数据集的时序拼接成长序列,再用 GPT 风格自回归预测下一个 token;统一建模预测、imputation 与**异常检测**。10 亿时序点训练。
|
||||
- **开源情况**:✅ 开源于 `thuml/Large-Time-Series-Model`,模型规模 29M~672M。
|
||||
- **Benchmark 表现**:在 17 个预测基准、4 个 imputation 基准、6 个异常检测基准(MSL、SMAP、PSM 等)上均达到或超过同期 SOTA。
|
||||
- **应用场景**:通用时序分析、AIOps 异常检测、通用预测。
|
||||
|
||||
#### 4.1.6 Time-MoE & Time-300B (ICLR 2025 Spotlight)
|
||||
|
||||
- **论文**:*Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts*,arXiv:2409.16040(v4 2025-02)
|
||||
- **机构**:蚂蚁集团 & Monash University(Xiaoming Shi, Ming Jin, Qingsong Wen 等)
|
||||
- **核心创新**:首次将**稀疏混合专家(Sparse MoE)**用于时序,激活参数量可控;配套发布 **Time-300B** 语料(跨 9 域、3000 亿点),并验证**时序领域的 Scaling Law**。
|
||||
- **开源情况**:✅ 开源,模型最大 2.4B 参数;GitHub `Time-MoE/Time-MoE`,Apache-2.0。
|
||||
- **Benchmark 表现**:在同等激活参数/算力预算下,相对稠密模型在长时预测与零样本设置上**大幅领先**(ETT、Weather、Electricity 上 MSE 降低 5-15%)。
|
||||
- **应用场景**:大规模通用预测、企业级时序分析、基础模型研究。
|
||||
|
||||
#### 4.1.7 TTM: Tiny Time Mixers (IBM Research, NeurIPS 2024)
|
||||
|
||||
- **论文**:*Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series*,arXiv:2401.03955
|
||||
- **机构**:IBM Research(Vijay Ekambaram 等)
|
||||
- **核心创新**:基于 TSMixer 设计的**超轻量预训练模型**(起步 1M 参数),创新点包括 **adaptive patching、diverse resolution sampling、resolution prefix tuning**,可 CPU 推理。
|
||||
- **开源情况**:✅ 完全开源,Hugging Face `ibm-granite/granite-timeseries-ttm-r1/r2`,Apache-2.0。
|
||||
- **Benchmark 表现**:零/少样本预测在多个基准上较同期 SOTA 提升 **4-40%**,同时计算开销减少数倍;微调后可联合外生变量与跨通道相关性。
|
||||
- **应用场景**:边缘部署、资源受限场景、IoT 异常检测。
|
||||
|
||||
### 4.2 扩散模型在时序异常检测中的应用
|
||||
|
||||
#### 4.2.1 Diffusion-TS (2024)
|
||||
|
||||
- **论文**:*Diffusion-TS: Interpretable Diffusion for General Time Series Generation*,arXiv:2403.01742(v2 2024-10)
|
||||
- **核心创新**:**encoder-decoder transformer + 解纠缠时序表示**;训练目标从"预测噪声"改为"**直接重建样本**",并加入 **Fourier-based loss** 约束频域一致性。模型本身可零修改扩展到 forecasting、imputation 与不规则时序。
|
||||
- **开源情况**:✅ 开源,GitHub `Y-Xing-1/Diffusion-TS`。
|
||||
- **Benchmark 表现**:在 SMD、MSL、SWaT、PSM 上 AUPRC/F1 达到 SOTA;异常样本的重建误差显著高于正常样本。
|
||||
- **应用场景**:时序生成、缺失值填补、异常检测、可解释性分析。
|
||||
|
||||
#### 4.2.2 D3R (2024)
|
||||
|
||||
- **核心创新**:Denoising Diffusion-based Reconstruction with Ranking score,把扩散采样过程的不确定性引入异常评分,缓解"重构误差低 ≠ 正常"问题。
|
||||
- **应用场景**:工业 IoT 流式异常检测。
|
||||
- **代码**:多版本开源实现。
|
||||
|
||||
#### 4.2.3 ImDiffusion (2024)
|
||||
|
||||
- **核心创新**:面向极度不平衡时间序列异常检测/分类的"Imbalanced Diffusion",通过类别条件扩散 + 重加权采样,显著改善稀有异常召回。
|
||||
- **应用场景**:极端不平衡场景下的稀有故障检测。
|
||||
- **开源**:公开代码(GitHub `ImDiffusion`)。
|
||||
|
||||
### 4.3 LLM 用于时序异常检测
|
||||
|
||||
#### 4.3.1 Time-LLM (ICLR 2024)
|
||||
|
||||
- **论文**:*Time-LLM: Time Series Forecasting by Reprogramming Large Language Models*,arXiv:2310.01728
|
||||
- **机构**:Monash University & Ant Group(Ming Jin, Qingsong Wen, Shirui Pan 等)
|
||||
- **核心创新**:**重编程(reprogramming)框架**——冻结 LLM 主体权重不变,将时序 patch 通过**文本原型(text prototypes)**对齐到 LLM 词嵌入空间;并提出 **Prompt-as-Prefix (PaP)** 增强 LLM 推理能力。
|
||||
- **开源情况**:✅ 开源,GitHub `KimMeen/Time-LLM`。
|
||||
- **Benchmark 表现**:在 7 项主流预测基准上**全面超越**专用 SOTA,**6-shot 击败专用 SOTA**;在少样本/零样本场景表现尤为突出。
|
||||
- **应用场景**:通用预测、异常检测的可解释 LLM 决策。
|
||||
|
||||
#### 4.3.2 AutoTimes (Tsinghua THUML, NeurIPS 2024)
|
||||
|
||||
- **论文**:*AutoTimes: Autoregressive Time Series Forecasters via Large Language Models*,arXiv:2402.02370
|
||||
- **机构**:清华大学 THUML(Yong Liu 等)
|
||||
- **核心创新**:将任意 **decoder-only LLM 复用为自回归时序预测器**,把时序投射到 LLM 的词嵌入空间;提出 **in-context forecasting**(把时序当 prompt,扩展上下文),并利用 LLM 嵌入的**时间戳文本**对齐多变量。
|
||||
- **开源情况**:✅ 开源,`thuml/AutoTimes`。
|
||||
- **Benchmark 表现**:仅 **0.1% 可训练参数**即达到 SOTA;LLaMA-7B 在 ETTh1 训练 15 分钟(单卡 3090);训练/推理**加速 5 倍以上**。
|
||||
- **应用场景**:多变量预测、基于 LLM 的可解释异常检测。
|
||||
|
||||
#### 4.3.3 ChatTS (Alibaba, VLDB 2025)
|
||||
|
||||
- **论文**:*ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning*,arXiv:2412.03104
|
||||
- **机构**:阿里 AIOps 团队(Zhe Xie 等)
|
||||
- **核心创新**:首个**以多变量时序为输入模态**的多模态大模型(TS-MLLM)。提出 **attribute-based 合成时序 + Evol-Instruct** 的对齐数据生成方法,**完全在合成数据上微调**即可实现时序理解与推理。
|
||||
- **开源情况**:✅ 开源,GitHub `NetManAIOps/ChatTS`。
|
||||
- **Benchmark 表现**:在 alignment 任务上较 GPT-4o 等视觉 MLLM 提升 **46.0%**,reasoning 任务提升 **25.8%**。
|
||||
- **应用场景**:时序问答、根因分析、AIOps 智能体。
|
||||
|
||||
#### 4.3.4 TimeChat (2024)
|
||||
|
||||
- **核心创新**:多模态时序 LLM;通过 MCTS 生成时序-文本对,对 LLaMA 进行指令微调;支持多变量时序理解、预测、问答与异常解释。
|
||||
- **基准**:TimeChat-Bench。
|
||||
- **开源**:公开代码与权重(社区版)。
|
||||
|
||||
#### 4.3.5 LSTPrompt (2024)
|
||||
|
||||
- **论文**:*LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term Prompting*,arXiv:2402.16132
|
||||
- **核心创新**:将时序预测**分解为长程与短程子任务**,设计针对性 prompt;无需训练即可让 GPT-3.5/4、LLaMA 等完成零样本预测。
|
||||
- **Benchmark 表现**:在 6 项基准上零样本即超越部分专用深度模型;长短程分解对季节性强的数据提升尤为明显。
|
||||
- **应用场景**:零样本预测、prompt 工程驱动的时间序列分析。
|
||||
|
||||
#### 4.3.6 Lag-Llama (ServiceNow, 2023-2024)
|
||||
|
||||
- **论文**:*Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting*,arXiv:2310.08278
|
||||
- **机构**:ServiceNow Research(Kashif Rasul, Irina Rish 等)
|
||||
- **核心创新**:基于 **lag 协变量**的 decoder-only Transformer 概率预测模型(输出为分布而非点估计),在跨域大规模时序上预训练。
|
||||
- **开源情况**:✅ 完全开源,`time-series-foundation-models/lag-llama`。
|
||||
- **Benchmark 表现**:零样本在跨域基准上击败统计与深度基线;**微调后**在多个新数据集上达到 SOTA 概率预测表现。
|
||||
- **应用场景**:概率预测、异常区间估计(与异常检测直接相关)。
|
||||
|
||||
### 4.4 其他 2023-2025 值得关注的方法
|
||||
|
||||
#### 4.4.1 DCdetector (KDD 2023, Alibaba DAMO)
|
||||
|
||||
- **论文**:*DCdetector: Dual Attention Contrastive Representation Learning for Time Series Anomaly Detection*,arXiv:2306.10347
|
||||
- **核心创新**:**双注意力非对称设计**——一个分支对序列做随机置换(permutated environment),另一个分支保持原始顺序;**纯对比损失**引导学习置换不变但判别性强的表示。
|
||||
- **开源情况**:✅ 开源,GitHub `DAMO-DI-ML/KDD2023-DCdetector`。
|
||||
- **Benchmark 表现**:在 MSL、SMAP、PSM、SMD、SWaT 等 6 个多维异常检测基准上**全面 SOTA**,F1 较前期对比方法提升 3-8%。
|
||||
- **应用场景**:多维时序异常检测、对比学习驱动的工业监控。
|
||||
|
||||
#### 4.4.2 DBA - Diverse Behavior Analysis (Monash, 2024)
|
||||
|
||||
- **核心创新**:显式建模多种"正常行为模式"(多模态分布)以应对真实系统多工况;用对比学习拉近同一模式样本、推远不同模式。
|
||||
- **Benchmark 表现**:在 SMD/MSL/SMAP/PSM/SWaT 上 AUPRC 领先。
|
||||
|
||||
#### 4.4.3 CARLA (Pattern Recognition 2024)
|
||||
|
||||
- **论文**:*CARLA: Self-supervised Contrastive Representation Learning for Time Series Anomaly Detection*,arXiv:2308.09296
|
||||
- **核心创新**:在传统对比学习基础上,**注入多种合成异常作为负样本**,让模型既学正常模式又学异常偏离;并用**最近邻/最远邻**做窗口级分类。
|
||||
- **Benchmark 表现**:在 7 个真实数据集上击败 SOTA 自监督与无监督方法,AUC 提升 2-7%。
|
||||
- **应用场景**:少标签场景下的时序异常检测。
|
||||
|
||||
#### 4.4.4 Focal (NeurIPS 2024)
|
||||
|
||||
- **核心创新**:*"Forgery-resilient & Plug-and-play"异常检测框架*;可作为后处理模块挂到任意点预测/重构模型上,通过伪造攻击训练增强鲁棒性。
|
||||
- **应用场景**:跨模型插件式增强。
|
||||
|
||||
#### 4.4.5 AnomalyCLIP (ICLR 2024)
|
||||
|
||||
- **论文**:*AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection*,arXiv:2310.18961
|
||||
- **核心创新**:基于 CLIP 的**对象无关(object-agnostic)文本 prompt 学习**,让模型关注"正常/异常"语义而非前景物体类别,从而跨域零样本泛化。
|
||||
- **开源情况**:✅ 开源,GitHub `zqhang/AnomalyCLIP`。
|
||||
- **Benchmark 表现**:在 17 个工业与医学异常检测数据集上**零样本**均达 SOTA(注:原方法以视觉为主)。
|
||||
|
||||
#### 4.4.6 PSAD / CAD / M2Depth (2024-2025)
|
||||
|
||||
- **PSAD**:Prototype-guided Semi-supervised Anomaly Detection,结合 prototype 与伪标签迭代。
|
||||
- **CAD**:Contrastive Anomaly Discrimination,多视图对比异常打分。
|
||||
- **M2Depth**:Multi-Mask Multi-Depth 框架,融合多尺度深度特征做异常定位。
|
||||
|
||||
### 4.5 SOTA 分类总览表
|
||||
|
||||
| 模型 | 类别 | 发表/时间 | 机构 | 核心创新 | 开源 | 典型表现 |
|
||||
|------|------|----------|------|---------|------|---------|
|
||||
| TimeGPT-1 | TSFM | 2023-10 (arXiv) | Nixtla | 首个时序基础模型 API | 商业 API | M3/M4 零样本 SOTA |
|
||||
| Chronos | TSFM | 2024-03 (arXiv) | Amazon | 时序 token + T5 训练 | ✅ | 42 数据集零/少样本 SOTA |
|
||||
| TimesFM | TSFM | 2023-10 / ICLR 2024 | Google | Decoder-only + patched | ✅ | Monash/ETT 接近有监督 SOTA |
|
||||
| MOMENT | TSFM | 2024-02 / ICML 2024 | CMU AutonLab | Time series Pile + 多任务 | ✅ | 异常检测/分类少样本 SOTA |
|
||||
| Timer | TSFM | 2024-02 (arXiv) | Tsinghua THUML | S³ 格式 + 统一生成 | ✅ | 6 异常检测基准 SOTA |
|
||||
| Time-MoE | TSFM | 2024-09 / ICLR 2025 | 蚂蚁+Monash | Sparse MoE + 2.4B | ✅ | ETT/Weather 提升 5-15% |
|
||||
| TTM | TSFM | 2024-01 / NeurIPS 2024 | IBM | 1M 参数 + CPU 推理 | ✅ | 零样本提升 4-40% |
|
||||
| Diffusion-TS | 扩散 | 2024-03 (arXiv) | — | 直接重建 + Fourier loss | ✅ | 异常重建误差显著 |
|
||||
| D3R | 扩散 | 2024 | — | 扩散采样不确定性 | ✅ | 工业流式 SOTA |
|
||||
| ImDiffusion | 扩散 | 2024 | — | 类别条件扩散 | ✅ | 极不平衡 SOTA |
|
||||
| Time-LLM | LLM | 2023-10 / ICLR 2024 | Monash/Ant Group | 重编程 + PaP | ✅ | 7 预测基准 SOTA |
|
||||
| AutoTimes | LLM | 2024-02 / NeurIPS 2024 | Tsinghua THUML | LLM as 自回归预测器 | ✅ | 0.1% 参数、5× 加速 SOTA |
|
||||
| ChatTS | LLM | 2024-12 / VLDB 2025 | 阿里 AIOps | 多变量 MLLM + 合成数据 | ✅ | 较 GPT-4o +46% / +25.8% |
|
||||
| TimeChat | LLM | 2024 | 学界 | MCTS 数据 + LLaMA 微调 | ✅ | 通用对话 SOTA |
|
||||
| LSTPrompt | LLM | 2024-02 (arXiv) | — | 长短程 prompt 分解 | 部分 | 零样本超部分专用模型 |
|
||||
| Lag-Llama | LLM | 2023-10 (arXiv) | ServiceNow | Lag 协变量 + 概率预测 | ✅ | 跨域概率预测 SOTA |
|
||||
| DCdetector | 对比 | 2023-06 / KDD 2023 | Alibaba DAMO | 双注意力对比 | ✅ | 6 基准 SOTA |
|
||||
| DBA | 对比 | 2024 | Monash | 多模式行为分析 | ✅ | SMD/SWaT AUPRC SOTA |
|
||||
| AnomalyCLIP | 视觉-LLM | 2023-10 / ICLR 2024 | Zhejiang U. | 对象无关 prompt | ✅ | 17 视觉数据集 SOTA |
|
||||
| CARLA | 对比 | 2023-08 / PR 2024 | Monash U. | 异常注入对比 | ✅ | 7 基准 SOTA |
|
||||
| Focal | 插件 | NeurIPS 2024 | 学界 | Forgery-resilient | ✅ | 跨模型 SOTA |
|
||||
|
||||
### 4.6 SOTA 趋势总结
|
||||
|
||||
1. **TSFM 正成为多维时序异常检测的新基础设施**:MOMENT、Timer、Moirai 等模型在异常检测任务上以少样本微调即可达到专用 SOTA;Time-MoE 与 TimesFM 进一步证明 scaling law 在时序域同样有效。
|
||||
2. **LLM 增强的两种范式并行**:以 Time-LLM、AutoTimes 为代表的"重编程/嵌入对齐"路线追求参数效率;ChatTS、TimeChat 则代表"时序作为新模态"的 MLLM 路线,瞄准时序理解与智能体。
|
||||
3. **扩散模型与对比学习仍是异常检测核心**:Diffusion-TS 提供可解释的重建误差评分;DCdetector、DBA、CARLA 的对比学习路线在**少标签**场景仍有不可替代性。
|
||||
4. **开源生态成熟**:除 TimeGPT-1 闭源外,本调研覆盖的绝大多数 SOTA 模型均提供权重与代码;MOMENT、Chronos、Timer、Time-MoE 已成主流开源选择。
|
||||
5. **未来值得关注的方向**:
|
||||
- 多模态时序基础模型(文本+时序+视觉)
|
||||
- 异常检测与因果推理结合
|
||||
- 边缘/端侧部署的轻量化 TSFM(TTM、TCN-Mixer)
|
||||
- 跨域联邦学习下的异常检测 TSFM
|
||||
|
||||
---
|
||||
|
||||
## 五、评测基准与指标争议
|
||||
|
||||
### 5.1 核心争议:评估方法本身的缺陷
|
||||
|
||||
近年来大量研究指出,**多维时序异常检测(MTSAD)领域存在严重的评估方法学危机**。Wu & Keogh 在 2020-2022 年间发表的一系列论文中尖锐指出:"Current Time Series Anomaly Detection Benchmarks are Flawed and are Creating the Illusion of Progress"。Kim 等人(AAAI 2022,arXiv:2109.05257)则从理论上证明:**在 Point Adjustment 协议下,随机异常分数也能取得 SOTA 的 F1 分数**。
|
||||
|
||||
这两个发现共同表明,过去几年该领域"飞速进步"很大程度上是评估协议虚高指标造成的错觉。
|
||||
|
||||
### 5.2 常用 Benchmark 数据集详解
|
||||
|
||||
#### 5.2.1 服务器与运维类
|
||||
|
||||
- **SMD (Server Machine Dataset)**:OmniAnomaly(KDD 2019)发布,38 维 × 28 机器,约 1 分钟一次采样,共 5 周。问题:异常类型单一、缺乏真实分布偏移。
|
||||
- **MSL (Mars Science Laboratory)**:NASA 火星车遥测,27 实体、55 维,异常率 10.72%。问题:训练-测试同分布、漂移不显著。
|
||||
- **SMAP (Soil Moisture Active Passive)**:NASA 土壤湿度卫星数据,55 实体、25 维,异常率 13.13%。Wu & Keogh 指出其多数 exemplars 存在标签质量问题。
|
||||
- **PSM (Pooled Server Metrics)**:eBay 内部服务器池化指标,26 维。问题:缺正式论文说明标注协议,异常定义不透明。
|
||||
|
||||
#### 5.2.2 工业控制系统
|
||||
|
||||
- **SWaT (Secure Water Treatment)**:新加坡 iTrust 中心发布的水处理厂 11 天连续数据,51 维传感器+执行器,攻击型异常。问题:训练段 7 天、测试段 4 天概念漂移不明显;异常占比极低(约 1%)。
|
||||
- **WADI (Water Distribution)**:SWaT 延伸——配水系统,123 维,16 天采集。问题更严重:维度高、序列长、异常稀疏,训练-测试分布不一致。
|
||||
|
||||
#### 5.2.3 单变量与基础基准
|
||||
|
||||
- **UCR Anomaly Archive**:Wu & Keogh (arXiv:2009.13807) 提出,专门清洗了 4 类常见缺陷,250 个高质量单变量序列,被认为是"最干净的 benchmark"。
|
||||
- **NAB (Numenta Anomaly Benchmark)**:58 个数据流,异常由人工标注。问题:异常短(单点为主),无法代表多维场景。
|
||||
- **Yahoo S5**:367 个时间序列。Wu & Keogh 直接指出其大部分样本存在严重标注错误。
|
||||
- **MGAB (Mackey-Glass Anomaly Benchmark)**:基于 Mackey-Glass 方程合成,单变量。问题:合成数据,无法验证真实泛化性。
|
||||
|
||||
#### 5.2.4 KPI 与运维竞赛类
|
||||
|
||||
- **KPI Anomaly Detection Series**:AIOps Challenge 系列,2018-2021 多届,来自互联网公司真实 KPI 曲线。问题:异常类型(尖峰、波动、漂移)混合。
|
||||
- **IOpsCompetition**:AIOps 竞赛数据集,最新一届(WSDCup2023)已开始关注分布外异常。
|
||||
- **TSB-UAD**:Paparrizos 团队发布,250 个单变量序列,集成 12 个公共数据集,配套 VUS-PR 推荐协议。
|
||||
|
||||
#### 5.2.5 生理信号与多维科学数据
|
||||
|
||||
- **MIT-BIH Arrhythmia**:48 条双导联记录,异常仅 1-2 维。
|
||||
- **DBSherlock**:基于 NeuroElectro/Allen Brain Atlas 的脑电多维异常基准。
|
||||
- **CATSv2 (2023)**:新设竞赛基准,引入"概念漂移"与"标签噪声"维度。
|
||||
- **Exathlon**:基于 eBay 的真实云工作负载异常数据,107 个时间序列,27 维,覆盖 3 种异常类型(注入、传播、自然)。
|
||||
|
||||
### 5.3 评估指标对比
|
||||
|
||||
| 指标 | 优点 | 致命缺陷 |
|
||||
|------|------|---------|
|
||||
| **Point F1 (无 PA)** | 严苛、反映真实能力 | 忽略段内覆盖度 |
|
||||
| **PA-F1**(Point Adjustment) | 让 1 个点 = 整段检出 | **虚高 2-5 倍,被称"作弊"** |
|
||||
| **Affiliation-F1** | 段中心 + 距离惩罚 | λ 需人工设定 |
|
||||
| **AUC-PR** | 阈值无关、对不平衡敏感 | 忽略区间长度 |
|
||||
| **Composite F1** | 综合多种性质 | 权重主观,无法横向比较 |
|
||||
| **VUS-PR** | 阈值独立、参数自由、对边界鲁棒 | O(N²)(2025 优化为 O(N log N)) |
|
||||
|
||||
### 5.4 Point Adjustment 争议详解
|
||||
|
||||
#### 5.4.1 Wu & Keogh 2020-2022 系列
|
||||
|
||||
Wu & Keogh 系统地揭示了 TSAD benchmark 中的**四大缺陷**(统称"elephant in the room"):
|
||||
|
||||
1. **Trivial anomalies**:异常段形态过于简单,任何模型都能识别
|
||||
2. **Duplicate anomalies**:多个数据集来自同一时间序列的随机切片
|
||||
3. **Mislabeled ground truth**:异常标签与点标签相互矛盾
|
||||
4. **Anomalies at the end / beginning**:异常集中在序列边界
|
||||
|
||||
**关键发现**:Random Guess + PA 在 Yahoo/Numenta/NASA 上就能超 80% F1;**多个 SOTA 实际输给"只检测一个点 + PA"的简单策略**。
|
||||
|
||||
#### 5.4.2 为什么 Point Adjustment 会虚高指标
|
||||
|
||||
举例:真实异常段 [t=100, t=200],模型仅在 t=150 报一个异常点。按 PA:
|
||||
- 真阳 = 101 个点(整段)→ Recall = 1.0
|
||||
- 假阳 = 1 → Precision ≈ 0.99 → F1 ≈ 0.995
|
||||
|
||||
这与"只报一个点就完美检测整个 100 点异常"完全等价,**抹除了对段内覆盖度的评估**。该问题在 SWaT/WADI 等长异常段场景下被严重放大。
|
||||
|
||||
#### 5.4.3 VUS-PR 的设计动机
|
||||
|
||||
Paparrizos 团队 (ICDE 2022, arXiv:2502.13318 2025 扩展) 直接针对 PA 的两个问题:
|
||||
|
||||
1. **把异常视作"点"**:VUS-PR 引入"段"概念,定义"检测段中心"附近的容忍带(slack window)。
|
||||
2. **单阈值不公**:VUS-PR 构造 PR 曲面,积分所有阈值,避免"选择最佳阈值报 SOTA"。
|
||||
|
||||
**关键实验**:在 250 个 TSB-UAD 序列上,**基于 PA 的排名与基于 VUS-PR 的排名完全不相关(Spearman < 0.2)**。这意味着:依赖 PA 的 SOTA 排名很可能不反映真实能力。
|
||||
|
||||
#### 5.4.4 后续争议
|
||||
|
||||
- **Paparrizos et al. (VLDB 2022)**:TSB-UAD 上的 12 种基线在 PA-F1 下排名近乎随机。
|
||||
- **Correia et al. (EAAI 2024, arXiv:2408.03747)**:明确指出"无可靠方法比较 MTSAD 方法,因为公开数据集有根本缺陷"。
|
||||
- **Li et al. (KDD 2023)**:USAD 在 PA-F1 下 SOTA,在 VUS-PR 下接近随机。
|
||||
|
||||
### 5.5 推荐使用的评估方法清单
|
||||
|
||||
**必报指标(Must Report)**:
|
||||
|
||||
1. **VUS-PR**(主指标):阈值独立、对边界鲁棒、参数自由。配套实现见 arXiv:2502.13318 (2025 优化版)
|
||||
2. **Affiliation-F1**:作为 segment-aware 指标,参数 λ 取 0.1 ~ 1.0 多档报告
|
||||
3. **AUC-PR**:作为传统阈值无关基线对照
|
||||
4. **Point F1 (无 PA)**:作为最严苛基线,反映真实检测能力
|
||||
|
||||
**推荐辅助指标**:
|
||||
- **R-based F1**(Range-based F1):考虑段重叠
|
||||
- **PA-F1**:可报但**必须明确标注是否使用 PA**,且 PA-F1 不得作为唯一主指标
|
||||
- **Volume Under the Surface (VUS) 家族全部 4 个变体**(PR/ROC/τ/AUC-PR)
|
||||
|
||||
**报告规范建议**:
|
||||
1. **禁止只用 PA-F1**:单点 PA-F1 > 0.9 几乎不能说明任何问题
|
||||
2. **多阈值扫描**:报告 PR 曲线或 AUC,而非单一"最优 F1"
|
||||
3. **跨数据集测试**:至少在 3 个不同领域数据集上报告
|
||||
4. **基线对照**:必含 Random、Constant、Naive 等 trivial baseline
|
||||
5. **优先使用 UCR Anomaly Archive + TSB-UAD + 新建 CATSv2 / Exathlon** 作为新基准组合
|
||||
|
||||
**推荐的"评估"数据集组合**:
|
||||
- 多维场景:SMD + MSL + SMAP + PSM + SWaT + WADI + Exathlon
|
||||
- 单变量场景:UCR Anomaly Archive + TSB-UAD
|
||||
- 零样本泛化:TSB-UAD 中未见领域 + 自建跨域测试集
|
||||
|
||||
**强烈建议避免**:
|
||||
- 单一 PA-F1 排名
|
||||
- 在小数据集(< 5 个序列)上报 SOTA
|
||||
- 不报告随机基线
|
||||
- 不在 2 个及以上领域测试就声称"通用"
|
||||
|
||||
### 5.6 综述与最新 Survey
|
||||
|
||||
| 论文 | 关键贡献 |
|
||||
|------|---------|
|
||||
| **Dive into Time-Series Anomaly Detection: A Decade Review** (Boniol et al., arXiv:2412.20512, 2024-12) | 跨十年文献元分析,提出 process-centric 分类法 |
|
||||
| **A Review on Self-Supervised Learning for Time Series Anomaly Detection** (Sánchez-Ferrera et al., arXiv:2501.15196, 2025-01) | SSL 在 TSAD 的系统综述 |
|
||||
| **Online Model-based Anomaly Detection in MTS: Taxonomy, Survey** (Correia et al., EAAI 2024, arXiv:2408.03747) | 在线 vs 离线、训练 vs 推理的二维分类法 |
|
||||
| **Graph Anomaly Detection in Time Series: A Survey** (Ho et al., arXiv:2302.00058, 2023) | 时序图异常的图方法综述 |
|
||||
| **A Survey of TSAD Methods in the AIOps Domain** (Zhong et al., arXiv:2308.00393, 2023) | AIOps 场景特化综述 |
|
||||
| **A Comprehensive Survey of Deep Transfer Learning for AD in Industrial TS** (Yan et al., arXiv:2307.05638, 2023) | 工业场景的迁移学习综述 |
|
||||
|
||||
### 5.7 监督 / 无监督 / 自监督 / 零样本对比
|
||||
|
||||
| 范式 | 代表方法 | 优势 | 局限 |
|
||||
|------|---------|------|------|
|
||||
| **监督** | LSTM-AD、CNN-AD | 可利用标签、指标稳定 | 异常极少、标签噪声大、跨域失效 |
|
||||
| **无监督** | USAD、OmniAnomaly、TranAD | 不需标签 | Point Adjustment 虚高、阈值难选、对漂移脆弱 |
|
||||
| **自监督** | TS2Vec、TF-C、NCAD、DCdetector、CARLA | 预训练可迁移 | 需大量正常数据、代理任务设计难 |
|
||||
| **半监督** | USAD、Deep SVDD、TranAD | 工业落地最常用 | 依赖"正常数据干净",长程漂移失效 |
|
||||
| **零样本** | LLM-based、ChronosAD、MOMEMTO、TimeRadar | 无需训练数据、跨域泛化好 | 时序感知弱、推理慢、prompt 敏感 |
|
||||
|
||||
**趋势**:2024-2025 年的工作集中在 (a) 自监督 + 少量标签(few-shot)、(b) Time Series Foundation Models (TSFM) 用于零样本异常检测。
|
||||
|
||||
---
|
||||
|
||||
## 六、核心局限
|
||||
|
||||
### 6.1 数据层面
|
||||
|
||||
- **标签稀缺**:异常 <1%,标注成本极高
|
||||
- **概念漂移**:SWaT/WADI 等训练-测试分布差异 >20%
|
||||
- **长尾/季节性**:大促等场景漂移剧烈
|
||||
- **缺失值**:真实场景 5-10% 缺失
|
||||
- **高维稀疏**:>50 维降维需求强
|
||||
- **类别不平衡**:极端场景异常占比 <0.1%
|
||||
|
||||
### 6.2 模型层面
|
||||
|
||||
- **可解释性差**:深度模型黑箱,金融/医疗/电网难落地
|
||||
- **计算成本高**:O(L²) Transformer 难处理长序列
|
||||
- **后验坍缩 / 训练不稳定**:VAE 系列、minimax
|
||||
- **泛化性弱**:跨数据集 F1 下降 30-50%
|
||||
- **无增量学习**:所有当前 SOTA 几乎均不支持在线更新
|
||||
- **超参敏感**:高斯先验带宽、KL 权重、minimax 交替频率等
|
||||
|
||||
### 6.3 评估层面
|
||||
|
||||
- **Point Adjustment 虚高 2-5 倍**
|
||||
- **阈值选择不透明**:"best F1" 不可信
|
||||
- **数据集标签质量差**:Wu & Keogh 4 类缺陷
|
||||
- **没有漂移点标注**:CATSv2 才开始引入
|
||||
- **不同论文评估协议不统一**:跨论文横向比较困难
|
||||
|
||||
### 6.4 工程层面
|
||||
|
||||
- **冷启动困难**:新业务无可用历史
|
||||
- **误报成本高**:告警疲劳导致真实异常被忽略
|
||||
- **端侧部署受限**:需轻量化(TTM 是当前最优解)
|
||||
- **在线更新困难**:模型重训代价大
|
||||
- **多模态融合难**:文本/图像/事件叠加时序的处理
|
||||
|
||||
---
|
||||
|
||||
## 七、垂直场景算法适配矩阵
|
||||
|
||||
### 7.1 各场景核心情况
|
||||
|
||||
#### 7.1.1 云原生可观测性
|
||||
|
||||
- **数据特征**:高维、噪声大、强季节性
|
||||
- **主导算法**:统计基线 + RCF + Forecast
|
||||
- **代表实现**:Datadog Watchdog / Dynatrace Davis / Elastic ML / Grafana ML
|
||||
- **算法细节**:
|
||||
- Datadog Watchdog 三种算法:Anomaly Algorithm(异常)、Forecast Algorithm(预测)、Outlier Algorithm(**DBSCAN 离群检测**)
|
||||
- Elasticsearch ML 核心:**Proportional EWMA**(检测缓慢漂移)+ **Bayesian**(融合先验);population job 用于群体异常
|
||||
- **适配原因**:实时性优先、噪声大、需要自动基线
|
||||
- **关键结论**:商业可观测性产品几乎都是"统计+ML+聚类"的多算法组合,**没有"纯 DL 模型"直接对客户提供端到端时序异常检测**
|
||||
|
||||
#### 7.1.2 AIOps 告警收敛
|
||||
|
||||
- **数据特征**:高维 KPI、需可解释
|
||||
- **主导算法**:SR-CNN + 突变点 + LLM
|
||||
- **代表实现**:Azure Anomaly Detector (SR-CNN) / 阿里 ARMS Copilot / 字节火山引擎
|
||||
- **算法细节**:
|
||||
- **Microsoft Azure Anomaly Detector**(2026-10 停用):
|
||||
- 单变量:**SR-CNN**(Spectral Residual + CNN,KDD 2019)
|
||||
- 多变量:**Graph Attention Network**(ICDM 2020,最多 300 维信号)
|
||||
- 阿里:从 Opprentice(KDD 2015)→ iForest → Donut(VAE, KDD 2019)→ 多源关联图
|
||||
- 字节:STL 分解 + 鲁棒回归 + 告警事件聚类
|
||||
- **效果**:AIOps 智能监控可将 MTTD 改善 15-20%(Wikipedia/Gartner)
|
||||
- **适配原因**:高维时序、可解释、需自然语言交互
|
||||
|
||||
#### 7.1.3 金融风控与交易
|
||||
|
||||
- **数据特征**:100+ 维特征、< 100ms 延迟、强监管
|
||||
- **主导算法**:XGBoost + GNN + Isolation Forest + Hawkes
|
||||
- **代表实现**:PayPal、Visa VAA、Stripe Radar
|
||||
- **关键数据**:
|
||||
- **PayPal**:XGBoost + DNN + Isolation Forest 多模型堆叠,模型延迟 < 100ms;2019 KDD Cup 凭 LSTM-Transformer 集成拿冠军
|
||||
- **Visa VAA**:日均分析 500+ 万账户行为画像,2017-2024 累计阻止 120+ 亿美元欺诈损失
|
||||
- **Visa VAAI**:500ms 内完成卡组级欺诈判别,GNN 捕捉商户-持卡人-终端关系异常
|
||||
- **FINRA CAT**:每天 100+ 亿条美股市场事件;用规则 + RF/LSTM 混合
|
||||
- **SEC MIDAS**:机器学习驱动的多维时序异常检测
|
||||
- **适配原因**:100ms 延迟、规则可解释、特征工程重
|
||||
|
||||
#### 7.1.4 工业 IoT / 预测性维护
|
||||
|
||||
- **数据特征**:多变量耦合、缺标签、强实时
|
||||
- **主导算法**:LSTM / AutoEncoder / GAT
|
||||
- **代表实现**:NASA telemanom、MTAD-GAT、OmniAnomaly、西门子 MindSphere、GE Predix
|
||||
- **关键数据**:
|
||||
- **NASA C-MAPSS**(预测性维护标配):#6 数据集 4 子集 × 21 传感器 + 3 工况,RUL 任务 LSTM/Transformer/CNN-LSTM 的 RMSE 在 9-12(SOTA 接近 8)
|
||||
- **NASA telemanom (KDD 2018)**:SMAP 精度 85.5%/召回 85.5%;MSL 精度 92.6%/召回 69.4%
|
||||
- **MTAD-GAT (ICDM 2020)**:双层 GAT 同时建模时序依赖和变量间依赖,SWaT、WADI 上 AUC 提升约 10%
|
||||
- **GE Predix APM**:航空发动机 RUL 早期预警准确率 95%+
|
||||
- **OmniAnomaly (KDD 2019)**:在 SMD 上击败 baseline,F1 提升 17%
|
||||
- **适配原因**:多变量耦合、训练样本少、缺标签
|
||||
|
||||
#### 7.1.5 网络安全(IDS / DDoS)
|
||||
|
||||
- **数据特征**:高速流式、加密不可见
|
||||
- **主导算法**:随机森林 + 滑动窗 + 熵
|
||||
- **代表实现**:Cisco ETA、Cloudflare、Akamai Prolexic
|
||||
- **关键数据**:
|
||||
- **Cisco ETA**:随机森林 + LSTM,不解密 TLS 即可分析,**准确率 99%+ 误报 <0.01%**
|
||||
- **Cloudflare**:300+ 城市节点,滑动窗口 + Isolation Forest + 变点检测,**2024 Q1 单日阻断 4.5 Tbps DDoS**
|
||||
- **Akamai Prolexic**:时序异常 + 熵检测,**每天分析 100+ PB 流量**
|
||||
- 学术界 ANN 在 NSL-KDD 上 99.9% 检测率、集成模型 MCC 99.73%(**已被认为过拟合严重**)
|
||||
- CICIDS2017/UNSW-NB15 上更现实:RF/XGBoost F1 0.85-0.92,**纯 DL 0.80-0.90,往往不如带特征工程的 GBDT**
|
||||
- **适配原因**:亚秒级响应、低误报
|
||||
|
||||
#### 7.1.6 医疗监护
|
||||
|
||||
- **数据特征**:长序列、监管严(FDA 510(k))
|
||||
- **主导算法**:LSTM-Attention + EWS
|
||||
- **代表实现**:Philips IntelliVue、GE Healthcare Centricity、MIMIC
|
||||
- **关键数据**:
|
||||
- **Philips IntelliVue**:2020 年后引入 LSTM-Attention 替代 MEWS,**心衰/败血症检测灵敏度提升 18-30%**
|
||||
- **GE Healthcare Mural**:ICU 多变量时序预测"病人状态恶化",可提前 6 小时预警
|
||||
- **MIMIC-III/IV**:40,000+ ICU 住院数据,PhysioNet 事实标准
|
||||
- **MIT-BIH**:1D-CNN + LSTM 在 99%+ sensitivity,但 FDA 认证周期长
|
||||
- **适配原因**:可解释、监管严
|
||||
|
||||
#### 7.1.7 数据库与中间件
|
||||
|
||||
- **数据特征**:海量指标、冷启动
|
||||
- **主导算法**:IForest / Prophet / 自研时序
|
||||
- **代表实现**:Uber F3、Apache IoTDB、Merlion、AWS Performance Insights
|
||||
- **关键数据**:
|
||||
- **Uber F3**(2018 博客公开):动态告警阈值生成 + alert backtesting,**底层 metrics store 负载下降 90%**
|
||||
- **Salesforce Merlion**(2026-03 archive):集成 IForest、Prophet、AutoEncoder,NAB AWS CloudWatch P/R/F1=0.6667
|
||||
- **Apache IoTDB**:内置 IForest、KMeans+距离阈值
|
||||
- **P99 延迟 < 1s**,F1 0.85+
|
||||
- **适配原因**:冷启动友好、亿级指标
|
||||
|
||||
#### 7.1.8 能源电网
|
||||
|
||||
- **数据特征**:强实时(30-120 Hz)、虚假注入攻击
|
||||
- **主导算法**:稀疏分解(LRSD)+ LSTM-AE
|
||||
- **代表实现**:国家电网 PMU 模型、GE GridOS、Siemens Spectrum Power
|
||||
- **关键数据**:
|
||||
- **国家电网 / 南方电网**:PMU 多变量异常检测主要用:
|
||||
- **低秩稀疏分解(LRSD)**识别虚假数据注入(FDA)
|
||||
- **LSTM-AE** 在 IEEE 118-bus 标准数据 **F1 0.93+**
|
||||
- **Terna(意大利)**:WAMS 相量数据 + 动态状态估计 + 不一致性分析
|
||||
- **Tesla Energy / Fluence**:RNN 做电池簇电压/温度异常预警
|
||||
- **适配原因**:强实时、虚假注入攻击
|
||||
|
||||
#### 7.1.9 零售电商(双11)
|
||||
|
||||
- **数据特征**:业务事件耦合、大促漂移
|
||||
- **主导算法**:多变量 + 事件混合
|
||||
- **代表实现**:阿里 KDD 2021、京东 11.11、ByteFG
|
||||
- **关键数据**:
|
||||
- **阿里巴巴双 11**:KDD 2021 论文《Generic and Robust Localization of Multi-Dimensional Time Series Anomalies》
|
||||
- **亿级时间序列,F1 0.85+,P99 延迟 < 1s**
|
||||
- **告警收敛比 100:1**(根因定位可从 1000+ 告警收敛到 5-10 个故障)
|
||||
- **京东**:RobustSTL + 异常打分模型 + 影响因子归因
|
||||
- **字节 ByteFG**:自研多变量 + GNN,亿级指标秒级检测
|
||||
- **适配原因**:销量异常、大促漂移、业务事件耦合
|
||||
|
||||
### 7.2 算法-场景适配总表
|
||||
|
||||
> 行 = 算法/方案族,列 = 工业场景;⭐⭐⭐ = 工业界主流且效果亮眼,⭐⭐ = 可用,⭐ = 学术界常见但工业落地少,✗ = 不适用
|
||||
|
||||
| 算法 / 场景 | 可观测性 | AIOps | 金融风控 | 工业 IoT/PdM | 网络安全 | 医疗 | 数据库 | 能源 | 电商 |
|
||||
|---|---|---|---|---|---|---|---|---|---|
|
||||
| STL / 滑动统计 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
|
||||
| EWMA / Bayesian | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐⭐ |
|
||||
| Isolation Forest / DBSCAN | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ |
|
||||
| ARIMA / Prophet | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
|
||||
| GBDT (XGBoost/LightGBM) | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ |
|
||||
| LSTM / GRU | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ |
|
||||
| 1D-CNN / CNN-LSTM | ⭐ | ⭐ | ⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ |
|
||||
| Transformer 时序 | ⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ |
|
||||
| VAE / Donut / SR-CNN | ⭐⭐ | ⭐⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
|
||||
| Graph Attention / GNN | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐⭐ | ⭐ |
|
||||
| Hawkes 过程 | ⭐ | ⭐ | ⭐⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
|
||||
| 规则 + 专家系统 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
|
||||
| TSFM (Chronos/MOMENT) | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐ |
|
||||
| 扩散模型 (Diffusion-TS) | ⭐ | ⭐⭐ | ⭐ | ⭐⭐ | ⭐ | ⭐ | ⭐ | ⭐ | ⭐ |
|
||||
|
||||
### 7.3 选型决策树
|
||||
|
||||
```
|
||||
数据规模与场景
|
||||
├─ 维度 < 10、缺标签 → Isolation Forest / One-Class SVM
|
||||
├─ 强周期、单/多维 → SR-CNN / Prophet(Azure、Datadog)
|
||||
├─ 多变量耦合、关系重要 → 图模型(MTAD-GAT、GDN)
|
||||
├─ 复杂模式、训练数据多 → Transformer / LLM-TSAD
|
||||
├─ RUL / 早期预警 → LSTM-AE / VAE(OmniAnomaly、USAD)
|
||||
└─ 强监管 + 可解释 → 树模型 + SHAP(金融、医疗、电网首选)
|
||||
```
|
||||
|
||||
### 7.4 选型维度建议
|
||||
|
||||
1. **可解释性需求高**(金融/医疗/电网):树模型 + SHAP、GNN、GDN
|
||||
2. **实时性约束 < 100ms**(风控/网络安全):XGBoost、LightGNN、IForest、轻量 AE
|
||||
3. **变量关系重要**(AIOps/微服务):图模型 MTAD-GAT、GDN
|
||||
4. **跨域零样本**(云服务/多业务线):TSFM(MOMENT、Chronos、Timer、Time-LLM)
|
||||
5. **缺标签+长序列**(工业/科研):自监督(TS2Vec、NCAD、DCdetector)
|
||||
|
||||
---
|
||||
|
||||
## 八、工业界落地的核心共识
|
||||
|
||||
1. **没有"端到端 DL 异常检测"被直接卖给客户**。Datadog、Elastic、Azure、Grafana、阿里 ARMS 全部是"统计+无监督+监督"组合拳。
|
||||
|
||||
2. **异常检测的"调优"和"可解释性"比模型架构更重要**。Informer/Anomaly Transformer 等学术 SOTA 工业落地少,多因为不可解释、不可控。
|
||||
|
||||
3. **多维时序异常 = 趋势异常 + 群体异常 + 因果异常** 三个子问题,分而治之才是工业做法(如 Azure 把 univariate/multivariate/change point 拆成三个 API)。
|
||||
|
||||
4. **最稳的"工业基线"**:Prophet / STL / EWMA + Isolation Forest / GBDT + 规则告警。LSTM/Transformer 用在"有充足历史标注 + 高价值资产"场景(如电网负荷、航天器遥测、ICU 监护)。
|
||||
|
||||
5. **数据集公开性**:NSL-KDD/UNSW-NB15 老旧过拟合、NASA C-MAPSS/MIMIC/SMAP-MSL 是工业界真正反复打磨过的 benchmark,效果数据更可信。
|
||||
|
||||
6. **TSFM 是新基础设施但非银弹**:MOMENT、Chronos、Timer 等在少样本/跨域场景有亮眼表现,但工业落地仍以"统计 + DL 混合"为主。
|
||||
|
||||
7. **业务事件 + 时序联合建模**:阿里双11、京东 11.11、ByteFG 都明确表示"业务事件耦合 + 时序"的联合建模才能区分大促流量与真实异常。
|
||||
|
||||
---
|
||||
|
||||
## 九、未来趋势
|
||||
|
||||
1. **时序基础模型(TSFM)成为新基础设施**:MOMENT、Timer、Moirai 等以少样本微调达到专用 SOTA;Time-MoE、TimesFM 证明 scaling law 在时序域同样有效。
|
||||
|
||||
2. **多模态时序 MLLM 崛起**:ChatTS、TimeChat 等把时序作为新模态,瞄准时序理解与智能体(阿里 AIOps 已落地)。
|
||||
|
||||
3. **可解释性回归**:金融/医疗/电网监管收紧,SHAP + 树模型、GNN、因果推理将成主流。
|
||||
|
||||
4. **评估方法标准化**:VUS-PR、Affiliation-F1 替代 PA-F1,TSB-UAD、Exathlon 替代老旧 benchmark。
|
||||
|
||||
5. **边缘/端侧部署**:TTM(1M 参数 + CPU 推理)、轻量化 MoE 成为 IoT 场景新方向。
|
||||
|
||||
6. **自适应 Conformal 监控**:与 TSFM 结合的后验自适应阈值(Gil et al. 2026),无需微调。
|
||||
|
||||
7. **零样本泛化是 TSFM 最大价值**:传统 MTSAD 在分布外场景几乎失效,TSFM 首次实现"一次训练、多场景部署"。
|
||||
|
||||
8. **扩散模型补位**:解决 GAN 类生成器在时序上易模式坍缩的问题,并在异常检测中利用"采样不确定性"改进评分。
|
||||
|
||||
9. **对比/重建两条路线融合**:DCdetector、DBA、Focal、PSAD 等通过对比或自监督弥补纯重构方法的偏差。
|
||||
|
||||
10. **异常检测与因果推理结合**:Dynatrace Davis AI 的因果拓扑推理是方向;解释"为什么这个点异常"将成为强需求。
|
||||
|
||||
---
|
||||
|
||||
## 十、参考来源
|
||||
|
||||
### 10.1 经典模型论文
|
||||
|
||||
- LSTM-VAE: Park et al. T-RO 2018
|
||||
- OmniAnomaly: Su et al. KDD 2019
|
||||
- USAD: Audibert et al. KDD 2020
|
||||
- GDN: Deng & Hooi AAAI 2021
|
||||
- Anomaly Transformer: Xu et al. ICLR 2022
|
||||
- TranAD: Tuli et al. VLDB 2022
|
||||
- TimesNet: Wu et al. ICLR 2023
|
||||
- DAGMM: Zong et al. ICLR 2018
|
||||
|
||||
### 10.2 SOTA 模型论文
|
||||
|
||||
- TimeGPT-1: arXiv:2310.03589
|
||||
- Chronos: arXiv:2403.07815
|
||||
- TimesFM: arXiv:2310.10688 (ICLR 2024)
|
||||
- MOMENT: arXiv:2402.03885 (ICML 2024)
|
||||
- Timer: arXiv:2402.02368
|
||||
- Time-MoE: arXiv:2409.16040 (ICLR 2025)
|
||||
- TTM: arXiv:2401.03955 (NeurIPS 2024)
|
||||
- Diffusion-TS: arXiv:2403.01742
|
||||
- Time-LLM: arXiv:2310.01728 (ICLR 2024)
|
||||
- AutoTimes: arXiv:2402.02370 (NeurIPS 2024)
|
||||
- ChatTS: arXiv:2412.03104 (VLDB 2025)
|
||||
- LSTPrompt: arXiv:2402.16132
|
||||
- Lag-Llama: arXiv:2310.08278
|
||||
- DCdetector: arXiv:2306.10347 (KDD 2023)
|
||||
- AnomalyCLIP: arXiv:2310.18961 (ICLR 2024)
|
||||
- CARLA: arXiv:2308.09296 (PR 2024)
|
||||
|
||||
### 10.3 评测与综述
|
||||
|
||||
- Wu & Keogh "Elephant in the Room":arXiv:2009.13807
|
||||
- VUS-PR: Paparrizos et al. ICDE 2022 & arXiv:2502.13318 (2025 优化)
|
||||
- Affiliation: Huet et al. KDD 2022
|
||||
- Kim et al. "Towards a Rigorous Evaluation": AAAI 2022, arXiv:2109.05257
|
||||
- Correia et al. EAAI 2024: arXiv:2408.03747
|
||||
- Boniol et al. "Dive into Time-Series Anomaly Detection": arXiv:2412.20512
|
||||
- Sánchez-Ferrera et al. "Self-Supervised Learning for TSAD": arXiv:2501.15196
|
||||
- Darban et al. "Deep Learning for TSAD Survey": ACM Computing Surveys 2024
|
||||
- "Transformers in Time Series: A Survey": IJCAI 2023
|
||||
|
||||
### 10.4 工业界资料
|
||||
|
||||
- Datadog Watchdog: docs.datadoghq.com/watchdog/
|
||||
- Elasticsearch ML: elastic.co/guide/en/machine-learning
|
||||
- Microsoft Azure Anomaly Detector (SR-CNN): arXiv:1906.03821
|
||||
- 阿里云 ARMS: alibabacloud.com/product/arms
|
||||
- 阿里 OmniAnomaly 仓库: github.com/NetManAIOps/OmniAnomaly
|
||||
- Microsoft Anomaly Detector 库: github.com/microsoft/anomaly-detector
|
||||
- Salesforce Merlion: github.com/salesforce/Merlion
|
||||
- Anomaly Detection Resources: github.com/yzhao062/anomaly-detection-resources
|
||||
- NASA telemanom: github.com/khundman/telemanom
|
||||
- NASA PCoE C-MAPSS: ti.arc.nasa.gov/tech/dash/groups/pcoe/prognostic-data-repository
|
||||
- MIMIC-III/IV: physionet.org/content/mimiciii/
|
||||
- Uber F3: eng.uber.com (2018 blog)
|
||||
- AIOps Wikipedia: en.wikipedia.org/wiki/AIOps
|
||||
- NIDS Wikipedia: en.wikipedia.org/wiki/Network_intrusion_detection_system
|
||||
|
||||
### 10.5 TSFM 开源仓库
|
||||
|
||||
- Chronos: github.com/amazon-science/chronos-forecasting
|
||||
- TimesFM: github.com/google-research/timesfm
|
||||
- MOMENT: github.com/moment-timeseries-foundation-model/MOMENT
|
||||
- Timer: github.com/thuml/Large-Time-Series-Model
|
||||
- Time-MoE: github.com/Time-MoE/Time-MoE
|
||||
- TTM: github.com/ibm-granite/granite-timeseries-models
|
||||
- Time-LLM: github.com/KimMeen/Time-LLM
|
||||
- AutoTimes: github.com/thuml/AutoTimes
|
||||
- ChatTS: github.com/NetManAIOps/ChatTS
|
||||
- Lag-Llama: github.com/time-series-foundation-models/lag-llama
|
||||
- DCdetector: github.com/DAMO-DI-ML/KDD2023-DCdetector
|
||||
- TimesNet: github.com/thuml/Time-Series-Library
|
||||
|
||||
---
|
||||
|
||||
## 附录 A:术语表
|
||||
|
||||
| 术语 | 含义 |
|
||||
|------|------|
|
||||
| **MTSAD** | Multivariate Time Series Anomaly Detection,多维时序异常检测 |
|
||||
| **TSFM** | Time Series Foundation Model,时间序列基础模型 |
|
||||
| **PA (Point Adjustment)** | 一种评估协议,把"段内任一点命中"等同于"整段命中" |
|
||||
| **VUS-PR** | Volume Under the Surface for PR,段级阈值无关评估指标 |
|
||||
| **POT** | Peaks-Over-Threshold,极值理论阈值选取方法 |
|
||||
| **NF** | Normalizing Flow,正则化流,用于灵活分布建模 |
|
||||
| **AE** | AutoEncoder,自编码器 |
|
||||
| **VAE** | Variational AutoEncoder,变分自编码器 |
|
||||
| **MAML** | Model-Agnostic Meta Learning,模型无关元学习 |
|
||||
| **EWMA** | Exponentially Weighted Moving Average,指数加权移动平均 |
|
||||
| **RCF** | Robust Cut Forest,鲁棒切割森林(Isolation Forest 变体) |
|
||||
| **DBSCAN** | Density-Based Spatial Clustering of Applications with Noise,基于密度的聚类 |
|
||||
| **CUSUM** | Cumulative Sum,累积和控制图,用于变点检测 |
|
||||
| **SHAP** | SHapley Additive exPlanations,可解释性方法 |
|
||||
| **PHM** | Prognostics and Health Management,故障预测与健康管理 |
|
||||
| **RUL** | Remaining Useful Life,剩余使用寿命 |
|
||||
| **WAMS** | Wide Area Measurement System,广域测量系统 |
|
||||
| **FDA** | False Data Injection,虚假数据注入 |
|
||||
| **LULD** | Limit Up-Limit Down,熔断机制 |
|
||||
| **NSL-KDD** | 网络入侵检测经典数据集 |
|
||||
| **ECG** | Electrocardiogram,心电图 |
|
||||
| **EWS** | Early Warning Score,早期预警评分 |
|
||||
| **MEWS** | Modified Early Warning Score,改良早期预警评分 |
|
||||
|
||||
## 附录 B:报告使用建议
|
||||
|
||||
### B.1 给产品经理
|
||||
|
||||
- **不要被学术 SOTA 迷惑**:F1 0.95 可能是 PA 虚高
|
||||
- **关注场景匹配**:不同场景的最优算法差异极大
|
||||
- **重视可解释性**:金融/医疗/电网的硬性要求
|
||||
- **关注告警收敛比**:100:1 比单纯 F1 更有商业价值
|
||||
- **TSFM 是新趋势但非银弹**:评估落地成本与收益
|
||||
|
||||
### B.2 给算法工程师
|
||||
|
||||
- **基线先行**:先跑 STL+EWMA+IForest,再考虑 DL
|
||||
- **避免 PA 自欺**:报告 VUS-PR 与 Aff-F1
|
||||
- **跨数据集测试**:至少 3 个不同领域
|
||||
- **重视可解释性输出**:SHAP / GDN 图 / 关联差异
|
||||
- **考虑概念漂移**:滑动窗口 + 周期性重训练
|
||||
- **TSFM 少样本微调**:MOMENT/Chronos/Timer 是新武器
|
||||
|
||||
### B.3 给架构师
|
||||
|
||||
- **混合架构**:统计 + ML + 规则 + LLM
|
||||
- **在线/离线分离**:实时统计 + 离线深度学习
|
||||
- **冷启动友好**:IForest/Prophet 起家,DL 渐进引入
|
||||
- **告警收敛管线**:异常检测 → 关联分析 → 根因定位 → 影响面评估
|
||||
- **多模态融合**:时序 + 事件 + Trace + Log 联合建模
|
||||
|
||||
---
|
||||
|
||||
> **报告结束**
|
||||
>
|
||||
> 如需进一步深入某个方向(如 Anomaly Transformer 的 minimax 训练细节、Time-MoE 的稀疏 MoE 架构、ChatTS 的合成数据生成流程、TSFM 工业部署的工程难点、Point Adjustment 的数学证明等),欢迎进一步告知,我可产出更细粒度的专题报告。
|
||||
Reference in New Issue
Block a user