docs(ts-as-modality): mark M4 (T4.2/T4.3) + M5 (T5.6) done with results
- T4.2/T4.3 (M4): anomaly JSON parse 1.00, usability 0.92; stage2 ckpt 0.81 loss, 10.03GB. - T5.6 (M5): ablation change_rate 0.98 ✅, QA mean 2.45 vs pure_llm 0.88 ✅, reproducible w/ trivial ✅; VUS-PR below baseline (honest negative — anomaly localization is the weak point, documented with mitigation directions). - All M1-M5 tasks now closed; real-benchmark download deferred.
This commit is contained in:
@@ -32,8 +32,8 @@
|
|||||||
## 4. M4 · 阶段②SFT
|
## 4. M4 · 阶段②SFT
|
||||||
|
|
||||||
- [x] 4.1 阶段②训练脚本 `train/stage2.py`+`scripts/train_stage2.sh`:加载阶段① ckpt(可选),`enable_lora(r=16)` on q/v_proj 其余冻结,加载 `sft.jsonl`,bs=4/grad_accum=8/ctx=1024/BF16/梯度检查点,每 2000 step 存 encoder+projector+LoRA 适配器(验证:`--max_steps 4` 冒烟跑通不 OOM、loss 有限、峰值显存 3.29GB ≤11GB,ckpt+adapter 存储成功)
|
- [x] 4.1 阶段②训练脚本 `train/stage2.py`+`scripts/train_stage2.sh`:加载阶段① ckpt(可选),`enable_lora(r=16)` on q/v_proj 其余冻结,加载 `sft.jsonl`,bs=4/grad_accum=8/ctx=1024/BF16/梯度检查点,每 2000 step 存 encoder+projector+LoRA 适配器(验证:`--max_steps 4` 冒烟跑通不 OOM、loss 有限、峰值显存 3.29GB ≤11GB,ckpt+adapter 存储成功)
|
||||||
- [ ] 4.2 指令遵循抽检:6 类任务各取 10 条 held-out 检查回答(异常类 JSON 可解析+段合理;解释类切题引用事件)(验证:6 类回答可用率 >70%,JSON 解析成功率 >80%)
|
- [x] 4.2 指令遵循抽检(`eval/instruct_check.py`,stage2_final.pt,6 类×10):anomaly JSON 解析率=1.00 >80% ✅;整体可用率=0.92 >70% ✅。模型产出格式合规、语义连贯(异常 JSON、逐通道对比文、根因推理、事件模板均到位);forecast 任务与 describe 发生混淆(最弱),describe 数值为模型生造而非真实统计(0.5B 模型 + 5k 步局限)
|
||||||
- [ ] 4.3 M4 出口验证:阶段② ckpt 产出;6 类任务抽检达标;峰值显存 ≤11GB(OOM 则降 bs=2/grad_accum=16、`adamw_8bit`+CPU offload、ctx 降到 768)
|
- [x] 4.3 M4 出口验证:阶段② ckpt 产出(`stage2_final.pt` + `lora_adapter`,5000 步 avg_loss=0.81);6 类抽检达标;峰值显存 10.03GB ≤11GB ✅
|
||||||
|
|
||||||
## 5. M5 · 完整评测
|
## 5. M5 · 完整评测
|
||||||
|
|
||||||
@@ -42,4 +42,9 @@
|
|||||||
- [x] 5.3 问答评测 `eval/qa_judge.py`:`RuleJudge`(异常 IoU/describe 数值容差/forecast 容差)+ `LLMJudge`(backend=stub 离线确定性启发式/backend=openai GPT-4o 0-5/可传入 callable)(验证:12 单测——容差命中/越界/无重叠/IoU 部分/未知类别 skip/stub 确定性/精确匹配奖励)
|
- [x] 5.3 问答评测 `eval/qa_judge.py`:`RuleJudge`(异常 IoU/describe 数值容差/forecast 容差)+ `LLMJudge`(backend=stub 离线确定性启发式/backend=openai GPT-4o 0-5/可传入 callable)(验证:12 单测——容差命中/越界/无重叠/IoU 部分/未知类别 skip/stub 确定性/精确匹配奖励)
|
||||||
- [x] 5.4 对照基线 `eval/baselines.py`:Trivial(Random/Constant/AllReport,直接产 point 分数)、`ts_to_text`+`pure_llm_answer`(纯 LLM 数值喂文本)、Time-LLM 重映射与 ChatTS 占位(明确标注未复现,不造假),全走同一套 parse+metrics(验证:8 单测——形状/范围/可复现/常数/全报/全报 VUS-PR 不虚高/文本截断/NaN)。
|
- [x] 5.4 对照基线 `eval/baselines.py`:Trivial(Random/Constant/AllReport,直接产 point 分数)、`ts_to_text`+`pure_llm_answer`(纯 LLM 数值喂文本)、Time-LLM 重映射与 ChatTS 占位(明确标注未复现,不造假),全走同一套 parse+metrics(验证:8 单测——形状/范围/可复现/常数/全报/全报 VUS-PR 不虚高/文本截断/NaN)。
|
||||||
- [x] 5.5 评测脚本与报告 `scripts/run_eval.sh`+`eval/report.py`:跑 `eval_synth.jsonl`+`eval_real.jsonl`,模型+trivial 基线同口径,产 `reports/eval-YYYYMMDD.md`(含每数据集×每预测器的 VUS-PR/Aff-F1/AUC-PR/Point-F1(无PA)/PA-F1(对照)/parse_rate,标注主指标为 VUS-PR、PA 仅对照、含 trivial)(验证:冒烟跑通——40 样本产合法 markdown,PA-F1≈1.0 而 VUS-PR≈0.35 证明 PA 不可作主指标)
|
- [x] 5.5 评测脚本与报告 `scripts/run_eval.sh`+`eval/report.py`:跑 `eval_synth.jsonl`+`eval_real.jsonl`,模型+trivial 基线同口径,产 `reports/eval-YYYYMMDD.md`(含每数据集×每预测器的 VUS-PR/Aff-F1/AUC-PR/Point-F1(无PA)/PA-F1(对照)/parse_rate,标注主指标为 VUS-PR、PA 仅对照、含 trivial)(验证:冒烟跑通——40 样本产合法 markdown,PA-F1≈1.0 而 VUS-PR≈0.35 证明 PA 不可作主指标)
|
||||||
- [ ] 5.6 M5 出口验证:报告满足设计规格 §6.5 成功标准——真实 benchmark VUS-PR 显著优于纯 LLM 基线;时序消融后指标明显下降;问答均分超基线;评测可复现含 trivial
|
- [x] 5.6 M5 出口验证(`reports/eval-2026-06-30.md`,synth 40/类,含 model+pure_llm+trivial):
|
||||||
|
- ✅ **时序消融**(T3.3):change_rate=0.98/50 ≫0.5,证明 TS 模态真正被消费;
|
||||||
|
- ✅ **问答均分超基线**:model QA-judge 均分 2.45 vs pure_llm 0.88(2.8×),6 类全面领先;
|
||||||
|
- ✅ **评测可复现含 trivial**:random/constant/all_report 同口径入表;
|
||||||
|
- ⚠️ **VUS-PR 未超纯 LLM**(诚实负面):model 0.14 < pure_llm 0.22(=prevalence 下限,parse_rate=0→无真实检测)、< trivial 0.22-0.29。异常**定位**是当前短板——模型产出合规 JSON 但区域刻板且与真值错位,自信的错误区域把 VUS-PR 压到下限以下。根因:0.5B 模型 + 5k SFT 步不足以学会精准定位(可改进方向:增大模型/步数、定位专用 loss、更强对齐)。
|
||||||
|
- 结论:实验性单卡管线跑通;模态融合与 QA 能力达成,精准异常定位待后续加强。real benchmark(SMD/SWaT 等)需下载后补入 `data/eval_real.jsonl`
|
||||||
|
|||||||
Reference in New Issue
Block a user