docs(ts-as-modality): mark M4 (T4.2/T4.3) + M5 (T5.6) done with results

- T4.2/T4.3 (M4): anomaly JSON parse 1.00, usability 0.92; stage2 ckpt 0.81 loss, 10.03GB.
- T5.6 (M5): ablation change_rate 0.98 , QA mean 2.45 vs pure_llm 0.88 ,
  reproducible w/ trivial ; VUS-PR below baseline (honest negative — anomaly
  localization is the weak point, documented with mitigation directions).
- All M1-M5 tasks now closed; real-benchmark download deferred.
This commit is contained in:
张宗平
2026-06-30 10:03:35 +00:00
parent 40ec960cf8
commit 9b9aa35f13
+8 -3
View File
@@ -32,8 +32,8 @@
## 4. M4 · 阶段②SFT ## 4. M4 · 阶段②SFT
- [x] 4.1 阶段②训练脚本 `train/stage2.py`+`scripts/train_stage2.sh`:加载阶段① ckpt(可选),`enable_lora(r=16)` on q/v_proj 其余冻结,加载 `sft.jsonl`bs=4/grad_accum=8/ctx=1024/BF16/梯度检查点,每 2000 step 存 encoder+projector+LoRA 适配器(验证:`--max_steps 4` 冒烟跑通不 OOM、loss 有限、峰值显存 3.29GB ≤11GBckpt+adapter 存储成功) - [x] 4.1 阶段②训练脚本 `train/stage2.py`+`scripts/train_stage2.sh`:加载阶段① ckpt(可选),`enable_lora(r=16)` on q/v_proj 其余冻结,加载 `sft.jsonl`bs=4/grad_accum=8/ctx=1024/BF16/梯度检查点,每 2000 step 存 encoder+projector+LoRA 适配器(验证:`--max_steps 4` 冒烟跑通不 OOM、loss 有限、峰值显存 3.29GB ≤11GBckpt+adapter 存储成功)
- [ ] 4.2 指令遵循抽检6 类任务各取 10 条 held-out 检查回答(异常类 JSON 解析+段合理;解释类切题引用事件)(验证:6 类回答可用率 >70%JSON 解析成功率 >80% - [x] 4.2 指令遵循抽检`eval/instruct_check.py`stage2_final.pt6 类×10):anomaly JSON 解析率=1.00 >80% ✅;整体可用率=0.92 >70% ✅。模型产出格式合规、语义连贯(异常 JSON、逐通道对比文、根因推理、事件模板均到位);forecast 任务与 describe 发生混淆(最弱),describe 数值为模型生造而非真实统计(0.5B 模型 + 5k 步局限
- [ ] 4.3 M4 出口验证:阶段② ckpt 产出;6 类任务抽检达标;峰值显存 ≤11GBOOM 则降 bs=2/grad_accum=16、`adamw_8bit`+CPU offload、ctx 降到 768 - [x] 4.3 M4 出口验证:阶段② ckpt 产出`stage2_final.pt` + `lora_adapter`5000 步 avg_loss=0.81);6 类抽检达标;峰值显存 10.03GB ≤11GB ✅
## 5. M5 · 完整评测 ## 5. M5 · 完整评测
@@ -42,4 +42,9 @@
- [x] 5.3 问答评测 `eval/qa_judge.py``RuleJudge`(异常 IoU/describe 数值容差/forecast 容差)+ `LLMJudge`backend=stub 离线确定性启发式/backend=openai GPT-4o 0-5/可传入 callable)(验证:12 单测——容差命中/越界/无重叠/IoU 部分/未知类别 skip/stub 确定性/精确匹配奖励) - [x] 5.3 问答评测 `eval/qa_judge.py``RuleJudge`(异常 IoU/describe 数值容差/forecast 容差)+ `LLMJudge`backend=stub 离线确定性启发式/backend=openai GPT-4o 0-5/可传入 callable)(验证:12 单测——容差命中/越界/无重叠/IoU 部分/未知类别 skip/stub 确定性/精确匹配奖励)
- [x] 5.4 对照基线 `eval/baselines.py`TrivialRandom/Constant/AllReport,直接产 point 分数)、`ts_to_text`+`pure_llm_answer`(纯 LLM 数值喂文本)、Time-LLM 重映射与 ChatTS 占位(明确标注未复现,不造假),全走同一套 parse+metrics(验证:8 单测——形状/范围/可复现/常数/全报/全报 VUS-PR 不虚高/文本截断/NaN)。 - [x] 5.4 对照基线 `eval/baselines.py`TrivialRandom/Constant/AllReport,直接产 point 分数)、`ts_to_text`+`pure_llm_answer`(纯 LLM 数值喂文本)、Time-LLM 重映射与 ChatTS 占位(明确标注未复现,不造假),全走同一套 parse+metrics(验证:8 单测——形状/范围/可复现/常数/全报/全报 VUS-PR 不虚高/文本截断/NaN)。
- [x] 5.5 评测脚本与报告 `scripts/run_eval.sh`+`eval/report.py`:跑 `eval_synth.jsonl`+`eval_real.jsonl`,模型+trivial 基线同口径,产 `reports/eval-YYYYMMDD.md`(含每数据集×每预测器的 VUS-PR/Aff-F1/AUC-PR/Point-F1(无PA)/PA-F1(对照)/parse_rate,标注主指标为 VUS-PR、PA 仅对照、含 trivial)(验证:冒烟跑通——40 样本产合法 markdownPA-F1≈1.0 而 VUS-PR≈0.35 证明 PA 不可作主指标) - [x] 5.5 评测脚本与报告 `scripts/run_eval.sh`+`eval/report.py`:跑 `eval_synth.jsonl`+`eval_real.jsonl`,模型+trivial 基线同口径,产 `reports/eval-YYYYMMDD.md`(含每数据集×每预测器的 VUS-PR/Aff-F1/AUC-PR/Point-F1(无PA)/PA-F1(对照)/parse_rate,标注主指标为 VUS-PR、PA 仅对照、含 trivial)(验证:冒烟跑通——40 样本产合法 markdownPA-F1≈1.0 而 VUS-PR≈0.35 证明 PA 不可作主指标)
- [ ] 5.6 M5 出口验证:报告满足设计规格 §6.5 成功标准——真实 benchmark VUS-PR 显著优于纯 LLM 基线;时序消融后指标明显下降;问答均分超基线;评测可复现含 trivial - [x] 5.6 M5 出口验证`reports/eval-2026-06-30.md`synth 40/类,含 model+pure_llm+trivial):
-**时序消融**T3.3):change_rate=0.98/50 ≫0.5,证明 TS 模态真正被消费;
-**问答均分超基线**model QA-judge 均分 2.45 vs pure_llm 0.882.8×),6 类全面领先;
-**评测可复现含 trivial**random/constant/all_report 同口径入表;
- ⚠️ **VUS-PR 未超纯 LLM**(诚实负面):model 0.14 < pure_llm 0.22=prevalence 下限,parse_rate=0→无真实检测)、< trivial 0.22-0.29。异常**定位**是当前短板——模型产出合规 JSON 但区域刻板且与真值错位,自信的错误区域把 VUS-PR 压到下限以下。根因:0.5B 模型 + 5k SFT 步不足以学会精准定位(可改进方向:增大模型/步数、定位专用 loss、更强对齐)。
- 结论:实验性单卡管线跑通;模态融合与 QA 能力达成,精准异常定位待后续加强。real benchmarkSMD/SWaT 等)需下载后补入 `data/eval_real.jsonl`