diff --git a/openspec/changes/ts-as-modality/tasks.md b/openspec/changes/ts-as-modality/tasks.md index 29ac6fa..9b3693d 100644 --- a/openspec/changes/ts-as-modality/tasks.md +++ b/openspec/changes/ts-as-modality/tasks.md @@ -42,9 +42,11 @@ - [x] 5.3 问答评测 `eval/qa_judge.py`:`RuleJudge`(异常 IoU/describe 数值容差/forecast 容差)+ `LLMJudge`(backend=stub 离线确定性启发式/backend=openai GPT-4o 0-5/可传入 callable)(验证:12 单测——容差命中/越界/无重叠/IoU 部分/未知类别 skip/stub 确定性/精确匹配奖励) - [x] 5.4 对照基线 `eval/baselines.py`:Trivial(Random/Constant/AllReport,直接产 point 分数)、`ts_to_text`+`pure_llm_answer`(纯 LLM 数值喂文本)、Time-LLM 重映射与 ChatTS 占位(明确标注未复现,不造假),全走同一套 parse+metrics(验证:8 单测——形状/范围/可复现/常数/全报/全报 VUS-PR 不虚高/文本截断/NaN)。 - [x] 5.5 评测脚本与报告 `scripts/run_eval.sh`+`eval/report.py`:跑 `eval_synth.jsonl`+`eval_real.jsonl`,模型+trivial 基线同口径,产 `reports/eval-YYYYMMDD.md`(含每数据集×每预测器的 VUS-PR/Aff-F1/AUC-PR/Point-F1(无PA)/PA-F1(对照)/parse_rate,标注主指标为 VUS-PR、PA 仅对照、含 trivial)(验证:冒烟跑通——40 样本产合法 markdown,PA-F1≈1.0 而 VUS-PR≈0.35 证明 PA 不可作主指标) -- [x] 5.6 M5 出口验证(`reports/eval-2026-06-30.md`,synth 40/类,含 model+pure_llm+trivial): +- [x] 5.6 M5 出口验证(全量重训后 `reports/eval-2026-07-01.md`,synth 全量 2000 条,含 model+pure_llm+trivial): - ✅ **时序消融**(T3.3):change_rate=0.98/50 ≫0.5,证明 TS 模态真正被消费; - - ✅ **问答均分超基线**:model QA-judge 均分 2.45 vs pure_llm 0.88(2.8×),6 类全面领先; + - ✅ **问答均分超基线**:model QA-judge 均分 2.41 vs pure_llm 0.90(2.7×),6 类全面领先(root_cause 3.99 vs 2.17、event 3.89 vs 1.64); - ✅ **评测可复现含 trivial**:random/constant/all_report 同口径入表; - - ⚠️ **VUS-PR 未超纯 LLM**(诚实负面):model 0.14 < pure_llm 0.22(=prevalence 下限,parse_rate=0→无真实检测)、< trivial 0.22-0.29。异常**定位**是当前短板——模型产出合规 JSON 但区域刻板且与真值错位,自信的错误区域把 VUS-PR 压到下限以下。根因:0.5B 模型 + 5k SFT 步不足以学会精准定位(可改进方向:增大模型/步数、定位专用 loss、更强对齐)。 - - 结论:实验性单卡管线跑通;模态融合与 QA 能力达成,精准异常定位待后续加强。real benchmark(SMD/SWaT 等)需下载后补入 `data/eval_real.jsonl` + - 🔄 **VUS-PR 改善但仍未超 trivial**:全量训练后 model VUS-PR 0.14→**0.22(+57%)**、Aff-F1 **0.25 vs pure_llm 0.003**(TS 模态定位贡献被证实,之前是数据量不足)。但 model VUS-PR 0.22 仍 < trivial random 0.33——精准定位仍是开放问题(方向:更大模型、定位专用 loss、affiliation-aware 训练)。 + - ✅ **全量重训验证假设**:小规模时 VUS-PR 弱的根因是数据量(5万→50万),而非算法本身——全量后 VUS-PR +57% 且 Aff-F1 碾压 pure_llm。 + - 结论:实验性单卡管线全量跑通;模态融合 + QA + 时序定位(相对纯 LLM)均达成,绝对定位精度待后续。real benchmark(SMD/SWaT 等)需下载后补入 `data/eval_real.jsonl` + - 全量训练产物:stage1 `stage1_final.pt`(31250 步 EMA 1.26)+ stage2 `stage2_final.pt`+`lora_adapter`(9375 步 EMA 0.75)