跳转至

评估

论文评价的是完整活动记录。窗口准确率无法衡量事件次数、误报、记录碎片化或边界误差。

协议

划分 评估用途
训练集,80 条 训练后验模型
开发/校准集,20 条 校准并诊断 LBSA/TRL 策略
外部测试集,37 条 对冻结工作点进行一次最终报告

外部测试集包含 114 个标注片段。其标签不参与检查点、融合方案、时序参数或表格方案 选择。因此,开发分析与外部结果必须分开报告。

匹配

预测片段 \(P\) 与参考片段 \(G\) 必须属于同一条记录、活动类别相同,并满足 \(\operatorname{IoU}(P,G)>0.5\),才有资格匹配。匹配采用一对一规则。

\[ \operatorname{IoU}(P,G) = \frac{ \operatorname{dur}(P\cap G) }{ \operatorname{dur}(P\cup G) }. \tag{1} \]

分子是两个区间的重叠时长,分母是至少被其中一个区间覆盖的总时长。

错误类别、边界偏移、拆分与合并都会在同一记录级框架中受到惩罚。

指标

指标 衡量内容
平均用户 F1 对每位用户的片段 F1 等权平均
Micro-F1 汇总 TP、FP、FN 后计算 F1
匹配 IoU 真阳性记录的重叠质量
开始/结束 MAE 以秒为单位的边界误差
时长误差 以秒为单位的活动时长绝对误差
FP/hour 每记录小时的虚假活动数

每位用户根据匹配与未匹配片段计算精确率 \(P\)、召回率 \(R\) 和 F1:

\[ \begin{aligned} P &= \frac{\mathrm{TP}}{\mathrm{TP}+\mathrm{FP}}, & R &= \frac{\mathrm{TP}}{\mathrm{TP}+\mathrm{FN}}, \\[4pt] \mathrm{F1} &= \frac{2PR}{P+R}. \end{aligned} \tag{2} \]

若评估包含 \(U\) 位用户,主要报告的平均用户 F1 对每位用户等权:

\[ \mathrm{F1}_{\mathrm{mean\text{-}user}} = \frac{1}{U} \sum_{u=1}^{U}\mathrm{F1}_{u}. \tag{3} \]

平均用户 F1 避免长记录用户自然地主导主要分数;Micro-F1 则先汇总所有用户的 TP、FP、FN,再应用公式(2),从而保留全局事件计数视角。

错误解读

记录错误 计数影响 边界影响
漏检活动 FN 没有匹配边界
虚假活动 FP 没有参考边界
活动碎片化 产生额外 FP 开始与结束不稳定
合并相邻活动 一对一匹配冲突 时长过长
类别正确但区间偏移 可能形成 FP + FN 边界误差增大
类别错误 FP + FN 无可匹配记录

证据层级

重复 10/10 开发划分用于在固定 3 秒后验概率上分析 TRL,属于机制诊断。最终 LBSA + TRL 结果则来自 37 条外部记录上的固定三模型工作点。两类证据回答不同问题, 不能混为一谈。

外部测试主要结果为平均用户 F1 0.89、Micro-F1 0.90,TP/FP/FN 为 99/7/15。方案对比、置信区间、分类结果和失败案例见研究结果

结论边界

这些指标衡量片段记录质量,不能证明临床收益、训练指导质量、安全价值,也不能 证明对新设备或新人群的迁移能力。

复现

评估入口为 python evaluate.py --split external_test。必须使用与冻结模型和策略 对应的授权标签;资产说明见资产