评估¶
论文评价的是完整活动记录。窗口准确率无法衡量事件次数、误报、记录碎片化或边界误差。
协议¶
| 划分 | 评估用途 |
|---|---|
| 训练集,80 条 | 训练后验模型 |
| 开发/校准集,20 条 | 校准并诊断 LBSA/TRL 策略 |
| 外部测试集,37 条 | 对冻结工作点进行一次最终报告 |
外部测试集包含 114 个标注片段。其标签不参与检查点、融合方案、时序参数或表格方案 选择。因此,开发分析与外部结果必须分开报告。
匹配¶
预测片段 \(P\) 与参考片段 \(G\) 必须属于同一条记录、活动类别相同,并满足 \(\operatorname{IoU}(P,G)>0.5\),才有资格匹配。匹配采用一对一规则。
\[
\operatorname{IoU}(P,G)
=
\frac{
\operatorname{dur}(P\cap G)
}{
\operatorname{dur}(P\cup G)
}.
\tag{1}
\]
分子是两个区间的重叠时长,分母是至少被其中一个区间覆盖的总时长。
错误类别、边界偏移、拆分与合并都会在同一记录级框架中受到惩罚。
指标¶
| 指标 | 衡量内容 |
|---|---|
| 平均用户 F1 | 对每位用户的片段 F1 等权平均 |
| Micro-F1 | 汇总 TP、FP、FN 后计算 F1 |
| 匹配 IoU | 真阳性记录的重叠质量 |
| 开始/结束 MAE | 以秒为单位的边界误差 |
| 时长误差 | 以秒为单位的活动时长绝对误差 |
| FP/hour | 每记录小时的虚假活动数 |
每位用户根据匹配与未匹配片段计算精确率 \(P\)、召回率 \(R\) 和 F1:
\[
\begin{aligned}
P &= \frac{\mathrm{TP}}{\mathrm{TP}+\mathrm{FP}},
&
R &= \frac{\mathrm{TP}}{\mathrm{TP}+\mathrm{FN}},
\\[4pt]
\mathrm{F1} &= \frac{2PR}{P+R}.
\end{aligned}
\tag{2}
\]
若评估包含 \(U\) 位用户,主要报告的平均用户 F1 对每位用户等权:
\[
\mathrm{F1}_{\mathrm{mean\text{-}user}}
=
\frac{1}{U}
\sum_{u=1}^{U}\mathrm{F1}_{u}.
\tag{3}
\]
平均用户 F1 避免长记录用户自然地主导主要分数;Micro-F1 则先汇总所有用户的 TP、FP、FN,再应用公式(2),从而保留全局事件计数视角。
错误解读¶
| 记录错误 | 计数影响 | 边界影响 |
|---|---|---|
| 漏检活动 | FN | 没有匹配边界 |
| 虚假活动 | FP | 没有参考边界 |
| 活动碎片化 | 产生额外 FP | 开始与结束不稳定 |
| 合并相邻活动 | 一对一匹配冲突 | 时长过长 |
| 类别正确但区间偏移 | 可能形成 FP + FN | 边界误差增大 |
| 类别错误 | FP + FN | 无可匹配记录 |
证据层级¶
重复 10/10 开发划分用于在固定 3 秒后验概率上分析 TRL,属于机制诊断。最终 LBSA + TRL 结果则来自 37 条外部记录上的固定三模型工作点。两类证据回答不同问题, 不能混为一谈。
外部测试主要结果为平均用户 F1 0.89、Micro-F1 0.90,TP/FP/FN 为 99/7/15。方案对比、置信区间、分类结果和失败案例见研究结果。
结论边界
这些指标衡量片段记录质量,不能证明临床收益、训练指导质量、安全价值,也不能 证明对新设备或新人群的迁移能力。
复现
评估入口为 python evaluate.py --split external_test。必须使用与冻结模型和策略
对应的授权标签;资产说明见资产。