跳转至

方法

以这份视频自评数据为例,解释报告中的时间差、部署个人校正、把画像留到下次,需要分别审查。研究者整理证据,程序给出下一步,并记录理由、责任人和复审条件。

证据仍由人判断,行动仍由人负责。程序不会自行验证研究是否真实、完整。

协议总览:具体用途、人工证据审查、有序规则、行动,以及包含责任人与复审条件的决策记录。
Fig. 1. 新证据出现或用途改变时,更新记录并重新审查。 查看大图 ↗

审查规则

R1使用范围

结论是否超出了实际测试的人群、场景或信息条件?

结果可能依赖特定人群、场景或信息条件。证据不足以支持更广泛用途时,就只在已测试的范围内解释和使用。

查看正式条件与代码
R2额外收益

增加传感器或自动调整,真的带来改善了吗?

先与本项研究已经测试过的对照方案比较。没有证明额外收益时,保留该对照方案。

查看正式条件与代码
R3用户结果

只改善了模型指标,还是也检验了真实使用中的用户结果?

测量指标改善或表达偏好,不能证明实际使用中的收益。如果部署依据只有这些,就先开展预注册的真实使用研究。

查看正式条件与代码
R4长期复用

长期复用前,验证过稳定性、适用性和人群覆盖吗?

画像换到下次实验或其他场景,未必仍然适用;参考数据也可能未覆盖相关人群。证据缺失或不充分时,暂不长期保存或跨场景复用。

查看正式条件与代码
R5许可条件

是否有支持这项用途的直接证据,并满足用户控制或可逆等条件?

可逆的个性化操作,也需要与用途匹配的直接用户结果证据。满足全部许可条件、且没有其他规则要求限制时,才可在已测试范围内使用。

查看正式条件与代码

证据不足时,不会默认通过。

执行顺序与许可边界

R4 → R2 → R3 → R1 → R5

上方问题按编号介绍,不代表执行顺序。程序按优先级数值从小到大执行,由首个匹配规则决定结果;对应的优先级依次为 10、20、30、40、90。

  • R1 只限定结果的适用范围,不等于批准个性化。
  • R5 必须独立满足全部许可条件,且未命中更高优先级的约束。
  • 未匹配任何规则时,程序请求补充具体缺失的证据,不会默认许可。
查看解析器实现
校准示例

从其他校准视频学到的校正,降低了相对于参考轨迹的误差。这足以支持部署吗?

  1. 记录证据:与对照相比有改善,但评价测量的是参考误差,尚未检验直接用户收益。
  2. 解析规则:该记录未命中 R4、R2;替代指标评价触发 R3,并先于 R1 决定行动——开展预注册的情境内用户研究。
  3. 获得与用途匹配的直接证据,并预先明确收益与伤害标准后,更新记录并重跑全部规则,包括 R5 的其他条件。
查看已有校准记录

研究问题

同一段记录可以用来描述本次报告、估计个人时间校正,或建立供以后使用的画像。计算得出这些结果,还不足以说明每种用途都合适。

需要分别判断:差异能解释到哪一步,额外采集的信息是否有帮助,以及校正是否能给使用者带来收益。下面三个研究问题围绕这些判断展开。

RQ1
同一套规则,能否审查不同用途,并按预期给出结果?
RQ2
测量条件改变后,画像还能说明什么?
RQ3
增加传感器或反馈后,多了哪些有用证据?