评估设计
这条主线来自 MER-PS 数据中的视频观看与连续自评任务。本文对已发布数据做二次分析,没有新增采集或部署实验;另外用已有界面研究中的记录检查同一套规则。

规则测试 RQ1
用本研究的 4 条用途记录,以及作者从 6 篇论文整理的 7 条记录,检查规则能否按定义运行。
外部案例由本研究作者整理,并非独立研究者对审查结论的验证。
数据分析 RQ2 / RQ3
我们分析 24 名参与者观看 15 个视频时的报告,计算它们相对参考报告的时间差异。这些测量结果构成文中的“画像”,用于研究解释、传感、校准与复用所需的证据。
数据与分析详情
MER-PS 的 360 次试验来自一次会话、固定视频库和同一种二维摇杆界面。连续自评采用 1–255 的效价—唤醒度尺度。
标量传感与跨视频校准采用五折外层、四折内层参与者划分。内容及生理轨迹分析同时留出参与者和已发布视频;SAM 重建留出参与者,并使用同一视频的训练报告。参考、目标、缩放与模型选择均在相应训练边界内重建。
时间偏差量预测的误差以秒计,轨迹误差以摇杆标注单位计。区间与划分敏感性描述的是该数据集上的开发结果,不是独立确认队列。
统计分析登记表