跳转至

评估设计

这条主线来自 MER-PS 数据中的视频观看与连续自评任务。本文对已发布数据做二次分析,没有新增采集或部署实验;另外用已有界面研究中的记录检查同一套规则。

评价设计:24 名参与者与 15 个视频生成四条工作用途记录,与六篇 HCI 论文中的七条作者编码记录一起用于协议评价。
Fig. 2. 数据分析提供四条用途记录,供规则测试使用;额外轨迹分析不增加正式审查记录。 查看大图 ↗

规则测试 RQ1

用本研究的 4 条用途记录,以及作者从 6 篇论文整理的 7 条记录,检查规则能否按定义运行。

外部案例由本研究作者整理,并非独立研究者对审查结论的验证。

数据分析 RQ2 / RQ3

我们分析 24 名参与者观看 15 个视频时的报告,计算它们相对参考报告的时间差异。这些测量结果构成文中的“画像”,用于研究解释、传感、校准与复用所需的证据。

数据与分析详情

MER-PS 的 360 次试验来自一次会话、固定视频库和同一种二维摇杆界面。连续自评采用 1–255 的效价—唤醒度尺度。

标量传感与跨视频校准采用五折外层、四折内层参与者划分。内容及生理轨迹分析同时留出参与者和已发布视频;SAM 重建留出参与者,并使用同一视频的训练报告。参考、目标、缩放与模型选择均在相应训练边界内重建。

时间偏差量预测的误差以秒计,轨迹误差以摇杆标注单位计。区间与划分敏感性描述的是该数据集上的开发结果,不是独立确认队列。

统计分析登记表