2019年5月7日
本实验方案的目的是详细介绍如何在实验室中采集视频数据;如何记录参与者观看这些视频时的眼动数据;以及如何利用机器学习技术高效分析参与者所观看视频的内容。
许多眼动追踪研究依赖于复杂的视频刺激和真实世界环境,使得数据分析极为复杂。该分析技术相较于目前可用的方法,能够更丰富且自动化地分析基于视频的数据,从而更深入地提取更为复杂的数据。该方法可广泛应用于多种不同的眼动追踪场景,尤其适用于真实世界情境或使用视频作为刺激的研究。
景观研究一直依赖于对人们如何响应不同视觉刺激的理解。将这种技术与眼动追踪相结合,可用于验证这些假设。对于此类研究,团队合作至关重要,因为多个方面都需要高水平的投入和考量。
与我共同演示该程序的是我的研究生 Andrew Treller。影片序列应在具备自然光但可调控以避免屏幕反光的眼动追踪实验室中播放,使用尽可能大的屏幕,以占据尽可能多的视野范围,从而避免视野外的干扰。在让受试者坐在距离屏幕 60-65 厘米的位置后,要求他们设想自己处于需要修复的情境中,使用一句能够让受试者在眼动追踪视频的背景下进行想象的语句。
然后使用台式眼动仪,按照预先设定的随机顺序向参与者播放视频,以记录其在观看每个视频过程中的眼动轨迹。设计感兴趣区域时,应选择与研究相关的对象,例如树木、灌木、路标、建筑物、小径、台阶等。为了获得最佳性能并减少训练需求,应选用那些肉眼易于区分、和/或在各视频帧中持续占据不同区域的元素。
通常,只要包含足够多的训练样本,能够清晰展现每个兴趣区域(AOI)的视觉差异,就足以实现稳健的性能。当所有项目修改完成后,选择适当数量的训练帧以构成训练集。训练帧的数量没有固定标准。
接下来,在图像编辑软件中打开视频中的每一帧训练图像,并为每帧加载的图像叠加一个透明图层用于标注,同时创建一个颜色调板,为每个感兴趣的特定对象类别分配一种颜色。要选择感兴趣样本区域的颜色,请在目标区域内点击并拖动像素,使用调板中对应的颜色对样本区域进行着色。完成某一帧的标注后,将叠加图层导出为单独的图像文件,注意确保导出文件的基础文件名与原始帧的基础文件名一致,但需在末尾添加字母 C。
为了定量验证训练后分类器的准确性,需从原始视频序列中选取未被纳入训练集的帧,并参照前述训练帧的标注方法,尽可能精确且全面地对每帧中的像素进行标注。完成一帧的标注后,采用与训练集相同的命名规则,并将文件保存至单独的验证帧文件夹中。为实现视频序列的自动像素标注,请启动 Darwin 图形用户界面,然后点击“加载训练标签”。
要配置用于训练和标注的图形用户界面,请选择“创建项目”,并在弹出的对话框中为项目命名。在弹出窗口中选择包含视频序列所有原始帧的文件夹。使用弹出的文件浏览器对话框,选择包含相关视频序列标注训练图像的文件夹。
在文件资源管理器对话框中,选择包含相关视频序列所有已标注验证图像的文件夹。根据提示,选择一个目标文件夹,用于保存所有输出帧,这些输出帧将以与训练过程中相同的颜色调色板进行标注。在弹出的对话框中,在“感兴趣区域”部分输入需要标注的区域,包括在训练样本中标记每个区域时所使用的红/绿/蓝(RGB)数值。
该算法将检查每个已标注的训练帧,并学习外观模型,以将像素分类为任意指定的目标类别。训练完成后,点击“验证训练”,在文件资源管理器对话框中,选择包含相关视频序列所有已标注验证图像的文件夹。
为了直观验证生成的标签,请点击视觉验证。每个生成的带标签图像将与原始验证帧并排显示。如果在定量或定性验证中观察到的准确度低于可接受水平,请增加更多训练样本并重新进行训练。
分类器的训练和验证阶段完成后,单击“运行推理”以开始使用训练好的分类器对视频序列中的所有帧进行完整标注。标注完成后(可能需要数小时),单击“浏览输出”以查看生成的标签结果。大多数眼动追踪软件会显示,在第一个视频中,参与者的视线在x坐标上左右扫描的程度平均高于第二个视频;第二个视频的热图则呈现出更圆润的形状。
利用本文所述的机器学习像素标记技术,我们可以观察到更多细节。这种百分比注视时间的图形化表示表明,在视频播放过程中,该路径清晰可见。然而,正如眼动追踪数据中的这张图所示,参与者仅在关键位置偶尔注视该特征。
此处展示了本项代表性研究中全部39名参与者在观看视频过程中注视不同物体的停留时间总览。在该图表中,相同的注视时间数据被根据不同物体在视频中所占据的时间和空间比例进行了归一化处理。若某物体的数值为1,则表明其被注视的时间完全可由该物体在视频中出现的时长和空间范围来解释。
例如,与图像中的其他物体相比,相关性较低的物体(如两幅图像中的天空)被注视的时间相对较短。与其它自然物体相比,路灯和长椅等人工物体被注视的时间更长。此类分析可用于研究注意力和显著性相关的问题,并可广泛应用于不同研究领域。
随着短片作为视觉刺激的使用日益普遍,我们预计这种技术将变得更加流行。
查看完整文字稿并访问数千部科学视频
本方案概述了一种在实验室环境中采集和分析眼动追踪视频数据的方法。该方法强调使用机器学习技术来增强对视觉刺激的分析。
在复杂环境中理解视觉注意力有助于神经科学和行为研究中的靶点验证。该方法通过分离出由刺激驱动的注视模式与混杂变量,增强了机制层面的风险降低能力。它能够为城市健康和环境暴露研究中的注意力生物标志物提供可预测的置信度。
该方法通过提供可量化的、与刺激同步的行为终点指标,融入从假设检验到先导物识别的发现连续过程。