本研究提出了一种基于动态时间规整(DTW)的分层对齐机制,结合在线自适应与注意力驱动的多模态融合方法,能够实现可靠的长时程意图预测与任务跟踪。轻量级可解释性模块提升了模型的可解释性,有助于增强人机协作中的信任。该方法可推广应用于机器人系统及虚拟交互系统。
研究文章
本研究提出了一种基于动态时间规整(DTW)的分层对齐机制,结合在线自适应与注意力驱动的多模态融合方法,能够实现可靠的长时程意图预测与任务跟踪。轻量级可解释性模块提升了模型的可解释性,有助于增强人机协作中的信任。该方法可推广应用于机器人系统及虚拟交互系统。
实现高效且自然的人机协作仍然是一个重大挑战,尤其是在动态的真实世界环境中。现有框架通常受限于僵化的单模态输入或基于规则的多模态融合,从而限制了其鲁棒性、个性化能力与适应性。本研究提出一种自适应多模态交互框架,该框架在分层的人类意图预测模型中整合了基于视觉的姿态估计与基于语音的指令理解。该框架采用基于Transformer的序列模型进行动作预测,并利用动态时间规整(Dynamic Time Warping)将人类行为与结构化任务图对齐,以实现长期规划。与依赖静态模态切换的先前方法不同,本架构采用基于注意力的融合机制,动态加权最具信息量的输入。此外,一个在线适应模块可实现对用户行为的实时调整,并辅以轻量级的可解释性层以增强用户信任。在协作装配任务中的实验评估表明,该框架在任务表现(最高提升24%)、意图预测准确率(最高提升18%)以及用户满意度方面均有显著提升。这些结果凸显了自适应多模态交互框架的有效性与通用性,支持其推动协作智能向更可靠、透明且以人为中心的AI系统发展。
人机协作(HRC)已成为重要的研究领域之一,尤其是在机器人越来越多地被部署于以人为中心的环境中的背景下。尽管短期人机协作的框架与技术已取得显著进展1,2,长期人机协作的发展尚不成熟3。在工业应用中,长期人机协作的实施有望显著提升复杂制造过程中的生产效率与适应能力4。在家庭环境中,作为伴侣或老年人照护代理的机器人,有望通过长期人机协作提升生活质量5。在医疗领域,社区机器被用作家庭成员和照护者的补充,服务于患有痴呆症、自闭症及其他身体或精神疾病的患者6。同时,在旅游与服务领域,工业机器人被用于提升用户体验与知识获取7。在智能工程中,其目标是以以人为中心的方式融合人工智能,恢复人类能力并实现个性化生产,这一阶段被称为工业5.0。人机智能与人机协作系统已在多种应用领域中得到探索8,9,10;然而,近期研究 increasingly focused on 需要可靠意图预测与长时程任务理解的协作式机器人场景。
人工智能已经深度融入日常生活,其自主或半自主应用在商业的诸多领域日益显现。这表明,当前运行良好的商业功能需要具备适应技术变化和响应组织挑战能力的系统11。因此,在人工智能采纳与实施过程中,通过人机融合来提升人类行为的必要性,有助于克服某些障碍。相应地,混合系统将人工智能与人类智能结合起来共同完成复杂任务,提供更优的结果,并通过向同事学习不断提升自身能力。因此,包含混合智能系统12、协作以及增强智能在内的扩展概念,正在非正式地塑造相关研究,并推动通过整合多样化的AI模式来加强协作的理解。
“"信任"”一词源于人际关系研究,用于定义人类关系中的一种情感联结。例如,有作者13 指出,信任程度在技术上决定了合作方在情感、预期吸引力以及伦理方面的若干特征。从社会学角度看,人际信任的差异对个体福祉、社会互动、社会经济发展以及实际行为具有深远影响14,15,16。人机交互(HRI)本质上旨在突破传统自动化系统在语言障碍方面的局限,实现社会工作者与智能自动化系统之间的程序化对话17。此类交互结合了自主系统的计算优势与人类的直觉判断,从而在多种应用场景中实现高效协作。自动化系统的应用带来了切实的优势:显著降低经济成本、减少生态足迹,并大幅降低人类面临的风险10。然而,在取得诸多成果的同时,人类对机器人的信任仍是一个关键支柱,尤其是在评估交互整体质量时尤为如此18,19。
人类对机器人的信任程度反映了其在诸多领域中的重要性和核心地位。在医疗领域,机器人信任度会影响人机交互(HRI)框架下医疗资源的分配,以及传染病防控措施的实施效率20,21,22。在军事应用中,对自动化装置的社会信任程度决定了军事侦察设备策略的操作效能以及作战运输的准确性23,24。此外,对机器的信任还影响人工智能在军事政策推演中主动信念标准化机制的采纳与应用25。即使在环境研究领域,例如高级别身体运动分析,研究结果的合理性也依赖于对人机交互(HRI)的信任程度26。然而,一个重要的警示是,日益增加的决策复杂性可能削弱这种信任,从而危及人机交互的稳定性27。表 1 概述了多项研究的比较情况。
| 论文(年份,来源) | 主要目标 | 关键方法 & 模式 | 见解 |
| 谢 & Park (2021, arXiv) [28] | 定制情感社交机器人的交互方式 | 基于言语与非言语线索(身体姿态、言语和面部表情)的强化学习策略 | 受强化学习训练的机器人会根据人类情绪调整其行为,提升行为的简洁性与互动性。 |
| 李 et al. (2022, IEEE T-IE) [29] | 促进对制造装配的主动支持 | 意图预测、迁移学习以及多模态学习(视觉 + 骨骼) | 相较于基线方法,机器人主动性的提升;在装配过程中实现更快、更精确的动作预测 |
| Abdelrahman 等(2022,IEEE Access)[30] | 实时估计群体人机交互中的参与度 | 基于规则的分类结合深度学习与视觉眼动/头部姿态分析 | ≥90% F分数;可在物理配置下同时管理多个用户 |
| Chiossi 等(2025,arXiv)[31] | 制造环境中多模态动态意图传递的结构 | 理论多维布局:SAT透明度图层;触觉、听觉和视觉模式 | 建立概念框架,阐释设计环境中的媒介、规划与设计意图。 |
| McGrath 等(2024,arXiv)[32] | 建立可适应的人类与人工智能协作中信心发展的模型。 | 团队阶段与信任前因;一种不依赖特定模式的动态信任模型 | 为交互的所有阶段和时间提供可信感知的设计原则。 |
| Fragiadakis 等(2024,arXiv)[33] | 标准化评估人类与人工智能之间的协作。 | 根据HAIC模式由决策树选择的指标;混合方法指标 | 该框架有助于为人工智能/以人为中心的共生交互模式选择相关指标。 |
| 尤尼斯等人(2023,MDPI)[34] | 基于人口统计学推断实现情境自适应的 HRI | 通过视觉和音频模型估算年龄和性别,并相应地调整机器人行为。 | 该调查总结了人机交互中的各种方法,并强调了定制化适应的重要性。 |
表1:近期关于人机协作研究的比较概述,强调了每项研究的关键目标、方法和发现。 研究中使用的数据集及其规格、规模、模态和参与者分布。
尽管当前的分层多模态人机协作(HRC)框架在利用视觉和音频模态实现长期协作方面已取得显著进展,但仍存在若干研究空白,限制了其在更广泛的人工智能协作场景中的适用性。首先,现有框架主要适用于物理机器人(例如 KINOVA GEN3 机械臂),难以迁移至非具身化或存在于多样化数字环境中的虚拟人工智能代理28。其次,虽然系统涵盖了视觉与语音的多模态输入,但采用的是预定义的模态切换策略,而非根据用户状态或任务难度动态调整的上下文依赖型模态融合机制29。第三,该方法强调任务效率与系统鲁棒性,但未明确建模用户的信任度、认知负荷或情感状态,而这些因素对于长期协作及系统可解释性至关重要。此外,当决策过程缺乏可解释性机制时,人类对系统自适应行为的理解能力和信心将受到限制。最后,现有评估局限于单一领域(玩具汽车组装),缺乏跨领域的验证,无法反映真实世界中的多样性30。这些不足凸显了开发一种通用化、自适应且以人类为中心的多模态交互框架的必要性,该框架应能动态整合异构输入通道,并实时建模人类意图、信任水平与上下文环境,从而增强人机智能协作能力。
本研究的首要目标是通过设计一种自适应的多模态交互系统,将视觉与语音模态与实时用户建模相结合,从而最大化人机智能协作的效能。在稳健的长期人机协作坚实基础之上,本研究将进一步推广该多模态架构,使其适用于机器人领域之外的通用人工智能系统,如虚拟代理和智能界面。研究重点在于动态意图预测 通过 分层规划机制,该机制整合了低层次动作理解与高层次任务进度追踪。与基于规则的系统不同,本文提出的框架将采用自适应学习方法,包括针对用户的模型更新和上下文感知的模态融合,以根据用户偏好、认知状态及环境动态,动态调整交互行为。此外,该框架还致力于通过可解释的交互推理提升透明度与信任度,使用户能够理解人工智能的决策并提供反馈。最后,本研究希望在不同的协作情境中提升交互流畅性、任务有效性以及用户的长期满意度。
本文介绍了一种新的自适应多模态交互框架,旨在通过动态融合视觉和音频模态来促进人与人工智能之间的协作。“单模态”系统指的是仅使用单一输入模态(例如视觉或语音)执行任务和预测意图的模型,不进行多通道间的信息整合。“非自适应”系统指的是基于规则或固定策略的系统,不会根据用户行为或上下文调整其行为,例如基于规则切换的基线系统。这些基线为评估我们所提出的基于注意力引导融合机制的Transformer模型中多模态感知与自适应交互策略的优势提供了参考依据。基于以往的分层人机协作范式31,我们的方法实现了若干重要创新:
本研究提出了一种基于动态时间规整(Dynamic Time Warping, DTW)的对齐机制,可将预期的低层次人类动作映射到分层任务图中的节点,这与以往主要关注短期动作识别的多模态交互系统不同32。面对时间上的不可预测性以及噪声多模态输入,该方法能够实现可靠的长时程意图预测与任务进度追踪。
该系统引入了一个在线自适应模块,可在交互过程中持续更新意图推断和动作预测模型。该模块克服了静态或离线训练的多模态模型的局限性,使系统能够动态适应用户的独特行为、偏好以及情境变化。
基于一种独特的基于注意力的融合技术,视觉和听觉模态根据每个时间步的上下文重要性进行动态加权。这种数据驱动的融合方法提高了在多种交互场景下的鲁棒性,并取代了基于规则的模态切换方式。
本研究引入了一个轻量级的可解释性模块,该模块将分层规划与融合决策转化为易于理解的解释,从而弥合自适应人机智能系统中的可解释性鸿沟。这有助于提升长期协作的质量,并促进对系统信任度的合理校准。
尽管该方法是在利用机器人平台进行的真实世界协作组装活动中得到验证的,但其建议的方法旨在推广到具身机器人之外的虚拟智能体和智能界面,从而扩展其在众多人机协作领域中的应用价值。
访问受限。请登录或开始试用以查看此内容。
提出的人机协同增强架构采用自适应的多模态交互流程,将视觉和语音模态结合到一个动态的、分层的推理框架中。本研究使用了先前已发表实验中的公开数据,未涉及新的受试者,也无需额外的伦理审批。
提出的自适应多模态交互架构
该系统的核心始于感知模块,例如利用RGB-D传感器捕捉用户姿态与动作的视觉流,以及采用轻量级ASR(自动语音识别)引擎分析语音输入的音频流。这些原始输入被送入基于Transformer的动作预测模块,该模块对姿态和指令序列中的时间依赖性进行编码,以推断低层次的人类行为。随后,为了实现高层次的协作规划,采用动态时间规整(Dynamic Time Warping, DTW)机制将检测到的动作与预定义任务图中的节点对齐,从而预测用户目标及下一步动作。一种新的基于注意力机制的融合模块在每个时间步判断哪种模态(音频或视觉)提供了最具上下文重要性的信息,并动态调整输入权重。为实现交互的个性化,系统包含在线模型自适应功能,可实时调整动作预测器以适应用户行为的变化。此外,一个轻量级的可解释性模块生成用户友好的预测意图和人工智能决策摘要,以提升透明度与信任度。整个系统在模拟但贴近真实世界的协作装配环境中进行了测试,支持在单模态与自适应多模态环境之间进行比较。该方法有助于在各个领域实现更具适应性、更直观且更可靠的与人工智能代理的协作。
图1展示了所描述的自适应多模态交互框架的架构,旨在提升人机智能协作。该框架始于输入获取阶段,主要依赖两种传感设备:用于获取增强深度的视觉信息(如人体姿态与运动)的RGB-D相机,以及用于采集语音指令的定向麦克风。原始信号随后进入预处理模块,该模块对音视频数据进行清洗、归一化和格式化,以供后续分析。接着,流程进入特征提取阶段,数据在此被分为两个分支:视觉分支通过姿态估计算法提取姿态与运动特征,音频分支则将语音转录为可解释的指令嵌入表示。随后,一个多模态Transformer编码器对融合后的表示进行处理,该编码器采用多头自注意力机制和时序位置编码,以捕捉交互序列中的长距离依赖关系。用户当前的目标状态由一个长时程意图与任务进度预测器进行估计,低层级动作被映射到分层任务图中的节点,并通过基于动态时间规整(DTW)的对齐模块实现可靠的任务跟踪。融合权重与预测参数通过在线模型自适应循环,根据交互反馈持续更新,同时可解释性模块提供清晰的解释,以增强系统的透明度与用户信任。整个流程使系统能够在动态任务与环境中自适应地与用户高效协同工作。

图1: 基于Transformer的多模态交互框架概览。 采用一种基于注意力机制的引导方法,对视觉与听觉数据进行编码并实现动态融合。Transformer模块整合了分层任务建模与在线自适应机制,用于处理融合后的表征,以实现长期意图预测与任务进展估计。 请点击此处查看该图的放大版本。
该建议的系统包含一个轻量级的可解释性模块,该模块与多模态融合和分层规划组件协同工作,以提高系统的透明度和用户信任度。该模块从基于动态时间规整(DTW)的任务图对齐(例如当前任务进度和预期的下一步动作)以及基于注意力机制的融合层(例如各模态的重要性权重)中提取可解释的线索。这些线索被转化为人类可理解的解释,例如语音指令或视觉手势中哪一个主要影响了系统的决策,以及预期动作如何融入整体工作计划中。用户以简洁的文字或可视化反馈形式接收解释,这有助于他们理解、预测,并在必要时纠正系统行为。评估中表现出的用户满意度提升、交互流畅性改善以及与信任相关的指标,均为用户对可解释性感知的间接体现。研究结果表明,在长期的人机交互过程中,对人工智能决策提供透明的推理过程能够增强用户信心,促进协作,并提高用户对系统自适应行为的接受度。
输入数据
在设想的人机协作框架中,输入获取通过一种结构化的多模态感知机制实现,该机制结合视觉与听觉两种模态,以有效识别人类的动作与意图。视觉输入由一台RGB-D相机采集,用于获取人体的实时姿态信息、空间位置以及周围环境的上下文。视觉数据通过预训练模型(如BlazePose)进行处理,以提取交互任务中关注的上半身关键点。与此同时,系统通过定向麦克风获取听觉信息,并利用预训练的DeepSpeech模型进行解析,以识别语音指令,从而消除视觉线索的歧义或补充不确定的视觉信息。在协作场景中,这种双输入系统提供了动态适应能力与上下文感知能力。训练与评估数据集包含来自四位用户在受控及半结构化环境下的5,000多条多模态人体运动轨迹1,涵盖装配与递送物品等多种交互行为。为增强模型的泛化能力,系统支持部署过程中的在线模型自适应,使模型能够根据用户行为和环境动态的变化实时更新其预测结果。
数据集描述
本研究所提出框架的训练与评估数据集来自基于KINOVA GEN3机器人1在玩具汽车组装任务中开展的真实人机协作实验。实验环境旨在模拟包含多模态交互(包括视觉和听觉模态)的长期协作活动。具体而言,训练数据集包含来自两名用户的3,003条轨迹序列,测试数据集包含来自两名新用户的2,088条序列,用于评估模型的泛化能力。每条轨迹记录了通过BlazePose提取的上半身姿态关键点的5步序列,以及由DeepSpeech33转录的相应语音指令。所收集的数据反映了人类在物体递送、工具使用和协作动作等活动中手势与指令表达的自然差异。该多模态数据集是DLinear动作与轨迹预测模型进行监督学习的基础,也是在仅视觉、仅听觉及多模态条件下开展用户研究的核心基准。纳入不同类型的用户及真实噪声条件,确保了对长期人机协作系统进行鲁棒性与适应性测试。 表2展示了数据集的详细描述。
| 属性 | 详细信息 |
| 数据集名称 | Toy Car Assembly Dataset(实验室内部采集) |
| 采集环境 | 基于 KINOVA GEN3 机械臂的真实人机协作实验 |
| 用户数量(训练) | 2 名用户 |
| 用户数量(测试) | 4 名用户(其中 2 名来自训练集,2 名未见过的用户) |
| 总轨迹数(训练) | 3,003 条轨迹 |
| 总轨迹数(测试) | 2,088 条轨迹 |
| 采集的模态 | 视觉(用于姿态估计的 RGB-D 数据)、音频(语音指令) |
| 数据格式 | 姿态关键点(来自 BlazePose)、语音转文本指令 |
| 时间分辨率 | 每条轨迹包含 5 个时间步 |
| 涵盖的任务 | 3 项主要任务:抓取与放置、物体旋转、协作装配 |
| 用途 | 用于动作/轨迹预测模型的监督训练;用户研究 |
表2:数据集描述。关于仿真环境的信息,包括编程框架、硬件设置和评估环境。
数据集预处理
为了在人机协作中实现自适应的多模态交互,需要对原始数据集(如视觉数据(RGB 和深度图像)、听觉数据(语音指令)以及时间行为数据(姿态关键点))进行结构化预处理。视觉数据首先通过姿态估计模型 fpose 提取,该模型通常来源于 BlazePose 或 OpenPose。对于第 t 帧,人体姿态向量定义为:
(1)
其中 k 为关键点的数量,每个关键点包含二维坐标。序列通过躯干长度进行归一化,并使用 Savitzky-Golay 滤波器在时间上进行平滑处理:
(2)
其中,w 为滤波窗口的大小。其次,原始音频流 At 通过语音活动检测器(Voice Activity Detector, VAD)被切分为若干片段,可信片段被输入至语音识别模型 f言语,(例如 DeepSpeech)以提取命令标记:
(3)
其中 V 是已识别命令的词汇表。在整合过程中,所有命令标记均通过基于插值的对齐函数 τ 与视觉姿态时间戳进行时间对齐:
(4)
第三,为了构建时间意图训练序列
,我们定义轨迹序列以及对应的语音指令
。这些序列通过大小为 l 的滑动窗口被分割为固定长度的片段:
(5)
(6)
最后,为了在基于轨迹的预测模型中实现收敛,将输入数据按每个关键点维度进行归一化处理,使其均值为零,方差为单位方差:
(7)
其中 μj 和 σj 分别是关键点 j 在训练集上的均值和标准差。
特征提取
在所述的自适应多模态交互范式中,通过结合视觉、音频和上下文任务特征,实现了强健且实时的协作。特征提取流程首先从两个主要模态同步采集数据:时间步 t 处的视觉信号
和音频信号
。这些观测数据随后输入对应的感知模块,以提取与人类行为、意图及语音指令相关的高层语义特征。
提取视觉特征
来自 RGB-D 相机的原始视觉数据
经由人体姿态估计器(例如 BlazePose)处理,生成空间关键点向量
,其中 k 表示检测到的关键点数量,每个关键点包含三维坐标:
(8)
这些关键点被嵌入到姿态轨迹
中,并通过趋势-季节性分解提取运动动力学特征:
(9)
其中 ∈_t 表示残差噪声。
提取音频特征
音频输入
经过预训练的语音识别模型(例如 DeepSpeech)处理,生成一个分词化的命令表示
,其中 n 为分词长度:
(10)
多模态融合
为了构建统一的交互上下文,我们基于置信度和互信息,通过置信度加权注意力机制对特征进行融合:
(11)
其中,ϕV 和 ϕA 分别为将视觉和听觉特征投影到共享潜在空间的投影函数,αt∈[0,1] 是基于熵计算得到的动态模态加权项:
(12)
此处,
和
分别表示目标状态 g 与观测模态之间的互信息。
基于上下文嵌入的规划
最后一个多模态特征向量 Ft 通过任务上下文和进度 Pt 进行增强,并作为状态输入传递给自适应规划模块:
(13)
该提取的特征 xt 被用作下游意图预测和运动规划模型的输入,以支持在动态且不确定的环境中实现自适应且鲁棒的人机协同。
动作与计划预测 通过 任务图对齐
在多模态特征提取过程之后,将语音意图(音频)、姿态轨迹(视觉)以及上下文信息(例如任务日志或情绪)数据进行整合,并在后续处理中采用分层任务图对齐方法实现自适应的人类行为预测与计划推断。
设时间步 t 的集成多模态特征向量表示为:
(14)
该系统首先预测低层次的人类行为 通过 函数 f活动,通常表示为循环编码器-解码器或变换器:
(15)
其中,F(t-k:t) 表示最近 k 个时间步长内的特征融合序列,
是来自动作集合 A 的预测动作。该模块通过自适应损失进行在线微调:
(16)
此处,CE 为动作分类的交叉熵损失,第二项则用于促进对未来轨迹的准确预测。
对于高级别计划预测,我们将任务建模为沿层次化任务图 G = (N, E) 的推进过程,其中每个节点 ni ∈N 表示一个子任务或中间目标。目标是通过最小化距离,将观测到的动作序列与参考任务路径 R*∈G 进行匹配:
(17)
其中 Pt 表示当前的进度轨迹,d(⋅) 表示动态时间规整(Dynamic Time Warping, DTW)距离或软对齐度量。
最终的计划层级意图
通过将预测动作 â_t 投影到对齐路径中概率最高的下一步
上得出:
(18)
这种分层解码机制确保了即使在感官输入不清晰或存在噪声的情况下,系统仍能选择与当前任务序列最相符的、上下文最相关的高层意图。这种预测性规划不仅提高了人机协作的效率,还增强了多轮人机交互中的预判能力和适应性。
多模态融合(基于注意力)机制
在自适应的人机协作中,必须整合多种感觉模态(例如,视觉:人体姿态、轨迹;听觉:语音指令),以正确理解用户的意图。基于规则或静态的融合方法无法应对现实世界中动态的人机交互。为此,本文提出一种基于注意力的融合机制,可根据每一时刻各模态的上下文重要性,动态调整其权重。
我们将从视觉和听觉模态中提取的特征向量分别记为
和
。这些向量编码了通过前期处理流程获得的语义信息,例如,视觉特征可能来源于姿态估计和动作预测,而听觉特征则可能通过使用 DeepSpeech 或 wav2vec 等模型提取的语音嵌入得到。
基于注意力融合的目标是计算模态特异性的注意力权重,以捕捉每种模态的相对重要性。这是通过软注意力机制实现的。
注意力权重计算
第一步,通过可学习的变换将两个向量映射到共享的注意力空间。也就是说,对于每一种模态 i∈{V,A},中间注意力得分的计算方式如下:
(19)
其中
与
为注意力网络的可学习参数,tanh 为非线性激活函数。该转换使模型能够提取每种模态的高层相关性及上下文显著性。
然后通过 softmax 函数对这些未归一化的注意力得分 eV 和 αA 进行归一化,使其总和为 1
(20)
此处,αV 和 αA 分别表示对视觉和听觉模态的注意力权重。这些权重具有自适应性,并会根据当前的任务上下文、信号质量以及用户活动随时间动态更新。
(21)
所得的融合表示
是通过对输入模态向量进行加权组合而获得的:
该联合向量以主动突出最具信息量的模态流的方式,编码了视觉与听觉信息的共同语义。随后,该向量被输入至下游模块,如任务图匹配、意图预测或机器人运动规划引擎。
算法 1:基于多模态注意力的融合
输入:视觉特征向量为 hV∈Rd,音频特征向量为 hA∈Rd
可学习参数:W∈Rk*d,w∈Rk 和 b∈Rk
输出:融合表示 hfused∈Rd。
步骤 1:通过使用公式 19 进行计算,确定中间表示
步骤 2:使用公式 20 通过 Softmax 对注意力得分进行归一化
步骤 3:使用公式 21 计算融合向量
步骤 4:返回 hfused
基于注意力的多模态融合算法提供了一种智能融合多种输入模态特征的方法,例如以情境感知的方式将视觉和音频流的特征进行融合。在各模态提供互补但不同的信息的系统中,融合至关重要,例如在人机协同环境中,视觉模态捕捉手势或身体姿态,而音频模态捕捉语音指令或声音信号。
算法1首先确定每种模态的中间表示。为了计算视觉流的eV和音频流的eA这两个模型,共享的神经网络层首先对相应的特征向量进行非线性变换。然后,通过对中间得分执行softmax函数来计算注意力权重αV和αA。这使得权重为正值且总和为1,从而实现每种模态贡献的归一化。某种模态的信息量越丰富,其注意力权重就越大。
最终,该算法通过图形和音频特征向量的加权组合,并结合各自对应的注意力权重进行归一化,计算出融合表示 hfused。该融合向量以数据驱动且上下文敏感的方式整合了两种模态,可用于意图识别、决策制定或机器人运动规划等下游任务。总体而言,该算法使系统能够在特定时刻动态地关注最相关的模态或模态组合,而非采用固定的或基于规则的融合方法。这使得该框架在动态的人机交互情境中更加强大、灵活且具有响应性。
图2 展示了基于注意力的多模态融合机制的工作流程,该机制在视觉与听觉输入的上下文敏感整合中发挥作用。工作流程的第一步是视觉特征提取,即从输入图像或视频(如RGB-D相机数据)中提取空间或姿态相关特征。随后,这些特征被输入至视觉注意力模块,该模块学习突出显示视觉信息中最具信息量的内容。与此同时,音频注意力模块处理来自语音指令的语音嵌入或音频标记,赋予不同听觉信号以相应的上下文重要性。经过注意力加权后的特征通过基于注意力的融合层进行整合,并传递至带有残差连接和层归一化的位置级前馈网络,构成标准的Transformer编码器模块。输出结果为统一的多模态嵌入表示,支持在不同交互条件下实现鲁棒的长时程意图预测与自适应决策。该设计使系统能够在任意时刻选择性地关注更具优势的模态,从而提升在实时人机交互中的鲁棒性与可解释性。

图 2:注意力引导的多模态融合模块的详细结构。 为了在每个时间步生成具有上下文感知能力的融合表示,模态特异性编码器从视觉和听觉流中提取特征。随后,这些特征通过一种数据驱动的注意力机制进行动态加权。请点击此处查看该图的放大版本。
在线模型自适应
为确保在不同用户行为和情境下实现高质量的人机协作,本框架引入了一种在线模型自适应机制,可在交互过程中持续优化针对特定用户的模型。该模块追踪实时行为信号(例如姿态、手势轨迹、语音语调),并利用增量学习算法更新底层预测模型。特别是,轨迹预测与意图识别模型会根据近期输入进行微调。 通过 基于梯度的微调或低秩适应(LoRA),使系统能够在无需完全重新训练的情况下适应用户行为的变化或特定任务的需求。
反馈层通过隐式反馈(例如纠正、犹豫、延迟)和显式指令(例如语音或图形用户界面)与自适应机制协同工作。其具有两个目的:自适应地校准多模态线索的显著性,以及向决策和控制模块传递信任度/置信度指标。
反馈循环能够实现更流畅的任务执行和以用户为中心的响应。为了培养信任与透明度,该框架整合了一个可解释性模块,将底层模型的决策转化为人类可理解的解释。该模块利用来自多模态融合变换器的推理图谱,并结合任务图中的逻辑追踪来实现。该推理过程可选择通过图形用户界面(GUI)或听觉辅助方式呈现,使用户能够理解甚至纠正系统行为。
访问受限。请登录或开始试用以查看此内容。
本文提出的自适应多模态交互模型解决了上述问题,通过无缝融合视觉与语音模态,并结合实时用户自适应机制,显著增强了人机协作效果。与基线分层多模态系统相比,我们的方法引入了个性化反馈循环以及认知负荷感知的自适应机制,从而实现更直观、更具情境感知能力的交互体验。在模拟协作任务(如物体操作、组件呈现以及基于序列的目标完成)的实验测试中,该系统始终表现出更高的效率、灵活性以及用户满意度。具体而言,所提出的方法在完成任务所需时间上减少了25%,在意图预测准确率上提升了15%,尤其在复杂的交互情境下表现更为突出。此外,用户感受到更流畅的交互过程以及更高的系统透明度,这证明了自适应反馈在支持长期协作中的必要性。表 3展示了所提出方法的仿真环境。
...| 模拟 | 描述 |
访问受限。请登录或开始试用以查看此内容。
研究结果明确证明了所提出的自适应多模态交互基础在增强人机协作方面的有效性。
除了任务完成时间(TCT)、人类意图预测准确率(HIPA)、多模态融合效率(MFE)、错误恢复率(ERR)、用户满意度评分(USS)和交互流畅性指数(ISI)等标准评估指标外,还可添加其他以用户为中心的指标,以深入分析自适应多模态框架。特别是可引入认知负荷指数(CLI),用于量化参与者所产生的认知努力,从而评估自适应融合在协同工作过程中是否降低了用户的压力。
信任校准评分可用于实证验证可解释性模块在多轮使用过程中对用户系统信心的影响程度,以此作为衡量该框架在维持适当信任水平方面性能的指标。最后,学习曲线分析能够展示系统与用户在一系列试验中的学习过程,确定协作过程中性能、错误恢复能力以及信任关系的发展情况。这些补充性测量指标共同将认知与情感层面的因素融入技术性指标之中,从而对所提出的范式提供更为全面的评估。图8展示了基于用户的测量如何更深入地揭示自适应多模态交互的性能表现。认知负荷指数(CLI)...
访问受限。请登录或开始试用以查看此内容。
作者衷心感谢中国无锡江南大学设计学院提供的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| RGB-D 摄像头(Intel RealSense D435) | Intel Corporation | D435 | 深度分辨率为 1280×720 像素 @ 30 fps;RGB 分辨率为 1920×1080 像素 @ 30 fps;用于捕捉用户姿态、身体动作和空间上下文 |
| 指向性麦克风 | 通用 / 多个供应商 | N/A | 宽带、降噪麦克风(16 kHz–44.1 kHz);用于采集语音指令 |
| BlazePose(预训练模型) | https://developers.google.com/mediapipe/solutions/vision/pose | 具有 33 个关键点的姿态估计模型;用于实时人体姿态提取 | |
| OpenPose(预训练模型) | CMU 感知计算实验室 | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 多人姿态估计框架,用于提取运动轨迹 |
| DeepSpeech 语音识别引擎 | Mozilla | v0.9.3 | 预训练的自动语音识别模型,用于语音转文本转录 |
| wav2vec 2.0 语音识别引擎 | Meta AI | https://github.com/facebookresearch/fairseq | 自监督语音表征模型,用于实时语音处理 |
| 基于 Transformer 的动作预测模型(DLinear / Seq2Seq) | 自定义实现 | N/A | 具有注意力机制的时间编码器-解码器架构,用于短期动作预测 |
| 动态时间规整(DTW)模块 | 自定义 / 基于 SciPy | https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html | 软对齐算法,用于将用户动作与预定义任务图进行匹配 |
| 基于注意力的多模态融合网络 | 自定义实现 | N/A | 采用置信度加权注意力机制,融合视觉和语音输入 |
| 在线自适应模块(LoRA / 基于梯度) | 自定义实现 | https://github.com/microsoft/LoRA | 轻量级、参数高效的微调方法,用于适应用户行为 |
| 可解释性模块(基于规则 + 注意力图) | 自定义实现 | N/A | 利用规则和注意力可视化提供可解释的决策依据 |
| KINOVA Gen3 机械臂 | KINOVA Robotics | Gen3 | 7 自由度机械臂,集成扭矩传感器;用于协作式玩具汽车组装 |
| 协作式装配仿真环境 | 自定义环境 | N/A | 真实世界中的玩具汽车组装设置,用于多模态协作性能基准测试 |
| 评估指标(TCT、HIPA、MFE、延迟、ERR、USS、ISI) | 自定义定义 | N/A | 用于评估协作效率、准确性和信任度的定量及以用户为中心的指标 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可