本文综述了深度学习、多模态感知以及集成策略方面的最新进展,这些进展实现了人类与机器人之间无缝、自适应且以人类为中心的通信。
综述文章
本文综述了深度学习、多模态感知以及集成策略方面的最新进展,这些进展实现了人类与机器人之间无缝、自适应且以人类为中心的通信。
随着社交机器人、辅助机器人和教育机器人进入家庭、医疗保健机构和教室等日常环境,无缝的多模态人机通信变得至关重要。在这些场景中,机器人需要以高精度、低延迟和强健的现实适应性,整合语音、手势、注视、面部表情以及触觉线索。本综述系统地考察了当前技术如何实现实时、双向的多模态人机交互(HRI),重点关注融合策略、系统架构以及在特定领域的应用。我们检索了Web of Science核心合集2015年至2025年间以英文发表的实证研究,筛选出148篇涉及交流整合的论文。其中最重要的发现包括:自2022年以来,融合方法明显转向混合式和基于注意力机制的融合(约占所有方法的43%),相较于早期方法,能更有效地处理时间异步性和具身交互;评估指标普遍存在不一致性,阻碍了跨研究的比较;实验室中表现优异的系统在面对噪声、遮挡或用户差异等现实条件时,其鲁棒性仍明显不足。关键挑战包括实时处理、语义对齐、数据效率、部署鲁棒性,以及触觉信号与情感信息整合的研究尚不充分。展望未来,本综述建议优先发展自适应融合策略、建立针对同步性和流畅性的标准化基准,并推动持续学习,以实现面向用户个性化适应的能力。最终目标是指导开发更具人性化、能够在日常生活中实现协作性、有意义且社会可接受的机器人智能体。
机器人已从结构化环境中使用的工业工具,发展为融入家庭、医院和教室等社会场景的智能体。如今,它们在教育、治疗和陪伴等方面提供辅助,体现了从以任务为导向的自动化向以用户为中心、具备适应性交互的转变。这一转变的核心在于多模态通信,使机器人能够以动态环境中自然交流所需的时序精度,感知并响应人类的多种线索——包括言语、注视、手势、面部表情和触觉。这种对协调性与响应性的强调,与人机交互和认知科学领域的核心问题高度一致。本文所指的无缝多模态通信,是指对用户而言流畅且直观的交互体验,其特征包括亚秒级响应时间(通常小于300毫秒)、可感知的延迟或不匹配最小化,以及对现实世界中各种变化的强适应能力。这使其区别于传统的基于指令或单模态的系统,后者常因时序误差、模态失效或僵化的响应而破坏交互的自然性。
在人机交互(HRI)领域,本综述聚焦于人机通信,即人类与机器人之间多模态信号的双向实时交换。尽管HRI还包括规划、控制与安全等方面,但通信关注的是跨感官通道的感知与行为的同步。早期基于命令的系统优先考虑效率而非交互性,常导致僵化或延迟的行为表现。当前的研究致力于开发适应性强、具备情境感知能力的模型,以适应用户状态与情绪1,2。这一发展趋势凸显了构建精确、直观且个性化的交互框架的必要性。
早期的社交与辅助机器人通常依赖预设脚本程序或单一模态输入(如语音或触控),灵活性受限3。基于规则的逻辑和较慢的处理速度常导致手势与语音之间的时间不同步,或难以适应用户行为。为解决这些问题,研究人员采用低延迟融合、多模态感觉整合以及用户自适应学习技术4,5。这些策略可通过人机交互(HRI)领域广泛认可的三个基本沟通原则加以理解:互补性(不同模态相互补偿)、冗余性(信息重叠提升鲁棒性)和协同性(多模态汇聚增强自然性)。
传感与学习技术的进步催生了能够实时整合视觉、听觉、触觉及生理输入的社交响应型机器人5,6。这类系统不再依赖固定脚本,而是持续根据用户的提示进行自适应调整。便捷的编程接口与示范学习方法使教育工作者和治疗师能够针对护理与教学场景定制机器人的行为,这些场景对精确性、响应能力与适应性具有较高要求。
社交人机交互中的交流模式可分为并行式、互补式和交互式三种(图1)。在并行交互中,人类与机器人独立行动,交流极少。互补交互引入了结构化提示或基于事件的支持。最先进的交互式模式则涉及在言语、动作和视线等多个通道上持续进行的双向调整7。
文献筛选与分析
系统综述方法学:我们在 Web of Science 核心合集数据库中进行了系统的文献检索,目标为来自主要出版商(IEEE、ACM、Springer、Elsevier、Wiley、Taylor & Francis)的同行评审期刊文章和完整的会议论文集。布尔检索式为:(("human-robot interaction" OR HRI) AND (multimodal OR "sensor fusion" OR gesture OR gaze OR speech OR tactile) AND ("real-time" OR "low-latency" OR adaptive OR robust))。纳入标准为:2015年1月至2025年期间以英文发表的文献——该时间段涵盖了从基于规则的单模态系统向强调低延迟、自适应和鲁棒性交互的深度学习架构的转变过程——重点关注用于交流型人机交互的多模态融合技术,并具有实证验证(定量或定性)。排除仅限于单模态交互的研究、仅涉及机器人控制而无交流意图的研究,以及非实证性工作(例如纯理论性或仅基于仿真的研究)。初始检索获得大量文献,去除重复项后,我们根据纳入标准对标题和摘要进行筛选,随后进行全文审阅,以评估其相关性及对可靠多模态融合的贡献。这一多阶段筛选过程如 PRISMA 风格流程图(图2)所示,最终确定148篇论文作为本综述的实证基础。
精选文献概述: 图3 显示出版趋势与学科分布,涵盖计算机科学与自动化领域 & 机器人学占据主导地位,同时行为科学与神经科学的贡献日益增长,凸显了该领域的跨学科发展趋势。我们根据文献在多模态融合方面的技术贡献进行了主题聚类表1)。该综述涵盖了模态选择、融合方法、延迟处理、鲁棒性策略、适应性以及评估指标。2019年至2021年的研究主要采用早期融合或晚期融合,通常侧重于手势和触觉输入。自2022年以来,混合融合与基于注意力机制的架构逐渐受到青睐,尤其适用于情感计算与具身交互场景。在该语料库中,混合融合约占研究方法的43%,早期融合占29%,晚期融合占28%,这一分布表明对时间异步性的容忍度有所提升。
尽管在初步筛选的广泛文献中,实时性能力常被提及,但仅有少数研究详细描述了具体的缓解策略(例如,缓冲处理、预测模型或传感器层面的优化)。鲁棒性通常依赖于滤波、冗余设计或基于规则的备用方案,而具有前瞻性的自适应方法仍然罕见。评估方法不一致,对时间同步性或交互流畅性的标准化评估仍不常见。各研究之间的指标差异极大,导致直接比较往往困难。准确率、F1分数和延迟数据虽常见,但它们来源于不同的数据集、任务和环境条件;很少有论文采用共享的基准来评估时间对齐或抗噪声能力。因此,在干净的实验室环境中表现出的优异性能,常常夸大了这些方法在受控环境之外的实际效果。建立一致的评估框架——或许可包括在真实变异性条件下的标准化延迟测试——将极大地方便判断哪些方法真正推动了该领域的发展。
在触觉-情感整合方面仍存在关键空白(仅有六项研究8,9,10,11,12,13涉及此问题),以及在用户驱动的时间不确定性下动态调整延迟的问题。文献中暴露出若干值得关注的矛盾。尽管混合融合常被认为能有效处理时间错位问题14,但真正具有前瞻性或适应性的行为仍十分罕见,这令人质疑其所宣称的实时性能是否真正无缝。与此同时,基于视觉和语音的情感识别已取得显著进展,相比之下,将触觉线索与情感理解相结合的研究却极为有限。在受控实验中表现出的高准确率在真实世界条件下往往显著下降,凸显出在不同环境和用户之间泛化能力方面持续存在的挑战。表2总结了具有代表性的架构趋势和评估方法,为后续章节讨论的挑战提供了依据。
本综述为多模态人机交互(HRI)领域的文献提供了独特的贡献。近期的综述,如 Zhao 等人14,对感知驱动的决策机制进行了广泛概述,而 Wang 等人15则聚焦于5G支持的视觉-触觉信息传输。这些研究均强调通用框架或通信协议,对实时融合的权衡、指标可比性或部署挑战的讨论较为有限。相比之下,我们提出了更具针对性的分析:在特定约束条件下比较融合策略,批判跨研究间指标的不一致性,并突出实际应用中的差距——尤其是先前综述普遍忽视的实验室到实际场景的性能差异问题。
访问受限。请登录或开始试用以查看此内容。
随着机器人逐渐成为家庭、教室和医疗环境中的常见设备,自然且自适应的交流对其成功至关重要。机器人 increasingly 被视为社交伙伴而非工具,必须能够感知、解读并响应跨模态的人类信号。能够准确捕捉用户意图并提供及时反馈的系统可提升任务表现、信任感以及情感舒适度——尤其是在与儿童、老年人或残障人士互动时。实现这一目标需要持续且直观的交互,使机器人的回应与人类正在进行的行为保持一致,而非打断该行为。这种流畅性要求通过模仿人类自身交流机制的方式,整合语音、注视、手势和面部表情等多模态输入14,16。
感知与通信通道
视觉仍然是多模态人机交互的基础。面部表情、注视方向、姿势和手势等视觉线索是意图识别、情绪推断和参与度追踪的关键17,18,19,20,21。早期基于手工设计的方法,如使用Haar检测22或背景减除23,在遮挡或光照变化条件下常常失效16,21。目前,深度学习系统占据主导地位,采用卷积神经网络(CNN)和循环模型,并结合多摄像头输入。 图4 展示了HI-ROS跟踪流程,该流程在实时手势监测中将运动误差降低了27%。
整合注视、手臂和头部线索可提高对用户行为的预测能力17,而本体感觉与深度信息的融合则增强了操作精度24,25。相互注视19和仿生眼设计18进一步证明了细微信号在建立信任与协作中的作用。图5展示了文献26中的架构,其中两个Leap Motion控制器捕捉手部运动,并通过LSTM-RNN进行融合,以实现稳健的手术遥操作。近期的多摄像头系统,如Hi-ROS20和RPF21,27,提升了在非结构化环境中对人员的跟随能力。图6展示了自适应ReID生命周期,该流程通过持续优化分类器,在目标被遮挡时仍能维持跟踪。在主动标注28和语义SLAM26方面的互补研究进一步提升了上下文感知能力,使感知能力从物体识别扩展到行为理解。
语言提供了一条并行的交流通道。早期基于规则的对话系统在处理歧义时存在困难,促使研究转向数据驱动和基于变换器的模型29。当前,情感与社会响应能力至关重要:多模态系统通过协调面部与声音信号实现自适应对话2,30。强化学习可改善情感与声学线索之间的协同5,31,32。诸如 GPT-333 和 ChatGPT34 的大语言模型能够在多种任务中实现上下文推理与指令遵循35,36,37。这些模型与视觉和奖励建模的整合38,39,40,41,42,43,44,支持具备社会感知能力的通用化交互。
听觉感知补充了视觉和语言。当视觉线索不可靠时,韵律、音高和节奏能够传达意图。基于强化的特征提取可改善语音与表情之间的同步性。AVA ActiveSpeaker45、AFFECT-HRI5、SAVEn-Vid46、HumorHRI47 和 CHiME-5 等数据集增强了模型在嘈杂和情感丰富环境中的鲁棒性。Pan 等人32 推进了多说话人场景下的语音–唇动同步技术,而结合触觉或生理信号的多模态融合则有助于实现自适应行为。
具身感知与生理传感
触觉与生理感知可增强社交与物理环境的觉察能力。力、压力及生物信号可用于推断个体的意图、压力状态和参与程度。基于视觉的触觉模拟器(如 TACTO4)以及神经映射器(如 FOTS48)能够以每秒 300 帧的速度生成高分辨率的接触数据,支持低延迟控制。FOTS 通过学习得到的反射率函数 R 来建模光照与形变:

以及阴影投影:

其中 Ms 编码了投影几何结构。利用磁流变弹性体49、EtherCAT 传感器阵列50 和拉胀型霍尔效应材料51 已经实现了高分辨率触觉皮肤。诸如 DiGeTac13 之类的系统通过模块化流程整合了手势、触觉和距离信号。飞行时间距离数据的滤波建模如下:

随后进行神经手势分类和基于卷积神经网络(CNN)的接触定位。通过距离 d 调节机器人速度以实现安全控制。这些模块实现了鲁棒的人机协作。多模态 Transformer 进一步融合了触觉、视觉和文本信号。TVT-Transformer6 将模态特定的表示(qi, ki, vi)对齐为联合矩阵:

实现跨模态自注意力,以达成统一理解(图7)。
生理信号感知技术推动了情感对齐的发展。Heinisch 等人5将生理信号与音视频信号同步,用于情感建模。基于肌电图的系统52,53可解码手势和无声言语,而 MetaSonic54通过声学定位增强空间感知能力。大规模数据集(如 AgiBot World Colosseo55)支持多模态训练,包含超过一百万条触觉-视觉轨迹数据。这些进展共同标志着从单模态感知向对社会、物理及内部状态的综合理解转变。感知保真度的提升使机器人不仅能够测量接触,还能解读犹豫、紧张或不适,并以敏感性和自适应控制作出响应,这为后文讨论的无缝多模态框架奠定了关键基础。
多模态融合与表示学习
融合能够将分布式的感知流转化为连贯且具有上下文感知能力的控制信号。通常将融合方法分为早期融合、晚期融合或混合融合。早期融合在输入阶段整合特征,支持同步线索的处理,例如言语–手势或面部–韵律特征的对齐。Tsai 等人提出的多模态 Transformer14 是基于注意力机制的视觉、声学和文本信号早期融合的典型代表。Xue 等人56 通过引入面部关键点与语音特征的残差耦合扩展了该方法,在光照变化条件下提升了鲁棒性;而 Hu 等人提出了 MMSERNet57,这是一种采用空洞卷积和残差融合的多尺度融合网络,用于融合 MFCC、频谱图和词汇特征以实现情感识别。融合后的输出可表示为:

相比之下,晚期融合在独立处理后合并决策,对异步或含噪声的输入具有更高的容忍度。例如,在水下人机交互(HRI)中,将视线、惯性与运动信号在决策层面进行融合58,59。混合融合则整合了上述两种方法——将异构模态映射到共享的嵌入空间,同时保留时间特异性。多模态脑-机融合网络60在分类前对齐脑电图(EEG)和视觉特征,而用于3D姿态估计的跨模态设计则融合了惯性与单目视觉数据61。近期的框架将卷积层、循环层与变换器层结合,并通过注意力机制实现对齐62,63,根据上下文或任务相关性动态加权各模态64,65,66。早期融合、晚期融合与混合融合之间的选择并非放之四海而皆准。当模态高度同步且噪声水平较低时,早期融合通常表现更优,因为它能从初始阶段就捕捉丰富的跨模态关系。相比之下,在复杂、异步的真实世界条件下,晚期融合通常更具鲁棒性,因为各模态可在决策合并前独立处理。混合方法目前出现在约43%的近期研究中,尤其适用于情感性与具身交互场景,通过注意力机制实现输入的动态平衡,尽管其计算开销更高。最终,最佳策略取决于具体任务、噪声特征以及硬件限制,这表明未来的系统可能受益于动态切换融合模式。
不同模态之间的互补性也随情境变化而表现出显著差异。视觉与触觉结合在近距离物理任务中尤为有效,例如抓取或物体传递,此时触觉反馈能够弥补视觉遮挡、光照变化或距离限制带来的不足,并提供音频无法实现的精确力和接触信息。相反,在远距离或社交场景中,例如在嘈杂环境中进行情绪识别或对话时,视觉与听觉结合的效果更佳,因为当视觉线索不可用或不可靠时,韵律和语调能够传达意图和情感状态。
除了经典的早期、晚期和混合框架之外,深度学习实现了更精细的分类。基于注意力的融合使模型能够学习每个输入的动态模态重要性,从而有效地创建针对特定任务和上下文的融合路径,而无需严格的阶段边界。学习型融合策略更进一步,将整个融合过程视为一个端到端可微分的模块,使网络能够直接从数据中发现最优的组合模式。这些进展推动了该范式从预定义规则转向完全数据驱动、自适应的架构,从而更有效地应对实时多模态人机交互(HRI)的复杂性。
视觉-语言关联
大型语言模型的快速发展拓展了多模态推理的应用范围,尤其是通过视觉-语言模型(VLMs)。这些架构将语言与视觉信息进行对齐,使机器人能够理解指令、感知场景并生成符合上下文的动作。LXMERT64 和 CLIP66 等基础框架建立了图像-文本对齐的联合嵌入表示。Flamingo65 引入了少样本多模态推理能力,而 Maggio 的 Clio39 通过 CLIP 语义将指令动态链接到场景图。Gao 等人41 开发了 LAMARS,基于多模态预测实现前瞻性规划;Xie 等人67 应用时空卷积模型以高效理解手势。Arenas 等人提出了基于提示的定制化方法,用于个性化交互风格68。这些系统使得诸如 拿起红色杯子 的指令能够直接在场景语义中实现关联与执行。
与空间推理的结合进一步增强了机器人导航与理解能力。Wilson 的 LatentBKI38 将指令锚定于基于体素的空间地图中,而 Nwankwo 等人40 将大语言模型与视觉语言模型(VLM)推理相融合,以在视觉不确定条件下解析对话行为。基于事件的分割与异步感知方法则提升了动态任务的效率。总体而言,视觉语言模型(VLM)在符号化指令与具身理解之间起到了桥梁作用,为灵活交互提供了认知基础。
领域特定应用
在医疗和老年护理中,多模态通信能够实现安全、直观且富有同理心的辅助。核心功能——如跌倒检测、日常活动监测和应急响应——依赖于姿势、语音和面部线索3。分层控制模型可提高上肢辅助机器人运动的精确性1,而本体感觉反馈则指导协作式穿衣辅助系统69。物体传递过程如图8所示,是感知与运动协调同步化的典型示例70。通过LOVOT等系统研究的情感响应能力可增强用户信任,但也引发了关于过度依赖的伦理问题。
社交机器人需要流畅的多模态响应能力,以在家庭和公共环境中维持共情与信任。图9 展示了一个典型的架构,该架构整合了感知、规划和社会情感推理层。结合感知能力的大语言模型能够根据目光和语调调节开放式的对话40。儿科研究表明,富有表现力的动作和语调可降低儿童的焦虑水平71,而调查则强调非语言行为是影响参与度的关键因素8。诸如 RoboAgent37 和基于子先验引导的蚁群优化算法(Sub-Prior-guided Ant Colony Optimization)72 等主动式模型,能够实现对共同目标的联合探索。能够表达内部状态(如“准备就绪”、“困惑”)的系统73 可增强透明性与协作效率,而具备适应性的社交代理则可促进群体协作74,75。
教育机器人:在教育领域,多模态人机交互(HRI)通过利用具身性与社会信号促进学习动机与知识获取76。结合手势、面部表情和言语线索可增强可及性与参与度6,9,77,78。情感适应性有助于低龄学习者:能够感知情绪状态并调节语音与动作的系统可提高注意力与词汇量7,79。与虚拟现实的整合可提升沉浸感,但在可扩展性方面仍面临挑战80。总体而言,这些系统使机器人的角色从单纯的指导者转变为具备情感共鸣的协作伙伴。
个性化可确保多模态系统中的相关性和信任度71,81,82。伦理层面的个性化在自主性与共情之间取得平衡,通过参与式反馈来定制回应。Maaz 等人83展示了基于面部和认知线索的情感化辅导,而 Gomez-Izquierdo 等人84则建立了用户偏好模型以实现同步行为。个性化适应可形式化为:

其中 wi 为学习得到的偏好权重。诸如 RFIS 等实现可在边缘端实现实时行人重识别与手势识别85,而本体感知触觉界面10则可实现直观的物理交互。社交感知效应进一步调节个性化结果,叙述者身份会改变用户的响应时间和语句长度86。因此,个性化使用户从被动接受者转变为共同设计者,通过相互适应来塑造交互过程。
尽管综述的大部分工作仍处于研究原型阶段,但一些多模态人机交互(HRI)技术已从研究原型发展到商业或工业应用。例如,软银(SoftBank)的 Pepper 机器人在零售和教育环境中,将语音、手势和面部表情识别集成用于客户服务和教育87。丰田(Toyota)的“人机辅助机器人”(Human Support Robot)则采用视觉-手势融合技术,在家庭和医疗机构中执行辅助任务88。这些商业应用通常会简化融合策略,普遍采用晚期或混合融合方法,并结合基于规则的备用机制,以确保系统的可靠性与低成本,这凸显了先进学术模型与可扩展的工业解决方案之间持续存在的差距。弥合这一差距将需要更加重视边缘部署以及严格的现实环境验证。
人机交互中无缝通信的挑战
尽管多模态感知与融合技术取得了进展,但在受控环境之外实现顺畅的人机通信仍然困难。在实验室中表现优异的模型,往往在面对噪声、延迟、遮挡、意图变化或资源限制时性能下降。现有文献归纳出六个相互关联的障碍:视觉-语言融合、实时同步、多模态鲁棒性、语义精确性、数据集覆盖范围以及部署限制。
视觉与语言的整合
视觉理解是实现具身语言与行为的基础。基础性进展通过视觉-惯性SLAM技术提升了空间一致性和抽象能力,且无需手动初始化89,结合重识别与传感器融合实现对遮挡具有鲁棒性的跟踪16,车道图预测90,以及将标签与导航实用性对齐的半监督分割方法,并利用以自我为中心的视频结合SLAM和大规模分割来判断可通行性26。具备不确定性感知的地图构建仍处于核心地位:uPLAM将概率定位与全景分割相结合,适用于动态场景91,而Clio则自适应地构建基于CLIP的分层3D场景图,以支持任务敏感的语义理解30。具身化方法已从结构化描述和感知API92,93发展为多模态编码器与解码器架构94,95。
在开放环境中执行指令需要整合感知与推理能力。RobotGPT35 和 GroundingGPT36 通过视觉-语言联合推理解读指令;SayPlan、LFG 和 LLM-Planner 将导航与规划与具象化语言对齐34,44。为减少幻觉并确保语义一致性,GLAM 和 Vtimellm 引入了对齐目标96,97,而自适应框架则通过感知信息验证大语言模型(LLM)的输出98,99。时间控制对可理解性至关重要:优化的手势时序可提升可预测性9;强化学习减少了情感处理流程中的音视频延迟2;手势同步增强了流畅性的感知100;相关综述则整合了用于对齐的 LSTM、DTW 和 GAN 工具101。总体而言,实现无缝交互需要在感知、融合与响应之间建立低延迟感知的闭环系统,其中模仿机制30 与受小脑启发的预测机制102 协同调控时序,这一点也在 图10 所示的系统级时序回路中得到体现。
跨模态的实时感知
流畅性取决于异构数据流之间的有限端到端延迟。TACTO 以低延迟提供高分辨率的触觉反馈,实现响应迅速的操作。肌腱驱动的手部通过事件视觉和轻量级推理实现快速交互式操作103,如图11所示。在视觉–语言–动作耦合方面,将 CLIP 与 GraspNet 结合可加速在杂乱环境中的抓取操作104。Transformer 模型支持快速的社会性触觉手势分类11。面向边缘优化的音视频模型可实现亚秒级推理24。精确的头部运动时序可提升交互参与度105。综上,这些结果表明需要实现同步融合、按模态定制缓冲策略,并采用轻量级注意力机制以保持时间上的协同适应能力。可接受的延迟因任务领域而异。在社交对话或情绪识别中,延迟低于 200–300 ms 可维持感知上的流畅性和自然交互。对于物体递送或跌倒检测等辅助性任务,则需要更严格的延迟限制(50–150 ms),以确保安全性和响应性。遥操作或协作操作通常要求低于 100 ms 的延迟,以避免操作者迷失方向或产生运动病,而导航或监控类应用在 300–500 ms 范围内的延迟通常不会造成严重影响。
时间与语义处理挑战
错位与延迟会削弱信任度和任务效率,尤其是在分布式遥操作员–机器人–人类系统中106。感知与界面策略有助于用户容忍延迟:身体姿态和非词汇填充语107、视觉叠加和自适应提示108,109,110,111。控制层面的预测可缩短响应间隔102。并行对话流水线将填充内容生成、语音合成和提示编辑重叠处理,以减少感知延迟,如112及图12所示。系统研究对采集、编码/解码、网络、决策和执行等环节的累积延迟进行了分解分析113。如图13所示,延迟来源于传感器采集、视频编码与解码、网络传输、操作员处理以及车辆执行,形成一个复杂的双向反馈回路。Syntalos为闭环实验提供了毫秒级同步支持114。在情感交互中,实时面部模仿可增强同步性23。在对延迟敏感的领域(如远程手术)中,以触觉反馈锚定延迟的视觉信息可提升操作精度与响应性115。如图14所示,锚定触觉反馈带来了更优的表现和更强的响应感。
细微情绪效应与意图识别仍然具有挑战性。微表情、语调、注视方向以及预判性动作通常短暂且异步发生。Emo 能够生成与用户状态一致的预判性面部表情116。在面部或声音不可用的情况下,仅通过肢体语言即可传达意图117。基于 Pepper 机器人的多模态表达将言语分类与富有表现力的手势及表情符号相结合,以实现情绪同步118。在线强化学习增强了面部与语音流的融合2,而轻量级模仿机制则支持边缘部署30。当前尚未解决的问题包括群体效应、文化差异以及随时间推移的情绪效应漂移。
在开放领域中的泛化能力也存在局限。基于人类反馈的强化学习(RLHF)在分布外输入条件下表现出奖励稀疏和脆弱性119。RoboAgent 将空间推理与语言 grounding 相结合,实现跨任务迁移29。基于无动作数据的推理(Reasoning through Action-free Data, RAD)利用被动视频和语言数据,在无需人工标注的情况下实现零样本能力120。Perceiver-Actor 将物体属性进行 grounding,以操作不熟悉的物品121。RobotGPT 和 GroundingGPT 中感知与语义的持续对齐提升了自适应推理能力,但仍面临实时反馈的挑战35,36。
多模态鲁棒性与环境变异性
鲁棒性必须涵盖信号完整性和行为一致性。SimuMuHRI 引入特定模态的噪声和信号丢失以测试其恢复能力122。基于物理的结构光仿真可提升 RGB-D 在光照变化和遮挡条件下的可靠性123,124。延迟与触觉耦合揭示了远程操作中的敏感性问题125。来自安全关键型能源系统的冗余性和热稳定性的原理为容错人机交互提供了依据126,127。
行为一致性同样至关重要。声音与外貌的不匹配会降低信任度128,而虽正确但不连贯的动作会削弱合作效果129。基于观测器的自适应力控制和鲁棒交互控制器可在结构化与非结构化不确定性条件下维持系统稳定性130,131。数据集的覆盖范围也制约着研究进展。多机器人感知数据集——OPV2V132、CoPeD133、CSE134 和 AgiBot World Colosseo55——拓展了仿真与实地场景中的协同感知能力。面向自动驾驶人机交互(AV-HRI)的资源——CHiME-5135 及其后续的 CHiME-8 挑战赛136、AVA-ActiveSpeaker45、AFFECT-HRI5 和 SAVEn-Vid46——支持自动语音识别、说话人活跃度检测、情感识别以及长上下文指令跟随任务。大规模社交基准数据集——HumorHRI47、THÖR-MAGNI137、RW4T138 和 InViG139——分别针对幽默理解、导航、团队协作和交互式语义 grounding。尽管这些数据集覆盖广泛,但许多仍局限于特定领域或依赖脚本生成,且在时间维度上的深度有限,难以充分评估交互的流畅性,如表3所总结。
无缝性评估
传统的指标(如准确性和延迟)无法充分反映共适应、相互预测或社交流畅性。新的评估方法对情境连贯性和协作性进行评分140,整合用户反馈和情境信号141,并在物理人机交互中加入可预测性、协调性和舒适性指标84。团队协作框架可量化共享预期74,而数字孪生技术则用于追踪信任校准和团队流畅性142。目前仍缺乏一个统一的基准,能够融合时间同步性、情感一致性以及以用户为中心的流畅性。
在多模态人机交互(HRI)评估方面的标准化工作仍然有限且分散。诸如CHiME挑战赛135,138等重要倡议推动了视听语音识别的基准发展,特别是在抗噪声鲁棒性方面。THÖR-MAGNI137和RW4T138等数据集为动作捕捉和团队协作行为提供了共享资源。然而,目前尚无被广泛采纳的统一协议可用于跨模态时间同步、交互流畅性或在不同模态与领域间的情感对齐。这种标准化度量的缺失持续阻碍着研究的可重复性与结果的可比性,凸显了建立由学术共同体推动的基准体系的迫切需求。
从实验室到现实世界的应用
由于感知不规则性、意图变化以及计算瓶颈,系统在非结构化环境中的性能通常会下降143。这种性能退化凸显了实验室环境与现实世界应用之间长期存在的差距。在受控环境中,混合式融合与基于注意力机制的融合表现出色,能够以高准确率和低延迟完成物体操作或场景理解等任务。然而,在现实世界的部署中情况则截然不同。用于老年人照护的辅助机器人、家庭中的陪伴系统以及课堂中的教育工具,常常面临噪声干扰、遮挡、光照变化以及用户行为不可预测等问题,导致其有效性显著降低。在这些多变且异步的条件下,晚期融合方法往往表现出更高的可靠性;而尽管混合模型在情感识别与上下文适应方面具有优势,但其在边缘设备上的计算需求可能成为限制因素。许多成功的实地应用仍依赖较简单的冗余机制或基于规则的安全保障措施以提升可靠性,这表明从有前景的实验室演示迈向稳定可靠的日常应用仍是一项艰巨挑战。生态效度高的测试对于识别哪些技术能在受控实验之外真正奏效至关重要。自适应鲁棒控制器能够在干扰存在的情况下维持力控精度131。由大语言模型(LLM)驱动的协作规划可随用户意图的变化动态更新目标144。视觉叠加显示与考虑延迟的反馈机制有助于在通信链路质量下降时维持操作者的态势感知107,109。结合LoRa与数字影子的轻量级监控方案可在低带宽环境下实现远程监测145。来自空间机器人领域的经验表明,在存在不确定性与通信延迟的情况下,自主性必须与人类认知协同发展146。
资源限制决定了可行性。基于声音的情感与触觉识别在低功耗平台上运行时,内存占用低于 1 MB,计算量低于 0.7 GFLOPs12。添加社交功能可能增强临场感,但当延迟增加时,存在系统过载的风险147。调度策略与功能选择必须在认知负荷与交互连续性之间取得平衡148。延迟缓解措施涵盖感知、控制与网络层面,如文献113所归纳。用户通常更倾向于透明且稳定的交互,而非最大化任务效率,这表明无缝的人机交互(HRI)必须在技术能力与人类舒适度之间同时优先考虑149,151。在不同应用领域中,实际部署表现出明显差异:社交与教育类应用通常依赖视觉-音频的混合融合以实现情感化对话,而辅助性与协作性任务则更倾向于采用视觉-触觉组合,并通过晚期或早期融合实现精确的物理交互。这些模式与总结的策略一致——在变化环境中优先采用晚期融合以增强鲁棒性,而在需要更丰富情境适应时采用混合或基于注意力的融合方法——尽管为提升可靠性而进行功能简化仍较为普遍。
访问受限。请登录或开始试用以查看此内容。
本综述存在若干局限性。将检索范围限定于Web of Science核心合集中的英文文献,可能引入语言偏倚,并排除了相关的非英文研究成果。聚焦于2015年至2025年间发表的同行评审文章,也可能反映出出版偏倚,从而可能遗漏预印本、灰色文献或正在出现的未发表结果。尽管对148篇论文的筛选过程依据明确的标准进行,但人工筛选仍不可避免地带有一定主观性。最后,对趋势的主题解读反映了我们自身在这一快速发展的领域中的观点。
尽管存在这些局限性,该综述仍指明了推进无缝多模态人机交互(HRI)的明确优先方向。实时同步以及在非结构化环境中的鲁棒性仍是最重要的挑战,因为它们直接影响系统的部署可靠性与用户信任。未来,该领域应优先发展三个相互关联的方向:能够根据噪声水平和同步程度动态选择策略的情境自适应融合策略;用于时间对齐、跨模态延迟和交互流畅性的标准化基准;以及突破性方法,例如面向边缘优化的多模态变换器或持续学习技术,以实现无需完全重新训练的长期适应。集成轻量级大语言模型用于前瞻性意图预测,以及触觉-视觉协同适应,有望进一步加速该领域的发展。
无缝...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
本工作由马来西亚理科大学资助,项目编号:R501-LR-RND003-0000001342-0000。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可