Обзорная статья

Бесшовная мультимодальная коммуникация между человеком и роботом: методы интеграции в взаимодействии человека и компьютера

DOI:

10.3791/70218

9 июня 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот обзор обобщает последние достижения в области глубокого обучения, мультимодального сенсора и стратегий интеграции, которые обеспечивают бесшовную, адаптивную и ориентированную на человека коммуникацию между людьми и роботами.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Бесшовная мультимодальная коммуникация между человеком и роботом стала необходимой, поскольку социальные, вспомогательные и образовательные роботы появляются в повседневных условиях, таких как дома, медицинские учреждения и классы, где им необходимо интегрировать речь, жест, взгляд, мимику и тактильные сигналы с высокой точностью, низкой задержкой и реальной надёжностью. В этом обзоре систематически анализируется, как современные методы достигают взаимного мультимодального взаимодействия человека и робота (HRI) в реальном времени, с акцентом на стратегиях слияния, архитектурах систем и приложениях в конкретных областях. С 2015 по 2025 год мы искали в основной коллекции Web of Science эмпирические исследования на английском языке, выбрав 148 статей, посвящённых коммуникативной интеграции. Наиболее важные открытия включают явный сдвиг в сторону гибридного и внимания-ориентированного слияния с 2022 года (около 43% подходов), который лучше справляется со временной асинхронностью и воплощёнными взаимодействиями, чем предыдущие методы; широкое несоответствие в метриках оценки, мешающее сравнению перекрёстных исследований; и устойчивый разрыв между сильными лабораторными показателями и более слабой реальной устойчивостью под шумом, окклюзией или изменчивостью пользователя. Ключевые задачи включают обработку в реальном времени, семантическое выравнивание, эффективность данных, надёжность развертывания и малоизученную интеграцию тактильных сигналов с аффектом. Смотря в будущее, обзор предлагает приоритизировать политики адаптивного слияния, стандартизированные бенчмарки синхронизации и беглости владения, а также постоянное обучение для обеспечения персонализированной адаптации пользователя. В конечном итоге её цель — направлять развитие более ориентированных на человека роботизированных агентов, которые могут взаимодействовать совместно, значимо и быть социально приемлемыми в повседневной жизни.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Роботы эволюционировали от промышленных инструментов в структурированных условиях до социально встроенных агентов в домах, больницах и классах. Теперь они помогают в обучении, терапии и общении, отражая переход от автоматизации, ориентированной на задачи, к ориентированному на пользователя адаптивному взаимодействию. В основе этого перехода лежит мультимодальная коммуникация, позволяющая роботам воспринимать и реагировать на человеческие сигналы — речь, взгляд, жесты, мимику и осязания — с временной точностью, необходимой для естественных обменов в динамичных условиях. Этот акцент на координации и отзывчивости соответствует ключевым вопросам взаимодействия человека и компьютера и когнитивной науки. В данном обзоре бесшовная мультимодальная коммуникация относится к взаимодействиям, которые кажутся пользователям плавными и интуитивными, характеризуются временем отклика менее секунды (обычно менее 300 мс), минимальными заметными задержками или несоответствиями, а также надёжной адаптацией к реальной вариативности. Это отличает её от традиционных командных или унимодальных систем, где ошибки в тайминге, сбои модальности или жёсткие реакции нарушают естественный поток.

В рамках взаимодействия человека и робота (HRI) этот обзор сосредоточен на коммуникации между человеком и роботом, определяемой как взаимный, в реальном времени обмен мультимодальными сигналами между людьми и роботами. Хотя HRI также включает планирование, контроль и безопасность, коммуникация связана с синхронизацией восприятия и действий через сенсорные каналы. Ранние командные системы ставили эффективность выше боя, часто вызывая жёсткое или задерживаемое поведение. Современные работы используют адаптивные, контекстно-ориентированные модели, учитывающие состояние пользователя иэмоции 1,2. Эта эволюция подчёркивает необходимость точных, интуитивно понятных и персонализированных рамок взаимодействия.

Начальные социальные и ассистентные роботы обычно опирались на скриптовые рутины или одномодальные входы, такие как голос или касание, что ограничивалогибкость 3. Логика, основанная на правилах, и медленная обработка часто приводили к несоответствию времени между жестами и речью или к плохой адаптации к поведению пользователя. Для решения этих проблем исследователи применяют синтез с низкой задержкой, мультимодальную сенсорную интеграцию и адаптивное к пользователю обучение 4,5. Эти стратегии можно понять через три основных принципа коммуникации, широко признанных в HRI: комплементарность (модальности компенсируют друг друга), избыточность (перекрытие повышает устойчивость) и синергия (сходимость повышает естественность).

Достижения в области восприятия и обучения привели к созданию социально отзывчивых роботов, которые интегрируют визуальные, слуховые, тактильные и физиологические сигналы в реальном времени 5,6. Вместо фиксированных скриптов эти системы постоянно адаптируются к пользовательским сигналам. Доступные программные интерфейсы и методы обучения на демонстрациях позволяют педагогам и терапевтам настраивать поведение для ухода и обучения, где необходимы точность, отзывчивость и адаптивность.

Модели коммуникации в социальном HRI можно сгруппировать на параллельные, дополняющие и интерактивные режимы (рисунок 1). В параллельном взаимодействии люди и роботы действуют независимо с минимальным обменом. Взаимодополняющее взаимодействие вводит структурированные подсказки или поддержку, основанную на событиях. Самый продвинутый, интерактивный режим включает непрерывную двунаправленную регулировку по каналам, таким как речь, движение и взгляд7.

Отбор и анализ литературы

Методология систематического обзора: Мы провели систематический поиск литературы в Web of Science Core Collection, ориентируясь на рецензируемые статьи и полные материалы конференций ведущих издательств (IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis). Булевый запрос был: (("взаимодействие человека и робота" ИЛИ HRI) И (мультимодальный ИЛИ "слияние сенсоров" ИЛИ жест ИЛИ взгляд ИЛИ речь ИЛИ тактильный) И ("в реальном времени" ИЛИ "низкозадержка" ИЛИ адаптивный ИЛИ устойчивый)). Критерии включения: англоязычные публикации с января 2015 по 2025 год — период, посвящённый переходу от правилоориентированных систем с одной модальностью к архитектурам глубокого обучения с акцентом на низкое задержка, адаптивное и надёжное взаимодействие — с акцентом на мультимодальные методы интеграции для коммуникативного HRI и эмпирической валидации (количественной или качественной). Мы исключили исследования, ограниченные унимодальными взаимодействиями, те, что касались управления роботами без коммуникативного намерения, а также неэмпирические работы (например, чисто теоретические или только симуляционные). Первоначальный поиск дал значительный корпус. После удаления дубликатов мы отбирали заголовки и аннотации по критериям включения, а затем проводили полнотекстовые обзоры для оценки релевантности и вклада в надежное мультимодальное слияние. Этот многоэтапный процесс, суммированный в блок-схеме в стиле PRISMA (рисунок 2), дал итоговый корпус из 148 статей, которые составляют эмпирическую основу данного обзора.

Обзор избранной литературы: Рисунок 3 показывает тенденции публикаций и распределение дисциплин, при этом доминируют информатика и автоматизация и робототехника, а также растущий вклад поведенческих наук и нейронаук, что подчеркивает междисциплинарный путь отрасли. Мы тематически сгруппировали литературу по техническому вкладу в мультимодальную интеграцию (Таблица 1). Этот синтез охватывал методы, методы слияния, обработку задержек, стратегии устойчивости, адаптивность и метрики. Исследования с 2019 по 2021 год преимущественно использовали раннее или позднее слияние, часто делая акцент на жестах и тактильных сигналах. С 2022 года гибридные и ориентированные на внимание архитектуры получили популярность, особенно для аффективного и воплощённого взаимодействия. В этом корпусе гибридное слияние составляет примерно 43% подходов, раннее слияние — 29%, позднее слияние — 28% — распределение, свидетельствующее о повышенной толерантности к временной асинхронности.

Хотя в более широкой литературе, изначально отборованной, часто утверждается возможность реального времени, лишь ограниченное число исследований подробно описывает конкретные стратегии смягчения последствий (например, буферная обработка, прогнозные модели или оптимизация на уровне сенсоров). Устойчивость обычно основана на фильтрации, избыточности или резервных вариантах, основанных на правилах, тогда как предвосхищающая адаптация остаётся редкой. Методы оценки непоследовательны, а стандартизированные оценки временной синхронизации или беглости взаимодействия остаются редкими. Метрики настолько сильно различаются в разных исследованиях, что прямые сравнения часто бывают затруднены. Точность, показатели F1 и показатели задержки распространены, но они обусловлены разными наборами данных, задачами и условиями окружающей среды; Немногие статьи используют общие ориентиры временного выравнивания или устойчивости к шуму. В результате высокая производительность в чистых лабораторных установках часто преувеличивает, какие методы можно достичь вне контролируемых условий. Разработка последовательных систем оценки — возможно, включая стандартизированные тесты на задержку при реальных вариативностях — значительно упростила бы оценку, какие подходы действительно продвигают область.

Ключевые пробелы сохраняются в тактильной и аффективной интеграции (только шестьисследований 8,9,10,11,12,13 рассматривают эту проблему) и динамической корректировке задержки при пользовательской временной неопределённости. Из литературы выделяется несколько интересных напряжённостей. Гибридное слияние часто хвалят за то, что он хорошо справляется со временными несоответствиями, однако действительно предвосхищающие или адаптивные поведения остаются редкостью, что ставит под сомнение бесшовность заявленной производительности в реальном времени. В то же время впечатляющий прогресс в распознавании аффектов на основе зрения и речи резко контрастирует с минимальной работой по интеграции тактильных сигналов с пониманием эмоций. Высокая точность в контролируемых экспериментах также склонна ухудшаться в реальных условиях, подчёркивая постоянные трудности в обобщении между средами и пользователями. Таблица 2 обобщает репрезентативные архитектурные тенденции и подходы к оценке, что объясняет проблемы, обсуждаемые в последующих разделах.

Этот обзор вносит особый вклад в мультимодальную литературу по HRI. Недавние опросы, такие как Zhao et al.14, дают широкие обзоры принятия решений, основанных на восприятии, в то время как Wang и др.15 сосредоточены на визуально-тактильной передаче с поддержкой 5G. Оба акцентируют внимание на общих фреймворках или протоколах коммуникации, с ограниченным обсуждением компромиссов в реальном времени слияния, сопоставимости метрик или сложностей развертывания. В отличие от этого, мы предлагаем более целенаправленный анализ: сравнивая стратегии синтеза при определённых ограничениях, критикуя несоответствия метрик между исследованиями и выявляя практические пробелы — особенно разрыв между лабораториями и полями, который ранее в значительной степени упускали из виду.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обзор и перспектива

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Поскольку роботы становятся неотъемлемой частью дома, классов и медицинских учреждений, естественная и адаптивная коммуникация становится критически важной для их успеха. Их всё чаще рассматривают не как инструменты, а как социальные партнёры, и они должны воспринимать, интерпретировать и реагировать на человеческие сигналы в разных форматах. Системы, которые точно фиксируют намерение пользователя и предоставляют своевременную обратную связь, повышают выполнение задач, доверие и эмоциональный комфорт — особенно при взаимодействии с детьми, пожилыми людьми или людьми с ограниченными возможностями. Для достижения этого требуется непрерывное, интуитивное взаимодействие, которое согласует реакции роботов с текущим поведением человека, а не прерывает его. Такая беглость требует мультимодальных входов — голоса, взгляда, жеста, мимики — интегрированных через механизмы, отражающие само человеческоеобщение 14,16.

Каналы восприятия и коммуникации
Зрение остаётся основой мультимодального взаимодействия человека и робота. Визуальные сигналы, такие как мимика, взгляд, осанка и жесты, лежат в основе распознавания намерения, вывода эмоций и отслеживаниявовлечённости 17,18,19,20,21. Ранние ручные методы с использованием обнаруженияХаара 22 или фоновоговычитания 23 часто не сдавались из-за изменений окклюзии илиосвещения 16,21. Теперь доминируют системы глубокого обучения, использующие CNN и повторяющиеся модели с многокамерными входами. Рисунок 4 иллюстрирует конвейер отслеживания HI-ROS, который снижает ошибку движения на 27% при мониторинге жестов в реальном времени.

Интеграция сигналов взгляда, рук и головы улучшает предсказание действийпользователя 17, а проприоцептивное и глубинное синтез повышаютточность 24,25. Взаимный взгляд19 и биомиметические дизайны глаз18 дополнительно демонстрируют роль тонких сигналов в доверии и координации. Рисунок 5 показывает архитектуру из 26, где двойные контроллеры движения с прыжками фиксируют движение руки, объединённые с LSTM-RNN для надёжной хирургической телеоперации. Современные многокамерные системы, такие как Hi-ROS20 иRPF 21,27, улучшают возможность следовать за человеком в неструктурированных условиях. Рисунок 6 показывает адаптивный жизненный цикл ReID, который поддерживает отслеживание под окклюзией за счёт непрерывного уточнения классификаторов. Дополнительная работа по активному метированию28 и семантическому SLAM26 улучшает контекстную осведомлённость, расширяя восприятие от распознавания объектов до поведенческого понимания.

Язык обеспечивает параллельный канал коммуникации. Ранние системы диалога на основе правил испытывали трудности с неоднозначностью, что привело к внедрению моделей, основанных на данных итрансформаторах. Эмоциональная и социальная реактивность теперь играют ключевую роль: мультимодальные системы согласовывают лицевые и голосовые сигналы для адаптивногодиалога 2,30. Обучение с подкреплением улучшает координацию между аффективными и акустическимисигналами 5,31,32. Крупные языковые модели, такие как GPT-333 иChatGPT 34, позволяют контекстное мышление и следование инструкциям позадачам 35, 36, 37. Их интеграция с моделированием видения и вознаграждения38, 39, 40, 41, 42, 43, 44 поддерживает социально осознанное, обобщённое взаимодействие.

Слуховое восприятие дополняет зрение и язык. Просодия, высота звука и ритм передают намерение, когда визуальные сигналы ненадёжны. Выделение признаков на основе подкрепления улучшает синхронизацию речи и выражения. Наборы данных, такие как AVAActiveSpeaker 45, AFFECT-HRI5, SAVEn-Vid46, HumorHRI47 и CHiME-5, обогащают устойчивость модели в шумных, эмоциональных средах. Пан и др.32 продвигают синхронизацию речи и губ для многоговорящих сцен, тогда как мультимодальное слияние с тактильными или физиологическими входами формирует адаптивное поведение.

Воплощённые и физиологические ощущения
Тактильное и физиологическое восприятие усиливают социальную и физическую осведомлённость. Сила, давление и биосигналы позволяют определить намерение, стресс и взаимодействие. Тактильные симуляторы на основе зрения, такие какTACTO 4 , и нейронные картографы, например FOTS48 , генерируют контактные данные высокого разрешения с частотой 300 кадров в секунду, поддерживая управление низкой задержкой. FOTS моделирует освещение и деформацию с помощью изученной функции отражения R:

figure-protocol-1

и теневую проекцию:

figure-protocol-2

где Ms кодирует геометрию проекции. Высокоразрешающие тактильные оболочки были реализованы с использованием магнитореологических эластомеров49, сенсорных массивEtherCAT 50 и вспомогательных материалов по эффектуХолла 51. Системы, такие какDiGeTac 13 , объединяют жесты, тактильные и дальние сигналы через модульные конвейеры. Фильтрация данных о расстояниях по времени полёта моделируется следующим образом:

figure-protocol-3

затем последовала классификация нейронных жестов и локализация контактов на основе CNN. Контроль безопасности обеспечивается масштабированием скорости робота с разделением d. Эти модули обеспечивают надёжное сотрудничество между человеком и роботом. Мультимодальные трансформаторы дополнительно интегрируют тактильные, визуальные и текстовые сигналы. ТрансформаторTVT-6 выравнивает модально-специфические представления (qi, ki, vi) в матрицы суставов:

figure-protocol-4

обеспечение кроссмодального самосознания для единого понимания (рисунок 7).

Физиологические ощущения способствуют эмоциональному выравниванию. Хайниш и др. синхронизируют физиологические и аудиовизуальные сигналы для моделирования аффекта. Системы на основеэлектромиографии 52,53 декодируют жесты и беззвучную речь, аMetaSonic 54 улучшает пространственное восприятие за счёт акустической локализации. Крупномасштабные наборы данных, такие как AgiBot WorldColosseo 55, поддерживают мультимодальное обучение с более чем миллионом тактильных визуальных траекторий. Вместе эти достижения знаменуют переход от унимодального восприятия к интегрированному пониманию социальных, физических и внутренних состояний. Улучшенная точность восприятия позволяет роботам не только измерять контакт, но и интерпретировать колебания, напряжение или дискомфорт, реагируя с помощью чувствительности и адаптивного контроля, которые являются ключевыми основами для бесшовных мультимодальных рамок, рассмотренных в следующих разделах.

Мультимодальное слияние и обучение представления
Синтез позволяет преобразовывать распределённые сенсорные потоки в когерентный, контекстно-ориентированный контроль. Подходы обычно относятся к раннему, позднему или гибридному слиянию. Раннее слияние интегрирует функции на входной стадии, поддерживая синхронизированные сигналы, такие как речь–жест или выравнивание лица–просод. Мультимодальный трансформатор Цай и др. 14 иллюстрирует раннюю интеграцию визуальных, акустических и текстовых сигналов с помощью внимания. Сюэ и др.56 расширили это за счёт остаточного соединения лицевых ориентиров и речевых особенностей, что улучшило устойчивость при вариациях освещения, в то время как Ху и др. ПредложилMMSERNet 57 — многомасштабную термоядерную сеть с использованием расширенной свёртки и остаточного слияния для объединения MFCC, спектрограммы и лексических признаков для распознавания эмоций. Выходной сигнал выражается следующим образом:

figure-protocol-5

Поздний синтез, напротив, объединяет решения после самостоятельной обработки, обеспечивая более высокую толерантность к асинхронным или шумным входам. Примеры включают комбинацию сигналов взгляда, инерции и движения на уровне принятия решений в подводномHRI 58,59. Гибридное слияние объединяет оба подхода — сопоставляя гетерогенные модальности с общими пространствами вложения при сохранении временной специфичности. Multimodal Brain–Computer FusionNetwork 60 выравнивает ЭЭГ и визуальные признаки до классификации, в то время как кроссмодальные конструкции для 3D-оценки поз объединяют инерциальные и монокулярныеданные 61. Современные фреймворки объединяют сверточные, повторяющиеся и трансформаторные слои с выравниванием внимания62,63, динамически взвешивая модальности по контексту или релевантности задачи 64,65,66. Выбор между ранним, поздним и гибридным слиянием — это не вопрос универсального подхода. Раннее слияние обычно хорошо работает, когда модальности тесно синхронизированы и уровень шума низкий, что позволяет модели с самого начала фиксировать богатые межмодальные отношения. Поздний синтез, напротив, обычно более устойчив в сложных асинхронных реальных условиях, поскольку каждая модальность может быть обработана независимо до объединения решений. Гибридные подходы, которые сейчас встречаются примерно в 43% недавних исследований, находят полезный компромисс, особенно для аффективных и воплощённых взаимодействий, используя внимание к динамически сбалансированным входным данным, хотя и сопровождаются дополнительными вычислительными требованиями. В конечном итоге лучшая стратегия зависит от конкретной задачи, профиля шума и аппаратных ограничений, что говорит о том, что будущие системы могут получить выгоду от мгновенного переключения режимов термоядерного синтеза.

Комплементарность между модальностями также сильно варьируется в зависимости от контекста. Зрение в сочетании с тактильными эффектами особенно эффективно при физических задачах на ближнем расстоянии, таких как захват или передача объекта, где тактильная обратная связь компенсирует зрительную окклюзию, изменения освещения или ограничения расстояния и предоставляет точную информацию о силе и контакте, которую аудио не может передать. В то же время зрение в сочетании со звуком лучше работает в удалённых или социальных ситуациях, таких как распознавание эмоций или диалог в шумных условиях, где просодия и тон несут намерение и влияют на то, когда визуальные сигналы недоступны или ненадёжны.

Помимо классической системы ранних, поздних и гибридных моделей, глубокое обучение позволило создавать более детализированные категоризации. Слияние на основе внимания позволяет моделям изучать динамическую важность модальности для каждого входа, эффективно создавая пути интеграции, специфичные для задачи и контекста, без жёстких границ этапов. Изученные стратегии слияния идут дальше, рассматривая весь процесс слияния как сквозной дифференцируемый модуль, позволяющий сети напрямую находить оптимальные схемы комбинаций на основе данных. Эти разработки переносят парадигму от заранее определённых правил к полностью ориентированным на данные, адаптивным архитектурам, которые лучше решают сложность мультимодальных HRI в реальном времени.

Основание на языке видения
Быстрый рост крупных языковых моделей расширил охват мультимодального мышления, особенно через модели зрения–язык (VLM). Эти архитектуры выравнивают лингвистическую и визуальную информацию, позволяя роботам интерпретировать команды, воспринимать сцены и генерировать контекстно-зависимые действия. Фундаментальные фреймворки, такие какLXMERT 64 и CLIP66 , создали совместные вложения для выравнивания изображения и текста. Flamingo 65 ввела мультимодальное рассуждение с несколькими выстрелами, а Clio39 от Maggio динамически связывает инструкции с графами сцен с помощью семантики CLIP. Гао и др.41 разработали LAMARS для предвосхищающего планирования на основе мультимодального прогнозирования, а Се и др.67 применили пространственно-временные сверточные модели для эффективного понимания жестов. Arenas и др. ввели кастомизацию на основе подсказок для персонализированных стилейвзаимодействия 68. Эти системы позволяют напрямую закреплять команды вроде «поднимать красную чашку » в семантике сцены.

Интеграция с пространственным мышлением дополнительно улучшает навигацию и интерпретацию роботов. LatentBKI 38 Уилсона основывает инструкции на воксельных пространственных картах, тогда как Нванкво и др.40 объединяют крупные языковые модели с рассуждением VLM для интерпретации диалоговых действий в условиях визуальной неопределённости. Методы сегментации на основе событий и асинхронного восприятия повышают эффективность динамических задач. В совокупности VLM выступают мостами между символическим обучением и воплощённым пониманием, предоставляя когнитивную основу для гибкого взаимодействия.

Специализированные области применения
В здравоохранении и уходе за пожилыми мультимодальная коммуникация обеспечивает безопасную, интуитивную и эмпатичную помощь. Основные функции — обнаружение падения, ежедневный мониторинг активности, реагирование на экстренные ситуации — зависят от осанки, голоса и сигналовлица 3. Иерархические модели управления повышают точность движения в роботах-ассистентахруки 1, а проприоцептивная обратная связь направляет кооперативных помощников поперевязке 69. Передача объекта, изображённая на рисунке 8, демонстрирует синхронизированное восприятие и моторнуюкоординацию 70. Эмоциональная реакция, изучаемая с помощью таких систем, как LOVOT, способствует доверию пользователей, но вызывает этические сомнения по поводу чрезмерной зависимости.

Социальные роботы требуют гибкой мультимодальной реакции для поддержания эмпатии и доверия в домашних и общественных условиях. Рисунок 9 описывает типичную архитектуру, объединяющую слои сенсорного, планирования и социально-эмоционального мышления. Крупные языковые модели, интегрированные с восприятием, позволяют вести открытый диалог, модулируемый взглядом итоном 40. Педиатрические исследования показывают, что экспрессивные движения и просодия снижают тревожность у детей71 года, в то время как опросы выделяют невербальное поведение как факторывовлечённости 8. Проактивные модели, такие какRoboAgent 37 и Sub-Prior-guided Ant ColonyOptimization 72, позволяют совместно исследовать общие цели. Системы, способные выражать внутренние состояния (готовые, запутанные)73 повышают прозрачность и координацию, а адаптивные социальные агенты опосредуют групповоесотрудничество 74,75.

Образовательные роботы: в образовании мультимодальный HRI способствует мотивации и обучению, используя воплощение и социальнуюсигнализацию 76. Сочетание жестов, лицевых и словесных сигналов повышает доступность и вовлечённость 6,9,77,78. Эмоциональная адаптивность поддерживает младших учеников: системы, которые чувствуют аффективное состояние и модулируют речь и движение, увеличивают внимание исловарный запас 7,79. Интеграция с виртуальной реальностью улучшает погружение, но ставит под угрозумасштабируемость 80. В совокупности эти системы меняют роль робота с инструктора на эмоционально настроенного соавтора.

Персонализация обеспечивает релевантность и доверие в мультимодальныхсистемах 71, 81, 82. Этическая персонализация балансирует между автономией и эмпатией, адаптируя реакции через партисипативную обратную связь. Мааз и др.83 продемонстрировали аффективное репетиторство, основанное на лицевых и когнитивных сигналах, тогда как Гомес-Искьердо и др.84 моделировали предпочтения пользователя по синхронизированному поведению. Персонализированная адаптация может быть формализована следующим образом:

figure-protocol-6

где wi — изученные предпочтительные веса. Реализации, такие как RFIS, обеспечивают реидентификацию человека в реальном времени и распознавание жестов награнице 85, а проприоцептивные сенсорныеинтерфейсы 10 обеспечивают интуитивно понятную физическую коммуникацию. Влияние социального восприятия дополнительно модулирует результаты персонализации, при этом идентичность рассказчика меняет время реакции пользователя и длинувысказывания на 86. Таким образом, персонализация превращает пользователей из пассивных получателей в со-дизайнеров, формируя взаимодействие через взаимную адаптацию.

Хотя большая часть рассмотренных работ остаётся в исследовательских прототипах, несколько мультимодальных методов HRI перешли из исследовательских прототипов в коммерческие или промышленные приложения. Например, робот Pepper от SoftBank интегрирует распознавание речи, жестов и мимики для обслуживания клиентов и образования в розничной торговле иобразовательных учреждениях 87. Робот поддержки человека от Toyota использует слияние зрения и жестов для вспомогательных задач в домах и медицинскихучреждениях 88. Эти коммерческие реализации часто упрощают стратегии слияния, обычно используя поздние или гибридные подходы с правилами, основанными на запасных вариантах, чтобы обеспечить надёжность и низкую стоимость, подчёркивая устойчивый разрыв между продвинутыми академическими моделями и масштабируемыми промышленными решениями. Преодоление этого разрыва потребует большего внимания к развертыванию edge и строгой валидации в реальной жизни.

Проблемы бесшовной коммуникации в HRI
Несмотря на достижения в мультимодальных сенсорах и синтезе, поддерживать бесшовную коммуникацию между человеком и роботом вне контролируемых условий остаётся сложно. Модели, которые отлично работают в лабораториях, часто деградируют из-за шума, задержки, окклюзии, изменения намерения или ограничений ресурсов. Литература объединяется вокруг шести взаимосвязанных барьеров: интеграция зения и языка, синхронизация в реальном времени, мультимодальная устойчивость, семантическая точность, охват наборов данных и ограничения по развертыванию.

Интеграция языков зрения
Визуальное понимание лежит в основе приземлённого языка и действий. Фундаментальные шаги улучшили пространственную согласованность и абстракцию с помощью визуально-инерциального SLAM без ручной инициализации89, повторной идентификации плюс слияния сенсоров для отслеживания с устойчивостью кокклюзии 16, прогнозированию графаполос 90, полуконтролируемой сегментации, выравнивающей метки с навигационной полезностью, эгоцентричного видео с SLAM и масштабной сегментацией дляпроходимости 26. Отображение с учётом неопределённости остаётся центральным: uPLAM объединяет вероятностную локализацию с паноптической сегментацией для динамических сцен91, а Clio адаптивно строит иерархические 3D-графы сцен на основе CLIP для чувствительной к задачесемантики 30. Подходы к заземлению развивались от структурированных описаний и API восприятия92,93 до мультимодальных энкодеров и декодеров94,95.

Инструкции, следующие в открытой среде, интегрируют восприятие и рассуждение. RobotGPT 35 иGroundingGPT 36 интерпретируют команды с помощью связанного визуально-лингвистического вывода; SayPlan, LFG и LLM-Planner согласовывают навигацию и планирование на основании34,44. Для снижения галлюцинаций и обеспечения семантической согласованности GLAM и Vtimellm вводят целивыравнивания 96,97, а адаптивные фреймворки проверяют результаты LLM повосприятию 98,99. Время критически влияет на читаемость: оптимизированное время жестов улучшаетпредсказуемость 9; обучение с подкреплением снижает аудиовизуальную задержку в эмоциональныхконвейерах 2; Захват жестов повышает воспринимаемуюбеглость на 100; а также рассматривает объединение инструментов LSTM, DTW и GAN длявыравнивания 101. В целом, бесшовность требует цикла с учётом задержки между восприятием, слиянием и реакцией, гдемимикрия 30 и предсказание102, вдохновлённое мозжечком, координируют тайминг, что также показано системными временными циклами на рисунке 10.

Восприятие в реальном времени между модальностями
Беглость владения языком зависит от ограниченной задержки между гетерогенными потоками. TACTO обеспечивает тактильную обратную связь высокого разрешения с низкой задержкой для адаптивной обработки. Руки, управляемые сухожилиями, обеспечивают быструю интерактивную игру через event vision и лёгкий вывод103, как показано на рисунке 11. Для зрения–языка–действия связывание CLIP с GraspNet ускоряет захват впомехах 104. Трансформеры поддерживают быструю социальную тактильную классификациюжестов 11. Аудиовизуальные модели, оптимизированные по краям, поддерживают вывод нижесекунды 24. Точное время движения головы улучшаетзацепление на 105. Вместе эти результаты подтверждают необходимость синхронизированного слияния, буферных политик, адаптированных по модальности, и легкого внимания для сохранения временной коадаптации. Допустимая задержка значительно варьируется в зависимости от области задачи. В социальном диалоге или распознавании эмоций задержки менее 200–300 мс поддерживают воспринимаемую беглость и естественное взаимодействие. Вспомогательные задачи, такие как передача объектов или обнаружение падения, требуют более строгих ограничений (50–150 мс) для обеспечения безопасности и оперативности. Телеоперация или совместная обработка часто требуют задержки менее 100 мс для предотвращения дезориентации оператора или укачивания, тогда как навигационные или мониторинговые приложения могут выдерживать 300–500 мс без критического воздействия.

Временные и семантические задачи обработки
Несогласованность и задержки подрывают доверие и эффективность задач, особенно в распределённых системах телеоператор–робот–человек106. Перцептивные и интерфейсные стратегии помогают пользователям переносить задержки: телесные жесты и нелексическиефиллеры 107, визуальные наложения и адаптивныесигналы 108, 109, 110, 111. Прогнозирование на уровне контроля сокращает пробелы вответах 102. Параллельные диалоговые конвейеры пересекаются с генерацией заполнителей, синтезом речи и редактированием подсказок, чтобы уменьшить воспринимаемую задержку, как в112 и рисунке 12. Системные исследования разлагают накопленную задержку между захватом, кодированием/декодированием, сетями, принятием решений иактуацией 113. Как показано на рисунке 13, задержка вводится через захват датчиков, кодирование и декодирование видео, сетевую передачу, обработку оператором и движение транспортного средства, формируя сложную двустороннюю обратную связь. Syntalos обеспечивает миллисекундную синхронизацию для замкнутыхэкспериментов 114. В эмоциональных обменах имитация лица в реальном времени усиливаетсинхронность 23. Домены, чувствительные к задержке, такие как дистанционная хирургия, показывают, что закрепление тактильных эффектов против задержки зрения поддерживает точность иотзывчивость 115. Как показано на рисунке 14, закрепление тактильной обратной связи приводило к лучшей производительности и более сильному ощущению отзывчивости.

Тонкие эффекты и распознавание намерений остаются сложными. Микроэкспрессии, просодия, взгляд и предвосхищающее движение часто происходят кратковременно и асинхронно. Эмо создаёт предвкушающие мимики, соответствующие состоянию пользователя116. Только язык тела передаёт намерение там, где лицо или голоснедоступны 117. Мультимодальные дисплеи на основе перца сочетают вербальную классификацию с выразительными жестами и эмодзи для эмоциональнойсинхронности 118. Онлайн RL усиливает слияние лицевых и голосовыхпотоков 2, а лёгкая имитация поддерживает развертывание edge30. Открытые вопросы включают групповой эффект, культурные вариации и дрейф временного эффекта.

Обобщение в открытых областях также ограничено. Подкрепляющее обучение на основе человеческой обратной связи (RLHF) демонстрирует скудные вознаграждения и хрупкость при внераспределенныхвходах 119. RoboAgent сочетает пространственное мышление с языковым заземлением для передачи междузадачами 29. Reasoning Through Action-free Data (RAD) использует пассивное видео и язык для возможностей zero shot без ручных меток120. Perceiver-Actor заземляет свойства объекта для манипулирования незнакомымиобъектами 121. Постоянное согласование восприятия и семантики в RobotGPT и GroundingGPT улучшает адаптивное мышление, но всё равно сталкивается с проблемами обратной связи в реальномвремени 35,36.

Многомодальная устойчивость и изменчивость окружающей среды
Надёжность должна охватывать целостность сигнала и поведенческую последовательность. SimuMuHRI вводит специфический для модальности шум и дроп-аут для проверкиустойчивости 122. Физически заземленное моделирование структурированного света повышает надёжность RGB-D при освещении и окклюзии123,124. Задержка–тактическая связь выявляет чувствительность при удалённойобработке 125. Принципы избыточности и тепловой устойчивости из систем критически важных для безопасности служат в основе отказоустойчивого HRI126,127.

Поведенческая когерентность столь же важна. Несоответствие голоса и внешнего вида снижаетдоверие 128, а непредсказуемое, но правильное движение подрываетсотрудничество 129. Адаптивное управление силами на основе наблюдателей и надёжные контроллеры взаимодействия обеспечивают устойчивость при структурированных и неструктурированныхнеопределённостях 130,131. Покрытие наборами данных также ограничивает прогресс. Наборы данных по восприятию мультиоботов — OPV2V132,CoPeD 133,CSE 134 и AgiBot World Colosseo55 — расширяют совместное сенсорирование как в моделировании, так и в полевых условиях. Ресурсы AV-HRI — CHiME-5135 с последующим вызовом CHiME-8136, AVA-ActiveSpeaker45, AFFECT-HRI5 и SAVEn-Vid46 — позволяют выполнять ASR, активность спикера, аффект и инструкции в длительном контексте. Крупномасштабные социальные ориентиры —HumorHRI 47, THÖR-MAGNI137, RW4T138 и InViG139 — нацелены на юмор, навигацию, командное взаимодействие и интерактивное заземление. Несмотря на широту, многие наборы данных являются специализированными или скриптированными, с ограниченной временной глубиной оценки бесшовности, как изложено в таблице 3.

Оценка бесшовности
Обычные метрики, такие как точность и задержка, не полностью отражают коадаптацию, взаимное предсказание или социальную беглость. Новые оценщики оценивают контекстную согласованность исотрудничество на 140, интегрируют отзывы пользователей и ситуационныесигналы 141, а также добавляют предсказуемость, координацию и комфорт к физическомуHRI 84. Командные рамки количественно оценивают общееожидание 74, а цифровые двойники отслеживают калибровку доверия и беглостькоманды 142. Единый бенчмарк, объединяющий временную синхронизацию, аффективное выравнивание и беглость, ориентированную на пользователя, остаётся открытой потребностью.

Усилия по стандартизации в мультимодальной оценке HRI остаются ограниченными и фрагментированными. Значимые инициативы, такие как CHiMEChallenges 135 136, имеют продвинутые эталоны по аудиовизуальному распознаванию речи, особенно в плане устойчивости шума. Наборы данных, такие как THÖR-MAGNI137 и RW4T138, предоставляют общие ресурсы для захвата движения и командного поведения. Однако до сих пор не существует широко принятого единого протокола для межмодальной временной синхронизации, беглости взаимодействия или аффективного выравнивания между различными модальностями и доменами. Отсутствие стандартизированных метрик продолжает препятствовать воспроизводимости и сопоставимости, подчёркивая необходимость в эталонах, управляемых сообществом.

От лаборатории к реальному развертыванию
Производительность часто ухудшается в неструктурированных условиях из-за сенсорных аномалий, изменения намерений и узких мест ввычислениях 143. Это снижение производительности подчёркивает устойчивое разделение между лабораторными и реальными условиями. В контролируемых условиях гибридный и ориентированный на внимание синтез отлично работает, обеспечивая высокую точность и низкую задержку для таких задач, как работа с объектами или понимание сцены. Однако реальные развертывания говорят совсем другое. Ассистентные роботы в уходе за пожилыми, компаньонные системы в домах и образовательные инструменты в классах регулярно сталкиваются с шумом, окклюзией, изменениями освещения и непредсказуемым поведением пользователей, снижающим эффективность. Поздние методы синтеза, как правило, оказываются более надёжными при таких переменных, асинхронных условиях, тогда как гибридные модели, несмотря на свои преимущества в аффективной и контекстной адаптации, могут быть ограничены вычислительными требованиями к периферийным устройствам. Многие успешные полевые реализации по-прежнему включают более простую избыточность или правила, гарантии надёжности, что подчёркивает, что переход от перспективных лабораторных демонстраций к надёжной повседневной производительности остаётся серьёзной задачей. Экологически обоснованное тестирование необходимо для определения, какие методы действительно успешны за пределами контролируемых экспериментов. Адаптивные надёжные контроллеры сохраняют точность силы привозмущении 131. Совместное планирование на основе LLM обновляет цели по мере развития намерения пользователя144. Визуальные наложения и обратная связь с учётом задержки помогают поддерживать осведомлённость операторов при деградированныхсвязях 107,109. Лёгкий надзор с помощью LoRa и цифровых теней позволяет проводить мониторинг в полях с низкой пропускнойспособностью 145. Опыт космической робототехники показывает, что автономия должна эволюционировать вместе с человеческим когнитивным восприятием в условиях неопределённости изадержки 146.

Ограничения ресурсов формируют осуществимость. Звуковое распознавание аффектов и сенсорных сигналов работают менее 1 МБ и 0,7 GFLOP для маломощных платформ12. Добавление социальных функций может улучшить присутствие, но рискует перегрузка, когда задержкивырастают до 147. Расписание и выбор признаков должны балансировать когнитивные требования снепрерывностью 148. Снижение задержек охватывает восприятие, контроль и сети, организованные в 113. Пользователи часто предпочитают прозрачное, стабильное взаимодействие максимальной эффективности задач, подчёркивая, что бесшовное HRI должно ставить в приоритет технические возможности наряду с человеческимкомфортом 149 151. В разных областях реальные внедрения демонстрируют разные предпочтения: социальные и образовательные приложения часто используют гибридное слияние зрения и аудио для аффективного диалога, тогда как ассистентные и коллективные задачи предпочитают сочетания зрения и гаптики с поздним или ранним слиянием для точного физического взаимодействия. Эти закономерности совпадают с обобщёнными стратегиями — приоритетом позднего слияния для устойчивости в переменных условиях и гибридном/ориентированном на внимание для более богатой контекстуальной адаптации — хотя упрощение для надежности остаётся обычным.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Выводы

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У этого обзора есть несколько ограничений. Ограничение поиска публикациями на английском языке в Web of Science Core Collection могло привести к языковой предвзятости и исключению релевантных неанглоязычных работ. Фокус на рецензируемых статьях с 2015 по 2025 год также может отражать предвзятость публикаций, возможно упускание препринтов, серую литературу или новые неопубликованные результаты. Ручной отбор 148 статей, хотя и руководствуется явными критериями, неизбежно связан с определён...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была поддержана грантом Universiti Sains Malaysia, Bridging Grant с проектом No R501-LR-RND003-0000001342-0000.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Frennert, S., et al. Towards a hierarchical user requirement structure for upper limb assistive robotics. ACM Trans Hum-Robot Interact. 14 (1), 1-26 (2024).
  2. Kansizoglou, I., Bampis, L., Gasteratos, A. An active learning paradigm for online audio- visual emotion recognition. IEEE Trans Affect Comput. 13 (2), 756-768 (2019).
  3. Keroglou, C., et al. A survey on technical challenges of assistive robotics for elder people in domestic environments: The aspida concept. IEEE Trans Med Robot Bionics. 5 (2), 196-205 (2023).
  4. Wang, S., Lambeta, M., Chou, P. W., Calandra, R. Tacto: A fast, flexible, and open-source simulator for high-resolution vision-based tactile sensors. IEEE Robot Autom Lett. 7 (2), 3930-3937 (2022).
  5. Heinisch, J., et al. Physiological data for affective computing in HRI with anthropomorphic service robots: The AFFECT-HRI data set. Sci Data. 11 (1), 333 (2024).
  6. Li, B., et al. TVT-Transformer: A tactile-visual-textual fusion network for object recognition. Inf Fusion. 118, 102943 (2025).
  7. Kim, H., et al. Technological applications of social robots to create healthy and comfortable smart home environment. Build Environ. , 112269 (2024).
  8. Leoste, J., Marmor, K., Heidmets, M. Nonverbal behavior of service robots in social interactions: A survey on recent studies. Interact Des Archit. 61, 164-192 (2024).
  9. Liu, N., et al. A lightweight network-based sign language robot with facial mirroring and speech system. Expert Syst Appl. 262, 125492 (2024).
  10. Iskandar, M., Albu-Schäffer, A., Dietrich, A. Intrinsic sense of touch for intuitive physical human-robot interaction. Sci Robot. 9 (93), eadn4008 (2024).
  11. Ren, Q., Hou, Y., Belpaeme, T. Low-latency classification of social haptic gestures using transformers. , (2023).
  12. Hou, Y., Ren, Q., Wang, W., Botteldooren, D. Sound-based recognition of touch gestures and emotions for enhanced human-robot interaction. , (2025).
  13. Al, G., Martinez-Hernandez, U. DiGeTac unit for multimodal communication in human-robot interaction. IEEE Sens Lett. 8 (5), 6001804 (2024).
  14. Tsai, Y. H., et al. Multimodal transformer for unaligned multimodal language sequences. , (2019).
  15. Wang, Z., Chen, M., Liu, Q. A review on multimodal communications for human-robot collaboration in 5G: From visual to tactile. Intell Robot. 5 (3), 579-606 (2025).
  16. Antonucci, A., et al. Humans as path-finders for mobile robots using teach-by-showing navigation. Auton Robots. 47 (8), 1255-1273 (2023).
  17. Duarte, N. F., Rakovic, Action anticipation: Reading the intentions of humans and robots. IEEE Robot Autom Lett. 3 (4), 4132-4139 (2018).
  18. Hayashi, K. Investigation of joint action in go/no-go tasks: Development of a human-like eye robot and verification of action space. Int J Soc Robot. , 1-14 (2024).
  19. Belkaid, M., et al. Mutual gaze with a robot affects human neural activity and delays decision-making processes. Sci Robot. 6 (58), eabc5044 (2021).
  20. Guidolin, M., Tagliapietra, L., Menegatti, E., Reggiani, M. Hi-ros: Open-source multi-camera sensor fusion for real-time people tracking. Comput Vis Image Underst. 232, 103694 (2023).
  21. Ovur, S. E., Demiris, Y. Naturalistic robot-to-human bimanual handover in complex environments through multi-sensor fusion. IEEE Trans Autom Sci Eng. 21 (3), 3730-3741 (2023).
  22. Viola, P., Jones, M. Rapid object detection using a boosted cascade of simple features. , (2001).
  23. Stauffer, C., Grimson, W. E. L. Adaptive background mixture models for real-time tracking. , (1999).
  24. Qi, W., et al. Multi-sensor guided hand gesture recognition for a teleoperated robot using a recurrent neural network. IEEE Robot Autom Lett. 6 (3), 6039-6045 (2021).
  25. Sun, J., Shen, Y., Rosen, J. Sensor reduction, estimation, and control of an upper-limb exoskeleton. IEEE Robot Autom Lett. 6 (2), 1012-1019 (2021).
  26. Kim, Y., et al. Learning semantic traversability with egocentric video and automated annotation strategy. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).
  27. Ye, H., et al. Person re-identification for robot person following with online continual learning. IEEE Robot Autom Lett. 9 (11), 9151-9158 (2024).
  28. Vaswani, A., et al. Attention is all you need. , (2017).
  29. Schneider, S., Baevski, A., Collobert, R., Auli, M. Wav2vec: Unsupervised pre-training for speech recognition. , (2024).
  30. Liu, X., Chen, Y., Li, J., Cangelosi, A. Real-time robotic mirrored behavior of facial expressions and head motions based on lightweight networks. IEEE Internet Things J. 10 (2), 6039-6048 (2022).
  31. Tsai, C. Y., Su, Y. K. MobileNet-JDE: A lightweight multi-object tracking model for embedded systems. Multimed Tools Appl. 81 (7), 9915-9937 (2022).
  32. Pan, Z., Tao, R., Xu, C., Li, H. Selective listening by synchronizing speech with lips. IEEE/ACM Trans Audio Speech Lang Process. 30, 1650-1664 (2022).
  33. Brown, T. B., et al. Language models are few-shot learners. , (2020).
  34. Jin, Y., et al. RobotGPT: Robot manipulation learning from ChatGPT. IEEE Robot Autom Lett. 9 (3), 2543-2550 (2024).
  35. Li, Z., et al. GroundingGPT: Language Enhanced Multi-modal Grounding Model. , (2024).
  36. Bharadhwaj, H., et al. Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking. , (2024).
  37. Wilson, J., et al. LatentBKI: Open-dictionary continuous mapping in visual-language latent spaces with quantifiable uncertainty. IEEE Robot Autom Lett. , (2025).
  38. Maggio, D., et al. Clio: Real-time task-driven open-set 3D scene graphs. IEEE Robot Autom Lett. 9 (10), 5123-5130 (2024).
  39. Nwankwo, L., Rueckert, E. The Conversation is the Command: Interacting with Real-World Autonomous Robots Through Natural Language. , (2024).
  40. Gao, Y., et al. LAMARS: Large language model-based anticipation mechanism acceleration in real-time robotic systems. IEEE Access. 13, 3864-3880 (2024).
  41. Rana, K., et al. Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning. , (2023).
  42. Shah, D., et al. Navigation with large language models: Semantic guesswork as a heuristic for planning. , (2023).
  43. Song, C. H., et al. LLM-Planner: Few-shot grounded planning for embodied agents with large language models. , (2023).
  44. Roth, J., et al. AVA-ActiveSpeaker: An audio-visual dataset for active speaker detection. , (2020).
  45. Li, J., et al. SAVen-Vid: Synergistic audio-visual integration for enhanced understanding in long video context. arXiv. , (2024).
  46. Zhang, H., Hei, X., Cardenas, J., Miao, X., Tapus, A. Toward a multi-dimensional humor dataset for social robots. , (2024).
  47. Zhao, Y., Qian, K., Duan, B., Luo, S. FOTS: A fast optical tactile simulator for sim2real learning of tactile-motor robot manipulation skills. IEEE Robot Autom Lett. 9 (6), 2150-2157 (2024).
  48. Chen, D., et al. A high spatial resolution magnetorheological elastomer tactile sensor for texture recognition. IEEE Sens J. 25 (5), 1234-1241 (2025).
  49. Giovinazzo, F., et al. Design, implementation and testing of an EtherCAT-based network for multi-modal distributed sensing architectures. , (2024).
  50. Yun, Y., et al. Enhancing sensitivity across scales with highly sensitive Hall effect-based auxetic tactile sensors. Adv Intell Syst. 7 (3), 2300456 (2024).
  51. Zafar, M., Moosavi, S. K. R., Sanfilippo, F. Federated learning-enhanced edge deep learning model for EMG-based gesture recognition in real-time human-robot interaction. IEEE Sens J. 25 (5), 1234-1241 (2025).
  52. Dong, P., et al. Decoding silent speech cues from muscular biopotential signals for efficient human-robot collaborations. Adv Mater Technol. 10 (4), 2301123 (2024).
  53. Wang, J., An, Z., Guo, Y. MetaSonic: Advancing robot localization with directional embedded acoustic signals. IEEE Robot Autom Lett. 10 (2), 3150-3157 (2025).
  54. AgiBot-World-Contributors. AgiBot World Colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems. , (2025).
  55. Xue, F., Li, Y., Liu, D., Xie, Y., Wu, L., et al. LipFormer: Learning to lipread unseen speakers based on visual-landmark transformers. IEEE Trans Circuits Syst Video Technol. 33 (9), 4507-4517 (2023).
  56. Hu, H., et al. Speech emotion recognition based on multimodal and multiscale feature f usion. Signal Image Video Process. 19 (2), 123 (2024).
  57. Lee, D., et al. Intuitive six-degree-of-freedom human interface device for human-robot interaction. IEEE Trans Instrum Meas. 73, 1-10 (2024).
  58. Kvasic, I., et al. Diver-robot communication dataset for underwater hand gesture recognition. Comput Netw. 245, 110392 (2024).
  59. Li, Z., et al. MBCFNet: A multimodal brain-computer fusion network for human intention recognition. Knowl-Based Syst. 296, 111826 (2024).
  60. Popescu, M., et al. Fusion of inertial sensor suit and monocular camera for 3D human pelvis pose estimation. , (2024).
  61. Zhou, S., Yang, B., Yuan, M., Jiang, R., Yan, R., et al. Enhancing SNN-based spatiotemporal learning: A benchmark dataset and cross-modal attention model. IEEE Trans Neural Netw Learn Syst. 35 (8), 11234-11248 (2024).
  62. Biswas, S., Saw, R., Nandy, A. Attention-enabled hybrid convolutional neural network for enhancing human-robot collaboration through hand gesture recognition. Comput Electr Eng. 123, 110020 (2025).
  63. Tan, H., Bansal, M. LXMERT: Learning cross-modality encoder representations from transformers. , (2019).
  64. Alayrac, J. B., et al. Flamingo: a visual language model for few-shot learning. , (2022).
  65. Radford, A., et al. Learning transferable visual models from natural language supervision. , (2021).
  66. Xie, J., Zhang, B., Lu, Q., Borisov, O. A dynamic head gesture recognition method for real- time intention inference and its application to visual human-robot interaction. Int J Control Autom Syst. 22, 252-264 (2024).
  67. Arenas, M., et al. How to prompt your robot: A promptbook for manipulation skills with code as policies. , (2024).
  68. Zhu, J., Gienger, M., Franzese, G., Kober, J. Do you need a hand?—A bimanual robotic dressing assistance scheme. IEEE Trans Robot. 40, 1906-1919 (2024).
  69. Ortenzi, V., et al. Object handovers: A review for robotics. IEEE Trans Robot. 37 (6), 2150-2168 (2022).
  70. Kabacińska, K., Teng, K., Robillard, J. Social robot interactions in a pediatric hospital setting: Perspectives of children, parents, and healthcare providers. Multimodal Technol Interact. 9 (2), 14 (2025).
  71. Viyuela, &. #. 2. 1. 1. ;., Sanfeliu, A. Human-robot collaborative minimum time search through sub- priors in ant colony optimization. IEEE Robot Autom Lett. 9 (11), 1123-1130 (2024).
  72. Roy, L., Croft, E., Kulić, D. Learning to communicate functional states with nonverbal expressions for improved human-robot collaboration. IEEE Robot Autom Lett. 9 (6), 7123-7130 (2024).
  73. San Martin, A., Kildal, J., Lazkano, E. An analysis of the role of different levels of exchange of explicit information in human-robot cooperation. Front Robot AI. 12, 1511619 (2025).
  74. Gillet, S., et al. Interaction-shaping robotics: Robots that influence interactions between other agents. ACM Trans Hum-Robot Interact. 13 (1), 25 (2024).
  75. Belpaeme, T., et al. Social robots for education: A review. Sci Robot. 3 (21), eaat5954 (2018).
  76. Zhang, R., et al. Predicting emotion reactions for human-computer conversation: A variational approach. IEEE Trans Hum-Mach Syst. 51 (4), 712-721 (2022).
  77. Huang, C., Fu, L., Hung, S. C., Yang, S. Effect of visual programming instruction on students' flow experience, programming self-efficacy, and sustained willingness to learn. J Comput Assist Learn. 41 (1), 123-135 (2025).
  78. Berrezueta-Guzman, S., Dolón-Poza, M. Enhancing preschool language acquisition through robotic assistants: An evaluation of effectiveness, engagement, and acceptance. IEEE Access. , (2025).
  79. Lei, Y., Su, Z., Cheng, C. Virtual reality in human-robot interaction: Challenges and benefits. Electron Res Arch. 31 (4), 2374-2408 (2023).
  80. Pareto, J., Coeckelbergh, M. Social assistive robotics: An ethical and political inquiry through the lens of freedom. Int J Soc Robot. 16 (8), 1797-1808 (2024).
  81. Hung, L., et al. “It’s always happy to see me”: Exploring LOVOT robots as companions for older adults. J Rehabil Assist Technol Eng. 12, 20556683251320669 (2025).
  82. Maaz, N., Mounsef, J., Maalouf, N. CARE: Towards customized assistive robot-based education. Front Robot AI. 12, 1474741 (2025).
  83. Gómez-Izquierdo, G., Laplaza, J., Sanfeliu, A., Garrell, A. Enhancing context-aware human motion prediction for efficient robot handovers. , (2025).
  84. Lee, S., Lee, S., Park, H. Integration of tracking, re-identification, and gesture recognition for facilitating human-robot interaction. Sensors. 24 (15), 4850 (2024).
  85. Bakhoda, I., et al. Exploring the impact of narrator type on response latency and utterance length during interactive storytelling. , (2024).
  86. Pandey, A. K., Gelin, R. A mass-produced sociable humanoid robot: Pepper: The first machine of its kind. IEEE Robot Autom Mag. 25 (3), 40-48 (2018).
  87. Yamamoto, T., et al. Toyota Human Support Robot (HSR): Development and future prospects. 2019 IEEE/SICE International Symposium on System Integration (SII). , 634-639 (2019).
  88. Lupton, T., Sukkarieh, S. Visual-inertial-aided navigation for high-dynamic motion in built environments without initial conditions. IEEE Trans Robot. 28 (1), 61-76 (2011).
  89. Zürn, J., Posner, I., Burgard, W. Autograph: Predicting lane graphs from traffic observations. IEEE Robot Autom Lett. 9 (1), 73-80 (2024).
  90. Sirohi, K., Büscher, D., Burgard, W. UPLAM: Robust panoptic localization and mapping leveraging perception uncertainties. IEEE Robot Autom Lett. 9 (8), 5123-5130 (2024).
  91. Wang, L., et al. A survey on large language model based autonomous agents. Front Comput Sci. 18 (6), 186345 (2024).
  92. Zang, Y., et al. Contextual object detection with multimodal large language models. Int J Comput Vis. 133 (2), 1-19 (2024).
  93. Ivanovic, B., et al. Multimodal deep generative models for trajectory prediction: A conditional variational autoencoder approach. IEEE Robot Autom Lett. 6 (2), 295-302 (2020).
  94. Floridi, L., Chiriatti, M. GPT-3: Its nature, scope, limits, and consequences. Minds Mach. 30, 681-694 (2020).
  95. Carta, T., et al. Grounding large language models in interactive environments with online reinforcement learning. , (2023).
  96. Huang, B., et al. VTimeLLM: Empower LLM to grasp video moments. , (2024).
  97. Gupta, M., et al. From ChatGPT to ThreatGPT: Impact of generative AI in cybersecurity and privacy. IEEE Access. 11, 80218-80245 (2023).
  98. Li, X., et al. Chain-of-knowledge: Grounding large language models via dynamic knowledge adapting over heterogeneous sources. , (2024).
  99. Kimoto, M., Iio, T., Shiomi, M., Shimohara, K. Coordinating entrainment phenomena: Robot conversation strategy for object recognition. Appl Sci. 11 (5), 2358 (2021).
  100. Nyatsanga, S., et al. A comprehensive review of data-driven co-speech gesture generation. Comput Graph Forum. 42 (2), 569-596 (2023).
  101. Abadía, I., et al. A cerebellar-based solution to the nondeterministic time delay problem in robotic control. Sci Robot. 6 (58), eabf2756 (2021).
  102. Deng, X., Weirich, S., Katzschmann, R. K., Delbruck, T. A rapid and robust tendon-driven robotic hand for human-robot interactions playing rock-paper-scissors. , (2024).
  103. Xu, K., et al. A joint modeling of vision-language-action for target-oriented grasping in clutter. , (2023).
  104. Lee, H., Hahn, S. Effect of robot head movement and its timing on human-robot interaction. Int J Soc Robot. 17 (1), 3-14 (2024).
  105. Kim, S., Hernandez, I., Nussbaum, M., Lim, S. Teleoperator-robot-human interaction in manufacturing: Perspectives from industry, robot manufacturers, and researchers. IISE Trans Occup Ergon Hum Factors. 12 (1-2), 28-40 (2024).
  106. Pelikan, H., Hofstetter, E. Managing delays in human-robot interaction. ACM Trans Comput-Hum Interact. 30 (4), 1-24 (2022).
  107. Kang, D., Nam, C., Kwak, S. Robot feedback design for response delay. Int J Soc Robot. 16 (2), 1341-1361 (2024).
  108. Akita, E., Zaidner, G., Pryor, M. Improved situational awareness and performance with dynamic task-based overlays for teleoperation. , (2024).
  109. Scholz, C., et al. Improving robot-to-human communication using flexible display technology as a robotic-skin-interface: A co-design study. Int J Intell Robot Appl. 9 (1), 146-163 (2024).
  110. Reardon, C., et al. Augmented reality visualization of autonomous mobile robot change detection in uninstrumented environments. ACM Trans Hum-Robot Interact. 13 (3), 1-30 (2024).
  111. Asaka, S., Itoyama, K., Nakadai, K. Improving impressions of response delay in AI-based spoken dialogue systems. , (2024).
  112. Kamtam, S., et al. Network latency in teleoperation of connected and autonomous vehicles: A review of trends, challenges, and mitigation strategies. Sensors. 24 (12), 3957 (2024).
  113. Klumpp, M., et al. Syntalos: A software for precise synchronization of simultaneous multi- modal data acquisition and closed-loop interventions. Nat Commun. 16 (1), 708 (2025).
  114. Du, J., et al. Sensory manipulation as a countermeasure to robot teleoperation delays: System and evidence. Sci Rep. 14, (2024).
  115. Hu, Y., et al. Human-robot facial coexpression. Sci Robot. 9 (88), eadi4724 (2024).
  116. Gao, W., Shen, S., Ji, Y., Tian, Y. Human perception of the emotional expressions of humanoid robot body movements: Evidence from survey and eye-tracking measurements. Biomimetics. 9 (11), 684 (2024).
  117. Cárdenas, P., et al. Evaluation of robot emotion expressions for human-robot interaction. Int J Soc Robot. 16 (9), 2019-2041 (2024).
  118. Casper, S., et al. Open problems and fundamental limitations of reinforcement learning from human feedback. , (2025).
  119. Clark, J., Mirchandani, S., Sadigh, D., Belkhale, S. Action-free reasoning for policy generalization. arXiv. , (2025).
  120. Shridhar, M., et al. Perceiver-Actor: A multi-task transformer for robotic manipulation. , (2022).
  121. Wang, X. Mobile robot environment perception system based on multimodal sensor fusion. Appl Comput Eng. 127, 42-49 (2025).
  122. Bai, K., Zhang, L., Chen, Z., Wan, F., Zhang, J. Close the sim2real gap via physically-based structured light synthetic data simulation. , (2024).
  123. Fatehi, K., Torres, M., Kucukyilmaz, A. An overview of high-resource automatic speech recognition methods and their empirical evaluation in low-resource environments. Speech Commun. 167, 103151 (2024).
  124. Louca, J., Eder, K., Vrublevskis, J., Tzemanaki, A. Impact of haptic feedback in high latency teleoperation for space applications. ACM Trans Hum-Robot Interact. 13 (2), 1-21 (2024).
  125. Luo, W., Zhang, S., Gao, Y., Shen, C. Review of mechanisms and detection methods of internal short circuits in lithium-ion batteries. Ionics. 31 (5), 3945-3964 (2025).
  126. Luo, W., et al. Study on the comprehensive multisource thermal runaway failure characteristics and cooling effects of extinguishing agents in 280 Ah batteries. Phys Fluids. 37 (3), (2025).
  127. Alimardani, M., Roode, R., Vaitonyte, J., Louwerse, M. Effect of a virtual agent's appearance and voice on uncanny valley and trust in human-agent collaboration. , (2024).
  128. Moradinezhad, R., Solovey, E. Investigating trust in interaction with inconsistent embodied virtual agents. Int J Soc Robot. 13 (8), 2103-2118 (2021).
  129. Zixuan, H., et al. Observer-based adaptive robust force control of a robotic manipulator integrated with external force/torque sensor. Actuators. 14 (3), 116 (2025).
  130. Huang, J., et al. Adaptive robust interaction force control of a robotic manipulator in uncertain environments. IEEE Trans Ind Electron. 72 (8), 8251-8260 (2025).
  131. Xu, R., et al. OPV2V: An open benchmark dataset and fusion pipeline for perception with vehicle-to-vehicle communication. , (2022).
  132. Zhou, Y., Quang, L., Nieto-Granda, C., Loianno, G. CoPeD: Advancing multi-robot collaborative perception—A comprehensive dataset in real-world environments. IEEE Robot Autom Lett. 9 (7), 6416-6423 (2024).
  133. Park, H., et al. A benchmark dataset for collaborative SLAM in service environments. IEEE Robot Autom Lett. 9 (12), 11337-11344 (2024).
  134. Barker, J., Watanabe, S., Vincent, E., Trmal, J. The fifth CHiME speech separation and recognition challenge: Dataset, task and baselines. , (2018).
  135. Cornell, S., et al. The CHiME-8 DASR challenge for generalizable and array agnostic distant automatic speech recognition and diarization. , (2024).
  136. Schreiter, T., et al. THÖR-MAGNI: A large-scale indoor motion capture recording of human movement and robot interaction. Int J Robot Res. 44 (4), 568-591 (2024).
  137. Savko, L., Qian, Z., Gremillion, G., Neubauer, C., Canady, J., et al. RW4T dataset: Data of human-robot behavior and cognitive states in simulated disaster response tasks. , (2024).
  138. Zatsarynna, O., Farha, Y., Gall, J. Multi-modal temporal convolutional network for anticipating actions in egocentric videos. , (2021).
  139. Gkournelos, C., Konstantinou, C., Makris, S. An LLM-based approach for enabling seamless human-robot collaboration in assembly. CIRP Ann. 73 (1), 9-12 (2024).
  140. Rahimi, H., et al. User-VLM 360: Personalized vision language models with user-aware tuning for social human-robot interactions. , (2025).
  141. Langås, E., Zafar, M., Sanfilippo, F. Exploring the synergy of human-robot teaming, digital twins, and machine learning in industry 5.0: A step towards sustainable manufacturing. J Intell Manuf. , 1-24 (2025).
  142. Nizamuddin, M., Kamisetty, A., Gummadi, J. C., Talla, R. R. Integrating neural networks with robotics: Towards smarter autonomous systems and human-robot interaction. Robotics Xplore: USA Tech Digest. 1 (1), 157-169 (2024).
  143. Asuzu, K., Singh, H., Idrissi, M. Human-robot interaction through joint robot planning with large language models. Intell Serv Robot. 18 (2), 261-277 (2025).
  144. Shamshiri, R., et al. Internet of robotic things with a local LoRa network for teleoperation of an agricultural mobile robot using a digital shadow. Discov Appl Sci. 6, 414 (2024).
  145. Smith, C., Mott, T., Williams, T. Perspectives on level of autonomy decisions in space robotics. , (2024).
  146. Kim, T., Song, Y., Kim, D., Song, H. Too much is as bad as too little: The impact of implementing multiple social interaction features on trust and acceptance of automated vehicle agents. Int J Hum-Comput Interact. 41 (21), 13875-13890 (2025).
  147. Elsayyad, S., et al. An effective robot selection and recharge scheduling approach for improving robotic networks performance. Sci Rep. 14 (1), 28439 (2024).
  148. Mayer, L., et al. Human-AI collaboration: Trade-offs between performance and preferences. Cogn Res Princ Implic. 11, 18 (2026).
  149. Yang, B., et al. Gaze and environmental context-guided deep neural network and sequential decision fusion for grasp intention recognition. IEEE Trans Neural Syst Rehabil Eng. 31, 3687-3689 (2023).
  150. Rückin, J., Magistri, F., Stachniss, C., Popović, M. Semi-supervised active learning for semantic segmentation in unknown environments using informative path planning. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи