Artykuł przeglądowy

Płynna multimodalna komunikacja człowiek-robot: techniki integracji w interakcji człowiek-komputer

DOI:

10.3791/70218

9 czerwca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsza recenzja prezentuje ostatnie osiągnięcia w dziedzinie głębokiego uczenia się, multimodalnego czułego oraz strategii integracji, które umożliwiają płynną, adaptacyjną i zorientowaną na człowieka komunikację między ludźmi a robotami.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bezproblemowa multimodalna komunikacja człowiek-robot stała się koniecznością, ponieważ roboty socjalne, wspomagające i edukacyjne przenikają do codziennych środowisk, takich jak domy, ośrodki opieki zdrowotnej i klasy, gdzie muszą integrować mowę, gesty, wzrok, wyrazy twarzy i wskazówki dotykowe z dużą precyzją, niską opóźnieniem i prawdziwą odpornością na świat. Ta recenzja systematycznie bada, jak obecne techniki osiągają czasową, wzajemną multimodalną interakcję człowiek-robot (HRI), koncentrując się na strategiach fuzji, architekturach systemów i zastosowaniach w określonych dziedzinach. Przeszukaliśmy Web of Science Core Collection w poszukiwaniu angielskich empirycznych badań z lat 2015 do 2025, wybierając 148 prac, które dotyczą integracji komunikacyjnej. Najważniejsze wnioski obejmują wyraźny przesunięcie w kierunku hybrydowej i opartej na uważności fuzji od 2022 roku (około 43% podejść), która lepiej radzi sobie z asymetrią czasową i wcielonymi interakcjami niż wcześniejsze metody; szeroko rozpowszechnioną niekonsekwencję w wskaźnikach oceny, która utrudnia porównania między badaniami; i trwającą lukę między mocną wydajnością laboratoryjną a słabszą odpornością na świecie w warunkach hałasu, zasłon czy zmienności użytkowników. Kluczowe wyzwania obejmują przetwarzanie w czasie rzeczywistym, aligment semantyczny, efektywność danych, odporność wdrożenia oraz niedostatecznie zbadane integrację sygnałów dotykowych z afektem. Patrząc w przyszłość, recenzja sugeruje priorytetyzowanie adaptacyjnych polityk fuzji, standaryzowanych wskaźników synchronizacji i płynności oraz ciągłego uczenia się, aby umożliwić dostosowanie zindywidualizowane dla użytkowników. Ostatecznie ma na celu wskazanie kierunku rozwoju bardziej zorientowanych na człowieka agentów robotycznych, które mogą angażować się w sposób współpracy, znaczący i społecznie akceptowalny w codziennym życiu.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Roboty ewoluowały z narzędzi przemysłowych w strukturalnych środowiskach do społecznie osadzanych agentów w domach, szpitalach i klasach. Teraz pomagają w edukacji, terapii i towarzyszeniu, co odzwierciedla przemianę z zautomatyzowanych zadań na adaptacyjną interakcję zorientowaną na użytkownika. W centrum tej transformacji leży multimodalna komunikacja, umożliwiająca robotom percepcję i odpowiedź na wskazówki ludzkie—mówione, spojrzenie, gesty, wyrażenia twarzy i dotyk—z dokładnością czasową potrzebną do naturalnych wymian w dynamicznych środowiskach. Ten nacisk na koordynację i responsywność jest zgodny z głównymi zagadnieniami w interakcji człowiek–komputer i nauce poznawczej. W tej recenzji, płynna multimodalna komunikacja odnosi się do interakcji, które są dla użytkowników płynne i intuicyjne, charakteryzujące się czasami reakcji poniżej sekundy (zwykle mniej niż 300 ms), minimalnymi wykrywalnymi opóźnieniami lub niedopasowaniom oraz solidną adaptacją do rzeczywistej zmienności. To odróżnia je od tradycyjnych systemów opartych na poleceniach lub jednomodalnych, gdzie błędy czasowe, awarie modalności lub sztywne odpowiedzi zakłócają naturalny przepływ.

W interakcji człowiek–robot (HRI) ta recenzja koncentruje się na komunikacji człowiek–robot, zdefiniowanej jako wzajemna, czasu rzeczywistego wymiana multimodalnych sygnałów między ludźmi a robotami. Podczas gdy HRI obejmuje również planowanie, kontrolę i bezpieczeństwo, komunikacja dotyczy synchronizacji percepcji i działania w kanałach sensorycznych. Wczesne systemy oparte na poleceniach priorytetyzowały wydajność nad zaangażowaniem, często wytwarzając sztywne lub opóźnione zachowanie. Współczesne prace dążą do adaptacyjnych, świadomych kontekstu modeli, które przystosowują się do stanu i emocji użytkownika1,2. Ta ewolucja podkreśla potrzebę precyzyjnych, intuicyjnych i spersonalizowanych ram interakcji.

Wczesne społeczne i wspomagające roboty często opierały się na skryptowanych rutynach lub jednomodalnych wejściach, takich jak głos czy dotyk, ograniczając elastyczność3. Logika oparta na regułach i powolne przetwarzanie często prowadziły do niedopasowania czasowego między gestami a mową, lub do słabej adaptacji do zachowania użytkownika. Aby rozwiązać te problemy, naukowcy stoszą nisko-opóźniającą fuzję, multimodalną integrację sensoryczną i adaptacyjne uczenie się użytkownika4,5. Te strategie można zrozumieć poprzez trzy fundamentalne zasady komunikacji szeroko rozpoznane w HRI: uzupełnianie się (modalności kompensują się nawzajem), redundancja (nakładanie się poprawia niezawodność) i synergia (konwergencja zwiększa naturalność).

Postępy w sensorycznych i uczących się systemach przyniosły społecznie responsywne roboty, które integrują wizualne, słuchowe, dotykowe i fizjologiczne wejścia w czasie rzeczywistym5,6. Zamiast ustalonego skryptu, te systemy ciągle przystosowują się do wskazówek użytkowników. Dostępne interfejsy programowania i metody uczenia się poprzez demonstrację pozwalają edukatorom i terapeutom na dostosowanie zachowań dla opieki i instrukcji, gdzie precyzja, responsywność i adaptacyjność są niezbędne.

Wzorce komunikacji w społecznej HRI można podzielić na tryby równoległe, uzupełniające i interaktywne (Rysunek 1). W równoległej interakcji ludzie i roboty działają niezależnie z minimalną wymianą. Interakcja uzupełniająca wprowadza strukturalne bodźce lub wsparcie oparte na wydarzeniach. Najbardziej zaawansowany tryb interaktywny obejmuje ciągłą dwukierunkową regulację przez kanały takie jak mowa, ruch i spojrzenie7.

Selekcja i analiza literatury

Metodologia systematycznego przeglądu: Przeprowadziliśmy systematyczne wyszukiwanie literatury w Web of Science Core Collection, koncentrując się na recenzowanych artykułach i pełnych materiałach konferencyjnych od głównych wydawców (IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis). Zapytanie Boole'a brzmiało: (("human-robot interaction" LUB HRI) I (multimodal LUB "sensor fusion" LUB gest LUB spojrzenie LUB mowa LUB dotyk) I ("real-time" LUB "low-latency" LUB adaptacyjny LUB niezawodny)). Kryteria inkluzji obejmowały: publikację w języku angielskim z lat 2015-2025—okres obejmujący przemianę z systemów opartych na regułach, jednomodalnych do architektur głębokiego uczenia się, które podkreślają nisko-opóźniającą, adaptacyjną i niezawodną interakcję—z naciskiem na techniki integracji multimodalnej dla komunikacji HRI i walidację empiryczną (ilościową lub jakościową). Wykluczyliśmy badania ograniczone do jednomodalnej interakcji, te dotyczące kontroli robota bez intencji komunikacyjnej oraz prace nieempiryczne (np. czysto teoretyczne lub tylko symulacyjne). Początkowe wyszukiwanie przyniosło znaczny korpus. Po usunięciu duplikatów przeszukiwaliśmy tytuły i abstrakty zgodnie z kryteriami

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przegląd i perspektywa

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W miarę jak roboty stają się stałym elementem domów, klas szkolnych i placówek ochrony zdrowia, naturalna i adaptacyjna komunikacja staje się kluczowa dla ich sukcesu. Coraz częściej postrzegane nie jako narzędzia, lecz jako partnerzy społeczni, muszą one postrzegać, interpretować i reagować na sygnały ludzkie w różnych modalnościach. Systemy, które precyzyjnie odczytują intencje użytkownika i dostarczają terminową informację zwrotną, zwiększają efektywność wykonywania zadań, zaufanie oraz komfort emocjonalny — szczególnie w przypadku dzieci, osób starszych lub osób z niepełnosprawnościami. Osiągnięcie tego celu wymaga ciągłej, intuicyjnej interakcji, która dostosowuje reakcje robota do bieżącego zachowania człowieka, zamiast je przerywać. Taka płynność wymaga wielomodalnych danych wejściowych — głosu, spojrzenia, gestów i wyrazów twarzy — zintegrowanych za pomocą mechanizmów, które odzwierciedlają samą ludzką komunikację14,16.

Kanały percepcji i komunikacji
Wzrok pozostaje fundamentem multimodalnej interakcji człowiek-robot. Wskazówki wizualne, takie jak wyraz twarzy, kierunek spojrzenia, postawa i gesty, stanowią podstawę rozpoznawania intencji, wnioskowania o emocjach oraz śledzenia poziomu zaangażowania17,18,19,20,21. Wczesne metody oparte na ręcznie definiowanych cechach, wykorzystujące detekcję Haar22 lub odejmowanie tła23, często okazywały się nieskuteczne w przypadku przesłonięcia obiektu lub zmian oświetlenia16,21. Obecnie dominują systemy głębokiego uczenia, stosujące sieci CNN oraz modele rekurencyjne z wejściami z wielu kamer. Rycina 4 przedstawia potok śledzenia HI-ROS, który redukuje błąd ruchu o 27% w monitorowaniu gestów w czasie rzeczywistym.

Integracja wskazówek wzroku, ramienia i głowy poprawia przewidywanie działań użytkownika17, podczas gdy fuzja proprioceptywna i głębi zwiększa precyzję24,25. Wzajemne spojrzenia19 oraz biomimetyczne konstrukcje oczu18 dodatkowo demonstrują rolę subtelnych sygnałów w budowaniu zaufania i koordynacji. Rycina 5 przedstawia architekturę z pracy 26, w której dwa kontrolery Leap Motion rejestrują ruch dłoni, a dane są łączone za pomocą LSTM-RNN w celu zapewnienia stabilnej teleoperacji chirurgicznej. Nowoczesne systemy wielokamerowe, takie jak Hi-ROS20 i RPF21,27, usprawniają śledzenie osób w nieustrukturyzowanym otoczeniu. Rycina 6 pokazuje adaptacyjny cykl życia ReID, który utrzymuje śledzenie podczas przesłonięcia dzięki ciągłemu udoskonalaniu klasyfikatora. Uzupełniające prace nad aktywnym etykietowaniem28 oraz semantycznym SLAM26 poprawiają świadomość kontekstową, rozszerzając percepcję od rozpoznawania obiektów do rozumienia zachowań.

Język stanowi równoległy kanał komunikacyjny. Wczesne systemy dialogowe oparte na regułach borykały się z wieloznacznością, co skłoniło do przyjęcia modeli opartych na danych oraz transformerach29. Kluczowe stały się obecnie reaktywność emocjonalna i społeczna: systemy multimodalne synchronizują sygnały twarzy i głosu w celu prowadzenia adaptacyjnego dialogu2,30. Uczenie ze wzmocnieniem poprawia koordynację między wskazówkami afektywnymi a akustycznymi5,31,32. Duże modele językowe, takie jak GPT-333 i ChatGPT34, umożliwiają rozumowanie kontekstowe i postępowanie zgodnie z instrukcjami w różnych zadaniach35,36,37. Ich integracja z systemami wizyjnymi i modelowaniem nagród38,39,40,41,42,43,44 wspiera uogólnioną interakcję z uwzględnieniem kontekstu społecznego.

Percepcja słuchowa uzupełnia wzrok i język. Prozodia, wysokość dźwięku i rytm komunikują intencje w sytuacjach, gdy wskazówki wizualne są niewiarygodne. Ekstrakcja cech oparta na wzmocnieniu poprawia synchronizację mowy z ekspresją. Zbiory danych takie jak AVA ActiveSpeaker45, AFFECT-HRI5, SAVEn-Vid46, HumorHRI47 oraz CHiME-5 zwiększają odporność modeli w głośnych środowiskach afektywnych. Pan i wsp.32 rozwijają synchronizację mowy z ruchem warg w scenach wieloosobowych, podczas gdy fuzja multimodalna z danymi dotykowymi lub fizjologicznymi pozwala na kształtowanie adaptacyjnych zachowań.

Wycierzeń i sensoryka fizjologiczna
Percepcja dotykowa i fizjologiczna wzmacniają świadomość społeczną i fizyczną. Siła, ciśnienie i biosygnały umożliwiają wnioskowanie o intencjach, stresie i zaangażowaniu. Symulatory dotyku oparte na wizji, takie jak TACTO4, oraz mapery neuronowe, takie jak FOTS48, generują wysokorozdzielcze dane o kontakcie z częstotliwością 300 fps, co wspiera sterowanie o niskim opóźnieniu. FOTS modeluje oświetlenie i odkształcenia za pomocą wyuczonej funkcji odbicia R:

Funkcja gradientu, I(x,y)=R(∂H/∂x,∂H/∂y), wzór, schemat matematyczny, rachunek wektorowy.

oraz projekcja cieni:

Równanie macierzy transformacji kwaternionów, wzór matematyczny dla analizy rotacji 3D.

gdzie Ms koduje geometrię projekcji. Wysokorozdzielcze skóry dotykowe zrealizowano z wykorzystaniem elastomerów magnetoreologicznych49, macierzy czujników EtherCAT50 oraz auksetycznych materiałów wykorzystujących efekt Halla51. Systemy takie jak DiGeTac13 jednoczą sygnały gestów, dotyku i odległości za pomocą modularnych potoków przetwarzania. Filtrowanie danych o odległości mierzonych metodą czasu przelotu (time-of-flight) modeluje się jako:

Równanie modelu AR; metoda analizy szeregów czasowych; wzór; prognozowanie danych; modelowanie statystyczne.

następnie przeprowadzono klasyfikację gestów neuronalnych oraz lokalizację kontaktu w oparciu o CNN. Kontrola bezpieczeństwa jest wymuszana poprzez skalowanie prędkości robota w zależności od odległości d. Moduły te umożliwiają stabilną współpracę człowieka z robotem. Transformery multimodalne dodatkowo integrują sygnały dotykowe, wizualne i tekstowe. TVT-Transformer6 dopasowuje reprezentacje specyficzne dla danej modalności (qi, ki, vi) w wspólne macierze:

Równania macierzowe Q, K, V; reprezentacje wektorowe w analizie symboli, formuła edukacyjna.

umożliwiając międzymodalną samouwagę dla zunifikowanego zrozumienia (Rysunek 7).

Postępy w sensoryce fizjologicznej sprzyjają dostrojeniu emocjonalnemu. Heinisch i wsp.5 synchronizują sygnały fizjologiczne i audiowizualne w celu modelowania afektu. Systemy oparte na elektromiografii52,53 dekodują gesty i mowę cichą, podczas gdy MetaSonic54 poprawia percepcję przestrzenną poprzez lokalizację akustyczną. Zestawy danych w dużej skali, takie jak AgiBot World Colosseo55, wspierają trening multimodalny z wykorzystaniem ponad miliona trajektorii taktylno-wizualnych. Wspólnie osiągnięcia te wyznaczają przejście od percepcji unimodalnej do zintegrowanego rozumienia stanów społecznych, fizycznych i wewnętrznych. Poprawiona wierność sensorów pozwala robotom nie tylko mierzyć kontakt, ale także interpretować wahanie, napięcie lub dyskomfort, reagując z wrażliwością i adaptacyjną kontrolą, co stanowi kluczowy fundament dla bezszwowych frameworków multimodalnych omawianych w dalszych sekcjach.

Fuzja multimodalna i uczenie reprezentacji
Fuzja umożliwia przekształcenie rozproszonych strumieni sensorycznych w spójne, kontekstowe sterowanie. Podejścia te są zazwyczaj grupowane jako fuzja wczesna, późna lub hybrydowa. Fuzja wczesna integruje cechy na etapie wejścia, wspierając zsynchronizowane sygnały, takie jak dopasowanie mowy do gestów lub mimiki do prozodii. Multimodalny Transformator opracowany przez Tsai i wsp.14 stanowi przykład wczesnej integracji sygnałów wizualnych, akustycznych i tekstowych opartej na mechanizmie uwagi. Xue i wsp.56 rozszerzyli to podejście o sprzężenie rezdualne punktów charakterystycznych twarzy i cech mowy, co poprawiło odporność na zmiany oświetlenia, natomiast Hu i wsp. zaproponowali MMSERNet57 – wieloskalową sieć fuzji wykorzystującą sploty rozszerzone i fuzję rezdualną do łączenia MFCC, spektrogramów oraz cech leksykalnych w celu rozpoznawania emocji. Wynik fuzji jest wyrażony jako:

Równanie sieci neuronowej; wykorzystuje ReLU i normalizację wsadową; przedstawione w formie wzoru matematycznego.

Fuzja późna (late fusion), w przeciwieństwie do powyższego, łączy decyzje po niezależnym przetwarzaniu, co zapewnia wyższą tolerancję na wejścia asynchroniczne lub zaszumione. Przykładami są kombinacje na poziomie decyzji sygnałów wzroku, inercyjnych i ruchu w podwodnych interakcjach człowiek-robot (HRI)58,59. Fuzja hybrydowa integruje oba podejścia — mapując heterogeniczne modalności do wspólnych przestrzeni osadzeń (embedding spaces), przy jednoczesnym zachowaniu specyfiki czasowej. Multimodalna sieć fuzji mózg-komputer (Multimodal Brain–Computer Fusion Network)60 dopasowuje cechy EEG i wizualne przed klasyfikacją, natomiast projekty cross-modalne do estymacji pozy 3D łączą dane inercyjne i monokularne61. Nowoczesne frameworki łączą warstwy splotowe, rekurencyjne i transformery z wyrównaniem uwagi (attention alignment)62,63, dynamicznie przypisując wagi modalnościom w zależności od kontekstu lub istotności zadania64,65,66. Wybór między fuzją wczesną, późną a hybrydową nie jest kwestią uniwersalnego rozwiązania. Fuzja wczesna zazwyczaj sprawdza się dobrze, gdy modalności są ściśle zsynchronizowane, a poziom szumów jest niski, co pozwala modelowi przechwytywać bogate relacje cross-modalne od samego początku. Fuzja późna jest natomiast zazwyczaj bardziej odporna w trudnych, asynchronicznych warunkach rzeczywistych, ponieważ każda modalność może być przetwarzana niezależnie przed połączeniem decyzji. Podejścia hybrydowe, które pojawiają się obecnie w około 43% niedawnych badań, stanowią użyteczny kompromis, szczególnie w interakcjach afektywnych i ucieleśnionych, wykorzystując mechanizmy uwagi do dynamicznego balansowania wejść, choć wiążą się one z dodatkowymi wymaganiami obliczeniowymi. Ostatecznie najlepsza strategia zależy od konkretnego zadania, profilu szumów i ograniczeń sprzętowych, co sugeruje, że przyszłe systemy mogą odnieść korzyść z możliwości zmiany trybu fuzji w czasie rzeczywistym.

Komplementarność między modalnościami zmienia się również w znacznym stopniu w zależności od kontekstu. Połączenie wzroku z haptyką jest szczególnie skuteczne w fizycznych zadaniach z bliskiej odległości, takich jak chwytanie lub przekazywanie przedmiotów, gdzie sprzężenie zwrotne dotykowe kompensuje przesłonięcie widoku, zmiany oświetlenia lub ograniczenia dystansu i dostarcza precyzyjnych informacji o sile i kontakcie, których dźwięk nie jest w stanie zapewnić. I odwrotnie, połączenie wzroku z dźwiękiem sprawdza się lepiej w sytuacjach zdystansowanych lub społecznych, takich jak rozpoznawanie emocji lub dialog w hałaśliwym otoczeniu, gdzie prozodia i ton niosą intencje oraz afekt w przypadku, gdy wskazówki wizualne są niedostępne lub niewiarygodne.

Poza klasycznym schematem fuzji wczesnej, późnej i hybrydowej, uczenie głębokie umożliwiło wprowadzenie bardziej szczegółowych kategoryzacji. Fuzja oparta na mechanizmach uwagi pozwala modelom uczyć się dynamicznego znaczenia poszczególnych modalności dla każdego wejścia, co w efekcie tworzy ścieżki integracji specyficzne dla konkretnego zadania i kontekstu, bez sztywnych granic etapowych. Strategie fuzji wyuczonej idą jeszcze dalej, traktując cały proces fuzji jako różniczkowalny moduł end-to-end, co pozwala sieci odkrywać optymalne wzorce kombinacji bezpośrednio z danych. Rozwoje te przesuwają paradygmat od zdefiniowanych reguł w stronę w pełni sterowanych danymi, adaptacyjnych architektur, które lepiej radzą sobie ze złożonością multimodalnej interakcji człowiek-robot (HRI) w czasie rzeczywistym.

Powiązanie wizji z językiem (Vision-language grounding)
Szybki wzrost modeli wielkojęzykowych rozszerzył zakres rozumowania multimodalnego, w szczególności dzięki modelom wizyjno-językowym (VLMs). Architektury te dopasowują informacje lingwistyczne i wizualne, aby umożliwić robotom interpretację poleceń, percepcję scen oraz generowanie działań zależnych od kontekstu. Podstawowe frameworki, takie jak LXMERT64 i CLIP66, wprowadziły wspólne osadzenia (embeddings) dla dopasowania obrazu i tekstu. Flamingo65 wprowadził rozumowanie multimodalne typu few-shot, natomiast model Clio39 autorstwa Maggio dynamicznie łączy instrukcje z grafami scen za pomocą semantyki CLIP. Gao i wsp.41 opracowali system LAMARS do planowania antycypacyjnego w oparciu o predykcję multimodalną, a Xie i wsp.67 zastosowali spatiotempelne modele splotowe w celu efektywnego rozumienia gestów. Arenas i wsp. wprowadzili personalizację opartą na promptach dla indywidualnych stylów interakcji68. Systemy te pozwalają na bezpośrednie powiązanie poleceń, takich jak podnieś czerwony kubek, z semantyką sceny.

Integracja z rozumowaniem przestrzennym dodatkowo usprawnia nawigację i interpretację robotyczną. System LatentBKI opracowany przez Wilsona38 opiera instrukcje na mapach przestrzennych opartych na wokselach, podczas gdy Nwankwo i współpracownicy40 łączą duże modele językowe z rozumowaniem VLM w celu interpretacji aktów dialogowych w warunkach niepewności wizualnej. Segmentacja oparta na zdarzeniach oraz metody percepcji asynchronicznej zwiększają efektywność w zadaniach dynamicznych. Wspólnie modele VLM pełnią rolę pomostów między instrukcjami symbolicznymi a rozumieniem ucieleśnionym, stanowiąc podłoże poznawcze dla elastycznej interakcji.

Zastosowania specyficzne dla danej dziedziny
W opiece zdrowotnej i opiece nad osobami starszymi komunikacja multimodalna umożliwia bezpieczną, intuicyjną i empatyczną pomoc. Funkcje kluczowe — detekcja upadków, monitorowanie codziennej aktywności, reagowanie w sytuacjach awaryjnych — opierają się na postawie, głosie i sygnałach z mimiki twarzy3. Hierarchiczne modele sterowania poprawiają precyzję ruchu w robotach wspomagających ruchy ramion1, natomiast sprzężenie zwrotne proprioceptywne kieruje działaniem asystentów pomagających w ubieraniu69. Przekazywanie przedmiotów, przedstawione na Ryc. 8, obrazuje zsynchronizowaną percepcję i koordynację ruchową70. Reaktywność emocjonalna, badana za pomocą systemów takich jak LOVOT, buduje zaufanie użytkownika, ale budzi obawy etyczne dotyczące nadmiernej zależności.

Roboty społeczne wymagają płynnej responsywności multimodalnej, aby podtrzymać empatię i zaufanie w środowiskach domowych i publicznych. Rysunek 9 przedstawia typową architekturę integrującą warstwy sensoryczne, planowania oraz rozumowania socjo-emocjonalnego. Duże modele językowe zintegrowane z percepcją umożliwiają prowadzenie otwartego dialogu modulowanego przez spojrzenie i ton głosu40. Badania pediatryczne wykazują, że ekspresyjny ruch i prozodia redukują lęk u dzieci71, natomiast ankiety wskazują na zachowania niewerbalne jako determinanty zaangażowania8. Modele proaktywne, takie jak RoboAgent37 oraz optymalizacja kolonii mrówek sterowana priorytetami pomocniczymi (Sub-Prior-guided Ant Colony Optimization)72, umożliwiają wspólną eksplorację wspólnych celów. Systemy zdolne do wyrażania stanów wewnętrznych (gotowość, zmieszanie)73 zwiększają przejrzystość i koordynację, natomiast adaptacyjne agenci społeczni pośredniczą w kolaboracji grupowej74,75.

Roboty edukacyjne: W edukacji multimodalna interakcja człowiek-robot (HRI) sprzyja motywacji i nauce, wykorzystując ucieleśnienie oraz sygnały społeczna76. Łączenie gestów, ekspresji twarzy i wskazówek werbalnych zwiększa dostępność i zaangażowanie6,9,77,78. Adaptacyjność emocjonalna wspiera młodszych uczniów: systemy wykrywające stan afektywny i modulujące mowę oraz ruch zwiększają koncentrację i zasób słownictwa7,79. Integracja z rzeczywistością wirtualną poprawia imersję, ale stanowi wyzwanie w zakresie skalowalności80. Wspólnie systemy te zmieniają rolę robota z instruktora na współpracownika dostrojonego emocjonalnie.

Personalizacja zapewnia trafność i zaufanie w systemach multimodalnych71,81,82. Etyczna personalizacja równoważy autonomię i empatię, dostosowując odpowiedzi poprzez sprzężenie zwrotne oparte na partycypacji. Maaz i wsp.83 zademonstrowali afektywne nauczanie kierowane wskazówkami twarzowymi i poznawczymi, natomiast Gomez-Izquierdo i wsp.84 stworzyli model preferencji użytkownika dla zsynchronizowanego zachowania. Spersonalizowaną adaptację można sformalizować jako:

Równowaga statyczna, równanie: U(u,c)=Σ(wi * fi(u,c)), wzór matematyczny.

gdzie wi to wyuczone wagi preferencji. Implementacje takie jak RFIS umożliwiają re-identyfikację osób oraz rozpoznawanie gestów w czasie rzeczywistym na brzegu sieci85, podczas gdy proprioceptywne interfejsy dotykowe10 umożliwiają intuicyjną komunikację fizyczną. Efekty percepcji społecznej dodatkowo modulują wyniki personalizacji, przy czym tożsamość narratora wpływa na czas odpowiedzi użytkownika oraz długość wypowiedzi86. Personalizacja przekształca zatem użytkowników z biernych odbiorców w współprojektantów, kształtujących interakcję poprzez wzajemną adaptację.

Podczas gdy większość analizowanych prac pozostaje na etapie prototypów badawczych, kilka multimodalnych technik HRI przeszło z fazy prototypu do zastosowań komercyjnych lub przemysłowych. Przykładowo robot Pepper firmy SoftBank integruje rozpoznawanie mowy, gestów i wyrazu twarzy w celu obsługi klienta oraz edukacji w środowiskach detalicznych i oświatowych87. Robot Human Support Robot firmy Toyota wykorzystuje fuzję wizji i gestów do zadań wspomagających w domach i placówkach opieki zdrowotnej88. W tych komercyjnych implementacjach strategie fuzji są często uproszczone, zazwyczaj wykorzystując podejścia późne lub hybrydowe z regułowymi mechanizmami zastępczymi w celu zapewnienia niezawodności i niskich kosztów, co podkreśla trwałą lukę między zaawansowanymi modelami akademickimi a skalowalnymi rozwiązaniami przemysłowymi. Pokonanie tej bariery będzie wymagało większego nacisku na wdrażanie typu edge oraz rygorystyczną walidację w rzeczywistych warunkach.

Wyzwania dla płynnej komunikacji w HRI
Mimo postępów w wielomodalnym wykrywaniu i fuzji danych, utrzymanie płynnej komunikacji człowiek-robot poza kontrolowanymi warunkami pozostaje trudne. Modele, które sprawdzają się w laboratoriach, często tracą na efektywności w obliczu szumu, opóźnień, przesłonięć, zmieniających się intencji lub ograniczeń zasobów. W literaturze przedmiotu wskazuje się na sześć powiązanych ze sobą barier: integrację wizji z językiem, synchronizację w czasie rzeczywistym, odporność wielomodalną, precyzję semantyczną, zakres zbiorów danych oraz ograniczenia wdrożeniowe.

Integracja języka i wizji
Zrozumienie wizualne stanowi podstawę osadzenia języka i działania w kontekście. Fundamenty zostały wzmocnione poprzez poprawę spójności przestrzennej i abstrakcji dzięki wizualno-inercyjnemu SLAM bez manualnej inicjalizacji89, re-identyfikacji oraz fuzji czujników w celu śledzenia odpornego na przesłonięcia16, predykcji grafów pasów ruchu90, segmentacji półnadzorowanej dopasowującej etykiety do użyteczności nawigacyjnej oraz wideo egocentrycznego z SLAM i wielkoskalową segmentacją w celu oceny przejezdności26. Kluczowym elementem pozostaje mapowanie uwzględniające niepewność: uPLAM łączy probabilistyczną lokalizację z segmentacją panoptyczną dla scen dynamicznych91, natomiast Clio adaptacyjnie buduje hierarchiczne grafy scen 3D oparte na CLIP dla semantyki wrażliwej na zadanie30. Metody osadzania ewoluowały od ustrukturyzowanych opisów i API percepcji92,93 w stronę multimodalnych enkoderów i dekoderów94,95.

Instrukcje realizowane w środowiskach otwartych integrują percepcję i rozumowanie. RobotGPT35 oraz GroundingGPT36 interpretują polecenia za pomocą sprzężonego wnioskowania wizualno-lingwistycznego; SayPlan, LFG i LLM-Planner dopasowują nawigację i planowanie do zakotwiczonego języka34,44. Aby zredukować halucynacje i zapewnić spójność semantyczną, GLAM i Vtimellm wprowadzają cele dopasowania96,97, podczas gdy frameworki adaptacyjne weryfikują wyniki LLM w odniesieniu do percepcji98,99. Czas reakcji ma kluczowy wpływ na czytelność: zoptymalizowany czas trwania gestów poprawia przewidywalność9; uczenie przez wzmacnianie redukuje opóźnienia audiowizualne w potokach przetwarzania emocji2; synchronizacja gestów zwiększa postrzeganą płynność100; a przeglądy literatury konsolidują narzędzia LSTM, DTW i GAN w celu synchronizacji101. Ogólnie rzecz biorąc, płynność wymaga pętli uwzględniającej opóźnienia w zakresie percepcji, fuzji i reakcji, gdzie naśladownictwo30 oraz predykcja inspirowana działaniem móżdżka102 koordynują czas, co zilustrowano również w pętlach czasowych na poziomie systemu na Rysunku 10.

Percepcja w czasie rzeczywistym w różnych modalnościach
Płynność zależy od ograniczonego opóźnienia end-to-end w heterogenicznych strumieniach danych. TACTO zapewnia wysoką rozdzielczość sprzężenia zwrotnego dotykowego przy niskiej latencji, co umożliwia responsywną manipulację. Dłonie sterowane ścięgnami osiągają szybką interakcję dzięki wizji zdarzeń (event vision) i lekkiej inferencji103, jak pokazano na Rysunku 11. W przypadku integracji wizji, języka i działania (vision–language–action), połączenie modelu CLIP z GraspNet przyspiesza chwytanie obiektów w nieuporządkowanym środowisku104. Transformery wspierają szybką klasyfikację społecznych gestów haptycznych11. Zoptymalizowane pod kątem krawędziowych urządzeń obliczeniowych (edge-optimized) modele audiowizualne utrzymują czas inferencji poniżej jednej sekundy24. Precyzyjne wyczucie czasu ruchów głowy zwiększa zaangażowanie105. Wspólnie wyniki te przemawiają za zsynchronizowaną fuzją, politykami buforowania dostosowanymi do modalności oraz lekkimi mechanizmami uwagi w celu zachowania czasowej koadaptacji. Dopuszczalna latencja różni się znacząco w zależności od dziedziny zadań. W dialogu społecznym lub rozpoznawaniu emocji opóźnienia poniżej 200–300 ms pozwalają zachować postrzeganą płynność i naturalność interakcji. Zadania wspomagające, takie jak przekazywanie przedmiotów czy detekcja upadków, wymagają ściślejszych ograniczeń (50–150 ms) dla zapewnienia bezpieczeństwa i responsywności. Teleoperacja lub kolaboracyjna manipulacja często wymagają latencji poniżej 100 ms, aby zapobiec dezorientacji operatora lub chorobie lokomocyjnej, podczas gdy aplikacje nawigacyjne lub monitorujące mogą tolerować 300–500 ms bez krytycznego wpływu na działanie.

Wyzwania związane z przetwarzaniem czasowym i semantycznym
Błędy synchronizacji i opóźnienia obniżają zaufanie oraz efektywność wykonywania zadań, szczególnie w rozproszonych systemach teleoperator–robot–człowiek106. Strategie percepcyjne i interfejsowe pomagają użytkownikom tolerować opóźnienia: gesty ciała i wypełniacze nieleksykalne107, nakładki wizualne i adaptacyjne wskazówki108,109,110,111. Predykcja na poziomie sterowania skraca luki w odpowiedziach102. Równoległe potoki dialogowe nakładają na siebie generowanie wypełniaczy, syntezę mowy i edycję promptów, aby zredukować postrzegany lag, jak w112 oraz na Ryc. 12. Badania systemowe rozkładają skumulowane opóźnienie na etapy przechwytywania, kodowania/dekodowania, sieci, podejmowania decyzji i aktuacji113. Jak pokazano na Ryc. 13, opóźnienie powstaje podczas przechwytywania danych przez czujniki, kodowania i dekodowania wideo, transmisji sieciowej, przetwarzania przez operatora oraz aktuacji pojazdu, tworząc złożoną, dwukierunkową pętlę sprzężenia zwrotnego. System Syntalos zapewnia synchronizację z dokładnością do milisekund dla eksperymentów w pętli zamkniętej114. W wymianach afektywnych naśladownictwo mimiki twarzy w czasie rzeczywistym zwiększa synchronizację23. Domeny wrażliwe na opóźnienia, takie jak zdalna chirurgia, wykazują, że zakotwiczenie haptyki względem opóźnionego obrazu wspiera precyzję i responsywność115. Jak pokazano na Ryc. 14, zakotwiczenie sprzężenia zwrotnego haptycznego doprowadziło do lepszych wyników i silniejszego poczucia responsywności.

Precyzyjne rozpoznawanie efektów i intencji wciąż stanowi wyzwanie. Mikroekspresje, prozodia, spojrzenie i ruchy antycypacyjne często występują krótko i asynchronicznie. Emo generuje antycypacyjne ekspresje twarzy dostosowane do stanu użytkownika116. Sama mowa ciała przekazuje intencje w sytuacjach, gdy twarz lub głos są niedostępne117. Multimodalne wyświetlacze oparte na Pepperze łączą klasyfikację werbalną z ekspresyjnymi gestami i emoji w celu uzyskania synchronii emocjonalnej118. Online RL wzmacnia fuzję strumieni twarzy i głosu2, podczas gdy lekka mimikra wspiera wdrożenia typu edge30. Do nierozwiązanych kwestii należą efekt grupowy, zmienność kulturowa oraz dryf efektu czasowego.

Generalizacja w domenach otwartych jest również ograniczona. Uczenie ze wzmocnieniem na podstawie informacji zwrotnych od ludzi (RLHF) charakteryzuje się rzadkimi nagrodami i podatnością na błędy przy danych spoza rozkładu119. RoboAgent łączy rozumowanie przestrzenne z ugruntowaniem językowym w celu transferu między zadaniami29. Rozumowanie poprzez dane pozbawione działań (RAD) wykorzystuje pasywne wideo i język do uzyskania możliwości zero-shot bez konieczności ręcznego etykietowania120. Perceiver-Actor ugruntowuje właściwości obiektów, aby manipulować nieznanymi przedmiotami121. Ciągłe dopasowanie między percepcją a semantyką w RobotGPT i GroundingGPT poprawia rozumowanie adaptacyjne, lecz nadal napotyka problemy z informacją zwrotną w czasie rzeczywistym35,36.

Wielomodalna odporność i zmienność środowiskowa
Odporność musi obejmować zarówno integralność sygnału, jak i spójność behawioralną. SimuMuHRI wprowadza szum i wypadanie danych specyficzne dla danej modalności, aby przetestować odporność systemu122. Oparta na fizyce symulacja światła strukturalnego poprawia niezawodność RGB-D w warunkach zmiennego oświetlenia i przesłonięć123,124. Sprzężenie opóźnienia z haptyką ujawnia wrażliwość w zdalnej manipulacji125. Zasady redundancji i odporności termicznej z krytycznych pod względem bezpieczeństwa systemów energetycznych stanowią podstawę dla odpornego na błędy HRI126,127.

Równie istotna jest spójność behawioralna. Niezgodność głosu z wyglądem obniża zaufanie128, a nieregularny, choć poprawny ruch, podważa współpracę129. Adaptacyjne sterowanie siłą w oparciu o obserwatora oraz odporne kontrolery interakcji zapewniają stabilność w warunkach ustrukturyzowanych i nieustrukturyzowanych niepewności130,131. Postęp ograniczają również zakresy dostępnych zbiorów danych. Zbiory danych dotyczące percepcji wielorobotycznej — OPV2V132, CoPeD133, CSE134 oraz AgiBot World Colosseo55 — rozszerzają możliwości wspólnego wykrywania w symulacjach i warunkach terenowych. Zasoby AV-HRI — CHiME-5135 wraz z późniejszym wyzwaniem CHiME-8136, AVA-ActiveSpeaker45, AFFECT-HRI5 oraz SAVEn-Vid46 — umożliwiają ASR, analizę aktywności mówcy, afektu oraz śledzenie instrukcji w długim kontekście. Wielkoskalowe benchmarki społeczne — HumorHRI47, THÖR-MAGNI137, RW4T138 oraz InViG139 — koncentrują się na humorze, nawigacji, pracy zespołowej i interaktywnym ugruntowaniu. Pomimo szerokiego zakresu, wiele zbiorów danych jest specyficznych dla danej dziedziny lub opartych na scenariuszu, z ograniczoną głębokością czasową pozwalającą na ocenę płynności interakcji, co podsumowano w Tabeli 3.

Ocena płynności współpracy
Konwencjonalne mierniki, takie jak dokładność i opóźnienie, nie oddają w pełni coadaptacji, wzajemnej predykcji czy biegłości społecznej. Nowe systemy ewaluacji oceniają spójność kontekstową oraz współpracę140, integrują opinie użytkowników i sygnały sytuacyjne141, a w fizycznej interakcji człowiek-robot (HRI) uwzględniają przewidywalność, koordynację i komfort84. Ramy zespołowe kwantyfikują wspólną antycypację74, podczas gdy cyfrowe bliźniaki śledzą kalibrację zaufania i płynność pracy zespołu142. Wciąż istnieje potrzeba stworzenia ujednoliconego punktu odniesienia, który łączyłby synchronizację czasową, dostrojenie afektywne i biegłość zorientowaną na użytkownika.

Dążenia do standaryzacji w ewaluacji multimodalnej interakcji człowiek-robot (HRI) pozostają ograniczone i rozproszone. Znaczące inicjatywy, takie jak wyzwania CHiME135,136, przyczyniły się do rozwoju punktów odniesienia w zakresie audiowizualnego rozpoznawania mowy, szczególnie pod kątem odporności na szumy. Zbiory danych takie jak THÖR-MAGNI137 i RW4T138 dostarczają wspólnych zasobów w obszarze przechwytywania ruchu i zachowań zespołowych. Niemniej jednak, wciąż nie istnieje powszechnie przyjęty, jednolity protokół dotyczący międzymodalnej synchronizacji czasowej, płynności interakcji czy dopasowania afektywnego w różnych modalnościach i domenach. Brak ustandaryzowanych metryk nadal utrudnia odtwarzalność i porównywalność wyników, co podkreśla potrzebę opracowania punktów odniesienia tworzonych przez społeczność naukową.

Od laboratorium do wdrożeń w świecie rzeczywistym
Wydajność często spada w nieustrukturyzowanych środowiskach ze względu na nieprawidłowości sensoryczne, zmieniające się intencje i wąskie gardła obliczeniowe143. Ten spadek wydajności podkreśla trwały podział między warunkami laboratoryjnymi a rzeczywistymi. W kontrolowanych środowiskach fuzja hybrydowa i oparta na mechanizmach uwagi (attention-based fusion) sprawdzają się znakomicie, zapewniając wysoką dokładność i niskie opóźnienia w zadaniach takich jak manipulacja obiektami czy rozumienie sceny. Wdrożenia w świecie rzeczywistym ukazują jednak inny obraz. Roboty asystujące w opiece nad osobami starszymi, systemy towarzyszące w domach oraz narzędzia edukacyjne w klasach rutynowo zmagają się z szumem, przesłonięciami, zmianami oświetlenia i nieprzewidywalnymi zachowaniami użytkowników, co obniża ich skuteczność. Podejścia oparte na późnej fuzji (late fusion) wykazują tendencję do większej niezawodności w tak zmiennych, asynchronicznych warunkach, podczas gdy modele hybrydowe, mimo swoich zalet w adaptacji afektywnej i kontekstowej, mogą być ograniczone wymaganiami obliczeniowymi urządzeń brzegowych (edge devices). Wiele udanych implementacji terenowych wciąż wykorzystuje prostszą redundancję lub zabezpieczenia oparte na regułach w celu zapewnienia niezawodności, co podkreśla, że przejście od obiecujących demonstracji laboratoryjnych do stabilnego funkcjonowania w codziennym użytkowaniu pozostaje ogromnym wyzwaniem. Testowanie ekologicznie ważne (ecologically valid testing) jest niezbędne do zidentyfikowania technik, które faktycznie odnoszą sukces poza kontrolowanymi eksperymentami. Adaptacyjne kontrolery odporne utrzymują dokładność siły w obliczu zakłóceń131. Planowanie kolaboratywne sterowane przez LLM aktualizuje cele w miarę ewolucji intencji użytkownika144. Nakładki wizualne i sprzężenie zwrotne uwzględniające opóźnienia pomagają utrzymać świadomość operatora przy zdegradowanych łączach107,109. Lekki nadzór z wykorzystaniem LoRa i cyfrowych bliźniaków (digital shadows) umożliwia monitorowanie w obszarach o niskiej przepustowości łącza145. Doświadczenia z robotyki kosmicznej wskazują, że autonomia musi współewoluować z ludzkim poznaniem w warunkach niepewności i opóźnień146.

Ograniczenia zasobów kształtują wykonalność. Rozpoznawanie afektu i dotyku oparte na dźwięku działa przy zużyciu poniżej 1 MB i 0,7 GFLOPs dla platform o niskim poborze mocy12. Dodanie funkcji społecznych może poprawić poczucie obecności, ale niesie ryzyko przeciążenia w przypadku wzrostu opóźnień147. Planowanie i wybór funkcji muszą równoważyć obciążenie poznawcze z ciągłością148. Łagodzenie opóźnień obejmuje percepcję, sterowanie i sieci, zgodnie z organizacją przedstawioną w 113. Użytkownicy często preferują przejrzystą, stabilną interakcję nad maksymalną efektywność zadania, co potwierdza, że płynna HRI musi priorytetyzować możliwości techniczne równolegle z komfortem człowieka149,151. W różnych dziedzinach wdrożenia w świecie rzeczywistym wykazują wyraźne preferencje: aplikacje społeczne i edukacyjne często opierają się na hybrydowej fuzji wizyjno-audio dla dialogu afektywnego, podczas gdy zadania asystujące i kolaboracyjne faworyzują kombinacje wizyjno-haptyczne z fuzją późną lub wczesną dla precyzyjnej interakcji fizycznej. Wzorce te są zgodne z podsumowanymi strategiami — priorytetyzacją fuzji późnej dla zwiększenia odporności w zmiennych warunkach oraz fuzji hybrydowej/opartej na mechanizmach uwagi dla bogatszej adaptacji kontekstowej — choć upraszczanie w celu zapewnienia niezawodności pozostaje powszechną praktyką.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wnioski

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy przegląd posiada kilka ograniczeń. Ograniczenie wyszukiwania do publikacji w języku angielskim w bazie Web of Science Core Collection mogło wprowadzić błąd językowy i doprowadzić do pominięcia istotnych prac nieanglojęzycznych. Skupienie się na artykułach recenzowanych z lat 2015–2025 mogło również odzwierciedlać błąd publikacyjny, potencjalnie pomijając preprinty, literaturę szarą lub pojawiające się wyniki nieopublikowane. Ręczna selekcja 148 prac, choć prowadzona zgodnie z wyraźnymi kryteriami, nieuchronnie ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To dzieło zostało wspierane przez Universiti Sains Malaysia, Grant na rzecz łączenia ze sfinansowaniem nr: R501-LR-RND003-0000001342-0000.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Frennert, S., et al. Towards a hierarchical user requirement structure for upper limb assistive robotics. ACM Trans Hum-Robot Interact. 14 (1), 1-26 (2024).
  2. Kansizoglou, I., Bampis, L., Gasteratos, A. An active learning paradigm for online audio- visual emotion recognition. IEEE Trans Affect Comput. 13 (2), 756-768 (2019).
  3. Keroglou, C., et al. A survey on technical challenges of assistive robotics for elder people in domestic environments: The aspida concept. IEEE Trans Med Robot Bionics. 5 (2), 196-205 (2023).
  4. Wang, S., Lambeta, M., Chou, P. W., Calandra, R. Tacto: A fast, flexible, and open-source simulator for high-resolution vision-based tactile sensors. IEEE Robot Autom Lett. 7 (2), 3930-3937 (2022).
  5. Heinisch, J., et al. Physiological data for affective computing in HRI with anthropomorphic service robots: The AFFECT-HRI data set. Sci Data. 11 (1), 333 (2024).
  6. Li, B., et al. TVT-Transformer: A tactile-visual-textual fusion network for object recognition. Inf Fusion. 118, 102943 (2025).
  7. Kim, H., et al. Technological applications of social robots to create healthy and comfortable smart home environment. Build Environ. , 112269 (2024).
  8. Leoste, J., Marmor, K., Heidmets, M. Nonverbal behavior of service robots in social interactions: A survey on recent studies. Interact Des Archit. 61, 164-192 (2024).
  9. Liu, N., et al. A lightweight network-based sign language robot with facial mirroring and speech system. Expert Syst Appl. 262, 125492 (2024).
  10. Iskandar, M., Albu-Schäffer, A., Dietrich, A. Intrinsic sense of touch for intuitive physical human-robot interaction. Sci Robot. 9 (93), eadn4008 (2024).
  11. Ren, Q., Hou, Y., Belpaeme, T. Low-latency classification of social haptic gestures using transformers. , (2023).
  12. Hou, Y., Ren, Q., Wang, W., Botteldooren, D. Sound-based recognition of touch gestures and emotions for enhanced human-robot interaction. , (2025).
  13. Al, G., Martinez-Hernandez, U. DiGeTac unit for multimodal communication in human-robot interaction. IEEE Sens Lett. 8 (5), 6001804 (2024).
  14. Tsai, Y. H., et al. Multimodal transformer for unaligned multimodal language sequences. , (2019).
  15. Wang, Z., Chen, M., Liu, Q. A review on multimodal communications for human-robot collaboration in 5G: From visual to tactile. Intell Robot. 5 (3), 579-606 (2025).
  16. Antonucci, A., et al. Humans as path-finders for mobile robots using teach-by-showing navigation. Auton Robots. 47 (8), 1255-1273 (2023).
  17. Duarte, N. F., Rakovic, Action anticipation: Reading the intentions of humans and robots. IEEE Robot Autom Lett. 3 (4), 4132-4139 (2018).
  18. Hayashi, K. Investigation of joint action in go/no-go tasks: Development of a human-like eye robot and verification of action space. Int J Soc Robot. , 1-14 (2024).
  19. Belkaid, M., et al. Mutual gaze with a robot affects human neural activity and delays decision-making processes. Sci Robot. 6 (58), eabc5044 (2021).
  20. Guidolin, M., Tagliapietra, L., Menegatti, E., Reggiani, M. Hi-ros: Open-source multi-camera sensor fusion for real-time people tracking. Comput Vis Image Underst. 232, 103694 (2023).
  21. Ovur, S. E., Demiris, Y. Naturalistic robot-to-human bimanual handover in complex environments through multi-sensor fusion. IEEE Trans Autom Sci Eng. 21 (3), 3730-3741 (2023).
  22. Viola, P., Jones, M. Rapid object detection using a boosted cascade of simple features. , (2001).
  23. Stauffer, C., Grimson, W. E. L. Adaptive background mixture models for real-time tracking. , (1999).
  24. Qi, W., et al. Multi-sensor guided hand gesture recognition for a teleoperated robot using a recurrent neural network. IEEE Robot Autom Lett. 6 (3), 6039-6045 (2021).
  25. Sun, J., Shen, Y., Rosen, J. Sensor reduction, estimation, and control of an upper-limb exoskeleton. IEEE Robot Autom Lett. 6 (2), 1012-1019 (2021).
  26. Kim, Y., et al. Learning semantic traversability with egocentric video and automated annotation strategy. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).
  27. Ye, H., et al. Person re-identification for robot person following with online continual learning. IEEE Robot Autom Lett. 9 (11), 9151-9158 (2024).
  28. Vaswani, A., et al. Attention is all you need. , (2017).
  29. Schneider, S., Baevski, A., Collobert, R., Auli, M. Wav2vec: Unsupervised pre-training for speech recognition. , (2024).
  30. Liu, X., Chen, Y., Li, J., Cangelosi, A. Real-time robotic mirrored behavior of facial expressions and head motions based on lightweight networks. IEEE Internet Things J. 10 (2), 6039-6048 (2022).
  31. Tsai, C. Y., Su, Y. K. MobileNet-JDE: A lightweight multi-object tracking model for embedded systems. Multimed Tools Appl. 81 (7), 9915-9937 (2022).
  32. Pan, Z., Tao, R., Xu, C., Li, H. Selective listening by synchronizing speech with lips. IEEE/ACM Trans Audio Speech Lang Process. 30, 1650-1664 (2022).
  33. Brown, T. B., et al. Language models are few-shot learners. , (2020).
  34. Jin, Y., et al. RobotGPT: Robot manipulation learning from ChatGPT. IEEE Robot Autom Lett. 9 (3), 2543-2550 (2024).
  35. Li, Z., et al. GroundingGPT: Language Enhanced Multi-modal Grounding Model. , (2024).
  36. Bharadhwaj, H., et al. Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking. , (2024).
  37. Wilson, J., et al. LatentBKI: Open-dictionary continuous mapping in visual-language latent spaces with quantifiable uncertainty. IEEE Robot Autom Lett. , (2025).
  38. Maggio, D., et al. Clio: Real-time task-driven open-set 3D scene graphs. IEEE Robot Autom Lett. 9 (10), 5123-5130 (2024).
  39. Nwankwo, L., Rueckert, E. The Conversation is the Command: Interacting with Real-World Autonomous Robots Through Natural Language. , (2024).
  40. Gao, Y., et al. LAMARS: Large language model-based anticipation mechanism acceleration in real-time robotic systems. IEEE Access. 13, 3864-3880 (2024).
  41. Rana, K., et al. Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning. , (2023).
  42. Shah, D., et al. Navigation with large language models: Semantic guesswork as a heuristic for planning. , (2023).
  43. Song, C. H., et al. LLM-Planner: Few-shot grounded planning for embodied agents with large language models. , (2023).
  44. Roth, J., et al. AVA-ActiveSpeaker: An audio-visual dataset for active speaker detection. , (2020).
  45. Li, J., et al. SAVen-Vid: Synergistic audio-visual integration for enhanced understanding in long video context. arXiv. , (2024).
  46. Zhang, H., Hei, X., Cardenas, J., Miao, X., Tapus, A. Toward a multi-dimensional humor dataset for social robots. , (2024).
  47. Zhao, Y., Qian, K., Duan, B., Luo, S. FOTS: A fast optical tactile simulator for sim2real learning of tactile-motor robot manipulation skills. IEEE Robot Autom Lett. 9 (6), 2150-2157 (2024).
  48. Chen, D., et al. A high spatial resolution magnetorheological elastomer tactile sensor for texture recognition. IEEE Sens J. 25 (5), 1234-1241 (2025).
  49. Giovinazzo, F., et al. Design, implementation and testing of an EtherCAT-based network for multi-modal distributed sensing architectures. , (2024).
  50. Yun, Y., et al. Enhancing sensitivity across scales with highly sensitive Hall effect-based auxetic tactile sensors. Adv Intell Syst. 7 (3), 2300456 (2024).
  51. Zafar, M., Moosavi, S. K. R., Sanfilippo, F. Federated learning-enhanced edge deep learning model for EMG-based gesture recognition in real-time human-robot interaction. IEEE Sens J. 25 (5), 1234-1241 (2025).
  52. Dong, P., et al. Decoding silent speech cues from muscular biopotential signals for efficient human-robot collaborations. Adv Mater Technol. 10 (4), 2301123 (2024).
  53. Wang, J., An, Z., Guo, Y. MetaSonic: Advancing robot localization with directional embedded acoustic signals. IEEE Robot Autom Lett. 10 (2), 3150-3157 (2025).
  54. AgiBot-World-Contributors. AgiBot World Colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems. , (2025).
  55. Xue, F., Li, Y., Liu, D., Xie, Y., Wu, L., et al. LipFormer: Learning to lipread unseen speakers based on visual-landmark transformers. IEEE Trans Circuits Syst Video Technol. 33 (9), 4507-4517 (2023).
  56. Hu, H., et al. Speech emotion recognition based on multimodal and multiscale feature f usion. Signal Image Video Process. 19 (2), 123 (2024).
  57. Lee, D., et al. Intuitive six-degree-of-freedom human interface device for human-robot interaction. IEEE Trans Instrum Meas. 73, 1-10 (2024).
  58. Kvasic, I., et al. Diver-robot communication dataset for underwater hand gesture recognition. Comput Netw. 245, 110392 (2024).
  59. Li, Z., et al. MBCFNet: A multimodal brain-computer fusion network for human intention recognition. Knowl-Based Syst. 296, 111826 (2024).
  60. Popescu, M., et al. Fusion of inertial sensor suit and monocular camera for 3D human pelvis pose estimation. , (2024).
  61. Zhou, S., Yang, B., Yuan, M., Jiang, R., Yan, R., et al. Enhancing SNN-based spatiotemporal learning: A benchmark dataset and cross-modal attention model. IEEE Trans Neural Netw Learn Syst. 35 (8), 11234-11248 (2024).
  62. Biswas, S., Saw, R., Nandy, A. Attention-enabled hybrid convolutional neural network for enhancing human-robot collaboration through hand gesture recognition. Comput Electr Eng. 123, 110020 (2025).
  63. Tan, H., Bansal, M. LXMERT: Learning cross-modality encoder representations from transformers. , (2019).
  64. Alayrac, J. B., et al. Flamingo: a visual language model for few-shot learning. , (2022).
  65. Radford, A., et al. Learning transferable visual models from natural language supervision. , (2021).
  66. Xie, J., Zhang, B., Lu, Q., Borisov, O. A dynamic head gesture recognition method for real- time intention inference and its application to visual human-robot interaction. Int J Control Autom Syst. 22, 252-264 (2024).
  67. Arenas, M., et al. How to prompt your robot: A promptbook for manipulation skills with code as policies. , (2024).
  68. Zhu, J., Gienger, M., Franzese, G., Kober, J. Do you need a hand?—A bimanual robotic dressing assistance scheme. IEEE Trans Robot. 40, 1906-1919 (2024).
  69. Ortenzi, V., et al. Object handovers: A review for robotics. IEEE Trans Robot. 37 (6), 2150-2168 (2022).
  70. Kabacińska, K., Teng, K., Robillard, J. Social robot interactions in a pediatric hospital setting: Perspectives of children, parents, and healthcare providers. Multimodal Technol Interact. 9 (2), 14 (2025).
  71. Viyuela, &. #. 2. 1. 1. ;., Sanfeliu, A. Human-robot collaborative minimum time search through sub- priors in ant colony optimization. IEEE Robot Autom Lett. 9 (11), 1123-1130 (2024).
  72. Roy, L., Croft, E., Kulić, D. Learning to communicate functional states with nonverbal expressions for improved human-robot collaboration. IEEE Robot Autom Lett. 9 (6), 7123-7130 (2024).
  73. San Martin, A., Kildal, J., Lazkano, E. An analysis of the role of different levels of exchange of explicit information in human-robot cooperation. Front Robot AI. 12, 1511619 (2025).
  74. Gillet, S., et al. Interaction-shaping robotics: Robots that influence interactions between other agents. ACM Trans Hum-Robot Interact. 13 (1), 25 (2024).
  75. Belpaeme, T., et al. Social robots for education: A review. Sci Robot. 3 (21), eaat5954 (2018).
  76. Zhang, R., et al. Predicting emotion reactions for human-computer conversation: A variational approach. IEEE Trans Hum-Mach Syst. 51 (4), 712-721 (2022).
  77. Huang, C., Fu, L., Hung, S. C., Yang, S. Effect of visual programming instruction on students' flow experience, programming self-efficacy, and sustained willingness to learn. J Comput Assist Learn. 41 (1), 123-135 (2025).
  78. Berrezueta-Guzman, S., Dolón-Poza, M. Enhancing preschool language acquisition through robotic assistants: An evaluation of effectiveness, engagement, and acceptance. IEEE Access. , (2025).
  79. Lei, Y., Su, Z., Cheng, C. Virtual reality in human-robot interaction: Challenges and benefits. Electron Res Arch. 31 (4), 2374-2408 (2023).
  80. Pareto, J., Coeckelbergh, M. Social assistive robotics: An ethical and political inquiry through the lens of freedom. Int J Soc Robot. 16 (8), 1797-1808 (2024).
  81. Hung, L., et al. “It’s always happy to see me”: Exploring LOVOT robots as companions for older adults. J Rehabil Assist Technol Eng. 12, 20556683251320669 (2025).
  82. Maaz, N., Mounsef, J., Maalouf, N. CARE: Towards customized assistive robot-based education. Front Robot AI. 12, 1474741 (2025).
  83. Gómez-Izquierdo, G., Laplaza, J., Sanfeliu, A., Garrell, A. Enhancing context-aware human motion prediction for efficient robot handovers. , (2025).
  84. Lee, S., Lee, S., Park, H. Integration of tracking, re-identification, and gesture recognition for facilitating human-robot interaction. Sensors. 24 (15), 4850 (2024).
  85. Bakhoda, I., et al. Exploring the impact of narrator type on response latency and utterance length during interactive storytelling. , (2024).
  86. Pandey, A. K., Gelin, R. A mass-produced sociable humanoid robot: Pepper: The first machine of its kind. IEEE Robot Autom Mag. 25 (3), 40-48 (2018).
  87. Yamamoto, T., et al. Toyota Human Support Robot (HSR): Development and future prospects. 2019 IEEE/SICE International Symposium on System Integration (SII). , 634-639 (2019).
  88. Lupton, T., Sukkarieh, S. Visual-inertial-aided navigation for high-dynamic motion in built environments without initial conditions. IEEE Trans Robot. 28 (1), 61-76 (2011).
  89. Zürn, J., Posner, I., Burgard, W. Autograph: Predicting lane graphs from traffic observations. IEEE Robot Autom Lett. 9 (1), 73-80 (2024).
  90. Sirohi, K., Büscher, D., Burgard, W. UPLAM: Robust panoptic localization and mapping leveraging perception uncertainties. IEEE Robot Autom Lett. 9 (8), 5123-5130 (2024).
  91. Wang, L., et al. A survey on large language model based autonomous agents. Front Comput Sci. 18 (6), 186345 (2024).
  92. Zang, Y., et al. Contextual object detection with multimodal large language models. Int J Comput Vis. 133 (2), 1-19 (2024).
  93. Ivanovic, B., et al. Multimodal deep generative models for trajectory prediction: A conditional variational autoencoder approach. IEEE Robot Autom Lett. 6 (2), 295-302 (2020).
  94. Floridi, L., Chiriatti, M. GPT-3: Its nature, scope, limits, and consequences. Minds Mach. 30, 681-694 (2020).
  95. Carta, T., et al. Grounding large language models in interactive environments with online reinforcement learning. , (2023).
  96. Huang, B., et al. VTimeLLM: Empower LLM to grasp video moments. , (2024).
  97. Gupta, M., et al. From ChatGPT to ThreatGPT: Impact of generative AI in cybersecurity and privacy. IEEE Access. 11, 80218-80245 (2023).
  98. Li, X., et al. Chain-of-knowledge: Grounding large language models via dynamic knowledge adapting over heterogeneous sources. , (2024).
  99. Kimoto, M., Iio, T., Shiomi, M., Shimohara, K. Coordinating entrainment phenomena: Robot conversation strategy for object recognition. Appl Sci. 11 (5), 2358 (2021).
  100. Nyatsanga, S., et al. A comprehensive review of data-driven co-speech gesture generation. Comput Graph Forum. 42 (2), 569-596 (2023).
  101. Abadía, I., et al. A cerebellar-based solution to the nondeterministic time delay problem in robotic control. Sci Robot. 6 (58), eabf2756 (2021).
  102. Deng, X., Weirich, S., Katzschmann, R. K., Delbruck, T. A rapid and robust tendon-driven robotic hand for human-robot interactions playing rock-paper-scissors. , (2024).
  103. Xu, K., et al. A joint modeling of vision-language-action for target-oriented grasping in clutter. , (2023).
  104. Lee, H., Hahn, S. Effect of robot head movement and its timing on human-robot interaction. Int J Soc Robot. 17 (1), 3-14 (2024).
  105. Kim, S., Hernandez, I., Nussbaum, M., Lim, S. Teleoperator-robot-human interaction in manufacturing: Perspectives from industry, robot manufacturers, and researchers. IISE Trans Occup Ergon Hum Factors. 12 (1-2), 28-40 (2024).
  106. Pelikan, H., Hofstetter, E. Managing delays in human-robot interaction. ACM Trans Comput-Hum Interact. 30 (4), 1-24 (2022).
  107. Kang, D., Nam, C., Kwak, S. Robot feedback design for response delay. Int J Soc Robot. 16 (2), 1341-1361 (2024).
  108. Akita, E., Zaidner, G., Pryor, M. Improved situational awareness and performance with dynamic task-based overlays for teleoperation. , (2024).
  109. Scholz, C., et al. Improving robot-to-human communication using flexible display technology as a robotic-skin-interface: A co-design study. Int J Intell Robot Appl. 9 (1), 146-163 (2024).
  110. Reardon, C., et al. Augmented reality visualization of autonomous mobile robot change detection in uninstrumented environments. ACM Trans Hum-Robot Interact. 13 (3), 1-30 (2024).
  111. Asaka, S., Itoyama, K., Nakadai, K. Improving impressions of response delay in AI-based spoken dialogue systems. , (2024).
  112. Kamtam, S., et al. Network latency in teleoperation of connected and autonomous vehicles: A review of trends, challenges, and mitigation strategies. Sensors. 24 (12), 3957 (2024).
  113. Klumpp, M., et al. Syntalos: A software for precise synchronization of simultaneous multi- modal data acquisition and closed-loop interventions. Nat Commun. 16 (1), 708 (2025).
  114. Du, J., et al. Sensory manipulation as a countermeasure to robot teleoperation delays: System and evidence. Sci Rep. 14, (2024).
  115. Hu, Y., et al. Human-robot facial coexpression. Sci Robot. 9 (88), eadi4724 (2024).
  116. Gao, W., Shen, S., Ji, Y., Tian, Y. Human perception of the emotional expressions of humanoid robot body movements: Evidence from survey and eye-tracking measurements. Biomimetics. 9 (11), 684 (2024).
  117. Cárdenas, P., et al. Evaluation of robot emotion expressions for human-robot interaction. Int J Soc Robot. 16 (9), 2019-2041 (2024).
  118. Casper, S., et al. Open problems and fundamental limitations of reinforcement learning from human feedback. , (2025).
  119. Clark, J., Mirchandani, S., Sadigh, D., Belkhale, S. Action-free reasoning for policy generalization. arXiv. , (2025).
  120. Shridhar, M., et al. Perceiver-Actor: A multi-task transformer for robotic manipulation. , (2022).
  121. Wang, X. Mobile robot environment perception system based on multimodal sensor fusion. Appl Comput Eng. 127, 42-49 (2025).
  122. Bai, K., Zhang, L., Chen, Z., Wan, F., Zhang, J. Close the sim2real gap via physically-based structured light synthetic data simulation. , (2024).
  123. Fatehi, K., Torres, M., Kucukyilmaz, A. An overview of high-resource automatic speech recognition methods and their empirical evaluation in low-resource environments. Speech Commun. 167, 103151 (2024).
  124. Louca, J., Eder, K., Vrublevskis, J., Tzemanaki, A. Impact of haptic feedback in high latency teleoperation for space applications. ACM Trans Hum-Robot Interact. 13 (2), 1-21 (2024).
  125. Luo, W., Zhang, S., Gao, Y., Shen, C. Review of mechanisms and detection methods of internal short circuits in lithium-ion batteries. Ionics. 31 (5), 3945-3964 (2025).
  126. Luo, W., et al. Study on the comprehensive multisource thermal runaway failure characteristics and cooling effects of extinguishing agents in 280 Ah batteries. Phys Fluids. 37 (3), (2025).
  127. Alimardani, M., Roode, R., Vaitonyte, J., Louwerse, M. Effect of a virtual agent's appearance and voice on uncanny valley and trust in human-agent collaboration. , (2024).
  128. Moradinezhad, R., Solovey, E. Investigating trust in interaction with inconsistent embodied virtual agents. Int J Soc Robot. 13 (8), 2103-2118 (2021).
  129. Zixuan, H., et al. Observer-based adaptive robust force control of a robotic manipulator integrated with external force/torque sensor. Actuators. 14 (3), 116 (2025).
  130. Huang, J., et al. Adaptive robust interaction force control of a robotic manipulator in uncertain environments. IEEE Trans Ind Electron. 72 (8), 8251-8260 (2025).
  131. Xu, R., et al. OPV2V: An open benchmark dataset and fusion pipeline for perception with vehicle-to-vehicle communication. , (2022).
  132. Zhou, Y., Quang, L., Nieto-Granda, C., Loianno, G. CoPeD: Advancing multi-robot collaborative perception—A comprehensive dataset in real-world environments. IEEE Robot Autom Lett. 9 (7), 6416-6423 (2024).
  133. Park, H., et al. A benchmark dataset for collaborative SLAM in service environments. IEEE Robot Autom Lett. 9 (12), 11337-11344 (2024).
  134. Barker, J., Watanabe, S., Vincent, E., Trmal, J. The fifth CHiME speech separation and recognition challenge: Dataset, task and baselines. , (2018).
  135. Cornell, S., et al. The CHiME-8 DASR challenge for generalizable and array agnostic distant automatic speech recognition and diarization. , (2024).
  136. Schreiter, T., et al. THÖR-MAGNI: A large-scale indoor motion capture recording of human movement and robot interaction. Int J Robot Res. 44 (4), 568-591 (2024).
  137. Savko, L., Qian, Z., Gremillion, G., Neubauer, C., Canady, J., et al. RW4T dataset: Data of human-robot behavior and cognitive states in simulated disaster response tasks. , (2024).
  138. Zatsarynna, O., Farha, Y., Gall, J. Multi-modal temporal convolutional network for anticipating actions in egocentric videos. , (2021).
  139. Gkournelos, C., Konstantinou, C., Makris, S. An LLM-based approach for enabling seamless human-robot collaboration in assembly. CIRP Ann. 73 (1), 9-12 (2024).
  140. Rahimi, H., et al. User-VLM 360: Personalized vision language models with user-aware tuning for social human-robot interactions. , (2025).
  141. Langås, E., Zafar, M., Sanfilippo, F. Exploring the synergy of human-robot teaming, digital twins, and machine learning in industry 5.0: A step towards sustainable manufacturing. J Intell Manuf. , 1-24 (2025).
  142. Nizamuddin, M., Kamisetty, A., Gummadi, J. C., Talla, R. R. Integrating neural networks with robotics: Towards smarter autonomous systems and human-robot interaction. Robotics Xplore: USA Tech Digest. 1 (1), 157-169 (2024).
  143. Asuzu, K., Singh, H., Idrissi, M. Human-robot interaction through joint robot planning with large language models. Intell Serv Robot. 18 (2), 261-277 (2025).
  144. Shamshiri, R., et al. Internet of robotic things with a local LoRa network for teleoperation of an agricultural mobile robot using a digital shadow. Discov Appl Sci. 6, 414 (2024).
  145. Smith, C., Mott, T., Williams, T. Perspectives on level of autonomy decisions in space robotics. , (2024).
  146. Kim, T., Song, Y., Kim, D., Song, H. Too much is as bad as too little: The impact of implementing multiple social interaction features on trust and acceptance of automated vehicle agents. Int J Hum-Comput Interact. 41 (21), 13875-13890 (2025).
  147. Elsayyad, S., et al. An effective robot selection and recharge scheduling approach for improving robotic networks performance. Sci Rep. 14 (1), 28439 (2024).
  148. Mayer, L., et al. Human-AI collaboration: Trade-offs between performance and preferences. Cogn Res Princ Implic. 11, 18 (2026).
  149. Yang, B., et al. Gaze and environmental context-guided deep neural network and sequential decision fusion for grasp intention recognition. IEEE Trans Neural Syst Rehabil Eng. 31, 3687-3689 (2023).
  150. Rückin, J., Magistri, F., Stachniss, C., Popović, M. Semi-supervised active learning for semantic segmentation in unknown environments using informative path planning. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Strategie fuzjiarchitektury system wprzetwarzanie w czasie rzeczywistymdopasowanie semantycznefuzja adaptacyjnauczenie ci g eroboty asystuj ce spo ecznie

Powiązane artykuły