Übersichtsartikel

Nahtlose multimodale Mensch-Roboter-Kommunikation: Integrationstechniken in der Mensch-Computer-Interaktion

DOI:

10.3791/70218

9. Juni 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Übersichtsarbeit fasst jüngste Fortschritte im Bereich Deep Learning, multimodaler Sensorik und Integrationsstrategien zusammen, die nahtlose, adaptive und menschenzentrierte Kommunikation zwischen Mensch und Robotern ermöglichen.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nahtlose multimodale Mensch-Roboter-Kommunikation ist unerlässlich geworden, da soziale, unterstützende und pädagogische Roboter in alltägliche Umgebungen wie Haushalte, Gesundheitseinrichtungen und Klassenräume einziehen, wo sie Sprache, Gesten, Blick, Gesichtsausdrücke und taktile Hinweise mit hoher Präzision, geringer Latenz und realer Robustheit integrieren müssen. Diese Übersichtsarbeit untersucht systematisch, wie aktuelle Techniken eine Echtzeit-, reziproke multimodale Mensch-Roboter-Interaktion (HRI) erreichen, wobei der Fokus auf Fusionsstrategien, Systemarchitekturen und Anwendungen in spezifischen Bereichen liegt. Wir durchsuchten die Web of Science Core Collection von 2015 bis 2025 nach englischsprachigen empirischen Studien und wählten 148 Artikel aus, die sich mit kommunikativer Integration befassen. Die wichtigsten Erkenntnisse umfassen seit 2022 eine klare Verschiebung hin zu hybriden und aufmerksamkeitsbasierten Fusionen (etwa 43 % der Ansätze), die zeitliche Asynchronität und verkörperte Interaktionen besser behandelt als frühere Methoden; weitverbreitete Inkonsistenz in den Evaluationsmetriken, die Cross-Study-Vergleiche behindert; und eine anhaltende Lücke zwischen starker Laborleistung und schwächerer realer Robustheit bei Rauschen, Okklusion oder Benutzervariabilität. Wichtige Herausforderungen sind Echtzeitverarbeitung, semantische Ausrichtung, Dateneffizienz, Bereitstellungsrobustheit und die wenig erforschte Integration taktiler Signale mit Affect. Mit Blick auf die Zukunft schlägt die Überprüfung vor, adaptive Fusionsrichtlinien, standardisierte Benchmarks für Synchronisation und Flüssigkeit sowie kontinuierliches Lernen zu priorisieren, um eine benutzerpersonalisierte Anpassung zu ermöglichen. Letztlich zielt es darauf ab, die Entwicklung von stärker menschenzentrierten robotischen Agenten zu steuern, die kollaborativ, sinnvoll und im Alltag gesellschaftlich akzeptabel sind.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Roboter haben sich von industriellen Werkzeugen in strukturierten Umgebungen zu sozial eingebetteten Agenten in Haushalten, Krankenhäusern und Klassenzimmern entwickelt. Sie unterstützen nun bei Bildung, Therapie und Gesellschaft und spiegeln damit einen Wandel von aufgabenorientierter Automatisierung hin zu nutzerzentrierter, adaptiver Interaktion wider. Im Zentrum dieses Übergangs steht die multimodale Kommunikation, die es Robotern ermöglicht, menschliche Hinweise – Sprache, Blick, Gesten, Gesichtsausdrücke und Berührung – mit der zeitlichen Präzision wahrzunehmen und darauf zu reagieren, die für natürliche Austausche in dynamischen Umgebungen erforderlich ist. Diese Betonung von Koordination und Reaktionsfähigkeit steht im Einklang mit zentralen Anliegen der Mensch-Computer-Interaktion und der Kognitionswissenschaft. In dieser Übersicht bezeichnet nahtlose multimodale Kommunikation Interaktionen, die für die Nutzer flüssig und intuitiv wirken, gekennzeichnet durch Antwortzeiten unter einer Sekunde (typischerweise weniger als 300 ms), minimale wahrnehmbare Verzögerungen oder Fehlanpassungen sowie eine robuste Anpassung an reale Variabilität. Dies unterscheidet es von traditionellen befehlsbasierten oder unimodalen Systemen, bei denen Zeitfehler, Modalitätsfehler oder starre Reaktionen den natürlichen Fluss stören.

Innerhalb der Mensch-Roboter-Interaktion (HRI) konzentriert sich diese Übersichtsarbeit auf die Mensch-Roboter-Kommunikation, definiert als der wechselseitige, Echtzeit-Austausch multimodaler Signale zwischen Menschen und Robotern. Während HRI auch Planung, Kontrolle und Sicherheit umfasst, betrifft Kommunikation die Synchronisation von Wahrnehmung und Handlung über sensorische Kanäle hinweg. Frühe kommandobasierte Systeme priorisierten Effizienz gegenüber Engagement und führten oft zu starrem oder verzögertem Verhalten. Zeitgenössische Arbeit verfolgt adaptive, kontextbewusste Modelle, die Nutzerzustand und -emotion berücksichtigen 1,2. Diese Entwicklung unterstreicht die Notwendigkeit präziser, intuitiver und personalisierter Interaktionsrahmen.

Anfängliche soziale und unterstützende Roboter stützten sich häufig auf geskriptete Routinen oder Ein-modale Eingaben wie Sprache oder Berührung, was die Flexibilität einschränkte3. Regelbasierte Logik und langsame Verarbeitung führten häufig zu Zeitfehlern zwischen Gesten und Sprache oder zu schlechter Anpassung an das Nutzerverhalten. Um diese Probleme zu lösen, setzen Forscher Fusion mit niedriger Latenz, multimodaler sensorischer Integration und nutzeradaptivem Lernen 4,5 ein. Diese Strategien lassen sich durch drei grundlegende Kommunikationsprinzipien verstehen, die im HRI weithin anerkannt sind: Komplementarität (Modalitäten gleichen sich gegenseitig aus), Redundanz (Überlappung verbessert die Robustheit) und Synergie (Konvergenz erhöht Natürlichkeit).

Fortschritte im Bereich Wahrnehmung und Lernen haben sozial responsive Roboter hervorgebracht, die visuelle, auditive, taktile und physiologische Eingaben in Echtzeit integrieren 5,6. Anstelle fester Skripte passen sich diese Systeme kontinuierlich an Benutzerhinweise an. Zugängliche Programmierschnittstellen und Lernmethoden ermöglichen es Lehrkräften und Therapeuten, Verhaltensweisen für Pflege und Unterricht anzupassen, wobei Präzision, Reaktionsfähigkeit und Anpassungsfähigkeit unerlässlich sind.

Kommunikationsmuster im sozialen HRI können in parallele, komplementäre und interaktive Formen gruppiert werden (Abbildung 1). In der parallelen Interaktion handeln Menschen und Roboter unabhängig voneinander mit minimalem Austausch. Komplementäre Interaktion führt strukturierte Prompts oder ereignisbasierte Unterstützung ein. Der fortschrittlichste, interaktive Modus beinhaltet kontinuierliche bidirektionale Anpassung über Kanäle wie Sprache, Bewegung und Blick7.

Literaturauswahl und -analyse

Systematische Übersichtsmethodik: Wir führten eine systematische Literaturrecherche in der Web of Science Core Collection durch, wobei wir peer-reviewte Fachartikel und vollständige Konferenzberichte großer Verlage (IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis) einschloss. Die boolesche Abfrage lautete: (("Mensch-Roboter-Interaktion" ODER HRI) und (multimodale ODER "Sensorfusion" ODER Geste ODER Blick ODER Sprache ODER taktil) UND ("Echtzeit" ODER "niedrig-latenz" ODER adaptiv ODER robust)). Die Einschlusskriterien waren: englischsprachige Publikationen von Januar 2015 bis 2025 – ein Zeitraum, der den Wandel von regelbasierten, einmodalen Systemen zu Deep-Learning-Architekturen mit Schwerpunkt auf latenzarm, adaptiver und robuster Interaktion dokumentiert – mit Schwerpunkt auf multimodalen Integrationstechniken für kommunikative HRI und empirische Validierung (quantitativ oder qualitativ). Wir schlossen Studien aus, die sich auf die unimodale Interaktion beschränkten, solche, die sich mit Robotersteuerung ohne kommunikative Absicht befassten, sowie nicht-empirische Arbeiten (z. B. rein theoretisch oder nur simulationsbasiert). Die erste Suche ergab ein beträchtliches Kapital. Nach dem Entfernen der Duplikate prüften wir Titel und Abstracts anhand der Einschlusskriterien und führten anschließend Volltext-Reviews durch, um Relevanz und Beitrag zur zuverlässigen multimodalen Fusion zu bewerten. Dieser mehrstufige Prozess, zusammengefasst im PRISMA-ähnlichen Flussdiagramm (Abbildung 2), ergab ein abschließendes Korpus von 148 Artikeln, die die empirische Grundlage dieser Übersichtsarbeit bilden.

Überblick über ausgewählte Literatur: Abbildung 3 zeigt Publikationstrends und fachliche Verteilung, wobei Informatik sowie Automatisierung & Robotik dominieren, sowie wachsende Beiträge der Verhaltenswissenschaften und Neurowissenschaften, was die interdisziplinäre Entwicklung des Fachgebiets unterstreicht. Wir gruppierten die Literatur thematisch nach technischem Beitrag zur multimodalen Integration (Tabelle 1). Diese Synthese umfasste Modalitäten, Fusionsmethoden, Latenzmanagement, Robustheitsstrategien, Anpassungsfähigkeit und Metriken. Studien von 2019 bis 2021 verwendeten überwiegend frühe oder späte Fusion, wobei oft Gesten und taktile Eingaben betont wurden. Seit 2022 gewinnen hybride und aufmerksamkeitsbasierte Architekturen an Beliebtheit, insbesondere für affektive und verkörperte Interaktion. In diesem Korpus machen hybride Fusionen etwa 43 % der Ansätze aus, frühe Fusion 29 % und späte Fusion 28 % – eine Verteilung, die auf eine verbesserte Toleranz gegenüber zeitlicher Asynchronie hindeutet.

Obwohl in der anfangs gezeigten breiteren Literatur häufig eine Echtzeitfähigkeit beansprucht wird, beschreiben nur eine begrenzte Anzahl von Studien spezifische Minderungsstrategien (z. B. gepufferte Verarbeitung, prädiktive Modelle oder Sensoroptimierung). Robustheit beruht typischerweise auf Filterung, Redundanz oder regelbasierten Rückfallmöglichkeiten, während antizipatorische Anpassungen selten bleiben. Evaluationspraktiken sind inkonsistent, und standardisierte Bewertungen der temporalen Synchronisation oder der Interaktionsflüssigkeit bleiben selten. Die Kennzahlen variieren so stark zwischen den Studien, dass direkte Vergleiche oft schwierig sind. Genauigkeit, F1-Werte und Latenzzahlen sind üblich, stammen aber aus unterschiedlichen Datensätzen, Aufgaben und Umweltbedingungen; Nur wenige Arbeiten verwenden gemeinsame Benchmarks für zeitliche Ausrichtung oder Rauschrobustheit. Folglich übertreibt starke Leistung in sauberen Laboranlagen häufig, welche Methoden außerhalb kontrollierte Umgebungen erreichen können. Die Entwicklung konsistenter Bewertungsrahmen – vielleicht einschließlich standardisierter Latenztests unter realistischer Variabilität – würde es deutlich erleichtern zu beurteilen, welche Ansätze das Feld wirklich voranbringen.

Wichtige Lücken bestehen in der taktil-affektiven Integration (nur sechs Studien 8,9,10,11,12,13 behandeln dies) und der dynamischen Latenzanpassung unter nutzergesteuerter zeitlicher Unsicherheit. Aus der Literatur entstehen mehrere interessante Spannungen. Hybride Fusion wird oft dafür gelobt, temporale Fehlanpassungengut zu handhaben, doch wirklich antizipative oder adaptive Verhaltensweisen bleiben selten, was die Fragestellung aufwirft, wie nahtlos diese behauptete Echtzeitleistung tatsächlich ist. Gleichzeitig steht der beeindruckende Fortschritt bei der Seh- und sprachbasierten Affekterkennung in starkem Kontrast zu der minimalen Arbeit, taktile Hinweise mit Emotionsverständnis zu integrieren. Hohe Genauigkeit in kontrollierten Experimenten neigt ebenfalls dazu, unter realen Bedingungen zu verschlechtern, was die anhaltenden Herausforderungen bei der Verallgemeinerung über Umgebungen und Nutzer hinweg unterstreicht. Tabelle 2 fasst repräsentative architektonische Trends und Bewertungsansätze zusammen und informiert die in den folgenden Abschnitten diskutierten Herausforderungen.

Diese Übersicht leistet einen besonderen Beitrag zur multimodalen HRI-Literatur. Jüngste Umfragen wie Zhao et al.14 bieten breite Übersichten über wahrnehmungsgetriebene Entscheidungsfindung, während Wang et al.15 sich auf 5G-fähige visuell-taktile Übertragung konzentrieren. Beide legen den Schwerpunkt auf allgemeine Rahmenwerke oder Kommunikationsprotokolle, wobei nur begrenzte Diskussionen über Echtzeit-Fusionskompromisse, Vergleichbarkeit von Metriken oder Herausforderungen bei der Bereitstellung erfolgen. Im Gegensatz dazu bieten wir eine gezieltere Analyse: Wir vergleichen Fusionsstrategien unter bestimmten Bedingungen, kritisieren Inkonsistenzen in Grenzuntersuchungsmetriken und heben praktische Lücken hervor – insbesondere die Leistungsunterschiede zwischen Labor und Feld, die frühere Umfragen weitgehend übersehen haben.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Überprüfung und Perspektive

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Da Roboter zu festen Bestandteilen von Haushalten, Klassenzimmern und Gesundheitseinrichtungen werden, ist natürliche und adaptive Kommunikation entscheidend für ihren Erfolg. Immer mehr als Werkzeuge, sondern als soziale Partner betrachtet, müssen sie menschliche Signale über verschiedene Modalitäten hinweg wahrnehmen, interpretieren und darauf reagieren. Systeme, die die Nutzerabsicht genau erfassen und zeitnahes Feedback geben, verbessern die Aufgabenleistung, das Vertrauen und das emotionale Wohlbefinden – insbesondere im Umgang mit Kindern, älteren Erwachsenen oder Menschen mit Behinderungen. Um dies zu erreichen, ist eine kontinuierliche, intuitive Interaktion erforderlich, die die Reaktionen der Roboter mit dem fortlaufenden menschlichen Verhalten in Einklang bringt, anstatt es zu unterbrechen. Diese Sprachflüssigkeit erfordert multimodale Eingaben – Stimme, Blick, Geste, Gesichtsausdruck –, die durch Mechanismen integriert sind, die menschliche Kommunikation selbst widerspiegeln14,16.

Wahrnehmungs- und Kommunikationskanäle
Vision bleibt die Grundlage der multimodalen Mensch-Roboter-Interaktion. Visuelle Hinweise wie Gesichtsausdruck, Blick, Haltung und Gesten bilden die Grundlage für Absichtserkennung, Emotionsinferenz und Engagement-Tracking 17,18,19,20,21. Frühe handgefertigte Methoden mit Haar-Detektion22 oder Hintergrundsubtraktion23 scheiterten oft bei Okklusion oder Lichtänderungen 16,21. Deep-Learning-Systeme dominieren heute und setzen CNNs und rekurrente Modelle mit Multikamera-Eingängen ein. Abbildung 4 zeigt die HI-ROS-Tracking-Pipeline, die den Bewegungsfehler bei Echtzeit-Gestenüberwachung um 27 % reduziert.

Die Integration von Blick-, Arm- und Kopfhinweisen verbessert die Vorhersage von Nutzerhandlungen17, während propriozeptive und Tiefenfusion die Präzision 24,25 erhöhen. Mutual Gaze19 und biomimetische Augendesigns18 zeigen zudem die Rolle subtiler Signale für Vertrauen und Koordination. Abbildung 5 zeigt die Architektur aus 26, bei der zwei Leap Motion Controller Handbewegungen aufnehmen, die über LSTM-RNN für eine robuste chirurgische Teleoperation fusioniert werden. Neuere Multikamerasysteme wie Hi-ROS20 und RPF 21,27 verbessern die Personenverfolgung in unstrukturierten Umgebungen. Abbildung 6 zeigt den adaptiven ReID-Lebenszyklus, der die Verfolgung unter Okklusion durch kontinuierliche Klassifikatorverfeinerung aufrechterhält. Ergänzende Arbeit zur aktiven Markierung28 und semantischer SLAM26 verbessert das Kontextbewusstsein und erweitert die Wahrnehmung von der Objekterkennung auf das Verhaltensverständnis.

Sprache bietet einen parallelen Kommunikationskanal. Frühe regelbasierte Dialogsysteme hatten mit Mehrdeutigkeiten zu kämpfen, was zur Einführung datengetriebener und transformerbasierter Modelle29 führte. Emotionale und soziale Reaktionsfähigkeit sind jetzt entscheidend: Multimodale Systeme richten Gesichts- und Sprachsignale für adaptiven Dialogaus. Verstärkungslernen verbessert die Koordination zwischen affektiven und akustischen Hinweisen 5,31,32. Große Sprachmodelle wie GPT-333 und ChatGPT34 ermöglichen kontextuelles Schließen und Anweisungen über Aufgaben 35,36,37 hinweg. Ihre Integration mit Vision- und Belohnungsmodellierung 38,39,40,41,42,43,44 unterstützt sozial bewusste, allgemeine Interaktion.

Die auditive Wahrnehmung ergänzt Sehen und Sprache. Prosodie, Tonhöhe und Rhythmus kommunizieren Absicht, wenn visuelle Hinweise unzuverlässig sind. Die verstärkte Feature-Extraktion verbessert die Synchronisation zwischen Sprache und Ausdruck. Datensätze wie AVA ActiveSpeaker45, AFFECT-HRI5, SAVEn-Vid46, HumorHRI47 und CHiME-5 bereichern die Modellrobustheit in rauschenden, affektiven Umgebungen. Pan et al.32 fördern Sprach-Lippen-Synchronisation für Mehrsprecherszenen, während multimodale Fusion mit taktilen oder physiologischen Eingaben adaptives Verhalten beeinflusst.

Verkörperte und physiologische Wahrnehmung
Taktile und physiologische Wahrnehmung verbessern das soziale und körperliche Bewusstsein. Kraft, Druck und Biosignale ermöglichen die Schlussfolgerung von Absicht, Stress und Engagement. Sichtbasierte taktile Simulatoren wie TACTO4 und neuronale Karter wie FOTS48 erzeugen hochauflösende Kontaktdaten mit 300 fps und unterstützen so eine Kontrolle mit niedriger Latenz. FOTS modelliert Beleuchtung und Verformung mittels einer erlernten Reflexionsfunktion R:

figure-protocol-1

und Schattenprojektion:

figure-protocol-2

wobei Ms die Projektionsgeometrie kodiert. Hochauflösende taktile Hauten wurden mit magnetorheologischen Elastomeren49, EtherCAT-Sensorarrays50 und auxetischen Hall-Effekt-Materialien51 realisiert. Systeme wie DiGeTac13 vereinheitlichen Gesten-, taktile und Distanzsignale durch modulare Pipelines. Die Filterung von Flugzeitdistanzdaten wird wie folgt modelliert:

figure-protocol-3

gefolgt von neuronaler Gestenklassifikation und CNN-basierter Kontaktlokalisierung. Die Sicherheitskontrolle wird durch die Skalierung der Robotergeschwindigkeit mit Abstand d gewährleistet. Diese Module ermöglichen eine robuste Zusammenarbeit zwischen Mensch und Roboter. Multimodale Transformatoren integrieren zudem taktile, visuelle und textuelle Signale. Der TVT-Transformer6 richtet modalitätsspezifische Darstellungen (qi, ki, vi) in gemeinsame Matrizen aus:

figure-protocol-4

was intermodale Selbstaufmerksamkeit für ein einheitliches Verständnis ermöglicht (Abbildung 7).

Physiologische Wahrnehmung fördert die emotionale Ausrichtung. Heinisch et al.5 synchronisieren physiologische und audiovisuelle Signale zur Affektmodellierung. Elektromyographie-basierte Systeme52,53 dekodieren Gesten und stille Sprache, während MetaSonic54 die räumliche Wahrnehmung durch akustische Lokalisierung verbessert. Groß angelegte Datensätze wie AgiBot World Colosseo55 unterstützen multimodales Training mit über einer Million taktil-visuellen Trajektorien. Gemeinsam markieren diese Fortschritte den Übergang von der unimodalen Wahrnehmung hin zum integrierten Verständnis sozialer, physischer und innerer Zustände. Die verbesserte Sensorgenauigkeit ermöglicht es Robotern nicht nur, Kontakt zu messen, sondern auch Zögern, Spannung oder Unbehagen zu interpretieren und mit Empfindlichkeit und adaptiver Kontrolle zu reagieren, die zentrale Grundlagen für die nahtlosen multimodalen Rahmenwerke sind, die in späteren Abschnitten diskutiert werden.

Multimodale Fusion und Repräsentationslernen
Fusion ermöglicht die Umwandlung verteilter Sinnesströme in kohärenter, kontextbewusste Steuerung. Ansätze werden typischerweise als frühe, späte oder hybride Fusion gruppiert. Frühe Fusion integriert Merkmale in der Eingabephase und unterstützt synchronisierte Hinweise wie Sprach-Gesten- oder Gesichts-prosodische Ausrichtung. The Multimodal Transformer von Tsai et al.14 veranschaulicht die aufmerksamkeitsbasierte frühe Integration von visuellen, akustischen und textuellen Signalen. Xue et al.56 erweiterten dies durch eine verbleibende Kopplung von Gesichtsmarkierungen und Sprachmerkmalen, wodurch die Robustheit unter Lichtvariation verbessert wurde, während Hu et al. Vorgeschlagene MMSERNet57, ein multiskaliges Fusionsnetzwerk, das dilatierte Konfaltung und Residualfusion nutzt, um MFCC, Spektrogramm und lexikalische Merkmale zur Emotionserkennung zu verbinden. Der Fusionsausgang wird ausgedrückt als:

figure-protocol-5

Die späte Fusion hingegen kombiniert Entscheidungen nach unabhängiger Verarbeitung und bietet eine höhere Toleranz gegenüber asynchronen oder rauschen Eingaben. Beispiele sind Entscheidungskombinationen aus Blick-, Trägheits- und Bewegungssignalen im Unterwasser-HRI58,59. Hybridfusion integriert beide Ansätze – heterogene Modalitäten werden auf gemeinsame Einbettungsräume abgebildet und gleichzeitig zeitliche Spezifität erhalten. Das Multimodal Brain–Computer Fusion Network60 richtet EEG und visuelle Merkmale vor der Klassifizierung aus, während crossmodale Designs für 3D-Posenschätzung Trägheits- und Monokulardatenzusammenführen 61. Neuere Frameworks kombinieren Konfaltions-, Rekurrenten- und Transformatorschichten mit Aufmerksamkeitsausrichtung62,63, wobei Modalitäten dynamisch nach Kontext oder Aufgabenrelevanz 64,65,66 gewichtet werden. Die Wahl zwischen früher, später und hybrider Fusion ist keine Frage einer Einheitslösung. Frühe Fusion funktioniert in der Regel gut, wenn Modalitäten eng synchronisiert und die Rauschpegel niedrig sind, sodass das Modell von Anfang an reichhaltige intermodale Beziehungen erfassen kann. Spätfusion hingegen ist unter chaotischen, asynchronen realen Bedingungen im Allgemeinen robuster, da jede Modalität unabhängig verarbeitet werden kann, bevor Entscheidungen kombiniert werden. Hybride Ansätze, die inzwischen in etwa 43 % der aktuellen Studien vorkommen, finden einen nützlichen Mittelweg, insbesondere für affektive und verkörperte Interaktionen, indem sie auf dynamisch ausbalancierte Eingaben achten, auch wenn sie zusätzliche Rechenanforderungen mit sich bringen. Letztlich hängt die beste Strategie von der spezifischen Aufgabe, dem Rauschprofil und den Hardwarebeschränkungen ab, was darauf hindeutet, dass zukünftige Systeme davon profitieren könnten, die Fusionsmodi spontan zu wechseln.

Die Komplementarität zwischen den Modalitäten variiert ebenfalls stark je nach Kontext. Sehen in Kombination mit Haptik ist besonders effektiv bei körperlichen Nahbereichsaufgaben wie Greifen oder Objektübergabe, bei denen taktile Rückkopplungen visuelle Verdeckungen, Lichtveränderungen oder Entfernungsbeschränkungen ausgleichen und präzise Kraft- und Kontaktinformationen liefern, die Audio nicht liefern kann. Umgekehrt funktioniert Sehen in Kombination mit Audio besser in entfernten oder sozialen Umgebungen, wie Emotionserkennung oder Dialog in lauten Umgebungen, wo Prosodie und Ton Absicht und Wirkung tragen, wenn visuelle Hinweise nicht verfügbar oder unzuverlässig sind.

Über das klassische Early, Late- und Hybrid-Framework hinaus hat Deep Learning detailliertere Kategorisierungen ermöglicht. Aufmerksamkeitsbasierte Fusion ermöglicht es Modellen, die Bedeutung der dynamischen Modalität pro Eingabe zu lernen und so effektiv aufgaben- und kontextspezifische Integrationspfade ohne starre Stufengrenzen zu schaffen. Erlernte Fusionsstrategien gehen noch weiter, indem sie den gesamten Fusionsprozess als ein End-to-End-differenzierbares Modul behandeln, das es dem Netzwerk ermöglicht, optimale Kombinationsmuster direkt aus den Daten zu entdecken. Diese Entwicklungen verschieben das Paradigma von vordefinierten Regeln hin zu vollständig datengetriebenen, adaptiven Architekturen, die die Komplexität der Echtzeit-multimodalen HRI besser abdecken.

Vision-Sprach-Erdung
Das rasante Wachstum großer Sprachmodelle hat die Reichweite des multimodalen Denkens erweitert, insbesondere durch Vision-Language-Modelle (VLMs). Diese Architekturen richten sprachliche und visuelle Informationen aus, um Robotern zu ermöglichen, Befehle zu interpretieren, Szenen wahrzunehmen und kontextabhängige Aktionen zu erzeugen. Grundlegende Frameworks wie LXMERT64 und CLIP66 etablierten gemeinsame Einbettungen für die Bild-Text-Ausrichtung. Flamingo65 führte few-shot-multimodale Logik ein, während Maggios Clio39 Instruktionen dynamisch mit Szenengraphen über CLIP-Semantik verknüpft. Gao et al.41 entwickelten LAMARS für antizipatorische Planung auf Basis multimodaler Vorhersage, und Xie et al.67 wandten raumzeitliche Konfaltionsmodelle für eine effiziente Gestenverständnis an. Arenas et al. führten promptbasierte Anpassungen für personalisierte Interaktionsstileein. Diese Systeme ermöglichen es, Befehle wie Pick up the Red Cup direkt in der Szenensemantik zu erden.

Die Integration mit räumlichem Denken verbessert die robotische Navigation und Interpretation weiter. Wilsons LatentBKI38 erdet Anweisungen in voxelbasierten räumlichen Karten, während Nwankwo et al.40 große Sprachmodelle mit VLM-Argumentation fusionieren, um Dialoghandlungen unter visueller Unsicherheit zu interpretieren. Ereignisbasierte Segmentierung und asynchrone Wahrnehmungsmethoden erhöhen die Effizienz dynamischer Aufgaben. Gemeinsam fungieren VLMs als Brücken zwischen symbolischer Unterweisung und verkörpertem Verständnis und bieten das kognitive Substrat für flexible Interaktion.

Domänenspezifische Anwendungen
Im Gesundheitswesen und in der Altenpflege ermöglicht multimodale Kommunikation sichere, intuitive und empathische Unterstützung. Kernfunktionen – Sturzerkennung, tägliche Aktivitätsüberwachung, Notfallreaktion – basieren auf Haltung, Stimme und Gesichtsausdrücken3. Hierarchische Steuerungsmodelle verbessern die Bewegungspräzision bei armunterstützten Robotern1, während propriozeptive Rückkopplungen kooperativen Ankleideassistenten leitet69. Die Objektübergabe, dargestellt in Abbildung 8, veranschaulicht synchronisierte Wahrnehmung und motorische Koordination70. Emotionale Reaktionsfähigkeit, die durch Systeme wie LOVOT untersucht wird, fördert das Vertrauen der Nutzer, wirft aber ethische Bedenken hinsichtlich Überabhängigkeit auf.

Soziale Roboter benötigen eine flüssige, multimodale Reaktionsfähigkeit, um Empathie und Vertrauen in häuslichen und öffentlichen Umgebungen aufrechtzuerhalten. Abbildung 9 skizziert eine typische Architektur, die Schichten von Wahrnehmung, Planung und sozio-emotionalem Denken integriert. Große Sprachmodelle, die mit Wahrnehmung integriert sind, ermöglichen offene Dialoge, die durch Blick und Ton40 moduliert werden. Pädiatrische Studien zeigen, dass expressive Bewegung und Prosodie bei Kindern71 die Angst verringern, während Umfragen nonverbale Verhaltensweisen als Determinanten für das Engagementhervorheben 8. Proaktive Modelle wie RoboAgent37 und Sub-Prior-gesteuerte Ant Colony Optimization72 ermöglichen die gemeinsame Erkundung gemeinsamer Ziele. Systeme, die in der Lage sind, interne Zustände auszudrücken (bereit, verwirrt)73 erhöhen Transparenz und Koordination, während adaptive soziale Akteure die Gruppenzusammenarbeit vermitteln,74,75.

Bildungsroboter: Im Bildungsbereich fördert multimodale HRI Motivation und Lernen durch die Nutzung von Verkörperung und sozialer Signalisierung76. Die Kombination von Gesten, Gesichtsausdrücken und verbalen Hinweisen verbessert die Zugänglichkeit und das Engagement 6,9,77,78. Emotionale Anpassungsfähigkeit unterstützt jüngere Lernende: Systeme, die den affektiven Zustand wahrnehmen und Sprache und Bewegung modulieren, erhöhen Aufmerksamkeit und Wortschatz 7,79. Die Integration mit Virtual Reality verbessert die Immersion, stellt aber die Skalierbarkeitin Frage. 80. Gemeinsam verschieben diese Systeme die Rolle des Roboters vom Lehrer zum emotional ausgeprägten Mitarbeiter.

Personalisierung gewährleistet Relevanz und Vertrauen in multimodalen Systemen 71,81,82. Ethische Personalisierung balanciert Autonomie und Empathie aus und passt Antworten durch partizipatives Feedback an. Maaz et al.83 zeigten affektives Tutoring, das von Gesichts- und kognitiven Signalen geleitet wurde, während Gomez-Izquierdo et al.84 Nutzerpräferenzen für synchronisiertes Verhalten modellierten. Personalisierte Anpassung kann formalisiert werden als:

figure-protocol-6

wobei wi die erlernten Präferenzgewichte sind. Implementierungen wie RFIS erreichen Echtzeit-Personen-Wiedererkennung und Gestenerkennung am Edge85, während propriozeptive Touch-Schnittstellen10 intuitive physische Kommunikation ermöglichen. Soziale Wahrnehmungseffekte modulieren die Personalisierungsergebnisse weiter, wobei die Identität des Erzählers den Nutzerantwortzeitpunkt und die Äußerungslängeverschiebt 86. Personalisierung verwandelt Nutzer somit von passiven Empfängern in Co-Designer und formt die Interaktion durch gegenseitige Anpassung.

Während ein Großteil der überprüften Arbeiten weiterhin in Forschungsprototypen verbleibt, haben sich mehrere multimodale HRI-Techniken von Forschungsprototypen zu kommerziellen oder industriellen Anwendungen entwickelt. Der Pepper-Roboter von SoftBank beispielsweise integriert Sprach-, Gesten- und Gesichtsausdrückerkennung für Kundenservice und Bildung im Einzelhandel und im Bildungsbereich87. Toyotas Human Support Robot setzt Vision-Gesten-Fusion für unterstützende Aufgaben in Haushalten und Gesundheitseinrichtungenein. 88. Diese kommerziellen Implementierungen vereinfachen oft Fusionsstrategien, indem sie typischerweise späte oder hybride Ansätze mit regelbasierten Rücklagen verwenden, um Zuverlässigkeit und niedrige Kosten zu gewährleisten, was die anhaltende Lücke zwischen fortschrittlichen akademischen Modellen und skalierbaren industriellen Lösungen unterstreicht. Um diese Lücke zu schließen, wird ein stärkerer Fokus auf Edge-Deployment und eine rigorose Validierung in der realen Welt erforderlich sein.

Herausforderungen für eine reibungslose Kommunikation in HRI
Trotz Fortschritten in der multimodalen Sensorik und Fusion bleibt eine nahtlose Mensch-Roboter-Kommunikation außerhalb kontrollierter Umgebungen schwierig. Modelle, die in Laboren glänzen, degradieren oft aufgrund von Rauschen, Verzögerung, Verschluss, Shifting Intention oder Ressourcenbegrenzungen. Die Literatur konzentriert sich auf sechs miteinander verbundene Barrieren: Integration von Vision und Sprache, Echtzeit-Synchronisation, multimodale Robustheit, semantische Präzision, Datensatzabdeckung und Bereitstellungsbeschränkungen.

Integration von Visionssprachen
Visuelles Verständnis ist die Grundlage für geerdete Sprache und Handlung. Grundlegende Schritte verbesserten räumliche Konsistenz und Abstraktion durch visuell-inertial SLAM ohne manuelle Initialisierung89, Re-Identifikation plus Sensorfusion für okklusions-robustes Tracking16, Lane-Graph-Vorhersage90, halbüberwachte Segmentierung bei Ausrichtung von Labels mit Navigationsnutzen sowie egozentrisches Video mit SLAM und großflächige Segmentierung für Durchlaufbarkeit26. Unsicherheitsbewusstes Mapping bleibt zentral: uPLAM verbindet probabilistische Lokalisierung mit panoptischer Segmentierung für dynamische Szenen91, während Clio adaptiv CLIP-basierte hierarchische 3D-Szenengraphen für aufgabensensitive Semantikbaut 30. Erdungsansätze entwickelten sich von strukturierten Beschreibungen und Wahrnehmungs-APIs92,93 zu multimodalen Encodern undDecodern 94,95.

Anweisungen in offenen Umgebungen integrieren Wahrnehmung und Schlussfolgerung. RobotGPT35 und GroundingGPT36 interpretieren Befehle mittels gekoppelter visuell-linguistischer Inferenz; SayPlan, LFG und LLM-Planner richten Navigation und Planung auf die geerdete Sprache34,44 aus. Um Halluzinationen zu reduzieren und semantische Konsistenz zu gewährleisten, führen GLAM und Vtimellm die Ausrichtungsziele96,97 ein, während adaptive Rahmenwerke LLM-Ausgaben gegen Wahrnehmung98,99 validieren. Timing prägt die Lesbarkeit kritisch: Optimiertes Gestentiming verbessert die Vorhersehbarkeit9; Verstärkungslernen reduziert audiovisuelle Verzögerung in Emotionspipelines2; Gesten-Entrainment erhöht die wahrgenommene Sprachflüssigkeitum 100; und Übersichten konsolidieren LSTM-, DTW- und GAN-Tools für Ausrichtung101. Insgesamt erfordert Nahtlosigkeit eine latenzbewusste Schleife über Wahrnehmung, Fusion und Antwort, wobei Mimikry30 und von der Kleinhirn inspirierte Vorhersage102 das Timing koordinieren, wie auch die System-Timing-Schleifen in Abbildung 10 zeigen.

Echtzeitwahrnehmung über verschiedene Modalitäten hinweg
Die Flüssigkeit hängt von einer begrenzten End-to-End-Verzögerung über heterogene Ströme hinweg ab. TACTO liefert hochauflösendes taktiles Feedback mit geringer Latenz für eine reaktionsschnelle Manipulation. Sehnengesteuerte Hände erreichen schnelles, interaktives Spiel durch Ereignisvision und leichte Inferenz103, wie in Abbildung 11 dargestellt. Für Vision–Language–Action beschleunigt die Kopplung von CLIP mit GraspNet das Greifen in Clutter104. Transformers unterstützen eine schnelle soziale haptische Gestenklassifikation11. Kantenoptimierte audiovisuelle Modelle halten eine subsekundenlange Schlussfolgerungvon 24. Präzises Timing der Kopfbewegung verbessert das Engagementum 105. Zusammen argumentieren diese Ergebnisse für synchronisierte Fusion, nach modalität angepasste Pufferrichtlinien und leichte Aufmerksamkeit zur Erhaltung zeitlicher Koadaption. Die akzeptable Latenz variiert erheblich je nach Aufgabenbereich. Im sozialen Dialog oder bei der Emotionserkennung erhalten Verzögerungen unter 200–300 ms die wahrgenommene Flüssigkeit und natürliche Interaktion. Unterstützende Aufgaben wie Objektübergabe oder Fallerkennung erfordern strengere Grenzen (50–150 ms), um Sicherheit und Reaktionsfähigkeit zu gewährleisten. Teleoperation oder kollaborative Manipulation erfordert oft eine Latenz unter 100 ms, um Operator-Desorientierung oder Reisekrankheit zu vermeiden, während Navigations- oder Überwachungsanwendungen 300–500 ms ohne kritische Auswirkungen tolerieren können.

Herausforderungen der zeitlichen und semantischen Verarbeitung
Fehlanpassung und Latenz untergraben Vertrauen und Aufgabeneffizienz, insbesondere in verteilten Teleoperator–Roboter–Mensch-Systemen106. Wahrnehmungs- und Schnittstellenstrategien helfen Nutzern, Verzögerungen zu tolerieren: Körpergesten und nicht-lexikalische Füllstoffe107, visuelle Überlagerungen und adaptive Hinweise 108,109,110,111. Die Vorhersage auf Kontrollebene verkürzt die Antwortgapsum 102. Parallele Dialogpipelines überlappen sich mit Füllergenerierung, Sprachsynthese und Prompt-Bearbeitung, um wahrgenommene Verzögerungen zu reduzieren, wie in112 und Abbildung 12. Systemstudien zerlegen die kumulative Latenz über Capture, Encoding/Decoding, Netzwerke, Decision und Aktion113. Wie in Abbildung 13 gezeigt, wird die Latenz durch Sensorerfassung, Videokodierung und -dekodierung, Netzwerkübertragung, Bedienerverarbeitung und Fahrzeugaktivierung eingeführt, wodurch eine komplexe, bidirektionale Rückkopplungsschleife entsteht. Syntalos bietet Millisekundensynchronisation für geschlossene Experimente114. In affektiven Austauschen verstärkt die Echtzeit-Gesichtsnachahmung die Synchronität23. Verzögerungsempfindliche Bereiche wie Fernchirurgie zeigen, dass das Verankern von Haptik gegen verzögertes Sehen Präzision und Reaktionsfähigkeit115 unterstützt. Wie in Abbildung 14 gezeigt, führte das verankerte haptische Feedback zu besserer Leistung und einem stärkeren Reaktionsgefühl.

Feinkorrelierte Effekte und Absichtserkennung bleiben herausfordernd. Mikroexpressionen, Prosodie, Blick und antizipatorische Bewegungen treten oft kurz und asynchron auf. Emo erzeugt erwartungsvolle Gesichtsausdrücke, die auf Benutzerzustand116 ausgerichtet sind. Allein Körpersprache vermittelt Absicht, wo Gesicht oder Stimme nicht verfügbar sind.117. Pepper-basierte multimodale Anzeigen kombinieren verbale Klassifikation mit ausdrucksstarken Gesten und Emojis für emotionale Synchronisation118. Online RL stärkt die Fusion von Gesichts- und Stimmströmen2, während leichte Mimikry EdgeDeployment 30 unterstützt. Offene Themen sind Gruppeneffekt, kulturelle Variation und zeitliche Effektdrift.

Auch die Verallgemeinerung in offenen Domänen ist begrenzt. Verstärkungslernen durch menschliches Feedback (RLHF) zeigt spärliche Belohnungen und Sprödigkeit unter Eingaben außerhalb der Verteilung119. RoboAgent verbindet räumliches Schließen mit sprachlicher Grundlage für den Cross-Task-Transfer29. Reasoning through Action-free Data (RAD) nutzt passives Video und Sprache für Zero-Shot-Funktionen ohne manuelleLabels 120. Wahrnehmer-Akteur ergründet Objekteigenschaften, um unbekannte Gegenstände zu manipulieren121. Die kontinuierliche Ausrichtung zwischen Wahrnehmung und Semantik in RobotGPT und GroundingGPT verbessert das adaptive Denken, steht aber weiterhin vor Echtzeit-Feedback-Herausforderungen35,36.

Multimodale Robustheit und Umweltvariabilität
Robustheit muss Signalintegrität und Verhaltenskonsistenz umfassen. SimuMuHRI injiziert modalitätsspezifisches Rauschen und Dropout, um Resilienz122 zu testen. Die physikalisch geerdete strukturierte Lichtsimulation verbessert die Zuverlässigkeit von RGB-D unter Beleuchtung und Okklusion123.124. Die Latenz-Haptik-Kopplung legt die Empfindlichkeit in der Fernmanipulation125 frei. Prinzipien der Redundanz und thermischen Resilienz von sicherheitskritischen Energiesystemen informieren fehlertolerante HRI126,127.

Verhaltenskohärenz ist ebenso wichtig. Eine Fehlanpassung zwischen Stimme und Erscheinung verringert das Vertrauen128, und unberechenbare, aber korrekte Bewegungen untergräbt die Kooperation129. Beobachterbasierte adaptive Kraftsteuerung und robuste Interaktionsregler halten Stabilität unter strukturierten und unstrukturierten Unsicherheiten130.131. Auch die Datensatzabdeckung schränkt den Fortschritt ein. Multiobot-Wahrnehmungsdatensätze – OPV2V132, CoPeD133, CSE134 und AgiBot World Colosseo55 – erweitern die kollaborative Sensorik über Simulation und Feld hinweg. AV-HRI-Ressourcen – CHiME-5135 mit der anschließenden CHiME-8-Herausforderung136, AVA-ActiveSpeaker45, AFFECT-HRI5 und SAVEn-Vid46 – ermöglichen ASR, Sprecheraktivität, Affect und Langkontextanweisungen. Groß angelegte soziale Benchmarks – HumorHRI47, THÖR-MAGNI137, RW4T138 und InViG139 – zielen auf Humor, Navigation, Teaming und interaktive Erdung ab. Trotz der Breite sind viele Datensätze domänenspezifisch oder geskriptet, mit begrenzter zeitlicher Tiefe zur Bewertung von Nahtlosigkeit, wie in Tabelle 3 zusammengefasst.

Bewertung der Nahtlosigkeit
Konventionelle Kennzahlen wie Genauigkeit und Latenz erfassen Ko-Anpassung, gegenseitige Vorhersage oder soziale Flüssigkeit nicht vollständig. Neue Evaluatoren bewerten kontextuelle Kohärenz und Zusammenarbeitmit 140, integrieren Nutzerfeedback und situative Signale141 und fügen dem physischen HRI84 Vorhersehbarkeit, Koordination und Komfort hinzu. Team-Frameworks quantifizieren die geteilte Erwartung74, während digitale Zwillinge die Vertrauenskalibrierung und Teamflüssigkeit142 verfolgen. Ein einheitlicher Benchmark, der zeitliche Synchronisation, affektive Ausrichtung und nutzerzentrierte Sprachflüssigkeit vereint, bleibt ein offener Bedarf.

Die Bemühungen zur Standardisierung der multimodalen HRI-Bewertung bleiben begrenzt und fragmentiert. Bemerkenswerte Initiativen wie die CHiME Challenges135.136 haben Benchmarks für audiovisuelle Spracherkennung verbessert, insbesondere hinsichtlich der Rauschrobustheit. Datensätze wie THÖR-MAGNI137 und RW4T138 bieten gemeinsame Ressourcen für Motion Capture und Teaming-Verhalten. Es existiert jedoch noch kein weit verbreitetes einheitliches Protokoll für zeitübergreifende Synchronisation, Interaktionsflüssigkeit oder affektive Ausrichtung über verschiedene Modalitäten und Domänen. Dieses Fehlen standardisierter Kennzahlen behindert weiterhin die Reproduzierbarkeit und Vergleichbarkeit und unterstreicht die Notwendigkeit gemeinschaftsorientierter Benchmarks.

Vom Labor zur realen Implementierung
Die Leistung verschlechtert sich oft in unstrukturierten Umgebungen aufgrund sensorischer Unregelmäßigkeiten, wechselnder Absicht und Rechenengpässen143. Diese Leistungsverschlechterung verdeutlicht eine anhaltende Kluft zwischen Labor- und realen Umgebungen. In kontrollierten Umgebungen glänzen hybride und aufmerksamkeitsbasierte Fusionen und liefern hohe Genauigkeit und geringe Latenz für Aufgaben wie Objektmanipulation oder Szenenverständnis. Echte Einsätze erzählen jedoch eine andere Geschichte. Hilfsroboter in der Altenpflege, Begleitsysteme in Haushalten und Bildungswerkzeuge in Klassenzimmern haben routinemäßig mit Lärm, Okklusion, Lichtänderungen und unvorhersehbaren Nutzerverhalten zu kämpfen, die die Effektivität beeinträchtigen. Spätfusionsansätze erweisen sich unter solchen variablen, asynchronen Bedingungen tendenziell als zuverlässiger, während hybride Modelle trotz ihrer Stärken in affektiver und kontextueller Anpassung durch rechnerische Anforderungen an Edge-Geräte eingeschränkt werden können. Viele erfolgreiche Feldimplementierungen integrieren dennoch einfachere Redundanz oder regelbasierte Sicherungen für Zuverlässigkeit, was unterstreicht, dass der Übergang von vielversprechenden Labordemonstrationen zu robuster Alltagsleistung weiterhin eine große Herausforderung darstellt. Ökologisch valide Tests sind unerlässlich, um herauszufinden, welche Techniken über kontrollierte Experimente hinaus wirklich erfolgreich sind. Adaptive robuste Regler halten die Kraftgenauigkeit beiStörung 131. LLM-gesteuerte kollaborative Planung aktualisiert die Ziele, während sich die Nutzerintention weiterentwickelt144. Visuelle Überlagerungen und latenzbewusstes Feedback helfen, das Bewusstsein der Bediener unter degradiertenLinks 107.109 aufrechtzuerhalten. Leichte Überwachung mit LoRa und digitalen Schatten ermöglicht Überwachung in Feldernmit niedriger Bandbreite 145. Erfahrungen aus der Weltraumrobotik zeigen, dass sich Autonomie unter Unsicherheit und Verzögerung146 mit der menschlichen Kognition koentwickeln muss.

Ressourcenbeschränkungen prägen die Machbarkeit. Schallbasierte Effekt- und Toucherkennung laufen unter 1 MB und 0,7 GFLOPs fürEnergiesparplattformen 12. Das Hinzufügen sozialer Funktionen könnte die Präsenz verbessern, birgt aber das Risiko einer Überlastung, wenn die Verzögerungenum 147 steigen. Planung und Merkmalsauswahl müssen kognitive Nachfrage mitKontinuität 148 in Einklang bringen. Latenzminderung umfasst Wahrnehmung, Kontrolle und Netzwerke, wie sie in 113 organisiert sind. Nutzer bevorzugen häufig transparente, stabile Interaktion gegenüber maximaler Aufgabeneffizienz, was betont, dass nahtlose HRI technische Fähigkeiten neben menschlichem Komfort priorisieren muss149.151. Über verschiedene Bereiche hinweg zeigen reale Einsätze unterschiedliche Präferenzen: Soziale und Bildungsanwendungen basieren oft auf hybrider Vision-Audio-Fusion für affektiven Dialog, während unterstützende und kollaborative Aufgaben Seh-Haptik-Kombinationen mit späten oder frühen Fusionen für präzise physische Interaktion bevorzugen. Diese Muster stimmen mit den zusammengefassten Strategien überein – Priorisierung der späten Fusion für Robustheit in variablen Settings und hybrider/aufmerksamkeitsbasierter für reichhaltigere kontextuelle Anpassungen –, wobei Vereinfachungen zur Zuverlässigkeit weiterhin üblich sind.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Schlussfolgerungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Rezension hat mehrere Einschränkungen. Die Einschränkung der Suche auf englischsprachige Publikationen in der Web of Science Core Collection könnte Sprachverzerrungen eingeführt und relevante nicht-englischsprachige Arbeiten ausgeschlossen haben. Der Fokus auf peer-reviewte Artikel von 2015 bis 2025 könnte ebenfalls eine Publikationsverzerrung widerspiegeln, die möglicherweise Preprints, graue Literatur oder neu erscheinende unveröffentlichte Ergebnisse übersieht. Die manuelle Über...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären, dass sie keine Interessenkonflikte haben.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wurde von der Universiti Sains Malaysia unterstützt, einem Brückenzuschuss mit Projektnummer R501-LR-RND003-0000001342-00000.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Frennert, S., et al. Towards a hierarchical user requirement structure for upper limb assistive robotics. ACM Trans Hum-Robot Interact. 14 (1), 1-26 (2024).
  2. Kansizoglou, I., Bampis, L., Gasteratos, A. An active learning paradigm for online audio- visual emotion recognition. IEEE Trans Affect Comput. 13 (2), 756-768 (2019).
  3. Keroglou, C., et al. A survey on technical challenges of assistive robotics for elder people in domestic environments: The aspida concept. IEEE Trans Med Robot Bionics. 5 (2), 196-205 (2023).
  4. Wang, S., Lambeta, M., Chou, P. W., Calandra, R. Tacto: A fast, flexible, and open-source simulator for high-resolution vision-based tactile sensors. IEEE Robot Autom Lett. 7 (2), 3930-3937 (2022).
  5. Heinisch, J., et al. Physiological data for affective computing in HRI with anthropomorphic service robots: The AFFECT-HRI data set. Sci Data. 11 (1), 333 (2024).
  6. Li, B., et al. TVT-Transformer: A tactile-visual-textual fusion network for object recognition. Inf Fusion. 118, 102943 (2025).
  7. Kim, H., et al. Technological applications of social robots to create healthy and comfortable smart home environment. Build Environ. , 112269 (2024).
  8. Leoste, J., Marmor, K., Heidmets, M. Nonverbal behavior of service robots in social interactions: A survey on recent studies. Interact Des Archit. 61, 164-192 (2024).
  9. Liu, N., et al. A lightweight network-based sign language robot with facial mirroring and speech system. Expert Syst Appl. 262, 125492 (2024).
  10. Iskandar, M., Albu-Schäffer, A., Dietrich, A. Intrinsic sense of touch for intuitive physical human-robot interaction. Sci Robot. 9 (93), eadn4008 (2024).
  11. Ren, Q., Hou, Y., Belpaeme, T. Low-latency classification of social haptic gestures using transformers. , (2023).
  12. Hou, Y., Ren, Q., Wang, W., Botteldooren, D. Sound-based recognition of touch gestures and emotions for enhanced human-robot interaction. , (2025).
  13. Al, G., Martinez-Hernandez, U. DiGeTac unit for multimodal communication in human-robot interaction. IEEE Sens Lett. 8 (5), 6001804 (2024).
  14. Tsai, Y. H., et al. Multimodal transformer for unaligned multimodal language sequences. , (2019).
  15. Wang, Z., Chen, M., Liu, Q. A review on multimodal communications for human-robot collaboration in 5G: From visual to tactile. Intell Robot. 5 (3), 579-606 (2025).
  16. Antonucci, A., et al. Humans as path-finders for mobile robots using teach-by-showing navigation. Auton Robots. 47 (8), 1255-1273 (2023).
  17. Duarte, N. F., Rakovic, Action anticipation: Reading the intentions of humans and robots. IEEE Robot Autom Lett. 3 (4), 4132-4139 (2018).
  18. Hayashi, K. Investigation of joint action in go/no-go tasks: Development of a human-like eye robot and verification of action space. Int J Soc Robot. , 1-14 (2024).
  19. Belkaid, M., et al. Mutual gaze with a robot affects human neural activity and delays decision-making processes. Sci Robot. 6 (58), eabc5044 (2021).
  20. Guidolin, M., Tagliapietra, L., Menegatti, E., Reggiani, M. Hi-ros: Open-source multi-camera sensor fusion for real-time people tracking. Comput Vis Image Underst. 232, 103694 (2023).
  21. Ovur, S. E., Demiris, Y. Naturalistic robot-to-human bimanual handover in complex environments through multi-sensor fusion. IEEE Trans Autom Sci Eng. 21 (3), 3730-3741 (2023).
  22. Viola, P., Jones, M. Rapid object detection using a boosted cascade of simple features. , (2001).
  23. Stauffer, C., Grimson, W. E. L. Adaptive background mixture models for real-time tracking. , (1999).
  24. Qi, W., et al. Multi-sensor guided hand gesture recognition for a teleoperated robot using a recurrent neural network. IEEE Robot Autom Lett. 6 (3), 6039-6045 (2021).
  25. Sun, J., Shen, Y., Rosen, J. Sensor reduction, estimation, and control of an upper-limb exoskeleton. IEEE Robot Autom Lett. 6 (2), 1012-1019 (2021).
  26. Kim, Y., et al. Learning semantic traversability with egocentric video and automated annotation strategy. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).
  27. Ye, H., et al. Person re-identification for robot person following with online continual learning. IEEE Robot Autom Lett. 9 (11), 9151-9158 (2024).
  28. Vaswani, A., et al. Attention is all you need. , (2017).
  29. Schneider, S., Baevski, A., Collobert, R., Auli, M. Wav2vec: Unsupervised pre-training for speech recognition. , (2024).
  30. Liu, X., Chen, Y., Li, J., Cangelosi, A. Real-time robotic mirrored behavior of facial expressions and head motions based on lightweight networks. IEEE Internet Things J. 10 (2), 6039-6048 (2022).
  31. Tsai, C. Y., Su, Y. K. MobileNet-JDE: A lightweight multi-object tracking model for embedded systems. Multimed Tools Appl. 81 (7), 9915-9937 (2022).
  32. Pan, Z., Tao, R., Xu, C., Li, H. Selective listening by synchronizing speech with lips. IEEE/ACM Trans Audio Speech Lang Process. 30, 1650-1664 (2022).
  33. Brown, T. B., et al. Language models are few-shot learners. , (2020).
  34. Jin, Y., et al. RobotGPT: Robot manipulation learning from ChatGPT. IEEE Robot Autom Lett. 9 (3), 2543-2550 (2024).
  35. Li, Z., et al. GroundingGPT: Language Enhanced Multi-modal Grounding Model. , (2024).
  36. Bharadhwaj, H., et al. Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking. , (2024).
  37. Wilson, J., et al. LatentBKI: Open-dictionary continuous mapping in visual-language latent spaces with quantifiable uncertainty. IEEE Robot Autom Lett. , (2025).
  38. Maggio, D., et al. Clio: Real-time task-driven open-set 3D scene graphs. IEEE Robot Autom Lett. 9 (10), 5123-5130 (2024).
  39. Nwankwo, L., Rueckert, E. The Conversation is the Command: Interacting with Real-World Autonomous Robots Through Natural Language. , (2024).
  40. Gao, Y., et al. LAMARS: Large language model-based anticipation mechanism acceleration in real-time robotic systems. IEEE Access. 13, 3864-3880 (2024).
  41. Rana, K., et al. Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning. , (2023).
  42. Shah, D., et al. Navigation with large language models: Semantic guesswork as a heuristic for planning. , (2023).
  43. Song, C. H., et al. LLM-Planner: Few-shot grounded planning for embodied agents with large language models. , (2023).
  44. Roth, J., et al. AVA-ActiveSpeaker: An audio-visual dataset for active speaker detection. , (2020).
  45. Li, J., et al. SAVen-Vid: Synergistic audio-visual integration for enhanced understanding in long video context. arXiv. , (2024).
  46. Zhang, H., Hei, X., Cardenas, J., Miao, X., Tapus, A. Toward a multi-dimensional humor dataset for social robots. , (2024).
  47. Zhao, Y., Qian, K., Duan, B., Luo, S. FOTS: A fast optical tactile simulator for sim2real learning of tactile-motor robot manipulation skills. IEEE Robot Autom Lett. 9 (6), 2150-2157 (2024).
  48. Chen, D., et al. A high spatial resolution magnetorheological elastomer tactile sensor for texture recognition. IEEE Sens J. 25 (5), 1234-1241 (2025).
  49. Giovinazzo, F., et al. Design, implementation and testing of an EtherCAT-based network for multi-modal distributed sensing architectures. , (2024).
  50. Yun, Y., et al. Enhancing sensitivity across scales with highly sensitive Hall effect-based auxetic tactile sensors. Adv Intell Syst. 7 (3), 2300456 (2024).
  51. Zafar, M., Moosavi, S. K. R., Sanfilippo, F. Federated learning-enhanced edge deep learning model for EMG-based gesture recognition in real-time human-robot interaction. IEEE Sens J. 25 (5), 1234-1241 (2025).
  52. Dong, P., et al. Decoding silent speech cues from muscular biopotential signals for efficient human-robot collaborations. Adv Mater Technol. 10 (4), 2301123 (2024).
  53. Wang, J., An, Z., Guo, Y. MetaSonic: Advancing robot localization with directional embedded acoustic signals. IEEE Robot Autom Lett. 10 (2), 3150-3157 (2025).
  54. AgiBot-World-Contributors. AgiBot World Colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems. , (2025).
  55. Xue, F., Li, Y., Liu, D., Xie, Y., Wu, L., et al. LipFormer: Learning to lipread unseen speakers based on visual-landmark transformers. IEEE Trans Circuits Syst Video Technol. 33 (9), 4507-4517 (2023).
  56. Hu, H., et al. Speech emotion recognition based on multimodal and multiscale feature f usion. Signal Image Video Process. 19 (2), 123 (2024).
  57. Lee, D., et al. Intuitive six-degree-of-freedom human interface device for human-robot interaction. IEEE Trans Instrum Meas. 73, 1-10 (2024).
  58. Kvasic, I., et al. Diver-robot communication dataset for underwater hand gesture recognition. Comput Netw. 245, 110392 (2024).
  59. Li, Z., et al. MBCFNet: A multimodal brain-computer fusion network for human intention recognition. Knowl-Based Syst. 296, 111826 (2024).
  60. Popescu, M., et al. Fusion of inertial sensor suit and monocular camera for 3D human pelvis pose estimation. , (2024).
  61. Zhou, S., Yang, B., Yuan, M., Jiang, R., Yan, R., et al. Enhancing SNN-based spatiotemporal learning: A benchmark dataset and cross-modal attention model. IEEE Trans Neural Netw Learn Syst. 35 (8), 11234-11248 (2024).
  62. Biswas, S., Saw, R., Nandy, A. Attention-enabled hybrid convolutional neural network for enhancing human-robot collaboration through hand gesture recognition. Comput Electr Eng. 123, 110020 (2025).
  63. Tan, H., Bansal, M. LXMERT: Learning cross-modality encoder representations from transformers. , (2019).
  64. Alayrac, J. B., et al. Flamingo: a visual language model for few-shot learning. , (2022).
  65. Radford, A., et al. Learning transferable visual models from natural language supervision. , (2021).
  66. Xie, J., Zhang, B., Lu, Q., Borisov, O. A dynamic head gesture recognition method for real- time intention inference and its application to visual human-robot interaction. Int J Control Autom Syst. 22, 252-264 (2024).
  67. Arenas, M., et al. How to prompt your robot: A promptbook for manipulation skills with code as policies. , (2024).
  68. Zhu, J., Gienger, M., Franzese, G., Kober, J. Do you need a hand?—A bimanual robotic dressing assistance scheme. IEEE Trans Robot. 40, 1906-1919 (2024).
  69. Ortenzi, V., et al. Object handovers: A review for robotics. IEEE Trans Robot. 37 (6), 2150-2168 (2022).
  70. Kabacińska, K., Teng, K., Robillard, J. Social robot interactions in a pediatric hospital setting: Perspectives of children, parents, and healthcare providers. Multimodal Technol Interact. 9 (2), 14 (2025).
  71. Viyuela, &. #. 2. 1. 1. ;., Sanfeliu, A. Human-robot collaborative minimum time search through sub- priors in ant colony optimization. IEEE Robot Autom Lett. 9 (11), 1123-1130 (2024).
  72. Roy, L., Croft, E., Kulić, D. Learning to communicate functional states with nonverbal expressions for improved human-robot collaboration. IEEE Robot Autom Lett. 9 (6), 7123-7130 (2024).
  73. San Martin, A., Kildal, J., Lazkano, E. An analysis of the role of different levels of exchange of explicit information in human-robot cooperation. Front Robot AI. 12, 1511619 (2025).
  74. Gillet, S., et al. Interaction-shaping robotics: Robots that influence interactions between other agents. ACM Trans Hum-Robot Interact. 13 (1), 25 (2024).
  75. Belpaeme, T., et al. Social robots for education: A review. Sci Robot. 3 (21), eaat5954 (2018).
  76. Zhang, R., et al. Predicting emotion reactions for human-computer conversation: A variational approach. IEEE Trans Hum-Mach Syst. 51 (4), 712-721 (2022).
  77. Huang, C., Fu, L., Hung, S. C., Yang, S. Effect of visual programming instruction on students' flow experience, programming self-efficacy, and sustained willingness to learn. J Comput Assist Learn. 41 (1), 123-135 (2025).
  78. Berrezueta-Guzman, S., Dolón-Poza, M. Enhancing preschool language acquisition through robotic assistants: An evaluation of effectiveness, engagement, and acceptance. IEEE Access. , (2025).
  79. Lei, Y., Su, Z., Cheng, C. Virtual reality in human-robot interaction: Challenges and benefits. Electron Res Arch. 31 (4), 2374-2408 (2023).
  80. Pareto, J., Coeckelbergh, M. Social assistive robotics: An ethical and political inquiry through the lens of freedom. Int J Soc Robot. 16 (8), 1797-1808 (2024).
  81. Hung, L., et al. “It’s always happy to see me”: Exploring LOVOT robots as companions for older adults. J Rehabil Assist Technol Eng. 12, 20556683251320669 (2025).
  82. Maaz, N., Mounsef, J., Maalouf, N. CARE: Towards customized assistive robot-based education. Front Robot AI. 12, 1474741 (2025).
  83. Gómez-Izquierdo, G., Laplaza, J., Sanfeliu, A., Garrell, A. Enhancing context-aware human motion prediction for efficient robot handovers. , (2025).
  84. Lee, S., Lee, S., Park, H. Integration of tracking, re-identification, and gesture recognition for facilitating human-robot interaction. Sensors. 24 (15), 4850 (2024).
  85. Bakhoda, I., et al. Exploring the impact of narrator type on response latency and utterance length during interactive storytelling. , (2024).
  86. Pandey, A. K., Gelin, R. A mass-produced sociable humanoid robot: Pepper: The first machine of its kind. IEEE Robot Autom Mag. 25 (3), 40-48 (2018).
  87. Yamamoto, T., et al. Toyota Human Support Robot (HSR): Development and future prospects. 2019 IEEE/SICE International Symposium on System Integration (SII). , 634-639 (2019).
  88. Lupton, T., Sukkarieh, S. Visual-inertial-aided navigation for high-dynamic motion in built environments without initial conditions. IEEE Trans Robot. 28 (1), 61-76 (2011).
  89. Zürn, J., Posner, I., Burgard, W. Autograph: Predicting lane graphs from traffic observations. IEEE Robot Autom Lett. 9 (1), 73-80 (2024).
  90. Sirohi, K., Büscher, D., Burgard, W. UPLAM: Robust panoptic localization and mapping leveraging perception uncertainties. IEEE Robot Autom Lett. 9 (8), 5123-5130 (2024).
  91. Wang, L., et al. A survey on large language model based autonomous agents. Front Comput Sci. 18 (6), 186345 (2024).
  92. Zang, Y., et al. Contextual object detection with multimodal large language models. Int J Comput Vis. 133 (2), 1-19 (2024).
  93. Ivanovic, B., et al. Multimodal deep generative models for trajectory prediction: A conditional variational autoencoder approach. IEEE Robot Autom Lett. 6 (2), 295-302 (2020).
  94. Floridi, L., Chiriatti, M. GPT-3: Its nature, scope, limits, and consequences. Minds Mach. 30, 681-694 (2020).
  95. Carta, T., et al. Grounding large language models in interactive environments with online reinforcement learning. , (2023).
  96. Huang, B., et al. VTimeLLM: Empower LLM to grasp video moments. , (2024).
  97. Gupta, M., et al. From ChatGPT to ThreatGPT: Impact of generative AI in cybersecurity and privacy. IEEE Access. 11, 80218-80245 (2023).
  98. Li, X., et al. Chain-of-knowledge: Grounding large language models via dynamic knowledge adapting over heterogeneous sources. , (2024).
  99. Kimoto, M., Iio, T., Shiomi, M., Shimohara, K. Coordinating entrainment phenomena: Robot conversation strategy for object recognition. Appl Sci. 11 (5), 2358 (2021).
  100. Nyatsanga, S., et al. A comprehensive review of data-driven co-speech gesture generation. Comput Graph Forum. 42 (2), 569-596 (2023).
  101. Abadía, I., et al. A cerebellar-based solution to the nondeterministic time delay problem in robotic control. Sci Robot. 6 (58), eabf2756 (2021).
  102. Deng, X., Weirich, S., Katzschmann, R. K., Delbruck, T. A rapid and robust tendon-driven robotic hand for human-robot interactions playing rock-paper-scissors. , (2024).
  103. Xu, K., et al. A joint modeling of vision-language-action for target-oriented grasping in clutter. , (2023).
  104. Lee, H., Hahn, S. Effect of robot head movement and its timing on human-robot interaction. Int J Soc Robot. 17 (1), 3-14 (2024).
  105. Kim, S., Hernandez, I., Nussbaum, M., Lim, S. Teleoperator-robot-human interaction in manufacturing: Perspectives from industry, robot manufacturers, and researchers. IISE Trans Occup Ergon Hum Factors. 12 (1-2), 28-40 (2024).
  106. Pelikan, H., Hofstetter, E. Managing delays in human-robot interaction. ACM Trans Comput-Hum Interact. 30 (4), 1-24 (2022).
  107. Kang, D., Nam, C., Kwak, S. Robot feedback design for response delay. Int J Soc Robot. 16 (2), 1341-1361 (2024).
  108. Akita, E., Zaidner, G., Pryor, M. Improved situational awareness and performance with dynamic task-based overlays for teleoperation. , (2024).
  109. Scholz, C., et al. Improving robot-to-human communication using flexible display technology as a robotic-skin-interface: A co-design study. Int J Intell Robot Appl. 9 (1), 146-163 (2024).
  110. Reardon, C., et al. Augmented reality visualization of autonomous mobile robot change detection in uninstrumented environments. ACM Trans Hum-Robot Interact. 13 (3), 1-30 (2024).
  111. Asaka, S., Itoyama, K., Nakadai, K. Improving impressions of response delay in AI-based spoken dialogue systems. , (2024).
  112. Kamtam, S., et al. Network latency in teleoperation of connected and autonomous vehicles: A review of trends, challenges, and mitigation strategies. Sensors. 24 (12), 3957 (2024).
  113. Klumpp, M., et al. Syntalos: A software for precise synchronization of simultaneous multi- modal data acquisition and closed-loop interventions. Nat Commun. 16 (1), 708 (2025).
  114. Du, J., et al. Sensory manipulation as a countermeasure to robot teleoperation delays: System and evidence. Sci Rep. 14, (2024).
  115. Hu, Y., et al. Human-robot facial coexpression. Sci Robot. 9 (88), eadi4724 (2024).
  116. Gao, W., Shen, S., Ji, Y., Tian, Y. Human perception of the emotional expressions of humanoid robot body movements: Evidence from survey and eye-tracking measurements. Biomimetics. 9 (11), 684 (2024).
  117. Cárdenas, P., et al. Evaluation of robot emotion expressions for human-robot interaction. Int J Soc Robot. 16 (9), 2019-2041 (2024).
  118. Casper, S., et al. Open problems and fundamental limitations of reinforcement learning from human feedback. , (2025).
  119. Clark, J., Mirchandani, S., Sadigh, D., Belkhale, S. Action-free reasoning for policy generalization. arXiv. , (2025).
  120. Shridhar, M., et al. Perceiver-Actor: A multi-task transformer for robotic manipulation. , (2022).
  121. Wang, X. Mobile robot environment perception system based on multimodal sensor fusion. Appl Comput Eng. 127, 42-49 (2025).
  122. Bai, K., Zhang, L., Chen, Z., Wan, F., Zhang, J. Close the sim2real gap via physically-based structured light synthetic data simulation. , (2024).
  123. Fatehi, K., Torres, M., Kucukyilmaz, A. An overview of high-resource automatic speech recognition methods and their empirical evaluation in low-resource environments. Speech Commun. 167, 103151 (2024).
  124. Louca, J., Eder, K., Vrublevskis, J., Tzemanaki, A. Impact of haptic feedback in high latency teleoperation for space applications. ACM Trans Hum-Robot Interact. 13 (2), 1-21 (2024).
  125. Luo, W., Zhang, S., Gao, Y., Shen, C. Review of mechanisms and detection methods of internal short circuits in lithium-ion batteries. Ionics. 31 (5), 3945-3964 (2025).
  126. Luo, W., et al. Study on the comprehensive multisource thermal runaway failure characteristics and cooling effects of extinguishing agents in 280 Ah batteries. Phys Fluids. 37 (3), (2025).
  127. Alimardani, M., Roode, R., Vaitonyte, J., Louwerse, M. Effect of a virtual agent's appearance and voice on uncanny valley and trust in human-agent collaboration. , (2024).
  128. Moradinezhad, R., Solovey, E. Investigating trust in interaction with inconsistent embodied virtual agents. Int J Soc Robot. 13 (8), 2103-2118 (2021).
  129. Zixuan, H., et al. Observer-based adaptive robust force control of a robotic manipulator integrated with external force/torque sensor. Actuators. 14 (3), 116 (2025).
  130. Huang, J., et al. Adaptive robust interaction force control of a robotic manipulator in uncertain environments. IEEE Trans Ind Electron. 72 (8), 8251-8260 (2025).
  131. Xu, R., et al. OPV2V: An open benchmark dataset and fusion pipeline for perception with vehicle-to-vehicle communication. , (2022).
  132. Zhou, Y., Quang, L., Nieto-Granda, C., Loianno, G. CoPeD: Advancing multi-robot collaborative perception—A comprehensive dataset in real-world environments. IEEE Robot Autom Lett. 9 (7), 6416-6423 (2024).
  133. Park, H., et al. A benchmark dataset for collaborative SLAM in service environments. IEEE Robot Autom Lett. 9 (12), 11337-11344 (2024).
  134. Barker, J., Watanabe, S., Vincent, E., Trmal, J. The fifth CHiME speech separation and recognition challenge: Dataset, task and baselines. , (2018).
  135. Cornell, S., et al. The CHiME-8 DASR challenge for generalizable and array agnostic distant automatic speech recognition and diarization. , (2024).
  136. Schreiter, T., et al. THÖR-MAGNI: A large-scale indoor motion capture recording of human movement and robot interaction. Int J Robot Res. 44 (4), 568-591 (2024).
  137. Savko, L., Qian, Z., Gremillion, G., Neubauer, C., Canady, J., et al. RW4T dataset: Data of human-robot behavior and cognitive states in simulated disaster response tasks. , (2024).
  138. Zatsarynna, O., Farha, Y., Gall, J. Multi-modal temporal convolutional network for anticipating actions in egocentric videos. , (2021).
  139. Gkournelos, C., Konstantinou, C., Makris, S. An LLM-based approach for enabling seamless human-robot collaboration in assembly. CIRP Ann. 73 (1), 9-12 (2024).
  140. Rahimi, H., et al. User-VLM 360: Personalized vision language models with user-aware tuning for social human-robot interactions. , (2025).
  141. Langås, E., Zafar, M., Sanfilippo, F. Exploring the synergy of human-robot teaming, digital twins, and machine learning in industry 5.0: A step towards sustainable manufacturing. J Intell Manuf. , 1-24 (2025).
  142. Nizamuddin, M., Kamisetty, A., Gummadi, J. C., Talla, R. R. Integrating neural networks with robotics: Towards smarter autonomous systems and human-robot interaction. Robotics Xplore: USA Tech Digest. 1 (1), 157-169 (2024).
  143. Asuzu, K., Singh, H., Idrissi, M. Human-robot interaction through joint robot planning with large language models. Intell Serv Robot. 18 (2), 261-277 (2025).
  144. Shamshiri, R., et al. Internet of robotic things with a local LoRa network for teleoperation of an agricultural mobile robot using a digital shadow. Discov Appl Sci. 6, 414 (2024).
  145. Smith, C., Mott, T., Williams, T. Perspectives on level of autonomy decisions in space robotics. , (2024).
  146. Kim, T., Song, Y., Kim, D., Song, H. Too much is as bad as too little: The impact of implementing multiple social interaction features on trust and acceptance of automated vehicle agents. Int J Hum-Comput Interact. 41 (21), 13875-13890 (2025).
  147. Elsayyad, S., et al. An effective robot selection and recharge scheduling approach for improving robotic networks performance. Sci Rep. 14 (1), 28439 (2024).
  148. Mayer, L., et al. Human-AI collaboration: Trade-offs between performance and preferences. Cogn Res Princ Implic. 11, 18 (2026).
  149. Yang, B., et al. Gaze and environmental context-guided deep neural network and sequential decision fusion for grasp intention recognition. IEEE Trans Neural Syst Rehabil Eng. 31, 3687-3689 (2023).
  150. Rückin, J., Magistri, F., Stachniss, C., Popović, M. Semi-supervised active learning for semantic segmentation in unknown environments using informative path planning. IEEE Robot Autom Lett. 9 (3), 2662-2669 (2024).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

FusionsstrategienSystemarchitekturenEchtzeitverarbeitungsemantische Ausrichtungadaptive Fusionkontinuierliches Lernensozial assistierende Roboter

Verwandte Artikel