Artykuł badawczy

Wizualne mapowanie multimodalnych cech emocji dla projektowania inteligentnych interakcji

DOI:

10.3791/71171

21 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W pracy zaproponowano kompleksowy, multimodalny system analizy emocji, który wykorzystuje koderach transformera, rozdzielone reprezentacje emocji oraz oparty na grafach mechanizm uwagi między-modalnej z mapowaniem wizualnym w celu zwiększenia dokładności rozpoznawania emocji w dwóch zbiorach danych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wizualne mapowanie multimodalnych cech emocjonalnych ma kluczowe znaczenie dla projektowania inteligentnych interfejsów, umożliwiając maszynom rozumienie, interpretowanie i reagowanie na afektywne stany człowieka. Niemniej jednak obecne algorytmy multimodalnego wykrywania emocji koncentrują się głównie na wydajności predykcyjnej, oferując niewielki wgląd w interpretowalność, świadomość interakcji czy międzymodalne interakcje na poziomie cech. W niniejszej pracy przedstawiono ramy wizualnego mapowania aspektów emocji multimodalnych, które łączą wizualizację zorientowaną na interakcję, interpretowalną naukę reprezentacji oraz predykcję emocji. Bez użycia ręcznie tworzonych cech, do ekstrakcji wysokopoziomowych osadzeń emocjonalnych z modalności tekstowej, dźwiękowej i wizualnej wykorzystano koderów opartych na transformerach. W celu zwiększenia odporności, informacje specyficzne dla emocji oraz specyficzne dla modalności zostały rozdzielone za pomocą techniki rozplątanej nauki reprezentacji. Dodatkowo stworzono opartą na grafach sieć uwagi międzymodalnej, wykorzystującą adaptacyjne ważenie uwagi do symulowania subtelnych relacji emocjonalnych między modalnościami. W celu zwiększenia przejrzystości opracowano moduł wielowidokowego mapowania wizualnego, który obrazuje czasowe trajektorie emocji, rozkłady uwagi międzymodalnej oraz ukryte osadzenia emocjonalne. Do oceny zaproponowanych ram wykorzystano zbiór danych Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) oraz Chinese Multimodal Sentiment Analysis Dataset (CH-SIMS). Wyniki eksperymentalne wykazały, że zaproponowane ramy zapewniły lepszą interpretowalność na poziomie cech i wizualizację świadomą interakcji, konsekwentnie przewyższając reprezentatywne techniki bazowe pod względem dokładności, wskaźnika F1, korelacji oraz średniego błędu absolutnego. Ponadto moduł mapowania wizualnego umożliwił jakościową interpretację multimodalnych reprezentacji emocji, interakcji międzymodalnych i czasowej dynamiki emocji, wspierając analizę i wizualizację świadomą interakcji.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zdolność do prawidłowej identyfikacji i rozumienia ludzkich emocji stała się kluczowa dla usprawnienia interakcji między ludźmi a maszynami. Analiza emocji, poza tym że jest niezbędna do poprawy interakcji człowiek-komputer, ma potencjał zrewolucjonizować szereg dziedzin, w tym przeddiagnostykę medyczną1, analizę behawioralną w klasie2, monitorowanie psychologiczne pacjentów3, identyfikację zmęczenia w pojazdach4 oraz inteligentne zarządzanie w środowiskach inteligentnego domu5. Ostatnie osiągnięcia w dziedzinie informatyki afektywnej i uczenia głębokiego6 zwiększyły zainteresowanie tworzeniem systemów czasu rzeczywistego, które potrafią uchwycić złożoność ludzkich emocji.

Wiele obecnych metod opiera się głównie na danych unimodalnych, takich jak sygnały tekstowe, graficzne lub słuchowe7,8,9. Podejścia te wielokrotnie zawodzą w wykrywaniu subtelnych sygnałów, takich jak sarkazm czy niuanse zależne od kontekstu. Badania przesunęły się w stronę multimodalnej oceny emocji, która w celu przełamania tych ograniczeń łączy komplementarne dane z wielu źródeł10,11,12. Zalety łączenia wielu modalności zostały wykazane w modelach bazowych, takich jak wczesna fuzja z długo-krótkotrwałą pamięcią (EF-LSTM)13, lekkie głębokie sieci neuronowe FM (LF-DNN)14, sieci fuzji tensorowej (TFN) oraz podejścia oparte na fuzji multimodalnej o niskim rzędzie. Jednak większość tych metod opiera się na offline'owej generacji cech i nie nadaje się do dynamicznych sytuacji w świecie rzeczywistym.

W celu uwzględnienia stanów emocjonalnych, w ciągu ostatnich dziesięciu lat rozwinęły się badania i zastosowania w zakresie multimodalnej identyfikacji emocji15. Jednym z najbardziej wymagających i istotnych obszarów współczesnych badań jest ciągłe monitorowanie stanów emocjonalnych z wykorzystaniem różnorodnych źródeł danych16. Koncepcja multimodalności pojawiła się w sposób naturalny wraz z powstaniem tak zróżnicowanego systemu wiedzy, co doprowadziło do wielu postępów w wykorzystaniu emocji w dziedzinach takich jak obliczenia emocjonalne, interakcja człowiek-komputer (HCI), uczenie się, gry wideo, obsługa klienta, opieka medyczna, ocena doświadczeń użytkownika (UX) itp. Jednak zastosowanie technik rozpoznawania emocji w ewaluacji UX nie zawsze było tak proste.

Jednym z głównych powodów skupienia się na rozpoznawaniu multimodalnym, a nie na metodach unimodalnych, są immanentne wady polegania na pojedynczym źródle informacji. Systemy unimodalnego wykrywania emocji mogą cechować się niższą dokładnością z powodu brakujących lub niejasnych danych, podczas gdy schematy MER są bardziej niezawodne i oferują bardziej kompleksowe oraz wnikliwe zrozumienie stanów ekspresyjnych poprzez integrację wielu źródeł danych17. Na przykład sam język mimiki może być niewystarczający do precyzyjnej klasyfikacji uczuć, szczególnie gdy gesty są złożone lub niejasne. Jednak połączenie wyrazów twarzy z innymi formami komunikacji, takimi jak język lub sygnały fizyczne, może zwiększyć dokładność rozpoznawania uczuć.

Przeprowadzono szeroko zakrojone badania nad rozpoznawaniem emocji z wykorzystaniem kilku modalności. Wczesne studia koncentrowały się na identyfikacji cech wyróżniających w różnych modalnościach, takich jak dane graficzne, akustyczne lub tekstowe. Coraz bardziej oczywiste staje się jednak, że integracja różnych modalności może dostarczyć zrównoważonych informacji emocjonalnych, co prowadzi do bardziej wiarygodnego i precyzyjnego wykrywania sentymentu. Niniejszy segment omawia kluczowe postępy w jednowymiarowej i multimodalnej analizie emocji, koncentrując się na podejściach bazowych, ich niedociągnięciach oraz uzasadnieniu zastosowanej przez nas metody.

Wstępne badania nad rozpoznawaniem emocji koncentrowały się głównie na pojedynczej modalności. W obszarze wizualnym przełomowe badania doprowadziły do kategoryzacji prototypowych ruchów twarzy20. Kolejne postępy obejmowały techniki rejestrowania dynamiki czasowej, takie jak ruch wizualny21 oraz ukryte modele Markowa22, podczas gdy reakcje twarzy zostały podzielone na jednostki akcji przy użyciu Systemu Kodowania Ruchów Twarzy (FACS)23. Sieci LSTM oraz konwolucyjne sieci neuronowe (CNN) były z sukcesem wykorzystywane do ekstrakcji istotnych cech bezpośrednio z surowych sygnałów audio; metodologie identyfikacji emocji na podstawie dźwięku ewoluowały od konwencjonalnego przetwarzania sygnałów do głębokiego uczenia24. Ekstrakcja kontekstowych sygnałów sentymentu w tekstowej analizie emocji została znacznie usprawniona dzięki rekurencyjnym sieciom neuronowym (RNN) z wbudowanymi mechanizmami uwagi, a w ostatnim czasie przez modele oparte na transformerach. Pomimo tych osiągnięć, techniki unimodalne są z natury niezdolne do dokładnego odwzorowania złożoności doświadczeń ludzkich, ponieważ brakuje im informacji uzupełniających dostępnych w innych modalnościach.

W 2021 roku zaproponowano niektóre modele oparte na mechanizmach uwagi, takie jak model DialogXL25, w celu gromadzenia długoterminowych danych środowiskowych w obszarze identyfikacji sentymentu w konwersacjach. Kim i wsp.26 wprowadzili w 2021 roku model EmoBERTa, aby zwiększyć dokładność ERC. Model ten wykorzystuje dane o mówcach w celu ulepszenia cech uczestników rozmów oraz ich wzajemnych interakcji. W 2022 roku Li i wsp.27 zaprezentowali metodę CoG-BART. Organizacja ta wykorzystuje nadzorowane uczenie kontrastowe, aby poprawić zdolność modelu do interpretacji istotnych danych. Należy zauważyć, że uczenie nadzorowane wymaga znacznej ilości etykietowanych danych.

Typowym przykładem takich prac jest framework Multimodal Interaction-Aware Representation (MIAR)28, który wykorzystuje tokeny interakcji cech oraz wyrównanie kontrastowe w celu poprawy generalizacji między modalnościami. MIAR poprawia wyrównanie modalności i osiąga wysoką skuteczność w wielu zbiorach danych; jednak koncentruje się on przede wszystkim na dokładności predykcji, nie zajmując się odwzorowaniem wizualnym. Podobnie model Cross-Attentional Audio-Visual Fusion29 skutecznie rejestruje szczegółowe interakcje audiowizualne dla predykcji walencji i pobudzenia, ale jest ograniczony do dwóch modalności i nie posiada możliwości wizualizacji. Podejścia do modelowania czasowego oparte na sieciach LSTM i fuzji autoenkoderów pomyślnie oddają dynamikę czasową emocji, lecz zapewniają ograniczony wgląd w interakcje modalności i wyuczone reprezentacje emocjonalne. W ostatnim czasie metody oparte na transformerach, takie jak Transformer-based Multimodal Fusion Network (TMFN)30, wykazały wysoką skuteczność w zbiorach CMU-MOSI i CMU-MOSEI dzięki ulepszonej fuzji multimodalnej i uczeniu kontrastowemu. Niemniej jednak, podejścia te pozostają głównie zorientowane na wydajność i oferują ograniczone wsparcie dla wyjaśnialności, interpretacji na poziomie cech oraz wizualizacji zorientowanej na interakcje.

W celu usprawnienia integracji danych tekstowych, akustycznych i wizualnych zaproponowano szereg multimodalnych technik rozpoznawania emocji. Choć wczesne techniki fuzji, takie jak EF-LSTM i LF-DNN, nie były w stanie uchwycić złożonych interakcji międzymodalnych, wykazały one zalety wykorzystania informacji multimodalnych w analizie sentymentu i emocji. Mimo że model TFN poprawił wyniki na zbiorach referencyjnych, takich jak CMU-MOSI i CMU-MOSEI, oraz wprowadził jawne modelowanie interakcji międzymodalnych, jego użyteczność była ograniczona przez niską interpretowalność i wysoką złożoność obliczeniową. Aby poprawić dopasowanie modalności oraz dynamiczną fuzję cech, nowsze techniki, takie jak MIAR, modele fuzji z wzajemną uwagą (cross-attentional fusion), TMFN oraz adaptacyjne transformery multimodalne, wykorzystały topologie transformerów i mechanizmy uwagi. Metody te koncentrowały się przede wszystkim na wydajności predykcyjnej, oferując niewielki wgląd w reprezentacje emocjonalne na poziomie cech i zależności międzymodalne, mimo osiągnięcia konkurencyjnych wyników w powszechnych metrykach ewaluacyjnych, takich jak dokładność (accuracy), F1-score oraz średni błąd bezwzględny (mean absolute error). Ponadto niewiele badań opracowało techniki wizualizacji zdolne do ujawnienia ukrytych osadzeń emocji (latent emotion embeddings), rozkładów uwagi i czasowej dynamiki emocji, lub zintegrowało modelowanie interakcji międzymodalnych oparte na grafach. Zaproponowane podejście łączy wielowidokowe mapowanie wizualne, fuzję uwagi międzymodalnej opartą na grafach oraz uczenie reprezentacji rozplecionych (disentangled representation learning), aby wyeliminować te wady i zwiększyć wydajność multimodalnego rozpoznawania emocji.

Podobnie, Adaptive Multimodal Transformer32 proponuje fuzję opartą na wymianie, aby adaptacyjnie niwelować zakłócenia lub brakujące informacje modalne, zwiększając tym samym skuteczność klasyfikacji sentymentu. Chociaż podejście to może efektywnie rozwiązywać rozbieżności w rozkładzie informacji modalnych, jego konstrukcja jest specyficzna dla zadania analizy sentymentu i dostarcza ograniczonych informacji na temat wyuczonych reprezentacji emocjonalnych. Innym istotnym wkładem jest Multimodal Fusion Model33, który integruje sieci CNN, multiplikatywne sieci LSTM oraz mechanizm uwagi oparty na transformerach w celu rozpoznawania emocji multimodalnych w czasie rzeczywistym. Model ten przeprowadza pełną fuzję modalności wideo, audio i tekstu, wykazując wysoką skuteczność rozpoznawania. Niemniej jednak, podobnie jak inne istniejące modele, koncentruje się on głównie na dokładności predykcyjnej i brakuje mu jawnych cech umożliwiających wizualizację oraz interpretowalność zorientowaną na interakcję.

Podsumowując, choć obecne, najnowocześniejsze podejścia do multimodalnego rozpoznawania emocji odniosły znaczny sukces w przechwytywaniu interakcji międzymodalnych i zwiększaniu dokładności predykcji, większość z nich koncentruje się na zadaniach zorientowanych na samo rozpoznawanie. Mało uwagi poświęcono obszarom takim jak interpretowalność na poziomie cech, wizualizacja reprezentacji emocjonalnych w przestrzeni obrazu oraz włączanie proponowanego frameworka do projektowania inteligentnych interakcji. To właśnie z myślą o tych wyzwaniach wprowadzono proponowany framework.

Większość obecnych metod koncentruje się przede wszystkim na poprawie wydajności predykcyjnej, oferując niewielką interpretowalność wyuczonych reprezentacji emocjonalnych oraz interakcji między-modalnych, pomimo znaczących postępów w multimodalnym rozpoznawaniu emocji28,29. Złożone interakcje między modalnościami tekstową, akustyczną i wizualną są często trudne do wymodelowania dla obecnych strategii fuzji, szczególnie w przypadku wystąpienia rozbieżności między modalnościami oraz braków w informacjach 28,31. Chociaż architektury oparte na transformerach i mechanizmy uwagi usprawniły uczenie reprezentacji, ich przejrzystość i interpretowalność są często ograniczane przez brak wyraźnego oddzielenia informacji specyficznych dla emocji od informacji specyficznych dla modalności31,32,33. Ponadto tylko niewielka liczba badań analizowała modelowanie interakcji intermodalnych w oparciu o grafy lub tworzyła frameworki wizualizacyjne zdolne do ujawnienia temporalnej dynamiki emocji, rozkładów uwagi oraz embeddingów emocjonalnych. Wady te wskazują na konieczność opracowania interpretowalnego frameworka multimodalnego dla inteligentnej interakcji człowiek-maszyna, który łączyłby zorientowane na interakcję mapowanie wizualne z silnym uczeniem między-modalnym.

Niniejsza praca przedstawia interpretowalny model wizualnego mapowania multimodalnych aspektów emocji w projektowaniu inteligentnych interfejsów. Bez konieczności ręcznego tworzenia cech, system wykorzystuje głębokie uczenie end-to-end do ekstrakcji wysokopoziomowych reprezentacji emocjonalnych z modalności tekstowej, audio i wizualnej. Międzymodalne interakcje emocjonalne są modelowane za pomocą grafowego mechanizmu fuzji uwagi, który oddziela informacje specyficzne dla emocji od informacji specyficznych dla modalności, co umożliwia naukę rozplątanych reprezentacji oraz poprawia interpretowalność i odporność modelu. Dodatkowo stworzono moduł wizualizacji wielowidokowej, aby przedstawić czasową dynamikę emocji, międzymodalne wzorce uwagi oraz osadzenia emocji. Skuteczność i przydatność proponowanego modelu w inteligentnych systemach interakcji człowiek-maszyna zostały ocenione poprzez walidację na referencyjnych zbiorach danych do multimodalnego rozpoznawania emocji.

Niniejsza praca oferuje unikalne ramy dla wizualnego mapowania multimodalnych aspektów emocji, które wykraczają poza tradycyjne podejścia zorientowane na predykcję, aby przezwyciężyć słabe modelowanie interakcji międzymodalnych oraz ograniczoną interpretowalność w obecnych systemach identyfikacji emocji multimodalnych. W ramach jednej architektury zaproponowane podejście łączy multimodalne uczenie reprezentacji oparte na transformatorach, rozplecione (disentangled) modelowanie cech świadomych emocji, fuzję uwagi międzymodalnej opartą na grafach oraz wizualizację zorientowaną na interakcje. W przeciwieństwie do obecnych podejść, które koncentrują się głównie na wydajności klasyfikacji, opracowane ramy wyraźnie oddzielają reprezentacje specyficzne dla emocji od reprezentacji specyficznych dla modalności, co poprawia interpretowalność, odporność i spójność międzymodalną. Dodatkowo przedstawiono mechanizm uwagi oparty na grafach, aby umożliwić adaptacyjne modelowanie interakcji międzymodalnych poprzez przechwytywanie drobnoziarnistych współzależności emocjonalnych pomiędzy modalnościami tekstową, dźwiękową i wizualną. Stworzono moduł wizualnego mapowania wielowidokowego w celu zwiększenia przejrzystości poprzez ujawnienie czasowych trajektorii emocji, wzorców uwagi międzymodalnej i ukrytych osadzeń (embeddings) emocji, co zapewnia intuicyjny wgląd w proces podejmowania decyzji przez model. Oprócz zapewnienia lepszej wizualizacji i interpretowalności multimodalnej dynamiki emocjonalnej, ocena eksperymentalna na zbiorach danych referencyjnych CH-SIMS i CMU-MOSEI wykazała konkurencyjną wydajność pod względem dokładności, miary F1-score, średniego błędu bezwzględnego oraz korelacji.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponowana praca ma na celu usprawnienie projektowania inteligentnych interakcji poprzez zaproponowanie interpretowalnych ram mapowania wizualnego multimodalnych cech emocjonalnych. W pracy tej wykorzystano ogólnodostępne bazy danych CH-SIMS oraz CMU-MOSEI. Oba zestawy danych zostały pobrane z oficjalnych źródeł i wykorzystane zgodnie z wytycznymi dotyczącymi użytkowania, standardami badawczymi oraz warunkami licencjonowania określonymi przez ich odpowiednich twórców. Multimodalna zawartość zbiorów danych, obejmująca dane tekstowe, audio i wideo, została uprzednio zgromadzona i zanonotowana przez dostawców danych zgodnie z upoważnieniami uczestników oraz protokołami gromadzenia danych. W niniejszym badaniu nie wystąpiła bezpośrednia interakcja z ludźmi, nie prowadzono rekrutacji nowych uczestników ani nie gromadzono danych umożliwiających identyfikację osób. Wszystkie analizy zostały przeprowadzone z wykorzystaniem publicznie dostępnych zbiorów danych badawczych. W związku z tym wtórna analiza danych nie wymagała dodatkowej zgody komisji etycznej ani przeglądu Instytucjonalnej Rady Przeglądowej (IRB). Badanie zostało przeprowadzone zgodnie z odpowiednimi normami instytucjonalnymi regulującymi korzystanie z publicznie dostępnych zbiorów danych, etycznymi procedurami badawczymi oraz obowiązującymi zasadami wykorzystywania danych.

Zastosowano mechanizm uwagi międzymodalnej oparty na grafach w celu nauki charakterystyki emocji w różnych modalnościach, wykorzystując cechy specyficzne dla emocji lub modalności w celu poprawy zrozumienia. Komponent wielowidokowego mapowania wizualnego jest wykorzystywany do usprawnienia interaktywnego projektowania świadomego emocji w czasie rzeczywistym, a jego efektywność jest szacowana dla rozpoznawania emocji. Wyniki pokazują, że proponowana metoda poprawia zarówno interpretowalność, jak i wydajność inteligentnych interfejsów użytkownika świadomych emocji w świecie rzeczywistym. Rysunek 1 przedstawia schemat architektury proponowanego rozwiązania. Rysunek 1 pokazuje pełny przebieg pracy sugerowanego frameworka mapowania wizualnego dla multimodalnej nauki cech emocjonalnych w kontekście inteligentnych systemów interakcji. Przepływ pracy rozpoczyna się od trzech zsynchronizowanych modalności wejściowych, mianowicie tekstu, dźwięku i wideo, które wychwytują uzupełniające się informacje emocjonalne odpowiednio z modalności lingwistycznej, prozodycznej i ekspresji twarzy. Koder transformera specyficzny dla danej modalności przetwarza każdą modalność w celu uzyskania reprezentacji wysokiego poziomu z surowych danych wejściowych. Reprezentacje te są następnie przekazywane do modułu nauki reprezentacji rozplątanej, w którym osadzenia specyficzne dla emocji są rozdzielane od cech specyficznych dla modalności, aby zapewnić spójność wyuczonych emocji w heterogenicznych źródłach danych. Osadzenia specyficzne dla emocji z każdej modalności są następnie agregowane przez sieć uwagi międzymodalnej opartą na grafach, która modeluje międzymodalne zależności emocjonalne i przypisuje dynamiczne wagi istotności do każdej modalności na podstawie kontekstu interakcji. Ostatecznie framework dostarcza zarówno wyniki klasyfikacji emocji, jak i spostrzeżeń dotyczących interakcji, co ułatwia przejrzyste podejmowanie decyzji świadome emocji oraz adaptacyjny projekt inteligentnych interakcji.

Multimodalna akwizycja danych

Zbiory danych CH-SIMS i CMU-MOSEI to dwa istniejące, publicznie dostępne wielomodalne zbiory danych, które zawierają informacje wielomodalne, takie jak zsynchronizowany obraz wideo, dźwięk i tekst. Zbiór danych CH-SIMS obejmuje wielomodalne analizy osób pochodzenia chińskiego i składa się z 2 281 segmentów wideo, pochodzących z różnych fragmentów filmów, seriali telewizyjnych i programów rozrywkowych. Badania nad wielomodalną analizą emocji z wykorzystaniem danych wielomodalnych stają się bardziej angażujące i wykonalne dzięki dodaniu odpowiadającego dźwięku i tekstu do tych segmentów wideo. Z kolei zbiór danych CMU-MOSEI jest jednym z największych wielomodalnych zbiorów danych do badania opinii, uczuć i emocji; został on stworzony z ponad 23 000 klipów wideo zawierających frazy wypowiedziane przez ponad 1 000 mówców na różnorodne tematy. Zbiór danych ten został losowo podzielony na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%), przy zachowaniu rozkładu klas.

Transkrypcje tekstowe, sygnały audio oraz klatki wideo są pozyskiwane i synchronizowane czasowo, aby dopasować je do siebie na precyzyjnym poziomie temporalnym. Integracja na poziomie klatek zapewnia, że proponowane uczenie reprezentacji i mechanizmy fuzji oparte na grafach mogą wspólnie modelować i wykorzystywać treść emocjonalną wynikającą z ekspresji wizualnej, tonu głosu oraz treści lingwistycznej. Ten rodzaj techniki akwizycji multimodalnej umożliwia efektywną ekstrakcję między-modalnej dynamiki emocjonalnej, co jest niezbędne do projektowania inteligentnych interakcji i zrozumiałego mapowania wizualnego.

Tabela 1 przedstawia kluczowe struktury multimodalnych zbiorów danych dotyczących emocji wykorzystanych w proponowanej metodzie. Aby uzyskać szerszy zakres powiązanych odczuć, takich jak wypowiadane słowa, intonacja głosu i mimika twarzy, zbiory CH-SIMS i CMU-MOSEI integrują z tych zestawów danych modalności wideo, audio i tekstowe. Ponadto w zbiorze CH-SIMS dostępna jest ograniczona liczba próbek danych, co umożliwia dokładne zbadanie interakcji między modalnościami i zmienności emocji w Chinach. Z drugiej strony zbiór danych CMU-MOSEI jest istotniejszy dla oceny trwałości uczenia reprezentacji oraz powiązanych algorytmów wizualizacji omówionych w niniejszej pracy, ponieważ zawiera dużą ilość danych w różnych językach, dotyczących różnych osób i z adnotacjami poziomów emocji. Dodatkowo, w porównaniu z wcześniejszymi badaniami, redukuje on trudności w doborze informacji podczas testowania modeli.

Multimodalne przetwarzanie wstępne i synchronizacja

Adnotacje znaczników czasowych z zestawów danych CH-SIMS i CMU-MOSEI zostały wykorzystane do synchronizacji modalności tekstowej, słuchowej i wizualnej, co zapewniło spójne uczenie reprezentacji multimodalnych. Każna wypowiedź pełniła funkcję podstawowej jednostki analizy i była powiązana z odpowiadającymi jej segmentami audio i wideo w tym samym przedziale czasowym. Dopasowanie przeprowadzono na poziomie wypowiedzi. Transkrypcja została podzielona na segmenty na podstawie znaczników czasu rozpoczęcia i zakończenia każdej wypowiedzi. Korespondencję transkrypcji, audio i obrazu ustalono poprzez wyodrębnienie odpowiednich klatek wideo oraz sygnałów audio mieszczących się w tym samym przedziale czasowym. Podczas gdy segmenty audio były przetwarzane za pomocą Wav2Vec 2.0 w celu uzyskania reprezentacji akustycznych, klatki wizualne z segmentu wideo były próbkowane z określoną częstotliwością i kodowane przy użyciu Vision Transformer (ViT). Koder RoBERTa został wykorzystany do stworzenia osadzeń tekstowych z transkrypcji wypowiedzi. Synchronizację czasową osiągnięto poprzez dopasowanie cech wszystkich modalności do jednej granicy wypowiedzi, ponieważ trzy modalności generowały sekwencje cech o różnej długości. W celu normalizacji sekwencji o różnych długościach zastosowano format o stałej długości. Dłuższe sekwencje skrócono do maksymalnej dopuszczalnej długości sekwencji, natomiast krótsze sekwencje uzupełniono zerami (zero-padding). Podczas uczenia zastosowano maski uwagi, aby oddzielić elementy dopełniające od rzeczywistych pozycji cech. Osadzenia specyficzne dla danej modalności zostały rzutowane na wspólną przestrzeń latentną przed fuzją, aby zniwelować różnice w długościach sekwencji pomiędzy modalnościami. Gwarantowało to spójność wymiarową i umożliwiło mechanizmowi uwagi opartego na grafach ułatwienie skutecznego uczenia interakcji międzymodalnych. Aby zachować jakość danych i integralność synchronizacji, z badań wykluczono próbki z uszkodzonymi plikami, brakującymi adnotacjami lub niepełnymi informacjami o modalnościach.

Ekstrakcja cech oparta na transformerach

Metoda głębokiego uczenia jest wykorzystywana do nauki wysokopoziomowych reprezentacji cech uwzględniających emocje z informacji pochodzących z wielu modalności, takich jak wizja, dźwięk i tekst, w sposób end-to-end po wyrównaniu danych multimodalnych i przeprowadzeniu niezbędnego przetwarzania wstępnego. Dzięki zastosowaniu koderów transformera do nauki wewnętrznie dyskryminatywnych reprezentacji cech z surowych danych multimodalnych, proponowana metoda eliminuje konieczność inżynierii cech. Aby zapewnić spójność między zbiorami danych wykorzystanymi w proponowanym podejściu, dla każdej modalności wyznaczane jest osadzenie o stałym rozmiarze. Na przykład, dla każdej z poszczególnych modalności, w tym obrazu, dźwięku i tekstu, wyznaczane są 768-wymiarowe osadzenia cech, które wspólnie tworzą ujednoliconą przestrzeń cech stosowaną w całym podejściu, a w szczególności w metodzie ekstrakcji cech wykorzystywanej w proponowanym zbiorze danych CH-SIMS oraz zbiorze danych CMU-MOSEI w celu nauki wysokopoziomowych cech z danych o różnych rozmiarach.

Modalność wizualna: Transformer wizyjny dla osadzeń klatek uwzględniających emocje

Do ekstrakcji informacji wizualnych z klatek wideo w celu uzyskania przestrzennych reprezentacji istotnych dla emocji wykorzystano model Vision Transformer (ViT-Base). Przed ekstrakcją cech klatki z każdego segmentu wideo przeskalowano do rozmiaru (224 × 224) pikseli i pobrano w regularnych odstępach czasowych. Przy rozmiarze patcha 16 × 16 pikseli architektura ViT-Base generuje serię tokenów wizualnych, które są przetwarzane przez 12 warstw koderów transformera. Uzyskane reprezentacje na poziomie klatek zostały rzutowane na 768-wymiarową przestrzeń osadzeń z wykorzystaniem wstępnie wytrenowanego modelu ViT jako szkieletu wizualnego (visual backbone). Osadzenia na poziomie klatek zagregowano za pomocą średniego pulingu (mean pooling), aby stworzyć końcową reprezentację wizualną dla każdego segmentu. Podczas trenowania zastosowano normalizację obrazów oraz powszechne metody augmentacji, takie jak losowe przycinanie (random cropping) i poziome odwracanie (horizontal flipping), w celu poprawy generalizacji. Następnie zaproponowany wielomodalny schemat fuzji został wykorzystany do połączenia tych osadzeń wizualnych z reprezentacjami tekstowymi i słuchowymi.

Aby zachować dynamikę czasową emocji, próbki wideo z zestawów danych CH-SIMS oraz CMU-MOSEI zostaną pobrane w sposób jednolity dla modalności wizualnej. Klatki każdego filmu, figure-protocol-1, mogą zostać podzielone na N sekcji o stałej wielkości, które następnie zostaną spłaszczone i przeniesione odwrotnie do przestrzeni osadzeń latentnych o wymiarze figure-protocol-2. Seria zostaje utworzona poprzez dodanie osadzeń pozycyjnych oraz nauczalnego tokenu grupowania:

figure-protocol-3   (1)

gdzie figure-protocol-4 oznacza kodowanie pozycyjne, a figure-protocol-5 jest macierzą osadzania fragmentów.

Ułożone warstwowo kodery transformera, składające się z sieci przednich (feed-forward) oraz mechanizmu wielogłowicowej samoatencji, są wykorzystywane do przetwarzania sekwencji zakodowanych łat (patches). Transformacja w warstwie l jest opisana jako:

figure-protocol-6   (2)

figure-protocol-7   (3)

Aby uzyskać wektor cech wizualnych uwzględniający emocje, wyodrębnia się wyjście odpowiadające tokenowi klasy jako wektor cech figure-protocol-8. W celu zapewnienia spójnych wizualnych reprezentacji emocji pomimo różnic w języku i treści między zbiorami danych, osadzenia na poziomie klatek z każdego segmentu wideo są łączone, aby uchwycić mimikę twarzy oraz ewolucję emocji.

Modalność audio z wykorzystaniem Wav2Vec 2.0 do analizy prozodii i semantycznych osadzeń akustycznych Kontekstowe osadzenia mowy zostały wygenerowane przy użyciu wstępnie wytrenowanego koder Wav2Vec 2.0 jako szkieletu akustycznego. Wektor cech akustycznych o stałej długości dla każdej frazy uzyskano poprzez agregację wyjściowych reprezentacji ukrytych za pomocą średniego pulowania (mean pooling). Model Wav2Vec 2.0 wykorzystano do ekstrakcji reprezentacji akustycznych z sygnałów audio w celu uchwycenia kontekstowych i istotnych z punktu widzenia emocji charakterystyk mowy. Przed ekstrakcją cech nagrania audio zostały znormalizowane i przepróbkowane do 16 kHz. Aby zapewnić synchronizację między modalnościami tekstową i wizualną, każdy segment audio na poziomie wypowiedzi został wyizolowany przy użyciu granic znaczników czasowych dostarczonych w adnotacjach zbioru danych. Wstępnie wytrenowany koder akustyczny był dostrajany podczas trenowania modelu w celu poprawy adaptacji do konkretnego zadania, co pozwoliło uzyskanym reprezentacjom dokładniej oddać aspekty emocjonalne sygnałów mowy. Następnie, z wykorzystaniem końcowych osadzeń audio, przeprowadzono fuzję uwagi międzymodalnej opartą na grafach oraz uczenie reprezentacji rozplątanej (disentangled representation learning).

W modalności audio model Wav2Vec-2.0 jest wykorzystywany do modelowania sygnałów mowy pochodzących z pierwotnych informacji głosowych w zbiorach danych CH-SIMS i CMU-MOSEI, co pozwala na bezpośrednią ekstrakcję cech audio związanych z emocjami. Dla każdego wejściowego sygnału mowy istnieje konwolucyjne kodowanie cech figure-protocol-9:

figure-protocol-10   (4)

gdzie Z oznacza cechy prozodyczne niskiego poziomu, takie jak melodia, ton i energia. Sieć kontekstowa oparta na transformerze jest przydatna dla wspomnianych struktur, reprezentując długodystansowe zależności czasowe:

figure-protocol-11   (5)

Kontekstowe reprezentacje akustyczne zawierają dane prozodyczne i semantyczne, które są niezbędne do wyrażania emocji. Osadzenie audio o określonej długości jest tworzone poprzez przeprowadzenie procedury poolingu czasowego:

figure-protocol-12   (6)

Projekt ten unika wykorzystania cech akustycznych, takich jak MFCC, i zapewnia trwałość dzięki zastosowaniu danych mowy angielskiej z CMU-MOSEI oraz danych mowy chińskiej z CH-SIMS poprzez proste wyodrębnianie reprezentacji z przebiegów falowych.

Modalność tekstowa z wykorzystaniem RoBERTa do kontekstowych osadzeń emocji

W przypadku modalności tekstowej, głęboki dwukierunkowy transformer RoBERTa został zastosowany do transkrypcji mowy z dwóch zestawów danych w celu wygenerowania semantyki kontekstowej i znaczenia afektywnego. Enkodery transformerowe oparte na RoBERTa zostały wykorzystane do ekstrakcji reprezentacji tekstowych z danych transkrypcyjnych, aby uchwycić kontekstowe informacje semantyczne i emocjonalne. Dla anglojęzycznego zbioru danych CMU-MOSEI wykorzystano wstępnie wytrenowany model RoBERTa, natomiast dla chińskiego zbioru danych CH-SIMS zastosowano wariant RoBERTa w języku chińskim, aby lepiej uwzględnić specyficzne dla danego języka cechy lingwistyczne. Wstępne przetwarzanie tekstu obejmowało tokenizację przy użyciu odpowiedniego tokenizera RoBERTa dla każdego języka oraz normalizację tekstu. Aby zapewnić spójne przetwarzanie wsadowe, sekwencje wejściowe przekształcono w osadzenia tokenów (token embeddings), a następnie dopełniono lub przycięto do ustalonej maksymalnej długości sekwencji. Zgodnie z formatem wejściowym RoBERTa, wprowadzono specjalne tokeny klasyfikacyjne i separatorowe. Stałej długości osadzenie tekstowe uzyskano poprzez agregację kontekstualnych reprezentacji tokenów wygenerowanych przez enkoder transformerowy z wykorzystaniem końcowej reprezentacji zdania odpowiadającej tokenowi [CLS]. Aby dostosować wyuczone reprezentacje do zadania rozpoznawania emocji, wstępnie wytrenowane enkodery RoBERTa zostały doprecyzowane poprzez trening multimodalny. Następnie zaproponowana struktura fuzji multimodalnej została użyta do połączenia osadzeń tekstowych z cechami audio i wizualnymi.

Zagnieżdżenia tokenów (token embeddings) oraz kodowania pozycyjne mogą zostać połączone dla każdego tokenizowanego wejścia, figure-protocol-13, aby stworzyć reprezentację wejściową w głębokiej technice dwukierunkowej transformacji znanej jako

figure-protocol-14   (7)

Forma ta jest reprezentowana poprzez warstwy transformatora L, który wykorzystuje mechanizm self-attention do wykrywania zależności kontekstowych między słowami:

figure-protocol-15  (8)

Kontekstowe zanurzenie emocji uzyskuje się przy użyciu końcowego stanu ukrytego tokenu klasyfikacji:

figure-protocol-16   (9)

Polaryzacja sentymentu, intensywne emocje oraz powiązane z nimi implikacje są przykładami lingwistycznych cech związanych z emocjami, które zostaną przedstawione przez ten embedding. RoBERTa ułatwia modelowanie niezależne od języka. Pozwala to systemowi na zastosowanie tej samej wielkości embeddingu zarówno dla tekstów w języku angielskim z zestawu danych CMU-MOSEI, jak i dla tekstów w języku chińskim z zestawu danych CH-SIMS.

W sugerowanym kroku głębokiego uczenia reprezentacji cech wyodrębniane są trzy specyficzne dla danej modalności wektory cech o wymiarze 768: wizualny fv, audio fa oraz tekstowy ft . W projekcie inteligentnej interakcji wyuczone reprezentacje te tworzą ujednoliconą multimodalną przestrzeń cech, która stanowi podstawę dla mapowania wizualnego na poziomie cech, grafowej fuzji między modalnościami oraz uczenia reprezentacji rozplątanych.

Uczenie reprezentacji rozplątanych

Po wyuczeniu głębokiej reprezentacji cech, dodatkowe przetwarzanie multimodalnych wektorów cech z modalności wizualnej, słuchowej i tekstowej może pozwolić na uzyskanie rozłącznego opisu emocji. Jeśli osadzenia cech specyficzne dla modalności słuchowej, wizualnej i tekstowej użyte w poprzednim kroku są reprezentowane odpowiednio przez fv, fa oraz ft, tak że figure-protocol-17 oraz figure-protocol-18, celem tego kroku jest faktoryzacja wszystkich cech modalności na dwa odrębne opisy latentne, które obejmują opisy emocji po uwzględnieniu poprzedniej semantyki każdej z różnych modalności.

Zostaje to osiągnięte poprzez wprowadzenie cechy każdej modalności, fm , do dwóch równoległych sieci projekcyjnych: kodera emocji figure-protocol-19 oraz kodera modalności figure-protocol-20, w których generowane są dwa kodowania.

figure-protocol-21  (10)

Gdzie figure-protocol-22 cecha ukryta powiązana z emocją jest reprezentowana przez figure-protocol-23 , co reprezentuje cechę ukrytą specyficzną dla danej modalności. Pozwala to osadzeniom specyficznym dla emocji komunikować się z przestrzenią wielokrotnie w ramach wielu danych wejściowych, w tym dźwiękowych, wizualnych i tekstowych, przy jednoczesnym zachowaniu unikalnych danych strukturalnych powiązanych z każdą modalnością.

Skuteczna separacja jest wymuszana poprzez rekonstrukcję z ograniczeniami niezależności. Rekonstrukcja pierwotnej cechy modalności jest wyrażona wzorem:

figure-protocol-24  (11)

gdzie figure-protocol-25 jest siecią dekodującą. Strata rekonstrukcji zachowuje następujące dane:

figure-protocol-26   (12)

Dodatkowo ortogonalność, czyli brak korelacji, pomiędzy emocjami a przedstawieniami specyficznymi dla danej modalności często ogranicza nakładanie się informacji:

figure-protocol-27   (13)

Poprzez realizację tych celów model może wypracować reprezentacje emocji, które są niezawodne, zrozumiałe i odporne na zmienność modalności. Późniejsza międzymodalna fuzja oparta na grafach oraz funkcje mapowania wizualnego, szczególnie w kontekście projektowania inteligentnych interakcji, w dużym stopniu opierają się na interpretowalnych i ustrukturyzowanych reprezentacjach emocji.

Spójność emocjonalna w różnych modalnościach

Wprowadzenie spójności emocjonalnej wyraźnie zwiększa skuteczność fuzji między modalnościami. Dzieje się tak, ponieważ strategie fuzji nie muszą uwzględniać dużych różnic między dwiema reprezentacjami, gdyż osadzenia emocji specyficzne dla danej modalności dzielą wspólną przestrzeń latentną. Połączona ilustracja dwóch emocji opisana jest następująco figure-protocol-28. Fuzja ważona będzie bardziej stabilna, gdy reprezentacje specyficzne dla emocji będą spójne, ponieważ różnice między sygnałami z różnych modalności nie będą już miały wpływu na wynik.

figure-protocol-29   (14)

Poprzez wymuszenie semantycznego dopasowania informacji emocjonalnych, cel ten minimalizuje rozbieżności między modalnościami i zapewnia, że percepcja emocji pozostaje spójna, niezależnie od modalności wykorzystanej do jej wyrażenia. W rezultacie powstaje spójna i afektywna przestrzeń reprezentacji poprzez rzutowanie wskazówek emocjonalnych uzyskanych z sygnałów mowy, ekspresji twarzy oraz treści lingwistycznej.

Wpływ na fuzję multimodalną

Fuzja międzymodalna staje się bardziej efektywna, gdy wprowadza się spójność emocjonalną pomiędzy modalnościami. Mechanizmy fuzji nie muszą już rekompensować znaczących luk w reprezentacji międzymodalnej, ponieważ osadzenia specyficzne dla emocji są wyrównane w wspólnej przestrzeni latentnej. Zfuzowana reprezentacja emocji jest zdefiniowana w następujący sposób:

figure-protocol-30  (15)

Gdzie αm oznacza wagę uwagi przypisaną do modalności m. Ważona fuzja staje się bardziej stabilna i zrozumiała, gdy reprezentacje specyficzne dla emocji są spójne, ponieważ wynik fuzji wykazuje komplementarne dowody emocjonalne zamiast sprzecznych sygnałów z różnych modalności.

Z matematycznego punktu widzenia, zmniejszenie figure-protocol-31 wariancji pomiędzy różnymi typami reprezentacji specyficznych dla emocji w odniesieniu do figure-protocol-32 jest równoważne:

figure-protocol-33   (16)

gdzie figure-protocol-34 reprezentuje średnią ekspresję emocjonalną. Zredukowana wariancja sprawia, że modalności wejściowe są ważone zgodnie z ich precyzyjnym znaczeniem emocjonalnym, a nie szumem modalności, co zapewnia lepszą zbieżność sieci i dokładniejszą ocenę uwagi.

Ostatecznym celem nauczania w przypadku wizualizacji rozplątanych emocji jest połączenie fragmentacji, rekonstrukcji oraz jednolitości emocjonalnej:

figure-protocol-35   (17)

dwie hiperparametry, λ1 i λ2, kontrolują relację między niezawodnością emocji międzymodalnych a dysocjacją. Zaproponowany model pozyskuje niezmiennicze względem modalności, interpretowalne i możliwe do fuzji reprezentacje emocjonalne, aby to osiągnąć, kładąc nacisk na zapewnienie solidnych podstaw dla późniejszej fuzji opartej na grafach i reprezentacji na poziomie cech w projektowaniu inteligentnych interfejsów.

Fuzja uwagi międzymodalnej oparta na grafach

Do symulacji szczegółowych relacji emocjonalnych między modalnościami wykorzystano grafową sieć uwagi między-modalnej. Aby ułatwić przepływ informacji pomiędzy modalnościami, zbudowano w pełni połączony graf multimodalny, w którym każde osadzenie specyficzne dla danej modalności (tekstowe, audio i wizualne) reprezentowano jako węzeł grafu. Relacje między modalnościami posłużyły do stworzenia macierzy sąsiedztwa grafu, która została następnie udoskonalona za pomocą uczącej się metody uwagi. Wspólną przestrzeń latentną utworzono poprzez konkatenację i projekcję wyjść z kilku głowic uwagi. Następnie, poprzez agregację reprezentacji węzłów z wykorzystaniem poolingu ważonego uwagą, uzyskano ujednoliconą multimodalną reprezentację emocji. Ta zfuzjonowana reprezentacja została przekazana do modułów predykcji i wizualizacji w celu analizy świadomej interakcji oraz rozpoznawania emocji. Moduł fuzji grafowej posiadał wymiar reprezentacji ukrytej wynoszący 256 oraz dwie warstwy uwagi grafowej, z których każda zawierała osiem głowic uwagi. Aby określić względne znaczenie sąsiednich modalności, obliczono współczynniki uwagi między połączonymi węzłami i wystandaryzowano je za pomocą funkcji softmax. Po każdej warstwie uwagi grafowej zastosowano normalizację warstwową, połączenia rezydualne oraz współczynnik dropout wynoszący 0.2 w celu zwiększenia stabilności treningu i redukcji przeuczenia. Po konkatenacji i projekcji wyjść z kilku głowic uwagi na wspólną przestrzeń latentną, reprezentacje węzłów połączono w jedno multimodalne osadzenie emocji przy użyciu poolingu ważonego uwagą. Następnie zfuzjonowana reprezentacja została wykorzystana do wielowidokowego mapowania wizualnego i predykcji emocji.

Różnorodne interakcje międzymodalne zostały zarejestrowane z wykorzystaniem wielogłowicowej uwagi grafowej. Do normalizacji współczynników uwagi między połączonymi węzłami dla każdego węzła zastosowano funkcję softmax. Aby zwiększyć stabilność treningu i uniknąć przeuczenia, za skumulowanymi warstwami uwagi grafowej w module fuzji grafów zastosowano połączenia rezydualne, normalizację warstwową oraz regularyzację dropout.

Przyjmijmy, że wyrażenia figure-protocol-36 reprezentują odpowiednio reprezentacje odpowiadające konkretnym emocjom zgromadzonym przez modalności wizualną, dźwiękową i tekstową; każdy komponent znajduje się w wspólnej przestrzeni utajonej figure-protocol-37. Modele dla węzłów modalności wykorzystują notację dla grafu figure-protocol-38, w którym węzły zbioru figure-protocol-39 odpowiadają samym trzem węzłom modalności, aby jawnie wzmocnić zależności emocjonalne współdzielone pomiędzy różnymi reprezentacjami modalności.

Po przypisaniu wektora cech specyficznego dla danej emocji do każdego węzła w grafie, otrzymujemy:

figure-protocol-40   (18)

W przeciwieństwie do tradycyjnych metod fuzji, które wykorzystują określone z góry lub stałe wagi fuzji, proponowana metoda uczy się adaptacyjnych wag krawędzi w oparciu o ich istotność i współzależności, zarówno między kanałami, jak i między sytuacjami emocjonalnymi.

Do fuzji międzymodalnej wykorzystano grafową sieć uwagi (GAT). Współczynnik uwagi jest obliczany dla każdego węzła i oraz jego węzłów sąsiednich, tj. węzła j:

figure-protocol-41   (19)

Efekt emocjonalny przejścia z trybu j do modalności i jest mierzony za pomocą znormalizowanych wag αij.

Następnie wygląd połączony każdego węzła modalności jest obliczany jako ważona grupa jego sąsiadów:

figure-protocol-42   (20)

gdzie funkcja aktywacji figure-protocol-43 jest nieliniowa. Ostatecznie, zaktualizowane cechy każdego węzła są łączone w celu uzyskania globalnej, zintegrowanej reprezentacji emocji:

figure-protocol-44   (21)

Jest to użyteczna technika w zakresie interpretowalnego modelowania emocji i późniejszego mapowania wizualnego, ponieważ pozwala ona na uchwycenie komplementarnych informacji z różnych modalności przy jednoczesnym zachowaniu złożonych zależności między modalnościami.

Algorytm 1 (Plik uzupełniający 1) przedstawia ogólny schemat przeprowadzania fuzji międzymodalnej opartej na grafach. Początkowo tworzony jest graf, w którym cechy specyficzne dla emocji są powiązane z każdą z modalności: wizualną, dźwiękową i tekstową. Następnie oblicza się wyniki uwagi (attention scores) dla par węzłów każdego grafu, które reprezentują kombinację zależności emocjonalnych. Wyniki uwagi są następnie normalizowane, aby wskazać względny wkład każdej modalności w określony kontekst emocjonalny, co umożliwia naukę wag uwagi. W ostatnim etapie ogólna reprezentacja wektorowa (embedding) emocji jest generowana poprzez agregację cech powiązanych z węzłami grafu. W tym ujęciu ogólna fuzja cech multimodalnych powiązanych z określonymi emocjami, realizowana przez ten algorytm, wykazuje potencjał w zakresie adaptacyjności, interpretowalności i inteligencji kontekstowej.

Rysunek 2 przedstawia strukturę i zasadę działania proponowanej sieci uwagi między-modalnej (cross-modal attention network) do multimodalnej fuzji sentymentu. Embedingi specyficzne dla emocji, wyprowadzone niezależnie dla modalności tekstowej, słuchowej i wideo, są początkowo przekazywane przez mechanizmy uwagi na poziomie modalności, które uczą się względnego znaczenia informacji lingwistycznych, wokalnych i mimicznych dla danego kontekstu emocjonalnego. Reprezentacje modalności zważone przez mechanizm uwagi są następnie łączone w celu utworzenia ujednoliconego embeddingu emocji, w którym macierz uwagi rejestruje zależności między-modalne oraz siłę interakcji. Macierz uwagi wyuczona przez sieć dynamicznie moduluje wkład poszczególnych modalności, umożliwiając skupienie się na najsilniejszej modalności instrukcyjnej przy jednoczesnym ignorowaniu zakłóceń i mniej informatywnych danych. Połączona reprezentacja emocji umożliwia dokładne rozpoznawanie emocji oraz szczegółową analizę stanów emocjonalnych, takich jak neutralny, czułość (embrace) i niepokój.

Moduł mapowania wizualnego

Z pomocą sekcji mapowania wizualnego, stworzonej specjalnie w tym celu, inteligentny projektant interakcji może przekształcić ujednoliconą reprezentację stanu emocjonalnego w formę wizualną, która jest zrozumiała i łatwa w odbiorze po procesie fuzji międzymodalnej, w oparciu o graf.

Aby ułatwić zrozumienie utajonych reprezentacji emocjonalnych, w celu wizualizacji wyuczonych multimodalnych osadzeń emocji zastosowano techniki redukcji wymiarowości. Po zredukowaniu wymiarowości cech przy zachowaniu większości wariancji za pomocą analizy głównych składowych (PCA), osadzenia rzutowano na przestrzeń dwuwymiarową za pomocą algorytmu t-distributed Stochastic Neighbor Embedding (t-SNE). Dla t-SNE przyjęto wartość perplexity równą 30, współczynnik uczenia 200 oraz 1000 iteracji optymalizacji. Za pomocą uzyskanych rzutów zwizualizowano klastry specyficzne dla danych emocji oraz relacje między modalnościami. Do utworzenia map ciepła uwagi wykorzystano znormalizowane wagi uwagi między-modalnej uzyskane z sieci uwagi opartej na grafach. Mapy te przedstawiają relatywny wkład modalności tekstowej, audio i wizualnej podczas predykcji emocji. Wyuczone współczynniki uwagi posłużyły jako wagi krawędzi do stworzenia grafów interakcji między-modalnych, co umożliwiło wizualną analizę relacji między modalnościami oraz przepływu informacji w ramach struktury fuzji. Aby zbadać czasową dynamikę emocjonalną, stworzono wykresy trajektorii emocji poprzez monitorowanie rozwoju utajonych osadzeń emocji w kolejnych wypowiedziach. Trajektorie te rzucają światło na to, jak stany emocjonalne i wkłady poszczególnych modalności ewoluują w czasie. Do stworzenia wszystkich wizualizacji wykorzystano dwa pakiety języka Python: Matplotlib oraz Scikit-learn. W celu oceny interpretowalności, tworzenia klastrów, wkładu modalności oraz czasowej dynamiki emocji przeprowadzono analizy jakościowe wizualizacji osadzeń, grafów interakcji i map ciepła uwagi.

Niech zmienna figure-protocol-45 reprezentuje scaloną reprezentację stanu emocjonalnego uzyskaną za pomocą funkcji grafowej sieci uwagi (graph attention network). W przeciwieństwie do wizualizacji wykresów stanu emocjonalnego na poziomie wyjściowym, głównym celem modułu jest przekształcenie reprezentacji stanu emocjonalnego oraz odpowiadających im wag mechanizmu uwagi w zrozumiałą formę wizualną.

Wykorzystując wyuczoną wartość αji, tworzona jest mapa ciepła uwagi w celu wizualnej analizy wkładu każdej modalności. Następnie wagi uwagi wejściowej są sumowane, aby określić złożony wskaźnik istotności dla każdej modalności:

figure-protocol-46    (22)

gdzie si reprezentuje względny wkład emocjonalny modalności I. Aby pomóc w stworzeniu mapy ciepła uwagi, uzyskane wartości są normalizowane i mapowane na mapę kolorów, która ułatwia użytkownikowi identyfikację dominującej modalności w różnych krokach czasowych lub stanach interaktywnych. Poprzez różne modalności wejściowe – wizualne, słuchowe lub tekstowe – taki interfejs pomaga użytkownikowi zrozumieć sposób działania mechanizmu uwagi systemu.

Wyuczony graf jest modelowany specjalnie jako „ważony graf interakcji”, aby przedstawić międzymodalną zależność emocji ludzkich. Sama modalność jest reprezentowana przez każdy węzeł w grafie, a siła interakcji związanych z emocjami ludzkimi jest reprezentowana przez wagi w formie αji na krawędziach, które je łączą. Powyższy graf ważony ilustruje intensywność interakcji emocjonalnych człowieka. Definicja i oraz j jest następująca:

figure-protocol-47   (23)

Grubość linii lub przezroczystość wizualizacji wykresu są odpowiednio wyświetlane dzięki tym wagom. Ułatwia to zrozumienie sposobu, w jaki oddziałują na siebie poszczególne modalności. Dzięki grafom interakcji między modalnościami projektant może lepiej zrozumieć, jak wskaźniki emocjonalne oddziałują na siebie podczas procesu fuzji.

Połączone osadzenia emocji figure-protocol-48 w różnych krokach czasowych są redukowane do przestrzeni o niższym wymiarze za pomocą algorytmu redukcji wymiarowości, takiego jak PCA lub t-SNE, w celu przedstawienia ewolucji emocji w czasie:

figure-protocol-49   (24)

gdzie funkcja projekcji jest reprezentowana przez figure-protocol-50. Pojawienie się dwu- i trójwymiarowych trajektorii emocji, które ukazują przejścia, intensywność oraz stabilność emocji w interakcjach, można interpretować jako intuicyjny obraz ewolucji stanów emocjonalnych w czasie. Aspekty te mogą być wykorzystane w inteligentnych interakcjach, procesach podejmowania decyzji oraz monitorowaniu w czasie rzeczywistym.

W przeciwieństwie do konwencjonalnych systemów rozpoznawania emocji, które jedynie przypisują dane do konkretnych klas lub wyników, system ten koncentruje się na demonstrowaniu sposobu, w jaki formowane są w nim ludzkie emocje. Ujawnia on swój proces podejmowania decyzji poprzez oferowanie wizualizacji cech pośrednich, w tym czynników wagowych, interakcji między modelami oraz odpowiadających im ścieżek. Pozwala to użytkownikowi zrozumieć, w jaki sposób każdy czynnik – wizualny, wokalny lub lingwistyczny – wpływa na generowanie odpowiedzi na ludzkie emocje.

Mapowanie emocji na zrozumiałe formy poprzez reprezentacje wizualne może zatem wypełnić lukę między analizą emocji z wykorzystaniem metod głębokiego uczenia a ich integracją w projektowaniu inteligentnych interfejsów. Dane zebrane z obu tych podejść mogą następnie zostać wykorzystane do tworzenia bardziej precyzyjnych interfejsów użytkownika. W ten sposób sugerowane podejście może dostarczyć projektantom interakcji kluczowych informacji niezbędnych do tworzenia bardziej precyzyjnych interfejsów użytkownika. Innymi słowy, rozumienie emocji staje się bardzo aktywną częścią projektowania interakcji. Dokładność może wzrosnąć tylko wtedy, gdy rozumienie emocji zostanie aktywnie włączone do projektowania interakcji.

Moduł mapowania wizualnego umożliwia wyjaśnialność na kilka powiązanych ze sobą, lecz odmiennych sposobów: wyjaśnialność na poziomie cech ujawnia podstawowe reprezentacje emocji stworzone przez DNN, co pozwala nam zrozumieć semantykę wykorzystywaną do opisania każdej cechy związanej z emocjami; wyjaśnialność na poziomie modalności wykorzystuje dane z grafów interakcji oraz map ciepła uwagi wizualnej, aby opisać, w jaki sposób każda modalność – wizualna, dźwiękowa lub tekstowa – przyczynia się do decyzji podejmowanych w celu wyrażenia emocji; i wreszcie, trajektorie wynikające z osadzania emocji pozwalają nam zrozumieć, jak każda modalność wizualna i tekstowa zmienia się w czasie z perspektywy dynamicznej interakcji. Prosimy o zapoznanie się z Algorytmem 2 (Supplementary File 1).

Połączone multimodalne cechy emocjonalne są mapowane na znaczące wizualnie reprezentacje w celu projektowania inteligentnej interakcji z wykorzystaniem zaproponowanego Algorytmu 2 mapowania wizualnego. Wagom multimodalnej uwagi opartej na grafach służy do ilościowego określenia różnic między wejściowymi elementami wizualnymi, dźwiękowymi i tekstowymi w każdym kroku czasowym. Różnice te są następnie mapowane na reprezentacje wizualne, aby za pomocą elementów mapy ciepła wyróżnić główne źródła wpływające na emocje. Aby zapewnić wnikladący wgląd w interakcję między elementami wejściowymi oraz przekazać ewolucję emocjonalną generowaną przez multimodalne elementy wejściowe, obliczane są następnie parami siły interakcji w celu stworzenia wag interakcji multimodalnych. Jednocześnie widok ewolucji emocjonalnej jest tworzony poprzez mapowanie połączonych elementów emocjonalnych zbieranych w czasie do przestrzeni niskowymiarowej, aby uzyskać ciągłą ewolucję elementów emocjonalnych.

Przewidywanie emocji i informacja zwrotna z interakcji

Wynik zintegrowanej reprezentacji emocji, przedstawiony jako figure-protocol-51, jest następnie wykorzystywany jako funkcja zarówno dla informacji zwrotnej z interakcji, jak i dla predykcji emocji. Ponadto predykcja emocji jest opisana jako model wielozadaniowy, obejmujący zadanie regresji dla rozpoznawania ciągłej intensywności emocji oraz zadanie klasyfikacji dla rozpoznawania dyskretnych emocji. Do rozpoznawania dyskretnych emocji stosowany jest następujący model klasyfikacji oparty na funkcji softmax:

figure-protocol-52   (25)

gdzie figure-protocol-53 reprezentuje oczekiwane prawdopodobieństwa klas emocji, a Wc  oraz bc są parametrami do nauczenia. W celu wzmocnienia celu klasyfikacji wykorzystuje się funkcję straty entropii krzyżowej:

figure-protocol-54  (26)

gdzie yk to etykieta prawdy obiektywnej (ground-truth), a K to liczba klas emocji. Równolegle wykorzystuje się gałąź regresyjną do szacowania intensywności emocji, generując przewidywania dla różnych ciągłych atrybutów afektywnych, w tym walencji i pobudzenia (arousal). Przyjmij następującą definicję:

figure-protocol-55   (27)

gdzie oczekiwany wynik intensywności emocji jest określony przez figure-protocol-56. W celu usprawnienia zadania regresji zastosowano funkcję straty średniego błędu kwadratowego:

figure-protocol-57   (28)

Ogólnie oba zadania są połączone w celu predykcji:

figure-protocol-58   (29)

gdzie cele regresji i klasyfikacji są równoważone przez λ. Sugeruje to dynamiczną modyfikację modułu wizualizacji na podstawie zidentyfikowanego stanu emocjonalnego, aby umożliwić ten rodzaj sprzężenia zwrotnego uwzględniającego interakcję. Kontekst interakcji w danym czasie t jest reprezentowany przez ct. Odpowiedź modułu wizualizacji jest dostarczana przez:

figure-protocol-59    (30)

gdzie funkcja adaptacji wizualizacji jest reprezentowana przez figure-protocol-60. Umożliwia to dostosowywanie map ciepła modalności, grafów interakcji oraz trajektorii emocji w czasie rzeczywistym, w oparciu o przewidywane zmiany i emocje. Świadczy to o tym, że system zapewnia istotne wsparcie dla informacji zwrotnej, poza wysoką skutecznością w przewidywaniu stanu emocjonalnego.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsza praca waliduje proponowany framework mapowania wizualnego dla multimodalnych cech emocji pod kątem zarówno interpretowalności uwzględniającej interakcje, jak i wydajności predykcyjnej, z wykorzystaniem dwóch zestawów danych referencyjnych: CH-SIMS oraz CMU-MOSEI. Zgodnie z wynikami eksperymentalnymi, sugerowane podejście konsekwentnie osiąga lepsze wyniki niż obecne techniki multimodalnego rozpoznawania emocji w obrębie różnych metryk, w tym korelacji, dokładności, wskaźnika F1 oraz średniego błędu absolutnego (MAE). Rozdzielona reprezentacja emocji, mechanizm fuzji między-modalnej oparty na grafach oraz strategia uczenia głębokich reprezentacji end-to-end przyczyniają się do tej poprawy, umożliwiając bardziej stabilne i semantycznie spójne modelowanie emocji. Sugerowane podejście zapewnia bogatsze wglądy na poziomie cech dzięki mapowaniu wizualnemu, co wykracza poza zyski ilościowe i ułatwia zrozumienie wkładu poszczególnych modalności oraz dynamiki emocjonalnej. Pomimo różnic w języku, ekspresji kulturowej i wielkości zbiorów danych, wspomniany wzrost wydajności jest konsekwentnie obserwowany w obu zestawach danych, co demonstruje silną zdolność generalizacji proponowanego frameworku.

W proponowanej pracy wykorzystano publiczne zbiory danych multimodalnych dla emocji CH-SIMS oraz CMU-MOSEI. Zbiór danych CH-SIMS obejmuje 2281 klipów wideo z filmów, seriali telewizyjnych i programów rozrywkowych. W CH-SIMS dostępne są zsynchronizowane dane tekstowe, audio i wizualne. Etykiety sentymentu, zarówno unimodalne, jak i multimodalne, są klasyfikowane w kategoriach: pozytywna, neutralna i negatywna. Duży angielski zbiór danych multimodalnych znany jako CMU-MOSEI zawiera około 23 453 adnotowanych klipów wideo z udziałem ponad 1000 mówców omawiających szeroki zakres tematów. Zbiór ten zawiera zarówno ciągłe adnotacje natężenia emocji, takie jak walencja i pobudzenie, jak i kategoryczne etykiety emocji. Przeprowadzenie eksperymentów na tych dwóch zbiorach danych z wykorzystaniem sugerowanego modelu, obejmujących różnorodne warunki językowe, kulturowe i emocjonalne, wzmacnia jego odporność i niezawodność. Tabela 2 przedstawia szczegóły środowiska symulacyjnego.

Główne ustawienia eksperymentalne i implementacyjne wykorzystane do oceny sugerowanego modelu zostały podsumowane w tym środowisku symulacyjnym. Aby zapewnić jednolity wymiar cech w modalnościach tekstowych, dźwiękowych i wizualnych, w sposób ujednolicony zastosowano kodery oparte na transformatorach. Wykorzystano mechanizm uwagi oparty na grafach do fuzji międzymodalnej, co umożliwia adaptacyjne uczenie się zależności międzymodalnych w odniesieniu do stanów emocjonalnych.

Sugerowany schemat wyodrębnia reprezentacje tekstowe, słuchowe i wizualne przy użyciu koderów modalności opartych na transformatorach. Warstwy w pełni połączone z aktywacją ReLU rzutują osadzenia specyficzne dla danej modalności do wspólnej przestrzeni latentnej. Następnie wykorzystuje się oddzielne kodery specyficzne dla emocji i modalności, z których każdy posiada dwie warstwy w pełni połączone oraz nieliniową aktywację i normalizację, aby wyuczyć rozdzielone reprezentacje. Reprezentacje latentne są rzutowane do 256-wymiarowej przestrzeni cech, w której informacje dla każdej modalności i emocji są uczone osobno. W celu zachowania informacji o modalności i promowania efektywnego rozdzielenia stosuje się dekodery rekonstrukcyjne. Przed fuzją multimodalną i predykcją, grafowy moduł uwagi międzymodalnej modeluje zależności emocjonalne między modalnościami z wykorzystaniem reprezentacji latentnych. Sieć została wytrenowana przy użyciu optymalizatora Adam z początkową szybkością uczenia 1 × 10⁻4 i rozmiarem partii 32. W celu zapobiegania przeuczeniu zastosowano mechanizm wczesnego zatrzymania (early stopping) w oparciu o stratę walidacyjną. Całkowita funkcja celu składała się ze strat klasyfikacji, rekonstrukcji i spójności reprezentacji, z których każda była ważona przez regulowane hiperparametry. Trening modelu trwał do 100 epok, a do testowania zachowano model, który osiągnął najlepsze wyniki na zbiorze walidacyjnym.

Zaproponowany model oceniono za pomocą metryk klasyfikacji, w tym dokładności (Accuracy), precyzji (Precision), czułości (Recall) oraz miary F1 (F1-score), wraz z metrykami regresji, takimi jak średni błąd bezwzględny (MAE). Precyzję, czułość i miarę F1 obliczono z wykorzystaniem uśredniania makro (macro-averaging), aby uwzględnić niezrównoważenie klas w kategoriach emocji. W eksperymentach klasyfikacyjnych jako klasy referencyjne (ground-truth) wykorzystano zdefiniowane etykiety emocji/sentymentu dostarczone przez zbiory danych CH-SIMS oraz CMU-MOSEI. W przypadku przewidywania sentymentu opartego na regresji, zmiennymi celu były ciągłe wyniki intensywności sentymentu zawarte w zbiorach danych. Wygenerowano macierze pomyłek, aby przeanalizować wydajność predykcji dla poszczególnych klas oraz wzorce błędnej klasyfikacji przy przedziale ufności 95%. Aby zapewnić powtarzalność wyników, każdy eksperyment powtórzono 5 razy, stosując różne inicjalizacje losowe, a raportowane wyniki stanowią wartość średnią. ±± odchylenie standardowe wydajności we wszystkich uruchomieniach. Istotność statystyczną oceniono za pomocą odpowiednich procedur testowania hipotez, a w stosownych przypadkach obliczono przedziały ufności. Czas uczenia mierzono jako całkowity czas upływający, wymagany do zbieżności modelu na określonej platformie sprzętowej.

Zaproponowaną metodę można porównać z szeregiem reprezentatywnych modeli bazowych, w tym z modelami wczesnej fuzji (early fusion) i późnej fuzji (late fusion). Obejmują one TFN, metody oparte na LSTM, niskorandowe modele fuzji multimodalnej, adaptacyjne transformery multimodalne oraz nowe architektury oparte na uwadze krzyżowej (cross-modal attention). Modele bazowe te odzwierciedlają najnowocześniejsze techniki, które koncentrują się przede wszystkim na poprawie dokładności rozpoznawania emocji poprzez różne metody fuzji. W przeciwieństwie do tych metod, które skupiają się głównie na predykcji na poziomie wyjściowym, zaproponowany framework wykorzystuje uczenie reprezentacji rozplątanej (disentangled representation learning) oraz fuzję opartą na grafach, co poprawia interpretowalność i świadomość interakcji. Przykładami modeli bazowych zaimplementowanych przy użyciu oficjalnych repozytoriów lub publicznie dostępnych implementacji referencyjnych są fuzja LSTM, TFN, niskorandowa fuzja multimodalna (LMF), Adaptive-Graph oraz techniki oparte na transformerach. W przypadkach, gdy były one dostępne, zastosowano oryginalne ustawienia hiperparametrów autorów. Wszystkie ponownie wytrenowane modele bazowe oceniono przy użyciu tych samych podziałów zbiorów danych, technik preprocessingu, parametrów optymalizacji i kryteriów oceny, aby zapewnić rzetelne porównanie. Tabele porównawcze wyraźnie wskazują odpowiednie referencje dla danych pochodzących bezpośrednio z wcześniejszych publikacji.

Dokładność

Dokładność klasyfikacji dyskretnych emocji została zmierzona zarówno dla zbioru CH-SIMS, jak i CMU-MOSEI; jednak trend dokładności różni się w zależności od charakterystyki obu zbiorów danych. Ponieważ CH-SIMS jest średniej wielkości zbiorem danych z równą liczbą kategorii sentymentu i starannie przetworzonymi klipami wideo, jego dokładność jest wysoka, co sugeruje, że model potrafi wychwycić subtelne multimodalne informacje emocjonalne przy niewielkim poziomie szumów. Z kolei dokładna klasyfikacja emocji jest trudniejsza w przypadku CMU-MOSEI, ponieważ jest to wielkoskalowy zbiór danych z osobami mówiącymi pochodzącymi z różnych środowisk. Dlatego, poza zdolnością modelu do identyfikacji sentymentu, dokładność na zbiorze danych CMU-MOSEI wskazuje na jego zdolność do generalizacji i odporność na różnorodne scenariusze interakcji. Poprawa dokładności w obu zbiorach danych pokazuje, że zaproponowane podejście dobrze generalizuje się w odniesieniu do zbiorów danych o różnych językach, rozmiarach i poziomach złożoności emocjonalnej.

Dokładność klasyfikacji zaproponowanego podejścia oraz innych powszechnych metod bazowych w zestawach danych CH-SIMS i CMU-MOSEI przedstawiono w Tabeli 3. Jak wynika z Tabeli 3, zaproponowany model osiągnął najwyższą dokładność zarówno w zbiorze CH-SIMS, jak i CMU-MOSEI, przewyższając najsilniejszą metodę bazową (Adaptive-Graph) odpowiednio o około 3,3% i 3,1 punktu procentowego. Niższe wartości odchylenia standardowego wskazują również na większą stabilność w powtórnych próbach eksperymentalnych. Tradycyjne podejścia oparte na fuzji LSTM wykazują niższą dokładność ze względu na ograniczoną zdolność do wychwytywania złożonych relacji międzymodalnych. TFN oraz LMF poprawiają dokładność klasyfikacji poprzez modelowanie relacji międzymodalnych.

Wskaźnik F1

W problemach klasyfikacji emocji równowaga między czułością (recall) a precyzją (precision) jest mierzona za pomocą wskaźnika F1-score. Jest on zatem bardziej odpowiedni dla multimodalnych zbiorów danych do klasyfikacji emocji, w których prawdopodobne jest wystąpienie nierównej liczby klas. W zadaniach klasyfikacji emocji równowaga między czułością a precyzją jest mierzona za pomocą wskaźnika F1-score. Ponieważ oczekuje się, że multimodalne zbiory danych do klasyfikacji emocji będą niezbalansowane, F1-score jest bardziej właściwy. Im lepiej model wykrywa klasy emocji, tym wyższy jest wskaźnik F1-score.

Rysunek 3 przedstawia ocenę wskaźnika F1-score zaproponowanej techniki w porównaniu z metodami bazowymi na zbiorze danych CH-SIMS. Najniższy wskaźnik F1-score ujawnia ograniczoną zdolność bazowego modelu opartego na LSTM do modelowania złożonych, między-modalnych relacji emocjonalnych. Wskaźniki F1-score uzyskane przez oceniane techniki na zbiorze danych CH-SIMS zestawiono na Rysunku 3. Jak pokazano, bardziej zaawansowane struktury oparte na grafach i transformerach rutynowo przewyższają konwencjonalne metody oparte na fuzji. Najniższy wynik uzyskał model LSTM (F1-score 0,71), a następnie TFN (0,74) i LMF (0,76). Zastosowanie Adaptive-Graph podniosło wskaźnik F1-score do 0,79, co dowodzi wartości modelowania połączeń między-modalnych. Zaproponowana architektura, osiągając F1-score 0,82, przewyższyła Adaptive-Graph o 3,8%, LMF o 7,9%, TFN o 10,8% oraz LSTM o 15,5%. Wyniki te pokazują, że zaproponowany między-modalny mechanizm uwagi oparty na grafach oraz uczenie rozdzielonych reprezentacji (disentangled representation learning) skuteczniej przechwytują komplementarne informacje emocjonalne z modalności tekstowej, audio i wizualnej, co prowadzi do lepszych wyników klasyfikacji.

Względne trendy są spójne, mimo że wszystkie metody wykazują niewielki spadek wskaźnika F1-score w porównaniu z CH-SIMS, co przedstawiono na Rysunku 4. Wyniki wskazują na stałą poprawę wydajności, przechodząc od tradycyjnych metod fuzji do strategii multimodalnego uczenia opartego na grafach. Modele z najniższym wskaźnikiem F1-score to LSTM (0,69), TFN (0,72) oraz LMF (0,74). Wydajność modelu Adaptive-Graph wzrosła do 0,77, co pokazuje, jak skutecznie można modelować połączenia międzymodalne. Zaproponowany framework przewyższył wszystkie pozostałe podejścia, osiągając najwyższy wskaźnik F1-score wynoszący 0,80. Poprawa w stosunku do najsilniejszego modelu bazowego, Adaptive-Graph, dowodzi wkładu zaproponowanego uczenia rozplątanych reprezentacji emocji (disentangled emotion representation learning) oraz grafowego mechanizmu uwagi międzymodalnej w wychwytywanie komplementarnych wskazówek emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej. Wyniki te pokazują, że zaproponowany framework do multimodalnego rozpoznawania emocji jest niezawodny i efektywny. Zaproponowane podejście wykazuje znaczną poprawę zarówno w stosunku do metody opartej na grafach, jak i konwencjonalnej metody fuzji, co dodatkowo potwierdza silną zdolność generalizacji tej metody. Poprawa wskaźnika F1-score na zbiorze danych CMU-MOSEI dowodzi, że proponowane podejście pozwala osiągnąć zrównoważoną wydajność klasyfikacji emocji nawet w zaszumionych i zróżnicowanych środowiskach.

Precyzja

W inteligentnych systemach komunikacyjnych precyzja ma kluczowe znaczenie, ponieważ błędny sygnał emocjonalny może pogorszyć doświadczenia użytkownika. Stosunek dokładnie przewidzianych instancji konkretnej emocji do całkowitej liczby przypadków zaklasyfikowanych jako ta emocja określa się mianem precyzji. Ponieważ rozplątane reprezentacje emocji są mniej zaszumione i mniej podatne na błędną klasyfikację w danej modalności, proponowany model osiąga lepsze wyniki niż modele bazowe w zbiorze danych CH-SIMS, co przedstawiono na Rysunku 5.

Dokładność osiągnięta przez kilka multimodalnych technik rozpoznawania emocji na zbiorach danych CH-SIMS i CMU-MOSEI została zestawiona na Rysunku 5. Wraz z przejściem modeli od tradycyjnych technik opartych na fuzji do bardziej zaawansowanych architektur opartych na grafach, precyzja sukcesywnie wzrasta. Zaproponowany model osiągnął maksymalną precyzję na poziomie 0.82 na zbiorze danych CH-SIMS, przy czym precyzja wzrosła z 0.71 dla LSTM do 0.74, 0.76 i 0.79 odpowiednio dla TFN, LMF i Adaptive-Graph. Na zbiorze danych CMU-MOSEI precyzja wzrosła z 0.69 dla LSTM do 0.72, 0.74 i 0.77 odpowiednio dla TFN, LMF i Adaptive-Graph. Zaproponowane podejście osiągnęło najwyższą precyzję na poziomie 0.80. W porównaniu z najsilniejszym modelem bazowym (Adaptive-Graph), zaproponowany model zwiększył precyzję o około 3.8% na zbiorze CH-SIMS i o 3.9% na zbiorze CMU-MOSEI. Wyniki te pokazują, że dzięki przechwytywaniu uzupełniających informacji emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej, zaproponowana metoda uczenia reprezentacji rozplecionych (disentangled representation learning) oraz mechanizm między-modalnej uwagi opartej na grafach skutecznie redukuje liczbę błędnych predykcji pozytywnych. Wpływ nieistotnej modalności jest dodatkowo ograniczany przez między-modalną uwagę opartą na grafach. Większa różnorodność mówców i ekspresji językowych w korpusie CMU-MOSEI powoduje nieznaczny spadek precyzji we wszystkich modelach.

Czułość

W zadaniach rozpoznawania emocji kluczowe znaczenie ma pełność (recall) – miara zdolności modelu do właściwej kategoryzacji instancji emocjonalnych należących do określonej klasy – ponieważ brak informacji emocjonalnych może negatywnie wpłynąć na jakość interakcji. Wyższa wartość pełności sugeruje, że model identyfikuje mniej wyników fałszywie ujemnych i więcej rzeczywistych ekspresji emocjonalnych. Pełność można uznać za miarę efektywności, z jaką informacje emocjonalne są wyodrębniane z tekstowych, dźwiękowych i wizualnych modalności w kontekście multimodalnej analizy emocji.

Przewaga proponowanej techniki nad podejściami bazowymi w zbiorach danych CH-SIMS i CMU-MOSEI jest przedstawiona w porównaniu czułości (recall) na Rysunku 6. Wraz z ewolucją modeli od konwencjonalnych metod opartych na fuzji do bardziej wyrafinowanych multimodalnych struktur opartych na grafach, wyniki konsekwentnie wykazują wzrost czułości. Czułość w zbiorze danych CH-SIMS wzrosła z 0,70 dla LSTM do 0,73, 0,75 i 0,78 odpowiednio dla TFN, LMF i Adaptive-Graph; maksymalną czułość na poziomie 0,82 osiągnięto dzięki sugerowanemu frameworkowi. Sugerowane podejście osiągnęło najlepszą czułość wynoszącą 0,80 w zbiorze danych CMU-MOSEI, gdzie czułość wzrosła z 0,68 dla LSTM do 0,71, 0,73 i 0,76 odpowiednio dla TFN, LMF i Adaptive-Graph. Sugerowany framework przyniósł względną poprawę o około 5,1% w CH-SIMS i 5,3% w CMU-MOSEI w porównaniu z najsilniejszym modelem bazowym (Adaptive-Graph). Wyniki te pokazują, że dzięki wychwytywaniu komplementarnych wskazówek emocjonalnych w modalnościach tekstowej, akustycznej i wizualnej, proponowane uczenie reprezentacji rozplątanej (disentangled representation learning) oraz mechanizm uwagi między-modalnej oparty na grafach skutecznie redukują liczbę wyników fałszywie ujemnych, poprawiając tym samym identyfikację klas emocji w obu zbiorach danych. Ponieważ tradycyjne metody mają ograniczoną zdolność modelowania złożonych relacji między-modalnych, wykazują one tendencję do niższych wartości czułości. Poprzez bardziej jawne modelowanie relacji między modalnościami, TFN i LMF osiągają umiarkowane zyski. Metoda Adaptive-Graph jeszcze bardziej poprawiła czułość poprzez symulowanie ustrukturyzowanych relacji między modalnościami. W obu zbiorach danych proponowana metoda osiąga najwyższą czułość, co wskazuje na jej lepszą zdolność do wykrywania instancji emocjonalnych w różnych scenariuszach interakcji. Poprawa ta jest bardziej widoczna w wielkoskalowym zbiorze danych CMU-MOSEI, co demonstruje odporność i zdolność do generalizacji proponowanego frameworka.

Średni błąd bezwzględny (MAE)

Średni błąd bezwzględny (MAE) jest wykorzystywany do oceny wydajności zadań związanych z ciągłą predykcją intensywności emocji, takich jak predykcja walencji lub pobudzenia. W przeciwieństwie do dokładności, MAE lepiej odzwierciedla bliskość przewidywanej intensywności emocjonalnej względem rzeczywistego stanu emocjonalnego. Z tego powodu MAE jest bardziej odpowiedni dla zbiorów danych takich jak CH-SIMS i CMU-MOSEI, które posiadają ciągłe etykiety afektywne. Niższa wartość MAE wskazuje na większą dokładność w predykcji intensywności emocji.

Porównanie MAE między proponowaną strukturą a podejściami bazowymi w zbiorach danych CH-SIMS i CMU-MOSEI przedstawiono w Tabeli 4. Tradycyjne metody fuzji oparte na LSTM wykazują tendencję do wyższych wartości MAE ze względu na ich ograniczoną zdolność do modelowania złożonych multimodalnych zależności emocjonalnych. Metody TFN i LMF mogą obniżyć MAE poprzez modelowanie interakcji multimodalnych, a podejście Adaptive-Graph redukuje je jeszcze bardziej dzięki uczeniu relacji w grafie modalności. Proponowana struktura osiąga najniższą wartość MAE w obu zbiorach danych, co wskazuje na dokładniejszą estymację intensywności emocji. Warto zauważyć, że poprawa jest bardziej znacząca w zbiorze danych CMU-MOSEI, gdzie wielkoskalowa zmienność danych i warunki dotyczące mówców sprawiają, że zadanie predykcji jest bardziej wymagające.

Macierz pomyłek dla zbioru danych CH-SIMS

Zgodnie z macierzami pomyłek dla zbioru danych CH-SIMS, podstawowe metody wczesnej fuzji LSTM i TFN wykazują znaczną konfuzję między klasami emocji neutralnych i pozytywnych. Sugeruje to, że metody te nie radzą sobie najlepiej z identyfikacją subtelnych multimodalnych ekspresji emocjonalnych. Z drugiej strony, proponowana metoda wykazuje wyraźną silną dominację przekątnej, z bardzo niewielką liczbą elementów poza przekątną, co poprawia rozdzielność klas. Mechanizm rozplątanego uczenia emocji w proponowanej metodzie zapewnia spójną reprezentację emocji w różnych modalnościach, a podejście oparte na fuzji grafowej poprawia rozróżnianie między blisko powiązanymi klasami sentymentu. Rycina 7A–E przedstawia macierz pomyłek dla zbioru danych CH-SIMS z zastosowaniem różnych metod bazowych.

Macierz pomyłek dla zbioru danych CMU-MOSEI

Zaproponowany model wykorzystuje niezmiennicze względem modalności osadzenia emocji oraz adaptacyjne wagi uwagi, co pozwala znacząco zredukować wskaźnik błędnej klasyfikacji, szczególnie w przypadku wejść o niejednoznacznej emocjonalnie charakterystyce. Potwierdza to, że proponowany model sprawdza się w różnorodnych, wielkoskalowych scenariuszach interakcji multimodalnych. Ze względu na rozmiar zbioru danych, zmienność mówców oraz ciągły charakter etykiet sentymentu, macierze pomyłek dla zbioru CMU-MOSEI wykazują wyższy ogólny wskaźnik błędnej klasyfikacji. Metody bazowe wykazują znaczny stopień pomylenia różnych kategorii emocji. Rysunek 8A–E przedstawia macierz pomyłek dla zbioru danych CMU-MOSEI z zastosowaniem różnych metod bazowych.

Czas trenowania na epokę

Kompromisy obliczeniowe zaawansowanych technik fuzji multimodalnej zostają podkreślone poprzez porównanie czasu trenowania na epokę. Ze względu na kodery transformerowe oraz mechanizmy uwagi grafowej, proponowany model wymaga nieco więcej czasu trenowania niż proste podejścia do fuzji, jednak ten wzrost nie jest niedozwolony. Zaproponowany framework wykazał wysoką wydajność na referencyjnych zbiorach danych do multimodalnej analizy emocji i wykazuje potencjał do integracji z inteligentnymi systemami interakcji człowiek-maszyna. Niemniej jednak, w obecnym badaniu nie oceniono przydatności do wdrożenia w czasie rzeczywistym, co wymaga dalszych badań poprzez analizy opóźnień, przepustowości, pamięci i wdrożenia. Co istotne, poprawiona stabilność zbieżności oraz lepsza wydajność predykcyjna i interpretowalność sprawiają, że dodatkowy koszt obliczeniowy jest uzasadniony. Rysunek 9 przedstawia wynik czasu trenowania na epokę dla zaproponowanej metody.

Badanie ablacyjne

W celu określenia wpływu każdego istotnego elementu w proponowanej strukturze, takiego jak moduł mapowania wizualnego, grafowa fuzja międzymodalna oraz rozdzielona reprezentacja emocji, przeprowadzono badanie ablacyjne. Aby zrozumieć ten wpływ, poszczególne elementy usuwano pojedynczo. Wyniki eksperymentalne wskazują, że strategia fuzji grafowej usprawnia modelowanie zależności międzymodalnych, a wkład rozdzielonej reprezentacji emocji jest najważniejszy dla stabilności wyników. Pomocnicza rola modułu mapowania wizualnego została potwierdzona przez niewielki wpływ jego usunięcia na wydajność. Wyniki badania ablacyjnego w tych samych warunkach uczenia i ewaluacji przedstawiono w Table 5. Największy spadek wydajności zaobserwowano po usunięciu modułu grafowej uwagi międzymodalnej, co obniżyło dokładność z 81.72% do 77.88%, a wskaźnik F1-score z 0.823 do 0.776. Podkreśla to znaczenie modelowania złożonych interakcji międzymodalnych. Rola modułu uczenia reprezentacji rozdzielonych w pozyskiwaniu odpornych reprezentacji specyficznych dla emocji została wykazana przez fakt, że jego usunięcie obniżyło dokładność o 2.78 punktu procentowego, a F1-score o 0.032. Główną zaletą modułu mapowania wizualnego jest interpretowalność, a nie dokładność klasyfikacji, co potwierdza nieco mniejszy spadek wydajności predykcji po jego usunięciu. Najgorsze wyniki uzyskała konfiguracja Basic Fusion, co dowodzi, że uzyskanie najlepszej wydajności wielomodalnego rozpoznawania emocji wymaga połączonego wpływu wszystkich proponowanych modułów.

DOSTĘPNOŚĆ DANYCH:

Zbiory danych wykorzystane w niniejszym badaniu są publicznie dostępnymi zbiorami referencyjnymi. Zbiór danych CMU-MOSEI jest dostarczany przez Carnegie Mellon University Multimodal SDK i opisany w pracy Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), a dostęp do niego jest możliwy pod adresem https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. Zbiór danych CH-SIMS został opisany w pracy Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) i jest publicznie dostępny za pośrednictwem zasobów udostępnionych przez autorów, w tym pod adresem https://github.com/thuiar/MMSA. Wszystkie eksperymenty zostały przeprowadzone z wykorzystaniem oficjalnych wersji tych zbiorów. Surowe dane wyjściowe, przetworzone pliki danych, wyniki wstępnego przetwarzania, partycje treningowe/walidacyjne/testowe, wyprowadzone reprezentacje cech oraz szczegóły implementacji wspierające wyniki niniejszego badania są publicznie dostępne w repozytorium Zenodo pod adresem https://doi.org/10.5281/zenodo.21124921.

figure-results-1
Rysunek 1: Schemat proponowanego frameworka wizualnego mapowania multimodalnych cech emocji. Koncepcyjna ilustracja ogólnej architektury, przedstawiająca komponenty ekstrakcji cech multimodalnych, uczenia reprezentacji rozplątanej, fuzji uwagi między-modalnej opartej na grafach oraz mapowania wizualnego dla interpretowalnej multimodalnej analizy emocji.. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-2
Rysunek 2: Schematyczny diagram przepływu proponowanego protokołu obliczeniowego.
Koncepcyjna reprezentacja kompletnego potoku przetwarzania, obejmująca etapy pozyskiwania zbioru danych, przetwarzania wstępnego, ekstrakcji cech specyficznych dla danej modalności, fuzji multimodalnej, wizualizacji oraz predykcji emocji Proszę kliknąć tutaj, aby wyświetlić większą wersję tego rysunku.

figure-results-3
Rycina 3: Porównanie wyników wskaźnika F1 dla zbioru danych CH-SIMS. Średnie wartości wskaźnika F1 uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowego. Słupki błędów reprezentują ±± jedno odchylenie standardowe (SD). Wyższe wartości wskaźnika F1 wskazują na lepszą skuteczność klasyfikacji emocji. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

figure-results-4
Rycina 4: Porównanie wyników miary F1 dla zbioru danych CMU-MOSEI. Średnie wartości miary F1 uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowego. Słupki błędów reprezentują ±± jedno odchylenie standardowe (SD), a odpowiadające im wartości średnia ±± SD są wyświetlane nad każdym punktem danych. Wyższe wartości miary F1 wskazują na lepszą wydajność klasyfikacji emocji. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

figure-results-5
Rysunek 5: Porównanie precyzji na zbiorach danych CH-SIMS i CMU-MOSEI. Średnie wyniki precyzji uzyskane przez LSTM, TFN, LMF, Adaptive-Graph oraz proponowany model w pięciu niezależnych seriach eksperymentalnych (n = 5). Słupki błędów reprezentują ±± jedno odchylenie standardowe (SD) obliczone z powtórzonych serii z różnymi inicjalizacjami ziarna losowości. Proponowany model osiąga najwyższą precyzję na obu zbiorach danych, wykazując lepszą dyskryminację klas emocji dzięki efektywnej multimodalnej nauce cech i fuzji międzymodalnej opartej na grafach. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-6
Rycina 6: Porównanie czułości (recall) dla zbiorów danych CH-SIMS i CMU-MOSEI. Średnie wartości czułości uzyskane przez LSTM, TFN, LMF, Adaptive-Graph oraz proponowany framework w pięciu niezależnych próbach eksperymentalnych (n = 5). Słupki błędów wskazują ±± jedno odchylenie standardowe (SD) wyznaczone na podstawie powtórzonych eksperymentów. Proponowany framework konsekwentnie osiąga najwyższą czułość w obu zbiorach danych, co wskazuje na lepszą zdolność do przechwytywania multimodalnych informacji emocjonalnych i redukcji wyników fałszywie ujemnych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

figure-results-7
Rysunek 7: Macierz pomyłek dla zbioru danych CH-SIMS z zastosowaniem różnych metod bazowych. Wiersze odpowiadają rzeczywistym klasom emocji, a kolumny odpowiadają klasom przewidzianym. Wartości w komórkach reprezentują procent próbek znormalizowany względem każdej klasy rzeczywistej. Macierz pomyłek została obliczona z wykorzystaniem wydzielonej partycji testowej CH-SIMS. Wyższe wartości procentowe na przekątnej wskazują na lepszą dokładność rozpoznawania dla odpowiadającej kategorii emocji. Macierze pomyłek dla (A) wczesnej fuzji LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph oraz (E) proponowanej metody dla zbioru danych CH-SIMS. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-8
Rysunek 8: Macierz pomyłek dla zbioru danych CMU-MOSEI z zastosowaniem różnych metod bazowych. Wiersze reprezentują rzeczywiste etykiety emocji, a kolumny reprezentują etykiety przewidziane. Wartości podano jako procenty znormalizowane klasowo w zbiorze testowym CMU-MOSEI. Macierz ilustruje zarówno próbki sklasyfikowane poprawnie (wpisy na przekątnej), jak i pomyłki między kategoriami emocji (wpisy poza przekątną). Macierz pomyłek dla CMU-MOSEI (A) wczesna fuzja LSTM, (B) TFN, (C) LMF, (D) graf adaptacyjny oraz (E) proponowana metoda dla zbioru danych CMU-MOSEI. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-9
Rycina 9. Porównanie czasu trenowania na epokę w benchmarkowych multimodalnych zbiorach danych dotyczących emocji.
Średni czas trenowania na epokę uzyskany z pięciu niezależnych serii eksperymentalnych (n = 5) dla zbiorów danych CH-SIMS oraz CMU-MOSEI przy identycznych ustawieniach sprzętowych i programowych. Słupki błędów reprezentują ±± jedno odchylenie standardowe (SD) obliczone z powtórzonych eksperymentów z zastosowaniem różnych inicjalizacji ziarna losowego. Niższe wartości wskazują na wyższą wydajność obliczeniową, natomiast stabilne czasy trenowania w poszczególnych seriach wskazują na lepszą powtarzalność i spójność trenowania. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Zbiór danychModalnościLiczba próbekJęzykEtykiety emocji/sentymentu
CH-SIMS34Wideo, audio, tekst2,281 segmentów wideochińskiMultimodalne i unimodalne etykiety sentymentu (negatywny, neutralny, pozytywny)
CMU-MOSEI35Wideo, audio, tekst~23,453 adnotowanych klipówangielskiEtykiety sentymentu i intensywności emocji (ciągłe i kategoryczne)

Tabela 1: Opis zbiorów danych. Podsumowanie zbiorów danych wykorzystanych w niniejszym badaniu, modalności, liczby próbek, języka oraz etykiet emocji/sentymentu dla zbiorów danych CH-SIMS i CMU-MOSEI.

KomponentSpecyfikacja
Środowisko programistycznePython z PyTorch
Ekstraktor cech wizualnychVision Transformer (ViT)
Ekstraktor cech audioWav2Vec 2.0
Ekstraktor cech tekstowychRoBERTa
Strategia fuzjiGrafowa sieć uwagi międzymodalnej (Graph-based Cross-Modal Attention Network)
Wymiar cech768 na modalność
Optymalizator treningowyAdam
Wskaźnik uczenia1.00E-04
Wielkość partii16
SprzętGPU NVIDIA (np. seria RTX)
Zbiory danych do ewaluacjiCH-SIMS, CMU-MOSEI
Wymiar ukryty2.56E+02
Wymiar osadzenia768
Funkcja aktywacjiReLU
OptymalizatorAdam
Wskaźnik uczenia1.00E-04
Wielkość partii32
Epoki100
Wczesne zatrzymanie (Early Stopping)Włączone
Funkcja stratyKlasyfikacja + Rekonstrukcja + Spójność

Tabela 2: Środowisko symulacji. Konfiguracja eksperymentalna i szczegóły implementacji środowiska symulacji, takie jak specyfika modelu, cechy, optymalizator oraz wykorzystany sprzęt.

MetodaDokładność CH-SIMS (%)Dokładność CMU-MOSEI (%)
LSTM (fuzja wczesna/późna)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
Proponowana metoda81.72 ± 0.6179.94 ± 0.69

Tabela 3: Ocena dokładności sugerowanej metody w porównaniu z technikami bazowymi na zbiorach danych CH-SIMS i CMU-MOSEI. Wyniki przedstawiono jako średnia ±± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z wykorzystaniem różnych inicjalizacji ziarna losowego. Wszystkie metody oceniono przy użyciu identycznych partycji treningowych, walidacyjnych i testowych odpowiednich zbiorów danych w celu zapewnienia rzetelnego porównania.

MetodaCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (fuzja wczesna/późna)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
Proponowana metoda0.298 ± 0.0070.341 ± 0.008

Tabela 4: Wynik średniego błędu bezwzględnego. Wyniki przedstawiono jako średnia ±± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowego. Wszystkie metody oceniono przy użyciu identycznych podziałów zbiorów treningowych, walidacyjnych i testowych w odniesieniu do ich odpowiednich zbiorów danych, aby zapewnić rzetelne porównanie. Porównanie MAE dla ciągłego przewidywania intensywności emocji z wykorzystaniem proponowanego schematu oraz metod bazowych na obu zbiorach danych.

Wariant modeluDokładność (%)Wskaźnik F1
Pełny model81.72 ± 0.610.823 ± 0.008
Bez rozplątywania78.94 ± 0.740.791 ± 0.010
Bez fuzji grafów77.88 ± 0.810.776 ± 0.011
Bez mapowania wizualnego80.11 ± 0.660.807 ± 0.009
Podstawowa fuzja74.91 ± 0.980.742 ± 0.013

Tabela 5: Wynik badania ablacyjnego z zastosowaniem metod bazowych. Wyniki przedstawiono jako średnia ±± odchylenie standardowe uzyskane z pięciu niezależnych serii eksperymentalnych (n = 5) z zastosowaniem różnych inicjalizacji ziarna losowości. Wszystkie metody oceniono przy użyciu identycznych podziałów zbiorów treningowych, walidacyjnych i testowych dla ich odpowiednich zbiorów danych, aby zapewnić rzetelne porównanie. Porównanie wydajności między wariantami modelu wskazujące na skuteczność uczenia się z reprezentacji rozplątanych (disentangled representations), fuzji opartej na grafach oraz modułu mapowania wizualnego.

Plik uzupełniający 1: Algorytm 1 i Algorytm 2.Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki eksperymentalne wykazują, że w odniesieniu do zbiorów danych CH-SIMS i CMU-MOSEI proponowany framework mapowania wizualnego dla multimodalnych cech emocji przewyższa aktualne techniki multimodalnego rozpoznawania emocji. W porównaniu z modelami wczesnej i późnej fuzji, takimi jak EF-LSTM i TFN, proponowana technika osiąga wyższą dokładność oraz wartości F1 Score, co świadczy o jej odporności w przetwarzaniu zróżnicowanych informacji emocjonalnych. Poprawę działania tej metody można przypisać rozdzielonej reprezentacji emocji, która tłumi szum specyficzny dla danej modalności i zapewnia spójność emocjonalną pomiędzy modalnościami wizualną, audio i tekstową36.

Niedawno multimodalne modele oparte na transformatorach, takie jak Adaptive Multimodal Transformers37 oraz MIAR38, wykazały imponujące wyniki w modelowaniu zależności międzymodalnych. Niemniej jednak modele te koncentrują się głównie na predykcji i nie posiadają mechanizmów wspierających interpretowalność na poziomie cech. W przeciwieństwie do nich, proponowany system łączy opartą na grafach uwagę międzymodalną z modułem mapowania wizualnego, co umożliwia przejrzystą analizę interakcji między modalnościami a emocjami. Jest to kluczowy aspekt, który obecnie pomijany jest w literaturze, w której wnioskowanie emocjonalne traktowane jest jako proces typu „czarna skrzynka”.

Zaproponowany model wykazał spójną wydajność w zestawach danych referencyjnych CH-SIMS i CMU-MOSEI. Chociaż model ten może znaleźć zastosowanie w inteligentnej interakcji człowiek-maszyna, monitorowaniu stanu zdrowia, adaptacyjnych środowiskach uczenia się oraz innych systemach rozpoznających emocje, w obecnym badaniu metodę oceniono wyłącznie w kontrolowanych warunkach referencyjnych. Nie przeprowadzono wdrożenia w rzeczywistych warunkach, oceny interfejsu użytkownika, badania użyteczności ani ewaluacji z udziałem ludzi. W związku z tym praktyczna skuteczność modelu w środowiskach operacyjnych wymaga dalszych badań. Przyszłe prace skupią się na ewaluacjach zorientowanych na wdrożenie, badaniach zorientowanych na użytkownika, analizie opóźnień, ocenie zużycia pamięci oraz wydajności interakcji w czasie rzeczywistym.

Co więcej, poprawa wyników w różnych zróżnicowanych kulturowo i językowo zbiorach danych potwierdza zasadność zaproponowanego modelu. W przeciwieństwie do wcześniejszych prac walidowanych na pojedynczym zbiorze danych lub w konkretnym scenariuszu interakcji, zaproponowany model wykazuje stabilną wydajność w odniesieniu do różnych języków, mówców i ekspresji emocjonalnych. W związku z tym zaproponowany model jest bardzo odpowiedni dla praktycznych inteligentnych systemów interakcyjnych, które wymagają dokładnego rozpoznawania emocji i interpretowalnego podejmowania decyzji.

Interpretowalność proponowanego modelu została oceniona poprzez analizę opartą na wizualizacji wyuczonych reprezentacji multimodalnych. W szczególności zbadano latentne osadzenia emocji, mapy uwagi między-modalnej, grafy interakcji modalności oraz czasowe trajektorie emocji, aby uzyskać wgląd w proces podejmowania decyzji przez model oraz wkład poszczególnych modalności. Celem modułu mapowania wizualnego jest zwiększenie przejrzystości poprzez umożliwienie obserwacji interakcji na poziomie cech oraz dynamiki emocjonalnej. Jednakże w niniejszej pracy nie uwzględniono formalnych metryk interpretowalności, ewaluacji wierności uwagi (attention-faithfulness) ani badań z udziałem użytkowników. W związku z tym zgłaszane korzyści w zakresie interpretowalności należy traktować jako dowody oparte na wizualizacji, a nie jako ilościowo zwalidowane miary wyjaśnialności.

Z teoretycznego punktu widzenia, niniejsze badanie wnosi następujące wkłady do wielomodalnego obliczeniowego analizowania afektu: proponuje systematyczny sposób modelowania emocji, który wyraźnie rozróżnia reprezentacje specyficzne dla emocji od reprezentacji specyficznych dla modalności. Poprzez zapewnienie spójności emocjonalnej między modalnościami w wspólnej przestrzeni latentnej, sugerowany framework rozwija teorię uczenia reprezentacji w systemach wielomodalnych. Włączenie mechanizmów uwagi opartych na grafach dodatkowo formalizuje zależności między różnymi modalnościami w wyrażaniu emocji.

Z praktycznego punktu widzenia proponowany model jest bardzo korzystny dla projektowania inteligentnych interakcji oraz interfejsów użytkownika uwzględniających emocje. Moduł mapowania wizualnego w proponowanym modelu pozwala projektantom systemów zrozumieć wpływ różnych modalności na przewidywanie emocji, co jest dla nich niezwykle istotne. Proponowany model znajduje szerokie zastosowanie w takich rozwiązaniach jak afektywne agenty konwersacyjne, adaptacyjne systemy uczenia się, interfejsy monitorowania zdrowia oraz platformy oceny doświadczeń użytkownika.

Zaproponowane ramy posiadają jednak pewne ograniczenia. Zastosowanie mechanizmów uwagi grafowej i koderów transformera zwiększa złożoność, co może być problematyczne w przypadku urządzeń o ograniczonych możliwościach. Ponadto w obecnym badaniu pominięto inne sygnały fizjologiczne, takie jak EEG i okulografia, koncentrując się na modalnościach wizualnej, dźwiękowej i tekstowej. Wydajność obliczeniowa sugerowanych ram pod kątem wdrożenia w czasie rzeczywistym nie została konkretnie oceniona, mimo że osiągnięto konkurencyjną skuteczność predykcji i poprawiono możliwości wizualizacji. Przyszłe badania przeanalizują wydajność wdrożenia w rzeczywistych kontekstach inteligentnej interakcji, opóźnienie wnioskowania, przepustowość, zużycie pamięci oraz techniki kompresji modeli. Aby dodatkowo poprawić dokładność modelowania emocji i responsywność interakcji, przyszłe badania skupią się na opracowaniu lekkich modeli, technik optymalizacji w czasie rzeczywistym oraz włączeniu dodatkowych modalności. Wydajność wdrożenia w czasie rzeczywistym nie została oceniona, a zastosowanie koderów transformera i metod uwagi opartych na grafach zwiększa złożoność obliczeniową. Do walidacji metodologii wykorzystano wyłącznie zbiory danych referencyjnych CH-SIMS i CMU-MOSEI, co może wprowadzać błędy specyficzne dla danych zbiorów i ograniczać możliwość generalizacji na inne domeny, języki i populacje użytkowników. Dodatkowo obecne badanie nie obejmuje sygnałów fizjologicznych, takich jak dane EEG czy okulograficzne; zamiast tego koncentruje się na modalnościach wizualnej, dźwiękowej i tekstowej. Chociaż szczegółowe opisy implementacji i środowiska symulacyjnego poprawiły powtarzalność, kod źródłowy i wstępnie wytrenowane modele nie są obecnie udostępnione publicznie.

W niniejszej pracy zastosowano nowatorski system mapowania wizualnego do multimodalnego uczenia cech emocjonalnych na potrzeby projektowania inteligentnych interakcji. Sugerowana metoda integruje end-to-end uczenie reprezentacji oparte na transformerach, rozdzielone modelowanie emocji oraz grafową uwagę między modalnościami, aby osiągnąć wysoką dokładność predykcyjną i interpretowalność. Eksperymenty na zbiorach danych CH-SIMS oraz CMU-MOSEI wykazują, że proponowany system przewyższa najnowocześniejsze modele multimodalnego rozpoznawania emocji pod względem dokładności oraz wyniku F1. Co ważniejsze, proponowane rozwiązanie mapowania wizualnego niweluje lukę między rozpoznawaniem emocji a strategią interakcji i wyznacza nowy kierunek w projektowaniu interpretowalnych, świadomych interakcji multimodalnych systemów obliczeń afektywnych.

W celu usprawnienia interpretowalnego i inteligentnego projektowania interakcji, w niniejszym badaniu wprowadzono nowatorski framework mapowania wizualnego do uczenia multimodalnych cech emocji. Zaproponowany system skutecznie integruje detekcję emocji i interpretowalność w ramach jednej architektury, łącząc ekstrakcję multimodalnych cech opartą na transformerach, uczenie rozdzielonych reprezentacji emocji, fuzję uwagi między-modalnej opartą na grafach oraz metody mapowania wizualnego. Poza zapewnieniem przejrzystych wizualizacji wkładu poszczególnych modalności, interakcji między-modalnych i temporalnej dynamiki emocji, ewaluacja eksperymentalna na zestawach danych referencyjnych CH-SIMS i CMU-MOSEI wykazała poprawę wydajności w stosunku do reprezentatywnych metod bazowych w kilku metrykach, w tym Accuracy, Precision, Recall, F1-score oraz Mean Absolute Error (MAE). Jednak badanie to, ograniczone do ewaluacji na dwóch zestawach danych referencyjnych, nie obejmuje studiów nad wdrożeniem w rzeczywistych warunkach, ocen zorientowanych na użytkownika, ilościowych analiz wyjaśnialności ani integracji modalności fizjologicznych. Ponadto środowiska o ograniczonych zasobach mogą napotkać trudności ze względu na koszt obliczeniowy enkoderów transformerów i procesów uwagi opartych na grafach. Chociaż przyszłe prace skupią się na szerszej walidacji na różnych zestawach danych, integracji dodatkowych modalności, badaniach użyteczności, udostępnieniu reprodukowalnych zasobów oraz optymalizacji pod kątem scenariuszy wdrożeń w czasie rzeczywistym, zaproponowany framework wykazuje ogólnie potencjał interpretowalnej multimodalnej analizy emocji dla obliczeń afektywnych i aplikacji inteligentnych interakcji.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie deklarują żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy pragną podziękować za wsparcie udzielone przez School of Housing, Building and Planning, Universiti Sains Malaysia, Penang, Malezja, oraz School of Design Art, Changsha University of Science & Technology, Changsha, Chiny. Autorzy wyrażają również wdzięczność Xiamen Academy of Arts and Design, Fuzhou University, Xiamen, Chiny, za wsparcie akademickie i badawcze podczas realizacji niniejszej pracy.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AdamBiblioteka optymalizatorów PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Learning Rate = 1 × 10-4)Optymalizacja parametrów podczas trenowania modelu
CH-SIMSOryginalne repozytorium zbioru danychNajnowsza wersja publicznaZbiór danych referencyjnych do chińskiej multimodalnej analizy sentymentu/emocji
CMU-MOSEIRepozytorium CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (Najnowsza wersja publiczna)Zbiór danych referencyjnych do multimodalnego rozpoznawania sentymentu i emocji
Disentangled Emotion EncoderWłasna implementacjahttps://pytorch-geometric.readthedocs.io/en/latest/(Architektura Dual Encoder)Separacja reprezentacji ukrytych specyficznych dla emocji oraz specyficznych dla modalności
Graph Attention Network (GAT)PyTorch GeometricMulti-head GAT (https://pytorch-geometric.readthedocs.io/en/latest/)Modelowanie między-modalnych relacji emocjonalnych i adaptacyjna fuzja cech
Graph-Based Cross-Modal Attention LayerWłasna implementacjaMulti-Head Attention FusionUczenie szczegółowych zależności emocjonalnych pomiędzy modalnościami
MatplotlibProjekt Matplotlib3.7+Generowanie wykresów i analityka wizualna
NetworkXProjekt NetworkX3.0+Konstrukcja i wizualizacja grafów interakcji między-modalnych
NVIDIA GPUNVIDIA CorporationGPU z obsługą CUDAAkceleracja trenowania transformatorów i grafowych sieci neuronowych
Principal Component Analysis (PCA)Scikit-learnsklearn.decomposition.PCAWstępna redukcja wymiarowości wysokowymiarowych osadzeń emocji
PythonPython Software Foundation3.8+Podstawowy język programowania do implementacji frameworka multimodalnej analizy emocji
PyTorchPyTorch Foundation2.0+Opracowywanie, trenowanie i optymalizacja głębokich sieci neuronowych
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, osadzenia 768-dim)Ekstrakcja kontekstowych lingwistycznych i semantycznych reprezentacji emocji
SeabornProjekt Seaborn0.12+Generowanie map ciepła atencji i wizualizacji statystycznych
t-distributed Stochastic Neighbor Embedding (t-SNE)Scikit-learn
scikit-learn.org (Perplexity = 30, Iterations = 1000)
Wizualizacja klastrów i trajektorii ukrytych emocji
Ubuntu LinuxCanonical Ubuntu20.04 LTS lub nowszaŚrodowisko wykonawcze eksperymentów
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, osadzenia 768-dimEkstrakcja wizualnych reprezentacji uwzględniających emocje z klatek wideo
Wav2Vec 2.0Meta AI ResearchModel bazowy, osadzenia 768-dimEkstrakcja kontekstowych akustycznych i mownych cech emocji

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Predykcja emocjiuczenie reprezentacjiuwaga mi dzy modalno ciamienkodery Transformerreprezentacja rozpl tanaczasowe trajektorie emocjiinterpretowalno cech

Powiązane artykuły