본 연구는 두 개의 데이터셋에서 감정 인식 정확도를 향상시키기 위해 트랜스포머 인코더, 얽힘 제거된 감정 표현, 그리고 시각적 매핑을 이용한 그래프 기반 교차 모달 어텐션을 활용하는 엔드 투 엔드 멀티모달 감정 분석 프레임워크를 제안합니다.
연구 논문
본 연구는 두 개의 데이터셋에서 감정 인식 정확도를 향상시키기 위해 트랜스포머 인코더, 얽힘 제거된 감정 표현, 그리고 시각적 매핑을 이용한 그래프 기반 교차 모달 어텐션을 활용하는 엔드 투 엔드 멀티모달 감정 분석 프레임워크를 제안합니다.
기계가 인간의 정서적 상태를 이해하고 해석하며 이에 반응할 수 있게 함으로써, 다중 모달 정서 특성의 시각적 매핑은 지능형 인터페이스 설계에 있어 매우 중요합니다. 그럼에도 불구하고, 현재의 다중 모달 정서 감지 알고리즘은 주로 예측 성능에 집중하고 있어 해석 가능성, 상호작용 인식 또는 특징 수준의 교차 모달 상호작용에 대한 통찰력을 거의 제공하지 못하고 있습니다. 본 연구에서는 상호작용 중심의 시각화, 해석 가능한 표현 학습 및 정서 예측을 결합한 다중 모달 정서 측면의 시각적 매핑 프레임워크를 소개하였습니다. 수동으로 생성된 특징을 사용하는 대신, 트랜스포머 기반 인코더를 사용하여 텍스트, 오디오 및 시각 모달리티에서 고차원 정서 임베딩을 추출하였습니다. 강건성을 높이기 위해 얽힘 해제 표현 학습(disentangled representation learning) 기법을 사용하여 정서 특이적 정보와 모달리티 특이적 정보를 분리하였습니다. 또한, 모달리티 간의 미묘한 정서적 관계를 모사하기 위해 적응형 어텐션 가중치를 사용하는 그래프 기반 교차 모달 어텐션 네트워크를 구축하였습니다. 투명성을 높이기 위해 시간적 정서 궤적, 교차 모달 어텐션 분포 및 잠재 정서 임베딩을 묘사하는 다중 뷰 시각적 매핑 모듈을 개발하였습니다. 제안된 프레임워크를 평가하기 위해 Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) 데이터셋과 Chinese Multimodal Sentiment Analysis Dataset (CH-SIMS)를 사용하였습니다. 실험 결과에 따르면, 제안된 프레임워크는 정확도, F1-score, 상관관계 및 평균 절대 오차 측면에서 대표적인 베이스라인 기법들을 일관되게 능가하는 동시에 개선된 특징 수준의 해석 가능성과 상호작용 인식 시각화를 제공하였습니다. 또한, 시각적 매핑 모듈은 다중 모달 정서 표현, 교차 모달 상호작용 및 시간적 정서 역동성의 정성적 해석을 용이하게 하여 상호작용 인식 시각화 및 분석을 지원하였습니다.
인간의 감정을 정확하게 식별하고 이해하는 능력은 인간과 기계 사이의 상호작용을 개선하는 데 매우 중요해졌습니다. 감정 분석은 인간-컴퓨터 상호작용의 개선에 필수적일 뿐만 아니라, 사전 진단 의료 진단1, 교실 내 행동 분석2, 환자의 심리 추적3, 차량 내 피로 식별4, 그리고 스마트 홈 환경의 지능형 관리5를 포함한 여러 분야에 혁신을 가져올 잠재력을 가지고 있습니다. 최근 Affective Computing 및 딥러닝6의 발전으로 인해 인간 감정의 복잡성을 포착할 수 있는 실시간 시스템 구축에 대한 관심이 높아졌습니다.
현재의 많은 방법들은 주로 텍스트, 그래픽 또는 청각적 신호와 같은 단일 모달 데이터에 의존하고 있습니다7,8,9. 이러한 접근 방식들은 반어법이나 문맥 특유의 뉘앙스와 같은 정교한 신호를 감지하는 데 반복적으로 실패합니다. 이에 따라 이러한 제한 사항을 극복하기 위해 여러 소스로부터 상호 보완적인 데이터를 통합하는 다중 모달 감정 평가로 연구가 이동하였습니다10,11,12. 여러 모달리티를 병합하는 것의 이점은 early fusion-long short-term memory (EF-LSTM)13, light and FM deep neural networks (LF-DNN)14, tensor fusion networks (TFN), 그리고 low-rank multimodal fusion 접근 방식과 같은 베이스라인 모델들을 통해 입증되었습니다. 하지만 이러한 접근 방식의 대부분은 오프라인 특징 생성에 의존하므로, 동적인 실제 상황에는 적합하지 않습니다.
감정 상태를 수용하기 위해 지난 10년 동안 멀티모달 감정 식별 연구와 응용 분야가 성장해 왔습니다15. 오늘날 가장 도전적이고 중요한 연구 분야 중 하나는 다양한 데이터 소스를 사용하여 감정 상태를 지속적으로 모니터링하는 것입니다16. 멀티모달리티라는 개념은 이와 같이 다양한 지식 체계가 등장하면서 자연스럽게 나타났으며, 이는 감성 컴퓨팅, 인간-컴퓨터 상호작용(HCI), 학습, 비디오 게임, 소비자 서비스, 의료 서비스, 사용자 경험(UX) 평가 등과 같은 영역에서 감정 응용의 많은 발전을 이끌었습니다. 하지만 UX 평가에 감정 인식 기술을 적용하는 것이 항상 간단했던 것은 아닙니다.
단일 모달 방법보다 멀티모달 인식에 집중하는 주요 이유 중 하나는 단일 정보원에 의존할 때 발생하는 본질적인 단점 때문입니다. 단일 모달 감정 탐지 시스템은 데이터의 누락이나 불분명함으로 인해 정확도가 낮아질 수 있는 반면, MER 방식은 여러 데이터 소스를 통합함으로써 더욱 신뢰할 수 있으며 표현 상태에 대해 더 종합적이고 심도 있는 이해를 제공합니다17. 예를 들어, 특히 제스처가 복잡하거나 불분명할 때 얼굴 표정만으로는 감정을 정확하게 분류하기에 충분하지 않을 수 있습니다. 반면, 얼굴 표정을 언어나 신체적 신호와 같은 다른 형태의 의사소통 방식과 결합하면 감정 인식의 정확도를 높일 수 있습니다.
감정 인식에 관한 광범위한 연구가 여러 모달리티(modality)를 대상으로 수행되어 왔습니다. 초기 연구들은 그래픽, 음향 또는 텍스트 기반 입력과 같은 서로 다른 모달리티에서 구별되는 특징을 식별하는 데 집중했습니다. 하지만 다양한 모달리티를 통합함으로써 균형 잡힌 감정 정보를 제공할 수 있으며, 결과적으로 더 신뢰할 수 있고 정밀한 감정 검출이 가능하다는 점이 점점 더 분명해지고 있습니다. 본 섹션에서는 단일 모달리티 및 멀티모달 감정 분석의 주요 발전 사항을 검토하며, 특히 베이스라인 접근 방식과 그 한계점, 그리고 본 연구 방법의 근거에 초점을 맞춥니다.
감정 인식에 관한 초기 연구는 주로 단일 모달리티에 집중되었습니다. 시각적 영역에서는 획기적인 연구를 통해 전형적인 얼굴 움직임의 범주화가 이루어졌습니다20. 이후 시각적 움직임21 및 은닉 마르코프 모델(hidden Markov models)22과 같이 시간적 역동성을 포착하는 기술들이 발전하였으며, 얼굴 반응은 얼굴 움직임 부호화 시스템(Facial Action Coding System, FACS)23을 사용하여 행동 단위(action units)로 구분되었습니다. LSTM과 합성곱 신경망(CNN)은 원시 오디오 신호에서 유의미한 특징을 직접 추출하는 데 성공적으로 사용되어 왔으며, 오디오 기반 감정 식별 방법론은 전통적인 신호 처리에서 딥러닝으로 발전했습니다24. 텍스트 기반 감정 분석에서 문맥적 감성 신호를 추출하는 기능은 어텐션 메커니즘을 통합한 순환 신경망(RNN)과 최근의 트랜스포머 기반 모델에 의해 크게 향상되었습니다. 이러한 성과에도 불구하고, 단일 모달리티 기술은 다른 모드에서 발견되는 보완 정보가 부족하기 때문에 사람들이 경험하는 복잡성을 정확하게 표현하는 데 본질적으로 한계가 있습니다.
대화형 감성 식별 분야에서 더 장기적인 환경 데이터를 수집하기 위해 DialogXL 모델25과 같은 일부 attention mechanism 기반 모델들이 2021년에 제안되었습니다. Kim 등26은 ERC의 정확도를 높이기 위해 2021년에 EmoBERTa 모델을 도입했습니다. 이 모델은 화자 데이터를 사용하여 대화 내 화자의 특성과 화자 간의 상호작용 기능을 개선합니다. 2022년에 Li 등27은 CoG-BART 방법을 제시했습니다. 이 구조는 지도 대조 학습(supervised contrastive learning)을 사용하여 관련 데이터를 해석하는 모델의 능력을 향상시킵니다. 지도 학습에는 상당한 양의 레이블된 데이터가 필요하다는 점에 유의해야 합니다.
이러한 연구의 전형적인 예는 특징 상호작용 토큰과 대조 정렬을 사용하여 모달리티 간 일반화 성능을 향상시키는 Multimodal Interaction-Aware Representation (MIAR) 프레임워크28입니다. MIAR는 모달리티 정렬을 개선하고 여러 데이터셋에서 강력한 성능을 달성하지만, 시각적 매핑을 다루지 않고 주로 예측 정확도에 집중합니다. 마찬가지로, Cross-Attentional Audio-Visual Fusion 모델29은 정서가(valence) 및 각성도(arousal) 예측을 위해 세밀한 오디오-비주얼 상호작용을 효과적으로 포착하지만, 두 가지 모달리티로 제한되며 시각화 기능이 부족합니다. LSTM 네트워크 및 오토인코더 퓨전 기반의 시계열 모델링 접근 방식은 감정의 시간적 역동성을 성공적으로 포착하나, 모달리티 상호작용과 학습된 감정 표현에 대한 통찰력은 제한적입니다. 보다 최근에는 Transformer-based Multimodal Fusion Network (TMFN)30와 같은 트랜스포머 기반 방법들이 강화된 멀티모달 퓨전과 대조 학습을 통해 CMU-MOSI 및 CMU-MOSEI에서 강력한 성능을 입증했습니다. 그럼에도 불구하고, 이러한 접근 방식들은 여전히 주로 성능 중심적이며 설명 가능성, 특징 수준의 해석 및 상호작용 중심의 시각화에 대한 지원이 제한적입니다.
텍스트, 음향 및 시각 데이터의 통합을 강화하기 위해 여러 멀티모달 감정 인식 기술이 제안되어 왔습니다. EF-LSTM 및 LF-DNN과 같은 초기 퓨전 기술은 복잡한 교차 모달 상호작용을 포착하지는 못했지만, 감성 및 감정 분석에 멀티모달 정보를 활용하는 것의 이점을 입증했습니다. TFN은 CMU-MOSI 및 CMU-MOSEI와 같은 벤치마크 데이터셋에서 성능을 향상시키고 모달 간 상호작용의 명시적 모델링을 도입했으나, 제한적인 해석 가능성과 높은 계산 복잡성으로 인해 활용도에 한계가 있었습니다. 모달리티 정렬과 동적 특징 퓨전을 개선하기 위해 MIAR, 교차 주의 집중 퓨전 모델, TMFN 및 적응형 멀티모달 트랜스포머와 같은 최신 기술들은 트랜스포머 토폴로지와 주의 집중 메커니즘을 사용해 왔습니다. 이러한 방법들은 정확도, F1-score, 평균 절대 오차와 같은 일반적인 평가 지표에서 경쟁력 있는 결과를 얻었음에도 불구하고, 주로 예측 성능에 집중하여 특징 수준의 감정 표현 및 교차 모달 의존성에 대한 통찰력은 거의 제공하지 못했습니다. 또한, 잠재 감정 임베딩, 주의 집중 분포 및 시간적 감정 역학을 공개할 수 있는 시각화 기술을 구축하거나 모달 간 상호작용의 그래프 기반 모델링을 통합한 연구는 거의 없었습니다. 제안된 접근 방식은 이러한 단점을 극복하고 멀티모달 감정 인식 성능을 향상시키기 위해 다중 뷰 시각적 매핑, 그래프 기반 교차 모달 주의 집중 퓨전 및 얽힘 해제 표현 학습을 통합합니다.
이와 유사하게, Adaptive Multimodal Transformer32는 노이즈가 있거나 누락된 모달 정보를 적응적으로 완화하기 위해 교환 기반 융합(exchange-based fusion)을 제안하여 감정 분류 성능을 향상시켰습니다. 이러한 접근 방식은 모달 정보의 분포 차이를 효과적으로 해결할 수 있지만, 설계 자체가 감정 분석이라는 특정 작업에 국한되어 있어 학습된 감정 표현에 대한 통찰력은 제한적입니다. 또 다른 중요한 기여로는 CNN, 곱셈 LSTM(multiplicative LSTMs) 및 트랜스포머 기반 어텐션을 통합하여 실시간 멀티모달 감정 인식을 수행하는 Multimodal Fusion Model33이 있습니다. 이 모델은 비디오, 오디오 및 텍스트 모달리티에 대해 완전 융합(full fusion)을 수행하며 견고한 인식 성능을 보여줍니다. 그럼에도 불구하고, 다른 기존 모델들과 마찬가지로 주로 예측 정확도에 집중하고 있으며, 시각화 및 상호작용 중심의 해석 가능성을 위한 명시적인 특징이 부족합니다.
결론적으로, 현재의 최신 다중모드 감정 인식 접근 방식들은 교차 모드 상호작용을 포착하고 예측 정확도를 높이는 데 상당한 성과를 거두었으나, 대부분은 인식 중심의 작업에 치중되어 있습니다. 특성 수준의 해석 가능성, 이미지 공간에서의 감정 표현 시각화, 그리고 지능형 상호작용 설계를 위해 제안된 프레임워크를 통합하는 분야는 거의 주목받지 못했습니다. 본 연구에서는 이러한 과제들을 해결하기 위해 제안된 프레임워크를 소개합니다.
멀티모달 감정 인식의 주목할 만한 발전에도 불구하고28,29, 현재의 대다수 방법론은 학습된 감정 표현과 교차 모달 상호작용의 해석 가능성을 거의 제공하지 않은 채 주로 예측 성능을 개선하는 데 집중하고 있습니다. 텍스트, 음향 및 시각 모달리티 간의 복잡한 상호작용은 특히 모달리티 간의 불일치나 정보 부족이 발생할 때 현재의 퓨전 전략으로는 모델링하기 어려운 경우가 많습니다28,31. 트랜스포머 기반 설계와 어텐션 메커니즘이 표현 학습을 향상시켰으나, 감정 특이적 정보와 모달리티 특이적 정보의 명시적 분리가 부족하여 투명성과 해석 가능성이 종종 떨어집니다31,32,33. 또한, 모달 간 상호작용의 그래프 기반 모델링을 연구하거나 시간적 감정 역동성, 어텐션 분포 및 감정 임베딩을 공개할 수 있는 시각화 프레임워크를 구축한 연구는 소수에 불과합니다. 이러한 단점들은 상호작용 중심의 시각적 매핑과 강력한 교차 모달 학습을 결합한, 지능형 인간-기계 상호작용을 위한 해석 가능한 멀티모달 프레임워크의 필요성을 보여줍니다.
본 연구는 지능형 인터페이스 설계에서 다중 모달 감정 측면의 시각적 매핑을 위한 해석 가능한 프레임워크를 제시합니다. 이 시스템은 수동으로 생성된 특성 없이도 엔드-투-엔드 딥러닝을 사용하여 텍스트, 오디오 및 시각적 모달리티에서 고수준의 감정 표현을 추출합니다. 교차 모달 감정 상호작용은 감정 특이적 정보와 모달리티 특이적 정보를 분리하는 그래프 기반 어텐션 퓨전 메커니즘을 사용하여 모델링되며, 이를 통해 얽힘 해제된 표현 학습(disentangled representation learning)을 가능하게 하여 해석력과 강건성을 향상시킵니다. 또한, 시간적 감정 역학, 교차 모달 어텐션 패턴 및 감정 임베딩을 보여주기 위해 다중 뷰 시각화 모듈이 구축되었습니다. 제안된 프레임워크의 효능과 지능형 인간-기계 상호작용 시스템에서의 적합성은 벤치마크 다중 모달 감정 인식 데이터셋에 대한 검증을 통해 평가되었습니다.
본 연구는 기존의 예측 중심 접근 방식에서 벗어나, 현재의 멀티모달 감정 인식 시스템에서 나타나는 교차 모달 상호작용의 모델링 부족과 제한된 해석 가능성을 극복하기 위해 멀티모달 감정 측면의 시각적 매핑을 위한 독창적인 프레임워크를 제공합니다. 제안된 접근 방식은 단일 아키텍처 내에서 트랜스포머 기반의 멀티모달 표현 학습, 얽힘 해제된 감정 인지 특징 모델링, 그래프 기반 교차 모달 어텐션 퓨전 및 상호작용 중심 시각화를 결합합니다. 분류 성능에 주로 집중하는 기존 방식과 달리, 본 프레임워크는 감정 특이적 표현과 모달리티 특이적 표현을 명확히 분리하여 해석 가능성, 강건성 및 교차 모달 일관성을 향상시킵니다. 또한, 텍스트, 오디오 및 시각적 모달리티 간의 미세한 감정 상호의존성을 캡처하여 모달 간 상호작용의 적응적 모델링이 가능한 그래프 기반 어텐션 메커니즘을 제시합니다. 모델의 의사 결정 과정에 대한 직관적인 통찰력을 제공하기 위해 시간적 감정 궤적, 교차 모달 어텐션 패턴 및 잠재 감정 임베딩을 드러내어 투명성을 높이는 멀티뷰 시각적 매핑 모듈을 구축하였습니다. CH-SIMS 및 CMU-MOSEI 벤치마크 데이터셋에 대한 실험적 평가 결과, 멀티모달 감정 역동성의 시각화 및 해석 가능성이 향상되었을 뿐만 아니라 정확도, F1-score, 평균 절대 오차 및 상관관계 측면에서 경쟁력 있는 성능을 보여주었습니다.
본 연구는 다중 모달 감정 특징의 시각적 매핑을 위한 해석 가능한 프레임워크를 제공함으로써 지능형 상호작용 설계를 개선하는 것을 목표로 합니다. 본 연구에서는 공개적으로 접근 가능한 CH-SIMS 및 CMU-MOSEI 데이터베이스를 사용하였습니다. 두 데이터셋 모두 공식 출처에서 획득하였으며, 각 제작자가 정한 사용 지침, 연구 표준 및 라이선스 약관을 준수하여 활용하였습니다. 텍스트, 오디오, 비디오 데이터를 포함한 데이터셋의 다중 모달 콘텐츠는 데이터 제공자가 승인된 참가자 동의 및 데이터 수집 프로토콜에 따라 먼저 수집하고 주석을 달았습니다. 본 연구에서는 직접적인 인간 상호작용, 새로운 참가자 모집, 개인 식별 정보의 수집이 이루어지지 않았습니다. 모든 분석은 공개적으로 사용 가능한 연구 데이터셋을 사용하여 수행되었습니다. 따라서 본 2차 데이터 분석은 추가적인 윤리적 승인이나 기관생명윤리위원회(IRB)의 심의가 필요하지 않았습니다. 본 연구는 공개 데이터셋 사용을 규제하는 적절한 기관 규범, 윤리적 연구 절차 및 관련 데이터 사용 정책을 준수하여 수행되었습니다.
이해도를 높이기 위해 감정 또는 모달리티 특이적 특성을 사용하여 여러 모달리티에 걸친 감정 특성을 학습하는 그래프 기반 교차 모달리티 어텐션 메커니즘이 채택되었습니다. 실시간 감정 인식 인터랙티브 디자인을 강화하기 위해 다중 뷰 시각적 매핑 구성 요소가 사용되었으며, 감정 인식을 위한 해당 구성 요소의 효율성이 추정되었습니다. 연구 결과, 제안된 방법이 실제 환경의 감정 인식 지능형 사용자 인터페이스에 대한 해석 가능성과 효율성을 모두 향상시키는 것으로 나타났습니다. 그림 1은 제안된 연구의 아키텍처 워크플로우를 보여줍니다. 그림 1은 지능형 상호작용 시스템 맥락에서 다중 모달리티 감정 특징 학습을 위해 제안된 시각적 매핑 프레임워크의 전체 워크플로우를 보여줍니다. 워크플로우는 텍스트, 오디오, 비디오라는 세 가지 동기화된 입력 모달리티로 시작되며, 이는 각각 언어적, 운율적, 얼굴 표정 모달리티로부터 상호 보완적인 감정 정보를 캡처합니다. 모달리티 특이적 트랜스포머 인코더가 각 모달리티를 처리하여 원시 입력 데이터의 고수준 표현을 얻습니다. 이후 이 표현들은 얽힘 해제 표현 학습 모듈로 전달되며, 여기서 서로 다른 데이터 소스 전반에 걸쳐 학습된 감정의 일관성을 보장하기 위해 감정 특이적 임베딩이 모달리티 특이적 특징으로부터 분리됩니다. 각 모달리티의 감정 특이적 임베딩은 이후 그래프 기반 교차 모달리티 어텐션 네트워크에 의해 집계되며, 이 네트워크는 모달리티 간 감정 의존성을 모델링하고 상호작용 맥락에 따라 각 모달리티에 동적 중요도 가중치를 할당합니다. 마지막으로, 이 프레임워크는 감정 분류 출력과 상호작용 통찰력을 모두 제공하여, 투명한 감정 인식 의사 결정과 적응형 지능형 상호작용 디자인을 용이하게 합니다.
다중 모달 데이터 획득
CH-SIMS 및 CMU-MOSEI 데이터셋은 동기화된 비디오, 오디오 및 텍스트와 같은 멀티모달 정보를 수집한 기존의 두 가지 공개 도메인 멀티모달 데이터셋입니다. CH-SIMS 데이터셋은 영화, TV 드라마 및 예능 프로그램의 여러 비디오 세그먼트에서 추출된 2,281개의 비디오 세그먼트를 포함하며, 중국인에 대한 멀티모달 조사를 구성합니다. 이러한 비디오 세그먼트에 해당 오디오와 텍스트가 추가됨으로써, 멀티모달 데이터를 이용한 감정의 멀티모달 분석 연구가 더욱 흥미롭고 실행 가능해졌습니다. 한편, 의견, 느낌 및 감정 조사를 위한 최대 규모의 멀티모달 데이터셋 중 하나인 CMU-MOSEI 데이터셋은 다양한 주제에 대해 1,000명 이상의 화자가 말한 23,000개 이상의 비디오 클립에서 수집되었습니다. 이 데이터셋은 클래스 분포를 유지하면서 훈련(70%), 검증(15%) 및 테스트(15%) 서브셋으로 무작위 분할되었습니다.
텍스트 전사, 오디오 신호 및 비디오 프레임을 획득하고, 이를 세밀한 시간적 수준에서 일치하도록 타임스탬프 정렬을 수행합니다. 프레임 수준의 통합을 통해 제안된 표현 학습 및 그래프 기반 융합 메커니즘이 시각적 표현, 음성 톤 및 언어적 내용에서 발생하는 정서적 콘텐츠를 공동으로 모델링하고 활용할 수 있도록 합니다. 이러한 유형의 다중 모달 획득 기술은 모달 간의 정서적 역동성을 효과적으로 추출할 수 있게 하며, 이는 지능형 상호작용 설계와 이해 가능한 시각적 매핑에 필수적입니다.
표 1은 제안된 방법에 사용된 멀티모달 감정 데이터셋의 주요 구조를 나타냅니다. 말소리, 음성 억양, 얼굴 표정과 같이 더 넓은 범위의 관련 감정을 얻기 위해, CH-SIMS와 CMU-MOSEI는 해당 데이터셋의 비디오, 오디오 및 텍스트 모달리티를 통합합니다. 또한, CH-SIMS에서는 제한된 수의 데이터 샘플을 사용할 수 있어 중국 내 모달리티 상호작용 및 감정 변화에 대한 철저한 조사가 가능합니다. 반면, CMU-MOSEI 데이터셋은 다양한 언어, 피험자 및 주석 처리된 감정 수준에 걸쳐 방대한 양의 데이터를 포함하고 있어, 본 연구에서 다루는 표현 학습 및 관련 시각화 알고리즘의 내구성을 평가하는 데 더욱 중요합니다. 아울러, 이전 연구와 비교하여 모델을 테스트할 때 정보 선택의 어려움을 줄여줍니다.
다중 모달 전처리 및 동기화
CH-SIMS 및 CMU-MOSEI 데이터셋의 타임스탬프 주석을 사용하여 텍스트, 오디오 및 시각적 모달리티를 동기화함으로써 일관된 멀티모달 표현 학습을 보장하였습니다. 각 발화는 기본 분석 단위로 기능하였으며, 동일한 시간 간격 내의 일치하는 오디오 및 비디오 세그먼트와 연결되었습니다. 정렬은 발화 수준에서 수행되었습니다. 전사물은 각 발화의 시작 및 종료 타임스탬프를 기준으로 세그먼트로 분할되었습니다. 동일한 시간 간격 내에 포함되는 해당 비디오 프레임과 오디오 신호를 추출함으로써 전사물-오디오-시각적 대응 관계를 설정하였습니다. 오디오 세그먼트는 Wav2Vec 2.0을 사용하여 음향 표현을 생성하도록 처리되었으며, 비디오 세그먼트의 시각적 프레임은 미리 정해진 비율로 샘플링되어 Vision Transformer (ViT)를 통해 인코딩되었습니다. 발화 전사물로부터 텍스트 임베딩을 생성하기 위해 RoBERTa 인코더가 사용되었습니다. 세 가지 모달리티가 서로 다른 길이의 특징 시퀀스를 생성하므로, 모든 모달리티 특징을 단일 발화 경계에 맞춤으로써 시간적 동기화를 달성하였습니다. 가변적인 길이의 시퀀스를 정규화하기 위해 고정 길이 형식을 사용하였습니다. 더 긴 시퀀스는 허용된 최대 시퀀스 길이로 단축되었으며, 더 짧은 시퀀스는 제로 패딩되었습니다. 학습 과정에서는 어텐션 마스크를 사용하여 패딩된 요소와 실제 특징 위치를 분리하였습니다. 모달리티 간의 서로 다른 시퀀스 길이를 극복하기 위해, 모달리티별 임베딩은 융합 전 공통 잠재 공간으로 투영되었습니다. 이를 통해 차원 일관성을 보장하고, 그래프 기반 어텐션 메커니즘이 성공적인 교차 모달 상호작용 학습을 촉진할 수 있도록 하였습니다. 데이터 품질과 동기화 무결성을 유지하기 위해, 파일이 손상되었거나 주석이 누락되었거나 모달리티 정보가 불완전한 샘플은 연구에서 제외되었습니다.
트랜스포머 기반 특징 추출
다중 모달리티 데이터를 정렬하고 필요한 전처리를 수행한 후, 시각, 오디오, 텍스트와 같은 여러 모달리티의 정보로부터 고수준의 감정 인식 특징 표현을 엔드투엔드(end-to-end) 방식으로 학습하기 위해 딥러닝 방법이 사용됩니다. 제안된 방법은 트랜스포머 인코더를 사용하여 가공되지 않은 다중 모달리티 데이터로부터 본질적으로 판별 가능한 특징 표현을 학습함으로써 특징 공학(feature engineering)의 필요성을 제거합니다. 제안된 접근 방식에 사용되는 데이터셋 간의 일관성을 용이하게 하기 위해, 각 모달리티에 대해 고정 크기의 임베딩을 학습합니다. 예를 들어, 이미지, 오디오, 텍스트 모달리티를 포함한 각 개별 모달리티에서 768차원의 특징 임베딩을 학습하며, 이는 전체 접근 방식에서 사용되는 통합 특징 공간을 형성합니다. 특히, 다양한 크기의 데이터에서 고수준 특징을 학습하기 위해 제안된 CH-SIMS 데이터셋과 CMU-MOSEI 데이터셋 전반에 걸쳐 사용되는 특징 추출 방식에 적용됩니다.
시각적 모달리티: 감정 인식 프레임 임베딩을 위한 비전 트랜스포머
감정과 관련된 공간적 표현을 얻기 위해 비디오 프레임에서 시각적 정보를 추출하는 Vision Transformer (ViT-Base) 모델이 사용되었습니다. 특징을 추출하기 전에 각 비디오 세그먼트의 프레임을 (224 × 224) 픽셀로 크기를 조정하고 일정한 시간 간격으로 샘플링하였습니다. 16 × 16 픽셀의 패치 크기를 사용하여 ViT-Base 아키텍처는 12개의 트랜스포머 인코더 레이어에 의해 처리되는 일련의 시각적 토큰을 생성합니다. 추출된 프레임 수준의 표현은 사전 학습된 ViT 모델을 시각적 백본으로 사용하여 768차원의 임베딩 공간으로 투영되었습니다. 각 세그먼트에 대한 최종 시각적 표현을 생성하기 위해 평균 풀링(mean pooling)을 사용하여 프레임 수준의 임베딩을 집계하였습니다. 학습 과정에서는 일반화 성능을 높이기 위해 이미지 정규화와 무작위 크롭(random cropping) 및 수평 뒤집기(horizontal flipping)와 같은 일반적인 증강 방법을 사용하였습니다. 이후 제안된 멀티모달 퓨전 프레임워크를 사용하여 이러한 시각적 임베딩을 텍스트 및 오디오 표현과 결합하였습니다.
감정의 시간적 역동성을 유지하기 위해, 시각적 모달리티에 대해 CH-SIMS 및 CMU-MOSEI 데이터셋의 비디오 샘플을 균일하게 샘플링합니다. 각 비디오의 프레임
은 N개의 고정 크기 섹션으로 나눌 수 있으며, 이후 이를 평탄화하여 차원이
인 잠재 임베딩 공간으로 역전송합니다. 위치 임베딩과 학습 가능한 그룹화 토큰을 추가하여 시리즈를 생성합니다.
(1)
여기서
(은)는 위치 인코딩을 나타내며,
(은)는 패치 임베딩 행렬이다.
피드포워드 네트워크와 멀티헤드 셀프 어텐션으로 구성된 적층형 트랜스포머 인코더 층은 임베딩된 패치 시퀀스를 처리하는 데 사용됩니다. l번째 층에서의 변환은 다음과 같이 기술됩니다:
(2)
(3)
감정 인식 시각적 특징 벡터를 얻기 위해, 클래스 토큰에 해당하는 출력을 특징 벡터
로 추출합니다. 데이터셋 간의 언어 및 내용 차이에도 불구하고 일관된 시각적 감정 표현을 구현하기 위해, 각 비디오 세그먼트의 프레임 레벨 임베딩을 결합하여 얼굴 표정과 감정의 변화 과정을 포착합니다.
운율 및 의미론적 음향 임베딩을 위한 Wav2Vec 2.0 기반 오디오 모달리티 사전 훈련된 Wav2Vec 2.0 인코더를 음향 백본으로 사용하여 문맥화된 음성 임베딩을 생성했습니다. 평균 풀링을 통해 출력 은닉 표현을 집계하여 각 구절에 대한 고정 길이 음향 특징 벡터를 얻었습니다. Wav2Vec 2.0 모델은 오디오 신호에서 문맥 및 감정 관련 음성 특성을 포착하기 위해 음향 표현을 추출하는 데 사용되었습니다. 특징 추출 전, 오디오 녹음물은 정규화 및 16 kHz로 리샘플링되었습니다. 텍스트 및 시각적 모달리티 간의 동기화를 보장하기 위해, 데이터셋 주석에서 제공된 타임스탬프 경계를 사용하여 각 발화 수준의 오디오 세그먼트를 분리했습니다. 사전 훈련된 음향 인코더는 모델 훈련 과정에서 조정되어 작업별 적응력을 높였으며, 이를 통해 도출된 표현이 음성 신호의 감정적 측면을 더 정확하게 나타낼 수 있도록 했습니다. 이후 최종 오디오 임베딩을 사용하여 그래프 기반 교차 모달 어텐션 퓨전 및 얽힘 해제 표현 학습을 수행했습니다.
오디오 모달리티에서는 Wav2Vec-2.0을 사용하여 CH-SIMS 및 CMU-MOSEI 데이터셋의 초기 음성 정보에서 유도된 음성 신호를 모델링하며, 감정과 관련된 오디오 특징을 직접 추출합니다. 각 입력 음성 신호에 대해 다음과 같은 합성곱 특징 인코딩이 존재합니다
:
(4)
여기서 Z는 멜로디, 톤, 에너지와 같은 저수준 운율 특성을 나타냅니다. 트랜스포머 기반의 컨텍스트 네트워크는 앞서 언급한 구조들에 유용하며, 장기적인 시간 기반 의존성을 표현합니다:
(5)
감정 표현에 필수적인 운율 및 의미론적 음향 데이터가 이러한 문맥적 음향 표현에 포함됩니다. 시간적 풀링 과정을 수행하여 특정 길이의 오디오 임베딩을 생성합니다.
(6)
이 설계는 MFCC와 같은 음향 특징의 사용을 배제하며, 파형에서 표현형을 단순히 추출함으로써 CMU-MOSEI의 영어 음성 데이터와 CH-SIMS의 중국어 음성 데이터를 통해 내구성을 달성합니다.
문맥적 감정 임베딩을 위해 RoBERTa를 이용한 텍스트 모달리티
텍스트 모달리티의 경우, 두 데이터 세트의 음성 전사본에서 문맥적 의미와 정서적 의미를 생성하기 위해 심층 양방향 트랜스포머인 RoBERTa를 적용하였습니다. 전사 데이터에서 문맥적 의미 및 감정 정보를 포착하기 위해 RoBERTa 기반의 트랜스포머 인코더를 사용하여 텍스트 표현을 추출하였습니다. 영어 CMU-MOSEI 데이터 세트에는 사전 학습된 RoBERTa 모델을 사용하였으며, 중국어 CH-SIMS 데이터 세트에는 각 언어 특유의 언어적 특징을 더 잘 반영하기 위해 중국어 RoBERTa 변형 모델을 사용하였습니다. 텍스트 전처리에는 각 언어에 적합한 RoBERTa 토크나이저를 이용한 토큰화와 텍스트 정규화가 포함되었습니다. 일관된 배치 처리를 위해 입력 시퀀스는 토큰 임베딩으로 변환되었으며, 미리 정해진 최대 시퀀스 길이에 맞추어 패딩 처리되거나 잘라내어 조정되었습니다. RoBERTa 입력 형식에 따라 특수 분류 및 구분자 토큰을 도입하였습니다. 트랜스포머 인코더가 생성한 문맥화된 토큰 표현들을 최종 [CLS] 등가 문장 표현을 통해 집계함으로써 고정 길이의 텍스트 임베딩을 얻었습니다. 학습된 표현을 감정 인식 작업에 적응시키기 위해, 사전 학습된 RoBERTa 인코더를 멀티모달 학습을 통해 미세 조정하였습니다. 이후 제안된 멀티모달 융합 프레임워크를 사용하여 텍스트 임베딩을 오디오 및 시각적 특징과 병합하였습니다.
각 토큰화된 입력에 대해 토큰 임베딩과 위치 인코딩을 결합하여
, 다음과 같이 알려진 심층 양방향 변환 기술의 입력 표현을 생성할 수 있습니다.
(7)
이 형태는 단어 간의 문맥 의존성을 발견하기 위해 셀프 어텐션(self-attention)을 사용하는 L 트랜스포머의 레이어들을 통해 표현됩니다:
(8)
문맥적 감정 임베딩은 분류 토큰의 최종 은닉 상태를 사용하여 얻습니다:
(9)
감성 극성, 강렬한 감정 및 그와 관련된 함의는 이 임베딩으로 표현될 감정 관련 언어적 특성의 예시입니다. RoBERTa는 언어 불가지론적 모델링을 더 용이하게 만듭니다. 이를 통해 시스템은 CMU-MOSEI 데이터셋의 영어 텍스트와 CH-SIMS 데이터셋의 중국어 텍스트 모두에 대해 동일한 임베딩 크기를 사용할 수 있습니다.
제안된 딥 특징 표현 학습 단계를 통해 시각적 fv, 오디오 fa, 텍스트 ft 각 모달리티에 대해 768차원의 세 가지 모달리티 특화 특징 벡터가 추출됩니다. 지능형 상호작용 설계에서 이러한 학습된 표현들은 통합된 멀티모달 특징 공간을 생성하며, 이는 특징 레벨의 시각적 매핑, 그래프 기반 교차 모달 융합 및 얽힘 해제된 표현 학습의 기초가 됩니다.
얽힘 해제 표현 학습
심층 특징 표현(deep feature representation)을 학습한 후, 시각, 청각 및 텍스트 모달리티의 멀티모달 특징 벡터에 대한 추가 처리를 통해 분리된 감정 기술을 도출할 수 있습니다. 이전 단계에서 사용된 청각, 시각 및 텍스트 모달리티의 모달리티별 특징 임베딩이 각각 fv, fa , ft로 표현되어
및
일 때, 이 단계의 목적은 각기 다른 모달리티의 이전 세만틱을 고려하여 감정 기술을 포함하는 두 개의 뚜렷한 잠재 묘사(latent depictions)로 모든 모달리티 특징을 인수분해하는 것입니다.
이는 각 모달리티 특징 fm 을 두 개의 병렬 투영 네트워크인 감정 인코더
와 모달리티 인코더
에 입력하여 두 가지 인코딩을 생성함으로써 수행됩니다.
(10)
여기서
은 감정과 연결된 잠재 특징을 나타내며,
은 특정 모달리티에 특화된 잠재 특징을 나타냅니다. 이를 통해 감정 특이적 임베딩이 각 모달리티와 관련된 고유한 구조적 데이터를 유지하면서 오디오, 시각 및 텍스트를 포함한 다중 입력에 걸쳐 반복적으로 공간과 통신할 수 있게 됩니다.
독립 제약 조건을 통한 재구성을 통해 효과적인 분리가 이루어집니다. 원래 모달리티 특징의 재구성은 다음과 같이 정의됩니다:
(11)
여기서
은 디코더 네트워크입니다. 재구성 손실은 다음 데이터를 보존합니다:
(12)
또한, 감정과 양식(modality) 특이적 묘사 사이의 직교성 또는 상관관계 제거(decorrelation)로 인해 정보의 중첩이 제한되는 경우가 많습니다:
(13)
이러한 목표를 달성함으로써, 모델은 신뢰할 수 있고 이해 가능하며 모달리티 가변성에 강한 감정 표현을 학습할 수 있습니다. 이후의 그래프 기반 교차 모달 융합 및 시각적 매핑 특성, 특히 지능형 상호작용 설계의 경우, 해석 가능하고 구조화된 감정 표현에 크게 의존합니다.
양식 간의 감정 일관성
감정 일관성을 추가하면 모달리티 간 융합의 효율성이 분명하게 향상됩니다. 이는 모달리티별 감정 임베딩이 잠재 공간을 공유하므로, 융합 전략이 두 표현 사이의 큰 격차를 고려할 필요가 없기 때문입니다. 두 감정의 결합된 도식은 다음과 같이 기술됩니다
. 감정 특이적 표현들이 일관될 때, 다양한 모달리티에서 오는 신호 간의 변동이 더 이상 결과에 영향을 미치지 않으므로 가중 융합이 더 안정적이게 됩니다.
(14)
정서 정보의 시맨틱 정렬(semantic alignment)을 강제함으로써, 이 목표는 모달리티 간의 불일치를 최소화하고 표현에 사용된 모달리티와 관계없이 정서 인지가 일관되게 유지되도록 합니다. 결과적으로 음성 신호, 얼굴 표정 및 언어적 내용에서 얻은 정서적 단서들을 투영함으로써 응집력 있는 정서적 표현 공간이 생성됩니다.
교차 모달 융합에 미치는 영향
모달리티 간에 감정 일관성이 도입되면 교차 모달 융합이 더욱 효과적으로 이루어집니다. 감정 특이적 임베딩이 공통 잠재 공간에서 정렬되기 때문에, 융합 메커니즘이 더 이상 상당한 모달 간 표현 격차를 보완할 필요가 없습니다. 융합된 감정 표현은 다음과 같이 정의됩니다:
(15)
여기서 αm 은 모달리티 m에 부여된 어텐션 가중치를 나타냅니다. 정서 특이적 표현들이 일관될 때, 퓨전 결과가 상충하는 모달리티 신호보다는 상호 보완적인 정서적 근거를 보여주므로 가중 퓨전이 더 안정적이고 이해하기 쉬워집니다.
수학적으로, 낮추는 것은
~와 관련된 다양한 감정 특이적 표현 유형 간의 분산
~와 동일합니다:
(16)
여기서
은(는) 평균 감정 표현을 나타냅니다. 분산을 줄이면 입력 모달리티가 모달리티 노이즈보다는 정밀한 감정적 중요도에 따라 가중치가 부여되어, 네트워크 수렴도가 향상되고 더 정확한 어텐션 평가가 가능해집니다.
분리된 감정 시각화의 최종 학습 목표는 단편화, 재구성 및 감정 균일성을 결합하는 것입니다.
(17)
두 개의 하이퍼파라미터 λ1과 λ2가 교차 모달 감정 신뢰도와 분리 간의 관계를 제어합니다. 제안된 모델은 이를 달성하기 위해 모달리티 불변적이고 해석 가능하며 융합 가능한 감정 표현을 습득하며, 이는 지능형 인터페이스 설계에서 향후 그래프 기반 융합 및 특징 수준 표현을 위한 견고한 기반을 제공하는 데 중점을 둡니다.
그래프 기반 교차 모달 주의 집중 융합
모달리티 간의 세밀한 감정 관계를 시뮬레이션하기 위해 그래프 기반의 교차 모달 어텐션 네트워크(cross-modal attention network)가 사용되었습니다. 모달리티 간의 정보 흐름을 촉진하기 위해 각 모달리티별 임베딩(텍스트, 오디오, 시각)을 그래프 노드로 나타내는 완전 연결 멀티모달 그래프를 구축하였습니다. 모달리티 관계를 통해 그래프 인접 행렬을 생성하였으며, 이는 학습 가능한 어텐션 방법을 통해 개선되었습니다. 여러 어텐션 헤드의 출력을 연결하고 투영하여 공유 잠재 공간을 생성하였습니다. 그 다음, 어텐션 가중치 풀링을 사용하여 노드 표현을 집계함으로써 통합된 멀티모달 감정 표현을 생성하였습니다. 상호작용 인식 분석 및 감정 인식을 위한 예측 및 시각화 모듈은 이 융합된 표현을 전달받았습니다. 그래프 융합 모듈은 256의 은닉 표현 차원과 각각 8개의 어텐션 헤드를 가진 2개의 그래프 어텐션 레이어로 구성되었습니다. 인접 모달리티의 상대적 중요도를 확인하기 위해 연결된 노드 간의 어텐션 계수를 계산하고 softmax 함수를 사용하여 표준화하였습니다. 각 그래프 어텐션 레이어 이후에는 훈련 안정성을 높이고 과적합을 줄이기 위해 레이어 정규화, 잔차 연결 및 0.2의 드롭아웃 비율을 적용하였습니다. 여러 어텐션 헤드의 출력을 공통 잠재 공간에 연결하고 투영한 후, 어텐션 가중치 풀링을 사용하여 노드 표현을 하나의 멀티모달 감정 임베딩으로 결합하였습니다. 이후, 융합된 표현은 다중 뷰 시각적 매핑 및 감정 예측에 사용되었습니다.
멀티헤드 그래프 어텐션을 사용하여 다양한 교차 모달 상호작용을 캡처하였습니다. 모든 노드에 대해 연결된 노드 간의 어텐션 계수를 정규화하기 위해 소프트맥스 함수가 사용되었습니다. 훈련 안정성을 높이고 과적합을 방지하기 위해, 그래프 퓨전 모듈의 적층된 그래프 어텐션 레이어 뒤에 잔차 연결, 레이어 정규화 및 드롭아웃 정규화를 적용하였습니다.
항들이 각각 시각, 오디오 및 텍스트 모달리티를 통해 수집된 특정 감정에 대응하는 표현을 나타내며, 각 구성 요소는 공유 잠재 공간
내에 존재합니다. 모달리티 노드 모델은 그래프
표기법을 사용하며, 집합
의 노드들이 세 가지 모달리티 노드 자체에 대응하여, 다양한 모달리티 표현 간에 공유되는 감정적 의존성을 명시적으로 강화합니다.
그래프의 각 노드에 감정 특화 특성 벡터를 할당하면 다음과 같습니다:
(18)
미리 결정되거나 고정된 융합 가중치를 사용하는 전통적인 융합 방법과 달리, 제안된 방법은 채널 간 및 감정 상황 간의 중요도와 상호 의존성을 기반으로 적응형 엣지 가중치를 학습합니다.
교차 모달 융합을 위해 그래프 어텐션 네트워크(GAT)가 활용됩니다. 각 노드 i와 그 인접 노드, 즉 노드 j에 대해 어텐션 계수가 계산됩니다:
(19)
모드 j에서 양식 i로 전환할 때의 정서적 효과는 정규화된 가중치 αij로 측정됩니다.
다음으로, 각 모달리티 노드의 융합된 외형은 인접 노드들의 가중치 그룹화로 계산됩니다:
(20)
여기서 활성화 함수
은 비선형입니다. 최종적으로, 각 노드의 업데이트된 특징들이 결합되어 전역 융합 감정 표현을 얻습니다:
(21)
이 기술은 다양한 모달리티로부터 보완적인 정보를 캡처하는 동시에 복잡한 모달리티 간 관계를 유지하므로, 해석 가능한 감정 모델링 및 후속 시각적 매핑에 매우 유용합니다.
알고리즘 1 (보충 파일 1)은 그래프 기반 교차 모달 융합을 수행하기 위한 일반적인 체계를 제공합니다. 우선, 시각, 오디오 및 텍스트 모달리티 각각에 연결된 감정 특화 특성을 사용하여 그래프를 생성합니다. 그런 다음 감정적 의존성의 조합을 나타내는 각 그래프 노드 쌍에 대한 어텐션 점수를 계산합니다. 이후 어텐션 점수를 정규화하여 특정 감정 맥락에 대한 각 모달리티의 상대적 기여도를 나타내고, 이를 통해 어텐션 가중치를 학습합니다. 마지막 단계에서는 그래프 노드와 관련된 특성들을 집계하여 일반 감정 임베딩을 생성합니다. 이러한 관점에서, 특정 감정과 연결된 멀티모달 특성을 융합하는 이 알고리즘의 일반적인 방식은 적응성, 해석 가능성 및 맥락적 지능 측면에서 유망함을 보여줍니다.
그림 2는 멀티모달 감성 융합을 위해 제안된 교차 모달 어텐션 네트워크의 구조와 작동 원리를 보여줍니다. 텍스트, 청각 및 비디오 모달리티에 대해 독립적으로 도출된 감정 특이적 임베딩은 먼저 모달리티 수준 어텐션 메커니즘을 통해 전달되며, 여기서 주어진 감정적 맥락에 따른 언어적, 음성적 및 안면 정보의 상대적 중요도를 학습합니다. 이후 모달리티의 어텐션 가중치 표현들이 결합되어 통합된 감정 임베딩을 형성하며, 이때 어텐션 행렬은 모달리티 간의 의존성과 상호작용 강도를 포착합니다. 네트워크에 의해 학습된 어텐션 행렬은 각 모달리티의 기여도를 동적으로 조절하여, 노이즈가 많고 정보량이 적은 모달리티는 무시하고 가장 강력한 지침 모달리티에 집중할 수 있게 합니다. 이렇게 융합된 감정 표현을 통해 중립, 포용, 걱정과 같은 감정 상태의 정확한 감정 인식 및 세밀한 분석이 가능해집니다.
시각적 매핑 모듈
이 목적을 위해 특별히 제작된 시각적 매핑 섹션의 도움을 받아, 지능형 인터랙션 디자이너는 그래프를 기반으로 교차 모달 융합 프로세스 이후의 정서 상태에 대한 통합된 표현을 이해하기 쉽고 즉각적으로 소비 가능한 시각적 형태로 변환할 수 있습니다.
잠재적 감정 표현을 더 쉽게 파악하기 위해, 학습된 다중 모달 감정 임베딩을 시각화하는 차원 축소 기법이 사용되었습니다. 주성분 분석(PCA)을 사용하여 대부분의 분산을 유지하면서 특성 차원을 축소한 후, t-분포 확률적 이웃 임베딩(t-SNE)을 사용하여 임베딩을 2차원 공간으로 투영하여 표시하였습니다. t-SNE에는 perplexity 30, 학습률 200, 그리고 1,000회의 최적화 반복 횟수가 적용되었습니다. 얻어진 투영 결과를 통해 감정별 클러스터와 모달리티 간의 관계를 시각화하였습니다. 그래프 기반 어텐션 네트워크를 통해 얻은 정규화된 교차 모달 어텐션 가중치를 사용하여 어텐션 히트맵을 생성하였습니다. 이 히트맵에는 감정 예측 과정에서 텍스트, 오디오, 시각 모달리티의 상대적 기여도가 묘사되어 있습니다. 학습된 어텐션 계수를 엣지 가중치로 사용하여 교차 모달 상호작용 그래프를 생성하였으며, 이를 통해 융합 프레임워크 내부의 모달 간 관계와 정보 흐름을 시각적으로 검토하였습니다. 시간적 감정 역동성을 조사하기 위해 연속적인 발화에 따른 잠재적 감정 임베딩의 발달 과정을 모니터링하여 감정 궤적 도표를 작성하였습니다. 이러한 궤적은 시간이 지남에 따라 감정 상태와 모달리티 기여도가 어떻게 진화하는지를 보여줍니다. 모든 시각 자료를 생성하는 데는 Python 패키지인 Matplotlib과 Scikit-learn이 사용되었습니다. 해석 가능성, 클러스터 형성, 모달리티 기여도 및 시간적 감정 역동성을 평가하기 위해 임베딩 시각화, 상호작용 그래프 및 어텐션 히트맵에 대한 정성적 분석을 수행하였습니다.
변수
가 그래프 어텐션 네트워크 함수에 의한 정서 상태의 융합된 표현을 나타낸다고 가정합니다. 정서 상태 플롯의 출력 수준 시각화와 대조적으로, 이 모듈의 주요 목표는 정서 상태 표현과 어텐션 메커니즘의 해당 가중치를 이해 가능한 시각적 형태로 변환하는 것입니다.
학습된 αji를 사용하여 각 모달리티의 기여도를 시각적으로 검토하기 위한 어텐션 히트맵을 생성합니다. 그 다음, 들어오는 어텐션 가중치들을 합산하여 각 모달리티에 대한 종합 중요도 점수를 결정합니다:
(22)
여기서 si 는 양식(modality) I의 상대적인 정서적 기여도를 나타냅니다. 어텐션 히트맵(attention heatmap) 생성을 돕기 위해, 얻어진 값들은 정규화되어 컬러 맵에 매핑되며, 이를 통해 사용자는 다양한 시간 단계 또는 상호작용 상태에서 지배적인 양식을 쉽게 식별할 수 있습니다. 이러한 인터페이스는 다양한 시각적, 청각적 또는 텍스트 입력 양식을 통해 사용자가 시스템의 어텐션 메커니즘이 어떻게 작동하는지 이해하도록 돕습니다.
학습된 그래프는 인간 감정의 교차 모달리티 의존성을 나타내기 위해 특별히 "가중치 상호작용 그래프"로 모델링되었습니다. 각 노드는 모달리티 자체를 나타내며, 인간 감정과 관련된 상호작용의 강도는 노드를 연결하는 엣지의 가중치 αji 형태로 표현됩니다. 위의 가중치 그래프는 인간 감정 상호작용의 강도를 보여줍니다. i와 j의 정의는 다음과 같습니다.
(23)
이러한 가중치 덕분에 그래프 시각화의 선 두께나 투명도가 적절하게 표시됩니다. 이를 통해 각 모달리티가 어떻게 상호작용하는지 더 쉽게 이해할 수 있습니다. 설계자는 교차 모달 상호작용 그래프의 도움을 받아 융합 과정에서 정서적 지표들이 어떻게 상호작용하는지 더 잘 파악할 수 있습니다.
다양한 시간 단계에서의 융합된 감정 임베딩
은 시간적 감정의 변화를 시각화하기 위해 PCA 또는 t-SNE와 같은 차원 축소 알고리즘을 통해 저차원 공간으로 축소됩니다:
(24)
여기서 투영 함수는
로 표현됩니다. 상호작용에서의 감정 전이, 강도 및 안정성을 보여주는 2D/3D 감정 궤적의 등장은 시간에 따른 감정 상태의 진화를 직관적으로 묘사한 것으로 해석될 수 있습니다. 이러한 측면들은 지능형 상호작용, 의사결정 및 실시간 모니터링에 활용될 수 있습니다.
단순히 특정 클래스나 점수로 매핑하는 기존의 감정 시스템과 달리, 이 시스템은 인간의 감정이 시스템 내에서 어떻게 형성되는지를 보여주는 데 중점을 둡니다. 가중치 요인, 모델 간의 상호작용 및 그에 따른 경로를 포함하여 중간 특성을 시각화함으로써 의사 결정 과정을 드러냅니다. 이를 통해 사용자는 시각적, 음성적 또는 언어적 요인이 인간의 감정에 대한 응답을 생성하는 데 각각 어떤 영향을 미치는지 이해할 수 있습니다.
따라서 시각적 표현을 통해 감정을 이해 가능한 형태로 매핑함으로써, 딥러닝 방법을 이용한 감정 분석과 지능형 인터페이스 설계를 위한 통합 사이의 간극을 메울 수 있습니다. 두 가지 접근 방식에서 수집된 데이터는 더 정밀한 사용자 인터페이스를 구축하는 데 사용될 수 있습니다. 결과적으로 제안된 접근 방식은 인터랙션 디자이너에게 더 정밀한 사용자 인터페이스를 제작하기 위한 필수적인 정보를 제공할 수 있습니다. 다시 말해, 감정 이해가 인터랙션 설계의 매우 능동적인 부분이 되는 것입니다. 감정 이해가 인터랙션 설계에 적극적으로 통합될 때만이 정확도를 높일 수 있습니다.
시각적 매핑 모듈은 서로 연결되어 있으나 서로 다른 몇 가지 방식을 통해 설명 가능성을 구현합니다. 특성 수준의 설명 가능성은 DNN에 의해 생성된 감정의 잠재적 표현을 드러내어, 감정과 관련된 각 특성을 기술하는 데 사용된 의미론을 이해할 수 있게 합니다. 모달리티 수준의 설명 가능성은 상호작용 그래프와 시각적 어텐션 히트맵의 데이터를 사용하여 시각, 오디오 또는 텍스트의 각 모달리티가 감정 표현 결정에 어떻게 기여하는지 설명합니다. 마지막으로, 감정 임베딩으로 인한 궤적을 통해 동적 상호작용 관점에서 각 시각 및 텍스트 모달리티가 시간이 지남에 따라 어떻게 변화하는지 이해할 수 있습니다. 알고리즘 2(보충 파일 1)를 참조하십시오.
융합된 다중 모달 감정 특징은 제안된 시각적 매핑 알고리즘 2(Algorithm 2)를 사용하여 지능형 상호작용 설계를 위한 시각적으로 유의미한 표현으로 매핑됩니다. 그래프 기반의 다중 모달 어텐션 가중치는 각 시간 단계에서 입력된 시각, 오디오 및 텍스트 요소 간의 차이를 정량화하는 데 사용됩니다. 이후 이러한 차이는 히트맵 시각 요소를 통해 감정에 영향을 미치는 주요 요인을 강조하기 위한 시각적 표현으로 매핑됩니다. 입력 요소 간의 상호작용에 대한 통찰력 있는 뷰를 제공하고 다중 모달 입력 요소에 의해 생성된 감정의 변화를 전달하기 위해, 쌍별 상호작용 강도를 계산하여 다중 모달 상호작용 가중치를 생성합니다. 동시에, 시간에 따라 수집된 융합 감정 요소들을 저차원 공간으로 매핑함으로써 연속적인 감정 요소의 진화를 나타내는 감정 변화 뷰가 생성됩니다.
감정 예측 및 상호작용 피드백
로 표시되는 융합된 감정 표현의 결과물은 이후 상호작용 피드백과 감정 예측 모두를 위한 함수로 활용됩니다. 또한, 감정 예측은 연속적인 감정 강도 인식을 위한 회귀 작업과 이산적 감정 인식을 위한 분류 작업으로 구성된 멀티태스크 모델로 설명됩니다. 이산적 감정 인식에는 다음과 같은 소프트맥스(softmax) 기반 분류 모델이 사용됩니다:
(25)
여기서
은 예상 감정 클래스 확률을 나타내며, Wc 와 bc는 학습 가능한 제약 조건입니다. 분류 목표를 강화하기 위해 교차 엔트로피 손실이 활용됩니다:
(26)
여기서 yk 는 정답 태그이며, K는 감정 클래스의 수입니다. 회귀 분기는 병렬적으로 감정 강도를 추정하는 데 사용되며, valence와 arousal을 포함한 다양한 연속적 정서 속성의 예측값을 생성합니다. 이에 대해 다음과 같이 정의합니다:
(27)
여기서 예상 감정 강도 점수는
로 표시됩니다. 회귀 작업을 향상시키기 위해 평균 제곱 오차 손실이 사용됩니다:
(28)
일반적으로, 두 작업은 예측 목적 함수에서 결합됩니다:
(29)
여기서 회귀와 분류의 목표는 λ에 의해 균형이 맞추어집니다. 이는 이러한 유형의 상호작용 인식 피드백을 가능하게 하기 위해, 식별된 정서 상태에 기반하여 시각화 모듈을 동적으로 수정할 것을 제안합니다. 특정 시간 t에서의 상호작용 컨텍스트는 ct로 표현됩니다. 시각화 모듈의 응답은 다음과 같이 제공됩니다:
(30)
여기서 시각화 적응 함수는
로 나타내며, 이를 통해 예상되는 변화와 감정에 근거하여 모달리티 히트맵, 상호작용 그래프 및 감정 궤적을 실시간으로 조정할 수 있습니다. 이는 해당 시스템이 감정 상태 예측에서 우수한 성능을 보일 뿐만 아니라 피드백에 대해서도 상당한 지원을 제공함을 시사합니다.
본 연구는 두 개의 벤치마크 데이터셋인 CH-SIMS와 CMU-MOSEI를 사용하여, 상호작용 인식 해석 가능성과 예측 성능 측면에서 멀티모달 감정 특징을 위한 제안된 시각적 매핑 프레임워크를 검증합니다. 실험 결과에 따르면, 제안된 접근 방식은 상관관계, 정확도, F1-score 및 평균 절대 오차(MAE)를 포함한 다양한 지표에서 기존의 멀티모달 감정 인식 기술보다 지속적으로 우수한 성능을 보였습니다. 얽힘이 해제된 감정 표현, 그래프 기반의 교차 모달 융합 메커니즘, 그리고 엔드-투-엔드 딥 표현 학습 전략은 모두 더 안정적이고 의미론적으로 정렬된 감정 모델링을 가능하게 함으로써 이러한 성능 향상에 기여합니다. 제안된 접근 방식은 정량적 이득을 넘어 시각적 매핑을 통해 더 풍부한 특징 수준의 통찰력을 제공하며, 이를 통해 모달리티의 기여도와 감정 역학을 더 쉽게 이해할 수 있게 합니다. 언어, 문화적 표현 및 데이터셋 크기의 차이에도 불구하고 앞서 언급한 성능 향상이 두 데이터셋 모두에서 일관되게 관찰되었으며, 이는 제안된 프레임워크의 강력한 일반화 능력을 입증합니다.
제안된 연구에서는 다중 모달 감정 분석을 위해 CH-SIMS 및 CMU-MOSEI 공개 데이터셋을 사용합니다. CH-SIMS 데이터셋은 영화, TV 드라마, 예능 프로그램에서 추출한 2,281개의 비디오 클립으로 구성되어 있습니다. CH-SIMS에서는 동기화된 텍스트, 오디오 및 시각적 데이터를 사용할 수 있습니다. 단일 모달 및 다중 모달 감성 레이블은 모두 긍정, 중립, 부정 범주로 분류됩니다. CMU-MOSEI로 알려진 대규모 영어 다중 모달 데이터셋은 1,000명 이상의 화자가 다양한 주제에 대해 논의하는 약 23,453개의 어노테이션된 비디오 클립을 포함하고 있습니다. 이 데이터셋에는 valence 및 arousal과 같은 연속적인 감정 강도 어노테이션과 범주형 감정 레이블이 모두 포함되어 있습니다. 제안된 프레임워크를 사용하여 이 두 데이터셋에 대해 실험함으로써 다양한 언어적, 문화적, 정서적 조건을 지원하고 견고성과 신뢰성을 강화합니다. 표 2는 시뮬레이션 환경의 세부 정보를 보여줍니다.
제안된 프레임워크를 평가하는 데 사용된 주요 실험 및 구현 설정이 이 시뮬레이션 환경에 요약되어 있습니다. 텍스트, 오디오 및 시각적 모달리티 전반에서 균일한 특징 차원을 보장하기 위해 트랜스포머 기반 인코더가 일관되게 적용됩니다. 또한 크로스 모달 융합을 위해 그래프 기반 어텐션 메커니즘을 사용하여, 정서적 상태와 관련된 모달리티 간 의존성의 적응형 학습이 가능하도록 합니다.
제안된 프레임워크는 트랜스포머 기반의 모달리티 인코더를 사용하여 텍스트, 청각 및 시각적 표현을 추출합니다. ReLU 활성화 함수를 갖는 완전 연결 계층은 모달리티별 임베딩을 공유 잠재 공간으로 투영합니다. 이후 비선형 활성화 및 정규화와 두 개의 완전 연결 계층으로 구성된 별도의 감정 특화 인코더와 모달리티 특화 인코더를 사용하여 얽힘이 해제된 표현(disentangled representations)을 학습합니다. 잠재 표현은 256차원 특징 공간으로 투영되며, 여기서 각 모달리티와 감정에 대한 정보가 개별적으로 학습됩니다. 모달리티 정보를 유지하고 효율적인 얽힘 해제를 촉진하기 위해 재구성 디코더가 사용됩니다. 다중 모달 융합 및 예측 이전에, 그래프 기반 교차 모달 어텐션 모듈이 잠재 표현을 사용하여 모달리티 간의 감정적 의존성을 모델링합니다. 네트워크는 초기 학습률 1 × 10⁻4와 배치 크기 32의 Adam 옵티마이저를 사용하여 학습되었습니다. 과적합을 방지하기 위해 검증 손실(validation loss)을 기반으로 조기 종료(early stopping)를 적용했습니다. 전체 목적 함수는 분류, 재구성 및 표현 일관성 손실로 구성되었으며, 각각 조정 가능한 하이퍼파라미터로 가중치를 부여했습니다. 모델 학습은 최대 100 에포크(epochs) 동안 진행되었으며, 검증 세트에서 가장 성능이 좋은 모델을 테스트용으로 유지했습니다.
제안된 프레임워크는 Accuracy, Precision, Recall, F1-score를 포함한 분류 지표와 Mean Absolute Error (MAE)와 같은 회귀 지표를 사용하여 평가되었습니다. 감정 범주 간의 클래스 불균형을 고려하기 위해 Precision, Recall 및 F1-score는 매크로 평균(macro-averaging) 방식을 사용하여 계산되었습니다. 분류 실험의 경우, CH-SIMS 및 CMU-MOSEI 데이터셋에서 제공하는 사전 정의된 감정/정서 라벨을 정답(ground-truth) 클래스로 사용하였습니다. 회귀 기반의 정서 예측의 경우, 데이터셋의 연속적인 정서 강도 점수를 타겟 변수로 설정하였습니다. 클래스별 예측 성능과 오분류 패턴을 분석하기 위해 95% 신뢰 구간에서 혼동 행렬(Confusion matrices)을 생성하였습니다. 강건성을 보장하기 위해 각 실험은 서로 다른 무작위 초기화를 통해 5회 반복 수행되었으며, 보고된 결과는 모든 실행 횟수에 대한 평균 ±± 표준 편차 성능에 해당합니다. 통계적 유의성은 적절한 가설 검정 절차를 통해 평가되었으며, 필요한 경우 신뢰 구간을 계산하였습니다. 학습 시간은 지정된 하드웨어 플랫폼에서 모델이 수렴하는 데 소요된 총 경과 시간으로 측정하였습니다.
조기 융합(early fusion) 및 후기 융합(late fusion)을 포함한 다수의 대표적인 베이스라인 모델을 제안된 방법과 비교할 수 있습니다. 여기에는 TFN, LSTM 기반 방법, 저차원 다중 모달 융합 모델, 적응형 다중 모달 트랜스포머 및 새로운 교차 모달 어텐션 기반 아키텍처가 포함됩니다. 이러한 베이스라인들은 주로 다양한 융합 방법을 통해 감정 인식 정확도를 향상시키는 데 집중하는 최첨단 기술들을 반영합니다. 출력 수준의 예측에 주로 집중하는 이러한 방법들과 대조적으로, 제안된 프레임워크의 얽힘 해제 표현 학습(disentangled representation learning)과 그래프 기반 융합은 해석 가능성과 상호작용 인지 능력을 향상시킵니다. LSTM Fusion, TFN, 저차원 다중 모달 융합(LMF), Adaptive-Graph 및 트랜스포머 기반 기술들은 공식 저장소 또는 공개적으로 이용 가능한 참조 구현을 통해 구현된 베이스라인 모델의 예시입니다. 저자들의 원래 하이퍼파라미터 설정이 제공된 경우에는 이를 그대로 사용하였습니다. 공정한 비교를 위해 재학습된 모든 베이스라인은 동일한 데이터셋 분할, 전처리 기법, 최적화 파라미터 및 평가 기준을 사용하여 평가되었습니다. 비교 표에는 이전 출판물에서 직접 가져온 데이터에 대한 관련 참고 문헌이 명확하게 표시되어 있습니다.
정확도
CH-SIMS와 CMU-MOSEI 모두에 대해 이산 감정 분류의 정확도를 측정하였으며, 두 데이터셋의 특성에 따라 정확도 추세가 다르게 나타났습니다. CH-SIMS는 감정 범주의 수가 동일하고 비디오 클립이 세심하게 전처리된 중간 규모의 데이터셋이기 때문에 정확도가 높게 나타났으며, 이는 모델이 노이즈가 적은 상태에서 미묘한 다중 모달 감정 정보를 포착할 수 있음을 시사합니다. 반면, CMU-MOSEI는 다양한 배경을 가진 화자들이 포함된 대규모 데이터셋이므로 감정을 정확하게 분류하는 것이 어렵습니다. 따라서 CMU-MOSEI 데이터셋에서의 정확도는 감정을 식별하는 모델의 능력뿐만 아니라, 다양한 상호작용 시나리오에 대해 일반화하고 견딜 수 있는 역량을 나타냅니다. 두 데이터셋 모두에서 정확도가 향상된 것은 제안된 접근 방식이 서로 다른 언어, 규모 및 감정 복잡도 수준을 가진 데이터셋 전반에 걸쳐 일반화 성능이 우수함을 보여줍니다.
CH-SIMS 및 CMU-MOSEI 데이터셋에 대한 제안된 접근 방식과 기타 일반적인 베이스라인의 분류 정확도는 표 3에 나와 있습니다. 표 3에서 볼 수 있듯이, 제안된 프레임워크는 CH-SIMS와 CMU-MOSEI 데이터셋 모두에서 가장 높은 정확도를 달성했으며, 가장 강력한 베이스라인(Adaptive-Graph)보다 각각 약 3.3% 및 3.1%포인트 더 높은 성능을 보였습니다. 표준 편차 값이 낮다는 것은 반복적인 실험 실행 시 더 큰 안정성을 나타냅니다. 전통적인 LSTM-융합 방식은 복잡한 교차 모달 관계를 포착하는 능력이 제한적이기 때문에 정확도가 더 낮습니다. TFN과 LMF는 교차 모달 관계를 모델링함으로써 분류 정확도를 향상시킵니다.
F1-스코어
감정 분류 문제에서 재현율(recall)과 정밀도(precision) 사이의 균형은 F1-score를 통해 측정됩니다. 따라서 클래스 수가 불균형할 가능성이 높은 멀티모달 감정 분류 데이터셋의 경우 F1-score를 사용하는 것이 더 적합합니다. 감정 분류 작업에서 재현율과 정밀도의 균형은 F1-score로 측정됩니다. 멀티모달 감정 분류 데이터셋은 불균형할 것으로 예상되므로 F1-score가 더 적절합니다. 모델이 감정 클래스를 더 잘 감지할수록 F1-score는 더 높아집니다.
그림 3은 CH-SIMS 데이터셋에서 제안된 기법과 베이스라인 모델들의 F1-score 평가 결과를 보여줍니다. LSTM 기반 베이스라인의 가장 낮은 F1-score는 복잡한 교차 모달 감정 관계를 모델링하는 능력이 부족함을 나타냅니다. CH-SIMS 데이터셋에서 평가된 기법들의 F1-score 대비 결과는 그림 3에 제시되어 있습니다. 결과에서 알 수 있듯이, 보다 정교한 그래프 기반 및 트랜스포머 기반 구조가 일반적으로 기존의 퓨전 기반 방법보다 우수한 성능을 보입니다. LSTM 모델은 0.71의 F1-score로 가장 낮았으며, TFN(0.74)과 LMF(0.76)가 그 뒤를 이었습니다. Adaptive-Graph를 사용했을 때는 F1-score가 0.79까지 상승하여, 모달 간 관계 모델링의 가치를 입증했습니다. 제안된 프레임워크는 0.82의 F1-score를 기록하여 Adaptive-Graph보다 3.8%, LMF보다 7.9%, TFN보다 10.8%, 그리고 LSTM보다 15.5% 더 높은 성능을 보였습니다. 이러한 결과는 제안된 그래프 기반 교차 모달 어텐션 메커니즘과 얽힘 해제 표현 학습(disentangled representation learning)이 텍스트, 오디오, 시각 모달리티 전반의 상호 보완적인 감정 정보를 더 효과적으로 포착하여 더 나은 분류 성능을 이끌어냈음을 보여줍니다.
그림 4에서 보는 바와 같이, 모든 방법이 CH-SIMS에 비해 F1-score가 약간 감소함에도 불구하고 상대적인 추세는 일관되게 나타납니다. 이러한 결과는 전통적인 융합 방법에서 그래프 기반 다중 모달 학습 전략으로 갈수록 성능이 꾸준히 향상됨을 보여줍니다. F1-score가 가장 낮은 모델은 LSTM (0.69), TFN (0.72), LMF (0.74)였습니다. Adaptive-Graph 모델의 성능은 0.77로 증가하여, 교차 모달 연결이 얼마나 효과적으로 모델링될 수 있는지를 입증하였습니다. 제안된 프레임워크는 모든 다른 접근 방식보다 우수한 성능을 보이며 0.80이라는 가장 높은 F1-score를 달성하였습니다. 가장 강력한 베이스라인인 Adaptive-Graph보다 개선된 성능은, 제안된 얽힘 해제된 감정 표현 학습과 그래프 기반 교차 모달 어텐션 메커니즘이 텍스트, 음향 및 시각적 모달리티 전반의 상호 보완적인 감정 단서를 포착하는 데 기여함을 보여줍니다. 이러한 결과는 제안된 다중 모달 감정 인식 프레임워크가 신뢰할 수 있고 효율적임을 나타냅니다. 제안된 접근 방식은 그래프 기반 접근 방식과 전통적인 융합 방법 모두보다 상당한 향상을 보여주며, 이는 해당 방법의 강력한 일반화 능력을 더욱 확인시켜 줍니다. CMU-MOSEI 데이터셋에서 F1-score가 향상된 것은 제안된 접근 방식이 노이즈가 많고 다양한 환경에서도 균형 잡힌 감정 분류 성능을 달성할 수 있음을 입증합니다.
정밀도
스마트 통신 시스템에서는 잘못된 감정 신호가 사용자 경험을 저하시킬 수 있기 때문에 정밀도가 매우 중요합니다. 정밀도란 특정 감정으로 예측된 전체 사례 수 대비 해당 감정이 정확하게 예측된 사례의 비율을 의미합니다. 얽힘이 해제된 감정 표현(disentangled emotion representations)은 노이즈가 적고 모달리티 내 오분류 가능성이 낮기 때문에, 제안된 모델은 그림 5의 CH-SIMS 데이터셋에서 베이스라인 모델보다 더 우수한 성능을 보입니다.
CH-SIMS 및 CMU-MOSEI 데이터셋에 대한 여러 멀티모달 감정 인식 기법의 정확도를 그림 5에서 비교하였다. 모델이 전통적인 퓨전 기반 기법에서 더 정교한 그래프 기반 아키텍처로 이동함에 따라 정확도가 꾸준히 증가한다. 제안된 프레임워크는 CH-SIMS 데이터셋에서 0.82의 최대 정확도를 달성하였으며, 정확도는 LSTM의 0.71에서 TFN, LMF, Adaptive-Graph 순으로 각각 0.74, 0.76, 0.79로 증가하였다. CMU-MOSEI 데이터셋의 경우, 정확도는 LSTM의 0.69에서 TFN, LMF, Adaptive-Graph 순으로 각각 0.72, 0.74, 0.77로 증가하였다. 제안된 방식은 0.80의 가장 높은 정확도를 기록하였다. 제안된 프레임워크는 가장 강력한 베이스라인(Adaptive-Graph)과 비교했을 때 CH-SIMS에서 약 3.8%, CMU-MOSEI에서 약 3.9% 정확도를 향상시켰다. 이러한 결과는 텍스트, 음향 및 시각적 모달리티 전반에 걸쳐 상호 보완적인 감정 정보를 포착함으로써, 제안된 얽힘 해제 표현 학습 및 그래프 기반 교차 모달 어텐션 메커니즘이 위양성 예측을 성공적으로 줄였음을 보여준다. 그래프 기반 교차 모달 어텐션은 무관한 모달리티의 영향을 더욱 완화한다. CMU-MOSEI 코퍼스의 화자 및 언어적 표현의 다양성 증가로 인해 모든 모델에서 정확도가 약간 감소하였다.
재현율
감정 인식 작업에서 재현율(recall)은 특정 클래스에 속하는 감정 사례를 모델이 적절하게 분류하는 능력을 측정하는 지표로, 감정 정보의 부족이 상호작용의 질에 부정적인 영향을 미칠 수 있기 때문에 매우 중요합니다. 재현율 값이 높을수록 모델이 위음성(false negatives)을 적게 식별하고 실제 감정 표현을 더 많이 찾아낸다는 것을 의미합니다. 멀티모달 감정 분석의 맥락에서 재현율은 텍스트, 오디오 및 시각적 모달리티로부터 감정 정보를 추출하는 효율성의 척도로 간주될 수 있습니다.
CH-SIMS 및 CMU-MOSEI 데이터셋에 대해 제안된 기술이 베이스라인 접근 방식보다 갖는 이점은 그림 6의 재현율(recall) 비교에 나타나 있습니다. 모델이 기존의 퓨전 기반 방법에서 더 정교한 그래프 기반 다중 모달 구조로 발전함에 따라, 결과적으로 재현율의 지속적인 상승이 확인되었습니다. CH-SIMS 데이터셋의 재현율은 LSTM의 0.70에서 TFN, LMF, Adaptive-Graph 순으로 각각 0.73, 0.75, 0.78로 증가하였으며, 제안된 프레임워크에서 최대 재현율인 0.82를 달성하였습니다. 제안된 접근 방식은 CMU-MOSEI 데이터셋에서 최적의 재현율인 0.80을 달성하였으며, 여기서 재현율은 LSTM의 0.68에서 TFN, LMF, Adaptive-Graph 순으로 각각 0.71, 0.73, 0.76로 상승하였습니다. 제안된 프레임워크는 가장 강력한 베이스라인(Adaptive-Graph)과 비교했을 때 CH-SIMS에서 약 5.1%, CMU-MOSEI에서 약 5.3%의 상대적 개선을 보였습니다. 이러한 결과는 텍스트, 음향 및 시각 모달리티 전반의 상호 보완적인 감정 단서를 포착함으로써, 제안된 얽힘 해제 표현 학습(disentangled representation learning)과 그래프 기반 교차 모달 어텐션 메커니즘이 위음성(false-negative) 예측을 성공적으로 줄여 두 데이터셋 모두에서 감정 클래스 식별 능력을 향상시켰음을 보여줍니다. 전통적인 방법들은 복잡한 교차 모달 관계를 모델링하는 능력이 제한적이어서 재현율 값이 낮은 경향이 있습니다. TFN과 LMF는 모달리티 관계를 더 명시적으로 모델링함으로써 중간 정도의 이득을 얻었습니다. Adaptive-Graph 방법은 모달리티 간의 구조적 관계를 시뮬레이션함으로써 재현율을 더욱 개선하였습니다. 두 데이터셋 모두에서 제안된 방법이 가장 높은 재현율을 달성하였으며, 이는 다양한 상호작용 시나리오에서 감정 사례를 탐지하는 능력이 더 뛰어나다는 것을 나타냅니다. 이러한 개선은 대규모 CMU-MOSEI 데이터셋에서 더욱 뚜렷하게 나타나며, 이는 제안된 프레임워크의 강건성과 일반화 능력을 입증합니다.
평균 절대 오차 (MAE)
평균 절대 오차(Mean Absolute Error, MAE)는 valence 또는 arousal 예측과 같은 연속적인 감정 강도 예측 작업의 성능을 평가하는 데 사용됩니다. 정확도와 달리, MAE는 예측된 감정 강도가 실제 감정 상태와 얼마나 가까운지를 더 잘 반영합니다. 이러한 이유로 연속적인 정동 라벨을 가진 CH-SIMS 및 CMU-MOSEI와 같은 데이터셋에는 MAE가 더 적합합니다. MAE 값이 낮을수록 감정 강도 예측의 정확도가 더 높음을 나타냅니다.
CH-SIMS 및 CMU-MOSEI 데이터셋에서 제안된 프레임워크와 베이스라인 접근 방식 간의 MAE 비교 결과는 표 4에 제시되어 있습니다. 기존의 LSTM 기반 융합 방법은 복잡한 멀티모달 정서적 의존성을 모델링하는 능력이 제한적이기 때문에 MAE 값이 더 높은 경향이 있습니다. TFN과 LMF는 멀티모달 상호작용을 모델링함으로써 MAE를 낮출 수 있으며, Adaptive-Graph 접근 방식은 모달리티 그래프 관계를 학습함으로써 이를 더욱 감소시킵니다. 제안된 프레임워크는 두 데이터셋 모두에서 가장 낮은 MAE를 달성하여, 정서 강도를 더욱 정확하게 추정함을 보여줍니다. 특히 대규모 데이터 변동성과 화자 조건으로 인해 예측 작업이 더 까다로운 CMU-MOSEI 데이터셋에서 개선 효과가 더 뚜렷하게 나타났다는 점에 주목할 필요가 있습니다.
CH-SIMS 데이터셋에 대한 혼동 행렬
CH-SIMS 데이터셋의 혼동 행렬(confusion matrix)에 따르면, 조기 융합(early fusion) LSTM 및 TFN의 기본 방법들은 중립 감정과 긍정 감정 클래스 간에 상당한 혼동을 보입니다. 이는 해당 방법들이 미묘한 멀티모달 감정 표현을 식별하는 능력이 부족함을 시사합니다. 반면, 제안된 방법은 오프-대각(off-diagonal) 요소가 매우 적고 강한 대각 우세성을 뚜렷하게 보여 클래스 분리능을 향상시켰습니다. 제안된 방법의 얽힘 해제 감정 학습(disentangled emotion learning) 메커니즘은 모달리티 전반에 걸쳐 일관된 감정 표현을 보장하며, 그래프 융합 방식은 서로 밀접하게 관련된 감정 클래스 간의 판별력을 높여줍니다. 그림 7A–E는 다양한 기본 방법들을 사용한 CH-SIMS 데이터셋의 혼동 행렬을 보여줍니다.
CMU-MOSEI 데이터셋에 대한 혼동 행렬
제안된 프레임워크는 양식 불변 감정 임베딩(modality-invariant emotion embeddings)과 적응형 어텐션 가중치를 사용하여 특히 감정적으로 모호한 입력에 대한 오분류율을 크게 낮춥니다. 이는 제안된 프레임워크가 다양한 대규모 멀티모달 상호작용 시나리오에서 잘 작동함을 확인시켜 줍니다. 데이터셋의 규모, 화자의 다양성 및 감정 레이블의 연속적인 특성으로 인해 CMU-MOSEI 혼동 행렬은 전반적으로 더 높은 오분류율을 보입니다. 베이스라인 방법들은 다양한 감정 범주 간에 상당한 수준의 혼동을 보여줍니다. 그림 8A–E는 다양한 베이스라인 방법을 사용한 CMU-MOSEI 데이터셋의 혼동 행렬을 보여줍니다.
에포크당 훈련 시간
에포크당 학습 시간을 비교함으로써 고급 멀티모달 퓨전 기술의 계산적 트레이드오프를 확인할 수 있습니다. 트랜스포머 인코더와 그래프 어텐션 메커니즘으로 인해 제안된 모델은 단순 퓨전 방식보다 학습 시간이 약간 더 소요되지만, 이러한 증가는 감당 가능한 수준입니다. 제안된 프레임워크는 벤치마크 멀티모달 감정 분석 데이터셋에서 강력한 성능을 입증하였으며, 지능형 인간-기계 상호작용 시스템에 통합될 가능성을 보여주었습니다. 하지만 본 연구에서는 실시간 배포 적합성을 평가하지 않았으며, 이는 지연 시간, 처리량, 메모리 및 배포 분석을 통한 추가 연구가 필요합니다. 특히, 향상된 수렴 안정성과 우수한 예측 및 해석 가능성 성능은 추가적인 계산 비용을 감수할 만한 가치가 있게 합니다. 그림 9는 제안된 방법의 에포크당 학습 시간 결과를 보여줍니다.
어블레이션 연구(Ablation study)
시각적 매핑 모듈, 그래프 기반 교차 모달 융합, 얽힘 해제된 감정 표현과 같이 제안된 프레임워크 내 각 주요 요소의 영향력을 결정하기 위해 어블레이션 연구(ablation study)를 수행하였습니다. 영향력을 파악하기 위해 각 요소를 하나씩 제거하였습니다. 실험 결과에 따르면, 그래프 융합 전략은 교차 모달 의존성 모델링을 강화하며, 얽힘 해제된 감정 표현의 기여도가 성능 안정성에 가장 중요한 것으로 나타났습니다. 시각적 매핑 모듈을 제거했을 때 성능에 미치는 영향이 미미하다는 점에서 해당 모듈의 보조적 역할이 입증되었습니다. 동일한 훈련 및 평가 조건에서의 어블레이션 연구 결과는 Table 5에 제시되어 있습니다. 그래프 기반 교차 모달 어텐션 모듈을 제거했을 때 가장 큰 성능 저하가 관찰되었으며, 정확도는 81.72%에서 77.88%로, F1-score는 0.823에서 0.776으로 감소하였습니다. 이는 복잡한 모달 간 상호작용 모델링의 중요성을 강조합니다. 얽힘 해제된 표현 학습 모듈을 제거했을 때 정확도가 2.78% 포인트, F1-score가 0.032 감소했다는 사실은 견고한 감정 특화 표현을 학습하는 데 있어 해당 모듈의 역할을 입증합니다. 시각적 매핑 모듈을 제거했을 때 예측 성능의 하락 폭이 상대적으로 작았다는 점은 이 모듈의 주요 장점이 분류 정확도보다는 해석력에 있음을 보여줍니다. Basic Fusion 구성에서 가장 낮은 성능을 보였으며, 이는 최적의 다중모달 감정 인식 성능을 위해 제안된 모든 모듈의 결합된 영향이 필요함을 입증합니다.
데이터 가용성:
본 연구에 사용된 데이터셋은 공개적으로 이용 가능한 벤치마크 데이터셋입니다. CMU-MOSEI 데이터셋은 Carnegie Mellon University Multimodal SDK에서 제공하며 Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208)에 기술되어 있고, https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/에서 접속 가능합니다. CH-SIMS 데이터셋은 Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343)에 기술되어 있으며, https://github.com/thuiar/MMSA를 포함하여 저자들이 제공한 리소스를 통해 공개적으로 접근할 수 있습니다. 모든 실험은 이 데이터셋들의 공식 버전을 사용하여 수행되었습니다. 본 연구의 결과를 뒷받침하는 원시 추출 데이터, 처리된 데이터 파일, 전처리 결과물, 훈련/검증/테스트 분할 데이터, 도출된 특성 표현 및 구현 세부 사항은 Zenodo 리포지토리(https://doi.org/10.5281/zenodo.21124921)에서 공개적으로 이용 가능합니다.

그림 1: 제안된 멀티모달 감정 특징 시각적 매핑 프레임워크의 모식도.해석 가능한 멀티모달 감정 분석을 위한 멀티모달 특징 추출, 얽힘 해제 표현 학습, 그래프 기반 교차 모달 어텐션 퓨전 및 시각적 매핑 구성 요소를 보여주는 전체 아키텍처의 개념도. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 2: 제안된 계산 프로토콜의 도식적 워크플로우 다이어그램.
데이터셋 획득, 전처리, 모달리티별 특징 추출, 멀티모달 융합, 시각화 및 감정 예측 단계를 포함하는 엔드-투-엔드 처리 파이프라인의 개념적 표현 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: CH-SIMS 데이터셋에 대한 F1-score 성능 비교. 서로 다른 랜덤 시드 초기화를 사용하여 수행한 5회의 독립적인 실험(n = 5)을 통해 얻은 평균 F1-score 값. 오차 막대는 ±± 1 표준편차(SD)를 나타냄. F1-score 값이 높을수록 감정 분류 성능이 우수함을 의미함. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 4: CMU-MOSEI 데이터셋에 대한 F1-score 성능 비교. 서로 다른 랜덤 시드 초기화를 사용하여 수행한 5회의 독립적인 실험 런(n = 5)에서 얻은 평균 F1-score 값이다. 오차 막대는 ±± 1 표준편차(SD)를 나타내며, 해당하는 평균 ±± SD 값이 각 데이터 포인트 위에 표시되어 있다. F1-score 값이 높을수록 감정 분류 성능이 더 우수함을 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5CH-SIMS 및 CMU-MOSEI 데이터셋에 대한 정밀도 비교. LSTM, TFN, LMF, Adaptive-Graph 및 제안된 프레임워크를 통해 얻은 평균 정밀도 점수 5회의 독립적인 실험 반복(n = 5)오차 막대는 다음을 나타냅니다. ±± 1 표준편차(SD) 서로 다른 랜덤 시드 초기화를 통해 반복 실행하여 계산되었습니다. 제안된 프레임워크는 두 데이터셋 모두에서 가장 높은 정밀도를 달성하였으며, 이는 효과적인 다중 모달 특성 학습과 그래프 기반 교차 모달 융합을 통해 감정 클래스 판별 능력이 향상되었음을 입증합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 6: CH-SIMS 및 CMU-MOSEI 데이터셋에 대한 재현율(Recall) 비교. LSTM, TFN, LMF, Adaptive-Graph 및 제안된 프레임워크를 통해 5회의 독립적인 실험 실행(n = 5) 동안 얻은 평균 재현율 점수. 오차 막대는 반복 실험에서 도출된 ±± 1 표준 편차(SD)를 나타냅니다. 제안된 프레임워크는 두 데이터셋 모두에서 일관되게 가장 높은 재현율을 달성하며, 이는 다중 모달 감정 정보를 캡처하고 위음성(false-negative) 예측을 줄이는 능력이 우수함을 나타냅니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 7: 다양한 베이스라인 방법론을 적용한 CH-SIMS 데이터셋의 혼동 행렬. 행은 실제 감정 클래스에 해당하며, 열은 예측된 클래스에 해당한다. 셀 값은 각 실제 클래스에 대해 정규화된 샘플의 백분율을 나타낸다. 혼동 행렬은 별도로 분리된 CH-SIMS 테스트 파티션을 사용하여 계산되었다. 대각선 백분율이 높을수록 해당 감정 범주에 대한 인식 정확도가 더 높음을 의미한다. CH-SIMS 데이터셋에 적용한 (A) 조기 융합 LSTM, (B) TFN, (C) LMF, (D) 적응형 그래프, 그리고 (E) 제안된 방법의 혼동 행렬. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 8: 다양한 베이스라인 방법론을 적용한 CMU-MOSEI 데이터셋의 혼동 행렬. 행은 실제 감정 레이블을 나타내고 열은 예측된 레이블을 나타냅니다. 값은 CMU-MOSEI 테스트 세트에 대해 클래스 정규화된 백분율로 표시되었습니다. 이 행렬은 올바르게 분류된 샘플(대각 성분)과 감정 카테고리 간의 혼동(비대각 성분)을 모두 보여줍니다. CMU-MOSEI의 혼동 행렬 (A) Early fusion LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph, 그리고 (E) CMU-MOSEI 데이터셋에 적용한 제안 방법. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 9벤치마크 멀티모달 감정 데이터셋의 에포크당 훈련 시간 비교.
~에서 얻은 에포크당 평균 학습 시간 5회의 독립적인 실험 반복 (n = 5) 동일한 하드웨어 및 소프트웨어 설정 하의 CH-SIMS 및 CMU-MOSEI 데이터셋에 대하여. 오차 막대는 다음을 나타냄 ±± 1표준편차(SD) 서로 다른 랜덤 시드 초기화를 사용한 반복 실험을 통해 계산되었습니다. 값이 낮을수록 계산 효율성이 높음을 나타내며, 실행 간의 학습 시간이 일정하게 유지되는 것은 재현성과 학습 일관성이 향상되었음을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
| 데이터셋 | 모달리티 | 샘플 수 | 언어 | 감정/정서 레이블 |
| CH-SIMS34 | 비디오, 오디오, 텍스트 | 2,281 비디오 세그먼트 | 중국어 | 멀티모달 및 유니모달 정서 레이블 (부정, 중립, 긍정) |
| CMU-MOSEI35 | 비디오, 오디오, 텍스트 | 약 23,453개의 주석 처리된 클립 | 영어 | 정서 및 감정 강도 레이블 (연속형 및 범주형) |
표 1: 데이터셋 설명. 본 연구에 사용된 데이터셋, 모달리티, 샘플 수, 언어, CH-SIMS 및 CMU-MOSEI 데이터셋의 감정/정서 레이블 요약.
| 구성 요소 | 사양 |
| 프로그래밍 프레임워크 | PyTorch 기반 Python |
| 시각적 특징 추출기 | Vision Transformer (ViT) |
| 오디오 특징 추출기 | Wav2Vec 2.0 |
| 텍스트 특징 추출기 | RoBERTa |
| 융합 전략 | 그래프 기반 교차 모달 어텐션 네트워크 |
| 특징 차원 | 모달리티당 768 |
| 훈련 최적화 도구 | Adam |
| 학습률 | 1.00E-04 |
| 배치 크기 | 16 |
| 하드웨어 | NVIDIA GPU (예: RTX 시리즈) |
| 평가 데이터셋 | CH-SIMS, CMU-MOSEI |
| 잠재 차원 | 2.56E+02 |
| 임베딩 차원 | 768 |
| 활성화 함수 | ReLU |
| 최적화 도구 | Adam |
| 학습률 | 1.00E-04 |
| 배치 크기 | 32 |
| 에포크 | 100 |
| 조기 종료 | 활성화됨 |
| 손실 함수 | 분류 + 재구성 + 일관성 |
표 2: 시뮬레이션 환경. 모델 세부 사항, 특성, 최적화 도구 및 사용된 하드웨어와 같은 시뮬레이션 환경 실험 설정 및 구현 세부 정보.
| 방법 | CH-SIMS 정확도 (%) | CMU-MOSEI 정확도 (%) |
| LSTM (Early/Late Fusion) | 72.84 ± 1.12 | 70.35 ± 1.26 |
| TFN | 74.91 ± 0.98 | 72.68 ± 1.10 |
| LMF | 76.23 ± 0.85 | 74.12 ± 0.94 |
| Adaptive-Graph | 78.46 ± 0.73 | 76.89 ± 0.81 |
| 제안 방법 | 81.72 ± 0.61 | 79.94 ± 0.69 |
표 3: CH-SIMS 및 CMU-MOSEI 데이터셋에서 베이스라인 기법을 이용한 제안 방법의 정확도 평가결과는 다음과 같이 보고됩니다. 평균 ±± 표준 편차 ~에서 얻은 5회의 독립적인 실험 반복(n = 5) 서로 다른 무작위 시드 초기값을 사용하여 수행하였습니다. 공정한 비교를 위해 모든 방법은 각 데이터셋의 동일한 훈련, 검증 및 테스트 분할 세트를 사용하여 평가되었습니다.
| 방법 | CH-SIMS MAE ↓ | CMU-MOSEI MAE ↓ |
| LSTM (Early/Late Fusion) | 0.412 ± 0.014 | 0.465 ± 0.016 |
| TFN | 0.387 ± 0.012 | 0.439 ± 0.014 |
| LMF | 0.361 ± 0.010 | 0.412 ± 0.012 |
| Adaptive-Graph | 0.334 ± 0.009 | 0.379 ± 0.010 |
| 제안 방법 | 0.298 ± 0.007 | 0.341 ± 0.008 |
표 4: 평균 절대 오차 결과결과는 다음과 같이 보고합니다. 평균 ±± 표준 편차 ~로부터 얻은 5회의 독립적인 실험 반복(n = 5) 서로 다른 무작위 시드 초기화를 사용하여 분석하였습니다. 공정한 비교를 위해 모든 방법은 각 데이터셋의 동일한 훈련, 검증 및 테스트 분할을 사용하여 평가되었습니다. 두 데이터셋 모두에서 제안된 프레임워크와 베이스라인 접근 방식을 이용한 연속적 감정 강도 예측의 MAE 비교 결과입니다.
| 모델 변형 | 정확도 (%) | F1-스코어 |
| 전체 모델 | 81.72 ± 0.61 | 0.823 ± 0.008 |
| 얽힘 해제 없이 | 78.94 ± 0.74 | 0.791 ± 0.010 |
| 그래프 퓨전 제외 | 77.88 ± 0.81 | 0.776 ± 0.011 |
| 시각적 매핑 없이 | 80.11 ± 0.66 | 0.807 ± 0.009 |
| 기초 융합 | 74.91 ± 0.98 | 0.742 ± 0.013 |
표 5: 베이스라인 방법론을 이용한 어블레이션 연구 결과. 결과는 다음과 같이 보고됩니다. 평균 ±± 표준 편차 ~에서 얻은 5회의 독립적인 실험 반복 (n = 5) 서로 다른 랜덤 시드 초기화를 사용하여 수행하였다. 공정한 비교를 위해 모든 방법은 각 데이터셋의 동일한 훈련, 검증 및 테스트 분할을 사용하여 평가되었다. 모델 변형 간의 성능 비교는 얽힘 해제된 표현(disentangled representations)으로부터의 학습, 그래프 기반 융합 및 시각적 매핑 모듈의 효과를 나타낸다.
보충 파일 1: 알고리즘 1 및 알고리즘 2.이 파일을 다운로드하려면 여기를 클릭하십시오.
실험 결과, CH-SIMS 및 CMU-MOSEI 데이터셋 전반에서 다중모달 감정 특성을 위한 제안된 시각적 매핑 프레임워크가 기존의 다중모달 감정 인식 기술보다 우수한 성능을 보였다. EF-LSTM 및 TFN과 같은 초기 및 후기 융합 모델과 비교했을 때, 제안된 기술은 더 높은 정확도와 F1 Score를 달성하여 다양한 감정 정보를 처리하는 데 있어 강건함을 입증했다. 이러한 방법론의 개선은 양식별 노이즈를 억제하고 시각, 오디오, 텍스트 양식 간의 감정 일관성을 보장하는 얽힘 해제된 감정 표현(disentangled emotion representation) 덕분인 것으로 분석된다36.
최근 Adaptive Multimodal Transformers37 및 MIAR38와 같은 트랜스포머 기반의 멀티모달 모델들이 교차 모달 의존성 모델링에서 인상적인 결과를 보여주었습니다. 그럼에도 불구하고, 이러한 모델들은 주로 예측에 집중하고 있으며 특징 수준의 해석 가능성을 지원하는 메커니즘이 부족합니다. 반대로, 본 제안 시스템은 그래프 기반의 교차 모달 어텐션을 시각적 매핑 모듈과 결합하여 모달리티 및 감정 상호작용의 투명한 분석을 가능하게 합니다. 이는 감정 추론을 블랙박스 프로세스로 취급해 온 기존 문헌에서 현재 결여되어 있는 매우 중요한 요소입니다.
제안된 프레임워크는 CH-SIMS 및 CMU-MOSEI 벤치마크 데이터셋 전반에서 일관된 성능을 입증하였습니다. 이 프레임워크는 지능형 인간-기계 상호작용, 헬스케어 모니터링, 적응형 학습 환경 및 기타 감정 인식 시스템에 적용될 가능성이 있으나, 본 연구에서는 통제된 벤치마크 조건 하에서만 해당 방법을 평가하였습니다. 실제 현장 배포, 사용자 인터페이스 평가, 사용성 연구 또는 인간 대상 평가는 수행되지 않았습니다. 따라서 실제 운영 환경에서 이 프레임워크의 실질적인 효과에 대해서는 추가적인 조사가 필요합니다. 향후 연구는 배포 중심의 평가, 사용자 중심 연구, 지연 시간 분석, 메모리 소비 평가 및 실시간 상호작용 성능에 초점을 맞출 예정입니다.
또한, 문화적 및 언어적으로 다양한 여러 데이터셋 전반에서 나타난 성능 향상은 제안된 프레임워크의 타당성을 입증합니다. 단일 데이터셋이나 특정 상호작용 시나리오에서만 검증된 이전 연구들과 달리, 제안된 프레임워크는 언어, 화자 및 감정 표현에 걸쳐 견고한 성능을 보여줍니다. 따라서 제안된 프레임워크는 정확한 감정 인식과 해석 가능한 의사결정이 요구되는 실제 지능형 상호작용 시스템에 매우 적합합니다.
제안된 프레임워크의 해석 가능성은 학습된 멀티모달 표현의 시각화 기반 분석을 통해 평가되었습니다. 구체적으로, 모델의 결정 과정과 모달리티 기여도에 대한 통찰을 제공하기 위해 잠재 감정 임베딩, 교차 모달 어텐션 맵, 모달리티 상호작용 그래프 및 시간적 감정 궤적을 조사하였습니다. 시각적 매핑 모듈의 목적은 특징 수준의 상호작용과 감정 역학의 관찰을 가능하게 함으로써 투명성을 높이는 것입니다. 다만, 공식적인 해석 가능성 지표, 어텐션 충실도 평가 및 사용자 연구는 이번 연구에 포함되지 않았습니다. 따라서 보고된 해석 가능성의 이점은 정량적으로 검증된 설명 가능성 측정치가 아닌, 시각화 기반의 근거로 해석되어야 합니다.
이론적 관점에서 본 연구는 멀티모달 감성 컴퓨팅 분야에 다음과 같은 기여를 합니다. 먼저, 감정 특이적 표현과 모달리티 특이적 표현을 명확하게 구분하는 체계적인 감정 모델링 방법을 제안합니다. 또한, 공통 잠재 공간에서 모달리티 간의 감정적 일관성을 보장함으로써, 제안된 프레임워크는 멀티모달 시스템의 표현 학습 이론을 발전시킵니다. 아울러, 그래프 기반 어텐션 메커니즘의 통합을 통해 감정을 표현하는 서로 다른 모달리티 간의 의존성을 더욱 공식화합니다.
실질적인 관점에서, 제안된 프레임워크는 지능형 상호작용 설계 및 감정 인식 사용자 인터페이스에 매우 유용합니다. 제안된 프레임워크의 시각적 매핑 모듈을 통해 시스템 설계자는 다양한 모달리티가 감정 예측에 미치는 영향을 파악할 수 있으며, 이는 시스템 설계자에게 매우 중요한 요소입니다. 제안된 프레임워크는 정서적 대화 에이전트, 적응형 학습 시스템, 헬스케어 모니터링 인터페이스 및 사용자 경험 평가 플랫폼과 같은 응용 분야에 매우 유용합니다.
하지만 제안된 프레임워크에는 몇 가지 한계점이 있습니다. 그래프 어텐션 메커니즘과 트랜스포머 인코더의 사용은 복잡성을 증가시키며, 이는 기능이 제한된 장치에서 문제가 될 수 있습니다. 또한, 본 연구는 시각, 오디오 및 텍스트 모달리티에 집중하기 위해 EEG 및 시선 추적과 같은 다른 생체 신호들을 배제하였습니다. 제안된 프레임워크가 경쟁력 있는 예측 성능과 향상된 시각화 능력을 달성했음에도 불구하고, 실시간 배포를 위한 계산 효율성은 구체적으로 평가되지 않았습니다. 향후 연구에서는 실제 지능형 상호작용 환경에서의 배포 성능, 추론 지연 시간, 처리량, 메모리 소비 및 모델 압축 기술을 조사할 예정입니다. 감정 모델링의 정확도와 상호작용 응답성을 더욱 향상시키기 위해, 향후 연구는 경량 모델 개발, 실시간 최적화 기술 및 추가 모달리티 통합에 집중할 것입니다. 실시간 배포 성능이 평가되지 않았으며, 트랜스포머 인코더와 그래프 기반 어텐션 방법의 포함으로 인해 계산 복잡성이 증가합니다. 방법론 검증을 위해 CH-SIMS 및 CMU-MOSEI 벤치마크 데이터셋만 사용되었으며, 이는 데이터셋 특유의 편향을 유발하고 다른 도메인, 언어 및 사용자 집단에 대한 일반화 가능성을 제한할 수 있습니다. 또한, 본 연구에는 EEG 또는 시선 추적 데이터와 같은 생체 신호가 포함되지 않았으며, 대신 시각, 오디오 및 텍스트 모달리티에 집중하였습니다. 철저한 구현 및 시뮬레이션 환경 설명으로 재현성은 향상되었으나, 현재 소스 코드와 사전 학습된 모델은 공개되지 않은 상태입니다.
본 연구에서는 지능형 인터랙션 설계를 위한 멀티모달 감정 특징 학습용의 새로운 시각적 매핑 프레임워크가 사용되었습니다. 제안된 방법은 엔드-투-엔드 트랜스포머 기반 표현 학습, 얽힘 해제된 감정 모델링 및 그래프 기반 교차 모달 어텐션을 통합하여 높은 예측 정확도와 해석 가능성을 달성합니다. CH-SIMS 및 CMU-MOSEI 데이터셋을 이용한 실험 결과, 제안된 프레임워크가 정확도와 F1-score 측면에서 최신 멀티모달 감정 인식 모델들보다 우수한 성능을 보임을 확인하였습니다. 더욱 중요한 점은, 제안된 시각적 매핑 솔루션이 감정 인식과 인터랙션 전략 사이의 간극을 메우며, 해석 가능하고 인터랙션을 인지하는 멀티모달 어펙티브 컴퓨팅 시스템 설계의 새로운 방향을 제시한다는 것입니다.
해석 가능한 지능형 상호작용 설계를 촉진하기 위해, 본 연구에서는 멀티모달 감정 특징 학습을 위한 새로운 시각적 매핑 프레임워크를 도입하였습니다. 제안된 시스템은 트랜스포머 기반의 멀티모달 특징 추출, 얽힘 해제된 감정 표현 학습, 그래프 기반 교차 모달 어텐션 퓨전 및 시각적 매핑 방법을 결합함으로써 단일 아키텍처 내에 감정 검출과 해석 가능성을 성공적으로 통합하였습니다. 모달리티 기여도, 교차 모달 상호작용 및 시간적 감정 역동성에 대한 명확한 시각적 표현을 제공함과 동시에, CH-SIMS 및 CMU-MOSEI 벤치마크 데이터셋을 이용한 실험 평가 결과 Accuracy, Precision, Recall, F1-score 및 Mean Absolute Error (MAE)를 포함한 여러 지표에서 대표적인 베이스라인 방법들보다 향상된 성능을 보였습니다. 그러나 본 연구는 두 가지 벤치마크 데이터셋에 대한 평가로 제한되어 있어, 실제 환경 배포 연구, 사용자 중심 평가, 정량적 설명 가능성 평가 및 생체 신호 모달리티의 통합은 포함되지 않았습니다. 또한, 트랜스포머 인코더와 그래프 기반 어텐션 프로세스의 연산 비용으로 인해 자원이 제한된 환경에서는 어려움이 있을 수 있습니다. 향후 연구에서는 다양한 데이터셋에 대한 광범위한 검증, 추가 모달리티 통합, 사용성 연구, 재현 가능한 리소스 공개 및 실시간 배포 시나리오를 위한 최적화에 집중할 예정이지만, 제안된 프레임워크는 전반적으로 정서 컴퓨팅 및 지능형 상호작용 응용 분야를 위한 해석 가능한 멀티모달 감정 분석의 가능성을 보여줍니다.
저자들은 이해관계의 충돌이 없습니다.
저자들은 말레이시아 페낭의 Universiti Sains Malaysia, School of Housing, Building and Planning과 중국 창샤의 Changsha University of Science & Technology, School of Design Art의 지원에 감사드립니다. 또한, 본 연구 전반에 걸쳐 학술 및 연구 지원을 제공해 준 중국 샤먼의 Fuzhou University, Xiamen Academy of Arts and Design에 감사의 뜻을 표합니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Adam | PyTorch Optimizer 라이브러리 | https://pytorch-optimizers.readthedocs.io/en/latest/ (Learning Rate = 1 × 10-4) | 모델 학습 중 파라미터 최적화 |
| CH-SIMS | 원본 데이터셋 저장소 | 최신 공개 버전 | 중국어 멀티모달 감성/정서 분석을 위한 벤치마크 데이터셋 |
| CMU-MOSEI | CMU Multimodal SDK 저장소 | https://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (최신 공개 버전) | 멀티모달 감성 및 정서 인식을 위한 벤치마크 데이터셋 |
| Disentangled Emotion Encoder | 커스텀 구현 | https://pytorch-geometric.readthedocs.io/en/latest/(Dual Encoder 아키텍처) | 정서 특이적 및 모달리티 특이적 잠재 표현의 분리 |
| Graph Attention Network (GAT) | PyTorch Geometric | Multi-head GAT (https://pytorch-geometric.readthedocs.io/en/latest/) | 교차 모달 정서 관계 모델링 및 적응형 특징 융합 |
| Graph-Based Cross-Modal Attention Layer | 커스텀 구현 | Multi-Head Attention 융합 | 모달리티 간의 세밀한 정서적 의존성 학습 |
| Matplotlib | Matplotlib 프로젝트 | 3.7+ | 플롯 생성 및 시각적 분석 |
| NetworkX | NetworkX 프로젝트 | 3.0+ | 교차 모달 상호작용 그래프 구축 및 시각화 |
| NVIDIA GPU | NVIDIA Corporation | CUDA 지원 GPU | 트랜스포머 및 그래프 신경망 학습 가속화 |
| Principal Component Analysis (PCA) | Scikit-learn | sklearn.decomposition.PCA | 고차원 정서 임베딩의 초기 차원 축소 |
| Python | Python Software Foundation | 3.8+ | 멀티모달 정서 분석 프레임워크 구현을 위한 핵심 프로그래밍 언어 |
| PyTorch | PyTorch Foundation | 2.0+ | 심층 신경망의 개발, 학습 및 최적화 |
| RoBERTa | Hugging Face Transformers | https://huggingface.co/docs/transformers/index (roberta-base, 768-dim 임베딩) | 문맥적 언어 및 의미론적 정서 표현 추출 |
| Seaborn | Seaborn 프로젝트 | 0.12+ | 어텐션 히트맵 및 통계적 시각화 생성 |
| t-distributed Stochastic Neighbor Embedding (t-SNE) | Scikit-learn | scikit-learn.org (Perplexity = 30, Iterations = 1000) | 잠재 정서 클러스터 및 궤적 시각화 |
| Ubuntu Linux | Canonical Ubuntu | 20.04 LTS 또는 이후 버전 | 실험 실행 환경 |
| Vision Transformer (ViT-Base) | Google Research Vision Transformer | ViT-Base/16, 768-dim 임베딩 | 비디오 프레임에서 정서 인지적 시각적 표현 추출 |
| Wav2Vec 2.0 | Meta AI Research | Base 모델, 768-dim 임베딩 | 문맥적 음향 및 음성 정서 특징 추출 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청