Исследовательская статья

Визуальное картирование признаков мультимодальных эмоций для проектирования интеллектуального взаимодействия

DOI:

10.3791/71171

21 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе предлагается комплексная многомодальная структура анализа эмоций, использующая трансформерные кодировщики, распутанные представления эмоций и основанный на графах кросс-модальный механизм внимания с визуальным отображением для повышения точности распознавания эмоций на двух наборах данных.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Визуальное картирование мультимодальных признаков эмоций имеет решающее значение для проектирования интеллектуальных интерфейсов, позволяя машинам понимать, интерпретировать и реагировать на аффективные состояния человека. Тем не менее, современные алгоритмы мультимодального распознавания эмоций сосредоточены преимущественно на прогнозной эффективности, предоставляя мало данных об интерпретируемости, осведомленности о взаимодействии или кросс-модальных взаимодействиях на уровне признаков. В данной работе представлена платформа для визуального картирования аспектов мультимодальных эмоций, которая объединяет ориентированную на взаимодействие визуализацию, интерпретируемое обучение представлениям и прогнозирование эмоций. Для извлечения высокоуровневых эмбеддингов эмоций из текстовой, аудио- и визуальной модальностей без использования созданных вручную признаков применялись энкодеры на базе трансформеров. Для повышения робастности специфическая для эмоций и специфическая для модальности информация была разделена с помощью метода распутывания представлений (disentangled representation learning). Кроме того, была создана кросс-модальная сеть внимания на основе графов, использующая адаптивное взвешивание внимания для имитации тонких эмоциональных связей между модальностями. Для повышения прозрачности был разработан модуль многопроекционного визуального картирования, отображающий временные траектории эмоций, распределения кросс-модального внимания и латентные эмбеддинги эмоций. Для оценки предложенной платформы использовались набор данных Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) и китайский набор данных для мультимодального анализа сентимента (CH-SIMS). Согласно результатам экспериментов, предложенная платформа обеспечила улучшенную интерпретируемость на уровне признаков и визуализацию с учетом взаимодействия, при этом стабильно превосходя репрезентативные базовые методы по точности, F1-мере, корреляции и средней абсолютной ошибке. Кроме того, модуль визуального картирования облегчил качественную интерпретацию мультимодальных представлений эмоций, кросс-модальных взаимодействий и временной динамики эмоций, поддерживая визуализацию и анализ с учетом взаимодействия.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Способность правильно идентифицировать и понимать человеческие эмоции стала крайне важной для улучшения взаимодействия между человеком и машиной. Помимо того, что анализ эмоций необходим для совершенствования человеко-компьютерного взаимодействия, он обладает потенциалом революционизировать ряд областей, включая предварительную медицинскую диагностику1, поведенческий анализ в учебных классах2, психологическое наблюдение за пациентами3, определение усталости водителей в транспортных средствах4 и интеллектуальное управление в системах «умный дом»5. Последние достижения в области аффективных вычислений и глубокого обучения6 усилили интерес к созданию систем реального времени, способных запечатлеть всю сложность человеческих эмоций.

Многие современные методы опираются преимущественно на унимодальные данные, такие как текстовые, графические или слуховые сигналы7,8,9. Такие подходы неоднократно оказывались неспособными распознать тонкие сигналы, например, сарказм или контекстуальные нюансы. В связи с этим исследования перешли к мультимодальной оценке эмоций, которая объединяет дополняющие друг друга данные из нескольких источников для преодоления этих ограничений10,11,12. Преимущества слияния нескольких модальностей были продемонстрированы на базовых моделях, таких как долгосрочная краткосрочная память с ранним слиянием (EF-LSTM)13, облегченные и FM глубокие нейронные сети (LF-DNN)14, тензорные сети слияния (TFN) и подходы к мультимодальному слиянию с низким рангом. Однако большинство этих методов опираются на офлайн-генерацию признаков и не подходят для динамических ситуаций в реальном мире.

С целью учета эмоциональных состояний за последние десять лет значительно развились исследования и приложения в области мультимодального распознавания эмоций15. Одной из наиболее сложных и значимых областей современных исследований является непрерывный мониторинг эмоциональных состояний с использованием различных источников данных16. Концепция мультимодальности возникла естественным образом с появлением столь разнообразных систем знаний, что привело к многим достижениям в применении анализа эмоций в таких областях, как аффективные вычисления, человеко-компьютерное взаимодействие (HCI), обучение, видеоигры, обслуживание клиентов, медицинский уход, оценка пользовательского опыта (UX) и т. д. Тем не менее, применение методов распознавания эмоций при оценке UX не всегда было простым процессом.

Одной из основных причин сосредоточиться на мультимодальном распознавании, а не на унимодальных методах, являются неотъемлемые недостатки использования единственного источника информации. Системы унимодального детектирования эмоций могут иметь более низкую точность из-за отсутствующих или нечетких данных, тогда как схемы MER более надежны и обеспечивают более всестороннее и глубокое понимание экспрессивных состояний за счет интеграции нескольких источников данных17. Например, одного только языка мимики может быть недостаточно для точной классификации чувств, особенно когда жесты сложны или неясны. Однако сочетание мимики с другими формами коммуникации, такими как речь или физические сигналы, может повысить точность распознавания чувств.

Обширные исследования в области распознавания эмоций проводились с использованием нескольких модальностей. Ранние работы были сосредоточены на выявлении отличительных признаков из различных модальностей, таких как графические, акустические или текстовые данные. Однако становится все более очевидным, что интеграция различных модальностей может обеспечить сбалансированную эмоциональную информацию, что ведет к более надежному и точному определению тональности. В данном разделе рассматриваются ключевые достижения в одномодальном и мультимодальном анализе эмоций с упором на базовые подходы, их недостатки и обоснование нашего метода.

Первоначальные исследования по распознаванию эмоций были сосредоточены преимущественно на одной модальности. В визуальной области новаторские исследования привели к категоризации прототипных мимических движений20. Последующие достижения включали методы захвата временной динамики, такие как анализ визуального движения21 и скрытые марковские модели22, в то время как лицевые реакции были разделены на единицы действия с помощью системы кодирования лицевых движений (FACS)23. LSTM и сверточные нейронные сети (CNN) успешно применялись для извлечения значимых признаков непосредственно из необработанных аудиосигналов; методологии идентификации эмоций на основе аудио эволюционировали от традиционной обработки сигналов до глубокого обучения24. Извлечение контекстуальных эмоциональных сигналов в текстовом анализе эмоций было значительно улучшено за счет рекуррентных нейронных сетей (RNN), включающих механизмы внимания, а в последнее время — за счет моделей на базе трансформеров. Несмотря на достигнутые успехи, унимодальные методы по своей сути неспособны точно отобразить всю сложность человеческих переживаний, так как в них отсутствует дополнительная информация, содержащаяся в других модальностях.

В 2021 году были предложены некоторые модели на основе механизмов внимания, такие как модель DialogXL25, предназначенные для сбора долгосрочных контекстных данных в области идентификации тональности диалогов. Kim и соавт.26 представили модель EmoBERTa в 2021 году для повышения точности ERC. Эта модель использует данные о говорящих для улучшения характеристик участников разговоров и их взаимодействия друг с другом. В 2022 году Li и соавт.27 представили метод CoG-BART. В данной структуре используется контролируемое контрастивное обучение для повышения способности модели интерпретировать релевантные данные. Следует отметить, что контролируемое обучение требует значительного объема размеченных данных.

Типичным примером такой работы является фреймворк Multimodal Interaction-Aware Representation (MIAR)28, в котором используются токены взаимодействия признаков и контрастивное выравнивание для улучшения обобщения между модальностями. MIAR улучшает выравнивание модальностей и демонстрирует высокую эффективность на нескольких наборах данных; однако он сосредоточен главным образом на точности прогнозирования, не затрагивая вопрос визуального отображения. Аналогично, модель Cross-Attentional Audio-Visual Fusion29 эффективно фиксирует детализированные аудиовизуальные взаимодействия для прогнозирования валентности и активации, но ограничена двумя модальностями и не обладает возможностями визуализации. Подходы к темпоральному моделированию на основе сетей LSTM и слияния автоэнкодеров успешно улавливают временную динамику эмоций, однако дают ограниченное представление о взаимодействиях модальностей и изученных эмоциональных представлениях. В последнее время методы на основе трансформеров, такие как Transformer-based Multimodal Fusion Network (TMFN)30, продемонстрировали высокую эффективность на наборах данных CMU-MOSI и CMU-MOSEI благодаря улучшенному мультимодальному слиянию и контрастивному обучению. Тем не менее, эти подходы остаются преимущественно ориентированными на производительность и предоставляют ограниченную поддержку интерпретируемости, анализа на уровне признаков и визуализации, ориентированной на взаимодействие.

Для улучшения интеграции текстовых, акустических и визуальных данных было предложено несколько методов мультимодального распознавания эмоций. Несмотря на то, что методы раннего слияния, такие как EF-LSTM и LF-DNN, не позволяли фиксировать сложные кросс-модальные взаимодействия, они продемонстрировали преимущества использования мультимодальной информации для анализа настроений и эмоций. Хотя модель TFN повысила эффективность на эталонных наборах данных, таких как CMU-MOSI и CMU-MOSEI, и ввела явное моделирование интермодальных взаимодействий, ее ограниченная интерпретируемость и высокая вычислительная сложность препятствовали ее практическому применению. Для улучшения выравнивания модальностей и динамического слияния признаков в более современных методах, таких как MIAR, моделях слияния на основе перекрестного внимания (cross-attentional fusion), TMFN и адаптивных мультимодальных трансформерах, стали использоваться топологии трансформеров и механизмы внимания. Эти методы были сосредоточены преимущественно на прогностической способности, предоставляя мало сведений о представлениях эмоций на уровне признаков и кросс-модальных зависимостях, несмотря на достижение конкурентоспособных результатов по общепринятым метрикам оценки, таким как точность (accuracy), F1-мера (F1-score) и средняя абсолютная ошибка (mean absolute error). Кроме того, лишь в немногих исследованиях были разработаны методы визуализации, способные раскрыть латентные эмбеддинги эмоций, распределение внимания и временную динамику эмоций, или была интегрирована модель интермодальных взаимодействий на основе графов. Предлагаемый подход включает многовидовое визуальное отображение, слияние кросс-модального внимания на основе графов и обучение распутанным представлениям (disentangled representation learning) для преодоления этих недостатков и повышения эффективности мультимодального распознавания эмоций.

Аналогичным образом, в Adaptive Multimodal Transformer32 предлагается объединение на основе обмена для адаптивного смягчения влияния зашумленной или недостающей модальной информации, что повышает эффективность классификации тональности. Хотя этот подход позволяет эффективно устранить расхождения в распределении модальной информации, его архитектура специфична для задачи анализа тональности и дает ограниченное представление об изученных эмоциональных репрезентациях. Другим значимым вкладом является Multimodal Fusion Model33, которая объединяет CNN, мультипликативные LSTM и внимание на базе трансформеров для распознавания мультимодальных эмоций в режиме реального времени. Модель выполняет полное слияние видео-, аудио- и текстовых модальностей и демонстрирует высокую стабильность распознавания. Тем не менее, как и другие существующие модели, она ориентирована преимущественно на точность прогнозирования и не имеет явных признаков для визуализации и интерпретируемости, ориентированной на взаимодействие.

В заключение следует отметить, что, хотя современные подходы к мультимодальному распознаванию эмоций достигли значительных успехов в улавливании кросс-модальных взаимодействий и повышении точности прогнозирования, большинство из них сосредоточено на задачах, ориентированных на распознавание. Мало внимания уделялось таким областям, как интерпретируемость на уровне признаков, визуализация эмоциональных представлений в пространстве изображений и внедрение предлагаемой структуры для проектирования интеллектуального взаимодействия. Именно с учетом этих проблем предлагается данная структура.

Большинство современных методов сосредоточены прежде всего на повышении прогностической точности, предлагая при этом слабую интерпретируемость выученных эмоциональных представлений и кросс-модальных взаимодействий, несмотря на значительные успехи в области мультимодального распознавания эмоций28,29. Сложные взаимодействия между текстовой, акустической и визуальной модальностями зачастую трудно моделировать с помощью текущих стратегий слияния, особенно при наличии расхождений между модальностями и нехватки информации 28,31. Хотя архитектуры на основе трансформеров и механизмы внимания улучшили обучение представлениям, их прозрачность и интерпретируемость часто снижаются из-за отсутствия явного разделения информации, специфичной для эмоций, и информации, специфичной для модальностей31,32,33. Кроме того, лишь в небольшом количестве исследований изучалось графовое моделирование интермодальных взаимодействий или создавались системы визуализации, способные раскрыть временную динамику эмоций, распределение внимания и эмбеддинги эмоций. Эти недостатки демонстрируют необходимость в интерпретируемой мультимодальной структуре для интеллектуального человеко-машинного взаимодействия, которая сочетала бы в себе ориентированное на взаимодействие визуальное картирование с эффективным кросс-модальным обучением.

В данной работе представлена интерпретируемая структура для визуального картирования мультимодальных аспектов эмоций при проектировании интеллектуальных интерфейсов. Система использует сквозное глубокое обучение для извлечения высокоуровневых эмоциональных представлений из текстовых, аудио- и визуальных модальностей без необходимости создания признаков вручную. Кросс-модальные эмоциональные взаимодействия моделируются с помощью механизма слияния на основе графового внимания, который разделяет специфичную для эмоций и специфичную для модальности информацию, что обеспечивает распутывающее обучение представлениям и повышает интерпретируемость и устойчивость. Кроме того, создан модуль многоракурсной визуализации для отображения временной динамики эмоций, паттернов кросс-модального внимания и эмбеддингов эмоций. Эффективность и применимость предложенной структуры в интеллектуальных системах взаимодействия человека и машины оцениваются путем валидации на эталонных наборах данных для мультимодального распознавания эмоций.

Данная работа предлагает уникальную структуру для визуального картирования мультимодальных аспектов эмоций, которая выходит за рамки традиционных подходов, ориентированных на прогнозирование, чтобы преодолеть недостатки моделирования кросс-модальных взаимодействий и ограниченную интерпретируемость в современных системах идентификации мультимодальных эмоций. В рамках единой архитектуры предлагаемый подход объединяет мультимодальное обучение представлениям на основе трансформеров, распутанное моделирование признаков с учетом эмоций, слияние кросс-модального внимания на основе графов и визуализацию, ориентированную на взаимодействие. В отличие от существующих подходов, которые в основном сосредоточены на показателях классификации, данная структура четко разделяет специфичные для эмоций и специфичные для модальностей представления для повышения интерпретируемости, робастности и кросс-модальной согласованности. Кроме того, представлен механизм внимания на основе графов, который позволяет осуществлять адаптивное моделирование интермодальных взаимодействий путем захвата детальной эмоциональной взаимозависимости между текстовой, аудио- и визуальной модальностями. Для повышения прозрачности создан модуль многоракурсного визуального картирования, раскрывающий временные траектории эмоций, паттерны кросс-модального внимания и латентные эмбеддинги эмоций, что дает интуитивное понимание процесса принятия решений моделью. Помимо обеспечения улучшенной визуализации и интерпретируемости мультимодальной эмоциональной динамики, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала конкурентоспособные результаты с точки зрения точности, F1-меры, средней абсолютной ошибки и корреляции.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемая работа направлена на совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального отображения мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с правилами эксплуатации, стандартами исследований и условиями лицензирования, установленными их соответствующими создателями. Мультимодальное содержимое наборов данных, включая текстовые, аудио- и видеоданные, было первоначально собрано и аннотировано поставщиками данных в соответствии с полученными разрешениями участников и протоколами сбора данных. В данном исследовании не было прямого взаимодействия с людьми, не проводился набор новых участников и не собиралась лично идентифицируемая информация. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не требовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование проводилось в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этические процедуры исследований и применимые политики использования данных.

Для изучения характеристик эмоций в разных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени используется компонент многопроекционного визуального отображения, эффективность которого оценивается для распознавания эмоций. Результаты показывают, что предложенный метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов, учитывающих эмоции, в реальных условиях. На рисунке 1 представлена архитектурная схема предлагаемой работы. На рисунке 1 показан полный рабочий процесс предложенного фреймворка визуального отображения для обучения многомодальным признакам эмоций в контексте интеллектуальных систем взаимодействия. Процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют взаимодополняющую эмоциональную информацию из лингвистической, просодической модальностей и модальности мимики соответственно. Специализированный для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где эмбеддинги, специфичные для эмоций, отделяются от признаков, специфичных для модальности, чтобы обеспечить согласованность выученных эмоций в различных гетерогенных источниках данных. Эмбеддинги специфических эмоций из каждой модальности затем объединяются сетью кросс-модального внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. В конечном итоге фреймворк предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.

Мультимодальный сбор данных

CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных набора данных, содержащих синхронизированную видео-, аудио- и текстовую информацию. Набор данных CH-SIMS включает результаты мультимодальных исследований китайцев и состоит из 2 281 видеофрагмента, отобранных из различных отрывков фильмов, телевизионных драм и развлекательных шоу. Добавление соответствующих аудиозаписей и текста к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически реализуемыми. В свою очередь, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является CMU-MOSEI, который был сформирован из более чем 23 000 видеоклипов с высказываниями более чем 1 000 спикеров на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.

Текстовые транскрипции, аудиосигналы и видеокадры собираются и выравниваются по временным меткам для обеспечения точного соответствия на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и объединения на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокального тона и лингвистического содержания. Подобный метод мультимодального сбора данных обеспечивает эффективное извлечение межмодальной эмоциональной динамики, что является критически важным для проектирования интеллектуального взаимодействия и понятного визуального картирования.

Таблица 1 представляет основные структуры мультимодальных наборов данных эмоций, используемых в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произносимые слова, интонации голоса и мимика, в CH-SIMS и CMU-MOSEI интегрированы видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет провести тщательное исследование взаимодействия модальностей и вариативности эмоций в Китае. С другой стороны, набор данных CMU-MOSEI имеет большее значение для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассматриваемых в данной работе, так как он содержит большой объем данных на разных языках, по различным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, он снижает трудности при выборе информации во время тестирования моделей.

Мультимодальная предобработка и синхронизация

Временные метки аннотаций из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечивало согласованное обучение мультимодальным представлениям. Каждое высказывание служило базовой единицей анализа и было связано с соответствующими сегментами аудио и видео в пределах того же временного интервала. Выравнивание выполнялось на уровне высказываний. Транскрипт был разделен на сегменты на основе меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио и видео устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попадающих в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента выбирались с заданной частотой и кодировались с помощью Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения всех признаков модальностей к единой границе высказывания, поскольку три модальности создавали последовательности признаков разной длины. Для нормализации последовательностей различной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями (zero-padding). При обучении использовались маски внимания, чтобы отделить дополняющие элементы от истинных позиций признаков. Перед объединением эмбеддинги конкретных модальностей проецировались в общее латентное пространство, чтобы преодолеть различие в длине последовательностей разных модальностей. Это обеспечило размерную согласованность и позволило графовому механизму внимания эффективно реализовать обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований были исключены образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.

Извлечение признаков на основе трансформеров

Для извлечения высокоуровневых признаков, отражающих эмоциональное состояние, используется метод глубокого обучения, который в сквозном режиме (end-to-end) обрабатывает информацию из нескольких модальностей, таких как зрение, звук и текст, после выравнивания мультимодальных данных и проведения необходимой предобработки. Благодаря использованию трансформерного кодировщика для извлечения внутренне дискриминативных представлений признаков из необработанных мультимодальных данных, предлагаемый метод исключает необходимость в ручном конструировании признаков (feature engineering). Для обеспечения согласованности между наборами данных, используемыми в данном подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой из отдельных модальностей, включая изображения, аудио и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе; в частности, такой метод извлечения признаков применяется к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для обучения высокоуровневым признакам на данных различного объема.

Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния

Для извлечения визуальной информации из видеокадров с целью получения пространственных представлений, релевантных эмоциям, использовалась модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого видеосегмента масштабировались до (224 × 224) пикселей и сэмплировались через регулярные временные интервалы. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров проецировались в 768-мерное пространство эмбеддингов с использованием предобученной модели ViT в качестве визуального бэкенда. Эмбеддинги на уровне кадров объединялись с помощью усредняющего пулинга (mean pooling) для создания итогового визуального представления каждого сегмента. В процессе обучения для улучшения обобщающей способности применялись нормализация изображений и стандартные методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая архитектура мультимодального слияния была использована для объединения этих визуальных эмбеддингов с текстовыми и слуховыми представлениями.

Для сохранения временной динамики эмоций для визуальной модальности будет выполнено равномерное сэмплирование видеообразцов из наборов данных CH-SIMS и CMU-MOSEI. Кадры каждого видео, figure-protocol-1, могут быть разделены на N секций фиксированного размера, которые затем выравниваются и инверсно переносятся в латентное пространство эмбеддингов с размерностью figure-protocol-2. Последовательность создается путем добавления позиционных эмбеддингов и обучаемого группирующего токена:

figure-protocol-3   (1)

где figure-protocol-4 обозначает позиционное кодирование, а figure-protocol-5 представляет собой матрицу эмбеддинга патчей.

Для обработки последовательности встроенных патчей используются стеки слоев энкодера трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:

figure-protocol-6   (2)

figure-protocol-7   (3)

Для получения вектора визуальных признаков, учитывающего эмоции, в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса figure-protocol-8. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании наборов данных, эмбеддинги на уровне кадров из каждого сегмента видео объединяются для фиксации мимики и динамики развития эмоций.

Аудиомодальность с использованием Wav2Vec 2.0 для получения просодических и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с помощью предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегирования выходных скрытых представлений с помощью усреднения (mean pooling). Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и релевантных эмоциям характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы и передискретизированы до 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных границ, указанных в аннотациях набора данных. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем, с использованием итоговых аудиоэмбеддингов, было выполнено кросс-модальное слияние на основе графового внимания и обучение распутанным представлениям (disentangled representation learning).

Для аудиомодальности используется Wav2Vec-2.0 для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала существует сверточное кодирование признаков figure-protocol-9:

figure-protocol-10   (4)

где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на базе трансформера полезна для вышеупомянутых структур, так как она представляет долгосрочные временные зависимости:

figure-protocol-11   (5)

Данные просодические и семантические акустические характеристики, имеющие ключевое значение для выражения эмоций, включены в эти контекстуальные акустические представления. Акустический эмбеддинг определенной длины создается путем выполнения процедуры временного пулинга:

figure-protocol-12   (6)

Данная архитектура исключает использование акустических признаков, таких как MFCC, и обеспечивает устойчивость за счет использования данных английской речи из CMU-MOSEI и данных китайской речи из CH-SIMS путем простого извлечения представлений из осциллограмм.

Текстовая модальность с использованием RoBERTa для получения контекстных эмбеддингов эмоций

Для текстовой модальности к транскриптам речи из двух наборов данных применяется глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации использовались кодировщики на базе RoBERTa. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с использованием соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Для обеспечения согласованной пакетной обработки входные последовательности преобразовывались в токен-эмбеддинги и дополнялись или обрезались до заранее определенной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделителя. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных кодировщиком трансформера, с использованием финального представления предложения, эквивалентного [CLS]. Чтобы адаптировать изученные представления к задаче распознавания эмоций, предобученные кодировщики RoBERTa были доработаны с помощью мультимодального обучения. Затем предлагаемая структура мультимодального слияния использовалась для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.

Токенизированные эмбеддинги и позиционные кодирования могут быть объединены для каждого входного токена, figure-protocol-13, чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как

figure-protocol-14   (7)

Эта форма представлена через слои L-трансформера, который использует механизм собственного внимания (self-attention) для выявления контекстных зависимостей между словами:

figure-protocol-15  (8)

Контекстуальный эмбеддинг эмоций получается с использованием конечного скрытого состояния классификационного токена:

figure-protocol-16   (9)

Полярность сентимента, интенсивные эмоции и связанные с ними смысловые оттенки являются примерами лингвистических характеристик, относящихся к эмоциям, которые будут представлены данным эмбеддингом. RoBERTa упрощает языково-независимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.

Предложенный этап глубокого обучения представлению признаков позволяет извлечь три специфичных для каждой модальности вектора признаков размерностью 768: визуальный fv, аудио fa и текстовый ft . В структуре интеллектуального взаимодействия эти выученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на базе графов и обучения распутанным представлениям.

Обучение распутанным представлениям

После получения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков из визуальной, аудиальной и текстовой модальностей может позволить получить разделенное описание эмоций. Если специфические для модальности вложения признаков аудиальной, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, так что figure-protocol-17  и figure-protocol-18, целью данного этапа является факторизация всех признаков модальностей в два различных латентных описания, которые включают описания эмоций с учетом предшествующей семантики каждой из различных модальностей.

Это достигается путем подачи признака каждой модальности fm в две параллельные проекционные сети: кодировщик эмоций figure-protocol-19  и кодировщик модальности figure-protocol-20, в которых формируются два соответствующих кодирования.

figure-protocol-21  (10)

Здесь figure-protocol-22 латентный признак, связанный с эмоцией, представлен как figure-protocol-23 , что представляет собой латентный признак, специфичный для конкретной модальности. Это позволяет эмоциоспецифичным эмбеддингам многократно взаимодействовать с общим пространством при обработке различных входных данных, включая аудио-, визуальные и текстовые, сохраняя при этом уникальные структурные данные, характерные для каждой модальности.

Эффективное разделение обеспечивается путем реконструкции с использованием ограничений независимости. Реконструкция признаков исходной модальности выражается следующим образом:

figure-protocol-24  (11)

где figure-protocol-25 представляет собой сеть-декодер. Потери при реконструкции позволяют сохранить следующие данные:

figure-protocol-26   (12)

Кроме того, ортогональность или декорреляция между эмоциями и специфическими для модальности изображениями часто ограничивают перекрытие информации:

figure-protocol-27   (13)

Достигая этих целей, модель может сформировать представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное слияние на основе графов и визуальное картирование признаков, особенно для проектирования интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.

Согласованность эмоций между модальностями

Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это объясняется тем, что стратегии слияния больше не нуждаются в компенсации значительных разрывов между двумя представлениями, поскольку специфические для модальностей эмоцональные эмбеддинги разделяют одно и то же латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом figure-protocol-28. Взвешенное слияние будет более стабильным при условии согласованности специфических для эмоций представлений, так как вариации между сигналами различных модальностей больше не будут влиять на результат.

figure-protocol-29   (14)

За счет обеспечения семантического выравнивания эмоциональной информации эта цель минимизирует расхождения между модальностями и гарантирует, что восприятие эмоций остается неизменным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное пространство представлений путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.

Влияние на кросс-модальное слияние

Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между различными модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку специфичные для эмоций эмбеддинги выровнены в общем латентном пространстве. Слитое представление эмоции определяется следующим образом:

figure-protocol-30  (15)

Где αm представляет собой вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфические для эмоций представления согласованы, так как результат слияния демонстрирует дополняющие друг друга эмоциональные признаки, а не противоречивые сигналы модальностей.

С математической точки зрения, снижение figure-protocol-31 дисперсии между различными типами представлений конкретных эмоций по отношению к figure-protocol-32 эквивалентно следующему:

figure-protocol-33   (16)

где figure-protocol-34 представляет собой среднее выражение эмоций. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.

Конечной целью обучения при использовании визуализации распутанных эмоций является объединение фрагментации, реконструкции и однородности эмоций:

figure-protocol-35   (17)

два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между кросс-модальной надежностью эмоций и диссоциацией. Предложенная модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления для достижения этой цели, уделяя особое внимание созданию прочного фундамента для последующего объединения на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.

Графовое кросс-модальное внимание для слияния данных

Для моделирования детальных эмоциональных связей между модальностями была использована кросс-модальная сеть внимания на основе графов. Для облегчения потока информации между модальностями был построен полносвязный мультимодальный граф, в котором каждое модальное эмбеддинг-представление (текстовое, аудио- и визуальное) представлено в виде узла графа. Связи между модальностями использовались для формирования матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проецирования выходных данных нескольких голов внимания. Затем было получено унифицированное мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем передавалось в модули прогнозирования и визуализации для анализа с учетом взаимодействия и распознавания эмоций. Модуль графового слияния имел размерность скрытого представления 256 и два слоя графового внимания, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем графового внимания следовали слой нормализации, остаточные связи и dropout с коэффициентом 0,2 для повышения стабильности обучения и снижения переобучения. После конкатенации и проецирования выходных данных нескольких голов внимания в общее латентное пространство представления узлов объединялись в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многопроекционного визуального картирования и прогнозирования эмоций.

Разнообразные кросс-модальные взаимодействия регистрировались с помощью многоголового графового внимания. Для нормализации коэффициентов внимания между связанными узлами для каждого узла использовалась функция softmax. Для повышения стабильности обучения и предотвращения переобучения за стекированными слоями графового внимания модуля слияния графов следовали остаточные связи, послойная нормализация и регуляризация с применением дропаута.

Пусть члены figure-protocol-36 по отдельности представляют собой представления, соответствующие конкретным эмоциям, полученным из визуальной, аудио- и текстовой модальностей; каждый компонент находится в общем латентном пространстве figure-protocol-37. Модели для узлов модальностей используют обозначение для графа figure-protocol-38, где узлы множества figure-protocol-39 соответствуют трем узлам самих модальностей, чтобы явно усилить эмоциональные зависимости, общие для представлений различных модальностей.

После присвоения специфического для данной эмоции вектора признаков каждому узлу графа мы получаем следующее:

figure-protocol-40   (18)

В отличие от традиционных методов слияния, использующих предопределенные или фиксированные веса слияния, предлагаемый метод позволяет определять адаптивные веса ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.

Для кросс-модального слияния используется графовая сеть внимания (Graph Attention Network, GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:

figure-protocol-41   (19)

Эмоциональный эффект при переключении из режима j в модальность i измеряется с помощью нормированных весов αij.

Затем вычисляется объединенный вид каждого узла модальности как средневзвешенное значение его соседей:

figure-protocol-42   (20)

где функция активации figure-protocol-43 является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального комбинированного представления эмоций:

figure-protocol-44   (21)

Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального отображения, поскольку он позволяет извлечь дополняющую друг друга информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.

Алгоритм 1 (Дополнительный файл 1) представляет общую схему реализации кросс-модального слияния на основе графов. На начальном этапе создается граф, в котором специфические для эмоций характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем вычисляются показатели внимания для пар узлов каждого графа, которые представляют комбинацию эмоциональной зависимости. Далее показатели внимания нормализуются для определения относительного вклада каждой модальности в заданный эмоциональный контекст, что позволяет обучить веса внимания. На заключительном этапе формируется общий эмбеддинг эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, общая процедура слияния мультимодальных признаков, связанных с определенными эмоциями, демонстрирует перспективность с точки зрения адаптивности, интерпретируемости и контекстуального интеллекта.

Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети кросс-модального внимания для мультимодального объединения признаков сентимент-анализа. Эмбеддинги специфичных для эмоций признаков, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальностей, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем взвешенные с учетом внимания представления модальностей объединяются для формирования единого эмоционального эмбеддинга, в котором матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обученная сетью, динамически модулирует вклад каждой модальности, что позволяет системе фокусироваться на наиболее информативной модальности, игнорируя зашумленные и менее значимые данные. Объединенное представление эмоций обеспечивает точное распознавание эмоций и детальный анализ таких эмоциональных состояний, как нейтральное, объятия и беспокойство.

Модуль визуального картирования

С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать унифицированное представление эмоционального состояния в визуальную форму, которая является понятной и легко воспринимаемой после процесса кросс-модального слияния, основанного на графе.

Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двумерное пространство для отображения с использованием стохастического соседства с t-распределением (t-SNE). Для t-SNE использовались значение перплексии 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания, использовались для создания теплокарт внимания. На этих теплокартах отображен относительный вклад текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально исследовать межмодальные связи и поток информации внутри структуры слияния. Для изучения временной динамики эмоций были построены графики траекторий эмоций путем мониторинга развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории проясняют, как эмоциональные состояния и вклад модальностей изменяются с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и теплокарт внимания.

Пусть переменная figure-protocol-45 представляет собой объединенное представление эмоционального состояния, полученное с помощью функции графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.

Используя полученные αji, создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем веса входящего внимания суммируются для определения совокупного показателя значимости каждой модальности:

figure-protocol-46    (22)

где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и сопоставляются с цветовой картой, которая позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в различных интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым модальностям ввода такой интерфейс помогает пользователю понять, как работает механизм внимания системы.

Обученный граф специально смоделирован как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом в графе, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на ребрах, которые их соединяют. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определения i и j следующие:

figure-protocol-47   (23)

Благодаря этим весам толщина линий или прозрачность визуализации графа отображаются надлежащим образом. Это облегчает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия дизайнер может лучше понять, как взаимодействуют эмоциональные индикаторы в процессе слияния.

Объединенные эмбеддинги эмоций figure-protocol-48 на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:

figure-protocol-49   (24)

где функция проекции представлена выражением figure-protocol-50. Появление 2D/3D траекторий эмоций, отражающих переходы, интенсивность и стабильность эмоций в ходе взаимодействий, может быть интерпретировано как интуитивное описание эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.

В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, данная система ориентирована на демонстрацию механизмов формирования человеческих эмоций внутри нее. Она раскрывает процесс принятия решений, предлагая визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействие между моделями и соответствующие им пути. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.

Таким образом, сопоставление эмоций с понятными формами посредством визуальных представлений может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией в проектирование интеллектуальных интерфейсов. Данные, собранные обоими подходами, затем могут быть использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам взаимодействия важную информацию для разработки более точных пользовательских интерфейсов. Иными словами, понимание эмоций становится активной частью проектирования взаимодействия. Точность может повыситься только в том случае, если понимание эмоций будет активно интегрировано в процесс проектирования взаимодействия.

Модуль визуального картирования обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает лежащие в основе представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальностей использует данные из графов взаимодействия и тепловых карт визуального внимания для описания того, какой вклад каждая модальность — визуальная, аудио- или текстовая — вносит в решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют нам понять, как каждая визуальная и текстовая модальность изменяется с течением времени с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Дополнительный файл 1).

Объединенные мультимодальные эмоциональные признаки отображаются в визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения Algorithm 2. Веса мультимодального внимания на основе графов используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются в виде визуальных представлений с использованием элементов тепловых карт, чтобы выделить основные источники, влияющие на эмоции. Для обеспечения детального анализа взаимодействия между входными элементами и передачи эмоциональной динамики, вызванной мультимодальными входными данными, вычисляется сила попарного взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается представление эмоциональной динамики путем отображения объединенных эмоциональных элементов, собранных за определенное время, в низкомерное пространство для получения непрерывной эволюции эмоциональных элементов.

Прогнозирование эмоций и обратная связь при взаимодействии

Результат объединенного представления эмоций, выраженный формулой figure-protocol-51, затем используется в качестве функции как для обратной связи при взаимодействии, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая модель классификации на основе функции softmax:

figure-protocol-52   (25)

где figure-protocol-53 представляет вероятности ожидаемого класса эмоций, а Wc  и bc являются обучаемыми ограничениями. Для улучшения цели классификации используется перекрестная энтропия:

figure-protocol-54  (26)

где yk — истинная метка, а K — количество классов эмоций. Параллельно используется регрессионная ветвь для оценки интенсивности эмоций, которая выдает прогноз различных непрерывных аффективных атрибутов, включая валентность и уровень возбуждения. Дайте ей следующее определение:

figure-protocol-55   (27)

где ожидаемый показатель интенсивности эмоций обозначается как figure-protocol-56. Для оптимизации задачи регрессии используется функция потерь в виде среднеквадратичной ошибки:

figure-protocol-57   (28)

В целом, эти две задачи объединяются в целевой функции прогнозирования:

figure-protocol-58   (29)

где цели регрессии и классификации сбалансированы с помощью λ. Это предполагает динамическое изменение модуля визуализации на основе определенного эмоционального состояния для обеспечения такого типа обратной связи с учетом взаимодействия. Контекст взаимодействия в данный момент времени t представлен ct. Ответ модуля визуализации определяется следующим образом:

figure-protocol-59    (30)

где функция адаптации визуализации представлена формулой figure-protocol-60. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Таким образом, система не только демонстрирует высокую точность прогнозирования эмоционального состояния, но и обеспечивает существенную поддержку обратной связи.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе с помощью двух эталонных наборов данных, CH-SIMS и CMU-MOSEI, подтверждается эффективность предлагаемого фреймворка визуального отображения мультимодальных признаков эмоций с точки зрения как интерпретируемости с учетом взаимодействия, так и прогностической способности. Согласно результатам экспериментов, предложенный подход стабильно превосходит существующие методы мультимодального распознавания эмоций по ряду показателей, включая корреляцию, точность (accuracy), F1-меру и среднюю абсолютную ошибку (MAE). Распутанное представление эмоций, механизм кросс-модального слияния на основе графов и стратегия сквозного глубокого обучения представлениям способствуют этому улучшению, обеспечивая более стабильное и семантически согласованное моделирование эмоций. Предложенный подход обеспечивает более глубокое понимание на уровне признаков благодаря визуальному отображению, что выходит за рамки количественного прироста и упрощает понимание вклада каждой модальности и динамики эмоций. Несмотря на различия в языке, культурных особенностях выражения и объеме наборов данных, вышеупомянутое повышение производительности последовательно наблюдается в обоих датасетах, что демонстрирует высокую обобщающую способность предложенного фреймворка.

В предлагаемой работе используются общедоступные наборы данных для мультимодального анализа эмоций CH-SIMS и CMU-MOSEI. Набор данных CH-SIMS состоит из 2 281 видеоклипа из фильмов, телесериалов и развлекательных шоу. В CH-SIMS доступны синхронизированные текстовые, аудио- и визуальные данные. Как унимодальные, так и мультимодальные метки тональности классифицируются по категориям: положительная, нейтральная и отрицательная. Обширный англоязычный мультимодальный набор данных, известный как CMU-MOSEI, содержит около 23 453 аннотированных видеоклипов с участием более 1 000 говорящих, обсуждающих широкий спектр тем. Этот набор данных содержит как непрерывные аннотации интенсивности эмоций, такие как валентность и возбуждение, так и категориальные метки эмоций. Эксперименты на этих двух наборах данных с использованием предложенной структуры обеспечивают устойчивость и надежность результатов за счет поддержки различных лингвистических, культурных и эмоциональных условий. В Таблице 2 приведены сведения о среде моделирования.

Основные экспериментальные настройки и параметры реализации, использованные для оценки предлагаемой структуры, обобщены в данной симуляционной среде. Для обеспечения единообразной размерности признаков в текстовой, аудио- и визуальной модальностях повсеместно применяются энкодеры на базе трансформеров. В системе используется механизм внимания на основе графов для кросс-модального слияния, что позволяет адаптивно изучать взаимосвязи между модальностями в отношении эмоциональных состояний.

Предлагаемая архитектура извлекает текстовые, слуховые и визуальные представления с помощью кодировщиков модальностей на базе трансформеров. Полносвязные слои с функцией активации ReLU проецируют специфичные для каждой модальности эмбеддинги в общее латентное пространство. Затем для обучения распутанным представлениям используются отдельные кодировщики, специфичные для конкретных эмоций и модальностей, каждый из которых состоит из двух полносвязных слоев с нелинейной активацией и нормализацией. Латентные представления проецируются в 256-мерное пространство признаков, где информация для каждой модальности и эмоции изучается раздельно. Для сохранения информации о модальности и обеспечения эффективного распутывания используются декодировщики реконструкции. Перед мультимодальным слиянием и прогнозированием модуль кросс-модального внимания на основе графов моделирует эмоциональные зависимости между модальностями, используя латентные представления. Сеть обучали с помощью оптимизатора Adam с начальной скоростью обучения 1 × 10⁻4 и размером пакета 32. Для предотвращения переобучения применялась ранняя остановка на основе потерь на валидационной выборке. Общая целевая функция включала потери классификации, реконструкции и согласованности представлений, каждая из которых имела вес, определяемый настраиваемыми гиперпараметрами. Обучение модели проводилось до 100 эпох, и для тестирования была выбрана модель с наилучшими показателями на валидационном наборе данных.

Предложенная структура была оценена с помощью метрик классификации, включая Accuracy, Precision, Recall и F1-score, а также метрик регрессии, таких как средняя абсолютная ошибка (MAE). Precision, Recall и F1-score рассчитывались с использованием макроусреднения для учета дисбаланса классов по категориям эмоций. Для экспериментов по классификации в качестве эталонных классов использовались предопределенные метки эмоций/сентимента из наборов данных CH-SIMS и CMU-MOSEI. Для прогнозирования сентимента на основе регрессии в качестве целевых переменных служили непрерывные показатели интенсивности сентимента из этих наборов данных. Для анализа эффективности прогнозирования по классам и паттернов ошибочной классификации с доверительным интервалом 95% были построены матрицы ошибок. Для обеспечения устойчивости каждый эксперимент повторяли 5 раз с различными случайными инициализациями; представленные результаты соответствуют среднему значению ±± стандартному отклонению показателей по всем запускам. Статистическая значимость оценивалась с помощью соответствующих процедур проверки гипотез, а там, где это было применимо, рассчитывались доверительные интервалы. Время обучения измерялось как общее время, затраченное на сходимость модели на указанной аппаратной платформе.

Предложенный метод можно сравнить с рядом репрезентативных базовых моделей, включая модели с ранним и поздним объединением данных. К ним относятся TFN, методы на основе LSTM, низкоранговые модели мультимодального объединения, адаптивные мультимодальные трансформеры и новые архитектуры на основе кросс-модального внимания. Эти базовые модели отражают передовые методы, которые в первую очередь направлены на повышение точности распознавания эмоций с помощью различных способов объединения данных. В отличие от этих методов, сосредоточенных преимущественно на прогнозировании на уровне выходных данных, предлагаемая структура с обучением распутанных представлений и объединением на основе графов повышает интерпретируемость и осведомленность о взаимодействиях. Примерами базовых моделей, реализованных с использованием их официальных репозиториев или общедоступных эталонных реализаций, являются LSTM Fusion, TFN, низкоранговое мультимодальное объединение (LMF), Adaptive-Graph и методы на основе трансформеров. В тех случаях, когда это было возможно, использовались оригинальные настройки гиперпараметров авторов. Для обеспечения объективности сравнения все переобученные базовые модели оценивались с использованием одних и тех же разделений набора данных, методов предобработки, параметров оптимизации и критериев оценки. В сравнительных таблицах четко указаны соответствующие ссылки на данные, взятые непосредственно из более ранних публикаций.

Точность

Точность классификации дискретных эмоций измерялась для CH-SIMS и CMU-MOSEI; однако тенденция изменения точности различается в зависимости от характеристик двух наборов данных. Поскольку CH-SIMS представляет собой набор данных среднего размера с равным количеством категорий сентимента и тщательно предобработанными видеоклипами, точность его классификации высока, что свидетельствует о способности модели улавливать тонкую мультимодальную эмоциональную информацию при низком уровне шума. В то же время точная классификация эмоций в CMU-MOSEI представляет собой более сложную задачу, так как это крупномасштабный набор данных с участием носителей языка из различных социальных групп. Таким образом, помимо способности модели определять сентимент, точность на наборе данных CMU-MOSEI указывает на ее способность к обобщению и устойчивость к различным сценариям взаимодействия. Повышение точности на обоих наборах данных показывает, что предлагаемый подход хорошо обобщается на данные с разными языками, объемами и уровнями эмоциональной сложности.

Точность классификации предлагаемого подхода и других общепринятых базовых методов на наборах данных CH-SIMS и CMU-MOSEI представлена в Таблице 3. Как показано в Таблице 3, предлагаемая архитектура достигла наивысшей точности на обоих наборах данных, CH-SIMS и CMU-MOSEI, превзойдя самый сильный базовый метод (Adaptive-Graph) примерно на 3,3% и 3,1 процентного пункта соответственно. Более низкие значения стандартного отклонения также указывают на большую стабильность при повторных экспериментальных запусках. Традиционные подходы на основе LSTM-fusion демонстрируют более низкую точность из-за их ограниченной способности улавливать сложные кросс-модальные связи. TFN и LMF повышают точность классификации за счет моделирования этих кросс-модальных связей.

F1-мера

В задачах классификации эмоций баланс между полнотой и точностью измеряется с помощью F1-меры. Она более подходит для мультимодальных наборов данных по классификации эмоций, в которых, скорее всего, будет наблюдаться неравномерное распределение классов. В задачах классификации эмоций баланс между полнотой и точностью измеряется с помощью F1-меры. Поскольку ожидается, что мультимодальные наборы данных для классификации эмоций будут несбалансированными, использование F1-меры является более целесообразным. Чем лучше модель определяет классы эмоций, тем выше значение F1-меры.

Рисунок 3 иллюстрирует оценку F1-меры предлагаемого метода в сравнении с базовыми моделями на наборе данных CH-SIMS. Самая низкая F1-мера базовой модели на основе LSTM свидетельствует о ее ограниченной способности моделировать сложные кросс-модальные эмоциональные связи. Сравнение F1-мер, полученных при использовании оцениваемых методов на наборе данных CH-SIMS, представлено на Рисунке 3. Как показано, более сложные структуры на основе графов и трансформеров обычно превосходят традиционные методы слияния. Самый низкий показатель F1-меры был у модели LSTM (0.71), за ней следуют TFN (0.74) и LMF (0.76). При использовании Adaptive-Graph значение F1-меры увеличилось до 0.79, что подтверждает важность моделирования интермодальных связей. Предлагаемая архитектура с F1-мерой 0.82 превзошла Adaptive-Graph на 3.8%, LMF на 7.9%, TFN на 10.8% и LSTM на 15.5%. Эти результаты показывают, что предложенный механизм кросс-модального внимания на основе графов и обучение распутанным представлениям более эффективно извлекают дополняющую друг друга эмоциональную информацию из текстовой, аудио- и визуальной модальностей, что приводит к повышению точности классификации.

Относительные тенденции остаются неизменными, хотя во всех методах наблюдается небольшое снижение F1-score по сравнению с CH-SIMS, как показано на Рисунке 4. Результаты демонстрируют стабильное улучшение производительности при переходе от традиционных методов объединения к стратегиям мультимодального обучения на основе графов. Самый низкий F1-score показали модели LSTM (0,69), TFN (0,72) и LMF (0,74). Производительность модели Adaptive-Graph увеличилась до 0,77, что демонстрирует эффективность моделирования кросс-модальных связей. Предложенная архитектура превзошла все остальные подходы, достигнув максимального значения F1-score 0,80. Преимущество над самым сильным базовым решением, Adaptive-Graph, подтверждает вклад предложенного обучения распутанным представлениям эмоций и механизма кросс-модального внимания на основе графов в улавливание взаимодополняющих эмоциональных признаков в текстовой, акустической и визуальной модальностях. Эти результаты показывают, что предложенная архитектура для мультимодального распознавания эмоций является надежной и эффективной. Предложенный подход демонстрирует значительное улучшение по сравнению как с методом на основе графов, так и с традиционным методом объединения, что дополнительно подтверждает высокую обобщающую способность метода. Повышение F1-score на наборе данных CMU-MOSEI доказывает, что предложенный подход позволяет добиться сбалансированной производительности классификации эмоций даже в зашумленных и разнообразных средах.

Прецизионность

В интеллектуальных системах связи точность имеет решающее значение, поскольку ложный эмоциональный сигнал может ухудшить пользовательский опыт. Точность (precision) определяется как отношение количества правильно предсказанных случаев конкретной эмоции к общему числу случаев, которые были определены как данная эмоция. Поскольку распутанные представления эмоций характеризуются меньшим уровнем шума и меньшей склонностью к ошибочной классификации в модальности, предлагаемая модель превосходит базовые модели на наборе данных CH-SIMS, как показано на Рисунке 5.

На Рисунке 5 представлено сравнение точности нескольких методов мультимодального распознавания эмоций на наборах данных CH-SIMS и CMU-MOSEI. По мере перехода моделей от традиционных методов на основе слияния (fusion-based) к более сложным архитектурам на основе графов точность неуклонно растет. Предложенная архитектура достигла максимальной точности 0,82 на наборе данных CH-SIMS, при этом точность увеличивалась с 0,71 для LSTM до 0,74, 0,76 и 0,79 для TFN, LMF и Adaptive-Graph соответственно. На наборе данных CMU-MOSEI точность увеличилась с 0,69 для LSTM до 0,72, 0,74 и 0,77 для TFN, LMF и Adaptive-Graph соответственно. Предложенный подход достиг наивысшей точности 0,80. По сравнению с наиболее сильным базовым решением (Adaptive-Graph), предложенная архитектура повысила точность примерно на 3,8% для CH-SIMS и на 3,9% для CMU-MOSEI. Эти результаты показывают, что предложенный метод обучения распутанным представлениям (disentangled representation learning) и механизм кросс-модального внимания на основе графов успешно снижают количество ложноположительных прогнозов за счет захвата дополняющей эмоциональной информации в текстовой, акустической и визуальной модальностях. Влияние нерелевантной модальности дополнительно нивелируется кросс-модальным вниманием на основе графов. Более высокое разнообразие говорящих и лингвистических выражений в корпусе CMU-MOSEI приводит к небольшому снижению точности для всех моделей.

Полнота выборки

В задачах распознавания эмоций полнота (recall), которая является мерой способности модели правильно классифицировать эмоциональные экземпляры, относящиеся к определенному классу, имеет решающее значение, поскольку отсутствие эмоциональной информации может отрицательно сказаться на качестве взаимодействия. Более высокое значение полноты указывает на то, что модель выявляет меньше ложноотрицательных результатов и больше фактических эмоциональных выражений. Полноту можно рассматривать как меру эффективности извлечения эмоциональной информации из текстовых, аудио- и визуальных модальностей в контексте мультимодального анализа эмоций.

Преимущество предлагаемого метода по сравнению с базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI показано при сравнении полноты (recall) на рисунке 6. По мере эволюции моделей от традиционных методов на основе слияния (fusion-based) к более сложным мультимодальным структурам на базе графов, результаты последовательно демонстрируют рост полноты. Полнота на наборе данных CH-SIMS увеличилась с 0.70 для LSTM до 0.73, 0.75 и 0.78 для TFN, LMF и Adaptive-Graph соответственно; максимальное значение полноты 0.82 было достигнуто с помощью предлагаемой архитектуры. Предложенный подход обеспечил наилучшую полноту 0.80 на наборе данных CMU-MOSEI, где этот показатель вырос с 0.68 для LSTM до 0.71, 0.73 и 0.76 для TFN, LMF и Adaptive-Graph соответственно. Предлагаемая архитектура обеспечила относительное улучшение примерно на 5.1% для CH-SIMS и 5.3% для CMU-MOSEI по сравнению с самым сильным базовым методом (Adaptive-Graph). Эти результаты показывают, что за счет захвата дополнительных эмоциональных признаков в текстовой, акустической и визуальной модальностях, предлагаемое обучение распутанным представлениям (disentangled representation learning) и механизм кросс-модального внимания на основе графов успешно сокращают количество ложноотрицательных прогнозов, тем самым улучшая идентификацию классов эмоций в обоих наборах данных. Поскольку традиционные методы обладают ограниченной способностью моделировать сложные кросс-модальные связи, они, как правило, имеют более низкие значения полноты. За счет более явного моделирования взаимосвязей между модальностями TFN и LMF достигают умеренного прироста. Метод Adaptive-Graph еще больше повысил полноту за счет имитации структурированных отношений между модальностями. Для обоих наборов данных предлагаемый метод достигает наивысшей полноты, что указывает на его более высокую способность обнаруживать эмоциональные случаи в различных сценариях взаимодействия. Улучшение более заметно на крупномасштабном наборе данных CMU-MOSEI, что демонстрирует робастность и обобщающую способность предлагаемой архитектуры.

Средняя абсолютная ошибка (MAE)

Средняя абсолютная ошибка (MAE) используется для оценки эффективности задач по прогнозированию непрерывной интенсивности эмоций, таких как прогнозирование валентности или возбуждения. В отличие от точности (accuracy), MAE лучше отражает близость прогнозируемой интенсивности эмоций к фактическому эмоциональному состоянию. Именно поэтому MAE более подходит для таких наборов данных, как CH-SIMS и CMU-MOSEI, которые имеют непрерывные аффективные метки. Более низкое значение MAE указывает на более высокую точность прогнозирования интенсивности эмоций.

Сравнение MAE между предлагаемой структурой и базовыми подходами на наборах данных CH-SIMS и CMU-MOSEI представлено в Таблице 4. Традиционные методы слияния на основе LSTM, как правило, имеют более высокие значения MAE из-за их ограниченной способности моделировать сложные мультимодальные эмоциональные зависимости. TFN и LMF позволяют снизить MAE за счет моделирования мультимодальных взаимодействий, а подход Adaptive-Graph дополнительно снижает этот показатель путем изучения отношений в графе модальностей. Предлагаемая структура обеспечивает наименьшее значение MAE для обоих наборов данных, что указывает на более точную оценку интенсивности эмоций. Стоит отметить, что улучшение более значимо на наборе данных CMU-MOSEI, где масштабная вариативность данных и условия дикторов делают задачу прогнозирования более сложной.

Матрица ошибок для набора данных CH-SIMS

Согласно матрицам ошибок для набора данных CH-SIMS, базовые методы раннего слияния LSTM и TFN демонстрируют значительную путаницу между классами нейтральных и положительных эмоций. Это говорит о том, что данные методы недостаточно эффективны при распознавании тонких мультимодальных эмоциональных выражений. С другой стороны, предлагаемый метод демонстрирует явное и сильное доминирование по диагонали с очень малым количеством внедиагональных элементов, что повышает разделимость классов. Механизм распутывания признаков эмоций в предлагаемом методе обеспечивает согласованное представление эмоций в разных модальностях, а подход на основе графового слияния улучшает разграничение между близкими классами тональности. На рисунке 7A–E показаны матрицы ошибок для набора данных CH-SIMS при использовании различных базовых методов.

Матрица ошибок для набора данных CMU-MOSEI

Предложенная структура использует модально-инвариантные эмбеддинги эмоций и адаптивные веса внимания для значительного снижения частоты ошибочной классификации, особенно для эмоционально неоднозначных входных данных. Это подтверждает, что предложенная структура эффективно работает в различных крупномасштабных сценариях мультимодального взаимодействия. Из-за объема набора данных, вариативности говорящих и непрерывного характера меток тональности, матрицы ошибок для CMU-MOSEI демонстрируют более высокий общий уровень ошибочной классификации. Базовые методы показывают значительную степень смешения между различными категориями эмоций. На Рисунке 8A–E представлена матрица ошибок для набора данных CMU-MOSEI с применением различных базовых методов.

Время обучения за одну эпоху

Вычислительные компромиссы передовых методов мультимодального слияния подчеркиваются сравнением времени обучения за одну эпоху. Из-за использования трансформерных энкодеров и механизмов графового внимания предлагаемая модель требует немного больше времени на обучение, чем простые подходы к слиянию, однако это увеличение не является критическим. Предложенная архитектура продемонстрировала высокую эффективность на эталонных наборах данных для мультимодального анализа эмоций и показала потенциал для интеграции в интеллектуальные системы взаимодействия человека и машины. Тем не менее, пригодность для развертывания в режиме реального времени в данном исследовании не оценивалась и требует дальнейшего изучения посредством анализа задержки, пропускной способности, памяти и условий развертывания. Примечательно, что повышенная стабильность сходимости, а также превосходные показатели прогностической способности и интерпретируемости оправдывают дополнительные вычислительные затраты. На рисунке 9 представлены результаты времени обучения за эпоху для предлагаемого метода.

Абляционное исследование

Для определения влияния каждого важного элемента предлагаемой структуры, такого как модуль визуального отображения, графовое кросс-модальное слияние и распутанное представление эмоций, было проведено абляционное исследование. Чтобы понять степень этого влияния, каждый элемент удалялся поочередно. Согласно результатам экспериментов, стратегия графового слияния улучшает моделирование кросс-модальных зависимостей, а вклад распутанного представления эмоций является наиболее значимым для стабильности работы. Вспомогательная роль модуля визуального отображения подтверждается незначительным влиянием его удаления на производительность. Результаты абляционного исследования при одинаковых условиях обучения и оценки представлены в Таблице 5. Наибольшее снижение производительности наблюдалось после удаления модуля графового кросс-модального внимания, что привело к снижению точности с 81.72% до 77.88% и F1-меры с 0.823 до 0.776. Это подчеркивает важность моделирования сложных межмодальных взаимодействий. Роль модуля обучения распутанным представлениям в формировании устойчивых специфических для эмоций представлений была подтверждена тем, что его удаление снизило точность на 2.78 процентных пункта, а F1-меру — на 0.032. Основным преимуществом модуля визуального отображения является интерпретируемость, а не точность классификации, о чем свидетельствует несколько меньшее снижение качества прогнозирования при его удалении. Конфигурация Basic Fusion показала наихудшие результаты, что доказывает: для достижения наилучшей производительности многомодального распознавания эмоций требуется совокупное влияние всех предлагаемых модулей.

ДОСТУПНОСТЬ ДАННЫХ:

Наборы данных, использованные в данном исследовании, являются общедоступными эталонными данными. Набор данных CMU-MOSEI предоставлен Multimodal SDK Университета Карнеги-Меллона и описан в работе Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), доступ к нему открыт по адресу https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. Набор данных CH-SIMS описан в работе Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) и общедоступен через ресурсы, предоставленные авторами, включая https://github.com/thuiar/MMSA. Все эксперименты проводились с использованием официальных версий этих наборов данных. Исходные извлеченные данные, обработанные файлы данных, результаты предобработки, разделения на обучающую/валидационную/тестовую выборки, производные представления признаков и детали реализации, подтверждающие выводы данного исследования, общедоступны в репозитории Zenodo по адресу https://doi.org/10.5281/zenodo.21124921.

figure-results-1
Рисунок 1: Схематическая диаграмма предлагаемой структуры визуального отображения мультимодальных признаков эмоций. Концептуальная иллюстрация общей архитектуры, демонстрирующая извлечение мультимодальных признаков, обучение распутанным представлениям, слияние на основе кросс-модального внимания с использованием графов и компоненты визуального отображения для интерпретируемого мультимодального анализа эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Схематичная диаграмма рабочего процесса предлагаемого вычислительного протокола.
Концептуальное представление полного конвейера обработки, включающего этапы сбора набора данных, предварительной обработки, извлечения признаков для каждой модальности, мультимодального слияния, визуализации и прогнозирования эмоций Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-3
Рисунок 3: Сравнение показателей F1-меры на наборе данных CH-SIMS. Средние значения F1-меры, полученные в результате пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений случайных чисел. Планки погрешностей соответствуют ±± одному стандартному отклонению (SD). Более высокие значения F1-меры указывают на лучшую эффективность классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 4: Сравнение показателей F1-score на наборе данных CMU-MOSEI. Средние значения F1-score, полученные в результате пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных случайных значений. Планки погрешностей представляют ±± одно стандартное отклонение (SD), а соответствующие значения mean ±± SD указаны над каждой точкой данных. Более высокие значения F1-score свидетельствуют о лучшей эффективности классификации эмоций. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-5
Рисунок 5: Сравнение точности на наборах данных CH-SIMS и CMU-MOSEI. Средние значения точности, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемого фреймворка в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей представляют собой ±± одно стандартное отклонение (SD), рассчитанное на основе повторных запусков с различными начальными значениями случайных чисел. Предлагаемый фреймворк достигает наивысшей точности на обоих наборах данных, демонстрируя улучшенную дискриминацию классов эмоций за счет эффективного обучения мультимодальным признакам и кросс-модального слияния на основе графов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6: Сравнение полноты (recall) на наборах данных CH-SIMS и CMU-MOSEI. Средние значения полноты, полученные с помощью LSTM, TFN, LMF, Adaptive-Graph и предлагаемой структуры в ходе пяти независимых экспериментальных запусков (n = 5). Планки погрешностей указывают ±± одно стандартное отклонение (SD), рассчитанное по результатам повторных экспериментов. Предлагаемая структура стабильно достигает наивысшей полноты на обоих наборах данных, что свидетельствует о ее превосходной способности улавливать мультимодальную эмоциональную информацию и сокращать количество ложноотрицательных прогнозов. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-7
Рисунок 7: Матрица ошибок для набора данных CH-SIMS с использованием различных базовых методов. Строки соответствуют истинным классам эмоций, а столбцы — предсказанным классам. Значения в ячейках представляют процент образцов, нормализованный относительно каждого истинного класса. Матрица ошибок была вычислена с использованием отдельной тестовой выборки CH-SIMS. Более высокие значения процентов по диагонали указывают на лучшую точность распознавания для соответствующей категории эмоций. Матрицы ошибок для (A) LSTM с ранним слиянием, (B) TFN, (C) LMF, (D) адаптивного графа и (E) предлагаемого метода на наборе данных CH-SIMS. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-8
Рисунок 8: Матрица ошибок для набора данных CMU-MOSEI с использованием различных базовых методов. Строки представляют фактические метки эмоций, а столбцы — предсказанные метки. Значения представлены в виде нормализованных по классам процентов на тестовом наборе CMU-MOSEI. Матрица иллюстрирует как правильно классифицированные образцы (диагональные элементы), так и ошибки классификации между категориями эмоций (внедиагональные элементы). Матрица ошибок на CMU-MOSEI (A) LSTM с ранним слиянием, (B) TFN, (C) LMF, (D) Adaptive Graph и (E) предлагаемый метод на наборе данных CMU-MOSEI. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

figure-results-9
Рисунок 9. Сравнение времени обучения за одну эпоху на эталонных мультимодальных наборах данных эмоций.
Среднее время обучения за одну эпоху, полученное в результате пяти независимых экспериментальных запусков (n = 5) для наборов данных CH-SIMS и CMU-MOSEI при идентичных аппаратных и программных настройках. Планки погрешностей представляют собой ±± одно стандартное отклонение (SD), рассчитанное по результатам повторных экспериментов с использованием различных случайных начальных значений (random seed). Более низкие значения указывают на более высокую вычислительную эффективность, в то время как стабильное время обучения между запусками свидетельствует о лучшей воспроизводимости и согласованности обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Набор данныхМодальностиКоличество образцовЯзыкМетки эмоций/тональности
CH-SIMS34Видео, аудио, текст2,281 видеосегментаКитайскийМультимодальные и унимодальные метки тональности (отрицательная, нейтральная, положительная)
CMU-MOSEI35Видео, аудио, текст~23,453 аннотированных клипаАнглийскийМетки тональности и интенсивности эмоций (непрерывные и категориальные)

Таблица 1: Описание набора данных. Сводка наборов данных, использованных в данном исследовании, модальностей, количества образцов, языка, меток эмоций/тональности для наборов данных CH-SIMS и CMU-MOSEI.

КомпонентСпецификация
Программный фреймворкPython с PyTorch
Экстрактор визуальных признаковVision Transformer (ViT)
Экстрактор аудиопризнаковWav2Vec 2.0
Экстрактор текстовых признаковRoBERTa
Стратегия слиянияГрафовая кросс-модальная сеть внимания
Размерность признаков768 на модальность
Оптимизатор обученияAdam
Скорость обучения1.00E-04
Размер пакета16
ОборудованиеNVIDIA GPU (например, серии RTX)
Наборы данных для оценкиCH-SIMS, CMU-MOSEI
Латентная размерность2.56E+02
Размерность эмбеддинга768
Функция активацииReLU
ОптимизаторAdam
Скорость обучения1.00E-04
Размер пакета32
Эпохи100
Ранняя остановкаВключена
Функция потерьКлассификация + Реконструкция + Согласованность

Таблица 2: Среда моделирования. Экспериментальная установка и детали реализации среды моделирования, такие как спецификации модели, признаки, оптимизатор и используемое оборудование.

МетодТочность CH-SIMS (%)Точность CMU-MOSEI (%)
LSTM (раннее/позднее слияние)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
Предлагаемый метод81.72 ± 0.6179.94 ± 0.69

Таблица 3: Оценка точности предлагаемого метода в сравнении с базовыми методами на наборах данных CH-SIMS и CMU-MOSEI. Результаты представлены как среднее значение ±± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений генератора случайных чисел. Все методы оценивались с использованием идентичных разбиений на обучающую, валидационную и тестовую выборки соответствующих наборов данных для обеспечения объективности сравнения.

МетодCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (раннее/позднее слияние)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
Предлагаемый метод0.298 ± 0.0070.341 ± 0.008

Таблица 4: Результаты средней абсолютной ошибки. Результаты представлены как среднее значение ±± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений случайных чисел. Все методы оценивались с использованием идентичных выборок для обучения, валидации и тестирования соответствующих наборов данных для обеспечения объективности сравнения. Сравнение MAE для непрерывного прогнозирования интенсивности эмоций с использованием предлагаемого фреймворка и базовых подходов на обоих наборах данных.

Вариант моделиТочность (%)F1-мера
Полная модель81.72 ± 0.610.823 ± 0.008
Без распутывания (Disentanglement)78.94 ± 0.740.791 ± 0.010
Без объединения графов (Graph Fusion)77.88 ± 0.810.776 ± 0.011
Без визуального отображения (Visual Mapping)80.11 ± 0.660.807 ± 0.009
Базовое объединение (Basic Fusion)74.91 ± 0.980.742 ± 0.013

Таблица 5: Результаты абляционного исследования с базовыми методами. Результаты представлены как среднее значение ±± стандартное отклонение, полученное в ходе пяти независимых экспериментальных запусков (n = 5) с использованием различных начальных значений генератора случайных чисел. Для обеспечения объективности сравнения все методы оценивались с использованием идентичных обучающих, валидационных и тестовых выборок соответствующих наборов данных. Сравнение производительности различных вариантов модели, демонстрирующее эффективность обучения на основе распутанных представлений, графового слияния и модуля визуального отображения.

Дополнительный файл 1: Алгоритм 1 и Алгоритм 2.Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальные результаты показывают, что на наборах данных CH-SIMS и CMU-MOSEI предложенная структура визуального сопоставления для мультимодальных характеристик эмоций превосходит современные методы распознавания мультимодальных эмоций. По сравнению с моделями раннего и позднего объединения, такими как EF-LSTM и TFN, предложенный метод обеспечивает более высокую точность и значения F1-меры, что демонстрирует его устойчивость при обработке разнообразной эмоциональной информации. Улучшение метода можно объяснить распутанным представлением эмоций, которое подавляет шум, специфичный для конкретной модальности, и обеспечивает согласованность эмоций между визуальной, аудио- и текстовой модальностями36.

В последнее время мультимодальные модели на основе трансформеров, такие как Adaptive Multimodal Transformers37 и MIAR38, демонстрируют впечатляющие результаты в моделировании кросс-модальных зависимостей. Тем не менее, эти модели ориентированы преимущественно на прогнозирование и не имеют механизмов, поддерживающих интерпретируемость на уровне признаков. Напротив, предлагаемая система сочетает в себе кросс-модальное внимание на основе графов с модулем визуального отображения, что позволяет проводить прозрачный анализ взаимодействий между модальностями и эмоциями. Это критически важный аспект, который в настоящее время отсутствует в литературе, где вывод об эмоциональном состоянии рассматривается как процесс «черного ящика».

Предложенная структура продемонстрировала стабильные результаты на эталонных наборах данных CH-SIMS и CMU-MOSEI. Несмотря на то что данная структура может найти применение в интеллектуальном человеко-машинном взаимодействии, мониторинге состояния здоровья, адаптивных средах обучения и других системах, учитывающих эмоциональное состояние, в настоящем исследовании метод оценивался только в контролируемых условиях бенчмаркинга. Внедрение в реальных условиях, оценка пользовательского интерфейса, исследование юзабилити или оценка с участием людей не проводились. Следовательно, практическая эффективность структуры в рабочих средах требует дальнейшего изучения. Будущая работа будет сосредоточена на оценках, ориентированных на развертывание, исследованиях с участием пользователей, анализе задержек, оценке потребления памяти и производительности взаимодействия в режиме реального времени.

Более того, повышение эффективности на различных культурно и лингвистически разнообразных наборах данных подтверждает валидность предложенного фреймворка. В отличие от предыдущих работ, прошедших валидацию на одном наборе данных или в конкретном сценарии взаимодействия, предложенный фреймворк демонстрирует стабильную производительность независимо от языка, говорящего и эмоционального выражения. Таким образом, предложенный фреймворк весьма подходит для практических интеллектуальных систем взаимодействия, требующих точного распознавания эмоций и интерпретируемого принятия решений.

Интерпретируемость предложенной структуры была оценена с помощью анализа изученных мультимодальных представлений на основе визуализации. В частности, для получения представления о процессе принятия решений моделью и вкладе каждой модальности были изучены латентные эмбеддинги эмоций, карты кросс-модального внимания, графы взаимодействия модальностей и временные траектории эмоций. Целью модуля визуального картирования является повышение прозрачности путем обеспечения возможности наблюдения за взаимодействиями на уровне признаков и эмоциональной динамикой. Однако формальные метрики интерпретируемости, оценка достоверности внимания и пользовательские исследования в данную работу не были включены. Следовательно, сообщаемые преимущества интерпретируемости следует рассматривать как доказательства на основе визуализации, а не как количественно подтвержденные показатели объяснимости.

С теоретической точки зрения данное исследование вносит следующий вклад в область мультимодальных аффективных вычислений: в нем предлагается систематический способ моделирования эмоций, который четко разграничивает представления, специфичные для конкретной эмоции, и представления, специфичные для конкретной модальности. Обеспечивая эмоциональную согласованность между модальностями в общем латентном пространстве, предложенная структура развивает теорию обучения представлениям в мультимодальных системах. Внедрение механизмов внимания на основе графов дополнительно формализует зависимости между различными модальностями при выражении эмоций.

С практической точки зрения предлагаемая структура весьма полезна для проектирования интеллектуального взаимодействия и пользовательских интерфейсов, учитывающих эмоциональное состояние. Модуль визуального сопоставления в данной структуре позволяет разработчикам систем понять влияние различных модальностей на прогнозирование эмоций, что имеет большое значение для проектирования систем. Предложенная структура будет очень полезна для таких приложений, как аффективные разговорные агенты, адаптивные системы обучения, интерфейсы мониторинга состояния здоровья и платформы оценки пользовательского опыта.

Тем не менее, предложенная структура имеет ряд ограничений. Использование механизмов внимания в графах и трансформерных энкодеров увеличивает сложность, что может быть проблематичным для устройств с ограниченными возможностями. Кроме того, в текущем исследовании игнорируются другие физиологические сигналы, такие как ЭЭГ и айтрекинг, в пользу сосредоточения внимания на визуальных, аудио- и текстовых модальностях. Вычислительная эффективность предложенной структуры для развертывания в режиме реального времени не оценивалась специально, несмотря на то, что она продемонстрировала конкурентоспособную точность прогнозирования и улучшенные возможности визуализации. В будущих исследованиях будут изучены производительность развертывания в реальных контекстах интеллектуального взаимодействия, задержка вывода, пропускная способность, потребление памяти и методы сжатия моделей. Для дальнейшего повышения точности моделирования эмоций и скорости отклика взаимодействия будущие исследования будут сосредоточены на разработке облегченных моделей, методах оптимизации в режиме реального времени и включении дополнительных модальностей. Производительность развертывания в режиме реального времени не оценивалась, а включение трансформерных энкодеров и методов внимания на основе графов повышает вычислительную сложность. Для валидации методологии использовались только эталонные наборы данных CH-SIMS и CMU-MOSEI, что может привести к смещениям, специфичным для конкретного набора данных, и ограничить обобщаемость на другие области, языки и группы пользователей. Кроме того, текущее исследование не включает физиологические сигналы, такие как данные ЭЭГ или айтрекинга; вместо этого оно концентрируется на визуальных, аудио- и текстовых модальностях. Хотя подробные описания реализации и среды симуляции повысили воспроизводимость, исходный код и предобученные модели в настоящее время не находятся в открытом доступе.

В данной работе используется новая платформа визуального картирования для многомодального обучения признакам эмоций в целях проектирования интеллектуального взаимодействия. Предложенный метод объединяет сквозное обучение представлениям на основе трансформеров, распутанное моделирование эмоций и кросс-модальное внимание на основе графов для достижения высокой точности прогнозирования и интерпретируемости. Эксперименты на наборах данных CH-SIMS и CMU-MOSEI показывают, что предлагаемая платформа превосходит современные многомодальные модели распознавания эмоций по точности и F1-мере. Что более важно, предложенное решение по визуальному картированию устраняет разрыв между распознаванием эмоций и стратегией взаимодействия, открывая новое направление для разработки интерпретируемых многомодальных систем аффективных вычислений, учитывающих особенности взаимодействия.

Для обеспечения интерпретируемого и интеллектуального дизайна взаимодействия в данном исследовании представлена новая платформа визуального картирования для изучения мультимодальных признаков эмоций. Предложенная система успешно объединяет детектирование эмоций и интерпретируемость в рамках единой архитектуры, сочетая извлечение мультимодальных признаков на основе трансформеров, обучение распутанному представлению эмоций, слияние кросс-модального внимания на основе графов и методы визуального картирования. Помимо предоставления четких визуальных представлений вклада каждой модальности, кросс-модальных взаимодействий и временной динамики эмоций, экспериментальная оценка на эталонных наборах данных CH-SIMS и CMU-MOSEI показала улучшение производительности по сравнению с репрезентативными базовыми методами по нескольким метрикам, включая Accuracy, Precision, Recall, F1-score и Mean Absolute Error (MAE). Однако данное исследование ограничено оценкой на двух эталонных наборах данных и не включает исследования по внедрению в реальных условиях, пользователько-ориентированные оценки, количественные анализы объяснимости, а также интеграцию физиологических модальностей. Кроме того, в условиях ограниченных ресурсов могут возникнуть трудности из-за вычислительной сложности трансформерных энкодеров и процессов внимания на основе графов. Несмотря на то, что будущие работы будут сосредоточены на более обширной валидации на различных наборах данных, интеграции дополнительных модальностей, исследованиях удобства использования, выпуске воспроизводимых ресурсов и оптимизации для сценариев развертывания в реальном времени, предлагаемая платформа в целом демонстрирует потенциал интерпретируемого мультимодального анализа эмоций для аффективных вычислений и приложений интеллектуального взаимодействия.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не имеют конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность за поддержку, оказанную Школой жилья, строительства и планирования Университета Sains Malaysia (Пенанг, Малайзия) и Школой дизайна и искусства Чаншаского университета естественных наук & Технологии, Чанша, Китай. Авторы также выражают благодарность Академии искусств и дизайна города Сямынь Университета Фучжоу, Сямынь, Китай, за академическую и исследовательскую поддержку на протяжении всей данной работы.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
АдамБиблиотека оптимизаторов PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Скорость обучения = 1 × 10-4)Оптимизация параметров при обучении модели
CH-SIMSРепозиторий исходного набора данныхПоследний публичный выпускЭталонный набор данных для китайского мультимодального анализа сентимента/эмоций
CMU-MOSEIРепозиторий CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (последний публичный релиз)Эталонный набор данных для мультимодального распознавания настроений и эмоций
Дистиллированный энкодер эмоцийИндивидуальная реализацияАрхитектура с двойным кодировщиком (Dual Encoder Architecture)Разделение специфичных для эмоций и специфичных для модальности латентных представлений
Графовая сеть внимания (GAT)PyTorch GeometricМногоголовый GAT (https://pytorch-geometric.readthedocs.io/en/latest/)Моделирование кросс-модальных эмоциональных связей и адаптивное слияние признаков
Слой кросс-модального внимания на основе графовИндивидуальная реализацияСлияние с механизмом многоголового вниманияИзучение детальных эмоциональных зависимостей между модальностями
MatplotlibПроект Matplotlib3.7+Построение графиков и визуальная аналитика
NetworkXПроект NetworkX3.0+Построение и визуализация графов кросс-модального взаимодействия
GPU NVIDIANVIDIA CorporationGPU с поддержкой CUDAУскорение обучения трансформеров и графовых нейронных сетей
Метод главных компонент (МГК)Scikit-learnsklearn.decomposition.PCAПервичное снижение размерности многомерных эмбеддингов эмоций
PythonPython Software Foundation3.8+Основной язык программирования для реализации среды мультимодального анализа эмоций
PyTorchPyTorch Foundation2.0+Разработка, обучение и оптимизация глубоких нейронных сетей
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, эмбеддинги размерности 768)Извлечение контекстуальных лингвистических и семантических представлений эмоций
SeabornПроект Seaborn0.12+Построение карт внимания и статистическая визуализация
t-распределенное стохастическое вложение соседей (t-SNE)Scikit-learn
scikit-learn.org (перплексия = 30, количество итераций = 1000)
Визуализация латентных кластеров и траекторий эмоций
Ubuntu LinuxCanonical Ubuntu20.04 LTS или более поздняя версияСреда проведения эксперимента
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, эмбеддинги размерности 768Извлечение визуальных представлений из видеокадров с учетом эмоционального состояния
Wav2Vec 2.0Исследовательский центр Meta AIБазовая модель, 768-мерные эмбеддингиИзвлечение контекстных акустических признаков и признаков эмоциональной окраски речи

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи