$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предлагаемая работа направлена на совершенствование дизайна интеллектуального взаимодействия путем разработки интерпретируемой структуры для визуального отображения мультимодальных признаков эмоций. В данной работе использовались общедоступные базы данных CH-SIMS и CMU-MOSEI. Оба набора данных были получены из официальных источников и использовались в соответствии с правилами эксплуатации, стандартами исследований и условиями лицензирования, установленными их соответствующими создателями. Мультимодальное содержимое наборов данных, включая текстовые, аудио- и видеоданные, было первоначально собрано и аннотировано поставщиками данных в соответствии с полученными разрешениями участников и протоколами сбора данных. В данном исследовании не было прямого взаимодействия с людьми, не проводился набор новых участников и не собиралась лично идентифицируемая информация. Весь анализ проводился с использованием общедоступных исследовательских наборов данных. Следовательно, наш вторичный анализ данных не требовал дополнительного этического одобрения или рассмотрения Институциональным наблюдательным советом (IRB). Исследование проводилось в соответствии с соответствующими институциональными нормами, регулирующими использование общедоступных наборов данных, этические процедуры исследований и применимые политики использования данных.
Для изучения характеристик эмоций в разных модальностях с использованием специфических для эмоций или модальностей признаков с целью улучшения понимания был применен механизм кросс-модального внимания на основе графов. Для совершенствования интерактивного дизайна с учетом эмоций в режиме реального времени используется компонент многопроекционного визуального отображения, эффективность которого оценивается для распознавания эмоций. Результаты показывают, что предложенный метод повышает как интерпретируемость, так и эффективность интеллектуальных пользовательских интерфейсов, учитывающих эмоции, в реальных условиях. На рисунке 1 представлена архитектурная схема предлагаемой работы. На рисунке 1 показан полный рабочий процесс предложенного фреймворка визуального отображения для обучения многомодальным признакам эмоций в контексте интеллектуальных систем взаимодействия. Процесс начинается с трех синхронизированных входных модальностей, а именно текста, аудио и видео, которые фиксируют взаимодополняющую эмоциональную информацию из лингвистической, просодической модальностей и модальности мимики соответственно. Специализированный для каждой модальности трансформер-энкодер обрабатывает каждую модальность для получения высокоуровневых представлений необработанных входных данных. Затем эти представления подаются в модуль обучения распутанным представлениям, где эмбеддинги, специфичные для эмоций, отделяются от признаков, специфичных для модальности, чтобы обеспечить согласованность выученных эмоций в различных гетерогенных источниках данных. Эмбеддинги специфических эмоций из каждой модальности затем объединяются сетью кросс-модального внимания на основе графов, которая моделирует межмодальные эмоциональные зависимости и присваивает динамические веса значимости каждой модальности в зависимости от контекста взаимодействия. В конечном итоге фреймворк предоставляет как результаты классификации эмоций, так и аналитические данные о взаимодействии, что способствует прозрачному принятию решений с учетом эмоций и адаптивному проектированию интеллектуального взаимодействия.
Мультимодальный сбор данных
CH-SIMS и CMU-MOSEI представляют собой два существующих общедоступных мультимодальных набора данных, содержащих синхронизированную видео-, аудио- и текстовую информацию. Набор данных CH-SIMS включает результаты мультимодальных исследований китайцев и состоит из 2 281 видеофрагмента, отобранных из различных отрывков фильмов, телевизионных драм и развлекательных шоу. Добавление соответствующих аудиозаписей и текста к этим видеофрагментам делает исследования по мультимодальному анализу эмоций более содержательными и практически реализуемыми. В свою очередь, одним из крупнейших мультимодальных наборов данных для анализа мнений, чувств и эмоций является CMU-MOSEI, который был сформирован из более чем 23 000 видеоклипов с высказываниями более чем 1 000 спикеров на самые разные темы. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с сохранением распределения классов.
Текстовые транскрипции, аудиосигналы и видеокадры собираются и выравниваются по временным меткам для обеспечения точного соответствия на детальном временном уровне. Интеграция на уровне кадров гарантирует, что предлагаемые механизмы обучения представлениям и объединения на основе графов могут совместно моделировать и использовать эмоциональный контент, исходящий из визуальных выражений, вокального тона и лингвистического содержания. Подобный метод мультимодального сбора данных обеспечивает эффективное извлечение межмодальной эмоциональной динамики, что является критически важным для проектирования интеллектуального взаимодействия и понятного визуального картирования.
Таблица 1 представляет основные структуры мультимодальных наборов данных эмоций, используемых в предлагаемом методе. Для получения более широкого спектра связанных чувств, таких как произносимые слова, интонации голоса и мимика, в CH-SIMS и CMU-MOSEI интегрированы видео-, аудио- и текстовые модальности из этих наборов данных. Кроме того, в CH-SIMS доступно ограниченное количество образцов данных, что позволяет провести тщательное исследование взаимодействия модальностей и вариативности эмоций в Китае. С другой стороны, набор данных CMU-MOSEI имеет большее значение для оценки устойчивости обучения представлениям и соответствующих алгоритмов визуализации, рассматриваемых в данной работе, так как он содержит большой объем данных на разных языках, по различным субъектам и с аннотированными уровнями эмоций. Кроме того, по сравнению с предыдущими исследованиями, он снижает трудности при выборе информации во время тестирования моделей.
Мультимодальная предобработка и синхронизация
Временные метки аннотаций из наборов данных CH-SIMS и CMU-MOSEI использовались для синхронизации текстовой, слуховой и визуальной модальностей, что обеспечивало согласованное обучение мультимодальным представлениям. Каждое высказывание служило базовой единицей анализа и было связано с соответствующими сегментами аудио и видео в пределах того же временного интервала. Выравнивание выполнялось на уровне высказываний. Транскрипт был разделен на сегменты на основе меток начала и конца каждого высказывания. Соответствие между транскриптом, аудио и видео устанавливалось путем извлечения соответствующих видеокадров и аудиосигналов, попадающих в один и тот же временной интервал. В то время как аудиосегменты обрабатывались с помощью Wav2Vec 2.0 для получения акустических представлений, визуальные кадры из видеосегмента выбирались с заданной частотой и кодировались с помощью Vision Transformer (ViT). Для создания текстовых эмбеддингов из транскриптов высказываний использовался энкодер RoBERTa. Временная синхронизация была достигнута путем приведения всех признаков модальностей к единой границе высказывания, поскольку три модальности создавали последовательности признаков разной длины. Для нормализации последовательностей различной длины использовался формат фиксированной длины. Более длинные последовательности укорачивались до максимально допустимой длины, а более короткие дополнялись нулями (zero-padding). При обучении использовались маски внимания, чтобы отделить дополняющие элементы от истинных позиций признаков. Перед объединением эмбеддинги конкретных модальностей проецировались в общее латентное пространство, чтобы преодолеть различие в длине последовательностей разных модальностей. Это обеспечило размерную согласованность и позволило графовому механизму внимания эффективно реализовать обучение кросс-модальному взаимодействию. Для сохранения качества данных и целостности синхронизации из исследований были исключены образцы с поврежденными файлами, отсутствующими аннотациями или неполной информацией по модальностям.
Извлечение признаков на основе трансформеров
Для извлечения высокоуровневых признаков, отражающих эмоциональное состояние, используется метод глубокого обучения, который в сквозном режиме (end-to-end) обрабатывает информацию из нескольких модальностей, таких как зрение, звук и текст, после выравнивания мультимодальных данных и проведения необходимой предобработки. Благодаря использованию трансформерного кодировщика для извлечения внутренне дискриминативных представлений признаков из необработанных мультимодальных данных, предлагаемый метод исключает необходимость в ручном конструировании признаков (feature engineering). Для обеспечения согласованности между наборами данных, используемыми в данном подходе, для каждой модальности обучается эмбеддинг фиксированного размера. Например, для каждой из отдельных модальностей, включая изображения, аудио и текст, обучаются 768-мерные эмбеддинги признаков, которые в совокупности формируют единое пространство признаков, используемое во всем подходе; в частности, такой метод извлечения признаков применяется к предлагаемому набору данных CH-SIMS и набору данных CMU-MOSEI для обучения высокоуровневым признакам на данных различного объема.
Визуальная модальность: Vision-трансформер для создания эмбеддингов кадров с учетом эмоционального состояния
Для извлечения визуальной информации из видеокадров с целью получения пространственных представлений, релевантных эмоциям, использовалась модель Vision Transformer (ViT-Base). Перед извлечением признаков кадры каждого видеосегмента масштабировались до (224 × 224) пикселей и сэмплировались через регулярные временные интервалы. При размере патча 16 × 16 пикселей архитектура ViT-Base генерирует серию визуальных токенов, которые обрабатываются 12 слоями кодировщика трансформера. Полученные представления на уровне кадров проецировались в 768-мерное пространство эмбеддингов с использованием предобученной модели ViT в качестве визуального бэкенда. Эмбеддинги на уровне кадров объединялись с помощью усредняющего пулинга (mean pooling) для создания итогового визуального представления каждого сегмента. В процессе обучения для улучшения обобщающей способности применялись нормализация изображений и стандартные методы аугментации, такие как случайная обрезка и горизонтальное отражение. Затем предлагаемая архитектура мультимодального слияния была использована для объединения этих визуальных эмбеддингов с текстовыми и слуховыми представлениями.
Для сохранения временной динамики эмоций для визуальной модальности будет выполнено равномерное сэмплирование видеообразцов из наборов данных CH-SIMS и CMU-MOSEI. Кадры каждого видео,
, могут быть разделены на N секций фиксированного размера, которые затем выравниваются и инверсно переносятся в латентное пространство эмбеддингов с размерностью
. Последовательность создается путем добавления позиционных эмбеддингов и обучаемого группирующего токена:
(1)
где
обозначает позиционное кодирование, а
представляет собой матрицу эмбеддинга патчей.
Для обработки последовательности встроенных патчей используются стеки слоев энкодера трансформера, состоящие из сетей прямого распространения и многоголового механизма самовнимания. Преобразование на слое l описывается следующим образом:
(2)
(3)
Для получения вектора визуальных признаков, учитывающего эмоции, в качестве вектора признаков извлекается выходное значение, эквивалентное токену класса
. Чтобы обеспечить согласованность визуальных представлений эмоций, несмотря на различия в языке и содержании наборов данных, эмбеддинги на уровне кадров из каждого сегмента видео объединяются для фиксации мимики и динамики развития эмоций.
Аудиомодальность с использованием Wav2Vec 2.0 для получения просодических и семантических акустических эмбеддингов Контекстуализированные эмбеддинги речи были получены с помощью предобученного энкодера Wav2Vec 2.0 в качестве акустической основы. Вектор акустических признаков фиксированной длины для каждой фразы был получен путем агрегирования выходных скрытых представлений с помощью усреднения (mean pooling). Модель Wav2Vec 2.0 использовалась для извлечения акустических представлений из аудиосигналов с целью захвата контекстуальных и релевантных эмоциям характеристик речи. Перед извлечением признаков аудиозаписи были нормализованы и передискретизированы до 16 kHz. Для обеспечения синхронизации между текстовой и визуальной модальностями каждый аудиосегмент на уровне высказывания был выделен с использованием временных границ, указанных в аннотациях набора данных. Предобученный акустический энкодер был донастроен в процессе обучения модели для улучшения адаптации к конкретной задаче, что позволило полученным представлениям более точно отражать эмоциональные аспекты речевых сигналов. Затем, с использованием итоговых аудиоэмбеддингов, было выполнено кросс-модальное слияние на основе графового внимания и обучение распутанным представлениям (disentangled representation learning).
Для аудиомодальности используется Wav2Vec-2.0 для моделирования речевых сигналов, полученных из исходной речевой информации в наборах данных CH-SIMS и CMU-MOSEI, что позволяет напрямую извлекать аудиопризнаки, связанные с эмоциями. Для каждого входного речевого сигнала существует сверточное кодирование признаков
:
(4)
где Z обозначает низкоуровневые просодические признаки, такие как мелодика, тон и энергия. Контекстная сеть на базе трансформера полезна для вышеупомянутых структур, так как она представляет долгосрочные временные зависимости:
(5)
Данные просодические и семантические акустические характеристики, имеющие ключевое значение для выражения эмоций, включены в эти контекстуальные акустические представления. Акустический эмбеддинг определенной длины создается путем выполнения процедуры временного пулинга:
(6)
Данная архитектура исключает использование акустических признаков, таких как MFCC, и обеспечивает устойчивость за счет использования данных английской речи из CMU-MOSEI и данных китайской речи из CH-SIMS путем простого извлечения представлений из осциллограмм.
Текстовая модальность с использованием RoBERTa для получения контекстных эмбеддингов эмоций
Для текстовой модальности к транскриптам речи из двух наборов данных применяется глубокий двунаправленный трансформер RoBERTa для генерации контекстуальной семантики и аффективного значения. Для извлечения текстовых представлений из данных транскриптов с целью захвата контекстуальной семантической и эмоциональной информации использовались кодировщики на базе RoBERTa. Для англоязычного набора данных CMU-MOSEI использовалась предобученная модель RoBERTa, в то время как для китайского набора данных CH-SIMS применялся китайский вариант RoBERTa для более точного учета языковых особенностей. Предобработка текста включала токенизацию с использованием соответствующего токенизатора RoBERTa для каждого языка и нормализацию текста. Для обеспечения согласованной пакетной обработки входные последовательности преобразовывались в токен-эмбеддинги и дополнялись или обрезались до заранее определенной максимальной длины последовательности. В соответствии с форматом входных данных RoBERTa были введены специальные токены классификации и разделителя. Текстовый эмбеддинг фиксированной длины был получен путем агрегирования контекстуализированных представлений токенов, созданных кодировщиком трансформера, с использованием финального представления предложения, эквивалентного [CLS]. Чтобы адаптировать изученные представления к задаче распознавания эмоций, предобученные кодировщики RoBERTa были доработаны с помощью мультимодального обучения. Затем предлагаемая структура мультимодального слияния использовалась для объединения текстовых эмбеддингов с аудио- и визуальными характеристиками.
Токенизированные эмбеддинги и позиционные кодирования могут быть объединены для каждого входного токена,
, чтобы создать входное представление в методе глубокого двунаправленного преобразования, известном как
(7)
Эта форма представлена через слои L-трансформера, который использует механизм собственного внимания (self-attention) для выявления контекстных зависимостей между словами:
(8)
Контекстуальный эмбеддинг эмоций получается с использованием конечного скрытого состояния классификационного токена:
(9)
Полярность сентимента, интенсивные эмоции и связанные с ними смысловые оттенки являются примерами лингвистических характеристик, относящихся к эмоциям, которые будут представлены данным эмбеддингом. RoBERTa упрощает языково-независимое моделирование. Это позволяет системе использовать одинаковый размер эмбеддинга как для английских текстов из набора данных CMU-MOSEI, так и для китайских текстов из набора данных CH-SIMS.
Предложенный этап глубокого обучения представлению признаков позволяет извлечь три специфичных для каждой модальности вектора признаков размерностью 768: визуальный fv, аудио fa и текстовый ft . В структуре интеллектуального взаимодействия эти выученные представления формируют единое мультимодальное пространство признаков, которое служит основой для визуального отображения на уровне признаков, кросс-модального слияния на базе графов и обучения распутанным представлениям.
Обучение распутанным представлениям
После получения глубокого представления признаков дополнительная обработка мультимодальных векторов признаков из визуальной, аудиальной и текстовой модальностей может позволить получить разделенное описание эмоций. Если специфические для модальности вложения признаков аудиальной, визуальной и текстовой модальностей, использованные на предыдущем этапе, представлены соответственно как fv, fa и ft, так что
и
, целью данного этапа является факторизация всех признаков модальностей в два различных латентных описания, которые включают описания эмоций с учетом предшествующей семантики каждой из различных модальностей.
Это достигается путем подачи признака каждой модальности fm в две параллельные проекционные сети: кодировщик эмоций
и кодировщик модальности
, в которых формируются два соответствующих кодирования.
(10)
Здесь
латентный признак, связанный с эмоцией, представлен как
, что представляет собой латентный признак, специфичный для конкретной модальности. Это позволяет эмоциоспецифичным эмбеддингам многократно взаимодействовать с общим пространством при обработке различных входных данных, включая аудио-, визуальные и текстовые, сохраняя при этом уникальные структурные данные, характерные для каждой модальности.
Эффективное разделение обеспечивается путем реконструкции с использованием ограничений независимости. Реконструкция признаков исходной модальности выражается следующим образом:
(11)
где
представляет собой сеть-декодер. Потери при реконструкции позволяют сохранить следующие данные:
(12)
Кроме того, ортогональность или декорреляция между эмоциями и специфическими для модальности изображениями часто ограничивают перекрытие информации:
(13)
Достигая этих целей, модель может сформировать представления эмоций, которые будут надежными, понятными и устойчивыми к вариативности модальностей. Последующее кросс-модальное слияние на основе графов и визуальное картирование признаков, особенно для проектирования интеллектуального взаимодействия, в значительной степени опираются на интерпретируемые структурированные представления эмоций.
Согласованность эмоций между модальностями
Добавление согласованности эмоций явно повышает эффективность слияния модальностей. Это объясняется тем, что стратегии слияния больше не нуждаются в компенсации значительных разрывов между двумя представлениями, поскольку специфические для модальностей эмоцональные эмбеддинги разделяют одно и то же латентное пространство. Комбинированная иллюстрация двух эмоций представлена следующим образом
. Взвешенное слияние будет более стабильным при условии согласованности специфических для эмоций представлений, так как вариации между сигналами различных модальностей больше не будут влиять на результат.
(14)
За счет обеспечения семантического выравнивания эмоциональной информации эта цель минимизирует расхождения между модальностями и гарантирует, что восприятие эмоций остается неизменным независимо от модальности, используемой для их выражения. В результате создается целостное аффективное пространство представлений путем проецирования эмоциональных признаков, полученных из речевых сигналов, мимики и лингвистического содержания.
Влияние на кросс-модальное слияние
Кросс-модальное слияние становится более эффективным при обеспечении согласованности эмоций между различными модальностями. Механизмы слияния больше не должны компенсировать значительные разрывы в межмодальных представлениях, поскольку специфичные для эмоций эмбеддинги выровнены в общем латентном пространстве. Слитое представление эмоции определяется следующим образом:
(15)
Где αm представляет собой вес внимания, уделяемого модальности m. Взвешенное слияние становится более стабильным и понятным, когда специфические для эмоций представления согласованы, так как результат слияния демонстрирует дополняющие друг друга эмоциональные признаки, а не противоречивые сигналы модальностей.
С математической точки зрения, снижение
дисперсии между различными типами представлений конкретных эмоций по отношению к
эквивалентно следующему:
(16)
где
представляет собой среднее выражение эмоций. Снижение дисперсии приводит к тому, что входные модальности взвешиваются в соответствии с их точной эмоциональной значимостью, а не шумом модальности, что обеспечивает улучшенную сходимость сети и более точную оценку внимания.
Конечной целью обучения при использовании визуализации распутанных эмоций является объединение фрагментации, реконструкции и однородности эмоций:
(17)
два гиперпараметра, λ1 и λ2, контролируют взаимосвязь между кросс-модальной надежностью эмоций и диссоциацией. Предложенная модель формирует модально-инвариантные, интерпретируемые и объединяемые эмоциональные представления для достижения этой цели, уделяя особое внимание созданию прочного фундамента для последующего объединения на основе графов и представления на уровне признаков при проектировании интеллектуальных интерфейсов.
Графовое кросс-модальное внимание для слияния данных
Для моделирования детальных эмоциональных связей между модальностями была использована кросс-модальная сеть внимания на основе графов. Для облегчения потока информации между модальностями был построен полносвязный мультимодальный граф, в котором каждое модальное эмбеддинг-представление (текстовое, аудио- и визуальное) представлено в виде узла графа. Связи между модальностями использовались для формирования матрицы смежности графа, которая затем была оптимизирована с помощью обучаемого метода внимания. Общее латентное пространство было создано путем конкатенации и проецирования выходных данных нескольких голов внимания. Затем было получено унифицированное мультимодальное представление эмоций путем агрегирования представлений узлов с использованием пулинга с весами внимания. Это объединенное представление затем передавалось в модули прогнозирования и визуализации для анализа с учетом взаимодействия и распознавания эмоций. Модуль графового слияния имел размерность скрытого представления 256 и два слоя графового внимания, каждый из которых содержал восемь голов внимания. Для определения относительной важности соседних модальностей рассчитывались коэффициенты внимания между связанными узлами, которые затем стандартизировались с помощью функции softmax. За каждым слоем графового внимания следовали слой нормализации, остаточные связи и dropout с коэффициентом 0,2 для повышения стабильности обучения и снижения переобучения. После конкатенации и проецирования выходных данных нескольких голов внимания в общее латентное пространство представления узлов объединялись в единый мультимодальный эмбеддинг эмоций с помощью пулинга с весами внимания. После этого объединенное представление использовалось для многопроекционного визуального картирования и прогнозирования эмоций.
Разнообразные кросс-модальные взаимодействия регистрировались с помощью многоголового графового внимания. Для нормализации коэффициентов внимания между связанными узлами для каждого узла использовалась функция softmax. Для повышения стабильности обучения и предотвращения переобучения за стекированными слоями графового внимания модуля слияния графов следовали остаточные связи, послойная нормализация и регуляризация с применением дропаута.
Пусть члены
по отдельности представляют собой представления, соответствующие конкретным эмоциям, полученным из визуальной, аудио- и текстовой модальностей; каждый компонент находится в общем латентном пространстве
. Модели для узлов модальностей используют обозначение для графа
, где узлы множества
соответствуют трем узлам самих модальностей, чтобы явно усилить эмоциональные зависимости, общие для представлений различных модальностей.
После присвоения специфического для данной эмоции вектора признаков каждому узлу графа мы получаем следующее:
(18)
В отличие от традиционных методов слияния, использующих предопределенные или фиксированные веса слияния, предлагаемый метод позволяет определять адаптивные веса ребер на основе их значимости и взаимозависимостей как между каналами, так и между эмоциональными ситуациями.
Для кросс-модального слияния используется графовая сеть внимания (Graph Attention Network, GAT). Коэффициент внимания вычисляется для каждого узла i и его соседних узлов, т. е. узла j:
(19)
Эмоциональный эффект при переключении из режима j в модальность i измеряется с помощью нормированных весов αij.
Затем вычисляется объединенный вид каждого узла модальности как средневзвешенное значение его соседей:
(20)
где функция активации
является нелинейной. В конечном итоге обновленные признаки каждого узла объединяются для получения глобального комбинированного представления эмоций:
(21)
Это полезный метод для интерпретируемого моделирования эмоций и последующего визуального отображения, поскольку он позволяет извлечь дополняющую друг друга информацию из различных модальностей, сохраняя при этом сложные межмодальные связи.
Алгоритм 1 (Дополнительный файл 1) представляет общую схему реализации кросс-модального слияния на основе графов. На начальном этапе создается граф, в котором специфические для эмоций характеристики связаны с каждой из визуальной, аудио- и текстовой модальностей. Затем вычисляются показатели внимания для пар узлов каждого графа, которые представляют комбинацию эмоциональной зависимости. Далее показатели внимания нормализуются для определения относительного вклада каждой модальности в заданный эмоциональный контекст, что позволяет обучить веса внимания. На заключительном этапе формируется общий эмбеддинг эмоции путем агрегирования признаков, связанных с узлами графа. Таким образом, общая процедура слияния мультимодальных признаков, связанных с определенными эмоциями, демонстрирует перспективность с точки зрения адаптивности, интерпретируемости и контекстуального интеллекта.
Рисунок 2 демонстрирует структуру и принцип работы предлагаемой сети кросс-модального внимания для мультимодального объединения признаков сентимент-анализа. Эмбеддинги специфичных для эмоций признаков, полученные независимо для текстовой, слуховой и видеомодальностей, сначала проходят через механизмы внимания на уровне модальностей, которые определяют относительную важность лингвистической, вокальной и мимической информации для данного эмоционального контекста. Затем взвешенные с учетом внимания представления модальностей объединяются для формирования единого эмоционального эмбеддинга, в котором матрица внимания фиксирует межмодальные зависимости и силу взаимодействия. Матрица внимания, обученная сетью, динамически модулирует вклад каждой модальности, что позволяет системе фокусироваться на наиболее информативной модальности, игнорируя зашумленные и менее значимые данные. Объединенное представление эмоций обеспечивает точное распознавание эмоций и детальный анализ таких эмоциональных состояний, как нейтральное, объятия и беспокойство.
Модуль визуального картирования
С помощью раздела визуального картирования, созданного специально для этой цели, дизайнер интеллектуального взаимодействия может преобразовать унифицированное представление эмоционального состояния в визуальную форму, которая является понятной и легко воспринимаемой после процесса кросс-модального слияния, основанного на графе.
Для облегчения понимания латентных эмоциональных представлений для визуализации изученных мультимодальных эмбеддингов эмоций использовались методы снижения размерности. После снижения размерности признаков с сохранением большей части дисперсии с помощью метода главных компонент (PCA), эмбеддинги были спроецированы в двумерное пространство для отображения с использованием стохастического соседства с t-распределением (t-SNE). Для t-SNE использовались значение перплексии 30, скорость обучения 200 и 1 000 итераций оптимизации. С помощью полученных проекций были визуализированы специфические для эмоций кластеры и взаимосвязи между модальностями. Нормализованные веса кросс-модального внимания, полученные с помощью графовой сети внимания, использовались для создания теплокарт внимания. На этих теплокартах отображен относительный вклад текстовой, аудио- и визуальной модальностей при прогнозировании эмоций. Изученные коэффициенты внимания использовались в качестве весов ребер для создания графов кросс-модального взаимодействия, что позволило визуально исследовать межмодальные связи и поток информации внутри структуры слияния. Для изучения временной динамики эмоций были построены графики траекторий эмоций путем мониторинга развития латентных эмбеддингов эмоций в последовательных высказываниях. Эти траектории проясняют, как эмоциональные состояния и вклад модальностей изменяются с течением времени. Для создания всех визуализаций использовались два пакета Python: Matplotlib и Scikit-learn. Для оценки интерпретируемости, формирования кластеров, вклада модальностей и временной динамики эмоций был проведен качественный анализ визуализаций эмбеддингов, графов взаимодействия и теплокарт внимания.
Пусть переменная
представляет собой объединенное представление эмоционального состояния, полученное с помощью функции графовой сети внимания. В отличие от визуализации графиков эмоционального состояния на уровне выходных данных, основной целью данного модуля является преобразование представлений эмоционального состояния и соответствующих весов механизма внимания в понятную визуальную форму.
Используя полученные αji, создается тепловая карта внимания для визуального анализа вклада каждой модальности. Затем веса входящего внимания суммируются для определения совокупного показателя значимости каждой модальности:
(22)
где si представляет собой относительный эмоциональный вклад модальности I. Для создания тепловой карты внимания полученные значения нормализуются и сопоставляются с цветовой картой, которая позволяет пользователю легко определить доминирующую модальность на различных временных этапах или в различных интерактивных состояниях. Благодаря различным визуальным, слуховым или текстовым модальностям ввода такой интерфейс помогает пользователю понять, как работает механизм внимания системы.
Обученный граф специально смоделирован как «взвешенный граф взаимодействий» для представления кросс-модальной зависимости человеческих эмоций. Сама модальность представлена каждым узлом в графе, а сила взаимодействий, связанных с человеческими эмоциями, представлена весами в виде αji на ребрах, которые их соединяют. Приведенный выше взвешенный граф иллюстрирует интенсивность эмоциональных взаимодействий человека. Определения i и j следующие:
(23)
Благодаря этим весам толщина линий или прозрачность визуализации графа отображаются надлежащим образом. Это облегчает понимание того, как взаимодействуют модальности. С помощью графов кросс-модального взаимодействия дизайнер может лучше понять, как взаимодействуют эмоциональные индикаторы в процессе слияния.
Объединенные эмбеддинги эмоций
на различных временных этапах переводятся в пространство меньшей размерности с помощью алгоритма снижения размерности, такого как PCA или t-SNE, для визуализации эволюции временных эмоций:
(24)
где функция проекции представлена выражением
. Появление 2D/3D траекторий эмоций, отражающих переходы, интенсивность и стабильность эмоций в ходе взаимодействий, может быть интерпретировано как интуитивное описание эволюции эмоциональных состояний во времени. Эти аспекты могут быть использованы для интеллектуального взаимодействия, принятия решений и мониторинга в режиме реального времени.
В отличие от традиционных систем распознавания эмоций, которые лишь сопоставляют данные с определенными классами или баллами, данная система ориентирована на демонстрацию механизмов формирования человеческих эмоций внутри нее. Она раскрывает процесс принятия решений, предлагая визуализацию промежуточных признаков, включая весовые коэффициенты, взаимодействие между моделями и соответствующие им пути. Это позволяет пользователю понять, как каждый фактор — визуальный, вокальный или лингвистический — влияет на формирование ответов системы на человеческие эмоции.
Таким образом, сопоставление эмоций с понятными формами посредством визуальных представлений может восполнить пробел между анализом эмоций с использованием методов глубокого обучения и их интеграцией в проектирование интеллектуальных интерфейсов. Данные, собранные обоими подходами, затем могут быть использованы для создания более точных пользовательских интерфейсов. Следовательно, предлагаемый подход может предоставить дизайнерам взаимодействия важную информацию для разработки более точных пользовательских интерфейсов. Иными словами, понимание эмоций становится активной частью проектирования взаимодействия. Точность может повыситься только в том случае, если понимание эмоций будет активно интегрировано в процесс проектирования взаимодействия.
Модуль визуального картирования обеспечивает интерпретируемость несколькими взаимосвязанными, но различными способами: интерпретируемость на уровне признаков раскрывает лежащие в основе представления эмоций, созданные DNN, что позволяет нам понять семантику, используемую для описания каждого признака, связанного с эмоциями; интерпретируемость на уровне модальностей использует данные из графов взаимодействия и тепловых карт визуального внимания для описания того, какой вклад каждая модальность — визуальная, аудио- или текстовая — вносит в решения по выражению эмоций; и, наконец, траектории, полученные в результате вложения эмоций, позволяют нам понять, как каждая визуальная и текстовая модальность изменяется с течением времени с точки зрения динамического взаимодействия. Пожалуйста, обратитесь к Алгоритму 2 (Дополнительный файл 1).
Объединенные мультимодальные эмоциональные признаки отображаются в визуально значимые представления для проектирования интеллектуального взаимодействия с использованием предложенного алгоритма визуального отображения Algorithm 2. Веса мультимодального внимания на основе графов используются для количественной оценки различий между входными визуальными, аудио- и текстовыми элементами на каждом временном шаге. Затем эти различия отображаются в виде визуальных представлений с использованием элементов тепловых карт, чтобы выделить основные источники, влияющие на эмоции. Для обеспечения детального анализа взаимодействия между входными элементами и передачи эмоциональной динамики, вызванной мультимодальными входными данными, вычисляется сила попарного взаимодействия для создания весов мультимодального взаимодействия. Одновременно с этим создается представление эмоциональной динамики путем отображения объединенных эмоциональных элементов, собранных за определенное время, в низкомерное пространство для получения непрерывной эволюции эмоциональных элементов.
Прогнозирование эмоций и обратная связь при взаимодействии
Результат объединенного представления эмоций, выраженный формулой
, затем используется в качестве функции как для обратной связи при взаимодействии, так и для прогнозирования эмоций. Кроме того, прогнозирование эмоций описывается как многозадачная модель, включающая задачу регрессии для распознавания непрерывной интенсивности эмоций и задачу классификации для распознавания дискретных эмоций. Для распознавания дискретных эмоций используется следующая модель классификации на основе функции softmax:
(25)
где
представляет вероятности ожидаемого класса эмоций, а Wc и bc являются обучаемыми ограничениями. Для улучшения цели классификации используется перекрестная энтропия:
(26)
где yk — истинная метка, а K — количество классов эмоций. Параллельно используется регрессионная ветвь для оценки интенсивности эмоций, которая выдает прогноз различных непрерывных аффективных атрибутов, включая валентность и уровень возбуждения. Дайте ей следующее определение:
(27)
где ожидаемый показатель интенсивности эмоций обозначается как
. Для оптимизации задачи регрессии используется функция потерь в виде среднеквадратичной ошибки:
(28)
В целом, эти две задачи объединяются в целевой функции прогнозирования:
(29)
где цели регрессии и классификации сбалансированы с помощью λ. Это предполагает динамическое изменение модуля визуализации на основе определенного эмоционального состояния для обеспечения такого типа обратной связи с учетом взаимодействия. Контекст взаимодействия в данный момент времени t представлен ct. Ответ модуля визуализации определяется следующим образом:
(30)
где функция адаптации визуализации представлена формулой
. Это позволяет в режиме реального времени корректировать тепловые карты модальностей, графы взаимодействий и траектории эмоций на основе ожидаемых изменений и эмоциональных состояний. Таким образом, система не только демонстрирует высокую точность прогнозирования эмоционального состояния, но и обеспечивает существенную поддержку обратной связи.