$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El trabajo propuesto tiene como objetivo mejorar el diseño de interacción inteligente mediante un marco interpretable para la representación visual de características emocionales multimodales. En este trabajo se utilizaron las bases de datos CH-SIMS y CMU-MOSEI, que son de acceso público. Ambos conjuntos de datos fueron obtenidos de sus fuentes oficiales y empleados cumpliendo con las directrices de uso, estándares de investigación y términos de licencia establecidos por sus respectivos creadores. El contenido multimodal de los conjuntos de datos, que incluye texto, audio y datos de video, fue primero recopilado y anotado por los proveedores de los conjuntos de datos, de acuerdo con sus permisos autorizados para participantes y sus protocolos de recolección de datos. En este estudio no hubo interacción humana directa, ni reclutamiento de nuevos participantes, ni recopilación de información identificable personalmente. Todos los análisis se realizaron utilizando conjuntos de datos de investigación de acceso público. Por consiguiente, nuestro análisis secundario de datos no requirió aprobación ética adicional ni revisión por parte de una Junta de Revisión Institucional (IRB, por sus siglas en inglés). El estudio se llevó a cabo cumpliendo con las normas institucionales adecuadas que regulan el uso de conjuntos de datos de acceso público, los procedimientos éticos de investigación y las políticas aplicables de uso de datos.
Se empleó un mecanismo de atención cruzada basado en grafos para aprender caracterizaciones emocionales entre modalidades, utilizando características específicas de la emoción o de la modalidad con el fin de mejorar la comprensión. Se utiliza un componente de mapeo visual multivista para potenciar el diseño interactivo consciente de las emociones en tiempo real, y se estima su eficiencia en el reconocimiento emocional. Los resultados muestran que el método propuesto mejora tanto la interpretabilidad como la eficiencia de las interfaces de usuario inteligentes sensibles a las emociones en entornos reales. Figura 1 muestra el flujo arquitectónico del trabajo propuesto. Figura 1 muestra el flujo completo del marco de mapeo visual sugerido para el aprendizaje de características emocionales multimodales en el contexto de sistemas de interacción inteligentes. El flujo comienza con tres modalidades de entrada sincronizadas, a saber, texto, audio y video, que capturan información emocional complementaria proveniente de las modalidades lingüística, prosódica y de expresión facial, respectivamente. Un codificador transformador específico de modalidad procesa cada modalidad para obtener representaciones de alto nivel de los datos de entrada brutos. Las representaciones se introducen luego en un módulo de aprendizaje de representaciones desacopladas, donde los incrustados específicos de la emoción se separan de las características específicas de la modalidad, asegurando así la coherencia en las emociones aprendidas a través de fuentes de datos heterogéneas. Los incrustados específicos de la emoción de cada modalidad se agrupan entonces mediante una red de atención cruzada entre modalidades basada en grafos, que modela las dependencias emocionales intermodales y asigna pesos dinámicos de importancia a cada modalidad según el contexto de interacción. Finalmente, el marco proporciona tanto salidas de clasificación emocional como información sobre la interacción, lo que facilita la toma de decisiones transparente basada en emociones y el diseño adaptativo de interacciones inteligentes.
Adquisición de datos multimodal
Los conjuntos de datos CH-SIMS y CMU-MOSEI son dos conjuntos de datos multimodales de dominio público existentes que han recopilado información multimodal, como video, audio y texto sincronizados. El conjunto de datos CH-SIMS comprende exámenes multimodales de personas chinas, incluyendo 2.281 segmentos de video, derivados de múltiples segmentos de películas, dramas de televisión y programas de variedades. La adición de audio y texto correspondientes a estos segmentos de video hace que los estudios sobre análisis multimodal de emociones utilizando datos multimodales sean más atractivos y factibles. Sin embargo, uno de los conjuntos de datos multimodales más grandes para el examen de opiniones, sentimientos y emociones es el conjunto de datos CMU-MOSEI, que fue recopilado a partir de más de 23.000 clips de video de frases pronunciadas por más de 1.000 hablantes sobre una variedad de temas. El conjunto de datos se dividió aleatoriamente en subconjuntos de entrenamiento (70 %), validación (15 %) y prueba (15 %), manteniendo la distribución de clases.
Se obtienen transcripciones textuales, señales de audio y cuadros de video, y se alinean mediante marcas de tiempo para coincidir a un nivel temporal finamente detallado. La integración a nivel de cuadro garantiza que los mecanismos propuestos de aprendizaje de representación y fusión basada en grafos puedan modelar y aprovechar conjuntamente el contenido emocional derivado de expresiones visuales, tonos vocales y contenido lingüístico. La extracción eficaz de dinámicas emocionales intermodales se posibilita mediante esta técnica de adquisición multimodal, que es esencial para el diseño de interacciones inteligentes y la creación de mapas visuales comprensibles.
Tabla 1 presenta las estructuras clave de los conjuntos de datos multimodales de emociones utilizados en el método propuesto. Para obtener un rango más amplio de sentimientos relacionados, como palabras habladas, entonaciones vocales y expresiones faciales, CH-SIMS y CMU-MOSEI integran modalidades de video, audio y texto provenientes de estos conjuntos de datos. Además, el número de muestras disponibles en CH-SIMS es limitado, lo que permite un examen minucioso de las interacciones entre modalidades y de la variación emocional en China. Por otro lado, el conjunto de datos CMU-MOSEI es más relevante para evaluar la robustez del aprendizaje de representaciones y de los algoritmos de visualización relacionados tratados en este trabajo, ya que contiene una gran cantidad de datos en diversos idiomas, sujetos y niveles de emoción anotados. Asimismo, en comparación con investigaciones previas, reduce las dificultades asociadas a la selección de información al probar modelos.
Preprocesamiento y sincronización multimodal
Las anotaciones de marca de tiempo de los conjuntos de datos CH-SIMS y CMU-MOSEI se utilizaron para sincronizar las modalidades textual, auditiva y visual, asegurando un aprendizaje coherente de representación multimodal. Cada emisión funcionó como la unidad fundamental de análisis y se vinculó con segmentos de audio y video correspondientes dentro del mismo intervalo temporal. La alineación se realizó a nivel de emisión. La transcripción se dividió en segmentos según las marcas de tiempo de inicio y finalización de cada emisión. Se estableció la correspondencia entre transcripción, audio y video extrayendo los fotogramas de video y las señales de audio que caían dentro del mismo intervalo de tiempo. Mientras que los segmentos de audio se procesaron utilizando Wav2Vec 2.0 para producir representaciones acústicas, los fotogramas visuales del segmento de video se muestrearon a una tasa predeterminada y se codificaron usando el Transformador de Visión (ViT). El codificador RoBERTa se utilizó para crear incrustaciones textuales a partir de las transcripciones de las emisiones. La sincronización temporal se logró alineando todas las características de modalidad con un único límite de emisión, ya que las tres modalidades generaban secuencias de características de longitudes variables. Se utilizó un formato de longitud fija para normalizar secuencias de longitudes variables. Las secuencias más largas se acortaron a la longitud máxima permitida, mientras que las secuencias más cortas se rellenaron con ceros. Durante el entrenamiento, se utilizaron máscaras de atención para separar los elementos rellenados de las posiciones legítimas de características. Las incrustaciones específicas de cada modalidad se proyectaron en un espacio latente común antes de la fusión, con el fin de superar las diferentes longitudes de secuencia entre modalidades. Esto garantizó consistencia dimensional y permitió que el mecanismo de atención basado en grafos facilitara un aprendizaje efectivo de interacción cruzada entre modalidades. Para preservar la calidad de los datos y la integridad de la sincronización, se excluyeron de los estudios las muestras con archivos dañados, anotaciones faltantes o información incompleta de modalidad.
Extracción de características basada en transformadores
Se utiliza un método de aprendizaje profundo para aprender representaciones de características de alto nivel con reconocimiento emocional a partir de información de múltiples modalidades, como visión, audio y texto, de manera integral, tras alinear los datos multimodales y realizar cualquier preprocesamiento necesario. Al emplear un codificador transformador para aprender representaciones de características intrínsecamente discriminativas a partir de datos multimodales crudos, el método propuesto elimina la necesidad de ingeniería de características. Para facilitar la coherencia entre los conjuntos de datos utilizados en el enfoque propuesto, se aprende un incrustado (embedding) de tamaño fijo para cada modalidad. Por ejemplo, se aprenden incrustados de características de 768 dimensiones en cada una de las modalidades individuales, incluyendo imágenes, audio y texto, formando colectivamente un espacio de características unificado utilizado en todo el enfoque, particularmente un enfoque de extracción de características aplicado al conjunto de datos CH-SIMS propuesto y al conjunto de datos CMU-MOSEI para aprender características de alto nivel a partir de datos de diversos tamaños.
Modalidad visual: Transformador de visión para incorporaciones de fotogramas con reconocimiento de emociones
Se utilizó un modelo de Transformador de Visión (ViT-Base) para extraer información visual de los fotogramas de video con el fin de obtener representaciones espaciales relevantes para las emociones. Antes de extraer las características, los fotogramas de cada segmento de video se redimensionaron a (224 × 224) píxeles y se muestrearon a intervalos temporales regulares. Usando un tamaño de parche de 16 × 16 píxeles, la arquitectura ViT-Base produce una serie de tokens visuales que son procesados por 12 capas codificadoras de transformador. Las representaciones por fotograma recuperadas se proyectaron en un espacio de incrustación de 768 dimensiones utilizando un modelo ViT previamente entrenado como base visual. Las incrustaciones por fotograma se agregaron mediante promediado (mean pooling) para crear la representación visual final de cada segmento. Durante el entrenamiento, se aplicaron normalización de imágenes y métodos comunes de aumento de datos, como recorte aleatorio y volteo horizontal, para mejorar la generalización. Luego, se utilizó el marco propuesto de fusión multimodal para combinar estas incrustaciones visuales con representaciones textuales y auditivas.
Para mantener la dinámica temporal en la emoción, se realizará un muestreo uniforme de las muestras de video de los conjuntos de datos CH-SIMS y CMU-MOSEI para la modalidad visual. Los fotogramas de cada video,
, pueden dividirse en N secciones de tamaño fijo, que luego se aplanan y se transfieren inversamente a un espacio de incrustación latente con dimensión
. Se crea una serie mediante la adición de incrustaciones posicionales y un token de agrupamiento aprendible:
(1)
donde
representa la codificación posicional y
es la matriz de incrustación de fragmentos.
Se utilizan capas codificadoras de transformador apiladas, compuestas por redes de alimentación directa y autoatención multi-cabeza, para procesar la secuencia de fragmentos integrados. La transformación en la capa l se describe como:
(2)
(3)
Para obtener el vector de características visuales consciente de emociones, se extrae la salida equivalente al token de clase como vector de características
. Para abordar representaciones visuales de emociones consistentes a pesar de las diferencias en idioma y contenido entre conjuntos de datos, los incrustados a nivel de cuadro de cada segmento de video se combinan para capturar expresiones faciales y la evolución de las emociones.
Modalidad de audio usando Wav2Vec 2.0 para incrustaciones acústicas prosódicas y semánticas Se generaron incrustaciones de habla contextualizadas utilizando un codificador Wav2Vec 2.0 previamente entrenado como base acústica. Se obtuvo un vector de características acústicas de longitud fija para cada frase mediante la agregación de las representaciones ocultas de salida usando promediado. El modelo Wav2Vec 2.0 se utilizó para extraer representaciones acústicas de señales de audio con el fin de capturar características del habla contextuales y relevantes para la emoción. Antes de la extracción de características, las grabaciones de audio se normalizaron y remuestrearon a 16 kHz. Para garantizar la sincronización entre las modalidades textual y visual, cada segmento de audio a nivel de enunciado se aisló utilizando los límites de marca de tiempo proporcionados por las anotaciones del conjunto de datos. El codificador acústico previamente entrenado se ajustó durante el entrenamiento del modelo para mejorar la adaptación específica a la tarea, permitiendo que las representaciones derivadas reflejen con mayor precisión los aspectos emocionales de las señales de habla. Luego se realizó una fusión de atención multimodal basada en grafos y un aprendizaje de representaciones desacopladas utilizando las incrustaciones de audio finales.
En la modalidad de audio, se utiliza Wav2Vec-2.0 para modelar las señales de voz derivadas de la información inicial de voz en los conjuntos de datos CH-SIMS y CMU-MOSEI, extrayendo directamente características de audio relacionadas con la emoción. Existe una codificación de características convolucional para cada señal de voz de entrada
:
(4)
donde Z representa rasgos prosódicos de bajo nivel como melodía, tono y energía. Una red contextual basada en transformadores es útil para las estructuras mencionadas anteriormente, ya que representa dependencias temporales de largo alcance:
(5)
Los datos acústicos prosódicos y semánticos, que son esenciales para expresar emociones, se incluyen en estas representaciones acústicas contextuales. Un vector de audio de longitud específica se crea realizando un procedimiento de agrupación temporal:
(6)
El diseño evita el uso de características acústicas como los MFCC y logra durabilidad utilizando datos de habla en inglés del CMU-MOSEI y datos de habla en chino del CH-SIMS, simplemente extrayendo representaciones de las formas de onda.
Modalidad de texto utilizando RoBERTa para incorporaciones contextuales de emociones
Para la modalidad textual, se aplica el transformador bidireccional profundo RoBERTa a las transcripciones de habla de los dos conjuntos de datos para generar semántica contextual y significado afectivo. Se utilizaron codificadores transformadores basados en RoBERTa para extraer representaciones textuales de los datos de transcripción y capturar información semántica contextual y emocional. Se empleó un modelo RoBERTa preentrenado para el conjunto de datos CMU-MOSEI en inglés, mientras que se utilizó una variante de RoBERTa para chino en el conjunto de datos CH-SIMS en chino, con el fin de tener mejor en cuenta las características lingüísticas específicas del idioma. El preprocesamiento del texto incluyó la tokenización mediante el tokenizador RoBERTa adecuado para cada idioma y la normalización del texto. Para garantizar un procesamiento por lotes consistente, las secuencias de entrada se convirtieron en incrustaciones de tokens y se rellenaron o recortaron hasta una longitud máxima de secuencia predeterminada. De acuerdo con el formato de entrada de RoBERTa, se introdujeron tokens especiales de clasificación y separación. Se obtuvo una incrustación textual de longitud fija mediante la agregación de las representaciones de tokens contextualizadas producidas por el codificador transformador, utilizando la representación final de oración equivalente a [CLS]. Para adaptar las representaciones aprendidas a la tarea de reconocimiento de emociones, los codificadores RoBERTa preentrenados se refinaron mediante entrenamiento multimodal. Luego, se utilizó el marco propuesto de fusión multimodal para combinar las incrustaciones textuales con las características de audio y visuales.
Las incorporaciones de tokens y las codificaciones de posición se pueden combinar para cada entrada tokenizada,
, para crear la representación de entrada en la técnica de transformación profunda bidireccional conocida como
(7)
Esta forma se representa mediante las capas del transformador L, que utiliza la autoatención para descubrir las dependencias contextuales entre palabras:
(8)
La incorporación contextual de la emoción se obtiene utilizando el estado oculto final del token de clasificación:
(9)
La polaridad del sentimiento, las emociones intensas y las implicaciones asociadas son ejemplos de características lingüísticas relacionadas con las emociones que serán representadas por esta incrustación. RoBERTa facilita la modelización independiente del idioma. Esto permite al sistema utilizar el mismo tamaño de incrustación tanto para textos en inglés del conjunto de datos CMU-MOSEI como para textos en chino del conjunto de datos CH-SIMS.
Se extraen tres vectores de características específicas de modalidad con 768 dimensiones, uno para cada modalidad visual fv, de audio fa y textual ft, mediante el paso propuesto de aprendizaje de representación de características profundas. En el diseño de interacción inteligente, estas representaciones aprendidas crean un espacio unificado de características multimodal que sirve como base para la asignación visual a nivel de características, la fusión cruzada de modalidades basada en grafos y el aprendizaje de representaciones desacopladas.
Aprendizaje de representación desentrañada
Después de aprender una representación de características profundas, un procesamiento adicional de los vectores de características multimodales provenientes de las modalidades visual, auditiva y textual puede generar una descripción emocional disociada. Si las incrustaciones de características específicas de cada modalidad —auditiva, visual y textual— utilizadas en el paso anterior se representan mediante fv, fa y ft, respectivamente, de tal manera que
y
, el objetivo de este paso consiste en factorizar todas las características modales en dos representaciones latentes distintas, que incluyen las representaciones emocionales tras considerar la semántica previa de cada una de las diferentes modalidades.
Esto se logra alimentando cada característica de modalidad, fm , en dos redes de proyección paralelas: un codificador de emociones
y un codificador de modalidad
, donde se generan las dos codificaciones.
(10)
Donde
la característica latente asociada con la emoción está representada por
representa una característica latente específica de una modalidad. Esto permite que los incrustados específicos de la emoción se comuniquen con un espacio de manera repetida a través de múltiples entradas, incluyendo audio, visual y texto, al tiempo que mantiene los datos estructurales únicos asociados con cada modalidad.
Una separación eficaz se logra mediante la reconstrucción con restricciones de independencia. La reconstrucción de la característica de la modalidad original viene dada por:
(11)
donde
es una red decodificadora. La pérdida de reconstrucción conserva los siguientes datos:
(12)
Además, la ortogonalidad, o decorrelación, entre la emoción y las representaciones específicas de la modalidad suele limitar el solapamiento de información:
(13)
Al alcanzar estos objetivos, el modelo podría aprender representaciones emocionales que sean confiables, comprensibles y resistentes a la variabilidad de la modalidad. Fusiones posteriores basadas en grafos entre modalidades y características de mapeo visual, especialmente para el diseño de interacciones inteligentes, dependen en gran medida de representaciones emocionales interpretables y estructuradas.
Coincidencia emocional entre modalidades
La incorporación de la coherencia emocional mejora claramente la eficacia de la fusión entre las modalidades. Esto se debe a que las estrategias de fusión no necesitan compensar grandes diferencias entre las dos representaciones, ya que los embeddings emocionales específicos de cada modalidad comparten un espacio latente. La ilustración combinada de las dos emociones se describe a continuación
. La fusión ponderada será más estable cuando las representaciones específicas de la emoción sean coherentes, porque las variaciones entre las señales de distintas modalidades ya no afectarán al resultado.
(14)
Al exigir el alineamiento semántico de la información emocional, este objetivo minimiza las discrepancias entre modalidades y garantiza que la percepción emocional permanezca consistente independientemente de la modalidad utilizada para expresarla. En consecuencia, se crea un espacio de representación coherente y afectivo mediante la proyección de las señales emocionales obtenidas de señales de habla, expresiones faciales y contenido lingüístico.
Impacto en la fusión cruzada de modalidades
La fusión multimodal resulta más efectiva cuando se introduce consistencia emocional entre las modalidades. Los mecanismos de fusión ya no necesitan compensar grandes brechas en las representaciones intermodales, ya que los embeddings específicos de la emoción están alineados en un espacio latente común. La representación emocional fusionada se define de la siguiente manera:
(15)
Donde αm representa el peso de la atención asignado a la modalidad m. La fusión ponderada se vuelve más estable y comprensible cuando las representaciones específicas de la emoción son coherentes, ya que el resultado de la fusión muestra evidencia emocional complementaria en lugar de señales modales contradictorias.
Matemáticamente, reducir la
varianza entre diversos tipos de representaciones específicas de emociones en relación con
es equivalente a:
(16)
donde
representa la expresión emocional media. Una varianza reducida hace que las modalidades de entrada se ponderen según su significado emocional preciso en lugar del ruido de la modalidad, lo que garantiza una mejor convergencia de la red y una evaluación de la atención más precisa.
El objetivo final de aprendizaje de las visualizaciones emocionales desentrelazadas es combinar la fragmentación, la reconstrucción y la uniformidad emocional:
(17)
que dos hiperparámetros, λ1 y λ2, controlan la relación entre la fiabilidad emocional cruzada y la disociación. El modelo propuesto adquiere representaciones emocionales invariantes a la modalidad, interpretables y fusibles para lograr esto, haciendo hincapié en proporcionar una base sólida para la fusión basada en grafos y la representación a nivel de características en el diseño de interfaces inteligentes.
Fusión de atención multimodal basada en grafos
Se utilizó una red de atención multimodal basada en grafos para simular relaciones emocionales finamente detalladas entre modalidades. Para facilitar el flujo de información entre modalidades, se construyó un grafo multimodal completamente conectado, en el que cada incrustación específica de una modalidad (texto, audio y visual) se representó como un nodo del grafo. Las relaciones entre modalidades se emplearon para establecer la matriz de adyacencia del grafo, la cual luego se mejoró mediante un método de atención aprendible. Se creó un espacio latente compartido concatenando y proyectando las salidas de varias cabezas de atención. Una representación unificada de la emoción multimodal se generó entonces al agregar las representaciones de los nodos mediante un agrupamiento ponderado por atención. Este vector fusionado fue entregado a los módulos de predicción y visualización para análisis consciente de la interacción y reconocimiento emocional. El módulo de fusión basado en grafos tenía una dimensión de representación oculta de 256 y dos capas de atención sobre grafos, cada una con ocho cabezas de atención. Para determinar la importancia relativa de las modalidades cercanas, se calcularon y estandarizaron los coeficientes de atención entre nodos conectados utilizando la función softmax. Cada capa de atención sobre grafos fue seguida por normalización por capas, conexiones residuales y una tasa de abandono (dropout) de 0,2 para aumentar la estabilidad durante el entrenamiento y reducir el sobreajuste. Tras concatenar y proyectar las salidas de varias cabezas de atención en un espacio latente común, las representaciones de los nodos se combinaron en una única incrustación multimodal de emoción mediante agrupamiento ponderado por atención. Posteriormente, la representación fusionada se utilizó para mapeo visual multi-vista y predicción emocional.
Se capturaron diversas interacciones multimodales utilizando la atención gráfica multi-cabeza. Se utilizó la función softmax para normalizar los coeficientes de atención entre nodos conectados para cada nodo. Para aumentar la estabilidad del entrenamiento y evitar el sobreajuste, a las capas apiladas de atención gráfica en el módulo de fusión gráfica se les añadieron conexiones residuales, normalización de capa y regularización por abandono aleatorio (dropout).
Consideremos que los términos
representan individualmente las representaciones correspondientes a las emociones particulares recopiladas por las modalidades visual, de audio y de texto; cada componente reside dentro del espacio latente compartido
. Los modelos para los nodos de modalidad utilizan una notación para el grafo
, con los nodos de la colección
correspondiendo a los tres nodos de modalidad mismos, con el fin de reforzar explícitamente las dependencias emocionales compartidas entre las diversas representaciones de modalidad.
Después de asignar un vector de características específico para cada emoción a cada nodo en el grafo, tenemos:
(18)
A diferencia de los métodos tradicionales de fusión, que utilizan pesos de fusión predeterminados o fijos, el método propuesto aprende pesos de borde adaptativos según su importancia y dependencias, tanto entre canales como entre situaciones emocionales.
Se utiliza una red de atención gráfica (GAT) para la fusión multimodal. Se calcula un coeficiente de atención para cada nodo i y sus nodos vecinos, es decir, el nodo j:
(19)
El efecto emocional de cambiar del modo j a la modalidad i se mide mediante los pesos normalizados αij.
A continuación, se calcula la apariencia fusionada de cada nodo de modalidad como un agrupamiento ponderado de sus vecinos:
(20)
donde la función de activación
es no lineal. Finalmente, las características actualizadas de cada nodo se combinan para obtener una representación global fusionada de la emoción:
(21)
Es una técnica útil para la modelización de emociones interpretable y la posterior representación visual, ya que captura información complementaria de diversas modalidades, a la vez que conserva las complejas relaciones entre modalidades.
El Algoritmo 1 (Archivo Suplementario 1) proporciona el esquema general para llevar a cabo la fusión multimodal basada en grafos. Inicialmente, se crea un grafo con las características específicas de cada emoción vinculadas a las modalidades visual, auditiva y textual. Luego, se calculan las puntuaciones de atención para cada par de nodos del grafo, que representan la combinación de dependencia emocional. Estas puntuaciones de atención se normalizan después para indicar la contribución relativa de cada modalidad al contexto emocional especificado, lo que permite el aprendizaje de los pesos de atención. La representación general de la emoción se genera en la última etapa mediante la agregación de las características asociadas a los nodos del grafo. En este sentido, la fusión general del algoritmo de las características multimodales vinculadas a las emociones especificadas muestra potencial en cuanto a adaptabilidad, interpretabilidad e inteligencia contextual.
Figura 2 muestra la estructura y el funcionamiento de la red propuesta de atención cruzada modal para la fusión de sentimientos multimodal. Las representaciones específicas de la emoción, derivadas independientemente para las modalidades textual, auditiva y de video, pasan inicialmente por mecanismos de atención a nivel de modalidad que aprenden la importancia relativa de la información lingüística, vocal y facial en un contexto emocional determinado. Las representaciones ponderadas por la atención de las modalidades se combinan luego para formar una representación unificada de la emoción, en la cual la matriz de atención captura las dependencias intermodales y las intensidades de interacción. La matriz de atención aprendida por la red modula dinámicamente las contribuciones de las modalidades, permitiéndole concentrarse en la modalidad instruccional más fuerte mientras ignora aquellas que son ruidosas o menos informativas. La representación emocional fusionada permite un reconocimiento preciso de las emociones y un análisis detallado de estados emocionales como neutral, abrazo y preocupación.
Módulo de mapeo visual
Con la ayuda de la sección de mapeo visual, creada específicamente para este fin, un diseñador de interacciones inteligente puede convertir la representación unificada del estado emocional en una forma visual comprensible y fácilmente asimilable tras el proceso de fusión multimodal, basándose en el grafo.
Para facilitar la comprensión de las representaciones emocionales latentes, se utilizaron técnicas de reducción de dimensionalidad para visualizar los embeddings multimodales de emociones aprendidos. Después de reducir la dimensionalidad de las características manteniendo la mayor parte de la varianza mediante el Análisis de Componentes Principales (PCA), los embeddings se proyectaron en un espacio bidimensional para su visualización usando el método t-distributed Stochastic Neighbor Embedding (t-SNE). Para t-SNE se utilizó un valor de perplejidad de 30, una tasa de aprendizaje de 200 y 1.000 iteraciones de optimización. Mediante las proyecciones obtenidas, se visualizaron agrupaciones específicas de emociones y las relaciones entre modalidades. Los pesos normalizados de atención cruzada obtenidos por la red de atención basada en grafos se utilizaron para crear mapas de calor de atención. En estos mapas se representan las contribuciones relativas de las modalidades textual, de audio y visual durante la predicción de emociones. Los coeficientes de atención aprendidos se emplearon como pesos de las aristas para construir grafos de interacción cruzada, lo que permitió examinar visualmente las relaciones intermodales y el flujo de información dentro del marco de fusión. Se generaron gráficos de trayectoria emocional mediante el seguimiento del desarrollo de los embeddings latentes de emociones a lo largo de enunciados sucesivos, con el fin de examinar la dinámica emocional temporal. Estas trayectorias aportan información sobre cómo evolucionan los estados emocionales y las contribuciones de las modalidades a lo largo del tiempo. Todos los gráficos se crearon utilizando paquetes de Python como Matplotlib y Scikit-learn. Para evaluar la interpretabilidad, la formación de agrupaciones, las contribuciones modales y la dinámica emocional temporal, se realizaron análisis cualitativos de las visualizaciones de embeddings, los grafos de interacción y los mapas de calor de atención.
Sea la variable
la representación fusionada del estado emocional mediante la función de la red de atención gráfica. A diferencia de la visualización a nivel de salida de las gráficas del estado emocional, el objetivo principal del módulo consiste en convertir las representaciones del estado emocional y los pesos correspondientes del mecanismo de atención en una forma visual comprensible.
Utilizando el valor aprendido de αji, se crea un mapa de calor de atención para examinar visualmente la contribución de cada modalidad. Luego, los pesos de atención entrantes se suman para determinar una puntuación de importancia compuesta para cada modalidad:
(22)
donde si representa la contribución emocional relativa de la modalidad I. Para ayudar a crear un mapa de calor de atención, los valores obtenidos se normalizan y se asignan a un mapa de colores que facilita al usuario identificar la modalidad predominante en diferentes pasos temporales o estados interactivos. A través de diversas modalidades de entrada visual, auditiva o textual, dicha interfaz ayuda al usuario a comprender cómo funciona el mecanismo de atención del sistema.
El grafo aprendido se modela específicamente como un «grafo de interacción ponderado» para representar la dependencia cruzada entre modalidades de las emociones humanas. Cada modalidad se representa mediante un nodo en el grafo, y la intensidad de las interacciones relacionadas con las emociones humanas se representa mediante pesos en forma de αji en las aristas que las conectan. El grafo ponderado anterior ilustra la intensidad de las interacciones emocionales humanas. La definición de i y j es:
(23)
El grosor o la transparencia de las líneas en la visualización del grafo se muestran adecuadamente gracias a estos pesos. Esto facilita la comprensión de cómo interactúan las modalidades. El diseñador puede comprender mejor cómo interactúan los indicadores emocionales durante el proceso de fusión con la ayuda de los gráficos de interacción cruzada.
Las incorporaciones de emociones fusionadas
en diferentes pasos de tiempo se reducen a un espacio de menor dimensionalidad mediante un algoritmo de reducción de dimensionalidad, como PCA o t-SNE, con el fin de mostrar la evolución de las emociones temporales:
(24)
donde la función de proyección está representada por
. La aparición de trayectorias emocionales 2D/3D, que muestran transiciones emocionales, intensidades y estabilidad en las interacciones, puede interpretarse como una representación intuitiva de la evolución de los estados emocionales a lo largo del tiempo. Estos aspectos pueden utilizarse para la interacción inteligente, la toma de decisiones y la monitorización en tiempo real.
A diferencia de los sistemas convencionales de emociones que simplemente proporcionan asignaciones a clases o puntuaciones específicas, este sistema se centra en demostrar cómo se forman las emociones humanas dentro de él. Revela su proceso de toma de decisiones al ofrecer visualizaciones de características intermedias, incluyendo factores de ponderación, interacciones entre modelos y sus trayectorias correspondientes. Esto permite al usuario comprender cómo cada factor—visual, vocal o lingüístico—lo afecta al producir sus respuestas ante la emoción humana.
Asignar emociones a formas comprensibles mediante representaciones visuales puede, por tanto, cerrar la brecha entre el análisis de emociones utilizando métodos de aprendizaje profundo y su integración en el diseño de interfaces inteligentes. Los datos recopilados a partir de ambos enfoques pueden utilizarse entonces para crear interfaces de usuario más precisas. Así, el enfoque propuesto puede proporcionar a los diseñadores de interacción información esencial para desarrollar interfaces de usuario más precisas. Dicho de otro modo, la comprensión de las emociones se convierte en una parte muy activa del diseño de interacción. La precisión solo puede aumentar cuando la comprensión de las emociones se incorpora activamente al diseño de interacción.
El módulo de mapeo visual posibilita la explicabilidad de varias maneras interconectadas pero diferentes: la explicabilidad a nivel de características revela las representaciones subyacentes de la emoción creadas por la red neuronal profunda (DNN), lo que nos permite comprender la semántica utilizada para describir cada característica relacionada con la emoción; la explicabilidad a nivel de modalidad utiliza datos de los gráficos de interacción y los mapas de calor de atención visual para describir cómo cada modalidad —visual, auditiva o textual— contribuye a las decisiones tomadas para expresar emociones; y finalmente, las trayectorias resultantes del incrustado de emociones nos permiten entender cómo cambia cada modalidad visual y textual a lo largo del tiempo desde una perspectiva de interacción dinámica. Consulte el Algoritmo 2 (Supplementary File 1).
Las características emocionales multimodales fusionadas se asignan a representaciones visualmente significativas para el diseño de interacción inteligente mediante el algoritmo de asignación visual propuesto, algoritmo 2. Los pesos de atención multimodal basados en grafos se utilizan para cuantificar las diferencias entre los elementos visuales, auditivos y textuales de entrada en cada paso temporal. Estas diferencias se asignan luego a representaciones visuales para resaltar las principales fuentes que influyen en las emociones, utilizando elementos visuales de mapa de calor. Para ofrecer una visión profunda de la interacción entre los elementos de entrada y transmitir la evolución emocional generada por los elementos de entrada multimodales, se calculan entonces las intensidades de interacción por pares para crear los pesos de interacción multimodal. Al mismo tiempo, se genera una vista de la evolución emocional mediante la proyección de los elementos emocionales fusionados acumulados a lo largo del tiempo en un espacio de baja dimensionalidad, produciendo así una evolución continua del elemento emocional.
Predicción de emociones y retroalimentación de la interacción
El resultado de la representación emocional fusionada, representado como
, se utiliza entonces como función tanto para la retroalimentación de la interacción como para la predicción emocional. Además, la predicción emocional se describe como un modelo multitarea que comprende una tarea de regresión para el reconocimiento de la intensidad emocional continua y una tarea de clasificación para el reconocimiento emocional discreto. El siguiente modelo de clasificación basado en softmax se utiliza para el reconocimiento emocional discreto:
(25)
donde
representa las probabilidades esperadas de las clases de emociones y Wc y bc son restricciones aprendibles. Se utiliza la pérdida de entropía cruzada para mejorar el objetivo de clasificación:
(26)
donde yk es la etiqueta real, y K es el número de clases de emociones. Se utiliza una rama de regresión para estimar la intensidad emocional en paralelo, generando una predicción de diversos atributos afectivos continuos, incluyendo valencia y activación. Asígnale la siguiente definición:
(27)
donde el puntaje esperado de intensidad emocional está indicado por
. Se utiliza la pérdida del error cuadrático medio para mejorar la tarea de regresión:
(28)
En general, las dos tareas se combinan en el objetivo de predicción:
(29)
donde los objetivos de regresión y clasificación están equilibrados por λ. Se propone una modificación dinámica del módulo de visualización basada en el estado emocional identificado para permitir este tipo de retroalimentación sensible a la interacción. El contexto de interacción en un momento dado t está representado por ct. La respuesta del módulo de visualización se proporciona mediante:
(30)
donde la función de adaptación de visualización está representada por
. Esto permite ajustar las mapas de calor de modalidad, los gráficos de interacción y las trayectorias emocionales en tiempo real según los cambios y emociones anticipados. Esto indica que el sistema proporciona un apoyo considerable para la retroalimentación, además de desempeñarse adecuadamente en la predicción del estado emocional.