$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il lavoro proposto mira a migliorare la progettazione dell'interazione intelligente offrendo un framework interpretabile per la mappatura visiva delle caratteristiche emotive multimodali. I database CH-SIMS e CMU-MOSEI, accessibili al pubblico, sono stati utilizzati in questo lavoro. Entrambi i dataset sono stati ottenuti dalle loro fonti ufficiali e utilizzati nel rispetto delle linee guida d'uso, degli standard di ricerca e delle condizioni di licenza stabilite dai rispettivi creatori. Il contenuto multimodale dei dataset, comprensivo di dati testuali, audio e video, è stato inizialmente raccolto e annotato dai fornitori dei dataset conformemente alle autorizzazioni ottenute dai partecipanti e ai protocolli di raccolta dati. Nello studio non è avvenuta alcuna interazione diretta con soggetti umani, non è stato effettuato il reclutamento di nuovi partecipanti e non sono state raccolte informazioni identificabili personalmente. Tutte le analisi sono state condotte utilizzando dataset di ricerca pubblicamente disponibili. Di conseguenza, la nostra analisi secondaria dei dati non ha richiesto ulteriori approvazioni etiche né revisione da parte di un comitato etico istituzionale (IRB). Lo studio è stato condotto nel rispetto delle norme istituzionali appropriate che regolano l'uso di dataset pubblicamente disponibili, le procedure di ricerca etica e le politiche applicabili sull'utilizzo dei dati.
È stato impiegato un meccanismo di attenzione cross-modale basato su grafi per apprendere caratterizzazioni emotive attraverso diverse modalità, utilizzando caratteristiche specifiche per l'emozione o per la modalità al fine di migliorare la comprensione. Un componente di mappatura visiva multivista viene utilizzato per potenziare la progettazione interattiva in tempo reale sensibile alle emozioni, e la sua efficienza è stimata per il riconoscimento delle emozioni. I risultati mostrano che il metodo proposto migliora sia l'interpretabilità che l'efficienza delle interfacce utente intelligenti sensibili alle emozioni nel mondo reale. Figura 1 mostra il flusso architetturale del lavoro proposto. Figura 1 illustra l'intero flusso di lavoro del framework di mappatura visiva suggerito per l'apprendimento delle caratteristiche emotive multimodali nel contesto dei sistemi di interazione intelligente. Il flusso inizia con tre modalità di ingresso sincronizzate, ovvero testo, audio e video, che acquisiscono informazioni emotive complementari rispettivamente dalle modalità linguistica, prosodica ed espressione facciale. Un codificatore transformer specifico per ciascuna modalità elabora ogni modalità per ottenere rappresentazioni di alto livello dei dati grezzi in ingresso. Le rappresentazioni vengono quindi inviate a un modulo di apprendimento delle rappresentazioni disinnescate, in cui gli embedding specifici per l'emozione vengono separati dalle caratteristiche specifiche della modalità, garantendo coerenza nelle emozioni apprese attraverso fonti di dati eterogenee. Gli embedding specifici per l'emozione di ciascuna modalità vengono quindi aggregati da una rete di attenzione cross-modale basata su grafi, che modella le dipendenze emotive inter-modalità e assegna pesi dinamici di importanza a ciascuna modalità in base al contesto d'interazione. Infine, il framework fornisce sia output di classificazione emotiva sia informazioni sull'interazione, facilitando decisioni trasparenti sensibili alle emozioni e una progettazione adattiva dell'interazione intelligente.
Acquisizione di dati multimodali
I dataset CH-SIMS e CMU-MOSEI sono due dataset multimodali esistenti di pubblico dominio che hanno raccolto informazioni multimodali, come video, audio e testo sincronizzati. Il dataset CH-SIMS comprende esami multimodali di persone di lingua cinese, inclusi 2.281 segmenti video, derivati da diversi segmenti provenienti da film, serie televisive e programmi di varietà. L'aggiunta di audio e testo corrispondenti a questi segmenti video rende più interessante e fattibile lo studio dell'analisi multimodale delle emozioni mediante dati multimodali. Tuttavia, uno dei più ampi dataset multimodali per l'esame di opinioni, sentimenti ed emozioni è il dataset CMU-MOSEI, raccolto da oltre 23.000 clip video di frasi pronunciate da più di 1.000 oratori su una varietà di argomenti. Il dataset è stato suddiviso casualmente in sottoinsiemi di training (70%), validazione (15%) e test (15%), preservando la distribuzione delle classi.
Trascrizioni testuali, segnali audio e fotogrammi video vengono acquisiti e allineati temporalmente in modo da corrispondere a un livello temporale fine. L'integrazione a livello di fotogramma garantisce che i meccanismi proposti di apprendimento della rappresentazione e di fusione basata su grafi possano modellare e sfruttare congiuntamente il contenuto emotivo derivante da espressioni visive, toni vocali e contenuti linguistici. L'estrazione efficace delle dinamiche emotive intermodali è resa possibile da questa tecnica di acquisizione multimodale, fondamentale per la progettazione di interazioni intelligenti e per una mappatura visiva comprensibile.
Tabella 1 presenta le strutture principali dei dataset multimodali sulle emozioni utilizzati nel metodo proposto. Per ottenere un ampio spettro di sentimenti correlati, come parole parlate, intonazioni della voce ed espressioni facciali, CH-SIMS e CMU-MOSEI integrano modalità video, audio e testo provenienti da questi dataset. Inoltre, il numero limitato di campioni disponibili in CH-SIMS permette un'analisi approfondita delle interazioni tra modalità e delle variazioni emotive in ambito cinese. D'altro canto, il dataset CMU-MOSEI risulta più importante per valutare la robustezza degli algoritmi di apprendimento delle rappresentazioni e delle tecniche di visualizzazione trattati in questo studio, poiché comprende una grande quantità di dati in diverse lingue, soggetti e livelli emotivi annotati. In aggiunta, rispetto alle ricerche precedenti, riduce le difficoltà nella selezione delle informazioni durante i test dei modelli.
Preelaborazione e sincronizzazione multimodali
Le annotazioni temporali dei dataset CH-SIMS e CMU-MOSEI sono state utilizzate per sincronizzare le modalità testuale, uditiva e visiva, garantendo un apprendimento coerente della rappresentazione multimodale. Ogni enunciato fungeva da unità fondamentale di analisi ed era associato a segmenti audio e video corrispondenti nello stesso intervallo temporale. L'allineamento è stato eseguito a livello di enunciato. La trascrizione è stata suddivisa in segmenti in base ai timestamp di inizio e fine di ciascun enunciato. La corrispondenza tra trascrizione, audio e video è stata stabilita estraendo i fotogrammi video e i segnali audio corrispondenti che rientravano nello stesso intervallo temporale. Mentre i segmenti audio sono stati elaborati utilizzando Wav2Vec 2.0 per produrre rappresentazioni acustiche, i fotogrammi visivi del segmento video sono stati campionati a una frequenza predeterminata e codificati utilizzando il Vision Transformer (ViT). L'encoder RoBERTa è stato utilizzato per creare embedding testuali a partire dalle trascrizioni degli enunciati. La sincronizzazione temporale è stata ottenuta allineando tutte le caratteristiche delle modalità a un singolo confine dell'enunciato, poiché le tre modalità producevano sequenze di caratteristiche di lunghezza variabile. È stato utilizzato un formato a lunghezza fissa per normalizzare le sequenze di lunghezza variabile. Le sequenze più lunghe sono state accorciate alla lunghezza massima consentita, mentre le sequenze più brevi sono state completate con zeri. Durante l'addestramento, sono state utilizzate maschere di attenzione per separare gli elementi aggiunti per il padding dalle posizioni legittime delle caratteristiche. Gli embedding specifici per ciascuna modalità sono stati proiettati in uno spazio latente comune prima della fusione, al fine di superare le diverse lunghezze delle sequenze tra le modalità. Ciò ha garantito coerenza dimensionale e ha permesso al meccanismo di attenzione basato su grafi di facilitare un efficace apprendimento dell'interazione cross-modale. Per preservare la qualità dei dati e l'integrità della sincronizzazione, sono stati esclusi dagli studi i campioni con file corrotti, annotazioni mancanti o informazioni incomplete sulle modalità.
Estrazione di caratteristiche basata su Transformer
Un metodo di apprendimento profondo viene utilizzato per apprendere rappresentazioni di caratteristiche di alto livello consapevoli delle emozioni a partire da informazioni provenienti da più modalità, come visione, audio e testo, in modo end-to-end, dopo l'allineamento dei dati multimodali e ogni preelaborazione necessaria. Utilizzando un codificatore transformer per apprendere rappresentazioni di caratteristiche intrinsecamente discriminative a partire da dati multimodali grezzi, il metodo proposto elimina la necessità di ingegnerizzazione delle caratteristiche. Per favorire la coerenza tra i diversi dataset utilizzati nell'approccio proposto, viene appresa un'incorporazione (embedding) di dimensione fissa per ciascuna modalità. Ad esempio, vengono appresi embedding di caratteristiche di 768 dimensioni per ciascuna delle singole modalità, inclusa l'immagine, l'audio e il testo, formando collettivamente uno spazio unificato di caratteristiche utilizzato in tutto l'approccio, in particolare un approccio di estrazione di caratteristiche applicato al dataset CH-SIMS proposto e al dataset CMU-MOSEI per apprendere caratteristiche di alto livello da dati di dimensioni diverse.
Modalità visiva: Vision transformer per incorporamenti di frame consapevoli delle emozioni
È stato utilizzato un modello Vision Transformer (ViT-Base) per estrarre informazioni visive dai fotogrammi video al fine di ottenere rappresentazioni spaziali rilevanti per le emozioni. Prima dell'estrazione delle caratteristiche, i fotogrammi di ciascun segmento video sono stati ridimensionati a (224 × 224) pixel e campionati a intervalli temporali regolari. Utilizzando una dimensione di patch di 16 × 16 pixel, l'architettura ViT-Base produce una serie di token visivi elaborati da 12 livelli encoder del transformer. Le rappresentazioni a livello di fotogramma ottenute sono state proiettate in uno spazio di embedding a 768 dimensioni mediante un modello ViT preaddestrato utilizzato come backbone visivo. Gli embedding a livello di fotogramma sono stati aggregati mediante media pooling per creare la rappresentazione visiva finale di ciascun segmento. Durante l'addestramento, sono state applicate normalizzazione delle immagini e comuni tecniche di aumento, come il ritaglio casuale e il ribaltamento orizzontale, per migliorare la capacità di generalizzazione. Successivamente, è stato utilizzato il framework proposto di fusione multimodale per combinare questi embedding visivi con rappresentazioni testuali e uditive.
Per mantenere le dinamiche temporali nell'emozione, i campioni video dai dataset CH-SIMS e CMU-MOSEI verranno sottoposti a campionamento uniforme per la modalità visiva. I fotogrammi di ciascun video,
, possono essere suddivisi in N sezioni di dimensioni fisse, che vengono quindi appiattite e trasformate inversamente in uno spazio di embedding latente di dimensione
. Viene creata una serie aggiungendo embedding posizionali e un token di raggruppamento apprendibile:
(1)
dove
rappresenta la codifica posizionale e
è la matrice di embedding del patch.
Vengono utilizzati strati di encoder transformer sovrapposti, composti da reti feed-forward e da auto-attribuzione multi-testa, per elaborare la sequenza di patch incorporata. La trasformazione allo strato l è descritta come:
(2)
(3)
Per ottenere il vettore di caratteristiche visive consapevole delle emozioni, si estrae l'output equivalente al token di classe come vettore di caratteristiche
. Per affrontare rappresentazioni visive delle emozioni coerenti nonostante le differenze linguistiche e di contenuto tra i diversi dataset, gli embedding a livello di fotogramma di ciascun segmento video vengono combinati per catturare le espressioni facciali e l'evoluzione delle emozioni.
Modalità audio utilizzando Wav2Vec 2.0 per l'embeddings prosodico e semantico acustico Gli embeddings vocali contestualizzati sono stati prodotti utilizzando un codificatore Wav2Vec 2.0 preaddestrato come base acustica. Un vettore di caratteristiche acustiche di lunghezza fissa per ogni frase è stato ottenuto aggregando le rappresentazioni nascoste in uscita mediante media pooling. Il modello Wav2Vec 2.0 è stato utilizzato per estrarre rappresentazioni acustiche dai segnali audio al fine di catturare caratteristiche vocali contestuali e rilevanti per le emozioni. Prima dell'estrazione delle caratteristiche, le registrazioni audio sono state normalizzate e ricampionate a 16 kHz. Per garantire la sincronizzazione tra le modalità testuale e visiva, ogni segmento audio a livello di enunciato è stato isolato utilizzando i limiti temporali forniti dalle annotazioni del dataset. Il codificatore acustico preaddestrato è stato aggiornato durante l'addestramento del modello per migliorare l'adattamento specifico al compito, consentendo alle rappresentazioni ottenute di rappresentare in modo più accurato gli aspetti emotivi dei segnali vocali. Successivamente, sono state eseguite la fusione dell'attenzione multimodale basata su grafi e l'apprendimento di rappresentazioni disincagliate utilizzando gli embeddings audio finali.
Nella modalità audio, Wav2Vec-2.0 viene utilizzato per modellare i segnali vocali derivati dalle informazioni vocali iniziali nei dataset CH-SIMS e CMU-MOSEI, estraendo direttamente caratteristiche audio relative all'emozione. È presente una codifica convoluzionale delle caratteristiche per ogni segnale vocale in ingresso
:
(4)
dove Z indica tratti prosodici di basso livello come melodia, tono ed energia. Una rete contestuale basata su transformer è utile per le strutture sopra menzionate, in quanto rappresenta dipendenze temporali a lungo raggio:
(5)
I dati acustici prosodici e semantici, essenziali per esprimere le emozioni, sono inclusi in queste rappresentazioni acustiche contestuali. Un'incorporazione audio di lunghezza specifica viene creata eseguendo una procedura di pooling temporale:
(6)
Il design evita l'uso di caratteristiche acustiche come gli MFCC e raggiunge robustezza estraendo semplicemente rappresentazioni dalle forme d'onda, utilizzando dati vocali inglesi da CMU-MOSEI e dati vocali cinesi da CH-SIMS.
Modalità testuale utilizzando RoBERTa per incorporamenti contestuali delle emozioni
Per la modalità testuale, il trasformatore bidirezionale profondo RoBERTa viene applicato alle trascrizioni vocali dei due set di dati per generare semantica contestuale e significato affettivo. Gli encoder trasformatori basati su RoBERTa sono stati utilizzati per estrarre rappresentazioni testuali dai dati delle trascrizioni al fine di catturare informazioni semantiche contestuali ed emozionali. È stato utilizzato un modello RoBERTa preaddestrato per il dataset CMU-MOSEI in lingua inglese, mentre per il dataset cinese CH-SIMS è stata impiegata una variante cinese di RoBERTa, per tenere meglio conto delle caratteristiche linguistiche specifiche della lingua. La pre-elaborazione del testo ha incluso la tokenizzazione mediante il tokenizer RoBERTa appropriato per ciascuna lingua e la normalizzazione del testo. Per garantire un'elaborazione coerente per batch, le sequenze di input sono state convertite in embedding di token e successivamente riempite o tagliate fino a una lunghezza massima predeterminata. In conformità con il formato di input di RoBERTa, sono stati introdotti token speciali di classificazione e di separazione. Un embedding testuale di lunghezza fissa è stato ottenuto aggregando le rappresentazioni contestualizzate dei token prodotte dall'encoder trasformatore, utilizzando la rappresentazione finale della frase equivalente al [CLS]. Per adattare le rappresentazioni apprese al compito di riconoscimento delle emozioni, gli encoder RoBERTa preaddestrati sono stati affinati attraverso un addestramento multimodale. Successivamente, il framework proposto di fusione multimodale è stato utilizzato per unire gli embedding testuali con le caratteristiche audio e visive.
Gli embedding dei token e le codifiche posizionali possono essere combinati per ogni input tokenizzato,
, per creare la rappresentazione dell'input nella tecnica di trasformazione profonda bidirezionale nota come
(7)
Questa forma è rappresentata attraverso i livelli del trasformatore L, che utilizza l'auto-attenzione per scoprire le dipendenze contestuali tra le parole:
(8)
L'incorporamento contestuale dell'emozione si ottiene utilizzando lo stato nascosto finale del token di classificazione:
(9)
Polarità del sentiment, emozioni intense e implicazioni associate sono esempi di caratteristiche linguistiche legate alle emozioni che verranno rappresentate da questo embedding. RoBERTa semplifica la modellazione indipendente dal linguaggio. Ciò consente al sistema di utilizzare la stessa dimensione dell'embedding sia per i testi in inglese del dataset CMU-MOSEI che per i testi in cinese del dataset CH-SIMS.
Tre vettori di caratteristiche specifici per modalità, ciascuno di 768 dimensioni, relativi alle modalità visiva fv, audio fa e testuale ft, vengono estratti tramite il passaggio proposto di apprendimento della rappresentazione delle caratteristiche profonde. Nella progettazione dell'interazione intelligente, queste rappresentazioni apprese creano uno spazio unificato di caratteristiche multimodali che costituisce la base per il mapping visivo a livello di caratteristiche, la fusione incrociata multimodale basata su grafi e l'apprendimento di rappresentazioni disaccoppiate.
Apprendimento della rappresentazione disaccoppiata
Dopo aver appreso una rappresentazione di caratteristiche profonde, un'ulteriore elaborazione dei vettori di caratteristiche multimodali provenienti dalle modalità visiva, uditiva e testuale può produrre una descrizione emotiva disgiunta. Se gli embedding di caratteristiche specifici per modalità delle modalità uditiva, visiva e testuale utilizzati nel passaggio precedente sono rappresentati da fv, fa e ft, rispettivamente, in modo tale che
e
, l'obiettivo di questo passaggio è fattorizzare tutte le caratteristiche modali in due rappresentazioni latenti distinte, che includono le rappresentazioni emotive tenendo conto della semantica precedente di ciascuna delle diverse modalità.
Ciò viene ottenuto fornendo a ciascuna caratteristica modale, fm , due reti di proiezione parallele: un codificatore emotivo
e un codificatore modale
, dove vengono prodotte le due codifiche.
(10)
Dove
la caratteristica latente associata all'emozione è rappresentata da
rappresenta una caratteristica latente specifica di una modalità. Ciò consente agli embedding specifici per l'emozione di comunicare ripetutamente con uno spazio comune attraverso più input, inclusi audio, video e testo, mantenendo al contempo i dati strutturali unici associati a ciascuna modalità.
Una separazione efficace è ottenuta ricostruendo con vincoli di indipendenza. La ricostruzione della caratteristica dell'originale modalità è data da:
(11)
dove
è una rete decoder. La perdita di ricostruzione preserva i seguenti dati:
(12)
Inoltre, l'ortogonalità, o decorrelazione, tra emozione e rappresentazioni specifiche della modalità limita spesso la sovrapposizione di informazioni:
(13)
Raggiungendo questi obiettivi, il modello potrebbe apprendere rappresentazioni delle emozioni affidabili, comprensibili e resistenti alla variabilità modale. Successive fusioni cross-modalità basate su grafi e caratteristiche di mappatura visiva, specialmente per la progettazione di interazioni intelligenti, dipendono fortemente da rappresentazioni emotive interpretabili e strutturate.
Coincidenza delle emozioni tra le diverse modalità
L'aggiunta della coerenza emotiva migliora chiaramente l'efficacia della fusione tra le diverse modalità. Questo avviene perché le strategie di fusione non devono compensare ampie differenze tra le due rappresentazioni, dal momento che gli embedding emotivi specifici per modalità condividono uno spazio latente. L'illustrazione combinata delle due emozioni è descritta come segue
. La fusione pesata sarà più stabile quando le rappresentazioni specifiche per emozione sono coerenti, poiché le variazioni tra i segnali provenienti da diverse modalità non influenzeranno più il risultato.
(14)
Imponendo l'allineamento semantico delle informazioni emotive, questo obiettivo riduce al minimo le discrepanze tra le diverse modalità e garantisce che la percezione delle emozioni rimanga costante indipendentemente dalla modalità utilizzata per esprimerla. Di conseguenza, viene creato uno spazio rappresentativo coerente ed affettivo proiettando gli indizi emotivi ottenuti dai segnali vocali, dalle espressioni facciali e dal contenuto linguistico.
Impatto sulla fusione intersensoriale
La fusione cross-modale diventa più efficace quando viene introdotta una coerenza emotiva tra le diverse modalità. I meccanismi di fusione non devono più compensare ampie differenze nelle rappresentazioni inter-modali, poiché gli embedding specifici per l'emozione sono allineati in uno spazio latente comune. La rappresentazione emotiva fusa è definita come segue:
(15)
Dove αm rappresenta il peso dell'attenzione assegnato alla modalità m. La fusione pesata diventa più stabile e comprensibile quando le rappresentazioni specifiche per l'emozione sono coerenti, poiché il risultato della fusione mostra evidenze emotive complementari piuttosto che segnali di modalità contraddittori.
Matematicamente, ridurre la
varianza tra diversi tipi di rappresentazioni specifiche per emozione in relazione a
equivale a:
(16)
dove
rappresenta l'espressione media dell'emozione. Una varianza ridotta fa sì che le modalità di ingresso vengano pesate in base alla loro precisa rilevanza emotiva piuttosto che al rumore della modalità, garantendo una migliore convergenza della rete e una valutazione dell'attenzione più accurata.
L'obiettivo finale dell'apprendimento basato sulle visualizzazioni emotive disincagliate è combinare frammentazione, ricostruzione e uniformità emotiva:
(17)
in cui due iperparametri, λ1 e λ2, controllano la relazione tra affidabilità emotiva multimodale e dissociazione. Il modello proposto acquisisce rappresentazioni emotive invarianti rispetto alla modalità, interpretabili e fusibili per raggiungere questo obiettivo, con un'enfasi particolare nel fornire una base solida per la successiva fusione basata su grafi e per la rappresentazione a livello di caratteristiche nella progettazione di interfacce intelligenti.
Fusione tramite attenzione multimodale basata su grafo
È stata utilizzata una rete grafica con attenzione cross-modale per simulare relazioni emotive finemente dettagliate tra le diverse modalità. Per facilitare il flusso di informazioni tra le modalità, è stato costruito un grafo multimodale completamente connesso, in cui ogni embedding specifico per modalità (testo, audio e video) è rappresentato come un nodo del grafo. Le relazioni tra le modalità sono state utilizzate per definire la matrice di adiacenza del grafo, successivamente migliorata mediante un metodo di attenzione apprendibile. Uno spazio latente condiviso è stato creato concatenando e proiettando gli output di diversi head di attenzione. Una rappresentazione unificata dell'emozione multimodale è stata quindi prodotta aggregando le rappresentazioni dei nodi attraverso un pooling pesato sull'attenzione. Questa rappresentazione fusa è stata poi inviata ai moduli di previsione e visualizzazione per l'analisi consapevole delle interazioni e il riconoscimento delle emozioni. Il modulo di fusione basato su grafo aveva una dimensione della rappresentazione nascosta pari a 256 e comprendeva due strati di attenzione grafica, ciascuno con otto head di attenzione. Per determinare l'importanza relativa delle modalità adiacenti, i coefficienti di attenzione tra nodi connessi sono stati calcolati e normalizzati utilizzando la funzione softmax. Ogni strato di attenzione grafica era seguito da normalizzazione dello strato, connessioni residue e un tasso di dropout pari a 0,2, al fine di aumentare la stabilità durante l'addestramento e ridurre l'overfitting. Dopo aver concatenato e proiettato gli output di diversi head di attenzione in uno spazio latente comune, le rappresentazioni dei nodi sono state combinate in un unico embedding emotivo multimodale mediante pooling pesato sull'attenzione. Successivamente, la rappresentazione fusa è stata utilizzata per la mappatura visiva multi-vista e la previsione delle emozioni.
Diverse interazioni multimodali sono state catturate utilizzando un'attenzione grafica multi-testa. La funzione softmax è stata utilizzata per normalizzare i coefficienti di attenzione tra i nodi connessi per ogni nodo. Per aumentare la stabilità dell'addestramento ed evitare l'overfitting, ai livelli di attenzione grafica impilati nel modulo di fusione grafica sono state aggiunte connessioni residue, normalizzazione del livello e regolarizzazione con dropout.
Sia, i termini
considerati singolarmente, a rappresentare le rappresentazioni corrispondenti alle emozioni specifiche raccolte attraverso le modalità visiva, audio e testuale; ciascun componente risiede all'interno dello spazio latente condiviso
. I modelli per i nodi delle modalità utilizzano una notazione per il grafo
, con i nodi dell'insieme
che corrispondono direttamente ai tre nodi delle modalità stesse, al fine di rafforzare esplicitamente le dipendenze emotive condivise tra le diverse rappresentazioni modali.
Dopo aver assegnato un vettore di caratteristiche specifico per l'emozione a ciascun nodo nel grafo, abbiamo:
(18)
A differenza dei metodi di fusione tradizionali, che utilizzano pesi di fusione predeterminati o fissi, il metodo proposto apprende pesi adattivi per i collegamenti in base alla loro rilevanza e interdipendenze, sia tra i canali che tra le diverse situazioni emotive.
Una rete di attenzione su grafi (GAT) viene utilizzata per la fusione multimodale. Un coefficiente di attenzione viene calcolato per ogni nodo i e per i suoi nodi adiacenti, ossia il nodo j:
(19)
L'effetto emotivo del passaggio dalla modalità j alla modalità i è misurato dai pesi normalizzati αij.
Successivamente, l'aspetto fuso di ciascun nodo modale viene calcolato come un raggruppamento pesato dei suoi vicini:
(20)
dove la funzione di attivazione
è non lineare. Infine, le caratteristiche aggiornate di ogni nodo vengono combinate per ottenere una rappresentazione globale dell'emozione fusa:
(21)
È una tecnica utile per la modellazione interpretabile delle emozioni e per il successivo mapping visivo, poiché acquisisce informazioni complementari da diverse modalità mantenendo al contempo le complesse relazioni inter-modali.
L'algoritmo 1 (Supplementary File 1) fornisce lo schema generale per eseguire la fusione cross-modale basata su grafi. Inizialmente, viene creato un grafo con le caratteristiche specifiche dell'emozione associate a ciascuna delle modalità visiva, audio e testuale. Successivamente, vengono calcolati i punteggi di attenzione per ogni coppia di nodi del grafo, che rappresentano la combinazione della dipendenza emotiva. I punteggi di attenzione vengono quindi normalizzati per indicare il contributo relativo di ciascuna modalità al contesto emotivo specificato, consentendo l'apprendimento dei pesi di attenzione. L'embedding generale dell'emozione viene prodotto nell'ultima fase aggregando le caratteristiche associate ai nodi del grafo. In questo senso, la fusione generale dell'algoritmo delle caratteristiche multimodali legate alle emozioni specificate mostra potenzialità in termini di adattabilità, interpretabilità e intelligenza contestuale.
Figura 2 mostra la struttura e il funzionamento della rete proposta con attenzione cross-modale per la fusione del sentiment multimodale. Gli embedding specifici per emozione, derivati in modo indipendente per le modalità testuale, audio e video, vengono inizialmente elaborati da meccanismi di attenzione a livello modale che apprendono l'importanza relativa delle informazioni linguistiche, vocali e facciali in un dato contesto emotivo. Le rappresentazioni pesate mediante attenzione delle modalità vengono quindi combinate per formare un embedding emotivo unificato, nel quale la matrice di attenzione cattura le dipendenze inter-modali e le intensità delle interazioni. La matrice di attenzione appresa dalla rete modula dinamicamente i contributi delle modalità, consentendo di concentrarsi sulla modalità più informativa ed escludere quelle rumorose o meno significative. La rappresentazione emotiva fusa permette un riconoscimento accurato delle emozioni e un'analisi fine degli stati emotivi come neutro, abbraccio e preoccupazione.
Modulo di mappatura visiva
Con l'ausilio della sezione di mappatura visiva, creata appositamente per questo scopo, un progettista intelligente di interazioni può convertire la rappresentazione unificata dello stato emotivo in una forma visiva comprensibile e facilmente fruibile dopo il processo di fusione multimodale, in base al grafico.
Per facilitare la comprensione delle rappresentazioni emotive latenti, sono state utilizzate tecniche di riduzione della dimensionalità per visualizzare gli embedding multimodali appresi per l'emozione. Dopo aver ridotto la dimensionalità delle caratteristiche mantenendo la maggior parte della varianza mediante l'analisi delle componenti principali (PCA), gli embedding sono stati proiettati in uno spazio bidimensionale per la visualizzazione, usando l'incorporamento stocastico di vicini distribuiti in forma t (t-SNE). Per t-SNE sono stati utilizzati un valore di perplessità pari a 30, un tasso di apprendimento di 200 e 1.000 iterazioni di ottimizzazione. I cluster specifici per emozione e le relazioni tra le modalità sono stati visualizzati utilizzando le proiezioni ottenute. I pesi normalizzati di attenzione incrociata ottenuti dalla rete di attenzione basata su grafi sono stati utilizzati per creare mappe termiche di attenzione. Nei grafici termici è illustrato il contributo relativo delle modalità testuale, audio e visiva durante la previsione dell'emozione. I coefficienti di attenzione appresi sono stati utilizzati come pesi degli archi per creare grafi di interazione incrociata, consentendo l'analisi visiva delle relazioni inter-modali e del flusso informativo all'interno del framework di fusione. Sono stati creati grafici delle traiettorie emotive monitorando l'evoluzione degli embedding emotivi latenti attraverso utterance successive, per esaminare la dinamica emotiva temporale. Queste traiettorie forniscono informazioni su come gli stati emotivi e i contributi delle modalità evolvono nel tempo. Tutte le visualizzazioni sono state create utilizzando pacchetti Python come Matplotlib e Scikit-learn. Per valutare l'interpretabilità, la formazione dei cluster, i contributi delle modalità e la dinamica temporale delle emozioni, sono state condotte analisi qualitative delle visualizzazioni degli embedding, dei grafi di interazione e delle mappe termiche di attenzione.
Sia
a rappresentare la rappresentazione fusa dello stato emotivo ottenuta tramite la funzione della rete di attenzione su grafi. A differenza della visualizzazione a livello di output dei grafici dello stato emotivo, l'obiettivo principale del modulo è trasformare le rappresentazioni dello stato emotivo e i pesi corrispondenti del meccanismo di attenzione in una forma visiva comprensibile.
Utilizzando i valori αji appresi, viene creata una mappa termica di attenzione per esaminare visivamente il contributo di ciascuna modalità. I pesi di attenzione in ingresso vengono quindi sommati per determinare un punteggio composito di importanza per ogni modalità:
(22)
dove si rappresenta il contributo emotivo relativo della modalità I. Per facilitare la creazione di una mappa termica dell'attenzione, i valori ottenuti vengono normalizzati e associati a una mappa di colori che consente all'utente di identificare facilmente la modalità predominante in diversi passaggi temporali o stati interattivi. Attraverso varie modalità di input visive, uditive o testuali, un'interfaccia di questo tipo aiuta l'utente a comprendere il funzionamento del meccanismo di attenzione del sistema.
Il grafo appreso è modellato specificamente come un "grafo delle interazioni pesato" per rappresentare la dipendenza incrociata dei modi espressivi delle emozioni umane. Ogni modalità è rappresentata da un nodo del grafo, mentre l'intensità delle interazioni relative alle emozioni umane è rappresentata dai pesi, nella forma di αji , sugli archi che li collegano. Il grafo pesato sopra illustra l'intensità delle interazioni emotive umane. La definizione di i e j è:
(23)
Lo spessore o la trasparenza delle linee nella visualizzazione del grafico vengono mostrati correttamente grazie a questi pesi. Ciò facilita la comprensione delle interazioni tra le diverse modalità. Il progettista può comprendere meglio come gli indicatori emotivi interagiscono durante il processo di fusione, grazie ai grafici di interazione intermodale.
Gli embedding emotivi fusi
in diversi passi temporali vengono ridotti a uno spazio di dimensione inferiore mediante un algoritmo di riduzione della dimensionalità, come PCA o t-SNE, al fine di visualizzare l'evoluzione delle emozioni nel tempo:
(24)
dove la funzione di proiezione è rappresentata da
. L'emergere di traiettorie emotive 2D/3D, che mostrano transizioni emotive, intensità e stabilità nelle interazioni, può essere interpretato come una rappresentazione intuitiva dell'evoluzione degli stati emotivi nel tempo. Questi aspetti possono essere utilizzati per l'interazione intelligente, il processo decisionale e il monitoraggio in tempo reale.
A differenza dei sistemi convenzionali di riconoscimento delle emozioni, che si limitano a fornire corrispondenze con specifiche classi o punteggi, questo sistema si concentra sulla dimostrazione di come le emozioni umane si formano al suo interno. Rivela il proprio processo decisionale offrendo visualizzazioni di caratteristiche intermedie, inclusi i fattori di ponderazione, le interazioni tra modelli e i relativi percorsi. Ciò consente all'utente di comprendere come ciascun fattore—visivo, vocale o linguistico—influenzi la generazione delle risposte alle emozioni umane.
Mappare le emozioni in forme comprensibili attraverso rappresentazioni visive può quindi colmare il divario tra l'analisi delle emozioni mediante metodi di apprendimento profondo e la loro integrazione nella progettazione di interfacce intelligenti. I dati raccolti da entrambi gli approcci possono quindi essere utilizzati per creare interfacce utente più precise. Pertanto, l'approccio proposto può fornire ai progettisti di interazioni informazioni fondamentali per sviluppare interfacce utente più accurate. In altri termini, la comprensione delle emozioni diventa una componente estremamente attiva della progettazione delle interazioni. L'accuratezza può aumentare soltanto quando la comprensione delle emozioni viene integrata attivamente nella progettazione delle interazioni.
Il modulo di mappatura visiva rende possibile la spiegabilità in diversi modi interconnessi ma distinti: la spiegabilità a livello di caratteristica rivela le rappresentazioni sottostanti delle emozioni create dalla DNN, permettendoci di comprendere la semantica utilizzata per descrivere ogni caratteristica relativa all'emozione; la spiegabilità a livello di modalità utilizza dati provenienti dai grafi di interazione e dalle mappe termiche dell'attenzione visiva per descrivere come ciascuna modalità — visiva, audio o testuale — contribuisca alle decisioni prese per esprimere emozioni; infine, le traiettorie risultanti dall'incorporamento emotivo ci permettono di comprendere come ciascuna modalità visiva e testuale cambi nel tempo da una prospettiva di interazione dinamica. Si rimanda all'Algoritmo 2 (Supplementary File 1).
Le caratteristiche emotive multimodali fuse vengono mappate in rappresentazioni visivamente significative per la progettazione di interazioni intelligenti, utilizzando l'algoritmo di mappatura visiva proposto, Algoritmo 2. I pesi dell'attenzione multimodale basati su grafi vengono utilizzati per quantificare le differenze tra gli elementi visivi, audio e testuali in ingresso a ogni passo temporale. Queste differenze vengono quindi mappate in rappresentazioni visive per evidenziare le principali fonti che influenzano le emozioni, mediante elementi visivi a mappa di calore. Per fornire una visione approfondita dell'interazione tra gli elementi in ingresso e trasmettere l'evoluzione emotiva generata dagli elementi in ingresso multimodali, vengono quindi calcolate le intensità di interazione a coppie al fine di creare i pesi di interazione multimodali. Nel frattempo, viene creata una rappresentazione dell'evoluzione emotiva mappando gli elementi emotivi fusi raccolti nel tempo in uno spazio a bassa dimensionalità, producendo così un'evoluzione continua degli elementi emotivi.
Previsione delle emozioni e feedback dell'interazione
L'esito della rappresentazione emotiva fusa, rappresentata come
, viene quindi utilizzato come funzione sia per il feedback dell'interazione che per la previsione emotiva. Inoltre, la previsione emotiva è descritta come un modello multitasking costituito da un'attività di regressione per il riconoscimento dell'intensità emotiva continua e da un'attività di classificazione per il riconoscimento emotivo discreto. Per il riconoscimento emotivo discreto si utilizza il seguente modello di classificazione basato su softmax:
(25)
dove
rappresenta le probabilità attese per le classi emotive e Wc e bc sono vincoli apprendibili. Si utilizza la perdita di entropia incrociata per migliorare l'obiettivo di classificazione:
(26)
dove yk è l'etichetta reale e K è il numero di classi emotive. Un ramo di regressione viene utilizzato per stimare l'intensità emotiva in parallelo, producendo una previsione di diversi attributi affettivi continui, inclusi valenza ed attivazione. Assegnagli la seguente definizione:
(27)
dove il punteggio previsto di intensità emotiva è indicato da
. Viene utilizzata la perdita quadratica media per migliorare l'attività di regressione:
(28)
In generale, le due attività sono combinate nell'obiettivo di previsione:
(29)
dove gli obiettivi della regressione e della classificazione sono bilanciati da λ. Si propone una modifica dinamica del modulo di visualizzazione in base allo stato emotivo identificato, per consentire un feedback consapevole dell'interazione. Il contesto di interazione al tempo t è rappresentato da ct. La risposta del modulo di visualizzazione è fornita da:
(30)
dove la funzione di adattamento della visualizzazione è rappresentata dall'
. Ciò consente di aggiustare in tempo reale le mappe termiche delle modalità, i grafici di interazione e le traiettorie emotive in base ai cambiamenti e alle emozioni previsti. Questo indica che il sistema offre un sostegno significativo per il feedback, oltre a fornire prestazioni elevate nella previsione dello stato emotivo.