מאמר מחקר

מיפוי חזותי של מאפייני רגש רב-מודאליים לעיצוב אינטראקציה חכמה

DOI:

10.3791/71171

21 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

העבודה מציעה מסגרת מקצה לקצה לניתוח רגשות רב-מודאלי, המנצלת מקודדי transformer, ייצוגי רגשות מופרדים (disentangled) ותשומת לב חוצת-מודאליות מבוססת גרפים עם מיפוי חזותי, במטרה לשפר את דיוק זיהוי הרגשות בשני מאגרי נתונים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מיפוי חזותי של מאפייני רגש רב-מודאליים הוא חיוני לתכנון ממשקים חכמים, שכן הוא מאפשר למכונות להבין, לפרש ולהגיב למצבים רגשיים אנושיים. עם זאת, אלגוריתמים נוכחיים לזיהוי רגשות רב-מודאליים מתמקדים בעיקר בביצועים חיזויים, ומספקים תובנות מועטות לגבי יכולת הפרשנות, מודעות לאינטראקציה או אינטראקציות בין-מודאליות ברמת המאפיינים. עבודה זו הציגה מסגרת למיפוי חזותי של היבטי רגש רב-מודאליים המשלבת ויזואליזציה מכוונת-אינטראקציה, למידת ייצוג ניתנת לפרשנות וחיזוי רגשות. ללא שימוש במאפיינים שנוצרו ידנית, נעשה שימוש במקודדים מבוססי transformer כדי לחלץ שימועים (embeddings) רגשיים ברמה גבוהה ממודליות טקסטואליות, קוליות וחזותיות. כדי לשפר את החסינות, מידע ספציפי לרגש ומידע ספציפי למודליות הופרדו באמצעות טכניקה של למידת ייצוג מופרדת (disentangled representation learning). בנוסף, פותחה רשת קשב בין-מודאלית מבוססת גרף כדי להשתמש בשקלול קשב אדפטיבי לצורך סימולציה של קשרים רגשיים עדינים בין המודליות. מודול מיפוי חזותי רב-מבטי פותח כדי לתאר מסלולי רגש זמניים, התפלגויות קשב בין-מודאליות ושימועים רגשיים חבויים במטרה לשפר את השקיפות. מאגר הנתונים Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) של אוניברסיטת קרנגי מלון ומאגר הנתונים הסיני לניתוח סנטימנט רב-מודאלי (CH-SIMS) שימשו להערכת המסגרת המוצעת. על פי תוצאות ניסיוניות, המסגרת המוצעת סיפקה יכולת פרשנות משופרת ברמת המאפיינים וויזואליזציה מודעת-אינטראקציה, תוך שהיא עולה בעקביות בביצועיה על טכניקות בסיס מייצגות במונחים של דיוק, F1-score, מתאם וטעות מוחלטת ממוצעת. בנוסף, מודול המיפוי החזותי סייע בפרשנות איכותנית של ייצוגי רגש רב-מודאליים, אינטראקציות בין-מודאליות ודינמיקה רגשית זמנית, ובכך תמך בויזואליזציה ובניתוח מודעים-אינטראקציה.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

היכולת לזהות ולהבין נכונה רגשות אנושיים הפכה למכריעה לשיפור האינטראקציה בין בני אדם למכונות. בנוסף להיותו חיוני לשיפור האינטראקציה בין אדם למחשב, לניתוח רגשות יש פוטנציאל לחולל מהפכה במספר תחומים, כולל אבחון רפואי טרום-דיאגנוסטי1, ניתוח התנהגותי בכיתות לימוד2, מעקב פסיכולוגי אחר מטופלים3, זיהוי עייפות בכלי רכב4, וניהול חכם בסביבות בית חכם5. התפתחויות אחרונות במחשוב רגשי (affective computing) ובלמידה עמוקה6 הגבירו את העניין ביצירת מערכות בזמן אמת המסוגלות ללכוד את המורכבות של הרגש האנושי.

שיטות רבות כיום מסתמכות בעיקר על נתונים חד-מודאליים (unimodal), כגון סימנים טקסטואליים, גרפיים או שמיעתיים7,8,9. גישות אלו נכשלות שוב ושוב בזיהוי אותות מעודנים, כגון סרקזם או ניואנסים תלויי-הקשר. המחקר עבר להערכת רגשות רב-מודאלית (multimodal), המשלבת נתונים משלימים ממקורות מרובים כדי להתגבר על מגבלות אלו10,11,12. היתרונות של מיזוג מודאליות מרובות הודגמו על ידי מודלי בסיס כגון early fusion-long short-term memory (EF-LSTM)13, רשתות עצביות עמוקות מסוג light and FM (LF-DNN)14, רשתות tensor fusion (TFN), וגישות מיזוג רב-מודאליות בדרגה נמוכה (low-rank). עם זאת, רוב הגישות הללו מסתמכות על יצירת מאפיינים במצב לא מקוון (offline) ואינן מתאימות למצבים דינמיים בעולם האמיתי.

על מנת להכיל מצבים רגשיים, מחקרי ויישומי זיהוי רגשות רב-מודאליים גדלו במהלך עשר השנים האחרונות15. אחד מתחומי המחקר המאתגרים והמשמעותיים ביותר כיום הוא ניטור רציף של מצבים רגשיים באמצעות מגוון מקורות נתונים16. הרעיון של רב-מודאליות הופיע באופן טבעי למדי עם עלייתם של מערכות ידע מגוונות שכאלה, והוא הוביל להתקדמויות רבות ביישום רגשות בתחומים כגון מחשוב רגשי, אינטראקציית אדם-מחשב (HCI), למידה, משחקי וידאו, שירות לקוחות, טיפול רפואי, הערכת חווית משתמש (UX) ועוד. עם זאת, לא תמיד היה פשוט ליישם טכניקות לזיהוי רגשות בהערכת UX.

אחת הסיבות העיקריות להתמקדות בזיהוי רב-מודאלי (multimodal) במקום בשיטות חד-מודאליות היא החסרונות המובנים בהסתמכות על מקור מידע יחיד. מערכות לזיהוי רגשות חד-מודאליות עלולות לסבול מדיוק נמוך יותר עקב נתונים חסרים או לא ברורים, בעוד שסכמות MER הן אמינות יותר ומציעות הבנה מקיפה ומעמיקה יותר של מצבים הבעתיים על ידי שילוב של מספר מקורות נתונים17. לדוגמה, שפת פנים לבדה עשויה שלא להספיק כדי לסווג רגשות בצורה מדויקת, במיוחד כאשר המחוות מורכבות או לא ברורות. עם זאת, שילוב של הבעות פנים עם צורות תקשורת אחרות, כגון שפה או רמזים פיזיים, עשוי להעלות את רמת הדיוק בזיהוי הרגשות.

מחקרים נרחבים על זיהוי רגשות נערכו במספר מודליות. מחקרים מוקדמים התמקדו בזיהוי מאפיינים מבדילים ממודליות שונות, כגון קלט גרפי, אקוסטי או מבוסס טקסט. עם זאת, הולך ומתברר ששילוב של מודליות שונות יכול לספק מידע רגשי מאוזן, המוביל לזיהוי סנטימנט מהימן ומדויק יותר. חלק זה סוקר התקדמויות מרכזיות בניתוח רגשות במודליות בודדות ובניתוח רב-מודלי, תוך התמקדות בגישות הבסיס, בחסרונותיהן ובנימוקים לשיטה שלנו.

המחקר הראשוני על זיהוי רגשות התמקד בעיקר במודאליות אחת. בתחום הראייתי, מחקר פורץ דרך הוביל לסיווג של תנועות פנים פרוטוטיפיות20. התקדמויות מאוחרות יותר כללו טכניקות ללכידת דינמיקה זמנית, כגון תנועה חזותית21 ומודלי מרקוב חבויים22, בעוד שתגובות פנים חולקו ליחידות פעולה באמצעות מערכת קידוד פעולות פנים (FACS)23. רשתות LSTM ורשתות נוירונים קונבולוציוניות (CNNs) שימשו בהצלחה להפקת מאפיינים משמעותיים ישירות מאותות שמע גולמיים; מתודולוגיות לזיהוי רגשות מבוסס שמע התקדמו מעיבוד אותות קונבנציונלי ללמידה עמוקה24. הפקת אותות סנטימנטים הקשריים בניתוח רגשות מבוסס טקסט שופרה משמעותית על ידי רשתות נוירונים רקורסיביות (RNNs) המשלבות מנגנוני קשב, ולאחרונה, על ידי מודלים מבוססי Transformer. למרות הישגיהן, טכניקות של מודאליות אחת אינן מסוגלות מטבען לייצג במדויק את המורכבויות שבני האדם חווים, כיוון שחסר להן המידע המשלים שנמצא במודאליות אחרות.

מספר מודלים המבוססים על מנגנוני קשב (attention mechanism), כגון מודל DialogXL25, הוצעו בשנת 2021 כדי לאסוף נתונים סביבתיים לטווח ארוך יותר בתחום זיהוי סנטימנט בשיחות. Kim et al.26 הציגו בשנת 2021 את מודל EmoBERTa במטרה להגביר את הדיוק של ERC. מודל זה משתמש בנתוני הדוברים כדי לשפר את מאפייני הדוברים בשיחות ואת האינטראקציות שלהם זה עם זה. בשנת 2022, Li et al.27 הציגו את שיטת CoG-BART. שיטה זו משתמשת בלמידה ניגודית מונחית (supervised contrastive learning) כדי לשפר את יכולתו של המודל לפרש נתונים רלוונטיים. יש לציין כי למידה מונחית דורשת כמות ניכרת של נתונים מתויגים.

דוגמה טיפוסית לעבודה מסוג זה היא מסגרת ה-Multimodal Interaction-Aware Representation (MIAR)28, המשתמשת בטוקנים של אינטראקציית מאפיינים וביישור ניגודי (contrastive alignment) כדי לשפר את ההכללה בין מודליות שונות. MIAR משפרת את יישור המודליות ומשיגה ביצועים חזקים במספר מערכי נתונים; עם זאת, היא מתמקדת בעיקר בדיוק חיזוי מבלי להתייחס למיפוי חזותי. באופן דומה, מודל ה-Cross-Attentional Audio-Visual Fusion29 לוכד ביעילות אינטראקציות אודיו-ויזואליות ברזולוציה גבוהה לצורך חיזוי ערות (arousal) וולנס (valence), אך הוא מוגבל לשתי מודליות וחסר יכולות ויזואליזציה. גישות למידול זמני המבוססות על רשתות LSTM ומיזוג אוטואנקודר לוכדות בהצלחה את הדינמיקה הזמנית של רגשות, אך מספקות תובנה מוגבלת לגבי אינטראקציות בין מודליות והייצוגים הרגשיים שנלמדו. לאחרונה, שיטות מבוססות טרנספורמר, כגון ה-Transformer-based Multimodal Fusion Network (TMFN)30, הדגימו ביצועים חזקים ב-CMU-MOSI וב-CMU-MOSEI באמצעות מיזוג רב-מודלי משופר ולמידה ניגודית. עם זאת, גישות אלו נותרות בעיקר מונעות ביצועים ומספקות תמיכה מוגבלת ביכולת הסבר (explainability), פרשנות ברמת המאפיין וויזואליזציה מוכוונת-אינטראקציה.

כדי לשפר את השילוב של נתונים טקסטואליים, אקוסטיים וויזואליים, הוצעו מספר טכניקות לזיהוי רגשות רב-מודאלי (multimodal). למרות שלא הצליחו ללכוד אינטראקציות מורכבות בין מודאליות שונות, טכניקות מיזוג מוקדם כגון EF-LSTM ו-LF-DNN הדגימו את היתרונות של שימוש במידע רב-מודאלי לצורך ניתוח סנטימנט ורגשות. אף על פי שה-TFN שיפר את הביצועים במאגרי נתונים סטנדרטיים כגון CMU-MOSI ו-CMU-MOSEI והציג מידול מפורש של אינטראקציות בין-מודאליות, הפרשנות המוגבלת שלו והמורכבות החישובית הגבוהה עיכבו את יעילותו. כדי לשפר את היישור בין המודאליות (modality alignment) ואת מיזוג התכונות הדינמי, טכניקות מודרניות יותר כגון MIAR, מודלי מיזוג בעלי תשומת לב צולבת (cross-attentional fusion), TMFN וטרנספורמרים רב-מודאליים אדפטיביים השתמשו בטופולוגיות של טרנספורמר ובמנגנוני קשב (attention mechanisms). שיטות אלו התמקדו בעיקר בביצועים חיזויים, והעניקו תובנות מועטות לגבי ייצוגים רגשיים ברמת התכונה ותלויות בין-מודאליות, וזאת למרות השגתן תוצאות תחרותיות במדדי הערכה נפוצים כגון accuracy, F1-score ו-mean absolute error. יתרה מכך, מחקרים מעטים ביססו טכניקות ויזואליזציה שיכולות לחשוף קידודי רגש חבויים (latent emotion embeddings), התפלגויות קשב ודינמיקה רגשית זמנית, או שילבו מידול מבוסס גרפים של אינטראקציות בין-מודאליות. הגישה המוצעת משלבת מיפוי ויזואלי רב-מבטי, מיזוג קשב צולב מבוסס גרפים ולמידת ייצוג מופרדת (disentangled representation learning) כדי להתגבר על חסרונות אלו ולשפר את ביצועי זיהוי הרגשות הרב-מודאלי.

בדומה לכך, ה-Adaptive Multimodal Transformer32 מציע מיזוג מבוסס-החלפה כדי למתן באופן אדפטיבי מידע מודאלי רועש או חסר, ובכך לשפר את ביצועי סיווג הסנטימנט. למרות שגישה זו יכולה לטפל ביעילות בפערים בהפצה של המידע המודאלי, תכנונה ספציפי למשימה של ניתוח סנטימנט והיא מספקת תובנה מוגבלת לגבי הייצוגים הרגשיים שנלמדו. תרומה משמעותית נוספת היא ה-Multimodal Fusion Model33, המשלב רשתות CNN, רשתות LSTM כפליות ומנגנוני קשב מבוססי-טרנספורמר לזיהוי רגשות מולטי-מודאלי בזמן אמת. המודל מבצע מיזוג מלא של מודליות וידאו, אודיו וטקסט ומראה ביצועי זיהוי חסונים. עם זאת, בדומה למודלים קיימים אחרים, הוא מתמקד בעיקר בדיוק החיזוי וחסר מאפיינים מפורשים לוויזואליזציה וליכולת פירוש המכוונת לאינטראקציה.

לסיכום, בעוד שגישות עדכניות לזיהוי רגשות רב-מודאלי השיגו הצלחה ניכרת בלכידת אינטראקציות בין-מודאליות ובשיפור דיוק התחזיות, רובן מתמקדות במשימות מונחות-זיהוי. תחומים כגון פרשנות ברמת המאפיינים, ויזואליזציה של ייצוגים רגשיים במרחב התמונה, ושילוב המסגרת המוצעת לעיצוב אינטראקציה חכמה קיבלו תשומת לב מועטה. עם אתגרים אלו לנגד עינינו, מוצגת המסגרת המוצעת.

מרבית השיטות הנוכחיות מתמקדות בעיקר בשיפור ביצועי החיזוי תוך שהן מציעות יכולת פרשנות מוגבלת של ייצוגים רגשיים נלמדים ואינטראקציות בין-מודאליות, וזאת למרות התקדמויות בולטות בזיהוי רגשות רב-מודאלי28,29. לעיתים קרובות קשה לאסטרטגיות היתוך נוכחיות למדל אינטראקציות מורכבות בין מודאליות טקסטואליות, אקוסטיות וויזואליות, במיוחד כאשר מתרחשים פערים בין המודאליות ומחסור במידע 28,31. בעוד שעיצובים מבוססי-transformer ומנגנוני קשב שיפרו את למידת הייצוג, השקיפות והפרשנות שלהם נפגעות לעיתים קרובות בשל היעדר הפרדה מפורשת בין מידע ספציפי לרגש למידע ספציפי למודאליות31,32,33. בנוסף, רק מספר קטן של מחקרים בחנו מידול מבוסס-גרף של אינטראקציות בין-מודאליות או יצרו מסגרות ויזואליזציה שיכולות לחשוף דינמיקה רגשית זמנית, התפלגויות קשב ושיבוצים רגשיים (emotion embeddings). חסרונות אלו מדגישים את הצורך במסגרת רב-מודאלית הניתנת לפרשנות עבור אינטראקציה חכמה בין אדם למכונה, המשלבת מיפוי ויזואלי מוכוון-אינטראקציה עם למידה בין-מודאלית חזקה.

עבודה זו מציגה מסגרת ניתנת לפירוש למיפוי חזותי של היבטי רגש רב-מודאליים בעיצוב ממשקים חכמים. ללא צורך במאפיינים שנוצרו ידנית, המערכת משתמשת בלמידה עמוקה מקצה לקצה (end-to-end) כדי לחלץ ייצוגים רגשיים ברמה גבוהה ממודליות טקסטואליות, קוליות וחזותיות. אינטראקציות רגשיות חוצות-מודאליות ממודלות באמצעות מנגנון היתוך תשומת לב (attention fusion) מבוסס גרף המפריד בין מידע ספציפי לרגש לבין מידע ספציפי למודאליות, מה שמאפשר למידה של ייצוגים מופרדים ומשפר את יכולת הפירוש ואת החוסן של המערכת. בנוסף, פותח מודול ויזואליזציה רב-מבטים להצגת דינמיקה רגשית זמנית, דפוסי תשומת לב חוצי-מודאליות ושיבוצי רגש (emotion embeddings). היעילות וההתאמה של המסגרת המוצעת במערכות אינטראקציה חכמות בין אדם למכונה נבחנות באמצעות תיקוף על מאגרי נתונים סטנדרטיים לזיהוי רגשות רב-מודאליים.

עבודה זו מציעה מסגרת ייחודית למיפוי חזותי של היבטי רגש רב-מודאליים, החורגת מגישות מסורתיות מוכוונות-חיזוי כדי להתגבר על מידול לקוי של אינטראקציות בין-מודאליות ועל הפרשנות המוגבלת במערכות נוכחיות לזיהוי רגשות רב-מודאליים. בתוך ארכיטקטורה אחת, הגישה המוצעת משלבת למידת ייצוג רב-מודאלית מבוססת transformer, מידול תכונות מופרד (disentangled) מודע-רגש, מיזוג קשב בין-מודאלי מבוסס גרף, וויזואליזציה מוכוונת-אינטראקציה. המסגרת מפרידה בבירור בין ייצוגים ספציפיים לרגש לבין ייצוגים ספציפיים למודאליות כדי לשפר את הפרשנות, החסינות והעקביות הבין-מודאלית, בניגוד לגישות נוכחיות המתמקדות בעיקר בביצועי הסיווג. בנוסף, מוצג מנגנון קשב מבוסס גרף המאפשר מידול אדפטיבי של אינטראקציות בין-מודאליות על ידי לכידה של תלות רגשית ברמת פירוט גבוהה בין מודאליות טקסטואלית, קולית וחזותית. מודול מיפוי חזותי רב-מבטים נוצר כדי להגביר את השקיפות באמצעות חשיפת מסלולי רגש זמניים, דפוסי קשב בין-מודאליים והטמעות (embeddings) רגשיות חבויות, המספקים תובנות אינטואיטיביות לגבי תהליך קבלת ההחלטות של המודל. בנוסף לאספקת ויזואליזציה ופרשנות משופרות של דינמיקה רגשית רב-מודאלית, הערכה ניסיונית על מאגרי הבקרת CH-SIMS ו-CMU-MOSEI הראתה ביצועים תחרותיים במונחים של דיוק, F1-score, שגיאה מוחלטת ממוצעת ומתאם.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

העבודה המוצעת שואפת לשפר את עיצוב האינטראקציה החכמה על ידי הצעת מסגרת הניתנת לפירוש למיפוי ויזואלי של מאפייני רגש מולטי-מודאליים. בעבודה זו נעשה שימוש במאגרי הנתונים CH-SIMS ו-CMU-MOSEI, הנגישים לציבור. שני סטים של נתונים נרכשו מהמקורות הרשמיים שלהם ונוצלו בהתאם להנחיות השימוש, לתקני המחקר ולתנאי הרישוי שנקבעו על ידי יוצריהם בהתאמה. התוכן המולטי-מודאלי של מאגרי הנתונים, הכולל נתוני טקסט, אודיו ווידאו, נאסף תחילה וסומן על ידי ספקי מאגרי הנתונים בהתאם להרשאות המשתתפים המאושרות ולפרוטוקולי איסוף הנתונים שלהם. במחקר זה לא הייתה אינטראקציה אנושית ישירה, לא בוצע גיוס של משתתפים חדשים ולא נאסף מידע המזהה אנשים באופן אישי. כל ניתוח בוצע באמצעות מאגרי נתונים מחקריים הזמינים לציבור. כתוצאה מכך, ניתוח הנתונים המשני שלנו לא הצריך אישור אתי נוסף או סקירה של ועדת הלסינקי (IRB). המחקר בוצע בהתאם לנורמות מוסדיות הולמות השולטות בשימוש במאגרי נתונים זמינים לציבור, בהליכי מחקר אתיים ובמדיניות שימוש בנתונים רלוונטית.

מנגנון קשב צולב-מודאלי מבוסס-גרף הועסקה כדי ללמוד מאפייני רגש בין מודאליות שונות, תוך שימוש במאפיינים ספציפיים לרגש או למודאליות כדי לשפר את ההבנה. רכיב מיפוי חזותי רב-מבטים משמש לשיפור עיצוב אינטראקטיבי מודע-רגש בזמן אמת, ויעילותו מוערכת לצורך זיהוי רגשות. הממצאים מראים כי השיטה המוצעת משפרת הן את יכולת הפירוש והן את היעילות עבור ממשקי משתמש חכמים מודעי-רגש בעולם האמיתי. איור 1 מציג את זרימת העבודה הארכיטקטונית של העבודה המוצעת. איור 1 מציג את זרימת העבודה המלאה של מסגרת המיפוי החזותי המוצעת ללמידת מאפייני רגש מולטי-מודאליים בהקשר של מערכות אינטראקציה חכמות. זרימת העבודה מתחילה בשלוש מודאליות קלט מסונכרנות, קרי טקסט, אודיו ווידאו, הלוכדות מידע רגשי משלים מהמודאליות הלשונית, הפרוזודית ומביטויי הפנים, בהתאמה. מקודד transformer ספציפי-מודאלי מעבד כל מודאליות כדי להשיג ייצוגים ברמה גבוהה של נתוני הקלט הגולמיים. הייצוגים מוזנים לאחר מכן למודול למידת ייצוגים מופרדים (disentangled), שבו ההטמעות הספציפיות לרגש מופרדות מהמאפיינים הספציפיים למודאליות כדי להבטיח עקביות ברגשות הנלמדים ממקורות נתונים הטרוגניים. ההטמעות הספציפיות לרגש מכל מודאליות מאוגדות לאחר מכן על ידי רשת קשב צולב-מודאלית מבוססת-גרף, הממדלת את התלויות הרגשיות הבין-מודאליות ומקצה משקולות חשיבות דינמיות לכל מודאליות בהתבסס על הקשר האינטראקציה. לבסוף, המסגרת מספקת הן פלטי סיווג רגשות והן תובנות אינטראקטיביות, המאפשרות קבלת החלטות שקופה מודעת-רגש ועיצוב אינטראקציה חכם ואדפטיבי.

רכישת נתונים רב-מודאלית

מאגרי הנתונים CH-SIMS ו-CMU-MOSEI הם שני מאגרי נתונים מולטי-מודאליים קיימים בנחלת הכלל אשר אספו מידע מולטי-מודאלי, כגון וידאו, אודיו וטקסט מסונכרנים. מאגר הנתונים CH-SIMS כולל בדיקות מולטי-מודאליות של אנשים סינים, הכוללות 2,281 מקטעי וידאו, שנגזרו ממספר מקטעי וידאו מסרטים, דרמות טלוויזיוניות ותוכניות בידור. מחקרים על ניתוח מולטי-מודאלי של רגשות באמצעות נתונים מולטי-מודאליים הופכים למעניינים וישימים יותר הודות להוספת אודיו וטקסט תואמים למקטעי וידאו אלה. עם זאת, אחד ממאגרי הנתונים המולטי-מודאליים הגדולים ביותר לבחינת דעות, תחושות ורגשות הוא מאגר הנתונים CMU-MOSEI, שנאסף מיותר מ-23,000 קליפי וידאו של ביטויים שנאמרו על ידי יותר מ-1,000 דוברים במגוון נושאים. מאגר הנתונים חולק באופן אקראי לתתי-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) תוך שמירה על התפלגות המחלקות.

תמלולים טקסטואליים, אותות שמע ופריימים של וידאו נאספים ומסונכרנים באמצעות חותמות זמן כדי להתאים ברמה זמנית עדינה. אינטגרציה ברמת הפריים מבטיחה שלמידת הייצוג ומנגנוני המיזוג מבוססי הגרף המוצעים יוכלו למדל ולנצל במשותף תוכן רגשי הנובע מהבעות חזותיות, טוני פנימה ולשוניים ותוכן לינגוויסטי. חילוץ יעיל של דינמיקות רגשיות בין-מודאליות מתאפשר באמצעות טכניקה זו של רכישה רב-מודאלית, החיונית לעיצוב אינטראקציה אינטליגנטית ולמיפוי חזותי מובן.

טבלה 1 מציגה את המבנים המרכזיים של מאגרי הנתונים של רגשות רב-מודאליים ששימשו בשיטה המוצעת. כדי להשיג טווח רחב יותר של רגשות קשורים, כגון מילים מדוברות, אינטונציות קוליות והבעות פנים, CH-SIMS ו-CMU-MOSEI משלבים מודאליות של וידאו, אודיו וטקסט ממאגרי נתונים אלה. יתרה מכך, מספר מוגבל של דגימות נתונים זמינות ב-CH-SIMS, מה שמאפשר בחינה יסודית של אינטראקציות בין מודאליות ושונות רגשית בסין. מאידך, מאגר הנתונים CMU-MOSEI חשוב יותר להערכת העמידות של למידת הייצוג ואלגוריתמי הוויזואליזציה הקשורים הנידונים בעבודה זו, שכן הוא מכיל כמות גדולה של נתונים בשפות שונות, נושאים שונים ורמות רגש מתויגות. בנוסף, בהשוואה למחקרים קודמים, הוא מפחית קשיים בבחירת מידע בעת בדיקת מודלים.

עיבוד מקדים וסנכרון רב-מודאלי

הערות חותמת הזמן (timestamp) ממאגרי הנתונים CH-SIMS ו-CMU-MOSEI שימשו לסנכרון המודליות הטקסטואליות, השמיעתיות והחזותיות, כדי להבטיח למידה עקבית של ייצוג רב-מודאלי. כל הגייה (utterance) שימשה כיחידת הניתוח הבסיסית וקושרה למקטעי אודיו ווידאו תואמים בתוך אותו פרק זמן. הסנכרון בוצע ברמת ההגייה. התמלול חולק למקטעים בהתבסס על חותמות הזמן של תחילת וסיום כל הגייה. ההתאמה בין התמלול לאודיו ולוידאו נקבעה על ידי חילוץ פריימי הווידאו ואותות האודיו המתאימים שנפלו בתוך אותו פרק זמן. בעוד שמקטעי אודיו עובדו באמצעות Wav2Vec 2.0 להפקת ייצוגים אקוסטיים, פריימים חזותיים ממקטע הווידאו נדגמו בקצב שנקבע מראש וקודדו באמצעות Vision Transformer (ViT). המקודד RoBERTa שימש ליצירת שיכובים (embeddings) טקסטואליים מתמלולי ההגייה. סנכרון זמני הושג על ידי התאמת כל מאפייני המודליות לגבול הגייה יחיד, מכיוון ששלוש המודליות הפיקו רצפי מאפיינים באורכים משתנים. פורמט באורך קבוע שימש לנרמול של רצפים באורכים שונים. רצפים ארוכים יותר קוצרו לאורך הרצף המקסימלי המותר, בעוד שרצפים קצרים יותר עברו ריפוד באפסים (zero-padded). במהלך האימון, נעשה שימוש במסכי קשב (attention masks) כדי להפריד בין אלמנטים מרופדים לבין מיקומי מאפיינים לגיטימיים. שיכובים ספציפיים למודליות הוקרינו למרחב חבוי (latent space) משותף לפני האיחוד (fusion), וזאת כדי להתגבר על אורכי רצפים שונים בין המודליות. פעולה זו הבטיחה עקביות ממדית ואפשרה למנגנון הקשב מבוסס הגרף להקל על למידה מוצלחת של אינטראקציה חוצת-מודליות. כדי לשמור על איכות הנתונים ועל שלמות הסנכרון, דגימות עם קבצים פגומים, הערות חסרות או מידע מודאלי חלקי הוצאו מהמחקרים.

חילוץ מאפיינים מבוסס Transformer

שיטה של למידה עמוקה משמשת ללמידת ייצוגי תכונות ברמה גבוהה המודעים לרגשות מתוך מידע ממספר מודליות, כגון ראייה, שמע וטקסט, באופן מקצה לקצה לאחר סנכרון הנתונים הרב-מודליים וביצוע עיבוד מקדים נדרש. באמצעות שימוש במקודד transformer ללמידת ייצוגי תכונות מבחנים באופן אינטרינסי מנתונים רב-מודליים גולמיים, השיטה המוצעת מבטלת את הצורך בהנדסת תכונות. כדי להקל על העקביות בין מאגרי הנתונים המשמשים בגישה המוצעת, נלמד ייצוג (embedding) בגודל קבוע עבור כל מודליות. לדוגמה, ייצוגי תכונות במימד 768 נלמדים עבור כל אחת מהמודליות האינדיבידואליות, כולל מודליות של תמונה, שמע וטקסט, ויוצרים יחד מרחב תכונות מאוחד המשמש לאורך כל הגישה, ובפרט בגישת חילוץ תכונות המשמשת עבור מאגר הנתונים CH-SIMS המוצע ומאגר הנתונים CMU-MOSEI ללמידת תכונות ברמה גבוהה על פני נתונים בגדלים שונים.

מודאליות חזותית: Vision transformer עבור שיבוצי פריימים מודעי-רגש

מודל Vision Transformer (ViT-Base) שימש להפקת מידע חזותי מפריימים של וידאו במטרה להשיג ייצוגים מרחביים רלוונטיים לרגשות. לפני הפקת המאפיינים, הפרימים של כל מקטע וידאו הותאמו לגודל של (224 × 224) פיקסלים ונדגמו במרווחי זמן קבועים. באמצעות גודל פאץ' (patch) של 16 × 16 פיקסלים, ארכיטקטורת ה-ViT-Base מייצרת סדרה של טוקנים חזותיים המעובדים על ידי 12 שכבות מקודד טרנספורמר (transformer encoder). הייצוגים שהופקו ברמת הפריים הוקרנו למרחב שיכון (embedding space) ב-768 ממדים תוך שימוש במודל ViT מאומן מראש כשלד חזותי (visual backbone). השיכונים ברמת הפריים אוגדו באמצעות mean pooling כדי ליצור את הייצוג החזותי הסופי עבור כל מקטע. במהלך האימון, נעשה שימוש בנורמליזציה של תמונות ובשיטות הרחבה (augmentation) נפוצות, כגון חיתוך אקראי והיפוך אופקי, כדי לשפר את ההכללה. לאחר מכן, מסגרת מיזוג רב-מודאלית מוצעת שימשה לשילוב שיכונים חזותיים אלו עם ייצוגים טקסטואליים ושמיעתיים.

כדי לשמר דינמיקה זמנית ברגש, דגימות וידאו ממאגרי הנתונים CH-SIMS ו-CMU-MOSEI יידגמו באופן אחיד עבור המודליות הוויזואלית. את הפריימים של כל סרטון, figure-protocol-1, ניתן לחלק ל-N מקטעים בגודל קבוע, אשר לאחר מכן עוברים שיטוח והעברה הפוכה למרחב הטמעה חבוי (latent embedding space) בעל ממד figure-protocol-2. סדרה נוצרת על ידי הוספת הטמעות מיקומיות וטוקן קיבוץ למידה:

figure-protocol-3   (1)

כאשר figure-protocol-4  מייצג קידוד מיקומי ו-figure-protocol-5  היא מטריצת שיבוץ הפיסות (patch embedding matrix).

שכבות מקודד transformer מוערמות, המורכבות מרשתות feed-forward וממנגנון multi-head self-attention, משמשות לעיבוד רצף ה-patch המוטמע. הטרנספורמציה בשכבה l מתוארת כך:

figure-protocol-6   (2)

figure-protocol-7   (3)

כדי לקבל את וקטור המאפיינים החזותיים המודע לרגשות, המומצא השקול ל-class token נשלף כוקטור המאפיינים figure-protocol-8. כדי להבטיח ייצוגים חזותיים עקביים של רגשות למרות הבדלים בשפה ובתוכן בין מאגרי נתונים שונים, שילובים (embeddings) ברמת הפריים מכל מקטע וידאו ממוזגים כדי ללכוד הבעות פנים ואת התפתחות הרגש.

שימוש במודאליות שמע באמצעות Wav2Vec 2.0 עבור פרוסודיה והטמעות אקוסטיות סמנטיות הטמעות דיבור הקשריות הופקו באמצעות מקודד Wav2Vec 2.0 שאומן מראש כשלד האקוסטי. וקטור תכונות אקוסטי באורך קבוע עבור כל ביטוי התקבל על ידי אגרגציה של ייצוגי השכבות החבויות (hidden representations) באמצעות mean pooling. מודל Wav2Vec 2.0 שימש לחילוץ ייצוגים אקוסטיים מאותות שמע כדי ללכוד מאפייני דיבור הקשריים ורלוונטיים לרגש. לפני חילוץ התכונות, הקלטות השמע נורמלו ודגמו מחדש ל-16 kHz. כדי להבטיח סנכרון בין המודאליות הטקסטואלית והחזותית, כל מקטע שמע ברמת המבע (utterance) בודד באמצעות גבולות חותמת הזמן שסופקו באנוטציות של מערך הנתונים. המקודד האקוסטי שאומן מראש הותאם במהלך אימון המודל כדי לשפר את ההסתגלות למשימה הספציפית, מה שאפשר לייצוגים הנגזרים לייצג באופן מדויק יותר את ההיבטים הרגשיים של אותות הדיבור. לאחר מכן, בוצעו מיזוג תשומת לב חוצה-מודאליות מבוסס גרף (Graph-based cross-modal attention fusion) ולמידת ייצוגים מופרדים (disentangled representation learning) באמצעות הטמעות השמע הסופיות.

במודאליות השמע, נעשה שימוש ב-Wav2Vec-2.0 למידול אותות דיבור שנגזרו ממידע דיבור ראשוני במאגרי הנתונים CH-SIMS ו-CMU-MOSEI, תוך חילוץ ישיר של מאפייני שמע הקשורים לרגש. קיים קידוד מאפיינים קונבולוציוני עבור כל אות דיבור קלט figure-protocol-9:

figure-protocol-10   (4)

כאשר Z מייצג מאפיינים פרוזודיים ברמה נמוכה כגון מלודיה, טון ואנרגיה. רשת הקשר מבוססת-transformer מועילה למבנים שהוזכרו לעיל, ומייצגת תלויות זמן ארוכות-טווח:

figure-protocol-11   (5)

נתונים אקוסטיים פרוסודיים וסמנטיים, החיוניים להבעת רגש, נכללים בייצוגים אקוסטיים הקשריים אלה. השכבה האודיטוריים (audio embedding) באורך ספציפי נוצרת על ידי ביצוע הליך של איסוף זמני (temporal pooling):

figure-protocol-12   (6)

העיצוב נמנע משימוש במאפיינים אקוסטיים כגון MFCCs ומשיג עמידות באמצעות נתוני דיבור באנגלית מ-CMU-MOSEI ונתוני דיבור בסינית מ-CH-SIMS, וזאת על ידי הפקת ייצוגים מצורות גל בלבד.

מודליות טקסט באמצעות RoBERTa להטמעות רגשיות הקשריות

עבור המודליות הטקסטואלית, נעשה שימוש ב-RoBERTa, טרנספורמר דו-כיווני עמוק, על תמלילי הדיבור משני מערכי הנתונים כדי להפיק סמנטיקה הקשרית ומשמעות רגשית. מקודדי טרנספורמר מבוססי RoBERTa שימשו להוצאת ייצוגים טקסטואליים מנתוני התמלילים כדי ללכוד מידע סמנטי רגשי והקשרי. מודל RoBERTa מאומן מראש שימש עבור מערך הנתונים CMU-MOSEI בשפה האנגלית, בעוד שגרסת RoBERTa סינית שימשה עבור מערך הנתונים הסיני CH-SIMS כדי להתחשב טוב יותר במאפיינים לשוניים ספציפיים לשפה. עיבוד מקדמי של הטקסט כלל טוקניזציה באמצעות ה-tokenizer המתאים של RoBERTa לכל שפה ונורמליזציה של הטקסט. כדי להבטיח עיבוד אצוות (batch processing) עקבי, רצפי הקלט הומרו להטמעות טוקנים (token embeddings) וקיבלו ריפוד (padding) או נחתכו לאורך רצף מקסימלי שנקבע מראש. בהתאם לפורמט הקלט של RoBERTa, הוכנסו טוקנים מיוחדים לסיווג ולהפרדה. הטמעה טקסטואלית באורך קבוע הושגה על ידי אגרגציה של ייצוגי הטוקנים ההקשריים שהופקו על ידי מקודד הטרנספורמר, תוך שימוש בייצוג המשפט הסופי השקול ל-[CLS]. כדי להתאים את הייצוגים הנלמדים למשימת זיהוי הרגשות, מקודדי ה-RoBERTa המאומנים מראש עברו כוונון (refinement) באמצעות אימון רב-מודלי. לאחר מכן, מסגרת היתוך רב-מודלית המוצעת שימשה למיזוג ההטמעות הטקסטואליות עם המאפיינים האודיו-ויזואליים.

ניתן לשלב את שיכמודי האסימונים (token embeddings) ואת הקידודים המיקומיים עבור כל קלט שעבר טוקניזציה, figure-protocol-13, כדי ליצור את ייצוג הקלט בטכניקת הטרנספורמציה הדו-כיוונית העמוקה המוכרת כ-

figure-protocol-14   (7)

צורה זו מיוצגת באמצעות השכבות של ה-L transformer, המשתמש במנגנון self-attention כדי לגלות את תלויות ההקשר בין המילים:

figure-protocol-15  (8)

השיכון (embedding) של הרגש ההקשרי מתקבל באמצעות המצב החבוי הסופי של אסימון הסיווג:

figure-protocol-16   (9)

קיטוב רגשי, רגשות עזים והשלכות נלוות הם דוגמאות למאפיינים לשוניים הקשורים לרגשות שיוצגו על ידי שיכון (embedding) זה. RoBERTa מקלה על מידול שאינו תלוי בשפה. הדבר מאפשר למערכת להשתמש באותו גודל שיכון הן עבור טקסטים באנגלית ממאגר הנתונים CMU-MOSEI והן עבור טקסטים בסינית ממאגר הנתונים CH-SIMS.

שלושה וקטורי מאפיינים ספציפיים למודאליות בעלי 768 ממדים, עבור המודאליות הוויזואלית fv, השמעית fa והטקסטואלית ft , מופקים על ידי שלב למידת ייצוג המאפיינים העמוק המוצע. בתכנון האינטראקציה החכמה, ייצוגים נלמדים אלו יוצרים מרחב מאפיינים רב-מודאלי מאוחד המשמש כבסיס למיפוי ויזואלי ברמת המאפיינים, היתוך חוצה-מודאלי מבוסס גרפים ולמידת ייצוג מופרד (disentangled representation learning).

למידת ייצוגים מופרדים (Disentangled representation learning)

לאחר למידת ייצוג תכונות עמוק, עיבוד נוסף של וקטורי התכונות הרב-מודאליים מהמודאליות החזותית, השמיעתית והטקסטואלית יכול להניב תיאור רגש מופרד. אם השכבות (embeddings) של תכונות ספציפיות-למודאליות של המודאליות השמיעתית, החזותית והטקסטואלית ששימשו בשלב הקודם מיוצגות על ידי fv, fa ו-ft, בהתאמה, כך ש-figure-protocol-17 ו-figure-protocol-18, מטרתו של שלב זה היא לבצע פירוק (factorize) של כל תכונות המודאליות לשני תיאורים חבויים נפרדים, הכוללים את תיאורי הרגש לאחר התחשבות בסמנטיקה הקודמת של כל אחת מהמודאליות השונות.

דבר זה מושג על ידי הזנת מאפיין של כל מודאליות, fm , לשתי רשתות היטלה מקבילות: מקודד רגשות figure-protocol-19 ומקודד מודאליות figure-protocol-20, שבהם מופקים שני הקידודים.

figure-protocol-21  (10)

כאשר figure-protocol-22 המאפיין החבוי הקשור לרגש מיוצג על ידי figure-protocol-23 המייצג מאפיין חבוי ספציפי למודליות (modality). הדבר מאפשר להטמעות (embeddings) ספציפיות לרגש לתקשר עם מרחב באופן חוזר על פני מספר קלטים, כולל שמע, ויזואליה וטקסט, תוך שמירה על הנתונים המבניים הייחודיים הקשורים לכל מודליות.

הפרדה יעילה מושגת באמצעות שחזור עם אילוצי עצמאות. השחזור של מאפיין המודליות המקורי ניתן על ידי:

figure-protocol-24  (11)

כאשר figure-protocol-25 היא רשת פענוח (decoder network). הפסד השחזור משמר את הנתונים הבאים:

figure-protocol-26   (12)

בנוסף, אורתוגונליות, או דקורלציה, בין רגש לבין תיאורים ספציפיים למודליות מגבילה לעיתים קרובות את חפיפת המידע:

figure-protocol-27   (13)

על ידי השגת יעדים אלו, המודל עשוי ללמוד ייצוגי רגש שהם אמינים, מובנים ועמידים בפני שונות בין מודליות. מיזוג חוצה-מודליות מבוסס-גרף ומאפייני מיפוי חזותי מאוחרים יותר, במיוחד עבור עיצוב אינטראקציה חכמה, מסתמכים רבות על ייצוגי רגש מובנים וניתנים לפירוש.

עקביות רגשית בין מודליות

הוספת עקביות רגשית משפרת בבירור את יעילות המיזוג בין המודליות. זאת מכיוון שאסטרטגיות מיזוג אינן צריכות להתחשב בפערים גדולים בין שני הייצוגים, מאחר שהשיכובים (embeddings) הרגשיים הספציפיים למודליות חולקים מרחב חבוי. האיור המשולב של שני הרגשות מתואר באופן הבא figure-protocol-28. מיזוג משוקלל יהיה יציב יותר כאשר הייצוגים הספציפיים לרגשות הם עקביים, מכיוון ששינויים בין אותות ממודליות שונות לא ישפיעו יותר על התוצאה.

figure-protocol-29   (14)

על ידי אכיפת יישור סמנטי של מידע רגשי, מטרה זו ממזערת פערים בין מודליות שונות ומבטיחה שתפיסת הרגש תישאר עקבית ללא קשר למודליות המשמשת לביטויו. כתוצאה מכך, נוצר מרחב ייצוג רגשי וקוהרנטי על ידי השלכה של רמזים רגשיים שהתקבלו מאותות דיבור, הבעות פנים ותוכן לשוני.

השפעה על מיזוג רב-מודאלי (cross-modal fusion)

מיזוג רב-מודאלי (Cross-modal fusion) הופך ליעיל יותר כאשר מונהגת עקביות רגשית בין המודאליות השונות. מנגנוני המיזוג אינם נדרשים עוד לפצות על פערים משמעותיים בייצוגים הבין-מודאליים, מכיוון שהשיבוצים (embeddings) הספציפיים לרגש מיושרים במרחב חבוי (latent space) משותף. ייצוג הרגש הממוזג מוגדר באופן הבא:

figure-protocol-30  (15)

במקרה זה, αm מייצג את משקל התשומת לב המוקדש למודאליות m. מיזוג המשקולות הופך ליציב ומובן יותר כאשר הייצוגים הספציפיים לרגש הם עקביים, שכן תוצאת המיזוג מראה ראיות רגשיות משלימות במקום אותות מודאליות סותרים.

מבחינה מתמטית, הפחתת השונות בין סוגי ייצוגים שונים הספציפיים לרגשות ביחס ל-figure-protocol-31 figure-protocol-32  שקולה ל-:

figure-protocol-33   (16)

כאשר figure-protocol-34 מייצג את ביטוי הרגש הממוצע. שונות מופחתת גורמת לכך ששיטות הקלט ישוקללו בהתאם למשמעות הרגשית המדויקת שלהן ולא על פי רעש ממסרי, מה שמבטיח התכנסות משופרת של הרשת והערכת קשב מדויקת יותר.

מטרת הלמידה הסופית של ויזואליזציות רגשיות מופרדות (disentangled) היא לשלב פרגמנטציה, שחזור ואחידות רגשית:

figure-protocol-35   (17)

שני ההיפר-פרמטרים, λ1 ו-λ2, שולטים במערכת היחסים בין מהימנות רגשית חוצת-מודליות לבין דיסוציאציה. המודל המוצע רוכש ייצוגים רגשיים שאינם תלויים במודליות, ניתנים לפירוש וניתנים למיזוג כדי להשיג זאת, תוך דגש על אספקת בסיס איתן למיזוג מבוסס גרפים וייצוג ברמת התכונות בעיצוב ממשקים חכמים.

היתוך קשב חוצה-מודאליות מבוסס גרף

רשת קשב חוצת-מודליות מבוססת-גרף שימשה לסימולציה של קשרים רגשיים עדינים בין מודליות. כדי להקל על זרימת המידע בין המודליות, נבנה גרף רב-מודלי מחובר באופן מלא, שבו כל השכבה (embedding) הספציפית למודליות (טקסט, אודיו וויזואליה) מיוצגת כצומת בגרף. קשרי המודליות שימשו לקביעת מטריצת הסמיכות של הגרף, אשר שופרה לאחר מכן באמצעות שיטת קשב למידה. מרחב חבוי משותף נוצר על ידי שרשור והשלכה של הפלטים ממספר ראשי קשב. ייצוג רגשי רב-מודלי מאוחד הופק לאחר מכן על ידי ביצוע איגור (pooling) משוקלל-קשב של ייצוגי הצמתים. מודולי הניבוי והוויזואליזציה לניתוח מודע-אינטראקציה וזיהוי רגשות קיבלו לאחר מכן ייצוג ממוזג זה. למודול מיזוג-הגרף היה ממד ייצוג חבוי של 256 ושתי שכבות קשב של גרף, כאשר לכל אחת שמונה ראשי קשב. כדי לקבוע את החשיבות היחסית של מודליות סמוכות, חושבו מקדמי קשב בין צמתים מחוברים ואלו נורמלו באמצעות פונקציית softmax. לאחר כל שכבת קשב של גרף בוצעו נורמליזציה של שכבה (layer normalization), חיבורי שאריות (residual connections) ושימוש בשיעור dropout של 0.2 כדי להגביר את יציבות האימון ולהפחית התאמת-יתר (overfitting). לאחר שרשור והשלכה של פלטי מספר ראשי קשב למרחב חבוי משותף, שולבו ייצוגי הצמתים לשכבה רגשית רב-מודלית אחת באמצעות איגור משוקלל-קשב. לאחר מכן, הייצוג הממוזג שימש למיפוי ויזואלי רב-מבטי ולניבוי רגשות.

אינטראקציות רב-מודאליות מגוונות נלכדו באמצעות מנגנון קשב גרפי מרובה ראשים (multi-head graph attention). פונקציית softmax שימשה לנורמליזציה של מקדמי הקשב בין צמתים מחוברים עבור כל צומת. כדי להגביר את יציבות האימון ולמנוע התאמת יתר (overfitting), לאחר שכבות הקשב הגרפי המוערמות של מודול מיזוג הגרפים הוספו חיבורים שאריתיים (residual connections), נורמליזציית שכבות (layer normalization) והסדרת dropout.

נסמן את האיברים figure-protocol-36 כייצוגים התואמים לרגשות ספציפיים שנאספו ממודליות ויזואליות, קוליות וטקסטואליות; כל רכיב נמצא בתוך המרחב החבוי המשותף figure-protocol-37. המודלים עבור צומתי המודליות משתמשים בסימון עבור הגרף figure-protocol-38, כאשר הצמתים של האוסף figure-protocol-39 מתאימים לשלושת צומתי המודליות עצמם, וזאת כדי לחזק במפורש את התלויות הרגשיות המשותפות בין ייצוגי המודליות השונים.

לאחר הקצאת וקטור מאפיינים ספציפי לרגש לכל צומת בגרף, נקבל:

figure-protocol-40   (18)

בניגוד לשיטות היתוך מסורתיות, המשתמשות במשקולות היתוך קבועות או נקבעות מראש, השיטה המוצעת לומדת משקולות קצה אדפטיביות בהתבסס על חשיבותן והתלויות ההדדיות ביניהן, הן בין הערוצים והן בין מצבים רגשיים.

רשת קשב גרפית (GAT) משמשת למיזוג חוצה-מודאליות. מקדם קשב מחושב עבור כל צומת i והצמתים השכנים לו, כלומר, צומת j:

figure-protocol-41   (19)

ההשפעה הרגשית של מעבר ממצב j למודליות i נמדדת באמצעות המשקולות המנורמלות αij.

בשלב הבא, המראה הממוזג של כל צומת מודאליות מחושב כקיבוץ משוקלל של שכניו:

figure-protocol-42   (20)

כאשר פונקציית ההפעלה figure-protocol-43 היא לא ליניארית. בסופו של דבר, המאפיינים המעודכנים של כל צומת משולבים כדי להשיג ייצוג רגשי ממוזג גלובלי:

figure-protocol-44   (21)

זוהי טכניקה שימושית למידול רגשות ניתן לפירוש ולמיפוי חזותי עוקב, כיוון שהיא לוכדת מידע משלים ממודליות שונות תוך שימור מערכות יחסים בין-מודליות מורכבות.

אלגוריתם 1 (קובץ משלים 1) מספק את התרשים הכללי לביצוע מיזוג רב-מודאלי מבוסס גרף. בתחילה, נוצר גרף שבו מאפיינים ספציפיים לרגש מקושרים לכל אחת מהמודאליות החזותית, השמעית והטקסטואלית. לאחר מכן, מחושבים ציוני הקשב (attention scores) עבור זוגות צמתים בכל גרף, המייצגים את השילוב של התלות הרגשית. ציוני הקשב מנורמלים לאחר מכן כדי לציין את התרומה היחסית של כל מודאליות להקשר הרגשי המוגדר, מה שמאפשר למידה של משקלי הקשב. בשלב האחרון מופק הייצוג הווקטורי (embedding) הרגשי הכללי על ידי אגרגציה של המאפיינים הקשורים לצמתי הגרף. במובן זה, המיזוג הכללי של המאפיינים הרב-מודאליים המקושרים לרגשות המוגדרים כפי שמוצג באלגוריתם, מבטיח יכולות הסתגלות, פרשנות ואינטליגנציה הקשרית.

איור 2 מציג את המבנה ואת אופן הפעולה של רשת הקשב רב-מודאלית (cross-modal attention network) המוצעת למיזוג סנטימנטים רב-מודאלי. הייצוגים (embeddings) הספציפיים לרגש, שנגזרו באופן עצמאי עבור המודאליות של טקסט, שמע ווידאו, מועברים תחילה דרך מנגנוני קשב ברמת המודאליות, הלומדים את החשיבות היחסית של מידע לשוני, קולי ופני עבור הקשר רגשי נתון. הייצוגים של המודאליות המשוקללים לפי הקשב משולבים לאחר מכן ליצירת ייצוג רגשי מאוחד, שבו מטריצת הקשב לוכדת את התלות הבין-מודאלית ואת עוצמת האינטראקציה. מטריצת הקשב הנלמדת על ידי הרשת מווסתת באופן דינמי את התרומות של המודאליות השונות, ובכך מאפשרת לה להתמקד במודאליות ההדרכה החזקה ביותר תוך התעלמות ממודאליות רועשות ופחות אינפורמטיביות. ייצוג הרגש הממוזג מאפשר זיהוי מדויק של רגשות וניתוח ברזולוציה גבוהה של מצבים רגשיים כגון ניטרליות, חיבוק ודאגה.

מודול מיפוי ויזואלי

בעזרת סעיף המיפוי הוויזואלי, שנוצר במיוחד למטרה זו, מעצב אינטראקציה חכם יכול להמיר את הייצוג המאוחד של המצב הרגשי לצורה ויזואלית מובנת ונגישה לאחר תהליך היתוך חוצה-מודליות (cross-modal fusion), בהתבסס על הגרף.

כדי להקל על הבנת הייצוגים הרגשיים החבויים, נעשה שימוש בטכניקות להפחתת ממדיות כדי להציג חזותית את הטמעות (embeddings) הרגשיות הרב-מודאליות שנלמדו. לאחר הפחתת ממדיות התכונות תוך שמירה על רוב השונות באמצעות ניתוח רכיבים ראשיים (PCA), הוטמעו הייצוגים במרחב דו-ממדי לתצוגה באמצעות t-distributed Stochastic Neighbor Embedding (t-SNE). עבור t-SNE נעשה שימוש בערך perplexity של 30, קצב למידה של 200 ו-1,000 איטרציות אופטימיזציה. צבירים ספציפיים לרגשות ומערכות יחסים בין מודאליות הוצגו חזותית באמצעות ההטלות שהתקבלו. משקולות הקשב חוצות-מודאליות המנורמלות שהתקבלו מרשת הקשב מבוססת הגרף שימשו ליצירת מפות חום של קשב (attention heatmaps). התרומות היחסיות של המודאליות הטקסטואלית, השמעית והחזותית במהלך חיזוי הרגש מוצגות במפות חום אלו. מקדמי הקשב שנלמדו שימשו כמשקולות קשתים ליצירת גרפים של אינטראקציה חוצת-מודאליות, אשר אפשרו בחינה חזותית של יחסי גומלין בין מודאליות ושל זרימת מידע בתוך מסגרת ההיתוך. תרשימי מסלול רגשי נוצרו על ידי ניטור ההתפתחות של הטמעות רגשיות חבויות לאורך נאמרים עוקבים כדי לבחון דינמיקה רגשית זמנית. מסלולים אלו שופכים אור על האופן שבו מצבים רגשיים ותרומות מודאליות מתפתחים לאורך זמן. Matplotlib ו-Scikit-learn הן שתי חבילות Python ששימשו ליצירת כל הוויזואליזציות. כדי להעריך את יכולת הפירוש (interpretability), את היווצרות הצבירים, את תרומות המודאליות ואת הדינמיקה הרגשית הזמנית, נערכו ניתוחים איכותניים של ויזואליזציות ההטמעה, גרפי האינטראקציה ומפות החום של הקשב.

יהיה המשתנה figure-protocol-45 הייצוג המאוחד של המצב הרגשי על ידי פונקציית רשת תשומת הלב הגרפית (graph attention network). בניגוד להדמיה ברמת הפלט של גרפי המצב הרגשי, מטרתו העיקרית של המודול היא להמיר את ייצוגי המצב הרגשי ואת המשקולות התואמות של מנגנון תשומת הלב לצורה חזותית מובנת.

באמצעות αji שנלמד, נוצר מפת חום של קשב (attention heatmap) כדי לבחון באופן חזותי את התרומה של כל מודאליות. לאחר מכן, משקלי הקשב הנכנסים summed כדי לקבוע ציון חשיבות מורכב עבור כל מודאליות:

figure-protocol-46    (22)

כאשר si מייצג את התרומה הרגשית היחסית של מודאליות I. כדי לסייע ביצירת מפת חום של קשב (attention heatmap), הערכים שהתקבלו עוברים נרמול ומיפוי למפת צבעים המקלה על המשתמש לזהות את המודאליות הבולטת בנקודות זמן שונות או במצבים אינטראקטיביים שונים. באמצעות מודאליות קלט חזותיות, שמיעתיות או טקסטואליות שונות, ממשק כזה מסייע למשתמש להבין כיצד פועל מנגנון הקשב של המערכת.

הגרף הנלמד מומדל באופן ספציפי כ"גרף אינטראקציה משוקלל" כדי לייצג את התלות הרב-מודאלית (cross-modal) של רגשות אנושיים. המודאליות עצמה מיוצגת על ידי כל צומת בגרף, ועוצמת האינטראקציות המערבות רגשות אנושיים מיוצגת על ידי משקלות בצורה של αji על הקשתות המחברות ביניהם. הגרף המשוקלל לעיל ממחיש את עוצמת האינטראקציות הרגשיות האנושיות. ההגדרה של i ו-j היא:

figure-protocol-47   (23)

עובי הקו או השקיפות של ויזואליזציית הגרף מוצגים באופן הולם הודות למשקולות אלו. דבר זה מקל על הבנת האופן שבו המודליות מקיימות אינטראקציה. המעצב יכול להבין טוב יותר כיצד אינדיקטורים רגשיים מקיימים אינטראקציה במהלך תהליך ההיתוך בעזרת גרפים של אינטראקציה בין-מודלית.

ייצוגי הרגשות הממוזגים (emotion embeddings) figure-protocol-48 בשלבים שונים של הזמן מופחתים למרחב בעל ממד נמוך יותר באמצעות אלגוריתם להפחתת ממדיות כגון PCA או t-SNE, וזאת כדי להציג את התפתחות הרגשות לאורך זמן:

figure-protocol-49   (24)

כאשר פונקציית ההטלה מיוצגת על ידי figure-protocol-50. הופעתם של מסלולי רגש דו-ממדיים/תלת-ממדיים, המראים מעברים רגשיים, עוצמות ויציבות באינטראקציות, יכולה להתפרש כתיאור אינטואיטיבי של התפתחות מצבים רגשיים לאורך זמן. היבטים אלו יכולים לשמש לאינטראקציה חכמה, לקבלת החלטות ולניטור בזמן אמת.

בניגוד למערכות רגש קונבנציונליות המספקות אך ורק מיפויים למחלקות או לציונים מסוימים, מערכת זו מתמקדת בהדגמת האופן שבו רגשות אנושיים נוצרים בתוכה. היא חושפת את תהליך קבלת ההחלטות שלה באמצעות אספקת ויזואליזציות של מאפיינים ביניים, כולל גורמי שקלול, אינטראקציות בין מודלים והנתיבים התואמים להם. דבר זה מאפשר למשתמש להבין כיצד כל גורם — חזותי, קולי או לשוני — משפיע עליה ביצירת התגובות שלה לרגש אנושי.

מיפוי רגשות לצורות מובנות באמצעות ייצוגים חזותיים יכול לפיכך לגשר על הפער בין ניתוח רגשות באמצעות שיטות למידה עמוקה לבין שילובן בעיצוב ממשקים חכמים. ניתן יהיה להשתמש בנתונים שנאספו משתי הגישות כדי ליצור ממשקי משתמש מדויקים יותר. לפיכך, הגישה המוצעת יכולה לספק למעצבי אינטראקציה מידע חיוני ליצירת ממשקי משתמש מדויקים יותר. במילים אחרות, הבנת הרגש הופכת לחלק פעיל מאוד בעיצוב אינטראקציה. הדיוק יכול להגביר רק כאשר הבנת הרגש משולבת באופן פעיל בעיצוב האינטראקציה.

מודול המיפוי הוויזואלי מאפשר הסברתיות במספר דרכים מקושרות אך שונות: הסברתיות ברמת המאפיינים חושפת ייצוגים בסיסיים של רגש שנוצרו על ידי ה-DNN, ובכך מאפשרת לנו להבין את הסמנטיקה המשמשת לתיאור כל מאפיין הקשור לרגש; הסברתיות ברמת המודליות משתמשת בנתונים מגרפי האינטראקציה וממפות חום של קשב ויזואלי כדי לתאר כיצד כל מודליות – ויזואלית, שמעית או טקסטואלית – תורמת להחלטות שמתקבלות לצורך ביטוי רגשות; ולבסוף, המסלולים הנובעים מהטמעת הרגש (emotion embedding) מאפשרים לנו להבין כיצד כל מודליות ויזואלית וטקסטואלית משתנה לאורך זמן מנקודת מבט של אינטראקציה דינמית. אנא עיינו באלגוריתם 2 (Supplementary File 1).

מאפייני הרגש הרב-מודאליים הממוזגים ממופים לייצוגים משמעותיים מבחינה חזותית לצורך תכנון אינטראקציה חכמה באמצעות אלגוריתם המיפוי החזותי המוצע, Algorithm 2. משקלי הקשב הרב-מודאליים מבוססי-גרף משמשים לכימות ההבדלים בין האלמנטים החזותיים, השמעיים והטקסטואליים של הקלט בכל שלב של זמן. הבדלים אלו ממופים לאחר מכן לייצוגים חזותיים כדי להבליט את המקורות העיקריים המשפיעים על הרגשות באמצעות אלמנטים חזותיים של מפות חום (heatmap). כדי לספק מבט מעמיק על האינטראקציה בין אלמנטי הקלט ולהעביר את התפתחות הרגש הנוצרת על ידי האלמנטים הרב-מודאליים של הקלט, המערכת מחשבת לאחר מכן עוצמות אינטראקציה זוגיות ליצירת משקלי אינטראקציה רב-מודאליים. במקביל, נוצר מבט של התפתחות רגשית על ידי מיפוי אלמנטים רגשיים ממוזגים שנאספו לאורך זמן אל תוך מרחב בעל ממד נמוך, כדי להפיק התפתחות רציפה של אלמנטים רגשיים.

ניבוי רגשות ומשוב אינטראקטיבי

התוצאה של ייצוג הרגש הממוזג, המיוצגת כ-figure-protocol-51, משמשת לאחר מכן כפונקציה הן עבור משוב אינטראקטיבי והן עבור ניבוי רגשות. יתרה מכך, ניבוי רגשות מתואר כמודל רב-משימתי הכולל משימת רגרסיה לזיהוי רציף של עוצמת הרגש ומשימת סיווג לזיהוי רגשות בדידים. מודל הסיווג הבא, המבוסס על softmax, משמש לזיהוי רגשות בדידים:

figure-protocol-52   (25)

כאשר  figure-protocol-53 מייצג את ההסתברויות הצפויות של מחלקת הרגש, ו-Wc  ו-bc הם אילוצים למידיים. הפסד אנטרופיה צולבת (cross-entropy loss) מנוצל כדי לשפר את מטרת הסיווג:

figure-protocol-54  (26)

כאשר yk הוא התג של ערך האמת (ground-truth), ו-K הוא מספר מחלקות הרגש. ענף רגרסיה משמש להערכת עוצמת הרגש במקביל, ומפיק תחזית של מאפייני רגש רציפים שונים, כולל valence ו-arousal. תן לו את ההגדרה הבאה:

figure-protocol-55   (27)

כאשר ציון עוצמת הרגש הצפוי מסומן על ידי figure-protocol-56. הפסד שגיאה ריבועית ממוצעת (Mean-squared error loss) משמש לשיפור משימת הרגרסיה:

figure-protocol-57   (28)

באופן כללי, שתי המשימות משולבות ביעד החיזוי:

figure-protocol-58   (29)

שבה המטרות של רגרסיה וסיווג מאוזנות על ידי λ. הדבר מרמז על שינוי דינמי של מודול הוויזואליזציה בהתבסס על מצב הרגש שזוהה, כדי לאפשר סוג זה של משוב המודע לאינטראקציה. הקשרי האינטראקציה בזמן t נתון מיוצגים על ידי ct. התגובה של מודול הוויזואליזציה מסופקת על ידי:

figure-protocol-59    (30)

כאשר פונקציית התאמת הוויזואליזציה מיוצגת על ידי figure-protocol-60. דבר זה מאפשר להתאים את מפות החום של המודליות, את גרפי האינטראקציה ואת מסלולי הרגשות בזמן אמת, בהתבסס על שינויים ורגשות צפויים. הדבר מעיד על כך שהמערכת מספקת תמיכה משמעותית למשוב, בנוסף לביצועים טובים בחיזוי מצבי רגש.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו מתקפת את מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים (multimodal), הן במונחים של יכולת פירוש מודעת-אינטראקציה והן במונחים של ביצועים חיזויים, תוך שימוש בשני מאגרי נתונים ייחוסיים, CH-SIMS ו-CMU-MOSEI. על פי תוצאות ניסיוניות, הגישה המוצעת מציגה ביצועים עקביים וטובים יותר משיטות זיהוי רגשות רב-מודאליות קיימות במגוון מדדים, כולל מתאם (correlation), דיוק (accuracy), F1-score וטעות מוחלטת ממוצעת (MAE). ייצוג הרגש המופרד (disentangled), מנגנון ההיתוך הבין-מודאלי מבוסס-גרף ואסטרטגיית למידת הייצוג העמוקה מקצה לקצה, כולם תורמים לשיפור זה על ידי אפשור מידול רגשי יציב יותר ומיושר סמנטית. הגישה המוצעת מספקת תובנות עשירות יותר ברמת המאפיינים באמצעות מיפוי ויזואלי, דבר החורג מעבר לרווחים כמותיים ומקל על הבנת התרומות של המודאליות השונות והדינמיקה הרגשית. למרות הבדלים בשפה, בביטוי תרבותי ובגודל מאגרי הנתונים, שיפור הביצועים הנ"ל נצפה באופן עקבי בשני מאגרי הנתונים, דבר המדגים את יכולת ההכללה החזקה של המסגרת המוצעת.

בעבודה המוצעת נעשה שימוש במאגרי הנתונים הציבוריים CH-SIMS ו-CMU-MOSEI עבור רגש רב-מודאלי (multimodal emotion). מאגר הנתונים CH-SIMS כולל 2,281 קטעי וידאו מסרטים, דרמות טלוויזיוניות ותוכניות בידור. ב-CH-SIMS זמינים נתוני טקסט, אודיו וויזואליה מסונכרנים. תוויות סנטימנט חד-מודאליות ורב-מודאליות מסווגות לקטגוריות חיובית, ניטרלית ושלילית. מאגר הנתונים הרב-מודאלי הגדול בשפה האנגלית, הידוע כ-CMU-MOSEI, מכיל כ-23,453 קטעי וידאו מתויגים הכוללים למעלה מ-1,000 דוברים הדנים במגוון רחב של נושאים. מאגר נתונים זה מכיל הן התוויות רציפות של עוצמת רגש, כגון valence ו-arousal, והן תוויות רגש קטגוריות. באמצעות תמיכה במגוון תנאים לשוניים, תרבותיים ורגשיים, ניסויים בשני מאגרי נתונים אלה באמצעות המסגרת המוצעת מחזקים את החוסן והאמינות. Table 2 מציג את פרטי סביבת הסימולציה.

הגדרות הניסוי וההטמעה העיקריות ששימשו להערכת המסגרת המוצעת מסוכמות בסביבת סימולציה זו. כדי להבטיח ממדיות מאפיינים אחידה בין המודליות הטקסטואליות, השמעיות והחזותיות, מיושמים מקודדים מבוססי transformer באופן אחיד. המערכת משתמשת במנגנון קשב מבוסס גרף לצורך היתוך בין-מודאלי, המאפשר למידה אדפטיבית של תלויות בין-מודאליות בנוגע למצבים רגשיים.

המסגרת המוצעת מחלצת ייצוגים טקסטואליים, שמיעתיים וחזותיים באמצעות מקודדי מודאליות (modality encoders) מבוססי transformer. שכבות מחוברות באופן מלא (fully connected layers) עם הפעלת ReLU מקרינות את ההטמעות הספציפיות למודאליות אל מרחב חבוי משותף. לאחר מכן, נעשה שימוש במקודדים נפרדים ספציפיים לרגש וספציפיים למודאליות, שכל אחד מהם כולל שתי שכבות מחוברות באופן מלא עם הפעלה לא ליניארית ונורמליזציה, כדי ללמוד ייצוגים מופרדים (disentangled representations). הייצוגים החבויים מקורנים למרחב תכונות בעל 256 ממדים, שבו מידע עבור כל מודאליות ורגש נלמד בנפרד. כדי לשמר את מידע המודאליות ולקדם הפרדה יעילה, נעשה שימוש במפענחי שחזור (reconstruction decoders). לפני מיזוג רב-מודאלי וחיזוי, מודול קשב חוצה-מודאליות מבוסס גרף ממדל תלויות רגשיות בין המודאליות באמצעות הייצוגים החבויים. הרשת אומנה באמצעות אופטימייזר Adam עם קצב למידה ראשוני של 1 × 10⁻4 וגודל batch של 32. נעשה שימוש בעצירה מוקדמת (early stopping) על בסיס הפסד האימות כדי למנוע התאמת יתר (overfitting). פונקציית המטרה הכוללת כללה הפסדי סיווג, שחזור ועקביות ייצוגים, כאשר כל אחד מהם שוקלל על ידי היפר-פרמטרים הניתנים לכוונון. אימון המודל הורץ עד ל-100 epochs, והמודל בעל הביצועים הטובים ביותר על קבוצת האימות נשמר לצורך בדיקה.

המסגרת המוצעת הוערכה באמצעות מדדי סיווג, כולל Accuracy, Precision, Recall ו-F1-score, יחד עם מדדי רגרסיה כגון Mean Absolute Error (MAE). ערכי ה-Precision, ה-Recall וה-F1-score חושבו באמצעות macro-averaging כדי להתחשב בחוסר איזון בין המחלקות בקטגוריות הרגש. עבור ניסויי הסיווג, תוויות הרגש/סנטימנט שהוגדרו מראש במאגרי הנתונים CH-SIMS ו-CMU-MOSEI שימשו כמחלקות ה-ground-truth. עבור חיזוי סנטימנט מבוסס רגרסיה, ציוני עוצמת הסנטימנט הרציפים במאגרי הנתונים שימשו כמשתני המטרה. מטריצות בלבול (Confusion matrices) הופקו כדי לנתח את ביצועי החיזוי לכל מחלקה ואת דפוסי הסיווג השגוי ברווח סמך של 95%. כדי להבטיח חוסן, כל ניסוי חזר על עצמו 5 פעמים באמצעות אתחולים אקראיים שונים, והתוצאות המדווחות תואמות לביצועי הממוצע ±± סטיית התקן על פני כל ההרצות. מובהקות סטטיסטית הוערכה באמצעות הליכי בדיקת השערות מתאימים, ורווחי סמך חושבו במידת הצורך. זמן האימון נמדד כסך הזמן שחלף עד להגעה להתכנסות המודל על פלטפורמת החומרה המוגדרת.

ניתן להשוות מספר מודלי בסיס מייצגים, כולל מיזוג מוקדם (early fusion) ומיזוג מאוחר (late fusion), עם השיטה המוצעת: TFN, שיטות מבוססות LSTM, מודלי מיזוג מולטי-מודאליים בדרגה נמוכה (low-rank), טרנספורמרים מולטי-מודאליים אדפטיביים, וארכיטקטורות חדשות המבוססות על קשב חוצה-מודאלי (cross-modal attention). מודלי בסיס אלו משקפים טכניקות חלוציות המתמקדות בעיקר בשיפור דיוק זיהוי הרגשות באמצעות שיטות מיזוג שונות. לעומת שיטות אלו, המתרכזות בעיקר בחיזוי ברמת הפלט, למידת הייצוג המופרד (disentangled representation learning) והמיזוג מבוסס הגרף של המסגרת המוצעת משפרים את יכולת הפירוש (interpretability) ואת המודעות לאינטראקציה. דוגמאות למודלי בסיס שיושמו באמצעות המאגרים הרשמיים שלהם או מימושי ייחוס הזמינים לציבור כוללות את LSTM Fusion, TFN, מיזוג מולטי-מודאלי בדרגה נמוכה (LMF), Adaptive-Graph וטכניקות מבוססות טרנספורמר. כאשר היו זמינים, נעשה שימוש בהגדרות ההיפר-פרמטרים המקוריות של המחברים. כל מודלי הבסיס שעברו אימון מחדש הוערכו באמצעות אותן חלוקות של מערכי הנתונים, טכניקות עיבוד מקדמי, פרמטרי אופטימיזציה ומדדי הערכה, כדי להבטיח השוואה הוגנת. טבלאות ההשוואה מציינות בבירור את המקורות הרלוונטיים עבור נתונים שנלקחו ישירות מפרסומים קודמים.

דיוק

דיוק סיווג הרגשות הבדידים נמדד הן עבור CH-SIMS והן עבור CMU-MOSEI; עם זאת, מגמת הדיוק שונה בהתאם למאפיינים של שני מאגרי הנתונים. מכיוון ש-CH-SIMS הוא מאגר נתונים בגודל בינוני עם מספר שווה של קטגוריות רגש וסרטוני וידאו שעברו עיבוד מקדים קפדני, רמת הדיוק שלו גבוהה, מה שמעיד על כך שהמודל יכול ללכוד מידע רגשי רב-מודאלי עדין עם מעט רעש. מנגד, סיווג מדויק של רגשות הוא מאתגר במקרה של CMU-MOSEI, שכן זהו מאגר נתונים רחב-היקף עם דוברים מרקעים מגוונים. לכן, בנוסף ליכולתו של המודל לזהות רגש, הדיוק במאגר הנתונים CMU-MOSEI מעיד על יכולתו להכליל ולעמוד במגוון תרחישי אינטראקציה. השיפור בדיוק בשני מאגרי הנתונים מראה כי הגישה המוצעת מכלילה היטב על פני מאגרי נתונים בשפות שונות, בגדלים שונים וברמות מורכבות רגשית שונות.

דיוקי הסיווג של הגישה המוצעת ומספרי בסיס (baselines) נפוצים אחרים על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצגים בטבלה 3. כפי שמוצג בטבלה 3, המסגרת המוצעת השיגה את הדיוק הגבוה ביותר הן במאגר הנתונים CH-SIMS והן במאגר הנתונים CMU-MOSEI, ועקפה את מספר הבסיס החזק ביותר (Adaptive-Graph) בכ-3.3% ו-3.1 נקודות אחוז, בהתאמה. ערכי סטיית תקן נמוכים יותר מעידים גם על יציבות רבה יותר לאורך הרצות ניסיוניות חוזרות. לגישות מסוג LSTM-fusion מסורתיות יש דיוק נמוך יותר בשל יכולתן המוגבלת ללכוד קשרי צלב-מודאליים (cross-modal) מורכבים. TFN ו-LMF משפרים את דיוק הסיווג על ידי מידול של קשרי צלב-מודאליים.

מדד F1

בבעיות של סיווג רגשות, האיזון בין ה-recall (רגישות) לבין ה-precision (דיוק) נמדד באמצעות מדד ה-F1-score. לכן, הוא מתאים יותר עבור מאגרי נתונים לסיווג רגשות מולטי-מודאליים, שסביר להניח שיכילו מספר לא שווה של דגימות בכל מחלקה. במשימות של סיווג רגשות, האיזון בין ה-recall ל-precision נמדד באמצעות ה-F1-score. כיוון שמאגרי נתונים לסיווג רגשות מולטי-מודאליים צפויים להיות לא מאוזנים, ה-F1-score הוא המדד המתאים יותר. ככל שהמודל מסוגל לזהות את מחלקות הרגשות טוב יותר, כך ה-F1-score יהיה גבוה יותר.

איור 3 ממחיש את הערכת מדד ה-F1-score של הטכניקה המוצעת בהשוואה למודלי הבסיס (baselines) על מערך הנתונים CH-SIMS. היכולת של מודל הבסיס המבוסס על LSTM למדל מערכות יחסים רגשיות מורכבות בין מודליות נחשפת באמצעות מדד ה-F1-score הנמוך ביותר שלו. מדדי ה-F1-score שהושגו על ידי הטכניקות שנבחנו במערך הנתונים CH-SIMS מוצגים להשוואה באיור 3. כפי שהודגם, מבנים מתוחכמים יותר המבוססים על גרפים וטרנספורמרים משיגים בדרך כלל ביצועים טובים יותר משיטות מיזוג (fusion) קונבנציונליות יותר. מודל ה-LSTM הציג את התוצאה הנמוכה ביותר עם F1-score של 0.71, ואחריו TFN (0.74) ו-LMF (0.76). מדד ה-F1-score עלה עוד ל-0.79 בשימוש ב-Adaptive-Graph, מה שמעיד על הערך של מידול קשרים בין-מודליים. עם F1-score של 0.82, המסגרת המוצעת עלתה בביצועיה על Adaptive-Graph ב-3.8%, על LMF ב-7.9%, על TFN ב-10.8% ועל LSTM ב-15.5%. ממצאים אלו מראים כי מנגנון הקשב הבין-מודלי המבוסס על גרפים ולמידת הייצוג המופרד (disentangled representation learning) המוצעים לוכדים באופן יעיל יותר מידע רגשי משלים על פני מודליות טקסטואליות, קוליות וחזותיות, מה שמוביל לביצועי סיווג טובים יותר.

המגמות היחסיות עקביות, למרות שכל השיטות מראות ירידה קלה ב-F1-score בהשוואה ל-CH-SIMS, כפי שמוצג ב-איור 4. הממצאים מראים שיפור עקבי בביצועים משיטות היתוך (fusion) מסורתיות לאסטרטגיות למידה רב-מודאליות מבוססות גרפים. המודלים עם ה-F1-score הנמוך ביותר היו LSTM (0.69), TFN (0.72) ו-LMF (0.74). ביצועי מודל ה-Adaptive-Graph עלו ל-0.77, מה שמדגים עד כמה ניתן למדל קשרים חוצי-מודאליות (cross-modal) בצורה טובה. המסגרת המוצעת עלתה בביצועיה על כל שאר הגישות, והשיגה את ה-F1-score הגבוה ביותר של 0.80. התרומות של למידת ייצוג רגשות מופרד (disentangled emotion representation learning) ומנגנון קשב חוצה-מודאליות מבוסס גרפים ללכידת רמזים רגשיים משלימים בין מודאליות טקסטואלית, אקוסטית וויזואלית, מודגמות על ידי השיפור לעומת בסיס ההשוואה החזק ביותר, Adaptive-Graph. תוצאות אלו מראות כי המסגרת המוצעת לזיהוי רגשות רב-מודאלי היא אמינה ויעילה. הגישה המוצעת מדגימה שיפור משמעותי הן לעומת הגישה מבוססת הגרפים והן לעומת שיטת ההיתוך הקונבנציונלית, מה שמאשש עוד יותר את יכולת ההכללה החזקה של השיטה. השיפור ב-F1-score במערך הנתונים CMU-MOSEI מדגים כי הגישה המוצעת יכולה להשיג ביצועי סיווג רגשות מאוזנים גם בסביבות רועשות ומגוונות.

דיוק

במערכות תקשורת חכמות, הדיוק (precision) הוא קריטי מכיוון שאות רגשי שגוי עלול לפגוע בחוויית המשתמש. היחס בין המקרים שבהם חזוי במדויק רגש מסוים לבין המספר הכולל של המקרים שנחזו כרגש זה נקרא דיוק. מכיוון שייצוגי הרגש המופרדים (disentangled emotion representations) פחות רועשים ופחות נוטים לסיווג שגוי במודאליות, המודל המוצע משיג ביצועים טובים יותר מהמודלים הבסיסיים על מערך הנתונים CH-SIMS באיור 5.

באיור 5 מוצגת השוואה של רמת הדיוק שהושגה על ידי מספר טכניקות לזיהוי רגשות מולטי-מודאלי במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. ככל שהמודלים עוברים מטכניקות מסורתיות מבוססות מיזוג (fusion) לארכיטקטורות מורכבות יותר מבוססות גרפים, הדיוק עולה בהדרגה. המסגרת המוצעת השיגה את הדיוק המקסימלי של 0.82 במאגר הנתונים CH-SIMS, כאשר הדיוק עלה מ-0.71 עבור LSTM ל-0.74, 0.76 ו-0.79 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. במאגר הנתונים CMU-MOSEI, הדיוק עלה מ-0.69 עבור LSTM ל-0.72, 0.74 ו-0.77 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. הגישה המוצעת השיגה את הדיוק הגבוה ביותר של 0.80. המסגרת המוצעת הגבירה את הדיוק בכ-3.8% ב-CH-SIMS וב-3.9% ב-CMU-MOSEI בהשוואה לבסיס ההשוואה החזק ביותר (Adaptive-Graph). ממצאים אלה מראים כי על ידי לכידת מידע רגשי משלים על פני מודליות טקסטואליות, אקוסטיות וויזואליות, למידת הייצוג המופרד (disentangled representation learning) ומנגנון התשומת לב cross-modal מבוסס הגרפים המוצעים מפחיתים בהצלחה תחזיות חיוביות שגויות (false-positive). השפעתה של מודליות לא רלוונטית מומטמת עוד יותר על ידי התשומת לב ה-cross-modal מבוססת הגרפים. הגיוון המוגבר של הדוברים והביטויים הלשוניים בבסיס הנתונים של CMU-MOSEI גורם לירידה קלה בדיוק עבור כל המודלים.

היזכרות

במשימות של זיהוי רגשות, recall (הזכר), מדד ליכולתו של מודל לסווג כראוי מקרים רגשיים השייכים למחלקה ספציפית, הוא קריטי מכיוון שחוסר במידע רגשי עלול להשפיע לרעה על איכות האינטראקציה. ערך recall גבוה יותר מעיד על כך שהמודל מזהה פחות שליליים שגויים (false negatives) ויותר ביטויים רגשיים ממשיים. ניתן להתייחס ל-recall כאל מדד ליעילות שבה מופק מידע רגשי מטקסט, אודיו וערוצים חזותיים בהקשר של ניתוח רגשות רב-מודאלי (multimodal).

היתרון של הטכניקה המוצעת על פני גישות הבסיס במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצג בהשוואת ה-recall באיור 6. ככל שהמודלים מתפתחים משיטות מיזוג קונבנציונליות למבנים מולטי-מודאליים מתוחכמים יותר המבוססים על גרפים, התוצאות מראות עליות עקביות ב-recall. ה-recall במאגר הנתונים CH-SIMS עלה מ-0.70 עבור LSTM ל-0.73, 0.75 ו-0.78 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה; ה-recall המקסימלי של 0.82 הושג על ידי המסגרת המוצעת. הגישה המוצעת השיגה את ה-recall הטוב ביותר של 0.80 במאגר הנתונים CMU-MOSEI, שבו ה-recall עלה מ-0.68 עבור LSTM ל-0.71, 0.73 ו-0.76 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. המסגרת המוצעת הניבה שיפורים יחסיים של כ-5.1% ב-CH-SIMS ו-5.3% ב-CMU-MOSEI בהשוואה לגישת הבסיס החזקה ביותר (Adaptive-Graph). תוצאות אלו מראות כי על ידי לכידת רמזים רגשיים משלימים על פני מודליות טקסטואליות, אקוסטיות וויזואליות, למידת הייצוג המופרד (disentangled representation learning) ומנגנון ה-cross-modal attention מבוסס הגרפים המוצעים מפחיתים בהצלחה תחזיות שליליות שגויות (false-negative), ובכך משפרים את הזיהוי של מחלקות הרגש בשני מאגרי הנתונים. מאחר שלשיטות מסורתיות יש יכולת מוגבלת למדל מערכות יחסים מורכבות בין מודליות, נטייתן היא לערכי recall נמוכים יותר. על ידי מידול מפורש יותר של מערכות היחסים בין המודליות, TFN ו-LMF משיגים שיפורים מתונים. על ידי סימולציה של מערכות היחסים המובנות בין המודליות, שיטת ה-Adaptive-Graph שיפרה עוד יותר את ה-recall. עבור שני מאגרי הנתונים, השיטה המוצעת משיגה את ה-recall הגבוה ביותר, מה שמעיד על יכולתה הטובה יותר לזהות מקרים רגשיים בתרחישי אינטראקציה שונים. השיפור ניכר יותר במאגר הנתונים הגדול CMU-MOSEI, מה שמוכיח את החוסן וההכללה של המסגרת המוצעת.

טעות מוחלטת ממוצעת (MAE)

טעות מוחלטת ממוצעת (Mean Absolute Error - MAE) משמשת להערכת הביצועים של משימות חיזוי רציפות של עוצמת רגש, כגון חיזוי valence או arousal. בניגוד לדיוק (accuracy), MAE משקף טוב יותר את הקרבה של עוצמת הרגש החזויה למצב הרגשי בפועל. זו הסיבה ש-MAE מתאים יותר למאגרי נתונים כגון CH-SIMS ו-CMU-MOSEI, הכוללים תוויות רגשיות רציפות. ערך MAE נמוך יותר מעיד על דיוק רב יותר בחיזוי עוצמת הרגש.

השוואת ה-MAE בין המסגרת המוצעת לבין גישות הבסיס במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצגת ב-Table 4. שיטות מיזוג מסורתיות המבוססות על LSTM נוטות להציג ערכי MAE גבוהים יותר בשל יכולתן המוגבלת למדל תלויות רגשיות מולטי-מודאליות מורכבות. ה-TFN וה-LMF יכולים להפחית את ה-MAE על ידי מידול אינטראקציות מולטי-מודאליות, וגישת ה-Adaptive-Graph מפחיתה אותו עוד יותר באמצעות למידת יחסי גרף בין מודאליות. המסגרת המוצעת משיגה את ה-MAE הנמוך ביותר בשני מאגרי הנתונים, מה שמעיד על הערכה מדויקת יותר של עוצמת הרגש. ראוי לציין כי השיפור משמעותי יותר במאגר הנתונים CMU-MOSEI, שבו השונות בנתונים רחבי ההיקף ותנאי הדוברים הופכים את משימת הניבוי למאתגרת יותר.

מטריצת בלבול עבור מערך הנתונים CH-SIMS

שיטות הבסיס של early fusion LSTM ו-TFN מראות בלבול משמעותי בין מחלקות הרגשות הניטרליים והחיוביים, על פי מטריצות הבלבול עבור מערך הנתונים CH-SIMS. דבר זה מרמז כי שיטות אלו אינן יעילות מספיק בזיהוי ביטויים רגשיים מולטי-מודאליים עדינים. לעומת זאת, השיטה המוצעת מראה בבירור דומיננטיות אלכסונית חזקה, עם מעט מאוד איברים מחוץ לאלכסון, ובכך משפרת את הפרדה בין המחלקות. מנגנון למידת הרגשות המופרדת (disentangled emotion learning) של השיטה המוצעת מבטיח ייצוג עקבי של רגשות בין מודאליות שונות, וגישת מיזוג הגרפים שלה משפרת את ההבחנה בין מחלקות רגש בעלות קשר הדוק. איור 7A–E מציג את מטריצת הבלבול עבור מערך הנתונים CH-SIMS עם שיטות בסיס שונות.

מטריצת בלבול עבור מערך הנתונים CMU-MOSEI

המסגרת המוצעת משתמשת בייצוגים (embeddings) של רגשות שאינם תלויים באופן המודאליות ובמשקולות קשב אדפטיביות כדי להפחית באופן משמעותי את שיעור הסיווג השגוי, במיוחד עבור קלטים בעמימות רגשית. הדבר מאשש כי המסגרת המוצעת פועלת היטב במגוון תרחישים של אינטראקציות רב-מודאליות בקנה מידה גדול. בשל גודל מערך הנתונים, השונות בין הדוברים והטבע הרציף של תוויות הסנטימנט, מטריצות הבלבול של CMU-MOSEI מראות שיעור סיווג שגוי כולל גבוה יותר. שיטות הבסיס (baseline) מראות מידה ניכרת של בלבול בין קטגוריות רגש שונות. איור 8A–E מציג את מטריצת הבלבול עבור מערך הנתונים CMU-MOSEI עם שיטות בסיס שונות.

זמן אימון לכל epoch

הטרייד-אופים החישובים של טכניקות היתוך מולטי-מודאליות מתקדמות מודגשים על ידי השוואת זמן האימון לכל epoch. בשל מקודדי ה-transformer ומנגנוני תשומת לב גרפיים (graph attention), המודל המוצע דורש זמן אימון מעט ארוך יותר מאשר גישות היתוך פשוטות, אך עלייה זו אינה בלתי מעשית. המסגרת המוצעת הדגימה ביצועים חזקים במאגרי נתונים בנצ'מרק של ניתוח רגשות מולטי-מודאלי, ומראה פוטנציאל לשילוב במערכות אינטליגנטיות של אינטראקציה בין אדם למכונה. עם זאת, ההתאמה לפריסה בזמן אמת לא הוערכה במחקר הנוכחי ומצריכה חקירה נוספת באמצעות ניתוחים של שיהוי (latency), תפוקה (throughput), זיכרון ופריסה. ראוי לציין כי יציבות ההתכנסות המשופרת והביצועים העדיפים בניבוי ובפרשנות הופכים את העלות החישובית הנוספת למשתלמת. איור 9 מראה את תוצאת זמן האימון לכל epoch עבור השיטה המוצעת.

ניסוי אבלציה

כדי לקבוע את השפעתו של כל מרכיב מרכזי במסגרת המוצעת, כגון מודול המיפוי הוויזואלי, מיזוג צולב-מודאלי מבוסס גרף וייצוג רגשי מופרד (disentangled), נערך ניתוח אבלציה (ablation study). כדי להבין את ההשפעה, כל מרכיב הוסר בנפרד. על פי תוצאות הניסוי, אסטרטגיית מיזוג הגרף משפרת את מידול התלות הצולבת-מודאלית, ותרומתו של הייצוג הרגשי המופרד היא החשובה ביותר ליציבות הביצועים. תפקידו העזר של מודול המיפוי הוויזואלי הוכח על ידי ההשפעה הקלה שיש לו על הביצועים בעת הסרתו. תוצאות ניתוח האבלציה תחת אותם תנאי אימון והערכה מוצגות ב-Table 5. הידרדרות הביצועים המשמעותית ביותר נצפתה לאחר הסרת מודול הקשב הצולב-מודאלי מבוסס הגרף, אשר הפחית את הדיוק מ-81.72% ל-77.88% ואת מדד ה-F1-score מ-0.823 ל-0.776. דבר זה מדגיש את החשיבות של מידול אינטראקציות מורכבות בין המודאליות. תפקידו של מודול למידת הייצוג המופרד בלמידת ייצוגים חסונים הספציפיים לרגש הוכח על ידי העובדה שהסרתו הפחיתה את הדיוק ב-2.78 נקודות אחוז ואת ה-F1-score ב-0.032. היתרון המרכזי של מודול המיפוי הוויזואלי הוא יכולת הפירוש (interpretability) ולא דיוק הסיווג, כפי שמעידה הירידה הקלה יותר בביצועי הניבוי בעת הסרתו. תצורת ה-Basic Fusion הניבה את הביצועים הגרועים ביותר, מה שמוכיח כי ביצועי זיהוי רגשות מולטי-מודאליים מיטביים דורשים את ההשפעה המשולבת של כל המודולים המוצעים.

זמינות נתונים:

מערכי הנתונים ששימשו במחקר זה הם מערכי נתוני ייחוס (benchmark) הזמינים לציבור. מערך הנתונים CMU-MOSEI מסופק על ידי ה-Multimodal SDK של אוניברסיטת קרנגי מלון ומתואר ב-Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), והגישה אליו זמינה בכתובת https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. מערך הנתונים CH-SIMS מתואר ב-Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) וניתן להשגה באופן פומבי דרך משאבים שסיפקו המחברים, כולל https://github.com/thuiar/MMSA. כל הניסויים בוצעו באמצעות הגרסאות הרשמיות של מערכי נתונים אלו. הנתונים הגולמיים שהופקו, קבצי הנתונים המעובדים, תוצרי עיבוד מקדים, חלוקות לאימון/תיקוף/בדיקה, ייצוגי מאפיינים נגזרים ופרטי מימוש התומכים בממצאי מחקר זה זמינים לציבור במאגר Zenodo בכתובת https://doi.org/10.5281/zenodo.21124921.

figure-results-1
איור 1: תרשים סכמטי של מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים. איור מושגי של הארכיטקטורה הכוללת, המציגה את רכיבי מיצוי המאפיינים הרב-מודאליים, למידת ייצוג מופרד (disentangled representation learning), מיזוג תשומת לב חוצה-מודאלי מבוסס גרף, ורכיבי מיפוי ויזואלי לצורך ניתוח רגשי רב-מודאלי ניתן לפירוש.. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

figure-results-2
איור 2: תרשים זרימה סכמטי של הפרוטוקול החישובי המוצע.
ייצוג מושגי של צינור העיבוד מקצה לקצה, הכולל את שלבי רכישת מערך הנתונים, עיבוד מקדים, חילוץ מאפיינים ספציפיים למודליות, מיזוג רב-מודאלי, ויזואליזציה וחיזוי רגשות אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-3
איור 3: השוואת ביצועי F1-score במערך הנתונים CH-SIMS. ערכי F1-score ממוצעים שהתקבלו מחמישה הרצות ניסיוניות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעי אקראיות (random seed). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD). ערכי F1-score גבוהים יותר מעידים על ביצועי סיווג רגשות טובים יותר. אנא לחץ כאן כדי להציג גרסה מורחבת של איור זה.

figure-results-4
איור 4: השוואת ביצועי F1-score במערך הנתונים CMU-MOSEI. ערכי F1-score ממוצעים שהתקבלו מחמש הרצות ניסיוניות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעים אקראיים (random seeds). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD), וערכי ה-mean ±± SD המתאימים מוצגים מעל כל נקודת נתון. ערכי F1-score גבוהים יותר מעידים על ביצועי סיווג רגשות טובים יותר. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-5
איור 5: השוואת דיוק במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. ציוני דיוק ממוצעים שהושגו על ידי LSTM, TFN, LMF, Adaptive-Graph והמסגרת המוצעת לאורך חמישה הרצות ניסוייות עצמאיות (n = 5). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD) שחושבה מהרצות חוזרות עם אתחולים שונים של זרעי אקראיות (random seed). המסגרת המוצעת משיגה את הדיוק הגבוה ביותר בשני מאגרי הנתונים, מה שמעיד על הבחנה משופרת בין מחלקות רגש באמצעות למידת מאפיינים מולטי-מודאלית יעילה ומיזוג חוצה-מודאלי מבוסס גרף. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

figure-results-6
איור 6: השוואת Recall במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. ציוני recall ממוצעים שהושגו על ידי LSTM, TFN, LMF, Adaptive-Graph והמסגרת המוצעת לאורך חמישה הרצות ניסיוניות עצמאיות (n = 5). סטיות התקן מציינות ±± סטיית תקן אחת (SD) שנגזרה מניסויים חוזרים. המסגרת המוצעת משיגה באופן עקבי את ה-recall הגבוה ביותר בשני מאגרי הנתונים, מה שמעיד על יכולת עליונה בלכידת מידע רגשי רב-מודאלי והפחתת תחזיות שגויות מסוג false-negative. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-7
איור 7: מטריצת בלבול עבור סט הנתונים CH-SIMS עם שיטות בסיס שונות. השורות תואמות למחלקות הרגש של ה-ground-truth, והעמודות תואמות למחלקות שנחזו. ערכי התאים מייצגים את אחוז הדגימות שנורמלו ביחס לכל מחלקה אמיתית. מטריצת הבלבול חושבה באמצעות חלק הבדיקה המופרד של CH-SIMS. אחוזים גבוהים יותר באלכסון מעידים על דיוק זיהוי טוב יותר עבור קטגוריית הרגש התואמת. מטריצות בלבול של (A) Early fusion LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph, ו-(E) השיטה המוצעת על סט הנתונים CH-SIMS. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-8
איור 8: מטריצת בלבול עבור מערך הנתונים CMU-MOSEI עם שיטות בסיס שונות. השורות מייצגות תוויות רגש בפועל והעמודות מייצגות תוויות שנחזו. הערכים מדווחים כאחוזים מנורמלים לפי מחלקה על קבוצת הבדיקה של CMU-MOSEI. המטריצה ממחישה הן דגימות שסווגו נכון (ערכי האלכסון) והן בלבול בין קטגוריות רגש (ערכים מחוץ לאלכסון). מטריצת בלבול ב-CMU-MOSEI (A) LSTM עם מיזוג מוקדם, (B) TFN, (C) LMF, (D) גרף אדפטיבי, ו-(E) השיטה המוצעת על מערך הנתונים CMU-MOSEI. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-9
איור 9השוואה של זמן האימון לכל תקופה (epoch) במאגרי נתונים רב-מודאליים של רגשות המשמשים כבנצ'מרק.
זמן האימון הממוצע לכל תקופה (epoch) שהתקבל מ- חמישה הרצות ניסיוניות עצמאיות (n = 5) עבור מאגרי הנתונים CH-SIMS ו-CMU-MOSEI תחת הגדרות חומרה ותוכנה זהות. פסי השגיאה מייצגים ±± סטיית תקן אחת (SD) חושבו מניסויים חוזרים תוך שימוש באתחולים שונים של זרעים אקראיים (random seed). ערכים נמוכים יותר מעידים על יעילות חישובית גבוהה יותר, בעוד שזמני אימון יציבים בין הרצות מעידים על שיפור ביכולת השחזור ובעקביות האימון. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

מערך נתוניםשיטות טיפולמספר דגימותשפהתוויות רגש/סנטימנט
CH-SIMS34וידאו, אודיו, טקסט2,281 מקטעי וידאוסיניתתוויות רגש רב-מודאליות וחד-מודאליות (שלילי, ניטרלי, חיובי)
CMU-MOSEI35וידאו, אודיו, טקסט~23,453 קטעים מתויגיםאנגליתתוויות של סנטימנט ועוצמת רגש (רציפות וקטגוריאליות)

טבלה 1: תיאור מערכי הנתונים. סיכום של מערכי הנתונים ששימשו במחקר זה, המודליות, מספר הדגימות, השפה, ותוויות הרגש/סנטימנט עבור מערכי הנתונים CH-SIMS ו-CMU-MOSEI.

רכיבמפרט
מסגרת תכנותPython עם PyTorch
מחלץ מאפיינים חזותייםVision Transformer (ViT)
מחלץ מאפיינים קולייםWav2Vec 2.0
מחלץ מאפייני טקסטRoBERTa
אסטרטגיית היתוךרשת קשב רב-מודאלית מבוססת גרף
ממד מאפיינים768 לכל מודאליות
אופטימיזטור אימוןAdam
קצב למידה1.00E-04
גודל אצווה16
חומרהNVIDIA GPU (למשל, סדרת RTX)
מאגרי נתונים להערכהCH-SIMS, CMU-MOSEI
ממד חבוי2.56E+02
ממד שיכון768
פונקציית הפעלהReLU
אופטימיזטורAdam
קצב למידה1.00E-04
גודל אצווה32
איטרציות (Epochs)100
עצירה מוקדמתפעיל
פונקציית הפסדסיווג + שחזור + עקביות

טבלה 2: סביבת הסימולציה. הגדרות הניסוי של סביבת הסימולציה ופרטי המימוש, כגון מפרטי המודל, מאפיינים, אופטימייזר והחומרה שבה נעשה שימוש.

שיטהדיוק CH-SIMS (%)דיוק CMU-MOSEI (%)
LSTM (Early/Late Fusion)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
השיטה המוצעת81.72 ± 0.6179.94 ± 0.69

טבלה 3: הערכת דיוק השיטה המוצעת אל מול טכניקות בסיס במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. התוצאות מדווחות כממוצע ±± סטיית תקן שהתקבלו מחמישה הרצות ניסוייות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעי אקראיות (random seed). כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה במאגרי הנתונים הרלוונטיים כדי להבטיח השוואה הוגנת.

שיטהCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (מיזוג מוקדם/מאוחר)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
השיטה המוצעת0.298 ± 0.0070.341 ± 0.008

טבלה 4: תוצאה של טעות מוחלטת ממוצעת. התוצאות מדווחות כממוצע ±± סטיית תקן שהתקבלו מחמישה הרצות ניסוייות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעים אקראיים. כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה עבור מערכי הנתונים שלהן כדי להבטיח השוואה הוגנת. השוואה של MAE לניבוי רציף של עוצמת רגש באמצעות המסגרת המוצעת וגישות בסיס בשני מערכי הנתונים.

גרסת מודלדיוק (%)F1-score
מודל מלא81.72 ± 0.610.823 ± 0.008
ללא הפרדה (Disentanglement)78.94 ± 0.740.791 ± 0.010
ללא מיזוג גרף (Graph Fusion)77.88 ± 0.810.776 ± 0.011
ללא מיפוי חזותי80.11 ± 0.660.807 ± 0.009
מיזוג בסיסי74.91 ± 0.980.742 ± 0.013

טבלה 5: תוצאות מחקר אבלציה עם שיטות בסיס. התוצאות מדווחות כממוצע ±± סטיית תקן שהתקבלו מחמישה הרצות ניסוייות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעים אקראיים. כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה במאגרי הנתונים שלהן כדי להבטיח השוואה הוגנת. השוואה של ביצועים בין גרסאות המודל, המצביעה על יעילות הלמידה מייצוגים מופרדים (disentangled representations), מיזוג מבוסס גרף ומודול המיפוי הוויזואלי.

קובץ משלים 1: אלגוריתם 1 ואלגוריתם 2.אנא לחצו כאן להורדת קובץ זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הממצאים הניסיוניים מדגימים כי במאגרי הנתונים CH-SIMS ו-CMU-MOSEI, מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים עולה בביצועיה על טכניקות נוכחיות לזיהוי רגשות רב-מודאלי. בהשוואה למודלים של מיזוג מוקדם ומאוחר, כגון EF-LSTM ו-TFN, הטכניקה המוצעת משיגה דיוק גבוה יותר ומדדי F1 Scores גבוהים יותר, דבר המעיד על חסינותה בטיפול במידע רגשי מגוון. ניתן לייחס את השיפור בשיטה לייצוג הרגש המופרד (disentangled), המדכא רעש ספציפי למודאליות ומבטיח עקביות רגשית בין המודאליות הוויזואלית, השמעית והטקסטואלית36.

לאחרונה, מודלים מולטי-מודאליים מבוססי transformer, כגון Adaptive Multimodal Transformers37 ו-MIAR38, הראו תוצאות מרשימות במידול תלויות חוצות-מודאליות. עם זאת, מודלים אלה עוסקים בעיקר בחיזוי וחסרים מנגנונים התומכים בפרשנות ברמת המאפיינים. לעומת זאת, המערכת המוצעת משלבת קשב חוצה-מודאלי מבוסס גרף עם מודול מיפוי ויזואלי, מה שמאפשר ניתוח שקוף של האינטראקציות בין המודאליות לרגשות. זהו היבט קריטי החסר כעת בספרות, שבה הסקת מסקנות רגשית נתפסת כתהליך של "קופסה שחורה".

המסגרת המוצעת הדגימה ביצועים עקביים על פני מערכי הנתונים של CH-SIMS ו-CMU-MOSEI. בעוד שלמסגרת עשויות להיות יישומים פוטנציאליים באינטראקציה חכמה בין אדם למכונה, ניטור רפואי, סביבות למידה אדפטיביות ומערכות אחרות המודעות לרגשות, המחקר הנוכחי העריך את השיטה רק תחת תנאי benchmark מבוקרים. לא בוצע פריסה בעולם האמיתי, הערכת ממשק משתמש, מחקר שמישות או הערכה של נבדקים אנושיים. לכן, היעילות המעשית של המסגרת בסביבות תפעוליות עדיין דורשת בדיקה. עבודה עתידית תתמקד בהערכות מכוונות-פריסה, מחקרים ממוקדי-משתמש, ניתוח השהיה (latency), הערכת צריכת זיכרון וביצועי אינטראקציה בזמן אמת.

יתרה מכך, השיפורים בביצועים על פני מאגרי נתונים מגוונים מבחינה תרבותית ולשונית מדגימים את תקפות המסגרת המוצעת. בניגוד לעבודות קודמות שתוקפו בוצע על מאגר נתונים בודד או תרחיש אינטראקציה ספציפי, המסגרת המוצעת מראה ביצועים חסונים על פני שפות, דוברים וביטויים רגשיים שונים. לפיכך, המסגרת המוצעת מתאימה מאוד למערכות אינטראקציה חכמות מעשיות הדורשות זיהוי רגשות מדויק וקבלת החלטות ניתנת לפירוש.

הפרשנות של המסגרת המוצעת הוערכה באמצעות ניתוח מבוסס ויזואליזציה של הייצוגים הרב-מודאליים שנלמדו. באופן ספציפי, נבחנו שיבוצי רגשות חבויים (latent emotion embeddings), מפות קשב חוצות-מודאליות, גרפים של אינטראקציה בין מודאליות ומסלולי רגש זמניים, כדי לספק תובנות לגבי תהליך קבלת ההחלטות של המודל ותרומת המודאליות השונות. מטרתו של מודול המיפוי הוויזואלי היא להגביר את השקיפות על ידי מתן אפשרות לצפייה באינטראקציות ברמת המאפיינים ובדינמיקה רגשית. עם זאת, מדדי פרשנות פורמליים, הערכות נאמנות לקשב (attention-faithfulness) ומחקרי משתמשים לא נכללו בעבודה הנוכחית. לפיכך, יש לפרש את יתרונות הפרשנות המדווחים כראיות מבוססות ויזואליזציה ולא כמדדי הסבריות שתוקפו הוכח כמותית.

מנקודת מבט תיאורטית, מחקר זה תורם את הדברים הבאים למחשוב רגשי מולטי-מודאלי: הוא מציע דרך שיטתית למידול רגשות המבדילה בבירור בין ייצוגים ספציפיים לרגש לבין ייצוגים ספציפיים למודאליות. על ידי הבטחת עקביות רגשית בין מודאליות שונות במרחב חבוי משותף, המסגרת המוצעת מקדמת את התיאוריה של למידת ייצוגים במערכות מולטי-מודאליות. השילוב של מנגנוני קשב מבוססי גרף מעגן באופן פורמלי יותר את התלויות בין המודאליות השונות בביטוי רגשות.

מנקודת מבט מעשית, המסגרת המוצעת מועילה מאוד לעיצוב אינטראקציה חכמה ולממשקי משתמש מודעי-רגש. מודול המיפוי הוויזואלי במסגרת המוצעת מאפשר למתכנני מערכות להבין את ההשפעה של מודליות שונות על חיזוי רגשות, דבר החשוב מאוד עבורם. המסגרת המוצעת מועילה מאוד ליישומים כגון סוכני שיחה רגשיים, מערכות למידה אדפטיביות, ממשקי ניטור רפואיים ופלטפורמות להערכת חווית משתמש.

עם זאת, למסגרת המוצעת ישנן מספר מגבלות. השימוש במנגנוני תשומת לב גרפיים (graph attention mechanisms) ובמקודדי טרנספורמר (transformer encoders) מוסיף מורכבות, שעלולה להיות בעייתית עבור מכשירים בעלי יכולות מוגבלות. יתרה מכך, המחקר הנוכחי מתעלם מאותות פיזיולוגיים אחרים, כגון EEG ומעקב עיניים, לטובת התמקדות במודליות חזותית, קולית וטקסטואלית. היעילות החישובית של המסגרת המוצעת לצורך פריסה בזמן אמת לא הוערכה באופן ספציפי, למרות העובדה שהיא השיגה ביצועי ניבוי תחרותיים ויכולת ויזואליזציה משופרת. מחקרים עתידיים יבחנו ביצועי פריסה בהקשרי אינטראקציה חכמה בעולם האמיתי, עיכוב בהסקה (inference delay), קיבולת עיבוד (throughput), צריכת זיכרון וטכניקות לדחיסת מודלים. כדי לשפר עוד יותר את דיוק מידול הרגשות ואת התגובתיות של האינטראקציה, מחקרים עתידיים יתמקדו בפיתוח מודלים קלילים, טכניקות אופטימיזציה לזמן אמת ושילוב של מודליות נוספות. ביצועי פריסה בזמן אמת לא הוערכו, והשילוב של מקודדי טרנספורמר ושיטות תשומת לב מבוססות גרפים מעלה את המורכבות החישובית. רק מערכי הנתונים הבנצ'מרק CH-SIMS ו-CMU-MOSEI שימשו לתיקוף המתודולוגיה, דבר שעלול להוביל להטיות ספציפיות למערכי הנתונים ולהגביל את היכולת להכליל את התוצאות לדומיינים, שפות ואוכלוסיות משתמשים אחרים. בנוסף, המחקר הנוכחי אינו כולל אותות פיזיולוגיים כמו נתוני EEG או מעקב עיניים; תחת זאת, הוא מתמקד במודליות חזותית, קולית וטקסטואלית. למרות שתיאורים מפורטים של המימוש ושל סביבת הסימולציה שיפרו את יכולת השחזור, קוד המקור ומודלים מאומנים מראש אינם זמינים כעת לציבור.

בעבודה זו נעשה שימוש במסגרת מיפוי חזותית חדשנית ללמידת מאפייני רגש רב-מודאליים עבור עיצוב אינטראקציה חכמה. השיטה המוצעת משלבת למידת ייצוג מבוססת transformer מקצה לקצה, מידול רגשות מופרד (disentangled emotion modeling) ותשומת לב חוצת-מודאליות מבוססת גרף, וזאת כדי להשיג דיוק חיזוי ופרשנות גבוהים. ניסויים על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI מראים כי המסגרת המוצעת עולה בביצועיה על מודלים קיימים של זיהוי רגשות רב-מודאליים מבחינת דיוק ומדד F1-score. חשוב מכך, פתרון המיפוי החזותי המוצע מגשר על הפער שבין זיהוי רגשות לבין אסטרטגיית אינטראקציה, ומציע כיוון חדש לעיצוב של מערכות מחשוב רגשי רב-מודאליות המודעות לאינטראקציה וניתנות לפרשנות.

כדי להקל על עיצוב אינטראקציה חכם וניתן לפירוש, מחקר זה הציג מסגרת מיפוי ויזואלית חדשנית ללמידה של מאפייני רגש רב-מודאליים. המערכת המוצעת משלבת בהצלחה זיהוי רגשות ויכולת פירוש בתוך ארכיטקטורה אחת, על ידי שילוב של חילוץ מאפיינים רב-מודאליים מבוסס-transformer, למידה של ייצוג רגשי מופרד (disentangled), היתוך קשב חוצה-מודאליות מבוסס-גרף, ושיטות מיפוי ויזואלי. בנוסף למתן ייצוגים ויזואליים ברורים של תרומות המודאליות, אינטראקציות חוצות-מודאליות ודינמיקה רגשית זמנית, הערכה ניסיונית על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI הראתה ביצועים משופרים לעומת שיטות בסיס מייצגות במספר מדדים, כולל Accuracy, Precision, Recall, F1-score ו-Mean Absolute Error (MAE). עם זאת, מחקרי פריסה בעולם האמיתי, הערכות ממוקדות-משתמש, הערכות כמותיות של יכולת ההסבר ושילוב של מודאליות פיזיולוגיות אינם כלולים במחקר זה, המוגבל להערכות על שני מאגרי נתוני ייחוס. יתרה מכך, סביבות עם משאבים מוגבלים עלולות להיתקל בקשיים בשל העלות החישובית של מקודדי transformer ותהליכי קשב מבוססי-גרף. בעוד שעבודות עתידיות יתמקדו בתיקוף נרחב יותר על מאגרי נתונים שונים, שילוב של מודאליות נוספות, מחקרי שמישות, שחרור משאבים ניתנים לשחזור ואופטימיזציה לתרחישי פריסה בזמן אמת, המסגרת המוצעת מראה באופן כללי את הפוטנציאל של ניתוח רגשות רב-מודאלי וניתן לפירוש עבור מחשוב רגשי (affective computing) ויישומי אינטראקציה חכמה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי עניינים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מעוניינים להודות על התמיכה שניתנה על ידי בית הספר לדיור, בנייה ותכנון, Universiti Sains Malaysia, פנאנג, מלזיה, ובית הספר לאמנות העיצוב, Changsha University of Science & Technology, צ'אנגשה, סין. כמו כן, המחברים מביעים את הערכתם ל-Xiamen Academy of Arts and Design, Fuzhou University, שיאמן, סין, על תמיכתם האקדמית והמחקרית לאורך עבודה זו.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adamספריית PyTorch Optimizerhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Learning Rate = 1 × 10-4)אופטימיזציה של פרמטרים במהלך אימון המודל
CH-SIMSמאגר הנתונים המקוריהגרסה הציבורית האחרונהסט נתוני ייחוס (Benchmark) לניתוח רגשות/סנטימנטים רב-מודאלי בסינית
CMU-MOSEIמאגר CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (הגרסה הציבורית האחרונה)סט נתוני ייחוס (Benchmark) לזיהוי סנטימנטים ורגשות רב-מודאליים
Disentangled Emotion Encoderמימוש מותאם אישיתhttps://pytorch-geometric.readthedocs.io/en/latest/(ארכיטקטורת Dual Encoder)הפרדה בין ייצוגים חבויים (latent representations) ספציפיים לרגש וספציפיים למודאליות
Graph Attention Network (GAT)PyTorch GeometricMulti-head GAT (https://pytorch-geometric.readthedocs.io/en/latest/)מידול קשרים רגשיים חוצי-מודאליות ומיזוג מאפיינים אדפטיבי
Graph-Based Cross-Modal Attention Layerמימוש מותאם אישיתמיזוג Multi-Head Attentionלמידה של תלויות רגשיות ברזולוציה גבוהה בין מודאליות
Matplotlibפרויקט Matplotlib3.7+יצירת תרשימים ואנליזה ויזואלית
NetworkXפרויקט NetworkX3.0+בנייה וויזואליזציה של גרפים של אינטראקציות חוצות-מודאליות
NVIDIA GPUתאגיד NVIDIAGPU תומך CUDAהאצה של אימון רשתות טרנספורמר ורשתות עצביות גרפיות
Principal Component Analysis (PCA)Scikit-learnsklearn.decomposition.PCAהפחתה ראשונית של ממד השכבות (embeddings) הרגשיות רב-ממדיות
PythonPython Software Foundation3.8+שפת התכנות המרכזית להטמעת מסגרת ניתוח הרגשות הרב-מודאלית
PyTorchPyTorch Foundation2.0+פיתוח, אימון ואופטימיזציה של רשתות עצביות עמוקות
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, 768-dim embeddings)חילוץ ייצוגי רגשות לשוניים וסמנטיים בהקשר
Seabornפרויקט Seaborn0.12+יצירת מפות חום של קשב (attention heatmaps) וויזואליזציות סטטיסטיות
t-distributed Stochastic Neighbor Embedding (t-SNE)Scikit-learn
scikit-learn.org (Perplexity = 30, Iterations = 1000)
ויזואליזציה של אשכולות רגשיים חבויים ומסלולים
Ubuntu LinuxCanonical Ubuntu20.04 LTS או גרסה מאוחרת יותרסביבת הרצה ניסויית
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, 768-dim embeddingsחילוץ ייצוגים ויזואליים מודעי-רגש מתוך פריימים של וידאו
Wav2Vec 2.0Meta AI ResearchBase Model, 768-dim embeddingsחילוץ מאפייני רגש אקוסטים וקוליים בהקשר

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

TransformerDisentangled Representation

מאמרים קשורים