מאמר מחקר

שחזור וסינתזה של סגנון אמנותי של דגמים של מורשת תרבותית בלתי מוחשית באמצעות מסגרת למידה עמוקה המונחית על ידי סגמנטציה סמנטית

DOI:

10.3791/71577

14 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר תהליך עבודה של למידה עמוקה עבור סגמנטציה סמנטית, שחזור וסינתזה של סגנון אמנותי עבור דגמים של מורשת תרבותית בלתי מוחשית, תוך שימוש בחילוץ תכונות מבוסס transformer, שחזור אדברסרי ויצירת תמונות בעלת התאמה מרחבית, וזאת כדי לתמוך בשימור דיגיטלי וביישומי מורשת יצירתיים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השימור והשחזור הדיגיטלי של דגמים של מורשת תרבותית בלתי מומשית (ICH) זוכים לתשומת לב גוברת עם התקדמותן של טכניקות סינתזת תמונות מבוססות למידה עמוקה. גישות קיימות המבוססות על SegCycle-SPADE הדגימו פוטנציאל לסגמנטציה מבנית ושחזור אמנותי של דגמי מלאכה מסורתיים; עם זאת, נותרו מגבלות, הכוללות גיוון מוגבל של מערכי נתונים, שילוב לא מספק של סמנטיקה תרבותית, ושימור לא מספק של מאפייני דגם מבניים במהלך השחזור. כדי להתמודד עם אתגרים אלו, מחקר זה מציע מסגרת SegCycle-SPADE משופרת לסגמנטציה סמנטית ושחזור אמנותי של סוגי דגמי ICH. מודל סגמנטציה מבוסס Transformer, בשם SegFormer, מועסק כדי לזהות במדויק גבולות מוטיבים ואזורי דגמים. בנוסף, מוצג מודול Cross-Attention Cultural Feature Fusion לשיפור מוטיבים בעלי חשיבות תרבותית ולשיפור ייצוג המאפיינים. תרגום ושחזור של דגמים מבוצעים באמצעות CycleGAN, בעוד ש-Spatially-Adaptive Denormalization (SPADE) משמש לסינתזה של סגנון אמנותי כדי לשמור על עקביות סמנטית בין מפות הסגמנטציה לתמונות הנוצרות. כדי לשפר את הכללליות של המודל ואת הגיוון האמנותי, המסגרת מאומנת באמצעות מערך הנתונים של מוטיבים תרבותיים של Miao Batik ומערך הנתונים WikiArt. תוצאות ניסיוניות מדגימות כי מסגרת ה-SegCycle-SPADE המוצעת, המונחית על ידי attention, משפרת את דיוק הסגמנטציה ואת ביצועי שחזור דגמי המורשת בהשוואה לשיטות שחזור קיימות המבוססות על רשתות יריב גנרטיביות (GAN). המסגרת המוצעת מספקת פתרון ניתן להרחבה לתיעוד מורשת תרבותית, שחזור והחייאה אמנותית של עיצובי דגמים מסורתיים בסיוע בינה מלאכותית.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מורשת תרבותית, הכוללת הן אלמנטים בלתי מוחשיים כגון מנהגים, שפות ואמונות, והן אלמנטים מוחשיים כגון יצירות אמנות, מבנים ורישומים כתובים, היא ביטוי בסיסי של ההיסטוריה, היצירתיות והזהות האנושית1. שימור מורשת שואף לאפשר לקהילות להתחבר מחדש למקורותיהן ומאפשר לדורות הבאים להפיק תועלת מהזיכרון התרבותי הקולקטיבי שלהם. הוא גם מקדם הבנה בין-תרבותית, הערכה של מסורות ומנהגים מגוונים, והכרה בנרטיבים היסטוריים שונים. נכסים תרבותיים אלו עוזרים לנו להבין את הערכים, נקודות המבט והחוויות של דורות קודמים ותורמים לגיבוש זהויות חברתיות עכשוויות ולהמשכיות תרבותית. העקרונות הבסיסיים של שימור מורשת תרבותית מומחשים באיור 1.

דיאגרמת מסגרת SegCycle-SPADE; כוללת את SegFormer, CycleGAN ו-SPADE לשחזור תמונות.
איור 1. סקירה רעיונית של שחזור דפוסי מורשת תרבותית באמצעות מסגרת SegCycle-SPADE. איור סכימטי של הגישה המוצעת לשחזור והעשרה של דפוסי מורשת תרבותית בלתי מוחשית. זרימת העבודה כוללת איסוף נתונים ממאגרי הנתונים Miao Batik ו-WikiArt, עיבוד מקדימה של תמונות, סגמנטציה סמנטית באמצעות SegFormer-B2, מיזוג מאפיינים באמצעות מודול מיזוג מאפיינים תרבותיים בשיטת Cross-Attention (CAFFM), שחזור דפוסים באמצעות CycleGAN, סינתזה של סגנון אמנותי באמצעות SPADE, והערכה סופית באמצעות מדדי סגמנטציה ושחזור. החיצים מציינים את זרימת הנתונים והייצוגים של המאפיינים לאורך המסגרת. אנא לחצו כאן כדי להציג גרסה מוגדלת של איור זה.

הזיכרון הקולקטיבי והמורשת התרבותית של החברה האנושית מגולמים במורשת תרבותית בלתי מוחשית (ICH), המשמשת כמדיום חשוב לביטוי אמנותי וזהות תרבותית. עם זאת, ה-ICH ניצבת בפני אתגרים משמעותיים עקב השפעותיהן של הגלובליזציה והדיגיטליזציה2,3,4. פרקטיקות רבות של ICH הנמצאות בסכנה דורשות גישות חדשות לשימור ופיתוח, בשל מספרם הדועך של בעלי מלאכה מיומנים ויכולת הסתגלות מוגבלת לשווקים מודרניים5,6. כתחום חשוב במחקר ה-ICH, עיצוב בר-קיימא מדגיש את הפיתוח המשולב של התרבות, החברה והסביבה, ומספק נתיב מעשי להמשך שימור ה-ICH. באמצעות גישות של עיצוב בר-קיימא, ניתן להחיות את ה-ICH תוך התאמה לצרכיה של החברה העכשווית7,8.

במחקר זה, המונח "דפוסי מורשת תרבותית בלתי מוחשית" מתייחס לייצוגים של מוטיבים חזותיים המעבירים ומשמרים ערכים תרבותיים בלתי מוחשיים בבסיסם. כתוצאה מכך, המסגרת המוצעת שואפת לשמר ולתעד את המידע התרבותי הקשור למוטיבים אלו תוך שחזור צורותיהם החזותיות.

הרקמה והבאטיק של בני המiao הם צורות משמעותיות של מורשת תרבותית בלתי מוחשית (ICH) סינית, המשקפות את ההיסטוריה, האמונות והמסורות של קהילת ה-Miao באמצעות מוטיבים סמליים כגון ציפורים, פרפרים וטוטמים אבותיים9. מוטיבים אלו מוטמעים עמוקות בלבוש טקסי ובפרקטיקות של פסטיבלים, ותורמים לפיתוח התרבותי והכלכלי המקומי10,11. התקדמויות בטכנולוגיות דיגיטליות, ובמיוחד בינה מלאכותית (AI) ולמידה עמוקה (DL), יצרו הזדמנויות חדשות לשימור, ניתוח, שחזור ותיעוד של מורשת תרבותית. באטיק Miao ממרזב גוויג'ו (Guizhou), אחת ממסורות הבאטיק השמורות ביותר בסין, משמש כמדיום חשוב להעברת הידע התרבותי, האמונות, המנהגים והטקסים של בני ה-Miao12,13,14,15,16.

מחקרים אחרונים הדגימו את הפוטנציאל של למידה עמוקה (DL) לשימור מורשת תרבותית ושחזור דפוסים, תוך השגת דיוק סגמנטציה משופר (דיוק פיקסלים = 88.6%, ממוצע חיתוך מעל איחוד [IoU] = 78.1%) וביצועי שחזור טובים יותר בהשוואה ל-U-Net ו-DeepLabV3+1. עם זאת, נותרו מספר אתגרים. גישות קיימות המבוססות על רשתות יריב גנרטיביות (GAN) מתקשות לעיתים קרובות לשמר פרטים מבניים עדינים בדפוסים מורכבים17, בעוד שגיוון מוגבל של מערכי נתונים מגביל את הכללה של המודל על פני תחומי תרבות שונים18. בנוסף, מודלים של תרגום תמונה-לתמונה כגון CycleGAN עלולים להיכשל בשמירה על עקביות סמנטית בין מפות סגמנטציה לתמונות שנוצרו19, והיעדר מנגנוני קשב עלול להוביל לאובדן של פרטי מוטיבים בעלי חשיבות תרבותית במהלך השחזור20. לכן, נדרשת מסגרת משופרת המשלבת סגמנטציה מבוססת טרנספורמר, למידת מאפיינים מונחית-קשב ואימון על מערכי נתונים מרובים לשחזור יעיל של דפוסי מורשת תרבותית בלתי מוחשית (ICH).

הזדמנויות חדשות לשימור מורשת תרבותית נוצרו הודות לדיגיטציה של רקמת ה-Miao ולהתקדמות המהירה של בינה מלאכותית גנרטיבית. מודלי דיפוזיה (Diffusion models), מחלקה מתהווה של מודלים גנרטיביים עמוקים, הדגימו ביצועים מרשימים במשימות של ראייה ממוחשבת בשל יכולותיהם החזקות ליצירת תוכן21,22,23,24,25. במהלך תהליך הדיפוזיה ההפוכה, המודל לומד בהדרגה לשחזר את נתוני הקלט המקוריים מייצוגים רועשים26,27,28. מחקרים קודמים בחנו גם את היישום של טכנולוגיות שחזור תלת-ממדי ותכנון בעזרת מחשב (CAD) לצורך שימור והפצה של מורשת תרבותית.

על אף שרשתות נוירונים קונבולוציוניות (CNNs) ו-GANs מניבות ביצועים טובים ביצירת תמונות ובשימור מאפיינים, הן עדיין מתמודדות עם אתגרים הקשורים לשדות קליטה מוגבלים, קריסת מצבים (mode collapse) וחוסר יציבות באימון29. ארכיטקטורות המבוססות על Transformer, כגון SegFormer ו-Segmenter, מצטיינות בלכידה של הקשר גלובלי ומערכות יחסים סמנטיות; עם זאת, הן דורשות משאבים חישוביים רבים ועשויות להתקשות עם פרטים ברזולוציה גבוהה. למרות שמודלי דיפוזיה כגון Stable Diffusion מפגינים יכולות יצירת תמונות חזקות, הם לרוב חסרים שליטה מדויקת על המאפיינים המבניים והאמנותיים של העיצובים המיוצרים. יתרה מכך, מרבית הגישות הקיימות משתמשות באסטרטגיות אימון עצמאיות המגבילות שיתוף מידע יעיל ואופטימיזציה שיתופית בין רכיבי הסגמנטציה והיצירה, מה שמוביל לפשרה בין דיוק מבני לאותנטיות אמנותית30.

מודלים אחרונים המבוססים על דיפוזיה, כגון latent diffusion ו-Stable Diffusion, משיגים סינתזה של תמונות באיכות גבוהה אך דורשים הסרת רעשים (denoising) איטרטיבית, דבר המוביל לעלייה בעלות החישוב ובזמן ההסקה. יתרה מכך, שמירה על מוטיבים תרבותיים עדינים ועל עקביות מבנית נותרת מאתגרת ללא מנגנוני התניה ייעודיים. מודלים גנרטיביים המבוססים על Transformer לוכדים ביעילות קשרים קשריים גלובליים, אך דורשים לעיתים קרובות מערכי נתונים רחבי היקף ומשאבים חישוביים משמעותיים. בניגוד לכך, מסגרת העבודה SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) המוצעת משלבת סגמנטציה מבוססת SegFormer, מיזוג תכונות באמצעות cross-attention, שחזור CycleGAN וסינתזה מונחית SPADE כדי לספק הנחיה מבנית מפורשת, ובכך לשפר את שימור המוטיבים, את העקביות הסמנטית ואת השחזורB השליט של דגמי מורשת תרבותית.

מרבית הטכניקות המתקדמות לסגמנטציה סמנטית מתבססות על רשתות נוירונים קונבולוציוניות מלאות (FCNNs) בעלות ארכיטקטורה בצורת U31. במהלך שלב הקידוד, מאפיינים עמוקים עם שדות קליטה גדולים מופקים באמצעות סדרה של פעולות קונבולוציה ודגימה מחדש כלפי מטה (downsampling). שלב הפענוח משחזר בהדרגה את הרזולוציה המרחבית באמצעות דגימה מחדש כלפי מעלה (upsampling), ובסופו של דבר מאפשר חיזוי סמנטי ברמת הפיקסל. על ידי פיצוי על אובדן מידע מרחבי במהלך הדגימה מחדש כלפי מטה ושיפור ביצועי הסגמנטציה במגוון רחב של יישומים, קשרי דילוג (skip connections) מאפשרים שילוב ישיר של מידע ברזולוציה גבוהה מרמות שונות של המקודד לתוך המפענח32.

בעוד ששיטות אחרונות המבוססות על GAN, CNN ודיפוזיה הראו תוצאות מבטיחות ביצירת תמונות ובשיקום מורשת תרבותית, הן מתקשות לעיתים קרובות לשמור על עקביות סמנטית, לשמר מוטיבים מבניים עדינים ולהבטיח שחזור הניתן לשחזור על פני דפוסים תרבותיים מגוונים. מרבית הגישות הקיימות מתייחסות לסגמנטציה, שחזור וסינתזת סגנון כתהליכים נפרדים, דבר שעלול להוביל לאובדן של אלמנטים בעלי חשיבות תרבותית ולתוצאות לא עקביות. כדי לגשר על פער מתודולוגי זה, מחקר זה מציע מסגרת SegCycle-SPADE מאוחדת המשלבת סגמנטציה סמנטית מבוססת SegFormer, מודול חדש למיזוג תכונות תרבותיות באמצעות קשב צולב (CAFFM), שחזור מבוסס CycleGAN וסינתזת סגנון המונחית על ידי SPADE. באמצעות שילוב מפורש של מידע סגמנטציה מבני עם למידת תכונות גנרטיבית, המסגרת המוצעת מאפשרת שחזור אמין יותר, עקבי סמנטית וניתן לשחזור של מוטיבים של מורשת תרבותית בלתי מוחשית (ICH), תוך שמירה על האותנטיות התרבותית והאיכות האמנותית כאחד.

במחקר זה זוהו שלוש מגבלות מרכזיות של גישות נוכחיות לשחזור מורשת תרבותית: (i) שימור לא מספק של מוטיבים מבניים עדינים בשיטות שחזור מבוססות GAN; (ii) יכולת הכללה מוגבלת הנובעת מאימון על סטים קטנים של נתונים או נתונים ספציפיים לתחום מסוים; ו-(iii) חוסר עקביות סמנטית בין פלטי הסגמנטציה לתמונות הנוצרות במסגרות של תרגום תמונה-לתמונה (image-to-image translation). בנוסף, סגמנטציה, שחזור וסינתזה של סגנון נחשבים בדרך כלל כתהליכים נפרדים, דבר המוביל לאובדן של אלמנטים בעלי חשיבות תרבותית במהלך השחזור. באמצעות שילוב של סגמנטציה סמנטית מבוססת transformer, מיזוג תכונות באמצעות cross-attention, שחזור באמצעות CycleGAN וסינתזה אמנותית מונחית SPADE בתוך ארכיטקטורה מאוחדת, מסגרת SegCycle-SPADE המוצעת נותנת מענה למגבלות אלו ומשפרת את שימור המוטיבים, את העקביות הסמנטית ואת האותנטיות האמנותית בשחזור של דגמי ICH.

המטרה העיקרית של מחקר זה היא לפתח מסגרת SegCycle-SPADE משופרת לשחזור אמנותי של דגמי ICH המונחה על ידי סגמנטציה סמנטית. המסגרת משלבת את SegFormer לסגמנטציה מדויקת של מוטיבים תרבותיים, את CycleGAN לשחזור דגמים, ואת SPADE עבור סינתזה אמנותית עקבית סגנונית. כדי לשפר את ייצוג המאפיינים ולשמר פרטים מבניים עדינים, הוצג CAFFM כדי להקל על אינטראקציה יעילה בין מאפייני הסגמנטציה למאפיינים הגנרטיביים. המסגרת המוצעת, שאומנה על מאגרי הנתונים Miao Batik ו-WikiArt, משפרת את אותנטיות השחזור, את העקביות הסגנונית ואת השימור של מוטיבים בעלי חשיבות תרבותית.

על ידי שילוב של סגמנטציה סמנטית, היתוך תכונות מונחה-קשב (attention-guided feature fusion), שחזור תבניות וסינתזה של סגנון בתוך ארכיטקטורה מאוחדת, מחקר זה מציג את מסגרת SegCycle-SPADE החדשנית לשחזור אמנותי של תבניות מורשת תרבותית בלתי מוחשית (ICH). התרומות העיקריות של עבודה זו הן כדלקמן. ראשית, פותחה מסגרת שחזור חדשנית המונחית על ידי סגמנטציה סמנטית באמצעות שילוב של SegFormer, המאפשרת חילוץ ושימור מדויקים של מוטיבים תרבותיים מורכבים ואלמנטים מבניים. שנית, הוצג CAFFM חדש הממזג ביעילות תכונות סגמנטציה עם ייצוגים גנרטיביים, ובכך מאפשר למודל ללכוד קשרי טווח רחוק בין מוטיבים תרבותיים לתבניות סגנון אמנותיות. שלישית, ה-CAFFM המוצע משפר את השימור של אלמנטים בעלי משמעות תרבותית תוך שיפור הריאליזם הוויזואלי והקוהרנטיות המבנית של תבניות המורשת המשוחזרות. רביעית, באמצעות שילוב של CycleGAN לשחזור תבניות תרבותיות ו-SPADE לסינתזה אמנותית מונחית-סגמנטציה, המסגרת מבטיחה הן דיוק סמנטי והן אותנטיות סגנונית בתוצרים הנוצרים. חמישית, כדי לשפר את ההכללה ואת הגיוון האמנותי, המודל אומן באמצעות מערך הנתונים של מוטיבים תרבותיים של באטיק Miao ללמידת תבניות תרבותיות ומערך הנתונים WikiArt לייצוג סגנון אמנותי. WikiArt משמש כסט נתונים עזר להערכת יכולת ההכללה של המסגרת, חוסן למידת התכונות ואפקטיביות השליטה בסגנון על פני הקשרים ויזואליים מגוונים, ולא כסגנון יעד ליישום ישיר במוצרי מורשת תרבותית של Miao. לבסוף, בהשוואה לשיטות שחזור מורשת תרבותית קיימות המבוססות על GAN, תוצאות ניסיוניות מדגימות כי מסגרת SegCycle-SPADE המוצעת משיגה דיוק סגמנטציה משופר, איכות שחזור גבוהה יותר ועקביות סגנונית טובה יותר.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המסגרה המוצעת של SegCycle-SPADE תוכננה לשחזר ולשפר דגמים מסורתיים של מורשת תרבותית באמצעות סגמנטציה סמנטית, שיפור מאפיינים באמצעות מנגנון קשב (attention), שחזור גנרטיבי וסינתזה של סגנון אמנותי. מחקר זה השתמש במאגרי נתונים זמינים לציבור של מורשת תרבותית ותמונות אמנותיות, כולל מאגר הנתונים Miao Batik ומאגר הנתונים WikiArt. המחקר לא כלל משתתפים אנושיים, נתוני חולים, מידע אישי, בעלי חיים או רשומות קליניות; לפיכך, לא נדרשו אישור של ועדת אתיקה מוסדית או הסכמה מדעת. ראשית, מאגר המוטיבים התרבותיים של Miao Batik ומאגר הנתונים WikiArt שימשו לצורך ההערכה. מאגר הנתונים Miao Batik תואר על ידי Quan et al. (2024)32 והוא מכיל 15,148 תמונות מתויגות של מוטיבים מסורתיים של באטיק Miao. התיוגים הקיימים שסופקו על ידי יוצרי מאגר הנתונים שימשו באופן ישיר, ולא הופקו תיוגים ידניים נוספים במחקר זה. לאחר מכן, ביצעו עיבוד מקדמי של התמונות באמצעות שינוי גודל, נורמליזציה, הסרת רעשים ויצירת מסכת סגמנטציה. פרמטרי העיבוד המקדמי המדויקים מתוארים בתת-הסעיף Data Preprocessing. המסגרה המוצעת משתמשת במודל מבוסס-טרנספורמר בשם SegFormer-B2 לסגמנטציה סמנטית של הנתונים. השיטה תוכננה לזהות אזורי מפתח של מוטיבים תרבותיים וללמוד את המבנים שלהם. המאפיינים שעברו סגמנטציה משופרים לאחר מכן באמצעות מנגנון קשב, שבו מידע חשוב הקשור למוטיבים תרבותיים מודגש ומידע לא רלוונטי נזנח. הגדרות מנגנון הקשב מתוארות בתת-הסעיף CAFFM. המאפיינים המשופרים מועברים לאחר מכן ל-CycleGAN, שבו מבנים פגומים משוחזרים באמצעות למידה מחזורית. במהלך האימון, דגימות מוטיבים חלקיות נוצרו באופן מלאכותי על ידי החלת פעולות של מיסוך אקראי והסתרה חלקית על תמונות ה-Miao Batik המקוריות. הליכי פגיעה אלה סימולצו אזורי מוטיב חסרים ונזק מבני הנצפים בדרך כלל בחפצי מורשת תרבותית רעועים. התמונות החלקיות שהתקבלו שימשו כקלטים למודול השחזור של CycleGAN, בעוד שהתמונות המקוריות התואמות שימשו כמטרות לשחזור. דגמי המורשת התרבותית המשוחזרים משופרים לאחר מכן באמצעות SPADE, שבו מבוצע שיפור אמנותי המבוסס על מפות הסגמנטציה שהופקו. ביצועיה של המסגרה המוצעת מוערכים באמצעות מדדי סגמנטציה כמותיים ומדדי איכות תמונה, בעוד שהאותנטיות הוויזואלית של המוטיבים התרבותיים המשוחזרים מוערכת באופן איכותני. האותנטיות הוויזואלית הוערכה באמצעות בדיקה חזותית של הדגמים התרבותיים שהופקו ולא שימשה כמדד כמותי עצמאי. ההערכה התמקדה בשימור המוטיב, עקביות סמנטית, מאפיינים תרבותיים, לכידות מבנית ומראה אמנותי ביחס למוטיבים התרבותיים הייחוסיים התואמים. הערכה כמותית של ביצועי המודל בוצעה באמצעות Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR), ו-Fréchet Inception Distance (FID). איור 2 ממחיש את זרימת העבודה הכוללת של מסגרת SegCycle-SPADE המוצעת ומסכם את מדדי ההערכה ששימשו במחקר זה.

דיאגרמה של עיבוד מערכי נתונים באמצעות SegFormer, ו-CycleGAN ליצירת סגנון אמנותי; כולל מדדי הערכה.
איור 2. זרימת הארכיטקטורה הכללית של מסגרת ה-SegCycle-SPADE המוצעת. סקירה כללית של זרימת העבודה המלאה של SegCycle-SPADE. תמונות ממערכי הנתונים Miao Batik ו-WikiArt עוברות עיבוד מקדים לפני עיבוד באמצעות סגמנטציה סמנטית בעזרת SegFormer-B2, העשרת מאפיינים באמצעות CAFFM, שחזור דפוסים באמצעות CycleGAN, ויצירת סגנון אמנותי באמצעות SPADE. ביצועי המודל מוערכים באמצעות Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, ו-Fréchet Inception Distance (FID), בעוד שהאותנטיות הוויזואלית מוערכת באופן איכותני. אנא לחצו כאן כדי להציג גרסה מורחבת של איור זה.

מסגרת ה-SegCycle-SPADE לשחזור דפוסים של מורשת תרבותית תוכננה כדי לשלב מספר רכיבי DL לצורך סגמנטציה מדויקת של מוטיבים, שחזורם והעצמה אמנותית שלהם, כפי שמוצג ב-איור 2. תמונות ממאגר מוטיבים תרבותיים של באטיק מ尧 (Miao Batik) וממאגר ה-WikiArt משמשות לספק דפוסים תרבותיים וסגנונות אמנותיים מגוונים. בתחילה, התמונות מעובדות באמצעות מודול סגמנטציה סמנטית המבוסס על SegFormer כדי לזהות ולהגדיר את המוטיבים התרבותיים מהרקע. הארכיטקטורה הכוללת מורכבת מארבעה שלבים עיקריים. ראשית, מודל ה-SegFormer מחלץ מפות סגמנטציה סמנטית מתמונות הדפוסים התרבותיים. שנית, ה-CAFFM משלב תכונות סגמנטציה עם ייצוגים גנרטיביים כדי לשפר את למידת התכונות. שלישית, מודול ה-CycleGAN משחזר דפוסים תרבותיים באמצעות ייצוגי התכונות הממוזגים. לבסוף, מודול ה-SPADE מייצר פלטים מועצמים סגנונית תוך שמירה על עקביות מבנית באמצעות סינתזה מונחית-סגמנטציה. מפות התכונות המזוקקות מעובדות לאחר מכן על ידי מודול השחזור של ה-CycleGAN, הלומד לשחזר מוטיבים תרבותיים חסרים על ידי מיפוי דפוסים פגומים לצורותיהם השלמות התואמות. דגימות של מוטיבים חסרים הופקו על ידי החלת פעולות של מיסוך אקראי והסתרה חלקית על תמונות באטיק מ尧 המקוריות, ובכך סומללו אזורי דפוס חסרים ודגרדציה מבנית הנצפים בדרך כלל בחפצי מורשת פגומים. כל תמונה פגומה צומדה לתמונת המקור התואמת לה, ששימשה כיעד השחזור במהלך האימון. אסטרטגיה זו אפשרה למודול ה-CycleGAN ללמוד את השחזור של מבני מוטיבים חסרים תוך שמירה על עקביות סמנטית ומאפיינים בעלי חשיבות תרבותית. לבסוף, מחולל ה-SPADE מפיק פלטים אמנותיים מועצמים ויזואלית על ידי התניית סינתזת התמונה במפות הסגמנטציה שהופקו, ובכך שומר על השלמות המבנית של המוטיבים התרבותיים לאורך תהליך ההעצמה האמנותית.

השלבים הבאים כוללים את מסגרת ה-SegCycle-SPADE המוצעת.

שלב 1: איסוף מערכי נתונים
שני מערכי נתונים שימשו להשגת יעדי הלמידה של תבניות תרבותיות ויצירת סגנון אמנותי. מערך נתוני מוטיבים תרבותיים של באטיק מיהו (Miao Batik Cultural Motif Dataset) שימש לספק מידע על תבניות תרבותיות מסורתיות. מערך הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658) ומכיל 15,148 תמונות עם הערות (annotated) של מוטיבי באטיק מסורתיים של בני המיהו. ההערות הקיימות שסופקו על ידי יוצרי מערך הנתונים שימשו באופן ישיר, ולא הופקו הערות ידניות נוספות במחקר זה. מערך נתוני WikiArt שימש לספק מידע על סגנונות אמנותיים מגוונים לצורך יצירת סגנון אמנותי, והוא הושג ממאגר WikiArt הזמין לציבור (https://www.wikiart.org/).

שלב 2: עיבוד מקדימה של נתונים
כל התמונות עברו עיבוד מקדימה שכלל שינוי גודל, נורמליזציה והפחתת רעשים. עבור שלב הסגמנטציה הסמנטית, נעשה שימוש באנוטציות קיימות של מוטיבים תרבותיים שהושגו ממקורות מערכי הנתונים המקוריים. לא בוצעו הליכי אנוטציה או תיוג מחדש נוספים כחלק ממחקר זה.

שלב 3: סגמנטציה של תבניות סמנטיות באמצעות SegFormer
מודל ה-SegFormer שימש לסגמנטציה של מוטיבים תרבותיים. ה-backbone המדויק של SegFormer ואסטרטגיית האתחול מתוארים בסעיף המשנה Semantic Pattern Segmentation Using SegFormer. באופן ספציפי, נעשה שימוש בארכיטקטורת SegFormer-B2 עם backbone מסוג MIT-B2 ש पूर्व-אומן על ImageNet עבור סגמנטציה סמנטית של מוטיבים. מודל זה לוכד ביעילות מידע קשרי גלובלי תוך שמירה על הפרטים המבניים המורכבים של תבניות תרבותיות מסורתיות.

שלב 4: CAFFM
ה-CAFFM משלב מאפייני סגמנטציה סמנטית עם ייצוגים גנרטיביים, מה שמאפשר למסגרת ללמוד הן מאפיינים של מוטיבים מבניים והן מידע על סגנון אמנותי. פרטי האינטגרציה של ה-CAFFM מופיעים בסעיף המשנה CAFFM. המודול ממוקם בין שלב הסגמנטציה הסמנטית המבוסס על SegFormer לבין שלב השחזור הגנרטיבי, ושם הוא ממזג מאפיינים מבניים שנגזרו מהסגמנטציה עם מאפייני שחזור באמצעות multi-head cross-attention. תהליך זה משפר את שימור המוטיבים התרבותיים ומגביר את הריאליזם של הפלטים המשוחזרים.

שלב 5: שחזור תבניות (CycleGAN)
המאפיינים הממוזגים מעובדים לאחר מכן על ידי מודול ה-CycleGAN כדי לשחזר מבנים של תבניות תרבותיות. ארכיטקטורת ה-CycleGAN ותצורת האימון מתוארות בסעיף המשנה Pattern Reconstruction Using CycleGAN. מודול השחזור מורכב משני גנרטורים ושני דיסקרימינטורים, משתמש בארכיטקטורת גנרטור של רשת שאריות (residual-network) עם תשעה בלוקים של שאריות, עושה שימוש בדיסקרימינטור מסוג PatchGAN, ומאומן באמצעות הפסדי Adversarial ו-Cycle-consistency. תצורה זו מאפשרת מיפוי דו-כיווני של דומיינים ומסייעת בשחזור של מבני תבניות תרבותיות חסרים.

שלב 6: יצירת סגנון אמנותי (SPADE)
הדפוסים המשוחזרים מעובדים לאחר מכן באמצעות מודול ה-SPADE כדי לבצע סינתזה של סגנון אמנותי מונחית-סגמנטציה. תצורת מחולל ה-SPADE מתוארת בסעיף המשנה Artistic Style Generation Using SPADE. המודול עושה שימוש בבלוקים שיוריים (residual blocks) של SPADE, בשכבות נורמליזציה אדפטיביות מרחבית, ובתנאי סמנטיים הנגזרים ממפות סגמנטציה של SegFormer ומייצוגי תכונות של CAFFM. על ידי התניית יצירת התמונה במפות סגמנטציה, הפלטים המסונתזים שומרים על התאמה מבנית עם המוטיבים התרבותיים המקוריים תוך שילוב מאפייני סגנון אמנותי.

שלב 7: הערכת ביצועים
המסגרת המוצעת הוערכה באמצעות מספר מדדי סגמנטציה והערכת איכות תמונה, כולל Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR ו-FID. כדי להעריך את העקביות הניסויית, כל הניסויים חזרו חמש פעמים תוך שימוש בגרעיני אקראיות (random seeds) שונים, והתוצאות מדווחות כממוצע ± סטיית תקן. מובהקות סטטיסטית הוערכה באמצעות מבחני t מזווגים, עם סף מובהקות של p < 0.05.

איסוף מערכי נתונים
במסגרת ה-SegCycle-SPADE המוצעת, נעשה שימוש בשני מערכי נתונים להבנת דפוסים תרבותיים ולמידת סגנון. מערך הנתונים הראשון המשמש במסגרת המוצעת הוא מערך נתוני המוטיבים התרבותיים של באטיק מiao. מערך נתונים זה מכיל מוטיבים תרבותיים של באטיק מiao, שהם בדרך כלל תמונות של באטיק מiao מסורתי המכילות מוטיבים כגון בעלי חיים, צמחים וצורות גיאומטריות, המשמשים באמנות של השבט מiao. מערך נתונים זה מכיל תמונות עם מידע טקסטורלי עשיר, החשוב בדרך כלל לשימור מורשת תרבותית. מערך הנתונים השני המשמש במסגרת ה-SegCycle-SPADE המוצעת הוא מערך הנתונים WikiArt. מערך נתונים זה מכיל מספר עצום של יצירות אמנות, המגיעות בדרך כלל מסגנונות שונים. מערך נתונים זה משמש ללמידת סגנונות מורכבים, דבר המועיל בדרך כלל לשיפור יצירות אמנות. מערך נתונים זה כולל 80,000 יצירות אמנות ברזולוציית HD, עם 27 עיצובים שונים, מה שהופך אותו למועיל יותר למשימות יצירה או טרנספורמציה של סגנון מבוססות DL.

מאגר הנתונים Miao Batik:
מערך הנתונים Miao Batik (https://doi.org/10.5281/zenodo.20807658) כולל 15,148 תמונות של דגמי באטיק המתארים מוטיבים בעלי חשיבות תרבותית. התמונות כוללות מגוון של עיצובים מסורתיים, כגון מוטיבים של בעלי חיים (למשל, פרפרים ודגים), דגמים מבוססי צמחים ומוטיבים גיאומטריים הנושאים סמליות תרבותית. מערך נתונים זה הוא מרכיב חשוב במסגרת המוצעת, מכיוון שהוא מספק מבנים תרבותיים אותנטיים המאפשרים למודול הסגמנטציה לזהות ולשמר במדויק את גבולות המוטיבים במהלך שחזור הדגמים (טבלה 1במחקר זה, מוטיבים בעלי חשיבות תרבותית מתייחסים לאלמנטים חזותיים סמליים המתועדים נפוצה בספרות המורשת התרבותית של המיאו (Miao) ומוצגים בתוך השרטוטים (annotations) של מערך הנתונים, כולל ציפורים, פרפרים, דגמים צמחיים וטוטמים אבותים. מוטיבים אלו נבחרו על סמך חשיבותם התרבותית המתועדת ונוכחותם החוזרת בעיצובים מסורתיים של באטיק ורקמה של המיאו, ולא רק על סמך תדירות הופעתם או הרכבתם המרחבית. שרטוטי המוטיבים ותוויות הפילוח (segmentation labels) המודרכים על ידי מומחים התקבלו מהמקור של מערך נתוני הבאטיק של המיאו, ונעשה בהם שימוש ישיר במחקר זה. לא בוצעו על ידי המחברים הליכים נוספים של שרטוט ידני, תיווית מחדש או שרטוט מודרך על ידי מומחים. השרטוטים הקיימים שסופקו על ידי יוצרי מערך הנתונים שימשו לאימון ולהערכה של פילוח סמנטי.

פרמטרתיאור
שם מערך הנתוניםמאגר נתוני דפוסי תרבות של באטיק מיהאו (Miao Batik Cultural Pattern Dataset)
מקור מערך הנתוניםמאגר Zenodo (DOI: 10.5281/zenodo.20807658)
תחוםמורשת תרבותית בלתי מוחשית (ICH) / ניתוח תבניות טקסטיל
סך הכל תמונות15,148 תמונות
סוג תמונהדימויים דיגיטליים של דגמי טקסטיל מסורתיים של באטיק ממיאו (Miao)
קטגוריות תבניותמוטיבים של בעלי חיים, מוטיבים של צמחים ומוטיבים גיאומטריים
מקור תרבותיתרבות השבט מיאו, מחוז גויג'ו, סין
רזולוציית התמונה המקוריתתמונות ברזולוציה גבוהה (בדרך כלל ≥ 1,000 פיקסלים בצלע הקצרה) שצולמו כסריקות גולמיות או כתצלומים לפני עיבוד מקדים
רזולוציית אימוןהתמונות הותאמו לגודל של 256 × 256 פיקסלים במהלך עיבוד מקדימה
זמינות הערות שולייםהערות סגמנטציה קיימות שסופקו על ידי יוצרי מערך הנתונים שימשו ללא שינוי לצורכי אימון והערכה. במחקר זה לא בוצעו הליכי התמירתיות ידנית, תיווית מחדש או אישור מומחה נוספים.
יישום במחקר זהסגמנטציה של מוטיבים תרבותיים, חילוץ מאפיינים, שימור מוטיבים ושחזור תבניות

טבלה 1: מאפייני מערך הנתונים של דגמי תרבות הבאטיק של המיאו. סיכום של מערך נתוני מוטיבים תרבותיים של באטיק המיאו ששימשו לסגמנטציה סמנטית, ניתוח דגמים תרבותיים ושחזור מוטיבים. הטבלה מתארת את מקור מערך הנתונים, מאפייני התמונות, קטגוריות המוטיבים, המקור התרבותי, רזולוציית התמונות ותפקידו במסגרת ה-SegCycle-SPADE המוצעת.

מאגר הנתונים WikiArt:
מערך הנתונים WikiArt [https://www.wikiart.org/] הוא מאגר אמנות דיגיטלי רחב-היקף ופופולרי, המכיל למעלה מ-80,000 תמונות מ-27 סגנונות אמנותיים שונים ב- טבלה 2הסגנונות כוללים אמנות רנסנס, אימפרסיוניזם, קוביזם וסוריאליזם. מערך הנתונים הוא בעל חשיבות רבה במסגרת המוצעת, שכן הוא מספק ידע המאפשר למודול ה-SPADE ליצור דפוסים עשירים תרבותית תוך שמירה על מידע מבני שהתקבל מתהליך הסגמנטציה. מערך הנתונים כולל 56,000 תמונות ללמידה ו-12,000 תמונות הן לתיקוף והן לבדיקה. התמונות במערך הנתונים מסייעות באימון יעיל של מודל ה-DL.

פרמטרתיאור
שם מערך הנתוניםמערך הנתונים WikiArt
מקור מערך הנתוניםמאגר WikiArt (https://www.wikiart.org/)
תחוםאמנות דיגיטלית וציורים
סך הכל תמונותכ-80,000 יצירות אמנות
תמונות אימון56,000
תמונות תיקוף12,000
תמונות בדיקה12,000
סגנונות אמנותיים27 סגנונות אמנותיים, הכוללים רנסנס, אימפרסיוניזם, קוביזם, סוריאליזם, אקספרסיוניזם, ריאליזם ואמנות מופשטת
רזולוציית תמונה מקוריתרזולוציות התמונות המקוריות משתנות בין יצירות אמנות ומקורות שונים. התמונות שונו לגודל של רזולוציה אחידה של 256 × 256 pixels במהלך עיבוד מקדמי.
רזולוציית אימוןתמונות שונו לגודל של 256 × 256 pixels במהלך עיבוד מקדמי לפני למידת סגנון אמנותי וסינתזה של תמונות מונחית סגמנטציה.
חלוקת מערך הנתוניםחלוקה אקראית מרובדת (70% אימון, 15% תיקוף ו-15% בדיקה) באמצעות גרעין אקראי קבוע של 42
אסטרטגיית דגימת סגנוןנעשה שימוש בדגימה פרופורציונלית מרובדת כדי לשמר את ההתפלגות של 27 הסגנונות האמנותיים בין תתי-הקבוצות של האימון, התיקוף והבדיקה
יישום במחקר זהלמידת סגנון אמנותי, ייצוג סגנוני וסינתזה אמנותית מונחית סגמנטציה

טבלה 2: מאפייני מערך הנתונים WikiArt. סיכום של מערך הנתונים WikiArt המשמש ללמידת סגנון אמנותי ולסינתזת תמונות מונחית-סגנון. הטבלה מתארת את מקור מערך הנתונים, התפלגות התמונות, כיסוי הסגנונות האמנותיים, חלוקת מערך הנתונים, רזולוציית התמונות והיישום שלו במסגרת ה-SegCycle-SPADE המוצעת.

מערך נתוני ה-Miao Batik מכיל 15,148 תמונות המייצגות מוטיבים תרבותיים מסורתיים של בני המיאו.32 מערך הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658). לפני אימון המודל, כל התמונות נבחנו חזותית, שונו לגודל של 256 × 256 pixels, נורמלו ונבדקו לאיתור דגימות פגומות או כפילויות. סינון בקרת האיכות לא הוביל להחראת תמונות כלשהן; לפיכך, כל 15,148 התמונות נשמרו לניתוח המשכי. מערך הנתונים חולק באופן אקראי לתתי-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) תוך שימוש בגרעין אקראי (random seed) קבוע של 42 כדי להבטיח את השחזור של חלוקת הנתונים. הגישה למערך נתוני WikiArt התבצעה דרך מאגר WikiArt הרשמי (https://www.wikiart.org/), והוא מכיל למעלה מ-80,000 יצירות אמנות המקיפות 27 סגנונות אמנותיים. עבור ניסויי למידת סגנון, נעשה שימוש ב-56,000 תמונות לאימון, 12,000 לתיקוף ו-12,000 לבדיקה.

עיבוד מקדים של נתונים
לפני אימון מסגרת ה-SegCycle-SPADE המוצעת, מערך הנתונים של מוטיבים תרבותיים מבאטיק Miao ומערך הנתונים WikiArt הועברו מספר שלבי עיבוד מקדים כדי להבטיח איכות תמונה עקבית וייצוג מדויק של תכונות. אותו צינור עיבוד מקדים בסיסי, הכולל ניקת רעשים גאוסיאנית, נורמליזציה, שינוי גודל לרזולוציית קלט עקבית ואימות איכות התמונה, הוחל על שני מערכי הנתונים. עם זאת, למערכי הנתונים היו תפקידים שונים במסגרת העבודה. מערך הנתונים WikiArt שימש ללמידה וסינתזה של סגנון אמנותי, בעוד שמערך הנתונים של באטיק Miao שימש בעיקר לסגמנטציה ושחזור של מוטיבים תרבותיים. לא בוצעו שינויי עיבוד מקדים ספציפיים למערכי הנתונים מעבר לתפקידים אלו המותאמים למשימה. כדי להבטיח עיבוד עקבי על ידי מודל ה-DL, גודל התמונות שונה תחילה לרזולוציה קבועה. שלב זה היה נחוץ מכיוון שהתמונות בשני מערכי הנתונים נחלקו לרזולוציות שונות בהתאם למקורן. שינוי הגודל שיפר את היעילות החישובית ומנע מחוסר עקביות ממדית להשפיע על האימון. השלב השני של העיבוד המקדים היה נורמליזציה, שבה ערכי הפיקסלים הותאמו לטווח סטנדרטי כדי לייצב את עדכוני הגרדיאנט במהלך האימון. לאחר מכן, התמונות עובדו באמצעות סינון גאוסיאני להפחתת רעשים שעלולים להפריע למבני המוטיבים התרבותיים. עבור מערך הנתונים של באטיק Miao, מסכות סגמנטציה קיימות של מוטיבים תרבותיים שהושגו ישירות ממקור מערך הנתונים המקורי שימשו ללא שינוי לאימון והערכה של סגמנטציה סמנטית. לא הופקו מסכות סגמנטציה חדשות במיוחד למחקר זה.

אלא אם צוין אחרת, משוואות המתארות שיטות מבוססות הותאמו ממחקרים קודמים ומצוטטות בהתאם. המשוואות המתארות את ה-CAFFM המוצע ואת מסגרת האופטימיזציה המ composite SegCycle-SPADE פותחו על ידי המחברים עבור מחקר זה.

ניתן לייצג תמונת קלט מתוך מערך הנתונים כפי שמוצג ב-משוואה 1:

ייצוג מרחב וקטורי, I ∈ ℝⁿˣʷˣᶜ, איור של נוסחה, מושג מתמטי לימודי.  (1)

כאן, H, W, ו-C מתייחסים לגובה התמונה, לרוחבה ולמספר ערוצי הצבע, בהתאמה. כל התמונות מותאמות לגודל קבוע H′ × W′ כפי שמוצג ב-משוואה 2:

נוסחת עיבוד תמונה, משוואת Ir = Resize(I,H'×W'), הקשורה לשיטות שינוי גודל.

כאן, אניר היא התמונה לאחר שינוי הגודל. ערכי הפיקסלים הנורמליים מחושבים על פי משוואה 3:

נוסחה מתמטית עבור עוצמה מנורמלת, משוואה: In = Ir/255, רלוונטית לניתוח נתונים.   (3)

דבר זה מסייע בייצוב תהליך האימון. סינון רעשים מבוצע באמצעות מסנן גאוסי (Gaussian filter) כפי שמוצג ב- משוואה 4:

משוואת שיווי משקל סטטי Is=In*G(σ), סמל, ממוקד מתמטיקה, ניתוח מחקרי.

כאן, G(σ) הוא מסנן גאוסיאני ו-* מייצג קונבולוציה. נעשה שימוש במסנן גאוסיאני בעל גרעין (kernel) של 5 × 5 עם סטיית תקן של σ = 1.0. הוחל ריפוד השקפה (reflective padding) על פיקסלי השוליים כדי להפחית ארטיפקטים של קצוות. תהליך הסרת הרעש בוצע מיד לאחר טעינת התמונות, לפני השלב של קנה מידה ונורמליזציה. כדי להבטיח עיבוד מקדימה אחיד לאורך כל המחקר, הוחלה אותה הגדרת מסנן על כל תמונה במאגרי הנתונים Miao Batik ו-WikiArt. עבור מאגר הנתונים Miao Batik, מסכות הסגמנטציה נוצרות בהתאם ל-משוואה 5:

נוסחה מתמטית לזיהוי אזור מוטיב, המראה את קריטריוני סיווג הפיקסלים.

כאן, M היא מסכת סגמנטציה המשמשת להנחיית מודל ה-SegFormer.

תהליך העיבוד המקדים מתחיל ברכישת תמונות מתוך מאגר הנתונים Miao Batik ומאגר הנתונים WikiArt, כפי שמוצג ב-איור 3. לא נעשה שימוש בטכניקות של הגדלת נתונים (data augmentation) במהלך האימון. לאחר העיבוד המקדים, שכלל שינוי גודל, נורמליזציה, הסרת רעשים גאוסיאנית והכנת מסכות סגמנטציה, התמונות שימשו ישירות לאימון, תיקוף ובדיקה של מסגרת ה-SegCycle-SPADE המוצעת. השלב הראשוני של תהליך העיבוד המקדים כולל שינוי גודל של התמונות לגודל קבוע, המאפשר למודל ה-DL לעבד את התמונות ביעילות רבה יותר. השלב השני כולל נורמליזציה, הממירה את ערכי הפיקסלים לטווח מספרי סטנדרטי ומסייעת להתכנסות המודל. השלב השלישי כולל הסרת רעשים, במסגרתה התמונות מנוקות מרעשים לא רצויים כדי לשפר את זיהוי התבניות. בנוסף, עבור מאגר הנתונים Miao Batik, מסומנים אזורי מוטיבים תרבותיים, מה שמאפשר יצירת מסכות המשמשות במודול הסגמנטציה של המודל המוצע ומבטיח שהמוטיבים התרבותיים יישמרו במהלך היצירה. הפלט הסופי של שלב זה הוא מאגר נתונים נקי שמוכן לאימון מודולי הסגמנטציה והיצירה של המודל המוצע.

תרשים עיבוד סט נתונים; השלבים כוללים שינוי גודל, נורמליזציה, הסרת רעשים ואנוטציית מוטיבים.
איור 3. תהליך עיבוד מקדמי עבור תמונות של מורשת תרבותית. זרימת עבודה המדגימה את נהלי העיבוד המקדמי של התמונות המיושמים לפני אימון המודל. התהליך כולל רכישת סט הנתונים, שינוי גודל התמונות, נורמליזציה, הסרת רעשים גאוסיאנית, אנוטציות קיימות של מוטיבים תרבותיים והכנת מסכות סגמנטציה. התמונות והמסכות המעובדות שמתקבלות משמשות כקלטים לסגמנטציה סמנטית ושחזור תבניות. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

כל תמונה הועברה בתהליך בקרת איכות לפני אימון המודל. מערך הנתונים Miao Batik הכיל 15,148 תמונות. דגימות פגומות, כפולות ובעלות איכות נמוכה טופלו כבר על ידי יוצרי מערך הנתונים המקורי; לפיכך, לא הוצאו תמונות נוספות במהלך סינון בקרת האיכות במחקר זה. כתוצאה מכך, כל 15,148 התמונות נשמרו לצורך הניתוח. התמונות נטענו בפורמט RGB במהלך העיבוד המקדים ושונו לגודל של 256 × 256 פיקסלים באמצעות אינטרפולציה ביליניארית. ערכי הפיקסלים הותאמו מהטווח [0, 255] לטווח [0, 1] על ידי חלוקה ב-255. לאחר מכן הוחלה נורמליזציה לפי ערוצים באמצעות ערכי ממוצע של [0.485, 0.456, 0.406] וערכי סטיית תקן של [0.229, 0.224, 0.225] עבור הערוצים האדום, הירוק והכחול, בהתאמה. צינור העיבוד המקדים כלל טעינת תמונות, המרה ל-RGB, שינוי גודל, התאמת ערכי פיקסלים, נורמליזציה והמרה לטנזור. במידת הצורך, תמונות בגווני אפור הומרו לפורמט RGB תלת-ערוצי כדי לשמור על תאימות למודלי ה-DL. לאחר העיבוד המקדם, התמונות חולקו לתתי-קבוצות של אימון, תיקוף ובדיקה. כל השלבים של מסגרת ה-SegCycle-SPADE — כולל סגמנטציה סמנטית, מיזוג מאפיינים, שחזור מוטיבים וסינתזה אמנותית מבוססת SPADE — השתמשו ברזולוציית קלט עקבית של 256 × 256 פיקסלים.

סגמנטציה של תבניות סמנטיות באמצעות SegFormer
לאחר שלב עיבוד מקדמי זה, התמונות המנוקות והמנורמלות של מערך נתוני מוטיבי התרבות של Miao Batik ומערך הנתונים WikiArt מוזנות למודול הסגמנטציה הסמנטית המבוסס על המסגרה המוצעת של SegFormer-B2. מטרתו של שלב זה היא לזהות ולהפריד באופן נכון מוטיבים תרבותיים המופיעים בדגמי מורשת. המסגרת המוצעת של SegFormer מבוססת על ארכיטקטורת Transformer הכוללת מקודד (encoder) מסוג Transformer היררכי ומפענח (decoder) MLP קל משקל, כדי ללכוד במדויק מידע קשרי גלובלי וכן מידע מבני מפורט מדגמי מורשת מורכבים. המודל מחלץ תחילה ייצוגי מאפיינים בקנה מידה מרובה מהתמונה הקלטת, ולאחר מכן מתבצע מיזוג של ייצוגים אלו באמצעות המפענח כדי להפיק דגמים מסוגמנטים ומדויקים. הדבר מבטיח שהדגמים בתמונת המורשת יסוגמנטו נכונה למוטיבים כגון דגמים גיאומטריים, דגמים פרחוניים ודגמים סמליים, ובכך יופרדו מהרקע תוך שמירה על שלמותם המבנית. מידע מבני זה משמש לאחר מכן בשלבים מאוחרים יותר של יצירת דגמים במסגרת SegCycle-SPADE.

יהי תמונת הקלט שעברה עיבוד מקדמי מיוצגת כפי שמופיע ב-משוואה 6:

משוואה הממחישה את מרחב התמונה מממדים בעלי ערכים ממשיים; נוסחה: I_p ∈ ℝ^(H×W×C)    (6)

המקודד של SegFormer מחלק את התמונה לטלאים (patches) ומחלץ מאפיינים היררכיים באמצעות שכבות טרנספורמר, כפי שמוצג במשוואה 71:

משוואה המראה את תהליך קידוד המאפיינים; נוסחה: F = Encoder(Ip).

כאן, F מייצג את מפות המאפיינים הרב-קנה-מידה שהתקבלו ממקודד הטרנספורמר. מאפיינים אלו מקודדים הן תבניות מרקם מקומיות והן קשרים הקשריים גלובליים בין אזורי מוטיבים. מודל ה-SegFormer מחלץ מפות מאפיינים בקני מידה שונים כפי שמוגדר במשוואה 8:

נוסחת סימון וקטורי F={F1,F2,F3,F4}, המשמשת לניתוח שיווי משקל סטטי, סימון מתמטי.

השימוש בייצוגים רב-קנימיים (multiscale) מקל על זיהוי תבניות בגדלים שונים בתוך מוטיבים תרבותיים. לבסוף, המאפיינים משולבים באמצעות מפענח MLP כפי שמוצג ב-משוואה 91:
 משוואה: S=Decoder(F₁,F₂,F₃,F₄); נוסחה מתמטית, פונקציית מפענח.

כאן, S מייצגת את מפת הסגמנטציה הסופית שנחזתה.

שלד המודל SegFormer-B2 אותחל באמצעות משקולות שהוכשרו מראש על ImageNet ולאחר מכן עבר כוונון עדין (fine-tuning) על מערך הנתונים של Miao Batik לצורך סגמנטציה של מוטיבים תרבותיים. נקודת השמירה (checkpoint) המוכשרת מראש נלקחה מהמימוש הרשמי של SegFormer. באופן ספציפי, נעשה שימוש בנקודת השמירה MIT-B2 שהוכשרה על ImageNet-1K (mit_b2.pth), שסופקה על ידי מאגר ה-SegFormer הרשמי, כדי לאתחל את שלד ה-SegFormer-B2 לפני הכוונון העדין. המשקולות המוכשרות מראש תואמות לשלד ה-MIT-B2 שפורסם על ידי מחברי SegFormer ושימשו כמודל האתחול לאימון סגמנטציה סמנטית. השכבות שנותרו, שהן ספציפיות למשימה, אותחלו באמצעות נהלי אתחול המשקולות ברירת המחדל של PyTorch לפני האימון.

הארכיטקטורה משתמשת במקודד Transformer היררכי בעל ארבעה שלבים עם שיבוצי טלאים (patch embeddings) חופפים. בשלב הראשוני, גודל הטלאי נקבע ל-7 × 7 עם פסיעה (stride) של 4. עבור כל אחד מארבעת שלבי המקודד, ממדי השיבוץ היו 64, 128, 320 ו-512. לאורך ארבעת השלבים, היו 1, 2, 5 ו-8 ראשי קשב עצמי רב-ראשיים (multihead self-attention heads), ועומקי המקודד המתאימים היו 3, 4, 6 ו-3 שכבות. מאפיינים רב-קנימיים שחולצו מהמקודד אוגדו באמצעות מפענח all-MLP קל משקל. לפני יצירת מפת הסגמנטציה הסופית, המפענח השליך מאפיינים מכל שלב של המקודד למרחב שיבוץ יחיד. כל בלוקי ה-Transformer השתמשו בפונקציית ההפעלה Gaussian Error Linear Unit (GELU). שיעור dropout של 0.1 שימש במהלך האימון כדי לשפר את ההכללה ולהפחית התאמת יתר (overfitting).

במהלך שלב האימון, מסגרת ה-SegFormer מקבלת את התמונות שעברו עיבוד מקדים משני מערכי הנתונים. התמונות ממערך הנתונים של Miao Batik מכילות אזורי מוטיב המשמשים כתוויות ללמידה מפוקחת של מודל הסגמנטציה. מקודד ה-Transformer מעבד את התמונה כולה ולוכד קשרים ארוכי-טווח בין רכיבי התמונה, דבר החשוב במיוחד עבור דגמי באטיק מסורתיים המכילים מוטיבים המפוזרים מרחבית. מנגנון חילוץ התכונות ההיררכי לוכד בו-זמנית מבנים מקומיים, כגון טקסטורות גיאומטריות חוזרות. מפענח ה-MLP מעבד תכונות אלו ומפיק מסיכת סגמנטציה המדגישה את אזורי המוטיב. מפות הסגמנטציה הנוצרות בשלב זה משמשות לאחר מכן כקלטים מבניים עבור מודול הקשב (attention) ושלב השחזור של הדגם, ובכך הן מסייעות בשימור האותנטיות של הדגמים הנוצרים.

מוטיבים תרבותיים חולקו למחלקות שונות עבור סגמנטציה סמנטית בהתאם למאפייניהם הוויזואליים והתרבותיים. טקסונומיית הסגמנטציה כללה מוטיבים של בעלי חיים (למשל, פרפרים, דגים, ציפורים ופאונה סמלית אחרת), מוטיבים של צמחים (למשל, פרחים, עלים, גפנים ודגמים בוטניים), מוטיבים גיאומטריים (למשל, צורות חוזרות, מסגרות ומבנים גיאומטריים מופשטים), ואזורי רקע המייצגים שטחים ללא מוטיבים. מסכות סגמנטציה ברמת פיקסל שימשו להקצאת כל פיקסל לאחת המחלקות שהוגדרו מראש. תוויות מספר שלם קודדו באופן הבא: תווית 0 = רקע, תווית 1 = מוטיבים של בעלי חיים, תווית 2 = מוטיבים של צמחים, ותווית 3 = מוטיבים גיאומטריים. הערות הסגמנטציה ותוויות המוטיבים הופקו ישירות ממקור מאגר הנתונים המקורי של Miao Batik. במחקר זה לא בוצעו הליכי השמה ידנית נוספים, תיווית מחדש, אימות גבולות או הליכי אישור על ידי מומחים. ההערות הקיימות שסופקו על ידי יוצרי מאגר הנתונים שימשו ללא שינוי לצורך אימון והערכה.

מודל ה-SegFormer לסגמנטציה של מוטיבים תרבותיים מעבד את התמונות שעברו עיבוד מקדמי ממאגר הנתונים של Miao Batik וממאגר הנתונים של WikiArt באמצעות מנגנון מבוסס transformer לזיהוי מדויק של אזורי דגמים תרבותיים, כפי שמוצג ב-איור 4. ראשית, תמונת הקלט המכילה מוטיבים תרבותיים מסורתיים מוגשת למודל ה-SegFormer. מקודד ה-Transformer מחלץ הן מידע הקשרי גלובלי והן מאפיינים מבניים מקומיים מפיסות תמונה (patches). המאפיינים רב-קנייים המתקבלים מועברים למפענח הסגמנטציה, המשתמש ב-Mix Feed-Forward Network כדי לזקק את ייצוגי המאפיינים ולשפר את זיהוי המוטיבים. הפלט של מודל ה-SegFormer הוא מסכת סגמנטציה המדגישה פיקסלים התואמים לדגמים תרבותיים תוך דיכוי מידע רקע שאינו רלוונטי. הדגמים התרבותיים שהבודדו משמשים לאחר מכן כהנחיה מבנית עבור השלבים הבאים של מסגרת ה-SegCycle-SPADE.

דיאגרמת SegFormer; סגמנטציית תמונה עם מקודדי Transformer, מיצוי מאפיינים, מסכת סגמנטציה.
איור 4. סגמנטציה סמנטית של מוטיבים תרבותיים המבוססת על SegFormer-B2. ארכיטקטורה של מודול הסגמנטציה הסמנטית SegFormer-B2 המשמש למיצוי מוטיבים תרבותיים ואומן באופן בלעדי על מערך נתוני ה-Miao Batik. המסגרת מורכבת ממקודד מבוסס Transformer למיצוי מאפיינים רב-קניימי וממפענח סגמנטציה קל-משקל ליצירת מסכות של מוטיבים. המודל חוזה ארבע מחלקות סמנטיות — בעל חיים, צמח, גיאומטרי ורקע — כאשר מסכות הסגמנטציה המתוצאות מזהות אזורי מוטיבים בעלי משמעות תרבותית תוך דיכוי מידע רקע לא רלוונטי. פלטי סגמנטציה אלו מספקים הנחיה מבנית לשלבי מיזוג המאפיינים, השחזור והסינתזה האמנותית הבאים של מסגרת ה-SegCycle-SPADE המוצעת. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

אין צורך ביצירת הערות סגמנטציה חדשות במסגרת המוצעת. מערך הנתונים של Batik Miao נרכש ממקור ציבורי קיים, והמודל אומן באמצעות מידע על מוטיבים קשורים שסופקו על ידי יוצרי מערך הנתונים. במהלך תהליך הלמידה, מודל ה-SegFormer הפיק מפות סגמנטציה סמנטית. כתוצאה מכך, המחקר הנוכחי לא הצריך שימוש בתוכנה נוספת להערות ידניות, הנחיות להערה או נהלי בקרת איכות של ההערות.

CAFFM
כדי לשפר את האינטראקציה בין המאפיינים של סגמנטציה סמנטית לבין הייצוגים של שחזור גנרטיבי, המחקר הציע גם מודול CAFFM. המקודד SegFormer-B2 מספק מפות מאפיינים סמנטיים למודול ה-CAFFM, בעוד ששלב השחזור של CycleGAN מספק מפות מאפיינים גנרטיביים. ראשית, נעשה שימוש בשכבות הקרנה ליניארית כדי להקרין את שני זרמי המאפיינים למרחב שיכון (embedding space) משותף. לצורך חישוב תשומת לב צולבת (cross-attention), נוצרים ייצוגי שאילתה (Q), מפתח (K) וערך (V) באמצעות הטנזורים של המאפיינים שהופקו. לאחר מכן, הקשרים בין מידע על מוטיבים מבניים לבין אלמנטים של סגנון אמנותי ממודלים באמצעות תשומת לב צולבת רב-ראשית (multihead cross-attention). לאחר מכן, מיושמות נורמליזציה של שכבות, חיבורים שיוריים (residual connections) ושכבות הזנה קדימה (feed-forward) עם הפעלת GELU על ייצוגי המאפיינים המאוחדים. שלב הסינתזה המבוסס על SPADE מקבל את הפלט של מודול ה-CAFFM, מה שמאפשר שימור של תמות בעלות משמעות תרבותית מבלי להקריב את העקביות האמנותית.

כדי להבטיח תאימות של המאפיינים, המאפיינים הקלט מושלכים תחילה באמצעות שכבות היטל ליניאריות אל מרחב שיכון משותף עם ממד שיכון של 256. הקשרים בין המידע המבני הסמנטי לבין ייצוגי הסגנון הגנרטיביים ממודלים לאחר מכן באמצעות מנגנון Cross-Attention מרובה ראשים (MultiHead) עם שמונה ראשי קשב. חישוב ה-Cross-attention משתמש בווקטורים של שאילתה (Query - Q), מפתח (Key - K) וערך (Value - V) המופקים על ידי שכבות טרנספורמציה ליניאריות ספציפיות. כדי להגביר את יציבות האימון ולשמור על שלמות המאפיינים, נעשה שימוש בחיבורי שאריות (residual connections) ובנרמול שכבות (Layer Normalization) כדי לשפר עוד יותר את ייצוגי המאפיינים הממזגים. למידה לא-ליניארית של מאפיינים משופרת לאחר מכן על ידי החלת רשת feed-forward עם פונקציית ההפעלה Gaussian Error Linear Unit (GELU). ייצוג מאפייני פלט בממד 256 מופק על ידי המודול ונשלח לשלבים אחרים לצורך סינתזה יצירתית. ה-CAFFM משלב בהצלחה נתוני סגנון אמנותי עם מבני מוטיבים תרבותיים באמצעות טכניקת מיזוג המבוססת על cross-attention, מה שמשפר את השמירת על המוטיבים ואת הקוהרנטיות הוויזואלית בדגמי המורשת התרבותית המשוחזרים.

במערכת המוצעת, המאפיינים המבניים נגזרים ממאגר הנתונים של Miao Batik, בעוד שהמאפיינים הסגנוניים נלמדים ממאגר הנתונים WikiArt. נסמן ב-Fs את מפת המאפיינים שנגזרה מרשת הסגמנטציה SegFormer באמצעות תמונות ממאגר הנתונים של Miao Batik, ואת מפת המאפיינים שנגזרה מזרוע חילוץ מאפייני הסגנון באמצעות תמונות WikiArt נסמן ב-Fa. מודל ה-CAFFM המוצע משלב את שני תחומי המאפיינים באמצעות מנגנון קשב צולב (cross-attention) כדי ללמוד הן תלויות מבניות והן תלויות סגנוניות של תבניות תרבותיות. טבלה 3 מפרטת את כל המאפיינים הארכיטקטוניים, כולל ממדי ההטמעה (embedding dimensions), שכבות נורמליזציה, פונקציות אקטיבציה ותצורת ראשי הקשב. עבור גודל תמונת קלט של 256 × 256 פיקסלים, מקודד ה-SegFormer-B2 ייצר מפות מאפיינים סמנטיים בגודל 64 × 64 × 128, בעוד שזרוע חילוץ מאפייני הסגנון ייצרה מפות מאפיינים בגודל 64 × 64 × 128. שתי מפות המאפיינים הוקרנו דרך שכבות ליניאריות למידה אל תוך מרחב הטמעה משותף בממד 256 לפני מיזוג הקשב הצולב.

פרמטרתצורה
מסגרת מוצעתSegCycle-SPADE
מודל סגמנטציה סמנטיתSegFormer-B2
שלבי מקודד SegFormer4
אתחול משקולותSegFormer-B2 מאומן מראש על ImageNet-1K (שלד MIT-B2)
מקור נקודת ביקורת (Checkpoint)מאגר SegFormer הרשמי של NVIDIA (https://github.com/NVlabs/SegFormer); נקודת ביקורת: segformer.b2.512x512.ade.160k
אסטרטגיית כוונון עדין (Fine-Tuning)כוונון עדין מקצה לקצה על מערך הנתונים Miao Batik
גודל השכבת שיכון של טלאים (Patch Embedding)7 × 7
צעד הטלאים (Patch Stride)4
ממדי שיכון64, 128, 320, ו-512
עמקי מקודד3, 4, 6, ו-3
ראשי קשב (Attention Heads)1, 2, 5, ו-8
סוג מפענחמפענח All-MLP
פונקציית הפעלהGELU
שיעור נשירה (Dropout Rate)0.1
מודול שיפור מאפייניםמודול היתוך מאפיינים תרבותיים באמצעות קשב-צולב (CAFFM)
ממד שיכון CAFFM256
ראשי קשב CAFFM8
קשקלי היתוך CAFFM4
מודל שחזורCycleGAN
מודל יצירת סגנוןSPADE
מערך נתונים תרבותימערך נתוני Miao Batik
מערך נתוני סגנוןמערך נתוני WikiArt
תמונות Miao Batik15,148
תמונות WikiArtכ-80,000
רזולוציית תמונת קלט256 × 256 פיקסלים
פורמט צבעRGB
שיטת אינטרפולציהאינטרפולציה ביליניארית
שיטת ניקוי רעשיםסינון גאוסי
גודל גרעין גאוסי5 × 5
סיגמא גאוסי (σ)1
טווח נרמול[0, 1]
גודל אצווה (Batch Size)16
מספר תקופות (Epochs)100
אופטימייזרAdam
קצב למידה0.0002
פרמטרי Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, דעיכת משקולות = 0
פונקציות הפסדהפסד סגמנטציה, הפסד אדברסרי, הפסד עקביות-מחזורית, הפסד שחזור, הפסד שימור מוטיב והפסד עקביות-סגנון
אסטרטגיית חלוקת נתוניםאימון / תיקוף / בדיקה
מערכת אימון70%
מערכת תיקוף15%
מערכת בדיקה15%
גרעין אקראי (Random Seed)42
מדדי הערכהדיוק סגמנטציה, IoU, מקדם Dice, SSIM, PSNR ו-FID
שפת תכנותPython 3.8.10
מסגרת למידה עמוקהPyTorch 1.10.0
פלטפורמת חומרהמעבד גרפי NVIDIA RTX 3090 (24 GB VRAM), מעבד Intel Core i7 (דור 11), זיכרון RAM בנפח 32 GB
סביבת הפעלהUbuntu 20.04 LTS

טבלה 3: הגדרות ניסיוניות ותצורת מודל. סיכום של רכיבי הארכיטקטורה, תצורת האימון, הגדרות העיבוד המקדים, מערכי הנתונים, פרמטרי האופטימיזציה, מדדי ההערכה והסביבה החישובית ששימשו ליישום ולהערכה של מסגרת ה-SegCycle-SPADE המוצעת.

מודול הקשב ממפה תחילה את מפת המאפיינים לייצוגי שאילתה (query), מפתח (key) וערך (value) באמצעות משוואה 10:

נוסחאות שיווי משקל סטטי, Q=FsWq, K=FsWk, V=FsWv, משוואה לניתוח מכני.

כאן, Wq, Wk, ו-Wv הן מטריצות משקולות למידה. משקולות הקשב מחושבות על בסיס הדמיון בין וקטור השאילתה לוקטור המפתח באמצעות משוואה 1117

נוסחת פונקציית Softmax, A=Softmax((QK^T)/√d_k), משוואה עבור מנגנון קשב (attention mechanism).

כאן, dk הוא הממד של וקטור המפתח. ייצוג המאפיינים המשופר מחושב על ידי הכפלת משקלי הקשב במטריצת הערכים באמצעות משוואה 12:

נוסחת שיווי משקל סטטי \(F_a = A \cdot V\) מוצגת; מושג מפתח בניתוח מאזן כוחות.

כאן, Fa הוא ייצוג המאפיינים המשופר של מפת המאפיינים. ייצוג המאפיינים המשופר מחושב על ידי שילוב מאפייני הסגמנטציה המקוריים עם המאפיינים המשופרים שהושגו באמצעות מנגנון הקשב (attention mechanism) לפי משוואה 13:

משוואת שיווי משקל סטטית \( F_e = F_s + F_a \), המתארת כוחות, נוסחה.                                

כאן, Fe הוא מפת התכונות המשופרת המשמשת לשחזור דפוסים. ה-CAFFM מורחב באמצעות מנגנון תשומת לב צולבת רב-קנימי (multiscale cross-attention) כדי להוציא תכונות עבור מוטיבים תרבותיים בקניינים שונים. נסמן ב-Fsi את תכונות הסגמנטציה בקנייב i, בעוד ש-Faj מסמן את תכונות הסגנון האמנותי באותו קנייב. ייצוג התכונות הסופי מוגדר באמצעות משוואה 14:

  נוסחת מנגנון קשב \(F_{\text{fusion}} = \sum_{i=1}^{N} \text{Attention}(Q_i, K_i, V_i)\).

כאן, Qi, Ki, ו-Vi מייצגים את מטריצות השאילתה (query), המפתח (key) והערך (value) בקנה מידה i, בהתאמה, ו-N מציין את מספר קני המידה של המאפיינים. במחקר זה, N = 4, מה שמתבסס על מפות מאפיינים שהוצאו ברזולוציות מרחביות של 1/4, 1/8, 1/16, ו-1/32 מגודל תמונת הקלט. ייצוגי מאפיינים רב-קני מידה אלה הותכו באמצעות משקולות קשב (attention weights) למידה לפני השחזור והסינתזה האמנותית. הרחבה זו מאפשרת לשיטה לחלץ מוטיבים ומרקמים תרבותיים גלובליים כדי לשחזר דפוסים תרבותיים. CAFFM ממוקם בין שלב הסגמנטציה המבוסס על SegFormer לבין שלב הסינתזה היצירתית המבוסס על SPADE במערכת SegCycle-SPADE המוצעת. ראשית, בעוד ש-CycleGAN יוצר בו-זמנית מאפייני שחזור עם מידע סגנוני ומידע הקשור לדפוסים, SegFormer-B2 משחזר מפות מאפיינים סמנטיות המתארות את התכונות המבניות של מוטיבים תרבותיים. מודול ה-CAFFM מקבל שני זרמי מאפיינים אלה ומשתמש בהיתוך מבוסס קשב-מצליב (cross-attention) כדי לזהות קשרים בין ייצוגים מבניים לאמנותיים. כדי ליצור דפוסים אותנטיים מבחינה תרבותית תוך שמירה על עקביות סמנטית ותכונות מבניות, מפות המאפיינים המותוחות שמתקבלות נשלחות לאחר מכן למודול ה-SPADE לביצוע סינתזה יצירתית מונחית-סגמנטציה.

שחזור תבניות באמצעות CycleGAN
לאחר השלמת שלב שיפור המאפיינים מבוסס הקשב (attention-based), מפות המאפיינים יכילו את מבני המוטיבים התרבותיים המשופרים. עם זאת, מפות המאפיינים עשויות עדיין להכיל אזורי תבנית חסרים או פגומים. לכן, כדי לפתור את בעיית שחזור התבניות, המסגרת המוצעת תשתמש במודל CycleGAN. במסגרת המוצעת, שני הדומיינים יהיו תבניות המוטיבים התרבותיים המקוריות ותבניות המוטיבים התרבותיים המשוחזרות. באמצעות המאפיינים המשופרים מהשלבים הקודמים, מודל ה-CycleGAN ישחזר את התבניות התרבותיות תוך שמירה על עקביות מבנית. דבר זה יבטיח שתבניות תרבותיות, כגון תבניות גיאומטריות, תבניות פרחוניות ותבניות סמליות, ישמרו על הסידור המרחבי שלהן. תמונות Batik Miao המקוריות הועברו תהליכי מיסוך אקראי (random masking) ופעולות הסתרה חלקית כדי ליצור מוטיבים תרבותיים חסרים או פגומים. הליכי הדרדרת אלו סימלו אזורי תבנית חסרים ונזקים מבניים הנצפים בדרך כלל בחפצי מורשת תרבותית שדרדרו. התמונות המדרדרות שימשו כקלט למודול השחזור, בעוד התמונות המקוריות התואמות שימשו כתמונות ייחוס להערכת ביצועים ולהערכת איכות השחזור. אסטרטגיה זו אפשרה למודל ללמוד את השחזור של מבני מוטיבים חסרים תוך שמירה על עקביות סמנטית ומאפיינים תרבותיים.

יהי X התחום של דפוסים תרבותיים לא שלמים ויהי Y התחום של דפוסים תרבותיים משוחזרים. שני הגנרטורים לומדים לבצע מיפוי דו-כיווני באמצעות Equation 15:

 תרשים פונקציות ומיפויים GF:X→Y, FM:Y→X, טרנספורמציות מתמטיות במשוואות.

כאן, GE משמש לשחזור מבני מוטיבים ו-FM משמש למיפוי התבניות חזרה לדומיין המקורי. ההפסד האדವರ್סרי (adversarial loss) משמש כדי להבטיח שהתבניות המשוחזרות הן ריאליסטיות (משוואה 16)30

משוואת הפסד GAN \(L_{GAN}\); נוסחה לשיפור מודלים גנרטיביים; ביטוי מתמטי.

כאן, DY הוא המבדיל (discriminator) המשמש להבחנה בין תבניות אמיתיות לשחזוריות, ו-GE(x) מייצג את התבנית השחזורית שנוצרה. ה-CycleGAN אוכף גם עקביות מחזורית (cycle consistency) כדי לשמר את המבנה המבני של מוטיבים תרבותיים (משוואה 17)30.

נוסחה מתמטית עבור פונקציית ההפסד \(L_{cycle}(G_F, F_M)\) במידול חישובי.

פונקציית ההפסד הסופית מוגדרת באמצעות משוואה 1830:

משוואת שיווי משקל סטטי, L_total=L_GAN(G_E,D_Y,X,Y)+L_GAN(F_M,D_X,Y,X)+λ_L_cycle(G_E,F_M).

כאן, λi מציין את מקדם השקלול עבור הפסד עקביות המחזור (cycle-consistency loss), אשר נקבע ל-10 במהלך האימון, בהתאם לניסוח המקורי של CycleGAN. ערך זה נבחר כדי לאזן בין למידה אדברסרית לבין עקביות השחזור בין דומיין המקור לדומיין המטרה.

מודול השחזור של ה-CycleGAN מורכב משני גנרטורים ושני דיסקרימינטורים לתרגום תמונות דו-כיווני. כל גנרטור מבוסס על ארכיטקטורה של רשת שיורית (residual-network) הכוללת שכבת קונבולוציה ראשונית של 7 × 7, ולאחריה שתי שכבות קונבולוציה של דגימה מוחדשת למטה (downsampling), תשעה בלוקים שיוריים ושתי שכבות דגימה מוחדשת למעלה (upsampling). כל פעולות הקונבולוציה משתמשות בגודל גרעין של 3 × 3, למעט שכבת הקלט, המשתמשת בגרעין של 7 × 7 לצורך מיצוי תכונות משופר. נרמול מופעים (Instance Normalization) מיושם לאחר כל שכבת קונבולוציה כדי לשפר את יציבות האימון, בעוד שפונקציית אקטיבציה מסוג ReLU משמשת לאורך כל רשת הגנרטור. שכבת הפלט משתמשת בפונקציית אקטיבציה מסוג Tanh כדי להפיק פלטי תמונה מנורמלים. הדיסקרימינטור מבוסס על ארכיטקטורת PatchGAN של 70 × 70 המורכבת מסדרה של שכבות קונבולוציה עם גדלי גרעין של 4 × 4 וערוצי תכונות העולים בהדרגה. נרמול מופעים ואקטיבציית LeakyReLU (שיפוע שלילי = 0.2) מיושמים בדיסקרימינטור כדי לשפר את הבחנה בין תכונות ולמידה אדבסריאלית. מודול ה-CycleGAN מקבל כתשומות תמונות של מוטיבים תרבותיים שעברו עיבוד מוקדם ומייצר ייצוגי תבניות משוחזרים, אשר מועברים לאחר מכן ל-CAFFM לצורך אינטגרציה עם תכונות סגמנטציה. אימון ה-CycleGAN בוצע באמצעות אופטימיזטור Adam ‏(β₁ = 0.5, β₂ = 0.999) עם קצב למידה ראשוני של 0.0002. קצב הלמידה נשמר במהלך 100 האיפוכים (epochs) הראשונים ולאחר מכן דעך לינארית לאפס לאורך יתרת תקופת האימון. באפר השחזור (replay buffer) הכיל 50 תמונות שנוצרו בעבר כדי לייצב את אימון הדיסקרימינטור. הגנרטורים והדיסקרימינטורים עודכנו ביחס עדכון של 1:1, כאשר עדכון גנרטור אחד ה diikuti על ידי עדכון דיסקרימינטור אחד במהלך כל איטרציית אימון.

תהליך השחזור של ה-CycleGAN מבוסס על מפות המאפיינים המשופרות שהתקבלו באמצעות מנגנון ה-CAFFM ב-איור 5. מפות המאפיינים מכילות מוטיבים תרבותיים משופרים שהושגו בשלבי הסגמנטציה וה-CAFFM הקודמים. מפות המאפיינים משמשות כקלט לגנרטור הראשון GE. הגנרטור הראשון GE לומד את המיפוי הנדרש לשחזור דפוסים תרבותיים. הפלטים מוזנים לאחר מכן למבדיל (discriminator) DY כדי להבחין בין דפוסים תרבותיים אמיתיים לבין דפוסים משוחזרים. המבדיל DY מסייע לגנרטור GE להפיק פלטים ריאליסטיים. כדי להבטיח שהדפוסים התרבותיים לא יעוותו במהלך השחזור, הגנרטור השני FM מבצע מיפוי עקביות-מחזור (cycle-consistency mapping). הגנרטור השני FM ממפה את הפלטים בחזרה לדומיין המקורי. הפלטים מוערכים לאחר מכן על ידי המבדיל כדי להבטיח ריאליזם. הפלטים הסופיים מועברים לאחר מכן למודול ה-SPADE ליצירת סגנון אמנותי בשלב הבא של מסגרת ה-SegCycle-SPADE המוצעת.

תהליך שחזור תבניות; תרשים המשתמש ב-GANs ליצירת מוטיבים תרבותיים.
איור 5. זרימת עבודה לשחזור תבניות מבוסס CycleGAN. זרימת העבודה של מודול השחזור של ה-CycleGAN. ייצוגי מאפיינים מועצמי-קשב (Attention-enhanced) מסופקים כקלטים לרשת הגנרטור כדי לשחזר מוטיבים תרבותיים חסרים. הדיסקרימינטור מעריך את הפלטים המשוחזרים מול תבניות ייחוס, בעוד שמיפוי עקביות-מחזור (cycle-consistency mapping) שומר על השלמות המבנית במהלך תרגום תמונות דו-כיווני. המוטיבים המשוחזרים מועברים לאחר מכן למודול ה-SPADE עבור סינתזה של סגנון אמנותי. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

יצירת סגנון אמנותי באמצעות SPADE
בהמשך, המוטיבים התרבותיים המשוחזרים עוברים למודול SPADE לצורך יצירת סגנון אמנותי. המטרה העיקרית של מודול ה-SPADE היא להוסיף טקסטורות עשירות יותר מבחינה חזותית של סגנון אמנותי למוטיבים התרבותיים המשוחזרים, מבלי לפגוע בפריסה המבנית של המוטיבים. מודול ה-SPADE הוא טכניקת יצירת תמונות מותנית המשתמשת במושג של סגמנטציית תמונות ליצירת תמונות. מפות סמנטיות רב-ערוציות, שהתאימו למחלקות המוטיבים שנקבעו מראש, קודדו ממסכות הסגמנטציה הסמנטית שהופקו על ידי SegFormer-B2. מחולל ה-SPADE קיבל מפות מקודדות אלו כקלטים מותנים. פרמטרי קנה המידה (γ) וההטיה (β) האדפטיביים מרחבית הופקו על ידי עיבוד המפות הסמנטיות דרך שכבות קונבולוציה בתוך כל שכבת SPADE. באופן זה, המחולל היה מסוגל לשמור על גבולות המוטיבים, הפריסות המבניות והמידע הסמנטי במהלך הסינתזה האמנותית, על ידי החלת פרמטרים אלו על הפעולות (activations) הנורמליות של התכונות. ההכוונה הסמנטית יכלה להשפיע הן על השחזור המבני ברמה הגבוהה והן על סינתזת הטקסטורה ברמה הנמוכה, מכיוון שתהליך ההתניה בוצע במספר שכבות של מחולל ה-SPADE. כתוצאה מכך, הדגמים האמנותיים שנוצרו שילבו מאפיינים סגנוניים שנרכשו ממאגר הנתונים WikiArt, תוך שמירה על מבני המוטיבים התרבותיים שנמצאו בשלב הסגמנטציה.

מאגר הנתונים WikiArt, הכולל עבודות מ-27 קטגוריות אמנותיות שונות — כגון רנסנס, אימפרסיוניזם, קוביזם, אקספרסיוניזם, סוריאליזם, ריאליזם ואמנות מופשטת — שימש כמשאב המרכזי להבנת סגנונות אמנותיים. כדי לחשוף את המודל למגוון של מאפיינים יצירתיים ולשפר את הכללה של הסגנונות, נבחרו תמונות סגנון באופן אקראי מהקטגוריות השונות במהלך האימון. מאגר הנתונים חולק לתתי-קבוצות של אימון, תיקוף ובדיקה, עם ייצוג מאוזן של הקטגוריות האמנותיות במטרה להפחית הטיות סגנוניות. כדי להבטיח ייצוג מאוזן של כל 27 הקטגוריות האמנותיות, נעשה שימוש בדגימה מוקצבת (stratified sampling). דגימות מכל קטגוריה הוקצו באופן פרופורציונלי לתתי-קבוצות האימון, התיקוף והבדיקה תוך שמירה על התפלגות המחלקות המקורית. מודול ה-CAFFM שימש למיזוג היבטי הסגנון שהופקו מתמונות ה-WikiArt עם מאפייני השחזור שיוצרו על ידי CycleGAN. כדי לאפשר לרשת הסינתזה להעביר תכונות אמנותיות תוך שמירה על המבנה הסמנטי וגבולות המוטיבים התרבותיים הנגזרים ממפות הסגמנטציה, ייצוגי המיזוג שהתקבלו סופקו כמידע התניה (conditioning information) לגנרטור ה-SPADE. הודות לטכניקת התניית הסגנון זו, המסגרת המוצעת הייתה מסוגלת להפיק דפוסים אמנותיים אותנטיים מבחינה תרבותית עם ייצוגים מבניים וסגנוניים עקביים.

SPADE מציגה גם פרמטרים אדפטיביים מרחביים התלויים במפת הסגמנטציה. ניתן להגדיר את הפרמטרים כפי שמוצג ב-משוואה 191:

משוואת טרנספורמציה לינארית: y=γ(S)x̂+β(S) (משוואה 19), ייצוג מתמטי.

כאן, γ(S) הוא פרמטר קנה מידה המשתנה מרחבית ו-β(S) הוא פרמטר הסטייה (bias) המשתנה מרחבית. פרמטרים אלה יכולים לסייע למחולל ליצור טקסטורות וסגנונות שונים בהתאם לאזור הסמנטי בתמונות. ניתן להגדיר את יצירת האמנות התרבותית הסופית כפי שמוצג ב-משוואה 20:

 משוואה לתהליך הערכה גנטית נוסחה I_gen=G_E(X^P_r,SM).

כאן, GE הוא מחולל ה-SPADE, XrP הוא התבנית המשוחזרת, ו-SM הוא מפת הסגמנטציה. היצירה הסופית שומרת על השלמות המבנית של מוטיבים תרבותיים תוך שיפור המראה האמנותי. פונקציית הפסד משולבת, המאזנת בין דיוק סגמנטציה סמנטית, שימור מוטיבים תרבותיים, איכות שחזור התבנית ועקביות הסגנון האמנותי, שימשה לאופטימיזציה של ארכיטקטורת ה-SegCycle-SPADE המוצעת. תערובת משוקללת של הפסד סגמנטציה (Lseg), הפסד אדברסרי (Ladv), הפסד עקביות מחזורית (Lcycle), הפסד שחזור (Lrecon), הפסד שימור מוטיבים (Lmotif) והפסד עקביות סגנונית (Lstyle) שימשה להגדרת יעד האימון הכללי. פונקציית ההפסד הכוללת מוגדרת במשוואה 21:

נוסחת ההפסד הכולל, L_Total, שווה למספר רכיבים, מוצגת כמשוואה מתמטית לניתוח.  (21)

על מנת להבטיח עקביות מבנית בין המוטיבים התרבותיים של הקלט לאלו המשוחזרים, מקדם הפסד העקביות המחזורית (cycle-consistency loss) נקבע ל-10. כדי לשמר מאפייני מוטיב בעלי רזולוציה גבוהה ולהגביר את הדיוק הוויזואלי, מקדם הפסד השחזור נקבע ל-5. כדי להדגיש את השימור של תבניות מבניות חיוניות מבחינה תרבותית במהלך הסינתזה האמנותית, נעשה שימוש במקדם של 2 עבור הפסד שימור המוטיב (motif-preservation loss). על מנת לקדם העברה של סגנון אמנותי ללא עיוות מופרז של מבני המוטיב הסמנטיים, מקדם הפסד עקביות הסגנון כוונן ל-1. כדי לשמור על תרומה מאוזנת בין הפקת תמונה ריאליסטית לבין סגמנטציה מדויקת של המוטיב, ניתנו משקולות שוות להפסדי הסגמנטציה וההפסדים האדברסריים (adversarial losses). ייצוגי סגנון מבוססי-מאפיינים מתוך מאגר הנתונים WikiArt שימשו לחישוב הפסד עקביות הסגנון. בפרט, מאפייני סגנון אמנותיים נלכדו באמצעות קורלציות של מטריצת גראם (Gram matrix) שנלקחו ממפות מאפיינים עמוקות. ההפרש בנורמת פרובניוס (Frobenius norm) בין מטריצות הגראם של תמונת סגנון היעד לבין התמונה הנוצרת שימש לחישוב הפסד הסגנון, כפי שמוצג ב-משוואה 22:

משוואת חדווא להפסד סגנון ברשתות נוירונים, המציגה את הנוסחה L_style ותיאור של השיטה.

כאן, ג'נראה כי לא הוזן טקסט למעבר. אנא ספק את הטקסט באנגלית שברצונך לתרגם לעברית. האם מטריצת גראם (Gram matrix) מחושבת מה- ל_נראה שההודעה שלך ריקה או מכילה רק תווים בודדים. אנא ספק את הטקסט באנגלית שברצונך לתרגם לעברית, ואשמח לבצע את התרגום המדעי והמקצועי עבורך. שכבת מאפיינים, אנינא לספק את הטקסט באנגלית שברצונך לתרגם. מייצג את התמונה האמנותית שנוצרה, אניסגנון מסמן את תמונת סגנון המטרה ממאגר הנתונים WikiArt, ו- F מייצג את נורמת פרובניוס (Frobenius norm). ניסוח זה מאפשר למסגרת המוצעת לשמר מאפיינים אמנותיים תוך שמירה על השלמות המבנית והסמנטית של מוטיבים תרבותיים.

ייצוגי המאפיינים הממוזגים המופקים על ידי מודול ה-CAFFM משמשים כקלטים למתנה (conditioning inputs) עבור מודול ה-SPADE, המשמש כמרכיב הסינתזה האמנותית של המסגרת המוצעת. מחולל ה-SPADE כולל שבעה בלוקים שיוריים (residual blocks) של SPADE עם ממד מאפיינים חבוי של 256 ערוצים, ומפיק תמונות פלט ברזולוציה של 256 × 256 פיקסלים. מפות סגמנטציה סמנטית שהושגו ממודול ה-SegFormer–CAFFM משמשות כקלטים למתנה לאורך השכבות השיוריות של ה-SPADE. שכבות ה-SPADE מיושמות לפני פונקציות ההפעלה בתוך כל בלוק שיורי, מה שמאפשר התניה סמנטית מונחית-סגמנטציה. באמצעות פעולות דגימה כלפי מעלה (upsampling) וקונבולוציה רצופות, ייצוג המאפיינים החבוי עובר עידון הדרגתי כדי להפיק תבניות אמנותיות ברזולוציה גבוהה תוך שמירה על עקביות סמנטית ומבנה המוטיב. פונקציות הפעלת LeakyReLU משמשות לאורך כל המחולל, ופונקציית הפעלת Tanh מיושמת בשכבת הפלט כדי להפיק תמונות מנורמלות.

אלגוריתם וזרימת עבודה
מסגרת העבודה SegCycle-SPADE משלבת סגמנטציה סמנטית, היתוך תכונות, שחזור תבניות וסינתזה של סגנון אמנותי בתוך צינור אימון מאוחד. זרימת העבודה מתחילה ברכישת מערך נתונים ובעיבוד מקדים, הכולל שינוי גודל תמונות, נורמליזציה, הסרת רעשים והכנת מסכות סגמנטציה. תמונות שעברו עיבוד מקדים מעובדות לאחר מכן באמצעות רשת הסגמנטציה SegFormer-B2 כדי להפיק ייצוגים של מוטיבים סמנטיים. תכונות הסגמנטציה המתקבלות ממוזגות עם תכונות שחזור באמצעות ה-CAFFM, מה שמאפשר אינטראקציה בין מידע על מוטיבים מבניים לבין ייצוגי תכונות אמנותיות. מפות התכונות הממוזגות מועברות לאחר מכן למודול השחזור CycleGAN, המשחזר מבני מוטיבים תרבותיים חסרים תוך שמירה על עקביות סמנטית. התבניות המשוחזרות מועברות לאחר מכן למחולל ה-SPADE לצורך סינתזה אמנותית מונחית-סגמנטציה, המאפשרת שיפור סגנוני תוך שמירה על גבולות המוטיבים ועל האותנטיות המבנית. במהלך האימון, פרמטרי המודל מותאמים באמצעות פונקציית ההפסד המורכבת המתוארת ב- משוואות 21 ו-22, המאזן בין דיוק הפילוח (segmentation), שימור מוטיבים, איכות השחזור ועקביות הסגנון האמנותי. זרימת עבודה מפורטת ליישום שלב אחר שלב, הכוללת טעינת מערך נתונים, עיבוד מקדים, אתחול המודל, חזרות אימון, הליכי תיקוף, בחירת נקודות שמירה (checkpoints) והערכה סופית, מוצגת ב- קובץ משלים 1 (אלגוריתם 1)זרימת העבודה האלגוריתמית המלאה הוטמעה באמצעות גודל אצווה (batch size) של 16, קצב למידה של 0.0002 ו-100 תקופות אימון (epochs). נעשה שימוש בזרע אקראי (random seed) קבוע של 42 עבור חלוקת מערך הנתונים, אתחול המודל וכל ניסויי האימון. הזרע הוחל באופן עקבי על גבי מחוללי המספרים האקראיים של Python, NumPy ו-PyTorch כדי להבטיח שחזור. האופטימיזציה של Adam הוגדרה עם β₁ = 0.5, β₂ = 0.999, וללא דעיכת משקולות (weight decay = 0). נקודות שמירה (checkpoints) של המודל נבחרו על בסיס ציון ה-IoU הגבוה ביותר שהושג במערך הנתונים לאימות.

אופטימיזציה של פונקציית ההפסד
כדי לשמר מבני מוטיבים תרבותיים במהלך השחזור והסינתזה האמנותית, המסגרה המוצעת משתמשת ביעד אופטימיזציה מורכב המשלב הפסדי סגמנטציה, הפסדים אדברסריים (adversarial), הפסדי עקביות-מחזור (cycle-consistency), הפסדי שחזור, הפסדי שימור-מוטיבים והפסדי עקביות-סגנון. הניסוח המתמטי המלא, מקדמי השקלול והגדרת הפסד הסגנון מופיעים במשוואות 21 ו-22 בתוך תת-הסעיף Artistic Style Generation using SPADE. רכיב שימור המוטיבים מעניש סטיות מבניות בין אזורי המוטיבים שנחזו לבין מסכות הסגמנטציה המתאימות של ה-ground-truth, ובכך מעודד שימור של מבני תבניות בעלי חשיבות תרבותית לאורך תהליך השחזור.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מסגרת ה-SegCycle-SPADE המוצעת הוערכה באמצעות שני מערכי נתונים: מערך נתוני מוטיבים תרבותיים של Miao Batik ומערך הנתונים WikiArt. מערך נתוני ה-Miao Batik מכיל תמונות של מורשת תרבותית מסורתית ושימש בעיקר למשימות של סגמנטציה סמנטית ושחזור מבני, בעוד שמערך הנתונים WikiArt מכיל סגנונות אמנותיים מגוונים ושימש ללמידה ולהפקה של סגנון אמנותי. תמונות משני מערכי הנתונים עובדו דרך צינור העבודה המלא של SegCycle-SPADE, הכולל סגמנטציה סמנטית, CAFFM, שחזור תבניות והפקה של סגנון אמנותי מבוססת SPADE. השילוב של מידע על מוטיבים תרבותיים וייצוגי סגנון אמנותי אפשר למסגרת להפיק תוצרים בעלי משמעות תרבותית ועקביות חזותית.

כל הניסויים בוצעו בתחנת עבודה עם תמיכה ב-GPU, המצוידת במעבד Intel Core i7 וב-GPU של NVIDIA. באופן ספציפי, הניסויים בוצעו בתחנת עבודה המצוידת ב-CPU מסוג Intel Core i7 (דור 11), ב-GPU מסוג NVIDIA RTX 3090 עם 24 GB VRAM, וב-32 GB של זיכרון מערכת. המודלים הוממשו באמצעות Python 3.8 ו-PyTorch 1.10 עם האצת CUDA. האימון בוצע בהגדרת GPU בודד ללא אימון מבוזר. לאורך כל הניסויים נעשה שימוש בדיוק FP32 סטנדרטי, ולא נעשה שימוש באימון בדיוק מעורב (mixed-precision training). עבור האופטימיזציה נעשה שימוש ב-Adam עם גודל באץ' (batch size) של 16 למשך 100 תקופות אימון (epochs). Table 3 מסכם את פרמטרי ההמימוש וסביבת החישוב ששימשו במחקר זה.

הארכיטקטורה המוצעת מורכבת מארבעה רכיבים עיקריים: SegFormer-B2 לסגמנטציה סמנטית, CAFFM למיזוג מאפיינים, CycleGAN לשחזור מוטיבים, ו-SPADE לסנתזה של סגנון אמנותי. תמונות משני המאגרי נתונים שונו לגודל של 256 × 256 פיקסלים לפני האימון. רזולוציה סטנדרטית זו הבטיחה יעילות חישובית תוך שמירה על פרטי מוטיבים חשובים, ותרמה לאימון אדברסרי יציב של מודולי CycleGAN ו-SPADE.

ביצועי המסגרת המוצעת הוערכו באמצעות מדדי סגמנטציה והערכת איכות תמונה, הכוללים Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR ו-FID. האותנטיות החזותית הוערכה באופן איכותני באמצעות בדיקה ויזואלית של הדפוסים התרבותיים שנוצרו. ההערכה האיכותנית התמקדה בשימור מוטיבים, עקביות סמנטית, מאפיינים תרבותיים ומראה אמנותי ביחס למוטיבים התרבותיים ששימשו כייחוס. האותנטיות החזותית לא שימשה כמדד הערכה כמותי עצמאי.

הערכה כמותית של המסגרת המוצעת בוצעה באמצעות המדדים הבאים.

דיוק הסגמנטציה חושב באמצעות משוואה 23:

נוסחת דיוק, TP+TN/TP+TN+FP+FN, משוואת ניתוח סטטיסטי להערכת מודל.

כאן, TP, TN, FP ו-FN מסמנים, בהתאמה, חיוביים אמיתיים, שליליים אמיתיים, חיוביים שגויים ושליליים שגויים.

ה-IoU חושב באמצעות משוואה 24:

 נוסחת IoU, TP/(TP+FP+FN), משוואה מתמטית לדיוק של סגמנטציית תמונה.

מקדם דמיון דייס (Dice Similarity Coefficient (Dice)) חושב באמצעות משוואה 25:

משוואת מקדם Dice, \( \frac{2*TP}{2*TP+FP+FN} \), נוסחה המשמשת להערכת ניתוח נתונים.

מדד ה-SSIM שימש להערכת דמיון תפיסתי בין תמונות והוא מוגדר באמצעות משוואה 2633:

משוואת מדד SSIM; נוסחה מתמטית להערכת איכות תמונה; תרשים.  (26)

כאן, μ מייצגת את העוצמה הממוצעת, σ מייצגת את השונות, σxy מייצגת את השונות המשותפת (covariance) בין התמונות, ו-C1 ו-C2 הם קבועים מייצבים.

PSNR הוא מדד המשמש באופן נפוץ להערכת האיכות של תמונות שנוצרו, והוא מוגדר במשוואה 2733:

נוסחת PSNR, הערכת איכות תמונה, משוואה לחישוב יחס אות לרעש שיאו.

כאן, MaxI מציין את ערך הפיקסל המקסימלי האפשרי של התמונה ו-MSE הוא השגיאה הריבועית הממוצעת (mean square error) בין התמונה המקורית לתמונה המשוחזרת.

ניתן לחשב את ה-FID באמצעות ממוצעים ומטריצות שרירותיות (covariance matrices) כפי שמופיע ב- משוואה 2833:

משוואת מרחק פרשה אינצפציה (FID); שיטה סטטיסטית; נוסחה להערכת איכות תמונה.   (28)

כאן, μr הוא ערך הממוצע של התמונה האמיתית, μg הוא ערך הממוצע של התמונה הנוצרת, ו-Σr ו-Σg הן מטריצות השביעות (covariance matrix) של התמונות האמיתיות והנוצרות, בהתאמה.

להשוואת ביצועים, המסגרת המוצעת הוערכה אל מול שיטות מייצגות הנפוצות לסגמנטציה סמנטית, שחזור תמונות ויצירת תמונות אמנותיות. U-Net ו-DeepLabV3+ נכללו כבסיסי השוואה (baselines) לסגמנטציה, בעוד ש-Pix2Pix ו-CycleGAN נכללו כבסיסי השוואה לשחזור. StyleGAN ו-AttentionGAN שימשו כשיטות מייצגות ליצירת תמונות אמנותיות. השוואות אלו נערכו כדי להעריך את יעילותה של SegCycle-SPADE בשימור מידע על מוטיבים מבניים תוך שיפור סימולטני של האיכות האמנותית.

כל ניסוי חזר חמש פעמים כדי להעריך את יציבות הביצועים ואת השחזוריות. נעשה שימוש בזרע אקראי (random seed) קבוע של 42 עבור חלוקת מערך הנתונים כדי להבטיח תתי-קבוצות עקביות של אימון, תיקוף ובדיקה בכל הניסויים. התוצאות מדווחות כממוצע ± סטיית תקן. ערכי סטיית התקן הנמוכים שנצפו עבור Accuracy, IoU, Dice, SSIM, PSNR ו-FID מעידים על כך שהמסגרת המוצעת השיגה ביצועים יציבים לאורך הרצות ניסוייות חוזרות. מובהקות סטטיסטית הוערכה באמצעות מבחני t מזווגים, והבדלים נחשבו למובהקים סטטיסטית כאשר p < 0.05. מכיוון שכל המודלים הוערכו על אותן חלוקות של מערך הנתונים, התקבלו מדידות ביצועים מזווגות לאורך הרצות חוזרות, מה שהצדיק את השימוש במבחני t מזווגים. כדי לשלוט בשיעור השגיאה המשפחתי (family-wise error rate) הקשור להשוואות זוגיות מרובות, הוחל תיקון בונפרוני (Bonferroni correction), ומובהקות סטטיסטית נקבעה באמצעות סף מותאם של α/n, כאשר n מציין את מספר ההשוואות הזוגיות.

הממצאים הניסיוניים תומכים רשמיים ביעילותו של מסגרת ה-SegCycle-SPADE המוצעת. ביצועי הסגמנטציה העדיפים שהושגו על ידי SegFormer-B2 מדגימים את יכולתו לזהות ולשמר במדויק גבולות של מוטיבים בעלי חשיבות תרבותית. שיפורים במדדי IoU ו-Dice מעידים עוד על שימור יעיל של מבני מוטיבים סמנטיים לאורך צינור העיבוד. השילוב של CycleGAN ו-SPADE שחזר בהצלחה מבני מוטיבים חסרים תוך שמירה על פרטים חזותיים עדינים, כפי שמשתקף בערכי SSIM ו-PSNR המשופרים. יתרה מכך, מדדי FID נמוכים יותר מעידים על כך שהדפוסים האמנותיים הנוצרו מראים דמיון רב יותר לתמונות תרבותיות ואמנותיות אותנטיות, מה שמרמז על קוהרנטיות סגנונית וריאליזם חזותי משופרים.

ה-CAFFM תרם משמעותית לשיפורים אלו על ידי ייזום אינטראקציה יעילה בין מידע מבני הנגזר מפילוח (segmentation) לבין ייצוגי סגנון גנרטיביים. באמצעות היתוך מאפיינים המבוסס על קשב-צולב (cross-attention), ה-CAFFM שיפר הן את הנאמנות המבנית והן את האותנטיות האמנותית, תוך שימור קשרים ארוכי-טווח בין מוטיבים תרבותיים.

איור 6 מציג את השוואת דיוק הסגמנטציה בין מסגרת ה-SegCycle-SPADE המוצעת לבין שיטות קיימות במאגרי הנתונים Miao Batik ו-WikiArt. גישות סגמנטציה מסורתיות כגון U-Net ו-DeepLabV3+ השיגו ביצועים תחרותיים בשל יכולתן ללמוד ייצוגים מרחביים. עם זאת, Pix2Pix ו-CycleGAN הדגימו דיוק סגמנטציה נמוך יותר כיוון שלא תוכננו במיוחד למשימות סגמנטציה. מסגרת ה-SegCycle-SPADE המוצעת השיגה את דיוק הסגמנטציה הגבוה ביותר בשני מאגרי הנתונים הודות לשילוב של SegFormer-B2 והעשרת מאפיינים מבוססת CAFFM.

גרף דיוק סגמנטציה; השוואה בין שיטות U-Net, DeepLabV3+, Pix2Pix, CycleGAN, SegCycle-SPADE.
איור 6. השוואת דיוק הסגמנטציה בין שיטות שונות. השוואת דיוק הסגמנטציה שהתקבלו באמצעות U-Net, DeepLabV3+, Pix2Pix, CycleGAN ומסגרת SegCycle-SPADE המוצעת על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פס השגיאה מייצגים סטיית תקן אחת. ערכים גבוהים יותר מעידים על ביצועי סגמנטציה משופרים. מסגרת SegCycle-SPADE המוצעת השיגה את דיוק הסגמנטציה הגבוה ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7 מציג את השוואת ה-IoU בין השיטות שנבחנו. U-Net ו-DeepLabV3+ השיגו ביצועי חפיפה חזקים בשל ארכיטקטורות המכוונות לסגמנטציה. לעומת זאת, Pix2Pix ו-CycleGAN הניבו ערכי IoU נמוכים יותר, מכיוון שמטרתן העיקרית היא תרגום תמונה ולא סגמנטציה סמנטית. מסגרת SegCycle-SPADE המוצעת השיגה את ערכי ה-IoU הגבוהים ביותר בשני מאגרי הנתונים, מה שמעיד על שיפור במיקום ובשימור של אזורי מוטיבים תרבותיים.

השוואת מדדי IoU, תרשים עמודות; שיטות סגמנטציה מול מאגרי הנתונים Miao Batik ו-WikiArt; ממוצע ± SD.
איור 7. השוואת מדדי Intersection over Union (IoU) עבור סגמנטציה של מוטיבים תרבותיים. השוואת ביצועי IoU בין שיטות סגמנטציה שונות על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פסי השגיאה מצביעים על סטיית תקן אחת. ערכי IoU גבוהים יותר מעידים על חפיפה משופרת בין אזורי המוטיבים החזויים לאלו של הייחוס, ועל שימור טוב יותר של גבולות המוטיבים. מסגרת SegCycle-SPADE המוצעת השיגה את מדדי ה-IoU הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 8 מציג את השוואת מקדם דמיון דייס (Dice Similarity Coefficient). מדד דייס מודד את החפיפה בין מסכות הסגמנטציה שנחזו לבין אזורי המוטיב המהווים את ה-ground-truth. גישות סגמנטציה קונבנציונליות השיגו ציוני Dice גבוהים יחסית בשל יעילותן בלמידת מבנים מרחביים. עם זאת, מסגרת SegCycle-SPADE המוצעת השיגה את ציוני ה-Dice הגבוהים ביותר בשני מאגרי הנתונים, ובכך הדגימה שיפור בעקביות הסגמנטציה ובשימור המוטיבים.

גרף מקדם דייס (Dice coefficient) עבור סגמנטציית מוטיבים; שיטות: U-Net, DeepLabV3+, Pix2Pix, CycleGAN.
איור 8. השוואה של מקדם דייס עבור סגמנטציית מוטיבים תרבותיים. השוואה של ערכי מקדם דייס שהתקבלו באמצעות גישות סגמנטציה שונות על מאגרי הנתונים Miao Batik ו-WikiArt. מקדם הדייס מעריך את החפיפה בין מסכות הסגמנטציה החזויות למסכות הייחוס, כאשר ערכים גבוהים יותר מעידים על ביצועי סגמנטציה משופרים וזיהוי מדויק יותר של אזורי המוטיב. מסגרת SegCycle-SPADE המוצעת השיגה את ערכי מקדם הדייס הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 9 מציג את השוואת ה-SSIM בין תבניות תרבותיות ששוחזרו. שיטות מבוססות GAN כגון Pix2Pix, CycleGAN ו-StyleGAN השיגו ערכי SSIM גבוהים יותר משיטות סגמנטציה מסורתיות, מכיוון שהן תוכננו ליצירת תמונות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את ערכי ה-SSIM הגבוהים ביותר בשני מאגרי הנתונים, דבר המעיד על שימור מעולה של פרטים מבניים וקוהרנטיות אמנותית.גרף עמודות של השוואת דמיון מבני; ציוני SSIM עבור Pix2Pix, CycleGAN וכו' במאגרי נתונים.

איור 9השוואה של מדד דמיון מבני (SSIM). השוואה של ערכי מדד דמיון מבני (SSIM) שהתקבלו באמצעות שיטות שחזור שונות על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פסי השגיאה מציינים סטיית תקן אחת. ערכי SSIM גבוהים יותר מעידים על דמיון מבני רב יותר בין התבניות המשוחזרות לתבניות הייחוס. מסגרת ה-SegCycle-SPADE המוצעת השיגה את ציוני ה-SSIM הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

נעשה שימוש ב-FID כדי להעריך את רמת הריאליזם ואת הדמיון ההתפלגותי של הדפוסים האמנותיים שנוצרו. חישוב ה-FID בוצע באמצעות רשת Inception-v3 מאומנת מראש, כאשר וקטורי מאפיינים חולצו משכבת pool3, מה שהביא לייצוגי מאפיינים בעלי 2048 ממדים. לפני חילוץ המאפיינים, התמונות שנוצרו ותמונות הייחוס שונו לגודל של 299 × 299 פיקסלים באמצעות אינטרפולציה ביליניארית ונורמלו בהתאם לפרוטוקול עיבוד המקדמי הסטנדרטי של Inception-v3. ה-FID חושב באמצעות התפלגויות מאפיינים שחולצו מתוך מערך נתוני הבדיקה העצמאי. סטטיסטיקות הממוצע והשונות המשותפת (covariance) נאמדו מהטמעות המאפיינים ושימשו בתוך נוסחת ה-FID הסטנדרטית.

כפי שמוצג ב-טבלה 4, גישות קונבנציונליות להפקת תמונות כגון Pix2Pix ו-CycleGAN הניבו ציוני FID גבוהים יחסית מכיוון שהן היו חסרות הכוונה מבנית מפורשת. StyleGAN ו-AttentionGAN השיגו ציוני FID נמוכים יותר הודות ליכולות למידת תכונות משופרות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את ציוני ה-FID הנמוכים ביותר בשני מאגרי הנתונים, ובכך הדגימה ריאליזם תמונתי, עקביות סגנונית ושימור מוטיבים תרבותיים מעולים.

שיטהמאגר הנתונים Miao Batik (FID)סט הנתונים WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (מוצע)28.531.2

טבלה 4: תוצאות מרחק Frechet Inception (FID) עבור שחזור דגמים תרבותיים. השוואה של מדדי מרחק Frechet Inception (FID) שהתקבלו באמצעות מסגרת SegCycle-SPADE המוצעת ומודלים גנרטיביים בסיסיים על מאגרי הנתונים Miao Batik ו-WikiArt. ערכי FID נמוכים יותר מעידים על דמיון רב יותר בין התפלגויות התכונות של התמונות הנוצרות לבין התמונות האמיתיות, ולפיכך משקפים ריאליזם חזותי משופר של הדגמים התרבותיים המשוחזרים.

איור 10 משווה את איכות השחזור שהושגה בשיטות שונות. איכות השחזור (%) חושבה על ידי המרת ה-SSIM בין התמונה המשוחזרת לתמונת הייחוס המתאימה לסולם אחוזים (SSIM × 100). אחוזים גבוהים יותר מעידים על נאמנות מבנית גבוהה יותר ודמיון חזותי רב יותר למוטיב התרבותי המקורי. מודלים גנרטיביים קונבנציונליים כגון Pix2Pix ו-CycleGAN הניבו ביצועי שחזור בינוניים. ארכיטקטורות מתקדמות יותר, כולל StyleGAN ו-AttentionGAN, הניבו איכות שחזור משופרת הודות ליכולות למידת מאפיינים משופרות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את איכות השחזור הגבוהה ביותר, בשל השילוב של הנחיית סגמנטציה סמנטית, היתוך מאפיינים ב-cross-attention, למידת שחזור וסינתזה אמנותית.

תרשים השוואת איכות השחזור; שיטות: Pix2Pix, CycleGAN, StyleGAN, AttentionGAN, SegCycle-SPADE.
איור 10. השוואה של איכות שחזור התבניות. השוואה של איכות השחזור שהושגה באמצעות Pix2Pix, CycleGAN, StyleGAN, AttentionGAN ומסגרת ה-SegCycle-SPADE המוצעת על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמישה הרצות עצמאיות (n = 5). פסי השגיאה מצביעים על סטיית תקן אחת. ערכים גבוהים יותר מעידים על שיפור בשימור פרטים מבניים, עקביות סמנטית ונאמנות ויזואלית. מסגרת ה-SegCycle-SPADE המוצעת השיגה את ציוני איכות השחזור הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

השימוש ב-PSNR נועד להעריך את נאמנות השחזור על ידי מדידת הדמיות ברמת הפיקסל בין התמונות המשוחזרות לתמונות הייחוס המתאימות. ה-PSNR חושב עבור כל תמונה משוחזרת אל מול תמונת ה-Miao Batik המקורית המשמשת כייחוס ה-ground-truth. ערכי PSNR גבוהים יותר מעידים על שגיאת שחזור נמוכה יותר. כפי שמוצג ב-Table 5, המודלים Pix2Pix ו-CycleGAN השיגו ערכי PSNR בינוניים כיוון שהם שחזרו תבניות ללא הנחיה מבנית מפורשת. StyleGAN ו-AttentionGAN השיגו ערכי PSNR גבוהים יותר הודות ללמידת מאפיינים עמוקה יותר. מסגרת ה-SegCycle-SPADE המוצעת השיגה את ערכי ה-PSNR הגבוהים ביותר בשני מאגרי הנתונים, ובכך הדגימה נאמנות שחזור מעולה ושימור של מבני מוטיבים תרבותיים.

שיטהמערך נתוני Miao Batik
(PSNR, dB)
מאגר הנתונים WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (מוצע)32.431.2

טבלה 5: תוצאות יחס אות לרעש שיא (PSNR) עבור שחזור תבניות תרבותיות. השוואה של ערכי יחס אות לרעש שיא (PSNR) שהתקבלו באמצעות מסגרת ה-SegCycle-SPADE המוצעת ושיטות בסיס (baseline) על גבי מאגרי הנתונים Miao Batik ו-WikiArt. ערכי PSNR גבוהים יותר מעידים על נאמנות שחזור משופרת ועיוות מופחת ביחס לתמונות הייחוס המתאימות.

איור 11 ממחיש את התנהגות ההתכנסות של מסגרת ה-SegCycle-SPADE המוצעת במהלך האימון. עקומות ההפסד מייצגות את ממוצעי הפסדי האימון הממוצעים על פני חמישה הרצות אימון בלתי תלויות. כדי להפחית שונות סטוכסטית ולספק ייצוג חסון יותר של התכנסות האימון, ערכי ההפסד שוכללו בכל תקופה (epoch) על פני כל ההרצות. במהלך תקופות האימון הראשונות, ערכי ההפסד היו גבוהים יחסית מכיוון שהמודל עדיין למד ייצוגי מאפיינים מנתוני הקלט. עם התקדמות האימון, כל רכיבי ההפסד פחתו בהדרגה והתייצבו, דבר המעיד על אופטימיזציה מוצלחת של יעדי הסגמנטציה, השחזור והסינתזה האמנותית. התנהגות ההתכנסות שנצפתה מדגימה את היעילות, היציבות והשחזוריות של המסגרת המוצעת במהלך האימון.

גרף התכנסות האימון, מסגרת SegCycle-SPADE. loss מול epochs; L_total, L_seg, L_G, L_D.
איור 11. התכנסות האימון של מסגרת ה-SegCycle-SPADE המוצעת. עקומות ה-loss של האימון עבור מסגרת ה-SegCycle-SPADE המוצעת לאורך 100 epochs של אימון, ממוצעות על פני חמש הרצות אימון עצמאיות (n = 5). האיור מדגים את ההתפתחות של ה-loss הכולל (LTotal), ה-loss של הסגמנטציה (LSeg), ה-loss של הגנרטור (LG) וה-loss של הדיסקרימינטור (LD) במהלך האימון. ההפחתה ההדרגתית וההתייצבות העוקבת של כל רכיבי ה-loss מעידות על התכנסות מוצלחת ואופטימיזציה יציבה של המסגרת המוצעת. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

מחקר אבלציה (Ablation Study)
כדי להעריך את התרומה של כל רכיב בתוך מסגרת ה-SegCycle-SPADE המוצעת, נערך מחקר אבלציה באמצעות מספר תצורות מודל מבוקרות. התוצאות מסוכמות בטבלאות 6 ו-7.

תצורת מודלדיוק סגמנטציה (%)IoUSSIM
SegFormer בלבד87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (המוצע)93.80.860.93

טבלה 6: מחקר אבלציה (Ablation Study) של רכיבי SegCycle-SPADE. השוואת ביצועים של תצורות מודל המשופרות בהדרג כדי להעריך את התרומה של רכיבי מסגרת עבודה בודדים. המחקר בוחן את ההשפעות של סגמנטציה סמנטית, מודול מיזוג תכונות תרבותיות באמצעות קשב צולב (CAFFM), שחזור מבוסס CycleGAN וסינתזה אמנותית מבוססת SPADE על דיוק הסגמנטציה, מדד החיתוך מעל האיחוד (IoU) ומדד הדמיון המבני (SSIM). ערכים גבוהים יותר מעידים על שיפור בסגמנטציה של מוטיבים, באיכות השחזור ובשימור המבני.

גרסהIoU (%)מדד דייס (%)מדד הדמיון המבני (SSIM)PSNR (dB)FID ↓
SegFormer בלבד84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (מודל מלא)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

טבלה 7: ניתוח תרומת רכיבים עבור מסגרת ה-SegCycle-SPADE המוצעת. השוואת ביצועים של וריאנטים בודדים של המסגרת ששימשו להערכת התרומה של CAFFM, CycleGAN, SPADE והארכיטקטורה המלאה של SegCycle-SPADE. התוצאות מדווחות באמצעות Intersection over Union (IoU), מקדם Dice, מדד דמיון מבני (SSIM), יחס אות לרעש שיא (PSNR) ומרחק Frechet Inception Distance (FID). ערכי IoU, Dice, SSIM ו-PSNR גבוהים יותר מעידים על איכות סגמנטציה ושחזור משופרת, בעוד שערכי FID נמוכים יותר מעידים על ריאליזם ויזואלי רב יותר של דגמים תרבותיים שנוצרו.

טבלה 6 מעריכה את התרומה המצטברת של מרכיבי המסגרת העיקריים באמצעות ארבע תצורות: (i) SegFormer בלבד, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, ו-(iv) SegFormer + CAFFM + CycleGAN + SPADE (המסגרת המוצעת). מודל ה-SegFormer הבסיסי השיג דיוק סגמנטציה של 87.3%, ציון IoU של 0.76 וערך SSIM של 0.82. שילוב מודול ה-CAFFM שיפר את הביצועים בכל מדדי ההערכה, והעלה את דיוק הסגמנטציה ל-89.6%, את ה-IoU ל-0.79 ואת ה-SSIM ל-0.86. הוספת CycleGAN שיפרה עוד יותר את יכולת השחזור המבני, מה שהוביל ל-IoU של 0.82 ולערך SSIM של 0.89. מסגרת ה-SegCycle-SPADE המלאה השיגה את הביצועים הכוללים הטובים ביותר, עם דיוק סגמנטציה של 93.8%, IoU של 0.86 וערך SSIM של 0.93. תוצאות אלו מדגימות כי כל מרכיב תורם באופן הדרגתי לשיפור דיוק הסגמנטציה, השמירה המבנית ואיכות שחזור התמונה.

טבלה 7 בוחנת לעומק את התרומה של רכיבי התשתית הבודדים באמצעות חמישה וריאנטים של המודל: (i) SegFormer בלבד, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, ו-(v) המודל המלא המשלב את SegFormer, CAFFM, CycleGAN, SPADE, ו-motif-preservation loss. הביצועים הוערכו באמצעות מדדי IoU, Dice coefficient, SSIM, PSNR ו-FID.

תצורת הבסיס המבוססת על SegFormer בלבד השיגה IoU של 84.2%, מקדם Dice של 88.5%, ערך SSIM של 0.82, PSNR של 24.8 dB וציון FID של 31.8. הוספת CycleGAN שיפרה את איכות השחזור והפחיתה את ציון ה-FID ל-27.5, דבר המעיד על ריאליזם משופר של התמונה. שילוב של SPADE שיפר עוד יותר את הדמיון המבני ואת איכות התמונה, והביא לערך SSIM של 0.88 ולציון FID של 23.4. הכללת מודול ה-CAFFM המוצע הניבה שיפורים משמעותיים בכל המדדים, והגבירה את ה-IoU ל-90.0%, את מקדם ה-Dice ל-93.1%, את ה-SSIM ל-0.90 ואת ה-PSNR ל-29.6 dB, בעוד שציון ה-FID הופחת ל-20.3. המודל המלא, המשלב בנוסף את פונקציית ההפסד לשימור מוטיבים (motif-preservation loss), השיג את הביצועים הכוללים הטובים ביותר עם IoU של 93.0%, מקדם Dice של 95.4%, ערך SSIM של 0.92, PSNR של 31.2 dB וציון FID של 17.6.

טבלה 8 מציגה סקירה השוואתית של גישות DL מייצגות המשמשות לשחזור ושימור של דגמים במורשת תרבותית. שיטות קונבנציונליות מבוססות CNN מספקות למידה יעילה של תכונות מקומיות וביצועי סגמנטציה, אך לעיתים קרובות מתקשות לשמר מבני מוטיבים מורכבים בשל מידול מוגבל של תלויות ארוכות טווח. גישות מבוססות GAN משפרות את יכולות סינתזת התמונות והעברת הסגנון; עם זאת, הן עלולות לסבול מחוסר עקביות סמנטית ומאובדן של פרטים מבניים עדינים. שיטות מבוססות Transformer משפרות את הבנת ההקשר הגלובלי, אך בדרך כלל חסרות יכולות שחזור גנרטיביות, בעוד ששיטות מבוססות דיפוזיה (diffusion) מציעות ריאליזם ויזואלי גבוה במחיר של מורכבות חישובית מוגברת. גישות היברידיות של Transformer-GAN נותנות מענה חלקי למגבלות אלו על ידי שילוב של מנגנוני חילוץ תכונות ויצירת תמונות. לעומת זאת, מסגרת ה-SegCycle-SPADE המוצעת משלבת סגמנטציה מבוססת transformer, היתוך תכונות באמצעות cross-attention, שחזור גנרטיבי וסינתזה אמנותית מונחית-סגמנטציה בתוך ארכיטקטורה מאוחדת, ובכך משפרת את הדיוק המבני, העקביות הסמנטית ושימור המוטיבים התרבותיים. ההשוואה מסוכמת בטבלה 8.

גישהמתודולוגיית ליבהיתרונותמגבלותרלוונטיות למורשת תרבותית
שיטות מבוססות CNN (למשל, U-Net, DeepLabV3+)חילוץ מאפיינים קונבולוציוני וסגמנטציה סמנטיתלמידה יעילה של מאפיינים מקומיים וסגמנטציה מדויקתמידול מוגבל של תלויות לטווח רחוק; קושי בשימור מבני מוטיבים מורכביםמתאימה לסגמנטציה של מוטיבים אך פחות יעילה לשחזור אמנותי
שיטות מבוססות GAN (למשל, Pix2Pix, CycleGAN)יצירת תמונות אדוורסריאלית ותרגום תמונה-לתמונהסינתזת תמונות באיכות גבוהה והעברת סגנוןחוסר יציבות באימון; חוסר עקביות סמנטית; פגישה פוטנציאלית בפרטים מבניים עדיניםמועילה לשחזור תבניות אך עשויה שלא לשמר מוטיבים תרבותיים בצורה מדויקת
שיטות מבוססות Transformerמנגנון קשב עצמי (Self-attention) ומידול הקשר גלובלילוכדת תלויות לטווח רחוק ומערכות יחסים חזותיות מורכבותעלות חישובית גבוהה; דורשת מאגרי נתונים גדולים לאימוןיעילה לניתוח תבניות מורכבות אך בעלת יכולת גנרטיבית מוגבלת כאשר היא משמשת לבדה
שיטות מבוססות Diffusionיצירת תמונות המבוססת על הסרת רעשים (denoising) איטרטיביתריאליזם חזותי גבוה ומגוון תמונותמהירות הסקה איטית; דרישות חישוביות גבוהות; בקרה מבנית מוגבלתמבטיחה ליצירת תמונות מורשת, אך אינטנסיבית מבחינה חישובית
שיטות היברידיות של Transformer-GANשילוב של חילוץ מאפיינים מבוסס Transformer ויצירה מבוססת GANייצוג משופר של מאפיינים גלובליים ואיכות תמונה גבוההלעתים חסרה הנחיה סמנטית מפורשת לשימור מוטיביםמשפרת את איכות היצירה אך אינה מתוכננת ספציפית עבור מוטיבים של מורשת תרבותית
SegCycle-SPADE המוצעתSegFormer + CAFFM + CycleGAN + SPADEסגמנטציה מבוססת Transformer, היתוך מאפיינים מונחה-קשב, עקביות סמנטית, שימור מוטיבים ושחזור אמנותי שניתן לשליטהמורכבות חישובית גבוהה יותר מאשר גישות מבוססות CNN בלבדתוכננה ספציפית לשחזור ושימור של תבניות מורשת תרבותית עם נאמנות מבנית ועקביות סמנטית משופרות

טבלה 8: השוואה בין גישות למידה עמוקה מייצגות לשחזור ושימור דפוסים של מורשת תרבותית.השוואה איכותית של גישות למידה עמוקה מייצגות המשמשות לסגמנטציה של תמונות, שחזור דפוסים, יצירת סגנון ושימור מורשת תרבותית. הטבלה מסכמת את מתודולוגיית הליבה, נקודות החוזק, המגבלות והישימות של כל גישה, ומדגישה כיצד מסגרת ה-SegCycle-SPADE המוצעת משלבת סגמנטציה סמנטית, היתוך תכונות, שחזור וסינתזת סגנון כדי לתת מענה לאתגרים הקשורים לשימור מבני ועקביות סמנטית בדפוסים של מורשת תרבותית.

השיפורים שנצפו מדגימים כי מודול ה-CAFFM משפר ביעילות את האינטראקציה בין מאפיינים מבניים המופקים מסגמנטציה לבין ייצוגי סגנון אמנותי, וזאת באמצעות היתוך מאפיינים מבוסס cross-attention. יתרה מכך, ה-motif-preservation loss תורם לשמירה על מבני מוטיבים בעלי חשיבות תרבותית במהלך השחזור והסינתזה האמנותית, מה שמוביל לשיפור בעקביות הסגמנטציה, בנאמנות המבנית ובריאליזם הוויזואלי. יחד, תוצאות ה-ablation מאששות כי השילוב של SegFormer-B2, CAFFM, CycleGAN, SPADE ו-motif-preservation loss הוא הגורם לביצועים העליונים של מסגרת ה-SegCycle-SPADE המוצעת.

זמינות נתונים:
מערך הנתונים WikiArt ששימש ללמידת סגנון אמנותי זמין לציבור דרך מאגר הנתונים Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). מערך הנתונים Miao Batik ששימש במחקר זה זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658). מערכי הנתונים המעובדים, מסיכות הסגמנטציה, משקולות המודל המאומנים מראש, הפלטים שהופקו וקבצי מימוש השפה Python הקשורים למסגרת SegCycle-SPADE המוצעת זמינים אף הם דרך אותו מאגר ב-Zenodo.

קובץ נלווה:
קובץ נלווה 1. אלגוריתם 1: תהליך היישום של מסגרת ה-SegCycle-SPADE המוצעת. פסאודו-קוד שלב-אחר-שלב המתאר את צינור היישום המלא של מסגרת ה-SegCycle-SPADE המוצעת, כולל טעינת מערך נתונים, עיבוד מקדים, סגמנטציה סמנטית באמצעות SegFormer-B2, מיזוג מאפיינים באמצעות מודול מיזוג מאפיינים תרבותיים בשיטת Cross-Attention (CAFFM), שחזור מוטיבים תרבותיים באמצעות CycleGAN, סינתזת סגנון אמנותי באמצעות SPADE, אימון המודל, תיקוף, בחירת נקודות ביקורת (checkpoints) והערכה סופית של הביצועים. אנא לחצו כאן להורדת הקובץ.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השימור והשחזור הדיגיטלי של דגמי ICH זכו לתשומת לב גוברת בשנים האחרונות בשל האובדן ההדרגתי של מלאכות מסורתיות. מחקרים קודמים ניסו לטפל באובדן המורשת התרבותית באמצעות טכניקות עיבוד תמונה מבוססות DL. לדוגמה, Quan et al.32 הציעו מסגרת לשימור מורשת תרבותית המבוססת על גרפי ידע ו-DL עבור תרבות הבאטיק של מיאו בְּ-Guizhou. למרות שהמחקר התמקד בשחזור דיגיטלי של דגמים תרבותיים, המתודולוגיה שלו הייתה תלויה בעיקר בייצוגים של גרפי ידע. באופן דומה, Fu ו-Razmjooy16 הציעו מסגרת המבוססת על רשת פירמידת מאפיינים (FPN) לשיפור ושחזור של תמונות מורשת תרבותית. למרות ששיטה זו סיפקה חילוץ מאפיינים יעיל לשיפור התמונה, היא לא שילבה הנחיית סגמנטציה של תמונות או מנגנוני שחזור גנרטיביים עבור דגמים תרבותיים חסרים. לעומת זאת, מסגרת SegCycle-SPADE המוצעת משלבת מספר רכיבי DL כדי להתגבר על אתגרים אלו. ראשית, נעשה שימוש בסגמנטציה סמנטית באמצעות מודל SegFormer לזיהוי מדויק של אזורי מוטיבים בתוך דגמי מורשת תרבותית. לאחר מכן, מודול שיפור מאפיינים מבוסס CAFFM משפר את ייצוגי המאפיינים עבור מבני מוטיבים בעלי רזולוציה גבוהה. לאחר מכן, מודול שחזור CycleGAN משמש לשחזור אזורים חסרים או לא שלמים בתוך דגמים תרבותיים באמצעות למידה אדברסרית. לבסוף, מודול SPADE מבצע שיפור סגנוני תוך שמירה על יישור מבני עם מפות הסגמנטציה. שיטות קיימות מבוססות CNN, GAN, transformer ו-diffusion17,19,20,21,22,23,24,25,30,34 מציעות כל אחת יתרונות ייחודיים; עם זאת, הן מציגות גם מגבלות בשמירה על עקביות סמנטית, שימור מאפיינים מבניים או השגת יעילות חישובית, כפי שמסוכם ב-Table 8. ארכיטקטורת SegCycle-SPADE המוצעת משלבת את החוזקות של סגמנטציה מבוססת SegFormer, מיזוג מאפיינים באמצעות cross-attention, שחזור CycleGAN וסינתזה מונחית SPADE תוך טיפול במגבלות אלו. כתוצאה מכך, המסגרת משיגה איכות שחזור משופרת ושימור משופר של מוטיבים בעלי חשיבות תרבותית.

למרות ביצועיו המעודדים, מסגרת ה-SegCycle-SPADE המוצעת עדיין סובלת ממספר מגבלות. ראשית, ההערכה בוצעה באמצעות מערכי הנתונים Miao Batik ו-WikiArt בלבד, דבר העשוי להגביל את יכולת ההכללה של המסגרת לתחומי מורשת תרבותית אחרים. שנית, פריסה על פלטפורמות עם משאבים מוגבלים עשויה להיות מאתגרת, כיוון שהשילוב של SegFormer, CAFFM, CycleGAN ו-SPADE מגביר את המורכבות החישובית ואת דרישות הזיכרון. שלישית, ביצועי הסגמנטציה תלויים רבות באיכות ובעקביות של ההערות (annotations) של המנימוטים, והטיה בהערות עלולה להשפיע על שימורם של מבנים בעלי חשיבות תרבותית. לבסוף, כיוון שהמסגרת הוערכה באמצעות שני מערכי נתונים בלבד, ייתכן שיהיה צורך בנתוני אימון נוספים ובהתאמות ספציפיות לתחום כדי להבטיח את התאימות לאוספי מורשת תרבותית מגוונים. על כן, מחקרים עתידיים צריכים לבחון אסטרטגיות אימון חסונות יותר, ארכיטקטורות קלות משקל, נהלי הערה משופרים והערכות חוצות-תחומים באמצעות מערכי נתונים נוספים של מורשת תרבותית.

היכולת להרחבה (scalability) של מסגרת ה-SegCycle-SPADE למאגרי נתונים גדולים ומגוונים יותר של מורשת תרבותית תהווה מוקד מרכזי במחקרים עתידיים. תיבחן הערכה בין-תרבותית של מוטיבים של מורשת מאזורים ומסורות אמנותיות שונות כדי לשפר את הכללת המודל ואת ההסתגלות התרבותית שלו. יתרה מכך, הרחבות מולטי-מודאליות המשלבות תיאורים טקסטואליים, רשומות היסטוריות ומטא-נתונים תרבותיים עשויות לספק הדרכה סמנטית חזקה יותר במהלך השחזור. ניתן יהיה להרחיב את המסגרת לתמוך גם בשחזור תלת-ממדי של מורשת תרבותית על ידי שילוב של שחזור מבוסס תמונה עם טכניקות מידול בתלת-ממד. בנוסף, ייבחנו אפשרויות פריסה בארכיונים דיגיטליים, מוזיאונים, תערוכות וירטואליות ופלטפורמות לשימור מורשת תרבותית כדי להקל על יישומים מעשיים של שימור ותיעוד מורשת בעזרת בינה מלאכותית. כדי לשפר עוד יותר את יכולת הפרשנות ואת האותנטיות התרבותית, עבודה עתידית תחקור את השילוב של גרפי ידע תרבותיים, תיעוד אתנוגרפי, מטא-נתונים היסטוריים ומאגרי ידע שנאצרו על ידי מומחים, כדי לאפשר ניתוח ושחזור של מוטיבים המבוססים על ידע תרבותי32.

יש לקחת בחשבון מספר שיקולים מעשיים בעת יישום מסגרת ה-SegCycle-SPADE המוצעת. במהלך אימון ה-CycleGAN, עלולה להתרחש התכנסות אדברסרית (adversarial convergence) לא יציבה אם תיווצר חוסר איזון משמעותי בין הפסדי הגנרטור (generator losses) לפסדי הדיסקרימינטור (discriminator losses). במצבים אלו, הפחתת קצב הלמידה (learning rate), הגדלת משקל הפסד עקביות המחזור (cycle-consistency loss weight), או ניטור הדומיננטיות של הדיסקרימינטור עשויים לשפר את יציבות האימון. קריסת מצב (Mode collapse) עלולה להתרחש כאשר הגנרטור מייצר שוב ושוב פלטים דומים ויזואלית; ניתן לצמצם בעיה זו באמצעות אימון אדברסרי מאוזן, שימוש במאגר שחזור (replay-buffer), וניטור קפדני של מגמות ההפסד בגנרטור ובדיסקרימינטור. כשלי סגמנטציה עלולים להתרחש גם כאשר מוטיבים תרבותיים מציגים טקסטורות מורכבות, ניגודיות נמוכה או גבולות מעומעמים. כדי לטפל בבעיה זו, יש לוודא את איכות התמונות לפני האימון, ולבצע בדיקה ויזואלית של מסכות הסגמנטציה כדי להבטיח עקביות באנוטציות. שמירה על רזולוציית הקלט המומלצת ועל הגדרות הנורמליזציה חשובה אף היא להשגת ביצועי SegFormer אמינים. חוסר יציבות באימון עשוי לנבוע עוד מהגדרות לא מתאימות של קצב הלמידה, נתוני אימון לא מספיקים או וריאציות מספריות הקשורות לחומרה. כדי לשפר את השחזוריות (reproducibility), יש להשתמש בזרעים אקראיים (random seeds) קבועים עבור NumPy, PyTorch, CUDA ופעולות ערבוב נתוני המערך (dataset-shuffling). יתר על כן, יש לשמור על אותו צינור עיבוד מקדים (preprocessing pipeline), אותן חלוקות של מערך הנתונים, אותם היפר-פרמטרים של המודל ואותה סביבת תוכנה בכל ההרצות הניסוייות. מומלץ גם לבצע שמירת נקודות ביקורת (checkpoint) תקופית וניטור של הפסד התיקוף (validation-loss) כדי למנוע ירידה בביצועים ולאפשר התאוששות ממפגשי אימון שהופסקו.

העבודה המוצעת תורמת לקידום התאורטי של מסגרות עבודה לשחזור מורשת תרבותית מבוססות AI. גישות קונבנציונליות לשיקום תמונות מתייחסות בדרך כלל לסגמנטציה של תמונות, שחזור ויצירת סגנון כתהליכים עצמאיים17,19,20,30. בניגוד לכך, מחקר זה מציע מסגרת עבודה המשלבת תהליכים אלו באמצעות אסטרטגיית שחזור גנרטיבית מונחית-סגמנטציה. כתוצאה מכך, המחקר תורם לפיתוח התאורטי של שחזור מורשת תרבותית בסיוע AI, על ידי הדגמה כיצד ניתן לאחד סגמנטציה, שחזור ויצירת סגנון בתוך מסגרת עבודה אחת. אינטגרציה כזו חשובה במיוחד ביישומים של מורשת תרבותית, שבהם שימור מבנה המוטיב והמשמעות הסמנטית הם קריטיים. מהיבט מעשי, מסגרת העבודה המוצעת מציעה פתרון יעיל לשימור דיגיטלי, שיקום והעשרה אמנותית של דגמים תרבותיים מסורתיים. מוסדות מורשת תרבותית, מוזיאונים ומעצבים יכולים להשתמש ב-SegCycle-SPADE כדי לזהות באופן אוטומטי אזורי מוטיב, לשחזר דגמים פגומים או חסרים, וליצור ייצוגים אמנותיים משופרים ויזואלית של עיצובים מסורתיים. יכולת זו בעלת ערך מיוחד עבור מסורות מלאכה בסכנת הכחדה, כולל דגמי טקסטיל של באטיק Miao, שבהם חפצים היסטוריים עשויים להיות פגומים חלקית או חסרים. יתרה מכך, באמצעות שילוב של סינתזת סגנון גנרטיבית, מסגרת העבודה עשויה לתמוך ביישומים מודרניים של עיצוב תרבותי כגון עיצוב טקסטיל, יצירה אמנותית דיגיטלית וחינוך למורשת. באופן זה, מסגרת העבודה המוצעת מגשרת על הפער בין שימור מורשת תרבותית לבין יישומי עיצוב תרבותי עכשוויים.

עם זאת, למרות התוצאות המבטיחות שהושגו על ידי מסגרת ה-SegCycle-SPADE המוצעת, נותרו מספר מגבלות. ראשית, ההערכה בוצעה באמצעות מאגרי הנתונים Miao Batik ו-WikiArt בלבד, מה שעשוי להשפיע על יכולת ההכללה של המסגרת לשחזור של צורות אחרות של דפוסי מורשת תרבותית. שנית, מכיוון שתהליך השחזור מסתמך על מודלים מבוססי GAN, פלטים שנוצרו עשויים להכיל מדי פעם ארטיפקטים או מרקמים לא טבעיים בעת התמודדות עם מבני מוטיבים מורכבים מאוד. שלישית, המסגרת מתמקדת כעת בשחזור של דפוסים דו-ממדיים, בעוד שחלק מחפצי המורשת התרבותית כוללים מבנים תלת-ממדיים מטבעם. באופן כללי, הממצאים הניסיוניים מדגימים את יעילותה של מסגרת ה-SegCycle-SPADE המוצעת לשחזור אמנותי של דפוסי ICH. השילוב של סגמנטציה סמנטית מבוססת SegFormer, CAFFM, שחזור מוטיבים מבוסס CycleGAN וסינתזה אמנותית מבוססת SPADE שיפר באופן עקבי את מדדי הביצועים של הסגמנטציה, השחזור ואיכות התמונה. מחקרי האבלאציה תיקפו עוד יותר את תרומתו של כל רכיב במסגרת, והראו כי CAFFM והפסד שימור המוטיבים שיפרו באופן משמעותי את הנאמנות המבנית ואת האותנטיות הוויזואלית. ממצאים אלו תומכים בהיפותזה המרכזית לפיה שחזור מונחה סגמנטציה סמנטית בשילוב עם מיזוג מאפיינים של cross-attention יכול לשמר ביעילות מוטיבים בעלי חשיבות תרבותית תוך יצירת פלטים עשירים מבחינה אמנותית. לפיכך, המסגרת המוצעת מספקת גישה חישובית מהימנה וניתנת לשחזור לשימור דיגיטלי, שיקום והחייאה יצירתית של דפוסי ICH.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ניגוד עניינים:
המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מודים על התמיכה האקדמית והמוסדית שניתנה על ידי Guangdong Engineering Polytechnic ו-South China Normal University במהלך השלמת מחקר זה. מחקר זה נתמך על ידי הפרויקט הכללי של הקרן הלאומית למדעי החברה לשנת 2023 (מס' 23BH161), תחת הכותרת “Digital Regeneration Museum: Research on the Activation and Communication of Chinese Classic Calligraphy and Painting Cultural Relics.”

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adam Optimizerספריית האופטימיזציה של PyTorchAdamאלגוריתם אופטימיזציה המשמש במהלך אימון המודל.
CUDA ToolkitNVIDIA CorporationCUDA 11.3האצת GPU לחישובים של למידה עמוקה.
cuDNNNVIDIA CorporationcuDNN 8.2ספריית האצה לרשתות עצביות עמוקות המשמשת להאצת אימון והסקה (inference).
CycleGANUniversity of California, Berkeley / קוד פתוחמימוש רשמי של PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)רשת יריב יוצרת (generative adversarial network) המשמשת לשחזור מוטיבים תרבותיים.
משקולות מאומנות של ImageNetImageNet / קוד פתוחmit_b2.pth (נקודת ביקורת מאומנת של ImageNet-1K)משמש לאתחול של שלד ה-SegFormer-B2 לפני כוונון עדין (fine-tuning) על מערך נתוני ה-Miao Batik.
מעבד IntelIntel CorporationIntel Core i7 (דור 11)CPU המשמש לעיבוד מקדים של תמונות, תמיכה באימון מודלים והסקה.
Matplotlibצוות הפיתוח של MatplotlibMatplotlib 3.5.1ויזואליזציה של עקומות אימון ותוצאות הערכה.
מערך נתוני Miao Batikמאגר ZenodoDOI: 10.5281/zenodo.20807658מערך נתוני מוטיבים תרבותיים המכיל 15,148 תמונות המשמשות לסגמנטציה סמנטית ושחזור תבניות.
NumPyמפתחי NumPyNumPy 1.21.5חישוב נומרי ועיבוד מערכי נתונים.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)פלטפורמת חומרה המשמשת לאימון מודלים והסקה.
OpenCVOpenCV FoundationOpenCV 4.5.5עיבוד מקדים של תמונות, שינוי גודל, אינטרפולציה וניקוי רעשים גאוסיאני.
מערכת הפעלהCanonical Ltd.Ubuntu 20.04 LTSסביבת ביצוע ניסיונית.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0טעינה ומניפולציה של תמונות.
PythonPython Software FoundationPython 3.8.10שפת תכנות המשמשת למימוש ולניסויים.
PyTorchMeta AIPyTorch 1.10.0מסגרת למידה עמוקה המשמשת לאימון מודלים והסקה.
גרעין אקראי (Random Seed)הגדרה ניסיונית42גרעין קבוע המשמש לחלוקת מערך הנתונים, אתחול מודלים ושחזור ניסיוני.
Scikit-learnמפתחי Scikit-learnScikit-learn 1.0.2חלוקת מערכי נתונים, ניתוח סטטיסטי ומדדי הערכה.
Seabornקהילת קוד פתוחSeaborn 0.11.2ויזואליזציה של נתונים סטטיסטיים.
SegFormer-B2NVIDIA Research / קוד פתוחSegFormer-B2 (שלד MIT-B2)מודל סגמנטציה סמנטית מבוסס Transformer המשמש לסגמנטציה של מוטיבים תרבותיים.
מסכות סגמנטציה / הערות (Annotations)מערך נתוני Miao Batikכלול במערך הנתוניםתוויות סגמנטציה סמנטית ברמת פיקסל המשמשות לסיווג מוטיבים ואימון.
SPADENVIDIA Research / קוד פתוחמימוש רשמי של PyTorch (https://github.com/NVlabs/SPADE)מודל סינתזה של תמונות מונחה-סגמנטציה המשמש ליצירת תבניות אמנותיות.
TorchVisionMeta AITorchVision 0.11.1כלי עיבוד תמונות והתמרות מערכי נתונים המשמשים עם PyTorch.
מערך נתוני WikiArtWikiArthttps://www.wikiart.org/מערך נתוני סגנונות אמנותיים המכיל יותר מ-80,000 יצירות אמנות ב-27 סגנונות אמנותיים, המשמש ללמידה וסינתזה של סגנונות.

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

מאמרים קשורים