مقالة بحثية

إعادة بناء وتخليق الأنماط الفنية للتراث الثقافي غير المادي الموجهة بالتجزئة الدلالية باستخدام إطار تعلم عميق

DOI:

10.3791/71577

أغسطس 14, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول سير عمل للتعلم العميق من أجل التجزئة الدلالية، وإعادة البناء، وتوليد الأنماط الفنية للتراث الثقافي غير المادي، وذلك باستخدام استخراج الميزات القائم على المحولات (transformer)، وإعادة البناء التنافسية، وتوليد الصور التكيفي مكانيًا لدعم الحفظ الرقمي وتطبيقات التراث الإبداعي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لقد حظي الحفظ الرقمي وإعادة بناء أنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد مع تقدم تقنيات توليد الصور القائمة على التعلم العميق. وقد أظهرت المنهجيات الحالية القائمة على SegCycle-SPADE إمكانات في التقسيم الهيكلي وإعادة البناء الفني لأنماط الحرف التقليدية؛ ومع ذلك، لا تزال هناك قيود قائمة، بما في ذلك محدودية تنوع مجموعة البيانات، وعدم كفاية دمج الدلالات الثقافية، وعدم الحفاظ بشكل كافٍ على ميزات الأنماط الهيكلية أثناء إعادة البناء. ولمعالجة هذه التحديات، تقترح هذه الدراسة إطار عمل SegCycle-SPADE مطوراً للتقسيم الدلالي وإعادة البناء الفني لأنواع أنماط التراث الثقافي غير المادي. تم استخدام نموذج تقسيم قائم على Transformer، وهو SegFormer، لتحديد حدود الزخارف ومناطق الأنماط بدقة. بالإضافة إلى ذلك، تم تقديم وحدة دمج الميزات الثقافية عبر الانتباه (Cross-Attention Cultural Feature Fusion Module) لتعزيز الزخارف ذات الأهمية الثقافية وتحسين تمثيل الميزات. ويتم تنفيذ ترجمة الأنماط وإعادة بنائها باستخدام CycleGAN، بينما يتم استخدام إلغاء التطبيع المتكيف مكانياً (SPADE) لتوليد الأسلوب الفني للحفاظ على الاتساق الدلالي بين خرائط التقسيم والصور المولدة. ولتحسين تعميم النموذج والتنوع الفني، تم تدريب إطار العمل باستخدام كل من مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. وتظهر النتائج التجريبية أن إطار عمل SegCycle-SPADE المقترح والموجه بالانتباه يحسن دقة التقسيم وأداء إعادة بناء أنماط التراث مقارنة بطرق إعادة البناء الحالية القائمة على الشبكات الخصومية التوليدية (GAN). ويوفر إطار العمل المقترح حلاً قابلاً للتوسع لتوثيق التراث الثقافي بمساعدة الذكاء الاصطناعي، وإعادة بنائه، وإحيائه فنياً من خلال تصميمات الأنماط التقليدية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يُعد التراث الثقافي، الذي يشمل العناصر غير المادية مثل العادات واللغات والمعتقدات، والعناصر المادية مثل الأعمال الفنية والمباني والسجلات المكتوبة، تجلياً أساسياً للتاريخ البشري والإبداع والهوية1. ويسعى الحفاظ على التراث إلى تمكين المجتمعات من إعادة التواصل مع أصولها، ويسمح للأجيال القادمة بالاستفادة من ذاكرتها الثقافية الجماعية. كما أنه يعزز التفاهم بين الثقافات، وتقدير التقاليد والعادات المتنوعة، والاعتراف بالروايات التاريخية المختلفة. وتساعدنا هذه الأصول الثقافية على فهم قيم ومنظورات وتجارب الأجيال السابقة، وتساهم في تكوين الهويات الاجتماعية المعاصرة والاستمرارية الثقافية. وقد تم توضيح المبادئ الأساسية لصون التراث الثقافي في الشكل 1.

مخطط إطار عمل SegCycle-SPADE؛ يتضمن SegFormer وCycleGAN وSPADE لإعادة بناء الصور.
الشكل 1. نظرة مفاهيمية عامة على إعادة بناء أنماط التراث الثقافي باستخدام إطار عمل SegCycle-SPADE. توضيح تخطيطي للمنهج المقترح لإعادة بناء وتعزيز أنماط التراث الثقافي غير المادي. يتضمن سير العمل جمع مجموعة البيانات من مجموعتي بيانات Miao Batik وWikiArt، والمعالجة المسبقة للصور، والتقسيم الدلالي باستخدام SegFormer-B2، ودمج السمات باستخدام وحدة دمج السمات الثقافية عبر الانتباه المتبادل (CAFFM)، وإعادة بناء الأنماط باستخدام CycleGAN، وتخليق الأسلوب الفني باستخدام SPADE، والتقييم النهائي باستخدام مقاييس التقسيم وإعادة البناء. تشير الأسهم إلى تدفق البيانات وتمثيلات السمات عبر إطار العمل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تتجسد الذاكرة الجماعية والإرث الثقافي للمجتمع البشري في التراث الثقافي غير المادي (ICH)، والذي يعمل كوسيط هام للتعبير الفني والهوية الثقافية. ومع ذلك، يواجه التراث الثقافي غير المادي تحديات كبيرة بسبب آثار العولمة والرقمنة2,3,4. وتتطلب العديد من ممارسات التراث الثقافي غير المادي المهددة بالاندثار مناهج جديدة للحفظ والتطوير، وذلك بسبب تناقص أعداد الحرفيين المهرة ومحدودية القدرة على التكيف مع الأسواق الحديثة5,6. وباعتباره مجالاً هاماً في أبحاث التراث الثقافي غير المادي، يركز التصميم المستدام على التطوير المتكامل للثقافة والمجتمع والبيئة، ويوفر مساراً عملياً لمواصلة الحفاظ على التراث الثقافي غير المادي. ومن خلال مناهج التصميم المستدام، يمكن إحياء التراث الثقافي غير المادي مع تكييفه ليتناسب مع احتياجات المجتمع المعاصر7,8.

في هذه الدراسة، يشير مصطلح "أنماط التراث الثقافي غير المادي" إلى التمثيلات الزخرفية البصرية التي تنقل وتحفظ القيم الثقافية غير المادية الكامنة. وبناءً على ذلك، يهدف الإطار المقترح إلى حفظ وتوثيق المعلومات الثقافية المرتبطة بهذه الزخارف أثناء إعادة بناء أشكالها البصرية.

يعد تطريز الباتيك وتطريز المياو من الأشكال الهامة للتراث الثقافي غير المادي في الصين، حيث يعكسان تاريخ مجتمع المياو ومعتقداتهم وتقاليدهم من خلال زخارف رمزية مثل الطيور والفراشات وطواطم الأسلاف9. وتتجذر هذه الزخارف بعمق في الملابس الطقسية وممارسات المهرجانات، كما تساهم في التنمية الثقافية والاقتصادية المحلية10,11. وقد خلقت التطورات في التقنيات الرقمية، ولا سيما الذكاء الاصطناعي (AI) والتعلم العميق (DL)، فرصاً جديدة للحفاظ على التراث الثقافي وتحليله وإعادة بنائه وتوثيقه. ويُعد باتيك مياو في غويتشو، وهو أحد أفضل تقاليد الباتيك حفظاً في الصين، وسيلة مهمة لنقل المعارف الثقافية والمعتقدات والعادات والطقوس الخاصة بشعب المياو12,13,14,15,16.

أظهرت الدراسات الحديثة إمكانات التعلم العميق (DL) في الحفاظ على التراث الثقافي وإعادة بناء الأنماط، حيث حققت دقة تقسيم محسنة (دقة البكسل = 88.6%، ومتوسط التقاطع فوق الاتحاد [IoU]= 78.1%) وأداءً أفضل في إعادة البناء مقارنة بنماذج U-Net وDeepLabV3+1. ومع ذلك، لا تزال هناك عدة تحديات؛ إذ غالباً ما تواجه النهج القائمة على الشبكات التنافسية التوليدية (GAN) صعوبة في الحفاظ على التفاصيل الهيكلية الدقيقة في الأنماط المعقدة17، بينما يحد تنوع مجموعات البيانات المحدود من قدرة النموذج على التعميم عبر المجالات الثقافية المختلفة18. بالإضافة إلى ذلك، قد تخفق نماذج ترجمة الصور إلى صور، مثل CycleGAN، في الحفاظ على الاتساق الدلالي بين خرائط التقسيم والصور المولدة19، كما يمكن أن يؤدي غياب آليات الانتباه إلى فقدان تفاصيل الزخارف ذات الأهمية الثقافية أثناء عملية إعادة البناء20. وبناءً على ذلك، تبرز الحاجة إلى إطار عمل محسن يدمج التقسيم القائم على المحولات (transformer)، وتعلم الميزات الموجه بالانتباه، والتدريب على مجموعات بيانات متعددة، وذلك من أجل إعادة بناء فعالة لأنماط التراث الثقافي غير المادي (ICH).

ظهرت فرص جديدة للحفاظ على التراث الثقافي من خلال رقمنة تطريز المياو (Miao) والتقدم السريع في الذكاء الاصطناعي التوليدي. وقد أظهرت نماذج الانتشار (Diffusion models)، وهي فئة ناشئة من النماذج التوليدية العميقة، أداءً ملحوظًا في مهام الرؤية الحاسوبية نظرًا لقدراتها القوية في توليد المحتوى21,22,23,24,25. وأثناء عملية الانتشار العكسي، يتعلم النموذج تدريجيًا كيفية إعادة بناء بيانات الإدخال الأصلية من تمثيلات مشوشة26,27,28. كما استكشفت الدراسات السابقة تطبيق تقنيات إعادة البناء ثلاثية الأبعاد والتصميم بمساعدة الحاسوب (CAD) من أجل الحفاظ على التراث الثقافي ونشره.

على الرغم من أن الشبكات العصبية الالتفافية (CNNs) وشبكات الخصومة التوليدية (GANs) تحقق أداءً جيداً في توليد الصور والحفاظ على السمات، إلا أنها لا تزال تواجه تحديات تتعلق بمحدودية المجالات الاستقبالية، وانهيار النمط، وعدم استقرار التدريب29. وتتفوق البنى القائمة على المحولات (Transformer)، مثل SegFormer وSegmenter، في التقاط السياق العالمي والعلاقات الدلالية؛ ومع ذلك، فهي تتطلب موارد حوسبية مكثفة وقد تواجه صعوبة في التعامل مع التفاصيل الدقيقة. ورغم أن نماذج الانتشار، مثل Stable Diffusion، تظهر قدرات قوية في توليد الصور، إلا أنها غالباً ما تفتقر إلى التحكم الدقيق في الخصائص الهيكلية والفنية للتصاميم المولدة. علاوة على ذلك، تعتمد معظم النهج الحالية استراتيجيات تدريب مستقلة تحد من التبادل الفعال للمعلومات والتحسين التعاوني بين مكونات التقسيم والتوليد، مما يؤدي إلى مقايضة بين الدقة الهيكلية والأصالة الفنية30.

تحقق النماذج الحديثة القائمة على الانتشار، مثل الانتشار الكامن (latent diffusion) وStable Diffusion، تخليقاً للصور بجودة عالية، ولكنها تتطلب عملية إزالة ضوضاء تكرارية، مما يؤدي إلى زيادة التكلفة الحسابية ووقت الاستنتاج. علاوة على ذلك، لا يزال الحفاظ على الزخارف الثقافية الدقيقة والاتساق الهيكلي أمراً صعباً دون وجود آليات تكييف متخصصة. وتنجح النماذج التوليدية القائمة على المحولات (Transformer) في التقاط العلاقات السياقية العالمية بفعالية، ولكنها غالباً ما تتطلب مجموعات بيانات واسعة النطاق وموارد حسابية كبيرة. وفي المقابل، يدمج إطار عمل SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) المقترح بين التقسيم القائم على SegFormer، ودمج الميزات عبر الانتباه المتبادل (cross-attention)، وإعادة بناء CycleGAN، والتخليق الموجه بواسطة SPADE لتوفير توجيه هيكلي صريح، مما يؤدي بالتالي إلى تحسين الحفاظ على الزخارف، والاتساق الدلالي، وإعادة البناء القابلة للتحكم لأنماط التراث الثقافي.

تعتمد غالبية تقنيات التقسيم الدلالي الحديثة على الشبكات العصبية التلافيفية الكاملة (FCNNs) ذات البنى على شكل حرف U31. وخلال مرحلة الترميز، يتم استخلاص سمات عميقة ذات حقول استقبال واسعة من خلال سلسلة من عمليات التلافيف وأخذ العينات السفلي. أما مرحلة فك الترميز فتعمل تدريجيًا على استعادة الدقة المكانية من خلال أخذ العينات العلوي، مما يتيح في النهاية التنبؤ الدلالي على مستوى البكسل. ومن خلال تعويض فقدان المعلومات المكانية أثناء أخذ العينات السفلي وتحسين أداء التقسيم عبر مجموعة واسعة من التطبيقات، تسمح وصلات التخطي بدمج المعلومات عالية الدقة من مستويات مختلفة من المرمّز مباشرةً في مفكك الترميز32.

على الرغم من أن الطرق الحديثة القائمة على شبكات GAN وCNN ونماذج الانتشار (diffusion-based) قد أظهرت نتائج واعدة في توليد الصور وترميم التراث الثقافي، إلا أنها غالباً ما تواجه صعوبة في الحفاظ على الاتساق الدلالي، وصون الزخارف الهيكلية الدقيقة، وضمان إعادة بناء قابلة للتكرار عبر الأنماط الثقافية المتنوعة. وتعامل معظم المناهج الحالية عمليات التجزئة وإعادة البناء وتوليف النمط كعمليات منفصلة، مما قد يؤدي إلى فقدان العناصر ذات الأهمية الثقافية والحصول على مخرجات غير متسقة. ولمعالجة هذه الفجوة المنهجية، تقترح هذه الدراسة إطار عمل موحداً يسمى SegCycle-SPADE، يدمج التجزئة الدلالية القائمة على SegFormer، ووحدة دمج الميزات الثقافية عبر الانتباه المتقاطع (CAFFM) المبتكرة، وإعادة البناء القائمة على CycleGAN، وتوليف النمط الموجه بواسطة SPADE. ومن خلال دمج معلومات التجزئة الهيكلية صراحةً مع تعلم الميزات التوليدية، يتيح إطار العمل المقترح إعادة بناء أكثر موثوقية واتساقاً دلالياً وقابلية للتكرار لزخارف التراث الثقافي غير المادي (ICH)، مع الحفاظ على كل من الأصالة الثقافية والجودة الفنية.

تحدد هذه الدراسة ثلاثة قيود رئيسية في مناهج إعادة بناء التراث الثقافي الحالية: (i) عدم كفاية الحفاظ على الزخارف الهيكلية الدقيقة في طرق إعادة البناء القائمة على شبكات GAN؛ (ii) محدودية التعميم الناتجة عن التدريب على مجموعات بيانات صغيرة أو متخصصة في مجال معين؛ و(iii) عدم كفاية الاتساق الدلالي بين مخرجات التجزئة والصور المولدة في أطر ترجمة صورة إلى صورة. بالإضافة إلى ذلك، عادة ما يتم التعامل مع التجزئة وإعادة البناء وتوليف النمط كعمليات منفصلة، مما يؤدي إلى فقدان العناصر ذات الأهمية الثقافية أثناء عملية إعادة البناء. ومن خلال دمج التجزئة الدلالية القائمة على المحولات (transformer)، ودمج الميزات عبر الانتباه المتبادل (cross-attention)، وإعادة البناء بواسطة CycleGAN، والتوليف الفني الموجه بواسطة SPADE ضمن بنية موحدة، يعالج إطار عمل SegCycle-SPADE المقترح هذه القيود ويعزز الحفاظ على الزخارف، والاتساق الدلالي، والأصالة الفنية في إعادة بناء أنماط التراث الثقافي غير المادي (ICH).

الهدف الرئيسي من هذه الدراسة هو تطوير إطار عمل SegCycle-SPADE مُحسّن لإعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH) بتوجيه من التقسيم الدلالي. يدمج إطار العمل نموذج SegFormer لتقسيم الزخارف الثقافية بدقة، ونموذج CycleGAN لإعادة بناء الأنماط، ونموذج SPADE للتوليف الفني المتسق مع النمط. ولتحسين تمثيل الميزات والحفاظ على التفاصيل الهيكلية الدقيقة، تم تقديم وحدة CAFFM لتسهيل التفاعل الفعال بين ميزات التقسيم والميزات التوليدية. ومن خلال التدريب على مجموعتي بيانات Miao Batik وWikiArt، يعمل إطار العمل المقترح على تعزيز أصالة إعادة البناء، واتساق النمط، والحفاظ على الزخارف ذات الأهمية الثقافية.

من خلال الجمع بين التجزئة الدلالية، ودمج السمات الموجه بالانتباه، وإعادة بناء الأنماط، وتخليق الأسلوب ضمن بنية موحدة، تقدم هذه الدراسة إطار عمل SegCycle-SPADE المبتكر لإعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH). وتتمثل المساهمات الرئيسية لهذا العمل فيما يلي: أولاً، تم تطوير إطار عمل مبتكر لإعادة البناء الموجه بالتجزئة الدلالية من خلال دمج SegFormer، مما يتيح الاستخراج الدقيق والحفاظ على الزخارف الثقافية المعقدة والعناصر الهيكلية. ثانياً، تم تقديم وحدة CAFFM جديدة لدمج سمات التجزئة بفعالية مع التمثيلات التوليدية، مما يسمح للنموذج بالتقاط العلاقات بعيدة المدى بين الزخارف الثقافية وأنماط الأسلوب الفني. ثالثاً، تعمل وحدة CAFFM المقترحة على تعزيز الحفاظ على العناصر ذات الأهمية الثقافية مع تحسين الواقعية البصرية والتماسك الهيكلي لأنماط التراث المعاد بناؤها. رابعاً، ومن خلال دمج CycleGAN لإعادة بناء الأنماط الثقافية وSPADE للتخليق الفني الموجه بالتجزئة، يضمن إطار العمل كلاً من الدقة الدلالية والأصالة الأسلوبية في المخرجات المولدة. خامساً، ولتحسين التعميم والتنوع الفني، تم تدريب النموذج باستخدام مجموعة بيانات زخارف باتيك مياو (Miao Batik) لتعلم الأنماط الثقافية ومجموعة بيانات WikiArt لتمثيل الأسلوب الفني؛ حيث تعمل WikiArt كمجموعة بيانات مساعدة لتقييم قدرة إطار العمل على التعميم، ومتانة تعلم السمات، وفعالية التحكم في الأسلوب عبر سياقات بصرية متنوعة، بدلاً من كونها أسلوباً مستهدفاً للتطبيق المباشر في منتجات التراث الثقافي لمياو. وأخيراً، وبالمقارنة مع طرق إعادة بناء التراث الثقافي الحالية القائمة على شبكات GAN، تُظهر النتائج التجريبية أن إطار عمل SegCycle-SPADE المقترح يحقق دقة تجزئة أعلى، وجودة إعادة بناء أفضل، واتساقاً أسلوبياً أكبر.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

صُمم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدي من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام الانتباه، وإعادة البناء التوليدية، وتوليف الأسلوب الفني. استعانت هذه الدراسة بمجموعات بيانات متاحة علنًا للتراث الثقافي والصور الفنية، بما في ذلك مجموعة بيانات باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. لم يشارك في البحث أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبناءً على ذلك، لم تكن هناك حاجة لموافقة لجنة الأخلاقيات المؤسسية أو الحصول على موافقة مستنيرة. في البداية، استُخدمت مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لغرض التقييم. وقد وُصفت مجموعة بيانات باتيك مياو في دراسة Quan et al. (2024)32، وهي تحتوي على 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. استُخدمت الشروحات الموجودة التي قدمها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. بعد ذلك، يتم إجراء المعالجة المسبقة للصور عن طريق تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. وتفصيل معاملات المعالجة المسبقة الدقيقة في القسم الفرعي الخاص بالمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجًا قائمًا على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. صُممت هذه الطريقة للكشف عن المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف تكوين آلية الانتباه في القسم الفرعي CAFFM. ثم تُمرر الميزات المعززة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. وأثناء التدريب، تم إنشاء عينات زخارف غير مكتملة اصطناعيًا عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور باتيك مياو الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الملاحظ عادةً في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة بناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. ثم يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. يتم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما يتم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعيًا. تم تقييم الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني نسبةً إلى الزخارف الثقافية المرجعية المقابلة. أُجري التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، واتحاد التقاطع (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

مخطط معالجة مجموعة البيانات باستخدام SegFormer وCycleGAN لتوليد الأسلوب الفني؛ بما في ذلك مقاييس التقييم.
الشكل 2. سير العمل العام للهيكلية المقترحة لإطار عمل SegCycle-SPADE. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعتي بيانات Miao Batik وWikiArt لمعالجة أولية قبل معالجتها من خلال التقسيم الدلالي باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليد الأسلوب الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة فريدشيه للبدء (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تقسيم الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. وتُستخدم صور من مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأساليب فنية متنوعة. في البداية، تتم معالجة الصور باستخدام وحدة تقسيم دلالي تعتمد على SegFormer لتحديد الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يقوم نموذج SegFormer باستخراج خرائط التقسيم الدلالي من صور الأنماط الثقافية. ثانياً، يقوم CAFFM بدمج ميزات التقسيم مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال التخليق الموجه بالتقسيم. بعد ذلك، يتم معالجة خرائط الميزات المنقحة بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. وقد تم توليد عينات من الزخارف غير المكتملة عن طريق تطبيق عمليات إخفاء عشوائية وحجب جزئي على صور باتيك مياو الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الملحوظ عادةً في القطع الأثرية الثقافية التالفة. تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. وقد مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. وفي الختام، ينتج مولد SPADE مخرجات فنية محسنة بصرياً من خلال ربط تخليق الصور بخرائط التقسيم المولدة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التعزيز الفني.

تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.

الخطوة 1: جمع مجموعة البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأساليب الفنية. استُخدمت مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik Cultural Motif Dataset) لتوفير معلومات حول الأنماط الثقافية التقليدية؛ وتتوفر هذه المجموعة للعامة عبر Zenodo (https://doi.org/10.5281/zenodo.20807658)، وتضم 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. وقد استُخدمت الشروحات الموجودة التي قدمها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. أما مجموعة بيانات WikiArt فقد استُخدمت لتوفير معلومات متنوعة عن الأساليب الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعامة (https://www.wikiart.org/).

الخطوة 2: المعالجة المسبقة للبيانات
خضعت جميع الصور للمعالجة المسبقة من خلال تغيير الحجم، والتطبيع، وتقليل الضوضاء. واستُخدمت التعليقات التوضيحية الحالية للزخارف الثقافية التي تم الحصول عليها من مصادر مجموعة البيانات الأصلية لدعم مرحلة التجزئة الدلالية. لم يتم إجراء أي إجراءات إضافية للتعليق التوضيحي أو إعادة التصنيف كجزء من هذه الدراسة.

الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
تَم استخدام نموذج SegFormer لتقسيم الزخارف الثقافية. ويرد وصف الهيكل الأساسي لـ SegFormer واستراتيجية التهيئة الدقيقة في القسم الفرعي Semantic Pattern Segmentation Using SegFormer. وتحديداً، تم توظيف بنية SegFormer-B2 مع هيكل MIT-B2 مُدرب مسبقاً على ImageNet لتقسيم الزخارف الدلالية. ويلتقط هذا النموذج المعلومات السياقية العالمية بفعالية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.

الخطوة 4: CAFFM
يجمع نظام CAFFM بين ميزات التجزئة الدلالية والتمثيلات التوليدية، مما يُمكّن الإطار من تعلم خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني على حد سواء. تتوفر تفاصيل تكامل CAFFM في القسم الفرعي CAFFM. يقع هذا النموذج بين مرحلة التجزئة الدلالية القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث يقوم بدمج الميزات الهيكلية المستمدة من التجزئة مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.

الخطوة 5: إعادة بناء الأنماط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء الأنماط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين اثنين، وتستخدم بنية مولد تعتمد على الشبكة المتبقية (residual-network) مع تسعة كتل متبقية، وتوظف مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافس (adversarial losses) وخسائر اتساق الدورة (cycle-consistency losses). يتيح هذا التكوين رسم خرائط ثنائية الاتجاه بين النطاقات ويسهل إعادة بناء هياكل الأنماط الثقافية غير المكتملة.

الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تخليق للنمط الفني بتوجيه من التقسيم. تم وصف تكوين مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. تستخدم الوحدة كتل SPADE المتبقية، وطبقات تطبيع تكيفية مكانياً، وتكييفاً دلالياً مشتقاً من خرائط تقسيم SegFormer وتمثيلات ميزات CAFFM. من خلال ربط توليد الصور بخرائط التقسيم، تحافظ المخرجات المُخلقة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.

الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة للتجزئة وتقييم جودة الصور، بما في ذلك دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيت المبدئية (FID). ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وسُجلت النتائج في صورة المتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المزدوجة، مع تحديد عتبة الدلالة عند p < 0.05.

جمع مجموعات البيانات
في إطار عمل SegCycle-SPADE المقترح، تم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأنماط الفنية. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية من فن باتيك مياو، وهي عبارة عن صور لباتيك مياو التقليدي تتضمن زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتضم هذه المجموعة صوراً ذات معلومات غنية عن الملمس، وهو أمر ضروري بشكل عام للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عموماً إلى أنماط مختلفة، وتُستخدم لتعلم الأنماط المعقدة، وهو ما يفيد عادةً في تحسين الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميماً مختلفاً، مما يجعلها أكثر فائدة لمهام توليد أو تحويل الأنماط المعتمدة على التعلم العميق (DL).

مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشمل الصور مجموعة متنوعة من التصميمات التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط النباتية، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر بنيات ثقافية أصيلة تمكّن وحدة التجزئة من تحديد حدود الزخارف والحفاظ عليها بدقة أثناء إعادة بناء النمط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر البصرية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب مياو والممثلة ضمن تعليقات مجموعة البيانات، بما في ذلك الطيور، والفراشات، والأنماط الزهرية، والرموز القبلية الموروثة. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتكرار ظهورها في تصميمات باتيك وتطريز مياو التقليدية، وليس فقط بناءً على تكرار حدوثها أو تكوينها المكاني. وقد تم الحصول على تعليقات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بأي تعليقات يدوية إضافية، أو إعادة تسمية، أو إجراءات تعليق موجهة من قبل الخبراء. وقد استُخدمت التعليقات الموجودة التي وفرها منشئو مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.

المعلمةالوصف
اسم مجموعة البياناتمجموعة بيانات أنماط باتيك المياو الثقافية
مصدر مجموعة البياناتمستودع Zenodo (DOI: 10.5281/zenodo.20807658)
المجالالتراث الثقافي غير المادي (ICH) / تحليل أنماط المنسوجات
إجمالي الصور15,148 صورة
نوع الصورصور رقمية لأنماط منسوجات باتيك المياو التقليدية
فئات الأنماطزخارف حيوانية، وزخارف نباتية، وزخارف هندسية
الأصل الثقافيثقافة عرقية المياو، مقاطعة قويتشو، الصين
دقة الصور الأصليةصور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأقصر) تم التقاطها كمسوحات خام أو صور فوتوغرافية قبل المعالجة المسبقة
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة
توفر التعليقات التوضيحيةتم استخدام تعليقات تقسيم موجودة قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. ولم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة.
التطبيق في هذه الدراسةتقسيم الزخارف الثقافية، واستخراج الميزات، والحفاظ على الزخارف، وإعادة بناء الأنماط

الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يوضح الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.

مجموعة بيانات WikiArt:
تعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً واسع النطاق وشائعاً للفنون، حيث تضم أكثر من 80,000 صورة تتبع 27 نمطاً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأنماط فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. تكتسب مجموعة البيانات هذه أهمية بالغة في الإطار المقترح لأنها توفر المعرفة التي تتيح لوحدة SPADE إنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. وتتكون مجموعة البيانات من 56,000 صورة للتدريب و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في مجموعة البيانات في تدريب نموذج التعلم العميق (DL) بشكل فعال.

معلمةالوصف
اسم مجموعة البياناتمجموعة بيانات WikiArt
مصدر مجموعة البياناتمستودع WikiArt (https://www.wikiart.org/)
المجالالفنون واللوحات الرقمية
إجمالي الصورحوالي 80,000 عمل فني
صور التدريب56,000
صور التحقق12,000
صور اختبارية12,000
الأساليب الفنية27 نمطاً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي
دقة الصورة الأصليةتتباين دقة الصور الأصلية عبر الأعمال الفنية والمصادر المختلفة. وقد جرى تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل أثناء مرحلة المعالجة المسبقة.
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني وتخليق الصور الموجه بالتجزئة.
تقسيم مجموعة البياناتتقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42
استراتيجية أخذ عينات الأسلوباستُخدم أسلوب المعاينة النسبية الطبقية للحفاظ على توزيع الأنماط الفنية الـ 27 عبر مجموعات التدريب والتحقق والاختبار الفرعية.
التطبيق في هذه الدراسةتعلم النمط الفني، وتمثيل النمط، والتركيب الفني الموجه بالتجزئة

الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة في تعلم الأسلوب الفني وتوليد الصور الموجهة بالأسلوب. يوضح الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأساليب الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.

تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب مياو.32 وتتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور للفحص البصري، وتعديل الحجم إلى 256 × 256 بكسل، والتطبيع، وفحص العينات التالفة أو المكررة. لم يؤدِ فحص مراقبة الجودة إلى استبعاد أي صور؛ وبناءً عليه، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل اللاحق. قُسِّمت مجموعة البيانات عشوائيًا إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية إعادة إنتاج تقسيمات مجموعة البيانات. أما مجموعة بيانات WikiArt فقد تم الوصول إليها من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/) وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 نمطًا فنيًا. وبالنسبة لتجارب تعلم النمط، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.

المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt لعدة خطوات من المعالجة المسبقة لضمان جودة متسقة للصور وتمثيل دقيق للميزات. تم تطبيق مسار المعالجة المسبقة الأساسي ذاته على كلتا المجموعتين، بما في ذلك إزالة الضجيج بطريقة غاوس (Gaussian denoising)، والتطبيع (normalization)، وتغيير الحجم إلى دقة إدخال موحدة، والتحقق من جودة الصور. ومع ذلك، أدت مجموعتا البيانات أدواراً مختلفة ضمن إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأسلوب الفني وتوليفه، بينما استُخدمت مجموعة بيانات باتيك مياو بشكل أساسي لتقسيم الزخارف الثقافية وإعادة بنائها. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بكل مجموعة بيانات خارج هذه الأدوار المحددة للمهام. ولضمان المعالجة المتسقة بواسطة نموذج التعلم العميق (DL)، تم أولاً تغيير حجم الصور إلى دقة ثابتة؛ وكانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين تباينت دقتها بناءً على مصدرها. وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات البعدية من التأثير على التدريب. تمثلت الخطوة الثانية من المعالجة المسبقة في التطبيع، حيث تم تغيير مقياس قيم البكسل إلى نطاق معياري لاستقرار تحديثات التدرج أثناء التدريب. بعد ذلك، تمت معالجة الصور باستخدام ترشيح غاوس (Gaussian filtering) لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. وبالنسبة لمجموعة بيانات باتيك مياو، استُخدمت أقنعة تقسيم الزخارف الثقافية الموجودة مسبقاً، والتي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلي، دون تعديل لتدريب التجزئة الدلالية (semantic segmentation) وتقييمها. ولم يتم إنشاء أقنعة تقسيم جديدة خصيصاً لهذه الدراسة.

ما لم يُذكر خلاف ذلك، تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف نموذج CAFFM المقترح وإطار عمل تحسين SegCycle-SPADE المركب، فقد طورها المؤلفون خصيصاً لهذه الدراسة.

ليكن التمثيل الرياضي لصورة إدخال من مجموعة البيانات وفقاً لـ المعادلة 1>:

تمثيل الفضاء المتجهي، I ∈ ℝⁿˣʷˣᶜ، توضيح للصيغة، مفهوم رياضي تعليمي.  (1)

هنا، تشير H و W و C إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

صيغة معالجة الصور، المعادلة Ir = Resize(I,H'×W')، المتعلقة بطرق تغيير الحجم.

هنا، تمثل Ir الصورة التي تم تغيير حجمها. ويتم حساب قيم البكسل المُطبعة وفقاً لـ المعادلة 3:

الصيغة الرياضية للشدة الموحدة، المعادلة: In = Ir/255، ذات صلة بتحليل البيانات.   (3)

يساعد هذا في تثبيت إجراء التدريب. يتم إجراء تصفية الضجيج باستخدام مرشح غاوسي كما هو موضح في المعادلة 4:

معادلة التوازن الاستاتيكي Is=In*G(σ)، رمز، تركيز على الرياضيات، تحليل بحثي.

هنا، يمثل G(σ) مرشح غاوس (Gaussian filter) وتمثل العلامة * عملية الالتفاف (convolution). وقد استُخدم مرشح غاوس بنواة بحجم 5 × 5 وبانحراف معياري قدره σ = 1.0. وطُبق الحشو الانعكاسي (Reflective padding) على بكسلات الحواف لتقليل التشوهات الطرفية. وأجريت عملية إزالة الضجيج مباشرة بعد تحميل الصور وقبل عمليتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة في جميع أنحاء الدراسة، طُبقت تهيئة المرشح نفسها على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التقسيم وفقاً لـ المعادلة 5:

الصيغة الرياضية لتحديد منطقة الزخرفة، والتي توضح معايير تصنيف البكسل.

هنا، يمثل M قناع تقسيم يُستخدم لتوجيه نموذج SegFormer.

تبدأ سلسلة عمليات المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لتعزيز البيانات أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع، وإزالة الضجيج بطريقة Gaussian، وإعداد أقنعة التجزئة، استُخدمت الصور مباشرة في تدريب والتحقق من صحة واختبار إطار عمل SegCycle-SPADE المقترح. تتضمن الخطوة الأولى من سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق بمعالجة الصور بكفاءة أكبر. وتتضمن الخطوة الثانية التطبيع، الذي يحول قيم البكسل إلى نطاق عددي معياري ويسهل تقارب النموذج. أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، وبالنسبة لمجموعة بيانات Miao Batik، يتم تحديد مناطق الزخارف الثقافية، مما يسمح بتوليد أقنعة تُستخدم في وحدة التجزئة للنموذج المقترح، لضمان الحفاظ على الزخارف الثقافية أثناء عملية التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدتي التجزئة والتوليد في النموذج المقترح.

مخطط معالجة مجموعة البيانات؛ تشمل الخطوات تغيير الحجم، والتطبيع، وإزالة الضجيج، وتوصيف الزخارف.
الشكل 3. مسار المعالجة المسبقة للبيانات لصور التراث الثقافي. مخطط سير العمل الذي يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتطبيع، وإزالة الضجيج بطريقة Gaussian، وتوصيف الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

خضعت كل صورة لعملية مراقبة جودة قبل تدريب النموذج. احتوت مجموعة بيانات Miao Batik على 15,148 صورة. وكان منشئو مجموعة البيانات الأصليون قد عالجوا بالفعل العينات التالفة والمكررة ومنخفضة الجودة؛ ولذلك، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل. تم تحميل الصور بتنسيق RGB أثناء المعالجة المسبقة وتغيير حجمها إلى 256 × 256 بكسل باستخدام الاستيفاء الخطي الثنائي. وتم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم طُبق تطبيع لكل قناة باستخدام قيم متوسط قدرها [0.485, 0.456, 0.406] وقيم انحراف معياري قدرها [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء، على التوالي. شمل مسار المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وتغيير الحجم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق tensor. وعند الضرورة، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج DL. وبعد المعالجة المسبقة، تم تقسيم الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. واستخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التجزئة الدلالية، ودمج الميزات، وإعادة بناء الزخارف، والتوليف الفني القائم على SPADE — دقة إدخال ثابتة قدرها 256 × 256 بكسل.

تقسيم الأنماط الدلالي باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور المنظفة والمعيرة من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التقسيم الدلالي القائمة على إطار عمل SegFormer-B2 المقترح. والغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد إطار عمل SegFormer المقترح على بنية محول (transformer) تدمج مشفر محول هرمي وفك تشفير MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية التفصيلية من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يلي ذلك دمج هذه التمثيلات من خلال فك التشفير لإنشاء أنماط مقسمة بدقة. يضمن ذلك تقسيم الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل المتأخرة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.

لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة بـ المعادلة 6:

معادلة توضح فضاء الصورة من أبعاد ذات قيم حقيقية؛ الصيغة: I_p ∈ ℝ^(H×W×C)    (6)

يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج ميزات هرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

معادلة توضح عملية ترميز الميزات؛ الصيغة: F = Encoder(Ip).

هنا، يشير F إلى خرائط الميزات متعددة المقاييس التي تم الحصول عليها من مشفر المحول (transformer encoder). وتعمل هذه الميزات على ترميز كل من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخارف (motif regions). ويقوم نموذج SegFormer باستخراج خرائط الميزات بمقاييس مختلفة كما هو محدد في المعادلة 8:

صيغة تدوين المتجهات F={F1,F2,F3,F4}، المستخدمة في تحليل التوازن الساكن، تدوين رياضي.

يسهل استخدام التمثيلات متعددة المقاييس اكتشاف أنماط بأحجام مختلفة ضمن الزخارف الثقافية. وأخيرًا، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في Equation 91:
 المعادلة: S=Decoder(F₁,F₂,F₃,F₄)؛ صيغة رياضية، دالة مفكك الشفرة.

هنا، يشير S إلى خريطة التقسيم النهائية المتوقعة.

تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مدربة مسبقاً على مجموعة بيانات ImageNet، ومن ثم تم ضبطه بدقة على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، استُخدمت نقطة التحقق MIT-B2 المدربة مسبقاً على ImageNet-1K (mit_b2.pth) والمقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. تتوافق الأوزان المدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وقد عملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة الأوزان الافتراضية في PyTorch قبل البدء في التدريب.

تستخدم البنية الهندسية مشفر Transformer هرمي مكونًا من أربع مراحل مع تضمينات رقع متداخلة. في المرحلة الأولية، تم ضبط حجم الرقعة على 7 × 7 بزيادة قدرها 4. وبالنسبة لكل مرحلة من مراحل المشفر الأربع، كانت أبعاد التضمين 64 و128 و320 و512. وعبر المراحل الأربع، كان هناك 1 و2 و5 و8 من رؤوس الانتباه الذاتي متعددة الرؤوس، وكانت أعماق المشفر المقابلة 3 و4 و6 و3 طبقات. تم تجميع الميزات متعددة المقاييس المستخرجة من المشفر باستخدام مفكك شفرات خفيف الوزن يعتمد كليًا على Perceptrons متعدد الطبقات (MLP). وقبل إنشاء خريطة التجزئة النهائية، قام مفكك الشفرات بإسقاط الميزات من كل مرحلة من مراحل المشفر في مساحة تضمين واحدة. استخدمت جميع كتل Transformer دالة التنشيط Gaussian Error Linear Unit (GELU). كما تم استخدام معدل إسقاط (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم والحد من الإفراط في التخصيص.

خلال مرحلة التدريب، يستقبل إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلا المجموعتين من البيانات. تحتوي الصور المستمدة من مجموعة بيانات Miao Batik على مناطق الزخارف التي تعمل كملصقات للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات بعيدة المدى بين مكونات الصورة، وهو أمر مهم بشكل خاص لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تقوم آلية استخراج الميزات الهرمية بالتقاط البنى المحلية في آن واحد، مثل الأنسجة الهندسية المتكررة. ويقوم مفكك شفرة MLP بمعالجة هذه الميزات المستخرجة وإنتاج قناع تجزئة يبرز مناطق الزخارف. تُستخدم خرائط التجزئة التي تم إنشاؤها خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء النمط، مما يساعد في الحفاظ على أصالة الأنماط المُولدة.

تم تقسيم الزخارف الثقافية إلى فئات مختلفة للتجزئة الدلالية وفقاً لخصائصها البصرية والثقافية. وشمل تصنيف التجزئة الزخارف الحيوانية (مثل الفراشات، والأسماك، والطيور، وغيرها من الحيوانات الرمزية)، والزخارف النباتية (مثل الأزهار، والأوراق، والكروم، والأنماط النباتية)، والزخارف الهندسية (مثل الأشكال المتكررة، والإطارات، والهياكل الهندسية التجريدية)، ومناطق الخلفية التي تمثل المساحات الخالية من الزخارف. واستُخدمت أقنعة التجزئة على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقاً. وقد تم ترميز التسميات الرقمية كما يلي: التسمية 0 = الخلفية، والتسمية 1 = الزخارف الحيوانية، والتسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. وقد تم الحصول على تعليقات التجزئة وتسميات الزخارف مباشرة من مصدر مجموعة بيانات "باتيك مياو" (Miao Batik) الأصلية. ولم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة؛ بل استُخدمت التعليقات التوضيحية الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم.

يقوم نموذج SegFormer المخصص لتجزئة الزخارف الثقافية بمعالجة الصور التي تمت معالجتها مسبقاً من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية تعتمد على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. يقوم مشفر المحول (Transformer encoder) باستخراج كل من المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم تزويد الميزات متعددة المقاييس الناتجة بمفكك شفرة التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات وتعزيز الكشف عن الزخارف. تكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع حجب معلومات الخلفية غير ذات الصلة. وتعمل الأنماط الثقافية المعزولة بعد ذلك كإرشادات هيكلية للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

مخطط SegFormer؛ تقسيم الصور باستخدام مشفرات Transformer، واستخراج الميزات، وقناع التقسيم.
الشكل 4. التقسيم الدلالي للزخارف الثقافية بناءً على SegFormer-B2. بنية وحدة التقسيم الدلالي SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية والمدربة حصرياً على مجموعة بيانات Miao Batik. يتكون الإطار من مشفر يعتمد على Transformer لاستخراج الميزات متعددة المقاييس ومفكك تشفير تقسيم خفيف الوزن لإنشاء أقنعة الزخارف. يتنبأ النموذج بأربعة أصناف دلالية—حيوان، ونبات، وهندسي، وخلفية—حيث تحدد أقنعة التقسيم الناتجة مناطق الزخارف ذات الأهمية الثقافية مع تثبيط معلومات الخلفية غير ذات الصلة. توفر مخرجات التقسيم هذه توجيهاً هيكلياً لمراحل دمج الميزات وإعادة البناء والتركيب الفني اللاحقة في إطار SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. فقد تم الحصول على مجموعة بيانات Batik Miao من مصدر عام موجود مسبقاً، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.

وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء في CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطي لإسقاط كلا تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتبادل، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات الناتجة. بعد ذلك، يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتبادل متعدد الرؤوس. ثم تُطبق عملية تطبيع الطبقة، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتستقبل مرحلة التركيب القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على السمات ذات الدلالات الثقافية دون التضحية بالاتساق الفني.

لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطي على مساحة تضمين مشتركة ببعد تضمين قدره 256. ثم يتم نمذجة الترابطات بين المعلومات الهيكلية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتبادل متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. تعتمد حسابات الانتباه المتبادل على متجهات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي يتم إنتاجها بواسطة طبقات تحويل خطي محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتطبيع الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. بعد ذلك، يتم تحسين تعلم الميزات غير الخطي من خلال تطبيق شبكة تغذية أمامية مع دالة التنشيط Gaussian Error Linear Unit (GELU). يقوم النموذج بتوليد تمثيل ميزات مخرجات ببعد 256 وإرساله إلى مراحل أخرى من أجل التركيب الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع هياكل الزخارف الثقافية باستخدام تقنية دمج قائمة على الانتباه المتبادل، مما يعزز الحفاظ على الزخارف والاتساق البصري في أنماط التراث الثقافي المعاد بناؤها.

في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. لتكن خريطة السمات المشتقة من شبكة التجزئة SegFormer باستخدام صور من مجموعة بيانات Miao Batik يرمز لها بالرمز Fs، بينما يرمز لخريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بالرمز Fa. يقوم نموذج CAFFM المقترح بدمج مجالي السمات باستخدام آلية الانتباه المتقاطع لتعلم التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين، وطبقات التسوية، ودوال التنشيط، وتكوين رؤوس الانتباه. بالنسبة لحجم صورة مدخلة يبلغ 256 × 256 بكسل، أنتج مشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. وقد تم إسقاط كلتا خريطتي السمات عبر طبقات خطية قابلة للتعلم إلى فضاء تضمين مشترك ببعد 256 قبل عملية الدمج بالانتباه المتقاطع.

المعلمالتكوين
إطار العمل المقترحSegCycle-SPADE
نموذج التجزئة الدلاليةSegFormer-B2
مراحل مشفر SegFormer4
تهيئة الأوزاننموذج SegFormer-B2 مدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2)
مصدر نقطة التحققمستودع NVIDIA SegFormer الرسمي (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k
استراتيجية الضبط الدقيقضبط دقيق من الطرف إلى الطرف على مجموعة بيانات Miao Batik
حجم تضمين الرقعة7 × 7
خطوة الرقعة4
أبعاد التضمين64، 128، 320، و512
أعماق المشفر3، 4، 6، و3
رؤوس الانتباه1، 2، 5، و8
نوع مفكك الشفرةمفكك شفرة All-MLP
دالة التنشيطGELU
معدل التسرب0.1
وحدة تعزيز الميزاتوحدة دمج الميزات الثقافية بالانتباه المتقاطع (CAFFM)
بعد تضمين CAFFM256
رؤوس انتباه CAFFM8
مقاييس دمج CAFFM4
نموذج إعادة البناءCycleGAN
نموذج توليد النمطSPADE
مجموعة البيانات الثقافيةمجموعة بيانات Miao Batik
مجموعة بيانات النمطمجموعة بيانات WikiArt
صور Miao Batik15,148
صور WikiArtحوالي 80,000
دقة صورة الإدخال256 × 256 بكسل
تنسيق الألوانRGB
طريقة الاستيفاءالاستيفاء الخطي الثنائي (Bilinear Interpolation)
طريقة إزالة الضجيجالترشيح الغاوسي (Gaussian Filtering)
حجم النواة الغاوسية5 × 5
سيجما غاوس (σ)1
نطاق التطبيع[0, 1]
حجم الدفعة16
عدد العصور100
المحسنAdam
معدل التعلم0.0002
معاملات Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, اضمحلال الوزن = 0
دوال الخسارةخسارة التجزئة، خسارة الخصومة، خسارة اتساق الدورة، خسارة إعادة البناء، خسارة الحفاظ على الزخارف، وخسارة اتساق النمط
استراتيجية تقسيم مجموعة البياناتالتدريب / التحقق / الاختبار
مجموعة التدريب70%
مجموعة التحقق15%
مجموعة الاختبار15%
البذرة العشوائية42
مقاييس التقييمدقة التجزئة، IoU، معامل Dice، SSIM، PSNR، وFID
لغة البرمجةPython 3.8.10
إطار عمل التعلم العميقPyTorch 1.10.0
منصة الأجهزةوحدة معالجة الرسوميات NVIDIA RTX 3090 (بذاكرة VRAM سعة 24 GB)، معالج Intel Core i7 (الجيل الحادي عشر)، ذاكرة RAM سعة 32 GB
بيئة التشغيلUbuntu 20.04 LTS

الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات الهيكلية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعلمات التحسين، ومقاييس التقييم، والبيئة الحوسبية المستخدمة في تنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.

تقوم وحدة الانتباه أولاً برسم خريطة لخريطة السمات إلى تمثيلات الاستعلام والمفتاح والقيمة باستخدام Equation 10:

صيغ الاتزان الساكن، Q=FsWq, K=FsWk, V=FsWv، معادلة للتحليل الميكانيكي.

هنا، تكون Wq وWk وWv مصفوفات أوزان قابلة للتعلم. ويتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117

صيغة دالة Softmax، A=Softmax((QK^T)/√d_k)، المعادلة الخاصة بآلية الانتباه.

هنا، يمثل dk بُعد متجه المفتاح. ويتم حساب تمثيل الميزات المحسّن عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

صيغة الاتزان الساكن \(F_a = A \cdot V\) موضحة؛ وهي مفهوم رئيسي في تحليل توازن القوى.

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات من خلال دمج ميزات التقسيم الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقًا لـ المعادلة 13:

معادلة التوازن الساكن \( F_e = F_s + F_a \)، تصف القوى، صيغة.                                

هنا، تمثل Fe خريطة الميزات المحسنة المستخدمة في إعادة بناء النمط. يتم توسيع نموذج CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخراج ميزات الزخارف الثقافية بمقاييس مختلفة. لنرمز بـ Fsi إلى ميزات التجزئة عند المقياس i، بينما ترمز Faj إلى ميزات النمط الفني عند المقياس نفسه. يتم تعريف التمثيل النهائي للميزات باستخدام المعادلة 14:

  صيغة آلية الانتباه \(F_{\text{fusion}} = \sum_{i=1}^{N} \text{Attention}(Q_i, K_i, V_i)\).

هنا، تمثل Qi و Ki و Vi مصفوفات الاستعلام والمفتاح والقيمة عند المقياس i على التوالي، بينما يشير N إلى عدد مقاييس الميزات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط الميزات المستخرجة بدقة مكانية تبلغ 1/4 و 1/8 و 1/16 و 1/32 من حجم الصورة المدخلة. وقد دُمجت تمثيلات الميزات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل عمليتي إعادة البناء والتركيب الفني. يتيح التوسع المذكور أعلاه للمنهجية استخراج الزخارف الثقافية والقوام العالمي لإعادة بناء الأنماط الثقافية. يقع موديل CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء ميزات إعادة البناء التي تحتوي على معلومات متعلقة بالنمط والأسلوب في آن واحد، يقوم SegFormer-B2 باستعادة خرائط الميزات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. يستقبل موديل CAFFM تدفقي الميزات هذين، ويستخدم الدمج القائم على الانتباه المتقاطع (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط أصيلة ثقافياً مع الحفاظ على الاتساق الدلالي والميزات الهيكلية، يتم إرسال خرائط الميزات المدمجة الناتجة بعد ذلك إلى موديل SPADE لإجراء تركيب إبداعي موجه بالتجزئة.

إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز الميزات القائمة على الانتباه، ستتضمن خرائط الميزات هياكل الزخارف الثقافية المعززة. ومع ذلك، قد تظل خرائط الميزات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذا، ولمعالجة مشكلة إعادة بناء الأنماط، سيعتمد الإطار المقترح على نموذج CycleGAN. في الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام الميزات المعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. سيضمن ذلك احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية والأنماط الزهرية والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وقد حاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الملاحظ عادةً في القطع الأثرية التراثية الثقافية المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما عملت الصور الأصلية المقابلة كصور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.

لتكن X هي نطاق الأنماط الثقافية غير المكتملة و Y هي نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدان إجراء رسم خرائطي ثنائي الاتجاه باستخدام المعادلة 15:

 مخطط للدوال والتطبيقات GF:X→Y, FM:Y→X، والتحويلات الرياضية في المعادلات.

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures)، ويُستخدم FM لإسقاط الأنماط مرة أخرى على النطاق الأصلي. وتُستخدم الخسارة التنافسية (adversarial loss) لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

معادلة فقدان شبكات الخصومة التوليدية \(L_{GAN}\)؛ صيغة لتحسين النماذج التوليدية؛ تعبير رياضي.

هنا، يمثل DY المميز المستخدم للتفريق بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه والمولد. كما تفرض شبكة CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

الصيغة الرياضية لدالة الخسارة \(L_{cycle}(G_F, F_M)\) في النمذجة الحاسوبية.

يتم تعريف دالة الخسارة النهائية باستخدام المعادلة 1830:

معادلة التوازن الساكن، L_total=L_GAN(G_E,D_Y,X,Y)+L_GAN(F_M,D_X,Y,X)+λ_L_cycle(G_E,F_M).

هنا، ترمز λi إلى معامل التوزين لخسارة اتساق الدورة، وقد تم ضبطه عند القيمة 10 أثناء التدريب، بما يتوافق مع صيغة CycleGAN الأصلية. تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.

تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية الشبكة المتبقية (residual-network) التي تتألف من طبقة تلافيف أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لخفض العينات، وتسع كتل متبقية، وطبقتان لرفع العينات. تستخدم جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخراج الميزات. يتم تطبيق تطبيع المثيل (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة المخرجات دالة تنشيط Tanh لتوليد مخرجات صور مُطبعة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويُستخدم تطبيع المثيل وتنشيط LeakyReLU (بميل سالب = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية المعالجة مسبقاً كمدخلات وتولد تمثيلات أنماط مُعاد بناؤها، والتي يتم توجيهها لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام محسن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم خلال أول 100 حقبة (epochs)، ثم انخفض خطياً إلى الصفر خلال فترة التدريب المتبقية. كما استُخدم مخزن مؤقت للإعادة (replay buffer) يحتوي على 50 صورة تم توليدها سابقاً لتحقيق استقرار تدريب المميز. وتم تحديث المولدات والمميزات باستخدام نسبة تحديث 1:1، حيث يتبع كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.

تعتمد عملية إعادة البناء في نموذج CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM الموضحة في الشكل 5. تحتوي خرائط السمات هذه على زخارف ثقافية محسنة تم استخلاصها من المراحل السابقة للتجزئة وآلية CAFFM. وتُستخدم خرائط السمات كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية التعيين (mapping) المطلوبة لإعادة بناء الأنماط الثقافية. بعد ذلك، يتم تزويد المميّز DY بالمخرجات للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميّز DY المولد GE في إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء عملية إعادة البناء، يقوم المولد الثاني FM بإجراء تعيين لاتساق الدورة (cycle-consistency mapping)، حيث يعيد المولد الثاني FM تعيين المخرجات إلى النطاق الأصلي. ثم يتم تقييم المخرجات بواسطة المميّز لضمان واقعيتها. وفي الختام، يتم تمرير المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

عملية إعادة بناء الأنماط؛ مخطط باستخدام شبكات GAN لتوليد الزخارف الثقافية.
الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. يتم تقديم تمثيلات الميزات المعززة بآلية الانتباه كمدخلات لشبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تعيين الاتساق الدوري على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. يتم بعد ذلك إرسال الزخارف المعاد بناؤها إلى وحدة SPADE لتركيب الأسلوب الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

توليد الأسلوب الفني باستخدام SPADE
لاحقاً، تخضع الزخارف الثقافية المعاد بناؤها لوحدة SPADE لتوليد الأسلوب الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من الأسلوب الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالتخطيط الهيكلي لهذه الزخارف. وتُعد وحدة SPADE تقنية لتوليد الصور الشرطية التي تستخدم مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي الناتجة عن SegFormer-B2. وتلقى مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانياً (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة من طبقات SPADE. وبذلك، تمكن المولد من الحفاظ على حدود الزخارف، والتخطيطات الهيكلية، والمعلومات الدلالية أثناء الاصطناع الفني عن طريق تطبيق هذه المعاملات على تنشيطات السمات المُطبعة. وكان التوجيه الدلالي قادراً على التأثير في كل من إعادة البناء الهيكلي رفيع المستوى واصطناع الأنسجة منخفض المستوى نظراً لأن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية المبتكرة سمات أسلوبية مُكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي تم العثور عليها خلال مرحلة التقسيم.

استُخدمت مجموعة بيانات WikiArt، التي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد أساسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم الأسلوب، تم اختيار صور الأساليب عشوائياً من الفئات المختلفة أثناء التدريب. وقُسّمت مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية من أجل تقليل انحياز الأسلوب. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، استُخدم أخذ العينات الطبقية؛ حيث خُصصت العينات من كل فئة بشكل تناسبي لمجموعات التدريب والتحقق والاختبار مع الحفاظ على توزيع الفئات الأصلي. واستُخدمت وحدة CAFFM لدمج جوانب الأسلوب المستمدة من صور WikiArt مع سمات إعادة البناء الناتجة عن CycleGAN. ومن أجل السماح لشبكة التركيب بنقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تزويد مولد SPADE بالتمثيلات المدمجة الناتجة كمعلومات شرطية. وبفضل تقنية تكييف الأسلوب هذه، تمكن الإطار المقترح من إنتاج أنماط فنية أصيلة ثقافياً مع تمثيلات هيكلية وأسلوبية متسقة.

يقدم SPADE أيضاً معلمات تكيُّفية مكانياً تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعلمات كما هو موضح في المعادلة 191:

معادلة التحويل الخطي: y=γ(S)x̂+β(S) (المعادلة 19)، تمثيل رياضي.

هنا، يمثل γ(S) معلمة المقياس المتغيرة مكانيًا، بينما يمثل β(S) معلمة الانحياز المتغيرة مكانيًا. ويمكن لهذه المعلمات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة اعتمادًا على المنطقة الدلالية في الصور. ويمكن تعريف العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

 معادلة عملية التقييم الجيني formula I_gen=G_E(X^P_r,SM).

هنا، يمثل GE مولد SPADE، ويمثل XrP النمط المعاد بناؤه، ويمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. تم استخدام دالة فقدان مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. تم استخدام خليط مرجح من فقدان التجزئة (Lseg)، والفقدان التنافسي (Ladv)، وفقدان الاتساق الدوري (Lcycle)، وفقدان إعادة البناء (Lrecon)، وفقدان الحفاظ على الزخارف (Lmotif)، وفقدان اتساق الأسلوب (Lstyle) لتحديد هدف التدريب العام. تُعرَّف دالة الفقدان الإجمالية في المعادلة 21:

صيغة الفقد الكلي، L_Total، تساوي مكونات متعددة، تظهر كمعادلة رياضية للتحليل.  (21)

لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمعاد بناؤها، تم ضبط معامل فقدان الاتساق الدوري على القيمة 10. وللحفاظ على سمات الزخارف دقيقة التفاصيل وتعزيز الدقة البصرية، تم تعيين معامل فقدان إعادة البناء عند 5. ولتسليط الضوء على الحفاظ على الأنماط الهيكلية الأساسية ثقافياً أثناء التخليق الفني، تم استخدام معامل قدره 2 لفقدان الحفاظ على الزخرفة. ومن أجل تعزيز نقل الأسلوب الفني دون تشويه هياكل الزخارف الدلالية بشكل مفرط، تم تعديل معامل فقدان اتساق الأسلوب إلى 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، تم إعطاء أوزان متساوية لفقدان التقسيم والفقدان التنافسي. وقد استُخدمت تمثيلات الأسلوب القائمة على السمات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة جرام المستمدة من خرائط السمات العميقة. واستُخدم فرق معيار فروبينيوس بين مصفوفات جرام لصورة الأسلوب المستهدفة والصورة المولدة لحساب فقدان الأسلوب، كما هو موضح في المعادلة 22:

معادلة حسابية لفقدان النمط في الشبكات العصبية، توضح صيغة L_style وتصويراً للطريقة.

هنا، تمثل Gl مصفوفة جرام المحسوبة من طبقة الميزات lth، ويشير Igen إلى الصورة الفنية المولدة، ويشير Istyle إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، بينما يشير F إلى معيار فروبينيوس. وتسمح هذه الصيغة للإطار المقترح بالحفاظ على الخصائص الفنية مع الإبقاء على السلامة الهيكلية والدلالية للزخارف الثقافية.

تُستخدم تمثيلات الميزات المدمجة الناتجة عن وحدة CAFFM كمدخلات شرطية لوحدة SPADE، والتي تعمل كمكون للتوليف الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التجزئة الدلالية التي تم الحصول عليها من وحدة SegFormer–CAFFM كمدخلات شرطية عبر طبقات SPADE المتبقية. يتم تطبيق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يتيح التكييف الدلالي الموجه بالتجزئة. ومن خلال عمليات رفع العينات والتلافيف المتتالية، يتم تحسين تمثيل الميزات الكامن تدريجياً لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، ويتم تطبيق دالة تنشيط Tanh في طبقة المخرجات لإنتاج صور معيارية.

الخوارزمية وسير العمل
يدمج إطار عمل SegCycle-SPADE بين التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن خط تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتقييس، وإزالة الضجيج، وإعداد أقنعة التجزئة. وتُعالج الصور التي تمت معالجتها مسبقاً لاحقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، يتم تزويد خرائط الميزات المدمجة بوحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُقدم الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتحسين الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. وأثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و 22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. كما يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يشمل تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة 16، ومعدل تعلم 0.0002، و 100 حقبة تدريب. واستُخدمت بذرة عشوائية ثابتة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. تم تطبيق هذه البذرة باستمرار عبر مولدات الأرقام العشوائية في Python و NumPy و PyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين محسن Adam بقيم β₁ = 0.5 و β₂ = 0.999، وبدون اضمحلال في الوزن (weight decay = 0). واختيرت نقاط تحقق النموذج بناءً على أعلى درجة IoU للتحقق تم تحقيقها في مجموعة بيانات التحقق.

تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسارات التجزئة، والخسارة التنافسية، والاتساق الدوري، وإعادة البناء، والحفاظ على الزخارف، واتساق النمط. تتوفر الصيغة الرياضية الكاملة، ومعاملات الوزن، وتعريف خسارة النمط في المعادلتين 21 و22 ضمن القسم الفرعي Artistic Style Generation using SPADE. يعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة لها، مما يشجع على الحفاظ على هياكل الأنماط ذات الأهمية الثقافية طوال عملية إعادة البناء.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تقييم إطار عمل SegCycle-SPADE المقترح باستخدام مجموعتي بيانات: مجموعة بيانات الزخارف الثقافية لباتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. تحتوي مجموعة بيانات باتيك مياو على صور للتراث الثقافي التقليدي واستُخدمت بشكل أساسي لمهام التقسيم الدلالي وإعادة البناء الهيكلي، بينما تحتوي مجموعة بيانات WikiArt على أنماط فنية متنوعة واستُخدمت لتعلم الأنماط الفنية وتوليدها. تمت معالجة الصور من كلتا المجموعتين عبر مسار عمل SegCycle-SPADE الكامل، بما في ذلك التقسيم الدلالي، وCAFFM، وإعادة بناء الأنماط، وتوليد الأنماط الفنية القائم على SPADE. وقد مكن دمج معلومات الزخارف الثقافية وتمثيلات الأنماط الفنية إطار العمل من توليد مخرجات ذات دلالة ثقافية ومتماسكة بصرياً.

أُجريت جميع التجارب على محطة عمل تدعم وحدة معالجة الرسومات (GPU) ومجهزة بمعالج Intel Core i7 ووحدة معالجة رسومات NVIDIA. وبالتحديد، نُفذت التجارب على محطة عمل مجهزة بوحدة معالجة مركزية Intel Core i7 (الجيل الحادي عشر)، ووحدة معالجة رسومات NVIDIA RTX 3090 بذاكرة وصول عشوائي للفيديو (VRAM) سعة 24 GB، وذاكرة نظام سعة 32 GB. تم تنفيذ النماذج باستخدام لغة Python 3.8 وإطار عمل PyTorch 1.10 مع تسريع CUDA. أُجري التدريب باستخدام إعداد وحدة معالجة رسومات واحدة دون تدريب موزّع. استُخدمت دقة FP32 القياسية في جميع التجارب، ولم يتم استخدام التدريب بدقة مختلطة. استُخدم محسن Adam بحجم دفعة 16 لمدة 100 حقبة تدريبية. ويلخص الجدول 3 معاملات التنفيذ والبيئة الحسابية المستخدمة في هذه الدراسة.

تتكون البنية المقترحة من أربعة مكونات رئيسية: SegFormer-B2 للتجزئة الدلالية، وCAFFM لدمج الميزات، وCycleGAN لإعادة بناء الزخارف (motifs)، وSPADE لتوليف النمط الفني. تم تغيير حجم الصور من كلتا مجموعتي البيانات إلى 256 × 256 بكسل قبل التدريب. وقد ضمنت هذه الدقة الموحدة الكفاءة الحسابية مع الحفاظ على تفاصيل الزخارف الهامة، كما ساهمت في استقرار التدريب التنافسي لكل من وحدات CycleGAN وSPADE.

تم تقييم أداء الإطار المقترح باستخدام مقاييس تقسيم الصور وتقييم جودة الصور، والتي شملت دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيت المبدئية (FID). كما تم تقييم الأصالة البصرية نوعياً من خلال الفحص البصري للأنماط الثقافية المُولدة. وركز التقييم النوعي على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والمظهر الفني مقارنة بالزخارف الثقافية المرجعية. ولم تُستخدم الأصالة البصرية كمقياس تقييم كمي مستقل.

أُجري التقييم الكمي للإطار المقترح باستخدام المقاييس التالية.

تم حساب دقة التجزئة باستخدام المعادلة 23:

صيغة الدقة، TP+TN/TP+TN+FP+FN، معادلة التحليل الإحصائي لتقييم النموذج.

هنا، تشير TP وTN وFP وFN إلى الإيجابيات الحقيقية، والسلبيات الحقيقية، والإيجابيات الكاذبة، والسلبيات الكاذبة، على التوالي.

تم حساب تقاطع الاتحاد (IoU) باستخدام المعادلة 24:

 صيغة IoU، وهي TP/(TP+FP+FN)، المعادلة الرياضية لدقة تقسيم الصور.

تم حساب معامل تشابه دايس (Dice) باستخدام المعادلة 25:

معادلة معامل Dice، \( \frac{2*TP}{2*TP+FP+FN} \)، الصيغة المستخدمة في تقييم تحليل البيانات.

استُخدم مؤشر التشابه الهيكلي (SSIM) لتقييم التشابه الإدراكي للصور، ويتم تعريفه باستخدام المعادلة 2633:

معادلة مؤشر SSIM؛ الصيغة الرياضية لتقييم جودة الصورة؛ مخطط.  (26)

هنا، يرمز μ إلى متوسط الشدة، ويرمز σ إلى التباين، ويرمز σxy إلى التغاير بين الصور، بينما يمثل C1 و C2 ثوابت التثبيت.

تعد نسبة الإشارة إلى الضجيج ذات الذروة (PSNR) مقياساً شائع الاستخدام لتقييم جودة الصور المولدة، ويتم تعريفها في المعادلة 2733:

صيغة PSNR، تقييم جودة الصورة، معادلة حساب نسبة ذروة الإشارة إلى الضوضاء.

هنا، تشير MaxI إلى أقصى قيمة ممكنة للبكسل في الصورة، بينما يمثل MSE متوسط مربع الخطأ بين الصورة الأصلية والصورة المعاد بناؤها.

يمكن حساب FID باستخدام المتوسطات ومصفوفات التباين المشترك كما في المعادلة 2833:

معادلة مسافة فريشيه لإنسبشن (FID)؛ طريقة إحصائية؛ صيغة لتقييم جودة الصور.   (28)

هنا، تمثل μr القيمة المتوسطة للصورة الحقيقية، وتمثل μg القيمة المتوسطة للصورة المولدة، بينما تمثل Σr و Σg مصفوفة التغاير للصور الحقيقية والمولدة على التوالي.

ولإجراء مقارنة في الأداء، تم تقييم الإطار المقترح مقابل طرق تمثيلية شائعة الاستخدام في التقسيم الدلالي، وإعادة بناء الصور، وتوليد الصور الفنية. وقد تم إدراج U-Net و DeepLabV3+ كطرق مرجعية للتقسيم، بينما أُدرج Pix2Pix و CycleGAN كطرق مرجعية لإعادة البناء. كما استُخدم StyleGAN و AttentionGAN كطرق تمثيلية لتوليد الصور الفنية. وقد أجريت هذه المقارنات لتقييم مدى فعالية SegCycle-SPADE في الحفاظ على معلومات الأنماط الهيكلية مع تحسين الجودة الفنية في الوقت ذاته.

كُررت كل تجربة خمس مرات لتقييم استقرار الأداء وقابلية التكرار. استُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات لضمان اتساق المجموعات الفرعية للتدريب والتحقق والاختبار عبر جميع التجارب. تم تسجيل النتائج في صورة المتوسط ± الانحراف المعياري. وتشير قيم الانحراف المعياري المنخفضة الملاحظة في مقاييس Accuracy وIoU وDice وSSIM وPSNR وFID إلى أن الإطار المقترح قد حقق أداءً مستقراً عبر عمليات التشغيل التجريبية المتكررة. جرى تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة (paired t-tests)، واعتُبرت الفروق ذات دلالة إحصائية عندما تكون p < 0.05. ونظراً لتقييم جميع النماذج بناءً على نفس تقسيمات مجموعة البيانات، فقد تم الحصول على قياسات أداء مقترنة عبر عمليات التشغيل المتكررة، مما يبرر استخدام اختبارات t المقترنة. وللتحكم في معدل الخطأ العائلي (family-wise error rate) المرتبط بالمقارنات الزوجية المتعددة، تم تطبيق تصحيح بونفيروني (Bonferroni correction)، وحُددت الدلالة الإحصائية باستخدام عتبة معدلة قدرها α/n، حيث يشير n إلى عدد المقارنات الزوجية.

تدعم النتائج التجريبية بقوة فعالية إطار عمل SegCycle-SPADE المقترح. ويظهر أداء التجزئة الفائق الذي حققه SegFormer-B2 قدرته على تحديد حدود الزخارف ذات الأهمية الثقافية والحفاظ عليها بدقة. كما تشير التحسينات في درجات IoU وDice إلى الحفاظ الفعال على الهياكل الدلالية للزخارف طوال مراحل معالجة البيانات. وقد نجح دمج CycleGAN وSPADE في إعادة بناء هياكل الزخارف غير المكتملة مع الحفاظ على التفاصيل البصرية الدقيقة، وهو ما انعكس في تحسن قيم SSIM وPSNR. علاوة على ذلك، تشير درجات FID المنخفضة إلى أن الأنماط الفنية المولدة تظهر تشابهاً أكبر مع الصور الثقافية والفنية الأصلية، مما يشير إلى تحسن في التماسك الأسلوبي والواقعية البصرية.

ساهم نموذج CAFFM بشكل كبير في هذه التحسينات من خلال تسهيل التفاعل الفعال بين المعلومات الهيكلية المستمدة من التجزئة وتمثيلات الأسلوب التوليدية. ومن خلال دمج الميزات القائم على الانتباه المتقاطع، عزز نموذج CAFFM كلاً من الدقة الهيكلية والأصالة الفنية مع الحفاظ على العلاقات بعيدة المدى بين الزخارف الثقافية.

يوضح الشكل 6 مقارنة دقة التجزئة بين إطار عمل SegCycle-SPADE المقترح والطرق الحالية على مجموعتي بيانات Miao Batik وWikiArt. حققت مناهج التجزئة التقليدية مثل U-Net وDeepLabV3+ أداءً تنافسياً نظراً لقدرتها على تعلم التمثيلات المكانية. ومع ذلك، أظهر كل من Pix2Pix وCycleGAN دقة تجزئة أقل لكونهما غير مصممين خصيصاً لمهام التجزئة. وقد حقق إطار عمل SegCycle-SPADE المقترح أعلى دقة تجزئة في كلتا مجموعتي البيانات بفضل دمج SegFormer-B2 وتعزيز الميزات القائم على CAFFM.

رسم بياني لدقة التجزئة؛ لمقارنة طرق U-Net و DeepLabV3+ و Pix2Pix و CycleGAN و SegCycle-SPADE.
الشكل 6. مقارنة دقة التجزئة عبر الطرق المختلفة. مقارنة لدقة التجزئة التي تم الحصول عليها باستخدام U-Net و DeepLabV3+ و Pix2Pix و CycleGAN وإطار عمل SegCycle-SPADE المقترح على مجموعتي بيانات Miao Batik و WikiArt. يتم عرض النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تشير القيم الأعلى إلى تحسن في أداء التجزئة. حقق إطار عمل SegCycle-SPADE المقترح أعلى دقة تجزئة في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

يوضح الشكل 7 مقارنة IoU بين الطرق التي تم تقييمها. حققت كل من U-Net وDeepLabV3+ أداءً قوياً في التداخل بفضل بنيتيهما الموجهة نحو التجزئة. وفي المقابل، أنتجت Pix2Pix وCycleGAN قيم IoU أقل لأن هدفهما الأساسي هو ترجمة الصور وليس التجزئة الدلالية. وقد حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم IoU في كلتا مجموعتي البيانات، مما يشير إلى تحسن في التحديد الموضعي والحفاظ على مناطق الزخارف الثقافية.

مقارنة درجة IoU، مخطط شريطي؛ طرق التقسيم مقابل مجموعات بيانات Miao Batik وWikiArt؛ المتوسط ± الانحراف المعياري.
الشكل 7. مقارنة درجات التقاطع فوق الاتحاد (IoU) لتقسيم الزخارف الثقافية. مقارنة أداء IoU بين طرق التقسيم المختلفة على مجموعتي بيانات Miao Batik وWikiArt. تم عرض النتائج في صورة المتوسط ± الانحراف المعياري (SD) لخمس عمليات تشغيل مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير قيم IoU الأعلى إلى تحسن التداخل بين مناطق الزخارف المتوقعة والمرجعية والحفاظ بشكل أفضل على حدود الزخارف. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات IoU في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8 يوضح مقارنة معامل تشابه دايس (Dice Similarity Coefficient). يقيس معامل دايس مدى التداخل بين أقنعة التقسيم المتوقعة ومناطق الزخارف المرجعية (ground-truth). حققت منهجيات التقسيم التقليدية درجات دايس مرتفعة نسبيًا نظرًا لفعاليتها في تعلم الهياكل المكانية. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات دايس في كلتا مجموعتي البيانات، مما يدل على تحسن في اتساق التقسيم والحفاظ على الزخارف.

رسم بياني لمعامل Dice لتقسيم الزخارف؛ الطرق: U-Net، وDeepLabV3+، وPix2Pix، وCycleGAN.
الشكل 8. مقارنة معامل Dice لتقسيم الزخارف الثقافية. مقارنة لقيم معامل Dice التي تم الحصول عليها باستخدام مناهج تقسيم مختلفة على مجموعتي بيانات Miao Batik وWikiArt. يقيم معامل Dice مدى التداخل بين أقنعة التقسيم المتوقعة والأقنعة المرجعية، حيث تشير القيم الأعلى إلى تحسن في أداء التقسيم وتحديد منطقة الزخارف. حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم لمعامل Dice في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 9 يوضح مقارنة SSIM بين الأنماط الثقافية المعاد بناؤها. حققت الطرق القائمة على شبكات GAN مثل Pix2Pix وCycleGAN وStyleGAN قيم SSIM أعلى من طرق التجزئة التقليدية لأنها صُممت لتوليد الصور. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم SSIM في كلتا مجموعتي البيانات، مما يشير إلى تفوقه في الحفاظ على التفاصيل الهيكلية والاتساق الفني.رسم بياني شريطي لمقارنة التشابه الهيكلي؛ درجات SSIM لكل من Pix2Pix وCycleGAN وغيرها في مجموعات البيانات.

الشكل 9. مقارنة مؤشر التشابه الهيكلي (SSIM).مقارنة قيم مؤشر التشابه الهيكلي (SSIM) التي تم الحصول عليها باستخدام طرق إعادة بناء مختلفة على مجموعتي بيانات Miao Batik وWikiArt. تُعرض النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير قيم SSIM الأعلى إلى تشابه هيكلي أكبر بين الأنماط المعاد بناؤها والأنماط المرجعية. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات SSIM عبر كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تَمَّ استخدام مسافة فريديهيلر (FID) لتقييم واقعية الأنماط الفنية المُولَّدة ومدى تشابه توزيعها. أُجري حساب FID باستخدام شبكة Inception-v3 مُدربة مسبقاً، مع استخراج ناقلات السمات من طبقة pool3، مما نتج عنه تمثيلات سمات ذات 2048 بُعداً. وقبل عملية استخراج السمات، أُعيد تحجيم الصور المُولَّدة والمرجعية إلى 299 × 299 بكسل باستخدام الاستيفاء الخطي الثنائي، وجرى تطبيعها وفقاً لبروتوكول المعالجة المسبقة القياسي لشبكة Inception-v3. كما حُسبت قيمة FID باستخدام توزيعات السمات المستخرجة من مجموعة بيانات الاختبار المستقلة. وقد تم تقدير إحصاءات المتوسط والتباين المشترك من تضمينات السمات واستخدامها ضمن صيغة FID القياسية.

كما هو موضح في الجدول 4، أنتجت نهج توليد الصور التقليدية مثل Pix2Pix وCycleGAN درجات FID مرتفعة نسبيًا بسبب افتقارها إلى توجيه هيكلي صريح. وحقق كل من StyleGAN وAttentionGAN درجات FID أقل من خلال قدرات محسنة في تعلم الميزات. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أدنى درجات FID في كلتا مجموعتي البيانات، مما يدل على واقعية فائقة في الصور، واتساق في الأسلوب، والحفاظ على الزخارف الثقافية.

الطريقةمجموعة بيانات Miao Batik (FID)مجموعة بيانات WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (المقترحة)28.531.2

الجدول 4: نتائج مسافة فريشيه البادئة (FID) لإعادة بناء الأنماط الثقافية.مقارنة لدرجات مسافة فريشيه البادئة (FID) التي تم الحصول عليها بواسطة إطار عمل SegCycle-SPADE المقترح والنماذج التوليدية المرجعية على مجموعتي بيانات Miao Batik وWikiArt. تشير قيم FID الأدنى إلى تشابه أكبر بين توزيعات ميزات الصور المولدة والصور الحقيقية، وبالتالي تعكس واقعية بصرية محسنة للأنماط الثقافية المعاد بناؤها.

الشكل 10 يقارن جودة إعادة البناء التي حققتها الطرق المختلفة. تم حساب جودة إعادة البناء (%) عن طريق تحويل مؤشر التشابه الهيكلي (SSIM) بين الصورة المعاد بناؤها والصورة المرجعية المقابلة إلى مقياس نسبة مئوية (SSIM × 100). وتشير النسب المئوية الأعلى إلى دقة هيكلية أكبر وتشابه بصري أكثر مع الزخرفة الثقافية الأصلية. حققت النماذج التوليدية التقليدية مثل Pix2Pix وCycleGAN أداءً متوسطاً في إعادة البناء. بينما حققت البنيات الأكثر تقدماً، بما في ذلك StyleGAN وAttentionGAN، جودة إعادة بناء محسنة بفضل قدراتها المعززة في تعلم الميزات. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى جودة إعادة بناء بفضل تكامله مع توجيه التقسيم الدلالي، ودمج ميزات الانتباه المتقاطع، وتعلم إعادة البناء، والتركيب الفني.

مخطط مقارنة جودة إعادة البناء؛ الطرق: Pix2Pix، وCycleGAN، وStyleGAN، وAttentionGAN، وSegCycle-SPADE.
الشكل 10. مقارنة جودة إعادة بناء الأنماط. مقارنة لجودة إعادة البناء التي تم تحقيقها باستخدام Pix2Pix، وCycleGAN، وStyleGAN، وAttentionGAN، وإطار عمل SegCycle-SPADE المقترح على مجموعتي بيانات Miao Batik وWikiArt. تُعرض النتائج في صورة المتوسط ± الانحراف المعياري (SD) من خمس تجارب مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير القيم الأعلى إلى تحسن في الحفاظ على التفاصيل الهيكلية، والاتساق الدلالي، والدقة البصرية. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات جودة إعادة البناء في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تم استخدام نسبة إشارة الذروة إلى الضوضاء PSNR لتقييم دقة إعادة البناء من خلال قياس التشابه على مستوى البكسل بين الصور المعاد بناؤها والصور المرجعية المقابلة لها. وقد تم حساب PSNR بين كل صورة معاد بناؤها وصورة باتيك مياو الأصلية المقابلة لها والتي استُخدمت كمرجع للحقيقة الأرضية ground-truth. وتشير قيم PSNR الأعلى إلى انخفاض خطأ إعادة البناء. وكما هو موضح في الجدول 5، حقق كل من Pix2Pix و CycleGAN قيم PSNR متوسطة لأنهما قاما بإعادة بناء الأنماط دون توجيه هيكلي صريح. بينما حقق StyleGAN و AttentionGAN قيم PSNR أعلى من خلال تعلم ميزات أكثر عمقاً. وقد حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم PSNR في كلتا مجموعتي البيانات، مما أظهر دقة فائقة في إعادة البناء والحفاظ على هياكل الزخارف الثقافية.

الطريقةمجموعة بيانات Miao Batik
(PSNR, dB)
مجموعة بيانات WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (المقترحة)32.431.2

الجدول 5: نتائج نسبة ذروة الإشارة إلى الضجيج (PSNR) لإعادة بناء الأنماط الثقافية. مقارنة لقيم نسبة ذروة الإشارة إلى الضجيج (PSNR) التي تم الحصول عليها بواسطة إطار عمل SegCycle-SPADE المقترح والطرق المرجعية على مجموعتي بيانات Miao Batik وWikiArt. تشير قيم PSNR الأعلى إلى تحسن في دقة إعادة البناء وتقليل التشوه بالنسبة لصور المرجع المقابلة.

الشكل 11 يوضح سلوك التقارب لإطار عمل SegCycle-SPADE المقترح أثناء التدريب. تمثل منحنيات الخسارة متوسط خسائر التدريب المحسوبة عبر خمس عمليات تدريب مستقلة. ولتقليل التباين العشوائي وتقديم تمثيل أكثر متانة لتقارب التدريب، تم حساب متوسط قيم الخسارة عند كل حقبة تدريبية عبر جميع العمليات. خلال حقبات التدريب الأولية، كانت قيم الخسارة مرتفعة نسبياً لأن النموذج كان لا يزال يتعلم تمثيلات الميزات من البيانات المدخلة. ومع تقدم التدريب، انخفضت جميع مكونات الخسارة تدريجياً واستقرت، مما يشير إلى التحسين الناجح لأهداف التجزئة وإعادة البناء والتركيب الفني. يبرهن سلوك التقارب الملحوظ على فعالية واستقرار وقابلية تكرار إطار العمل المقترح أثناء التدريب.

رسم بياني لتقارب التدريب، إطار عمل SegCycle-SPADE. الخسارة مقابل عدد العصور؛ L_total وL_seg وL_G وL_D.
الشكل 11. تقارب التدريب لإطار عمل SegCycle-SPADE المقترح. منحنيات خسارة التدريب لإطار عمل SegCycle-SPADE المقترح على مدار 100 عصر تدريبي، بمتوسط خمس عمليات تدريب مستقلة (n = 5). يوضح الشكل تطور الخسارة الكلية (LTotal)، وخسارة التجزئة (LSeg)، وخسارة المولد (LG)، وخسارة المميز (LD) أثناء التدريب. يشير الانخفاض التدريجي ثم الاستقرار اللاحق لجميع مكونات الخسارة إلى التقارب الناجح والتحسين المستقر لإطار العمل المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

دراسة الاستئصال
لتقييم مساهمة كل مكون ضمن إطار عمل SegCycle-SPADE المقترح، أُجريت دراسة استئصال باستخدام تكوينات نموذجية متعددة ومضبوطة. والنتائج ملخصة في الجدولين 6 و7.

تكوين النموذجدقة التجزئة (%)IoUSSIM
SegFormer فقط87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (المقترح)93.80.860.93

الجدول 6: دراسة استئصال لمكونات SegCycle-SPADE. مقارنة في الأداء لتكوينات النموذج المحسنة تدريجياً لتقييم مساهمة المكونات الفردية للإطار العملي. تبحث الدراسة في آثار التجزئة الدلالية، ووحدة دمج الميزات الثقافية عبر الانتباه المتبادل (CAFFM)، وإعادة البناء القائمة على CycleGAN، والتخليق الفني القائم على SPADE على دقة التجزئة، وتقاطع الاتحاد (IoU)، ومؤشر التشابه الهيكلي (SSIM). وتشير القيم الأعلى إلى تحسن في تجزئة الزخارف، وجودة إعادة البناء، والحفاظ على الهيكل.

متغايرنسبة التداخل فوق الاتحاد (IoU) (%)معامل دايس (%)مؤشر التشابه الهيكلي (SSIM)نسبة إشارة الذروة إلى الضوضاء (ديسيبل)كاشف التأين باللهب (FID) ↓
SegFormer فقط84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (النموذج الكامل)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

الجدول 7: تحليل مساهمة المكونات في إطار عمل SegCycle-SPADE المقترح. مقارنة في الأداء لمتغيرات فردية من إطار العمل استُخدمت لتقييم مساهمة كل من CAFFM وCycleGAN وSPADE، بالإضافة إلى بنية SegCycle-SPADE الكاملة. تم تسجيل النتائج باستخدام تقاطع الاتحاد (IoU)، ومعامل Dice، ومؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضجيج (PSNR)، ومسافة Frechet Inception (FID). تشير القيم الأعلى لكل من IoU وDice وSSIM وPSNR إلى تحسن في جودة التجزئة وإعادة البناء، بينما تشير قيم FID الأقل إلى واقعية بصرية أكبر للأنماط الثقافية المولدة.

يقوم الجدول 6 بتقييم المساهمة التراكمية لمكونات الإطار الأساسية باستخدام أربعة تكوينات: (i) SegFormer فقط، و(ii) SegFormer + CAFFM، و(iii) SegFormer + CAFFM + CycleGAN، و(iv) SegFormer + CAFFM + CycleGAN + SPADE (الإطار المقترح). حقق نموذج SegFormer المرجعي دقة تقسيم بلغت 87.3%، ودرجة IoU بلغت 0.76، وقيمة SSIM بلغت 0.82. وقد أدى دمج وحدة CAFFM إلى تحسين الأداء عبر جميع مقاييس التقييم، حيث ارتفعت دقة التقسيم إلى 89.6%، وIoU إلى 0.79، وSSIM إلى 0.86. كما ساهمت إضافة CycleGAN في تعزيز قدرة إعادة البناء الهيكلية بشكل أكبر، مما أدى إلى تحقيق IoU قدره 0.82 وقيمة SSIM قدرها 0.89. وحقق إطار SegCycle-SPADE الكامل أفضل أداء إجمالي، بدقة تقسيم بلغت 93.8%، وIoU قدره 0.86، وقيمة SSIM بلغت 0.93. وتثبت هذه النتائج أن كل مكون يساهم بشكل تراكمي في تحسين دقة التقسيم، والحفاظ على البنية، وجودة إعادة بناء الصورة.

الجدول 7 يبحث بشكل أعمق في مساهمة مكونات الإطار الفردية باستخدام خمسة متغيرات من النموذج: (i) SegFormer فقط، (ii) SegFormer + CycleGAN، (iii) SegFormer + SPADE، (iv) SegFormer + CAFFM، و (v) النموذج الكامل الذي يدمج SegFormer و CAFFM و CycleGAN و SPADE وخسارة الحفاظ على الزخرفة (motif-preservation loss). تم تقييم الأداء باستخدام مقاييس IoU، ومعامل Dice، و SSIM، و PSNR، و FID.

حققت التهيئة الأساسية المعتمدة على SegFormer وحده قيمة IoU بلغت 84.2%، ومعامل Dice بنسبة 88.5%، وقيمة SSIM بلغت 0.82، وPSNR قدره 24.8 dB، ودرجة FID بلغت 31.8. وقد أدىت إضافة CycleGAN إلى تحسين جودة إعادة البناء وخفض درجة FID إلى 27.5، مما يشير إلى تعزيز واقعية الصور. كما ساهم دمج SPADE في تحسين التشابه الهيكلي وجودة الصور بشكل أكبر، مما نتج عنه قيمة SSIM بلغت 0.88 ودرجة FID بلغت 23.4. وأدى تضمين وحدة CAFFM المقترحة إلى تحقيق مكاسب جوهرية في جميع المقاييس، حيث ارتفع IoU إلى 90.0%، ومعامل Dice إلى 93.1%، وSSIM إلى 0.90، وPSNR إلى 29.6 dB، مع خفض درجة FID إلى 20.3. أما النموذج الكامل، الذي يدمج بالإضافة إلى ذلك فقدان الحفاظ على الزخارف (motif-preservation loss)، فقد حقق أفضل أداء إجمالي بقيمة IoU بلغت 93.0%، ومعامل Dice بنسبة 95.4%، وقيمة SSIM بلغت 0.92، وPSNR قدره 31.2 dB، ودرجة FID بلغت 17.6.

يقدم الجدول 8 نظرة عامة مقارنة لنهج التعلم العميق (DL) التمثيلية المستخدمة في إعادة بناء الأنماط والحفاظ على التراث الثقافي. توفر الطرق التقليدية القائمة على الشبكات العصبية التلافيفية (CNN) تعلمًا فعالًا للميزات المحلية وأداءً جيدًا في التجزئة، ولكنها غالبًا ما تواجه صعوبة في الحفاظ على هياكل الزخارف المعقدة بسبب محدودية نمذجة الاعتماديات طويلة المدى. أما النهج القائمة على الشبكات التنافسية التوليدية (GAN) فتحسن من قدرات تخليق الصور ونقل الأنماط؛ ومع ذلك، قد تعاني من عدم اتساق دلالي وفقدان في التفاصيل الهيكلية الدقيقة. وتعزز الطرق القائمة على المحولات (Transformer) الفهم السياقي العالمي، لكنها تفتقر عادةً إلى قدرات إعادة البناء التوليدية، بينما توفر الطرق القائمة على الانتشار (diffusion) واقعية بصرية عالية على حساب زيادة التعقيد الحسابي. وتعالج نهج المحولات-GAN الهجينة هذه القيود جزئيًا من خلال الجمع بين آليات استخراج الميزات وتوليد الصور. وفي المقابل، يدمج إطار عمل SegCycle-SPADE المقترح التجزئة القائمة على المحولات، ودمج الميزات عبر الانتباه المتبادل، وإعادة البناء التوليدية، والتخليق الفني الموجه بالتجزئة ضمن بنية موحدة، مما يؤدي إلى تحسين الدقة الهيكلية، والاتساق الدلالي، والحفاظ على الزخارف الثقافية. وتلخص هذه المقارنة في الجدول 8.

المنهجالمنهجية الأساسيةنقاط القوةالقيودالأهمية للتراث الثقافي
الطرق القائمة على CNN (مثل U-Net وDeepLabV3+)استخراج الميزات الالتفافية والتقسيم الدلاليتعلم فعال للميزات المحلية وتقسيم دقيقنمذجة محدودة للاعتماديات طويلة المدى؛ صعوبة في الحفاظ على هياكل الزخارف المعقدةمناسبة لتقسيم الزخارف ولكنها أقل فعالية في إعادة البناء الفني
الطرق القائمة على GAN (مثل Pix2Pix وCycleGAN)توليد الصور التنافسي والترجمة من صورة إلى صورةتخليق صور عالية الجودة ونقل للأنماطعدم استقرار التدريب؛ عدم اتساق دلالي؛ احتمال فقدان التفاصيل الهيكلية الدقيقةمفيدة لاستعادة الأنماط ولكن قد لا تحافظ على الزخارف الثقافية بدقة
الطرق القائمة على Transformerالانتباه الذاتي ونمذجة السياق العالميالتقاط الاعتماديات طويلة المدى والعلاقات البصرية المعقدةتكلفة حوسبية عالية؛ تتطلب مجموعات بيانات تدريب ضخمةفعالة لتحليل الأنماط المعقدة ولكن قدرتها التوليدية محدودة عند استخدامها بمفردها
الطرق القائمة على الانتشار (Diffusion)توليد الصور القائم على إزالة الضجيج التكراريواقعية بصرية عالية وتنوع في الصورسرعة استنتاج بطيئة؛ متطلبات حوسبية عالية؛ تحكم هيكلي محدودواعدة لتوليد صور التراث ولكنها مكثفة حوسبياً
طرق Transformer-GAN الهجينةالجمع بين استخراج الميزات القائم على Transformer والتوليد القائم على GANتمثيل محسن للميزات العالمية وجودة صورة أفضلغالباً ما تفتقر إلى توجيه دلالي صريح للحفاظ على الزخارفتعزز جودة التوليد ولكنها غير مصممة خصيصاً لزخارف التراث الثقافي
نموذج SegCycle-SPADE المقترحSegFormer + CAFFM + CycleGAN + SPADEتقسيم قائم على Transformer، دمج ميزات موجه بالانتباه، اتساق دلالي، حفظ الزخارف، وإعادة بناء فنية قابلة للتحكمتعقيد حوسبي أعلى من المنهجيات القائمة على CNN المنفردةمصمم خصيصاً لإعادة بناء وحفظ أنماط التراث الثقافي مع تحسين الدقة الهيكلية والاتساق الدلالي

الجدول 8: مقارنة بين مناهج التعلم العميق التمثيلية لإعادة بناء أنماط التراث الثقافي والحفاظ عليها. مقارنة نوعية لمناهج التعلم العميق التمثيلية المستخدمة في تقسيم الصور، وإعادة بناء الأنماط، وتوليد الأساليب، والحفاظ على التراث الثقافي. يلخص الجدول المنهجية الأساسية، ونقاط القوة، والقيود، وقابلية التطبيق لكل منهج، ويسلط الضوء على كيفية دمج إطار عمل SegCycle-SPADE المقترح بين التقسيم الدلالي، ودمج الميزات، وإعادة البناء، وتوليف الأساليب لمعالجة التحديات المتعلقة بالحفاظ الهيكلي والاتساق الدلالي في أنماط التراث الثقافي.

تُظهر التحسينات الملحوظة أن وحدة CAFFM تعزز بفعالية التفاعل بين السمات الهيكلية المستمدة من التجزئة وتمثيلات الأسلوب الفني من خلال دمج السمات القائم على الانتباه المتقاطع. علاوة على ذلك، تساهم خسارة الحفاظ على الزخارف في الحفاظ على هياكل الزخارف ذات الأهمية الثقافية أثناء عملية إعادة البناء والتوليف الفني، مما يؤدي إلى تحسين اتساق التجزئة، والدقة الهيكلية، والواقعية البصرية. وتؤكد نتائج دراسة الاستئصال مجتمعة أن دمج كل من SegFormer-B2 وCAFFM وCycleGAN وSPADE وخسارة الحفاظ على الزخارف هو المسؤول عن الأداء المتفوق لإطار عمل SegCycle-SPADE المقترح.

توافر البيانات:
إن مجموعة بيانات WikiArt المستخدمة في تعلم الأنماط الفنية متاحة للعامة من خلال مستودع Kaggle WikiArt عبر الرابط (https://www.kaggle.com/datasets/steubk/wikiart). كما أن مجموعة بيانات Miao Batik المستخدمة في هذه الدراسة متاحة للعامة عبر Zenodo من خلال الرابط (https://doi.org/10.5281/zenodo.20807658). وتتوفر أيضاً مجموعات البيانات المعالجة، وأقنعة التقسيم، وأوزان النموذج المدربة مسبقاً، والمخرجات المولدة، وملفات تنفيذ لغة Python المرتبطة بإطار عمل SegCycle-SPADE المقترح من خلال مستودع Zenodo ذاته.

ملف تكميلي:
الملف التكميلي 1. الخوارزمية 1: سير عمل تنفيذ إطار عمل SegCycle-SPADE المقترح. كود برمجي وصفي (pseudocode) خطوة بخطوة يوضح مسار التنفيذ الكامل لإطار عمل SegCycle-SPADE المقترح، بما في ذلك تحميل مجموعة البيانات، والمعالجة المسبقة، والتقسيم الدلالي باستخدام SegFormer-B2، ودمج الميزات باستخدام وحدة دمج الميزات الثقافية عبر الانتباه المتبادل (CAFFM)، وإعادة بناء الزخارف الثقافية باستخدام CycleGAN، وتوليف النمط الفني باستخدام SPADE، وتدريب النموذج، والتحقق من الصحة، واختيار نقاط التحقق، والتقييم النهائي للأداء. يرجى النقر هنا لتحميل هذا الملف.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لقد حظي حفظ وإعادة البناء الرقمي لأنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد في السنوات الأخيرة بسبب الفقدان التدريجي للحرف التقليدية. وقد حاولت الدراسات السابقة معالجة فقدان التراث الثقافي من خلال تقنيات معالجة الصور القائمة على التعلم العميق (DL). فعلى سبيل المثال، اقترح Quan et al.32 إطار عمل للحفاظ على التراث الثقافي يعتمد على الرسوم البيانية للمعرفة والتعلم العميق لثقافة الباتيك لشعب مياو في غويتشو. ورغم أن الدراسة ركزت على إعادة البناء الرقمي للأنماط الثقافية، إلا أن منهجيتها اعتمدت بشكل أساسي على تمثيلات الرسوم البيانية للمعرفة. وبالمثل، اقترح Fu and Razmjooy16 إطار عمل يعتمد على شبكة هرم الميزات (FPN) لتحسين وترميم صور التراث الثقافي. وبالرغم من أن هذه الطريقة وفرت استخلاصاً فعالاً للميزات لتحسين الصور، إلا أنها لم تدمج توجيهاً لتقسيم الصور أو آليات إعادة بناء توليدية للأنماط الثقافية غير المكتملة. وفي المقابل، يجمع إطار عمل SegCycle-SPADE المقترح بين مكونات متعددة من التعلم العميق للتغلب على هذه التحديات. أولاً، يتم استخدام التقسيم الدلالي باستخدام نموذج SegFormer للتحديد الدقيق لمناطق الزخارف داخل أنماط التراث الثقافي. بعد ذلك، تعمل وحدة تعزيز الميزات القائمة على CAFFM على تحسين تمثيلات الميزات لهياكل الزخارف دقيقة التفاصيل. ثم تُستخدم وحدة إعادة بناء CycleGAN لإعادة بناء المناطق المفقودة أو غير المكتملة داخل الأنماط الثقافية من خلال التعلم التنافسي. وأخيراً، تقوم وحدة SPADE بإجراء تحسين أسلوبي مع الحفاظ على المحاذاة الهيكلية مع خرائط التقسيم. تقدم الطرق الحالية القائمة على CNN- وGAN- وtransformer- وdiffusion17,19,20,21,22,23,24,25,30,34 مزايا فريدة؛ ومع ذلك، فإنها تظهر أيضاً قيوداً في الحفاظ على الاتساق الدلالي، أو الحفاظ على الميزات الهيكلية، أو تحقيق الكفاءة الحسابية، كما هو ملخص في الجدول 8. وتجمع بنية SegCycle-SPADE المقترحة بين نقاط القوة في التقسيم القائم على SegFormer، ودمج الميزات عبر الانتباه المتبادل، وإعادة بناء CycleGAN، والتوليف الموجه بـ SPADE مع معالجة هذه القيود. وبالتالي، يحقق إطار العمل جودة محسنة في إعادة البناء وتعزيزاً في الحفاظ على الزخارف ذات الأهمية الثقافية.

على الرغم من أدائه المشجع، لا يزال إطار عمل SegCycle-SPADE المقترح يواجه عدة قيود. أولاً، أُجري التقييم باستخدام مجموعتي بيانات Miao Batik وWikiArt فقط، مما قد يحد من إمكانية تعميم إطار العمل على مجالات أخرى من التراث الثقافي. ثانياً، قد يكون النشر على المنصات ذات الموارد المحدودة أمراً صعباً لأن دمج SegFormer وCAFFM وCycleGAN وSPADE يزيد من التعقيد الحسابي ومتطلبات الذاكرة. ثالثاً، يعتمد أداء التجزئة بشكل كبير على جودة واتساق تعليقات الزخارف التوضيحية، وقد يؤثر انحياز التعليق التوضيحي على الحفاظ على الهياكل ذات الأهمية الثقافية. وأخيراً، ونظراً لتقييم إطار العمل باستخدام مجموعتي بيانات فقط، قد تكون هناك حاجة إلى بيانات تدريب إضافية وتكيفات محددة لكل مجال لضمان القابلية للتطبيق عبر مجموعات التراث الثقافي المتنوعة. لذا، ينبغي أن تستكشف الدراسات المستقبلية استراتيجيات تدريب أكثر قوة، وبنيات خفيفة الوزن، وإجراءات تحسين للتعليقات التوضيحية، وتقييمات عبر المجالات باستخدام مجموعات بيانات إضافية للتراث الثقافي.

سيكون التركيز الرئيسي للأبحاث المستقبلية على مدى قابلية إطار عمل SegCycle-SPADE للتوسع ليشمل مجموعات بيانات أكبر وأكثر تنوعاً من التراث الثقافي. كما سيتم إجراء تقييم عبر ثقافي للزخارف التراثية من مناطق مختلفة وتقاليد فنية متنوعة لتحسين تعميم النموذج وقدرته على التكيف الثقافي. علاوة على ذلك، قد توفر التوسعات متعددة الوسائط التي تدمج الأوصاف النصية، والسجلات التاريخية، والبيانات الوصفية الثقافية توجيهاً دلالياً أقوى أثناء عملية إعادة البناء. ويمكن أيضاً توسيع إطار العمل لدعم إعادة بناء التراث الثقافي ثلاثي الأبعاد من خلال دمج إعادة البناء القائمة على الصور مع تقنيات النمذجة ثلاثية الأبعاد. بالإضافة إلى ذلك، سيتم استكشاف إمكانية النشر في الأرشيفات الرقمية، والمتاحف، والمعارض الافتراضية، ومنصات الحفاظ على التراث الثقافي لتسهيل التطبيقات العملية لصون التراث وتوثيقه بمساعدة الذكاء الاصطناعي. ولتحسين القابلية للتفسير والأصالة الثقافية بشكل أكبر، ستعمل الأبحاث المستقبلية على دراسة دمج الرسوم البيانية للمعرفة الثقافية، والتوثيق الإثنوغرافي، والبيانات الوصفية التاريخية، وقواعد المعرفة التي يشرف عليها الخبراء لتمكين تحليل وإعادة بناء الزخارف بناءً على معرفة ثقافية مستنيرة32.

يجب مراعاة عدة اعتبارات عملية عند تنفيذ إطار عمل SegCycle-SPADE المقترح. فخلال تدريب CycleGAN، قد يحدث تقارب تنافسي غير مستقر إذا أصبح فقد المولد والمميز غير متوازن بشكل كبير. وفي مثل هذه الحالات، قد يؤدي تقليل معدل التعلم، أو زيادة وزن فقد الاتساق الدوري، أو مراقبة هيمنة المميز إلى تحسين استقرار التدريب. كما قد يحدث انهيار النمط (Mode collapse) عندما ينتج المولد مخرجات متشابهة بصرياً بشكل متكرر؛ ويمكن التخفيف من هذه المشكلة من خلال التدريب التنافسي المتوازن، واستخدام ذاكرة التخزين المؤقت للإعادة (replay-buffer)، والمراقبة الدقيقة لاتجاهات فقد المولد والمميز. وقد تظهر أيضاً إخفاقات في التقسيم عندما تظهر الزخارف الثقافية أنسجة معقدة، أو تبايناً منخفضاً، أو حدوداً غامضة. ولمعالجة هذه المشكلة، يجب التحقق من جودة الصور قبل التدريب، وفحص أقنعة التقسيم بصرياً لضمان اتساق التوصيفات. ومن المهم أيضاً الحفاظ على دقة الإدخال وإعدادات التسوية الموصى بها لتحقيق أداء موثوق لنموذج SegFormer. وقد ينتج عدم استقرار التدريب أيضاً عن إعدادات غير مناسبة لمعدل التعلم، أو عدم كفاية بيانات التدريب، أو تباينات عددية متعلقة بالأجهزة. ولتحسين إمكانية إعادة الإنتاج، يجب استخدام بذور عشوائية ثابتة لعمليات NumPy وPyTorch وCUDA وعمليات خلط مجموعة البيانات. علاوة على ذلك، يجب الحفاظ على نفس مسار المعالجة المسبقة، وتقسيمات مجموعة البيانات، والمعلمات الفائقة للنموذج، والبيئة البرمجية عبر جميع عمليات التشغيل التجريبية. كما يُنصح بحفظ نقاط التحقق (checkpoint) بشكل دوري ومراقبة فقد التحقق لمنع تدهور الأداء وتسهيل الاستعادة من جلسات التدريب التي تعرضت للمقاطعة.

يساهم العمل المقترح في التطوير النظري لأطر إعادة بناء التراث الثقافي القائمة على الذكاء الاصطناعي. تعامل مناهج ترميم الصور التقليدية عمومًا عمليات تقسيم الصور، وإعادة البناء، وتوليد النمط كعمليات مستقلة17,19,20,30. وفي المقابل، تقترح هذه الدراسة إطار عمل يدمج هذه العمليات من خلال استراتيجية إعادة بناء توليدية موجهة بالتقسيم. وبناءً على ذلك، تساهم الدراسة في التطوير النظري لإعادة بناء التراث الثقافي بمساعدة الذكاء الاصطناعي من خلال توضيح كيفية توحيد عمليات التقسيم وإعادة البناء وتوليد النمط ضمن إطار عمل واحد. ويعد هذا التكامل مهمًا بشكل خاص في تطبيقات التراث الثقافي، حيث يكون الحفاظ على بنية الزخارف والمعنى الدلالي أمرًا بالغ الأهمية. ومن منظور عملي، يوفر إطار العمل المقترح حلًا فعالًا للحفظ الرقمي، والترميم، والتحسين الفني للأنماط الثقافية التقليدية. ويمكن لمؤسسات التراث الثقافي والمتاحف والمصممين استخدام SegCycle-SPADE لتحديد مناطق الزخارف تلقائيًا، وإعادة بناء الأنماط التالفة أو غير المكتملة، وتوليد تمثيلات فنية محسنة بصريًا للتصاميم التقليدية. وتكتسب هذه القدرة قيمة خاصة بالنسبة للحرف التقليدية المهددة بالاندثار، بما في ذلك أنماط منسوجات باتيك Miao، حيث قد تكون القطع الأثرية التاريخية تالفة جزئيًا أو غير مكتملة. علاوة على ذلك، ومن خلال دمج التوليف النمطي التوليدي، يمكن لإطار العمل دعم تطبيقات التصميم الثقافي الحديثة مثل تصميم المنسوجات، والإبداع الفني الرقمي، والتعليم التراثي. وبهذه الطريقة، يسد إطار العمل المقترح الفجوة بين الحفاظ على التراث الثقافي وتطبيقات التصميم الثقافي المعاصرة.

ومع ذلك، وعلى الرغم من النتائج الواعدة التي حققها إطار عمل SegCycle-SPADE المقترح، لا تزال هناك عدة قيود. أولاً، أُجري التقييم باستخدام مجموعتي بيانات Miao Batik وWikiArt فقط، مما قد يؤثر على قدرة الإطار على التعميم عند إعادة بناء أنماط أخرى من التراث الثقافي. ثانياً، نظراً لأن عملية إعادة البناء تعتمد على نماذج GAN، فقد تحتوي المخرجات الناتجة أحياناً على عيوب تقنية أو أنسجة غير طبيعية عند التعامل مع هياكل الزخارف شديدة التعقيد. ثالثاً، يركز الإطار حالياً على إعادة بناء الأنماط ثنائية الأبعاد، في حين أن بعض القطع التراثية الثقافية تتضمن هياكل ثلاثية الأبعاد بطبيعتها. وبشكل عام، تثبت النتائج التجريبية فعالية إطار عمل SegCycle-SPADE المقترح في إعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH). وقد أدى دمج التجزئة الدلالية القائمة على SegFormer، وCAFFM، وإعادة بناء الزخارف القائمة على CycleGAN، والتوليف الفني القائم على SPADE، إلى تحسين مقاييس أداء التجزئة وإعادة البناء وجودة الصورة بشكل مستمر. كما أكدت دراسات الاستئصال مساهمة كل مكون من مكونات الإطار، حيث أظهرت أن CAFFM وفقدان الحفاظ على الزخارف (motif-preservation loss) قد عززا بشكل كبير الدقة الهيكلية والأصالة البصرية. وتدعم هذه النتائج الفرضية المركزية القائلة بأن إعادة البناء الموجهة بالتجزئة الدلالية والمدمجة مع دمج الميزات عبر الانتباه (cross-attention feature fusion) يمكن أن تحافظ بفعالية على الزخارف ذات الأهمية الثقافية مع توليد مخرجات غنية فنياً. وبناءً على ذلك، يوفر الإطار المقترح نهجاً حاسوبياً موثوقاً وقابلاً للتكرار للحفظ الرقمي، والترميم، والإحياء الإبداعي لأنماط التراث الثقافي غير المادي.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تضارب المصالح:
يعلن المؤلفون عن عدم وجود أي تضارب في المصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقر المؤلفون بالدعم الأكاديمي والمؤسسي المقدم من كلية قوانغدونغ المتعددة التقنيات وجامعة جنوب الصين العادية خلال إتمام هذا البحث. وقد حظي هذا البحث بدعم المشروع العام لصندوق العلوم الاجتماعية الوطني لعام 2023 (رقم 23BH161)، بعنوان “متحف التجديد الرقمي: بحث في تفعيل وتوصيل الآثار الثقافية للخط والرسم الصيني الكلاسيكي.”

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مُحسِّن Adamمكتبة PyTorch OptimizerAdamخوارزمية تحسين مستخدمة أثناء تدريب النموذج.
مجموعة أدوات CUDAشركة NVIDIACUDA 11.3تسريع وحدة معالجة الرسوميات (GPU) لحسابات التعلم العميق.
cuDNNشركة NVIDIAcuDNN 8.2مكتبة تسريع الشبكات العصبية العميقة المستخدمة لتسريع التدريب والاستدلال.
CycleGANجامعة كاليفورنيا، بيركلي / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)شبكة تنافسية توليدية مستخدمة لإعادة بناء الزخارف الثقافية.
أوزان ImageNet مسبقة التدريبImageNet / مصدر مفتوحmit_b2.pth (نقطة فحص ImageNet-1K مسبقة التدريب)تُستخدم لتهيئ العمود الفقري لنموذج SegFormer-B2 قبل الضبط الدقيق على مجموعة بيانات Miao Batik.
معالج Intelشركة IntelIntel Core i7 (الجيل الحادي عشر)وحدة المعالجة المركزية (CPU) المستخدمة في المعالجة المسبقة للصور، ودعم تدريب النموذج، والاستدلال.
Matplotlibفريق تطوير MatplotlibMatplotlib 3.5.1تصور منحنيات التدريب ونتائج التقييم.
مجموعة بيانات Miao Batikمستودع ZenodoDOI: 10.5281/zenodo.20807658مجموعة بيانات للزخارف الثقافية تحتوي على 15,148 صورة مستخدمة للتقسيم الدلالي وإعادة بناء الأنماط.
NumPyمطورو NumPyNumPy 1.21.5الحسابات العددية ومعالجة مجموعة البيانات.
وحدة معالجة الرسوميات NVIDIAشركة NVIDIANVIDIA RTX 3090 (24 GB VRAM)المنصة العتادية المستخدمة لتدريب النموذج والاستدلال.
OpenCVمؤسسة OpenCVOpenCV 4.5.5المعالجة المسبقة للصور، وتغيير الحجم، والاستكمال، وإزالة الضجيج باستخدام مرشح غاوس.
نظام التشغيلشركة Canonical Ltd.Ubuntu 20.04 LTSبيئة التنفيذ التجريبية.
Pillow (PIL)مكتبة صور بايثونPillow 8.4.0تحميل الصور ومعالجتها.
Pythonمؤسسة برمجيات بايثونPython 3.8.10لغة البرمجة المستخدمة في التنفيذ والتجريب.
PyTorchMeta AIPyTorch 1.10.0إطار عمل التعلم العميق المستخدم لتدريب النموذج والاستدلال.
البذرة العشوائيةالإعداد التجريبي42بذرة ثابتة مستخدمة لتقسيم مجموعة البيانات، وتهيئة النموذج، وقابلية تكرار التجربة.
Scikit-learnمطورو Scikit-learnScikit-learn 1.0.2تقسيم مجموعة البيانات، والتحليل الإحصائي، ومقاييس التقييم.
Seabornمجتمع المصادر المفتوحةSeaborn 0.11.2تصور البيانات الإحصائية.
SegFormer-B2أبحاث NVIDIA / مصدر مفتوحSegFormer-B2 (MIT-B2 Backbone)نموذج تقسيم دلالي يعتمد على المحولات (Transformer) مستخدم لتقسيم الزخارف الثقافية.
أقنعة التقسيم / التعليقات التوضيحيةمجموعة بيانات Miao Batikمدرجة مع مجموعة البياناتتسميات التقسيم الدلالي على مستوى البكسل مستخدمة لتصنيف الزخارف والتدريب.
SPADEأبحاث NVIDIA / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/NVlabs/SPADE)نموذج توليد صور موجه بالتقسيم مستخدم لإنشاء أنماط فنية.
TorchVisionMeta AITorchVision 0.11.1أدوات معالجة الصور وتحويلات مجموعات البيانات المستخدمة مع PyTorch.
مجموعة بيانات WikiArtWikiArthttps://www.wikiart.org/مجموعة بيانات للأنماط الفنية تحتوي على أكثر من 80,000 عمل فني عبر 27 نمطاً فنياً، مستخدمة لتعلم الأنماط وتوليدها.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

مقالات ذات صلة