$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
صُمم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدي من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام الانتباه، وإعادة البناء التوليدية، وتوليف الأسلوب الفني. استعانت هذه الدراسة بمجموعات بيانات متاحة علنًا للتراث الثقافي والصور الفنية، بما في ذلك مجموعة بيانات باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. لم يشارك في البحث أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبناءً على ذلك، لم تكن هناك حاجة لموافقة لجنة الأخلاقيات المؤسسية أو الحصول على موافقة مستنيرة. في البداية، استُخدمت مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لغرض التقييم. وقد وُصفت مجموعة بيانات باتيك مياو في دراسة Quan et al. (2024)32، وهي تحتوي على 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. استُخدمت الشروحات الموجودة التي قدمها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. بعد ذلك، يتم إجراء المعالجة المسبقة للصور عن طريق تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. وتفصيل معاملات المعالجة المسبقة الدقيقة في القسم الفرعي الخاص بالمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجًا قائمًا على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. صُممت هذه الطريقة للكشف عن المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف تكوين آلية الانتباه في القسم الفرعي CAFFM. ثم تُمرر الميزات المعززة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. وأثناء التدريب، تم إنشاء عينات زخارف غير مكتملة اصطناعيًا عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور باتيك مياو الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الملاحظ عادةً في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة بناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. ثم يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. يتم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما يتم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعيًا. تم تقييم الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني نسبةً إلى الزخارف الثقافية المرجعية المقابلة. أُجري التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، واتحاد التقاطع (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

الشكل 2. سير العمل العام للهيكلية المقترحة لإطار عمل SegCycle-SPADE. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعتي بيانات Miao Batik وWikiArt لمعالجة أولية قبل معالجتها من خلال التقسيم الدلالي باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليد الأسلوب الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة فريدشيه للبدء (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تقسيم الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. وتُستخدم صور من مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأساليب فنية متنوعة. في البداية، تتم معالجة الصور باستخدام وحدة تقسيم دلالي تعتمد على SegFormer لتحديد الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يقوم نموذج SegFormer باستخراج خرائط التقسيم الدلالي من صور الأنماط الثقافية. ثانياً، يقوم CAFFM بدمج ميزات التقسيم مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال التخليق الموجه بالتقسيم. بعد ذلك، يتم معالجة خرائط الميزات المنقحة بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. وقد تم توليد عينات من الزخارف غير المكتملة عن طريق تطبيق عمليات إخفاء عشوائية وحجب جزئي على صور باتيك مياو الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الملحوظ عادةً في القطع الأثرية الثقافية التالفة. تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. وقد مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. وفي الختام، ينتج مولد SPADE مخرجات فنية محسنة بصرياً من خلال ربط تخليق الصور بخرائط التقسيم المولدة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التعزيز الفني.
تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.
الخطوة 1: جمع مجموعة البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأساليب الفنية. استُخدمت مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik Cultural Motif Dataset) لتوفير معلومات حول الأنماط الثقافية التقليدية؛ وتتوفر هذه المجموعة للعامة عبر Zenodo (https://doi.org/10.5281/zenodo.20807658)، وتضم 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. وقد استُخدمت الشروحات الموجودة التي قدمها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. أما مجموعة بيانات WikiArt فقد استُخدمت لتوفير معلومات متنوعة عن الأساليب الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعامة (https://www.wikiart.org/).
الخطوة 2: المعالجة المسبقة للبيانات
خضعت جميع الصور للمعالجة المسبقة من خلال تغيير الحجم، والتطبيع، وتقليل الضوضاء. واستُخدمت التعليقات التوضيحية الحالية للزخارف الثقافية التي تم الحصول عليها من مصادر مجموعة البيانات الأصلية لدعم مرحلة التجزئة الدلالية. لم يتم إجراء أي إجراءات إضافية للتعليق التوضيحي أو إعادة التصنيف كجزء من هذه الدراسة.
الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
تَم استخدام نموذج SegFormer لتقسيم الزخارف الثقافية. ويرد وصف الهيكل الأساسي لـ SegFormer واستراتيجية التهيئة الدقيقة في القسم الفرعي Semantic Pattern Segmentation Using SegFormer. وتحديداً، تم توظيف بنية SegFormer-B2 مع هيكل MIT-B2 مُدرب مسبقاً على ImageNet لتقسيم الزخارف الدلالية. ويلتقط هذا النموذج المعلومات السياقية العالمية بفعالية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.
الخطوة 4: CAFFM
يجمع نظام CAFFM بين ميزات التجزئة الدلالية والتمثيلات التوليدية، مما يُمكّن الإطار من تعلم خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني على حد سواء. تتوفر تفاصيل تكامل CAFFM في القسم الفرعي CAFFM. يقع هذا النموذج بين مرحلة التجزئة الدلالية القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث يقوم بدمج الميزات الهيكلية المستمدة من التجزئة مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.
الخطوة 5: إعادة بناء الأنماط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء الأنماط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين اثنين، وتستخدم بنية مولد تعتمد على الشبكة المتبقية (residual-network) مع تسعة كتل متبقية، وتوظف مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافس (adversarial losses) وخسائر اتساق الدورة (cycle-consistency losses). يتيح هذا التكوين رسم خرائط ثنائية الاتجاه بين النطاقات ويسهل إعادة بناء هياكل الأنماط الثقافية غير المكتملة.
الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تخليق للنمط الفني بتوجيه من التقسيم. تم وصف تكوين مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. تستخدم الوحدة كتل SPADE المتبقية، وطبقات تطبيع تكيفية مكانياً، وتكييفاً دلالياً مشتقاً من خرائط تقسيم SegFormer وتمثيلات ميزات CAFFM. من خلال ربط توليد الصور بخرائط التقسيم، تحافظ المخرجات المُخلقة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.
الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة للتجزئة وتقييم جودة الصور، بما في ذلك دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيت المبدئية (FID). ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وسُجلت النتائج في صورة المتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المزدوجة، مع تحديد عتبة الدلالة عند p < 0.05.
جمع مجموعات البيانات
في إطار عمل SegCycle-SPADE المقترح، تم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأنماط الفنية. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية من فن باتيك مياو، وهي عبارة عن صور لباتيك مياو التقليدي تتضمن زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتضم هذه المجموعة صوراً ذات معلومات غنية عن الملمس، وهو أمر ضروري بشكل عام للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عموماً إلى أنماط مختلفة، وتُستخدم لتعلم الأنماط المعقدة، وهو ما يفيد عادةً في تحسين الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميماً مختلفاً، مما يجعلها أكثر فائدة لمهام توليد أو تحويل الأنماط المعتمدة على التعلم العميق (DL).
مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشمل الصور مجموعة متنوعة من التصميمات التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط النباتية، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر بنيات ثقافية أصيلة تمكّن وحدة التجزئة من تحديد حدود الزخارف والحفاظ عليها بدقة أثناء إعادة بناء النمط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر البصرية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب مياو والممثلة ضمن تعليقات مجموعة البيانات، بما في ذلك الطيور، والفراشات، والأنماط الزهرية، والرموز القبلية الموروثة. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتكرار ظهورها في تصميمات باتيك وتطريز مياو التقليدية، وليس فقط بناءً على تكرار حدوثها أو تكوينها المكاني. وقد تم الحصول على تعليقات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بأي تعليقات يدوية إضافية، أو إعادة تسمية، أو إجراءات تعليق موجهة من قبل الخبراء. وقد استُخدمت التعليقات الموجودة التي وفرها منشئو مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.
| المعلمة | الوصف |
| اسم مجموعة البيانات | مجموعة بيانات أنماط باتيك المياو الثقافية |
| مصدر مجموعة البيانات | مستودع Zenodo (DOI: 10.5281/zenodo.20807658) |
| المجال | التراث الثقافي غير المادي (ICH) / تحليل أنماط المنسوجات |
| إجمالي الصور | 15,148 صورة |
| نوع الصور | صور رقمية لأنماط منسوجات باتيك المياو التقليدية |
| فئات الأنماط | زخارف حيوانية، وزخارف نباتية، وزخارف هندسية |
| الأصل الثقافي | ثقافة عرقية المياو، مقاطعة قويتشو، الصين |
| دقة الصور الأصلية | صور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأقصر) تم التقاطها كمسوحات خام أو صور فوتوغرافية قبل المعالجة المسبقة |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة |
| توفر التعليقات التوضيحية | تم استخدام تعليقات تقسيم موجودة قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. ولم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة. |
| التطبيق في هذه الدراسة | تقسيم الزخارف الثقافية، واستخراج الميزات، والحفاظ على الزخارف، وإعادة بناء الأنماط |
الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يوضح الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.
مجموعة بيانات WikiArt:
تعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً واسع النطاق وشائعاً للفنون، حيث تضم أكثر من 80,000 صورة تتبع 27 نمطاً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأنماط فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. تكتسب مجموعة البيانات هذه أهمية بالغة في الإطار المقترح لأنها توفر المعرفة التي تتيح لوحدة SPADE إنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. وتتكون مجموعة البيانات من 56,000 صورة للتدريب و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في مجموعة البيانات في تدريب نموذج التعلم العميق (DL) بشكل فعال.
| معلمة | الوصف |
| اسم مجموعة البيانات | مجموعة بيانات WikiArt |
| مصدر مجموعة البيانات | مستودع WikiArt (https://www.wikiart.org/) |
| المجال | الفنون واللوحات الرقمية |
| إجمالي الصور | حوالي 80,000 عمل فني |
| صور التدريب | 56,000 |
| صور التحقق | 12,000 |
| صور اختبارية | 12,000 |
| الأساليب الفنية | 27 نمطاً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي |
| دقة الصورة الأصلية | تتباين دقة الصور الأصلية عبر الأعمال الفنية والمصادر المختلفة. وقد جرى تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل أثناء مرحلة المعالجة المسبقة. |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني وتخليق الصور الموجه بالتجزئة. |
| تقسيم مجموعة البيانات | تقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42 |
| استراتيجية أخذ عينات الأسلوب | استُخدم أسلوب المعاينة النسبية الطبقية للحفاظ على توزيع الأنماط الفنية الـ 27 عبر مجموعات التدريب والتحقق والاختبار الفرعية. |
| التطبيق في هذه الدراسة | تعلم النمط الفني، وتمثيل النمط، والتركيب الفني الموجه بالتجزئة |
الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة في تعلم الأسلوب الفني وتوليد الصور الموجهة بالأسلوب. يوضح الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأساليب الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.
تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب مياو.32 وتتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور للفحص البصري، وتعديل الحجم إلى 256 × 256 بكسل، والتطبيع، وفحص العينات التالفة أو المكررة. لم يؤدِ فحص مراقبة الجودة إلى استبعاد أي صور؛ وبناءً عليه، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل اللاحق. قُسِّمت مجموعة البيانات عشوائيًا إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية إعادة إنتاج تقسيمات مجموعة البيانات. أما مجموعة بيانات WikiArt فقد تم الوصول إليها من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/) وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 نمطًا فنيًا. وبالنسبة لتجارب تعلم النمط، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.
المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt لعدة خطوات من المعالجة المسبقة لضمان جودة متسقة للصور وتمثيل دقيق للميزات. تم تطبيق مسار المعالجة المسبقة الأساسي ذاته على كلتا المجموعتين، بما في ذلك إزالة الضجيج بطريقة غاوس (Gaussian denoising)، والتطبيع (normalization)، وتغيير الحجم إلى دقة إدخال موحدة، والتحقق من جودة الصور. ومع ذلك، أدت مجموعتا البيانات أدواراً مختلفة ضمن إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأسلوب الفني وتوليفه، بينما استُخدمت مجموعة بيانات باتيك مياو بشكل أساسي لتقسيم الزخارف الثقافية وإعادة بنائها. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بكل مجموعة بيانات خارج هذه الأدوار المحددة للمهام. ولضمان المعالجة المتسقة بواسطة نموذج التعلم العميق (DL)، تم أولاً تغيير حجم الصور إلى دقة ثابتة؛ وكانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين تباينت دقتها بناءً على مصدرها. وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات البعدية من التأثير على التدريب. تمثلت الخطوة الثانية من المعالجة المسبقة في التطبيع، حيث تم تغيير مقياس قيم البكسل إلى نطاق معياري لاستقرار تحديثات التدرج أثناء التدريب. بعد ذلك، تمت معالجة الصور باستخدام ترشيح غاوس (Gaussian filtering) لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. وبالنسبة لمجموعة بيانات باتيك مياو، استُخدمت أقنعة تقسيم الزخارف الثقافية الموجودة مسبقاً، والتي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلي، دون تعديل لتدريب التجزئة الدلالية (semantic segmentation) وتقييمها. ولم يتم إنشاء أقنعة تقسيم جديدة خصيصاً لهذه الدراسة.
ما لم يُذكر خلاف ذلك، تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف نموذج CAFFM المقترح وإطار عمل تحسين SegCycle-SPADE المركب، فقد طورها المؤلفون خصيصاً لهذه الدراسة.
ليكن التمثيل الرياضي لصورة إدخال من مجموعة البيانات وفقاً لـ المعادلة 1>:
(1)
هنا، تشير H و W و C إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

هنا، تمثل Ir الصورة التي تم تغيير حجمها. ويتم حساب قيم البكسل المُطبعة وفقاً لـ المعادلة 3:
(3)
يساعد هذا في تثبيت إجراء التدريب. يتم إجراء تصفية الضجيج باستخدام مرشح غاوسي كما هو موضح في المعادلة 4:

هنا، يمثل G(σ) مرشح غاوس (Gaussian filter) وتمثل العلامة * عملية الالتفاف (convolution). وقد استُخدم مرشح غاوس بنواة بحجم 5 × 5 وبانحراف معياري قدره σ = 1.0. وطُبق الحشو الانعكاسي (Reflective padding) على بكسلات الحواف لتقليل التشوهات الطرفية. وأجريت عملية إزالة الضجيج مباشرة بعد تحميل الصور وقبل عمليتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة في جميع أنحاء الدراسة، طُبقت تهيئة المرشح نفسها على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التقسيم وفقاً لـ المعادلة 5:

هنا، يمثل M قناع تقسيم يُستخدم لتوجيه نموذج SegFormer.
تبدأ سلسلة عمليات المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لتعزيز البيانات أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع، وإزالة الضجيج بطريقة Gaussian، وإعداد أقنعة التجزئة، استُخدمت الصور مباشرة في تدريب والتحقق من صحة واختبار إطار عمل SegCycle-SPADE المقترح. تتضمن الخطوة الأولى من سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق بمعالجة الصور بكفاءة أكبر. وتتضمن الخطوة الثانية التطبيع، الذي يحول قيم البكسل إلى نطاق عددي معياري ويسهل تقارب النموذج. أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، وبالنسبة لمجموعة بيانات Miao Batik، يتم تحديد مناطق الزخارف الثقافية، مما يسمح بتوليد أقنعة تُستخدم في وحدة التجزئة للنموذج المقترح، لضمان الحفاظ على الزخارف الثقافية أثناء عملية التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدتي التجزئة والتوليد في النموذج المقترح.

الشكل 3. مسار المعالجة المسبقة للبيانات لصور التراث الثقافي. مخطط سير العمل الذي يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتطبيع، وإزالة الضجيج بطريقة Gaussian، وتوصيف الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
خضعت كل صورة لعملية مراقبة جودة قبل تدريب النموذج. احتوت مجموعة بيانات Miao Batik على 15,148 صورة. وكان منشئو مجموعة البيانات الأصليون قد عالجوا بالفعل العينات التالفة والمكررة ومنخفضة الجودة؛ ولذلك، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل. تم تحميل الصور بتنسيق RGB أثناء المعالجة المسبقة وتغيير حجمها إلى 256 × 256 بكسل باستخدام الاستيفاء الخطي الثنائي. وتم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم طُبق تطبيع لكل قناة باستخدام قيم متوسط قدرها [0.485, 0.456, 0.406] وقيم انحراف معياري قدرها [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء، على التوالي. شمل مسار المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وتغيير الحجم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق tensor. وعند الضرورة، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج DL. وبعد المعالجة المسبقة، تم تقسيم الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. واستخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التجزئة الدلالية، ودمج الميزات، وإعادة بناء الزخارف، والتوليف الفني القائم على SPADE — دقة إدخال ثابتة قدرها 256 × 256 بكسل.
تقسيم الأنماط الدلالي باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور المنظفة والمعيرة من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التقسيم الدلالي القائمة على إطار عمل SegFormer-B2 المقترح. والغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد إطار عمل SegFormer المقترح على بنية محول (transformer) تدمج مشفر محول هرمي وفك تشفير MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية التفصيلية من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يلي ذلك دمج هذه التمثيلات من خلال فك التشفير لإنشاء أنماط مقسمة بدقة. يضمن ذلك تقسيم الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل المتأخرة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.
لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة بـ المعادلة 6:
(6)
يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج ميزات هرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

هنا، يشير F إلى خرائط الميزات متعددة المقاييس التي تم الحصول عليها من مشفر المحول (transformer encoder). وتعمل هذه الميزات على ترميز كل من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخارف (motif regions). ويقوم نموذج SegFormer باستخراج خرائط الميزات بمقاييس مختلفة كما هو محدد في المعادلة 8:

يسهل استخدام التمثيلات متعددة المقاييس اكتشاف أنماط بأحجام مختلفة ضمن الزخارف الثقافية. وأخيرًا، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في Equation 91:

هنا، يشير S إلى خريطة التقسيم النهائية المتوقعة.
تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مدربة مسبقاً على مجموعة بيانات ImageNet، ومن ثم تم ضبطه بدقة على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، استُخدمت نقطة التحقق MIT-B2 المدربة مسبقاً على ImageNet-1K (mit_b2.pth) والمقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. تتوافق الأوزان المدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وقد عملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة الأوزان الافتراضية في PyTorch قبل البدء في التدريب.
تستخدم البنية الهندسية مشفر Transformer هرمي مكونًا من أربع مراحل مع تضمينات رقع متداخلة. في المرحلة الأولية، تم ضبط حجم الرقعة على 7 × 7 بزيادة قدرها 4. وبالنسبة لكل مرحلة من مراحل المشفر الأربع، كانت أبعاد التضمين 64 و128 و320 و512. وعبر المراحل الأربع، كان هناك 1 و2 و5 و8 من رؤوس الانتباه الذاتي متعددة الرؤوس، وكانت أعماق المشفر المقابلة 3 و4 و6 و3 طبقات. تم تجميع الميزات متعددة المقاييس المستخرجة من المشفر باستخدام مفكك شفرات خفيف الوزن يعتمد كليًا على Perceptrons متعدد الطبقات (MLP). وقبل إنشاء خريطة التجزئة النهائية، قام مفكك الشفرات بإسقاط الميزات من كل مرحلة من مراحل المشفر في مساحة تضمين واحدة. استخدمت جميع كتل Transformer دالة التنشيط Gaussian Error Linear Unit (GELU). كما تم استخدام معدل إسقاط (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم والحد من الإفراط في التخصيص.
خلال مرحلة التدريب، يستقبل إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلا المجموعتين من البيانات. تحتوي الصور المستمدة من مجموعة بيانات Miao Batik على مناطق الزخارف التي تعمل كملصقات للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات بعيدة المدى بين مكونات الصورة، وهو أمر مهم بشكل خاص لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تقوم آلية استخراج الميزات الهرمية بالتقاط البنى المحلية في آن واحد، مثل الأنسجة الهندسية المتكررة. ويقوم مفكك شفرة MLP بمعالجة هذه الميزات المستخرجة وإنتاج قناع تجزئة يبرز مناطق الزخارف. تُستخدم خرائط التجزئة التي تم إنشاؤها خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء النمط، مما يساعد في الحفاظ على أصالة الأنماط المُولدة.
تم تقسيم الزخارف الثقافية إلى فئات مختلفة للتجزئة الدلالية وفقاً لخصائصها البصرية والثقافية. وشمل تصنيف التجزئة الزخارف الحيوانية (مثل الفراشات، والأسماك، والطيور، وغيرها من الحيوانات الرمزية)، والزخارف النباتية (مثل الأزهار، والأوراق، والكروم، والأنماط النباتية)، والزخارف الهندسية (مثل الأشكال المتكررة، والإطارات، والهياكل الهندسية التجريدية)، ومناطق الخلفية التي تمثل المساحات الخالية من الزخارف. واستُخدمت أقنعة التجزئة على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقاً. وقد تم ترميز التسميات الرقمية كما يلي: التسمية 0 = الخلفية، والتسمية 1 = الزخارف الحيوانية، والتسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. وقد تم الحصول على تعليقات التجزئة وتسميات الزخارف مباشرة من مصدر مجموعة بيانات "باتيك مياو" (Miao Batik) الأصلية. ولم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة؛ بل استُخدمت التعليقات التوضيحية الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم.
يقوم نموذج SegFormer المخصص لتجزئة الزخارف الثقافية بمعالجة الصور التي تمت معالجتها مسبقاً من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية تعتمد على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. يقوم مشفر المحول (Transformer encoder) باستخراج كل من المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم تزويد الميزات متعددة المقاييس الناتجة بمفكك شفرة التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات وتعزيز الكشف عن الزخارف. تكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع حجب معلومات الخلفية غير ذات الصلة. وتعمل الأنماط الثقافية المعزولة بعد ذلك كإرشادات هيكلية للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

الشكل 4. التقسيم الدلالي للزخارف الثقافية بناءً على SegFormer-B2. بنية وحدة التقسيم الدلالي SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية والمدربة حصرياً على مجموعة بيانات Miao Batik. يتكون الإطار من مشفر يعتمد على Transformer لاستخراج الميزات متعددة المقاييس ومفكك تشفير تقسيم خفيف الوزن لإنشاء أقنعة الزخارف. يتنبأ النموذج بأربعة أصناف دلالية—حيوان، ونبات، وهندسي، وخلفية—حيث تحدد أقنعة التقسيم الناتجة مناطق الزخارف ذات الأهمية الثقافية مع تثبيط معلومات الخلفية غير ذات الصلة. توفر مخرجات التقسيم هذه توجيهاً هيكلياً لمراحل دمج الميزات وإعادة البناء والتركيب الفني اللاحقة في إطار SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. فقد تم الحصول على مجموعة بيانات Batik Miao من مصدر عام موجود مسبقاً، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.
وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء في CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطي لإسقاط كلا تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتبادل، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات الناتجة. بعد ذلك، يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتبادل متعدد الرؤوس. ثم تُطبق عملية تطبيع الطبقة، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتستقبل مرحلة التركيب القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على السمات ذات الدلالات الثقافية دون التضحية بالاتساق الفني.
لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطي على مساحة تضمين مشتركة ببعد تضمين قدره 256. ثم يتم نمذجة الترابطات بين المعلومات الهيكلية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتبادل متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. تعتمد حسابات الانتباه المتبادل على متجهات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي يتم إنتاجها بواسطة طبقات تحويل خطي محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتطبيع الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. بعد ذلك، يتم تحسين تعلم الميزات غير الخطي من خلال تطبيق شبكة تغذية أمامية مع دالة التنشيط Gaussian Error Linear Unit (GELU). يقوم النموذج بتوليد تمثيل ميزات مخرجات ببعد 256 وإرساله إلى مراحل أخرى من أجل التركيب الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع هياكل الزخارف الثقافية باستخدام تقنية دمج قائمة على الانتباه المتبادل، مما يعزز الحفاظ على الزخارف والاتساق البصري في أنماط التراث الثقافي المعاد بناؤها.
في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. لتكن خريطة السمات المشتقة من شبكة التجزئة SegFormer باستخدام صور من مجموعة بيانات Miao Batik يرمز لها بالرمز Fs، بينما يرمز لخريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بالرمز Fa. يقوم نموذج CAFFM المقترح بدمج مجالي السمات باستخدام آلية الانتباه المتقاطع لتعلم التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين، وطبقات التسوية، ودوال التنشيط، وتكوين رؤوس الانتباه. بالنسبة لحجم صورة مدخلة يبلغ 256 × 256 بكسل، أنتج مشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. وقد تم إسقاط كلتا خريطتي السمات عبر طبقات خطية قابلة للتعلم إلى فضاء تضمين مشترك ببعد 256 قبل عملية الدمج بالانتباه المتقاطع.
| المعلم | التكوين |
| إطار العمل المقترح | SegCycle-SPADE |
| نموذج التجزئة الدلالية | SegFormer-B2 |
| مراحل مشفر SegFormer | 4 |
| تهيئة الأوزان | نموذج SegFormer-B2 مدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2) |
| مصدر نقطة التحقق | مستودع NVIDIA SegFormer الرسمي (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k |
| استراتيجية الضبط الدقيق | ضبط دقيق من الطرف إلى الطرف على مجموعة بيانات Miao Batik |
| حجم تضمين الرقعة | 7 × 7 |
| خطوة الرقعة | 4 |
| أبعاد التضمين | 64، 128، 320، و512 |
| أعماق المشفر | 3، 4، 6، و3 |
| رؤوس الانتباه | 1، 2، 5، و8 |
| نوع مفكك الشفرة | مفكك شفرة All-MLP |
| دالة التنشيط | GELU |
| معدل التسرب | 0.1 |
| وحدة تعزيز الميزات | وحدة دمج الميزات الثقافية بالانتباه المتقاطع (CAFFM) |
| بعد تضمين CAFFM | 256 |
| رؤوس انتباه CAFFM | 8 |
| مقاييس دمج CAFFM | 4 |
| نموذج إعادة البناء | CycleGAN |
| نموذج توليد النمط | SPADE |
| مجموعة البيانات الثقافية | مجموعة بيانات Miao Batik |
| مجموعة بيانات النمط | مجموعة بيانات WikiArt |
| صور Miao Batik | 15,148 |
| صور WikiArt | حوالي 80,000 |
| دقة صورة الإدخال | 256 × 256 بكسل |
| تنسيق الألوان | RGB |
| طريقة الاستيفاء | الاستيفاء الخطي الثنائي (Bilinear Interpolation) |
| طريقة إزالة الضجيج | الترشيح الغاوسي (Gaussian Filtering) |
| حجم النواة الغاوسية | 5 × 5 |
| سيجما غاوس (σ) | 1 |
| نطاق التطبيع | [0, 1] |
| حجم الدفعة | 16 |
| عدد العصور | 100 |
| المحسن | Adam |
| معدل التعلم | 0.0002 |
| معاملات Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, اضمحلال الوزن = 0 |
| دوال الخسارة | خسارة التجزئة، خسارة الخصومة، خسارة اتساق الدورة، خسارة إعادة البناء، خسارة الحفاظ على الزخارف، وخسارة اتساق النمط |
| استراتيجية تقسيم مجموعة البيانات | التدريب / التحقق / الاختبار |
| مجموعة التدريب | 70% |
| مجموعة التحقق | 15% |
| مجموعة الاختبار | 15% |
| البذرة العشوائية | 42 |
| مقاييس التقييم | دقة التجزئة، IoU، معامل Dice، SSIM، PSNR، وFID |
| لغة البرمجة | Python 3.8.10 |
| إطار عمل التعلم العميق | PyTorch 1.10.0 |
| منصة الأجهزة | وحدة معالجة الرسوميات NVIDIA RTX 3090 (بذاكرة VRAM سعة 24 GB)، معالج Intel Core i7 (الجيل الحادي عشر)، ذاكرة RAM سعة 32 GB |
| بيئة التشغيل | Ubuntu 20.04 LTS |
الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات الهيكلية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعلمات التحسين، ومقاييس التقييم، والبيئة الحوسبية المستخدمة في تنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.
تقوم وحدة الانتباه أولاً برسم خريطة لخريطة السمات إلى تمثيلات الاستعلام والمفتاح والقيمة باستخدام Equation 10:

هنا، تكون Wq وWk وWv مصفوفات أوزان قابلة للتعلم. ويتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117:

هنا، يمثل dk بُعد متجه المفتاح. ويتم حساب تمثيل الميزات المحسّن عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات من خلال دمج ميزات التقسيم الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقًا لـ المعادلة 13:
هنا، تمثل Fe خريطة الميزات المحسنة المستخدمة في إعادة بناء النمط. يتم توسيع نموذج CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخراج ميزات الزخارف الثقافية بمقاييس مختلفة. لنرمز بـ Fsi إلى ميزات التجزئة عند المقياس i، بينما ترمز Faj إلى ميزات النمط الفني عند المقياس نفسه. يتم تعريف التمثيل النهائي للميزات باستخدام المعادلة 14:

هنا، تمثل Qi و Ki و Vi مصفوفات الاستعلام والمفتاح والقيمة عند المقياس i على التوالي، بينما يشير N إلى عدد مقاييس الميزات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط الميزات المستخرجة بدقة مكانية تبلغ 1/4 و 1/8 و 1/16 و 1/32 من حجم الصورة المدخلة. وقد دُمجت تمثيلات الميزات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل عمليتي إعادة البناء والتركيب الفني. يتيح التوسع المذكور أعلاه للمنهجية استخراج الزخارف الثقافية والقوام العالمي لإعادة بناء الأنماط الثقافية. يقع موديل CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء ميزات إعادة البناء التي تحتوي على معلومات متعلقة بالنمط والأسلوب في آن واحد، يقوم SegFormer-B2 باستعادة خرائط الميزات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. يستقبل موديل CAFFM تدفقي الميزات هذين، ويستخدم الدمج القائم على الانتباه المتقاطع (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط أصيلة ثقافياً مع الحفاظ على الاتساق الدلالي والميزات الهيكلية، يتم إرسال خرائط الميزات المدمجة الناتجة بعد ذلك إلى موديل SPADE لإجراء تركيب إبداعي موجه بالتجزئة.
إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز الميزات القائمة على الانتباه، ستتضمن خرائط الميزات هياكل الزخارف الثقافية المعززة. ومع ذلك، قد تظل خرائط الميزات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذا، ولمعالجة مشكلة إعادة بناء الأنماط، سيعتمد الإطار المقترح على نموذج CycleGAN. في الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام الميزات المعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. سيضمن ذلك احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية والأنماط الزهرية والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وقد حاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الملاحظ عادةً في القطع الأثرية التراثية الثقافية المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما عملت الصور الأصلية المقابلة كصور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.
لتكن X هي نطاق الأنماط الثقافية غير المكتملة و Y هي نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدان إجراء رسم خرائطي ثنائي الاتجاه باستخدام المعادلة 15:

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures)، ويُستخدم FM لإسقاط الأنماط مرة أخرى على النطاق الأصلي. وتُستخدم الخسارة التنافسية (adversarial loss) لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

هنا، يمثل DY المميز المستخدم للتفريق بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه والمولد. كما تفرض شبكة CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

يتم تعريف دالة الخسارة النهائية باستخدام المعادلة 1830:

هنا، ترمز λi إلى معامل التوزين لخسارة اتساق الدورة، وقد تم ضبطه عند القيمة 10 أثناء التدريب، بما يتوافق مع صيغة CycleGAN الأصلية. تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.
تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية الشبكة المتبقية (residual-network) التي تتألف من طبقة تلافيف أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لخفض العينات، وتسع كتل متبقية، وطبقتان لرفع العينات. تستخدم جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخراج الميزات. يتم تطبيق تطبيع المثيل (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة المخرجات دالة تنشيط Tanh لتوليد مخرجات صور مُطبعة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويُستخدم تطبيع المثيل وتنشيط LeakyReLU (بميل سالب = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية المعالجة مسبقاً كمدخلات وتولد تمثيلات أنماط مُعاد بناؤها، والتي يتم توجيهها لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام محسن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم خلال أول 100 حقبة (epochs)، ثم انخفض خطياً إلى الصفر خلال فترة التدريب المتبقية. كما استُخدم مخزن مؤقت للإعادة (replay buffer) يحتوي على 50 صورة تم توليدها سابقاً لتحقيق استقرار تدريب المميز. وتم تحديث المولدات والمميزات باستخدام نسبة تحديث 1:1، حيث يتبع كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.
تعتمد عملية إعادة البناء في نموذج CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM الموضحة في الشكل 5. تحتوي خرائط السمات هذه على زخارف ثقافية محسنة تم استخلاصها من المراحل السابقة للتجزئة وآلية CAFFM. وتُستخدم خرائط السمات كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية التعيين (mapping) المطلوبة لإعادة بناء الأنماط الثقافية. بعد ذلك، يتم تزويد المميّز DY بالمخرجات للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميّز DY المولد GE في إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء عملية إعادة البناء، يقوم المولد الثاني FM بإجراء تعيين لاتساق الدورة (cycle-consistency mapping)، حيث يعيد المولد الثاني FM تعيين المخرجات إلى النطاق الأصلي. ثم يتم تقييم المخرجات بواسطة المميّز لضمان واقعيتها. وفي الختام، يتم تمرير المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. يتم تقديم تمثيلات الميزات المعززة بآلية الانتباه كمدخلات لشبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تعيين الاتساق الدوري على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. يتم بعد ذلك إرسال الزخارف المعاد بناؤها إلى وحدة SPADE لتركيب الأسلوب الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
توليد الأسلوب الفني باستخدام SPADE
لاحقاً، تخضع الزخارف الثقافية المعاد بناؤها لوحدة SPADE لتوليد الأسلوب الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من الأسلوب الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالتخطيط الهيكلي لهذه الزخارف. وتُعد وحدة SPADE تقنية لتوليد الصور الشرطية التي تستخدم مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي الناتجة عن SegFormer-B2. وتلقى مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانياً (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة من طبقات SPADE. وبذلك، تمكن المولد من الحفاظ على حدود الزخارف، والتخطيطات الهيكلية، والمعلومات الدلالية أثناء الاصطناع الفني عن طريق تطبيق هذه المعاملات على تنشيطات السمات المُطبعة. وكان التوجيه الدلالي قادراً على التأثير في كل من إعادة البناء الهيكلي رفيع المستوى واصطناع الأنسجة منخفض المستوى نظراً لأن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية المبتكرة سمات أسلوبية مُكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي تم العثور عليها خلال مرحلة التقسيم.
استُخدمت مجموعة بيانات WikiArt، التي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد أساسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم الأسلوب، تم اختيار صور الأساليب عشوائياً من الفئات المختلفة أثناء التدريب. وقُسّمت مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية من أجل تقليل انحياز الأسلوب. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، استُخدم أخذ العينات الطبقية؛ حيث خُصصت العينات من كل فئة بشكل تناسبي لمجموعات التدريب والتحقق والاختبار مع الحفاظ على توزيع الفئات الأصلي. واستُخدمت وحدة CAFFM لدمج جوانب الأسلوب المستمدة من صور WikiArt مع سمات إعادة البناء الناتجة عن CycleGAN. ومن أجل السماح لشبكة التركيب بنقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تزويد مولد SPADE بالتمثيلات المدمجة الناتجة كمعلومات شرطية. وبفضل تقنية تكييف الأسلوب هذه، تمكن الإطار المقترح من إنتاج أنماط فنية أصيلة ثقافياً مع تمثيلات هيكلية وأسلوبية متسقة.
يقدم SPADE أيضاً معلمات تكيُّفية مكانياً تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعلمات كما هو موضح في المعادلة 191:

هنا، يمثل γ(S) معلمة المقياس المتغيرة مكانيًا، بينما يمثل β(S) معلمة الانحياز المتغيرة مكانيًا. ويمكن لهذه المعلمات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة اعتمادًا على المنطقة الدلالية في الصور. ويمكن تعريف العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

هنا، يمثل GE مولد SPADE، ويمثل XrP النمط المعاد بناؤه، ويمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. تم استخدام دالة فقدان مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. تم استخدام خليط مرجح من فقدان التجزئة (Lseg)، والفقدان التنافسي (Ladv)، وفقدان الاتساق الدوري (Lcycle)، وفقدان إعادة البناء (Lrecon)، وفقدان الحفاظ على الزخارف (Lmotif)، وفقدان اتساق الأسلوب (Lstyle) لتحديد هدف التدريب العام. تُعرَّف دالة الفقدان الإجمالية في المعادلة 21:
(21)
لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمعاد بناؤها، تم ضبط معامل فقدان الاتساق الدوري على القيمة 10. وللحفاظ على سمات الزخارف دقيقة التفاصيل وتعزيز الدقة البصرية، تم تعيين معامل فقدان إعادة البناء عند 5. ولتسليط الضوء على الحفاظ على الأنماط الهيكلية الأساسية ثقافياً أثناء التخليق الفني، تم استخدام معامل قدره 2 لفقدان الحفاظ على الزخرفة. ومن أجل تعزيز نقل الأسلوب الفني دون تشويه هياكل الزخارف الدلالية بشكل مفرط، تم تعديل معامل فقدان اتساق الأسلوب إلى 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، تم إعطاء أوزان متساوية لفقدان التقسيم والفقدان التنافسي. وقد استُخدمت تمثيلات الأسلوب القائمة على السمات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة جرام المستمدة من خرائط السمات العميقة. واستُخدم فرق معيار فروبينيوس بين مصفوفات جرام لصورة الأسلوب المستهدفة والصورة المولدة لحساب فقدان الأسلوب، كما هو موضح في المعادلة 22:

هنا، تمثل Gl مصفوفة جرام المحسوبة من طبقة الميزات lth، ويشير Igen إلى الصورة الفنية المولدة، ويشير Istyle إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، بينما يشير F إلى معيار فروبينيوس. وتسمح هذه الصيغة للإطار المقترح بالحفاظ على الخصائص الفنية مع الإبقاء على السلامة الهيكلية والدلالية للزخارف الثقافية.
تُستخدم تمثيلات الميزات المدمجة الناتجة عن وحدة CAFFM كمدخلات شرطية لوحدة SPADE، والتي تعمل كمكون للتوليف الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التجزئة الدلالية التي تم الحصول عليها من وحدة SegFormer–CAFFM كمدخلات شرطية عبر طبقات SPADE المتبقية. يتم تطبيق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يتيح التكييف الدلالي الموجه بالتجزئة. ومن خلال عمليات رفع العينات والتلافيف المتتالية، يتم تحسين تمثيل الميزات الكامن تدريجياً لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، ويتم تطبيق دالة تنشيط Tanh في طبقة المخرجات لإنتاج صور معيارية.
الخوارزمية وسير العمل
يدمج إطار عمل SegCycle-SPADE بين التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن خط تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتقييس، وإزالة الضجيج، وإعداد أقنعة التجزئة. وتُعالج الصور التي تمت معالجتها مسبقاً لاحقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، يتم تزويد خرائط الميزات المدمجة بوحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُقدم الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتحسين الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. وأثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و 22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. كما يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يشمل تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة 16، ومعدل تعلم 0.0002، و 100 حقبة تدريب. واستُخدمت بذرة عشوائية ثابتة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. تم تطبيق هذه البذرة باستمرار عبر مولدات الأرقام العشوائية في Python و NumPy و PyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين محسن Adam بقيم β₁ = 0.5 و β₂ = 0.999، وبدون اضمحلال في الوزن (weight decay = 0). واختيرت نقاط تحقق النموذج بناءً على أعلى درجة IoU للتحقق تم تحقيقها في مجموعة بيانات التحقق.
تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسارات التجزئة، والخسارة التنافسية، والاتساق الدوري، وإعادة البناء، والحفاظ على الزخارف، واتساق النمط. تتوفر الصيغة الرياضية الكاملة، ومعاملات الوزن، وتعريف خسارة النمط في المعادلتين 21 و22 ضمن القسم الفرعي Artistic Style Generation using SPADE. يعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة لها، مما يشجع على الحفاظ على هياكل الأنماط ذات الأهمية الثقافية طوال عملية إعادة البناء.