Araştırma makalesi

Bir Derin Öğrenme Çerçevesi Kullanarak Somut Olmayan Kültürel Miras Desenlerinin Semantik Segmentasyon Rehberliğinde Yeniden Yapılandırılması ve Sanatsal Stil Sentezi

DOI:

10.3791/71577

14 Ağustos 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol; dijital koruma ve yaratıcı miras uygulamalarını desteklemek amacıyla, transformer tabanlı özellik çıkarımı, adversaryal yeniden yapılandırma ve uzamsal olarak uyarlanabilir görüntü oluşturma yöntemlerini kullanarak somut olmayan kültürel miras desenlerinin semantik segmentasyonu, yeniden yapılandırılması ve sanatsal stil sentezi için bir derin öğrenme iş akışını açıklamaktadır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Derin öğrenme tabanlı görüntü sentezleme tekniklerinin ilerlemesiyle birlikte, somut olmayan kültürel miras (SOKM) desenlerinin dijital olarak korunması ve yeniden yapılandırılması giderek daha fazla dikkat çekmektedir. Mevcut SegCycle-SPADE tabanlı yaklaşımlar, geleneksel zanaat desenlerinin yapısal segmentasyonu ve sanatsal yeniden yapılandırılması konusunda potansiyel göstermiştir; ancak, sınırlı veri seti çeşitliliği, kültürel semantiğin yetersiz entegrasyonu ve yeniden yapılandırma sırasında yapısal desen özelliklerinin yetersiz korunması gibi kısıtlamalar devam etmektedir. Bu zorlukları aşmak için bu çalışma, SOKM desen türlerinin semantik segmentasyonu ve sanatsal yeniden yapılandırılması için geliştirilmiş bir SegCycle-SPADE çerçevesi önermektedir. Motif sınırlarını ve desen bölgelerini doğru bir şekilde belirlemek için Transformer tabanlı bir segmentasyon modeli olan SegFormer kullanılmıştır. Ayrıca, kültürel açıdan anlamlı motifleri güçlendirmek ve özellik temsilini iyileştirmek için bir Çapraz-Dikkat Kültürel Özellik Füzyon Modülü tanıtılmıştır. Desen çevirisi ve yeniden yapılandırma CycleGAN kullanılarak gerçekleştirilirken, segmentasyon haritaları ile üretilen görüntüler arasında semantik tutarlılığı sağlamak için sanatsal stil sentezinde Mekansal-Adaptif Denormalizasyon (SPADE) kullanılmıştır. Model genellemesini ve sanatsal çeşitliliği artırmak için çerçeve, hem Miao Batik kültürel motif veri seti hem de WikiArt veri seti kullanılarak eğitilmiştir. Deneysel sonuçlar, önerilen dikkat yönlendirmeli SegCycle-SPADE çerçevesinin, mevcut üretken çekişmeli ağ (GAN) tabanlı yeniden yapılandırma yöntemlerine kıyasla segmentasyon doğruluğunu ve miras deseni yeniden yapılandırma performansını artırdığını göstermektedir. Önerilen çerçeve, yapay zeka destekli kültürel miras belgeleme, yeniden yapılandırma ve geleneksel desen tasarımlarının sanatsal olarak canlandırılması için ölçeklenebilir bir çözüm sunmaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gelenekler, diller ve inançlar gibi somut olmayan unsurların yanı sıra sanat eserleri, binalar ve yazılı kayıtlar gibi somut unsurları da içeren kültürel miras; insan tarihinin, yaratıcılığının ve kimliğinin temel bir tezahürüdür1. Miras konservasyonu, toplulukların kökenleriyle yeniden bağ kurmalarını sağlamayı amaçlar ve gelecek nesillerin kolektif kültürel belleklerinden yararlanmalarına imkan tanır. Ayrıca kültürlerarası anlayışı, çeşitli gelenek ve göreneklere duyulan takdiri ve farklı tarihsel anlatıların tanınmasını teşvik eder. Bu kültürel varlıklar, önceki nesillerin değerlerini, bakış açılarını ve deneyimlerini anlamamıza yardımcı olur; çağdaş sosyal kimliklerin oluşumuna ve kültürel sürekliliğe katkıda bulunur. Kültürel mirasın korunmasının temel ilkeleri Şekil 1'de gösterilmiştir.

SegCycle-SPADE çerçeve diyagramı; görüntü yeniden yapılandırma için SegFormer, CycleGAN ve SPADE içerir.
Şekil 1. SegCycle-SPADE Çerçevesi Kullanılarak Kültürel Miras Desenlerinin Yeniden Yapılandırılmasına İlişkin Kavramsal Genel Bakış. Somut olmayan kültürel miras desenlerini yeniden yapılandırmak ve geliştirmek için önerilen yaklaşımın şematik gösterimi. İş akışı; Miao Batik ve WikiArt veri kümelerinden veri toplama, görüntü ön işleme, SegFormer-B2 kullanılarak yapılan anlamsal segmentasyon, Çapraz Dikkat Kültürel Özellik Füzyon Modülü (CAFFM) kullanılarak özellik füzyonu, CycleGAN kullanılarak desen yeniden yapılandırması, SPADE kullanılarak sanatsal stil sentezi ve segmentasyon ile yeniden yapılandırma metrikleri kullanılarak yapılan final değerlendirmesini içerir. Oklar, çerçeve boyunca veri ve özellik temsillerinin akışını göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

İnsan toplumunun kolektif hafızası ve kültürel mirası, sanatsal ifade ve kültürel kimlik için önemli bir araç görevi gören somut olmayan kültürel mirasta (SOKÜM) somutlaşmaktadır. Ancak SOKÜM, küreselleşme ve dijitalleşmenin etkileri nedeniyle önemli zorluklarla karşı karşıyadır2,3,4. Birçok tehlike altındaki SOKÜM uygulaması, yetenekli zanaatkarların sayısının azalması ve modern pazarlara sınırlı adaptasyon yeteneği nedeniyle koruma ve geliştirme konusunda yeni yaklaşımlara ihtiyaç duymaktadır5,6. SOKÜM araştırmalarının önemli bir alanı olan sürdürülebilir tasarım, kültür, toplum ve çevrenin entegre gelişimini vurgulamakta ve SOKÜM'ün devamlılığı için pratik bir yol sunmaktadır. Sürdürülebilir tasarım yaklaşımları aracılığıyla SOKÜM, çağdaş toplumun ihtiyaçlarına uyum sağlarken yeniden canlandırılabilir7,8.

Bu çalışmada, “somut olmayan kültürel miras desenleri” terimi, temelindeki somut olmayan kültürel değerleri aktaran ve koruyan görsel motif temsillerini ifade eder. Sonuç olarak, önerilen çerçeve, bu motiflerin görsel formlarını yeniden oluştururken, onlarla ilişkili kültürel bilgilerin korunmasını ve belgelenmesini amaçlamaktadır.

Miao nakışı ve batiği, kuşlar, kelebekler ve ata totemleri gibi sembolik motifler aracılığıyla Miao topluluğunun tarihini, inançlarını ve geleneklerini yansıtan Çin somut olmayan kültürel mirasının (ICH) önemli biçimleridir9. Bu motifler, ritüel kıyafetlerine ve festival uygulamalarına derinlemesine nüfuz etmiş olup yerel kültürel ve ekonomik kalkınmaya katkıda bulunmaktadır10,11. Dijital teknolojilerdeki, özellikle de yapay zeka (AI) ve derin öğrenme (DL) alanındaki ilerlemeler; kültürel mirasın korunması, analizi, yeniden yapılandırılması ve belgelenmesi için yeni fırsatlar yaratmıştır. Çin'deki en iyi korunmuş batik geleneklerinden biri olan Guizhou Miao batiği, Miao halkının kültürel bilgisinin, inançlarının, geleneklerinin ve ritüellerinin aktarılmasında önemli bir araç görevi görmektedir12,13,14,15,16.

Yakın tarihli çalışmalar, DL'nin kültürel mirasın korunması ve desen yeniden yapılandırması için potansiyelini ortaya koymuş; U-Net ve DeepLabV3+1 ile karşılaştırıldığında daha iyi segmentasyon doğruluğu (piksel doğruluğu = 88,6%, ortalama birlik üzerinden kesişim [IoU]= 78,1%) ve yeniden yapılandırma performansı elde etmiştir. Ancak, çeşitli zorluklar devam etmektedir. Mevcut üretici çekişmeli ağ (GAN) tabanlı yaklaşımlar, karmaşık desenlerdeki ince yapısal detayları korumakta genellikle zorlanırken17, sınırlı veri seti çeşitliliği modelin farklı kültürel alanlar genelindeki genelleme yeteneğini kısıtlamaktadır18. Ek olarak, CycleGAN gibi görüntüden-görüntüye çeviri modelleri, segmentasyon haritaları ile üretilen görüntüler arasındaki semantik tutarlılığı korumada yetersiz kalabilir19 ve dikkat mekanizmalarının eksikliği, yeniden yapılandırma sırasında kültürel açıdan önemli motif detaylarının kaybıyla sonuçlanabilir20. Bu nedenle, etkili bir ICH desen yeniden yapılandırması için transformer tabanlı segmentasyon, dikkat güdümlü özellik öğrenimi ve çoklu veri seti eğitimini entegre eden geliştirilmiş bir çerçeveye ihtiyaç duyulmaktadır.

Miao nakışının dijitalleştirilmesi ve üretken yapay zekanın hızlı ilerleyişi sayesinde, kültürel mirasın korunması için yeni fırsatlar ortaya çıkmıştır. Yeni gelişen bir derin üretken model sınıfı olan difüzyon modelleri, güçlü içerik oluşturma yetenekleri sayesinde bilgisayarlı görü görevlerinde dikkat çekici bir performans sergilemiştir21,22,23,24,25. Ters difüzyon süreci boyunca model, gürültülü temsillerden orijinal giriş verilerini yeniden oluşturmayı kademeli olarak öğrenir26,27,28. Önceki çalışmalar, kültürel mirasın korunması ve yaygınlaştırılması için üç boyutlu yeniden yapılandırma ve bilgisayar destekli tasarım (CAD) teknolojilerinin uygulanmasını da araştırmıştır.

Konvolüsyonel sinir ağları (CNN'ler) ve GAN'ler görüntü oluşturma ve özellik koruma konusunda iyi performans gösterseler de, hala sınırlı alıcı alanlar, mod çökmesi ve eğitim kararsızlığı ile ilgili zorluklarla karşı karşıyadırlar29. SegFormer ve Segmenter gibi Transformer tabanlı mimariler, küresel bağlamı ve semantik ilişkileri yakalamada üstündür; ancak hesaplama açısından yoğunluktadırlar ve ince ayrıntılarda zorlanabilirler. Stable Diffusion gibi difüzyon modelleri güçlü görüntü oluşturma yetenekleri sergilese de, genellikle oluşturulan tasarımların yapısal ve sanatsal özellikleri üzerinde hassas kontrole sahip değillerdir. Ayrıca, mevcut yaklaşımların çoğu, segmentasyon ve oluşturma bileşenleri arasında etkili bilgi paylaşımını ve iş birlikçi optimizasyonu sınırlayan bağımsız eğitim stratejileri kullanmakta, bu da yapısal doğruluk ile sanatsal özgünlük arasında bir ödünleşime yol açmaktadır30.

Gizli difüzyon (latent diffusion) ve Stable Diffusion gibi güncel difüzyon tabanlı modeller yüksek kaliteli görüntü sentezi gerçekleştirmektedir; ancak iteratif gürültü giderme işlemi gerektirdikleri için hesaplama maliyetini ve çıkarım süresini artırmaktadırlar. Ayrıca, özel koşullandırma mekanizmaları olmadan ince kültürel motiflerin ve yapısal tutarlılığın korunması zor olmaya devam etmektedir. Transformer tabanlı üretici modeller, küresel bağlamsal ilişkileri etkili bir şekilde yakalamaktadır; fakat sıklıkla büyük ölçekli veri setlerine ve önemli miktarda hesaplama kaynağına ihtiyaç duymaktadırlar. Buna karşın, önerilen SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) çerçevesi; açık yapısal yönlendirme sağlamak amacıyla SegFormer tabanlı segmentasyon, çapraz dikkat (cross-attention) özellik füzyonu, CycleGAN yeniden yapılandırması ve SPADE kılavuzlu sentezi birleştirerek motif korumayı, semantik tutarlılığı ve kültürel miras desenlerinin kontrol edilebilir yeniden yapılandırılmasını geliştirmektedir.

En yeni semantik segmentasyon tekniklerinin çoğu, U şeklinde mimarilere sahip tam evrişimli sinir ağlarına (FCNN'lere) dayanmaktadır31. Kodlama aşamasında, bir dizi evrişim ve alt örnekleme işlemi aracılığıyla geniş alıcı alanlara sahip derin özellikler çıkarılır. Kod çözme aşaması, üst örnekleme yoluyla mekansal çözünürlüğü kademeli olarak geri yükleyerek nihayetinde piksel düzeyinde semantik tahmine olanak tanır. Atlama bağlantıları, farklı kodlayıcı seviyelerinden gelen yüksek çözünürlüklü bilgilerin doğrudan kod çözücüye entegre edilmesini sağlayarak, alt örnekleme sırasındaki mekansal bilgi kaybını telafi eder ve geniş bir uygulama yelpazesinde segmentasyon performansını artırır32.

Son zamanlarda GAN tabanlı, CNN tabanlı ve difüzyon tabanlı yöntemler görüntü oluşturma ve kültürel miras restorasyonunda gelecek vaat eden sonuçlar göstermiş olsa da, bu yöntemler genellikle semantik tutarlılığı korumakta, ince yapısal motifleri muhafaza etmekte ve çeşitli kültürel desenlerde yeniden üretilebilir rekonstrüksiyon sağlamakta zorlanmaktadır. Mevcut yaklaşımların çoğu segmentasyon, rekonstrüksiyon ve stil sentezini ayrı süreçler olarak ele almakta, bu da kültürel açıdan önemli unsurların kaybına ve tutarsız çıktılara yol açabilmektedir. Bu metodolojik boşluğu gidermek için bu çalışma; SegFormer tabanlı semantik segmentasyonu, yeni bir Çapraz Dikkatli Kültürel Özellik Füzyon Modülü'nü (CAFFM), CycleGAN tabanlı rekonstrüksiyonu ve SPADE güdümlü stil sentezini entegre eden birleşik bir SegCycle-SPADE çerçevesi önermektedir. Yapısal segmentasyon bilgisini üretici özellik öğrenimiyle açıkça entegre eden önerilen çerçeve, hem kültürel özgünlüğü hem de sanatsal kaliteyi korurken, Somut Olmayan Kültürel Miras (ICH) motiflerinin daha güvenilir, semantik olarak tutarlı ve yeniden üretilebilir şekilde rekonstrüksiyonunu sağlamaktadır.

Bu çalışmada, mevcut kültürel miras yeniden yapılandırma yaklaşımlarının üç temel sınırlaması belirlenmiştir: (i) GAN tabanlı yeniden yapılandırma yöntemlerinde ince yapısal motiflerin yetersiz korunması; (ii) küçük veya alana özgü veri kümeleriyle eğitim yapılması sonucunda ortaya çıkan sınırlı genelleme yeteneği ve (iii) görüntüden görüntüye aktarım çerçevelerinde segmentasyon çıktıları ile oluşturulan görüntüler arasındaki yetersiz anlamsal tutarlılık. Ayrıca, segmentasyon, yeniden yapılandırma ve stil sentezi genellikle ayrı süreçler olarak ele alınmakta, bu da yeniden yapılandırma sırasında kültürel açıdan önemli unsurların kaybına yol açmaktadır. Önerilen SegCycle-SPADE çerçevesi; transformer tabanlı anlamsal segmentasyon, çapraz dikkat özellik füzyonu, CycleGAN yeniden yapılandırması ve SPADE kılavuzlu sanatsal sentezi birleşik bir mimari içinde birleştirerek bu sınırlamaları gidermekte ve somut olmayan kültürel miras (SOK) desenlerinin yeniden yapılandırılmasında motif korumasını, anlamsal tutarlılığı ve sanatsal özgünlüğü geliştirmektedir.

Bu çalışmanın temel amacı, Somut Olmayan Kültürel Miras (ICH) desenlerinin semantik segmentasyon rehberliğinde sanatsal rekonstrüksiyonu için geliştirilmiş bir SegCycle-SPADE çerçevesi oluşturmaktır. Söz konusu çerçeve, doğru kültürel motif segmentasyonu için SegFormer'ı, desen rekonstrüksiyonu için CycleGAN'ı ve stile uygun sanatsal sentez için SPADE'i entegre eder. Özellik temsilini iyileştirmek ve ince yapısal detayları korumak amacıyla, segmentasyon ve üretici özellikler arasında etkili etkileşimi kolaylaştırmak için bir CAFFM sunulmuştur. Miao Batik ve WikiArt veri setleri üzerinde eğitilen önerilen çerçeve; rekonstrüksiyon özgünlüğünü, stil tutarlılığını ve kültürel açıdan anlamlı motiflerin korunmasını artırmaktadır.

Bu çalışma; anlamsal segmentasyon, dikkat güdümlü özellik füzyonu, desen yeniden yapılandırma ve stil sentezini tek bir mimari altında birleştirerek, ICH (Somut Olmayan Kültürel Miras) desenlerinin sanatsal yeniden yapılandırılması için özgün bir SegCycle-SPADE çerçevesi sunmaktadır. Bu çalışmanın temel katkıları şunlardır. İlk olarak, SegFormer entegrasyonu aracılığıyla, karmaşık kültürel motiflerin ve yapısal unsurların doğru bir şekilde çıkarılmasını ve korunmasını sağlayan yeni bir anlamsal segmentasyon güdümlü yeniden yapılandırma çerçevesi geliştirilmiştir. İkinci olarak, segmentasyon özelliklerini üretici temsillerle etkili bir şekilde birleştirmek için yeni bir CAFFM tanıtılmıştır; bu sayede modelin kültürel motifler ve sanatsal stil desenleri arasındaki uzun menzilli ilişkileri yakalaması sağlanmıştır. Üçüncü olarak, önerilen CAFFM, yeniden yapılandırılan miras desenlerinin görsel gerçekçiliğini ve yapısal tutarlılığını artırırken kültürel açıdan anlamlı unsurların korunmasını geliştirmiştir. Dördüncü olarak, kültürel desen yeniden yapılandırması için CycleGAN ve segmentasyon güdümlü sanatsal sentez için SPADE entegre edilerek, çerçeve üretilen çıktılarda hem anlamsal doğruluğu hem de stilistik özgünlüğü sağlamıştır. Beşinci olarak, genelleştirmeyi ve sanatsal çeşitliliği artırmak amacıyla model, kültürel desen öğrenimi için Miao Batik kültürel motif veri seti ve sanatsal stil temsili için WikiArt veri seti kullanılarak eğitilmiştir. WikiArt, Miao kültürel miras ürünlerinde doğrudan uygulama için bir hedef stil olarak değil, çerçevenin farklı görsel bağlamlardaki genelleme yeteneğini, özellik öğrenme sağlamlığını ve stil kontrol etkinliğini değerlendirmek için yardımcı bir veri seti olarak kullanılmıştır. Son olarak, mevcut GAN tabanlı kültürel miras yeniden yapılandırma yöntemleriyle karşılaştırıldığında, deneysel sonuçlar önerilen SegCycle-SPADE çerçevesinin daha iyi segmentasyon doğruluğu, yeniden yapılandırma kalitesi ve stilistik tutarlılık sağladığını göstermektedir.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen SegCycle-SPADE çerçevesi; semantik segmentasyon, dikkat (attention) kullanılarak özellik iyileştirme, üretken yeniden yapılandırma ve sanatsal stil sentezi yoluyla geleneksel kültürel miras desenlerini yeniden yapılandırmak ve geliştirmek için tasarlanmıştır. Bu çalışmada, Miao Batik veri seti ve WikiArt veri seti dahil olmak üzere halka açık kültürel miras ve sanatsal görüntü veri setleri kullanılmıştır. Araştırmada insan katılımcılar, hasta verileri, kişisel bilgiler, hayvan denekler veya klinik kayıtlar yer almamıştır; bu nedenle, kurumsal etik kurul onayı ve bilgilendirilmiş onam gerekmemiştir. Başlangıç olarak, değerlendirme için Miao Batik kültürel motif veri seti ve WikiArt veri seti kullanılmıştır. Miao Batik veri seti, Quan et al. (2024)32 tarafından tanımlanmış olup geleneksel Miao batik motiflerinin 15.148 adet açıklanmış görüntüsünü içermektedir. Veri seti oluşturucuları tarafından sağlanan mevcut açıklamalar doğrudan kullanılmış ve bu çalışmada ek manuel açıklamalar oluşturulmamıştır. Ardından, görüntülerin ön işlemesi; yeniden boyutlandırma, normalleştirme, gürültü giderme ve bir segmentasyon maskesi oluşturma işlemleriyle gerçekleştirilmiştir. Kesin ön işleme parametreleri, Veri Ön İşleme alt bölümünde açıklanmıştır. Önerilen çerçeve, verilerin semantik segmentasyonu için SegFormer-B2 adlı transformer tabanlı bir model kullanmaktadır. Yöntem, kültürel motiflerin kilit bölgelerini tespit etmek ve yapılarını öğrenmek için tasarlanmıştır. Segmentlere ayrılmış özellikler daha sonra, kültürel motiflerle ilgili önemli bilgilerin vurgulandığı ve ilgisiz bilgilerin ayıklandığı bir dikkat mekanizması aracılığıyla geliştirilmiştir. Dikkat mekanizması yapılandırması, CAFFM alt bölümünde açıklanmıştır. İyileştirilen özellikler daha sonra, hasarlı yapıların döngüsel öğrenme yoluyla yeniden yapılandırıldığı CycleGAN'e aktarılmıştır. Eğitim sırasında, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi oklüzyon işlemleri uygulanarak yapay olarak eksik motif örnekleri oluşturulmuştur. Bu bozulma prosedürleri, yıpranmış kültürel miras eserlerinde yaygın olarak gözlenen eksik motif bölgelerini ve yapısal hasarları simüle etmiştir. Elde edilen eksik görüntüler CycleGAN yeniden yapılandırma modülüne girdi olarak kullanılırken, karşılık gelen orijinal görüntüler yeniden yapılandırma hedefleri olarak hizmet etmiştir. Yeniden yapılandırılan kültürel miras desenleri daha sonra, üretilen segmentasyon haritalarına dayanarak sanatsal iyileştirmenin gerçekleştirildiği SPADE aracılığıyla geliştirilmiştir. Önerilen çerçevenin performansı, kantitatif segmentasyon ve görüntü kalitesi metrikleri kullanılarak değerlendirilmiş, yeniden yapılandırılan kültürel motiflerin görsel özgünlüğü ise kalitatif olarak değerlendirilmiştir. Görsel özgünlük, üretilen kültürel desenlerin görsel incelemesi yoluyla değerlendirilmiş ve bağımsız bir kantitatif metrik olarak kullanılmamıştır. Değerlendirme; motif koruması, semantik tutarlılık, kültürel özellikler, yapısal bütünlük ve ilgili referans kültürel motiflere göre sanatsal görünüme odaklanmıştır. Model performansının kantitatif değerlendirmesi; Segmentasyon Doğruluğu, IoU, Dice Katsayısı, Yapısal Benzerlik İndeksi (SSIM), Pik Sinyal-Gürültü Oranı (PSNR) ve Fréchet Inception Mesafesi (FID) kullanılarak gerçekleştirilmiştir. Şekil 2, önerilen SegCycle-SPADE çerçevesinin genel iş akışını göstermekte ve bu çalışmada kullanılan değerlendirme metriklerini özetlemektedir.

Sanatsal stil üretimi için SegFormer ve CycleGAN kullanan veri seti işleme diyagramı; değerlendirme metrikleri dahil edilmiştir.
Şekil 2. Önerilen SegCycle-SPADE Çerçevesinin Genel Mimari İş Akışı. Tam SegCycle-SPADE iş akışının genel görünümü. Miao Batik ve WikiArt veri setlerinden alınan görüntüler, SegFormer-B2 kullanılarak semantik segmentasyon, CAFFM kullanılarak özellik iyileştirme, CycleGAN kullanılarak desen yeniden yapılandırma ve SPADE kullanılarak sanatsal stil üretimi aşamalarına girmeden önce ön işlemeden geçirilir. Model performansı; Segmentasyon Doğruluğu, Birleşim üzerinden Kesişim (IoU), Dice Katsayısı, Yapısal Benzerlik İndeksi (SSIM), PSNR ve Fréchet Inception Distance (FID) kullanılarak değerlendirilirken, görsel özgünlük nitel olarak değerlendirilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Kültürel miras desen yeniden yapılandırması için geliştirilen SegCycle-SPADE çerçevesi, Şekil 2'de gösterildiği üzere; doğru motif segmentasyonu, yeniden yapılandırma ve sanatsal geliştirme için birden fazla DL bileşenini entegre edecek şekilde tasarlanmıştır. Çeşitli kültürel desenler ve sanatsal stiller sağlamak amacıyla Miao Batik kültürel motif veri setinden ve WikiArt veri setinden alınan görüntüler kullanılmıştır. Başlangıçta, kültürel motifleri arka plandan tanımlamak ve sınırlarını belirlemek için görüntüler SegFormer tabanlı bir semantik segmentasyon modülü kullanılarak işlenir. Genel mimari dört ana aşamadan oluşur. İlk olarak, SegFormer modeli kültürel desen görüntülerinden semantik segmentasyon haritaları çıkarır. İkinci olarak, CAFFM, özellik öğrenimini geliştirmek için segmentasyon özelliklerini üretici temsillerle entegre eder. Üçüncü olarak, CycleGAN modülü, birleştirilmiş özellik temsillerini kullanarak kültürel desenleri yeniden yapılandırır. Son olarak, SPADE modülü, segmentasyon rehberliğinde sentezleme yoluyla yapısal tutarlılığı korurken stilsel olarak geliştirilmiş çıktılar üretir. İyileştirilmiş özellik haritaları daha sonra, bozulmuş desenleri ilgili tam formlarına eşleyerek eksik kültürel motifleri geri getirmeyi öğrenen CycleGAN yeniden yapılandırma modülü tarafından işlenir. Eksik motif örnekleri, orijinal Miao Batik görüntülerine rastgele maskeleme ve kısmi tıkanma işlemleri uygulanarak oluşturulmuş; böylece hasarlı kültürel eserlerde yaygın olarak gözlemlenen eksik desen bölgeleri ve yapısal bozulmalar simüle edilmiştir. Her bozulmuş görüntü, eğitim sırasında yeniden yapılandırma hedefi olarak hizmet eden karşılık gelen orijinal görüntüsüyle eşleştirilmiştir. Bu strateji, CycleGAN modülünün, semantik tutarlılığı ve kültürel açıdan önemli özellikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır. Son olarak, SPADE üreticisi, görüntü sentezini üretilen segmentasyon haritalarına koşullandırarak görsel olarak geliştirilmiş sanatsal çıktılar üretir ve böylece sanatsal geliştirme süreci boyunca kültürel motiflerin yapısal bütünlüğünü korur.

Önerilen SegCycle-SPADE çerçevesinde aşağıdaki adımlar yer almaktadır.

Adım 1: Veri Seti Toplama
Kültürel desen öğrenimi ve sanatsal stil üretimi amaçlarını gerçekleştirmek için iki veri seti kullanılmıştır. Geleneksel kültürel desen bilgilerini sağlamak için Miao Batik Kültürel Motif Veri Seti kullanılmıştır. Veri seti, Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden halka açık olarak erişilebilirdir ve 15.148 adet etiketlenmiş geleneksel Miao batik motifi görüntüsü içermektedir. Veri seti oluşturucuları tarafından sağlanan mevcut etiketlemeler doğrudan kullanılmış olup, bu çalışmada ek bir manuel etiketleme yapılmamıştır. Sanatsal stil üretimi için çeşitli sanatsal stil bilgilerini sağlamak amacıyla kullanılan WikiArt veri seti, halka açık WikiArt deposundan (https://www.wikiart.org/) temin edilmiştir.

Adım 2: Veri Ön İşleme
Tüm görüntüler yeniden boyutlandırma, normalleştirme ve gürültü azaltma işlemleriyle ön işlemeden geçirilmiştir. Semantik segmentasyon aşamasını desteklemek amacıyla orijinal veri seti kaynaklarından elde edilen mevcut kültürel motif anotasyonları kullanılmıştır. Bu çalışmanın bir parçası olarak ek bir anotasyon veya yeniden etiketleme işlemi gerçekleştirilmemiştir.

Adım 3: SegFormer Kullanılarak Semantik Desen Segmentasyonu
Kültürel motif segmentasyonu için SegFormer modeli kullanılmıştır. Kesin SegFormer omurgası ve başlatma stratejisi, Semantic Pattern Segmentation Using SegFormer alt bölümünde açıklanmıştır. Spesifik olarak, semantik motif segmentasyonu için ImageNet ön eğitimli MIT-B2 omurgalı SegFormer-B2 mimarisi kullanılmıştır. Bu model, geleneksel kültürel desenlerin karmaşık yapısal detaylarını korurken küresel bağlamsal bilgileri etkili bir şekilde yakalar.

Adım 4: CAFFM
CAFFM, semantik segmentasyon özelliklerini üretken temsillerle birleştirerek çerçevenin hem yapısal motif özelliklerini hem de sanatsal stil bilgilerini öğrenmesini sağlar. CAFFM'nin entegrasyon detayları CAFFM alt bölümünde sunulmuştur. Modül, SegFormer tabanlı semantik segmentasyon aşaması ile üretken yeniden yapılandırma aşaması arasına konumlandırılmıştır ve burada segmentasyondan türetilen yapısal özellikleri, çok başlı çapraz dikkat (multi-head cross-attention) aracılığıyla yeniden yapılandırma özellikleriyle kaynaştırır. Bu işlem, kültürel motiflerin korunmasını iyileştirir ve yeniden yapılandırılan çıktıların gerçekçiliğini artırır.

Adım 5: Desen Yeniden Oluşturma (CycleGAN)
Birleştirilmiş özellikler, kültürel desen yapılarını yeniden oluşturmak amacıyla CycleGAN modülü tarafından işlenir. CycleGAN mimarisi ve eğitim konfigürasyonu, CycleGAN Kullanarak Desen Yeniden Oluşturma alt bölümünde açıklanmıştır. Yeniden oluşturma modülü, iki jeneratör ve iki diskriminatörden oluşur; dokuz rezidüel blok içeren bir rezidüel ağ jeneratör mimarisi kullanır, bir PatchGAN diskriminatörü uygular ve adverseryal ve döngüsel tutarlılık kayıpları kullanılarak eğitilir. Bu konfigürasyon, çift yönlü alan eşlemesine olanak tanır ve eksik kültürel desen yapılarının yeniden oluşturulmasını kolaylaştırır.

Adım 6: Sanat Stili Üretimi (SPADE)
Rekonstrüktif desenler daha sonra segmentasyon kılavuzlu sanatsal stil sentezi gerçekleştirmek için SPADE modülünden geçirilir. SPADE jeneratör konfigürasyonu, SPADE Kullanarak Sanat Stili Üretimi alt bölümünde açıklanmıştır. Modül; SPADE rezidüel bloklar, mekansal adaptif normalizasyon katmanları ve SegFormer segmentasyon haritaları ile CAFFM özellik temsillerinden türetilen semantik koşullandırmayı kullanır. Görüntü üretimi segmentasyon haritalarına koşullandırılarak, sentezlenen çıktıların sanatsal stil özelliklerini bünyesine katarken orijinal kültürel motiflerle yapısal hizalanmasını koruması sağlanır.

Adım 7: Performans Tahmini
Önerilen çerçeve; Segmentasyon Doğruluğu, IoU, Dice Benzerlik Katsayısı (Dice), SSIM, PSNR ve FID dahil olmak üzere birden fazla segmentasyon ve görüntü kalitesi değerlendirme metriği kullanılarak değerlendirilmiştir. Deneysel tutarlılığı ölçmek için tüm deneyler farklı rastgele tohumlar kullanılarak beş kez tekrarlanmış ve sonuçlar ortalama ± standart sapma olarak raporlanmıştır. İstatistiksel anlamlılık, p < 0,05 anlamlılık eşiği ile eşleştirilmiş t-testleri kullanılarak değerlendirilmiştir.

Veri Kümesi Toplama
Önerilen SegCycle-SPADE çerçevesinde, kültürel desenlerin anlaşılması ve stil öğrenimi için iki veri kümesi kullanılmıştır. Önerilen çerçevede kullanılan ilk veri kümesi, Miao Batik kültürel motif veri kümesidir. Bu veri kümesi, Miao etnik sanatı'nda kullanılan hayvanlar, bitkiler ve geometrik şekiller gibi motifleri içeren geleneksel Miao Batik görsellerinden oluşan kültürel motifleri içerir. Bu veri kümesi, kültürel mirasın korunması açısından genellikle önemli olan, zengin doku bilgisine sahip görüntüler içerir. SegCycle-SPADE'in önerilen çerçevesinde kullanılan ikinci veri kümesi ise WikiArt veri kümesidir. Bu veri kümesi, genellikle farklı stillerden gelen çok sayıda sanat eserini içerir. Bu veri kümesi, sanat eserlerini geliştirmek için genellikle faydalı olan karmaşık stil öğrenimi için kullanılmıştır. Bu veri kümesi, 27 farklı tasarıma sahip HD çözünürlükte 80.000 sanat eseri içermekte olup, bu özelliğiyle derin öğrenme tabanlı stil üretimi veya dönüştürme görevleri için daha kullanışlı hale gelmektedir.

Miao Batik Veri Seti:
Miao Batik veri seti (https://doi.org/10.5281/zenodo.20807658), kültürel açıdan anlamlı motifleri betimleyen 15.148 batik deseni görüntüsünden oluşmaktadır. Görüntüler, hayvan motifleri (örneğin, kelebekler ve balıklar), bitki tabanlı desenler ve kültürel sembolizm taşıyan geometrik motifler gibi çeşitli geleneksel tasarımları içermektedir. Bu veri seti, desen yeniden yapılandırması sırasında segmentasyon modülünün motif sınırlarını doğru bir şekilde tanımlamasını ve korumasını sağlayan otantik kültürel yapılar sunduğu için önerilen çerçevenin önemli bir bileşenidir (Tablo 1). Bu çalışmada, kültürel açıdan önemli motifler; kuşlar, kelebekler, çiçek desenleri ve ata totemleri dahil olmak üzere, Miao kültürel miras literatüründe yaygın olarak belgelenen ve veri seti açıklamalarında temsil edilen sembolik görsel öğeleri ifade etmektedir. Bu motifler, yalnızca görülme sıklıklarına veya mekansal kompozisyonlarına göre değil, belgelenmiş kültürel önemleri ve geleneksel Miao batik ve nakış tasarımlarındaki tekrarlayan varlıkları temel alınarak seçilmiştir. Uzman rehberliğindeki motif açıklamaları ve segmentasyon etiketleri, orijinal Miao Batik veri seti kaynağından alınmış ve bu çalışmada doğrudan kullanılmıştır. Yazarlar tarafından herhangi bir ek manuel açıklama, yeniden etiketleme veya uzman rehberliğinde açıklama prosedürü gerçekleştirilmemiştir. Veri seti oluşturucuları tarafından sağlanan mevcut açıklamalar, semantik segmentasyon eğitimi ve değerlendirmesi için kullanılmıştır.

ParametreAçıklama
Veri Seti AdıMiao Batik Kültürel Desen Veri Seti
Veri Seti KaynağıZenodo Deposu (DOI: 10.5281/zenodo.20807658)
AlanSomut Olmayan Kültürel Miras (SOKÜM) / Tekstil Desen Analizi
Toplam Görüntü Sayısı15.148 görüntü
Görüntü TipiGeleneksel Miao batik tekstil desenlerinin dijital görüntüleri
Örüntü KategorileriHayvan motifleri, bitki motifleri ve geometrik motifler
Kültürel KökenMiao etnik kültürü, Guizhou Eyaleti, Çin
Orijinal Görüntü ÇözünürlüğüÖn işlemden önce ham taramalar veya fotoğraflar olarak yakalanmış yüksek çözünürlüklü görüntüler (genellikle kısa kenarda ≥ 1.000 piksel)
Eğitim ÇözünürlüğüÖnişleme sırasında görüntüler 256 × 256 piksel boyutuna getirildi
Açıklama KullanılabilirliğiVeri seti oluşturucuları tarafından sağlanan mevcut segmentasyon anotasyonları, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışmada ek bir manuel anotasyon, yeniden etiketleme veya uzman onayı prosedürü uygulanmamıştır.
Bu Çalışmadaki UygulamaKültürel motif segmentasyonu, özellik çıkarımı, motif koruma ve örüntü yeniden yapılandırma

Tablo 1: Miao Batik Kültürel Desen Veri Setinin Özellikleri. Semantik segmentasyon, kültürel desen analizi ve motif yeniden yapılandırması için kullanılan Miao Batik kültürel motif veri setinin özeti. Tablo; veri seti kaynağını, görüntü özelliklerini, motif kategorilerini, kültürel kökeni, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesindeki rolünü açıklamaktadır.

WikiArt Veri Seti:
WikiArt veri seti [https://www.wikiart.org/], Tablo 2'de belirtilen 27 farklı sanatsal stilden 80.000'den fazla görüntüyü içeren popüler ve büyük ölçekli bir dijital sanat deposudur. Bu stiller arasında Rönesans sanatı, Empresyonizm, Kübizm ve Sürrealizm yer almaktadır. Veri seti, SPADE modülünün segmentasyon sürecinden elde edilen yapısal bilgileri korurken kültürel açıdan zenginleştirilmiş desenler oluşturmasına olanak tanıyan bilgi sağladığı için önerilen çerçevede oldukça önemlidir. Veri seti, eğitim için 56.000 ve hem doğrulama hem de test için 12.000 görüntüden oluşmaktadır. Veri setindeki görüntüler, DL modelinin etkili bir şekilde eğitilmesine yardımcı olur.

ParametreAçıklama
Veri Kümesi AdıWikiArt Veri Kümesi
Veri Kümesi KaynağıWikiArt Deposu (https://www.wikiart.org/)
AlanDijital Sanat ve Tablolar
Toplam Görüntü SayısıYaklaşık 80.000 sanat eseri
Eğitim Görüntüleri56.000
Doğrulama Görüntüleri12.000
Test Görüntüleri12.000
Sanatsal StillerRönesans, İzlenimcilik, Kübizm, Sürrealizm, Ekspresyonizm, Realizm ve Soyut Sanat dahil olmak üzere 27 sanatsal stil
Orijinal Görüntü ÇözünürlüğüOrijinal görüntü çözünürlükleri eserler ve kaynaklar arasında farklılık göstermektedir. Görüntüler, ön işleme sırasında 256 × 256 piksellik standart bir çözünürlüğe yeniden boyutlandırılmıştır.
Eğitim ÇözünürlüğüGörüntüler; sanatsal stil öğrenimi ve segmentasyon güdümlü görüntü sentezi öncesindeki ön işleme aşamasında 256 × 256 piksele yeniden boyutlandırılmıştır.
Veri Kümesi Bölümleme42 sabit rastgele tohumu kullanılarak yapılan tabakalı rastgele bölümleme (%70 eğitim, %15 doğrulama ve %15 test)
Stil Örnekleme Stratejisi27 sanatsal stilin eğitim, doğrulama ve test alt kümeleri arasındaki dağılımını korumak için tabakalı orantılı örnekleme uygulanmıştır
Bu Çalışmadaki UygulamaSanatsal stil öğrenimi, stil temsili ve segmentasyon güdümlü sanatsal sentez

Tablo 2: WikiArt Veri Setinin Özellikleri. Sanat tarzı öğrenimi ve tarz güdümlü görüntü sentezi için kullanılan WikiArt veri setinin özeti. Tablo; veri seti kaynağını, görüntü dağılımını, sanatsal tarz kapsamını, veri seti bölümlendirmesini, görüntü çözünürlüğünü ve önerilen SegCycle-SPADE çerçevesi içindeki uygulamasını açıklamaktadır.

Miao Batik veri seti, geleneksel Miao kültürel motiflerini temsil eden 15.148 görüntü içermektedir.32 Veri setine Zenodo (https://doi.org/10.5281/zenodo.20807658) üzerinden kamuya açık olarak erişilebilmektedir. Model eğitimi öncesinde tüm görüntüler görsel olarak incelenmiş, 256 × 256 piksel boyutuna getirilmiş, normalize edilmiş ve bozuk veya kopya örnekler açısından taranmıştır. Kalite kontrol taraması sonucunda herhangi bir görüntü dışlanmamıştır; bu nedenle, sonraki analizler için 15.148 görüntünün tamamı korunmuştur. Veri seti bölümlerinin tekrarlanabilirliğini sağlamak amacıyla, 42 değerindeki sabit bir rastgele başlangıç değeri (seed) kullanılarak eğitim (%70), doğrulama (%15) ve test (%15) alt kümelerine rastgele ayrılmıştır. WikiArt veri setine resmi WikiArt deposu (https://www.wikiart.org/) aracılığıyla erişilmiş olup, 27 farklı sanatsal tarzı kapsayan 80.000'den fazla sanat eseri içermektedir. Stil öğrenme deneyleri için eğitim amacıyla 56.000, doğrulama için 12.000 ve test için 12.000 görüntü kullanılmıştır.

Veri Ön İşleme
Önerilen SegCycle-SPADE çerçevesi eğitilmeden önce, tutarlı görüntü kalitesi ve doğru özellik temsili sağlamak amacıyla Miao Batik kültürel motif veri seti ve WikiArt veri seti birkaç ön işleme adımına tabi tutulmuştur. Gaussian gürültü giderme, normalizasyon, tutarlı bir giriş çözünürlüğüne yeniden boyutlandırma ve görüntü kalitesi doğrulaması dahil olmak üzere aynı temel ön işleme hattı her iki veri setine de uygulanmıştır. Bununla birlikte, veri setleri çerçeve içinde farklı roller üstlenmiştir. WikiArt veri seti sanatsal stil öğrenimi ve sentezi için kullanılırken, Miao Batik veri seti öncelikle kültürel motif segmentasyonu ve yeniden yapılandırma için kullanılmıştır. Bu göreve özgü roller dışında veri setine özel herhangi bir ön işleme değişikliği yapılmamıştır. DL modelinin tutarlı bir şekilde işlem yapmasını sağlamak için görüntüler önce sabit bir çözünürlüğe yeniden boyutlandırılmıştır. Her iki veri setindeki görüntülerin çözünürlükleri kaynaklarına göre farklılık gösterdiği için bu adım gerekli olmuştur. Yeniden boyutlandırma, hesaplama verimliliğini artırmış ve boyutsal tutarsızlıkların eğitimi etkilemesini önlemiştir. İkinci ön işleme adımı, eğitim sırasında gradyan güncellemelerini stabilize etmek için piksel değerlerinin standartlaştırılmış bir aralığa ölçeklendiği normalizasyon işlemidir. Ardından görüntüler, kültürel motif yapılarında karışıklığa neden olabilecek gürültüyü azaltmak için Gaussian filtreleme kullanılarak işlenmiştir. Miao Batik veri seti için, orijinal veri seti kaynağından doğrudan elde edilen mevcut kültürel motif segmentasyon maskeleri, semantik segmentasyon eğitimi ve değerlendirmesi için herhangi bir değişiklik yapılmadan kullanılmıştır. Bu çalışmaya özel olarak yeni segmentasyon maskeleri oluşturulmamıştır.

Aksi belirtilmedikçe, yerleşik yöntemleri tanımlayan denklemler önceki çalışmalardan uyarlanmış olup buna göre atıfta bulunulmuştur. Önerilen CAFFM'yi ve kompozit SegCycle-SPADE optimizasyon çerçevesini tanımlayan denklemler, bu çalışma için yazarlar tarafından geliştirilmiştir.

Veri setinden alınan bir girdi görüntüsünün Denklem 1 ile temsil edildiğini varsayalım:

Vektör uzayı temsili, I ∈ ℝⁿˣʷˣᶜ, formül gösterimi, eğitimsel matematik kavramı.  (1)

Burada H, W ve C sırasıyla görüntü yüksekliğini, genişliğini ve renk kanallarının sayısını ifade eder. Tüm görüntüler, Denklem 2'de gösterildiği gibi sabit bir H′ × W′ boyutuna yeniden boyutlandırılır:

Yeniden boyutlandırma yöntemleriyle ilgili görüntü işleme formülü, Ir = Resize(I,H'×W') denklemi.

Burada, Ir yeniden boyutlandırılmış görüntüdür. Normalize edilmiş piksel değerleri Denklem 3'e göre hesaplanır:

Normalize edilmiş yoğunluk için matematiksel formül, denklem: In = Ir/255, veri analizinde ilgili.   (3)

Bu, eğitim prosedürünün stabilize edilmesine yardımcı olur. Gürültü filtrelemesi, Denklem 4'te gösterildiği gibi bir Gauss filtresi kullanılarak gerçekleştirilir:

Statik denge denklemi Is=In*G(σ), sembol, matematik odaklı, araştırma analizi.

Burada, G(σ) bir Gauss filtresini ve * ise konvolüsyonu temsil etmektedir. Standart sapması σ = 1.0 olan 5 × 5 çekirdekli bir Gauss filtresi kullanılmıştır. Kenar artefaktlarını azaltmak amacıyla sınır piksellerine yansıtmalı dolgu (reflective padding) uygulanmıştır. Ölçekleme ve normalizasyondan önce, gürültü giderme işlemi görüntülerin yüklenmesinin hemen ardından gerçekleştirilmiştir. Çalışma boyunca ön işlemenin tekdüze olmasını sağlamak için, Miao Batik ve WikiArt veri kümelerindeki her görüntüye aynı filtre yapılandırması uygulanmıştır. Miao Batik veri kümesi için segmentasyon maskeleri Denklem 5'e göre oluşturulur:

Piksel sınıflandırma kriterlerini gösteren motif bölgesi tanımlama için matematiksel formül.

Burada, M, SegFormer modeline rehberlik etmek için kullanılan bir segmentasyon maskesidir.

Önişleme hattı, Şekil 3'te gösterildiği gibi, Miao Batik veri setinden ve WikiArt veri setinden görüntülerin elde edilmesiyle başlar. Eğitim sırasında herhangi bir veri artırma tekniği kullanılmamıştır. Yeniden boyutlandırma, normalizasyon, Gaussian gürültü giderme ve segmentasyon maskesi hazırlığını içeren önişlemeden sonra görüntüler, önerilen SegCycle-SPADE çerçevesinin eğitimi, doğrulaması ve testi için doğrudan kullanılmıştır. Önişleme hattının ilk adımı, DL modelinin görüntüleri daha verimli işlemesini sağlamak için görüntülerin sabit bir boyuta yeniden boyutlandırılmasını içerir. İkinci adım, piksel değerlerini standartlaştırılmış bir sayısal aralığa dönüştüren ve model yakınsamasını kolaylaştıran normalizasyonu kapsar. Üçüncü adım ise, örüntü tanımayı iyileştirmek için görüntülerin istenmeyen gürültülerden arındırıldığı gürültü giderme işlemini içerir. Ayrıca, Miao Batik veri seti için kültürel motif bölgeleri işaretlenmiş; böylece önerilen modelin segmentasyon modülünde kullanılan maskelerin oluşturulması sağlanarak üretim sırasında kültürel motiflerin korunması güvence altına alınmıştır. Bu aşamanın nihai çıktısı, önerilen modelin segmentasyon ve üretim modüllerini eğitmek için hazır olan temiz bir veri setidir.

Veri seti işleme diyagramı; adımlar yeniden boyutlandırma, normalizasyon, gürültü giderme ve motif açıklama süreçlerini içerir.
Şekil 3. Kültürel Miras Görüntüleri için Veri Ön İşleme İş Akışı. Model eğitimi öncesinde uygulanan görüntü ön işleme prosedürlerini gösteren iş akışı. İş akışı; veri seti edinimi, görüntünün yeniden boyutlandırılması, normalizasyon, Gaussian gürültü giderme, mevcut kültürel motif açıklamaları ve segmentasyon maskesi hazırlığını içerir. Elde edilen işlenmiş görüntüler ve maskeler, semantik segmentasyon ve örüntü yeniden yapılandırması için girdi olarak kullanılır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Model eğitimi öncesinde her görüntü bir kalite kontrol sürecine tabi tutulmuştur. Miao Batik veri seti 15.148 görüntü içermekteydi. Bozuk, mükerrer ve düşük kaliteli örnekler orijinal veri seti oluşturucuları tarafından daha önceden giderilmiştir; bu nedenle, bu çalışmadaki kalite kontrol taraması sırasında ek herhangi bir görüntü hariç tutulmamıştır. Sonuç olarak, 15.148 görüntünün tamamı analiz için tutulmuştur. Görüntüler, ön işleme sırasında RGB formatında yüklenmiş ve bilinear interpolasyon kullanılarak 256 × 256 piksel boyutuna yeniden boyutlandırılmıştır. Piksel değerleri, 255'e bölünerek [0, 255] aralığından [0, 1] aralığına ölçeklenmiştir. Ardından, kırmızı, yeşil ve mavi kanallar için sırasıyla [0.485, 0.456, 0.406] ortalama değerleri ve [0.229, 0.224, 0.225] standart sapma değerleri kullanılarak kanal bazlı normalizasyon uygulanmıştır. Ön işleme hattı; görüntü yükleme, RGB dönüşümü, yeniden boyutlandırma, piksel değeri ölçeklendirme, normalizasyon ve tensör dönüşümünü içermiştir. Gerektiğinde, DL modelleriyle uyumluluğu korumak için gri tonlamalı görüntüler üç kanallı RGB formatına dönüştürülmüştür. Ön işlemenin ardından görüntüler eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Semantik segmentasyon, özellik füzyonu, motif yeniden yapılandırma ve SPADE tabanlı sanatsal sentez dahil olmak üzere SegCycle-SPADE çerçevesinin tüm aşamalarında 256 × 256 piksel boyutunda tutarlı bir giriş çözünürlüğü kullanılmıştır.

SegFormer Kullanılarak Semantik Desen Segmentasyonu
Bu ön işleme adımından sonra, Miao Batik kültürel motif veri kümesinin ve WikiArt veri kümesinin temizlenmiş ve normalize edilmiş görüntüleri, SegFormer-B2'nin önerilen çerçevesine dayanan semantik segmentasyon modülüne aktarılır. Bu adımın amacı, miras desenlerinde mevcut olan kültürel motifleri doğru bir şekilde tanımlamak ve ayırmaktır. SegFormer'ın önerilen çerçevesi, karmaşık miras desenlerinden hem küresel bağlamsal bilgileri hem de ayrıntılı yapısal bilgileri doğru bir şekilde yakalamak için hiyerarşik bir Transformer kodlayıcı ve hafif bir MLP kod çözücü içeren bir transformer mimarisine dayanmaktadır. Model öncelikle giriş görüntüsünden çoklu ölçeklerde öznitelik temsilleri çıkarır, ardından bu temsiller kod çözücü aracılığıyla birleştirilerek doğru segmentlere ayrılmış desenler oluşturulur. Bu işlem, miras görüntüsündeki desenlerin geometrik desenler, çiçeksi desenler ve sembolik desenler gibi motiflere doğru şekilde ayrıştırılmasını sağlayarak, yapısal bütünlüklerini korurken onları arka plandan ayırır. Bu yapısal bilgiler, daha sonra SegCycle-SPADE çerçevesi içindeki desen oluşturmanın sonraki aşamalarında kullanılır.

Önişlemden geçmiş giriş görüntüsü Denklem 6 ile temsil edilsin:

Gerçeksiz boyutlu görüntü uzayını gösteren denklem; formül: I_p ∈ ℝ^(H×W×C)    (6)

SegFormer kodlayıcısı, görüntüyü yamalara ayırır ve Denklem 7'de1 gösterildiği gibi transformer katmanlarını kullanarak hiyerarşik özellikler çıkarır:

Özellik kodlama sürecini gösteren denklem; formül: F = Encoder(Ip).

Burada F, transformer kodlayıcıdan elde edilen çok ölçekli özellik haritalarını belirtir. Bu özellikler, motif bölgeleri arasındaki hem yerel doku örüntülerini hem de küresel bağlamsal ilişkileri kodlar. SegFormer modeli, Denklem 8'de tanımlandığı şekilde farklı ölçeklerde özellik haritaları çıkarır:

Statik denge analizinde kullanılan vektör gösterimi formülü F={F1,F2,F3,F4}, matematiksel gösterim.

Çok ölçekli temsillerin kullanımı, kültürel motifler içindeki farklı boyutlardaki desenlerin tespitini kolaylaştırır. Son olarak, özellikler Denklem 91'da gösterildiği gibi MLP dekoder kullanılarak birleştirilir:
 Denklem: S=Decoder(F₁,F₂,F₃,F₄); matematiksel formül, dekoder fonksiyonu.

Burada, S nihai öngörülen segmentasyon haritasını belirtir.

SegFormer-B2 ana gövdesi, ImageNet ile önceden eğitilmiş ağırlıklar kullanılarak başlatılmış ve ardından kültürel motif segmentasyonu için Miao Batik veri kümesi üzerinde ince ayar yapılmıştır. Önceden eğitilmiş kontrol noktası, resmi SegFormer uygulamasından elde edilmiştir. Özellikle, ince ayar öncesinde SegFormer-B2 ana gövdesini başlatmak için resmi SegFormer deposu tarafından sağlanan ImageNet-1K önceden eğitilmiş MIT-B2 kontrol noktası (mit_b2.pth) kullanılmıştır. Önceden eğitilmiş ağırlıklar, SegFormer yazarları tarafından yayınlanan MIT-B2 ana gövdesine karşılık gelmekte olup semantik segmentasyon eğitimi için başlangıç modeli olarak hizmet etmiştir. Geri kalan göreve özgü katmanlar, eğitimden önce varsayılan PyTorch ağırlık başlatma prosedürleri kullanılarak başlatılmıştır.

Mimaride, örtüşen yama gömmelerine sahip dört aşamalı hiyerarşik bir Transformer kodlayıcı kullanılmıştır. İlk aşamada, yama boyutu 4 adımla (stride) 7 × 7 olarak belirlenmiştir. Dört kodlayıcı aşamasının her biri için gömme boyutları 64, 128, 320 ve 512'dir. Dört aşama boyunca sırasıyla 1, 2, 5 ve 8 çok kafalı öz-dikkat (multihead self-attention) kafası bulunmuş ve ilgili kodlayıcı derinlikleri 3, 4, 6 ve 3 katman olarak ayarlanmıştır. Kodlayıcıdan elde edilen çok ölçekli özellikler, hafif bir tüm-MLP çözücü (decoder) kullanılarak birleştirilmiştir. Çözücü, nihai segmentasyon haritasını oluşturmadan önce her bir kodlayıcı aşamasındaki özellikleri tek bir gömme uzayına yansıtmıştır. Tüm Transformer bloklarında Gaussian Hata Doğrusal Birim (GELU) aktivasyon fonksiyonu kullanılmıştır. Genelleştirmeyi artırmak ve aşırı öğrenmeyi (overfitting) azaltmak için eğitim sırasında 0,1 dropout oranı uygulanmıştır.

Eğitim aşamasında, SegFormer çerçevesi her iki veri setinden gelen ön işlemlere tabi tutulmuş görüntüleri alır. Miao Batik veri setinden gelen görüntüler, segmentasyon modelinin denetimli öğrenimi için etiket görevi gören motif bölgelerini içerir. Transformer kodlayıcı, görüntünün tamamını işler ve görüntü bileşenleri arasındaki uzun menzilli ilişkileri yakalar; bu durum, özellikle mekansal olarak dağılmış motifler içeren geleneksel batik desenleri için önemlidir. Hiyerarşik özellik çıkarma mekanizması, aynı zamanda tekrarlanan geometrik dokular gibi yerel yapıları yakalar. MLP kod çözücü, bu çıkarılan özellikleri işler ve motif bölgelerini vurgulayan bir segmentasyon maskesi oluşturur. Bu aşamada üretilen segmentasyon haritaları, daha sonra dikkat modülü ve desen yeniden yapılandırma aşaması için yapısal girdiler olarak kullanılır ve böylece üretilen desenlerin özgünlüğünün korunmasına yardımcı olur.

Kültürel motifler, görsel ve kültürel özelliklerine göre semantik segmentasyon için farklı sınıflara ayrılmıştır. Segmentasyon taksonomisi; hayvan motiflerini (örneğin kelebekler, balıklar, kuşlar ve diğer sembolik fauna), bitki motiflerini (örneğin çiçekler, yapraklar, sarmaşıklar ve botanik desenler), geometrik motifleri (örneğin tekrarlayan şekiller, bordürler ve soyut geometrik yapılar) ve motif olmayan alanları temsil eden arka plan bölgelerini kapsamaktadır. Her bir pikseli önceden tanımlanmış sınıflardan birine atamak için piksel düzeyinde segmentasyon maskeleri kullanılmıştır. Tam sayı etiketleri şu şekilde kodlanmıştır: Etiket 0 = arka plan, Etiket 1 = hayvan motifleri, Etiket 2 = bitki motifleri ve Etiket 3 = geometrik motifler. Segmentasyon anotasyonları ve motif etiketleri, doğrudan orijinal Miao Batik veri seti kaynağından alınmıştır. Bu çalışmada ek bir manuel anotasyon, yeniden etiketleme, sınır doğrulama veya uzman onay prosedürü uygulanmamıştır. Veri seti oluşturucuları tarafından sağlanan mevcut anotasyonlar, eğitim ve değerlendirme için herhangi bir değişiklik yapılmadan kullanılmıştır.

Kültürel motif segmentasyonu için kullanılan SegFormer modeli, Şekil 4'te gösterildiği gibi, kültürel desen bölgelerinin doğru tespiti için transformer tabanlı bir mekanizma kullanarak Miao Batik veri kümesinden ve WikiArt veri kümesinden gelen ön işlemlere tabi tutulmuş görüntüleri işler. İlk olarak, geleneksel kültürel motifler içeren giriş görüntüsü SegFormer modeline sunulur. Transformer kodlayıcı, görüntü yamalarından hem küresel bağlamsal bilgileri hem de yerel yapısal özellikleri çıkarır. Elde edilen çok ölçekli özellikler, özellik temsillerini iyileştirmek ve motif tespitini geliştirmek için bir Mix Feed-Forward Network kullanan segmentasyon kod çözücüye iletilir. SegFormer modelinin çıktısı, ilgisiz arka plan bilgilerini baskılarken kültürel desenlere karşılık gelen pikselleri vurgulayan bir segmentasyon maskesidir. Ayrıştırılan kültürel desenler, daha sonra SegCycle-SPADE çerçevesinin sonraki aşamaları için yapısal rehberlik sağlar.

SegFormer diyagramı; Transformer kodlayıcılar ile görüntü segmentasyonu, özellik çıkarımı, segmentasyon maskesi.
Şekil 4. Kültürel Motiflerin SegFormer-B2 Tabanlı Semantik Segmentasyonu. Kültürel motif çıkarımı için kullanılan ve yalnızca Miao Batik veri seti üzerinde eğitilen SegFormer-B2 semantik segmentasyon modülünün mimarisi. Çerçeve, çok ölçekli özellik çıkarımı için Transformer tabanlı bir kodlayıcıdan ve motif maskeleri oluşturmak için hafif bir segmentasyon kod çözücüsünden oluşur. Model; hayvan, bitki, geometrik ve arka plan olmak üzere dört semantik sınıfı tahmin eder ve ortaya çıkan segmentasyon maskeleri, ilgisiz arka plan bilgilerini bastırırken kültürel açıdan önemli motif bölgelerini tanımlar. Bu segmentasyon çıktıları, önerilen SegCycle-SPADE çerçevesinin sonraki özellik füzyonu, yeniden yapılandırma ve sanatsal sentez aşamaları için yapısal rehberlik sağlar. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Önerilen çerçevede yeni segmentasyon açıklamaları oluşturmaya gerek yoktur. Miao Batik veri seti, halihazırda mevcut olan bir kamu kaynağıdan edinilmiş ve model, veri seti oluşturucuları tarafından sağlanan ilgili motif bilgileri kullanılarak eğitilmiştir. Öğrenme sürecinde SegFormer modeli, semantik segmentasyon haritaları üretmiştir. Sonuç olarak, mevcut çalışma herhangi bir ek manuel açıklama yazılımına, açıklama kılavuzuna veya açıklama kalite kontrol prosedürüne ihtiyaç duymamıştır.

CAFFM
Semantik segmentasyon özellikleri ile üretken yeniden yapılandırma temsilleri arasındaki etkileşimi geliştirmek için çalışma aynı zamanda bir CAFFM önermiştir. SegFormer-B2 kodlayıcı, CAFFM modülüne semantik özellik haritaları sağlarken, CycleGAN yeniden yapılandırma adımı üretken özellik haritaları sağlar. İlk olarak, her iki özellik akışını ortak bir gömme alanına yansıtmak için doğrusal projeksiyon katmanları kullanılır. Çapraz dikkat hesaplaması için, oluşturulan özellik tensörleri kullanılarak sorgu (Q), anahtar (K) ve değer (V) temsilleri oluşturulur. Ardından, yapısal motif bilgileri ile sanatsal stil öğeleri arasındaki ilişkiler, çok başlı çapraz dikkat kullanılarak modellenir. Daha sonra, birleştirilmiş özellik temsillerine katman normalizasyonu, artık bağlantılar ve GELU aktivasyonuna sahip ileri beslemeli katmanlar uygulanır. SPADE tabanlı sentez aşaması, sanatsal tutarlılıktan ödün vermeden kültürel açıdan anlamlı temaların korunmasını sağlayarak CAFFM modülünün çıktısını alır.

Özellik uyumluluğunu garanti etmek için, giriş özellikleri önce doğrusal projeksiyon katmanları kullanılarak 256 gömme boyutuna sahip ortak bir gömme uzayına yansıtılır. Ardından, anlamsal yapısal bilgiler ile üretken stil temsilleri arasındaki etkileşimler, sekiz dikkat kafasından oluşan bir Çok Kafalı Çapraz Dikkat (MultiHead Cross-Attention) mekanizması kullanılarak modellenir. Çapraz dikkat hesaplaması, belirli doğrusal dönüşüm katmanları tarafından üretilen Sorgu (Q), Anahtar (K) ve Değer (V) vektörlerini kullanır. Eğitim stabilitesini artırmak ve özellik bütünlüğünü korumak amacıyla, birleştirilmiş özellik temsillerini daha da geliştirmek için artık bağlantılar (residual connections) ve Katman Normalizasyonu (Layer Normalization) uygulanır. Ardından, Gaussian Hata Doğrusal Birimi (GELU) aktivasyon fonksiyonuna sahip bir ileri beslemeli ağ uygulanarak doğrusal olmayan özellik öğrenimi geliştirilir. Modül tarafından 256 boyutunda bir çıktı özellik temsili üretilir ve yaratıcı sentez için diğer aşamalara gönderilir. CAFFM, çapraz dikkat tabanlı bir birleştirme tekniği kullanarak sanatsal stil verilerini kültürel motif yapılarıyla başarıyla birleştirir; bu da yeniden yapılandırılan kültürel miras desenlerinde motif korunmasını ve görsel tutarlılığı artırır.

Önerilen sistemde, yapısal özellikler Miao Batik veri setinden türetilirken, stilistik özellikler WikiArt veri setinden öğrenilmektedir. Miao Batik veri setindeki görüntüleri kullanan SegFormer segmentasyon ağından türetilen özellik haritası Fs ile, WikiArt görüntülerini kullanan stil-özellik çıkarma branşından türetilen özellik haritası ise Fa ile gösterilsin. Önerilen CAFFM, kültürel desenlerin hem yapısal hem de stilistik bağımlılıklarını öğrenmek için bir çapraz dikkat (cross-attention) mekanizması kullanarak iki özellik alanını birleştirir. Tablo 3; gömme boyutları, normalizasyon katmanları, aktivasyon fonksiyonları ve dikkat başlığı konfigürasyonu dahil olmak üzere tüm mimari özellikleri raporlamaktadır. 256 × 256 piksel boyutundaki bir giriş görüntüsü için, SegFormer-B2 kodlayıcısı 64 × 64 × 128 boyutunda semantik özellik haritaları üretirken, stil-özellik çıkarma branşı 64 × 64 × 128 boyutunda özellik haritaları üretmiştir. Her iki özellik haritası da çapraz dikkat füzyonu öncesinde, öğrenilebilir doğrusal katmanlar aracılığıyla 256 boyutlu ortak bir gömme alanınale projekte edilmiştir.

ParametreKonfigürasyon
Önerilen ÇerçeveSegCycle-SPADE
Semantik Segmentasyon ModeliSegFormer-B2
SegFormer Kodlayıcı Aşamaları4
Ağırlık BaşlatmaImageNet-1K Ön Eğitimli SegFormer-B2 (MIT-B2 Omurgası)
Kontrol Noktası KaynağıResmî NVIDIA SegFormer Deposu (https://github.com/NVlabs/SegFormer); kontrol noktası: segformer.b2.512x512.ade.160k
İnce Ayar StratejisiMiao Batik veri kümesi üzerinde uçtan uca ince ayar
Yama Gömme Boyutu7 × 7
Yama Adımı4
Gömme Boyutları64, 128, 320 ve 512
Kodlayıcı Derinlikleri3, 4, 6 ve 3
Dikkat Başlıkları1, 2, 5 ve 8
Dekoder TürüTam-MLP Dekoder
Aktivasyon FonksiyonuGELU
Dropout Oranı0.1
Öznitelik İyileştirme ModülüÇapraz Dikkatli Kültürel Öznitelik Füzyon Modülü (CAFFM)
CAFFM Gömme Boyutu256
CAFFM Dikkat Başlıkları8
CAFFM Füzyon Ölçekleri4
Rekonstrüksiyon ModeliCycleGAN
Stil Üretim ModeliSPADE
Kültürel Veri KümesiMiao Batik Veri Kümesi
Stil Veri KümesiWikiArt Veri Kümesi
Miao Batik Görüntüleri15.148
WikiArt GörüntüleriYaklaşık 80.000
Giriş Görüntü Çözünürlüğü256 × 256 piksel
Renk FormatıRGB
İnterpolasyon YöntemiBilineer İnterpolasyon
Gürültü Giderme YöntemiGauss Filtrelemesi
Gauss Çekirdek Boyutu5 × 5
Gauss Sigma (σ)1
Normalizasyon Aralığı[0, 1]
Yığın Boyutu16
Epoch Sayısı100
OptimizerAdam
Öğrenme Oranı0.0002
Adam Parametreleriβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0
Kayıp FonksiyonlarıSegmentasyon Kaybı, Adversaryal Kayıp, Döngüsel Tutarlılık Kaybı, Rekonstrüksiyon Kaybı, Motif Koruma Kaybı ve Stil Tutarlılığı Kaybı
Veri Kümesi Bölme StratejisiEğitim / Doğrulama / Test
Eğitim Seti%70
Doğrulama Seti%15
Test Seti%15
Rastgele Tohum42
Değerlendirme MetrikleriSegmentasyon Doğruluğu, IoU, Dice Katsayısı, SSIM, PSNR ve FID
Programlama DiliPython 3.8.10
Derin Öğrenme ÇerçevesiPyTorch 1.10.0
Donanım PlatformuNVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (11. Nesil), 32 GB RAM
İşletim OrtamıUbuntu 20.04 LTS

Tablo 3: Deneysel Kurulum ve Model Konfigürasyonu. Önerilen SegCycle-SPADE çerçevesinin uygulaması ve değerlendirilmesi için kullanılan mimari bileşenlerin, eğitim konfigürasyonunun, ön işleme ayarlarının, veri kümelerinin, optimizasyon parametrelerinin, değerlendirme metriklerinin ve hesaplama ortamının özeti.

Dikkat modülü, öncelikle öznitelik haritasını Denklem 10'u kullanarak sorgu, anahtar ve değer temsillerine eşler:

Statik denge formülleri, Q=FsWq, K=FsWk, V=FsWv, mekanik analiz denklemi.

Burada, Wq, Wk ve Wv öğrenilebilir ağırlık matrisleridir. Dikkat ağırlıkları, sorgu vektörü ile anahtar vektörü arasındaki benzerliğe dayalı olarak Denklem 1117 kullanılarak hesaplanır:

Softmax fonksiyonu formülü, A=Softmax((QK^T)/√d_k), dikkat mekanizması denklemi.

Burada, dk anahtar vektörün boyutudur. Geliştirilmiş özellik temsili, dikkat ağırlıklarının değer matrisi ile Denklem 12 kullanılarak çarpılmasıyla hesaplanır:

Statik denge formülü \(F_a = A \cdot V\) gösterilmektedir; kuvvet dengesi analizindeki temel kavram.

Burada, Fa özellik haritasının geliştirilmiş özellik gösterimidir. Geliştirilmiş özellik gösterimi, orijinal segmentasyon özellikleri ile dikkat mekanizması kullanılarak elde edilen geliştirilmiş özelliklerin Denklem 13 kullanılarak birleştirilmesiyle hesaplanır:

Kuvvetleri tanımlayan statik denge denklemi \( F_e = F_s + F_a \), formül.                                

Burada, Fe, desen yeniden yapılandırması için kullanılan geliştirilmiş özellik haritasıdır. CAFFM, farklı ölçeklerdeki kültürel motifler için özellikler çıkarmak amacıyla çok ölçekli bir çapraz dikkat mekanizmasıyla genişletilmiştir. Fsi ölçek i'deki segmentasyon özelliklerini, Faj ise aynı ölçekteki sanatsal stil özelliklerini ifade etsin. Nihai özellik temsili Denklem 14 kullanılarak tanımlanmıştır:

  Dikkat mekanizması formülü \(F_{\text{fusion}} = \sum_{i=1}^{N} \text{Attention}(Q_i, K_i, V_i)\).

Burada, Qi, Ki ve Vi sırasıyla i ölçeğindeki sorgu, anahtar ve değer matrislerini temsil eder ve N özellik ölçeklerinin sayısını belirtir. Bu çalışmada N = 4 olup, bu değer giriş görüntü boyutunun 1/4, 1/8, 1/16 ve 1/32'lik uzamsal çözünürlüklerinde çıkarılan özellik haritalarına karşılık gelmektedir. Bu çok ölçekli özellik temsilleri, yeniden yapılandırma ve sanatsal sentez öncesinde öğrenilebilir dikkat ağırlıkları kullanılarak birleştirilmiştir. Yukarıdaki genişletme, yöntemin kültürel desenleri yeniden yapılandırmak için küresel kültürel motifleri ve dokuları çıkarmasını sağlar. CAFFM, önerilen SegCycle-SPADE sisteminde SegFormer tabanlı segmentasyon aşaması ile SPADE tabanlı yaratıcı sentez aşaması arasında yer alır. İlk olarak, CycleGAN stilistik ve desenle ilgili bilgileri içeren yeniden yapılandırma özelliklerini eş zamanlı olarak oluştururken, SegFormer-B2 kültürel motiflerin yapısal özelliklerini betimleyen semantik özellik haritalarını geri kazanır. CAFFM modülü bu iki özellik akışını alır ve yapısal ile sanatsal temsiller arasındaki ilişkileri belirlemek için çapraz dikkat tabanlı birleştirme kullanır. Semantik tutarlılığı ve yapısal özellikleri korurken kültürel açıdan özgün desenler oluşturmak amacıyla, sonuçtaki birleştirilmiş özellik haritaları daha sonra segmentasyon güdümlü yaratıcı sentez için SPADE modülüne gönderilir.

CycleGAN ile Desen Rekonstrüksiyonu
Dikkat tabanlı özellik geliştirme aşaması tamamlandığında, özellik haritaları geliştirilmiş kültürel motif yapılarını içerecektir. Ancak, özellik haritaları hala eksik veya hasarlı desen bölgeleri içerebilir. Bu nedenle, desenlerin rekonstrüksiyonu problemini çözmek için önerilen çerçevede CycleGAN modeli kullanılacaktır. Önerilen çerçevede iki domain, orijinal kültürel motif desenleri ve rekonstrüktü edilmiş kültürel motif desenleri olacaktır. CycleGAN modeli, önceki aşamalardan gelen geliştirilmiş özellikleri kullanarak, yapısal tutarlılığı korurken kültürel desenleri yeniden oluşturacaktır. Bu durum; geometrik desenler, floral desenler ve sembolik desenler gibi kültürel desenlerin uzamsal düzenlerini korumasını sağlayacaktır. Eksik veya hasarlı kültürel motifler üretmek için orijinal Miao Batik görüntüleri rastgele maskeleme ve kısmi oklüzyon işlemlerine tabi tutulmuştur. Bu bozma prosedürleri, bozulmuş kültürel miras eserlerinde yaygın olarak gözlemlenen eksik desen bölgelerini ve yapısal hasarları simüle etmiştir. Bozulmuş görüntüler rekonstrüksiyon modülüne girdi olarak kullanılırken, karşılık gelen orijinal görüntüler performans değerlendirmesi ve rekonstrüksiyon kalitesi analizi için referans görüntüler olarak kullanılmıştır. Bu strateji, modelin semantik tutarlılığı ve kültürel özellikleri korurken eksik motif yapılarının restorasyonunu öğrenmesini sağlamıştır.

X eksik kültürel örüntülerin alanı ve Y yeniden yapılandırılmış kültürel örüntülerin alanı olsun. İki oluşturucu, Denklem 15'i kullanarak çift yönlü eşleme yapmayı öğrenir:

 GF:X→Y ve FM:Y→X fonksiyon ve eşleme diyagramı, denklemlerdeki matematiksel dönüşümler.

Burada, motif yapılarını yeniden oluşturmak için GE ve örüntüleri orijinal alana geri eşlemek için FM kullanılır. Yeniden oluşturulan örüntülerin gerçekçi olmasını sağlamak için adversariyal kayıp kullanılır (Denklem 16)30

GAN kayıp denklemi \(L_{GAN}\); üretici modelleri iyileştirmek için formül; matematiksel ifade.

Burada, DY gerçek ve yeniden yapılandırılmış desenleri ayırt etmek için kullanılan ayrıştırıcıdır ve GE(x) üretilen yeniden yapılandırılmış deseni ifade eder. CycleGAN ayrıca kültürel motiflerin yapısal düzenini korumak için döngü tutarlılığını zorunlu kılar (Denklem 17)30.

Hesaplamalı modellemede kayıp fonksiyonu \(L_{cycle}(G_F, F_M)\) için matematiksel formül.

Nihai kayıp fonksiyonu Denklem 1830 kullanılarak tanımlanmıştır:

Statik denge denklemi, L_total=L_GAN(G_E,D_Y,X,Y)+L_GAN(F_M,D_X,Y,X)+λ_L_cycle(G_E,F_M).

Burada λi, döngü tutarlılığı kaybı için ağırlıklandırma katsayısını ifade eder ve orijinal CycleGAN formülasyonuyla tutarlı olarak eğitim sırasında 10 olarak ayarlanmıştır. Bu değer, karşıt öğrenme ile kaynak ve hedef alanlar arasındaki yeniden yapılandırma tutarlılığını dengelemek için seçilmiştir.

CycleGAN yeniden yapılandırma modülü, çift yönlü görüntü çevirisi için iki jeneratör ve iki diskriminatörden oluşur. Her jeneratör; başlangıçta bir 7 × 7 konvolüsyon katmanı, ardından iki alt-örnekleme (downsampling) konvolüsyon katmanı, dokuz rezidüel blok ve iki üst-örnekleme (upsampling) katmanından oluşan bir rezidüel ağ mimarisini takip eder. Girdi katmanı, gelişmiş özellik çıkarımı için 7 × 7 kernel kullanırken, tüm diğer konvolüsyon işlemleri 3 × 3 kernel boyutu kullanır. Eğitim kararlılığını artırmak için her konvolüsyon katmanından sonra Örnek Normalizasyonu (Instance Normalization) uygulanmış, jeneratör ağının genelinde ise ReLU aktivasyonu kullanılmıştır. Çıktı katmanı, normalize edilmiş görüntü çıktıları üretmek için Tanh aktivasyon fonksiyonunu kullanır. Diskriminatör, 4 × 4 kernel boyutlarına ve kademeli olarak artan özellik kanallarına sahip bir dizi konvolüsyonel katmandan oluşan 70 × 70 PatchGAN mimarisini takip eder. Özellik ayırt etme ve çekişmeli öğrenmeyi (adversarial learning) iyileştirmek için diskriminatörde Örnek Normalizasyonu ve LeakyReLU aktivasyonu (negatif eğim = 0.2) kullanılmıştır. CycleGAN modülü, girdi olarak ön işlemeden geçmiş kültürel motif görüntülerini alır ve segmentasyon özellikleriyle entegrasyon için daha sonra CAFFM'ye iletilen yeniden yapılandırılmış desen temsilleri üretir. CycleGAN eğitimi, 0.0002 başlangıç öğrenme hızıyla Adam optimize edici (β₁ = 0.5, β₂ = 0.999) kullanılarak gerçekleştirilmiştir. Öğrenme hızı ilk 100 epoch boyunca sabit tutulmuş ve ardından kalan eğitim süresince doğrusal olarak sıfıra indirilmiştir. Diskriminatör eğitimini stabilize etmek için daha önce üretilmiş 50 görüntü içeren bir yeniden oynatma tamponu (replay buffer) kullanılmıştır. Jeneratörler ve diskriminatörler, her eğitim iterasyonu sırasında bir jeneratör güncellemesini bir diskriminatör güncellemesinin takip ettiği 1:1 güncelleme oranıyla güncellenmiştir.

CycleGAN'ın yeniden yapılandırma süreci, Şekil 5'teki CAFFM mekanizması kullanılarak elde edilen geliştirilmiş özellik haritalarına dayanmaktadır. Özellik haritaları, segmentasyon ve CAFFM'nin önceki aşamalarından elde edilen geliştirilmiş kültürel motifleri içerir. Özellik haritaları, ilk üreteç olan GE için girdi olarak kullanılır. İlk üreteç GE, kültürel desenleri yeniden yapılandırmak için gereken eşlemeyi öğrenir. Çıktılar daha sonra gerçek kültürel desenler ile yeniden yapılandırılan desenleri ayırt etmek için ayrıştırıcı DY'ye aktarılır. Ayrıştırıcı DY, üreteç GE'nin gerçekçi çıktılar üretmesine yardımcı olur. Yeniden yapılandırma sırasında kültürel desenlerin bozulmamasını sağlamak için ikinci üreteç FM döngüsel tutarlılık eşlemesi gerçekleştirir. İkinci üreteç FM, çıktıları orijinal alana geri eşler. Çıktılar daha sonra gerçekçiliğin sağlanması için ayrıştırıcı tarafından değerlendirilir. Nihai çıktılarle ardından, önerilen SegCycle-SPADE çerçevesinin bir sonraki aşamasında sanatsal stil üretimi için SPADE modülüne iletilir.

Desen yeniden yapılandırma süreci; kültürel motif üretimi için GAN'lar kullanan diyagram.
Şekil 5. CycleGAN Tabanlı Desen Yeniden Yapılandırma İş Akışı. CycleGAN yeniden yapılandırma modülünün iş akışı. Eksik kültürel motifleri yeniden yapılandırmak için jeneratör ağına girdi olarak dikkatle geliştirilmiş öznitelik temsilleri sağlanır. Diskriminatör, yeniden yapılandırılmış çıktıları referans desenlerle karşılaştırarak değerlendirirken, döngüsel tutarlılık eşlemesi çift yönlü görüntü çevirisi sırasında yapısal bütünlüğü korur. Yeniden yapılandırılan motifler daha sonra sanatsal stil sentezi için SPADE modülüne iletilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

SPADE Kullanarak Artistik Stil Üretimi
Ardından, yeniden yapılandırılan kültürel motifler, artistik stil üretimi için SPADE modülüne tabi tutulur. SPADE modülünün temel amacı, motiflerin yapısal düzenini bozmadan, yeniden yapılandırılan kültürel motiflere görsel olarak daha zengin artistik stil dokuları eklemektir. SPADE modülü, görüntü üretimi için görüntü segmentasyonu kavramından yararlanan koşullu bir görüntü üretme tekniğidir. SegFormer-B2 tarafından üretilen semantik segmentasyon maskelerinden, önceden belirlenmiş motif sınıflarına karşılık gelen çok kanallı semantik haritalar kodlanmıştır. SPADE üreteci, bu kodlanmış haritaları koşullandırma girdileri olarak almıştır. Mekansal olarak uyarlanabilir ölçekleme (γ) ve sapma (β) parametreleri, her SPADE katmanı içindeki evrişimli katmanlar aracılığıyla semantik haritaların işlenmesiyle üretilmiştir. Böylece üreteç, bu parametreleri normalize edilmiş özellik aktivasyonlarına uygulayarak artistik sentez sırasında motif sınırlarını, yapısal düzenleri ve semantik bilgileri koruyabilmiştir. Koşullandırma işlemi SPADE üretecinin birkaç katmanında gerçekleştirildiği için semantik yönlendirme, hem üst düzey yapısal yeniden yapılandırmayı hem de alt düzey doku sentezini etkileyebilmiştir. Sonuç olarak, oluşturulan artistik desenler, segmentasyon aşamasında bulunan kültürel motif yapılarını korurken WikiArt veri setinden elde edilen stilistik özellikleri bünyesinde toplamıştır.

Sanatsal stillerin anlaşılması için ana kaynak olarak; Rönesans, İzlenimcilik, Kübizm, Ekspresyonizm, Sürrealizm, Realizm ve Soyut Sanat gibi 27 farklı sanatsal kategoriden eserler içeren WikiArt veri seti kullanılmıştır. Modelin çeşitli yaratıcı özelliklere maruz kalmasını sağlamak ve stil genellemesini geliştirmek amacıyla, eğitim sırasında çeşitli kategorilerden rastgele stil görüntüleri seçilmiştir. Stil yanlılığını azaltmak için veri seti; eğitim, doğrulama ve test alt kümelerine, sanatsal kategorilerin dengeli bir temsiline sahip olacak şekilde bölünmüştür. Tüm 27 sanatsal kategorinin dengeli temsilini sağlamak için tabakalı örnekleme yöntemi kullanılmıştır. Her kategorideki örnekler, orijinal sınıf dağılımı korunarak eğitim, doğrulama ve test alt kümelerine orantılı olarak dağıtılmıştır. WikiArt görüntülerinden türetilen stil yönleri ile CycleGAN tarafından üretilen yeniden yapılandırma özelliklerini birleştirmek için CAFFM modülü kullanılmıştır. Sentez ağının, segmentasyon haritalarından türetilen semantik yapıyı ve kültürel motif sınırlarını korurken sanatsal nitelikleri aktarabilmesini sağlamak amacıyla, ortaya çıkan birleştirilmiş temsiller SPADE üretecine koşullandırma bilgisi olarak sunulmuştur. Bu stil koşullandırma tekniği sayesinde önerilen çerçeve, tutarlı yapısal ve stilistik temsillerle kültürel açıdan otantik sanatsal desenler üretebilmiştir.

SPADE ayrıca segmentasyon haritasına bağlı olarak mekansal olarak uyarlamalı parametreler sunar. Parametreler Denklem 191'de gösterildiği gibi tanımlanabilir:

Lineer dönüşüm denklemi: y=γ(S)x̂+β(S) (Eq. 19), matematiksel gösterim.

Burada, γ(S) mekansal olarak değişen ölçek parametresi ve β(S) mekansal olarak değişen sapma parametresidir. Parametreler, üreticinin görüntülerdeki semantik bölgeye bağlı olarak farklı dokular ve stiller oluşturmasına yardımcı olabilir. Nihai kültürel sanat eseri, Denklem 20'de gösterildiği gibi tanımlanabilir:

 Genetik değerlendirme süreci için formül I_gen=G_E(X^P_r,SM).

Burada, GE SPADE üretecini, XrP yeniden yapılandırılmış deseni ve SM segmentasyon haritasını temsil eder. Nihai sanat eseri, sanatsal görünümü geliştirirken kültürel motiflerin yapısal bütünlüğünü korur. Önerilen SegCycle-SPADE mimarisini optimize etmek için semantik segmentasyon doğruluğu, kültürel motif koruması, desen yeniden yapılandırma kalitesi ve sanatsal stil tutarlılığını dengeleyen bileşik bir kayıp fonksiyonu kullanılmıştır. Genel eğitim amacını belirlemek için segmentasyon kaybı (Lseg), karşıt kayıp (Ladv), döngü tutarlılığı kaybı (Lcycle), yeniden yapılandırma kaybı (Lrecon), motif koruma kaybı (Lmotif) ve stil tutarlılığı kaybının (Lstyle) ağırlıklı bir karışımı kullanılmıştır. Toplam kayıp fonksiyonu Denklem 21'de tanımlanmıştır:

Toplam kayıp formülü, L_Total, analiz için matematiksel bir denklem olarak gösterilen birden fazla bileşene eşittir.  (21)

Giriş ve yeniden yapılandırılan kültürel motifler arasında yapısal tutarlılığı garanti etmek için döngü tutarlılığı kaybı katsayısı 10 olarak belirlenmiştir. İnce taneli motif özelliklerini korumak ve görsel doğruluğu artırmak için yeniden yapılandırma kaybı katsayısı 5 olarak ayarlanmıştır. Sanatsal sentez sırasında kültürel açıdan temel yapısal modellerin korunmasını vurgulamak için motif koruma kaybı için 2 katsayısı kullanılmıştır. Semantik motif yapılarını aşırı derecede bozmadan sanatsal stil transferini teşvik etmek amacıyla stil tutarlılığı kaybı katsayısı 1'e ayarlanmıştır. Gerçekçi görüntü üretimi ile hassas motif segmentasyonu arasında dengeli bir katkı sağlamak için segmentasyon ve adversariyal kayıplara eşit ağırlıklar verilmiştir. Stil tutarlılığı kaybını hesaplamak için WikiArt veri setinin özellik tabanlı stil temsilleri kullanılmıştır. Özellikle, sanatsal stil özellikleri, derin özellik haritalarından alınan Gram matrisi korelasyonları kullanılarak yakalanmıştır. Stil kaybını hesaplamak için, Denklem 22'de gösterildiği gibi, hedef stil görüntüsü ile üretilen görüntünün Gram matrisleri arasındaki Frobenius norm farkı kullanılmıştır:

Sinir ağlarında stil kaybı için kalkülüs denklemi, L_style formülünü ve yöntem betimlemesini göstermektedir.

Burada, GLütfen çevirmemi istediğiniz kaynak metni sağlayın. Gram matrisi, şuradan hesaplanmış mıdır: Sadece bir harf ("l") gönderdiğiniz için çevrilecek bir metin bulunmamaktadır. Lütfen çevirmemi istediğiniz İngilizce kaynak metni paylaşın.Lütfen çevrilmesini istediğiniz metni sağlayın. Profesyonel akademik standartlarda, bilimsel terminolojiye uygun şekilde İngilizce'den Türkçe'ye çevirisini gerçekleştireceğim. özellik katmanı, BenLütfen çevirmemi istediğiniz İngilizce metni paylaşın. oluşturulan sanatsal görüntüyü ifade eder, Istil WikiArt veri setinden alınan hedef stil görüntüsünü ifade eder ve F Frobenius normunu ifade eder. Bu formülasyon, önerilen çerçevenin kültürel motiflerin yapısal ve anlamsal bütünlüğünü korurken sanatsal özellikleri muhafaza etmesini sağlar.

CAFFM modülü tarafından üretilen birleştirilmiş özellik temsilleri, önerilen çerçevenin sanatsal sentez bileşeni olarak görev yapan SPADE modülüne koşullandırma girdileri olarak kullanılır. SPADE üreteci, 256 kanallık gizli özellik boyutuna sahip yedi SPADE rezidüel bloğundan oluşur ve 256 × 256 piksel çözünürlüğünde çıktı görüntüleri üretir. SegFormer–CAFFM modülünden elde edilen semantik segmentasyon haritaları, SPADE rezidüel katmanları boyunca koşullandırma girdileri olarak kullanılır. SPADE katmanları, her bir rezidüel blok içindeki aktivasyon fonksiyonlarından önce uygulanarak segmentasyon kılavuzlu semantik koşullandırmayı sağlar. Ardışık yukarı örnekleme ve evrişim işlemleri aracılığıyla, semantik tutarlılığı ve motif yapısını korurken yüksek çözünürlüklü sanatsal desenler oluşturmak için gizli özellik temsili kademeli olarak rafine edilir. Üreteci boyunca LeakyReLU aktivasyon fonksiyonları kullanılır ve normalize edilmiş görüntüler üretmek için çıktı katmanında bir Tanh aktivasyon fonksiyonu uygulanır.

Algoritma ve İş Akışı
SegCycle-SPADE çerçevesi; semantik segmentasyon, özellik füzyonu, desen yeniden yapılandırma ve sanatsal stil sentezini birleşik bir eğitim hattı içerisinde entegre eder. İş akışı; görüntü boyutlandırma, normalizasyon, gürültü giderme ve segmentasyon maskesi hazırlama dahil olmak üzere veri seti edinimi ve ön işleme ile başlar. Ön işlemden geçmiş görüntüler, daha sonra semantik motif temsillerini çıkarmak için SegFormer-B2 segmentasyon ağı kullanılarak işlenir. Elde edilen segmentasyon özellikleri, yapısal motif bilgisi ile sanatsal özellik temsilleri arasında etkileşime olanak tanıyan CAFFM aracılığıyla yeniden yapılandırma özellikleriyle birleştirilir. Birleştirilmiş özellik haritaları daha sonra, semantik tutarlılığı korurken eksik kültürel motif yapılarını onaran CycleGAN yeniden yapılandırma modülüne aktarılır. Yeniden yapılandırılan desenler, motif sınırlarını ve yapısal özgünlüğü korurken stilistik iyileştirme sağlamak amacıyla, segmentasyon güdümlü sanatsal sentez için SPADE üretecine sunulur. Eğitim sırasında, model parametreleri; segmentasyon doğruluğu, motif koruma, yeniden yapılandırma kalitesi ve sanatsal stil tutarlılığını dengeleyen Denklem 21 ve 22'de açıklanan bileşik kayıp fonksiyonu kullanılarak optimize edilir. Veri seti yükleme, ön işleme, model başlatma, eğitim iterasyonları, doğrulama prosedürleri, kontrol noktası seçimi ve final değerlendirmesini içeren ayrıntılı, adım adım uygulama iş akışı Ek Dosya 1 (Algoritma 1)'de sunulmuştur. Tüm algoritmik iş akışı; 16'lık bir batch size, 0.0002 öğrenme hızı ve 100 eğitim epoch'u kullanılarak uygulanmıştır. Veri seti bölümlendirme, model başlatma ve tüm eğitim deneyleri için 42 sabit rastgele tohumu (random seed) kullanılmıştır. Yeniden üretilebilirliği sağlamak için bu tohum; Python, NumPy ve PyTorch rastgele sayı üreteçlerine tutarlı bir şekilde uygulanmıştır. Adam optimize edici β₁ = 0.5, β₂ = 0.999 ve ağırlık azalması olmaksızın (weight decay = 0) yapılandırılmıştır. Model kontrol noktaları, doğrulama veri setinde elde edilen en yüksek doğrulama IoU skoruna göre seçilmiştir.

Kayıp Fonksiyonu Optimizasyonu
Yeniden yapılandırma ve sanatsal sentez sırasında kültürel motif yapılarını korumak için, önerilen çerçeve; segmentasyon, adversariyal, döngüsel tutarlılık, yeniden yapılandırma, motif koruma ve stil tutarlılığı kayıplarını birleştiren bileşik bir optimizasyon hedefi kullanır. Tam matematiksel formülasyon, ağırlıklandırma katsayıları ve stil kaybı tanımı, SPADE kullanarak Sanatsal Stil Üretimi alt bölümündeki Denklemler 21 ve 22'de sunulmuştur. Motif koruma bileşeni, tahmin edilen motif bölgeleri ile karşılık gelen gerçek segmentasyon maskeleri arasındaki yapısal sapmaları cezalandırarak, yeniden yapılandırma süreci boyunca kültürel açıdan anlamlı desen yapılarının korunmasını teşvik eder.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen SegCycle-SPADE çerçevesi, Miao Batik kültürel motif veri seti ve WikiArt veri seti olmak üzere iki veri seti kullanılarak değerlendirilmiştir. Miao Batik veri seti, geleneksel kültürel miras görüntülerini içermekte olup öncelikle semantik segmentasyon ve yapısal yeniden yapılandırma görevleri için kullanılmıştır; WikiArt veri seti ise çeşitli sanatsal stiller içermekte olup sanatsal stil öğrenimi ve üretimi için kullanılmıştır. Her iki veri setinden alınan görüntüler; semantik segmentasyon, CAFFM, desen yeniden yapılandırması ve SPADE tabanlı sanatsal stil üretimi dahil olmak üzere tüm SegCycle-SPADE işlem hattından geçirilmiştir. Kültürel motif bilgilerinin ve sanatsal stil temsillerinin entegrasyonu, çerçevenin kültürel açıdan anlamlı ve görsel olarak tutarlı çıktılar üretmesini sağlamıştır.

Tüm deneyler, Intel Core i7 işlemci ve NVIDIA GPU ile donatılmış GPU destekli bir iş istasyonunda yürütülmüştür. Spesifik olarak deneyler, Intel Core i7 (11. Nesil) CPU, 24 GB VRAM'e sahip NVIDIA RTX 3090 GPU ve 32 GB sistem belleği ile donatılmış bir iş istasyonunda gerçekleştirilmiştir. Modeller, Python 3.8 ve CUDA hızlandırmalı PyTorch 1.10 kullanılarak uygulanmıştır. Eğitim, dağıtık eğitim olmadan tek bir GPU kurulumu kullanılarak gerçekleştirilmiştir. Tüm deneyler boyunca standart FP32 hassasiyeti kullanılmış ve karma hassasiyetli eğitim uygulanmamıştır. Adam optimizasyon yöntemi, 16'lık bir grup boyutuyla (batch size) 100 eğitim epoku boyunca kullanılmıştır. Tablo 3, bu çalışmada kullanılan uygulama parametrelerini ve hesaplama ortamını özetlemektedir.

Önerilen mimari dört ana bileşenden oluşmaktadır: semantik segmentasyon için SegFormer-B2, özellik füzyonu için CAFFM, motif rekonstrüksiyonu için CycleGAN ve sanatsal stil sentezi için SPADE. Her iki veri setinden alınan görüntüler, eğitim öncesinde 256 × 256 piksel boyutuna yeniden boyutlandırılmıştır. Bu standart çözünürlük, önemli motif detaylarını korurken hesaplama verimliliğini sağlamış ve hem CycleGAN hem de SPADE modüllerinin stabil adversariyal eğitimine katkıda bulunmuştur.

Önerilen çerçevenin performansı; Segmentasyon Doğruluğu, IoU, Dice Benzerlik Katsayısı (Dice), SSIM, PSNR ve FID dahil olmak üzere segmentasyon ve görüntü kalitesi değerlendirme metrikleri kullanılarak değerlendirilmiştir. Görsel özgünlük, üretilen kültürel desenlerin görsel incelemesi yoluyla nitel olarak değerlendirilmiştir. Nitel değerlendirme; referans kültürel motiflere kıyasla motif korunumu, anlamsal tutarlılık, kültürel özellikler ve sanatsal görünüme odaklanmıştır. Görsel özgünlük, bağımsız bir nicel değerlendirme metriği olarak kullanılmamıştır.

Önerilen çerçevenin nicel değerlendirmesi aşağıdaki metrikler kullanılarak gerçekleştirilmiştir.

Segmentasyon Doğruluğu, Denklem 23 kullanılarak hesaplanmıştır:

Doğruluk formülü, TP+TN/TP+TN+FP+FN, model değerlendirmesi için istatistiksel analiz denklemi.

Burada TP, TN, FP ve FN sırasıyla doğru pozitifleri, doğru negatifleri, yanlış pozitifleri ve yanlış negatifleri ifade etmektedir.

IoU, Denklem 24 kullanılarak hesaplanmıştır:

 IoU formülü, TP/(TP+FP+FN), görüntü segmentasyonu doğruluğu için matematiksel denklem.

Dice Benzerlik Katsayısı (Dice), Denklem 25 kullanılarak hesaplanmıştır:

Veri analizi değerlendirmesinde kullanılan Dice katsayısı denklemi, \( \frac{2*TP}{2*TP+FP+FN} \), formülü.

Algısal görüntü benzerliğini değerlendirmek için SSIM kullanılmış olup Denklem 2633 ile tanımlanmıştır:

SSIM indeksi denklemi; görüntü kalitesi değerlendirmesi için matematiksel formül; diyagram.  (26)

Burada μ ortalama şiddeti, σ varyansı, σxy görüntüler arasındaki kovaryansı ve C1 ile C2 ise stabilize edici sabitleri ifade eder.

PSNR, oluşturulan görüntülerin kalitesini değerlendirmek için yaygın olarak kullanılan bir metriktir ve Denklem 27'de33 tanımlanmıştır:

PSNR formülü, görüntü kalitesi değerlendirmesi, tepe sinyal-gürültü oranı hesaplama denklemi.

Burada, MaxI görüntünün mümkün olan maksimum piksel değerini ve MSE orijinal görüntü ile yeniden oluşturulan görüntü arasındaki ortalama kare hata değerini ifade eder.

FID, Denklem 2833'de olduğu gibi ortalamalar ve kovaryans matrisleri kullanılarak hesaplanabilir:

Fréchet Inception Distance (FID) denklemi; istatistiksel yöntem; görüntü kalite değerlendirme formülü.   (28)

Burada, μr gerçek görüntünün ortalama değerini, μg üretilen görüntünün ortalama değerini, Σr ve Σg ise sırasıyla gerçek ve üretilen görüntülerin kovaryans matrisini temsil eder.

Performans karşılaştırması için, önerilen çerçeve; semantik segmentasyon, görüntü yeniden yapılandırma ve artistik görüntü oluşturma için yaygın olarak kullanılan temsilci yöntemlere karşı değerlendirilmiştir. Segmentasyon temel çizgileri olarak U-Net ve DeepLabV3+ dahil edilirken, yeniden yapılandırma temel çizgileri olarak Pix2Pix ve CycleGAN dahil edilmiştir. Temsilci artistik görüntü oluşturma yöntemleri olarak StyleGAN ve AttentionGAN kullanılmıştır. Bu karşılaştırmalar, SegCycle-SPADE'in yapısal motif bilgisini korurken aynı zamanda artistik kaliteyi artırmadaki etkinliğini değerlendirmek amacıyla gerçekleştirilmiştir.

Performans kararlılığını ve tekrarlanabilirliğini değerlendirmek için her deney beş kez tekrarlanmıştır. Tüm deneylerde tutarlı eğitim, doğrulama ve test alt kümeleri sağlamak amacıyla, veri seti bölümleme işlemi için 42 sabit rastgele tohumu kullanılmıştır. Sonuçlar ortalama ± standart sapma olarak raporlanmıştır. Accuracy, IoU, Dice, SSIM, PSNR ve FID değerlerinde gözlenen düşük standart sapma değerleri, önerilen çerçevenin tekrarlanan deneysel çalışmalar boyunca kararlı bir performans sergilediğini göstermektedir. İstatistiksel anlamlılık, eşleştirilmiş t-testleri kullanılarak değerlendirilmiş ve p < 0.05 olduğunda farklar istatistiksel olarak anlamlı kabul edilmiştir. Tüm modeller aynı veri seti bölümleri üzerinde değerlendirildiği için, tekrarlanan çalışmalar arasında eşleştirilmiş performans ölçümleri elde edilmiş ve bu durum eşleştirilmiş t-testlerinin kullanımını haklı çıkarmıştır. Çoklu ikili karşılaştırmalarla ilişkili aile bazlı hata oranını kontrol etmek için Bonferroni düzeltmesi uygulanmış ve istatistiksel anlamlılık, n'nin ikili karşılaştırma sayısını temsil ettiği α/n şeklinde ayarlanmış bir eşik değeri kullanılarak belirlenmiştir.

Deneysel bulgular, önerilen SegCycle-SPADE çerçevesinin etkinliğini güçlü bir şekilde desteklemektedir. SegFormer-B2 tarafından elde edilen üstün segmentasyon performansı, kültürel açıdan önemli motif sınırlarını doğru bir şekilde tanımlama ve koruma yeteneğini kanıtlamaktadır. IoU ve Dice skorlarındaki iyileşmeler, işlem hattı boyunca semantik motif yapılarının etkili bir şekilde korunduğunu göstermektedir. CycleGAN ve SPADE entegrasyonu, iyileşen SSIM ve PSNR değerlerinin de yansıttığı üzere, ince detaylı görsel ayrıntıları korurken eksik motif yapılarını başarıyla yeniden oluşturmuştur. Ayrıca, daha düşük FID skorları, oluşturulan sanatsal desenlerin otantik kültürel ve sanatsal görüntülerle daha yüksek benzerlik sergilediğini belirterek, gelişmiş stilistik tutarlılığa ve görsel gerçekçiliğe işaret etmektedir.

CAFFM, segmentasyon kaynaklı yapısal bilgiler ile üretken stil temsilleri arasında etkili bir etkileşim sağlayarak bu iyileştirmelere önemli katkılarda bulunmuştur. Çapraz dikkat tabanlı özellik füzyonu aracılığıyla CAFFM, kültürel motifler arasındaki uzun menzilli ilişkileri korurken hem yapısal sadakati hem de sanatsal özgünlüğü artırmıştır.

Şekil 6, önerilen SegCycle-SPADE çerçevesi ile mevcut yöntemlerin Miao Batik ve WikiArt veri setleri üzerindeki segmentasyon doğruluk karşılaştırmasını sunmaktadır. U-Net ve DeepLabV3+ gibi geleneksel segmentasyon yaklaşımları, uzamsal temsilleri öğrenme yetenekleri sayesinde rekabetçi bir performans sergilemiştir. Bununla birlikte, Pix2Pix ve CycleGAN, özellikle segmentasyon görevleri için tasarlanmadıkları için daha düşük segmentasyon doğruluğu göstermiştir. Önerilen SegCycle-SPADE çerçevesi, SegFormer-B2 ve CAFFM tabanlı özellik iyileştirmesinin entegrasyonu sayesinde her iki veri setinde de en yüksek segmentasyon doğruluğuna ulaşmıştır.

Segmentasyon doğruluğu grafiği; U-Net, DeepLabV3+, Pix2Pix, CycleGAN, SegCycle-SPADE yöntemlerinin karşılaştırılması.
Şekil 6. Farklı Yöntemler Arasındaki Segmentasyon Doğruluğunun Karşılaştırılması. Miao Batik ve WikiArt veri setleri üzerinde U-Net, DeepLabV3+, Pix2Pix, CycleGAN ve önerilen SegCycle-SPADE çerçevesi kullanılarak elde edilen segmentasyon doğruluğunun karşılaştırılması. Sonuçlar, beş bağımsız çalışmadan (n = 5) elde edilen ortalama ± standart sapma (SD) olarak sunulmuştur. Hata çubukları bir standart sapmayı temsil etmektedir. Daha yüksek değerler, gelişmiş segmentasyon performansını göstermektedir. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek segmentasyon doğruluğuna ulaşmıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 7, değerlendirilen yöntemler arasındaki IoU karşılaştırmasını sunmaktadır. U-Net ve DeepLabV3+, segmentasyon odaklı mimarileri sayesinde güçlü örtüşme performansı sergilemiştir. Buna karşın, Pix2Pix ve CycleGAN, temel amaçları semantik segmentasyondan ziyade görüntü çevirisi olduğu için daha düşük IoU değerleri üretmiştir. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek IoU değerlerine ulaşarak kültürel motif bölgelerinin lokalizasyonunun ve korunmasının iyileştiğini göstermiştir.

IoU skor karşılaştırması, sütun grafiği; Segmentasyon yöntemleri ile Miao Batik, WikiArt veri setleri; Ortalama ± SD.
Şekil 7. Kültürel Motif Segmentasyonu için Birleşme Üzerinden Kesişim (IoU) Skorlarının Karşılaştırılması. Miao Batik ve WikiArt veri setleri üzerinde segmentasyon yöntemlerinin IoU performanslarının karşılaştırılması. Sonuçlar, beş bağımsız çalıştırmadan (n = 5) elde edilen ortalama ± standart sapma (SD) olarak sunulmuştur. Hata çubukları bir standart sapmayı belirtmektedir. Daha yüksek IoU değerleri, tahmin edilen ve referans motif bölgeleri arasında daha iyi bir örtüşmeyi ve motif sınırlarının daha iyi korunduğunu göstermektedir. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek IoU skorlarını elde etmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 8, Dice Benzerlik Katsayısı karşılaştırmasını sunmaktadır. Dice, tahmin edilen segmentasyon maskeleri ile temel gerçeklik (ground-truth) motif bölgeleri arasındaki örtüşmeyi ölçer. Geleneksel segmentasyon yaklaşımları, uzamsal yapıları öğrenmedeki etkinlikleri nedeniyle nispeten yüksek Dice skorları elde etmiştir. Bununla birlikte, önerilen SegCycle-SPADE çerçevesi her iki veri setinde de en yüksek Dice skorlarına ulaşarak iyileştirilmiş segmentasyon tutarlılığı ve motif koruması sergilemiştir.

Motif segmentasyonu için Dice katsayısı grafiği; yöntemler: U-Net, DeepLabV3+, Pix2Pix, CycleGAN.
Şekil 8. Kültürel Motif Segmentasyonu için Dice Katsayısının Karşılaştırılması. Miao Batik ve WikiArt veri setlerinde farklı segmentasyon yaklaşımları kullanılarak elde edilen Dice katsayısı değerlerinin karşılaştırılması. Dice katsayısı, tahmin edilen segmentasyon maskeleri ile referans maskeler arasındaki örtüşmeyi değerlendirir; yüksek değerler, geliştirilmiş segmentasyon performansını ve motif bölgesi tanımlama başarısını gösterir. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek Dice katsayısı değerlerine ulaşmıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 9, yeniden oluşturulan kültürel desenler arasındaki SSIM karşılaştırmasını sunmaktadır. Pix2Pix, CycleGAN ve StyleGAN gibi GAN tabanlı yöntemler, görüntü oluşturma amacıyla tasarlandıkları için geleneksel segmentasyon yöntemlerinden daha yüksek SSIM değerleri elde etmiştir. Buna rağmen, önerilen SegCycle-SPADE çerçevesi her iki veri setinde de en yüksek SSIM değerlerine ulaşmış; bu durum, yapısal detayların ve sanatsal tutarlılığın üstün düzeyde korunduğunu göstermiştir.Yapısal benzerlik karşılaştırma sütun grafiği; veri setleri üzerinde Pix2Pix, CycleGAN vb. için SSIM skorları.

Şekil 9. Yapısal Benzerlik İndeksinin (SSIM) Karşılaştırılması. Miao Batik ve WikiArt veri kümeleri üzerinde farklı yeniden yapılandırma yöntemleri kullanılarak elde edilen Yapısal Benzerlik İndeksi (SSIM) değerlerinin karşılaştırılması. Sonuçlar, beş bağımsız çalışmadan (n = 5) elde edilen ortalama ± standart sapma (SD) olarak sunulmuştur. Hata çubukları bir standart sapmayı göstermektedir. Daha yüksek SSIM değerleri, yeniden yapılandırılan ve referans desenler arasında daha fazla yapısal benzerlik olduğunu gösterir. Önerilen SegCycle-SPADE çerçevesi, her iki veri kümesinde de en yüksek SSIM skorlarını elde etmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Üretilen sanatsal desenlerin gerçekçiliği ve dağılımsal benzerliği değerlendirmek için FID kullanılmıştır. FID hesaplaması, pool3 katmanından öznitelik vektörlerinin çıkarılmasıyla 2048 boyutlu öznitelik temsilleri elde edilerek, önceden eğitilmiş bir Inception-v3 ağı kullanılarak gerçekleştirilmiştir. Öznitelik çıkarımı öncesinde, üretilen ve referans görüntüler bilinear interpolasyon kullanılarak 299 × 299 piksele yeniden boyutlandırılmış ve standart Inception-v3 ön işleme protokolüne göre normalize edilmiştir. FID, bağımsız test veri setinden çıkarılan öznitelik dağılımları kullanılarak hesaplanmıştır. Ortalama ve kovaryans istatistikleri öznitelik gömmelerinden tahmin edilmiş ve standart FID formülasyonu dahilinde kullanılmıştır.

Tablo 4'te gösterildiği üzere, Pix2Pix ve CycleGAN gibi geleneksel görüntü oluşturma yaklaşımları, açık yapısal rehberlikten yoksun oldukları için nispeten yüksek FID skorları üretmiştir. StyleGAN ve AttentionGAN, geliştirilmiş özellik öğrenme yetenekleri sayesinde daha düşük FID skorları elde etmiştir. Ancak, önerilen SegCycle-SPADE çerçevesi her iki veri setinde de en düşük FID skorlarını elde ederek üstün görüntü gerçekçiliği, stilistik tutarlılık ve kültürel motif koruması sergilemiştir.

YöntemMiao Batik Veri Seti (FID)WikiArt Veri Seti (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (Önerilen)28.531.2

Tablo 4: Kültürel Desen Rekonstrüksiyonu için Frechet Inception Distance (FID) Sonuçları. Önerilen SegCycle-SPADE çerçevesi ve temel üretici modeller tarafından Miao Batik ve WikiArt veri setlerinde elde edilen Frechet Inception Distance (FID) skorlarının karşılaştırılması. Daha düşük FID değerleri, üretilen ve gerçek görüntü özellik dağılımları arasındaki benzerliğin daha fazla olduğunu gösterir ve dolayısıyla rekonstrükte edilen kültürel desenlerin görsel gerçekçiliğinin arttığını yansıtır.

Şekil 10, farklı yöntemlerle elde edilen yeniden yapılandırma kalitesini karşılaştırmaktadır. Yeniden Yapılandırma Kalitesi (%), yeniden yapılandırılan görüntü ile karşılık gelen referans görüntü arasındaki SSIM'in yüzde ölçeğine dönüştürülmesiyle (SSIM × 100) hesaplanmıştır. Daha yüksek yüzdeler, orijinal kültürel motife karşı daha yüksek yapısal sadakat ve görsel benzerliği ifade eder. Pix2Pix ve CycleGAN gibi geleneksel üretici modeller orta düzeyde yeniden yapılandırma performansı göstermiştir. StyleGAN ve AttentionGAN dahil olmak üzere daha gelişmiş mimariler, geliştirilmiş özellik öğrenme yetenekleri sayesinde daha iyi yeniden yapılandırma kalitesi elde etmiştir. Bununla birlikte, önerilen SegCycle-SPADE çerçevesi; semantik segmentasyon kılavuzluğu, çapraz dikkat özellik füzyonu, yeniden yapılandırma öğrenimi ve sanatsal sentezin entegrasyonu sayesinde en yüksek yeniden yapılandırma kalitesine ulaşmıştır.

Yeniden yapılandırma kalitesi karşılaştırma grafiği; yöntemler: Pix2Pix, CycleGAN, StyleGAN, AttentionGAN, SegCycle-SPADE.
Şekil 10. Desen Yeniden Yapılandırma Kalitesinin Karşılaştırılması. Miao Batik ve WikiArt veri setlerinde Pix2Pix, CycleGAN, StyleGAN, AttentionGAN ve önerilen SegCycle-SPADE çerçevesi kullanılarak elde edilen yeniden yapılandırma kalitesinin karşılaştırılması. Sonuçlar, beş bağımsız çalışmadan (n = 5) elde edilen ortalama ± standart sapma (SD) olarak sunulmuştur. Hata çubukları bir standart sapmayı göstermektedir. Daha yüksek değerler; yapısal detayların, anlamsal tutarlılığın ve görsel sadakatin daha iyi korunduğunu gösterir. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek yeniden yapılandırma kalitesi puanlarını elde etmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Yeniden yapılandırılmış görüntüler ile ilgili referans görüntüler arasındaki piksel düzeyindeki benzerliği ölçerek yeniden yapılandırma sadakatini değerlendirmek için PSNR kullanılmıştır. PSNR, her bir yeniden yapılandırılmış görüntü ile temel gerçeklik referansı olarak kullanılan ilgili orijinal Miao Batik görüntüsü arasında hesaplanmıştır. Daha yüksek PSNR değerleri, daha düşük yeniden yapılandırma hatasını gösterir. Tablo 5'te gösterildiği üzere, Pix2Pix ve CycleGAN, açık yapısal rehberlik olmadan desenleri yeniden yapılandırdıkları için orta düzeyde PSNR değerleri elde etmiştir. StyleGAN ve AttentionGAN, daha derin özellik öğrenimi yoluyla daha yüksek PSNR değerlerine ulaşmıştır. Önerilen SegCycle-SPADE çerçevesi, her iki veri setinde de en yüksek PSNR değerlerini elde ederek üstün yeniden yapılandırma sadakati ve kültürel motif yapılarının korunmasını sergilemiştir.

YöntemMiao Batik Veri Seti
(PSNR, dB)
WikiArt Veri Seti
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (Önerilen)32.431.2

Tablo 5: Kültürel Desen Rekonstrüksiyonu için Tepe Sinyal-Gürültü Oranı (PSNR) Sonuçları. Miao Batik ve WikiArt veri kümeleri üzerinde önerilen SegCycle-SPADE çerçevesi ve temel yöntemler tarafından elde edilen Tepe Sinyal-Gürültü Oranı (PSNR) değerlerinin karşılaştırılması. Daha yüksek PSNR değerleri, ilgili referans görüntülere kıyasla iyileştirilmiş rekonstrüksiyon sadakatini ve azalmış distorsiyonu göstermektedir.

Şekil 11 önerilen SegCycle-SPADE çerçevesinin eğitim sırasındaki yakınsama davranışını göstermektedir. Kayıp eğrileri, beş bağımsız eğitim çalışması üzerinden ortalaması alınan ortalama eğitim kayıplarını temsil etmektedir. Stokastik değişkenliği azaltmak ve eğitim yakınsamasının daha sağlam bir temsilini sunmak için, kayıp değerleri her bir epoch için tüm çalışmalar genelinde ortalanmıştır. Eğitimin ilk epoch'larında, model girdi verilerinden öznitelik temsillerini henüz öğrenme aşamasında olduğu için kayıp değerleri nispeten yüksekti. Eğitim ilerledikçe, tüm kayıp bileşenleri kademeli olarak azalmış ve stabilize olmuştur; bu durum segmentasyon, yeniden yapılandırma ve sanatsal sentez hedeflerinin başarıyla optimize edildiğini göstermektedir. Gözlemlenen yakınsama davranışı, önerilen çerçevenin eğitim sırasındaki etkinliğini, stabilitesini ve tekrarlanabilirliğini kanıtlamaktadır.

Eğitim yakınsama grafiği, SegCycle-SPADE çerçevesi. Kayıp değerine karşı epoklar; L_total, L_seg, L_G, L_D.
Şekil 11. Önerilen SegCycle-SPADE Çerçevesinin Eğitim Yakınsaması. Önerilen SegCycle-SPADE çerçevesinin 100 eğitim epoku boyunca, beş bağımsız eğitim çalışmasının ortalaması üzerinden (n = 5) eğitim-kayıp eğrileri. Şekil; toplam kaybın (LTotal), segmentasyon kaybının (LSeg), jeneratör kaybının (LG) ve diskriminatör kaybının (LD) eğitim sırasındaki gelişimini göstermektedir. Tüm kayıp bileşenlerinin kademeli olarak azalması ve ardından stabilize olması, önerilen çerçevenin başarılı bir şekilde yakınsadığını ve stabil bir optimizasyon gerçekleştiğini göstermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Ablasyon Çalışması
Önerilen SegCycle-SPADE çerçevesindeki her bir bileşenin katkısını değerlendirmek için, birden fazla kontrollü model konfigürasyonu kullanılarak bir ablasyon çalışması yürütülmüştür. Sonuçlar Tablo 6 ve 7'de özetlenmiştir.

Model YapılandırmasıSegmentasyon Doğruluğu (%)IoU (Intersection over Union - Kesişim bölü Birleşim)Yapısal Benzerlik İndeksi
Yalnızca SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (Önerilen)93.80.860.93

Tablo 6: SegCycle-SPADE Bileşenlerinin Ablasyon Çalışması. Bireysel çerçeve bileşenlerinin katkısını değerlendirmek için kademeli olarak geliştirilmiş model konfigürasyonlarının performans karşılaştırması. Çalışma; semantik segmentasyonun, Çapraz Dikkat Kültürel Özellik Füzyon Modülünün (CAFFM), CycleGAN tabanlı yeniden yapılandırmanın ve SPADE tabanlı sanatsal sentezin segmentasyon doğruluğu, Kesişim üzerinden Birlik (IoU) ve Yapısal Benzerlik İndeksi (SSIM) üzerindeki etkilerini incelemektedir. Daha yüksek değerler, iyileştirilmiş motif segmentasyonunu, yeniden yapılandırma kalitesini ve yapısal korunumu göstermektedir.

VaryantIoU (%)Dice (%)SSIMPSNR (dB)FID ↓
Yalnızca SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (Tam Model)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Tablo 7: Önerilen SegCycle-SPADE Çerçevesinin Bileşen Katkı Analizi. CAFFM, CycleGAN, SPADE ve tam SegCycle-SPADE mimarisinin katkısını değerlendirmek için kullanılan bireysel çerçeve varyantlarının performans karşılaştırması. Sonuçlar; Kesişim üzerinden Birleşim (IoU), Dice katsayısı, Yapısal Benzerlik İndeksi (SSIM), Tepe Sinyal-Gürültü Oranı (PSNR) ve Frechet Inception Uzaklığı (FID) kullanılarak bildirilmiştir. Daha yüksek IoU, Dice, SSIM ve PSNR değerleri, gelişmiş segmentasyon ve yeniden yapılandırma kalitesini gösterirken, daha düşük FID değerleri üretilen kültürel desenlerin daha yüksek görsel gerçekçiliğe sahip olduğunu gösterir.

Tablo 6; (i) sadece SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN ve (iv) SegFormer + CAFFM + CycleGAN + SPADE (önerilen çerçeve) olmak üzere dört konfigürasyonu kullanarak temel çerçeve bileşenlerinin kümülatif katkısını değerlendirmektedir. Temel SegFormer modeli %87,3 segmentasyon doğruluğu, 0,76 IoU skoru ve 0,82 SSIM değeri elde etmiştir. CAFFM modülünün dahil edilmesi, tüm değerlendirme metriklerinde performansı artırarak segmentasyon doğruluğunu %89,6'ya, IoU'yu 0,79'a ve SSIM'yi 0,86'ya çıkarmıştır. CycleGAN'ın eklenmesi yapısal yeniden yapılandırma kabiliyetini daha da geliştirmiş ve 0,82 IoU ile 0,89 SSIM değeri ile sonuçlanmıştır. Tam SegCycle-SPADE çerçevesi; %93,8 segmentasyon doğruluğu, 0,86 IoU ve 0,93 SSIM değeri ile en iyi genel performansı sergilemiştir. Bu sonuçlar, her bir bileşenin segmentasyon doğruluğunun artmasına, yapısal korumaya ve görüntü yeniden yapılandırma kalitesine kademeli olarak katkıda bulunduğunu göstermektedir.

Tablo 7, beş model varyantı kullanarak bireysel çerçeve bileşenlerinin katkısını daha ayrıntılı olarak incelemektedir: (i) Yalnızca SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM ve (v) SegFormer, CAFFM, CycleGAN, SPADE ve motif koruma kaybını içeren tam model. Performans; IoU, Dice katsayısı, SSIM, PSNR ve FID metrikleri kullanılarak değerlendirilmiştir.

Temel SegFormer tabanlı konfigürasyon %84,2 IoU, %88,5 Dice katsayısı, 0,82 SSIM değeri, 24,8 dB PSNR ve 31,8 FID skoru elde etmiştir. CycleGAN eklenmesi rekonstrüksiyon kalitesini artırmış ve FID skorunu 27,5'e düşürerek görüntü gerçekçiliğinin iyileştiğini göstermiştir. SPADE'in dahil edilmesi yapısal benzerliği ve görüntü kalitesini daha da artırarak 0,88 SSIM değeri ve 23,4 FID skoru ile sonuçlanmıştır. Önerilen CAFFM modülünün eklenmesi tüm metriklerde önemli kazanımlar sağlamış; IoU'yu %90,0'a, Dice katsayısını %93,1'e, SSIM'i 0,90'a ve PSNR'ı 29,6 dB'ye yükseltirken FID skorunu 20,3'e düşürmüştür. Ek olarak motif koruma kaybını (motif-preservation loss) içeren tam model; %93,0 IoU, %95,4 Dice katsayısı, 0,92 SSIM değeri, 31,2 dB PSNR ve 17,6 FID skoru ile genel olarak en iyi performansı sergilemiştir.

Tablo 8, kültürel miras desenlerinin yeniden yapılandırılması ve korunması için kullanılan temsili DL yaklaşımlarının karşılaştırmalı bir genel görünümünü sunmaktadır. Geleneksel CNN tabanlı yöntemler etkili yerel özellik öğrenimi ve segmentasyon performansı sağlar ancak sınırlı uzun menzilli bağımlılık modellemesi nedeniyle karmaşık motif yapılarını korumakta genellikle zorlanırlar. GAN tabanlı yaklaşımlar görüntü sentezi ve stil aktarma yeteneklerini geliştirir; ancak, semantik tutarsızlıklardan ve ince yapısal detayların kaybından etkilenebilirler. Transformer tabanlı yöntemler küresel bağlamsal anlamayı geliştirir ancak tipik olarak üretken yeniden yapılandırma yeteneklerinden yoksundurlar; öte yandan, difüzyon tabanlı yöntemler artan hesaplama karmaşıklığı pahasına yüksek görsel gerçekçilik sunarlar. Hibrit Transformer-GAN yaklaşımları, özellik çıkarma ve görüntü oluşturma mekanizmalarını birleştirerek bu sınırlamaları kısmen giderir. Buna karşılık, önerilen SegCycle-SPADE çerçevesi; transformer tabanlı segmentasyonu, çapraz dikkat özellik füzyonunu, üretken yeniden yapılandırmayı ve segmentasyon güdümlü sanatsal sentezi birleşik bir mimari içinde entegre ederek yapısal sadakati, semantik tutarlılığı ve kültürel motif korumasını iyileştirir. Karşılaştırma Tablo 8'de özetlenmiştir.

YaklaşımTemel MetodolojiGüçlü YönlerKısıtlamalarKültürel Mirasla İlişkisi
CNN Tabanlı Yöntemler (örn. U-Net, DeepLabV3+)Konvolüsyonel özellik çıkarımı ve semantik segmentasyonEtkili yerel öznitelik öğrenimi ve doğru segmentasyonSınırlı uzun menzilli bağımlılık modelleme; karmaşık motif yapılarının korunmasında zorlukMotif segmentasyonu için uygun ancak sanatsal yeniden yapılandırma için daha az etkili
GAN Tabanlı Yöntemler (örn. Pix2Pix, CycleGAN)Çekişmeli görüntü oluşturma ve görüntüden görüntüye çeviriYüksek kaliteli görüntü sentezi ve stil aktarımıEğitim kararsızlığı; semantik tutarsızlık; ince yapısal detayların potansiyel kaybıDesen restorasyonu için yararlıdır ancak kültürel motifleri doğru şekilde korumayabilir
Transformer Tabanlı YöntemlerÖz-dikkat ve küresel bağlam modellemeUzun menzilli bağımlılıkları ve karmaşık görsel ilişkileri yakalarYüksek hesaplama maliyeti; geniş eğitim veri setleri gerektirirKarmaşık örüntü analizinde etkili ancak tek başına kullanıldığında üretici kapasitesi sınırlı
Difüzyon Temelli Yöntemlerİteratif gürültü giderme tabanlı görüntü oluşturmaYüksek görsel gerçekçilik ve görüntü çeşitliliğiYavaş çıkarım hızı; yüksek hesaplama gereksinimleri; sınırlı yapısal kontrolKültürel miras görüntüsü oluşturma için gelecek vadeden ancak hesaplama açısından yoğun
Hibrit Transformer-GAN YöntemleriTransformer tabanlı özellik çıkarımı ve GAN tabanlı üretimin kombinasyonuGeliştirilmiş küresel özellik temsili ve görüntü kalitesiGenellikle motif korunumu için açık semantik yönlendirmeden yoksundurlarÜretim kalitesini artırır ancak özellikle kültürel miras motifleri için tasarlanmamıştır
Önerilen SegCycle-SPADESegFormer + CAFFM + CycleGAN + SPADETransformer tabanlı segmentasyon, dikkat rehberli özellik füzyonu, semantik tutarlılık, motif koruması ve kontrol edilebilir artistik yeniden yapılandırmaBağımsız CNN tabanlı yaklaşımlardan daha yüksek hesaplama karmaşıklığıYapısal sadakat ve anlamsal tutarlılığı artırılmış, kültürel miras desenlerinin rekonstrüksiyonu ve korunması için özel olarak tasarlanmış

Tablo 8: Kültürel Miras Desen Rekonstrüksiyonu ve Korunması için Temsili Derin Öğrenme Yaklaşımlarının Karşılaştırılması. Görüntü segmentasyonu, desen rekonstrüksiyonu, stil üretimi ve kültürel miras korunması için kullanılan temsili derin öğrenme yaklaşımlarının nitel karşılaştırması. Tablo; her bir yaklaşımın temel metodolojisini, güçlü yönlerini, sınırlamalarını ve uygulanabilirliğini özetlemekte ve önerilen SegCycle-SPADE çerçevesinin, kültürel miras desenlerindeki yapısal koruma ve anlamsal tutarlılıkla ilgili zorlukları gidermek için semantik segmentasyon, özellik füzyonu, rekonstrüksiyon ve stil sentezini nasıl birleştirdiğini vurgulamaktadır.

Gözlemlenen iyileştirmeler, CAFFM modülünün çapraz dikkat tabanlı özellik füzyonu aracılığıyla segmentasyondan türetilen yapısal özellikler ile sanatsal stil temsilleri arasındaki etkileşimi etkili bir şekilde artırdığını kanıtlamaktadır. Ayrıca, motif koruma kaybı, yeniden yapılandırma ve sanatsal sentez sırasında kültürel açıdan önemli motif yapılarının korunmasına katkıda bulunarak segmentasyon tutarlılığının, yapısal sadakatin ve görsel gerçekçiliğin artmasını sağlamaktadır. Toplu olarak, ablasyon sonuçları SegFormer-B2, CAFFM, CycleGAN, SPADE ve motif koruma kaybının entegrasyonunun, önerilen SegCycle-SPADE çerçevesinin üstün performansından sorumlu olduğunu doğrulamaktadır.

Veri Kullanılabilirliği:
Sanatsal stil öğrenimi için kullanılan WikiArt veri seti, Kaggle WikiArt deposu (https://www.kaggle.com/datasets/steubk/wikiart) üzerinden herkese açıktır. Bu çalışmada kullanılan Miao Batik veri seti, Zenodo (https://doi.org/10.5281/zenodo.20807658) aracılığıyla herkese açıktır. Önerilen SegCycle-SPADE çerçevesi ile ilişkili işlenmiş veri setleri, segmentasyon maskeleri, önceden eğitilmiş model ağırlıkları, üretilen çıktılar ve Python uygulama dosyaları da aynı Zenodo deposu üzerinden erişilebilirdir.

EK DOSYA:
Ek Dosya 1. Algoritma 1: Önerilen SegCycle-SPADE Çerçevesinin Uygulama İş Akışı. Veri kümesi yükleme, ön işleme, SegFormer-B2 kullanılarak semantik segmentasyon, Çapraz Dikkat Kültürel Özellik Füzyon Modülü (CAFFM) kullanılarak özellik füzyonu, CycleGAN kullanılarak kültürel motif yeniden yapılandırması, SPADE kullanılarak sanatsal stil sentezi, model eğitimi, doğrulama, kontrol noktası seçimi ve nihai performans değerlendirmesi dahil olmak üzere, önerilen SegCycle-SPADE çerçevesinin tüm uygulama hattını tanımlayan adım adım sözde kod. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Geleneksel zanaatların kademeli olarak yok olması nedeniyle, Somut Olmayan Kültürel Miras (SOKÜM) desenlerinin korunması ve dijital rekonstrüksiyonu son yıllarda artan bir ilgi görmüştür. Önceki çalışmalar, DL tabanlı görüntü işleme teknikleri aracılığıyla kültürel miras kaybını gidermeye çalışmıştır. Örneğin, Quan ve ark.32, Guizhou Miao batik kültürü için bilgi grafikleri ve DL tabanlı bir kültürel miras koruma çerçevesi önermiştir. Çalışma kültürel desenlerin dijital rekonstrüksiyonuna odaklanmış olsa da, metodolojisi temel olarak bilgi grafiği temsillerine dayanmaktaydı. Benzer şekilde, Fu ve Razmjooy16, kültürel miras görüntülerinin iyileştirilmesi ve restorasyonu için özellik piramidi ağına (FPN) dayalı bir çerçeve önermişlerdir. Bu yöntem, görüntü iyileştirme için etkili özellik çıkarımı sağlamış olsa da, eksik kültürel desenler için görüntü segmentasyon kılavuzluğu veya üretken rekonstrüksiyon mekanizmaları içermiyordu. Buna karşın, önerilen SegCycle-SPADE çerçevesi, bu zorlukların üstesinden gelmek için birden fazla DL bileşenini birleştirir. İlk olarak, kültürel miras desenleri içindeki motif bölgelerinin doğru şekilde tanımlanması için SegFormer modeli kullanılarak semantik segmentasyon uygulanır. Ardından, CAFFM tabanlı bir özellik iyileştirme modülü, ince taneli motif yapıları için özellik temsillerini geliştirir. Daha sonra, karşıt öğrenme yoluyla kültürel desenler içindeki eksik veya tamamlanmamış bölgeleri yeniden oluşturmak için bir CycleGAN rekonstrüksiyon modülü kullanılır. Son olarak, bir SPADE modülü, segmentasyon haritalarıyla yapısal hizalamayı korurken stilistik iyileştirme gerçekleştirir. Mevcut CNN-, GAN-, transformer- ve difüzyon tabanlı yöntemlerin17,19,20,21,22,23,24,25,30,34 her biri kendine özgü avantajlar sunmakta; ancak Tablo 8'de özetlendiği üzere, semantik tutarlılığın korunması, yapısal özelliklerin sürdürülmesi veya hesaplama verimliliğinin sağlanması konularında sınırlamalar barındırmaktadır. Önerilen SegCycle-SPADE mimarisi; SegFormer tabanlı segmentasyon, çapraz dikkat özellik füzyonu, CycleGAN rekonstrüksiyonu ve SPADE kılavuzlu sentezin güçlü yönlerini, bu sınırlamaları gidererek birleştirir. Sonuç olarak çerçeve, geliştirilmiş rekonstrüksiyon kalitesi ve kültürel açıdan anlamlı motiflerin daha iyi korunmasını sağlar.

Teşvik edici performansına rağmen, önerilen SegCycle-SPADE çerçevesi hâlâ çeşitli kısıtlamalar sunmaktadır. İlk olarak, değerlendirme yalnızca Miao Batik ve WikiArt veri kümeleri kullanılarak gerçekleştirilmiştir; bu durum, çerçevenin diğer kültürel miras alanlarına genelleştirilebilirliğini sınırlayabilir. İkinci olarak, SegFormer, CAFFM, CycleGAN ve SPADE'in entegrasyonu hesaplama karmaşıklığını ve bellek gereksinimlerini artırdığı için kaynak kısıtlı platformlarda kurulum zorlayıcı olabilir. Üçüncü olarak, segmentasyon performansı büyük ölçüde motif açıklamalarının kalitesine ve tutarlılığına bağlıdır ve açıklama yanlılığı, kültürel açıdan anlamlı yapıların korunmasını etkileyebilir. Son olarak, çerçeve yalnızca iki veri kümesi kullanılarak değerlendirildiği için, farklı kültürel miras koleksiyonları genelinde uygulanabilirliği sağlamak amacıyla ek eğitim verileri ve alana özgü adaptasyonlar gerekli olabilir. Bu nedenle gelecek çalışmalar; daha sağlam eğitim stratejilerini, hafif mimarileri, iyileştirilmiş açıklama prosedürlerini ve ek kültürel miras veri kümeleri kullanılarak yapılan alanlar arası değerlendirmeleri araştırmalıdır.

SegCycle-SPADE çerçevesinin daha geniş ve daha çeşitli kültürel miras veri setlerine ölçeklenebilirliği, gelecekteki araştırmaların temel odak noktası olacaktır. Modelin genelleştirme yeteneğini ve kültürel uyumluluğunu artırmak için farklı bölgelerden ve sanatsal geleneklerden gelen miras motiflerinin kültürler arası değerlendirmesi incelenecektir. Ayrıca, metinsel açıklamaları, tarihi kayıtları ve kültürel üst verileri içeren çok modlu genişletmeler, yeniden yapılandırma sırasında daha güçlü semantik rehberlik sağlayabilir. Çerçeve, görüntü tabanlı yeniden yapılandırmayı 3D modelleme teknikleriyle entegre ederek üç boyutlu kültürel miras yeniden yapılandırmasını destekleyecek şekilde de genişletilebilir. Ek olarak, yapay zeka destekli miras koruma ve belgelemenin pratik uygulamalarını kolaylaştırmak amacıyla dijital arşivler, müzeler, sanal sergiler ve kültürel miras koruma platformlarındaki kullanımı araştırılacaktır. Yorumlanabilirliği ve kültürel özgünlüğü daha da artırmak için gelecek çalışmalar; kültürel olarak bilgilendirilmiş motif analizi ve yeniden yapılandırmayı mümkün kılmak adına kültürel bilgi grafiklerinin, etnografik belgelerin, tarihi üst verilerin ve uzmanlar tarafından kürate edilmiş bilgi tabanlarının entegrasyonunu inceleyecektir32.

Önerilen SegCycle-SPADE çerçevesi uygulanırken birkaç pratik husus göz önünde bulundurulmalıdır. CycleGAN eğitimi sırasında, jeneratör ve diskriminatör kayıpları arasında yüksek bir dengesizlik oluşursa, kararsız adversariyel yakınsama meydana gelebilir. Bu gibi durumlarda, öğrenme hızının düşürülmesi, döngü tutarlılığı (cycle-consistency) kaybı ağırlığının artırılması veya diskriminatör baskınlığının izlenmesi eğitim stabilitesini artırabilir. Jeneratörün tekrar tekrar görsel olarak benzer çıktılar üretmesi durumunda mod çökmesi (mode collapse) yaşanabilir; bu sorun, dengeli adversariyel eğitim, replay-buffer kullanımı ve jeneratör ile diskriminatör kaybı trendlerinin dikkatle izlenmesi yoluyla hafifletilebilir. Kültürel motiflerin karmaşık dokular, düşük kontrast veya belirsiz sınırlar sergilediği durumlarda segmentasyon hataları da ortaya çıkabilir. Bu sorunu gidermek için eğitimden önce görüntü kalitesi doğrulanmalı ve anotasyon tutarlılığını sağlamak amacıyla segmentasyon maskeleri görsel olarak incelenmelidir. Güvenilir SegFormer performansı elde etmek için önerilen giriş çözünürlüğünün ve normalizasyon ayarlarının korunması da önemlidir. Eğitim kararsızlığı ayrıca uygun olmayan öğrenme hızı ayarları, yetersiz eğitim verileri veya donanım kaynaklı sayısal varyasyonlardan kaynaklanabilir. Tekrarlanabilirliği artırmak için NumPy, PyTorch, CUDA ve veri seti karıştırma işlemleri için sabit rastgele tohumlar (random seeds) kullanılmalıdır. Ayrıca, tüm deneysel çalışmalar boyunca aynı ön işleme hattı, veri seti bölümleri, model hiperparametreleri ve yazılım ortamı korunmalıdır. Performans düşüşünü önlemek ve yarıda kalan eğitim oturumlarından geri dönmeyi kolaylaştırmak için periyodik kontrol noktası (checkpoint) kaydı ve doğrulama kaybı izlemesi de önerilir.

Önerilen çalışma, yapay zeka tabanlı kültürel miras yeniden yapılandırma çerçevelerinin teorik ilerlemesine katkıda bulunmaktadır. Geleneksel görüntü restorasyon yaklaşımları genellikle görüntü segmentasyonu, yeniden yapılandırma ve stil üretimini bağımsız süreçler olarak ele alır17,19,20,30. Buna karşılık, bu çalışma, bu süreçleri segmentasyon rehberliğinde üretken bir yeniden yapılandırma stratejisi aracılığıyla entegre eden bir çerçeve önermektedir. Sonuç olarak çalışma; segmentasyonun, yeniden yapılandırmanın ve stil üretiminin tek bir çerçeve içinde nasıl birleştirilebileceğini göstererek yapay zeka destekli kültürel miras yeniden yapılandırmasının teorik gelişimine katkı sağlamaktadır. Bu tür bir entegrasyon, motif yapısının ve anlamsal anlamın korunmasının kritik olduğu kültürel miras uygulamalarında özellikle önemlidir. Pratik bir perspektiften bakıldığında, önerilen çerçeve, geleneksel kültürel desenlerin dijital olarak korunması, restorasyonu ve sanatsal olarak geliştirilmesi için etkili bir çözüm sunmaktadır. Kültürel miras kurumları, müzeler ve tasarımcılar; motif bölgelerini otomatik olarak tanımlamak, hasarlı veya eksik desenleri yeniden yapılandırmak ve geleneksel tasarımların görsel olarak geliştirilmiş sanatsal temsillerini üretmek için SegCycle-SPADE'i kullanabilirler. Bu yetenek, tarihi eserlerin kısmen hasarlı veya eksik olabildiği Miao batik tekstil desenleri dahil olmak üzere, tehlike altındaki zanaat gelenekleri için özellikle değerlidir. Ayrıca, üretken stil sentezinin dahil edilmesiyle çerçeve; tekstil tasarımı, dijital sanatsal üretim ve miras eğitimi gibi modern kültürel tasarım uygulamalarını destekleyebilir. Bu şekilde, önerilen çerçeve, kültürel miras koruma ile çağdaş kültürel tasarım uygulamaları arasındaki boşluğu doldurmaktadır.

Buna rağmen, önerilen SegCycle-SPADE çerçevesi ile elde edilen gelecek vaat eden sonuçlara karşın, bazı kısıtlamalar mevcuttur. İlk olarak, değerlendirme yalnızca Miao Batik ve WikiArt veri kümeleri kullanılarak gerçekleştirilmiştir; bu durum, çerçevenin diğer kültürel miras desenlerini yeniden oluşturma konusundaki genelleme yeteneğini etkileyebilir. İkinci olarak, yeniden oluşturma süreci GAN tabanlı modellere dayandığı için, oldukça karmaşık motif yapılarıyla karşılaşıldığında üretilen çıktılar zaman zaman artefaktlar veya doğal olmayan dokular içerebilir. Üçüncü olarak, çerçeve şu anda iki boyutlu desenlerin yeniden oluşturulmasına odaklanmaktadır, oysa bazı kültürel miras eserleri doğası gereği üç boyutlu yapılar içerir. Genel olarak, deneysel bulgular, önerilen SegCycle-SPADE çerçevesinin somut olmayan kültürel miras (SOK) desenlerinin sanatsal yeniden oluşturulmasındaki etkinliğini kanıtlamaktadır. SegFormer tabanlı semantik segmentasyon, CAFFM, CycleGAN tabanlı motif yeniden oluşturma ve SPADE tabanlı sanatsal sentezin entegrasyonu; segmentasyon, yeniden oluşturma ve görüntü kalitesi performans metriklerini tutarlı bir şekilde iyileştirmiştir. Ablasyon çalışmaları, her bir çerçeve bileşeninin katkısını daha da doğrulamış; CAFFM ve motif koruma kaybının yapısal sadakati ve görsel özgünlüğü önemli ölçüde artırdığını göstermiştir. Bu bulgular, semantik segmentasyon kılavuzluğundaki yeniden oluşturmanın çapraz dikkat özellik füzyonu ile birleştirilmesinin, sanatsal açıdan zengin çıktılar üretirken kültürel açıdan anlamlı motifleri etkili bir şekilde koruyabileceği yönündeki temel hipotezi desteklemektedir. Bu nedenle, önerilen çerçeve, SOK desenlerinin dijital olarak korunması, restorasyonu ve yaratıcı şekilde canlandırılması için güvenilir ve tekrarlanabilir bir hesaplama yaklaşımı sunmaktadır.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Çıkar Çatışması:
Yazarlar herhangi bir çıkar çatışması olmadığını beyan ederler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu araştırmanın tamamlanması sırasında Guangdong Mühendislik Politeknik Üniversitesi ve Güney Çin Normal Üniversitesi tarafından sağlanan akademik ve kurumsal desteği kabul ederler. Bu araştırma, “Dijital Yeniden Canlandırma Müzesi: Çin Klasik Kaligrafi ve Resim Kültürel Kalıntılarının Aktivasyonu ve İletişimi Üzerine Araştırmalar” başlıklı 2023 Ulusal Sosyal Bilimler Fonu Genel Projesi (No. 23BH161) tarafından desteklenmiştir.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Adam OptimizerPyTorch Optimizer KütüphanesiAdamModel eğitimi sırasında kullanılan optimizasyon algoritması.
CUDA ToolkitNVIDIA CorporationCUDA 11.3Derin öğrenme hesaplamaları için GPU hızlandırması.
cuDNNNVIDIA CorporationcuDNN 8.2Eğitimi ve çıkarımı hızlandırmak için kullanılan derin sinir ağı hızlandırma kütüphanesi.
CycleGANUniversity of California, Berkeley / Açık KaynakResmî PyTorch Uygulaması (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Kültürel motif yeniden yapılandırması için kullanılan üretken çekişmeli ağ.
ImageNet Ön Eğitimli AğırlıklarImageNet / Açık Kaynakmit_b2.pth (ImageNet-1K Ön Eğitimli Kontrol Noktası)Miao Batik veri seti üzerinde ince ayar yapmadan önce SegFormer-B2 omurgasını başlatmak için kullanılır.
Intel İşlemciIntel CorporationIntel Core i7 (11. Nesil)Görüntü ön işleme, model eğitimi desteği ve çıkarım için kullanılan CPU.
MatplotlibMatplotlib Geliştirme EkibiMatplotlib 3.5.1Eğitim eğrilerinin ve değerlendirme sonuçlarının görselleştirilmesi.
Miao Batik Veri SetiZenodo DeposuDOI: 10.5281/zenodo.20807658Semantik segmentasyon ve desen yeniden yapılandırması için kullanılan 15.148 görüntü içeren kültürel motif veri seti.
NumPyNumPy GeliştiricileriNumPy 1.21.5Sayısal hesaplama ve veri seti işleme.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Model eğitimi ve çıkarımı için kullanılan donanım platformu.
OpenCVOpenCV VakfıOpenCV 4.5.5Görüntü ön işleme, yeniden boyutlandırma, interpolasyon ve Gauss gürültü giderme.
İşletim SistemiCanonical Ltd.Ubuntu 20.04 LTSDeneysel yürütme ortamı.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Görüntü yükleme ve manipülasyonu.
PythonPython Software FoundationPython 3.8.10Uygulama ve deneyleme için kullanılan programlama dili.
PyTorchMeta AIPyTorch 1.10.0Model eğitimi ve çıkarımı için kullanılan derin öğrenme çerçevesi.
Rastgele TohumDeneysel Ayar42Veri seti bölümlendirme, model başlatma ve deneysel tekrarlanabilirlik için kullanılan sabit tohum.
Scikit-learnScikit-learn GeliştiricileriScikit-learn 1.0.2Veri seti bölümlendirme, istatistiksel analiz ve değerlendirme metrikleri.
SeabornAçık Kaynak TopluluğuSeaborn 0.11.2İstatistiksel veri görselleştirme.
SegFormer-B2NVIDIA Research / Açık KaynakSegFormer-B2 (MIT-B2 Omurgası)Kültürel motif segmentasyonu için kullanılan Transformer tabanlı semantik segmentasyon modeli.
Segmentasyon Maskeleri / AçıklamalarMiao Batik Veri SetiVeri Seti ile Birlikte VerilmiştirMotif sınıflandırması ve eğitimi için kullanılan piksel düzeyinde semantik segmentasyon etiketleri.
SPADENVIDIA Research / Açık KaynakResmî PyTorch Uygulaması (https://github.com/NVlabs/SPADE)Artistik desen üretimi için kullanılan segmentasyon güdümlü görüntü sentezleme modeli.
TorchVisionMeta AITorchVision 0.11.1PyTorch ile kullanılan görüntü işleme yardımcıları ve veri seti dönüşümleri.
WikiArt Veri SetiWikiArthttps://www.wikiart.org/Stil öğrenimi ve sentezi için kullanılan, 27 artistik stilde 80.000'den fazla sanat eseri içeren artistik stil veri seti.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

İlgili makaleler