본 프로토콜은 디지털 보존 및 창의적 유산 활용을 지원하기 위해, 트랜스포머 기반 특징 추출, 적대적 재구성 및 공간 적응형 이미지 생성을 이용하여 무형문화유산 문양의 시맨틱 세그멘테이션, 재구성 및 예술적 스타일 합성을 수행하는 딥러닝 워크플로우를 설명합니다.
연구 논문
본 프로토콜은 디지털 보존 및 창의적 유산 활용을 지원하기 위해, 트랜스포머 기반 특징 추출, 적대적 재구성 및 공간 적응형 이미지 생성을 이용하여 무형문화유산 문양의 시맨틱 세그멘테이션, 재구성 및 예술적 스타일 합성을 수행하는 딥러닝 워크플로우를 설명합니다.
딥러닝 기반 이미지 합성 기술의 발전과 함께 무형문화유산(ICH) 문양의 디지털 보존 및 복원에 대한 관심이 높아지고 있습니다. 기존의 SegCycle-SPADE 기반 접근 방식은 전통 공예 문양의 구조적 세그멘테이션과 예술적 복원 가능성을 입증하였으나, 데이터셋 다양성 부족, 문화적 의미론적 요소의 반영 미흡, 복원 과정에서의 구조적 문양 특징 보존 부족 등의 한계가 남아 있습니다. 이러한 과제를 해결하기 위해 본 연구에서는 ICH 문양 유형의 의미론적 세그멘테이션 및 예술적 복원을 위한 개선된 SegCycle-SPADE 프레임워크를 제안합니다. 모티프 경계와 문양 영역을 정확하게 식별하기 위해 Transformer 기반 세그멘테이션 모델인 SegFormer를 채택하였습니다. 또한, 문화적으로 중요한 모티프를 강화하고 특징 표현력을 높이기 위해 교차 주의 집중 문화 특징 융합 모듈(Cross-Attention Cultural Feature Fusion Module)을 도입하였습니다. 문양 변환 및 복원은 CycleGAN을 사용하여 수행하며, 세그멘테이션 맵과 생성된 이미지 간의 의미론적 일관성을 유지하기 위해 공간 적응형 비정규화(Spatially-Adaptive Denormalization, SPADE)를 통한 예술적 스타일 합성을 적용하였습니다. 모델의 일반화 성능과 예술적 다양성을 향상시키기 위해 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 WikiArt 데이터셋을 모두 사용하여 프레임워크를 학습시켰습니다. 실험 결과, 제안된 주의 집중 기반 SegCycle-SPADE 프레임워크는 기존의 생성적 적대 신경망(GAN) 기반 복원 방법과 비교하여 세그멘테이션 정확도와 문화유산 문양 복원 성능을 향상시키는 것으로 나타났습니다. 본 프레임워크는 인공지능 보조 문화유산 기록, 복원 및 전통 문양 디자인의 예술적 재생을 위한 확장 가능한 솔루션을 제공합니다.
관습, 언어, 신념과 같은 무형의 요소와 예술품, 건축물, 기록물과 같은 유형의 요소를 모두 포함하는 문화유산은 인류의 역사, 창의성 및 정체성이 나타나는 근본적인 발현입니다1. 유산 보존은 공동체가 자신의 기원과 다시 연결될 수 있도록 하며, 미래 세대가 집단적 문화 기억의 혜택을 누릴 수 있게 합니다. 또한 이는 상호 문화적 이해, 다양한 전통과 관습에 대한 감상, 그리고 서로 다른 역사적 서사에 대한 인식을 증진합니다. 이러한 문화적 자산은 이전 세대의 가치, 관점 및 경험을 이해하는 데 도움을 주며, 현대의 사회적 정체성 형성과 문화적 연속성에 기여합니다. 문화유산 보존의 기본 원리는 그림 1에 설명되어 있습니다.

그림 1. SegCycle-SPADE 프레임워크를 이용한 문화유산 패턴 재구성의 개념적 개요. 무형 문화유산 패턴을 재구성하고 강화하기 위해 제안된 접근 방식의 모식도. 워크플로우에는 Miao Batik 및 WikiArt 데이터셋의 데이터 수집, 이미지 전처리, SegFormer-B2를 이용한 시맨틱 세그멘테이션, Cross-Attention Cultural Feature Fusion Module(CAFFM)을 이용한 특징 융합, CycleGAN을 이용한 패턴 재구성, SPADE를 이용한 예술적 스타일 합성, 그리고 세그멘테이션 및 재구성 지표를 이용한 최종 평가가 포함된다. 화살표는 프레임워크 전체의 데이터 및 특징 표현의 흐름을 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
인류 사회의 집단적 기억과 문화적 유산은 무형문화유산(ICH)에 구현되어 있으며, 이는 예술적 표현과 문화적 정체성을 위한 중요한 매개체 역할을 합니다. 그러나 무형문화유산은 세계화와 디지털화의 영향으로 인해 상당한 도전에 직면해 있습니다2,3,4. 숙련된 장인의 수 감소와 현대 시장에 대한 제한적인 적응력으로 인해, 소멸 위기에 처한 많은 무형문화유산 관행은 보존과 발전을 위한 새로운 접근 방식이 필요합니다5,6. 무형문화유산 연구의 중요한 분야로서 지속 가능한 디자인은 문화, 사회, 환경의 통합적 발전을 강조하며, 무형문화유산의 지속적인 보존을 위한 실질적인 경로를 제공합니다. 지속 가능한 디자인 접근 방식을 통해 무형문화유산은 현대 사회의 요구에 적응하면서 동시에 활성화될 수 있습니다7,8.
본 연구에서 “무형문화유산 패턴”이라는 용어는 기저에 깔린 무형의 문화적 가치를 전달하고 보존하는 시각적 모티프 표현을 의미합니다. 따라서 제안된 프레임워크는 이러한 모티프의 시각적 형태를 재구성하는 동시에, 이와 관련된 문화적 정보를 보존하고 기록하는 것을 목표로 합니다.
묘족 자수와 바틱(batik)은 중국 무형문화유산(ICH)의 중요한 형태로, 새, 나비, 조상 토템과 같은 상징적 모티프를 통해 묘족 공동체의 역사, 신념 및 전통을 반영합니다9. 이러한 모티프는 제례 의복과 축제 관습에 깊이 내재되어 있으며 지역의 문화적 및 경제적 발전에 기여하고 있습니다10,11. 특히 인공지능(AI)과 딥러닝(DL)을 필두로 한 디지털 기술의 발전은 문화유산의 보존, 분석, 재구성 및 문서화에 있어 새로운 기회를 창출했습니다. 중국에서 가장 잘 보존된 바틱 전통 중 하나인 구이저우 묘족 바틱은 묘족의 문화적 지식, 신념, 관습 및 제례를 전달하는 중요한 매체 역할을 합니다12,13,14,15,16.
최근 연구들은 문화유산 보존 및 패턴 복원을 위한 DL의 잠재력을 입증했으며, U-Net 및 DeepLabV3+1과 비교하여 향상된 세그멘테이션 정확도(pixel accuracy = 88.6%, mean intersection over union [IoU]= 78.1%)와 복원 성능을 달성하였습니다. 그러나 몇 가지 과제가 남아 있습니다. 기존의 생성적 적대 신경망(GAN) 기반 접근 방식은 복잡한 패턴의 미세한 구조적 세부 사항을 보존하는 데 어려움을 겪는 경우가 많으며17, 제한된 데이터셋 다양성은 여러 문화 영역에 걸친 모델의 일반화 능력을 제한합니다18. 또한, CycleGAN과 같은 이미지-투-이미지 변환 모델은 세그멘테이션 맵과 생성된 이미지 사이의 의미론적 일관성을 유지하지 못할 수 있으며19, 어텐션 메커니즘의 부재는 복원 과정에서 문화적으로 중요한 모티프 세부 사항의 손실을 초래할 수 있습니다20. 따라서 효과적인 무형문화유산(ICH) 패턴 복원을 위해서는 트랜스포머 기반 세그멘테이션, 어텐션 가이드 특징 학습 및 다중 데이터셋 훈련이 통합된 강화된 프레임워크가 필요합니다.
묘족 자수의 디지털화와 생성형 AI의 급격한 발전으로 문화유산 보존을 위한 새로운 기회가 나타났습니다. 최신 딥 생성 모델의 일종인 확산 모델(Diffusion models)은 강력한 콘텐츠 생성 능력 덕분에 컴퓨터 비전 작업에서 뛰어난 성능을 입증해 왔습니다21,22,23,24,25. 역확산 과정 동안 모델은 노이즈가 섞인 표현으로부터 원래의 입력 데이터를 점진적으로 재구성하는 법을 학습합니다26,27,28. 기존 연구들은 또한 문화유산의 보존과 전파를 위해 3차원 재구성 및 컴퓨터 보조 설계(CAD) 기술의 적용을 탐구해 왔습니다.
합성곱 신경망(CNN)과 GAN은 이미지 생성 및 특징 보존에서 우수한 성능을 보이지만, 제한된 수용 영역, 모드 붕괴 및 학습 불안정성과 관련된 문제에 여전히 직면해 있습니다29. SegFormer 및 Segmenter와 같은 트랜스포머 기반 아키텍처는 전역적 문맥과 시맨틱 관계를 포착하는 데 뛰어나지만, 연산 집약적이며 세밀한 세부 사항을 처리하는 데 어려움을 겪을 수 있습니다. Stable Diffusion과 같은 확산 모델은 강력한 이미지 생성 능력을 보여주지만, 생성된 디자인의 구조적 및 예술적 특성에 대한 정밀한 제어가 부족한 경우가 많습니다. 또한, 기존의 대부분의 접근 방식은 독립적인 학습 전략을 채택하여 세그멘테이션과 생성 구성 요소 간의 효과적인 정보 공유 및 협력적 최적화를 제한하며, 결과적으로 구조적 정확성과 예술적 진정성 사이의 트레이드오프를 초래합니다30.
잠재 확산(latent diffusion) 및 Stable Diffusion과 같은 최신 확산 기반 모델은 고품질의 이미지 합성을 달성하지만, 반복적인 디노이징 과정이 필요하여 계산 비용과 추론 시간이 증가한다는 단점이 있습니다. 또한, 특화된 조건화 메커니즘 없이는 미세한 문화적 모티프와 구조적 일관성을 유지하는 것이 여전히 어렵습니다. 트랜스포머 기반 생성 모델은 전역적 문맥 관계를 효과적으로 포착하지만, 종종 대규모 데이터셋과 상당한 계산 자원을 필요로 합니다. 이와 대조적으로, 제안된 SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) 프레임워크는 SegFormer 기반 세그멘테이션, 크로스 어텐션 특징 융합, CycleGAN 재구성 및 SPADE 가이드 합성을 결합하여 명시적인 구조적 가이드를 제공함으로써, 문화유산 패턴의 모티프 보존, 세만틱 일관성 및 제어 가능한 재구성 성능을 향상시킵니다.
최첨단 시맨틱 세그멘테이션 기술의 대부분은 U자형 아키텍처를 갖춘 완전 합성곱 신경망(FCNN)에 의존합니다31. 인코딩 단계에서는 일련의 합성곱 및 다운샘플링 연산을 통해 수용 영역이 넓은 심층 특징을 추출합니다. 디코딩 단계에서는 업샘플링을 통해 공간 해상도를 점진적으로 복원하여 최종적으로 픽셀 수준의 시맨틱 예측을 가능하게 합니다. 스킵 연결은 다운샘플링 중 발생하는 공간 정보 손실을 보완하고 다양한 응용 분야에서 세그멘테이션 성능을 향상시키며, 서로 다른 인코더 레벨의 고해상도 정보가 디코더에 직접 통합될 수 있도록 합니다32.
최근 GAN 기반, CNN 기반 및 확산 기반 방법들이 이미지 생성 및 문화유산 복원에서 유망한 결과를 보여주었으나, 의미론적 일관성을 유지하고 미세한 구조적 모티프를 보존하며 다양한 문화적 패턴에 걸쳐 재현 가능한 재구성을 보장하는 데에는 여전히 어려움이 있습니다. 기존의 대부분의 접근 방식은 세분화, 재구성 및 스타일 합성을 별개의 프로세스로 처리하며, 이는 문화적으로 중요한 요소의 손실과 일관성 없는 결과물로 이어질 수 있습니다. 이러한 방법론적 격차를 해결하기 위해, 본 연구에서는 SegFormer 기반의 의미론적 세분화, 새로운 교차 주의 집중 문화 특성 융합 모듈(Cross-Attention Cultural Feature Fusion Module, CAFFM), CycleGAN 기반 재구성 및 SPADE 안내 스타일 합성을 통합한 통합 SegCycle-SPADE 프레임워크를 제안합니다. 구조적 세분화 정보와 생성적 특성 학습을 명시적으로 통합함으로써, 제안된 프레임워크는 문화적 진정성과 예술적 품질을 모두 유지하면서 무형문화유산(ICH) 모티프의 보다 신뢰할 수 있고 의미론적으로 일관되며 재현 가능한 재구성을 가능하게 합니다.
본 연구에서는 현재의 문화유산 복원 방식에서 나타나는 세 가지 주요 한계점을 확인하였다: (i) GAN 기반 복원 방법에서 미세 구조 모티프의 보존이 불충분함, (ii) 소규모 또는 특정 도메인 데이터셋으로 학습함에 따라 일반화 능력이 제한됨, (iii) 이미지-투-이미지 변환 프레임워크에서 세그멘테이션 결과와 생성된 이미지 간의 시맨틱 일관성이 부족함. 또한, 세그멘테이션, 복원 및 스타일 합성이 일반적으로 개별 공정으로 처리되어 복원 과정에서 문화적으로 중요한 요소들이 손실되는 결과로 이어진다. 제안된 SegCycle-SPADE 프레임워크는 트랜스포머 기반 시맨틱 세그멘테이션, 교차 주의집중(cross-attention) 특징 융합, CycleGAN 복원 및 SPADE 가이드 예술적 합성을 단일 아키텍처 내에서 결합함으로써 이러한 한계점을 해결하고, 무형문화유산(ICH) 패턴 복원 시 모티프 보존, 시맨틱 일관성 및 예술적 진정성을 향상시킨다.
본 연구의 주요 목적은 무형문화유산(ICH) 패턴의 시맨틱 세그멘테이션 기반 예술적 재구성을 위한 개선된 SegCycle-SPADE 프레임워크를 개발하는 것입니다. 이 프레임워크는 정확한 문화적 모티프 세그멘테이션을 위한 SegFormer, 패턴 재구성을 위한 CycleGAN, 그리고 스타일 일관성을 갖춘 예술적 합성을 위한 SPADE를 통합합니다. 특징 표현을 개선하고 미세한 구조적 세부 사항을 보존하기 위해, 세그멘테이션 특징과 생성 특징 간의 효율적인 상호작용을 촉진하는 CAFFM이 도입되었습니다. Miao Batik 및 WikiArt 데이터셋으로 학습된 제안된 프레임워크는 재구성의 진본성, 스타일 일관성 및 문화적으로 중요한 모티프의 보존 능력을 향상시킵니다.
본 연구는 시맨틱 세그멘테이션, 어텐션 가이드 특징 퓨전, 패턴 재구성 및 스타일 합성을 통합 아키텍처 내에 결합하여, 무형문화유산(ICH) 패턴의 예술적 재구성을 위한 새로운 SegCycle-SPADE 프레임워크를 제시합니다. 본 연구의 주요 기여는 다음과 같습니다. 첫째, SegFormer를 통합하여 정교한 문화적 모티프와 구조적 요소의 정확한 추출 및 보존이 가능한 새로운 시맨틱 세그멘테이션 가이드 재구성 프레임워크를 개발하였습니다. 둘째, 세그멘테이션 특징을 생성적 표현과 효과적으로 융합하는 새로운 CAFFM을 도입하여, 모델이 문화적 모티프와 예술적 스타일 패턴 사이의 장거리 관계를 포착할 수 있도록 하였습니다. 셋째, 제안된 CAFFM은 문화적으로 중요한 요소의 보존성을 높이는 동시에 재구성된 유산 패턴의 시각적 사실성과 구조적 일관성을 향상시킵니다. 넷째, 문화 패턴 재구성을 위한 CycleGAN과 세그멘테이션 가이드 예술적 합성을 위한 SPADE를 통합함으로써, 생성된 결과물의 시맨틱 정확성과 스타일적 진정성을 모두 확보하였습니다. 다섯째, 일반화 성능과 예술적 다양성을 개선하기 위해, 문화 패턴 학습을 위한 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 예술적 스타일 표현을 위한 WikiArt 데이터셋을 사용하여 모델을 학습시켰습니다. WikiArt는 묘족 문화유산 제품에 직접 적용하기 위한 타겟 스타일이 아니라, 다양한 시각적 맥락에서 프레임워크의 일반화 능력, 특징 학습의 강건성 및 스타일 제어 효과를 평가하기 위한 보조 데이터셋으로 활용되었습니다. 마지막으로, 기존의 GAN 기반 문화유산 재구성 방법들과 비교했을 때, 실험 결과 제안된 SegCycle-SPADE 프레임워크가 세그멘테이션 정확도, 재구성 품질 및 스타일 일관성 면에서 개선된 성능을 달성함을 입증하였습니다.
제안된 SegCycle-SPADE 프레임워크는 시맨틱 세그멘테이션, 어텐션을 이용한 특징 강화, 생성적 재구성 및 예술적 스타일 합성을 통해 전통 문화유산 패턴을 재구성하고 개선하도록 설계되었습니다. 본 연구에서는 Miao Batik 데이터셋과 WikiArt 데이터셋을 포함하여 공개적으로 사용 가능한 문화유산 및 예술 이미지 데이터셋을 활용하였습니다. 본 연구에는 인간 참여자, 환자 데이터, 개인 정보, 동물 실험 대상 또는 임상 기록이 포함되지 않았으며, 따라서 기관 윤리 위원회의 승인 및 고지된 동의는 필요하지 않았습니다. 우선, 평가를 위해 Miao Batik 문화 문양 데이터셋과 WikiArt 데이터셋이 활용되었습니다. Miao Batik 데이터셋은 Quan 등(2024)32에서 설명되었으며, 전통 Miao batik 문양의 어노테이션이 완료된 이미지 15,148개를 포함하고 있습니다. 데이터셋 제작자가 제공한 기존 어노테이션을 직접 사용하였으며, 본 연구에서 추가적인 수동 어노테이션은 생성하지 않았습니다. 이후 이미지 전처리는 크기 조정, 정규화, 노이즈 제거 및 세그멘테이션 마스크 생성을 통해 수행됩니다. 정확한 전처리 매개변수는 데이터 전처리 소섹션에 기술되어 있습니다. 제안된 프레임워크는 데이터의 시맨틱 세그멘테이션을 위해 SegFormer-B2라는 트랜스포머 기반 모델을 활용합니다. 이 방법은 문화 문양의 핵심 영역을 탐지하고 그 구조를 학습하도록 설계되었습니다. 세그멘테이션된 특징은 이후 어텐션 메커니즘을 통해 강화되며, 여기서 문화 문양과 관련된 중요한 정보는 강조되고 무관한 정보는 폐기됩니다. 어텐션 메커니즘 구성은 CAFFM 소섹션에 기술되어 있습니다. 강화된 특징은 이후 CycleGAN으로 전달되며, 여기서 손상된 구조가 사이클 학습을 통해 재구성됩니다. 학습 과정에서 원래의 Miao Batik 이미지에 무작위 마스킹 및 부분 가림 작업을 적용하여 불완전한 문양 샘플을 인위적으로 생성하였습니다. 이러한 퇴화 절차는 훼손된 문화유산 유물에서 흔히 관찰되는 문양 영역의 누락과 구조적 손상을 모사하였습니다. 이렇게 생성된 불완전한 이미지는 CycleGAN 재구성 모듈의 입력값으로 사용되었으며, 대응하는 원래 이미지는 재구성 목표로 설정되었습니다. 재구성된 문화유산 패턴은 이후 SPADE를 통해 강화되며, 생성된 세그멘테이션 맵을 기반으로 예술적 강화가 수행됩니다. 제안된 프레임워크의 성능은 정량적 세그멘테이션 및 이미지 품질 지표를 사용하여 평가되었으며, 재구성된 문화 문양의 시각적 정통성은 정성적으로 평가되었습니다. 시각적 정통성은 생성된 문화 패턴의 시각적 검토를 통해 평가되었으며, 독립적인 정량적 지표로 사용되지 않았습니다. 평가는 대응하는 참조 문화 문양과 비교하여 문양 보존, 시맨틱 일관성, 문화적 특성, 구조적 응집력 및 예술적 외형에 중점을 두었습니다. 모델 성능의 정량적 평가는 Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) 및 Fréchet Inception Distance (FID)를 사용하여 수행되었습니다. 그림 2는 제안된 SegCycle-SPADE 프레임워크의 전체 워크플로를 보여주며, 본 연구에서 사용된 평가 지표를 요약하여 나타냅니다.

그림 2. 제안된 SegCycle-SPADE 프레임워크의 전체 아키텍처 워크플로우. 전체 SegCycle-SPADE 워크플로우의 개요. Miao Batik 및 WikiArt 데이터셋의 이미지는 전처리를 거친 후 SegFormer-B2를 이용한 의미론적 분할(semantic segmentation), CAFFM을 이용한 특징 강화, CycleGAN을 이용한 패턴 재구성, 그리고 SPADE를 이용한 예술적 스타일 생성 과정을 거친다. 모델 성능은 Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, Fréchet Inception Distance (FID)를 사용하여 평가하며, 시각적 진위성은 정성적으로 평가한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
그림 2에 나타난 바와 같이, 문화유산 패턴 복원을 위한 SegCycle-SPADE 프레임워크는 정확한 모티프 분할, 복원 및 예술적 향상을 위해 여러 딥러닝(DL) 구성 요소를 통합하도록 설계되었습니다. 다양한 문화적 패턴과 예술적 스타일을 제공하기 위해 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 WikiArt 데이터셋의 이미지가 사용됩니다. 우선, SegFormer 기반의 시맨틱 분할 모듈을 사용하여 이미지를 처리함으로써 배경에서 문화 모티프를 식별하고 경계를 설정합니다. 전체 아키텍처는 네 가지 주요 단계로 구성됩니다. 첫째, SegFormer 모델이 문화 패턴 이미지에서 시맨틱 분할 맵을 추출합니다. 둘째, CAFFM이 분할 특징과 생성적 표현을 통합하여 특징 학습을 강화합니다. 셋째, CycleGAN 모듈이 융합된 특징 표현을 사용하여 문화 패턴을 복원합니다. 마지막으로, SPADE 모듈이 분할 기반 합성을 통해 구조적 일관성을 유지하면서 스타일적으로 향상된 결과물을 생성합니다. 정제된 특징 맵은 이후 CycleGAN 복원 모듈에 의해 처리되며, 이 모듈은 손상된 패턴을 그에 대응하는 완전한 형태로 매핑함으로써 불완전한 문화 모티프를 복원하는 방법을 학습합니다. 불완전한 모티프 샘플은 원본 묘족 바틱 이미지에 무작위 마스킹 및 부분 가림 작업을 적용하여 생성되었으며, 이를 통해 손상된 문화 유물에서 흔히 관찰되는 패턴 영역의 누락과 구조적 퇴화를 시뮬레이션했습니다. 각 손상된 이미지는 학습 과정에서 복원 목표로 사용되는 해당 원본 이미지와 쌍을 이룹니다. 이러한 전략을 통해 CycleGAN 모듈은 시맨틱 일관성과 문화적으로 중요한 특성을 유지하면서 누락된 모티프 구조의 복원을 학습할 수 있었습니다. 마지막으로, SPADE 생성기는 생성된 분할 맵을 조건으로 이미지 합성을 수행하여 시각적으로 향상된 예술적 결과물을 생성하며, 이를 통해 예술적 향상 과정 전반에 걸쳐 문화 모티프의 구조적 무결성을 유지합니다.
제안된 SegCycle-SPADE 프레임워크에는 다음 단계들이 포함됩니다.
1단계: 데이터셋 수집
문화적 패턴 학습 및 예술적 스타일 생성을 목표로 하기 위해 두 가지 데이터셋을 사용하였다. 전통 문화 패턴 정보를 제공하기 위해 Miao Batik 문화 문양 데이터셋을 사용하였다. 해당 데이터셋은 Zenodo (https://doi.org/10.5281/zenodo.20807658)를 통해 공개적으로 제공되며, 15,148장의 주석 처리된 전통 묘족(Miao) 바틱 문양 이미지를 포함하고 있다. 데이터셋 제작자가 제공한 기존 주석을 그대로 사용하였으며, 본 연구에서 추가적인 수동 주석을 생성하지는 않았다. 예술적 스타일 생성을 위한 다양한 예술적 스타일 정보를 제공하기 위해 WikiArt 데이터셋을 사용하였으며, 이는 공개 저장소인 WikiArt (https://www.wikiart.org/)에서 확보하였다.
단계 2: 데이터 전처리
모든 이미지는 크기 조정, 정규화 및 노이즈 제거를 통해 전처리되었습니다. 시맨틱 세그멘테이션 단계를 지원하기 위해 기존 데이터셋 소스에서 얻은 문화적 모티프 주석이 사용되었습니다. 본 연구의 일환으로 추가적인 주석 작성이나 재라벨링 절차는 수행되지 않았습니다.
단계 3: SegFormer를 이용한 의미론적 패턴 분할
문화적 모티브 분할을 위해 SegFormer 모델을 사용하였습니다. 정확한 SegFormer 백본 및 초기화 전략은 SegFormer를 이용한 의미론적 패턴 분할 소섹션에 설명되어 있습니다. 구체적으로, 의미론적 모티브 분할을 위해 ImageNet으로 사전 학습된 MIT-B2 백본을 갖춘 SegFormer-B2 아키텍처를 채택하였습니다. 이 모델은 전통 문화 패턴의 복잡한 구조적 세부 사항을 유지하면서 전역적인 문맥 정보를 효과적으로 캡처합니다.
단계 4: CAFFM
CAFFM은 시맨틱 세그멘테이션 특징을 생성적 표현과 결합하여, 프레임워크가 구조적 모티프 특성과 예술적 스타일 정보를 모두 학습할 수 있게 합니다. CAFFM의 통합 세부 사항은 CAFFM 하위 섹션에 제공되어 있습니다. 이 모듈은 SegFormer 기반의 시맨틱 세그멘테이션 단계와 생성적 재구성 단계 사이에 위치하며, 멀티헤드 교차 주의 집중(multi-head cross-attention)을 통해 세그멘테이션에서 유도된 구조적 특징을 재구성 특징과 융합합니다. 이 과정은 문화적 모티프의 보존력을 높이고 재구성된 출력물의 사실성을 향상시킵니다.
5단계: 패턴 재구성 (CycleGAN)
융합된 특징들은 이후 CycleGAN 모듈을 통해 처리되어 문화적 패턴 구조를 재구성합니다. CycleGAN의 아키텍처 및 훈련 설정은 CycleGAN을 이용한 패턴 재구성 소섹션에 기술되어 있습니다. 재구성 모듈은 두 개의 생성기와 두 개의 판별기로 구성되며, 9개의 잔차 블록을 갖는 잔차 네트워크 생성기 아키텍처를 활용하고 PatchGAN 판별기를 사용하며, 적대적 손실 및 사이클 일관성 손실을 통해 훈련됩니다. 이러한 구성은 양방향 도메인 매핑을 가능하게 하며 불완전한 문화적 패턴 구조의 재구성을 용이하게 합니다.
6단계: 예술적 스타일 생성 (SPADE)
재구성된 패턴은 이후 SPADE 모듈을 통해 처리되어 세그멘테이션 가이드 기반의 예술적 스타일 합성을 수행합니다. SPADE 생성기의 구성은 SPADE를 이용한 예술적 스타일 생성 하위 섹션에 설명되어 있습니다. 이 모듈은 SPADE 잔차 블록, 공간 적응형 정규화 층, 그리고 SegFormer 세그멘테이션 맵과 CAFFM 특징 표현에서 도출된 시맨틱 컨디셔닝을 사용합니다. 이미지 생성을 세그멘테이션 맵에 조건화함으로써, 합성된 출력물은 예술적 스타일 특성을 통합하는 동시에 원래의 문화적 모티프와 구조적 정렬을 유지합니다.
단계 7: 성능 추정
제시된 프레임워크는 분할 정확도(Segmentation Accuracy), IoU, Dice 유사도 계수(Dice), SSIM, PSNR 및 FID를 포함한 여러 분할 및 이미지 품질 평가 지표를 사용하여 평가되었습니다. 실험의 일관성을 평가하기 위해 모든 실험은 서로 다른 무작위 시드를 사용하여 5회 반복되었으며, 결과는 평균 ± 표준 편차로 보고되었습니다. 통계적 유의성은 대응표본 t-검정(paired t-tests)을 통해 평가하였으며, 유의 수준은 p < 0.05로 설정하였습니다.
데이터셋 수집
제안된 SegCycle-SPADE 프레임워크에서는 문화적 패턴 이해와 스타일 학습을 위해 두 가지 데이터셋이 사용됩니다. 제안된 프레임워크에 사용된 첫 번째 데이터셋은 묘족 바틱(Miao Batik) 문화 문양 데이터셋입니다. 이 데이터셋은 묘족 예술에 사용되는 동물, 식물, 기하학적 형상과 같은 문양을 포함하는 전통 묘족 바틱 이미지들로 구성된 문화 문양 데이터셋입니다. 이 데이터셋은 문화유산 보존에 일반적으로 중요한 풍부한 질감 정보를 가진 이미지들을 포함하고 있습니다. SegCycle-SPADE의 제안된 프레임워크에 사용된 두 번째 데이터셋은 WikiArt 데이터셋입니다. 이 데이터셋은 일반적으로 서로 다른 스타일의 수많은 예술 작품들을 포함하고 있습니다. 이 데이터셋은 예술 작품의 품질을 높이는 데 일반적으로 유용한 복잡한 스타일 학습을 위해 사용됩니다. 이 데이터셋은 27가지의 서로 다른 디자인을 가진 80,000점의 HD 예술 작품으로 구성되어 있어, 딥러닝(DL) 기반의 스타일 생성 또는 변환 작업에 더욱 유용합니다.
묘족 바틱 데이터셋(Miao Batik Dataset):
묘족 바틱 데이터셋(https://doi.org/10.5281/zenodo.20807658)은 문화적으로 중요한 모티프를 묘사한 바틱 패턴 이미지 15,148장으로 구성되어 있다. 해당 이미지에는 동물 모티프(예: 나비 및 물고기), 식물 기반 패턴 및 문화적 상징성을 지닌 기하학적 모티프 등 다양한 전통 디자인이 포함되어 있다. 이 데이터셋은 패턴 재구성 과정에서 세그멘테이션 모듈이 모티프 경계를 정확하게 식별하고 보존할 수 있게 하는 실제적인 문화적 구조를 제공하므로, 제안된 프레임워크의 중요한 구성 요소가 된다(표 1). 본 연구에서 문화적으로 중요한 모티프란 새, 나비, 꽃 패턴 및 조상 토템을 포함하여 묘족 문화유산 문헌에 일반적으로 기록되어 있으며 데이터셋 어노테이션 내에 표현된 상징적 시각 요소를 의미한다. 이러한 모티프들은 단순히 출현 빈도나 공간적 구성이 아니라, 기록된 문화적 중요성과 전통 묘족 바틱 및 자수 디자인에서의 반복적인 등장 여부를 기준으로 선정되었다. 전문가가 가이드한 모티프 어노테이션 및 세그멘테이션 레이블은 원본 묘족 바틱 데이터셋 소스에서 가져와 본 연구에 직접 사용되었다. 저자들에 의한 추가적인 수동 어노테이션, 레이블 재지정 또는 전문가 가이드 어노테이션 절차는 수행되지 않았다. 데이터셋 제작자가 제공한 기존 어노테이션은 시맨틱 세그멘테이션 학습 및 평가에 활용되었다.
| 매개변수 | 설명 |
| 데이터셋 이름 | Miao Batik 문화 패턴 데이터셋 |
| 데이터셋 출처 | Zenodo 리포지토리 (DOI: 10.5281/zenodo.20807658) |
| 영역 | 무형문화유산 (ICH) / 직물 패턴 분석 |
| 전체 이미지 수 | 15,148장 |
| 이미지 유형 | 전통 묘족(Miao) 바틱 직물 패턴의 디지털 이미지 |
| 패턴 범주 | 동물 문양, 식물 문양 및 기하학적 문양 |
| 문화적 기원 | 중국 귀저우성 묘족 문화 |
| 원본 이미지 해상도 | 전처리 전 로우 스캔 또는 사진으로 캡처된 고해상도 이미지 (통상적으로 짧은 쪽 기준 ≥ 1,000 픽셀) |
| 학습 해상도 | 전처리 과정에서 256 × 256 픽셀로 크기가 조정된 이미지 |
| 어노테이션 가용성 | 데이터셋 제작자가 제공한 기존 세그멘테이션 어노테이션을 수정 없이 학습 및 평가에 사용하였다. 본 연구에서는 추가적인 수동 어노테이션, 재레이벨링 또는 전문가 확인 절차를 수행하지 않았다. |
| 본 연구에서의 활용 | 문화적 문양 세그멘테이션, 특징 추출, 문양 보존 및 패턴 재구성 |
표 1: 묘족 바틱 문화 패턴 데이터셋의 특성. 시맨틱 세그멘테이션, 문화 패턴 분석 및 모티프 재구성에 사용된 묘족 바틱 문화 모티프 데이터셋의 요약입니다. 이 표는 데이터셋의 출처, 이미지 특성, 모티프 범주, 문화적 기원, 이미지 해상도 및 제안된 SegCycle-SPADE 프레임워크 내에서의 역할을 설명합니다.
WikiArt 데이터셋:
WikiArt 데이터셋 [https://www.wikiart.org/]은 Table 2에 명시된 27가지의 서로 다른 예술 스타일을 포함하여 80,000장 이상의 이미지로 구성된 대중적인 대규모 디지털 예술 저장소입니다. 해당 스타일에는 르네상스 미술, 인상주의, 입체주의 및 초현실주의가 포함됩니다. 이 데이터셋은 SPADE 모듈이 세그멘테이션 과정에서 얻은 구조적 정보를 유지하면서 문화적으로 풍부한 패턴을 생성할 수 있게 하는 지식을 제공하므로 제안된 프레임워크에서 매우 중요합니다. 데이터셋은 학습용 이미지 56,000장과 검증 및 테스트용 이미지 12,000장으로 구성되어 있습니다. 이 데이터셋의 이미지들은 DL 모델을 효과적으로 훈련시키는 데 도움을 줍니다.
| 매개변수 | 설명 |
| 데이터셋 이름 | WikiArt 데이터셋 |
| 데이터셋 출처 | WikiArt 저장소 (https://www.wikiart.org/) |
| 도메인 | 디지털 아트 및 회화 |
| 전체 이미지 수 | 약 80,000점의 예술 작품 |
| 훈련 이미지 | 56,000 |
| 검증 이미지 | 12,000 |
| 테스트 이미지 | 12,000 |
| 예술적 스타일 | 르네상스, 인상주의, 입체주의, 초현실주의, 표현주의, 사실주의 및 추상 예술을 포함한 27가지 예술적 스타일 |
| 원본 이미지 해상도 | 원본 이미지 해상도는 작품과 출처에 따라 다양함. 전처리 과정에서 이미지들을 256 × 256 픽셀의 균일한 해상도로 조정함. |
| 훈련 해상도 | 예술적 스타일 학습 및 세그멘테이션 기반 이미지 합성에 앞서, 전처리 과정에서 이미지를 256 × 256 픽셀로 조정함. |
| 데이터셋 분할 | 고정 난수 시드 42를 사용하여 층화 무작위 분할 수행 (훈련 70%, 검증 15%, 테스트 15%) |
| 스타일 샘플링 전략 | 훈련, 검증 및 테스트 서브셋 전체에서 27가지 예술적 스타일의 분포를 유지하기 위해 층화 비례 샘플링을 적용함 |
| 본 연구에서의 활용 | 예술적 스타일 학습, 스타일 표현 및 세그멘테이션 기반 예술적 합성 |
표 2: WikiArt 데이터셋의 특성. 예술적 스타일 학습 및 스타일 가이드 이미지 합성에 사용된 WikiArt 데이터셋의 요약입니다. 이 표는 데이터셋 소스, 이미지 분포, 예술적 스타일 범위, 데이터셋 분할, 이미지 해상도 및 제안된 SegCycle-SPADE 프레임워크 내에서의 적용 내용을 설명합니다.
Miao Batik 데이터셋은 전통 묘족 문화 모티프를 나타내는 15,148장의 이미지로 구성되어 있습니다.32 이 데이터셋은 Zenodo(https://doi.org/10.5281/zenodo.20807658)를 통해 공개적으로 제공됩니다. 모델 학습에 앞서, 모든 이미지를 시각적으로 검사하고 256 × 256 픽셀로 크기를 조정하고 정규화하였으며, 손상되거나 중복된 샘플이 있는지 스크리닝했습니다. 품질 관리 스크리닝 결과 제외된 이미지는 없었으며, 이에 따라 15,148장의 이미지 모두를 후속 분석에 사용하였습니다. 데이터셋 분할의 재현성을 보장하기 위해 고정 랜덤 시드 42를 사용하여 데이터셋을 학습(70%), 검증(15%), 테스트(15%) 서브셋으로 무작위 분할하였습니다. WikiArt 데이터셋은 공식 WikiArt 저장소(https://www.wikiart.org/)를 통해 접근하였으며, 27가지 예술 스타일을 아우르는 80,000점 이상의 예술 작품을 포함하고 있습니다. 스타일 학습 실험을 위해 56,000장의 이미지를 학습에, 12,000장을 검증에, 12,000장을 테스트에 사용하였습니다.
데이터 전처리
제안된 SegCycle-SPADE 프레임워크를 학습시키기 전, 일관된 이미지 품질과 정확한 특징 표현을 확보하기 위해 묘족 배틱(Miao Batik) 문화 문양 데이터셋과 WikiArt 데이터셋에 대해 여러 전처리 단계를 수행하였다. 가우시안 노이즈 제거, 정규화, 일관된 입력 해상도로의 크기 조정 및 이미지 품질 검증을 포함하는 동일한 기본 전처리 파이프라인이 두 데이터셋 모두에 적용되었다. 다만, 두 데이터셋은 프레임워크 내에서 서로 다른 역할을 수행하였다. WikiArt 데이터셋은 예술적 스타일 학습 및 합성에 사용되었으며, 묘족 배틱 데이터셋은 주로 문화 문양의 세그멘테이션 및 재구성에 사용되었다. 이러한 작업별 역할 외에 데이터셋별로 특정한 전처리 변경 사항은 없었다. 딥러닝(DL) 모델의 일관된 처리를 위해 이미지들을 먼저 고정된 해상도로 크기를 조정하였다. 이는 두 데이터셋의 이미지들이 출처에 따라 해상도가 다양했기 때문에 필요한 단계였다. 크기 조정은 계산 효율성을 높이고 차원 불일치가 학습에 영향을 주는 것을 방지하였다. 두 번째 전처리 단계는 정규화였으며, 학습 중 그래디언트 업데이트를 안정화하기 위해 픽셀 값을 표준 범위로 스케일링하였다. 그 후 가우시안 필터링을 사용하여 문화 문양 구조를 방해할 수 있는 노이즈를 제거하였다. 묘족 배틱 데이터셋의 경우, 원래 데이터셋 출처에서 직접 얻은 기존 문화 문양 세그멘테이션 마스크를 수정 없이 시맨틱 세그멘테이션 학습 및 평가에 사용하였다. 본 연구를 위해 새로운 세그멘테이션 마스크를 별도로 생성하지는 않았다.
별도로 명시되지 않는 한, 기설정된 방법을 설명하는 방정식은 이전 연구들을 참조하여 조정되었으며 이에 따라 인용되었습니다. 제안된 CAFFM 및 복합 SegCycle-SPADE 최적화 프레임워크를 설명하는 방정식은 본 연구를 위해 저자들에 의해 개발되었습니다.
데이터셋의 입력 이미지를 식 1과 같이 나타낸다고 가정합니다:
(1)
여기에서 H, W, C는 각각 이미지의 높이, 너비 및 색상 채널 수를 나타냅니다. 모든 이미지는 식 2에 표시된 바와 같이 고정된 크기인 H′ × W′로 리사이징됩니다.

여기에서, I알겠습니다. 번역할 원문 텍스트를 제공해 주시기 바랍니다. 크기가 조정된 이미지입니다. 정규화된 픽셀 값은 다음과 같이 계산됩니다. 식 3:
(3)
이는 학습 과정을 안정화하는 데 도움이 됩니다. 노이즈 필터링은 식 4에 표시된 대로 가우시안 필터를 사용하여 수행됩니다:

여기서 G(σ)는 가우시안 필터이며 *는 컨볼루션을 나타냅니다. 표준 편차가 σ = 1.0인 5 × 5 커널 가우시안 필터가 사용되었습니다. 경계 아티팩트를 줄이기 위해 테두리 픽셀에 반사 패딩(reflective padding)을 적용하였습니다. 스케일링 및 정규화에 앞서, 이미지 로딩 직후에 노이즈 제거 공정을 수행하였습니다. 연구 전반에 걸쳐 균일한 전처리를 보장하기 위해, Miao Batik 및 WikiArt 데이터셋의 모든 이미지에 동일한 필터 설정을 적용하였습니다. Miao Batik 데이터셋의 경우, 세그멘테이션 마스크는 식 5에 따라 생성됩니다:

여기서 M은 SegFormer 모델을 안내하는 데 사용되는 세분화 마스크입니다.
그림 3에 나타낸 바와 같이, 전처리 파이프라인은 Miao Batik 데이터셋과 WikiArt 데이터셋에서 이미지를 획득하는 것으로 시작됩니다. 학습 과정에서 데이터 증강 기술은 사용되지 않았습니다. 크기 조정, 정규화, 가우시안 노이즈 제거 및 세그멘테이션 마스크 준비를 포함하는 전처리를 거친 후, 이미지들은 제안된 SegCycle-SPADE 프레임워크의 학습, 검증 및 테스트에 직접 사용되었습니다. 전처리 파이프라인의 첫 번째 단계는 이미지를 고정된 크기로 조정하는 것이며, 이를 통해 딥러닝 모델이 이미지를 더 효율적으로 처리할 수 있게 합니다. 두 번째 단계는 정규화 단계로, 픽셀 값을 표준화된 수치 범위로 변환하여 모델의 수렴을 돕습니다. 세 번째 단계는 노이즈 제거 단계로, 패턴 인식 능력을 향상시키기 위해 이미지에서 불필요한 노이즈를 제거합니다. 또한, Miao Batik 데이터셋의 경우 문화적 모티프 영역을 어노테이션하여 마스크를 생성하며, 이 마스크는 제안된 모델의 세그멘테이션 모듈에서 사용되어 생성 과정 동안 문화적 모티프가 보존되도록 합니다. 이 단계의 최종 결과물은 제안된 모델의 세그멘테이션 및 생성 모듈을 학습시키기에 적합한 정제된 데이터셋입니다.

그림 3. 문화유산 이미지의 데이터 전처리 파이프라인. 모델 학습 전에 적용된 이미지 전처리 절차를 보여주는 워크플로. 파이프라인에는 데이터셋 획득, 이미지 리사이징, 정규화, 가우시안 노이즈 제거, 기존 문화 모티프 주석 달기 및 세그멘테이션 마스크 준비가 포함됨. 처리된 결과 이미지와 마스크는 시맨틱 세그멘테이션 및 패턴 재구성을 위한 입력값으로 사용됨. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
모델 학습 전 모든 이미지에 대해 품질 관리 프로세스를 수행하였습니다. Miao Batik 데이터셋에는 15,148장의 이미지가 포함되어 있었습니다. 손상되었거나 중복된 샘플 및 저품질 샘플은 이미 원본 데이터셋 제작자에 의해 처리되었으므로, 본 연구의 품질 관리 스크리닝 과정에서 추가로 제외된 이미지는 없었습니다. 결과적으로 15,148장의 모든 이미지가 분석에 사용되었습니다. 전처리 과정에서 이미지는 RGB 형식으로 로드되었으며, 이선형 보간법(bilinear interpolation)을 사용하여 256 × 256 픽셀로 크기를 조정하였습니다. 픽셀 값은 255로 나누어 [0, 255] 범위에서 [0, 1] 범위로 스케일링하였습니다. 이후 빨강, 초록, 파랑 채널에 대해 각각 [0.485, 0.456, 0.406]의 평균값과 [0.229, 0.224, 0.225]의 표준 편차 값을 사용하여 채널별 정규화를 적용하였습니다. 전처리 파이프라인은 이미지 로드, RGB 변환, 크기 조정, 픽셀 값 스케일링, 정규화 및 텐서 변환으로 구성되었습니다. 필요한 경우, DL 모델과의 호환성을 유지하기 위해 그레이스케일 이미지를 3채널 RGB 형식으로 변환하였습니다. 전처리를 마친 후 이미지는 학습, 검증 및 테스트 서브셋으로 분할되었습니다. 세그멘테이션, 특징 융합, 모티프 재구성 및 SPADE 기반 예술적 합성을 포함한 SegCycle-SPADE 프레임워크의 모든 단계에서는 256 × 256 픽셀의 일관된 입력 해상도를 사용하였습니다.
SegFormer를 이용한 의미론적 패턴 분할
이 전처리 단계 이후, 정제 및 정규화된 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 WikiArt 데이터셋의 이미지는 제안된 SegFormer-B2 프레임워크 기반의 의미론적 분할 모듈로 입력됩니다. 이 단계의 목적은 문화유산 패턴에 존재하는 문화 모티프를 정확하게 식별하고 분리하는 것입니다. 제안된 SegFormer 프레임워크는 계층적 Transformer 인코더와 경량 MLP 디코더를 포함하는 Transformer 아키텍처를 기반으로 하여, 복잡한 문화유산 패턴으로부터 전역적 문맥 정보와 세부적인 구조 정보를 모두 정확하게 포착합니다. 모델은 먼저 입력 이미지에서 다중 스케일의 특징 표현을 추출한 다음, 디코더를 통해 이러한 표현들을 융합하여 정확하게 분할된 패턴을 생성합니다. 이를 통해 문화유산 이미지 내의 패턴이 기하학적 패턴, 꽃 패턴, 상징적 패턴과 같은 모티프로 정확하게 분할되어, 구조적 완전성을 유지하면서 배경으로부터 분리됩니다. 이렇게 얻은 구조 정보는 이후 SegCycle-SPADE 프레임워크 내의 패턴 생성 후반 단계에서 사용됩니다.
전처리된 입력 이미지를 식 6과 같이 나타냅니다:
(6)
SegFormer 인코더는 이미지를 패치로 분할하고, 식 71에 나타낸 바와 같이 트랜스포머 층을 사용하여 계층적 특징을 추출합니다.

여기서 F는 트랜스포머 인코더로부터 얻은 다중 스케일 특징 맵을 나타냅니다. 이러한 특징들은 모티프 영역 간의 국소적 텍스처 패턴과 전역적 문맥 관계를 모두 인코딩합니다. SegFormer 모델은 식 8에 정의된 대로 서로 다른 스케일의 특징 맵을 추출합니다.

다중 스케일 표현을 사용하면 문화적 모티프 내에서 다양한 크기의 패턴을 탐지하는 것이 용이해집니다. 마지막으로, 식 91에 표시된 것처럼 MLP 디코더를 사용하여 특징들을 결합합니다:

여기서 S는 최종 예측된 세분화 맵을 나타냅니다.
SegFormer-B2 백본은 ImageNet으로 사전 학습된 가중치를 사용하여 초기화되었으며, 이후 문화적 모티프 분할을 위해 Miao Batik 데이터셋으로 미세 조정되었습니다. 사전 학습된 체크포인트는 SegFormer의 공식 구현체에서 가져왔습니다. 구체적으로, 미세 조정 전 SegFormer-B2 백본을 초기화하기 위해 공식 SegFormer 저장소에서 제공하는 ImageNet-1K 사전 학습 MIT-B2 체크포인트(mit_b2.pth)를 사용하였습니다. 사전 학습된 가중치는 SegFormer 저자들이 공개한 MIT-B2 백본에 해당하며, 시맨틱 분할 학습을 위한 초기화 모델로 사용되었습니다. 그 외의 작업 특화 레이어들은 학습 전 PyTorch의 기본 가중치 초기화 절차를 통해 초기화되었습니다.
아키텍처에는 중첩 패치 임베딩을 갖춘 4단계 계층적 Transformer 인코더가 사용되었습니다. 초기 단계에서 패치 크기는 7 × 7, 스트라이드는 4로 설정되었습니다. 4개 인코더 단계 각각의 임베딩 차원은 64, 128, 320, 512였습니다. 4단계에 걸쳐 멀티헤드 셀프 어텐션 헤드 수는 각각 1, 2, 5, 8개였으며, 이에 상응하는 인코더 깊이는 3, 4, 6, 3 레이어였습니다. 인코더에서 추출된 다중 스케일 특징은 경량 all-MLP 디코더를 사용하여 집계되었습니다. 최종 세그멘테이션 맵을 생성하기 전, 디코더는 모든 인코더 단계의 특징을 단일 임베딩 공간으로 투영했습니다. 모든 Transformer 블록에는 Gaussian Error Linear Unit (GELU) 활성화 함수가 사용되었습니다. 일반화 성능을 높이고 과적합을 줄이기 위해 훈련 과정에서 0.1의 드롭아웃 비율이 적용되었습니다.
훈련 단계에서 SegFormer 프레임워크는 두 데이터셋 모두에서 전처리된 이미지를 입력받습니다. Miao Batik 데이터셋의 이미지는 세그멘테이션 모델의 지도 학습을 위한 라벨 역할을 하는 모티프 영역을 포함하고 있습니다. Transformer 인코더는 전체 이미지를 처리하고 이미지 구성 요소 간의 장거리 관계를 포착하는데, 이는 공간적으로 분산된 모티프를 포함하는 전통 바틱 패턴에서 특히 중요합니다. 계층적 특징 추출 메커니즘은 반복되는 기하학적 질감과 같은 국소 구조를 동시에 포착합니다. MLP 디코더는 이렇게 추출된 특징들을 처리하여 모티프 영역을 강조하는 세그멘테이션 마스크를 생성합니다. 이 단계에서 생성된 세그멘테이션 맵은 이후 어텐션 모듈과 패턴 재구성 단계의 구조적 입력값으로 사용되어, 생성된 패턴의 정통성을 유지하는 데 기여합니다.
문화적 모티프는 시각적 및 문화적 특성에 따라 시맨틱 세그멘테이션을 위해 서로 다른 클래스로 분류되었습니다. 세그멘테이션 분류 체계는 동물 모티프(예: 나비, 물고기, 새 및 기타 상징적 동물), 식물 모티프(예: 꽃, 잎, 덩굴 및 식물학적 패턴), 기하학적 모티프(예: 반복되는 모양, 테두리 및 추상적인 기하학적 구조), 그리고 모티프가 아닌 영역을 나타내는 배경 영역으로 구성되었습니다. 각 픽셀을 미리 정의된 클래스 중 하나에 할당하기 위해 픽셀 수준의 세그멘테이션 마스크가 사용되었습니다. 정수 레이블은 다음과 같이 인코딩되었습니다: 레이블 0 = 배경, 레이블 1 = 동물 모티프, 레이블 2 = 식물 모티프, 레이블 3 = 기하학적 모티프. 세그멘테이션 어노테이션과 모티프 레이블은 원본 Miao Batik 데이터셋 소스에서 직접 가져왔습니다. 본 연구에서는 추가적인 수동 어노테이션, 레이블 재설정, 경계 확인 또는 전문가 확인 절차를 수행하지 않았습니다. 데이터셋 제작자가 제공한 기존 어노테이션을 수정 없이 학습 및 평가에 사용하였습니다.
그림 4에 나타낸 바와 같이, 문화적 모티프 분할을 위한 SegFormer 모델은 트랜스포머 기반 메커니즘을 사용하여 Miao Batik 데이터셋과 WikiArt 데이터셋의 전처리된 이미지를 처리함으로써 문화적 패턴 영역을 정확하게 검출합니다. 먼저, 전통 문화 모티프가 포함된 입력 이미지가 SegFormer 모델에 제공됩니다. 트랜스포머 인코더는 이미지 패치로부터 전역적 문맥 정보와 지역적 구조 특징을 모두 추출합니다. 이렇게 생성된 다중 스케일 특징은 분할 디코더로 전달되며, 디코더는 Mix Feed-Forward Network를 활용하여 특징 표현을 정밀화하고 모티프 검출 성능을 향상시킵니다. SegFormer 모델의 출력은 무관한 배경 정보는 억제하고 문화적 패턴에 해당하는 픽셀을 강조하는 분할 마스크입니다. 이렇게 분리된 문화적 패턴은 이후 SegCycle-SPADE 프레임워크의 다음 단계에서 구조적 가이드 역할을 합니다.

그림 4SegFormer-B2 기반의 문화적 모티프 의미론적 분할. 문화 모티프 추출에 사용되었으며 묘족 바틱(Miao Batik) 데이터셋으로만 학습된 SegFormer-B2 시맨틱 세그멘테이션 모듈의 구조이다. 해당 프레임워크는 다중 스케일 특징 추출을 위한 트랜스포머 기반 인코더와 모티프 마스크 생성을 위한 경량 세그멘테이션 디코더로 구성된다. 모델은 동물, 식물, 기하학적 무늬, 배경의 네 가지 시맨틱 클래스를 예측하며, 결과로 생성된 세그멘테이션 마스크는 무관한 배경 정보는 억제하고 문화적으로 중요한 모티프 영역을 식별한다. 이러한 세그멘테이션 출력은 제안된 SegCycle-SPADE 프레임워크의 후속 단계인 특징 융합, 재구성 및 예술적 합성 단계에 구조적 가이드를 제공한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
제안된 프레임워크에서는 새로운 세그멘테이션 어노테이션을 생성할 필요가 없습니다. Miao Batik 데이터셋은 이미 존재하는 공개 소스에서 획득하였으며, 모델은 데이터셋 제작자가 제공한 관련 모티프 정보를 사용하여 학습되었습니다. 학습 과정 중에 SegFormer 모델이 시맨틱 세그멘테이션 맵을 생성하였습니다. 결과적으로, 본 연구에서는 별도의 수동 어노테이션 소프트웨어, 어노테이션 가이드라인 또는 어노테이션 품질 관리 절차가 필요하지 않았습니다.
CAFFM
시맨틱 세그멘테이션(semantic segmentation)의 특징과 생성적 재구성(generative reconstruction)의 표현 사이의 상호작용을 개선하기 위해, 본 연구에서는 CAFFM을 제안하였다. SegFormer-B2 인코더는 CAFFM 모듈에 시맨틱 특징 맵을 제공하며, CycleGAN 재구성 단계는 생성적 특징 맵을 제공한다. 먼저, 선형 투영 층을 사용하여 두 특징 스트림을 공통 임베딩 공간으로 투영한다. 교차 주의(cross-attention) 계산을 위해, 생성된 특징 텐서를 사용하여 쿼리(Q), 키(K), 값(V) 표현을 생성한다. 이후 멀티헤드 교차 주의를 통해 구조적 모티프 정보와 예술적 스타일 요소 간의 관계를 모델링한다. 그런 다음 융합된 특징 표현에 레이어 정규화, 잔차 연결 및 GELU 활성화 함수를 포함한 피드포워드 층을 적용한다. SPADE 기반 합성 단계는 CAFFM 모듈의 출력을 전달받아, 예술적 일관성을 유지하면서도 문화적으로 의미 있는 테마를 보존할 수 있게 한다.
특징 호환성을 보장하기 위해, 입력 특징들은 먼저 선형 투영 층을 통해 임베딩 차원이 256인 공유 임베딩 공간으로 투영됩니다. 그 다음, 시맨틱 구조 정보와 생성적 스타일 표현 사이의 상호 연결은 8개의 어텐션 헤드를 가진 MultiHead Cross-Attention 메커니즘을 사용하여 모델링됩니다. 교차 어텐션 계산에는 특정 선형 변환 층에서 생성된 Query (Q), Key (K), Value (V) 벡터가 사용됩니다. 학습 안정성을 높이고 특징의 무결성을 유지하기 위해, 잔차 연결과 레이어 정규화를 적용하여 융합된 특징 표현을 더욱 강화합니다. 이후 Gaussian Error Linear Unit (GELU) 활성화 함수가 포함된 피드 포워드 네트워크를 적용하여 비선형 특징 학습을 개선합니다. 이 모듈은 차원이 256인 출력 특징 표현을 생성하여 창의적 합성을 위해 다른 단계로 전달합니다. CAFFM은 교차 어텐션 기반의 융합 기술을 통해 예술적 스타일 데이터와 문화적 모티프 구조를 성공적으로 결합하며, 이를 통해 재구성된 문화유산 패턴의 모티프 보존력과 시각적 일관성을 향상시킵니다.
제안된 시스템에서 구조적 특징은 Miao Batik 데이터셋에서 도출되며, 스타일 특징은 WikiArt 데이터셋에서 학습됩니다. Miao Batik 데이터셋의 이미지를 사용하여 SegFormer 세그멘테이션 네트워크에서 도출된 특징 맵을 Fs로, WikiArt 이미지를 사용하는 스타일 특징 추출 분기에서 도출된 특징 맵을 Fa로 정의합니다. 제안된 CAFFM은 교차 주의(cross-attention) 메커니즘을 사용하여 두 특징 도메인을 결합함으로써 문화적 패턴의 구조적 및 스타일적 의존성을 모두 학습합니다. Table 3은 임베딩 차원, 정규화 층, 활성화 함수 및 어텐션 헤드 구성을 포함한 모든 아키텍처 특성을 나타냅니다. 256 × 256 픽셀의 입력 이미지 크기에 대해 SegFormer-B2 인코더는 64 × 64 × 128 크기의 시맨틱 특징 맵을 생성했으며, 스타일 특징 추출 분기는 64 × 64 × 128 크기의 특징 맵을 생성했습니다. 두 특징 맵은 교차 주의 융합 전, 학습 가능한 선형 층을 통해 차원이 256인 공유 임베딩 공간으로 투영되었습니다.
| 파라미터 | 설정 |
| 제안된 프레임워크 | SegCycle-SPADE |
| 시맨틱 세그멘테이션 모델 | SegFormer-B2 |
| SegFormer 인코더 단계 | 4 |
| 가중치 초기화 | ImageNet-1K 사전 학습된 SegFormer-B2 (MIT-B2 백본) |
| 체크포인트 출처 | 공식 NVIDIA SegFormer 리포지토리 (https://github.com/NVlabs/SegFormer); 체크포인트: segformer.b2.512x512.ade.160k |
| 미세 조정 전략 | Miao Batik 데이터셋에 대한 엔드 투 엔드 미세 조정 |
| 패치 임베딩 크기 | 7 × 7 |
| 패치 스트라이드 | 4 |
| 임베딩 차원 | 64, 128, 320, 512 |
| 인코더 깊이 | 3, 4, 6, 3 |
| 어텐션 헤드 | 1, 2, 5, 8 |
| 디코더 유형 | All-MLP 디코더 |
| 활성화 함수 | GELU |
| 드롭아웃 비율 | 0.1 |
| 특징 강화 모듈 | 교차 어텐션 문화 특징 융합 모듈 (Cross-Attention Cultural Feature Fusion Module, CAFFM) |
| CAFFM 임베딩 차원 | 256 |
| CAFFM 어텐션 헤드 | 8 |
| CAFFM 융합 스케일 | 4 |
| 재구성 모델 | CycleGAN |
| 스타일 생성 모델 | SPADE |
| 문화 데이터셋 | Miao Batik 데이터셋 |
| 스타일 데이터셋 | WikiArt 데이터셋 |
| Miao Batik 이미지 수 | 15,148 |
| WikiArt 이미지 수 | 약 80,000 |
| 입력 이미지 해상도 | 256 × 256 pixels |
| 색상 형식 | RGB |
| 보간법 | 쌍선형 보간법 (Bilinear Interpolation) |
| 노이즈 제거 방법 | 가우시안 필터링 |
| 가우시안 커널 크기 | 5 × 5 |
| 가우시안 시그마 (σ) | 1 |
| 정규화 범위 | [0, 1] |
| 배치 크기 | 16 |
| 에포크 수 | 100 |
| 옵티마이저 | Adam |
| 학습률 | 0.0002 |
| Adam 파라미터 | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0 |
| 손실 함수 | 세그멘테이션 손실, 적대적 손실, 사이클 일관성 손실, 재구성 손실, 모티프 보존 손실, 스타일 일관성 손실 |
| 데이터셋 분할 전략 | 훈련 / 검증 / 테스트 |
| 훈련 세트 | 70% |
| 검증 세트 | 15% |
| 테스트 세트 | 15% |
| 랜덤 시드 | 42 |
| 평가 지표 | 세그멘테이션 정확도, IoU, Dice 계수, SSIM, PSNR, FID |
| 프로그래밍 언어 | Python 3.8.10 |
| 딥러닝 프레임워크 | PyTorch 1.10.0 |
| 하드웨어 플랫폼 | NVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (11세대), 32 GB RAM |
| 운영 환경 | Ubuntu 20.04 LTS |
표 3: 실험 설정 및 모델 구성. 제안된 SegCycle-SPADE 프레임워크의 구현 및 평가에 사용된 아키텍처 구성 요소, 학습 설정, 전처리 설정, 데이터셋, 최적화 파라미터, 평가 지표 및 컴퓨팅 환경의 요약.
어텐션 모듈은 먼저 식 10을 사용하여 특성 맵을 쿼리, 키 및 밸류 표현으로 매핑합니다.

여기에, Wq, Wk, 그리고 Wv 학습 가능한 가중치 행렬입니다. 어텐션 가중치는 다음을 사용하여 쿼리 벡터와 키 벡터 사이의 유사성을 기반으로 계산됩니다. 식 1117:

여기서 dk는 키 벡터의 차원입니다. 강화된 특징 표현은 식 12를 사용하여 어텐션 가중치와 밸류 행렬을 곱함으로써 계산됩니다:

여기서 Fa는 특징 맵의 강화된 특징 표현입니다. 강화된 특징 표현은 식 13을 사용하여 어텐션 메커니즘으로 얻은 강화 특징을 원래의 세그멘테이션 특징과 결합하여 계산합니다:
여기서 Fe는 패턴 재구성에 사용되는 향상된 특징 맵입니다. CAFFM은 다양한 스케일의 문화적 모티프에 대한 특징을 추출하기 위해 멀티스케일 교차 주의 집중 메커니즘으로 확장됩니다. Fsi를 스케일 i에서의 세그멘테이션 특징으로, Faj를 동일한 스케일에서의 예술적 스타일 특징으로 정의합니다. 최종 특징 표현은 식 14를 사용하여 정의됩니다:

여기서 Qi, Ki, 그리고 Vi는 각각 스케일 i에서의 쿼리, 키, 값 행렬을 나타내며, N은 특징 스케일의 수를 나타냅니다. 본 연구에서는 N = 4이며, 이는 입력 이미지 크기의 1/4, 1/8, 1/16, 1/32 공간 해상도에서 추출된 특징 맵에 해당합니다. 이러한 다중 스케일 특징 표현은 재구성 및 예술적 합성과 이전에 학습 가능한 어텐션 가중치를 사용하여 융합되었습니다. 위의 확장을 통해 이 방법은 문화적 패턴을 재구성하기 위한 전역적인 문화적 모티프와 텍스처를 추출할 수 있습니다. CAFFM은 제안된 SegCycle-SPADE 시스템에서 SegFormer 기반의 세그멘테이션 단계와 SPADE 기반의 창의적 합성 단계 사이에 위치합니다. 먼저, CycleGAN이 스타일 및 패턴 관련 정보가 포함된 재구성 특징을 동시에 생성하는 동안, SegFormer-B2는 문화적 모티프의 구조적 특성을 묘사하는 시맨틱 특징 맵을 복구합니다. CAFFM 모듈은 이 두 특징 스트림을 입력받아 교차 어텐션 기반 융합을 통해 구조적 표현과 예술적 표현 사이의 관계를 식별합니다. 시맨틱 일관성과 구조적 특징을 유지하면서 문화적으로 정통한 패턴을 생성하기 위해, 결과로 도출된 융합 특징 맵은 이후 세그멘테이션 가이드 창의적 합성을 위해 SPADE 모듈로 전송됩니다.
CycleGAN을 이용한 패턴 재구성
어텐션 기반의 특징 강화 단계가 완료되면, 특징 맵에는 강화된 문화적 모티프 구조가 포함됩니다. 하지만 특징 맵에는 여전히 불완전하거나 손상된 패턴 영역이 포함되어 있을 수 있습니다. 따라서 패턴 재구성 문제를 해결하기 위해 제안된 프레임워크에서는 CycleGAN 모델을 사용합니다. 제안된 프레임워크에서 두 도메인은 원래의 문화적 모티프 패턴과 재구성된 문화적 모티프 패턴이 됩니다. 이전 단계에서 강화된 특징을 사용하여, CycleGAN 모델은 구조적 일관성을 유지하면서 문화적 패턴을 재구성합니다. 이를 통해 기하학적 패턴, 꽃무늬 패턴 및 상징적 패턴과 같은 문화적 패턴들이 공간적 배치를 유지하도록 합니다. 원래의 묘족 바틱(Miao Batik) 이미지는 불완전하거나 손상된 문화적 모티프를 생성하기 위해 무작위 마스킹 및 부분 가림 연산을 거쳤습니다. 이러한 퇴화 절차는 훼손된 문화 유산 유물에서 흔히 관찰되는 패턴 영역의 손실과 구조적 손상을 시뮬레이션했습니다. 퇴화된 이미지는 재구성 모듈의 입력값으로 사용되었으며, 이에 대응하는 원래 이미지는 성능 평가 및 재구성 품질 평가를 위한 참조 이미지로 사용되었습니다. 이러한 전략을 통해 모델은 의미적 일관성과 문화적 특성을 보존하면서 손실된 모티프 구조의 복원을 학습할 수 있었습니다.
X를 불완전한 문화적 패턴의 도메인이라 하고, Y를 재구성된 문화적 패턴의 도메인이라 합니다. 두 생성기는 식 15를 사용하여 양방향 매핑을 수행하도록 학습합니다.

여기서 GE는 모티프 구조를 재구성하는 데 사용되며, FM은 패턴을 원래의 도메인으로 다시 매핑하는 데 사용됩니다. 재구성된 패턴이 현실적인지 확인하기 위해 적대적 손실이 사용됩니다 (식 16)30

여기서 DY는 실제 패턴과 재구성된 패턴을 구별하는 데 사용되는 판별자이며, GE(x)는 생성된 재구성 패턴을 나타냅니다. 또한 CycleGAN은 문화적 모티프의 구조적 배치를 보존하기 위해 사이클 일관성을 강제합니다(식 17)30.

최종 손실 함수는 식 1830을 사용하여 정의됩니다:

여기서 λi는 사이클 일관성 손실(cycle-consistency loss)에 대한 가중 계수를 나타내며, 원래의 CycleGAN 정식화와 일관되게 훈련 과정 동안 10으로 설정되었습니다. 이 값은 적대적 학습과 소스 및 타겟 도메인 간의 재구성 일관성 사이의 균형을 맞추기 위해 선택되었습니다.
CycleGAN 재구성 모듈은 양방향 이미지 변환을 위해 두 개의 생성자와 두 개의 판별자로 구성됩니다. 각 생성자는 초기 7 × 7 합성곱 층, 이어서 두 개의 다운샘플링 합성곱 층, 9개의 잔차 블록(residual block), 그리고 두 개의 업샘플링 층으로 이루어진 잔차 네트워크 아키텍처를 따릅니다. 모든 합성곱 연산은 3 × 3 커널 크기를 사용하며, 다만 입력 층은 향상된 특징 추출을 위해 7 × 7 커널을 활용합니다. 훈련 안정성을 높이기 위해 각 합성곱 층 이후에 인스턴스 정규화(Instance Normalization)를 적용하며, 생성자 네트워크 전반에 걸쳐 ReLU 활성화 함수가 사용됩니다. 출력 층은 정규화된 이미지 출력을 생성하기 위해 Tanh 활성화 함수를 사용합니다. 판별자는 4 × 4 커널 크기의 합성곱 층들이 연속되며 특징 채널이 점진적으로 증가하는 70 × 70 PatchGAN 아키텍처를 따릅니다. 판별자에서는 특징 식별력과 적대적 학습을 개선하기 위해 인스턴스 정규화와 LeakyReLU 활성화 함수(음수 기울기 = 0.2)가 사용됩니다. CycleGAN 모듈은 전처리된 문화적 모티프 이미지를 입력으로 받아 재구성된 패턴 표현을 생성하며, 이는 이후 세그멘테이션 특징과의 통합을 위해 CAFFM으로 전달됩니다. CycleGAN 훈련은 Adam 최적화 도구(β₁ = 0.5, β₂ = 0.999)를 사용하여 초기 학습률 0.0002로 수행되었습니다. 학습률은 처음 100 에포크(epoch) 동안 유지되었으며, 이후 남은 훈련 기간 동안 0까지 선형적으로 감소시켰습니다. 판별자 훈련을 안정화하기 위해 이전에 생성된 이미지 50장이 포함된 리플레이 버퍼(replay buffer)를 사용하였습니다. 생성자와 판별자는 1:1 업데이트 비율로 업데이트되었으며, 각 훈련 반복 시 생성자 업데이트 한 번 후에 판별자 업데이트가 한 번 이루어졌습니다.
CycleGAN의 재구성 프로세스는 그림 5의 CAFFM 메커니즘을 사용하여 획득한 강화된 특징 맵(feature maps)을 기반으로 합니다. 이 특징 맵에는 이전 단계인 세그멘테이션과 CAFFM을 통해 얻은 강화된 문화적 모티프가 포함되어 있습니다. 특징 맵은 첫 번째 생성자인 GE의 입력값으로 사용됩니다. 첫 번째 생성자 GE는 문화적 패턴을 재구성하는 데 필요한 매핑을 학습합니다. 이후 출력값은 판별자 DY로 전달되어 실제 문화적 패턴과 재구성된 패턴을 구분합니다. 판별자 DY는 생성자 GE가 사실적인 출력물을 생성하도록 돕습니다. 재구성 과정에서 문화적 패턴이 왜곡되지 않도록 하기 위해, 두 번째 생성자인 FM이 사이클 일관성(cycle-consistency) 매핑을 수행합니다. 두 번째 생성자 FM은 출력값을 다시 원래의 도메인으로 매핑합니다. 그런 다음 출력값은 판별자에 의해 사실 여부가 평가됩니다. 최종 출력물은 이후 제안된 SegCycle-SPADE 프레임워크의 다음 단계인 예술적 스타일 생성을 위해 SPADE 모듈로 전달됩니다.

그림 5. CycleGAN 기반 패턴 재구성 워크플로. CycleGAN 재구성 모듈의 워크플로. 불완전한 문화적 모티프를 재구성하기 위해 어텐션 강화 특징 표현(attention-enhanced feature representations)이 생성 네트워크의 입력값으로 제공된다. 판별기는 재구성된 출력물을 참조 패턴과 비교하여 평가하며, 사이클 일관성 매핑(cycle-consistency mapping)은 양방향 이미지 변환 과정에서 구조적 무결성을 유지한다. 재구성된 모티프는 이후 예술적 스타일 합성을 위해 SPADE 모듈로 전달된다. 이 그림의 확대 버전을 보려면 여기를 클릭하십시오.
SPADE를 이용한 예술적 스타일 생성
이어서, 재구성된 문화적 모티프를 SPADE 모듈에 적용하여 예술적 스타일을 생성합니다. SPADE 모듈의 주요 목표는 모티프의 구조적 배치를 훼손하지 않으면서 재구성된 문화적 모티프에 시각적으로 풍부한 예술적 스타일의 질감을 추가하는 것입니다. SPADE 모듈은 이미지 생성을 위해 이미지 세그멘테이션 개념을 활용하는 조건부 이미지 생성 기술입니다. SegFormer-B2에서 생성된 시맨틱 세그멘테이션 마스크로부터 미리 정의된 모티프 클래스에 대응하는 다채널 시맨틱 맵을 인코딩하였습니다. SPADE 생성기는 이러한 인코딩된 맵을 조건부 입력으로 받습니다. 각 SPADE 레이어 내의 컨볼루션 레이어를 통해 시맨틱 맵을 처리함으로써 공간 적응형 스케일(γ) 및 편향(β) 파라미터를 생성하였습니다. 이를 통해 생성기는 정규화된 특징 활성화 값에 해당 파라미터들을 적용함으로써 예술적 합성 과정 동안 모티프의 경계, 구조적 배치 및 시맨틱 정보를 유지할 수 있었습니다. 조건부 프로세스가 SPADE 생성기의 여러 레이어에서 수행되었기 때문에 시맨틱 가이딩이 고수준의 구조적 재구성과 저수준의 질감 합성에 모두 영향을 줄 수 있었습니다. 그 결과, 생성된 예술적 패턴은 세그멘테이션 단계에서 발견된 문화적 모티프 구조를 유지하면서 WikiArt 데이터셋에서 얻은 스타일적 특성을 통합하였습니다.
르네상스, 인상주의, 입체주의, 표현주의, 초현실주의, 사실주의, 추상 미술 등 27가지의 서로 다른 예술 범주를 포함하는 WikiArt 데이터셋이 예술적 스타일을 이해하기 위한 주요 리소스로 사용되었습니다. 모델이 다양한 창의적 특성에 노출되어 스타일 일반화 성능을 향상시킬 수 있도록, 학습 과정에서 다양한 범주의 스타일 이미지들을 무작위로 선택하였습니다. 스타일 편향을 줄이기 위해 데이터셋은 예술 범주가 균형 있게 표현되도록 학습, 검증 및 테스트 서브셋으로 나누었습니다. 모든 27개 예술 범주의 균형 잡힌 표현을 보장하기 위해 층화 추출법이 사용되었습니다. 각 범주의 샘플은 원래의 클래스 분포를 유지하면서 학습, 검증 및 테스트 서브셋에 비례적으로 할당되었습니다. WikiArt 이미지에서 도출된 스타일 요소와 CycleGAN에서 생성된 재구성 특징을 병합하기 위해 CAFFM 모듈이 사용되었습니다. 합성 네트워크가 세그멘테이션 맵에서 도출된 시맨틱 구조와 문화적 모티프 경계를 유지하면서 예술적 특성을 전달할 수 있도록, 결과적으로 융합된 표현들이 SPADE 생성기에 조건부 정보로 제공되었습니다. 이러한 스타일 조건화 기법 덕분에 제안된 프레임워크는 일관된 구조적 및 스타일적 표현을 가진 문화적으로 정통한 예술적 패턴을 생성할 수 있었습니다.
SPADE는 또한 세그멘테이션 맵에 따라 달라지는 공간 적응형 파라미터를 도입합니다. 이 파라미터들은 식 191에 표시된 대로 정의될 수 있습니다.

여기서 γ(S)는 공간적으로 변화하는 스케일 파라미터이며, β(S)는 공간적으로 변화하는 바이어스 파라미터입니다. 이 파라미터들은 생성기가 이미지의 시맨틱 영역에 따라 서로 다른 질감과 스타일을 생성할 수 있도록 돕습니다. 최종 문화 예술 작품은 식 20에 나타난 바와 같이 정의될 수 있습니다:

여기서 GE는 SPADE 생성기, XrP는 재구성된 패턴, SM은 세그멘테이션 맵을 나타냅니다. 최종 결과물은 문화적 모티프의 구조적 무결성을 유지하면서 예술적 외관을 향상시킵니다. 제안된 SegCycle-SPADE 아키텍처를 최적화하기 위해 시맨틱 세그멘테이션 정확도, 문화적 모티프 보존, 패턴 재구성 품질 및 예술적 스타일 일관성의 균형을 맞춘 복합 손실 함수가 사용되었습니다. 전체 학습 목표를 설정하기 위해 세그멘테이션 손실(Lseg), 적대적 손실(Ladv), 사이클 일관성 손실(Lcycle), 재구성 손실(Lrecon), 모티프 보존 손실(Lmotif) 및 스타일 일관성 손실(Lstyle)의 가중치 혼합이 사용되었습니다. 총 손실 함수는 식 21에 정의되어 있습니다:
(21)
입력 문화 모티프와 재구성된 문화 모티프 사이의 구조적 일관성을 보장하기 위해, 사이클 일관성 손실 계수는 10으로 설정되었습니다. 세밀한 모티프 특징을 유지하고 시각적 정확도를 높이기 위해, 재구성 손실 계수는 5로 설정되었습니다. 예술적 합성과정에서 문화적으로 필수적인 구조적 패턴의 보존을 강조하기 위해, 모티프 보존 손실에는 2의 계수가 사용되었습니다. 의미론적 모티프 구조를 과도하게 왜곡하지 않으면서 예술적 스타일 전이를 촉진하기 위해, 스타일 일관성 손실 계수는 1로 조정되었습니다. 실사 이미지 생성과 정밀한 모티프 세그멘테이션 사이의 균형 잡힌 기여도를 유지하기 위해, 세그멘테이션 손실과 적대적 손실에 동일한 가중치를 부여했습니다. 스타일 일관성 손실을 계산하는 데는 WikiArt 데이터셋의 특징 기반 스타일 표현이 사용되었습니다. 특히, 심층 특징 맵에서 추출한 Gram 행렬 상관관계를 사용하여 예술적 스타일 특성을 포착했습니다. Equation 22에 나타난 바와 같이, 타겟 스타일 이미지와 생성된 이미지의 Gram 행렬 간의 Frobenius 노름 차이를 이용하여 스타일 손실을 계산했습니다.

여기에서, G제공된 텍스트가 없습니다. 번역할 내용을 입력해 주세요. Gram 행렬이 ~로부터 계산되었습니까? 제공된 텍스트가 없습니다. 번역할 내용을 입력해 주세요.th 피처 레이어, I제네레이터(gen) 생성된 예술적 이미지를 나타내며, 나스타일 WikiArt 데이터셋의 타겟 스타일 이미지를 나타내며, F 는 프로베니우스 노름(Frobenius norm)을 나타냅니다. 이러한 공식화를 통해 제안된 프레임워크는 문화적 모티프의 구조적 및 의미론적 무결성을 유지하면서 예술적 특성을 보존할 수 있습니다.
CAFFM 모듈에 의해 생성된 융합 특징 표현은 제안된 프레임워크의 예술적 합성 구성 요소 역할을 하는 SPADE 모듈의 조건부 입력으로 사용됩니다. SPADE 생성기는 256 채널의 잠재 특징 차원을 가진 7개의 SPADE 잔차 블록으로 구성되며, 256 × 256 픽셀 해상도의 출력 이미지를 생성합니다. SegFormer–CAFFM 모듈에서 얻은 시맨틱 분할 맵은 SPADE 잔차 레이어 전반에 걸쳐 조건부 입력으로 사용됩니다. SPADE 레이어는 각 잔차 블록 내의 활성화 함수 이전에 적용되어 분할 기반의 시맨틱 조건화가 가능하게 합니다. 연속적인 업샘플링 및 컨볼루션 연산을 통해 잠재 특징 표현이 점진적으로 정교해지며, 시맨틱 일관성과 모티프 구조를 유지하면서 고해상도 예술 패턴을 생성합니다. 생성기 전반에는 LeakyReLU 활성화 함수가 사용되며, 출력 레이어에는 정규화된 이미지를 생성하기 위해 Tanh 활성화 함수가 적용됩니다.
알고리즘 및 워크플로
SegCycle-SPADE 프레임워크는 시맨틱 세그멘테이션, 특징 융합, 패턴 재구성 및 예술적 스타일 합성을 하나의 통합된 훈련 파이프라인 내에 통합합니다. 워크플로는 이미지 크기 조정, 정규화, 노이즈 제거 및 세그멘테이션 마스크 준비를 포함한 데이터셋 획득 및 전처리부터 시작됩니다. 전처리된 이미지는 이후 SegFormer-B2 세그멘테이션 네트워크를 통해 처리되어 시맨틱 모티프 표현을 추출합니다. 결과로 얻은 세그멘테이션 특징은 CAFFM을 통해 재구성 특징과 융합되어, 구조적 모티프 정보와 예술적 특징 표현 간의 상호작용을 가능하게 합니다. 융합된 특징 맵은 이어서 CycleGAN 재구성 모듈로 전달되며, 이 모듈은 시맨틱 일관성을 유지하면서 불완전한 문화적 모티프 구조를 복원합니다. 재구성된 패턴은 이후 세그멘테이션 가이드 기반의 예술적 합성을 위해 SPADE 생성기에 제공되어, 모티프 경계와 구조적 진정성을 유지하면서 스타일적 향상을 가능하게 합니다. 훈련 과정에서 모델 파라미터는 식 21 및 22에 기술된 복합 손실 함수를 사용하여 최적화되며, 이는 세그멘테이션 정확도, 모티프 보존, 재구성 품질 및 예술적 스타일 일관성 사이의 균형을 맞춥니다. 데이터셋 로딩, 전처리, 모델 초기화, 훈련 반복, 검증 절차, 체크포인트 선택 및 최종 평가를 포함한 상세한 단계별 구현 워크플로는 보충 파일 1 (알고리즘 1)에 제공됩니다. 전체 알고리즘 워크플로는 배치 크기 16, 학습률 0.0002 및 100회의 훈련 에포크를 사용하여 구현되었습니다. 데이터셋 분할, 모델 초기화 및 모든 훈련 실험에는 42의 고정된 랜덤 시드가 사용되었습니다. 재현성을 보장하기 위해 이 시드는 Python, NumPy 및 PyTorch 랜덤 숫자 생성기에 일관되게 적용되었습니다. Adam 옵티마이저는 β₁ = 0.5, β₂ = 0.999로 설정되었으며 가중치 감쇠는 적용하지 않았습니다 (weight decay = 0). 모델 체크포인트는 검증 데이터셋에서 달성한 가장 높은 검증 IoU 점수를 기준으로 선택되었습니다.
손실 함수 최적화
재구성 및 예술적 합성 과정에서 문화적 모티프 구조를 보존하기 위해, 제안된 프레임워크는 세그멘테이션, 적대적, 사이클 일관성, 재구성, 모티프 보존 및 스타일 일관성 손실을 결합한 복합 최적화 목적 함수를 사용합니다. 전체 수학적 공식, 가중치 계수 및 스타일 손실 정의는 SPADE를 이용한 예술적 스타일 생성 하위 섹션의 수식 21 및 22에 제공되어 있습니다. 모티프 보존 구성 요소는 예측된 모티프 영역과 이에 해당하는 정답(ground-truth) 세그멘테이션 마스크 간의 구조적 편차에 대해 패널티를 부여함으로써, 재구성 프로세스 전반에 걸쳐 문화적으로 중요한 패턴 구조가 보존되도록 유도합니다.
제안된 SegCycle-SPADE 프레임워크는 묘족 바틱(Miao Batik) 문화 문양 데이터셋과 WikiArt 데이터셋의 두 가지 데이터셋을 사용하여 평가되었습니다. 묘족 바틱 데이터셋은 전통 문화유산 이미지를 포함하고 있으며 주로 시맨틱 세그멘테이션 및 구조적 재구성 작업에 사용된 반면, WikiArt 데이터셋은 다양한 예술적 스타일을 포함하고 있어 예술적 스타일 학습 및 생성에 사용되었습니다. 두 데이터셋의 이미지는 시맨틱 세그멘테이션, CAFFM, 패턴 재구성 및 SPADE 기반 예술적 스타일 생성을 포함하는 전체 SegCycle-SPADE 파이프라인을 통해 처리되었습니다. 문화 문양 정보와 예술적 스타일 표현의 통합을 통해, 본 프레임워크는 문화적으로 의미 있고 시각적으로 일관된 결과물을 생성할 수 있었습니다.
모든 실험은 Intel Core i7 프로세서와 NVIDIA GPU가 장착된 GPU 지원 워크스테이션에서 수행되었습니다. 구체적으로, Intel Core i7(11세대) CPU, 24 GB VRAM의 NVIDIA RTX 3090 GPU 및 32 GB 시스템 메모리가 장착된 워크스테이션에서 실험을 진행하였습니다. 모델은 Python 3.8 및 CUDA 가속이 적용된 PyTorch 1.10을 사용하여 구현하였습니다. 학습은 분산 학습 없이 단일 GPU 설정으로 수행되었습니다. 모든 실험 전반에 걸쳐 표준 FP32 정밀도를 사용하였으며, 혼합 정밀도 학습은 적용하지 않았습니다. Adam 옵티마이저를 사용하여 배치 크기 16으로 100 에포크 동안 학습을 진행하였습니다. 표 3은 본 연구에 사용된 구현 파라미터와 계산 환경을 요약하여 보여줍니다.
제안된 아키텍처는 시맨틱 세그멘테이션을 위한 SegFormer-B2, 특징 융합을 위한 CAFFM, 모티프 재구성을 위한 CycleGAN, 그리고 예술적 스타일 합성을 위한 SPADE라는 네 가지 주요 구성 요소로 이루어져 있습니다. 두 데이터셋의 이미지는 학습 전 256 × 256 픽셀로 크기가 조정되었습니다. 이러한 표준화된 해상도는 중요한 모티프 세부 사항을 보존하는 동시에 계산 효율성을 보장하며, CycleGAN과 SPADE 모듈 모두의 안정적인 적대적 학습에 기여하였습니다.
제안된 프레임워크의 성능은 Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR 및 FID를 포함한 세그멘테이션 및 이미지 품질 평가 지표를 사용하여 평가되었습니다. 시각적 진위성은 생성된 문화적 패턴의 시각적 검사를 통해 정성적으로 평가되었습니다. 정성적 평가는 참조 문화 모티프와 비교하여 모티프 보존, 의미론적 일관성, 문화적 특성 및 예술적 외관에 중점을 두었습니다. 시각적 진위성은 독립적인 정량적 평가 지표로 사용되지 않았습니다.
제안된 프레임워크의 정량적 평가는 다음의 지표들을 사용하여 수행되었습니다.
세그멘테이션 정확도(Segmentation Accuracy)는 식 23을 사용하여 계산되었습니다:

여기서 TP, TN, FP, FN은 각각 진양성, 진음성, 위양성, 위음성을 나타냅니다.
IoU는 식 24를 사용하여 계산되었습니다:

Dice 유사도 계수(Dice)는 식 25를 사용하여 계산하였습니다:

지각적 이미지 유사도를 평가하기 위해 SSIM을 사용하였으며, 이는 식 2633으로 정의됩니다:
(26)
여기서 μ는 평균 강도를, σ는 분산을, σxy는 이미지 간의 공분산을 나타내며, C1과 C2는 안정화 상수입니다.
PSNR은 생성된 이미지의 품질을 평가하는 데 흔히 사용되는 지표이며, 식 2733과 같이 정의됩니다:

여기서 MaxI는 이미지의 가능한 최대 픽셀 값을 나타내며, MSE는 원본 이미지와 재구성된 이미지 사이의 평균 제곱 오차를 의미합니다.
FID는 Equation 2833에서와 같이 평균과 공분산 행렬을 사용하여 계산할 수 있습니다.
(28)
여기서 μr은 실제 이미지의 평균값, μg은 생성된 이미지의 평균값이며, Σr과 Σg는 각각 실제 이미지와 생성된 이미지의 공분산 행렬입니다.
성능 비교를 위해, 제안된 프레임워크를 시맨틱 세그멘테이션, 이미지 재구성 및 예술적 이미지 생성에 일반적으로 사용되는 대표적인 방법들과 비교하여 평가하였습니다. 세그멘테이션 베이스라인으로 U-Net과 DeepLabV3+를 포함하였으며, 재구성 베이스라인으로는 Pix2Pix와 CycleGAN을 포함하였습니다. 예술적 이미지 생성의 대표적인 방법으로는 StyleGAN과 AttentionGAN이 사용되었습니다. 이러한 비교는 예술적 품질을 높이는 동시에 구조적 모티프 정보를 보존하는 SegCycle-SPADE의 효과를 평가하기 위해 수행되었습니다.
성능 안정성과 재현성을 평가하기 위해 각 실험을 5회 반복하였습니다. 모든 실험에서 일관된 훈련, 검증 및 테스트 서브셋을 보장하기 위해 데이터셋 분할 시 42의 고정된 랜덤 시드를 사용하였습니다. 결과는 평균 ± 표준편차로 보고되었습니다. Accuracy, IoU, Dice, SSIM, PSNR 및 FID에서 관찰된 낮은 표준편차 값은 제안된 프레임워크가 반복된 실험 실행 전반에서 안정적인 성능을 달성했음을 나타냅니다. 통계적 유의성은 paired t-test를 사용하여 평가하였으며, p < 0.05일 때 통계적으로 유의미한 차이가 있는 것으로 간주하였습니다. 모든 모델이 동일한 데이터셋 분할본으로 평가되었으므로, 반복 실행 간의 짝지어진 성능 측정값이 얻어졌으며 이는 paired t-test 사용의 근거가 되었습니다. 다중 쌍별 비교와 관련된 가족오류율(family-wise error rate)을 제어하기 위해 Bonferroni 교정을 적용하였으며, 통계적 유의성은 adjusted threshold인 α/n을 사용하여 결정하였습니다(여기서 n는 쌍별 비교 횟수를 나타냄).
실험 결과는 제안된 SegCycle-SPADE 프레임워크의 효과를 강력하게 뒷받침합니다. SegFormer-B2가 달성한 우수한 세그멘테이션 성능은 문화적으로 중요한 모티프 경계를 정확하게 식별하고 보존하는 능력을 입증합니다. IoU 및 Dice 점수의 향상은 처리 파이프라인 전반에 걸쳐 세만틱 모티프 구조가 효과적으로 보존되었음을 추가로 나타냅니다. CycleGAN과 SPADE의 통합은 개선된 SSIM 및 PSNR 값에서 알 수 있듯이 미세한 시각적 세부 사항을 유지하면서 불완전한 모티프 구조를 성공적으로 재구성했습니다. 또한, 더 낮은 FID 점수는 생성된 예술적 패턴이 실제 문화 및 예술 이미지와 더 높은 유사성을 보임을 나타내며, 이는 스타일적 일관성과 시각적 사실성이 향상되었음을 시사합니다.
CAFFM은 세그멘테이션으로 도출된 구조적 정보와 생성적 스타일 표현 사이의 효과적인 상호작용을 촉진함으로써 이러한 개선에 크게 기여했습니다. 교차 주의 집중(cross-attention) 기반의 특징 융합을 통해 CAFFM은 문화적 모티프 간의 장거리 관계를 유지하면서 구조적 충실도와 예술적 진정성을 모두 향상시켰습니다.
그림 6은 Miao Batik 및 WikiArt 데이터셋에 대해 제안된 SegCycle-SPADE 프레임워크와 기존 방법들 간의 세그멘테이션 정확도 비교를 보여줍니다. U-Net 및 DeepLabV3+와 같은 전통적인 세그멘테이션 방식은 공간적 표현을 학습하는 능력 덕분에 경쟁력 있는 성능을 달성했습니다. 하지만 Pix2Pix와 CycleGAN은 세그멘테이션 작업 전용으로 설계되지 않았기 때문에 더 낮은 세그멘테이션 정확도를 보였습니다. 제안된 SegCycle-SPADE 프레임워크는 SegFormer-B2 및 CAFFM 기반의 특징 강화(feature enhancement)를 통합함으로써 두 데이터셋 모두에서 가장 높은 세그멘테이션 정확도를 달성했습니다.

그림 6. 다양한 방법 간의 분할 정확도 비교. Miao Batik 및 WikiArt 데이터셋에서 U-Net, DeepLabV3+, Pix2Pix, CycleGAN 및 제안된 SegCycle-SPADE 프레임워크를 사용하여 얻은 분할 정확도 비교. 결과는 5회의 독립적인 실행(n = 5)에서 얻은 평균 ± 표준 편차(SD)로 나타내었다. 오차 막대는 1 표준 편차를 나타낸다. 값이 높을수록 분할 성능이 향상되었음을 의미한다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 분할 정확도를 달성하였다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
그림 7은 평가된 방법들 간의 IoU 비교를 보여줍니다. U-Net과 DeepLabV3+는 세그멘테이션 중심의 아키텍처 덕분에 강력한 오버랩 성능을 달성했습니다. 반면, Pix2Pix와 CycleGAN은 주요 목적이 시맨틱 세그멘테이션이 아닌 이미지 변환이기 때문에 더 낮은 IoU 값을 나타냈습니다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 IoU 값을 달성하였으며, 이는 문화적 모티프 영역의 국소화 및 보존 능력이 향상되었음을 나타냅니다.

그림 7. 문화적 모티프 세그멘테이션을 위한 Intersection over Union (IoU) 점수 비교. Miao Batik 및 WikiArt 데이터셋에서 세그멘테이션 방법 간의 IoU 성능 비교. 결과는 5회의 독립적인 실행(n = 5)에 대한 평균 ± 표준 편차(SD)로 나타내었다. 오차 막대는 1 표준 편차를 나타낸다. IoU 값이 높을수록 예측된 모티프 영역과 참조 모티프 영역 간의 중첩도가 향상되고 모티프 경계가 더 잘 보존되었음을 나타낸다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 IoU 점수를 달성하였다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
그림 8은 Dice 유사도 계수(Dice Similarity Coefficient)의 비교 결과를 보여줍니다. Dice는 예측된 분할 마스크와 실제 정답(ground-truth) 모티프 영역 간의 중첩 정도를 측정합니다. 기존의 분할 방식들은 공간적 구조를 학습하는 능력이 뛰어나 상대적으로 높은 Dice 점수를 기록했습니다. 하지만 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 Dice 점수를 달성하여, 분할 일관성과 모티프 보존 능력이 향상되었음을 입증했습니다.

그림 8. 문화적 문양 분할에 대한 Dice 계수 비교. Miao Batik 및 WikiArt 데이터셋에서 서로 다른 분할 접근 방식을 사용하여 얻은 Dice 계수 값의 비교. Dice 계수는 예측된 분할 마스크와 참조 마스크 사이의 중첩도를 평가하며, 값이 높을수록 분할 성능과 문양 영역 식별 능력이 향상되었음을 나타냅니다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 Dice 계수 값을 달성했습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
그림 9는 재구성된 문화적 패턴 간의 SSIM 비교 결과를 보여줍니다. Pix2Pix, CycleGAN, StyleGAN과 같은 GAN 기반 방법들은 이미지 생성을 위해 설계되었기 때문에 전통적인 세그멘테이션 방법보다 더 높은 SSIM 값을 달성했습니다. 그럼에도 불구하고, 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 SSIM 값을 기록하여, 구조적 세부 사항과 예술적 일관성을 우수하게 보존함을 나타냈습니다.
그림 9. 구조적 유사도 지수(SSIM) 비교. Miao Batik 및 WikiArt 데이터셋에 대해 서로 다른 재구성 방법을 사용하여 얻은 구조적 유사도 지수(SSIM) 값의 비교. 결과는 5회의 독립적인 실행(n = 5)에서 얻은 평균 ± 표준 편차(SD)로 나타내었다. 오차 막대는 1 표준 편차를 나타낸다. SSIM 값이 높을수록 재구성된 패턴과 참조 패턴 사이의 구조적 유사도가 더 높음을 의미한다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 SSIM 점수를 달성하였다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
생성된 예술적 패턴의 사실성과 분포 유사성을 평가하기 위해 FID를 사용하였습니다. FID 계산은 사전 학습된 Inception-v3 네트워크를 사용하여 수행되었으며, pool3 레이어에서 특징 벡터를 추출하여 2048차원의 특징 표현을 얻었습니다. 특징 추출 전, 생성된 이미지와 참조 이미지는 bilinear interpolation을 사용하여 299 × 299 픽셀로 크기를 조정하였고, 표준 Inception-v3 전처리 프로토콜에 따라 정규화하였습니다. FID는 독립 테스트 데이터셋에서 추출된 특징 분포를 사용하여 계산되었습니다. 평균 및 공분산 통계량은 특징 임베딩으로부터 추정되었으며, 표준 FID 공식 내에서 사용되었습니다.
표 4에 나타난 바와 같이, Pix2Pix 및 CycleGAN과 같은 기존의 이미지 생성 방식은 명시적인 구조적 안내가 부족하여 상대적으로 높은 FID 점수를 기록했습니다. StyleGAN과 AttentionGAN은 개선된 특징 학습 능력을 통해 더 낮은 FID 점수를 달성했습니다. 그러나 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 낮은 FID 점수를 기록하여, 이미지의 사실성, 스타일 일관성 및 문화적 모티프 보존 능력이 우수함을 입증했습니다.
| 방법 | Miao Batik 데이터셋 (FID) | WikiArt 데이터셋 (FID) |
| Pix2Pix | 48.6 | 52.3 |
| CycleGAN | 42.8 | 46.5 |
| StyleGAN | 39.7 | 43.1 |
| AttentionGAN | 36.9 | 40.4 |
| SegCycle-SPADE (제안된 방법) | 28.5 | 31.2 |
표 4: 문화적 패턴 재구성을 위한 Frechet Inception Distance (FID) 결과. Miao Batik 및 WikiArt 데이터셋에서 제안된 SegCycle-SPADE 프레임워크와 베이스라인 생성 모델을 통해 얻은 Frechet Inception Distance (FID) 점수의 비교. FID 값이 낮을수록 생성된 이미지와 실제 이미지의 특징 분포 사이의 유사성이 높음을 나타내며, 따라서 재구성된 문화적 패턴의 시각적 사실감이 향상되었음을 반영한다.
그림 10은 서로 다른 방법론에 의해 달성된 복원 품질을 비교한 것이다. 복원 품질(%)은 복원된 이미지와 그에 해당하는 참조 이미지 사이의 SSIM을 백분율 척도로 변환하여 계산하였다(SSIM × 100). 백분율이 높을수록 원래의 문화적 문양에 대한 구조적 충실도와 시각적 유사성이 더 높음을 나타낸다. Pix2Pix 및 CycleGAN과 같은 기존 생성 모델은 중간 정도의 복원 성능을 보였다. StyleGAN 및 AttentionGAN을 포함한 더 진보된 아키텍처는 향상된 특징 학습 능력 덕분에 개선된 복원 품질을 달성하였다. 그러나 제안된 SegCycle-SPADE 프레임워크는 시맨틱 세그멘테이션 가이드, 교차 주의 집중 특징 융합, 복원 학습 및 예술적 합성이 통합되었기 때문에 가장 높은 복원 품질을 달성하였다.

그림 10. 패턴 재구성 품질 비교. Miao Batik 및 WikiArt 데이터셋에서 Pix2Pix, CycleGAN, StyleGAN, AttentionGAN 및 제안된 SegCycle-SPADE 프레임워크를 사용하여 달성한 재구성 품질의 비교 결과이다. 결과는 5회의 독립적인 실행(n = 5)에서 얻은 평균 ± 표준 편차(SD)로 나타내었다. 오차 막대는 1 표준 편차를 나타낸다. 값이 높을수록 구조적 세부 사항, 의미적 일관성 및 시각적 충실도의 보존 능력이 향상되었음을 의미한다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 재구성 품질 점수를 기록하였다. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.
재구성된 이미지와 그에 대응하는 참조 이미지 간의 픽셀 수준 유사도를 측정하여 재구성 충실도를 평가하기 위해 PSNR을 사용하였습니다. PSNR은 각 재구성된 이미지와 정답 참조로 사용된 해당 원본 묘족 바틱(Miao Batik) 이미지 사이에서 계산되었습니다. PSNR 값이 높을수록 재구성 오차가 낮음을 나타냅니다. Table 5에 나타난 바와 같이, Pix2Pix와 CycleGAN은 명시적인 구조적 가이드 없이 패턴을 재구성했기 때문에 중간 정도의 PSNR 값을 기록하였습니다. StyleGAN과 AttentionGAN은 더 깊은 특징 학습을 통해 더 높은 PSNR 값을 달성하였습니다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 PSNR 값을 달성하여, 탁월한 재구성 충실도와 문화적 모티프 구조의 보존 능력을 입증하였습니다.
| 방법 | Miao Batik 데이터셋 (PSNR, dB) | WikiArt 데이터셋 (PSNR, dB) |
| Pix2Pix | 25.8 | 24.6 |
| CycleGAN | 27.3 | 26.1 |
| StyleGAN | 28.7 | 27.5 |
| AttentionGAN | 29.9 | 28.6 |
| SegCycle-SPADE (제안함) | 32.4 | 31.2 |
표 5: 문화적 패턴 재구성을 위한 최대 신호 대 잡음비(PSNR) 결과. Miao Batik 및 WikiArt 데이터셋에서 제안된 SegCycle-SPADE 프레임워크와 베이스라인 방법들로 얻은 최대 신호 대 잡음비(PSNR) 값의 비교. PSNR 값이 높을수록 해당 참조 이미지 대비 재구성 충실도가 향상되고 왜곡이 감소했음을 나타낸다.
그림 11 은 학습 과정 중 제안된 SegCycle-SPADE 프레임워크의 수렴 동작을 보여줍니다. 손실 곡선은 5회의 독립적인 학습 실행에서 평균한 평균 학습 손실을 나타냅니다. 확률적 변동성을 줄이고 학습 수렴의 더 견고한 표현을 제공하기 위해, 모든 실행에 대해 각 에포크에서의 손실 값을 평균하였습니다. 초기 학습 에포크 동안에는 모델이 입력 데이터로부터 특징 표현을 학습하는 단계였으므로 손실 값이 상대적으로 높았습니다. 학습이 진행됨에 따라 모든 손실 구성 요소가 점진적으로 감소하고 안정화되었으며, 이는 세그멘테이션, 재구성 및 예술적 합성 목표의 최적화가 성공적으로 이루어졌음을 나타냅니다. 관찰된 수렴 동작은 학습 과정 중 제안된 프레임워크의 효과성, 안정성 및 재현성을 입증합니다.

그림 11. 제안된 SegCycle-SPADE 프레임워크의 훈련 수렴. 5회의 독립적인 훈련 실행(n = 5)에 대해 평균을 낸, 100회의 훈련 epoch 동안 제안된 SegCycle-SPADE 프레임워크의 훈련 손실 곡선이다. 이 그림은 훈련 과정 중 전체 손실(LTotal), 세그멘테이션 손실(LSeg), 생성기 손실(LG) 및 판별기 손실(LD)의 변화를 보여준다. 모든 손실 구성 요소가 점진적으로 감소한 후 안정화되는 것은 제안된 프레임워크의 성공적인 수렴과 안정적인 최적화를 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
소거 연구(Ablation Study)
제안된 SegCycle-SPADE 프레임워크 내 각 구성 요소의 기여도를 평가하기 위해, 여러 제어된 모델 구성을 사용하여 소거 연구를 수행하였다. 그 결과는 표 6 및 7에 요약되어 있다.
| 모델 구성 | 세그멘테이션 정확도 (%) | IoU | SSIM |
| SegFormer 단독 | 87.3 | 0.76 | 0.82 |
| SegFormer + CAFFM | 89.6 | 0.79 | 0.86 |
| SegFormer + CAFFM + CycleGAN | 91.4 | 0.82 | 0.89 |
| SegFormer + CAFFM + CycleGAN + SPADE (제안됨) | 93.8 | 0.86 | 0.93 |
표 6: SegCycle-SPADE 구성 요소의 어블레이션 연구. 개별 프레임워크 구성 요소의 기여도를 평가하기 위해 점진적으로 향상된 모델 구성의 성능을 비교함. 본 연구에서는 시맨틱 세그멘테이션, 교차 주의 집중 문화적 특징 융합 모듈(CAFFM), CycleGAN 기반 재구성 및 SPADE 기반 예술적 합성이 세그멘테이션 정확도, IoU(Intersection over Union) 및 SSIM(Structural Similarity Index)에 미치는 영향을 조사함. 값이 높을수록 모티프 세그멘테이션, 재구성 품질 및 구조적 보존 능력이 향상되었음을 나타냄.
| 변체 | IoU (%) | Dice (%) | SSIM | PSNR (dB) | FID ↓ |
| SegFormer 단독 | 84.2 ± 0.4 | 88.5 ± 0.3 | 0.82 ± 0.01 | 24.8 ± 0.2 | 31.8 ± 0.6 |
| SegFormer + CycleGAN | 86.7 ± 0.3 | 90.2 ± 0.2 | 0.85 ± 0.01 | 26.3 ± 0.2 | 27.5 ± 0.5 |
| SegFormer + SPADE | 87.0 ± 0.3 | 90.5 ± 0.2 | 0.88 ± 0.01 | 27.8 ± 0.2 | 23.4 ± 0.4 |
| SegFormer + CAFFM | 90.0 ± 0.2 | 93.1 ± 0.2 | 0.90 ± 0.01 | 29.6 ± 0.1 | 20.3 ± 0.3 |
| SegCycle-SPADE (전체 모델) | 93.0 ± 0.2 | 95.4 ± 0.1 | 0.92 ± 0.01 | 31.2 ± 0.1 | 17.6 ± 0.2 |
표 7: 제안된 SegCycle-SPADE 프레임워크의 구성 요소 기여도 분석. CAFFM, CycleGAN, SPADE 및 전체 SegCycle-SPADE 아키텍처의 기여도를 평가하기 위해 사용된 개별 프레임워크 변형 모델의 성능 비교. 결과는 Intersection over Union (IoU), Dice 계수, Structural Similarity Index (SSIM), Peak Signal-to-Noise Ratio (PSNR) 및 Frechet Inception Distance (FID)를 사용하여 보고되었다. IoU, Dice, SSIM 및 PSNR 값이 높을수록 세그멘테이션 및 재구성 품질이 향상되었음을 나타내며, FID 값이 낮을수록 생성된 문화 패턴의 시각적 사실성이 더 높음을 나타낸다.
표 6은 네 가지 구성으로 주요 프레임워크 구성 요소의 누적 기여도를 평가합니다: (i) SegFormer 단독, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, 그리고 (iv) SegFormer + CAFFM + CycleGAN + SPADE (제안된 프레임워크). 베이스라인인 SegFormer 모델은 87.3%의 세그멘테이션 정확도, 0.76의 IoU 점수, 0.82의 SSIM 값을 달성했습니다. CAFFM 모듈을 통합함으로써 모든 평가 지표에서 성능이 향상되어, 세그멘테이션 정확도는 89.6%, IoU는 0.79, SSIM은 0.86으로 증가했습니다. CycleGAN의 추가는 구조적 재구성 능력을 더욱 강화하여 0.82의 IoU와 0.89의 SSIM 값을 기록했습니다. 전체 SegCycle-SPADE 프레임워크는 93.8%의 세그멘테이션 정확도, 0.86의 IoU, 0.93의 SSIM 값을 보이며 최고의 종합 성능을 달성했습니다. 이러한 결과는 각 구성 요소가 세그멘테이션 정확도, 구조적 보존 및 이미지 재구성 품질의 향상에 점진적으로 기여함을 입증합니다.
표 7에서는 (i) SegFormer 단독, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, 그리고 (v) SegFormer, CAFFM, CycleGAN, SPADE 및 모티프 보존 손실(motif-preservation loss)이 모두 포함된 전체 모델의 다섯 가지 모델 변형을 사용하여 개별 프레임워크 구성 요소의 기여도를 추가로 조사하였습니다. 성능은 IoU, Dice 계수, SSIM, PSNR 및 FID 지표를 사용하여 평가되었습니다.
기본 SegFormer 단독 구성에서는 IoU 84.2%, Dice 계수 88.5%, SSIM 값 0.82, PSNR 24.8 dB, FID 점수 31.8를 달성했습니다. CycleGAN을 추가함으로써 재구성 품질이 향상되었고 FID 점수가 27.5로 낮아져 이미지의 사실감이 개선되었음을 나타냈습니다. SPADE를 통합하여 구조적 유사성과 이미지 품질이 더욱 향상되었으며, 그 결과 SSIM 값 0.88 및 FID 점수 23.4를 기록했습니다. 제안된 CAFFM 모듈을 포함했을 때는 모든 지표에서 상당한 이득이 발생하여 IoU는 90.0%, Dice 계수는 93.1%, SSIM은 0.90, PSNR은 29.6 dB로 증가했으며 FID 점수는 20.3으로 감소했습니다. 모티프 보존 손실(motif-preservation loss)을 추가로 통합한 최종 모델은 IoU 93.0%, Dice 계수 95.4%, SSIM 값 0.92, PSNR 31.2 dB 및 FID 점수 17.6을 기록하며 최적의 종합 성능을 달성했습니다.
표 8은 문화유산 패턴 복원 및 보존에 사용되는 대표적인 DL 접근 방식들에 대한 비교 개요를 보여줍니다. 기존의 CNN 기반 방법들은 효과적인 국소 특징 학습 및 세그멘테이션 성능을 제공하지만, 장거리 의존성 모델링의 한계로 인해 복잡한 모티프 구조를 보존하는 데 어려움을 겪는 경우가 많습니다. GAN 기반 접근 방식은 이미지 합성 및 스타일 전이 능력을 향상시키지만, 의미론적 불일치와 미세한 구조적 세부 사항의 손실이 발생할 수 있습니다. Transformer 기반 방법들은 전역적 문맥 이해도를 높이지만 일반적으로 생성적 복원 능력이 부족하며, 반면 확산(diffusion) 기반 방법들은 계산 복잡도가 증가하는 대신 높은 시각적 사실성을 제공합니다. 하이브리드 Transformer-GAN 접근 방식은 특징 추출과 이미지 생성 메커니즘을 결합하여 이러한 제한 사항들을 부분적으로 해결합니다. 이와 대조적으로, 제안된 SegCycle-SPADE 프레임워크는 Transformer 기반 세그멘테이션, 교차 주의집중(cross-attention) 특징 융합, 생성적 복원 및 세그멘테이션 유도 예술적 합성을 하나의 통합된 아키텍처 내에 결합함으로써 구조적 충실도, 의미론적 일관성 및 문화적 모티프 보존 능력을 향상시킵니다. 비교 내용은 표 8에 요약되어 있습니다.
| 접근 방법 | 핵심 방법론 | 강점 | 한계점 | 문화유산과의 관련성 |
| CNN 기반 방법(예: U-Net, DeepLabV3+) | 합성곱 특징 추출 및 의미론적 분할 | 효과적인 국소 특징 학습 및 정밀한 세그멘테이션 | 제한적인 장거리 의존성 모델링, 복잡한 모티프 구조 유지의 어려움 | 모티프 분할에는 적합하나 예술적 복원에는 덜 효과적임 |
| GAN 기반 방법 (예: Pix2Pix, CycleGAN) | 적대적 이미지 생성 및 이미지 대 이미지 변환 | 고품질 이미지 합성 및 스타일 전이 | 훈련 불안정성; 의미론적 불일치; 미세 구조 세부 사항의 잠재적 손실 | 패턴 복원에는 유용하지만 문화적 모티프를 정확하게 보존하지 못할 수 있음 |
| 트랜스포머 기반 방법론 | 셀프 어텐션 및 전역 문맥 모델링 | 장거리 의존성 및 복잡한 시각적 관계를 포착함 | 높은 계산 비용; 대규모 훈련 데이터셋 필요 | 복잡한 패턴 분석에는 효과적이지만, 단독으로 사용했을 때의 생성 능력은 제한적임 |
| 확산 기반 방법 | 반복적 노이즈 제거 기반 이미지 생성 | 높은 시각적 사실성과 이미지 다양성 | 느린 추론 속도; 높은 계산 요구 사양; 제한적인 구조적 제어 | 유산 이미지 생성에 유망하나 계산 집약적임 |
| 하이브리드 트랜스포머-GAN 방법론 | 트랜스포머 기반 특징 추출과 GAN 기반 생성의 결합 | 개선된 전역 특징 표현 및 이미지 품질 | 모티프 보존을 위한 명시적인 의미론적 가이드가 부족한 경우가 많음 | 생성 품질을 향상시키지만 문화유산 모티프를 위해 특별히 설계되지는 않았습니다. |
| 제안된 SegCycle-SPADE | SegFormer + CAFFM + CycleGAN + SPADE | 트랜스포머 기반 세분화, 어텐션 유도 특징 융합, 시맨틱 일관성, 모티프 보존 및 제어 가능한 예술적 재구성 | 단독 CNN 기반 방식보다 더 높은 계산 복잡도 | 구조적 충실도와 의미론적 일관성이 향상된 문화유산 패턴의 복원 및 보존을 위해 특별히 설계됨 |
표 8: 문화유산 패턴 복원 및 보존을 위한 대표적 딥러닝 접근 방식 비교. 이미지 분할, 패턴 복원, 스타일 생성 및 문화유산 보존에 사용되는 대표적인 딥러닝 접근 방식에 대한 정성적 비교. 이 표는 각 접근 방식의 핵심 방법론, 장점, 한계 및 적용 가능성을 요약하며, 제안된 SegCycle-SPADE 프레임워크가 시맨틱 분할, 특징 융합, 복원 및 스타일 합성을 결합하여 문화유산 패턴의 구조적 보존 및 시맨틱 일관성과 관련된 과제를 어떻게 해결하는지 강조한다.
관찰된 개선 사항들은 CAFFM 모듈이 교차 주의 기반의 특징 융합을 통해 세그멘테이션 유도 구조적 특징과 예술적 스타일 표현 사이의 상호작용을 효과적으로 강화함을 보여줍니다. 또한, 모티프 보존 손실은 재구성 및 예술적 합성 과정에서 문화적으로 중요한 모티프 구조를 유지하는 데 기여하여, 세그멘테이션 일관성, 구조적 충실도 및 시각적 사실성을 향상시킵니다. 종합적으로, 어블레이션 결과는 SegFormer-B2, CAFFM, CycleGAN, SPADE 및 모티프 보존 손실의 통합이 제안된 SegCycle-SPADE 프레임워크의 우수한 성능을 가능하게 했음을 확인해 줍니다.
데이터 가용성:
예술적 스타일 학습에 사용된 WikiArt 데이터셋은 Kaggle WikiArt 저장소(https://www.kaggle.com/datasets/steubk/wikiart)를 통해 공개되어 있습니다. 본 연구에 사용된 Miao Batik 데이터셋은 Zenodo(https://doi.org/10.5281/zenodo.20807658)를 통해 공개되어 있습니다. 제안된 SegCycle-SPADE 프레임워크와 관련된 전처리된 데이터셋, 세그멘테이션 마스크, 사전 학습된 모델 가중치, 생성된 결과물 및 Python 구현 파일 또한 동일한 Zenodo 저장소에서 확인할 수 있습니다.
보충 파일:
보충 파일 1. 알고리즘 1: 제안된 SegCycle-SPADE 프레임워크의 구현 워크플로. 데이터셋 로딩, 전처리, SegFormer-B2를 이용한 시맨틱 세그멘테이션, 교차 주의 문화적 특징 융합 모듈(CAFFM)을 이용한 특징 융합, CycleGAN을 이용한 문화적 모티프 재구성, SPADE를 이용한 예술적 스타일 합성, 모델 훈련, 검증, 체크포인트 선택 및 최종 성능 평가를 포함하여 제안된 SegCycle-SPADE 프레임워크의 전체 구현 파이프라인을 설명하는 단계별 의사코드입니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
전통 공예의 점진적인 소실로 인해 최근 무형문화유산(ICH) 패턴의 보존 및 디지털 복원이 점점 더 많은 관심을 받고 있습니다. 이전 연구들은 딥러닝(DL) 기반의 이미지 처리 기술을 통해 문화유산의 손실 문제를 해결하려 시도해 왔습니다. 예를 들어, Quan 등32은 구이저우 묘족 바틱 문화를 위해 지식 그래프와 DL 기반의 문화유산 보존 프레임워크를 제안했습니다. 해당 연구는 문화 패턴의 디지털 복원에 중점을 두었으나, 그 방법론은 주로 지식 그래프 표현에 의존했습니다. 마찬가지로 Fu와 Razmjooy16는 문화유산 이미지의 강화 및 복원을 위해 피라미드 특징 네트워크(FPN) 기반의 프레임워크를 제안했습니다. 이 방법은 이미지 강화를 위한 효과적인 특징 추출을 제공했지만, 불완전한 문화 패턴에 대한 이미지 세그멘테이션 가이드나 생성적 복원 메커니즘을 포함하지 않았습니다. 이와 대조적으로, 제안된 SegCycle-SPADE 프레임워크는 이러한 한계를 극복하기 위해 여러 DL 구성 요소를 결합합니다. 먼저, SegFormer 모델을 이용한 시맨틱 세그멘테이션을 통해 문화유산 패턴 내 모티프 영역을 정확하게 식별합니다. 이어서 CAFFM 기반의 특징 강화 모듈이 세밀한 모티프 구조에 대한 특징 표현을 개선합니다. 그런 다음 CycleGAN 복원 모듈을 사용하여 적대적 학습을 통해 문화 패턴 내의 누락되었거나 불완전한 영역을 복원합니다. 마지막으로 SPADE 모듈이 세그멘테이션 맵과의 구조적 정렬을 유지하면서 스타일 강화를 수행합니다. 기존의 CNN-, GAN-, 트랜스포머- 및 확산 기반 방법들17,19,20,21,22,23,24,25,30,34은 각각 고유한 장점을 제공하지만, Table 8에 요약된 바와 같이 시맨틱 일관성 보존, 구조적 특징 유지 또는 계산 효율성 달성 측면에서 한계를 보입니다. 제안된 SegCycle-SPADE 아키텍처는 SegFormer 기반 세그멘테이션, 교차 주의 집중 특징 융합, CycleGAN 복원 및 SPADE 가이드 합성의 장점을 결합하여 이러한 한계를 해결합니다. 결과적으로, 이 프레임워크는 향상된 복원 품질과 문화적으로 중요한 모티프의 강화된 보존을 달성합니다.
고무적인 성능에도 불구하고, 제안된 SegCycle-SPADE 프레임워크에는 여전히 몇 가지 한계점이 있습니다. 첫째, 평가가 Miao Batik 및 WikiArt 데이터셋만을 사용하여 수행되었으므로, 다른 문화유산 도메인에 대한 프레임워크의 일반화 가능성이 제한될 수 있습니다. 둘째, SegFormer, CAFFM, CycleGAN 및 SPADE의 통합으로 인해 계산 복잡성과 메모리 요구 사항이 증가하여 리소스가 제한된 플랫폼에서의 배포가 어려울 수 있습니다. 셋째, 세분화 성능은 문양 어노테이션의 품질과 일관성에 크게 의존하며, 어노테이션 편향이 문화적으로 중요한 구조의 보존에 영향을 미칠 수 있습니다. 마지막으로, 프레임워크가 두 개의 데이터셋만을 사용하여 평가되었기 때문에, 다양한 문화유산 컬렉션 전반에 걸친 적용 가능성을 보장하기 위해서는 추가적인 훈련 데이터와 도메인별 최적화가 필요할 수 있습니다. 따라서 향후 연구에서는 더 강력한 훈련 전략, 경량 아키텍처, 개선된 어노테이션 절차 및 추가적인 문화유산 데이터셋을 이용한 교차 도메인 평가를 탐색해야 합니다.
더욱 방대하고 다양한 문화유산 데이터셋에 대한 SegCycle-SPADE 프레임워크의 확장 가능성이 향후 연구의 주요 초점이 될 것입니다. 모델의 일반화 능력과 문화적 적응성을 향상시키기 위해 서로 다른 지역과 예술적 전통을 가진 문화유산 모티프에 대한 교차 문화적 평가가 조사될 것입니다. 또한, 텍스트 설명, 역사적 기록 및 문화적 메타데이터를 통합한 멀티모달 확장은 재구성 과정에서 더 강력한 의미론적 가이드를 제공할 수 있습니다. 본 프레임워크는 이미지 기반 재구성을 3D 모델링 기술과 통합함으로써 3차원 문화유산 재구성을 지원하도록 확장될 수 있습니다. 아울러, AI 기반 문화유산 보존 및 기록의 실질적인 응용을 촉진하기 위해 디지털 아카이브, 박물관, 가상 전시 및 문화유산 보존 플랫폼으로의 배포가 모색될 것입니다. 해석 가능성과 문화적 진정성을 더욱 높이기 위해, 향후 연구에서는 문화적 지식 그래프, 민족지학적 기록, 역사적 메타데이터 및 전문가가 큐레이팅한 지식 베이스의 통합을 조사하여 문화적 맥락을 반영한 모티프 분석 및 재구성을 가능하게 할 것입니다32.
제안된 SegCycle-SPADE 프레임워크를 구현할 때 몇 가지 실질적인 고려 사항을 염두에 두어야 합니다. CycleGAN 학습 과정에서 생성자와 판별자의 손실 값이 심하게 불균형해지면 불안정한 적대적 수렴이 발생할 수 있습니다. 이러한 상황에서는 학습률을 낮추거나, 사이클 일관성 손실(cycle-consistency loss) 가중치를 높이거나, 판별자의 지배력을 모니터링함으로써 학습 안정성을 개선할 수 있습니다. 생성자가 시각적으로 유사한 출력을 반복적으로 생성하는 모드 붕괴(mode collapse)가 발생할 수 있으며, 이는 균형 잡힌 적대적 학습, 리플레이 버퍼(replay-buffer) 활용 및 생성자와 판별자의 손실 추세를 세밀하게 모니터링함으로써 완화할 수 있습니다. 또한 문화적 모티프가 복잡한 질감, 낮은 대비 또는 모호한 경계를 나타낼 때 세그멘테이션 실패가 발생할 수 있습니다. 이 문제를 해결하기 위해 학습 전 이미지 품질을 확인해야 하며, 어노테이션의 일관성을 보장하기 위해 세그멘테이션 마스크를 시각적으로 검수해야 합니다. 신뢰할 수 있는 SegFormer 성능을 달성하기 위해서는 권장되는 입력 해상도와 정규화 설정을 유지하는 것도 중요합니다. 학습 불안정성은 부적절한 학습률 설정, 불충분한 학습 데이터 또는 하드웨어 관련 수치 변동으로 인해 추가적으로 발생할 수 있습니다. 재현성을 높이기 위해 NumPy, PyTorch, CUDA 및 데이터셋 셔플링 작업에 고정된 랜덤 시드(random seed)를 사용해야 합니다. 또한 모든 실험 실행 전반에 걸쳐 동일한 전처리 파이프라인, 데이터셋 분할, 모델 하이퍼파라미터 및 소프트웨어 환경을 유지해야 합니다. 성능 저하를 방지하고 중단된 학습 세션으로부터의 복구를 용이하게 하기 위해 주기적인 체크포인트 저장과 검증 손실(validation-loss) 모니터링을 권장합니다.
본 연구는 AI 기반 문화유산 복원 프레임워크의 이론적 발전에 기여합니다. 기존의 이미지 복원 방식은 일반적으로 이미지 세그멘테이션, 복원 및 스타일 생성을 독립적인 프로세스로 처리합니다17,19,20,30. 이와 대조적으로, 본 연구는 세그멘테이션 유도 생성적 복원 전략을 통해 이러한 프로세스들을 통합하는 프레임워크를 제안합니다. 결과적으로, 본 연구는 세그멘테이션, 복원 및 스타일 생성이 어떻게 단일 프레임워크 내에서 통합될 수 있는지를 입증함으로써 AI 보조 문화유산 복원의 이론적 발전에 기여합니다. 이러한 통합은 문양 구조와 의미론적 의미를 보존하는 것이 매우 중요한 문화유산 응용 분야에서 특히 중요합니다. 실용적인 관점에서 제안된 프레임워크는 전통 문화 문양의 디지털 보존, 복원 및 예술적 향상을 위한 효과적인 솔루션을 제공합니다. 문화유산 기관, 박물관 및 디자이너는 SegCycle-SPADE를 활용하여 문양 영역을 자동으로 식별하고, 손상되었거나 불완전한 문양을 복원하며, 전통 디자인의 시각적으로 향상된 예술적 표현물을 생성할 수 있습니다. 이러한 기능은 역사적 유물이 부분적으로 손상되었거나 불완전할 수 있는 묘족 바틱 섬유 문양과 같은 멸종 위기의 공예 전통에 특히 가치가 있습니다. 나아가, 생성적 스타일 합성의 결합을 통해 본 프레임워크는 섬유 디자인, 디지털 예술 창작 및 유산 교육과 같은 현대적 문화 디자인 응용 분야를 지원할 수 있습니다. 이러한 방식으로 제안된 프레임워크는 문화유산 보존과 현대적 문화 디자인 응용 사이의 간극을 메웁니다.
그럼에도 불구하고, 제안된 SegCycle-SPADE 프레임워크가 거둔 유망한 결과에도 불구하고 몇 가지 한계점이 남아 있습니다. 첫째, 평가는 Miao Batik 및 WikiArt 데이터셋만을 사용하여 수행되었으며, 이는 다른 형태의 문화유산 패턴을 재구성하는 프레임워크의 일반화 능력에 영향을 미칠 수 있습니다. 둘째, 재구성 과정이 GAN 기반 모델에 의존하기 때문에, 매우 복잡한 모티프 구조를 다룰 때 생성된 결과물에 때때로 아티팩트나 부자연스러운 질감이 포함될 수 있습니다. 셋째, 현재 프레임워크는 2차원 패턴의 재구성에 집중하고 있으나, 일부 문화유산 유물은 본질적으로 3차원 구조를 포함하고 있습니다. 전반적으로, 실험 결과는 무형문화유산(ICH) 패턴의 예술적 재구성을 위한 제안된 SegCycle-SPADE 프레임워크의 효과를 입증합니다. SegFormer 기반의 시맨틱 세그멘테이션, CAFFM, CycleGAN 기반의 모티프 재구성 및 SPADE 기반의 예술적 합성의 통합은 세그멘테이션, 재구성 및 이미지 품질 성능 지표를 일관되게 향상시켰습니다. 어블레이션 연구를 통해 각 프레임워크 구성 요소의 기여도가 추가로 검증되었으며, CAFFM과 모티프 보존 손실이 구조적 충실도와 시각적 진정성을 상당히 높였음을 보여주었습니다. 이러한 발견은 시맨틱 세그멘테이션 가이드 재구성과 교차 주의 특징 융합의 결합이 예술적으로 풍부한 결과물을 생성하는 동시에 문화적으로 중요한 모티프를 효과적으로 보존할 수 있다는 핵심 가설을 뒷받침합니다. 따라서 제안된 프레임워크는 무형문화유산 패턴의 디지털 보존, 복원 및 창조적 활성화를 위한 신뢰할 수 있고 재현 가능한 계산적 접근 방식을 제공합니다.
이해상충:
저자들은 경쟁 관계에 있는 이해관계가 없음을 밝힙니다.
저자들은 본 연구를 수행하는 동안 광동공정폴리테크닉(Guangdong Engineering Polytechnic)과 화남사범대학교(South China Normal University)에서 제공한 학술적 및 제도적 지원에 감사를 표합니다. 본 연구는 “디지털 재생 박물관: 중국 고전 서화 문화유산의 활성화 및 소통에 관한 연구”라는 제목의 2023년 국가사회과학기금 일반 프로젝트(No. 23BH161)의 지원을 받았습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Adam Optimizer | PyTorch Optimizer 라이브러리 | Adam | 모델 학습 중에 사용되는 최적화 알고리즘. |
| CUDA Toolkit | NVIDIA Corporation | CUDA 11.3 | 딥러닝 연산을 위한 GPU 가속. |
| cuDNN | NVIDIA Corporation | cuDNN 8.2 | 학습 및 추론 속도를 높이는 데 사용되는 딥 뉴럴 네트워크 가속 라이브러리. |
| CycleGAN | University of California, Berkeley / 오픈 소스 | 공식 PyTorch 구현체 (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix) | 문화적 모티프 복원에 사용되는 생성적 적대 신경망. |
| ImageNet 사전 학습 가중치 | ImageNet / 오픈 소스 | mit_b2.pth (ImageNet-1K 사전 학습 체크포인트) | Miao Batik 데이터셋으로 미세 조정하기 전 SegFormer-B2 백본을 초기화하는 데 사용됨. |
| Intel 프로세서 | Intel Corporation | Intel Core i7 (11세대) | 이미지 전처리, 모델 학습 지원 및 추론에 사용되는 CPU. |
| Matplotlib | Matplotlib 개발 팀 | Matplotlib 3.5.1 | 학습 곡선 및 평가 결과의 시각화. |
| Miao Batik 데이터셋 | Zenodo 리포지토리 | DOI: 10.5281/zenodo.20807658 | 시맨틱 세그멘테이션 및 패턴 복원에 사용되는 15,148장의 이미지가 포함된 문화적 모티프 데이터셋. |
| NumPy | NumPy 개발자 | NumPy 1.21.5 | 수치 연산 및 데이터셋 처리. |
| NVIDIA GPU | NVIDIA Corporation | NVIDIA RTX 3090 (24 GB VRAM) | 모델 학습 및 추론에 사용되는 하드웨어 플랫폼. |
| OpenCV | OpenCV Foundation | OpenCV 4.5.5 | 이미지 전처리, 크기 조정, 보간 및 가우시안 노이즈 제거. |
| 운영 체제 | Canonical Ltd. | Ubuntu 20.04 LTS | 실험 실행 환경. |
| Pillow (PIL) | Python Imaging Library | Pillow 8.4.0 | 이미지 로딩 및 조작. |
| Python | Python Software Foundation | Python 3.8.10 | 구현 및 실험에 사용된 프로그래밍 언어. |
| PyTorch | Meta AI | PyTorch 1.10.0 | 모델 학습 및 추론에 사용되는 딥러닝 프레임워크. |
| 랜덤 시드 | 실험 설정 | 42 | 데이터셋 분할, 모델 초기화 및 실험 재현성을 위해 사용된 고정 시드. |
| Scikit-learn | Scikit-learn 개발자 | Scikit-learn 1.0.2 | 데이터셋 분할, 통계 분석 및 평가 지표. |
| Seaborn | 오픈 소스 커뮤니티 | Seaborn 0.11.2 | 통계 데이터 시각화. |
| SegFormer-B2 | NVIDIA Research / 오픈 소스 | SegFormer-B2 (MIT-B2 백본) | 문화적 모티프 세그멘테이션에 사용되는 Transformer 기반 시맨틱 세그멘테이션 모델. |
| 세그멘테이션 마스크 / 어노테이션 | Miao Batik 데이터셋 | 데이터셋에 포함됨 | 모티프 분류 및 학습에 사용되는 픽셀 수준의 시맨틱 세그멘테이션 레이블. |
| SPADE | NVIDIA Research / 오픈 소스 | 공식 PyTorch 구현체 (https://github.com/NVlabs/SPADE) | 예술적 패턴 생성에 사용되는 세그멘테이션 가이드 이미지 합성 모델. |
| TorchVision | Meta AI | TorchVision 0.11.1 | PyTorch와 함께 사용되는 이미지 처리 유틸리티 및 데이터셋 변환. |
| WikiArt 데이터셋 | WikiArt | https://www.wikiart.org/ | 스타일 학습 및 합성에 사용되는, 27가지 예술 스타일에 걸쳐 80,000점 이상의 예술 작품이 포함된 예술 스타일 데이터셋. |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청