本方案描述了一种基于深度学习的工作流程,用于非物质文化遗产图案的语义分割、重建及艺术风格合成,通过基于变换器的特征提取、对抗性重建和空间自适应图像生成,支持文化遗产的数字化保护与创造性应用。
研究文章
本方案描述了一种基于深度学习的工作流程,用于非物质文化遗产图案的语义分割、重建及艺术风格合成,通过基于变换器的特征提取、对抗性重建和空间自适应图像生成,支持文化遗产的数字化保护与创造性应用。
随着基于深度学习的图像合成技术的发展,非物质文化遗产(ICH)图案的数字化保存与重构日益受到关注。现有的基于SegCycle-SPADE的方法在传统工艺图案的结构分割与艺术化重构方面已展现出潜力;然而仍存在若干局限,包括数据集多样性不足、文化语义信息融合不充分,以及在重构过程中对图案结构特征的保留不够完整。为应对这些挑战,本研究提出一种改进的SegCycle-SPADE框架,用于非物质文化遗产图案类型的语义分割与艺术化重构。该框架采用基于Transformer的分割模型SegFormer,以精确识别图案中的纹样边界与区域。此外,引入跨注意力文化特征融合模块,以增强具有文化意义的关键纹样并提升特征表达能力。图案的转换与重构通过CycleGAN实现,同时采用空间自适应去归一化(SPADE)进行艺术风格合成,以保持分割图与生成图像之间的语义一致性。为提升模型的泛化能力与艺术多样性,框架在苗族蜡染文化纹样数据集与WikiArt数据集上共同训练。实验结果表明,所提出的注意力引导的SegCycle-SPADE框架在分割准确率与遗产图案重构性能方面均优于现有的基于生成对抗网络(GAN)的重构方法。该框架为人工智能辅助下的文化遗产记录、重构及传统图案设计的艺术化复兴提供了可扩展的解决方案。
文化遗产包括无形元素(如习俗、语言和信仰)以及有形元素(如艺术品、建筑和文字记录),是人类历史、创造力和身份认同的基本体现1。遗产保护旨在帮助社区重新连接其文化根源,并使后代能够受益于集体文化记忆。它还促进跨文化理解,增进对不同传统与习俗的欣赏,并认可多元的历史叙述。这些文化资产有助于我们理解前人的价值观、观点和经历,并推动当代社会身份的形成与文化的延续。文化遗产保护的基本原则如图1所示。

图 1.基于 SegCycle-SPADE 框架的文化遗产图案重建概念概述。 所提出方法的示意图,用于重建和增强非物质文化遗产图案。该工作流程包括从苗族蜡染和 WikiArt 数据集中收集数据集、图像预处理、使用 SegFormer-B2 进行语义分割、使用跨注意力文化特征融合模块(CAFFM)进行特征融合、使用 CycleGAN 进行图案重建、使用 SPADE 进行艺术风格合成,以及最终通过分割和重建指标进行评估。箭头表示数据和特征表示在整个框架中的流动方向。请点击此处查看该图的放大版本。
人类社会的集体记忆与文化传承体现在非物质文化遗产(ICH)之中,非物质文化遗产是艺术表达和文化认同的重要载体。然而,由于全球化和数字化的影响,非物质文化遗产正面临严峻挑战2,3,4。许多濒危的非物质文化遗产实践因技艺传承人数量减少以及难以适应现代市场而亟需新的保护与发展途径5,6。作为非物质文化遗产研究的重要领域,可持续设计强调文化、社会与环境的协同发展,为非物质文化遗产的持续保护提供了切实可行的路径。通过可持续设计的方法,非物质文化遗产能够在适应当代社会需求的同时实现复兴与活化7,8。
本研究中,“非物质文化遗产图案”指传达和保存潜在非物质文化价值的视觉主题表现形式。因此,所提出的框架旨在重建这些主题的视觉形态,同时保护和记录与之相关的文化信息。
苗绣和蜡染是中国非物质文化遗产的重要形式,通过鸟类、蝴蝶和祖先图腾等象征性图案,反映了苗族社区的历史、信仰和传统9。这些图案深深植根于仪式服饰和节庆习俗之中,并促进了当地文化与经济的发展10,11。数字技术的进步,特别是人工智能(AI)和深度学习(DL)的发展,为文化遗产的保护、分析、重建和记录提供了新的机遇。贵州苗族蜡染是中国保存最完好的蜡染传统之一,是传承苗族人民文化知识、信仰、习俗和仪式的重要媒介12,13,14,15,16。
近期研究表明,深度学习(DL)在文化遗产保护和图案重建方面具有巨大潜力,与U-Net和DeepLabV3+1相比,实现了更高的分割精度(像素准确率=88.6%,平均交并比[IoU]=78.1%)和更优的重建性能。然而,仍存在若干挑战。现有的基于生成对抗网络(GAN)的方法通常难以在复杂图案中保留精细的结构细节17,而数据集多样性不足也限制了模型在不同文化领域间的泛化能力18。此外,诸如CycleGAN之类的图像到图像转换模型可能无法保持分割图与生成图像之间的语义一致性19,且缺乏注意力机制可能导致在重建过程中丢失具有文化意义的图案细节20。因此,亟需一种增强型框架,整合基于Transformer的分割、注意力引导的特征学习以及多数据集训练,以实现对非物质文化遗产(ICH)图案的有效重建。
苗绣的数字化与生成式人工智能的快速发展,为文化遗产保护带来了新的机遇。扩散模型作为一类新兴的深度生成模型,因其强大的内容生成能力,在计算机视觉任务中表现出卓越性能21,22,23,24,25。在逆向扩散过程中,模型逐步学习从含噪声的表征中重建原始输入数据26,27,28。以往研究也探讨了三维重建与计算机辅助设计(CAD)技术在文化遗产保护与传播中的应用。
尽管卷积神经网络(CNN)和生成对抗网络(GAN)在图像生成和特征保持方面表现良好,但仍面临感受野有限、模式崩溃以及训练不稳定等挑战29。基于Transformer的架构(如SegFormer和Segmenter)在捕捉全局上下文和语义关系方面表现出色;然而,这类模型计算开销较大,且可能在细粒度细节处理上存在困难。尽管Stable Diffusion等扩散模型展现出强大的图像生成能力,但通常难以精确控制生成设计的结构和艺术特征。此外,大多数现有方法采用独立训练策略,限制了分割与生成组件之间有效的信息共享和协同优化,导致结构准确性与艺术真实感之间存在权衡30。
近期的基于扩散的模型,例如潜在扩散模型和Stable Diffusion,虽然能够实现高质量的图像合成,但需要进行迭代去噪,导致计算成本和推理时间增加。此外,在缺乏专门条件机制的情况下,保持精细的文化图案和结构一致性仍然具有挑战性。基于Transformer的生成模型能够有效捕捉全局上下文关系,但通常需要大规模数据集和大量的计算资源。相比之下,本文提出的SegCycle-空间自适应去归一化(SegCycle-SPADE)框架结合了基于SegFormer的分割、交叉注意力特征融合、CycleGAN重建以及SPADE引导的合成方法,提供了明确的结构指导,从而提升了文化遗产图案中图案的保留性、语义一致性和可控重建能力。
目前大多数先进的语义分割技术依赖于具有U形架构的全卷积神经网络(FCNNs)31。在编码阶段,通过一系列卷积和下采样操作提取具有较大感受野的深层特征。解码阶段则通过上采样逐步恢复空间分辨率,最终实现像素级的语义预测。跳跃连接能够补偿下采样过程中丢失的空间信息,并提升在广泛应用场景中的分割性能,使得来自编码器不同层级的高分辨率信息可被直接整合到解码器中32。
尽管近年来基于生成对抗网络(GAN)、卷积神经网络(CNN)和扩散模型的方法在图像生成与文化遗产修复方面取得了令人瞩目的成果,但这些方法在保持语义一致性、保留精细结构纹样以及在不同文化图案中实现可重复重建方面仍常面临挑战。大多数现有方法将分割、重建和风格合成视为独立过程,这可能导致具有文化意义的元素丢失以及输出结果不一致。为弥补这一方法学上的不足,本研究提出了一种统一的SegCycle-SPADE框架,该框架融合了基于SegFormer的语义分割、一种新颖的交叉注意力文化特征融合模块(CAFFM)、基于CycleGAN的重建以及SPADE引导的风格合成。通过将结构分割信息与生成式特征学习显式结合,所提出的框架能够在保持文化真实性和艺术质量的同时,实现对非物质文化遗产(ICH)纹样更可靠、语义一致且可重复的重建。
本研究指出现有文化遗产重建方法存在三个主要局限性:(i)基于生成对抗网络(GAN)的重建方法对精细结构纹样的保留不足;(ii)由于在小规模或特定领域数据集上进行训练,导致泛化能力有限;(iii)图像到图像转换框架中,分割输出与生成图像之间的语义一致性不足。此外,分割、重建和风格合成通常被视为独立过程,导致重建过程中文化重要元素的丢失。通过在一个统一架构中融合基于Transformer的语义分割、交叉注意力特征融合、CycleGAN重建以及SPADE引导的艺术合成,所提出的SegCycle-SPADE框架有效解决了上述问题,显著提升了非物质文化遗产(ICH)图案重建中的纹样保留度、语义一致性和艺术真实性。
本研究的主要目标是开发一种增强的SegCycle-SPADE框架,用于脑出血(ICH)模式的语义分割引导艺术化重建。该框架结合了SegFormer以实现精确的文化图案分割,采用CycleGAN进行图案重建,并利用SPADE实现风格一致的艺术合成。为了提升特征表示能力并保留精细的结构细节,引入了一种CAFFM模块,以促进分割特征与生成特征之间的有效交互。该框架在苗族蜡染和WikiArt数据集上进行训练,能够增强重建结果的真实性、风格一致性以及对具有文化意义图案的保留效果。
通过在统一架构中融合语义分割、注意力引导的特征融合、模式重建和风格合成,本研究提出了一种新颖的SegCycle-SPADE框架,用于脑出血(ICH)模式的艺术化重建。本工作的主要贡献如下。第一,通过整合SegFormer,构建了一种新颖的语义分割引导的重建框架,能够精确提取并保留复杂的文化纹样和结构要素。第二,提出了一种新的CAFFM模块,有效融合分割特征与生成表示,使模型能够捕捉文化纹样与艺术风格模式之间的长距离关联。第三,所提出的CAFFM在增强文化重要元素保留的同时,提升了重建遗产纹样的视觉真实感和结构连贯性。第四,通过结合CycleGAN进行文化纹样重建以及SPADE实现分割引导的艺术合成,该框架确保了生成结果在语义准确性和风格真实性两方面的统一。第五,为提升模型的泛化能力与艺术多样性,模型训练采用了苗族蜡染文化纹样数据集以学习文化图案特征,并结合WikiArt数据集用于艺术风格表征。其中,WikiArt作为辅助数据集,用于评估框架在不同视觉上下文中的泛化能力、特征学习鲁棒性及风格控制有效性,而非直接应用于苗族文化遗产产品中的目标艺术风格。最后,与现有的基于GAN的文化遗产重建方法相比,实验结果表明,所提出的SegCycle-SPADE框架在分割精度、重建质量及风格一致性方面均取得更优性能。
所提出的SegCycle-SPADE框架旨在通过语义分割、基于注意力机制的特征增强、生成式重建以及艺术风格合成,对传统文化遗产图案进行重建与优化。本研究使用了公开可用的文化遗产与艺术图像数据集,包括苗族蜡染数据集(Miao Batik dataset)和WikiArt数据集。研究未涉及人类受试者、患者数据、个人信息、动物实验或临床记录,因此无需机构伦理委员会批准及知情同意。首先,采用苗族蜡染文化纹样数据集与WikiArt数据集进行评估。苗族蜡染数据集由Quan等人(2024)32描述,包含15,148张标注的传统苗族蜡染纹样图像。本研究直接使用数据集创建者提供的现有标注,未额外生成任何人工标注。随后,对图像进行预处理,包括调整尺寸、归一化、去噪以及生成分割掩码。具体的预处理参数详见“数据预处理”小节。所提出的框架采用一种基于Transformer的模型SegFormer-B2,用于数据的语义分割。该方法旨在检测文化纹样的关键区域并学习其结构。分割所得特征随后通过注意力机制进行增强,突出与文化纹样相关的重要信息,并剔除无关内容。注意力机制的具体配置详见CAFFM小节。增强后的特征被输入CycleGAN,通过循环学习重建受损结构。在训练过程中,通过对原始苗族蜡染图像施加随机掩码和部分遮挡操作,人工生成不完整纹样样本。这些退化操作模拟了在老化文化遗产实物中常见的纹样缺失区域与结构损伤。生成的不完整图像作为CycleGAN重建模块的输入,而对应的原始图像则作为重建目标。重建后的文化遗产图案进一步通过SPADE进行增强,依据生成的分割图实现艺术化增强。所提框架的性能通过定量的分割与图像质量指标进行评估,同时对重建文化纹样的视觉真实性进行定性评估。视觉真实性通过目视检查生成的文化图案进行判断,未作为独立的定量指标使用。评估重点包括纹样保留度、语义一致性、文化特征、结构连贯性以及艺术表现力,均相对于相应的参考文化纹样进行比较。模型性能的定量评估采用分割准确率(Segmentation Accuracy)、交并比(IoU)、Dice系数、结构相似性指数(SSIM)、峰值信噪比(PSNR)以及Fréchet Inception距离(FID)。图2展示了所提出的SegCycle-SPADE框架的整体工作流程,并总结了本研究中使用的评估指标。

图 2.所提出的 SegCycle-SPADE 框架的整体架构流程。 完整的 SegCycle-SPADE 工作流程概述。来自苗族蜡染数据集和 WikiArt 数据集的图像在经过预处理后,依次通过 SegFormer-B2 进行语义分割、CAFFM 进行特征增强、CycleGAN 进行图案重建,以及 SPADE 进行艺术风格生成。模型性能通过分割准确率、交并比(IoU)、Dice 系数、结构相似性指数(SSIM)、峰值信噪比(PSNR)和 Fréchet Inception 距离(FID)进行评估,视觉真实性则通过定性分析进行评价。请点击此处查看该图的放大版本。
用于文化遗产图案重建的 SegCycle-SPADE 框架旨在整合多种深度学习组件,以实现精确的图案分割、重建和艺术增强,如图2所示。该框架使用苗族蜡染文化图案数据集和 WikiArt 数据集中的图像,以提供多样化的文化图案和艺术风格。首先,利用基于 SegFormer 的语义分割模块对图像进行处理,以识别并勾勒出背景中的文化图案。整体架构包含四个主要阶段:第一,SegFormer 模型从文化图案图像中提取语义分割图;第二,CAFFM 将分割特征与生成式表征相融合,以增强特征学习;第三,CycleGAN 模块利用融合后的特征表征重建文化图案;最后,SPADE 模块通过分割引导的合成方式生成在风格上得到增强的输出,同时保持结构一致性。经过优化的特征图随后由 CycleGAN 重建模块处理,该模块通过将退化的图案映射为其对应的完整形式,学习恢复不完整的文化图案。不完整的图案样本是通过对原始苗族蜡染图像施加随机掩码和部分遮挡操作生成的,从而模拟在受损文化遗产文物中常见的图案缺失区域和结构退化情况。每张退化图像均与其对应的原始图像配对,后者在训练过程中作为重建目标。该策略使 CycleGAN 模块能够学习缺失图案结构的恢复方法,同时保持语义一致性和具有文化意义的特征。最后,SPADE 生成器以生成的分割图为条件进行图像合成,产生视觉上增强的艺术化输出,从而在整个艺术增强过程中保持文化图案的结构完整性。
拟议的 SegCycle-SPADE 框架包含以下步骤。
步骤1:数据集收集
为实现文化模式学习与艺术风格生成的目标,本研究使用了两个数据集。苗族蜡染文化图案数据集用于提供传统的文化图案信息。该数据集通过Zenodo公开获取(https://doi.org/10.5281/zenodo.20807658),包含15,148幅标注的传统苗族蜡染图案图像。本研究直接使用了数据集创建者提供的现有标注,未额外生成任何人工标注。WikiArt数据集用于为艺术风格生成提供多样化的艺术风格信息,数据来源于公开的WikiArt资源库(https://www.wikiart.org/)。
步骤 2:数据预处理
所有图像均经过调整大小、归一化和降噪处理。语义分割阶段使用了从原始数据集来源获取的现有文化图案标注。本研究未进行任何额外的标注或重新标注操作。
步骤3:使用SegFormer进行语义模式分割
SegFormer 模型被用于文化图案分割。具体的 SegFormer 骨干网络结构及初始化策略在下文中描述 使用 SegFormer 进行语义模式分割 具体而言,采用基于ImageNet预训练的MIT-B2骨干网络的SegFormer-B2架构进行语义纹样分割。该模型在有效捕捉全局上下文信息的同时,保留了传统文字符号的复杂结构细节。
步骤 4:CAFFM
CAFFM 将语义分割特征与生成式表征相结合,使框架能够同时学习结构图案特征和艺术风格信息。CAFFM 的集成细节见“CAFFM”小节。该模块位于基于 SegFormer 的语义分割阶段与生成重建阶段之间,通过多头交叉注意力机制将来自分割的结构特征与重建特征进行融合。此过程可改善文化图案的保留效果,并提升重建输出的逼真度。
步骤5:模式重建(CycleGAN)
融合后的特征随后由CycleGAN模块处理,以重建文化模式结构。CycleGAN的架构和训练配置详见于 使用 CycleGAN 进行模式重建 该子模块包含两个生成器和两个判别器,采用具有九个残差块的残差网络生成器架构,使用PatchGAN判别器,并通过对抗损失和循环一致性损失进行训练。该配置可实现双向域映射,并有助于重建不完整的文化模式结构。
步骤6:艺术风格生成(SPADE)
重建的图案随后通过SPADE模块进行分割引导的艺术风格合成。SPADE生成器的配置详见于 使用SPADE生成艺术风格图像 该模块采用 SPADE 残差块、空间自适应归一化层,以及源自 SegFormer 分割图和 CAFFM 特征表示的语义条件。通过以分割图作为图像生成的条件,合成结果在保持与原始文化图案结构对齐的同时,融入了艺术风格特征。
步骤7:性能评估
使用多种分割和图像质量评估指标对所提出的框架进行评估,包括分割准确率、交并比(IoU)、Dice相似系数(Dice)、结构相似性(SSIM)、峰值信噪比(PSNR)和Fréchet起始距离(FID)。为评估实验的一致性,所有实验均使用不同的随机种子重复五次,结果以均值±标准差形式报告。采用配对t检验评估统计学显著性,显著性阈值为 p < 0.05。
数据集采集
在所提出的 SegCycle-SPADE 框架中,使用了两个数据集用于文化图案理解与风格学习。该框架所采用的第一个数据集是苗族蜡染文化纹样数据集。该数据集包含苗族蜡染的文化纹样,通常为包含动物、植物和几何形状等图案的传统苗族蜡染图像,这些图案广泛应用于苗族民族艺术中。该数据集中的图像具有丰富的纹理信息,对于保护文化遗产具有重要意义。SegCycle-SPADE 框架中使用的第二个数据集是 WikiArt 数据集。该数据集包含大量来自不同艺术风格的艺术作品,用于复杂的风格学习,通常有助于提升艺术创作效果。该数据集包含 80,000 幅高清艺术作品,涵盖 27 种不同的艺术风格,因此在基于深度学习的风格生成或风格转换任务中具有更高的应用价值。
苗族蜡染数据集:
苗族蜡染数据集(https://doi.org/10.5281/zenodo.20807658)包含15,148幅描绘具有文化意义图案的蜡染图像。这些图像涵盖多种传统设计,例如动物图案(如蝴蝶和鱼)、植物类纹样以及具有文化象征意义的几何图案。该数据集是所提出框架的重要组成部分,因其提供了真实的文化结构,使分割模块能够在图案重建过程中准确识别并保留图案边界(表1)。在本研究中,具有文化重要性的图案指的是在苗族文化遗产文献中常见并体现在数据集标注中的象征性视觉元素,包括鸟类、蝴蝶、花卉图案和祖先图腾。这些图案的选择依据其在传统苗族蜡染和刺绣设计中已被记录的文化意义及其反复出现的特征,而不仅仅基于其出现频率或空间构成。图案的专家指导标注和分割标签来源于原始的苗族蜡染数据集,并在本研究中直接使用。作者未进行任何额外的手动标注、重新标注或专家指导标注操作。本研究利用数据集创建者提供的现有标注进行语义分割的训练与评估。
| 参数 | 描述 |
| 数据集名称 | Miao Batik Cultural Pattern Dataset |
| 数据集来源 | Zenodo 仓库 (DOI: 10.5281/zenodo.20807658) |
| 领域 | 非物质文化遗产(ICH)/ 纺织图案分析 |
| 图像总数 | 15,148 张图像 |
| 图像类型 | 传统苗族蜡染纺织图案的数字图像 |
| 图案类别 | 动物纹样、植物纹样和几何纹样 |
| 文化起源 | 中国贵州省苗族民族文化 |
| 原始图像分辨率 | 高分辨率图像(通常短边 ≥ 1,000 像素),在预处理前以原始扫描或摄影方式获取 |
| 训练分辨率 | 预处理期间将图像调整为 256 × 256 像素 |
| 标注可用性 | 本研究直接使用数据集创建者提供的现有分割标注,未作任何修改。本研究未进行额外的手动标注、重新标注或专家确认流程。 |
| 本研究中的应用 | 文化纹样分割、特征提取、纹样保护与图案重建 |
表1:苗族蜡染文化图案数据集的特征。用于语义分割、文化图案分析和图案重构的苗族蜡染文化纹样数据集的汇总。该表格描述了数据集来源、图像特征、纹样类别、文化渊源、图像分辨率及其在所提出的SegCycle-SPADE框架中的作用。
WikiArt 数据集:
WikiArt 数据集 [https://www.wikiart.org/] 是一个广受欢迎的大规模数字艺术资源库,包含来自 表2 中 27 种不同艺术风格的超过 80,000 张图像。这些风格包括文艺复兴艺术、印象派、立体主义和超现实主义。该数据集在所提出的框架中具有重要作用,因为它提供了使 SPADE 模块能够在保持从分割过程中获得的结构信息的同时,生成具有丰富文化特征的图案所需的知识。该数据集包含 56,000 张用于训练的图像,以及 12,000 张用于验证和测试的图像。数据集中的图像有助于高效地训练深度学习模型。
| 参数 | 描述 |
| 数据集名称 | WikiArt 数据集 |
| 数据集来源 | WikiArt 仓库 (https://www.wikiart.org/) |
| 领域 | 数字艺术与绘画 |
| 图像总数 | 约 80,000 件艺术作品 |
| 训练图像 | 56,000 |
| 验证图像 | 12,000 |
| 测试图像 | 12,000 |
| 艺术风格 | 27 种艺术风格,包括文艺复兴、印象派、立体主义、超现实主义、表现主义、现实主义和抽象艺术 |
| 原始图像分辨率 | 原始图像分辨率因作品和来源而异。在预处理过程中,图像被调整为统一的 256 × 256 像素分辨率。 |
| 训练分辨率 | 在进行艺术风格学习和基于分割的图像合成之前,图像在预处理阶段被调整为 256 × 256 像素。 |
| 数据集划分 | 采用分层随机划分方法(70% 训练集,15% 验证集,15% 测试集),固定随机种子为 42 |
| 风格采样策略 | 采用分层比例采样方法,以保持 27 种艺术风格在训练集、验证集和测试集中的分布一致性 |
| 本研究中的应用 | 艺术风格学习、风格表征以及基于分割的藝術合成 |
表2:WikiArt数据集的特征。用于艺术风格学习和风格引导图像合成的WikiArt数据集概要。该表描述了数据集来源、图像分布、艺术风格覆盖范围、数据集划分方式、图像分辨率,以及其在所提出的SegCycle-SPADE框架中的应用。
苗族蜡染数据集包含 15,148 张代表传统苗族文化图案的图像。32 该数据集通过 Zenodo 公开获取(https://doi.org/10.5281/zenodo.20807658)。在模型训练之前,所有图像均经过视觉检查,调整为 256 × 256 像素,进行归一化处理,并筛查损坏或重复的样本。质量控制筛查未导致任何图像被排除,因此全部 15,148 张图像均保留用于后续分析。该数据集使用固定的随机种子 42 随机划分为训练集(70%)、验证集(15%)和测试集(15%),以确保数据划分的可重复性。WikiArt 数据集通过官方 WikiArt 仓库(https://www.wikiart.org/)获取,包含超过 80,000 幅艺术作品,涵盖 27 种艺术风格。在风格学习实验中,使用了 56,000 张图像进行训练,12,000 张用于验证,12,000 张用于测试。
数据预处理
在训练所提出的 SegCycle-SPADE 框架之前,苗族蜡染文化图案数据集和 WikiArt 数据集均经过若干预处理步骤,以确保图像质量的一致性和特征表示的准确性。两个数据集均采用相同的基本预处理流程,包括高斯去噪、归一化、调整至统一输入分辨率以及图像质量验证。然而,这两个数据集在框架中承担不同的角色:WikiArt 数据集用于艺术风格的学习与合成,而苗族蜡染数据集则主要用于文化图案的语义分割与重建。除上述任务特定的角色外,未对任一数据集进行特定的预处理调整。为确保深度学习模型处理的一致性,首先将所有图像调整至固定分辨率。此步骤是必要的,因为两个数据集中的图像分辨率因其来源不同而存在差异。调整分辨率可提高计算效率,并防止维度不一致影响模型训练。第二个预处理步骤是归一化,即将像素值缩放到标准化范围内,以稳定训练过程中的梯度更新。随后,采用高斯滤波对图像进行处理,以降低可能干扰文化图案结构的噪声。对于苗族蜡染数据集,直接使用从原始数据集来源获取的现有文化图案分割掩膜,且未作任何修改,用于语义分割的训练与评估。本研究未专门生成新的分割掩膜。
除非另有说明,描述已有方法的方程均改编自先前的研究,并相应地予以引用。描述所提出的CAFFM方法及复合SegCycle-SPADE优化框架的方程由作者为本研究专门建立。
设数据集中的输入图像表示为公式 1:
(1)
其中,H、W 和 C 分别表示图像的高度、宽度和颜色通道数。所有图像均被调整为固定尺寸 H′ × W′,如公式 2所示:

其中,Ir 为调整大小后的图像。归一化像素值根据公式 3计算:
(3)
这有助于稳定训练过程。噪声滤波使用高斯滤波器进行,如公式 4所示:

其中,G(σ) 为高斯滤波器,* 表示卷积运算。采用的是标准差为 σ = 1.0 的 5 × 5 核高斯滤波器。为减少边缘伪影,对边界像素应用了反射填充。在缩放和归一化之前,去噪处理在图像加载后立即进行。为确保整个研究过程中预处理的一致性,相同的滤波器配置被应用于苗族蜡染数据集和 WikiArt 数据集中的每幅图像。对于苗族蜡染数据集,分割掩码根据公式 5生成:

此处,M 是用于引导 SegFormer 模型的分割掩膜。
预处理流程从获取苗族蜡染数据集(Miao Batik dataset)和 WikiArt 数据集的图像开始,如图3所示。训练过程中未采用任何数据增强技术。经过包括图像缩放、归一化、高斯去噪和分割掩膜制备在内的预处理后,图像被直接用于所提出的 SegCycle-SPADE 框架的训练、验证和测试。预处理流程的第一步是将图像调整为固定尺寸,以使深度学习模型能够更高效地处理图像。第二步是归一化,即将像素值转换为标准化的数值范围,以促进模型收敛。第三步是去噪处理,通过清除图像中的无关噪声来提升图案识别效果。此外,针对苗族蜡染数据集,对文化纹样区域进行了标注,从而生成可用于模型分割模块的掩膜,确保在生成过程中保留文化纹样。该阶段的最终输出是一个干净的数据集,可用于训练所提出模型的分割与生成模块。

图3.文化遗产图像的数据预处理流程。该工作流展示了模型训练前应用的图像预处理步骤,包括数据集获取、图像调整大小、归一化、高斯去噪、现有文化图案标注以及分割掩膜制备。经处理后所得的图像和掩膜将作为语义分割与图案重建的输入数据。请点击此处查看该图的放大版本。
在模型训练之前,每张图像均经过质量控制流程。苗族蜡染数据集包含15,148张图像。原始数据集创建者已对损坏、重复及低质量样本进行了处理;因此,本研究在质量控制筛选过程中未额外排除任何图像。因此,全部15,148张图像均被保留用于分析。在预处理阶段,图像以RGB格式加载,并使用双线性插值调整为256 × 256像素。像素值通过除以255,从[0, 255]范围缩放到[0, 1]范围。随后按通道进行归一化处理,红、绿、蓝三个通道分别采用均值[0.485, 0.456, 0.406]和标准差[0.229, 0.224, 0.225]。预处理流程包括图像加载、RGB格式转换、尺寸调整、像素值缩放、归一化及张量转换。必要时,将灰度图像转换为三通道RGB格式,以确保与深度学习模型的兼容性。预处理完成后,图像被划分为训练集、验证集和测试集。SegCycle-SPADE框架的所有阶段——包括语义分割、特征融合、纹样重建以及基于SPADE的艺术化合成——均采用统一的输入分辨率256 × 256像素。
基于 SegFormer 的语义模式分割
完成此预处理步骤后,苗族蜡染文化纹样数据集和 WikiArt 数据集的已清洗和标准化图像将输入至基于 SegFormer-B2 框架构建的语义分割模块。该步骤的目的是准确识别并分离出文化遗产图案中存在的文化纹样。所提出的 SegFormer 框架基于 Transformer 架构,结合了分层 Transformer 编码器和轻量级 MLP 解码器,以精确捕捉复杂文化遗产图案中的全局上下文信息以及详细的结构信息。该模型首先从输入图像中提取多尺度的特征表示,随后通过解码器融合这些表示,生成精确的分割图案。这确保了遗产图像中的图案被正确分割为几何图案、花卉图案和象征性图案等纹样类别,同时将其与背景分离并保持其结构完整性。这些结构信息将在后续 SegCycle-SPADE 框架的图案生成阶段中被进一步利用。
设预处理后的输入图像表示为公式6:
(6)
SegFormer 编码器将图像分割成若干图像块,并利用 Transformer 层提取分层特征,如公式 71所示:

此处,F 表示从 Transformer 编码器获得的多尺度特征图。这些特征编码了局部纹理模式以及基序区域之间的全局上下文关系。SegFormer 模型按照公式 8中定义的方式提取不同尺度的特征图:

多尺度表示的使用有助于在文化图案中检测出不同尺寸的模式。最后,如公式91所示,通过MLP解码器对特征进行组合:

此处,S 表示最终的预测分割图。
SegFormer-B2 主干网络使用在 ImageNet 上预训练的权重进行初始化,随后在苗族蜡染数据集上进行微调,以实现文化图案的分割。预训练的检查点来自官方的 SegFormer 实现。具体而言,使用了官方 SegFormer 仓库提供的 ImageNet-1K 预训练 MIT-B2 检查点(mit_b2.pth),在微调前用于初始化 SegFormer-B2 主干网络。这些预训练权重对应于 SegFormer 作者发布的 MIT-B2 主干网络,并作为语义分割训练的初始化模型。其余任务特定的层在训练前采用 PyTorch 默认的权重初始化方法进行初始化。
该架构采用具有重叠图像块嵌入的四阶段分层 Transformer 编码器。在第一阶段,图像块大小设置为 7 × 7,步长为 4。对于四个编码器阶段,嵌入维度分别为 64、128、320 和 512。在四个阶段中,多头自注意力头的数量分别为 1、2、5 和 8,对应的编码器深度分别为 3、4、6 和 3 层。从编码器提取的多尺度特征通过一个轻量级的全 MLP 解码器进行聚合。在生成最终分割图之前,解码器将每个编码器阶段的特征投影到一个统一的嵌入空间中。所有 Transformer 模块均使用高斯误差线性单元(GELU)作为激活函数。训练过程中采用 0.1 的 dropout 率,以提升泛化能力并减少过拟合。
在训练阶段,SegFormer 框架接收来自两个数据集的预处理图像。苗族蜡染数据集中的图像包含作为分割模型监督学习标签的纹样区域。Transformer 编码器处理整幅图像,并捕捉图像组件之间的长距离关系,这对于包含空间分布纹样的传统蜡染图案尤为重要。分层特征提取机制同时捕捉局部结构,例如重复的几何纹理。MLP 解码器处理这些提取的特征,并生成突出显示纹样区域的分割掩膜。此阶段生成的分割图随后被用作注意力模块和图案重建阶段的结构输入,从而有助于保持生成图案的真实性。
根据视觉和文化特征,将文化图案划分为不同的类别以进行语义分割。分割分类体系包括动物图案(如蝴蝶、鱼类、鸟类及其他象征性动物)、植物图案(如花朵、叶片、藤蔓及植物纹样)、几何图案(如重复形状、边框及抽象几何结构),以及代表非图案区域的背景部分。采用像素级分割掩膜,将每个像素分配至一个预定义类别。整数标签编码如下:标签 0 = 背景,标签 1 = 动物图案,标签 2 = 植物图案,标签 3 = 几何图案。分割标注及图案标签均直接来源于原始苗族蜡染数据集。本研究未进行任何额外的手动标注、重新标记、边界验证或专家确认流程。训练与评估所用的标注信息均直接采用数据集创建者提供的现有标注,未作任何修改。
用于文化图案分割的 SegFormer 模型通过基于 Transformer 的机制处理来自苗族蜡染数据集和 WikiArt 数据集的预处理图像,以精确检测文化图案区域,如图4所示。首先,包含传统文化图案的输入图像被送入 SegFormer 模型。Transformer 编码器从图像块中提取全局上下文信息和局部结构特征。所得到的多尺度特征被传递给分割解码器,该解码器利用混合前馈网络(Mix Feed-Forward Network)来优化特征表示并提升图案检测效果。SegFormer 模型的输出是一张分割掩码,突出显示对应于文化图案的像素,同时抑制无关的背景信息。分离出的文化图案随后作为 SegCycle-SPADE 框架后续阶段的结构引导。

图 4.基于 SegFormer-B2 的文化图案语义分割。 用于文化图案提取并在苗族蜡染数据集上专门训练的 SegFormer-B2 语义分割模块架构。该框架包含一个基于 Transformer 的编码器,用于多尺度特征提取,以及一个轻量级分割解码器,用于生成图案掩码。模型预测四个语义类别——动物、植物、几何图形和背景,生成的分割掩码可识别具有文化意义的图案区域,同时抑制无关的背景信息。这些分割输出为所提出的 SegCycle-SPADE 框架后续的特征融合、重建和艺术合成阶段提供结构指导。 请点击此处查看该图的放大版本。
在建议的框架中无需创建新的分割标注。苗族蜡染数据集取自已有的公开来源,模型训练使用了数据集提供者提供的相关纹样信息。在学习过程中,SegFormer 模型生成了语义分割图。因此,本研究无需额外的手动标注软件、标注指南或标注质量控制流程。
CAFFM
为了增强语义分割特征与生成重建表征之间的交互,该研究还提出了一种 CAFFM 模块。SegFormer-B2 编码器向 CAFFM 模块提供语义特征图,而 CycleGAN 重建步骤则提供生成特征图。首先,使用线性投影层将两个特征流投影到一个共同的嵌入空间中。为了进行交叉注意力计算,利用生成的特征张量构建查询(Q)、键(K)和值(V)表示。随后,通过多头交叉注意力机制对结构基序信息与艺术风格元素之间的关系进行建模。接着,对融合后的特征表示应用层归一化、残差连接以及带有 GELU 激活函数的前馈网络层。最终,基于 SPADE 的合成阶段接收 CAFFM 模块的输出,从而在不牺牲艺术连贯性的前提下保留具有文化意义的主题。
为确保特征兼容性,首先使用线性投影层将输入特征投影到嵌入维度为256的共享嵌入空间中。随后,采用具有八个注意力头的多头交叉注意力(MultiHead Cross-Attention)机制,对语义结构信息与生成式风格表征之间的关联进行建模。交叉注意力计算依赖于特定线性变换层生成的查询(Query, Q)、键(Key, K)和值(Value, V)向量。为提升训练稳定性并保持特征完整性,引入残差连接和层归一化(Layer Normalization)以进一步增强融合后的特征表征。随后,通过应用带有高斯误差线性单元(GELU)激活函数的前馈网络,提升非线性特征学习能力。该模块最终生成维度为256的输出特征表征,并传递至后续阶段用于创意合成。CAFFM通过基于交叉注意力的融合技术,成功结合了艺术风格数据与文化纹样结构,从而在重建的文化遗产图案中增强了纹样保持性与视觉连贯性。
在所提出的系统中,结构特征源自苗族蜡染数据集,而风格特征则从 WikiArt 数据集学习得到。设通过苗族蜡染数据集图像经 SegFormer 分割网络提取的特征图记为 Fs,而通过 WikiArt 图像在风格特征提取分支中获得的特征图记为 Fa。所提出的 CAFFM 模块利用交叉注意力机制融合这两个特征域,以学习文化图案的结构与风格依赖关系。表3列出了所有架构特性,包括嵌入维度、归一化层、激活函数以及注意力头的配置。对于尺寸为 256 × 256 像素的输入图像,SegFormer-B2 编码器生成大小为 64 × 64 × 128 的语义特征图,风格特征提取分支也生成大小为 64 × 64 × 128 的特征图。在进行交叉注意力融合之前,这两个特征图均通过可学习的线性层投影到维度为 256 的共享嵌入空间中。
| 参数 | 配置 |
| 提出框架 | SegCycle-SPADE |
| 语义分割模型 | SegFormer-B2 |
| SegFormer 编码器阶段数 | 4 |
| 权重初始化 | ImageNet-1K 预训练 SegFormer-B2(MIT-B2 主干网络) |
| 检查点来源 | 官方 NVIDIA SegFormer 仓库(https://github.com/NVlabs/SegFormer);检查点:segformer.b2.512x512.ade.160k |
| 微调策略 | 在苗族蜡染数据集上进行端到端微调 |
| 图像块嵌入尺寸 | 7 × 7 |
| 图像块步长 | 4 |
| 嵌入维度 | 64、128、320 和 512 |
| 编码器深度 | 3、4、6 和 3 |
| 注意力头数 | 1、2、5 和 8 |
| 解码器类型 | 全 MLP 解码器 |
| 激活函数 | GELU |
| Dropout 率 | 0.1 |
| 特征增强模块 | 交叉注意力文化特征融合模块(CAFFM) |
| CAFFM 嵌入维度 | 256 |
| CAFFM 注意力头数 | 8 |
| CAFFM 融合尺度数 | 4 |
| 重建模型 | CycleGAN |
| 风格生成模型 | SPADE |
| 文化数据集 | 苗族蜡染数据集 |
| 风格数据集 | WikiArt 数据集 |
| 苗族蜡染图像数量 | 15,148 |
| WikiArt 图像数量 | 约 80,000 |
| 输入图像分辨率 | 256 × 256 像素 |
| 颜色格式 | RGB |
| 插值方法 | 双线性插值 |
| 去噪方法 | 高斯滤波 |
| 高斯核大小 | 5 × 5 |
| 高斯标准差(σ) | 1 |
| 归一化范围 | [0, 1] |
| 批量大小 | 16 |
| 训练轮数 | 100 |
| 优化器 | Adam |
| 学习率 | 0.0002 |
| Adam 参数 | β₁ = 0.5,β₂ = 0.999,ε = 1 × 10⁻⁸,权重衰减 = 0 |
| 损失函数 | 分割损失、对抗损失、循环一致性损失、重建损失、图案保持损失和风格一致性损失 |
| 数据集划分策略 | 训练集 / 验证集 / 测试集 |
| 训练集比例 | 70% |
| 验证集比例 | 15% |
| 测试集比例 | 15% |
| 随机种子 | 42 |
| 评估指标 | 分割准确率、IoU、Dice 系数、SSIM、PSNR 和 FID |
| 编程语言 | Python 3.8.10 |
| 深度学习框架 | PyTorch 1.10.0 |
| 硬件平台 | NVIDIA RTX 3090 GPU(24 GB 显存)、Intel Core i7(第 11 代)、32 GB 内存 |
| 操作系统环境 | Ubuntu 20.04 LTS |
表3:实验设置与模型配置。 所提出的SegCycle-SPADE框架在实现与评估过程中所使用的架构组件、训练配置、预处理设置、数据集、优化参数、评价指标及计算环境的汇总。
注意力模块首先使用公式 10将特征图映射为查询、键和值的表示形式:

其中,Wq、Wk 和 Wv 为可学习的权重矩阵。注意力权重通过查询向量与键向量之间的相似性计算得到,计算公式见公式 1117:

其中,dk 是键向量的维度。通过将注意力权重与值矩阵相乘,使用公式 12计算增强的特征表示:

其中,Fa 是特征图的增强特征表示。该增强特征表示通过将原始分割特征与利用注意力机制获得的增强特征相结合来计算,具体如公式 13所示:
其中,Fe 是用于图案重建的增强特征图。CAFFM 通过引入多尺度交叉注意力机制,以提取不同尺度下的文化纹样特征。设 Fsi 表示在尺度 i 上的分割特征,而 Faj 表示在同一尺度下的艺术风格特征。最终的特征表示由公式 14定义:

其中,Qi、Ki 和 Vi 分别表示尺度 i 上的查询、键和值矩阵,N 表示特征尺度的数量。在本研究中,N = 4,对应于从输入图像尺寸的 1/4、1/8、1/16 和 1/32 空间分辨率下提取的特征图。这些多尺度特征表示在重建和艺术合成之前,通过可学习的注意力权重进行融合。上述扩展使该方法能够提取全球文化图案和纹理,以重建文化模式。CAFFM 位于所提出的 SegCycle-SPADE 系统中基于 SegFormer 的分割阶段与基于 SPADE 的创意合成阶段之间。首先,CycleGAN 并行生成包含风格和图案相关信息的重建特征,而 SegFormer-B2 则恢复描述文化图案结构特性的语义特征图。CAFFM 模块接收这两路特征流,并利用基于交叉注意力的融合机制识别结构表示与艺术表示之间的关联。为了在保持语义一致性和结构特征的同时生成具有文化真实性的图案,融合后的特征图随后被送入 SPADE 模块进行分割引导的创意合成。
使用 CycleGAN 进行图案重建
在基于注意力的特征增强阶段完成后,特征图将包含增强后的文化图案结构。然而,这些特征图可能仍存在不完整或受损的图案区域。因此,为解决图案重建问题,所提出的框架将采用 CycleGAN 模型。在该框架中,两个域分别为原始文化图案和重建后的文化图案。利用前一阶段得到的增强特征,CycleGAN 模型将在保持结构一致性的前提下重建文化图案。这将确保几何图案、花卉图案和象征性图案等文化图案的空间布局得以保留。原始苗族蜡染图像经过随机掩码和部分遮挡操作,以生成不完整或受损的文化图案。这些退化处理模拟了在老化文化遗产文物中常见的图案缺失区域和结构损伤。退化后的图像被用作重建模块的输入,而对应的原始图像则作为参考图像,用于性能评估和重建质量分析。该策略使模型能够学习缺失图案结构的恢复方法,同时保持语义一致性和文化特征。
设 X 为不完整文化模式的域,Y 为重建文化模式的域。两个生成器通过公式 15学习执行双向映射:

此处,GE 用于重构模体结构,而 FM 用于将模式映射回原始域。对抗损失用于确保重构的模式具有真实性(公式 16)30

此处,DY 是用于区分真实图案与重建图案的判别器,GE(x) 表示生成的重建图案。CycleGAN 还施加了循环一致性约束,以保留文化图案的结构布局(公式 17)30。

最终的损失函数由公式1830定义:

其中,λi 表示循环一致性损失的权重系数,在训练过程中设置为 10,与原始 CycleGAN 的设定一致。该数值的选择旨在平衡源域与目标域之间的对抗学习与重建一致性。
CycleGAN 重建模块包含两个生成器和两个判别器,用于双向图像转换。每个生成器采用残差网络架构,由一个初始的 7 × 7 卷积层、随后的两个下采样卷积层、九个残差块以及两个上采样层组成。除输入层使用 7 × 7 卷积核以增强特征提取外,其余所有卷积操作均采用 3 × 3 的卷积核。每个卷积层后均应用实例归一化(Instance Normalization),以提高训练稳定性,生成器网络中全程使用 ReLU 激活函数。输出层采用 Tanh 激活函数,以生成归一化的图像输出。判别器采用 70 × 70 的 PatchGAN 架构,由一系列卷积层构成,卷积核大小为 4 × 4,特征通道数逐层递增。判别器中使用实例归一化和 LeakyReLU 激活函数(负斜率 = 0.2),以提升特征判别能力与对抗学习效果。CycleGAN 模块接收预处理后的文化图案图像作为输入,生成重建的图案表示,并随后传递至 CAFFM 模块,与分割特征进行融合。CycleGAN 的训练采用 Adam 优化器(β₁ = 0.5,β₂ = 0.999),初始学习率为 0.0002。学习率在前 100 个训练周期保持不变,随后在剩余训练阶段线性衰减至零。训练过程中使用包含 50 张先前生成图像的重放缓冲区(replay buffer),以稳定判别器的训练。生成器与判别器采用 1:1 的更新比例,即每次训练迭代中先更新一次生成器,再更新一次判别器。
CycleGAN 的重建过程基于 图5 中使用 CAFFM 机制获得的增强特征图。这些特征图包含从前述的分割阶段和 CAFFM 中获取的增强文化图案。特征图被用作第一个生成器 GE 的输入。GE 学习重建文化图案所需的映射关系。生成的输出随后被送入判别器 DY,以区分真实的文化图案与重建的图案。判别器 DY 协助生成器 GE 生成逼真的输出。为了确保文化图案在重建过程中不发生畸变,第二个生成器 FM 执行循环一致性映射。该生成器 FM 将输出映射回原始域,随后由判别器对输出进行评估以确保其真实性。最终输出随后被传递至 SPADE 模块,用于在所提出的 SegCycle-SPADE 框架的下一阶段生成艺术风格。

图5.基于CycleGAN的图案重建工作流程。 CycleGAN重建模块的工作流程。将经过注意力增强的特征表示作为生成器网络的输入,以重建不完整的文化图案。判别器将重建结果与参考图案进行对比评估,而循环一致性映射则在双向图像转换过程中保持结构完整性。重建后的图案随后被传递至SPADE模块,用于艺术风格合成。请点击此处查看该图的放大版本。
使用 SPADE 生成艺术风格
随后,重建的文化图案被输入至 SPADE 模块以生成艺术风格。SPADE 模块的主要目标是在不破坏图案结构布局的前提下,为重建的文化图案添加更丰富的艺术风格纹理。SPADE 模块是一种条件图像生成技术,利用图像分割的概念来生成图像。多通道语义图对应于预定义的图案类别,由 SegFormer-B2 生成的语义分割掩码编码而来。这些编码后的语义图作为条件输入提供给 SPADE 生成器。在每个 SPADE 层中,通过卷积层处理语义图以生成空间自适应的缩放参数(γ)和偏置参数(β)。生成器通过将这些参数应用于归一化的特征激活,从而在艺术合成过程中保持图案边界、结构布局以及语义信息。由于条件化过程在 SPADE 生成器的多个层级上进行,语义引导能够同时影响高层级的结构重建和低层级的纹理合成。因此,生成的艺术图案既保留了分割阶段识别出的文化图案结构,又融合了来自 WikiArt 数据集的艺术风格特征。
本研究使用了WikiArt数据集作为理解艺术风格的主要资源,该数据集包含来自27种不同艺术类别的作品,例如文艺复兴、印象派、立体主义、表现主义、超现实主义、现实主义和抽象艺术等。为了使模型接触多样的艺术特征并增强风格泛化能力,在训练过程中从各个类别中随机选取风格图像。为减少风格偏差,数据集被划分为训练集、验证集和测试集,且各艺术类别在三个子集中均保持均衡分布。为确保全部27个艺术类别的代表性均衡,采用了分层抽样方法,按照原始类别分布的比例,将每个类别的样本相应分配至训练集、验证集和测试集。CAFFM模块用于融合从WikiArt图像中提取的风格特征与CycleGAN生成的重建特征。融合后的表示作为条件信息输入至SPADE生成器,使合成网络能够在保持由分割图提取的语义结构和文化图案边界的同时,实现艺术特征的迁移。得益于这种风格条件化技术,所提出的框架能够生成具有文化真实性的艺术图案,并保持结构与风格表达的一致性。
SPADE 还引入了依赖于分割图的空间自适应参数。这些参数可以如公式 191所示进行定义:

其中,γ(S) 是空间变化的尺度参数,β(S) 是空间变化的偏置参数。这些参数可帮助生成器根据图像中的语义区域生成不同的纹理和风格。最终的文化艺术作品可由公式 20定义:

其中,GE 为 SPADE 生成器,XrP 为重建图案,SM 为分割图。最终作品在增强艺术表现力的同时,保持了文化图案的结构完整性。为优化所提出的 SegCycle-SPADE 架构,采用了一种综合损失函数,以平衡语义分割精度、文化图案保留、图案重建质量以及艺术风格一致性。该训练目标由分割损失(Lseg)、对抗损失(Ladv)、循环一致性损失(Lcycle)、重建损失(Lrecon)、图案保留损失(Lmotif)和风格一致性损失(Lstyle)的加权组合构成。总损失函数定义见公式 21:
(21)
为了确保输入文化图案与重建文化图案之间的结构一致性,循环一致性损失系数被设置为10。为保持精细的图案特征并提高视觉准确性,重建损失系数设定为5。为了在艺术合成过程中突出对文化核心结构模式的保留,图案保留损失的系数设为2。为促进艺术风格迁移的同时避免过度扭曲语义图案结构,风格一致性损失系数调整为1。为了在真实图像生成与精确图案分割之间保持平衡的贡献,分割损失和对抗损失被赋予相等的权重。风格一致性损失的计算采用了WikiArt数据集基于特征的风格表示。具体而言,通过从深层特征图中提取的格拉姆矩阵(Gram matrix)相关性来捕捉艺术风格特征。风格损失通过目标风格图像与生成图像的格拉姆矩阵之间的弗罗贝尼乌斯范数(Frobenius norm)差异进行计算,如公式22所示:

其中,Gl 是从第 lth 个特征层计算得到的格拉姆矩阵,Igen 表示生成的艺术图像,Istyle 表示来自 WikiArt 数据集的目标风格图像,而 F 表示弗罗贝尼乌斯范数。该公式使所提出的框架能够在保持文化图案的结构和语义完整性的同时,保留其艺术特征。
CAFFM 模块生成的融合特征表示被用作 SPADE 模块的条件输入,该模块是所提出框架中的艺术合成组件。SPADE 生成器包含七个 SPADE 残差块,潜在特征维度为 256 个通道,并以 256 × 256 像素的分辨率生成输出图像。来自 SegFormer–CAFFM 模块的语义分割图在整个 SPADE 残差层中被用作条件输入。SPADE 层应用于每个残差块内的激活函数之前,从而实现由分割引导的语义条件控制。通过连续的上采样和卷积操作,潜在特征表示被逐步优化,在保持语义一致性和图案结构的同时生成高分辨率的艺术图案。生成器中普遍使用 LeakyReLU 激活函数,输出层则采用 Tanh 激活函数以生成归一化的图像。
算法与工作流程
SegCycle-SPADE 框架在一个统一的训练流程中集成了语义分割、特征融合、模式重建和艺术风格合成。该工作流程始于数据集的获取与预处理,包括图像缩放、归一化、去噪以及分割掩码的准备。预处理后的图像随后通过 SegFormer-B2 分割网络进行处理,以提取语义图案表征。生成的分割特征通过 CAFFM 与重建特征相融合,实现结构图案信息与艺术特征表征之间的交互。融合后的特征图被输入至 CycleGAN 重建模块,该模块在保持语义一致性的前提下恢复不完整的文化图案结构。重建后的图案随后被送入 SPADE 生成器进行分割引导的艺术合成,从而在保留图案边界和结构真实性的基础上实现风格增强。在训练过程中,模型参数通过 公式 21 和 22 中描述的复合损失函数进行优化,该函数平衡了分割准确性、图案保留、重建质量以及艺术风格一致性。详细的逐步实现流程(包括数据集加载、预处理、模型初始化、训练迭代、验证过程、检查点选择及最终评估)见 补充文件 1(算法 1)。完整的算法工作流程采用批量大小为 16、学习率为 0.0002,并训练 100 个周期。数据集划分、模型初始化及所有训练实验均使用固定的随机种子 42。该种子在 Python、NumPy 和 PyTorch 的随机数生成器中保持一致,以确保结果可复现。Adam 优化器配置为 β₁ = 0.5,β₂ = 0.999,且不使用权重衰减(weight decay = 0)。模型检查点根据验证集上取得的最高验证 IoU 分数进行选择。
损失函数优化
为在重建和艺术合成过程中保留文化图案结构,所提出的框架采用了一种复合优化目标,该目标结合了分割损失、对抗损失、循环一致性损失、重建损失、图案保留损失以及风格一致性损失。完整的数学表达式、权重系数及风格损失的定义详见使用SPADE的艺术风格生成小节中的公式21和公式22。其中,图案保留项通过惩罚预测图案区域与对应真实分割掩码之间的结构偏差,从而在重建过程中促进对具有文化意义的图案结构的保留。
所提出的 SegCycle-SPADE 框架通过两个数据集进行了评估:苗族蜡染文化图案数据集和 WikiArt 数据集。苗族蜡染数据集包含传统文化遗产图像,主要用于语义分割和结构重建任务;而 WikiArt 数据集包含多样的艺术风格,用于艺术风格学习与生成。两个数据集的图像均经过完整的 SegCycle-SPADE 流程处理,包括语义分割、CAFFM、图案重建以及基于 SPADE 的艺术风格生成。通过融合文化图案信息与艺术风格表征,该框架能够生成具有文化意义且视觉连贯的输出结果。
所有实验均在配备 Intel Core i7 处理器和 NVIDIA GPU 的 GPU 工作站上进行。具体而言,实验所用工作站配置为 Intel Core i7(第 11 代)CPU、24 GB 显存的 NVIDIA RTX 3090 GPU 以及 32 GB 系统内存。模型使用 Python 3.8 和 PyTorch 1.10 搭建,并启用 CUDA 加速。训练过程采用单 GPU 设置,未使用分布式训练。所有实验均采用标准的 FP32 精度,未采用混合精度训练。优化器选用 Adam,批量大小为 16,训练周期为 100 轮。表 3 总结了本研究中使用的实现参数和计算环境。
所提出的架构包含四个主要组件:用于语义分割的 SegFormer-B2、用于特征融合的 CAFFM、用于图案重建的 CycleGAN,以及用于艺术风格合成的 SPADE。来自两个数据集的图像在训练前均被调整为 256 × 256 像素。这一标准化分辨率在保留重要图案细节的同时确保了计算效率,并有助于 CycleGAN 和 SPADE 模块的稳定对抗训练。
采用分割和图像质量评估指标(包括分割准确率、交并比、Dice相似系数(Dice)、结构相似性指数(SSIM)、峰值信噪比(PSNR)和Fréchet起始距离(FID))对所提出框架的性能进行了评估。通过目视检查生成的文化图案,定性评估其视觉真实性。定性评估重点关注生成图案在图案保留、语义一致性、文化特征和艺术表现方面与参考文化图案的相符程度。视觉真实性未作为独立的定量评估指标使用。
使用以下指标对所提出的框架进行了定量评估。
使用公式23计算分割准确性:

其中,TP、TN、FP 和 FN 分别表示真阳性、真阴性、假阳性和假阴性。
使用公式 24计算交并比(IoU):

使用公式 25计算了 Dice 相似性系数(Dice):

SSIM 用于评估图像的感知相似性,其定义见公式 2633:
(26)
其中,μ 表示平均强度,σ 表示方差,σxy 表示图像间的协方差,C1 和 C2 为稳定常数。
PSNR 是一种常用于评估生成图像质量的指标,其定义见公式 2733:

此处,MaxI 表示图像的最大可能像素值,MSE 是原始图像与重建图像之间的均方误差。
可以使用均值和协方差矩阵按照公式 2833计算FID:
(28)
其中,μr 是真实图像的均值,μg 是生成图像的均值,Σr 和 Σg 分别是真实图像与生成图像的协方差矩阵。
为了进行性能比较,将所提出的框架与常用于语义分割、图像重建和艺术图像生成的代表性方法进行了对比评估。其中,U-Net 和 DeepLabV3+ 作为分割任务的基线方法,Pix2Pix 和 CycleGAN 作为重建任务的基线方法。StyleGAN 和 AttentionGAN 则被用作艺术图像生成的代表性方法。这些对比旨在评估 SegCycle-SPADE 在同时提升艺术质量的同时,保留结构模体信息的有效性。
每个实验均重复五次,以评估性能的稳定性和可重复性。数据集划分时采用固定的随机种子42,以确保所有实验中的训练集、验证集和测试集保持一致。结果以均值±标准差表示。在准确率、IoU、Dice、SSIM、PSNR和FID等指标中观察到的标准差值较低,表明所提出的框架在多次实验运行中表现出稳定的性能。采用配对t检验评估统计学显著性,当p < 0.05时,认为差异具有统计学显著性。由于所有模型均在相同的数据集划分上进行评估,因此获得了重复运行间的配对性能测量值,这支持使用配对t检验。为控制与多次两两比较相关的整体误差率,采用了Bonferroni校正,并通过调整后的阈值α/n确定统计学显著性,其中n表示两两比较的次数。
实验结果有力地支持了所提出的SegCycle-SPADE框架的有效性。SegFormer-B2实现的优异分割性能表明,其能够准确识别并保留具有文化意义的图案边界。IoU和Dice分数的提升进一步说明,在整个处理流程中,语义图案结构得到了有效保持。CycleGAN与SPADE的结合成功重建了不完整的图案结构,同时保留了精细的视觉细节,这体现在SSIM和PSNR值的提高上。此外,更低的FID分数表明生成的艺术图案与真实的文化艺术图像更为相似,说明其风格一致性与视觉真实感得到了提升。
CAFFM通过促进基于分割的结构信息与生成式风格表征之间的有效交互,显著推动了这些改进。通过基于交叉注意力的特征融合,CAFFM在保持文化图案之间长距离关联的同时,增强了结构保真度与艺术真实性。
图6展示了所提出的SegCycle-SPADE框架与现有方法在苗族蜡染和WikiArt数据集上的分割精度对比。U-Net和DeepLabV3+等传统分割方法由于具备学习空间表征的能力,取得了具有竞争力的性能。然而,Pix2Pix和CycleGAN表现出较低的分割精度,因为它们并非专门为分割任务设计。所提出的SegCycle-SPADE框架在两个数据集上均实现了最高的分割精度,这得益于SegFormer-B2与基于CAFFM的特征增强模块的结合。

图 6.不同方法间分割精度的比较。在苗族蜡染数据集(Miao Batik)和 WikiArt 数据集上,使用 U-Net、DeepLabV3+、Pix2Pix、CycleGAN 以及所提出的 SegCycle-SPADE 框架获得的分割精度比较结果。数据以五次独立实验的均值 ± 标准差(SD)表示(n = 5),误差条代表一个标准差。数值越高表示分割性能越优。所提出的 SegCycle-SPADE 框架在两个数据集上均取得了最高的分割精度。请点击此处查看该图的放大版本。
图7展示了各评估方法之间的交并比(IoU)对比结果。由于U-Net和DeepLabV3+采用面向分割的网络结构,因此在重叠率指标上表现出色。相比之下,Pix2Pix和CycleGAN的IoU值较低,因为它们的主要目标是图像转换,而非语义分割。本文提出的SegCycle-SPADE框架在两个数据集上均取得了最高的IoU值,表明其在文化图案区域的定位精度和保留效果方面均有提升。

图 7.文化图案分割的交并比(IoU)分数比较。在苗族蜡染和 WikiArt 数据集上,不同分割方法的 IoU 性能比较。结果以五次独立实验的均值 ± 标准差(SD)表示(n = 5)。误差条表示一个标准差。较高的 IoU 值表明预测图案区域与参考图案区域之间的重叠程度更高,且图案边界得到更好的保留。所提出的 SegCycle-SPADE 框架在两个数据集上均取得了最高的 IoU 分数。请点击此处查看该图的放大版本。
图8展示了Dice相似性系数的比较结果。Dice系数用于衡量预测的分割掩码与真实标签模体区域之间的重叠程度。传统的分割方法由于在学习空间结构方面具有较好的效果,因此取得了相对较高的Dice分数。然而,本文提出的SegCycle-SPADE框架在两个数据集上均获得了最高的Dice分数,表明其在分割一致性和模体保持方面具有更优的性能。

图 8.文化纹样分割的 Dice 系数比较。在苗族蜡染和 WikiArt 数据集上使用不同分割方法所得 Dice 系数值的比较。Dice 系数用于评估预测分割掩膜与参考掩膜之间的重叠程度,数值越高表示分割性能及纹样区域识别效果越好。所提出的 SegCycle-SPADE 框架在两个数据集上均取得了最高的 Dice 系数值。请点击此处查看该图的放大版本。
图9展示了重建文化图案之间的结构相似性(SSIM)比较结果。基于生成对抗网络(GAN)的方法(如Pix2Pix、CycleGAN和StyleGAN)由于专为图像生成而设计,其SSIM值高于传统分割方法。然而,本文提出的SegCycle-SPADE框架在两个数据集上均取得了最高的SSIM值,表明其在保留结构细节和艺术连贯性方面具有更优性能。
图9.结构相似性指数(SSIM)比较。在苗族蜡染和WikiArt数据集上使用不同重建方法获得的结构相似性指数(SSIM)值的比较。结果以五次独立实验的均值±标准差(SD)表示(n = 5)。误差条表示一个标准差。较高的SSIM值表明重建图案与参考图案之间的结构相似性更高。所提出的SegCycle-SPADE框架在两个数据集上均取得了最高的SSIM得分。请点击此处查看该图的放大版本。
使用FID评估生成艺术图案的真实性及分布相似性。FID计算采用预训练的Inception-v3网络,从pool3层提取特征向量,得到2048维的特征表示。在特征提取之前,生成图像和参考图像通过双线性插值调整为299 × 299像素,并根据标准的Inception-v3预处理协议进行归一化。FID基于独立测试数据集提取的特征分布进行计算。均值和协方差统计量由特征嵌入估计,并用于标准FID公式中。
如表4所示,Pix2Pix和CycleGAN等传统的图像生成方法由于缺乏明确的结构引导,产生的FID分数相对较高。StyleGAN和AttentionGAN通过改进特征学习能力,实现了较低的FID分数。然而,本文提出的SegCycle-SPADE框架在两个数据集上均取得了最低的FID分数,表明其在图像真实性、风格一致性以及文化图案保留方面具有更优性能。
| 方法 | 苗族蜡染数据集(FID) | WikiArt 数据集(FID) |
| Pix2Pix | 48.6 | 52.3 |
| CycleGAN | 42.8 | 46.5 |
| StyleGAN | 39.7 | 43.1 |
| AttentionGAN | 36.9 | 40.4 |
| SegCycle-SPADE(本文提出) | 28.5 | 31.2 |
表4:文化图案重建的弗雷歇 inception 距离(FID)结果。 所提出的 SegCycle-SPADE 框架与基线生成模型在苗族蜡染和 WikiArt 数据集上的弗雷歇 inception 距离(FID)得分比较。FID 值越低,表明生成图像与真实图像特征分布之间的相似性越高,因此反映出重建文化图案的视觉真实感更优。
图10比较了不同方法所达到的重建质量。重建质量(%)通过将重建图像与对应参考图像之间的结构相似性(SSIM)转换为百分比尺度(SSIM × 100)计算得出。较高的百分比表示与原始文化图案在结构保真度和视觉相似性方面更为接近。传统的生成模型(如Pix2Pix和CycleGAN)实现了中等水平的重建效果。而更先进的架构(包括StyleGAN和AttentionGAN)由于具备更强的特征学习能力,重建质量有所提升。然而,本文提出的SegCycle-SPADE框架因融合了语义分割引导、交叉注意力特征融合、重建学习以及艺术合成机制,实现了最高的重建质量。

图10.图案重建质量比较。在苗族蜡染数据集和WikiArt数据集上,使用Pix2Pix、CycleGAN、StyleGAN、AttentionGAN以及所提出的SegCycle-SPADE框架所实现的重建质量对比。结果以五次独立实验的均值±标准差(SD)表示(n = 5)。误差条表示一个标准差。数值越高,表明结构细节、语义一致性和视觉保真度的保留效果越好。所提出的SegCycle-SPADE框架在两个数据集上均取得了最高的重建质量评分。请点击此处查看该图的放大版本。
PSNR 用于通过测量重建图像与相应参考图像之间的像素级相似性来评估重建保真度。PSNR 的计算基于每幅重建图像与其对应的原始苗族蜡染图像(作为真实参考)之间的比较。较高的 PSNR 值表明重建误差较低。如表5所示,Pix2Pix 和 CycleGAN 由于在缺乏明确结构引导的情况下重建图案,仅达到了中等水平的 PSNR 值。StyleGAN 和 AttentionGAN 通过更深层次的特征学习实现了更高的 PSNR 值。本文提出的 SegCycle-SPADE 框架在两个数据集上均取得了最高的 PSNR 值,表明其在重建保真度以及文化图案结构的保留方面具有优越性能。
| 方法 | 苗族蜡染数据集 (PSNR, dB) | WikiArt 数据集 (PSNR, dB) |
| Pix2Pix | 25.8 | 24.6 |
| CycleGAN | 27.3 | 26.1 |
| StyleGAN | 28.7 | 27.5 |
| AttentionGAN | 29.9 | 28.6 |
| SegCycle-SPADE (本文提出) | 32.4 | 31.2 |
表5:文化图案重建的峰值信噪比(PSNR)结果。 所提出的SegCycle-SPADE框架与基线方法在苗族蜡染和WikiArt数据集上获得的峰值信噪比(PSNR)值的比较。较高的PSNR值表明相对于相应参考图像,重建保真度更高,失真更小。
图11 展示了所提出的 SegCycle-SPADE 框架在训练过程中的收敛行为。损失曲线表示在五次独立训练运行中平均得到的平均训练损失。为了降低随机变异性并提供更稳健的训练收敛表征,每个训练轮次的损失值均在所有运行中进行了平均。在初始训练阶段,损失值相对较高,因为模型仍在从输入数据中学习特征表示。随着训练的进行,所有损失分量逐渐下降并趋于稳定,表明分割、重建和艺术合成目标得到了有效优化。观察到的收敛行为证明了所提出框架在训练过程中的有效性、稳定性和可重复性。

图11.所提出 SegCycle-SPADE 框架的训练收敛性。 所提出的 SegCycle-SPADE 框架在 100 个训练轮次中的训练损失曲线,结果为五次独立训练运行的平均值(n = 5)。该图展示了训练过程中总损失(LTotal)、分割损失(LSeg)、生成器损失(LG)和判别器损失(LD)的变化情况。所有损失分量的逐步下降并最终趋于稳定,表明所提出框架成功收敛且优化过程稳定。请点击此处查看该图的放大版本。
消融实验
为了评估所提出的 SegCycle-SPADE 框架中每个组件的贡献,通过多种受控模型配置进行了消融实验。结果汇总于表6和表7中。
| 模型配置 | 分割准确率 (%) | IoU | SSIM |
| 仅 SegFormer | 87.3 | 0.76 | 0.82 |
| SegFormer + CAFFM | 89.6 | 0.79 | 0.86 |
| SegFormer + CAFFM + CycleGAN | 91.4 | 0.82 | 0.89 |
| SegFormer + CAFFM + CycleGAN + SPADE(本文提出) | 93.8 | 0.86 | 0.93 |
表6:SegCycle-SPADE组件的消融研究。 逐步增强模型配置的性能比较,用于评估框架中各个组件的贡献。本研究考察了语义分割、交叉注意力文化特征融合模块(CAFFM)、基于CycleGAN的重建以及基于SPADE的艺术化合成对分割准确率、交并比(IoU)和结构相似性指数(SSIM)的影响。数值越高,表示图案分割效果、重建质量及结构保持能力越优。
| 变体 | 交并比 (%) | Dice系数 (%) | 结构相似性指数 | 峰值信噪比 (dB) | Fréchet起始距离 ↓ |
| 仅SegFormer | 84.2 ± 0.4 | 88.5 ± 0.3 | 0.82 ± 0.01 | 24.8 ± 0.2 | 31.8 ± 0.6 |
| SegFormer + CycleGAN | 86.7 ± 0.3 | 90.2 ± 0.2 | 0.85 ± 0.01 | 26.3 ± 0.2 | 27.5 ± 0.5 |
| SegFormer + SPADE | 87.0 ± 0.3 | 90.5 ± 0.2 | 0.88 ± 0.01 | 27.8 ± 0.2 | 23.4 ± 0.4 |
| SegFormer + CAFFM | 90.0 ± 0.2 | 93.1 ± 0.2 | 0.90 ± 0.01 | 29.6 ± 0.1 | 20.3 ± 0.3 |
| SegCycle-SPADE(完整模型) | 93.0 ± 0.2 | 95.4 ± 0.1 | 0.92 ± 0.01 | 31.2 ± 0.1 | 17.6 ± 0.2 |
表7:所提出的SegCycle-SPADE框架的组件贡献分析。 各个框架变体的性能比较,用于评估CAFFM、CycleGAN、SPADE以及完整的SegCycle-SPADE架构的贡献。结果使用交并比(IoU)、Dice系数、结构相似性指数(SSIM)、峰值信噪比(PSNR)和弗雷歇 inception 距离(FID)进行报告。较高的IoU、Dice、SSIM和PSNR值表示更优的分割与重建质量,而较低的FID值表示生成的文化图案具有更高的视觉真实感。
表6通过四种配置评估了主要框架组件的累积贡献:(i)仅SegFormer,(ii)SegFormer + CAFFM,(iii)SegFormer + CAFFM + CycleGAN,以及(iv)SegFormer + CAFFM + CycleGAN + SPADE(所提出的框架)。基准SegFormer模型的分割准确率为87.3%,IoU得分为0.76,SSIM值为0.82。引入CAFFM模块后,所有评估指标的性能均得到提升,分割准确率提高至89.6%,IoU提升至0.79,SSIM提升至0.86。加入CycleGAN进一步增强了结构重建能力,使IoU达到0.82,SSIM值达到0.89。完整的SegCycle-SPADE框架取得了最佳的整体性能,分割准确率达到93.8%,IoU为0.86,SSIM值为0.93。这些结果表明,每个组件均逐步提升了分割准确性、结构保持能力以及图像重建质量。
表7 进一步通过五种模型变体研究了各个框架组件的贡献:(i)仅 SegFormer,(ii)SegFormer + CycleGAN,(iii)SegFormer + SPADE,(iv)SegFormer + CAFFM,以及(v)完整模型,该模型整合了 SegFormer、CAFFM、CycleGAN、SPADE 和基序保持损失。性能评估采用了 IoU、Dice 系数、SSIM、PSNR 和 FID 指标。
基础的仅使用 SegFormer 的配置达到了 84.2% 的交并比(IoU)、88.5% 的 Dice 系数、0.82 的结构相似性指数(SSIM)、24.8 dB 的峰值信噪比(PSNR)以及 31.8 的 Fréchet 起始距离(FID)分数。引入 CycleGAN 后,重建质量得到提升,FID 分数降低至 27.5,表明图像真实性增强。进一步引入 SPADE 模块后,结构相似性和图像质量进一步改善,SSIM 值提升至 0.88,FID 分数降至 23.4。加入本文提出的 CAFFM 模块后,各项指标均取得显著提升,IoU 提高至 90.0%,Dice 系数提升至 93.1%,SSIM 提升至 0.90,PSNR 提高至 29.6 dB,同时 FID 分数降低至 20.3。完整的模型进一步引入了基序保持损失(motif-preservation loss),实现了最佳的整体性能,IoU 达到 93.0%,Dice 系数达到 95.4%,SSIM 值为 0.92,PSNR 为 31.2 dB,FID 分数降至 17.6。
表8展示了用于文化遗产图案重建与保护的代表性深度学习方法的比较概览。基于传统卷积神经网络(CNN)的方法在局部特征学习和分割性能方面表现有效,但由于对长距离依赖关系建模能力有限,通常难以保留复杂的图案结构。基于生成对抗网络(GAN)的方法提升了图像合成与风格迁移能力,但可能存在语义不一致和细微结构细节丢失的问题。基于Transformer的方法增强了全局上下文理解能力,但通常缺乏生成式重建能力;而基于扩散模型的方法虽能实现高视觉真实感,却以更高的计算复杂度为代价。混合型Transformer-GAN方法通过结合特征提取与图像生成机制,在一定程度上缓解了上述局限性。相比之下,本文提出的SegCycle-SPADE框架在一个统一架构中集成了基于Transformer的分割、跨注意力特征融合、生成式重建以及分割引导的艺术化合成,从而提升了结构保真度、语义一致性以及文化图案的保留效果。该比较总结见表8。
| 方法 | 核心技术 | 优势 | 局限性 | 在文化遗产领域的相关性 |
| 基于CNN的方法(例如 U-Net、DeepLabV3+) | 卷积特征提取与语义分割 | 有效的局部特征学习与精确分割 | 建模长距离依赖关系能力有限;难以保留复杂的图案结构 | 适用于图案分割,但在艺术重建方面效果有限 |
| 基于GAN的方法(例如 Pix2Pix、CycleGAN) | 对抗性图像生成与图像到图像的转换 | 高质量图像合成与风格迁移 | 训练过程不稳定;存在语义不一致;可能丢失精细的结构细节 | 可用于图案修复,但可能无法准确保留文化图案 |
| 基于Transformer的方法 | 自注意力机制与全局上下文建模 | 能够捕捉长距离依赖关系与复杂的视觉关联 | 计算成本高;需要大规模训练数据集 | 适用于复杂图案分析,但单独使用时生成能力有限 |
| 基于扩散模型的方法 | 基于迭代去噪的图像生成 | 具有高视觉真实感与图像多样性 | 推理速度慢;计算资源需求高;结构控制能力有限 | 在文化遗产图像生成方面前景良好,但计算开销大 |
| 混合型Transformer-GAN方法 | 基于Transformer的特征提取与基于GAN的生成相结合 | 提升了全局特征表示能力与图像质量 | 通常缺乏用于图案保留的显式语义引导 | 增强了生成质量,但并非专为文化遗产图案设计 |
| 本文提出的SegCycle-SPADE | SegFormer + CAFFM + CycleGAN + SPADE | 基于Transformer的分割、注意力引导的特征融合、语义一致性、图案保留以及可控的艺术重建 | 相比独立的CNN方法具有更高的计算复杂度 | 专为文化遗产图案的重建与保护而设计,具有更高的结构保真度与语义一致性 |
表8:文化遗产图案重建与保护中代表性深度学习方法的比较。 对用于图像分割、图案重建、风格生成及文化遗产保护的代表性深度学习方法进行定性比较。该表总结了每种方法的核心方法论、优势、局限性及适用性,并强调了所提出的SegCycle-SPADE框架如何结合语义分割、特征融合、重建和风格合成,以应对文化遗产图案在结构保持和语义一致性方面的挑战。
观察到的改进表明,CAFFM 模块通过基于交叉注意力的特征融合,有效增强了由分割生成的结构特征与艺术风格表示之间的交互。此外, motif-保持损失有助于在重建和艺术合成过程中维持具有文化意义的 motif 结构,从而提高了分割一致性、结构保真度和视觉真实感。综合来看,消融实验结果证实,SegFormer-B2、CAFFM、CycleGAN、SPADE 以及 motif-保持损失的集成共同促成了所提出的 SegCycle-SPADE 框架的优异性能。
数据可用性:
用于艺术风格学习的 WikiArt 数据集可通过 Kaggle WikiArt 仓库公开获取(https://www.kaggle.com/datasets/steubk/wikiart)。本研究中使用的苗族蜡染数据集可通过 Zenodo 公开获取(https://doi.org/10.5281/zenodo.20807658)。与所提出的 SegCycle-SPADE 框架相关的处理后数据集、分割掩码、预训练模型权重、生成结果及 Python 实现文件也可通过同一 Zenodo 仓库获取。
补充文件:
补充文件 1. 算法 1:所提出的 SegCycle-SPADE 框架的实现流程。 逐步伪代码,描述了所提出的 SegCycle-SPADE 框架的完整实现流程,包括数据集加载、预处理、使用 SegFormer-B2 进行语义分割、使用跨注意力文化特征融合模块(CAFFM)进行特征融合、使用 CycleGAN 进行文化图案重建、使用 SPADE 进行艺术风格合成、模型训练、验证、检查点选择以及最终性能评估。请点击此处下载该文件。
近年来,由于传统工艺逐渐消失,非物质文化遗产(ICH)图案的保存与数字化重建受到越来越多的关注。先前的研究尝试通过基于深度学习(DL)的图像处理技术来应对文化遗产的流失问题。例如,Quan 等人32提出了一种基于知识图谱和深度学习的框架,用于贵州苗族蜡染文化的保护。尽管该研究聚焦于文化图案的数字化重建,但其方法主要依赖于知识图谱的表示。类似地,Fu 和 Razmjooy16提出了一种基于特征金字塔网络(FPN)的框架,用于文化遗产图像的增强与修复。尽管该方法在图像增强方面实现了有效的特征提取,但并未引入图像分割引导机制或针对不完整文化图案的生成式重建机制。相比之下,本文提出的 SegCycle-SPADE 框架结合了多种深度学习组件,以克服上述挑战。首先,采用 SegFormer 模型进行语义分割,以准确识别文化遗产图案中的纹样区域;随后,基于 CAFFM 的特征增强模块提升了细粒度纹样结构的特征表示;接着,利用 CycleGAN 重建模块通过对抗学习重建文化图案中缺失或不完整的区域;最后,SPADE 模块在保持与分割图结构对齐的同时实现风格化增强。现有的基于 CNN、GAN、Transformer 和扩散模型的方法17,19,20,21,22,23,24,25,30,34 各具独特优势,但在保持语义一致性、结构特征保留或计算效率方面仍存在局限性,如表8所总结。本文提出的 SegCycle-SPADE 架构融合了基于 SegFormer 的分割、交叉注意力特征融合、CycleGAN 重建以及 SPADE 引导合成等优势,同时有效克服了上述局限性。因此,该框架在重建质量以及对具有文化意义的纹样的保护方面均实现了提升。
尽管该方法表现出良好的性能,所提出的 SegCycle-SPADE 框架仍存在若干局限性。首先,评估仅使用了苗族蜡染和 WikiArt 数据集,这可能限制该框架在其他文化遗产领域的泛化能力。其次,由于集成了 SegFormer、CAFFM、CycleGAN 和 SPADE,模型的计算复杂度和内存需求增加,导致在资源受限平台上的部署可能面临挑战。第三,分割性能在很大程度上依赖于图案标注的质量与一致性,而标注偏差可能影响对具有文化意义结构的保留。最后,由于该框架仅在两个数据集上进行了评估,可能需要更多的训练数据和针对特定领域的调整,以确保其在多样化的文化遗产藏品中的适用性。因此,未来的研究应探索更稳健的训练策略、轻量级网络架构、改进的标注流程,以及利用更多文化遗产数据集进行的跨领域评估。
SegCycle-SPADE 框架在更大规模和更多样化的文化遗产数据集上的可扩展性将是未来研究的重点。将针对来自不同地区和艺术传统的文化遗产图案开展跨文化评估,以提升模型的泛化能力与文化适应性。此外,通过引入文本描述、历史记录和文化元数据等多模态信息,可能在重建过程中提供更强的语义引导。该框架还可通过结合基于图像的重建方法与三维建模技术,进一步拓展至支持三维文化遗产的重建。同时,还将在数字档案馆、博物馆、虚拟展览以及文化遗产保护平台中探索该框架的部署应用,以推动人工智能辅助文化遗产保护与记录的实际应用。为进一步提升模型的可解释性与文化真实性,未来的研究将探索融合文化知识图谱、民族志记录、历史元数据以及专家构建的知识库,从而实现基于文化背景的图案分析与重建32。
在实施所提出的 SegCycle-SPADE 框架时,应考虑若干实际因素。在 CycleGAN 训练过程中,若生成器与判别器的损失严重失衡,可能会出现对抗性收敛不稳定的情况。此时,降低学习率、增加循环一致性损失权重或监控判别器主导情况,可能有助于提升训练稳定性。当生成器反复产生视觉上相似的输出时,可能发生模式崩溃;该问题可通过平衡对抗训练、使用回放缓冲区以及仔细监控生成器与判别器损失趋势加以缓解。当文化图案呈现复杂纹理、低对比度或边界模糊时,也可能出现分割失败。为解决此问题,应在训练前验证图像质量,并对分割掩码进行视觉检查,以确保标注的一致性。保持推荐的输入分辨率和归一化设置,对于实现可靠的 SegFormer 性能也至关重要。训练不稳定还可能源于不恰当的学习率设置、训练数据不足或硬件相关的数值波动。为提高可重复性,应在 NumPy、PyTorch、CUDA 及数据集打乱操作中使用固定的随机种子。此外,所有实验运行应保持相同的预处理流程、数据集划分、模型超参数和软件环境。建议定期保存检查点并监控验证损失,以防止性能下降,并便于从中断的训练中恢复。
本研究对基于人工智能的文化遗产重建框架的理论发展具有推动作用。传统的图像修复方法通常将图像分割、重建和风格生成视为相互独立的过程17,19,20,30。相比之下,本研究提出了一种通过分割引导的生成式重建策略将这些过程整合起来的框架。因此,本研究通过展示分割、重建和风格生成如何在单一框架内实现统一,推动了人工智能辅助文化遗产重建的理论发展。这种整合在文化遗产应用中尤为重要,因为在这些应用中,保持图案结构和语义含义至关重要。从实践角度来看,所提出的框架为传统文化遗产图案的数字化保存、修复和艺术性增强提供了一种有效解决方案。文化遗产机构、博物馆和设计师可利用SegCycle-SPADE自动识别图案区域,重建受损或不完整的图案,并生成视觉上增强的传统设计艺术表现形式。这一能力对于濒危的手工艺传统尤其有价值,例如苗族蜡染纺织图案,其历史文物可能部分受损或不完整。此外,通过引入生成式风格合成,该框架还可支持现代文化设计应用,如纺织品设计、数字艺术创作和文化遗产教育。通过这种方式,所提出的框架弥合了文化遗产保护与当代文化设计应用之间的鸿沟。
尽管所提出的SegCycle-SPADE框架取得了令人鼓舞的结果,但仍存在若干局限性。首先,评估仅使用了苗族蜡染和WikiArt数据集,这可能影响该框架在重建其他形式文化遗产图案时的泛化能力。其次,由于重建过程依赖基于生成对抗网络(GAN)的模型,在处理高度复杂的图案结构时,生成结果偶尔可能出现伪影或不自然的纹理。第三,该框架目前仅聚焦于二维图案的重建,而部分文化遗产实物本质上具有三维结构。总体而言,实验结果表明,所提出的SegCycle-SPADE框架在非物质文化遗产(ICH)图案的艺术化重建方面具有有效性。基于SegFormer的语义分割、CAFFM模块、基于CycleGAN的图案重建以及基于SPADE的艺术化合成的集成,持续提升了分割、重建及图像质量的各项性能指标。消融实验进一步验证了框架中各组成部分的贡献,表明CAFFM模块和图案保持损失函数显著增强了结构保真度与视觉真实性。这些发现支持了本研究的核心假设:语义分割引导的重建方法结合交叉注意力特征融合,能够在生成艺术性丰富输出的同时,有效保留具有文化意义的图案元素。因此,该框架为非物质文化遗产图案的数字化保存、修复与创造性复兴提供了一种可靠且可重复的计算方法。
利益冲突:
作者声明无竞争利益。
作者感谢广东工程职业技术学院和华南师范大学在本研究完成过程中提供的学术与机构支持。本研究受2023年度国家社会科学基金一般项目(No. 23BH161)资助,项目名称为 数字再生博物馆:中国经典书画文物的活化与传播研究
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Adam 优化器 | PyTorch 优化器库 | Adam | 模型训练过程中使用的优化算法。 |
| CUDA 工具包 | NVIDIA 公司 | CUDA 11.3 | 用于深度学习计算的 GPU 加速。 |
| cuDNN | NVIDIA 公司 | cuDNN 8.2 | 用于加速训练和推理的深度神经网络加速库。 |
| CycleGAN | 加州大学伯克利分校 / 开源 | 官方 PyTorch 实现(https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix) | 用于文化纹样重建的生成对抗网络。 |
| ImageNet 预训练权重 | ImageNet / 开源 | mit_b2.pth(ImageNet-1K 预训练检查点) | 在苗族蜡染数据集上进行微调前,用于初始化 SegFormer-B2 主干网络。 |
| Intel 处理器 | Intel 公司 | Intel Core i7(第 11 代) | 用于图像预处理、模型训练支持和推理的 CPU。 |
| Matplotlib | Matplotlib 开发团队 | Matplotlib 3.5.1 | 用于训练曲线和评估结果的可视化。 |
| 苗族蜡染数据集 | Zenodo 仓库 | DOI: 10.5281/zenodo.20807658 | 包含 15,148 张图像的文化纹样数据集,用于语义分割和图案重建。 |
| NumPy | NumPy 开发者 | NumPy 1.21.5 | 用于数值计算和数据集处理。 |
| NVIDIA GPU | NVIDIA 公司 | NVIDIA RTX 3090(24 GB 显存) | 用于模型训练和推理的硬件平台。 |
| OpenCV | OpenCV 基金会 | OpenCV 4.5.5 | 用于图像预处理、缩放、插值和高斯去噪。 |
| 操作系统 | Canonical 公司 | Ubuntu 20.04 LTS | 实验执行环境。 |
| Pillow(PIL) | Python 图像库 | Pillow 8.4.0 | 用于图像加载和操作。 |
| Python | Python 软件基金会 | Python 3.8.10 | 用于实现和实验的编程语言。 |
| PyTorch | Meta AI | PyTorch 1.10.0 | 用于模型训练和推理的深度学习框架。 |
| 随机种子 | 实验设置 | 42 | 用于数据集划分、模型初始化和实验可重复性的固定种子。 |
| Scikit-learn | Scikit-learn 开发者 | Scikit-learn 1.0.2 | 用于数据集划分、统计分析和评估指标。 |
| Seaborn | 开源社区 | Seaborn 0.11.2 | 用于统计数据分析可视化。 |
| SegFormer-B2 | NVIDIA 研究院 / 开源 | SegFormer-B2(MIT-B2 主干网络) | 基于 Transformer 的语义分割模型,用于文化纹样分割。 |
| 分割掩码 / 标注 | 苗族蜡染数据集 | 随数据集提供 | 用于纹样分类和训练的像素级语义分割标签。 |
| SPADE | NVIDIA 研究院 / 开源 | 官方 PyTorch 实现(https://github.com/NVlabs/SPADE) | 基于分割引导的图像合成模型,用于艺术图案生成。 |
| TorchVision | Meta AI | TorchVision 0.11.1 | 与 PyTorch 配合使用的图像处理工具和数据集变换。 |
| WikiArt 数据集 | WikiArt | https://www.wikiart.org/ | 包含超过 80,000 件艺术品、涵盖 27 种艺术风格的艺术风格数据集,用于风格学习与合成。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可