本プロトコルでは、デジタル保存および創造的な文化遺産の活用を目的とした、非物質文化遺産のパターンのセマンティックセグメンテーション、再構成、および芸術的スタイル合成のためのディープラーニングワークフローについて解説します。ここでは、トランスフォーマーベースの特徴抽出、敵対的再構成、および空間適応的な画像生成を用いています。
研究記事
本プロトコルでは、デジタル保存および創造的な文化遺産の活用を目的とした、非物質文化遺産のパターンのセマンティックセグメンテーション、再構成、および芸術的スタイル合成のためのディープラーニングワークフローについて解説します。ここでは、トランスフォーマーベースの特徴抽出、敵対的再構成、および空間適応的な画像生成を用いています。
深層学習ベースの画像合成技術の進展に伴い、無形文化遺産(ICH)パターンのデジタル保存と再構築がますます注目を集めています。既存のSegCycle-SPADEベースのアプローチは、伝統工芸パターンの構造的なセグメンテーションと芸術的な再構築において可能性を示してきましたが、データセットの多様性の不足、文化的意味論の組み込み不十分、および再構築時における構造的なパターン特徴の保持不足などの制限が残っています。これらの課題を解決するため、本研究ではICHパターン種類のセグメンテーションおよび芸術的再構築に向けた、改良版SegCycle-SPADEフレームワークを提案します。モチーフの境界とパターン領域を正確に特定するために、TransformerベースのセグメンテーションモデルであるSegFormerを採用しています。さらに、文化的に重要なモチーフを強調し、特徴表現を向上させるために、Cross-Attention Cultural Feature Fusion Moduleを導入しました。パターンの変換と再構築にはCycleGANを用い、セグメンテーションマップと生成画像間の意味的一貫性を維持するための芸術的スタイル合成にはSpatially-Adaptive Denormalization(SPADE)を使用しています。モデルの汎用性と芸術的多様性を高めるため、本フレームワークは苗族 Batikの文化的モチーフデータセットとWikiArtデータセットの両方を用いて学習されています。実験結果から、提案されたアテンション誘導型SegCycle-SPADEフレームワークは、既存の生成敵対的ネットワーク(GAN)ベースの再構築手法と比較して、セグメンテーション精度と文化遺産パターンの再構築性能を向上させることが実証されました。提案されたフレームワークは、人工知能を用いた文化遺産の記録、再構築、および伝統的なパターンデザインの芸術的再生のための拡張可能なソリューションを提供します。
慣習、言語、信仰といった無形要素と、芸術作品、建造物、書面記録といった有形要素の両方を含む文化遺産は、人類の歴史、創造性、およびアイデンティティの根本的な現れです1。遺産保存は、コミュニティが自らの起源と再びつながることを可能にし、将来の世代が集団的な文化的記憶から恩恵を受けることを目的としています。また、異文化間の理解、多様な伝統や慣習への賞賛、そして異なる歴史的物語の認識を促進します。これらの文化的資産は、前世代の価値観、視点、経験を理解するのに役立ち、現代の社会的アイデンティティの形成と文化的継続性に寄与します。文化遺産保存の基本原則を図1に示します。

Figure 1. SegCycle-SPADEフレームワークを用いた文化遺産パターンの再構成に関する概念的概要。無形文化遺産のパターンの再構成および強化のために提案されたアプローチの模式的な図。ワークフローには、Miao BatikおよびWikiArtデータセットからのデータセット収集、画像の前処理、SegFormer-B2を用いたセマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module(CAFFM)を用いた特徴融合、CycleGANを用いたパターンの再構成、SPADEを用いた芸術的スタイルの合成、そしてセグメンテーションおよび再構成の指標を用いた最終評価が含まれる。矢印は、フレームワーク全体におけるデータおよび特徴表現の流れを示す。こちらの画像をクリックして拡大表示してください。
人間社会の集団的記憶と文化的遺産は、無形文化遺産(ICH)に具現化されており、これは芸術的表現と文化的アイデンティティのための重要な媒体として機能しています。しかし、ICHはグローバル化とデジタル化の影響により、重大な課題に直面しています2,3,4。熟練した職人の減少や現代市場への適応力の不足により、消滅の危機にある多くのICHの実践には、保存と発展のための新しいアプローチが必要です5,6。ICH研究の重要な領域として、サステナブルデザインは文化、社会、環境の統合的な発展を強調しており、ICHの継続的な保存のための実践的な道筋を提供します。サステナブルデザインのアプローチを通じて、現代社会のニーズに適応させながら、ICHを活性化させることが可能です7,8
本研究において、「無形文化遺産パターン」という用語は、根底にある無形の文化的価値を伝え、保存するための視覚的なモチーフ表現を指します。したがって、提案されたフレームワークは、これらのモチーフの視覚的形態を再構築しつつ、それに付随する文化情報を保存し、記録することを目的としています。
苗族の刺繍とバティック(ろうけつ染め)は、中国の重要な無形文化遺産(ICH)であり、鳥や蝶、祖先のトーテムなどの象徴的なモチーフを通じて、苗族コミュニティの歴史、信仰、伝統を反映しています9。これらのモチーフは儀礼服や祭事の慣習に深く組み込まれており、地域の文化および経済発展に寄与しています10,11。デジタル技術、特に人工知能(AI)とディープラーニング(DL)の進歩は、文化遺産の保存、分析、復元、および記録に新たな機会をもたらしました。中国で最も保存状態の良いバティック伝統の一つである貴州苗族バティックは、苗族の文化的知識、信仰、習慣、儀礼を伝承するための重要な媒体となっています12,13,14,15,16。
近年の研究により、文化遺産の保存とパターンの再構成におけるディープラーニング(DL)の有用性が実証されており、U-NetやDeepLabV3+と比較して、セグメンテーション精度(画素精度 = 88.6%、平均インターセクション・オーバー・ユニオン [IoU]= 78.1%)および再構成性能の向上が達成されています。しかし、依然としていくつかの課題が残っています。既存の敵対的生成ネットワーク(GAN)ベースの手法では、複雑なパターンにおける微細な構造的詳細の保持が困難な場合が多く17、また、データセットの多様性が限られているため、異なる文化領域におけるモデルの汎用性が制限されています18。加えて、CycleGANなどの画像間翻訳モデルでは、セグメンテーションマップと生成画像間の意味論的一貫性を維持できないことがあり19、アテンションメカニズムの欠如により、再構成時に文化的に重要なモチーフの詳細が失われる可能性があります20。したがって、無形文化遺産(ICH)のパターンを効果的に再構成するためには、トランスフォーマーベースのセグメンテーション、アテンション誘導型特徴学習、およびマルチデータセット学習を統合した強化フレームワークが必要です。
苗族刺繍のデジタル化と生成AIの急速な進展により、文化遺産の保存に向けた新たな機会が生まれています。深層生成モデルの新しいクラスである拡散モデルは、その強力なコンテンツ生成能力により、コンピュータビジョンのタスクにおいて優れた性能を示しています21,22,23,24,25。逆拡散プロセスにおいて、モデルはノイズを含む表現から元の入力データを段階的に再構成することを学習します26,27,28。また、先行研究では、文化遺産の保存および普及のために、3次元再構成やコンピュータ支援設計(CAD)技術の適用についても検討されています。
畳み込みニューラルネットワーク(CNN)やGANは、画像の生成および特徴保持において高い性能を発揮しますが、受容野の制限、モード崩壊、および学習の不安定性といった課題が依然として存在します29。SegFormerやSegmenterなどのTransformerベースのアーキテクチャは、グローバルコンテキストや意味的関係の把握に優れていますが、計算コストが高く、微細なディテールの再現に苦慮する場合がある。Stable Diffusionなどの拡散モデルは強力な画像生成能力を示しますが、生成されたデザインの構造的および芸術的特性を精密に制御することが困難な場合が多いです。さらに、既存のアプローチの多くは独立した学習戦略を採用しているため、セグメンテーション成分と生成成分の間で効果的な情報の共有や協調的な最適化が制限されており、結果として構造的な正確さと芸術的な真正性の間でトレードオフが生じています30。
潜在拡散モデルやStable Diffusionなどの近年の拡散ベースモデルは、高品質な画像合成を実現していますが、反復的なデノイジングを必要とするため、計算コストと推論時間が増大します。さらに、特殊な条件付けメカニズムなしに、微細な文化的モチーフや構造的な一貫性を維持することは依然として困難です。Transformerベースの生成モデルは、グローバルな文脈関係を効果的に捉えますが、多くの場合、大規模なデータセットと膨大な計算リソースを必要とします。対照的に、提案するSegCycle-Spatially Adaptive Denormalization(SegCycle-SPADE)フレームワークは、SegFormerベースのセグメンテーション、クロスアテンションによる特徴融合、CycleGANによる再構成、およびSPADEによるガイド付き合成を組み合わせることで、明示的な構造的ガイダンスを提供し、これによりモチーフの保存、意味的一貫性、および文化遺産パターンの制御可能な再構成を向上させます。
最先端のセマンティックセグメンテーション手法の多くは、U字型アーキテクチャを持つ完全畳み込みニューラルネットワーク(FCNN)に基づいています31。エンコード段階では、一連の畳み込みおよびダウンサンプリング操作を通じて、広い受容野を持つ深い特徴量が抽出されます。デコード段階では、アップサンプリングによって空間解像度が段階的に復元され、最終的にピクセルレベルのセマンティック予測が可能になります。スキップ接続により、異なるエンコーダーレベルからの高解像度情報をデコーダーに直接統合することができ、ダウンサンプリング時の空間情報の損失を補完し、幅広いアプリケーションにおけるセグメンテーション性能を向上させています32。
近年のGANベース、CNNベース、および拡散ベースの手法は、画像生成や文化遺産の修復において有望な結果を示していますが、意味的な一貫性の維持、微細な構造モチーフの保存、および多様な文化的パターンにわたる再現可能な再構成の確保に苦慮することが多くあります。既存のアプローチの多くは、セグメンテーション、再構成、およびスタイル合成を個別のプロセスとして扱っており、その結果、文化的に重要な要素の喪失や出力の一貫性の欠如を招く可能性があります。この手法上の乖離を解消するため、本研究では、SegFormerベースの意味的セグメンテーション、新規のCross-Attention Cultural Feature Fusion Module(CAFFM)、CycleGANベースの再構成、およびSPADEガイド付きスタイル合成を統合した、統一的なSegCycle-SPADEフレームワークを提案します。構造的なセグメンテーション情報と生成的特徴学習を明示的に統合することにより、提案されたフレームワークは、文化的真正性と芸術的品質の両方を維持しつつ、より信頼性が高く、意味的に一貫し、かつ再現可能なICHモチーフの再構成を可能にします。
本研究では、現在の文化遺産復元の手法における3つの大きな限界を特定しています。(i) GANベースの復元手法における微細な構造的モチーフの保存不足、(ii) 小規模またはドメイン固有のデータセットでのトレーニングに起因する汎用性の低さ、(iii) image-to-image変換フレームワークにおけるセグメンテーション出力と生成画像の間の不十分な意味的整合性です。加えて、セグメンテーション、復元、およびスタイルの合成は通常、個別のプロセスとして扱われており、その結果、復元過程で文化的に重要な要素が失われることになります。提案するSegCycle-SPADEフレームワークは、Transformerベースの意味的セグメンテーション、クロスアテンション特徴融合、CycleGAN復元、およびSPADEガイド付きの芸術的合成を単一のアーキテクチャ内で統合することで、これらの限界を解消し、無形文化遺産(ICH)パターンの復元におけるモチーフの保存、意味的整合性、および芸術的な真正性を向上させます。
本研究の主な目的は、無形文化遺産(ICH)パターンの意味論的セグメンテーション誘導型芸術的再構成のための、拡張されたSegCycle-SPADEフレームワークを開発することである。このフレームワークは、文化的なモチーフを正確にセグメンテーションするためのSegFormer、パターンの再構成を行うCycleGAN、およびスタイル一貫性のある芸術的合成を実現するSPADEを統合している。特徴表現を改善し、微細な構造的詳細を保持するために、セグメンテーション特徴と生成特徴の間の効果的な相互作用を促進するCAFFMを導入した。Miao BatikおよびWikiArtデータセットで学習させた結果、提案したフレームワークは、再構成の真正性、スタイルの一貫性、および文化的に重要なモチーフの保存性を向上させた。
本研究では、セマンティックセグメンテーション、アテンション誘導型特徴融合、パターンの再構成、およびスタイル合成を単一のアーキテクチャに統合することで、無形文化遺産(ICH)パターンの芸術的な再構成のための新しいSegCycle-SPADEフレームワークを提案します。本研究の主な貢献は以下の通りです。第一に、SegFormerを統合することで、複雑な文化的モチーフや構造的要素を正確に抽出および保存できる、新しいセマンティックセグメンテーション誘導型再構成フレームワークを開発しました。第二に、セグメンテーション特徴を生成表現と効果的に融合させる新しいCAFFMを導入し、モデルが文化的モチーフと芸術的スタイルパターンの間の長距離的な関係を捉えられるようにしました。第三に、提案したCAFFMにより、文化的に重要な要素の保存を強化しつつ、再構成された遺産パターンの視覚的なリアリズムと構造的な一貫性を向上させました。第四に、文化パターンの再構成にCycleGANを、セグメンテーション誘導型の芸術的合成にSPADEを統合することで、生成された出力におけるセマンティックな正確さとスタイルの真正性の両方を確保しました。第五に、汎用性と芸術的多様性を向上させるため、文化パターンの学習には苗族 batik 文化的モチーフデータセットを、芸術的スタイルの表現にはWikiArtデータセットを用いてモデルを学習させました。WikiArtは、苗族の文化遺産製品に直接適用するためのターゲットスタイルとしてではなく、多様な視覚的コンテキストにおけるフレームワークの汎用能力、特徴学習の堅牢性、およびスタイル制御の有効性を評価するための補助データセットとして機能します。最後に、既存のGANベースの文化遺産再構成手法と比較して、提案したSegCycle-SPADEフレームワークは、セグメンテーション精度、再構成品質、およびスタイルの整合性において改善を達成したことを実験結果により実証しました。
提案されたSegCycle-SPADEのフレームワークは、セマンティックセグメンテーション、アテンションを用いた特徴量強化、生成的再構成、および芸術的スタイル合成を通じて、伝統的な文化遺産のパターンを再構成し改善するように設計されています。本研究では、Miao BatikデータセットおよびWikiArtデータセットを含む、公開されている文化遺産および芸術画像データセットを利用しました。本研究にヒトの参加者、患者データ、個人情報、動物被験者、または臨床記録は含まれていないため、機関倫理委員会の承認およびインフォームドコンセントは不要でした。まず、評価のためにMiao Batik文化モチーフデータセットとWikiArtデータセットが利用されます。Miao BatikデータセットはQuan et al. (2024)32で説明されており、伝統的な苗族(Miao)のバティックモチーフの注釈付き画像15,148枚が含まれています。データセット作成者によって提供された既存の注釈を直接使用し、本研究で追加の手動注釈は生成していません。次に、リサイズ、正規化、ノイズ除去、およびセグメンテーションマスクの作成によって画像の前処理が行われます。正確な前処理パラメータは、「データ前処理(Data Preprocessing)」のサブセクションに記載されています。提案されたフレームワークでは、データのセマンティックセグメンテーションにSegFormer-B2というTransformerベースのモデルを利用します。この手法は、文化モチーフの主要領域を検出し、その構造を学習するように設計されています。セグメント化された特徴量は、その後アテンションメカニズムを通じて強化され、文化モチーフに関連する重要な情報が強調され、無関係な情報は破棄されます。アテンションメカニズムの構成は、「CAFFM」のサブセクションに記載されています。強化された特徴量はその後CycleGANに送られ、サイクリック学習を通じて損傷した構造が再構成されます。トレーニング中、元のMiao Batik画像にランダムなマスキングおよび部分的な遮蔽操作を適用することで、不完全なモチーフサンプルを人工的に作成しました。これらの劣化手順により、劣化が進んだ文化遺産 artifactsに一般的に見られる、モチーフ領域の欠損や構造的損傷をシミュレートしました。得られた不完全な画像はCycleGAN再構成モジュールの入力として使用され、対応する元の画像が再構成ターゲットとして機能しました。再構成された文化遺産パターンは、その後SPADEを通じて強化され、生成されたセグメンテーションマップに基づいて芸術的強化が行われます。提案されたフレームワークの性能は、定量的セグメンテーションおよび画像品質メトリクスを用いて評価され、再構成された文化モチーフの視覚的な真正性は定性的に評価されます。視覚的な真正性は、生成された文化パターンの目視検査を通じて評価され、独立した定量的指標としては使用されませんでした。評価は、対応する参照文化モチーフに対する、モチーフの保存、セマンティックの一貫性、文化的特性、構造的コヒーレンス、および芸術的な外観に焦点を当てて行われました。モデル性能の定量的評価は、Segmentation Accuracy、IoU、Dice Coefficient、Structural Similarity Index Measure (SSIM)、Peak Signal-to-Noise Ratio (PSNR)、およびFréchet Inception Distance (FID)を用いて行われました。図2は、提案されたSegCycle-SPADEフレームワークの全体的なワークフローを示し、本研究で使用された評価メトリクスをまとめています。

Figure 2. 提案するSegCycle-SPADEフレームワークの全体的なアーキテクチャワークフロー。SegCycle-SPADEワークフローの全体概要。Miao BatikおよびWikiArtデータセットの画像は、前処理を経て、SegFormer-B2によるセマンティックセグメンテーション、CAFFMによる特徴強化、CycleGANによるパターン再構築、そしてSPADEによる芸術的スタイル生成へと処理される。モデルの性能は、Segmentation Accuracy、Intersection over Union (IoU)、Dice Coefficient、Structural Similarity Index Measure (SSIM)、PSNR、Fréchet Inception Distance (FID)を用いて評価され、視覚的な真正性は定性的に評価される。こちらのリンクをクリックして、この図の拡大版を表示してください。
文化遺産のパターン再構成のためのSegCycle-SPADEフレームワークは、図2に示すように、モチーフの正確なセグメンテーション、再構成、および芸術的な強化のために、複数のDLコンポーネントを統合するように設計されています。多様な文化パターンと芸術的スタイルを提供するために、Miao Batik文化モチーフデータセットおよびWikiArtデータセットの画像が使用されます。最初に、画像はSegFormerベースのセマンティックセグメンテーションモジュールを用いて処理され、背景から文化モチーフを特定し、輪郭を抽出します。全体のアーキテクチャは4つの主要なステージで構成されています。第一に、SegFormerモデルが文化パターン画像からセマンティックセグメンテーションマップを抽出します。第二に、CAFFMがセグメンテーション特徴量と生成表現を統合し、特徴学習を強化します。第三に、CycleGANモジュールが融合された特徴表現を用いて文化パターンを再構成します。最後に、SPADEモジュールが、セグメンテーションガイド付き合成を通じて構造的な一貫性を維持しつつ、スタイルを強化した出力を生成します。精緻化された特徴マップは、その後CycleGAN再構成モジュールによって処理され、このモジュールは劣化させたパターンを対応する完全な形式にマッピングすることで、不完全な文化モチーフを復元することを学習します。不完全なモチーフサンプルは、元のMiao Batik画像にランダムなマスキングおよび部分的遮蔽操作を適用して生成され、これにより、損傷した文化遺物に一般的に見られるパターンの欠損領域や構造的な劣化をシミュレートしました。各劣化画像は、トレーニング時の再構成ターゲットとして機能する対応する元の画像とペアにされました。この戦略により、CycleGANモジュールは、セマンティックな一貫性と文化的に重要な特性を維持しながら、欠損したモチーフ構造の復元を学習することが可能となりました。最終的に、SPADEジェネレーターは、生成されたセグメンテーションマップを条件として画像合成を行うことで、視覚的に強化された芸術的な出力を生成し、これにより芸術的強化プロセス全体を通じて文化モチーフの構造的完全性を維持します。
提案されたSegCycle-SPADEフレームワークには、以下の手順が含まれます。
ステップ 1:データセットの収集
文化的パターンの学習および芸術的スタイルの生成という目的を達成するために、2つのデータセットを使用した。伝統的な文化的パターンの情報を提供するために、Miao Batik Cultural Motif Datasetを使用した。このデータセットはZenodo (https://doi.org/10.5281/zenodo.20807658) を 통해公開されており、アノテーション済みの伝統的な苗族バティック文様の画像15,148枚が含まれている。データセット作成者によって提供された既存のアノテーションをそのまま使用し、本研究において追加の手動アノテーションは行わなかった。芸術的スタイル生成のための多様な芸術的スタイル情報を提供するためにWikiArtデータセットを使用し、これは公開されているWikiArtリポジトリ (https://www.wikiart.org/) から取得した。
ステップ2:データの前処理
すべての画像は、リサイズ、正規化、およびノイズ除去によって前処理されました。セマンティックセグメンテーション段階を支援するため、元のデータセットソースから得られた既存の文化的モチーフのアノテーションを使用しました。本研究の一環として、追加のアノテーションやリラベルの手順は行っていません。
ステップ 3:SegFormerを用いた意味的パターンのセグメンテーション
文化的なモチーフのセグメンテーションにはSegFormerモデルを使用した。SegFormerのバックボーンおよび初期化戦略の詳細については、Semantic Pattern Segmentation Using SegFormer(SegFormerを用いた意味的パターンのセグメンテーション)のサブセクションに記載されている。具体的には、意味的モチーフのセグメンテーションに、ImageNetで事前学習済みのMIT-B2バックボーンを備えたSegFormer-B2アーキテクチャを採用した。このモデルは、伝統的な文化的パターンの複雑な構造的詳細を維持しつつ、グローバルなコンテキスト情報を効果的に捉えることができる。
ステップ 4: CAFFM
CAFFMは、セマンティックセグメンテーションの特徴量と生成的な表現を組み合わせることで、フレームワークが構造的なモチーフの特性と芸術的なスタイルの情報の両方を学習することを可能にします。CAFFMの統合に関する詳細は、CAFFMのサブセクションで説明します。このモジュールは、SegFormerベースのセマンティックセグメンテーション段階と生成的な再構成段階の間に配置され、マルチヘッドクロスアテンションを通じて、セグメンテーションから得られた構造的特徴量と再構成特徴量を融合させます。このプロセスにより、文化的モチーフの保存性が向上し、再構成された出力のリアリズムが高まります。
ステップ 5:パターンの再構成 (CycleGAN)
融合された特徴量は、その後CycleGANモジュールによって処理され、文化的パターンの構造が再構成されます。CycleGANのアーキテクチャおよび学習構成については、「CycleGANを用いたパターンの再構成」のサブセクションで詳述しています。再構成モジュールは2つの生成器と2つの識別器で構成され、9つの残差ブロックを持つ残差ネットワーク生成器アーキテクチャを採用し、PatchGAN識別器を使用し、敵対的損失およびサイクル一貫性損失を用いて学習されます。この構成により、双方向のドメインマッピングが可能となり、不完全な文化的パターン構造の再構成が促進されます。
ステップ 6:芸術的スタイルの生成 (SPADE)
再構成されたパターンは、次にSPADEモジュールで処理され、セグメンテーションガイドによる芸術的スタイルの合成が行われます。SPADEジェネレーターの構成については、Artistic Style Generation Using SPADE のサブセクションで詳述されています。このモジュールは、SPADE残差ブロック、空間適応型正規化層、およびSegFormerセグメンテーションマップとCAFFM特徴表現から派生した意味的条件付けを採用しています。画像生成をセグメンテーションマップに条件付けることで、合成された出力は、芸術的なスタイルの特性を取り入れつつ、元の文化的モチーフとの構造的な整合性を維持します。
ステップ 7:性能評価
提案したフレームワークは、セグメンテーション精度、IoU、Dice係数(Dice)、SSIM、PSNR、およびFIDを含む、複数のセグメンテーションおよび画像品質評価指標を用いて評価されました。実験の整合性を確認するため、すべての実験は異なるランダムシードを用いて5回繰り返し行い、結果を平均値 ± 標準偏差として報告しています。統計的有意性は対応のあるt検定を用いて評価し、有意水準をp < 0.05としました。
データセットの収集
提案されたSegCycle-SPADEのフレームワークでは、文化的パターンの理解とスタイルの学習のために2つのデータセットが採用されています。本フレームワークで使用される1つ目のデータセットは、苗族(ミャオ族) Batikの文化的モチーフデータセットです。このデータセットには、苗族の芸術に用いられる動物、植物、幾何学図形などのモチーフを含む伝統的な苗族 Batikの画像が含まれています。このデータセットには豊かなテクスチャ情報を持つ画像が含まれており、これらは一般的に文化遺産の保存において重要です。SegCycle-SPADEのフレームワークで使用される2つ目のデータセットは、WikiArtデータセットです。このデータセットには、一般的に多様なスタイルを持つ膨大な数の芸術作品が含まれています。このデータセットは複雑なスタイルの学習に用いられ、一般的に芸術作品の強化に有用です。本データセットには27種類の異なるデザインを持つHD画質の芸術作品が80,000点含まれており、DLベースのスタイル生成や変換タスクにおいてより有用なものとなっています。
Miao Batikデータセット:
Miao Batikデータセット(https://doi.org/10.5281/zenodo.20807658)は、文化的に重要なモチーフを描いたバティックパターンの画像15,148枚で構成されています。これらの画像には、動物のモチーフ(例:蝶や魚)、植物ベースのパターン、および文化的象徴性を有する幾何学的モチーフなど、多様な伝統的デザインが含まれています。このデータセットは、パターン再構成時にセグメンテーションモジュールがモチーフの境界を正確に識別し、保持することを可能にする真正な文化的構造を提供するため、提案したフレームワークの重要な構成要素となります(表1)。本研究において、文化的に重要なモチーフとは、鳥、蝶、花柄、先祖のトーテムなど、Miaoの文化遺産文献に一般的に記録され、データセットのアノテーション内で表現されている象徴的な視覚的要素を指します。これらのモチーフは、出現頻度や空間的構成のみならず、文書化された文化的重要性および伝統的なMiaoのバティックや刺繍デザインにおける繰り返し的な出現に基づいて選定されました。専門家の指導によるモチーフのアノテーションおよびセグメンテーションラベルは、元のMiao Batikデータセットのソースから取得し、本研究で直接使用しました。著者による追加の手動アノテーション、再ラベル付け、または専門家指導によるアノテーション手順は行われていません。データセット作成者によって提供された既存のアノテーションが、セマンティックセグメンテーションの学習および評価に使用されました。
| パラメータ | 説明 |
| データセット名 | Miao Batik Cultural Pattern Dataset |
| データセットソース | Zenodoリポジトリ (DOI: 10.5281/zenodo.20807658) |
| ドメイン | 無形文化遺産 (ICH) / テキスタイルパターン解析 |
| 総画像数 | 15,148 images |
| 画像タイプ | 伝統的な苗族バティックのテキスタイルパターンのデジタル画像 |
| パターンのカテゴリ | 動物モチーフ、植物モチーフ、および幾何学モチーフ |
| 文化的起源 | 中国貴州省の苗族文化 |
| 元の画像解像度 | 前処理前の raw スキャンまたは写真として撮影された高解像度画像(通常、短辺が 1,000 pixels 以上) |
| 学習用解像度 | 前処理時に 256 × 256 pixels にリサイズされた画像 |
| アノテーションの可用性 | データセット作成者によって提供された既存のセグメンテーションアノテーションを、変更せずに学習および評価に使用した。本研究において、追加の手動アノテーション、ラベルの付け替え、または専門家による確認手順は行われていない。 |
| 本研究における適用 | 文化的モチーフのセグメンテーション、特徴抽出、モチーフの保存、およびパターンの再構成 |
表1:苗族バティック文化パターンデータセットの特徴。セマンティックセグメンテーション、文化パターン分析、およびモチーフ再構成に使用された苗族バティック文化モチーフデータセットの概要。本表では、データセットの出典、画像特性、モチーフカテゴリー、文化的起源、画像解像度、および提案されたSegCycle-SPADEフレームワークにおける役割について記述する。
WikiArtデータセット:
WikiArtデータセット [https://www.wikiart.org/] は、Table 2 に示す27種類の異なる芸術的スタイルにわたる80,000枚以上の画像で構成される、普及している大規模なデジタルアートリポジトリです。スタイルには、ルネサンス美術、印象派、キュビスム、シュルレアリスムなどが含まれます。このデータセットは、セグメンテーションプロセスから得られた構造情報を維持しつつ、SPADEモジュールが文化的に豊かなパターンを生成することを可能にする知識を提供するため、提案されたフレームワークにおいて非常に重要です。本データセットは、学習用に56,000枚、検証およびテスト用に12,000枚の画像で構成されています。データセット内の画像は、DLモデルを効果的に訓練するのに役立ちます。
| パラメータ | 概要 |
| データセット名 | WikiArtデータセット |
| データセットのソース | WikiArtリポジトリ (https://www.wikiart.org/) |
| ドメイン | デジタルアートおよび絵画 |
| 総画像数 | 約80,000点の芸術作品 |
| トレーニング画像 | 56,000 |
| 検証画像 | 12,000 |
| テスト画像 | 12,000 |
| 芸術的様式 | ルネサンス、印象派、キュビスム、シュルレアリスム、表現主義、写実主義、抽象芸術を含む27の芸術様式 |
| 元の画像解像度 | 元の画像の解像度は、作品やソースによって異なります。前処理において、画像は256×256ピクセルの均一な解像度にリサイズされました。 |
| トレーニング解像度 | 芸術的スタイルの学習およびセグメンテーション誘導画像合成に先立つ前処理において、画像を256 × 256ピクセルにリサイズした。 |
| データセットの分割 | 固定ランダムシード42を用いた層化ランダム分割(トレーニング用70%、検証用15%、テスト用15%) |
| スタイルサンプリング戦略 | トレーニング、検証、およびテストの各サブセットにおいて27種類の芸術スタイルの分布を維持するため、層化比例抽出法を用いた。 |
| 本研究における応用 | 芸術的スタイルの学習、スタイルの表現、およびセグメンテーション誘導型芸術的合成 |
表2:WikiArtデータセットの特徴。芸術的スタイルの学習およびスタイルガイド付き画像合成に使用されたWikiArtデータセットの概要。この表は、データセットのソース、画像の分布、芸術的スタイルの網羅性、データセットの分割、画像解像度、および提案されたSegCycle-SPADEフレームワーク内での適用について記述している。
Miao Batikデータセットには、伝統的な苗族の文化的モチーフを表す15,148枚の画像が含まれています。32 このデータセットはZenodo(https://doi.org/10.5281/zenodo.20807658)を通じて公開されています。モデルの学習前に、すべての画像を視覚的に検査し、256 × 256 pixelsにリサイズし、正規化を行い、破損したサンプルや重複したサンプルのスクリーニングを実施しました。品質管理スクリーニングの結果、除外された画像はなく、したがって全15,148枚の画像がその後の解析に使用されました。データセットの分割の再現性を確保するため、固定の乱数シード42を用いて、データセットをトレーニング用(70%)、検証用(15%)、テスト用(15%)のサブセットにランダムに分割しました。WikiArtデータセットは、公式のWikiArtリポジトリ(https://www.wikiart.org/)を通じてアクセスし、27の芸術スタイルにわたる80,000点以上の芸術作品が含まれています。スタイル学習実験では、トレーニングに56,000枚、検証に12,000枚、テストに12,000枚の画像を使用しました。
データの前処理
提案したSegCycle-SPADEフレームワークをトレーニングする前に、一貫した画質と正確な特徴表現を確保するため、苗族 batik(ミャオ族バティック)の文化的モチーフデータセットおよびWikiArtデータセットに対していくつかの前処理ステップを実施した。ガウシアンデノイジング、正規化、一定の入力解像度へのリサイズ、および画質検証を含む同一の基本前処理パイプラインを、両データセットに適用した。ただし、フレームワーク内において各データセットは異なる役割を担っていた。WikiArtデータセットは芸術的なスタイルの学習と合成に使用され、苗族 batikデータセットは主に文化的モチーフのセグメンテーションと再構成に使用された。これらのタスク固有の役割以外に、データセット固有の前処理の変更は行わなかった。DLモデルによる一貫した処理を確実にするため、まず画像を固定解像度にリサイズした。両データセットの画像は、ソースによって解像度が異なっていたため、このステップが必要であった。リサイズにより計算効率が向上し、次元の不整合がトレーニングに影響を与えることを防いだ。2番目の前処理ステップは正規化であり、トレーニング中の勾配更新を安定させるためにピクセル値を標準化された範囲にスケーリングした。その後、文化的モチーフの構造を妨げる可能性のあるノイズを低減させるため、ガウシアンフィルタリングを用いて画像を処理した。苗族 batikデータセットについては、セマンティックセグメンテーションのトレーニングおよび評価のために、元のデータセットソースから直接得られた既存の文化的モチーフセグメンテーションマスクを修正せずに使用した。本研究のために新しいセグメンテーションマスクを生成してはいない。
特に断りのない限り、確立された手法を記述する方程式は先行研究から引用し、適切に参照しています。提案するCAFFMおよび複合SegCycle-SPADE最適化フレームワークを記述する方程式は、本研究のために著者らが開発したものです。
データセットからの入力画像を式 1で表します:
(1)
ここで、H、W、およびCは、それぞれ画像の高さ、幅、およびカラーチャネル数を表します。すべての画像は、式2に示すように、固定次元H′ × W′にリサイズされます。

ここで、Irはリサイズ後の画像です。正規化されたピクセル値は、式 3に従って算出されます:
(3)
これにより、トレーニング手順の安定化に寄与します。ノイズフィルタリングは、式 4に示すガウスフィルタを用いて行われます:

ここで、G(σ)はガウスフィルタ、*は畳み込みを表します。標準偏差σ = 1.0の5 × 5カーネルガウスフィルタを使用しました。エッジアーティファクトを低減するため、境界画素に反射パディングを適用しました。デノイジング処理は、スケーリングおよび正規化の前、画像読み込み直後に実施しました。研究全体で前処理を統一するため、Miao BatikおよびWikiArtデータセットのすべての画像に同一のフィルタ設定を適用しました。Miao Batikデータセットの場合、セグメンテーションマスクは式5に従って作成されます:

ここで、MはSegFormerモデルを誘導するために使用されるセグメンテーションマスクである。
図3に示すように、前処理パイプラインは、Miao BatikデータセットおよびWikiArtデータセットからの画像取得から始まります。トレーニングにおいてデータ拡張手法は採用されませんでした。リサイズ、正規化、ガウスノイズ除去、およびセグメンテーションマスクの作成を含む前処理の後、画像は提案するSegCycle-SPADEフレームワークのトレーニング、検証、およびテストに直接使用されました。前処理パイプラインの最初のステップでは、画像を固定サイズにリサイズし、DLモデルがより効率的に画像を処理できるようにします。2番目のステップでは正規化を行い、ピクセル値を標準化された数値範囲に変換してモデルの収束を促進します。3番目のステップではノイズ除去を行い、不要なノイズを取り除いてパターン認識精度を向上させます。さらに、Miao Batikデータセットについては、文化的モチーフ領域のアノテーションを行い、提案モデルのセグメンテーションモジュールで使用するマスクを生成することで、生成過程において文化的モチーフが保存されるようにします。このステージの最終出力は、提案モデルのセグメンテーションおよび生成モジュールのトレーニングに使用可能な、クリーンなデータセットとなります。

図 3. 文化遺産画像のデータ前処理パイプライン。モデル学習前に適用される画像前処理の手順を示すワークフロー。このパイプラインには、データセットの取得、画像のリサイズ、正規化、ガウスノイズ除去、既存の文化的モチーフのアノテーション、およびセグメンテーションマスクの作成が含まれる。処理後の画像とマスクは、セマンティックセグメンテーションおよびパターンの再構成の入力として使用される。こちらのリンクをクリックして、この図の拡大版を表示してください。
モデルのトレーニング前に、すべての画像に対して品質管理プロセスを実施した。Miao Batikデータセットには15,148枚の画像が含まれていた。破損したサンプル、重複したサンプル、および低品質のサンプルは、元のデータセット作成者によってすでに対処されていたため、本研究の品質管理スクリーニングにおいて追加で除外された画像はなかった。その結果、15,148枚すべての画像が解析に使用された。前処理において、画像はRGB形式で読み込まれ、バイリニア補間を用いて256 × 256ピクセルにリサイズされた。ピクセル値は、255で除算することで [0, 255] の範囲から [0, 1] の範囲にスケーリングされた。その後、赤、緑、青の各チャンネルに対して、それぞれ [0.485, 0.456, 0.406] の平均値および [0.229, 0.224, 0.225] の標準偏差を用いてチャンネルごとの正規化を適用した。前処理パイプラインには、画像の読み込み、RGB変換、リサイズ、ピクセル値のスケーリング、正規化、およびテンソル変換が含まれていた。必要に応じて、DLモデルとの互換性を維持するために、グレースケール画像を3チャンネルのRGB形式に変換した。前処理後、画像はトレーニング、検証、およびテストのサブセットに分割された。セマンティックセグメンテーション、特徴融合、モチーフ再構築、およびSPADEベースの芸術的合成を含むSegCycle-SPADEフレームワークのすべてのステージにおいて、256 × 256ピクセルの一定の入力解像度を使用した。
SegFormerを用いたセマンティックパターンセグメンテーション
この前処理ステップの後、クリーニングおよび正規化された苗族バティック文化モチーフデータセットとWikiArtデータセットの画像が、提案されたSegFormer-B2のフレームワークに基づくセマンティックセグメンテーションモジュールに入力されます。このステップの目的は、伝統的なパターンに存在する文化モチーフを正しく識別し、分離することです。提案されたSegFormerのフレームワークは、階層的なTransformerエンコーダーと軽量なMLPデコーダーを組み込んだTransformerアーキテクチャに基づいており、複雑な伝統的パターンから詳細な構造情報およびグローバルなコンテキスト情報を正確に抽出します。モデルはまず、入力画像からマルチスケールで特徴表現を抽出し、続いてこれらの表現をデコーダーを通じて融合させることで、正確なセグメント化パターンを生成します。これにより、伝統的な画像内のパターンが幾何学模様、花模様、象徴的模様などのモチーフに正しくセグメント化され、構造的な整合性を維持しながら背景から分離されることが保証されます。この構造情報は、その後のSegCycle-SPADEフレームワーク内でのパターン生成段階で使用されます。
前処理済みの入力画像を式6で表します:
(6)
SegFormerエンコーダーは、画像をパッチに分割し、式71に示すように、トランスフォーマー層を用いて階層的な特徴を抽出します。

ここで、Fはトランスフォーマーエンコーダーから得られたマルチスケール特徴マップを表します。これらの特徴は、モチーフ領域間の局所的なテクスチャパターンとグローバルな文脈関係の両方をエンコードしています。SegFormerモデルは、式8で定義されるように、異なるスケールの特徴マップを抽出します。

マルチスケール表現を用いることで、文化的なモチーフ内にある異なるサイズのパターンの検出が容易になります。最終的に、特徴量は式91に示すようにMLPデコーダーを用いて統合されます。

ここで、Sは最終的な予測セグメンテーションマップを表します。
SegFormer-B2バックボーンは、ImageNetで事前学習済みの重みを用いて初期化され、その後、文化的なモチーフのセグメンテーションのためにMiao Batikデータセットでファインチューニングされました。事前学習済みのチェックポイントは、SegFormerの公式実装から取得しました。具体的には、ファインチューニングの前に、公式のSegFormerリポジトリによって提供されたImageNet-1K事前学習済みMIT-B2チェックポイント(mit_b2.pth)を使用してSegFormer-B2バックボーンを初期化しました。この事前学習済みの重みは、SegFormerの著者によってリリースされたMIT-B2バックボーンに対応しており、セマンティックセグメンテーション学習の初期化モデルとして使用されました。その他のタスク固有のレイヤーは、学習前にデフォルトのPyTorch重み初期化手順を用いて初期化されました。
アーキテクチャには、オーバーラップパッチ埋め込みを備えた4段階の階層的Transformerエンコーダが使用されています。初期段階では、パッチサイズを7 × 7、ストライドを4に設定しました。4つのエンコーダステージそれぞれの埋め込み次元は、64、128、320、512でした。4つのステージにおけるマルチヘッド自己注意ヘッド数はそれぞれ1、2、5、8であり、対応するエンコーダの深さは3、4、6、3レイヤーでした。エンコーダから抽出されたマルチスケール特徴量は、軽量なオールMLPデコーダを用いて集約されました。最終的なセグメンテーションマップを作成する前に、デコーダはすべてのエンコーダステージからの特徴量を単一の埋め込み空間に投影しました。すべてのTransformerブロックでは、活性化関数としてGaussian Error Linear Unit(GELU)が使用されました。汎化性能の向上と過学習の抑制のため、トレーニング時には0.1のドロップアウト率を適用しました。
トレーニングフェーズにおいて、SegFormerフレームワークは両方のデータセットから前処理済みの画像を受け取ります。Miao Batikデータセットの画像には、セグメンテーションモデルの教師あり学習のためのラベルとして機能するモチーフ領域が含まれています。Transformerエンコーダーは画像全体を処理し、画像構成要素間の長距離相関を捉えます。これは、空間的に分散したモチーフを含む伝統的なバティックパターンにおいて特に重要です。階層的な特徴抽出メカニズムは、繰り返される幾何学的テクスチャなどの局所的な構造を同時に捉えます。MLPデコーダーは、これらの抽出された特徴を処理し、モチーフ領域を強調したセグメンテーションマスクを生成します。この段階で生成されたセグメンテーションマップは、その後のアテンションモジュールおよびパターン再構成段階の構造的入力として使用され、これにより生成されるパターンの真正性の維持に寄与します。
文化的モチーフは、その視覚的および文化的特性に基づき、セマンティックセグメンテーションのために異なるクラスに分類されました。セグメンテーションのタクソノミーは、動物モチーフ(例:蝶、魚、鳥、およびその他の象徴的な動物相)、植物モチーフ(例:花、葉、蔓、および植物学的パターン)、幾何学モチーフ(例:反復形状、縁取り、および抽象的な幾何学構造)、およびモチーフ以外の領域を表す背景領域で構成されました。各ピクセルを定義済みのクラスのいずれかに割り当てるために、ピクセルレベルのセグメンテーションマスクが使用されました。整数ラベルは次のようにエンコードされました:ラベル 0 = 背景、ラベル 1 = 動物モチーフ、ラベル 2 = 植物モチーフ、ラベル 3 = 幾何学モチーフ。セグメンテーションのアノテーションとモチーフラベルは、元の Miao Batik データセットのソースから直接取得されました。本研究において、追加の手動アノテーション、再ラベル付け、境界検証、または専門家による確認手順は行われませんでした。データセット作成者によって提供された既存のアノテーションが、変更されることなくトレーニングおよび評価に使用されました。
文化的なモチーフのセグメンテーションのためのSegFormerモデルは、図4に示すように、Miao BatikデータセットおよびWikiArtデータセットから前処理された画像をトランスフォーマーベースのメカニズムを用いて処理し、文化的パターンの領域を正確に検出します。まず、伝統的な文化的モチーフを含む入力画像がSegFormerモデルに提供されます。Transformerエンコーダーが、画像パッチからグローバルなコンテキスト情報とローカルな構造的特徴の両方を抽出します。得られたマルチスケール特徴はセグメンテーションデコーダーに提供され、そこでMix Feed-Forward Networkを用いて特徴表現を精緻化し、モチーフ検出の精度を向上させます。SegFormerモデルの出力は、無関係な背景情報を抑制しつつ、文化的パターンに対応するピクセルを強調したセグメンテーションマスクとなります。こうして分離された文化的パターンは、その後のSegCycle-SPADEフレームワークの段階における構造的なガイダンスとして機能します。

Figure 4. SegFormer-B2に基づく文化的モチーフのセマンティックセグメンテーション。文化的モチーフの抽出に使用され、Miao Batikデータセットのみで学習されたSegFormer-B2セマンティックセグメンテーションモジュールのアーキテクチャ。本フレームワークは、マルチスケール特徴抽出のためのTransformerベースのエンコーダーと、モチーフマスクを生成するための軽量なセグメンテーションデコーダーで構成されている。モデルは、動物、植物、幾何学的形状、背景の4つのセマンティッククラスを予測し、得られたセグメンテーションマスクによって、不要な背景情報を抑制しながら文化的に重要なモチーフ領域を特定する。これらのセグメンテーション出力は、提案するSegCycle-SPADEフレームワークの後続ステージである特徴融合、再構成、および芸術的合成のための構造的ガイダンスとなる。ここをクリックして、この図の拡大版を表示してください。
提案されたフレームワークでは、新しいセグメンテーションアノテーションを作成する必要はありません。Miao Batikデータセットは既存の公開ソースから取得されており、モデルの学習にはデータセット作成者が提供した関連モチーフ情報が使用されました。学習プロセスにおいて、SegFormerモデルがセマンティックセグメンテーションマップを生成しました。その結果、本研究では追加の手動アノテーションソフトウェア、アノテーションガイドライン、またはアノテーションの品質管理手順は必要ありませんでした。
CAFFM
セマンティックセグメンテーションの特徴と生成再構成の表現との相互作用を向上させるため、本研究ではCAFFMも提案した。SegFormer-B2エンコーダーがCAFFMモジュールにセマンティック特徴マップを提供し、CycleGANの再構成ステップが生成特徴マップを提供する。まず、線形投影層を用いて、両方の特徴ストリームを共通の埋め込み空間に投影する。クロスアテンションの計算のために、生成された特徴テンソルを用いてクエリ(Q)、キー(K)、およびバリュー(V)の表現を作成する。次に、マルチヘッドクロスアテンションを用いて、構造的モチーフの情報と芸術的スタイルの要素との関係をモデル化する。その後、融合された特徴表現に対して、レイヤー正規化、残留接続、およびGELU活性化関数を備えたフィードフォワード層を適用する。SPADEベースの合成ステージがCAFFMモジュールの出力を受け取ることで、芸術的な一貫性を損なうことなく、文化的に意味のあるテーマを維持することが可能となる。
特徴量の互換性を保証するため、まず線形投影レイヤーを用いて、入力特徴量を次元数256の共通埋め込み空間に投影します。次に、意味的な構造情報と生成スタイルの表現との相互接続を、8つのアテンションヘッドを持つマルチヘッド・クロスアテンション機構を用いてモデル化します。クロスアテンションの計算には、特定の線形変換レイヤーによって生成されるクエリ(Q)、キー(K)、およびバリュー(V)ベクトルを使用します。学習の安定性を高め、特徴量の整合性を維持するために、残差接続とレイヤー正規化を導入し、融合された特徴表現をさらに強化します。その後、Gaussian Error Linear Unit(GELU)活性化関数を備えたフィードフォワードネットワークを適用することで、非線形特徴学習を改善します。このモジュールによって次元数256の出力特徴表現が生成され、クリエイティブな合成を行うための他のステージへ送られます。CAFFMは、クロスアテンションベースの融合手法を用いることで、芸術的なスタイルデータと文化的モチーフ構造を効果的に組み合わせ、再構築された文化遺産パターンにおけるモチーフの保存性と視覚的な一貫性を向上させています。
提案システムにおいて、構造的特徴はMiao Batikデータセットから得られ、スタイル的特徴はWikiArtデータセットから学習されます。Miao Batikデータセットの画像を用いてSegFormerセグメンテーションネットワークから得られた特徴マップをFs、WikiArtの画像を用いてスタイル特徴抽出ブランチから得られた特徴マップをFaと定義します。提案するCAFFMは、クロスアテンション機構を用いてこれら2つの特徴ドメインを結合し、文化的なパターンの構造的依存性とスタイル的依存性の両方を学習します。表3に、埋め込み次元、正規化層、活性化関数、アテンションヘッドの構成を含むすべてのアーキテクチャ特性を示します。入力画像サイズが256 × 256ピクセルの場合、SegFormer-B2エンコーダーは64 × 64 × 128サイズのセマンティック特徴マップを生成し、スタイル特徴抽出ブランチは64 × 64 × 128サイズの特徴マップを生成しました。両方の特徴マップは、クロスアテンション融合の前に、学習可能な線形層を通じて次元256の共有埋め込み空間に投影されました。
| パラメーター | 構成 |
| 提案される枠組み | SegCycle-SPADE |
| セマンティックセグメンテーションモデル | SegFormer-B2 |
| SegFormerエンコーダーステージ | 4 |
| 重みの初期化 | ImageNet-1Kで事前学習済みSegFormer-B2(MIT-B2バックボーン) |
| チェックポイントソース | NVIDIA SegFormer公式リポジトリ (https://github.com/NVlabs/SegFormer);チェックポイント:segformer.b2.512x512.ade.160k |
| ファインチューニング戦略 | Miao Batikデータセットを用いたエンドツーエンドのファインチューニング |
| パッチ埋め込みサイズ | 7 × 7 |
| パッチストライド | 4 |
| 埋め込み次元 | 64、128、320、および512 |
| エンコーダー深度 | 3、4、6、および3 |
| アテンションヘッド | 1、2、5、および8 |
| デコーダーの種類 | 全MLPデコーダ |
| 活性化関数 | GELU |
| 脱落率 | 0.1 |
| 特徴量強調モジュール | クロスアテンション文化的特徴融合モジュール (CAFFM) |
| CAFFM埋め込み次元 | 256 |
| CAFFMアテンションヘッド | 8 |
| CAFFM融合尺度 | 4 |
| 再構築モデル | CycleGAN |
| スタイル生成モデル | SPADE |
| 文化データセット | ミャオ族バティックデータセット |
| スタイルデータセット | WikiArtデータセット |
| ミャオ族のバティック画像 | 15,148 |
| WikiArt画像 | 約80,000 |
| 入力画像の解像度 | 256 × 256 ピクセル |
| カラーフォーマット | RGB |
| 補間法 | 双線形補間 |
| デノイジング法 | ガウスフィルタリング |
| ガウスカーネルサイズ | 5 × 5 |
| ガウス分布のシグマ(σ) | 1 |
| 正規化範囲 | [0, 1] |
| バッチサイズ | 16 |
| エポック数 | 100 |
| オプティマイザー | アダム |
| 学習率 | 0.0002 |
| Adamパラメータ | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, ウェイトディケイ = 0 |
| 損失関数 | セグメンテーション損失、敵対的損失、サイクル一貫性損失、再構成損失、モチーフ保存損失、およびスタイル一貫性損失 |
| データセット分割戦略 | トレーニング / 検証 / テスト |
| トレーニングセット | 70% |
| 検証セット | 15% |
| テストセット | 15% |
| 乱数シード | 42 |
| 評価指標 | セグメンテーション精度、IoU、ダイス係数、SSIM、PSNR、およびFID |
| プログラミング言語 | Python 3.8.10 |
| ディープラーニングフレームワーク | PyTorch 1.10.0 |
| ハードウェアプラットフォーム | NVIDIA RTX 3090 GPU (24 GB VRAM)、Intel Core i7 (第11世代)、32 GB RAM |
| 動作環境 | Ubuntu 20.04 LTS |
表 3: 実験設定およびモデル構成提案されたSegCycle-SPADEフレームワークの実装および評価に使用した、アーキテクチャ構成要素、トレーニング構成、前処理設定、データセット、最適化パラメータ、評価指標、および計算環境の要約。
アテンションモジュールは、まず式10を用いて、特徴マップをクエリ、キー、およびバリューの表現に写像します:

ここで、Wq、Wk、およびWvは学習可能な重み行列です。アテンション重みは、式 1117を用いて、クエリベクトルとキーベクトルの類似性に基づいて算出されます:

ここで、dkはキーベクトルの次元です。強化された特徴表現は、式 12を用いて、アテンション重みにバリュー行列を乗じることで算出されます:

ここで、Faは特徴マップの強化された特徴表現です。この強化された特徴表現は、元のセグメンテーション特徴と、アテンションメカニズムを用いて得られた強化特徴を式13に従って組み合わせることで算出されます。
ここで、Feはパターン再構成に使用される強化特徴マップです。CAFFMは、異なるスケールの文化的モチーフの特徴を抽出するために、マルチスケール・クロスアテンション機構によって拡張されています。スケールiにおけるセグメンテーション特徴をFsiとし、同スケールにおける芸術的スタイル特徴をFajとします。最終的な特徴表現は、式14を用いて定義されます:

ここで、Qi、Ki、およびViは、それぞれスケールiにおけるクエリ、キー、およびバリュー行列を表し、Nは特徴スケールの数を示します。本研究ではN = 4とし、これは入力画像サイズの1/4、1/8、1/16、および1/32の空間解像度で抽出された特徴マップに対応しています。これらのマルチスケール特徴表現は、再構成および芸術的合成の前に、学習可能なアテンションウェイトを用いて統合されました。以上の拡張により、本手法では文化的なモチーフやテクスチャをグローバルに抽出し、文化的なパターンを再構成することが可能になります。CAFFMは、提案するSegCycle-SPADEシステムにおいて、SegFormerベースのセグメンテーション段階とSPADEベースの創造的合成段階の間に配置されています。まず、CycleGANがスタイルおよびパターンに関する情報を伴う再構成特徴を同時に生成する一方で、SegFormer-B2は文化的モチーフの構造的特性を描写するセマンティック特徴マップを復元します。CAFFMモジュールはこれら2つの特徴ストリームを受け取り、クロスアテンションベースの融合を用いて、構造的な表現と芸術的な表現の間の関係性を特定します。その後、セマンティックな一貫性と構造的特徴を維持しつつ、文化的に真正なパターンを作成するため、得られた融合特徴マップがSPADEモジュールに送られ、セグメンテーション誘導による創造的合成が行われます。
CycleGANを用いたパターンの再構成
アテンションベースの特徴量強化段階が完了すると、特徴マップには強化された文化的モチーフ構造が含まれます。しかし、特徴マップには依然として不完全または損傷したパターン領域が含まれている可能性があります。そのため、パターンの再構成という課題に対処するため、提案するフレームワークではCycleGANモデルを利用します。提案フレームワークにおいて、2つのドメインは元の文化的モチーフパターンと再構成された文化的モチーフパターンとなります。前段階で得られた強化特徴量を用いて、CycleGANモデルは構造的一貫性を維持しながら文化的パターンの再構成を行います。これにより、幾何学模様、花模様、象徴的な模様などの文化的パターンが、その空間的配置を維持することが保証されます。元の苗族ろうぜん(Miao Batik)画像には、ランダムなマスキングおよび部分的な遮蔽操作を施し、不完全または損傷した文化的モチーフを生成しました。これらの劣化手順により、劣化した文化遺産に一般的に見られるパターンの欠損領域や構造的な損傷をシミュレートしました。劣化画像は再構成モジュールの入力として使用し、対応する元の画像は性能評価および再構成品質の評価のための参照画像として使用しました。この戦略により、モデルは意味的一貫性と文化的特性を維持しつつ、欠損したモチーフ構造の修復を学習することが可能となりました。
Xを不完全な文化的パターンのドメインとし、Yを再構成された文化的パターンのドメインとします。2つの生成器は、式 15を用いて双方向マッピングを実行することを学習します:

ここでは、GEを用いてモチーフ構造を再構成し、FMを用いてパターンを元のドメインにマッピングします。再構成されたパターンが現実的であることを保証するために、敵対的損失が用いられます(式 16)30

ここで、DYは実パターンと再構成パターンを区別するために用いられるディスクリミネーターであり、GE(x)は生成された再構成パターンを表します。また、CycleGANは文化的なモチーフの構造的レイアウトを維持するために、サイクル一貫性を強制します(式 17)30。

最終的な損失関数は、式1830を用いて定義されます:

ここで、λiはサイクル一貫性損失の重み係数を示しており、元のCycleGANの定式化に従い、トレーニング時に10に設定されました。この値は、敵対的学習とソースドメインおよびターゲットドメイン間の再構成の一貫性のバランスを調整するために選択されました。
CycleGAN再構成モジュールは、双方向の画像変換を行うための2つのジェネレータと2つのディスクリミネータで構成されています。各ジェネレータは、初期の7 × 7畳み込み層、それに続く2つのダウンサンプリング畳み込み層、9つの残差ブロック、および2つのアップサンプリング層からなる残差ネットワークアーキテクチャを採用しています。すべての畳み込み操作では3 × 3のカーネルサイズを使用していますが、入力層のみは特徴抽出を強化するために7 × 7カーネルを使用しています。学習の安定性を高めるため、各畳み込み層の後にインスタンス正規化(Instance Normalization)が適用され、ジェネレータネットワーク全体でReLU活性化関数が使用されています。出力層には、正規化された画像出力を生成するためにTanh活性化関数が採用されています。ディスクリミネータは、カーネルサイズ4 × 4の畳み込み層が連続し、特徴チャネル数が段階的に増加する70 × 70のPatchGANアーキテクチャに従っています。ディスクリミネータでは、特徴識別と敵対的学習を改善するために、インスタンス正規化とLeakyReLU活性化(負の傾き = 0.2)が採用されています。CycleGANモジュールは、前処理された文化的なモチーフ画像を入力として受け取り、再構成されたパターンの表現を生成します。これはその後、セグメンテーション特徴量と統合するためにCAFFMへと送られます。CycleGANの学習は、Adamオプティマイザ(β₁ = 0.5, β₂ = 0.999)を用い、初期学習率0.0002で実施されました。学習率は最初の100エポックの間維持され、その後、残りの学習期間にわたって線形にゼロまで減衰させました。ディスクリミネータの学習を安定させるため、過去に生成した50枚の画像を格納するリプレイバッファを使用しました。ジェネレータとディスクリミネータは1:1の更新比率で更新され、各学習イテレーションにおいて、1回のジェネレータ更新の後に1回のディスクリミネータ更新が行われました。
CycleGANの再構成プロセスは、図5のCAFFMメカニズムを用いて得られた強化特徴マップに基づいています。この特徴マップには、前段階のセグメンテーションおよびCAFFMによって抽出・強化された文化的モチーフが含まれています。これらの特徴マップは、第1ジェネレーターGEへの入力として使用されます。第1ジェネレーターGEは、文化的パターンを再構成するために必要なマッピングを学習します。その後、出力はディスクリミネーターDYに送られ、本物の文化的パターンと再構成されたパターンの識別が行われます。ディスクリミネーターDYは、ジェネレーターGEがより写実的な出力を生成するのを支援します。再構成中に文化的パターンが歪まないようにするため、第2ジェネレーターFMがサイクル一貫性マッピングを実行します。第2ジェネレーターFMは、出力を元のドメインへとマッピングし戻します。その後、ディスクリミネーターによって出力が評価され、写実性が確認されます。最終的な出力は、その後、提案されたSegCycle-SPADEフレームワークの次段階である芸術的スタイルの生成を行うために、SPADEモジュールへと転送されます。

図5. CycleGANに基づくパターンの再構築ワークフロー。CycleGAN再構築モジュールのワークフロー。不完全な文化的モチーフを再構築するため、アテンション強化された特徴表現が生成ネットワークへの入力として提供される。ディスクリミネータは、再構築された出力を参照パターンと照らし合わせて評価し、サイクル一貫性マッピングによって双方向の画像変換中の構造的完全性が維持される。再構築されたモチーフは、その後、芸術的スタイルの合成のためにSPADEモジュールに送られる。この図の拡大版を表示するには、ここをクリックしてください。
SPADEを用いた芸術的スタイルの生成
続いて、再構成された文化的モチーフをSPADEモジュールにかけ、芸術的スタイルを生成します。SPADEモジュールの主な目的は、モチーフの構造的レイアウトを損なうことなく、再構成された文化的モチーフに視覚的に豊かな芸術的スタイルのテクスチャを加えることです。SPADEモジュールは、画像生成に画像セグメンテーションの概念を利用した条件付き画像生成手法です。SegFormer-B2によって生成されたセマンティックセグメンテーションマスクから、あらかじめ定義されたモチーフクラスに対応するマルチチャネルのセマンティックマップをエンコードしました。SPADEジェネレーターは、これらのエンコードされたマップを条件付け入力として受け取ります。各SPADEレイヤー内の畳み込み層でセマンティックマップを処理することにより、空間適応的なスケーリング(γ)およびバイアス(β)パラメータが生成されます。これにより、ジェネレーターはこれらのパラメータを正規化された特徴アクティベーションに適用することで、芸術的合成の間、モチーフの境界、構造的レイアウト、およびセマンティック情報を維持することができました。条件付けプロセスがSPADEジェネレーターの複数のレイヤーで実行されるため、セマンティックガイダンスは高レベルの構造再構成と低レベルのテクスチャ合成の両方に影響を与えることができました。その結果、生成された芸術的パターンは、セグメンテーション段階で特定された文化的モチーフの構造を維持しつつ、WikiArtデータセットから得られたスタイル上の特徴を取り入れることができました。
ルネサンス、印象派、キュビスム、表現主義、シュルレアリスム、写実主義、抽象芸術など、27の異なる芸術カテゴリーの作品を含むWikiArtデータセットを、芸術的スタイルの理解のための主要なリソースとして使用しました。モデルを多様な創造的特性に触れさせ、スタイルの汎化性能を高めるため、トレーニング中は様々なカテゴリーからスタイル画像をランダムに選択しました。スタイルバイアスを軽減するため、データセットは、芸術カテゴリーが均等に表現されるようにトレーニング用、検証用、およびテスト用のサブセットに分割されました。全27の芸術カテゴリーがバランスよく表現されることを保証するため、層化サンプリングを用いました。各カテゴリーのサンプルを、元のクラス分布を維持しつつ、トレーニング、検証、テストの各サブセットに比例配分しました。WikiArt画像から得られたスタイル側面と、CycleGANによって生成された再構成機能を統合するために、CAFFMモジュールを使用しました。合成ネットワークが、セグメンテーションマップから得られる意味的な構造と文化的モチーフの境界を維持しながら、芸術的な特性を転送できるように、得られた融合表現をSPADEジェネレーターへの条件付け情報として提供しました。このスタイル条件付けの手法により、提案したフレームワークは、構造的およびスタイル的な表現が一貫した、文化的に真正な芸術的パターンを生成することが可能となりました。
SPADEはまた、セグメンテーションマップに依存する空間的に適応的なパラメータを導入しています。これらのパラメータは、式191に示すように定義できます:

ここで、γ(S)は空間的に変化するスケールパラメータであり、β(S)は空間的に変化するバイアスパラメータです。これらのパラメータにより、ジェネレーターは画像内のセマンティック領域に応じて異なるテクスチャやスタイルを生成することが可能になります。最終的な文化的芸術作品は、式20に示すように定義されます。

ここで、GEはSPADEジェネレーター、XrPは再構成されたパターン、SMはセグメンテーションマップである。最終的な作品は、文化的モチーフの構造的な整合性を維持しつつ、芸術的な外観を向上させている。提案されたSegCycle-SPADEアーキテクチャを最適化するために、セマンティックセグメンテーションの精度、文化的モチーフの保存、パターンの再構成品質、および芸術的スタイルの整合性のバランスをとる複合損失関数が使用された。全体の学習目的を確立するために、セグメンテーション損失(Lseg)、敵対的損失(Ladv)、サイクル一貫性損失(Lcycle)、再構成損失(Lrecon)、モチーフ保存損失(Lmotif)、およびスタイル一貫性損失(Lstyle)の加重混合が用いられた。全損失関数は式21で定義される:
(21)
入力された文化的なモチーフと再構成されたモチーフとの間で構造的な一貫性を保証するため、サイクル一貫性損失係数を10に設定しました。また、詳細なモチーフの特徴を維持し、視覚的な正確性を向上させるため、再構成損失係数を5に設定しました。芸術的な合成において文化的に重要な構造パターンの保存を強調するため、モチーフ保存損失には係数2を使用しました。意味的なモチーフ構造を不当に歪めることなく芸術的なスタイル転移を促進するため、スタイル一貫性損失係数を1に調整しました。写実的な画像生成と正確なモチーフセグメンテーションとの間でバランスの取れた寄与を維持するため、セグメンテーション損失と敵対的損失に等しい重みを割り当てました。スタイル一貫性損失の算出には、WikiArtデータセットの特徴ベースのスタイル表現を使用しました。具体的には、深い特徴マップから得られたグラム行列の相関を用いて、芸術的なスタイルの特性を捉えました。ターゲットとなるスタイル画像と生成画像のグラム行列間のフロベニウスノルムの差を用いて、Equation 22に示すようにスタイル損失を算出しました。

ここでは、 G申し訳ございませんが、翻訳対象のソーステキストが提供されておりません。翻訳するテキストを入力してください。 グラム行列は、〜から計算されるのでしょうか。 申し訳ございませんが、翻訳対象となるソーステキストが提供されておりません。翻訳が必要なテキストをご入力ください。翻訳対象のテキストが提供されていません。翻訳したい英文をご提示ください。 フィーチャーレイヤー I遺伝子 生成された芸術的画像を表し、 私はスタイル WikiArtデータセットのターゲットスタイル画像を示し、 F はフロベニウスノルムを表す。この定式化により、提案されたフレームワークは、文化的モチーフの構造的および意味的な整合性を維持しつつ、芸術的な特性を保存することが可能となる。
CAFFMモジュールによって生成された融合特徴表現は、提案フレームワークの芸術的合成コンポーネントとして機能するSPADEモジュールの条件付き入力として使用されます。SPADEジェネレーターは、潜在特徴次元が256チャンネルの7つのSPADE残差ブロックで構成され、256 × 256ピクセルの解像度で出力画像を生成します。SegFormer–CAFFMモジュールから得られたセマンティックセグメンテーションマップが、SPADE残差レイヤー全体を通じて条件付き入力として使用されます。SPADEレイヤーは各残差ブロック内の活性化関数の前に適用され、セグメンテーションによるセマンティック条件付けを可能にします。連続的なアップサンプリングと畳み込み演算を通じて、潜在特徴表現が段階的に洗練され、セマンティックな一貫性とモチーフ構造を維持しながら高解像度の芸術的パターンが生成されます。ジェネレーター全体にLeakyReLU活性化関数が使用され、出力層には正規化された画像を生成するためにTanh活性化関数が適用されます。
アルゴリズムおよびワークフロー
SegCycle-SPADEフレームワークは、セマンティックセグメンテーション、特徴融合、パターン再構成、および芸術的スタイル合成を単一のトレーニングパイプラインに統合したものである。ワークフローは、データセットの取得と、画像のリサイズ、正規化、ノイズ除去、およびセグメンテーションマスクの作成を含む前処理から始まる。前処理済みの画像は、その後SegFormer-B2セグメンテーションネットワークを用いて処理され、セマンティックなモチーフ表現が抽出される。得られたセグメンテーション特徴はCAFFMを通じて再構成特徴と融合され、構造的なモチーフ情報と芸術的な特徴表現との相互作用が可能になる。融合された特徴マップは次にCycleGAN再構成モジュールに供給され、セマンティックな一貫性を維持しながら、不完全な文化的モチーフ構造を復元する。再構成されたパターンはその後、セグメンテーション誘導型の芸術的合成を行うためにSPADEジェネレーターに提供され、モチーフの境界と構造的な真正性を維持したままスタイルの強化が行われる。トレーニング中、モデルパラメータは式21および22に記載された複合損失関数を用いて最適化され、セグメンテーションの精度、モチーフの保存、再構成の品質、および芸術的スタイルの一貫性がバランスよく調整される。データセットの読み込み、前処理、モデルの初期化、トレーニングの反復、検証手順、チェックポイントの選択、および最終評価を含む詳細なステップバイステップの実装ワークフローは、補足ファイル1 (Algorithm 1)に記載されている。完全なアルゴリズムワークフローは、バッチサイズ16、学習率0.0002、トレーニングエポック数100で実装された。データセットの分割、モデルの初期化、およびすべてのトレーニング実験には、固定乱数シード42が使用された。再現性を確保するため、このシードはPython、NumPy、およびPyTorchの乱数ジェネレーター全体にわたって一貫して適用された。Adamオプティマイザーは、β₁ = 0.5、β₂ = 0.999、および重み減衰なし(weight decay = 0)に設定された。モデルのチェックポイントは、検証データセットで達成された最高の検証IoUスコアに基づいて選択された。
損失関数の最適化
再構成および芸術的合成において文化的モチーフの構造を維持するため、提案されたフレームワークでは、セグメンテーション損失、敵対的損失、サイクル一貫性損失、再構成損失、モチーフ維持損失、およびスタイル一貫性損失を組み合わせた複合的な最適化目的関数を採用しています。完全な数式、重み係数、およびスタイル損失の定義は、「SPADEを用いた芸術的スタイル生成」のサブセクション内の式21および22に記載されています。モチーフ維持コンポーネントは、予測されたモチーフ領域と対応するグランドトゥルースのセグメンテーションマスクとの間の構造的偏差にペナルティを課すことで、再構成プロセス全体を通じて文化的に重要なパターンの構造が維持されるように促します。
提案されたSegCycle-SPADEフレームワークを、Miao Batikの文化的モチーフデータセットとWikiArtデータセットの2つのデータセットを用いて評価しました。Miao Batikデータセットには伝統的な文化遺産の画像が含まれており、主にセマンティックセグメンテーションと構造再構成タスクに使用されました。一方、WikiArtデータセットには多様な芸術的スタイルが含まれており、芸術的スタイルの学習と生成に使用されました。両データセットの画像は、セマンティックセグメンテーション、CAFFM、パターン再構成、およびSPADEベースの芸術的スタイル生成を含む、完全なSegCycle-SPADEパイプラインを通じて処理されました。文化的モチーフの情報と芸術的スタイルの表現を統合することで、本フレームワークは、文化的な意味を持ち、視覚的に一貫した出力を生成することが可能となりました。
すべての実験は、Intel Core i7プロセッサとNVIDIA GPUを搭載したGPU対応ワークステーションで実施されました。具体的には、Intel Core i7(第11世代)CPU、24 GB VRAM搭載のNVIDIA RTX 3090 GPU、および32 GBのシステムメモリを備えたワークステーションを使用しました。モデルは、Python 3.8およびCUDA加速を用いたPyTorch 1.10を用いて実装されました。トレーニングは、分散トレーニングを用いず、シングルGPU構成で実施されました。すべての実験を通して標準的なFP32精度が使用され、混合精度トレーニングは採用しませんでした。オプティマイザーにはAdamを使用し、バッチサイズ16で100エポックのトレーニングを行いました。表3に、本研究で使用した実装パラメータと計算環境をまとめます。
提案されたアーキテクチャは、セマンティックセグメンテーション用のSegFormer-B2、特徴量融合用のCAFFM、モチーフ再構成用のCycleGAN、および芸術的スタイル合成用のSPADEという4つの主要コンポーネントで構成されています。両データセットの画像は、トレーニング前に256 × 256ピクセルにリサイズされました。この標準化された解像度により、重要なモチーフの詳細を保持しつつ計算効率が確保され、CycleGANおよびSPADE両モジュールの安定した敵対的学習に寄与しました。
提案したフレームワークの性能は、セグメンテーション精度、IoU、Dice係数(Dice)、SSIM、PSNR、およびFIDを含む、セグメンテーションおよび画質評価指標を用いて評価されました。視覚的な真正性は、生成された文化的パターンの目視検査を通じて定性的に評価されました。定性評価では、参照文化モチーフに対するモチーフの保持、意味論的な一貫性、文化的特性、および芸術的な外観に焦点を当てました。なお、視覚的な真正性は、独立した定量評価指標としては使用していません。
提案したフレームワークの定量的評価は、以下の指標を用いて行われました。
セグメンテーション精度は、式 23を用いて算出した:

ここで、TP、TN、FP、およびFNは、それぞれ真陽性、真陰性、偽陽性、および偽陰性を表します。
IoUは式24を用いて算出した:

Dice係数(Dice Similarity Coefficient)は、式 25を用いて算出した:

知覚的な画像の類似性を評価するためにSSIMが用いられ、これは式2633を用いて定義されます:
(26)
ここで、μは平均強度、σは分散、σxyは画像間の共分散、C1およびC2は安定化定数を示します。
PSNRは、生成された画像の品質を評価するために一般的に用いられる指標であり、式 2733で定義されています。

ここで、MaxIは画像の最大画素値を表し、MSEはオリジナル画像と再構成画像の間の平均二乗誤差を表します。
FIDは、式2833のように、平均と共分散行列を用いて計算することができます:
(28)
ここで、μrは実画像の平均値、μgは生成画像の平均値であり、ΣrおよびΣgはそれぞれ実画像と生成画像の共分散行列である。
性能比較のため、提案したフレームワークを、セマンティックセグメンテーション、画像再構成、および芸術的画像生成で一般的に用いられる代表的な手法と比較して評価しました。セグメンテーションのベースラインとしてU-NetおよびDeepLabV3+を、再構成のベースラインとしてPix2PixおよびCycleGANを組み込みました。また、芸術的画像生成の代表的な手法としてStyleGANおよびAttentionGANを使用しました。これらの比較は、芸術的な品質を向上させると同時に、構造的モチーフ情報を保存するにおけるSegCycle-SPADEの有効性を検証するために行われました。
性能の安定性と再現性を評価するため、各実験を5回繰り返した。すべての実験において、トレーニング、検証、およびテストのサブセットを一致させるため、データセットの分割には固定の乱数シード 42 を使用した。結果は平均値 ± 標準偏差として報告する。Accuracy、IoU、Dice、SSIM、PSNR、および FID で観察された標準偏差の値が低いことは、提案したフレームワークが繰り返しの実験実行を通じて安定した性能を達成したことを示している。統計的有意性は対応のあるt検定を用いて評価し、p < 0.05 の場合に統計的に有意であるとみなした。すべてのモデルが同一のデータセット分割で評価されたため、繰り返しの実行間で対応のある性能測定値が得られ、対応のあるt検定の使用が正当化された。複数のペア比較に伴うファミリーワイズ誤差率を制御するため、ボンフェローニ補正を適用し、調整後の閾値 α/n(n はペア比較の数を示す)を用いて統計的有意性を判定した。
実験結果は、提案されたSegCycle-SPADEフレームワークの有効性を強く支持しています。SegFormer-B2によって達成された優れたセグメンテーション性能は、文化的に重要なモチーフの境界を正確に特定し、保持する能力があることを示しています。IoUおよびDiceスコアの向上は、処理パイプライン全体を通じてセマンティックなモチーフ構造が効果的に保持されていることをさらに示唆しています。CycleGANとSPADEの統合により、SSIMおよびPSNR値の改善に反映されているように、微細な視覚的詳細を維持しつつ、不完全なモチーフ構造を正常に再構成できました。さらに、FIDスコアの低下は、生成された芸術的パターンが本物の文化・芸術的な画像に対してより高い類似性を示していることを意味しており、スタイルの一貫性と視覚的なリアリズムが向上したことを示唆しています。
CAFFMは、セグメンテーション由来の構造情報と生成的なスタイル表現との効果的な相互作用を促進することにより、これらの改善に大きく貢献しました。クロスアテンションに基づく特徴融合を通じて、CAFFMは文化的モチーフ間の長距離的な関係性を維持しつつ、構造的な忠実度と芸術的な真正性の両方を向上させました。
図6は、Miao BatikおよびWikiArtデータセットにおける、提案したSegCycle-SPADEフレームワークと既存手法とのセグメンテーション精度の比較を示している。U-NetやDeepLabV3+などの従来のセグメンテーション手法は、空間表現を学習する能力があるため、競争力のある性能を達成した。しかし、Pix2PixおよびCycleGANは、セグメンテーションタスク向けに特化した設計ではないため、セグメンテーション精度が低かった。提案したSegCycle-SPADEフレームワークは、SegFormer-B2とCAFFMベースの特徴量強化を統合したことにより、両方のデータセットで最高のセグメンテーション精度を達成した。

図6. 各手法におけるセグメンテーション精度の比較。Miao BatikおよびWikiArtデータセットを用いて、U-Net、DeepLabV3+、Pix2Pix、CycleGAN、および提案するSegCycle-SPADEフレームワークで得られたセグメンテーション精度の比較。結果は5回の独立した試行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を表す。値が高いほど、セグメンテーション性能が向上していることを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のセグメンテーション精度を達成した。この図の拡大版を表示するには、ここをクリックしてください。
図 7は、評価した各手法におけるIoUの比較を示しています。U-NetとDeepLabV3+は、セグメンテーションに特化したアーキテクチャであるため、高いオーバーラップ性能を達成しました。対照的に、Pix2PixとCycleGANは、主な目的がセマンティックセグメンテーションではなく画像変換であるため、IoUの値が低くなりました。提案したSegCycle-SPADEフレームワークは、両方のデータセットで最高のIoU値を達成しており、文化的モチーフ領域の局在化と保存が改善されたことが示されています。

Figure 7. 文化的なモチーフのセグメンテーションにおけるIntersection over Union (IoU) スコアの比較。Miao BatikおよびWikiArtデータセットにおける、セグメンテーション手法間のIoU性能の比較。結果は5回の独立した試行(n = 5)の平均 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を示す。IoU値が高いほど、予測されたモチーフ領域と参照モチーフ領域の重なりが改善され、モチーフの境界がより良好に保持されていることを示す。提案するSegCycle-SPADEフレームワークが、両方のデータセットで最高のIoUスコアを達成した。この図の拡大版を表示するには、ここをクリックしてください。
図8にDice係数の比較を示す。Dice係数は、予測されたセグメンテーションマスクとグランドトゥルースのモチーフ領域との重なりを測定する。従来のセグメンテーション手法は、空間構造の学習に効果的であるため、比較的高いDiceスコアを達成した。しかし、提案するSegCycle-SPADEフレームワークは、両方のデータセットで最高のDiceスコアを達成し、セグメンテーションの一貫性とモチーフの保存性が向上していることが示された。

Figure 8. 文化的なモチーフセグメンテーションにおけるDice係数の比較。Miao BatikおよびWikiArtデータセットにおいて、異なるセグメンテーション手法を用いて得られたDice係数値の比較。Dice係数は、予測されたセグメンテーションマスクとリファレンスマスクの重複度を評価するものであり、値が高いほどセグメンテーション性能およびモチーフ領域の特定能力が高いことを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のDice係数値を達成した。この図の拡大版を表示するには、ここをクリックしてください。
図9に、再構成された文化パターンのSSIM比較を示す。Pix2Pix、CycleGAN、StyleGANなどのGANベースの手法は、画像生成用に設計されているため、従来のセグメンテーション手法よりも高いSSIM値を達成した。それにもかかわらず、提案したSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のSSIM値を達成し、構造的詳細と芸術的コヒーレンスの保存能力が優れていることを示した。
図 9. 構造的類似性指標(SSIM)の比較。Miao BatikおよびWikiArtデータセットにおいて、異なる再構成手法を用いて得られた構造的類似性指標(SSIM)値の比較。結果は5回の独立した実行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を示す。SSIM値が高いほど、再構成されたパターンと参照パターンの間の構造的類似性が高いことを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のSSIMスコアを達成した。こちらのリンクをクリックして、この図の拡大版を表示してください。
生成された芸術的パターンのリアリズムと分布の類似性を評価するために、FIDを用いました。FIDの算出には事前学習済みのInception-v3ネットワークを使用し、pool3層から特徴ベクトルを抽出することで、2048次元の特徴表現を得ました。特徴抽出の前に、生成画像と参照画像をバイリニア補間を用いて299 × 299ピクセルにリサイズし、標準的なInception-v3の前処理プロトコルに従って正規化しました。FIDは、独立したテストデータセットから抽出された特徴分布を用いて算出しました。特徴埋め込みから平均と共分散の統計量を推定し、それを標準的なFIDの定式化に使用しました。
表4に示すように、Pix2PixやCycleGANなどの従来の画像生成手法は、明示的な構造的ガイダンスを欠いていたため、FIDスコアが比較的高い値となりました。StyleGANとAttentionGANは、特徴学習能力の向上により、より低いFIDスコアを達成しました。しかし、提案したSegCycle-SPADEフレームワークは、両方のデータセットにおいて最も低いFIDスコアを達成し、優れた画像のリアリズム、スタイルの整合性、および文化的モチーフの保存能力を実証しました。
| 手法 | Miao Batikデータセット (FID) | WikiArtデータセット (FID) |
| Pix2Pix | 48.6 | 52.3 |
| CycleGAN | 42.8 | 46.5 |
| StyleGAN | 39.7 | 43.1 |
| AttentionGAN | 36.9 | 40.4 |
| SegCycle-SPADE (提案手法) | 28.5 | 31.2 |
表4:文化パターンの再構成におけるFrechet Inception Distance (FID) の結果。Miao BatikおよびWikiArtデータセットにおいて、提案するSegCycle-SPADEフレームワークとベースラインの生成モデルにより得られたFrechet Inception Distance (FID) スコアの比較。FID値が低いほど、生成画像と実画像の特長分布の類似性が高く、したがって再構成された文化パターンの視覚的なリアリズムが向上していることを示す。
図10は、異なる手法によって達成された再構成品質を比較したものである。再構成品質(%)は、再構成画像と対応する参照画像の間のSSIMをパーセント尺度(SSIM × 100)に変換して算出した。パーセンテージが高いほど、元の文化的モチーフに対する構造的な忠実度と視覚的な類似性が高いことを示す。Pix2PixやCycleGANなどの従来の生成モデルは、中程度の再構成性能を達成した。StyleGANやAttentionGANを含むより高度なアーキテクチャは、強化された特徴学習能力により、向上した再構成品質を達成した。しかし、提案するSegCycle-SPADEフレームワークは、セマンティックセグメンテーションによるガイダンス、クロスアテンション特徴融合、再構成学習、および芸術的合成を統合しているため、最高の再構成品質を達成した。

図10. パターン再構成品質の比較。Miao BatikおよびWikiArtデータセットにおいて、Pix2Pix、CycleGAN、StyleGAN、AttentionGAN、および提案するSegCycle-SPADEフレームワークを用いて達成された再構成品質の比較。結果は5回の独立した実行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を示す。値が高いほど、構造的詳細の保持、意味的一貫性、および視覚的忠実度が向上していることを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットで最高の再構成品質スコアを達成した。この図の拡大版を表示するには、ここをクリックしてください。
再構成された画像と対応する参照画像の間のピクセルレベルの類似性を測定することにより、再構成の忠実度を評価するためにPSNRを用いました。PSNRは、各再構成画像と、グランドトゥルース(正解)参照として使用した対応するオリジナルの苗族バティック画像との間で算出しました。PSNR値が高いほど、再構成誤差が小さいことを示します。表5に示すように、Pix2PixとCycleGANは、明示的な構造的ガイダンスなしにパターンを再構成したため、中程度のPSNR値となりました。StyleGANとAttentionGANは、より深い特徴学習を通じて、より高いPSNR値を達成しました。提案したSegCycle-SPADEフレームワークは、両方のデータセットで最高のPSNR値を達成し、優れた再構成忠実度と文化的なモチーフ構造の保存を実証しました。
| 手法 | Miao Batik データセット (PSNR, dB) | WikiArt データセット (PSNR, dB) |
| Pix2Pix | 25.8 | 24.6 |
| CycleGAN | 27.3 | 26.1 |
| StyleGAN | 28.7 | 27.5 |
| AttentionGAN | 29.9 | 28.6 |
| SegCycle-SPADE (提案手法) | 32.4 | 31.2 |
表 5: 文化パターンの再構成におけるピーク信号対雑音比 (PSNR) の結果。Miao Batik および WikiArt データセットを用いて、提案する SegCycle-SPADE フレームワークとベースライン手法で得られたピーク信号対雑音比 (PSNR) 値を比較したものである。PSNR 値が高いほど、対応する参照画像に対する再構成の忠実度が向上し、歪みが減少していることを示す。
図11 は、提案したSegCycle-SPADEフレームワークのトレーニング中の収束挙動を示している。損失曲線は、5回の独立したトレーニングランで平均された平均トレーニング損失を表している。確率的な変動を抑え、トレーニングの収束をより堅牢に表現するため、各エポックにおける損失値はすべてのランにわたって平均化した。トレーニングの初期エポックでは、モデルが入力データから特徴表現を学習していたため、損失値は比較的高かった。トレーニングが進むにつれて、すべての損失成分が徐々に減少し安定したことは、セグメンテーション、再構成、および芸術的合成の目的関数が正常に最適化されたことを示している。観察された収束挙動は、提案したフレームワークがトレーニングにおいて有効であり、安定性と再現性を備えていることを実証している。

図11提案されたSegCycle-SPADEフレームワークの学習収束。 提案したSegCycle-SPADEフレームワークにおける、100トレーニングエポックにわたるトレーニング損失曲線。5回の独立したトレーニングの平均値(n = 5)。本図は、トレーニング中の全損失(LTotal)、セグメンテーション損失(LSeg)、ジェネレータ損失(LG)、およびディスクリミネータ損失(LD)の推移を示している。すべての損失成分が徐々に減少し、その後に安定していることは、提案したフレームワークが正常に収束し、安定して最適化されたことを示している。 この図の拡大版を表示するには、ここをクリックしてください。
アブレーション研究
提案したSegCycle-SPADEフレームワークにおける各コンポーネントの寄与を評価するため、複数の制御されたモデル構成を用いてアブレーション研究を実施した。結果を表6および表7にまとめる。
| モデル構成 | セグメンテーション精度 (%) | IoU | SSIM |
| SegFormer のみ | 87.3 | 0.76 | 0.82 |
| SegFormer + CAFFM | 89.6 | 0.79 | 0.86 |
| SegFormer + CAFFM + CycleGAN | 91.4 | 0.82 | 0.89 |
| SegFormer + CAFFM + CycleGAN + SPADE (提案手法) | 93.8 | 0.86 | 0.93 |
表6:SegCycle-SPADEコンポーネントのアブレーション研究個々のフレームワークコンポーネントの寄与を評価するため、段階的に強化したモデル構成の性能比較を行った。本研究では、セマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module (CAFFM)、CycleGANベースの再構成、およびSPADEベースの芸術的合成が、セグメンテーション精度、Intersection over Union (IoU)、およびStructural Similarity Index (SSIM)に及ぼす影響を検討している。値が高いほど、モチーフのセグメンテーション、再構成品質、および構造保持が向上していることを示す。
| バリアント | IoU (%) | Dice (%) | SSIM | PSNR (dB) | FID ↓ |
| SegFormerのみ | 84.2 ± 0.4 | 88.5 ± 0.3 | 0.82 ± 0.01 | 24.8 ± 0.2 | 31.8 ± 0.6 |
| SegFormer + CycleGAN | 86.7 ± 0.3 | 90.2 ± 0.2 | 0.85 ± 0.01 | 26.3 ± 0.2 | 27.5 ± 0.5 |
| SegFormer + SPADE | 87.0 ± 0.3 | 90.5 ± 0.2 | 0.88 ± 0.01 | 27.8 ± 0.2 | 23.4 ± 0.4 |
| SegFormer + CAFFM | 90.0 ± 0.2 | 93.1 ± 0.2 | 0.90 ± 0.01 | 29.6 ± 0.1 | 20.3 ± 0.3 |
| SegCycle-SPADE (フルモデル) | 93.0 ± 0.2 | 95.4 ± 0.1 | 0.92 ± 0.01 | 31.2 ± 0.1 | 17.6 ± 0.2 |
表7:提案するSegCycle-SPADEフレームワークの構成要素の寄与度分析。CAFFM、CycleGAN、SPADE、および完全なSegCycle-SPADEアーキテクチャの寄与度を評価するために使用した、個別のフレームワークバリアントの性能比較。結果は、Intersection over Union (IoU)、Dice係数、構造的類似性指数 (SSIM)、ピーク信号対雑音比 (PSNR)、およびFrechet Inception Distance (FID)を用いて報告されている。IoU、Dice、SSIM、PSNRの値が高いほどセグメンテーションおよび再構成の品質が向上していることを示し、FIDの値が低いほど生成された文化的パターンの視覚的な写実性が高いことを示す。
表6では、(i) SegFormerのみ、(ii) SegFormer + CAFFM、(iii) SegFormer + CAFFM + CycleGAN、および(iv) SegFormer + CAFFM + CycleGAN + SPADE(提案フレームワーク)の4つの構成を用いて、主要なフレームワーク構成要素の累積的な寄与を評価しています。ベースラインのSegFormerモデルでは、セグメンテーション精度87.3%、IoUスコア0.76、SSIM値0.82を達成しました。CAFFMモジュールを組み込むことで、すべての評価指標において性能が向上し、セグメンテーション精度は89.6%、IoUは0.79、SSIMは0.86に上昇しました。さらにCycleGANを追加したことで構造再構成能力が向上し、IoU 0.82、SSIM値0.89となりました。完全なSegCycle-SPADEフレームワークは、セグメンテーション精度93.8%、IoU 0.86、SSIM値0.93という最高の総合性能を達成しました。これらの結果は、各構成要素がセグメンテーション精度の向上、構造の保存、および画像再構成品質の向上に段階的に寄与していることを示しています。
表 7 では、(i) SegFormerのみ、(ii) SegFormer + CycleGAN、(iii) SegFormer + SPADE、(iv) SegFormer + CAFFM、および (v) SegFormer、CAFFM、CycleGAN、SPADE、およびモチーフ保持損失を組み込んだフルモデルの5つのモデルバリアントを用いて、個々のフレームワーク構成要素の寄与をさらに調査しています。性能評価には、IoU、Dice係数、SSIM、PSNR、およびFIDの指標が用いられました。
SegFormerのみを用いたベースライン構成では、IoU 84.2%、Dice係数 88.5%、SSIM値 0.82、PSNR 24.8 dB、およびFIDスコア 31.8を達成した。CycleGANを追加したことで再構成品質が向上し、FIDスコアが27.5まで低下し、画像のリアリズムが改善された。さらにSPADEを組み込むことで構造的類似性と画質が向上し、SSIM値 0.88、FIDスコア 23.4となった。提案するCAFFMモジュールの導入により、すべての指標で大幅な向上が見られ、IoUは90.0%、Dice係数は93.1%、SSIMは0.90、PSNRは29.6 dBに増加し、FIDスコアは20.3まで低下した。さらにモチーフ保存損失を組み込んだ完全なモデルでは、IoU 93.0%、Dice係数 95.4%、SSIM値 0.92、PSNR 31.2 dB、FIDスコア 17.6となり、最高の総合性能を達成した。
表8に、文化遺産のパターンの再構成および保存に使用される代表的な深層学習(DL)アプローチの比較概要を示す。従来のCNNベースの手法は、効果的な局所特徴学習とセグメンテーション性能を提供するが、長距離依存性のモデリング能力が限られているため、複雑なモチーフ構造の保存に苦慮することが多い。GANベースのアプローチは、画像合成およびスタイル転送能力を向上させるが、意味的な不整合や微細な構造的詳細の喪失が生じる可能性がある。Transformerベースの手法は、グローバルな文脈理解を強化するが、一般に生成的な再構成能力に欠ける。一方、拡散モデルベースの手法は、計算量が増加するという代償はあるが、高い視覚的リアリズムを提供する。ハイブリッドなTransformer-GANアプローチは、特徴抽出と画像生成メカニズムを組み合わせることで、これらの制限を部分的に解消している。対照的に、提案するSegCycle-SPADEフレームワークは、Transformerベースのセグメンテーション、クロスアテンションによる特徴融合、生成的再構成、およびセグメンテーション誘導型の芸術的合成を単一のアーキテクチャに統合しており、これにより構造的忠実度、意味的一貫性、および文化的モチーフの保存性が向上している。比較のまとめは表8に記載されている。
| アプローチ | コア手法 | 長所 | 限界 | 文化遺産への関連性 |
| CNNベースの手法 (例: U-Net, DeepLabV3+) | 畳み込みによる特徴抽出およびセマンティックセグメンテーション | 効果的な局所特徴学習と正確なセグメンテーション | 長期的な依存関係のモデリングに限界がある。複雑なモチーフ構造の維持が困難 | モチーフのセグメンテーションには適しているが、芸術的な再構成への効果は低い |
| GANベースの手法 (例: Pix2Pix, CycleGAN) | 敵対的画像生成およびimage-to-image変換 | 高品質な画像合成とスタイル転送 | 学習の不安定性、セマンティックな不整合、微細な構造的詳細の喪失の可能性 | パターンの復元には有用だが、文化的なモチーフを正確に維持できない可能性がある |
| Transformerベースの手法 | 自己注意機構(Self-attention)とグローバルコンテキストモデリング | 長期的な依存関係と複雑な視覚的関係を捉えることができる | 計算コストが高く、大規模な学習データセットを必要とする | 複雑なパターン分析に効果的だが、単独で使用した場合の生成能力は限定的 |
| 拡散モデル(Diffusion-Based)の手法 | 反復的なデノイジングに基づく画像生成 | 高い視覚的リアリズムと画像の多様性 | 推論速度が遅い。高い計算リソースを必要とし、構造的な制御が限定的 | 遺産画像の生成において有望だが、計算負荷が高い |
| Hybrid Transformer-GAN手法 | Transformerベースの特徴抽出とGANベースの生成の組み合わせ | グローバルな特徴表現と画像品質の向上 | モチーフを維持するための明示的なセマンティックガイダンスを欠くことが多い | 生成品質は向上するが、文化遺産のモチーフ向けに特化して設計されているわけではない |
| 提案手法 SegCycle-SPADE | SegFormer + CAFFM + CycleGAN + SPADE | Transformerベースのセグメンテーション、アテンション誘導による特徴融合、セマンティックな一貫性、モチーフの保存、および制御可能な芸術的再構成 | 単独のCNNベースのアプローチよりも計算複雑性が高い | 構造的忠実度とセマンティックな一貫性を向上させ、文化遺産パターンの再構成および保存に特化して設計されている |
表8:文化遺産のパターンの再構築および保存における代表的なディープラーニング手法の比較画像セグメンテーション、パターンの再構築、スタイルの生成、および文化遺産の保存に使用される代表的なディープラーニング手法の定量的比較。本表では、各手法の核心となる手法、利点、限界、および適用性をまとめており、提案するSegCycle-SPADEフレームワークが、セマンティックセグメンテーション、特徴融合、再構築、およびスタイル合成をどのように組み合わせ、文化遺産のパターンにおける構造的保存とセマンティックな一貫性に関する課題に対処しているかを強調している。
観察された改善により、CAFFMモジュールがクロスアテンションに基づく特徴融合を通じて、セグメンテーション由来の構造的特徴と芸術的なスタイル表現との相互作用を効果的に強化することが実証されました。さらに、モチーフ保存損失(motif-preservation loss)は、再構成および芸術的合成において文化的に重要なモチーフ構造を維持することに寄与し、その結果、セグメンテーションの一貫性、構造的な忠実度、および視覚的なリアリズムが向上しました。総じて、アブレーション解析の結果から、SegFormer-B2、CAFFM、CycleGAN、SPADE、およびモチーフ保存損失の統合が、提案されたSegCycle-SPADEフレームワークの優れた性能を実現していることが確認されました。
データ可用性:
芸術的スタイルの学習に使用したWikiArtデータセットは、KaggleのWikiArtリポジトリ(https://www.kaggle.com/datasets/steubk/wikiart)を通じて公開されています。本研究で使用したMiao Batikデータセットは、Zenodo(https://doi.org/10.5281/zenodo.20807658)を通じて公開されています。提案するSegCycle-SPADEフレームワークに関連する処理済みデータセット、セグメンテーションマスク、事前学習済みモデルの重み、生成出力、およびPython実装ファイルも、同じZenodoリポジトリから入手可能です。
補足ファイル:
補足ファイル1. アルゴリズム1:提案されたSegCycle-SPADEフレームワークの実装ワークフロー。 データセットの読み込み、前処理、SegFormer-B2を用いたセマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module (CAFFM) を用いた特徴融合、CycleGANを用いた文化的モチーフの再構築、SPADEを用いた芸術的スタイルの合成、モデルのトレーニング、検証、チェックポイントの選択、および最終的な性能評価を含む、提案されたSegCycle-SPADEフレームワークの完全な実装パイプラインを記述したステップバイステップの擬似コード。こちらのリンクからファイルをダウンロードしてください。
伝統工芸の緩やかな喪失に伴い、近年、無形文化遺産(ICH)パターンの保存とデジタル再構築への関心が高まっています。先行研究では、ディープラーニング(DL)に基づく画像処理技術を用いて文化遺産の喪失に対処することが試みられてきました。例えば、Quanら32は、貴州省の苗族バティック文化を対象に、ナレッジグラフとDLに基づく文化遺産保存フレームワークを提案しました。この研究は文化パターンのデジタル再構築に焦点を当てていましたが、その手法は主にナレッジグラフによる表現に依存していました。同様に、FuとRazmjooy16は、文化遺産画像の強調および修復のために、特徴ピラミッドネットワーク(FPN)に基づくフレームワークを提案しました。この手法は画像強調のための効果的な特徴抽出を実現しましたが、不完全な文化パターンに対する画像セグメンテーションによる誘導や、生成的な再構築メカニズムは組み込まれていませんでした。対照的に、提案するSegCycle-SPADEフレームワークは、複数のDLコンポーネントを組み合わせることで、これらの課題を克服しています。まず、SegFormerモデルを用いたセマンティックセグメンテーションを採用し、文化遺産パターン内のモチーフ領域を正確に特定します。続いて、CAFFMベースの特徴強調モジュールにより、きめ細やかなモチーフ構造の特徴表現を改善します。その後、CycleGAN再構築モジュールを用いて、敵対的学習を通じて文化パターン内の欠損または不完全な領域を再構築します。最後に、SPADEモジュールが、セグメンテーションマップとの構造的な整合性を維持しながら、スタイルの強調を行います。既存のCNN、GAN、Transformer、および拡散ベースの手法17,19,20,21,22,23,24,25,30,34は、それぞれ独自の利点を有していますが、Table 8にまとめられているように、セマンティックな一貫性の保持、構造的特徴の維持、または計算効率の達成において限界もあります。提案するSegCycle-SPADEアーキテクチャは、SegFormerベースのセグメンテーション、クロスアテンション特徴融合、CycleGAN再構築、およびSPADE誘導合成の強みを組み合わせることで、これらの限界に対処しています。その結果、本フレームワークは再構築品質を向上させ、文化的に重要なモチーフの保存性を高めることに成功しました。
有望な性能を示したものの、提案されたSegCycle-SPADEフレームワークには依然としていくつかの限界があります。第一に、評価がMiao BatikおよびWikiArtのデータセットのみを用いて行われたため、他の文化遺産ドメインへのフレームワークの汎用性が制限される可能性があります。第二に、SegFormer、CAFFM、CycleGAN、およびSPADEの統合により計算複雑性とメモリ要件が増大するため、リソース制限のあるプラットフォームへの展開が困難な場合があります。第三に、セグメンテーション性能はモチーフアノテーションの品質と一貫性に大きく依存しており、アノテーションのバイアスが文化的に重要な構造の保存に影響を与える可能性があります。最後に、本フレームワークは2つのデータセットのみで評価されたため、多様な文化遺産コレクションへの適用性を確保するには、追加のトレーニングデータとドメイン固有の適応が必要になる可能性があります。したがって、今後の研究では、より堅牢なトレーニング戦略、軽量なアーキテクチャ、改善されたアノテーション手順、および追加の文化遺産データセットを用いたクロスドメイン評価を検討する必要があります。
より大規模で多様な文化遺産データセットに対するSegCycle-SPADEフレームワークの拡張性は、今後の研究の主要な焦点となります。モデルの汎化性能と文化的適応性を向上させるため、異なる地域や芸術的伝統に由来する遺産モチーフの文化横断的な評価が調査される予定です。さらに、テキスト記述、歴史的記録、および文化的メタデータを組み込んだマルチモーダル拡張により、再構成中のより強力な意味論的ガイダンスが得られる可能性があります。また、画像ベースの再構成と3Dモデリング技術を統合することで、本フレームワークを3次元文化遺産再構成のサポートに拡張できる可能性があります。加えて、AI支援による文化遺産の保存および記録の実用的な応用を促進するため、デジタルアーカイブ、博物館、バーチャル展示、および文化遺産保存プラットフォームへの展開が検討されます。解釈可能性と文化的な真正性をさらに向上させるため、今後の研究では、文化知識グラフ、民族誌的記録、歴史的メタデータ、および専門家がキュレーションした知識ベースの統合を検討し、文化的に裏付けられたモチーフ分析と再構成を実現します32。
提案されたSegCycle-SPADEフレームワークを実装する際には、いくつかの実用的な考慮事項を検討する必要があります。CycleGANのトレーニング中、ジェネレーターとディスクリミネーターの損失のバランスが著しく崩れると、敵対的収束が不安定になる場合があります。このような状況では、学習率の低下、サイクル一貫性損失の重みの増加、またはディスクリミネーターの優位性の監視により、トレーニングの安定性が向上する可能性があります。ジェネレーターが視覚的に類似した出力を繰り返し生成する場合、モード崩壊が発生することがあります。この問題は、バランスの取れた敵対的トレーニング、リプレイバッファの利用、およびジェネレーターとディスクリミネーターの損失トレンドの慎重な監視によって軽減できます。また、文化的モチーフが複雑なテクスチャ、低コントラスト、または曖昧な境界を持つ場合、セグメンテーションの失敗が生じることがあります。この問題に対処するためには、トレーニング前に画像品質を確認し、アノテーションの一貫性を確保するためにセグメンテーションマスクを視覚的に検査する必要があります。信頼性の高いSegFormerの性能を達成するためには、推奨される入力解像度と正規化設定を維持することも重要です。さらに、不適切な学習率の設定、トレーニングデータの不足、またはハードウェアに関連する数値的な変動によって、トレーニングが不安定になる場合があります。再現性を向上させるためには、NumPy、PyTorch、CUDA、およびデータセットのシャッフル操作に固定の乱数シードを使用する必要があります。さらに、すべての実験ランにおいて、同一の前処理パイプライン、データセットの分割、モデルのハイパーパラメータ、およびソフトウェア環境を維持する必要があります。性能低下を防ぎ、中断されたトレーニングセッションからの復旧を容易にするために、定期的なチェックポイントの保存と検証損失の監視も推奨されます。
本研究は、AIベースの文化遺産復元フレームワークの理論的な進展に寄与するものである。従来の画像復元手法では、一般的に画像セグメンテーション、復元、およびスタイル生成を独立したプロセスとして扱ってきた17,19,20,30。対照的に本研究では、セグメンテーション誘導型生成復元戦略を通じてこれらのプロセスを統合するフレームワークを提案する。その結果、セグメンテーション、復元、およびスタイル生成を単一のフレームワーク内でどのように統一できるかを示すことで、AI支援による文化遺産復元の理論的発展に寄与している。このような統合は、モチーフの構造と意味的意味の保存が極めて重要である文化遺産への応用において特に重要である。実用的な観点から、提案されたフレームワークは、伝統的な文化パターンのデジタル保存、復元、および芸術的な向上に向けた効果的なソリューションを提供する。文化遺産機関、博物館、およびデザイナーは、SegCycle-SPADEを利用してモチーフ領域を自動的に特定し、損傷したまたは不完全なパターンを復元し、伝統的なデザインの視覚的に強化された芸術的表現を生成することができる。この機能は、歴史的な工芸品が部分的に損傷していたり不完全であったりする苗族のバティックテキスタイルパターンを含む、絶滅の危機に瀕した工芸伝統にとって特に価値がある。さらに、生成的なスタイル合成を組み込むことで、本フレームワークはテキスタイルデザイン、デジタル芸術創作、および遺産教育などの現代的な文化デザインアプリケーションをサポートすることが可能である。このように、提案されたフレームワークは、文化遺産の保存と現代の文化デザインアプリケーションの間の隔たりを埋めるものである。
しかしながら、提案したSegCycle-SPADEフレームワークによって有望な結果が得られたものの、いくつかの限界も残っています。第一に、評価がMiao BatikおよびWikiArtのデータセットのみを用いて行われたため、他の形態の文化遺産パターンの再構成における本フレームワークの汎化能力に影響を及ぼす可能性があります。第二に、再構成プロセスがGANベースのモデルに依存しているため、非常に複雑なモチーフ構造を扱う際に、生成された出力にアーティファクトや不自然なテクスチャが含まれる場合があります。第三に、現在のフレームワークは二次元パターンの再構成に焦点を当てていますが、一部の文化遺産遺物は本質的に三次元構造を有しています。総括すると、実験結果は、無形文化遺産(ICH)パターンの芸術的再構成における提案手法であるSegCycle-SPADEフレームワークの有効性を実証しています。SegFormerベースの意味論的セグメンテーション、CAFFM、CycleGANベースのモチーフ再構成、およびSPADEベースの芸術的合成の統合により、セグメンテーション、再構成、および画像品質の性能指標が一貫して向上しました。アブレーション研究により、各フレームワーク構成要素の寄与がさらに検証され、CAFFMとモチーフ保持損失が構造的な忠実度と視覚的な真正性を大幅に高めることが示されました。これらの知見は、意味論的セグメンテーション誘導型の再構成とクロスアテンション特徴融合を組み合わせることで、芸術的に豊かな出力を生成しつつ、文化的に重要なモチーフを効果的に保存できるという中心的な仮説を支持するものです。したがって、提案したフレームワークは、ICHパターンのデジタル保存、修復、および創造的な活性化のための、信頼性と再現性の高い計算論的アプローチを提供します。
利益相反:
著者は、競合する利益がないことを宣言します。
著者らは、本研究の遂行にあたり、広東工程 Polytechnic および華南師範大学から提供された学術的および機関的な支援に感謝いたします。本研究は、2023年国家社会科学基金一般プロジェクト(No. 23BH161)「(タイトル)」の支援を受けて実施されました。 「デジタル再生博物館:中国古典書画文化遺産の活性化と伝達に関する研究」
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Adam オプティマイザ | PyTorch Optimizer Library | Adam | モデルトレーニング中に使用される最適化アルゴリズム。 |
| CUDA Toolkit | NVIDIA Corporation | CUDA 11.3 | ディープラーニング計算のためのGPU加速。 |
| cuDNN | NVIDIA Corporation | cuDNN 8.2 | トレーニングと推論を高速化するために使用される深層ニューラルネットワーク加速ライブラリ。 |
| CycleGAN | University of California, Berkeley / オープンソース | Official PyTorch Implementation (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix) | 文化的なモチーフの再構成に使用される敵対的生成ネットワーク。 |
| ImageNet 学習済み重み | ImageNet / オープンソース | mit_b2.pth (ImageNet-1K Pretrained Checkpoint) | Miao Batik データセットでのファインチューニング前に、SegFormer-B2 バックボーンを初期化するために使用。 |
| Intel プロセッサ | Intel Corporation | Intel Core i7 (第11世代) | 画像の前処理、モデルトレーニングのサポート、および推論に使用されるCPU。 |
| Matplotlib | Matplotlib Development Team | Matplotlib 3.5.1 | トレーニング曲線と評価結果の可視化。 |
| Miao Batik データセット | Zenodo Repository | DOI: 10.5281/zenodo.20807658 | セマンティックセグメンテーションとパターン再構成に使用される、15,148 枚の画像を含む文化的モチーフのデータセット。 |
| NumPy | NumPy Developers | NumPy 1.21.5 | 数値計算およびデータセット処理。 |
| NVIDIA GPU | NVIDIA Corporation | NVIDIA RTX 3090 (24 GB VRAM) | モデルトレーニングと推論に使用されるハードウェアプラットフォーム。 |
| OpenCV | OpenCV Foundation | OpenCV 4.5.5 | 画像の前処理、リサイズ、補間、およびガウシアンデノイジング。 |
| オペレーティングシステム | Canonical Ltd. | Ubuntu 20.04 LTS | 実験実行環境。 |
| Pillow (PIL) | Python Imaging Library | Pillow 8.4.0 | 画像の読み込みと操作。 |
| Python | Python Software Foundation | Python 3.8.10 | 実装と実験に使用されるプログラミング言語。 |
| PyTorch | Meta AI | PyTorch 1.10.0 | モデルトレーニングと推論に使用されるディープラーニングフレームワーク。 |
| 乱数シード | 実験設定 | 42 | データセットの分割、モデルの初期化、および実験の再現性のために使用される固定シード。 |
| Scikit-learn | Scikit-learn Developers | Scikit-learn 1.0.2 | データセットの分割、統計分析、および評価指標。 |
| Seaborn | オープンソースコミュニティ | Seaborn 0.11.2 | 統計データの可視化。 |
| SegFormer-B2 | NVIDIA Research / オープンソース | SegFormer-B2 (MIT-B2 Backbone) | 文化的モチーフのセグメンテーションに使用される Transformer ベースのセマンティックセグメンテーションモデル。 |
| セグメンテーションマスク / アノテーション | Miao Batik データセット | データセットに含まれる | モチーフの分類とトレーニングに使用されるピクセルレベルのセマンティックセグメンテーションラベル。 |
| SPADE | NVIDIA Research / オープンソース | Official PyTorch Implementation (https://github.com/NVlabs/SPADE) | 芸術的なパターンの生成に使用されるセグメンテーション誘導型画像合成モデル。 |
| TorchVision | Meta AI | TorchVision 0.11.1 | PyTorch と併用される画像処理ユーティリティおよびデータセット変換。 |
| WikiArt データセット | WikiArt | https://www.wikiart.org/ | スタイル学習と合成に使用される、27 の芸術スタイルにわたる 80,000 点以上の芸術作品を含む芸術スタイルデータセット。 |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト