Исследовательская статья

Реконструкция с использованием семантической сегментации и синтез художественного стиля паттернов нематериального культурного наследия на основе системы глубокого обучения

DOI:

10.3791/71577

14 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном протоколе описывается рабочий процесс глубокого обучения для семантической сегментации, реконструкции и синтеза художественного стиля узоров нематериального культурного наследия с использованием извлечения признаков на основе трансформеров, состязательной реконструкции и пространственно-адаптивной генерации изображений для поддержки цифрового сохранения и творческого применения объектов наследия.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цифровое сохранение и реконструкция узоров нематериального культурного наследия (НКН) привлекают все больше внимания по мере развития методов синтеза изображений на основе глубокого обучения. Существующие подходы на базе SegCycle-SPADE продемонстрировали потенциал для структурной сегментации и художественной реконструкции традиционных ремесленных узоров; однако сохраняются определенные ограничения, включая недостаточное разнообразие наборов данных, недостаточный учет культурной семантики и неадекватное сохранение структурных особенностей узоров при реконструкции. Для решения этих проблем в данной работе предлагается усовершенствованный фреймворк SegCycle-SPADE для семантической сегментации и художественной реконструкции типов узоров НКН. Модель сегментации SegFormer на базе архитектуры Transformer используется для точного определения границ мотивов и областей узора. Кроме того, введен модуль слияния культурных признаков на основе перекрестного внимания (Cross-Attention Cultural Feature Fusion Module) для усиления значимых культурных мотивов и улучшения представления признаков. Трансляция и реконструкция узоров выполняются с помощью CycleGAN, а пространственно-адаптивная денормализация (SPADE) используется для синтеза художественного стиля с целью поддержания семантической согласованности между картами сегментации и генерируемыми изображениями. Для улучшения обобщающей способности модели и художественного разнообразия фреймворк обучается с использованием набора данных культурных мотивов батика народа мяо и набора данных WikiArt. Результаты экспериментов показывают, что предлагаемый фреймворк SegCycle-SPADE с механизмом внимания повышает точность сегментации и эффективность реконструкции традиционных узоров по сравнению с существующими методами реконструкции на основе генеративно-состязательных сетей (GAN). Предложенный фреймворк представляет собой масштабируемое решение для документирования культурного наследия с помощью искусственного интеллекта, реконструкции и художественного возрождения традиционных дизайнерских узоров.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Культурное наследие, которое включает как нематериальные элементы, такие как обычаи, языки и верования, так и материальные элементы, такие как произведения искусства, здания и письменные памятники, является фундаментальным проявлением человеческой истории, творчества и идентичности1. Сохранение наследия призвано дать возможность сообществам восстановить связь со своими истоками и позволяет будущим поколениям пользоваться преимуществами их коллективной культурной памяти. Оно также способствует межкультурному взаимопониманию, признанию многообразия традиций и обычаев, а также признанию различных исторических повествований. Эти культурные ценности помогают нам понять ценности, взгляды и опыт предыдущих поколений и способствуют формированию современных социальных идентичностей и культурной преемственности. Основные принципы сохранения культурного наследия проиллюстрированы на рисунке 1.

Схема фреймворка SegCycle-SPADE; включает SegFormer, CycleGAN и SPADE для реконструкции изображений.
Рисунок 1. Концептуальный обзор реконструкции узоров культурного наследия с использованием фреймворка SegCycle-SPADE. Схематическая иллюстрация предлагаемого подхода для реконструкции и улучшения узоров нематериального культурного наследия. Рабочий процесс включает сбор данных из наборов данных Miao Batik и WikiArt, предобработку изображений, семантическую сегментацию с помощью SegFormer-B2, слияние признаков с использованием модуля слияния культурных признаков с перекрестным вниманием (CAFFM), реконструкцию узоров с помощью CycleGAN, синтез художественного стиля с помощью SPADE и итоговую оценку с использованием метрик сегментации и реконструкции. Стрелки указывают направление потока данных и представлений признаков в рамках всей системы. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Коллективная память и культурное наследие человеческого общества воплощены в нематериальном культурном наследии (НКН), которое служит важным средством художественного выражения и культурной идентичности. Однако НКН сталкивается со значительными проблемами из-за воздействия глобализации и цифровизации2,3,4. Многие находящиеся под угрозой исчезновения практики НКН требуют новых подходов к сохранению и развитию в связи с сокращением числа квалифицированных мастеров и ограниченной способностью к адаптации к современным рынкам5,6. Будучи важной областью исследований НКН, устойчивый дизайн делает акцент на интегрированном развитии культуры, общества и окружающей среды, предоставляя практический путь для дальнейшего сохранения НКН. Благодаря методам устойчивого дизайна НКН может быть возрождено при одновременной адаптации к потребностям современного общества7,8.

В данном исследовании термин «паттерны нематериального культурного наследия» относится к визуальным репрезентациям мотивов, которые передают и сохраняют лежащие в их основе нематериальные культурные ценности. Соответственно, предлагаемая концепция направлена на сохранение и документирование культурной информации, связанной с этими мотивами, при одновременном восстановлении их визуальных форм.

Вышивка и батик народа мяо являются значимыми формами нематериального культурного наследия Китая, отражающими историю, верования и традиции общины мяо через такие символические мотивы, как птицы, бабочки и родовые тотемы9. Эти мотивы глубоко интегрированы в ритуальную одежду и праздничные обряды, а также способствуют местному культурному и экономическому развитию10,11. Достижения в области цифровых технологий, в частности искусственного интеллекта (ИИ) и глубокого обучения (ГО), открыли новые возможности для сохранения, анализа, реконструкции и документирования культурного наследия. Батик мяо из провинции Гуйчжоу, одна из наиболее сохранившихся традиций батика в Китае, служит важным средством передачи культурных знаний, верований, обычаев и ритуалов народа мяо12,13,14,15,16.

Недавние исследования продемонстрировали потенциал глубокого обучения (DL) для сохранения культурного наследия и реконструкции узоров, позволив достичь более высокой точности сегментации (точность по пикселям = 88,6%, средний коэффициент пересечения над объединением [IoU] = 78,1%) и качества реконструкции по сравнению с U-Net и DeepLabV3+1. Тем не менее, ряд проблем остается нерешенным. Существующие подходы на основе генеративно-состязательных сетей (GAN) часто с трудом сохраняют мелкие структурные детали в сложных узорах17, в то время как ограниченное разнообразие наборов данных ограничивает обобщающую способность моделей в различных культурных областях18. Кроме того, модели преобразования изображения в изображение, такие как CycleGAN, могут не обеспечивать семантическую согласованность между картами сегментации и сгенерированными изображениями19, а отсутствие механизмов внимания может привести к потере культурно значимых деталей мотивов в процессе реконструкции20. Таким образом, для эффективной реконструкции узоров нематериального культурного наследия (ICH) необходима усовершенствованная платформа, объединяющая сегментацию на базе трансформеров, обучение признакам с использованием механизмов внимания и обучение на нескольких наборах данных.

Цифровизация вышивки народа мяо и стремительное развитие генеративного ИИ открыли новые возможности для сохранения культурного наследия. Диффузионные модели, представляющие собой новый класс глубоких генеративных моделей, продемонстрировали выдающиеся результаты в задачах компьютерного зрения благодаря своим мощным возможностям генерации контента21,22,23,24,25. В процессе обратной диффузии модель постепенно учится реконструировать исходные входные данные из зашумленных представлений26,27,28. В предыдущих исследованиях также изучалось применение технологий трехмерной реконструкции и автоматизированного проектирования (CAD) для сохранения и распространения культурного наследия.

Несмотря на то, что сверточные нейронные сети (CNN) и GAN демонстрируют хорошие результаты в генерации изображений и сохранении признаков, они по-прежнему сталкиваются с проблемами, связанными с ограниченными рецептивными полями, коллапсом моды и нестабильностью обучения29. Архитектуры на базе трансформеров, такие как SegFormer и Segmenter, отлично справляются с захватом глобального контекста и семантических связей; однако они требуют значительных вычислительных ресурсов и могут испытывать трудности с передачей мелких деталей. Хотя диффузионные модели, такие как Stable Diffusion, демонстрируют высокие возможности генерации изображений, им часто не хватает точного контроля над структурными и художественными характеристиками создаваемых дизайнов. Кроме того, большинство существующих подходов используют стратегии независимого обучения, что ограничивает эффективный обмен информацией и совместную оптимизацию между компонентами сегментации и генерации, приводя к компромиссу между структурной точностью и художественной аутентичностью30.

Современные диффузионные модели, такие как латентная диффузия и Stable Diffusion, позволяют синтезировать изображения высокого качества, однако требуют итерационного шумоподавления, что ведет к увеличению вычислительных затрат и времени вывода. Кроме того, сохранение тонких культурных мотивов и структурной целостности остается сложной задачей без использования специализированных механизмов кондиционирования. Генеративные модели на базе трансформеров эффективно улавливают глобальные контекстуальные связи, но зачастую требуют крупномасштабных наборов данных и значительных вычислительных ресурсов. В противовес этому, предлагаемый фреймворк SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) объединяет сегментацию на базе SegFormer, слияние признаков с помощью перекрестного внимания, реконструкцию CycleGAN и синтез под управлением SPADE для обеспечения явного структурного руководства, что улучшает сохранность мотивов, семантическую согласованность и контролируемую реконструкцию узоров культурного наследия.

Большинство современных методов семантической сегментации основано на полностью сверточных нейронных сетях (FCNN) с U-образной архитектурой31. На этапе кодирования глубокие признаки с широкими рецептивными полями извлекаются с помощью серии операций свертки и понижения размерности (downsampling). Этап декодирования постепенно восстанавливает пространственное разрешение посредством повышения размерности (upsampling), что в конечном итоге позволяет осуществлять семантическое прогнозирование на уровне пикселей. Компенсируя потерю пространственной информации при понижении размерности и повышая эффективность сегментации в широком спектре приложений, перекрестные связи (skip connections) позволяют напрямую интегрировать информацию высокого разрешения с разных уровней кодировщика в декодировщик32.

Хотя современные методы на основе GAN, CNN и диффузионных моделей демонстрируют многообещающие результаты в генерации изображений и реставрации объектов культурного наследия, они часто с трудом обеспечивают семантическую согласованность, сохранение тонких структурных мотивов и воспроизводимую реконструкцию различных культурных паттернов. Большинство существующих подходов рассматривают сегментацию, реконструкцию и синтез стиля как отдельные процессы, что может привести к потере значимых культурных элементов и противоречивым результатам. Для устранения этого методологического пробела в данной работе предлагается единый фреймворк SegCycle-SPADE, объединяющий семантическую сегментацию на базе SegFormer, новый модуль слияния культурных признаков на основе перекрестного внимания (CAFFM), реконструкцию на базе CycleGAN и синтез стиля под управлением SPADE. Благодаря явной интеграции данных структурной сегментации с генеративным обучением признаков, предлагаемый фреймворк обеспечивает более надежную, семантически согласованную и воспроизводимую реконструкцию мотивов нематериального культурного наследия, сохраняя при этом как культурную аутентичность, так и художественное качество.

В данном исследовании выявлены три основных ограничения современных подходов к реконструкции культурного наследия: (i) недостаточное сохранение мелких структурных мотивов в методах реконструкции на базе GAN; (ii) ограниченная обобщающая способность, возникающая вследствие обучения на малых или узкоспециализированных наборах данных; и (iii) недостаточная семантическая согласованность между результатами сегментации и сгенерированными изображениями в архитектурах преобразования изображения в изображение (image-to-image translation). Кроме того, сегментация, реконструкция и синтез стиля обычно рассматриваются как отдельные процессы, что приводит к потере культурно значимых элементов в ходе реконструкции. Предложенный фреймворк SegCycle-SPADE, объединяющий семантическую сегментацию на базе трансформеров, слияние признаков с перекрестным вниманием (cross-attention), реконструкцию с помощью CycleGAN и художественный синтез под управлением SPADE в единой архитектуре, позволяет преодолеть эти ограничения и улучшить сохранение мотивов, семантическую согласованность и художественную аутентичность при реконструкции образцов ICH.

Основной целью данного исследования является разработка усовершенствованного фреймворка SegCycle-SPADE для художественной реконструкции паттернов нематериального культурного наследия (ICH) с использованием семантической сегментации. Фреймворк объединяет SegFormer для точной сегментации культурных мотивов, CycleGAN для реконструкции паттернов и SPADE для стилистически согласованного художественного синтеза. Для улучшения репрезентации признаков и сохранения мелких структурных деталей введен модуль CAFFM, который способствует эффективному взаимодействию между признаками сегментации и генеративными признаками. Предложенный фреймворк, обученный на наборах данных Miao Batik и WikiArt, повышает аутентичность реконструкции, стилистическую согласованность и сохранность культурно значимых мотивов.

Объединяя семантическую сегментацию, направленное вниманием слияние признаков, реконструкцию паттернов и синтез стиля в рамках единой архитектуры, в данном исследовании представлена новая платформа SegCycle-SPADE для художественной реконструкции паттернов нематериального культурного наследия. Основной вклад данной работы заключается в следующем. Во-первых, за счет интеграции SegFormer разработана новая платформа реконструкции под руководством семантической сегментации, обеспечивающая точное извлечение и сохранение сложных культурных мотивов и структурных элементов. Во-вторых, представлен новый модуль CAFFM для эффективного слияния признаков сегментации с генеративными представлениями, что позволяет модели улавливать дальние связи между культурными мотивами и паттернами художественного стиля. В-третьих, предложенный CAFFM улучшает сохранность культурно значимых элементов, одновременно повышая визуальный реализм и структурную целостность реконструированных паттернов наследия. В-четвертых, благодаря интеграции CycleGAN для реконструкции культурных паттернов и SPADE для художественного синтеза под руководством сегментации, платформа обеспечивает как семантическую точность, так и стилистическую аутентичность генерируемых результатов. В-пятых, для улучшения обобщающей способности и художественного разнообразия модель обучалась с использованием набора данных культурных мотивов батика народа мяо для изучения культурных паттернов и набора данных WikiArt для представления художественного стиля. WikiArt служит вспомогательным набором данных для оценки способности платформы к обобщению, робастности обучения признакам и эффективности управления стилем в различных визуальных контекстах, а не в качестве целевого стиля для прямого применения в продуктах культурного наследия мяо. Наконец, по сравнению с существующими методами реконструкции культурного наследия на основе GAN, результаты экспериментов демонстрируют, что предложенная платформа SegCycle-SPADE обеспечивает более высокую точность сегментации, качество реконструкции и стилистическую согласованность.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложенная структура SegCycle-SPADE предназначена для реконструкции и улучшения традиционных узоров культурного наследия посредством семантической сегментации, усиления признаков с помощью механизмов внимания, генеративной реконструкции и синтеза художественного стиля. В данном исследовании использовались общедоступные наборы данных изображений культурного наследия и произведений искусства, включая датасет Miao Batik и датасет WikiArt. В исследовании не принимали участия люди, не использовались данные пациентов, личная информация, подопытные животные или клинические записи; следовательно, одобрение институционального комитета по этике и информированное согласие не требовались. Для начала для оценки используются датасет культурных мотивов Miao Batik и датасет WikiArt. Датасет Miao Batik был описан в работе Quan et al. (2024)32 и содержит 15 148 аннотированных изображений традиционных мотивов батика народа мяо. Существующие аннотации, предоставленные создателями датасета, использовались напрямую, и в данном исследовании дополнительные ручные аннотации не создавались. Затем выполняется предварительная обработка изображений путем изменения размера, нормализации, шумоподавления и создания маски сегментации. Точные параметры предварительной обработки описаны в подразделе «Предварительная обработка данных». Предложенная структура использует модель на основе трансформера под названием SegFormer-B2 для семантической сегментации данных. Метод предназначен для обнаружения ключевых областей культурных мотивов и изучения их структур. Затем сегментированные признаки усиливаются с помощью механизма внимания, при котором важная информация, относящаяся к культурным мотивам, выделяется, а нерелевантная информация отсекается. Конфигурация механизма внимания описана в подразделе CAFFM. Затем усиленные признаки передаются через CycleGAN, где поврежденные структуры реконструируются посредством циклического обучения. В процессе обучения образцы неполных мотивов создавались искусственно путем применения операций случайного маскирования и частичного перекрытия к исходным изображениям батика Miao. Эти процедуры деградации имитировали недостающие области мотивов и структурные повреждения, часто наблюдаемые в разрушенных артефактах культурного наследия. Полученные неполные изображения использовались в качестве входных данных для модуля реконструкции CycleGAN, в то время как соответствующие оригинальные изображения служили целями реконструкции. Реконструированные узоры культурного наследия затем улучшаются с помощью SPADE, где художественное усиление выполняется на основе сгенерированных карт сегментации. Эффективность предложенной структуры оценивается с использованием количественных метрик сегментации и качества изображений, в то время как визуальная аутентичность реконструированных культурных мотивов оценивается качественно. Визуальная аутентичность оценивалась путем визуального осмотра сгенерированных культурных узоров и не использовалась в качестве независимой количественной метрики. Оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных характеристиках, структурной целостности и художественном облике по сравнению с соответствующими эталонными культурными мотивами. Количественная оценка производительности модели выполнялась с использованием показателей Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) и Fréchet Inception Distance (FID). На Рисунке 2 представлена общая схема рабочего процесса предложенной структуры SegCycle-SPADE и приведены метрики оценки, использованные в данном исследовании.

Схема обработки набора данных с использованием SegFormer, CycleGAN для генерации художественного стиля; включены метрики оценки.
Рисунок 2. Общая схема архитектуры предлагаемого фреймворка SegCycle-SPADE. Обзор полного рабочего процесса SegCycle-SPADE. Изображения из наборов данных Miao Batik и WikiArt проходят предварительную обработку, после чего подвергаются семантической сегментации с помощью SegFormer-B2, усилению признаков с использованием CAFFM, реконструкции паттернов с помощью CycleGAN и генерации художественного стиля с использованием SPADE. Эффективность модели оценивается с помощью показателей Segmentation Accuracy, Intersection over Union (IoU), коэффициента Дайса (Dice Coefficient), индекса структурного сходства (SSIM), PSNR, расстояния Фреше (FID), в то время как визуальная аутентичность оценивается качественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Фреймворк SegCycle-SPADE для реконструкции паттернов культурного наследия разработан для интеграции нескольких компонентов глубокого обучения (DL) с целью точного сегментирования, реконструкции и художественного улучшения мотивов, как показано на Рисунке 2. Для обеспечения разнообразия культурных паттернов и художественных стилей используются изображения из набора данных культурных мотивов Miao Batik и набора данных WikiArt. Сначала изображения обрабатываются модулем семантической сегментации на базе SegFormer для идентификации и выделения культурных мотивов из фона. Общая архитектура состоит из четырех основных этапов. Во-первых, модель SegFormer извлекает карты семантической сегментации из изображений культурных паттернов. Во-вторых, CAFFM объединяет признаки сегментации с генеративными представлениями для улучшения обучения признаков. В-третьих, модуль CycleGAN реконструирует культурные паттерны, используя объединенные представления признаков. Наконец, модуль SPADE генерирует художественно улучшенные результаты, сохраняя структурную целостность за счет синтеза под управлением сегментации. Очищенные карты признаков затем обрабатываются модулем реконструкции CycleGAN, который обучается восстанавливать неполные культурные мотивы путем сопоставления деградировавших паттернов с их соответствующими полными формами. Образцы неполных мотивов были созданы путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik, имитируя тем самым области утраченных паттернов и структурную деградацию, часто наблюдаемую в поврежденных культурных артефактах. Каждое деградировавшее изображение было сопоставлено с соответствующим оригинальным изображением, которое служило целью реконструкции при обучении. Эта стратегия позволила модулю CycleGAN изучить восстановление отсутствующих структур мотивов при сохранении семантической согласованности и значимых культурных характеристик. Наконец, генератор SPADE создает визуально улучшенные художественные результаты, обуславливая синтез изображений сгенерированными картами сегментации, тем самым поддерживая структурную целостность культурных мотивов на протяжении всего процесса художественного улучшения.

Предлагаемая платформа SegCycle-SPADE включает следующие этапы.

Шаг 1: Сбор наборов данных
Для достижения целей изучения культурных паттернов и генерации художественного стиля были использованы два набора данных. Набор данных культурных мотивов мяо-батика (Miao Batik Cultural Motif Dataset) использовался для предоставления информации о традиционных культурных паттернах. Этот набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658) и содержит 15 148 аннотированных изображений традиционных мотивов мяо-батика. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Набор данных WikiArt использовался для предоставления разнообразной информации о художественных стилях для генерации художественного стиля и был получен из общедоступного репозитория WikiArt (https://www.wikiart.org/).

Этап 2: Предобработка данных
Все изображения прошли предварительную обработку, включающую изменение размера, нормализацию и шумоподавление. Для поддержки этапа семантической сегментации использовались имеющиеся аннотации культурных мотивов, полученные из исходных наборов данных. В рамках данного исследования дополнительные процедуры аннотирования или перемаркировки не проводились.

Шаг 3: Семантическая сегментация паттернов с помощью SegFormer
Для сегментации культурных мотивов использовалась модель SegFormer. Точная архитектура базовой сети (backbone) SegFormer и стратегия инициализации описаны в подразделе Semantic Pattern Segmentation Using SegFormer. В частности, для семантической сегментации мотивов применялась архитектура SegFormer-B2 с базовой сетью MIT-B2, предварительно обученной на наборе данных ImageNet. Эта модель эффективно улавливает глобальную контекстную информацию, сохраняя при этом сложные структурные детали традиционных культурных паттернов.

Шаг 4: CAFFM
CAFFM объединяет признаки семантической сегментации с генеративными представлениями, что позволяет системе изучать как характеристики структурных мотивов, так и информацию о художественном стиле. Подробности интеграции CAFFM приведены в подразделе CAFFM. Модуль расположен между этапом семантической сегментации на базе SegFormer и этапом генеративной реконструкции; в нем происходит слияние структурных признаков, полученных в результате сегментации, с признаками реконструкции посредством многоголового перекрестного внимания (multi-head cross-attention). Этот процесс улучшает сохранность культурных мотивов и повышает реалистичность реконструированных результатов.

Шаг 5: Реконструкция паттерна (CycleGAN)
Объединенные признаки затем обрабатываются модулем CycleGAN для реконструкции структур культурных паттернов. Архитектура CycleGAN и конфигурация обучения описаны в подразделе Реконструкция паттерна с помощью CycleGAN. Модуль реконструкции состоит из двух генераторов и двух дискриминаторов, использует архитектуру генератора на базе остаточной сети с девятью остаточными блоками, применяет дискриминатор PatchGAN и обучается с использованием функций потерь состязательности и циклической согласованности. Такая конфигурация обеспечивает двунаправленное отображение доменов и облегчает реконструкцию неполных структур культурных паттернов.

Шаг 6: Генерация художественного стиля (SPADE)
Затем реконструированные паттерны обрабатываются модулем SPADE для выполнения синтеза художественного стиля с направлением по сегментации. Конфигурация генератора SPADE описана в подразделе Генерация художественного стиля с использованием SPADE. Модуль использует остаточные блоки SPADE, слои пространственно-адаптивной нормализации и семантическое кондиционирование, полученное из карт сегментации SegFormer и признаковых представлений CAFFM. Благодаря кондиционированию генерации изображений по картам сегментации, синтезированные результаты сохраняют структурное соответствие оригинальным культурным мотивам, при этом приобретая характеристики художественного стиля.

Шаг 7: Оценка эффективности
Предложенная структура была оценена с использованием нескольких метрик сегментации и анализа качества изображений, включая точность сегментации, IoU, коэффициент сходства Dice (Dice), SSIM, PSNR и FID. Для оценки воспроизводимости экспериментов все опыты повторяли пять раз с использованием различных случайных чисел (seeds), результаты представлены как среднее значение ± стандартное отклонение. Статистическая значимость оценивалась с помощью парных t-критериев с порогом значимости p < 0,05.

Сбор наборов данных
В предлагаемой структуре SegCycle-SPADE для понимания культурных паттернов и изучения стиля используются два набора данных. Первый набор данных, применяемый в предлагаемой структуре, — это набор культурных мотивов батика народа мяо. Этот набор содержит культурные мотивы батика мяо, которые обычно представляют собой изображения традиционного батика мяо с такими мотивами, как животные, растения и геометрические фигуры, используемые в искусстве этнической группы мяо. Данный набор содержит изображения с богатой текстурной информацией, что обычно имеет важное значение для сохранения культурного наследия. Второй набор данных, используемый в предлагаемой структуре SegCycle-SPADE, — это набор данных WikiArt. Этот набор содержит огромное количество произведений искусства, относящихся к различным стилям. Он применяется для изучения сложных стилей, что обычно полезно для улучшения художественных произведений. Данный набор включает 80 000 произведений искусства в высоком разрешении (HD) с 27 различными вариантами дизайна, что делает его более эффективным для задач генерации или трансформации стиля на основе глубокого обучения (DL).

Набор данных Miao Batik:
Набор данных Miao Batik (https://doi.org/10.5281/zenodo.20807658) состоит из 15 148 изображений узоров батика, изображающих культурно значимые мотивы. Изображения включают разнообразные традиционные орнаменты, такие как анималистические мотивы (например, бабочки и рыбы), растительные узоры и геометрические мотивы, несущие культурный символизм. Данный набор данных является важным компонентом предлагаемой структуры, поскольку он предоставляет аутентичные культурные структуры, которые позволяют модулю сегментации точно определять и сохранять границы мотивов при реконструкции узора (Таблица 1). В данном исследовании под культурно значимыми мотивами понимаются символические визуальные элементы, обычно документируемые в литературе по культурному наследию народа мяо и представленные в аннотациях набора данных, включая птиц, бабочек, цветочные узоры и родовые тотемы. Эти мотивы были выбраны на основе их задокументированной культурной значимости и регулярного присутствия в традиционных дизайнах батика и вышивки мяо, а не только на основе частоты их появления или пространственной композиции. Аннотации мотивов и метки сегментации, выполненные под руководством экспертов, были взяты из первоначального источника набора данных Miao Batik и использовались в данном исследовании напрямую. Авторами не проводилось никаких дополнительных процедур ручного аннотирования, перемаркировки или аннотирования под руководством экспертов. Существующие аннотации, предоставленные создателями набора данных, использовались для обучения и оценки семантической сегментации.

ПараметрОписание
Название набора данныхНабор данных культурных узоров батика народа мяо
Источник данныхРепозиторий Zenodo (DOI: 10.5281/zenodo.20807658)
Область примененияНематериальное культурное наследие (НКН) / Анализ текстильных узоров
Общее количество изображений15 148 изображений
Тип изображенияЦифровые изображения традиционных текстильных узоров батика народа мяо
Категории паттерновЗооморфные мотивы, растительные мотивы и геометрические мотивы
Культурное происхождениеКультура этнической группы мяо, провинция Гуйчжоу, Китай
Исходное разрешение изображенияИзображения высокого разрешения (как правило, ≥ 1000 пикселей по короткой стороне), полученные в виде необработанных сканов или фотографий до этапа предварительной обработки
Обучающее разрешениеИзображения были изменены до размера 256 × 256 пикселей в процессе предварительной обработки
Доступность аннотацийСуществующие аннотации сегментации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки. В данном исследовании не проводилось дополнительное ручное аннотирование, перемаркировка или процедуры экспертного подтверждения.
Применение в данном исследованииСегментация культурных мотивов, извлечение признаков, сохранение мотивов и реконструкция паттернов

Таблица 1: Характеристики набора данных культурных узоров батика народа мяо.Сводка набора данных культурных мотивов батика мяо, используемого для семантической сегментации, анализа культурных узоров и реконструкции мотивов. В таблице описаны источник набора данных, характеристики изображений, категории мотивов, культурное происхождение, разрешение изображений и роль набора данных в предлагаемой структуре SegCycle-SPADE.

Набор данных WikiArt:
Набор данных WikiArt [https://www.wikiart.org/] представляет собой популярный крупномасштабный цифровой репозиторий произведений искусства, содержащий более 80 000 изображений, относящихся к 27 различным художественным стилям, указанным в Таблице 2. Эти стили включают в себя искусство Ренессанса, импрессионизм, кубизм и сюрреализм. Данный набор данных имеет важное значение в предлагаемой архитектуре, поскольку он предоставляет знания, позволяющие модулю SPADE создавать культурно обогащенные паттерны, сохраняя при этом структурную информацию, полученную в процессе сегментации. Набор данных включает 56 000 изображений для обучения и 12 000 изображений для валидации и тестирования. Изображения из этого набора данных способствуют эффективному обучению модели DL.

ПараметрОписание
Название набора данныхНабор данных WikiArt
Источник набора данныхРепозиторий WikiArt (https://www.wikiart.org/)
Область примененияЦифровое искусство и живопись
Общее количество изображенийПриблизительно 80 000 произведений искусства
Обучающие изображения56,000
Изображения для валидации12,000
Тестовые изображения12,000
Художественные стили27 художественных стилей, включая Ренессанс, импрессионизм, кубизм, сюрреализм, экспрессионизм, реализм и абстрактное искусство
Исходное разрешение изображенияРазрешение исходных изображений варьируется в зависимости от произведений искусства и источников. В ходе предварительной обработки изображения были приведены к единому разрешению 256 × 256 пикселей.
Разрешение обученияИзображения были изменены до размера 256 × 256 пикселей в ходе предварительной обработки перед обучением художественному стилю и синтезом изображений под контролем сегментации.
Разбиение набора данныхСтратифицированное случайное разделение (70% — обучающая выборка, 15% — валидационная и 15% — тестовая) с использованием фиксированного случайного числа (seed) 42
Стратегия выборки стилейДля сохранения распределения 27 художественных стилей в обучающей, валидационной и тестовой подвыборках использовался метод стратифицированного пропорционального отбора.
Применение в данной работеОбучение художественному стилю, репрезентация стиля и сегментационный синтез в художественном стиле

Таблица 2: Характеристики набора данных WikiArt. Сводные данные о наборе данных WikiArt, используемом для обучения художественному стилю и синтеза изображений с заданным стилем. В таблице описаны источник набора данных, распределение изображений, охват художественных стилей, разделение набора данных, разрешение изображений и его применение в рамках предлагаемой структуры SegCycle-SPADE.

Набор данных Miao Batik содержит 15 148 изображений, представляющих традиционные культурные мотивы народа мяо.32 Набор данных находится в открытом доступе через Zenodo (https://doi.org/10.5281/zenodo.20807658). Перед обучением модели все изображения были визуально проверены, изменены по размеру до 256 × 256 пикселей, нормализованы и проверены на наличие поврежденных или дублирующих образцов. Скрининг контроля качества не привел к исключению каких-либо изображений; следовательно, все 15 148 изображений были сохранены для последующего анализа. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) подмножества с использованием фиксированного случайного значения seed 42 для обеспечения воспроизводимости разделения данных. Доступ к набору данных WikiArt был получен через официальный репозиторий WikiArt (https://www.wikiart.org/), который содержит более 80 000 произведений искусства, охватывающих 27 художественных стилей. Для экспериментов по изучению стиля было использовано 56 000 изображений для обучения, 12 000 для валидации и 12 000 для тестирования.

Предобработка данных
Перед обучением предлагаемой структуры SegCycle-SPADE набор данных культурных мотивов мяо-батика и набор данных WikiArt прошли несколько этапов предобработки для обеспечения однообразного качества изображений и точного представления признаков. К обоим наборам данных был применен один и тот же базовый конвейер предобработки, включающий гауссово шумоподавление, нормализацию, изменение размера до единого входного разрешения и проверку качества изображений. Тем не менее, наборы данных выполняли разные функции в рамках структуры. Набор данных WikiArt использовался для изучения и синтеза художественного стиля, в то время как набор данных мяо-батика применялся преимущественно для сегментации и реконструкции культурных мотивов. Помимо этих специфических задач, никаких изменений в предобработке конкретных наборов данных не вносилось. Для обеспечения согласованной обработки моделью DL изображения сначала были приведены к фиксированному разрешению. Этот шаг был необходим, поскольку изображения в обоих наборах данных имели разное разрешение в зависимости от источника. Изменение размера повысило вычислительную эффективность и предотвратило влияние размерных несоответствий на обучение. Вторым этапом предобработки была нормализация, при которой значения пикселей были масштабированы до стандартного диапазона для стабилизации обновлений градиента во время обучения. Затем изображения были обработаны с помощью гауссовой фильтрации для снижения уровня шума, который мог помешать определению структур культурных мотивов. Для набора данных мяо-батика существующие маски сегментации культурных мотивов, полученные непосредственно из первоначального источника данных, использовались без изменений для обучения и оценки семантической сегментации. Новые маски сегментации специально для данного исследования не создавались.

Если не указано иное, уравнения, описывающие общепринятые методы, были адаптированы из предыдущих исследований и процитированы соответствующим образом. Уравнения, описывающие предлагаемый метод CAFFM и комплексную структуру оптимизации SegCycle-SPADE, были разработаны авторами специально для данной работы.

Пусть входное изображение из набора данных будет представлено как Уравнение 1:

Представление векторного пространства, I ∈ ℝⁿˣʷˣᶜ, иллюстрация формулы, образовательная математическая концепция.  (1)

Здесь H, W и C обозначают высоту, ширину изображения и количество цветовых каналов соответственно. Все изображения приводятся к фиксированному размеру H′ × W′, как показано в Уравнении 2:

Формула обработки изображений, уравнение Ir = Resize(I,H'×W'), относящееся к методам изменения размера.

Здесь Ir — изображение измененного размера. Нормализованные значения пикселей вычисляются в соответствии с Уравнением 3:

Математическая формула для нормализованной интенсивности, уравнение: In = Ir/255, используемая при анализе данных.   (3)

Это способствует стабилизации процедуры обучения. Фильтрация шума выполняется с помощью фильтра Гаусса, как показано в Уравнении 4:

Уравнение статического равновесия Is=In*G(σ), символ, математический анализ, исследовательский анализ.

Здесь G(σ) — это фильтр Гаусса, а * обозначает операцию свертки. Был использован гауссов фильтр с ядром 5 × 5 и стандартным отклонением σ = 1.0. Для уменьшения краевых артефактов к граничным пикселям применялось зеркальное дополнение. Процесс шумоподавления выполнялся сразу после загрузки изображений, перед масштабированием и нормализацией. Для обеспечения единообразности предобработки на протяжении всего исследования одна и та же конфигурация фильтра применялась к каждому изображению в наборах данных Miao Batik и WikiArt. Для набора данных Miao Batik маски сегментации создаются в соответствии с Уравнением 5:

Математическая формула для идентификации области мотива, демонстрирующая критерии классификации пикселей.

Здесь M — маска сегментации, используемая для управления моделью SegFormer.

Конвейер предварительной обработки начинается со сбора изображений из наборов данных Miao Batik и WikiArt, как показано на Рисунке 3. В процессе обучения методы аугментации данных не применялись. После предварительной обработки, которая включала изменение размера, нормализацию, гауссово шумоподавление и подготовку масок сегментации, изображения были непосредственно использованы для обучения, валидации и тестирования предлагаемой архитектуры SegCycle-SPADE. Первый этап конвейера предварительной обработки включает изменение размера изображений до фиксированного значения, что позволяет модели глубокого обучения обрабатывать изображения более эффективно. Второй этап включает нормализацию, которая приводит значения пикселей к стандартизированному числовому диапазону и способствует сходимости модели. Третий этап включает удаление шума, при котором из изображений удаляются нежелательные помехи для улучшения распознавания образов. Кроме того, для набора данных Miao Batik аннотируются области культурных мотивов, что позволяет создавать маски, используемые в модуле сегментации предлагаемой модели для обеспечения сохранности культурных мотивов в процессе генерации. Конечным результатом этого этапа является очищенный набор данных, готовый для обучения модулей сегментации и генерации предлагаемой модели.

Схема обработки набора данных; этапы включают изменение размера, нормализацию, удаление шума и аннотирование мотивов.
Рисунок 3. Конвейер предварительной обработки данных для изображений культурного наследия. Схема рабочего процесса, иллюстрирующая процедуры предварительной обработки изображений, применяемые перед обучением модели. Конвейер включает сбор набора данных, изменение размера изображений, нормализацию, гауссово шумоподавление, аннотирование существующих культурных мотивов и подготовку масок сегментации. Полученные обработанные изображения и маски используются в качестве входных данных для семантической сегментации и реконструкции паттернов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Перед обучением модели каждое изображение прошло процедуру контроля качества. Набор данных Miao Batik содержал 15 148 изображений. Поврежденные, дублированные и низкокачественные образцы были удалены создателями исходного набора данных; следовательно, в ходе данного исследования при проверке качества дополнительные изображения не исключались. В результате для анализа были сохранены все 15 148 изображений. В процессе предобработки изображения загружались в формате RGB и масштабировались до размера 256 × 256 пикселей с использованием билинейной интерполяции. Значения пикселей были масштабированы из диапазона [0, 255] в диапазон [0, 1] путем деления на 255. Затем была выполнена поканальная нормализация с использованием средних значений [0.485, 0.456, 0.406] и значений стандартного отклонения [0.229, 0.224, 0.225] для красного, зеленого и синего каналов соответственно. Конвейер предобработки включал загрузку изображений, преобразование в RGB, изменение размера, масштабирование значений пикселей, нормализацию и преобразование в тензоры. При необходимости полутоновые изображения преобразовывались в трехканальный формат RGB для обеспечения совместимости с моделями DL. После предобработки изображения были разделены на обучающую, валидационную и тестовую выборки. На всех этапах архитектуры SegCycle-SPADE, включая семантическую сегментацию, слияние признаков, реконструкцию мотивов и художеческий синтез на основе SPADE, использовалось единое входное разрешение 256 × 256 пикселей.

Семантическая сегментация паттернов с помощью SegFormer
После этого этапа предобработки очищенные и нормализованные изображения из набора данных культурных мотивов Мяо Батик (Miao Batik) и набора данных WikiArt подаются в модуль семантической сегментации, основанный на предложенной архитектуре SegFormer-B2. Целью данного этапа является правильная идентификация и разделение культурных мотивов, присутствующих в традиционных паттернах. Предложенная архитектура SegFormer основана на трансформерной архитектуре, которая включает иерархический кодировщик Transformer и легковесный декодер MLP для точного захвата как глобальной контекстной информации, так и детальной структурной информации из сложных традиционных паттернов. Сначала модель извлекает признаки различных масштабов из входного изображения, после чего эти представления объединяются с помощью декодера для генерации точных сегментированных паттернов. Это гарантирует, что элементы на традиционном изображении будут правильно сегментированы на такие мотивы, как геометрические, растительные и символические узоры, отделяя их от фона при сохранении структурной целостности. Эта структурная информация впоследствии используется на более поздних этапах генерации паттернов в рамках архитектуры SegCycle-SPADE.

Пусть предварительно обработанное входное изображение будет представлено в виде Уравнения 6:

Уравнение, иллюстрирующее пространство изображений из вещественнозначных размерностей; формула: I_p ∈ ℝ^(H×W×C) (6)

Энкодер SegFormer разделяет изображение на патчи и извлекает иерархические признаки с помощью трансформерных слоев, как показано в Формуле 71:

Уравнение, демонстрирующее процесс кодирования признаков; формула: F = Encoder(Ip).

Здесь F обозначает многомасштабные карты признаков, полученные с помощью трансформерного энкодера. Эти признаки кодируют как локальные текстурные паттерны, так и глобальные контекстуальные связи между областями мотивов. Модель SegFormer извлекает карты признаков в разных масштабах, как определено в Уравнении 8:

Формула векторной записи F={F1,F2,F3,F4}, используемая при анализе статического равновесия, математическая запись.

Использование многомасштабных представлений облегчает обнаружение паттернов различных размеров в культурных мотивах. Наконец, признаки объединяются с помощью декодера MLP, как показано в Уравнении 91:
 Уравнение: S=Decoder(F₁,F₂,F₃,F₄); математическая формула, функция декодера.

Здесь S обозначает итоговую прогнозируемую карту сегментации.

Основная сеть SegFormer-B2 была инициализирована с использованием весов, предобученных на ImageNet, и в дальнейшем дообучена на наборе данных Miao Batik для сегментации культурных мотивов. Предобученная контрольная точка была получена из официальной реализации SegFormer. В частности, для инициализации основной сети SegFormer-B2 перед дообучением использовалась контрольная точка MIT-B2 (mit_b2.pth), предобученная на ImageNet-1K и предоставленная официальным репозиторием SegFormer. Предобученные веса соответствуют основной сети MIT-B2, опубликованной авторами SegFormer, и служили моделью инициализации для обучения семантической сегментации. Остальные специфические для данной задачи слои были инициализированы с использованием стандартных процедур инициализации весов PyTorch перед началом обучения.

В архитектуре используется четырехэтапный иерархический кодировщик Transformer с перекрывающимися эмбеддингами патчей. На начальном этапе размер патча был установлен на 7 × 7 с шагом 4. Для каждого из четырех этапов кодировщика размерности эмбеддингов составляли 64, 128, 320 и 512. На этих четырех этапах использовалось 1, 2, 5 и 8 голов многоголового самовнимания (multihead self-attention), а соответствующая глубина кодировщика составляла 3, 4, 6 и 3 слоя. Многомасштабные признаки, полученные от кодировщика, агрегировались с помощью легковесного декодера на базе MLP. Перед созданием итоговой карты сегментации декодер проецировал признаки с каждого этапа кодировщика в единое пространство эмбеддингов. Во всех блоках Transformer использовалась функция активации Gaussian Error Linear Unit (GELU). Для улучшения обобщающей способности и снижения переобучения в процессе обучения использовался коэффициент дропаута 0.1.

На этапе обучения фреймворк SegFormer получает предварительно обработанные изображения из обоих наборов данных. Изображения из набора данных Miao Batik содержат области мотивов, которые служат метками для контролируемого обучения модели сегментации. Трансформерный энкодер обрабатывает все изображение и фиксирует дальние зависимости между компонентами изображения, что особенно важно для традиционных узоров батика, содержащих пространственно распределенные мотивы. Механизм иерархического извлечения признаков одновременно улавливает локальные структуры, такие как повторяющиеся геометрические текстуры. MLP-декодер обрабатывает эти извлеченные признаки и создает маску сегментации, выделяющую области мотивов. Карты сегментации, созданные на этом этапе, впоследствии используются в качестве структурных входных данных для модуля внимания и этапа реконструкции узора, что способствует сохранению аутентичности генерируемых паттернов.

Культурные мотивы были разделены на разные классы для семантической сегментации в соответствии с их визуальными и культурными характеристиками. Таксономия сегментации включала анималистические мотивы (например, бабочек, рыб, птиц и другую символическую фауну), растительные мотивы (например, цветы, листья, лозы и ботанические узоры), геометрические мотивы (например, повторяющиеся фигуры, бордюры и абстрактные геометрические структуры), а также фоновые области, представляющие зоны без мотивов. Для присвоения каждому пикселю одного из предопределенных классов использовались маски сегментации на уровне пикселей. Целочисленные метки были закодированы следующим образом: Метка 0 = фон, Метка 1 = анималистические мотивы, Метка 2 = растительные мотивы и Метка 3 = геометрические мотивы. Аннотации сегментации и метки мотивов были получены непосредственно из исходного набора данных Miao Batik. В данном исследовании не проводилось дополнительной ручной разметки, переименования меток, проверки границ или процедур экспертного подтверждения. Существующие аннотации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки.

Модель SegFormer для сегментации культурных мотивов обрабатывает предварительно подготовленные изображения из набора данных Miao Batik и набора данных WikiArt, используя механизм на основе трансформера для точного обнаружения областей с культурными узорами, как показано на рисунке 4. Сначала в модель SegFormer подается входное изображение, содержащее традиционные культурные мотивы. Энкодер Transformer извлекает как глобальную контекстную информацию, так и локальные структурные признаки из патчей изображения. Полученные многомасштабные признаки передаются в декодер сегментации, который использует смешанную сеть прямого распространения (Mix Feed-Forward Network) для уточнения представлений признаков и улучшения обнаружения мотивов. Результатом работы модели SegFormer является маска сегментации, которая выделяет пиксели, соответствующие культурным узорам, подавляя при этом нерелевантную информацию фона. Изолированные культурные узоры затем служат структурным руководством для последующих этапов фреймворка SegCycle-SPADE.

Диаграмма SegFormer; сегментация изображений с помощью кодировщиков Transformer, извлечение признаков, маска сегментации.
Рисунок 4. Семантическая сегментация культурных мотивов на базе SegFormer-B2. Архитектура модуля семантической сегментации SegFormer-B2, используемого для извлечения культурных мотивов и обученного исключительно на наборе данных Miao Batik. Структура состоит из кодировщика на базе Transformer для многомасштабного извлечения признаков и легковесного декодера сегментации для генерации масок мотивов. Модель предсказывает четыре семантических класса — животное, растение, геометрический объект и фон, при этом полученные маски сегментации определяют культурно значимые области мотивов, подавляя иррелевантную информацию фона. Результаты сегментации служат структурным руководством для последующих этапов слияния признаков, реконструкции и художественного синтеза в рамках предлагаемой архитектуры SegCycle-SPADE. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

В предлагаемом подходе нет необходимости создавать новые аннотации сегментации. Набор данных Miao Batik был получен из уже существующего открытого источника, а модель была обучена с использованием соответствующей информации о мотивах, предоставленной создателями набора данных. В процессе обучения модель SegFormer генерировала карты семантической сегментации. В результате в данном исследовании не потребовалось никакого дополнительного программного обеспечения для ручной аннотации, руководств по разметке или процедур контроля качества аннотирования.

CAFFM
Для улучшения взаимодействия между признаками семантической сегментации и представлениями генеративной реконструкции в исследовании также был предложен модуль CAFFM. Энкодер SegFormer-B2 передает семантические карты признаков в модуль CAFFM, в то время как этап реконструкции CycleGAN предоставляет генеративные карты признаков. Сначала слои линейного проецирования используются для отображения обоих потоков признаков в общее пространство эмбеддингов. Для вычисления перекрестного внимания (cross-attention) на основе сгенерированных тензоров признаков создаются представления запроса (Q), ключа (K) и значения (V). Затем с помощью многоголового перекрестного внимания моделируются взаимосвязи между информацией о структурных мотивах и элементами художественного стиля. К объединенным представлениям признаков затем применяются нормализация слоя, остаточные связи и полносвязные слои с функцией активации GELU. Этап синтеза на базе SPADE получает выходные данные модуля CAFFM, что позволяет сохранить культурно значимые темы без ущерба для художественной целостности.

Для обеспечения совместимости признаков входные признаки сначала проецируются с помощью слоев линейной проекции в общее пространство эмбеддингов с размерностью эмбеддинга 256. Затем взаимосвязи между семантической структурной информацией и представлениями генеративного стиля моделируются с использованием механизма многоголового перекрестного внимания (MultiHead Cross-Attention) с восемью головами внимания. Вычисление перекрестного внимания осуществляется с использованием векторов запроса (Query, Q), ключа (Key, K) и значения (Value, V), которые создаются специальными слоями линейного преобразования. Для повышения стабильности обучения и сохранения целостности признаков используются остаточные связи (residual connections) и послойная нормализация (Layer Normalization) для дальнейшего улучшения объединенного представления признаков. Затем нелинейное обучение признаков совершенствуется путем применения сети прямого распространения с функцией активации GELU (Gaussian Error Linear Unit). Модуль генерирует выходное представление признаков размерностью 256, которое передается на другие этапы для творческого синтеза. CAFFM успешно объединяет данные о художественном стиле со структурами культурных мотивов с помощью метода слияния на основе перекрестного внимания, что улучшает сохранность мотивов и визуальную связность в реконструированных узорах культурного наследия.

В предлагаемой системе структурные признаки извлекаются из набора данных Miao Batik, в то время как стилистические признаки изучаются на основе набора данных WikiArt. Пусть карта признаков, полученная с помощью сети сегментации SegFormer с использованием изображений из набора данных Miao Batik, обозначается как Fs, а карта признаков, полученная из ветви извлечения стилистических признаков с использованием изображений WikiArt, обозначается как Fa. Предлагаемый модуль CAFFM объединяет два домена признаков с помощью механизма перекрестного внимания (cross-attention) для изучения как структурных, так и стилистических зависимостей культурных узоров. В таблице 3 приведены все архитектурные характеристики, включая размерности эмбеддингов, слои нормализации, функции активации и конфигурацию голов внимания. При размере входного изображения 256 × 256 пикселей кодировщик SegFormer-B2 создавал семантические карты признаков размером 64 × 64 × 128, в то время как ветвь извлечения стилистических признаков создавала карты признаков размером 64 × 64 × 128. Обе карты признаков проецировались через обучаемые линейные слои в общее пространство эмбеддингов размерности 256 перед слиянием с помощью перекрестного внимания.

ПараметрКонфигурация
Предлагаемая концепцияSegCycle-SPADE
Модель семантической сегментацииSegFormer-B2
Этапы кодировщика SegFormer4
Инициализация весовПредобученная на ImageNet-1K модель SegFormer-B2 (с базовой сетью MIT-B2)
Источник контрольной точкиОфициальный репозиторий NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); контрольная точка: segformer.b2.512x512.ade.160k
Стратегия тонкой настройкиСквозная тонкая настройка на наборе данных Miao Batik
Размер встраивания патча7 × 7
Шаг патча4
Размерности эмбеддингов64, 128, 320 и 512
Глубина энкодера3, 4, 6 и 3
Механизмы внимания (Attention Heads)1, 2, 5 и 8
Тип декодераДекодер на базе исключительно MLP
Функция активацииGELU (Gaussian Error Linear Unit — Гауссова линейная единица с ошибкой)
Доля выбывших0.1
Модуль улучшения признаковМодуль слияния культурных признаков на основе перекрестного внимания (CAFFM)
Размерность вложения CAFFM256
Механизмы внимания CAFFM8
Шкалы слияния CAFFM4
Модель реконструкцииCycleGAN
Модель генерации стиляSPADE
Культурный набор данныхНабор данных Miao Batik
Набор данных о стилеНабор данных WikiArt
Изображения батика народа мяо15,148
Изображения WikiArtПриблизительно 80 000
Разрешение входного изображения256 × 256 пикселей
Формат цветаRGB
Метод интерполяцииБилинейная интерполяция
Метод шумоподавленияГауссова фильтрация
Размер ядра Гаусса5 × 5
Сигма (σ) распределения Гаусса1
Диапазон нормализации[0, 1]
Размер партии16
Количество эпох100
ОптимизаторАдам
Скорость обучения0.0002
Параметры Adamβ₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, weight decay = 0
Функции потерьПотери сегментации, адверсарные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля
Стратегия разделения набора данныхОбучение / Валидация / Тестирование
Обучающая выборка70%
Валидационная выборка15%
Тестовый набор15%
Случайное число (seed)42
Метрики оценкиТочность сегментации, IoU, коэффициент Дайса, SSIM, PSNR и FID
Язык программированияPython 3.8.10
Среда глубокого обученияPyTorch 1.10.0
Аппаратная платформаГрафический процессор NVIDIA RTX 3090 (24 ГБ VRAM), Intel Core i7 (11-го поколения), 32 ГБ ОЗУ
Рабочая средаUbuntu 20.04 LTS

Таблица 3: Экспериментальная установка и конфигурация модели. Сводка архитектурных компонентов, конфигурации обучения, настроек предобработки, наборов данных, параметров оптимизации, метрик оценки и вычислительной среды, использованных для реализации и оценки предлагаемого фреймворка SegCycle-SPADE.

Модуль внимания сначала отображает карту признаков в представления запроса (query), ключа (key) и значения (value) с помощью Уравнения 10:

Формулы статического равновесия, Q=FsWq, K=FsWk, V=FsWv, уравнение для механического анализа.

Здесь Wq, Wk и Wv представляют собой обучаемые матрицы весов. Веса внимания рассчитываются на основе сходства между вектором запроса и вектором ключа с помощью Уравнения 1117

Формула функции Softmax, A=Softmax((QK^T)/√d_k), уравнение механизма внимания.

Здесь dk — это размерность вектора ключа. Улучшенное представление признаков вычисляется путем умножения весов внимания на матрицу значений с использованием Уравнения 12:

Показана формула статического равновесия \(F_a = A \cdot V\); ключевая концепция анализа баланса сил.

Здесь Fa представляет собой улучшенное представление признаков карты признаков. Улучшенное представление признаков вычисляется путем объединения исходных признаков сегментации с улучшенными признаками, полученными с помощью механизма внимания, согласно Уравнению 13:

Уравнение статического равновесия \( F_e = F_s + F_a \), описывающее силы, формула.                                

Здесь Fe — это улучшенная карта признаков, используемая для реконструкции паттерна. CAFFM дополнена многомасштабным механизмом перекрестного внимания для извлечения признаков культурных мотивов в разных масштабах. Пусть Fsi обозначает признаки сегментации в масштабе i, а Faj — признаки художественного стиля в том же масштабе. Окончательное представление признаков определяется с помощью Уравнения 14:

  Формула механизма внимания \(F_{\text{fusion}} = \sum_{i=1}^{N} \text{Attention}(Q_i, K_i, V_i)\).

Здесь Qi, Ki и Vi представляют собой матрицы запроса (query), ключа (key) и значения (value) соответственно на масштабе i, а N обозначает количество масштабов признаков. В данном исследовании N = 4, что соответствует картам признаков, извлеченным при пространственных разрешениях 1/4, 1/8, 1/16 и 1/32 от размера входного изображения. Эти многомасштабные представления признаков объединялись с использованием обучаемых весов внимания перед этапами реконструкции и художественного синтеза. Приведенное расширение позволяет методу извлекать глобальные культурные мотивы и текстуры для реконструкции культурных паттернов. Модуль CAFFM расположен между стадией сегментации на базе SegFormer и стадией творческого синтеза на базе SPADE в предлагаемой системе SegCycle-SPADE. Сначала, в то время как CycleGAN параллельно создает признаки реконструкции со стилистической и паттерн-зависимой информацией, SegFormer-B2 восстанавливает семантические карты признаков, которые описывают структурные свойства культурных мотивов. Модуль CAFFM принимает эти два потока признаков и использует слияние на основе перекрестного внимания (cross-attention) для выявления взаимосвязей между структурными и художественными представлениями. Для создания культурно достоверных паттернов при сохранении семантической согласованности и структурных особенностей полученные объединенные карты признаков затем направляются в модуль SPADE для творческого синтеза под управлением сегментации.

Реконструкция узоров с помощью CycleGAN
После завершения этапа усиления признаков на основе механизма внимания карты признаков будут содержать усиленные структуры культурных мотивов. Тем не менее, карты признаков все еще могут содержать неполные или поврежденные области узора. Поэтому для решения задачи реконструкции узоров в предлагаемой архитектуре будет использоваться модель CycleGAN. В данной архитектуре двумя доменами будут оригинальные узоры культурных мотивов и реконструированные узоры культурных мотивов. Используя усиленные признаки с предыдущих этапов, модель CycleGAN восстановит культурные узоры, сохраняя при этом структурную целостность. Это обеспечит сохранение пространственного расположения таких культурных узоров, как геометрические, цветочные и символические орнаменты. Исходные изображения батика народа мяо были подвергнуты операциям случайного маскирования и частичного перекрытия для создания неполных или поврежденных культурных мотивов. Эти процедуры деградации имитировали отсутствие фрагментов узора и структурные повреждения, часто наблюдаемые в deteriorated объектах культурного наследия. Деградированные изображения использовались в качестве входных данных для модуля реконструкции, в то время как соответствующие оригинальные изображения служили эталонными для оценки эффективности и качества реконструкции. Такая стратегия позволила модели изучить восстановление недостающих структур мотивов при сохранении семантической целостности и культурных особенностей.

Пусть X будет областью неполных культурных паттернов, а Y — областью реконструированных культурных паттернов. Два генератора обучаются выполнять двунаправленное отображение, используя Уравнение 15:

 Диаграмма функций и отображений GF:X→Y, FM:Y→X, математические преобразования в уравнениях.

Здесь GE используется для реконструкции структур мотивов, а FM — для отображения паттернов обратно на исходный домен. Состязательная функция потерь используется для обеспечения реалистичности реконструированных паттернов (Уравнение 16)30

Уравнение функции потерь GAN \(L_{GAN}\); формула для улучшения генеративных моделей; математическое выражение.

Здесь DY — это дискриминатор, используемый для различения реальных и реконструированных паттернов, а GE(x) обозначает сгенерированный реконструированный паттерн. CycleGAN также обеспечивает циклическую согласованность для сохранения структурного расположения культурных мотивов (Уравнение 17)30.

Математическая формула функции потерь \(L_{cycle}(G_F, F_M)\) в компьютерном моделировании.

Итоговая функция потерь определяется с помощью Уравнения 1830:

Уравнение статического равновесия, L_total=L_GAN(G_E,D_Y,X,Y)+L_GAN(F_M,D_X,Y,X)+λ_L_cycle(G_E,F_M).

Здесь λi обозначает весовой коэффициент функции потерь циклической согласованности, который в процессе обучения был установлен равным 10, что соответствует исходной формулировке CycleGAN. Данное значение было выбрано для обеспечения баланса между состязательным обучением и согласованностью реконструкции между исходным и целевым доменами.

Модуль реконструкции CycleGAN состоит из двух генераторов и двух дискриминаторов для двунаправленного преобразования изображений. Каждый генератор построен на архитектуре остаточной сети, включающей начальный сверточный слой 7 × 7, за которым следуют два сверточных слоя понижения дискретизации, девять остаточных блоков и два слоя повышения дискретизации. Во всех операциях свертки используется размер ядра 3 × 3, за исключением входного слоя, где для улучшенного извлечения признаков применяется ядро 7 × 7. После каждого сверточного слоя применяется Instance Normalization для повышения стабильности обучения, а во всей сети генератора используется функция активации ReLU. В выходном слое применяется функция активации Tanh для получения нормализованных выходных изображений. Дискриминатор построен на архитектуре PatchGAN 70 × 70, состоящей из ряда сверточных слоев с размером ядра 4 × 4 и постепенно увеличивающимся количеством каналов признаков. В дискриминаторе используются Instance Normalization и активация LeakyReLU (отрицательный наклон = 0.2) для улучшения дискриминации признаков и состязательного обучения. Модуль CycleGAN принимает на вход предварительно обработанные изображения культурных мотивов и генерирует реконструированные представления паттернов, которые затем передаются в CAFFM для интеграции с признаками сегментации. Обучение CycleGAN проводилось с использованием оптимизатора Adam (β₁ = 0.5, β₂ = 0.999) с начальной скоростью обучения 0.0002. Скорость обучения поддерживалась на этом уровне в течение первых 100 эпох, а затем линейно снижалась до нуля в течение оставшегося периода обучения. Для стабилизации обучения дискриминатора использовался буфер воспроизведения (replay buffer), содержащий 50 ранее сгенерированных изображений. Обновление генераторов и дискриминаторов происходило в соотношении 1:1: одно обновление генератора сменялось одним обновлением дискриминатора в каждой итерации обучения.

Процесс реконструкции CycleGAN основан на улучшенных картах признаков, полученных с помощью механизма CAFFM, показанного на рисунке 5. Карты признаков содержат усиленные культурные мотивы, полученные на предыдущих этапах сегментации и CAFFM. Эти карты признаков используются в качестве входных данных для первого генератора GE. Первый генератор GE изучает отображение, необходимое для реконструкции культурных паттернов. Затем выходные данные подаются на дискриминатор DY для разграничения реальных культурных паттернов и реконструированных паттернов. Дискриминатор DY помогает генератору GE создавать реалистичные результаты. Чтобы культурные паттерны не искажались в процессе реконструкции, второй генератор FM выполняет циклическое согласованное отображение (cycle-consistency mapping). Второй генератор FM отображает выходные данные обратно в исходную область. Затем результаты оцениваются дискриминатором для проверки реалистичности. Итоговые результаты впоследствии передаются в модуль SPADE для генерации художественного стиля на следующем этапе предлагаемой архитектуры SegCycle-SPADE.

Процесс реконструкции узоров; диаграмма использования GAN для генерации культурных мотивов.
Рисунок 5. Схема реконструкции узоров на основе CycleGAN. Рабочий процесс модуля реконструкции CycleGAN. В качестве входных данных для сети-генератора используются представления признаков с механизмом внимания для реконструкции незавершенных культурных мотивов. Дискриминатор оценивает реконструированные результаты по отношению к эталонным узорам, в то время как циклическое согласованное отображение обеспечивает сохранение структурной целостности при двунаправленном преобразовании изображений. Реконструированные мотивы затем передаются в модуль SPADE для синтеза художественного стиля. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Генерация художественного стиля с использованием SPADE
В дальнейшем реконструированные культурные мотивы подвергаются обработке модулем SPADE для генерации художественного стиля. Основная цель модуля SPADE заключается в добавлении более насыщенных визуальных текстур художественного стиля к реконструированным культурным мотивам без нарушения их структурной компоновки. Модуль SPADE представляет собой метод условной генерации изображений, использующий концепцию сегментации изображений для создания новых визуальных образов. Многоканальные семантические карты, соответствующие предопределенным классам мотивов, были закодированы на основе масок семантической сегментации, полученных с помощью SegFormer-B2. Эти закодированные карты поступали на вход генератора SPADE в качестве условий. Параметры пространственно-адаптивного масштабирования (γ) и смещения (β) формировались путем обработки семантических карт сверточными слоями внутри каждого слоя SPADE. Таким образом, генератор мог сохранять границы мотивов, структурную компоновку и семантическую информацию в процессе художественного синтеза, применяя эти параметры к нормализованным активациям признаков. Семантическое управление могло влиять как на высокоуровневую структурную реконструкцию, так и на низкоуровневый синтез текстур, поскольку процесс кондиционирования осуществлялся на нескольких слоях генератора SPADE. В результате созданные художественные паттерны включали в себя стилистические черты, заимствованные из набора данных WikiArt, при сохранении структур культурных мотивов, выявленных на этапе сегментации.

В качестве основного ресурса для изучения художественных стилей использовался набор данных WikiArt, включающий работы из 27 различных категорий искусства, таких как Ренессанс, импрессионизм, кубизм, экспрессионизм, сюрреализм, реализм и абстрактное искусство. Для того чтобы модель была ознакомлена с разнообразными творческими особенностями и улучшилась генерализация стилей, в процессе обучения изображения стилей выбирались случайным образом из различных категорий. Набор данных был разделен на обучающую, валидационную и тестовую подвыборки с сбалансированным представлением художественных категорий для снижения систематической ошибки стиля. Для обеспечения сбалансированного представления всех 27 художественных категорий использовалось стратифицированное сэмплирование. Образцы из каждой категории пропорционально распределялись между обучающей, валидационной и тестовой подвыборками с сохранением исходного распределения классов. Модуль CAFFM использовался для объединения аспектов стиля, извлеченных из изображений WikiArt, с признаками реконструкции, созданными CycleGAN. Полученные объединенные представления подавались в качестве кондиционирующей информации в генератор SPADE, чтобы сеть синтеза могла переносить художественные качества, сохраняя при этом семантическую структуру и границы культурных мотивов, полученные из карт сегментации. Благодаря этому методу кондиционирования стиля предложенная архитектура смогла создавать культурно достоверные художественные паттерны с согласованными структурными и стилистическими представлениями.

SPADE также вводит пространственно-адаптивные параметры, которые зависят от карты сегментации. Эти параметры могут быть определены так, как показано в Уравнении 191:

Уравнение линейного преобразования: y=γ(S)x̂+β(S) (Ур. 19), математическое представление.

Здесь γ(S) — это пространственно меняющийся параметр масштаба, а β(S) — пространственно меняющийся параметр смещения. Эти параметры помогают генератору создавать различные текстуры и стили в зависимости от семантической области на изображениях. Итоговое произведение культурного искусства может быть определено следующим образом, как показано в Уравнении 20:

 Уравнение для формулы процесса генетической оценки I_gen=G_E(X^P_r,SM).

Здесь GE — это генератор SPADE, XrP — реконструированный паттерн, а SM — карта сегментации. Итоговое произведение сохраняет структурную целостность культурных мотивов, улучшая при этом художественный вид. Для оптимизации предложенной архитектуры SegCycle-SPADE использовалась композитная функция потерь, которая балансирует точность семантической сегментации, сохранность культурных мотивов, качество реконструкции паттерна и согласованность художественного стиля. Общая цель обучения была определена как взвешенная смесь потерь сегментации (Lseg), адверсариальных потерь (Ladv), потерь циклической согласованности (Lcycle), потерь реконструкции (Lrecon), потерь сохранения мотивов (Lmotif) и потерь согласованности стиля (Lstyle). Общая функция потерь определена в Уравнении 21:

Формула общих потерь, L_Total, приравнивается к нескольким компонентам, представленным в виде математического уравнения для анализа.  (21)

Для обеспечения структурного соответствия между исходными и реконструированными культурными мотивами коэффициент потери циклической согласованности (cycle-consistency loss) был установлен на уровне 10. Чтобы сохранить детализированные признаки мотивов и повысить визуальную точность, коэффициент потери реконструкции (reconstruction loss) был установлен на уровне 5. Для подчеркивания сохранения культурно значимых структурных паттернов в процессе художественного синтеза для потери сохранения мотивов (motif-preservation loss) использовался коэффициент 2. Чтобы способствовать переносу художественного стиля без чрезмерного искажения семантических структур мотивов, коэффициент потери согласованности стиля (style-consistency loss) был скорректирован до 1. Для поддержания сбалансированного вклада между созданием реалистичного изображения и точной сегментацией мотивов потерям сегментации и состязательным потерям (adversarial losses) были присвоены равные веса. Для расчета потери согласованности стиля использовались представления стиля на основе признаков из набора данных WikiArt. В частности, характеристики художественного стиля фиксировались с помощью корреляций матрицы Грама, полученных из карт глубоких признаков. Для вычисления потери стиля использовалась разность норм Фробениуса между матрицами Грама целевого изображения стиля и сгенерированного изображения, как показано в формуле 22:

Уравнение для расчета потерь стиля в нейронных сетях, демонстрирующее формулу L_style, изображение метода.

Здесь, Gл вычисляется ли матрица Грама на основе лПожалуйста, предоставьте текст для перевода. слой объектов, ЯПоскольку вы не предоставили исходный текст для перевода, пожалуйста, отправьте контент, который необходимо перевести на русский язык. Я готов приступить к работе в соответствии с вашими инструкциями по профессиональному научному переводу для JoVE. обозначает созданное художественное изображение, Ястиль обозначает целевое изображение стиля из набора данных WikiArt, и F обозначает норму Фробениуса. Такая формулировка позволяет предложенному фреймворку сохранять художественные особенности, поддерживая при этом структурную и семантическую целостность культурных мотивов.

Объединенные представления признаков, создаваемые модулем CAFFM, используются в качестве обусловляющих входных данных для модуля SPADE, который служит компонентом художественного синтеза предлагаемой структуры. Генератор SPADE состоит из семи остаточных блоков SPADE с размерностью латентных признаков 256 каналов и генерирует выходные изображения с разрешением 256 × 256 пикселей. Карты семантической сегментации, полученные от модуля SegFormer–CAFFM, используются в качестве обусловляющих входных данных на всех остаточных слоях SPADE. Слои SPADE применяются перед функциями активации в каждом остаточном блоке, что обеспечивает семантическое обусловливание под управлением сегментации. Посредством последовательных операций повышения дискретизации и свертки латентное представление признаков постепенно уточняется для генерации художественных паттернов высокого разрешения при сохранении семантической согласованности и структуры мотивов. В генераторе повсеместно используются функции активации LeakyReLU, а на выходном слое применяется функция активации Tanh для получения нормализованных изображений.

Алгоритм и рабочий процесс
Структура SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию паттернов и синтез художественного стиля в рамках единого конвейера обучения. Рабочий процесс начинается со сбора и предобработки набора данных, включая изменение размера изображений, нормализацию, шумоподавление и подготовку масок сегментации. Предобработанные изображения затем обрабатываются с помощью сети сегментации SegFormer-B2 для извлечения семантических представлений мотивов. Полученные признаки сегментации объединяются с признаками реконструкции через CAFFM, что обеспечивает взаимодействие между структурной информацией о мотивах и представлениями художественных особенностей. Объединенные карты признаков затем подаются в модуль реконструкции CycleGAN, который восстанавливает неполные структуры культурных мотивов, сохраняя семантическую целостность. Реконструированные паттерны впоследствии передаются генератору SPADE для управляемого сегментацией художественного синтеза, что позволяет улучшить стилистику при сохранении границ мотивов и структурной аутентичности. В процессе обучения параметры модели оптимизируются с использованием составной функции потерь, описанной в Уравнениях 21 и 22, которая балансирует точность сегментации, сохранность мотивов, качество реконструкции и согласованность художественного стиля. Подробный пошаговый процесс реализации, включая загрузку данных, предобработку, инициализацию модели, итерации обучения, процедуры валидации, выбор контрольных точек и окончательную оценку, представлен в Дополнительном файле 1 (Алгоритм 1). Полный алгоритмический рабочий процесс был реализован с размером пакета 16, скоростью обучения 0.0002 и 100 эпохами обучения. Для разделения набора данных, инициализации модели и всех экспериментов по обучению использовался фиксированный случайный seed 42. Этот seed последовательно применялся в генераторах случайных чисел Python, NumPy и PyTorch для обеспечения воспроизводимости. Оптимизатор Adam был настроен с β₁ = 0.5, β₂ = 0.999 и без распада весов (weight decay = 0). Контрольные точки модели выбирались на основе наивысшего показателя IoU, достигнутого на валидационном наборе данных.

Оптимизация функции потерь
Для сохранения структур культурных мотивов при реконструкции и художественном синтезе в предлагаемой архитектуре используется комбинированная целевая функция оптимизации, которая объединяет потери сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля. Полная математическая формулировка, весовые коэффициенты и определение потерь стиля приведены в уравнениях 21 и 22 в подразделе Artistic Style Generation using SPADE. Компонент сохранения мотивов штрафует структурные отклонения между предсказанными областями мотивов и соответствующими масками сегментации истинных значений (ground-truth), тем самым способствуя сохранению культурно значимых структур узоров на протяжении всего процесса реконструкции.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложенная платформа SegCycle-SPADE была оцениваться с использованием двух наборов данных: набора данных культурных мотивов батика народа мяо и набора данных WikiArt. Набор данных батика мяо содержит изображения традиционного культурного наследия и использовался преимущественно для задач семантической сегментации и структурной реконструкции, в то время как набор данных WikiArt содержит разнообразные художественные стили и использовался для обучения и генерации художественного стиля. Изображения из обоих наборов данных были обработаны через полный конвейер SegCycle-SPADE, включая семантическую сегментацию, CAFFM, реконструкцию паттернов и генерацию художественного стиля на основе SPADE. Интеграция информации о культурных мотивах и представлений художественного стиля позволила платформе создавать культурно значимые и визуально согласованные результаты.

Все эксперименты проводились на рабочей станции с поддержкой GPU, оснащенной процессором Intel Core i7 и графическим процессором NVIDIA. В частности, эксперименты выполнялись на рабочей станции с центральным процессором Intel Core i7 (11-го поколения), графическим процессором NVIDIA RTX 3090 с 24 GB VRAM и 32 GB системной памяти. Модели были реализованы с использованием Python 3.8 и PyTorch 1.10 с ускорением CUDA. Обучение проводилось с использованием одного GPU без распределенного обучения. Во всех экспериментах использовалась стандартная точность FP32; обучение со смешанной точностью не применялось. Оптимизатор Adam использовался с размером пакета 16 в течение 100 эпох обучения. В Таблице 3 обобщены параметры реализации и вычислительная среда, использованные в данном исследовании.

Предложенная архитектура состоит из четырех основных компонентов: SegFormer-B2 для семантической сегментации, CAFFM для слияния признаков, CycleGAN для реконструкции мотивов и SPADE для синтеза художественного стиля. Перед началом обучения изображения из обоих наборов данных были приведены к размеру 256 × 256 пикселей. Такое стандартизированное разрешение обеспечило вычислительную эффективность при сохранении важных деталей мотивов, а также способствовало стабильному состязательному обучению модулей CycleGAN и SPADE.

Эффективность предложенной структуры была оценена с помощью метрик сегментации и анализа качества изображений, включая точность сегментации (Segmentation Accuracy), IoU, коэффициент сходства Дайса (Dice), SSIM, PSNR и FID. Визуальная аутентичность оценивалась качественно путем визуального осмотра сгенерированных культурных узоров. Качественная оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных особенностях и художественном виде по сравнению с эталонными культурными мотивами. Визуальная аутентичность не использовалась в качестве независимой количественной метрики оценки.

Количественная оценка предлагаемой структуры была проведена с использованием следующих метрик.

Точность сегментации была вычислена с использованием формулы 23:

Формула точности, TP+TN/TP+TN+FP+FN, уравнение статистического анализа для оценки модели.

Здесь TP, TN, FP и FN обозначают истинно положительные, истинно отрицательные, ложноположительные и ложноотрицательные результаты соответственно.

IoU был рассчитан по уравнению 24:

 Формула IoU, TP/(TP+FP+FN), математическое уравнение для точности сегментации изображений.

Коэффициент сходства Дайса (Dice) был рассчитан с использованием Уравнения 25:

Уравнение коэффициента Дайса, \( \frac{2*TP}{2*TP+FP+FN} \), формула, используемая при оценке анализа данных.

Для оценки перцептивного сходства изображений использовался индекс SSIM, который определяется согласно уравнению 2633:

Уравнение индекса SSIM; математическая формула для оценки качества изображения; диаграмма.  (26)

Здесь μ обозначает среднюю интенсивность, σ обозначает дисперсию, σxy обозначает ковариацию между изображениями, а C1 и C2 являются стабилизирующими константами.

PSNR — это метрика, обычно используемая для оценки качества генерируемых изображений, и она определяется в Уравнении 2733:

Формула PSNR, оценка качества изображения, уравнение для расчета пикового отношения сигнала к шуму.

Здесь MaxI обозначает максимально возможное значение пикселя изображения, а MSE — среднеквадратичную ошибку между оригинальным и реконструированным изображениями.

FID можно рассчитать с использованием средних значений и ковариационных матриц, как показано в Уравнении 2833:

Уравнение расстояния Фреше-Инцепции (FID); статистический метод; формула для оценки качества изображений.   (28)

Здесь μr — среднее значение реального изображения, μg — среднее значение сгенерированного изображения, а Σr и Σg — ковариационные матрицы реального и сгенерированного изображений соответственно.

Для сравнения производительности предложенная архитектура была оценена в сопоставлении с репрезентативными методами, обычно используемыми для семантической сегментации, реконструкции изображений и художественной генерации изображений. В качестве базовых моделей для сегментации были выбраны U-Net и DeepLabV3+, в то время как Pix2Pix и CycleGAN использовались в качестве базовых моделей для реконструкции. StyleGAN и AttentionGAN были использованы как репрезентативные методы художественной генерации изображений. Данные сравнения проводились для оценки эффективности SegCycle-SPADE в сохранении информации о структурных мотивах при одновременном повышении художественного качества.

Каждый эксперимент повторяли пять раз для оценки стабильности и воспроизводимости результатов. Для разделения набора данных использовали фиксированный случайный seed 42, чтобы обеспечить согласованность подмножеств для обучения, валидации и тестирования во всех экспериментах. Результаты представлены как среднее значение ± стандартное отклонение. Низкие значения стандартного отклонения, наблюдаемые для Accuracy, IoU, Dice, SSIM, PSNR и FID, указывают на то, что предложенная архитектура обеспечила стабильную работу при повторных запусках экспериментов. Статистическая значимость оценивалась с помощью парных t-критериев; различия считались статистически значимыми при p < 0.05. Поскольку все модели оценивались на одних и тех же разделах данных, были получены парные измерения производительности при повторных запусках, что оправдывает использование парных t-критериев. Для контроля семейной ошибки, связанной с множественными попарными сравнениями, применялась поправка Бонферрони, а статистическая значимость определялась с использованием скорректированного порога α/n, где n обозначает количество попарных сравнений.

Экспериментальные результаты убедительно подтверждают эффективность предложенного фреймворка SegCycle-SPADE. Высокие показатели сегментации, достигнутые с помощью SegFormer-B2, демонстрируют его способность точно определять и сохранять границы культурно значимых мотивов. Улучшение показателей IoU и коэффициентов Dice дополнительно указывает на эффективное сохранение семантических структур мотивов на протяжении всего конвейера обработки. Интеграция CycleGAN и SPADE позволила успешно реконструировать неполные структуры мотивов при сохранении детальных визуальных элементов, что отражено в повышенных значениях SSIM и PSNR. Кроме того, более низкие значения FID свидетельствуют о том, что сгенерированные художественные паттерны обладают бóльшим сходством с подлинными культурными и художественными изображениями, что говорит об улучшении стилистической согласованности и визуального реализма.

Модуль CAFFM внес значительный вклад в эти улучшения, обеспечив эффективное взаимодействие между структурной информацией, полученной в результате сегментации, и генеративными представлениями стиля. Благодаря слиянию признаков на основе перекрестного внимания (cross-attention), CAFFM повысил как структурную точность, так и художественную достоверность, сохранив при этом дальние связи между культурными мотивами.

Рисунок 6 представляет сравнение точности сегментации между предложенной структурой SegCycle-SPADE и существующими методами на наборах данных Miao Batik и WikiArt. Традиционные подходы к сегментации, такие как U-Net и DeepLabV3+, продемонстрировали конкурентоспособные результаты благодаря их способности изучать пространственные представления. Однако Pix2Pix и CycleGAN показали более низкую точность сегментации, поскольку они не были специально разработаны для задач сегментации. Предложенная структура SegCycle-SPADE достигла наивысшей точности сегментации на обоих наборах данных благодаря интеграции SegFormer-B2 и усиления признаков на основе CAFFM.

График точности сегментации; сравнение методов U-Net, DeepLabV3+, Pix2Pix, CycleGAN и SegCycle-SPADE.
Рисунок 6. Сравнение точности сегментации при использовании различных методов. Сравнение точности сегментации, полученной с использованием U-Net, DeepLabV3+, Pix2Pix, CycleGAN и предложенного фреймворка SegCycle-SPADE на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей соответствуют одному стандартному отклонению. Более высокие значения указывают на улучшение качества сегментации. Предложенный фреймворк SegCycle-SPADE достиг наивысшей точности сегментации на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7 представляет сравнение IoU между оцениваемыми методами. U-Net и DeepLabV3+ продемонстрировали высокие показатели перекрытия благодаря своим архитектурам, ориентированным на сегментацию. Напротив, Pix2Pix и CycleGAN показали более низкие значения IoU, так как их основной целью является преобразование изображений, а не семантическая сегментация. Предложенная платформа SegCycle-SPADE достигла самых высоких значений IoU на обоих наборах данных, что указывает на улучшенную локализацию и сохранность областей культурных мотивов.

Сравнение показателей IoU, столбчатая диаграмма; Методы сегментации в сравнении с наборами данных Miao Batik и WikiArt; Среднее значение ± SD.
Рисунок 7. Сравнение показателей пересечения над объединением (IoU) при сегментации культурных мотивов. Сравнение эффективности IoU различных методов сегментации на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей соответствуют одному стандартному отклонению. Более высокие значения IoU указывают на лучшее перекрытие между прогнозируемыми и эталонными областями мотивов, а также на более точное сохранение границ мотивов. Предложенная архитектура SegCycle-SPADE достигла самых высоких показателей IoU на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 8 представляет сравнение коэффициентов сходства Дайса. Коэффициент Дайса определяет степень перекрытия между предсказанными масками сегментации и истинными областями мотивов. Традиционные подходы к сегментации достигли относительно высоких значений коэффициента Дайса благодаря их эффективности в изучении пространственных структур. Однако предложенная архитектура SegCycle-SPADE показала самые высокие значения коэффициента Дайса на обоих наборах данных, продемонстрировав улучшенную согласованность сегментации и сохранность мотивов.

График коэффициента Дайса для сегментации мотивов; методы: U-Net, DeepLabV3+, Pix2Pix, CycleGAN.
Рисунок 8. Сравнение коэффициента Дайса для сегментации культурных мотивов. Сравнение значений коэффициента Дайса, полученных с использованием различных подходов к сегментации на наборах данных Miao Batik и WikiArt. Коэффициент Дайса оценивает степень перекрытия между предсказанными масками сегментации и эталонными масками, при этом более высокие значения указывают на улучшение качества сегментации и идентификации областей мотивов. Предложенный фреймворк SegCycle-SPADE достиг самых высоких значений коэффициента Дайса для обоих наборов данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9 представляет сравнение SSIM реконструированных культурных паттернов. Методы на основе GAN, такие как Pix2Pix, CycleGAN и StyleGAN, достигли более высоких значений SSIM, чем традиционные методы сегментации, так как они были разработаны для генерации изображений. Тем не менее, предложенная архитектура SegCycle-SPADE обеспечила самые высокие значения SSIM на обоих наборах данных, что указывает на превосходное сохранение структурных деталей и художественной целостности.Столбчатая диаграмма сравнения структурного сходства; показатели SSIM для Pix2Pix, CycleGAN и др. на наборах данных.

Рисунок 9. Сравнение индекса структурного сходства (SSIM). Сравнение значений индекса структурного сходства (SSIM), полученных с использованием различных методов реконструкции на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей указывают одно стандартное отклонение. Более высокие значения SSIM свидетельствуют о большем структурном сходстве между реконструированными и эталонными паттернами. Предложенная архитектура SegCycle-SPADE достигла самых высоких показателей SSIM для обоих наборов данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Для оценки реалистичности и распределительного сходства сгенерированных художественных паттернов использовался показатель FID. Вычисление FID проводилось с помощью предобученной сети Inception-v3, при этом векторы признаков извлекались из слоя pool3, что позволило получить 2048-мерные представления признаков. Перед извлечением признаков сгенерированные и эталонные изображения были масштабированы до размера 299 × 299 пикселей с использованием билинейной интерполяции и нормализованы в соответствии со стандартным протоколом предобработки Inception-v3. FID вычислялся на основе распределений признаков, извлеченных из независимого тестового набора данных. Статистики среднего значения и ковариации были оценены на основе эмбеддингов признаков и использованы в стандартной формуле FID.

Как показано в Таблице 4, традиционные подходы к генерации изображений, такие как Pix2Pix и CycleGAN, дали относительно высокие значения FID из-за отсутствия явного структурного руководства. StyleGAN и AttentionGAN достигли более низких значений FID благодаря улучшенным возможностям изучения признаков. Однако предложенная платформа SegCycle-SPADE обеспечила самые низкие значения FID для обоих наборов данных, продемонстрировав превосходный реализм изображений, стилистическую согласованность и сохранность культурных мотивов.

МетодНабор данных батика народа мяо (FID)Набор данных WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (предлагаемый вариант)28.531.2

Таблица 4: Результаты расчета расстояния Фреше — Инцепции (FID) для реконструкции культурных узоров. Сравнение показателей расстояния Фреше — Инцепции (FID), полученных с помощью предложенного фреймворка SegCycle-SPADE и базовых генеративных моделей на наборах данных Miao Batik и WikiArt. Более низкие значения FID указывают на большее сходство между распределениями признаков сгенерированных и реальных изображений и, следовательно, отражают повышенный визуальный реализм реконструированных культурных узоров.

Рисунок 10 демонстрирует сравнение качества реконструкции, достигнутого с помощью различных методов. Качество реконструкции (%) рассчитывалось путем перевода значения SSIM между реконструированным и соответствующим эталонным изображением в процентную шкалу (SSIM × 100). Более высокие значения в процентах указывают на большую структурную точность и визуальное сходство с оригинальным культурным мотивом. Традиционные генеративные модели, такие как Pix2Pix и CycleGAN, показали средние результаты реконструкции. Более современные архитектуры, включая StyleGAN и AttentionGAN, обеспечили повышенное качество реконструкции благодаря улучшенным возможностям обучения признакам. Однако предложенная архитектура SegCycle-SPADE достигла наивысшего качества реконструкции благодаря интеграции семантического сегментационного управления, слияния признаков с перекрестным вниманием (cross-attention), обучения реконструкции и художественного синтеза.

Диаграмма сравнения качества реконструкции; методы: Pix2Pix, CycleGAN, StyleGAN, AttentionGAN, SegCycle-SPADE.
Рисунок 10. Сравнение качества реконструкции паттернов. Сравнение качества реконструкции, полученного с помощью Pix2Pix, CycleGAN, StyleGAN, AttentionGAN и предложенной платформы SegCycle-SPADE на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей указывают одно стандартное отклонение. Более высокие значения свидетельствуют о лучшем сохранении структурных деталей, семантической согласованности и визуальной точности. Предложенная платформа SegCycle-SPADE продемонстрировала самые высокие показатели качества реконструкции на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Для оценки точности реконструкции использовался показатель PSNR, который позволяет измерить сходство на уровне пикселей между реконструированными изображениями и соответствующими эталонными изображениями. PSNR рассчитывался для каждого реконструированного изображения относительно оригинального изображения батика народа мяо, использованного в качестве истинного эталона. Более высокие значения PSNR указывают на меньшую ошибку реконструкции. Как показано в таблице 5, модели Pix2Pix и CycleGAN достигли умеренных значений PSNR, поскольку они реконструировали узоры без явного структурного руководства. StyleGAN и AttentionGAN продемонстрировали более высокие значения PSNR благодаря более глубокому обучению признакам. Предложенная архитектура SegCycle-SPADE достигла самых высоких значений PSNR на обоих наборах данных, что свидетельствует о превосходной точности реконструкции и сохранении структур культурных мотивов.

МетодНабор данных Miao Batik
(PSNR, dB)
Набор данных WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (Предлагаемый)32.431.2

Таблица 5: Результаты пикового отношения сигнал/шум (PSNR) для реконструкции культурных паттернов. Сравнение значений пикового отношения сигнал/шум (PSNR), полученных с помощью предлагаемой структуры SegCycle-SPADE и базовых методов на наборах данных Miao Batik и WikiArt. Более высокие значения PSNR указывают на повышенную точность реконструкции и снижение искажений по отношению к соответствующим эталонным изображениям.

Рисунок 11 иллюстрирует поведение сходимости предложенного фреймворка SegCycle-SPADE в процессе обучения. Кривые потерь представляют собой средние значения потерь при обучении, усредненные по пяти независимым запускам. Для снижения стохастической вариативности и обеспечения более надежного представления сходимости обучения значения потерь усреднялись на каждой эпохе по всем запускам. В течение начальных эпох обучения значения потерь были относительно высокими, так как модель все еще изучала представления признаков из входных данных. По мере продвижения обучения все компоненты потерь постепенно снижались и стабилизировались, что указывает на успешную оптимизацию задач сегментации, реконструкции и художественного синтеза. Наблюдаемое поведение сходимости демонстрирует эффективность, стабильность и воспроизводимость предложенного фреймворка в процессе обучения.

График сходимости обучения, архитектура SegCycle-SPADE. Функция потерь в зависимости от эпох; L_total, L_seg, L_G, L_D.
Рисунок 11. Сходимость обучения предлагаемой архитектуры SegCycle-SPADE. Кривые потерь при обучении предлагаемой архитектуры SegCycle-SPADE на протяжении 100 эпох обучения, усредненные по пяти независимым циклам обучения (n = 5). На рисунке показана динамика общей функции потерь (LTotal), потерь сегментации (LSeg), потерь генератора (LG) и потерь дискриминатора (LD) в процессе обучения. Постепенное снижение и последующая стабилизация всех компонентов потерь свидетельствуют об успешной сходимости и стабильной оптимизации предлагаемой архитектуры. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Анализ влияния компонентов (абляционное исследование)
Для оценки вклада каждого компонента в рамках предложенного фреймворка SegCycle-SPADE было проведено абляционное исследование с использованием нескольких контролируемых конфигураций модели. Результаты обобщены в таблицах 6 и 7.

Конфигурация моделиТочность сегментации (%)IoU (интерсекция над объединением)SSIM (индекс структурного сходства)
Только SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (предлагаемый вариант)93.80.860.93

Таблица 6: Анализ влияния компонентов SegCycle-SPADE. Сравнение производительности последовательно улучшаемых конфигураций моделей для оценки вклада отдельных компонентов системы. В исследовании изучается влияние семантической сегментации, модуля слияния культурных признаков на основе перекрестного внимания (Cross-Attention Cultural Feature Fusion Module, CAFFM), реконструкции на базе CycleGAN и художественного синтеза на базе SPADE на точность сегментации, индекс пересечения над объединением (IoU) и индекс структурного сходства (SSIM). Более высокие значения указывают на улучшенную сегментацию мотивов, качество реконструкции и сохранность структуры.

ВариантIoU (%)Коэффициент Дайса (%)SSIM (индекс структурного сходства)PSNR (дБ)ФИД ↓
Только SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (полная модель)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Таблица 7: Анализ вклада компонентов предлагаемой архитектуры SegCycle-SPADE. Сравнение эффективности отдельных вариантов архитектуры, использованных для оценки вклада CAFFM, CycleGAN, SPADE и полной архитектуры SegCycle-SPADE. Результаты представлены с использованием показателей Intersection over Union (IoU), коэффициента Dice, индекса структурного сходства (SSIM), пикового отношения сигнала к шуму (PSNR) и расстояния Фреше (FID). Более высокие значения IoU, Dice, SSIM и PSNR указывают на улучшенное качество сегментации и реконструкции, в то время как более низкие значения FID свидетельствуют о более высоком визуальном реализме сгенерированных культурных паттернов.

В таблице 6 оценивается совокупный вклад основных компонентов системы с использованием четырех конфигураций: (i) только SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN и (iv) SegFormer + CAFFM + CycleGAN + SPADE (предлагаемая система). Базовая модель SegFormer достигла точности сегментации 87.3%, показателя IoU 0.76 и значения SSIM 0.82. Внедрение модуля CAFFM улучшило показатели по всем критериям оценки, повысив точность сегментации до 89.6%, IoU до 0.79, а SSIM до 0.86. Добавление CycleGAN дополнительно расширило возможности структурной реконструкции, что привело к IoU 0.82 и значению SSIM 0.89. Полная система SegCycle-SPADE продемонстрировала наилучшие общие показатели: точность сегментации 93.8%, IoU 0.86 и значение SSIM 0.93. Эти результаты показывают, что каждый компонент вносит постепенный вклад в повышение точности сегментации, сохранение структуры и качество реконструкции изображений.

В таблице 7 далее исследуется вклад отдельных компонентов архитектуры с использованием пяти вариантов модели: (i) только SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM и (v) полная модель, включающая SegFormer, CAFFM, CycleGAN, SPADE и функцию потерь сохранения мотивов. Эффективность оценивалась с помощью метрик IoU, коэффициента Dice, SSIM, PSNR и FID.

Базовая конфигурация, состоящая только из SegFormer, обеспечила IoU 84.2%, коэффициент Dice 88.5%, значение SSIM 0.82, PSNR 24.8 dB и показатель FID 31.8. Добавление CycleGAN улучшило качество реконструкции и снизило показатель FID до 27.5, что указывает на повышение реалистичности изображений. Внедрение SPADE дополнительно улучшило структурное сходство и качество изображений, в результате чего значение SSIM составило 0.88, а показатель FID — 23.4. Включение предложенного модуля CAFFM привело к существенному росту всех метрик: IoU увеличился до 90.0%, коэффициент Dice — до 93.1%, SSIM — до 0.90, а PSNR — до 29.6 dB при снижении показателя FID до 20.3. Полная модель, в которой дополнительно используется функция потерь для сохранения мотивов, продемонстрировала наилучшую общую эффективность с IoU 93.0%, коэффициентом Dice 95.4%, значением SSIM 0.92, PSNR 31.2 dB и показателем FID 17.6.

В таблице 8 представлен сравнительный обзор репрезентативных подходов на основе глубокого обучения (DL), используемых для реконструкции и сохранения паттернов культурного наследия. Традиционные методы на базе CNN обеспечивают эффективное обучение локальным признакам и сегментацию, однако часто с трудом сохраняют сложные структуры мотивов из-за ограниченного моделирования дальних зависимостей. Подходы на базе GAN улучшают возможности синтеза изображений и переноса стиля, однако они могут быть подвержены семантическим несоответствиям и потере мелких структурных деталей. Методы на базе трансформеров улучшают глобальное контекстуальное понимание, но обычно не обладают возможностями генеративной реконструкции, в то время как методы на базе диффузии обеспечивают высокий визуальный реализм за счет повышенной вычислительной сложности. Гибридные подходы Transformer-GAN частично решают эти проблемы, объединяя механизмы извлечения признаков и генерации изображений. Напротив, предлагаемая архитектура SegCycle-SPADE объединяет сегментацию на базе трансформеров, слияние признаков с использованием перекрестного внимания, генеративную реконструкцию и сегментационно-направляемый художественный синтез в рамках единой архитектуры, что повышает структурную точность, семантическую согласованность и сохранность культурных мотивов. Сравнение обобщено в таблице 8.

ПодходОсновная методологияПреимуществаОграниченияЗначимость для культурного наследия
Методы на базе CNN (например, U-Net, DeepLabV3+)Сверточное извлечение признаков и семантическая сегментацияЭффективное обучение локальным признакам и точная сегментацияОграниченное моделирование дальних зависимостей; трудности с сохранением сложных структур мотивовПодходят для сегментации мотивов, но менее эффективны для художественной реконструкции
Методы на базе GAN (например, Pix2Pix, CycleGAN)Состязательная генерация изображений и преобразование изображения в изображениеВысокое качество синтеза изображений и перенос стиляНестабильность обучения; семантическая несогласованность; возможная потеря мелких структурных деталейПолезны для восстановления паттернов, но могут неточно сохранять культурные мотивы
Методы на базе TransformerМеханизм самовнимания (self-attention) и моделирование глобального контекстаУлавливают дальние зависимости и сложные визуальные взаимосвязиВысокие вычислительные затраты; необходимость в больших наборах обучающих данныхЭффективны для анализа сложных паттернов, но обладают ограниченными генеративными возможностями при самостоятельном использовании
Методы на базе диффузииГенерация изображений на основе итеративного шумоподавленияВысокий визуальный реализм и разнообразие изображенийНизкая скорость вывода (inference); высокие вычислительные требования; ограниченный структурный контрольПерспективны для генерации изображений наследия, но ресурсозатратны с вычислительной точки зрения
Гибридные методы Transformer-GANКомбинация извлечения признаков на базе transformer и генерации на базе GANУлучшенное представление глобальных признаков и качество изображенийЧасто отсутствует явное семантическое руководство для сохранения мотивовПовышают качество генерации, но не разработаны специально для мотивов культурного наследия
Предлагаемый SegCycle-SPADESegFormer + CAFFM + CycleGAN + SPADEСегментация на базе Transformer, слияние признаков под управлением внимания, семантическая согласованность, сохранение мотивов и контролируемая художественная реконструкцияБолее высокая вычислительная сложность по сравнению с отдельными подходами на базе CNNСпециально разработан для реконструкции и сохранения паттернов культурного наследия с улучшенной структурной точностью и семантической согласованностью

Таблица 8: Сравнение репрезентативных подходов глубокого обучения для реконструкции и сохранения паттернов культурного наследия.Качественное сравнение репрезентативных подходов глубокого обучения, используемых для сегментации изображений, реконструкции паттернов, генерации стиля и сохранения культурного наследия. В таблице обобщены основная методология, преимущества, ограничения и применимость каждого подхода, а также подчеркивается, как предлагаемый фреймворк SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию и синтез стиля для решения проблем, связанных с сохранением структуры и семантической согласованностью паттернов культурного наследия.

Наблюдаемые улучшения демонстрируют, что модуль CAFFM эффективно усиливает взаимодействие между структурными признаками, полученными в результате сегментации, и представлениями художественного стиля посредством слияния признаков на основе перекрестного внимания. Кроме того, функция потерь для сохранения мотивов способствует поддержанию культурно значимых структур мотивов в процессе реконструкции и художеческого синтеза, что приводит к улучшению согласованности сегментации, структурной точности и визуального реализма. В совокупности результаты абляционного анализа подтверждают, что интеграция SegFormer-B2, CAFFM, CycleGAN, SPADE и функции потерь для сохранения мотивов обеспечивает превосходную производительность предлагаемого фреймворка SegCycle-SPADE.

Доступность данных:
Набор данных WikiArt, использованный для обучения художественному стилю, находится в открытом доступе в репозитории Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). Набор данных Miao Batik, использованный в данном исследовании, доступен в открытом доступе через Zenodo (https://doi.org/10.5281/zenodo.20807658). Обработанные наборы данных, маски сегментации, веса предобученной модели, сгенерированные результаты и файлы реализации на языке Python, связанные с предлагаемым фреймворком SegCycle-SPADE, также доступны в этом же репозитории Zenodo.

ДОПОЛНИТЕЛЬНЫЙ ФАЙЛ:
Дополнительный файл 1. Алгоритм 1: Рабочий процесс реализации предлагаемого фреймворка SegCycle-SPADE. Пошаговый псевдокод, описывающий полный конвейер реализации предлагаемого фреймворка SegCycle-SPADE, включая загрузку набора данных, предварительную обработку, семантическую сегментацию с использованием SegFormer-B2, слияние признаков с помощью модуля слияния культурных признаков на основе перекрестного внимания (Cross-Attention Cultural Feature Fusion Module, CAFFM), реконструкцию культурных мотивов с помощью CycleGAN, синтез художественного стиля с использованием SPADE, обучение модели, валидацию, выбор контрольных точек и окончательную оценку эффективности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сохранение и цифровая реконструкция узоров нематериального культурного наследия (НКН) в последние годы привлекают все больше внимания в связи с постепенным исчезновением традиционных ремесел. В предыдущих исследованиях предпринимались попытки решить проблему утраты культурного наследия с помощью методов обработки изображений на базе глубокого обучения (DL). Например, Quan и др.32 предложили систему сохранения культурного наследия для культуры батика народа мяо в провинции Гуйчжоу, основанную на графах знаний и DL. Хотя данное исследование было сосредоточено на цифровой реконструкции культурных узоров, его методология в основном опиралась на представления в виде графов знаний. Аналогично, Fu и Razmjooy16 предложили архитектуру на основе сети пирамид признаков (FPN) для улучшения и восстановления изображений культурного наследия. Несмотря на то, что этот метод обеспечил эффективное извлечение признаков для улучшения изображений, в нем не были задействованы механизмы сегментации изображений или генеративной реконструкции для неполных культурных узоров. В отличие от них, предлагаемая архитектура SegCycle-SPADE объединяет несколько компонентов DL для преодоления этих проблем. Во-первых, для точной идентификации областей мотивов в узорах культурного наследия используется семантическая сегментация с помощью модели SegFormer. Затем модуль улучшения признаков на базе CAFFM совершенствует представления признаков для мелкозернистых структур мотивов. После этого модуль реконструкции CycleGAN используется для восстановления недостающих или неполных областей в культурных узорах посредством состязательного обучения. Наконец, модуль SPADE выполняет стилистическое улучшение, сохраняя при этом структурное соответствие картам сегментации. Существующие методы на базе CNN, GAN, трансформеров и диффузионных моделей17,19,20,21,22,23,24,25,30,34 обладают уникальными преимуществами, однако они также имеют ограничения в сохранении семантической согласованности, поддержании структурных особенностей или достижении вычислительной эффективности, как обобщено в Таблице 8. Предложенная архитектура SegCycle-SPADE сочетает в себе сильные стороны сегментации на базе SegFormer, слияния признаков с перекрестным вниманием, реконструкции CycleGAN и синтеза под управлением SPADE, устраняя при этом указанные недостатки. В результате данная архитектура обеспечивает более высокое качество реконструкции и улучшенное сохранение культурно значимых мотивов.

Несмотря на многообещающие результаты, предлагаемая архитектура SegCycle-SPADE все еще имеет ряд ограничений. Во-первых, оценка проводилась с использованием только наборов данных Miao Batik и WikiArt, что может ограничить обобщающую способность системы для других областей культурного наследия. Во-вторых, развертывание на платформах с ограниченными ресурсами может быть затруднительным, так как интеграция SegFormer, CAFFM, CycleGAN и SPADE увеличивает вычислительную сложность и требования к памяти. В-третьих, эффективность сегментации сильно зависит от качества и согласованности аннотаций мотивов, а систематическая ошибка аннотирования может повлиять на сохранность культурно значимых структур. Наконец, поскольку архитектура оценивалась всего на двух наборах данных, для обеспечения применимости к различным коллекциям культурного наследия могут потребоваться дополнительные обучающие данные и адаптации под конкретные области. Таким образом, в будущих исследованиях следует изучить более надежные стратегии обучения, облегченные архитектуры, улучшенные процедуры аннотирования и провести кросс-доменную оценку с использованием дополнительных наборов данных культурного наследия.

Основным направлением будущих исследований станет масштабируемость платформы SegCycle-SPADE для работы с более крупными и разнообразными наборами данных культурного наследия. Для улучшения обобщающей способности и культурной адаптивности модели будет проведена кросс-культурная оценка мотивов наследия из разных регионов и художественных традиций. Кроме того, мультимодальные расширения, включающие текстовые описания, исторические записи и культурные метаданные, могут обеспечить более точное семантическое руководство в процессе реконструкции. Платформа также может быть расширена для поддержки трехмерной реконструкции культурного наследия путем интеграции реконструкции на основе изображений с методами 3D-моделирования. В дополнение к этому будет изучена возможность внедрения системы в цифровые архивы, музеи, виртуальные выставки и платформы по сохранению культурного наследия для содействия практическому применению ИИ в консервации и документировании наследия. Для дальнейшего повышения интерпретируемости и культурной достоверности в будущих работах будет исследована интеграция графов культурных знаний, этнографической документации, исторических метаданных и курируемых экспертами баз знаний, что позволит проводить анализ и реконструкцию мотивов с учетом культурного контекста32.

При внедрении предлагаемой платформы SegCycle-SPADE следует учитывать несколько практических аспектов. В процессе обучения CycleGAN может возникнуть нестабильная адверсальная сходимость, если потери генератора и дискриминатора станут сильно несбалансированными. В таких ситуациях для повышения стабильности обучения может помочь снижение скорости обучения, увеличение веса потерь циклической согласованности или мониторинг доминирования дискриминатора. Коллапс моды может произойти, если генератор неоднократно создает визуально схожие результаты; эту проблему можно смягчить с помощью сбалансированного адверсального обучения, использования буфера воспроизведения (replay-buffer) и тщательного мониторинга тенденций потерь генератора и дискриминатора. Ошибки сегментации также могут возникнуть, если культурные мотивы имеют сложную текстуру, низкий контраст или неоднозначные границы. Чтобы решить эту проблему, перед обучением следует проверить качество изображений, а маски сегментации должны быть визуально проинспектированы для обеспечения согласованности аннотаций. Для достижения надежной производительности SegFormer также важно поддерживать рекомендуемое входное разрешение и настройки нормализации. Нестабильность обучения может дополнительно возникнуть из-за неправильных настроек скорости обучения, недостаточного объема обучающих данных или численных вариаций, связанных с оборудованием. Для повышения воспроизводимости следует использовать фиксированные случайные зерна (seeds) для NumPy, PyTorch, CUDA и операций перемешивания наборов данных. Кроме того, во всех экспериментальных запусках должны быть сохранены один и тот же конвейер предобработки, разделение наборов данных, гиперпараметры модели и программная среда. Также рекомендуется периодическое сохранение контрольных точек и мониторинг потерь на валидации, чтобы предотвратить снижение производительности и облегчить восстановление после прерванных сеансов обучения.

Предлагаемая работа вносит вклад в теоретическое развитие систем реконструкции культурного наследия на базе ИИ. Традиционные подходы к восстановлению изображений обычно рассматривают сегментацию изображения, реконструкцию и генерацию стиля как независимые процессы17,19,20,30. В отличие от них, в данном исследовании предлагается система, объединяющая эти процессы посредством стратегии генеративной реконструкции с использованием сегментации. Таким образом, работа способствует теоретическому развитию реконструкции культурного наследия с помощью ИИ, демонстрируя возможность объединения сегментации, реконструкции и генерации стиля в рамках единой системы. Такая интеграция особенно важна применительно к культурному наследию, где критически важным является сохранение структуры мотивов и семантического значения. С практической точки зрения предложенная система представляет собой эффективное решение для цифрового сохранения, реставрации и художественного улучшения традиционных культурных орнаментов. Институты культурного наследия, музеи и дизайнеры могут использовать SegCycle-SPADE для автоматического определения областей мотивов, реконструкции поврежденных или неполных узоров, а также для создания визуально улучшенных художественных репрезентаций традиционных дизайнов. Эта возможность особенно ценна для исчезающих ремесленных традиций, включая текстильные узоры батика народа мяо, где исторические артефакты могут быть частично повреждены или неполны. Кроме того, благодаря внедрению генеративного синтеза стиля, система может поддерживать современные приложения в области культурного дизайна, такие как дизайн текстиля, цифровое художественное творчество и образование в сфере наследия. Таким образом, предложенная система устраняет разрыв между сохранением культурного наследия и современными приложениями в области культурного дизайна.

Тем не менее, несмотря на многообещающие результаты, достигнутые с помощью предложенного фреймворка SegCycle-SPADE, ряд ограничений сохраняется. Во-первых, оценка проводилась с использованием только наборов данных Miao Batik и WikiArt, что может повлиять на обобщающую способность фреймворка при реконструкции других форм узоров культурного наследия. Во-вторых, поскольку процесс реконструкции опирается на модели на базе GAN, сгенерированные результаты могут время от времени содержать артефакты или неестественные текстуры при работе с высокосложными структурами мотивов. В-третьих, в настоящее время фреймворк ориентирован на реконструкцию двухмерных узоров, в то время как некоторые артефакты культурного наследия имеют изначально трехмерные структуры. В целом, результаты экспериментов демонстрируют эффективность предложенного фреймворка SegCycle-SPADE для художественной реконструкции узоров НМК. Интеграция семантической сегментации на базе SegFormer, CAFFM, реконструкции мотивов на базе CycleGAN и художественного синтеза на базе SPADE последовательно улучшила показатели сегментации, реконструкции и качества изображений. Исследования с использованием метода абляции дополнительно подтвердили вклад каждого компонента фреймворка, показав, что CAFFM и функция потерь сохранения мотивов существенно повысили структурную точность и визуальную аутентичность. Эти результаты подтверждают основную гипотезу о том, что реконструкция под руководством семантической сегментации в сочетании с объединением признаков с перекрестным вниманием может эффективно сохранять культурно значимые мотивы, создавая при этом художественно насыщенные результаты. Таким образом, предложенный фреймворк представляет собой надежный и воспроизводимый вычислительный подход для цифрового сохранения, реставрации и творстного возрождения узоров НМК.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Конфликт интересов:
Авторы заявляют об отсутствии конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность за академическую и институциональную поддержку, оказанную Гуандунским инженерным политехническим институтом и Южно-Китайским нормальным университетом в ходе проведения данного исследования. Данная работа была поддержана общим проектом Национального фонда социальных наук на 2023 год (№ 23BH161) под названием «Музей цифровой регенерации: исследование по активизации и популяризации культурных реликвий классической китайской каллиграфии и живописи».

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Оптимизатор AdamБиблиотека оптимизаторов PyTorchAdamАлгоритм оптимизации, используемый при обучении модели.
CUDA ToolkitNVIDIA CorporationCUDA 11.3GPU-ускорение для вычислений глубокого обучения.
cuDNNNVIDIA CorporationcuDNN 8.2Библиотека ускорения глубоких нейронных сетей, используемая для ускорения обучения и инференса.
CycleGANКалифорнийский университет в Беркли / Open SourceОфициальная реализация на PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Генеративно-состязательная сеть, используемая для реконструкции культурных мотивов.
Предобученные веса ImageNetImageNet / Open Sourcemit_b2.pth (предобученный чекпоинт ImageNet-1K)Используются для инициализации основы SegFormer-B2 перед тонкой настройкой на наборе данных Miao Batik.
Процессор IntelIntel CorporationIntel Core i7 (11-е поколение)ЦП, используемый для предобработки изображений, поддержки обучения модели и инференса.
MatplotlibКоманда разработки MatplotlibMatplotlib 3.5.1Визуализация кривых обучения и результатов оценки.
Набор данных Miao BatikРепозиторий ZenodoDOI: 10.5281/zenodo.20807658Набор данных культурных мотивов, содержащий 15 148 изображений, используемых для семантической сегментации и реконструкции паттернов.
NumPyРазработчики NumPyNumPy 1.21.5Численные вычисления и обработка наборов данных.
GPU NVIDIANVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Аппаратная платформа, используемая для обучения модели и инференса.
OpenCVOpenCV FoundationOpenCV 4.5.5Предобработка изображений, изменение размера, интерполяция и гауссово шумоподавление.
Операционная системаCanonical Ltd.Ubuntu 20.04 LTSСреда выполнения экспериментов.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Загрузка и манипулирование изображениями.
PythonPython Software FoundationPython 3.8.10Язык программирования, используемый для реализации и проведения экспериментов.
PyTorchMeta AIPyTorch 1.10.0Фреймворк глубокого обучения, используемый для обучения модели и инференса.
Случайное число (Seed)Настройка эксперимента42Фиксированное значение, используемое для разделения набора данных, инициализации модели и воспроизводимости экспериментов.
Scikit-learnРазработчики Scikit-learnScikit-learn 1.0.2Разделение набора данных, статистический анализ и метрики оценки.
SeabornСообщество Open SourceSeaborn 0.11.2Статистическая визуализация данных.
SegFormer-B2NVIDIA Research / Open SourceSegFormer-B2 (основа MIT-B2)Модель семантической сегментации на базе Transformer, используемая для сегментации культурных мотивов.
Маски сегментации / аннотацииНабор данных Miao BatikВключены в набор данныхМетки семантической сегментации на уровне пикселей, используемые для классификации мотивов и обучения.
SPADENVIDIA Research / Open SourceОфициальная реализация на PyTorch (https://github.com/NVlabs/SPADE)Модель синтеза изображений с управлением сегментацией, используемая для генерации художественных паттернов.
TorchVisionMeta AITorchVision 0.11.1Средства обработки изображений и преобразования наборов данных, используемые с PyTorch.
Набор данных WikiArtWikiArthttps://www.wikiart.org/Набор данных художественных стилей, содержащий более 80 000 произведений искусства в 27 художественных стилях, используемый для изучения и синтеза стилей.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Похожие статьи