$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предложенная структура SegCycle-SPADE предназначена для реконструкции и улучшения традиционных узоров культурного наследия посредством семантической сегментации, усиления признаков с помощью механизмов внимания, генеративной реконструкции и синтеза художественного стиля. В данном исследовании использовались общедоступные наборы данных изображений культурного наследия и произведений искусства, включая датасет Miao Batik и датасет WikiArt. В исследовании не принимали участия люди, не использовались данные пациентов, личная информация, подопытные животные или клинические записи; следовательно, одобрение институционального комитета по этике и информированное согласие не требовались. Для начала для оценки используются датасет культурных мотивов Miao Batik и датасет WikiArt. Датасет Miao Batik был описан в работе Quan et al. (2024)32 и содержит 15 148 аннотированных изображений традиционных мотивов батика народа мяо. Существующие аннотации, предоставленные создателями датасета, использовались напрямую, и в данном исследовании дополнительные ручные аннотации не создавались. Затем выполняется предварительная обработка изображений путем изменения размера, нормализации, шумоподавления и создания маски сегментации. Точные параметры предварительной обработки описаны в подразделе «Предварительная обработка данных». Предложенная структура использует модель на основе трансформера под названием SegFormer-B2 для семантической сегментации данных. Метод предназначен для обнаружения ключевых областей культурных мотивов и изучения их структур. Затем сегментированные признаки усиливаются с помощью механизма внимания, при котором важная информация, относящаяся к культурным мотивам, выделяется, а нерелевантная информация отсекается. Конфигурация механизма внимания описана в подразделе CAFFM. Затем усиленные признаки передаются через CycleGAN, где поврежденные структуры реконструируются посредством циклического обучения. В процессе обучения образцы неполных мотивов создавались искусственно путем применения операций случайного маскирования и частичного перекрытия к исходным изображениям батика Miao. Эти процедуры деградации имитировали недостающие области мотивов и структурные повреждения, часто наблюдаемые в разрушенных артефактах культурного наследия. Полученные неполные изображения использовались в качестве входных данных для модуля реконструкции CycleGAN, в то время как соответствующие оригинальные изображения служили целями реконструкции. Реконструированные узоры культурного наследия затем улучшаются с помощью SPADE, где художественное усиление выполняется на основе сгенерированных карт сегментации. Эффективность предложенной структуры оценивается с использованием количественных метрик сегментации и качества изображений, в то время как визуальная аутентичность реконструированных культурных мотивов оценивается качественно. Визуальная аутентичность оценивалась путем визуального осмотра сгенерированных культурных узоров и не использовалась в качестве независимой количественной метрики. Оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных характеристиках, структурной целостности и художественном облике по сравнению с соответствующими эталонными культурными мотивами. Количественная оценка производительности модели выполнялась с использованием показателей Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) и Fréchet Inception Distance (FID). На Рисунке 2 представлена общая схема рабочего процесса предложенной структуры SegCycle-SPADE и приведены метрики оценки, использованные в данном исследовании.

Рисунок 2. Общая схема архитектуры предлагаемого фреймворка SegCycle-SPADE. Обзор полного рабочего процесса SegCycle-SPADE. Изображения из наборов данных Miao Batik и WikiArt проходят предварительную обработку, после чего подвергаются семантической сегментации с помощью SegFormer-B2, усилению признаков с использованием CAFFM, реконструкции паттернов с помощью CycleGAN и генерации художественного стиля с использованием SPADE. Эффективность модели оценивается с помощью показателей Segmentation Accuracy, Intersection over Union (IoU), коэффициента Дайса (Dice Coefficient), индекса структурного сходства (SSIM), PSNR, расстояния Фреше (FID), в то время как визуальная аутентичность оценивается качественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Фреймворк SegCycle-SPADE для реконструкции паттернов культурного наследия разработан для интеграции нескольких компонентов глубокого обучения (DL) с целью точного сегментирования, реконструкции и художественного улучшения мотивов, как показано на Рисунке 2. Для обеспечения разнообразия культурных паттернов и художественных стилей используются изображения из набора данных культурных мотивов Miao Batik и набора данных WikiArt. Сначала изображения обрабатываются модулем семантической сегментации на базе SegFormer для идентификации и выделения культурных мотивов из фона. Общая архитектура состоит из четырех основных этапов. Во-первых, модель SegFormer извлекает карты семантической сегментации из изображений культурных паттернов. Во-вторых, CAFFM объединяет признаки сегментации с генеративными представлениями для улучшения обучения признаков. В-третьих, модуль CycleGAN реконструирует культурные паттерны, используя объединенные представления признаков. Наконец, модуль SPADE генерирует художественно улучшенные результаты, сохраняя структурную целостность за счет синтеза под управлением сегментации. Очищенные карты признаков затем обрабатываются модулем реконструкции CycleGAN, который обучается восстанавливать неполные культурные мотивы путем сопоставления деградировавших паттернов с их соответствующими полными формами. Образцы неполных мотивов были созданы путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik, имитируя тем самым области утраченных паттернов и структурную деградацию, часто наблюдаемую в поврежденных культурных артефактах. Каждое деградировавшее изображение было сопоставлено с соответствующим оригинальным изображением, которое служило целью реконструкции при обучении. Эта стратегия позволила модулю CycleGAN изучить восстановление отсутствующих структур мотивов при сохранении семантической согласованности и значимых культурных характеристик. Наконец, генератор SPADE создает визуально улучшенные художественные результаты, обуславливая синтез изображений сгенерированными картами сегментации, тем самым поддерживая структурную целостность культурных мотивов на протяжении всего процесса художественного улучшения.
Предлагаемая платформа SegCycle-SPADE включает следующие этапы.
Шаг 1: Сбор наборов данных
Для достижения целей изучения культурных паттернов и генерации художественного стиля были использованы два набора данных. Набор данных культурных мотивов мяо-батика (Miao Batik Cultural Motif Dataset) использовался для предоставления информации о традиционных культурных паттернах. Этот набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658) и содержит 15 148 аннотированных изображений традиционных мотивов мяо-батика. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Набор данных WikiArt использовался для предоставления разнообразной информации о художественных стилях для генерации художественного стиля и был получен из общедоступного репозитория WikiArt (https://www.wikiart.org/).
Этап 2: Предобработка данных
Все изображения прошли предварительную обработку, включающую изменение размера, нормализацию и шумоподавление. Для поддержки этапа семантической сегментации использовались имеющиеся аннотации культурных мотивов, полученные из исходных наборов данных. В рамках данного исследования дополнительные процедуры аннотирования или перемаркировки не проводились.
Шаг 3: Семантическая сегментация паттернов с помощью SegFormer
Для сегментации культурных мотивов использовалась модель SegFormer. Точная архитектура базовой сети (backbone) SegFormer и стратегия инициализации описаны в подразделе Semantic Pattern Segmentation Using SegFormer. В частности, для семантической сегментации мотивов применялась архитектура SegFormer-B2 с базовой сетью MIT-B2, предварительно обученной на наборе данных ImageNet. Эта модель эффективно улавливает глобальную контекстную информацию, сохраняя при этом сложные структурные детали традиционных культурных паттернов.
Шаг 4: CAFFM
CAFFM объединяет признаки семантической сегментации с генеративными представлениями, что позволяет системе изучать как характеристики структурных мотивов, так и информацию о художественном стиле. Подробности интеграции CAFFM приведены в подразделе CAFFM. Модуль расположен между этапом семантической сегментации на базе SegFormer и этапом генеративной реконструкции; в нем происходит слияние структурных признаков, полученных в результате сегментации, с признаками реконструкции посредством многоголового перекрестного внимания (multi-head cross-attention). Этот процесс улучшает сохранность культурных мотивов и повышает реалистичность реконструированных результатов.
Шаг 5: Реконструкция паттерна (CycleGAN)
Объединенные признаки затем обрабатываются модулем CycleGAN для реконструкции структур культурных паттернов. Архитектура CycleGAN и конфигурация обучения описаны в подразделе Реконструкция паттерна с помощью CycleGAN. Модуль реконструкции состоит из двух генераторов и двух дискриминаторов, использует архитектуру генератора на базе остаточной сети с девятью остаточными блоками, применяет дискриминатор PatchGAN и обучается с использованием функций потерь состязательности и циклической согласованности. Такая конфигурация обеспечивает двунаправленное отображение доменов и облегчает реконструкцию неполных структур культурных паттернов.
Шаг 6: Генерация художественного стиля (SPADE)
Затем реконструированные паттерны обрабатываются модулем SPADE для выполнения синтеза художественного стиля с направлением по сегментации. Конфигурация генератора SPADE описана в подразделе Генерация художественного стиля с использованием SPADE. Модуль использует остаточные блоки SPADE, слои пространственно-адаптивной нормализации и семантическое кондиционирование, полученное из карт сегментации SegFormer и признаковых представлений CAFFM. Благодаря кондиционированию генерации изображений по картам сегментации, синтезированные результаты сохраняют структурное соответствие оригинальным культурным мотивам, при этом приобретая характеристики художественного стиля.
Шаг 7: Оценка эффективности
Предложенная структура была оценена с использованием нескольких метрик сегментации и анализа качества изображений, включая точность сегментации, IoU, коэффициент сходства Dice (Dice), SSIM, PSNR и FID. Для оценки воспроизводимости экспериментов все опыты повторяли пять раз с использованием различных случайных чисел (seeds), результаты представлены как среднее значение ± стандартное отклонение. Статистическая значимость оценивалась с помощью парных t-критериев с порогом значимости p < 0,05.
Сбор наборов данных
В предлагаемой структуре SegCycle-SPADE для понимания культурных паттернов и изучения стиля используются два набора данных. Первый набор данных, применяемый в предлагаемой структуре, — это набор культурных мотивов батика народа мяо. Этот набор содержит культурные мотивы батика мяо, которые обычно представляют собой изображения традиционного батика мяо с такими мотивами, как животные, растения и геометрические фигуры, используемые в искусстве этнической группы мяо. Данный набор содержит изображения с богатой текстурной информацией, что обычно имеет важное значение для сохранения культурного наследия. Второй набор данных, используемый в предлагаемой структуре SegCycle-SPADE, — это набор данных WikiArt. Этот набор содержит огромное количество произведений искусства, относящихся к различным стилям. Он применяется для изучения сложных стилей, что обычно полезно для улучшения художественных произведений. Данный набор включает 80 000 произведений искусства в высоком разрешении (HD) с 27 различными вариантами дизайна, что делает его более эффективным для задач генерации или трансформации стиля на основе глубокого обучения (DL).
Набор данных Miao Batik:
Набор данных Miao Batik (https://doi.org/10.5281/zenodo.20807658) состоит из 15 148 изображений узоров батика, изображающих культурно значимые мотивы. Изображения включают разнообразные традиционные орнаменты, такие как анималистические мотивы (например, бабочки и рыбы), растительные узоры и геометрические мотивы, несущие культурный символизм. Данный набор данных является важным компонентом предлагаемой структуры, поскольку он предоставляет аутентичные культурные структуры, которые позволяют модулю сегментации точно определять и сохранять границы мотивов при реконструкции узора (Таблица 1). В данном исследовании под культурно значимыми мотивами понимаются символические визуальные элементы, обычно документируемые в литературе по культурному наследию народа мяо и представленные в аннотациях набора данных, включая птиц, бабочек, цветочные узоры и родовые тотемы. Эти мотивы были выбраны на основе их задокументированной культурной значимости и регулярного присутствия в традиционных дизайнах батика и вышивки мяо, а не только на основе частоты их появления или пространственной композиции. Аннотации мотивов и метки сегментации, выполненные под руководством экспертов, были взяты из первоначального источника набора данных Miao Batik и использовались в данном исследовании напрямую. Авторами не проводилось никаких дополнительных процедур ручного аннотирования, перемаркировки или аннотирования под руководством экспертов. Существующие аннотации, предоставленные создателями набора данных, использовались для обучения и оценки семантической сегментации.
| Параметр | Описание |
| Название набора данных | Набор данных культурных узоров батика народа мяо |
| Источник данных | Репозиторий Zenodo (DOI: 10.5281/zenodo.20807658) |
| Область применения | Нематериальное культурное наследие (НКН) / Анализ текстильных узоров |
| Общее количество изображений | 15 148 изображений |
| Тип изображения | Цифровые изображения традиционных текстильных узоров батика народа мяо |
| Категории паттернов | Зооморфные мотивы, растительные мотивы и геометрические мотивы |
| Культурное происхождение | Культура этнической группы мяо, провинция Гуйчжоу, Китай |
| Исходное разрешение изображения | Изображения высокого разрешения (как правило, ≥ 1000 пикселей по короткой стороне), полученные в виде необработанных сканов или фотографий до этапа предварительной обработки |
| Обучающее разрешение | Изображения были изменены до размера 256 × 256 пикселей в процессе предварительной обработки |
| Доступность аннотаций | Существующие аннотации сегментации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки. В данном исследовании не проводилось дополнительное ручное аннотирование, перемаркировка или процедуры экспертного подтверждения. |
| Применение в данном исследовании | Сегментация культурных мотивов, извлечение признаков, сохранение мотивов и реконструкция паттернов |
Таблица 1: Характеристики набора данных культурных узоров батика народа мяо.Сводка набора данных культурных мотивов батика мяо, используемого для семантической сегментации, анализа культурных узоров и реконструкции мотивов. В таблице описаны источник набора данных, характеристики изображений, категории мотивов, культурное происхождение, разрешение изображений и роль набора данных в предлагаемой структуре SegCycle-SPADE.
Набор данных WikiArt:
Набор данных WikiArt [https://www.wikiart.org/] представляет собой популярный крупномасштабный цифровой репозиторий произведений искусства, содержащий более 80 000 изображений, относящихся к 27 различным художественным стилям, указанным в Таблице 2. Эти стили включают в себя искусство Ренессанса, импрессионизм, кубизм и сюрреализм. Данный набор данных имеет важное значение в предлагаемой архитектуре, поскольку он предоставляет знания, позволяющие модулю SPADE создавать культурно обогащенные паттерны, сохраняя при этом структурную информацию, полученную в процессе сегментации. Набор данных включает 56 000 изображений для обучения и 12 000 изображений для валидации и тестирования. Изображения из этого набора данных способствуют эффективному обучению модели DL.
| Параметр | Описание |
| Название набора данных | Набор данных WikiArt |
| Источник набора данных | Репозиторий WikiArt (https://www.wikiart.org/) |
| Область применения | Цифровое искусство и живопись |
| Общее количество изображений | Приблизительно 80 000 произведений искусства |
| Обучающие изображения | 56,000 |
| Изображения для валидации | 12,000 |
| Тестовые изображения | 12,000 |
| Художественные стили | 27 художественных стилей, включая Ренессанс, импрессионизм, кубизм, сюрреализм, экспрессионизм, реализм и абстрактное искусство |
| Исходное разрешение изображения | Разрешение исходных изображений варьируется в зависимости от произведений искусства и источников. В ходе предварительной обработки изображения были приведены к единому разрешению 256 × 256 пикселей. |
| Разрешение обучения | Изображения были изменены до размера 256 × 256 пикселей в ходе предварительной обработки перед обучением художественному стилю и синтезом изображений под контролем сегментации. |
| Разбиение набора данных | Стратифицированное случайное разделение (70% — обучающая выборка, 15% — валидационная и 15% — тестовая) с использованием фиксированного случайного числа (seed) 42 |
| Стратегия выборки стилей | Для сохранения распределения 27 художественных стилей в обучающей, валидационной и тестовой подвыборках использовался метод стратифицированного пропорционального отбора. |
| Применение в данной работе | Обучение художественному стилю, репрезентация стиля и сегментационный синтез в художественном стиле |
Таблица 2: Характеристики набора данных WikiArt. Сводные данные о наборе данных WikiArt, используемом для обучения художественному стилю и синтеза изображений с заданным стилем. В таблице описаны источник набора данных, распределение изображений, охват художественных стилей, разделение набора данных, разрешение изображений и его применение в рамках предлагаемой структуры SegCycle-SPADE.
Набор данных Miao Batik содержит 15 148 изображений, представляющих традиционные культурные мотивы народа мяо.32 Набор данных находится в открытом доступе через Zenodo (https://doi.org/10.5281/zenodo.20807658). Перед обучением модели все изображения были визуально проверены, изменены по размеру до 256 × 256 пикселей, нормализованы и проверены на наличие поврежденных или дублирующих образцов. Скрининг контроля качества не привел к исключению каких-либо изображений; следовательно, все 15 148 изображений были сохранены для последующего анализа. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) подмножества с использованием фиксированного случайного значения seed 42 для обеспечения воспроизводимости разделения данных. Доступ к набору данных WikiArt был получен через официальный репозиторий WikiArt (https://www.wikiart.org/), который содержит более 80 000 произведений искусства, охватывающих 27 художественных стилей. Для экспериментов по изучению стиля было использовано 56 000 изображений для обучения, 12 000 для валидации и 12 000 для тестирования.
Предобработка данных
Перед обучением предлагаемой структуры SegCycle-SPADE набор данных культурных мотивов мяо-батика и набор данных WikiArt прошли несколько этапов предобработки для обеспечения однообразного качества изображений и точного представления признаков. К обоим наборам данных был применен один и тот же базовый конвейер предобработки, включающий гауссово шумоподавление, нормализацию, изменение размера до единого входного разрешения и проверку качества изображений. Тем не менее, наборы данных выполняли разные функции в рамках структуры. Набор данных WikiArt использовался для изучения и синтеза художественного стиля, в то время как набор данных мяо-батика применялся преимущественно для сегментации и реконструкции культурных мотивов. Помимо этих специфических задач, никаких изменений в предобработке конкретных наборов данных не вносилось. Для обеспечения согласованной обработки моделью DL изображения сначала были приведены к фиксированному разрешению. Этот шаг был необходим, поскольку изображения в обоих наборах данных имели разное разрешение в зависимости от источника. Изменение размера повысило вычислительную эффективность и предотвратило влияние размерных несоответствий на обучение. Вторым этапом предобработки была нормализация, при которой значения пикселей были масштабированы до стандартного диапазона для стабилизации обновлений градиента во время обучения. Затем изображения были обработаны с помощью гауссовой фильтрации для снижения уровня шума, который мог помешать определению структур культурных мотивов. Для набора данных мяо-батика существующие маски сегментации культурных мотивов, полученные непосредственно из первоначального источника данных, использовались без изменений для обучения и оценки семантической сегментации. Новые маски сегментации специально для данного исследования не создавались.
Если не указано иное, уравнения, описывающие общепринятые методы, были адаптированы из предыдущих исследований и процитированы соответствующим образом. Уравнения, описывающие предлагаемый метод CAFFM и комплексную структуру оптимизации SegCycle-SPADE, были разработаны авторами специально для данной работы.
Пусть входное изображение из набора данных будет представлено как Уравнение 1:
(1)
Здесь H, W и C обозначают высоту, ширину изображения и количество цветовых каналов соответственно. Все изображения приводятся к фиксированному размеру H′ × W′, как показано в Уравнении 2:

Здесь Ir — изображение измененного размера. Нормализованные значения пикселей вычисляются в соответствии с Уравнением 3:
(3)
Это способствует стабилизации процедуры обучения. Фильтрация шума выполняется с помощью фильтра Гаусса, как показано в Уравнении 4:

Здесь G(σ) — это фильтр Гаусса, а * обозначает операцию свертки. Был использован гауссов фильтр с ядром 5 × 5 и стандартным отклонением σ = 1.0. Для уменьшения краевых артефактов к граничным пикселям применялось зеркальное дополнение. Процесс шумоподавления выполнялся сразу после загрузки изображений, перед масштабированием и нормализацией. Для обеспечения единообразности предобработки на протяжении всего исследования одна и та же конфигурация фильтра применялась к каждому изображению в наборах данных Miao Batik и WikiArt. Для набора данных Miao Batik маски сегментации создаются в соответствии с Уравнением 5:

Здесь M — маска сегментации, используемая для управления моделью SegFormer.
Конвейер предварительной обработки начинается со сбора изображений из наборов данных Miao Batik и WikiArt, как показано на Рисунке 3. В процессе обучения методы аугментации данных не применялись. После предварительной обработки, которая включала изменение размера, нормализацию, гауссово шумоподавление и подготовку масок сегментации, изображения были непосредственно использованы для обучения, валидации и тестирования предлагаемой архитектуры SegCycle-SPADE. Первый этап конвейера предварительной обработки включает изменение размера изображений до фиксированного значения, что позволяет модели глубокого обучения обрабатывать изображения более эффективно. Второй этап включает нормализацию, которая приводит значения пикселей к стандартизированному числовому диапазону и способствует сходимости модели. Третий этап включает удаление шума, при котором из изображений удаляются нежелательные помехи для улучшения распознавания образов. Кроме того, для набора данных Miao Batik аннотируются области культурных мотивов, что позволяет создавать маски, используемые в модуле сегментации предлагаемой модели для обеспечения сохранности культурных мотивов в процессе генерации. Конечным результатом этого этапа является очищенный набор данных, готовый для обучения модулей сегментации и генерации предлагаемой модели.

Рисунок 3. Конвейер предварительной обработки данных для изображений культурного наследия. Схема рабочего процесса, иллюстрирующая процедуры предварительной обработки изображений, применяемые перед обучением модели. Конвейер включает сбор набора данных, изменение размера изображений, нормализацию, гауссово шумоподавление, аннотирование существующих культурных мотивов и подготовку масок сегментации. Полученные обработанные изображения и маски используются в качестве входных данных для семантической сегментации и реконструкции паттернов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Перед обучением модели каждое изображение прошло процедуру контроля качества. Набор данных Miao Batik содержал 15 148 изображений. Поврежденные, дублированные и низкокачественные образцы были удалены создателями исходного набора данных; следовательно, в ходе данного исследования при проверке качества дополнительные изображения не исключались. В результате для анализа были сохранены все 15 148 изображений. В процессе предобработки изображения загружались в формате RGB и масштабировались до размера 256 × 256 пикселей с использованием билинейной интерполяции. Значения пикселей были масштабированы из диапазона [0, 255] в диапазон [0, 1] путем деления на 255. Затем была выполнена поканальная нормализация с использованием средних значений [0.485, 0.456, 0.406] и значений стандартного отклонения [0.229, 0.224, 0.225] для красного, зеленого и синего каналов соответственно. Конвейер предобработки включал загрузку изображений, преобразование в RGB, изменение размера, масштабирование значений пикселей, нормализацию и преобразование в тензоры. При необходимости полутоновые изображения преобразовывались в трехканальный формат RGB для обеспечения совместимости с моделями DL. После предобработки изображения были разделены на обучающую, валидационную и тестовую выборки. На всех этапах архитектуры SegCycle-SPADE, включая семантическую сегментацию, слияние признаков, реконструкцию мотивов и художеческий синтез на основе SPADE, использовалось единое входное разрешение 256 × 256 пикселей.
Семантическая сегментация паттернов с помощью SegFormer
После этого этапа предобработки очищенные и нормализованные изображения из набора данных культурных мотивов Мяо Батик (Miao Batik) и набора данных WikiArt подаются в модуль семантической сегментации, основанный на предложенной архитектуре SegFormer-B2. Целью данного этапа является правильная идентификация и разделение культурных мотивов, присутствующих в традиционных паттернах. Предложенная архитектура SegFormer основана на трансформерной архитектуре, которая включает иерархический кодировщик Transformer и легковесный декодер MLP для точного захвата как глобальной контекстной информации, так и детальной структурной информации из сложных традиционных паттернов. Сначала модель извлекает признаки различных масштабов из входного изображения, после чего эти представления объединяются с помощью декодера для генерации точных сегментированных паттернов. Это гарантирует, что элементы на традиционном изображении будут правильно сегментированы на такие мотивы, как геометрические, растительные и символические узоры, отделяя их от фона при сохранении структурной целостности. Эта структурная информация впоследствии используется на более поздних этапах генерации паттернов в рамках архитектуры SegCycle-SPADE.
Пусть предварительно обработанное входное изображение будет представлено в виде Уравнения 6:
(6)
Энкодер SegFormer разделяет изображение на патчи и извлекает иерархические признаки с помощью трансформерных слоев, как показано в Формуле 71:

Здесь F обозначает многомасштабные карты признаков, полученные с помощью трансформерного энкодера. Эти признаки кодируют как локальные текстурные паттерны, так и глобальные контекстуальные связи между областями мотивов. Модель SegFormer извлекает карты признаков в разных масштабах, как определено в Уравнении 8:

Использование многомасштабных представлений облегчает обнаружение паттернов различных размеров в культурных мотивах. Наконец, признаки объединяются с помощью декодера MLP, как показано в Уравнении 91:

Здесь S обозначает итоговую прогнозируемую карту сегментации.
Основная сеть SegFormer-B2 была инициализирована с использованием весов, предобученных на ImageNet, и в дальнейшем дообучена на наборе данных Miao Batik для сегментации культурных мотивов. Предобученная контрольная точка была получена из официальной реализации SegFormer. В частности, для инициализации основной сети SegFormer-B2 перед дообучением использовалась контрольная точка MIT-B2 (mit_b2.pth), предобученная на ImageNet-1K и предоставленная официальным репозиторием SegFormer. Предобученные веса соответствуют основной сети MIT-B2, опубликованной авторами SegFormer, и служили моделью инициализации для обучения семантической сегментации. Остальные специфические для данной задачи слои были инициализированы с использованием стандартных процедур инициализации весов PyTorch перед началом обучения.
В архитектуре используется четырехэтапный иерархический кодировщик Transformer с перекрывающимися эмбеддингами патчей. На начальном этапе размер патча был установлен на 7 × 7 с шагом 4. Для каждого из четырех этапов кодировщика размерности эмбеддингов составляли 64, 128, 320 и 512. На этих четырех этапах использовалось 1, 2, 5 и 8 голов многоголового самовнимания (multihead self-attention), а соответствующая глубина кодировщика составляла 3, 4, 6 и 3 слоя. Многомасштабные признаки, полученные от кодировщика, агрегировались с помощью легковесного декодера на базе MLP. Перед созданием итоговой карты сегментации декодер проецировал признаки с каждого этапа кодировщика в единое пространство эмбеддингов. Во всех блоках Transformer использовалась функция активации Gaussian Error Linear Unit (GELU). Для улучшения обобщающей способности и снижения переобучения в процессе обучения использовался коэффициент дропаута 0.1.
На этапе обучения фреймворк SegFormer получает предварительно обработанные изображения из обоих наборов данных. Изображения из набора данных Miao Batik содержат области мотивов, которые служат метками для контролируемого обучения модели сегментации. Трансформерный энкодер обрабатывает все изображение и фиксирует дальние зависимости между компонентами изображения, что особенно важно для традиционных узоров батика, содержащих пространственно распределенные мотивы. Механизм иерархического извлечения признаков одновременно улавливает локальные структуры, такие как повторяющиеся геометрические текстуры. MLP-декодер обрабатывает эти извлеченные признаки и создает маску сегментации, выделяющую области мотивов. Карты сегментации, созданные на этом этапе, впоследствии используются в качестве структурных входных данных для модуля внимания и этапа реконструкции узора, что способствует сохранению аутентичности генерируемых паттернов.
Культурные мотивы были разделены на разные классы для семантической сегментации в соответствии с их визуальными и культурными характеристиками. Таксономия сегментации включала анималистические мотивы (например, бабочек, рыб, птиц и другую символическую фауну), растительные мотивы (например, цветы, листья, лозы и ботанические узоры), геометрические мотивы (например, повторяющиеся фигуры, бордюры и абстрактные геометрические структуры), а также фоновые области, представляющие зоны без мотивов. Для присвоения каждому пикселю одного из предопределенных классов использовались маски сегментации на уровне пикселей. Целочисленные метки были закодированы следующим образом: Метка 0 = фон, Метка 1 = анималистические мотивы, Метка 2 = растительные мотивы и Метка 3 = геометрические мотивы. Аннотации сегментации и метки мотивов были получены непосредственно из исходного набора данных Miao Batik. В данном исследовании не проводилось дополнительной ручной разметки, переименования меток, проверки границ или процедур экспертного подтверждения. Существующие аннотации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки.
Модель SegFormer для сегментации культурных мотивов обрабатывает предварительно подготовленные изображения из набора данных Miao Batik и набора данных WikiArt, используя механизм на основе трансформера для точного обнаружения областей с культурными узорами, как показано на рисунке 4. Сначала в модель SegFormer подается входное изображение, содержащее традиционные культурные мотивы. Энкодер Transformer извлекает как глобальную контекстную информацию, так и локальные структурные признаки из патчей изображения. Полученные многомасштабные признаки передаются в декодер сегментации, который использует смешанную сеть прямого распространения (Mix Feed-Forward Network) для уточнения представлений признаков и улучшения обнаружения мотивов. Результатом работы модели SegFormer является маска сегментации, которая выделяет пиксели, соответствующие культурным узорам, подавляя при этом нерелевантную информацию фона. Изолированные культурные узоры затем служат структурным руководством для последующих этапов фреймворка SegCycle-SPADE.

Рисунок 4. Семантическая сегментация культурных мотивов на базе SegFormer-B2. Архитектура модуля семантической сегментации SegFormer-B2, используемого для извлечения культурных мотивов и обученного исключительно на наборе данных Miao Batik. Структура состоит из кодировщика на базе Transformer для многомасштабного извлечения признаков и легковесного декодера сегментации для генерации масок мотивов. Модель предсказывает четыре семантических класса — животное, растение, геометрический объект и фон, при этом полученные маски сегментации определяют культурно значимые области мотивов, подавляя иррелевантную информацию фона. Результаты сегментации служат структурным руководством для последующих этапов слияния признаков, реконструкции и художественного синтеза в рамках предлагаемой архитектуры SegCycle-SPADE. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
В предлагаемом подходе нет необходимости создавать новые аннотации сегментации. Набор данных Miao Batik был получен из уже существующего открытого источника, а модель была обучена с использованием соответствующей информации о мотивах, предоставленной создателями набора данных. В процессе обучения модель SegFormer генерировала карты семантической сегментации. В результате в данном исследовании не потребовалось никакого дополнительного программного обеспечения для ручной аннотации, руководств по разметке или процедур контроля качества аннотирования.
CAFFM
Для улучшения взаимодействия между признаками семантической сегментации и представлениями генеративной реконструкции в исследовании также был предложен модуль CAFFM. Энкодер SegFormer-B2 передает семантические карты признаков в модуль CAFFM, в то время как этап реконструкции CycleGAN предоставляет генеративные карты признаков. Сначала слои линейного проецирования используются для отображения обоих потоков признаков в общее пространство эмбеддингов. Для вычисления перекрестного внимания (cross-attention) на основе сгенерированных тензоров признаков создаются представления запроса (Q), ключа (K) и значения (V). Затем с помощью многоголового перекрестного внимания моделируются взаимосвязи между информацией о структурных мотивах и элементами художественного стиля. К объединенным представлениям признаков затем применяются нормализация слоя, остаточные связи и полносвязные слои с функцией активации GELU. Этап синтеза на базе SPADE получает выходные данные модуля CAFFM, что позволяет сохранить культурно значимые темы без ущерба для художественной целостности.
Для обеспечения совместимости признаков входные признаки сначала проецируются с помощью слоев линейной проекции в общее пространство эмбеддингов с размерностью эмбеддинга 256. Затем взаимосвязи между семантической структурной информацией и представлениями генеративного стиля моделируются с использованием механизма многоголового перекрестного внимания (MultiHead Cross-Attention) с восемью головами внимания. Вычисление перекрестного внимания осуществляется с использованием векторов запроса (Query, Q), ключа (Key, K) и значения (Value, V), которые создаются специальными слоями линейного преобразования. Для повышения стабильности обучения и сохранения целостности признаков используются остаточные связи (residual connections) и послойная нормализация (Layer Normalization) для дальнейшего улучшения объединенного представления признаков. Затем нелинейное обучение признаков совершенствуется путем применения сети прямого распространения с функцией активации GELU (Gaussian Error Linear Unit). Модуль генерирует выходное представление признаков размерностью 256, которое передается на другие этапы для творческого синтеза. CAFFM успешно объединяет данные о художественном стиле со структурами культурных мотивов с помощью метода слияния на основе перекрестного внимания, что улучшает сохранность мотивов и визуальную связность в реконструированных узорах культурного наследия.
В предлагаемой системе структурные признаки извлекаются из набора данных Miao Batik, в то время как стилистические признаки изучаются на основе набора данных WikiArt. Пусть карта признаков, полученная с помощью сети сегментации SegFormer с использованием изображений из набора данных Miao Batik, обозначается как Fs, а карта признаков, полученная из ветви извлечения стилистических признаков с использованием изображений WikiArt, обозначается как Fa. Предлагаемый модуль CAFFM объединяет два домена признаков с помощью механизма перекрестного внимания (cross-attention) для изучения как структурных, так и стилистических зависимостей культурных узоров. В таблице 3 приведены все архитектурные характеристики, включая размерности эмбеддингов, слои нормализации, функции активации и конфигурацию голов внимания. При размере входного изображения 256 × 256 пикселей кодировщик SegFormer-B2 создавал семантические карты признаков размером 64 × 64 × 128, в то время как ветвь извлечения стилистических признаков создавала карты признаков размером 64 × 64 × 128. Обе карты признаков проецировались через обучаемые линейные слои в общее пространство эмбеддингов размерности 256 перед слиянием с помощью перекрестного внимания.
| Параметр | Конфигурация |
| Предлагаемая концепция | SegCycle-SPADE |
| Модель семантической сегментации | SegFormer-B2 |
| Этапы кодировщика SegFormer | 4 |
| Инициализация весов | Предобученная на ImageNet-1K модель SegFormer-B2 (с базовой сетью MIT-B2) |
| Источник контрольной точки | Официальный репозиторий NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); контрольная точка: segformer.b2.512x512.ade.160k |
| Стратегия тонкой настройки | Сквозная тонкая настройка на наборе данных Miao Batik |
| Размер встраивания патча | 7 × 7 |
| Шаг патча | 4 |
| Размерности эмбеддингов | 64, 128, 320 и 512 |
| Глубина энкодера | 3, 4, 6 и 3 |
| Механизмы внимания (Attention Heads) | 1, 2, 5 и 8 |
| Тип декодера | Декодер на базе исключительно MLP |
| Функция активации | GELU (Gaussian Error Linear Unit — Гауссова линейная единица с ошибкой) |
| Доля выбывших | 0.1 |
| Модуль улучшения признаков | Модуль слияния культурных признаков на основе перекрестного внимания (CAFFM) |
| Размерность вложения CAFFM | 256 |
| Механизмы внимания CAFFM | 8 |
| Шкалы слияния CAFFM | 4 |
| Модель реконструкции | CycleGAN |
| Модель генерации стиля | SPADE |
| Культурный набор данных | Набор данных Miao Batik |
| Набор данных о стиле | Набор данных WikiArt |
| Изображения батика народа мяо | 15,148 |
| Изображения WikiArt | Приблизительно 80 000 |
| Разрешение входного изображения | 256 × 256 пикселей |
| Формат цвета | RGB |
| Метод интерполяции | Билинейная интерполяция |
| Метод шумоподавления | Гауссова фильтрация |
| Размер ядра Гаусса | 5 × 5 |
| Сигма (σ) распределения Гаусса | 1 |
| Диапазон нормализации | [0, 1] |
| Размер партии | 16 |
| Количество эпох | 100 |
| Оптимизатор | Адам |
| Скорость обучения | 0.0002 |
| Параметры Adam | β₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, weight decay = 0 |
| Функции потерь | Потери сегментации, адверсарные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля |
| Стратегия разделения набора данных | Обучение / Валидация / Тестирование |
| Обучающая выборка | 70% |
| Валидационная выборка | 15% |
| Тестовый набор | 15% |
| Случайное число (seed) | 42 |
| Метрики оценки | Точность сегментации, IoU, коэффициент Дайса, SSIM, PSNR и FID |
| Язык программирования | Python 3.8.10 |
| Среда глубокого обучения | PyTorch 1.10.0 |
| Аппаратная платформа | Графический процессор NVIDIA RTX 3090 (24 ГБ VRAM), Intel Core i7 (11-го поколения), 32 ГБ ОЗУ |
| Рабочая среда | Ubuntu 20.04 LTS |
Таблица 3: Экспериментальная установка и конфигурация модели. Сводка архитектурных компонентов, конфигурации обучения, настроек предобработки, наборов данных, параметров оптимизации, метрик оценки и вычислительной среды, использованных для реализации и оценки предлагаемого фреймворка SegCycle-SPADE.
Модуль внимания сначала отображает карту признаков в представления запроса (query), ключа (key) и значения (value) с помощью Уравнения 10:

Здесь Wq, Wk и Wv представляют собой обучаемые матрицы весов. Веса внимания рассчитываются на основе сходства между вектором запроса и вектором ключа с помощью Уравнения 1117:

Здесь dk — это размерность вектора ключа. Улучшенное представление признаков вычисляется путем умножения весов внимания на матрицу значений с использованием Уравнения 12:

Здесь Fa представляет собой улучшенное представление признаков карты признаков. Улучшенное представление признаков вычисляется путем объединения исходных признаков сегментации с улучшенными признаками, полученными с помощью механизма внимания, согласно Уравнению 13:
Здесь Fe — это улучшенная карта признаков, используемая для реконструкции паттерна. CAFFM дополнена многомасштабным механизмом перекрестного внимания для извлечения признаков культурных мотивов в разных масштабах. Пусть Fsi обозначает признаки сегментации в масштабе i, а Faj — признаки художественного стиля в том же масштабе. Окончательное представление признаков определяется с помощью Уравнения 14:

Здесь Qi, Ki и Vi представляют собой матрицы запроса (query), ключа (key) и значения (value) соответственно на масштабе i, а N обозначает количество масштабов признаков. В данном исследовании N = 4, что соответствует картам признаков, извлеченным при пространственных разрешениях 1/4, 1/8, 1/16 и 1/32 от размера входного изображения. Эти многомасштабные представления признаков объединялись с использованием обучаемых весов внимания перед этапами реконструкции и художественного синтеза. Приведенное расширение позволяет методу извлекать глобальные культурные мотивы и текстуры для реконструкции культурных паттернов. Модуль CAFFM расположен между стадией сегментации на базе SegFormer и стадией творческого синтеза на базе SPADE в предлагаемой системе SegCycle-SPADE. Сначала, в то время как CycleGAN параллельно создает признаки реконструкции со стилистической и паттерн-зависимой информацией, SegFormer-B2 восстанавливает семантические карты признаков, которые описывают структурные свойства культурных мотивов. Модуль CAFFM принимает эти два потока признаков и использует слияние на основе перекрестного внимания (cross-attention) для выявления взаимосвязей между структурными и художественными представлениями. Для создания культурно достоверных паттернов при сохранении семантической согласованности и структурных особенностей полученные объединенные карты признаков затем направляются в модуль SPADE для творческого синтеза под управлением сегментации.
Реконструкция узоров с помощью CycleGAN
После завершения этапа усиления признаков на основе механизма внимания карты признаков будут содержать усиленные структуры культурных мотивов. Тем не менее, карты признаков все еще могут содержать неполные или поврежденные области узора. Поэтому для решения задачи реконструкции узоров в предлагаемой архитектуре будет использоваться модель CycleGAN. В данной архитектуре двумя доменами будут оригинальные узоры культурных мотивов и реконструированные узоры культурных мотивов. Используя усиленные признаки с предыдущих этапов, модель CycleGAN восстановит культурные узоры, сохраняя при этом структурную целостность. Это обеспечит сохранение пространственного расположения таких культурных узоров, как геометрические, цветочные и символические орнаменты. Исходные изображения батика народа мяо были подвергнуты операциям случайного маскирования и частичного перекрытия для создания неполных или поврежденных культурных мотивов. Эти процедуры деградации имитировали отсутствие фрагментов узора и структурные повреждения, часто наблюдаемые в deteriorated объектах культурного наследия. Деградированные изображения использовались в качестве входных данных для модуля реконструкции, в то время как соответствующие оригинальные изображения служили эталонными для оценки эффективности и качества реконструкции. Такая стратегия позволила модели изучить восстановление недостающих структур мотивов при сохранении семантической целостности и культурных особенностей.
Пусть X будет областью неполных культурных паттернов, а Y — областью реконструированных культурных паттернов. Два генератора обучаются выполнять двунаправленное отображение, используя Уравнение 15:

Здесь GE используется для реконструкции структур мотивов, а FM — для отображения паттернов обратно на исходный домен. Состязательная функция потерь используется для обеспечения реалистичности реконструированных паттернов (Уравнение 16)30

Здесь DY — это дискриминатор, используемый для различения реальных и реконструированных паттернов, а GE(x) обозначает сгенерированный реконструированный паттерн. CycleGAN также обеспечивает циклическую согласованность для сохранения структурного расположения культурных мотивов (Уравнение 17)30.

Итоговая функция потерь определяется с помощью Уравнения 1830:

Здесь λi обозначает весовой коэффициент функции потерь циклической согласованности, который в процессе обучения был установлен равным 10, что соответствует исходной формулировке CycleGAN. Данное значение было выбрано для обеспечения баланса между состязательным обучением и согласованностью реконструкции между исходным и целевым доменами.
Модуль реконструкции CycleGAN состоит из двух генераторов и двух дискриминаторов для двунаправленного преобразования изображений. Каждый генератор построен на архитектуре остаточной сети, включающей начальный сверточный слой 7 × 7, за которым следуют два сверточных слоя понижения дискретизации, девять остаточных блоков и два слоя повышения дискретизации. Во всех операциях свертки используется размер ядра 3 × 3, за исключением входного слоя, где для улучшенного извлечения признаков применяется ядро 7 × 7. После каждого сверточного слоя применяется Instance Normalization для повышения стабильности обучения, а во всей сети генератора используется функция активации ReLU. В выходном слое применяется функция активации Tanh для получения нормализованных выходных изображений. Дискриминатор построен на архитектуре PatchGAN 70 × 70, состоящей из ряда сверточных слоев с размером ядра 4 × 4 и постепенно увеличивающимся количеством каналов признаков. В дискриминаторе используются Instance Normalization и активация LeakyReLU (отрицательный наклон = 0.2) для улучшения дискриминации признаков и состязательного обучения. Модуль CycleGAN принимает на вход предварительно обработанные изображения культурных мотивов и генерирует реконструированные представления паттернов, которые затем передаются в CAFFM для интеграции с признаками сегментации. Обучение CycleGAN проводилось с использованием оптимизатора Adam (β₁ = 0.5, β₂ = 0.999) с начальной скоростью обучения 0.0002. Скорость обучения поддерживалась на этом уровне в течение первых 100 эпох, а затем линейно снижалась до нуля в течение оставшегося периода обучения. Для стабилизации обучения дискриминатора использовался буфер воспроизведения (replay buffer), содержащий 50 ранее сгенерированных изображений. Обновление генераторов и дискриминаторов происходило в соотношении 1:1: одно обновление генератора сменялось одним обновлением дискриминатора в каждой итерации обучения.
Процесс реконструкции CycleGAN основан на улучшенных картах признаков, полученных с помощью механизма CAFFM, показанного на рисунке 5. Карты признаков содержат усиленные культурные мотивы, полученные на предыдущих этапах сегментации и CAFFM. Эти карты признаков используются в качестве входных данных для первого генератора GE. Первый генератор GE изучает отображение, необходимое для реконструкции культурных паттернов. Затем выходные данные подаются на дискриминатор DY для разграничения реальных культурных паттернов и реконструированных паттернов. Дискриминатор DY помогает генератору GE создавать реалистичные результаты. Чтобы культурные паттерны не искажались в процессе реконструкции, второй генератор FM выполняет циклическое согласованное отображение (cycle-consistency mapping). Второй генератор FM отображает выходные данные обратно в исходную область. Затем результаты оцениваются дискриминатором для проверки реалистичности. Итоговые результаты впоследствии передаются в модуль SPADE для генерации художественного стиля на следующем этапе предлагаемой архитектуры SegCycle-SPADE.

Рисунок 5. Схема реконструкции узоров на основе CycleGAN. Рабочий процесс модуля реконструкции CycleGAN. В качестве входных данных для сети-генератора используются представления признаков с механизмом внимания для реконструкции незавершенных культурных мотивов. Дискриминатор оценивает реконструированные результаты по отношению к эталонным узорам, в то время как циклическое согласованное отображение обеспечивает сохранение структурной целостности при двунаправленном преобразовании изображений. Реконструированные мотивы затем передаются в модуль SPADE для синтеза художественного стиля. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Генерация художественного стиля с использованием SPADE
В дальнейшем реконструированные культурные мотивы подвергаются обработке модулем SPADE для генерации художественного стиля. Основная цель модуля SPADE заключается в добавлении более насыщенных визуальных текстур художественного стиля к реконструированным культурным мотивам без нарушения их структурной компоновки. Модуль SPADE представляет собой метод условной генерации изображений, использующий концепцию сегментации изображений для создания новых визуальных образов. Многоканальные семантические карты, соответствующие предопределенным классам мотивов, были закодированы на основе масок семантической сегментации, полученных с помощью SegFormer-B2. Эти закодированные карты поступали на вход генератора SPADE в качестве условий. Параметры пространственно-адаптивного масштабирования (γ) и смещения (β) формировались путем обработки семантических карт сверточными слоями внутри каждого слоя SPADE. Таким образом, генератор мог сохранять границы мотивов, структурную компоновку и семантическую информацию в процессе художественного синтеза, применяя эти параметры к нормализованным активациям признаков. Семантическое управление могло влиять как на высокоуровневую структурную реконструкцию, так и на низкоуровневый синтез текстур, поскольку процесс кондиционирования осуществлялся на нескольких слоях генератора SPADE. В результате созданные художественные паттерны включали в себя стилистические черты, заимствованные из набора данных WikiArt, при сохранении структур культурных мотивов, выявленных на этапе сегментации.
В качестве основного ресурса для изучения художественных стилей использовался набор данных WikiArt, включающий работы из 27 различных категорий искусства, таких как Ренессанс, импрессионизм, кубизм, экспрессионизм, сюрреализм, реализм и абстрактное искусство. Для того чтобы модель была ознакомлена с разнообразными творческими особенностями и улучшилась генерализация стилей, в процессе обучения изображения стилей выбирались случайным образом из различных категорий. Набор данных был разделен на обучающую, валидационную и тестовую подвыборки с сбалансированным представлением художественных категорий для снижения систематической ошибки стиля. Для обеспечения сбалансированного представления всех 27 художественных категорий использовалось стратифицированное сэмплирование. Образцы из каждой категории пропорционально распределялись между обучающей, валидационной и тестовой подвыборками с сохранением исходного распределения классов. Модуль CAFFM использовался для объединения аспектов стиля, извлеченных из изображений WikiArt, с признаками реконструкции, созданными CycleGAN. Полученные объединенные представления подавались в качестве кондиционирующей информации в генератор SPADE, чтобы сеть синтеза могла переносить художественные качества, сохраняя при этом семантическую структуру и границы культурных мотивов, полученные из карт сегментации. Благодаря этому методу кондиционирования стиля предложенная архитектура смогла создавать культурно достоверные художественные паттерны с согласованными структурными и стилистическими представлениями.
SPADE также вводит пространственно-адаптивные параметры, которые зависят от карты сегментации. Эти параметры могут быть определены так, как показано в Уравнении 191:

Здесь γ(S) — это пространственно меняющийся параметр масштаба, а β(S) — пространственно меняющийся параметр смещения. Эти параметры помогают генератору создавать различные текстуры и стили в зависимости от семантической области на изображениях. Итоговое произведение культурного искусства может быть определено следующим образом, как показано в Уравнении 20:

Здесь GE — это генератор SPADE, XrP — реконструированный паттерн, а SM — карта сегментации. Итоговое произведение сохраняет структурную целостность культурных мотивов, улучшая при этом художественный вид. Для оптимизации предложенной архитектуры SegCycle-SPADE использовалась композитная функция потерь, которая балансирует точность семантической сегментации, сохранность культурных мотивов, качество реконструкции паттерна и согласованность художественного стиля. Общая цель обучения была определена как взвешенная смесь потерь сегментации (Lseg), адверсариальных потерь (Ladv), потерь циклической согласованности (Lcycle), потерь реконструкции (Lrecon), потерь сохранения мотивов (Lmotif) и потерь согласованности стиля (Lstyle). Общая функция потерь определена в Уравнении 21:
(21)
Для обеспечения структурного соответствия между исходными и реконструированными культурными мотивами коэффициент потери циклической согласованности (cycle-consistency loss) был установлен на уровне 10. Чтобы сохранить детализированные признаки мотивов и повысить визуальную точность, коэффициент потери реконструкции (reconstruction loss) был установлен на уровне 5. Для подчеркивания сохранения культурно значимых структурных паттернов в процессе художественного синтеза для потери сохранения мотивов (motif-preservation loss) использовался коэффициент 2. Чтобы способствовать переносу художественного стиля без чрезмерного искажения семантических структур мотивов, коэффициент потери согласованности стиля (style-consistency loss) был скорректирован до 1. Для поддержания сбалансированного вклада между созданием реалистичного изображения и точной сегментацией мотивов потерям сегментации и состязательным потерям (adversarial losses) были присвоены равные веса. Для расчета потери согласованности стиля использовались представления стиля на основе признаков из набора данных WikiArt. В частности, характеристики художественного стиля фиксировались с помощью корреляций матрицы Грама, полученных из карт глубоких признаков. Для вычисления потери стиля использовалась разность норм Фробениуса между матрицами Грама целевого изображения стиля и сгенерированного изображения, как показано в формуле 22:

Здесь, Gл вычисляется ли матрица Грама на основе лПожалуйста, предоставьте текст для перевода. слой объектов, ЯПоскольку вы не предоставили исходный текст для перевода, пожалуйста, отправьте контент, который необходимо перевести на русский язык. Я готов приступить к работе в соответствии с вашими инструкциями по профессиональному научному переводу для JoVE. обозначает созданное художественное изображение, Ястиль обозначает целевое изображение стиля из набора данных WikiArt, и F обозначает норму Фробениуса. Такая формулировка позволяет предложенному фреймворку сохранять художественные особенности, поддерживая при этом структурную и семантическую целостность культурных мотивов.
Объединенные представления признаков, создаваемые модулем CAFFM, используются в качестве обусловляющих входных данных для модуля SPADE, который служит компонентом художественного синтеза предлагаемой структуры. Генератор SPADE состоит из семи остаточных блоков SPADE с размерностью латентных признаков 256 каналов и генерирует выходные изображения с разрешением 256 × 256 пикселей. Карты семантической сегментации, полученные от модуля SegFormer–CAFFM, используются в качестве обусловляющих входных данных на всех остаточных слоях SPADE. Слои SPADE применяются перед функциями активации в каждом остаточном блоке, что обеспечивает семантическое обусловливание под управлением сегментации. Посредством последовательных операций повышения дискретизации и свертки латентное представление признаков постепенно уточняется для генерации художественных паттернов высокого разрешения при сохранении семантической согласованности и структуры мотивов. В генераторе повсеместно используются функции активации LeakyReLU, а на выходном слое применяется функция активации Tanh для получения нормализованных изображений.
Алгоритм и рабочий процесс
Структура SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию паттернов и синтез художественного стиля в рамках единого конвейера обучения. Рабочий процесс начинается со сбора и предобработки набора данных, включая изменение размера изображений, нормализацию, шумоподавление и подготовку масок сегментации. Предобработанные изображения затем обрабатываются с помощью сети сегментации SegFormer-B2 для извлечения семантических представлений мотивов. Полученные признаки сегментации объединяются с признаками реконструкции через CAFFM, что обеспечивает взаимодействие между структурной информацией о мотивах и представлениями художественных особенностей. Объединенные карты признаков затем подаются в модуль реконструкции CycleGAN, который восстанавливает неполные структуры культурных мотивов, сохраняя семантическую целостность. Реконструированные паттерны впоследствии передаются генератору SPADE для управляемого сегментацией художественного синтеза, что позволяет улучшить стилистику при сохранении границ мотивов и структурной аутентичности. В процессе обучения параметры модели оптимизируются с использованием составной функции потерь, описанной в Уравнениях 21 и 22, которая балансирует точность сегментации, сохранность мотивов, качество реконструкции и согласованность художественного стиля. Подробный пошаговый процесс реализации, включая загрузку данных, предобработку, инициализацию модели, итерации обучения, процедуры валидации, выбор контрольных точек и окончательную оценку, представлен в Дополнительном файле 1 (Алгоритм 1). Полный алгоритмический рабочий процесс был реализован с размером пакета 16, скоростью обучения 0.0002 и 100 эпохами обучения. Для разделения набора данных, инициализации модели и всех экспериментов по обучению использовался фиксированный случайный seed 42. Этот seed последовательно применялся в генераторах случайных чисел Python, NumPy и PyTorch для обеспечения воспроизводимости. Оптимизатор Adam был настроен с β₁ = 0.5, β₂ = 0.999 и без распада весов (weight decay = 0). Контрольные точки модели выбирались на основе наивысшего показателя IoU, достигнутого на валидационном наборе данных.
Оптимизация функции потерь
Для сохранения структур культурных мотивов при реконструкции и художественном синтезе в предлагаемой архитектуре используется комбинированная целевая функция оптимизации, которая объединяет потери сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля. Полная математическая формулировка, весовые коэффициенты и определение потерь стиля приведены в уравнениях 21 и 22 в подразделе Artistic Style Generation using SPADE. Компонент сохранения мотивов штрафует структурные отклонения между предсказанными областями мотивов и соответствующими масками сегментации истинных значений (ground-truth), тем самым способствуя сохранению культурно значимых структур узоров на протяжении всего процесса реконструкции.