Artykuł metodologiczny

Wielowidokowa struktura sieci Vision Mamba w kształcie litery U do segmentacji obrazów medycznych

DOI:

10.3791/72616

7 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół opisuje, jak skonstruować, wytrenować i wycenić wieloperspektywiczną ramę sieci Vision Mamba w kształcie litery U dla segmentacji obrazów medycznych, umożliwiającą powtarzalną segmentację zmian skórnych i narządów jamy brzusznej poprzez standaryzowane przygotowanie zestawu danych, implementację modelu i ocenę wydajności.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentacja obrazów medycznych wymaga metod obliczeniowych, które dokładnie uchwytują globalny kontekst, lokalne granice oraz struktury anatomiczne wieloskalowe, zachowując jednocześnie możliwość reprodukcji w różnych zastosowaniach. W tym artykule przedstawiono protokół budowy, trenowania i oceny Multi-view Vision Mamba U-Shaped Network framework dla dwuwymiarowej segmentacji obrazów medycznych. Protokół zapewnia możliwość reprodukcji procesu, który obejmuje pozyskiwanie publicznego zbioru danych, przetwarzanie obrazu i maski, budowę sieci, trenowanie modelu, wybór punktów zapisu i ilościową oraz jakościową ocenę wydajności. Framework włącza skanowanie cech wielowidokowych, aby uchwycić uzupełniające informacje przestrzenne, konturowe, skalowe i graniczne, oraz stosuje wieloetapowe łączenie cech w architekturze kodera-dekodera w kształcie U w celu poprawy integracji cech podczas segmentacji. Protokół jest demonstrowany przy użyciu publicznie dostępnych zbiorów danych dotyczących segmentacji zmian skórnych i narządów jamy brzusznej. Zgodnie z opisanym przepływem implementacji, framework osiąga konkurencyjną wydajność segmentacji przy użyciu standardowych metryk ewaluacji. Dzięki przestrzeganiu procedur przedstawionych w tym protokole, naukowcy mogą odtworzyć implementację modelu, wytrenować sieć przy użyciu określonych ustawień eksperymentalnych, ocenić wydajność segmentacji oraz dostosować przepływ pracy do pokrewnych zadań segmentacji obrazów medycznych wymagających rozbudowanej analizy opartej na nauce głębokiej.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentacja obrazów medycznych jest podstawowym zadaniem w dziedzinach komputerowego widzenia i analizy obrazów medycznych1,2,3. Polega ona na podziale obrazu na wiele regionów lub obiektów w celu dalszej analizy i przetwarzania. Ta technologia jest szczególnie ważna w obrazowaniu medycznym, ponieważ pomaga klinicystom w identyfikacji i lokalizacji patologicznych regionów, poprawiając dokładność diagnostyki i planowanie leczenia. Wraz z rozwojem technologii obrazowania medycznego, takich jak rezonans magnetyczny (MRI), tomografia komputerowa (CT) i tomografia emisyjna z pozytonami (PET), zapotrzebowanie na dokładne techniki segmentacji obrazów medycznych stale rośnie. Obecne metody segmentacji obrazów medycznych można ogólnie podzielić na trzy główne podejścia: metody oparte na konwolucyjnych sieciach neuronowych (CNN)4, metody oparte na Transformerach5oraz metody oparte na modelach przestrzeni stanów (SSM)6,7. Metody oparte na CNN zazwyczaj wykorzystują architekturę sieci w kształcie litery U do segmentacji obrazów medycznych. Najczęściej stosowaną architekturą w tej kategorii jest U-Net8, która wykazała skuteczność architektury U-shaped encoder-decoder do segmentacji obrazów biomedycznych. U-Net3+ łączy gęste połączenia pomijaj-sie z UNet++9z pełnymi połączeniami pomijaj-sie, aby poprawić agregację cech wieloskalowych. Jednak metody oparte na CNN mają ograniczoną zdolność do rejestrowania zależności długoterminowych i dlatego mogą nieskutecznie modelować informacje kontekstowe na dłuższą metę.

Metody oparte na Transformerach skutecznie rejestrują zależności długoterminowe poprzez mechanizm samouważania, który umożliwia równoległe obliczenia i przypisuje różne wagi uwagi do różnych regionów zainteresowania. UNETR++10 wprowadza moduł Efficient Paired Attention (EPA), aby zmniejszyć liczbę parametrów i koszt obliczeniowy. nnFormer11 łączy przeplatane operacje konwolucyjne i samouważania oraz wprowadza mechanizm samouważania lokalno-globalnego oparty na objętości do uczenia się reprezentacji objętościowych w trójwymiarowym (3D) segmentowaniu obrazów medycznych. H2Former12 proponuje wydajny hierarchiczny hybrydowy Vision Transformer, który łączy mechanizmy uważności z ekstrakcją cech opartą na CNN w enkoderze. Jednak metody oparte na Transformerach wykazują kwadratowe złożoność obliczeniową wraz ze wzrostem długości sekwencji, co skutkuje znacznie wyższym kosztem obliczeniowym. Rycina 1 ilustruje motywację dla MVM-UNet i porównuje proponowaną strategię skanowania wielopunktowego z istniejącymi ramami segmentacji opartymi na SSM.

figure-introduction-1
Rycina 1. Porównanie MVM-UNet z istniejącymi czystymi architekturami segmentacji opartymi na modelu przestrzeni stanów (SSM). Porównanie między konwencjonalnym czystym szkieletem segmentacji opartym na modelu przestrzeni stanów (SSM) a zaproponowaną architekturą Multi-View Mamba U-Net (MVM-UNet). Górny panel przedstawia MVM-UNet, w którym moduł Multi-View 4-Directional (MV4D) wyodrębnia uzupełniające cechy za pomocą skanowania w zygzak, hierarchiczne, spiralne i radialne pary skanów, które są zintegrowane przez Spatial Fusion Mamba (SFusion Mamba), podczas gdy Multistage Fusion Mamba (MFusion Mamba) agreguje wieloskalowe cechy enkodera przed dekodowaniem. Dolny panel przedstawia reprezentatywną czystą architekturę opartą na SSM z modułami Selective Scan 2-Dimensional (SS2D) z przecinającym się skanowaniem. Rycina podkreśla różnice architektoniczne między konwencjonalnymi sieciami segmentacji opartymi na SSM a zaproponowanym MVM-UNet. Proszę kliknąć tutaj, aby wyświetlić większą wersję tej ryciny.

Metody oparte na SSM łączą globalną zdolność modelowania Transformerów z liniową złożonością obliczeniową. Architektura Mamba selektywnie przetwarza informacje wejściowe za pomocą wyborowego modelu przestrzeni stanów (Selective-SSM), umożliwiając modelowi dynamiczne dostosowywanie jego parametrów zgodnie z wejściem, filtrując nieistotne informacje i podkreślając informacyjne cechy. Vim13i VMamba14 adaptują architekturę Mamba do zadań widzenia komputerowego. U-Mamba15 stosuje hybrydową architekturę CNN-SSM, aby zbadać zastosowanie SSM w segmentowaniu obrazów medycznych, podczas gdy Mamba-UNet16 przyjmuje w pełni opartą na SSM architekturę enkodera-dekodera do segmentowania obrazów medycznych. Te metody osiągają konkurencyjną wydajność, używając znacznie mniej parametrów. Jednak obecne metody oparte na SSM/Mamba przede wszystkim wyodrębniają cechy obrazów za pomocą prostych plam obrazowych i strategii skanowania SS2D, co ma kilka ograniczeń dla segmentowania obrazów medycznych. Po pierwsze, SS2D i techniki oparte na plamach są przede wszystkim zaprojektowane do og

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To nie to. Badanie to opierało się wyłącznie na publicznie dostępnych i anonimizowanych zbiorach obrazów medycznych, w tym ISIC 2017, ISIC 2018 i Synapse. W niniejszym badaniu nie zebrano nowych danych dotyczących osób, zwierząt ani identyfikowalnych prywatnych informacji medycznych. Zestaw danych ISIC 2017 użyty w niniejszym badaniu to zestaw danych dotyczący segmentacji obrazów zmian skórnych w ramach wyzwania ISIC 2017, uzyskany z oficjalnego zbioru danych wyzwania International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2017). Wersja zestawu danych użyta w niniejszym badaniu odpowiada zadaniu segmentacji zmian skórnych ISIC 2017 i obejmuje oficjalne podziały na zbiór treningowy, walidacyjny i testowy. Zestaw danych został pobrany 15 marca 2024 r. Zestaw danych ISIC 2018 użyty w niniejszym badaniu to zestaw danych dotyczący segmentacji granic zmian w ramach zadania 1 wyzwania ISIC 2018, uzyskany z oficjalnego zbioru danych wyzwania International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2018). Wersja zestawu danych użyta w niniejszym badaniu odpowiada zadaniu ISIC 2018: Segmentacja granic zmian. Zestaw danych został pobrany 8 lipca 2024 r.

Zestaw danych Synapse użyty w niniejszym badaniu to zestaw danych dotyczący segmentacji wieloatlasowej poza czaszką w badaniach tomografii komputerowej jamy brzusznej, uzyskany z repozytorium Synapse pod identyfikatorem dostępu syn3193805 (https://www.synapse.org/Synapse:syn3193805). Zestaw danych użyty w niniejszym badaniu odpowiada powszechnie stosowanej 30-przypadkowej bazie danych dotyczącej segmentacji wielu narządów w badaniach tomografii komputerowej jamy brzusznej. Pobrany archiwum to Abdomen/RawData.zip, dostępne pod identyfikatorem dostępu syn3193805. Repozytorium nie dostarczyło oddzielnej wersji numerycznej, etykiety wydania ani oznaczenia daty wydania w momencie pobrania. Zgodnie z przyjętym wcześniej standardem, do treningu użyto 18 przypadków, a do testowania 12 przypadków. Podział danych przeprowadzono zgodnie z listą przypadków stosowanych przez TransUNet23. Konkretnie, przypadki treningowe to case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 i case0037, zaś przypadki testowe to case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 i case0035. Zestaw danych został pobrany 9 lipca 2024 r. Ponieważ w niniejszym badaniu użyto wyłącznie publicznie dostępnych i anonimizowanych zestawów danych i nie zebrano nowych danych dotyczących osób, nie było konieczności uzyskania zgody Komitetu Etyki Instytucjonalnej na eksperymenty komputerowe opisane w niniejszym protokole. Nie uzyskano formalnego pisemnego zwolnienia z obowiązku zgody Komitetu Etyki Instytucjonalnej. Jeśli wymagane jest to przez lokalną politykę instytucjonalną, naukowcy powinni uzyskać zwolnienie z obowiązku zgody Komitetu Etyki Instytucjonalnej przed przeprowadzeniem wtórnych analiz publicznie dostępnych zestawów danych. W niniejszym badaniu nie było dostępne żadne numeryczne odniesienie do zwolnienia Komitetu Etyki Instytucjonalnej ani formalnej dokumentacji zwolnienia.

1. Przygotowanie zestawów danych

  1. Pobierz zestaw danych dotyczący segmentacji zmian skórnych ISIC 2017 z oficjalnego repozytorium International Skin Imaging Collaboration. Użyj oficjalnych podziałów na zbiór treningowy, walidacyjny i testowy. Upewnij się, że zestaw danych zawiera 2000 obrazów do treningu, 150 obrazów do walidacji i 600 obrazów do testowania.
  2. Pobierz zestaw danych dotyczący segmentacji zmian skórnych ISIC 2018 z oficjalnego repozytorium International Skin Imaging Collaboration. Użyj oficjalnych podziałów na zbiór treningowy, walidacyjny i testowy. Upewnij się, że zestaw danych dotyczący segmentacji zawiera 2594 obrazy do treningu, 100 obrazów do walidacji i 1000 obrazów do testowania.
  3. Pobierz zestaw danych dotyczący segmentacji wieloorganowej Synapse. Użyj standardowego podziału składającego się z 18 przypadków (2212 przekrojów osierdziowych) do treningu i 12 przypadków (1567 przekrojów osierdziowych) do testowania. Nie wprowadzaj osobnego zestawu walidacyjnego.
    1. Zarezerwuj 12 przypadków testowych wyłącznie na ocenę końcową. Nie używaj przypadków testowych do treningu modelu, dostrojenia hiperparametrów ani do selekcji modelu. Zadanie dotyczące segmentacji obejmuje osiem narządów jamy brzusznej: aortę, woreczek żółciowy, śledzionę, nerkę lewą, nerkę prawą, wątrobę, trzustkę i żołądek.
    2. Użyj następującego podziału zestawu danych Synapse. 18 przypadków treningowych to case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 i case0037. 12 przypadków testowych

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Oczekiwane wyniki i interpretacja
Jeśli protokół jest wdrożony poprawnie, przeszkolony model MVM-UNet ma osiągać stabilną wydajność segmentacji w wielokrotnych uruchomieniach, z tylko niewielkimi różnicami między różnymi losowymi ziarnami dla większości metryk oceny. Dla ISIC 2017 i ISIC 2018, pomyślne wyniki odzwierciedlają się w wysokich wartościach DSC, mIoU, Acc, Sen i Spe, wraz z przewidzianymi maskami zmian, które ściśle naśladują granice rzeczywistych zmian (Rysunki 6 i 7). Dla Synapse, pomyślne wyniki odzwierciedlają się w wysokich wartościach średniego DSC i niskich wartościach HD95 dla przednich narządów (Rysunek 8). Podczas realizacji protokołu, metryki ilościowe należy interpretować razem z odpowiadającymi im wynikami jakościowymi segmentacji. Model, który osiąga wysokie DSC, ale wykazuje wycieki granic, pominięcie małych struktur lub fragmentowane predykcje, powinien być uważany tylko za częściowo udany, a procedurę przetwarzania wstępnego, wybór punktów kontrolnych i ustawienia inferencji należy zweryfikować.

figure-results-1
Rysunek 6. Reprezentatywne jakościowe wyniki segmentacji na zbiorze danych ISIC 2017. Reprezentatywne jakościowe wyniki segmentacji uzyskane na zbiorze danych International Skin Imaging Collaboration (ISIC) 2017 do segmentacji zmian skórnych. Każdy przykład pokazuje oryginalny obraz dermatoskopowy (Obraz), odpowiadającą mu maskę segmentacji rzeczywistej (GT) oraz predykcje wygenerowaną przez MVM-UNet (Pred). Reprezentatywne przypadki testowe ilustrują wydajność segmentacji dla zmian o różnej wielkości, morfologii i złożoności granic. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 7. Reprezentatywne jakościowe wyniki segmentacji na zbiorze danych ISIC 2018. Reprezentatywne jakościowe wyniki segmentacji uzyskane na zbiorze danych International Skin Imaging Collaboration (ISIC) 2018 do segmentacji zmian skórnych. Każdy przykład pokazuje oryginalny obraz dermatoskopowy (Obraz), odpowiadającą mu maskę segmentacji rzeczywistej (GT) oraz predykcje wygenerowaną przez MVM-UNet (Pred). Reprezentatywne przypadki testowe demonstrują wydajność segmentacji dla zmian o zróżnicowanej morfologii i charakterystyce granic. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-3
Rysunek 8. Reprezentatywne jakościowe wyniki segmentacji na zbiorze danych Synapse do wieloorgonowej tomografii komputerowej. Reprezentatywne jakościowe wyniki wieloorgonowej segmentacji uzyskane na zbiorze danych Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Każdy przykład pokazuje oryginalny obraz tomografii komputerowej (Obraz), odpowiadającą mu adnotacje rzeczywistego narządu (GT) oraz predykcje wygenerowaną przez MVM-UNet (Pred). Przykłady reprezentatywne dla zmian ilustrują zgodność między przewidywaną a referencyjną segmentacją dla wielu narządów jamy brzusznej. Prosimy kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Wydajność na ISIC 2017
Aby ocenić reprodybowalność MVM-UNet, wszystkie główne eksperymenty porównawcze zostały powtórzone przy użyciu trzech niezależnych ziaren losowych (1, 52 i 100), a wyniki są podawane jako średnia ± SD. Statystyczna istotność została oceniona za pomocą testu Wilcoxona opartego na sparowanych wynikach dla każdego obrazu dla ISIC 2017 i ISIC 2018 oraz sparowanych wynikach dla każdego przypadku dla Synapse. Analiza statystyczna została przeprowadzona na podstawie sparowanych wartości metryk, a nie średnich wartości na poziomie ziaren. Aby zapewnić uczciwe porównanie, wyniki podawane jako średnia ± SD zostały odtworzone przy użyciu oficjalnych implementacji w ramach tego samego podziału zbiorów danych, rozdzielczości wejściowych i metryk oceny, o ile to możliwe, podczas gdy pojedyncze wartości wyników zostały zachowane z odpowiednich oryginalnych publikacji.

MVM-UNet został oceniony na zbiorze danych ISIC 2017 do segmentacji zmian skórnych i porównany z reprezentatywnymi metodami segmentacji, w tym UNet8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół opisuje MVM-UNet, strukturę segmentacji obrazów medycznych opartą na Mamba. Metoda została zaprojektowana, aby rozwiązać dwie ograniczenia istniejących modeli segmentacji. Po pierwsze, konwencjonalne metody oparte na CNN mają ograniczoną zdolność do modelowania zależności dalekiego zasięgu i hierarchicznych informacji kontekstowych w złożonych obrazach medycznych43. Po drugie, metody oparte na Transformerach mogą modelować globalny kontekst, ale zwykle wymagają wyższych kosztów obliczeniowych23,25. MVM-UNet wykorzystuje architekturę Mamba13,14,15,16,17,18,19,20 do osiągnięcia wydajnego modelowania na odległym zasięgu i wprowadza skanowanie wielowidokowe oraz wieloetapowe łączenie funkcji, aby poprawić dokładność segmentacji. Z perspektywy wykonania protokołu i reprodukowalności, kilka kroków jest kluczowych dla uzyskania wyników porównywalnych z tymi zgłoszonymi w tej pracy. Po pierwsze, podział zbioru danych, skalowanie obrazu, interpolacja masek, strategia normalizacji i konwersja kanałów powinny być spójne z protokołem, ponieważ różnice w przetwarzaniu wstępnym mogą bezpośrednio zmieniać dystrybucję wejścia i granice masek. W szczególności maski segmentacji powinny być skalowane za pomocą interpolacji najbliższych sąsiadów, aby uniknąć wprowadzania niecałkowitych wartości etykiet44. Po drugie, konfiguracja treningowa, w tym rozdzielczość wejściowa, wielkość partii, ustawienia optymalizatora, harmonogram szybkości uczenia, losowe nasienie, współczynniki wag straty, reguła wyboru checkpointu i próg wnioskowania lub operacja argmax, powinny być sprawdzone przed porównaniem wyników. Jeśli odtworzone wyniki są wyraźnie niższe niż wartości zgłoszone, użytkownicy powinni najpierw zweryfikować ścieżkę do zbioru danych, format adnotacji, konwencję etykiety tła-pierwszego planu, ładowanie checkpointu, podział na walidację lub testowanie oraz procedurę obliczania metryki. Wycieki graniczne, rozdrobnione maski lub brak małych struktur zwykle wskazują na potencjalne niezgodności w przetwarzaniu wstępnym, interpolacji masek, wyborze checkpointu lub post-processingu wnioskowania.

Głównym wkładem MVM-UNet jest moduł MV4D. W przeciwieństwie do prostych strategii skanowania dwuwymiarowego stosowanych w poprzednich architekturach opartych na modelach przestrzeni stanów14,15,16,17,18,19,20, MV4D wykorzystuje pary skanów w kształcie zęba piaskowca, hierarchiczne, spiralne i radialne, aby uchwycić uzupełniające informacje wizualne. Pary skanów w kształcie zęba piaskowca pomagają zbilansować lokalne i globalne informacje przestrzenne, pary skanów hierarchicznych zwiększają ekstrakcję funkcji wieloskalowych, pary skanów spiralnych wzmacniają globalną reprezentację konturów, a pary skanów radialnych poprawiają ekstrakcję funkcji krawędzi i granic lokalnych. SFusion Mamba następnie integruje te uzupełniające modalności skanowania. Reprezentatywne wyniki i eksperymenty ablacyjne (Tabele 4 i 5; Rysunek 9) pokazują, że zarówno różnorodność wzorców skanowania, jak i mechanizm fuzji przyczyniają się do poprawy wydajności segmentacji. Innym ważnym komponentem jest MFusion Mamba, który służy jako moduł fuzji funkcji międzyenkoderem a dekoderem. Konwencjonalne architektury w kształcie litery U, w tym U-Net8,21, V-Net44 oraz wiele późniejszych wariantów9,23,25, przede wszystkim przenoszą informacje poprzez połączenia pomijakowe etapowo. Ta strategia może nie w pełni wykorzystywać uzupełniające wieloetapowe reprezentacje enkodera. MFusion Mamba radzi sobie z tym ograniczeniem, łącząc funkcje enkodera poprzez Grupowanie Grube i Drobne przed dekodowaniem. Reprezentatywne wyniki (Tabela 6; Rysunek 10) pokazują, że MFusion Mamba konsekwentnie poprawia wydajność segmentacji, co wskazuje, że wyraźna wieloetapowa fuzja funkcji jest korzystna dla segmentacji obrazów medycznych.

Metodyczny wkład MVM-UNet należy rozumieć jako przeprojektowanie na poziomie architektury, a nie wynalazek każdej pojedynczej operacji od zera. Architektury enkodera-dekoder w kształcie litery U, połączenia resztowe, warstwy projekcyjne i bloki Mamba/model przestrzeni stanów (SSM) były dogłębnie badane w poprzednich badaniach8,13,14,15,16,17,18,

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konkurencyjnych interesów finansowych.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie nie otrzymało żadnego zewnętrznego finansowania.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage.Computational platform for training, validation, testing, ablation, and inference-only experiments.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationNVIDIA A800 GPU (80 GB memory).GPU-accelerated model training and inference.
Hardware - Central processing unit (CPU)Intel Corporation / AMD13th Gen Intel Core i9-13900K CPU.Host processor for data loading, preprocessing, and experiment execution.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB system RAMMemory for dataset loading, preprocessing, and training.
Hardware - StorageInstitutional computing platform / local workstation2 TB NVMe solid-state drive.Storage for datasets, checkpoints, logs, and generated prediction figures.
Software environment - Operating systemCanonical Ltd.Recommended: Ubuntu 22.04.1 LTSOperating system for the computational environment.
Software environment - Conda environmentAnaconda, Inc. / MinicondaEnvironment name: mvmunetPython environment used to install and isolate dependencies.
Software environment - PythonPython Software FoundationPython 3.8Programming language used for implementation and experiment execution.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8GPU computing backend required by PyTorch and Mamba-related packages.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.GPU-accelerated deep-learning primitives used through PyTorch.
Python package - PyTorchPyTorchtorch == 2.0.1Deep-learning framework for model training, loss calculation, optimization, and inference.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Image transform utilities used in preprocessing and augmentation.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Installed with the recommended PyTorch environment.
Python package - timmtimm developerstimm == 0.4.12Model-component or utility dependency listed in the repository environment instructions.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0Dependency used by GPU-accelerated sequence modeling components.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Efficient causal convolution dependency required by the Mamba implementation.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1State-space sequence modeling package used for Mamba/S6-related components.
Python package - NumPyNumPy developersNumPy version 1.24.3.Numerical computation and array operations.
Python package - SciPySciPy developersSciPy version 1.10.1.Scientific computation; scipy.ndimage.zoom is imported in utils.py.
Python package - SimpleITKInsight Software ConsortiumSimpleITK version 2.2.1.Medical image input/output and preprocessing utility imported in utils.py.
Python package - MedPyMedPy developersMedPy version 0.4.0.Medical image metric calculation package imported in utils.py.
Python package - scikit-imagescikit-image developersscikit-image version 0.21.0.Image-processing dependency listed in README.
Python package - scikit-learnscikit-learn developersscikit-learn version 1.3.2.Machine-learning utility package listed in README.
Python package - matplotlibMatplotlib developersMatplotlib version 3.7.2.Used for saving qualitative visualization figures.
Python package - h5pyh5py developersh5py version 3.9.0.HDF5 file support for Synapse test volumes.
Python package - thopTHOP developersTHOP version 0.1.1.post2209072238.Used when calculating FLOPs and parameter-related computational cost.
Python package - packagingPython Packaging Authoritypackaging version 23.1.Dependency listed in README.
Python package - pytestpytest developerspytest version 7.4.0.Dependency listed in README.
Python package - chardetchardet developerschardet version 5.2.0.Dependency listed in README.
Python package - yacsYACS developersyacs version 0.1.8.Configuration utility dependency listed in README.
Python package - termcolortermcolor developerstermcolor version 2.3.0.Logging/terminal utility dependency listed in README.
Python package - submititsubmitit developerssubmitit version 1.4.5.Experiment/job utility dependency listed in README.
Python package - tensorboardXtensorboardX developerstensorboardX version 2.6.2.2.Training log visualization utility listed in README.
Python package - ml-collectionsml_collections developersml-collections version 0.1.1.Imported by configs/config_setting_synapse.py.
Dataset - ISIC 2017 Challenge datasetInternational Skin Imaging CollaborationISIC 2017 skin lesion segmentation datasetPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - ISIC 2018 Challenge Task 1 datasetInternational Skin Imaging CollaborationISIC 2018 Task 1: Lesion Boundary SegmentationPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault datasetSynapse / Sage BionetworksAccession identifier: syn3193805Public abdominal CT multi-organ segmentation dataset.
Data organization - ISIC 2017 data folderAuthors / repository layoutdata/isic2017/Expected local folder containing train and validation images/masks.
Data organization - ISIC 2018 data folderAuthors / repository layoutdata/isic2018/Expected local folder containing train and validation images/masks.
Data organization - Synapse data folderAuthors / repository layoutdata/Synapse/Expected local folder for Synapse lists, train_npz, and test_vol_h5.
Source code - MVM-UNet source-code repositoryAuthors / GitHubBranch: master;Git commit hash: ee891b42c2f083c4990eed72f1d4463adc5e103e.Complete source-code implementation of the protocol.
Source code - ISIC configuration fileAuthorsconfigs/config_setting.pyConfiguration file for ISIC-style binary segmentation.
Source code - Synapse configuration fileAuthorsconfigs/config_setting_synapse.pyConfiguration file for Synapse multi-organ segmentation.
Source code - ISIC training scriptAuthorstrain.pyTraining and validation entry point for ISIC-style binary segmentation.
Source code - Synapse training scriptAuthorstrain_synapse.pyTraining and validation entry point for Synapse multi-class segmentation.
Source code -

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

MedycynaNumer 234Numer 234Du y model j zykowySSMUNet

Powiązane artykuły