Methodenartikel

Innovative hybride CNN-Transformer-Deep-Learning-Modelle zur automatisierten Diagnose von Affenpocken anhand medizinischer Bilder

DOI:

10.3791/70533

29. Mai 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Verwendung einer kuratierten Sammlung von 2.280 Hautläsionsbildern führte zu einem standardisierten binären Deep-Learning-Workflow, um das Vorhandensein von Mpox in jedem Bild zu klassifizieren. Ein maßgeschneidertes und InceptionV3, ResNetV2, ResNet50, DenseNet121 und ein hybrides CNN-Transformator-Modell wurden im Kontext einer gemeinsamen Vorverarbeitungs- und Trainingspipeline verglichen.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das visuelle Erscheinungsbild von Affenpocken-Hautläsionen ist aufgrund ihrer Ähnlichkeit mit anderen vesikulären und pustulären Hauterkrankungen weiterhin schlecht belegt. Diese Arbeit testete die Hypothese, dass ein hybrides Deep-Learning-Modell, integriert mit konvolutionalen und transformatorbasierten Feature-Encodern, mpox-Bilder automatisch innerhalb einer einheitlichen experimentellen Pipeline klassifizieren kann. Um Konsistenz zwischen Modellen und Berichten sicherzustellen, wurde die Hauptanalyse als binäre Aufgabe durchgeführt: mpox vs. andere Bedingungen mit derselben oder ähnlicher Darstellung. Diese Benchmarkdaten bestanden aus 2.280 Bildern: 1.020 mpox und 1.260 nicht-mpox Läsionen. Die Bilder wurden auf eine Standard-Eingabegröße von 150 × 150 Pixel heruntergebacken, und die Werte lagen im Bereich [0, 1]. Während der Ausbildung wurden die Bilder durch Rotation, Translation, Scherung, Zoom und horizontales Umdrehen ergänzt. Ein benutzerdefiniertes sequentielles CNN, InceptionV3, ResNetV2, ResNet50, DenseNet121 und eine vorgeschlagene hybride CNN-Transformator-Architektur wurden verglichen. Jedes Basismodell wurde über 15 Epochen mit dem Adam-Optimierer und binären Kreuzentropieverlust trainiert. Trainings- und Validierungsgenauigkeit, Verlust, Präzision, Rückruf, F1-Wert und Fläche unter der Empfänger-Funktionscharakteristik wurden gemessen, um die Leistung, soweit möglich, zu bewerten. Die bestberichtete interne Validierungsgenauigkeit wurde mit dem sequentiellen CNN beobachtet, und das Hybridmodell erreichte eine Genauigkeit von 98,50, einen Rückruf von 98,50 und einen F1-Wert von 98,58, was ein ausgewogenes diskriminierendes Profil ergab. InceptionV3 zeigt Anzeichen von Überanpassung, und ResNetV2 lieferte nicht genügend Validierungsdaten, um einen robusten Generalisierungstest zu unterstützen. Insgesamt kann das Hybridmodell als tragfähige und ausgewogene Strategie betrachtet werden und nicht unbedingt besser als alle Basislinien.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die automatisierte und schnelle Erkennung von Mpox in medizinischen Fällen ist klinisch bedeutsam, da die Erkrankung bei der ersten visuellen Untersuchung verschiedenen anderen vesikulären oder pustelartigen Ausbrüchen ähneln kann. Kliniker achten in der Praxis nicht alleine auf die Morphologie der Läsionen, sondern kombinieren Muster, Verbreitung, Anamnese, Expositionsrisiko, epidemiologischen Kontext und Laborbestätigung1. Dennoch nutzen Computergeräte Bilder und können auch ein hilfreiches Triageverfahren in Umgebungen durchführen, in denen eine fachkundige dermatologische Überprüfung eingeschränkt oder verzögert ist. Es ist besonders anwendbar, wenn es um Ausbruchsverfolgung, teledermatologische Screenings und Einrichtungen geht, die ressourcenbegrenzt sind und eine beträchtliche Anzahl möglicher Fälle aufweisen, die priorisiert für bestätigende Tests benötigt werden sollten.

Auch die auf Deep Learning basierenden Ansätze haben sich als attraktiv für diese Aufgabe erwiesen, da sie diskriminierende Bilder von Läsionen entdecken können, ohne manuell erstellte Deskriptoren zu verwenden2. Die beliebteste Literaturübersicht gehört weiterhin zu den konvolutionellen neuronalen Netzwerken, da sie wirksam sind bei lokaler Textur, Farbumfang und Wiedererkennung von Läsionenrändern3. Neuere Arbeiten haben dieses Paradigma mit Hilfe von Transfer Learning, Aufmerksamkeitsmechanismen und Transformatormodulen weiterentwickelt, die versuchen, eine größere räumliche Abhängigkeit des Bildes zu modellieren. Dennoch weist die Literatur zu mpox eine hohe berichtete Leistung auf, die mit Vorsicht betrachtet werden sollte. Eine große Vielfalt von Studien nutzt spärliche öffentliche Datensätze, hat unterschiedliche Mengen heterogener Klassen oder vergleicht Ergebnisse mit verschiedenen Vorverarbeitungs- und Validierungsregimen4. Aus diesem Grund gibt es häufig das Dilemma, ob Leistungssteigerungen das Ergebnis eines wirklich überlegenen Modells, einer wünschenswerten Aufteilung, einer kräftigen Augmentation oder Ungleichheiten in der Formulierung der zugrunde liegenden Aufgabe sind.

Mpox bleibt eine der bedeutendsten Infektionskrankheiten mit negativen Auswirkungen auf die öffentliche Gesundheit, da seine Läsionen mit Hautinfektionen während derErstuntersuchung während der Erstuntersuchung scheinbar mit anderen vesikulären und pustelartigen Läsionen an der Schnittstelle verwechselt werden können. Praktisch stellen Kliniker ihre Diagnose von Mpox nicht basierend auf der Morphologie: Muster, Verbreitung, Anamnese, Epidemiologie und Laborbestätigung sind Bestandteile der Diagnoseentscheidung6. Dennoch können sie mit Hilfe von Rechengeräten, die auf den Bildern basieren, eine vorteilhafte Rolle im Triageprozess spielen, insbesondere wenn die Erfahrungen der Dermatologen entweder unzureichend, langsam oder nicht verfügbar sind. Sie könnten in der Teledermatologie anwendbar sein, in Fällen, in denen ein Ausbruch mit Screening behandelt werden soll, und an Orten mit begrenzten Ressourcen, in denen Verdachtsfälle auf der Prioritätenliste schnell behandelt werden müssen7.

Deep-Learning-basierte Methoden, da sie das Erlernen diskriminierender Läsionsrepräsentationen ermöglichen, wären für diese Aufgabe attraktiv, da sie solche Darstellungen ohne handgefertigte Deskriptoren lernen, abhängig von den Eigenschaften der Eingabebilder8. Im Bereich der dermatologischen Bilder ist es ein großer Hype, konvolutionelle neuronale Netzwerke (CNNs) zur Bildanalyse zu nutzen, da sie die Fähigkeit besitzen, lokale Textur, die Peripherie von Läsionen und die Bedeutung der exquisiten Morphologie zu kodieren. Spätere Studien haben dieses Paradigma durch Transfer Learning, Aufmerksamkeit und transformatorbasierte Submodule bereitgestellt, um allgemeinere räumliche Beziehungen und kontextuelle Trends zu erlernen9. Dennoch ist die Literatur zur Mpox-Bildgebung weiterhin heterogen. Es ist nicht ungewöhnlich, dass die Leistung nicht nur auf der Architekturauswahl, sondern auch auf der Datensatzstruktur, dem Erweiterungsplan, der Klassendefinition und derValidierungsstruktur 10 basiert. Gute Schlagzeilenperformance bedeutet also nicht zwangsläufig eine erhöhte Verallgemeinerung.

In der aktuellen Arbeit wird dieses Problem durch die Verwendung eines wahrnehmbareren und intern konsistenten binären mpox-Bildklassifikations-Benchmarks11 gelöst. Sie behandelt nicht den Beitrag im Format, eine völlig neue hybride Architektur vorzuschlagen, da CNN-Transformator-Methoden bereits inder Literatur verstreut wurden. Vielmehr führt das Experiment einen Standardvergleich mit expliziter primärer binärer Zerlegung ein, bei dem die zusätzlichen Multiklassen-Beweisstücke, die Vorverarbeitung/das Training und die Modellleistung protokollfreundlich betrachtet werden und die Modellleistung im Vergleich zur Experimentumgebung13 konservativ betrachtet wird. In diesem Paradigma kann ein CNN-Transformer-Modell weiterhin von funktionaler Bedeutung sein, da CNNs optimal strukturiert sind, um lokale Läsionsinformationen zu erfassen, während transformatorbasierte Darstellungen das Potenzial haben, auch die in der Dermatologie interessante Langstreckenstrukturen darzustellen.

Die jüngste Bildklassifikationsforschung von mpox lässt sich in drei breit gefasste Forschungsrichtungen unterteilen, die auf einer Methodik basieren. Letzteres basiert auf den konventionellen CNNs und Transfer-Learning aufgrund seiner Reife, Berechnungsgeschwindigkeit und der Rekonstruktion läsionsspezifischer Texturen14. Letzteres untersucht aufmerksamkeitsbasierte oder Transformer-Modelle, die besser geeignet sind, den Kontext der globalen Läsion zu erlernen. Die dritte integriert Faltung und Aufmerksamkeit in die hybriden Pipelines, um die lokale Sensitivität zu erhalten, aber größere Körperkontextmodellierung zu verwenden. Mehrere der Studien berichten über hohe Leistungen, die nicht einfach direkt verglichen werden können, da sich die Studien in der Größe ihres Datensatzes, der Kuratierungsstrategie, der Struktur ihrer Klassen, der Vorverarbeitung und dem Validierungsprotokoll15 unterscheiden. Sie sind auf binäre Klassifikationen ausgerichtet, multiklassig dermatologisch diskriminierungsorientiert, wobei nicht alle die gleichen Bewertungsmaße haben. Mpox-Bilddatensätze, die öffentlich zugänglich gemacht werden, können auch nahezu doppelte oder sehr ähnliche Bilder enthalten, was eine scheinbare Leistung erfordert, falls die Split-Kontrollenicht ausreichend ist.

Die gegebene Analyse basiert auf einer kontrollierten binären Menge von 2.280 Fotos von Hautläsionen, 1.020 Fotos von mpox und 1.260 Fotos von Other waren geplant. Die Kategorie "Andere" überschneidet sich mit den nicht-mpoxen Läsionen, die mit bloßem Auge erscheinen, was die Aufgabe zu einer klinisch interessanten frühen Triage-Formulierung im Vergleich zu einem vollständigen dermatologischen Lokalisationssystem17 macht. Die Bilder wurden alle in einer typischen inneren Trainings-Validierungspipeline vergrößert, normalisiert, ergänzt und bewertet. Das Hauptziel war der Vergleich des Verhaltens konventioneller und hybrider Deep-Learning-Modelle in einem transparenten Benchmark und eine Schlussfolgerung darüber, ob die vorgeschlagene hybride Architektur ein überlegenes Gleichgewicht zwischen Diskriminierung und Interpretierbarkeit im Vergleich zu gängigen Basiswerten bietet.

Die deutliche Lücke, die die derzeit überarbeitete Version adressiert, ist somit nicht nur die Präsentation des hybriden Modells, da die Strategien des hybriden CNN-Transformers bereits in der Literatur behandelt wurden. Stattdessen besteht die Diskrepanz darin, dass eine eigenständigere, intern konsistente Metrik benötigt wurde, die die primären binären Aufgaben und explorative Multiklassen-Ausgaben außer Acht lässt, die Vorverarbeitungs- und Trainingspipeline reproduzierbar charakterisiert und die Modellleistung so präsentiert, dass Neuheit oder klinische Vorbereitung nicht überbewertetwerden 18. In dieser Hinsicht ist eine hybride Architektur dennoch eine Überlegung wert, da CNNs in der lokalen Merkmalsextraktion hervorragend sind und transformatorähnliche Aufmerksamkeit theoretisch globale Läsionskonfigurationen und räumliche Verbindungen mit größerer Reichweite modellieren kann, um die visuelle Diagnose zu unterstützen19. Die praktische Frage betrifft nicht, ob ein hybrides Design im Vergleich zu typischen Baselines im gleichen kuratierten Datenbereich ein günstiges Gleichgewicht aus Diskriminierung, Stabilität und Interpretierbarkeit bietet, sondern ob es ein gutes Gleichgewicht zwischen Besteuerung, Stabilität und Interpretierbarkeit bietet.

Die neuesten Arbeiten zur MPOX-Bildanalyse lassen sich in drei allgemeine Bereiche der Methodenforschung unterteilen. Ersteres verwendet traditionelle CNNs und Transfer-Learning-Architekturen aufgrund ihrer Reife, Recheneffizienz und der Fähigkeit, läsionsspezifische Texturen und lokale morphologische Merkmalezu lernen 20. Der zweite Strom bietet dem Vision-Transformer oder aufmerksamkeitsverstärkten Modellen, um die breiteren räumlichen Assoziationen über das Läsionsfeld zu erfassen, insbesondere wenn die Texturpatches aus kontextuellen Läsionsverteilungen bestehen und daher ebenso wichtig sein können wie einzelne Texturpatches. Der dritte Strom fügt die Faltung und die Aufmerksamkeit hinzu, um hybride Pipelines zu unterstützen, um die lokale Sensibilität von CNNs zu erhalten, dabei aber die kontextuelle Modellierungsfähigkeit von Aufmerksamkeitsblöcken zu nutzen.

Obwohl die meisten dieser Arbeiten eine ausgezeichnete Genauigkeit beanspruchen, ist ein Cross-Study-Vergleich aufgrund der Unterschiede in Größe, Kuratierungsstrategie, Klassenzusammensetzung und Validierungsdesign zwischen Datensätzen keine leichte Aufgabe21. Es gibt Publikationen, die binäre Diskriminierung bewerten, und solche, die die multiklassige dermatologische Kategorisierung bewerten; einige sind ebenfalls in Berichtsgenauigkeit und Abruf ausgewogen, andere konzentrieren sich auf dieGenauigkeit 22. Außerdem können berichtete mpox-Datensätze auf Online-Bildsammlungen, kuratierten Sammlungen oder erweiterten Teilmengen basieren, was die gemeldete Leistung steigern kann, wenn Zugvalidierungslecks oder nahezu doppelte Bilder nicht gut verwaltet werden. Tabelle 1 wird daher nicht als bloßes Kompendium früherer Arbeiten geführt, sondern als schematische Karte von Modellfamilien, Datensatzbeschränkungen und den Möglichkeiten, die die in dieser Forschung verfügbaren Methoden bieten.

Der methodische Wert des jeweiligen Werks spiegelt sich in einer begrenzteren und besser vertretbaren Weise wider. Dieses Papier wird die Notwendigkeit des transparenten binären Benchmarks mit Hilfe des bereitgestellten kuratierten Datensatzes behandeln, das Vorverarbeitungs- und Trainingsverfahren berichten und das vorgeschlagene Hybridmodell direkt mit gängigen Baselines23 vergleichen. Diese Änderungen trennen auch das Haupt-Binärexperiment und die Supplementierungs-Multiklassen-Evidenz so, dass Leistungsbehauptungen mit dem entsprechenden experimentellen Kontext verknüpft werdenkönnen. Der Unterschied macht einen entscheidenden Unterschied in der diskursiven Analyse von Modellverhalten, berichteten Messgrößen und Praktikabilität.

Das Hauptexperiment dieses Skripts ist ein binäres Klassifikationsexperiment an einer kleineren Sammlung von 2280 Bildern von Hautläsionen, die von Hand kuratiert wurden. In diesem Datensatz wurden 1.020 als mpox identifizierte Bilder identifiziert, und die als anderen kategorisierten Bilder 1.260. Die andere Kategorie umfasst das Auftreten von nicht-mpox-bedingten dermatologischen Erscheinungsformen visuellen Charakters, meist Läsionen, bei denen das Manuskript sie als windpocken- und masernähnliche Läsionen bezeichnet25. Diese duale Nomenklatur macht diese binäre Gruppierung klinisch bedeutsam als primitive Screening-Formulierung, da das Modell untersucht, ob das Modell in der Lage ist, vermutete Mpox und visuell verwirrende Alternativen zu disaggregieren, aber auch weniger komplex ist als ein vollständiger multiklassiger dermatologischer Benchmark.

Das Training der Modelle musste standardisiert werden, wobei alle Bilder vor dem Training vorgefertigt wurden. Größenänderung, Intensitätsnormalisierung, Augmentation und Umwandlung von kategorischen in binäre Labels werden ebenfalls im Manuskript erwähnt. Im aktualisierten Sinne werden diese Schritte jedoch als Komponenten einer reproduzierbaren Pipeline betrachtet und nicht als Notizen, die am Rand geschrieben wurden. Sein Array wurde weiter in Trainings- und Validierungsteilmengen unterteilt, die aus Verzeichnissen bestehen, und die genannten Leistungskennzahlen sollten dann als interne Leistungseinwirkungen der Validierung betrachtet werden, statt als Indikatoren einer völlig unabhängigen externen Testgruppe. Um es klarer zu machen: Diese Sammlung mit 2.280 Bildern wird als offizielle Daten für die Hauptanalyse herangezogen. Die binäre Rahmung wurde gewählt, weil sie die frühe Triagefrage widerspiegelt, die in der Praxis häufig ist: Ist das Bild einer verdächtigen Läsion wahrscheinlicher mpox als andere visuell ähnliche Zustände? Diese Darstellung ist im Vergleich zu einer umfangreichen dermatologischen Diagnose begrenzt, aber sie ist ein gültiger und technisch interpretierbarer Ausgangspunkt für vergleichende Benchmarking.

Die aktualisierte Beschreibung des Datensatzes berücksichtigt außerdem, dass das Papier einige zusätzliche Ausgaben enthält, die mit Hilfe verschiedener Klassenstrukturen oder einiger angereicherter Teilmengen erhalten wurden, wie sie in den Abbildungen 1A–I dargestellt sind. Anstatt diese Materialien zu löschen, kontextualisiert das Manuskript sie nun direkt, sodass die Leser die Ergebnisse sehen können, die Teil des binären Benchmarks sind, und die von sekundären Experimenten. Diese Methode erhält die gesamte Dokumentation dieser Studie, erlaubt jedoch nicht, dass inkompatible Experimente in eine einzige Behauptung integriert werden.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

HINWEIS: Verwenden Sie für das Hauptexperiment den kuratierten binären mpox-Bilddatensatz, der im Manuskript beschrieben wird. Der Datensatz enthält 2.280 Bilder von Hautläsionen, darunter 1.020 mpox-Bilder und 1.260 Bilder, die als Andere gekennzeichnet sind. Verwenden Sie nur eine sekundäre Bildanalyse; Führen Sie im Rahmen dieses Workflows keine direkte Patientenrekrutierung, klinische Interventionen, Tierversuche oder Erzeugung neuer biologischer Proben durch.

1. Beschaffung und Kuratierung des Datensatzes

  1. Definiere ein binäres Bezeichnungsschema mit zwei Klassen: mpox und Andere.
  2. Weisen Sie der Klasse Other ähnliche nicht-mpoxe Läsionen zu.
  3. Überprüfen Sie alle Bilder auf Lesbarkeit, Klassenidentität und Eignung für die Klassifikation überwachter Bilder.
  4. Schließen Sie unbrauchbare oder mehrdeutige Bilder während der Kuratierung aus.
  5. Organisieren Sie die kuratierten Bilder in verzeichnisbasierte Klassenordner für das nachgelagerte Laden mit Bildgeneratoren.

2. Die Bilder vergrößern und normalisieren

  1. Skalieren Sie alle Bilder vor dem Modelltraining auf 150 x 150 Pixel.
  2. Wenden Sie während der Größenänderung bikubische Interpolation an, um flüssige Bildübergänge zu erhalten.
  3. Skaliere die Pixelintensitäten neu, indem du jeden Pixelwert durch 255 teilst.
  4. Normalisiere alle Bildintensitäten auf den Bereich [0,1].
    HINWEIS: Verwenden Sie für alle Modelle dasselbe räumliche Auflösungs- und Normalisierungsverfahren, um einen fairen Vergleich zwischen den Architekturen zu gewährleisten.

3. Ergänzung der Trainingsbilder

  1. Wenden Sie Augmentation nur auf die Trainingsgruppe an.
  2. Stellen Sie den Drehbereich auf 20° ein.
  3. Stellen Sie den Breitenverschiebungsbereich auf 0,2 ein.
  4. Stellen Sie den Höhenverschiebungsbereich auf 0,2 ein.
  5. Stellen Sie den Scherbereich auf 0,2 ein.
  6. Stellen Sie den Zoombereich auf 0,2 ein.
  7. Aktiviere horizontales Umdrehen.
  8. Verwenden Sie die Nächste-Nachbar-Füllung für Pixel, die während der Augmentation eingeführt werden.
  9. Führen Sie die Erweiterung während des Trainings online durch, anstatt die Bilddateien dauerhaft zu duplizieren.
    HINWEIS: Ergänzen Sie die Validierungsbilder nicht; Nur sie neu skalieren.

4. Kodieren Sie die Labels und teilen Sie den Datensatz auf

  1. Kodieren Sie die beiden Klassen als binäre Labels.
  2. Laden Sie die Bilder mit verzeichnisbasierten Generatoren im binären Klassenmodus.
  3. Stelle die Chargengröße auf 32 ein.
  4. Unterteilen Sie den Datensatz in Trainings- und Validierungsteile.
    HINWEIS: Das Manuskript berichtet nur über interne Trainingsvalidierungs-Benchmarks und enthält keine unabhängige externe Testkohorte.

5. Aufbau der CNN-Basismodelle

  1. Konstruiere eine sequentielle CNN-Basislinie mit drei Faltungsblöcken.
  2. Verwenden Sie 32 Filter im ersten Faltungsblock und folgen Sie dem Block mit maximalem Pooling.
  3. Verwende 64 Filter im zweiten Faltungsblock und folge dem Block mit maximalem Pooling.
  4. Verwenden Sie 128 Filter im dritten Faltungsblock und folgen Sie dem Block mit maximalem Pooling.
  5. Flachen Sie die extrahierten Feature-Karten.
  6. Füge eine dichte Schicht mit 512 Einheiten hinzu.
  7. Beantrage einen Abbruch mit einer Rate von 0,5.
  8. Verwenden Sie eine sigmoidische Ausgabeschicht für binäre Klassifikation.
  9. Beziehen Sie InceptionV3, ResNetV2, ResNet50 und DenseNet121 als vergleichende Basisarchitekturen ein.
    HINWEIS: Verwenden Sie denselben kuratierten Binärdatensatz und dieselbe Preprocessing-Pipeline für alle Basisvergleiche, wo immer dies anwendbar ist.

6. Definieren Sie das hybride CNN-Transformator-Modell

  1. Verwenden Sie ein CNN-Modul als lokalen Feature-Encoder.
  2. Läsionstextur, Rand und lokale morphologische Muster mit der CNN-Komponente extrahieren.
  3. Verwenden Sie ein transformatorbasiertes Modul als Kontextencoder.
  4. Modelliere breitere räumliche Abhängigkeiten in der erlernten Darstellung mit der Transformatorkomponente.
  5. Projiziere die CNN- und Transformator-Merkmalsvektoren auf dieselbe Dimensionalität und fusioniere sie durch elementweise Addition.
  6. Mappt die fusionierte Darstellung über einen Klassifikationskopf auf eine binäre mpox-versus-Other-Ausgabe.
    HINWEIS: Melden Sie die hybride Architektur auf Modulebene, wenn die Anzahl der Aufmerksamkeitsköpfe, Einbettungsdimensionen und Transformatorschichten nicht explizit angegeben ist.

7. Ausbildungsprozess und Bewertungspraxis

  1. Assembleren Sie den binären Klassifikator mit dem implementierten Modell und dem Adam-Optimierer, binärem Kreuzentropieverlust und Genauigkeit als primärer Trainingsmetrik.
  2. Trainieren Sie das klar definierte Baseline-Modell für 15 Epochen auf dem kuratierten mpox-versus-other-Datensatz.
  3. Führen Sie alle Experimente in einer Python-basierten Deep-Learning-Umgebung auf einem GPU-ausgerüsteten System durch und fassen Sie die Softwareressourcen sowie die verallgemeinerte Rechenumgebung in Table of Materials zusammen.
  4. Überwachen Sie die Trainings- und Validierungsverlustkurven während des Trainings und berechnen Sie Genauigkeit, Präzision, Rückruf, F1-Wert und AUC für jedes einzelne Modell, wenn verfügbar.
  5. Interpretieren Sie die Modellleistung durch Betonung der Konsistenz im Berichts- und Generalisierungsverhalten und priorisieren Sie ein Gleichgewicht zwischen Sensitivität und Spezifität gegenüber einzelnen Spitzengenauigkeitswerten.
  6. Formulieren Sie für jedes Modell zwei Bewertungsfragen: (i) wie gut das Modell zu den Trainingsdaten passt und (ii) wie gut die erlernte Darstellung auf gehaltene Validierungsbilder aus derselben kuratierten Quelle überträgt.
    HINWEIS: Stellen Sie diese beiden Aspekte explizit im Manuskript dar, um Repräsentationsfähigkeit von nützlicher Verallgemeinerung zu unterscheiden.
  7. Hohe Trainingsgenauigkeit als Beweis für ausreichende Repräsentationskapazität interpretieren und hohe und stabile Validierungsleistung als aussagekräftigeren Indikator für nützliche Verallgemeinerungen.

8. Experimentelle Analysen

  1. Berichte nur Ergebnisse, die direkt durch die aufgezeichneten Ergebnisse gestützt werden, und vermeiden Sie es, über die dokumentierten Beweise hinaus zu extrapolieren.
  2. Nennen Sie explizit Einschränkungen dort, wo Validierungsinformationen fehlen oder eine Tabelle eine andere Klassenstruktur widerspiegelt.
  3. Behandle die binäre mpox-gegen-andere Klassifikationsaufgabe als primäre Analyse und nutze sie als interne Referenz für alle Experimente.
  4. Übersetzen Sie den ursprünglichen Implementierungscode in ein narratives Protokoll und in Tabelle 2 , sodass der Datensatz, die Softwareumgebung, die Modellfamilien und die Trainingskonfiguration für die Reproduzierbarkeit prägnant zusammengefasst sind.
  5. Verallgemeinere die Beschreibungen von Hardware und Software, sodass der Fokus weiterhin auf methodischer Reproduzierbarkeit liegt und nicht auf einer einzigen herstellerspezifischen Plattform.
  6. Die vorliegenden modellweise Ergebnisse in derselben Reihenfolge wie die Architekturen eingeführt werden, um den Vergleich von Trainingsverhalten, Validierungsverhalten und Berichtsvollständigkeit zu vereinfachen.
  7. Beschreiben Sie die sequentielle CNN-Basislinie als sehr hohe interne Validierungsleistung, wobei darauf hingewiesen wird, dass dies günstige Split-Eigenschaften widerspiegeln und sich nicht extern verallgemeinern lässt.
  8. Interpretieren Sie das sequentielle Modell als starke interne Referenz und nicht als endgültige Demonstration einsetzbarer diagnostischer Robustheit.
  9. Rechtfertigen Sie die Beibehaltung separater InceptionV3-Panels, da Verlust- und Genauigkeitstrajektorien zusammen eine effektive Trainingsoptimierung, aber ein inkonsistentes Validierungsverhalten zeigen.
  10. Beschreiben Sie ResNetV2 als informative, aber teilweise berichtete Basislinie, da vergleichbare Validierungsmetriken nicht verfügbar waren.
  11. Betrachten Sie das Multiclass-Experiment von ResNet50 als ergänzenden Beweis, der sich vom primären binären Benchmark unterscheidet.
  12. Interpretiere DenseNet121 als einen Zwischen-Benchmark mit wettbewerbsfähiger, aber nicht dominanter Leistung auf der gemeldeten binären Teilmenge.
  13. Beschreiben Sie den hybriden CNN-Transformator als einen Erreichen einer ausgeglichenen Klassendiskriminierung und nicht als einseitigen Gewinn in einer einzigen Metrik.
  14. Vermeiden Sie es, universelle Überlegenheit des hybriden Modells gegenüber allen Baselines zu beanspruchen, da einige Modelle unter unterschiedlichen Berichtsbedingungen bewertet wurden.
  15. Positionieren Sie das hybride Modell als vielversprechenden Kompromiss zwischen hoher Validierungsleistung und Kennzahlenbalance und empfehlen weitere Bewertungen bei standardisierten, extern getesteten Benchmarks.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vergleich über die Schlagzeilengenauigkeit hinaus

Diese Ergebnisse zeigen, dass Vergleiche von Modellen in der medizinischen Bildanalyse sich nicht nur auf die Schlagzeilengenauigkeit konzentrieren sollten, sondern auch auf das Verhalten der Architekturen in Bezug auf eine Reihe von Kennzahlen und verschiedenen experimentellen Settings. Während der gesamten Experimente verhielten sich die Modelle nicht ähnlich: Das einfache sequentielle CNN wa...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das Hauptergebnis der Studie ist, dass eine binäre Klassifikation von mpox versus visuell ähnlichen Läsionen, die sogenannte automatisierte Klassifikation, mit dem in dieser Studie verwendeten kuratierten Datensatz möglich ist, ein solcher Erfolg jedoch weitgehend auf der Interpretation von Evidenz27 beruht. Durch eine angemessene Trennung der Experimente präsentiert das Manuskript Hinweise darauf, dass sowohl konventionelle als auch vorgeschlagene hybride Archite...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren geben an, dass sie keine bekannten konkurrierenden finanziellen oder nichtfinanziellen Interessen haben, die die in diesem Manuskript berichtete Arbeit beeinflusst haben könnten.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken dankbar für die finanzielle Unterstützung, die vom Vel Tech Rangarajan Dr. Sagunthala R&D Institute of Science and Technology im Rahmen des Research Development Fund (RDF), Fördernummer VTU/RDF/FY2026-27/009. Diese Unterstützung war entscheidend für die erfolgreiche Durchführung dieser Forschungsarbeit.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
DatensatzKuratierter mpox-Bilddatensatz; 2.280 Bilder für den Haupt-Binär-Benchmark (1.020 mpox und 1.260 andere)Primäre Schulung und interne Validierungsquelle
AufgabendefinitionBinärklassifikation für die Kernstudie; ergänzende Multiclass- und erweiterte Zusammenfassungen wurden separat beibehaltenStellt eine konsistente Interpretation der gemeldeten Kennzahlen sicher.
ProgrammierumgebungPython-basierter Notebook-WorkflowDatenverarbeitung, Modelltraining und Plotting
Deep-Learning-FrameworkTensorFlow / Keras-Implementierung, die im eingereichten Code gemeldet wirdModellentwicklung und Optimierung
BildprogrammeImageDataGenerator mit Reskalierung und Augmentation; Darstellung von Bibliotheken für TrainingskurvenVorverarbeitung, Augmentation und visuelle Berichterstattung
Baseline-ArchitekturenSequential CNN, InceptionV3, ResNetV2, ResNet50, DenseNet121Vergleichendes Benchmarking
Vorgeschlagene ArchitekturHybrider CNN-Transformator-KlassifikatorPrimärer methodischer Beitrag
TrainingsumgebungenEingangsgröße 150 x 150; Chargengröße 32; Adam Optimierer; binäre Kreuzentropie; 15 Epochen wurden für gelieferten Baseline-Code gemeldetReproduzierbarkeit des Kernworkflows
RechenumgebungGPU-fähiges Rechensystem; Hardwaredetails, die in der Erzählung verallgemeinert werdenModellbeschleunigung während des Trainings

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Affenpockendiagnostikhybrides Deep Learningmedizinische BildklassifizierungHautl sionsbilderbin re KlassifizierungBildaugmentationModellvalidierung

Verwandte Artikel