$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Badanie zostało przeprowadzone zgodnie z Deklaracją Helsińską i zatwierdzone przez Instytucjonalną Komisję Etyczną SR University w Warangal, Telangana, Indie (nr zatwierdzenia 007/2026). Przed rozpoczęciem gromadzenia danych od wszystkich uczestników uzyskano pisemną świadomą zgodę.
Wybór uczestników
Dane EEG zebrały od 11 zdrowych uczestników (zakres wieku: 25–45 lat; średnia wieku: 28 lat) bez historii zaburzeń neurologicznych lub psychiatrycznych. W badaniu tym przeanalizowano łącznie 1175 segmentów EEG, z czego 527 należało do klasy relaksacji, a 648 do klasy uwagi. Wykluczono uczestników, których zapisy EEG wykazały nadmierne artefakty ruchowe lub słabą jakość sygnału.
Konfiguracja akwizycji EEG
Ogólny schemat proponowanego systemu interfejsu mózg-komputer opartego na EEG przedstawiono na Rysunku 1, który obrazuje cały proces akwizycji sygnału, klasyfikacji i zastosowania w czasie rzeczywistym. Dane EEG rejestrowano przy użyciu niewielkiego modułu akwizycji potencjałów biologicznych połączonego z systemem opartym na mikrokontrolerze. Elektrody żelowe rozmieszczono zgodnie z międzynarodowym systemem 10–20, a mianowicie w przedczołowych punktach Fp1 i Fp2, z elektrodą referencyjną i uziemiającą umieszczonymi na płatkach usznych, jak wskazano na Rysunku 2. Sygnały były cyfryzowane z częstotliwością 128 Hz i przesyłane do komputera za pomocą autorskiego skryptu akwizycyjnego napisanego w języku Python. W celu zmniejszenia impedancji elektrod i poprawy jakości sygnału zastosowano odpowiednie przygotowanie skóry oraz żel przewodzący.
Procedura eksperymentalna
Rejestracje EEG przeprowadzono w dwóch warunkach poznawczych: relaksacji oraz uwagi, zgodnie ze standaryzowanym protokołem. W warunku relaksacji uczestnik siedział w komfortowym, cichym otoczeniu i otrzymał instrukcję, aby pozostać w bezruchu, ograniczając ruchy do minimum. Przez słuchawki odtwarzano uspokajającą muzykę instrumentalną, a akwizycję EEG rozpoczęto za pomocą polecenia python collect.py. Sygnały EEG rejestrowano przez 5 min na sesję, powtarzając proces w czterech sesjach. W warunku uwagi uczestnik otrzymał instrukcję wykonywania zadań wymagających koncentracji, takich jak gry interaktywne, przy zachowaniu tej samej konfiguracji akwizycji, co w warunku relaksacji. Sygnały EEG rejestrowano przez 5 min na sesję, powtarzając proces w czterech sesjach. Każdy uczestnik brał udział w badaniu przez łącznie 40 min, na co składało się 20 min relaksacji i 20 min zadań wymagających uwagi, co umożliwiło wiarygodne porównanie stanów poznawczych.
Przetworzony zestaw danych został zorganizowany w oznaczone segmenty w następujący sposób: Relaksacja (0); Koncentracja (1). Każdy segment miał czas trwania 4 s z 50% nakładaniem się i był reprezentowany jako spektrogram z wykorzystaniem krótkoczasowej transformaty Fouriera.
Przetwarzanie sygnałów, reprezentacja cech i implementacja modelu
Uzyskane sygnały EEG poddano wstępnemu przetwarzaniu w celu usunięcia szumów i artefaktów. Do eliminacji zakłóceń z sieci elektrycznej zastosowano filtr notch o częstotliwości 50 Hz, natomiast do wyboru odpowiednich pasm częstotliwości EEG użyto pasmowo-przepustowego filtra Butterwortha 4. rzędu w zakresie od 0.5 do 30 Hz. W celu zidentyfikowania segmentów zanieczyszczonych artefaktami wykorzystano progowanie amplitudy oraz inspekcję wizualną, co pozwoliło na usunięcie około 8–12% danych. Metodami augmentacji danych zastosowanymi w celu zwiększenia odporności modelu były dodawanie szumu Gaussa, maskowanie czasowe oraz maskowanie częstotliwościowe. Sygnały EEG przefiltrowano, a następnie podzielono na 4-sekundowe okna z 50-procentowym nakładaniem.
Poszczególne segmenty EEG przekształcono w reprezentację czasowo-częstotliwościową (Krótkoczasowa Transformata Fouriera), zgodnie z równaniem (1), aby umożliwić ekstrakcję charakterystyk czasowych i widmowych.
(1)
Uzyskane spektrogramy zostały znormalizowane i przeskalowane do stałych wymiarów, aby służyć jako dane wejściowe dla modelu klasyfikacji. Aby zapobiec wyciekowi danych spowodowanemu nakładaniem się próbek, zbiór danych przed segmentacją podzielono na podzbiory treningowy (70%), walidacyjny (10%) i testowy (20%), co przedstawiono na Rysunku 3. Dodatkowo przeprowadzono walidację krzyżową metodą leave-one-subject-out (LOSO) w celu oceny generalizacji międzyosobniczej, w której dane od jednego uczestnika wykorzystano do testowania, natomiast pozostałe dane posłużyły do trenowania modelu.
Zaproponowana architektura SET-Net, przedstawiona na Rysunku 4, została opracowana w celu uchwycenia wielowymiarowych cech EEG. Model integruje szkielet splotowej sieci neuronowej (CNN) do ekstrakcji reprezentacji przestrzenno-spektralnych, po którym następuje blok squeeze-and-excitation (SE), który adaptacyjnie rekalibruje ważność cech w poszczególnych kanałach, zgodnie z opisem w Równaniu (2). Szkielet CNN składa się z dwóch warstw splotowych o rozmiarze jądra 3 × 3, po których następują normalizacja wsadowa (batch normalization) oraz aktywacja jednostki liniowej wykładniczej (ELU)
(2)
Wewnętrzna struktura bloku SE została przedstawiona na Rysunku 5. W celu uchwycenia długoterminowych zależności czasowych włączono enkoder transformera, którego mechanizm uwagi zdefiniowano w równaniu (3) i zilustrowano na Rysunku 6.
(3)
Do redukcji map cech do stałego rozmiaru 16 × 16 wykorzystano warstwę adaptacyjnego uśredniania pulującego (adaptive average pooling). Współczynnik redukcji bloku SE wynosi 8 i służy on do rekalibracji odpowiedzi cech w poszczególnych kanałach. Koder transformera składał się z czterech warstw z czterema głowicami uwagi, rozmiarem wymiaru sieci feed-forward wynoszącym 256 oraz rozmiarem osadzania modelu wynoszącym 128.
Końcowa klasyfikacja została przeprowadzona przy użyciu warstw w pełni połączonych z regularyzacją dropout oraz funkcji aktywacji softmax w celu rozróżnienia stanów uwagi i relaksacji. Szczegółowa architektura warstwowa proponowanego modelu przedstawiona jest w Tabeli 1.
Model został wytrenowany przy użyciu optymalizatora AdamW z początkową szybkością uczenia 0,001 i rozkładem wag (weight decay) 1×10⁻4. W celu usprawnienia zbieżności zastosowano harmonogram wygaszania cosinusoidalnego (cosine annealing scheduler), a proces trenowania trwał 50 epok przy rozmiarze partii (batch size) wynoszącym 32. Problem niezbalansowania klas rozwiązano poprzez zastosowanie ważonej funkcji straty entropii krzyżowej, zgodnie z opisem w równaniu (4).
(4)
Tabela 2 podsumowuje konfigurację treningową, a Tabela 3 przedstawia poszukiwanie hiperparametrów dla proponowanej sieci SET-Net, która została wykorzystana w klasyfikacji uwagi i relaksacji w oparciu o EEG. Wybrane parametry zapewniają stabilność treningu, zwiększoną generalizację oraz tolerancję na zmiany w sygnałach EEG. Wybrane parametry zapewniają stabilność procesu treningowego, zwiększają zdolność generalizacji i są odporne na modyfikacje sygnału EEG. Do pomiaru wydajności modelu wykorzystano dokładność (accuracy), precyzję (precision), czułość (recall), wynik F1 (F1-score) oraz ROC-AUC. Wszystkie potoki obejmujące przetwarzanie wstępne, trening modelu i ewaluację zostały napisane w języku Python z wykorzystaniem frameworka PyTorch w celu zapewnienia powtarzalności. Tabela 4 zawiera szczegółowy opis rozwiązywania problemów, aby pomóc w identyfikacji i rozwiązywaniu trudności związanych z akwizycją EEG, przetwarzaniem wstępnym, treningiem modelu i zastosowaniem w czasie rzeczywistym. Tabela 5 przedstawia zestawienie materiałów urządzenia EEG, aby umożliwić łatwe stworzenie struktury do przeprowadzania eksperymentów oraz konfiguracji eksperymentalnej. Do implementacji proponowanego frameworka SET-Net wykorzystano język Python 3.8 wraz z frameworkiem do głębokiego uczenia PyTorch. Do wstępnego przetwarzania sygnałów i ekstrakcji cech wykorzystano standardowe biblioteki obliczeń naukowych NumPy, SciPy i Matplotlib. Każda procedura eksperymentalna została przeprowadzona na systemie z procesorem Intel i7 i 16 GB RAM, aby przyspieszyć trening modeli.
DOSTĘPNOŚĆ DANYCH:
Zanonimizowany zestaw danych EEG, wygenerowany i przeanalizowany podczas niniejszego badania, jest publicznie dostępny w repozytorium Zenodo pod następującym linkiem dostępowym: https://zenodo.org/records/19627795.
Wszystkie dane zostały zanonimizowane w celu zapewnienia poufności uczestników, zgodnie z instytucjonalnymi wytycznymi etycznymi zatwierdzonymi przez Komisję Etyki Instytucjonalnej Uniwersytetu SR (Numer zatwierdzenia 007/2026).
Przetworzone informacje, ustawienia modelu oraz szczegóły implementacji niezbędne do odtworzenia wyników zostały przedstawione w manuskrypcie, a kod źródłowy jest publicznie dostępny pod adresem: https://github.com/Ravichanderj/SET-Net-EEG-BCI.