Artykuł metodologiczny

Metoda śledzenia wielu obiektów sterowana stopniem pewności w materiałach wideo ze zdarzeń sportowych z wykorzystaniem semantycznej fuzji koszulek

DOI:

10.3791/71557

14 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół opisuje proces wielobiektowego śledzenia sterowanego poziomem pewności dla nagrań wideo ze zdarzeń sportowych, który integruje informacje o kolorze koszulki i numerze zawodnika w celu poprawy asocjacji trajektorii oraz spójności tożsamości w warunkach wahań pewności, okluzji oraz wizualnego podobieństwa zawodników.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Śledzenie wielu obiektów (Multi-Object Tracking, MOT) w nagraniach wideo ze zdarzeń sportowych dostarcza informacji o trajektoriach niezbędnych do analizy taktycznej, interpretacji zachowań zawodników oraz zautomatyzowanej analizy statystycznej. Jednak scenariusze sportowe często wiążą się z szybkimi zmianami kierunku, nagłymi zatrzymaniami, częstymi przesłonięciami obiektów oraz wizualnym podobieństwem członków tej samej drużyny, co prowadzi do wahań pewności detekcji i błędów w identyfikacji podczas asocjacji między klatkami. Aby rozwiązać te problemy, w niniejszym badaniu przedstawiono JerseyTrack – metodę MOT w sporcie sterowaną poziomem pewności, opartą na fuzji semantycznej koszulek. Przepływ pracy adaptacyjnie dzieli ramki detekcji na przedziały wysokiej, średniej i niskiej pewności, zgodnie z rozkładem pewności w każdej klatce. Detekcje o wysokiej pewności są asocjowane głównie w oparciu o podobieństwo ruchu, natomiast w przypadku detekcji o średniej i niskiej pewności dodatkowo wykorzystuje się cechy koloru koszulki oraz numeru zawodnika, wyodrębnione za pomocą klastrowania kolorów i lekkiego modelu optycznego rozpoznawania znaków (Optical Character Recognition, OCR). Cechy semantyczne te są łączone z informacjami o ruchu podczas dopasowania uzupełniającego, aby poprawić ciągłość trajektorii i spójność identyfikacji. Metodę oceniono na zbiorze danych SportsMOT. JerseyTrack osiągnął wynik 88,9% dla dokładności śledzenia wielu obiektów (Multiple Object Tracking Accuracy, MOTA), 74,3% dla wskaźnika IDF1 (IDentity F1 Score) oraz 69,9% dla dokładności śledzenia wyższego rzędu (Higher Order Tracking Accuracy, HOTA), co wykazuje poprawę wydajności śledzenia w analizowanych warunkach sportowych. Niniejszy protokół zapewnia odtwarzalny schemat integrowania asocjacji sterowanej pewnością z semantycznymi informacjami o koszulkach w celu usprawnienia śledzenia wielu obiektów w filmach sportowych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Śledzenie wielu obiektów (MOT) zapewnia ciągłą lokalizację obiektów i utrzymanie ich tożsamości w sekwencjach wideo, co umożliwia ekstrakcję trajektorii sportowców, analizę taktyczną oraz zautomatyzowaną analizę statystyczną w aplikacjach do analizy wideo w sporcie1,2,3. Niezawodne informacje wizualne są również powiązane z podejmowaniem decyzji specyficznych dla danej dyscypliny oraz oceną wyników w nauce o sporcie, co dodatkowo podkreśla wartość stabilnych danych o ruchu pochodzących z wideo dla dalszej analizy sportowej4. W scenariuszach sportowych niezawodność danych taktycznych zależy od ciągłości trajektorii śledzenia oraz spójności tożsamości celów.

W porównaniu do ogólnych scenariuszy MOT, filmy sportowe charakteryzują się gwałtownymi zmianami kierunku, nagłymi zatrzymaniami, skokami, gęstymi interakcjami oraz częstymi przesłonięciami. Czynniki te powodują znaczne wahania poziomu ufności ramek detekcyjnych i zwiększają częstotliwość detekcji o niskiej ufności, co może przerywać asocjację trajektorii5,6. Jednolite stroje drużynowe dodatkowo ograniczają zdolność dyskryminacyjną ogólnych cech wyglądu i zwiększają ryzyko pomyłek w identyfikacji wizualnie podobnych członków tej samej drużyny7,8. Gdy przesłonięcia i podobieństwo wyglądu występują w tej samej sekwencji, ufność detekcji spada, a informacje o wyglądzie celu stają się niepełne, co utrudnia asocjację trajektorii i utrzymanie tożsamości9,10. W MOT re-identyfikacja (Re-ID) odnosi się do procesu wiązania tej samej tożsamości celu w różnych klatkach, okresach przesłonięcia lub w przypadkach ponownego pojawienia się w kadrze, z wykorzystaniem wizualnych dowodów związanych z tożsamością. W filmach ze sportów drużynowych ogólne wskazówki Re-ID mogą być osłabione, ponieważ sportowcy z tej samej drużyny często noszą podobne stroje i mają zbliżoną budowę ciała. Przegląd literatury technicznej wskazuje, że fragmentacja trajektorii i pomyłki w identyfikacji w sportowym MOT są zazwyczaj rozwiązywane za pomocą dwóch komplementarnych podejść: wykorzystania poziomu ufności detekcji oraz wzmocnienia wskazówek tożsamości. JerseyTrack sytuuje się na przecięciu tych podejść, regulując wykorzystanie semantycznych wskazówek dotyczących strojów w zależności od jakości detekcji, zamiast jednolicie stosować informacje o kolorze i numerze zawodnika do wszystkich detekcji.

Niniejsze badanie przedstawia JerseyTrack, metodę śledzenia wielu obiektów (MOT) w sporcie, kierowaną poziomem ufności i opartą na semantycznej fuzji strojów sportowych. Metoda została opracowana dla nagrań wideo z dyscyplin zespołowych, w których sportowcy noszą widoczne stroje, a wyniki detekcji dostarczają ramki ograniczające wraz z wynikiem ufności. JerseyTrack łączy cztery główne komponenty: detekcję sportowców, partycjonowanie poziomów ufności, ekstrakcję semantycznych cech stroju oraz kaskadową asocjację międzyklatkową. Ufność detekcji jest wykorzystywana do adaptacyjnego podziału detekcji na grupy o wysokiej, średniej i niskiej ufności, które są przetwarzane przy użyciu różnych strategii asocjacji. Detekcje o wysokiej ufności są powiązane głównie na podstawie informacji o ruchu, podczas gdy w przypadku detekcji o średniej i niskiej ufności dodatkowo uwzględnia się kolor stroju oraz numer zawodnika, aby poprawić utrzymanie tożsamości w sytuacjach słabej widoczności dowodów wizualnych. Metoda jest przeznaczona do zadań analizy wideo sportowego wymagających stabilnych trajektorii sportowców, takich jak analiza taktyczna i interpretacja zachowań graczy.

Zaproponowane podejście posiada również ograniczenia operacyjne. Ekstrakcja semantyczna koszulek może być utrudniona przez silne przesłonięcia, rozmycie ruchu, niską rozdzielczość obrazu, nietypowe pozy zawodników lub niewidoczne numery na koszulkach. W takich przypadkach semantyczne wskazówki oparte na koszulkach mogą stać się niekompletne, a proces asocjacji w większym stopniu opiera się na spójności ruchu i weryfikacji wieloklatkowej. W związku z tym deklarowana wydajność w niniejszym badaniu jest ograniczona do ewaluowanych zbiorów danych i ustawień eksperymentalnych. Eksperymenty na zbiorze danych SportsMOT pokazują, że JerseyTrack poprawia ewaluowane metryki śledzenia i redukuje liczbę zdarzeń przełączania tożsamości w przetestowanych warunkach śledzenia sportowego. Główna trudność MOT w filmach sportowych polega na utrzymaniu ciągłości trajektorii i spójności tożsamości przy szybkim ruchu, przesłonięciach i podobieństwie wyglądu. Istniejące badania powiązane z JerseyTrack można szeroko podzielić na dwa kierunki badawcze: wykorzystanie pewności detekcji do asocjacji trajektorii oraz wzmacnianie wskazówek tożsamości poprzez specyficzne dla sportu cechy semantyczne.

Poziom ufności detekcji (detection confidence) jest szeroko stosowany do szacowania niezawodności ramek detekcji oraz do kierowania asocjacją trajektorii w MOT. Wczesne metody śledzenia zazwyczaj traktowały ufność jako binarny kryterium filtrowania, w którym detekcje poniżej ustalonego progu były usuwane w celu redukcji wyników fałszywie dodatnich11,12. Strategia ta redukuje liczbę zakłóconych detekcji, ale może również odrzucić rzeczywiste cele w przypadku okluzji, szybkiego ruchu lub niskiej jakości obrazu, co prowadzi do fragmentacji trajektorii13,14,15. Podobne strategie filtrowania wykazały również, że stałe progi ufności są wrażliwe na zmienność sceny i jakość detekcji16,17. Aby usprawnić wykorzystanie detekcji o niskim poziomie ufności, w ByteTrack wprowadzono strategię asocjacji, która zachowuje ramki o niskiej ufności jako potencjalne cele dla dopasowania wtórnego i łączy je z istniejącymi trajektoriami poprzez podobieństwo ruchu i historię trajektorii18. McByte rozszerza asocjację w sportowym MOT, wprowadzając czasowo propagowane maski segmentacji jako wskazówkę asocjacyjną, co poprawia odporność w warunkach szybkiego ruchu, okluzji i przesunięć kamery bez konieczności dodatkowego trenowania dla każdego wideo19. Powiązane badania zmodyfikowały również wykorzystanie detekcji o niskiej ufności, aby zachować słabe, ale potencjalnie poprawne cele podczas asocjacji20,21,22. Strategie asocjacji adaptacyjne względem ufności doprecyzowały następnie kryteria dopasowania zgodnie ze spójnością ruchu i niezawodnością detekcji23,24,25. Metody udoskonalania trajektorii oparte na regresji ramek detekcji i optymalizacji gładkości trajektorii były również stosowane w celu redukcji fragmentacji trajektorii26,27,28. Dodatkowe strategie udoskonalania zapewniają uzupełniające wsparcie dla zachowania ciągłości trajektorii w złożonych warunkach ruchu29. Czasowo spójny przepływ obiektów (temporal coherent object flow) dodatkowo modeluje czasową spójność na poziomie obiektu pomiędzy klatkami, stanowiąc kolejne podejście zorientowane na asocjację w celu redukcji przerw w trajektoriach w złożonych scenariuszach MOT30. Metody fuzji trackerów uczą się również z wyników wielu trackerów i wykorzystują oparte na uczeniu strategie selekcji lub fuzji, aby poprawić odporność śledzenia w różnych benchmarkach MOT31. Łącznie badania te wskazują, że asocjacja uwzględniająca ufność pomaga odzyskać przerwane trajektorie; jednak wskazówki dotyczące ufności i ruchu dostarczają ograniczone informacje o tożsamości, gdy zawodnicy z tej samej drużyny mają podobny wygląd wizualny. Chociaż metody te skutecznie łagodzą fragmentację trajektorii w scenariuszach ogólnych, napotykają one na inherentne ograniczenia w ustawieniach sportowych, ponieważ zawodnicy z tej samej drużyny często mają bardzo podobny wygląd, a poleganie wyłącznie na informacjach o ufności i ruchu nie może zapewnić wystarczającej podstawy do rozróżnienia tożsamości32,33,34. Nawet gdy ramki o niskiej ufności są skutecznie odzyskiwane, podobieństwo cech nadal może prowadzić do zamiany tożsamości (identity switching), co utrudnia spełnienie rygorystycznych wymagań dotyczących spójności tożsamości w analizie sportowej.

W celu poprawy dyskryminacji tożsamości w śledzeniu sportowców wykorzystywano również specyficzne dla sportu wskazówki tożsamościowe. Semantyczne informacje z koszulek, takie jak kolor drużyny i numer zawodnika, dostarczają wskazówek tożsamościowych, które są bardziej bezpośrednio związane z sytuacjami sportowymi niż ogólne osadzenia wyglądu35,36,37. Kolor koszulki był wykorzystywany do wspierania dyskryminacji na poziomie drużyny i redukcji pomyłek między drużynami, podczas gdy rozpoznawanie numeru zawodnika dostarcza bardziej precyzyjnej wskazówki tożsamościowej, gdy obszar numeru jest widoczny i czytelny38,39. Istniejące badania nad śledzeniem w sporcie włączyły specyficzne dla domeny cechy wizualne oraz rozpoznawanie kolorów koszulek, aby poprawić asocjację zawodników w zatłoczonych warunkach sportowych40,41. Powiązane prace nad rozpoznawaniem numerów na koszulkach i syntetycznymi danymi numerowymi dodatkowo wspierają modelowanie tożsamości w warunkach niskiej rozdzielczości lub częściowego przesłonięcia42,43. Badania te wskazują, że semantyka koszulek może wzmocnić reprezentację tożsamości w sports MOT. Jednak większość metod śledzenia wzbogaconych semantycznie nie modeluje w sposób wystarczający relacji między pewnością detekcji a jakością cech semantycznych. Detekcje o wysokiej pewności mogą już zawierać niezawodne informacje przestrzenne i dotyczące wyglądu, co sprawia, że powtarzająca się ekstrakcja semantyczna jest mniej efektywna. Detekcje o niskiej pewności często cierpią z powodu przesłonięcia, rozmycia, ucięcia lub niskiej rozdzielczości, co zmniejsza niezawodność wskazówek dotyczących koloru i numeru zawodnika. Ograniczenie to motywuje do zaprojektowania asocjacji sterowanej pewnością, w której semantyka koszulek jest wprowadzana w zależności od jakości detekcji, a nie stosowana jednolicie do wszystkich detekcji. Przejrzane badania pokazują, że asocjacja świadoma pewności i modelowanie semantyczne koszulek odnoszą się do różnych aspektów sports MOT. Strategie oparte na pewności określają głównie, czy detekcja powinna uczestniczyć w asocjacji i w jaki sposób powinna zostać dopasowana do istniejących trajektorii, podczas gdy strategie semantyczne koszulek przede wszystkim wzmacniają reprezentację tożsamości poprzez wskazówki specyficzne dla sportu. Jednak te dwa mechanizmy są często projektowane jako osobne komponenty. W rezultacie wskazówki semantyczne nie zawsze są dostosowywane do jakości detekcji, a poziomy pewności nie regulują bezpośrednio wykorzystania informacji o kolorze i numerze zawodnika podczas asocjacji. Rozdzielność ta ogranicza wspólne radzenie sobie z fragmentacją trajektorii i pomyłkami w tożsamości w materiałach wideo z gier zespołowych. Pozostała luka badawcza polega na powiązaniu oceny jakości pewności detekcji z semantyczną asocjacją koszulek w ramach tego samego procesu śledzenia.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie obejmowało wtórną analizę publicznie dostępnych benchmarkowych zbiorów danych wideo, a mianowicie SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20. Nie rekrutowano uczestników, nie przeprowadzano żadnych interwencji ani nie gromadzono nowych danych dotyczących ludzi. Zgodnie z obowiązującymi wymogami instytucjonalnymi Uniwersytetu Bangkok Thonburi, badanie to nie wymagało zgody komisji etycznej.

Poniższy protokół opisuje schemat postępowania wykorzystany do odtworzenia JerseyTrack, od przygotowania danych po ocenę śledzenia. Schemat ten obejmuje przygotowanie zbioru danych, przygotowanie detektora, semantyczną ekstrakcję koszulek, partycjonowanie poziomów ufności, asocjację sterowaną poziomem ufności, inferencję śledzenia oraz ocenę wydajności, co zostało podsumowane na Rysunku 1. Wymagane oprogramowanie, zbiory danych i zasoby sprzętowe wymieniono w Tabeli materiałów.

Proces śledzenia zawodników; ekstrakcja cech koszulek; schemat; predykcja stanu; asocjacja danych.
Rysunek 1. Ogólny schemat działania metody JerseyTrack. Schemat obejmuje semantyczną ekstrakcję cech koszulek, wstępne dopasowanie obiektów, uzupełniające dopasowanie sterowane poziomem ufności oraz fuzję cech. Cechy koloru drużyny i numeru zawodnika są ekstrahowane z wykrytych obszarów sportowców i włączane do procesu asocjacji, aby poprawić dopasowanie trajektorii w warunkach niepewnej detekcji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

1. Przygotowanie zbiorów danych i struktury katalogów

  1. Pobierz publiczne zestawy danych benchmarkowych wymienione w Tabeli Materiałów. Użyj SportsMOT jako głównego zestawu danych do przygotowania detektora i oceny śledzenia. Zachowaj TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20 do oceny międzyzbiorowej.
  2. Przechowuj wszystkie zestawy danych w ujednoliconym katalogu projektu. Upewnij się, że detektor, moduł ekstrakcji semantycznej, moduł śledzenia oraz zestaw narzędzi ewaluacyjnych używają identycznych identyfikatorów sekwencji.
  3. Konwertuj oficjalne adnotacje SportsMOT do formatu treningowego detektora, korzystając ze skryptu do przygotowania danych zastosowanego w niniejszym badaniu. Wykonaj następującą komendę:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Skrypt do przygotowania danych (scripts/prepare_data.py) jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Wymagane zależności oprogramowania są określone w pliku environment.yml, w tym Python 3.12, PyTorch 2.11.0 oraz OpenCV 4.10 lub nowsza wersja. Skonfiguruj środowisko oprogramowania za pomocą następującej komendy: conda env create -f environment.yml. Wykonaj skrypt do przygotowania danych za pomocą następującej komendy: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Zweryfikuj, czy konwersja wygenerowała plik konfiguracyjny do treningu detektora: data\processed\SportsMOT_yolo\data.yaml oraz manifest konwersji: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    UWAGA: W niniejszym badaniu skonwertowany zestaw danych treningowych i walidacyjnych SportsMOT zawierał 90 sekwencji, 55 544 klatki oraz 608 152 adnotowane obiekty.
  6. Przejrzyj reprezentatywne sekwencje, aby upewnić się, że kolejność klatek, współrzędne ramek ograniczających (bounding-box) oraz etykiety tożsamości pozostają spójne z oryginalnymi adnotacjami benchmarkowymi.
  7. Zachowaj skonwertowane pliki adnotacji bez modyfikacji podczas przygotowania detektora, wnioskowania śledzenia i ewaluacji, aby wszystkie metody korzystały z tego samego podziału zbioru danych i protokołu oceny.
    UWAGA: Oczekiwanym rezultatem tej sekcji jest zestandaryzowany katalog treningowy detektora SportsMOT zawierający skonwertowane adnotacje, manifest konwersji oraz pliki podziału zbioru danych niezbędne do przygotowania detektora i oceny śledzenia.

2. Przygotowanie wyjść detektora

  1. Przeprowadź dostrojenie detektora obiektów, wykorzystując przygotowany podzbiór treningowy SportsMOT. Zoptymalizuj detektor, stosując stratę klasyfikacji oraz stratę regresji ramki ograniczającej zdefiniowane w Równaniu 1. Zastosuj rozdzielczość wejściową detektora, wielkość partii, szybkość uczenia, liczbę epok treningowych oraz pozostałe parametry treningowe opisane w konfiguracji implementacji i w Tabeli materiałów
    Ldet = Lcls + Lbox   (1)
    Gdzie Ldet  oznacza całkowitą stratę detektora, Lcls oznacza stratę klasyfikacji, a Lbox  oznacza stratę regresji ramki ograniczającej.
    UWAGA: Punkt kontrolny detektora użyty w głównych eksperymentach (wewnętrzny identyfikator eksperymentu e3) został wytrenowany przy użyciu frameworka Ultralytics YOLO z konfiguracją zbioru danych SportsMOT w formacie YOLO (data/processed/SportsMOT_yolo/data.yaml). Uruchom trening detektora za pomocą następującego polecenia: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Po treningu wykorzystaj uzyskany, najlepiej działający punkt kontrolny do wygenerowania wyników detektora dla sekwencji walidacyjnych za pomocą następującego polecenia: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Po zakończeniu treningu zapisz punkt kontrolny wytrenowanego detektora, odpowiadający plik metadanych oraz dziennik treningu.
    UWAGA: W niniejszym badaniu punkt kontrolny detektora użyty w eksperymentach formalnych został zapisany jako:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Odpowiadający mu plik metadanych został zapisany jako: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Katalog z wynikami detektora użyty w głównych eksperymentach walidacyjnych SportsMOT to: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Uruchom wytrenowany detektor na każdej sekwencji walidacyjnej, aby wygenerować ramki ograniczające sportowców oraz wyniki ufności. Wyeksportuj jeden plik detekcji dla każdej sekwencji, zawierający indeks klatki, współrzędne ramki ograniczającej, ufność detekcji oraz etykietę klasy.
    UWAGA: W przebiegu walidacji SportsMOT wykorzystanym w głównych eksperymentach, próg ufności wynoszący 0.05 wygenerował 343 990 detekcji sportowców.
  4. Przejrzyj katalog z wynikami detektora przed inferencją śledzenia. Potwierdź, że każda sekwencja posiada odpowiadający jej plik detekcji, że indeksy klatek zgadzają się z przygotowaną sekwencją obrazów oraz że każdy rekord detekcji zawiera wynik ufności.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest kompletny katalog z wynikami detektora, który służy jako dane wejściowe do semantycznej ekstrakcji numerów koszulek, partycjonowania poziomów ufności oraz asocjacji śledzenia.

3. Ekstrakcja cech semantycznych koszulki

  1. Wykorzystaj pliki wyjściowe detektora do wycięcia obszarów z zawodnikami z każdej klatki wideo. Zapisz każdy wycięty obraz zawodnika wraz z identyfikatorem sekwencji, indeksem klatki oraz indeksem detekcji. Wyklucz nieprawidłowe wycięcia z brakującą treścią obrazu lub ramkami ograniczającymi wykraczającymi poza granice obrazu. Zachowaj powiązanie między nazwą pliku wycięcia a oryginalnym rekordem detekcji, aby wyodrębnione cechy semantyczne mogły zostać dopasowane do odpowiadającej im detekcji podczas asocjacji śledzenia.
  2. Wyodrębnij cechy koloru koszulki z wyciętych obrazów zawodników, korzystając ze skryptu ekstrakcji semantycznej zastosowanego w niniejszym badaniu.
    UWAGA: Skrypty ekstrakcji cech semantycznych (scripts/extract_fast_color_semantics.py oraz scripts/formal_extract_semantics.py) są dostępne w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nie jest wymagany oddzielny plik konfiguracyjny; wszystkie parametry czasu wykonania są przekazywane za pomocą argumentów wiersza poleceń.
    Wygeneruj deskryptory koloru koszulki za pomocą następującego polecenia: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Wygeneruj semantyczne cechy numerów zawodników za pomocą modelu OCR, stosując następujące polecenie: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Wygenerowane deskryptory koloru koszulek i wyniki prawdopodobieństwa numerów zawodników są powiązane za pomocą identyfikatora sekwencji i połączone w plikach cech semantycznych używanych podczas asocjacji śledzenia.
  3. Przekonwertuj każdy wycięty obraz zawodnika do przestrzeni barw Hue, Saturation, Value (HSV). Wyodrębnij piksele pierwszego planu z obszaru koszulki i podsumuj dominujący kolor koszulki, korzystając z klastrowania K-średnich z K = 3. Przed porównaniem cech znormalizuj wynikowy deskryptor koloru za pomocą normalizacji L2.
  4. Wytrenuj gałąź rozpoznawania numerów zawodników, korzystając z wyciętych obrazów zawodników o rozmiarze wejściowym 128 × 64 pikseli. Wygeneruj pseudoetykiety numerów zawodników, stosując procedurę etykietowania ze słabym nadzorem {weakly supervised labeling} zastosowaną w niniejszym badaniu. Wyklucz z obliczeń straty optycznego rozpoznawania znaków (OCR) wycięcia z niewidocznymi, nieczytelnymi, silnie przesłoniętymi lub niskopoziomowymi obszarami numerów zawodników.
  5. Zoptymalizuj gałąź OCR, korzystając ze straty entropii krzyżowej zdefiniowanej w Równaniu 2.
    Równanie straty entropii krzyżowej, \(L_{ocr} = -\sum_{i=1}^{N} y_i \log(\hat{y}_i)\), formuła matematyczna. (2)
    Tutaj Locr oznacza stratę OCR, yi  oznacza nadzorowaną etykietę numeru zawodnika, a Regresja wielomianowa: ŷi=â+bx; wykres punktowy z krzywą dopasowania; wykres analizy danych. oznacza przewidzianą kategorię numeru zawodnika.
  6. Zoptymalizuj moduł ekstrakcji cech semantycznych, korzystając z adaptacyjnego optymalizatora, tempa uczenia, rozmiaru partii, zaniku wag i czasu trenowania wymienionych w Tabeli Materiałów. Połącz stratę detektora i stratę OCR, stosując całkowity cel trenowania zdefiniowany w Równaniu 3.
    Ltotal = Ldet + γLocr   (3)
    Tutaj Ltotal oznacza całkowitą stratę trenowania, Ldet oznacza stratę detektora zdefiniowaną w Równaniu 1, Locr oznacza stratę OCR zdefiniowaną w Równaniu 2, a γ oznacza zdefiniowany przez użytkownika współczynnik wagowy dla straty OCR.
  7. Zastosuj wytrenowaną gałąź OCR do każdego wyciętego obrazu zawodnika. Zapisz przewidzianą kategorię numeru zawodnika lub wektor prawdopodobieństwa dla każdego wycięcia. Jeśli numer zawodnika nie jest widoczny lub ufność OCR jest poniżej progu zdefiniowanego w implementacji, zarejestruj cechę numeru zawodnika jako niedostępną, zamiast wymuszać predykcję.
  8. Połącz deskryptor koloru koszulki i wynik numeru zawodnika w pliku cech semantycznych używanym przez moduł śledzenia.
    UWAGA: W głównym przebiegu walidacji SportsMOT skrypt ekstrakcji semantycznej przetworzył 343 990 detekcji bez brakujących klatek lub nieprawidłowych wycięć. W aktualnym pakiecie rewizyjnym podsumowanie ekstrakcji semantycznej wykazało ogólną dokładność ekstrakcji semantycznej koloru i OCR na poziomie 86,7% w ocenianym ustawieniu SportsMOT. Oczekiwanym wynikiem tej sekcji jest plik cech semantycznych, w którym każdy prawidłowy rekord detekcji jest powiązany z deskryptorem koloru koszulki, wynikiem numeru zawodnika (jeśli jest dostępny) oraz flagą wskazującą, czy informacje semantyczne są dostępne dla asocjacji śledzenia.

4. Poziomy ufności wykrywania partycji

  1. Wczytaj plik z wynikami detektora dla każdej sekwencji wideo. Zbierz wyniki ufności (confidence scores) dla wszystkich detekcji sportowców w każdej klatce.
  2. Podziel wyniki ufności na poziomie klatki na przedziały wysokiej, średniej i niskiej ufności, stosując klastrowanie K-średnich z K = 3, zgodnie z przepływem asocjacji sterowanej ufnością przedstawionym na Rysunku 2. Wyznacz adaptacyjne progi ufności poprzez minimalizację wariancji wewnątrzklastrowej zgodnie z Równaniem 4.
    Wzór na równowagę statyczną, równanie Σ(sd−μ)^2, optymalizacja matematyczna, schemat badawczy.  (4)
    Tutaj sd oznacza wynik ufności detekcji d; D1, D2 oraz D3 oznaczają odpowiednio przedziały wysokiej, średniej i niskiej ufności; μ1, μ2 oraz μ3 oznaczają średnie wyniki ufności dla trzech przedziałów; a τ1 oraz τ2 oznaczają adaptacyjne progi ufności uzyskane z wyników klastrowania K-średnich.
    UWAGA: Skrypt do podziału ufności (scripts/formal_partition_confidence.py) jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Moduł podziału ufności wykorzystuje jednowymiarową procedurę klastrowania K-średnich opartą na bibliotece NumPy z K = 3. Nie jest wymagany osobny plik konfiguracyjny; katalog wejściowy, katalog wyjściowy oraz parametr klastrowania są określane za pomocą argumentów wiersza poleceń. Wykonaj procedurę podziału ufności za pomocą następującego polecenia: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Wymagane zależności oprogramowania, w tym wersja NumPy, są określone w pliku environment.yml.
  3. Uruchom procedurę podziału ufności, wskazując katalog z wynikami detektora jako wejście.
    UWAGA: W niniejszym badaniu katalog z wynikami detektora był: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Katalog wyjściowy podziału ufności był: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Wygenerowane pliki wyjściowe obejmowały pliki CSV z ufnością dla każdej sekwencji, _confidence_frame_summary.csv oraz _confidence_runtime.csv.
  4. Przypisz etykietę poziomu ufności do każdej detekcji. Oznacz detekcje o wysokiej ufności do asocjacji opartej na ruchu, detekcje o średniej ufności do asocjacji semantyczno-ruchowej, a detekcje o niskiej ufności wyłącznie do odzyskiwania trajektorii. Zachowaj oryginalny wynik ufności wraz z przypisaną etykietą poziomu ufności.
  5. Przeanalizuj rozkłady wyników ufności oraz reprezentatywne klatki, zgodnie z ilustracją na Rysunku 3. Zweryfikuj, czy detekcje o wysokiej ufności odpowiadają głównie pełnym i wiarygodnym ramkom ograniczającymi (bounding boxes) sportowców, podczas gdy detekcje o średniej i niskiej ufności zawierają głównie detekcje częściowe, przesłonięte, rozmyte lub słabe.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest plik podziału ufności zawierający indeks detekcji, oryginalny wynik ufności, przypisany poziom ufności oraz adaptacyjne progi ufności na poziomie klatki dla każdej detekcji.

Schemat algorytmu analizy wideo dla klasyfikacji przedziałów ufności; zawiera wzory i metody.
Rycina 2. Strategia asocjacji kierowana ufnością. Przepływ pracy dzieli ufność detekcji na przedziały wysokiej, średniej i niskiej ufności przy użyciu adaptacyjnego klastrowania ufności. Detekcje o wysokiej ufności są asocjowane na podstawie podobieństwa ruchu, detekcje o średniej ufności są asocjowane przy użyciu połączonego podobieństwa ruchu i semantyki koszulki, a detekcje o niskiej ufności są wykorzystywane do wspomaganej semantycznie rekonstrukcji trajektorii z weryfikacją wieloklatkową. Panel po prawej stronie podsumowuje sformułowania matematyczne stosowane do podziału ufności i asocjacji. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres słupkowy porównujący dawki decyzyjne w przedziałach ufności dla piłki nożnej, koszykówki i siatkówki.
Rycina 3. Rozkład wyników ufności detekcji. Histogram przedstawia liczbę ramek detekcji sportowców w pięciu przedziałach ufności dla sekwencji piłki nożnej, koszykówki i siatkówki w zbiorze danych SportsMOT. Rozkład ten ilustruje różnice w ufności detektora w ocenianych kategoriach dyscyplin sportowych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

5. Przeprowadzenie asocjacji z prowadzeniem opartym na ufności

  1. Wczytaj plik z wynikami detektora, plik cech semantycznych oraz plik partycji ufności dla każdej sekwencji wideo. Zainicjuj tracker, wykorzystując pierwsze poprawne detekcje, i utrzymuj jeden stan trajektorii dla każdego śledzonego sportowca. Dla każdej kolejnej klatki przewiduj pozycję każdej istniejącej trajektorii, korzystając z modelu ruchu filtru Kalmana.
  2. Oblicz podobieństwo ruchu między każdą przewidzianą trajektorią a kandydacką detekcją, stosując odległość Mahalanobisa zdefiniowaną w Równaniu 5.
    Schemat równania metryki statystycznej, przedstawiający wzór \( S_{mot} \) do analizy danych.  (5)
    Tutaj Równowaga statyczna: symbol \(t_i^k\), schemat równania fizycznego. oznacza I-tą trajektorię w klatce k, równowaga statyczna, ΣFx=0, schemat ilustrujący równowagę sił, edukacyjny koncept fizyczny oznacza stan trajektorii przewidziany przez filtr Kalmana, dj oznacza kandydacką detekcję, Równanie równowagi statycznej, Σi^-1, wyrażenie matematyczne. oznacza odwrotność macierzy kowariancji stanu przewidzianej trajektorii, a Smot oznacza odległość ruchu między przewidzianą trajektorią a detekcją.
    UWAGA: Główny proces asocjacji jest zaimplementowany w pliku jerseytrack/formal_tracker.py i wykonywany za pomocą skryptu scripts/formal_track.py; oba są dostępne w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Osobny plik konfiguracyjny nie jest wymagany. Wszystkie parametry czasu wykonania, w tym progi ufności, maksymalny wiek trajektorii, współczynniki wag ruchu oraz waga odległości środka, są przekazywane jako argumenty wiersza poleceń. Pełna komenda wykonawcza i ustawienia parametrów zostały podane w Kroku 6.2. Implementacja wykorzystuje algorytm liniowej sumy przypisań z biblioteki SciPy do dopasowania węgierskiego oraz bibliotekę NumPy do asocjacji opartej na kosztach.
  3. Uruchom proces śledzenia, używając pliku z wynikami detektora, pliku cech semantycznych oraz pliku partycji ufności jako danych wejściowych.
    UWAGA: W niniejszym badaniu główny tracker został zaimplementowany w jerseytrack\formal_tracker.py, a proces śledzenia był wykonywany za pomocą scripts\formal_track.py.
  4. Powiąż detekcje o wysokim poziomie ufności z istniejącymi trajektoriami, wykorzystując spójność ruchu. Aktualizuj dopasowane trajektorie i inicjuj nowe trajektorie tylko wtedy, gdy niedopasowane detekcje o wysokim poziomie ufności spełniają kryteria inicjalizacji trajektorii.
  5. Przeanalizuj wyniki ekstrakcji semantyki koszulek przedstawione na Rysunku 4 i skonstruuj wektor cech semantycznych koszulki dla każdej detekcji, łącząc deskryptor koloru drużyny i cechę numeru zawodnika zgodnie z Równaniem 6.
    fsem = [fcol;fid] (6)
    Tutaj fsem oznacza połączony wektor cech semantycznych, fcol oznacza deskryptor koloru drużyny, a fid oznacza cechę numeru zawodnika wygenerowaną przez gałąź OCR.
  6. Powiąż detekcje o średnim poziomie ufności, łącząc podobieństwo ruchu z podobieństwem semantycznym koszulek. Oblicz połączony wynik dopasowania zgodnie z Równaniem 7.
    Równanie matematyczne dla analizy fuzji danych, zawierające składniki fuzji ruchu i semantyki. (7)
    Tutaj Ssem oznacza podobieństwo cosinusowe między wektorami cech semantycznych trajektorii i kandydackiej detekcji, Smot oznacza odległość ruchu zdefiniowaną w Równaniu 5, a λ oznacza adaptacyjny współczynnik fuzji równoważący składniki podobieństwa ruchu i semantyki.
  7. Oblicz adaptacyjny współczynnik fuzji zgodnie z Równaniem 8.
    Równanie wykładniczego zaniku na schemacie, ilustrujące proces zależny od naprężeń w inżynierii materiałowej. (8)
    Tutaj λoznacza początkowy współczynnik wagi ruchu, σsd oznacza odchylenie standardowe wyników ufności detekcji w aktualnej klatce, a σmax oznacza maksymalne odchylenie standardowe wyniku ufności używane do normalizacji.
  8. Używaj detekcji o niskim poziomie ufności wyłącznie do odzyskiwania trajektorii. Dopasuj detekcje o niskim poziomie ufności do przerwanych trajektorii tylko wtedy, gdy dostępne są informacje semantyczne i spełnione są kryteria odzyskiwania. Zastosuj weryfikację wieloklatkową przed przywróceniem tożsamości trajektorii i odrzuć detekcje, które nie przeszły weryfikacji.
    UWAGA: Gdy cecha numeru zawodnika jest niedostępna, przeprowadź asocjację przy użyciu dostępnych informacji semantycznych i spójności ruchu, zamiast wymuszać dopasowanie numeru zawodnika. Oczekiwanym wynikiem tej sekcji jest klatkowy zapis śledzenia zawierający tożsamości trajektorii, ramki ograniczające (bounding boxes), etykiety poziomu ufności, koszty ruchu, informacje semantyczne oraz ostateczne decyzje asocjacyjne. W pakiecie dowodów rewizyjnych wyniki śledzenia zostały zapisane w: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

Śledzenie meczu siatkówki za pomocą komputerowego rozpoznawania obrazów, analiza ruchu zawodników, wizualizacja danych.
Rysunek 4. Ekstrakcja cech semantycznych koszulek. Reprezentatywne detekcje sportowców są opisane wyekstrahowanymi deskryptorami kolorów drużyny oraz informacjami o numerach zawodników, wygenerowanymi przez moduł ekstrakcji semantycznej koszulek. Wyekstrahowane cechy semantyczne są następnie włączane do asocjacji danych sterowanej poziomem ufności. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

6. Uruchomienie wnioskowania śledzenia i eksport wyników

  1. Przeprowadź inferencję śledzenia dla każdej sekwencji wideo, korzystając z przygotowanych plików wyjściowych detektora, plików cech semantycznych oraz plików partycji ufności. Przetwarzaj klatki wideo w porządku chronologicznym, aby stany trajektorii, historia semantyczna i decyzje o odzyskiwaniu trajektorii były aktualizowane spójnie w całej sekwencji. Stosuj tę samą konfigurację inferencji dla wszystkich ocenianych sekwencji, chyba że wyraźnie wskazano ustawienia specyficzne dla danego zbioru danych.
    UWAGA: Inferencja śledzenia została wykonana przy użyciu skryptu scripts/formal_track.py, który jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Osobny plik konfiguracyjny nie jest wymagany. Wykonaj inferencję śledzenia za pomocą następującej komendy: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Wszystkie niewskazane parametry zachowały wartości domyślne zapisane w zarchiwizowanym kodzie źródłowym.
  2. Po inferencji zastosuj główną sekwencję postprocesowania za pomocą następujących komend: python scripts/merge_tracklets.py oraz python scripts/sweep_track_filter.py --min-len 95.
  3. Wyeksportuj wyniki śledzenia w formacie wymaganym przez zestaw narzędzi ewaluacyjnych. Uwzględnij indeks klatki, identyfikator trajektorii, współrzędne ramki ograniczającej (bounding box) oraz wszystkie pola wymagane przez format ewaluacji benchmarku. Zapisz jeden plik wyników śledzenia dla każdej sekwencji, stosując spójną konwencję nazewnictwa plików, tak aby każdy plik wyników można było dopasować do odpowiadającego mu pliku adnotacji ground-truth.
  4. Zastosuj wyłącznie operacje postprocesowania użyte w niniejszym badaniu. Przeprowadź łączenie trackletów i filtrowanie ścieżek za pomocą skryptów postprocesowania opisanych w pakiecie rewizyjnym.
    UWAGA: W niniejszym badaniu w przepływie pracy postprocesowania użyto następujących skryptów:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Przejrzyj wyeksportowane wyniki śledzenia przed ewaluacją ilościową. Potwierdź, że identyfikatory trajektorii pozostają numeryczne i spójne w obrębie każdej sekwencji, że żadne indeksy klatek nie zostały pominięte oraz że wszystkie ramki ograniczające znajdują się w granicach obrazu.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest kompletny zestaw plików z wynikami śledzenia na poziomie sekwencji, gotowy do ewaluacji ilościowej.

7. Ocena wydajności śledzenia

  1. Oceń wyeksportowane pliki z wynikami śledzenia, korzystając z zestawu narzędzi ewaluacyjnych wymienionego w Tabeli Materiałów. Dopasuj każdy plik z wynikami śledzenia do odpowiadającego mu pliku z adnotacjami referencyjnymi (ground-truth) oraz odpowiedniego podzbioru danych. Dla wszystkich porównywanych metod zastosuj tę samą konfigurację ewaluacyjną, aby upewnić się, że różnice w wydajności wynikają z rezultatów śledzenia, a nie z ustawień ewaluacji.
  2. Uruchom ewaluację za pomocą następującego polecenia
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    UWAGA: Ewaluacja została przeprowadzona z wykorzystaniem standardowej implementacji metryk TrackEval (Wersja 1.3.0) zarchiwizowanej w pakiecie reprodukcyjności JerseyTrack. Nie wprowadzono żadnych modyfikacji do implementacji metryk Higher Order Tracking Accuracy (HOTA), CLEAR ani Identity. Repozytorium zawiera wrapper wykonawczy w stylu MOTChallenge znajdujący się w evaluation/trackeval/scripts/run_mot_challenge.py, który konfiguruje ścieżki do zbioru danych i wyników oraz wywołuje standardowe metryki ewaluacyjne TrackEval.
  3. Zapisz metryki ewaluacyjne przedstawione w manuskrypcie, w tym Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detection Accuracy (DetA), Association Accuracy (AssA), wyniki fałszywie dodatnie (FPs), wyniki fałszywie ujemne (FNs) oraz zdarzenia przełączania tożsamości (identity-switching events). Wyeksportuj podsumowanie ewaluacji w formie tabeli i zachowaj pliki z ewaluacją dla każdej sekwencji w celu weryfikacji.
  4. Podczas porównywania JerseyTrack z metodami bazowymi stosuj ten sam podzbiór danych, te same wyniki z detektora oraz tę samą konfigurację ewaluacyjną dla wszystkich metod. Dla każdego porównania odnotuj użyty zbiór danych, źródło wyników z detektora, konfigurację zestawu narzędzi ewaluacyjnych oraz wartości metryk.
  5. Przejrzyj logi ewaluacji, aby zweryfikować, czy wszystkie sekwencje zostały pomyślnie ocenione i czy nie brakuje żadnych plików z wynikami śledzenia.
    UWAGA: W niniejszym badaniu główny plik podsumowujący TrackEval został zapisany w: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Oczekiwanym rezultatem tej sekcji jest kompletna tabela podsumowująca ewaluację wraz z plikami metryk dla poszczególnych sekwencji, które stanowią podstawę dla raportowanych Wyników oraz późniejszej weryfikacji.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tej sekcji przedstawiono ilościowe i jakościowe wyniki uzyskane z ocenianych eksperymentów wielobieżnego śledzenia obiektów w sporcie. Wyniki koncentrują się na dokładności śledzenia, zachowaniu tożsamości obiektów, jakości asocjacji oraz odporności w ramach testowanych ustawień zestawu danych. Roszczenia dotyczące wydajności są ograniczone do ocenianych metod, zestawów danych, wyników detektora oraz konfiguracji narzędzi ewaluacyjnych opisanych w protokole i konfiguracji implementacji.

Układ eksperymentalny i projekt oceny

Zbiór danych i wstępne przetwarzanie:

Zestaw SportsMOT został wykorzystany jako główny punkt odniesienia do przygotowania detektora, wnioskowania w śledzeniu oraz oceny ilościowej. Zbiór danych zawiera 240 sekwencji wideo i ponad 150 000 klatek obrazu obejmujących scenariusze z piłki nożnej, koszykówki i siatkówki (Rysunek 5). W formalnej ocenie główne wyniki dla SportsMOT obliczono przy użyciu podzbioru walidacyjnego wraz z wynikami detektora, konfiguracją śledzenia i ustawieniami TrackEval opisanymi w Protokołach. Ewaluacja międzyzbiorowa została przeprowadzona na zbiorach TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20 w celu zbadania transferu wydajności pomiędzy różnymi typami zbiorów danych, a nie w celu bezpośredniego porównania metryk między nimi.

Sekwencja analizy meczów sportowych, zawierająca klatki z piłki nożnej, koszykówki i siatkówki; schemat badania ruchu.
Rycina 5. Reprezentatywne zbiory danych wykorzystane do ewaluacji. Przykładowe klatki ilustrują reprezentatywne sekwencje z piłki nożnej, koszykówki i siatkówki użyte w ewaluacji eksperymentalnej. Rycina podkreśla różnice w punkcie widzenia kamery, zagęszczeniu zawodników oraz złożoności sceny w ewaluowanych zbiorach danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Dane SportsMOT zostały zorganizowane zgodnie z oficjalną strukturą zbioru danych i przekonwertowane na format trenowania detektora opisany w Protokole. Przekonwertowane dane treningowe i walidacyjne SportsMOT zawierały 90 sekwencji, 55 544 klatek i 608 152 adnotowanych obiektów. Partycja treningowa została wykorzystana do przygotowania detektora i dostrojenia parametrów, natomiast partycja walidacyjna posłużyła do formalnej ewaluacji śledzenia przedstawionej w niniejszym badaniu. Wszystkie klatki wejściowe zostały przeskalowane zgodnie z konfiguracją detektora opisaną w Protokole oraz w Tabeli materiałów. Ta sama procedura wstępnego przetwarzania została zastosowana podczas przygotowania detektora, ekstrakcji cech semantycznych, wnioskowania śledzenia oraz ewaluacji TrackEval, tak aby zgłaszane różnice odzwierciedlały przede wszystkim strategię asocjacji śledzenia, a nie różnice w przetwarzaniu danych.

Wskaźniki oceny:

Wydajność śledzenia oceniono przy użyciu protokołu ewaluacyjnego zgodnego z MOTChallenge, zaimplementowanego za pomocą zestawu narzędzi ewaluacyjnych wymienionego w Tabeli Materiałów. Raportowane metryki opisują trzy aspekty wydajności MOT w sporcie: ogólną dokładność śledzenia, zachowanie tożsamości oraz jakość detekcji i asocjacji. Jako główne metryki ewaluacyjne zastosowano MOTA, IDF1 oraz HOTA44,45. MOTA podsumowuje wyniki fałszywie dodatnie, fałszywie ujemne oraz zmiany tożsamości w postaci ogólnej oceny dokładności śledzenia. IDF1 mierzy spójność między przewidywanymi trajektoriami a tożsamościami rzeczywistymi (ground-truth). HOTA wspólnie ocenia dokładność detekcji i dokładność asocjacji, a tym samym charakteryzuje równowagę między lokalizacją celu a asocjacją trajektorii. DetA i AssA raportowano jako metryki uzupełniające. FPs, FNs oraz zmiany tożsamości (IDs) wykorzystano do scharakteryzowania źródeł błędów związanych z błędnymi detekcjami, pominiętymi detekcjami oraz zmianami tożsamości. W celu porównania metod w ramach SportsMOT zastosowano te same wyniki detektora i konfigurację zestawu narzędzi ewaluacyjnych, aby ograniczyć wpływ zmienności detektora i różnic w ustawieniach ewaluacji. W przypadku porównań między zbiorami danych, wartości metryk interpretowano jako wyniki ewaluacji wewnątrz danego zbioru, a nie jako dowód absolutnej wyższości wydajności w różnych zbiorach danych.

Środowisko eksperymentalne i konfiguracja parametrów:

Eksperymenty przeprowadzono z wykorzystaniem zasobów sprzętowych i programowych wymienionych w Tabeli materiałów. W celu zachowania spójności podczas przygotowania detektora, wnioskowania w śledzeniu oraz oceny wydajności, w głównych eksperymentach SportsMOT stosowano to samo środowisko obliczeniowe, strukturę detektora, dane wyjściowe detektora oraz zestaw narzędzi ewaluacyjnych. Struktura detektora wymieniona w Tabeli materiałów została wytrenowana przy użyciu wielkości partii (batch size) wynoszącej 16, początkowej szybkości uczenia 0,01 oraz 80 epok treningowych. W module semantycznej ekstrakcji koszulek do grupowania kolorów wykorzystano algorytm K-means z K = 3, a gałąź OCR wykorzystała lekką splotową rekurencyjną sieć neuronową o rozmiarze wejściowym 128 × 64 pikseli. Gałąź OCR została zoptymalizowana przy użyciu adaptacyjnego optymalizatora wymienionego w Tabeli materiałów z szybkością uczenia 1 × 10⁻3, spadkiem wag (weight decay) 1 × 10⁻5, wielkością partii 64 oraz 40 epokami treningowymi. Podczas trenowania modułu ekstrakcji cech semantycznych nie stosowano dodatkowego harmonogramu szybkości uczenia. Współczynnik ważenia straty OCR (γ) traktowano jako hiperparametr definiowany przez użytkownika i dobierano na podstawie wyników na zbiorze walidacyjnym. Stratyfikacja poziomu ufności wykorzystywała adaptacyjny podział K-means, w którym wartości τ₁ i τ₂ były obliczane z rozkładu ufności detekcji dla każdej klatki, zamiast być definiowane ręcznie przed wnioskowaniem.

Monitorowanie wydajności w różnych dyscyplinach sportowych i przy różnym stopniu złożoności scenariuszy

Wydajność ilościowa w różnych dyscyplinach sportowych i warunkach otoczenia:

Wydajność śledzenia została oceniona w odniesieniu do dwóch czynników grupujących: kategorii sportu oraz złożoności sceny. Analiza kategorii sportu obejmowała sekwencje piłki nożnej, koszykówki i siatkówki. Analiza złożoności sceny uwzględniała poziom przesłonięcia, prędkość ruchu i gęstość obiektów, stosując te same kryteria grupowania we wszystkich ocenianych sekwencjach. Raportowane metryki były zgodne z protokołem ewaluacyjnym opisanym w sekcji 7 Protokołu.

Rysunek 6 podsumowuje wyniki ilościowego śledzenia w różnych kategoriach sportowych i warunkach złożoności sceny. Rysunek 6A przedstawia wartości MOTA i DetA dla sekwencji piłki nożnej, koszykówki i siatkówki. Rysunek 6B przedstawia zmienność MOTA przy różnych poziomach przesłonięcia, prędkości ruchu i gęstości obiektów. Rysunek 6C przedstawia skumulowaną liczbę FP i FN dla każdego wymiaru złożoności sceny.

Wykresy analizy MOTA: wykresy słupkowe i liniowe porównujące MOTA i DetA w różnych dyscyplinach sportu, scenariuszach oraz liczbie FP/FN.
Rysunek 6. Wydajność śledzenia w różnych kategoriach sportowych i warunkach scenicznych. (A) Dokładność śledzenia wielu obiektów (MOTA) oraz dokładność detekcji (DetA) dla piłki nożnej, koszykówki, siatkówki oraz średnia ogólna. (B) MOTA w reprezentatywnych warunkach scenicznych o różnym stopniu przesłonięcia, zagęszczenia zawodników i złożoności ruchu. (C) Liczba wyników fałszywie dodatnich (FPs) i fałszywie ujemnych (FNs) w ocenianych warunkach scenicznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

W trzech kategoriach sportowych system JerseyTrack osiągnął średnią wartość MOTA wynoszącą 88,9% oraz średnią wartość DetA wynoszącą 80,2%. Różnica w MOTA pomiędzy kategoriami sportowymi wyniosła 1,3 punktu procentowego, przy czym najwyższą wartość MOTA odnotowano dla sekwencji siatkówki (89,2%), a najniższą dla sekwencji koszykówki (87,9%). Niższa wartość MOTA zaobserwowana dla sekwencji koszykówki jest spójna z większą częstotliwością interakcji w bliskim zasięgu oraz gęstymi okluzjami w ocenianych sekwencjach. W mniej złożonych warunkach scenicznych, obejmujących lekką okluzję, niską prędkość ruchu i rzadki rozkład obiektów, MOTA osiągnęła odpowiednio 91,8%, 93,1% i 93,8%. W bardziej złożonych warunkach scenicznych wartość MOTA spadła do 84,9% przy silnej okluzji, 83,6% przy szybkim ruchu i 83,1% przy gęstym rozkładzie obiektów. Wyniki te pokazują, że wydajność śledzenia spadała wraz ze wzrostem złożoności sceny, pozostając jednocześnie w raportowanym zakresie we wszystkich ocenianych scenariuszach sportowych.

Śledzenie spójności w reprezentatywnych scenariuszach sportowych:

Rysunek 7 przedstawia reprezentatywne przykłady śledzenia, ilustrujące spójność czasową algorytmu JerseyTrack w trzech wymagających scenariuszach sportowych: gęstych interakcjach między zawodnikami, długotrwałym częściowemu zasłonięciu oraz gwałtownych zmianach kierunku. W tych reprezentatywnych sekwencjach tracker zachował spójne tożsamości trajektorii pomimo częstego nakładania się sportowców i dynamicznego ruchu. Fragmentacja tożsamości była obserwowana głównie podczas silnego zasłonięcia lub w sytuacjach, gdy semantyka koszulki stała się tymczasowo niedostępna; jednak strategia asocjacji kierowana poziomem ufności umożliwiła odzyskanie trajektorii po ponownym pojawieniu się wiarygodnych detekcji. Przykłady te jakościowo potwierdzają wyniki ilościowe przedstawione na Rysunku 6, demonstrując stabilne zachowanie tożsamości w ocenianych warunkach śledzenia sportowego.

Schemat analityki sportowej porównujący pozycje zawodników w koszykówce, piłce nożnej i siatkówce.
Rysunek 7. Reprezentatywne wyniki śledzenia wygenerowane przez JerseyTrack. Kolejne klatki z sekwencji koszykówki, piłki nożnej i siatkówki ilustrują zachowanie tożsamości i trajektorii sportowców podczas śledzenia. Kolorowe ramki ograniczające reprezentują śledzone tożsamości utrzymane w kolejnych klatkach wideo. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Wyniki ablacji dla zachowania tożsamości:

Przeprowadzono analizę ablacyjną w celu zbadania wpływu strategii asocjacji kierowanej pewnością (confidence-guided association) oraz modułu fuzji semantycznej koszulek (jersey semantic fusion module) na zachowanie tożsamości. Porównano cztery warianty modelu: V0, model bazowy bez asocjacji kierowanej pewnością ani fuzji semantycznej koszulek; V1, wariant wykorzystujący wyłącznie asocjację kierowaną pewnością; V2, wariant wykorzystujący wyłącznie fuzję semantyczną koszulek; oraz V3, pełną konfigurację JerseyTrack uwzględniającą oba komponenty. Ewaluacja koncentrowała się na metrykach związanych z tożsamością, w tym IDs, IDF1, precyzji tożsamości (IDP) i czułości tożsamości (IDR). Reprezentatywne wzorce zachowania tożsamości przedstawiono na Rysunku 8.

Analiza wydajności modelu; wykresy słupkowe i liniowe; scenariusze V3 vs V0; porównanie metryk danych; analityka.
Rycina 8. Analiza ablacyjna semantycznego powiązania koszulek kierowanego pewnością. (A) Całkowita liczba przełączeń tożsamości (IDs) oraz wskaźnik IDentity F1 (IDF1) dla ocenianych wariantów modelu. (B) Porównanie IDs pomiędzy pełnym modelem (V3) a konfiguracją bazową (V0) w reprezentatywnych, wymagających scenariuszach śledzenia. (C) IDF1, precyzja ID (IDP) oraz pełność ID (IDR) pełnego modelu w różnych scenariuszach śledzenia. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

W ogólnych ustawieniach walidacji SportsMOT pełna konfiguracja V3 przyniosła najniższą liczbę identyfikatorów (ID) oraz najwyższą wartość IDF1 spośród czterech wariantów modelu. W przypadku V3 odnotowano 2 768 ID, co oznacza o 477 mniej przełączeń tożsamości niż w V0, a uzyskana wartość IDF1 wyniosła 74,3%, co stanowi wzrost o 7,1 punktu procentowego w porównaniu do V0. Wyniki te wskazują, że oba moduły wspólnie przyczyniły się do zachowania tożsamości w ocenianych warunkach śledzenia w sporcie. Porównanie wariantów z pojedynczym modułem z pełną konfiguracją wykazało ponadto, że oba moduły wpływały na różne źródła błędów śledzenia. Strategia asocjacji kierowana pewnością (confidence-guided association strategy) zredukowała błędy dopasowania związane z niestabilną pewnością detekcji i niepewnością lokalizacji, podczas gdy moduł semantycznej fuzji koszulek (jersey semantic fusion module) dostarczył dodatkowych informacji o tożsamości w sytuacjach, gdy same informacje o ruchu były niewystarczające. Pełna konfiguracja V3 osiągnęła lepsze wyniki związane z tożsamością niż którykolwiek z wariantów z pojedynczym modułem, co sugeruje, że oba moduły wniosły wkład komplementarny, a nie redundantny.

Wyniki na poziomie scenariuszy wykazały większe różnice w bardziej wymagających warunkach zachowania tożsamości. Podczas długotrwałej okluzji V3 zarejestrowało 215 ID w porównaniu z 482 dla V0. W gęstych scenariuszach z zawodnikami tej samej drużyny, obejmujących od 6 do 10 graczy, V3 zarejestrowało 328 ID w porównaniu z 615 dla V0. Przy szybkich zmianach kierunku V3 zarejestrowało 482 ID w porównaniu z 960 dla V0. Redukcje te są zgodne z zamierzonym wykorzystaniem wskazówek semantycznych podczas okluzji i gęstych interakcji oraz z asocjacją sterowaną pewnością przy fluktuującej pewności detekcji podczas szybkiego ruchu. Trendy IDP i IDR przedstawione na Rysunku 8C wskazują, że redukcja liczby ID nie wiązała się ze znacznym spadkiem precyzji tożsamości (identity precision) ani kompletności tożsamości (identity recall). Pełna konfiguracja utrzymała wartości IDF1 powyżej 71% we wszystkich ocenianych wymagających scenariuszach, przy czym niższe wartości zaobserwowano podczas gęstych interakcji zawodników tej samej drużyny oraz szybkich zmian kierunku. Wyniki te wskazują na poprawę spójności tożsamości w ocenianych warunkach, identyfikując jednocześnie gęste interakcje i szybki ruch jako główne pozostałe źródła degradacji wydajności.

Wyniki ewaluacji międzyzbiorowej:

Przeprowadzono ewaluację międzyzbiorową, aby zbadać, czy zachowanie śledzenia zaobserwowane w SportsMOT może zostać utrzymane w różnych warunkach zbiorów danych. Ewaluacja objęła dwa zbiory danych specyficzne dla sportu, SoccerNet Tracking i TeamTrack, oraz dwa ogólne zbiory MOT, MOT17 i MOT20. Celem tego eksperymentu było zbadanie transferu wydajności pomiędzy różnymi typami zbiorów danych. Wyniki nie zostały wykorzystane do wykazania bezpośredniej przewagi na poziomie metryk pomiędzy zbiorami, ponieważ różnią się one protokołami adnotacji, kompozycją scen, punktami widzenia kamery oraz kategoriami obiektów.

Tabela 1 podsumowuje wyniki ewaluacji międzyzbiorowej. W przypadku zbiorów danych specyficznych dla sportu, JerseyTrack utrzymał stosunkowo stabilne wartości MOTA i IDF1 w porównaniu z głównym ustawieniem walidacyjnym SportsMOT. Tendencja ta sugeruje, że strategia asocjacji kierowana pewnością oraz semantyczne wskazówki związane z koszulkami pozostały skuteczne, gdy sceny śledzenia zachowały wizualne charakterystyki sportów zespołowych, w tym powtarzające się mundury, gęste interakcje sportowców i częste przesłonięcia. W przypadku ogólnych zbiorów danych MOT, metoda utrzymała konkurencyjne wartości MOTA i DetA, podczas gdy IDF1 była niższa niż obserwowana dla zbiorów specyficznych dla sportu. Wzorzec ten jest spójny z brakiem informacji o kolorze koszulki i numerze zawodnika w zbiorach MOT17 i MOT20, które są wykorzystywane przez moduł fuzji semantycznej. W tych warunkach komponent asocjacji kierowanej pewnością pozostał stosowalny, podczas gdy gałąź semantyczna dostarczała mniej informacji specyficznych dla tożsamości niż w przypadku filmów ze sportów zespołowych. Ogólnie wyniki te wskazują, że JerseyTrack przenosił się skuteczniej na zbiory danych zawierające specyficzną dla sportu semantykę wizualną niż na ogólne zbiory danych do śledzenia pieszych. Ewaluacja międzyzbiorowa potwierdza zatem zamierzone zastosowanie metody jako trackera zorientowanego na sport, jednocześnie wskazując brak jawnej semantyki koszulek jako czynnik ograniczający dla ogólnych zbiorów danych MOT.

Zbiór danychMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

Tabela 1: Wyniki ewaluacji międzyzbiorowej. Wydajność śledzenia algorytmu JerseyTrack oceniona na czterech publicznych zbiorach danych referencyjnych. Raportowano dokładność śledzenia wielu obiektów (MOTA), wskaźnik IDF1 (IDF1), dokładność detekcji (DetA) oraz prędkość przetwarzania mierzoną jako liczba klatek na sekundę (FPS). Wyższe wartości wskaźników MOTA, IDF1, DetA i FPS oznaczają lepszą wydajność.

Wytrzymałość w kontrolowanych warunkach perturbacji

Przeprowadzono eksperymenty z kontrolowanymi zakłóceniami, aby zbadać stabilność systemu JerseyTrack w warunkach typowych zaburzeń wizualnych i jakościowych detekcji występujących w nagraniach wideo ze sportu. Ewaluowane zakłócenia podzielono na trzy kategorie: zakłócenia cech semantycznych, zakłócenia ramki detekcji oraz zakłócenia środowiskowe. Zakłócenia cech semantycznych obejmowały przesłonięcie numeru zawodnika, rozmycie obrazu, degradację rozdzielczości oraz podobne kolory koszulek. Zakłócenia ramki detekcji obejmowały przesunięcie ramki ograniczającej (bounding-box), fluktuacje pewności detekcji oraz fałszywe ramki detekcji. Zakłócenia środowiskowe obejmowały szum przypominający deszcz, degradację przypominającą mgłę, silne oświetlenie oraz interferencję cieni. Rysunek 9 podsumowuje wydajność śledzenia w tych warunkach zakłóceń. W przypadku zakłóceń cech semantycznych wydajność śledzenia spadała wraz z pogarszaniem się widoczności numeru zawodnika i jakości wycinka. Gdy 40% obszaru numeru zawodnika było przesłonięte, wskaźnik MOTA spadł o 3,2 punktu procentowego, a IDF1 o 5,3 punktu procentowego w stosunku do warunków bez zakłóceń, podczas gdy dokładność ekstrakcji semantycznej pozostała na poziomie 86,7%. Wyniki te wskazują, że kolor koszulki i wskazówki dotyczące numeru zawodnika dostarczały komplementarnych informacji w sytuacjach, gdy jedna z cech semantycznych stawała się mniej wiarygodna. W przypadku zakłóceń ramki detekcji metoda wykazała umiarkowany spadek wydajności zamiast gwałtownego błędu. Gdy ramki detekcji zostały przesunięte o ±10 pikseli, a wyniki pewności zostały poddane zakłóceniom szumem Gaussa, spadek MOTA pozostał poniżej 3 punktów procentowych, a wzrost wskaźnika IDs nie przekroczył 16%. Tendencja ta jest zgodna ze strategią asocjacji kierowaną pewnością, w której detekcje o średniej i niskiej pewności są przetwarzane przy użyciu dodatkowych ograniczeń asocjacji, a nie tą samą strategią, która jest stosowana dla detekcji o wysokiej pewności.

Analiza numerów na koszulkach z wykresami intensywności przesłonięcia, wydajności, tempa wzrostu i dokładności semantycznej.
Rycina 9. Ocena odporności w warunkach kontrolowanych perturbacji. (A) Zmiany w dokładności śledzenia wielu obiektów (MOTA), wyniku F1 tożsamości (IDF1) oraz liczbie zmian tożsamości (IDs) wraz ze wzrostem przesłonięcia numerów na koszulkach. (B) Spadek wydajności w reprezentatywnych warunkach zakłóceń. (C) Wzrost liczby IDs w zależności od rodzaju zakłóceń. (D) Dokładność ekstrakcji semantycznej numerów na koszulkach w ocenianych warunkach perturbacji. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

W warunkach zaburzeń środowiskowych spadki w głównych metrykach śledzenia pozostały poniżej 5 punktów procentowych w ocenianych warunkach, a dokładność ekstrakcji semantycznej wyniosła 87,2%. Zastosowanie deskryptorów koloru w przestrzeni HSV zmniejszyło wrażliwość na zmiany oświetlenia, podczas gdy gałąź OCR zachowała użyteczne informacje o numerach zawodników dla podzbioru rozmytych lub zdegradowanych wycinków obrazu. Wyniki te wskazują, że moduł semantyczny pozostał użyteczny w ocenianych warunkach zaburzeń, choć jego niezawodność nadal zależała od widoczności koszulki oraz jakości wycinka. Ogólnie rzecz biorąc, kontrolowane eksperymenty z zaburzeniami wykazały, że JerseyTrack utrzymał mierzalną wydajność śledzenia w ocenianych zakresach zaburzeń semantycznych, jakości detekcji oraz środowiskowych. Wnioski te należy interpretować w ramach przetestowanego zakresu zaburzeń. Systematyczna reidentyfikacja po wyjściu poza pole widzenia, silny szum w tle oraz długotrwałe całkowite przesłonięcie nie zostały ocenione oddzielnie w tym eksperymencie i są omówione jako ograniczenia w sekcji Dyskusja.

Analiza wkładu modułów i dyskryminacji cech

W celu zbadania, w jaki sposób dwa zaproponowane komponenty wpłynęły na wydajność śledzenia powiązanego z tożsamością, przeprowadzono dalszą analizę wkładu modułów oraz dyskryminacji cech. Analiza wkładu modułów wykorzystała cztery warianty modelu zdefiniowane w analizie ablacyjnej, natomiast analiza dyskryminacji cech porównywała tradycyjne cechy Re-ID, cechy oparte wyłącznie na kolorze, cechy oparte wyłącznie na numerach zawodników oraz połączone cechy semantyczne koszulek. Do opisu separowalności cech wykorzystano stosunek odległości międzyklasowej do wewnątrzklasowej, gdzie większe wartości wskazywały na większą separację między różnymi tożsamościami w stosunku do zmienności w obrębie tej samej tożsamości. Tabela 2 podsumowuje analizę wkładu modułów. W ogólnej ocenie szacowany wkład strategii asocjacji kierowanej pewnością wyniósł 41,7%, szacowany wkład fuzji semantycznej koszulek 47,6%, a pozostałe 10,7% przypisano łącznemu zastosowaniu obu komponentów. Wartości te wskazują, że oba komponenty przyczyniły się do zaobserwowanej poprawy, podczas gdy pełna konfiguracja odniosła korzyść z ich wspólnego zastosowania, a nie z każdego komponentu z osobna. Wzorzec wkładu różnił się w zależności od typu sceny. Przy silnych przesłonięciach szacowany wkład fuzji semantycznej koszulek wzrósł do 69,4%, co jest zgodne ze zmniejszoną wiarygodnością wskazówek dotyczących ruchu w sytuacjach, gdy sportowcy byli częściowo lub tymczasowo przesłonięci. Przy ruchu o wysokiej prędkości szacowany wkład asocjacji kierowanej pewnością osiągnął 44,3%, a łączny zysk wyniósł 20,6%, co wskazuje, że partycjonowanie na poziomie pewności stało się bardziej istotne, gdy pewność detekcji wahała się z powodu szybkiego ruchu lub niepewności lokalizacji.

Wariant modeluScenariusz testowyMOTA↑IDF1↑IDs↓Wkład modułuZysk synergiczny
V0 (Baseline)Cała scena83.567.23245
Sceny z silnymi przesłonięciami77.861.53862
Scena z szybkim ruchem77.162.33689
V1 (Asocjacja kierowana pewnością)Cała scena86.370.9289341.7
Sceny z silnymi przesłonięciami80.965.9341529.8
Scena z szybkim ruchem81.467.9302444.3
V2 (Semantyczna asocjacja koszulek)Cała scena85.271.8293747.6
Sceny z silnymi przesłonięciami82.772.8275369.4
Scena z szybkim ruchem80.166.8315735.1
V3 (Pełny JerseyTrack)Cała scena88.974.3276810.7
Sceny z silnymi przesłonięciami84.975.626890.8
Scena z szybkim ruchem83.671.5284220.6

Tabela 2: Analiza ablacyjna wkładu poszczególnych modułów. Porównanie wydajności różnych wariantów modelu JerseyTrack w scenariuszach ogólnych, z silnymi przesłonami oraz przy ruchu o dużej prędkości. Dokładność śledzenia wielu obiektów (MOTA), wynik F1 dla tożsamości (IDF1) oraz liczba zmian tożsamości (IDs) są przedstawione wraz z szacowanym wkładem modułów i zyskiem synergicznym. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1, wkładu modułów i zysku synergicznego, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.

Tabela 3 podsumowuje analizę dyskryminacji cech. Połączona cecha semantyczna koszulki osiągnęła stosunek odległości międzyklasowej do wewnątrzklasowej na poziomie 5,63, w porównaniu do 1,82 dla tradycyjnych cech Re-ID, co odpowiada względnej poprawie o 209,3% w mierniku stosunku odległości. Cechy oparte wyłącznie na kolorze oraz wyłącznie na numerze zawodnika również poprawiły rozdzielność cech w stosunku do tradycyjnych cech Re-ID, choć każda z tych poszczególnych wskazówek pozostała podatna na konkretne przypadki błędów, w tym podobne kolory drużyn, przesłonięcie numeru zawodnika, rozmycie ruchu oraz nieczytelne obszary koszulki. Wśród ocenianych reprezentacji cech, połączona reprezentacja semantyczna osiągnęła najwyższą rozdzielność cech i odpowiadała najwyższemu wskaźnikowi IDF1 oraz najniższej liczbie ID zaobserwowanej w analizie ablacyjnej. Wyniki te wspierają wykorzystanie specyficznych dla koszulki wskazówek semantycznych jako uzupełniających informacji o tożsamości w systemach MOT w sporcie, gdy sportowcy mają podobny wygląd, a same informacje o ruchu są niewystarczające. Obserwacje te ograniczają się do ocenianego środowiska SportsMOT i nie powinny być interpretowane jako dowód na to, że semantyka koszulek rozwiązuje wszystkie niejednoznaczności tożsamości w każdym materiale wideo ze sportu.

Typ cechyStosunek odległości międzyklasowej do wewnątrzklasowejPoprawa względna (%)IDF1↑IDs↓
Tradycyjne cechy Re-ID1.8265.73482
Cechy koloru drużyny3.1774.269.83125
Cechy numeru zawodnika3.4991.870.53018
Zintegrowane semantyczne cechy koszulki5.63209.374.32768

Tabela 3: Analiza dyskryminacyjna różnych reprezentacji cech. Porównanie dyskryminacji cech z wykorzystaniem tradycyjnych cech re-identyfikacji (Re-ID), cech koloru koszulki, cech numerów zawodników oraz połączonych cech semantycznych. Przedstawiono stosunek odległości międzyklasowej do wewnątrzklasowej, wzgloszną poprawę dyskryminacji cech, wynik F1 dla tożsamości (IDF1) oraz liczbę zmian tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku stosunku odległości, względnej poprawy i IDF1, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.

Porównanie referencyjne z istniejącymi metodami MOT

Przeprowadzono porównanie referencyjne w celu zestawienia systemu JerseyTrack z reprezentatywnymi metodami MOT w tych samych warunkach walidacji zbioru SportsMOT. Metody poddane porównaniu obejmowały QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT oraz MOTR. Wszystkie metody wykorzystywały te same wyniki detektora wygenerowane przez framework detekcyjny wymieniony w Tabeli Materiałów, tak aby porównanie koncentrowało się na wydajności asocjacji śledzenia, a nie na różnicach między detektorami. Do oceny wykorzystano metryki zdefiniowane w sekcji 7 Protokołu. Główne metryki oceny obejmowały MOTA, HOTA oraz IDF1. Metryki pomocnicze obejmowały DetA, AssA, FPs, FNs oraz IDs. Tabela 4 podsumowuje ilościowe porównanie na zbiorze walidacyjnym SportsMOT, a Rysunek 10 przedstawia wizualne porównanie dokładności śledzenia, szybkości inferencji oraz rozkładu HOTA w analizowanych scenach sportowych. JerseyTrack osiągnął najwyższą wartość MOTA spośród porównywanych metod, wynoszącą 88.9%. Wartość ta była o 1.1 punktu procentowego wyższa niż w przypadku Deep OC-SORT (87.8%) i o 2.5 punktu procentowego wyższa niż w przypadku ByteTrack (86.4%). W analizowanych warunkach walidacji SportsMOT system JerseyTrack osiągnął zatem najwyższą ogólną dokładność śledzenia spośród porównywanych metod. W przypadku HOTA JerseyTrack osiągnął wynik 69.9%, w porównaniu do 64.4% dla Deep OC-SORT i 62.8% dla ByteTrack. Różnice te odpowiadają poprawie o odpowiednio 5.5 i 7.1 punktu procentowego, co wskazuje na lepszą równowagę między wydajnością detekcji a asocjacji w tych samych warunkach oceny.

MetodaMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓ID↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Tabela 4: Porównanie wydajności metody JerseyTrack i reprezentatywnych metod śledzenia wielu obiektów na zbiorze walidacyjnym SportsMOT.Porównanie JerseyTrack z reprezentatywnymi metodami śledzenia wielu obiektów (MOT) na zbiorze danych walidacyjnych SportsMOT. Raportowane metryki obejmują dokładność śledzenia wielu obiektów (MOTA), dokładność śledzenia wyższego rzędu (HOTA), wynik F1 dla tożsamości (IDF1), dokładność detekcji (DetA), dokładność asocjacji (AssA), liczbę wyników fałszywie dodatnich (FP), liczbę wyników fałszywie ujemnych (FN) oraz liczbę zmian tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, HOTA, IDF1, DetA i AssA, natomiast niższe wartości wskazują na lepszą wydajność w przypadku FP, FN i IDs.

Analiza zbioru danych SportsMOT; wykres rozrzutu MOTA vs FPS, wykres pudełkowy HOTA w scenach sportowych, porównanie algorytmów.
Rysunek 10. Porównanie wydajności z reprezentatywnymi metodami śledzenia wielu obiektów. (A) Porównanie dokładności śledzenia wielu obiektów (MOTA) i liczby klatek na sekundę (FPS) dla JerseyTrack oraz reprezentatywnych metod śledzenia wielu obiektów ocenianych na zbiorze danych SportsMOT. (B) Rozkład dokładności śledzenia wyższego rzędu (HOTA) w ocenianych metodach śledzenia. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

W zakresie zachowania tożsamości JerseyTrack osiągnął wskaźnik IDF1 na poziomie 74,3%, w porównaniu do 69,9% dla Deep OC-SORT oraz 67,7% dla ByteTrack. JerseyTrack zarejestrował również 2 768 identyfikatorów (ID), co stanowi liczbę mniejszą niż 3 211 ID zarejestrowanych przez Deep OC-SORT oraz 4 192 ID zarejestrowanych przez ByteTrack. Obserwacje te są zgodne z wynikami ablacji przedstawionymi na Rysunku 8 oraz w Tabeli 2, w których pełna konfiguracja JerseyTrack zredukowała częstotliwość przełączania tożsamości w stosunku do wariantów modelu bazowego. W kwestii jakości detekcji i asocjacji JerseyTrack osiągnął wskaźnik DetA na poziomie 80,2% oraz AssA na poziomie 54,3%. W porównaniu z Deep OC-SORT, JerseyTrack poprawił DetA o 2,0 punktu procentowego, a AssA o 2,2 punktu procentowego. JerseyTrack wygenerował również mniej błędów FP oraz FN niż pozostałe metody porównawcze raportowane w Tabeli 4, odnotowując 21 953 FP i 67 160 FN. Ogólnie rzecz biorąc, porównanie benchmarkowe wykazało, że JerseyTrack osiągnął najwyższe wartości głównych metryk śledzenia spośród ewaluowanych metod w ustawieniach walidacyjnych SportsMOT. Wyniki te są zgodne z zaobserwowaną poprawą w zachowaniu tożsamości i stabilności asocjacji, uzyskaną dzięki zastosowaniu asocjacji sterowanej pewnością (confidence-guided association) oraz semantycznej fuzji koszulek. Porównanie ogranicza się do wspólnych wyników detektora oraz konfiguracji walidacyjnej SportsMOT zastosowanej w niniejszym badaniu.

Wyniki analizy wrażliwości parametrów

Przeprowadzono analizę czułości parametrów, aby zbadać, w jaki sposób kluczowe parametry implementacji wpływały na wydajność śledzenia w warunkach walidacji SportsMOT. Oceniono trzy parametry: współczynnik wagowy straty OCR (γ), liczbę hierarchicznych klastrów poziomu ufności (K) oraz szybkość uczenia sieci OCR (η). Tabela 5 podsumowuje wartości MOTA, IDF1, HOTA oraz IDs uzyskane przy różnych ustawieniach parametrów.

ParametrWartośćMOTA↑IDF1↑HOTA↑IDs↓
Waga straty OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (optymalna)88.974.369.92,768
188.273.869.32,792
Liczba klastrów ufności (K)286.772.168.52,876
3 (optymalna)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
Szybkość uczenia OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (optymalna)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Tabela 5: Analiza wrażliwości parametrów. Wydajność śledzenia uzyskana przy użyciu różnych ustawień parametrów dla JerseyTrack. Przedstawiono wskaźniki Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA) oraz liczbę przełączeń tożsamości (IDs) dla różnych wartości współczynnika wagowego straty Optical Character Recognition (OCR) (γ), liczby klastrów ufności (K) oraz szybkości uczenia OCR (η). Wartości parametrów zidentyfikowane jako optymalne odpowiadają ustawieniom zastosowanym w raportowanych eksperymentach. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1 i HOTA, natomiast niższe wartości wskazują na lepszą wydajność dla IDs.

W przypadku współczynnika wagowego straty OCR (γ), najlepsze wyniki uzyskano dla γ = 0.8. Przy tych ustawieniach JerseyTrack osiągnął wskaźnik MOTA na poziomie 88.9%, IDF1 wynoszący 74.3%, HOTA na poziomie 69.9% oraz 2,768 ID. Gdy wartość γ została zmniejszona do 0.2, wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 84.7%, 69.4% i 66.2%, podczas gdy liczba ID wzrosła do 2,944. Po zwiększeniu γ do 1.0 metryki wydajności nieznacznie spadły w porównaniu do γ = 0.8, osiągając MOTA na poziomie 88.2%, IDF1 wynoszący 73.8%, HOTA na poziomie 69.3% oraz 2,792 ID. Wyniki te wskazują, że niewystarczający nadzór OCR obniżył zdolność rozróżniania numerów zawodników, natomiast zwiększenie wagi straty OCR powyżej ocenionego optimum nie poprawiło wydajności śledzenia w testowanych warunkach.

W przypadku liczby hierarchicznych klastrów poziomu ufności (K), najlepszą ocenioną wydajność uzyskano dla K = 3. Ustawienie to odpowiada strategii asocjacji o wysokim, średnim i niskim poziomie ufności opisanej w metodologii. Przy K = 2 partycjonowanie ufności było mniej szczegółowe, a wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 86,7%, 72,1% i 68,5%. Gdy K wzrosło do 4 lub 5, wydajność również spadła w stosunku do K = 3, co sugeruje, że nadmierna partycjonacja podzieliła detekcje na zbyt wąskie grupy ufności i zmniejszyła stabilność strategii asocjacji. Wyniki te potwierdzają zasadność zastosowania trzech poziomów ufności w ocenianej konfiguracji JerseyTrack.

W przypadku tempa uczenia sieci OCR (η), najlepszą ocenioną wydajność uzyskano przy η = 1 × 10-3. Przy niższym tempie uczenia wynoszącym 1 × 10-4, wskaźniki MOTA, IDF1 oraz HOTA spadły odpowiednio do 85,9%, 70,8% i 67,3%, natomiast liczba identyfikatorów (IDs) wzrosła do 2 934. Przy wyższym tempie uczenia wynoszącym 1 × 10-2, MOTA, IDF1 i HOTA spadły odpowiednio do 86,5%, 71,6% i 68,7%, podczas gdy liczba identyfikatorów wzrosła do 2 889. Wyniki te wskazują, że odgałęzienie OCR było wrażliwe na dobór tempa uczenia, a wartość 1 × 10-3 zapewniła najlepszą równowagę między rozpoznawaniem liczby graczy a wydajnością zachowania tożsamości w ocenianych warunkach.

Ogólnie Tabela 5 pokazuje, że kombinacja parametrów γ = 0.8, K = 3 oraz η = 1 × 10-3 pozwoliła uzyskać najwyższe wartości ocenianych wskaźników MOTA, IDF1 i HOTA, przy jednoczesnej najniższej liczbie identyfikatorów (ID). Analiza wrażliwości wykazała również, że umiarkowane odchylenia od tych wartości parametrów prowadziły do mierzalnych, lecz nie gwałtownych zmian w wydajności śledzenia. W związku z tym ustawienia te zostały zastosowane w porównaniu referencyjnym oraz w głównych eksperymentach walidacyjnych SportsMOT opisanych w niniejszym badaniu.

Dostępność danych

Surowe podsumowania oceny, końcowe wyniki śledzenia, rejestry środowiska, pliki mapowania zbiorów danych oraz pośrednie pliki podsumowujące wspierające wyniki niniejszego badania są dostępne w publicznym repozytorium pod adresem https://doi.org/10.5281/zenodo.21274353. Oryginalne publiczne zbiory danych referencyjnych wykorzystane w tym badaniu, w tym SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20, są dostępne u ich odpowiednich dostawców i nie są redystrybuowane w repozytorium.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W niniejszym badaniu oceniono workflow sportowego MOT sterowany pewnością, który łączy partycjonowanie na podstawie pewności detekcji z semantycznymi wskazówkami dotyczącymi koszulek. Asocjację sterowaną pewnością oraz fuzję cech semantycznych badano jako strategie komplementarne, mające na celu poprawę asocjacji danych w śledzeniu wielu obiektów12,20,23,24,46. Wyniki pokazują, że pełna konfiguracja JerseyTrack poprawiła zachowanie tożsamości i stabilność asocjacji w ocenianym ustawieniu walidacyjnym SportsMOT. Główny wynik walidacji SportsMOT osiągnął wartość MOTA na poziomie 88.9%, HOTA 69.9%, IDF1 74.3%, DetA 80.2% oraz AssA 54.3%. Wartości te należy interpretować w odniesieniu do źródła wyjścia detektora, podziału zbioru danych oraz konfiguracji TrackEval opisanych w protokole.

Kluczowym krokiem w procesie jest partycjonowanie poziomu ufności, które umożliwia zastosowanie różnych strategii asocjacji w zależności od niezawodności wyników detektora20,22,23,24. Poprzez podział detekcji na grupy o wysokim, średnim i niskim poziomie ufności, JerseyTrack stosuje różne reguły asocjacji dla detekcji o różnych poziomach niezawodności. Detekcje o wysokim poziomie ufności są powiązane głównie poprzez spójność ruchu, podczas gdy w przypadku detekcji o średnim poziomie ufności wykorzystuje się wspólnie semantykę ruchu i koszulek. Detekcje o niskim poziomie ufności nie są używane do inicjowania nowych trajektorii i są brane pod uwagę wyłącznie podczas odzyskiwania trajektorii. Taka konstrukcja zmniejszyła ryzyko, że słabe detekcje lub wyniki fałszywie dodatnie stworzą niestabilne tożsamości, jednocześnie pozwalając na to, aby częściowe detekcje przyczyniały się do odzyskiwania trajektorii w sytuacji dostępności dodatkowych dowodów semantycznych8,11,20. Drugim krytycznym krokiem jest ekstrakcja semantyki koszulek. Cechy kolorów drużyn stanowią ograniczenie na poziomie drużyny, natomiast cechy numerów zawodników dostarczają bardziej precyzyjnych wskazówek dotyczących tożsamości, gdy obszar numeru jest widoczny i czytelny35,41,42,43. Wyniki ablacji wskazują, że wskazówki te są najbardziej użyteczne w przypadku gęstych interakcji zawodników z tej samej drużyny oraz w sytuacjach okluzji, gdzie asocjacja oparta wyłącznie na ruchu jest mniej niezawodna. Niemniej jednak semantyka koszulek powinna być traktowana jako dowód pomocniczy, a nie jako całkowity zamiennik asocjacji ruchu. Numery zawodników mogą być nieczytelne z powodu rozmycia, ucięcia, ujęć od tyłu, silnej okluzji lub niskiej rozdzielczości obrazu. Cechy kolorów drużyn również nie pozwalają odróżnić sportowców z tej samej drużyny, gdy informacje o numerach są niedostępne35,42,43. Wyniki z różnych zbiorów danych dodatkowo wyjaśniają zakres zastosowania tej metody. JerseyTrack przenosił się bardziej naturalnie na zbiory danych sportów drużynowych niż na ogólne zbiory danych MOT dla pieszych, ponieważ gałąź semantyczna została zaprojektowana w oparciu o kolor koszulek i numery zawodników19,33,34,35,36,37. W przypadku ogólnych zbiorów danych MOT komponent asocjacji sterowany poziomem ufności pozostał możliwy do zastosowania, ale specyficzna dla sportu gałąź semantyczna dostarczyła mniej informacji o tożsamości. W związku z tym metoda ta jest najbardziej odpowiednia dla filmów z gier zespołowych, w których sportowcy noszą charakterystyczne stroje, a obszar koszulki jest wystarczająco widoczny do ekstrakcji semantycznej19,33,34,35,36,37.

Pozostaje kilka ograniczeń. Po pierwsze, metoda zależy od jakości wyników detektora; liczne pominięcia w detekcji lub niedokładne ramki ograniczające (bounding boxes) obniżają wiarygodność zarówno przewidywania ruchu, jak i przycinania semantycznego14,17,46. Po drugie, w bieżącej implementacji nie zoptymalizowano osobno długoterminowej reidentyfikacji obiektów poza polem widzenia. Gdy sportowiec opuszcza pole widzenia kamery na dłuższy czas, a następnie do niego powraca, obecna strategia odzyskiwania trajektorii może być niewystarczająca do przywrócenia pierwotnej tożsamości19,34. Po trzecie, znaczny szum w tle, nakładanie się zawodników, rozmycie ruchu oraz nieczytelne numery na koszulkach mogą obniżać wiarygodność cech semantycznych14,35,42,46. Po czwarte, obecna ocena skupiała się na publicznych zbiorach danych referencyjnych i kontrolowanych ustawieniach perturbacji; wdrożenie w materiałach wideo z transmisji z cięciami montażowymi, zmianami zoomu i niestandardowymi kątami widzenia może wymagać dodatkowych modułów preprocessingu lub reidentyfikacji19,33,34.

Głównym praktycznym wnioskiem jest to, że asocjacje kierowane pewnością (confidence-guided association) oraz semantyczne wskazówki specyficzne dla koszulek mogą zostać zintegrowane z modułowym potokiem MOT bez zmiany struktury detektora. Możliwość ta znajduje zastosowanie w zadaniach analizy sportowej, takich jak ekstrakcja trajektorii sportowców, analiza ruchów zespołu, przegląd zdarzeń taktycznych oraz półautomatyczna adnotacja wideo1,4,33,36. Przyszłe prace powinny skupić się na skuteczniejszej reidentyfikacji obiektów poza polem widzenia, radzeniu sobie z zakłóceniami tła, agregacji cech czasowych oraz bardziej odpornym rozpoznawaniu numerów zawodników w warunkach silnego rozmycia lub przesłonięcia14,19,34,46.

Podsumowując, JerseyTrack jest metodą SportsMOT, która łączy asocjację sterowaną poziomem ufności z semantyczną fuzją strojów. Metoda ta dzieli detekcje na grupy o wysokim, średnim i niskim poziomie ufności i stosuje różne reguły asocjacji w zależności od wiarygodności detekcji, wykorzystując jednocześnie kolor stroju i numery zawodników jako pomocnicze informacje o tożsamości podczas asocjacji o średnim poziomie ufności oraz odzyskiwania trajektorii. W ramach ocenianej konfiguracji walidacyjnej SportsMOT system JerseyTrack wykazał poprawę dokładności śledzenia i lepsze zachowanie tożsamości w porównaniu z analizowanymi konfiguracjami bazowymi. Wyniki ablacji wykazały, że pełna konfiguracja zredukowała liczbę zmian tożsamości w stosunku do wariantu bazowego i wariantów z pojedynczymi modułami, a porównanie z benchmarkiem wykazało wyższe wartości głównych metryk śledzenia przy wspólnej konfiguracji wyjścia detektora i ewaluacji. Wyniki te wspierają wykorzystanie informacji o poziomie ufności oraz specyficznych semantycznych wskazówek dotyczących strojów do śledzenia sportowców w nagraniach z gier zespołowych, szczególnie gdy regiony strojów są widoczne, a kolor drużyny lub numer zawodnika dostarczają uzupełniających dowodów tożsamości20,35,46. Rozwiązanie zidentyfikowanych ograniczeń może w dalszym stopniu poprawić możliwości zastosowania proponowanego przepływu pracy w bardziej wymagających scenariuszach śledzenia w sporcie.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie mają żadnych finansowych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych podziękowań do zadeklarowania.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CUDA RuntimeNVIDIAWersja 12.8Środowisko uruchomieniowe obliczeń GPU wykorzystywane do trenowania detektora, ekstrakcji cech semantycznych i inferencji śledzenia.
EasyOCRJaided AIWersja 1.7.2Zestaw narzędzi do optycznego rozpoznawania znaków wykorzystywany do rozpoznawania numerów zawodników.
Kod źródłowy JerseyTrackAutorzyN/AWłasna implementacja zawierająca skrypty do przygotowania danych, ekstrakcji cech semantycznych, partycjonowania ufności, śledzenia, postprocesowania i ewaluacji. Dostępna pod adresem: https://doi.org/10.5281/zenodo.21274352
Lekki model CRNN OCRAutorzyN/AWłasna konwolucyjna rekurencyjna sieć neuronowa (CRNN) wykorzystywana do rozpoznawania numerów zawodników.
Zbiór danych MOT17MOTChallengeN/APubliczny zbiór danych referencyjnych wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://motchallenge.net/data/MOT17/
Zbiór danych MOT20MOTChallengeN/APubliczny zbiór danych referencyjnych wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://motchallenge.net/data/MOT20/
motmetricsTwórcy motmetricsWersja 1.4.0Biblioteka wykorzystywana do obliczania diagnostycznych metryk śledzenia wielu obiektów.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Jednostka przetwarzania graficznego wykorzystywana do trenowania detektora i inferencji śledzenia.
Sterownik GPU NVIDIANVIDIAWersja 610.62Sterownik GPU wykorzystywany w środowisku eksperymentalnym.
NumPyTwórcy NumPyWersja 2.4.4Biblioteka obliczeń numerycznych wykorzystywana do przetwarzania cech i obsługi danych.
OpenCVOpenCVWersja 4.10.0Biblioteka wizji komputerowej wykorzystywana do ładowania, przycinania, wstępnego przetwarzania i wizualizacji obrazów.
PythonPython Software FoundationWersja 3.12.2Język programowania wykorzystywany w całym przepływie pracy.
PyTorchPyTorch FoundationWersja 2.11.0+cu128Framework głębokiego uczenia wykorzystywany do implementacji detektora i modelu semantycznego.
scikit-learnTwórcy scikit-learnWersja 1.9.0Biblioteka uczenia maszynowego wykorzystywana do klastrowania K-średnich podczas ekstrakcji kolorów koszulek i partycjonowania ufności.
Zbiór danych SoccerNet TrackingSoccerNetN/APubliczny benchmark śledzenia piłki nożnej wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://www.soccer-net.org/tasks/tracking
Zbiór danych SportsMOTSportsMOT BenchmarkN/AGłówny zbiór danych referencyjnych wykorzystywany do przygotowania detektora i ewaluacji śledzenia. Dostępny pod adresem: https://deeperaction.github.io/datasets/sportsmot.html
Zbiór danych TeamTrackTeamTrack BenchmarkN/APubliczny benchmark śledzenia sportowego wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationWersja 0.26.0+cu128Biblioteka wizji komputerowej wykorzystywana z PyTorch do transformacji obrazów i wsparcia modeli.
TrackEvalTwórcy TrackEvalWersja 1.3.0Zestaw narzędzi ewaluacyjnych wykorzystywany do obliczania dokładności śledzenia wielu obiektów (MOTA), wyniku F1 dla tożsamości (IDF1), dokładności śledzenia wyższego rzędu (HOTA), dokładności detekcji (DetA), dokładności asocjacji (AssA), wyników fałszywie dodatnich (FP), fałszywie ujemnych (FN) oraz zmian tożsamości (IDs).
UltralyticsUltralyticsWersja 8.4.90Framework detekcji obiektów wykorzystywany do trenowania detektora i generowania detekcji sportowców.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

ledzenie sterowane pewno citrajektoria zawodnikapodobie stwo ruchukolor koszulkioptyczne rozpoznawanie znak wsp jno to samo cizbi r danych SportsMOT

Powiązane artykuły