Artykuł badawczy

Możliwy do powtórzenia multimodalny przepływ pracy sztucznej inteligencji do odkrywania historycznych cyfrowych archiwów

DOI:

10.3791/71698

7 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiamy tu protokół mający na celu poprawę odkrywania w historycznych archiwach cyfrowych poprzez integrację korekcji optycznego rozpoznawania znaków, klasyfikacji wizualnej dokumentów, wzbogacania metadan i ewaluacji odzyskiwania w nadzorowanym przepływie pracy.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Historyczne archiwa cyfrowe są coraz bardziej dostępne w wyszukiwarkach, ale odkrywanie pozostaje ograniczone, gdy błędy optycznego rozpoznawania znaków, wizualnie nierównorodne typy dokumentów i rzadkie metadane są obsługiwane osobno. Badanie to miało na celu opracowanie powtarzalnego protokołu, aby ocenić, czy konserwatywny multimodalny przepływ pracy sztucznej inteligencji może poprawić odzyskiwanie archiwalne bez zastępowania przeglądu przez archiwisty. Zebrano korpus 1600 scyfryfikowanych zapisów archiwalnych z ośmiu klas dokumentów i zastosowano 420-zapytaniowy benchmark, aby porównać pięć warunków odzyskiwania: indeksowanie bazowe, samodzielne korekty optycznego rozpoznawania znaków, samodzielna klasyfikacja wizualna, samodzielne wzbogacanie metadan i pełna multimodalna integracja. Wyniki na poziomie zapisu obejmowały wskaźnik błędów znaków (CER), wskaźnik błędów słów (WER), odzyskiwanie nazw własnych, dokładność klasyfikacji typów dokumentów, pewność predykcji, kompletność metadan i dopasowanie nagłówków tematycznych. Wyniki na poziomie zapytania obejmowały P@10, R@10, nDCG@10, czas do pierwszego odpowiedniego wyniku i wskaźnik udanych wyszukiwań. Korekta optycznego rozpoznawania znaków najmocniej zmniejszała WER dla ręcznie pisanych listów, ksieg rachunkowych i ksiąg rejestrowych; wizualne dostrajanie poprawiało dokładność klasyfikacji najbardziej dla map, plakatów, gazet i ksiąg rejestrowych; a wzbogacanie metadan zwiększało kompletność w całych okresach historycznych. Pełny multimodalny warunek osiągnął najwyższą wydajność odzyskiwania (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) i zmniejszył średni czas do pierwszego odpowiedniego wyniku z 156,079 s do 58,485 s. Te wyniki wspierają modularny, poddany rewidencji przepływ pracy, w którym tekst, obraz i sygnały opisowe są łączone według wyraźnych progów i poddają się przeglądowi przez człowieka.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Archiwa cyfrowe rozwijają się szybko i obecnie wspierają badania w dziedzinie historii, dziedzictwa kulturowego, administracji publicznej i cyfrowych nauk humanistycznych. Jednak dostęp jest nadal nierówny, ponieważ archiwa zawierają często pogorszone wyniki optycznego rozpoznawania znaków, wizualnie zróżnicowane układy stron, niekonsekwentne praktyki katalogowania oraz historycznie zmienne nazwy, miejsca i instytucje. Ograniczenia te wpływają nie tylko na jakość transkrypcji, ale także na odzyskiwanie, filtrowanie i dalsze wykorzystanie scyfryzowanych kolekcji1,2,3,4,5,6,7.

Istniejące badania nad sztuczną inteligencją w dokumentach oraz archiwum i odzyskiwaniem poprawiły poszczególne komponenty, takie jak poprawka optycznego rozpoznawania znaków, klasyfikowanie obrazów dokumentów, normalizacja metadan, modelowanie tematów, osadzenia słów, odzyskiwanie neuronowe i praktyki zarządzania danymi8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25. Jednak wiele systemów archiwalnych nadal ocenia te komponenty oddzielnie, co utrudnia określenie, czy połączony przepływ pracy poprawia odkrywanie w realnych warunkach wyszukiwania. Lukę metodologiczną, na którą zwraca się tutaj uwagę, jest brak reproduktybilnego, podlegającego audytowi protokołu, który łączy moduły tekstowe, obrazowe i metadanych z wynikami odzyskiwania w jednym przepływie pracy archiwalnym.

Głównym celem było przetestowanie, czy korekcja optycznego rozpoznawania znaków, klasyfikacja wizualna dokumentów i wzbogacanie metadan ograniczonych regułami dają uzupełniające poprawki, gdy są oceniane na podstawie tego samego kryterium odzyskiwania.

Przypuszczaliśmy, że pełny warunek multimodalny przewyższy każdy warunek pojedynczego komponentu, ponieważ odkrywanie archiwalne zależy od interakcji czytelnego tekstu, wizualnie interpretowalnej struktury dokumentu i przeszukiwalnych metadan opisowych. Przepływ pracy został zaprojektowany konserwatywnie: zautomatyzowane wyniki mogły wzbogacać indeksy odzyskiwania, ale prognozy o niskiej pewności były oznaczane do przeglądu, a nie używane jako autorytatywny opis archiwalny.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badania wykorzystały scyfryzowane zapisy archiwalne i symulowane zapytania do odzyskiwania informacji jako jednostki analizy. Archiwum może ograniczać dostęp do wrażliwych lub chronionych kulturowo zapisów. Przed przetworzeniem lub udostępnieniem jakichkolwiek zapisów należy przestrzegać zasad dostępu do repozytoriów, instytucjonalnych procedur dotyczących bezpieczeństwa danych oraz wymagań dotyczących anonimizacji. Podczas tego cyfrowego przepływu pracy nie powstały żadne niebezpieczne odpady chemiczne, biologiczne, ostre, radioaktywne ani inne regulowane odpady laboratoryjne.

Projekt badania i budowa korpusu

Rysunek 1 przedstawia kompletny przepływ pracy badania, w tym budowę korpusu, etykietowanie referencyjne, przetwarzanie obrazów, generowanie OCR i poprawę po korekcji, klasyfikację wizualną, wzbogacanie metadan, budowę indeksu, ewaluację odzyskiwania, analizę statystyczną i pakiet do reprodukcji.

Budowa korpusu przebiegała od 15 stycznia do 30 kwietnia 2025 roku, po czym nastąpiło projektowanie i debugowanie systemu od 1 maja do 31 października 2025 roku. Korpus zawierał 1600 scyfryzowanych zapisów archiwalnych wybranych z ośmiu repozytoriów reprezentujących systemy państwowe, miejskie, religijne, muzealne, uniwersyteckie i biblioteczne. Ramka prób była zróżnicowana według repozytoriów i klas dokumentów, aby zachować różnorodność archiwalną wśród ręcznie pisanych listów, ksiąg rachunkowych, map, gazet, fotografii z podpisami, plakatów, ksiąg rejestrowych i korespondencji pisowni maszynowej.

Dla każdego kandydackiego zapisu log selekcji zawierał identyfikator repozytorium lub kolekcji, identyfikator katalogowy, klasę dokumentu, przybliżony okres historyczny, dominujący kontekst językowy, dostępny format obrazu, rozdzielczość obrazu, liczbę stron oraz podstawowe pola opisowe. Każdy zapis musiał spełniać następujące wymogi: stabilny identyfikator katalogowy; co najmniej jedno zdjęcie strony w formacie TIFF, JPEG lub PNG; rozdzielczość obrazu źródłowego co najmniej 150 dpi; czytelną treść tekstową, tabelaryczną lub strukturalną; oraz przypisanie do jednej z ośmiu wstępnie zdefiniowanych klas dokumentów. Kryteria wykluczenia to dokładne duplikaty, puste strony odwrotne, obrazy przycięte do punktu, w którym brakowało ponad 30% obszaru zawierającego tekst oraz zapisy uznane za nieczytelne po inspekcji manualnej.

Benchmark odzyskiwania zawierał 420 krótkich zapytań w języku naturalnym wygenerowanych między 5 a 20 sierpnia 2025 roku. Generowanie zapytań odbywało się według wykonalnego szablonu: potencjalne potrzeby informacyjne były pobrane od ludzi, instytucji, miejsc, przedziałów czasowych, zawodów, wydarzeń i tematów; każde zapytanie zostało znormalizowane do 2–9 słów; a docelowe odpowiednie zapisy zostały zidentyfikowane przed porównaniem systemów. Każde zapytanie było oceniane w pięciu warunkach odzyskiwania, co dało 2100 dopasowanych obserwacji zapytań i warunków.

Etykietowanie referencyjne i kontrola jakości

Etykietowanie referencyjne było wykonywane od 1 maja do 15 lipca 2025 roku przez trzech anotatorów: dwóch pracowników archiwalnych doświadczonych w katalogowaniu opisowym oraz jednego badacza z zakresu humanistyki cyfrowej doświadczonego w ocenie historycznych dokumentów. Przewodnik do anotykowania definiował klasy dokumentów, kategorie kontekstu językowego, kategorie okresów historycznych, pola kompletności metadan, kategorie nazw własnych oraz zasady wyboru regionów oceny OCR.

Do oceny OCR anotatorzy wybierali reprezentatywne regiony zawierające tekst, które obejmowały nagłówki, nazwiska, daty, terminy instytucjonalne, notatki marginalne, wpisy tabelaryczne i, jeśli były obecne, obszary układu o niskim poziomie hałasu. Gdy strona zawierała wiele regionów tekstowych, wybrany region musiał być istotny dla odzyskiwania i musiał zawierać wystarczającą liczbę znaków do obliczenia CER i WER. Spory były początkowo rozwiązywane poprzez dyskusję między dwoma głównymi anotatorami; nierozwiązane przypadki były rozstrzygane przez badacza z zakresu humanistyki cyfrowej.

Kontrola jakości wykorzystywała losową 12% podzbiór zapisów. Zgodność między anotatorami dla głównego typu dokumentu wynosiła kappa Cohena = 0,86, co sugeruje znaczną zgodność. W dziennik rozstrzygania zachowało się oryginalne i ostateczne etykiety, kategorię sporu oraz powód rozwiązania, aby przyszli użytkownicy mogli przeprowadzić audyt definicji klas i przypadków brzegowych.

Przetwarzanie obrazów

Wszystkie obrazy były przetwarzane na poziomie zapisu przy użyciu Pythona 3.11.8 z OpenCV 4.9.0, Pillow 10.3.0 i NumPy 1.26.4. Każda strona wejściowa była konwertowana na 8-bitowy szary poziom, chyba że kolor zawierał informacje semantyczne, takie jak mapy, plakaty, znaczki lub anotacje kolorowe. Nachylenie było oszacowane za pomocą profili projekcji i wykrywania linii Hougha; deskewing był stosowany tylko wtedy, gdy bezwzględny k

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Poprawa OCR poprawiła transkrypcję, szczególnie w rękopisach i zapisach tabelarycznych

Poprawa OCR poprawiła jakość transkrypcji we wszystkich ośmiu klasach dokumentów archiwalnych (n = 1600 zapisów). Średni WER spadł z 0,529 ± 0,172 do 0,384 ± 0,123, ze średnią zmienności parowaną -0,144 (95% CI, -0,149 do -0,139; Wilcoxon signed-rank P < 0,001). Średni CER spadł z 0,377 ± 0,126 do 0,258 ± 0,086, ze średnią zmienności parowaną -0,119 (95% CI, -0,123 do -0,116; Wilcoxon signed-rank P < 0,001). Tabela 2 pokazuje, że początkowy WER był najwyższy dla rękopisów, ksiąg rachunkowych i ksiąg rejestrowych, co wskazuje, że najbardziej skomplikowane wizualnie zapisy miały również największe początkowe obciążenie rozpoznawaniem.

Po poprawce WER spadł we wszystkich klasach dokumentów. Największe średnie zredukowane WER dotyczyły rękopisów (n = 262; -0,200; 95% CI, -0,213 do -0,188), ksiąg rachunkowych (n = 263; -0,195; 95% CI, -0,206 do -0,183) i ksiąg rejestrowych (n = 194; -0,173; 95% CI, -0,187 do -0,160). CER podążał za tym samym wzorcem, co potwierdza interpretację, że moduł po poprawce głównie przyczynił się do poprawy trudnych rękopisów, zapisów tabelarycznych i mieszanych układów.

Pamięć nazw własnych poprawiła się również we wszystkich typach dokumentów, jak pokazano w tabeli podsumowującej. Największe wzrosty wystąpiły w rękopisach (0,302-0,440), księgach rachunkowych (0,336-0,471) i księgach rejestrowych (0,369-0,504). Skryptowane korespondencje osiągnęły najwyższą pamięć nazw własnych po poprawce (0,646), ale ich bezwzględna zyska była mniejsza, ponieważ początkowa rozpoznawalność była już silniejsza dla tej klasy. Rysunek 2 podsumowuje relację CER-WER na poziomie zapisu, skojarzenie między intensywnością pisma a korzyścią z poprawy oraz przesunięcie na poziomie zapisu w dostępności po poprawce.

Wizyjna klasyfikacja dokumentów poprawiła się ogólnie, ale zyski wydajności były nierówne w poszczególnych klasach

Wizyjna klasyfikacja dokumentów poprawiła się ogólnie w zestawie testowym 1600 zapisów. Dokładność top-1 wzrosła z 0,717 do 0,796 (zmienność bezwzględna, 0,079; McNemar chi-kwadrat = 27,33; P < 0,001), a średnia pewność predykcji wzrosła z 0,736 ± 0,131 do 0,800 ± 0,108 (średnia zmienność para, 0,064; 95% CI, 0,057-0,071; test t parami P < 0,001). Jak pokazano w Tabeli 3, siedem z ośmiu klas poprawiło się po dostosowaniu specyficznym dla archiwum, a największe zyski odnotowali mapy, plakaty, gazety i księgi rejestrowe.

Skryptowane korespondencje nie poprawiły się materialnie po dostrajeniu (0,796-0,791), co sugeruje, że ich początkowe cechy wizualne były już stabilne i że procedura treningowa dodała niewiele dodatkowego rozdzielania klas dla tej kategorii.

Rysunek 3 podsumowuje wydajność wizualnej klasyfikacji dokumentów przed i po dostrajeniu specyficznym dla archiwum; arkusz danych źródłowych zawiera 20 epok straty i dokładności trenowania/walidacji, wraz z podsumowaniami diagnostycznymi macro-F1, weighted-F1, ROC-AUC i PR-AUC.

Zbogacanie metadanych poprawiło opisową kompletność we wszystkich okresach historycznych (n = 1600 zapisów). Średnia kompletność wzrosła z 0,657 ± 0,125 do 0,907 ± 0,070, ze średnią zmiennością parową 0,250 (95% CI, 0,243-0,257; Wilcoxon signed-rank P < 0,001). Jak pokazano w Tabeli 4, początkowa kompletność była najniższa dla lat 1850-1879 i wzrosła w późniejszych okresach przed wzbogaceniem. Rysunek 4 podsumowuje poprawę kompletności metadanych, nowo zrealizowane pola metadanych według typu dokumentu i zyski dopasowania nagłówków tematycznych w okresach historycznych.

Po wzbogaceniu kompletność wzrosła w każdym okresie historycznym: 1850-1879 (n = 281; średnia zmiana, 0,207; 95% CI, 0,191-0,223), 1880-1909 (n = 474; średnia zmiana, 0,236; 95% CI, 0,223-0,248), 1910-1939 (n = 549; średnia zmiana, 0,277; 95% CI

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To protokollo pokazuje, że odkrywanie w historycznych archiwach cyfrowych najbardziej poprawiło się, gdy poprawka OCR, wizualne zrozumienie dokumentów i konserwatywne wzbogacanie metadanych były oceniane jako połączone komponenty odzyskiwania, a nie jako izolowane techniczne ulepszenia. Największe zdobycze OCR miały miejsce w materiałach rękopiśmiennych, tabelarycznych i rejestrowych, co potwierdza wartość korekty po analizie dla klas dokumentów, w których rozpoznawanie bazowe jest najsłabsze. Jednocześnie pozostałe błędy po korekcji pokazują, że oczyszczanie OCR nie może być traktowane jako ostateczna transkrypcja i musi pozostać podlegające weryfikacji.

Wyniki klasyfikacji wizualnej również wymagają ostrożnej interpretacji. Dostrajanie poprawiło wizualnie wyróżniające się klasy, takie jak mapy, plakaty, gazety i księgi rejestrowe, ale zdobycze były mniejsze w przypadku rękopiśmiennych listów i ksiąg rachunkowych, gdzie układy się nakładają, a granice klas są mniej wizualnie rozdzielne. Stosunkowo niewielki rozmiar korpusu oznacza, że wydajność klasyfikacji powinna być interpretowana jako dowód protokołu, a nie jako dowód, że model multimodalny produkcyjny może być trenowany na podstawie 1600 zapisów samodzielnie. Przyszłe walidacje powinny porównywać EfficientNet-B3 z transformatorami dokumentów, Vision Transformers, Swin Transformers, ConvNeXt i multimodalnymi modelami fundacyjnymi dokumentów8,11,12,13,14,15,16,17,18.

Wzbogacanie metadanych znacząco przyczyniło się do odzyskiwania poprzez rozszerzenie rozproszonych opisowych zapisów w przeszukiwalne pola, zachowując informacje źródłowe i dotyczące pewności. To odkrycie jest zgodne z potrzebą archiwalną bardziej bogatych punktów dostępu, ale również podnosi ryzyko dotyczące zarządzania. Zautomatyzowane wzbogacanie może wzmacniać błędy OCR, zbyt agresywnie normalizować historycznie niejednoznaczne nazwy lub wprowadzać uprzedzenia, jeśli kontrolowane słownictwo jest niekompletne. Z tego powodu, przepływ pracy używa progów pewności, rejestracji źródeł i flag przeglądu zamiast całkowicie zautomatyzowanej wymiany zapisów katalogowych.

Ocena odzyskiwania dostarcza dowodów efektów uzupełniających modułów, ale ma ograniczenia. Obecne porównanie używało warunków bazowych i wewnętrznych ablacji modułów; nie porównano z gęstym odzyskiwaniem, późnymi rankerami interakcji, takimi jak ColBERT, hybrydowym odzyskiwaniem rozproszonym-gęstym, neuronowym ponownym rangowaniem lub systemami generowania wzmacnianych odzyskiwaniem22,23,24. Te podejścia powinny być dodane w przyszłej pracy, aby ustalić, czy obserwowane zdobycze multimodalne pozostają konkurencyjne w stosunku do obecnych architektur odzyskiwania.

Implementacja również wymaga uwagi na wycieki danych, ograniczenia obliczeniowe i skalowalność. Wzbogacanie używało wyjść optycznego rozpoznawania znaków, wizualnych przewidywań i istniejących metadanych, więc podział na trening/walidację/testowanie i ocena zapytań musi być oddzielona od decyzji dotyczących wzbogacania. Przyszłe wdrożenia powinny raportować sprzęt, czas wykonania, użycie pamięci, rozmiar indeksu i koszt na 1000 zapisów. Podejścia do przywracania obrazów z sąsiedniej pracy wizji komputerowej, w tym modele usuwania okluzji oparte na uważności wieloskalowej, mogą zainspirować przyszłe eksperymenty przetwarzania wstępnego, ale powinny być starannie testowane, ponieważ przepływy pracy archiwalne nie mogą halucynować ani zmieniać dowodów treści26,27.

Ogólnie, przepływ pracy najlepiej rozumieć jako protokół dostępu, który można powtórzyć, a nie jako zamiennik dla opisu archiwalnego. Multimodalna sztuczna inteligencja może poprawić odkrywanie, gdy jej wyjścia są ograniczone, rejestrowane i przeglądane, ale archiwisty są nadal niezbędni dla oceny proweniencji, decyzji dotyczących zarządzania dostępem i interpretacji historycznie złożonych zapisów21,25.

KONKLUZYJE:
Niniejsze badanie przetestowało, czy korekta optycznego rozpoznawania znaków, klasyfikacja wizualna dokumentów i konserwatywne wzbogacanie metadanych mogą służyć jako uzupełniające komponenty odzyskiwania w historycznych archiwach cyfrowych. Protokół poprawił transkrypcję, klasyfikację, kompletność metadanych i łączną wydajność odzyskiwania, zachowując jednocześnie wyraźne progi, rejestrację źródeł i zabezpieczenia przeglądu przez ludzi. Przepływ pracy powinien zatem być stosowany jako audytowalny protokół wsparcia dostępu, a nie jako zamiennik dla osądów archiwisty lub zarządzania repozytorium.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy szczerze dziękują dwóm doświadczonym pracownikom archiwalnym oraz profesjonalnemu badaczowi z zakresu humanistyki cyfrowej za ich cenny wkład w komentowanie tekstu i kontrolę jakości. Badania te były wspierane finansowo przez Plan Projektów Naukowych i Technologicznych Archiwów Prowincji Jiangsu (Grant nr 2024-9) na budowę inteligentnego systemu archiwum opartego na mowie, oraz Plan Rozwoju Nauki i Technologii Prowincji Jiangsu dla Tradycyjnej Medycyny Chińskiej (Grant nr MS2025025) na badanie dziedzictwa i rozwoju szkół TCM z perspektywy archiwalnej.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Statistical analysis and final figure generation
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractBaseline optical character recognition generation
Tesseract language packsTesseract OCR ProjectStudy-specific language packs; https://github.com/tesseract-ocr/tessdataPrimary and mixed-language optical character recognition decoding
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Deskewing, noise estimation, and image preprocessing
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Image input/output and format normalization
NumPyNumPy developersv1.26.4; https://numpy.org/Array computation for image and metric processing
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Tabular data handling and summary exports
SciPySciPy developersv1.13.1; https://scipy.org/Statistical tests and numerical utilities
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Statistical modeling and paired-comparison support
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Classification metrics, ROC/PR diagnostics, and validation utilities
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzEdit-distance candidate ranking for optical character recognition correction
spaCyExplosion AIv3.7.4; https://spacy.io/Named-entity processing with custom lexicon tables
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Visual document classifier training
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 implementation and image transforms
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlVisual document classification backbone
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Semantic expansion for controlled-vocabulary candidates
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indexing, retrieval, and ranking
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Containerized retrieval environment
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Fixed operating environment for retrieval runs
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Version control for configuration, vocabularies, scripts, and figure code
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R-based figure rendering
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Supplementary visualization and quality-assurance plots
Annotation guidelineAuthors5 annotation sections; 8 document-class labels; OCR regions; entity labels; relevance judgments; adjudication rulesDefinitions for document classes, OCR regions, entities, relevance judgments, and adjudication
Archive-specific OCR lexiconAuthors6 lexicon categories: person variants, place names, institution names, date patterns, administrative terms, abbreviationsNames, places, institutions, administrative terms, and spelling variants
Controlled vocabulary mappingAuthors / archival repositories5 mapping rules linking OCR entities, visual class, title keywords, date coverage, and query topic to metadata fieldsSubject-heading matching and semantic expansion
Benchmark query setAuthors420 benchmark queries; 6 query topics; 3 difficulty levels; 8 target document classes; 4 historical periods; 6 language contextsMatched retrieval benchmark across five system arms
Relevance judgmentsAuthors / annotators2,100 query-system rows; 420 queries x 5 system arms; relevant totals, relevant-in-top-10 counts, graded relevance, and success flagsGround-truth surrogate for P@10, R@10, nDCG@10, and successful-search rate
Training diagnosticsAuthors20 epochs; training loss; validation loss; training accuracy; validation accuracy; macro-F1; weighted-F1; ROC-AUC; PR-AUCEpoch-level model diagnostic summaries
Computational hardwareAuthors8 CPU cores; 32 GB RAM; NVIDIA GPU-class training environmentReproducibility resource detail for JoVE submission
Dataset fileAuthorsdata.xlsx; 1,600 records; 17 variables; DOI listed in manuscript Data AvailabilityRecord-level source data for optical character recognition, metadata completeness, discoverability, and visual classification analyses

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

In ynieriaWydanie 234Wydanie 234Warto pustaWydanieArchiwa cyfroweMultimodalna sztuczna inteligencjaKorekta OCRWzbogacanie metadanychKlasyfikacja wizualna i zapytania do zapis w historycznych

Powiązane artykuły