Artykuł metodologiczny

Zwęzły protokół dotyczący konstruowania chińskiego– angielskiego słownictwa turystyki kulturowej z wykorzystaniem zarejestrowanych korpusów

DOI:

10.3791/71320

3 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół tworzy chiński-angielski słownik turystyki kulturalnej związanej z ceramiką, wykorzystując zarejestrowane korpusy dwujęzyczne, standaryzowane czyszczenie, ekstrakcję kandydatów do terminów, wyrównanie w oparciu o podobieństwo oraz walidację ekspercką z arbitrażem. Korzystając z tego procesu, 60 zweryfikowanych wpisów zostało eksportowanych z definicjami, przykładami użycia, zapisami pochodzenia oraz wynikami zgodnymi z TBX.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tworzenie dwujęzycznych zasobów terminologicznych dla turystyki kulturalnej związanej z ceramiką jest wyzwaniem, ponieważ odpowiednie teksty są często fragmentami, wybory tłumaczeń są niejednolite, a powtarzalne przepływy pracy dotyczące konstrukcji są rzadko dokumentowane. Ten protokół przedstawia powtarzalny, krok po kroku przepływ pracy nad stworzeniem chińsko-angielskiego leksykonu turystyki kulturalnej związanej z ceramiką poprzez rejestrację i oczyszczanie korpusu, wyodrębnianie kandydatów na wyrazy, dwujęzyczne dopasowanie oraz walidację przez ekspertów z orzecznictwem. Zastosowany do zarejestrowanego dwujęzycznego korpusu, przepływ pracy wygenerował wybrane kandydatów na wyrazy po chińsku i angielsku, wyprodukował uporządkowane pary dwujęzycznych terminów i zachował zweryfikowane dopasowania po niezależnej recenzji ekspertów. Skompletowany leksykon eksportował 60 zweryfikowanych wpisów z dwujęzycznymi formami terminów, etykietami dziedzin, typami tłumaczeń, dwujęzycznymi definicjami, przykładami użycia, zapisami pochodzenia oraz interoperacyjnymi wynikami, takimi jak pliki Excel i TBX. Aby wspierać przejrzystość i możliwość ponownego uruchomienia, protokół rejestruje także progi, wersje pakietów, zamrożone zasoby i decyzje walidacyjne na całym przepływie pracy. Dzięki temu procedura jest podatna na audyt i łatwiejsza do zastosowania w innych dziedzinach turystyki dziedzictwa kulturowego. Po przeniesieniu do nowej dziedziny, użytkownicy mogą rozszerzyć listę słów kluczowych dziedziny, zaktualizować dwujęzyczny zasób mapowania i dostosować niewielką liczbę progów kandydatów i podobieństwa zgodnie z wielkością korpusu i gęstością terminologii.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Turystyka kulturowa stała się ważnym czynnikiem rozwoju miejsc przeznaczonych dla podróżników, którzy coraz częściej szukają doświadczeń opartych na dziedzictwie kulturowym, które są znaczące, a nie tylko rekreacyjne1. Na poziomie polityki i przemysłu, międzynarodowe organizacje wielokrotnie podkreślały wartość łączenia turystyki z kulturą oraz poprawę interpretacji, dokumentacji i komunikacji w różnorodnych aktywach dziedzictwa1. W szerszym kontekście turystyka kulturowa ceramiki jest szczególnie bogata w terminologię, ponieważ odwiedzający regularnie spotykają się z wyspecjalizowanymi pojęciami dotyczącymi materiałów, procesów szkliwienia i wypalania, technologii pieców, motywów stylistycznych, typów artefaktów oraz narracji o procesach rzemieślniczych. Te terminy często mają znaczenia techniczne, które nie są łatwo przekazywane poprzez przypadkowe parafrazy, a wybory tłumaczeniowe mogą bezpośrednio kształtować to, co odwiedzający rozumie z etykiet, interpretacji przewodników oraz materiałów edukacyjnych2. Jednocześnie, ramy dziedzictwa podkreślają, że ochrona niematerialnego dziedzictwa kulturowego zależy od ciągłej transmisji wiedzy i świadomości publicznej, które wymagają języka, który jest dokładny, dostępny i odpowiedni kontekstowo dla interpretacji i edukacji3.

Mimo tego zapotrzebowania, zasoby terminologiczne dwuizyczne dla turystyki kulturowej ceramiki pozostają rozproszone i niespójne. W etykietach muzealnych, tekstach wystaw, stronach przewodników turystycznych i opisach dziedzictwa, ten sam koncept może być oddany różnie w różnych instytucjach, regionach i ustawieniach komunikacyjnych4. Taka różnorodność nie jest tylko stylistyczna. Może wpływać na zrozumienie odwiedzających, zmniejszać porównywalność opisów między stronami i osłabiać postrzeganą wiarygodność komunikacji o dziedzictwie5. Badania nad terminologią od dawna argumentują, że wysokiej jakości zasoby terminowe powinny być zorientowane na pojęcia, wspierane przez jasne definicje i zakotwiczone w śledzonym dowodzie, takim jak źródła, konteksty i zapisy kontroli jakości6. Jednak wiele zespołów dziedzinowych nadal nie posiada procesu, który mógłby systematycznie przekształcić rozproszone teksty w spisane dwuizyczne leksykony, zachowując przezroczyste zasady decyzyjne, powtarzalne procedury i ponownie używalne wyniki7. W porównaniu z przypadkową manualną kompilacją, znormalizowany protokół oferuje jaśniejszą dokumentację, bardziej spójną weryfikację i lepsze warunki do aktualizacji, audytów i ponownego użycia między instytucjami.

Aby sprostać tym wyzwaniom, praktyczny protokół budowy dwuizycznego leksykonu musi zorganizować dwa powiązane zadania: odkrywanie kandydatów do terminów i dwuizyczne dopasowanie. Dla odkrywania terminów, automatyczne wyciąganie oparte na korpusie może zmniejszyć zależność od całkowicie manualnego zbierania, łącząc wzorce językowe ze statystycznymi dowodami, ułatwiając identyfikację terminologii istotnej dla dziedziny w dużej skali8. W ustawieniach dziedzictwa kulturowego, jednak, budowa korpusu rzadko jest prosta. Materiały źródłowe często różnią się stylem, rejestrem i celem komunikacyjnym, a mogą zawierać nazwy specyficzne dla dziedziny i mieszane konwencje opisowe9. Te cechy sprawiają, że przejrzyste rejestrowanie parametrów i stabilne reguły przetwarzania są szczególnie ważne. Dla dwuizycznego dopasowania, metody komputerowe mogą generować sklasyfikowane kandydacki pary międzyjęzykowe, porównując formy terminów i ich otaczające konteksty użycia, po czym eksperci z dziedziny mogą zweryfikować, czy proponowane pary są koncepcyjnie odpowiednie10. W tym protokole, automatyzacja jest używana do generowania i klasyfikowania prawdopodobnych kandydatów, podczas gdy recenzja ekspertów jest używana do potwierdzenia lub odrzucenia ich później. Ta kombinacja poprawia efektywność bez usuwania interpretacyjnego osądu z ostatecznej decyzji. Ponieważ terminologia dziedzictwa często ma implikacje kulturowe i edukacyjne, recenzenci muszą być w stanie sprawdzić dowód za każdą zaproponowaną parą, zamiast polegać na nieprzejrzystym wyjściu11.

Tutaj przedstawiono krok po kroku i audytowalny protokół budowy chińskiego–angielskiego leksykonu turystyki kulturowej ceramiki z zarejestrowanych źródeł tekstowych. Workflow standaryzuje rejestrację korpusu i czyszczenie, dwuizyczne wyciąganie kandydatów, generowanie sklasyfikowanych par, recenzję dwóch anotatorów z orzecznictwem oraz końcowe ukończenie wpisu według stałego schematu. Integrując rejestrację wersji, kontrolę progów, zamrożone zasoby i walidację ekspertów, protokół poprawia reprodykowalność, możliwość audytu i standaryzację względem mniej strukturalnych workflowów budowy terminologii. Aby wspierać dłuższy czas ponownego użycia w zarządzaniu terminologią i praktyce tłumaczeniowej, sfinalizowany leksykon może być również eksportowany w formacie TermBase eXchange (TBX), który jest zgodny z ISO i przeznaczony do strukturalnej wymiany danych terminologicznych12</

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie wykorzystało tylko dane tekstowe dostępne publicznie lub autoryzowane przez instytucję i nie obejmowało badań na ludziach ani na zwierzętach. Nie była wymagana zgoda etyczna instytucji.

1. Utwórz przestrzeń roboczą projektu

  1. Utwórz folder projektu i następujące podfoldery: corpus_raw, corpus_clean, candidates, alignment, validation, outputs, logs i resources.
  2. Utwórz log uruchomienia i zapisz ustawienia środowiska.
    1. Utwórz logs/run_notes.txt.
    2. Zapisz datę/godzinę uruchomienia, wersję systemu operacyjnego i zakres projektu jako “Chińsko-angielskie terminologie dotyczące turystyki kulturalnej związanej z ceramiką”.
    3. Ustaw interpreter Pythona na Python 3.11 i zapisz tę informację w logs/run_notes.txt.
  3. Uruchom python -m pip freeze > logs/pip_freeze.txt i upewnij się, że logs/pip_freeze.txt zostało wygenerowane i nie jest puste13.
  4. Utwórz plik zależności i zainstaluj środowisko oprogramowania.
    1. Utwórz resources/requirements.txt.
    2. Wypisz wersje pakietów rdzeniowych użytych w tym protokołe: jieba==0.42.1, spacy==3.7.2, scikit-learn==1.4.2 i RapidFuzz==3.6.1.
    3. Zapisz polecenie instalacyjne w logs/run_notes.txt.
    4. Zainstaluj en_core_web_sm==3.7.1. 1.4.5 Uruchom python -m spacy validate i zapisz zweryfikowaną wersję modelu w logs/run_notes.txt.
      UWAGA: Przed kontynuowaniem upewnij się, że oba pliki logs/pip_freeze.txt i logs/run_notes.txt istnieją i nie są puste.

2. Skompiluj zbalansowane dwujęzyczne korpus i zarejestruj źródła

  1. Wybierz źródła, aby pasowały do składu dwuizycznego i gatunkowego przedstawionego w Tabeli 1 i przypisz każdemu dokumentowi unikalne source_id, takie jak S001 lub S00214.
  2. Utwórz SourceRegister.xlsx i zapisz dla każdego dokumentu source_id, tytuł, właściciel/wydawca, język, gatunek, data dostępu i license_note.
  3. Przekształć każdy dokument na zwykły tekst UTF-8, nazwać każdy plik jako source_id_lang.txt (np. S001_zh.txt lub S001_en.txt) i zapisz pliki w corpus_raw.
  4. Zapisz zamrożoną kopię rejestru jako outputs/SourceRegister_v1.xlsx i zapisz datę zamrożenia oraz łączną liczbę dokumentów (n_docs_zh i n_docs_en) w logs/run_notes.txt.
    UWAGA: Protokół można tutaj wstrzymać. Jeśli wznawia się później, nie zmieniaj przypisań source_id.
    OSTRZEŻENIE: Używaj tylko tekstów dostępnych publicznie lub autoryzowanych przez instytucję. Nie rozprowadzaj chronionych prawami autorskimi pełnych tekstów bez wyraźnej zgody.

3. Oczyść i normalizuj pliki korpusu

  1. Usuń linie tylko z nawigacją, linie tylko z URL-ami i powtórzone nagłówki lub stopki powtarzające się w co najmniej trzech dokumentach. Zachowaj pozostałe linie w oryginalnej kolejności15.
  2. Zachowaj interpunkcję, która może tworzyć część wielowyrazowych lub złożonych terminów podczas czyszczenia, w tym myślnik (-), ukośnik (/), nawiasy (( i )) i kropka środkowa (·).
  3. Normalizuj tekst chiński, konwertując pełnoszerokościowe znaki alfanumeryczne na znaki o połowę szerokości i standaryzując formy nawiasów do ( i ).
  4. Normalizuj tekst angielski, ściągając powtórzone spacje do pojedynczej spacji i standaryzując wszystkie warianty myślników do ASCII myślnika (-), zachowując jednocześnie złożone z myślnikiem słowa.
  5. Zapisz każdy oczyszczony plik do corpus_clean, używając tej samej nazwy pliku source_id_lang.txt jak w corpus_raw.
  6. Zapisz source_id, lang, n_chars_before, n_chars_after, timestamp i cleaning_ruleset ustawione na v1.0 w outputs/CorpusStats.xlsx16.
    UWAGA: Dla każdego języka upewnij się, że każdy plik w corpus_raw ma odpowiednik w oczyszczonym pliku w corpus_clean o tym samym source_id i sufiksie językowym.
    OSTRZEŻENIE: Usuń informacje osobiste, takie jak imiona, numery telefonów i adresy e-mail, podczas przetwarzania wstępnego, jeśli takie informacje pojawiają się w surowym tekście.

4. Wyodrębnij kandydatów do terminów w języku chińskim i angielskim

  1. Segmentuj tekst chiński za pomocą wersji jieba 0.42.1 z zasobami słownika użytkownika resources/userdict_zh.txt i zachowaj kandydatów pasujących do 2–8 kolejnych znaków chińskich lub 2–6 znaków chińskich oddzielonych jednym zachowanym delimiterem17.
  2. Przetwarzaj tekst angielski za pomocą spaCy wersji 3.7.2 z en_core_web_sm wersja 3.7.1 i zachowaj tylko frazy rzeczownikowe i złożone z myślnikiem słowa

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zasoby i wydajność oczyszczania korpusu
Zgodnie z projektem korpusu przedstawionym w Tabeli 1, zgromadzono zarejestrowany korpus dwujęzyczny z tekstów muzealnych i wystawienniczych, opisów dziedzictwa oraz materiałów turystycznych skierowanych do odwiedzających. Po oczyszczeniu korpus składał się z 12 dokumentów w języku chińskim i 8 dokumentów w języku angielskim, co łącznie dało 47 843 znaków chińskich i 32 193 znaków angielskich30. Korpus zachował zamierz...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Główną wartość tego protokołu stanowi jego zdolność do przekształcenia zadania terminologicznego, które często jest realizowane nieformalnie, w przejrzysty i możliwy do powtórzenia przepływ pracy. W ceramicznym turystyce kulturalnej wiele terminów jest zarówno technicznych, jak i interpretacyjnych: odnoszą się nie tylko do materiałów, rodzajów pieców, etapów wypalania czy stylów dekoracyjnych, ale także do tego, jak te koncepcje są przekazywane gościom w etykietach, narracjach i materiałach edukacyjnych...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konkurencyjnych interesów finansowych ani niefinansowych związanych z tą pracą.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy dziękują praktykom z zakresu turystyki kulturalnej dotyczącej ceramiki oraz pracownikom muzeów, którzy zapewnili dostęp do materiałów tekstowych i opinii fachowych podczas budowy i walidacji korpusu. Autorzy dziękują również dwóm niezależnym anotatorom domeny za staranne przeglądanie kandydatów do dopasowania oraz konstruktywne uwagi dotyczące projektu wpisu. Praca ta była wspierana przez projekt badawczy Jiangxi Association of Higher Education zatytułowany “Badanie nad inteligentnym tłumaczeniem angielskim chińskiej terminologii turystyki ceramicznej na podstawie DeepSeek i jego modelu wielokanałowego rozpowszechniania” (Grant No. WY-D-115).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Komputer stacjonarnySprzętKażdy nowoczesny komputer zdolny do uruchomienia Pythona 3.11 i przetwarzania korpusów tekstowych; zalecane >=8 GB RAMBrak wymogu numeru katalogowego
Źródło: Generyczne (dowolny dostawca)
System operacyjnyOprogramowanieWindows 10/11, macOS lub Linux (dokładna wersja systemu zapisywana w logs/run_notes.txt)Wersja zapisywana w run_notes.txt
Źródło: Zainstalowane w systemie
PythonOprogramowaniePython 3.11Wersja zapisywana w logs/pip_freeze.txt
Źródło: Dystrybucja Python Software Foundation
jiebaBiblioteka oprogramowania0.42.1jieba==0.42.1
Źródło: Repozytorium pakietów PyPI
spaCyBiblioteka oprogramowania3.7.2spacy==3.7.2
Źródło: Repozytorium pakietów PyPI
Angielski model potokuModel NLPen_core_web_sm 3.7.1 (pakiet modelu spaCy)en_core_web_sm==3.7.1; instalacja zapisywana w run_notes.txt
Źródło: Repozytorium modeli spaCy
scikit-learnBiblioteka oprogramowania1.4.2scikit-learn==1.4.2
Źródło: Repozytorium pakietów PyPI
RapidFuzzBiblioteka oprogramowania3.6.1RapidFuzz==3.6.1
Źródło: Repozytorium pakietów PyPI
Edytor arkuszy kalkulacyjnychOprogramowanieDowolne oprogramowanie zdolne do edycji plików.xlsxUżywane do przeglądania/edycji SourceRegister.xlsx, CorpusStats.xlsx, plików Candidates/Shortlist
Źródło: Generyczne (dowolny dostawca)
Edytor tekstu prostegoOprogramowanieDowolne oprogramowanie zdolne do edycji plików .txt i.csvUżywane do przeglądania/edycji logs/.txt i resources/.csv
Źródło: Generyczne (dowolny dostawca)
Narzędzie do konwersji tekstu UTF-8OprogramowanieDowolne narzędzie zdolne do eksportu dokumentów do prostego tekstu UTF-8Używane w kroku 2.3; dokładna metoda zapisywana w run_notes.txt
Źródło: Generyczne (dowolny dostawca)
Szablon SourceRegisterSzablon plikuSourceRegister.xlsx z polami: source_id, title, owner/publisher, language, genre, access_date, license_noteZablokowane jako outputs/SourceRegister_v1.xlsx
Źródło: Stworzone w tym badaniu
Szablon statystyk korpusuSzablon plikuCorpusStats.xlsx z polami: source_id, lang, n_chars_before, n_chars_after, timestamp, cleaning_rulesetGenerowane w kroku 3.6
Źródło: Stworzone w tym badaniu
Chiński słownik użytkownikaPlik zasobówresources/userdict_zh.txt (lista terminów specyficznych dla domeny wsparcia segmentacji)Zablokowana kopia zapisana; suma kontrolna zapisywana w thresholds.txt
Źródło: Stworzone/kuratowane w tym badaniu
Mapa słowa kluczowego domenyPlik zasobówresources/domain_keywords.csv z zasadami priorytetu domain_tagZablokowane jako outputs/domain_keywords_v1.csv; suma kontrolna zapisywana w alignment_log.txt
Źródło: Stworzone/kuratowane w tym badaniu
Tabela mapowania terminów chińsko-angielskichPlik zasobówresources/term_map_zh2en.xlsx z kolumnami term_zh i term_zh_enZablokowane jako outputs/term_map_zh2en_v1.xlsx; zasięg zapisany w alignment_log.txt
Źródło: Stworzone/kuratowane w tym badaniu
Log progówPlik logulogs/thresholds.txt (wzory, progi, wersje bibliotek, sumy kontrolne zasobów)Wymagane dla deterministycznych ponownych uruchomień
Źródło: Generowane w tym badaniu
Log alineacjiPlik logulogs/alignment_log.txt (wagi, k, progi, ustawienia wektoryzatora, zasięg mapowania, sumy kontrolne map)Wymagane dla deterministycznych ponownych uruchomień
Źródło: Generowane w tym badaniu
Arkusz adnotacyjnySzablon plikuvalidation/Annotation.xlsx (pair_id, term_zh, term_en, S, decyzje, orzeczenie, uzasadnienie)Zablokowane jako outputs/Annotation_v1.xlsx po kroku 6.6
Źródło: Stworzone w tym badaniu
Wynik ewaluacyjnyPlik wyjściowyoutputs/Evaluation.xlsx (suma zgody brutto, Cohen’s κ, sumarycznie)Generowane w kroku 6.4
Źródło: Generowane w tym badaniu
Ostateczny eksport leksykonuPlik wyjściowyoutputs/FinalLexicon.xlsx zgodnie ze schematem Tabeli 2Generowane w kroku 7.2
Źródło: Generowane w tym badaniu
Eksport TBXPlik wyjściowyPlik TBX wygenerowany z FinalLexicon.xlsx z mapowaniem stable entry_idWynik walidacji zapisywany w run_notes.txt
Źródło: Generowane w tym badaniu

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

ZachowanieNumer 233Numer 233WszystkieNumerPusta wartoNumerterminologia dwuj zycznatworzenie leksykon wautomatyczna ekstrakcja termin wdwuj zyczne wyr wnywanie termin wwalidacja eksperckaTBX TermBase eXchangeinterpretacja dziedzictwa kulturowegot umaczenie chi sko angielskie

Powiązane artykuły