方法文章

使用注册语料库构建汉英陶瓷文化旅游术语库的可复现方案

DOI:

10.3791/71320

2026年7月3日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案利用已注册的双语语料库,通过标准化清洗、候选术语提取、基于相似度排序的对齐以及专家验证与裁决,构建了中英陶瓷文化旅游术语库。采用该工作流程,导出了60个经过验证的词条,包含定义、用法示例、来源记录以及兼容TBX格式的输出结果。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

构建陶瓷文化旅游领域的双语术语资源面临诸多挑战,因为相关文本往往零散不全,翻译选择缺乏一致性,且可复用的构建流程很少被系统记录。本方案提出了一种可重复的、分步实施的工作流程,用于构建中英陶瓷文化旅游术语库,具体步骤包括语料库注册与清洗、候选术语提取、双语对齐以及专家验证与裁决。该流程应用于一个已注册的双语语料库后,成功生成了中英文候选术语短名单,产出排序后的双语术语对,并在独立专家评审后保留了经验证的对齐结果。最终形成的术语库导出了60个经核实的词条,包含双语术语形式、领域标签、翻译类型、双语定义、用法示例、来源记录,以及Excel和TBX等可互操作的输出格式。为确保透明性和可重复性,本方案在全流程中记录了各项阈值、软件包版本、冻结资源及验证决策,从而使整个过程具备可审计性,并更易于推广至其他文化遗产旅游领域。当迁移至新领域时,用户可通过扩展领域关键词列表、更新双语映射资源,并根据语料库规模和术语密度调整少量短名单及相似度阈值,实现流程的适配与延展。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着游客日益追求具有意义的文化遗产体验而不仅仅是纯粹的休闲活动,文化旅游已成为目的地发展的重要推动力1。在政策和产业层面,国际组织多次强调将旅游与文化相结合的价值,并呼吁加强对多样化遗产资源的阐释、记录与传播。在此宏观背景下,陶瓷文化旅游尤其涉及大量专业术语,因为游客经常接触到与材料、釉料和烧制工艺、窑炉技术、风格纹样、器物类型以及手工艺过程叙述相关的专门概念。这些术语往往具有难以通过随意转述传达的技术含义,而翻译选择会直接影响游客对展签、导览解说和教育材料内容的理解2。与此同时,文化遗产保护框架强调,非物质文化遗产的保护依赖于持续的知识传承和公众认知,而这两者都要求在阐释与教育中使用准确、易懂且符合语境的语言3

尽管存在这一需求,陶瓷文化旅游领域的双语术语资源仍处于零散且不一致的状态。在博物馆标签、展览文字、旅游指南页面和遗产描述中,相同的概念在不同机构、地区和交际场景下可能呈现不同的表达方式4。这种差异不仅仅是风格上的不同,它可能影响游客的理解,降低各遗址描述之间的可比性,并削弱遗产传播的可信度5。术语学研究长期以来主张,高质量的术语资源应以概念为中心,配有明确的定义,并以可追溯的证据为基础,例如来源、语境以及质量控制记录6。然而,许多专业团队仍然缺乏一种系统性的工作流程,能够将分散的文本转化为经过审校的双语词表,同时保留透明的决策规则、可重复的操作程序以及可复用的成果7。与临时性的手工汇编相比,标准化的协议能够提供更清晰的文档记录、更一致的验证过程,以及更有利于更新、审计和跨机构复用的条件。

为应对这些挑战,构建双语术语库的实用方案需要统筹两项关联任务:候选术语发现与双语对齐。在术语发现方面,基于语料库的自动提取方法可通过结合语言模式与统计证据,降低对完全人工收集的依赖,从而更高效地大规模识别领域相关术语8。然而,在文化遗产领域,语料库的构建往往并不简单。原始资料在文体、语域和交际目的上常存在差异,且可能包含领域专有名称及混合的描述惯例9。这些特征使得参数记录的透明化和处理规则的稳定性尤为重要。在双语对齐方面,计算方法可通过比较术语形式及其上下文使用环境,生成按优先级排序的跨语言候选词对,随后由领域专家判断所提议的词对在概念上是否恰当10。本方案中,首先利用自动化方法生成并排序合理候选词对,再通过专家评审进行确认或否决。这种结合方式在保留最终判断中解释性决策的同时,提高了工作效率。由于文化遗产术语常具有文化和教育层面的含义,评审人员必须能够审查每个提议词对背后的证据,而非依赖不透明的输出结果11

本文提出了一种逐步可审计的协议,用于从注册文本资源中构建汉英陶瓷文化旅游术语库。该工作流程对语料库的注册与清洗、双语候选词提取、排序词对生成、两名标注员评审并经仲裁确认以及在固定模式下的最终词条完善等步骤进行了标准化。通过整合版本记录、阈值控制、冻结资源和专家验证,该协议相较于结构松散的术语构建流程,显著提高了可重复性、可审计性和标准化水平。为支持术语管理与翻译实践中的长期复用,最终完成的术语库还可导出为术语库交换(TermBase eXchange, TBX)格式,这是一种符合ISO标准的结构化术语数据交换标准12

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究仅使用公开可用或机构授权的文本数据,未涉及人类或动物受试者。无需机构伦理审批。

1. 创建项目工作区

  1. 创建一个项目文件夹,并建立以下子文件夹:corpus_raw、corpus_clean、candidates、alignment、validation、outputs、logs 和 resources。
  2. 创建运行日志并记录环境设置。
    1. 创建 logs/run_notes.txt。
    2. 记录运行的日期/时间、操作系统版本以及项目范围为“中文–英文陶瓷文化旅游术语”。
    3. 将 Python 解释器设置为 Python 3.11,并将此信息记录在 logs/run_notes.txt 中。
  3. 运行 python -m pip freeze > logs/pip_freeze.txt,并确认 logs/pip_freeze.txt 已生成且不为空13
  4. 创建依赖文件并安装软件环境。
    1. 创建 resources/requirements.txt。
    2. 列出本实验方案中使用的核心包版本,如下所示:jieba==0.42.1、spacy==3.7.2、scikit-learn==1.4.2 和 RapidFuzz==3.6.1。
    3. 在 logs/run_notes.txt 中记录安装命令。
    4. 安装 en_core_web_sm==3.7.1。1.4.5 运行 python -m spacy validate,并将验证后的模型版本记录在 logs/run_notes.txt 中。
      注意:在继续操作前,确认 logs/pip_freeze.txt 和 logs/run_notes.txt 均存在且不为空。

2. 汇编平衡的双语语料库并登记来源

  1. 选择符合表1所示双语及体裁构成的语料来源,并为每份文档分配唯一的 source_id,例如 S001 或 S00214
  2. 创建 SourceRegister.xlsx 文件,为每份文档记录 source_id、标题、所有者/出版者、语言、体裁、访问日期(access_date)以及授权说明(license_note)。
  3. 将每份文档转换为 UTF-8 编码的纯文本,将文件命名为 source_id_lang.txt(例如 S001_zh.txt 或 S001_en.txt),并保存至 corpus_raw 目录中。
  4. 将注册表保存一份冻结版本至 outputs/SourceRegister_v1.xlsx,并在 logs/run_notes.txt 中记录冻结日期以及文档总数(n_docs_zh 和 n_docs_en)。
    注意: 此处可暂停本方案。若后续恢复执行,不得更改任何 source_id 的分配。
    警告: 仅使用公开可访问或机构授权的文本。未经明确许可,不得重新分发受版权保护的完整文本。

3. 清理并标准化语料库文件

  1. 删除仅用于导航的行、仅包含网址的行,以及在至少三个文档中重复出现的页眉或页脚。保留其余所有行,并维持其原始顺序15
  2. 在清理过程中,保留可能构成多词术语或复合词一部分的标点符号,包括连字符(-)、斜杠(/)、括号(( 和 ))以及中间点(·)。
  3. 通过将全角字母数字字符转换为半角字符,并将括号形式标准化为 ( 和 ),对中文文本进行归一化处理。
  4. 通过将重复的空白字符合并为单个空格,并将所有连字符变体标准化为 ASCII 连字符(-),同时保留带连字符的复合词,对英文文本进行归一化处理。
  5. 将每个清理后的文件保存到 corpus_clean 目录中,文件名采用与 corpus_raw 中相同的 source_id_lang.txt 格式。
  6. 在 outputs/CorpusStats.xlsx 中记录 source_id、lang、n_chars_before、n_chars_after、timestamp 以及 cleaning_ruleset(设为 v1.0)16
    注意: 对于每种语言,需验证 corpus_raw 中的每个文件在 corpus_clean 中均有对应的清理后文件,且 source_id 和语言后缀相同。
    警告: 若原始文本中出现姓名、电话号码和电子邮件地址等个人信息,应在预处理过程中予以删除。

4. 提取中文和英文候选术语

  1. 使用 jieba 版本 0.42.1 对中文文本进行分词,采用固定用户词典 resources/userdict_zh.txt,并保留匹配以下任一模式的候选词:连续的 2–8 个中文字符,或由一个保留的分隔符分隔的 2–6 个中文字符17
  2. 使用 spaCy 版本 3.7.2(en_core_web_sm 版本 3.7.1)处理英文文本,仅保留包含 1–5 个词元的名词短语和带连字符的复合词18
  3. 计算 freq,即每个候选词在整个清洗后语料库中的总出现次数;计算 doc_freq,即至少包含该候选词一次的不同 source_id 文件的数量。
  4. 应用候选词短名单阈值:仅保留 doc_freq ≥ 2 且 freq ≥ 3 的候选词,其余候选词予以剔除19
    注意:这些短名单阈值是为相对较小且文体均衡的语料库选定的。对于更大或更异质的语料库,可在初步检查后调整阈值。
  5. 导出候选词文件 candidates/Candidates_ZH.xlsx 和 candidates/Candidates_EN.xlsx,包含列项:term、freq、doc_freq、example_source_id 和 example_snippet。
  6. 导出候选词短名单文件 candidates/Shortlist_ZH.xlsx 和 candidates/Shortlist_EN.xlsx,使用相同列项,其中中文片段显示为某一实际出现位置前后各 ±20 个字符,英文片段显示为前后各 ±10 个词元。
  7. 在 logs/thresholds.txt 中记录分词器或词性标注器的名称与版本、候选词模式以及短名单阈值。
  8. 为 resources/userdict_zh.txt 计算校验和,将其记录在 logs/thresholds.txt 中,并保存一份冻结副本为 outputs/userdict_zh_v1.txt20
    注意:打开 Shortlist_ZH.xlsx 和 Shortlist_EN.xlsx,确认两个文件均包含非零行且 example_snippet 字段已填充。

5. 生成双语对齐候选词并排序术语对

  1. 针对每个候选中文术语,收集其每次出现前后各 ±20 个中文字符的上下文窗口,并将最多五个窗口拼接成一个名为 ctx_zh 的上下文字符串。
  2. 针对每个候选英文术语,收集其每次出现前后各 ±10 个词元(token)的上下文窗口,并将最多五个窗口拼接成一个名为 ctx_en 的上下文字符串。
  3. 创建并冻结双语映射资源。
    1. 创建文件 resources/term_map_zh2en.xlsx,包含列 term_zh 和 term_zh_en。
    2. 通过授权流程填充该文件,例如使用现有机构术语表、先前已接受的双语术语列表以及基于规则的标准化方法。
    3. 将冻结后的映射保存为 outputs/term_map_zh2en_v1.xlsx。
    4. 在 logs/alignment_log.txt 中记录冻结日期、映射覆盖率及文件校验和。注意:当将此工作流程适配到新领域时,应以高频领域术语的种子列表开始构建映射资源,并在完整重运行之间扩展该表,而非在评分过程中进行扩展。
  4. 使用冻结的映射将每个 term_zh 映射为对应的英文可比形式 term_zh_en,并在整个运行过程中保持使用相同的映射资源21
  5. 通过对 ctx_zh 应用冻结映射,将匹配到的 term_zh 出现替换为 term_zh_en,其余文本保持不变,从而生成 ctx_zh_en。
  6. 记录映射与标准化过程。
    1. 在 logs/alignment_log.txt 中记录映射过程。
    2. 在 logs/alignment_log.txt 中记录所有标准化规则,包括小写化和连字符标准化。
  7. 使用 RapidFuzz 版本 3.6.1 的 token_sort_ratio 计算字符串相似度得分 S_str,比较 term_zh_en 与 term_en 的标准化英文术语字符串,并将结果除以 100,使得分缩放到 [0, 1] 范围内22
  8. 计算上下文相似度得分 S_ctx。
    1. 使用 scikit-learn 版本 1.4.2 和 TfidfVectorizer,参数固定为 lowercase=True、ngram_range=(1, 2)、min_df=1、max_df=0.95,stop_words="english"23
    2. 在当前运行中 ctx_en 与 ctx_zh_en 字符串的合并集上拟合向量化器。
    3. 将 S_ctx 计算为每个 ctx_zh_en 字符串与每个 ctx_en 字符串之间的余弦相似度。
      注意:TF-IDF 表示每个上下文窗口中词语和短语的相对重要性,余弦相似度用于比较生成的上下文表示。
  9. 计算最终相似度得分并对候选词对进行排序。
    1. 将最终得分计算为 S = 0.60 × S_str + 0.40 × S_ctx。
    2. 对每个中文术语,保留按 S 排名前 k = 3 的英文候选词。
    3. 通过为每个唯一的 (term_zh, term_en) 词对保留得分最高的实例来去除重复项。
    4. 在 logs/alignment_log.txt 中记录 k 值、得分权重以及导出词对的总数24
      注意:权重方案和 k 值的选择旨在保持可管理的审阅集,同时保留合理的备选项。对于更大语料库或术语变化更大的情况,可在试点测试后调整这些设置。
  10. 使用固定关键词映射文件 resources/domain_keywords.csv 及以下优先级顺序分配 domain_tag 值:kiln_technology > craft_process > heritage_museum > tourism_experience > product_commerce25
    注意:当将该工作流程迁移至其他主题领域时,需替换关键词映射并修改优先级顺序,然后重新运行完整流程。
  11. 将关键词映射的冻结副本保存为 outputs/domain_keywords_v1.csv,并将其校验和记录在 logs/alignment_log.txt 中。
  12. 导出 alignment/AlignmentPairs.xlsx,包含列 pair_id、term_zh、term_en、term_zh_en、S、rank_within_zh、domain_tag、evidence_snippet_zh、evidence_snippet_en 和 evidence_snippet_zh_en。
  13. 使用以下阈值对每对词标注为 auto_accept、review 或 auto_reject:S ≥ 0.90、0.75 ≤ S ≤ 0.89 以及 S < 0.75,并在 logs/alignment_log.txt 中记录阈值及各标签组的数量。
    注意:在与本研究所用环境相当的标准桌面环境中,针对此类规模语料库的上下文生成、TF-IDF 拟合和相似度评分可在数分钟内完成。
    注意:随机检查 AlignmentPairs.xlsx 中至少 10 行,确认 evidence_snippet_zh_en 存在,且在已映射情况下 term_zh_en 非空。
    警告:在一次运行过程中必须保持所有映射资源固定。评分开始后不得更新双语映射表或关键词映射。

6. 通过专家标注与裁决验证术语对

  1. 创建包含以下列的验证/标注文件 Validation/Annotation.xlsx:pair_id、term_zh、term_en、term_zh_en、S、domain_tag、A1_decision、A2_decision、adjudication 和 rationale。
  2. 制定一份一页纸的标注指南,明确定义陶瓷文化旅游领域中的概念对等性、可接受的解释性翻译,以及排除情况,例如部分重叠、过于泛化的译法以及文物类型不匹配的情况26
  3. 指示两名标注人员根据提供的证据片段,独立判断每一对术语应“保留”或“排除”,且不得查看彼此的标注结果。
  4. 在独立标注完成后,对所有不一致的判断进行复核,并在 adjudication 和 rationale 列中记录最终决定及一句简要的理由说明。
  5. 基于“保留”和“排除”标签计算原始一致率和 Cohen’s κ 值,并将一致性指标以及“保留”和“排除”的总数记录至 outputs/Evaluation.xlsx27
  6. 复核所有被排除的语对,识别系统性的假阳性模式,并将最常出现的拒绝模式保存至 logs/rule_update_v1.txt。
  7. 将完成的标注文件保存为冻结版本 outputs/Annotation_v1.xlsx,此后不得更改任何已裁定的标注结果。
    注意:本方案可在此处暂停。若后续恢复执行,不得修改任何已冻结的验证决定。

7. 完成词典并导出

  1. 使用表2中汇总的条目字段填充最终词典,包括双语术语形式、词性、领域标签、翻译类型、双语定义、用法示例、来源信息和质量标记。
  2. 在所有导出文件中使用相同的 entry_id 值,并在生成文件前确认标识符的一致性。
  3. 将最终电子表格导出为 outputs/FinalLexicon.xlsx,并在保存前验证所有必填字段均已填写。
  4. 生成并验证 TBX 导出文件。
    1. 使用相同的 entry_id 值生成 TBX 文件,以保持可追溯性。
    2. 根据目标 TBX 模式(schema)对 TBX 文件进行验证。
    3. 将验证结果记录在 logs/run_notes.txt28 中。
  5. 将所有日志、参数文件、冻结资源和输出归档至版本化文件夹 outputs/Lexicon_v1/,并在 logs/run_notes.txt 中记录归档日期和文件数量。
  6. 将脚本、冻结资源和参数日志作为补充文件提供,包括 outputs/userdict_zh_v1.txt、outputs/domain_keywords_v1.csv、outputs/term_map_zh2en_v1.xlsx、logs/thresholds.txt 和 logs/alignment_log.txt。
  7. 提供一个已获得权限许可的语料库验证子集,使用相同的文件结构和输出模式,以便读者可在发布的子集上复现工作流程29
    注意:在共享补充材料前,须确认发布包中不包含受版权保护的全文、敏感标识符或未经授权的机构资源。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

语料库构建与清洗结果
根据表1所示的语料库设计,从博物馆和展览文本、文化遗产描述以及面向游客的旅游资料中整理构建了一个注册的双语语料库。经过清洗后,语料库包含12份中文文档和8份英文文档,共计47,843个中文字符和32,193个英文字符30。该语料库保留了技术性、阐释性及旅游导向类材料的预期组合。最终语料库的构成符合表1中定义的目标范围。

此阶段的阳性结果特征为:来源标识符稳定,注册文件与清洗后文件完全对应,且每份文档的清洗后文本均可使用。阴性或次优结果更可能涉及清洗后文件缺失、标识符不一致,或清洗后文本丢失过多。此类情况会降低下游术语覆盖率,应在候选术语提取前予以纠正。

...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案的主要价值在于能够将通常以非正式方式处理的术语工作转化为可重复、可审查的工作流程。在陶瓷文化旅游领域,许多术语既具有技术性又具有诠释性:它们不仅指代材料、窑炉类型、烧制阶段或装饰风格,还涉及这些概念如何通过标签、解说文本和教育材料向游客传达36。因此,该领域中的双语差异并非微不足道的表达风格问题,而可能影响游客的理解方式,并改变文化意义在不同平台和机构间的传播效果37。本方案通过结合固定的预处理规则、固定的参数设置、排序的双语对齐方法以及专家验证,构建了一个可追溯的整合工作流程,以解决这一问题。

该方法可靠运行依赖于若干关键步骤。首先,语料库的注册、清洗和参数冻结应被视为受控步骤,而非常规准备工作。预处理过程中微小的未记录变更,例如软件包版本或阈值的变化,可能导致两次运行结果看似相似,但实际上已不再具有可比性。因此,完整记录参数状态并冻结输入资源有助于实现可重复运行,并使后续差异更易于追溯38

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们与本研究无任何相关的竞争性财务或非财务利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢在语料库构建与验证过程中提供文本资料和领域反馈的陶瓷文化旅游从业者及博物馆工作人员。作者还感谢两位独立的领域标注人员,他们对对齐候选条目进行了仔细审阅,并对词条设计提出了建设性意见。本研究得到了江西省高等教育学会研究项目“基于DeepSeek的中国陶瓷旅游术语智能英译及其多渠道传播模型研究”(项目编号:WY-D-115)的资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
计算机工作站硬件任何能够运行 Python 3.11 并处理文本语料库的现代计算机;建议配备 ≥8 GB 内存无需目录编号
来源:通用(任意供应商)
操作系统软件Windows 10/11、macOS 或 Linux(在 logs/run_notes.txt 中记录确切的操作系统版本)版本记录在 run_notes.txt 中
来源:系统预装
Python软件Python 3.11版本记录在 logs/pip_freeze.txt 中
来源:Python 软件基金会发行版
jieba软件库0.42.1jieba==0.42.1
来源:PyPI 软件包仓库
spaCy软件库3.7.2spacy==3.7.2
来源:PyPI 软件包仓库
英文自然语言处理模型NLP 模型en_core_web_sm 3.7.1(spaCy 模型包)en_core_web_sm==3.7.1;安装记录在 run_notes.txt 中
来源:spaCy 模型仓库
scikit-learn软件库1.4.2scikit-learn==1.4.2
来源:PyPI 软件包仓库
RapidFuzz软件库3.6.1RapidFuzz==3.6.1
来源:PyPI 软件包仓库
电子表格编辑器软件任何能够编辑 .xlsx 文件的软件用于查看/编辑 SourceRegister.xlsx、CorpusStats.xlsx、Candidates/Shortlist 文件
来源:通用(任意供应商)
纯文本编辑器软件任何能够编辑 .txt 和 .csv 文件的软件用于查看/编辑 logs/.txt 和 resources/.csv
来源:通用(任意供应商)
UTF-8 文本转换工具软件任何能够将文档导出为 UTF-8 纯文本的工具在步骤 2.3 中使用;具体方法记录在 run_notes.txt 中
来源:通用(任意供应商)
源注册模板文件模板SourceRegister.xlsx,包含字段:source_id、title、owner/publisher、language、genre、access_date、license_note冻结为 outputs/SourceRegister_v1.xlsx
来源:本研究创建
语料库统计模板文件模板CorpusStats.xlsx,包含字段:source_id、lang、n_chars_before、n_chars_after、timestamp、cleaning_ruleset在步骤 3.6 中生成
来源:本研究创建
中文用户词典资源文件resources/userdict_zh.txt(用于支持分词的领域特定术语列表)保存了冻结副本;校验和记录在 thresholds.txt 中
来源:本研究创建/整理
领域关键词映射表资源文件resources/domain_keywords.csv,包含 domain_tag 优先级规则冻结为 outputs/domain_keywords_v1.csv;校验和记录在 alignment_log.txt 中
来源:本研究创建/整理
中英术语映射表资源文件resources/term_map_zh2en.xlsx,包含列 term_zh 和 term_zh_en冻结为 outputs/term_map_zh2en_v1.xlsx;覆盖率记录在 alignment_log.txt 中
来源:本研究创建/整理
阈值日志日志文件logs/thresholds.txt(模式、阈值、库版本、资源校验和)确定性重运行所必需
来源:本研究生成
对齐日志日志文件logs/alignment_log.txt(权重、k、截断值、向量化器设置、映射覆盖率、映射校验和)确定性重运行所必需
来源:本研究生成
标注表单文件模板validation/Annotation.xlsx(pair_id、term_zh、term_en、S、decisions、adjudication、rationale)在步骤 6.6 后冻结为 outputs/Annotation_v1.xlsx
来源:本研究创建
评估输出输出文件outputs/Evaluation.xlsx(原始一致性、Cohen’s κ、总计)在步骤 6.4 中生成
来源:本研究生成
最终词典导出输出文件outputs/FinalLexicon.xlsx,遵循表 2 的模式在步骤 7.2 中生成
来源:本研究生成
TBX 导出文件输出文件由 FinalLexicon.xlsx 生成的 TBX 文件,具有稳定的 entry_id 映射验证结果记录在 run_notes.txt 中
来源:本研究生成

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Labadi, S., et al. . Heritage and the sustainable development goals: policy guidance for heritage and development actors. , (2021).
  2. Cheng, Y., Chen, W. Cultural perception of tourism heritage landscapes via multi-label deep learning: a study of Jingdezhen, the porcelain capital. Land. 14 (3), 559 (2025).
  3. UNESCO. . Convention for the safeguarding of the intangible cultural heritage. , (2003).
  4. Ababneh, A. Preserving intangible cultural heritage: review approaches and tools for documentation. Univ Sharjah J Humanit Soc Sci. 22 (2), (2025).
  5. Xu, Z., et al. Immersive HCI for intangible cultural heritage in tourism contexts: a narrative review of design and evaluation. Sustainability. 18 (1), 153 (2026).
  6. Bowker, L. Terminology management. The Bloomsbury companion to language industry studies. , 261-284 (2020).
  7. Establishing a comprehensive and standardized terminology framework for conducting building condition audits: enhancing consistency, clarity, and effectiveness in assessment practices. ResearchGate Available from: https://www.researchgate.net/profile/Antony-Owen/4 (2025)
  8. Rozhkov, Y. Linguocognitive approach to extracting terms from a corpus of veterinary texts. Int J Philol. 14 (4), 46-55 (2023).
  9. Ranjgar, B., et al. Cultural heritage information retrieval: past, present, and future trends. IEEE Access. 12, 42992-43026 (2024).
  10. Li, Y. Research on bilingual translation sentence similarity detection method based on cross-linguistic mapping. Int J High Speed Electron Syst. 25, 2540537 (2025).
  11. Resck, L., Augenstein, I., Korhonen, A. Explainability and interpretability of multilingual large language models: a survey. , 20454-20486 (2025).
  12. Wissik, T. Dimensions of sustainability in terminology practice in institutional settings. Terminol Sci Res. 27, 93-116 (2024).
  13. Sousa, S., Kern, R. How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing. Artif Intell Rev. 56 (2), 1427-1492 (2023).
  14. Rosenberg, J., et al. . TRAIL: audit trails for enhanced reproducibility and observability of research computing. , (2025).
  15. Abdumirzabekova, D. Building a balanced corpus: principles and challenges. Ustozlar Uchun. 85 (2), 149-155 (2025).
  16. Fernández-Pichel, M., et al. An unsupervised perplexity-based method for boilerplate removal. Nat Lang Eng. 30 (1), 132-149 (2024).
  17. Khekare, G., et al. Text normalization and summarization using advanced natural language processing. , 1-6 (2024).
  18. Liwei, Z. Chinese technical terminology extraction based on DC-value and information entropy. Sci Rep. 12 (1), 20044 (2022).
  19. Ananiadou, S. A methodology for automatic term recognition. , 1034-1038 (1994).
  20. Lossio-Ventura, J. A., Jonquet, C., Roche, M., Teisseire, M. Yet another ranking function for automatic multiword term extraction. , 52-64 (2014).
  21. Lei, X., Kim, E., Baibakova, V., Sun, S. Lessons in reproducibility: insights from NLP studies in materials science. arXiv [Preprint]. , (2023).
  22. Badham, L., Furlong, A. Summative assessments in a multilingual context: what comparative judgment reveals about comparability across different languages in literature. Int J Test. 23 (2), 111-134 (2023).
  23. Widianto, A., Pebriyanto, E., Fitriyanti, F., Marna, M. Document similarity using term frequency–inverse document frequency representation and cosine similarity. J Dinda Data Sci Inf Technol Data Anal. 4 (2), 149-153 (2024).
  24. RapidFuzz: a fast string matching library for Python and C++. Available from: https://github.com/maxbachmann/RapidFuzz (2019)
  25. Irvine, A., Callison-Burch, C. A comprehensive analysis of bilingual lexicon induction. Comput Linguist. 43 (2), 273-310 (2017).
  26. Bakker, R. M., de Boer, M. H., van Drie, R. A., Vos, D. Extracting structured knowledge from Dutch legal texts: a rule-based approach. , (2022).
  27. Ruggeri, F., et al. Let guidelines guide you: a prescriptive guideline-centered data annotation methodology. arXiv [Preprint]. , (2024).
  28. Musid, N. A., Matore, M. E., Hamid, H. A. Inter-rater reliability for assessing digital leadership situational judgement test linguistic validation using Cohen kappa. J ReAttach Ther Dev Divers. 6 (10s2), 1021-1029 (2023).
  29. Vezzani, F., Di Nunzio, G. M., Costa, R. ISO standards for terminology resources management: are they FAIR enough?. Digital Translation. 10 (2), 233-252 (2023).
  30. Sandve, G. K., Nekrutenko, A., Taylor, J., Hovig, E. Ten simple rules for reproducible computational research. PLoS Comput Biol. 9 (10), e1003285 (2013).
  31. Nordling, T., Peralta, T. M. . A literature review of methods for assessment of reproducibility in science. , (2022).
  32. Knoth, P., Schmidt, M., Smrz, P., Zdrahal, Z. . Towards a framework for comparing automatic term recognition methods. , (2009).
  33. Ji, S., Mickus, T., Segonne, V., Tiedemann, J. Can machine translation bridge multilingual pretraining and cross-lingual transfer learning?. , 2809-2818 (2024).
  34. Li, D., Rosé, C., Yuan, A., Zhou, C. Estimating agreement by chance for sequence annotation. , 5085-5097 (2024).
  35. Saiko, M., Dorofeieva, M., Kiyko, S. Methodological coordinate system for empirical translation-oriented terminology research. Glottotheory. , (2025).
  36. Moreno-Melgarejo, A., García-Valenzuela, L. J., Hilliard, I., Pinto-Tortosa, A. J. Exploring relations between heritage interpretation, visitors learning experience and tourist satisfaction. Czech Journal of Tourism. 8 (2), 103-118 (2019).
  37. Zheng, L. Y., Wang, Y. Y. English translation methods for ancient Chinese cultural artifacts terminology. J Lit Art Stud. 15 (3), 178-188 (2025).
  38. Johns, M., et al. Data provenance in biomedical research: scoping review. J Med Internet Res. 25, e42289 (2023).
  39. Pallucchini, F., et al. Lost in alignment: a survey on cross-lingual alignment methods for contextualized representation. ACM Comput Surv. 58 (5), 1-34 (2025).
  40. Mei, H., Chen, Y. Exploring the role of standards-based descriptors in promoting translation learners’ metacognitive strategy use and translation performance. Front Psychol. 16, 1631662 (2025).
  41. Al-Tarawneh, A., Al-Badawi, M., Binsaddig, R. Language as a legal tool: the intersection of translation studies and corporate governance. Frontiers of human centricity in the artificial intelligence-driven society 5.0. , 153-163 (2024).
  42. Landis, J. R., Koch, G. G. The measurement of observer agreement for categorical data. Biometrics. 33 (1), 159-174 (1977).
  43. Bender, E. M., Friedman, B. Data statements for natural language processing: toward mitigating system bias and enabling better science. Trans Assoc Comput Linguist. 6, 587-604 (2018).
  44. Przybyl, H., Karakanta, A., Menzel, K., Teich, E. Exploring linguistic variation in mediated discourse: translation vs. interpreting. Mediated discourse at the European Parliament: empirical investigations. , 191-224 (2022).
  45. Gaizauskas, R., Barker, E., Paramita, M. L., Aker, A. Assigning terms to domains by document classification. , 11-21 (2014).
  46. Ding, Q., et al. Enhancing bilingual lexicon induction via harnessing polysemous words. Neurocomputing. 611, 128682 (2025).
  47. Singh, P., Sorrell, J. Sensitivity of stability: theoretical and empirical analysis of replicability for adaptive data selection in transfer learning. arXiv [Preprint]. , (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233 TBX

相关文章