本方案利用已注册的双语语料库,通过标准化清洗、候选术语提取、基于相似度排序的对齐以及专家验证与裁决,构建了中英陶瓷文化旅游术语库。采用该工作流程,导出了60个经过验证的词条,包含定义、用法示例、来源记录以及兼容TBX格式的输出结果。
方法文章
本方案利用已注册的双语语料库,通过标准化清洗、候选术语提取、基于相似度排序的对齐以及专家验证与裁决,构建了中英陶瓷文化旅游术语库。采用该工作流程,导出了60个经过验证的词条,包含定义、用法示例、来源记录以及兼容TBX格式的输出结果。
构建陶瓷文化旅游领域的双语术语资源面临诸多挑战,因为相关文本往往零散不全,翻译选择缺乏一致性,且可复用的构建流程很少被系统记录。本方案提出了一种可重复的、分步实施的工作流程,用于构建中英陶瓷文化旅游术语库,具体步骤包括语料库注册与清洗、候选术语提取、双语对齐以及专家验证与裁决。该流程应用于一个已注册的双语语料库后,成功生成了中英文候选术语短名单,产出排序后的双语术语对,并在独立专家评审后保留了经验证的对齐结果。最终形成的术语库导出了60个经核实的词条,包含双语术语形式、领域标签、翻译类型、双语定义、用法示例、来源记录,以及Excel和TBX等可互操作的输出格式。为确保透明性和可重复性,本方案在全流程中记录了各项阈值、软件包版本、冻结资源及验证决策,从而使整个过程具备可审计性,并更易于推广至其他文化遗产旅游领域。当迁移至新领域时,用户可通过扩展领域关键词列表、更新双语映射资源,并根据语料库规模和术语密度调整少量短名单及相似度阈值,实现流程的适配与延展。
随着游客日益追求具有意义的文化遗产体验而不仅仅是纯粹的休闲活动,文化旅游已成为目的地发展的重要推动力1。在政策和产业层面,国际组织多次强调将旅游与文化相结合的价值,并呼吁加强对多样化遗产资源的阐释、记录与传播。在此宏观背景下,陶瓷文化旅游尤其涉及大量专业术语,因为游客经常接触到与材料、釉料和烧制工艺、窑炉技术、风格纹样、器物类型以及手工艺过程叙述相关的专门概念。这些术语往往具有难以通过随意转述传达的技术含义,而翻译选择会直接影响游客对展签、导览解说和教育材料内容的理解2。与此同时,文化遗产保护框架强调,非物质文化遗产的保护依赖于持续的知识传承和公众认知,而这两者都要求在阐释与教育中使用准确、易懂且符合语境的语言3。
尽管存在这一需求,陶瓷文化旅游领域的双语术语资源仍处于零散且不一致的状态。在博物馆标签、展览文字、旅游指南页面和遗产描述中,相同的概念在不同机构、地区和交际场景下可能呈现不同的表达方式4。这种差异不仅仅是风格上的不同,它可能影响游客的理解,降低各遗址描述之间的可比性,并削弱遗产传播的可信度5。术语学研究长期以来主张,高质量的术语资源应以概念为中心,配有明确的定义,并以可追溯的证据为基础,例如来源、语境以及质量控制记录6。然而,许多专业团队仍然缺乏一种系统性的工作流程,能够将分散的文本转化为经过审校的双语词表,同时保留透明的决策规则、可重复的操作程序以及可复用的成果7。与临时性的手工汇编相比,标准化的协议能够提供更清晰的文档记录、更一致的验证过程,以及更有利于更新、审计和跨机构复用的条件。
为应对这些挑战,构建双语术语库的实用方案需要统筹两项关联任务:候选术语发现与双语对齐。在术语发现方面,基于语料库的自动提取方法可通过结合语言模式与统计证据,降低对完全人工收集的依赖,从而更高效地大规模识别领域相关术语8。然而,在文化遗产领域,语料库的构建往往并不简单。原始资料在文体、语域和交际目的上常存在差异,且可能包含领域专有名称及混合的描述惯例9。这些特征使得参数记录的透明化和处理规则的稳定性尤为重要。在双语对齐方面,计算方法可通过比较术语形式及其上下文使用环境,生成按优先级排序的跨语言候选词对,随后由领域专家判断所提议的词对在概念上是否恰当10。本方案中,首先利用自动化方法生成并排序合理候选词对,再通过专家评审进行确认或否决。这种结合方式在保留最终判断中解释性决策的同时,提高了工作效率。由于文化遗产术语常具有文化和教育层面的含义,评审人员必须能够审查每个提议词对背后的证据,而非依赖不透明的输出结果11。
本文提出了一种逐步可审计的协议,用于从注册文本资源中构建汉英陶瓷文化旅游术语库。该工作流程对语料库的注册与清洗、双语候选词提取、排序词对生成、两名标注员评审并经仲裁确认以及在固定模式下的最终词条完善等步骤进行了标准化。通过整合版本记录、阈值控制、冻结资源和专家验证,该协议相较于结构松散的术语构建流程,显著提高了可重复性、可审计性和标准化水平。为支持术语管理与翻译实践中的长期复用,最终完成的术语库还可导出为术语库交换(TermBase eXchange, TBX)格式,这是一种符合ISO标准的结构化术语数据交换标准12。
访问受限。请登录或开始试用以查看此内容。
本研究仅使用公开可用或机构授权的文本数据,未涉及人类或动物受试者。无需机构伦理审批。
1. 创建项目工作区
2. 汇编平衡的双语语料库并登记来源
3. 清理并标准化语料库文件
4. 提取中文和英文候选术语
5. 生成双语对齐候选词并排序术语对
6. 通过专家标注与裁决验证术语对
7. 完成词典并导出
访问受限。请登录或开始试用以查看此内容。
语料库构建与清洗结果
根据表1所示的语料库设计,从博物馆和展览文本、文化遗产描述以及面向游客的旅游资料中整理构建了一个注册的双语语料库。经过清洗后,语料库包含12份中文文档和8份英文文档,共计47,843个中文字符和32,193个英文字符30。该语料库保留了技术性、阐释性及旅游导向类材料的预期组合。最终语料库的构成符合表1中定义的目标范围。
此阶段的阳性结果特征为:来源标识符稳定,注册文件与清洗后文件完全对应,且每份文档的清洗后文本均可使用。阴性或次优结果更可能涉及清洗后文件缺失、标识符不一致,或清洗后文本丢失过多。此类情况会降低下游术语覆盖率,应在候选术语提取前予以纠正。
| ... |
访问受限。请登录或开始试用以查看此内容。
本方案的主要价值在于能够将通常以非正式方式处理的术语工作转化为可重复、可审查的工作流程。在陶瓷文化旅游领域,许多术语既具有技术性又具有诠释性:它们不仅指代材料、窑炉类型、烧制阶段或装饰风格,还涉及这些概念如何通过标签、解说文本和教育材料向游客传达36。因此,该领域中的双语差异并非微不足道的表达风格问题,而可能影响游客的理解方式,并改变文化意义在不同平台和机构间的传播效果37。本方案通过结合固定的预处理规则、固定的参数设置、排序的双语对齐方法以及专家验证,构建了一个可追溯的整合工作流程,以解决这一问题。
该方法可靠运行依赖于若干关键步骤。首先,语料库的注册、清洗和参数冻结应被视为受控步骤,而非常规准备工作。预处理过程中微小的未记录变更,例如软件包版本或阈值的变化,可能导致两次运行结果看似相似,但实际上已不再具有可比性。因此,完整记录参数状态并冻结输入资源有助于实现可重复运行,并使后续差异更易于追溯38。
访问受限。请登录或开始试用以查看此内容。
作者声明,他们与本研究无任何相关的竞争性财务或非财务利益。
作者感谢在语料库构建与验证过程中提供文本资料和领域反馈的陶瓷文化旅游从业者及博物馆工作人员。作者还感谢两位独立的领域标注人员,他们对对齐候选条目进行了仔细审阅,并对词条设计提出了建设性意见。本研究得到了江西省高等教育学会研究项目“基于DeepSeek的中国陶瓷旅游术语智能英译及其多渠道传播模型研究”(项目编号:WY-D-115)的资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机工作站 | 硬件 | 任何能够运行 Python 3.11 并处理文本语料库的现代计算机;建议配备 ≥8 GB 内存 | 无需目录编号 来源:通用(任意供应商) |
| 操作系统 | 软件 | Windows 10/11、macOS 或 Linux(在 logs/run_notes.txt 中记录确切的操作系统版本) | 版本记录在 run_notes.txt 中 来源:系统预装 |
| Python | 软件 | Python 3.11 | 版本记录在 logs/pip_freeze.txt 中 来源:Python 软件基金会发行版 |
| jieba | 软件库 | 0.42.1 | jieba==0.42.1 来源:PyPI 软件包仓库 |
| spaCy | 软件库 | 3.7.2 | spacy==3.7.2 来源:PyPI 软件包仓库 |
| 英文自然语言处理模型 | NLP 模型 | en_core_web_sm 3.7.1(spaCy 模型包) | en_core_web_sm==3.7.1;安装记录在 run_notes.txt 中 来源:spaCy 模型仓库 |
| scikit-learn | 软件库 | 1.4.2 | scikit-learn==1.4.2 来源:PyPI 软件包仓库 |
| RapidFuzz | 软件库 | 3.6.1 | RapidFuzz==3.6.1 来源:PyPI 软件包仓库 |
| 电子表格编辑器 | 软件 | 任何能够编辑 .xlsx 文件的软件 | 用于查看/编辑 SourceRegister.xlsx、CorpusStats.xlsx、Candidates/Shortlist 文件 来源:通用(任意供应商) |
| 纯文本编辑器 | 软件 | 任何能够编辑 .txt 和 .csv 文件的软件 | 用于查看/编辑 logs/.txt 和 resources/.csv 来源:通用(任意供应商) |
| UTF-8 文本转换工具 | 软件 | 任何能够将文档导出为 UTF-8 纯文本的工具 | 在步骤 2.3 中使用;具体方法记录在 run_notes.txt 中 来源:通用(任意供应商) |
| 源注册模板 | 文件模板 | SourceRegister.xlsx,包含字段:source_id、title、owner/publisher、language、genre、access_date、license_note | 冻结为 outputs/SourceRegister_v1.xlsx 来源:本研究创建 |
| 语料库统计模板 | 文件模板 | CorpusStats.xlsx,包含字段:source_id、lang、n_chars_before、n_chars_after、timestamp、cleaning_ruleset | 在步骤 3.6 中生成 来源:本研究创建 |
| 中文用户词典 | 资源文件 | resources/userdict_zh.txt(用于支持分词的领域特定术语列表) | 保存了冻结副本;校验和记录在 thresholds.txt 中 来源:本研究创建/整理 |
| 领域关键词映射表 | 资源文件 | resources/domain_keywords.csv,包含 domain_tag 优先级规则 | 冻结为 outputs/domain_keywords_v1.csv;校验和记录在 alignment_log.txt 中 来源:本研究创建/整理 |
| 中英术语映射表 | 资源文件 | resources/term_map_zh2en.xlsx,包含列 term_zh 和 term_zh_en | 冻结为 outputs/term_map_zh2en_v1.xlsx;覆盖率记录在 alignment_log.txt 中 来源:本研究创建/整理 |
| 阈值日志 | 日志文件 | logs/thresholds.txt(模式、阈值、库版本、资源校验和) | 确定性重运行所必需 来源:本研究生成 |
| 对齐日志 | 日志文件 | logs/alignment_log.txt(权重、k、截断值、向量化器设置、映射覆盖率、映射校验和) | 确定性重运行所必需 来源:本研究生成 |
| 标注表单 | 文件模板 | validation/Annotation.xlsx(pair_id、term_zh、term_en、S、decisions、adjudication、rationale) | 在步骤 6.6 后冻结为 outputs/Annotation_v1.xlsx 来源:本研究创建 |
| 评估输出 | 输出文件 | outputs/Evaluation.xlsx(原始一致性、Cohen’s κ、总计) | 在步骤 6.4 中生成 来源:本研究生成 |
| 最终词典导出 | 输出文件 | outputs/FinalLexicon.xlsx,遵循表 2 的模式 | 在步骤 7.2 中生成 来源:本研究生成 |
| TBX 导出文件 | 输出文件 | 由 FinalLexicon.xlsx 生成的 TBX 文件,具有稳定的 entry_id 映射 | 验证结果记录在 run_notes.txt 中 来源:本研究生成 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可