本文介绍了一种在资源有限情况下,利用 BioBERT、基于提示的学习方法及大语言模型进行生物医学命名实体识别的实验方案。
研究文章
本文介绍了一种在资源有限情况下,利用 BioBERT、基于提示的学习方法及大语言模型进行生物医学命名实体识别的实验方案。
生物医学命名实体识别(NER)在从临床文本和生物医学文献中提取有价值信息方面发挥着关键作用。传统的深度学习模型,包括 BioBERT、ClinicalBERT 和 RoBERTa,在 NER 任务中已展现出显著改进;然而,这些模型在低资源生物医学术语、领域适应性挑战以及对未见实体的泛化能力方面仍存在困难。为解决这些局限性,本研究提出一种混合框架,结合 BioBERT、基于提示的学习(prompt-based learning)和大语言模型(LLMs),以增强生物医学 NER 中的少样本(few-shot)和零样本(zero-shot)学习能力。所提出的模型有效利用了预训练 Transformer 模型中的上下文知识,在保持高准确率的同时,降低了对大规模标注数据集的依赖。在多个生物医学基准数据集上经过广泛实验评估后,该方法表现出持续优异的性能。具体而言,其准确率达到 89.8%,精确率为 88.7%,召回率为 90.5%,F1 分数为 0.895,优于基线方法,证明其在生物医学文本挖掘任务中的有效性。与其他方法相比,提示工程(prompt engineering)使模型能更好地适应生物医学文本特有的语言特征。此外,通过大语言模型(LLM)的增强,NER 性能得到显著提升,能够捕捉复杂的语义和语法细节。这些结果表明,少样本与零样本学习在生物医学文本挖掘中具有显著成效,为实现更高效的自动化临床数据分析和更智能的决策支持系统奠定了基础。
生物医学文献、电子健康记录(EHR)和临床试验数据的激增,迫切需要智能且稳健的生物医学命名实体识别(BioNER)系统。BioNER 是自然语言处理(NLP)中的一项专门任务,旨在识别非结构化生物医学文本中的实体,例如疾病、基因、蛋白质、药物和化学物质1。能够准确提取这些实体,对于诸多后续应用至关重要,例如挖掘生物医学知识、发现新药、辅助临床决策,甚至自动分类大量研究论文2。
尽管基于深度学习的模型(如BioBERT、ClinicalBERT和BlueBERT)已取得显著进展,但大多数现有的监督式生物医学命名实体识别(BioNER)方法仍严重依赖大规模标注数据集。这种对大量标注数据的依赖限制了模型在应用于新颖或此前未见过的生物医学文本时的泛化能力3。传统的BioNER模型仅为了微调就需要海量标注数据,这在数据稀缺的领域成为实际难题,例如罕见病、药物基因组学,或以非英语发表的生物医学研究4。此外,人工标注这些生物医学文本耗时、昂贵,且通常需要领域内的真正专家5。因此,开发少样本(few-shot)和零样本(zero-shot)BioNER模型至关重要:这能够显著减少对标注数据的需求,同时确保模型在多种生物医学内容中均具有良好的性能6。
少样本学习(FSL)使模型仅需使用少量标注数据(通常仅为完整训练数据集的1%至10%)即可实现具有竞争力的实体识别性能,因此在资源匮乏的生物医学领域尤为有价值7。零样本学习(ZSL)更进一步,使模型无需任何额外训练数据,仅通过利用大规模预训练语言模型(LLM)的能力,即可识别其从未见过的实体8。近年来,GPT-4、LLaMA 和 Falcon 等预训练语言模型的进展已在通用命名实体识别(NER)任务中展现出强大的零样本性能,但其在实际生物医学文本中的应用仍 largely 未被探索。这主要是因为生物医学领域的语言极为专业且复杂9。
本研究旨在通过整合BioBERT微调、少样本学习、零样本大语言模型推理以及基于提示的学习方法,全面提升低资源生物医学场景下生物命名实体识别(BioNER)的性能水平。
以下是一些现有的模型示例:(1)BioBERT 是 BERT 的一个版本,已在 PubMed 摘要和全文文章上重新训练,因此更适用于生物医学内容10。(2)ClinicalBERT 是一种在电子健康记录(EHR)上训练的 BERT 变体,专门针对临床记录和医生报告的理解进行了优化11。(3)BlueBERT 是另一种生物医学自然语言处理模型,训练数据包括 PubMed 和 MIMIC-III 数据集,专为识别文本中的医学信息而优化12。(4)PubMedBERT 是一种仅在 PubMed 数据上训练的 Transformer 模型,能够更好地捕捉生物医学文献中特有的语言模式和术语13。
尽管这些模型在生物医学命名实体识别(BioNER)基准测试中达到了最先进的性能,但它们对大规模标注数据集和监督式微调的依赖限制了其在新生物医学领域的适应能力14。此外,科学生物医学文献(例如 PubMed 摘要)与临床记录(例如 i2b2 2010 数据集)之间的领域差异进一步降低了监督式 BioNER 系统的性能15。
当前生物医学命名实体识别(BioNER)研究的主要局限性包括:对标注数据的依赖性:现有的基于Transformer的模型需要大量标注数据集,而这些数据在专业的生物医学领域中十分稀缺16。对未见实体的泛化能力不足:现有模型难以识别训练数据中未出现的罕见或新颖的生物医学术语17。少样本与零样本学习探索有限:大多数研究集中于全监督学习,针对BioNER的低资源学习范式研究较少18。大语言模型(LLM)的低效适配:尽管GPT-4和LLaMA等大语言模型在通用自然语言处理任务中表现出强大的零样本能力,但由于生物医学术语的复杂性以及缺乏领域特定的提示(prompt),其在生物医学命名实体识别中的应用仍鲜有探索19。
为解决这些不足,本研究探讨以下关键科学问题:少样本学习如何在极少量标注数据条件下提升 BioBERT 在生物医学命名实体识别(NER)任务中的性能?利用大语言模型(LLM)进行零样本推理,能否在无需领域特定微调的情况下准确识别生物医学实体?基于提示的学习方法如何增强零样本模式在生物医学命名实体识别任务中的表现?结合 BioBERT 与大语言模型生成的伪标签,何种混合策略在低资源环境下对提升生物医学命名实体识别(BioNER)效果最优?对抗训练如何影响少样本与零样本生物医学命名实体识别模型的鲁棒性?
本研究旨在开发一种新型的自适应生物医学命名实体识别(NER)框架,利用少样本学习和零样本学习来应对标注数据稀缺所带来的挑战。该研究通过探索提示工程、对比学习和对抗训练等技术,旨在增强BioBERT和大语言模型(LLMs)的泛化能力。
本研究围绕以下目标展开:(1)通过在有限标注数据上微调BioBERT,构建用于生物医学命名实体识别的少样本学习流程;(2)利用领域特定的提示工程,评估零样本大语言模型(如GPT-4、LLaMA、Falcon)在生物医学命名实体识别中的性能;(3)创建一种混合方法,将BioBERT微调与大语言模型生成的伪标签相结合,以提升低资源生物医学数据集中的实体识别效果;(4)对少样本 与. 使用标准生物医学基准(MedMentions、BC5CDR、i2b2 2010、PharmaCoNER、BioASQ)进行零样本学习。(5)实施对抗训练(FGSM、PGD)以增强模型对生物医学文本噪声变异的鲁棒性。
本研究通过引入少样本与零样本生物医学命名实体识别(BioNER)策略,应对生物医学数据集中标签稀缺的问题,并展示了如何利用大语言模型(LLMs)实现零样本生物医学命名实体识别(NER),从而推动了生物医学自然语言处理与实体识别领域的发展 通过 优化提示工程。提出一种混合框架,结合BioBERT微调与大语言模型生成的合成标注,以提升泛化能力。评估对抗训练对生物命名实体识别模型的影响,以增强其对领域迁移的鲁棒性。提供监督学习、少样本与零样本范式下生物命名实体识别性能的对比基准。
文献综述
Sivarajkumar 和 Wang20 开发了 HealthPrompt,这是一种用于临床自然语言处理(NLP)的零样本学习(ZSL)框架,旨在解决标注临床数据集缺乏的问题。他们并未对预训练语言模型(PLM)进行微调,而是采用了基于提示的学习方法,通过结构化模板来调整任务定义。他们在 MIMIC-III 数据集上评估了包括 BioBERT 和 ClinicalBERT 在内的六种 PLM,结果显示 ClinicalBERT 在临床文本分类任务中取得了最佳准确率(85%)和 F1 分数(86%)。该研究表明,在无需任何训练数据的情况下,基于提示的零样本学习(ZSL)在临床自然语言处理(NLP)中能够达到与监督模型相当的性能。
Keming Lu 及其团队21开发了BIODLM,这是一种通过基于提示的持续预训练来微调判别式语言模型(DLMs)以适应生物医学领域的新方法。via巧妙的提示调优和替换令牌检测(Replaced Token Detection, RTD)方法,旨在提升模型在生物医学领域少样本和零样本任务中的表现。为实现该目标,他们对词汇表进行了调整,有意混合领域特定术语,并在预训练过程中使用PubMedBERT作为生成器。实验结果令人信服:BIODLM在全监督条件下以50.2%的宏平均准确率超过了传统的基于CLS的微调方法,在零样本模式下也达到了43.4%的准确率。
Zonghai Yao 及其同事22 采取了另一种方法,专注于考虑上下文差异的提示生成。他们的目标是减少基于提示探测过程中可能出现的异常偏差,并使 BioLAMA 评估更加透明和可解释。换句话说,他们试图确保这些语言模型给出的答案是合理的,而不仅仅是在响应措辞巧妙的提示。
他们引入了一种基于排序变化的评估指标(UCM:理解–混淆–误解),以替代传统的Top-k准确率,用于评估预训练语言模型在生物医学实体识别任务中的表现。在包括BioBERT、ClinicalBERT和基于RoBERTa的模型在内的12种预训练语言模型上的实验表明,该方法在大N-M关系和稀有生物医学实体上显著提升了BioLAMA的性能。其中,BioBERT的Accuracy@1达到40.7%,UCM可理解性为32.8%,优于传统的Top-k指标。
Yeh 等人23利用 ChemProt 数据集研究了生物医学关系抽取中的提示学习方法,以提升特定领域的少样本和全数据微调效果。他们设计了基于提示的模板,并引入频率、特异性和相似性等评分指标来优化标签词的选择。基于 BioMed-RoBERTa-base 模型,该方法取得了 90.09 的 F1 分数,比 SciFive-Large 高出 1.14 F1,比常规微调高出 14.21 F1。这证实了基于提示的学习能够在较少训练样本的情况下提升生物医学命名实体识别(NER)的性能。
Susanti 和 Holsmoelle24研究了基于自然语言处理的因果图谱验证方法,比较了经过微调的语言模型与基于提示的大型语言模型。他们训练了BioBERT和GPT模型用于监督式因果关系分类,并评估了零样本和少样本条件下基于提示的大型语言模型的表现。在生物医学和开放领域数据集上的结果显示,经过微调的模型优于基于提示的大型语言模型,F1分数最高高出20.5%。该研究强调,需要采用更先进的提示技术以及针对特定数据集的调优方法,以提高因果关系抽取的准确性。
Chen 等人25提出了一种面向少样本生物命名实体识别(BioNER)的知识引导实例生成与提示对比学习框架。该方法利用领域知识图谱生成多样化的生物医学实体,并采用基于问题提示的对比学习,通过衡量查询-回答对之间的互信息来增强实体识别能力。在多个基准数据集(NCBI、BC5CDR-Disease、BioNLP11EPI、BioNLP13GE)上的评估结果显示,该模型在20-shot场景下相较于最先进的模型最高提升了7.1%的F1分数。其代码已公开发布于:https://github.com/cpmss521/KGPC。
Chen 等人26还提出了一种用于生物医学声明检测的提示学习方法,通过将文本分类任务转化为掩码语言建模(MLM)任务来实现。他们使用 BERT、RoBERTa 和 T5 模型,结合硬模板和混合模板,提高了声明预测的准确性。在 BioClaim 数据集上,其采用混合模板的 T5 模型相比先前模型 F1 分数提升了 5.3%,通过掩码标记预测有效缩小了预训练语言模型(PLM)在预训练与微调阶段之间的差距。
Ryan Shea Ying Cong Tan 等人27评估了使用 Transformer 模型、Bi-LSTM、CNN 和经典机器学习方法从放射学报告中推断癌症疾病反应的大型语言模型(LLM)。他们的方法包括数据增强(句子排列和一致性损失)以及基于提示的微调。GatorTron Transformer 模型取得了最佳准确率:在测试集上的准确率为 0.8916,经数据增强后提升至 0.8976。基于提示的微调使得仅使用 500 份标注报告即可实现有效的性能表现。
Hu 等人28评估了 GPT-3.5 和 GPT-4 在临床命名实体识别(NER)中的表现,通过四部分提示框架提升性能:基础提示、基于指南的提示、基于错误的指令以及少样本示例。在 MTSamples 和 VAERS 数据集上,GPT-3.5 和 GPT-4 的宽松 F1 分数分别从 0.634/0.804 和 0.301/0.593 提高至 0.794/0.861 和 0.676/0.736。尽管仍落后于 BioClinicalBERT(在 MTSamples 上 F1 为 0.901,在 VAERS 上为 0.802),这些结果表明,采用适当的提示策略,大语言模型在临床命名实体识别中的有效性正在不断提升。
访问受限。请登录或开始试用以查看此内容。
1. 实验步骤


2. 环境设置
访问受限。请登录或开始试用以查看此内容。
在源自PubMed摘要、临床记录和生物医学问答语料库的多样化生物医学数据集上,对少样本(Few-Shot)和零样本(Zero-Shot)生物医学命名实体识别(NER)模型进行了评估。该模型与已建立的模型(包括BioBERT、ClinicalBERT、RoBERTa、PhenoBERT29、GPT-3.5和GPT-4)进行了性能比较分析。所提出的模型取得了89.8%的总体准确率,精确率为88.7%,召回率为90.5%,F1分数为0.895。该性能显著优于ClinicalBERT(准确率85.0%,F1分数0.86)和GPT-4(准确率86.1%,F1分数0.86),性能提升主要归因于基于提示的学习(prompt-based learning)与本体驱动的实体链接(ontology-driven entity linking)相结合,从而增强了模型处理新型生物医学实体的能力。
该模型在低数据场景下表现出卓越的能力。在零样本设置中,其准确率达到43.4%,显著优于BioBERT(31.1%)和GPT-3.5(35.2%),表明即使在缺乏任务...
访问受限。请登录或开始试用以查看此内容。
相互矛盾的结果、意外的发现以及与其他研究的差异
尽管所提出模型表现出更优的性能,但在与现有研究进行比较时仍出现了一些矛盾的结果。基于 BioBERT 的模型在生物医学命名实体识别(NER)任务中传统上表现出较强的性能,这在此前关于生物医学 NER 系统的综述和比较研究中已有报道4,10。尽管基于 Transformer 的架构在医疗健康领域的自然语言处理任务中始终能够实现高准确率3,12,但最近研究表明,将基于提示的学习(prompt-based learning)与大语言模型(LLMs)相结合,可提升少样本生物医学学习的效果。在本研究中,基于提示的集成方法获得了更高的召回率,但由于对模糊医学术语较为敏感,偶尔导致过度预测,这一局限性也在零样本与少样本医学人工智能研究中被讨论过。
先前使用临床领域BERT...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 核心模型 | BioBERT-base (v1.1) | Hugging Face: monologg/biobert-v1.1 | |
| 深度学习框架 | PyTorch 2.3.1 | https://pytorch.org/ | |
| GPU 硬件 | NVIDIA A100 (40GB VRAM) | NVIDIA | |
| 大语言模型(LLM) | GPT-4 | OpenAI API | |
| 操作系统 | windows | Microsoft | |
| 参数高效微调 | LoRA (通过 PEFT 库 0.6.2) | https://github.com/huggingface/peft | |
| 编程语言 | Python 3.9.18 | Python Software Foundation | |
| 零样本基线大语言模型 | GPT-3.5-Turbo | OpenAI API |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可