本研究提出一种结合元蒸馏与元学习的轻量级图神经网络,以提升英文文本分类效果。该方法在低数据量和跨领域场景下增强了泛化能力,同时降低了计算成本并保持高性能。
研究文章
本研究提出一种结合元蒸馏与元学习的轻量级图神经网络,以提升英文文本分类效果。该方法在低数据量和跨领域场景下增强了泛化能力,同时降低了计算成本并保持高性能。
全球化与信息技术的发展推动了英文文本数据的激增,对高效分类提出了迫切需求。为提升英文文本分类在小样本和跨领域场景下的泛化能力,并实现模型轻量化,本研究结合复杂系统理论与深度学习,构建了一种充分考虑文本样本分布特性的图神经网络模型。该方法采用结合元学习策略的两级元知识蒸馏方法,动态调整教师模型参数,优化整体知识迁移过程。实验结果表明,所提出模型在少样本与跨领域文本分类任务中的分类性能显著优于传统图神经网络及其他主流对比模型。在轻量化方面,通过两阶段元蒸馏机制生成的SM模型在多主题文本分类数据集上保持了极高的性能保留率,同时显著降低了计算时间。此外,该方法在长文本处理场景中仍能保持高效率与稳定的分类性能,在计算效率方面相较传统蒸馏方法及文献报道的其他方法具有明显优势。所提出的方法在显著降低计算成本的同时,有效提升了低样本量与跨领域应用场景下英文文本的分类性能,为资源受限环境中的英文文本分类提供了可行且高效的技术解决方案。
全球化进程的加快以及信息技术的进步,导致社交媒体、学术研究和商业交流等领域中的英语文本数据呈爆炸式增长。高效地对这些文本进行分类,以实现信息检索、情感分析、内容管理等功能,已成为自然语言处理中的一项重要任务1。英语文本分类(ETC)的目标是根据文本的语义内容将其划分到预定义的类别中。然而,自然语言的复杂性,包括其歧义性、上下文依赖性以及表达方式的多样性,给文本分类任务带来了诸多挑战2。目前,深度学习(DL)技术的发展为文本分类带来了新的机遇。以基于Transformer的双向编码器表示(BERT)及其变体为代表的预训练语言模型,能够通过对大规模语料库的预训练学习丰富的上下文语义信息,显著提升文本分类的性能3。然而,现有的ETC方法仍面临两个关键局限:首先,这些方法通常强调单一模型或特征的优化,忽视了语言作为复杂系统所具有的内在特性,例如其动态性和涌现行为,导致在数据稀疏或跨领域场景下的泛化能力不足;其次,尽管预训练模型性能强大,但其高昂的计算成本和庞大的参数量严重阻碍了其在资源受限环境中的实际部署4,5。为解决上述问题,本研究提出一种融合复杂系统理论(CST)与两阶段元蒸馏机制(TSMDM)的轻量级文本分类框架。
在本研究中,CST 指的是将自然语言视为具有动态演化、语义涌现以及词汇节点影响力异质分布的典型复杂系统的理论框架。该框架用于模拟核心词汇在语义传播中的主导作用,以及从局部词汇特征中涌现出整体语义的规律,从而增强模型对文本语义的深层理解能力,以及在少样本和跨域数据场景下的适应性。其核心贡献如下:理论上,据我们所知,CST 首次被系统性地引入文本分类任务中,通过模拟语言系统的动态演化与语义涌现过程,提升模型对文本的深层理解能力及在少样本和跨域数据下的适应性。方法上,设计了一种包含样本分布特征的图神经网络(GNN)。所提出的创新性 TSMDM 方法在本质上不同于标准的知识蒸馏:标准知识蒸馏实现的是从固定参数的教师模型(TM)向轻量级学生模型(SM)的单向知识传递;而本研究中的元蒸馏在蒸馏基础上融合了元学习策略,能够根据 SM 的学习反馈动态调整 TM 的参数。两阶段设计还额外引入教学辅助模型作为中间缓冲层,以缓解 TM 与 SM 之间因复杂度差距过大而导致的信息损失,在保持高精度的同时实现显著的模型轻量化,从而为资源受限场景提供高效的分类解决方案。
在文本分类(ETC)领域,研究人员已开展了广泛探索,提出了多种整合不同特征和模型架构的解决方案,以应对不同场景下的技术挑战。R. Zhang 等人设计了一种多语言预训练多特征融合模型(MP-MFFM),旨在解决当前深度学习方法在 ETC 中对长距离上下文结构信息捕捉不足的问题。该方法结合了多语言 BERT、BiLSTM 和文本 CNN,用于提取深层语义、全局和局部结构信息,并实现特征融合。该方法在三个数据集上提升了准确率、敏感性和精确度,验证了其有效性6。C. Madhu 等人采用基于方言特征的模糊图学习框架(DF-FGLF),以应对社交网络中非结构化、低标注数据的文本分类需求,以及方言差异对国际英语分类的影响。他们结合语义与方言差异学习特征,构建优化的模糊图。当仅有 10 个标注样本时,方言识别和文本分类的 F1 值分别超过 93% 和 80%,优于同类方法,适用于实际分类任务7。B. Shannaq 等人使用英文和阿拉伯文数据集进行实验,研究 n-gram 长度在不同书写系统中的文本分类效果,以及语言特征对最优 n-gram 长度的影响。结果显示,英文以 2-gram 表现最佳(准确率为 0.482,召回率为 0.489,F1 值为 0.472),而阿拉伯文以 6-gram 表现最佳(F1 值约为 0.85)。语言形态学和句法特征显著影响 n-gram 模型的性能8。N. S. Lagutina 等人利用基于字符、词汇和句子结构文献计量特征构建的文本向量,结合 SVM 等标准机器学习分类器,实现了用于评估学生学习情况的英文短文本自动分类。在《欧洲共同语言参考框架》语料库中,SVM 的 F1 值为 67%,而表现最佳的 BERT 模型(bert-base-cased)的 F1 值为 69%。分类错误主要出现在相邻等级之间,分类质量依赖于语料库的选择9。
知识蒸馏作为一种实现模型轻量化的有效手段,能够在小样本场景下提升模型性能并降低计算成本,相关研究已取得显著进展。先前的研究探索了知识蒸馏在应对关键自然语言处理挑战中的应用,包括:在低标注条件下提升小参数模型的性能、优化多语言文本分类任务、通过混合压缩策略压缩大规模预训练模型,以及蒸馏有效的句子表示,以缩小大模型与小语言模型之间的性能差距,同时适应硬件限制10,11,12,13。尽管取得了上述进展,现有的知识蒸馏方法在文本分类(ETC)任务中仍存在关键局限性:缺乏对知识迁移过程的动态优化机制,在高度复杂的教师模型(TMs)向轻量级学生模型(SMs)蒸馏时常常出现严重的信息丢失,并且未能有效融合文本数据的内在分布特征。这些缺陷导致在少样本和跨域场景下的泛化性能不理想。通过此类方法获得的轻量级模型在资源受限环境中往往难以在分类有效性与计算效率之间实现良好平衡。这正是本文研究旨在解决的核心问题。
本研究检验以下研究假设:第一,将复杂系统理论(CST)融入文本分类(ETC)可有效模拟自然语言系统的动态演化与语义涌现特征。相较于忽略语言复杂系统特性的传统文本分类模型,这种理论融合可显著提升模型在少样本和跨领域场景下的泛化能力。第二,设计时明确考虑文本样本分布特征的图神经网络(GNN)模型,能够弥补传统GNN仅关注实例级关系建模的局限性,实现对英文文本中全局与局部语义信息的更深层次挖掘。第三,结合元学习策略与教学辅助模型的教师-学生模型蒸馏机制(TSMDM),可实现从复杂教师模型(TMs)到轻量级学生模型(SMs)的高效、低损耗知识迁移。这能在保持高分类性能的同时,显著降低模型的计算成本与参数规模。此外,通过该机制衍生出的轻量级模型在处理具有复杂语义结构的长文本场景中,仍能保持稳定且高效的分类性能。
综上所述,相关研究通过多特征融合、方言特征学习、n-gram 优化以及文体度量特征,提升了文本分类性能,并通过知识蒸馏实现了模型轻量化。然而,现有方法在长距离信息捕捉、小样本泛化能力以及复杂与简单模型的适配方面仍存在不足。为在保证 ETC 模型准确率的同时降低其计算成本,本研究通过结合 CST 与 TSMDM 构建轻量级模型,以增强模型的泛化能力和计算效率。
访问受限。请登录或开始试用以查看此内容。
为了提高ETC在小样本和跨领域场景下的泛化能力,并实现轻量化模型,本研究提出了一种融合CST与TSMDM的文本分类框架。该框架的整体流程如图1所示。

图1:集成CST与TSMDM的四阶段轻量级英文文本分类框架可视化。该工作流程包含四个阶段。第一阶段利用基于BERT的动态嵌入对输入的英文文本进行文本表示。第二阶段通过构建文本图并计算实例级和分布级关系,应用图神经网络建模。第三阶段通过节点中心性重构和多层次原型生成框架建模语义涌现,以获得最终的类别原型。第四阶段进行两阶段元素蒸馏,其中先训练教师模型,再通过元蒸馏实现知识迁移,生成最终的学生模型。请点击此处查看该图的放大版本。
首先,在文本表示与动态嵌入阶段,利用 BERT 模型对输入文本进行动态嵌入,以捕捉上下文语义信息。第二阶段为分布感知的图神经网络(GNN)建模,该阶段考虑样本的分布特征,构建 GNN 模型,并通过实例层面与分布层面的双重信息交互来增强特征表示。第三阶段是基于混合系统理论引导的语义涌现建模,引入节点中心性重构和三级原型生成机制,以模拟语言系统的动态性与涌现性。最后,在第四阶段进行两级元蒸馏轻量化操作,通过辅助模型和元学习策略优化知识蒸馏过程,实现高效的模型压缩与加速。
基于分布特征和CST的ETC模型
模型架构概述
本文提出的文本分类模型首先采用预训练的BERT对输入文本进行动态上下文编码,生成语义丰富的词嵌入和全局表示。随后,从这些特征中构建实例图和分布图:实例图捕捉样本间的成对相似性,而分布图则建模整体数据分布;两图之间进行迭代的信息交互,实现个体特征与全局结构的协同增强。接着,引入CST对图网络进行深度增强。节点中心性重构采用PageRank量化词汇影响力,模拟语言网络中核心元素的主导作用。这是一种在复杂网络拓扑中衡量节点全局影响力的广泛验证方法,特别适用于捕捉语言系统中核心词汇节点的非对称语义扩散特性。三级“微观–中观–宏观”原型生成框架模拟了从局部语义到整体类别表示的涌现过程。最后,将增强后的特征表示输入分类器,输出最终的类别概率。
基于分布感知图神经网络的特征交互
为了优化文本分类(ETC)的泛化能力,并有效捕捉文本与样本分布特征(SDFs)之间的复杂语义关系,本研究构建了一种基于分布特征和CST的ETC模型。该模型通过融合图神经网络(GNN)和动态文本嵌入等机制,实现了对文本中全局与局部信息的深度挖掘。GNN是一种专门用于处理图结构数据的深度学习模型,其核心原理是采用消息传递机制(即图中每个节点聚合其邻接节点的特征信息),并结合自身状态进行更新。通过多轮迭代,逐步学习包含图拓扑结构的高维表示。这一过程使节点能够捕捉局部邻域乃至整个图的结构与特征依赖关系。为克服传统序列模型在建模长距离依赖和全局关系方面的局限性,本研究利用GNN来捕获样本间的复杂语义关联和结构关系。然而,由于GNN主要关注个体样本之间的直接关联信息,往往忽略了样本集的整体分布特性14,15,16。因此,本研究提出一种考虑SDF的GNN模型。该模型引入BERT实现动态文本嵌入,并结合原型网络计算样本间的特征差异。BERT是一种基于Transformer架构的预训练语言模型,其核心思想是通过双向编码器同时捕捉上下文中每个词的语义信息,并在大规模语料库上以“掩码语言模型”和“下一句预测”两项任务进行预训练。在掩码语言模型中,输入中的部分词语被随机遮蔽,模型需根据上下文预测原始词语;下一句预测则判断两个句子是否连续。经过预训练后,BERT可通过微调快速适应多种自然语言处理任务,显著提升性能,并为后续图结构构建提供高质量的特征表示。本研究构建的ETC模型具体结构如图2所示。

图 2:结合复杂系统理论并考虑样本分布特征的英文文本分类模型架构设计。 该图展示了结合复杂系统理论(CST)并考虑文本样本分布特征的英文文本分类模型的架构设计。该架构融合了基于 BERT 的动态上下文嵌入、分布感知图神经网络(GNN)以及 CST 增强机制,通过多模块协同建模,实现对英文文本中全局与局部语义信息的深度挖掘。请点击此处查看该图的放大版本。
在该模型中,对于一般数据集,输入到 BERT 模型中的英文文本通过分词器生成一个词元序列。序列构建方法如公式 (1) 所示。
[CLS],a1、a2、...an,[SEP] (1)
在公式(1)中,[CLS] 是位于序列起始位置的分类标记。BERT 在训练过程中会为 [CLS] 生成一个固定位置的隐藏状态,该状态直接用于表示整个文本的全局语义。a1, a2,...an 表示文本中的一个词或子词。[SEP] 是用于标记句子结束的分隔符。在 BERT 对上述序列进行处理后,可获得每个 token 的特征,从而为模型提供结构化的上下文信息。对于包含实体的特殊数据集,若采用传统的序列构建方法,实体所包含的位置信息将会丢失。因此,本研究采用公式(2)所示的方法构建序列。
(2)
在公式(2)中,[E1]、[/E1]、[E2] 和 [/E2] 是用于确定两个实体起始和结束位置的标记。类似地,在经过 Bert 处理后,这些标记的输出特征将携带相应实体的语义信息,从而更充分地利用实体位置的重要信息。随后,本研究采用考虑 SDF 的图神经网络(GNN)模型,以增强样本的分布特征和实例特征。模型结构如图3所示。

图3:分布感知图神经网络模型的双图特征交互架构。 该图展示了用于英文文本分类的分布感知图神经网络(GNN)模型的双图特征交互架构。该架构构建了一个点图以实现实例级别的相似性编码,同时构建一个分布图以实现分布级别的相似性编码,并通过两个图之间的迭代信息交互实现特征增强,从而完成实例特征与分布特征之间的跨层级信息循环。请点击此处查看该图的放大版本。
该模型通过两阶段交互机制实现特征增强。首先,从数据样本的实例级关联中解析分布特征,然后通过在分布层级上的信息交换动态优化实例特征。通过迭代地强化实例层级和分布层级的特征,最终完成分类任务。具体而言,模型利用点图和分布图实现信息交换。点图以文本样本特征向量(由 BERT 的最后两层更新)作为节点,通过专用编码网络(一个 Sigmoid 层 + 两个卷积批归一化层)量化样本特征差异以计算边权重,并采用最小-最大归一化将其归一化至 [0,1] 区间。设定 0.2 为经验性相似性阈值进行边阈值化处理,权重低于该阈值的边将被剪除,以消除较弱的实例级关联。分布图以融合后的文本分布特征作为节点,边权重基于分布特征向量的余弦相似性计算,并通过 L2 归一化进行标准化,以确保度量一致性。采用 0.15 作为边阈值,权重低于该值的边将被移除,而剩余的有效边权重进一步通过多层感知机进行映射与标准化,以增强分布层级关联的判别能力。本研究定义了第 l 层迭代的点图
,其中节点
表示样本特征,边
编码实例级相似性。分布图
中,节点
表示样本特征,边
编码分布级相似性。以第 l 轮到第 l+1 轮为例,实例级关系计算通过特征差异计算点相似性,如公式 (3) 所示。
(3)
在公式(3)中,
和
是点图在第 l 次和第 l-1 次迭代过程中节点 i 与 j 之间的边权重,用于反映样本特征的相似性。
是一个编码网络,用于将节点特征差异转换为边权重尺度,由一层 sigmoid 函数和两层卷积批归一化激活函数组成。当
和
为第 l-1 次迭代时,节点 i 和 j 的特征向量由 Bert 在最后两层中进行更新。随后,基于实例关系计算分布特征,如公式(4)所示。
(4)
在公式(4)中,
是第 l 层分布图中节点 i 的特征向量。MLP1 是由激活函数和全连接层组成的多层感知机,用于将拼接后的复合特征映射为新的分布特征。随后,基于分布特征计算分布关系,并由分布关系进一步计算实例特征,从而完成跨层级的信息循环。
复杂系统增强机制
为进一步提升泛化能力,本研究将复杂系统理论(CST)应用于上述模型。复杂系统的动态演化表现为节点影响力的异质性分布。为模拟核心词汇在语言系统语义传播中的主导作用,本研究引入节点中心性指标以重构信息传播机制。针对每个场景任务构建的点图 Hp 采用PageRank算法量化节点 C(hi) 的中心性,如公式(5)17所示。
(5)
在公式(5)中,α 为阻尼系数,α = 0.85。N(hi) 表示邻近节点的集合,L(hj) 为节点度。公式(5)取代了模拟语言网络中词汇影响的级联传播过程,使得核心词汇(如动词和主题词)获得更高的中心性。随后,节点中心性与边权重耦合,以动态调节节点间信息传播的强度。耦合函数 λij 如公式(6)所示。
(6)
在公式(6)中,σ 是 Sigmoid 激活函数,WT 是可学习的权重向量,b 表示偏置项。中心性与边权重的耦合动态地平衡了局部关系与全局重要性,从而增强了模型对任务中动态变化的适应能力。CST 的涌现表现为英语中整体语义超越局部词汇之和18。为了在 ETC 中利用这一特性,本研究设计了一个三级原型生成框架,以模拟从微观特征到宏观类别的涌现过程,如图 4所示。

图4:语言语义涌现的微观-介观-宏观三级原型生成框架的逐步构建。该图展示了用于模拟英文文本分类中语言语义涌现现象的微观-介观-宏观三级原型生成框架的逐步构建过程。该框架通过K均值聚类实现微观子类划分,基于分布相似性加权进行介观子类原型融合,并通过注意力机制实现宏观非线性整合,从而构建出层级化的文本类别表征,模拟语言系统中“整体大于部分之和”的涌现特性。请点击此处查看该图的放大版本。
上述过程从微观到宏观逐步构建文本类别表示,以提升模型的泛化能力。在微观层面,通过对每个文本类别的样本嵌入表示进行聚类,生成 K 个子类。采用 K 均值算法将类别内的样本划分为若干子组,并将每个子组的质心位置计算为子类原型19。在介观层面,计算各子类原型的分布相似性,生成相似性矩阵,然后根据相似性权重对子类原型进行重组,以量化子类之间的关联性。子类相似性权重 wij 的计算如公式(7)所示。
(7)
在公式(7)中,
表示 Jensen-Shannon 散度,用于衡量两个子类
和
20 之间分布的差异。最后,对子类原型进行加权融合,得到一组类别分布表示
。在宏观层面,通过注意力机制学习各个子类的重要性权重,并引入非线性变换以模拟类别的生成过程,从而得到最终的类别原型 cfinal ,如公式(8)所示。
(8)
在公式(8)中,αk 表示第 k 类的注意力权重。U 表示非线性变换权重矩阵。tanh(·) 用于增强非线性表示能力,并模拟复杂系统中“整体大于部分之和”的特性。每一层级通过子类结构捕捉类别内部的多样性,利用分布相似性加权以降低噪声子类的影响,并通过注意力机制动态聚焦于判别性特征,从而提升模型的泛化能力。CST 主要通过两种机制与 GNN 集成:第一种机制是引入节点中心性以重构信息传播过程,模拟语言系统中词汇影响力分布的异质性。节点中心性通过 PageRank 算法进行量化,并与边权重动态耦合,使核心词汇在语义传播中占据主导地位,增强模型对任务动态变化的适应能力。第二种机制是设计一个从微观子类聚类到宏观类别原型融合的三级原型生成框架,以模拟语言系统中“整体大于部分之和”的涌现特性。该框架通过分布相似性加权和注意力机制,实现从局部特征到全局语义的层次化整合。
综上所述,所构建的ETC模型的核心创新在于将复杂系统理论(CST)的思想深度融入图神经网络(GNN)的框架中。通过节点中心性重构信息传播机制,该模型模拟了语言系统中核心要素的主导作用,并增强了对任务动态的适应性。借助三级原型生成框架,模型实现了从局部特征到全局语义的涌现过程,从而提升了模型捕捉类别内部多样性与判别性特征的能力。该方法避免了传统GNN仅依赖实例级关系的局限性,通过分布级交互与复杂系统特性,为提升模型在少样本及跨域场景下的泛化能力提供了新的解决方案。
CST 的涌现特性对应于一个三级原型生成框架。在语言系统中,“整体大于部分之和”的原则表现为从局部词语意义到整体文本类别的语义跃迁。本研究通过“微观-中观-宏观”三级原型生成机制模拟这一过程:在微观层面,对样本嵌入进行聚类以形成子类原型;在中观层面,基于分布相似性对这些原型进行加权融合;在宏观层面,通过注意力机制非线性地合成最终类别原型。例如,在情感分类任务中,“disappointing”、“slow”和“expensive”等多个负面词汇非线性地融合转化,涌现出“负面评价”这一强烈的整体情感。CST 中的节点中心性与异质性对应于基于节点中心性重构的信息传播机制。在语言网络中,词语的影响分布不均,核心词(如动词、主题词)在语义传播中起主导作用。本研究采用 PageRank 算法量化节点中心性,并将其动态耦合至边权重,以调节节点间信息传播的强度。例如,在新闻分类任务中,“election”一词在政治类文本中具有高中心性,使得相邻节点如“vote”和“campaign”在信息聚合过程中获得更高权重,从而增强该主题的语义表征。CST 的动态性与自适应性对应于分布感知的图神经网络(GNN)以及元蒸馏框架内的教学实验机制。语言系统根据上下文和任务需求动态演化。模型通过分布感知的 GNN 捕捉数据集中整体分布的变化。同时,在 TSMDM 中引入由元学习驱动的教学实验机制,使目标任务模型(TM)能够根据源模型(SM)的反馈动态调整参数。例如,在跨领域情感分析中,模型可根据目标领域的数据分布快速调整特征权重,并在元蒸馏过程中优化 TM 的参数,以提升对新领域的适应效率。
基于TSMDM的轻量级文本分类模型
两阶段元蒸馏流程
为应对资源受限环境下计算成本高和部署困难的挑战,本文提出一种基于TSMDM的轻量级文本分类模型。该元蒸馏方法以严格的顺序分两个不同阶段执行蒸馏过程:仅在第一阶段训练完成并收敛后,才启动第二阶段:1)教师模型到教学助手(TA)的知识压缩阶段;2)结合元学习参数自适应的TA到学生模型(SM)的轻量化蒸馏阶段。该方法通过两阶段蒸馏实现从复杂的教师模型(TM)向轻量级学生模型(SM)的高效知识迁移,同时引入元学习机制,在蒸馏过程中动态优化知识迁移策略21,22。整体流程如图5所示。

图 5:基于两阶段元蒸馏机制的轻量级文本分类模型的流程设计。 该图展示了基于两阶段元蒸馏机制(TSMDM)的轻量级文本分类模型的流程设计。该流程包括一个教师模型(高复杂度知识源)、一个助教模型(中等复杂度的缓冲层)和一个学生模型(轻量级目标模型),并通过两个连续阶段实现高效的知识迁移:教师到助教的知识压缩阶段,以及结合元学习的助教到学生的轻量级蒸馏阶段。请点击此处查看此图的放大版本。
该方法包含三个角色:教师模型(TM)、中间模型(TA)和学生模型(SM),蒸馏过程分为两个阶段:教师-中间模型蒸馏和中间模型-学生模型蒸馏。在第一阶段的教师到中间模型知识压缩过程中,教师模型的知识首先被压缩至一个中等复杂度的中间模型(TA),以缓解直接蒸馏时因模型容量差距过大而导致的信息丢失。作为知识源的教师模型,将其输出的分类概率和中间层特征同时传递给中间模型。中间模型通过使其输出和特征表示与教师模型对齐来进行训练,采用结合了分类损失和特征对齐损失的复合损失函数21。在第二阶段的中间模型到学生模型的轻量化蒸馏中,当中间模型训练收敛后,知识进一步从中间模型蒸馏至最终的轻量化学生模型(SM)。该阶段同样采用双重监督(分类逻辑值和中间特征),并引入元学习机制:教师模型在辅助任务上进行“教学实验”,以评估学生模型的学习状态,并动态调整自身参数,从而提供更具适应性和针对性的指导。学生模型通过最小化相对于中间模型的输出差异和特征距离完成训练,从而在最大程度上实现参数压缩的同时保持分类性能22。
基于教学实验的元学习
在传统的知识蒸馏方法中,训练好的教师模型(TM)通过参与损失计算来指导学生模型(SM)。然而,参数固定的教师模型难以评估学生模型实际的学习状态,也无法量化其指导对学生模型参数更新的具体贡献23,24。因此,本研究将元学习思想引入蒸馏过程,使教师模型能够根据学生模型的学习反馈调整自身参数。蒸馏过程如图6所示。

图6:结合教学实验机制的元蒸馏迭代参数优化过程。 该图展示了结合教学实验机制的元蒸馏在英文文本分类模型轻量化中的迭代参数优化过程。该过程从学生模型生成一个临时的内层学习器,通过内层学习器的模拟训练表现来量化教学效果损失,并使教师模型通过该损失的反向传播调整自身参数,从而优化后续的知识迁移策略。请点击此处查看该图的放大版本。
在训练阶段,教师模型(TM)通过常规分类任务优化其参数,从而产生反映其原始性能的基础分类损失 LT。完成训练后,学生模型(SM)S 被复制,生成一个内部学习器的临时副本 S1。TM 在 S1 上进行教学实验,并将 S1 在该模拟训练中表现出的综合性能误差量化为损失 LQ。该信号作为反馈用于评估TM的教学效果。通过反向传播 LQ,TM 主动调整自身参数,优化其知识传递方式。完成元学习优化后,TM 对原始学生模型 S 进行正式的知识蒸馏,并同样使用模型损失 LS 作为对 TM 教学效果评估的反馈。为实现ETC模型的轻量化,本研究将考虑将SDF GNN模型作为TM引入教学实验流程中,如图7所示。

图 7:元蒸馏过程中教师模型优化的教学实验机制的参数更新流程。 该图展示了元蒸馏过程中用于教师模型优化的教学实验机制的参数更新流程。该流程首先使用均方误差损失函数计算内层学习器预测结果与教师模型预测结果之间的软损失,将软损失与硬标签误差结合形成总训练损失,并通过对加权总误差进行反向传播来更新教师模型的参数,从而提升其教学效果。 请点击此处查看该图的放大版本。
完成知识蒸馏训练后,学生模型(SM)首先计算教师模型(TM)预测结果与真实标签之间的差异。随后,使用均方误差(MSE)损失函数来度量学生模型预测(内部学习器 S1)与教师模型预测之间的距离。该距离值作为软损失25。最终的训练目标由硬标签误差与软损失的加权组合构成。通过反向传播加权后的总误差,更新教师模型的参数,从而提升教师模型的教学效果。内部学习器 S1 的参数计算如公式(9)所示。
(9)
在公式(9)中,
和
是内部学习者的参数,其初始参数受教学模型参数 γT 的影响。λ(学习率,λ = 0.005)控制元蒸馏过程中内部学习者(即 SM 的副本)的参数更新步长26。公式(9)通过反向传播计算损失梯度,而 λ 用于更新内部学习者的参数。该机制反映了 SM 的学习特性,使教学模型(TM)能够接收反馈并调整其教学策略,从而提高后续知识蒸馏的有效性。元学习中损失 LS 的计算如公式(10)所示。
(10)
在公式(10)中,B 是元学习样本序列。
通过损失设计与辅助模型优化知识迁移
为进一步提升知识蒸馏的有效性,本研究通过计算分类损失和特征损失来获得总体损失。其中,特征损失采用回溯机制,利用教师模型(TM)的浅层和当前特征输出来指导学生模型(SM),如公式(11)所示。
(11)
在公式(11)中,I 是特征层索引的集合。D 是用于计算两个特征表示之间差异的距离函数。
和
是教师模型(TM)和学生模型(SM)中的目标表示函数,它们将第 i 层和第 j 层的特征输出
与
转换为注意力矩阵。分类损失结合了学生模型输出与真实标签之间的交叉熵损失,以及两个模型输出之间的均方误差(MSE),后者作为软损失27,28。最终,通过加权整合这两项损失得到总体损失,以帮助学生模型更有效地从教师模型获得指导。为了在知识蒸馏过程中最小化性能损失,本研究在两个模型之间引入了助教模型,如 图8所示。

图8:以教学辅助模型作为中间缓冲层的两阶段知识蒸馏处理流程。该图展示了以教学辅助模型作为中间缓冲层的两阶段知识蒸馏处理流程。第一阶段融合特征损失和分类损失,构建总蒸馏损失,并利用教师模型的知识训练教学辅助模型;第二阶段采用相同的损失融合策略,将教学辅助模型的知识蒸馏至学生模型,从而减少因教师模型与学生模型之间复杂度差距过大而导致的信息损失。请点击此处查看该图的放大版本。
完成元蒸馏阶段后,教师-学生模型(TA模型)与目标模型(TM)进行传统的知识蒸馏。在此过程中,同步提取两者的特征,并计算相应的损失 La 。随后,该特征损失与模型的分类损失 LM1 融合,构成第一阶段的蒸馏损失函数
,如公式(12)所示。
(12)
在公式(12)中,β 是用于控制总损失中特征损失与分类损失比例的权重系数。
和
分别为教学辅助模型与 TM 中的客观表示函数,其将第 i 层与第 j 层的特征输出
与
转换为注意力矩阵。zT 与 zM 分别为 TM 与辅助模型的输出。从教学辅助模型到 SM 的蒸馏过程与上述过程相同,通过多次迭代最小化 SM 的损失,从而完成知识迁移。
综上所述,所提出的TSMDM的核心贡献在于通过元学习机制优化知识迁移过程。与传统蒸馏方法相比,该方法的核心优势在于其动态教学能力:教师模型(TM)能够根据学生模型(SM)的实时反馈,通过教学实验机制调整自身参数,从而提供更具针对性的指导。同时,引入教学助理模型作为缓冲层,有效弥合了教师模型与学生模型之间的复杂性差距,减少了知识迁移过程中的信息损失。这种“元学习优化教学策略”与“两级缓冲降低迁移难度”的协同设计,使得最终的学生模型在最大程度保留从复杂教师模型中蒸馏出的核心知识的同时,实现了显著的轻量化。
数据可用性
本研究期间生成和/或分析的数据集已提供在补充文件1中。
访问受限。请登录或开始试用以查看此内容。
实验设置与数据集:
为全面评估所提出模型在小样本跨域分类任务中的性能及轻量化效率,本研究在四个数据集上进行了实验:FewRel(小样本关系分类)、ARSC(跨域情感分析)、Reuters-21578(多主题新闻分类)和 ArXiv(长篇学术摘要)。FewRel 是一个广泛使用的小样本关系分类数据集,源自 Wikipedia,包含 100 个语义关系类别(例如“商业/公司创始人”和“地点/国家首都”),每个类别包含 700 条高质量句子。ARSC 用于评估模型在真实世界跨域场景下的表现,涵盖 Amazon 平台上 23 个产品类别(如“图书”、“DVD”、“厨房电器”)的用户评论,构成 69 个二分类情感分析任务(正面/负面)。Reuters-21578 是一个经典的多类别新闻文档分类数据集,包含 21,578 篇路透社新闻文章,标注于 90 个存在重叠的主题类别(经济、政治、体育等)之下。此外,本研究还通过 ArXiv 公共 API 收集了计算机科学领域的论文摘要,构建了一个长文本分类数据集,用于测试模型处理长文本序列的计算效率。各数据集的样本示例如 表 1 所...
访问受限。请登录或开始试用以查看此内容。
为了在少样本和跨领域场景下增强ETC的泛化能力,同时降低计算成本,本研究提出了一种结合CST与TSMDM的轻量级文本分类框架。将CST与TSMDM框架相结合,通过在模型设计中引入语言系统动力学和涌现语义特性,并实现高效的轻量化压缩知识迁移,从而解决了现有ETC方法的核心局限性(少样本/跨领域泛化能力差以及计算成本高)。这种设计上的协同效应是该模型在资源受限环境下性能优于传统方法的关键。
从理论上讲,将复杂系统理论(CST)引入文本分类超越了传统模型对局部语义或静态分布的依赖,为理解具有动态性和涌现性特征的语言这一复杂系统提供了新的计算建模视角31。在方法论上,所提出的分布感知图神经网络(GNN)与轻量级语义模型蒸馏框架(TSMDM)为少样本学习、跨域适应和模型压缩提供了一个协同优化的框架。实验结果表明,该模型在FewRel和ARSC等数据集上优于传统的GNN、BERT基线模型以及当前最先进的对比方法(表3),验证了其在少样本和跨域场景下的卓越泛化能力和效率。在FewRel的5类5样本任务中达到95.1...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者无任何致谢事项。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 中央处理器(CPU) | 商用硬件供应商(Intel、Dell、Lenovo) | Intel i5-7300HQ | 硬件规格 |
| 图形处理器(GPU) | 商业硬件供应商(NVIDIA,ASUS) | NVIDIA GeForce RTX 3060,12 GB VRAM | 硬件规格 |
| 随机存取存储器(RAM) | 商业硬件供应商 | 16 GB DDR4 | 硬件规格 |
| 固态硬盘(SSD) | 商业硬件供应商 | 1 TB NVMe 固态硬盘 | 硬件规格 |
| 操作系统 | 微软官方网站 | Windows 10(64 位) | 系统软件 |
| Python | Python 官方网站 (python.org) | Python 3.8 | 编程语言 |
| PyTorch | PyTorch 官方网站 (pytorch.org) | PyTorch 1.11.0 | 深度学习框架 &和核心文库 |
| CUDA | NVIDIA 官方网站 | CUDA 11.3 | 深度学习框架 &核心合集 |
| Hugging Face Transformers | Hugging Face Hub (huggingface.co) | 稳定版本(适配 Python 3.8/PyTorch 1.11.0) | 深度学习框架 &和核心文库 |
| NumPy | PyPI (pypi.org) | 稳定版本(适配 Python 3.8) | 数据处理 &和统计库 |
| Pandas | PyPI (pypi.org) | 稳定版本(适配 Python 3.8) | 数据处理 &和统计库 |
| Scikit-learn | PyPI (pypi.org) | 稳定版本(适配 Python 3.8) | 数据处理 &和统计库 |
| SciPy | PyPI (pypi.org) | 稳定版本(适配 Python 3.8) | 数据处理 &和统计库 |
| Matplotlib | PyPI (pypi.org) | 稳定版本(适配 Python 3.8) | 可视化库 |
| AdamW | PyTorch 内置 | 集成于 PyTorch 1.11.0 | 优化器 |
| BERT | Hugging Face Hub (huggingface.co) | BERT-base(bert-base-cased) | 预训练模型 |
| FewRel | FewRel 官方代码库(GitHub)/ 维基百科 | 100 个语义关系类别,每个类别 700 个句子;训练集/验证集/测试集划分(5:2:3) | 数据集 |
| ARSC | 公开的跨领域情感分析数据集(GitHub/ACL 文集) | 23 个亚马逊产品类别,69 项二元情感分析任务;训练集/验证集/测试集划分比例(4:2:3) | 数据集 |
| 路透社-21578 | 加州大学欧文分校机器学习知识库 / 路透社官方档案 | 21,578 篇新闻文章,90 个主题类别;ModApte 划分方法 | 数据集 |
| ArXiv | ArXiv 公共 API (arxiv.org) | 计算机科学论文摘要;训练/验证/测试集划分(7:2:1) | 数据集 |
| 分词器 | Hugging Face Hub (huggingface.co) | BERT-base-cased 分词器 | 其他必需工具 |
| Git | Git 官方网站 (git-scm.com) | 最新稳定版本 | 其他必需工具 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可