本方案介绍了一种可重复的、由人工智能驱动的工作流程,该流程对 BERT 模型进行微调以实现实体与关系抽取,采用图神经网络进行本体对齐,从非结构化数据中构建企业级知识图谱,并系统评估语义检索性能与决策支持效率。
研究文章
本方案介绍了一种可重复的、由人工智能驱动的工作流程,该流程对 BERT 模型进行微调以实现实体与关系抽取,采用图神经网络进行本体对齐,从非结构化数据中构建企业级知识图谱,并系统评估语义检索性能与决策支持效率。
大量非结构化组织数据可能导致企业知识管理(KM)系统难以提取正确且具有上下文相关性的信息,从而造成知识共享效率低下和决策延迟。本研究提出一种统一的人工智能驱动框架以克服这一局限。该框架结合图神经网络(GNN)用于本体对齐和语义推理,以及优化后的基于Transformer的双向编码器表示(BERT)用于特定领域实体与关系抽取。方法学流程包括:系统性数据收集、企业文本语料的预处理、微调BERT以识别实体和关系、将提取出的三元组转化为结构化知识图谱,以及基于GNN的本体对齐以确保异构知识源之间的语义一致性。为评估该框架在真实企业场景中的有效性,系统还集成了面向任务的评估指标,如检索准确率、本体对齐正确率和决策延迟时间。与基线方法相比,在两个行业应用中的实验验证显示,决策延迟减少了35%,知识检索准确率提高了21%。
此外,用户反馈表明,KM 界面通过其语义搜索和上下文标记功能提高了用户满意度。所提出的架构通过系统地融合基于图的推理与对齐方法以及基于深度学习的信息提取技术,实现了从非结构化企业数据中构建可重复的知识图谱。研究结果表明,当有组织的知识表示与组织流程相一致时,战略性和操作性的知识管理成效均得到提升。总体而言,所提出的方法提高了检索准确性,加快了决策工作流程的响应时间,并为企业级知识管理系统提供了一种切实可行且可扩展的解决方案。
由于数据存储库分散、组织平台多样以及知识碎片化地分布在非结构化文档中,有效的知识管理(KM)在数字化转型项目中往往难以实施。尽管早期研究已从组织和行业视角探讨了人工智能的采用与数字化转型,但鲜有研究提出一种可复现且具备技术可实施性的框架,用以系统性地提取、结构化、对齐并实现企业知识的可操作性1,2,3。当前的方法主要关注管理或战略层面的影响,但在支持规模化部署所需的架构细节方面仍显不足。先前研究表明,在分布式数字工作环境中,有效的知识传递不仅依赖于技术基础设施,还依赖于能够促进组织参与者之间协调、共享理解与持续协作的交互机制(Aman & Nicholson, 2009)。这进一步凸显了企业知识管理架构的必要性——其功能应超越信息提取,还需保留实现有意义知识交换所必需的上下文条件4。
传统的管理信息系统(MIS)和企业资源计划(ERP)系统主要处理结构化数据,并支持事务性报告,但无法处理非结构化文本或进行具有上下文感知能力的语义推理。相比之下,基于Transformer的模型(如BERT)能够实现从复杂文本语料库中提取上下文实体和关系抽取(RE)5,6。类似地,图神经网络(GNN)在多种不同领域中已被证明在关系推理、图表示学习和本体对齐方面具有强大能力7,8,9。尽管取得了这些进展,当前的研究通常单独使用这些模型,而未能将其整合到统一的企业知识管理(KM)流程中。
大数据分析、云计算、工业物联网以及先进的机器学习是近年来推动制造业、医疗保健、专业服务和治理等领域数字化转型的技术进步实例10,11,12,13。与此同时,国际政策框架高度重视人工智能的负责任应用,强调数字系统中的伦理一致性、问责制和透明度14,15,16。然而,在现有的知识管理(KM)系统中,伦理可解释性与技术鲁棒性很少被结合于单一架构之中。
例如,在环境、社会和治理(ESG)报告中,由人工智能驱动的决策可能忽略复杂的道德问题,而这些问题需要人类做出判断。过度依赖知识可能导致利用专业知识进行决策的能力下降17。由执业会计师(PAs)承担的咨询职能历来基于经济知识与客户互动,而自动化最终可能削弱这一职能18。这种情况可能造成干扰,因为旨在推动职业发展的工具可能无意中损害关键的人类能力。
尖端数字技术与对道德商业绩效及企业责任日益增强的关注相结合,促使人们提出“工业6.0”的概念,标志着工业发展的一个突破性阶段19。这一阶段在工业4.0和工业5.0的基础上演进而来,是技术发展的下一个阶段。工业6.0进一步拓展了这些理念,构想一个创新增强而非取代人类能力的时代20。该理念在倡导人类与机器人协作、提升综合效率的同时,回应了关于自动化的道德关切21。员工的数字素养(DL)在企业层面尤为重要,因为企业内部同事间的互动往往塑造个体对数字技术的掌握程度和理解水平。这一策略旨在与现有研究保持一致,即探索如何促进员工与新技术协同工作,以在企业中有效执行各类任务和操作22,23。由于数字素养能够帮助企业接触更广泛的客户群体,因此被视为中小企业生存的关键因素24。相较于传统企业结构,中小企业管理者通过利用技术进步,能够以更少的实体资产实现更高效的运营管理25,26。
在线广告能力的发展能够有效提升企业绩效,这取决于技术资源,例如技术进步以及与企业目标的结合27。然而,企业的电子化程度及其客户环境中的技术变革在这些影响中起到调节作用28。企业可通过将数字技术深度整合到其业务、产品、服务和战略中,更有效地利用信息技术进步与协同,从而提升其在线营销能力。
人工智能技术储备的两种机制为资本支出(capex)和运营成本。资本支出可用于大数据平台的组建、扩展与升级,以及信息科学与机器学习的发明方案;运营成本则用于组织内部人工智能与大数据工具的许可证授权,或最终用于员工的人工智能相关培训。29采用人工智能的企业,若同时应用其他技术并遵循内部研发活动,其收益更高。&D策略,根据Lee的30对人工智能资产行为进行审查。此外,关键在于决定是聘用外部机构人员,还是使用内部具备人工智能技能的员工31人力资源在这一培训领域中的地位是当前研究的主要焦点,研究结果表明,拥有内部人工智能知识的企业会投入资源培养此类人才,以获得超越竞争对手的优势32,33.
使用图神经网络(GNN)预测了蛋白质相互作用34,并利用大语言模型(LLM)验证了预测结果。该方法准确性很高,并提供了可解释的说明。诸如 BERT 等先进的机器学习与深度学习技术已被用于研究危机时期的大规模社交媒体数据35。循环神经网络(RNN)、卷积神经网络(CNN)和图卷积网络(GCN)有助于处理和分类海量数据,可用于肿瘤检测36。文献37,38,39,40提出了一种新颖的方法,通过将社交图谱与知识图谱结合到基于 GNN 的模型中,以增强推荐系统。
尽管人工智能和大数据分析已被公认为专业环境中的变革性力量,但以往的研究尚未充分探讨如何系统地整合基于Transformer的语义提取与基于图的推理,以提升知识管理的操作性和战略性功能。特别是,目前仍缺乏能够实现以下目标的成熟框架:(i)将非结构化的企业文本转化为语义对齐的知识图谱;(ii)确保跨远程数据源的本体层级一致性;(iii)对企业的决策支持效果进行统计评估。
为了弥补这一差距,本研究预测,与传统的基于ERP/MIS和关键词驱动的知识管理系统相比,将领域自适应的基于Transformer的信息抽取技术与基于图神经网络(GNN)的本体对齐和推理相结合,将显著提高语义检索的准确性,并降低企业决策延迟。本研究提出了一种可执行的、由人工智能与大数据分析驱动的知识管理框架,能够完成以下任务:利用微调后的Transformer模型进行领域特定的实体与关系抽取;基于抽取的三元组构建知识图谱;基于图神经网络的本体对齐与关系推理;以及通过检索精确率、对齐准确率和决策延迟等指标进行面向任务的评估。
所提出方法的新颖之处在于其双层知识管理(KM)对齐架构,该架构通过结构化知识整合,同时支持战略层面的知识管理,提升组织敏捷性和创新能力;并通过增强决策支持、流程优化和上下文检索,支持运营层面的知识管理。与以往的概念性研究或单一模型研究不同,本文提供了一种端到端且经实证验证的架构,并已在两个真实企业系统中实施。实验结果表明,决策延迟减少了35%,检索精度提高了21%。此外,通过将人工智能驱动的输出与语义组织的知识表示相连接,系统提升了可解释性,促进了透明且负责任的决策过程。本研究通过系统性融合基于Transformer的上下文编码与基于图的语义推理,构建了一个可扩展且可复用的范式,适用于符合工业6.0原则的先进数字化转型环境中的企业知识图谱构建与智能知识管理。
访问受限。请登录或开始试用以查看此内容。
伦理声明
本研究在数据收集前已通过马来西亚国民大学(The National University of Malaysia, UKM)机构审查委员会(IRB)的审查与批准(批准编号:UKM/FEP/2025/AI-047;批准日期:2025年3月12日)。获批的方案涵盖对人类参与者实施结构化问卷调查和半结构化访谈。所有参与者均被告知研究目的、参与的自愿性质以及随时无后果退出的权利,并在纳入研究前获得书面知情同意。研究严格维护参与者的匿名性和保密性,分析与发表过程中不包含任何可识别个人身份的信息,所有数据均安全存储,并仅用于符合机构伦理标准及相关国际人类受试者研究指南的学术研究目的。
所提出的 BERT–GNN 知识管理框架的整体架构
首先使用一个经过微调的 Transformer 编码器来处理非结构化文本,包括内部文档、客户交互内容以及社交媒体内容。基于 BERT–GNN 的知识管理流程的整体系统架构如图 1所示。本研究中使用的企业数据以数字文档格式收集,包括结构化调查文件、访谈记录、企业内部报告以及公开可用的案例研究文档。所有文档被整合为一个统一的语料库用于分析。从这些来源中提取文本内容,并进行清洗以去除无关的元数据、重复条目以及格式化残留物。清洗后的语料库被分割为句子,并通过词元化处理,为下游自然语言处理任务(如使用解析器进行文本提取、去噪、句子分割以及使用 WordPiece 分词器进行词元化)做好准备。该处理后的文本数据集作为微调模型的输入,用于实体和关系抽取34,该模型具有 12 层、12 个注意力头和 768 个隐藏单元。抽取的数据被组织成知识图谱,从而在企业领域本体映射中提供结构化且相互关联的知识表示。图神经网络(GNN)被应用于本体对齐,通过余弦相似度和推理机制,利用字符串相似度(阈值为 0.85)去除重复项,确保跨知识领域的语义关系被准确捕捉并进行逻辑推断。处理后的知识随后被用于决策层,支持高效的数据分析并促进数据驱动的决策过程。该架构将碎片化的数据转化为智能的、具有上下文感知能力的信息资产。该框架通过业务案例模拟进行验证,并与传统的知识管理系统(如朴素贝叶斯(NB)、支持向量机(SVM)、随机森林(RF)、TF-IDF、LDA、仅使用 BERT 以及 BERT 与知识图谱结合的方法)进行基准对比,数据集划分为 70:15:15,固定随机种子为 42,以评估在检索准确率、决策延迟和知识效用方面的性能提升。

图1:基于BERT-GNN的知识管理流程总体系统架构。 整体AI–BDA–GNN系统架构,展示多源数据摄入、预处理、基于微调BERT的语义信息提取、知识图谱构建、基于图神经网络(GNN)的本体对齐与推理,以及决策层。箭头表示数据流,以及用于在线学习的可选反馈回路。请点击此处查看该图的放大版本。
数据采集
本研究使用的数据集来自多个来源,以确保数据的代表性和外部有效性。主要数据通过结构化调查问卷和半结构化访谈收集,受访者包括来自信息技术、制造业、医疗保健和教育领域的从业者,以及罗马尼亚注册财务审计师协会的认证会员。次要数据包括匿名的企业内部文件、年度报告以及公开的数字化转型案例研究。数据收集工作在明确界定的研究周期内完成,所有记录均根据机构伦理审查批准的要求进行匿名化处理,以保护机密性并确保合规性。
参与者的入选标准:为确保方法学的严谨性和代表性,参与者需根据明确的纳入与排除标准进行筛选。符合条件的参与者除需积极参与数字化转型、知识管理(KM)、人工智能、大数据分析或企业信息系统项目外,还必须在信息技术、制造业、医疗保健、教育、会计或相关企业环境中拥有至少三年的专业工作经验。在数据收集期间,持证专业人员必须保持有效的认证状态(例如罗马尼亚财务审计师协会的成员)。此外,参与者还需具备罗马尼亚语或英语的熟练能力,以准确理解调查和访谈材料,并根据经批准的机构审查委员会(IRB)协议提供知情同意。不符合以下条件者将被排除:相关经验少于三年、专业资格处于非活跃状态(如适用)、未直接参与企业层面的知识管理或决策过程、调查问卷应答不完整(缺失数据超过20%),或未通过数据质量筛查。此外,访谈记录中内容不够详尽或与知识管理技术无关的部分亦不纳入分析。上述标准确保了所选参与者样本具备专业性、行业代表性及分析上的可靠性。
罗马尼亚注册财务审计师协会(CAFR)的认证会员是数据收集的关键目标人群。研究团队设计了一份在线调查问卷,并通过 CAFR 的内部沟通渠道进行分发,以实现精准投放并提高回复率。为构建具有代表性的样本,研究人员审阅了 CAFR 的会员记录,并根据与研究相关的特征,从中选取了 250 名注册参与者。
调查工具结构:本研究采用结构化问卷,共包含24个题项,分为五个构念领域:组织敏捷性与运营效率(5个题项)、战略决策支持与创新能力(5个题项)、大数据分析对知识共享的影响(5个题项)、人工智能在知识管理中的应用(5个题项),以及用户感知的有效性与系统可用性(4个题项)。每个题项采用五点李克特量表评分,1表示“强烈不同意”,5表示“强烈同意”。该工具针对企业人工智能实施情境进行了调整,并基于先前已验证的知识管理与数字化转型量表修改而成。三位学术专家和两位企业专家进行了专家评审,以确认内容效度。为优化语言表达、评估清晰度并检验信度,研究还对20名从业者开展了预调研;所有构念的Cronbach's α值均高于0.80,表明具有良好的内部一致性。此外,还开展了半结构化访谈以补充问卷调查结果。访谈提纲涵盖五个主题领域:数字化转型经验、企业知识流动中的挑战、人工智能与大数据在决策中的整合、语义对齐的障碍,以及伦理治理问题。每次访谈均在获得知情同意后进行,持续约45至60分钟,全程录音并转录,用于定性分析。
为了评估所提出的BERT-GNN框架在数字化转型组织中知识管理(KM)方面的性能,研究从不同行业多个来源构建了一个大规模且多样化数据集。该数据集涵盖定量与定性两方面内容,以反映关于知识流动和组织变革的动态认知。结构化数据通过在线问卷从250多名专业人士处收集,问卷包含李克特量表(1–5分)条目,用于衡量人工智能(AI)与大数据分析(BDA)对知识共享、创新及业务敏捷性感知影响的程度。同时,通过半结构化访谈收集了30位领域专家的非结构化数据,获得超过12万字的访谈文本。此外,还收集了超过50份半结构化资料,包括企业年度报告和数字化战略文件,以提供企业级技术采纳模式的背景信息。另外,纳入了来自信息技术、制造业、医疗保健和教育行业的15个详细案例研究,以提供实际转型情境。出于隐私保护目的而匿名化的内部知识库文档(约200 MB)也被纳入数据集,以增强对运营知识资产的刻画。这一多源数据集为深度学习模型提供了强有力的训练与评估流程,同时捕捉了知识管理的战略与运营双重维度。表1展示了用于评估的样本总体。
| 组件 | 类型 | 来源 | 大小/体积 |
| 专业调查反馈 | 结构化 | 来自250多名专业人士的在线调查 | 约10,000条记录 |
| 访谈转录文本 | 非结构化 | 来自30位专家的半结构化访谈 | 约120,000词 |
| 企业报告 | 半结构化 | 年度报告及数字化战略文档 | 50余份文档 |
| 案例研究 | 混合型 | 特定行业的数字化转型应用案例 | 15个详细案例 |
| 知识库内容 | 非结构化 | 来自各组织的内部文档(已匿名化) | 约200 MB |
表1:用于评估的人群样本。提供样本量和抽样框架。
数据预处理与 BERT 微调
原始企业文档数据来自经过整理的列表,并通过句子分割、分词、停用词去除和归一化等预处理步骤进行处理,以满足分词器的要求。随后对预训练模型进行进一步调整,针对特定任务进行微调,并用于执行命名实体识别(NER)和关系抽取(RE)任务。该模型使用 Adam 优化器在预处理后的语料库数据上进行了特定轮次(epoch)的微调。最终,从识别出的实体及其关系中生成了上下文化的词嵌入(R768)。归一化实体通过基于本体的归一化技术生成,其中不同的实体(如同义词)被转换为统一的标准化形式。在知识图谱表示中,每个唯一的归一化实体作为一个节点,而实体之间的关系称为边。模型生成的归一化实体嵌入构成了图神经网络的初始节点特征。接下来,采用负采样(通过边破坏获得)的监督式链路预测方法对图神经网络进行训练。训练过程中,在多个训练轮次上计算交叉熵损失。通过知识检索准确率、决策延迟时间和用户满意度作为评估指标,对训练完成的框架进行了评估。
采用混合标注方法为关系抽取(RE)和命名实体识别(NER)创建训练标签。两位独立的领域专家使用预定义的本体模式,对包含内部报告、客户交互日志和政策文件等企业文档的领域特定语料库进行人工标注,该本体模式定义了实体类别(如组织、流程、技术、角色、关键绩效指标)以及关系类型(如支持、依赖于、改善)。为确保关系方向性和实体边界检测的一致性,制定了详细的标注指南。为评估标注可靠性,对20%的数据集进行了双重标注。采用Cohen's Kappa系数检验标注者间一致性,结果显示一致性较高(实体标注κ = 0.87,关系抽取κ = 0.82)。随后采用弱监督方法,通过基于规则和受本体约束的模式匹配,扩展人工标注的数据集,并结合基于置信度的过滤以降低噪声。为确保完全可重复性,所有标注流程、本体定义、数据集划分及随机种子均被完整记录。
在文档级别上测量了精确效率,基于端到端查询响应时间估计了延迟,并通过李克特量表问卷评估了用户满意度。在每个阶段结束时,建立了以下协议检查点:(i)BERT 输出检查点——提取的样本实体和关系三元组;(ii)知识图谱检查点——带有本体标签的构建子图样本;(iii)图神经网络检查点——本体预测结果和推断链接的样本;(iv)检索检查点——带有相关性标签的检索知识项样本。
本方案采用如下结构:确定性的多阶段流程,具有明确定义的中间输出,可实现完全的可重复性。步骤1:在完成原始结构化、半结构化和非结构化企业数据的摄取与预处理后,将生成经过清洗的文本语料库和标准化的数值特征矩阵。步骤2:应用经过微调的BERT模型进行知识抽取,输出明确的结果,包括命名实体(如部门、流程、文档和关键绩效指标);(ii)实体之间的语义关系,以主语-谓语-宾语三元组形式表示。在步骤3中,这些三元组被转换为初始知识图谱,其中节点表示实体,关系表示带有类型的边,并与预定义的本体模式对齐。步骤4中,应用图神经网络对该图谱进行本体对齐与推理,生成优化的节点嵌入,推断隐含关系,并对齐本体标签。步骤5输出最终的知识图谱及推理结果,用于支持语义检索、决策支持和绩效评估。
本方案的每个阶段均会明确生成所有中间产物,包括实体列表、关系三元组、本体对齐图谱以及推断出的关联,从而实现研究的独立可重复性,无需额外提示。
数据集按照固定的 70:15:15 比例划分为训练集、验证集和测试集,以确保实验结果的可重复性。在文本预处理方面,针对 BERT 模型进行了分词、转为小写、去除停用词以及将序列截断至 512 个词元的操作。另一方面,结构特征则采用 Z-Score 标准化方法进行归一化处理。此外,使用深度学习框架库对 BERT 模型进行微调,优化器为 Adam,学习率为 2e-5,批量大小为 16,训练轮数为 5。预测提取出的实体和关系以标准格式保存,用于知识图谱的构建。另外,知识图谱的节点嵌入(R768)被用作图神经网络(GNN)的输入,以实现本体对齐与推理。
BERT-GNN 接口与数据流
在所提出的框架中,Transformer 编码器经过微调以执行两项自然语言处理任务:在企业文本语料库上进行命名实体识别(NER)任务和关系抽取(RE)任务。最终,模型输出包括上下文化词元嵌入(R768)、实体分类标签以及主语-谓语-宾语形式的关系三元组。通过构建预定义的企业本体,对实体的文本变体和同义词进行映射,从而实现实体的归一化处理,并为每个唯一归一化实体在构建的知识图谱中分配一个新的实体节点。根据行业语料库的规模,所生成的知识图谱在评估的企业场景中包含 18,000 至 25,000 个实体节点以及 42,000 至 60,000 条带有类型的关系边。图中包含的节点类型包括人员(Person)、部门(Department)、流程(Process)、产品(Product)、组织(Organization)和文档(Document)等。其他边类型包括 works_for(任职于)、manages(管理)、belongs_to(隶属于)、produces(生产)、approved_by(由……批准)和 related_to(与……相关)。每个节点都被赋予一个源自预定义企业本体的唯一基于本体的标识符。因此,所得到的异构图包含表示归一化关系的带类型边和具有语义嵌入特性的带类型节点。随后,图神经网络(GNN)利用这些节点嵌入进行关系推理和本体对齐。关键的是,GNN 在生成的图上运行时不会将梯度反向传播至 BERT 编码器,从而确保模块化训练,并保持图推理与语义提取组件之间的分离。
本研究使用 BERT 进行上下文语言建模和语义特征提取。当使用针对特定分类目标定制的标注数据进行微调时,该模型能够高效地学习预测新文本输入的正确类别标签。由于 BERT 是双向的,它会同时考虑每个词的前后上下文,从而更全面地理解文本内部的关系。BERT-base 模型的编码器由 12 个 Transformer 模块组成,每个模块包含 12 个自注意力头,隐藏层大小为 768。在处理之前,输入文本会根据所选的分词方法被划分为词元,这些词元可能代表完整词或子词。使用 BERT 得到的序列表示详见补充文件 1。模型参数通过最小化正确标签的对数概率进行优化(图 2)。

图 2:用于提取语义特征的 BERT 模型详细工作流程。展示了输入/输出维度以及上下文嵌入在知识图谱构建中的作用。请点击此处查看此图的放大版本。
使用图神经网络构建知识图谱
在构建知识图谱之前,其模式已被预先定义,以提供语义一致性。本体也预先定义了实体类型和关系类型的有限集合,并包含领域范围约束,有助于推理。该模式适用于从 BERT 模型提取的三元组填充图谱,也适用于图神经网络中的关系感知消息传递。
在此框架中,知识图谱(KG)作为企业知识的结构化表示,用于建模实体(如部门、文档、流程)及其之间的语义关系。KG 的数学推导见补充文件 1。KG 构建与基于图神经网络(GNN)的推理相结合,可在企业知识管理(KM)框架内实现本体对齐、关系推断以及增强的语义检索。
知识图谱(KG)被表示为一个异质图 G,其结构由本体 O 表达。KG 也可以被视为由谓词推理断言所表达的一组事实。这些基本要素具有如下描述35。图 G 是多样化的,其中 V 代表对象或节点的集合(两者可互换使用),
代表关系的集合。三元组 (
) 也可用于分别刻画两个对象 v1 和
及其关联
。使用图神经网络(GNN)构建 KG 的数学推导见补充文件 1。
基于 BERT-GNN 的本体对齐与推理
算法 1 展示了基于图神经网络(GNN)的本体对齐与推理过程。该过程首先利用预提取的嵌入向量以及通过高质量调优的 BERT 版本生成的嵌入向量来初始化节点表征能力,这些嵌入向量能够捕捉非结构化文本中每个实体的语义含义。知识图谱由节点(实体)和边(关系)构成,使用邻接矩阵(A)和特征矩阵(X)进行表示。
该规则集通过多个图神经网络(GNN)层依次进行。在每一层中,节点的表示通过聚合其相邻节点的信息进行更新,并根据节点间的连接性进行加权(即利用邻接矩阵)。这一过程在数学上通过消息传递方法进行建模:节点嵌入通过可训练的权重矩阵进行扩展,并经由非线性激活函数(如 ReLU)传递。归一化步骤(例如层归一化,或如图卷积网络(GCN)方程中使用度矩阵的方法)确保了跨层学习过程的稳定性。
在对预定义层数范围 T 重复此过程后,模型生成最终的节点嵌入集合 Z,该集合编码了每个邻域及其结构和语义特征。随后,这些嵌入通过一个 Softmax 分类层进行处理,以预测对齐的本体标签,包括实体类型(例如,“部门”、“产品”、“项目”)或企业内部的语义角色。
算法 1:基于 BERT GNN 的本体对齐与推理
基于 GNN 的本体对齐与推理过程作用于构建的知识图谱,该知识图谱由表示为节点的实体及其表示为边的关系构成。初始节点表示来源于基于 BERT 的语义嵌入,并组织为特征矩阵。邻接矩阵表示图的连接结构,并应用预定义层数的 GNN 层以优化节点表示。在每一层中,模型根据图结构,通过聚合邻居节点的信息来更新每个节点。公式(1)中的聚合过程包括将邻居节点的表示与可训练权重矩阵相乘,加入偏置项,并应用非线性激活函数。
(1)
每次层更新后,应用归一化以稳定训练过程并确保嵌入尺度的一致性。当所有层处理完毕后,获得最终的节点嵌入。这些嵌入随后通过一个带有softmax函数的分类层,以预测对齐的本体标签或实体类别。该过程输出最终优化的节点嵌入以及预测的本体对齐标签。
该方法能够实现多源实体的语义对齐,并通过推断新关系及对先前未标记的节点进行分类,支持对知识图谱的推理。

图 3:使用图神经网络(GNN)进行本体对齐与语义推理。图示邻域消息传递与嵌入更新步骤。请点击此处查看此图的放大版本。
图 3 展示了一个图神经网络(GNN)系统,该系统用于知识图谱中的本体对齐和实体样式内部处理,特别是在利用人工智能推动知识组织以实现企业数字化重塑的背景下。该过程始于由经过微调的 BERT 模型生成的输入特征,该模型为图中的每个实体(包括文档、部门或业务单元)生成上下文嵌入。这些实体以图结构中的节点(v1、v2、v3)表示,边则表示它们之间的语义或关系连接。编号为二的节点(v2)通过一种称为邻域聚合的过程,整合其相邻节点(v1 和 v3)的数据,从而获取上下文统计信息。
通过使用特定关系的权重矩阵和非线性激活函数(例如 ReLU),对聚合的特征进行变换,生成更新后的节点嵌入,这些嵌入整合了来自 BERT 的语义特征和图结构中的结构信息。随后,这些嵌入被传递到 softmax 分类层,以预测实体标签或对齐的本体类别。这一成熟的过程使得图神经网络(GNN)在推理“方法知识图谱”方面极为有效,有助于完成实体消歧、关系推断和语义类型识别等任务,最终推动更智能的、由人工智能驱动的数据管理系统的构建(Table 2)。
| 组件 | 描述 |
| 框架/工具包 | Python 3.9, PyTorch 2.0.1, Hugging Face Transformers 4.34, DGL 1.1 (Deep Graph Library) |
| 硬件 | NVIDIA Tesla V100 GPU (16GB), 128GB RAM, Ubuntu 20.04 |
| 预处理流程 | 分词(BERT 的 Word Piece)、停用词去除、实体识别(SpaCy)、数值特征的 z-score 标准化 |
| 数据集来源 | 专业调查(250 多份回复)、访谈转录文本(约 120,000 词)、企业报告(50 多份)、案例研究(15 项)、内部文档(200MB) |
| 数据划分 | 70% 训练集,15% 验证集,15% 测试集 |
| 文本编码器模型 | BERT base(不区分大小写),12 层,768 隐藏层维度,12 个注意力头 |
| BERT 微调参数 | 4 个训练轮次,批量大小 = 32,学习率 = 2e-5,Adam 优化器,最大序列长度 = 512 |
| 图谱构建 | 基于三元组的知识提取(主语、谓语、宾语) |
| 图谱类型 | 具有多关系边的异质图(实体来源于 BERT 输出) |
| GNN 架构 | 2 层异质图神经网络(消息传递模型) |
| GNN 超参数 | 隐藏层维度 = 128,激活函数 = ReLU,优化器 = Adam,学习率 = 0.001 |
| 解码器类型 | Dist. Mult,使用点积评分进行链接预测 |
| 损失函数 | 用于三元组分类的二元交叉熵损失函数 |
表2:BERT模型的配置细节。总结了用于语义提取的训练设置。
最后,本方案生成以下输出结果:一个与本体对齐的企业知识图谱、BERT 模型和 GNN 模型、信息检索与推理的结果,以及 KRP、OAA、DML 和 USR 的报告。这些成果以可重复的形式提供最终输出。在 GNN 训练过程中的负采样阶段,根据本体定义的类型约束,通过替换实体来破坏有效的三元组。所得到的本体对齐结果会经过一致性验证,并由领域专家进行人工审查,以确保提取出的实体与规范本体类别之间的语义连贯性。
评估标准
决策延迟是指系统在用户提交查询后提供可执行响应所花费的总时间。设 i 为用户查询,
为查询提交的时刻,
为系统提供最终决策输出的时刻。决策延迟(DML)由下式给出:
(2)
其中为评估查询的总数。该指标用于衡量所提出框架从知识检索到响应生成的整体响应时间。该指标的值越低越好,因为这表明系统响应时间更短,对于时间敏感的企业决策应用至关重要。
知识覆盖率是指系统针对特定查询检索出所有相关知识项的能力的比率。设查询 q 的所有相关知识项集合为,系统实际检索出的知识项集合为。知识覆盖率(KCR)定义如下:
(3)
该公式用于计算所检索知识项的完整性,相当于传统信息检索系统中使用的召回率指标。
访问受限。请登录或开始试用以查看此内容。
数据预处理与 BERT 微调
所提出的设备集成了一个经过最优调参的 BERT 版本,用于非结构化理解信息的提取,以及一个图神经网络(GNN),用于在理解图框架内进行本体对齐和推理。实验设置重点比较了 BERT 模块在命名实体识别(NER)和关系抽取(RE)任务上的整体性能,同时对 GNN 模块在所构建的理解图上的链接预测和节点分类任务中进行了评估。
命名实体识别(NER)任务和关系抽取(RE)任务的F1分数如表3所示。为避免数据泄露,所有报告的数值仅反映在独立保留的测试集上的性能表现,该测试集与训练集和验证集严格按照70:15:15的比例进行划分。在独立保留的测试集上,所提出的BERT–GNN架构在RE和NER任务中表现最佳。基于图的本体对齐方法相较于仅使用上下文Transformer建模的方法带来了可量化的提升,其相对于BERT基线模型的改进具有统计学显著性(p < 0.01)。通过五次独立训练实验中较低的标准差值可看出模型训练稳定性良好,而较窄的置信区间则表明模型具有较强的泛化能...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种统一的企业级知识管理框架,该框架通过BERT实现上下文语义提取,并结合基于图的关系推理与利用图神经网络(GNN)的本体对齐。为了实现实体链接、跨文档推理以及在不同业务数据源之间连贯的知识表示,本研究的主要贡献在于将深度上下文语言建模与结构化、本体感知的推理集成于单一处理流程中3,5。通过解决现有方法的局限性——例如规则系统在可扩展性和歧义性方面的不足、仅使用Transformer的模型产生的扁平化输出,以及仅依赖图的方法对预结构化数据的依赖——所提出的框架提升了科学性。该方法通过融合基于BERT的语义提取与基于GNN的推理,实现了持续的本体对齐、有序的跨源推理以及可扩展的语义检索6,7。通过超越独立的提取或推理模块,这种集成有助于构建更为复杂且具备推理能力的企业级知识系统。
本研究存在若干限制。由于该框架依赖于...
访问受限。请登录或开始试用以查看此内容。
作者衷心感谢马来西亚班吉马来亚国立大学经济与管理学院提供的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BERT-Base (Uncased) 预训练模型 | Google AI | N/A | 基于 Transformer 的预训练语言模型(bert-base-uncased 变体) |
| Deep Graph Library (DGL) | AWS Labs | RRID: SCR_017054 | 用于图神经网络建模的 2.1 版本 |
| Matplotlib 可视化库 | PyData 社区 | RRID: SCR_008624 | 用于性能图表绘制与可视化分析 |
| NetworkX 图分析库 | PyPI 社区 | RRID: SCR_005317 | 用于图结构构建与分析的 3.2 版本 |
| NumPy 数值计算库 | PyData 社区 | RRID: SCR_008633 | 用于数值运算与数组处理 |
| NVIDIA GPU (Tesla T4 / RTX 3080) | NVIDIA Corporation | RRID: SCR_016409 | 支持 CUDA 的硬件加速器,用于模型训练 |
| Pandas 数据分析库 | PyData 社区 | RRID: SCR_018214 | 用于结构化数据操作 |
| Python 编程语言 | Python 软件基金会 | RRID: SCR_008394 | 用于模型开发与数据处理的 3.10 版本 |
| PyTorch 深度学习框架 | Meta AI | RRID: SCR_018536 | 用于神经网络实现的 2.0 版本 |
| Scikit-learn 机器学习库 | Scikit-learn 开发者团队 | RRID: SCR_002577 | 用于预处理与评估指标计算的 1.5 版本 |
| Transformers 自然语言处理库 | Hugging Face | RRID: SCR_020989 | 用于预训练 Transformer 模型的 4.40 版本 |
| Ubuntu Linux 操作系统 | Canonical Ltd. | RRID: SCR_018317 | 20.04 LTS 版本运行环境 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可