2025年6月13日
本文介绍了RUGGED(基于图引导可解释疾病区分的检索),该方法将大语言模型(LLM)推理与检索增强生成(RAG)相结合。它从专家整理的生物医学知识库和同行评审的生物医学出版物中提取证据,利用最新信息综合新知识,识别具有可解释性和可操作性的预测结果,并确定假设驱动研究的潜在方向。
本方案提供了一个可靠的研究平台,可用于探索生物医学和临床问题,并进行假设生成。Rugged 通过利用大语言模型,将其与同行评审的出版物和经过 curated 的生物医学知识库相连接,并结合可解释的人工智能技术,帮助探索生物医学领域的复杂图景,揭示新的关联关系。近年来,生成式人工智能和大语言模型的进展已彻底改变了我们使用循证生物医学资源的方式,使摘要生成、问答以及灵活的假设探索等任务成为可能。早期的方法依赖文本挖掘技术,从生物医学文献中提取模式和高层次的关系。如今,研究方法正将大语言模型与检索增强生成(retrieval-augmented generation)、智能体系统(agentic systems)以及工具调用能力相结合。许多公开可用的语言模型在可靠性方面仍存在不足,可能生成事实错误的信息。尽管近期模型已有改进,但其在发表时的输出往往缺乏领域特异性,依赖模糊的通用语言,并产生冗长且碎片化的解释。在我们此前与 JoVE 发表的研究中,我们阐述了如何应用文本挖掘和生物医学知识图谱建模来预测和理解蛋白质、细胞组分与心血管疾病之间的关系。在此基础上,我们最新的研究聚焦于将结构化的生物医学知识与大语言模型支持的工作流程相整合,从而实现准确的推理和基于证据的响应。
[旁白] 首先,在终端中使用命令启动 Rugged 服务。提取生物医学文献并利用 caseOLAP LIFT 识别相关文档以及高层次的蛋白质-疾病关系。访问 caseOLAP LIFT JoVE 实验方案,执行 caseOLAP LIFT 文本挖掘分析。接下来,在终端中克隆 Know2BIO 代码仓库。通过命令行执行 create_edge_files.py 脚本,以下载知识库资源并监控提取流程的进度。然后,使用 prepare_kgs.py 脚本构建知识图谱。整合 combine_kg_results.py 脚本的输出结果,将文本挖掘分析和知识图谱构建中提取的关系与实体合并为一个综合图谱。通过审阅知识图谱,识别感兴趣的生物医学实体,并选择相关节点用于预测分析。使用 filter.py 脚本提取从选定的目标疾病节点出发、两跳范围内可达的子图,并运行相应命令。通过在命令行参数中指定待预测的边和输入知识图谱,运行预测分析脚本并获取输出结果。现在,连接到 Rugged Docker 容器。如果之前的终端窗口已关闭,请重新连接至该 Docker 容器。连接成功后,在命令行中使用 cd workspace/Rugged 命令进入 Rugged 目录,并在该命令行窗口中完成所有后续步骤。在确认所有支持服务均已运行后,于命令行界面启动 Rugged,开始与系统交互。为查询知识图谱,使用以关键词“query”开头的自然语言提问。例如,输入“query what are the currently prescribed drugs classified as beta blockers?”(查询当前被归类为β受体阻滞剂的处方药有哪些?)。使用以关键词“predict”开头的问题探索链路预测分析的结果。然后,使用关键词“search”以自然语言检索步骤二中与特定生物医学主题相关的文献。在同一终端窗口中,利用 Rugged 类似聊天的界面迭代优化查询请求。可选地,可在 Neo4j 中重新运行或修改 cypher 命令,以进一步优化知识图谱的查询结果。最后,使用关键词“summarize”对整个交互过程进行总结,生成可供后续审阅的文本摘要,并开展人工参与的审阅,以提升系统响应的可读性与准确性,再最终确定摘要内容。最后,检查 Rugged 的 log 文件夹中的聊天日志,查看完整交互文本。使用 Know2BIO 构建的知识图谱包含 219,450 个节点和 6,323,257 条边。Rugged 系统采用 BART 模型对知识图谱和出版物数据进行嵌入以支持向量检索,对于长度超过 500 个 token 的出版物,按章节进行分段摘要。
本文介绍了RUGGED(基于图引导可解释疾病区分的检索,Retrieval Under Graph-Guided Explainable disease Distinction),该平台将大语言模型推理与检索增强生成技术相结合,旨在从生物医学文献和知识库中综合新知识,以促进假设生成及生物医学问题的探索。
将可解释的人工智能与检索增强生成相结合,能够帮助生物制药团队在庞大的生物医学知识库中综合并验证证据,从而减少早期发现阶段的不确定性。RUGGED 工作流程通过将假设探索建立在经过 curated 的文献和结构化知识图谱基础上,提升了预测的可信度。该方法通过简化可操作的药物-疾病关系的识别过程,支持基于风险调整的投资组合决策。
RUGGED 平台通过将基于证据的知识整合嵌入研发全过程,在早期发现、靶点验证和转化研究之间架起桥梁。