2024年12月6日
在本方案中,通过使用经同行评审的领域特定科学文献,经由向量嵌入机制增强,从而提升基础大语言模型的响应质量。此外,还提供了代码以辅助在不同大语言模型之间进行性能比较。
我们的研究聚焦于机器学习和大语言模型在癌症诊疗中的多种应用。这包括改善患者的直接诊疗服务,以及解决排班和文档记录等运营方面的挑战。我们最终旨在回答这样一个问题:这些技术如何能够使患者、医疗服务提供者和研究人员的医疗保健服务变得更优?
大型语言模型已经开始改变科研格局。以往难以实现的自然语言处理任务如今对更多研究者变得可行,从而推动了涉及非结构化数据的众多新研究方向。一个主要挑战在于大型语言模型工具与基础设施的快速演变。
许多临床医生和研究人员可能对应用程序有构想,但目前缺乏实施所需的背景知识或技术知识,或未能深入考虑不同方法之间的权衡。首先,在计算机上安装 Git、Python 和 PIP,并在终端中运行命令以验证安装。然后运行 git clone 命令下载代码仓库,并安装所需的依赖项。
要创建向量数据库,请编辑 config.py 文件,将以下变量的值替换为包含用于增强大语言模型的文档的文件夹路径。然后将更新后的文件保存到 articles 目录中。
接下来,在同一目录下的终端中,使用 Python 3 的 build index 命令执行代码,以创建并持久化数据库。验证数据库是否已保存在向量数据库文件夹中。为查询增强后的 LLM,执行 Python 3 run augmented llm 命令。
在终端中输入 py 命令。测试用户查询,以接收由文档集数据增强的响应。完成后按 Control + C 退出。
要创建选择题,请编辑 questions.py 文件,并参考示例的格式。按照类似的格式添加题目,然后保存文件。
要编辑 config. pi 文件,请添加用于 Open AI 或 Hugging Face 的 API 密钥,如果目标是针对任一提供商的模型进行基准测试。
现在保存文件。然后编辑 compare llms.py 文件,并选择要测试的一组模型。
取消注释需对比的模型后,最后在终端中使用 compare llms 命令执行代码,执行完成后,在指定文件夹中查看模型响应,以进行评分或其他审查。在测试的多项选择题中,embed 模型的表现显著优于基础模型,增强的 open AI 模型亦如此。
本方案通过向量嵌入机制整合同行评审的科学文章,以提升大语言模型响应的质量。同时提供了用于比较多种大语言模型性能的代码。
将向量嵌入与大语言模型(LLMs)相结合,可实现生物制药领域的研究&D团队可快速将最新的领域特定科学文献整合到由人工智能驱动的工作流程中。该方法解决了在快速发展的生物医学领域中静态模型语料库所带来的挑战,支持在发现阶段实现更具响应性和上下文感知能力的决策。基于嵌入的增强技术提升了整个研究项目中的预测置信度与操作灵活性。
嵌入增强型大语言模型通过在每个关键节点实现动态文献检索、基准测试和知识整合,融入了从发现到临床前研究的连续过程。