2025年8月19日
基于质谱的蛋白质组学数据可从开放数据库中获取,并可通过免费工具进行访问。鉴于数据库搜索和描述的复杂性,许多生物学家缺乏利用这些数据集的知识。本文提供了一份使用免费工具进行基本蛋白质组学数据搜索的指南。
我们的工作为生物学家提供了使用免费工具分析复杂蛋白质组学数据的指南。我们的目标是帮助他们验证研究结果并探索公共数据集。由于缺乏明确的指导,许多生物学家无法利用公共蛋白质组数据。
我们的研究填补了这一空白,能够在无需开展任何新的野生动物实验的情况下进行验证。我们的工作采用了免费的、最先进的软件,且不受供应商限制。与许多传统工具相比,这些工具速度更快、灵敏度更高,并能提供更精确的蛋白质组学发现。
首先,从 UniProt 数据库下载参考蛋白质组 FASTA 文件。点击“添加 FASTA”按钮,将参考蛋白质组文件加载到 DIA-NN 软件中。在前体离子生成部分,选择两个选项:用于无谱库搜索谱库生成的 FASTA 消解,以及基于深度学习的质谱图、保留时间(RTs)和离子淌度(IMs)预测。
然后,单击运行按钮以生成预测的谱图库。在前体离子生成部分取消选中两个选项。在输入部分,单击与文件格式对应的类型按钮以加载DIA数据。
现在,在算法部分将质量和 MS1 准确度均设置为零 ppm。根据实验设置,在前体离子生成部分调整前体离子和碎片离子的质量范围设置。其他软件设置保持不变。
接下来,单击运行按钮。等待操作界面显示“已完成”,表示分析结束。安装后,单击 bin 文件夹中的 frag pipe 图标。
导航至配置选项卡以查看所有相关设置。检查您的系统上是否已安装 MSFragger、IonQuant、diaTracer、DIA-NN 和 Python 模块。如果缺少任何模块,请点击下载更新或下载按钮以获取相应模块。
现在,切换到工作流选项卡。从工作流下拉菜单中选择默认选项,然后点击加载工作流。接着,点击添加文件以输入文件路径。
在“分配文件”下指定实验名称和生物学重复编号,或留空。接下来,单击数据库选项卡以切换至该选项卡。从磁盘加载一个FASTA文件,或下载与样本物种对应的FASTA文件。
下载时,为简单运行请选择“仅限已审核序列”、“添加诱饵库”和“添加常见污染物”选项。点击 MSFragger 标签以切换视图,选择“封闭搜索默认配置”并点击加载。
在峰匹配设置下,保留所有默认值。在校准和优化步骤中,选择“无”以减少处理时间。对于蛋白质消化,根据实验需求调整参数,并保持其余默认设置不变。
现在,切换到验证选项卡。取消选中“预测 RT”和“预测光谱”,因为这些选项适用于数据非依赖性采集工作流程。单击定量 MS1 选项卡。
选择运行 MS1 定量,然后单击加载定量默认值。选择离子定量,并将所有其他设置保留为默认值。最后,单击运行选项卡以继续。
选择所需的输出目录,然后单击运行以开始分析数据。在胰腺导管腺癌(PDAC)患者中,SERPINA5 和 HPSE 的表达显著降低,而 FGB 在血清中的表达较正常个体升高。在肝细胞癌肿瘤样本中,ENO3、PLS3、MTAP、SERPINB9 和 ITPR2 的表达较配对组织降低,而 ME1、CYP27A1、RPS16 和 ATP5PF 的表达显著升高。
热图可视化显示,与正常个体相比,胰腺导管腺癌(PDAC)患者血清中的蛋白质表达水平持续升高。对PDAC血清进行基因本体富集分析表明,凝血和止血相关过程显著上调。肝细胞癌肿瘤的GO分析则发现核苷酸和代谢过程富集,包括嘌呤核苷酸代谢和NAD代谢通路。
对胰腺导管腺癌(PDAC)血清进行KEGG通路富集分析,发现补体和凝血级联通路以及糖胺聚糖降解通路显著激活。在肝细胞癌肿瘤样本中进行的KEGG分析则显示,PPAR信号通路、碳代谢通路和神经退行性疾病相关通路存在富集,但统计学显著性较低。PDAC血清上调蛋白的蛋白质-蛋白质相互作用网络显示,存在一个以凝血因子11、纤维蛋白原β链和血浆丝氨酸蛋白酶抑制剂为核心的核心簇,同时还包括HPSE、CD5抗原样蛋白和CRISP3等多个孤立蛋白。
查看完整文字稿并访问数千部科学视频
本研究为生物学家提供了使用免费的前沿工具分析复杂蛋白质组学数据的全面指南。
基于质谱的蛋白质组学在早期发现和转化研究中正变得日益重要,然而数据的复杂性以及缺乏便捷可用的工作流程限制了其在生物制药研发中的广泛应用。本文展示了如何利用免费的、与厂商无关的计算工具,对公开的蛋白质组学数据集进行可靠的数据解析和验证,从而在无需新增实验负担的情况下支持以假设为导向的研究。简化的数据分析流程可提高预测的可信度,并促进跨研究的比较,直接推动靶点验证和生物标志物发现的进程。
该工作流程利用公共数据库和免费计算工具,将质谱数据分析贯穿于早期发现、先导物鉴定及转化研究的全过程。