2019年4月11日
OpenProt 是一个可免费访问的数据库,致力于推行真核生物基因组的多顺反子模型。本文介绍了一种在分析质谱数据集时使用 OpenProt 数据库的实验方案。利用 OpenProt 数据库进行蛋白质组学实验分析,有助于发现新颖且以往难以检测到的蛋白质。
OpenProt 是首个能够对真核生物基因组进行多顺反子注释的数据库,可识别原始基因的编码潜力,并实现对以往难以检测到的蛋白质的发现。我们设计本实验方案时,力求使其适用于所有用户,无需具备深厚的生物信息学技能,从而将蛋白质组学的发现能力带给每一位研究者。为了理解并应对当今医学领域的挑战,我们需要全面了解蛋白质组的全景图景,以及其中所有组分及其动态变化。
OpenProt 提供了这种可能性。尽管此处 OpenProt 用于分析蛋白质组学实验,但它也可用于其他系统,因为它只是对蛋白质组提供了更清晰的定义。首先打开 OpenProt 网站,并通过首页菜单中的链接进入下载页面。
根据分析的实验数据和目标蛋白类型,点击感兴趣的物种。点击 AllProts、Isoforms 和 RefProds 以生成包含 OpenProt 数据库中所有已知和新发现蛋白类型的文件;如果可用,点击生成蛋白序列的注释来源。根据研究目标,点击选择蛋白筛选所需的支持性证据级别。
然后单击,生成包含所有 OpenProt 预测结果的文件,并单击所需的文件格式进行下载。对于蛋白质组学分析,请选择 FASTA 蛋白质文件。readme 文件将包含有关该文件格式的所有必要信息。
进行数据库处理时,登录到合适的蛋白质组学工具实例并创建新的历史记录。要导入下载的 OpenProt 数据库,请点击“上传”。要输入数据库处理工作流程,请进入工作流程页面,再次点击“上传”,然后点击运行工作流程。
然后选择导入的 OpenProt 数据库作为输入,并将获得的 Fasta 文件重命名为具有明确意义的名称。该数据库现已准备好用于蛋白质组学分析。对于质谱文件的准备,请打开 ProteoWizard 套件中免费提供的 MS Convert 工具,并上传待分析的数据文件。
选择输出目录并设置所需的文件格式为 mzML,然后在质谱一级和二级数据上使用基于小波的算法选择峰提取滤波器并开始转换。进行蛋白质定量时,创建一个新的历史记录,并将先前创建的数据库拖放到该新历史记录中。单击上传以导入转换后的 mzML 数据文件。
打开工作流程页面,再次点击“上传”以导入所需的工作流程,并选择运行该工作流程以查看不同的参数。选择已导入的 mzML 数据文件,并将先前创建的数据库作为数据库 Fasta 文件输入。由于该工作流程使用 X!
使用串联搜索引擎时,单击“上传”以导入 X! Tandem 默认配置文件。由于使用完整的 OpenProt 数据库会导致数据量显著增加,因此应采用严格的假发现率。
为了进行质量控制,对 ID 过滤器输出结果运行文件信息工具,以获取常见的性能指标,例如肽段谱图匹配数、已鉴定肽段数和已鉴定蛋白质数。对于 OpenProt 数据库挖掘,请返回 OpenProt 网站并打开搜索页面。点击已鉴定蛋白质所对应的感兴趣物种,并在蛋白质查询框中输入蛋白质登录号。
单击激增,将出现一个包含所查询蛋白质基本信息的表格。接下来,单击详细信息链接。新打开的页面将包含一个以所查询蛋白质为中心的基因组浏览器,以及其他相关信息。
要获取蛋白质或DNA序列,请分别点击信息标签中的蛋白质或DNA链接,然后点击各个标签页,以浏览有关质谱证据、核糖体谱型检测、保守性以及已鉴定蛋白质结构域的详细信息。在此代表性分析中,原始论文中鉴定出的大多数蛋白质也通过OpenProt 2_pep或OpenProt_all数据库被成功鉴定,表明OpenProt数据库能够实现与基于InterPro KB数据库的现有方法相当的蛋白质鉴定与定量结果。使用OpenProt 2_pep数据库,在所有数据集中鉴定出11种目前尚未在数据库中注释但具有高置信度肽段支持的蛋白质。
使用 OpenProt_all 数据库,在所有数据集中通过高置信度肽段共发现了 29 种新蛋白质。尽管推荐的严格假发现率降低了已鉴定蛋白质的总数,但并未影响最高置信度的蛋白质鉴定结果。其中一种新蛋白质被发现是 Raf-1 蛋白的相互作用蛋白。
这些蛋白质此前尚未通过质谱分析或核糖体谱型分析检测到,并且展示了高质量的谱图。在报告新蛋白质发现时,务必确保所选参数适合实验设计,并始终验证支持性证据的质量。该方案适用于所有自上而下的蛋白质组学实验,尤其是与功能蛋白质组学联合使用时。
这将有助于更深入地筛选和理解蛋白质相互作用及细胞通路。OpenProt 揭示了当前基因组注释所传递的蛋白质组景观被严重低估,并强调了真核基因的多顺反子特性。这为研究开辟了全新的方向。
本方案的优点在于无需具备 extensive bioinformatic skills,而且由于其使用远程服务器,可在任何计算机上运行。
OpenProt 是一个支持真核基因组多顺反子模型的开创性数据库,有助于发现此前难以检测的蛋白质。本实验方案概述了如何利用 OpenProt 数据库分析质谱数据集,使不具备深厚生物信息学技能的研究人员也能开展蛋白质组学研究。
目前的基因组注释通过施加任意的开放阅读框(ORF)长度限制以及每条转录本仅包含一个ORF的约束,低估了真核生物的蛋白质组,从而限制了早期药物开发中的靶点发现。OpenProt通过实现多顺反子注释弥补了这一空白,揭示了来自非经典ORF的新型蛋白质,这些蛋白质可能代表尚未充分探索的治疗靶点或脱靶风险。这扩展了靶点验证的研究范畴,并通过减少蛋白质组筛选中的假阴性结果,提高了临床前靶点选择的预测可信度。
OpenProt 融入从靶点鉴定到先导化合物优化的发现全过程,以最低的生物信息学负担增强全蛋白质组范围的筛选。