2014年2月5日
本文介绍了一种从核苷酸或氨基酸序列数据集中生成可靠系统发育树的逐步分析流程。本指南旨在为初次接触系统发育分析的研究人员或学生提供帮助。
本文的总体目标是从 DNA 或蛋白质序列中重建一个可靠的系统发育树。首先,通过在 NCBI 使用 blast 程序识别相似序列来实现这一目标。第二步是比对这些相似序列。
接下来,根据比对结果确定最合适的进化模型。最后一步是基于比对后的序列推断系统发育关系。最终,这一逐步分析流程用于展示用户如何从序列数据获得可靠的系统发育树。
该方法可通过推断新序列的身份和功能,帮助回答多个领域的关键问题。要使用基础局部比对搜索工具(BLAST)的在线版本,请访问美国国家生物技术信息中心(NCBI)的BLAST网络服务器,然后点击相应的BLAST程序。
在查询框中输入一个FASTA格式的文本序列,例如此处所示的序列。点击适用于搜索的相应BLAST程序,然后点击BLAST。默认输出为HTML格式,显示与输入文本序列最相似的序列。
下一节介绍如何在 Windows 和 Mac 上使用本地的 blast 可执行程序。用户可跳至名为“Blast Local executables for Macs x”的下一节。要在 Windows 计算机上运行 blast 命令行程序,请从 NCBI blast 网站下载适用于 Windows 的可执行文件。
安装Blast程序后,按如下方式配置计算机的环境变量:单击计算机的“开始”按钮,右键单击“计算机”,然后单击“属性”。在新窗口中,选择“高级系统设置”,在弹出窗口的“高级”选项卡中,单击“环境变量”按钮。
然后在用户部分的用户变量下,点击新建按钮。在弹出的新窗口中,添加变量名 path 以及此处显示的变量值。接下来,从 NCBI 网站下载每日更新的预格式化 blast 数据库,或下载特定生物体的基因组。
然后,通过点击“开始”并在搜索栏中键入 CMD 来打开 MS DOS 命令提示符,接着切换到 NCBI blast 文件夹。使用此处显示的 Make blast DB 命令创建数据库。通过将一条 FASTA 格式的蛋白质序列文本插入 DB 文件夹中,创建一个名为 test 的查询蛋白序列。
然后,为了鉴定与测试蛋白序列最相似的序列,可通过 blast P 查询命令检索数据库。以下部分将针对 Mac 用户重复此信息。Windows 用户可跳至第五部分,即生成多序列比对。
要在 Mac 上运行 blast 命令行程序,需通过远程访问美国国家生物技术信息中心(NCBI)的 FTP 网站下载适用于 Mac 的可执行文件。为此,请打开 Finder,在终端窗口中搜索并启动“终端”应用,然后在终端中输入 NCBI 的 FTP 网站地址。输入用户名和密码时均使用“anonymous”,随后输入命令 CD blast / executables / latest。
通过输入 LS 列出可执行文件,并通过键入以下命令下载符合您系统要求的最新版本。现在解压缩已下载的文件。接着将 blast 可执行文件的二进制程序所在路径添加到您的环境变量中,以便 shell 能够搜索该目录。
在查找命令时,从 NCBI 网站下载预格式化的 blast 数据库或基因组。通过输入 CD genomes 命令进入 genomes 目录。然后按照以下步骤下载感兴趣的基因组或序列,最后输入 quit 退出 FTP 站点。
接下来,通过输入 Make Blast DB 指令来创建数据库。将 FASTA 格式的查询序列插入到 bin 文件夹中,并使用 blast P 查询命令对数据库进行检索,以在常用的多重序列比对(MSA)程序中找到与测试序列数据最相似的序列,其中一种常用程序是 tea coffee。在将 FASTA 格式的序列数据输入至 tea coffee 网站的查询框后,输出结果会通过颜色编码标示出相似的残基。
另一种常用的多序列比对(MSA)程序是 Clustal MSA,该程序可下载为命令行版本 CLUSTERAL W,或适用于多种操作系统的图形化版本 CLUSTERAL X。接下来,通过选择文件选项卡,以 FASTA 格式的序列文本形式将数据加载到 Clustal 程序中,然后点击加载序列按钮。
现在切换到比对选项卡,点击“执行完整比对”按钮,以对序列进行比对并获得最优进化模型。下载ProTest程序。ProTest下载完成后,双击启动ProTest。
启动分析后,单击比对框中的“选择文件”以加载序列数据,然后单击“开始”运行程序。运行完成后,程序将根据推断序列的标准显示最佳模型。
下载并启动 Phi ML 后,通过输入文件名和 PY 来加载输入序列,将其作为文件 lip 格式序列。然后通过输入 y 来启动程序。从 Mr Bays 网站下载贝叶斯推断程序后,通过单击可执行文件来启动该程序。然后通过输入 execute 文件名 dot NEX 将 Nexus 格式的序列数据读入程序中。
接下来,设置进化模型并选择运行的世代数。使用 mc mc 命令运行分析后,通过 sum T 命令汇总生成的树以查看系统发育树。下载树状图查看程序。
最后需要说明的是,不断有新的软件发布,旨在提供更优的序列比对、相似性预测或系统发育树构建。尽管本视频概述了一些常用程序,但仍鼓励观众探索其他可选工具。BLAST 算法执行局部比对,即搜索序列中较短的相似片段。
在算法查找了查询序列的所有可能片段并将其序列最大程度延伸后,便会进行比对组装。对于每一对查询序列,e 值用于指示匹配结果的统计学显著性。E 值越低,表明匹配结果越显著。
例如,E 值为 0.05 的序列比对意味着该匹配仅由随机因素产生的可能性为 100 次中有 5 次。BIT 分值使用特定的打分矩阵来评估比对质量的优劣,BIT 分值越高,表示比对结果越好。
多序列比对(MSA)是指对三个或更多由氨基酸、DNA 或 RNA 组成的初级序列进行的序列比对。此处显示的 MSA 结果以颜色编码标记相似的残基。以下展示的是使用 Cluster X 对六个蛋白质序列进行比对后得到的氨基酸序列比对示例。
protest 程序用于确定氨基酸替换的最佳适配模型。在分析过程中,该程序会列出正在分析的模型,并在程序运行结束后显示最佳适配结果。Phi ML 可根据核苷酸或氨基酸序列比对结果估算最大似然系统发育树,集成了大量替换模型,并结合多种选项用于搜索树拓扑空间。
MrBayes 利用贝叶斯CMC推断方法,在多种进化模型下重建系统发育关系。程序运行后,可以按特定时间间隔查看进度,如图所示。系统发育树生成后,需要对拓扑结构进行可视化。
在此图中,树状图窗口显示了来自 fly.Base 的蛋白质示例树。树状图包含一个树编辑器,允许用户移动分支并重新调整树的结构。在执行此操作时,重要的是要仔细阅读每个程序的用户指南。
本方案为读者提供了实际的入门起点,介绍了这些程序的工作原理。然而,我鼓励读者自行尝试并熟悉每个程序相关的众多设置。
查看完整文字稿并访问数千部科学视频
本文介绍了一种从DNA或蛋白质序列重建可靠系统发育树的逐步流程。该流程专为初次接触系统发育分析的研究人员和学生设计。
系统发育分析通过推断新序列的功能身份和进化关系,可在早期发现阶段实现靶点验证和机制去风险化。该流程通过阐明生物学背景并减少靶点假设验证中的不确定性,提高对先导化合物识别的预测可信度。它架起了从序列数据到功能注释的转化桥梁,为项目组合的筛选及基于风险评估的推进决策提供依据。
该方法可融入从靶点鉴定到先导化合物优化的整个发现流程,支持基于进化关系的假设验证、生物学风险评估和预测建模。