2012年3月12日
ITS2数据库是一个用于系统发育推断的工作平台,可同时分析内转录间隔区2(ITS2)的序列及其二级结构。该平台包含数据收集与精确注释、结构预测、序列-结构多序列比对以及快速建树等功能。简而言之,该工作平台将初步的系统发育分析简化为几次简单的点击操作。
内转录间隔区二核糖体基因(ITS2)是分子系统学中最重要的标记之一。过去20年的研究主要集中在利用ITS2序列进行系统发育重建。然而,由于多种原因,ITS2的二级结构在系统发育推断领域正日益得到应用。
二级结构分析扩展了该分子标记在分类学上的适用范围,而进化迅速因而高度变异的ITS2序列则主要适用于物种水平或更低分类阶元的系统发育分析。由于ITS2二级结构包含四个特征性茎环结构,具有高度保守性,因此加入结构信息后可同时实现较高分类阶元的分析。因此,二级结构分析的结果能够提升基于一级序列所获得的系统发育分辨率。
大家好,亲爱的同事们,我叫 Matthias Wolf。我在 I ts two proof 已经工作了将近八年,目前在德国维尔茨堡大学生物中心的生物信息学系工作。
今天,我们将为您介绍一段简短的视频,内容是关于如何使用ITS2数据库。大家好,我是Y. Chu。制作这段视频的原因在于,ITS2数据库实际上不仅是一个存储数据库,我们还提供了大量工具,可帮助您提升系统发育分析的水平。
在本视频中,我们将向您展示如何使用这些工具,以及如何将这些工具连接在一起。正确。IT序列的界定对于结构预测至关重要。因此,已开发出基于隐马尔可夫模型注释的网页界面。
为了正确注释您的 ITS2 序列,您可以将序列粘贴到网站顶部的序列编辑器中。通过加载示例序列“plans”可演示此操作。序列编辑器本身会检查您的 ITS2 序列是否有效,并输出相应的错误信息。
例如,当使用非PAC字符时,在选择正确的隐马尔可夫模型(HMM)后,可通过点击开始分析流程,对每个5.8S和28S rRNA进行注释。程序识别出的序列将被移除,保留正确注释的ITS2序列,这些序列位于两者之间。最终,显示被界定的ITS2序列以及预测的5.8S与28S rRNA杂交结构。为了验证HMM注释的准确性,在完成新保留的ITS2序列注释后,可通过两种方法确定其二级结构。
首个预测可通过同源建模实现,即利用数据库中完整的序列和结构作为模板。要预测您所注释序列的结构,请点击“预测结构”中的两个序列。如果您的两个序列能够直接折叠成典型的its two级结构,结果将立即显示。
现在可以选择多种选项来进一步处理您的序列结构,包括将其添加到您的数据池中。如果在此处发现两个序列无法直接折叠,则会针对数据库执行BLAST搜索。结果页面将显示最佳的BLAST匹配结果,包括以每个同源模板进行的同源建模。
单击加号即可显示详细信息,您可以选择任意的序列-结构对,并通过拖放或右键单击使用上下文菜单将其添加到数据池中。另一种方法是手动输入一个或多个序列,包括其二级结构作为模板,以便将最合适的二级结构转移至您的查询序列。此过程可通过加载多模板示例文件进行演示。
单击“预测最佳模板”后,系统将使用默认设置进行同源建模。同源建模程序会计算所有结构之间的相互比对,并显示最佳的查询序列与模板组合。在生成的结果表格中,您可以查看哪些模板成功利用其二级结构对一个或多个查询序列进行了建模。
同样,通过点击加号可以展开结果的详细信息,因为完整的同源建模方法与ITS二无关。该方法可用于预测任意RNA的二级结构,前提是存在已知结构的同源分子。此外,所得的序列-结构配对可通过拖放操作或通过右键点击打开的上下文菜单添加到数据池中。
除了整体结构外,I TS2 还具有若干保守的基序,例如位于第三螺旋顶端上游的 A-U-G-G-U 序列,以及第二螺旋中错配区域的尿嘧啶-尿嘧啶(UU)错配形成的边缘-嘧啶结构。该 UU 错配两侧分别分布有两个基序:一个位于第二螺旋左侧,另一个位于第二与第三螺旋之间,并包含一个额外的三联腺嘌呤(A)核苷酸。我们将这些序列基序转化为 hms 后,现可实现对目标序列中此类基序的识别。
为了搜索这些模体,请将查询序列输入搜索框并选择正确的模型。同样,可通过加载“植物”示例文件来演示此操作。要开始计算,请点击“模体搜索”。
发现其两个动机在您的查询序列中已被注释并高亮显示。从 I Ts two 数据库中检索其两个序列结构对的一种方法是使用搜索功能。该功能允许用户通过分类名称或 GenBank 标识符来搜索序列结构。
若要通过 GenBank 编号搜索序列结构,请在搜索框中输入 GI 编号,然后点击搜索。搜索结果列表将出现在新标签页中。点击“显示详情”可查看某条序列结构的详细信息。
此外,您可以通过点击“按拖放显示序列结构”或通过右键单击上下文菜单,在标签页内展示所有匹配结果的序列 S 方向。可选择的序列结构可被添加至数据池中。除了通过 gi 号搜索序列-结构配对外,您还可以在搜索框中输入分类名称,系统将自动弹出实时搜索框提供支持。当新标签页出现并列出所有匹配结果后,您可以使用与之前相同的各项功能。
例如,通过拖放方式向数据池中添加筛选项。从数据库中获取序列-结构配对的第二种方法是浏览功能。此处,文本经过分类整理。
根据 NCBI 分类学数据库,数据可通过网站左侧的树状结构进行访问。点击加号即可显示其下一级的分类内容。
单击分类名称,即可打开一个新标签页,其中包含该分类单元的每条序列结构及其配对信息。除了可通过CEM数据库编号或物种信息搜索序列和结构外,I Ts two数据库还提供基于BLAST的搜索功能。然而,标准的BLAST分析通常难以识别远缘相关的序列。
由于序列差异较大,其两个序列难以比对。为了克服这一障碍,我们采用了一种基于序列和结构的blast搜索方法,在同源性搜索中引入了关于高度保守结构的信息。该方法通过将序列结构转化为12个字母的伪蛋白质序列来实现。
因此,从任何感兴趣的序列开始并覆盖广泛分类范围的物种取样,已变得与进行一次BLAST搜索一样简单。要执行BLAST搜索,可将查询序列输入序列编辑器中。
如果您的查询序列为不含结构的普通核苷酸序列,则使用常见的 blast n 算法;而对于包含二级结构的序列,将采用 ITS two blast 算法。通过点击 blast 按钮启动该过程。
片刻之后,您的 blast 结果将显示在一个新标签页中。您会看到每个查询序列对应一个标签页。单击“显示比对”后,您可以像之前一样滚动浏览比对结果,并选择您需要的序列-结构配对,将其加入数据池中。
在处理 ITS 两个数据库的过程中,您的数据池中可能已积累了多个序列结构。您可以随时访问数据池并查看其内容。接下来的分析步骤是进行多序列结构比对。
单击“分析数据集”,然后选择“序列与结构”以执行序列-结构比对。此时,系统将要求您选择比对的图形显示模式。对于大量序列,建议选择简约版本。
由于我们的数据池仅包含少数序列结构,因此我们选择全图模式。计算完成后,比对结果将被添加到您的数据池中。通过高亮显示一个碱基对的一侧,其对应的另一侧将自动被高亮显示。
最后,单击“保存比对”即可安全保存比对结果。当您对序列结构比对的质量满意后,可单击“分析数据集”,然后选择“邻接法”,以计算系统发育邻接树。生成的树将显示在新标签页中。
您可以使用滚动条自由缩放系统发育树,通过点击树中的任意节点或叶节点来重新布线该树,并在该节点处进行重新布线。如果要从数据池中移除某个分类单元,请点击对应的叶节点,然后选择“从此数据池中移除该节点”。
现在,您可以点击“保存树”来重新计算经过减少分类单元取样的比对和系统发育树。您可以将系统发育树保存为NU格式。点击“关于本网站”,然后选择“工具”,以获取有关正在销售的独立工具及专业版的更多信息。
除了通过 I Ts two 数据库网页界面提供的邻接法(Neighbor joining)比对功能外,您现在还可以使用多种新功能,例如基于补偿性碱基变化的物种界定(species Delimitation)。在过去的几分钟里,我们向您展示了一些技巧,帮助您提升系统发育分析的质量。我们演示了如何从 I Ts two 数据库中获取数据,使用 four cell 进行序列比对,并最终利用 Pro S 构建系统发育树。在所有这些步骤中,我们不仅考虑了序列信息,还整合了序列与二级结构信息。当然。
希望您喜欢我们这部小影片以及繁重的系统发育树构建过程。晚安。
ITS2数据库是一个用于系统发育分析的综合性工具,整合了内转录间隔区2(ITS2)的序列数据和二级结构信息。该数据库有助于实现准确的注释、结构预测和序列比对,从而简化系统发育分析流程。
ITS2数据库通过整合序列与二级结构数据,为系统发育分析提供了结构化的方法,能够在多个分类层级上实现更精确的分类学分辨。该功能通过提高用于表型筛选和检测开发的生物模型的可靠性,支持早期发现阶段的靶点验证和机制性风险降低。从序列注释到系统发育树构建的集成化工作流程,为转化生物标志物的鉴定和临床前模型的选择提供了一个可重复利用的平台。
ITS2数据库通过提供一个连贯的序列-结构分析和系统发育推断流程,契合了从早期靶点验证到先导物识别及临床前开发的整个发现过程。