2017年8月16日
本实验方案的目的是为缺乏统一命名和分类标准的蛋白质群组建立一个参考体系。该参考体系将有助于对整个群组进行分析和讨论,并可与已确立的名称一并使用。
本实验的总体目标是利用标准电子表格软件,为缺乏统一命名和分类标准的蛋白质组建立一个参考体系。该方法有助于阐明具有混乱或不一致命名的同源蛋白质之间的关系,例如包含无脊椎动物防御成分的半胱氨酸稳定型α-β防御肽超家族。该技术的主要优势在于能够对目标蛋白质提供一种简洁直观的可视化呈现。
首先,确定目标蛋白家族的特征性结构。例如,昆虫防御素来自腐尸蝇(Phormia terraenovae)的溶液结构中存在 CS α-β 折叠,该结构定义了 CS α-β 超家族。这一折叠结构还包含一个较小的基序,称为半胱氨酸稳定螺旋,其特征是在 CXC 序列上游存在 CXXXC 模式。
四个半胱氨酸形成两个二硫键。为了完成CSα-β基序,另外一对半胱氨酸会形成第三个二硫键。最终,了解至少一些与蛋白质结构或功能相关的重要特征至关重要。
如果没有这些信息,就无法生成参考序列。现在,将这些确定的特征输入电子表格中,使用列表示保守的特征,并用列来表示这些特征之间的间隔区域。
保持列宽足够以容纳数字,并使各列宽度一致。在行中描述序列。若要将某个序列标记为特征,请使用填充功能为特征框填充颜色。
然后,在中间的输入框中输入氨基酸数目,以表示各特征之间的间距。接着,添加已被结构数据库和已发表结果确认为该组成员的代表性序列。根据需要,添加可能定义序列亚组的特征,例如额外的半胱氨酸残基。
如果某个序列缺少特定特征,请留空该区域,并将其与代表中间氨基酸的区域合并。为此,请使用“合并居中”功能。在输入代表性序列后,识别出明显相关的序列组。
然后,总结这些基团的特征。当特征之间的氨基酸数目可变时,使用连字符表示范围,或使用斜杠表示若干特定数目。根据需要,对可能相关但不常见到足以列入参考的特征进行创造性注释。
例如,由于半胱氨酸在该超家族中具有重要作用,因此可以对额外存在的半胱氨酸进行标注。有时,在将新鉴定的序列添加到电子表格时,某一物种的序列可能归属于该超家族中的多个不同分组,缓步动物即为一例。完成之后,可通过排序电子表格的行来突出显示物种内的变异,或不同分类群之间的变异。
本演示使用免费提供的 MEGA 6 软件。然而,其他软件也可采用类似方法操作。要开始新的比对,请在“Align”选项卡下选择“Edit/Build Alignment”。
然后,在弹出的对话框中选择“创建新比对”,并点击“确定”。接着选择“蛋白质”。现在,在“编辑”菜单中选择“从文件插入序列”,以导入序列。序列必须为 FASTA 格式。
默认情况下会显示反映不同氨基酸类型的背景颜色,可通过“显示”菜单下的切换按钮关闭。输入所有序列后,单击弯曲手臂图标,然后单击“比对蛋白质”,以使用 MUSCLE 算法对序列进行比对。如果出现“未选择任何内容进行比对”的提示信息。
是否全选?弹出窗口中选择“确定”。某些参数可在弹出窗口中更改,但本次演示中使用默认设置即可。现在,根据该蛋白质超家族的重要特征检查比对结果。
上方的比对栏显示了氨基酸完全保守的位置,以星号标记。初始比对识别出了四个保守的半胱氨酸中的三个。其中一条序列明显比对错误。
为修正错位的序列,选中连字符并按 Delete 键,注意不要误删氨基酸。然后通过添加空格将氨基酸调整至正确的位置。手动完成序列比对后,应注意 CXXXC 模式中的最后一个半胱氨酸在整条比对序列中是保守的。
通常需要手动调整,以优先突出序列中最重要的特征。先前建立的 CS α-β 超家族的表格比对揭示了五种基本的成键模式。新鉴定出的缓步动物序列涵盖了这些模式的完整谱系。
接下来,采用系统发育分析来研究该类蛋白质可能的进化过程。然而,这些序列通常较短且高度分化。因此,所得的进化树分辨率较低,提供的信息有限。
尽管使用参考序列优化了多序列比对,但在最大似然分析和贝叶斯系统发育分析中分辨率仍然较低。大多数分支的支持率都很低。然而,在两棵系统发育树中至少有一棵树支持了五个较小的类群。
在同一分类群中,具有不同半胱氨酸数量的序列可能比来自不同分类群但具有相同模式的序列关系更密切。观看本视频后,您应能够很好地掌握如何使用电子表格软件对蛋白质的重要特征进行简单的可视化展示。在尝试此操作时,重要的是要记住,确定该组蛋白质最相关的特征通常是一个迭代过程,可能需要对参考信息进行修订。
新的序列始终可以添加到电子表格中,并且可以轻松创建多个版本,以便加入可能对分类和分析有用的新增特征。尽管电子表格比对有助于直观展示结构和功能特征,但还可以进行其他方法(如系统发育分析),以进一步揭示进化关系。
查看完整文字稿并访问数千部科学视频
本方案旨在为目前缺乏统一命名和分类标准的一类蛋白质建立参考体系。通过阐明相关蛋白质之间的关系,该参考体系将有助于促进对该类蛋白质的讨论与分析。
蛋白质分类的挑战可能阻碍在不同发现项目中的靶点验证和比较分析,尤其是在命名法和序列多样性掩盖了功能关系的情况下。建立一个优先考虑结构和活性相关特征的参考框架,能够更可靠地对新序列进行归类,并支持跨职能的研发讨论。该方法可提高对序列差异较大的蛋白质家族的预测可信度,进而优化项目组合决策。
这种基于参考的方法可融入从早期靶点识别到先导化合物优化的整个发现流程,尤其适用于具有复杂序列多样性的蛋白质家族。