2017年12月22日
本文描述了在葡萄中鉴定和表征基因家族的方法,该方法应用于拟南芥酵母毒性(Arabidopsis Tóxicos in Levadura,ATL)E3泛素连接酶家族。
本实验的总体目标是通过对基因结构、相关蛋白基序、染色体位置、基因重复事件及表达模式的全面定义,从全局角度对植物中的一个基因家族进行详尽表征。该方法有助于回答植物分类学中的关键问题,例如通过全基因组鉴定家族成员及其转录组特征,从而实现基因表达分析。该完整流程的主要优势在于提供了一套详尽的实验步骤,以实现对基因家族的全面表征。
该方法可应用于任何具有可用遗传数据的植物物种的任何基因家族。此外,该方法可提供有价值的信息,用于鉴定功能研究中的候选基因。整个实验流程将由我实验室的Pietro Ariani进行演示。
打开 Blast 网页,点击蛋白质 Blast 部分。在“输入查询序列”字段中,输入将用作探针以鉴定其他家族成员的蛋白质的氨基酸序列。应使用具有该家族所有重要特征的蛋白质。
接下来,在“选择搜索集”字段中,选择参考蛋白质数据库和目标生物体。现在,在“程序选择”字段中,选择 PSI-BLAST 算法。如有需要,可单击“算法参数”以调整高级参数,如最大目标序列数和打分矩阵。
E 值是显著性阈值,本次搜索中将其从 0.05 降低至 0.01。点击 BLAST 按钮以运行分析。在所有与查询序列显示相对匹配的序列中,取消选择明显不属于该家族的条目。
通过点击 PSI-BLAST 列中选择框的对勾来执行此操作。然后,通过点击“go”按钮运行第二次 PSI-BLAST 迭代。所有新识别出的序列将以黄色高亮显示。
再次取消选择不属于该科的命中结果。重复此过程,直至算法未找到任何相关条目或达到收敛状态。当所有假阳性结果均被剔除后,将氨基酸序列收集到一个 FASTA 格式的文件中,并将该文件上传至生物信息学软件套件。
接下来,在列表中选择所有已导入的序列,然后点击工具栏中的“比对/组装”按钮。随后点击“双两序列多序列比对”,选择 MUSCLE 比对方法,然后点击“确定”。此时将使用默认参数进行序列比对。接着可视化该比对结果的序列标志图(sequence logo),并通过肉眼观察基因序列,以查找可能的假阳性结果。
文中方案描述了对蛋白理化参数与结构域、染色体分布、重复事件以及外显子-内含子结构的进一步分析。接下来,通过构建高质量的系统发育树并确定家族命名法,分析ATL家族成员之间的关系。首先,从UmoProt数据库中获取作为参考序列的拟南芥(Arabidopsis adopt systeliana)ATL序列,这些序列是葡萄基因命名所必需的参考。
然后创建一个FASTA文件,包含用于系统发育分析的葡萄和拟南芥基因家族成员的所有核苷酸序列。现在访问Phylogeny.fr主页,选择系统发育分析流程。大多数情况下,使用一键式分析即可;但如有需要,也可通过高级选项选择特定的高级设置,甚至使用菜单式选项进行完全自定义的分析。
接下来,输入分析的名称并上传FASTA文件,然后点击提交以运行分析。如果此操作导致错误消息,请单独完成系统发育分析流程中的每一步。
首先,访问 MUSCLE 软件主页并上传 FASTA 文件。选择 Pearson FASTA 作为输出格式,然后提交。接下来,以 FASTA 格式下载文件,并剔除任何比对质量较差的位点。
打开 G-block 服务器工具,上传比对的 FASTA 文件,选择 DNA 作为序列类型,并根据分析需求选择合适的严格度。对于葡萄 ATL 基因家族的比对,由于序列差异较大,选择系统提供的全部三项宽松筛选选项。然后点击“获取模块”以运行分析。
为保存结果,点击输出页面底部的比对结果,并创建一个新的FASTA文件。G-blocks可去除DNA或蛋白质比对中分歧区域的比对不良位点,从而使比对结果更适用于系统发育分析。在此步骤中,列严格性参数的经验性选择至关重要,以确保它们符合三者的一致性要求。
为了完成系统发育树的构建,我们进入 Phylogeny France 的主页。在该页面中,选择“a la carte”流程,并取消选中以下选项:多序列比对和比对校正。接下来,点击“create workflow”,上传经 G-blocks 校正后的 FASTA 文件,选择自举法(bootstrapping)分析程序,并使用默认参数和设置。
最后,单击提交以运行分析。至此,逐步操作完成。系统生成系统发育树后,将自展支持率低于 70% 的分支折叠收起,然后以 Newick 格式下载最终结果,用于进一步分析。
该文本方案提供了基于系统发育关系指定基因名称的指导。在此方案中,从基因表达文库中获取经arma标准化的表达值,制作成带制表符分隔的文本格式文件。将每个基因家族的表达值按相同的模式行进行整理。
接下来,使用多实验查看器软件进行分级双聚类分析。首先,上传工作数据矩阵并选择文本文件。选择单色阵列,并在未提供自动注释时取消勾选“加载注释”选项。
选择表达量表格预览中左上角的表达量数值,然后点击加载按钮。接下来,对数据进行调整,应用 Log2 转换以及基因/行标准化。然后设置合适的尺度范围。
现在计算层次聚类。在排序优化字段中,选择优化基因叶序和优化样本叶序。接下来,在连接方法选择字段中,选择平均连接聚类,而在距离矩阵选择字段中选择皮尔逊相关性。
然后单击“确定”以运行分析。在窗口左侧面板中查看结果,并通过文件菜单中的“保存图像”导出热图。根据BLAST-P搜索结果,拟南芥ATL2最相似的基因被用于调查葡萄基因组中的ATL家族成员。
经过数个循环后,PSI BLAST 分析趋于收敛,提供了一份基因家族中假定基因的列表。通过目视检查 MUSCLE 比对结果,评估了每个候选基因是否存在典型的环状 H2 结构域。由此将搜索范围缩小至 96 个葡萄基因。
通过将鉴定出的基因与拟南芥ATL基因家族进行系统发育分析,从而确定命名。在96个葡萄ATL基因中,有13个被赋予了特定标识符,作为拟南芥ATL基因的直系同源物。利用分级双聚类分析,将鉴定出的基因映射到葡萄全局基因表达图谱,结果显示全部96个基因在至少一种组织中表达,并可识别出五个表达聚类。
类似的方法也被用于研究这些基因在生物胁迫下的表达情况。ATL基因家族直接参与了对病原体感染的响应,其中有62个基因在至少两种条件下表现出显著的表达调控。观看本视频后,您应能够充分理解如何使用相关软件对基因家族进行表征分析。
在进行该实验流程时,重要的是要仔细界定特定基因家族的特征以及用于全基因组家族成员鉴定的相应探针。通过该流程,可以基于除基因家族命名所需物种之外的其他一些物种构建额外的系统发育树,从而研究基因家族的进化及P30的功能。
查看完整文字稿并访问数千部科学视频
本文描述了一种在葡萄中鉴定和表征基因家族的方法,重点研究拟南芥酵母毒性蛋白(ATL)E3泛素连接酶。该方法旨在全面了解基因结构、蛋白质基序、染色体定位、基因重复事件及表达模式。
对葡萄中ATL E3泛素连接酶等基因家族进行全基因组鉴定和荟萃分析,可实现植物生物技术流程中的系统性靶点验证和机制风险降低。该工作流程有助于提升功能基因组学研究的预测可信度,为性状改良和抗逆适应研究中的候选基因优先排序提供依据。该方法可广泛应用于任何具有基因组数据的植物物种,从而加强农业研发中的项目组合决策。
该工作流程整合了植物生物技术流程中从早期发现到先导物鉴定以及临床前性状验证的各个环节。