2011年5月9日
我们提供一个用于基因组序列分析的公共计算网站。该网站能够检测具有不同非随机核苷酸组成的DNA序列模式。此资源还可生成具有多种复杂程度的随机化序列。
本实验的总体目标是分析用户指定基因组序列的中等范围非随机性,也称为序列的不均一性。该目标首先通过分析输入序列的寡核苷酸组成,并生成包含该序列的所有寡核苷酸的频率表来实现。此过程通过调用 SRI Analyzer 程序完成。
第二步是生成与输入序列具有完全相同寡核苷酸组成的随机序列。这可以通过调用 SRI 生成程序来实现。该流程的第三步是在输入序列和随机化序列中寻找特定核苷酸或核苷酸组合(例如 GC 或 ag)显著富集的区段。
这一目标通过 MRI Analyzer 程序实现。该流程的最后一步是下载包含程序检测到的所有 MRI 区域序列的文件。最终可以获得结果,显示多细胞区域的大多数基因组区域在含有四种核苷酸各自或其任意组合的碱基组成极端片段中显著富集。
这些非均质区域与异常的DNA构象和/或特定的DNA特性相关。该方法有助于回答基因组学领域的关键问题,例如在大片段的非编码序列(包括基因间区或启动子区)中寻找潜在的功能性DNA元件。尽管该方法可用于研究哺乳动物基因组,也可应用于其他生物体,如无脊椎动物、植物、真菌和细菌。
在 www.bioinfo.utoledo.edu/gri/ 该网络资源处打开基因组中等范围同源性分析(G GM I)软件包的主页。帮助部分的“Readme”链接还提供了有关程序的详细信息。
尽管所有关于基因组MRI及类似算法的已发表资料均已列在相关资源链接中,但仍需创建一个包含快速格式化序列的文件,以启动A-G-M-R-I分析会话。快速格式化序列以尖号(carrot)或大于号(>)开头,后接唯一的标识符或名称,随后的行中为序列内容。基因组MRI仅处理T、G、C和A核苷酸,但允许输入其他字符。
使用 PKD1 基因的序列文件。为演示该操作,请按下开始按钮。这将打开一个新网页,可在提供的窗口中选择复制并粘贴输入序列,或在文件较大时进行相应处理。
要上传文件,请点击“选择文件”按钮以上传文件。浏览至目标文件,然后点击“使用此文件启动本会话”按钮。文件上传成功的确认信息将显示在页面顶部下方。
此信息是当前会话的标识符,在本例中为 C eight EP oh six。要分析输入序列的短程非均一性,请点击“分析短程非均一性”按钮。程序将打开一个新页面,专为运行 SRI Analyzer 程序而设计。
在此,我们需要选择待分析的寡核苷酸的最大长度。由于输入序列的长度约为 50,000 个核苷酸,属于中等大小,因此我们选择“formers”作为将要计算频率的寡核苷酸的最长长度。最后,需立即点击分析文件按钮。
该程序可计算输入序列中指定长度及更短长度的所有寡核苷酸的出现频率。要查看所有寡核苷酸的频率,请点击链接下载组成文件。此文件命名为用户文件。
com 代表一个包含三列的表格。第一列表示寡核苷酸,第二列表示它们的相对频率,第三列表示输入序列中寡核苷酸出现的次数。
要生成与输入文件具有相同寡核苷酸组成的随机序列,请点击 SRI 生成器标签。在新页面中,选择要生成的随机序列样本数量。每个样本将包含与用户文件中输入序列相同数量和长度的随机序列。
在此示例中,用户文件为 PKD1 基因的序列。接下来,选择用于生成随机序列时估算寡核苷酸频率的最长寡核苷酸长度,通过选中代表四碱基寡核苷酸的“formers”单选按钮进行设置。然后,选择生成随机序列样本的数量为两个。
最后,单击生成文件按钮,启动程序以处理数十万核苷酸的输入序列。生成随机序列可能需要几分钟时间,因此请等待页面底部出现蓝色下载链接。
为了分析输入序列和随机化序列在中等范围内的均一性,请点击 MRI 分析器选项卡。在新页面中,从待分析文件列表框中选择一个待分析的序列,然后从七种含量类型列表中选择 GC 含量。
GC含量指的是G与C的组成比例。窗口大小字段允许选择用于分析富含和贫乏GC序列的窗口长度。保持默认的50个核苷酸窗口大小。
最后,分别为富含内容和缺乏内容的区域选择上限和下限阈值。这些阈值可以通过当前窗口中特定核苷酸的数量或这些核苷酸在窗口中的百分比来定义。在此情况下,我们首先为上限阈值选择60%,为下限阈值选择30%的随机值。
接下来,按下分析文件按钮。随后,将显示输出文件的链接以及结果的图形化表示。输入序列中所有富含GC的区域以蓝色向上的尖峰标记,而GC含量较低的区域则以红色向下的尖峰标记。该图显示,代表GC富集区域的蓝色尖峰过多,而代表GC贫乏区域的红色尖峰则少得多。
这意味着所选参数并非最优。在下一次迭代中,请使用75%的上限阈值和32%的下限阈值。然后,再次通过点击“analyze file”按钮启动MRI分析器。
新图显示,即使采用更为严格的新参数,仍存在数百个蓝色尖峰。因此,将上限阈值提高至80%,并重复计算。新图显示,有62个GC富集区域的GC含量大于或等于80%,以及28个GC贫乏区域的GC含量低于32%。接下来,将输入文件的结果与两个与PKD1基因具有相同寡核苷酸组成的随机序列进行比较。
为此,使用“分析文件”列表框将序列从 PKD1 基因更改为随机序列,同时保持 GC 富集区和 GC 缺乏区的参数不变。新生成的随机序列一号的图形显示表明,该随机序列仅包含一个 GC 缺乏区和 31 个 GC 富集区。另一个随机序列在富集区与缺乏区的数量上可能略有波动,但总体趋势应保持一致。
PKD1基因的随机序列数量少数倍。GC富集区域的数量比GC贫乏区域少十倍以上。下一个演示将使用另一种类型的MRI内容。
在同一基因组中,该人类基因的内含子包含多个与DNAex结构相关的富含嘌呤的区域。在MRI分析器网页中,将DNA内容切换为代表嘌呤的AG核苷酸。保持窗口大小为50个碱基,并将上限阈值更改为80%,下限阈值更改为10%。然后按下“分析文件”按钮以启动程序。
图中显示,该基因具有六个富含AG的区域,由蓝色垂直峰表示,以及十四个贫乏AG的区域,由红色峰表示。接下来,将PKD1基因获得的这些结果与具有相同寡核苷酸组成的随机序列的数据进行比较:首先切换至随机序列(例如编号2),并保持与之前测试相同的参数。该随机序列的图谱显示,其仅包含一个富含AG的区域,且无贫乏AG的区域。
会话期间生成的所有数据均保存在特殊文件中,可通过每个网页右上角的“下载文件”标签访问。打开此链接后,请下载输入序列以及所有生成的随机化序列。在此文件列表下方,提供有由 SRI 分析程序生成的寡核苷酸频率表的链接。
然后是链接到本次会话期间由 MRI 分析程序生成的所有结果。例如,单击文件 user a file RAND one four AGCO 50 32 14,该文件代表针对随机序列获得的结果。序列编号为一,其参数如下:AG 含量为 50 个核苷酸长度的窗口,上限阈值为 32 个核苷酸,下限阈值为 14 个核苷酸。
在此文件中,所有符合富含或贫乏内容标准的核苷酸序列片段及其坐标,均根据其在输入序列中的连续位置以列表形式提供。观看本视频后,您应能够充分理解如何操作基因组 MRI 计算资源。
本文介绍了一种用于基因组序列分析的计算型网络资源,重点在于检测非随机的核苷酸组成。该工具可生成具有相似寡核苷酸组成的随机序列,有助于研究基因组的异质性。
基因组MRI提供了一种计算方法,用于检测非编码DNA中非随机的核苷酸模式,通过识别具有潜在功能意义的调控元件来支持靶点验证。该方法通过将序列不均一性与基因表达和重组等生物学过程相关联,可在早期发现阶段实现机制层面的风险降低。该资源通过优先选择具有极端碱基组成的基因组区域用于下游检测开发,从而提高先导靶点鉴定的预测可信度。
该方法通过提供有关序列富集的定量输出,为生物学去风险决策提供依据,从而整合到从靶点验证、先导化合物鉴定直至临床前研究的整个发现流程中。