2012年6月23日
混合DNA测序是一种快速且经济高效的策略,可用于在大样本队列中检测与复杂表型相关的罕见变异。本文介绍了利用SPLINTER软件包对32个癌症相关基因进行混合的下一代测序数据进行计算分析的方法。该方法具有可扩展性,适用于任何感兴趣的表型研究。
本实验的总体目标是鉴定在表现出大量罕见功能变异的个体群体中存在的基因。该目标首先通过汇集一组DNA样本实现,第二步是构建并测序新一代测序文库。
随后将测序读段比对至参考序列,并建立误差模型。最后一步是使用 splinter 算法进行计算分析。最终,通过对合并的下一代测序数据进行 splinter 分析,揭示在群体中携带大量罕见功能性变异的基因,从而演示该实验流程。
今天将由 Francesco Vilania 演示,他是我的导师兼合作者 Rob Mitra 实验室的一名研究生,他将与我实验室的研究生 Enrique Ramos 一同进行实验。该技术相较于现有方法(如单一个体基因型分析)的主要优势在于,它能够在混合的 DNA 分子群体中非常精确地检测出稀有序列变异,且无需任何先验信息。该方法有助于回答遗传学与基因组学领域的关键问题,例如如何确定在大规模队列研究中新型致病性稀有变异的频率。
每次裂解实验均需设置阴性对照和阳性对照,以获得最佳准确性。使用PFU超保真DNA聚合酶制备PCR反应混合液。阴性对照应为已知无遗传变异的任何DNA序列的PCR产物,例如克隆载体骨架。
此处使用来自 M13 MP18 载体的 1,934 个碱基对的扩增片段。阳性对照可以是整个群体中先前已验证过的任意一组序列变异。如果该数据不可用,本实验室设计了一种人工阳性对照,其包含一种来自 PGMT easy 载体中克隆的工程化序列混合物的 331 个碱基对的 PCR 产物,如本表所列。
这些序列经过组合,以模拟患者群体中真实变异位点的不同次要等位基因频率。按照本视频配套书面方案所述进行样本的PCR扩增后,使用Kyogen Kayak快速柱纯化试剂盒或配备真空泵的96孔滤板对大量样本进行PCR产物中过量引物的清除。纯化完成后,采用标准方法对每份PCR产物进行定量。
准备将所有PCR产物及对照按分子数归一化后合并成一个混合样本。若按浓度进行合并,会导致较小的扩增片段在混合样本中比例过高。相反,应按每个扩增片段归一化的分子数进行合并。
选择足够大的任意数值,以确保移液过程中的准确性。取出PCR产物和对照品。必须对PCR产物进行连接,因为小片段PCR扩增子的断裂可能会导致其末端序列在文库中比例偏高。
由于这一原因,我们在对扩增产物进行片段化之前,先将其连接至大片段载体中。根据方案中所列,使用T4连接酶、T4多核苷酸激酶(PNK)和PEG配制平末端连接反应体系。在22°C下孵育反应17小时。
随后在65摄氏度孵育20分钟,并在4摄氏度下保存。之后,取50纳克样品上样至琼脂糖凝胶,通过电泳检测连接结果。成功连接的样品会在泳道中出现高分子量条带。
通过将样本用 Qiagen PB 缓冲液按 10 比 1 稀释,降低其黏度,为采用随机超声波打断策略进行 DNA 片段化做准备。随后使用 24 样本对角线探头式生物破碎仪对大量 PCR 产物进行片段化处理,在 25 分钟内以高功率超声处理,每分钟循环 40 秒开启和 20 秒关闭。在琼脂糖凝胶上检测 DNA 片段化结果,并按照文中所述继续进行高通量测序。
开始测序时,需进行读段比对。可将原始测序读段文件转换为scarf格式,或对其进行压缩。压缩为可选步骤。
在不丢失任何相关信息的情况下,为后续分析步骤节省了时间和空间。使用附带的比对工具,将原始读段比对至已注释的快速参考序列。针对特定区域,包括PCR反应以及阳性和阴性对照。
输入格式必须为 scarf 格式或压缩格式。接下来,按照文中所述进行文件标记。每次运行都会生成独特的测序错误谱型,需对其进行表征,以准确建模每次运行的错误,从而实现精确的变异检测。
每个池样本文库中均包含一种已知存在序列变异的内参。从比对后的带标签文件中,使用所包含的工具并以阴性对照参考序列为基准生成错误模型文件,可使用全部阴性对照序列,或根据指定的5'端和3'端选择性地使用其中一部分序列。应始终应用唯一读段(unique reads)和伪计数(pseudo counts)。
该工具将生成三个文件,文件名以输出文件名参数命名,分别以零、一或二结尾。这些文件对应于使用 splinter 进行变异检测时的零阶、一阶和二阶误差模型。在可视化运行误差率谱型时,应始终使用二阶误差模型。
可用于绘制误差模型图的 Pearl 脚本,亦可用来基于零阶误差模型文件生成 PDF 格式的误差图。该图文件将揭示特定测序运行的误差趋势,并可用于推断分析中读段的最大碱基数。下一部分将演示如何在比对后的文件上运行 splinter,利用误差模型检测稀有序列变异。
分析的第一步是使用参考序列和错误模型,对已比对的文件运行 splinter 程序。若发现单个测序读段的碱基存在缺陷,可将其从分析中排除。P 值截断值决定了变异位点 calling 分析的严格程度。
最低截断值设为 -1.301 是一个良好的起点。池大小选项通过排除实际样本池中频率低于单个等位基因的次要等位基因可能带来的变异,从而优化算法的信号与噪声区分能力。池大小选项应设置为大于实验中分析的等位基因实际数量的最接近值。
在较低频率下检测到的变异将被视为噪声而忽略。输入所有参数和文件名后,运行 splinter。该文件将返回在样本中具有统计学显著性的所有变异结果,并包含变异位置和变异类型的描述。
该变异位点在每条DNA链上的P值频率及每条DNA链的总覆盖度。该列表小瓶由splinter用于在样本间标准化覆盖度。第一个字段表示感兴趣的扩增子,第二个字段表示突变所在的位置。
N 表示该序列的其余部分不包含任何突变。归一化过程中,对阳性对照的分析是提高特定实验运行的敏感性和特异性的关键。这一点非常重要,因为最初的 -1.301 截断值很可能不足以完全消除所有假阳性结果。
每次裂变分析将显示每个已检出变异位点的实际 P 值,而该值无法在分析前预先确定。然而,可以通过采用初始结果中已知真实阳性碱基位置所显示的最宽松 P 值,重复进行整个分析。这种方法能够在保留所有真实阳性结果的同时,排除大部分甚至全部假阳性结果,因为假阳性结果的 P 值通常远不如真实阳性结果显著。
为了自动化此过程,可以使用截断值测试脚本。该脚本需要一个裂解物输出文件以及一份以制表符分隔的阳性对照命中结果列表文件,后者格式应与归一化所用文件相同。最终输出结果将是一系列逐步接近最优值的截断值列表。
最后一行代表该次运行的最优截断值,因此可用于数据分析。理想的结果是达到灵敏度和特异性均为1。然而,如果未达到该理想值,可通过改变整合的读取碱基数来优化碎片分析。
可以使用 cutoff cut 脚本对数据应用最终的截断值,该脚本将过滤掉低于最优截断值的 splinter 输出文件中的命中结果。此步骤将生成最终的 splinter 输出文件,其中包含样本中存在的 snips 和 indels。请注意,插入事件的输出结果与替换或缺失事件的输出略有不同。
此类图表展示了在混合样本中单个等位基因的检测准确率随测序深度的变化情况。准确率通过受试者工作特征曲线下面积(简称AUC)进行估计,其取值范围从随机水平的0.5到完全准确的1.0。本示例中,AUC被绘制成在包含200、501和1000个等位基因的混合样本中检测单个突变等位基因时,各等位基因测序深度的函数。
此处将插入、缺失和替换的总错误数(UC)绘制成图。该错误图显示了在特定位置掺入错误碱基的概率。错误谱显示出较低的错误率,并且随着测序读段向3'端延伸,错误率呈逐渐上升趋势。
值得注意的是,不同的参考核苷酸表现出不同的错误概率。该图展示了 splinter 在估计每个等位基因测序深度超过 25 倍位点的等位基因频率时的准确性。splinter 估计的混合 DNA 等位基因频率与全基因组关联研究(GWAS)结果中测得的等位 基因计数之间的比较。
在高度相关的样本中,针对超过20千碱基的区域,选取了974名个体进行测序。采用Splinter工具检测稀有变异。根据标准流程,每个个体此前均已通过全基因组关联研究(GWAS)完成基因分型,并对已标记变异与新发现变异的基因分型结果进行了一致性验证。
在混合样本中检测到的变异结果非常理想。通过测序结果鉴定出三个变异,其中两个在人群中属于罕见变异,且为新发突变(denovo);这些变异通过个体焦磷酸测序得到验证,焦磷酸测序与混合测序之间的次要等位基因频率或数学一致性结果良好。在您完成混合样本中罕见变异的鉴定后,许多研究者通常希望了解所发现变异的功能影响。
因此,在开发之后,对变异进行注释成为该流程的下一步。该技术为DNA测序领域的研究人员提供了研究稀有变异的新途径,使其能够以快速且经济高效的方式在大规模人群研究中表征稀有变异。观看本视频后,您应能够很好地掌握如何利用splinter在DNA样本池中检测稀有序列变异。
混合DNA测序是在大群体中鉴定与复杂性状相关的罕见遗传变异的有效方法。本文详细介绍了利用SPLINTER软件包对32个癌症相关基因的混合测序数据进行的计算分析。
在复杂疾病研究中,常见变异无法解释表型变异,因此在大群体中检测稀有基因组变异对于靶点验证至关重要。基于SPLINTER技术的混合测序方法提供了一种经济高效、可扩展的策略,能够在无需预先了解变异信息的情况下识别低频功能变异,从而验证治疗假设。该方法通过在与疾病相关的队列中进行等位基因频率估计和变异确认,支持早期发现阶段的风险降低,直接为项目组合优先级排序和后续机制研究提供依据。
该方法适用于从假设生成到先导物鉴定的整个发现流程,所提供的变异检测结果可用于指导靶点选择和检测方法的建立。