在不同测序深度和样本量下,使用CKB和EAS参考面板对三种填补工具——STITCH、QUILT2和GLIMPSE2——进行了基准测试。研究结果为在超低深度测序数据中选择合适的基因型填补策略提供了实用框架,有助于开展大规模人群基因组学和复杂性状研究。
方法文章
在不同测序深度和样本量下,使用CKB和EAS参考面板对三种填补工具——STITCH、QUILT2和GLIMPSE2——进行了基准测试。研究结果为在超低深度测序数据中选择合适的基因型填补策略提供了实用框架,有助于开展大规模人群基因组学和复杂性状研究。
超低深度测序(ULDS)是一种适用于大规模基因组研究的经济高效策略,但其应用效果依赖于准确的基因型填补。本研究利用中国嘉道理生物样本库(CKB)和千人基因组计划(1KGP)东亚人群(EAS)参考面板,评估了三种填补工具——STITCH、QUILT2 和 GLIMPSE2——在不同测序深度和样本量下的表现。研究揭示了关键的性能差异:样本量敏感性方面,STITCH 的准确性随样本量增大显著提升,而 QUILT2 和 GLIMPSE2 对样本量的依赖性极小;参考面板优化方面,人群特异性的 CKB 面板显著提高了 QUILT2 和 GLIMPSE2 的准确性,但对主要依赖内部单倍型推断的 STITCH 影响甚微;深度阈值方面,所有工具在中等测序深度(≥ 0.5x)下均达到稳健的准确性,但在超低深度(≤ 0.1x)时,STITCH 表现明显不足。GLIMPSE2 结合 CKB 实现了最高的整体准确性,而 QUILT2 在精度与计算效率之间实现了良好平衡。对于无创产前检测(NIPT)数据,GLIMPSE2+CKB 仍能保持足够的准确性以支持下游分析。本研究提出一个决策框架,优先推荐使用人群匹配的参考面板和适应测序深度的工具,为在不同研究场景下优化 ULDS-WGS 提供了可操作的指导建议。这些发现弥合了方法学进展与实际应用之间的差距,使基因组研究能够在不牺牲数据质量的前提下实现经济高效的规模化扩展。
超低深度测序(ULDS)是指测序深度低于1x的测序方法,因其成本低、基因组覆盖范围广以及适用于多种样本类型而受到广泛关注。ULDS已在无创产前检测(NIPT)1、癌症监测2和染色体拷贝数变异(CNV)检测3,4等临床应用中展现出重要价值。除临床诊断外,随着测序成本的持续降低和生物信息学的快速发展,ULDS在群体基因组学和复杂性状研究中正发挥着日益重要的作用。通过将ULDS数据与大规模群体单倍型参考面板相结合,基因型填补技术能够恢复个体水平的全基因组变异信息。因此,ULDS已成为传统单核苷酸多态性(SNP)芯片和高深度全基因组测序(WGS)的一种经济高效的替代方案,尤其适用于全基因组关联分析(GWAS)和群体结构分析等大规模研究5。
先前的研究已证明,利用无创产前检测(NIPT)测序数据开展多种遗传学研究是可行的,包括变异检测、群体历史重建、病毒感染模式推断以及全基因组关联分析(GWAS)6。
尽管具有这些优势,超低深度测序(ULDS)数据极度稀疏的特性仍带来了独特的挑战。在变异位点层面,许多位点完全未被检测到,或每个个体仅由单个等位基因代表,导致下游分析所需的数据质量不足。因此,基因型填补至关重要,它利用大型参考面板(例如 1000 Genomes7 或人群特异性资源)中的单倍型结构,通过统计学方法推断缺失或不确定的基因型。先前的研究表明,从无创产前检测(NIPT)数据进行填补可实现高准确性,并在全基因组关联分析(GWAS)中识别性状相关变异时保持强大的统计功效8。通过使用 STITCH9 算法,对中国20,900名孕妇队列的NIPT数据(平均深度约0.15x)成功进行了基因型填补,进而鉴定了与妊娠相关的位点。填补后的基因型与高深度全基因组测序(WGS)数据在GWAS结果中表现出高度一致性(Pearson R² > 0.8)10。
基于超低深度测序(ULDS)的分析的成功在很大程度上取决于填补(imputation)的准确性,而填补准确性又受到测序深度、参考面板的质量与人群匹配度、填补算法的性能、样本量以及等位基因频率谱的影响11。在这些因素中,参考面板的选择是决定填补准确性的主要因素。常用的参考面板包括具有全球代表性的资源,如1000基因组计划(1KGP)7、TOPMed12和单倍型参考联盟(HRC)13,以及越来越多可用的人群或地区特异性面板,例如新加坡一万个基因组(SG10K)14和中国嘉道理生物样本库(CKB)15。影响填补性能的另一个关键因素是算法的选择。已有多种工具被开发出来,以应对低深度测序带来的独特挑战,显著推动了填补方法在大规模遗传学研究中的实际应用。尽管Beagle(v5+)16、Minimac417和IMPUTE511等填补方法被广泛用于SNP芯片和中高深度全基因组测序(WGS)数据,但它们在ULDS条件下的表现往往不够理想。近年来,一些专用工具被开发出来以应对这些挑战。STITCH9可直接从低深度测序读段中推断单倍型,特别适用于大规模同质性队列。QUILT218采用压缩单倍型库和局部似然模型,能够在使用大规模参考面板时实现高效的填补,并在产前基因组学中具有独特应用价值。GLIMPSE219是原始GLIMPSE框架的扩展版本,在准确性和计算效率方面均实现了进一步提升。
尽管这些工具代表了重要的技术进步,但它们在不同实验设计(例如测序深度、队列规模和参考面板选择)下的相对性能尚未得到系统评估,导致研究人员在选择最合适的策略时缺乏明确指导。为填补这一空白,本研究对三种广泛使用的超低深度测序(ULDS)基因型填补工具——STITCH、QUILT2 和 GLIMPSE2——在多种测序深度和样本量条件下进行了系统性基准测试。评估采用了两个与中国人群高度相关的东亚参考面板。研究结果表明,在测序深度 ≥0.5x 时,ULDS 填补通常具有较高的可靠性;而测序深度 <0.1x 时,则需要显著更大的队列规模才能达到可接受的准确性。参考面板的选择应根据具体研究背景进行优化,使用与目标人群匹配的面板(如 CKB)可提高填补准确性。此外,这些方法可直接应用于大规模人群研究和无创产前检测(NIPT)中产生的超低深度测序数据。因此,本研究为基于 ULDS 的研究提供了工具选择的实用框架,为未来在群体遗传学和复杂性状分析中的应用提供了方法学指导。
访问受限。请登录或开始试用以查看此内容。
所有参与者在参与前均签署了书面知情同意书。涉及高深度全基因组测序(WGS)数据的研究已通过华大基因机构审查委员会(BGI-IRB 23058-T2)的审查和批准,并已获得中国人类遗传资源管理办公室关于人类遗传资源采集的批准([2023] CJ0262)。涉及来自无创产前检测(NIPT)的超低深度测序(ULDS)数据的研究已获得武汉市儿童医院机构审查委员会(2021R062)、华大基因机构审查委员会(BGI-IRB 21088)的批准,并获得了中国人类遗传资源管理办公室的额外批准([2021] CJ2002)。
注意:本研究包含两种类型的全基因组测序(WGS)数据。第一类为来自深圳自然人群队列中500名个体血液样本的高深度WGS数据(30x),用于构建高质量的基准数据集,并进行后续的降采样及准确性评估。第二类为来自武汉地区10,000名孕妇无创产前检测(NIPT)的超低深度测序(ULDS)数据。
1. 高深度全基因组测序数据
2. 超低深度无创产前检测数据(约0.1x WGS)
3. 数据预处理流程
4. 基因型填补
5. 填补准确度评估
访问受限。请登录或开始试用以查看此内容。
样本量对填补准确度的影响
将样本量从 N = 200 增加到 N = 500 提高了 STITCH 的填补准确度,尤其是在低测序深度条件下。例如,在 CKB 参考面板 1x 测序深度下,STITCH 的 R2> 从 0.882(N=200)提升至 0.916(N=500),提高了 3.4% (图 3;补充文件 2)。同样,在 0.5x 测序深度下,其准确度从 0.800 提高到 0.868(ΔR2> = 8.5%)。相比之下,QUILT2 和 GLIMPSE2 对样本量变化的敏感性极低,在所有测试条件下 R2> 波动均小于 0.5%。例如,QUILT2 在 CKB 面板 1x 测序深度下表现稳定(N = 200 时 R2> = 0.970,N = 500 时为 0.971)。这表明 STITCH 更能从更大的样本量中获益,这与其基于隐马尔可夫模型(HMM)的单...
访问受限。请登录或开始试用以查看此内容。
本研究系统评估了三种广泛使用的基因型填补工具在超低深度测序(ULDS)中的表现,以高深度全基因组测序(WGS)作为金标准。该研究的关键方法学优势在于采用了统一的预处理流程——包括序列比对、质量控制和碱基质量评分重校准——从而最大限度地减少批次效应,并确保不同工具和条件之间的可比性。通过对深度测序样本进行降采样,在受控条件下模拟出超低深度数据,从而为性能评估提供了客观的基准框架。将分析限定于1号染色体上一个定义明确的10 Mb基因组区间,既保证了计算的可行性,又保留了足够的变异位点密度。对STITCH、QUILT2和GLIMPSE2的比较评估揭示了不同填补策略各自的优势与局限性。
测序深度和样本量对填补准确性具有可预测的影响。当深度低于约0.1x时,准确性急剧下降,反映出稀疏的读段数据无法提供足够的信息以可靠地重建单倍型。更大的样本量通过更准确地推断群体单倍型结构,缓解了这一限制,这与理论预期一致:更多的样本可提高填补性能29。结果表明,即使在较小的样本量下,0.5x及以上的测序深度仍能对常见变异保持可接受的准确性;而低于0.1x的测序...
访问受限。请登录或开始试用以查看此内容。
作者声明无竞争利益。
本研究由深圳市医学研究基金(B2404004)、中国国家重点研发计划(2023YFC2605400,2022YFC2502402)、深圳市科技计划项目(SYSPG20241211173852024)、血管稳态与重构国家重点实验室(北京大学)开放研究项目(2025-SKLVHR-013)以及广东省重点领域研发计划(2023B0303040001)资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数据 | |||
| 10,000 例 NIPT 低深度样本 | 本文 | 用于填补基准测试的超低深度全基因组测序数据。 | |
| 500 例高深度 WGS 样本 | 本文 | 30× 高深度 WGS,作为金标准/真实数据集。 | |
| 参考面板 | |||
| 1KGP-EAS 参考面板 | 千人基因组计划(东亚) | 千人基因组计划中用于东亚血统特异性基因型填补的子集。 | |
| CKB 参考面板 | 中国嘉道理生物样本库 | 用于基因型填补的定制人群特异性面板。 | |
| 软件与算法 | |||
| BCFtools v1.11 | GitHub(samtools/bcftools) | 用于合并和排序染色体水平结果,以及变异位点过滤。 | |
| GATK 4.0.4.0 工具集中的 BQSR | 布罗德研究所 | 用于碱基质量评分重校准(BQSR)。 | |
| BWA-MEM .7.16a-r1181 | Heng Li / GitHub | 用于将原始测序读段比对至 GRCh38 参考基因组。 | |
| DPGT(分布式群体遗传学工具) | BGI | 一种分布式群体遗传学分析工具,支持对数百万 WGS 样本进行联合检测。可访问 [GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT) 获取。 | |
| fastp.0.23.4 | 开源软件(Chen 等,2018) | 用于质量控制和接头序列修剪。 | |
| GLIMPSE2 | 牛津大学 | 适用于低覆盖度 WGS 的快速基因型分型与填补工具。 | |
| 分析所用原始代码 | 本文 | 补充文件 1 分析所用原始代码 | |
| Picard 工具包 | 布罗德研究所 | 用于标记重复序列和文件格式转换。 | |
| Plink 2.0 | C. Chang, S. Purcell / 布罗德研究所 | 用于基因型格式转换和关联分析。 | |
| Python 3.8 | Python 软件基金会 | 用于脚本编写、自动化处理和数据分析。 | |
| QUILT2 | 牛津大数据研究所 | 基于隐马尔可夫模型(HMM)并使用外部参考面板进行基因型填补。 | |
| R 4.1.3 | R 基金会 | 用于运行 STITCH、QUILT2 以及绘图和统计分析。 | |
| SAMtools v1.3 | GitHub(samtools/samtools) | 用于操作 SAM/BAM 文件。 | |
| Seqtk-1.5 | GitHub(lh3/seqtk) | 用于处理 FASTA/Q 格式序列的工具包。可访问 [GitHub - lh3/seqtk](https://github.com/lh3/seqtk) 获取。 | |
| SOAPnuke | BGI | 用于高通量测序数据的质量控制和过滤。 | |
| STITCH v1.6.6 | 牛津大学 | 专为超低覆盖度测序优化的基因型填补工具。 | |
| tabix | GitHub(samtools/tabix) | 用于索引和查询经 bgzip 压缩的 VCF 文件。 | |
| 其他材料 | |||
| GATK 捆绑文件 | GATK | 可访问 [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json] 获取。 | |
| 1000G 的遗传图谱(GRCh38) | 牛津大学 / 千人基因组计划 | 基因型分型/填补工具所必需的输入文件。 | |
| GRCh38 | 基因组参考联盟 | 用于测序读段比对和变异检测。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可