方法文章

使用校准差分RNA编辑扫描仪实现RNA编辑位点的高精度检测

DOI:

10.3791/71148

2026年6月23日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案描述了校准型差异RNA编辑扫描仪(CADRES)的使用方法,这是一种计算流程,通过整合DNA-RNA联合变异检测、信号优化重校准以及考虑重复实验的统计建模,以高精度识别差异RNA编辑位点。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

准确界定RNA编辑在技术上仍然具有挑战性,因为必须将真实的转录后修饰与基因组变异及测序假象区分开来。这一困难在APOBEC酶催化的胞苷向尿苷(C-to-U)编辑中尤为显著,其中DNA与RNA的混合变化掩盖了真实的编辑信号。校准型差异RNA编辑扫描器(Calibrated Differential RNA Editing Scanner, CADRES)提供了一种结构化的计算框架,通过整合DNA–RNA变异分析和对真实编辑特征的靶向保留,以克服这些局限性。本方案介绍了CADRES的工作流程,包括数据准备、联合RNA变异检测、信号保留型碱基质量重校准、假象过滤,以及在不同实验条件下对RNA编辑进行差异分析。CADRES支持配对的RNA-seq与全基因组或全外显子组测序,并要求具备生物学重复。 该方法采用多阶段过滤策略,包括同聚物区域去除和基于PBLAT的旁系同源筛选,系统性地减少假阳性结果,同时保留低频编辑事件。通过将校准步骤与考虑重复样本的建模方法相结合,CADRES提高了RNA编辑分析的精确性和可重复性,从而能够探究多种生物学背景下编辑动态的变化。与现有方法相比,CADRES旨在提升RNA编辑检测的准确性,尤其适用于APOBEC介导的C-to-U编辑事件。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA编辑构成了转录后调控的一个动态层次,能够在不改变DNA序列的情况下实现RNA转录本中特定位点的核苷酸替换。在后生动物中,由ADAR酶介导的腺苷向肌苷(A>I)脱氨是主要形式,参与转录本多样化、mRNA稳定性维持、先天免疫调节以及神经功能1,2。由APOBEC家族成员催化的胞苷向尿苷(C>U) (在生物学语境中下文简称为"C>U";在测序语境中称为"C>T")脱氨作用与这些通路并行存在,参与脂质代谢、病毒限制、诱变过程,并在免疫和癌症生物学中发挥新兴的调控作用3,4,5,6,7。近期研究表明,多种APOBEC酶(包括APOBEC1、APOBEC3A和APOBEC3B(A3B))在生理和病理条件下均可催化RNA编辑3,4,7,8,9,10。APOBEC3酶还可诱导DNA编辑,产生与RNA编辑重叠的突变特征,从而增加了区分RNA编辑与基因组变异的难度8,10,11,12

新一代测序技术已实现转录组范围内潜在RNA编辑位点的鉴定,但区分真实的编辑事件与基因组SNV或技术噪声仍然具有挑战性。A>I和C>U事件在cDNA文库中表现为A>G和C>T的替换,可能因引物错配、聚合酶错误、比对假象以及特定序列背景下的表达变化而产生干扰。公共数据库如REDIportal13已收录数百万个A>I编辑位点,而C>U的注释仍较为稀少,这反映了生物学和分析方法上的双重限制。因此,可靠地鉴定C>U编辑——尤其是不同条件下发生的编辑变化——仍是一个尚未满足的分析需求。

本文所介绍方法——校准差异性RNA编辑扫描仪(Calibrated Differential RNA Editing Scanner, CADRES)的总体目标,是精确定位差异性RNA变异位点(Differential Variants on RNA, DVRs):即在两个或多个特定条件下,编辑深度发生统计学显著变化的RNA编辑位点。14在开发本方案时,我们力求解决两个长期存在的障碍。第一, 真正有效的 RNA编辑必须与DNA编码的变异区分开来。其次,需要在生物学重复的RNA-seq数据集之间以统计稳健的方式量化编辑差异。CADRES的核心创新在于将DNA/RNA联合变异检测与在碱基质量评分重校准(BQSR)过程中对RNA变异的校准化处理相结合。这种“增强重校准”策略在BQSR过程中保留新发现的RNA编辑位点,从而防止对低频编辑位点因系统性质量降级而导致的检测灵敏度下降。15,16,17该方法相较于仅依赖不完整RNA编辑数据库的分析流程,可减少假阴性结果并提高特异性。

CADRES 位于一系列针对 RNA 编辑分析不同方面的研究方法之中。SNPiR18 和 RVboost19 可从仅基于 RNA 的变异集合中过滤人工假象;VaDiR20 引入了 DNA–RNA 比对分析,但未对重复实验结构进行建模;rMATS-DVR21 采用基于广义线性混合模型(GLMM)的差异检验方法,但完全依赖 RNA-seq 数据;而 JACUSA/JACUSA222,23 支持考虑重复实验的检测,却未整合联合 DNA–RNA 分析或校准优化策略。CADRES 将考虑重复实验的统计建模、联合 DNA/RNA 变异检测以及富集新发编辑位点的再校准策略统一起来,提供了一套优化的单一流程,用于检测依赖于特定条件的 RNA 编辑事件——包括与 APOBEC 活性相关的 C>U 事件10,11,12

在此背景下,当实验体系满足以下条件时,用户可考虑采用 CADRES。首先,已有来自相同样本的配对 RNA 测序与全基因组或全外显子组测序数据,从而能够严格区分源自 RNA 的编辑事件与 DNA 编码的变异。其次,所研究的生物学问题涉及不同条件下 RNA 编辑的变化——例如酶的诱导、环境应激、发育阶段或疾病状态——此时对重复样本中等位基因特异性测序深度进行统计建模至关重要。第三,研究者希望提高 C>U 编辑检测的特异性,而准确区分 RNA 编辑事件与 APOBEC 驱动的 DNA 突变尤为关键。CADRES 在 APOBEC 活性同时引发 RNA 与 DNA 编辑的体系中尤其具有价值,如可诱导 A3B 模型中所示10,11,12,而在这些体系中,传统的仅依赖 RNA 的方法由于受到混淆性单核苷酸变异(SNVs)或重复序列干扰等因素影响,假阳性率显著升高。

CADRES 具有多项实用优势。其联合的 DNA/RNA 变异检测可减少由单核苷酸变异(SNV)驱动的假阳性结果。Boost 重校准能够保留真实的编辑信号,包括参考数据库中不存在的新颖编辑事件。基于 rMATS 的广义线性混合模型(GLMM)为跨重复样本的差异编辑分析提供了具有统计学依据的分析框架。这些特性共同构建了一个经过校准、高精度的平台,可用于在实验和疾病背景下研究动态 RNA 编辑。在我们之前的研究14中,CADRES 通过计算机模拟数据集和真实世界的可诱导 A3B 细胞模型,与现有的 RNA 编辑检测方法进行了严格基准测试。在计算机模拟评估中,CADRES 在不同重复数下始终实现了 0.85–0.95 的精确度得分和 0.92–0.98 的准确度得分。整体 CADRES 工作流程如图 1所示。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案描述了一种完全基于计算的生物信息学工作流程,用于利用CADRES框架鉴定C>U RNA编辑事件。所有步骤均在Linux环境中通过命令行执行。仅使用公开可用的测序数据集,不涉及人类或脊椎动物受试者。

1. 环境设置与软件安装

注意:CADRES 工作流程的最低计算要求如下:CPU ≥ 8 核(推荐 16 核),RAM ≥ 32 GB(全基因组数据集推荐 64 GB),磁盘空间 ≥ 100 GB。

  1. 确认系统中已安装 Linux 操作系统。打开终端窗口,并确保当前用户环境具有安装权限。
  2. 如果系统中尚未安装 Conda 包管理器,请先进行安装。从其官方网站下载最小版本的 Conda 安装程序,并按照屏幕提示执行安装脚本。
  3. 通过输入以下命令验证 Conda 是否已正常启用,并确保该命令输出有效的版本号。
    $ conda --version
  4. 为 CADRES 工作流程创建一个工作目录。使用以下命令进入该目录:
    $ cd /path/to/working_directory
  5. 通过执行以下命令下载 CADRES 源代码:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. 运行以下命令进入克隆的目录:
    $ cd CADRES
  7. 使用 CADRES 代码仓库中提供的 environment.yml 文件创建独立的 Conda 环境。执行以下命令,并确保安装过程完整无中断地完成:
    $ conda env create -f environment.yml
  8. 通过输入以下命令激活新创建的环境。通过检查终端提示符是否显示环境名称,确认环境已成功激活:
    $ conda activate CADRES
  9. 验证所需命令行工具是否已正确安装。依次执行以下每条命令,并确认每条命令返回的是版本号而非错误信息:
    $ python --version
    $ samtools --version
    $ gatk --help
    $ bedtools --version
    $ pblat

    注意:CADRES 环境中包含的工具集合可能因 environment.yml 文件的更新而略有不同。若发现工具缺失,请重新创建环境或按需更新依赖列表。
  10. 确保系统具有足够的磁盘空间。通过输入以下命令确认至少有 100 GB 的可用空间,用于存储参考基因组、比对索引和中间 BAM 文件:
    $ df -h
  11. 通过创建测试文件,确认在所有工作目录、输出目录和临时目录中均具有写入权限:
    $ touch test_file.txt
  12. 随后通过输入以下命令删除该文件:
    $ rm test_file.txt

2. 数据准备

注意:本方案中使用的代表性数据集包括:含有强力霉素诱导型 A3B–GFP 的 HEK293T 细胞;33× 深度的全基因组测序(WGS);链特异性双端 RNA 测序(2×150 bp,每样本 ≥6000 万条读长);每种条件(DMSO 与强力霉素处理 72 小时)设置 n = 3 个生物学重复。完整数据:SRA PRJNA1211186。chr22 的演示子集已提供在 CADRES 数据库中。

CADRES 需要满足以下条件:(i) 全基因组测序(WGS,≥33×)或全外显子组测序(WES,≥33×);(ii) 链特异性的双端 RNA-seq(每个样本 ≥6000 万条 reads);(iii) 至少两个实验条件,每个条件包含 ≥2 个生物学重复。

  1. 准备参考基因组和注释。
    1. 从 Ensembl 或类似数据库下载参考基因组(FASTA)和 GTF 注释文件。推荐使用的参考基因组为 Ensembl GRCh38 主要组装版本:https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/;推荐使用的 GTF 注释文件为 GENCODE 第 45 版:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/
    2. 索引参考FASTA文件:
      $ samtools faidx FASTA_FILE.fa
      确保所有参考材料中的染色体命名规范(例如,“chr1”与“1”)保持一致。
  2. 获取测序数据。
    1. 获取测序深度 ≥33× 的DNA测序FASTQ文件(全基因组测序或全外显子组测序)。
    2. 获取链特异性的双端RNA测序FASTQ文件,每个样本的测序读长远超过6000万条,涵盖两种生物学条件,每组至少包含两个生物学重复。
  3. 使用 BWA-MEM 比对 DNA 测序读段。
    1. 构建BWA索引:
      $ bwa index Homo_sapiens.GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. 比对并转换为 BAM 格式:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | samtools view -b > wgs.bam
  4. 使用 STAR 将 RNA 测序读段进行比对。
    1. 生成 STAR 基因组索引:
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens.GRCh38.dna.primary_assembly.fa
      --genomeDir STAR_index \
      --sjdbGTF文件 Homo_sapiens.GRCh38.gtf
    2. 比对RNA测序读段
      $ 星号 \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens.GRCh38.gtf
      --outSAMtype BAM 未排序 \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix 第一次比对_

      注意:这将生成一个剪接连接位点文件(pass1_SJ.out.tab),其中包含已注释的和新的连接位点。
    3. 重新生成包含新剪接位点的STAR基因组索引:
      $ cat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens.GRCh38.dna.primary_assembly.fa
      --genomeDir STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens.GRCh38.gtf
      --sjdbFileChrStartEnd SJ_all.tab
    4. 使用更新后的索引进行第二轮比对。
      $ STAR \
      --genomeDir STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens.GRCh38.gtf
      --outSAMtype BAM SortedByCoordinate \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix 输出文件名前缀
  5. 准备辅助参考资源。
    1. (推荐)获取 dbSNP VCF
      从 NCBI FTP 服务器下载人类 GRCh38 dbSNP VCF 文件(例如,dbSNP build 150):
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ 将下载的文件(例如,dbsnp_150.vcf.gz)放入工作目录。
      注意:RNA来源的条目(molType="cDNA") 在 dbSNP 中可能会掩盖真实的 RNA 编辑位点。使用以下方法将其排除:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (推荐)对 dbSNP VCF 进行排序
      对VCF文件进行排序,使其与参考基因组和GATK兼容:
      $ gatk SortVcf \
      -I dbsnp_150.vcf.gz \
      -O dbsnp_150.sorted.vcf.gz \

      --sequence-dictionary Homo_sapiens.GRCh38.dict
    3. (推荐)对排序后的 dbSNP VCF 进行索引
      为已排序的 dbSNP VCF 文件创建索引:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      注意: 需要一个匹配的参考字典。如果文件 Homo_sapiens.GRCh38.dict 缺失,按如下方式生成:
      $ gatk CreateSequenceDictionary \
      -人 Homo_sapiens.GRCh38.dna.primary_assembly.fa \
      -O Homo_sapiens.GRCh38.dna.primary_assembly.dict
    4. (推荐)获取 gnomAD 体细胞系 VCF 文件
      从以下网址下载 GRCh38 gnomAD 体细胞系变异位点 VCF 文件:https://gnomad.broadinstitute.org/downloads 根据分析流程选择适用的基因组 VCF 文件(例如, gnomad.genomes.vX.X.sites.vcf.gz).
    5. (推荐)对 gnomAD VCF 进行排序
      使用相同的参考字典对 gnomAD VCF 文件进行排序,以确保兼容性:
      $ gatk SortVcf \
      - I gnomad.vcf.gz \
      -O gnomad.sorted.vcf.gz
      --sequence-dictionary Homo_sapiens.GRCh38.dict
    6. (推荐)对排序后的 gnomAD VCF 进行索引
      为排序后的 gnomAD VCF 创建索引:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      注意:在运行 SortVcf 之前,确保染色体命名(例如,“chr1” 与 “1”)与参考 FASTA 文件中的命名一致。
  6. 获取已知的RNA编辑参考序列。
    注意:适用于 CADRES 的兼容 REDIportal 参考文件(rediportal.txt)已在 CADRES 仓库中整理,可直接从以下地址下载:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0。该文件用于在步骤3中对已知的编辑事件进行注释。
  7. 准备RefGene格式的基因注释。从UCSC下载RefGene注释文件(例如refGene.txt.gz)。如有需要,解压缩文件,并确保染色体名称与参考基因组中的染色体名称一致。
    注意:CADRES 示例样本已在 CADRES 仓库中整理,可直接从以下地址下载:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

CADRES 分析工作流程的执行

注意:第 3 节需在激活 CADRES Conda 环境的 Linux 终端中执行。

  1. 校准与 Boost 重校准
    注意:步骤 1 对 BAM 文件进行标准化,并执行 Boost 重校准——一种增强的碱基质量评分重校准(BQSR)方法,整合了 dbSNP、gnomAD 以及一组初步的 RNA 编辑候选位点,以保留真实的编辑信号。列出所有 RNA BAM 文件,以空格分隔。输出:重校准后的 BAM 文件(后缀:_recalibration.bam)和 Boost 候选位点。
    1. 执行步骤 3.1:
      $ python pipeline_step1_calibration.py \
      --rna_bams /path/to/rna_sample1.bam /path/to/rna_sample2.bam ... \
      --dna_bam /path/to/wgs_normal.bam \
      --genome /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --prefix project_demo

      注意:Boost 候选位点基于初步的联合 DNA-RNA Mutect2 调用结果构建(--max-events-in-region 4,仅 PASS 滤过;无额外的等位基因频率/质量阈值)。同聚物和重复区域的过滤将在步骤 3.2 中处理。
  2. 变异检测、污染估计与过滤
    注意: 步骤 3.2 使用 gnomAD 进行联合 DNA-RNA 变异检测并估计样本污染,随后基于同聚物上下文和 PBLAT 重新比对对候选位点进行过滤。输出:{prefix}.final.vcf。
    1. 执行步骤 3.2:
      $ python pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --genome /path/to/hg38.fa \
      --gnomad /path/to/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --prefix project_demo

      注意:此步骤生成最终的严格过滤后的变异调用集(project_demo.final.vcf),代表所有样本中高置信度的 RNA-DNA 差异。关键参数:Mutect2 --min-median-base-quality 12,--max-events-in-region 4;PBLAT minbasequal 5;所有参数已在流程脚本中预配置。
  3. 统计检验与功能注释
    注意:步骤 3.3 使用源自 rMATS 的广义线性混合模型(GLMM)量化差异性 RNA 编辑(采用 Benjamini-Hochberg FDR 校正),并对每个位点进行基因区域、基因符号及已知编辑状态的功能注释。输出:{prefix}_Result.txt(包含 P 值和 FDR 的 DVRs)。
    PBLAT 重新比对过滤器会移除映射到多个基因组位点的候选位点,从而提高重复区域中的特异性。其内部 THREAD_COUNT 由 pipeline_step2_variant_calling.py 中的 --threads 参数控制。
    1. 执行步骤 3.3:
      $ python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --genome /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --known_editing /path/to/rediportal.txt \
      --gene_anno /path/to/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --labels Control Treated

      注意:关键参数包括:samtools mpileup -q 30(最小比对质量),-Q 17(最小碱基质量);rMATS-GLMM 似然比检验,Δψ 截断值 = 0.0001,采用 binomial logit 链接函数并结合考虑重复样本的多元正态惩罚项(rho = 0.9);Benjamini-Hochberg FDR 校正;所有参数已在流程脚本中预配置。
      全部三个流程步骤均支持通过 --threads 参数实现多线程运行(默认每步 4 线程)。步骤 2 还额外支持 --contamination_threads 参数(默认 2 线程)。

4. 结果检查与可视化

  1. CADRES 工作流程完成后,导航至输出目录。主结果文件 {prefix}_Result.txt 列出了所有检测到的 RNA 差异变异(DVR),包括基因组坐标、等位基因、重复水平的等位基因计数、编辑比例、组间差异以及相关的统计指标(P 值和 FDR)。还包含基因水平的注释信息(基因符号、区域、链、变异类型、已知 SNP/编辑状态)。配套的摘要文件 {prefix}_Result_summary.txt 提供了每种替换类型的计数,并将其分类为 SNP DVR、已知 RNA 编辑 DVR 和新发现 DVR。
  2. (可选)通过运行后续分析脚本生成标准可视化图表。打开 R 会话并输入:
    R 控制台:
    source("Post-analysis.R")
    脚本 Post-analysis.R 包含在 https://github.com/junsun-hash/CADRES/ 中。
  3. 将出现一个文件选择对话框;请选择 {prefix}_Result.txt。该脚本将生成六张 PNG 图像。
    注意:文件选择对话框需要桌面版 R 会话。在无界面服务器上,需直接编辑输入文件变量(Post-analysis.R 第 10 行)并运行 Rscript Post-analysis.R。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了在接近真实的实验条件下评估CADRES,我们在293T细胞中使用了可诱导的APOBEC3B(A3B)系统。将表达A3B-GFP的多西环素响应型慢病毒载体导入293T细胞,并用嘌呤霉素筛选获得稳定整合的细胞克隆。经多西环素诱导72小时后,A3B-GFP表达显著增强,GFP荧光信号及A3B mRNA水平升高均证实了这一点。随后,对经诱导与未诱导的配对样本进行统一的DNA和RNA提取、文库构建及测序,以确保所观察到的RNA-DNA差异反映的是真正的A3B依赖性编辑事件,而非技术性噪声。完整的原始数据集已存入SRA数据库,编号为PRJNA1211186;为便于演示和测试,部分22号染色体区域(chr22:28,000–30,000 kb)的数据子集也已上传至CADRES的GitHub代码仓库(https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0)。

运行后,CADRES 会生成包含 DVR 坐标、编辑分数、P 值和 FDR 的 {prefix}_Result.txt 文件。预期输出包括:(i) DVR 计数与生物学编辑活性一...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍的CADRES工作流程提供了一种经过校准且内部一致的策略,可高特异性地检测差异性RNA编辑事件,尤其是由APOBEC酶催化的C>U脱氨反应。该方案中的多个步骤对其准确性至关重要。匹配的基因组和转录组测序对于区分真实的RNA编辑与潜在的DNA多态性必不可少,而提升重校准步骤则可防止在碱基质量分数重校准过程中错误地惩罚真实的RNA变异。同样重要的是序列组成和比对过滤步骤,它们可减少因同聚物重复序列或多向比对读段引起的假阳性结果,以及使用链特异性的等位基因深度测量方法。对差异编辑事件的可靠识别还依赖于在rMATS广义线性混合模型中正确设定重复结构。

尽管CADRES被设计为端到端的分析流程,但其多个组件可根据实际限制进行调整。在无法获得全面基因组数据的情况下,可使用高深度外显子组测序替代全基因组测序,但需注意浅层或亚克隆突变可能仍无法充分解析。对于具有高度重复转录本或存在广泛成簇编辑的生物体系的研究人员,可能需要对变异检测参数进行适度调整,或采用更严格的比对过滤条件。常见问题排查通常包括验证链注释的正确性、确保用于重校准的已知位点列表构建无误,以及确认所有重复样本中的测序...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S.、Z.D. 和 C.Z. 是上海生物制品研究所的员工,该机构目前正从事治疗性生物制剂的商业化开发。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究由上海市科学技术委员会(23S11901100)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
BCFtoolsSamtools项目N/A版本 1.21。变异调用和VCF操作。URL: https://github.com/samtools/bcftools
BedtoolsQuinlan实验室N/A版本 2.31.1。基因组算术操作。URL: https://github.com/arq5x/bedtools2
BiopythonBiopython项目N/A版本 1.85。分子生物学的Python工具。URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/A版本 0.7.18。DNA序列比对。URL: https://github.com/lh3/bwa
CADRES源代码GitHub (junsun-hash/CADRES)N/A版本 1.0.0。CADRES管道脚本。URL: https://github.com/junsun-hash/CADRES
Conda或MinicondaAnaconda Inc.N/A版本 23.1。包和环境管理器。URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/A版本 155。常见的生殖细胞变异数据库。URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/A版本 4.3.0.0。基因组分析工具包。URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/A版本 2.39。版本控制系统。URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/A版本 3.1。人口等位基因频率。URL: https://gnomad.broadinstitute.org
GTF注释文件EnsemblN/A版本 109。GRCh38的基因注释。URL: https://www.ensembl.org
人类参考基因组GRCh38Ensembl/UCSCN/A版本 109。参考基因组组装。URL: https://www.ensembl.org 或 https://hgdownload.soe.ucsc.edu
Linux工作站或服务器多种N/AUbuntu 20.04。需要x86_64架构。URL: https://ubuntu.com
pblatUCSC基因组浏览器N/A版本 2.5.1。并行BLAT重对齐。URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/A版本 2.20.8。NGS数据操作。URL: https://github.com/broadinstitute/picard
PythonPython软件基金会N/A版本 3.9.19。编程语言。URL: https://www.python.org
RR基金会N/A版本 4.5.2。统计计算。URL: https://www.r-project.org
R包: forcatsCRANN/A版本 1.0.0。因子操作。URL: https://cran.r-project.org/package=forcats
R包: ggplot2CRANN/A版本 4.0.1。数据可视化。URL: https://cran.r-project.org/package=ggplot2
R包: ggrepelCRANN/A版本 0.9.5。文本标签排斥。URL: https://cran.r-project.org/package=ggrepel
R包: lme4CRANN/A版本 1.1.35。线性混合效应模型。URL: https://cran.r-project.org/package=lme4
R包: readrCRANN/A版本 2.1.5。快速文件读取。URL: https://cran.r-project.org/package=readr
R包: stringrCRANN/A版本 1.6.0。字符串操作。URL: https://cran.r-project.org/package=stringr
REDIportal参考博洛尼亚大学N/A版本 2.0。A-to-I RNA编辑位点数据库。URL: http://srv00.recas.ba.infn.it/atlas/
RefGene注释UCSC表浏览器N/A版本 109。基因结构注释。URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools项目N/A版本 1.21。BAM文件操作。URL: https://github.com/samtools/samtools
STAR对齐器GitHub (alexdobin/STAR)N/A版本 2.7.11b。RNA-seq对齐。URL: https://github.com/alexdobin/STAR

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

RNA APOBEC C to U RNA RNA

相关文章