2026年8月21日
本方案提供了一种可重复的空间转录组数据分析工作流程,指导用户完成公共数据获取、基于Seurat的质量控制、数据整合、空间特征检测、细胞类型去卷积、感兴趣区域注释以及细胞间通讯分析,并设置了实用的检查点,以支持透明化的操作执行。
大家好。在本视频中,我们将逐步介绍一个实用的空间转录组数据分析流程,从数据获取与加载,到基础探索,再到最终的高级分析。总体而言,该工作流程包含三个主要步骤。
第一步,下载数据;第二步,获取分析代码;第三步,运行流程以生成结果。第一步:数据获取与目录结构准备。首先,获取公开的空间转录组数据集。
下载原始数据存档文件,并解压该存档。将文件整理为标准化的目录结构。
首先,创建一个主数据目录,然后为每个样本创建一个专用的子目录。将每个样本的以下必要文件传输到相应的子目录中。接着,在每个样本目录内创建一个空间子文件夹。
将以下文件放入 spatial 子文件夹中。将过滤后的特征 PC 指标 S1 文件放入样本的主子目录中。解压缩 spatial 文件夹中的 gzip 文件。
确保原始文件名完全符合“加载10X空间数据”功能的要求。第二步,软件环境配置。此处跳过R语言的安装,数据处理流程从获取GitHub仓库中的分析脚本开始。
通过执行文件指挥器中的脚本 setup R,从 Graham 安装所需的 R 包。通过执行官方文档表中提供的安装命令来安装 auto suit。导航至官方安装 URL 以获取安装脚本。根据安装页面说明,初始化所需的 Python 环境和系统依赖项。
通过访问 GitHub 仓库获取自定义工具,并下载源代码。进入 TOS 目录并安装 Python 依赖项。第三步,空间数据加载与质量控制。
将空间数据读取到 Seurat 对象中。使用读取 10X 图像功能手动加载高分辨率组织图像,并指定图像及其文件名。
使用 load 10X spatial 参数,将图像设置为上一步中创建的图像对象,并生成 Seurat 对象。计算质量控制指标。使用 percentage feature set 并以 mt 为模式计算线粒体读段的百分比。
根据质控指标可视化并解读数据。使用小提琴图函数生成 nCount_Spatial、nFeature_Spatial 和 percent.mt 的小提琴图。
使用空间特征图创建这些指标的空间特征图,并识别组织区域外的点。可选步骤:应用滤波器去除低质量的点。
运行脚本后,可以获得这些结果,包括质控指标和特征空间图。第四步,数据预处理、整合与聚类。在预处理单个样本时进行标准化。
使用 Spatial 检测对每个样本分别进行 SCTransform 标准化。整合多个样本。准备用于整合的 SCTransform 标准化对象列表。
通过复制空间检测方法,确保每个对象均具有RNA检测。在PREP SCT整合中使用“选择整合特征”以识别共有的可变特征。使用“寻找整合锚点”并选择SCT归一化方法来寻找整合锚点。
使用 IntegrateData 整合数据。在整合后的检测数据上进行聚类的降维分析。利用 runPCA 对整合后的数据执行主成分分析(PCA)。
通过计算累计解释方差来确定下游分析所需的最优主成分数量。通过程序识别肘点。使用确定的主成分数量运行 UMap。
使用 FindNeighbors 和 FindClusters 对细胞进行聚类。在设定分辨率 0.5 的情况下,指定已确定的主成分(PCs)。利用 FindWorkers 函数对目标组间进行差异表达分析。
鉴定空间可变基因。针对每个原始样本,使用 Moran's I 方法在 SCT 检测数据上运行“寻找空间可变特征”以计算空间自相关性。运行此脚本后,您可获得肘部图、UMap 图、聚类图、聚类标志物热图、火山图、空间特征差异表达基因图、空间可靠基因图以及结肠层标志物图。
以及结肠层标记物的点图,连同空间特征图中的标记物。第五步,单细胞参考数据预处理。使用 read 10X 读取单细胞 RNA-seq 计数矩阵,并创建 Seurat 对象。
进行标准的质控归一化和去重。计算过滤后细胞中线粒体reads的百分比。使用SC转换方法对数据进行归一化。
设置 vara.to 以回归 percent.mt。进行长PCA UMap分析,并使用前述步骤中描述的动态PC选择方法对细胞进行聚类,然后注释细胞类型。
使用 AddModuleScore 计算经典细胞类型标记基因的模块评分。根据模块评分和已知生物学特征对聚类进行注释。或者,从元数据中导入预先计算的注释。
学习完该脚本后,您可以获得质控指标。他们已上传了按簇分布的UMap、按样本分布的UMap以及细胞类型评分。第六步,使用SPOTlight进行参考引导的去卷积分析。
首先,为 SPOTlight 准备数据。将已注释的单细胞 Seurat 对象和空间 Seurat 对象转换为单细胞实验对象。使用 LogMoreCounts 对单细胞数据进行对数归一化。
然后运行 SPOTlight 去卷积分析。首先,使用 ModelGeneVar 在单细胞数据上识别高变异性基因。利用 score markers 计算细胞类型标志物,并筛选高质量标志物。
将每种细胞类型的单细胞参考数据下采样至可管理的数量,以减少计算时间。使用 SPOTlight 函数执行去卷积分析,提供单细胞参考数据、空间数据、标记基因列表和高变基因(HVGs),然后我们可以对结果进行可视化和导出。你可以获得如图所示的去卷积结果,呈现为散点管道图。
第七步,使用 Stdeconvolve 进行无监督反卷积。首先,准备空间数据。利用 GetAssayData 并指定 slot 为 counts,从空间 Seurat 对象中提取行计数矩阵。
使用 STdeconvolve 的干净计数结果去除低质量的点和基因。通过 restrict strict LDA 方法,识别在最小比例的点中表达 corpus 四个基因的潜在细胞类型,并利用 fitLDA 在一系列可能的主题数量范围内拟合该分配模型。根据最小复杂度,使用 opt min 选择最优模型。
分析并可视化结果。使用 getBetaTheta 提取最优模型的血清型比例、Theta 以及基因谱型 Beta。为了加入对腐蚀主题的生物学解释,导入由选择空间位点工具生成的兴趣区域注释。
将这些注释作为参数用于包含所有主题的函数中。将反卷积得到的细胞类型比例重新映射回空间坐标,并根据其 ROI 对各个点进行颜色编码。运行脚本后,您将得到类似这样的结果:一种比例尺的点阵图,类似于 SPOTlight 所生成的图像。
第八步,使用 Giotto 进行空间细胞间通信分析。首先,将 Seurat 对象转换为 Giotto 对象。调用 createGiottoObject 函数,并提供低计数指标和空间坐标。
预处理 Giotto 对象并添加反卷积结果。使用归一化 Giotto 对方法对数据进行归一化处理,并将其作为血清型注释添加。使用 addCellmetadata 选择细胞元数据。
使用 createSpatialNetwork 创建空间网络。将配体-受体数据库加载到环境中。运行 explore CellCellcom 以识别在空间上邻近的细胞类型之间显著的配体-受体相互作用。
可以得到类似的细胞间通讯点图。步骤九为可选步骤。使用 SelectSpatialSpot 进行交互式空间点选择。
使用脚本六为交互式工具准备数据。利用 GetTissueCoordinates 从 Seurat 对象中提取空间坐标,并对数据进行格式化和导出。
将形成性数据框导出为 CSV 文件,然后执行感兴趣区域分析。启动自定义程序。
选择空间点阵仪表应用并加载 CSV 文件。根据空间位置交互式地选择点阵。然后导出所选点阵及其分配组的列表,并标记为新的 CSV 文件。
我们逐一运行脚本后,检查所能获得的结果。所有结果均保存在结果的五倍交叉验证文件夹中。如您所见,我们可以获得质控指标,并进行划分。
您可以在此处查看空间特征图。此外,反卷积过程同时采用了有监督和无监督两种方法。SPOTlight 的结果如下。
如您所见,所有点位均包含比例信息。此处还生成了基于 STdeconvolve 的无监督反卷积结果。这是空间数据中点位的 Seurat 聚类结果。
您还可以在空间团队图中以这种方式进行可视化。此外,您还可以通过 Giotto 获得点对点的通信结果。整个工作流程 100% 开源。
从表达量分析到高级空间建模的点阵分析。所有步骤均在配备 16GB 内存的计算机上运行。代码具有模块化结构,每个任务对应一个独立脚本。
请注意,此流程不涵盖来自 FASTQ 文件的上游处理。重点在于二维空间数据,目前仅包含 Visium 的下载工具。就这些,感谢观看。
查看完整文字稿并访问数千部科学视频
本文介绍了一种利用 R 语言分析空间转录组学(ST)数据集的综合性计算工作流程。该方案通过提供简化的基于脚本的分析方法,解决了 ST 分析中的常见挑战,包括数据导入、质量控制、数据整合、去卷积、空间统计分析和可视化。该工作流程可适用于标准的基于阵列的 ST 数据集,并强调结果的可重复性与参数设置的透明性。
空间转录组学数据分析对于理解早期发现和转化研究中的组织结构及微环境生物学至关重要。该工作流程可帮助生物制药团队以可重复且参数透明的方式整合、去卷积和解读空间基因表达数据。通过标准化计算步骤,该流程支持可靠的目标靶点验证以及基于风险评估的研发管线决策。
该工作流程通过为空间转录组学分析提供可重复的计算框架,连接了早期发现、先导物鉴定和转化研究。