本方案提供了一种可重复的空间转录组数据分析工作流程,指导用户完成公共数据获取、基于Seurat的质量控制、数据整合、空间特征检测、细胞类型去卷积、感兴趣区域注释以及细胞间通讯分析,并设置了实用的检查点,以支持透明化的操作执行。
方法文章
本方案提供了一种可重复的空间转录组数据分析工作流程,指导用户完成公共数据获取、基于Seurat的质量控制、数据整合、空间特征检测、细胞类型去卷积、感兴趣区域注释以及细胞间通讯分析,并设置了实用的检查点,以支持透明化的操作执行。
空间转录组学(ST)能够在保留组织切片中 mRNA 分子二维空间信息的同时,对全基因组范围内的基因表达进行分析,从而支持对组织结构和微环境相关生物学的研究。然而,ST 数据分析仍然具有挑战性,因为数据导入、质量控制、整合、去卷积、空间统计分析和可视化通常需要多个软件环境以及可重复的参数选择。本实验方案介绍了一种在 R 语言中处理公共 ST 数据集的实用计算流程,从数据获取和软件配置开始,依次进行基于 Seurat 的数据加载、质量控制、标准化、多样本整合、聚类分析以及空间可变基因分析。随后,该流程应用了多种互补的去卷积策略,包括基于参考的 SPOTlight 分析和无监督的 STdeconvolve 主题建模方法,继而采用基于 Giotto 的空间细胞间通讯分析,并通过自定义的 Python Dash 应用程序实现交互式感兴趣区域(ROI)选择。本方案强调基于脚本的执行方式、明确的参数设定依据、预期输出结果以及故障排查检查点,为标准阵列型 ST 数据集及相关平台提供了一个可灵活调整的分析框架,前提是需针对具体数据集和平台进行参数评估。
空间转录组学(ST)是一类具有变革性的技术,可在保留组织切片内信使RNA(mRNA)分子空间坐标的同时,检测全基因组范围的基因表达。ST方法包括基于测序的技术,该技术使用带有位置条形码的阵列,以及 原位 在完整组织微环境中定位转录信号的成像方法1,2通过保留空间信息,空间转录组学(ST)能够分析组织结构、细胞邻域分布、细胞间通讯以及与微环境相关的生物学过程,而这些信息在组织解离后将无法完整解析。3.
公共空间转录组(ST)数据存储库的快速发展为二次分析和方法开发带来了前所未有的机遇3。诸如CROST数据库等资源汇集了跨越多个物种和技术平台的数百个空间分辨转录组数据集,而STOmicsDB等专业数据库则专注于特定技术方法,例如Stereo-seq4,5。尽管数据资源日益丰富,由于空间数据结构的复杂性、分析工具的多样性以及实现可重复工作流程中的技术障碍,计算分析仍然面临挑战6,7,8,9,10,11。
为克服依赖单一软件环境的局限性,本文提出了一种整合式计算工作流程,该流程利用互补的分析工具。现有的综合性空间转录组(ST)分析生态系统主要包括 Seurat、Giotto 以及基于 Python 的框架(如 Squidpy6,7,12)。尽管 Squidpy 等基于 Python 的工具为空间图分析提供了广泛的功能,但将主要计算流程集中于单一编程语言环境中,可最大限度减少跨语言的技术障碍。因此,核心流程主要在 R 环境中实现,以降低跨语言技术复杂性。在此基于 R 的工作流程中,Seurat 用于数据加载、质量控制、标准化、降维、可视化以及多样本整合,反映了其在单细胞和空间转录组学分析流程中的广泛应用。随后使用 Giotto 进行空间网络构建以及基于配体-受体的细胞间通讯分析。因此,该流程将基于 Seurat 的预处理与整合步骤与基于 Giotto 的空间分析相连接,同时确保两个工具集之间的数据传递过程明确且可重复。
在此框架中,采用了两种互补的去卷积策略:SPOTlight 是一种参考引导方法,利用单细胞 RNA 测序(scRNA-seq)数据来估计细胞类型比例;STdeconvolve 是一种无监督的主题建模方法,用于识别潜在的转录模式8,11。这两种方法的输出结果提供了空间细胞异质性的互补视角,除非用户执行本方案中描述的可选一致性分析,否则不将其视为定量的交叉验证。此外,集成了一个自定义的 Python Dash 应用程序“Select Spatial Spots”,用于交互式地进行感兴趣区域(ROI)注释,并导出基于标准坐标的注释文件,供后续下游分析使用。
关于实际应用性,本工作流程主要针对标准的基于阵列的空间转录组数据(例如,55 µm 分辨率的 Visium),在参数评估后可能适用于其他组织类型。在分析前应考虑若干关键局限性。首先,参考引导的去卷积模块依赖于高质量且与组织匹配的单细胞 RNA 测序(scRNA-seq)参考数据集。其次,亚细胞分辨率或接近单细胞水平的技术平台在整合前可能需要调整预处理步骤、空间 bin 聚合方法或基于图像的细胞分割方法2。本研究以代表性的小鼠结肠数据集作为演示案例,旨在展示该工作流程如何评估空间结构域及由标志物定义的组织架构,而非证明其在所有平台上的通用兼容性。
本方案中分析的所有生物数据集均为公开可用,且仅用于演示目的。相关步骤中提供了具体的数据编号及来源数据库。原始数据集由各原始研究者根据相应研究适用的机构伦理准则生成。请参见材料表以确认所有必需的软件及R语言程序包版本。
硬件要求:此工作流程所需的计算内存随分析的样本数和点数的增加而增加。对于典型的空間转录组学数据集(例如,每个样本约 3,000 个点,最多三个样本),配备至少 16 GB 内存的标准工作站足以运行该流程。然而,强烈建议使用 32 GB 或更高内存,以确保最佳性能和稳定性,特别是在进行 SCTransform 标准化以及去卷积过程中的矩阵分解等内存密集型计算步骤时。
1. 数据采集与目录结构准备
2. 软件环境设置
3. 空间数据加载与质量控制(1_ReadSpatialData.R, 2_SpatialDataQC.R)
4. 数据预处理、整合与聚类 (3_IntegrationAndClustering.R)
5. 单细胞参考数据预处理 (4_scDataPreProcessing.R)
6. 基于参考的 SPOTlight 解卷积分析 (5_SPOTlight_Deconv.R)
7. 使用 STdeconvolve 进行无参考解卷积 (7_STdeconvolve.R)
8. 使用 Giotto 进行空间细胞间通信分析(8_Giotto_Communication.R)
9. 使用选择空间斑点进行交互式斑点选择 (6_SelectSpatialSpots.R)
工作流程的实施与数据整合揭示了主要的组织特征
将计算工作流程应用于小鼠结肠空间转录组学数据,以展示各分析阶段的预期输出结果。如工作流程示意图(图1)所示,该流程从数据获取和质量控制开始,其中空间特征图清晰勾勒出组织边界(图2A、B)。随后采用Seurat基于锚点的整合流程,以减少技术批次效应,同时保留可解释的生物学变异。整合后的UMAP可视化结果展示了样本的对齐情况及空间聚类模式(图2C、D)。通过基于累积方差的定量动态主成分(PCs)选择方法,指导降维和下游聚类分析(见补充图1)。标志基因热图分析揭示了空间聚类背后 distinct 的转录谱特征(图2E)。
为了评估计算聚类结果是否与已知的结肠组织解剖结构一致,分析了典型层次特异性标志基因的表达谱。黏膜上皮层表达上皮细胞标志物,包括 Epcam 和 Krt8,以及杯状细胞标志物 Muc2。间充质和基质标志物如 Col1a1 和 Vim 标记了固有层和黏膜下层区域,而外层的肌层则由平滑肌结构基因如 Acta2 和 Tagln 标示。这些谱系相关标志物的空间分布特征支持如下解释:整合与聚类分析流程保留了结肠组织从黏膜到肌层轴向上的主要组织学分层结构(见补充图2)。
在完成簇验证后,进行了下游差异表达分析,以鉴定不同实验条件之间的差异表达基因(DEGs)(图2F,G)。此外,利用Moran's I统计量鉴定空间可变基因,以揭示在组织中具有显著非随机空间分布的基因(图2H)。
细胞去卷积与空间相互作用网络揭示组织微结构
单细胞RNA测序参考数据的处理结果得到了质控过滤(图3A)、无监督聚类(图3B)、标记基因验证(图3C)以及与独立注释结果的一致性分析(图3D)的支持。细胞组成信息(图3E)为去卷积分析中的下采样策略提供了依据。SPOTlight估算了空间位点中基于参考的细胞类型比例(图4A、B),而STdeconvolve则提供了空间细胞模式的无监督主题建模视图(图5B)。自定义的“选择空间位点”工具为这些模式提供了组织学背景信息(图5A)。最后,基于去卷积得到的细胞类型分配结果,空间通信分析鉴定了空间上邻近的细胞类型群体之间的配体-受体相互作用(图6A、B)。
实验方案优化中的故障排除观察
在方案优化过程中,发现了若干问题,这些问题为实际操作中的检查点提供了依据。当单细胞参考数据与组织背景匹配不佳时,会出现次优的去卷积结果,这表明在条件允许的情况下,应使用与组织和物种相匹配的单细胞RNA测序(scRNA-seq)数据。使用默认参数进行初始聚类时,并不总能解析出预期的生物学结构;通过检查主成分(PC)选择、聚类分辨率以及标记基因的一致性,有助于识别与组织解剖结构相符的空间可解释功能区域。这些观察结果为用户在执行工作流程时诊断常见分析问题提供了实际示例。

图1整合空间转录组学分析工作流程 分析流程示意图,从数据获取与预处理到高级空间分析。关键步骤包括:(1)使用 Seurat 进行数据加载、质量控制和多样本整合;(2)空间聚类及空间可变基因的检测;(3)细胞类型去卷积 通过 基于参考的(SPOTlight)和无监督(STdeconvolve)方法;(4)使用Giotto进行空间细胞间通讯分析,以及利用自定义工具进行交互式感兴趣区域选择 选择空间位点所有模块的结果被整合以深入解析组织结构和细胞微环境的生物学意义。 请点击此处以查看此图的放大版本。

图2数据整合、聚类与差异表达分析 (A,B) 空间样本 A1 和 B1 的质量控制指标,显示基因数、UMI 数及线粒体基因百分比的分布情况。 (C) 整合的空间转录组学数据的UMAP可视化,按样本来源(左)和聚类身份(右)着色。 (D) 将聚类身份在组织切片上的空间投影 (E) 每个空间聚类的前导标志基因热图。 (F) 火山图显示 A1_colon_d0 与 B1_colon_d14 条件间差异表达的基因。 (G) 组织切片中代表性差异表达基因的空间表达模式。H) 空间表达图谱:鉴定出的高空间变异性基因的空间表达分布 通过 Moran's I 统计量,左侧两个面板显示样本 A1_colon_d0 的基因,右侧两个面板显示样本 B1_colon_d14 的基因。 请点击此处以查看此图的放大版本。

图3:单细胞参考数据的处理与注释。(A) scRNA-seq参考数据在过滤前后的质控指标。 (B) 按无监督聚类结果着色的scRNA-seq数据UMAP可视化图。 (C) 点图显示各聚类中经典细胞类型标志基因的表达评分。 (D) 已注释的scRNA-seq数据UMAP可视化图,标注了主要细胞类型。 (E) scRNA-seq参考数据集的细胞组成。红色虚线表示在SPOTlight去卷积过程中应用的下采样阈值(每种类型n = 50个细胞),以平衡计算效率与细胞类型的代表性。请点击此处查看该图的放大版本。

图4细胞异质性的空间解卷积 (A,B) 基于SPOTlight去卷积的空间散点饼图,显示样本A1中每个位点主要细胞类型的组成比例A)和 B1(B)。 (C) 样本A1(左)和B1(右)中B细胞的代表性空间分布,展示了通过去卷积分析鉴定出的特定免疫细胞群体的空间分辨定位模式。 请点击此处以查看此图的放大版本。

图5:感兴趣区域的交互式分析与无监督去卷积结果比较。(A)自定义“选择空间点”工具界面,显示对应于近端结肠、远端结肠及其他组织区域的交互式选择。(B)样本A1的无监督去卷积结果(STdeconvolve)的空间散点饼图可视化,各点根据(A)中人工注释的区域着色,展示基于组织学的注释与计算推导的细胞主题分布之间的一致性。请点击此处查看该图的放大版本。

图6:基于空间信息的细胞间通讯网络。(A,B)由Giotto推断出的样本A1(A)和B1(B)的配体-受体相互作用网络。节点代表细胞类型,边代表显著的配体-受体对(FDR < 0.05),边的粗细对应于相互作用强度。为确保可比性和可视化清晰度,所有样本均采用统一的显著性阈值(FDR < 0.05),并显示每种条件下按log2FC排序的前20个相互作用。该网络突出了结肠组织空间背景下细胞类型特异性的通讯模式。请点击此处查看该图的放大版本。
补充图1:降维参数优化的定量评估。 肘部图展示了该工作流程通过程序化方法动态选择最佳主成分(PCs)数量的策略。该选择基于累积标准差和边际方差阈值进行计算,其中红色垂直线表示所选阈值,旨在捕获生物学变异,同时在后续聚类分析前降低技术噪声的影响。请点击此处下载该文件。
补充图2:使用经典的结肠层特异性标志物验证空间聚类。(A)点图显示上皮、间质和平滑肌标志物在计算聚类中的富集表达。(B)空间特征图将代表性标志物(Epcam、Col1a1、Acta2)映射回组织坐标。请点击此处下载该文件。
本方案提供了一套全面的空间转录组数据分析计算流程,在分析深度与实际可操作性之间实现了平衡。该逐步操作方法指导研究人员完成从初始数据获取到高级空间分析的整个分析流程,同时强调关键决策点和潜在的陷阱。
由于某些步骤会影响后续结果,因此在操作流程中需特别注意。质量控制和过滤阈值应根据特定的组织类型和技术平台仔细调整,因为过于严格的过滤可能会去除具有生物学意义的点,而过于宽松的阈值则可能引入技术噪声。标准化方法的选择会显著影响下游的聚类和差异表达分析结果。例如,本流程采用SCTransform而非标准的对数归一化方法,因为已有研究报道SCTransform能够建模并减少单细胞和空间工作流程中与测序深度及其他技术因素相关的技术变异14,15。在整合过程中,整合特征和分辨率参数的选择需要仔细权衡,以在保证整合强度的同时保留生物学信号。在空间可变基因识别方面,本流程选用Moran's I,因其在基于阵列的数据中具有计算可扩展性,并适用于空间自相关分析;然而,根据数据集大小和研究目标,也可考虑使用SPARK等其他替代方法16。
该工作流程的故障排除部分聚焦于在将一个软件包的输出传递给下一个软件包时常见的互操作性问题。该流程并未依赖单一的通用转换步骤,而是在每个软件接口处采用定制化的格式转换:在进行 Seurat 整合之前,空间计数数据会被复制到标准的 RNA 检测槽中;Seurat 和单细胞参考对象会被转换为 SPOTlight 所需的 SingleCellExperiment 对象;空间计数矩阵会被重新格式化以适配 STdeconvolve;由 Seurat 导出的计数数据、坐标信息及细胞类型元数据会被转换为 Giotto 对象,用于细胞间通讯分析;此外,从 Select Spatial Spots 获得的兴趣区域(ROI)注释会以 CSV 文件形式导出,包含 CELL_ID、X/Y 坐标和分组标签,以便能够映射回 Seurat 对象。这些步骤有助于用户识别并纠正常见问题,例如检测槽不兼容、点阵标识符不匹配、元数据列缺失、坐标格式错误以及配体-受体基因符号不一致等问题。
该工作流程的另一个特点是采用了两种互补的去卷积策略,而非依赖单一算法。SPOTlight 利用已有的单细胞 RNA 测序(scRNA-seq)参考数据进行参考引导的细胞类型比例估计,而 STdeconvolve 则支持无需参考数据的潜在转录主题发现。在演示数据集中,STdeconvolve 提取的主题与组织学定义的区域相一致(图 5B),表明其具有生物学可解释性。本方案未对这两种方法进行直接的定量比较;希望在自身数据上对二者进行性能评估的用户可参照第 7.3.2 步提供的框架进行操作。此外,该方案通过使用脚本实现核心功能,同时提供图形化界面(“选择空间点阵”)以直观地分离感兴趣区域(ROI),从而提升了可用性与可追溯性。
连接 Seurat 和 Giotto 可使工作流程结合基于 Seurat 的预处理与整合,以及基于 Giotto 的空间统计和网络分析。Seurat 为具有单细胞 RNA 测序(scRNA-seq)经验的研究人员提供了成熟的分析环境,并支持多样本整合;而将整合后的数据导入 Giotto 则可实现空间网络构建和配体-受体分析。该设计使用户能够充分利用这两个平台各自已知的优势,但并不意味着本研究已将它们与 Squidpy 或其他框架进行过性能比较。在细胞间通讯分析方面,采用了 Giotto 基于 Delaunay 网络的配体-受体推断方法,因其在同一分析环境中整合了空间邻近性信息;而诸如 CellChat 等框架虽提供广泛信号通路数据库,但未在本实验方案中进行评估17。
必须考虑若干局限性。基于参考的去卷积方法高度依赖高质量且相匹配的单细胞参考数据集。此外,细胞间通讯分析背后的基本假设依赖于转录本共表达作为蛋白质物理相互作用的替代指标,因此需要后续实验验证。最后,该工作流程主要围绕标准的 Visium 数据集开发。随着领域向 Visium HD 等接近单细胞分辨率的技术发展,分析考量将发生变化;更高分辨率的数据可能需要不同的预处理参数,并降低对点去卷积的绝对需求。为了将此工作流程适配于 Visium HD 数据集,可将高分辨率的 bins 在计算上聚合成更大的空间 bins,或绕过点去卷积模块,转而采用基于图像的细胞分割方法18。
这些特性表明其在发育生物学、神经科学、癌症研究和免疫学等多个生物学领域具有潜在的应用价值19,20,21,22。模块化设计使研究人员能够根据自身需求调整特定组件,无论是专注于空间结构域识别、细胞间通讯还是区域特化分析。随着空间技术的不断发展和数据集的持续扩大,本实验方案提供了一个可扩展的基础框架,可用于整合新的分析方法并应对新出现的生物学问题。
作者声明不存在竞争性财务利益。
作者感谢 Seurat、Giotto 和 SPOTlight 软件包的开发与维护人员所提供的支持和文档。同时衷心感谢公共数据存储库以及慷慨分享其数据集的研究人员所做出的贡献。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| ggplot2 | Posit Software, PBC | v4.0.0(CRAN) | 高级数据可视化 |
| Giotto | Dries 实验室 | v4.2.2 (GitHub) | 空间网络与细胞间通讯分析 |
| patchwork | Thomas Lin Pedersen | v1.3.2 (CRAN) | 图形组合与布局 |
| R 软件 | 统计计算基金会 R Foundation for Statistical Computing | v4.4.3 | 核心执行环境(macOS aarch64) |
| scater | Davis McCarthy 等 | v1.34.1 (Bioconductor) | 单细胞质量控制与可视化 |
| scran | Aaron Lun 等 | v1.34.0 (Bioconductor) | 单细胞方差建模与标志物检测 |
| Select Spatial Spots(自定义 Python 工具) | LeafLight | v1.0.0 (GitHub) | 交互式空间感兴趣区域(ROI)选择(https://github.com/LeafLight/SelectSpatialSpots) |
| Seurat | Satija 实验室 | v5.3.0 (CRAN) | 空间数据预处理、整合与聚类 |
| SeuratObject | Satija 实验室 | v5.2.0 (CRAN) | 单细胞与空间数据的数据结构 |
| SingleCellExperiment | Bioconductor 核心团队 | v1.28.1 (Bioconductor) | 单细胞 RNA 测序的标准数据容器 |
| SPOTlight | Marc Elosua-Bayes 等 | v1.10.0 (Bioconductor) | 基于参考的无监督空间去卷积 |
| Stdeconvolve | Jean Fan 实验室 | v1.3.2 (Bioconductor) | 无监督潜在主题建模 |
| tidyverse | Posit Software, PBC | v2.0.0 (CRAN) | 核心数据操作与格式化套件 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可