方法文章

空间转录组数据分析的实用工作流程:从数据获取到高级分析

DOI:

10.3791/70188

2026年8月21日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案提供了一种可重复的空间转录组数据分析工作流程,指导用户完成公共数据获取、基于Seurat的质量控制、数据整合、空间特征检测、细胞类型去卷积、感兴趣区域注释以及细胞间通讯分析,并设置了实用的检查点,以支持透明化的操作执行。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

空间转录组学(ST)能够在保留组织切片中 mRNA 分子二维空间信息的同时,对全基因组范围内的基因表达进行分析,从而支持对组织结构和微环境相关生物学的研究。然而,ST 数据分析仍然具有挑战性,因为数据导入、质量控制、整合、去卷积、空间统计分析和可视化通常需要多个软件环境以及可重复的参数选择。本实验方案介绍了一种在 R 语言中处理公共 ST 数据集的实用计算流程,从数据获取和软件配置开始,依次进行基于 Seurat 的数据加载、质量控制、标准化、多样本整合、聚类分析以及空间可变基因分析。随后,该流程应用了多种互补的去卷积策略,包括基于参考的 SPOTlight 分析和无监督的 STdeconvolve 主题建模方法,继而采用基于 Giotto 的空间细胞间通讯分析,并通过自定义的 Python Dash 应用程序实现交互式感兴趣区域(ROI)选择。本方案强调基于脚本的执行方式、明确的参数设定依据、预期输出结果以及故障排查检查点,为标准阵列型 ST 数据集及相关平台提供了一个可灵活调整的分析框架,前提是需针对具体数据集和平台进行参数评估。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

空间转录组学(ST)是一类具有变革性的技术,可在保留组织切片内信使RNA(mRNA)分子空间坐标的同时,检测全基因组范围的基因表达。ST方法包括基于测序的技术,该技术使用带有位置条形码的阵列,以及 原位 在完整组织微环境中定位转录信号的成像方法1,2通过保留空间信息,空间转录组学(ST)能够分析组织结构、细胞邻域分布、细胞间通讯以及与微环境相关的生物学过程,而这些信息在组织解离后将无法完整解析。3.

公共空间转录组(ST)数据存储库的快速发展为二次分析和方法开发带来了前所未有的机遇3。诸如CROST数据库等资源汇集了跨越多个物种和技术平台的数百个空间分辨转录组数据集,而STOmicsDB等专业数据库则专注于特定技术方法,例如Stereo-seq4,5。尽管数据资源日益丰富,由于空间数据结构的复杂性、分析工具的多样性以及实现可重复工作流程中的技术障碍,计算分析仍然面临挑战6,7,8,9,10,11

为克服依赖单一软件环境的局限性,本文提出了一种整合式计算工作流程,该流程利用互补的分析工具。现有的综合性空间转录组(ST)分析生态系统主要包括 Seurat、Giotto 以及基于 Python 的框架(如 Squidpy6,7,12)。尽管 Squidpy 等基于 Python 的工具为空间图分析提供了广泛的功能,但将主要计算流程集中于单一编程语言环境中,可最大限度减少跨语言的技术障碍。因此,核心流程主要在 R 环境中实现,以降低跨语言技术复杂性。在此基于 R 的工作流程中,Seurat 用于数据加载、质量控制、标准化、降维、可视化以及多样本整合,反映了其在单细胞和空间转录组学分析流程中的广泛应用。随后使用 Giotto 进行空间网络构建以及基于配体-受体的细胞间通讯分析。因此,该流程将基于 Seurat 的预处理与整合步骤与基于 Giotto 的空间分析相连接,同时确保两个工具集之间的数据传递过程明确且可重复。

在此框架中,采用了两种互补的去卷积策略:SPOTlight 是一种参考引导方法,利用单细胞 RNA 测序(scRNA-seq)数据来估计细胞类型比例;STdeconvolve 是一种无监督的主题建模方法,用于识别潜在的转录模式8,11。这两种方法的输出结果提供了空间细胞异质性的互补视角,除非用户执行本方案中描述的可选一致性分析,否则不将其视为定量的交叉验证。此外,集成了一个自定义的 Python Dash 应用程序“Select Spatial Spots”,用于交互式地进行感兴趣区域(ROI)注释,并导出基于标准坐标的注释文件,供后续下游分析使用。

关于实际应用性,本工作流程主要针对标准的基于阵列的空间转录组数据(例如,55 µm 分辨率的 Visium),在参数评估后可能适用于其他组织类型。在分析前应考虑若干关键局限性。首先,参考引导的去卷积模块依赖于高质量且与组织匹配的单细胞 RNA 测序(scRNA-seq)参考数据集。其次,亚细胞分辨率或接近单细胞水平的技术平台在整合前可能需要调整预处理步骤、空间 bin 聚合方法或基于图像的细胞分割方法2。本研究以代表性的小鼠结肠数据集作为演示案例,旨在展示该工作流程如何评估空间结构域及由标志物定义的组织架构,而非证明其在所有平台上的通用兼容性。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案中分析的所有生物数据集均为公开可用,且仅用于演示目的。相关步骤中提供了具体的数据编号及来源数据库。原始数据集由各原始研究者根据相应研究适用的机构伦理准则生成。请参见材料表以确认所有必需的软件及R语言程序包版本。

硬件要求:此工作流程所需的计算内存随分析的样本数和点数的增加而增加。对于典型的空間转录组学数据集(例如,每个样本约 3,000 个点,最多三个样本),配备至少 16 GB 内存的标准工作站足以运行该流程。然而,强烈建议使用 32 GB 或更高内存,以确保最佳性能和稳定性,特别是在进行 SCTransform 标准化以及去卷积过程中的矩阵分解等内存密集型计算步骤时。

1. 数据采集与目录结构准备

  1. 获取公开的空间转录组学数据集(例如,GEO 编号 GSE169749,提交日期为 2021 年 3 月 26 日,最后更新日期为 2022 年 3 月 6 日)以及单细胞 RNA 测序参考数据(例如,GEO 编号 GSE264408,提交日期为 2024 年 4 月 19 日,最后更新日期为 2024 年 12 月 10 日)。
  2. 从数据库下载原始数据压缩包(例如,GSE169749_RAW.tar)并解压该压缩包。
    注意:本方案所用的代表性数据集中,解压后的目录包含每个样本的多个文件,文件名通常包含 GEO 样本编号(例如,GSM5213483)。
  3. 将文件整理为与 Seurat Load10X_Spatial 函数兼容的标准目录结构。
    1. 创建一个主数据目录(例如,./data/)。
    2. 为每个样本创建一个专用的子目录(例如,./data/sample_A1/)。
    3. 将每个样本的以下关键文件转移(复制或移动)至相应的子目录中。
      1. filtered_feature_bc_matrix.h5 文件放入样本的主子目录中。
      2. 在每个样本目录中创建一个 spatial/ 子文件夹。
      3. 将以下文件放入 spatial/ 子文件夹中: tissue_positions_list.csv.gz、scalefactors_json.json.gz 和 tissue_hires_image.png.gz
    4. 解压 spatial/ 文件夹中的 .gz 文件。确保解压后的原始文件名与 Load10X_Spatial 函数所要求的名称完全一致(例如,tissue_positions_list.csv)。
      注意:为实现无缝加载,最终整理好的目录结构必须遵循以下模式,以样本 A1 为例:
      ./data/sample_A1/filtered_feature_bc_matrix.h5
      ./data/sample_A1/spatial/tissue_positions_list.csv
      ./data/sample_A1/spatial/scalefactors_json.json
      ./data/sample_A1/spatial/tissue_hires_image.png

2. 软件环境设置

  1. 安装 R(版本 4.4.3 或更高版本)。
  2. 从 GitHub 仓库(https://github.com/LeafLight/SpatialTranscriptomicsWorkFlow,为确保可重复性,请使用提交哈希值 2d85e18)获取分析脚本(1_ReadSpatialData.R 至 8_Giotto_Communication.R)。
  3. 通过运行脚本 setup.R 安装来自 CRAN 和 Bioconductor 的必需 R 包。
    注意:本工作流程所使用具体包版本的完整列表见材料表,也可在相关 GitHub 仓库(https://github.com/LeafLight/SpatialTranscriptomicsWorkFlow)中的 session_info.txt 文件中获取。
  4. 通过执行官方文档中提供的安装命令来安装 Giotto Suite
    1. 访问官方安装网址以获取安装脚本:https://giottosuite.com/articles/installation.html
    2. 根据分步说明初始化所需的 Python 环境和系统依赖项。
  5. 安装额外的可视化增强包。
    1. 执行命令:install.packages(c("ggprism", "colorBlindness"))
  6. 安装自定义的 Select Spatial Spots 工具。确保操作系统为 Windows、macOS 或 Linux,并已安装 Python 3.8 或更高版本。此步骤为可选。
    1. 前往 GitHub 仓库(https://github.com/LeafLight/SelectSpatialSpots,为确保可重复性,请使用提交哈希值 d20946e)下载源代码以获取该工具。
    2. 进入工具目录并安装 Python 依赖项: pip install -r requirements.txt
  7. 通过执行 BiocManager::install("glmGamPoi") 安装 glmGamPoi 包,以加速 SCTransform 标准化过程。
    注意:核心工作流程仅需步骤 2.1–2.3 和 2.6 中列出的包。Rfast2 包用于加快 Moran's I 统计量的计算。步骤 2.5 中的可选包用于生成具有棱镜风格主题(ggprism)的出版级图表以及使用适合色盲用户的调色板(colorBlindness)。步骤 2.6 中的工具可实现交互式点位选择功能。请执行 sessionInfo() 命令并将完整的控制台输出保存为文本文件,以记录确切的软件版本和包依赖关系,这对确保长期可重复性至关重要。

3. 空间数据加载与质量控制1_ReadSpatialData.R, 2_SpatialDataQC.R

  1. 将空间数据读取为 Seurat 对象。
    1. 使用 Read10X_Image 手动加载高分辨率组织图像,并指定 image.dir 和 image.name
    2. 使用 Load10X_Spatial,并将 image 参数设置为步骤 3.1.1 中创建的图像对象,以生成 Seurat 对象。
  2. 计算质量控制指标。
    1. 使用 PercentageFeatureSet 函数并设置模式 ^mt-,计算线粒体基因的读段百分比。
  3. 基于质量控制指标进行数据可视化与解读。
    1. 使用 VlnPlot 生成 nCount_SpatialnFeature_Spatialpercent.mt 的小提琴图。
    2. 使用 SpatialFeaturePlot 创建这些指标的空间特征图,以识别位于组织区域外的捕获点。
      注:可视化检查点:组织区域外的捕获点通常表现出较低的 UMI 计数(nCount_Spatial < 500)和较低的基因检出数(nFeature_Spatial < 200)。
    3. 为演示目的,可应用筛选条件去除低质量捕获点(例如,subset(seurat_obj, subset = nFeature_Spatial > 200 & nCount_Spatial > 500))。此步骤为可选。
      注:空间转录组学中质量控制的主要目标是识别并注释技术性伪影,例如组织区域外的捕获点。对于演示用的 Visium 结肠数据,设定 nFeature_Spatial > 200 和 nCount_Spatial > 500 可去除低复杂度或背景信号的捕获点。对于 RNA 含量较低或已降解的组织切片,应在提高阈值前仔细检查小提琴图和空间特征图;而对于 RNA 密度高或 UMI 含量高的组织,可考虑采用更严格的阈值。除非存在明显的双细胞、组织折叠或明确的伪影,否则应避免仅基于高表达值进行过滤。通常不建议进行过滤操作,因为这会物理性地移除空间位置,可能破坏组织结构的连续性,从而影响后续的空间分析。

4. 数据预处理、整合与聚类 (3_IntegrationAndClustering.R)

  1. 对各个样本进行标准化和预处理。
    1. 对每个样本分别应用 SCTransform 标准化,参数设置为 assay = 空间.
  2. 整合多个样本。
    1. 准备用于整合的经 SCT 标准化的对象列表。确保每个对象均具有 "RNA" 通过复制进行检测 "空间" 检测 spatial_list[[1]][["RNA"]] <- 空间列表[[1]][["空间"]]
      ​注意:复制 "空间" 将检测方法标准化 "RNA" 检测槽位作为一种必要的变通方法,可确保与下游集成功能的兼容性,这些功能最初是为单细胞 Seurat 对象设计的。
    2. 使用 选择整合特征 PrepSCTIntegration 识别共享的可变特征。
    3. 使用以下方法寻找整合锚点 FindIntegrationAnchors归一化方法 = "SCT".
    4. 使用 IntegrateData 整合数据 归一化方法 = "SCT".
  3. 对整合后的检测数据进行降维和聚类分析。
    1. 对整合数据进行主成分分析(PCA) RunPCA.
    2. 通过计算主成分分析(PC)所解释的累积方差,确定下游分析的最佳主成分数量。使用代码中的方法,以编程方式识别拐点(例如,累积方差超过90%且边际增益降至0.1%以下的点) 3_整合与聚类.R第36-38行由此得到的PC数量在下文中称为 pc.use.
    3. 运行 RunUMAP dims = 1:pc.use.
    4. 使用聚类方法对细胞进行分群 查找邻近细胞dims = 1:pc.use 并使用 FindClusters 进行聚类分析 分辨率 = 0.5仅在检查聚类稳定性与标记基因一致性后调整分辨率。
    5. 在目标组之间进行差异表达分析(例如, "B1_结肠_d14" 与 "A1_colon_d0") 使用 FindMarkers 功能。
      ​注意:可视化检查点:成功的整合将在UMAP图中显示样本间的适当混合,同时保持生物学上 distinct 的聚类。
  4. 识别空间可变基因。
    1. 对每个原始样品进行检测 FindSpatiallyVariableFeatures 使用 "moransi" 方法在 "SCT" 用于计算空间自相关的检测方法。

5. 单细胞参考数据预处理 (4_scDataPreProcessing.R)

  1. 使用 Read10X 读取单细胞 RNA-seq 计数矩阵,并创建 Seurat 对象。
  2. 进行标准的质控、标准化和聚类分析。
    1. 计算线粒体基因读段所占百分比(percent.mt),并对细胞进行过滤(例如:nFeature_RNA > 200 & nFeature_RNA < 7500 & percent.mt < 25)。
    2. 使用 SCTransform 对数据进行标准化,设置 vars.to.regress = "percent.mt"
    3. 运行 PCA、UMAP 分析,并使用步骤 4.3.2 中描述的动态主成分选择方法对细胞进行聚类。
  3. 注释细胞类型。
    1. 使用 AddModuleScore 计算经典细胞类型标志基因的模块评分。
    2. 根据模块评分和已知生物学知识对聚类进行注释;或者,从元数据中导入预先计算好的注释结果。

6. 基于参考的 SPOTlight 解卷积分析 (5_SPOTlight_Deconv.R)

  1. 为 SPOTlight 准备数据。
    1. 将带有注释的单细胞 Seurat 对象和空间 Seurat 对象转换为 SingleCellExperiment 对象。
    2. 使用对数归一化单细胞数据 logNormCounts
  2. 运行 SPOTlight 去卷积分析。
    1. 使用单细胞数据鉴定高变基因(HVGs) modelGeneVar getTopHVGs.
    2. 使用计算细胞类型标记基因 评分标记物 并筛选高质量的标记物(例如,mean.AUC) > 0.8).
    3. 将每种细胞类型的单细胞参考数据下采样至可管理的数量(例如,50 个细胞),以减少计算时间。
    4. 使用去卷积算法进行处理 SPOTlight 功能与 weight_id = "平均AUC",组别编号 = "簇",且 gene_id = "基因".
  3. 可视化并导出结果。
    1. 提取去卷积结果矩阵(每个点的细胞类型比例)。
    2. 使用 plotSpatialScatterpie 在空间坐标上可视化细胞组成。
    3. 使用去卷积结果更新空间 Seurat 对象的元数据 添加元数据去卷积矩阵,包含每个空间位点的细胞类型比例列、显示局部细胞组成的空间散点饼图,以及一个Seurat对象,其中包含作为元数据的去卷积比例。

7. 使用 STdeconvolve 进行无参考解卷积 (7_STdeconvolve.R)

  1. 准备空间数据。
    1. 使用空间 Seurat 对象提取原始计数矩阵 使用插槽 slot 的 GetAssayData "计数".
    2. 使用以下方法去除低质量的点和基因 cleanCounts 来自 STdeconvolve(例如, min.lib.size = 100).
  2. 鉴定潜在的细胞类型。
    1. 使用最低斑点表达比例进一步筛选基因集 限制语料库 (例如, 移除阈值以上=1.0, removeBelow = 0.05).
    2. 在一系列潜在主题数量(K)范围内拟合潜在狄利克雷分配(LDA)模型(例如, Ks = seq(2, 9, by = 1))使用 fitLDA.
    3. 根据最低困惑度选择最优模型 最优模型,其中 opt = "分钟".
  3. 分析并可视化结果。
    1. 使用最优模型提取细胞类型(主题)比例(theta)和基因表达谱(beta) getBetaTheta.
    2. 为了辅助解释去卷积后的主题,导入由感兴趣区域(ROI)生成的注释 "选择空间位点" 工具(参见步骤 9.3.3)。将这些注释用作组参数 所有主题 将去卷积得到的细胞类型比例投影回空间坐标,并根据其ROI对点进行颜色编码。此步骤为可选。
      注意:STdeconvolve 应返回每个点的 theta 值(表示主题比例)和每个主题的 beta 值(表示基因表达谱)。如果用户希望将无监督的 STdeconvolve 结果与参考引导的 SPOTlight 输出结果(来自步骤 6)进行定量比较,可导出两个比例矩阵(STdeconvolve 的 theta 值和 SPOTlight 矩阵),并使用标准的 R 函数计算每个点的相关性或一致性指标(例如,Pearson 或 Spearman 相关性)。SPOTlight 与 STdeconvolve 之间的定量比较是可选的,并非核心工作流程所必需;然而,相关输出矩阵可从步骤 6.3.1 和 7.3.1 获取,供希望执行此类分析的用户使用。

8. 使用 Giotto 进行空间细胞间通信分析(8_Giotto_Communication.R)

  1. 将 Seurat 对象转换为 Giotto 对象。
    1. 使用 createGiottoObject 函数,提供原始计数矩阵和空间坐标。
  2. 预处理 Giotto 对象并添加去卷积结果。
    1. 使用 normalizeGiotto 对数据进行标准化。
    2. 使用 addCellMetadata 将细胞类型注释(例如来自 SPOTlight 去卷积的主要细胞类型)添加到细胞元数据中
  3. 推断具有空间信息的细胞间通讯。
    1. 使用 createSpatialNetwork 并设置 method = "Delaunay"name = "Delaunay_network" 创建空间网络。
    2. 将配体-受体数据库加载到 R 环境中。确保加载的对象格式为数据框,且包含两个独立的列,分别表示配体和受体基因符号(例如,来自 Zenodo 的预编译小鼠网络:https://zenodo.org/api/records/15168114/files/lr_network_mouse.csv/content,版本 v6,发布于 2025 年 4 月 7 日)。
    3. 运行 exprCellCellcom,设置 cluster_column = "celltype_major",以识别在空间上邻近的细胞类型之间的显著配体-受体相互作用。预期输出:包含配体-受体对、来源与靶细胞类型组合、log2 倍数变化值以及校正后 P 值的结果表格;保留显著相互作用(例如,p.adj < 0.05)用于可视化。

9. 使用选择空间斑点进行交互式斑点选择 (6_SelectSpatialSpots.R)

  1. 为交互式工具准备数据。
    1. 使用 GetTissueCoordinates 从 Seurat 对象中提取空间坐标。
  2. 格式化并导出数据。
    1. 将坐标数据框格式化为包含以下精确列标题的形式:CELL_ID、X 和 Y
    2. 将格式化后的数据框导出为 CSV 文件。
  3. 执行感兴趣区域(ROI)分析。
    1. 启动自定义的 Select Spatial Spots Dash 应用程序,并加载 CSV 文件。
    2. 根据空间位置交互式地选择点。
    3. 将所选点及其分配的组别/ROI 标签列表导出为新的 CSV 文件。预期输出:一个包含点标识符、X/Y 坐标以及分配的组别/ROI 标签的 CSV 文件,可通过 CELL_ID 与 Seurat 对象进行匹配。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

工作流程的实施与数据整合揭示了主要的组织特征

将计算工作流程应用于小鼠结肠空间转录组学数据,以展示各分析阶段的预期输出结果。如工作流程示意图(图1)所示,该流程从数据获取和质量控制开始,其中空间特征图清晰勾勒出组织边界(图2A、B)。随后采用Seurat基于锚点的整合流程,以减少技术批次效应,同时保留可解释的生物学变异。整合后的UMAP可视化结果展示了样本的对齐情况及空间聚类模式(图2C、D)。通过基于累积方差的定量动态主成分(PCs)选择方法,指导降维和下游聚类分析(见补充图1)。标志基因热图分析揭示了空间聚类背后 distinct 的转录谱特征(图2E)。

为了评估计算聚类结果是否与已知的结肠组织解剖结构一致,分析了典型层次特异性标志基因的表达谱。黏膜上皮层表达上皮细胞标志物,包括 Epcam 和 Krt8,以及杯状细胞标志物 Muc2。间充质和基质标志物如 Col1a1 和 Vim 标记了固有层和黏膜下层区域,而外层的肌层则由平滑肌结构基因如 Acta2 和 Tagln 标示。这些谱系相关标志物的空间分布特征支持如下解释:整合与聚类分析流程保留了结肠组织从黏膜到肌层轴向上的主要组织学分层结构(见补充图2)。

在完成簇验证后,进行了下游差异表达分析,以鉴定不同实验条件之间的差异表达基因(DEGs)(图2F,G)。此外,利用Moran's I统计量鉴定空间可变基因,以揭示在组织中具有显著非随机空间分布的基因(图2H)。

细胞去卷积与空间相互作用网络揭示组织微结构

单细胞RNA测序参考数据的处理结果得到了质控过滤(图3A)、无监督聚类(图3B)、标记基因验证(图3C)以及与独立注释结果的一致性分析(图3D)的支持。细胞组成信息(图3E)为去卷积分析中的下采样策略提供了依据。SPOTlight估算了空间位点中基于参考的细胞类型比例(图4A、B),而STdeconvolve则提供了空间细胞模式的无监督主题建模视图(图5B)。自定义的“选择空间位点”工具为这些模式提供了组织学背景信息(图5A)。最后,基于去卷积得到的细胞类型分配结果,空间通信分析鉴定了空间上邻近的细胞类型群体之间的配体-受体相互作用(图6A、B)。

实验方案优化中的故障排除观察

在方案优化过程中,发现了若干问题,这些问题为实际操作中的检查点提供了依据。当单细胞参考数据与组织背景匹配不佳时,会出现次优的去卷积结果,这表明在条件允许的情况下,应使用与组织和物种相匹配的单细胞RNA测序(scRNA-seq)数据。使用默认参数进行初始聚类时,并不总能解析出预期的生物学结构;通过检查主成分(PC)选择、聚类分辨率以及标记基因的一致性,有助于识别与组织解剖结构相符的空间可解释功能区域。这些观察结果为用户在执行工作流程时诊断常见分析问题提供了实际示例。

figure-results-1
图1整合空间转录组学分析工作流程 分析流程示意图,从数据获取与预处理到高级空间分析。关键步骤包括:(1)使用 Seurat 进行数据加载、质量控制和多样本整合;(2)空间聚类及空间可变基因的检测;(3)细胞类型去卷积 通过 基于参考的(SPOTlight)和无监督(STdeconvolve)方法;(4)使用Giotto进行空间细胞间通讯分析,以及利用自定义工具进行交互式感兴趣区域选择 选择空间位点所有模块的结果被整合以深入解析组织结构和细胞微环境的生物学意义。 请点击此处以查看此图的放大版本。

figure-results-2
图2数据整合、聚类与差异表达分析 (A,B) 空间样本 A1 和 B1 的质量控制指标,显示基因数、UMI 数及线粒体基因百分比的分布情况。 (C) 整合的空间转录组学数据的UMAP可视化,按样本来源(左)和聚类身份(右)着色。 (D) 将聚类身份在组织切片上的空间投影 (E) 每个空间聚类的前导标志基因热图。 (F) 火山图显示 A1_colon_d0 与 B1_colon_d14 条件间差异表达的基因。 (G) 组织切片中代表性差异表达基因的空间表达模式。H) 空间表达图谱:鉴定出的高空间变异性基因的空间表达分布 通过 Moran's I 统计量,左侧两个面板显示样本 A1_colon_d0 的基因,右侧两个面板显示样本 B1_colon_d14 的基因。 请点击此处以查看此图的放大版本。

figure-results-3
图3:单细胞参考数据的处理与注释。A) scRNA-seq参考数据在过滤前后的质控指标。 (B) 按无监督聚类结果着色的scRNA-seq数据UMAP可视化图。 (C) 点图显示各聚类中经典细胞类型标志基因的表达评分。 (D) 已注释的scRNA-seq数据UMAP可视化图,标注了主要细胞类型。 (E) scRNA-seq参考数据集的细胞组成。红色虚线表示在SPOTlight去卷积过程中应用的下采样阈值(每种类型n = 50个细胞),以平衡计算效率与细胞类型的代表性。请点击此处查看该图的放大版本。

figure-results-4
图4细胞异质性的空间解卷积 (A,B) 基于SPOTlight去卷积的空间散点饼图,显示样本A1中每个位点主要细胞类型的组成比例A)和 B1(B)。 (C) 样本A1(左)和B1(右)中B细胞的代表性空间分布,展示了通过去卷积分析鉴定出的特定免疫细胞群体的空间分辨定位模式。 请点击此处以查看此图的放大版本。

figure-results-5
图5:感兴趣区域的交互式分析与无监督去卷积结果比较。A)自定义“选择空间点”工具界面,显示对应于近端结肠、远端结肠及其他组织区域的交互式选择。(B)样本A1的无监督去卷积结果(STdeconvolve)的空间散点饼图可视化,各点根据(A)中人工注释的区域着色,展示基于组织学的注释与计算推导的细胞主题分布之间的一致性。请点击此处查看该图的放大版本。

figure-results-6
图6:基于空间信息的细胞间通讯网络。A,B)由Giotto推断出的样本A1(A)和B1(B)的配体-受体相互作用网络。节点代表细胞类型,边代表显著的配体-受体对(FDR < 0.05),边的粗细对应于相互作用强度。为确保可比性和可视化清晰度,所有样本均采用统一的显著性阈值(FDR < 0.05),并显示每种条件下按log2FC排序的前20个相互作用。该网络突出了结肠组织空间背景下细胞类型特异性的通讯模式。请点击此处查看该图的放大版本。

补充图1:降维参数优化的定量评估。 肘部图展示了该工作流程通过程序化方法动态选择最佳主成分(PCs)数量的策略。该选择基于累积标准差和边际方差阈值进行计算,其中红色垂直线表示所选阈值,旨在捕获生物学变异,同时在后续聚类分析前降低技术噪声的影响。请点击此处下载该文件。

补充图2:使用经典的结肠层特异性标志物验证空间聚类。A)点图显示上皮、间质和平滑肌标志物在计算聚类中的富集表达。(B)空间特征图将代表性标志物(Epcam、Col1a1、Acta2)映射回组织坐标。请点击此处下载该文件。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案提供了一套全面的空间转录组数据分析计算流程,在分析深度与实际可操作性之间实现了平衡。该逐步操作方法指导研究人员完成从初始数据获取到高级空间分析的整个分析流程,同时强调关键决策点和潜在的陷阱。

由于某些步骤会影响后续结果,因此在操作流程中需特别注意。质量控制和过滤阈值应根据特定的组织类型和技术平台仔细调整,因为过于严格的过滤可能会去除具有生物学意义的点,而过于宽松的阈值则可能引入技术噪声。标准化方法的选择会显著影响下游的聚类和差异表达分析结果。例如,本流程采用SCTransform而非标准的对数归一化方法,因为已有研究报道SCTransform能够建模并减少单细胞和空间工作流程中与测序深度及其他技术因素相关的技术变异14,15。在整合过程中,整合特征和分辨率参数的选择需要仔细权衡,以在保证整合强度的同时保留生物学信号。在空间可变基因识别方面,本流程选用Moran's I,因其在基于阵列的数据中具有计算可扩展性,并适用于空间自相关分析;然而,根据数据集大小和研究目标,也可考虑使用SPARK等其他替代方法16

该工作流程的故障排除部分聚焦于在将一个软件包的输出传递给下一个软件包时常见的互操作性问题。该流程并未依赖单一的通用转换步骤,而是在每个软件接口处采用定制化的格式转换:在进行 Seurat 整合之前,空间计数数据会被复制到标准的 RNA 检测槽中;Seurat 和单细胞参考对象会被转换为 SPOTlight 所需的 SingleCellExperiment 对象;空间计数矩阵会被重新格式化以适配 STdeconvolve;由 Seurat 导出的计数数据、坐标信息及细胞类型元数据会被转换为 Giotto 对象,用于细胞间通讯分析;此外,从 Select Spatial Spots 获得的兴趣区域(ROI)注释会以 CSV 文件形式导出,包含 CELL_ID、X/Y 坐标和分组标签,以便能够映射回 Seurat 对象。这些步骤有助于用户识别并纠正常见问题,例如检测槽不兼容、点阵标识符不匹配、元数据列缺失、坐标格式错误以及配体-受体基因符号不一致等问题。

该工作流程的另一个特点是采用了两种互补的去卷积策略,而非依赖单一算法。SPOTlight 利用已有的单细胞 RNA 测序(scRNA-seq)参考数据进行参考引导的细胞类型比例估计,而 STdeconvolve 则支持无需参考数据的潜在转录主题发现。在演示数据集中,STdeconvolve 提取的主题与组织学定义的区域相一致(图 5B),表明其具有生物学可解释性。本方案未对这两种方法进行直接的定量比较;希望在自身数据上对二者进行性能评估的用户可参照第 7.3.2 步提供的框架进行操作。此外,该方案通过使用脚本实现核心功能,同时提供图形化界面(“选择空间点阵”)以直观地分离感兴趣区域(ROI),从而提升了可用性与可追溯性。

连接 Seurat 和 Giotto 可使工作流程结合基于 Seurat 的预处理与整合,以及基于 Giotto 的空间统计和网络分析。Seurat 为具有单细胞 RNA 测序(scRNA-seq)经验的研究人员提供了成熟的分析环境,并支持多样本整合;而将整合后的数据导入 Giotto 则可实现空间网络构建和配体-受体分析。该设计使用户能够充分利用这两个平台各自已知的优势,但并不意味着本研究已将它们与 Squidpy 或其他框架进行过性能比较。在细胞间通讯分析方面,采用了 Giotto 基于 Delaunay 网络的配体-受体推断方法,因其在同一分析环境中整合了空间邻近性信息;而诸如 CellChat 等框架虽提供广泛信号通路数据库,但未在本实验方案中进行评估17

必须考虑若干局限性。基于参考的去卷积方法高度依赖高质量且相匹配的单细胞参考数据集。此外,细胞间通讯分析背后的基本假设依赖于转录本共表达作为蛋白质物理相互作用的替代指标,因此需要后续实验验证。最后,该工作流程主要围绕标准的 Visium 数据集开发。随着领域向 Visium HD 等接近单细胞分辨率的技术发展,分析考量将发生变化;更高分辨率的数据可能需要不同的预处理参数,并降低对点去卷积的绝对需求。为了将此工作流程适配于 Visium HD 数据集,可将高分辨率的 bins 在计算上聚合成更大的空间 bins,或绕过点去卷积模块,转而采用基于图像的细胞分割方法18

这些特性表明其在发育生物学、神经科学、癌症研究和免疫学等多个生物学领域具有潜在的应用价值19,20,21,22。模块化设计使研究人员能够根据自身需求调整特定组件,无论是专注于空间结构域识别、细胞间通讯还是区域特化分析。随着空间技术的不断发展和数据集的持续扩大,本实验方案提供了一个可扩展的基础框架,可用于整合新的分析方法并应对新出现的生物学问题。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在竞争性财务利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢 Seurat、Giotto 和 SPOTlight 软件包的开发与维护人员所提供的支持和文档。同时衷心感谢公共数据存储库以及慷慨分享其数据集的研究人员所做出的贡献。

材料

本文使用的材料清单
姓名公司目录编号评论
ggplot2Posit Software, PBCv4.0.0(CRAN)高级数据可视化
GiottoDries 实验室v4.2.2 (GitHub)空间网络与细胞间通讯分析
patchwork Thomas Lin Pedersenv1.3.2 (CRAN)图形组合与布局
R 软件 统计计算基金会 R Foundation for Statistical Computingv4.4.3核心执行环境(macOS aarch64)
scaterDavis McCarthy 等v1.34.1 (Bioconductor)单细胞质量控制与可视化
scranAaron Lun 等v1.34.0 (Bioconductor)单细胞方差建模与标志物检测
Select Spatial Spots(自定义 Python 工具)LeafLightv1.0.0 (GitHub)交互式空间感兴趣区域(ROI)选择(https://github.com/LeafLight/SelectSpatialSpots)
Seurat Satija 实验室v5.3.0 (CRAN)空间数据预处理、整合与聚类
SeuratObject Satija 实验室v5.2.0 (CRAN)单细胞与空间数据的数据结构
SingleCellExperimentBioconductor 核心团队v1.28.1 (Bioconductor)单细胞 RNA 测序的标准数据容器
SPOTlightMarc Elosua-Bayes 等v1.10.0 (Bioconductor)基于参考的无监督空间去卷积
StdeconvolveJean Fan 实验室v1.3.2 (Bioconductor)无监督潜在主题建模
tidyversePosit Software, PBCv2.0.0 (CRAN)核心数据操作与格式化套件

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ozirmak Lermi N, Molina Ayala M, Hernandez S, et al. Comparison of imaging based single-cell resolution spatial transcriptomics profiling platforms using formalin-fixed paraffin-embedded tumor samples. Nat Commun. 2025;16(1):8499.
  2. Ren P, Zhang R, Wang Y, et al. Systematic benchmarking of high-throughput subcellular spatial transcriptomics platforms across human tumors. Nat Commun. 2025;16(1):9232.
  3. Danishuddin, Khan S, Kim JJ. Spatial transcriptomics data and analytical methods: An updated perspective. Drug Discovery Today. 2024;29(3):103889.
  4. Xu Z, Wang W, Yang T, et al. STOmicsDB: A comprehensive database for spatial transcriptomics data sharing, analysis and visualization. Accessed October 31, 2025. https://dx.doi.org/10.1093/nar/gkad933
  5. Wang G, Wu S, Xiong Z, Qu H, Fang X, Bao Y. CROST: A comprehensive repository of spatial transcriptomics. Nucleic Acids Res. 2024;52(D1):D882-D890.
  6. Chen JG, Chávez-Fuentes JC, O’Brien M, et al. Giotto Suite: a multiscale and technology-agnostic spatial multiomics analysis ecosystem. Nat Methods. 2025;22(10):2052-2064. doi:10.1038/s41592-025-02817-w
  7. Butler A, Hoffman P, Smibert P, Papalexi E, Satija R. Integrating single-cell transcriptomic data across different conditions, technologies, and species. Nat Biotechnol. 2018;36(5):411-420.
  8. Elosua-Bayes M, Nieto P, Mereu E, Gut I, Heyn H. SPOTlight: seeded NMF regression to deconvolute spatial transcriptomics spots with single-cell transcriptomes. Nucleic Acids Res. 2021;49(9):e50-e50.
  9. McCarthy DJ, Campbell KR, Lun ATL, Wills QF. Scater: pre-processing, quality control, normalization and visualization of single-cell RNA-seq data in R. Bioinformatics. 2017;33(8):1179-1186.
  10. Lun ATL, McCarthy DJ, Marioni JC. A step-by-step workflow for low-level analysis of single-cell RNA-seq data with bioconductor. F1000Research. Preprint posted online October 31, 2016. doi:10.12688/f1000research.9501.2
  11. Miller BF, Huang F, Atta L, Sahoo A, Fan J. Reference-free cell type deconvolution of multi-cellular pixel-resolution spatially resolved transcriptomics data. Nat Commun. 2022;13(1):2339.
  12. Palla G, Spitzer H, Klein M, et al. Squidpy: A scalable framework for spatial omics analysis. Nat Methods. 2022;19(2):171-178.
  13. Luecken MD, Büttner M, Chaichoompu K, et al. Benchmarking atlas-level data integration in single-cell genomics. Nat Methods. 2022;19(1):41-50.
  14. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019 Dec 23;20(1):296.
  15. Cuevas-Diaz Duran R, Wei H, Wu J. Data normalization for addressing the challenges in the analysis of single-cell transcriptomic datasets. BMC Genomics. 2024;25(1):444.
  16. Sun S, Zhu J, Zhou X. Statistical analysis of spatial expression patterns for spatially resolved transcriptomic studies. Nat Methods. 2020;17(2):193-200.
  17. Jin S, Plikus MV, Nie Q. CellChat for systematic analysis of cell–cell communication from single-cell transcriptomics. Nat Protoc. 2025;20(1):180-219.
  18. Zohora FT, Paliwal D, Flores-Figueroa E, et al. CellNEST reveals cell–cell relay networks using attention mechanisms on spatial transcriptomics. Nat Methods. 2025;22(7):1505-1519.
  19. Wang Q, Zhu H, Deng L, et al. Spatial transcriptomics: Biotechnologies, computational tools, and neuroscience applications. Small Methods. 2025;9(5):2401107.
  20. Chen MM, Gao Q, Ning H, et al. Integrated single-cell and spatial transcriptomics uncover distinct cellular subtypes involved in neural invasion in pancreatic cancer. Cancer Cell. 2025;43(9):1656-1676.e10.
  21. Li H, Guan W, Huang J, et al. A complete model of mouse embryogenesis through organogenesis enabled by chemically induced embryo founder cells. Cell. 2025;188(21):5912-5930.e20.
  22. Loh JW, Lee JY, Lim AH, et al. Spatial transcriptomics reveal topological immune landscapes of asian head and neck angiosarcoma. Commun Biol. 2023;6(1):461.

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Seurat SPOTlight

相关文章