2025年8月1日
本文以小鼠皮肤伤口愈合的单细胞时间序列转录组数据集为例,利用 R 语言展示了一套逐步、可视化的分析工作流程。该方案包括使用 Seurat 进行数据集下载、质量控制、可视化和细胞类型注释的标准流程,以及使用 CellChat 进行细胞间相互作用分析。
在我们的实验室中,我们结合单细胞转录组学、空间转录组学以及系统生物学和生物信息学方法,研究不同愈合结局中的时空细胞动态。近年来,单细胞转录组学在人类及模式生物(如小鼠)伤口愈合研究中的应用迅速增加。然而,对于缺乏或仅有少量生物信息学经验的实验科学家而言,单细胞数据集的完整分析具有较高门槛。这意味着在伤口愈合领域,科学家们往往未能充分利用单细胞数据集。本方案是首个无需任何生物信息学先验知识的综合性实验流程,可引导用户从数据集下载开始,逐步完成与伤口愈合研究相关的各类分析并获得结果输出。本方案可作为伤口愈合研究人员深入分析自身单细胞数据集的模板,同时帮助他们从公开可用的数据集中挖掘新的科学见解。
[Shalyn] 首先,使用编号 GSE204777 从基因表达综合数据库(Gene Expression Omnibus)中访问数据集文件。点击标题为 GSM6190913 的第一个数据集。滚动至 GSM6190913 页面底部,通过 FTP 或 HTML 链接下载列出的三个文件。使用计算机的文件资源管理器,将下载的文件移至名为 b1 的目录中,并确保该目录位于工作目录内。获取已下载的单细胞测序文件的目录路径信息。接下来,将单细胞测序文件加载到工作环境中。然后,从工作数据集中分离基因表达数据和多重检测 HTO 数据。使用基因表达数据创建 Seurat 对象,同时过滤掉在少于五个细胞中被检测到的基因,以及基因数少于 200 的细胞。对于缺乏 HTO 数据的数据集,使用相同的过滤参数创建 Seurat 对象,并切换至基因表达检测。计算每个细胞中线粒体基因所占百分比,并将该值作为元数据变量进行赋值。可视化所有细胞中基因计数、总 RNA 量以及线粒体基因百分比的分布情况。使用阈值去除线粒体含量超过 25% 的细胞,并在剔除这些低质量细胞后重新可视化更新后的分布。使用 SC doublet finder 方法检测可能的双细胞(doublets)。运行 SC doublet finder 分析流程,将生成的双细胞评分作为新的元数据变量进行赋值。现在,可视化所有细胞中双细胞评分的分布情况。剔除双细胞评分高于 0.25 的所有细胞,并将清洗后的 Seurat 对象以 RDS 文件格式保存至工作目录中。执行数据归一化、标准化及主成分分析(PCA)。可视化前 50 个主成分的方差贡献情况。使用前 13 个主成分和聚类分辨率为 0.1 的参数对细胞进行聚类。在邻近性分析中执行均匀流形近似与投影(UMAP)降维,使用前 13 个主成分,并将随机种子数设为 123。现在,在 UMAP 图上可视化细胞聚类结果,随后在另一张 UMAP 图上展示伤口时间和空间注释。接着,生成一个表格,将细胞聚类与伤口时间和空间注释相关联。在计算所有聚类之间的差异表达基因后确定主要细胞类型身份,并将得到的差异表达基因(DEG)列表赋值给变量,随后以分隔符文本文件格式保存至工作目录。现在,在电子表格应用程序中打开数据集聚类标志物文件。使用文本导入向导将逗号设置为分隔符,并将基因名称列格式化为文本,以防止基因名称被自动转换为日期。在电子表格中,将“平均 log2 FC”列按从大到小排序,使行按 log2 倍数变化值递减顺序排列,接着将“cluster”列按从小到大排序。为使行按 Seurat 聚类编号升序排列,首先筛选“平均 log2 FC”列,仅保留大于或等于 2.5 的值,然后筛选“PCT 1”列,仅保留大于或等于 0.4 的值。接下来,筛选“PCT 2”列,仅保留小于或等于 0.2 的值。最后,筛选“P-value adjusted”列,仅保留小于或等于 0.01 的值。现在,打开基于网页的富集分析工具 Enrichr。针对每个聚类,将差异表达基因列表分别复制到独立的 Enrichr 窗口中并点击“analyze”。然后,点击分析结果上方的“cell types”标签,重点关注三个精选细胞标志物数据库中排名前五的富集结果。根据 Enrichr 分析中获得的最高富集结果,为八个聚类分配可能的细胞身份。将聚类 2 和聚类 6 合并为一个标注为“成纤维细胞(fibroblasts)”的类别,并将这些标注作为名为“cell types”的新元数据变量进行赋值。随后,在 UMAP 图上可视化标注后的细胞类型,并在一系列 UMAP 图上展示加粗显示的顶级聚类标志基因的定位情况。在点图(dot plot)中按原始聚类编号分组展示顶级聚类标志差异表达基因,然后再次在点图中展示这些顶级标志基因,但此次按标注的细胞类型分组。为进行时间序列分析做准备,移除空间注释并对数据集进行简化。将伤口时间和空间元数据重新赋值为一个名为 DPW(Days Post Wounding,伤后天数)的新变量。在 UMAP 图上可视化新的 DPW 时间序列分组,并生成表格,展示每个 DPW 组中各类细胞的数量。接下来,将细胞计数转换为比例,以评估愈合过程中细胞类型组成相对变化情况,并可视化每种细胞类型内各 DPW 类别的比例分布。最后,可视化每个 DPW 组中各类细胞的比例,并将包含所有注释和过滤信息的最终 Seurat 对象以 RDS 文件格式保存至工作目录。数据集中所有细胞在 UMAP 图上均清晰聚类为不同颜色编码的主要细胞类型,证实了基于富集细胞类型特征的成功注释。顶级聚类标志基因的高表达在 UMAP 图上定位于其对应的细胞类型聚类区域内。点图可视化结果进一步确认,聚类标志基因的最高表达水平仅局限于其标注的主要细胞类型中。堆叠柱状图显示,在伤后第 1 天,中性粒细胞和巨噬细胞占主导地位,而在后期时间点,成纤维细胞、上皮细胞和内皮细胞的比例逐渐升高,反映了已知的伤口愈合细胞级联过程。
本文介绍了一种使用 R 语言分析与小鼠皮肤伤口愈合相关的单细胞时间序列转录组数据集的全面实验方案。该工作流程指导研究人员完成数据集下载、质量控制、数据可视化以及细胞类型注释等步骤。
单细胞转录组学能够对组织修复过程中细胞异质性及动态细胞间相互作用进行高分辨率解析,直接为再生医学中的靶点验证和机制去风险化提供依据。本方案建立了稳健且可重复的分析流程,用于解析伤口愈合相关的单细胞数据集,降低跨职能团队从复杂单细胞数据中提取可操作性见解的门槛。通过标准化质量控制、细胞注释和相互作用分析流程,该工作流可提高预测可信度,支持在早期发现和转化研究中做出基于风险评估的项目组合决策。
该工作流程通过实现从数据集获取到细胞间相互作用图谱构建的标准化单细胞分析,连接了早期发现、筛选和转化研究。