2024年9月20日
我们提出了一种灵活且可扩展的基于 Jupyter-lab 的工作流程,用于对复杂的多组学数据集进行无监督分析,该流程整合了不同的预处理步骤、多组学因子分析模型的估计以及多种下游分析方法。
我们的工作流程能够轻松分析不同分辨率的复杂多组学数据集。该方法可提取出特定数据类型中独有或共有的主要变异模式,并对其进行整合。所得的所谓“因子”可进一步与分子过程及临床或技术协变量相关联。
我们的分析是首批将MOFA模型应用于多组学及多个样本单细胞数据的研究之一。尤为重要的是,这些样本来自心肌梗死患者的临床队列,使我们能够鉴定出与疾病状态和临床预后相关的多细胞免疫特征。
随着单细胞和多组学数据集的日益增多,这些数据集的特征通常仍被单独分析。这种做法限制了研究的深入,因为生物过程通常是多种特征和细胞类型之间相互作用的结果。通过我们的实验方案,用户可以轻松地对完整数据集进行整合分析,并识别出这些多细胞程序。
我们认为,将该方案应用于其他多组学数据集将有助于深入理解其他疾病或生物学背景。这些发现将为未来的生物标志物或治疗研究提供依据。首先,将所有多组学输入数据集添加到 input_data 文件夹中。
此处包含来自病情稳定、慢性及急性冠状动脉综合征患者的数 据。为预处理数据,请单击文件夹图标,然后依次双击 mofa_workflow、scripts 和 configurations,以进入配置文件夹。双击 Data_Configuration CSV 文件以打开该文件。
在值列中,输入输入数据和结果文件夹的路径。在配置名称值列中,指定一个名称,该名称将作为文件扩展名添加到所有保存的文件中。要保存更改,请在顶部菜单中选择“文件”和“保存 CSV 文件”。
然后使用左侧的导航菜单,点击“scripts”进入脚本文件夹。双击 00_Configuration_Update.ipynb 以打开初始化笔记本。
要运行脚本,请点击顶部的“重启内核并运行所有单元格”按钮,然后在弹出窗口中点击“重启”。要导航至配置文件夹,请双击“configurations”文件夹,然后双击“1_Pre_Processing_SC_Data”。
csv 以打开文件。核对自动填充的数值。从顶部菜单中选择“文件”并点击“保存 CSV 文件”,以保存更改。
然后使用左侧的导航菜单,点击“scripts”进入脚本文件夹。双击 01_Prepare_Pseudobulk.ipynb 以打开该笔记本。
要运行脚本,请点击顶部的“重启内核并运行所有单元格”按钮,然后在弹出窗口中点击“重启”。要导航至 figures 文件夹,请先双击 figures,再双击 01_figures。打开新生成的图表:FIG01_Amount_of_Cells 概览图。
然后检查图表,识别每个样本中细胞数量极少的细胞类型簇。记录下需要在后续步骤中排除的这些簇 ID 名称。要返回配置文件夹,请单击点状图标,然后双击 configurations。
然后打开文件 02_Pre_Processing_Config_SC.csv。将上一步中确定需要排除的所有聚类 ID 添加到 cell_type_exclusion 列中,各 ID 之间用英文逗号分隔。为保存更改,请在顶部菜单中选择“文件”并保存为 CSV 文件。
现在打开文件 02_Pre_Processing_Config.csv,并针对数据输入文件夹中包含并存储的每个数据集调整预处理配置。根据需要应用的预处理步骤,相应地调整各列中的参数。
通过选择“文件”并保存 CSV 文件来保存更改。要导航到脚本文件夹,请点击 scripts。打开笔记本 02_Integrate_and_Normalize_Data_Sources.ipynb。
单击顶部的“重启内核并运行所有单元格”按钮,然后在弹出窗口中单击“重启”。接着,导航至生成的 02_results 文件夹。单击文件夹图标,然后双击 results 和 02_results。
确认其中包含文件 02_Combined_Data_Config_Name_INTEGRATED.csv,该文件为合并后的预处理数据输入文件。起始数据为已处理并标准化的输入数据,包含五列:sample id type、dataset、variable 和 value。
这些数据将用于MOFA模型。然后进入Jupyter Lab,点击文件夹图标,依次双击mofa_workflow、scripts和configurations。
打开文件 03_MOFA_Configs.csv。输入要在 MOFA 模型中估计的因子数量,并调整文件中的数值以定义是否应用加权和缩放。从顶部菜单中选择“文件”并保存 CSV 文件,以保存更改。
使用左侧的导航菜单,通过点击 scripts 进入脚本文件夹。然后打开 notebook 03_Run_MOFA.ipynb。点击顶部的“重启内核并运行所有单元格”按钮以运行脚本,随后在弹出窗口中点击重启。
双击 figures,然后双击 03_Figures,进入 03_figures 文件夹。打开生成的图表 FIG03_Overview_Variance_Decomposition_MOFRA_ResultName,查看模型结果。转到左侧的导航菜单。
单击文件夹图标,然后双击 input_data 以进入 input_data 文件夹。拖放 Prepared。
将包含所有待分析样本元数据的 csv 文件与生成的因子文件一起放入 input_data 文件夹中。单击文件夹图标,然后依次双击 mofa_workflow、scripts 和 configurations,返回到 configurations 文件夹。
打开文件 04_Factor_Analysis CSV。在数值变量列中,输入准备好的样本元数据 CSV 文件中将用于与 MOFA 因子进行关联分析的所有数值型列的名称,各名称之间用英文逗号分隔。在分类协变量列中,输入准备好的样本元数据 CSV 文件中将用于与 MOFA 因子进行关联分析的所有分类列的名称,各名称之间用英文逗号分隔。
通过在顶部菜单中选择“文件”并点击“保存 CSV 文件”来保存更改。接下来,单击“脚本”以导航至脚本文件夹。然后双击笔记本 04_Downstream_Factor_Analysis。
ipynb 以打开文件。要运行脚本,请点击顶部的“重启内核并运行所有单元格”按钮,然后在弹出窗口中点击“重启”。使用左侧的导航菜单,通过双击 figures,然后双击 04_figures,导航至 04_figures 文件夹。
要打开生成的图表,请双击图表,并分析其中的因素以发现有趣的模式和关联。
本文介绍了一种基于 Jupyter-lab 的灵活且可扩展的工作流程,用于对复杂的多组学数据集进行无监督分析。该工作流程能够提取与分子过程及临床协变量相关的变异主要模式。
将无监督的多组学因子分析(MOFA)整合到发现阶段的工作流程中,可使生物制药团队揭示心血管疾病背后复杂的分子模式和多细胞程序。该方法通过将高维组学数据与疾病相关过程关联,提高预测可信度,支持早期靶点验证和转化生物标志物的发现。该工作流程具备可扩展性和适应性,可作为整个产品线范围内机制性降风险和优先级排序的可重复利用的能力。
这种基于MOFA的工作流程通过实现多组学和临床数据的整合分析,连接了早期发现、先导物识别和转化研究。