21 de agosto de 2026
Este protocolo presenta un flujo de trabajo reproducible para analizar datos de transcriptómica espacial, guiando a los usuarios desde la adquisición de datos públicos y el control de calidad basado en Seurat hasta la integración, la detección de características espaciales, la desconvolución de tipos celulares, la anotación de regiones de interés y el análisis de la comunicación entre células, con puntos de control prácticos que favorecen una ejecución transparente.
Hola a todos. En este video, describiremos una tubería práctica de análisis de datos de transcriptómica espacial, desde la adquisición y carga de datos hasta la exploración básica y, finalmente, el análisis avanzado. En general, el flujo de trabajo consta de tres pasos principales.
Primero, descargar los datos; segundo, obtener el código de análisis; y tercero, ejecutar la canalización para generar los resultados. Paso uno, adquisición de datos y preparación de la estructura de directorios. Primero, obtener conjuntos de datos públicos de transcriptómica espacial.
Descargue el archivo de datos brutos y extráigalo. Organice los archivos en una estructura de directorios estandarizada.
Primero, cree un directorio principal para los datos y luego cree un subdirectorio dedicado para cada muestra. Transfiera los siguientes archivos esenciales para cada muestra al subdirectorio correspondiente. A continuación, cree una subcarpeta espacial dentro de cada directorio de muestra.
Coloque los siguientes archivos en la subcarpeta espacial. Coloque el archivo S1 de métricas de PC de características filtradas en el subdirectorio principal de la muestra. Descomprima los archivos gzip en la carpeta espacial.
Asegúrese de que los nombres originales de los archivos permanezcan exactamente como los requiere la función de carga espacial 10X. Paso dos, configuración del entorno de software. Aquí se omite la instalación del lenguaje R y el análisis de datos comienza con la obtención del script de análisis en el repositorio de GitHub.
Instale los paquetes de R requeridos desde Graham en el archivo del conductor ejecutando el script setup R. Instale el conjunto de herramientas automático ejecutando los comandos de instalación proporcionados en la hoja de documentación oficial. Navegue hasta la URL oficial de instalación para obtener los scripts de configuración. Inicialice el entorno de Python y las dependencias del sistema requeridas según las instrucciones de la página de configuración.
Obtenga la herramienta personalizada accediendo al repositorio de GitHub y descargue el código fuente. Navegue hasta el directorio TOS e instale las dependencias de Python. Paso tres, carga de datos espaciales y control de calidad.
Lea los datos espaciales en un objeto Seurat. Utilice la lectura de imagen 10X para cargar manualmente la imagen de tejido de alta resolución. Especifique la imagen allí y el nombre de la imagen.
Utilice la carga 10X espacial con el parámetro de imagen establecido en el objeto de imagen creado en el paso anterior y cree el objeto Seurat. Calcule las métricas de control de calidad. Calcule el porcentaje de lecturas mitocondriales utilizando el conjunto de características de porcentaje con el patrón mt.
Visualice e interprete los datos basándose en las métricas de control de calidad. Genere gráficos de violín de nCount_Spatial, nFeature_Spatial y percent. mt utilizando la función de gráfico de violín.
Cree gráficos espaciales de estas métricas utilizando gráficos de características espaciales. E identifique puntos fuera del área del tejido. Opcional: aplique filtros para eliminar puntos de baja calidad.
Después de ejecutar el script, puede obtener estos resultados, que incluyen métricas de control de calidad y el gráfico espacial de características. Paso cuatro, preprocesamiento, integración y agrupamiento de datos. Normalice durante el preprocesamiento de muestras individuales.
Aplicar como una normalización SC transform a cada muestra por separado con el ensayo Spatial. Integrar múltiples muestras. Preparar la lista de objetos normalizados por SCTransform para la integración.
Asegúrese de que cada objeto tenga un ensayo de ARN copiando el ensayo espacial. Utilice las características de integración seleccionadas en la integración PREP SCT para identificar características variables compartidas. Encuentre los anclajes de integración utilizando encontrar anclajes de integración con el método de normalización SCT.
Integre los datos utilizando IntegrateData. Realice una reducción de dimensionalidad en el agrupamiento sobre el ensayo integrado. Ejecute PCA sobre los datos integrados utilizando runPCA.
Determine el número óptimo de componentes principales para el análisis posterior mediante el cálculo de la varianza acumulada explicada. Identifique el punto de codo mediante programación. Ejecute UMap utilizando el número determinado de CP.
Agrupe las células utilizando FindNeighbors y FindClusters. Especifique los PCs determinados en la resolución establecida en 0,5. Realice un análisis de expresión diferencial entre los grupos objetivo utilizando la función FindWorkers.
Identifique genes con variabilidad espacial. Para cada muestra original, ejecute la búsqueda de características espacialmente variables utilizando el método de Moran's I en el ensayo SCT para calcular la autocorrección espacial. Después de ejecutar este script, puede obtener el gráfico de codo, el gráfico UMap, el gráfico de agrupamiento, el mapa de calor de marcadores de agrupamiento, el gráfico de volcan, los genes expresados diferencialmente según la característica espacial, los genes espacialmente confiables y los marcadores de capas del colon.
Y el gráfico de puntos de marcadores de capas del colon, junto con los marcadores en el gráfico de características espaciales. Paso cinco, preprocesamiento de datos de referencia de célula individual. Lea la matriz de conteo de RNA-seq de célula individual utilizando read 10X y cree un objeto Seurat.
Realice la normalización estándar de control de calidad y la desagrupación. Calcule el porcentaje de lecturas mitocondriales en las células filtradas. Normalice los datos utilizando la transformación SC.
Establezca una vara.to. para regresar el porcentaje.mt. Realice PCA y UMap largo, y agrupe las células utilizando el método dinámico de selección de PC descrito en pasos anteriores, luego anote los tipos celulares.
Calcule puntajes de módulos para genes marcadores canónicos de tipos celulares mediante AddModuleScore. Anote los grupos según los puntajes de módulos y la biología conocida. Alternativamente, importe anotaciones precalculadas desde metadatos.
Después de aprender este script, puede obtener las métricas de control de calidad. Han cargado el UMap por clúster, el UMap por muestra y las puntuaciones de tipos celulares. Paso seis, desconvolución guiada por referencia con SPOTlight.
Primero, prepare los datos para SPOTlight. Convierta el objeto Seurat de célula individual anotado y el objeto Seurat espacial en un objeto de experimento de célula individual. Normalice los datos de célula individual mediante logaritmo usando LogMoreCounts.
Luego, realice la desconvolución con SPOTlight. Primero, identifique los genes de alta variabilidad en los datos de célula individual utilizando ModelGeneVar. Calcule los marcadores de tipo celular usando score markers y filtre para obtener marcadores de alta calidad.
Reducir la muestra de referencia de célula individual para cada tipo de célula a un número manejable para disminuir el tiempo computacional. Ejecutar la desconvolución utilizando la función SPOTlight, proporcionando la referencia de célula individual, los datos espaciales, la lista de marcadores y los HVG, luego podemos visualizar y exportar los resultados. Puede obtener el resultado de la desconvolución de esta manera, mostrado como una ruta de dispersión.
Paso siete, desconvolución no supervisada con Stdeconvolve. Primero, prepare los datos espaciales. Extraiga las métricas del recuento de filas del objeto espacial de Seurat utilizando GetAssayData con la ranura counts.
Elimine puntos y genes de baja calidad utilizando recuentos limpios de STdeconvolve. Identifique los tipos celulares latentes para los filtros que expresan cuatro genes en una fracción mínima de puntos, utilizando LDA estricto restringido mediante el modelo de asignación a lo largo de un rango de números potenciales de temas usando fitLDA. Seleccione el modelo óptimo basado en la mínima complejidad utilizando el modelo óptimo con opt min.
Analice y visualice los resultados. Extraiga la proporción de serotipos, Theta y los perfiles genéticos Beta para el modelo óptimo utilizando getBetaTheta. Para incorporar la interpretación biológica de los temas de corrosión, importe anotaciones de regiones de interés generadas por la herramienta de selección de puntos espaciales.
Utilice estas anotaciones como parámetro del grupo en la función con todos los temas. Al proyecto, vuelva a proyectar las proporciones de tipos celulares desconvolutadas sobre las coordenadas espaciales y codifique con colores los puntos según su ROI. Después de ejecutar el script, obtendrá un resultado como este, una carga de tubería de escala, como las generadas por SPOTlight.
Paso ocho, comunicación espacial entre células mediante Giotto. Primero, convierta el objeto Seurat en un objeto Giotto. Utilice la función createGiottoObject, proporcionando métricas de conteo bajo y las coordenadas espaciales.
Preprocese el objeto Giotto y agregue el resultado de la desconvolución. Normalice los datos utilizando Giotto normalizado y añádalos como anotaciones de serotipo. Elija los metadatos celulares utilizando addCellmetadata.
Cree una red espacial utilizando createSpatialNetwork. Cargue una base de datos de receptores y ligandos en nuestro entorno. Ejecute explore CellCellcom para identificar interacciones significativas entre ligandos y receptores entre tipos celulares que se encuentran en proximidad espacial.
Puede obtener el gráfico de puntos de comunicación célula-célula de esta manera. El paso nueve es opcional. Selección interactiva de puntos con SelectSpatialSpot.
Prepare los datos para la herramienta interactiva utilizando el script seis. Extraiga las coordenadas espaciales del objeto Seurat utilizando GetTissueCoordinates. Formatee y exporte los datos.
Exporte el marco de datos formativo a un archivo CSV. Luego realice el análisis de la región de interés. Inicie el personalizado.
Seleccione las aplicaciones de puntos espaciales y cargue el archivo CSV. Seleccione interactivamente los puntos según su ubicación espacial. Luego exporte la lista de puntos seleccionados y su grupo asignado, etiquetado como un nuevo archivo CSV.
Simplemente verificamos qué podemos obtener tras ejecutar el script uno por uno. Todos los resultados se guardan en la carpeta de resultados dividida en cinco partes. Y como puede ver, podemos obtener las métricas de control de calidad y dividirlas.
Y puede comprobar el gráfico de características espaciales aquí. Además, el proceso de desconvolución se realiza de forma supervisada y no supervisada. Los resultados de SPOTlight están aquí.
Como puede verse, todos los puntos contienen la información de proporción. Aquí también se generan los resultados de desconvolución no supervisada mediante STdeconvolve. Y este es el resultado de los grupos de Seurat para el punto en los datos espaciales.
También puede visualizarlos en el gráfico espacial de equipos, como este. Además, también puede obtener el resultado de la comunicación entre puntos mediante Giotto. Todo este flujo de trabajo es 100 % de código abierto.
Análisis de puntos desde las métricas de expresión hasta la modelización espacial avanzada. Todos los pasos se ejecutan en una máquina con 16 GB de RAM. La base de código es modular, un script para cada tarea.
Tenga en cuenta que esta canalización no abarca el procesamiento previo desde el precio FASTQ. El enfoque está en los datos espaciales en 2D y actualmente incluye solo los descargadores de Visium. Eso es todo, gracias por ver.
Vea la transcripción completa y acceda a miles de videos científicos
Este artículo presenta un flujo de trabajo computacional integral para analizar conjuntos de datos de transcriptómica espacial (ST) utilizando R. El protocolo aborda desafíos comunes en el análisis de ST, como la importación de datos, control de calidad, integración, desconvolución, estadísticas espaciales y visualización, mediante un enfoque optimizado basado en scripts. El flujo de trabajo es adaptable a conjuntos de datos de ST estándar basados en matrices y hace hincapié en la reproductibilidad y la transparencia de los parámetros.
El análisis de datos de transcriptómica espacial es fundamental para comprender la arquitectura tisular y la biología del microambiente en investigaciones de descubrimiento temprano y traslacionales. Este flujo de trabajo permite a los equipos de biofármacos integrar, desconvolucionar e interpretar datos de expresión génica espacial con reproductibilidad y transparencia de parámetros. Al estandarizar los pasos computacionales, apoya la validación robusta de dianas y la toma de decisiones en carteras ajustadas al riesgo.
Este flujo de trabajo conecta el descubrimiento inicial, la identificación de candidatos y la investigación traslacional al proporcionar una base computacional reproducible para el análisis de transcriptómica espacial.