Artículo de método

Un flujo de trabajo práctico para el análisis de datos de transcriptómica espacial: desde la adquisición de datos hasta los análisis avanzados

DOI:

10.3791/70188

21 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo presenta un flujo de trabajo reproducible para analizar datos de transcriptómica espacial, guiando a los usuarios desde la adquisición de datos públicos y el control de calidad basado en Seurat hasta la integración, la detección de características espaciales, la desconvolución de tipos celulares, la anotación de regiones de interés y el análisis de la comunicación entre células, con puntos de control prácticos que favorecen una ejecución transparente.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La transcriptómica espacial (ST) caracteriza la expresión génica a nivel del genoma completo al tiempo que conserva el contexto espacial bidimensional de las moléculas de ARNm dentro de secciones de tejido, permitiendo estudios sobre la arquitectura tisular y la biología asociada al microambiente. Sin embargo, el análisis de ST sigue siendo un desafío porque la importación de datos, el control de calidad, la integración, la desconvolución, las estadísticas espaciales y la visualización a menudo requieren múltiples entornos de software y elecciones reproducibles de parámetros. Este protocolo presenta un flujo de trabajo computacional práctico para conjuntos de datos públicos de ST en R, que comienza con la adquisición de datos y la configuración del software, y continúa con la carga de datos basada en Seurat, control de calidad, normalización, integración de múltiples muestras, agrupamiento y análisis de genes espacialmente variables. A continuación, el flujo de trabajo aplica estrategias complementarias de desconvolución, incluyendo el análisis SPOTlight guiado por referencia y la modelización de temas no supervisada STdeconvolve, seguido del análisis espacial de comunicación célula a célula basado en Giotto y la selección interactiva de regiones de interés (ROI) mediante una aplicación personalizada en Python Dash. Al enfatizar la ejecución basada en scripts, las justificaciones explícitas de los parámetros, las salidas esperadas y los puntos de control para solución de problemas, el protocolo proporciona un marco adaptable para conjuntos de datos estándar de ST basados en matrices y plataformas relacionadas tras la evaluación de parámetros específicos del conjunto de datos y de la plataforma.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La transcriptómica espacial (ST) es una familia transformadora de tecnologías que mide la expresión génica a nivel del genoma completo mientras conserva las coordenadas espaciales de las moléculas de ARN mensajero (mRNA) dentro de secciones de tejido. Los métodos de ST incluyen enfoques basados en secuenciación que utilizan matrices con códigos de barras posicionales y enfoques de imágenes in situ que localizan señales transcripcionales dentro de microentornos tisulares intactos1,2. Al preservar el contexto espacial, la ST permite el análisis de la arquitectura tisular, la organización de vecindades celulares, la comunicación entre células y los procesos biológicos asociados al microentorno que no pueden resolverse completamente tras la disociación del tejido3.

El rápido crecimiento de los repositorios públicos de datos de transcriptómica espacial (ST) ha creado oportunidades sin precedentes para el análisis secundario y el desarrollo de métodos3. Recursos como la base de datos CROST curan cientos de conjuntos de datos transcriptómicos con resolución espacial en múltiples especies y plataformas tecnológicas, mientras que colecciones especializadas como STOmicsDB se centran en metodologías específicas, como Stereo-seq4,5. A pesar de esta abundancia de datos, el análisis computacional sigue siendo un desafío debido a la complejidad de las estructuras de datos espaciales, la diversidad de herramientas analíticas y los obstáculos técnicos para implementar flujos de trabajo reproducibles6,7,8,9,10,11.

Para abordar las limitaciones de depender de un único entorno de software, se presenta aquí un flujo de trabajo computacional integrado que utiliza herramientas analíticas complementarias. Los ecosistemas existentes de análisis de ST incluyen principalmente Seurat, Giotto y marcos basados en Python como Squidpy6,7,12. Aunque las herramientas basadas en Python como Squidpy ofrecen funcionalidades extensas para el análisis de grafos espaciales, consolidar la canalización computacional principal dentro de un único entorno de lenguaje de programación minimiza los obstáculos técnicos entre lenguajes. En consecuencia, la canalización principal se implementa principalmente en R para reducir los obstáculos técnicos entre lenguajes. Dentro de este flujo de trabajo basado en R, Seurat se utiliza para la carga de datos, control de calidad, normalización, reducción de dimensionalidad, visualización e integración de múltiples muestras, reflejando su uso común en flujos de trabajo de transcriptómica unicelular y espacial. Luego, Giotto se emplea para la construcción de redes espaciales y el análisis de comunicación célula-célula basado en ligandos y receptores. Por lo tanto, esta canalización vincula el preprocesamiento y la integración basados en Seurat con el análisis espacial basado en Giotto, manteniendo explícita y reproducible la transferencia de datos entre ambos conjuntos de herramientas.

Dentro de este marco, se implementan dos estrategias complementarias de desconvolución: SPOTlight, un método guiado por referencias que utiliza datos de scRNA-seq para estimar las proporciones de tipos celulares, y STdeconvolve, un método de modelado de temas no supervisado que identifica patrones transcripcionales latentes8,11. Los resultados ofrecen visiones complementarias de la heterogeneidad celular espacial, pero no se consideran una validación cruzada cuantitativa, a menos que los usuarios realicen el análisis opcional de concordancia descrito en el protocolo. Una aplicación personalizada en Python Dash, Select Spatial Spots, se integra para la anotación interactiva de regiones de interés (ROI) y exporta archivos de anotación estándar basados en coordenadas que pueden utilizarse en análisis posteriores.

En cuanto a la aplicabilidad práctica, este flujo de trabajo está destinado principalmente a datos estándar de ST basados en matrices (por ejemplo, Visium con resolución de 55 µm) y podría adaptarse a otros tipos de tejidos tras la evaluación de parámetros. Deben considerarse algunas limitaciones clave antes del análisis. En primer lugar, el módulo de desconvolución guiado por referencia depende de una referencia de scRNA-seq de alta calidad y compatible con el tejido. En segundo lugar, las plataformas subcelulares o cercanas a la resolución unicelular pueden requerir un preprocesamiento modificado, la agregación espacial de bins o una segmentación celular basada en imágenes antes de la integración2. El conjunto de datos representativo del colon de ratón se utiliza como caso de demostración para mostrar cómo el flujo de trabajo puede evaluar dominios espaciales y la organización del tejido definida por marcadores, y no como evidencia de compatibilidad universal de la plataforma.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los conjuntos de datos biológicos analizados en este protocolo están disponibles públicamente y se utilizan estrictamente con fines de demostración. Las referencias específicas de acceso a los datos y los repositorios de origen se proporcionan en los pasos correspondientes. Los conjuntos de datos originales fueron generados por los investigadores originales cumpliendo con las directrices éticas institucionales aplicables a cada estudio de origen. Consulte la Tabla de Materiales para verificar todas las versiones requeridas del software y los paquetes de R.

Requisitos de hardware: La memoria computacional necesaria para este flujo de trabajo aumenta según el número de muestras y puntos analizados. Para un conjunto de datos típico de transcriptómica espacial (por ejemplo, aproximadamente 3.000 puntos por muestra en hasta tres muestras), una estación de trabajo estándar con un mínimo de 16 GB de RAM es suficiente para ejecutar la canalización. Sin embargo, se recomienda encarecidamente contar con 32 GB de RAM o más para garantizar un rendimiento y estabilidad óptimos, especialmente durante los pasos computacionales que requieren mucha memoria, como la normalización mediante SCTransform y la factorización de matrices durante la desconvolución.

1. Adquisición de datos y preparación de la estructura de directorios

  1. Obtenga conjuntos de datos públicos de transcriptómica espacial (por ejemplo, acceso GEO GSE169749, con fecha de envío el 26 de marzo de 2021 y última actualización el 6 de marzo de 2022) y datos de referencia de RNA-seq de célula individual (por ejemplo, acceso GEO GSE264408, con fecha de envío el 19 de abril de 2024 y última actualización el 10 de diciembre de 2024).
  2. Descargue el archivo de datos brutos (por ejemplo, GSE169749_RAW.tar) desde el repositorio y extraiga el archivo.
    NOTA: Para el conjunto de datos representativo utilizado en este protocolo, el directorio extraído contiene múltiples archivos para cada muestra, cuyos nombres de archivo suelen incluir el número de acceso de la muestra en GEO (por ejemplo, GSM5213483).
  3. Organice los archivos en una estructura de directorios estandarizada compatible con Seurat Cargar_espacial_10X función.
    1. Cree un directorio principal para los datos (por ejemplo, ./data/).
    2. Cree un subdirectorio dedicado para cada muestra (por ejemplo, ./data/sample_A1/).
    3. Transfiera (copie o mueva) los siguientes archivos esenciales para cada muestra al subdirectorio correspondiente.
      1. Coloque el filtered_feature_bc_matrix.h5 archivo en el subdirectorio principal de la muestra.
      2. Crear un espacial/ subcarpeta dentro de cada directorio de muestra
      3. Coloque los siguientes archivos en el espacial/ subcarpeta: tissue_positions_list.csv.gz, scalefactors_json.json.gz y tissue_hires_image.png.gz.
    4. Descomprimir el .gz archivos en el espacial/ carpeta. Asegúrese de que los nombres de archivo originales permanezcan exactamente como los requiere el Cargar_espacial_10X función (por ejemplo, tissue_positions_list.csv).
      NOTA: La estructura final y organizada para una carga sin problemas debe seguir este patrón, utilizando la muestra A1 como ejemplo:
      ./data/muestra_A1/filtered_feature_bc_matrix.h5
      ./data/muestra_A1/espacial/posiciones_tejido_lista.csv
      ./data/muestra_A1/espacial/factores_de_escala_json.json
      ./data/muestra_A1/espacial/imagen_tejido_resolucion_alta.png

2. Configuración del entorno de software

  1. Instale R (versión 4.4.3 o superior).
  2. Obtenga los scripts de análisis (1_ReadSpatialData.R hasta 8_Giotto_Communication.R) desde el repositorio de GitHub (https://github.com/LeafLight/SpatialTranscriptomicsWorkFlow, en el commit con hash 2d85e18 para garantizar la reproducibilidad).
  3. Instale los paquetes de R requeridos desde CRAN y Bioconductor ejecutando el script setup.R.
    NOTA: Se proporciona una lista exhaustiva de las versiones específicas de los paquetes utilizados en este flujo de trabajo en el Tabla de materiales y también está disponible en el session_info.txt archivo dentro del repositorio de GitHub asociado (https://github.com/LeafLight/SpatialTranscriptomicsWorkFlow).
  4. Instalar Giotto Suite al ejecutar los comandos de instalación proporcionados en la documentación oficial.
    1. Diríjase a la URL oficial de instalación para obtener los scripts de configuración: https://giottosuite.com/articles/installation.html
    2. Inicialice el entorno de Python y las dependencias del sistema requeridas según las instrucciones paso a paso.
  5. Instale paquetes adicionales para una visualización mejorada.
    1. Ejecutar: install.packages(c("ggprism", "daltonismo"))
  6. Instale el personalizado Seleccionar puntos espaciales herramienta. Asegúrese de que el sistema operativo sea Windows, macOS o Linux, y de que esté instalada la versión 3.8 o superior de Python. Este paso es opcional.
    1. Obtenga la herramienta navegando al repositorio de GitHub (https://github.com/LeafLight/SelectSpatialSpots, en el commit con hash d20946e para garantizar la reproducibilidad) y descargando el código fuente.
    2. Diríjase al directorio de la herramienta e instale las dependencias de Python: pip install -r requirements.txt
  7. Instale el glmGamPoi paquete mediante la ejecución de BiocManager::install("glmGamPoi") para acelerar el SCTransform normalización.
    NOTA: El flujo de trabajo principal requiere únicamente los paquetes enumerados en los pasos 2.1–2.3 y 2.6. El paquete Rfast2 se utiliza para acelerar el cálculo del estadístico de Moran's I. Los paquetes opcionales del paso 2.5 sirven para generar gráficos listos para publicación con un tema estilo prism (ggprism) y para acceder a una paleta de colores adecuada para personas con discapacidad cromática (colorBlindness). La herramienta del paso 2.6 posibilita la función interactiva de selección de puntos. Ejecute el comando sessionInfo() y guarde la salida completa de la consola en un archivo de texto. Esto documenta las versiones exactas del software y las dependencias de los paquetes, lo cual es fundamental para garantizar la reproducibilidad a largo plazo.

3. Carga de datos espaciales y control de calidad (1_ReadSpatialData.R, 2_SpatialDataQC.R)

  1. Leer los datos espaciales en objetos Seurat.
    1. Utilice Read10X_Imagen para cargar manualmente la imagen de tejido de alta resolución, especificando la image.dir y image.name
    2. Uso Cargar10X_Espacial con el imagen parámetro establecido en el objeto de imagen creado en el paso 3.1.1 para crear el objeto Seurat.
  2. Calcular métricas de control de calidad.
    1. Calcule el porcentaje de lecturas mitocondriales utilizando PorcentajeConjuntoCaracterísticas con el patrón ^mt-.
  3. Visualice e interprete los datos en función de las métricas de control de calidad.
    1. Generar gráficos de violín de nConteo_Espacial, nCaracterística_Espacial, y porcentaje.mt utilizando VlnPlot.
    2. Crear gráficos espaciales de estas métricas utilizando SpatialFeaturePlot para identificar puntos fuera del área del tejido.
      NOTA: Punto de control visual: los puntos fuera del área del tejido suelen mostrar recuentos bajos de UMI (nConteo_Espacial < 500) y baja detección de genes (nCaracterística_Espacial < 200)
    3. Para fines de demostración, aplique filtros para eliminar puntos de baja calidad (por ejemplo, subconjunto(seurat_obj, subconjunto = nFeature_Spatial) > 200 & nCount_Spatial > 500)). Este es un paso opcional.
      NOTA: El objetivo principal del control de calidad (QC) en la transcriptómica espacial es identificar y anotar artefactos técnicos, como puntos fuera del tejido. Para los datos de colon Visium utilizados a modo de demostración, nFeature_Spatial > 200 y nCount_Spatial > 500 elimina puntos de baja complejidad o de fondo. Para tejidos con bajo contenido de ARN o secciones degradadas, inspeccione los gráficos de violín y de características espaciales antes de aumentar los umbrales; para tejidos densos o con alto número de UMI, pueden ser apropiados umbrales más estrictos. Evite filtrar únicamente por valores altos de expresión a menos que se observen dobletes, pliegues del tejido o artefactos evidentes. Con frecuencia no se recomienda el filtrado, ya que elimina físicamente ubicaciones espaciales, lo que podría interrumpir la continuidad de la estructura del tejido en análisis espaciales posteriores.

4. Preprocesamiento, integración y agrupamiento de datos (3_IntegrationAndClustering.R)

  1. Normalizar y preprocesar muestras individuales.
    1. Aplicar la normalización SCTransform a cada muestra por separado con assay = Spatial.
  2. Integrar múltiples muestras.
    1. Preparar la lista de objetos normalizados con SCT para la integración. Asegurarse de que cada objeto tenga un assay de "RNA" copiando el assay de "Spatial": spatial_list[[1]][["RNA"]] <- spatial_list[[1]][["Spatial"]]
      ​NOTA: Copiar el assay "Spatial" en una ranura estándar de assay "RNA" constituye una solución necesaria para garantizar la compatibilidad con funciones de integración posteriores diseñadas originalmente para objetos Seurat de célula única.
    2. Utilizar SelectIntegrationFeatures y PrepSCTIntegration para identificar características variables compartidas.
    3. Encontrar anclas de integración usando FindIntegrationAnchors con normalization.method = "SCT".
    4. Integrar los datos usando IntegrateData con normalization.method = "SCT".
  3. Realizar reducción de dimensionalidad y agrupamiento en el assay integrado.
    1. Ejecutar PCA en los datos integrados usando RunPCA.
    2. Determinar el número óptimo de componentes principales (PCs) para el análisis posterior mediante el cálculo de la varianza acumulada explicada. Identificar el punto de inflexión de forma programática (por ejemplo, el punto en el que la varianza acumulada supera el 90 % y la ganancia marginal cae por debajo del 0,1 %), utilizando el código en 3_IntegrationAndClustering.R, líneas 36-38. El número resultante de PCs se denominará a partir de ahora pc.use.
    3. Ejecutar RunUMAP con dims = 1:pc.use.
    4. Agrupar las células usando FindNeighbors con dims = 1:pc.use y FindClusters con resolution = 0,5. Ajustar la resolución únicamente tras inspeccionar la estabilidad de los grupos y la coherencia de los genes marcadores.
    5. Realizar análisis de expresión diferencial entre grupos objetivo (por ejemplo, "B1_colon_d14" frente a "A1_colon_d0") usando la función FindMarkers.
      ​NOTA: Control visual: una integración exitosa mostrará una mezcla adecuada de muestras en el gráfico UMAP, manteniendo al mismo tiempo grupos biológicamente distintos.
  4. Identificar genes con variabilidad espacial.
    1. Para cada muestra original, ejecutar FindSpatiallyVariableFeatures utilizando el método "moransi" en el assay "SCT" para calcular la autocorrelación espacial.

5. Preprocesamiento de datos de referencia de célula individual (4_scDataPreProcessing.R)

  1. Lea la matriz de conteo de RNA-seq de célula individual utilizando Read10X y cree un objeto Seurat.
  2. Realice control de calidad, normalización y agrupamiento estándar.
    1. Calcule el porcentaje de lecturas mitocondriales (percent.mt) y filtre las células (por ejemplo, nFeature_RNA > 200 & nFeature_RNA < 7500 & percent.mt < 25).
    2. Normalice los datos usando SCTransform, estableciendo vars.to.regress = "percent.mt".
    3. Realice PCA, UMAP y agrupe las células utilizando el método dinámico de selección de componentes principales descrito en el paso 4.3.2.
  3. Anote los tipos celulares.
    1. Calcule las puntuaciones modulares para los genes marcadores canónicos de tipo celular utilizando AddModuleScore.
    2. Anote los grupos según las puntuaciones modulares y la biología conocida. Alternativamente, importe anotaciones precalculadas desde los metadatos.

6. Desconvolución guiada por referencia con SPOTlight (5_SPOTlight_Deconv.R)

  1. Preparar los datos para SPOTlight.
    1. Convertir el objeto Seurat de célula única anotado y el objeto Seurat espacial en objetos SingleCellExperiment.
    2. Normalizar mediante logaritmo los datos de célula única utilizando logNormCounts.
  2. Realizar la desconvolución con SPOTlight.
    1. Identificar genes hipervariables (HVGs) en los datos de célula única utilizando modelGeneVar y getTopHVGs.
    2. Calcular los genes marcadores de tipo celular mediante scoreMarkers y filtrar para obtener marcadores de alta calidad (por ejemplo, media.AUC > 0,8).
    3. Reducir mediante submuestreo la referencia de célula única para cada tipo celular a un número manejable (por ejemplo, 50 células) para disminuir el tiempo computacional.
    4. Realizar la desconvolución utilizando la función SPOTlight con weight_id = "mean.AUC", group_id = "cluster" y gene_id = "gene".
  3. Visualizar y exportar los resultados.
    1. Extraer la matriz resultante de la desconvolución (proporciones de tipos celulares por punto).
    2. Utilizar plotSpatialScatterpie para visualizar la composición celular en las coordenadas espaciales.
    3. Añadir los resultados de la desconvolución a los metadatos del objeto Seurat espacial mediante AddMetaData. Resultado esperado: una matriz de desconvolución con columnas de proporciones de tipos celulares para cada punto espacial, gráficos de dispersión espaciales tipo pastel que muestren la composición celular local, y un objeto Seurat que contenga las proporciones de desconvolución como metadatos.

7. Desconvolución independiente de referencias con STdeconvolve (7_STdeconvolve.R)

  1. Preparar los datos espaciales.
    1. Extraiga la matriz de conteo crudo del objeto espacial de Seurat utilizando GetAssayData con ranura = "recuentos".
    2. Eliminar puntos y genes de baja calidad utilizando cleanCounts de STdeconvolve (por ejemplo, min.lib.size = 100).
  2. Identifique los tipos celulares latentes.
    1. Filtrar aún más el conjunto de datos para genes expresados en una fracción mínima de puntos utilizando restringirCorpus (p. ej., eliminarPorEncima=1.0, removeBelow = 0.05).
    2. Ajustar un modelo de Asignación Latente de Dirichlet (LDA) a lo largo de un rango de posibles números de temas (K) (por ejemplo, Ks = seq(2, 9, por = 1)) utilizando fitLDA.
    3. Seleccione el modelo óptimo según la perplejidad mínima utilizando modelo óptimo con opt = "min".
  3. Analice y visualice los resultados.
    1. Extraiga las proporciones de tipo celular (tema) (theta) y los perfiles génicos (beta) del modelo óptimo utilizando getBetaTheta.
    2. Para ayudar en la interpretación biológica de los temas desconvolucionados, importe anotaciones de regiones de interés (ROI) generadas por el "Seleccionar puntos espaciales" herramienta (ver paso 9.3.3). Utilice estas anotaciones como el parámetro de grupos en el vizTodosLosTemas función para proyectar las proporciones de tipos celulares desconvolutas de vuelta sobre las coordenadas espaciales y codificar por colores los puntos según su ROI. Este es un paso opcional.
      NOTA: El resultado esperado es que STdeconvolve devuelva valores theta que representen las proporciones de temas por punto y valores beta que representen los perfiles génicos para cada tema. Si los usuarios desean comparar cuantitativamente los resultados no supervisados de STdeconvolve con las salidas guiadas por referencia de SPOTlight (del Paso 6), pueden exportar ambas matrices de proporciones (theta de STdeconvolve y la matriz de SPOTlight) y calcular métricas de correlación o concordancia por punto (por ejemplo, correlación de Pearson o de Spearman) utilizando funciones estándar de R. La comparación cuantitativa entre SPOTlight y STdeconvolve es opcional y no es necesaria para ejecutar el flujo de trabajo principal; sin embargo, las matrices de salida relevantes están disponibles en los Pasos 6.3.1 y 7.3.1 para los usuarios que deseen realizar dicho análisis.

8. Comunicación espacial entre células mediante Giotto(8_Giotto_Communication.R)

  1. Convierta el objeto Seurat en un objeto Giotto.
    1. Utilice la función createGiottoObject, proporcionando la matriz de conteos crudos y las coordenadas espaciales.
  2. Preprocese el objeto Giotto y agregue los resultados de desconvolución.
    1. Normalice los datos utilizando normalizeGiotto.
    2. Agregue las anotaciones de tipo celular (por ejemplo, el tipo celular principal obtenido mediante desconvolución SPOTlight) a los metadatos celulares usando addCellMetadata.
  3. Infiere comunicación espacialmente informada entre células.
    1. Cree una red espacial utilizando createSpatialNetwork con method = "Delaunay" y name = "Delaunay_network".
    2. Cargue una base de datos de ligandos-receptores en el entorno R. Asegúrese de que el objeto cargado tenga formato de marco de datos con dos columnas distintas que representen los símbolos génicos del ligando y del receptor (por ejemplo, una red de ratón precompilada desde Zenodo: https://zenodo.org/api/records/15168114/files/lr_network_mouse.csv/content, versión v6, publicada el 7 de abril de 2025).
    3. Ejecute exprCellCellcom con cluster_column = "celltype_major" para identificar interacciones significativas entre ligandos y receptores entre tipos celulares que están en proximidad espacial. Resultado esperado: una tabla con pares de ligando-receptor, combinaciones de tipos celulares de origen y destino, valores de cambio de expresión en escala log2 y valores de p ajustados; conserve las interacciones significativas (por ejemplo, p.adj < 0.05) para su visualización.

9. Selección interactiva de puntos con selección de puntos espaciales (6_SelectSpatialSpots.R)

  1. Preparar los datos para la herramienta interactiva.
    1. Extraiga las coordenadas espaciales del objeto Seurat utilizando GetTissueCoordinates.
  2. Formatee y exporte los datos.
    1. Formatee el marco de datos de coordenadas para que contenga exactamente los encabezados de columna: CELL_ID, X e Y.
    2. Exporte el marco de datos formateado a un archivo CSV.
  3. Realice el análisis de región de interés (ROI).
    1. Inicie la aplicación personalizada Select Spatial Spots en Dash y cargue el archivo CSV.
    2. Seleccione interactivamente los puntos según su ubicación espacial.
    3. Exporte la lista de puntos seleccionados y sus etiquetas de grupo/ROI asignadas como un nuevo archivo CSV. Resultado esperado: un archivo CSV con identificadores de puntos, coordenadas X/Y y etiquetas de grupo/ROI asignadas que puedan asociarse nuevamente al objeto Seurat mediante CELL_ID.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La implementación del flujo de trabajo y la integración de datos ilustran las características principales de los tejidos

El flujo de trabajo computacional se aplicó a datos de transcriptómica espacial del colon de ratón para ilustrar los resultados esperados en las distintas etapas analíticas. Como se muestra en el esquema del flujo de trabajo (Figura 1), la canalización comenzó con la adquisición de datos y el control de calidad, donde los gráficos espaciales de características delimitaron los límites del tejido (Figura 2A,B). Luego, se utilizó el flujo de trabajo de integración basado en anclas de Seurat para reducir los efectos técnicos por lotes, conservando al mismo tiempo la variación biológica interpretable. Las visualizaciones UMAP mostraron el alineamiento de muestras y los patrones de agrupamiento espacial tras la integración (Figura 2C,D). Se implementó la selección cuantitativa y dinámica de componentes principales (PCs) basada en la varianza acumulada para guiar la reducción de dimensionalidad y el agrupamiento posterior (véase Figura Suplementaria 1). El análisis del mapa de calor de genes marcadores mostró perfiles transcripcionales distintos que sustentan los agrupamientos espaciales (Figura 2E).

Para evaluar si los grupos computacionales eran coherentes con la arquitectura anatómica conocida de la histología del colon, se analizaron los perfiles de expresión de genes marcadores canónicos específicos de capa. La capa de epitelio mucoso mostró expresión de marcadores de células epiteliales, incluyendo Epcam y Krt8, junto con el marcador de células caliciformes Muc2. Los marcadores mesenquimales y estromales, como Col1a1 y Vim, identificaron las regiones de lámina propia y submucosa, mientras que la capa externa de la muscularis propia fue indicada por genes estructurales de músculo liso como Acta2 y Tagln. La restricción espacial de estos marcadores asociados a linajes respalda la interpretación de que el flujo de trabajo de integración y agrupamiento preservó las principales laminaciones histológicas del tejido colónico a lo largo del eje mucosa-muscularis (véase Supplementary Figure 2).

Tras la validación de los grupos, se realizó un análisis de expresión diferencial posterior para identificar genes expresados diferencialmente (DEG) entre las condiciones experimentales (Figura 2F,G). Además, se identificaron genes espacialmente variables mediante la estadística de Moran I, destacando aquellos genes con una distribución espacial significativamente no aleatoria a través del tejido (Figura 2H).

La desconvolución celular y las redes de interacción espacial revelan la microorganización del tejido

El procesamiento de los datos de referencia de RNA-seq a nivel celular produjo anotaciones respaldadas por filtrado de control de calidad (Figura 3A), agrupamiento no supervisado (Figura 3B), validación de genes marcadores (Figura 3C) y concordancia con anotaciones independientes (Figura 3D). La composición celular (Figura 3E) informó la estrategia de submuestreo para la desconvolución. SPOTlight estimó las proporciones de tipos celulares guiadas por referencia a través de puntos espaciales (Figura 4A,B), mientras que STdeconvolve proporcionó una visión basada en modelado de temas no supervisado de los patrones celulares espaciales (Figura 5B). La herramienta personalizada Seleccionar Puntos Espaciales aportó contexto histológico para estos patrones (Figura 5A). Finalmente, utilizando las asignaciones de tipos celulares desconvolutas, el análisis de comunicación espacial identificó interacciones ligando-receptor entre grupos de tipos celulares próximos espacialmente (Figura 6A,B).

Observaciones para la solución de problemas a partir de la optimización del protocolo

Durante la optimización del protocolo, se identificaron varios problemas que permitieron establecer puntos de control prácticos. Los resultados subóptimos de desconvolución ocurrieron cuando las referencias de célula única no coincidían adecuadamente con el contexto del tejido, lo que indicó la necesidad de utilizar datos de scRNA-seq correspondientes al tejido y especie cuando estuvieran disponibles. Los intentos iniciales de agrupamiento con parámetros predeterminados no siempre resolvieron estructuras biológicas esperadas; examinar la selección de componentes principales (PC), la resolución del agrupamiento y la coherencia de los genes marcadores ayudó a identificar dominios interpretables espacialmente que se alineaban con la anatomía del tejido. Estas observaciones proporcionan ejemplos prácticos de cómo los usuarios pueden diagnosticar problemas analíticos comunes durante la ejecución del flujo de trabajo.

figure-results-1
Figura 1: Flujo de trabajo para el análisis integrado de transcriptómica espacial. Representación esquemática de la tubería analítica, desde la adquisición y preprocesamiento de datos hasta los análisis espaciales avanzados. Los pasos clave incluyen: (1) Carga de datos, control de calidad e integración multi-muestra utilizando Seurat; (2) Agrupamiento espacial y detección de genes con variabilidad espacial; (3) Desconvolución de tipos celulares mediante métodos basados en referencias (SPOTlight) y no supervisados (STdeconvolve); (4) análisis espacial de la comunicación célula-célula con Giotto y selección interactiva de regiones de interés mediante una herramienta personalizada, Seleccionar puntos espacialesLos resultados de todos los módulos se sintetizan para obtener conocimientos biológicos sobre la arquitectura tisular y el microambiente celular. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Integración de datos, agrupamiento y análisis de expresión diferencial. (A,B) Métricas de control de calidad para las muestras espaciales A1 y B1, que muestran las distribuciones de conteos de genes, conteos de UMI y porcentajes de genes mitocondriales. (C) Visualización UMAP de los datos integrados de transcriptómica espacial, coloreados según el origen de la muestra (izquierda) y la identidad de agrupamiento (derecha). (D) Proyección espacial de las identidades de los grupos sobre secciones de tejido. (E) Mapa de calor de los genes marcadores principales para cada grupo espacial. (F) Gráfico de volcán que muestra los genes diferencialmente expresados entre las condiciones A1_colon_d0 y B1_colon_d14. (G) Patrones de expresión espacial de genes representativos diferencialmente expresados a lo largo de secciones de tejido. (H) Mapas de expresión espacial de los principales genes espacialmente variables identificados mediante el estadístico de Moran's I, donde los dos paneles izquierdos muestran genes de la muestra A1_colon_d0 y los dos paneles derechos muestran genes de la muestra B1_colon_d14. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Procesamiento y anotación de datos de referencia a nivel de célula individual. (A) Métricas de control de calidad para los datos de referencia de scRNA-seq antes y después del filtrado. (B) Visualización UMAP de los datos de scRNA-seq coloreados según agrupamientos no supervisados. (C) Gráfico de puntos que muestra las puntuaciones de expresión de genes marcadores canónicos de tipos celulares a través de los agrupamientos. (D) Visualización UMAP anotada de los datos de scRNA-seq con los principales tipos celulares etiquetados. (E) Composición celular del conjunto de datos de referencia de scRNA-seq. La línea roja discontinua indica el umbral de submuestreo (n = 50 células por tipo) aplicado durante la desconvolución SPOTlight para equilibrar la eficiencia computacional y la representación de los tipos celulares. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 4: Desconvolución espacial de la heterogeneidad celular. (A,B) Gráficos circulares espaciales procedentes de la desconvolución SPOTlight que muestran la composición proporcional de los principales tipos celulares en cada punto para las muestras A1 (A) y B1 (B). (C) Distribución espacial representativa de las células B en las muestras A1 (izquierda) y B1 (derecha), que demuestra los patrones de localización resueltos espacialmente de una población específica de células inmunitarias identificada mediante desconvolución. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5: Comparación del análisis interactivo por regiones de interés y la desconvolución no supervisada. (A) Interfaz de la herramienta personalizada «Seleccionar puntos espaciales» que muestra la selección interactiva de regiones correspondientes al colon proximal, colon distal y otros dominios tisulares. (B) Visualización espacial en gráficos de pastel que muestra los resultados de la desconvolución no supervisada (STdeconvolve) para la muestra A1, con puntos coloreados según las regiones anotadas manualmente en (A), lo que ilustra la correspondencia entre la anotación basada en histología y las distribuciones computacionales de temas celulares. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 6: Redes espacialmente informadas de comunicación célula-célula. (A,B) Redes de interacción ligando-receptor inferidas por Giotto para las muestras A1 (A) y B1 (B). Los nodos representan tipos celulares, las aristas representan pares significativos de ligando-receptor (FDR < 0,05) y el grosor de las aristas corresponde a la intensidad de la interacción. Para garantizar la comparabilidad y la claridad visual, se aplicó un umbral de significancia uniforme (FDR < 0,05) en todas las muestras, y se muestran las 20 principales interacciones ordenadas por log2FC para cada condición. Las redes destacan patrones de comunicación específicos de cada tipo celular dentro del contexto espacial del tejido colónico. Haga clic aquí para ver una versión más grande de esta figura.

Figura suplementaria 1: Evaluación cuantitativa de la optimización de parámetros para la reducción de dimensionalidad. El gráfico de codo muestra el enfoque automatizado del flujo de trabajo para seleccionar dinámicamente el número óptimo de componentes principales (PCs). La selección se calcula en función de los umbrales de desviación estándar acumulada y varianza marginal, representados por la línea vertical roja, con el fin de capturar la varianza biológica mientras se reduce el ruido técnico antes del agrupamiento subsiguiente.Haga clic aquí para descargar este archivo.

Figura suplementaria 2: Validación del agrupamiento espacial mediante marcadores específicos de capas cólonicas canónicas. (A) Gráfico de puntos que muestra la expresión enriquecida de marcadores epiteliales, estromales y de músculo liso en los grupos computacionales. (B) Gráficos de características espaciales que asignan marcadores representativos (Epcam, Col1a1, Acta2) a las coordenadas del tejido.Haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo proporciona un flujo de trabajo computacional integral para el análisis de datos de transcriptómica espacial que equilibra la profundidad analítica con la accesibilidad práctica. El enfoque paso a paso guía a los investigadores a través de toda la tubería analítica, desde la adquisición inicial de datos hasta análisis espaciales avanzados, destacando puntos críticos de decisión y posibles dificultades.

Varios pasos del protocolo requieren atención particular debido a su impacto en los resultados posteriores. Los umbrales de control de calidad y filtrado deben ajustarse cuidadosamente según los tipos de tejido y plataformas tecnológicas específicas, ya que un filtrado excesivamente estricto podría eliminar puntos biológicamente relevantes, mientras que umbrales permisivos pueden introducir ruido técnico. La elección del método de normalización influye significativamente en los resultados de agrupamiento y expresión diferencial posteriores. Por ejemplo, la canalización utiliza SCTransform en lugar de la normalización logarítmica estándar porque se ha reportado que SCTransform modela y reduce la variación técnica relacionada con la profundidad de secuenciación y otros efectos técnicos en flujos de trabajo de células individuales y espaciales14,15. Durante la integración, la selección de características de integración y los parámetros de resolución requieren una consideración cuidadosa para equilibrar la fuerza de integración con la preservación de la señal biológica. Para la identificación de genes espacialmente variables, se seleccionó el índice de Moran (Moran's I) por su escalabilidad computacional y su adecuación para el análisis de autocorrelación espacial en datos basados en matrices, aunque pueden considerarse alternativas como SPARK dependiendo del tamaño del conjunto de datos y los objetivos del estudio16.

El componente de solución de problemas de este flujo de trabajo se centra en los problemas comunes de interoperabilidad que surgen al pasar salidas de un paquete al siguiente. En lugar de depender de un único paso genérico de conversión, el flujo de trabajo utiliza conversiones de formato personalizadas en cada interfaz de software: los datos espaciales de conteo se copian en una ranura de ensayo de ARN estándar antes de la integración en Seurat; los objetos de referencia de Seurat y de célula individual se convierten en objetos SingleCellExperiment para SPOTlight; las matrices espaciales de conteo se reformatean para STdeconvolve; los conteos, coordenadas y metadatos de tipos celulares derivados de Seurat se convierten en un objeto Giotto para el análisis de comunicación entre células; y las anotaciones de regiones de interés (ROI) de Select Spatial Spots se exportan como archivos CSV con CELL_ID, coordenadas X/Y y etiquetas de grupo para que puedan mapearse nuevamente al objeto Seurat. Estos pasos ayudan a los usuarios a identificar y corregir problemas comunes, como ranuras de ensayo incompatibles, identificadores de puntos no coincidentes, columnas de metadatos faltantes, formato incorrecto de coordenadas y discrepancias en los símbolos génicos de ligandos y receptores.

Una característica adicional de este flujo de trabajo es el uso de dos estrategias complementarias de desconvolución en lugar de depender de un solo algoritmo. SPOTlight utiliza referencias previas de scRNA-seq para la estimación guiada por referencias de las proporciones de tipos celulares, mientras que STdeconvolve posibilita el descubrimiento libre de referencias de temas transcriptómicos latentes. En el conjunto de datos de demostración, los temas identificados por STdeconvolve se alinearon con regiones definidas histológicamente (Figura 5B), lo que respalda su interpretación biológica. En este protocolo no se realizó una comparación cuantitativa directa entre ambos métodos; los usuarios que deseen evaluarlos con sus propios datos pueden seguir el marco proporcionado en el paso 7.3.2 del protocolo. Además, el protocolo favorece la usabilidad y trazabilidad mediante el uso de secuencias de comandos para funciones principales, al tiempo que ofrece una interfaz gráfica (Seleccionar puntos espaciales) para el aislamiento intuitivo de regiones de interés.

Vincular Seurat y Giotto permite que el flujo de trabajo combine el preprocesamiento y la integración basados en Seurat con estadísticas espaciales y análisis de redes basados en Giotto. Seurat ofrece un entorno consolidado para investigadores con experiencia en scRNA-seq y admite integración de múltiples muestras, mientras que transferir los datos armonizados a Giotto posibilita la construcción de redes espaciales y el análisis de ligandos-receptores. Este diseño permite a los usuarios aprovechar las ventajas documentadas de ambas plataformas sin implicar que se hayan comparado aquí con Squidpy u otros marcos de trabajo. Para la comunicación entre células, se utilizó la inferencia de ligandos-receptores basada en redes de Delaunay de Giotto porque incorpora la adyacencia espacial dentro del mismo entorno de análisis; marcos de trabajo como CellChat proporcionan bases de datos de señalización extensas, pero no se evalúan en este protocolo17.

Se deben considerar varias limitaciones. El enfoque de desconvolución basado en referencias depende críticamente de la disponibilidad de referencias de célula individual de alta calidad y coincidentes. Además, los supuestos fundamentales detrás del análisis de comunicación entre células se basan en la coexpresión transcripcional como un indicador de interacción física entre proteínas, lo que requiere validación experimental posterior. Por último, este flujo de trabajo se desarrolló principalmente en torno a conjuntos de datos Visium estándar. A medida que el campo avanza hacia tecnologías de resolución casi a nivel de célula individual, como Visium HD, las consideraciones analíticas cambiarán; los datos de mayor resolución pueden requerir parámetros diferentes de preprocesamiento y reducir la necesidad absoluta de desconvolución de puntos. Para adaptar este flujo de trabajo a conjuntos de datos Visium HD, los intervalos de alta resolución pueden agruparse computacionalmente en intervalos espaciales más grandes, o pueden omitirse los módulos de desconvolución de puntos en favor de la segmentación celular basada en imágenes18.

Estas características sugieren una aplicabilidad potencial en diversos ámbitos biológicos, incluyendo biología del desarrollo, neurociencia, investigación del cáncer e inmunología19,20,21,22. El diseño modular permite a los investigadores adaptar componentes específicos a sus necesidades, ya sea enfocándose en la identificación de dominios espaciales, la comunicación celular o la especialización regional. A medida que las tecnologías espaciales continúan evolucionando y los conjuntos de datos se amplían, este protocolo proporciona una base que puede ampliarse para incorporar nuevos métodos analíticos y abordar preguntas biológicas emergentes.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros en conflicto.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a los desarrolladores y mantenedores de los paquetes Seurat, Giotto y SPOTlight por su apoyo y documentación. También se reconoce con gratitud las contribuciones de los repositorios públicos de datos y de los investigadores que compartieron generosamente sus conjuntos de datos.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
ggplot2Posit Software, PBCv4.0.0(CRAN)Visualización avanzada de datos
GiottoDries Labv4.2.2 (GitHub)Análisis espacial de redes y comunicación entre células
patchwork Thomas Lin Pedersenv1.3.2 (CRAN)Composición y disposición de gráficos
R software R Foundation for Statistical Computingv4.4.3Entorno principal de ejecución (macOS aarch64)
scaterDavis McCarthy et al.v1.34.1 (Bioconductor)Control de calidad y visualización a nivel de célula individual
scranAaron Lun et al.v1.34.0 (Bioconductor)Modelado de varianza y detección de marcadores en células individuales
Select Spatial Spots (Herramienta personalizada en Python)LeafLightv1.0.0 (GitHub)Selección interactiva de regiones de interés espaciales (ROI) (https://github.com/LeafLight/SelectSpatialSpots)
Seurat Satija Labv5.3.0 (CRAN)Preprocesamiento, integración y agrupamiento de datos espaciales
SeuratObject Satija Labv5.2.0 (CRAN)Estructuras de datos para datos de célula individual y espaciales
SingleCellExperimentBioconductor Core Teamv1.28.1 (Bioconductor)Contenedor estandarizado de datos para secuenciación de ARN en célula individual (scRNA-seq)
SPOTlightMarc Elosua-Bayes et al.v1.10.0 (Bioconductor)Desconvolución espacial guiada por referencia
StdeconvolveJean Fan Labv1.3.2 (Bioconductor)Modelado de temas latentes no supervisado
tidyversePosit Software, PBCv2.0.0 (CRAN)Conjunto principal para manipulación y formateo de datos

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ozirmak Lermi N, Molina Ayala M, Hernandez S, et al. Comparison of imaging based single-cell resolution spatial transcriptomics profiling platforms using formalin-fixed paraffin-embedded tumor samples. Nat Commun. 2025;16(1):8499.
  2. Ren P, Zhang R, Wang Y, et al. Systematic benchmarking of high-throughput subcellular spatial transcriptomics platforms across human tumors. Nat Commun. 2025;16(1):9232.
  3. Danishuddin, Khan S, Kim JJ. Spatial transcriptomics data and analytical methods: An updated perspective. Drug Discovery Today. 2024;29(3):103889.
  4. Xu Z, Wang W, Yang T, et al. STOmicsDB: A comprehensive database for spatial transcriptomics data sharing, analysis and visualization. Accessed October 31, 2025. https://dx.doi.org/10.1093/nar/gkad933
  5. Wang G, Wu S, Xiong Z, Qu H, Fang X, Bao Y. CROST: A comprehensive repository of spatial transcriptomics. Nucleic Acids Res. 2024;52(D1):D882-D890.
  6. Chen JG, Chávez-Fuentes JC, O’Brien M, et al. Giotto Suite: a multiscale and technology-agnostic spatial multiomics analysis ecosystem. Nat Methods. 2025;22(10):2052-2064. doi:10.1038/s41592-025-02817-w
  7. Butler A, Hoffman P, Smibert P, Papalexi E, Satija R. Integrating single-cell transcriptomic data across different conditions, technologies, and species. Nat Biotechnol. 2018;36(5):411-420.
  8. Elosua-Bayes M, Nieto P, Mereu E, Gut I, Heyn H. SPOTlight: seeded NMF regression to deconvolute spatial transcriptomics spots with single-cell transcriptomes. Nucleic Acids Res. 2021;49(9):e50-e50.
  9. McCarthy DJ, Campbell KR, Lun ATL, Wills QF. Scater: pre-processing, quality control, normalization and visualization of single-cell RNA-seq data in R. Bioinformatics. 2017;33(8):1179-1186.
  10. Lun ATL, McCarthy DJ, Marioni JC. A step-by-step workflow for low-level analysis of single-cell RNA-seq data with bioconductor. F1000Research. Preprint posted online October 31, 2016. doi:10.12688/f1000research.9501.2
  11. Miller BF, Huang F, Atta L, Sahoo A, Fan J. Reference-free cell type deconvolution of multi-cellular pixel-resolution spatially resolved transcriptomics data. Nat Commun. 2022;13(1):2339.
  12. Palla G, Spitzer H, Klein M, et al. Squidpy: A scalable framework for spatial omics analysis. Nat Methods. 2022;19(2):171-178.
  13. Luecken MD, Büttner M, Chaichoompu K, et al. Benchmarking atlas-level data integration in single-cell genomics. Nat Methods. 2022;19(1):41-50.
  14. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019 Dec 23;20(1):296.
  15. Cuevas-Diaz Duran R, Wei H, Wu J. Data normalization for addressing the challenges in the analysis of single-cell transcriptomic datasets. BMC Genomics. 2024;25(1):444.
  16. Sun S, Zhu J, Zhou X. Statistical analysis of spatial expression patterns for spatially resolved transcriptomic studies. Nat Methods. 2020;17(2):193-200.
  17. Jin S, Plikus MV, Nie Q. CellChat for systematic analysis of cell–cell communication from single-cell transcriptomics. Nat Protoc. 2025;20(1):180-219.
  18. Zohora FT, Paliwal D, Flores-Figueroa E, et al. CellNEST reveals cell–cell relay networks using attention mechanisms on spatial transcriptomics. Nat Methods. 2025;22(7):1505-1519.
  19. Wang Q, Zhu H, Deng L, et al. Spatial transcriptomics: Biotechnologies, computational tools, and neuroscience applications. Small Methods. 2025;9(5):2401107.
  20. Chen MM, Gao Q, Ning H, et al. Integrated single-cell and spatial transcriptomics uncover distinct cellular subtypes involved in neural invasion in pancreatic cancer. Cancer Cell. 2025;43(9):1656-1676.e10.
  21. Li H, Guan W, Huang J, et al. A complete model of mouse embryogenesis through organogenesis enabled by chemically induced embryo founder cells. Cell. 2025;188(21):5912-5930.e20.
  22. Loh JW, Lee JY, Lim AH, et al. Spatial transcriptomics reveal topological immune landscapes of asian head and neck angiosarcoma. Commun Biol. 2023;6(1):461.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Perfilado de expresi n g nicaarquitectura tisularintegraci n de datoscontrol de calidadflujo de trabajo de Seuratdeconvoluci n espacialan lisis SPOTlightan lisis de comunicaci n celularregi n de inter s

Artículos relacionados