$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Mise en œuvre du flux de travail et intégration des données illustrant les caractéristiques majeures des tissus
Le flux de travail informatique a été appliqué à des données de transcriptomique spatiale du côlon de souris afin d'illustrer les résultats attendus à chaque étape analytique. Comme indiqué dans le schéma du flux de travail (Figure 1), le pipeline débutait par l'acquisition des données et le contrôle de qualité, où les graphiques spatiaux des caractéristiques délimitaient les frontières du tissu (Figure 2A,B). Le flux de travail d'intégration basé sur des ancres de Seurat a ensuite été utilisé pour réduire les effets techniques liés aux lots tout en préservant la variation biologique interprétable. Les visualisations UMAP montraient l'alignement des échantillons et les motifs de regroupement spatial après intégration (Figure 2C,D). Une sélection quantitative et dynamique des composantes principales (PC) fondée sur la variance cumulée a été mise en œuvre afin de guider la réduction dimensionnelle et le regroupement ultérieur (voir Figure supplémentaire 1). L'analyse du heatmap des gènes marqueurs a révélé des profils transcriptionnels distincts sous-tendant les groupes spatiaux (Figure 2E).
Afin d'évaluer si les groupes calculés étaient cohérents avec l'architecture anatomique connue de l'histologie du côlon, les profils d'expression de gènes marqueurs canoniques spécifiques aux couches ont été analysés. La couche de l'épithélium muqueux présentait une expression de marqueurs de cellules épithéliales, notamment Epcam et Krt8, ainsi que du marqueur des cellules caliciformes Muc2. Les marqueurs mésenchymateux et stromaux tels que Col1a1 et Vim identifiaient la lame propre et les régions sous-muqueuses, tandis que la couche externe de la musculeuse propre était indiquée par des gènes structuraux des muscles lisses tels que Acta2 et Tagln. La restriction spatiale de ces marqueurs associés aux lignées soutient l'interprétation selon laquelle le flux de travail d'intégration et de regroupement a préservé les principales laminations histologiques du tissu colique selon l'axe muqueuse-musculeuse (voir Supplementary Figure 2).
Après la validation des groupes, une analyse différentielle de l'expression a été réalisée afin d'identifier les gènes différentiellement exprimés (DEG) entre les conditions expérimentales (Figure 2F,G). De plus, les gènes présentant une variabilité spatiale ont été identifiés à l'aide de la statistique de Moran I, mettant en évidence les gènes dont la distribution spatiale dans le tissu est significativement non aléatoire (Figure 2H).
La désconvolution cellulaire et les réseaux d'interaction spatiale révèlent la microorganisation tissulaire
Le traitement des données de référence de séquençage de l'ARN unicellulaire a produit des annotations étayées par un filtrage de contrôle qualité (Figure 3A), un regroupement non supervisé (Figure 3B), une validation par gènes marqueurs (Figure 3C) et une concordance avec des annotations indépendantes (Figure 3D). La composition cellulaire (Figure 3E) a guidé la stratégie de sous-échantillonnage pour la déconvolution. SPOTlight a estimé les proportions de types cellulaires guidées par référence à travers les spots spatiaux (Figure 4A,B), tandis que STdeconvolve a fourni une vue, basée sur un modèle thématique non supervisé, des motifs cellulaires spatiaux (Figure 5B). L'outil personnalisé Select Spatial Spots a fourni un contexte histologique à ces motifs (Figure 5A). Enfin, à l'aide des attributions de types cellulaires déconvoluées, l'analyse de communication spatiale a identifié des interactions ligand-récepteur entre des groupes de types cellulaires proches spatialement (Figure 6A,B).
Observations de dépannage issues de l'optimisation du protocole
Lors de l'optimisation du protocole, plusieurs problèmes ont été identifiés et ont permis d'établir des points de contrôle pratiques. Des résultats de déconvolution sous-optimaux ont été observés lorsque les références unicellulaires étaient mal appariées au contexte tissulaire, ce qui souligne la nécessité d'utiliser des données scRNA-seq appariées au tissu et à l'espèce lorsque cela est possible. Les premières tentatives de regroupement avec les paramètres par défaut ne permettaient pas toujours de distinguer les structures biologiques attendues ; l'analyse du choix des composantes principales, de la résolution du regroupement et de la cohérence des gènes marqueurs a permis d'identifier des domaines interprétables spatialement, conformes à l'anatomie du tissu. Ces observations fournissent des exemples pratiques de la manière dont les utilisateurs peuvent diagnostiquer des problèmes analytiques courants lors de l'exécution du flux de travail.

Figure 1: Flux de travail pour l'analyse intégrée de la transcriptomique spatiale. Représentation schématique du pipeline analytique, allant de l'acquisition des données et du prétraitement jusqu'aux analyses spatiales avancées. Les étapes clés comprennent : (1) le chargement des données, le contrôle de qualité et l'intégration multi-échantillons à l'aide de Seurat ; (2) le regroupement spatial et la détection des gènes à variabilité spatiale ; (3) la déconvolution des types cellulaires via méthodes basées sur une référence (SPOTlight) et méthodes non supervisées (STdeconvolve) ; (4) Analyse de la communication spatiale entre cellules à l'aide de Giotto et sélection interactive de régions d'intérêt à l'aide d'un outil personnalisé, Sélectionner les spots spatiauxLes résultats de tous les modules sont synthétisés afin de dégager des informations biologiques sur l'architecture tissulaire et le microenvironnement cellulaire. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 2 : Intégration des données, regroupement et analyse d'expression différentielle. (A,B) Métriques de contrôle qualité pour les échantillons spatiaux A1 et B1, montrant les distributions des nombres de gènes, des nombres d'UMI et des pourcentages de gènes mitochondriaux. (C) Visualisation UMAP des données d'expression transcriptionnelle spatiale intégrées, colorées selon l'origine des échantillons (à gauche) et l'identité des regroupements (à droite). (D) Projection spatiale des identités des groupes sur les sections tissulaires. (E) Carte thermique des gènes marqueurs les plus significatifs pour chaque groupe spatial. (F) Graphique en volcan illustrant les gènes différentiellement exprimés entre les conditions A1_colon_d0 et B1_colon_d14. (G) Profils d'expression spatiale de gènes différentiellement exprimés représentatifs à travers les sections tissulaires. (H) Cartes d'expression spatiale des gènes les plus variables spatialement identifiés via la statistique de Moran's I, les deux panneaux de gauche montrant des gènes de l'échantillon A1_colon_d0 et les deux panneaux de droite montrant des gènes de l'échantillon B1_colon_d14. Veuillez cliquer ici pour consulter une version agrandie de cette figure.

Figure 3 : Traitement et annotation des données de référence à cellule unique. (A) Métriques de contrôle de qualité des données de référence scRNA-seq avant et après filtration. (B) Visualisation UMAP des données scRNA-seq colorées selon les clusters non supervisés. (C) Graphique en points montrant les scores d'expression des gènes marqueurs canoniques des types cellulaires selon les clusters. (D) Visualisation UMAP annotée des données scRNA-seq avec les principaux types cellulaires identifiés. (E) Composition cellulaire du jeu de données de référence scRNA-seq. La ligne rouge pointillée indique le seuil de sous-échantillonnage (n = 50 cellules par type) appliqué lors de la déconvolution SPOTlight afin d'équilibrer efficacité computationnelle et représentation des types cellulaires. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Déconvolution spatiale de l'hétérogénéité cellulaire. (A,B) Graphiques en camembert spatiaux issus de la déconvolution SPOTlight, montrant la composition proportionnelle des principaux types cellulaires à chaque position pour les échantillons A1 (A) et B1 (B). (C) Répartition spatiale représentative des cellules B dans les échantillons A1 (à gauche) et B1 (à droite), illustrant les profils de localisation spatialement résolus d'une population spécifique de cellules immunitaires identifiée par déconvolution. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Analyse interactive de régions d’intérêt et comparaison de la déconvolution non supervisée. (A) Interface de l'outil personnalisé « Sélectionner les points spatiaux » montrant la sélection interactive de régions correspondant au côlon proximal, au côlon distal et à d'autres domaines tissulaires. (B) Visualisation spatiale en camembert des résultats de déconvolution non supervisée (STdeconvolve) pour l'échantillon A1, avec des points colorés selon les régions annotées manuellement sur (A), illustrant la correspondance entre l'annotation histologique et les distributions de thèmes cellulaires dérivées par calcul. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Réseaux de communication entre cellules informés par la localisation spatiale. (A,B) Réseaux d'interactions ligand-récepteur inférés par Giotto pour les échantillons A1 (A) et B1 (B). Les nœuds représentent les types cellulaires, les arêtes représentent des paires ligand-récepteur significatives (FDR < 0,05), et l'épaisseur des arêtes correspond à l'intensité de l'interaction. Afin d'assurer la comparabilité et la clarté de la visualisation, un seuil de significativité uniforme (FDR < 0,05) a été appliqué à tous les échantillons, et les 20 premières interactions classées par log2FC sont affichées pour chaque condition. Ces réseaux mettent en évidence des profils de communication spécifiques aux types cellulaires dans le contexte spatial du tissu colique. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Figure supplémentaire 1 : Évaluation quantitative de l'optimisation des paramètres pour la réduction de dimensionnalité. Le graphique du coude illustre l'approche algorithmique du flux de travail pour sélectionner dynamiquement le nombre optimal de composantes principales (PCs). Ce choix est calculé à partir des seuils d'écart-type cumulé et de variance marginale, représentés par la ligne verticale rouge, afin de capturer la variance biologique tout en atténuant le bruit technique avant le regroupement en amont.Veuillez cliquer ici pour télécharger ce fichier.
Figure supplémentaire 2 : Validation du regroupement spatial à l'aide de marqueurs spécifiques aux couches coliques canoniques. (A) Graphique en points montrant l'expression enrichie de marqueurs épithéliaux, stromaux et musculaires lisses à travers les groupes obtenus par calcul informatique. (B) Cartes spatiales représentant la localisation de marqueurs caractéristiques (Epcam, Col1a1, Acta2) sur les coordonnées tissulaires.Veuillez cliquer ici pour télécharger ce fichier.