21 августа 2026 г.
В данном протоколе представлен воспроизводимый рабочий процесс анализа данных пространственной транскриптомики, который ведет пользователя от получения общедоступных данных и контроля качества на базе Seurat до интеграции, обнаружения пространственных признаков, деконволюции типов клеток, аннотирования областей интереса и анализа межклеточных взаимодействий с практическими контрольными точками, обеспечивающими прозрачность выполнения.
Всем привет. В этом видео мы подробно разберем практический конвейер анализа данных пространственной транскриптомики: от получения и загрузки данных до базового ознакомления и, наконец, углубленного анализа. В целом рабочий процесс состоит из трех основных этапов.
Во-первых, загрузите данные, во-вторых, получите код для анализа и, в-третьих, запустите конвейер обработки для получения результатов. Шаг первый: сбор данных и подготовка структуры каталогов. Сначала получите общедоступные наборы данных пространственной транскриптомики.
Загрузите архив с необработанными данными. Распакуйте архив. Организуйте файлы в соответствии со стандартной структурой каталогов.
Сначала создайте основной каталог данных, а затем создайте отдельный подкаталог для каждого образца. Перенесите следующие основные файлы для каждого образца в соответствующий подкаталог. После этого создайте подпапку для пространственных данных (spatial) внутри каталога каждого образца.
Поместите следующие файлы в подпапку spatial. Поместите файл S1 с метриками PC отфильтрованных признаков в основной подкаталог образца. Распакуйте gzip-файлы в папке spatial.
Убедитесь, что исходные имена файлов точно соответствуют требованиям функции load 10X spatial. Шаг второй: настройка программной среды. В данном случае мы пропускаем установку языка R, и описание процесса начинается с получения скрипта для анализа из репозитория GitHub.
Установите необходимые пакеты R из папки Graham в файловом проводнике, запустив скрипт setup R. Установите auto suit, выполнив команды установки, указанные в официальном документе. Перейдите по официальному URL-адресу установки, чтобы получить установочные скрипты. Инициализируйте необходимую среду Python и системные зависимости в соответствии с инструкциями на странице установки.
Получите специализированный инструмент, перейдя в репозиторий GitHub, и скачайте исходный код. Перейдите в директорию TOS и установите зависимости Python. Шаг три: загрузка пространственных данных и контроль качества.
Загрузите пространственные данные в объект Seurat. Используйте функцию read 10X image для ручной загрузки изображения ткани с высоким разрешением, указав путь к изображению и его имя.
Используйте функцию load 10X spatial с параметром image, установленным на объект изображения, созданный на предыдущем этапе, и создайте объект Seurat. Рассчитайте показатели контроля качества. Вычислите процент митохондриальных ридов с помощью функции percentage feature, указав паттерн mt.
Визуализируйте и интерпретируйте данные на основе метрик контроля качества (QC). Постройте скрипичные диаграммы (violin plots) для nCount_Spatial, nFeature_Spatial и percent.mt с помощью функции violin plot.
Постройте графики пространственных признаков для этих метрик с помощью функций визуализации пространственных признаков. Определите споты, находящиеся за пределами области ткани. При необходимости примените фильтры для удаления спотов низкого качества.
После запуска скрипта вы получите следующие результаты, включая показатели контроля качества (QC) и пространственный график признаков. Шаг четыре: предварительная обработка, интеграция и кластеризация данных. Выполните нормализацию при предварительной обработке отдельных образцов.
Примените нормализацию SC transform к каждому образцу отдельно с использованием анализа Spatial. Интегрируйте несколько образцов. Подготовьте список объектов, нормализованных с помощью SCTransform, для интеграции.
Убедитесь, что для каждого объекта есть анализ РНК, скопировав пространственный анализ. Используйте функции выбора признаков интеграции (select integration features) в интеграции PREP SCT для идентификации общих вариабельных признаков. Найдите якоря интеграции с помощью функции поиска якорей интеграции (find integration anchors) с методом нормализации SCT.
Интегрируйте данные с помощью IntegrateData. Выполните снижение размерности и кластеризацию интегрированного анализа. Запустите PCA для интегрированных данных с помощью runPCA.
Определите оптимальное количество главных компонентов для последующего анализа путем расчета кумулятивной объясненной дисперсии. Программно определите точку перегиба («локоть»). Запустите UMap, используя установленное количество главных компонентов.
Выполните кластеризацию клеток с помощью функций FindNeighbors и FindClusters. Укажите определенные PC при значении resolution 0,5. Проведите анализ дифференциальной экспрессии между целевыми группами с помощью функции FindMarkers.
Выявите пространственно-вариабельные гены. Для каждого исходного образца запустите функцию find spatially variable features, используя метод индекса Морана (Moran's I) в анализе SCT для вычисления пространственной автокорреляции. После запуска этого скрипта вы сможете получить график «локтя», график UMap, график кластеров, тепловую карту маркеров кластеров, график «вулкан», список дифференциально экспрессируемых пространственных признаков, пространственно достоверные гены и маркеры слоев толстой кишки.
А также диаграмма рассеяния маркеров слоев толстой кишки, вместе с маркерами на графике пространственных признаков. Шаг пять: предварительная обработка эталонных данных секвенирования единичных клеток. Считайте матрицу подсчетов scRNA-seq с помощью функции read10X и создайте объект Seurat.
Выполните стандартную нормализацию контроля качества (QC) и декластеризацию. Рассчитайте процент митохондриальных ридов в отфильтрованных клетках. Нормализуйте данные с помощью метода SC transform.
Установите vara.to. для регрессии percent.mt. Выполните PCA, UMap и кластеризацию клеток с использованием метода динамического выбора главных компонентов, описанного на предыдущих этапах, затем аннотируйте типы клеток.
Рассчитайте баллы модулей для канонических marker-генов типов клеток с помощью функции AddModuleScore. Аннотируйте кластеры на основе полученных баллов модулей и известных биологических данных. В качестве альтернативы импортируйте предварительно вычисленные аннотации из метаданных.
После изучения этого скрипта вы сможете получить показатели контроля качества (QC). В загруженные данные входят UMap по кластерам, UMap по образцам и показатели типов клеток. Шаг шестой: деконволюция с использованием референсного руководства с помощью SPOTlight.
Сначала подготовьте данные для SPOTlight. Преобразуйте аннотированный объект Seurat с данными одноклеточного секвенирования и пространственный объект Seurat в объекты SingleCellExperiment. Выполните логарифмическую нормализацию одноклеточных данных с помощью LogMoreCounts.
Затем выполните деконволюцию с помощью SPOTlight. Сначала определите высоковариабельные гены в данных одноклеточного секвенирования с помощью ModelGeneVar. Рассчитайте маркеры типов клеток, используя score markers, и отфильтруйте их для выбора высококачественных маркеров.
Проведите даунсэмплинг одноклеточной референсной выборки для каждого типа клеток до приемлемого количества, чтобы сократить время вычислений. Выполните деконволюцию с помощью функции SPOTlight, указав одноклеточную референсную выборку, пространственные данные, список маркеров и HVGs, после чего можно будет визуализировать и экспортировать результаты. Результат деконволюции можно получить следующим образом, в виде цепочки функций (scatter pipe route).
Шаг семь: ненаправленная деконволюция с помощью Stdeconvolve. Сначала подготовьте пространственные данные. Извлеките показатели количества чтений в строках из пространственного объекта Seurat, используя функцию GetAssayData со слотом counts.
Удалите пятна и гены низкого качества, используя очищенные данные подсчетов из STdeconvolve. Определите латентные типы клеток для фильтров, при которых четыре корпуса генов экспрессируются в минимальной фракции пятен, используя restrict strict LDA. Примените эту модель распределения для диапазона потенциальных чисел тем с помощью fitLDA. Выберите оптимальную модель на основе минимальной сложности, используя optimal model с opt min.
Проанализируйте и визуализируйте результаты. Извлеките пропорцию серотипов Theta и генные профили Beta для оптимальной модели с помощью функции getBetaTheta. Для добавления биологической интерпретации тем коррозии импортируйте аннотации интересующих областей, созданные с помощью инструмента выбора пространственных точек (select spatial spot tool).
Используйте эти аннотации в качестве параметра группы в функции with all topics. Перенесите деконволюционные пропорции типов клеток вашего проекта обратно на пространственные координаты и раскрасьте споты в соответствии с их ROI. После запуска скрипта вы получите результат, подобный этому: масштабную визуализацию, аналогичную той, что создается с помощью SPOTlight.
Шаг восемь: анализ пространственного межклеточного взаимодействия с помощью Giotto. Сначала преобразуйте объект Seurat в объект Giotto. Используйте функцию createGiottoObject, указав метрики с низким количеством отсчетов и пространственные координаты.
Выполните предварительную обработку объекта Giotto и добавьте результаты деконволюции. Нормализуйте данные с помощью функции normalized Giotto, добавьте аннотации серотипов. Выберите метаданные клеток с помощью функции addCellmetadata.
Создайте пространственную сеть с помощью функции createSpatialNetwork. Загрузите базу данных лиганд-рецепторных взаимодействий в рабочую среду. Запустите функцию explore CellCellcom, чтобы выявить значимые взаимодействия лиганд-рецептор между типами клеток, находящимися в пространственной близости.
Вы можете получить точечную диаграмму межклеточного взаимодействия следующим образом. Девятый шаг не является обязательным. Интерактивный выбор точек с помощью SelectSpatialSpot.
Подготовьте данные для интерактивного инструмента с помощью скрипта six. Извлеките пространственные координаты из объекта Seurat с помощью функции GetTissueCoordinates. Отформатируйте и экспортируйте данные.
Экспортируйте сформированный фрейм данных в файл CSV. Затем проведите анализ интересующей области. Запустите пользовательскую программу.
Выберите приложение «spatial spots dash» и загрузите CSV-файл. Интерактивно выберите точки на основе их пространственного расположения. Затем экспортируйте список выбранных точек и назначенную им группу в новый CSV-файл.
Мы проверяем, какие данные можно получить после последовательного запуска скриптов. Все результаты сохраняются в папке results five-fold. Как видно, мы получаем показатели контроля качества (QC metrics) и данные разделения.
График пространственных признаков можно посмотреть здесь. Кроме того, процесс деконволюции выполнялся как контролируемым, так и неконтролируемым способами. Результаты SPOTlight представлены здесь.
Как видно, все пятна содержат информацию о пропорциях. Здесь также представлены результаты ненаправленной деконволюции, полученные с помощью STdeconvolve. И это результат кластеризации пятен в пространственных данных с помощью Seurat.
Вы также можете визуализировать их на пространственном графике команд, как показано здесь. Более того, вы можете получить результаты анализа взаимодействия спотов с помощью Giotto. Весь этот рабочий процесс является полностью открытым (open source).
Анализ пятнистости: от показателей экспрессии до продвинутого пространственного моделирования. Все этапы выполняются на компьютере с 16ГБ оперативной памяти. Кодовая база является модульной: для каждой задачи предусмотрен отдельный скрипт.
Обратите внимание, что данный рабочий процесс не охватывает предварительную обработку данных из файлов FASTQ. Основное внимание уделено 2D-пространственным данным, и на данный момент включены только загрузчики Visium. Это всё, спасибо за внимание.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данной статье представлен комплексный вычислительный рабочий процесс для анализа данных пространственной транскриптомики (ST) с использованием языка R. Протокол решает распространенные проблемы анализа ST, такие как импорт данных, контроль качества, интеграция, деконволюция, пространственная статистика и визуализация, предлагая оптимизированный подход на основе скриптов. Этот рабочий процесс адаптируем для стандартных ST-датасетов на базе массивов и делает упор на воспроизводимость и прозрачность параметров.
Анализ данных пространственной транскриптомики имеет решающее значение для понимания архитектуры тканей и биологии микроокружения в рамках ранних этапов открытий и трансляционных исследований. Данный рабочий процесс позволяет биофармацевтическим группам интегрировать, декольвуционировать и интерпретировать данные о пространственной экспрессии генов с обеспечением воспроизводимости и прозрачности параметров. Стандартизация вычислительных этапов способствует надежной валидации мишеней и принятию взвешенных решений по портфелю проектов с учетом рисков.
Данный рабочий процесс объединяет этапы первичного поиска, идентификации перспективных соединений и трансляционных исследований, предоставляя воспроизводимую вычислительную основу для анализа пространственной транскриптомики.