2026년 8월 21일
본 프로토콜은 공간 전사체 데이터 분석을 위한 재현 가능한 워크플로우를 제시하며, 공개 데이터 획득 및 Seurat 기반의 품질 관리부터 통합, 공간적 특징 검출, 세포 유형 디콘볼루션(deconvolution), 관심 영역 주석 달기, 그리고 세포 간 통신 분석에 이르기까지의 과정을 안내하며, 투명한 실행을 지원하는 실질적인 체크포인트를 제공합니다.
안녕하세요. 본 영상에서는 데이터 획득 및 로딩부터 기초 탐색, 그리고 최종적인 심층 분석에 이르기까지의 실무적인 공간 전사체 데이터 분석 파이프라인을 살펴보겠습니다. 전반적인 워크플로우는 세 가지 주요 단계로 구성됩니다.
첫째, 데이터를 다운로드하고, 둘째, 분석 코드를 확보하며, 셋째, 파이프라인을 실행하여 결과를 생성합니다. 1단계는 데이터 획득 및 디렉토리 구조 준비입니다. 우선, 공개 공간 전사체 데이터 세트를 확보하십시오.
원시 데이터 아카이브를 다운로드하십시오. 그리고 아카이브를 압축 해제하십시오. 파일들을 표준화된 디렉토리 구조로 정리하십시오.
먼저 메인 데이터 디렉토리를 생성한 다음, 각 샘플을 위한 전용 하위 디렉토리를 생성하십시오. 각 샘플에 해당하는 필수 파일들을 해당 하위 디렉토리로 전송하십시오. 그런 다음 각 샘플 디렉토리 내에 spatial 하위 폴더를 생성하십시오.
다음 파일들을 spatial 하위 폴더에 넣습니다. 필터링된 feature PC metrics S1 파일을 샘플의 메인 하위 디렉토리에 넣습니다. spatial 폴더 내의 gzip 파일들을 압축 해제합니다.
파일 이름이 load 10X spatial 함수에서 요구하는 형식과 정확히 일치하는지 확인하십시오. 두 번째 단계는 소프트웨어 환경 설정입니다. 여기서는 R 언어 설치 과정은 생략하며, GitHub 저장소에서 분석 스크립트를 가져오는 것부터 데이터 처리를 시작합니다.
setup R 스크립트를 실행하여 conductor 파일에 있는 Graham의 필수 R 패키지를 설치하십시오. 공식 문서 시트에 제공된 설치 명령어를 실행하여 auto suit를 설치하십시오. 공식 설치 URL로 이동하여 설정 스크립트를 가져오십시오. 설정 페이지의 지침에 따라 필요한 Python 환경 및 시스템 종속성을 초기화하십시오.
GitHub 리포지토리에 접속하여 커스텀 툴을 확보하고 소스 코드를 다운로드합니다. TOS 디렉토리로 이동하여 Python 종속성을 설치합니다. 세 번째 단계는 공간 데이터 로딩 및 품질 관리입니다.
공간 데이터를 Seurat 객체로 읽어들입니다. read 10X image를 사용하여 고해상도 조직 이미지를 수동으로 로드합니다. 이때 이미지 경로와 이미지 이름을 지정합니다.
이전 단계에서 생성한 이미지 객체를 image 파라미터로 설정하여 load 10X spatial을 사용하고 Seurat 객체를 생성합니다. 품질 관리 지표를 계산합니다. pattern을 mt로 설정한 percentage feature set을 사용하여 미토콘드리아 리드 비율을 계산합니다.
QC 메트릭을 기반으로 데이터를 시각화하고 해석하십시오. violin plot 함수를 사용하여 nCount_Spatial, nFeature_Spatial 및 percent.mt의 바이올린 플롯을 생성하십시오.
공간 특징 플롯을 사용하여 이러한 메트릭의 공간 특징 플롯을 생성하십시오. 그리고 조직 영역 외부에 있는 스팟을 식별하십시오. 선택 사항으로, 품질이 낮은 스팟을 제거하기 위해 필터를 적용하십시오.
스크립트를 실행하면 QC 지표와 특성 공간 도표를 포함한 이러한 결과들을 얻을 수 있습니다. 4단계는 데이터 전처리, 통합 및 클러스터링입니다. 개별 샘플의 전처리 과정에서 정규화를 수행합니다.
Spatial 분석 어세이를 사용하여 각 샘플에 개별적으로 SC transform 정규화를 적용하십시오. 여러 샘플을 통합하십시오. 통합을 위해 SCTransform 정규화된 객체 목록을 준비하십시오.
공간 분석(spatial assay)을 복사하여 각 객체에 RNA 분석(RNA assay)이 포함되도록 합니다. PREP SCT 통합(integration)의 선택적 통합 기능(select integration features)을 사용하여 공유 가변 특성(shared variable features)을 식별합니다. 정규화 방법으로 SCT를 사용하는 find integration anchors를 통해 통합 앵커(integration anchors)를 찾습니다.
IntegrateData를 사용하여 데이터를 통합하십시오. 통합된 assay에 대해 클러스터링 및 차원 축소를 수행하십시오. runPCA를 사용하여 통합된 데이터에 대해 PCA를 실행하십시오.
누적 설명 분산을 계산하여 다운스트림 분석을 위한 최적의 주성분 개수를 결정합니다. 엘보우 포인트(elbow point)를 프로그램으로 식별합니다. 결정된 PC 개수를 사용하여 UMap을 실행합니다.
FindNeighbors와 FindClusters를 사용하여 세포를 클러스터링합니다. 설정된 resolution 0.5에서 결정된 PC들을 지정하십시오. FindWorkers 함수를 사용하여 표적 그룹 간의 차등 발현 분석을 수행합니다.
공간적 가변 유전자를 식별합니다. 각 원본 샘플에 대해, SCT assay에서 Moran's I 방법을 이용한 find spatially variable features를 실행하여 공간적 자기상관을 계산합니다. 이 스크립트를 실행한 후, 엘보우 플롯, UMap 플롯, 클러스터 플롯, 클러스터 마커 히트맵, 화산 플롯, 공간적 특징 차별 발현 유전자, 공간적 신뢰 유전자 및 결장 층 마커를 얻을 수 있습니다.
그리고 결장 층 마커 도트 플롯과 공간 특징 플롯의 마커들을 확인합니다. 5단계, 단일 세포 참조 데이터 전처리 단계입니다. read 10X를 사용하여 단일 세포 RNA-seq 카운트 행렬을 읽고, Seurat 객체를 생성합니다.
표준 QC 정규화 및 디클러스터링(declustering)을 수행합니다. 필터링된 세포 내 미토콘드리아 리드의 백분율을 계산합니다. SC transform을 사용하여 데이터를 정규화합니다.
vara.to.를 설정하고 percent.mt.를 회귀 분석합니다. Long PCA UMap을 수행하고 이전 단계에서 설명한 동적 PC 선택 방법을 사용하여 세포를 클러스터링한 다음, 세포 유형을 주석 처리합니다.
AddModuleScore를 사용하여 표준 세포 유형 마커 유전자에 대한 모듈 점수를 계산합니다. 모듈 점수와 알려진 생물학적 지식을 바탕으로 클러스터를 주석 처리합니다. 또는 메타데이터에서 미리 계산된 주석을 가져올 수 있습니다.
이 스크립트를 학습한 후, QC 지표를 얻을 수 있습니다. 클러스터별 UMap, 샘플별 UMap, 세포 유형 점수가 업로드되어 있습니다. 6단계는 SPOTlight를 이용한 참조 가이드 디콘볼루션(reference guided deconvolution)입니다.
먼저, SPOTlight를 위한 데이터를 준비합니다. 주석이 달린 단일 세포 Seurat 객체와 공간 Seurat 객체를 단일 세포 실험 객체(single-cell experiment object)로 변환합니다. LogMoreCounts를 사용하여 단일 세포 데이터를 로그 정규화합니다.
그런 다음 SPOTlight 디콘볼루션을 실행합니다. 우선, ModelGeneVar를 사용하여 단일 세포 데이터에서 고변이 유전자를 식별합니다. 스코어 마커를 사용하여 세포 유형 마커를 계산하고 고품질 마커만 필터링합니다.
계산 시간을 단축하기 위해 각 세포 유형별 단일 세포 참조 데이터를 관리 가능한 수준으로 다운샘플링합니다. 단일 세포 참조 데이터, 공간 데이터, 마커 목록 및 HVG를 제공하여 SPOTlight 함수를 통해 디콘볼루션을 수행한 후, 그 결과를 시각화하고 내보낼 수 있습니다. 다음과 같이 산점도 파이프 경로로 표시된 디콘볼루션 결과를 얻을 수 있습니다.
7단계, Stdeconvolve를 이용한 비지도 디컨볼루션입니다. 먼저, 공간 데이터를 준비합니다. GetAssayData의 slot counts를 사용하여 공간 Seurat 객체에서 행 카운트 메트릭을 추출합니다.
STdeconvolve에서 얻은 정제된 카운트(clean counts)를 사용하여 품질이 낮은 스폿(spot)과 유전자를 제거합니다. restrict strict LDA를 통해 코퍼스 내의 4개 유전자가 최소 스폿 분율에서 발현되는 필터의 잠재적 세포 유형을 식별하며, fitLDA를 사용하여 다양한 잠재적 토픽 수 범위에 걸쳐 해당 할당 모델을 도출합니다. opt min을 이용한 최적 모델(optimal model)을 통해 복잡성이 최소화되는 지점을 기준으로 최적의 모델을 선택합니다.
결과를 분석하고 시각화하십시오. getBetaTheta를 사용하여 최적 모델의 혈청형 비율(Theta)과 유전자 프로파일(Beta)을 추출하십시오. 부식 주제에 대한 생물학적 해석을 추가하려면, select spatial spot 도구로 생성한 관심 영역(region of interest) 주석을 가져오십시오.
이 어노테이션을 모든 토픽(with all topics) 기능의 그룹 파라미터로 사용하십시오. 디콘볼루션된 세포 유형 비율을 프로젝트의 공간 좌표에 다시 매핑하고, 각 스팟을 ROI별로 색상 코딩하십시오. 스크립트를 실행하면 SPOTlight에서 생성된 것과 같이 스케일 파이프 로드 형태의 결과를 얻게 됩니다.
8단계, Giotto를 이용한 공간적 세포 간 통신 분석입니다. 먼저, Seurat 객체를 Giotto 객체로 변환합니다. createGiottoObject 함수를 사용하여 low-count metrics와 공간 좌표를 제공하십시오.
Giotto 객체를 전처리하고 디컨볼루션(deconvolution) 결과를 추가합니다. normalized Giotto를 사용하여 데이터를 정규화하고, 이를 혈청형(serotype) 주석으로 추가합니다. addCellmetadata를 사용하여 세포 메타데이터를 선택합니다.
createSpatialNetwork를 사용하여 공간 네트워크를 생성하십시오. 리간드-수용체 데이터베이스를 환경으로 로드하십시오. explore CellCellcom을 실행하여 공간적으로 인접한 세포 유형 간의 유의미한 리간드-수용체 상호작용을 식별하십시오.
이와 같이 세포 간 통신 점 도표(dot plot)를 얻을 수 있습니다. 9단계는 선택 사항입니다. SelectSpatialSpot을 이용한 대화형 스팟 선택 과정입니다.
six 스크립트를 사용하여 인터랙티브 도구를 위한 데이터를 준비합니다. GetTissueCoordinates를 사용하여 Seurat 객체에서 공간 좌표를 추출합니다. 데이터를 포맷팅하고 내보냅니다.
형성된 데이터 프레임을 CSV 파일로 내보냅니다. 그 다음 관심 영역(region of interest) 분석을 수행합니다. 사용자 정의 프로그램을 실행하십시오.
spatial spots dash 애플리케이션을 선택하고 CSV 파일을 불러옵니다. 공간적 위치를 기반으로 스팟을 대화형으로 선택합니다. 그런 다음 선택한 스팟 목록과 할당된 그룹을 새로운 CSV 파일로 내보냅니다.
스크립트를 하나씩 실행한 후 얻을 수 있는 결과를 확인하겠습니다. 모든 결과는 results five-fold에 저장됩니다. 보시는 바와 같이, QC 메트릭과 divide를 얻을 수 있습니다.
여기에서 공간적 특성 플롯을 확인할 수 있습니다. 또한, 디컨볼루션 과정은 지도 및 비지도 방식 모두로 수행되었습니다. SPOTlight 결과는 여기에 있습니다.
보시는 바와 같이, 모든 스폿에는 비율 정보가 포함되어 있습니다. STdeconvolve를 통한 비지도 디콘볼루션(unsupervised deconvolution) 결과 또한 여기서 생성되었습니다. 그리고 이것은 공간 데이터 내 스폿에 대한 Seurat 클러스터링 결과입니다.
다음과 같이 공간 팀 플롯(spatial team plot)에서도 시각화할 수 있습니다. 또한 Giotto를 통해 스팟 간 통신(spot-spot communication) 결과도 얻을 수 있습니다. 이 전체 워크플로우는 100% 오픈 소스입니다.
발현 지표부터 고급 공간 모델링까지의 스팟 분석 과정입니다. 모든 단계는 16GB RAM이 탑재된 컴퓨터에서 실행됩니다. 코드베이스는 모듈식으로 구성되어 있으며, 각 작업당 하나의 스크립트가 할당되어 있습니다.
이 파이프라인은 FASTQ 파일로부터의 업스트림 프로세싱은 다루지 않는다는 점에 유의하십시오. 2D 공간 데이터에 중점을 두고 있으며, 현재는 Visium 다운로더만 포함하고 있습니다. 이것으로 마치겠습니다, 시청해 주셔서 감사합니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 논문은 R을 이용해 공간 전사체학(ST) 데이터셋을 분석하기 위한 종합적인 계산 워크플로우를 제시합니다. 이 프로토콜은 효율적인 스크립트 기반 접근 방식을 제공함으로써 데이터 임포트, 품질 관리, 통합, 디콘볼루션, 공간 통계 및 시각화와 같은 ST 분석의 일반적인 과제들을 해결합니다. 해당 워크플로우는 표준 어레이 기반 ST 데이터셋에 적용 가능하며, 재현성과 파라미터 투명성을 강조합니다.
공간 전사체 데이터 분석은 초기 발견 및 중개 연구에서 조직 구조와 미세환경 생물학을 이해하는 데 중추적인 역할을 합니다. 이 워크플로우를 통해 바이오 제약 팀은 재현성과 파라미터 투명성을 갖추고 공간 유전자 발현 데이터를 통합, 디컨볼루션 및 해석할 수 있습니다. 계산 단계를 표준화함으로써, 이는 강력한 타겟 검증과 리스크가 조정된 포트폴리오 의사결정을 지원합니다.
이 워크플로우는 공간 전사체 분석을 위한 재현 가능한 계산적 기반을 제공함으로써 초기 발견, 리드 물질 식별 및 중개 연구를 연결합니다.