2012년 12월 10일
우리 베이지안 변경 포인트 (BCP)이 알고리즘은 숨겨진 마르코프 모델을 통해 모델링 변화 포인트의 최신 발전을 토대로와 염색질 immunoprecipitation 시퀀싱 (ChIPseq) 데이터 분석에 적용됩니다. BCP는 광범위하고 작은 반점이있는 두 데이터 유형에서 잘 수행하지만, 정확하게 확산 히스톤 농축의 강력한 재현 섬을 식별하는 탁월한.
다음 실험의 전반적인 목표는 크로마틴 면역침전 시퀀싱 데이터의 매핑된 리드 위치 밀도를 활용하여 게놈 전체의 사후 평균 리드 밀도를 추정하는 것입니다. 이는 전처리 과정을 통해 달성됩니다. 매핑된 ChIP-seq 리드는 200 base pair의 비중복 빈(bin) 내에 동일한 수의 리드가 포함되도록 블록화된 밀도 프로파일로 변환됩니다.
두 번째 단계로 밀도가 동일한 인접 빈(bin)들을 더 큰 블록으로 병합하며, 전방 및 후방 필터가 포함된 베이지안 모델을 사용하여 모든 주변 블록의 맥락 내에서 각 블록의 사후 평균 밀도를 재귀적으로 계산합니다. 이때 블록의 리드 수는 alpha 및 beta 매개변수를 갖는 감마 사전 분포를 따르는 theta 매개변수의 포아송 분포로 모델링됩니다. 다음으로, 최종 농축 게놈 세그먼트 결과를 생성하기 위해 각 블록의 사후 평균 밀도 추정치가 입력 대조군 배경 밀도에 대한 90번째 분위수를 초과하는지 여부를 기준으로 유의성을 평가합니다. 이를 통해 BCP 분석 중 ChIP-seq 데이터에서 raw 시퀀싱 리드부터 사후 평균 리드 밀도 추정치, 그리고 최종적으로 농축된 아일랜드(island)에 이르기까지의 진행 과정을 보여주는 결과가 도출됩니다.
또한, 결과에 따르면 BCP는 경쟁 도구인 cer보다 우수한 성능을 보입니다. CER과 같은 기존 방법 대비 이 기술의 주요 장점은 BCP가 은닉 마커 모델의 최신 A 발전 사항을 활용했다는 점이며, 따라서 이전의 휴리스틱 방법들보다 chipsy 데이터 분석의 미세한 차이를 더 잘 특성화합니다. 이 방법은 게놈 전반의 농축 패턴을 특성화함으로써 histo 변형의 역할과 같은 후성유전학 분야의 핵심 질문들을 해결하는 데 도움을 줄 수 있습니다.
본 환자 방법론은 ChIP-seq 데이터 분석에 대한 통찰을 제공할 수 있지만, 이 기본 프레임워크는 bisulfite 시퀀싱 데이터에서의 차등 메틸화 영역 식별, RNA-Seq에서의 새로운 전사 궤적, 복제수 변이 또는 수많은 마이크로어레이 타일링 데이터와 같은 다른 차세대 시퀀싱 데이터 분석에도 적용될 수 있습니다. 이 방법의 시각적 시연은 방법론과 그 장점을 명확하게 이해하는 데 매우 중요합니다. 이론적인 장점들은 소프트웨어 내에 구현되어 있습니다.
여기에서 시연된 모든 절차 단계는 BCP 소프트웨어 패키지의 단일 실행 파일로 패키징되었으며, 이 비디오에서 다운로드할 수 있습니다. 소프트웨어를 실행하기 위해 프로그램이 수행하는 단계들이 설명되어 있습니다. 세 가지 매개변수가 필요합니다.
칩 샘플에서 유일하게 매핑된 리드(read)가 포함된 파일과 입력 대조군 리드에 대한 유사한 파일, 그리고 BCP 분석을 위한 입력 파일을 준비하기 위한 출력 파일 이름이 필요합니다. 먼저, 시퀀싱 런(sequencing run)에서 생성된 숏 리드(short read)를 선호하는 숏 리드 정렬 소프트웨어를 사용하여 적절한 참조 게놈에 정렬하십시오. 매핑된 위치는 6개 열로 구성된 브라우저 확장 데이터 또는 BED 형식으로 변환되어야 하며, 매핑된 리드당 탭으로 구분된 한 줄로 매핑된 염색체 시작 위치, 종료 위치, 리드 이름, 점수 및 가닥(strand)이 표시되어야 합니다.
칩 및 입력 맵 위치를 미리 정해진 단편 길이로 확장합니다. 예를 들어, DNA의 효소 소화 또는 초음파 처리 중에 목표로 한 단편 크기는 보통 약 200 base pairs입니다. 그 다음, 인접한 빈(bin)에 단편 수를 집계합니다.
기본적으로 빈 크기는 추정 단편 길이인 200 base pairs로 설정됩니다. 동일한 리드 수가 나타나는 빈 세트에서 발생 가능한 모든 변화점은 대부분 최외곽 경계에 위치하게 됩니다. 따라서 리드 수가 동일한 두 빈 사이의 내부 경계에서 변화점이 발생할 가능성은 낮습니다.
따라서 빈당 리드 수가 동일한 인접 빈들을 하나의 블록으로 그룹화합니다. 입력 파일을 준비한 후, 화면 하단에 표시된 명령어를 입력하여 BCP 추정을 실행합니다. 각 블록의 리드 밀도는 평균 파라미터 theta를 가진 포아송 분포로 모델링되며, theta는 alpha 및 beta 파라미터를 가진 감마 분포의 혼합과 임의의 블록에서 변화 지점이 발생할 사전 확률을 따릅니다.
각 블록에 대해 P 조건의 경계를 설정하는 방식은 결과적으로 무한 상태 은닉 마르코프 모델(hidden Markov model) 또는 HMM을 구현합니다. 하이퍼파라미터 alpha, beta 및 P는 최대 사후 가능도를 사용하여 추정합니다. 베이즈 추정치는 각 블록 theta sub T에 대하여 why sub T가 주어졌을 때 theta sub T의 기댓값으로 명시적으로 계산됩니다. HMM에서 흔히 사용되는 더 전통적이지만 시간이 많이 소요되는 전방 및 후방 필터는 사후 평균 theta hat sub T를 추정하기 위해 계산 효율성이 더 높은 유계 복잡도 혼합 근사(bounded complexity mixture approximation)로 대체됩니다. 결과적으로 도출된 사후 평균은 근사적인 구간별 상수 프로필로 평활화되므로, 동일한 theta hat sub T를 가진 블록들은 업데이트된 경계 좌표와 함께 추가로 그룹화되어야 합니다.
BCP는 블록당 입력 리드 수를 배경 비율로 사용하여 농축도를 결정합니다. 이는 블록에 대한 칩 위치 평균 밀도가 특정 유의성 임계값을 초과하는지 여부에 기반한 단순 가설 검정을 통해 이루어집니다. 90번째 분위수가 기본 임계값이며 대부분의 경우에 적절합니다.
그 후 BCP는 농축 수준을 초과하는 인접한 후험 평균 밀도 블록들을 하나의 단일 영역으로 병합하고, 병합된 좌표를 브라우저에 표시합니다. 확장 가능한 데이터 형식의 BCP는 히스톤 수정 데이터에서 광범위한 농축 영역을 식별하는 데 탁월합니다. 여기에서는 BCP의 결과를 기존 도구인 cser의 결과와 비교하였습니다. 본 연구실의 이전 연구에서 H3K36 trimethylation을 조사했을 때, BCP가 cer보다 훨씬 더 큰 아일랜드 크기를 나타내는 경향이 있음이 입증되었습니다.
더 큰 아일랜드는 H3K36 삼메틸화 농축이 넓고 확산되어 나타난다는 일반적인 기대치와 더 잘 일치합니다. 하지만 아일랜드가 크다는 것만으로는 정확성을 나타내지 않습니다. 따라서 BCP와 CER의 성능을 평가하기 위해, H3K36 삼메틸화 아일랜드가 활발하게 전사되는 유전자 본체(gene body)와 연관되어 있다는 점과 H3K27 삼메틸화 아일랜드와는 상호 배타적이라는 알려진 사실을 이용하였습니다. CER-BCP는 H3K27 삼메틸화 아일랜드와의 중첩 증가를 초래하지 않으면서도 유전자 본체를 더 잘 포착하는 더 큰 연속적 아일랜드를 검출하였습니다.
BCP는 전사 억제된 유전자 간 영역 유전자 또는 H3K27 trimethylation 억제 마크와의 위양성 중첩 정도를 증가시키지 않으면서, 유전자 본체(gene body)와 밀접하게 정렬된 경계를 통해 H3K36 trimethylation islands의 활성 유전자 고중첩 상태를 유지합니다. 두 개의 반복 데이터 세트에서 BCP island 호출의 재현성을 평가한 결과, BCP는 경쟁 알고리즘인 cser에서 나타나는 리드 커버리지 깊이에 대한 심한 의존성 문제가 없는 것으로 관찰되었습니다. BCP의 견고성과 재현성에 대한 추가 증거는 별도의 다른 영역들을 조사함으로써 제공되었으며, 이는 감소된 커버리지 깊이에도 불구하고 일관된 island 경계를 보여주었습니다. BCP의 다재다능함을 완전히 입증하기 위해, H3K27 trimethylation 및 H3K36 trimethylation 외에도 점상 마크인 H3K27 acetylation, H3K9 acetylation, H3K4 trimethylation 및 확산성 마크인 H3K9 trimethylation을 포함한 광범위한 히스톤 수정 데이터가 수집되었습니다. 이 데이터 세트들은 BCP와 cser 모두 기본 매개변수 설정을 사용하여 분석되었습니다.
중심부에는 PXDN 유전자의 활성 전사를 나타내는 H3K36 트리메틸화 농축 부위가 있으며, 전사 시작 부위에서는 예상대로 감소합니다. 추가적인 점상 활성 표지인 H3K27 아세틸화, H3K9 아세틸화 및 H3K4 트리메틸화가 관찰됩니다. PXDN 바로 하류에는 H3K27 트리메틸화 농축으로 표시된 억제된 유전자 간 공간이 있으며, 반대쪽 측면에는 H3K27 트리메틸화로 억제된 유전자가 위치합니다. 한 단계 더 바깥쪽으로 이동하면.
H3K9 트리메틸화 농축으로 나타나는 우리의 침묵 염색질은, 아마도 H3K27 트리메틸화 억제보다 덜 일시적인 의미에서 SNTG2 및 MYT1L의 침묵을 나타내는 것으로 보입니다. 이 영역은 히스톤 수정의 ChIP-seek에서 발견되는 대부분의 현상을 포함합니다. 이는 BCP의 역동적인 특성이 점상 아세틸화와 H3K4 트리메틸화 표지를 식별하는 동시에, H3K27 트리메틸화 및 H3K9 트리메틸화 억제의 거대한 연속 섬 영역과 H3K36 트리메틸화 활성 전사를 구분할 수 있음을 보여줍니다.
이 알고리즘은 리드 수와 게놈 서명 결과에 따라 약 30분 정도 소요될 수 있습니다. 다른 방법들에서 흔히 요구되는 것과 같은 상당한 최적화는 이 절차를 따른 후 진행하십시오. BBCP를 사용하면 다양한 다른 히스톤 수정뿐만 아니라 DNA 결합 전사 인자를 포함한 염색질 면역침전의 여러 표적 단백질을 연구할 수 있으며, 이를 통해 후성유전적 메커니즘과 유전자 조절에 관한 추가적인 의문에 답할 수 있습니다.
이 영상을 시청하고 나면, ChIP-seq 데이터 분석에서 확산성 히스톤 마크(diffuse histone marks)에 도달 가능한 영역을 식별하기 위해 BCP가 어떻게 사용되는지 충분히 이해하게 될 것입니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 연구에서는 크로마틴 면역침전 시퀀싱(ChIP-seq) 데이터 분석을 개선하는 베이지안 변화점(Bayesian Change Point, BCP) 알고리즘을 제시합니다. BCP는 은닉 마르코프 모델(Hidden Markov Models)을 활용하여 광범위한 데이터 유형과 점상 데이터 유형 모두에서 히스톤 농축 영역을 효과적으로 식별합니다.
베이지안 변화점(Bayesian Change Point, BCP) 알고리즘은 점으로 나타나는 전사 인자 결합부터 확산된 히스톤 수정 아일랜드에 이르기까지 다양한 ChIP-seq 데이터 유형 전체에서 농축된 게놈 영역을 식별하는 통합적이고 매개변수 의존도가 낮은 접근 방식을 제공합니다. BCP는 휴리스틱 임계값 및 모델 전환에 대한 의존도를 낮춤으로써 에피게놈 표적 검증의 재현성과 실험실 간 비교 가능성을 향상시킵니다. 이는 통계적 근거를 갖춘 정량적 리드 밀도 프로파일을 제공하여 표적 신뢰도 및 경로 분석에 정보를 제공함으로써 초기 발견 단계에서의 기전적 리스크 감소를 지원합니다.
BCP 알고리즘은 원천 시퀀싱 데이터부터 생물학적 통찰에 이르는 발견의 연속 과정에 적용되어, 가설 기반의 타겟 검증, 재현 가능한 에피게놈 프로파일링, 그리고 초기 스크리닝과 전임상 검증 단계 전반의 데이터 통합을 지원합니다.