10 Aralık 2012
Bizim Bayesian Değişim Noktası (BCP) algoritması Saklı Markov Modelleri ile modelleme değişim noktaları state-of-the-art gelişmeler üzerine inşa ve kromatin immünopresipitasyon sekans (ChIPseq) veri analizi uygular. BCP geniş ve noktasal hem de veri türleri iyi performans sergilediğini, ancak doğru diffüz histon zenginleştirme sağlam, tekrarlanabilir adalar belirlenmesinde öne çıkmaktadır.
Aşağıdaki deneyin genel amacı, genom genelindeki posterior ortalama okuma yoğunluğunu tahmin etmek için kromatin immünopresipitasyon sekanslama verilerinden elde edilen eşlenmiş okuma konumlarının yoğunluğunu kullanmaktır. Bu, ön işleme yoluyla gerçekleştirilir. Eşlenmiş ChIP-seq okumaları, 200 baz çiftlik örtüşmeyen bölmeler (bin) içine düşen aynı sayıda okumaya sahip bloklanmış yoğunluk profillerine dönüştürülür.
İkinci bir adım olarak, aynı yoğunluğa sahip komşu kutular daha büyük bir blokta birleştirilir; ardından her bloğun posterior ortalama yoğunlukları, ileri ve geri filtreli bir Bayesyen model kullanılarak tüm çevreleyen bloklar bağlamında özyinelemeli olarak hesaplanır. Burada bir bloğun okuma sayısı, alfa ve beta parametrelerine sahip bir gama ön dağılımı alan bir theta parametresi ile Poisson dağılımı ile modellenir. Daha sonra, nihai zenginleştirilmiş genom segmentleri sonuçlarını oluşturmak için her bloğun posterior ortalama yoğunluk tahminleri, girdi kontrol arka plan yoğunluğuna göre 90. kantili aşıp aşmadığına göre anlamlılık açısından değerlendirilir; böylece BCP analizi sırasında ChIP-seq verileri üzerindeki ham dizilenmiş okumalardan posterior ortalama okuma yoğunluğu tahminlerine ve son olarak zenginleştirilmiş adalara geçişi gösteren sonuçlar elde edilir.
Ayrıca, sonuçlar BCP'nin rakip bir araç olan cer'den daha iyi performans gösterdiğini ortaya koymaktadır. Bu tekniğin CER gibi mevcut yöntemlere göre temel avantajı, BCP'nin gizli işaretleyici modellerindeki en güncel A gelişmelerini kullanmış olmasıdır; bu sayede, önceki sezgisel yöntemlere göre chipsy veri analizinin nüanslarını daha iyi tanımlamaktadır. Bu yöntem, genom genelindeki zenginleşme modellerini karakterize ederek histon modifikasyonlarının rolü gibi epigenomik alanındaki temel soruların yanıtlanmasına yardımcı olabilir.
Bu hasta yöntemi ChIP-seq veri analizi hakkında içgörü sağlayabilse de, temel çerçeve, bisülfit sekanslama verilerindeki diferansiyel metillenmiş bölgelerin tanımlanması, RNA-Seq'teki yeni transkripsiyon lokusları, kopya sayısı varyasyonu veya herhangi bir sayıdaki mikroarray döşeme verileri gibi diğer yeni nesil sekanslama veri analizlerine de uygulanabilir. Bu yöntemin görsel gösterimi, metodolojinin ve sağladığı avantajların net bir şekilde anlaşılması için kritiktir. Teorik avantajlar yazılımın içerisinde gizlidir.
Burada gösterilen tüm prosedür adımları, bu videoda indirilmeye hazır olan BCP yazılım paketinde tek bir yürütülebilir dosya olarak paketlenmiştir. Program tarafından yürütülen adımlar, yazılımın çalıştırılması için açıklanmıştır. Üç parametre gereklidir.
Bir çip örneğinden elde edilen benzersiz eşleşmiş okumaları içeren bir dosya, girdi kontrol okumaları için benzer bir dosya ve BCP analizi için girdi dosyalarını hazırlamak üzere belirlenmiş bir çıktı dosya adı. İlk olarak, sekanslama işlemlerinden elde edilen kısa okumaları, tercih edilen kısa okuma hizalama yazılımını kullanarak uygun referans genom ile hizalayın. Eşleşen konumlar, her bir eşleşmiş okuma için eşleşen kromozom başlangıç konumunu, bitiş konumunu, okuma adını, puanını ve zincirini belirten, sekmelerle ayrılmış altı sütunlu browser extensible data veya BED formatına dönüştürülmelidir.
Çip ve girdi haritalama konumlarını önceden belirlenmiş bir fragman uzunluğuna genişletin. Örneğin, DNA'nın enzim sindirimi veya sonikasyonu sırasında hedeflenen fragman boyutu genellikle 200 baz çifti civarındadır. Ardından fragman sayıları komşu kutucuklarda (bin) toplanır.
Varsayılan olarak, kutu (bin) boyutu 200 baz çifti olarak tahmin edilen fragman uzunluğuna ayarlanmıştır. Aynı okuma sayılarına sahip bir kutu setindeki olası tüm değişim noktaları, büyük olasılıkla en dış sınırlarda yer alacaktır. Buna bağlı olarak, aynı okuma sayılarına sahip iki kutu arasındaki dahili bir sınırda değişim noktası oluşması düşük bir ihtimaldir.
Bu nedenle, bin başına düşen okuma sayıları özdeş olan komşu binleri tek bir blok halinde gruplandırın. Giriş dosyalarını hazırladıktan sonra, ekranın altında gösterilen komutu yazarak BCP kestirimini başlatın. Her bloğun okuma yoğunluğu, alfa ve beta parametrelerine sahip gama dağılımlarının bir karışımını takip eden bir theta ortalama parametresi ile herhangi bir blokta değişim noktası oluşma olasılığının önsel olasılığına sahip bir poisson dağılımı olarak modellenir.
Her bloğu bu şekilde koşullandıran P sınırı, etkili bir şekilde sonsuz durumlu gizli Markov modelini veya HMM'yi oluşturur. Alfa, beta ve P hiperparametreleri maksimum posterior olasılık kullanılarak tahmin edilir. Bayes tahminleri, her bir theta sub T bloğu için, why sub T verildiğinde theta sub T'nin beklenen değeri olarak açıkça hesaplanır. HMM'lerde sıklıkla kullanılan ancak zaman alıcı olan geleneksel ileri ve geri filtrelerin yerini, posterior ortalamaları theta hat sub T'yi tahmin etmek için hesaplama açısından daha verimli olan sınırlı karmaşıklığa sahip karışım yaklaşımı alır. Ortaya çıkan posterior ortalamaları yaklaşık parçalı sabit bir profile düzleştirilecektir; dolayısıyla özdeş theta hat sub T değerine sahip bloklar, güncellenmiş sınır koordinatlarıyla birlikte daha fazla gruplandırılmalıdır.
BCP, blok başına düşen girdi okuma sayısını arka plan oranı olarak kullanır ve zenginleştirmeyi belirler. Bir blok için çip konumunun ortalama yoğunluğunun belirli bir anlamlılık eşiğini aşıp aşmadığına dayanan basit bir hipotez testi kullanılır. Çoğu durum için uygun olan varsayılan eşik, 90. kantildir.
BCP daha sonra, zenginleşme değerini aşan bitişik posterior ortalama yoğunluk bloklarını tek bir bölgeyle birleştirir ve birleştirilmiş koordinatları tarayıcıda raporlar. Genişletilebilir veri formatı BCP, histon modifikasyon verilerindeki geniş zenginleşme bölgelerini tanımlamada mükemmeldir. Burada, BCP sonuçları, mevcut bir araç olan cser'in sonuçlarıyla karşılaştırılmıştır. Bu laboratuvarda H3K36 trimetilasyonunu inceleyen önceki çalışmalarda, BCP'de cser'e göre çok daha büyük ada boyutuna yönelik bir eğilim olduğu gösterilmiştir.
Daha büyük adalar, H3K36 trimetilasyonu zenginleşmesinin yaygın ve yayılımlı adalar şeklinde olduğu geleneksel beklentiyle daha çok örtüşmektedir. Sadece daha büyük adaların olması, tek başına doğruluğu göstermez. Bu nedenle, H3K36 trimetilasyon adalarının aktif olarak transkribe edilen gen gövdeleriyle olan bilinen ilişkisinin yanı sıra, H3K27 trimetilasyon adalarıyla olan karşılıklı dışlayıcılığı, BCP ve CER'nin performansını değerlendirmek için kullanılmıştır. CER ile karşılaştırıldığında BCP, H3K27 trimetilasyon adalarıyla artan örtüşmeye yol açmadan, gen gövdelerini daha iyi kapsayan daha büyük bitişik adalar tanımlamıştır.
BCP, intergenik alan genleri ile baskılanmış transkripsiyonlu genlerin veya H3K27 trimethylation baskılayıcı işaretinin yanlış pozitif örtüşme derecesini artırmadan, sınırları gen gövdeleriyle yakından uyumlu olan H3K36 trimethylation adacıkları ile aktif genlerin yüksek örtüşmesini korur. İki tekrarlı veri setinde BCP ada çağrılarının tekrarlanabilirliği değerlendirildiğinde, BCP'nin rakip algoritma cser'in aksine okuma kapsam derinliğine ağır bir bağımlılık göstermediği gözlemlenmiştir. BCP'nin sağlamlığına ve tekrarlanabilirliğine dair ek kanıtlar, azaltılmış kapsam derinliğine rağmen tutarlı ada sınırlarını ortaya koyan ek farklı bölgelerin incelenmesiyle sağlanmıştır. BCP'nin çok yönlülüğünü tam olarak göstermek için, H3K27 trimethylation ve H3K36 trimethylation'a ek olarak; noktasal işaretler olan H3K27 acetylation, H3K9 acetylation ve H3K4 trimethylation ile yaygın işaret olan H3K9 trimethylation'ı içeren geniş bir histon modifikasyon verileri spektrumu elde edilmiştir. Bu veri setleri, hem BCP hem de cser için varsayılan parametre ayarları kullanılarak analiz edilmiştir.
Merkezde, aktif transkripsiyonu işaretleyen PXDN geni üzerindeki H3K36 trimetilasyon zenginleşmesi yer alır; transkripsiyon başlangıç bölgesinde ise beklendiği üzere azalan ek noktasal aktif işaretler olan H3K27 asetilasyonu, H3K9 asetilasyonu ve H3K4 trimetilasyonu bulunur. PXDN'nin hemen aşağısında, H3K27 trimetilasyon zenginleşmesi ile işaretlenmiş baskılanmış intergenik bölge; karşı tarafta ise H3K27 trimetilasyonu ile baskılanmış bir gen yer alır. Bir adım daha dışarıya doğru ilerlendiğinde.
H3K9 trimetilasyon zenginleşmesinin mevcudiyeti ile belirtilen susturulmuş kromatinimiz, belki H3K27 trimetilasyon baskılamasına kıyasla daha az geçici bir anlamda SNTG2 ve MYT1L'nin susturulduğunu göstermektedir. Bu bölge, histon modifikasyonlarının ChIP-seq analizlerinde karşılaşılan fenomenlerin çoğunu kapsamaktadır. Bu durum, BCP'nin dinamik doğasının, noktasal asetilasyon ve H3K4 trimetilasyon işaretlerini tanımlayabilirken, aynı zamanda H3K27 trimetilasyon ve H3K9 trimetilasyon baskılamasının oluşturduğu geniş bitişik adaların yanı sıra H3K36 trimetilasyon aktif transkripsiyonunu nasıl ayırt edebildiğini göstermektedir.
Bu algoritma, okuma sayısına ve genom işaretleri sonucuna bağlı olarak yaklaşık 30 dakikada tamamlanabilir. Diğer yöntemlerde genellikle gerekli olan önemli optimizasyonlara bu prosedürden sonra ihtiyaç duyulmaz. Epigenomik mekanizmalar ve gen düzenlemesi hakkındaki ek soruları yanıtlamak için, çeşitli diğer histon modifikasyonlarının yanı sıra DNA bağlayan transkripsiyon faktörleri de dahil olmak üzere, kromatin immünopresipitasyonunun birçok farklı hedef proteini BBCP kullanılarak çalışılabilir.
Bu videoyu izledikten sonra, ChIP-seq veri analizinde yaygın histon işaretleri için erişilebilir bölgeleri belirlemede BCP'nin nasıl kullanıldığına dair iyi bir anlayışa sahip olmalısınız.
Tam transkripti görüntüleyin ve binlerce bilimsel videoya erişin
Bu çalışma, kromatin immünopresipitasyon sekanslama (ChIP-seq) veri analizini geliştiren bir Bayesian Değişim Noktası (BCP) algoritması sunmaktadır. BCP, Gizli Markov Modellerini kullanarak hem geniş hem de noktasal veri türlerinde histon zenginleşme bölgelerini etkili bir şekilde tanımlar.
Bayesyen Değişim Noktası (BCP) algoritması, noktasal transkripsiyon faktörü bağlanmalarından yaygın histon modifikasyon adacıklarına kadar çeşitli ChIP-seq veri türleri genelinde zenginleşmiş genomik bölgelerin belirlenmesi için parametre gereksinimi düşük, birleşik bir yaklaşım sunar. BCP, sezgisel eşik değerlerine ve model değişimlerine olan bağımlılığı azaltarak, epigenomik hedef doğrulamada tekrarlanabilirliği ve laboratuvarlar arası karşılaştırılabilirliği artırır. Bu yöntem, hedef güvenilirliği ve yolak analizine temel oluşturan, istatistiksel olarak temellendirilmiş kantitatif okuma yoğunluğu profilleri sağlayarak erken keşif aşamasındaki mekanistik risk azaltma süreçlerini destekler.
BCP algoritması, ham dizileme verilerinden biyolojik içgörüye kadar uzanan keşif sürecine uyum sağlayarak, hipotez odaklı hedef doğrulamayı, tekrarlanabilir epigenomik profillemeyi ve erken tarama ile preklinik doğrulama aşamaları arasındaki veri entegrasyonunu desteklemektedir.