10 décembre 2012
Notre point de changement bayésien (BCP) algorithme s'appuie sur l'état de l'art des progrès de la modélisation ruptures par modèles de Markov cachés et les applique à immunoprécipitation de la chromatine séquençage (ChIPseq) l'analyse des données. BCP se comporte bien dans les types de données à la fois larges et ponctuées, mais il excelle dans l'identification précise robustes, reproductibles îles de l'enrichissement d'histone diffuse.
L'objectif général de l'expérience suivante est d'utiliser la densité des positions de lecture cartographiées à partir de données de séquençage après immunoprécipitation de chromatine afin d'estimer la densité moyenne a posteriori des lectures à travers le génome. Ceci est réalisé par un prétraitement. Les lectures ChIP-seq cartographiées sont converties en profils de densité par blocs, avec le même nombre de lectures tombant dans des fenêtres non chevauchantes de 200 paires de bases.
À une deuxième étape, toutes les classes adjacentes ayant la même densité sont fusionnées en un bloc plus grand ; ensuite, les densités moyennes a posteriori de chaque bloc sont calculées de manière récursive dans le contexte de tous les blocs environnants à l’aide d’un modèle bayésien comportant des filtres avant et arrière. Le nombre de lectures pour un bloc est modélisé selon une distribution de Poisson avec un paramètre thêta qui suit une loi a priori gamma de paramètres alpha et beta. Ensuite, les estimations de la densité moyenne a posteriori de chaque bloc sont évaluées quant à leur signification statistique selon qu’elles dépassent ou non le quantile 90 par rapport à la densité de fond du contrôle d’entrée, afin de produire les segments génomiques enrichis finaux. Les résultats obtenus illustrent la progression allant des lectures brutes séquencées aux estimations de densité moyenne a posteriori, puis aux îlots enrichis sur des données ChIP-séq durant l’analyse BCP.
En outre, les résultats montrent que BCP surpasse un outil concurrent, cer. Le principal avantage de cette technique par rapport aux méthodes existantes comme CER est que BCP utilise les avancées les plus récentes en matière de modèles de marqueurs cachés, ce qui permet de mieux caractériser les subtilités de l'analyse des données chipsy par rapport aux méthodes heuristiques antérieures. Cette méthode peut aider à répondre à des questions clés dans le domaine de l'épigénomique, telles que le rôle des modifications histones grâce à la caractérisation de leurs profils d'enrichissement à l'échelle du génome.
Bien que cette méthode rigoureuse puisse offrir des aperçus utiles pour l'analyse de données ChIP-séq, le cadre de base peut également s'appliquer à l'analyse d'autres données de séquençage de nouvelle génération, comme l'identification de régions différentiellement méthylées dans des données de séquençage bis-Sufi, de nouveaux locus de transcription dans des données RNA-Séq, de variations du nombre de copies ou de tout type de données de puces à ADN par balayage. La démonstration visuelle de cette méthode est essentielle pour bien comprendre la méthodologie et ses avantages. Les avantages théoriques sont intégrés au logiciel.
Toutes les étapes procédurales démontrées ici ont été regroupées en un seul exécutable inclus dans le logiciel BCP, disponible au téléchargement dans cette vidéo. Les étapes exécutées par le programme sont décrites afin de permettre l'utilisation du logiciel. Trois paramètres sont requis.
Un fichier contenant des lectures uniques provenant d'un échantillon de puces et un fichier similaire pour les lectures du contrôle d'entrée, ainsi qu'un nom de fichier de sortie afin de préparer les fichiers d'entrée pour l'analyse BCP. Tout d'abord, alignez les lectures courtes produites lors des séquençages sur le génome de référence approprié à l'aide du logiciel d'alignement de lectures courtes privilégié. Les positions alignées doivent être converties au format de données extensible pour navigateur, ou format BED à six colonnes, chaque lecture alignée étant représentée par une ligne séparée par des tabulations indiquant le chromosome, la position de départ, la position d'arrivée, le nom de la lecture, le score et le brin.
Étendre la puce et les emplacements de la carte d'entrée à une longueur de fragment prédéterminée. Par exemple, la taille de fragment visée lors de la digestion enzymatique ou de la sonication de l'ADN, généralement d'environ 200 paires de bases. Les décomptes de fragments sont ensuite regroupés dans des intervalles adjacents.
Par défaut, la taille des segments est définie sur la longueur estimée des fragments, soit 200 paires de bases. Tout point de changement possible dans un ensemble de segments ayant des nombres identiques de lectures se situera très probablement aux limites les plus externes. Par conséquent, il est improbable qu'un point de changement apparaisse à une limite interne entre deux segments ayant le même nombre de lectures.
Par conséquent, regroupez les compartiments adjacents ayant le même nombre de lectures par compartiment en un seul bloc. Après avoir préparé les fichiers d'entrée, lancez l'estimation BCP en tapant simplement la commande indiquée au bas de l'écran. La densité de lectures de chaque bloc est modélisée selon une distribution de Poisson dont le paramètre moyen theta suit un mélange de distributions gamma avec des paramètres alpha et beta, ainsi qu'une probabilité a priori de présence d'un point de rupture à n'importe quel bloc.
La limite de P conditionnant chaque bloc de cette manière donne effectivement un modèle de Markov caché à état infini, ou HMM. Les hyperparamètres alpha, beta et P sont estimés par maximum de vraisemblance a posteriori. Les estimations bayésiennes sont explicitement calculées pour chaque bloc thêta indice T comme l'espérance de thêta indice T sachant y indice T ; les filtres avant et arrière plus traditionnels, mais plus coûteux en temps de calcul, souvent utilisés dans les HMM, sont remplacés par une approximation de mélange à complexité bornée, plus efficace sur le plan computationnel, afin d'estimer les moyennes a posteriori thêta chapeau indice T. Les moyennes a posteriori résultantes seront lissées en un profil approximativement constant par morceaux, de sorte que les blocs ayant des valeurs identiques de thêta chapeau indice T doivent être regroupés ensemble, avec des coordonnées de limites mises à jour.
BCP utilise le nombre de lectures d'entrée par bloc comme taux de fond et détermine l'enrichissement. À l'aide d'un test d'hypothèse simple basé sur la densité moyenne des positions de puces pour un bloc, on évalue si celle-ci dépasse un certain seuil de significativité. Le quantile 90e constitue le seuil par défaut et convient dans la plupart des cas.
BCP fusionne ensuite les blocs adjacents de densité moyenne postérieure dépassant l'enrichissement en une seule région et signale les coordonnées fusionnées dans le navigateur. Le format de données extensible BCP excelle à identifier des régions d'enrichissement étendu dans les données de modification histone. Ici, les résultats de BCP sont comparés à ceux de cser, un outil existant ayant démontré des performances solides ; des travaux antérieurs de ce laboratoire sur la triméthylation de H trois K 36 ont révélé une tendance à des îlots nettement plus grands avec BCP qu'avec cer.
Les îles plus grandes sont plus conformes à l'attente classique selon laquelle on observe de vastes îlots diffus d'enrichissement en triméthylation de H3K36. La taille des îles, prise isolément, n'indique pas nécessairement une plus grande précision. C'est pourquoi l'association connue entre les îles de triméthylation de H3K36 et les régions géniques actives, ainsi que leur caractère mutuellement exclusif par rapport aux îles de triméthylation de H3K27, ont été utilisées pour évaluer les performances de BCP et de CER. En comparaison avec CER, BCP a identifié des îles contiguës plus étendues, mieux adaptées pour recouvrir les régions codantes des gènes, sans pour autant réduire le chevauchement accru avec les îles de triméthylation de H3K27.
BCP maintient un fort recouvrement des gènes actifs par les îlots de triméthylation de la lysine 36 de l'histone H3, dont les limites sont étroitement alignées sur les régions codantes des gènes, sans augmenter le taux de faux positifs dans les régions intergéniques associées à une transcription réprimée ou à la marque répressive de triméthylation de la lysine 27 de l'histone H3. Lors de l'évaluation de la reproductibilité des appels d'îlots BCP sur deux jeux de données répliqués, on a observé que BCP ne présentait pas une forte dépendance à la profondeur de couverture, contrairement à l'algorithme concurrent cser. Des preuves supplémentaires de la robustesse et de la reproductibilité de BCP sont apportées par l'analyse de régions distinctes supplémentaires, démontrant des limites d'îlots cohérentes malgré une réduction de la profondeur de couverture. Afin de démontrer pleinement la polyvalence de BCP, un large spectre de données de modifications histoniques a été obtenu, incluant les marques ponctuelles d'acétylation de la lysine 27 de l'histone H3, d'acétylation de la lysine 9 de l'histone H3 et de triméthylation de la lysine 4 de l'histone H3, ainsi que la marque diffuse de triméthylation de la lysine 9 de l'histone H3, en plus des triméthylations des lysines 27 et 36 de l'histone H3. Ces jeux de données ont été analysés à l'aide des paramètres par défaut pour BCP et cser.
Au centre se trouve un enrichissement en triméthylation de l'histone H3 sur la lysine 36 (H3K36me3) au niveau du gène PXDN, marquant une transcription active. Comme prévu, à proximité du site de démarrage de la transcription, on observe des marques ponctuelles supplémentaires d'activité transcriptionnelle : l'acétylation de la lysine 27 de l'histone H3 (H3K27ac), l'acétylation de la lysine 9 de l'histone H3 (H3K9ac) et la triméthylation de la lysine 4 de l'histone H3 (H3K4me3). Juste en aval de PXDN s'étend une région intergénique réprimée, marquée par un enrichissement en triméthylation de la lysine 27 de l'histone H3 (H3K27me3). Sur le flanc opposé se trouve un gène réprimé, lui aussi marqué par la triméthylation de la lysine 27 de l'histone H3 (H3K27me3). En s'éloignant encore d'un pas.
Notre chromatine silencieuse, indiquée par la présence d'un enrichissement en triméthylation de H3K9, semble indiquer un silençage de SN TG2 et de MYT1L, peut-être de manière moins transitoire que le répresseur par triméthylation de H3K27. Cette région englobe la majorité des phénomènes observés dans l'analyse ChIPseek des modifications histoniques. Elle illustre comment la nature dynamique de BCP permet d'identifier à la fois des marques d'acétylation ponctuelles et de triméthylation de H3K4, tout en distinguant simultanément de grandes îles contiguës de répression par triméthylation de H3K27 et de H3K9, ainsi que la triméthylation de H3K36 associée à une transcription active.
Cet algorithme peut être effectué en environ 30 minutes, selon le nombre de lectures et le résultat des signes du génome. Aucune optimisation importante n'est requise, comme c'est souvent le cas avec d'autres méthodes, après avoir suivi cette procédure. De nombreuses protéines cibles différentes de l'immunoprécipitation de la chromatine peuvent être étudiées à l'aide de BBCP, y compris diverses autres modifications des histones ainsi que des facteurs de transcription liant l'ADN, afin de répondre à des questions supplémentaires sur les mécanismes épigénomiques et la régulation des gènes.
Après avoir visionné cette vidéo, vous devriez bien comprendre comment le BCP est utilisé pour identifier les régions accessibles aux marques histones diffuses dans l'analyse de données chipsy.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Cette étude présente un algorithme bayésien de détection de points de rupture (BCP) qui améliore l'analyse des données de séquençage après immunoprécipitation de la chromatine (ChIP-seq). En utilisant des modèles de Markov cachés, BCP identifie efficacement les régions d'enrichissement des histones dans les deux types de données, étendues et ponctuelles.
L'algorithme bayésien de détection des points de rupture (BCP) offre une approche unifiée et peu dépendante des paramètres pour identifier des régions génomiques enrichies à partir de divers types de données ChIP-séq, allant des liaisons ponctuelles de facteurs de transcription à des îlots diffus de modifications histoniques. En réduisant la dépendance aux seuils heuristiques et aux changements de modèle, BCP améliore la reproductibilité et la comparabilité entre laboratoires lors de la validation de cibles épigénomiques. Cela permet une détection mécanistique des risques en phase précoce de découverte, en fournissant des profils quantitatifs de densité de lecture statistiquement fondés, qui éclairent la confiance dans les cibles et l'analyse des voies biologiques.
L'algorithme BCP s'inscrit dans le continuum de la découverte, allant des données brutes de séquençage à l'interprétation biologique, en soutenant la validation ciblée orientée par hypothèse, le profilage épigénomique reproductible et l'intégration des données à travers les étapes de dépistage précoce et de validation préclinique.