10 de diciembre de 2012
Nuestro punto de cambio bayesiano (BCP) algoritmo se basa en los avances del estado de la técnica de modelado en los puntos de cambio a través de modelos ocultos de Markov y los aplica a la cromatina immunoprecipitation secuenciación (ChIPseq) el análisis de datos. BCP funciona bien en ambos tipos de datos amplios y punteada, pero sobresale en la identificación precisa de las islas robustas, reproducibles de enriquecimiento histona difusa.
El objetivo general del siguiente experimento consiste en utilizar la densidad de las posiciones de lecturas mapeadas provenientes de datos de secuenciación de inmunoprecipitación de cromatina (ChIP-seq) para estimar la densidad media posterior de lecturas a lo largo del genoma. Esto se logra mediante un preprocesamiento que convierte las lecturas de ChIP-seq mapeadas en perfiles de densidad segmentados, con el mismo número de lecturas distribuidas dentro de ventanas no solapadas de 200 pares de bases.
Como segundo paso, los contenedores adyacentes con la misma densidad se fusionan en un bloque más grande; luego, las densidades medias posteriores de cada bloque se calculan recursivamente dentro del contexto de todos los bloques circundantes mediante un modelo bayesiano con filtros hacia adelante y hacia atrás. En este modelo, el recuento de lecturas para un bloque se describe mediante una distribución de Poisson con un parámetro theta que sigue una distribución previa gamma con parámetros alfa y beta. A continuación, se evalúa la significancia de las estimaciones de densidad media posterior de cada bloque según si superan o no el cuantil 90 con respecto a la densidad de fondo del control de entrada, con el fin de generar los segmentos genómicos enriquecidos finales. Se obtienen resultados que ilustran la progresión desde las lecturas secuenciadas en bruto hasta las estimaciones de densidad media posterior de lecturas, y finalmente las islas enriquecidas en datos de ChIP-seq durante el análisis BCP.
Además, los resultados muestran que BCP supera a una herramienta competidora, cer. La principal ventaja de esta técnica frente a métodos existentes como CER es que BCP utiliza los avances más recientes en modelos de marcadores ocultos, por lo que caracteriza mejor los matices del análisis de datos chipsy que los métodos heurísticos anteriores. Este método puede ayudar a responder preguntas clave en el campo de la epigenómica, como el papel de las modificaciones de histonas mediante la caracterización de sus patrones de enriquecimiento a nivel del genoma completo.
Aunque este método meticuloso puede ofrecer información sobre el análisis de datos de ChIP-seq, el marco básico también puede aplicarse al análisis de otros datos de secuenciación de nueva generación, como la identificación de regiones diferencialmente metiladas en datos de secuenciación bis Sufi, loci transcripcionales novedosos en RNA-Seq, variaciones en el número de copias o cualquier tipo de datos de microarreglos por tiling. La demostración visual de este método es fundamental para comprender claramente la metodología y sus ventajas. Las ventajas teóricas se encuentran ocultas dentro del software.
Todos los pasos del procedimiento mostrados aquí se han empaquetado en un único ejecutable dentro del paquete de software BCP, que está disponible para su descarga en este video. Se describen los pasos ejecutados por el programa para ejecutar el software. Se requieren tres parámetros.
Un archivo que contiene lecturas con mapeo único provenientes de una muestra de chip y un archivo similar para las lecturas de control de entrada, así como un nombre de archivo de salida para preparar los archivos de entrada para el análisis BCP. Primero, alinee las lecturas cortas generadas a partir de corridas de secuenciación con el genoma de referencia apropiado utilizando el software preferido para el alineamiento de lecturas cortas. Las ubicaciones mapeadas deben convertirse al formato de datos extensible del navegador, o BED, de seis columnas, con una línea separada por tabulaciones por cada lectura mapeada que indique el cromosoma mapeado, la posición inicial, la posición final, el nombre de la lectura, la puntuación y la cadena.
Extienda las ubicaciones del chip y del mapa de entrada a una longitud de fragmento predeterminada. Por ejemplo, el tamaño de fragmento objetivo durante la digestión enzimática o la sonicación del ADN, generalmente alrededor de 200 pares de bases. Luego, las cuentas de fragmentos se agrupan en intervalos adyacentes.
Por defecto, el tamaño del bin se establece en la longitud estimada del fragmento de 200 pares de bases. Cualquier punto de cambio posible en un conjunto de bins con recuentos de lecturas idénticos probablemente caerá en los límites más externos. Por consiguiente, es improbable que un punto de cambio ocurra en un límite interno entre dos bins con los mismos recuentos de lecturas.
Por lo tanto, agrupe los contenedores adyacentes con lecturas idénticas por contenedor en un solo bloque. Después de preparar los archivos de entrada, invoque la estimación BCP simplemente escribiendo el comando que se muestra en la parte inferior de la pantalla. La densidad de lecturas de cada bloque se modela mediante una distribución de Poisson con un parámetro medio theta, siguiendo una mezcla de distribuciones gamma con parámetros alfa y beta, y una probabilidad previa de que ocurra un punto de cambio en cualquier bloque.
El límite de P que condiciona cada bloque de esta manera representa efectivamente un modelo oculto de Markov de estado infinito, o HMM. Los hiperparámetros alfa, beta y P se estiman utilizando la verosimilitud máxima a posteriori. Las estimaciones bayesianas se calculan explícitamente para cada bloque theta sub T como la esperanza de theta sub T dado y sub T. Los filtros hacia adelante y hacia atrás más tradicionales, aunque más lentos, comúnmente utilizados en HMS, se sustituyen por una aproximación de mezcla de complejidad acotada, más eficiente computacionalmente, para estimar las medias a posteriori theta sombrero sub T. Las medias a posteriori resultantes se suavizarán en un perfil aproximadamente constante por tramos, por lo que los bloques con theta sombrero sub T idénticos deben agruparse aún más, con coordenadas de límite actualizadas.
BCP utiliza el número de lecturas de entrada por bloque como tasa de fondo y determina el enriquecimiento. Mediante una prueba de hipótesis simple basada en si la densidad media de la posición de la chip para un bloque supera cierto umbral de significancia. El percentil 90 es el umbral predeterminado y es apropiado en la mayoría de los casos.
BCP luego combina bloques adyacentes de densidad media posterior que superan el enriquecimiento en una sola región e informa las coordenadas fusionadas en el navegador. El formato de datos extensible BCP destaca en la identificación de regiones de enriquecimiento amplio en datos de modificaciones histónicas. Aquí, se comparan los resultados de BCP con los de cser, una herramienta existente que ha demostrado un buen desempeño; trabajos previos de este laboratorio sobre la trimetilación de H tres K 36 mostraron una tendencia hacia tamaños de isla mucho mayores en BCP que en cer.
Las islas más grandes están más en consonancia con la expectativa convencional de islas amplias y difusas de enriquecimiento por trimetilación de H tres K 36. Las islas más grandes por sí solas no indican precisión. Por lo tanto, se utilizó la asociación conocida entre las islas de trimetilación de H tres K 36 con los cuerpos de genes activamente transcritos, así como su exclusión mutua con las islas de trimetilación de H tres K 27, para evaluar el rendimiento de BCP y CER en comparación con CER. BCP identificó islas contiguas más grandes que representan mejor los cuerpos de los genes sin sacrificar un mayor solapamiento con las islas de trimetilación de H tres K 27.
BCP mantiene la alta superposición de genes activos mediante islas de trimetilación de H tres K 36, con límites estrechamente alineados a los cuerpos génicos, sin aumentar el grado de superposición falsa positiva con genes del espacio intergénico que presentan transcripción represiva o la marca represiva de TRIMETILACIÓN de H tres K 27. Al evaluar la reproducibilidad de las llamadas de islas de BCP en dos conjuntos de datos replicados, se observó que BCP no presentaba una fuerte dependencia de la profundidad de cobertura de lecturas, a diferencia del algoritmo competidor cser. Pruebas adicionales de la robustez y reproducibilidad de BCP se obtuvieron al examinar regiones distintas adicionales, demostrando límites de islas consistentes a pesar de la reducida profundidad de cobertura. Para demostrar completamente la versatilidad de BCP, se obtuvo un amplio espectro de datos de modificaciones histónicas, incluyendo las marcas puntuales de acetilación de H tres K 27, acetilación de H tres K nueve y trimetilación de H tres K cuatro, y la marca difusa de trimetilación de H tres K nueve, además de la trimetilación de H tres K 27 y la trimetilación de H tres K 36. Estos conjuntos de datos se analizaron utilizando configuraciones de parámetros predeterminadas tanto para BCP como para cser.
En el centro se encuentra el enriquecimiento de la trimetilación de H3K36 en el gen PXDN, que marca la transcripción activa, cayendo como se espera en el sitio de inicio de la transcripción, los cuales son marcas activas puntuales adicionales: acetilación de H3K27, acetilación de H3K9 y trimetilación de H3K4. Justo aguas abajo de PXDN se halla una región intergénica represora marcada por el enriquecimiento de trimetilación de H3K27; en el flanco opuesto se encuentra un gen represor marcado por TRIMETILACIÓN de H3K27. Avanzando un paso más hacia afuera.
Nuestro cromatina silenciado, indicado por la presencia de enriquecimiento de trimetilación de H tres K nueve, que parece indicar el silenciamiento de SN TG dos y MYT uno L, quizás de una manera menos transitoria que la represión por trimetilación de H tres K 27. Esta región abarca la mayoría de los fenómenos encontrados en ChIPseek de modificaciones histónicas. Ilustra cómo la naturaleza dinámica de BCP puede identificar tanto marcas puntuales de acetilación como de trimetilación de H tres K cuatro, al mismo tiempo que distingue grandes islas contiguas de represión por trimetilación de H tres K 27 y trimetidación de H tres K nueve, así como la transcripción activa por trimetilación de H tres K 36.
Este algoritmo puede realizarse aproximadamente en 30 minutos, dependiendo del número de lecturas y del resultado de las firmas del genoma. No se requiere ninguna optimización significativa, como suele ser necesario con otros métodos, tras seguir este procedimiento. Muchas proteínas diana diferentes de la inmunoprecipitación de cromatina pueden estudiarse utilizando BBCP, incluyendo diversas modificaciones de histonas, así como factores de transcripción que se unen al ADN, para responder preguntas adicionales sobre los mecanismos epigenómicos y la regulación génica.
Después de ver este video, debería tener una buena comprensión de cómo se utiliza BCP para identificar regiones accesibles para marcas difusas de histonas en el análisis de datos de chipsy.
Vea la transcripción completa y acceda a miles de videos científicos
Este estudio presenta un algoritmo bayesiano de detección de puntos de cambio (BCP) que mejora el análisis de datos de secuenciación de inmunoprecipitación de cromatina (ChIP-seq). Al utilizar modelos ocultos de Markov, BCP identifica eficazmente regiones de enriquecimiento de histonas en ambos tipos de datos, amplios y puntuales.
El algoritmo Bayesiano de Detección de Puntos de Cambio (BCP) proporciona un enfoque unificado y con pocos parámetros para identificar regiones genómicas enriquecidas en diversos tipos de datos de ChIP-seq, desde la unión puntual de factores de transcripción hasta islas difusas de modificaciones de histonas. Al reducir la dependencia de umbrales heurísticos y cambios de modelo, BCP mejora la reproducibilidad y la comparabilidad entre laboratorios en la validación de objetivos epigenómicos. Esto apoya la desviación mecanicista en las fases iniciales del descubrimiento al ofrecer perfiles cuantitativos estadísticamente robustos de densidad de lecturas que informan sobre la confianza en los objetivos y el análisis de vías.
El algoritmo BCP se integra en el continuo de descubrimiento desde datos de secuenciación en bruto hasta la comprensión biológica, apoyando la validación de objetivos guiada por hipótesis, el perfilado epigenómico reproducible y la integración de datos a través de las etapas iniciales de cribado y validación preclínica.