10 декабря 2012 г.
Наши байесовского Точка изменения (BCP) алгоритм основывается на состоянии самой современной прогресс в области моделирования изменения точки через скрытых Марковских моделей и применяет их к иммунопреципитации хроматина секвенирования (ChIPseq) анализ данных. BCP хорошо работает как в широком и точечные типов данных, но превосходит точно идентифицировать надежные, воспроизводимые острова диффузного гистонов обогащения.
Общая цель следующего эксперимента заключается в использовании плотности позиций картированных ридов, полученных в результате секвенирования после иммунопреципитации хроматина, для оценки апостериорного среднего значения плотности ридов по всему геному. Это достигается путем предварительной обработки картированных ридов ChIP-seq в профили блоковой плотности, при которой в каждом неперекрывающемся интервале (бине) размером 200 пар оснований содержится одинаковое количество ридов.
На втором этапе любые соседние корзины с одинаковой плотностью объединяются в более крупный блок; затем рекурсивно рассчитываются апостериорные средние плотности каждого блока в контексте всех окружающих блоков с использованием байесовской модели с прямым и обратным фильтрами. При этом количество чтений для блока моделируется с помощью распределения Пуассона с параметром тета, который имеет гамма-распределение априорной вероятности с параметрами альфа и бета. Далее оценки апостериорной средней плотности каждого блока проверяются на значимость: определяется, превышает ли она 90-й квантиль относительно плотности фонового контроля входного сигнала для формирования окончательных результатов обогащенных сегментов генома. В итоге получаются результаты, иллюстрирующие процесс перехода от необработанных секвенированных чтений к оценкам апостериорной средней плотности чтений и, наконец, к обогащенным «островкам» в данных ChIP-seq в ходе анализа BCP.
Кроме того, результаты показывают, что BCP превосходит конкурирующий инструмент cer. Основным преимуществом данной методики перед существующими методами, такими как CER, является то, что в BCP использованы последние достижения в области скрытых марковских моделей, что позволяет более точно описывать нюансы анализа данных chipsy, чем предыдущие эвристические методы. Этот метод может помочь в решении ключевых вопросов в области эпигеномики, таких как роль модификаций гистонов, путем характеристики паттернов их обогащения в масштабе всего генома.
Хотя данный метод ориентирован на анализ данных ChIP-seq, эта базовая структура может быть применена и к анализу других данных секвенирования следующего поколения, таких как идентификация дифференциально метилированных регионов в данных бисульфитного секвенирования, поиск новых транскрипционных локусов в RNA-Seq, определение вариаций числа копий или анализ любых данных плиточного микрочипа. Визуальная демонстрация этого метода имеет решающее значение для четкого понимания методологии и ее преимуществ. Теоретические преимущества скрыты в программном обеспечении.
Все представленные здесь этапы процедуры были объединены в один исполняемый файл в программном пакете BCP, который доступен для скачивания в данном видео. Для запуска программы приведено описание выполняемых ею действий. Требуется указать три параметра.
Файл, содержащий уникально картированные риды из образца ChIP, и аналогичный файл для контрольных ридов (input), а также имя выходного файла для подготовки входных файлов для анализа BCP. Сначала выровняйте короткие риды, полученные в результате секвенирования, по соответствующему референсному геному, используя предпочтительное программное обеспечение для выравнивания коротких ридов. Координаты картирования должны быть преобразованы в шестиколоночный формат BED (Browser Extensible Data), где каждая строка с разделителем-табуляцией соответствует одному картированному риду и содержит информацию о картированной хромосоме, начальной позиции, конечной позиции, имени рида, значении score и направлении нити.
Доведите координаты чипа и карты ввода до заранее определенной длины фрагмента. Например, до размера фрагмента, который задавался при ферментативном расщеплении или соникации ДНК, обычно около 200 base pairs. Затем количество фрагментов суммируется в соседних интервалах (бинах).
По умолчанию размер бина установлен в соответствии с расчетной длиной фрагмента, равной 200 base pairs. Любые возможные точки перелома в наборе бинов с идентичным количеством чтений, скорее всего, будут находиться на внешних границах. Соответственно, появление точки перелома на внутренней границе между двумя бинами с одинаковым количеством чтений маловероятно.
Таким образом, сгруппируйте соседние бины с одинаковым количеством ридов в один блок. После подготовки входных файлов запустите оценку BCP, просто введя команду, показанную в нижней части экрана. Плотность ридов каждого блока моделируется как распределение Пуассона с параметром среднего theta, который следует смеси гамма-распределений с параметрами alpha и beta, а также априорной вероятностью возникновения точки смены в любом блоке.
Ограничение P, задаваемое для каждого блока таким образом, фактически создает скрытую марковскую модель (HMM) с бесконечным числом состояний. Гиперпараметры alpha, beta и P оцениваются с помощью метода максимального апостериорного правдоподобия. Байесовские оценки theta sub T для каждого блока рассчитываются явно как математическое ожидание theta sub T при заданном значении why sub T. Более традиционные, но трудоемкие прямые и обратные фильтры, часто используемые в HMM, заменены более вычислительно эффективным методом аппроксимации смеси с ограниченной сложностью для оценки апостериорных средних theta hat sub T. Полученные апостериорные средние будут сглажены в приблизительный кусочно-постоянный профиль, поэтому блоки с идентичными значениями theta hat sub T должны быть дополнительно объединены с обновлением координат границ.
BCP использует количество входных прочтений на блок в качестве фонового уровня и определяет степень обогащения. Для этого применяется простой гипотетический тест, основанный на том, превышает ли средняя плотность позиций чипа для данного блока определенный порог значимости. Пороговым значением по умолчанию является 90-й квантиль, который подходит для большинства случаев.
Затем BCP объединяет смежные блоки с наибольшей апостериорной плотностью, превышающие уровень обогащения, в единую область и выводит координаты объединенных регионов в браузере. Расширяемый формат данных BCP отлично подходит для идентификации областей широкого обогащения в данных о модификациях гистонов. Здесь результаты BCP сравниваются с результатами cser — существующего инструмента, продемонстрировавшего высокую эффективность. Предыдущие работы данной лаборатории по изучению триметилирования H3K36 выявили тенденцию к значительно большему размеру «островков» в BCP по сравнению с cer.
Более крупные острова в большей степени соответствуют общепринятым ожиданиям относительно широких диффузных областей обогащения триметилированием H3K36. Однако наличие только более крупных островов не является единственным показателем точности. Следовательно, для оценки эффективности BCP и CER по сравнению с CER использовалась известная связь островов триметилирования H3K36 с телами активно транскрибируемых генов, а также их взаимная исключительность с островами триметилирования H3K27. BCP выявлял более крупные непрерывные острова, которые лучше охватывают тела генов, не увеличивая при этом степень перекрытия с островами триметилирования H3K27.
BCP обеспечивает высокую степень перекрытия активных генов с островами триметилирования H3K36, причем границы этих островов точно совпадают с телами генов, не увеличивая при этом частоту ложноположительного перекрытия с межгенными пространствами, генами с репрессированной транскрипцией или репрессивной меткой триметилирования H3K27; при оценке воспроизводимости определения островов с помощью BCP на двух повторных наборах данных было замечено, что BCP не подвержен сильной зависимости от глубины покрытия ридов, в отличие от конкурирующего алгоритма cser. Дополнительные доказательства надежности и воспроизводимости BCP получены путем анализа других отдельных регионов, что продемонстрировало стабильность границ островов даже при сниженной глубине покрытия. Чтобы в полной мере продемонстрировать универсальность BCP, был получен широкий спектр данных о модификациях гистонов, включая точечные метки H3K27-ацетилирование, H3K9-ацетилирование и H3K4-триметилирование, а также диффузную метку H3K9-триметилирование, в дополнение к H3K27-триметилированию и H3K36-триметилированию. Эти наборы данных были проанализированы с использованием параметров по умолчанию как для BCP, так и для cser.
В центре находится область обогащения триметилированием H3K36 в гене PXDN, что свидетельствует об активной транскрипции; ожидаемо в сайте начала транскрипции расположены дополнительные точечные метки активности: ацетилирование H3K27, ацетилирование H3K9 и триметилирование H3K4. Сразу за PXDN следует репрессированная межгенная область, характеризующаяся обогащением триметилированием H3K27; на противоположном фланге находится репрессированный триметилированием H3K27 ген. Перейдем на один шаг дальше.
Наш сайленсированный хроматин, на что указывает обогащение триметилированием H3K9, по-видимому, свидетельствует о сайленсинге SNTG2 и MYT1L, возможно, в более устойчивом смысле, чем репрессия посредством триметилирования H3K27. Этот регион охватывает большинство явлений, наблюдаемых при ChIP-seq модификаций гистонов. Он иллюстрирует, как динамическая природа BCP позволяет идентифицировать как точечные метки ацетилирования и триметилирования H3K4, так и одновременно различать крупные непрерывные острова репрессии вследствие триметилирования H3K27 и H3K9, а также активную транскрипцию с триметилированием H3K36.
Выполнение этого алгоритма занимает примерно 30 минут, в зависимости от количества чтений и результата анализа генома. В отличие от многих других методов, выполнение данной процедуры не требует значительной оптимизации. С помощью BBCP можно изучать множество различных целевых белков хроматиновой иммунопреципитации, включая различные модификации гистонов, а также ДНК-связывающие транскрипционные факторы для получения дополнительных ответов на вопросы об эпигеномных механизмах и регуляции генов.
После просмотра этого видео вы должны получить четкое представление о том, как BCP используется для определения регионов обогащения диффузных меток гистонов при анализе данных ChIP-seq.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данном исследовании представлен алгоритм байесовского определения точек перелома (BCP), который расширяет возможности анализа данных секвенирования иммунопреципитации хроматина (ChIP-seq). Благодаря использованию скрытых марковских моделей, BCP эффективно идентифицирует области обогащения гистонами как в данных с широкими, так и с точечными пиками.
Алгоритм байесовского поиска точек изменения (BCP) обеспечивает унифицированный, минимально параметризированный подход к идентификации обогащенных геномных регионов для различных типов данных ChIP-seq: от точечного связывания транскрипционных факторов до диффузных «островков» модификаций гистонов. Снижая зависимость от эвристических порогов и смены моделей, BCP повышает воспроизводимость и сопоставимость результатов между разными лабораториями при валидации эпигеномных мишеней. Это способствует снижению механистических рисков на ранних этапах поиска за счет получения статистически обоснованных количественных профилей плотности чтений, которые позволяют оценить достоверность мишени и провести анализ сигнальных путей.
Алгоритм BCP встраивается в континуум анализа — от необработанных данных секвенирования до получения биологических выводов, обеспечивая проверку гипотез при валидации мишеней, воспроизводимое эпигеномное профилирование и интеграцию данных на этапах первичного скрининга и доклинической валидации.