9 мая 2011 г.
Мы представляем общественности вычислительной веб-сайта для анализа геномных последовательностей. Он обнаруживает модели последовательности ДНК с различными неслучайный нуклеотидных композиций. Этот ресурс также генерирует рандомизированных последовательностей с различными уровнями сложности.
Общая цель данной процедуры — исследование среднечастотной неслучайности, также называемой неоднородностью, заданной пользователем геномной последовательности. Это достигается путем предварительного анализа олигонуклеотидного состава входной последовательности и построения таблицы частот олигонуклеотидов, входящих в эту последовательность. Данная цель реализуется с помощью программы SRI Analyzer.
Вторым этапом является создание случайных последовательностей, имеющих точно такой же олигонуклеотидный состав, как и исходная последовательность. Это достигается путем вызова программы-генератора SRI. Третьим этапом процедуры является поиск сегментов в исходных и рандомизированных последовательностях, которые значительно обогащены определенным нуклеотидом или комбинацией нуклеотидов, например, GC или ag.
Эта цель достигается с помощью программы MRI Analyzer. Заключительным этапом процедуры является загрузка файлов, содержащих последовательности всех областей MRI, обнаруженных программой. В конечном итоге можно получить результаты, демонстрирующие, что большинство геномных областей многоклеточных арий значительно обогащены сегментами с экстремальным составом оснований, выявленными для каждого из четырех нуклеотидов или любой их комбинации.
Эти гомогенные области связаны с необычными конформациями ДНК и/или особыми свойствами ДНК. Данный метод может помочь ответить на ключевые вопросы в области геномики, такие как поиск потенциально функциональных элементов ДНК в обширных областях некодирующих последовательностей, включая межгенные регионы или интроны. Хотя этот метод позволяет получить сведения о геномах млекопитающих, он также может быть применен к другим организмам, таким как беспозвоночные, растения, грибы и бактерии.
Откройте главную страницу онлайн-пакета для анализа геномной однородности среднего диапазона или G GM I по адресу www.bioinfo.utoledo. edu/gri/the. Веб-ресурс также предоставляет подробную информацию о программах в ссылке Readme в разделе справки (help).
В то время как все опубликованные материалы по геномному МРТ и аналогичным алгоритмам перечислены по ссылке на соответствующие ресурсы, создайте файл с последовательностью в ускоренном формате для запуска сессии анализа A-G-M-R-I. Последовательность в ускоренном формате начинается со знака «крышечка» или символа «больше», за которым следует уникальный идентификатор или название, а на следующих строках — сама последовательность. Геномный МРТ будет обрабатывать только нуклеотиды T, G и C, хотя ввод других символов допускается.
Используется файл последовательности гена PKD1. Для запуска сеанса нажмите кнопку «Start». Откроется новая веб-страница, где можно скопировать и вставить входную последовательность в предоставленное окно или загрузить файл, если он имеет большой размер.
Чтобы загрузить файл, нажмите кнопку выбора файла. Найдите нужный файл в папке. Затем нажмите кнопку «начать сессию с этим файлом». Подтверждение успешной загрузки файла отобразится в верхней части страницы ниже.
Данное сообщение является идентификатором текущей сессии, которая в данном случае имеет номер C eight EP oh six. Для анализа краткосрочной неоднородности входной последовательности нажмите кнопку «Analyze short range inhomogeneity». Программа откроет новую страницу, специально предназначенную для запуска программы SRI Analyzer.
Здесь необходимо выбрать максимальную длину олигонуклеотидов для анализа. Поскольку наши входные последовательности среднего размера составляют примерно 50 000 нуклеотидов, мы выбираем формуеры в качестве максимальной длины олигонуклеотидов, для которых будут рассчитаны частоты. В завершение нужно сразу нажать кнопку «analyze file».
Программа вычисляет частоту встречаемости всех олигонуклеотидов выбранной длины и меньшей длины в пределах входной последовательности. Чтобы просмотреть частоты всех олигонуклеотидов, нажмите на ссылку «загрузить файл состава». Этот файл называется «пользовательский файл».
В com представлена таблица из трех столбцов. В первом столбце указаны олигонуклеотиды, во втором — их относительная частота, а в третьем — количество вхождений олигонуклеотидов в исходной последовательности.
Чтобы создать рандомизированные последовательности с тем же олигонуклеотидным составом, что и в исходном файле, перейдите на вкладку генератора SRI. На открывшейся странице выберите количество образцов рандомизированных последовательностей, которые необходимо создать. Каждый из этих образцов будет содержать рандомизированные последовательности в том же количестве и длине, что и исходные последовательности в пользовательском файле.
В данном примере в качестве пользовательского файла используется последовательность гена PKD1. Далее выберите максимальную длину олигонуклеотидов, частоты которых будут аппроксимированы в рандомизированных последовательностях, выбрав переключатель «fourmers», что означает олигонуклеотиды из четырех оснований. Затем введите значение «2» для определения количества генерируемых образцов рандомизированных последовательностей.
Наконец, запустите программу, нажав кнопку генерации файла для входных последовательностей из сотен тысяч нуклеотидов. Генерация случайных последовательностей может занять несколько минут. Дождитесь появления синих ссылок для скачивания в нижней части этой страницы.
Чтобы проанализировать однородность входных и рандомизированных последовательностей в среднем диапазоне, перейдите на вкладку MRI analyzer. На открывшейся странице выберите в списке «file to analyze» последовательность, которую необходимо проанализировать. Затем выберите GC content из списка семи типов содержания.
Содержание GC означает совокупный процент гуанина и цитозина. Поле «размер окна» позволяет выбрать длину окна, в пределах которого будут анализироваться последовательности с высоким и низким содержанием GC. Оставьте размер окна по умолчанию — 50 нуклеотидов.
Наконец, выберите верхний и нижний пороги для регионов, богатых и бедных соответствующим содержанием. Эти пороги могут быть определены количеством конкретных нуклеотидов в текущем окне или их процентным содержанием в этом окне. В данном случае для начала выберем произвольные значения: 60% для верхнего порога и 30% для нижнего порога.
Затем нажмите кнопку analyze file. После этого появится ссылка на выходной файл и будет отображено графическое представление результатов. Все богатые контентом области вдоль входной последовательности отмечены синими пиками, направленными вверх, а бедные контентом области — красными пиками, направленными вниз. График показывает, что синих пиков, указывающих на богатые GC-парами области, слишком много, в то время как красных пиков, указывающих на бедные GC-парами области, значительно меньше.
Это означает, что выбранные параметры не являются оптимальными. Для следующей итерации используйте верхний порог 75% и нижний порог 32%. Снова запустите МРТ-анализатор, нажав кнопку analyze file.
На новом графике видно, что даже при новых, гораздо более строгих параметрах, наблюдаются сотни синих пиков. Следовательно, увеличьте верхний порог до 80% и повторите расчеты. Новый график показывает, что 62 GC-богатных региона имеют содержание GC больше или равно 80%, а 28 GC-бедных регионов — содержание GC ниже 32%. Затем сравните результаты для входного файла с двумя рандомизированными последовательностями, имеющими такой же олигонуклеотидный состав, как и ген PKD1.
Для этого измените последовательность с гена PKD1 на случайную, используя список файлов для анализа, сохраняя при этом те же параметры для GC-богатых и GC-бедных регионов. Новый график для рандомизированной последовательности номер один показывает, что эта случайная последовательность содержит только один GC-бедный регион и 31 GC-богатый регион. В другой рандомизированной последовательности может наблюдаться некоторое колебание количества богатых и бедных по содержанию регионов, однако общая тенденция должна оставаться прежней.
Количество рандомизированных последовательностей для гена PKD1 в несколько раз меньше. GC-богатых регионов более чем в 10 раз меньше, чем GC-бедных регионов. В следующей демонстрации используется другой тип контента МРТ.
В том же пакете интроны одного человеческого гена содержат несколько богатых пуринами областей, связанных со структурами DN aex. На веб-странице анализатора MRI измените содержимое ДНК на нуклеотиды ag, которые представляют пурины. Установите размер окна равным 50 bases, измените верхний порог на 80% и нижний порог на 10%. Затем нажмите кнопку analyze file, чтобы запустить программу.
На представленном графике видно, что данный ген имеет шесть AG-богатых регионов, обозначенных синими вертикальными пиками, и 14 AG-бедных регионов, обозначенных красными пиками. Затем сравните эти результаты, полученные для гена PKD1, с данными рандомизированных последовательностей, имеющих тот же олигонуклеотидный состав, что и исследуемый ген: сначала переключитесь на рандомизированную последовательность, например номер два, сохранив те же параметры, что и в предыдущем тесте. График для этой случайной последовательности показывает, что она содержит только один AG-богатый регион и не содержит AG-бедных регионов.
Все данные, полученные в ходе сессии, сохраняются в специальных файлах, доступных через вкладку загрузки файлов в правом верхнем углу каждой веб-страницы. Перейдя по этой ссылке, загрузите исходную последовательность, а также все сгенерированные рандомизированные последовательности. Ниже этого списка файлов находится ссылка на таблицу частот олигонуклеотидов, сформированную программой-анализатором SRI.
Затем представлены ссылки на все результаты, созданные программой анализатора MRI во время сессии. Например, нажмите на файл user a file RAND one four AGCO 50 32 14, который содержит результаты, полученные для рандомизированной последовательности номер один со следующими параметрами: содержание AG 50%, размер окна 32 нуклеотида и нижний порог 14 нуклеотидов.
В этом файле все сегменты нуклеотидных последовательностей, соответствующие критериям обогащения или обеднения, а также их координаты представлены в виде списка в соответствии с их последовательным расположением вдоль входной последовательности. После просмотра этого видео вы должны получить четкое представление о том, как пользоваться вычислительным ресурсом genomic MRI.
В данной статье представлен вычислительный веб-ресурс, предназначенный для анализа геномных последовательностей с упором на выявление неслучайного нуклеотидного состава. Инструмент генерирует рандомизированные последовательности с аналогичным олигонуклеотидным составом, что облегчает исследование геномных неоднородностей.
Геномный МРТ-анализ представляет собой вычислительный подход для обнаружения неслучайных нуклеотидных паттернов в некодирующей ДНК, что способствует валидации мишеней путем идентификации регуляторных элементов, обладающих потенциальной функциональной значимостью. Это позволяет снизить механистические риски на ранних этапах поиска за счет установления связи между неоднородностью последовательностей и такими биологическими процессами, как экспрессия генов и рекомбинация. Данный ресурс повышает прогностическую достоверность при идентификации ведущих соединений за счет приоритизации геномных регионов с экстремальным составом оснований для последующей разработки аналитических методов.
Данный метод интегрируется в непрерывный процесс разработки — от валидации мишени и идентификации лидерных соединений до доклинических исследований, — предоставляя количественные данные об обогащении последовательностей, которые позволяют принимать обоснованные решения по снижению биологических рисков.