12 marca 2012
Baza danych ITS2 to środowisko pracy służące do wnioskowania filogenetycznego z jednoczesnym uwzględnieniem sekwencji i struktury drugorzędowej wewnętrznego transkrybowanego odstępnika 2. Obejmuje ona gromadzenie danych z dokładną adnotacją, przewidywanie struktury, wielokrotne dopasowanie sekwencji i struktur oraz szybkie obliczanie drzew. W skrócie, to narzędzie sprowadza wstępne analizy filogenetyczne do kilku kliknięć.
Wewnętrzny odstęp transkrybowany drugi genu rybosomalnego, czyli ITS2, jest jednym z najważniejszych markerów w systematyce molekularnej. Badania z ostatnich 20 lat koncentrowały się głównie na wykorzystaniu sekwencji ITS2 do rekonstrukcji filogenetycznej. Niemniej jednak, ze względu na szereg przyczyn, struktura drugorzędowa ITS2 jest coraz częściej stosowana w dziedzinie wnioskowania filogenetycznego.
Analiza struktury drugorzędowej rozszerza zastosowanie taksonomiczne tego markera, podczas gdy szybko ewoluująca i w związku z tym bardzo zmienna sekwencja ITS2 nadaje się głównie do analizy filogenetycznej na poziomie gatunkowym lub niższym. Dodanie informacji strukturalnych umożliwia jednoczesną analizę na wyższym poziomie taksonomicznym dzięki silnie zakonserwowanej strukturze drugorzędowej ITS2, składającej się z czterech charakterystycznych elementów ESS. W związku z tym wyniki analizy struktury drugorzędowej mogą poprawić rozdzielczość filogenetyczną uzyskaną z sekwencji pierwotnej.
Witam, drodzy koledzy, nazywam się Matthias Wolf. Pracuję w I ts two proof od około ośmiu lat. Pracuję tutaj w Katedrze Bioinformatyki w centrum biologicznym na Uniwersytecie w Würzburgu w Niemczech.
Dzisiaj chcielibyśmy zaprezentować krótki film na temat korzystania z bazy danych ITS2. Cześć, jestem y Chu. Celem tego filmu jest pokazanie, że baza danych ITS2 nie służy w rzeczywistości jedynie do przechowywania danych, ale udostępniamy w niej również wiele narzędzi, które pozwalają usprawnić analizy filogenetyczne.
W tym filmie chcemy pokazać Państwu, jak korzystać z tych narzędzi oraz w jaki sposób je ze sobą połączyć. Prawidłowe wyznaczenie granic sekwencji ITS2 może mieć kluczowe znaczenie dla przewidywania struktury. W związku z tym wdrożono interfejs internetowy służący do adnotacji w oparciu o ukryty model Markowa.
Aby uzyskać prawidłową adnotację sekwencji ITS2, można wkleić je do edytora sekwencji u góry strony internetowej. Zostało to zademonstrowane poprzez załadowanie przykładowych sekwencji roślin. Edytor sekwencji sam sprawdza, czy sekwencje ITS2 są poprawne, i wyświetla komunikaty o błędach.
Na przykład, przy użyciu znaków spoza PAC, po wyborze odpowiedniego HMM, można rozpocząć proces, klikając annotate. Każdy fragment 5.8 s oraz 28 SRNA, który został zidentyfikowany przez program, jest usuwany, pozostawiając poprawnie adnotowane sekwencje ITS2, które znajdowały się pomiędzy nimi. W rezultacie wyświetlane są wyznaczone sekwencje ITS2, a także przewidywany hybryd 5.8 s i 28 S-R-R-N-A. Aby potwierdzić dokładność adnotacji HMM po adnotacji nowo zachowanych sekwencji ITS2, struktury drugorzędowe można wyznaczyć na dwa sposoby.
Pierwszą predykcję można przeprowadzić za pomocą modelowania homologicznego, wykorzystując kompletny zestaw sekwencji i struktur z bazy danych jako szablony. Aby przewidzieć strukturę zaznaczonej sekwencji, należy kliknąć przycisk predict structure. Jeśli zaznaczona sekwencja może bezpośrednio zwinąć się w typową strukturę drugorzędową, wynik zostanie wyświetlony natychmiast.
Można teraz wybrać jedną z kilku opcji dalszego przetwarzania struktury sekwencji, w tym dodanie jej do puli danych. Jeśli sekwencje nie mogą zostać bezpośrednio sfałdowane, przeprowadzane jest przeszukiwanie BLAST w bazie danych. Wynikowa strona pokazuje najlepsze trafienia BLAST, w tym modelowanie homologiczne dla każdego plastiku jako szablonu.
Po kliknięciu znaku plus wyświetlane są szczegóły; można wybrać wybrane pary sekwencja-struktura i dodać je do puli danych, przeciągając i upuszczając lub korzystając z menu kontekstowego poprzez kliknięcie prawym przyciskiem myszy. Drugim podejściem jest ręczne wprowadzenie jednej lub wielu sekwencji, wraz z ich strukturami drugorzędowymi jako szablonami, aby przenieść najbardziej odpowiednie struktury drugorzędowe do sekwencji zapytania. Zostało to zademonstrowane poprzez załadowanie pliku przykładu dla wielu szablonów.
Klikając Predict best templates, wykonują Państwo modelowanie homologiczne z ustawieniami domyślnymi. Program do modelowania homologicznego obliczy wszystkie kombinacje struktur i wyświetli najlepsze pary szablon-zapytanie. W otrzymanej tabeli można sprawdzić, które szablony z sukcesem wykorzystały swoją strukturę drugorzędową do wymodelowania jednej lub kilku sekwencji zapytania.
Ponownie, szczegóły wyników można otworzyć, klikając znak plus, ponieważ pełne podejście do modelowania homologicznego jest niezależne od I TS two. Można go użyć do przewidywania struktury drugorzędowej dowolnego RNA, pod warunkiem posiadania cząsteczki homologicznej o znanej strukturze. Ponadto wynikowe pary sekwencja-struktura mogą zostać dodane do puli danych za pomocą funkcji przeciągnij i upuść lub poprzez menu kontekstowe, które otwiera się prawym przyciskiem myszy.
Oprócz ogólnej struktury, dla ITS2 opisano konserwatywne motywy, takie jak sekwencja A-U-G-G-U poprzedzająca wierzchołek trzeciej helisy oraz niedopasowanie typu piramidy w drugiej helisie. To niedopasowanie UU jest otoczone dwoma motywami: jednym po lewej stronie helisy drugiej i jednym po prawej, pomiędzy helisą drugą a trzecią, z dodatkowym potrójnym nukleotydem A. Po przekształceniu tych motywów sekwencyjnych w hms, przedstawiamy teraz identyfikację tych motywów w analizowanych sekwencjach.
Aby wyszukać te motywy, wprowadź zapytanie sekwencyjne w polu wyszukiwania i wybierz odpowiedni model. Ponownie, zostaje to zademonstrowane poprzez załadowanie pliku przykładu dla planów. Aby rozpocząć obliczenia, kliknij wyszukiwanie motywów.
Dwa motywy ITS zostały adnotowane i wyróżnione w sekwencjach zapytania. Jednym ze sposobów na pobranie dwóch par struktury sekwencji ITS z bazy danych ITS dwa jest funkcja wyszukiwania. Pozwala ona użytkownikowi na wyszukiwanie struktur sekwencji według nazwy taksonu lub identyfikatora GenBank.
Aby wyszukać strukturę sekwencji za pomocą identyfikatora GenBank, należy wpisać numer GI w polu wyszukiwania i kliknąć przycisk wyszukiwania. Lista wyników pojawi się w nowej karcie. Szczegóły struktury sekwencji można wyświetlić, klikając przycisk pokaż szczegóły.
Można również wyświetlić bezpośrednie sekwencje S wszystkich trafień w danej karcie, klikając opcję pokazuj strukturę sekwencji metodą przeciągnij i upuść lub korzystając z menu kontekstowego po kliknięciu prawym przyciskiem myszy, dzięki czemu wybrane struktury sekwencji można dodać do puli danych. Oprócz wyszukiwania par struktura sekwencji według gi, w polu wyszukiwania można wpisać nazwę taksonu, co jest wspierane przez pojawiające się pole wyszukiwania na żywo. Po pojawieniu się nowej karty z listą wszystkich trafień, można korzystać z tych samych funkcji co wcześniej.
Na przykład, dodawanie zaznaczenia do puli danych za pomocą funkcji przeciągnij i upuść. Drugą możliwością pobrania par sekwencja-struktura z bazy danych jest funkcja przeglądania. Tutaj teksty są posortowane.
Zgodnie z bazą taksonomiczną NCBI, dane są dostępne poprzez strukturę drzewiastą po lewej stronie witryny. Klikając znak plus, można wyświetlić tekst na poziomie niższym.
Kliknięcie nazwy taksonu otwiera nową kartę zawierającą każdą strukturę sekwencji oraz parę danego taksonu. Oprócz wyszukiwania sekwencji i struktur za pomocą identyfikatorów banku CEM lub informacji o gatunkach, baza danych I Ts two umożliwia również przeszukiwanie oparte na algorytmie BLAST. Należy jednak pamiętać, że standardowe procedury BLAST często nie są w stanie zidentyfikować odległych pokrewieństw.
Są to dwie sekwencje ze względu na wysoką dywergencję sekwencji. Aby pokonać tę przeszkodę, wdrożyliśmy wyszukiwanie BLAST oparte na sekwencji i strukturze, które w wyszukiwaniu homologii uwzględnia informacje o wysoce konserwatywnej strukturze. Odbywa się to poprzez przetłumaczenie struktury sekwencji na 12-literową pseudosekwencję białkową.
W związku z tym pobieranie próbek gatunków, które rozpoczyna się od dowolnej sekwencji zainteresowania i obejmuje szerokie zakresy taksonomiczne, stało się tak proste, jak wyszukiwanie BLAST. Aby przeprowadzić wyszukiwanie BLAST, można wpisać zapytania sekwencyjne do edytora sekwencji.
Jeśli sekwencja zapytania jest zwykłą sekwencją nukleotydową bez struktury, do sekwencji obejmujących ich struktury drugorzędowe stosowany jest algorytm blast n. Interfejs internetowy wykorzystuje algorytm I Ts two blast. Rozpocznij proces, klikając blast.
Po chwili wyniki wyszukiwania BLAST zostaną wyświetlone w nowej zakładce. Tutaj widoczna jest jedna zakładka dla każdej sekwencji zapytania. Po kliknięciu przycisku „pokaż dopasowania” (show alignments) można przejrzeć dopasowania BLAST. Podobnie jak wcześniej, można wybrać interesujące pary struktura-sekwencja i dodać je do puli danych.
Podczas pracy z bazą danych ITS two, Twoja pula danych może zostać wypełniona wieloma strukturami sekwencji. Dostęp do puli danych oraz możliwość wyświetlenia jej zawartości są możliwe w dowolnym momencie. Kolejnym krokiem analizy jest wielokrotne dopasowanie struktur sekwencji.
Kliknij przycisk analyze dataset, a następnie sequence and structure, aby przeprowadzić dopasowanie sekwencji i struktury. Teraz zostaniesz poproszony o wybranie trybu graficznego dopasowania. W przypadku dużego zestawu sekwencji zaleca się wybranie wersji slim.
Ponieważ nasza pula danych zawiera tylko kilka struktur sekwencji, wybieramy pełny tryb graficzny. Po zakończeniu obliczeń dopasowanie zostaje dodane do puli danych. Podświetlenie jednej strony pary zasad automatycznie podświetla jej odpowiednik.
Na koniec można zapisać dopasowanie, klikając przycisk safe alignment. Po upewnieniu się, że jakość dopasowania struktury sekwencji jest zadowalająca, można obliczyć filogenetyczne drzewo metodą neighbor joining, klikając analyze data set, a następnie neighbor. Wynikowe drzewo neighbor joining pojawi się w nowej karcie.
Można dowolnie zmieniać skalę drzewa za pomocą paska przewijania oraz zmieniać punkt zakorzenienia drzewa, klikając w dowolny węzeł lub liść drzewa, a następnie wybierając opcję zmiany zakorzenienia w tym węźle. Aby usunąć takson z puli danych, należy kliknąć w liść i wybrać opcję Usuń ten węzeł z puli.
Teraz możesz przeliczyć dopasowanie i drzewo przy zredukowanej próbie taksonów, klikając „save tree”. Możesz zapisać swoje drzewo filogenetyczne w formacie NU. Kliknij „about this website”, a następnie „tools”, aby znaleźć dodatkowe informacje o dostępnych do sprzedaży samodzielnych narzędziach oraz wersji pro.
Oprócz dopasowania metodą Neighbor joining, dostępnego również w interfejsie webowym bazy danych ITS2, mogą Państwo teraz korzystać z kilku nowych funkcji, na przykład z ograniczania gatunków (species Del Limitation) w oparciu o zmiany kompensacyjne. W ciągu ostatnich minut chcieliśmy zaprezentować kilka sposobów na ulepszenie analizy filogenetycznej. Pokazaliśmy, jak pobrać dane z bazy danych ITS2, dopasować je za pomocą programu four cell, a na koniec obliczyć drzewa w programie Pro S. Na każdym z tych etapów braliśmy pod uwagę nie tylko sekwencję, ale sekwencję i strukturę. Oczywiście.
Mamy nadzieję, że nasza krótka prezentacja oraz żmudne budowanie drzewa były dla Państwa interesujące. Dobranoc.
Baza danych ITS2 służy jako kompleksowe narzędzie do analiz filogenetycznych, integrując dane sekwencyjne oraz informacje o strukturze drugorzędowej wewnętrznego transkrybowanego odstępnika 2 (ITS2). Umożliwia ona dokładną adnotację, przewidywanie struktury i dopasowanie sekwencji, co usprawnia proces analizy filogenetycznej.
Baza danych ITS2 zapewnia ustrukturyzowane podejście do analizy filogenetycznej poprzez łączenie danych o sekwencjach i strukturach drugorzędowych, co umożliwia bardziej precyzyjne rozdzielenie taksonomiczne na wielu poziomach. Możliwość ta wspiera walidację celów oraz ograniczanie ryzyka mechanistycznego we wczesnej fazie odkrywania leków, zwiększając pewność co do modeli biologicznych stosowanych w przesiewach fenotypowych i opracowywaniu testów. Zintegrowany przepływ pracy, od adnotacji sekwencji po generowanie drzew filogenetycznych, stanowi platformę wielokrotnego użytku służącą do identyfikacji translacyjnych biomarkerów i wyboru modeli przedklinicznych.
Baza danych ITS2 wpisuje się w kontinuum procesów odkrywania leków — od wczesnej walidacji celu po identyfikację związku wiodącego i rozwój przedkliniczny — zapewniając spójny proces analizy sekwencji i struktury oraz wnioskowania filogenetycznego.