12 mars 2012
La base de données ITS2 est un atelier pour la séquence d'inférence phylogénétique considérant simultanément et de la structure secondaire de l'espaceur interne transcrit 2. Cela comprend la collecte de données avec l'annotation précise, prédiction de la structure, plusieurs séquence-structure d'alignement et de calcul d'arbre rapide. En un mot, ce plan de travail simplifie les analyses phylogénétiques premiers à quelques clics.
L'espaceur transcrit interne deux du gène ribosomique, ou ITS2, est l'un des marqueurs les plus importants en systématique moléculaire. Les recherches des 20 dernières années se sont principalement concentrées sur l'exploitation des séquences ITS2 pour la reconstruction phylogénétique. Toutefois, la structure secondaire de l'ITS2 est de plus en plus utilisée dans le domaine de l'inférence phylogénétique pour plusieurs raisons.
L'analyse de la structure secondaire étend l'applicabilité taxonomique de ce marqueur, tandis que la séquence ITS deux, en évolution rapide et donc très variable, convient principalement aux analyses phylogénétiques au niveau des espèces ou inférieur. L'ajout d'informations structurales permet simultanément une analyse à un rang taxonomique plus élevé, grâce à la structure secondaire fortement conservée de l'ITS deux, composée de ses quatre hélices caractéristiques. Ainsi, les résultats de l'analyse de la structure secondaire peuvent améliorer la résolution phylogénétique obtenue à partir de la séquence primaire.
Bienvenue, chers collègues, je m'appelle Matthias Wolf. Je travaille au sein de l'I ts two proof depuis environ huit ans. J'exerce ici au Département de bioinformatique du bio center de l'Université de Wurtzbourg en Allemagne.
Aujourd'hui, nous aimerions vous présenter un court film expliquant comment utiliser la base de données I ts two. Bonjour, je suis y Chu. La raison d'être de ce film est que la base de données I Ts two n'est pas seulement une base de données de stockage, mais nous fournissons également de nombreux outils qui vous permettent d'améliorer vos analyses phylogénétiques.
Dans cette vidéo, nous souhaitons vous montrer comment utiliser ces outils et comment tous ces outils ensemble. Correct. La délimitation de la séquence des I Ts peut être cruciale pour la prédiction de la structure. Par conséquent, une interface basée sur le web pour l'annotation fondée sur le modèle de Markov caché a été mise en œuvre.
Pour obtenir une annotation correcte de vos séquences ITS2, vous pouvez les coller dans l'éditeur de séquences en haut de la page web. Cela est illustré en chargeant les séquences d'exemple de plantes. L'éditeur de séquences vérifie lui-même si vos séquences ITS2 sont valides ou non, et affiche des messages d'erreur.
Par exemple, lorsque vous utilisez des caractères non PAC, après avoir choisi le bon modèle HMM, vous pouvez démarrer le processus en cliquant sur annoter chaque ARN 5,8 s et 28 S. Celui qui peut être identifié par le programme est retiré, laissant les séquences I TS deux correctement annotées, situées entre les deux. En conséquence, les séquences I TS deux délimitées sont affichées ainsi que l'hybride prédit des ARN 5,8 s et 28 S-R-R-N-A. Pour confirmer la précision des annotations HMM après l'annotation des nouvelles séquences I TS deux conservées, les structures secondaires peuvent être déterminées de deux manières.
La première prédiction peut être réalisée par modélisation par homologie à l'aide de l'ensemble complet des séquences et structures de la base de données servant de modèles. Pour prédire la structure de votre séquence annotée, cliquez sur « prédire la structure » pour vos deux séquences. Si vos deux séquences peuvent se replier directement en adoptant la structure secondaire typique de son deux, le résultat est affiché immédiatement.
Vous pouvez désormais choisir parmi plusieurs options pour continuer à traiter votre structure de séquence, notamment en l'ajoutant à votre pool de données. Si vos séquences se trouvent ici, deux séquences ne pouvant pas se replier directement, une recherche Blast contre la base de données est effectuée. La page résultante affiche les meilleurs résultats Blast, incluant la modélisation par homologie pour chaque plastique en tant que modèle.
En cliquant sur le signe plus, les détails s'affichent ; vous pouvez sélectionner les paires séquence-structure de votre choix et les ajouter au groupe de données, soit par glisser-déposer, soit à l'aide du menu contextuel obtenu par un clic droit. Une deuxième approche consiste à saisir manuellement une ou plusieurs séquences, incluant leurs structures secondaires, comme modèles afin de transférer les structures secondaires les plus adaptées vers vos séquences interrogées. Cela est illustré en chargeant le fichier exemple contenant plusieurs modèles.
En cliquant sur Prédire les meilleurs modèles, vous effectuez la modélisation par homologie avec les paramètres par défaut. Le programme de modélisation par homologie calculera toutes les structures contre toutes les autres et affichera les meilleures combinaisons entre séquences cibles et modèles. Dans le tableau résultant, vous pouvez voir quels modèles ont pu utiliser avec succès leur structure secondaire pour modéliser une ou plusieurs séquences cibles.
Encore une fois, les détails des résultats peuvent être affichés en cliquant sur le signe plus, car l'approche complète de modélisation par homologie est indépendante de la région ITS2. Elle peut être utilisée pour prédire la structure secondaire de n'importe quel ARN à partir d'une molécule homologue dont la structure est connue. De plus, les paires séquence-structure résultantes peuvent être ajoutées au groupe de données par glisser-déposer ou via le menu contextuel, qui s'ouvre par un clic droit.
Outre la structure globale, des motifs conservés tels que la séquence A-U-G-G-U précédant l'apex de la troisième hélice et une pyramide périne en désappariement dans la deuxième hélice ont été décrits pour l'ITS2. Ce désappariement UU est entouré par deux motifs, l'un situé à gauche de l'hélice deux et l'autre à droite entre l'hélice deux et l'hélice trois, avec un triplet de nucléotides A supplémentaire. Ayant transformé ces motifs de séquence en hms, nous proposons désormais l'identification de ces motifs dans des séquences d'intérêt.
Pour rechercher ces motifs, saisissez votre séquence de requête dans le champ de recherche et choisissez le modèle approprié. Là encore, cela est illustré en chargeant le fichier exemple pour les plans. Pour démarrer les calculs, cliquez sur recherche de motifs.
Les deux motifs I ts ont été annotés et mis en évidence dans vos séquences de requête. Une possibilité pour récupérer les paires de structures de séquences I ts deux à partir de la base de données I Ts deux est d'utiliser la fonction de recherche. Elle permet à l'utilisateur de rechercher des structures de séquences soit par nom taxonomique, soit par identifiant GenBank.
Pour rechercher une structure de séquence par identifiant GenBank, saisissez le GI dans le champ de recherche et cliquez sur rechercher. Une liste de résultats s'affiche dans un nouvel onglet. Vous pouvez afficher les détails d'une structure de séquence en cliquant sur afficher les détails.
Vous pouvez également afficher les séquences S directs de tous les résultats dans l'onglet en cliquant sur « afficher la structure de la séquence » par glisser-déposer, ou via le menu contextuel avec un clic droit ; les structures de séquence choisies peuvent ainsi être ajoutées au groupe de données. Outre la recherche de paires structure-séquence par gi, vous pouvez saisir un nom de taxon dans le champ de recherche, assisté par une boîte de recherche en direct qui apparaît. Une fois le nouvel onglet apparu, listant tous les résultats, vous pouvez accéder aux mêmes fonctions qu’auparavant.
Par exemple, ajouter une sélection au groupe de données par glisser-déposer. La deuxième possibilité pour récupérer des paires structure-séquence à partir de la base de données est la fonction de navigation. Ici, les textes sont triés.
Selon la base de données de taxonomie du NCBI, les données sont accessibles via une structure arborescente située à gauche du site web. En cliquant sur le signe plus, vous pouvez afficher le texte d'un niveau inférieur.
En cliquant sur un nom de taxon, vous ouvrez un nouvel onglet contenant chaque structure de séquence, par paire du taxon. En complément d'une recherche de séquences et de structures à l'aide d'identifiants de la banque CEM ou d'informations sur les espèces, la base de données I Ts two propose également une recherche basée sur BLAST. Toutefois, les procédures BLAST classiques ne parviennent souvent pas à identifier les relations éloignées.
Ses deux séquences en raison de la forte divergence de séquence. Pour surmonter cet obstacle, nous avons mis en œuvre une recherche blast basée sur la séquence et la structure, qui inclut des informations sur la structure fortement conservée pour la recherche d'homologie. Cela est réalisé en traduisant la structure de la séquence en une séquence pseudo-protéique de 12 lettres.
Ainsi, l'échantillonnage d'espèces qui commence par n'importe quelle séquence d'intérêt et couvre de vastes gammes taxonomiques est devenu aussi simple qu'une recherche Blast. Pour effectuer une recherche Blast, vous pouvez saisir vos séquences interrogées dans l'éditeur de séquences.
Si votre séquence requête est une séquence nucléotidique simple dépourvue de structure, un algorithme blast n classique est utilisé pour les séquences incluant leurs structures secondaires. L'interface web utilise l'algorithme I Ts two blast. Démarrez le processus en cliquant sur blast.
Après quelques instants, vos résultats BLAST sont répertoriés dans un nouvel onglet. Vous voyez ici un onglet pour chaque séquence requête. En cliquant sur « afficher les alignements », vous pouvez parcourir les alignements, comme précédemment. Vous pouvez alors sélectionner les paires séquence-structure de votre choix et les ajouter au groupe de données.
Lors de votre travail sur la base de données ITS deux, votre pool de données peut s'être enrichi de plusieurs structures de séquences. Vous pouvez accéder à tout moment à votre pool de données et afficher son contenu. L'étape suivante de votre analyse est l'alignement multiple des structures de séquences.
Cliquez sur analyser le jeu de données, puis sur séquence et structure pour effectuer l'alignement entre la séquence et la structure. Vous devez maintenant choisir le mode graphique de votre alignement. Pour un grand ensemble de séquences, il est recommandé de sélectionner la version allégée.
Étant donné que notre pool de données ne contient qu'un nombre limité de structures de séquences, nous choisissons le mode graphique complet. Une fois le calcul terminé, l'alignement est ajouté à votre pool de données. En mettant en surbrillance un côté d'une paire de bases, vous mettez automatiquement en surbrillance son partenaire.
Enfin, l'alignement peut être sauvegardé en cliquant sur « sauvegarder l'alignement ». Une fois que vous êtes satisfait de la qualité de l'alignement de la structure de votre séquence, vous pouvez calculer un arbre phylogénétique par la méthode du voisin-joignant en cliquant sur « analyser le jeu de données », puis sur « voisin ». L'arbre résultant s'affiche dans un nouvel onglet.
Vous pouvez redimensionner librement votre arbre à l'aide de la barre de défilement, modifier son tracé en cliquant sur un nœud ou une feuille quelconque de l'arbre, puis en modifiant le tracé à partir de ce nœud. Si vous souhaitez supprimer un taxon de votre pool de données, cliquez sur la feuille correspondante et choisissez « Supprimer ce nœud du pool ».
Vous pouvez maintenant recalculer votre alignement et votre arbre avec un échantillonnage réduit de taxons en cliquant sur enregistrer l'arbre. Vous pouvez sauvegarder votre arbre phylogénétique au format NU. Cliquez sur à propos de ce site, puis sur outils pour obtenir des informations supplémentaires concernant les outils autonomes disponibles à la vente et les versions pro.
Outre l'alignement à l'aide de la fonction Neighbor Joining fournie également par l'interface web de la base de données I Ts two, vous pouvez désormais accéder à plusieurs nouvelles fonctions, par exemple, la délimitation d'espèces fondée sur des changements compensatoires. Au cours des dernières minutes, nous avons souhaité vous montrer quelques astuces pour améliorer votre analyse phylogénétique. Nous vous avons montré comment récupérer vos données à partir de la base de données I Ts two, les aligner avec four cell, puis finalement calculer vos arbres avec Pro S. Dans chacune de ces étapes, nous avons pris en compte non seulement la séquence, mais aussi la séquence et la structure. Bien sûr.
Nous espérons que vous avez apprécié notre petit film et la construction intensive d'arbres phylogénétiques. Bonne nuit.
La base de données ITS2 constitue un outil complet pour l'analyse phylogénétique, intégrant des données de séquence et des informations sur la structure secondaire de l'espaceur transcrit interne 2 (ITS2). Elle permet une annotation précise, la prédiction de structure et l'alignement, simplifiant ainsi le processus d'analyse phylogénétique.
La base de données ITS2 propose une approche structurée de l'analyse phylogénétique en combinant les données de séquence et de structure secondaire, permettant ainsi une résolution taxonomique plus précise à plusieurs niveaux. Cette fonctionnalité soutient la validation des cibles et la réduction des risques mécanistiques en phase précoce de découverte, en renforçant la confiance dans les modèles biologiques utilisés pour le criblage phénotypique et le développement d'essais. Le flux de travail intégré, allant de l'annotation des séquences à la génération d'arbres phylogénétiques, offre une plateforme réutilisable pour l'identification de biomarqueurs translationnels et le choix de modèles précliniques.
La base de données ITS2 s'inscrit dans le continuum de la découverte, de la validation précoce de cibles jusqu'à l'identification de candidats-médicaments et le développement préclinique, en offrant un pipeline cohérent pour l'analyse séquence-structure et l'inférence phylogénétique.