9 mei 2011
We presenteren een openbare computationele website voor de analyse van genomische sequenties. Het detecteert DNA-sequentie-patronen met verschillende niet-willekeurige nucleotide composities. Deze bron genereert ook gerandomiseerde sequenties met verschillende niveaus van complexiteit.
Het algemene doel van deze procedure is het onderzoeken van mid-range, niet-willekeurige patronen, ook wel inhomogeniteit genoemd, van een door de gebruiker gespecificeerde genomische sequentie. Dit wordt bereikt door eerst de oligonucleotide-compositie van een inputsequentie te onderzoeken en een frequentietabel te genereren van de oligonucleotiden die de sequentie vormen. Dit doel wordt bereikt door het SRI Analyzer-programma aan te roepen.
De tweede stap bestaat uit het produceren van willekeurige sequenties die exact dezelfde oligonucleotidesamenstelling hebben als de inputsequentie. Dit wordt bereikt door het SRI-generatorprogramma aan te roepen. De derde stap van de procedure is het vinden van segmenten binnen de input- en gerandomiseerde sequenties die significant verrijkt zijn met een bepaald nucleotide of een nucleotidecombinatie, bijvoorbeeld GC of ag.
Dit doel wordt bereikt met het MRI Analyzer-programma. De laatste stap van de procedure is het downloaden van de bestanden die sequenties bevatten van alle door het programma gedetecteerde MRI-regio's. Uiteindelijk kunnen resultaten worden verkregen waaruit blijkt dat een meerderheid van de genomische regio's van meercellige arias significant verrijkt zijn met segmenten die basecompositie-extremen bevatten, gedetecteerd voor elk van de vier nucleotiden of elke combinatie daarvan.
Deze in homogene regio's zijn geassocieerd met ongebruikelijke DNA-conformaties en/of specifieke DNA-eigenschappen. Deze methode kan helpen bij het beantwoorden van kernvragen binnen het genomics-veld, zoals het vinden van potentieel functionele DNA-elementen binnen uitgestrekte gebieden van niet-coderende sequenties, inclusief intergene regio's of introns. Hoewel deze methode inzicht kan verschaffen in zoogdiergenomen, kan deze ook worden toegepast op andere organismen zoals ongewervelden, planten, schimmels en bacteriën.
Open de startpagina van het online genomic mid-range in homogeneity of G GM I-pakket op www.bioinfo.utoledo. edu/gri/the web resource. De webbron biedt tevens gedetailleerde informatie over de programma's via de help how to Readme-link.
Hoewel alle gepubliceerde materialen over genomische MRI en soortgelijke algoritmen zijn vermeld in de link naar relevante bronnen, maakt u een bestand aan met een versnelde geformatteerde sequentie om een A-G-M-R-I-analysesessie te starten. Een versnelde geformatteerde sequentie begint met een caret of het groter-dan-teken, gevolgd door een unieke identificatie of naam en een sequentie op de volgende regels. Alleen T, G en C nucleotiden zullen door genomische MRI worden verwerkt, hoewel andere karakterinvoeren zijn toegestaan.
Het sequentiebestand voor het PKD1-gen wordt gebruikt. Om de sessie te demonstreren, drukt u op de startknop. Dit opent een nieuwe webpagina, waarop de optie wordt geboden om de inputsequentie in het daarvoor bestemde venster te kopiëren en te plakken, of om het bestand te uploaden als dit groot is.
Om het bestand te uploaden, klikt u op de knop bestand kiezen om een bestand te uploaden. Navigeer naar het gewenste bestand. Klik vervolgens op de knop start deze sessie met dit bestand. Een bevestiging dat het bestand succesvol is geüpload, wordt bovenaan de pagina weergegeven. Hieronder.
Dit bericht is een identificatiekenmerk van de huidige sessie, die in dit geval C acht EP oh zes is. Klik op de knop 'analyseer korte-afstands-inhomogeniteit' om de korte-afstands-inhomogeniteit van de inputsequentie te analyseren. Het programma opent een nieuwe pagina, specifiek ontworpen voor de uitvoering van het SRI Analyzer-programma.
Hier moeten we de maximale lengte van de te onderzoeken oligonucleotide-fragmenten kiezen. Aangezien onze inputsequenties van gemiddelde grootte ongeveer 50.000 nucleotiden zijn, selecteren we k-meren als de maximale lengte van de oligonucleotiden waarvoor de frequenties zullen worden berekend. Ten slotte moeten we onmiddellijk op de knop 'analyseer bestand' drukken.
Het programma berekent de frequenties van alle oligonucleotiden van de gekozen lengte en kortere lengtes binnen de ingevoerde sequentie. Om de frequenties van alle oligonucleotiden te zien, klikt u op de link download samenstellingsbestand. Dit bestand is benoemd als gebruikersbestand.
com stelt een tabel voor met drie kolommen. De eerste kolom specificeert oligonucleotiden. De tweede representeert hun relatieve frequenties, en de derde representeert het aantal voorkomens van oligonucleotiden binnen de invoersequentie.
Om gerandomiseerde sequenties te genereren met dezelfde oligonucleotidecompositie als het invoerbestand, klikt u op het tabblad SRI-generator. Kies op de nieuwe pagina het aantal monsters van willekeurige sequenties dat moet worden gegenereerd. Elk van deze monsters zal willekeurige sequenties bevatten met hetzelfde aantal en dezelfde lengte als de invoersequenties in het gebruikersbestand.
In dit voorbeeld is het gebruikersbestand de sequentie van het PKD1-gen. Selecteer vervolgens de maximale lengte van de oligonucleotiden waarvan de frequenties in de gerandomiseerde sequenties zullen worden benaderd door het keuzerondje voor 'formers' te selecteren, wat staat voor oligonucleotiden van vier basen. Kies vervolgens twee als aantal monsters van gerandomiseerde sequenties dat gegenereerd moet worden.
Start ten slotte het programma door op de knop 'generate file' te klikken voor de inputsequenties van honderdduizenden nucleotiden. Het genereren van willekeurige sequenties kan enkele minuten duren. Wacht daarom tot de blauwe downloadlinks onderaan deze pagina verschijnen.
Om de mid-range in homogeniteit van input- en gerandomiseerde sequenties te analyseren, klikt u op het tabblad MRI-analyzer. Selecteer op de nieuwe pagina een te analyseren sequentie uit de lijstbox met bestanden om te analyseren. Kies vervolgens GC-gehalte uit de lijst met zeven inhoudstypes.
GC-gehalte staat voor de G-plus-C-samenstelling. In het veld voor venstergrootte kan de lengte van het venster worden geselecteerd waarvoor sequenties met een hoog of laag gehalte worden onderzocht. Behoud de standaardvenstergrootte van 50 nucleotiden.
Kies tot slot respectievelijk de bovenste en onderste drempelwaarde voor contentrijke en contentarme regio's. Deze drempelwaarden kunnen worden gedefinieerd door het aantal specifieke nucleotiden in het huidige venster of door het percentage van deze nucleotiden in het venster. Laten we in dit geval in eerste instantie willekeurige waarden kiezen van 60% voor de bovenste drempelwaarde en 30% voor de onderste drempelwaarde.
Klik vervolgens op de knop om het bestand te analyseren. Daarna verschijnt er een link naar het uitvoerbestand en wordt een grafische weergave van de resultaten getoond. Alle contentrijke regio's langs de inputsequentie zijn gemarkeerd als blauwe pieken die omhoog wijzen, en contentarme regio's als rode pieken die omlaag wijzen. De grafiek laat zien dat er te veel blauwe pieken zijn die GC-rijke regio's aangeven en aanzienlijk minder rode pieken die GC-arme regio's aangeven.
Dit betekent dat de gekozen parameters niet optimaal zijn. Gebruik voor de volgende iteratie een bovengrens van 75% en een ondergrens van 32%. Start de MRI-analyzer opnieuw door op de knop bestand analyseren te klikken.
De nieuwe grafiek laat zien dat er, zelfs voor de nieuwe, veel strengere parameters, honderden blauwe pieken zijn. Verhoog daarom de bovengrens naar 80% en herhaal de berekeningen. De nieuwe grafiek laat zien dat 62 GC-rijke regio's een GC-gehalte hebben dat groter is dan of gelijk is aan 80% en 28 GC-arme regio's een GC-gehalte hebben onder de 32%. Vergelijk vervolgens de resultaten voor het inputbestand met de twee gerandomiseerde sequenties die dezelfde oligonucleotide-compositie hebben als het PKD1-gen.
Om dit te doen, wijzigt u de sequentie van het PKD1-gen naar de willekeurige sequentie met behulp van het selectievak 'file to analyze', terwijl u dezelfde parameters voor GC-rijke en GC-arme regio's behoudt. De nieuw gegenereerde grafische weergave voor de gerandomiseerde sequentie nummer één illustreert dat deze willekeurige sequentie slechts één GC-arme regio en 31 GC-rijke regio's heeft. Een andere gerandomiseerde sequentie kan enige fluctuatie vertonen in het aantal inhoudsrijke en inhoudsarme regio's, maar de trend zou hetzelfde moeten zijn.
Gerandomiseerde sequenties voor het PKD1-gen komen meerdere malen minder voor. GC-rijke regio's komen meer dan 10 keer minder vaak voor dan GC-arme regio's. De volgende demonstratie maakt gebruik van een ander type MRI-inhoud.
In hetzelfde pakket bevatten de intronen van één menselijk gen verschillende purinerijke regio's die geassocieerd zijn met DNA-aex-structuren. Schakel op de webpagina van de MRI-analyzer de DNA-inhoud in naar ag-nucleotiden die purines vertegenwoordigen. Houd de venstergrootte gelijk aan 50 bases en wijzig de bovengrens naar 80% en de ondergrens naar 10%. Druk vervolgens op de knop 'analyze file' om het programma aan te roepen.
De weergegeven grafiek laat zien dat dit gen zes AG-rijke regio's heeft, aangegeven door blauwe verticale pieken, en 14 AG-arme regio's, aangegeven door rode pieken. Vergelijk vervolgens deze resultaten voor het PKD1-gen met de gegevens van de gerandomiseerde sequenties die dezelfde oligonucleotide-samenstelling hebben als het bestudeerde gen; schakel eerst over naar de gerandomiseerde sequentie, bijvoorbeeld nummer twee, en behoud dezelfde parameters als bij de vorige test. De grafiek voor deze willekeurige sequentie laat zien dat deze slechts één AG-rijke regio bevat en geen AG-arme regio's.
Alle gegevens die tijdens de sessie worden gegenereerd, worden opgeslagen in speciale bestanden die toegankelijk zijn via het tabblad 'download files' in de rechterbovenhoek van elke webpagina. Nadat u op deze link heeft geklikt, downloadt u de inputsequentie en alle gegenereerde gerandomiseerde sequenties. Onder deze lijst met bestanden staat een link naar de oligonucleotidefrequentietabel die is gegenereerd door het SRI-analyseprogramma.
Vervolgens zijn er links naar alle resultaten die door het MRI-analyseprogramma tijdens de sessie zijn gegenereerd. Klik bijvoorbeeld op het bestand RAND one four AGCO 50 32 14, dat de resultaten vertegenwoordigt die zijn verkregen voor de gerandomiseerde sequentie nummer één met de volgende parameters: ag-gehalte 50, een nucleotide-venster van 50, een bovengrens van 32 nucleotiden en een ondergrens van 14 nucleotiden.
In dit bestand zijn alle nucleotidevolgsegmenten die voldoen aan de criteria voor rijkdom of armoede, samen met hun coördinaten, beschikbaar als een lijst op basis van hun opeenvolgende posities langs de inputsequentie. Na het bekijken van deze video zou u een goed inzicht moeten hebben in het navigeren door genomic MRI, een computationele bron.
Dit artikel presenteert een computationele webresource die is ontworpen voor de analyse van genomische sequenties, met een focus op het detecteren van niet-willekeurige nucleotidecomposities. De tool genereert gerandomiseerde sequenties met soortgelijke oligonucleotidecomposities, wat de exploratie van genomische inhomogeniteiten vergemakkelijkt.
Genomische MRI biedt een computationele benadering om niet-willekeurige nucleotidenpatronen in niet-coderend DNA te detecteren, wat doelwitvalidatie ondersteunt door regulatoire elementen met potentiële functionele betekenis te identificeren. Dit maakt mechanische risicoreductie in de vroege ontdekkingsfase mogelijk door sequentie-inhomogeniteit te koppelen aan biologische processen zoals genexpressie en recombinatie. De bron verhoogt het voorspellende vertrouwen bij de identificatie van lead-verbindingen door genomische regio's met een extreme basecompositie prioriteit te geven voor de ontwikkeling van downstream-assays.
De methode integreert in het ontdekkingscontinuüm, van targetvalidatie via lead-identificatie tot preklinisch werk, door kwantitatieve outputs over sequentieverrijking te leveren die bijdragen aan beslissingen voor biologische risicoreductie.