2 januari 2011
Visuele analyses (VA) is een nieuwe benadering van het analyseren van gegevens interactief. In deze video bespreken we de data overload probleem veroorzaakt door high-throughput biologische experimenten, en stellen VA als een oplossing voor dergelijke problemen. De video toont analyse binnen en tussen de immunologische datasets met behulp van een tool genaamd VA Tableau.
Het faciliteren van de analyse van immunologische gegevens met visuele analytische technieken. Terwijl de capaciteit om gegevens te verzamelen en op te slaan zich snel heeft ontwikkeld, is de mogelijkheid om deze te verwerken en te analyseren in vergelijking weinig vooruitgegaan. Hierdoor zijn er in biomedische laboratoria vaak grote datasets aanwezig die niet effectief of efficiënt worden geanalyseerd.
Hierdoor gaat potentieel rijke en waardevolle informatie verloren in de afgrond van opslagsystemen. Visuele analytics of VA is ontstaan als een nieuwe manier om grote, complexe datasets te analyseren. VA-technieken zijn gebaseerd op visualisaties die analisten in staat stellen hun visuele intelligentie te gebruiken om patronen in data te herkennen, zoals algemene trends of uitschieters.
Deze snelle visualisaties maken het mogelijk om snel hypothesen te vormen tijdens het verkennen van gegevens. De flexibiliteit van VA-instrumenten stelt de analist in staat om in te zoomen, dieper in de data te graven en verbindingen tussen meerdere datasets op te bouwen terwijl de relaties daartussen worden verkend. Door VA toe te passen op geïntegreerde gegevensbronnen kan de gebruiker nieuwe en belangrijke bevindingen ontsluiten.
Parent-analyse is een VA-benadering waarbij een VA-toolexpert en een technisch expert, ook wel domeinexpert genoemd, samenwerken, waarbij de domeinexpert biologisch relevante vragen over de data stelt. De VA-toolexpert maakt vervolgens visualisaties die kunnen helpen bij het onthullen van patronen die bijdragen aan het beantwoorden van deze vraag of leiden tot verdere exploratie. Dit proces kan iteratief worden doorlopen om verschillende visualisaties te bouwen die inzicht verschaffen.
We hebben getracht de geschiktheid van een gekoppelde analyse-VA-benadering te testen voor een grote, complexe biomedische dataset. In voorlopige pilootexperimenten hebben we verschillende bestaande VA-tools geëvalueerd voor het huidige probleem. We hebben Tableau van Tableau software gekozen als de tool die het meest geschikt is voor de huidige taak.
De selectiecriteria in deze pilotexperimenten waren gebaseerd op subjectieve parameters zoals gebruiksvriendelijkheid en algemene bruikbaarheid, evenals objectieve technische kenmerken zoals een reeks interactietechnieken en visualisatiefuncties. We hebben hier een dataset in een Microsoft Excel-spreadsheet die typisch is voor een laboratorium dat werkzaam is op het gebied van infectieziekten. Deze set bevat een subjectidentificatie en gegevens over variatie in genetische DNA-sequenties.
In dit geval gaat het om enkelvoudige nucleotidepolymorfismen (SNP's) van NF kappa BIA voor de proefpersoon, evenals de geobserveerde concentratie van verschillende biologische moleculen; in dit geval cytokines die door immuuncellen van de proefpersoon zijn geproduceerd na stimulatie van deze immuuncellen met specifieke stimuli. We scrollen nu naar beneden naar het spreadsheet. Om een idee te geven van de omvang van deze dataset: we willen achterhalen of er een algemene relatie bestaat tussen het genotype (de verschillende SNP's van in dit geval het NF Kappa BIA-gen) en de geobserveerde cytokinerespons.
Na de stimulatie koppelen we nu de dataset aan Tableau, waarbij we ervoor zorgen dat we de NF kappa BIA-tabel importeren. Aan de linkerkant is te zien dat Tableau is gekoppeld aan de juiste tabel en de kolomvariabelen automatisch heeft gescheiden in wat Tableau dimensies en maten noemt. Dimensies zijn simpelweg de kolommen die de gegevens categoriseren, en maten zijn de kwantitatieve waarden in die kolom.
Voor deze visualisatie plotten we nu de stimulusconcentratieniveaus tegenover de waargenomen cytokine-responsconcentratie. We berekenen nu het gemiddelde van de cytokineconcentratieniveaus. De volgorde van de concentratieniveaus is onjuist, maar dit kan heel eenvoudig snel opnieuw worden gesorteerd.
Vervolgens kunnen we de weergave aanpassen aan het scherm om de data gemakkelijker te kunnen visualiseren. Omdat we willen onderzoeken hoe we onderscheid kunnen maken tussen de verschillende genotypen, hoeven we alleen maar de dimensie genotype naar dit kleurgedeelte te slepen. De visualisatie scheidt de data automatisch en onmiddellijk op basis van het genotype.
Nu kunnen we verschillende weergaveformaten proberen. Een lijngrafiek kan bijvoorbeeld een patroon dat we willen vastleggen beter onthullen. Er zijn uiteraard nog veel andere opties.
De biologen in deze gekoppelde analyse suggereren dat we beginnen met het onderzoeken van de relaties met de productie van een van de cytokinemarkers, genaamd TNF alpha, na stimulatie met een reagens genaamd 3M OH OH 2. Om dit te doen, moeten we filteren op de marker-dimensie TNF alpha en de stimulus-dimensie 3M OH OH 2. Om het filterproces flexibeler te maken, kunnen we de optie 'toon snel filter' kiezen voor zowel de marker- als de stimulus-dimensies, waarbij we ervoor zorgen dat dit een lijst met enkelvoudige waarden is.
Deze visualisatie laat duidelijk een verschil zien in de TNF alfa-productie na verschillende niveaus van drie MO oh twee-stimulatie, gescheiden per genotype in verschillende kleuren; we kunnen elke andere combinatie van marker- en stimulusfilterwaarden kiezen, waardoor de visualisatie dienovereenkomstig verandert. Net als in Excel kunnen we verschillende visualisaties in afzonderlijke tabbladen opbouwen. Ten behoeve van presentaties kunnen we ook een samenvattend overzicht van meerdere analyses genereren.
In dit geval hebben we de productie van TNF Alpha onderzocht bij verschillende proefpersonen met een verschillend NF Kappa BIAS snp-genotype. In deze demonstratie hebben we met succes een reeks krachtige visualisaties gegenereerd in ongeveer 1 minuut en 30 seconden met behulp van een paired analysis VA-benadering. Een vergelijkbare set visualisaties kost een biomedisch onderzoeker normaal gesproken 30 minuten om in Excel te genereren.
Een vorig voorbeeld was een eenvoudige tweedimensionale analyse. De werkelijke kracht van VA is het vermogen om meerdere dimensies tegelijkertijd te visualiseren. Tableau ondersteunt bijvoorbeeld analyses tussen datasets via logische joins van sleutelwaarden.
Hier zijn twee spreadsheets die in hetzelfde werkboek zijn geplaatst. De eerste dataset is afkomstig uit het vorige demonstratievoorbeeld, en de andere is een dataset van cellen die zijn geanalyseerd met een techniek genaamd flowcytometrie voor de productie van meerdere cytokinen in dezelfde cel. Tegelijkertijd is er een maatstaf genaamd polyfunctionaliteitsgraad of PFD; u kunt het blad een naam geven zodat deze tijdens de importfase gemakkelijker te identificeren zijn.
Dit stelt Tableau in staat om de twee spreadsheets met elkaar te verbinden. Na het selecteren van de optie voor meerdere tabellen kunt u de functie voor het toevoegen van een nieuwe tabel gebruiken om de twee tabellen te koppelen. Deze functie voegt de tweede spreadsheet toe aan de eerste en gebruikt join-statements om de datasets te combineren aan de hand van identieke sleutels, zoals celtype, concentratieniveau, stadium, groepsstimulus en proefpersoon-identificatie.
Let op dat de dimensies zijn gescheiden per spreadsheetnaam. Hierdoor kunnen we de dimensies gebruiken die geen deel uitmaakten van de logische joint-verklaring. De definitie voor polyfunctionaliteit is bijvoorbeeld het percentage cellen dat meer dan één cytokine produceert.
Bijvoorbeeld, een cel die twee cytokinen produceert als een PFD van twee en een cel die drie cytokinen produceert als een PFD van drie. Hier maken we één berekend veld aan om deze waarden te combineren tot één maatstaf die we in een visuele weergave kunnen gebruiken. Nu kunnen we beginnen met het bouwen van de visualisatie.
Eerst plotten we de concentratie van cytokineniveaus tegenover PFD's over twee, en we nemen, net als in de vorige demo, de gemiddelde waarde van PFD's groter dan twee. We schikken daarnaast de labels van de concentratie handmatig van laag naar hoog. Aangezien genotype-informatie slechts beschikbaar is voor een deel van deze groep, moeten we de rijen met gegevens filteren die geen genotype-informatie bevatten.
Net als voorheen kunnen we het genotype snel in het kleurlabel slepen, zodat we elk verschillend genotype ook kunnen onderscheiden. Vervolgens kunnen we de weergave aanpassen aan het scherm voor een eenvoudigere visualisatie van de gegevens. We kunnen ook de staafgrafiek aanpassen.
Een lijngrafiek waarin dit is getest geeft bijvoorbeeld een goed beeld van hoe de CYT-respons en PFP-respons variëren volgens de patronen die specifiek zijn voor elk genotype. Er valt direct op dat de NF kappa b SNP met het GG-genotype een ander responspatroon vertoont in vergelijking met de andere genotypes. We kunnen dit verder onderzoeken door de impact van verschillende stimuli op dit patroon te bestuderen.
Let op dat na het toevoegen van LPS in de stimulusdimensie, de drie belangrijkste genotypen een vergelijkbaar PFD-niveau vertonen bij alle concentraties, maar dat bij de stimuli met enkel 3M MO oh twee, het GG-genotype een sterke stijging in PFD laat zien van een lage naar een hoge concentratie van de stimulus. Deze bevinding stelt ons in staat een hypothese op te stellen om in toekomstige experimenten te testen, namelijk dat het type stimulus invloed heeft op de PFD. In de laatste twee demonstraties hebben we gezien hoe snel visualisaties kunnen worden gegenereerd om potentieel betekenisvolle patronen te detecteren, zowel binnen als tussen datasets.
De kracht van visuele analyse kan snel worden uitgebreid naar grote datasets, waarbij de dimensies van de analyse worden opgeschaald afhankelijk van de toepassing, om informatie over uitgestrekte datasets te integreren. Vanwege de vele datasilo's die in cohortstudies worden gegenereerd, is VA bijvoorbeeld een zeer overdraagbare benadering die potentieel kan worden toegepast op elk domein met grote hoeveelheden van vele verschillende soorten gegevens, inclusief categorische en numerieke datasets. De VA-benadering biedt twee belangrijke voordelen.
Ten eerste, flexibele hypothesegeneratie. De gebruiker kan ter plekke hypothesen over de gegevens genereren op basis van de huidige bevindingen, en snel nieuwe visualisaties maken die de hypothese verkennen, wat ten tweede tijd bespaart. De bruikbaarheid en efficiëntie van UVA-instrumenten zijn hun belangrijkste voordeel ten opzichte van traditionele informatievisualisatietools.
De inspanning die gewoonlijk gepaard gaat met het maken van grafieken via traditionele methoden kan meerdere werkdagen in beslag nemen om te bereiken wat in twee tot drie uur eenvoudig kan worden gerealiseerd op een VA-platform zoals Tableau. Het is duidelijk dat er andere applicatieplatforms zijn en zullen zijn, elk met specifieke voor- en nadelen. Het extra voordeel van het benaderen van deze taak met para-analyse draagt duidelijk bij aan het algemene voordeel van een op VA gebaseerde aanpak voor de analyse van complexe multidimensionale gegevens.
Bekijk het volledige transcript en krijg toegang tot duizenden wetenschappelijke video's
Deze video bespreekt de uitdagingen bij het analyseren van grote immunologische datasets en introduceert visuele analyse (VA) als oplossing. VA-technieken maken gebruik van visualisaties om analisten te helpen patronen en trends in complexe data te identificeren.
Visuele analyse (VA) pakt de groeiende uitdaging van overvloed aan immunologische gegevens aan door snelle, interactieve exploratie van complexe, multidimensionale datasets mogelijk te maken. Deze aanpak versnelt het genereren en valideren van hypothesen, waardoor de tijd tot het verkrijgen van inzichten in vroege discovery-workflows wordt verkort. Door domeinexpertise te integreren met vaardigheid in VA-instrumenten, kunnen biofarmaceutische teams het vertrouwen in target-validatie verhogen en leads met een grotere voorspellende waarde prioriteren.
VA-methoden zijn geïntegreerd in het ontdekkingscontinuüm, van vroege doelwitvalidatie tot leadidentificatie, waardoor een naadloze overgang naar preklinische beoordeling mogelijk is door het genereren van visueel interpreteerbare datasets die klaar zijn voor hypothesevorming.