2 de enero de 2011
La analítica visual (AV) es un nuevo enfoque de análisis de datos de forma interactiva. En este video, se discute el problema de la sobrecarga de datos causada por experimentos de alto rendimiento biológico y proponer VA como una solución a tal problema. El video muestra el análisis dentro y entre los conjuntos de datos inmunológicos utilizando una herramienta llamada Tableau VA.
Facilitar el análisis de datos inmunológicos con técnicas de análisis visual. Si bien la capacidad de recopilar y almacenar datos ha avanzado rápidamente, la capacidad de procesarlos y analizarlos, en comparación, ha progresado poco. Como resultado, en los laboratorios biomédicos a menudo existen grandes conjuntos de datos que no se analizan de manera efectiva ni eficiente.
Con ello, información potencialmente rica y poderosa se pierde en el abismo de los sistemas de almacenamiento. La analítica visual o VA ha surgido como una nueva forma de analizar conjuntos de datos grandes y complejos. Las técnicas de VA se basan en visualizaciones que permiten a los analistas utilizar su inteligencia visual para detectar patrones en los datos, como tendencias generales o valores atípicos.
Estas visualizaciones rápidas permiten la formación rápida de hipótesis mientras se exploran los datos. La flexibilidad de las herramientas de VA permite al analista acercarse, profundizar y establecer conexiones entre múltiples conjuntos de datos mientras explora sus relaciones. A través de la aplicación de VA a fuentes de datos integradas, el usuario puede revelar hallazgos nuevos e importantes.
El análisis de progenitores es un enfoque de VA en el que un experto en herramientas de VA y un experto técnico, también conocido como experto en el dominio, trabajan juntos para que el experto en el dominio formule preguntas biológicamente relevantes sobre los datos. Luego, el experto en herramientas de VA crea visualizaciones que podrían ayudar a revelar patrones útiles para responder esta pregunta o para continuar con la exploración. Este proceso puede repetirse para generar diferentes visualizaciones que aporten conocimientos.
Empezamos a evaluar la idoneidad de un enfoque de análisis emparejado de VA para un conjunto de datos biomédicos complejo y amplio. En experimentos piloto preliminares, evaluamos varias de las herramientas de VA existentes para el problema actual. Elegimos Tableau de Tableau Software como la herramienta más adecuada para la tarea en cuestión.
Los criterios de selección en estos experimentos piloto se basaron en parámetros subjetivos, como la facilidad de uso y la usabilidad general, así como en características técnicas objetivas, como una variedad de técnicas de interacción y funciones de visualización. Aquí tenemos un conjunto de datos en una hoja de cálculo de Microsoft Excel, típico de un laboratorio que trabaja en el campo de las enfermedades infecciosas. Este conjunto contiene un identificador de sujeto y datos sobre la variación en secuencias genéticas de ADN.
En este caso, los polimorfismos de un solo nucleótido del NF kappa BIA, o SNS, del sujeto, así como la concentración observada de varias moléculas biológicas, en este caso citocinas producidas por las células inmunitarias del sujeto tras la estimulación de dichas células con estímulos específicos. Ahora vamos a desplazarnos hacia abajo hasta la hoja de cálculo. Para dar una idea del volumen de este conjunto de datos, estamos interesados en determinar si existe una relación general entre el genotipo, es decir, los diferentes SNPs, en este caso, del gen NF Kappa BIA, y la respuesta citocínica observada.
Después de la estimulación, conectaremos ahora el conjunto de datos con Tableau, asegurándonos de importar la tabla NF kappa BIA. Puede observarse en el lado izquierdo que Tableau está conectado a la tabla correcta y ha separado automáticamente las variables de columna en lo que Tableau denomina dimensiones y medidas. Las dimensiones son simplemente las columnas que categorizan los datos, y las medidas son los valores cuantitativos en esa columna.
Para esta visualización, graficaremos ahora los niveles de concentración del estímulo frente a la concentración observada de la respuesta de citocinas. Ahora promediamos los valores de los niveles de concentración de citocinas. El orden de los niveles de concentración es incorrecto, pero es bastante fácil reordenarlos rápidamente.
Luego podemos cambiar la vista para ajustarla a la pantalla y permitir una visualización más sencilla de los datos. Dado que queremos investigar cómo diferenciar entre los distintos genotipos, todo lo que debemos hacer es arrastrar la dimensión de genotipo a esta sección de color. La visualización se separa automáticamente e inmediatamente según el genotipo.
Ahora, podemos probar diferentes formatos de visualización. Por ejemplo, un gráfico de líneas podría revelar mejor un patrón que deseamos capturar. Obviamente, existen muchas otras opciones.
Los biólogos en este análisis pareado sugieren que comencemos explorando las relaciones de la producción de uno de los marcadores de citocinas llamado QNF alfa tras la estimulación con un reactivo llamado 3M oh oh dos. Para ello, necesitamos filtrar la dimensión del marcador, TNF alfa, y la dimensión del estímulo 3M oh oh dos. Para hacer el proceso de filtrado más flexible, podemos seleccionar la opción mostrar filtro rápido para ambas dimensiones, marcador y estímulo, asegurándonos de que sea una lista de valores únicos.
Esta visualización muestra claramente una diferencia en la producción de TNF alfa tras distintos niveles de estimulación con tres MO oh dos, separados por genotipo en diferentes colores. Podemos elegir cualquier otra combinación de marcadores y valores del filtro de estímulo, y la visualización cambiaría en consecuencia. De forma similar a Excel, podríamos crear diferentes visualizaciones en pestañas separadas. Con fines de presentación, también podemos generar una vista resumen de múltiples análisis.
En este caso, hemos investigado la producción de TNF Alpha en varios sujetos con un genotipo diferente del SNP NF Kappa BIAS. En esta demostración, generamos con éxito una serie de visualizaciones potentes en aproximadamente un minuto y treinta segundos utilizando un enfoque de análisis emparejado VA. Un conjunto similar de visualizaciones normalmente requiere que un investigador biomédico invierta treinta minutos para generarlas en Excel.
Un ejemplo anterior fue un análisis bidimensional sencillo. El verdadero potencial del análisis visual (VA) radica en la capacidad de visualizar múltiples dimensiones al mismo tiempo. Por ejemplo, Tableau permite realizar análisis entre conjuntos de datos mediante combinaciones lógicas de valores clave.
Aquí hay dos hojas de cálculo colocadas en el mismo libro. El primer conjunto de datos es el del ejemplo de demostración anterior, y el otro es un conjunto de datos de células analizadas mediante una técnica llamada citometría de flujo para la producción de múltiples citocinas en la misma célula. Al mismo tiempo, una medida llamada grado de polifuncionalidad o PFD; puede nombrar la hoja para facilitar su identificación durante la etapa de importación.
Esto permite que Tableau conecte las dos hojas de cálculo. Después de seleccionar la opción de varias tablas, puede utilizar la función de agregar nueva tabla para unir las dos tablas. Esta función añade la segunda hoja de cálculo a la primera y utiliza las instrucciones de combinación para fusionar los conjuntos de datos mediante claves idénticas, como tipo de célula, nivel de concentración, etapa, estímulo del grupo e identificador del sujeto.
Tenga en cuenta que las dimensiones están separadas por el nombre de la hoja de cálculo. Esto nos permite utilizar las dimensiones que no formaban parte de la declaración conjunta lógica. La definición de funcionalidad polivalente, por ejemplo, es el porcentaje de células que producen más de una citocina.
Por ejemplo, una célula que produce dos citoquinas con un PFD de dos y una célula que produce tres citoquinas con un PFD de tres. Aquí creamos un campo calculado para combinar estos valores en una sola medida que podemos utilizar en una representación visual. Ahora podemos comenzar a construir la visualización.
Primero, graficamos la concentración de los niveles de citocinas frente a los PFD sobre dos, y al igual que en la última demostración, tomamos el valor promedio de los PFD mayores que dos. También organizamos las etiquetas de concentración de menor a mayor estableciéndolas manualmente. Dado que la información sobre el genotipo solo está disponible para algunos individuos de este grupo, necesitamos filtrar las filas de datos que no contienen información sobre el genotipo.
Al igual que antes, podemos colocar rápidamente el genotipo en la etiqueta de color, lo que nos permite diferenciar también cada genotipo distinto. Luego, podemos cambiar la vista para ajustarla a la pantalla y facilitar la visualización de los datos. También podemos modificar el segundo gráfico de barras.
Por ejemplo, un gráfico de líneas que evaluó esto proporciona una buena idea de cómo la respuesta de CYT y la respuesta de PFP varían según los patrones específicos de cada genotipo. Se observa inmediatamente que el SNP de NF kappa b con el genotipo GG presenta un patrón de respuesta diferente en comparación con los otros genotipos. Podemos explorar esto más a fondo investigando el impacto de diferentes estímulos sobre este patrón.
Téngase en cuenta que tras añadir LPS en la dimensión del estímulo, los tres genotipos principales muestran un nivel similar de PFD en todas las concentraciones, pero únicamente con los estímulos 3M MO oh dos, el genotipo GG muestra un aumento pronunciado en el PFD al pasar de baja a alta concentración de estímulo. Este hallazgo nos permite generar una hipótesis para probar en futuros experimentos, concretamente que el tipo de estímulo influye en el PFD. En las dos últimas demostraciones, observamos la generación rápida de visualizaciones para detectar patrones potencialmente significativos tanto dentro como entre conjuntos de datos.
El poder del análisis visual puede extenderse rápidamente a conjuntos de datos grandes, ampliando las dimensiones del análisis según la aplicación e integrando información a través de vastos conjuntos de datos. Por ejemplo, con los numerosos silos de datos generados en estudios de cohortes, el análisis visual (VA) es un enfoque altamente transferible que potencialmente puede aplicarse a cualquier dominio con grandes cantidades de diferentes tipos de datos, incluyendo conjuntos de datos categóricos y numéricos. El enfoque de VA ofrece dos ventajas principales.
Una, generación flexible de hipótesis. El usuario puede generar hipótesis sobre los datos sobre la marcha a partir de los hallazgos actuales, y crear rápidamente nuevas visualizaciones que exploren la hipótesis, lo que ahorra tiempo. La facilidad de uso y la eficiencia de las herramientas UVA son su principal ventaja frente a las herramientas tradicionales de visualización de información.
El esfuerzo que normalmente implica la elaboración de gráficos mediante métodos tradicionales puede llevar varios días de trabajo para completar lo que se logra fácilmente en dos o tres horas en una plataforma de análisis visual (VA) como Tableau. Es evidente que existen y probablemente seguirán existiendo otras plataformas de aplicación, cada una con sus ventajas y desventajas específicas. El beneficio adicional de abordar esta tarea con análisis para claramente incrementa el beneficio general de un enfoque basado en VA para el análisis de datos complejos multidimensionales.
Vea la transcripción completa y acceda a miles de videos científicos
Este vídeo analiza los desafíos de examinar grandes conjuntos de datos inmunológicos e introduce la analítica visual (VA) como una solución. Las técnicas de analítica visual aprovechan las visualizaciones para ayudar a los analistas a identificar patrones y tendencias en datos complejos.
El análisis visual (VA) aborda el creciente desafío de la sobrecarga de datos inmunológicos al permitir la exploración rápida e interactiva de conjuntos de datos complejos y multidimensionales. Este enfoque acelera la generación y validación de hipótesis, reduciendo el tiempo necesario para obtener conclusiones en los flujos de trabajo de descubrimiento inicial. Al integrar la experiencia específica del dominio con la competencia en herramientas de VA, los equipos de biofármacos pueden mejorar la confianza en la validación de objetivos y priorizar candidatos con mayor valor predictivo.
Los métodos de VA se integran en el continuo de descubrimiento desde la validación temprana de objetivos hasta la identificación de compuestos prometedores, permitiendo una transición fluida hacia la evaluación preclínica mediante la generación de conjuntos de datos listos para hipótesis e interpretación visual.