2011년 1월 2일
영상 분석 (VA)는 대화식으로 데이터를 분석하는 새로운 접근 방식입니다. 이 비디오에서는, 우리는 높은 처리량 생물학 실험에 의해 가져온 데이터 과부하 문제를 논의하고, 그러한 문제에 대한 솔루션으로 VA를 만나볼 수 있습니다. 비디오 이내에 테이블오라는 VA 도구를 사용하여 면역 데이터 세트 사이의 분석을 보여줍니다.
시각적 분석 기술을 이용한 면역학적 데이터 분석의 용이성 확보. 데이터 수집 및 저장 능력은 빠르게 발전한 반면, 그에 비해 데이터를 처리하고 분석하는 능력은 거의 진전이 없었습니다. 그 결과, 생의학 연구실에는 대규모 데이터 세트가 존재하는 경우가 많지만, 이를 효과적이고 효율적으로 분석하지 못하고 있습니다.
이처럼 잠재적으로 풍부하고 강력한 정보들이 저장 시스템의 심연 속에서 소실되곤 합니다. 이에 따라 방대하고 복잡한 데이터 세트를 분석하는 새로운 방법으로 시각적 분석(Visual analytics, VA)이 등장했습니다. VA 기술은 분석가가 자신의 시각적 지능을 활용하여 일반적인 추세나 이상치와 같은 데이터 내의 패턴을 포착할 수 있게 하는 시각화에 기반합니다.
이러한 빠른 시각화는 데이터를 탐색하는 동안 신속하게 가설을 형성할 수 있게 해줍니다. VA 도구의 유연성 덕분에 분석가는 데이터 간의 관계를 탐색하면서 확대, 세부 분석 및 여러 데이터 세트 간의 연결을 구축할 수 있습니다. 통합된 데이터 소스에 VA를 적용함으로써 사용자는 새롭고 중요한 발견을 도출할 수 있습니다.
부모 분석(Parent analysis)은 VA 도구 전문가와 기술 전문가(도메인 전문가로도 알려짐)가 협력하여 도메인 전문가가 데이터에 대해 생물학적으로 유의미한 질문을 던지는 VA 접근 방식 중 하나입니다. 그러면 VA 도구 전문가는 해당 질문에 답하거나 추가 탐색으로 이어질 수 있는 패턴을 밝히는 데 도움이 되는 시각화를 생성합니다. 이 과정은 통찰력을 제공하는 다양한 시각화를 구축하기 위해 반복될 수 있습니다.
본 연구에서는 대규모 복합 생물 의학 데이터 세트에 대한 쌍 분석(paired analysis) VA 접근법의 적합성을 테스트하고자 하였습니다. 사전 파일럿 실험을 통해 현재 문제에 적합한 기존 VA 도구들을 여러 가지 평가하였으며, 그 결과 Tableau Software의 Tableau가 본 작업에 가장 적합한 도구인 것으로 판단하여 선택하였습니다.
이些 파일럿 실험의 선정 기준은 사용자 친화성, 전반적인 사용성과 같은 주관적 매개변수뿐만 아니라 상호작용 기법의 범위 및 시각화 기능과 같은 객관적인 기술적 특성을 기반으로 하였습니다. 여기에는 감염성 질환 분야에서 활동하는 실험실의 전형적인 데이터 세트인 Microsoft Excel 스프레드시트가 있습니다. 이 세트에는 피험자 식별자와 유전적 DNA 서열의 변이에 관한 데이터가 포함되어 있습니다.
본 사례에서는 피험자의 NF kappa BIA 단일 염기 다형성(single nucleotide polymorphisms, SNPs)과, 특정 자극으로 면역 세포를 자극한 후 해당 피험자의 면역 세포에서 생성된 사이토카인과 같은 여러 생물학적 분자의 관찰 농도를 다룹니다. 이제 스프레드시트로 스크롤을 내려보겠습니다. 이 데이터셋의 규모를 파악하시도록 설명드리자면, 저희는 유전형, 즉 이 사례의 경우 NF Kappa BIA 유전자의 서로 다른 SNP들과 관찰된 사이토카인 반응 사이에 일반적인 관계가 있는지 확인하고자 합니다.
자극 후, 이제 NF kappa BIA 테이블을 가져왔는지 확인하면서 데이터 세트를 Tableau에 연결하겠습니다. 왼쪽에서 Tableau가 올바른 테이블에 연결되어 있으며, Tableau에서 차원(dimensions)과 측정값(measures)이라고 부르는 항목으로 열 변수가 자동으로 분리된 것을 볼 수 있습니다. 차원은 단순히 데이터를 분류하는 열이며, 측정값은 해당 열의 정량적 값을 의미합니다.
이 시각화를 위해, 이제 자극 농도 수준을 관찰된 사이토카인 반응 농도에 대해 도식화하겠습니다. 이제 사이토카인 농도 수준의 값들을 평균 냅니다. 농도 수준의 순서가 잘못되었으나, 이는 매우 빠르게 다시 정렬할 수 있습니다.
그런 다음 화면에 맞게 뷰를 전환하여 데이터를 더 쉽게 시각화할 수 있습니다. 서로 다른 유전자형을 어떻게 구별할지 조사하려는 것이므로, 유전자형 차원을 이 색상 섹션으로 드래그하기만 하면 됩니다. 그러면 유전자형에 따라 시각화 결과가 즉각적이고 자동으로 분리됩니다.
이제 다른 표시 형식을 시도해 볼 수 있습니다. 예를 들어, 선 그래프를 사용하면 포착하려는 패턴을 더 잘 드러낼 수 있습니다. 분명 그 외에도 많은 옵션이 있습니다.
이 쌍 분석의 생물학자들은 3M OO2라는 시약으로 자극한 후 TNF alpha라고 불리는 사이토카인 마커 중 하나의 생성 관계를 탐색하는 것부터 시작할 것을 제안합니다. 이를 위해 마커 차원에서 TNF alpha를, 자극 차원에서 3M OO2를 필터링해야 합니다. 필터링 과정을 더 유연하게 만들기 위해 마커와 자극 차원 모두에서 빠른 필터 표시 옵션을 선택하고, 단일 값 목록인지 확인하십시오.
이 시각화 자료는 유전자형별로 서로 다른 색상으로 구분하여, 세 가지 수준의 MO oh two 자극 후 TNF alpha 생성의 차이를 명확하게 보여줍니다. 마커와 자극 필터 값의 다른 조합을 선택하면 시각화 결과가 그에 따라 변경됩니다. Excel과 마찬가지로, 별도의 탭에서 다양한 시각화 자료를 구축할 수 있습니다. 발표 목적으로 여러 분석 결과의 요약 뷰를 생성할 수도 있습니다.
본 사례에서는 서로 다른 NF Kappa B IS snip 유전자형을 가진 여러 피험자를 대상으로 TNF Alpha의 생성을 조사하였습니다. 이번 시연에서는 쌍 분석(paired analysis) VA 접근법을 사용하여 약 1분 30초 만에 일련의 강력한 시각화 자료를 성공적으로 생성하였습니다. 이와 유사한 시각화 세트를 엑셀(Excel)로 생성하려면 생의학 연구자에게 일반적으로 30분 정도의 시간이 소요됩니다.
이전의 예시는 단순한 2차원 분석이었습니다. VA의 진정한 강점은 여러 차원을 동시에 시각화할 수 있는 능력에 있습니다. 예를 들어, Tableau는 키 값의 논리적 조인을 통해 데이터 세트 간의 분석을 지원합니다.
동일한 통합 문서에 배치된 두 개의 스프레드시트가 있습니다. 첫 번째 데이터 세트는 이전 시연 예제에서 사용된 것이며, 다른 하나는 동일한 세포 내에서 여러 사이토카인이 생성되는 것을 유세포 분석법(flow cytometry)이라는 기술로 분석한 세포 데이터 세트입니다. 동시에, 다기능성 정도(poly functionality degree) 또는 PFD라고 불리는 측정값이 포함되어 있으며, 가져오기 단계에서 쉽게 식별할 수 있도록 시트 이름을 지정할 수 있습니다.
이를 통해 Tableau에서 두 스프레드시트를 연결할 수 있습니다. 다중 테이블 옵션을 선택한 후, '새 테이블 추가' 기능을 사용하여 두 테이블을 조인할 수 있습니다. 이 기능은 첫 번째 스프레드시트에 두 번째 스프레드시트를 추가하며, 세포 유형, 농도 수준 단계, 그룹 자극 및 피험자 식별자와 같은 동일한 키를 사용하는 조인 구문을 통해 데이터 세트를 결합합니다.
차원이 스프레드시트 이름별로 구분되어 있음에 유의하십시오. 이를 통해 논리적 결합 문(logical joint statement)에 포함되지 않은 차원을 사용할 수 있습니다. 예를 들어, 다기능성(poly functionality)의 정의는 하나 이상의 사이토카인을 생성하는 세포의 백분율입니다.
예를 들어, 두 가지 사이토카인을 생성하는 세포는 PFD 2로, 세 가지 사이토카인을 생성하는 세포는 PFD 3으로 정의합니다. 여기서 이러한 값들을 시각적 표시 장치에서 사용할 수 있는 하나의 측정값으로 결합하기 위해 계산된 필드 하나를 생성합니다. 이제 시각화 구축을 시작할 수 있습니다.
먼저, 사이토카인 농도 수치를 PFD에 대해 두 개까지 플롯하고, 이전 데모와 마찬가지로 PFD가 2보다 큰 값들의 평균값을 구합니다. 또한, 농도 레이블을 수동으로 설정하여 낮은 순에서 높은 순으로 정렬합니다. 이 그룹 중 일부에 대해서만 유전자형 정보가 제공되므로, 유전자형 정보가 포함되지 않은 데이터 행은 필터링하여 제거해야 합니다.
이전과 마찬가지로, 유전자형을 색상 레이블에 빠르게 드래그 앤 드롭하여 각기 다른 유전자형을 구분할 수 있습니다. 그런 다음 뷰를 화면에 맞게 전환하여 데이터를 더 쉽게 시각화할 수 있습니다. 막대 그래프 또한 변경할 수 있습니다.
예를 들어, 이를 테스트한 선 그래프를 통해 각 유전형의 특정 패턴에 따라 CYT 반응과 PFP 반응이 어떻게 달라지는지 잘 파악할 수 있습니다. GG 유전형을 가진 NF kappa b SNP가 다른 유전형과 다른 반응 패턴을 보인다는 점을 즉시 확인할 수 있습니다. 다양한 자극이 이 패턴에 미치는 영향을 조사함으로써 이를 더욱 자세히 탐구할 수 있습니다.
자극 차원에 LPS를 추가한 후, 세 가지 주요 유전자형은 모든 농도에서 유사한 PFD 수준을 보이지만, 3M MO oh two 자극에서만 GG 유전자형이 자극의 저농도에서 고농도로 갈수록 PFD가 급격히 증가하는 것을 확인할 수 있습니다. 이러한 발견을 통해 우리는 자극의 종류가 PFD에 영향을 미친다는 가설을 세우고 향후 실험에서 이를 검증할 수 있습니다. 마지막 두 가지 시연에서는 데이터 세트 내부 및 상호 간의 잠재적으로 유의미한 패턴을 탐지하기 위해 시각화 자료를 빠르게 생성하는 과정을 살펴보았습니다.
시각적 분석의 힘은 대규모 데이터 세트로 빠르게 확장될 수 있으며, 응용 분야에 따라 분석 차원을 확대하고 방대한 데이터 세트 전반의 정보를 통합할 수 있습니다. 예를 들어, 코호트 연구에서 생성되는 수많은 데이터 사일로(data silos)의 경우, VA는 범주형 및 수치 기반 데이터 세트를 포함하여 매우 다양한 유형의 대량 데이터가 존재하는 모든 도메인에 잠재적으로 적용 가능한 전이성이 높은 접근 방식입니다. VA 접근 방식은 두 가지 주요 장점을 제공합니다.
첫째, 유연한 가설 생성입니다. 사용자는 현재의 분석 결과로부터 도출된 데이터에 대해 즉석에서 가설을 생성할 수 있으며, 빠르게 새로운 시각화를 만들어 해당 가설을 탐색함으로써 두 번째로 시간을 절약할 수 있습니다. UVA 도구의 사용 편의성과 효율성은 기존의 정보 시각화 도구와 차별화되는 주요 장점입니다.
전통적인 방법을 사용하여 그래프를 그리는 데 일반적으로 소요되는 노력은 Tableau와 같은 VA 플랫폼에서 2~3시간이면 쉽게 완료할 수 있는 작업을 마무리하는 데 수 영업일이 걸릴 수 있습니다. 분명히, 각각의 구체적인 장단점이 있는 다른 애플리케이션 플랫폼들이 존재하며 앞으로도 계속 존재할 것입니다. 이러한 작업에 파라 분석(para analysis)을 접목함으로써 얻는 추가적인 이점은 복잡한 다차원 데이터 분석에 대한 VA 기반 접근 방식의 전반적인 이점을 분명히 더해줍니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
이 비디오에서는 대규모 면역학 데이터 세트 분석의 어려움을 논의하고, 이에 대한 해결책으로 시각적 분석(visual analytics, VA)을 소개합니다. VA 기술은 시각화를 활용하여 분석가가 복잡한 데이터 내의 패턴과 추세를 식별할 수 있도록 돕습니다.
시각적 분석(Visual analytics, VA)은 복잡한 다차원 데이터 세트의 신속하고 대화형인 탐색을 가능하게 함으로써 증가하는 면역학 데이터 과부하 문제를 해결합니다. 이러한 접근 방식은 가설 생성 및 검증을 가속화하여 초기 발견 워크플로우에서 인사이트 도출까지 걸리는 시간을 단축합니다. 바이오 제약 팀은 도메인 전문 지식과 VA 도구 활용 능력을 통합함으로써 타겟 검증의 신뢰도를 높이고 예측 가치가 더 큰 리드를 우선적으로 선정할 수 있습니다.
VA 방법은 초기 타겟 검증부터 리드 화합물 발굴에 이르는 발견 연속체에 통합되어, 가설 설정이 가능하고 시각적으로 해석 가능한 데이터 세트를 생성함으로써 전임상 평가로의 원활한 전환을 가능하게 합니다.