2011年1月2日
視覚的な分析(VA)は、対話的にデータを分析の新しいアプローチです。このビデオでは、我々はハイスループット生物学的実験によってもたらされるデータの過負荷の問題を議論し、そのような問題に対する解決策として、VA提案する。ビデオでは、内と場札と呼ばれるVAツールを使用して免疫学的データセット間の分析を示しています。
視覚的分析手法を用いて免疫学的データの解析を促進します。データの収集および保存能力は急速に向上しましたが、それに比して、データを処理および解析する能力はほとんど進歩していません。その結果、生物医学研究室には、効果的かつ効率的に解析されていない大規模なデータセットが存在することが多くあります。
このように、潜在的に豊かで強力な情報は、ストレージシステムの深淵の中で失われています。そこで、大規模で複雑なデータセットを分析する新たな手法として、ビジュアルアナリティクス(VA)が登場しました。VAの手法は視覚化に基づいたものであり、分析者が自身の視覚的知能を活用して、全般的な傾向や外れ値などのデータ内のパターンを特定することを可能にします。
これらの迅速な可視化により、データの探索中に仮説を速やかに構築することが可能になります。VAツールの柔軟性により、分析者は複数のデータセットを探索しながら、ズームインやドリルダウンを行い、それらの関係性を横断して接続を構築することができます。統合されたデータソースにVAを適用することで、ユーザーは新しく重要な知見を明らかにすることが可能です。
ペア分析とは、VAツールの専門家と、ドメインエキスパートとして知られる技術専門家が協力し、ドメインエキスパートがデータに関して生物学的に意義のある質問を投げかけるVAアプローチの一種です。次に、VAツールの専門家が、その質問への回答に役立つパターンを明らかにしたり、さらなる探索へと導いたりするための可視化を作成します。このプロセスを繰り返し、洞察を得るためのさまざまな可視化を構築します。
私たちは、大規模で複雑なバイオメディカルデータセットに対して、ペアード分析によるVAアプローチの適合性を検証することを目指しました。予備的なパイロット実験において、現在の課題に対して既存のいくつかのVAツールを評価しました。その結果、今回のタスクに最も適したツールとして、Tableau Software社のTableauを選択しました。
これらのパイロット実験における選定基準は、ユーザーフレンドリーさや全体的なユーザビリティなどの主観的なパラメータに加えて、インタラクション手法の範囲や可視化機能などの客観的な技術的特徴に基づいています。ここでは、感染症分野の研究室で一般的に使用される、Microsoft Excelスプレッドシート形式のデータセットを使用します。このデータセットには、被験者の識別子および遺伝子DNA配列の変異に関するデータが含まれています。
このケースでは、被験者のNF kappa BIAの一塩基多型(SNP)、および、免疫細胞を特定の刺激で刺激した後に観察された、いくつかの生物学的分子(ここでは免疫細胞によって産生されたサイトカイン)の濃度を扱います。それでは、スプレッドシートを下にスクロールします。このデータセットの規模を把握していただくため、ここではジェノタイプ(この場合はNF Kappa BIA遺伝子の異なるSNP)と、観察されたサイトカイン反応との間に一般的な相関関係があるかを確認したいと考えています。
刺激後、データセットをTableauに接続し、NF kappa BIAテーブルが正しくインポートされていることを確認します。画面左側で、Tableauが正しいテーブルに接続され、列変数がTableauで「ディメンション」と「メジャー」と呼ばれる項目に自動的に分類されていることがわかります。ディメンションとは単にデータを分類する列のことであり、メジャーとはその列に含まれる定量的な値を指します。
この視覚化では、刺激濃度レベルと観察されたサイトカイン応答濃度の関係をプロットします。次に、サイトカイン濃度の平均値を算出します。濃度レベルの順序が正しくありませんが、これは簡単に並べ替えることができます。
次に、表示を画面にフィットするように切り替え、データの可視化を容易にします。異なる遺伝子型をどのように区別するかを検討したいため、遺伝子型のディメンションをこのカラーセクションにドラッグして配置します。これにより、遺伝子型に基づいた可視化が自動的かつ即座に行われます。
次に、別の表示形式を試してみます。例えば、線グラフを使用することで、捉えたいパターンをより明確に示せる場合があります。もちろん、他にも多くの選択肢があります。
このペア解析を行う生物学者は、まず3M OH OH 2という試薬で刺激した後の、TNF alphaと呼ばれるサイトカインマーカーの一つの産生関係を調査することから始めることを提案しています。そのためには、マーカー次元のTNF alphaと、刺激次元の3M OH OH 2でフィルタリングを行う必要があります。フィルタリングプロセスをより柔軟にするために、マーカー次元と刺激次元の両方で「クイックフィルターを表示」オプションを選択し、それが単一値のリストであることを確認します。
この可視化により、3つの異なるレベルのMO oh two刺激後のTNF alpha産生の差が、ジェノタイプごとに色分けされて明確に示されています。マーカーと刺激フィルター値の他の任意の組み合わせを選択することができ、それに応じて可視化内容が変更されます。Excelと同様に、個別のタブで異なる可視化を作成することが可能です。また、プレゼンテーション用に、複数の解析結果のサマリービューを生成することもできます。
本ケースでは、異なるNF Kappa BのSNP遺伝子型を持つ複数の被験者におけるTNF Alphaの産生を調査しました。このデモンストレーションでは、ペア解析VAアプローチを用いることで、約1分30秒で一連の強力な視覚化を実現しました。同様の視覚化セットをExcelで作成する場合、通常、バイオメディカル研究者は30分を要します。
前述の例は単純な2次元解析でした。VAの真の力は、複数の次元を同時に可視化できる能力にあります。例えば、Tableauでは、キー値の論理結合を通じてデータセット間の解析をサポートしています。
ここでは、同じワークブック内に配置された2つのスプレッドシートを使用します。1つ目のデータセットは前回のデモンストレーション例のもので、もう1つは、同一細胞内での複数サイトカインの産生をフローサイトメトリーと呼ばれる手法で解析したデータセットです。同時に、ポリファンクショナリティ度(PFD)と呼ばれる指標も含まれています。インポート段階で識別しやすくするため、シートに名前を付けてください。
これにより、Tableauで2つのスプレッドシートを接続できるようになります。「複数のテーブル」オプションを選択した後、「新しいテーブルの追加」機能を使用して2つのテーブルを結合できます。この機能では、1つ目のスプレッドシートに2つ目のスプレッドシートを追加し、結合ステートメントを用いて、細胞型、濃度レベル、ステージ、グループ刺激、被験者識別子などの同一のキーに基づいてデータセットを統合します。
次元がスプレッドシート名によって分けられていることに注目してください。これにより、論理的な結合ステートメントの一部ではなかった次元を使用することが可能になります。例えば、ポリ機能性の定義は、複数のサイトカインを産生する細胞の割合です。
例えば、2種類のサイトカインを産生する細胞をPFD 2として、3種類のサイトカインを産生する細胞をPFD 3として定義します。ここで、これらの値を視覚的表示に使用できる単一の指標にまとめるための計算フィールドを1つ作成します。これで、視覚化の構築を開始できます。
まず、サイトカイン濃度を2日以上のPFDに対してプロットし、前回のデモンストレーションと同様に、PFDが2日を超える値の平均値を算出します。また、濃度ラベルを手動で設定し、低い順から高い順に並べ替えます。このグループの一部にしか遺伝子型情報がないため、遺伝子型情報が含まれていないデータ行をフィルタリングして除外する必要があります。
前と同様に、ジェノタイプをカラーラベルに素早くドラッグ&ドロップすることで、各ジェノタイプを区別して表示させることができます。次に、ビューを画面に合わせて切り替え、データをより容易に可視化できるようにします。また、棒グラフの内容を変更することも可能です。
例えば、これを検証した折れ線グラフを見ると、CYT反応とPFP反応が各ジェノタイプ特有のパターンに従ってどのように変化するかがよく分かります。NF kappa b SNPのGGジェノタイプは、他のジェノタイプとは異なる反応パターンを示していることがすぐに分かります。異なる刺激がこのパターンに与える影響を調べることで、さらに詳細に解析することができます。
刺激次元にLPSを加えた後、3つの主要な遺伝子型はすべての濃度で同様のPFDレベルを示しますが、3M MO oh two刺激のみ、GG遺伝子型では刺激の低濃度から高濃度にかけてPFDが急激に上昇することがわかります。この知見により、刺激の種類がPFDに影響を与えるという、今後の実験で検証すべき仮説を立てることが可能になります。最後の2つのデモンストレーションでは、データセット内およびデータセット間における潜在的に意味のあるパターンを検出するための、可視化の迅速な生成について確認しました。
視覚的分析の威力は大規模なデータセットへと迅速に拡張でき、アプリケーションに応じて分析次元をスケールアップさせ、膨大なデータセットにわたる情報を統合することが可能です。例えば、コホート研究で生成される多くのデータサイロにおいて、VAは非常に転用性の高いアプローチであり、カテゴリーデータや数値ベースのデータセットを含む、多種多様な大量のデータが存在するあらゆる領域に適用できる可能性があります。VAアプローチには、主に2つの利点があります。
第一に、柔軟な仮説生成が可能です。ユーザーは得られた知見に基づいて、その場でデータに関する仮説を立て、その仮説を検証するための新しい視覚化を迅速に作成できるため、時間を短縮できます。UVAツールのユーザビリティと効率性は、従来の情報視覚化ツールに対する最大の利点です。
従来の手法を用いてグラフを作成する場合、通常は数営業日かかる作業が、TableauのようなVAプラットフォームを使用すれば2〜3時間で容易に完了します。明らかに、他のアプリケーションプラットフォームも存在し、今後も登場するでしょうし、それぞれに固有のメリットとデメリットがあると考えられます。このタスクにパラ分析を用いてアプローチすることで得られる追加的な利点は、複雑な多次元データの解析におけるVAベースのアプローチの全体的な有用性を明らかに高めています。
完全なトランスクリプトを表示し、数千本の科学動画にアクセス
このビデオでは、大規模な免疫学的データセットを解析する際の課題について論じ、その解決策としてビジュアルアナリティクス(VA)を紹介します。VAの手法は可視化を活用することで、解析者が複雑なデータの中にあるパターンや傾向を特定することを支援します。
ビジュアルアナリティクス(VA)は、複雑で多次元的なデータセットの迅速かつインタラクティブな探索を可能にすることで、免疫学的データのオーバーロードという増大する課題に対処します。このアプローチは、仮説の生成と検証を加速させ、初期探索ワークフローにおける知見を得るまでの時間を短縮します。ドメイン専門知識とVAツールの習熟度を統合することで、バイオ製薬チームはターゲット検証の信頼性を向上させ、より予測価値の高いリードを優先順位付けすることが可能になります。
VA法は、初期のターゲットバリデーションからリード化合物の同定に至る創薬の連続的なプロセスに統合されており、仮説立案に活用可能で視覚的に解釈可能なデータセットを生成することで、前臨床評価への円滑な移行を可能にします。