2017年4月8日
ギャラクシーとDAVIDバイオインフォマティクストレーニングなしの研究者が分析し、RNA-配列データを解釈できるようにする一般的なツールとして浮上しています。私たちは、 線虫の研究者は、アクセスをRNA-配列実験を行い、銀河を使用してデータセットを処理し、DAVIDを用いた遺伝子リストから意味のある生体情報を取得するためのプロトコルを記述します。
このプロトコルの全体的な目標は、バイオインフォマティクスの専門知識を持たないC.elegansの研究者が、オープンアクセスプラットフォームであるGalaxyを使用してRNAシーケンシング実験を行い、データを分析できるようにすることです。この方法は、複雑なハイスループットシーケンシングデータを解析し、C.elegansの表現型の背後にあるトランスクリプトームシグネチャーに関する洞察を提供するのに役立ちます。この手法の主な利点は、バイオインフォマティクスのトレーニングを受けていない科学者が生のシーケンシングデータを分析し、差次的に発現する遺伝子のリストとそれに関連する遺伝子オントロジー用語を作成できることです。
この方法は、特にC.elegansシーケンシングデータのニュアンスを対象としていますが、ゲノムの主要な転写変化を調べる必要がある他の生物や生物学的状況にも適用できます。このビデオでは、Galaxy パイプラインの Web ベースの使用法を扱っています。可能であれば、ワークフローをローカルで実行します。
Wikiページの指示に従ってGalaxyをダウンロードしてインストールします。Galaxyのホームページにあるstart hereチュートリアルを利用した後、このビデオに従ってください。ユーザーは、Galaxyユーザーインターフェイスとワークフローで使用されるツールに慣れ、向きを整えることが重要です。
まず、ヘッダーパネルの「データの分析」をクリックして、分析ホームビューにアクセスします。右上のプログレスバーは、ディスクスペースの使用量を監視します。次に、左パネルのツールメニューにアクセスし、NGS RNA解析をクリックします。
これにより、RNA配列データの解析に必要なすべてのツールを使用するオプションが提供されます。次に、新しい分析履歴を開始します。右側の履歴パネルに移動します。
歯車のアイコンをクリックし、ポップアップメニューから[新規作成]オプションを選択します。次に、分析を識別するために履歴の下に名前を指定します。続行するには、ツールメニューに移動し、[データの取得]で[ファイルのアップロード]機能をクリックして、生の高速キューファイルをアップロードします。
解析インターフェースでタスクが開いたら、[ローカルファイルの選択]をクリックするか、[FTPファイル]をクリックして適切なシーケンスデータに移動し、選択します。デフォルトでは、Galaxyはファイルタイプを自動的に検出します。次に、プルダウンメニューから生物(この場合はC.elegans)を選択します。
次に、[開始]をクリックしてデータのアップロードを開始します。ファイルがアップロードされると、アクションは履歴パネルに保存され、そこからデータを選択してアクセスできます。次に、NGS QCおよび操作メニューにアクセスし、ファストキューグルーマーを選択し、グルーミングするファイルの下のファイルを選択して、ファイルを一度に1つずつ高速キュー形式から高速キューサンガー形式に変換します。
適切な入力の高速等価スコア タイプを選択し、デフォルトのパラメーターを使用してツールを実行します。これで、データファイルを分析できます。プロトコル全体で使用されるファイル形式とテストパラメータには特に注意してください。
この知識は、失敗したテストやその他の問題のトラブルシューティングに役立ちます。先に進む前に、品質管理テストを使用することができます。それらの実行の詳細については、テキストプロトコルで提供されています。
ファイルを解析する準備ができたら、まずNGS RNA解析セクションを開き、次にトップハットツールをクリックして、シーケンシングデータをマッピングします。ドロップダウンメニューから、「このシングルエンドデータかペアエンドデータか」という質問に対する回答を入力します。次に、適切な高速キュー ファイルを選択します。
次のドロップダウンメニューで[組み込みゲノムを使用]を選択し、参照C.elegansゲノムデータを選択します。他のすべてのパラメータオプションに対して「デフォルト」を選択し、「実行」をクリックします。データセット内の転写産物の相対的な存在量を推定するには、NGS RNA解析セクションのカフリンクスツールを選択し、最初のドロップダウンメニューから、トップハット解析から取得したマッピングされた受け入れられたhits bam形式のファイルを選択します。
2 番目のドロップダウンメニューから、現在のゲノムデータを含む GTF ファイルに参照アノテーションを設定します。[バイアス補正の実行] オプションが表示されたら、[はい] を選択し、既定の設定を使用してタスクを実行します。次に、NGS RNA解析メニューからカフマージツールを開き、すべてのRNA配列サンプルで生成されたアセンブルされた転写産物をマージします。
ツールの最初のボックスには、前のステップでカフスボタンを使用して生成されたすべてのGTFファイルがロードされます。次に、同じ菌株条件の生物学的複製を含む、試験した各菌株または条件について、アセンブルされた転写産物ファイルを選択します。ユーザー参照アノテーションには「はい」を選択し、参照ゲノムデータファイルを選択します。
次に、シーケンスデータの使用オプションで はい を選択します。これにより、適切な参照ゲノムが自動的に検出され、選択されます。他のすべてのパラメータはデフォルト設定のままにして、[実行]をクリックします。
1 つの GTF ファイルが生成されます。複数の菌株または条件を比較するには、NGS RNA解析セクションに戻り、cuff divツールを選択します。次に、cuff div ツールのトランスクリプト メニューから、cuff merge からマージされた出力ファイルを選択します。
次に、2 つの条件のラベルを入力します。各条件について、replicate に移動し、その条件の異なる生物学的反復に対応する top hat からの個々の受け入れられたヒット出力ファイルを選択します。複数のファイルを同時に選択するには、コマンドキーまたはコントロールキーを押したままにします。
ファイルを選択したら、デフォルトのパラメータ設定を使用し、[実行]をクリックしてタスクを実行します。ヒストリーパネルに生成された遺伝子鑑別検査ボックスの保存アイコンをクリックして、差次発現データをダウンロードします。まず、WebサイトからDavidにアクセスします。
Web ページのヘッダーから [分析の開始] を選択します。Galaxyから取得した遺伝子のリストをボックスAにコピーし、この例では遺伝子識別子をworm base gene IDとして選択し、質問3のリストタイプでgene listを選択し、リストの送信アイコンをクリックします。これで、分析ウィザードのホームページが開き、そこからDavidタスクを選択できます。
このビデオ セグメントでは、これらのオプションの一部について説明します。まず、機能アノテーションクラスタリングを選択して、サマリーページに移動します。アノテーションカテゴリはデフォルト設定のままにして、機能アノテーションクラスタリングをクリックします。
このオプションは、エンリッチメント スコアによってランク付けされた類似の注釈用語のクラスターを生成します。ここで、解析ウィザードに戻り、機能アノテーションチャートオプションを選択して、遺伝子リストに関連付けられた大幅に過大評価された生物学的用語を特定します。Davidの貴重な機能は、機能的な注釈テーブルを作成するオプションです。
これは、統計計算を表示せずに、遺伝子に関連付けられているすべてのアノテーションをリストします。これは、遺伝子ごとの解析や、目的の特定の遺伝子を見つけるのに役立ちます。レビューに便利な別のDavidツールは、遺伝子の機能分類です。
このオプションは、遺伝子を機能的に関連するグループのリストに分離し、その濃縮スコアによってランク付けします。記載されたプロトコールを使用して、生殖細胞系の喪失後にtcer-1によって発現が調節される遺伝子を同定した。長命の生殖細胞系リストglp-1変異体のトランスクリプトームを、生殖細胞系リストに掲載されているが寿命延長を示さないtcer-1 glp-1二重変異体と比較しました。
配列の品質チェックでは、低品質の読み取りはなく、GC含有量は48〜49%で、配列の読み取り長は51塩基対が一定でした。サンプルのゲノムカバレッジは、7倍から11倍の間と推定されました。Galaxyは、各系統の2つの反復からのNGSデータの組み合わせを可能にし、示差解析を実行して、ゲノムワイドな発現プロファイルを強調する遺伝子リストを生成しました。
全体として、835個の遺伝子が2つの系統間で差次的に発現し、P値が0.05にカットオフされました。アップレギュレーションされた遺伝子の機能的アノテーション解析により、エンリッチメントスコアの高い4つのアノテーションクラスターが明らかになりました。最も高かったのは、シトクロムP450と生体異物応答遺伝子を含み、次いで脂質修飾に関与する遺伝子でした。
ダウンレギュレーションされたターゲットの機能的アノテーションクラスタリングも、さまざまなアノテーションクラスターを特定しました。これらには、細胞骨格機能、成長の正の調節、生殖、および老化に富んだクラスターが含まれていました。Galaxyパイプラインは、幅広い生物学分野の研究者が大規模な遺伝子発現変化を迅速かつ効率的に解析するための道を開きました。
このビデオを見た後、RNAシーク実験を行い、Galaxyパイプラインを使用して生のハイスループットシーケンシングデータを分析できるようになるはずです。また、Davidプラットフォームを使用して、Galaxyデータから生物学的に関連性のある情報を抽出できる必要があります。
完全なトランスクリプトを表示し、数千本の科学動画にアクセス
このプロトコルは、C.elegans研究者がRNAシーケンシング実験を実施し、Galaxyプラットフォームを用いてデータを解析することを支援します。これにより、バイオインフォマティクスのトレーニングを受けていない研究者でも、複雑なシーケンシングデータを効果的に解釈することが可能になります。
Galaxyのような利用しやすいトランスクリプトーム解析プラットフォームにより、研究チームは高度なバイオインフォマティクスの専門知識を必要とせずに遺伝子発現の変化を解析することができ、初期段階のターゲットバリデーションやメカニズムのリスク低減を加速させることが可能です。RNA-Seqデータの処理と機能アノテーションを効率化することで、このワークフローはC. elegansなどのモデルシステムにおける迅速な仮説検証とポートフォリオの優先順位付けを支援します。このアプローチは、小規模なトランスクリプトーム研究を行う初心者から経験豊富なR&Dチームまで、再現性と拡張性を向上させます。
このワークフローは、生データから発現変動解析および機能アノテーションに至るRNA-Seq解析を、初期探索から前臨床までの連続的なプロセスの中に位置づけ、ターゲットの検証とメカニズム研究の両方を支援します。