23 ביוני 2012
רצפי DNA ונקווה היא אסטרטגיה מהיר וחסכוני לזהות גרסאות נדירים הקשורים פנוטיפים מורכבים של קבוצות גדולות. כאן אנו מתארים את ניתוח חישובי של רצפי נקווה הדור הבא, של 32 גנים הקשורים בסרטן באמצעות חבילת תוכנה ספלינטר. שיטה זו היא מדרגית, והיא חלה על כל הפנוטיפ של עניין.
המטרה הכללית של פרוצדורה זו היא לזהות גנים בתוך אוכלוסייה של פרטים המראים שכיחות גבוהה של וריאציות תפקודיות נדירות. דבר זה מושג תחילה על ידי איחוד (pooling) של אוכלוסיית דגימות DNA. השלב השני הוא יצירה וריצוף של ספריית ריצוף מהדור הבא (next generation sequencing library).
לאחר מכן מבוצעת הצמדה של הקריאות (reads) לרצף הייחוס ויצירה של מודל שגיאות. השלב הסופי הוא ניתוח חישובי באמצעות אלגוריתם splinter. בסופו של דבר, ניתוח splinter של רצף דור הבא (Next generation sequencing) ממאגרים מאוחדים (pooled) משמש להצגת גנים בתוך אוכלוסיות הנושאים שכיחות גבוהה של וריאנס פונקציונלי נדיר. הדגמת הפרוצדורה.
היום נלווה את פרנצ'סקו וילניה (Francesco Vilania), סטודנט לתואר מתקדם במעבדתו של המנטור שלי ושל השותף שלנו למחקר, רוב מיטרה (Rob Mitra), ויצטרף אליו אנריקה רמוס (Enrique Ramos), סטודנט לתואר מתקדם במעבדה שלי. היתרון המרכזי של טכניקה זו על פני שיטות קיימות, כגון טיפוס גנטי (genotyping) של פרטים בודדים, הוא שהיא מאפשרת לזהות בדיוק רב וריאנטים נדירים של רצפים באוכלוסייה מעורבת של מולקולות DNA ללא צורך במידע מוקדם. שיטה זו יכולה לסייע במתן מענה לשאלות מפתח בתחומי הגנטיקה והגנומיקה, כגון קביעת השכיחות של וריאנטים נדירים חדשים הגורמים למחלות במחקרי קוהורט רחבי היקף.
כל ניסוי splinter דורש נוכחות של ביקורת שלילית וחיובית כדי להשיג דיוק אופטימלי; הכינו את תערובת התגובה של ה-PCR באמצעות PFU ultra high fidelity DNA polymerase. הביקורת השלילית היא תוצר PCR מכל רצף DNA הידוע כנטול וריאציה גנטית, כגון שלד של וקטור משובט (cloned vector backbone).
כאן נעשה שימוש באמפליקון של 1,934 base pair מהווקטור M 13 MP 18. הביקורת החיובית יכולה להיות כל סט של וריאנטים של רצפים שתוקפו בעבר והוא קיים באוכלוסייה כולה. אם נתונים אלו אינם זמינים, מעבדה זו תכננה ביקורת חיובית מלאכותית המורכבת מתוצר PCR של 331 base per מתערובת של רצפים מהונדסים ששובטו לתוך הווקטור PGMT easy כפי שמופיע בטבלה זו.
רצפים אלה משולבים כדי לדמות תדריות שונות של אללים מיעוטים (minor allele frequencies) של וריאנטים אמיתיים בתוך מאגר המטופלים. לאחר הגברת הדגימות ב-PCR כפי שדון בפרוטוקול הכתוב המצורף לסרטון זה, נקו כל תוצר PCR מעודפי פריימרים באמצעות טיהור בטורים מהירים של kyogen kayak, או באמצעות פלטות סינון של 96 בארות עם סעפת ואקום לצורך ניקוי בקנה מידה גדול. לאחר הטיהור, כמתו כל תוצר PCR באמצעות טכניקות סטנדרטיות.
הכינו את כל תוצרי ה-PCR והביקורות לאיחוד בבריכה (pool) המנורמלת לפי מספר מולקולות. איחוד לפי ריכוז יוביל לייצוג יתר של אמפליקונים קטנים לעומת תוצרים גדולים יותר. במקום זאת, אחו את מספר מולקולות מנורמל לכל אמפליקון.
בחרו מספרים שרירותיים הגדולים מספיק כדי לשמור על הדיוק במהלך הפפיטה. הוציאו את תוצרי ה-PCR ואת הביקורות. ליגציה של תוצרי ה-PCR היא נחוצה מכיוון שפרגמנטציה של תוצרי PCR קטנים תגרום ככל הנראה להטיה של הייצוג לעבר הקצוות שלהם.
מסיבה זו, אנו מקשרים את תוצרי ה-PCR של ה-pull לתוך וקטור גדול לפני הפירמנטציה שלהם. הכינו תערובת לליגציה של קצוות קהים באמצעות T four Ligase, T four PNK, ו-PEG כפי שמופיע בפרוטוקול. דגרו את התגובה ב-22 degrees Celsius למשך 17 שעות.
המשיכו בדגירה בטמפרטורה של 65 °C למשך 20 דקות ושמרו בטמפרטורה של 4 °C. לאחר מכן, בדקו את האיגור (ligation) על ידי העמסת 50 ng של דגימה על ג'ל אגרוז. איגור מוצלח יביא להופעת פס בעל משקל מולקולרי גבוה בנתיב.
הכינו את הדגימות לפרגמנטציה של ה-DNA באמצעות אסטרטגיית סוניקציה אקראית על ידי דילול הדגימה ביחס של 10 ל-1 ב-Qiagen PB Buffer כדי להפחית את הצמיגות. לאחר מכן, בצעו פרגמנטציה למקבצי ה-PCR הגדולים באמצעות Diagenode Bioruptor בעל 24 דגימות; בצעו סוניקציה בעוצמה גבוהה לאורך 25 דקות, עם מחזורים של 40 שניות פעולה ו-20 שניות מנוחה בכל דקה. בדקו את תוצאות פרגמנטציית ה-DNA על ג'ל agarose והמשיכו לריצוף Illumina כפי שמתואר בטקסט.
כדי להתחיל בריצוף, בצעו יישור קריאות (read alignment). המירו את קבצי קריאות הריצוף הגולמיים לפורמט scarf, או דחסו אותם. הדחיסה היא רשות.
פעולה זו חוסכת זמן ומקום לשלבי הניתוח הבאים מבלי לאבד מידע רלוונטי. באמצעות כלי היישור המצורף, יישרו את הקריאות הגולמיות (raw reads) לרצף הייחוס המבויים והמהיר יותר. עבור האזורים הממוקדים, כללו את תגובות ה-PCR וכן את הביקורות החיוביות והשליליות.
פורמט הקלט חייב להיות בפורמט scarf או דחוס. לאחר מכן, בצע תיוג קבצים כפי שמתואר בטקסט. כל הרצה מייצרת פרופיל ייחודי של שגיאות ריצוף שיש לאפיין לצורך קריאת וריאנטים מדויקת, כדי למדל את השגיאות עבור כל הרצה.
בכל ספריית דגימה ממאגר נכלל ביקורת פנימית הידועה בשל שינויי רצף. צור קובץ מודל שגיאות באמצעות הכלי המצורף עם רצף הייחוס של הביקורת השלילית; ניתן להשתמש בכל רצף הביקורת השלילית, או לחלופין רק בתת-קבוצה המוגדרת על ידי הקצוות שלה ב-5' וב-3'. יש להחיל תמיד קריאות ייחודיות וספירות דמה (pseudo counts).
הכלי יפיק שלושה קבצים ששמם יהיה זהה לפרמטר שם קובץ הפלט, כאשר הם יסתיימו בספרות אפס, אחת או שתיים. קבצים אלו מקבילים למודל שגיאה מסדר אפס, ראשון ושני, בהתאמה, עבור זיהוי וריאנטים (variant calling) באמצעות splinter. יש להשתמש תמיד במודל השגיאה מסדר שני לצורך ויזואליזציה של פרופיל שיעור השגיאה בריצה.
ניתן להשתמש בסקריפט ה-Pearl ששימש לשרטוט גרף מודל השגיאות כדי להפיק גרף שגיאות בפורמט PDF מקובץ מודל השגיאות מסדר אפס. קובץ הגרף יחשוף מגמות שגיאות ספציפיות להרצה, וניתן להשתמש בו כדי להסיק את המספר המקסימלי של בסיסי קריאה (read bases) עבור האנליזה. הסעיף הבא ידגים כיצד להריץ את splinter על הקובץ המיושר (aligned file) באמצעות מודל השגיאות כדי לזהות וריאנטים נדירים של רצפים.
השלב הראשון בניתוח הוא הרצת splinter על הקובץ המיושר באמצעות רצף הייחוס ומודל השגיאות. ניתן להחריג בסיסים של קריאות בודדות מהניתוח אם נמצאו פגומים. סף ה-P-value קובע עד כמה מחמירה תהיה אנליזת זיהוי הווריאנטים (variant calling).
סף מינימלי של 1.301- מהווה נקודת התחלה טובה. אפשרות גודל המאגר (pool size) מייעלת את יכולת הבחנה בין אות לרעש של האלגוריתם על ידי ביטול שונות פוטנציאלית עם תדרי אלל מינוריים הנמוכים מאלו של אלל בודד במאגר בפועל. יש להגדיר את אפשרות גודל המאגר לערך הקרוב ביותר שגדול ממספר האללים בפועל שנותחו בניסוי.
שונות שזוהתה בתדרים נמוכים יותר תיחשב כרעש ותוזנח. לאחר הזנת כל הפרמטרים ושמות הקבצים, הפעל את splinter. קובץ זה מחזיר את כל הפגיעות (hits) בעלות מובהקות סטטיסטית במדגם, יחד עם תיאור של מיקום הווריאנט וסוג הווריאנט.
ערך ה-P-value לתדירות גדיל ה-DNA של הווריאנט וכיסוי כולל לכל גדיל DNA. קובץ הרשימה משמש את splinter לנורמליזציה של הכיסוי לאורך הדגימה. השדה הראשון מציין את האמפליקון הרלוונטי, בעוד שהשדה השני מציין את המיקום שבו נמצאה המוטציה.
N מציינת ששאר הרצף אינו מכיל מוטציה כלשהי. כחלק מהנורמליזציה, ניתוח הביקורת החיובית הוא מרכיב מפתח למקסום הרגישות והספציפיות עבור ריצה מסוימת. דבר זה חשוב מכיוון שסביר להניח שערך הסף הראשוני של 1.301- לא יספיק כדי לסלק את כל התוצאות החיוביות השגויות.
כל ניתוח של splinter יציג את ערך ה-P הממשי עבור כל וריאנט שזוהה, שערך זה לא ניתן לחיזוי מראש. עם זאת, ניתן לחזור על הניתוח כולו באמצעות שימוש בערך ה-P הפחות מחמיר שמוצג בפלט הראשוני עבור מיקומי הבסיס החיוביים האמיתיים הידועים. פעולה זו תשמש לשימור כל החיוביים האמיתיים תוך הדרת רוב החיוביים הכוזבים, אם לא כולם, אשר בדרך כלל הם בעלי ערכי P פחות סיגניפיקנטיים בהשוואה לחיוביים האמיתיים.
כדי לאוטומט תהליך זה, ניתן להשתמש בסקריפט ה-cutoff tester. סקריפט ה-cutoff tester דורש קובץ פלט של splinter ורשימה של פגיעות בקרת חיוביות (positive control hits) בפורמט של קובץ המופרד בטאבים, בדומה לזה ששימש לנורמליזציה. הפלט שיתקבל יהיה רשימה של ערכי סף (cutoffs) המגיעים באופן הדרגתי לערך האופטימלי.
השורה האחרונה מייצגת את ערך הסף (cutoff) האופטימלי ביותר עבור ההרצה, ולכן ניתן להשתמש בה לצורך ניתוח הנתונים. התוצאה האופטימלית היא השגת רגישות וסגוליות של אחת. עם זאת, במידה ולא הושגו ערכים אלו, ניתן למטב את ניתוח ה-splinter על ידי שינוי מספר בסיסי הקריאה (read bases) המגולמים.
ניתן להחיל את סף הסינון הסופי על הנתונים באמצעות סקריפט cutoff cut, שיסנן מקובץ הפלט של splinter פגיעות (hits) הנמוכות מסף הסינון האופטימלי. שלב זה יפיק את קובץ הפלט הסופי של splinter, שיכיל snips ו-indels שנמצאו בדגימה. שימו לב כי הפלט עבור insertions שונה מעט מהפלט עבור substitutions או deletions.
בסוג זה של גרף מוצגת הדיוק כפונקציה של הכיסוי עבור אלל בודד במדגם מאוחד. הדיוק מוערך כשטח תחת העקומה (AUC) של עקומת ROC, והוא נע בין דיוק מקרי של 0.5 לדיוק מושלם של 1.0. בדוגמה זו, ה-AUC מוצג כפונקציה של הכיסוי לאלל עבור זיהוי אללים מוטנטיים בודדים במאגרי אללים של 200, 500 ו-1,000.
כאן מוצג UC כפונקציה של הסה"כ עבור הכנסות, מחיקות והחלפות. גרף שגיאות זה מראה את ההסתברות לשילוב בסיס שגוי במיקום נתון. פרופיל השגיאות מראה שיעורי שגיאה נמוכים עם מגמה עולה לעבר הקצה שלושה פריים של קריאת הריצוף.
ניכר כי נוקלאוטידי ייחוס שונים מציגים הסתברויות שגיאה שונות. תרשים זה חושף את הדיוק של splinter בהערכת תדירות אללים עבור מיקומים שהיו בעלי כיסוי של יותר מ-25 פיים לאלל. השוואה בין תדירויות אללים של DNA מאוחד שהוערכו על ידי splinter לבין ספירות אללים שנמדדו על ידי מחקרי אסוציאציה גנומיים רחבים או תוצאות GWAS.
במתאם גבוה מאוד, נדגמה אוכלוסייה של 974 פרטים אשר סומנה לריצוף לאורך 20 kilobases. נעשה שימוש ב-Splinter לזיהוי וריאנטים נדירים. בהתאם לפרוטוקול הסטנדרטי, לכל פרט בוצע בעבר טיפוס גנטי (genotyping) לבדיקת התאמה ב-gwas בין טיפוס גנטי של וריאנטים מסומנים לבין וריאנטים חדשים.
הזיהוי של הווריאנטים בדגימה המאוחדת היה מצוין. שלושה וריאנטים, שניים מהם נדירים באוכלוסייה, זוהו כ-denovo מתוצאות הריצוף, ואומתו באמצעות pyro sequencing אינדיבידואלי; תדרי האליל המיעוט או ההלימה המתמטית בין ה-pyro sequencing לריצוף המאוחד היו מצוינים. לאחר שסיימתם למצוא את הווריאנט הנדיר בדגימה המאוחדת שלכם, רבים מעוניינים לדעת מהן ההשלכות התפקודיות של הווריאנט שזוהה.
על כן, שלב האנוטציה של הווריאנס שלכם הופך לשלב הבא בתהליך לאחר הפיתוח. טכניקה זו סללה את הדרך עבור חוקרים בתחום ריצוף ה-DNA ללמוד וריאנטים נדירים באופן מהיר וחסכוני, כדי לאפיין וריאנטים נדירים במחקרי אוכלוסיות גדולים. לאחר צפייה בסרטון זה, תגיעו להבנה טובה לגבי האופן שבו ניתן לזהות וריאנטים נדירים של רצפים בדגימת DNA מאובסס (pool) באמצעות splinter.
ריצוף DNA ממאגרים מאוחדים (Pooled DNA sequencing) הוא שיטה יעילה לזיהוי וריאנטים גנטיים נדירים הקשורים לתכונות מורכבות באוכלוסיות גדולות. מאמר זה מפרט את הניתוח החישובי של נתוני ריצוף מאוחדים מ-32 גנים הקשורים לסרטן באמצעות חבילת התוכנה SPLINTER.
זיהוי וריאנטים גנומיים נדירים באוכלוסיות גדולות הוא קריטי לאישוש מטרות במחקר של מחלות מורכבות, שבהן וריאנטים נפוצים אינם מצליחים להסביר את השונות הפנוטיפית. גישת הריצוף המאוחד (pooled sequencing) המאפשרת SPLINTER מספקת שיטה חסכונית וניתנת להרחבה לבחינת היפותזות טיפוליות על ידי זיהוי וריאנטים פונקציונליים בתדירות נמוכה ללא ידע מוקדם על הווריאנטים. דבר זה תומך בהפחתת סיכונים בשלב הגילוי המוקדם על ידי מתן אפשרות להערכת תדירות אללים ואישור וריאנטים בחברות (cohorts) הרלוונטיות למחלה, ובכך מספק מידע ישיר לתעדוף פורטפוליו ולמעקב מכניסטי.
השיטה משתלבת ברצף הגילוי, החל מיצירת השערות ועד לזיהוי מובילים (leads), ומספקת תוצרי זיהוי וריאנטים המכוונים את בחירת המטרה ואת המוכנות לבדיקה.