21 באוגוסט 2026
פרוטוקול זה מציג זרימת עבודה הניתנת לשחזור לניתוח נתוני טרנסקריפטומיקה מרחבית (spatial transcriptomics), ומנחה את המשתמשים החל מרכישת נתונים ציבוריים ובקרת איכות מבוססת Seurat, דרך אינטגרציה, זיהוי מאפיינים מרחביים, דה-קונבולוציה של סוגי תאים, אנוטציה של אזורי עניין (ROI) וניתוח תקשורת בין-תאית, כולל נקודות ביקורת מעשיות התומכות בביצוע שקוף.
שלום לכולם. בסרטון זה, נסקור את שלבי העבודה של תהליך ניתוח נתונים מעשי של טרנסקריפטומיקה מרחבית, החל מרכישת הנתונים וטעינתם, דרך סקירה בסיסית, ועד לניתוח מתקדם. באופן כללי, זרימת העבודה מורכבת משלושה שלבים עיקריים.
ראשית, הורדת הנתונים, שנית, השגת קוד הניתוח, ושלישית, הרצת צינור העיבוד (pipeline) להפקת התוצאות. שלב ראשון: רכישת נתונים והכנת מבנה הספריות. ראשית, השג מערכי נתונים ציבוריים של טרנסקריפטומיקה מרחבית.
הורידו את ארכיון הנתונים הגולמיים. חלצו את הארכיון. ארגנו את הקבצים במבנה ספריות סטנדרטי.
ראשית, צרו ספריית נתונים ראשית, ולאחר מכן צרו תת-ספרייה ייעודית עבור כל דגימה. העבירו את הקבצים החיוניים הבאים עבור כל דגימה לתת-ספרייה המתאימה. לאחר מכן, צרו תת-תיקייה מרחבית (spatial) בתוך ספריית כל דגימה.
העבירו את הקבצים הבאים לתת-תיקיית ה-spatial. העבירו את קובץ ה-S1 של מדדי ה-PC של ה-filtered feature לספריית המשנה הראשית של הדגימה. דחסו מחדש (Decompress) את קבצי ה-gzip בתיקיית ה-spatial.
ודאו ששמות הקבצים המקוריים נשארים בדיוק כפי שנדרש על ידי פונקציית load 10X spatial. שלב שני, הגדרת סביבת התוכנה. כאן נדלג על התקנת שפת R והדגמה של התהליך תתחיל מהשגת סקריפט הניתוח במאגר ה-GitHub.
התקינו את חבילות ה-R הנדרשות מ-Graham בקובץ conductor על ידי הרצת הסקריפט setup R. התקינו את auto suit על ידי הרצת פקודות ההתקנה המופיעות בגיליון המסמכים הרשמי. עברו לכתובת ה-URL הרשמית של ההתקנה כדי להוריד את סקריפטי ההגדרה. אתחלו את סביבת ה-Python הנדרשת ואת תלויות המערכת בהתאם להוראות בעמוד ההגדרה.
השיגו את הכלי המותאם אישית על ידי ניווט למאגר ה-GitHub והורדת קוד המקור. נווטו לספריית ה-TOS והתקינו את תלויות ה-Python. שלב שלושה, טעינת נתונים מרחביים ובקרת איכות.
טען את הנתונים המרחביים לתוך אובייקט Seurat. השתמש ב-read 10X image כדי לטעון ידנית את תמונת הרקמה ברזולוציה גבוהה, תוך הגדרת נתיב התמונה ושם התמונה.
השתמש ב-load 10X spatial עם פרמטר image המוגדר לאובייקט התמונה שנוצר בשלב הקודם, וצור את אובייקט ה-Seurat. חשב מדדי בקרת איכות. חשב את אחוז הקריאות המיטוכונדריאליות באמצעות percentage feature עם התבנית mt.
בצעו ויזואליזציה ופרשנו את הנתונים בהתבסס על מדדי QC. צרו תרשימי כינור (violin plots) עבור nCount_Spatial, nFeature_Spatial ו-percent.mt באמצעות פונקציית violin plot.
צרו תרשימי מאפיינים מרחביים של מדדים אלו באמצעות תרשימי מאפיינים מרחביים. זהה נקודות שנמצאות מחוץ לאזור הרקמה. באופן רשות, ניתן להחיל מסננים כדי להסיר נקודות באיכות נמוכה.
לאחר הרצת הסקריפט, תוכלו לקבל תוצאות אלו, כולל מדדי QC וסכימה מרחבית של המאפיינים. שלב ארבעה, עיבוד מקדים של הנתונים, אינטגרציה ואשכול (clustering). בצעו נורמליזציה בעיבוד המקדים של דגימות בודדות.
בצע נרמול מסוג SC transform לכל דגימה בנפרד עם assay Spatial. שלב מספר דגימות. הכן את רשימת האובייקטים שעברו נרמול SCTransform לצורך השילוב.
ודאו שלכל אובייקט יש בדיקת RNA על ידי העתקת הבדיקה המרחבית (spatial assay). השתמשו בתכונות שילוב נבחרות (select integration features) בשילוב ה-PREP SCT כדי לזהות תכונות משתנות משותפות. מצאו את עגני השילוב באמצעות find integration anchors עם שיטת נורמליזציה מסוג SCT.
בצע אינטגרציה לנתונים באמצעות IntegrateData. בצע הפחתת ממדים (dimensionality reduction) לצורך מקבץ (clustering) על המבחן (assay) המשולב. הרץ PCA על הנתונים המשולבים באמצעות runPCA.
קבע את המספר האופטימלי של רכיבי העיקר (principal components) עבור הניתוח הבא על ידי חישוב השונות המצטברת המוסברת. זהה את נקודת המרפק (elbow point) באופן תוכנתי. הרץ UMap באמצעות מספר ה-PCs שנקבע.
בצעו אשכול (Cluster) של התאים באמצעות FindNeighbors ו-FindClusters. הגדירו את ה-PCs שנקבעו עם רזולוציה (resolution) של 0.5. בצעו ניתוח ביטוי דיפרנציאלי בין קבוצות המטרה באמצעות פונקציית FindWorkers.
זהו את הגנים בעלי השונות המרחבית. עבור כל דגימה מקורית, הרץ את הפקודה find spatially variable features באמצעות שיטת Moran's I על ה-SCT assay כדי לחשב אוטוקורלציה מרחבית. לאחר הרצת סקריפט זה, תוכל לקבל את תרשים המרפק (elbow plot), תרשים UMap, תרשים אשכולות (cluster plot), מפת חום של סממני אשכולות, תרשים געש (volcano plot), גנים עם ביטוי דיפרנציאלי של מאפיינים מרחביים, גנים אמינים מרחבית וסממני שכבות המעי הגס.
וסימני השכבה של המעי הגס בגרף נקודות (dot plot), יחד עם הסימנים בגרף המאפיינים המרחביים (spatial feature plot). שלב חמש, עיבוד מקדים של נתוני ייחוס של תא בודד. קראו את מטריצת הספירה של single-cell RNA-seq באמצעות read 10X, וצרו אובייקט Seurat.
בצע נורמליזציה סטנדרטית של בקרת איכות (QC) וביטול צבירה (declustering). חשב את אחוז הקריאות המיטוכונדריאליות בתאי הסינון. נרמל את הנתונים באמצעות SC transform.
הגדירו משתנה ב-vara.to, בצעו רגרסיה ל-percent.mt, בצעו PCA, UMap וקיבצו את התאים באמצעות שיטת בחירת ה-PC הדינמית שתוארה בשלבים הקודמים, ולאחר מכן בצעו אנוטציה לסוגי התאים.
חשבו ציוני מודולים עבור גנים מסמנים של סוגי תאים קנוניים באמצעות AddModuleScore. בצעו אנוטציה לצבירים (clusters) בהתבסס על ציוני המודולים ועל ידע ביולוגי מוכר. לחלופין, ניתן לייבא אנוטציות שחושבו מראש מתוך המטא-דאטה.
לאחר למידת סקריפט זה, תוכלו לקבל את מדדי ה-QC. הם העלו את ה-UMap לפי קלאסטר, Umap לפי דגימה וציוני סוג תא. שלב שש, דה-קונוולוציה מונחית רפרנס באמצעות SPOTlight.
ראשית, הכינו את הנתונים עבור SPOTlight. המירו את אובייקט ה-Seurat של התאים הבודדים המאונוטציה ואת אובייקט ה-Seurat המרחבי לאובייקט של single-cell experiment. בצעו נורמליזציה לוגריתמית לנתוני התאים הבודדים באמצעות LogMoreCounts.
לאחר מכן, הרץ דקונבולוציה באמצעות SPOTlight. ראשית, זהה גנים בעלי שונות גבוהה בנתוני התא הבודד באמצעות ModelGeneVar. חשב סממנים לסוגי התאים באמצעות score markers וסנן כדי להישאר עם סממנים באיכות גבוהה.
בצעו דגימה מופחתת (Downsample) של רפרנס התאים הבודדים עבור כל סוג תא למספר בר-ניהול כדי להפחית את זמן החישוב. בצעו את הדה-קונבולוציה (deconvolution) באמצעות פונקציית SPOTlight, תוך אספקת רפרנס התאים הבודדים, הנתונים המרחביים, רשימת הסמנים וה-HVGs, ולאחר מכן נוכל להציג ויזואלית ולייצא את התוצאות. ניתן לקבל את תוצאת הדה-קונבולוציה באופן זה, המוצגת כנתיב צינור פיזור (scatter pipe route).
שלב שבע, דקונבולוציה לא מונחית באמצעות Stdeconvolve. ראשית, הכינו את הנתונים המרחביים. חלצו את מדדי ספירת השורות מאובייקט ה-Seurat המרחבי באמצעות GetAssayData עם הסלוט counts.
הסר נקודות וגנים באיכות נמוכה באמצעות ספירות נקיות מ-STdeconvolve. זהה את סוגי התאים החבויים עבור המסננים שבהם ארבעה גנים במינימום חלק מהנקודות ביטוי, באמצעות restrict strict LDA על ידי הגעה למודל הקצאה זה על פני טווח של מספרי נושאים פוטנציאליים באמצעות fitLDA. בחר את המודל האופטימלי על בסיס המורכבות המינימלית באמצעות optimal model עם opt min.
נתחו והציגו את התוצאות באופן ויזואלי. הוציאו את פרופורציית הסרוטיפ, Theta, ואת פרופילי הגנים Beta עבור המודל האופטימלי באמצעות getBetaTheta. כדי להוסיף את הפרשנות הביולוגית של נושאי הקורוזיה, ייבאו הערות של אזורי עניין (ROI) שנוצרו באמצעות כלי בחירת הנקודות המרחביות (select spatial spot tool).
השתמשו באנוטציות אלו כפרמטר של הקבוצה בפונקציית with all topics. מיפו את פרופורציות סוגי התאים שפורקו (deconvolved) בחזרה אל הקואורדינטות המרחביות בפרויקט שלכם, וצבעו את הנקודות (spots) לפי ה-ROI שלהן. לאחר הרצת הסקריפט, תקבלו תוצאה כזו, טעינת צינור של סקאלה (scale's pipe load), בדומה לאלו שמופקים על ידי SPOTlight.
שלב שמונה, תקשורת מרחבית בין תאים באמצעות Giotto. ראשית, המירו את אובייקט ה-Seurat לאובייקט Giotto. השתמשו בפונקציה createGiottoObject, תוך אספקת מדדי ספירה נמוכים (low-count metrics) והקואורדינטות המרחביות.
בצע עיבוד מקדים לאובייקט ה-Giotto והוסף את תוצאות הדה-קונבולוציה. נרמל את הנתונים באמצעות normalized Giotto, והוסף אותם כהערות של סרוטיפ. בחר מטא-נתונים של תאים באמצעות addCellmetadata.
צרו רשת מרחבית באמצעות createSpatialNetwork. טענו מסד נתונים של ליגנדים וקולטנים לסביבת העבודה. הריצו את explore CellCellcom כדי לזהות אינטראקציות משמעותיות בין ליגנדים לקולטנים בין סוגי תאים הנמצאים בקרבה מרחבית.
ניתן לקבל את תרשים הנקודות (dot plot) של התקשורת בין תאים באופן זה. שלב תשע הוא אופציונלי. בחירת נקודות אינטראקטיבית באמצעות SelectSpatialSpot.
הכינו את הנתונים עבור הכלי האינטראקטיבי באמצעות הסקריפט six. חלצו את הקואורדינטות המרחביות מאובייקט ה-Seurat באמצעות GetTissueCoordinates. בצעו עיצוב וייצוא של הנתונים.
ייצא את מסגרת הנתונים המעצבת לקובץ CSV. לאחר מכן, בצע ניתוח של אזור העניין (region of interest). הפעל את הממשק המותאם אישית.
בחרו ביישומים של spatial spots dash וטענו את קובץ ה-CSV. בחרו את הנקודות באופן אינטראקטיבי בהתבסס על המיקום המרחבי. לאחר מכן, ייצאו את רשימת הנקודות שנבחרו ואת הקבוצה שהוקצתה להן, כקובץ CSV חדש.
אנו בודקים כעת מה ניתן להפיק לאחר הרצת הסקריפט one-by-one. כל התוצאות נשמרות בתיקיית results five-fold. וכפי שניתן לראות, אנו יכולים לקבל את מדדי ה-QC והחלוקה.
ניתן לבחון כאן את תרשים מאפייני המרחב. יתרה מכך, תהליך הדה-קונבולוציה (deconvolution) בוצע הן בשיטה מונחית והן בשיטה שאינה מונחית. תוצאות ה-SPOTlight מוצגות כאן.
כפי שניתן לראות, כל הנקודות כוללות את מידע הפרופורציות. כאן מוצגים גם תוצאות הדקונבולוציה הבלתי מודרכת על ידי STdeconvolve. וזוהי תוצאת ה-Seurat clusters של הנקודה בנתוני המרחב.
ניתן להדמיות אותם גם בתרשים צוות מרחבי (spatial team plot), באופן זה. יתרה מכך, ניתן לקבל את תוצאות התקשורת בין נקודות (spot-spot communication) באמצעות Giotto. תהליך עבודה זה כולו הוא בקוד פתוח ב-100%.
ניתוח זיהוי נקודות (Spotting analysis), ממדדי ביטוי ועד למידול מרחבי מתקדם. כל השלבים מורצים על מכונה עם 16GB RAM. בסיס הקוד הוא מודולרי, כאשר קיים סקריפט נפרד לכל משימה.
שימו לב שסבב עיבוד זה אינו כולל עיבוד מקדים מקובצי FASTQ. הדגש הוא על נתונים מרחביים בדו-ממד, וכעת הוא כולל רק את כלי ההורדה של Visium. זה הכל, תודה שצפיתם.
צפו בתמליל המלא וקבלו גישה לאלפי סרטונים מדעיים
מאמר זה מציג זרימת עבודה חישובית מקיפה לניתוח מאגרי נתונים של טרנסקריפטומיקה מרחבית (ST) באמצעות R. הפרוטוקול נותן מענה לאתגרים נפוצים בניתוח ST, כגון ייבוא נתונים, בקרת איכות, אינטגרציה, דקונבולוציה (deconvolution), סטטיסטיקה מרחבית וויזואליזציה, על ידי אספקת גישה יעילה ומבוססת סקריפטים. זרימת העבודה ניתנת להתאמה למאגרי נתונים סטנדרטיים של ST מבוססי מערכים (arrays) ומדגישה שחזוריות ושקיפות של הפרמטרים.
ניתוח נתוני טרנסקריפטומיקה מרחבית הוא קריטי להבנת ארכיטקטורת הרקמה והביולוגיה של המיקרו-סביבה במחקרים של גילוי מוקדם ומחקרים תרגומיים. זרימת עבודה זו מאפשרת לצוותי ביו-פארמה לבצע אינטגרציה, דה-קונבולוציה ופירוש של נתוני ביטוי גנים מרחביים עם הדירות ושקיפות של הפרמטרים. באמצעות סטנדרטיזציה של השלבים החישובים, היא תומכת בתיקוף יעדים חסון ובקבלת החלטות בתיק השקעות המותאמות לסיכון.
תהליכי עבודה אלה מגשרים בין שלבי הגילוי המוקדמים, זיהוי מובילים (lead identification) ומחקר תרגומי, על ידי אספקת תשתית חישובית הניתנת לשחזור עבור ניתוח טרנסקריפטומיקה מרחבית.