מאמר מחקר

קריאות ואיכות של מידע להסברת מטופלים על נוירופתיה של עצב השלישייה שנוצר על ידי מודלי שפה גדולים: מחקר חתך

DOI:

10.3791/70833

21 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כאן אנו מציגים פרוטוקול להערכה שיטתית של קריאות, התאמה חינוכית ואיכות של מידע למטופלים על נוירופתיה של עצב השלישייה (trigeminal neuralgia) שהופק על ידי מודלי שפה גדולים, במטרה לבצע בנצ'מרק למודלים ולהנחות תקשורת מול מטופלים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודלי שפה גדולים (LLMs) משמשים יותר ויותר לחינוך בריאותי של מטופלים, אך הקריאות והאיכות החינוכית של מידע על נוירופתיה של העצב השלישי (trigeminal neuralgia - TN) שהופק על ידי LLMs לא הוערכו באופן מספיק. מחקר השוואתי חתכי זה השווה תוכן חינוכי על TN שהופק על ידי חמישה LLMs הזמינים לציבור (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, ו-GPT-5). עשרים שאלות נפוצות על TN, המכסות ידע בסיסי על המחלה, אטיולוגיה/גורמי סיכון, אבחנה, טיפול ומניעה/שיקום, הוצגו לכל מודל באמצעות הנחיות (prompts) סטנדרטיות. הקריאות הוערכה באמצעות שבעה מדדים מבוססים, ההתאמה החינוכית באמצעות כלי הערכת חומרי חינוך למטופלים להבנה וישימות (PEMAT), ואיכות המידע הכללית באמצעות מדד איכות גלובלי (GQS). שני מומחים קליניים העריכו באופן עצמאי את כל התשובות, כאשר מחלוקות נפתרו על ידי בורר בכיר. ניתוחים סטטיסטיים השוו את ביצועי המודלים, הבדלים תמתיים ומתאמים בין מדדי ההערכה. נצפו הבדלים משמעותיים בין המודלים במדדי הקריאות, ה-PEMAT וה-GQS. GPT-5 ייצר את התשובות המורכבות ביותר מבחינה לשונית, אך השיג את הדירוגים הגבוהים ביותר להתאמה חינוכית ואיכות מידע. לעומת זאת, Wenxin Yiyan הפיק את הטקסט הקריא ביותר, אך באופן כללי קיבל ציונים נמוכים יותר ב-PEMAT וב-GQS. קטגוריית התוכן השפיעה על הקריאות, כאשר נושאי מניעה/שיקום ואטיולוגיה/גורמי סיכון היו קשים יותר לקריאה, בעוד שערכי ה-PEMAT וה-GQS נותרו עקביים יחסית בין התמות השונות. מדדי הקריאות הראו עקביות פנימית חזקה ומתאמים חיוביים חלשים עד בינוניים עם PEMAT ו-GQS, בעוד ש-PEMAT ו-GQS הראו מתאם חיובי בינוני. ממצאים אלו מצביעים על כך שבחירת המודל משפיעה על ההתאמה החינוכית ואיכות המידע הכללית כפי שהוערכו על ידי מומחים, בעוד שמורכבות הנושא משפיעה בעיקר על הקריאות. מאחר שהבנת המטופל, שביעות רצונו, אמון, תוצאות בריאותיות, דיוק עובדתי ובטיחות קלינית לא הוערכו, יש לפרש תוצאות אלה כניתוח השוואתי המבוסס על דירוג מומחים ולא כראיה למוכנות קלינית.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

נוירופתיה של העצב השלישי (Trigeminal neuralgia, TN) היא תסמונת של כאב נוירופתי המאופיינת בפרקוסי רקורסיביים של כאב פנים חד-צדדי, קצר ועז ביותר, המתואר לרוב כדמוי שוק חשמלי או דקירה. על פי הסיווג הבינלאומי של הפרעות כאבי ראש, מהדורה שלישית (ICHD-3), הכאב ממוקם בדרך כלל בהתאמה לפיזור של ענף אחד או יותר של העצב השלישי, עוצמתו לרוב בלתי נסבלת, וניתן לעורר אותו על ידי גירויים תמימים כגון מגע קל, שטיפת פנים, צחצוח שיניים, דיבור או לעיסה. ההתקפים מאופיינים בהתחלה פתאומית ובסיום abrupt, עם משך זמן הנע בין שברירי שניות למספר דקות1,2. למרות ש-TN אינה מסכנת חיים בדרך כלל, הכאב העז והבלתי צפוי משבש באופן משמעותי פעילויות יומיומיות חיוניות, כולל אכילה, דיבור, שינה וויסות רגשי, מה שמוביל לנטל פסיכו-סוציאלי ניכר ולירידה באיכות החיים. ראיות מסקירות סיסטמטיות מצביעות על כך שאנשים הסובלים מ-TN עומדים בפני סיכון מוגבר משמעותית לדיכאון, חרדה והפרעות שינה בהשוואה לאוכלוסייה הכללית3,4. במחקרי קוהורט רחבים, כ-35–55% מהמטופלים עם TN מראים תסמינים משמעותיים מבחינה קלינית של חרדה או דיכאון, וקטסטרופיזציה של הכאב היא שכיחה מאוד, מה שמרמז על אינטראקציה דו-כיוונית בין כאב כרוני עז, נשירה מהשינה (insomnia) והפרעות רגשיות5,6. הערכות אפידמיולוגיות מצביעות על כך שהשכיחות של TN באוכלוסייה הכללית נעה בין כ-0.03% ל-0.3%, עם שכיחות גבוהה יותר בקרב נשים ומבוגרים, ושינויים ניכרים בין אזורים גיאוגרפיים, קבוצות אתניות ושכבות גיל7,8. במדינות מאוכלסות מאוד, כגון סין והודו, הזדקנות מהירה של האוכלוסייה לוותה בעלייה מתמדת במספר האנשים המושפעים מ-TN, ובכך הטילה נטל גדל על מערכות הבריאות והדגישה את הצורך בגישות יעילות יותר, ניתנות להרחבה ומבוססות נתונים להערכה וניהול של המחלה8,9.

ניתן לסווג את TN לתתי-סוגים קלאסיים, משניים ואידיופתיים, כאשר עדויות גוברות מדגימות הבדלים משמעותיים במנגנונים האטיולוגיים ובאסטרטגיות הטיפוליות בין קטגוריות אלו1,10. מחקרים נוכחיים מצביעים על כך ששינויים מבניים הקשורים לקונפליקט נוירו-וסקולרי באזור כניסת שורש העצב הטריגמינלי, היפר-אקסיטביליות של עצבים פריפריים ושינוי בוויסות הכאב המרכזי תורמים במשותף לפתוגנזה של המחלה11,12. קווים מנחים קליניים ממליצים על carbamazepine ו-oxcarbazepine כטיפולים ראשוניים, בעוד שגישות כירורגיות או התערבותיות נשקלות כאשר טיפול פרמקולוגי אינו יעיל או אינו נסבל10. למרות התקדמויות טיפוליות אלו, TN מאופיינת במהלך של התפרצויות והפסקות (relapsing–remitting), וחזרה של כאב לטווח ארוך נותרת נפוצה, מה שהופך השגת רמיסיה קבועה לקשה13. כתוצאה מכך, מעקב ארוך טווח וניהול מובנה של מחלה כרונית חיוניים לניטור סיכון לחזרה, תגובה לטיפול וסיבוכים. מחקרי קוהורט אורך מעידים כי תחת אסטרטגיות ניהול סטנדרטיות (כולל טיפול פרמקולוגי, התערבות כירורגית כאשר היא מומלצת, ומעקב מקיף), כחצי מהמטופלים המקבלים טיפול שמרני יכולים להגיע להפחתה של ≥50% בנטל הכאב הכולל בתוך שנתיים, ללא התקדמות בלתי נמנעת של המחלה14. ממצאים אלו מדגישים את החשיבות של מעורבות מתמשכת של המטופל וחינוך בריאותי יעיל לניהול המחלה לטווח ארוך. עדויות מצביעות על כך שמטופלים עם הבנה טובה יותר של אטיולוגיית המחלה, הפתופיזיולוגיה ואפשרויות הטיפול נוטים יותר להשתתף באופן פעיל ולדבוק במשטרי טיפול, מה שמוביל לתוצאות משופרות15. עם זאת, גישות מסורתיות לחינוך בריאותי מוגבלות לעיתים קרובות בהגעה ובמדרגיות. עם האימוץ הנרחב של האינטרנט, ובמיוחד פלטפורמות שאלות ותשובות מקוונות ומדיה חברתית, מטופלים מסתמכים יותר ויותר על מקורות דיגיטליים כדי להשיג מידע רפואי16,17. למרות זאת, שונות משמעותית באוריינות בריאותית אינדיבידואלית ובביכולת לגשת, לעבד ולהבין מידע בריאותי בסיסי לצורך קבלת החלטות מושכלת מהווה חסמים מרכזיים לחינוך יעיל של המטופל18. יתרה מכך, האיכות הבלתי אחידה של מידע בריאותי מקוון, כולל תוכן לא מדויק או מטעה, עלולה להשפיע לרעה על החלטות רפואיות של מטופלים ועל רווחתם הפסיכולוגית19.

טכנולוגיות בינה מלאכותית (AI), ובמיוחד הפיתוח המהיר של מודלי שפה גדולים (LLMs) בשנים האחרונות, יצרו הזדמנויות חדשות לתקשורת במדעי הרפואה ולהשכלה בריאותית20. מודלים אלו, שאומנו על קורפוסים טקסטואליים רחבי היקף, יכולים להפיק תגובות מובנות וקוהרנטיות לוגית באמצעות אינטראקציה בשפה טבעית21. מערכות בינלאומיות מייצגות, כגון ChatGPT, הדגימו פוטנציאל מבטיח במתן מענה לשאלות רפואיות, בייעוץ למטופלים ובחינוך רפואי22,23. מספר מודלי LLMs דומים תפקודית הופיעו בסין, עם כיסוי משתמשים ותרחישי יישום המתרחבים ללא הרף24. למרות התקדמויות אלו, יישומם של מודלי LLMs בהפצת ידע במדעי הרפואה עדיין עומד בפני אתגרים משמעותיים, הכוללים את אמינות נתוני האימון, תדירות העדכונים, הדיוק המדעי של התגובות המופקות ומחסור בתיקוף קליני25. בנוסף, הבדלים בין המודלים בסגנון השפה, בקריאות, במבנה הלוגי ובדיוק הציטוטים עשויים להשפיע ישירות על הבנת המטופלים ועל אמוןם במידע הקשור לבריאות26. נכון להיום, הערכות שיטתיות של ביצועי LLM בחינוך בריאותי הקשור ל-TN היו מוגבלות.

לפיכך, מחקר זה נועד להעריך ולהשוות באופן שיטתי את הביצועים של ארבעה מודלי שפה גדולים (LLMs) סיניים נפוצים (Doubao, DeepSeek, Wenxin Yiyan, ו-Tongyi Qianwen) ומודל שפה גדול בינלאומי מייצג (ChatGPT) במתן מענה לשאלות להדרכת מטופלים הקשורות ל-TN. באמצעות תכנון חתך, בנינו סט שאלות בנושא TN המבוסס על קווי דרישה קליניים ודאגות נפוצות של מטופלים, והערכנו את התגובות שהופקו על ידי חמישה מודלי שפה גדולים הזמינים לציבור (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, ו-GPT-5). רמת הקריאות הוערכה באמצעות מדדים מרובים, והבנה ויכולת יישום נבחנו באמצעות כלי הערכת חומרי הדרכה למטופלים (PEMAT). איכות המידע הכללית הוערכה באמצעות מדד איכות גלובלי (GQS). בנוסף, ניתחנו כיצד נושאי חינוך לבריאות שונים משפיעים על מדדי הערכה אלו ועל הקשרים ביניהם, במטרה לספק הדרכה מבוססת ראיות לבחירה ואופטימיזציה של מודלי שפה גדולים בתקשורת בריאות קלינית.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה ניתח טקסטים שנוצרו על ידי בינה מלאכותית בלבד ולא כלל משתתפים אנושיים, בעלי חיים, דגימות ביולוגיות, רשומות רפואיות, מידע אישי מזוהה או התערבות בטיפול קליני. לפיכך, סקירת אתיקה והסכמה מדעית רשמית לא היו רלוונטיות.

מערך המחקר

מחקר חתך זה העריך את רמת הקריאות, האיכות וההתאמה הפדגוגית של תשובות שנוצרו על ידי חמישה מודלי שפה גדולים (LLMs) כמענה לשאלות נפוצות על TN.

זיהוי שאלות נפוצות הקשורות ל-TN

ב-25 בנובמבר 2025, שני מומחים קליניים בעלי ניסיון נרחב ברפואת כאב סקרו באופן עצמאי את ההנחיות הקליניות הנוכחיות לניורלגיה של עצב השלישייה (TN), כולל הסיווג הבינלאומי של הפרעות כאב ראש, מהדורה שלישית (ICHD-3), הנחיות האקדמיה האירופית לנוירולוגיה והנחיות האקדמיה האמריקאית לנוירולוגיה/פדרציית החברות הנוירולוגיות האירופית1,10,11. בעקבות דיון להשגת קונסנזוס, הם ערכו רשימה של 20 שאלות הקשורות ל-TN הנשאלות בדרך כלל בפרקטיקה הקלינית. מספר השאלות נקבע מראש כדי לספק כיסוי מאוזן של חמישה תחומים תמטיים שהוגדרו מראש, כאשר נבחרו ארבע שאלות לכל תחום, תוך שמירה על מספר התגובות שהופקו על ידי המודל בטווח שניתן לדירוג ואימות ידני על ידי מומחים. כדי לשפר את השחזוריות, תהליך הבחירה נעשה לפי מסגרת מוגדרת מראש המבוססת על תחומים: המומחים זיהו תחילה שאלות מועמדות בתוך כל תחום, סקרו אותן באופן עצמאי לבחינת הרלוונטיות הקלינית, ניסוח המכוון למטופל ומניעת כפילויות, ולאחר מכן הגיעו לקונסנזוס לגבי ארבע השאלות הסופיות לכל תחום. רשימת השאלות הסופית מופיעה ב-טבלה 1 וב-קובץ משלים 1. חמשת התחומים התמטיים שהוגדרו מראש היו ידע בסיסי על המחלה, אתיולוגיה וגורמי סיכון, אבחנה, טיפול, ומניעה ושיקום. מכיוון שערכת השאלות לא נגזרה מיומני חיפוש של מטופלים, שאילתות חיפוש מקוונות או ראיונות רשמיים עם מטופלים, הפוטנציאל להטיית בחירה מוכר כמגבלה של המחקר.

מודלי AI והליך איסוף נתונים

ב-25 בנובמבר 2025, הוגשה מערכת סופית של 20 שאלות הקשורות ל-TN לחמש פלטפורמות של מודלי שפה גדולים (LLM) נגישות לציבור: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ו-GPT-5/ChatGPT. הגישה לכל המודלים התבצעה באמצעות ממשקי הצ'אט הסטנדרטיים שלהם מבוססי האינטרנט; לא נעשה שימוש בגישה באמצעות ממשק תכנות יישומים (API). עבור כל פלטפורמה, נעשה שימוש במודל ברירת המחדל שהיה זמין לציבור בתאריך איסוף הנתונים, ללא שינוי של פרמטרי יצירה כלשהם. מכיוון שממשקי האינטרנט הציבוריים לא הציגו מזהי תצלומיות (snapshots) של מודלי ה-backend, הנחיות מערכת נסתרות, temperature, top-p, מספר מקסימלי של טוקנים בפלט או פרמטרי יצירה אחרים, פריטים אלו נרשמו כ"לא מוצגים בממשק האינטרנט הציבורי".

שפת הפקודות והתגובות הייתה אנגלית עבור כל המודלים. כל פקודה סטנדרטית consisted solely מהשאלה באנגלית כפי שנכתבה, ללא הוראות נוספות שספציפיות למודל. כל שאלה הוגשה באופן פרטני בשיחת צ'אט חדשה ועצמאית, ללא היסטוריית שיחות קודמת, קבצים שהועלו, תוספים, הוראות מותאמות אישית או פקודות המשך. הרשימה המלאה של הפקודות הסטנדרטיות והפלטים הגולמיים המתאימים של המודלים מופיעה בSupplementary File 1. מטא-נתונים של המודלים והגדרות איסוף הנתונים מסוכמים בSupplementary Table 1.

הערכת קריאות

קריאותן של התגובות שהופקו על ידי ה-LLM הוערכה באמצעות מספר נוסחאות קריאות מבוססות הזמינות דרך פלטפורמה מקוונת להערכת קריאות (http://readabilityformulas.com/). בהינתן היעדר תקן זהב מקובל באופן אוניברסלי להערכת קריאות, ובדומה למחקרים קודמים, נעשה שימוש במערב מקיפה של מדדי קריאות נפוצים23,27. שבעה מדדים נבחרו כדי לתפוס היבטים משלימים של קריאות, כולל אורך משפט, אורה של מילה, עומס הברות, מורכבות מבוססת תווים, קלות קריאה ורמת כיתה מוערכת, ובכך להפחית את ההסתמכות על נוסחה בודדת. באופן ספציפי, חושבו מדדי ה-Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES) ו-Flesch-Kincaid Grade Level (FKGL). מדדים אלו מעריכים את קשיי הקריאה או את רמת הכיתה ומספקים מדדים כמותיים לקריאות הטקסט (Table 2).

הערכת התאמה חינוכית ואיכות המידע

ההתאמה החינוכית הוערכה באמצעות הכלי להערכת חומרי הדרכה למטופלים (PEMAT), הכולל שני תחומים: מובנות ויכולת יישום28. הכלי כולל 24 פריטים, כאשר 16 מעריכים את המובנות ושמונה מעריכים את יכולת היישום. כל פריט דורג באופן דיכוטומי (0 = הקריטריון לא הושג; 1 = הקריטריון הושג), מה שהניב ציון כולל הנע בין 0 ל-24, כאשר ציונים גבוהים יותר מעידים על התאמה רבה יותר להדרכת מטופלים. איכות המידע הכללית הוערכה באמצעות מדד איכות גלובלי (GQS)27, סולם ליקרט בן חמש נקודות הנמצא בשימוש נרחב להערכת איכות של מידע רפואי (טבלה 3).

ב-25 בנובמבר 2025, שני מומחים קליניים עם ניסיון של למעלה מ-3 שנים בניהול TN העריכו את כל התגובות שהופקו על ידי AI באמצעות שני כלי ההערכה. לפני הניקוד, כל התגובות שהופקו על ידי AI עברו אנונימיזציה עם מזהי תגובה מקודדים, והבודקים היו מסווגים (blinded) לפלטפורמת ה-LLM במהלך הערכות ה-PEMAT וה-GQS. מחלוקות נפתרו על ידי מומחה בכיר שלישי, שפסק על הניקוד הסופי. מהימנות בין בודקים נמדדה באמצעות מקדם הקאפה של כהן (Cohen's kappa coefficient), כאשר ערכים >0.75 מעידים על הסכמה מצוינת, 0.40–0.75 מעידים על הסכמה מקובלת, ו-<0.40 מעידים על הסכמה דלה. ערכי הקאפה של כהן הן עבור ה-PEMAT והן עבור ה-GQS עלו על 0.75, מה שמעיד על מהימנות מצוינת בין הבודקים.

ניתוח סטטיסטי

כל הניתוחים הסטטיסטיים בוצעו באמצעות תוכנת R (גרסה 4.4.3). נורמליות הנתונים הוערכה באמצעות מבחן Shapiro-Wilk וגרפי Q-Q. משתנים בעלי התפלגות נורמלית סוכמו כממוצע ± סטיית תקן והושוו באמצעות ניתוח שונות חד-כיווני (ANOVA), ולאחריו מבחן post hoc של Tukey במידת הצורך. משתנים שאינם בעלי התפלגות נורמלית סוכמו כחציונים וטווחים בין-רבעוניים והושוו באמצעות מבחן Kruskal-Wallis, ולאחריו מבחן post hoc של Dunn עם תיקון Bonferroni להשוואות זוגיות. מתאמים בין מדדי קריאות, ציוני PEMAT וערכי GQS הוערכו באמצעות מקדם המתאם הרטבי של Spearman, תוך יישום תיקון Benjamini-Hochberg לבדיקות מרובות. ערך P דו-צדדי מתוקנן של < 0.05 נחשב למשמעותי מבחינה סטטיסטית.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה העריך באופן שיטתי את ההשפעות של מודלי שפה גדולים (LLMs) וקטגוריות שונות של תכני חינוך לבריאות על קריאותם ואיכותם של טקסטים שנוצרו. ראשית, השווינו את הביצועים של חמישה LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ו-GPT-5 — ביחס להתאמה להדרכת מטופלים, איכות מידע כוללת ומדדי קריאות מרובים, כולל ציון PEMAT, GQS ומדמדי קריאות מבוססים (ARI, FRES, GFOG, FKGL, CL, SMOG ו-LW). שנית, בחנו את אותם מדדי תוצאה בחמישה תחומים תמטיים של תכני חינוך לבריאות: ידע בסיסי על מחלות, אתיולוגיה וגורמי סיכון, אבחנה, טיפול, ומניעה ושיקום. באמצעות שילוב של שתי פרספקטיבות אנליטיות אלו, חקרנו עוד כיצד סוג המודל וקטגוריית התוכן משפיעים במשותף על איכות הטקסט ועל הקריאות שלו, ובכך זיהינו דפוסים שיטתיים בחומרי הדרכה למטופלים שנוצרו על ידי LLM.

ניתוח קריאות בין מודלי שפה גדולים שונים

שבעה מדדי קריאות מבוססים שימשו להשוואה שיטתית של המורכבות הלשונית של טקסטים הקשורים לנוירופתיה של עצב השליש (trigeminal neuralgia) שהופקו על ידי חמישה מודלי שפה גדולים: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ו-GPT-5. התוצאות הכוללות מסוכמות בטבלה 4, וההתפלגויות של מדדי הקריאות הבודדים מוצגות באיור 1A–G. נצפו הבדלים מובהקים סטטיסטית בין חמשת המודלים עבור כל מדדי הקריאות, כאשר P < 0.001 עבור כל אחד מהם.

GPT-5 הציג את ערכי החציון הגבוהים ביותר עבור ARI, GFOG, FKGL, CL ו-SMOG ואת ה-FRES הנמוך ביותר, מה שמעיד על כך שהוא ייצר טקסטים עם מבני משפטים ארוכים יותר, אוצר מילים מורכב יותר ועומס קריאה כולל הגבוה ביותר (איור 1A–G). לעומת זאת, Wenxin Yiyan הדגים את המורכבות הלשונית הנמוכה ביותר. ערכי החציון שלו עבור ARI, GFOG, FKGL, CL ו-SMOG היו הנמוכים ביותר מבין חמשת המודלים, בעוד שערך ה-FRES שלו היה הגבוה ביותר.

Doubao, DeepSeek ו-Tongyi Qianwen הדגימו רמות קריאות ביניים בין GPT-5 ל-Wenxin Yiyan. Doubao ו-DeepSeek הראו ביצועים דומים במדדי רמת הלימוד, כולל ARI, GFOG, FKGL ו-CL, ושניהם הציגו ערכים גבוהים משמעותית מאלו של Wenxin Yiyan, כאשר כל ה-P < 0.05. ממצאים אלו מצביעים על נטל קריאה כללי דומה עבור Doubao ו-DeepSeek, עם מורכבות לשונית רבה יותר מזו של Wenxin Yiyan.

באופן כללי, Tongyi Qianwen הניב ערכים שבין אלה של Doubao/DeepSeek לבין אלה של GPT-5 ברוב מדדי הקריאות. בולט במיוחד שציון ה-CL שלו היה קרוב יותר לזה של GPT-5, מה שמעיד על מורכבות לשונית גבוהה מעט יותר מזו של Doubao ו-DeepSeek, אך עדיין פחות מורכבת מזו של GPT-5. מדד ה-LW הציג דפוס התפלגות השונה מזה של שאר מדדי הקריאות. Wenxin Yiyan השיג את ציון ה-LW הגבוה ביותר (60.00), אחריו Tongyi Qianwen, DeepSeek ו-Doubao, בעוד ש-GPT-5 קיבל את ציון ה-LW הנמוך ביותר (46.50). פער זה משקף הבדלים באופן שבו נוסחאות קריאות שונות שוקלות את אורך המשפט ואת קשיי המילים (איור 1G).

באופן כללי, נצפו הבדלים משמעותיים במורכבות הלשונית בין חמשת מודלי השפה הגדולים. GPT-5 ייצר את הטקסט המורכב ביותר מבחינה לשונית, Wenxin Yiyan הפיק את התוכן הקריא ביותר, והשאר הפגינו רמות ביניים של קריאות, אם כי הבדלים מבניים היו ניכרים.

השוואה של התאמת חינוך מטופלים ואיכות כוללת בין מודלי שפה גדולים

נצפו הבדלים משמעותיים בהתאמה להדרכת מטופלים, כפי שהוערכה באמצעות ה-PEMAT, בין חמשת מודלי השפה (איור 1H; טבלה 4), כאשר כל ה- P < 0.001. GPT-5 השיג את ציון ה-PEMAT הגבוה ביותר בדירוג המומחים (9.40 ± 1.90), מה שמעיד על התאמה חינוכית רבה יותר במסגרת הבנצ'מרק הנוכחית. עם זאת, ממצא זה אינו צריך להתפרש כראיה לכך שחומרים שנוצרו על ידי GPT-5 משפרים את הבנת המטופל בפועל, את שביעות רצונו, את האמון, את התנהגויות הבריאות או את התוצאות הקליניות.

DeepSeek השיג ציון PEMAT בינוני (6.80 ± 1.06), עם התפלגות ציונים רשומית יחסית, מה שמעיד על ביצועים עקביים ביצירת חומרי הדרכה למטופלים. עם זאת, התאמתו החינוכית הכוללת נותרה נמוכה משמעותית מזו של GPT-5 (P < 0.001). Doubao, Tongyi Qianwen ו-Wenxin Yiyan הניבו ציוני PEMAT נמוכים יותר (5.35 ± 1.04, 5.65 ± 1.09 ו-5.35 ± 0.93, בהתאמה). לא נצפו הבדלים משמעותיים בין שלושת המודלים הללו, וכולם הציגו ביצועים גרועים משמעותית מ-DeepSeek ומ-GPT-5 (כולם P < 0.01). ממצאים אלו מעידים על התאמה חינוכית דומה אך מוגבלת בין מודלים אלו, במיוחד בנוגע לבהירות ההנחיות, הארגון הלשוני וקלות ההבנה.

דפוס דומה נצפה עבור איכות המידע הכללית, כפי שהוערכה באמצעות ה-GQS (איור 1I). הבדלים מובהקים סטטיסטית זוהו בין חמשת המודלים, כאשר כל ה- P < 0.001. GPT-5 השיג את ציון ה-GQS הגבוה ביותר (4.00 ± 0.65). ציוניו היו מרוכזים בטווח של 4–5, עם שונות מוגבלת, מה שמעיד על ביצועים גבוהים באופן עקבי בקוהרנטיות של התוכן, בשלמות המבנית ובשימושיות המעשית.

DeepSeek ו-Doubao הגיעו לאחר מכן, עם ציוני GQS של 3.35 ± 0.59 ו-3.40 ± 0.50, בהתאמה. התפלגויות הציונים שלהם היו מרוכזות בין 3 ל-4, מה שמעיד על איכות מידע מתונה ואמינות סבירה. לעומת זאת, Tongyi Qianwen ו-Wenxin Yiyan השיגו את ציוני ה-GQS הנמוכים ביותר (2.50 ± 0.51 ו-2.20 ± 0.52, בהתאמה). ההתפלגויות שלהם היו מוטות לעבר הקצה הנמוך של הסולם, מה שמעיד על מגבלות בדיוק המידע, בסיגוף המבני ובעומק התוכן, אשר עשויות להפחית את תועלתם לחינוך מטופלים.

באופן כללי, GPT-5 השיג את ציוני ה-PEMAT וה-GQS הגבוהים ביותר בדירוג המומחים במאגר נתונים זה, בעוד ש-DeepSeek ו-Doubao הראו ביצועים בינוניים. Tongyi Qianwen ו-Wenxin Yiyan קיבלו דירוגי GQS נמוכים יותר. ממצאים אלו מייצגים תוצאות של בנצ'מרקינג בדירוג מומחים ואין לפרשם כראיה למוכנות קלינית או ליעילות ברמת המטופל.

השוואה של קריאות, התאמה להדרכת מטופלים ואיכות כללית בין קטגוריות של תוכן חינוך בריאות

ניתוח לפי קטגוריות תוכן חשף הבדלים משמעותיים ברמת הקריאות בין חמשת נושאי החינוך הבריאותי (טבלה 5). עבור ה-FRES, נצפו הבדלים מובהקים סטטיסטית בין הקטגוריות התמטיות (P = 0.004). ערכי FRES גבוהים יותר מעידים על קריאות קלה יותר. טקסטים העוסקים בידע בסיסי על מחלות היו בעלי הקריאות הגבוהה ביותר (חציון = 28.50), ואחריהם תוכן אבחנתי (חציון = 16.00), תוכן העוסק באטיולוגיה ובגורמי סיכון (חציון = 12.50), ותוכן הקשור לטיפול (חציון = 11.50). לעומת זאת, טקסטים העוסקים במניעה ושיקום הראו את הקריאות הנמוכה ביותר (חציון FRES = 1.00), דבר המצביע על קשיי הקריאה הגבוהים ביותר.

דפוסים דומים נצפו בשאר מדדי הקריאות. GFOG ו-FKGL נבדלו באופן מובהק בין הקטגוריות התמטיות (P = 0.002 ו-P = 0.036, בהתאמה), כאשר שני המדדים הצביעו על רמות כיתה גבוהות יותר עבור תכנים בנושאי אתיולוגיה וגורמי סיכון, ומניעה ושיקום. באופן דומה, מדד SMOG העלה כי טקסטים על אתיולוגיה וגורמי סיכון הכילו פרופורציה גבוהה יותר של מילים רב-הברתיות (P = 0.039). ההבדלים הגדולים ביותר נצפו עבור CL (P < 0.001). לטקסטים על מניעה ושיקום היו המשפטים הארוכים ביותר (חציון = 21.01), מה שהגביר משמעותית את קושי הקריאה, בעוד שטקסטים על ידע בסיסי על המחלה הכילו את המשפטים הקצרים ביותר (חציון = 14.88), מה שהתאים לעומס הקריאה הנמוך ביותר. לא נצפו הבדלים מובהקים בין קטגוריות התוכן עבור ARI או LW.

לא זוהו הבדלים מובהקים סטטיסטית בהתאמה להשכלת מטופלים בין חמש קטגוריות התוכן על סמך ציוני PEMAT (P = 0.252). ציוני PEMAT הממוצעים נעים בין 5.90 ל-7.20, מה שמעיד על כך שלמרות הבדלים ניכרים במורכבות הלשונית, ההתאמה החינוכית נותרה עקבית יחסית בין הנושאים השונים. באופן דומה, איכות המידע הכללית, כפי שנמדדה באמצעות GQS, לא נבדלה באופן מובהק בין קטגוריות התוכן (P = 0.822). ערכי GQS הממוצעים נעים בין 2.95 ל-3.25, דבר המצביע על כך שאיכות המידע הכללית הייתה יציבה יחסית בין נושאי התוכן.

באופן כללי, נצפו הבדלים משמעותיים ברמת הקריאות בין נושאי חינוך לבריאות, כאשר תכנים העוסקים באטיולוגיה וגורמי סיכון ותכנים העוסקים במניעה ושיקום הציגו את רמת הקושי הגבוהה ביותר בקריאה, בעוד שתכנים העוסקים בידע בסיסי על המחלה היו הקריאים ביותר. לעומת זאת, התאמתו של החינוך למטופלים והאיכות הכללית של המידע נותרו עקביות יחסית בין קטגוריות התוכן השונות.

ניתוח מתאם בין קריאות, התאמה להשכלת מטופלים ואיכות כללית

מטריצת המתאם ב-איור 2 מראה קשרים עקביים וחזקים בין מדדי הקריאות, המעידים על עקביות פנימית גבוהה. מרבית מדדי הקריאות, כולל ARI, GFOG, FKGL, CL ו-SMOG, הראו מתאמים חיוביים בינוניים עד חזקים זה עם זה, עם מקדמי מתאם הנעים בין 0.64 ל-0.97 (כולם P < 0.001). ממצאים אלו תומכים עוד יותר באופי המשלי של מדדים אלו בהערכת מורכבות לשונית. לעומת זאת, FRES הראה מתאמים שליליים מובהקים עם מספר מדדי קריאות, כולל ARI, GFOG, FKGL, CL ו-SMOG, עם מקדמי מתאם מוחלטים הגבוהים מ-0.70 (כולם P < 0.001). דפוס זה משקף את כיוון הניקוד ההפוך של FRES, שבו ציונים גבוהים יותר מעידים על קריאות גבוהה יותר. מדד ה-LW הדגים אף הוא מתאמים שליליים מובהקים עם מדדי קריאות אחרים, כולל ARI, FKGL, GFOG ו-SMOG, עם מקדמי מתאם מוחלטים הנעים בין 0.75 ל-0.90 (כולם P < 0.001). לעומת זאת, LW נמצא במתאם חיובי עם FRES (מקדם מתאם = 0.69, P < 0.001).

נצפו גם קשרים ברורים בין מדדי קריאות לבין איכות המידע הכוללת, כפי שנמדדה באמצעות ה-GQS. ה-GQS הראה מתאמים חיוביים חלשים עד בינוניים עם רוב מדדי הקריאות, כולל ARI, GFOG, FKGL, CL ו-SMOG, כאשר מקדמי המתאם נעים בין 0.326 ל-0.391 (כולם P < 0.001). ממצאים אלו מצביעים על כך שמורכבות לשונית גבוהה יותר הייתה קשורה לאיכות מידע גבוהה יותר בדירוג המומחים. לעומת זאת, ה-GQS היה במתאם שלילי בינוני עם FRES (מקדם מתאם = −0.408, P < 0.001), מה שמעיד על כך שטקסטים הדורשים רמת קריאה גבוהה יותר קיבלו בדרך כלל דירוגי GQS גבוהים יותר. ה-GQS הראה גם מתאם שלילי בינוני עם LW (מקדם מתאם = −0.421, P < 0.001).

הקשרים בין קריאות לבין התאמה לחינוך מטופלים, כפי שנמדדו באמצעות ה-PEMAT, היו בדרך כלל חלשים יותר אך עקביים בכיוונם. ציוני PEMAT הראו מתאמים חיוביים חלשים עם ARI, GFOG, FKGL, CL ו-SMOG, עם מקדמי מתאם שנעו בין 0.305 ל-0.434 (כולם P < 0.01). לעומת זאת, ציוני PEMAT הראו מתאם שלילי חלש עם FRES ו-LW, עם מקדמי מתאם מוחלטים של 0.432 ו-0.320, בהתאמה (שניהם P < 0.01). ממצאים אלו מצביעים על כך שבתוך מערך נתונים זה, מורכבות לשונית רבה יותר הייתה קשורה להתאמה חינוכית גבוהה יותר במעט לפי דירוג מומחים, אם כי עוצמתם של קשרים אלו הייתה מוגבלת.

חשוב לציין כי נצפתה מתאם חיובי בינוני בין ציוני ה-PEMAT לבין ציוני ה-GQS (מקדם מתאם = 0.645, P < 0.001). זה היה הקשר החזק ביותר שנצפה בין תחומי ההערכה, מה שמעיד על כך שתשובות עם התאמה חינוכית גבוהה יותר נטו גם לקבל דירוגים גבוהים יותר של איכות מידע כללית.

זמינות נתונים:

סט הנתונים המלא התומך במחקר זה מסופק כחומר נלווה. קובץ נלווה 1 מכיל את הרשימה המלאה של השאלות וההנחיות הסטנדרטיות, וכן את 100 התגובות שנשמרו אשר הופקו על ידי LLM. טבלה נלווה 2 מכילה את גיליונות הניקוד של המומחים עבור PEMAT ו-GQS, כולל דירוגי PEMAT ברמת הפריט כאשר אלו זמינים, ציוני PEMAT כוללים, ציוני GQS, מידע להשוואה בין המדרגים ורישומי בוררות במידת הרלוונטיות. ציוני הקריאות, נתוני המקור של האיורים וקוד ניתוח ה-R מסופקים כקובץ נלווה 2. מכיוון שפלטי LLM עשויים להשתנות עם הזמן עקב עדכוני מודלים, שינויים בממשק ושינויים ברמת הפלטפורמה, יש להשתמש בפלטים שנשמרו, ולא בתגובות שהופקו מחדש, לצורך אימות וניתוח משני.

figure-results-1
איור 1: השוואה של קריאות, התאמה להדרכת מטופלים ואיכות מידע כללית בין חמישה מודלי שפה גדולים. (A–G) פאנל זה מציג את מדדי הקריאות: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG), ו-Linsear Write Formula (LW). (H) פאנל זה מציג את ציוני PEMAT הכוללים, ופאנל (I) מציג את ציוני האיכות הגלובליים (GQS). בכל תרשים קופסה, הקו המרכזי מייצג את החציונה, הקופסה מציינת את הטווח הבין-רבעוני (IQR), השפם נמתח עד ל-1.5 × IQR, ונקודות מעבר לשפם מייצגות ערכים חריגים. קיצורים: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = the Patient Education Materials Assessment Tool for Understandability and Actionability, printable format; Global Quality Score = GQS. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-2
איור 2: מטריצת מתאמי Spearman בין מדדי קריאות, התאמה להדרכת מטופלים ואיכות מידע כללית בכל התגובות שהופקו על ידי המודלים. המטריצה מציגה מקדמי מתאם Spearman לקשרים זוגיים בין ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT ו-GQS. קיצורים: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

טבלה 1: רשימה של 20 שאלות הקשורות לנוירופתיה טריגמינלית. אנא לחצו כאן להורדת קובץ זה.

טבלה 2: כלי קריאות, נוסחאות ותיאורים. אנא לחצו כאן כדי להוריד קובץ זה.

טבלה 3: קריטריוני האיכות של מדד האיכות הגלובלי (GQS). אנא לחצו כאן כדי להוריד קובץ זה.

טבלה 4: תוצאות ניתוח של מודלי שפה גדולים שונים עבור השאלות הנפוצות ביותר הקשורות לנוירופתיה טריגמינלית. אנא לחצו כאן להורדת קובץ זה.

טבלה 5: תוצאות ניתוח בממדים שונים עבור השאלות הנפוצות ביותר הקשורות לנוירופתיה של עצב השליש (trigeminal neuralgia). אנא לחץ כאן כדי להוריד קובץ זה.

טבלה נלווית 1: ציוני קריאות של תגובות שנוצרו על ידי חמישה מודלי שפה גדולים בכל מדדי הקריאות שנבחנו. אנא לחצו כאן כדי להוריד קובץ זה.

טבלה משלימה 2: דירוגי מומחים להתאמה של חינוך מטופלים (PEMAT) ואיכות מידע כללית (GQS) עבור תשובות שהופקו על ידי חמישה מודלי שפה גדולים. אנא לחצו כאן להורדת קובץ זה.

קובץ משלים 1: שאלות סטנדרטיות על נוירופתיה טריגמינלית ותשובות מלאות שהופקו על ידי חמישה מודלי שפה גדולים. אנא לחצו כאן כדי להוריד קובץ זה.

קובץ משלים 2: סקריפטים של R ונתוני מקור ששימשו לניתוחים סטטיסטיים וליצירת איורים. אנא לחצו כאן כדי להוריד קובץ זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר השוואתי זה בחתך רוחבי השווה באופן שיטתי את רמת הקריאות, ההתאמה הפדגוגית ואיכות המידע הכללית של חומרי הדרכה למטופלים עם נוירופתיה של העצב התוך-לסתי (TN), אשר הופקו על ידי חמישה מודלי שפה גדולים (LLMs) הזמינים לציבור. עלו ארבעה ממצאים עיקריים. ראשית, רמת הקריאות הייתה שונה באופן משמעותי בין המודלים, כאשר GPT-5 הפיק את התשובות המורכבות ביותר מבחינה לשונית, בעוד ש-Wenxin Yiyan הפיק את התוכן הקריא ביותר. שנית, רמת הקריאות ואיכות המידע כפי שהוערכה על ידי מומחים היו ממדי הערכה נפרדים, כאשר GPT-5 השיג את ציוני ה-PEMAT וה-GQS הגבוהים ביותר למרות רמת הקריאות הנמוכה יותר שלו. שלישית, נושא התוכן השפיע על רמת הקריאות, כאשר נושאי מניעה, שיקום, אתיולוגיה וגורמי סיכון דרשו בדרך כלל רמות קריאה גבוהות יותר, בעוד שציוני ה-PEMAT וה-GQS נותרו יציבים יחסית בין קטגוריות התוכן השונות. לבסוף, מדדי הקריאות הפגינו עקביות פנימית חזקה, וניתוחי מתאם חשפו קשרים חיוביים חלשים עד בינוניים בין המורכבות הלשונית לבין מדדי ה-PEMAT וה-GQS, וכן מתאם חיובי בינוני בין PEMAT ל-GQS. יחד, ממצאים אלו מספקים מדד להערכת חומרי הדרכה למטופלי TN המופקים על ידי LLM, תוך הדגשת הצורך באיזון בין שלמות רפואית לבין נגישות לשונית. חשוב לציין כי תוצאות אלו מייצגות תוצאות של מדד שהוערך על ידי מומחים, ואין לפרשן כראיה להבנת המטופל, לדיוק עובדתי, לבטיחות קלינית או למוכנות לשימוש קליני שגרתי.

ממצאי מחקר זה עולים בקנה אחד עם הערכות קודמות של מידע רפואי שהופק על ידי AI, אשר דיווחו על שונות ניכרת בין LLMs ועל נתק תכוף בין רמת הקריאות לבין איכות המידע26,27,29. מחקרים קודמים בתחומי מחלה מרובים הראו כי חומרי הדרכה למטופלים שהופקו על ידי LLM עולים לעיתים קרובות על רמות הקריאה המומלצות, וכי מודלים המפיקים את הטקסט הקריא ביותר אינם מספקים בהכרח את המידע המקיף ביותר או בעל האיכות הגבוהה ביותר26,30. הממצאים בהדרכה בנושא TN תומכים בתצפית זו. GPT-5 הפיק את התגובות המורכבות ביותר מבחינה לשונית, אך השיג את הציונים הגבוהים ביותר ב-PEMAT וב-GQS, בעוד ש-Wenxin Yiyan הפיק טקסט קריא יותר אך עם התאמה חינוכית ואיכות כללית נמוכות יותר בדירוג המומחים. יתרה מכך, רמת הקריאות השתנתה בין התחומים התמטיים, כאשר נושאי מניעה ושיקום ואטיולוגיה וגורמי סיכון הפגינו בדרך כלל מורכבות לשונית רבה יותר, מה שמרמז כי הן מאפייני המודל והן מורכבות הנושא משפיעים על קושי הקריאה31.

הטרייד-אוף (trade-off) הנראה לעין בין קריאות לאיכות המידע עולה בקנה אחד עם המבנים (constructs) השונים שנמדדו על ידי כלי ההערכה. נוסחאות קריאות מעריכות בעיקר מאפיינים לשוניים ברמת השטח, כגון אורך משפטים ומורכבות לקסיקלית, בעוד ש-PEMAT ו-GQS מעריכים תכונות מסדר גבוה יותר, הכוללות ארגון מידע, שלמות, בהירות ההסברים ויכולת יישום (actionability)32. עבור חינוך בנושאי TN, תשובות באיכות גבוהה כוללות לעיתים קרובות דיונים על סימני אזהרה (red-flag symptoms), אבחנה מבדלת, טיפול פרמקולוגי ותופעות לוואי, אפשרויות התערבותיות וכירורגיות, ואסטרטגיות שיקום מותאמות אישית33. תוכן מקיף מבחינה קלינית כזה מגביר בהכרח את הצפיפות הטרמינולוגית והמורכבות התחבירית, מה שמוביל לציוני קריאות גבוהים יותר ולאיכות חינוכית משופרת כפי שהוערכה על ידי מומחים. חשוב לציין כי ממצאים אלו לא צריכים להתפרש כהצעה ששפה מורכבת יותר היא עדיפה. במקום זאת, הם מעידים על כך ש-LLMs נוכחיים משפרים לעיתים קרובות את שלמות המידע על חשבון הנגישות הלשונית. לפיכך, פיתוח עתידי של מערכות חינוך למטופלים צריך להתמקד בשמירה על דיוק רפואי תוך פישוט השפה באמצעות עריכה לשפה פשוטה (plain-language), הצגה מובנית של נקודות מפתח, הסבר של טרמינולוגיה טכנית, והנחיות ברורות וניתנות ליישום המתאימות למטופלים עם רמות שונות של אוריינות בריאותית11,34,35.

ניתוח מתאמים תומך עוד יותר בהבחנה בין קריאות לבין איכות חינוכית. רוב מדדי הקריאות המבוססים על רמת כיתה הראו קשרים חיוביים חלשים עד בינוניים הן עם PEMAT והן עם GQS, בעוד ש-FRES הראה את הקשר ההפוך הצפוי, מכיוון שציוני FRES גבוהים יותר מעידים על קריאות קלה יותר. ממצאים אלו אינם מרמזים כי מורכבות לשונית רבה יותר היא רצויה; במקום זאת, הם מצביעים על כך ש-LLMs נוכחיים משיגים לעיתים קרובות שלמות מידע רבה יותר על חשבון הנגישויות34. בהתאם לכך, פיתוח חינוך למטופלים בסיוע בינה מלאכותית צריך לתת עדיפות לדיוק רפואי ולשלמות, תוך שילוב עריכה בשפה פשוטה, הצגה מובנית של נקודות מפתח, הסברים ברורים למינוח טכני והמלצות מעשיות המותאמות למטופלים עם רמות שונות של אוריינות בריאותית11,35.

ממצא מתודולוגי נוסף היה ההתנהגות המובחנת של מדד LW בהשוואה למדדי הקריאות האחרים. בניגוד ל-ARI, FKGL, GFOG, CL ו-SMOG, מדד LW הראה דפוס דומה יותר ל-FRES, מה שמשקף הבדלים באופן שבו נוסחאות קריאות תפעולות את מורכבות הטקסט36. מכיוון ש-LW פותח במקור עבור מדריכים טכניים ומדגיש את מבנה המשפטים שנמדגAmounts וסיווג מילים במקום מאפיינים כלליים של משפטים או הברות, ייתכן שהוא יגיב באופן שונה לטקסטים רפואיים שנוצרו על ידי AI, המשלבים הצהרות תמציתיות עם קטעי הסבר ארוכים יותר והפצה לא אחידה של מינוחים טכניים37,38. ממצאים אלו מחזקים את החשיבות של מסגרת הערכה רב-מטרית, שכן אף מדד קריאות בודד אינו לוכד באופן מספק את כל ממדי מורכבות הטקסט. בהתאמה למחקרים קודמים על מידע בריאותי שנוצר על ידי AI, יש לפרש את הקריאות הכללית באמצעות ראיות מתכנסות על פני מספר מדדים משלימים, ולא באמצעות מדד בודד39.

גם לקטגוריית התוכן הייתה השפעה על קריאות הטקסט. נושאים העוסקים במניעה, שיקום, אטיולוגיה וגורמי סיכון הניבו בדרך כלל טקסטים עם רמת קושי קריאה גבוהה יותר מאשר ידע בסיסי על המחלה, ככל הנראה משום שנושאים אלו דורשים המלצות מותנות, הסברים מכניסטיים וטרמינולוגיה מקצועית יותר40,41. לעומת זאת, ידע בסיסי על המחלה מבוסס בעיקר על הגדרות וניתן להעבירו בשפה פשוטה יותר42. למרות הבדלים אלו, מדדי ה-PEMAT וה-GQS נותרו עקביים יחסית בין התחומים התמטיים השונים, מה שמעיד על כך שההתאמה החינוכית ואיכות המידע הכללית, כפי שהוערכו על ידי מומחים, נשמרו בסוגים שונים של שאלות מטופלים35,43.

לממצאים אלו מספר השלכות על הפרקטיקה הקלינית ועל פיתוח מודלי שפה גדולים (LLM) בעתיד. ככל שמטופלים משתמשים יותר ב-LLMs כדי להשיג מידע לפני או אחרי ייעוצים רפואיים, תוכן שנוצר על ידי בינה מלאכותית צריך להשלים, ולא להחליף, את הייעוץ של הקלינאי, במיוחד בנושאי בטיחות תרופות, התוויות לטיפול פולשני או כירורגי, וזיהוי תסמיני "דגל אדום" הדורשים הערכה דחופה44. ארגוני בריאות עשויים להפיק תועלת מאספקת משאבים חינוכיים בשפה פשוטה שעברו ביקורת של מומחים, תוך שימוש ב-LLMs ככלים לניסוח או לתמיכה בקבלת החלטות ולא כמערכות אוטונומיות להשכלת מטופלים. מודלים עתידיים צריכים לשלב אסטרטגיות יצירה מודעות לקריאות, דיווח שקוף על גרסאות המודל ותאריכי היצירה, תקשורת מפורשת של אי-ודאות, ונהלי ממשל הכוללים ביקורת קלינאית, אימות דיוק עובדתי, סינון הזיות (hallucinations), בדיקות בטיחות תרופות, הנחיות לדגלים אדומים ובדיקת הבנת המטופל לפני יישום קליני26,44,45.

למחקר זה מספר מגבלות. תוצרי המודלים נאספו מממשקי רשת נגישים לציבור בתאריך יחיד, ועדכוני מודלים מאוחרים יותר, שינויים בממשק, הנחיות מערכת נסתרות (system prompts) או הגדרות יצירה כברירת מחדל עשויים להשפיע על השחזור. מערך 20 השאלות פותח על ידי מומחים קליניים ולא נגזר מיומני חיפוש של מטופלים או מראיונות רשמיים עם מטופלים, פרקטיקה שעלולה להוביל להטיית בחירה. יתרה מכך, המחקר התבסס על הערכות PEMAT ו-GQS שבוצעו על ידי מומחים ולא העריך הבנה, אמון, שביעות רצון, התנהגויות בריאותיות או תוצאים קליניים של מטופלים. נוסחאות קריאות, PEMAT ו-GQS אינן מעריכות באופן ישיר דיוק עובדתי, סיכון להזיות (hallucinations), דיוק בציטוטים, שלמות של התוויות נגדיות או בטיחות קלינית. כתוצאה מכך, יש לפרש ממצאים אלה כניתוח השוואתי (benchmarking) חתכי המבוסס על דירוג מומחים, ולא כראיה לכך שחומרים שנוצרו על ידי LLM מוכנים לשימוש קליני שגרתי. מחקרים עתידיים צריכים לכלול תוצרי מודל מאורכבים, מטא-נתונים מפורטים של המודל, הערכות רב-לשוניות, מערכי שאלות גדולים יותר, ביקורות בטיחות רשמיות, הערכות דיוק עובדתי ומדדי תוצאים ממוקדי-מטופל, בטרם יישקלו חומרי למידה שנוצרו על ידי LLM ליישום קליני.

במחקר השוואתי זה מסוג חתך (cross-sectional), שדורג על ידי מומחים, נמצא כי מודלי שפה גדולים הזמינים לציבור נבדלו באופן משמעותי ברמות הקריאות, ההתאמה הפדגוגית ואיכות המידע הכוללת של חומרי הדרכה למטופלים עם נוירופתיה של העצב השלישי (trigeminal neuralgia). GPT-5 השיג את הציונים הגבוהים ביותר בדירוג המומחים במדדי PEMAT ו-GQS, אך ייצר גם את התשובות המורכבות ביותר מבחינה לשונית, ממצא המדגיש כי קריאות ואיכות פדגוגית בדירוג מומחים מייצגות ממדים קשורים אך נפרדים של הדרכת מטופלים. למרות שחלק מהמודלים ייצרו תוכן קריא יותר, הדבר לא תורגם בהכרח להתאמה פדגוגית רבה יותר או לאיכות מידע כוללת גבוהה יותר. מכיוון שמחקר זה לא העריך דיוק עובדתי באמצעות ביקורת בטיחות ייעודית, סיכון להזיות (hallucinations), דיוק בציטוטים, הבנת המטופל, אמון, שביעות רצון, התנהגויות בריאותיות או תוצאים קליניים, יש לפרש את הממצאים כניתוח השוואתי בדירוג מומחים ולא כראיה למוכנות קלינית. מחקרים עתידיים צריכים לשלב סקירת מומחים, הערכות רשמיות של בטיחות ודיוק עובדתי, והערכות ממוקדות-מטופל כדי לתמוך בשימוש בטוח ואפקטיבי בחומרים שנוצרו על ידי LLM בהדרכת מטופלים.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה לא קיבל מענק ספציפי מכל סוכנות מימון במגזר הציבורי, המסחרי או ללא מטרות רווח. המחברים מודים לעמיתיהם הקליניים שסיפקו משוב על מערכת השאלות בנושא נוירופתיה טריגמינלית וסייעו בליטוש מסגרת ההערכה. אנו מודים גם לכל התורמים שתמכו בהכנת כתב היד ובביצוע העריכות.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
פלטפורמת הצ'אט DeepSeekDeepSeekhttps://chat.deepseek.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
פלטפורמת הצ'אט DoubaoDoubaohttps://www.doubao.com/chat/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
GPT 5 OpenAIhttps://chat.openai.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
תוכנת R, גרסה 4.4.3R Foundation for Statistical Computingלא רלוונטיניתוח סטטיסטי והדמיה
מחשבון קריאות מקוון של Readability FormulasReadability Formulasלא רלוונטיכלי מקוון המשמש לחישוב מדדי קריאות
פלטפורמת הצ'אט Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות
פלטפורמת הצ'אט Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/ממשק מודל שפה גדול נגיש לציבור המשמש ליצירת תגובות

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

PEMATGQS

מאמרים קשורים