Araştırma makalesi

Trigeminal Nevralji için Büyük Dil Modeli Hasta Eğitiminin Okunabilirliği ve Kalitesi: Kesitsel Bir Çalışma

DOI:

10.3791/70833

21 Ağustos 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada, modelleri kıyaslamak ve hastaya yönelik iletişimi yönlendirmek amacıyla, büyük dil modelleri tarafından oluşturulan trigeminal nevralji hakkındaki hasta bilgilendirmelerinin okunabilirliğini, eğitimsel uygunluğunu ve kalitesini sistematik olarak değerlendirmek için bir protokol sunuyoruz.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Büyük dil modelleri (LLM'ler) hasta sağlık eğitimi için giderek daha fazla kullanılmaktadır, ancak trigeminal nevralji (TN) hakkında LLM tarafından oluşturulan bilgilerin okunabilirliği ve eğitim kalitesi yetersiz şekilde değerlendirilmiştir. Bu kesitsel kıyaslama çalışması, halka açık beş LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından oluşturulan TN eğitim içeriklerini karşılaştırmıştır. Temel hastalık bilgisi, etiyoloji/risk faktörleri, tanı, tedavi ve önleme/rehabilitasyonu kapsayan, sıkça sorulan yirmi TN sorusu, standart istemler kullanılarak her bir modele sunulmuştur. Okunabilirlik yedi yerleşik indeksle, eğitim uygunluğu Anlaşılırlık ve Uygulanabilirlik için Hasta Eğitim Materyalleri Değerlendirme Aracı (PEMAT) ile ve genel bilgi kalitesi Küresel Kalite Puanı (GQS) kullanılarak değerlendirilmiştir. Tüm yanıtlar iki klinik uzman tarafından bağımsız olarak değerlendirilmiş ve uyuşmazlıklar kıdemli bir hakem tarafından çözülmüştür. İstatistiksel analizler, model performansını, tematik farklılıkları ve değerlendirme metrikleri arasındaki korelasyonları karşılaştırmıştır. Okunabilirlik, PEMAT ve GQS puanları açısından modeller arasında anlamlı farklılıklar gözlemlenmiştir. GPT-5 dilsel olarak en karmaşık yanıtları oluşturmuş ancak eğitim uygunluğu ve bilgi kalitesi açısından en yüksek puanları almıştır. Buna karşılık, Wenxin Yiyan en okunabilir metni üretmiş ancak genel olarak PEMAT ve GQS'de daha düşük puanlar almıştır. İçerik kategorisi okunabilirliği etkilemiş; önleme/rehabilitasyon ve etiyoloji/risk faktörü konularının okunması daha zor olurken, PEMAT ve GQS temalar arasında nispeten tutarlı kalmıştır. Okunabilirlik indeksleri güçlü bir iç tutarlılık ve PEMAT ile GQS ile zayıf ila orta derecede pozitif korelasyonlar gösterirken, PEMAT ve GQS orta derecede pozitif bir korelasyon sergilemiştir. Bu bulgular, model seçiminin uzmanlarca puanlanan eğitim uygunluğunu ve genel bilgi kalitesini etkilediğini, konu karmaşıklığının ise öncelikle okunabilirliği etkilediğini göstermektedir. Hasta kavrayışı, memnuniyeti, güveni, sağlık sonuçları, olgusal doğruluk ve klinik güvenlik değerlendirilmediğinden, bu sonuçlar klinik hazır oluş kanıtından ziyade uzmanlarca puanlanmış bir kıyaslama analizi olarak yorumlanmalıdır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Trigeminal nevralji (TN), genellikle elektrik çarpmasına benzer veya saplanma şeklinde tarif edilen, tekrarlayan, tek taraflı, kısa süreli ve aşırı şiddetli yüz ağrıları ile karakterize nöropatik bir ağrı sendromudur. Uluslararası Baş Ağrısı Bozuklukları Sınıflandırması 3. baskıya (ICHD-3) göre ağrı tipik olarak trigeminal sinirin bir veya daha fazla dalının dağılım alanıyla sınırlıdır, şiddeti genellikle dayanılmazdır ve hafif dokunuş, yüz yıkama, diş fırçalama, konuşma veya çiğneme gibi zararsız uyaranlarla tetiklenebilir. Ataklar, saniyenin küçük kesirlerinden birkaç dakikaya kadar değişen sürelerde, ani başlangıç ve aniden sona erme ile seyretmektedir1,2. TN genellikle yaşamı tehdit etmese de, şiddetli ve öngörülemez ağrıları; yemek yeme, konuşma, uyku ve duygusal düzenleme dahil olmak üzere temel günlük aktiviteleri önemli ölçüde bozarak ciddi bir psikososyal yüke ve yaşam kalitesinin düşmesine neden olur. Sistematik incelemelerden elde edilen kanıtlar, TN'li bireylerin genel popülasyona kıyasla depresyon, anksiyete ve uyku bozuklukları açısından önemli ölçüde daha yüksek risk altında olduğunu göstermektedir3,4. Geniş kohort çalışmalarında, TN hastalarının yaklaşık %35–55'i klinik olarak anlamlı anksiyete veya depresyon semptomları göstermekte ve ağrı katastrofize etme durumu oldukça yaygındır; bu da kronik şiddetli ağrı, insomni ve afektif bozukluklar arasında çift yönlü bir etkileşim olduğunu düşündürmektedir5,6. Epidemiyolojik tahminler, genel popülasyonda TN prevalansının yaklaşık %0,03 ile %0,3 arasında değiştiğini, kadınlarda ve yaşlı yetişkinlerde görülme oranının daha yüksek olduğunu ve coğrafi bölgeler, etnik gruplar ile yaş katmanları arasında belirgin farklılıklar olduğunu göstermektedir7,8. Çin ve Hindistan gibi nüfusun yoğun olduğu ülkelerde, hızlı nüfus yaşlanmasına TN'den etkilenen birey sayısındaki sürekli bir artış eşlik etmiş; bu durum sağlık sistemleri üzerinde artan bir yük oluşturmuş ve hastalık değerlendirmesi ile yönetimi için daha etkili, ölçeklenebilir ve veri odaklı yaklaşımlara duyulan ihtiyacı vurgulamıştır8,9.

TN; klasik, sekonder ve idiyopatik alt tiplere ayrılabilir ve artan kanıtlar, bu kategoriler arasında etiyolojik mekanizmalar ve terapötik stratejiler açısından önemli farklılıklar olduğunu göstermektedir1,10. Güncel çalışmalar; trigeminal sinir kök giriş bölgesindeki nörovasküler konfliğe bağlı yapısal değişikliklerin, periferik sinir hipereksitabilitesinin ve değişmiş merkezi ağrı modülasyonunun hastalığın patogenezine ortaklaşa katkıda bulunduğunu öne sürmektedir11,12. Klinik kılavuzlar, birinci basamak tedaviler olarak karbamazepin ve okskarbazepini önermekte, farmakolojik tedavinin etkisiz olduğu veya kötü tolere edildiği durumlarda ise cerrahi veya girişimsel yaklaşımlar değerlendirilmektedir10. Bu terapötik gelişmelere rağmen TN, relaps-remisyon seyri ile karakterizedir ve uzun vadeli ağrı nüksleri yaygın kalmaya devam etmekte, bu da kalıcı remisyonun elde edilmesini zorlaştırmaktadır13. Sonuç olarak, nüks riskinin, tedavi yanıtının ve komplikasyonların izlenmesi için uzun süreli takip ve yapılandırılmış kronik hastalık yönetimi esastır. Boylamsal kohort çalışmaları; standardize yönetim stratejileri altında (farmakolojik tedavi, endike olduğunda cerrahi müdahale ve kapsamlı takip dahil), konservatif yönetim alan hastaların yaklaşık yarısının, kaçınılmaz bir hastalık progresyonu olmaksızın iki yıl içinde toplam ağrı yükünde ≥50% azalma sağlayabildiğini göstermektedir14. Bu bulgular, uzun vadeli hastalık yönetimi için sürdürülebilir hasta katılımının ve etkili sağlık eğitiminin önemini vurgulamaktadır. Kanıtlar, hastalık etiyolojisini, patofizyolojisini ve tedavi seçeneklerini daha iyi anlayan hastaların, terapötik rejimlere aktif olarak katılma ve uyum sağlama olasılığının daha yüksek olduğunu ve bunun da iyileşmiş sonuçlara yol açtığını göstermektedir15. Ancak, geleneksel sağlık eğitimi yaklaşımları genellikle erişim ve ölçeklenebilirlik açısından sınırlıdır. İnternetin, özellikle çevrimiçi soru-cevap platformlarının ve sosyal medyanın yaygınlaşmasıyla birlikte hastalar, tıbbi bilgi edinmek için giderek daha fazla dijital kaynaklara güvenmektedir16,17. Buna rağmen, bireysel sağlık okuryazarlığındaki önemli değişkenlik ile bilinçli karar verme için temel sağlık bilgilerine erişme, işleme ve anlama yeteneği, etkili hasta eğitiminin önünde büyük engeller teşkil etmektedir18. Ayrıca, yanlış veya yanıltıcı içerikler de dahil olmak üzere çevrimiçi sağlık bilgilerinin düzensiz kalitesi, hastaların tıbbi kararlarını ve psikolojik refahlarını olumsuz etkileyebilir19.

Yapay zeka (AI) teknolojileri, özellikle son yıllarda büyük dil modellerinin (LLM'ler) hızla gelişmesi, tıp bilimi iletişimi ve sağlık eğitimi için yeni fırsatlar yaratmıştır20. Büyük ölçekli metinsel korpuslar üzerinde eğitilen bu modeller, doğal dil etkileşimi yoluyla yapılandırılmış ve mantıksal olarak tutarlı yanıtlar üretebilmektedir21. ChatGPT gibi temsili uluslararası sistemler; tıbbi soru yanıtlama, hasta konsültasyonu ve tıp eğitimi için gelecek vaat eden bir potansiyel sergilemiştir22,23. Çin'de, kullanıcı kapsamı ve uygulama senaryoları sürekli genişleyen, işlevsel olarak benzer birkaç LLM ortaya çıkmıştır24. Bu ilerlemelere rağmen, LLM'lerin tıp biliminin yaygınlaştırılmasındaki uygulamaları; eğitim verilerinin güvenilirliği, güncelleme sıklığı, üretilen yanıtların bilimsel doğruluğu ve klinik doğrulamanın eksikliği gibi önemli zorluklarla karşı karşıyadır25. Ayrıca, modeller arasındaki dil üslubu, okunabilirlik, mantıksal yapı ve atıf doğruluğu farklılıkları, hastaların sağlıkla ilgili bilgilere yönelik anlayışını ve güvenini doğrudan etkileyebilir26. Bugüne kadar, TN ile ilgili sağlık eğitiminde LLM performansının sistematik değerlendirmeleri sınırlı kalmıştır.

Bu nedenle, bu çalışma; yaygın olarak kullanılan dört Çin menşeli LLM'in (Doubao, DeepSeek, Wenxin Yiyan ve Tongyi Qianwen) ve temsilci bir uluslararası LLM'in (ChatGPT), TN ile ilgili hasta eğitimi sorularını yanıtlama performansını sistematik olarak değerlendirmeyi ve karşılaştırmayı amaçlamıştır. Kesitsel bir tasarım kullanarak, klinik kılavuzlar ve yaygın hasta endişeleri temelinde bir TN soru seti oluşturduk ve halka açık beş LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından üretilen yanıtları değerlendirdik. Okunabilirlik birden fazla metrik kullanılarak değerlendirildi; anlaşılırlık ve uygulanabilirlik ise Hasta Eğitimi Materyalleri Değerlendirme Aracı (PEMAT) kullanılarak ölçüldü. Genel bilgi kalitesi, Global Kalite Puanı (GQS) kullanılarak değerlendirildi. Ayrıca, farklı sağlık eğitimi konularının bu değerlendirme metriklerini nasıl etkilediğini ve aralarındaki ilişkileri analiz ederek, klinik sağlık iletişiminde LLM'lerin seçimi ve optimizasyonu için kanıta dayalı rehberlik sağlamayı hedefledik.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma yalnızca yapay zeka tarafından oluşturulan metinleri analiz etmiştir; insan katılımcıları, hayvanları, biyolojik örnekleri, tıbbi kayıtları, tanımlanabilir kişisel bilgileri veya klinik bakım müdahalesini kapsamamaktadır. Bu nedenle, etik kurul incelemesi ve resmi bilgilendirilmiş onam uygulanmamıştır.

Çalışma tasarımı

Bu kesitsel çalışma, TN hakkında sıkça sorulan sorulara yanıt olarak beş LLM tarafından üretilen yanıtların okunabilirliğini, kalitesini ve eğitimsel uygunluğunu değerlendirmiştir.

Sıkça sorulan TN ile ilgili soruların belirlenmesi

25 Kasım 2025 tarihinde, ağrı tıbbı konusunda kapsamlı deneyime sahip iki klinik uzman; Uluslararası Baş Ağrısı Bozuklukları Sınıflandırması, 3. baskı (ICHD-3), Avrupa Nöroloji Akademisi kılavuzu ve Amerikan Nöroloji Akademisi/Avrupa Nörolojik Cemiyetler Federasyonu kılavuzu dahil olmak üzere trigeminal nevralji (TN) için mevcut klinik kılavuzları bağımsız olarak incelemiştir1,10,11. Bir konsensüs tartışmasının ardından, klinik uygulamada yaygın olarak karşılaşılan TN ile ilgili 20 soruluk bir liste derlemişlerdir. Soru sayısı, önceden tanımlanmış beş tematik alanın dengeli bir şekilde kapsanmasını sağlamak amacıyla a priori olarak belirlenmiş ve her alan için dört soru seçilmiştir; böylece model tarafından üretilen toplam yanıt sayısı, uzmanlar tarafından manuel olarak derecelendirme ve doğrulama yapılabilmesi için uygun bir aralıkta tutulmuştur. Tekrarlanabilirliği artırmak için seçim süreci, önceden tanımlanmış alan tabanlı bir çerçeve izlemiştir: uzmanlar önce her alan içindeki aday soruları belirlemiş, bunları klinik uygunluk, hasta odaklı dil ve tekrarlardan kaçınma açısından bağımsız olarak incelemiş ve ardından alan başına nihai dört soru üzerinde konsensüse varmışlardır. Soruların nihai listesi Tablo 1 ve Ek Dosya 1'de sunulmuştur. Önceden tanımlanmış beş tematik alan; temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyondan oluşmaktadır. Soru seti hasta arama kayıtlarından, çevrimiçi arama sorgularından veya resmi hasta mülakatlarından türetilmediği için, seçim yanlılığı potansiyeli bir çalışma kısıtlılığı olarak kabul edilmektedir.

Yapay zeka modelleri ve veri toplama prosedürü

25 Kasım 2025 tarihinde, TN ile ilgili kesinleştirilmiş 20 soruluk set; Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5/ChatGPT olmak üzere halka açık beş büyük dil modeli (LLM) platformuna iletilmiştir. Tüm modellere standart halka açık web tabanlı sohbet arayüzleri üzerinden erişilmiş; uygulama programlama arayüzü (API) erişimi kullanılmamıştır. Her platform için, veri toplama tarihinde mevcut olan ve herhangi bir üretim parametresi değiştirilmeden kullanılan varsayılan halka açık model tercih edilmiştir. Halka açık web arayüzleri; arka uç model anlık görüntü tanımlayıcılarını, gizli sistem istemlerini, sıcaklığı (temperature), top-p değerini, maksimum çıktı token sayısını veya diğer üretim parametrelerini görüntülemediğinden, bu kalemler "halka açık web arayüzünde görüntülenmedi" şeklinde kaydedilmiştir.

Tüm modeller için istem ve yanıt dilleri İngilizceydi. Her standartlaştırılmış istem, modele özgü herhangi bir ek talimat olmaksızın yalnızca İngilizce sorunun aynından oluşmuştur. Her soru; önceki konuşma geçmişi, yüklenmiş dosyalar, eklentiler, özelleştirilmiş talimatlar veya takip istemleri olmaksızın yeni ve bağımsız bir sohbet oturumunda bireysel olarak gönderilmiştir. Standartlaştırılmış istemlerin tam listesi ve bunlara karşılık gelen ham model çıktıları Ek Dosya 1'de sunulmuştur. Model meta verileri ve veri toplama ayarları Ek Tablo 1'de özetlenmiştir.

Okunabilirlik değerlendirmesi

LLM tarafından oluşturulan yanıtların okunabilirliği, çevrimiçi bir okunabilirlik değerlendirme platformu (http://readabilityformulas.com/) üzerinden erişilebilen birden fazla yerleşik okunabilirlik formülü kullanılarak değerlendirilmiştir. Okunabilirlik değerlendirmesi için evrensel olarak kabul görmüş tek bir altın standart olmaması nedeniyle ve önceki çalışmalarla tutarlı olarak, yaygın olarak kullanılan kapsamlı bir okunabilirlik indeksleri seti uygulanmıştır23,27. Herhangi bir tek formüle olan bağımlılığı azaltmak amacıyla; cümle uzunluğu, kelime uzunluğu, hece yükü, karakter tabanlı karmaşıklık, okuma kolaylığı ve tahmini sınıf düzeyi dahil olmak üzere okunabilirliğin birbirini tamamlayan yönlerini yakalamak için yedi indeks seçilmiştir. Spesifik olarak, Coleman-Liau İndeksi (CL), Linsear Write Formülü (LW), Otomatik Okunabilirlik İndeksi (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog İndeksi (GFOG), Flesch Okuma Kolaylığı Puanı (FRES) ve Flesch-Kincaid Sınıf Düzeyi (FKGL) hesaplanmıştır. Bu indeksler okuma zorluğunu veya sınıf düzeyini tahmin ederek metin okunabilirliğine dair nicel ölçütler sunmaktadır (Tablo 2).

Eğitimsel uygunluk ve bilgi kalitesinin değerlendirilmesi

Eğitimsel uygunluk, anlaşılırlık ve uygulanabilirlik olmak üzere iki alandan oluşan Hasta Eğitim Materyalleri Değerlendirme Aracı (PEMAT) kullanılarak değerlendirilmiştir28. Araç, 16'sı anlaşılırlığı ve sekizi uygulanabilirliği değerlendiren toplam 24 maddeden oluşmaktadır. Her madde iki seçenekli olarak puanlanmış (0 = kriter karşılanmadı; 1 = kriter karşılandı) ve 0 ile 24 arasında toplam bir puan elde edilmiştir; yüksek puanlar, hasta eğitimi için daha yüksek uygunluğu göstermektedir. Genel bilgi kalitesi, tıbbi bilgilerin kalitesini değerlendirmek için yaygın olarak kullanılan beşli Likert ölçeği olan Global Kalite Skoru (GQS) ile değerlendirilmiştir27 (Tablo 3).

25 Kasım 2025 tarihinde, TN yönetiminde 3 yılı aşkın deneyime sahip iki klinik uzman, her iki değerlendirme aracını kullanarak yapay zeka tarafından oluşturulan tüm yanıtları değerlendirmiştir. Puanlamadan önce, yapay zeka tarafından oluşturulan tüm yanıtlar kodlanmış yanıt tanımlayıcıları ile anonimize edilmiş ve değerlendiriciler PEMAT ve GQS değerlendirmeleri sırasında LLM platformuna karşı körlenmiştir. Uyuşmazlıklar, nihai puanlara karar veren üçüncü bir kıdemli uzman tarafından çözülmüştür. Değerlendiriciler arası güvenilirlik Cohen's kappa katsayısı ile değerlendirilmiş; >0.75 değerleri mükemmel uyumu, 0.40–0.75 değerleri kabul edilebilir uyumu ve <0.40 değerleri ise zayıf uyumu göstermiştir. Hem PEMAT hem de GQS için Cohen's kappa değerleri 0.75'i aşmış ve mükemmel değerlendiriciler arası güvenilirlik göstermiştir.

İstatistiksel analiz

Tüm istatistiksel analizler R yazılımı (versiyon 4.4.3) kullanılarak gerçekleştirilmiştir. Verilerin normalliği Shapiro-Wilk testi ve Q-Q grafikleri ile değerlendirilmiştir. Normal dağılım gösteren değişkenler ortalama ± standart sapma olarak özetlenmiş ve tek yönlü varyans analizi (ANOVA) ile karşılaştırılmış, uygun olduğunda Tukey post hoc testi uygulanmıştır. Normal dağılım göstermeyen değişkenler medyan ve çeyrekler arası aralık olarak özetlenmiş ve Kruskal-Wallis testi ile karşılaştırılmış, ardından ikili karşılaştırmalar için Bonferroni düzeltmeli Dunn post hoc testi uygulanmıştır. Okunabilirlik indeksleri, PEMAT puanları ve GQS değerleri arasındaki korelasyonlar, çoklu testler için Benjamini-Hochberg düzeltmesi uygulanarak Spearman sıra korelasyon katsayısı ile değerlendirilmiştir. İki yönlü düzeltilmiş P değeri < 0.05 istatistiksel olarak anlamlı kabul edilmiştir.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, büyük dil modellerinin (LLM'ler) ve farklı sağlık eğitimi içerik kategorilerinin, oluşturulan metinlerin okunabilirliği ve kalitesi üzerindeki etkilerini sistematik olarak değerlendirmiştir. İlk olarak; beş LLM'nin (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) performansları; hasta eğitimi uygunluğu, genel bilgi kalitesi ve PEMAT skoru, GQS ile yerleşik okunabilirlik indeksleri (ARI, FRES, GFOG, FKGL, CL, SMOG ve LW) dahil olmak üzere çok sayıda okunabilirlik metriği açısından karşılaştırılmıştır. İkinci olarak, aynı sonuç ölçümleri sağlık eğitimi içeriğinin beş tematik alanı boyunca incelenmiştir: temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyon. Bu iki analitik bakış açısını entegre ederek, model türü ve içerik kategorisinin metin kalitesini ve okunabilirliğini birlikte nasıl etkilediği daha ayrıntılı olarak araştırılmış ve böylece LLM tarafından oluşturulan hasta eğitimi materyallerindeki sistematik kalıplar belirlenmiştir.

Farklı büyük dil modelleri arasında okunabilirlik analizi

Beş büyük dil modelinin (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) oluşturduğu trigeminal nevralji ile ilgili metinlerin dilbilimsel karmaşıklığını sistematik olarak karşılaştırmak için yedi adet kabul görmüş okunabilirlik indeksi kullanılmıştır. Genel sonuçlar Tablo 4'te özetlenmiş ve bireysel okunabilirlik metriklerinin dağılımları Şekil 1A–G'de gösterilmiştir. Beş model arasında tüm okunabilirlik indeksleri için istatistiksel olarak anlamlı farklar gözlemlenmiş olup, her biri için P < 0,001 olarak belirlenmiştir.

GPT-5; ARI, GFOG, FKGL, CL ve SMOG için en yüksek medyan değerleri ve en düşük FRES değerini sergileyerek, daha uzun cümle yapılarına, daha karmaşık sözcük dağarcığına ve genel olarak en yüksek okuma yüküne sahip metinler ürettiğini göstermiştir (Şekil 1A–G). Buna karşılık, Wenxin Yiyan en düşük dilsel karmaşıklığı ortaya koymuştur. Medyan ARI, GFOG, FKGL, CL ve SMOG değerleri beş model arasında en düşük seviyedeyken, FRES değeri en yüksek olan modeldir.

Doubao, DeepSeek ve Tongyi Qianwen, GPT-5 ile Wenxin Yiyan arasında orta düzey okunabilirlik seviyeleri sergilemiştir. Doubao ve DeepSeek; ARI, GFOG, FKGL ve CL dahil olmak üzere sınıf seviyesi indekslerinde benzer performanslar göstermiş ve her ikisi de tüm P < 0.05 ile Wenxin Yiyan'dan anlamlı derecede daha yüksek değerlere sahip olmuştur. Bu bulgular, Doubao ve DeepSeek için benzer bir genel okuma yükü olduğunu ve her ikisinin de Wenxin Yiyan'dan daha yüksek dilsel karmaşıklığa sahip olduğunu göstermektedir.

Tongyi Qianwen, çoğu okunurluk indeksi genelinde genellikle Doubao/DeepSeek ile GPT-5 arasındaki değerler üretmiştir. Özellikle CL puanı GPT-5'inkine daha yakın çıkmış, bu da Doubao ve DeepSeek'ten biraz daha fazla dilsel karmaşıklığa sahip olduğunu, ancak yine de GPT-5'ten daha az karmaşık olduğunu göstermiştir. LW indeksi, diğer okunurluk metriklerinden farklı bir dağılım örüntüsü sergilemiştir. Wenxin Yiyan en yüksek LW puanını (60.00) elde etmiş, onu sırasıyla Tongyi Qianwen, DeepSeek ve Doubao izlemiş, GPT-5 ise en düşük LW puanına (46.50) sahip olmuştur. Bu farklılık, bireysel okunurluk formüllerinin cümle uzunluğu ve kelime zorluğunu nasıl ağırlıklandırdığındaki farklılıkları yansıtmaktadır (Şekil 1G).

Genel olarak, beş büyük dil modeli arasında dilsel karmaşıklık açısından önemli farklar gözlemlenmiştir. GPT-5 dilsel açıdan en karmaşık metni oluşturmuş, Wenxin Yiyan en okunabilir içeriği üretmiş ve geri kalan modeller, yapısal farklılıklar belirgin olsa da orta düzeyde okunabilirlik sergilemiştir.

Büyük dil modelleri arasında hasta eğitimi uygunluğunun ve genel kalitesinin karşılaştırılması

PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu açısından, beş dil modeli arasında tüm P < 0.001 olmak üzere anlamlı farklılıklar gözlemlenmiştir (Şekil 1H; Tablo 4). GPT-5, uzmanlar tarafından verilen en yüksek PEMAT puanına (9,40 ± 1,90) ulaşarak mevcut kıyaslama çerçevesinde daha yüksek bir eğitim uygunluğu sergilemiştir. Bununla birlikte, bu bulgu, GPT-5 tarafından oluşturulan materyallerin gerçek hasta kavrayışını, memnuniyetini, güvenini, sağlık davranışlarını veya klinik sonuçları iyileştirdiğine dair bir kanıt olarak yorumlanmamalıdır.

DeepSeek orta düzeyde bir PEMAT puanı (6.80 ± 1.06) elde etmiş olup, nispeten dar bir puan dağılımı sergilemiş; bu durum, hasta eğitim materyalleri oluşturmada tutarlı bir performans gösterdiğine işaret etmektedir. Buna rağmen, genel eğitim uygunluğu GPT-5'ten anlamlı derecede düşük kalmıştır (P < 0.001). Doubao, Tongyi Qianwen ve Wenxin Yiyan ise daha düşük PEMAT puanları (sırasıyla 5.35 ± 1.04, 5.65 ± 1.09 ve 5.35 ± 0.93) üretmiştir. Bu üç model arasında anlamlı bir fark gözlenmemiş olup, tümü DeepSeek ve GPT-5'ten anlamlı derecede daha kötü performans göstermiştir (tümleri için P < 0.01). Bu bulgular, söz konusu modeller arasında, özellikle öğretimsel netlik, dilsel organizasyon ve anlaşılabilirlik açısından karşılaştırılabilir ancak sınırlı bir eğitim uygunluğu olduğunu göstermektedir.

GQS kullanılarak değerlendirilen genel bilgi kalitesi için de benzer bir örüntü gözlemlenmiştir (Şekil 1I). Beş model arasında, tamamı P < 0.001 olan istatistiksel olarak anlamlı farklar tespit edilmiştir. GPT-5 en yüksek GQS puanına (4,00 ± 0,65) ulaşmıştır. Puanları, sınırlı bir değişkenlikle 4–5 aralığında yoğunlaşmış olup bu durum; içerik tutarlılığı, yapısal tamlık ve pratik fayda açısından sürekli olarak yüksek performans sergilendiğini göstermektedir.

Sırasıyla 3,35 ± 0,59 ve 3,40 ± 0,50 GQS puanları ile DeepSeek ve Doubao bunu takip etti. Puan dağılımları 3 ile 4 arasında yoğunlaşarak orta düzeyde bilgi kalitesine ve makul bir güvenilirliğe işaret etti. Buna karşılık, Tongyi Qianwen ve Wenxin Yiyan en düşük GQS puanlarını (sırasıyla 2,50 ± 0,51 ve 2,20 ± 0,52) aldı. Dağılımları ölçeğin alt ucuna doğru kaymış olup bu durum; bilgi doğruluğu, yapısal titizlik ve içerik derinliğindeki kısıtlamalara işaret ederek hasta eğitimi için kullanışlılıklarını azaltabilmektedir.

Genel olarak, bu veri setinde GPT-5 uzmanlar tarafından değerlendirilen en yüksek PEMAT ve GQS puanlarını elde ederken, DeepSeek ve Doubao orta düzeyde performans göstermiştir. Tongyi Qianwen ve Wenxin Yiyan ise daha düşük GQS dereceleri almıştır. Bu bulgular, uzmanlar tarafından puanlanmış kıyaslama sonuçlarını temsil etmektedir ve klinik hazırlığa veya hasta düzeyindeki etkinliğe dair bir kanıt olarak yorumlanmamalıdır.

Sağlık eğitimi içerik kategorileri arasında okunabilirlik, hasta eğitimi uygunluğu ve genel kalitenin karşılaştırılması

İçerik kategorisine göre yapılan analiz, beş sağlık eğitimi teması arasında okunurluk açısından anlamlı farklılıklar olduğunu ortaya koymuştur (Tablo 5). FRES için tematik kategoriler arasında istatistiksel olarak anlamlı farklılıklar gözlemlenmiştir (P = 0.004). Daha yüksek FRES değerleri, daha kolay okunurluğa işaret eder. Temel hastalık bilgisi metinleri en yüksek okunurluğa sahipken (medyan = 28.50), bunu tanısal içerik (medyan = 16.00), etiyoloji ve risk faktörü içeriği (medyan = 12.50) ve tedaviyle ilgili içerik (medyan = 11.50) izlemiştir. Buna karşılık, önleme ve rehabilitasyon metinleri en düşük okunurluğu sergileyerek (medyan FRES = 1.00) en yüksek okuma zorluğunu göstermiştir.

Benzer örüntüler diğer okunabilirlik indekslerinde de gözlemlenmiştir. GFOG ve FKGL, tematik kategoriler arasında anlamlı farklılıklar göstermiştir (P = 0,002 ve P = 0,036), her iki indeks de etiyoloji ile risk faktörleri ve önleme ile rehabilitasyon içerikleri için daha yüksek okuma seviyelerine işaret etmiştir. SMOG indeksi de benzer şekilde, etiyoloji ve risk faktörü metinlerinin daha yüksek oranda çok heceli kelimeler içerdiğini göstermiştir (P = 0,039). En büyük farklılıklar CL için gözlemlenmiştir (P < 0,001). Önleme ve rehabilitasyon metinleri, okuma zorluğunu önemli ölçüde artıran en uzun cümlelere (medyan = 21,01) sahipken, temel hastalık bilgisi metinleri en düşük okuma yüküne karşılık gelen en kısa cümlelere (medyan = 14,88) sahiptir. ARI veya LW için içerik kategorileri arasında anlamlı bir fark gözlemlenmemiştir.

PEMAT puanlarına göre beş içerik kategorisi arasında hasta eğitimi uygunluğu açısından istatistiksel olarak anlamlı bir fark saptanmadı (P = 0.252). Ortalama PEMAT puanları 5,90 ile 7,20 arasında değişerek, dilsel karmaşıklıktaki belirgin farklılıklara rağmen eğitim uygunluğunun temalar arasında nispeten tutarlı kaldığını göstermiştir. Benzer şekilde, GQS kullanılarak değerlendirilen genel bilgi kalitesi, içerik kategorileri arasında anlamlı bir farklılık göstermedi (P = 0.822). Ortalama GQS değerleri 2,95 ile 3,25 arasında değişerek genel bilgi kalitesinin içerik temaları genelinde nispeten stabil olduğunu göstermiştir.

Genel olarak, sağlık eğitimi temaları arasında okunabilirlik açısından önemli farklılıklar gözlemlenmiş; etyoloji ve risk faktörü içerikleri ile önleme ve rehabilitasyon içerikleri en yüksek okuma zorluğunu sergilerken, temel hastalık bilgisi içeriği en okunabilir olan kategori olarak belirlenmiştir. Buna karşılık, hasta eğitiminin uygunluğu ve bilgi kalitesinin geneli, içerik kategorileri arasında nispeten tutarlı kalmıştır.

Okunabilirlik, hasta eğitimi uygunluğu ve genel kalite arasındaki korelasyon analizi

Şekil 2'deki korelasyon matrisi, okunabilirlik indeksleri arasında tutarlı ve güçlü ilişkiler olduğunu göstererek yüksek bir iç tutarlılığa işaret etmektedir. ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği, 0,64 ile 0,97 arasında değişen korelasyon katsayıları ile birbirleriyle orta-güçlü pozitif korelasyonlar sergilemiştir (tüm P < 0,001). Bu bulgular, dilsel karmaşıklığın değerlendirilmesinde bu indekslerin tamamlayıcı doğasını daha da desteklemektedir. Buna karşılık FRES; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere birden fazla okunabilirlik metriği ile 0,70'ten büyük mutlak korelasyon katsayılarına sahip anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Bu örüntü, daha yüksek puanların daha yüksek okunabilirliğe işaret ettiği FRES'in ters puanlama yönünü yansıtmaktadır. LW indeksi de ARI, FKGL, GFOG ve SMOG dahil olmak üzere diğer okunabilirlik indeksleri ile 0,75 ile 0,90 arasında değişen mutlak korelasyon katsayıları ile anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Aksine, LW ile FRES arasında pozitif korelasyon saptanmıştır (korelasyon katsayısı = 0,69, P < 0,001).

Okunabilirlik indeksleri ile GQS tarafından ölçülen genel bilgi kalitesi arasında da belirgin ilişkiler gözlemlenmiştir. GQS; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği ile 0,326 ile 0,391 arasında değişen korelasyon katsayılarına sahip (tüm P < 0,001) düşük ila orta düzeyde pozitif korelasyonlar göstermiştir. Bu bulgular, daha yüksek dilsel karmaşıklığın, uzmanlar tarafından değerlendirilen daha yüksek bilgi kalitesi ile ilişkili olduğunu göstermektedir. Aksine GQS, FRES ile orta düzeyde negatif korelasyon göstermiştir (korelasyon katsayısı = −0,408, P < 0,001); bu durum, daha yüksek bir okuma seviyesi gerektiren metinlerin genellikle daha yüksek GQS puanları aldığını göstermektedir. GQS ayrıca LW ile de orta düzeyde negatif bir korelasyon göstermiştir (korelasyon katsayısı = −0,421, P < 0,001).

Okunabilirlik ile PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu arasındaki ilişkiler genel olarak daha zayıftı ancak yönsel olarak tutarlıydı. PEMAT skorları; ARI, GFOG, FKGL, CL ve SMOG ile 0,305 ile 0,434 arasında değişen korelasyon katsayılarıyla (tümleri P < 0,01) zayıf pozitif korelasyonlar gösterdi. Buna karşın, PEMAT skorları FRES ve LW ile sırasıyla 0,432 ve 0,320 mutlak korelasyon katsayılarıyla zayıf negatif korelasyon gösterdi (her ikisi de P < 0,01). Bu bulgular, bu veri seti dahilinde, ilişkilerin gücü sınırlı olsa da, daha yüksek dilsel karmaşıklığın uzmanlar tarafından değerlendirilen eğitim uygunluğunun orta derecede daha yüksek olmasıyla ilişkili olduğunu göstermektedir.

Önemli bir bulgu olarak, PEMAT ve GQS puanları arasında orta düzeyde pozitif bir korelasyon gözlemlenmiştir (korelasyon katsayısı = 0.645, P < 0.001). Bu, değerlendirme alanları arasında gözlemlenen en güçlü ilişki olup, eğitimsel uygunluğu daha yüksek olan yanıtların genel bilgi kalitesi açısından da daha yüksek puanlar alma eğiliminde olduğunu göstermektedir.

VERİ ERİŞİLEBİLİRLİĞİ:

Bu çalışmayı destekleyen tam veri seti ek materyal olarak sunulmuştur. Ek Dosya 1, standardize edilmiş soruların, istemlerin ve arşivlenmiş 100 LLM tarafından oluşturulmuş yanıtın tam listesini içermektedir. Ek Tablo 2, mümkün olan durumlarda madde düzeyindeki PEMAT değerlendirmeleri, toplam PEMAT puanları, GQS puanları, değerlendirici karşılaştırma bilgileri ve uygun olduğunda hakem kararı kayıtları dahil olmak üzere uzman PEMAT ve GQS puanlama çizelgelerini içermektedir. Okunabilirlik puanları, şekil kaynak verileri ve R analiz kodu Ek Dosya 2 olarak sunulmuştur. Model güncellemeleri, arayüz değişiklikleri ve platform düzeyindeki modifikasyonlar nedeniyle LLM çıktıları zamanla değişebileceğinden, doğrulama ve ikincil analizler için yeniden oluşturulan yanıtlar yerine arşivlenmiş çıktılar kullanılmalıdır.

figure-results-1
Şekil 1: Beş büyük dil modeli arasında okunabilirlik, hasta eğitimi uygunluğu ve genel bilgi kalitesinin karşılaştırılması. (A–G) Bu panel okunabilirlik indekslerini sunmaktadır: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) ve Linsear Write Formula (LW). (H) Bu panel toplam PEMAT skorlarını, panel (I) ise Global Kalite Skorlarını (GQS) göstermektedir. Her bir kutu grafiğinde, orta çizgi medyanı temsil eder, kutu çeyrekler arası aralığı (IQR) belirtir, bıyıklar 1.5 × IQR kadar uzanır ve bıyıkların ötesindeki noktalar aykırı değerleri temsil eder. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Anlaşılabilirlik ve Uygulanabilirlik için Hasta Eğitimi Materyalleri Değerlendirme Aracı, yazdırılabilir format; Global Kalite Skoru = GQS. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: Tüm model tarafından oluşturulan yanıtlar genelinde okunabilirlik indeksleri, hasta eğitimi uygunluğu ve genel bilgi kalitesi arasındaki Spearman korelasyon matrisi. Matris; ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT ve GQS arasındaki ikili ilişkiler için Spearman korelasyon katsayılarını rapor etmektedir. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Tablo 1: Trigeminal nevralji ile ilgili 20 sorunun listesi. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tablo 2: Okunabilirlik araçları, formülleri ve açıklamaları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tablo 3: Küresel Kalite Skoru (GQS) kalite kriterleri. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tablo 4: Trigeminal nevralji ile ilgili en yaygın sorular için farklı büyük dil modellerinin analiz sonuçları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tablo 5: Trigeminal nevralji ile ilgili en yaygın soruların farklı boyutlar üzerinden analiz sonuçları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Tablo 1: Değerlendirilen tüm okunurluk indeksleri üzerinden beş büyük dil modeli tarafından oluşturulan yanıtların okunurluk puanları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Tablo 2: Beş büyük dil modeli tarafından oluşturulan yanıtların hasta eğitimi uygunluğu (PEMAT) ve genel bilgi kalitesi (GQS) için uzman puanlamaları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Dosya 1: Beş büyük dil modeli tarafından oluşturulan standardize trigeminal nevralji soruları ve eksiksiz yanıtlar. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Dosya 2: İstatistiksel analizler ve şekil oluşturma için kullanılan R scriptleri ve kaynak veriler. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu kesitsel kıyaslama çalışması, halka açık beş büyük dil modeli (LLM) tarafından oluşturulan trigeminal nevralji (TN) hasta eğitim materyallerinin okunabilirliğini, eğitimsel uygunluğunu ve genel bilgi kalitesini sistematik olarak karşılaştırmıştır. Dört temel bulgu ortaya çıkmıştır. İlk olarak, okunabilirlik modeller arasında önemli ölçüde farklılık göstermiş; GPT-5 dilsel olarak en karmaşık yanıtları üretirken, Wenxin Yiyan en okunabilir içeriği oluşturmuştur. İkinci olarak, okunabilirlik ile uzmanlar tarafından puanlanan bilgi kalitesinin farklı değerlendirme boyutları olduğu görülmüş ve GPT-5, düşük okunabilirliğine rağmen en yüksek PEMAT ve GQS puanlarını almıştır. Üçüncü olarak, içerik temasının okunabilirliği etkilediği; önleme, rehabilitasyon, etiyoloji ve risk faktörü konularının genellikle daha yüksek okuma seviyeleri gerektirdiği, PEMAT ve GQS değerlerinin ise içerik kategorileri arasında nispeten sabit kaldığı tespit edilmiştir. Son olarak, okunabilirlik indeksleri güçlü bir iç tutarlılık göstermiş ve korelasyon analizleri, dilsel karmaşıklık ile hem PEMAT hem de GQS arasında zayıf ila orta düzeyde pozitif ilişkiler olduğunu, ayrıca PEMAT ile GQS arasında orta düzeyde pozitif bir korelasyon olduğunu ortaya koymuştur. Toplu olarak bu bulgular, tıbbi eksiksizlik ile dilsel erişilebilirlik arasındaki dengenin kurulması gerektiğini vurgularken, LLM tarafından oluşturulan TN hasta eğitim materyallerini değerlendirmek için bir kıyaslama noktası sağlamaktadır. Önemli bir nokta olarak, bu sonuçlar uzmanlar tarafından puanlanmış kıyaslama çıktılarını temsil etmekte olup; hasta kavrayışının, olgusal doğruluğun, klinik güvenliğin veya rutin klinik kullanıma uygunluğun kanıtı olarak yorumlanmamalıdır.

Bu çalışmanın bulguları, LLM'ler arasında önemli değişkenlikler olduğunu ve okunabilirlik ile bilgi kalitesi arasında sıkça kopukluk yaşandığını bildiren, yapay zeka tarafından oluşturulan tıbbi bilgilere yönelik önceki değerlendirmelerle tutarlıdır26,27,29. Birden fazla hastalık alanında yürütülen önceki çalışmalar, LLM tarafından oluşturulan hasta eğitim materyallerinin genellikle önerilen okuma seviyelerini aştığını ve en okunabilir metinleri üreten modellerin her zaman en kapsamlı veya en yüksek kaliteli bilgileri sağlamadığını göstermiştir26,30. TN eğitimiyle ilgili bulgular bu gözlemi desteklemektedir. GPT-5, dilsel olarak en karmaşık yanıtları üretmesine rağmen en yüksek PEMAT ve GQS puanlarını elde ederken, Wenxin Yiyan daha okunabilir metinler üretmiş ancak uzmanlar tarafından değerlendirilen eğitim uygunluğu ve genel kalitede daha düşük puanlar almıştır. Ayrıca, okunabilirlik tematik alanlara göre farklılık göstermiş; önleme ve rehabilitasyon ile etiyoloji ve risk faktörü konuları genellikle daha fazla dilsel karmaşıklık sergilemiştir; bu durum, hem model özelliklerinin hem de konu karmaşıklığının okuma zorluğunu etkilediğini göstermektedir31.

Okunabilirlik ile bilgi kalitesi arasındaki görünür ödünleşim, değerlendirme araçları tarafından ölçülen farklı yapılarla tutarlıdır. Okunabilirlik formülleri öncelikle cümle uzunluğu ve sözcük karmaşıklığı gibi yüzeysel dilsel özellikleri değerlendirirken, PEMAT ve GQS; bilgi organizasyonu, tamlık, açıklamaların netliği ve uygulanabilirlik dahil olmak üzere daha üst düzey nitelikleri değerlendirir32. TN eğitimi için yüksek kaliteli yanıtlar sıklıkla kırmızı bayrak semptomları, ayırıcı tanı, farmakolojik yönetim ve yan etkiler,le girişimsel ve cerrahi seçenekler ile bireyselleştirilmiş rehabilitasyon stratejilerine ilişkin tartışmaları içerir33. Bu tür klinik olarak kapsamlı içerikler, terminolojik yoğunluğu ve sözdizimsel karmaşıklığı kaçınılmaz olarak artırarak daha yüksek okunabilirlik skorlarına ve uzmanlarca puanlanan eğitim kalitesinde artışa yol açar. Önemle belirtilmelidir ki, bu bulgular daha karmaşık bir dilin tercih edildiği şeklinde yorumlanmamalıdır. Aksine, mevcut LLM'lerin genellikle dilsel erişilebilirlik pahasına bilgi tamlığını artırdığını göstermektedir. Bu nedenle, hasta eğitim sistemlerinin gelecekteki geliştirme süreçleri; sade dille revizyon, temel noktaların yapılandırılmış sunumu, teknik terminolojinin açıklanması ve farklı sağlık okuryazarlığı seviyelerine sahip hastalar için uygun, net ve uygulanabilir rehberlik yoluyla dili sadeleştirirken tıbbi doğruluğu korumaya odaklanmalıdır11,34,35.

Korelasyon analizi, okunabilirlik ile eğitimsel kalite arasındaki ayrımı daha da desteklemektedir. Sınıf düzeyi tabanlı çoğu okunabilirlik indeksinin hem PEMAT hem de GQS ile zayıf ila orta düzeyde pozitif ilişkiler gösterdiği, buna karşın FRES'in, daha yüksek FRES skorlarının daha kolay okunabilirliği belirttiği nedeniyle beklenen ters ilişkiyi gösterdiği görülmüştür. Bu bulgular, daha yüksek dilsel karmaşıklığın arzu edilir olduğu anlamına gelmemektedir; aksine, mevcut LLM'lerin sıklıkla erişilebilirlik pahasına daha yüksek bilgilendirici tamamlığa ulaştıklarını göstermektedir34. Buna göre, yapay zeka destekli hasta eğitiminin geliştirilmesi, tıbbi doğruluğu ve tamamlığı önceliklendirirken aynı zamanda sade dil düzenlemelerini, temel noktaların yapılandırılmış sunumunu, teknik terminolojinin açık açıklamalarını ve farklı sağlık okuryazarlığı seviyelerine sahip hastalara göre uyarlanmış uygulanabilir önerileri içermelidir11,35.

Ek bir metodolojik bulgu, LW indeksinin diğer okunabilirlik ölçümleriyle karşılaştırıldığında sergilediği belirgin davranıştır. ARI, FKGL, GFOG, CL ve SMOG'un aksine LW, okunabilirlik formüllerinin metin karmaşıklığını işleme biçimlerindeki farklılıkları yansıtacak şekilde, FRES'e daha benzer bir örüntü izlemiştir36. LW başlangıçta teknik kılavuzlar için geliştirildiğinden ve genel cümle veya hece özelliklerinden ziyade örneklenen cümle yapısına ve kelime sınıflandırmasına önem verdiğinden; kısa ifadeleri daha uzun açıklayıcı pasajlarla ve teknik terminolojinin düzensiz dağılımlarıyla birleştiren yapay zeka tarafından oluşturulmuş tıbbi metinlere farklı tepki verebilir37,38. Hiçbir tekil okunabilirlik indeksinin metin karmaşıklığının tüm boyutlarını yeterince yakalayamaması nedeniyle, bu bulgular çoklu metrik değerlendirme çerçevesinin önemini pekiştirmektedir. Yapay zeka tarafından oluşturulan sağlık bilgilerine ilişkin önceki çalışmalarla tutarlı olarak, genel okunabilirlik, herhangi bir tekil ölçümden ziyade birden fazla tamamlayıcı indeks arasındaki yakınsayan kanıtlar kullanılarak yorumlanmalıdır39.

İçerik kategorisi de okunabilirliği etkilemiştir. Önleme, rehabilitasyon, etiyoloji ve risk faktörü konuları, genel olarak temel hastalık bilgilerine kıyasla daha yüksek okuma zorluğuna sahip metinler üretmiştir; bunun nedeni muhtemelen bu konuların koşullu öneriler, mekanistik açıklamalar ve daha uzmanlaşmış terminoloji gerektirmesidir40,41. Buna karşılık, temel hastalık bilgileri öncelikle tanımlara dayalıdır ve daha basit bir dille aktarılabilir42. Bu farklılıklara rağmen, PEMAT ve GQS puanları tematik alanlar genelinde nispeten tutarlı kalmıştır; bu durum, uzmanlar tarafından değerlendirilen eğitsel uygunluğun ve genel bilgi kalitesinin farklı hasta soruları genelinde korunduğunu göstermektedir35,43.

Bu bulguların klinik uygulama ve gelecekteki LLM geliştirme süreçleri için çeşitli çıkarımları vardır. Hastaların tıbbi konsültasyonlar öncesinde veya sonrasında bilgi edinmek için LLM'leri kullanımı arttıkça, yapay zeka tarafından oluşturulan içerikler; özellikle ilaç güvenliği, girişimsel veya cerrahi tedavi endikasyonları ve acil değerlendirme gerektiren kırmızı bayrak semptomlarının tanınması konularında, klinisyen danışmanlığının yerini almak yerine onu tamamlayıcı nitelikte olmalıdır44. Sağlık kuruluşları, LLM'leri otonom hasta eğitim sistemleri olarak kullanmak yerine, taslak oluşturma veya karar destek araçları olarak kullanırken, uzmanlarca gözden geçirilmiş ve yalın dille hazırlanmış eğitim kaynakları sağlayarak fayda sağlayabilirler. Gelecekteki modeller; klinik uygulamaya geçilmeden önce okunabilirlik farkındalığına sahip oluşturma stratejilerini, model sürümlerinin ve oluşturma tarihlerinin şeffaf raporlanmasını, belirsizliğin açıkça iletilmesini ve klinisyen incelemesi, olgusal doğruluk doğrulaması, halüsinasyon taraması, ilaç güvenliği kontrolleri, kırmızı bayrak kılavuzluğu ve hasta anlama testlerini içeren yönetişim prosedürlerini bünyesine katmalıdır26,44,45.

Bu çalışmanın birkaç kısıtlılığı bulunmaktadır. Model çıktıları, tek bir tarihte halka açık web arayüzlerinden toplanmıştır ve sonraki model güncellemeleri, arayüz değişiklikleri, gizli sistem istemleri veya varsayılan oluşturma ayarları tekrarlanabilirliği etkileyebilir. 20 soruluk set, hasta arama kayıtlarından veya resmi hasta görüşmelerinden türetilmek yerine klinik uzmanlar tarafından geliştirilmiştir; bu uygulama seçim yanlılığına yol açabilir. Ayrıca, çalışma uzmanlar tarafından puanlanan PEMAT ve GQS değerlendirmelerine dayanmış olup hastaların anlamasını, güvenini, memnuniyetini, sağlık davranışlarını veya klinik sonuçları değerlendirmemiştir. Okunabilirlik formülleri, PEMAT ve GQS ayrıca olgusal doğruluğu, halüsinasyon riskini, atıf doğruluğunu, kontrendikasyonların eksiksizliğini veya klinik güvenliği doğrudan değerlendirmez. Sonuç olarak, bu bulgular, herhangi bir LLM tarafından üretilen materyalin rutin klinik kullanıma hazır olduğuna dair bir kanıttan ziyade, uzmanlarca puanlanmış kesitsel bir kıyaslama analizi olarak yorumlanmalıdır. Gelecekteki çalışmalar, LLM tarafından üretilen eğitim materyalleri klinik uygulama için değerlendirilmeden önce, arşivlenmiş model çıktılarını, ayrıntılı model meta verilerini, çok dilli değerlendirmeleri, daha geniş soru setlerini, resmi güvenlik denetimlerini, olgusal doğruluk değerlendirmelerini ve hasta merkezli sonuç ölçümlerini içermelidir.

Uzmanlar tarafından değerlendirilen bu kesitsel kıyaslama çalışmasında, halka açık büyük dil modellerinin trigeminal nevralji hasta eğitim materyallerinin okunabilirliği, eğitimsel uygunluğu ve genel bilgi kalitesi açısından önemli ölçüde farklılık gösterdiği saptanmıştır. GPT-5, uzmanlar tarafından puanlanan en yüksek PEMAT ve GQS skorlarını elde etmiş ancak aynı zamanda dilsel olarak en karmaşık yanıtları üretmiştir; bu durum, okunabilirliğin ve uzmanlarca değerlendirilen eğitimsel kalitenin, hasta eğitiminin birbiriyle ilişkili ancak farklı boyutlarını temsil ettiğini vurgulamaktadır. Bazı modellerin daha okunabilir içerikler üretmiş olması, bunun mutlaka daha yüksek eğitimsel uygunluk veya genel bilgi kalitesi anlamına gelmediği görülmüştür. Bu çalışma; gerçek olguların doğruluğunu özel bir güvenlik denetimiyle değerlendirmediği, halüsinasyon riskini, atıf doğruluğunu, hasta kavrayışını, güveni, memnuniyeti, sağlık davranışlarını veya klinik sonuçları incelemediği için, bulgular klinik hazırlığa dair bir kanıttan ziyade uzman değerlendirmeli bir kıyaslama analizi olarak yorumlanmalıdır. Gelecekteki çalışmalar, LLM tarafından oluşturulan materyallerin hasta eğitiminde güvenli ve etkili kullanımını desteklemek için uzman incelemesini, resmi güvenlik ve gerçek doğruluk değerlendirmelerini ve hasta merkezli değerlendirmeleri entegre etmelidir.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, herhangi bir çıkar çatışmasının olmadığını beyan ederler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu araştırma, kamu, ticari veya kâr amacı gütmeyen sektörlerdeki herhangi bir finansman kuruluşundan özel bir hibe almamıştır. Yazarlar, trigeminal nevralji soru seti hakkında geri bildirim sağlayan ve değerlendirme çerçevesinin geliştirilmesine yardımcı olan klinik meslektaşlarına teşekkür eder. Ayrıca, taslağın hazırlanması ve revizyonu aşamasında destek veren tüm katkıda bulunanlara teşekkür ederiz.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
DeepSeek sohbet platformuDeepSeekhttps://chat.deepseek.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
Doubao sohbet platformuDoubaohttps://www.doubao.com/chat/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
GPT 5 OpenAIhttps://chat.openai.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
R yazılımı, versiyon 4.4.3R Foundation for Statistical ComputingUygulanamazİstatistiksel analiz ve görselleştirme
Readability Formulas çevrimiçi okunabilirlik hesaplayıcısıReadability FormulasUygulanamazOkunabilirlik indekslerini hesaplamak için kullanılan çevrimiçi araç
Tongyi Qianwen sohbet platformuTongyi Qianwenhttps://www.tongyi.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
Wenxin Yiyan sohbet platformuWenxin Yiyanhttps://yiyan.baidu.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

B y k Dil ModelleriOkunabilirlik De erlendirmesiE itsel KalitePEMAT De erlendirmesiGlobal Kalite SkoruSa l k Bilgisi KalitesiModel Kar la t rmasHasta Kavray

İlgili makaleler