$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, büyük dil modellerinin (LLM'ler) ve farklı sağlık eğitimi içerik kategorilerinin, oluşturulan metinlerin okunabilirliği ve kalitesi üzerindeki etkilerini sistematik olarak değerlendirmiştir. İlk olarak; beş LLM'nin (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) performansları; hasta eğitimi uygunluğu, genel bilgi kalitesi ve PEMAT skoru, GQS ile yerleşik okunabilirlik indeksleri (ARI, FRES, GFOG, FKGL, CL, SMOG ve LW) dahil olmak üzere çok sayıda okunabilirlik metriği açısından karşılaştırılmıştır. İkinci olarak, aynı sonuç ölçümleri sağlık eğitimi içeriğinin beş tematik alanı boyunca incelenmiştir: temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyon. Bu iki analitik bakış açısını entegre ederek, model türü ve içerik kategorisinin metin kalitesini ve okunabilirliğini birlikte nasıl etkilediği daha ayrıntılı olarak araştırılmış ve böylece LLM tarafından oluşturulan hasta eğitimi materyallerindeki sistematik kalıplar belirlenmiştir.
Farklı büyük dil modelleri arasında okunabilirlik analizi
Beş büyük dil modelinin (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) oluşturduğu trigeminal nevralji ile ilgili metinlerin dilbilimsel karmaşıklığını sistematik olarak karşılaştırmak için yedi adet kabul görmüş okunabilirlik indeksi kullanılmıştır. Genel sonuçlar Tablo 4'te özetlenmiş ve bireysel okunabilirlik metriklerinin dağılımları Şekil 1A–G'de gösterilmiştir. Beş model arasında tüm okunabilirlik indeksleri için istatistiksel olarak anlamlı farklar gözlemlenmiş olup, her biri için P < 0,001 olarak belirlenmiştir.
GPT-5; ARI, GFOG, FKGL, CL ve SMOG için en yüksek medyan değerleri ve en düşük FRES değerini sergileyerek, daha uzun cümle yapılarına, daha karmaşık sözcük dağarcığına ve genel olarak en yüksek okuma yüküne sahip metinler ürettiğini göstermiştir (Şekil 1A–G). Buna karşılık, Wenxin Yiyan en düşük dilsel karmaşıklığı ortaya koymuştur. Medyan ARI, GFOG, FKGL, CL ve SMOG değerleri beş model arasında en düşük seviyedeyken, FRES değeri en yüksek olan modeldir.
Doubao, DeepSeek ve Tongyi Qianwen, GPT-5 ile Wenxin Yiyan arasında orta düzey okunabilirlik seviyeleri sergilemiştir. Doubao ve DeepSeek; ARI, GFOG, FKGL ve CL dahil olmak üzere sınıf seviyesi indekslerinde benzer performanslar göstermiş ve her ikisi de tüm P < 0.05 ile Wenxin Yiyan'dan anlamlı derecede daha yüksek değerlere sahip olmuştur. Bu bulgular, Doubao ve DeepSeek için benzer bir genel okuma yükü olduğunu ve her ikisinin de Wenxin Yiyan'dan daha yüksek dilsel karmaşıklığa sahip olduğunu göstermektedir.
Tongyi Qianwen, çoğu okunurluk indeksi genelinde genellikle Doubao/DeepSeek ile GPT-5 arasındaki değerler üretmiştir. Özellikle CL puanı GPT-5'inkine daha yakın çıkmış, bu da Doubao ve DeepSeek'ten biraz daha fazla dilsel karmaşıklığa sahip olduğunu, ancak yine de GPT-5'ten daha az karmaşık olduğunu göstermiştir. LW indeksi, diğer okunurluk metriklerinden farklı bir dağılım örüntüsü sergilemiştir. Wenxin Yiyan en yüksek LW puanını (60.00) elde etmiş, onu sırasıyla Tongyi Qianwen, DeepSeek ve Doubao izlemiş, GPT-5 ise en düşük LW puanına (46.50) sahip olmuştur. Bu farklılık, bireysel okunurluk formüllerinin cümle uzunluğu ve kelime zorluğunu nasıl ağırlıklandırdığındaki farklılıkları yansıtmaktadır (Şekil 1G).
Genel olarak, beş büyük dil modeli arasında dilsel karmaşıklık açısından önemli farklar gözlemlenmiştir. GPT-5 dilsel açıdan en karmaşık metni oluşturmuş, Wenxin Yiyan en okunabilir içeriği üretmiş ve geri kalan modeller, yapısal farklılıklar belirgin olsa da orta düzeyde okunabilirlik sergilemiştir.
Büyük dil modelleri arasında hasta eğitimi uygunluğunun ve genel kalitesinin karşılaştırılması
PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu açısından, beş dil modeli arasında tüm P < 0.001 olmak üzere anlamlı farklılıklar gözlemlenmiştir (Şekil 1H; Tablo 4). GPT-5, uzmanlar tarafından verilen en yüksek PEMAT puanına (9,40 ± 1,90) ulaşarak mevcut kıyaslama çerçevesinde daha yüksek bir eğitim uygunluğu sergilemiştir. Bununla birlikte, bu bulgu, GPT-5 tarafından oluşturulan materyallerin gerçek hasta kavrayışını, memnuniyetini, güvenini, sağlık davranışlarını veya klinik sonuçları iyileştirdiğine dair bir kanıt olarak yorumlanmamalıdır.
DeepSeek orta düzeyde bir PEMAT puanı (6.80 ± 1.06) elde etmiş olup, nispeten dar bir puan dağılımı sergilemiş; bu durum, hasta eğitim materyalleri oluşturmada tutarlı bir performans gösterdiğine işaret etmektedir. Buna rağmen, genel eğitim uygunluğu GPT-5'ten anlamlı derecede düşük kalmıştır (P < 0.001). Doubao, Tongyi Qianwen ve Wenxin Yiyan ise daha düşük PEMAT puanları (sırasıyla 5.35 ± 1.04, 5.65 ± 1.09 ve 5.35 ± 0.93) üretmiştir. Bu üç model arasında anlamlı bir fark gözlenmemiş olup, tümü DeepSeek ve GPT-5'ten anlamlı derecede daha kötü performans göstermiştir (tümleri için P < 0.01). Bu bulgular, söz konusu modeller arasında, özellikle öğretimsel netlik, dilsel organizasyon ve anlaşılabilirlik açısından karşılaştırılabilir ancak sınırlı bir eğitim uygunluğu olduğunu göstermektedir.
GQS kullanılarak değerlendirilen genel bilgi kalitesi için de benzer bir örüntü gözlemlenmiştir (Şekil 1I). Beş model arasında, tamamı P < 0.001 olan istatistiksel olarak anlamlı farklar tespit edilmiştir. GPT-5 en yüksek GQS puanına (4,00 ± 0,65) ulaşmıştır. Puanları, sınırlı bir değişkenlikle 4–5 aralığında yoğunlaşmış olup bu durum; içerik tutarlılığı, yapısal tamlık ve pratik fayda açısından sürekli olarak yüksek performans sergilendiğini göstermektedir.
Sırasıyla 3,35 ± 0,59 ve 3,40 ± 0,50 GQS puanları ile DeepSeek ve Doubao bunu takip etti. Puan dağılımları 3 ile 4 arasında yoğunlaşarak orta düzeyde bilgi kalitesine ve makul bir güvenilirliğe işaret etti. Buna karşılık, Tongyi Qianwen ve Wenxin Yiyan en düşük GQS puanlarını (sırasıyla 2,50 ± 0,51 ve 2,20 ± 0,52) aldı. Dağılımları ölçeğin alt ucuna doğru kaymış olup bu durum; bilgi doğruluğu, yapısal titizlik ve içerik derinliğindeki kısıtlamalara işaret ederek hasta eğitimi için kullanışlılıklarını azaltabilmektedir.
Genel olarak, bu veri setinde GPT-5 uzmanlar tarafından değerlendirilen en yüksek PEMAT ve GQS puanlarını elde ederken, DeepSeek ve Doubao orta düzeyde performans göstermiştir. Tongyi Qianwen ve Wenxin Yiyan ise daha düşük GQS dereceleri almıştır. Bu bulgular, uzmanlar tarafından puanlanmış kıyaslama sonuçlarını temsil etmektedir ve klinik hazırlığa veya hasta düzeyindeki etkinliğe dair bir kanıt olarak yorumlanmamalıdır.
Sağlık eğitimi içerik kategorileri arasında okunabilirlik, hasta eğitimi uygunluğu ve genel kalitenin karşılaştırılması
İçerik kategorisine göre yapılan analiz, beş sağlık eğitimi teması arasında okunurluk açısından anlamlı farklılıklar olduğunu ortaya koymuştur (Tablo 5). FRES için tematik kategoriler arasında istatistiksel olarak anlamlı farklılıklar gözlemlenmiştir (P = 0.004). Daha yüksek FRES değerleri, daha kolay okunurluğa işaret eder. Temel hastalık bilgisi metinleri en yüksek okunurluğa sahipken (medyan = 28.50), bunu tanısal içerik (medyan = 16.00), etiyoloji ve risk faktörü içeriği (medyan = 12.50) ve tedaviyle ilgili içerik (medyan = 11.50) izlemiştir. Buna karşılık, önleme ve rehabilitasyon metinleri en düşük okunurluğu sergileyerek (medyan FRES = 1.00) en yüksek okuma zorluğunu göstermiştir.
Benzer örüntüler diğer okunabilirlik indekslerinde de gözlemlenmiştir. GFOG ve FKGL, tematik kategoriler arasında anlamlı farklılıklar göstermiştir (P = 0,002 ve P = 0,036), her iki indeks de etiyoloji ile risk faktörleri ve önleme ile rehabilitasyon içerikleri için daha yüksek okuma seviyelerine işaret etmiştir. SMOG indeksi de benzer şekilde, etiyoloji ve risk faktörü metinlerinin daha yüksek oranda çok heceli kelimeler içerdiğini göstermiştir (P = 0,039). En büyük farklılıklar CL için gözlemlenmiştir (P < 0,001). Önleme ve rehabilitasyon metinleri, okuma zorluğunu önemli ölçüde artıran en uzun cümlelere (medyan = 21,01) sahipken, temel hastalık bilgisi metinleri en düşük okuma yüküne karşılık gelen en kısa cümlelere (medyan = 14,88) sahiptir. ARI veya LW için içerik kategorileri arasında anlamlı bir fark gözlemlenmemiştir.
PEMAT puanlarına göre beş içerik kategorisi arasında hasta eğitimi uygunluğu açısından istatistiksel olarak anlamlı bir fark saptanmadı (P = 0.252). Ortalama PEMAT puanları 5,90 ile 7,20 arasında değişerek, dilsel karmaşıklıktaki belirgin farklılıklara rağmen eğitim uygunluğunun temalar arasında nispeten tutarlı kaldığını göstermiştir. Benzer şekilde, GQS kullanılarak değerlendirilen genel bilgi kalitesi, içerik kategorileri arasında anlamlı bir farklılık göstermedi (P = 0.822). Ortalama GQS değerleri 2,95 ile 3,25 arasında değişerek genel bilgi kalitesinin içerik temaları genelinde nispeten stabil olduğunu göstermiştir.
Genel olarak, sağlık eğitimi temaları arasında okunabilirlik açısından önemli farklılıklar gözlemlenmiş; etyoloji ve risk faktörü içerikleri ile önleme ve rehabilitasyon içerikleri en yüksek okuma zorluğunu sergilerken, temel hastalık bilgisi içeriği en okunabilir olan kategori olarak belirlenmiştir. Buna karşılık, hasta eğitiminin uygunluğu ve bilgi kalitesinin geneli, içerik kategorileri arasında nispeten tutarlı kalmıştır.
Okunabilirlik, hasta eğitimi uygunluğu ve genel kalite arasındaki korelasyon analizi
Şekil 2'deki korelasyon matrisi, okunabilirlik indeksleri arasında tutarlı ve güçlü ilişkiler olduğunu göstererek yüksek bir iç tutarlılığa işaret etmektedir. ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği, 0,64 ile 0,97 arasında değişen korelasyon katsayıları ile birbirleriyle orta-güçlü pozitif korelasyonlar sergilemiştir (tüm P < 0,001). Bu bulgular, dilsel karmaşıklığın değerlendirilmesinde bu indekslerin tamamlayıcı doğasını daha da desteklemektedir. Buna karşılık FRES; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere birden fazla okunabilirlik metriği ile 0,70'ten büyük mutlak korelasyon katsayılarına sahip anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Bu örüntü, daha yüksek puanların daha yüksek okunabilirliğe işaret ettiği FRES'in ters puanlama yönünü yansıtmaktadır. LW indeksi de ARI, FKGL, GFOG ve SMOG dahil olmak üzere diğer okunabilirlik indeksleri ile 0,75 ile 0,90 arasında değişen mutlak korelasyon katsayıları ile anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Aksine, LW ile FRES arasında pozitif korelasyon saptanmıştır (korelasyon katsayısı = 0,69, P < 0,001).
Okunabilirlik indeksleri ile GQS tarafından ölçülen genel bilgi kalitesi arasında da belirgin ilişkiler gözlemlenmiştir. GQS; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği ile 0,326 ile 0,391 arasında değişen korelasyon katsayılarına sahip (tüm P < 0,001) düşük ila orta düzeyde pozitif korelasyonlar göstermiştir. Bu bulgular, daha yüksek dilsel karmaşıklığın, uzmanlar tarafından değerlendirilen daha yüksek bilgi kalitesi ile ilişkili olduğunu göstermektedir. Aksine GQS, FRES ile orta düzeyde negatif korelasyon göstermiştir (korelasyon katsayısı = −0,408, P < 0,001); bu durum, daha yüksek bir okuma seviyesi gerektiren metinlerin genellikle daha yüksek GQS puanları aldığını göstermektedir. GQS ayrıca LW ile de orta düzeyde negatif bir korelasyon göstermiştir (korelasyon katsayısı = −0,421, P < 0,001).
Okunabilirlik ile PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu arasındaki ilişkiler genel olarak daha zayıftı ancak yönsel olarak tutarlıydı. PEMAT skorları; ARI, GFOG, FKGL, CL ve SMOG ile 0,305 ile 0,434 arasında değişen korelasyon katsayılarıyla (tümleri P < 0,01) zayıf pozitif korelasyonlar gösterdi. Buna karşın, PEMAT skorları FRES ve LW ile sırasıyla 0,432 ve 0,320 mutlak korelasyon katsayılarıyla zayıf negatif korelasyon gösterdi (her ikisi de P < 0,01). Bu bulgular, bu veri seti dahilinde, ilişkilerin gücü sınırlı olsa da, daha yüksek dilsel karmaşıklığın uzmanlar tarafından değerlendirilen eğitim uygunluğunun orta derecede daha yüksek olmasıyla ilişkili olduğunu göstermektedir.
Önemli bir bulgu olarak, PEMAT ve GQS puanları arasında orta düzeyde pozitif bir korelasyon gözlemlenmiştir (korelasyon katsayısı = 0.645, P < 0.001). Bu, değerlendirme alanları arasında gözlemlenen en güçlü ilişki olup, eğitimsel uygunluğu daha yüksek olan yanıtların genel bilgi kalitesi açısından da daha yüksek puanlar alma eğiliminde olduğunu göstermektedir.
VERİ ERİŞİLEBİLİRLİĞİ:
Bu çalışmayı destekleyen tam veri seti ek materyal olarak sunulmuştur. Ek Dosya 1, standardize edilmiş soruların, istemlerin ve arşivlenmiş 100 LLM tarafından oluşturulmuş yanıtın tam listesini içermektedir. Ek Tablo 2, mümkün olan durumlarda madde düzeyindeki PEMAT değerlendirmeleri, toplam PEMAT puanları, GQS puanları, değerlendirici karşılaştırma bilgileri ve uygun olduğunda hakem kararı kayıtları dahil olmak üzere uzman PEMAT ve GQS puanlama çizelgelerini içermektedir. Okunabilirlik puanları, şekil kaynak verileri ve R analiz kodu Ek Dosya 2 olarak sunulmuştur. Model güncellemeleri, arayüz değişiklikleri ve platform düzeyindeki modifikasyonlar nedeniyle LLM çıktıları zamanla değişebileceğinden, doğrulama ve ikincil analizler için yeniden oluşturulan yanıtlar yerine arşivlenmiş çıktılar kullanılmalıdır.

Şekil 1: Beş büyük dil modeli arasında okunabilirlik, hasta eğitimi uygunluğu ve genel bilgi kalitesinin karşılaştırılması. (A–G) Bu panel okunabilirlik indekslerini sunmaktadır: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) ve Linsear Write Formula (LW). (H) Bu panel toplam PEMAT skorlarını, panel (I) ise Global Kalite Skorlarını (GQS) göstermektedir. Her bir kutu grafiğinde, orta çizgi medyanı temsil eder, kutu çeyrekler arası aralığı (IQR) belirtir, bıyıklar 1.5 × IQR kadar uzanır ve bıyıkların ötesindeki noktalar aykırı değerleri temsil eder. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Anlaşılabilirlik ve Uygulanabilirlik için Hasta Eğitimi Materyalleri Değerlendirme Aracı, yazdırılabilir format; Global Kalite Skoru = GQS. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 2: Tüm model tarafından oluşturulan yanıtlar genelinde okunabilirlik indeksleri, hasta eğitimi uygunluğu ve genel bilgi kalitesi arasındaki Spearman korelasyon matrisi. Matris; ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT ve GQS arasındaki ikili ilişkiler için Spearman korelasyon katsayılarını rapor etmektedir. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Tablo 1: Trigeminal nevralji ile ilgili 20 sorunun listesi. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 2: Okunabilirlik araçları, formülleri ve açıklamaları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 3: Küresel Kalite Skoru (GQS) kalite kriterleri. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 4: Trigeminal nevralji ile ilgili en yaygın sorular için farklı büyük dil modellerinin analiz sonuçları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Tablo 5: Trigeminal nevralji ile ilgili en yaygın soruların farklı boyutlar üzerinden analiz sonuçları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Tablo 1: Değerlendirilen tüm okunurluk indeksleri üzerinden beş büyük dil modeli tarafından oluşturulan yanıtların okunurluk puanları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Tablo 2: Beş büyük dil modeli tarafından oluşturulan yanıtların hasta eğitimi uygunluğu (PEMAT) ve genel bilgi kalitesi (GQS) için uzman puanlamaları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Dosya 1: Beş büyük dil modeli tarafından oluşturulan standardize trigeminal nevralji soruları ve eksiksiz yanıtlar. Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Dosya 2: İstatistiksel analizler ve şekil oluşturma için kullanılan R scriptleri ve kaynak veriler. Bu dosyayı indirmek için lütfen buraya tıklayın.