Onderzoeksartikel

Leesbaarheid en kwaliteit van patiëntenvoorlichting over trigeminusneuralgie door grote taalmodellen: een crosssectionele studie

DOI:

10.3791/70833

21 augustus 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier presenteren wij een protocol om systematisch de leesbaarheid, educatieve geschiktheid en kwaliteit van door grote taalmodellen gegenereerde patiënteninformatie over trigeminale neuralgie te evalueren, om zo modellen te benchmarken en patiëntgerichte communicatie te sturen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Grote taalmodellen (LLM's) worden steeds vaker ingezet voor patiëntenvoorlichting, maar de leesbaarheid en de educatieve kwaliteit van door LLM's gegenereerde informatie over trigeminuseuralgie (TN) zijn onvoldoende geëvalueerd. Deze crosssectionele benchmarkingstudie vergeleek educatieve inhoud over TN die was gegenereerd door vijf publiek toegankelijke LLM's (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5). Twintig veelgestelde vragen over TN, die basiskennis over de ziekte, etiologie/risicofactoren, diagnose, behandeling en preventie/revalidatie besloegen, werden aan elk model voorgelegd met behulp van gestandaardiseerde prompts. De leesbaarheid werd beoordeeld aan de hand van zeven erkende indexen, de educatieve geschiktheid met de Patient Education Materials Assessment Tool for Understandability and Actionability (PEMAT) en de algemene informatiekwaliteit met de Global Quality Score (GQS). Twee klinische experts evalueerden alle antwoorden onafhankelijk van elkaar, waarbij meningsverschillen werden opgelost door een senior scheidsrechter. Statistische analyses vergeleken de prestaties van de modellen, thematische verschillen en correlaties tussen de evaluatiemetrieken. Er werden significante verschillen waargenomen tussen de modellen wat betreft leesbaarheid, PEMAT- en GQS-scores. GPT-5 genereerde de linguïstisch meest complexe antwoorden, maar behaalde de hoogste scores voor educatieve geschiktheid en informatiekwaliteit. Wenxin Yiyan produceerde daarentegen de meest leesbare tekst, maar scoorde over het algemeen lager op PEMAT en GQS. De inhoudscategorie beïnvloedde de leesbaarheid, waarbij onderwerpen over preventie/revalidatie en etiologie/risicofactoren moeilijker leesbaar waren, terwijl PEMAT en GQS relatief consistent bleven over de verschillende thema's. De leesbaarheidsindexen vertoonden een sterke interne consistentie en zwakke tot matige positieve correlaties met PEMAT en GQS, terwijl PEMAT en GQS een matige positieve correlatie vertoonden. Deze bevindingen suggereren dat de modelkeuze van invloed is op de door experts beoordeelde educatieve geschiktheid en algemene informatiekwaliteit, terwijl de complexiteit van het onderwerp primair de leesbaarheid beïnvloedt. Omdat patiëntenbegrip, tevredenheid, vertrouwen, gezondheidsuitkomsten, feitelijke nauwkeurigheid en klinische veiligheid niet zijn geëvalueerd, moeten deze resultaten worden geïnterpreteerd als een door experts beoordeelde benchmarkinganalyse en niet als bewijs van klinische inzetbaarheid.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Trigeminusneuralgie (TN) is een neuropathisch pijnsyndroom dat wordt gekenmerkt door recidiverende episodes van unilaterale, kortstondige en extreem ernstige gezichtspijn, die vaak wordt beschreven als een elektrische schok of een steekende pijn. Volgens de International Classification of Headache Disorders, 3de editie (ICHD-3), is de pijn doorgaans gelokaliseerd in het verspreidingsgebied van één of meer takken van de nervus trigeminus, is deze vaak onverdraaglijk intens en kan deze worden uitgelokt door onschadelijke prikkels zoals een lichte aanraking, gezichtsverzorging, tandenpoetsen, spreken of kauwen. Aanvallen worden gekenmerkt door een plotseling begin en een abrupt einde, met een duur die varieert van fracties van een seconde tot enkele minuten1,2. Hoewel TN gewoonlijk niet levensbedreigend is, verstoren de ernstige en onvoorspelbare pijnen essentiële dagelijkse activiteiten aanzienlijk, waaronder eten, spreken, slapen en emotionele regulatie, wat leidt tot een aanzienlijke psychosociale belasting en een verminderde kwaliteit van leven. Bewijs uit systematische reviews geeft aan dat personen met TN een significant verhoogd risico lopen op depressie, angst en slaapstoornissen in vergelijking met de algemene populatie3,4. In grootschalige cohortstudies vertoont ongeveer 35–55% van de patiënten met TN klinisch relevante symptomen van angst of depressie, en is pijncatastroferen zeer prevalent, wat wijst op een bidirectionele interactie tussen chronische ernstige pijn, insomnia en affectieve stoornissen5,6. Epidemiologische schattingen geven aan dat de prevalentie van TN in de algemene populatie varieert van ongeveer 0,03% tot 0,3%, met een hogere incidentie bij vrouwen en ouderen en opmerkelijke variaties tussen geografische regio's, etnische groepen en leeftijdsschommelingen7,8. In dichtbevolkte landen, zoals China en India, is de snelle vergrijzing van de bevolking gepaard gegaan met een aanhoudende toename van het aantal personen die door TN worden getroffen, waardoor de druk op de gezondheidszorg toeneemt en de noodzaak voor effectievere, schaalbare en op data gebaseerde benaderingen voor ziektebeoordeling en -beheer wordt benadrukt8,9.

TN kan worden geclassificeerd in klassieke, secundaire en idiopathische subtypes, waarbij steeds meer bewijs substantiële verschillen aantoont in de etiologische mechanismen en therapeutische strategieën tussen deze categorieën1,10. Huidige studies suggereren dat neurovasculaire conflict-gerelateerde structurele veranderingen bij de wortelingangszone van de nervus trigeminus, perifere nerveuze hyperexcitabiliteit en een veranderde centrale pijnmodulatie gezamenlijk bijdragen aan de pathogenese van de ziekte11,12. Klinische richtlijnen bevelen carbamazepine en oxcarbazepine aan als eerstelijnsbehandelingen, terwijl chirurgische of interventionele benaderingen worden overwogen wanneer farmacologische therapie ineffectief is of slecht wordt getolereerd10. Ondanks deze therapeutische vooruitgang wordt TN gekenmerkt door een recidiverend-remitterend beloop, en recidiverende pijn op lange termijn komt veel voor, waardoor permanente remissie moeilijk te bereiken is13. Bijgevolg zijn langdurige follow-up en gestructureerd chronisch ziektebeheer essentieel voor het monitoren van het risico op recidieven, de behandelrespons en complicaties. Longitudinale cohortstudies geven aan dat onder gestandaardiseerde beheersstrategieën (inclusief farmacologische behandeling, chirurgische interventie indien geïndiceerd en uitgebreide follow-up) ongeveer de helft van de patiënten die conservatief behandeld worden, binnen twee jaar een reductie van ≥50% in de totale pijnlast kan bereiken, zonder onvermijdelijke ziekteprogressie14. Deze bevindingen onderstrepen het belang van aanhoudende patiëntenbetrokkenheid en effectieve gezondheidseducatie voor langdurig ziektebeheer. Bewijs suggereert dat patiënten met een beter begrip van de ziekte-etiologie, pathofysiologie en behandelopties vaker actief deelnemen aan en zich houden aan therapeutische schema's, wat leidt tot verbeterde uitkomsten15. Traditionele benaderingen van gezondheidseducatie zijn echter vaak beperkt in bereik en schaalbaarheid. Met de wijdverbreide adoptie van het internet, in het bijzonder online vraag-en-antwoordplatforms en sociale media, vertrouwen patiënten steeds vaker op digitale bronnen om medische informatie te verkrijgen16,17. Desondanks vormen aanzienlijke variabiliteit in individuele gezondheidsvaardigheden en het vermogen om basisgezondheidsinformatie te raadplegen, te verwerken en te begrijpen voor een geïnformeerde besluitvorming grote barrières voor effectieve patiënteneducatie18. Bovendien kan de ongelijke kwaliteit van online gezondheidsinformatie, inclusief onjuiste of misleidende inhoud, de medische beslissingen en het psychologische welzijn van patiënten negatief beïnvloeden19.

Technologieën voor kunstmatige intelligentie (KI), en in het bijzonder de snelle ontwikkeling van grote taalmodellen (LLM's) in recente jaren, hebben nieuwe mogelijkheden gecreëerd voor medische wetenschapscommunicatie en gezondheidseducatie20. Deze modellen zijn getraind op grootschalige tekstuele corpora en kunnen via interactie in natuurlijke taal gestructureerde en logisch coherente antwoorden genereren21. Representatieve internationale systemen, zoals ChatGPT, hebben veelbelovend potentieel getoond voor het beantwoorden van medische vragen, patiëntenconsultatie en medisch onderwijs22,23. In China zijn verschillende functioneel vergelijkbare LLM's verschenen, met een voortdurend uitbreidende gebruikersgroep en diverse toepassingsscenario's24. Ondanks deze vooruitgang staat de toepassing van LLM's bij de popularisering van de medische wetenschap nog voor aanzienlijke uitdagingen, waaronder de betrouwbaarheid van trainingsgegevens, de updatefrequentie, de wetenschappelijke nauwkeurigheid van de gegenereerde antwoorden en een gebrek aan klinische validatie25. Daarnaast kunnen verschillen tussen modellen in taalstijl, leesbaarheid, logische structuur en de nauwkeurigheid van citaties direct van invloed zijn op het begrip van patiënten en hun vertrouwen in gezondheidsinformatie26. Tot op heden zijn systematische evaluaties van de prestaties van LLM's in gezondheidseducatie met betrekking tot TN beperkt.

Daarom was het doel van deze studie om systematisch de prestaties te evalueren en te vergelijken van vier veelgebruikte Chinese LLM's (Doubao, DeepSeek, Wenxin Yiyan en Tongyi Qianwen) en een representatieve internationale LLM (ChatGPT) bij het beantwoorden van patiëntenvoorlichtingsvragen met betrekking tot TN. Middels een cross-sectioneel design hebben we een TN-vragenset samengesteld op basis van klinische richtlijnen en veelvoorkomende zorgen van patiënten, en hebben we de antwoorden beoordeeld die werden gegenereerd door vijf openbaar toegankelijke LLM's (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5). De leesbaarheid werd geëvalueerd met behulp van meerdere metrieken, en de begrijpelijkheid en toepasbaarheid werden beoordeeld met de Patient Education Materials Assessment Tool (PEMAT). De algehele informatiekwaliteit werd geëvalueerd met de Global Quality Score (GQS). Daarnaast hebben we geanalyseerd hoe verschillende onderwerpen voor gezondheidsvoorlichting deze evaluatiemetrieken en hun onderlinge relaties beïnvloeden, met als doel evidence-based richtlijnen te bieden voor het selecteren en optimaliseren van LLM's in klinische gezondheidscommunicatie.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie analyseerde uitsluitend door AI gegenereerde tekst en hield geen menselijke deelnemers, dieren, biologische monsters, medische dossiers, identificeerbare persoonlijke informatie of interventies in de klinische zorg in. Daarom waren een ethische toetsing en formele geïnformeerde toestemming niet van toepassing.

Studieopzet

Deze cross-sectionele studie evalueerde de leesbaarheid, kwaliteit en educatieve geschiktheid van antwoorden gegenereerd door vijf LLM's op veelgestelde vragen over TN.

Identificatie van veelgestelde vragen met betrekking tot TN

Op 25 november 2025 hebben twee klinische experts met uitgebreide ervaring in pijnbestrijding onafhankelijk de huidige klinische richtlijnen voor trigeminusneuralgie (TN) beoordeeld, waaronder de International Classification of Headache Disorders, 3de editie (ICHD-3), de richtlijn van de European Academy of Neurology en de richtlijn van de American Academy of Neurology/European Federation of Neurological Societies1,10,11. Na een consensusdiscussie stelden zij een lijst samen van 20 TN-gerelateerde vragen die veel voorkomen in de klinische praktijk. Het aantal vragen werd a priori bepaald om een gebalanceerde dekking van de vijf vooraf gedefinieerde thematische domeinen te bieden, waarbij voor elk domein vier vragen werden geselecteerd, terwijl het totale aantal door het model gegenereerde antwoorden binnen een bereik bleef dat haalbaar was voor handmatige beoordeling en verificatie door experts. Om de reproduceerbaarheid te verbeteren, volgde het selectieproces een vooraf gedefinieerd domeingebaseerd kader: de experts identificeerden eerst kandidaatvragen binnen elk domein, beoordeelden deze onafhankelijk op klinische relevantie, patiëntgerichte formulering en het vermijden van redundantie, en bereikten vervolgens consensus over de definitieve vier vragen per domein. De definitieve lijst met vragen staat in Tabel 1 en Aanvullend Bestand 1. De vijf vooraf gedefinieerde thematische domeinen waren basiskennis van de ziekte, etiologie en risicofactoren, diagnose, behandeling, en preventie en rehabilitatie. Omdat de set vragen niet was afgeleid van zoeklogs van patiënten, online zoekopdrachten of formele patiëntinterviews, wordt de mogelijkheid van selectiebias erkend als een beperking van de studie.

AI-modellen en procedure voor gegevensverzameling

Op 25 november 2025 werd de definitieve set van 20 TN-gerelateerde vragen ingediend bij vijf publiek toegankelijke platforms voor grote taalmodellen (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5/ChatGPT. Alle modellen werden benaderd via hun standaard publieke webgebaseerde chat-interfaces; er werd geen gebruik gemaakt van toegang via een application programming interface (API). Voor elk platform werd het standaard publiek beschikbare model gebruikt dat op de datum van gegevensverzameling beschikbaar was, zonder wijziging van de generatieparameters. Omdat de publieke webinterfaces geen backend-model-snapshot-identificatoren, verborgen systeemprompts, temperatuur, top-p, maximale output-tokens of andere generatieparameters weergaven, werden deze items genoteerd als "niet weergegeven in de publieke webinterface".

De talen voor de prompts en de reacties waren voor alle modellen Engels. Elke gestandaardiseerde prompt bestond uitsluitend uit de letterlijke Engelse vraag zonder aanvullende modelspecifieke instructies. Elke vraag werd individueel ingediend in een nieuwe, onafhankelijke chatsessie zonder voorafgaande gespreksgeschiedenis, geüploade bestanden, plug-ins, aangepaste instructies of vervolgprompts. De volledige lijst met gestandaardiseerde prompts en de bijbehorende ruwe modeloutputs is opgenomen in Supplementary File 1. De modelmetadata en de instellingen voor de gegevensverzameling zijn samengevat in Supplementary Table 1.

Beoordeling van de leesbaarheid

De leesbaarheid van de door de LLM gegenereerde antwoorden werd geëvalueerd met behulp van meerdere gevestigde leesbaarheidsformules die beschikbaar zijn via een online platform voor leesbaarheidsbeoordeling (http://readabilityformulas.com/). Gezien het ontbreken van een universeel geaccepteerde gouden standaard voor leesbaarheidsbeoordeling en in overeenstemming met eerdere studies, werd een uitgebreide set veelgebruikte leesbaarheidsindexen toegepast23,27. Zeven indexen werden geselecteerd om complementaire aspecten van leesbaarheid te vatten, waaronder zinlengte, woordlengte, lettergreepbelasting, op tekens gebaseerde complexiteit, leesgemak en het geschatte taalniveau, waardoor de afhankelijkheid van één enkele formule werd verminderd. Specifiek werden de Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES) en Flesch-Kincaid Grade Level (FKGL) berekend. Deze indexen schatten de leesmoeilijkheid of het taalniveau in en bieden kwantitatieve maten voor de leesbaarheid van de tekst (Tabel 2).

Evaluatie van educatieve geschiktheid en informatiekwaliteit

De educatieve geschiktheid werd beoordeeld met de Patient Education Materials Assessment Tool (PEMAT), die uit twee domeinen bestaat: begrijpelijkheid en actiegerichtheid28. Het instrument bevat 24 items, waarvan er 16 de begrijpelijkheid evalueren en acht de actiegerichtheid. Elk item werd dichotoom gescoord (0 = criterium niet behaald; 1 = criterium behaald), wat resulteerde in een totale score variërend van 0 tot 24, waarbij hogere scores duiden op een grotere geschiktheid voor patiëntenvoorlichting. De algehele informatiekwaliteit werd geëvalueerd met de Global Quality Score (GQS)27, een veelgebruikte vijfpunts Likert-schaal voor het beoordelen van de kwaliteit van medische informatie (Tabel 3).

Op 25 november 2025 evalueerden twee klinische experts met meer dan 3 jaar ervaring in het beheer van TN alle AI-gegenereerde antwoorden met behulp van beide beoordelingsinstrumenten. Voorafgaand aan de scoring werden alle AI-gegenereerde antwoorden geanonimiseerd met gecodeerde respondent-identificaties, en de beoordelaars waren tijdens de PEMAT- en GQS-beoordelingen geblinderd voor het LLM-platform. Onenigheden werden opgelost door een derde senior expert, die de definitieve scores vaststelde. De interbeoordelaarsbetrouwbaarheid werd beoordeeld met de coëfficiënt kappa van Cohen, waarbij waarden >0,75 wezen op uitstekende overeenstemming, 0,40–0,75 op acceptabele overeenstemming en <0,40 op matige overeenstemming. De kappa-waarden van Cohen voor zowel de PEMAT als de GQS waren hoger dan 0,75, wat wijst op een uitstekende interbeoordelaarsbetrouwbaarheid.

Statistische analyse

Alle statistische analyses werden uitgevoerd met R-software (versie 4.4.3). De normaliteit van de gegevens werd beoordeeld met de Shapiro-Wilk-toets en Q-Q-plots. Normaal verdeelde variabelen werden samengevat als gemiddelde ± standaarddeviatie en vergeleken met behulp van een eenweg-variantieanalyse (ANOVA), gevolgd door de post hoc-toets van Tukey indien van toepassing. Niet-normaal verdeelde variabelen werden samengevat als medianen en interkwartielafstanden en vergeleken met de Kruskal-Wallis-toets, gevolgd door de post hoc-toets van Dunn met een Bonferroni-correctie voor paarsgewijze vergelijkingen. Correlaties tussen leesbaarheidsindexen, PEMAT-scores en GQS-waarden werden geëvalueerd met de rangcorrelatiecoëfficiënt van Spearman, waarbij de Benjamini-Hochberg-correctie is toegepast voor meervoudig testen. Een tweezijdige gecorrigeerde P-waarde < 0,05 werd beschouwd als statistisch significant.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie evalueerde systematisch de effecten van grote taalmodellen (LLM's) en verschillende categorieën gezondheidseducatieve inhoud op de leesbaarheid en kwaliteit van de gegenereerde teksten. Ten eerste vergeleken we de prestaties van vijf LLM's—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5—met betrekking tot de geschiktheid voor patiënteneducatie, de algemene informatiekwaliteit en meerdere leesbaarheidsmetrieken, waaronder de PEMAT-score, GQS en gevestigde leesbaarheidsindexen (ARI, FRES, GFOG, FKGL, CL, SMOG en LW). Ten tweede onderzochten we dezelfde uitkomstmaten binnen vijf thematische domeinen van gezondheidseducatieve inhoud: basiskennis over ziekten, etiologie en risicofactoren, diagnose, behandeling en preventie en rehabilitatie. Door deze twee analytische perspectieven te integreren, hebben we verder onderzocht hoe het modeltype en de inhoudscategorie gezamenlijk de tekstkwaliteit en leesbaarheid beïnvloeden, waardoor systematische patronen in door LLM's gegenereerde materialen voor patiënteneducatie konden worden geïdentificeerd.

Leesbaarheidsanalyse over verschillende grote taalmodellen

Zeven gevestigde leesbaarheidsindexen werden gebruikt om systematisch de linguïstische complexiteit te vergelijken van teksten over trigeminusneuralgie die zijn gegenereerd door vijf grote taalmodellen: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5. De algemene resultaten zijn samengevat in Tabel 4, en de verdelingen van de individuele leesbaarheidsstatistieken zijn weergegeven in Figuur 1A–G. Er werden statistisch significante verschillen waargenomen tussen de vijf modellen voor alle leesbaarheidsindexen, met P < 0,001 voor elk.

GPT-5 vertoonde de hoogste mediaanwaarden voor ARI, GFOG, FKGL, CL en SMOG en de laagste FRES, wat aangeeft dat het teksten genereerde met langere zinstructuren, een complexere woordenschat en de grootste totale leeslast (Figuur 1A–G). In contrast hiermee demonstreerde Wenxin Yiyan de laagste linguïstische complexiteit. De mediaanwaarden voor ARI, GFOG, FKGL, CL en SMOG waren voor dit model het laagst van de vijf modellen, terwijl de FRES het hoogst was.

Doubao, DeepSeek en Tongyi Qianwen vertoonden gemiddelde leesbaarheidsniveaus tussen GPT-5 en Wenxin Yiyan. Doubao en DeepSeek lieten vergelijkbare prestaties zien over de indices voor leerjaar-niveaus, waaronder ARI, GFOG, FKGL en CL, en beide hadden significant hogere waarden dan Wenxin Yiyan, met alle P < 0,05. Deze bevindingen duiden op een vergelijkbare algemene leeslast voor Doubao en DeepSeek, met een grotere linguïstische complexiteit dan bij Wenxin Yiyan.

Tongyi Qianwen leverde over het algemeen waarden op die tussen die van Doubao/DeepSeek en GPT-5 lagen voor de meeste leesbaarheidsindices. Opvallend was dat de CL-score dichter bij die van GPT-5 lag, wat wijst op een iets grotere linguïstische complexiteit dan bij Doubao en DeepSeek, maar nog steeds minder complex was dan bij GPT-5. De LW-index vertoonde een distributiepatroon dat afweek van dat van de andere leesbaarheidsmetrieken. Wenxin Yiyan behaalde de hoogste LW-score (60,00), gevolgd door Tongyi Qianwen, DeepSeek en Doubao, terwijl GPT-5 de laagste LW-score had (46,50). Dit verschil weerspiegelt verschillen in de manier waarop individuele leesbaarheidsformules de zinlengte en woordmoeilijkheid wegen (Figuur 1G).

Over het geheel genomen werden aanzienlijke verschillen in linguïstische complexiteit waargenomen tussen de vijf grote taalmodellen. GPT-5 genereerde de meest linguïstisch complexe tekst, Wenxin Yiyan produceerde de meest leesbare inhoud, en de overige modellen vertoonden tussenliggende niveaus van leesbaarheid, hoewel structurele verschillen evident waren.

Vergelijking van de geschiktheid voor patiëntenvoorlichting en de algemene kwaliteit tussen grote taalmodellen

Er werden significante verschillen waargenomen in de geschiktheid voor patiënteneducatie, beoordeeld met de PEMAT, tussen de vijf taalmodellen (Figuur 1H; Tabel 4), waarbij alle P < 0,001 waren. GPT-5 behaalde de hoogste door experts beoordeelde PEMAT-score (9,40 ± 1,90), wat wijst op een grotere educatieve geschiktheid binnen het huidige benchmarking-kader. Deze bevinding mag echter niet worden geïnterpreteerd als bewijs dat door GPT-5 gegenereerde materialen het werkelijke begrip, de tevredenheid, het vertrouwen, het gezondheidsgedrag of de klinische uitkomsten van patiënten verbeteren.

DeepSeek behaalde een gemiddelde PEMAT-score (6,80 ± 1,06), met een relatief compacte scoreverdeling, wat wijst op een consistente prestatie bij het genereren van patiëntenvoorlichtingsmateriaal. Desondanks bleef de algemene educatieve geschiktheid significant lager dan die van GPT-5 (P < 0,001). Doubao, Tongyi Qianwen en Wenxin Yiyan leverden lagere PEMAT-scores op (respectievelijk 5,35 ± 1,04, 5,65 ± 1,09 en 5,35 ± 0,93). Er werden geen significante verschillen waargenomen tussen deze drie modellen, en ze presteerden allemaal significant slechter dan DeepSeek en GPT-5 (allemaal P < 0,01). Deze bevindingen wijzen op een vergelijkbare maar beperkte educatieve geschiktheid over deze modellen heen, in het bijzonder met betrekking tot de instructieve helderheid, de linguïstische organisatie en het gemak van begrip.

Een vergelijkbaar patroon werd waargenomen voor de algemene informatiekwaliteit, beoordeeld met behulp van de GQS (Figuur 1I). Statistisch significante verschillen werden vastgesteld tussen de vijf modellen, met alle P < 0,001. GPT-5 behaalde de hoogste GQS-score (4,00 ± 0,65). De scores hiervan waren geconcentreerd binnen het bereik van 4–5, met beperkte variabiliteit, wat wijst op een consistent hoge prestatie op het gebied van inhoudelijke coherentie, structurele volledigheid en praktische bruikbaarheid.

DeepSeek en Doubao volgden, met GQS-scores van respectievelijk 3,35 ± 0,59 en 3,40 ± 0,50. Hun scoreverdelingen waren gecentreerd tussen 3 en 4, wat wijst op een matige informatiekwaliteit en een redelijke betrouwbaarheid. In tegenstelling hiermee behaalden Tongyi Qianwen en Wenxin Yiyan de laagste GQS-scores (respectievelijk 2,50 ± 0,51 en 2,20 ± 0,52). Hun verdelingen waren scheefgetrokken naar het lagere uiteinde van de schaal, wat duidt op beperkingen in de nauwkeurigheid van de informatie, de structurele striktheid en de diepgang van de inhoud, wat hun bruikbaarheid voor patiëntenvoorlichting kan verminderen.

Over het algemeen behaalde GPT-5 de hoogste door experts beoordeelde PEMAT- en GQS-scores in deze dataset, terwijl DeepSeek en Doubao een gemiddelde prestatie vertoonden. Tongyi Qianwen en Wenxin Yiyan ontvingen lagere GQS-beoordelingen. Deze bevindingen vertegenwoordigen resultaten van benchmarking door experts en mogen niet worden geïnterpreteerd als bewijs voor klinische inzetbaarheid of effectiviteit op patiëntniveau.

Vergelijking van leesbaarheid, geschiktheid voor patiëntenvoorlichting en algehele kwaliteit over verschillende categorieën gezondheidseducatieve inhoud

Analyse per inhoudscategorie onthulde significante verschillen in leesbaarheid tussen de vijf thema's voor gezondheidseducatie (Tabel 5). Voor de FRES werden statistisch significante verschillen waargenomen tussen de thematische categorieën (P = 0,004). Hogere FRES-waarden duiden op een eenvoudigere leesbaarheid. Teksten over basiskennis van ziekten waren het meest leesbaar (mediaan = 28,50), gevolgd door diagnostische inhoud (mediaan = 16,00), inhoud over etiologie en risicofactoren (mediaan = 12,50) en behandelingsgerelateerde inhoud (mediaan = 11,50). Daarentegen vertoonden teksten over preventie en rehabilitatie de laagste leesbaarheid (mediaan FRES = 1,00), wat duidt op de grootste leesmoeite.

Vergelijkbare patronen werden waargenomen voor de overige leesbaarheidsindices. GFOG en FKGL verschilden significant tussen de thematische categorieën (P = 0,002 en P = 0,036, respectievelijk), waarbij beide indices wezen op hogere leesniveaus voor de inhoud over etiologie en risicofactoren en preventie en rehabilitatie. De SMOG-index suggereerde evenzo dat teksten over etiologie en risicofactoren een groter aandeel meersyllabische woorden bevatten (P = 0,039). De grootste verschillen werden waargenomen voor CL (P < 0,001). Teksten over preventie en rehabilitatie hadden de langste zinnen (mediaan = 21,01), wat de leesmoeilijkheid aanzienlijk verhoogde, terwijl teksten over basiskennis over ziekten de kortste zinnen hadden (mediaan = 14,88), wat overeenkwam met de laagste leeslast. Er werden geen significante verschillen waargenomen tussen de inhoudscategorieën voor de ARI of LW.

Er werden geen statistisch significante verschillen in de geschiktheid voor patiëntenvoorlichting vastgesteld tussen de vijf inhoudscategorieën op basis van PEMAT-scores (P = 0,252). De gemiddelde PEMAT-scores varieerden van 5,90 tot 7,20, wat aangeeft dat de educatieve geschiktheid relatief consistent bleef over de thema's heen, ondanks duidelijke verschillen in taalkundige complexiteit. Op dezelfde manier verschilde de algehele informatiekwaliteit, beoordeeld met de GQS, niet significant tussen de inhoudscategorieën (P = 0,822). De gemiddelde GQS-waarden varieerden van 2,95 tot 3,25, wat aantoont dat de algehele informatiekwaliteit relatief stabiel was over de verschillende inhoudsthema's.

Over het algemeen werden aanzienlijke verschillen in leesbaarheid waargenomen tussen de thema's voor gezondheidseducatie, waarbij inhoud over etiologie en risicofactoren en inhoud over preventie en rehabilitatie de grootste leesmoeilijkheid vertoonden, terwijl inhoud over basiskennis van ziekten het meest leesbaar was. Daarentegen bleven de geschiktheid van de patiëntenvoorlichting en de algemene kwaliteit van de informatie relatief consistent over de verschillende inhoudscategorieën heen.

Correlatieanalyse tussen leesbaarheid, geschiktheid voor patiëntenvoorlichting en algehele kwaliteit

De correlatiematrix in Figuur 2 laat consistente, robuuste associaties zien tussen de leesbaarheidsindices, wat wijst op een sterke interne consistentie. De meeste leesbaarheidsmetrieken, waaronder ARI, GFOG, FKGL, CL en SMOG, vertoonden matige tot sterke positieve correlaties met elkaar, met correlatiecoëfficiënten variërend van 0,64 tot 0,97 (alle P < 0,001). Deze bevindingen ondersteunen verder de complementaire aard van deze indices bij het beoordelen van linguïstische complexiteit. In tegenstelling hiermee vertoonde FRES significante negatieve correlaties met meerdere leesbaarheidsmetrieken, waaronder ARI, GFOG, FKGL, CL en SMOG, met absolute correlatiecoëfficiënten groter dan 0,70 (alle P < 0,001). Dit patroon weerspiegelt de omgekeerde score-richting van FRES, waarbij hogere scores wijzen op een grotere leesbaarheid. De LW-index vertoonde eveneens significante negatieve correlaties met andere leesbaarheidsindices, waaronder ARI, FKGL, GFOG en SMOG, met absolute correlatiecoëfficiënten variërend van 0,75 tot 0,90 (alle P < 0,001). Omgekeerd was LW positief gecorreleerd met FRES (correlatiecoëfficiënt = 0,69, P < 0,001).

Er werden ook duidelijke associaties waargenomen tussen leesbaarheidsindexen en de algemene informatiekwaliteit, zoals gemeten met de GQS. De GQS vertoonde zwakke tot matige positieve correlaties met de meeste leesbaarheidsmetrieken, waaronder ARI, GFOG, FKGL, CL en SMOG, met correlatiecoëfficiënten variërend van 0,326 tot 0,391 (allemaal P < 0,001). Deze bevindingen suggereren dat een grotere linguïstische complexiteit geassocieerd was met een hogere door experts beoordeelde informatiekwaliteit. Omgekeerd was de GQS matig negatief gecorreleerd met FRES (correlatiecoëfficiënt = −0,408, P < 0,001), wat aangeeft dat teksten die een hoger leesniveau vereisen over het algemeen hogere GQS-scores kregen. De GQS vertoonde ook een matige negatieve correlatie met LW (correlatiecoëfficiënt = −0,421, P < 0,001).

De associaties tussen leesbaarheid en de geschiktheid voor patiëntenvoorlichting, zoals beoordeeld met de PEMAT, waren over het algemeen zwakker, maar consistent in richting. PEMAT-scores vertoonden zwakke positieve correlaties met ARI, GFOG, FKGL, CL en SMOG, met correlatiecoëfficiënten variërend van 0,305 tot 0,434 (allemaal P < 0,01). Daarentegen waren de PEMAT-scores zwak negatief gecorreleerd met FRES en LW, met absolute correlatiecoëfficiënten van respectievelijk 0,432 and 0,320 (beiden P < 0,01). Deze bevindingen suggereren dat, binnen deze dataset, een grotere linguïstische complexiteit geassocieerd was met een bescheiden hogere door experts beoordeelde educatieve geschiktheid, hoewel de sterkte van deze associaties beperkt was.

Belangrijk is dat er een matige positieve correlatie werd waargenomen tussen de PEMAT- en GQS-scores (correlatiecoëfficiënt = 0,645, P < 0,001). Dit was de sterkste associatie die tussen de evaluatiedomeinen werd waargenomen, wat erop wijst dat antwoorden met een hogere educatieve geschiktheid ook de neiging hadden om hogere scores te krijgen voor de algehele informatiekwaliteit.

BESCHIKBAARHEID VAN GEGEVENS:

De volledige dataset die deze studie ondersteunt, is beschikbaar als aanvullend materiaal. Aanvullend bestand 1 bevat de volledige lijst met gestandaardiseerde vragen, prompts en de 100 gearchiveerde LLM-gegenereerde antwoorden. Aanvullende tabel 2 bevat de PEMAT- en GQS-scoreformulieren van experts, inclusief PEMAT-beoordelingen op itemniveau waar beschikbaar, totale PEMAT-scores, GQS-scores, informatie over de vergelijking tussen beoordelaars en adjudicatieresultaten indien van toepassing. De leesbaarheidsscores, brondata van figuren en de R-analysecode zijn opgenomen als Aanvullend bestand 2. Omdat LLM-outputs in de loop van de tijd kunnen veranderen door modelupdates, wijzigingen in de interface en aanpassingen op platformniveau, dienen de gearchiveerde outputs, en niet de opnieuw gegenereerde antwoorden, te worden gebruikt voor verificatie en secundaire analyse.

figure-results-1
Figuur 1: Vergelijking van de leesbaarheid, geschiktheid voor patiënteneducatie en algemene informatiekwaliteit tussen vijf grote taalmodellen. (A–G) Dit paneel toont de leesbaarheidsindices: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) en Linsear Write Formula (LW). (H) Dit paneel toont de totale PEMAT-scores, en paneel (I) toont de Global Quality Scores (GQS). In elke boxplot vertegenwoordigt de middenlijn de mediaan, geeft de box het interkwartielbereik (IQR) aan, strekken de whiskers zich uit tot 1,5 × IQR, en vertegenwoordigen punten buiten de whiskers uitschieters. Afkortingen: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool for Understandability and Actionability, printformaat; Global Quality Score = GQS. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-2
Figuur 2: Spearman-correlatiematrix tussen leesbaarheidsindices, geschiktheid voor patiëntenvoorlichting en algehele informatiekwaliteit over alle door het model gegenereerde antwoorden.De matrix rapporteert Spearman-correlatiecoëfficiënten voor paarsgewijze associaties tussen ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT en GQS. Afkortingen: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Klik hier om een grotere versie van deze figuur te bekijken.

Tabel 1: Lijst van 20 vragen met betrekking tot trigeminusneuralgie. Klik hier om dit bestand te downloaden.

Tabel 2: Leesbaarheidstools, formules en beschrijvingen. Klik hier om dit bestand te downloaden.

Tabel 3: De kwaliteitscriteria voor de Global Quality Score (GQS). Klik hier om dit bestand te downloaden.

Tabel 4: Analyseresultaten van verschillende grote taalmodellen voor de meest voorkomende vragen met betrekking tot trigeminusneuralgie. Klik hier om dit bestand te downloaden.

Tabel 5: Analyseresultaten over verschillende dimensies voor de meest voorkomende vragen met betrekking tot trigeminusneuralgie. Klik hier om dit bestand te downloaden.

Aanvullende Tabel 1: Leesbaarheidsscores van responsen gegenereerd door de vijf grote taalmodellen over alle geëvalueerde leesbaarheidsindexen. Klik hier om dit bestand te downloaden.

Aanvullende tabel 2: Expertbeoordelingen van de geschiktheid voor patiëntenvoorlichting (PEMAT) en de algemene informatiekwaliteit (GQS) voor antwoorden gegenereerd door de vijf grote taalmodellen. Klik hier om dit bestand te downloaden.

Aanvullend bestand 1: Gestandaardiseerde vragen over trigeminusneuralgie en volledige antwoorden gegenereerd door de vijf grote taalmodellen. Klik hier om dit bestand te downloaden.

Aanvullend bestand 2: R-scripts en brondata gebruikt voor statistische analyses en het genereren van figuren. Klik hier om dit bestand te downloaden.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze cross-sectionele benchmarkingstudie vergeleek systematisch de leesbaarheid, educatieve geschiktheid en de algehele informatiekwaliteit van patiëntenvoorlichtingsmaterialen over trigeminusneuralgie (TN), gegenereerd door vijf publiek toegankelijke grote taalmodellen (LLM's). Er kwamen vier belangrijke bevindingen naar voren. Ten eerste verschilde de leesbaarheid aanzienlijk tussen de modellen, waarbij GPT-5 de taalkundig meest complexe antwoorden genereerde en Wenxin Yiyan de meest leesbare inhoud produceerde. Ten tweede waren de leesbaarheid en de door experts beoordeelde informatiekwaliteit verschillende evaluatiedimensies, waarbij GPT-5 de hoogste PEMAT- en GQS-scores behaalde ondanks de lagere leesbaarheid. Ten derde beïnvloedde het inhoudsthema de leesbaarheid, waarbij onderwerpen over preventie, rehabilitatie, etiologie en risicofactoren over het algemeen een hoger leesniveau vereisten, terwijl PEMAT en GQS relatief stabiel bleven over de verschillende inhoudscategorieën. Tot slot vertoonden de leesbaarheidsindices een sterke interne consistentie, en correlatieanalyses onthulden zwakke tot matige positieve associaties tussen taalkundige complexiteit en zowel PEMAT als GQS, evenals een matige positieve correlatie tussen PEMAT en GQS. Gezamenlijk bieden deze bevindingen een referentiekader voor het evalueren van door LLM's gegenereerde patiëntenvoorlichtingsmaterialen over TN, terwijl ze de noodzaak benadrukken om een balans te vinden tussen medische volledigheid en taalkundige toegankelijkheid. Belangrijk is dat deze resultaten expertbeoordeelde benchmarkingresultaten zijn en niet geïnterpreteerd moeten worden als bewijs voor patiëntbegrip, feitelijke nauwkeurigheid, klinische veiligheid of geschiktheid voor routinematig klinisch gebruik.

De bevindingen van deze studie zijn consistent met eerdere evaluaties van door AI gegenereerde medische informatie, waarbij aanzienlijke variabiliteit tussen LLM's en een frequente discrepantie tussen leesbaarheid en informatiekwaliteit werden gerapporteerd26,27,29. Eerdere studies binnen meerdere ziektegebieden hebben aangetoond dat door LLM's gegenereerde patiëntenvoorlichtingsmaterialen vaak de aanbevolen leesniveaus overschrijden en dat modellen die de meest leesbare tekst produceren niet noodzakelijkerwijs de meest uitgebreide of kwalitatief hoogwaardigste informatie versleffen26,30. De bevindingen in de voorlichting over TN ondersteunen deze observatie. GPT-5 genereerde de linguïstisch meest complexe antwoorden, maar behaalde wel de hoogste PEMAT- en GQS-scores, terwijl Wenxin Yiyan leesbaardere tekst produceerde, maar een lagere door experts beoordeelde educatieve geschiktheid en algehele kwaliteit vertoonde. Bovendien varieerde de leesbaarheid per thematisch domein, waarbij onderwerpen over preventie en rehabilitatie en etiologie en risicofactoren over het algemeen een grotere linguïstische complexiteit vertoonden, wat suggereert dat zowel modelkenmerken als de complexiteit van het onderwerp de leesmoeilijkheid beïnvloeden31.

De schijnbare afweging tussen leesbaarheid en informatiekwaliteit is consistent met de verschillende constructen die door de evaluatie-instrumenten worden gemeten. Leesbaarheidsformules beoordelen primair taalkundige kenmerken op oppervlakkig niveau, zoals zinslengte en lexicale complexiteit, terwijl PEMAT en GQS hogere-orde eigenschappen evalueren, waaronder informatieorganisatie, volledigheid, duidelijkheid van uitleg en actiegerichtheid32. Voor educatie over TN bevatten kwalitatief hoogwaardige antwoorden vaak besprekingen over alarmsymptomen, differentiaaldiagnose, farmacologisch beheer en bijwerkingen, interventionele en chirurgische opties, en geïndividualiseerde revalidatiestrategieën33. Dergelijke klinisch uitgebreide inhoud verhoogt onvermijdelijk de terminologische dichtheid en syntactische complexiteit, wat resulteert in hogere leesbaarheidsscores en een door experts beoordeelde verbeterde educatieve kwaliteit. Belangrijk is dat deze bevindingen niet zo geïnterpreteerd moeten worden dat complexer taalgebruik preferabel is. Integendeel, ze geven aan dat huidige LLM's vaak de informatieve volledigheid verbeteren ten koste van de taalkundige toegankelijkheid. De toekomstige ontwikkeling van patiënteneducatiesystemen moet zich daarom richten op het behouden van medische nauwkeurigheid, terwijl de taal wordt vereenvoudigd door revisies in begrijpelijke taal, een gestructureerde presentatie van kernpunten, uitleg van technische terminologie en duidelijke, actiegerichte begeleiding die geschikt is voor patiënten met verschillende niveaus van gezondheidsvaardigheden11,34,35.

Correlatieanalyse ondersteunt verder het onderscheid tussen leesbaarheid en educatieve kwaliteit. De meeste op leerjaar gebaseerde leesbaarheidsindices vertoonden zwakke tot matige positieve associaties met zowel PEMAT als GQS, terwijl FRES de verwachte inverse relatie vertoonde, aangezien hogere FRES-scores duiden op een eenvoudigere leesbaarheid. Deze bevindingen impliceren niet dat een grotere linguïstische complexiteit wenselijk is; ze suggereren eerder dat huidige LLM's vaak een grotere informatievolledigheid bereiken ten koste van de toegankelijkheid34. Bijgevolg moet de ontwikkeling van door AI ondersteunde patiënteneducatie prioriteit geven aan medische nauwkeurigheid en volledigheid, terwijl er gebruik wordt gemaakt van bewerkingen in begrijpelijke taal, een gestructureerde presentatie van kernpunten, heldere uitleg van technische terminologie en actiegerichte aanbevelingen die zijn afgestemd op patiënten met verschillende niveaus van gezondheidsvaardigheden11,35.

Een aanvullende methodologische bevinding was het onderscheidende gedrag van de LW-index in vergelijking met de andere leesbaarheidsmaten. In tegenstelling tot ARI, FKGL, GFOG, CL en SMOG volgde LW een patroon dat meer overeenkwam met FRES, wat wijst op verschillen in hoe leesbaarheidsformules tekstcomplexiteit operationaliseren36. Omdat LW oorspronkelijk was ontwikkeld voor technische handleidingen en nadruk legt op de structuur van geselecteerde zinnen en woordclassificatie in plaats van op algemene zins- of lettergrekenkenmerken, kan het anders reageren op door AI gegenereerde medische teksten waarin beknopte beweringen worden gecombineerd met langere verklarende passages en een ongelijkmatige verdeling van technische terminologie37,38. Deze bevindingen onderstrepen het belang van een assessmentraamwerk met meerdere metrieken, aangezien geen enkele individuele leesbaarheidsindex alle dimensies van tekstcomplexiteit adequaat vastlegt. In overeenstemming met eerdere studies naar door AI gegenereerde gezondheidsinformatie moet de algehele leesbaarheid daarom worden geïnterpreteerd aan de hand van convergerend bewijs uit meerdere complementaire indices in plaats van op basis van een enkele maatstaf39.

Ook de inhoudscategorie beïnvloedde de leesbaarheid. Onderwerpen over preventie, rehabilitatie en etiologie en risicofactoren resulteerden over het algemeen in teksten met een hogere leesmoeilijkheid dan basiskennis over ziekten, waarschijnlijk omdat deze onderwerpen voorwaardelijke aanbevelingen, mechanistische verklaringen en gespecialiseerdere terminologie vereisen40,41. In contrast hiermee is basiskennis over ziekten primair gebaseerd op definities en kan deze in eenvoudigere taal worden overgebracht42. Ondanks deze verschillen bleven de PEMAT en GQS relatief consistent over de thematische domeinen heen, wat suggereert dat de door experts beoordeelde educatieve geschiktheid en de algemene informatiekwaliteit werden gehandhaafd bij verschillende soorten patiëntenvragen35,43.

Deze bevindingen hebben verschillende implicaties voor de klinische praktijk en de toekomstige ontwikkeling van LLM's. Aangezien patiënten in toenemende mate LLM's gebruiken om informatie in te winnen vóór of na medische consulten, dient AI-gegenereerde content aanvullend te zijn aan, en niet ter vervanging van, het advies van de clinicus, met name met betrekking tot medicatieveiligheid, indicaties voor interventionele of chirurgische behandeling en het herkennen van alarmsymptomen (red flags) die een dringende evaluatie vereisen44. Zorgorganisaties kunnen er baat bij hebben om door experts getoetste, begrijpelijke educatieve bronnen aan te bieden, terwijl LLM's worden ingezet als hulpmiddelen voor het opstellen van concepten of als beslissingsondersteunende instrumenten in plaats van als autonome systemen voor patiëntenvoorlichting. Toekomstige modellen moeten generatiestrategieën bevatten die rekening houden met de leesbaarheid, transparante rapportage van modelversies en generatiedata, expliciete communicatie van onzekerheid en governanceprocedures, waaronder beoordeling door clinici, verificatie van feitelijke juistheid, screening op hallucinaties, controles van de medicatieveiligheid, richtlijnen voor alarmsymptomen en tests voor het begrip van de patiënt voorafgaand aan de klinische implementatie26,44,45.

Deze studie kent verschillende beperkingen. Modeloutputs werden op een enkele datum verzameld via openbaar toegankelijke webinterfaces; daaropvolgende modelupdates, wijzigingen in de interface, verborgen systeemprompts of standaardinstellingen voor generatie kunnen de reproduceerbaarheid beïnvloeden. De set van 20 vragen is ontwikkeld door klinische experts in plaats van afgeleid te zijn uit zoeklogs van patiënten of formele patiëntinterviews, een praktijk die selectiebias kan introduceren. Bovendien vertrouwde de studie op PEMAT- en GQS-beoordelingen door experts en is er geen evaluatie gedaan van het begrip, het vertrouwen, de tevredenheid, het gezondheidsgedrag of de klinische uitkomsten van patiënten. Leesbaarheidformules, PEMAT en GQS beoordelen bovendien niet direct de feitelijke nauwkeurigheid, het risico op hallucinaties, de nauwkeurigheid van citaten, de volledigheid van contra-indicaties of de klinische veiligheid. Bijgevolg moeten deze bevindingen worden geïnterpreteerd als een door experts beoordeelde cross-sectionele benchmarking-analyse en niet als bewijs dat door LLM gegenereerd materiaal klaar is voor routinematig klinisch gebruik. Toekomstige studies zouden gearchiveerde modeloutputs, gedetailleerde modelmetadata, meertalige evaluaties, grotere vragensets, formele veiligheidsaudits, beoordelingen van feitelijke nauwkeurigheid en patiëntgerichte uitkomstmaten moeten bevatten voordat door LLM gegenereerde educatieve materialen worden overwogen voor klinische implementatie.

In deze door experts beoordeelde cross-sectionele benchmarkstudie verschilden publiek toegankelijke grote taalmodellen aanzienlijk in de leesbaarheid, educatieve geschiktheid en algemene informatiekwaliteit van patiëntenvoorlichtingsmaterialen over trigeminusneuralgie. GPT-5 behaalde de hoogste door experts beoordeelde PEMAT- en GQS-scores, maar genereerde ook de linguïstisch meest complexe antwoorden, wat onderstreept dat leesbaarheid en door experts beoordeelde educatieve kwaliteit gerelateerde maar verschillende dimensies van patiëntenvoorlichting zijn. Hoewel sommige modellen leesbaardere inhoud produceerden, vertaalde dit zich niet noodzakelijkerwijs in een grotere educatieve geschiktheid of een algemene betere informatiekwaliteit. Omdat deze studie geen feitelijke nauwkeurigheid heeft geëvalueerd via een specifieke veiligheidsaudit, noch het risico op hallucinaties, citatieprecisie, patiëntenbegrip, vertrouwen, tevredenheid, gezondheidsgedrag of klinische uitkomsten, moeten de bevindingen worden geïnterpreteerd als een door experts beoordeelde benchmarkanalyse en niet als bewijs van klinische gereedheid. Toekomstige studies zouden expertbeoordelingen, formele veiligheids- en feitelijkheidsbeoordelingen en patiëntgerichte evaluaties moeten integreren om het veilige en effectieve gebruik van door LLM's gegenereerde materialen in patiëntenvoorlichting te ondersteunen.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat er geen belangenverstrengelingen zijn.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit onderzoek heeft geen specifieke subsidie ontvangen van enige financieringsinstantie in de publieke, commerciële of non-profit sector. De auteurs danken de klinische collega's die feedback hebben gegeven op de vragenlijst over trigeminusneuralgie en hebben geholpen bij het verfijnen van het evaluatiekader. We danken ook alle medewerkers die hebben ondersteund bij het opstellen en herzien van het manuscript.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
DeepSeek chatplatformDeepSeekhttps://chat.deepseek.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
Doubao chatplatformDoubaohttps://www.doubao.com/chat/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
GPT 5 OpenAIhttps://chat.openai.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
R-software, versie 4.4.3R Foundation for Statistical ComputingNiet van toepassingStatistische analyse en visualisatie
Readability Formulas online leesbaarheidscalculatorReadability FormulasNiet van toepassingOnline tool gebruikt voor het berekenen van leesbaarheidsindices
Tongyi Qianwen chatplatformTongyi Qianwenhttps://www.tongyi.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
Wenxin Yiyan chatplatformWenxin Yiyanhttps://yiyan.baidu.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Grote taalmodellenleesbaarheidsbeoordelingeducatieve kwaliteitPEMAT evaluatieGlobal Quality Scorekwaliteit van gezondheidsinformatiemodel benchmarkingpati ntenbegrip

Gerelateerde artikelen