Article de recherche

Lisibilité et qualité de l'éducation des patients sur la névralgie du trijumeau générée par des grands modèles de langage : une étude transversale

DOI :

10.3791/70833

21 août 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ici, nous présentons un protocole permettant d'évaluer systématiquement la lisibilité, l'adaptabilité pédagogique et la qualité des informations destinées aux patients sur la névralgie du trijumeau, générées par des modèles de langage de grande taille, afin d'établir des références pour les modèles et de guider la communication destinée aux patients.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les grands modèles linguistiques (LLM) sont de plus en plus utilisés pour l'éducation des patients en matière de santé, mais la lisibilité et la qualité éducative des informations générées par les LLM sur la névralgie du trijumeau (NT) ont été insuffisamment évaluées. Cette étude comparative transversale a analysé le contenu éducatif sur la NT produit par cinq LLM accessibles au public (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5). Vingt questions fréquemment posées sur la NT, couvrant les connaissances fondamentales sur la maladie, l'étiologie/les facteurs de risque, le diagnostic, le traitement et la prévention/la réadaptation, ont été soumises à chaque modèle à l’aide d’instructions standardisées. La lisibilité a été évaluée à l’aide de sept indices reconnus, la pertinence éducative à l’aide de l’outil d’évaluation des supports pédagogiques pour patients (PEMAT) portant sur la compréhension et l’actionnabilité, et la qualité globale de l’information à l’aide du score de qualité global (GQS). Deux experts cliniques ont évalué indépendamment toutes les réponses, les désaccords étant tranchés par un arbitre principal. Des analyses statistiques ont comparé les performances des modèles, les différences thématiques et les corrélations entre les critères d’évaluation. Des différences significatives ont été observées entre les modèles concernant les scores de lisibilité, de PEMAT et de GQS. GPT-5 a produit les réponses les plus complexes sur le plan linguistique, mais a obtenu les notes les plus élevées en termes de pertinence éducative et de qualité de l’information. En revanche, Wenxin Yiyan a généré le texte le plus lisible, mais a généralement obtenu des scores inférieurs sur le PEMAT et le GQS. La catégorie de contenu a influencé la lisibilité, les sujets liés à la prévention/la réadaptation et à l’étiologie/aux facteurs de risque étant plus difficiles à lire, tandis que les scores PEMAT et GQS sont restés relativement stables selon les thèmes. Les indices de lisibilité ont montré une forte cohérence interne ainsi que des corrélations faibles à modérées positives avec le PEMAT et le GQS, tandis que le PEMAT et le GQS présentaient une corrélation positive modérée. Ces résultats suggèrent que le choix du modèle influence la pertinence éducative et la qualité globale de l’information tels qu’évalués par des experts, tandis que la complexité du sujet affecte principalement la lisibilité. Étant donné que la compréhension du patient, sa satisfaction, sa confiance, les résultats sanitaires, l’exactitude factuelle et la sécurité clinique n’ont pas été évaluées, ces résultats doivent être interprétés comme une analyse comparative fondée sur l’évaluation d’experts, et non comme une preuve de préparation clinique.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La névralgie du trijumeau (NT) est un syndrome douloureux neuropathique caractérisé par des épisodes récurrents de douleur faciale unilatérale, brève et extrêmement intense, couramment décrite comme une décharge électrique ou une sensation de piqûre. Selon la Classification internationale des céphalées, 3e édition (CIC-3), la douleur est généralement localisée dans le territoire d'une ou plusieurs branches du nerf trijumeau, est souvent d'une intensité intolérable et peut être déclenchée par des stimuli inoffensifs tels qu'une légère touche, le lavage du visage, le brossage des dents, la parole ou la mastication. Les crises sont caractérisées par une apparition soudaine et une disparition brutale, avec une durée variant de fractions de seconde à plusieurs minutes.1,2Bien que la névralgie du trijumeau (NT) ne soit généralement pas une affection menaçant le pronostic vital, ses douleurs sévères et imprévisibles perturbent considérablement les activités quotidiennes essentielles, telles que l'alimentation, la parole, le sommeil et la régulation émotionnelle, entraînant une charge psychosociale importante et une altération de la qualité de vie. Des données issues de revues systématiques indiquent que les personnes atteintes de NT présentent un risque significativement accru de dépression, d'anxiété et de troubles du sommeil par rapport à la population générale.3,4Dans les études sur de grandes cohortes, environ 35 à 55 % des patients atteints de névralgie du trijumeau présentent des symptômes cliniquement significatifs d'anxiété ou de dépression, et la catastrophisation de la douleur est très fréquente, suggérant une interaction bidirectionnelle entre la douleur chronique sévère, l'insomnie et les troubles affectifs.5,6. Des estimations épidémiologiques indiquent que la prévalence de la névralgie du trijumeau dans la population générale varie approximativement entre 0,03 % et 0,3 %, avec une fréquence plus élevée chez les femmes et les personnes âgées, ainsi que des variations notables selon les régions géographiques, les groupes ethniques et les tranches d'âge7,8. Dans les pays fortement peuplés, tels que la Chine et l'Inde, le vieillissement rapide de la population s'accompagne d'une augmentation soutenue du nombre de personnes touchées par la névralgie du trijumeau (TN), ce qui pèse de plus en plus lourd sur les systèmes de santé et souligne la nécessité de développer des approches plus efficaces, évolutives et fondées sur des données pour l'évaluation et la prise en charge de la maladie8,9.

La névralgie du trijumeau peut être classée en sous-types classique, secondaire et idiopathique, des preuves croissantes mettant en évidence des différences substantielles entre ces catégories en ce qui concerne les mécanismes étiologiques et les stratégies thérapeutiques1,10. Les études actuelles suggèrent que des modifications structurelles liées à un conflit neurovasculaire au niveau de la zone d'entrée racinaire du nerf trijumeau, une hyperexcitabilité des nerfs périphériques et une modulation centrale de la douleur altérée contribuent conjointement à la pathogenèse de la maladie11,12. Les recommandations cliniques préconisent la carbamazépine et l'oxcarbamazépine comme traitements de première intention, tandis que des approches chirurgicales ou interventionnelles sont envisagées lorsque le traitement pharmacologique s'avère inefficace ou mal toléré10. Malgré ces progrès thérapeutiques, la névralgie du trijumeau se caractérise par un cours récidivant-rémittant, et la récidive prolongée de la douleur reste fréquente, rendant difficile l'obtention d'une rémission durable13. Par conséquent, un suivi à long terme et une prise en charge structurée de la maladie chronique sont essentiels pour surveiller le risque de récidive, la réponse au traitement et les complications. Des études de cohorte longitudinales indiquent que, sous des stratégies de prise en charge standardisées (incluant un traitement pharmacologique, une intervention chirurgicale si indiquée et un suivi complet), environ la moitié des patients traités de manière conservatrice peuvent obtenir une réduction ≥50 % de la charge globale de douleur dans les deux ans, sans progression inévitable de la maladie14. Ces résultats soulignent l'importance d'une implication soutenue du patient et d'une éducation sanitaire efficace pour la gestion à long terme de la maladie. Des données montrent que les patients ayant une meilleure compréhension de l'étiologie, de la physiopathologie et des options thérapeutiques de la maladie sont plus enclins à participer activement aux protocoles de traitement et à y adhérer, ce qui conduit à de meilleurs résultats15. Toutefois, les approches traditionnelles d'éducation sanitaire sont souvent limitées en portée et en capacité d'extension. Avec l'adoption généralisée d'Internet, notamment des plateformes en ligne de type questions-réponses et des réseaux sociaux, les patients s'appuient de plus en plus sur des sources numériques pour obtenir des informations médicales16,17. Néanmoins, la grande variabilité du niveau d'illectronisme en santé et de la capacité à accéder, traiter et comprendre les informations sanitaires de base nécessaires à une prise de décision éclairée constitue un obstacle majeur à une éducation efficace du patient18. De plus, la qualité inégale des informations sanitaires en ligne, y compris des contenus inexacts ou trompeurs, peut influencer négativement les décisions médicales des patients et leur bien-être psychologique19.

Les technologies d'intelligence artificielle (IA), en particulier le développement rapide des grands modèles linguistiques (LLM) ces dernières années, ont créé de nouvelles opportunités pour la communication scientifique en médecine et l'éducation en santé20. Entraînés sur de vastes corpus textuels, ces modèles peuvent produire des réponses structurées et logiquement cohérentes par interaction en langage naturel21. Des systèmes internationaux représentatifs, tels que ChatGPT, ont démontré un potentiel prometteur dans les domaines de la réponse aux questions médicales, de la consultation patient et de l'enseignement médical22,23. Plusieurs LLM fonctionnellement similaires sont apparus en Chine, avec une couverture utilisateur et des scénarios d'application en constante expansion24. Malgré ces progrès, l'application des LLM à la vulgarisation scientifique médicale fait toujours face à des défis importants, notamment la fiabilité des données d'entraînement, la fréquence des mises à jour, l'exactitude scientifique des réponses générées et l'absence de validation clinique25. De plus, les différences entre modèles en matière de style linguistique, de lisibilité, de structure logique et de précision des citations peuvent influencer directement la compréhension et la confiance des patients dans l'information liée à la santé26. À ce jour, les évaluations systématiques des performances des LLM dans l'éducation sanitaire liée à la névralgie du trijumeau (TN) ont été limitées.

Par conséquent, cette étude visait à évaluer systématiquement et à comparer les performances de quatre grands modèles linguistiques chinois largement utilisés (Doubao, DeepSeek, Wenxin Yiyan et Tongyi Qianwen) ainsi que d’un modèle international représentatif (ChatGPT) dans la réponse à des questions d’éducation des patients relatives à la névralgie du trijumeau (TN). En utilisant un dispositif transversal, nous avons élaboré un ensemble de questions sur la TN fondé sur des recommandations cliniques et les préoccupations courantes des patients, puis évalué les réponses produites par cinq modèles linguistiques accessibles au public (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5). La lisibilité a été évaluée à l’aide de plusieurs indicateurs, tandis que la compréhensibilité et l’applicabilité ont été mesurées à l’aide de l’outil d’évaluation des supports d’éducation des patients (Patient Education Materials Assessment Tool, PEMAT). La qualité globale de l’information a été évaluée au moyen du score de qualité global (Global Quality Score, GQS). De plus, nous avons analysé l’influence de différents thèmes d’éducation sanitaire sur ces indicateurs d’évaluation ainsi que leurs interrelations, dans le but de fournir des recommandations fondées sur des preuves pour le choix et l’optimisation des modèles linguistiques dans la communication clinique en santé.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La présente étude a analysé uniquement des textes générés par l'intelligence artificielle et n'a pas impliqué de participants humains, d'animaux, d'échantillons biologiques, de dossiers médicaux, d'informations personnelles identifiables ni d'intervention dans les soins cliniques. Par conséquent, un examen éthique et un consentement éclairé formel n'étaient pas applicables.

Conception de l'étude

Cette étude transversale a évalué la lisibilité, la qualité et l'adaptabilité pédagogique des réponses générées par cinq modèles linguistiques de grande taille (LLM) en réponse à des questions fréquemment posées sur la névralgie du trijumeau (TN).

Identification des questions fréquemment posées relatives à la névralgie du trijumeau

Le 25 novembre 2025, deux experts cliniciens possédant une vaste expérience en médecine de la douleur ont examiné indépendamment les lignes directrices cliniques actuelles concernant la névralgie du trijumeau (NT), notamment la Classification internationale des troubles céphalalgiques, 3e édition (CITC-3), la recommandation de l'Académie européenne de neurologie, ainsi que la recommandation de l'Académie américaine de neurologie/Fédération européenne des sociétés de neurologie1,10,11. Après une discussion de consensus, ils ont établi une liste de 20 questions liées à la NT fréquemment rencontrées en pratique clinique. Le nombre de questions avait été déterminé a priori afin d'assurer une couverture équilibrée des cinq domaines thématiques prédéfinis, avec quatre questions sélectionnées pour chaque domaine, tout en maintenant le nombre total de réponses générées par le modèle dans une fourchette réalisable pour l'évaluation et la vérification manuelles par des experts. Afin d'améliorer la reproductibilité, le processus de sélection a suivi un cadre prédéfini basé sur les domaines : les experts ont tout d'abord identifié des questions candidates au sein de chaque domaine, les ont examinées indépendamment quant à leur pertinence clinique, leur formulation centrée sur le patient et l'absence de redondance, puis ont abouti à un consensus sur les quatre questions finales par domaine. La liste finale des questions est fournie dans le tableau 1 et le fichier supplémentaire 1. Les cinq domaines thématiques prédéfinis étaient les connaissances fondamentales sur la maladie, l'étiologie et les facteurs de risque, le diagnostic, le traitement, ainsi que la prévention et la réadaptation. Étant donné que l'ensemble des questions n'a pas été établi à partir des journaux de recherche des patients, des requêtes en ligne ou d'entretiens formels avec des patients, la possibilité d'un biais de sélection est reconnue comme une limite de l'étude.

Modèles d'IA et procédure de collecte des données

Le 25 novembre 2025, le jeu finalisé de 20 questions liées à la TN a été soumis à cinq plateformes publiques de grands modèles linguistiques (LLM) : Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5/ChatGPT. Tous les modèles ont été accessibles via leurs interfaces de chat web publiques standard ; aucun accès par interface de programmation d'application (API) n'a été utilisé. Pour chaque plateforme, le modèle public par défaut disponible à la date de collecte des données a été utilisé, sans modification des paramètres de génération. Étant donné que les interfaces web publiques ne montraient pas les identifiants de version du modèle backend, les invites système cachées, la température, le top-p, le nombre maximal de jetons de sortie ou d'autres paramètres de génération, ces éléments ont été notés comme « non affichés dans l'interface web publique ».

Les langues de l’invite et de la réponse étaient l’anglais pour tous les modèles. Chaque invite standardisée se composait uniquement de la question en anglais, mot pour mot, sans aucune instruction spécifique au modèle. Chaque question a été soumise individuellement dans une nouvelle session de discussion indépendante, sans historique de conversation préalable, fichiers téléchargés, plug-ins, instructions personnalisées ou invites de suivi. La liste complète des invites standardisées et les sorties brutes correspondantes des modèles sont fournies dans le Fichier supplémentaire 1. Les métadonnées des modèles et les paramètres de collecte des données sont résumés dans le Tableau supplémentaire 1.

Évaluation de la lisibilité

La lisibilité des réponses générées par le modèle linguistique de grande taille (LLM) a été évaluée à l’aide de plusieurs formules de lisibilité établies, disponibles via une plateforme en ligne d’évaluation de la lisibilité (http://readabilityformulas.com/). En l’absence d’un standard universellement accepté pour l’évaluation de la lisibilité et conformément à des études antérieures, un ensemble complet d’indices de lisibilité largement utilisés a été employé23,27. Sept indices ont été sélectionnés afin de couvrir des aspects complémentaires de la lisibilité, notamment la longueur des phrases, la longueur des mots, la charge syllabique, la complexité basée sur les caractères, la facilité de lecture et le niveau scolaire estimé, réduisant ainsi la dépendance à une seule formule. Plus précisément, l’indice de Coleman-Liau (CL), la formule Linsear Write (LW), l’indice de lisibilité automatisé (ARI), la mesure simple de galimatias (SMOG), l’indice Gunning Fog (GFOG), le score de facilité de lecture de Flesch (FRES) et le niveau scolaire Flesch-Kincaid (FKGL) ont été calculés. Ces indices estiment la difficulté de lecture ou le niveau scolaire requis et fournissent des mesures quantitatives de la lisibilité du texte (Tableau 2).

Évaluation de l'adéquation pédagogique et de la qualité de l'information

L'adaptation pédagogique a été évaluée à l'aide de l'outil d'évaluation des supports pédagogiques destinés aux patients (Patient Education Materials Assessment Tool, PEMAT), qui comprend deux domaines : la compréhensibilité et l'applicabilité28. L'instrument comprend 24 items, dont 16 évaluent la compréhensibilité et 8 l'applicabilité. Chaque item a été noté de manière binaire (0 = critère non satisfait ; 1 = critère satisfait), ce qui donne un score total variant de 0 à 24, les scores plus élevés indiquant une meilleure adaptation à l'éducation des patients. La qualité globale de l'information a été évaluée à l'aide du score de qualité global (Global Quality Score, GQS)27, une échelle de Likert à cinq points largement utilisée pour évaluer la qualité de l'information médicale (Tableau 3).

Le 25 novembre 2025, deux experts cliniciens possédant plus de trois ans d'expérience dans la prise en charge de la névralgie du trijumeau ont évalué toutes les réponses générées par l'IA à l'aide des deux instruments d'évaluation. Avant l'attribution des notes, toutes les réponses générées par l'IA ont été anonymisées à l'aide d'identifiants codés, et les évaluateurs ont été tenus dans l'ignorance de la plateforme de modèle linguistique (LLM) lors des évaluations PEMAT et GQS. Les désaccords ont été tranchés par un troisième expert senior, qui a attribué les notes finales. La fiabilité inter-évaluateurs a été évaluée à l'aide du coefficient kappa de Cohen, les valeurs >0,75 indiquant un accord excellent, les valeurs comprises entre 0,40 et 0,75 un accord acceptable, et les valeurs <0,40 un accord insuffisant. Les valeurs du kappa de Cohen pour le PEMAT et le GQS ont toutes deux dépassé 0,75, démontrant une excellente fiabilité inter-évaluateurs.

Analyse statistique

Toutes les analyses statistiques ont été effectuées à l'aide du logiciel R (version 4.4.3). La normalité des données a été évaluée à l'aide du test de Shapiro-Wilk et des graphiques Q-Q. Les variables normalement distribuées ont été résumées par la moyenne ± l'écart type et comparées à l'aide d'une analyse de variance à un facteur (ANOVA), suivie du test a posteriori de Tukey lorsque cela était approprié. Les variables non normalement distribuées ont été résumées par les médianes et les écarts interquartiles et comparées à l'aide du test de Kruskal-Wallis, suivi du test a posteriori de Dunn avec une correction de Bonferroni pour les comparaisons par paires. Les corrélations entre les indices de lisibilité, les scores PEMAT et les valeurs GQS ont été évaluées à l'aide du coefficient de corrélation de rang de Spearman, avec une correction de Benjamini-Hochberg appliquée pour les tests multiples. Une valeur P ajustée bilatérale < 0,05 a été considérée comme statistiquement significative.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a évalué systématiquement les effets des grands modèles linguistiques (LLMs) et de différentes catégories de contenu éducatif en santé sur la lisibilité et la qualité des textes générés. Premièrement, nous avons comparé les performances de cinq LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5 — en ce qui concerne l'adaptation aux patients, la qualité globale de l'information et plusieurs indicateurs de lisibilité, notamment le score PEMAT, le GQS et des indices de lisibilité établis (ARI, FRES, GFOG, FKGL, CL, SMOG et LW). Deuxièmement, nous avons examiné les mêmes mesures de résultat dans cinq domaines thématiques du contenu éducatif en santé : connaissances de base sur la maladie, étiologie et facteurs de risque, diagnostic, traitement, ainsi que prévention et réadaptation. En intégrant ces deux perspectives analytiques, nous avons approfondi la manière dont le type de modèle et la catégorie de contenu influencent conjointement la qualité et la lisibilité des textes, identifiant ainsi des motifs systématiques dans les supports éducatifs pour patients générés par les LLMs.

Analyse de la lisibilité entre différents grands modèles linguistiques

Sept indices de lisibilité établis ont été utilisés pour comparer systématiquement la complexité linguistique des textes relatifs à la névralgie du trijumeau générés par cinq grands modèles linguistiques : Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5. Les résultats globaux sont résumés dans le Tableau 4, et les distributions des métriques individuelles de lisibilité sont présentées dans la Figure 1A–G. Des différences statistiquement significatives ont été observées entre les cinq modèles pour tous les indices de lisibilité, avec une valeur P < 0,001 pour chacun.

GPT-5 a présenté les valeurs médianes les plus élevées pour l'ARI, le GFOG, le FKGL, le CL et le SMOG, ainsi que la valeur FRES la plus faible, indiquant qu'il a produit des textes avec des structures de phrases plus longues, un vocabulaire plus complexe et une charge de lecture globale la plus importante (Figure 1A–G). En revanche, Wenxin Yiyan a montré la complexité linguistique la plus faible. Ses valeurs médianes d'ARI, de GFOG, de FKGL, de CL et de SMOG étaient les plus basses parmi les cinq modèles, tandis que sa valeur FRES était la plus élevée.

Doubao, DeepSeek et Tongyi Qianwen ont démontré des niveaux de lisibilité intermédiaires entre GPT-5 et Wenxin Yiyan. Doubao et DeepSeek ont présenté des performances comparables selon les indices de niveau scolaire, notamment l'ARI, le GFOG, le FKGL et le CL, et les deux ont obtenu des valeurs significativement plus élevées que Wenxin Yiyan, avec dans tous les cas P < 0,05. Ces résultats indiquent une charge de lecture globale similaire pour Doubao et DeepSeek, avec une complexité linguistique supérieure à celle de Wenxin Yiyan.

Tongyi Qianwen a généralement fourni des valeurs intermédiaires entre celles de Doubao/DeepSeek et de GPT-5 selon la plupart des indices de lisibilité. Notamment, son score CL était plus proche de celui de GPT-5, suggérant une complexité linguistique légèrement supérieure à celle de Doubao et de DeepSeek, tout en restant inférieure à celle de GPT-5. L'indice LW présentait un profil de distribution différent de celui des autres métriques de lisibilité. Wenxin Yiyan a obtenu le score LW le plus élevé (60,00), suivi par Tongyi Qianwen, DeepSeek et Doubao, tandis que GPT-5 affichait le score LW le plus bas (46,50). Cette divergence reflète les différences dans la manière dont chaque formule de lisibilité pondère la longueur des phrases et la difficulté des mots (Figure 1G).

Dans l'ensemble, des différences substantielles en matière de complexité linguistique ont été observées entre les cinq grands modèles linguistiques. GPT-5 a produit le texte le plus complexe sur le plan linguistique, Wenxin Yiyan a généré le contenu le plus lisible, et les modèles restants ont présenté des niveaux intermédiaires de lisibilité, bien que des différences structurelles soient apparentes.

Comparaison de l'adaptabilité à l'éducation des patients et de la qualité globale entre les grands modèles linguistiques

Des différences significatives en matière d'adaptabilité à l'éducation des patients, évaluée à l'aide du PEMAT, ont été observées entre les cinq modèles linguistiques (Figure 1H ; Tableau 4), avec toutes les valeurs de P < 0,001. GPT-5 a obtenu le score PEMAT le plus élevé selon les experts (9,40 ± 1,90), indiquant une meilleure adéquation éducative dans le cadre actuel de référence. Toutefois, ces résultats ne doivent pas être interprétés comme une preuve que les documents générés par GPT-5 améliorent la compréhension réelle des patients, leur satisfaction, leur confiance, leurs comportements de santé ou les résultats cliniques.

DeepSeek a obtenu un score PEMAT intermédiaire (6,80 ± 1,06), avec une distribution des scores relativement compacte, suggérant une performance cohérente dans la génération de documents éducatifs à l'intention des patients. Néanmoins, son adéquation éducative globale est restée significativement inférieure à celle de GPT-5 (P < 0,001). Doubao, Tongyi Qianwen et Wenxin Yiyan ont obtenu des scores PEMAT plus faibles (5,35 ± 1,04, 5,65 ± 1,09 et 5,35 ± 0,93, respectivement). Aucune différence significative n’a été observée entre ces trois modèles, et tous ont performé significativement moins bien que DeepSeek et GPT-5 (tous les P < 0,01). Ces résultats indiquent une adéquation éducative comparable mais limitée pour ces modèles, en particulier en ce qui concerne la clarté des instructions, l’organisation linguistique et la facilité de compréhension.

Un schéma similaire a été observé pour la qualité globale de l'information, évaluée à l'aide du GQS (Figure 1I). Des différences statistiquement significatives ont été identifiées parmi les cinq modèles, tous les P < 0,001. GPT-5 a obtenu le score GQS le plus élevé (4,00 ± 0,65). Ses scores étaient concentrés dans la plage 4–5, avec une variabilité limitée, indiquant une performance constamment élevée en matière de cohérence du contenu, de complétude structurelle et d'utilité pratique.

DeepSeek et Doubao ont suivi, avec des scores GQS de 3,35 ± 0,59 et 3,40 ± 0,50, respectivement. Leurs distributions de scores étaient centrées entre 3 et 4, suggérant une qualité d'information modérée et une fiabilité raisonnable. En revanche, Tongyi Qianwen et Wenxin Yiyan ont obtenu les scores GQS les plus faibles (2,50 ± 0,51 et 2,20 ± 0,52, respectivement). Leurs distributions étaient asymétriques vers l'extrémité inférieure de l'échelle, indiquant des limites en matière de précision des informations, de rigueur structurelle et de profondeur du contenu, ce qui pourrait réduire leur utilité pour l'éducation des patients.

Dans l'ensemble, GPT-5 a obtenu les scores PEMAT et GQS les plus élevés selon les experts sur cet ensemble de données, tandis que DeepSeek et Doubao ont montré des performances intermédiaires. Tongyi Qianwen et Wenxin Yiyan ont reçu des évaluations GQS plus faibles. Ces résultats constituent des données de référence évaluées par des experts et ne doivent pas être interprétées comme une preuve de préparation clinique ou d'efficacité au niveau des patients.

Comparaison de la lisibilité, de l'adaptation à l'éducation du patient et de la qualité globale entre les catégories de contenus éducatifs en santé

L'analyse par catégorie de contenu a révélé des différences significatives en matière de lisibilité entre les cinq thèmes d'éducation sanitaire (Tableau 5). Pour le score FRES, des différences statistiquement significatives ont été observées entre les catégories thématiques (P = 0,004). Des valeurs FRES plus élevées indiquent une lisibilité plus facile. Les textes sur les connaissances de base concernant les maladies étaient les plus lisibles (médiane = 28,50), suivis par les contenus diagnostiques (médiane = 16,00), les contenus sur l'étiologie et les facteurs de risque (médiane = 12,50) et les contenus relatifs au traitement (médiane = 11,50). En revanche, les textes sur la prévention et la réadaptation présentaient la plus faible lisibilité (médiane FRES = 1,00), indiquant la plus grande difficulté de lecture.

Des schémas similaires ont été observés pour les autres indices de lisibilité. Le GFOG et le FKGL différaient significativement selon les catégories thématiques (P = 0,002 et P = 0,036, respectivement), les deux indices indiquant des niveaux scolaires de lecture plus élevés pour les contenus portant sur l'étiologie et les facteurs de risque, ainsi que sur la prévention et la réadaptation. L'indice SMOG suggérait également que les textes sur l'étiologie et les facteurs de risque contenaient une proportion plus importante de mots polysyllabiques (P = 0,039). Les différences les plus marquées ont été observées pour le CL (P < 0,001). Les textes sur la prévention et la réadaptation présentaient les phrases les plus longues (médiane = 21,01), augmentant considérablement la difficulté de lecture, tandis que les textes sur les connaissances de base sur la maladie avaient les phrases les plus courtes (médiane = 14,88), correspondant à la charge de lecture la plus faible. Aucune différence significative n'a été observée entre les catégories de contenu pour l'ARI ou le LW.

Aucune différence statistiquement significative en matière d'adéquation éducative pour les patients n'a été observée entre les cinq catégories de contenu selon les scores PEMAT (P = 0,252). Les scores moyens au PEMAT variaient de 5,90 à 7,20, indiquant qu’en dépit de différences marquées en complexité linguistique, l’adéquation éducative est restée relativement constante selon les thèmes. De même, la qualité globale de l'information, évaluée à l’aide du GQS, ne différait pas de manière significative entre les catégories de contenu (P = 0,822). Les valeurs moyennes du GQS allaient de 2,95 à 3,25, ce qui montre que la qualité globale de l'information était relativement stable selon les thèmes abordés.

Dans l'ensemble, des différences substantielles de lisibilité ont été observées selon les thèmes d'éducation à la santé, les contenus portant sur l'étiologie et les facteurs de risque ainsi que sur la prévention et la réadaptation présentant la plus grande difficulté de lecture, tandis que les connaissances de base sur la maladie étaient les plus accessibles. En revanche, l'adaptabilité de l'éducation du patient et la qualité globale de l'information sont restées relativement constantes entre les catégories de contenu.

Analyse de corrélation entre la lisibilité, l'adaptation à l'éducation du patient et la qualité globale

La matrice de corrélation de la Figure 2 montre des associations cohérentes et robustes entre les indices de lisibilité, indiquant une forte cohérence interne. La plupart des indicateurs de lisibilité, notamment l’ARI, le GFOG, le FKGL, le CL et le SMOG, présentaient des corrélations positives allant de modérées à fortes les uns avec les autres, les coefficients de corrélation variant de 0,64 à 0,97 (tous les P < 0,001). Ces résultats renforcent davantage le caractère complémentaire de ces indices pour évaluer la complexité linguistique. En revanche, le FRES présentait des corrélations négatives significatives avec plusieurs indicateurs de lisibilité, notamment l’ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation absolus étant supérieurs à 0,70 (tous les P < 0,001). Ce schéma reflète le sens inverse du score du FRES, où des valeurs plus élevées indiquent une lisibilité accrue. L’indice LW montrait également des corrélations négatives significatives avec d'autres indices de lisibilité, notamment l’ARI, le FKGL, le GFOG et le SMOG, les coefficients de corrélation absolus variant de 0,75 à 0,90 (tous les P < 0,001). En revanche, le LW était positivement corrélé au FRES (coefficient de corrélation = 0,69, P < 0,001).

Des associations nettes ont également été observées entre les indices de lisibilité et la qualité globale de l'information, telle que mesurée par le GQS. Le GQS a démontré des corrélations positives faibles à modérées avec la plupart des indicateurs de lisibilité, notamment l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,326 à 0,391 (tous P < 0,001). Ces résultats suggèrent qu'une complexité linguistique plus élevée était associée à une qualité d'information plus élevée selon les experts. En revanche, le GQS était modérément négativement corrélé avec le FRES (coefficient de corrélation = −0,408, P < 0,001), indiquant que les textes nécessitant un niveau de lecture plus élevé obtenaient généralement des notes GQS plus élevées. Le GQS présentait également une corrélation négative modérée avec le LW (coefficient de corrélation = −0,421, P < 0,001).

Les associations entre la lisibilité et l'adéquation éducative pour les patients, évaluées à l'aide du PEMAT, étaient généralement plus faibles mais cohérentes en direction. Les scores PEMAT présentaient de faibles corrélations positives avec l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,305 à 0,434 (tous P < 0,01). En revanche, les scores PEMAT étaient faiblement négativement corrélés au FRES et au LW, avec des coefficients de corrélation absolus de 0,432 et 0,320, respectivement (les deux P < 0,01). Ces résultats suggèrent que, dans le cadre de ce jeu de données, une complexité linguistique plus élevée était associée à une adéquation éducative légèrement supérieure selon l'évaluation d'experts, bien que la force de ces associations soit limitée.

Il est important de noter qu'une corrélation positive modérée a été observée entre les scores PEMAT et GQS (coefficient de corrélation = 0,645, P < 0,001). Il s'agissait de l'association la plus forte observée entre les domaines d'évaluation, ce qui indique que les réponses présentant une adéquation éducative plus élevée avaient également tendance à obtenir des évaluations plus élevées en matière de qualité globale de l'information.

DISPONIBILITÉ DES DONNÉES :

L'ensemble complet des données soutenant cette étude est fourni en tant que matériel supplémentaire. Supplementary File 1 contient la liste complète des questions normalisées, des invites et des 100 réponses générées par les modèles linguistiques de grande taille (LLM) archivées. Supplementary Table 2 contient les feuilles de notation PEMAT et GQS par des experts, y compris les évaluations PEMAT par item lorsque disponibles, les scores PEMAT totaux, les scores GQS, les informations de comparaison entre évaluateurs et les dossiers d'arbitrage le cas échéant. Les scores de lisibilité, les données brutes des figures et le code d'analyse R sont fournis en tant que Supplementary File 2. Étant donné que les sorties des LLM peuvent évoluer avec le temps en raison de mises à jour des modèles, de modifications d'interface ou de changements au niveau de la plateforme, les sorties archivées, plutôt que les réponses régénérées, doivent être utilisées pour la vérification et les analyses secondaires.

figure-results-1
Figure 1 : Comparaison de la lisibilité, de l'adaptation à l'éducation des patients et de la qualité globale de l'information entre cinq grands modèles linguistiques. (A–G) Ce panneau présente les indices de lisibilité : indice de lisibilité automatisé (ARI), score de facilité de lecture de Flesch (FRES), indice de brouillard de Gunning (GFOG), niveau scolaire Flesch-Kincaid (FKGL), indice Coleman-Liau (CL), mesure simple de charabia (SMOG) et formule Linsear Write (LW). (H) Ce panneau montre les scores totaux du PEMAT, et le panneau (I) présente les scores de qualité globale (GQS). Dans chaque boîte à moustaches, la ligne centrale représente la médiane, la boîte indique l'intervalle interquartile (IQR), les moustaches s'étendent jusqu'à 1,5 × IQR, et les points au-delà des moustaches représentent des valeurs aberrantes. Abréviations : ARI = Automated Readability Index ; FRES = Flesch Reading Ease Score ; GFOG = Gunning Fog Index ; FKGL = Flesch Kincaid Grade Level ; CL = Coleman Liau Index ; SMOG = Simple Measure of Gobbledygook ; LW = Linsear Write ; PEMAT = outil d'évaluation des documents pédagogiques destinés aux patients pour l'intelligibilité et la possibilité d'action, format imprimable ; Global Quality Score = GQS. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

figure-results-2
Figure 2 : Matrice de corrélation de Spearman entre les indices de lisibilité, l'adaptabilité à l'éducation du patient et la qualité globale de l'information dans l'ensemble des réponses générées par le modèle. La matrice indique les coefficients de corrélation de Spearman pour les associations par paires entre l'ARI, le FRES, le GFOG, le FKGL, le CL, le SMOG, le LW, le PEMAT et le GQS. Abréviations : ARI = indice de lisibilité automatisé ; FRES = score de facilité de lecture de Flesch ; GFOG = indice de brouillard de Gunning ; FKGL = niveau scolaire de Flesch-Kincaid ; CL = indice de Coleman-Liau ; SMOG = mesure simple du charabia ; LW = Linsear Write ; PEMAT = outil d'évaluation des supports pédagogiques pour patients ; GQS = score de qualité global. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Tableau 1 : Liste de 20 questions relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.

Tableau 2 : Outils, formules et descriptions relatifs à la lisibilité. Veuillez cliquer ici pour télécharger ce fichier.

Tableau 3 : Critères de qualité du Global Quality Score (GQS). Veuillez cliquer ici pour télécharger ce fichier.

Tableau 4 : Résultats d'analyse de différents grands modèles linguistiques pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.

Tableau 5 : Résultats de l'analyse selon différentes dimensions pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.

Tableau supplémentaire 1 : Scores de lisibilité des réponses générées par les cinq grands modèles linguistiques à travers tous les indices de lisibilité évalués. Veuillez cliquer ici pour télécharger ce fichier.

Tableau supplémentaire 2 : Évaluations par des experts de l'adaptation à l'éducation des patients (PEMAT) et de la qualité globale de l'information (GQS) pour les réponses générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.

Fichier supplémentaire 1 : Questions normalisées sur la névralgie du trijumeau et réponses complètes générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.

Fichier supplémentaire 2 : Scripts R et données sources utilisés pour les analyses statistiques et la création des figures. Veuillez cliquer ici pour télécharger ce fichier.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude transversale de référence a comparé de manière systématique la lisibilité, l'adéquation pédagogique et la qualité globale de l'information des documents éducatifs destinés aux patients atteints de névralgie du trijumeau (TN), générés par cinq grands modèles linguistiques (LLM) accessibles au public. Quatre résultats principaux ont émergé. Premièrement, la lisibilité variait considérablement selon les modèles, GPT-5 produisant les réponses les plus complexes sur le plan linguistique, tandis que Wenxin Yiyan générait le contenu le plus lisible. Deuxièmement, la lisibilité et la qualité de l'information évaluée par des experts représentaient des dimensions d'évaluation distinctes, GPT-5 obtenant les scores les plus élevés aux échelles PEMAT et GQS malgré sa lisibilité inférieure. Troisièmement, le thème du contenu influençait la lisibilité, les sujets portant sur la prévention, la rééducation, ainsi que sur l'étiologie et les facteurs de risque nécessitant généralement un niveau de lecture plus élevé, alors que les scores PEMAT et GQS restaient relativement stables selon les catégories de contenu. Enfin, les indices de lisibilité présentaient une forte cohérence interne, et les analyses de corrélation ont révélé des associations positives faibles à modérées entre la complexité linguistique et les scores PEMAT et GQS, ainsi qu'une corrélation positive modérée entre PEMAT et GQS. Dans leur ensemble, ces résultats fournissent une référence pour évaluer les documents éducatifs sur la TN générés par des LLM, tout en soulignant la nécessité d'équilibrer exhaustivité médicale et accessibilité linguistique. Il est important de noter que ces résultats reflètent des évaluations expertes et ne doivent pas être interprétés comme une preuve de compréhension par les patients, d'exactitude factuelle, de sécurité clinique ou d'aptitude à une utilisation clinique courante.

Les résultats de cette étude sont cohérents avec des évaluations antérieures des informations médicales générées par l'intelligence artificielle, qui ont signalé une variabilité importante entre les grands modèles linguistiques (LLM) et une fréquente disconnexion entre la lisibilité et la qualité de l'information26,27,29. Des études antérieures menées dans plusieurs domaines pathologiques ont montré que les documents éducatifs pour patients générés par les LLM dépassent souvent les niveaux de lecture recommandés, et que les modèles produisant les textes les plus lisibles n'offrent pas nécessairement les informations les plus complètes ou de la meilleure qualité26,30. Les résultats obtenus dans l'éducation sur la thrombose veineuse profonde (TV) confirment cette observation. GPT-5 a généré les réponses les plus complexes sur le plan linguistique tout en obtenant les scores les plus élevés aux échelles PEMAT et GQS, tandis que Wenxin Yiyan a produit un texte plus lisible mais avec une pertinence éducative et une qualité globale inférieures selon l'évaluation par des experts. De plus, la lisibilité variait selon les domaines thématiques, les sujets relatifs à la prévention et à la réadaptation ainsi qu'à l'étiologie et aux facteurs de risque présentant généralement une complexité linguistique plus élevée, ce qui suggère que la difficulté de lecture est influencée à la fois par les caractéristiques du modèle et par la complexité du sujet31.

Le compromis apparent entre lisibilité et qualité de l'information est conforme aux concepts distincts mesurés par les instruments d'évaluation. Les formules de lisibilité évaluent principalement des caractéristiques linguistiques de surface, telles que la longueur des phrases et la complexité lexicale, tandis que le PEMAT et le GQS évaluent des attributs de niveau supérieur, notamment l'organisation de l'information, l'exhaustivité, la clarté des explications et l'applicabilité concrète32. Pour l'éducation sur le nerf trijumeau (TN), les réponses de haute qualité incluent fréquemment une discussion sur les symptômes d'alerte, le diagnostic différentiel, la prise en charge pharmacologique et ses effets indésirables, les options interventionnelles et chirurgicales, ainsi que des stratégies de réadaptation individualisées33. Un contenu cliniquement complet de ce type augmente inévitablement la densité terminologique et la complexité syntaxique, ce qui se traduit par des scores de lisibilité plus élevés et une qualité éducative supérieure selon les experts. Il est important de noter que ces résultats ne doivent pas être interprétés comme suggérant qu'un langage plus complexe serait préférable. Ils indiquent plutôt que les grands modèles linguistiques (LLM) actuels améliorent souvent l'exhaustivité de l'information au détriment de l'accessibilité linguistique. Le développement futur des systèmes d'éducation des patients devrait donc viser à préserver l'exactitude médicale tout en simplifiant le langage par une révision en langage clair, une présentation structurée des points clés, l'explication des termes techniques et des recommandations claires et applicables, adaptées aux patients ayant des niveaux variés d'alphabétisation en santé11,34,35.

L'analyse de corrélation renforce davantage la distinction entre lisibilité et qualité éducative. La plupart des indices de lisibilité basés sur le niveau scolaire ont montré des associations positives faibles à modérées avec les scores PEMAT et GQS, tandis que le FRES a présenté la relation inverse attendue, car des scores FRES plus élevés indiquent une lisibilité plus facile. Ces résultats n'impliquent pas qu'une complexité linguistique accrue soit souhaitable ; ils suggèrent plutôt que les modèles linguistiques actuels (LLM) atteignent souvent une complétude informationnelle plus grande au détriment de l'accessibilité34. Par conséquent, le développement de l'éducation des patients assistée par l'intelligence artificielle devrait privilégier l'exactitude et la complétude médicales, tout en intégrant une rédaction en langage simple, une présentation structurée des points clés, des explications claires du vocabulaire technique et des recommandations applicables adaptées aux patients ayant des niveaux variés d'illectronisme en santé11,35.

Un autre résultat méthodologique concerne le comportement distinct de l'indice LW par rapport aux autres mesures de lisibilité. Contrairement à l'ARI, au FKGL, au GFOG, au CL et au SMOG, le LW suivait un modèle plus proche de celui du FRES, reflétant ainsi les différences dans la manière dont les formules de lisibilité opérationnalisent la complexité du texte36. Étant donné que le LW a été initialement conçu pour des manuels techniques et qu'il met l'accent sur la structure des phrases échantillonnées et la classification des mots plutôt que sur les caractéristiques globales des phrases ou des syllabes, il pourrait réagir différemment aux textes médicaux générés par l'intelligence artificielle, qui combinent des énoncés concis avec des passages explicatifs plus longs et des distributions irrégulières de terminologie technique37,38. Ces résultats renforcent l'importance d'un cadre d'évaluation multiparamétrique, car aucun indice unique de lisibilité ne saisit adéquatement toutes les dimensions de la complexité textuelle. En cohérence avec des études antérieures sur l'information de santé générée par l'IA, la lisibilité globale devrait donc être interprétée à partir de preuves convergentes issues de plusieurs indices complémentaires, plutôt que d'une mesure isolée39.

La catégorie de contenu a également influencé la lisibilité. Les sujets portant sur la prévention, la réadaptation, ainsi que sur l'étiologie et les facteurs de risque produisaient généralement des textes plus difficiles à lire que ceux consacrés aux connaissances de base sur les maladies, probablement parce que ces thèmes exigent des recommandations conditionnelles, des explications mécanistiques et un vocabulaire plus spécialisé40,41. En revanche, les connaissances de base sur les maladies sont principalement fondées sur des définitions et peuvent être exprimées dans un langage plus simple42. Malgré ces différences, le PEMAT et le GQS sont restés relativement constants entre les différents domaines thématiques, ce qui suggère que la pertinence éducative évaluée par des experts et la qualité globale de l'information ont été maintenues quel que soit le type de question posée par les patients35,43.

Ces résultats ont plusieurs implications pour la pratique clinique et le développement futur des grands modèles linguistiques (LLM). Alors que les patients utilisent de plus en plus les LLM pour obtenir des informations avant ou après une consultation médicale, le contenu généré par l’intelligence artificielle devrait compléter, et non remplacer, le conseil prodigué par les cliniciens, en particulier en ce qui concerne la sécurité des médicaments, les indications de traitements interventionnels ou chirurgicaux, et la reconnaissance des symptômes d’alerte nécessitant une évaluation urgente44. Les établissements de santé pourraient tirer profit de la mise à disposition de ressources éducatives rédigées en langage simple et validées par des experts, tout en utilisant les LLM comme outils de rédaction ou d’aide à la décision, plutôt que comme systèmes autonomes d’éducation des patients. Les modèles futurs devraient intégrer des stratégies de génération prenant en compte la lisibilité, une communication transparente des versions du modèle et des dates de génération, une indication explicite des incertitudes, ainsi que des procédures de gouvernance incluant la relecture par des cliniciens, la vérification de l’exactitude factuelle, le dépistage des hallucinations, les contrôles de sécurité médicamenteuse, des recommandations pour les signes d’alerte et des tests de compréhension par les patients avant toute mise en œuvre clinique26,44,45.

Cette étude présente plusieurs limites. Les résultats des modèles ont été recueillis à partir d'interfaces web accessibles au public à une seule date, et des mises à jour ultérieures des modèles, des modifications d'interface, des invites système cachées ou des paramètres de génération par défaut pourraient affecter la reproductibilité. L'ensemble de 20 questions a été élaboré par des experts cliniques plutôt que dérivé de journaux de recherche des patients ou d'entretiens formels avec des patients, une pratique qui pourrait introduire un biais de sélection. De plus, l'étude s'est appuyée sur des évaluations expertes des critères PEMAT et GQS, sans évaluer la compréhension, la confiance, la satisfaction, les comportements de santé ou les résultats cliniques des patients. Les formules de lisibilité, le PEMAT et le GQS n'évaluent pas non plus directement l'exactitude factuelle, le risque d'hallucination, l'exactitude des citations, l'exhaustivité des contre-indications ou la sécurité clinique. Par conséquent, ces résultats doivent être interprétés comme une analyse transversale de référence effectuée par des experts, plutôt que comme une preuve que tout matériel généré par un LLM est prêt à être utilisé en pratique clinique courante. Les études futures devraient inclure des résultats de modèles archivés, des métadonnées détaillées sur les modèles, des évaluations multilingues, des ensembles de questions plus larges, des audits de sécurité formels, des évaluations de l'exactitude factuelle et des mesures centrées sur les patients avant que des supports pédagogiques générés par LLM ne soient envisagés pour une mise en œuvre clinique.

Dans cette étude transversale comparative évaluée par des experts, les grands modèles linguistiques disponibles publiquement différaient fortement quant à la lisibilité, à l'adaptation éducative et à la qualité globale de l'information des documents éducatifs destinés aux patients atteints de névralgie du trijumeau. GPT-5 a obtenu les scores les plus élevés aux évaluations expertes PEMAT et GQS, mais a également produit les réponses les plus complexes sur le plan linguistique, ce qui souligne que la lisibilité et la qualité éducative évaluée par des experts représentent des dimensions liées, mais distinctes, de l'éducation des patients. Bien que certains modèles aient produit des contenus plus lisibles, cela ne s'est pas nécessairement traduit par une adaptation éducative ou une qualité d'information globale supérieure. Étant donné que cette étude n'a pas évalué l'exactitude factuelle au moyen d'un audit de sécurité dédié, les risques d'hallucinations, l'exactitude des citations, la compréhension par les patients, la confiance, la satisfaction, les comportements de santé ou les résultats cliniques, les résultats doivent être interprétés comme une analyse comparative évaluée par des experts, et non comme une preuve de préparation clinique. Les études futures devraient intégrer une évaluation par des experts, des évaluations formelles de la sécurité et de l'exactitude factuelle, ainsi que des évaluations centrées sur le patient afin de soutenir l'utilisation sûre et efficace des documents générés par les grands modèles linguistiques dans l'éducation des patients.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun intérêt concurrentiel.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche n'a reçu aucune subvention spécifique d'un organisme de financement public, commercial ou à but non lucratif. Les auteurs remercient les collègues cliniciens qui ont fourni des commentaires sur le jeu de questions relatif à la névralgie du trijumeau et aidé à affiner le cadre d'évaluation. Nous remercions également tous les contributeurs qui ont soutenu la préparation et la révision du manuscrit.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Plateforme de discussion DeepSeekDeepSeekhttps://chat.deepseek.com/Interface publiquement accessible de modèle de langage volumineux utilisée pour générer des réponses
Plateforme de discussion DoubaoDoubaohttps://www.doubao.com/chat/Interface publiquement accessible de modèle de langage volumineux utilisée pour générer des réponses
GPT 5 OpenAINon applicableInterface publiquement accessible de modèle de langage volumineux utilisée pour générer des réponses
Logiciel R, version 4.4.3Fondation R pour l'informatique statistiqueNon applicableAnalyse statistique et visualisation
Calculateur en ligne de formules de lisibilitéReadability FormulasNon applicableOutil en ligne utilisé pour calculer des indices de lisibilité
Plateforme de discussion Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interface publiquement accessible de modèle de langage volumineux utilisée pour générer des réponses
Plateforme de discussion Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interface publiquement accessible de modèle de langage volumineux utilisée pour générer des réponses

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Grands mod les de langagevaluation de la lisibilitqualit ducativevaluation PEMATscore de qualit globalequalit de l information sanitaireanalyse comparative de mod lescompr hension du patient

Articles connexes