$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Cette étude a évalué systématiquement les effets des grands modèles linguistiques (LLMs) et de différentes catégories de contenu éducatif en santé sur la lisibilité et la qualité des textes générés. Premièrement, nous avons comparé les performances de cinq LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5 — en ce qui concerne l'adaptation aux patients, la qualité globale de l'information et plusieurs indicateurs de lisibilité, notamment le score PEMAT, le GQS et des indices de lisibilité établis (ARI, FRES, GFOG, FKGL, CL, SMOG et LW). Deuxièmement, nous avons examiné les mêmes mesures de résultat dans cinq domaines thématiques du contenu éducatif en santé : connaissances de base sur la maladie, étiologie et facteurs de risque, diagnostic, traitement, ainsi que prévention et réadaptation. En intégrant ces deux perspectives analytiques, nous avons approfondi la manière dont le type de modèle et la catégorie de contenu influencent conjointement la qualité et la lisibilité des textes, identifiant ainsi des motifs systématiques dans les supports éducatifs pour patients générés par les LLMs.
Analyse de la lisibilité entre différents grands modèles linguistiques
Sept indices de lisibilité établis ont été utilisés pour comparer systématiquement la complexité linguistique des textes relatifs à la névralgie du trijumeau générés par cinq grands modèles linguistiques : Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen et GPT-5. Les résultats globaux sont résumés dans le Tableau 4, et les distributions des métriques individuelles de lisibilité sont présentées dans la Figure 1A–G. Des différences statistiquement significatives ont été observées entre les cinq modèles pour tous les indices de lisibilité, avec une valeur P < 0,001 pour chacun.
GPT-5 a présenté les valeurs médianes les plus élevées pour l'ARI, le GFOG, le FKGL, le CL et le SMOG, ainsi que la valeur FRES la plus faible, indiquant qu'il a produit des textes avec des structures de phrases plus longues, un vocabulaire plus complexe et une charge de lecture globale la plus importante (Figure 1A–G). En revanche, Wenxin Yiyan a montré la complexité linguistique la plus faible. Ses valeurs médianes d'ARI, de GFOG, de FKGL, de CL et de SMOG étaient les plus basses parmi les cinq modèles, tandis que sa valeur FRES était la plus élevée.
Doubao, DeepSeek et Tongyi Qianwen ont démontré des niveaux de lisibilité intermédiaires entre GPT-5 et Wenxin Yiyan. Doubao et DeepSeek ont présenté des performances comparables selon les indices de niveau scolaire, notamment l'ARI, le GFOG, le FKGL et le CL, et les deux ont obtenu des valeurs significativement plus élevées que Wenxin Yiyan, avec dans tous les cas P < 0,05. Ces résultats indiquent une charge de lecture globale similaire pour Doubao et DeepSeek, avec une complexité linguistique supérieure à celle de Wenxin Yiyan.
Tongyi Qianwen a généralement fourni des valeurs intermédiaires entre celles de Doubao/DeepSeek et de GPT-5 selon la plupart des indices de lisibilité. Notamment, son score CL était plus proche de celui de GPT-5, suggérant une complexité linguistique légèrement supérieure à celle de Doubao et de DeepSeek, tout en restant inférieure à celle de GPT-5. L'indice LW présentait un profil de distribution différent de celui des autres métriques de lisibilité. Wenxin Yiyan a obtenu le score LW le plus élevé (60,00), suivi par Tongyi Qianwen, DeepSeek et Doubao, tandis que GPT-5 affichait le score LW le plus bas (46,50). Cette divergence reflète les différences dans la manière dont chaque formule de lisibilité pondère la longueur des phrases et la difficulté des mots (Figure 1G).
Dans l'ensemble, des différences substantielles en matière de complexité linguistique ont été observées entre les cinq grands modèles linguistiques. GPT-5 a produit le texte le plus complexe sur le plan linguistique, Wenxin Yiyan a généré le contenu le plus lisible, et les modèles restants ont présenté des niveaux intermédiaires de lisibilité, bien que des différences structurelles soient apparentes.
Comparaison de l'adaptabilité à l'éducation des patients et de la qualité globale entre les grands modèles linguistiques
Des différences significatives en matière d'adaptabilité à l'éducation des patients, évaluée à l'aide du PEMAT, ont été observées entre les cinq modèles linguistiques (Figure 1H ; Tableau 4), avec toutes les valeurs de P < 0,001. GPT-5 a obtenu le score PEMAT le plus élevé selon les experts (9,40 ± 1,90), indiquant une meilleure adéquation éducative dans le cadre actuel de référence. Toutefois, ces résultats ne doivent pas être interprétés comme une preuve que les documents générés par GPT-5 améliorent la compréhension réelle des patients, leur satisfaction, leur confiance, leurs comportements de santé ou les résultats cliniques.
DeepSeek a obtenu un score PEMAT intermédiaire (6,80 ± 1,06), avec une distribution des scores relativement compacte, suggérant une performance cohérente dans la génération de documents éducatifs à l'intention des patients. Néanmoins, son adéquation éducative globale est restée significativement inférieure à celle de GPT-5 (P < 0,001). Doubao, Tongyi Qianwen et Wenxin Yiyan ont obtenu des scores PEMAT plus faibles (5,35 ± 1,04, 5,65 ± 1,09 et 5,35 ± 0,93, respectivement). Aucune différence significative n’a été observée entre ces trois modèles, et tous ont performé significativement moins bien que DeepSeek et GPT-5 (tous les P < 0,01). Ces résultats indiquent une adéquation éducative comparable mais limitée pour ces modèles, en particulier en ce qui concerne la clarté des instructions, l’organisation linguistique et la facilité de compréhension.
Un schéma similaire a été observé pour la qualité globale de l'information, évaluée à l'aide du GQS (Figure 1I). Des différences statistiquement significatives ont été identifiées parmi les cinq modèles, tous les P < 0,001. GPT-5 a obtenu le score GQS le plus élevé (4,00 ± 0,65). Ses scores étaient concentrés dans la plage 4–5, avec une variabilité limitée, indiquant une performance constamment élevée en matière de cohérence du contenu, de complétude structurelle et d'utilité pratique.
DeepSeek et Doubao ont suivi, avec des scores GQS de 3,35 ± 0,59 et 3,40 ± 0,50, respectivement. Leurs distributions de scores étaient centrées entre 3 et 4, suggérant une qualité d'information modérée et une fiabilité raisonnable. En revanche, Tongyi Qianwen et Wenxin Yiyan ont obtenu les scores GQS les plus faibles (2,50 ± 0,51 et 2,20 ± 0,52, respectivement). Leurs distributions étaient asymétriques vers l'extrémité inférieure de l'échelle, indiquant des limites en matière de précision des informations, de rigueur structurelle et de profondeur du contenu, ce qui pourrait réduire leur utilité pour l'éducation des patients.
Dans l'ensemble, GPT-5 a obtenu les scores PEMAT et GQS les plus élevés selon les experts sur cet ensemble de données, tandis que DeepSeek et Doubao ont montré des performances intermédiaires. Tongyi Qianwen et Wenxin Yiyan ont reçu des évaluations GQS plus faibles. Ces résultats constituent des données de référence évaluées par des experts et ne doivent pas être interprétées comme une preuve de préparation clinique ou d'efficacité au niveau des patients.
Comparaison de la lisibilité, de l'adaptation à l'éducation du patient et de la qualité globale entre les catégories de contenus éducatifs en santé
L'analyse par catégorie de contenu a révélé des différences significatives en matière de lisibilité entre les cinq thèmes d'éducation sanitaire (Tableau 5). Pour le score FRES, des différences statistiquement significatives ont été observées entre les catégories thématiques (P = 0,004). Des valeurs FRES plus élevées indiquent une lisibilité plus facile. Les textes sur les connaissances de base concernant les maladies étaient les plus lisibles (médiane = 28,50), suivis par les contenus diagnostiques (médiane = 16,00), les contenus sur l'étiologie et les facteurs de risque (médiane = 12,50) et les contenus relatifs au traitement (médiane = 11,50). En revanche, les textes sur la prévention et la réadaptation présentaient la plus faible lisibilité (médiane FRES = 1,00), indiquant la plus grande difficulté de lecture.
Des schémas similaires ont été observés pour les autres indices de lisibilité. Le GFOG et le FKGL différaient significativement selon les catégories thématiques (P = 0,002 et P = 0,036, respectivement), les deux indices indiquant des niveaux scolaires de lecture plus élevés pour les contenus portant sur l'étiologie et les facteurs de risque, ainsi que sur la prévention et la réadaptation. L'indice SMOG suggérait également que les textes sur l'étiologie et les facteurs de risque contenaient une proportion plus importante de mots polysyllabiques (P = 0,039). Les différences les plus marquées ont été observées pour le CL (P < 0,001). Les textes sur la prévention et la réadaptation présentaient les phrases les plus longues (médiane = 21,01), augmentant considérablement la difficulté de lecture, tandis que les textes sur les connaissances de base sur la maladie avaient les phrases les plus courtes (médiane = 14,88), correspondant à la charge de lecture la plus faible. Aucune différence significative n'a été observée entre les catégories de contenu pour l'ARI ou le LW.
Aucune différence statistiquement significative en matière d'adéquation éducative pour les patients n'a été observée entre les cinq catégories de contenu selon les scores PEMAT (P = 0,252). Les scores moyens au PEMAT variaient de 5,90 à 7,20, indiquant qu’en dépit de différences marquées en complexité linguistique, l’adéquation éducative est restée relativement constante selon les thèmes. De même, la qualité globale de l'information, évaluée à l’aide du GQS, ne différait pas de manière significative entre les catégories de contenu (P = 0,822). Les valeurs moyennes du GQS allaient de 2,95 à 3,25, ce qui montre que la qualité globale de l'information était relativement stable selon les thèmes abordés.
Dans l'ensemble, des différences substantielles de lisibilité ont été observées selon les thèmes d'éducation à la santé, les contenus portant sur l'étiologie et les facteurs de risque ainsi que sur la prévention et la réadaptation présentant la plus grande difficulté de lecture, tandis que les connaissances de base sur la maladie étaient les plus accessibles. En revanche, l'adaptabilité de l'éducation du patient et la qualité globale de l'information sont restées relativement constantes entre les catégories de contenu.
Analyse de corrélation entre la lisibilité, l'adaptation à l'éducation du patient et la qualité globale
La matrice de corrélation de la Figure 2 montre des associations cohérentes et robustes entre les indices de lisibilité, indiquant une forte cohérence interne. La plupart des indicateurs de lisibilité, notamment l’ARI, le GFOG, le FKGL, le CL et le SMOG, présentaient des corrélations positives allant de modérées à fortes les uns avec les autres, les coefficients de corrélation variant de 0,64 à 0,97 (tous les P < 0,001). Ces résultats renforcent davantage le caractère complémentaire de ces indices pour évaluer la complexité linguistique. En revanche, le FRES présentait des corrélations négatives significatives avec plusieurs indicateurs de lisibilité, notamment l’ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation absolus étant supérieurs à 0,70 (tous les P < 0,001). Ce schéma reflète le sens inverse du score du FRES, où des valeurs plus élevées indiquent une lisibilité accrue. L’indice LW montrait également des corrélations négatives significatives avec d'autres indices de lisibilité, notamment l’ARI, le FKGL, le GFOG et le SMOG, les coefficients de corrélation absolus variant de 0,75 à 0,90 (tous les P < 0,001). En revanche, le LW était positivement corrélé au FRES (coefficient de corrélation = 0,69, P < 0,001).
Des associations nettes ont également été observées entre les indices de lisibilité et la qualité globale de l'information, telle que mesurée par le GQS. Le GQS a démontré des corrélations positives faibles à modérées avec la plupart des indicateurs de lisibilité, notamment l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,326 à 0,391 (tous P < 0,001). Ces résultats suggèrent qu'une complexité linguistique plus élevée était associée à une qualité d'information plus élevée selon les experts. En revanche, le GQS était modérément négativement corrélé avec le FRES (coefficient de corrélation = −0,408, P < 0,001), indiquant que les textes nécessitant un niveau de lecture plus élevé obtenaient généralement des notes GQS plus élevées. Le GQS présentait également une corrélation négative modérée avec le LW (coefficient de corrélation = −0,421, P < 0,001).
Les associations entre la lisibilité et l'adéquation éducative pour les patients, évaluées à l'aide du PEMAT, étaient généralement plus faibles mais cohérentes en direction. Les scores PEMAT présentaient de faibles corrélations positives avec l'ARI, le GFOG, le FKGL, le CL et le SMOG, les coefficients de corrélation variant de 0,305 à 0,434 (tous P < 0,01). En revanche, les scores PEMAT étaient faiblement négativement corrélés au FRES et au LW, avec des coefficients de corrélation absolus de 0,432 et 0,320, respectivement (les deux P < 0,01). Ces résultats suggèrent que, dans le cadre de ce jeu de données, une complexité linguistique plus élevée était associée à une adéquation éducative légèrement supérieure selon l'évaluation d'experts, bien que la force de ces associations soit limitée.
Il est important de noter qu'une corrélation positive modérée a été observée entre les scores PEMAT et GQS (coefficient de corrélation = 0,645, P < 0,001). Il s'agissait de l'association la plus forte observée entre les domaines d'évaluation, ce qui indique que les réponses présentant une adéquation éducative plus élevée avaient également tendance à obtenir des évaluations plus élevées en matière de qualité globale de l'information.
DISPONIBILITÉ DES DONNÉES :
L'ensemble complet des données soutenant cette étude est fourni en tant que matériel supplémentaire. Supplementary File 1 contient la liste complète des questions normalisées, des invites et des 100 réponses générées par les modèles linguistiques de grande taille (LLM) archivées. Supplementary Table 2 contient les feuilles de notation PEMAT et GQS par des experts, y compris les évaluations PEMAT par item lorsque disponibles, les scores PEMAT totaux, les scores GQS, les informations de comparaison entre évaluateurs et les dossiers d'arbitrage le cas échéant. Les scores de lisibilité, les données brutes des figures et le code d'analyse R sont fournis en tant que Supplementary File 2. Étant donné que les sorties des LLM peuvent évoluer avec le temps en raison de mises à jour des modèles, de modifications d'interface ou de changements au niveau de la plateforme, les sorties archivées, plutôt que les réponses régénérées, doivent être utilisées pour la vérification et les analyses secondaires.

Figure 1 : Comparaison de la lisibilité, de l'adaptation à l'éducation des patients et de la qualité globale de l'information entre cinq grands modèles linguistiques. (A–G) Ce panneau présente les indices de lisibilité : indice de lisibilité automatisé (ARI), score de facilité de lecture de Flesch (FRES), indice de brouillard de Gunning (GFOG), niveau scolaire Flesch-Kincaid (FKGL), indice Coleman-Liau (CL), mesure simple de charabia (SMOG) et formule Linsear Write (LW). (H) Ce panneau montre les scores totaux du PEMAT, et le panneau (I) présente les scores de qualité globale (GQS). Dans chaque boîte à moustaches, la ligne centrale représente la médiane, la boîte indique l'intervalle interquartile (IQR), les moustaches s'étendent jusqu'à 1,5 × IQR, et les points au-delà des moustaches représentent des valeurs aberrantes. Abréviations : ARI = Automated Readability Index ; FRES = Flesch Reading Ease Score ; GFOG = Gunning Fog Index ; FKGL = Flesch Kincaid Grade Level ; CL = Coleman Liau Index ; SMOG = Simple Measure of Gobbledygook ; LW = Linsear Write ; PEMAT = outil d'évaluation des documents pédagogiques destinés aux patients pour l'intelligibilité et la possibilité d'action, format imprimable ; Global Quality Score = GQS. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 2 : Matrice de corrélation de Spearman entre les indices de lisibilité, l'adaptabilité à l'éducation du patient et la qualité globale de l'information dans l'ensemble des réponses générées par le modèle. La matrice indique les coefficients de corrélation de Spearman pour les associations par paires entre l'ARI, le FRES, le GFOG, le FKGL, le CL, le SMOG, le LW, le PEMAT et le GQS. Abréviations : ARI = indice de lisibilité automatisé ; FRES = score de facilité de lecture de Flesch ; GFOG = indice de brouillard de Gunning ; FKGL = niveau scolaire de Flesch-Kincaid ; CL = indice de Coleman-Liau ; SMOG = mesure simple du charabia ; LW = Linsear Write ; PEMAT = outil d'évaluation des supports pédagogiques pour patients ; GQS = score de qualité global. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Tableau 1 : Liste de 20 questions relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 2 : Outils, formules et descriptions relatifs à la lisibilité. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 3 : Critères de qualité du Global Quality Score (GQS). Veuillez cliquer ici pour télécharger ce fichier.
Tableau 4 : Résultats d'analyse de différents grands modèles linguistiques pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 5 : Résultats de l'analyse selon différentes dimensions pour les questions les plus fréquentes relatives à la névralgie du trijumeau. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 1 : Scores de lisibilité des réponses générées par les cinq grands modèles linguistiques à travers tous les indices de lisibilité évalués. Veuillez cliquer ici pour télécharger ce fichier.
Tableau supplémentaire 2 : Évaluations par des experts de l'adaptation à l'éducation des patients (PEMAT) et de la qualité globale de l'information (GQS) pour les réponses générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 1 : Questions normalisées sur la névralgie du trijumeau et réponses complètes générées par les cinq grands modèles linguistiques. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 2 : Scripts R et données sources utilisés pour les analyses statistiques et la création des figures. Veuillez cliquer ici pour télécharger ce fichier.