$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio evaluó sistemáticamente los efectos de los modelos de lenguaje grandes (LLMs) y de diferentes categorías de contenido educativo en salud sobre la legibilidad y calidad de los textos generados. En primer lugar, comparamos el desempeño de cinco LLMs—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5—en cuanto a la adecuación para la educación del paciente, la calidad general de la información y múltiples métricas de legibilidad, incluyendo la puntuación PEMAT, GQS e índices de legibilidad establecidos (ARI, FRES, GFOG, FKGL, CL, SMOG y LW). En segundo lugar, examinamos las mismas medidas de resultado en cinco dominios temáticos del contenido educativo en salud: conocimientos básicos sobre la enfermedad, etiología y factores de riesgo, diagnóstico, tratamiento, y prevención y rehabilitación. Al integrar estas dos perspectivas analíticas, exploramos además cómo el tipo de modelo y la categoría de contenido influyen conjuntamente en la calidad y legibilidad del texto, identificando así patrones sistemáticos en los materiales educativos para pacientes generados por LLMs.
Análisis de legibilidad en diferentes modelos grandes de lenguaje
Se utilizaron siete índices de legibilidad establecidos para comparar sistemáticamente la complejidad lingüística de los textos relacionados con la neuralgia del trigémino generados por cinco modelos lingüísticos grandes: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5. Los resultados generales se resumen en la Tabla 4, y las distribuciones de las métricas individuales de legibilidad se muestran en la Figura 1A–G. Se observaron diferencias estadísticamente significativas entre los cinco modelos para todos los índices de legibilidad, con P < 0,001 en cada caso.
GPT-5 exhibió los valores medianos más altos para ARI, GFOG, FKGL, CL y SMOG, y el FRES más bajo, lo que indica que generó textos con estructuras de oraciones más largas, vocabulario más complejo y la mayor carga de lectura en general (Figura 1A–G). En contraste, Wenxin Yiyan mostró la menor complejidad lingüística. Sus valores medianos de ARI, GFOG, FKGL, CL y SMOG fueron los más bajos entre los cinco modelos, mientras que su FRES fue el más alto.
Doubao, DeepSeek y Tongyi Qianwen mostraron niveles intermedios de legibilidad entre GPT-5 y Wenxin Yiyan. Doubao y DeepSeek presentaron un desempeño comparable en los índices por nivel educativo, incluyendo ARI, GFOG, FKGL y CL, y ambos obtuvieron valores significativamente más altos que Wenxin Yiyan, con todos los P < 0,05. Estos hallazgos indican una carga de lectura general similar para Doubao y DeepSeek, con una mayor complejidad lingüística que Wenxin Yiyan.
Tongyi Qianwen produjo generalmente valores intermedios entre los de Doubao/DeepSeek y GPT-5 en la mayoría de los índices de legibilidad. Nótese que su puntuación CL fue más cercana a la de GPT-5, lo que sugiere una complejidad lingüística ligeramente mayor que la de Doubao y DeepSeek, aunque manteniéndose menos complejo que GPT-5. El índice LW mostró un patrón de distribución distinto al de las demás métricas de legibilidad. Wenxin Yiyan obtuvo la puntuación LW más alta (60,00), seguida por Tongyi Qianwen, DeepSeek y Doubao, mientras que GPT-5 tuvo la puntuación LW más baja (46,50). Esta discrepancia refleja diferencias en la forma en que las fórmulas individuales de legibilidad ponderan la longitud de las oraciones y la dificultad de las palabras (Figura 1G).
En general, se observaron diferencias sustanciales en la complejidad lingüística entre los cinco grandes modelos de lenguaje. GPT-5 generó el texto más complejo lingüísticamente, Wenxin Yiyan produjo el contenido más legible y los modelos restantes mostraron niveles intermedios de legibilidad, aunque fueron evidentes diferencias estructurales.
Comparación de la idoneidad educativa para pacientes y la calidad general entre modelos de lenguaje amplios
Se observaron diferencias significativas en la adecuación para la educación del paciente, evaluada mediante el PEMAT, entre los cinco modelos de lenguaje (Figura 1H; Tabla 4), con todos los valores de P < 0,001. GPT-5 obtuvo la puntuación PEMAT más alta según la evaluación de expertos (9,40 ± 1,90), lo que indica una mayor idoneidad educativa dentro del marco actual de evaluación comparativa. Sin embargo, estos resultados no deben interpretarse como evidencia de que los materiales generados por GPT-5 mejoren la comprensión real del paciente, la satisfacción, la confianza, los comportamientos relacionados con la salud o los resultados clínicos.
DeepSeek obtuvo una puntuación PEMAT intermedia (6,80 ± 1,06), con una distribución de puntuaciones relativamente compacta, lo que sugiere un rendimiento consistente en la generación de materiales educativos para pacientes. Sin embargo, su idoneidad educativa general siguió siendo significativamente menor que la de GPT-5 (P < 0,001). Doubao, Tongyi Qianwen y Wenxin Yiyan obtuvieron puntuaciones PEMAT más bajas (5,35 ± 1,04, 5,65 ± 1,09 y 5,35 ± 0,93, respectivamente). No se observaron diferencias significativas entre estos tres modelos, y todos tuvieron un desempeño significativamente peor que DeepSeek y GPT-5 (todos P < 0,01). Estos hallazgos indican una idoneidad educativa comparable pero limitada entre estos modelos, particularmente en cuanto a claridad instruccional, organización lingüística y facilidad de comprensión.
Se observó un patrón similar en la calidad general de la información, según se evaluó mediante el GQS (Figura 1I). Se identificaron diferencias estadísticamente significativas entre los cinco modelos, con todos los valores de P < 0,001. GPT-5 obtuvo la puntuación GQS más alta (4,00 ± 0,65). Sus puntuaciones se concentraron dentro del rango de 4 a 5, con variabilidad limitada, lo que indica un rendimiento consistentemente alto en coherencia del contenido, completitud estructural y utilidad práctica.
Le siguieron DeepSeek y Doubao, con puntuaciones GQS de 3,35 ± 0,59 y 3,40 ± 0,50, respectivamente. Sus distribuciones de puntuación se centraron entre 3 y 4, lo que sugiere una calidad de información moderada y una fiabilidad razonable. En contraste, Tongyi Qianwen y Wenxin Yiyan obtuvieron las puntuaciones GQS más bajas (2,50 ± 0,51 y 2,20 ± 0,52, respectivamente). Sus distribuciones estuvieron sesgadas hacia el extremo inferior de la escala, lo que indica limitaciones en la precisión de la información, el rigor estructural y la profundidad del contenido, lo cual podría reducir su utilidad para la educación del paciente.
En general, GPT-5 obtuvo las puntuaciones más altas evaluadas por expertos en PEMAT y GQS en este conjunto de datos, mientras que DeepSeek y Doubao mostraron un rendimiento intermedio. Tongyi Qianwen y Wenxin Yiyan recibieron puntuaciones GQS más bajas. Estos hallazgos representan resultados de referencia evaluados por expertos y no deben interpretarse como evidencia de preparación clínica o eficacia a nivel de paciente.
Comparación de la legibilidad, adecuación para la educación del paciente y calidad general entre las categorías de contenido educativo en salud
El análisis por categoría de contenido reveló diferencias significativas en la legibilidad entre los cinco temas de educación sanitaria (Tabla 5). Para el FRES, se observaron diferencias estadísticamente significativas entre las categorías temáticas (P = 0.004). Valores más altos de FRES indican una mayor facilidad de lectura. Los textos sobre conocimientos básicos de enfermedades fueron los más legibles (mediana = 28,50), seguidos por el contenido diagnóstico (mediana = 16,00), el contenido sobre etiología y factores de riesgo (mediana = 12,50) y el contenido relacionado con el tratamiento (mediana = 11,50). En contraste, los textos sobre prevención y rehabilitación mostraron la menor legibilidad (mediana FRES = 1,00), lo que indica la mayor dificultad de lectura.
Se observaron patrones similares en los demás índices de legibilidad. GFOG y FKGL difirieron significativamente entre las categorías temáticas (P = 0,002 y P = 0,036, respectivamente), con ambos índices indicando niveles de grado de lectura más altos para el contenido sobre etiología y factores de riesgo, así como prevención y rehabilitación. El índice SMOG también sugirió que los textos sobre etiología y factores de riesgo contenían una mayor proporción de palabras polisilábicas (P = 0,039). Las diferencias más grandes se observaron para CL (P < 0,001). Los textos sobre prevención y rehabilitación tenían las oraciones más largas (mediana = 21,01), lo que aumentaba considerablemente la dificultad de lectura, mientras que los textos sobre conocimientos básicos de la enfermedad tenían las oraciones más cortas (mediana = 14,88), lo que correspondía a la carga de lectura más baja. No se observaron diferencias significativas entre las categorías de contenido para ARI o LW.
No se identificaron diferencias estadísticamente significativas en la adecuación educativa para pacientes entre las cinco categorías de contenido según las puntuaciones PEMAT (P = 0.252). Las puntuaciones medias PEMAT oscilaron entre 5,90 y 7,20, lo que indica que, a pesar de las diferencias notables en complejidad lingüística, la adecuación educativa se mantuvo relativamente constante entre los temas. De manera similar, la calidad general de la información, evaluada mediante la GQS, no difirió significativamente entre las categorías de contenido (P = 0.822). Los valores medios de GQS oscilaron entre 2,95 y 3,25, lo que indica que la calidad general de la información fue relativamente estable a través de los temas de contenido.
En general, se observaron diferencias sustanciales en la legibilidad entre los temas de educación sanitaria, siendo los contenidos sobre etiología y factores de riesgo y los contenidos sobre prevención y rehabilitación los de mayor dificultad lectora, mientras que los contenidos sobre conocimientos básicos de la enfermedad fueron los más fáciles de leer. En contraste, la adecuación de la educación al paciente y la calidad general de la información se mantuvieron relativamente consistentes entre las categorías de contenido.
Análisis de correlación entre legibilidad, adecuación para la educación del paciente y calidad general
La matriz de correlación de la Figura 2 muestra asociaciones consistentes y robustas entre los índices de legibilidad, lo que indica una fuerte consistencia interna. La mayoría de los índices de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, presentaron correlaciones positivas moderadas a fuertes entre sí, con coeficientes de correlación que oscilaron entre 0,64 y 0,97 (todos P < 0,001). Estos hallazgos respaldan aún más la naturaleza complementaria de estos índices para evaluar la complejidad lingüística. En contraste, FRES mostró correlaciones negativas significativas con varios índices de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación absolutos superiores a 0,70 (todos P < 0,001). Este patrón refleja la dirección inversa de la puntuación de FRES, en la que puntuaciones más altas indican una mayor legibilidad. El índice LW también mostró correlaciones negativas significativas con otros índices de legibilidad, incluyendo ARI, FKGL, GFOG y SMOG, con coeficientes de correlación absolutos que variaron entre 0,75 y 0,90 (todos P < 0,001). Por el contrario, LW se correlacionó positivamente con FRES (coeficiente de correlación = 0,69, P < 0,001).
También se observaron asociaciones claras entre los índices de legibilidad y la calidad general de la información, medida mediante el GQS. El GQS mostró correlaciones positivas débiles a moderadas con la mayoría de las métricas de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación que oscilaron entre 0,326 y 0,391 (todos P < 0,001). Estos hallazgos sugieren que una mayor complejidad lingüística estuvo asociada con una calidad de información más alta según la evaluación de expertos. Por el contrario, el GQS presentó una correlación negativa moderada con FRES (coeficiente de correlación = −0,408, P < 0,001), lo que indica que los textos que requieren un nivel de lectura más alto generalmente obtuvieron calificaciones más altas en el GQS. El GQS también mostró una correlación negativa moderada con LW (coeficiente de correlación = −0,421, P < 0,001).
Las asociaciones entre legibilidad y adecuación educativa para pacientes, evaluadas mediante el PEMAT, fueron generalmente más débiles pero consistentes en dirección. Las puntuaciones del PEMAT mostraron correlaciones positivas débiles con el ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación que oscilaron entre 0,305 y 0,434 (todos P < 0,01). En contraste, las puntuaciones del PEMAT se correlacionaron negativamente y de forma débil con el FRES y el LW, con coeficientes de correlación absolutos de 0,432 y 0,320, respectivamente (ambos P < 0,01). Estos hallazgos sugieren que, dentro de este conjunto de datos, una mayor complejidad lingüística estuvo asociada con una adecuación educativa ligeramente mayor según la evaluación de expertos, aunque la fuerza de estas asociaciones fue limitada.
Es importante destacar que se observó una correlación positiva moderada entre las puntuaciones del PEMAT y del GQS (coeficiente de correlación = 0,645, P < 0,001). Esta fue la asociación más fuerte observada entre los dominios de evaluación, lo que indica que las respuestas con mayor adecuación educativa también tendían a recibir calificaciones más altas en cuanto a la calidad general de la información.
DISPONIBILIDAD DE LOS DATOS:
El conjunto completo de datos que respalda este estudio se proporciona como material suplementario. Archivo Suplementario 1 contiene la lista completa de preguntas y estímulos estandarizados, así como las 100 respuestas generadas por modelos de lenguaje grandes (LLM) archivadas. Tabla Suplementaria 2 contiene las hojas de calificación PEMAT y GQS realizadas por expertos, incluyendo las puntuaciones PEMAT por ítem cuando estuvieron disponibles, las puntuaciones totales PEMAT, las puntuaciones GQS, la información de comparación entre evaluadores y los registros de adjudicación cuando correspondió. Las puntuaciones de legibilidad, los datos fuente de las figuras y el código de análisis en R se proporcionan como Archivo Suplementario 2. Dado que las salidas de los LLM pueden cambiar con el tiempo debido a actualizaciones del modelo, cambios en la interfaz y modificaciones a nivel de plataforma, deben utilizarse las salidas archivadas, y no las respuestas regeneradas, para la verificación y el análisis secundario.

Figura 1: Comparación de la legibilidad, la adecuación para la educación del paciente y la calidad general de la información entre cinco modelos grandes de lenguaje. (A–G) Este panel muestra los índices de legibilidad: Índice de Legibilidad Automatizado (ARI), Puntuación de Facilidad de Lectura de Flesch (FRES), Índice de Niebla de Gunning (GFOG), Nivel de Grado Flesch-Kincaid (FKGL), Índice Coleman-Liau (CL), Medida Simple de Galimatías (SMOG) y Fórmula Linsear Write (LW). (H) Este panel muestra las puntuaciones totales del PEMAT, y el panel (I) muestra las Puntuaciones de Calidad Global (GQS). En cada gráfico de caja, la línea central representa la mediana, el cuadro indica el rango intercuartílico (RIC), los bigotes se extienden hasta 1,5 × RIC, y los puntos más allá de los bigotes representan valores atípicos. Abreviaturas: ARI = Índice de Legibilidad Automatizado; FRES = Puntuación de Facilidad de Lectura de Flesch; GFOG = Índice de Niebla de Gunning; FKGL = Nivel de Grado Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simple de Galimatías; LW = Linsear Write; PEMAT = la Herramienta de Evaluación de Materiales Educativos para Pacientes en cuanto a Comprensibilidad y Aplicabilidad, formato imprimible; Puntuación de Calidad Global = GQS. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Matriz de correlación de Spearman entre los índices de legibilidad, la adecuación para la educación del paciente y la calidad general de la información en todas las respuestas generadas por el modelo. La matriz muestra los coeficientes de correlación de Spearman para las asociaciones por pares entre ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT y GQS. Abreviaturas: ARI = Índice de Legibilidad Automatizado; FRES = Puntuación de Facilidad de Lectura de Flesch; GFOG = Índice de Niebla de Gunning; FKGL = Nivel Escolar de Flesch-Kincaid; CL = Índice de Coleman-Liau; SMOG = Medida Simple de Galimatías; LW = Linsear Write; PEMAT = Herramienta de Evaluación de Materiales Educativos para Pacientes; GQS = Puntuación Global de Calidad. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Lista de 20 preguntas relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.
Tabla 2: Herramientas, fórmulas y descripciones de legibilidad. Haga clic aquí para descargar este archivo.
Tabla 3: Criterios de calidad de la puntuación global de calidad (GQS). Haga clic aquí para descargar este archivo.
Tabla 4: Resultados del análisis de diferentes modelos de lenguaje grandes para las preguntas más comunes relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.
Tabla 5: Resultados del análisis en diferentes dimensiones para las preguntas más comunes relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.
Tabla suplementaria 1: Puntuaciones de legibilidad de las respuestas generadas por los cinco modelos grandes de lenguaje en todos los índices de legibilidad evaluados. Haga clic aquí para descargar este archivo.
Tabla suplementaria 2: Calificaciones de expertos sobre la adecuación de la educación al paciente (PEMAT) y la calidad general de la información (GQS) para las respuestas generadas por los cinco modelos lingüísticos grandes. Haga clic aquí para descargar este archivo.
Archivo suplementario 1: Preguntas estandarizadas sobre neuralgia del trigémino y respuestas completas generadas por los cinco modelos grandes de lenguaje. Haga clic aquí para descargar este archivo.
Archivo suplementario 2: Secuencias de comandos R y datos fuente utilizados para los análisis estadísticos y la generación de figuras. Haga clic aquí para descargar este archivo.