Artículo de investigación

Legibilidad y calidad de la educación al paciente generada por modelos de lenguaje extensos para la neuralgia del trigémino: un estudio transversal

DOI:

10.3791/70833

21 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí presentamos un protocolo para evaluar sistemáticamente la legibilidad, adecuación educativa y calidad de la información para pacientes sobre la neuralgia del trigémino generada por modelos de lenguaje de gran tamaño, con el fin de establecer puntos de referencia para los modelos y orientar la comunicación dirigida a los pacientes.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los modelos de lenguaje grandes (LLM) se utilizan cada vez más para la educación sanitaria de los pacientes, aunque la legibilidad y la calidad educativa de la información generada por LLM sobre la neuralgia del trigémino (TN) no han sido evaluadas suficientemente. Este estudio transversal de referencia comparó contenidos educativos sobre TN generados por cinco LLM disponibles públicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5). Se presentaron a cada modelo veinte preguntas frecuentes sobre TN, que abarcaban conocimientos básicos de la enfermedad, etiología/factores de riesgo, diagnóstico, tratamiento y prevención/rehabilitación, utilizando instrucciones estandarizadas. La legibilidad se evaluó mediante siete índices establecidos, la idoneidad educativa mediante la Herramienta de Evaluación de Materiales Educativos para Pacientes para Comprendibilidad y Accionabilidad (PEMAT) y la calidad general de la información mediante la Puntuación Global de Calidad (GQS). Dos expertos clínicos evaluaron de forma independiente todas las respuestas, resolviendo las discrepancias mediante un árbitro principal. Los análisis estadísticos compararon el rendimiento de los modelos, las diferencias temáticas y las correlaciones entre las métricas de evaluación. Se observaron diferencias significativas entre los modelos en las puntuaciones de legibilidad, PEMAT y GQS. GPT-5 generó las respuestas más complejas lingüísticamente, pero obtuvo las calificaciones más altas en idoneidad educativa y calidad de la información. En contraste, Wenxin Yiyan produjo el texto más legible, pero generalmente obtuvo puntuaciones más bajas en PEMAT y GQS. La categoría del contenido influyó en la legibilidad, siendo los temas de prevención/rehabilitación y etiología/factores de riesgo más difíciles de leer, mientras que PEMAT y GQS se mantuvieron relativamente constantes entre los temas. Los índices de legibilidad mostraron una fuerte consistencia interna y correlaciones positivas débiles a moderadas con PEMAT y GQS, mientras que PEMAT y GQS mostraron una correlación positiva moderada. Estos hallazgos sugieren que la selección del modelo influye en la idoneidad educativa y en la calidad general de la información valoradas por expertos, mientras que la complejidad del tema afecta principalmente a la legibilidad. Dado que no se evaluaron la comprensión del paciente, la satisfacción, la confianza, los resultados sanitarios, la precisión factual ni la seguridad clínica, estos resultados deben interpretarse como un análisis de referencia valorado por expertos, y no como evidencia de preparación clínica.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La neuralgia del trigémino (NT) es un síndrome de dolor neuropático caracterizado por episodios recurrentes de dolor facial unilateral, breve e intensamente severo, comúnmente descrito como una descarga eléctrica o punzante. Según la Clasificación Internacional de Trastornos de Cefalea, tercera edición (ICHD-3), el dolor se localiza típicamente en la distribución de una o más ramas del nervio trigémino, suele ser insoportable en intensidad y puede desencadenarse por estímulos inócuos como el tacto ligero, el lavado facial, el cepillado dental, hablar o masticar. Los ataques se caracterizan por un inicio súbito y una cesación abrupta, con duraciones que van desde fracciones de segundo hasta varios minutos1,2. Aunque la NT generalmente no es mortal, su dolor intenso e impredecible interrumpe sustancialmente las actividades diarias esenciales, incluyendo la alimentación, el habla, el sueño y la regulación emocional, lo que provoca una carga psicosocial considerable y una calidad de vida deteriorada. Evidencia proveniente de revisiones sistemáticas indica que las personas con NT enfrentan un riesgo significativamente elevado de depresión, ansiedad y trastornos del sueño en comparación con la población general3,4. En estudios de cohortes grandes, aproximadamente entre el 35 % y el 55 % de los pacientes con NT presentan síntomas clínicamente significativos de ansiedad o depresión, y la catastrofización del dolor es altamente prevalente, lo que sugiere una interacción bidireccional entre el dolor crónico severo, el insomnio y los trastornos afectivos5,6. Las estimaciones epidemiológicas indican que la prevalencia de la NT en la población general oscila entre aproximadamente el 0,03 % y el 0,3 %, con una mayor frecuencia entre mujeres y adultos mayores, y variaciones notables entre regiones geográficas, grupos étnicos y estratos de edad7,8. En países altamente poblados, como China e India, el envejecimiento acelerado de la población ha ido acompañado de un aumento sostenido en el número de personas afectadas por NT, lo que impone una carga creciente sobre los sistemas de salud y subraya la necesidad de enfoques más eficaces, escalables y basados en datos para la evaluación y el manejo de la enfermedad8,9.

El TN puede clasificarse en subtipos clásico, secundario e idiopático, con una evidencia creciente que demuestra diferencias sustanciales en los mecanismos etiológicos y las estrategias terapéuticas entre estas categorías1,10. Estudios actuales sugieren que los cambios estructurales relacionados con el conflicto neurovascular en la zona de entrada de la raíz del nervio trigémino, la hiperexcitabilidad del nervio periférico y la modulación alterada del dolor central contribuyen conjuntamente a la patogénesis de la enfermedad11,12. Las guías clínicas recomiendan la carbamazepina y la oxcarbazepina como tratamientos de primera línea, mientras que se consideran enfoques quirúrgicos o intervencionistas cuando la terapia farmacológica resulta ineficaz o mal tolerada10. A pesar de estos avances terapéuticos, el TN se caracteriza por un curso recidivante-remisivo, y la recurrencia prolongada del dolor sigue siendo común, lo que dificulta lograr una remisión permanente13. En consecuencia, el seguimiento a largo plazo y la gestión estructurada de la enfermedad crónica son esenciales para monitorear el riesgo de recurrencia, la respuesta al tratamiento y las complicaciones. Estudios longitudinales de cohorte indican que, bajo estrategias de manejo estandarizadas (incluyendo tratamiento farmacológico, intervención quirúrgica cuando está indicada y seguimiento integral), aproximadamente la mitad de los pacientes que reciben manejo conservador pueden lograr una reducción ≥50 % en la carga total del dolor dentro de los dos años, sin progresión inevitable de la enfermedad14. Estos hallazgos subrayan la importancia de mantener el compromiso del paciente y una educación sanitaria eficaz para la gestión prolongada de la enfermedad. La evidencia sugiere que los pacientes con una mejor comprensión de la etiología, la fisiopatología y las opciones de tratamiento de la enfermedad tienen más probabilidades de participar activamente y adherirse a los regímenes terapéuticos, lo que conduce a mejores resultados15. Sin embargo, los enfoques tradicionales de educación sanitaria suelen tener alcance y escalabilidad limitados. Con la amplia adopción de internet, especialmente plataformas en línea de preguntas y respuestas y redes sociales, los pacientes dependen cada vez más de fuentes digitales para obtener información médica16,17. No obstante, la variabilidad considerable en la alfabetización en salud individual y en la capacidad de acceder, procesar y comprender información básica sobre salud para tomar decisiones informadas representa una barrera importante para una educación eficaz del paciente18. Además, la calidad desigual de la información sanitaria en línea, incluyendo contenidos inexactos o engañosos, puede influir negativamente en las decisiones médicas y el bienestar psicológico de los pacientes19.

Las tecnologías de inteligencia artificial (IA), particularmente el rápido desarrollo de modelos de lenguaje de gran tamaño (LLMs) en los últimos años, han creado nuevas oportunidades para la comunicación científica médica y la educación en salud20. Entrenados con corpus textuales a gran escala, estos modelos pueden generar respuestas estructuradas y lógicamente coherentes mediante interacciones en lenguaje natural21. Sistemas internacionales representativos, como ChatGPT, han demostrado un potencial prometedor en la respuesta a preguntas médicas, la consulta con pacientes y la educación médica22,23. Varios LLMs funcionalmente similares han surgido en China, con una cobertura de usuarios y escenarios de aplicación en continua expansión24. A pesar de estos avances, la aplicación de los LLMs en la divulgación científica médica aún enfrenta desafíos importantes, incluyendo la fiabilidad de los datos de entrenamiento, la frecuencia de actualización, la precisión científica de las respuestas generadas y la falta de validación clínica25. Además, las diferencias entre modelos en estilo lingüístico, legibilidad, estructura lógica y precisión en las citas pueden influir directamente en la comprensión y la confianza de los pacientes en la información relacionada con la salud26. Hasta la fecha, las evaluaciones sistemáticas del rendimiento de los LLMs en la educación sanitaria relacionada con TN han sido limitadas.

Por lo tanto, este estudio tuvo como objetivo evaluar y comparar sistemáticamente el desempeño de cuatro modelos lingüísticos grandes (LLM) chinos ampliamente utilizados (Doubao, DeepSeek, Wenxin Yiyan y Tongyi Qianwen) y un LLM internacional representativo (ChatGPT) al responder preguntas de educación para pacientes relacionadas con la neuralgia del trigémino (TN). Mediante un diseño transversal, construimos un conjunto de preguntas sobre TN basado en guías clínicas y preocupaciones comunes de los pacientes, y evaluamos las respuestas generadas por cinco LLM disponibles públicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5). La legibilidad se evaluó mediante múltiples métricas, y la comprensibilidad y la capacidad de acción se analizaron utilizando la Herramienta de Evaluación de Materiales de Educación para Pacientes (PEMAT). La calidad general de la información se evaluó mediante la Puntuación Global de Calidad (GQS). Además, analizamos cómo diferentes temas de educación sanitaria influyen en estas métricas de evaluación y en sus interrelaciones, con el fin de proporcionar orientación basada en evidencia para la selección y optimización de los LLM en la comunicación clínica sobre salud.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio analizó únicamente texto generado por inteligencia artificial y no involucró a participantes humanos, animales, especímenes biológicos, historiales médicos, información personal identificable ni intervenciones en la atención clínica. Por lo tanto, no fue necesaria la revisión ética ni el consentimiento informado formal.

Diseño del estudio

Este estudio transversal evaluó la legibilidad, calidad y adecuación educativa de las respuestas generadas por cinco LLM en respuesta a preguntas frecuentes sobre la TN.

Identificación de preguntas frecuentes relacionadas con la neuralgia del trigémino

El 25 de noviembre de 2025, dos expertos clínicos con amplia experiencia en medicina del dolor revisaron de forma independiente las actuales guías clínicas para la neuralgia del trigémino (NT), incluyendo la Clasificación Internacional de Trastornos de Cefalea, tercera edición (ICHD-3), la guía de la Academia Europea de Neurología y la guía de la Academia Americana de Neurología/Federación Europea de Sociedades Neurológicas1,10,11. Tras una discusión de consenso, elaboraron una lista de 20 preguntas relacionadas con la NT comúnmente encontradas en la práctica clínica. El número de preguntas se determinó a priori para proporcionar una cobertura equilibrada de los cinco dominios temáticos predefinidos, seleccionando cuatro preguntas para cada dominio, manteniendo al mismo tiempo el número total de respuestas generadas por el modelo dentro de un rango factible para la evaluación y verificación manual por expertos. Para mejorar la reproducibilidad, el proceso de selección siguió un marco predefinido basado en dominios: los expertos primero identificaron preguntas candidatas dentro de cada dominio, las revisaron de forma independiente en cuanto a relevancia clínica, redacción orientada al paciente y evitación de redundancias, y luego alcanzaron un consenso sobre las cuatro preguntas finales por dominio. La lista final de preguntas se proporciona en Tabla 1 y Archivo Suplementario 1. Los cinco dominios temáticos predefinidos fueron conocimientos básicos sobre la enfermedad, etiología y factores de riesgo, diagnóstico, tratamiento, y prevención y rehabilitación. Dado que el conjunto de preguntas no se derivó de registros de búsquedas de pacientes, consultas en línea ni entrevistas formales con pacientes, se reconoce como una limitación del estudio el potencial de sesgo de selección.

Modelos de IA y procedimiento de recopilación de datos

El 25 de noviembre de 2025, se envió el conjunto final de 20 preguntas relacionadas con TN a cinco plataformas públicamente accesibles de modelos de lenguaje grandes (LLM, por sus siglas en inglés): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5/ChatGPT. Se accedió a todos los modelos a través de sus interfaces de chat web públicas estándar; no se utilizó acceso mediante interfaz de programación de aplicaciones (API). Para cada plataforma, se empleó el modelo disponible públicamente por defecto en la fecha de recopilación de datos, sin modificar ningún parámetro de generación. Dado que las interfaces web públicas no mostraban identificadores de versión del modelo del backend, indicaciones del sistema ocultas, temperatura, top-p, número máximo de tokens de salida u otros parámetros de generación, estos elementos se registraron como «no mostrados en la interfaz web pública».

Los idiomas de los prompts y las respuestas fueron inglés para todos los modelos. Cada prompt estandarizado consistió únicamente en la pregunta en inglés textual, sin instrucciones adicionales específicas para el modelo. Cada pregunta se envió individualmente en una nueva sesión de chat independiente, sin historial previo de conversación, archivos cargados, complementos, instrucciones personalizadas ni preguntas de seguimiento. La lista completa de prompts estandarizados y las salidas brutas correspondientes de los modelos se proporciona en Supplementary File 1. Los metadatos de los modelos y la configuración de recopilación de datos se resumen en Supplementary Table 1.

Evaluación de legibilidad

La legibilidad de las respuestas generadas por modelos de lenguaje de gran tamaño (LLM) se evaluó utilizando varias fórmulas de legibilidad establecidas disponibles a través de una plataforma en línea de evaluación de legibilidad (http://readabilityformulas.com/). Dado que no existe un estándar universalmente aceptado como referencia para la evaluación de la legibilidad y en concordancia con estudios previos, se empleó un conjunto integral de índices de legibilidad ampliamente utilizados23,27. Se seleccionaron siete índices para captar aspectos complementarios de la legibilidad, incluyendo la longitud de la oración, la longitud de la palabra, la carga silábica, la complejidad basada en caracteres, la facilidad de lectura y el nivel escolar estimado, reduciendo así la dependencia de una única fórmula. Específicamente, se calcularon el Índice de Coleman-Liau (CL), la Fórmula Linsear Write (LW), el Índice Automatizado de Legibilidad (ARI), la Medida Simple de Gobbledygook (SMOG), el Índice Gunning Fog (GFOG), la Puntuación de Facilidad de Lectura de Flesch (FRES) y el Nivel Escolar de Flesch-Kincaid (FKGL). Estos índices estiman la dificultad de lectura o el nivel escolar y proporcionan medidas cuantitativas de la legibilidad del texto (Tabla 2).

Evaluación de la idoneidad educativa y la calidad de la información

La adecuación educativa se evaluó utilizando la Herramienta de Evaluación de Materiales Educativos para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que comprende dos dominios: comprensibilidad y capacidad de acción28. El instrumento incluye 24 ítems, de los cuales 16 evalúan la comprensibilidad y ocho evalúan la capacidad de acción. Cada ítem se puntuó de forma dicotómica (0 = criterio no cumplido; 1 = criterio cumplido), obteniéndose una puntuación total que oscila entre 0 y 24, siendo las puntuaciones más altas indicativas de una mayor adecuación para la educación del paciente. La calidad general de la información se evaluó mediante la Puntuación Global de Calidad (Global Quality Score, GQS)27, una escala tipo Likert de cinco puntos ampliamente utilizada para evaluar la calidad de la información médica (Tabla 3).

El 25 de noviembre de 2025, dos expertos clínicos con más de 3 años de experiencia en el manejo de la neuralgia del trigémino evaluaron todas las respuestas generadas por inteligencia artificial utilizando ambos instrumentos de evaluación. Antes de la calificación, todas las respuestas generadas por inteligencia artificial se anonimizaron con identificadores codificados, y los revisores permanecieron ciegos respecto a la plataforma de modelos de lenguaje de gran tamaño durante las evaluaciones del PEMAT y del GQS. Las discrepancias se resolvieron mediante un tercer experto senior, quien determinó las puntuaciones finales. La fiabilidad entre evaluadores se evaluó mediante el coeficiente kappa de Cohen, en el que valores >0,75 indican un acuerdo excelente, de 0,40 a 0,75 un acuerdo aceptable y <0,40 un acuerdo deficiente. Los valores kappa de Cohen tanto para el PEMAT como para el GQS superaron 0,75, lo que demuestra una excelente fiabilidad entre evaluadores.

Análisis estadístico

Todos los análisis estadísticos se realizaron utilizando el software R (versión 4.4.3). La normalidad de los datos se evaluó mediante la prueba de Shapiro-Wilk y gráficos Q-Q. Las variables con distribución normal se resumieron como media ± desviación estándar y se compararon mediante análisis de varianza de un factor (ANOVA), seguido de la prueba post hoc de Tukey cuando correspondía. Las variables sin distribución normal se resumieron como medianas y rangos intercuartílicos y se compararon mediante la prueba de Kruskal-Wallis, seguida de la prueba post hoc de Dunn con corrección de Bonferroni para comparaciones por pares. Las correlaciones entre los índices de legibilidad, las puntuaciones PEMAT y los valores GQS se evaluaron utilizando el coeficiente de correlación de rangos de Spearman, aplicando la corrección de Benjamini-Hochberg para pruebas múltiples. Se consideró estadísticamente significativo un valor P ajustado bilateral < 0,05.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio evaluó sistemáticamente los efectos de los modelos de lenguaje grandes (LLMs) y de diferentes categorías de contenido educativo en salud sobre la legibilidad y calidad de los textos generados. En primer lugar, comparamos el desempeño de cinco LLMs—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5—en cuanto a la adecuación para la educación del paciente, la calidad general de la información y múltiples métricas de legibilidad, incluyendo la puntuación PEMAT, GQS e índices de legibilidad establecidos (ARI, FRES, GFOG, FKGL, CL, SMOG y LW). En segundo lugar, examinamos las mismas medidas de resultado en cinco dominios temáticos del contenido educativo en salud: conocimientos básicos sobre la enfermedad, etiología y factores de riesgo, diagnóstico, tratamiento, y prevención y rehabilitación. Al integrar estas dos perspectivas analíticas, exploramos además cómo el tipo de modelo y la categoría de contenido influyen conjuntamente en la calidad y legibilidad del texto, identificando así patrones sistemáticos en los materiales educativos para pacientes generados por LLMs.

Análisis de legibilidad en diferentes modelos grandes de lenguaje

Se utilizaron siete índices de legibilidad establecidos para comparar sistemáticamente la complejidad lingüística de los textos relacionados con la neuralgia del trigémino generados por cinco modelos lingüísticos grandes: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen y GPT-5. Los resultados generales se resumen en la Tabla 4, y las distribuciones de las métricas individuales de legibilidad se muestran en la Figura 1A–G. Se observaron diferencias estadísticamente significativas entre los cinco modelos para todos los índices de legibilidad, con P < 0,001 en cada caso.

GPT-5 exhibió los valores medianos más altos para ARI, GFOG, FKGL, CL y SMOG, y el FRES más bajo, lo que indica que generó textos con estructuras de oraciones más largas, vocabulario más complejo y la mayor carga de lectura en general (Figura 1A–G). En contraste, Wenxin Yiyan mostró la menor complejidad lingüística. Sus valores medianos de ARI, GFOG, FKGL, CL y SMOG fueron los más bajos entre los cinco modelos, mientras que su FRES fue el más alto.

Doubao, DeepSeek y Tongyi Qianwen mostraron niveles intermedios de legibilidad entre GPT-5 y Wenxin Yiyan. Doubao y DeepSeek presentaron un desempeño comparable en los índices por nivel educativo, incluyendo ARI, GFOG, FKGL y CL, y ambos obtuvieron valores significativamente más altos que Wenxin Yiyan, con todos los P < 0,05. Estos hallazgos indican una carga de lectura general similar para Doubao y DeepSeek, con una mayor complejidad lingüística que Wenxin Yiyan.

Tongyi Qianwen produjo generalmente valores intermedios entre los de Doubao/DeepSeek y GPT-5 en la mayoría de los índices de legibilidad. Nótese que su puntuación CL fue más cercana a la de GPT-5, lo que sugiere una complejidad lingüística ligeramente mayor que la de Doubao y DeepSeek, aunque manteniéndose menos complejo que GPT-5. El índice LW mostró un patrón de distribución distinto al de las demás métricas de legibilidad. Wenxin Yiyan obtuvo la puntuación LW más alta (60,00), seguida por Tongyi Qianwen, DeepSeek y Doubao, mientras que GPT-5 tuvo la puntuación LW más baja (46,50). Esta discrepancia refleja diferencias en la forma en que las fórmulas individuales de legibilidad ponderan la longitud de las oraciones y la dificultad de las palabras (Figura 1G).

En general, se observaron diferencias sustanciales en la complejidad lingüística entre los cinco grandes modelos de lenguaje. GPT-5 generó el texto más complejo lingüísticamente, Wenxin Yiyan produjo el contenido más legible y los modelos restantes mostraron niveles intermedios de legibilidad, aunque fueron evidentes diferencias estructurales.

Comparación de la idoneidad educativa para pacientes y la calidad general entre modelos de lenguaje amplios

Se observaron diferencias significativas en la adecuación para la educación del paciente, evaluada mediante el PEMAT, entre los cinco modelos de lenguaje (Figura 1H; Tabla 4), con todos los valores de P < 0,001. GPT-5 obtuvo la puntuación PEMAT más alta según la evaluación de expertos (9,40 ± 1,90), lo que indica una mayor idoneidad educativa dentro del marco actual de evaluación comparativa. Sin embargo, estos resultados no deben interpretarse como evidencia de que los materiales generados por GPT-5 mejoren la comprensión real del paciente, la satisfacción, la confianza, los comportamientos relacionados con la salud o los resultados clínicos.

DeepSeek obtuvo una puntuación PEMAT intermedia (6,80 ± 1,06), con una distribución de puntuaciones relativamente compacta, lo que sugiere un rendimiento consistente en la generación de materiales educativos para pacientes. Sin embargo, su idoneidad educativa general siguió siendo significativamente menor que la de GPT-5 (P < 0,001). Doubao, Tongyi Qianwen y Wenxin Yiyan obtuvieron puntuaciones PEMAT más bajas (5,35 ± 1,04, 5,65 ± 1,09 y 5,35 ± 0,93, respectivamente). No se observaron diferencias significativas entre estos tres modelos, y todos tuvieron un desempeño significativamente peor que DeepSeek y GPT-5 (todos P < 0,01). Estos hallazgos indican una idoneidad educativa comparable pero limitada entre estos modelos, particularmente en cuanto a claridad instruccional, organización lingüística y facilidad de comprensión.

Se observó un patrón similar en la calidad general de la información, según se evaluó mediante el GQS (Figura 1I). Se identificaron diferencias estadísticamente significativas entre los cinco modelos, con todos los valores de P < 0,001. GPT-5 obtuvo la puntuación GQS más alta (4,00 ± 0,65). Sus puntuaciones se concentraron dentro del rango de 4 a 5, con variabilidad limitada, lo que indica un rendimiento consistentemente alto en coherencia del contenido, completitud estructural y utilidad práctica.

Le siguieron DeepSeek y Doubao, con puntuaciones GQS de 3,35 ± 0,59 y 3,40 ± 0,50, respectivamente. Sus distribuciones de puntuación se centraron entre 3 y 4, lo que sugiere una calidad de información moderada y una fiabilidad razonable. En contraste, Tongyi Qianwen y Wenxin Yiyan obtuvieron las puntuaciones GQS más bajas (2,50 ± 0,51 y 2,20 ± 0,52, respectivamente). Sus distribuciones estuvieron sesgadas hacia el extremo inferior de la escala, lo que indica limitaciones en la precisión de la información, el rigor estructural y la profundidad del contenido, lo cual podría reducir su utilidad para la educación del paciente.

En general, GPT-5 obtuvo las puntuaciones más altas evaluadas por expertos en PEMAT y GQS en este conjunto de datos, mientras que DeepSeek y Doubao mostraron un rendimiento intermedio. Tongyi Qianwen y Wenxin Yiyan recibieron puntuaciones GQS más bajas. Estos hallazgos representan resultados de referencia evaluados por expertos y no deben interpretarse como evidencia de preparación clínica o eficacia a nivel de paciente.

Comparación de la legibilidad, adecuación para la educación del paciente y calidad general entre las categorías de contenido educativo en salud

El análisis por categoría de contenido reveló diferencias significativas en la legibilidad entre los cinco temas de educación sanitaria (Tabla 5). Para el FRES, se observaron diferencias estadísticamente significativas entre las categorías temáticas (P = 0.004). Valores más altos de FRES indican una mayor facilidad de lectura. Los textos sobre conocimientos básicos de enfermedades fueron los más legibles (mediana = 28,50), seguidos por el contenido diagnóstico (mediana = 16,00), el contenido sobre etiología y factores de riesgo (mediana = 12,50) y el contenido relacionado con el tratamiento (mediana = 11,50). En contraste, los textos sobre prevención y rehabilitación mostraron la menor legibilidad (mediana FRES = 1,00), lo que indica la mayor dificultad de lectura.

Se observaron patrones similares en los demás índices de legibilidad. GFOG y FKGL difirieron significativamente entre las categorías temáticas (P = 0,002 y P = 0,036, respectivamente), con ambos índices indicando niveles de grado de lectura más altos para el contenido sobre etiología y factores de riesgo, así como prevención y rehabilitación. El índice SMOG también sugirió que los textos sobre etiología y factores de riesgo contenían una mayor proporción de palabras polisilábicas (P = 0,039). Las diferencias más grandes se observaron para CL (P < 0,001). Los textos sobre prevención y rehabilitación tenían las oraciones más largas (mediana = 21,01), lo que aumentaba considerablemente la dificultad de lectura, mientras que los textos sobre conocimientos básicos de la enfermedad tenían las oraciones más cortas (mediana = 14,88), lo que correspondía a la carga de lectura más baja. No se observaron diferencias significativas entre las categorías de contenido para ARI o LW.

No se identificaron diferencias estadísticamente significativas en la adecuación educativa para pacientes entre las cinco categorías de contenido según las puntuaciones PEMAT (P = 0.252). Las puntuaciones medias PEMAT oscilaron entre 5,90 y 7,20, lo que indica que, a pesar de las diferencias notables en complejidad lingüística, la adecuación educativa se mantuvo relativamente constante entre los temas. De manera similar, la calidad general de la información, evaluada mediante la GQS, no difirió significativamente entre las categorías de contenido (P = 0.822). Los valores medios de GQS oscilaron entre 2,95 y 3,25, lo que indica que la calidad general de la información fue relativamente estable a través de los temas de contenido.

En general, se observaron diferencias sustanciales en la legibilidad entre los temas de educación sanitaria, siendo los contenidos sobre etiología y factores de riesgo y los contenidos sobre prevención y rehabilitación los de mayor dificultad lectora, mientras que los contenidos sobre conocimientos básicos de la enfermedad fueron los más fáciles de leer. En contraste, la adecuación de la educación al paciente y la calidad general de la información se mantuvieron relativamente consistentes entre las categorías de contenido.

Análisis de correlación entre legibilidad, adecuación para la educación del paciente y calidad general

La matriz de correlación de la Figura 2 muestra asociaciones consistentes y robustas entre los índices de legibilidad, lo que indica una fuerte consistencia interna. La mayoría de los índices de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, presentaron correlaciones positivas moderadas a fuertes entre sí, con coeficientes de correlación que oscilaron entre 0,64 y 0,97 (todos P < 0,001). Estos hallazgos respaldan aún más la naturaleza complementaria de estos índices para evaluar la complejidad lingüística. En contraste, FRES mostró correlaciones negativas significativas con varios índices de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación absolutos superiores a 0,70 (todos P < 0,001). Este patrón refleja la dirección inversa de la puntuación de FRES, en la que puntuaciones más altas indican una mayor legibilidad. El índice LW también mostró correlaciones negativas significativas con otros índices de legibilidad, incluyendo ARI, FKGL, GFOG y SMOG, con coeficientes de correlación absolutos que variaron entre 0,75 y 0,90 (todos P < 0,001). Por el contrario, LW se correlacionó positivamente con FRES (coeficiente de correlación = 0,69, P < 0,001).

También se observaron asociaciones claras entre los índices de legibilidad y la calidad general de la información, medida mediante el GQS. El GQS mostró correlaciones positivas débiles a moderadas con la mayoría de las métricas de legibilidad, incluyendo ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación que oscilaron entre 0,326 y 0,391 (todos P < 0,001). Estos hallazgos sugieren que una mayor complejidad lingüística estuvo asociada con una calidad de información más alta según la evaluación de expertos. Por el contrario, el GQS presentó una correlación negativa moderada con FRES (coeficiente de correlación = −0,408, P < 0,001), lo que indica que los textos que requieren un nivel de lectura más alto generalmente obtuvieron calificaciones más altas en el GQS. El GQS también mostró una correlación negativa moderada con LW (coeficiente de correlación = −0,421, P < 0,001).

Las asociaciones entre legibilidad y adecuación educativa para pacientes, evaluadas mediante el PEMAT, fueron generalmente más débiles pero consistentes en dirección. Las puntuaciones del PEMAT mostraron correlaciones positivas débiles con el ARI, GFOG, FKGL, CL y SMOG, con coeficientes de correlación que oscilaron entre 0,305 y 0,434 (todos P < 0,01). En contraste, las puntuaciones del PEMAT se correlacionaron negativamente y de forma débil con el FRES y el LW, con coeficientes de correlación absolutos de 0,432 y 0,320, respectivamente (ambos P < 0,01). Estos hallazgos sugieren que, dentro de este conjunto de datos, una mayor complejidad lingüística estuvo asociada con una adecuación educativa ligeramente mayor según la evaluación de expertos, aunque la fuerza de estas asociaciones fue limitada.

Es importante destacar que se observó una correlación positiva moderada entre las puntuaciones del PEMAT y del GQS (coeficiente de correlación = 0,645, P < 0,001). Esta fue la asociación más fuerte observada entre los dominios de evaluación, lo que indica que las respuestas con mayor adecuación educativa también tendían a recibir calificaciones más altas en cuanto a la calidad general de la información.

DISPONIBILIDAD DE LOS DATOS:

El conjunto completo de datos que respalda este estudio se proporciona como material suplementario. Archivo Suplementario 1 contiene la lista completa de preguntas y estímulos estandarizados, así como las 100 respuestas generadas por modelos de lenguaje grandes (LLM) archivadas. Tabla Suplementaria 2 contiene las hojas de calificación PEMAT y GQS realizadas por expertos, incluyendo las puntuaciones PEMAT por ítem cuando estuvieron disponibles, las puntuaciones totales PEMAT, las puntuaciones GQS, la información de comparación entre evaluadores y los registros de adjudicación cuando correspondió. Las puntuaciones de legibilidad, los datos fuente de las figuras y el código de análisis en R se proporcionan como Archivo Suplementario 2. Dado que las salidas de los LLM pueden cambiar con el tiempo debido a actualizaciones del modelo, cambios en la interfaz y modificaciones a nivel de plataforma, deben utilizarse las salidas archivadas, y no las respuestas regeneradas, para la verificación y el análisis secundario.

figure-results-1
Figura 1: Comparación de la legibilidad, la adecuación para la educación del paciente y la calidad general de la información entre cinco modelos grandes de lenguaje. (A–G) Este panel muestra los índices de legibilidad: Índice de Legibilidad Automatizado (ARI), Puntuación de Facilidad de Lectura de Flesch (FRES), Índice de Niebla de Gunning (GFOG), Nivel de Grado Flesch-Kincaid (FKGL), Índice Coleman-Liau (CL), Medida Simple de Galimatías (SMOG) y Fórmula Linsear Write (LW). (H) Este panel muestra las puntuaciones totales del PEMAT, y el panel (I) muestra las Puntuaciones de Calidad Global (GQS). En cada gráfico de caja, la línea central representa la mediana, el cuadro indica el rango intercuartílico (RIC), los bigotes se extienden hasta 1,5 × RIC, y los puntos más allá de los bigotes representan valores atípicos. Abreviaturas: ARI = Índice de Legibilidad Automatizado; FRES = Puntuación de Facilidad de Lectura de Flesch; GFOG = Índice de Niebla de Gunning; FKGL = Nivel de Grado Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simple de Galimatías; LW = Linsear Write; PEMAT = la Herramienta de Evaluación de Materiales Educativos para Pacientes en cuanto a Comprensibilidad y Aplicabilidad, formato imprimible; Puntuación de Calidad Global = GQS. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Matriz de correlación de Spearman entre los índices de legibilidad, la adecuación para la educación del paciente y la calidad general de la información en todas las respuestas generadas por el modelo. La matriz muestra los coeficientes de correlación de Spearman para las asociaciones por pares entre ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT y GQS. Abreviaturas: ARI = Índice de Legibilidad Automatizado; FRES = Puntuación de Facilidad de Lectura de Flesch; GFOG = Índice de Niebla de Gunning; FKGL = Nivel Escolar de Flesch-Kincaid; CL = Índice de Coleman-Liau; SMOG = Medida Simple de Galimatías; LW = Linsear Write; PEMAT = Herramienta de Evaluación de Materiales Educativos para Pacientes; GQS = Puntuación Global de Calidad. Haga clic aquí para ver una versión más grande de esta figura.

Tabla 1: Lista de 20 preguntas relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.

Tabla 2: Herramientas, fórmulas y descripciones de legibilidad. Haga clic aquí para descargar este archivo.

Tabla 3: Criterios de calidad de la puntuación global de calidad (GQS). Haga clic aquí para descargar este archivo.

Tabla 4: Resultados del análisis de diferentes modelos de lenguaje grandes para las preguntas más comunes relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.

Tabla 5: Resultados del análisis en diferentes dimensiones para las preguntas más comunes relacionadas con la neuralgia del trigémino. Haga clic aquí para descargar este archivo.

Tabla suplementaria 1: Puntuaciones de legibilidad de las respuestas generadas por los cinco modelos grandes de lenguaje en todos los índices de legibilidad evaluados. Haga clic aquí para descargar este archivo.

Tabla suplementaria 2: Calificaciones de expertos sobre la adecuación de la educación al paciente (PEMAT) y la calidad general de la información (GQS) para las respuestas generadas por los cinco modelos lingüísticos grandes. Haga clic aquí para descargar este archivo.

Archivo suplementario 1: Preguntas estandarizadas sobre neuralgia del trigémino y respuestas completas generadas por los cinco modelos grandes de lenguaje. Haga clic aquí para descargar este archivo.

Archivo suplementario 2: Secuencias de comandos R y datos fuente utilizados para los análisis estadísticos y la generación de figuras. Haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio transversal de referencia comparó sistemáticamente la legibilidad, la idoneidad educativa y la calidad general de la información en materiales educativos sobre la neuralgia del trigémino (TN) generados por cinco modelos de lenguaje grandes (LLM) disponibles públicamente. Surgieron cuatro hallazgos principales. Primero, la legibilidad varió sustancialmente entre los modelos, siendo GPT-5 el que generó las respuestas más complejas lingüísticamente, mientras que Wenxin Yiyan produjo el contenido más legible. Segundo, la legibilidad y la calidad de la información evaluada por expertos fueron dimensiones distintas de evaluación, con GPT-5 obteniendo las puntuaciones más altas en PEMAT y GQS a pesar de su menor legibilidad. Tercero, el tema del contenido influyó en la legibilidad, siendo los temas de prevención, rehabilitación y etiología y factores de riesgo los que generalmente exigieron niveles de lectura más altos, mientras que PEMAT y GQS se mantuvieron relativamente estables entre las categorías de contenido. Por último, los índices de legibilidad mostraron una fuerte consistencia interna, y los análisis de correlación revelaron asociaciones positivas débiles a moderadas entre la complejidad lingüística y tanto PEMAT como GQS, así como una correlación positiva moderada entre PEMAT y GQS. En conjunto, estos hallazgos proporcionan una referencia para evaluar los materiales educativos sobre TN generados por LLM, destacando al mismo tiempo la necesidad de equilibrar la completitud médica con la accesibilidad lingüística. Es importante señalar que estos resultados representan evaluaciones de referencia realizadas por expertos y no deben interpretarse como evidencia de comprensión por parte de los pacientes, precisión fáctica, seguridad clínica o preparación para uso clínico rutinario.

Los hallazgos de este estudio son coherentes con evaluaciones previas de la información médica generada por inteligencia artificial, las cuales han reportado una variabilidad considerable entre los modelos lingüísticos grandes (LLM) y una desconexión frecuente entre la legibilidad y la calidad de la información26,27,29. Estudios anteriores en múltiples ámbitos de enfermedades han demostrado que los materiales educativos para pacientes generados por LLM a menudo superan los niveles de lectura recomendados, y que los modelos que producen textos más legibles no necesariamente proporcionan la información más completa o de mayor calidad26,30. Los hallazgos en la educación sobre la neuritis óptica (TN) respaldan esta observación. GPT-5 generó las respuestas más complejas lingüísticamente, pero obtuvo las puntuaciones más altas en PEMAT y GQS, mientras que Wenxin Yiyan produjo textos más legibles, pero con una adecuación educativa y calidad general más baja según la evaluación de expertos. Además, la legibilidad varió entre los dominios temáticos, siendo los temas de prevención y rehabilitación, así como de etiología y factores de riesgo, los que generalmente presentaron una mayor complejidad lingüística, lo que sugiere que tanto las características del modelo como la complejidad del tema influyen en la dificultad de lectura31.

El aparente compromiso entre legibilidad y calidad de la información es coherente con los constructos distintos medidos por los instrumentos de evaluación. Las fórmulas de legibilidad evalúan principalmente características lingüísticas de superficie, como la longitud de las oraciones y la complejidad léxica, mientras que el PEMAT y el GQS evalúan atributos de orden superior, incluyendo la organización de la información, la completitud, la claridad de las explicaciones y la capacidad de acción32. Para la educación sobre la neuralgia del trigémino (TN), las respuestas de alta calidad frecuentemente incluyen discusiones sobre síntomas de alarma, diagnóstico diferencial, manejo farmacológico y efectos adversos, opciones intervencionistas y quirúrgicas, y estrategias individualizadas de rehabilitación33. Este contenido clínicamente completo aumenta inevitablemente la densidad terminológica y la complejidad sintáctica, lo que resulta en puntuaciones más altas de legibilidad y una mejor calidad educativa valorada por expertos. Es importante señalar que estos hallazgos no deben interpretarse como una sugerencia de que un lenguaje más complejo es preferible. Más bien, indican que los modelos lingüísticos grandes (LLM) actuales a menudo mejoran la completitud informativa a expensas de la accesibilidad lingüística. Por lo tanto, el desarrollo futuro de sistemas de educación para pacientes debería centrarse en mantener la precisión médica mientras se simplifica el lenguaje mediante la revisión en lenguaje sencillo, la presentación estructurada de los puntos clave, la explicación del vocabulario técnico y orientaciones claras y aplicables, adecuadas para pacientes con distintos niveles de alfabetización en salud11,34,35.

El análisis de correlación respalda aún más la distinción entre legibilidad y calidad educativa. La mayoría de los índices de legibilidad basados en el nivel escolar mostraron asociaciones positivas débiles a moderadas tanto con PEMAT como con GQS, mientras que FRES mostró la relación inversa esperada, ya que puntuaciones más altas en FRES indican una mayor facilidad de lectura. Estos hallazgos no implican que una complejidad lingüística mayor sea deseable; más bien, sugieren que los modelos lingüísticos grandes (LLM) actuales a menudo logran una mayor completitud informativa a expensas de la accesibilidad34. Por consiguiente, el desarrollo de la educación del paciente asistida por inteligencia artificial debe priorizar la precisión y completitud médicas, incorporando al mismo tiempo una redacción en lenguaje sencillo, la presentación estructurada de los puntos clave, explicaciones claras del vocabulario técnico y recomendaciones prácticas adaptadas a pacientes con distintos niveles de alfabetización en salud11,35.

Un hallazgo metodológico adicional fue el comportamiento distinto del índice LW en comparación con las demás medidas de legibilidad. A diferencia del ARI, FKGL, GFOG, CL y SMOG, LW siguió un patrón más similar al FRES, lo que refleja diferencias en la forma en que las fórmulas de legibilidad operacionalizan la complejidad del texto36. Dado que LW fue desarrollado originalmente para manuales técnicos y hace hincapié en la estructura de oraciones muestreadas y la clasificación de palabras, más que en características generales de oraciones o sílabas, podría responder de manera diferente a textos médicos generados por inteligencia artificial que combinan enunciados concisos con pasajes explicativos más largos y distribuciones irregulares de terminología técnica37,38. Estos hallazgos refuerzan la importancia de un marco de evaluación basado en múltiples métricas, ya que ningún índice individual de legibilidad captura adecuadamente todas las dimensiones de la complejidad textual. En concordancia con estudios previos sobre información sanitaria generada por inteligencia artificial, la legibilidad general debe interpretarse, por tanto, a partir de evidencia convergente proveniente de varios índices complementarios, en lugar de basarse en una sola medida39.

La categoría de contenido también influyó en la legibilidad. Los temas sobre prevención, rehabilitación, y etiología y factores de riesgo generalmente produjeron textos con mayor dificultad de lectura que el conocimiento básico sobre enfermedades, probablemente porque estos temas requieren recomendaciones condicionales, explicaciones mecanicistas y terminología más especializada40,41. En contraste, el conocimiento básico sobre enfermedades se basa principalmente en definiciones y puede transmitirse en un lenguaje más sencillo42. A pesar de estas diferencias, el PEMAT y el GQS se mantuvieron relativamente consistentes entre los distintos dominios temáticos, lo que sugiere que la adecuación educativa evaluada por expertos y la calidad general de la información se mantuvieron a través de diferentes tipos de preguntas de los pacientes35,43.

Estos hallazgos tienen varias implicaciones para la práctica clínica y el desarrollo futuro de modelos lingüísticos grandes (LLM). A medida que los pacientes utilizan cada vez más los LLM para obtener información antes o después de las consultas médicas, el contenido generado por inteligencia artificial debe complementar, y no sustituir, la orientación brindada por los médicos, especialmente en lo que respecta a la seguridad de los medicamentos, las indicaciones para tratamientos intervencionistas o quirúrgicos y el reconocimiento de síntomas de alarma que requieren evaluación urgente44. Las organizaciones de atención médica podrían beneficiarse al ofrecer recursos educativos en lenguaje sencillo revisados por expertos, utilizando al mismo tiempo los LLM como herramientas de redacción o apoyo a la toma de decisiones, y no como sistemas autónomos de educación al paciente. Los modelos futuros deberían incorporar estrategias de generación que consideren la legibilidad, informes transparentes sobre las versiones del modelo y las fechas de generación, comunicación explícita de la incertidumbre, y procedimientos de gobernanza que incluyan revisión por parte de médicos, verificación de la precisión factual, detección de alucinaciones, controles de seguridad de medicamentos, orientación sobre síntomas de alarma y pruebas de comprensión por parte del paciente antes de su implementación clínica26,44,45.

Este estudio tiene varias limitaciones. Las salidas del modelo se recopilaron de interfaces web de acceso público en una única fecha, y actualizaciones posteriores del modelo, cambios en las interfaces, indicaciones del sistema ocultas o configuraciones predeterminadas de generación podrían afectar la reproducibilidad. El conjunto de 20 preguntas fue desarrollado por expertos clínicos en lugar de derivarse de registros de búsqueda de pacientes o entrevistas formales con pacientes, una práctica que podría introducir un sesgo de selección. Además, el estudio se basó en evaluaciones expertas mediante PEMAT y GQS, y no evaluó la comprensión, confianza, satisfacción, comportamientos relacionados con la salud ni los resultados clínicos en pacientes. Las fórmulas de legibilidad, el PEMAT y el GQS tampoco evalúan directamente la precisión fáctica, el riesgo de alucinaciones, la exactitud de las citas, la completitud de las contraindicaciones ni la seguridad clínica. Por consiguiente, estos hallazgos deben interpretarse como un análisis transversal de referencia basado en evaluaciones expertas, y no como evidencia de que algún material generado por modelos de lenguaje de gran tamaño (LLM) esté listo para su uso clínico rutinario. Los estudios futuros deberían incluir salidas archivadas del modelo, metadatos detallados del modelo, evaluaciones multilingües, conjuntos más amplios de preguntas, auditorías formales de seguridad, evaluaciones de precisión fáctica y medidas de resultados centradas en el paciente antes de considerar la implementación clínica de materiales educativos generados por LLM.

En este estudio transversal de referencia calificado por expertos, los modelos de lenguaje grandes de acceso público difirieron considerablemente en la legibilidad, adecuación educativa y calidad general de la información de los materiales educativos para pacientes con neuralgia del trigémino. GPT-5 obtuvo las puntuaciones más altas según la evaluación de expertos en PEMAT y GQS, pero también generó las respuestas más complejas desde el punto de vista lingüístico, lo que destaca que la legibilidad y la calidad educativa evaluada por expertos representan dimensiones relacionadas pero distintas de la educación del paciente. Aunque algunos modelos produjeron contenidos más legibles, esto no se tradujo necesariamente en una mayor adecuación educativa o calidad general de la información. Dado que este estudio no evaluó la precisión fáctica mediante una auditoría de seguridad dedicada, el riesgo de alucinaciones, la exactitud de las citas, la comprensión del paciente, la confianza, la satisfacción, los comportamientos relacionados con la salud ni los resultados clínicos, los hallazgos deben interpretarse como un análisis de referencia valorado por expertos, y no como evidencia de preparación clínica. Los estudios futuros deberían integrar la revisión por expertos, evaluaciones formales de seguridad y precisión fáctica, y evaluaciones centradas en el paciente para apoyar el uso seguro y eficaz de materiales generados por modelos de lenguaje grandes en la educación del paciente.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses competitivos.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió ninguna subvención específica de ninguna agencia financiadora de los sectores público, comercial o sin fines de lucro. Los autores agradecen a los colegas clínicos que proporcionaron comentarios sobre el conjunto de preguntas relacionadas con la neuralgia del trigémino y ayudaron a perfeccionar el marco de evaluación. También agradecemos a todos los colaboradores que apoyaron la preparación y revisión del manuscrito.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Plataforma de chat DeepSeekDeepSeekhttps://chat.deepseek.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Plataforma de chat DoubaoDoubaohttps://www.doubao.com/chat/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
GPT 5 OpenAINo aplicableInterfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Software R, versión 4.4.3Foundation R para la Computación EstadísticaNo aplicableAnálisis estadístico y visualización
Calculadora en línea de fórmulas de legibilidadReadability FormulasNo aplicableHerramienta en línea utilizada para calcular índices de legibilidad
Plataforma de chat Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas
Plataforma de chat Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interfaz pública de modelo de lenguaje de gran tamaño utilizada para generar respuestas

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Modelos de lenguaje extensosevaluaci n de la legibilidadcalidad educativaevaluaci n PEMATpuntuaci n de calidad globalcalidad de la informaci n sanitariaan lisis comparativo de modeloscomprensi n del paciente

Artículos relacionados