Artigo de investigação

Legibilidade e Qualidade da Educação do Paciente por Modelos de Linguagem de Grande Escala para Neuralgia do Trigêmeo: Um Estudo Transversal

DOI:

10.3791/70833

21 de agosto de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aqui, apresentamos um protocolo para avaliar de forma sistemática a legibilidade, adequação educacional e qualidade das informações geradas por modelos de linguagem de grande porte sobre a neuralgia do trigêmeo, com o objetivo de estabelecer parâmetros de referência para os modelos e orientar a comunicação voltada aos pacientes.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modelos linguísticos grandes (LLMs) estão sendo usados com frequência crescente na educação em saúde do paciente, embora a legibilidade e a qualidade educacional das informações geradas por LLMs sobre neuralgia do trigêmeo (TN) ainda não tenham sido suficientemente avaliadas. Este estudo transversal de referência comparou conteúdos educacionais sobre TN gerados por cinco LLMs disponíveis publicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). Vinte perguntas frequentes sobre TN, abrangendo conhecimentos básicos da doença, etiologia/fatores de risco, diagnóstico, tratamento e prevenção/reabilitação, foram apresentadas a cada modelo utilizando estímulos padronizados. A legibilidade foi avaliada por meio de sete índices estabelecidos, a adequação educacional foi medida com a Ferramenta de Avaliação de Materiais Educacionais para Pacientes quanto à Compreensibilidade e Capacidade de Ação (PEMAT) e a qualidade geral da informação foi determinada pelo Índice Global de Qualidade (GQS). Dois especialistas clínicos avaliaram independentemente todas as respostas, com desacordos resolvidos por um árbitro sênior. Análises estatísticas compararam o desempenho dos modelos, diferenças temáticas e correlações entre as métricas de avaliação. Foram observadas diferenças significativas entre os modelos quanto aos escores de legibilidade, PEMAT e GQS. O GPT-5 gerou as respostas mais linguisticamente complexas, mas obteve as classificações mais altas em adequação educacional e qualidade da informação. Em contraste, o Wenxin Yiyan produziu o texto mais legível, mas geralmente obteve escores mais baixos nos critérios PEMAT e GQS. A categoria do conteúdo influenciou a legibilidade, sendo os temas prevenção/reabilitação e etiologia/fatores de risco mais difíceis de ler, enquanto os escores PEMAT e GQS permaneceram relativamente consistentes entre os temas. Os índices de legibilidade mostraram forte consistência interna e correlações positivas fracas a moderadas com os escores PEMAT e GQS, enquanto PEMAT e GQS demonstraram correlação positiva moderada. Esses achados sugerem que a escolha do modelo influencia a adequação educacional e a qualidade geral da informação conforme avaliado por especialistas, enquanto a complexidade do tema afeta principalmente a legibilidade. Como a compreensão do paciente, satisfação, confiança, resultados em saúde, precisão factual e segurança clínica não foram avaliadas, esses resultados devem ser interpretados como uma análise de referência baseada na avaliação de especialistas, e não como evidência de prontidão clínica.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A neuralgia do trigêmeo (NT) é uma síndrome de dor neuropática caracterizada por episódios recorrentes de dor facial unilateral, breve e extremamente intensa, comumente descrita como semelhante a choques elétricos ou pontadas. De acordo com a Classificação Internacional de Transtornos da Dor de Cabeça, 3ª edição (ICHD-3), a dor localiza-se tipicamente na distribuição de um ou mais ramos do nervo trigêmeo, é frequentemente de intensidade insuportável e pode ser desencadeada por estímulos inócuos, como toque leve, lavagem do rosto, escovação dos dentes, fala ou mastigação. Os ataques são marcados por início súbito e cessação abrupta, com duração variando de frações de segundo a vários minutos1,2. Embora a NT geralmente não seja ameaçadora à vida, a dor severa e imprevisível interrompe substancialmente atividades diárias essenciais, incluindo alimentação, fala, sono e regulação emocional, resultando em considerável carga psicossocial e qualidade de vida prejudicada. Evidências de revisões sistemáticas indicam que indivíduos com NT enfrentam risco significativamente elevado de depressão, ansiedade e distúrbios do sono em comparação com a população geral3,4. Em grandes estudos de coorte, aproximadamente 35–55% dos pacientes com NT apresentam sintomas clinicamente significativos de ansiedade ou depressão, e a catastrofização da dor é altamente prevalente, sugerindo uma interação bidirecional entre dor crônica severa, insônia e transtornos afetivos5,6. Estimativas epidemiológicas indicam que a prevalência da NT na população geral varia de aproximadamente 0,03% a 0,3%, com maior ocorrência entre mulheres e adultos mais velhos e variações notáveis entre regiões geográficas, grupos étnicos e faixas etárias7,8. Em países altamente povoados, como China e Índia, o envelhecimento populacional acelerado tem sido acompanhado por um aumento sustentado no número de indivíduos afetados pela NT, impondo, assim, uma carga crescente aos sistemas de saúde e destacando a necessidade de abordagens mais eficazes, escaláveis e baseadas em dados para avaliação e manejo da doença8,9.

A NT pode ser classificada em subtipos clássico, secundário e idiopático, com evidências crescentes demonstrando diferenças substanciais nos mecanismos etiológicos e nas estratégias terapêuticas entre essas categorias1,10. Estudos atuais sugerem que alterações estruturais relacionadas ao conflito neurovascular na zona de entrada da raiz do nervo trigêmeo, a hiperexcitabilidade do nervo periférico e a modulação central da dor alterada contribuem conjuntamente para a patogênese da doença11,12. As diretrizes clínicas recomendam carbamazepina e oxcarbazepina como tratamentos de primeira linha, enquanto abordagens cirúrgicas ou intervencionistas são consideradas quando a terapia farmacológica é ineficaz ou mal tolerada10. Apesar desses avanços terapêuticos, a NT caracteriza-se por um curso recidivante-remissivo, e a recorrência prolongada da dor permanece comum, dificultando a obtenção de remissão permanente13. Consequentemente, o acompanhamento a longo prazo e o manejo estruturado da doença crônica são essenciais para monitorar o risco de recorrência, a resposta ao tratamento e as complicações. Estudos longitudinais de coorte indicam que, sob estratégias padronizadas de manejo (incluindo tratamento farmacológico, intervenção cirúrgica quando indicada e acompanhamento abrangente), aproximadamente metade dos pacientes submetidos ao manejo conservador pode alcançar uma redução ≥50% na carga total da dor em até dois anos, sem progressão inevitável da doença14. Esses achados destacam a importância do engajamento contínuo do paciente e de uma educação em saúde eficaz para o manejo prolongado da doença. Evidências indicam que pacientes com melhor compreensão da etiologia, da fisiopatologia e das opções de tratamento da doença têm maior probabilidade de participar ativamente e aderir aos regimes terapêuticos, resultando em melhores desfechos15. No entanto, as abordagens tradicionais de educação em saúde frequentemente apresentam limitações quanto ao alcance e à escalabilidade. Com a ampla adoção da internet, especialmente plataformas online de perguntas e respostas e redes sociais, os pacientes dependem cada vez mais de fontes digitais para obter informações médicas16,17. Apesar disso, a variabilidade significativa na alfabetização em saúde individual e na capacidade de acessar, processar e compreender informações básicas de saúde para tomada de decisões informadas representa um grande obstáculo à educação eficaz do paciente18. Além disso, a qualidade desigual das informações de saúde online, incluindo conteúdos imprecisos ou enganosos, pode influenciar negativamente as decisões médicas e o bem-estar psicológico dos pacientes19.

As tecnologias de inteligência artificial (IA), particularmente o rápido desenvolvimento de modelos de linguagem de grande porte (MLGP) nos últimos anos, criaram novas oportunidades para a comunicação científica na área médica e para a educação em saúde20. Treinados em grandes corpora textuais, esses modelos podem gerar respostas estruturadas e logicamente coerentes por meio da interação em linguagem natural21. Sistemas internacionais representativos, como o ChatGPT, demonstraram potencial promissor para respostas a perguntas médicas, consultas a pacientes e educação médica22,23. Vários MLGP funcionalmente semelhantes surgiram na China, com cobertura de usuários e cenários de aplicação em constante expansão24. Apesar desses avanços, a aplicação de MLGP na divulgação científica médica ainda enfrenta desafios significativos, incluindo a confiabilidade dos dados de treinamento, frequência de atualização, a precisão científica das respostas geradas e a falta de validação clínica25. Além disso, diferenças entre modelos quanto ao estilo linguístico, legibilidade, estrutura lógica e precisão nas citações podem influenciar diretamente a compreensão e a confiança dos pacientes nas informações relacionadas à saúde26. Até o momento, avaliações sistemáticas do desempenho de MLGP na educação em saúde relacionada à NT têm sido limitadas.

Portanto, este estudo teve como objetivo avaliar e comparar de forma sistemática o desempenho de quatro grandes modelos linguísticos de uso comum na China (Doubao, DeepSeek, Wenxin Yiyan e Tongyi Qianwen) e um modelo linguístico internacional representativo (ChatGPT) na resposta a perguntas de educação do paciente relacionadas à nevralgia do trigêmeo (TN). Utilizando um delineamento transversal, construímos um conjunto de perguntas sobre TN com base em diretrizes clínicas e nas preocupações frequentes dos pacientes, e avaliamos as respostas geradas por cinco grandes modelos linguísticos disponíveis publicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). A legibilidade foi avaliada por meio de múltiplas métricas, e a compreensibilidade e a aplicabilidade foram analisadas utilizando a Ferramenta de Avaliação de Materiais de Educação do Paciente (PEMAT). A qualidade geral das informações foi avaliada por meio do Escore Global de Qualidade (GQS). Além disso, analisamos como diferentes temas de educação em saúde influenciam essas métricas de avaliação e suas inter-relações, com o objetivo de fornecer orientações baseadas em evidências para a seleção e otimização de grandes modelos linguísticos na comunicação clínica em saúde.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo analisou apenas texto gerado por IA e não envolveu participantes humanos, animais, espécimes biológicos, prontuários médicos, informações pessoais identificáveis ou intervenção na assistência clínica. Portanto, a análise ética e o consentimento formal não eram aplicáveis.

Desenho do estudo

Este estudo transversal avaliou a legibilidade, qualidade e adequação educacional das respostas geradas por cinco LLMs em resposta a perguntas frequentes sobre TN.

Identificação de perguntas frequentes relacionadas à NT

Em 25 de novembro de 2025, dois especialistas clínicos com ampla experiência em medicina da dor revisaram independentemente as diretrizes clínicas atuais para a neuralgia do trigêmeo (NT), incluindo a Classificação Internacional dos Transtornos da Dor de Cabeça, 3ª edição (ICHD-3), a diretriz da Academia Europeia de Neurologia e a diretriz da Academia Americana de Neurologia/Federação Europeia de Sociedades Neurológicas1,10,11. Após uma discussão de consenso, eles elaboraram uma lista de 20 perguntas relacionadas à NT frequentemente encontradas na prática clínica. O número de perguntas foi determinado a priori para proporcionar uma cobertura equilibrada dos cinco domínios temáticos pré-definidos, com quatro perguntas selecionadas para cada domínio, mantendo o número total de respostas geradas por modelo dentro de uma faixa viável para avaliação e verificação manual por especialistas. Para melhorar a reprodutibilidade, o processo de seleção seguiu uma estrutura pré-definida baseada em domínios: os especialistas identificaram primeiramente perguntas candidatas dentro de cada domínio, revisaram-nas independentemente quanto à relevância clínica, formulação centrada no paciente e ausência de redundância, e então chegaram a um consenso sobre as quatro perguntas finais por domínio. A lista final de perguntas está apresentada na Tabela 1 e no Arquivo Suplementar 1. Os cinco domínios temáticos pré-definidos foram conhecimento básico da doença, etiologia e fatores de risco, diagnóstico, tratamento, e prevenção e reabilitação. Como o conjunto de perguntas não foi derivado de registros de buscas de pacientes, consultas online ou entrevistas formais com pacientes, reconhece-se a possibilidade de viés de seleção como uma limitação do estudo.

Modelos de IA e procedimento de coleta de dados

Em 25 de novembro de 2025, o conjunto finalizado de 20 perguntas relacionadas a TN foi submetido a cinco plataformas publicamente acessíveis de modelos linguísticos grandes (LLM, na sigla em inglês): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5/ChatGPT. Todos os modelos foram acessados por meio de suas interfaces de chat padrão baseadas na web; não foi utilizado acesso por interface de programação de aplicações (API). Em cada plataforma, foi utilizado o modelo publicamente disponível padrão disponível na data da coleta de dados, sem modificação de quaisquer parâmetros de geração. Como as interfaces web públicas não exibiam identificadores de versão do modelo de back-end, prompts do sistema ocultos, temperatura, top-p, número máximo de tokens de saída ou outros parâmetros de geração, esses itens foram registrados como "não exibidos na interface web pública".

Os idiomas do prompt e da resposta foram o inglês para todos os modelos. Cada prompt padronizado consistia exclusivamente na pergunta em inglês, sem quaisquer instruções adicionais específicas ao modelo. Cada pergunta foi enviada individualmente em uma nova sessão de chat independente, sem histórico prévio de conversa, arquivos enviados, plug-ins, instruções personalizadas ou prompts de acompanhamento. A lista completa dos prompts padronizados e as respectivas saídas brutas dos modelos está fornecida no Arquivo Suplementar 1. Os metadados dos modelos e as configurações de coleta de dados são resumidos na Tabela Suplementar 1.

Avaliação da legibilidade

A legibilidade das respostas geradas por modelos de linguagem foi avaliada utilizando múltiplas fórmulas de legibilidade estabelecidas, disponíveis por meio de uma plataforma online de avaliação de legibilidade (http://readabilityformulas.com/). Diante da ausência de um padrão-ouro universalmente aceito para avaliação de legibilidade e em conformidade com estudos anteriores, empregou-se um conjunto abrangente de índices de legibilidade amplamente utilizados23,27. Sete índices foram selecionados para abranger aspectos complementares da legibilidade, incluindo comprimento da frase, comprimento da palavra, carga silábica, complexidade baseada em caracteres, facilidade de leitura e nível escolar estimado, reduzindo assim a dependência de qualquer fórmula única. Especificamente, foram calculados o Índice de Coleman-Liau (CL), a Fórmula Linsear Write (LW), o Índice de Legibilidade Automatizado (ARI), a Medida Simples de Gobbledygook (SMOG), o Índice Gunning Fog (GFOG), o Escore de Facilidade de Leitura de Flesch (FRES) e o Nível de Escolaridade Flesch-Kincaid (FKGL). Esses índices estimam a dificuldade de leitura ou o nível escolar e fornecem medidas quantitativas da legibilidade do texto (Tabela 2).

Avaliação da adequação educacional e qualidade das informações

A adequação educacional foi avaliada utilizando a Ferramenta de Avaliação de Materiais Educacionais para Pacientes (Patient Education Materials Assessment Tool, PEMAT), que compreende dois domínios: compreensibilidade e capacidade de ação28. O instrumento inclui 24 itens, sendo 16 para avaliar a compreensibilidade e oito para avaliar a capacidade de ação. Cada item foi pontuado de forma dicotômica (0 = critério não atendido; 1 = critério atendido), resultando em uma pontuação total variando de 0 a 24, em que pontuações mais altas indicam maior adequação para a educação do paciente. A qualidade geral da informação foi avaliada utilizando o Escore Global de Qualidade (Global Quality Score, GQS)27, uma escala Likert de cinco pontos amplamente utilizada para avaliar a qualidade da informação médica (Tabela 3).

Em 25 de novembro de 2025, dois especialistas clínicos com mais de três anos de experiência no manejo de TN avaliaram todas as respostas geradas por IA utilizando ambos os instrumentos de avaliação. Antes da pontuação, todas as respostas geradas por IA foram anonimizadas com identificadores codificados, e os revisores permaneceram cegos quanto à plataforma de LLM durante as avaliações PEMAT e GQS. Os desacordos foram resolvidos por um terceiro especialista sênior, que decidiu as pontuações finais. A confiabilidade entre avaliadores foi avaliada utilizando o coeficiente kappa de Cohen, em que valores >0,75 indicam concordância excelente, 0,40–0,75 indicam concordância aceitável e <0,40 indicam concordância pobre. Os valores de kappa de Cohen tanto para o PEMAT quanto para o GQS superaram 0,75, demonstrando excelente confiabilidade entre avaliadores.

Análise estatística

Todas as análises estatísticas foram realizadas utilizando o software R (versão 4.4.3). A normalidade dos dados foi avaliada por meio do teste de Shapiro-Wilk e dos gráficos Q-Q. As variáveis com distribuição normal foram resumidas como média ± desvio padrão e comparadas utilizando análise de variância unidirecional (ANOVA), seguida do teste post hoc de Tukey quando apropriado. As variáveis com distribuição não normal foram resumidas como medianas e intervalos interquartis e comparadas utilizando o teste de Kruskal-Wallis, seguido do teste post hoc de Dunn com correção de Bonferroni para comparações aos pares. As correlações entre os índices de legibilidade, os escores PEMAT e os valores GQS foram avaliadas utilizando o coeficiente de correlação de postos de Spearman, com aplicação da correção de Benjamini-Hochberg para testes múltiplos. Um valor de P ajustado bicaudal < 0,05 foi considerado estatisticamente significativo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo avaliou sistematicamente os efeitos de modelos de linguagem grandes (LLMs) e de diferentes categorias de conteúdo educacional em saúde sobre a legibilidade e a qualidade dos textos gerados. Primeiro, comparamos o desempenho de cinco LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5 — em relação à adequação para educação do paciente, qualidade geral da informação e múltiplas métricas de legibilidade, incluindo o escore PEMAT, GQS e índices de legibilidade estabelecidos (ARI, FRES, GFOG, FKGL, CL, SMOG e LW). Em segundo lugar, examinamos as mesmas medidas de resultado em cinco domínios temáticos do conteúdo educacional em saúde: conhecimento básico sobre doenças, etiologia e fatores de risco, diagnóstico, tratamento e prevenção e reabilitação. Ao integrar essas duas perspectivas analíticas, exploramos ainda como o tipo de modelo e a categoria de conteúdo influenciam conjuntamente a qualidade e a legibilidade do texto, identificando assim padrões sistemáticos nos materiais educacionais para pacientes gerados por LLMs.

Análise de legibilidade entre diferentes modelos grandes de linguagem

Sete índices de legibilidade estabelecidos foram utilizados para comparar sistematicamente a complexidade linguística dos textos relacionados à neuralgia do trigêmeo gerados por cinco modelos linguísticos grandes: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5. Os resultados gerais são resumidos na Tabela 4, e as distribuições das métricas individuais de legibilidade são apresentadas na Figura 1A–G. Diferenças estatisticamente significativas foram observadas entre os cinco modelos para todos os índices de legibilidade, com P < 0,001 para cada um.

O GPT-5 apresentou os valores medianos mais altos para ARI, GFOG, FKGL, CL e SMOG e o FRES mais baixo, indicando que gerou textos com estruturas de frases mais longas, vocabulário mais complexo e maior carga de leitura geral (Figura 1A–G). Em contraste, o Wenxin Yiyan demonstrou a menor complexidade linguística. Seus valores medianos de ARI, GFOG, FKGL, CL e SMOG foram os mais baixos entre os cinco modelos, enquanto seu FRES foi o mais alto.

Doubao, DeepSeek e Tongyi Qianwen demonstraram níveis intermediários de legibilidade entre o GPT-5 e o Wenxin Yiyan. Doubao e DeepSeek apresentaram desempenho comparável nos índices de nível escolar, incluindo ARI, GFOG, FKGL e CL, e ambos apresentaram valores significativamente mais altos do que o Wenxin Yiyan, com todos os P < 0,05. Esses resultados indicam uma carga de leitura geral semelhante para Doubao e DeepSeek, com maior complexidade linguística do que o Wenxin Yiyan.

O Tongyi Qianwen geralmente apresentou valores entre os do Doubao/DeepSeek e do GPT-5 na maioria dos índices de legibilidade. Notavelmente, sua pontuação CL foi mais próxima à do GPT-5, sugerindo uma complexidade linguística ligeiramente maior do que a do Doubao e do DeepSeek, ainda que permanecendo menos complexa que a do GPT-5. O índice LW exibiu um padrão de distribuição distinto dos demais indicadores de legibilidade. O Wenxin Yiyan obteve a pontuação LW mais alta (60,00), seguido pelo Tongyi Qianwen, DeepSeek e Doubao, enquanto o GPT-5 apresentou a pontuação LW mais baixa (46,50). Essa discrepância reflete diferenças na forma como as fórmulas individuais de legibilidade ponderam o comprimento das frases e a dificuldade das palavras (Figura 1G).

No geral, foram observadas diferenças substanciais na complexidade linguística entre os cinco grandes modelos de linguagem. O GPT-5 gerou o texto mais complexo do ponto de vista linguístico, o Wenxin Yiyan produziu o conteúdo mais legível, e os modelos restantes exibiram níveis intermediários de legibilidade, embora diferenças estruturais tenham sido evidentes.

Comparação da adequação da educação do paciente e da qualidade geral entre modelos de linguagem grandes

Foram observadas diferenças significativas na adequação dos materiais para educação do paciente, conforme avaliado pelo PEMAT, entre os cinco modelos de linguagem (Figura 1H; Tabela 4), com todos os valores de P < 0,001. O GPT-5 obteve a pontuação mais alta no PEMAT segundo avaliação de especialistas (9,40 ± 1,90), indicando maior adequação educacional dentro da estrutura atual de avaliação comparativa. No entanto, esse resultado não deve ser interpretado como evidência de que os materiais gerados pelo GPT-5 melhorem a compreensão real do paciente, satisfação, confiança, comportamentos relacionados à saúde ou desfechos clínicos.

O DeepSeek obteve um escore PEMAT intermediário (6,80 ± 1,06), com uma distribuição de escores relativamente compacta, sugerindo desempenho consistente na geração de materiais educativos para pacientes. Contudo, sua adequação educacional geral permaneceu significativamente inferior à do GPT-5 (P < 0,001). O Doubao, o Tongyi Qianwen e o Wenxin Yiyan apresentaram escores PEMAT mais baixos (5,35 ± 1,04, 5,65 ± 1,09 e 5,35 ± 0,93, respectivamente). Nenhuma diferença significativa foi observada entre esses três modelos, e todos tiveram desempenho significativamente pior em comparação com o DeepSeek e o GPT-5 (todos P < 0,01). Esses achados indicam adequação educacional comparável, porém limitada, entre esses modelos, especialmente em relação à clareza instrucional, organização linguística e facilidade de compreensão.

Um padrão semelhante foi observado para a qualidade geral das informações, conforme avaliado pelo GQS (Figura 1I). Foram identificadas diferenças estatisticamente significativas entre os cinco modelos, com todos os P < 0,001. O GPT-5 obteve a pontuação GQS mais alta (4,00 ± 0,65). Suas pontuações concentraram-se na faixa de 4–5, com variabilidade limitada, indicando desempenho consistentemente alto na coerência do conteúdo, completude estrutural e utilidade prática.

O DeepSeek e o Doubao seguiram, com pontuações GQS de 3,35 ± 0,59 e 3,40 ± 0,50, respectivamente. Suas distribuições de pontuação estavam centradas entre 3 e 4, sugerindo qualidade moderada da informação e confiabilidade razoável. Em contraste, o Tongyi Qianwen e o Wenxin Yiyan obtiveram as pontuações GQS mais baixas (2,50 ± 0,51 e 2,20 ± 0,52, respectivamente). Suas distribuições foram inclinadas para a extremidade inferior da escala, indicando limitações na precisão das informações, rigor estrutural e profundidade do conteúdo, o que pode reduzir sua utilidade para a educação do paciente.

No geral, o GPT-5 obteve as pontuações mais altas atribuídas por especialistas para PEMAT e GQS neste conjunto de dados, enquanto o DeepSeek e o Doubao demonstraram desempenho intermediário. O Tongyi Qianwen e o Wenxin Yiyan receberam classificações mais baixas de GQS. Esses resultados representam avaliações de referência feitas por especialistas e não devem ser interpretados como evidência de prontidão clínica ou eficácia em nível de paciente.

Comparação da legibilidade, adequação à educação do paciente e qualidade geral entre categorias de conteúdo educativo em saúde

A análise por categoria de conteúdo revelou diferenças significativas na legibilidade entre os cinco temas de educação em saúde (Tabela 5). Para o FRES, observaram-se diferenças estatisticamente significativas entre as categorias temáticas (P = 0,004). Valores mais altos de FRES indicam maior facilidade de leitura. Os textos sobre conhecimentos básicos sobre doenças foram os mais legíveis (mediana = 28,50), seguidos pelos conteúdos sobre diagnóstico (mediana = 16,00), etiologia e fatores de risco (mediana = 12,50) e conteúdos relacionados ao tratamento (mediana = 11,50). Em contraste, os textos sobre prevenção e reabilitação apresentaram a menor legibilidade (mediana de FRES = 1,00), indicando a maior dificuldade de leitura.

Padrões semelhantes foram observados nos outros índices de legibilidade. GFOG e FKGL diferiram significativamente entre as categorias temáticas (P = 0,002 e P = 0,036, respectivamente), com ambos os índices indicando níveis de escolaridade mais altos para os conteúdos sobre etiologia e fatores de risco e sobre prevenção e reabilitação. O índice SMOG também sugeriu que os textos sobre etiologia e fatores de risco continham uma proporção maior de palavras com múltiplas sílabas (P = 0,039). As maiores diferenças foram observadas para CL (P < 0,001). Os textos sobre prevenção e reabilitação tinham as frases mais longas (mediana = 21,01), aumentando substancialmente a dificuldade de leitura, enquanto os textos sobre conhecimentos básicos da doença tinham as frases mais curtas (mediana = 14,88), correspondendo à menor carga de leitura. Não foram observadas diferenças significativas entre as categorias de conteúdo para ARI ou LW.

Não foram identificadas diferenças estatisticamente significativas na adequação educacional para pacientes entre as cinco categorias de conteúdo com base nas pontuações do PEMAT (P = 0,252). As pontuações médias do PEMAT variaram de 5,90 a 7,20, indicando que, apesar das diferenças acentuadas na complexidade linguística, a adequação educacional permaneceu relativamente consistente entre os temas. Da mesma forma, a qualidade geral da informação, avaliada pelo GQS, não diferiu significativamente entre as categorias de conteúdo (P = 0,822). Os valores médios do GQS variaram de 2,95 a 3,25, indicando que a qualidade geral da informação foi relativamente estável entre os temas de conteúdo.

No geral, foram observadas diferenças substanciais na legibilidade entre os temas de educação em saúde, sendo os conteúdos sobre etiologia e fatores de risco e sobre prevenção e reabilitação os que apresentaram maior dificuldade de leitura, enquanto os conteúdos sobre conhecimentos básicos da doença foram os mais legíveis. Em contraste, a adequação da educação do paciente e a qualidade geral das informações permaneceram relativamente consistentes entre as categorias de conteúdo.

Análise de correlação entre legibilidade, adequação à educação do paciente e qualidade geral

A matriz de correlação na Figura 2 mostra associações consistentes e robustas entre os índices de legibilidade, indicando forte consistência interna. A maioria das métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, exibiu correlações positivas moderadas a fortes entre si, com coeficientes de correlação variando de 0,64 a 0,97 (todos P < 0,001). Esses resultados reforçam a natureza complementar desses índices na avaliação da complexidade linguística. Em contraste, o FRES apresentou correlações negativas significativas com múltiplas métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação absolutos superiores a 0,70 (todos P < 0,001). Esse padrão reflete a direção inversa da pontuação do FRES, em que pontuações mais altas indicam maior legibilidade. O índice LW também demonstrou correlações negativas significativas com outros índices de legibilidade, incluindo ARI, FKGL, GFOG e SMOG, com coeficientes de correlação absolutos variando de 0,75 a 0,90 (todos P < 0,001). Por outro lado, LW apresentou correlação positiva com FRES (coeficiente de correlação = 0,69, P < 0,001).

Associações claras também foram observadas entre os índices de legibilidade e a qualidade geral da informação, conforme medido pelo GQS. O GQS demonstrou correlações positivas fracas a moderadas com a maioria das métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação variando de 0,326 a 0,391 (todos P < 0,001). Esses achados sugerem que uma maior complexidade linguística estava associada a uma qualidade da informação mais alta segundo avaliação de especialistas. Por outro lado, o GQS apresentou correlação negativa moderada com o FRES (coeficiente de correlação = −0,408, P < 0,001), indicando que textos que exigem um nível de leitura mais elevado geralmente receberam pontuações mais altas no GQS. O GQS também mostrou uma correlação negativa moderada com LW (coeficiente de correlação = −0,421, P < 0,001).

As associações entre legibilidade e adequação educacional para pacientes, avaliadas por meio do PEMAT, foram geralmente mais fracas, mas consistentes em direção. Os escores do PEMAT exibiram correlações positivas fracas com ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação variando de 0,305 a 0,434 (todos P < 0,01). Em contraste, os escores do PEMAT correlacionaram-se negativamente e de forma fraca com FRES e LW, com coeficientes de correlação absolutos de 0,432 e 0,320, respectivamente (ambos P < 0,01). Esses achados sugerem que, dentro deste conjunto de dados, uma maior complexidade linguística esteve associada a uma adequação educacional ligeiramente mais alta segundo avaliação de especialistas, embora a força dessas associações tenha sido limitada.

Importante, uma correlação positiva moderada foi observada entre as pontuações do PEMAT e do GQS (coeficiente de correlação = 0,645, P < 0,001). Essa foi a associação mais forte observada entre os domínios de avaliação, indicando que respostas com maior adequação educacional também tenderam a receber classificações mais altas quanto à qualidade geral das informações.

DISPONIBILIDADE DE DADOS:

O conjunto completo de dados que sustenta este estudo é fornecido como material suplementar. Arquivo Suplementar 1 contém a lista completa das perguntas padronizadas, instruções e as 100 respostas geradas por modelos linguísticos grandes (LLM) arquivadas. Tabela Suplementar 2 contém as planilhas de pontuação PEMAT e GQS pelos especialistas, incluindo as classificações PEMAT por item quando disponíveis, pontuações totais do PEMAT, pontuações do GQS, informações de comparação entre avaliadores e registros de adjudicação quando aplicável. As pontuações de legibilidade, os dados brutos das figuras e o código de análise em R são fornecidos como Arquivo Suplementar 2. Como as saídas dos LLMs podem mudar ao longo do tempo devido a atualizações de modelos, alterações de interface e modificações em nível da plataforma, as saídas arquivadas, e não as respostas regeneradas, devem ser utilizadas para verificação e análise secundária.

figure-results-1
Figura 1: Comparação da legibilidade, adequação para educação do paciente e qualidade geral da informação entre cinco modelos de linguagem grandes. (A–G) Este painel apresenta os índices de legibilidade: Índice Automatizado de Legibilidade (ARI), Escore de Facilidade de Leitura de Flesch (FRES), Índice de Neblina de Gunning (GFOG), Nível de Grau Flesch-Kincaid (FKGL), Índice Coleman-Liau (CL), Medida Simples de Gobbledygook (SMOG) e Fórmula Linsear Write (LW). (H) Este painel mostra os escores totais do PEMAT, e o painel (I) mostra os Escores Globais de Qualidade (GQS). Em cada gráfico de caixa, a linha central representa a mediana, a caixa indica a amplitude interquartil (IQR), os bigodes estendem-se até 1,5 × IQR, e os pontos além dos bigodes representam valores atípicos. Abreviações: ARI = Índice Automatizado de Legibilidade; FRES = Escore de Facilidade de Leitura de Flesch; GFOG = Índice de Neblina de Gunning; FKGL = Nível de Grau Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simples de Gobbledygook; LW = Linsear Write; PEMAT = Ferramenta de Avaliação de Materiais Educacionais para Pacientes para Compreensibilidade e Capacidade de Ação, formato imprimível; Escore Global de Qualidade = GQS. Clique aqui para visualizar uma versão maior desta figura.

figure-results-2
Figura 2: Matriz de correlação de Spearman entre os índices de legibilidade, adequação para educação do paciente e qualidade geral da informação em todas as respostas geradas pelo modelo. A matriz apresenta os coeficientes de correlação de Spearman para as associações aos pares entre ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT e GQS. Abreviações: ARI = Índice Automatizado de Legibilidade; FRES = Escore de Facilidade de Leitura de Flesch; GFOG = Índice Fog de Gunning; FKGL = Nível de Escolaridade Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simples de Gobbledygook; LW = Linsear Write; PEMAT = Ferramenta de Avaliação de Materiais de Educação do Paciente; GQS = Escore Global de Qualidade. Clique aqui para visualizar uma versão maior desta figura.

Tabela 1: Lista de 20 perguntas relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.

Tabela 2: Ferramentas, fórmulas e descrições de legibilidade. Clique aqui para baixar este arquivo.

Tabela 3: Critérios de qualidade da Pontuação Global de Qualidade (GQS). Clique aqui para baixar este arquivo.

Tabela 4: Resultados da análise de diferentes modelos de linguagem grandes para as perguntas mais comuns relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.

Tabela 5: Resultados da análise em diferentes dimensões para as perguntas mais comuns relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.

Tabela Suplementar 1: Pontuações de legibilidade das respostas geradas pelos cinco modelos de linguagem grandes em todos os índices de legibilidade avaliados. Clique aqui para baixar este arquivo.

Tabela Suplementar 2: Avaliações por especialistas da adequação da educação do paciente (PEMAT) e da qualidade geral da informação (GQS) para as respostas geradas pelos cinco modelos linguísticos grandes. Clique aqui para baixar este arquivo.

Arquivo Suplementar 1: Perguntas padronizadas sobre neuralgia do trigêmeo e respostas completas geradas pelos cinco grandes modelos de linguagem. Clique aqui para baixar este arquivo.

Arquivo Suplementar 2: Scripts R e dados brutos utilizados nas análises estatísticas e na geração de figuras. Clique aqui para baixar este arquivo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo transversal de referência comparou de forma sistemática a legibilidade, a adequação educacional e a qualidade geral das informações em materiais educativos sobre neuralgia do trigêmeo (NT) gerados por cinco modelos de linguagem grandes (LLMs) de acesso público. Quatro principais achados emergiram. Primeiro, a legibilidade variou substancialmente entre os modelos, sendo o GPT-5 o que gerou respostas mais complexas linguisticamente, enquanto o Wenxin Yiyan produziu o conteúdo mais legível. Segundo, legibilidade e qualidade da informação avaliada por especialistas foram dimensões distintas de avaliação, com o GPT-5 obtendo as pontuações mais altas nos índices PEMAT e GQS, apesar de sua menor legibilidade. Terceiro, o tema do conteúdo influenciou a legibilidade, sendo que tópicos sobre prevenção, reabilitação e etiologia e fatores de risco geralmente exigiram níveis de leitura mais elevados, enquanto os escores PEMAT e GQS permaneceram relativamente estáveis entre as categorias de conteúdo. Por fim, os índices de legibilidade demonstraram forte consistência interna, e análises de correlação revelaram associações positivas fracas a moderadas entre complexidade linguística e ambos os índices PEMAT e GQS, bem como uma correlação positiva moderada entre PEMAT e GQS. Em conjunto, esses achados fornecem uma referência para avaliação de materiais educativos sobre NT gerados por LLMs, destacando ao mesmo tempo a necessidade de equilibrar completude médica com acessibilidade linguística. É importante ressaltar que esses resultados representam desempenho avaliado por especialistas e não devem ser interpretados como evidência de compreensão pelos pacientes, precisão factual, segurança clínica ou prontidão para uso clínico rotineiro.

Os resultados deste estudo são consistentes com avaliações anteriores de informações médicas geradas por IA, que relataram variabilidade substancial entre modelos linguísticos grandes (LLMs) e uma frequente desconexão entre legibilidade e qualidade da informação26,27,29. Estudos anteriores em múltiplos domínios de doenças mostraram que materiais educacionais para pacientes gerados por LLMs frequentemente excedem os níveis de leitura recomendados e que modelos que produzem textos mais legíveis nem sempre fornecem informações mais completas ou de maior qualidade26,30. Os achados na educação sobre TN apoiam essa observação. O GPT-5 gerou as respostas mais linguisticamente complexas, mas obteve as pontuações mais altas no PEMAT e no GQS, enquanto o Wenxin Yiyan produziu textos mais legíveis, porém com adequação educacional e qualidade geral mais baixas segundo a avaliação de especialistas. Além disso, a legibilidade variou entre domínios temáticos, sendo que os tópicos sobre prevenção e reabilitação e sobre etiologia e fatores de risco geralmente apresentaram maior complexidade linguística, sugerindo que tanto as características do modelo quanto a complexidade do tema influenciam a dificuldade de leitura31.

A aparente compensação entre legibilidade e qualidade da informação é consistente com os constructos distintos medidos pelos instrumentos de avaliação. As fórmulas de legibilidade avaliam principalmente características linguísticas de superfície, como comprimento das frases e complexidade lexical, enquanto o PEMAT e o GQS avaliam atributos de ordem superior, incluindo organização da informação, completude, clareza das explicações e capacidade de ação32. Para a educação em TN, respostas de alta qualidade frequentemente incluem discussões sobre sintomas de alerta, diagnóstico diferencial, manejo farmacológico e efeitos adversos, opções intervencionais e cirúrgicas e estratégias individualizadas de reabilitação33. Esse conteúdo clinicamente abrangente inevitavelmente aumenta a densidade terminológica e a complexidade sintática, resultando em escores mais altos de legibilidade e maior qualidade educacional avaliada por especialistas. É importante ressaltar que esses achados não devem ser interpretados como sugestão de que uma linguagem mais complexa seja preferível. Pelo contrário, indicam que os LLMs atuais frequentemente melhoram a completude da informação à custa da acessibilidade linguística. O desenvolvimento futuro de sistemas de educação do paciente deve, portanto, focar na manutenção da precisão médica enquanto simplifica a linguagem por meio de revisão em linguagem simples, apresentação estruturada dos pontos principais, explicação da terminologia técnica e orientações claras e acionáveis, apropriadas para pacientes com diferentes níveis de alfabetização em saúde11,34,35.

A análise de correlação reforça ainda mais a distinção entre legibilidade e qualidade educacional. A maioria dos índices de legibilidade baseados no nível escolar demonstrou associações positivas fracas a moderadas tanto com o PEMAT quanto com o GQS, enquanto o FRES apresentou a relação inversa esperada, pois pontuações mais altas no FRES indicam maior facilidade de leitura. Esses achados não implicam que uma complexidade linguística maior seja desejável; ao contrário, sugerem que os modelos linguísticos grandes atuais frequentemente alcançam uma completude informacional maior à custa da acessibilidade34. Assim, o desenvolvimento da educação do paciente assistida por IA deve priorizar a precisão e completude médicas, incorporando edição em linguagem simples, apresentação estruturada dos pontos principais, explicações claras de terminologias técnicas e recomendações acionáveis adaptadas a pacientes com diferentes níveis de alfabetização em saúde11,35.

Uma descoberta metodológica adicional foi o comportamento distinto do índice LW em comparação com as outras medidas de legibilidade. Diferentemente de ARI, FKGL, GFOG, CL e SMOG, LW seguiu um padrão mais semelhante ao de FRES, refletindo diferenças na forma como as fórmulas de legibilidade operacionalizam a complexidade textual36. Como LW foi originalmente desenvolvido para manuais técnicos e enfatiza a estrutura amostrada das sentenças e a classificação das palavras, em vez das características gerais de sentenças ou sílabas, ele pode responder de maneira diferente a textos médicos gerados por IA que combinam declarações concisas com passagens explicativas mais longas e distribuições irregulares de terminologia técnica37,38. Esses achados reforçam a importância de um quadro avaliativo com múltiplas métricas, já que nenhum único índice de legibilidade capta adequadamente todas as dimensões da complexidade textual. Em consonância com estudos anteriores sobre informações de saúde geradas por IA, a legibilidade geral deve, portanto, ser interpretada com base em evidências convergentes de vários índices complementares, em vez de qualquer medida isolada39.

A categoria de conteúdo também influenciou a legibilidade. Tópicos sobre prevenção, reabilitação e etiologia e fatores de risco geralmente produziram textos com maior dificuldade de leitura do que o conhecimento básico sobre doenças, provavelmente porque esses temas exigem recomendações condicionais, explicações mecanicistas e terminologia mais especializada40,41. Em contraste, o conhecimento básico sobre doenças é principalmente baseado em definições e pode ser transmitido em linguagem mais simples42. Apesar dessas diferenças, o PEMAT e o GQS permaneceram relativamente consistentes entre os domínios temáticos, sugerindo que a adequação educacional avaliada por especialistas e a qualidade geral da informação foram mantidas em diferentes tipos de perguntas feitas pelos pacientes35,43.

Essas descobertas têm várias implicações para a prática clínica e o desenvolvimento futuro de modelos linguísticos grandes (LLMs). À medida que os pacientes utilizam cada vez mais LLMs para obter informações antes ou após consultas médicas, o conteúdo gerado por IA deve complementar, e não substituir, o aconselhamento feito pelo clínico, especialmente no que diz respeito à segurança medicamentosa, indicações para tratamentos intervencionistas ou cirúrgicos e reconhecimento de sintomas de alerta que exigem avaliação urgente44. As organizações de saúde podem se beneficiar ao fornecer recursos educacionais em linguagem simples e revisados por especialistas, utilizando LLMs como ferramentas de redação ou apoio à decisão, e não como sistemas autônomos de educação ao paciente. Modelos futuros devem incorporar estratégias de geração com foco na legibilidade, relatórios transparentes sobre versões do modelo e datas de geração, comunicação explícita de incertezas e procedimentos de governança, incluindo revisão por clínicos, verificação de precisão factual, triagem de alucinações, verificações de segurança medicamentosa, orientações sobre sinais de alerta e testes de compreensão pelo paciente antes da implementação clínica26,44,45.

Este estudo apresenta várias limitações. As saídas dos modelos foram coletadas de interfaces web de acesso público em uma única data, e atualizações subsequentes dos modelos, alterações nas interfaces, prompts ocultos do sistema ou configurações padrão de geração podem afetar a reprodutibilidade. O conjunto de 20 perguntas foi desenvolvido por especialistas clínicos, em vez de ser derivado de registros de buscas de pacientes ou entrevistas formais com pacientes, prática que pode introduzir viés de seleção. Além disso, o estudo baseou-se em avaliações do PEMAT e do GQS realizadas por especialistas e não avaliou a compreensão, confiança, satisfação, comportamentos relacionados à saúde ou desfechos clínicos dos pacientes. Fórmulas de legibilidade, PEMAT e GQS também não avaliam diretamente a precisão factual, o risco de alucinações, a exatidão das citações, a completude das contraindicações ou a segurança clínica. Consequentemente, esses achados devem ser interpretados como uma análise transversal de referência baseada em avaliação por especialistas, e não como evidência de que qualquer material gerado por modelos de linguagem grandes (LLM) esteja pronto para uso clínico rotineiro. Estudos futuros devem incluir saídas arquivadas dos modelos, metadados detalhados dos modelos, avaliações multilíngues, conjuntos maiores de perguntas, auditorias formais de segurança, avaliações de precisão factual e medidas de desfechos centradas no paciente antes que materiais educacionais gerados por LLM sejam considerados para implementação clínica.

Neste estudo transversal de referência avaliado por especialistas, modelos de linguagem grandes de acesso público diferiram substancialmente na legibilidade, adequação educacional e qualidade geral das informações dos materiais educativos para pacientes com neuralgia do trigêmeo. O GPT-5 obteve as pontuações mais altas nos critérios PEMAT e GQS avaliados por especialistas, mas também gerou as respostas mais complexas do ponto de vista linguístico, destacando que legibilidade e qualidade educacional avaliada por especialistas representam dimensões relacionadas, porém distintas, da educação do paciente. Embora alguns modelos tenham produzido conteúdos mais legíveis, isso não se traduziu necessariamente em maior adequação educacional ou qualidade geral das informações. Como este estudo não avaliou a precisão factual por meio de uma auditoria de segurança dedicada, o risco de alucinações, a exatidão das citações, a compreensão do paciente, confiança, satisfação, comportamentos relacionados à saúde ou desfechos clínicos, os resultados devem ser interpretados como uma análise de referência avaliada por especialistas, e não como evidência de prontidão clínica. Estudos futuros devem integrar revisão por especialistas, avaliações formais de segurança e precisão factual, e avaliações centradas no paciente, para apoiar o uso seguro e eficaz de materiais gerados por LLM na educação do paciente.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não possuem interesses concorrentes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta pesquisa não recebeu nenhuma bolsa específica de qualquer agência de fomento nos setores público, comercial ou sem fins lucrativos. Os autores agradecem aos colegas clínicos que forneceram feedback sobre o conjunto de perguntas sobre neuralgia do trigêmeo e auxiliaram no aprimoramento da estrutura de avaliação. Agradecemos também a todos os colaboradores que apoiaram a preparação e revisão do manuscrito.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Plataforma de chat DeepSeekDeepSeekhttps://chat.deepseek.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Plataforma de chat DoubaoDoubaohttps://www.doubao.com/chat/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
GPT 5 OpenAINão aplicávelInterface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Software R, versão 4.4.3Fundação R para Computação EstatísticaNão aplicávelAnálise estatística e visualização
Calculadora online de legibilidade Formulas de LegibilidadeFormulas de LegibilidadeNão aplicávelFerramenta online utilizada para calcular índices de legibilidade
Plataforma de chat Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas
Plataforma de chat Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interface pública de modelo de linguagem de grande porte utilizada para gerar respostas

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Modelos de Linguagem de Grande EscalaAvalia o de LegibilidadeQualidade EducacionalAvalia o PEMATGlobal Quality ScoreQualidade da Informa o de Sa deBenchmarking de ModelosCompreens o do Paciente

Artigos relacionados