$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo avaliou sistematicamente os efeitos de modelos de linguagem grandes (LLMs) e de diferentes categorias de conteúdo educacional em saúde sobre a legibilidade e a qualidade dos textos gerados. Primeiro, comparamos o desempenho de cinco LLMs — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5 — em relação à adequação para educação do paciente, qualidade geral da informação e múltiplas métricas de legibilidade, incluindo o escore PEMAT, GQS e índices de legibilidade estabelecidos (ARI, FRES, GFOG, FKGL, CL, SMOG e LW). Em segundo lugar, examinamos as mesmas medidas de resultado em cinco domínios temáticos do conteúdo educacional em saúde: conhecimento básico sobre doenças, etiologia e fatores de risco, diagnóstico, tratamento e prevenção e reabilitação. Ao integrar essas duas perspectivas analíticas, exploramos ainda como o tipo de modelo e a categoria de conteúdo influenciam conjuntamente a qualidade e a legibilidade do texto, identificando assim padrões sistemáticos nos materiais educacionais para pacientes gerados por LLMs.
Análise de legibilidade entre diferentes modelos grandes de linguagem
Sete índices de legibilidade estabelecidos foram utilizados para comparar sistematicamente a complexidade linguística dos textos relacionados à neuralgia do trigêmeo gerados por cinco modelos linguísticos grandes: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5. Os resultados gerais são resumidos na Tabela 4, e as distribuições das métricas individuais de legibilidade são apresentadas na Figura 1A–G. Diferenças estatisticamente significativas foram observadas entre os cinco modelos para todos os índices de legibilidade, com P < 0,001 para cada um.
O GPT-5 apresentou os valores medianos mais altos para ARI, GFOG, FKGL, CL e SMOG e o FRES mais baixo, indicando que gerou textos com estruturas de frases mais longas, vocabulário mais complexo e maior carga de leitura geral (Figura 1A–G). Em contraste, o Wenxin Yiyan demonstrou a menor complexidade linguística. Seus valores medianos de ARI, GFOG, FKGL, CL e SMOG foram os mais baixos entre os cinco modelos, enquanto seu FRES foi o mais alto.
Doubao, DeepSeek e Tongyi Qianwen demonstraram níveis intermediários de legibilidade entre o GPT-5 e o Wenxin Yiyan. Doubao e DeepSeek apresentaram desempenho comparável nos índices de nível escolar, incluindo ARI, GFOG, FKGL e CL, e ambos apresentaram valores significativamente mais altos do que o Wenxin Yiyan, com todos os P < 0,05. Esses resultados indicam uma carga de leitura geral semelhante para Doubao e DeepSeek, com maior complexidade linguística do que o Wenxin Yiyan.
O Tongyi Qianwen geralmente apresentou valores entre os do Doubao/DeepSeek e do GPT-5 na maioria dos índices de legibilidade. Notavelmente, sua pontuação CL foi mais próxima à do GPT-5, sugerindo uma complexidade linguística ligeiramente maior do que a do Doubao e do DeepSeek, ainda que permanecendo menos complexa que a do GPT-5. O índice LW exibiu um padrão de distribuição distinto dos demais indicadores de legibilidade. O Wenxin Yiyan obteve a pontuação LW mais alta (60,00), seguido pelo Tongyi Qianwen, DeepSeek e Doubao, enquanto o GPT-5 apresentou a pontuação LW mais baixa (46,50). Essa discrepância reflete diferenças na forma como as fórmulas individuais de legibilidade ponderam o comprimento das frases e a dificuldade das palavras (Figura 1G).
No geral, foram observadas diferenças substanciais na complexidade linguística entre os cinco grandes modelos de linguagem. O GPT-5 gerou o texto mais complexo do ponto de vista linguístico, o Wenxin Yiyan produziu o conteúdo mais legível, e os modelos restantes exibiram níveis intermediários de legibilidade, embora diferenças estruturais tenham sido evidentes.
Comparação da adequação da educação do paciente e da qualidade geral entre modelos de linguagem grandes
Foram observadas diferenças significativas na adequação dos materiais para educação do paciente, conforme avaliado pelo PEMAT, entre os cinco modelos de linguagem (Figura 1H; Tabela 4), com todos os valores de P < 0,001. O GPT-5 obteve a pontuação mais alta no PEMAT segundo avaliação de especialistas (9,40 ± 1,90), indicando maior adequação educacional dentro da estrutura atual de avaliação comparativa. No entanto, esse resultado não deve ser interpretado como evidência de que os materiais gerados pelo GPT-5 melhorem a compreensão real do paciente, satisfação, confiança, comportamentos relacionados à saúde ou desfechos clínicos.
O DeepSeek obteve um escore PEMAT intermediário (6,80 ± 1,06), com uma distribuição de escores relativamente compacta, sugerindo desempenho consistente na geração de materiais educativos para pacientes. Contudo, sua adequação educacional geral permaneceu significativamente inferior à do GPT-5 (P < 0,001). O Doubao, o Tongyi Qianwen e o Wenxin Yiyan apresentaram escores PEMAT mais baixos (5,35 ± 1,04, 5,65 ± 1,09 e 5,35 ± 0,93, respectivamente). Nenhuma diferença significativa foi observada entre esses três modelos, e todos tiveram desempenho significativamente pior em comparação com o DeepSeek e o GPT-5 (todos P < 0,01). Esses achados indicam adequação educacional comparável, porém limitada, entre esses modelos, especialmente em relação à clareza instrucional, organização linguística e facilidade de compreensão.
Um padrão semelhante foi observado para a qualidade geral das informações, conforme avaliado pelo GQS (Figura 1I). Foram identificadas diferenças estatisticamente significativas entre os cinco modelos, com todos os P < 0,001. O GPT-5 obteve a pontuação GQS mais alta (4,00 ± 0,65). Suas pontuações concentraram-se na faixa de 4–5, com variabilidade limitada, indicando desempenho consistentemente alto na coerência do conteúdo, completude estrutural e utilidade prática.
O DeepSeek e o Doubao seguiram, com pontuações GQS de 3,35 ± 0,59 e 3,40 ± 0,50, respectivamente. Suas distribuições de pontuação estavam centradas entre 3 e 4, sugerindo qualidade moderada da informação e confiabilidade razoável. Em contraste, o Tongyi Qianwen e o Wenxin Yiyan obtiveram as pontuações GQS mais baixas (2,50 ± 0,51 e 2,20 ± 0,52, respectivamente). Suas distribuições foram inclinadas para a extremidade inferior da escala, indicando limitações na precisão das informações, rigor estrutural e profundidade do conteúdo, o que pode reduzir sua utilidade para a educação do paciente.
No geral, o GPT-5 obteve as pontuações mais altas atribuídas por especialistas para PEMAT e GQS neste conjunto de dados, enquanto o DeepSeek e o Doubao demonstraram desempenho intermediário. O Tongyi Qianwen e o Wenxin Yiyan receberam classificações mais baixas de GQS. Esses resultados representam avaliações de referência feitas por especialistas e não devem ser interpretados como evidência de prontidão clínica ou eficácia em nível de paciente.
Comparação da legibilidade, adequação à educação do paciente e qualidade geral entre categorias de conteúdo educativo em saúde
A análise por categoria de conteúdo revelou diferenças significativas na legibilidade entre os cinco temas de educação em saúde (Tabela 5). Para o FRES, observaram-se diferenças estatisticamente significativas entre as categorias temáticas (P = 0,004). Valores mais altos de FRES indicam maior facilidade de leitura. Os textos sobre conhecimentos básicos sobre doenças foram os mais legíveis (mediana = 28,50), seguidos pelos conteúdos sobre diagnóstico (mediana = 16,00), etiologia e fatores de risco (mediana = 12,50) e conteúdos relacionados ao tratamento (mediana = 11,50). Em contraste, os textos sobre prevenção e reabilitação apresentaram a menor legibilidade (mediana de FRES = 1,00), indicando a maior dificuldade de leitura.
Padrões semelhantes foram observados nos outros índices de legibilidade. GFOG e FKGL diferiram significativamente entre as categorias temáticas (P = 0,002 e P = 0,036, respectivamente), com ambos os índices indicando níveis de escolaridade mais altos para os conteúdos sobre etiologia e fatores de risco e sobre prevenção e reabilitação. O índice SMOG também sugeriu que os textos sobre etiologia e fatores de risco continham uma proporção maior de palavras com múltiplas sílabas (P = 0,039). As maiores diferenças foram observadas para CL (P < 0,001). Os textos sobre prevenção e reabilitação tinham as frases mais longas (mediana = 21,01), aumentando substancialmente a dificuldade de leitura, enquanto os textos sobre conhecimentos básicos da doença tinham as frases mais curtas (mediana = 14,88), correspondendo à menor carga de leitura. Não foram observadas diferenças significativas entre as categorias de conteúdo para ARI ou LW.
Não foram identificadas diferenças estatisticamente significativas na adequação educacional para pacientes entre as cinco categorias de conteúdo com base nas pontuações do PEMAT (P = 0,252). As pontuações médias do PEMAT variaram de 5,90 a 7,20, indicando que, apesar das diferenças acentuadas na complexidade linguística, a adequação educacional permaneceu relativamente consistente entre os temas. Da mesma forma, a qualidade geral da informação, avaliada pelo GQS, não diferiu significativamente entre as categorias de conteúdo (P = 0,822). Os valores médios do GQS variaram de 2,95 a 3,25, indicando que a qualidade geral da informação foi relativamente estável entre os temas de conteúdo.
No geral, foram observadas diferenças substanciais na legibilidade entre os temas de educação em saúde, sendo os conteúdos sobre etiologia e fatores de risco e sobre prevenção e reabilitação os que apresentaram maior dificuldade de leitura, enquanto os conteúdos sobre conhecimentos básicos da doença foram os mais legíveis. Em contraste, a adequação da educação do paciente e a qualidade geral das informações permaneceram relativamente consistentes entre as categorias de conteúdo.
Análise de correlação entre legibilidade, adequação à educação do paciente e qualidade geral
A matriz de correlação na Figura 2 mostra associações consistentes e robustas entre os índices de legibilidade, indicando forte consistência interna. A maioria das métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, exibiu correlações positivas moderadas a fortes entre si, com coeficientes de correlação variando de 0,64 a 0,97 (todos P < 0,001). Esses resultados reforçam a natureza complementar desses índices na avaliação da complexidade linguística. Em contraste, o FRES apresentou correlações negativas significativas com múltiplas métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação absolutos superiores a 0,70 (todos P < 0,001). Esse padrão reflete a direção inversa da pontuação do FRES, em que pontuações mais altas indicam maior legibilidade. O índice LW também demonstrou correlações negativas significativas com outros índices de legibilidade, incluindo ARI, FKGL, GFOG e SMOG, com coeficientes de correlação absolutos variando de 0,75 a 0,90 (todos P < 0,001). Por outro lado, LW apresentou correlação positiva com FRES (coeficiente de correlação = 0,69, P < 0,001).
Associações claras também foram observadas entre os índices de legibilidade e a qualidade geral da informação, conforme medido pelo GQS. O GQS demonstrou correlações positivas fracas a moderadas com a maioria das métricas de legibilidade, incluindo ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação variando de 0,326 a 0,391 (todos P < 0,001). Esses achados sugerem que uma maior complexidade linguística estava associada a uma qualidade da informação mais alta segundo avaliação de especialistas. Por outro lado, o GQS apresentou correlação negativa moderada com o FRES (coeficiente de correlação = −0,408, P < 0,001), indicando que textos que exigem um nível de leitura mais elevado geralmente receberam pontuações mais altas no GQS. O GQS também mostrou uma correlação negativa moderada com LW (coeficiente de correlação = −0,421, P < 0,001).
As associações entre legibilidade e adequação educacional para pacientes, avaliadas por meio do PEMAT, foram geralmente mais fracas, mas consistentes em direção. Os escores do PEMAT exibiram correlações positivas fracas com ARI, GFOG, FKGL, CL e SMOG, com coeficientes de correlação variando de 0,305 a 0,434 (todos P < 0,01). Em contraste, os escores do PEMAT correlacionaram-se negativamente e de forma fraca com FRES e LW, com coeficientes de correlação absolutos de 0,432 e 0,320, respectivamente (ambos P < 0,01). Esses achados sugerem que, dentro deste conjunto de dados, uma maior complexidade linguística esteve associada a uma adequação educacional ligeiramente mais alta segundo avaliação de especialistas, embora a força dessas associações tenha sido limitada.
Importante, uma correlação positiva moderada foi observada entre as pontuações do PEMAT e do GQS (coeficiente de correlação = 0,645, P < 0,001). Essa foi a associação mais forte observada entre os domínios de avaliação, indicando que respostas com maior adequação educacional também tenderam a receber classificações mais altas quanto à qualidade geral das informações.
DISPONIBILIDADE DE DADOS:
O conjunto completo de dados que sustenta este estudo é fornecido como material suplementar. Arquivo Suplementar 1 contém a lista completa das perguntas padronizadas, instruções e as 100 respostas geradas por modelos linguísticos grandes (LLM) arquivadas. Tabela Suplementar 2 contém as planilhas de pontuação PEMAT e GQS pelos especialistas, incluindo as classificações PEMAT por item quando disponíveis, pontuações totais do PEMAT, pontuações do GQS, informações de comparação entre avaliadores e registros de adjudicação quando aplicável. As pontuações de legibilidade, os dados brutos das figuras e o código de análise em R são fornecidos como Arquivo Suplementar 2. Como as saídas dos LLMs podem mudar ao longo do tempo devido a atualizações de modelos, alterações de interface e modificações em nível da plataforma, as saídas arquivadas, e não as respostas regeneradas, devem ser utilizadas para verificação e análise secundária.

Figura 1: Comparação da legibilidade, adequação para educação do paciente e qualidade geral da informação entre cinco modelos de linguagem grandes. (A–G) Este painel apresenta os índices de legibilidade: Índice Automatizado de Legibilidade (ARI), Escore de Facilidade de Leitura de Flesch (FRES), Índice de Neblina de Gunning (GFOG), Nível de Grau Flesch-Kincaid (FKGL), Índice Coleman-Liau (CL), Medida Simples de Gobbledygook (SMOG) e Fórmula Linsear Write (LW). (H) Este painel mostra os escores totais do PEMAT, e o painel (I) mostra os Escores Globais de Qualidade (GQS). Em cada gráfico de caixa, a linha central representa a mediana, a caixa indica a amplitude interquartil (IQR), os bigodes estendem-se até 1,5 × IQR, e os pontos além dos bigodes representam valores atípicos. Abreviações: ARI = Índice Automatizado de Legibilidade; FRES = Escore de Facilidade de Leitura de Flesch; GFOG = Índice de Neblina de Gunning; FKGL = Nível de Grau Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simples de Gobbledygook; LW = Linsear Write; PEMAT = Ferramenta de Avaliação de Materiais Educacionais para Pacientes para Compreensibilidade e Capacidade de Ação, formato imprimível; Escore Global de Qualidade = GQS. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Matriz de correlação de Spearman entre os índices de legibilidade, adequação para educação do paciente e qualidade geral da informação em todas as respostas geradas pelo modelo. A matriz apresenta os coeficientes de correlação de Spearman para as associações aos pares entre ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT e GQS. Abreviações: ARI = Índice Automatizado de Legibilidade; FRES = Escore de Facilidade de Leitura de Flesch; GFOG = Índice Fog de Gunning; FKGL = Nível de Escolaridade Flesch-Kincaid; CL = Índice Coleman-Liau; SMOG = Medida Simples de Gobbledygook; LW = Linsear Write; PEMAT = Ferramenta de Avaliação de Materiais de Educação do Paciente; GQS = Escore Global de Qualidade. Clique aqui para visualizar uma versão maior desta figura.
Tabela 1: Lista de 20 perguntas relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.
Tabela 2: Ferramentas, fórmulas e descrições de legibilidade. Clique aqui para baixar este arquivo.
Tabela 3: Critérios de qualidade da Pontuação Global de Qualidade (GQS). Clique aqui para baixar este arquivo.
Tabela 4: Resultados da análise de diferentes modelos de linguagem grandes para as perguntas mais comuns relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.
Tabela 5: Resultados da análise em diferentes dimensões para as perguntas mais comuns relacionadas à neuralgia do trigêmeo. Clique aqui para baixar este arquivo.
Tabela Suplementar 1: Pontuações de legibilidade das respostas geradas pelos cinco modelos de linguagem grandes em todos os índices de legibilidade avaliados. Clique aqui para baixar este arquivo.
Tabela Suplementar 2: Avaliações por especialistas da adequação da educação do paciente (PEMAT) e da qualidade geral da informação (GQS) para as respostas geradas pelos cinco modelos linguísticos grandes. Clique aqui para baixar este arquivo.
Arquivo Suplementar 1: Perguntas padronizadas sobre neuralgia do trigêmeo e respostas completas geradas pelos cinco grandes modelos de linguagem. Clique aqui para baixar este arquivo.
Arquivo Suplementar 2: Scripts R e dados brutos utilizados nas análises estatísticas e na geração de figuras. Clique aqui para baixar este arquivo.