本文介绍了一种系统评估大型语言模型生成的三叉神经痛患者信息在可读性、教育适用性和质量方面的方案,旨在为模型性能提供基准,并指导面向患者的沟通。
研究文章
本文介绍了一种系统评估大型语言模型生成的三叉神经痛患者信息在可读性、教育适用性和质量方面的方案,旨在为模型性能提供基准,并指导面向患者的沟通。
大型语言模型(LLMs)在患者健康教育中的应用日益广泛,但针对三叉神经痛(TN)的LLM生成内容的可读性与教育质量尚未得到充分评估。本项横断面基准研究比较了五个公开可用的LLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen和GPT-5)生成的TN教育内容。研究采用标准化提示词,向每个模型提出20个关于TN的常见问题,涵盖疾病基础知识、病因/危险因素、诊断、治疗以及预防/康复等方面。通过七个公认的可读性指数评估内容的可读性,使用患者教育材料评估工具(PEMAT)评估教育适宜性(包括可理解性与可操作性),并采用全球质量评分(GQS)评估整体信息质量。两名临床专家独立评估所有回答,分歧由资深仲裁者裁决。统计分析用于比较各模型的表现、主题差异以及各项评价指标之间的相关性。在可读性、PEMAT评分和GQS评分方面,各模型之间存在显著差异。GPT-5生成的回答语言复杂度最高,但在教育适宜性和信息质量方面得分最高。相比之下,Wenxin Yiyan生成的内容最易读,但在PEMAT和GQS上的得分普遍较低。内容类别影响可读性,其中预防/康复及病因/危险因素类主题更难阅读,而PEMAT和GQS在不同主题间的得分相对稳定。可读性指数之间表现出高度的内部一致性,并与PEMAT和GQS呈弱至中等程度的正相关,而PEMAT与GQS之间呈中等程度正相关。研究结果表明,模型选择会影响专家评定的教育适宜性和整体信息质量,而主题复杂性主要影响可读性。由于本研究未评估患者的理解程度、满意度、信任度、健康结局、事实准确性及临床安全性,因此这些结果应视为专家评定的基准分析,而非临床应用准备就绪的证据。
三叉神经痛(TN)是一种神经病理性疼痛综合征,其特征是反复发作的单侧、短暂且极为剧烈的面部疼痛,通常被描述为电击样或刺痛样。根据《国际头痛障碍分类》第三版(ICHD-3),疼痛通常局限于三叉神经的一个或多个分支分布区域,疼痛强度常难以忍受,并可由无害性刺激诱发,例如轻触、洗脸、刷牙、说话或咀嚼。发作具有突然起始和 abrupt 中止的特点,持续时间从数秒的几分之一到数分钟不等1,2。尽管三叉神经痛通常不危及生命,但其剧烈且不可预测的疼痛会严重干扰进食、言语、睡眠和情绪调节等基本日常活动,导致显著的心理社会负担并降低生活质量。系统综述的证据表明,与一般人群相比,三叉神经痛患者罹患抑郁症、焦虑症和睡眠障碍的风险显著升高3,4。在大规模队列研究中,约35–55%的三叉神经痛患者表现出具有临床意义的焦虑或抑郁症状,且疼痛灾难化现象高度普遍,提示慢性重度疼痛、失眠与情感障碍之间存在双向交互作用5,6。流行病学估计显示,三叉神经痛在一般人群中的患病率约为0.03%至0.3%,女性和老年人群中发病率较高,且在不同地理区域、种族群体和年龄层之间存在显著差异7,8。在人口众多的国家(如中国和印度),随着人口迅速老龄化,受三叉神经痛影响的个体数量持续增加,给医疗系统带来日益加重的负担,凸显了对更有效、可扩展且基于数据的疾病评估与管理方法的迫切需求8,9。
TN 可分为经典型、继发型和特发型亚型,越来越多的证据表明,这些类型在病因机制和治疗策略上存在显著差异1,10。目前的研究表明,三叉神经根入脑区的神经血管压迫相关结构改变、外周神经的过度兴奋以及中枢疼痛调节功能的异常共同参与了该疾病的发病机制11,12。临床指南推荐卡马西平和奥卡西平作为一线治疗药物,当药物治疗无效或耐受性差时,则考虑采用手术或介入治疗10。尽管治疗手段不断进步,TN 仍表现为反复发作与缓解的病程,长期疼痛复发较为常见,实现永久缓解十分困难13。因此,长期随访和规范化的慢性病管理对于监测复发风险、治疗反应及并发症至关重要。纵向队列研究显示,在采用标准化管理策略(包括药物治疗、必要时的手术干预以及全面的随访)的情况下,约一半接受保守治疗的患者可在两年内实现总体疼痛负担降低 ≥50%,且疾病未必然进展14。这些发现凸显了持续的患者参与和有效的健康教育在长期疾病管理中的重要性。证据表明,对疾病病因、病理生理机制及治疗选择有更好理解的患者,更有可能积极参与并依从治疗方案,从而获得更优的治疗效果15。然而,传统的健康教育方式在覆盖范围和可扩展性方面往往受限。随着互联网的广泛普及,尤其是在线问答平台和社交媒体的兴起,患者越来越多地依赖数字渠道获取医学信息16,17。但个体健康素养的差异,以及获取、处理和理解基本健康信息以支持知情决策的能力参差不齐,构成了有效患者教育的主要障碍18。此外,在线健康信息质量良莠不齐,包括不准确或误导性内容,可能对患者的医疗决策和心理健康产生负面影响19。
人工智能(AI)技术,特别是近年来大语言模型(LLM)的快速发展,为医学科学传播和健康教育带来了新的机遇20。这些模型在大规模文本语料库上进行训练,能够通过自然语言交互生成结构清晰、逻辑连贯的回应21。以ChatGPT为代表的国际代表性系统,在医学问答、患者咨询和医学教育方面已展现出良好的应用潜力22,23。中国也涌现出多个功能类似的LLM,其用户覆盖范围和应用场景持续扩展24。尽管取得了上述进展,LLM在医学科普中的应用仍面临诸多挑战,包括训练数据的可靠性、更新频率、生成内容的科学准确性以及缺乏临床验证25。此外,不同模型在语言风格、可读性、逻辑结构和引文准确性方面的差异,可能直接影响患者对健康相关信息的理解和信任程度26。迄今为止,针对LLM在腱鞘炎相关健康教育中的系统性性能评估仍较为有限。
因此,本研究旨在系统评估并比较四种广泛使用的中文大语言模型(Doubao、DeepSeek、Wenxin Yiyan 和 Tongyi Qianwen)以及一种代表性国际大语言模型(ChatGPT)在回答与三叉神经痛(TN)相关的患者教育问题方面的表现。采用横断面研究设计,我们基于临床指南和患者常见关切构建了一套TN问题集,并对五个公开可用的大语言模型(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5)生成的回答进行评估。使用多种指标评估可读性,并采用患者教育材料评估工具(PEMAT)评估回答的可理解性和可操作性。整体信息质量则通过全球质量评分(GQS)进行评价。此外,我们分析了不同健康教育主题对这些评估指标及其相互关系的影响,旨在为临床健康传播中大语言模型的选择与优化提供循证依据。
本研究仅分析了人工智能生成的文本,未涉及人类受试者、动物、生物样本、医疗记录、可识别的个人信息或对临床护理的干预。因此,无需进行伦理审查和正式的知情同意。
研究设计
这项横断面研究评估了五种大语言模型(LLM)针对三叉神经痛常见问题所生成回答的可读性、质量及教育适用性。
常见三叉神经相关问题的识别
2025年11月25日,两位在疼痛医学领域具有丰富经验的临床专家独立审阅了三叉神经痛(TN)的现有临床指南,包括《国际头痛障碍分类第三版》(ICHD-3)、欧洲神经病学学会指南以及美国神经病学学会/欧洲神经学会联合会指南1,10,11。经过共识讨论后,他们整理出临床实践中常见的20个与三叉神经痛相关的问题。问题数量预先设定,旨在均衡覆盖五个预定义的主题领域,每个领域选取4个问题,同时确保模型生成的回答总数处于专家人工评分与验证可行的范围内。为提高可重复性,问题筛选过程遵循预设的基于领域的框架:专家首先在每个领域内确定候选问题,独立评估其临床相关性、以患者为中心的表述方式以及避免冗余,随后就每个领域最终的4个问题达成共识。最终的问题列表见表1和补充文件1。五个预定义的主题领域分别为疾病基础知识、病因与危险因素、诊断、治疗以及预防与康复。由于该问题集并非来源于患者搜索日志、在线搜索查询或正式的患者访谈,因此研究承认可能存在选择偏倚,此为本研究的一项局限性。
人工智能模型与数据收集流程
2025年11月25日,最终确定的一组包含20个与三叉神经相关的题目被提交至五个公开可访问的大语言模型(LLM)平台:Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5/ChatGPT。所有模型均通过其标准的公共网页聊天界面访问,未使用应用程序编程接口(API)访问。对于每个平台,均使用数据收集当日可获得的默认公开模型,且未对任何生成参数进行修改。由于公共网页界面未显示后端模型快照标识符、隐藏系统提示、温度、top-p、最大输出令牌数或其他生成参数,因此这些项目均记录为“在公共网页界面中未显示”。
所有模型的提示和响应语言均为英语。每个标准化提示仅包含逐字的英文问题,不附加任何针对特定模型的指令。每个问题均在新的独立聊天会话中单独提交,无先前对话历史、上传文件、插件、自定义指令或后续提示。标准化提示的完整列表及相应模型原始输出见补充文件1。模型元数据及数据收集设置汇总于补充表1。
可读性评估
使用在线可读性评估平台(http://readabilityformulas.com/)提供的多种成熟可读性公式,对大语言模型生成回答的可读性进行了评估。鉴于目前尚无普遍接受的可读性评估金标准,且与以往研究一致,本研究采用了一套广泛使用的可读性指标23,27。共选取了七个指标,以涵盖可读性的多个互补维度,包括句子长度、单词长度、音节数量、基于字符的复杂度、阅读难易度以及估计的年级水平,从而降低对单一公式的依赖。具体计算的指标包括:科尔曼-利亚乌指数(CL)、林斯尔书写公式(LW)、自动可读性指数(ARI)、SMOG可读性指数(SMOG)、冈宁雾数(GFOG)、弗莱施阅读易读性得分(FRES)以及弗莱施-金凯德年级水平(FKGL)。这些指标可估算文本的阅读难度或对应年级水平,为文本可读性提供定量衡量标准(表2)。
教育适宜性与信息质量的评估
采用患者教育材料评估工具(Patient Education Materials Assessment Tool, PEMAT)评估教育适宜性,该工具包含两个维度:可理解性和可操作性28。该工具共包含24个条目,其中16个用于评估可理解性,8个用于评估可操作性。每个条目采用二分法评分(0 = 未达到标准;1 = 达到标准),总分范围为0至24分,分数越高表示越适合用于患者教育。整体信息质量采用全球质量评分(Global Quality Score, GQS)27进行评估,GQS是一种广泛使用的五点Likert量表,用于评估医学信息的质量(表3)。
2025年11月25日,两名在三叉神经痛管理方面具有超过3年经验的临床专家使用两种评估工具对所有由人工智能生成的回答进行了评估。在评分前,所有由人工智能生成的回答均采用编码化的回答标识符进行匿名化处理,评审人员在进行PEMAT和GQS评估时对所使用的大型语言模型平台保持盲态。分歧由第三位高级专家解决,该专家裁定最终得分。采用Cohen kappa系数评估评分者间信度,kappa值>0.75表示信度极佳,0.40–0.75表示信度可接受,<0.40表示信度较差。PEMAT和GQS两项评估的Cohen kappa值均超过0.75,表明评分者间信度极佳。
统计学分析
所有统计分析均使用 R 软件(版本 4.4.3)进行。数据正态性通过 Shapiro-Wilk 检验和 Q-Q 图进行评估。符合正态分布的变量以均值 ± 标准差表示,并采用单因素方差分析(ANOVA)进行比较,必要时结合 Tukey 事后检验。不符合正态分布的变量以中位数和四分位距表示,并采用 Kruskal-Wallis 检验进行比较,随后使用 Dunn 事后检验,并对两两比较进行 Bonferroni 校正。可读性指数、PEMAT 评分与 GQS 值之间的相关性采用 Spearman 秩相关系数进行评估,并对多重检验应用 Benjamini-Hochberg 校正。双侧调整后 P 值 < 0.05 被认为具有统计学显著性。
本研究系统评估了大语言模型(LLMs)及不同类别的健康教育内容对生成文本可读性和质量的影响。首先,我们比较了五种大语言模型——Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5——在患者教育适宜性、整体信息质量以及多项可读性指标方面的表现,这些指标包括 PEMAT 评分、GQS 和既定的可读性指数(ARI、FRES、GFOG、FKGL、CL、SMOG 和 LW)。其次,我们在五个健康教育主题领域中考察了相同的结局指标:疾病基础知识、病因与危险因素、诊断、治疗以及预防与康复。通过整合这两种分析视角,我们进一步探讨了模型类型与内容类别如何共同影响文本质量和可读性,从而识别出大语言模型生成的患者教育材料中的系统性规律。
不同大语言模型的可读性分析
采用七种既定的可读性指数,系统比较了由五种大语言模型(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen 和 GPT-5)生成的三叉神经痛相关文本的语言复杂性。总体结果汇总如下 表4,各单项可读性指标的分布情况如下所示 图1A–G在五种模型的所有可读性指标中均观察到统计学上的显著差异,其中 P < 0.001,每个。
GPT-5 在 ARI、GFOG、FKGL、CL 和 SMOG 指标上表现出最高的中位数,而 FRES 最低,表明其生成的文本具有更长的句子结构、更复杂的词汇以及最高的整体阅读负担(图 1A–G)。相比之下,文心一言展现出最低的语言复杂性,其 ARI、GFOG、FKGL、CL 和 SMOG 的中位数在五种模型中均为最低,而 FRES 最高。
豆包、DeepSeek 和通义千问在可读性水平上介于 GPT-5 与文心一言之间。豆包和 DeepSeek 在年级水平指数(包括 ARI、GFOG、FKGL 和 CL)上的表现相当,且各项指标均显著高于文心一言,所有 P < 0.05。这些结果表明,豆包和 DeepSeek 的整体阅读负担相似,语言复杂度高于文心一言。
在大多数可读性指标中,通义千问的得分介于豆包/深度求索与GPT-5之间。值得注意的是,其CL得分更接近GPT-5,表明其语言复杂度略高于豆包和深度求索,但仍低于GPT-5。LW指数的分布模式与其他可读性指标不同。文心一言的LW得分最高(60.00),其次是通义千问、深度求索和豆包,而GPT-5的LW得分最低(46.50)。这一差异反映了不同可读性公式在句子长度和词汇难度权重上的差异(图1G)。
总体而言,五个大型语言模型在语言复杂性方面表现出显著差异。GPT-5 生成的文本语言复杂度最高,文心一言生成的内容可读性最强,其余模型的可读性处于中等水平,但结构上的差异明显。
大型语言模型在患者教育适宜性与整体质量方面的比较
使用 PEMAT 评估时,五个语言模型在患者教育适宜性方面表现出显著差异(图 1H;表 4),所有 P < 0.001。GPT-5 获得最高的专家评分 PEMAT 得分(9.40 ± 1.90),表明其在当前基准测试框架下具有更高的教育适宜性。然而,这一结果不应被解读为 GPT-5 生成的内容能够改善真实患者的理解程度、满意度、信任度、健康行为或临床结局的证据。
DeepSeek 的 PEMAT 得分为中等水平(6.80 ± 1.06),得分分布相对集中,表明其在生成患者教育材料方面表现较为稳定。然而,其整体教育适宜性仍显著低于 GPT-5(P < 0.001)。Doubao、Tongyi Qianwen 和 Wenxin Yiyan 的 PEMAT 得分较低(分别为 5.35 ± 1.04、5.65 ± 1.09 和 5.35 ± 0.93)。这三种模型之间的差异无统计学意义,且它们的表现均显著差于 DeepSeek 和 GPT-5(所有 P < 0.01)。这些结果表明,这些模型在教育适宜性方面表现相近但均有限,尤其在教学清晰度、语言组织和理解难易程度方面存在不足。
在整体信息质量方面也观察到了类似的模式,该评估基于GQS进行(图1I)。五种模型之间的差异具有统计学意义,所有 P < 0.001。GPT-5 获得了最高的 GQS 得分(4.00 ± 0.65),其得分主要集中于 4–5 范围内,变异性较小,表明其在内容连贯性、结构完整性和实际实用性方面表现 consistently 高水平。
DeepSeek 和 Doubao 紧随其后,GQS 评分分别为 3.35 ± 0.59 和 3.40 ± 0.50。它们的评分分布集中在 3 到 4 之间,表明信息质量中等,可靠性较为合理。相比之下,通义千问和文心一言的 GQS 评分最低(分别为 2.50 ± 0.51 和 2.20 ± 0.52)。它们的分布偏向量表的低端,表明在信息准确性、结构严谨性和内容深度方面存在局限性,可能降低其在患者教育中的实用性。
总体而言,在本数据集中,GPT-5 获得了专家评分中最高的 PEMAT 和 GQS 得分,而 DeepSeek 和 Doubao 表现出中等水平的性能。通义千问和文心一言的 GQS 评分较低。这些结果代表了专家评分的基准测试结果,不应被解读为临床可用性或患者层面有效性的证据。
不同健康教育内容类别在可读性、患者教育适用性及整体质量方面的比较
按内容类别分析显示,五种健康教育主题在可读性方面存在显著差异(表5)。就FRES而言,各主题类别之间的差异具有统计学意义(P = 0.004)。FRES值越高,表示可读性越佳。基础疾病知识类文本的可读性最高(中位数 = 28.50),其次为诊断相关内容(中位数 = 16.00)、病因与危险因素内容(中位数 = 12.50)以及治疗相关的内容(中位数 = 11.50)。相比之下,预防与康复类文本的可读性最低(FRES中位数 = 1.00),表明其阅读难度最大。
在其他可读性指标中也观察到了类似的模式。GFOG 和 FKGL 在不同主题类别之间存在显著差异(P = 0.002 和 P = 0.036),这两个指标均显示病因与危险因素以及预防与康复类内容的阅读年级水平更高。SMOG 指数同样表明,病因与危险因素类文本包含更多比例的多音节词(P = 0.039)。CL 的差异最为显著(P < 0.001)。预防与康复类文本的句子最长(中位数 = 21.01),显著增加了阅读难度;而基础疾病知识类文本的句子最短(中位数 = 14.88),对应最低的阅读负担。在 ARI 和 LW 指标上,各类内容之间未观察到显著差异。
根据PEMAT评分,五个内容类别在患者教育适宜性方面未发现具有统计学意义的差异(P = 0.252)。PEMAT平均得分范围为5.90至7.20,表明尽管语言复杂性存在明显差异,但各主题之间的教育适宜性相对一致。同样,根据GQS评估的整体信息质量在不同内容类别之间也无显著差异(P = 0.822)。GQS平均值范围为2.95至3.25,表明整体信息质量在各内容主题间相对稳定。
总体而言,不同健康教育主题在可读性方面存在显著差异,其中病因与危险因素内容以及预防与康复内容的阅读难度最大,而基本疾病知识内容的可读性最高。相比之下,患者教育的适宜性以及信息的整体质量在各类内容之间相对一致。
可读性、患者教育适宜性与总体质量之间的相关性分析
相关性矩阵在 图2 在可读性指数之间显示出一致且显著的关联性,表明具有较高的内部一致性。大多数可读性指标(包括ARI、GFOG、FKGL、CL和SMOG)彼此之间呈现中等至强的正相关关系,相关系数范围为0.64至0.97(均 P < 0.001)。这些发现进一步支持了这些指数在评估语言复杂性方面的互补性。相比之下,FRES 与多个可读性指标(包括 ARI、GFOG、FKGL、CL 和 SMOG)均呈现显著的负相关,其绝对相关系数大于 0.70(所有) P < 0.001)。该模式反映了FRES评分方向的逆向性,即得分越高,可读性越强。LW指数与其他可读性指数(包括ARI、FKGL、GFOG和SMOG)也表现出显著的负相关,其绝对相关系数范围为0.75至0.90(均 P < 0.001)。相反,LW 与 FRES 呈正相关(相关系数 = 0.69, P < 0.001).
可读性指数与GQS测量的整体信息质量之间也观察到明显的关联。GQS与大多数可读性指标(包括ARI、GFOG、FKGL、CL和SMOG)呈弱至中等程度的正相关,相关系数范围为0.326至0.391(所有P < 0.001)。这些结果表明,语言复杂性越高,专家评定的信息质量也越高。相反,GQS与FRES呈中等程度的负相关(相关系数 = −0.408,P < 0.001),表明需要更高阅读水平的文本通常获得更高的GQS评分。GQS还与LW呈中等负相关(相关系数 = −0.421,P < 0.001)。
使用 PEMAT 评估的可读性与患者教育适宜性之间的关联总体较弱,但方向一致。PEMAT 评分与 ARI、GFOG、FKGL、CL 和 SMOG 呈弱正相关,相关系数范围为 0.305 至 0.434(均 P < 0.01)。相比之下,PEMAT 评分与 FRES 和 LW 呈弱负相关,其绝对相关系数分别为 0.432 和 0.320(均 P < 0.01)。这些结果表明,在本数据集中,语言复杂性越高,专家评定的教育适宜性略高,但这些关联的强度有限。
重要的是,PEMAT 和 GQS 评分之间存在中等程度的正相关关系(相关系数 = 0.645,P < 0.001)。这是各评估领域之间观察到的最强关联,表明教育适宜性较高的回答往往也获得较高的整体信息质量评分。
数据可用性:
支持本研究的完整数据集已作为补充材料提供。补充文件1包含标准化问题、提示语以及100条存档的大型语言模型生成的回答。补充表2包含专家评估的PEMAT和GQS评分表,包括可获得的条目级PEMAT评分、总PEMAT得分、GQS得分、评分者比较信息以及适用时的裁决记录。可读性评分、图表源数据和R分析代码作为补充文件2提供。由于大型语言模型的输出可能因模型更新、界面变更和平台级修改而发生变化,因此应使用存档的输出结果而非重新生成的回答进行验证和二次分析。

图1五种大型语言模型在可读性、患者教育适用性及整体信息质量方面的比较 (A–G此面板 提供可读性指数:自动可读性指数(ARI)、弗莱施阅读难易度评分(FRES)、冈宁雾指数(GFOG)、弗莱施-金凯德年级水平(FKGL)、科尔曼-利亚乌指数(CL)、简易理解指数(SMOG)以及林斯尔书写公式(LW)。 (H) 该图展示了总PEMAT评分,以及图 (I) 显示全球质量评分(GQS)。每个箱线图中,中心线代表中位数,方框表示四分位距(IQR),须线延伸至1.5倍四分位距范围 × IQR,须线以外的点表示异常值。缩写:ARI = 自动可读性指数;FRES = 弗莱什阅读难易度评分;GFOG = 金宁雾指数;FKGL = 弗莱什-金凯德年级水平;CL = 科尔曼-利亚指数;SMOG = 简化版术语难懂度测量;LW = 林希尔写作指数;PEMAT = 患者教育材料可理解性与可操作性评估工具,可打印格式;Global Quality Score = 全球质量评分(GQS)。 请点击此处以查看此图的放大版本。

图2:所有模型生成回答中,可读性指数、患者教育适宜性与整体信息质量之间的Spearman相关性矩阵。该矩阵报告了ARI、FRES、GFOG、FKGL、CL、SMOG、LW、PEMAT和GQS之间两两关联的Spearman相关系数。缩写:ARI = 自动可读性指数(Automated Readability Index);FRES = Flesch阅读易度评分(Flesch Reading Ease Score);GFOG = Gunning Fog指数(Gunning Fog Index);FKGL = Flesch-Kincaid年级水平(Flesch-Kincaid Grade Level);CL = Coleman-Liau指数(Coleman-Liau Index);SMOG = 简易词汇量度(Simple Measure of Gobbledygook);LW = Linsear Write;PEMAT = 患者教育材料评估工具(Patient Education Materials Assessment Tool);GQS = 全球质量评分(Global Quality Score)。请点击此处查看本图的放大版本。
表1:与三叉神经痛相关的20个问题列表。 请点击此处下载该文件。
表2:可读性分析工具、公式及说明。 请点击此处下载该文件。
表3:全球质量评分(GQS)质量标准。 请点击此处下载该文件。
表4:针对三叉神经痛相关最常见问题的不同大语言模型分析结果。 请点击此处下载该文件。
表5:针对三叉神经痛最常见问题的多维度分析结果。 请点击此处下载该文件。
补充表 1:五个大型语言模型在所有评估的可读性指数下生成回答的可读性得分。 请点击此处下载该文件。
补充表2:五个大型语言模型生成回答的患者教育适宜性(PEMAT)和总体信息质量(GQS)专家评分。 请点击此处下载该文件。
补充文件1:三叉神经痛的标准化问题及五个大型语言模型生成的完整回答。 请点击此处下载该文件。
补充文件 2:用于统计分析和图表生成的 R 脚本及源数据。 请点击此处下载该文件。
这项横断面基准研究系统比较了由五种公开可用的大语言模型(LLMs)生成的三叉神经痛(TN)患者教育材料的可读性、教育适用性及整体信息质量。研究得出四个主要发现。第一,不同模型在可读性方面存在显著差异,其中GPT-5生成的回答语言复杂度最高,而文心一言生成的内容最易读。第二,可读性与专家评定的信息质量是两个不同的评估维度,尽管GPT-5的可读性较低,但其在患者教育材料评估工具(PEMAT)和总体质量评分(GQS)上得分最高。第三,内容主题影响可读性水平,预防、康复以及病因与风险因素类主题通常需要更高的阅读能力,而PEMAT和GQS在不同内容类别间的得分则相对稳定。最后,可读性指标表现出高度的内部一致性,相关性分析显示语言复杂度与PEMAT及GQS之间存在弱至中等程度的正相关关系,同时PEMAT与GQS之间也存在中等程度的正相关。综合来看,这些发现为评估大语言模型生成的三叉神经痛患者教育材料提供了基准,同时强调了在医学内容完整性与语言可及性之间取得平衡的必要性。需要特别指出的是,这些结果代表的是专家评分的基准评估结果,不应被解读为患者理解能力、事实准确性、临床安全性或常规临床应用准备度的证据。
本研究结果与既往对人工智能生成医学信息的评估一致,既往研究报道了不同大语言模型(LLMs)之间存在显著差异,且可读性与信息质量之间常存在脱节现象26,27,29。在多种疾病领域的既往研究中已表明,由大语言模型生成的患者教育材料通常超出推荐的阅读水平,且生成文本可读性最高的模型未必能提供最全面或质量最高的信息26,30。本研究在震颤麻痹(TN)教育领域的发现支持了这一观察结果。GPT-5生成的文本语言复杂度最高,但其PEMAT评分和GQS评分也最高;而文心一言生成的文本可读性更强,但其专家评定的教育适宜性和整体质量较低。此外,可读性在不同主题领域之间存在差异,其中预防与康复、病因与危险因素等主题通常表现出更高的语言复杂性,提示模型特性与主题复杂性均会影响阅读难度31。
可读性与信息质量之间看似存在的权衡关系,与评估工具所测量的不同构念相一致。可读性公式主要评估语言的表层特征,例如句子长度和词汇复杂性,而 PEMAT 和 GQS 则评估更高层次的属性,包括信息的组织性、完整性、解释的清晰度以及可操作性32。在三叉神经痛(TN)教育中,高质量的回答通常包含对警示性症状、鉴别诊断、药物治疗及其不良反应、介入性和手术治疗选择,以及个体化康复策略的讨论33。此类临床全面的内容不可避免地增加了术语密度和句法复杂性,从而导致更高的可读性评分(即更难阅读)以及更优的专家评定教育质量。重要的是,这些发现不应被解读为表明更复杂的语言更可取;相反,它们表明当前的大语言模型(LLM)在提升信息完整性的同时,往往牺牲了语言的易理解性。因此,未来患者教育系统的发展应着重于在保持医学准确性的前提下,通过使用简易语言修改、对关键点进行结构化呈现、解释专业术语,以及提供清晰且具可操作性的指导,来简化语言表达,以适应不同健康素养水平的患者需求11,34,35。
相关性分析进一步支持了可读性与教育质量之间的区别。大多数基于年级水平的可读性指数与 PEMAT 和 GQS 均呈现弱至中等程度的正相关关系,而 FRES 则表现出预期的负相关关系,因为较高的 FRES 分数表示文本更易于阅读。这些发现并不意味着更高的语言复杂性是可取的;相反,它们表明当前的大语言模型(LLM)往往以牺牲可及性为代价来实现更高的信息完整性34。因此,人工智能辅助患者教育工具的开发应优先确保医学内容的准确性和完整性,同时结合通俗语言编辑、关键信息的结构化呈现、对专业术语的清晰解释,以及针对不同健康素养水平患者量身定制的可操作建议11,35。
另一项方法学发现是,LW指数与其他可读性指标相比表现出明显不同的行为。与ARI、FKGL、GFOG、CL和SMOG不同,LW的变化模式更接近FRES,反映出不同可读性公式在文本复杂性操作化方式上的差异36。由于LW最初是为技术手册开发的,其重点在于抽样句子结构和词汇分类,而非整体句子长度或音节特征,因此它对人工智能生成的医学文本可能表现出不同的响应——这类文本通常将简洁陈述与较长的解释性段落结合,并且专业术语分布不均37,38。这些发现进一步强调了采用多指标评估框架的重要性,因为单一可读性指数无法充分涵盖文本复杂性的所有维度。与既往关于人工智能生成健康信息的研究一致,总体可读性应基于多个互补指数的收敛证据进行解读,而非依赖任一单一指标39。
内容类别也影响了文本的可读性。预防、康复以及病因和风险因素类主题通常产生的文本阅读难度较高,而基本疾病知识类主题的阅读难度相对较低,这可能是因为前者需要条件性建议、机制性解释以及更专业的术语40,41。相比之下,基本疾病知识主要基于定义,可用更简单的语言表达42。尽管存在这些差异,PEMAT 和 GQS 在不同主题领域中仍保持相对一致,表明专家评估的教育适宜性和整体信息质量在不同类型的患者问题中均得到了维持35,43。
这些发现对临床实践和未来大语言模型(LLM)的开发具有多方面意义。随着患者越来越多地在就医前后使用大语言模型获取信息,人工智能生成的内容应作为临床医生指导的补充,而非替代,尤其是在药物安全性、有创或手术治疗的适应证,以及需紧急评估的警示症状识别等方面44。医疗机构可从提供经专家审核、采用通俗语言的教育资源中获益,同时将大语言模型用作草拟工具或决策支持工具,而非完全自主的患者教育系统。未来的大语言模型应纳入可读性感知的生成策略,透明报告模型版本和生成日期,明确传达不确定性,并建立治理流程,包括临床医生审核、事实准确性验证、幻觉筛查、药物安全检查、警示症状指导以及患者理解能力测试,方可在临床实践中推广应用26,44,45。
本研究存在若干局限性。模型输出是在单一日期从公开可访问的网页界面收集的,后续的模型更新、界面变更、隐藏的系统提示或默认生成设置可能影响结果的可重复性。20个问题的集合由临床专家制定,而非来源于患者搜索日志或正式的患者访谈,这种做法可能引入选择偏倚。此外,本研究依赖专家对PEMAT和GQS的评分,未评估患者对内容的理解程度、信任度、满意度、健康行为或临床结局。可读性公式、PEMAT和GQS也无法直接评估事实准确性、幻觉风险、引文准确性、禁忌症描述的完整性或临床安全性。因此,应将这些发现解读为基于专家评分的横断面基准分析,而非证明任何大语言模型生成的内容已适用于常规临床使用。未来的研究应包括存档的模型输出、详细的模型元数据、多语言评估、更大规模的问题集、正式的安全审计、事实准确性评估以及以患者为中心的结局指标,方可考虑将大语言模型生成的教育材料用于临床实践。
在这项专家评分的横断面基准研究中,公开可用的大型语言模型在三叉神经痛患者教育材料的可读性、教育适用性以及整体信息质量方面存在显著差异。GPT-5 获得了最高的专家评分 PEMAT 和 GQS 得分,但其生成的回答语言复杂度也最高,这表明可读性与专家评定的教育质量代表了患者教育中相关但不同的两个维度。尽管某些模型生成的内容更具可读性,但这并不一定转化为更高的教育适用性或整体信息质量。由于本研究未通过专门的安全性审查来评估事实准确性,因此研究结果应被视为一项专家评分的基准分析,而非临床应用准备就绪的证据。未来的研究应整合专家评审、正式的安全性和事实准确性评估,以及以患者为中心的评价,以支持大型语言模型生成材料在患者教育中的安全有效使用。
作者声明不存在任何竞争利益。
本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。作者感谢提供三叉神经痛问题集反馈意见并协助完善评估框架的临床同行。我们还感谢所有支持稿件撰写和修订工作的贡献者。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| DeepSeek 聊天平台 | DeepSeek | https://chat.deepseek.com/ | 用于生成回复的公开大型语言模型接口 |
| 豆包聊天平台 | Doubao | https://www.doubao.com/chat/ | 用于生成回复的公开大型语言模型接口 |
| GPT 5 | OpenAI | 不适用 | 用于统计分析与可视化的工具 |
| R 软件,版本 4.4.3 | R 统计计算基金会 | 不适用 | 统计分析与可视化 |
| Readability Formulas 在线可读性计算器 | Readability Formulas | 不适用 | 用于计算可读性指数的在线工具 |
| 通义千问聊天平台 | Tongyi Qianwen | https://www.tongyi.com/ | 用于生成回复的公开大型语言模型接口 |
| 文心一言聊天平台 | Wenxin Yiyan | https://yiyan.baidu.com/ | 用于生成回复的公开大型语言模型接口 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可