연구 논문

삼차신경통에 대한 거대언어모델 환자 교육 자료의 가독성 및 품질: 단면 연구

DOI:

10.3791/70833

2026년 8월 21일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 논문에서는 거대 언어 모델(LLM)이 생성한 삼차신경통 환자 정보의 가독성, 교육적 적절성 및 품질을 체계적으로 평가하여 모델의 성능을 벤치마킹하고 환자 대상 커뮤니케이션의 지침을 제공하기 위한 프로토콜을 제시합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

대규모 언어 모델(LLM)이 환자 건강 교육에 점점 더 많이 사용되고 있으나, 삼차신경통(TN)에 대해 LLM이 생성한 정보의 가독성과 교육적 품질에 대한 평가는 여전히 부족한 실정입니다. 본 단면 벤치마킹 연구에서는 공개적으로 사용 가능한 5가지 LLM(Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, GPT-5)이 생성한 삼차신경통 교육 콘텐츠를 비교하였습니다. 기본 질환 지식, 원인/위험 요인, 진단, 치료, 예방/재활을 포괄하는 20가지의 빈번한 삼차신경통 관련 질문을 표준화된 프롬프트를 사용하여 각 모델에 제시하였습니다. 가독성은 7가지의 확립된 지표를 사용하여 평가하였고, 교육적 적합성은 환자 교육 자료의 이해도 및 실행 가능성 평가 도구(PEMAT)를 통해, 전반적인 정보 품질은 글로벌 품질 점수(GQS)를 통해 평가하였습니다. 두 명의 임상 전문가가 모든 답변을 독립적으로 평가하였으며, 의견 불일치는 상급 조정자가 해결하였습니다. 통계 분석을 통해 모델 간 성능, 주제별 차이 및 평가 지표 간의 상관관계를 비교하였습니다. 가독성, PEMAT 및 GQS 점수에서 모델 간의 유의미한 차이가 관찰되었습니다. GPT-5는 언어적으로 가장 복잡한 답변을 생성했으나, 교육적 적합성과 정보 품질 면에서는 가장 높은 등급을 받았습니다. 반면, Wenxin Yiyan은 가장 가독성이 좋은 텍스트를 생성했지만, 일반적으로 PEMAT 및 GQS 점수는 더 낮았습니다. 콘텐츠 범주가 가독성에 영향을 미쳤으며, 특히 예방/재활 및 원인/위험 요인 주제가 읽기 더 어려운 것으로 나타난 반면, PEMAT 및 GQS는 주제 전반에 걸쳐 비교적 일정하게 유지되었습니다. 가독성 지표는 강한 내부 일관성을 보였으며, PEMAT 및 GQS와는 약하거나 중간 정도의 양의 상관관계를 보인 반면, PEMAT와 GQS는 중간 정도의 양의 상관관계를 나타냈습니다. 이러한 결과는 모델 선택이 전문가가 평가한 교육적 적합성과 전반적인 정보 품질에 영향을 미치는 반면, 주제의 복잡성은 주로 가독성에 영향을 준다는 것을 시사합니다. 환자의 이해도, 만족도, 신뢰도, 건강 결과, 사실적 정확성 및 임상적 안전성은 평가되지 않았으므로, 본 결과는 임상적 준비 완료의 증거라기보다 전문가 평가 기반의 벤치마킹 분석으로 해석되어야 합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

삼차신경통(TN)은 일반적으로 전기 충격과 같거나 찌르는 듯한 양상으로 묘사되는, 일측성의 짧고 극심한 안면 통증이 반복적으로 발생하는 것이 특징인 신경병성 통증 증후군입니다. 국제두통질환분류 제3판(ICHD-3)에 따르면, 통증은 일반적으로 삼차신경의 하나 이상의 분지가 분포하는 영역에 국한되며, 강도가 매우 심해 견디기 어려운 경우가 많고, 가벼운 접촉, 세안, 양치질, 말하기 또는 씹기와 같은 무해한 자극에 의해 유발될 수 있습니다. 발작은 갑작스럽게 시작되어 급격히 종료되며, 지속 시간은 수분의 1초에서 수분까지 다양합니다1,2. TN은 대개 생명을 위협하지는 않지만, 심각하고 예측 불가능한 통증으로 인해 식사, 언어, 수면 및 정서 조절을 포함한 필수적인 일상 활동이 크게 방해받으며, 이는 상당한 심리사회적 부담과 삶의 질 저하로 이어집니다. 체계적 문헌고찰 결과에 따르면, TN 환자는 일반 인구에 비해 우울증, 불안 및 수면 장애의 위험이 상당히 높은 것으로 나타났습니다3,4. 대규모 코호트 연구에서 TN 환자의 약 35–55%가 임상적으로 유의미한 불안 또는 우울 증상을 보였으며, 통증 파국화가 매우 흔하게 나타나는데, 이는 만성적인 심한 통증, 불면증 및 정동 장애 사이에 양방향 상호작용이 있음을 시사합니다5,6. 역학적 추정치에 따르면 일반 인구에서 TN의 유병률은 약 0.03%에서 0.3% 사이이며, 여성과 고령층에서 발생률이 더 높고 지리적 지역, 인종 집단 및 연령층에 따라 뚜렷한 차이를 보입니다7,8. 중국과 인도 같이 인구가 많은 국가에서는 급격한 인구 고령화와 함께 TN 환자 수가 지속적으로 증가하고 있으며, 이에 따라 의료 시스템에 가해지는 부담이 커지고 있어 질환 평가 및 관리를 위한 더 효과적이고 확장 가능하며 데이터에 기반한 접근 방식의 필요성이 강조되고 있습니다8,9.

삼차신경통(TN)은 고전성, 이차성 및 특발성 하위 유형으로 분류될 수 있으며, 이러한 범주 간의 병인 기전과 치료 전략에 상당한 차이가 있음을 입증하는 증거가 계속해서 증가하고 있습니다1,10. 현재의 연구들은 삼차신경 신경근 진입 구역의 신경혈관 압박과 관련된 구조적 변화, 말초신경의 과흥분성, 그리고 변화된 중추성 통증 조절이 복합적으로 작용하여 질환의 병인에 기여한다고 시사합니다11,12. 임상 가이드라인에서는 carbamazepine과 oxcarbazepine을 1차 치료제로 권장하며, 약물 치료가 효과가 없거나 내약성이 낮은 경우에는 수술적 또는 중재적 접근법을 고려합니다10. 이러한 치료적 진전에도 불구하고, TN은 재발과 완화가 반복되는 경과를 보이는 것이 특징이며, 장기적인 통증 재발이 흔하게 발생하여 영구적인 완치를 달성하기 어렵습니다13. 따라서 재발 위험, 치료 반응 및 합병증을 모니터링하기 위해 장기적인 추적 관찰과 체계적인 만성 질환 관리가 필수적입니다. 종단적 코호트 연구에 따르면 표준화된 관리 전략(약물 치료, 적응증이 있는 경우의 수술적 중재 및 종합적인 추적 관찰 포함) 하에서, 보존적 관리를 받는 환자의 약 절반이 불가피한 질병 진행 없이 2년 이내에 전체 통증 부담을 ≥50% 감소시킬 수 있는 것으로 나타났습니다14. 이러한 결과는 장기적인 질환 관리를 위한 지속적인 환자의 참여와 효과적인 보건 교육의 중요성을 강조합니다. 질병의 병인, 병태생리 및 치료 옵션에 대해 더 잘 이해하고 있는 환자일수록 치료 계획에 더 적극적으로 참여하고 준수하며, 이는 결과적으로 개선된 치료 성과로 이어진다는 증거가 있습니다15. 그러나 전통적인 보건 교육 방식은 도달 범위와 확장성 면에서 제한적인 경우가 많습니다. 인터넷, 특히 온라인 질의응답 플랫폼과 소셜 미디어의 광범위한 보급으로 인해 환자들은 의료 정보를 얻기 위해 디지털 소스에 점점 더 의존하고 있습니다16,17. 그럼에도 불구하고, 개별적인 건강 문해력과 정보에 입각한 의사결정을 위해 기본적인 건강 정보를 접근, 처리 및 이해하는 능력의 상당한 차이가 효과적인 환자 교육의 주요 장벽이 되고 있습니다18. 더욱이, 부정확하거나 오해의 소지가 있는 내용을 포함하여 온라인 건강 정보의 품질이 균일하지 않다는 점은 환자의 의료적 결정과 심리적 안녕에 부정적인 영향을 미칠 수 있습니다19.

인공지능(AI) 기술, 특히 최근 몇 년간 거대언어모델(LLMs)의 급격한 발전은 의과학 커뮤니케이션과 건강 교육의 새로운 기회를 창출했습니다20. 대규모 텍스트 코퍼스로 학습된 이러한 모델들은 자연어 상호작용을 통해 구조적이고 논리적으로 일관된 응답을 생성할 수 있습니다21. ChatGPT와 같은 대표적인 국제적 시스템은 의료 질문 답변, 환자 상담 및 의학 교육 분야에서 유망한 잠재력을 보여주었습니다22,23. 중국에서도 기능적으로 유사한 여러 LLM이 등장했으며, 사용자 범위와 응용 시나리오가 지속적으로 확장되고 있습니다24. 이러한 진전에도 불구하고, 의과학 보급 분야에서 LLM의 적용은 학습 데이터의 신뢰성, 업데이트 빈도, 생성된 응답의 과학적 정확성 및 임상 검증 부족 등 여전히 상당한 과제에 직면해 있습니다25. 또한 언어 스타일, 가독성, 논리적 구조 및 인용 정확도 등 모델 간의 차이는 건강 관련 정보에 대한 환자의 이해도와 신뢰도에 직접적인 영향을 미칠 수 있습니다26. 현재까지 TN 관련 건강 교육에서 LLM 성능에 대한 체계적인 평가는 제한적이었습니다.

따라서 본 연구는 삼차신경통(TN)과 관련된 환자 교육 질문에 답하는 데 있어 널리 사용되는 4가지 중국어 LLM(Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen)과 대표적인 국제 LLM(ChatGPT)의 성능을 체계적으로 평가하고 비교하는 것을 목표로 하였다. 단면 연구 설계를 통해 임상 가이드라인과 환자들이 흔히 갖는 우려 사항을 바탕으로 TN 질문 세트를 구성하였으며, 공개적으로 이용 가능한 5가지 LLM(Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, GPT-5)이 생성한 응답을 평가하였다. 가독성은 여러 지표를 사용하여 평가하였고, 이해도와 실행 가능성은 환자 교육 자료 평가 도구(PEMAT)를 사용하여 평가하였다. 전체적인 정보 품질은 종합 품질 점수(GQS)를 사용하여 평가하였다. 또한, 서로 다른 건강 교육 주제가 이러한 평가 지표와 그 상호 관계에 어떠한 영향을 미치는지 분석하여, 임상 건강 소통에서 LLM을 선택하고 최적화하는 데 근거 기반의 지침을 제공하고자 하였다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 AI가 생성한 텍스트만을 분석하였으며, 인간 참여자, 동물, 생물학적 표본, 의료 기록, 식별 가능한 개인 정보 또는 임상 치료 개입을 포함하지 않았습니다. 따라서 윤리 심의 및 공식적인 고지된 동의는 해당되지 않았습니다.

연구 설계

본 단면 연구에서는 TN에 관한 자주 묻는 질문에 대해 5가지 LLM이 생성한 답변의 가독성, 품질 및 교육적 적합성을 평가하였습니다.

일반적으로 제기되는 TN 관련 질문의 식별

2025년 11월 25일, 통증 의학 분야에서 광범위한 경험을 가진 두 명의 임상 전문가가 국제 두통 장애 분류 제3판(ICHD-3), 유럽 신경학회 가이드라인, 그리고 미국 신경학회/유럽 신경학회 연맹 가이드라인1,10,11을 포함하여 삼차신경통(TN)에 관한 현재의 임상 가이드라인을 독립적으로 검토하였습니다. 합의 토론을 거쳐, 전문가들은 임상 현장에서 흔히 접하는 TN 관련 질문 20가지의 목록을 작성하였습니다. 질문의 수는 미리 정의된 5가지 주제 영역을 균형 있게 다루기 위해 각 영역당 4가지 질문이 선택되도록 사전에 결정되었으며, 이는 모델이 생성한 응답의 총 개수를 전문가가 수동으로 평가하고 검증할 수 있는 실행 가능한 범위 내로 유지하기 위함이었습니다. 재현성을 높이기 위해, 선택 과정은 미리 정의된 영역 기반 프레임워크를 따랐습니다. 전문가들은 먼저 각 영역 내에서 후보 질문을 식별하고, 임상적 관련성, 환자 중심의 표현, 중복 방지 여부를 독립적으로 검토한 후, 영역당 최종 4가지 질문에 대해 합의에 도달하였습니다. 최종 질문 목록은 Table 1Supplementary File 1에 제공되어 있습니다. 미리 정의된 5가지 주제 영역은 질환의 기본 지식, 원인 및 위험 요인, 진단, 치료, 그리고 예방 및 재활이었습니다. 질문 세트가 환자의 검색 로그, 온라인 검색 쿼리 또는 공식적인 환자 인터뷰에서 도출되지 않았으므로, 선택 편향의 가능성이 연구의 한계점으로 인정됩니다.

AI 모델 및 데이터 수집 절차

2025년 11월 25일, 최종 확정된 20가지의 TN 관련 질문 세트가 5개의 공개적으로 접근 가능한 대규모 언어 모델(LLM) 플랫폼인 Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen 및 GPT-5/ChatGPT에 제출되었습니다. 모든 모델은 표준 공개 웹 기반 채팅 인터페이스를 통해 접속되었으며, 애플리케이션 프로그래밍 인터페이스(API) 접근은 사용되지 않았습니다. 각 플랫폼의 경우, 데이터 수집일 당시에 기본적으로 공개 제공되는 모델을 사용하였으며, 생성 파라미터의 수정은 이루어지지 않았습니다. 공개 웹 인터페이스에서는 백엔드 모델 스냅샷 식별자, 숨겨진 시스템 프롬프트, temperature, top-p, 최대 출력 토큰 또는 기타 생성 파라미터가 표시되지 않았으므로, 해당 항목들은 "공개 웹 인터페이스에 표시되지 않음"으로 기록되었습니다.

모든 모델의 프롬프트 및 응답 언어는 영어였습니다. 각 표준화된 프롬프트는 모델별 추가 지침 없이 영어 질문 그대로로만 구성되었습니다. 각 질문은 이전 대화 기록, 업로드된 파일, 플러그인, 맞춤형 지침 또는 후속 프롬프트가 없는 새롭고 독립적인 채팅 세션에서 개별적으로 제출되었습니다. 표준화된 프롬프트의 전체 목록과 그에 해당하는 모델의 원시 출력값은 보충 파일 1에 제공되어 있습니다. 모델 메타데이터 및 데이터 수집 설정은 보충 표 1에 요약되어 있습니다.

가독성 평가

LLM이 생성한 응답의 가독성은 온라인 가독성 평가 플랫폼(http://readabilityformulas.com/)에서 제공하는 여러 기성 가독성 공식들을 사용하여 평가되었습니다. 가독성 평가에 있어 보편적으로 인정되는 단일 표준이 없음을 고려하고 이전 연구들과 일관성을 유지하기 위해, 널리 사용되는 가독성 지표들을 종합적으로 적용하였습니다23,27. 문장 길이, 단어 길이, 음절 부담, 문자 기반 복잡성, 읽기 쉬움, 추정 학년 수준 등 가독성의 상호 보완적인 측면들을 파악하기 위해 7가지 지표를 선정함으로써, 특정 단일 공식에 대한 의존도를 낮추었습니다. 구체적으로, Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES), Flesch-Kincaid Grade Level (FKGL)을 계산하였습니다. 이 지표들은 읽기 난이도나 학년 수준을 추정하며, 텍스트 가독성에 대한 정량적 측정값을 제공합니다(표 2).

교육적 적합성 및 정보 품질 평가

교육적 적합성은 이해도와 실행 가능성이라는 두 가지 영역으로 구성된 환자 교육 자료 평가 도구(Patient Education Materials Assessment Tool, PEMAT)를 사용하여 평가되었습니다28. 이 도구는 총 24개 항목으로 구성되어 있으며, 16개 항목은 이해도를, 8개 항목은 실행 가능성을 평가합니다. 각 항목은 이분법적으로 점수를 매겼으며(0 = 기준 미충족; 1 = 기준 충족), 총점은 0점에서 24점까지이며 점수가 높을수록 환자 교육에 더 적합함을 나타냅니다. 전반적인 정보 품질은 의료 정보의 품질을 평가하는 데 널리 사용되는 5점 리커트 척도인 글로벌 품질 점수(Global Quality Score, GQS)를 사용하여 평가되었습니다(표 3)27.

2025년 11월 25일, 삼차신경통(TN) 관리에 3년 이상의 경력을 가진 두 명의 임상 전문가가 두 가지 평가 도구를 사용하여 모든 AI 생성 응답을 평가했습니다. 점수를 매기기 전, 모든 AI 생성 응답은 코딩된 응답 식별자를 통해 익명화되었으며, PEMAT 및 GQS 평가 동안 검토자들은 LLM 플랫폼을 알 수 없도록 블라인드 처리되었습니다. 의견 불일치는 세 번째 상급 전문가가 최종 점수를 판정하여 해결했습니다. 평가자 간 신뢰도는 Cohen's kappa 계수를 사용하여 평가하였으며, 그 값은 >0.75는 매우 우수한 일치도를, 0.40~0.75는 수용 가능한 일치도를 나타내며, <0.40는 낮은 일치도를 나타냅니다. PEMAT와 GQS 모두 Cohen's kappa 값이 0.75를 초과하여 매우 우수한 평가자 간 신뢰도를 보였습니다.

통계 분석

모든 통계 분석은 R 소프트웨어(버전 4.4.3)를 사용하여 수행되었습니다. 데이터의 정규성은 Shapiro-Wilk 검정과 Q-Q 플롯을 사용하여 평가하였습니다. 정규 분포를 따르는 변수는 평균 ± 표준편차로 요약하였으며, 일원 분산 분석(one-way ANOVA)을 사용하여 비교하고, 필요한 경우 Tukey의 사후 검정을 실시하였습니다. 정규 분포를 따르지 않는 변수는 중앙값과 사분위 범위로 요약하였으며, Kruskal-Wallis 검정을 사용하여 비교하고, 쌍별 비교를 위해 Bonferroni 교정을 적용한 Dunn의 사후 검정을 실시하였습니다. 가독성 지수, PEMAT 점수 및 GQS 값 간의 상관관계는 Spearman의 서열 상관계수를 사용하여 평가하였으며, 다중 검정에는 Benjamini-Hochberg 교정을 적용하였습니다. 양측 조정 P value < 0.05를 통계적으로 유의한 것으로 간주하였습니다.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구에서는 대규모 언어 모델(LLM)과 서로 다른 범주의 건강 교육 콘텐츠가 생성된 텍스트의 가독성과 품질에 미치는 영향을 체계적으로 평가하였다. 먼저, Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen, GPT-5 등 5가지 LLM의 성능을 환자 교육 적합성, 전반적인 정보 품질, 그리고 PEMAT 점수, GQS 및 기성 가독성 지수(ARI, FRES, GFOG, FKGL, CL, SMOG, LW)를 포함한 여러 가독성 지표를 기준으로 비교하였다. 둘째, 기본 질환 지식, 원인 및 위험 요인, 진단, 치료, 예방 및 재활의 5가지 건강 교육 콘텐츠 주제 영역 전반에 걸쳐 동일한 결과 측정 항목을 조사하였다. 이러한 두 가지 분석적 관점을 통합함으로써, 모델 유형과 콘텐츠 범주가 텍스트 품질과 가독성에 어떻게 공동으로 영향을 미치는지 추가로 탐색하였으며, 이를 통해 LLM이 생성한 환자 교육 자료의 체계적인 패턴을 확인하였다.

다양한 거대 언어 모델 간의 가독성 분석

다섯 가지 거대 언어 모델인 Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen 및 GPT-5가 생성한 삼차신경통 관련 텍스트의 언어적 복잡성을 체계적으로 비교하기 위해 7가지의 기성 가독성 지수가 사용되었습니다. 전체 결과는 표 4에 요약되어 있으며, 개별 가독성 지표의 분포는 그림 1A–G에 나타내었습니다. 모든 가독성 지수에서 다섯 가지 모델 간에 통계적으로 유의미한 차이가 관찰되었으며, 각각 P < 0.001이었습니다.

GPT-5는 ARI, GFOG, FKGL, CL, SMOG에서 가장 높은 중앙값을 보였고 FRES는 가장 낮게 나타났으며, 이는 문장 구조가 더 길고 어휘가 더 복잡하며 전반적인 독해 부담이 가장 큰 텍스트를 생성했음을 나타냅니다(그림 1A–G). 이와 대조적으로, Wenxin Yiyan은 언어적 복잡성이 가장 낮게 나타났습니다. ARI, GFOG, FKGL, CL, SMOG의 중앙값은 5개 모델 중 가장 낮았던 반면, FRES는 가장 높았습니다.

Doubao, DeepSeek, 그리고 Tongyi Qianwen은 GPT-5와 Wenxin Yiyan 사이의 중간 수준의 가독성을 나타냈습니다. Doubao와 DeepSeek은 ARI, GFOG, FKGL, CL을 포함한 학년 수준 지표 전반에서 유사한 성능을 보였으며, 두 모델 모두 Wenxin Yiyan보다 유의하게 높은 값을 나타냈습니다 (P < 0.05). 이러한 결과는 Doubao와 DeepSeek의 전반적인 읽기 부담이 유사하며, Wenxin Yiyan보다 언어적 복잡성이 더 높음을 시사합니다.

Tongyi Qianwen은 대부분의 가독성 지표에서 일반적으로 Doubao/DeepSeek와 GPT-5 사이의 값을 나타냈습니다. 특히, CL 점수는 GPT-5에 더 가까웠는데, 이는 Doubao 및 DeepSeek보다 언어적 복잡성이 약간 더 높지만 GPT-5보다는 덜 복잡함을 시사합니다. LW 지수는 다른 가독성 지표와는 구별되는 분포 패턴을 보였습니다. Wenxin Yiyan이 가장 높은 LW 점수(60.00)를 기록했으며, Tongyi Qianwen, DeepSeek, Doubao가 그 뒤를 이은 반면, GPT-5는 가장 낮은 LW 점수(46.50)를 기록했습니다. 이러한 차이는 개별 가독성 공식이 문장 길이와 단어 난이도에 가중치를 두는 방식의 차이를 반영합니다(그림 1G).

전반적으로, 5가지 대규모 언어 모델 간에 언어적 복잡성에서 상당한 차이가 관찰되었습니다. GPT-5가 언어적으로 가장 복잡한 텍스트를 생성했고, Wenxin Yiyan이 가장 가독성이 높은 콘텐츠를 생성했으며, 나머지 모델들은 구조적 차이가 분명함에도 불구하고 중간 수준의 가독성을 나타냈습니다.

대규모 언어 모델 간 환자 교육 적합성 및 전반적인 품질 비교

PEMAT를 사용하여 평가한 결과, 5가지 언어 모델 간에 환자 교육 적합성에서 유의미한 차이가 관찰되었다(그림 1H; 표 4), 모든 P < 0.001. GPT-5는 전문가 평가 PEMAT 점수에서 가장 높은 점수(9.40)를 기록했다. ± 1.90)이며, 이는 현재의 벤치마킹 프레임워크 내에서 교육적 적합성이 더 높음을 나타냅니다. 그러나 이러한 결과가 GPT-5로 생성된 자료가 실제 환자의 이해도, 만족도, 신뢰도, 건강 행동 또는 임상적 결과를 개선한다는 증거로 해석되어서는 안 됩니다.

DeepSeek는 중간 정도의 PEMAT 점수(6.80 ± 1.06)를 기록했으며, 점수 분포가 비교적 조밀하게 나타나 환자 교육 자료 생성 성능이 일관됨을 시사했다. 그럼에도 불구하고, 전반적인 교육적 적합성은 GPT-5보다 유의하게 낮았다(P < 0.001). Doubao, Tongyi Qianwen 및 Wenxin Yiyan은 더 낮은 PEMAT 점수(각각 5.35 ± 1.04, 5.65 ± 1.09, 5.35 ± 0.93)를 보였다. 이 세 모델 간에는 유의미한 차이가 관찰되지 않았으며, 모두 DeepSeek 및 GPT-5보다 유의하게 낮은 성능을 보였다(모두 P < 0.01). 이러한 결과는 이 모델들이 서로 비슷하지만 제한적인 교육적 적합성을 가지고 있으며, 특히 지침의 명확성, 언어적 구성 및 이해 용이성 측면에서 그러함을 나타낸다.

GQS를 사용하여 평가한 전반적인 정보 품질에서도 유사한 패턴이 관찰되었습니다.그림 1I). 다섯 가지 모델 간에 통계적으로 유의미한 차이가 확인되었으며, 모든 P < 0.001. GPT-5가 가장 높은 GQS 점수(4.00)를 기록했습니다. ± 0.65). 점수는 4~5점 범위에 집중되었으며 변동성이 적었는데, 이는 내용의 일관성, 구조적 완결성 및 실용적 유용성 측면에서 일관되게 높은 성능을 보였음을 나타낸다.

DeepSeek와 Doubao가 각각 3.35 ± 0.59 및 3.40 ± 0.50의 GQS 점수로 그 뒤를 이었습니다. 이들의 점수 분포는 3과 4 사이에 집중되어 있어, 정보의 질이 보통 수준이며 신뢰도는 합리적인 수준임을 시사합니다. 이와 대조적으로, Tongyi Qianwen과 Wenxin Yiyan은 가장 낮은 GQS 점수(각각 2.50 ± 0.51 및 2.20 ± 0.52)를 기록했습니다. 이들의 분포는 척도의 낮은 쪽으로 치우쳐 있었으며, 이는 정보의 정확성, 구조적 엄격성 및 내용의 깊이에 한계가 있어 환자 교육에 대한 유용성이 떨어질 수 있음을 나타냅니다.

전반적으로, GPT-5는 이 데이터셋에서 전문가가 평가한 PEMAT 및 GQS 점수 중 가장 높은 점수를 기록한 반면, DeepSeek과 Doubao는 중간 정도의 성능을 보였습니다. Tongyi Qianwen과 Wenxin Yiyan은 더 낮은 GQS 등급을 받았습니다. 이러한 결과는 전문가가 평가한 벤치마킹 결과이며, 임상적 준비 상태나 환자 수준의 유효성에 대한 증거로 해석되어서는 안 됩니다.

건강 교육 콘텐츠 범주별 가독성, 환자 교육 적합성 및 전반적인 품질 비교

콘텐츠 카테고리별 분석 결과, 5가지 건강 교육 주제 간의 가독성에 유의미한 차이가 있음이 밝혀졌습니다(표 5). FRES의 경우, 주제별 카테고리 간에 통계적으로 유의미한 차이가 관찰되었습니다(P = 0.004). FRES 값이 높을수록 가독성이 더 좋음을 의미합니다. 기초 질환 지식 텍스트의 가독성이 가장 높았으며(중앙값 = 28.50), 진단 콘텐츠(중앙값 = 16.00), 원인 및 위험 요인 콘텐츠(중앙값 = 12.50), 치료 관련 콘텐츠(중앙값 = 11.50) 순으로 나타났습니다. 반면, 예방 및 재활 텍스트는 가장 낮은 가독성을 보였으며(중앙값 FRES = 1.00), 이는 읽기 난이도가 가장 높음을 나타냅니다.

다른 가독성 지표에서도 유사한 패턴이 관찰되었습니다. GFOG와 FKGL은 주제별 범주에 따라 유의미한 차이를 보였으며(P = 0.002 및 P = 0.036), 두 지표 모두 병인 및 위험 요인과 예방 및 재활 콘텐츠에서 더 높은 읽기 학년 수준을 나타냈습니다. SMOG 지표 또한 병인 및 위험 요인 텍스트에 다음절 단어의 비율이 더 높음을 시사했습니다(P = 0.039). 가장 큰 차이는 CL에서 관찰되었습니다(P < 0.001). 예방 및 재활 텍스트는 문장 길이(중앙값 = 21.01)가 가장 길어 읽기 난이도가 상당히 높았던 반면, 기초 질환 지식 텍스트는 문장 길이(중앙값 = 14.88)가 가장 짧아 읽기 부담이 가장 낮았습니다. ARI 또는 LW의 경우 콘텐츠 범주 간에 유의미한 차이가 관찰되지 않았습니다.

PEMAT 점수를 기준으로 다섯 가지 콘텐츠 범주 간의 환자 교육 적합성에서 통계적으로 유의미한 차이는 발견되지 않았습니다(P = 0.252). 평균 PEMAT 점수는 5.90에서 7.20 사이였으며, 이는 언어적 복잡성에는 뚜렷한 차이가 있음에도 불구하고 교육적 적합성은 주제 전반에 걸쳐 비교적 일관되게 유지되었음을 나타냅니다. 마찬가지로 GQS를 사용하여 평가한 전반적인 정보 품질 또한 콘텐츠 범주 간에 유의미한 차이가 없었습니다(P = 0.822). 평균 GQS 값은 2.95에서 3.25 사이였으며, 이는 전반적인 정보 품질이 콘텐츠 주제 전반에 걸쳐 비교적 안정적이었음을 나타냅니다.

전반적으로 건강 교육 주제에 따라 가독성에서 상당한 차이가 관찰되었으며, 특히 병인 및 위험 요인 관련 내용과 예방 및 재활 관련 내용의 읽기 난이도가 가장 높았던 반면, 질환에 대한 기본 지식 내용은 가독성이 가장 높았습니다. 이와 대조적으로, 환자 교육의 적절성과 정보의 전반적인 질은 콘텐츠 범주 전반에 걸쳐 비교적 일관되게 유지되었습니다.

가독성, 환자 교육 적합성 및 전반적인 품질 간의 상관관계 분석

그림 2의 상관 행렬은 가독성 지수들 사이에 일관되고 견고한 연관성이 있음을 보여주며, 이는 높은 내부 일관성을 나타냅니다. ARI, GFOG, FKGL, CL, SMOG를 포함한 대부분의 가독성 지표는 서로 중간에서 강한 수준의 양의 상관관계를 보였으며, 상관 계수는 0.64에서 0.97 사이였습니다 (모두 P < 0.001). 이러한 결과는 언어적 복잡성을 평가하는 데 있어 이 지수들이 상호 보완적인 성격을 가짐을 더욱 뒷받침합니다. 이와 대조적으로, FRES는 ARI, GFOG, FKGL, CL, SMOG를 포함한 여러 가독성 지표와 유의미한 음의 상관관계를 보였으며, 절대 상관 계수는 0.70보다 컸습니다 (모두 P < 0.001). 이러한 패턴은 점수가 높을수록 가독성이 더 좋음을 나타내는 FRES의 역방향 점수 산정 방식을 반영합니다. LW 지수 또한 ARI, FKGL, GFOG, SMOG를 포함한 다른 가독성 지수들과 유의미한 음의 상관관계를 보였으며, 절대 상관 계수는 0.75에서 0.90 사이였습니다 (모두 P < 0.001). 반대로, LW는 FRES와 양의 상관관계를 보였습니다 (상관 계수 = 0.69, P < 0.001).

가독성 지수와 GQS로 측정된 전반적인 정보 품질 사이에서도 뚜렷한 연관성이 관찰되었습니다. GQS는 ARI, GFOG, FKGL, CL, SMOG를 포함한 대부분의 가독성 지표와 약함에서 중간 정도의 양의 상관관계를 보였으며, 상관계수는 0.326에서 0.391 사이였습니다 (모두 P < 0.001). 이러한 결과는 언어적 복잡성이 높을수록 전문가가 평가한 정보 품질이 더 높다는 것을 시사합니다. 반대로 GQS는 FRES와 중간 정도의 음의 상관관계를 보였으며 (상관계수 = −0.408, P < 0.001), 이는 더 높은 읽기 수준을 요구하는 텍스트가 일반적으로 더 높은 GQS 점수를 받았음을 나타냅니다. 또한 GQS는 LW와 중간 정도의 음의 상관관계를 보였습니다 (상관계수 = −0.421, P < 0.001).

PEMAT를 사용하여 평가한 가독성과 환자 교육 적합성 사이의 연관성은 일반적으로 더 약했으나 방향성은 일관되었습니다. PEMAT 점수는 ARI, GFOG, FKGL, CL 및 SMOG와 약한 양의 상관관계를 보였으며, 상관계수는 0.305에서 0.434 사이였습니다 (모두 P < 0.01). 반면, PEMAT 점수는 FRES 및 LW와 약한 음의 상관관계를 보였으며, 절대 상관계수는 각각 0.432와 0.320이었습니다 (모두 P < 0.01). 이러한 결과는 본 데이터셋 내에서 언어적 복잡성이 높을수록 전문가가 평가한 교육 적합성이 약간 더 높게 나타났음을 시사하나, 이러한 연관성의 강도는 제한적이었습니다.

중요한 점은 PEMAT 점수와 GQS 점수 사이에 중간 정도의 양의 상관관계가 관찰되었다는 것입니다(상관계수 = 0.645, P < 0.001). 이는 평가 영역 간에 관찰된 가장 강력한 연관성으로, 교육적 적합성이 높은 응답일수록 전반적인 정보 품질 등급도 높게 받는 경향이 있음을 나타냅니다.

데이터 가용성:

본 연구를 뒷받침하는 전체 데이터 세트는 보충 자료로 제공됩니다. 보충 파일 1에는 표준화된 질문, 프롬프트 전체 목록과 보관된 100개의 LLM 생성 응답이 포함되어 있습니다. 보충 표 2에는 가능한 경우 항목별 PEMAT 등급, 총 PEMAT 점수, GQS 점수, 평가자 비교 정보 및 해당되는 경우 판정 기록을 포함한 전문가 PEMAT 및 GQS 채점표가 포함되어 있습니다. 가독성 점수, 그림 소스 데이터 및 R 분석 코드는 보충 파일 2로 제공됩니다. LLM 출력은 모델 업데이트, 인터페이스 변경 및 플랫폼 수준의 수정으로 인해 시간이 지남에 따라 변경될 수 있으므로, 검증 및 2차 분석에는 재생성된 응답이 아닌 보관된 출력을 사용해야 합니다.

figure-results-1
그림 1: 5가지 대규모 언어 모델 간의 가독성, 환자 교육 적합성 및 전반적인 정보 품질 비교. (A–G) 이 패널 은 가독성 지수인 Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) 및 Linsear Write Formula (LW)를 나타낸다. (H) 이 패널은 총 PEMAT 점수를 보여주며, 패널 (I) 은 전반적 품질 점수(Global Quality Scores, GQS)를 보여준다. 각 박스 플롯에서 중앙선은 중앙값을 나타내고, 박스는 사분위수 범위(IQR)를 나타내며, 수염은 1.5 × IQR까지 확장되고, 수염 너머의 점은 이상치를 나타낸다. 약어: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = 이해도 및 실행 가능성을 위한 환자 교육 자료 평가 도구(Patient Education Materials Assessment Tool for Understandability and Actionability), 인쇄 포맷; Global Quality Score = GQS. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

figure-results-2
그림 2: 모든 모델 생성 응답에 대한 가독성 지표, 환자 교육 적합성 및 전반적인 정보 품질 간의 Spearman 상관관계 행렬. 이 행렬은 ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT 및 GQS 간의 쌍별 연관성에 대한 Spearman 상관계수를 나타냅니다. 약어: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

표 1: 삼차신경통 관련 20가지 질문 목록. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 2: 가독성 도구, 공식 및 설명. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 3: 글로벌 품질 점수(GQS) 품질 기준. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 4: 삼차신경통과 관련된 가장 일반적인 질문들에 대한 다양한 거대 언어 모델의 분석 결과. 이 파일을 다운로드하시려면 여기를 클릭하십시오.

표 5: 삼차신경통과 관련된 가장 일반적인 질문들에 대한 다양한 차원별 분석 결과. 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 1: 평가된 모든 가독성 지표에 따른 5가지 대규모 언어 모델이 생성한 응답의 가독성 점수. 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 2: 5가지 거대 언어 모델이 생성한 응답에 대한 환자 교육 적합성(PEMAT) 및 전반적인 정보 품질(GQS)의 전문가 평가 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 파일 1: 5가지 거대 언어 모델에 의해 생성된 표준화된 삼차신경통 질문 및 전체 응답. 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 파일 2: 통계 분석 및 그림 생성에 사용된 R 스크립트 및 소스 데이터 이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 단면 벤치마킹 연구는 공개적으로 이용 가능한 5가지 대규모 언어 모델(LLM)이 생성한 삼차신경통(TN) 환자 교육 자료의 가독성, 교육적 적합성 및 전반적인 정보 품질을 체계적으로 비교하였습니다. 네 가지 주요 결과가 도출되었습니다. 첫째, 모델 간 가독성 차이가 상당했으며, GPT-5가 언어적으로 가장 복잡한 응답을 생성한 반면 Wenxin Yiyan이 가장 가독성 높은 콘텐츠를 생성했습니다. 둘째, 가독성과 전문가가 평가한 정보 품질은 서로 다른 평가 차원이었으며, GPT-5는 낮은 가독성에도 불구하고 가장 높은 PEMAT 및 GQS 점수를 기록했습니다. 셋째, 콘텐츠 주제가 가독성에 영향을 미쳤으며, 예방, 재활, 원인 및 위험 요인 주제는 일반적으로 더 높은 읽기 수준을 요구한 반면, PEMAT 및 GQS 점수는 콘텐츠 범주 전반에 걸쳐 상대적으로 안정적이었습니다. 마지막으로, 가독성 지수는 강한 내부 일관성을 보였으며, 상관관계 분석 결과 언어적 복잡성과 PEMAT 및 GQS 모두 사이에 약함에서 중간 정도의 양의 상관관계가 있었고, PEMAT와 GQS 사이에는 중간 정도의 양의 상관관계가 있음이 밝혀졌습니다. 종합적으로, 이러한 결과는 LLM이 생성한 TN 환자 교육 자료를 평가하기 위한 벤치마크를 제공하는 동시에, 의학적 완결성과 언어적 접근성 사이의 균형을 맞출 필요성을 강조합니다. 중요한 점은, 본 결과가 전문가 평가 기반의 벤치마킹 결과이며, 이를 환자의 이해도, 사실적 정확성, 임상적 안전성 또는 일상적인 임상 사용 준비 완료의 근거로 해석해서는 안 된다는 것입니다.

본 연구의 결과는 AI가 생성한 의료 정보에 대한 이전 평가들과 일치하며, 이전 연구들에서도 LLM 간의 상당한 가변성과 가독성과 정보 품질 사이의 빈번한 괴리가 보고된 바 있다26,27,29. 여러 질환 분야에 걸친 기존 연구들에 따르면, LLM이 생성한 환자 교육 자료는 권장 읽기 수준을 초과하는 경우가 많으며, 가장 가독성 높은 텍스트를 생성하는 모델이 반드시 가장 포괄적이거나 높은 품질의 정보를 제공하는 것은 아님을 보여주었다26,30. TN 교육에서의 결과는 이러한 관찰을 뒷받침한다. GPT-5는 언어적으로 가장 복잡한 응답을 생성했음에도 불구하고 가장 높은 PEMAT 및 GQS 점수를 획득한 반면, Wenxin Yiyan은 더 가독성 있는 텍스트를 생성했으나 전문가가 평가한 교육적 적합성과 전반적인 품질은 더 낮았다. 또한, 가독성은 주제 영역별로 차이를 보였으며, 예방 및 재활과 병인 및 위험 요인 주제가 일반적으로 더 높은 언어적 복잡성을 나타냈는데, 이는 모델의 특성과 주제의 복잡성 모두가 읽기 난이도에 영향을 미친다는 것을 시사한다31.

가독성과 정보 품질 사이의 겉보기 상충 관계는 평가 도구들이 측정하는 서로 다른 구성 개념과 일치합니다. 가독성 공식은 주로 문장 길이 및 어휘 복잡성과 같은 표면적인 언어적 특성을 평가하는 반면, PEMAT와 GQS는 정보 구성, 완전성, 설명의 명확성 및 실행 가능성을 포함한 고차원적 속성을 평가합니다32. TN 교육의 경우, 고품질의 답변에는 적색 깃발 증상(red-flag symptoms), 감별 진단, 약물학적 관리 및 부작용, 중재적 및 외과적 옵션, 그리고 개별화된 재활 전략에 대한 논의가 빈번하게 포함됩니다33. 이러한 임상적으로 포괄적인 내용은 필연적으로 전문 용어의 밀도와 구문 복잡성을 증가시키며, 이는 결과적으로 가독성 점수를 높이고(가독성을 낮추고) 전문가가 평가한 교육 품질을 향상시킵니다. 중요한 점은, 이러한 결과가 더 복잡한 언어가 선호된다는 것을 시사하는 것으로 해석되어서는 안 된다는 것입니다. 오히려 이는 현재의 LLM이 종종 언어적 접근성을 희생하여 정보의 완전성을 개선한다는 것을 나타냅니다. 따라서 향후 환자 교육 시스템의 개발은 쉬운 언어로의 수정, 핵심 사항의 구조화된 제시, 전문 용어에 대한 설명, 그리고 다양한 건강 문해력 수준을 가진 환자들에게 적합한 명확하고 실행 가능한 지침을 통해, 의학적 정확성을 유지하면서 언어를 단순화하는 데 집중해야 합니다11,34,35.

상관관계 분석 결과는 가독성과 교육적 품질 사이의 구분을 더욱 뒷받침합니다. 대부분의 학년 수준 기반 가독성 지표는 PEMAT 및 GQS 모두와 약하거나 중간 정도의 양의 상관관계를 보인 반면, FRES는 점수가 높을수록 가독성이 좋음을 의미하므로 예상된 역관계를 나타냈습니다. 이러한 결과가 언어적 복잡성이 더 높을수록 바람직하다는 것을 의미하지는 않으며, 오히려 현재의 LLM이 가독성을 희생하면서 정보의 완결성을 높이는 경우가 많음을 시사합니다34. 따라서 AI 지원 환자 교육의 개발은 의학적 정확성과 완결성을 우선시하는 동시에, 쉬운 언어로의 편집, 핵심 사항의 구조적 제시, 전문 용어에 대한 명확한 설명, 그리고 다양한 건강 문해력 수준을 가진 환자들에게 맞춘 실행 가능한 권고 사항의 포함을 우선적으로 고려해야 합니다11,35.

추가적인 방법론적 발견은 LW 지수가 다른 가독성 측정 지표들과는 뚜렷하게 다른 양상을 보였다는 점입니다. ARI, FKGL, GFOG, CL 및 SMOG와 달리, LW는 FRES와 더 유사한 패턴을 따랐으며, 이는 가독성 공식이 텍스트 복잡성을 구체화하는 방식의 차이를 반영합니다36. LW는 원래 기술 매뉴얼을 위해 개발되었으며, 전체적인 문장이나 음절 특성보다는 샘플링된 문장 구조와 단어 분류를 강조하기 때문에, 간결한 진술과 긴 설명 구절 및 기술 용어의 불균등한 분포가 결합된 AI 생성 의료 텍스트에 다르게 반응할 수 있습니다37,38. 이러한 결과는 단일 가독성 지수만으로는 텍스트 복잡성의 모든 차원을 적절하게 포착할 수 없으므로, 다각적인 측정 평가 프레임워크가 중요하다는 점을 뒷받침합니다. AI 생성 건강 정보에 관한 이전 연구들과 일관되게, 따라서 전반적인 가독성은 개별 측정치가 아닌 여러 상호 보완적인 지표들에 걸친 수렴적 근거를 사용하여 해석해야 합니다39.

콘텐츠 카테고리 또한 가독성에 영향을 미쳤습니다. 예방, 재활, 그리고 원인 및 위험 요인 관련 주제는 일반적으로 기초 질병 지식보다 읽기 난이도가 높은 텍스트를 생성했는데, 이는 이러한 주제들이 조건부 권고 사항, 기전적 설명 및 더 전문적인 용어를 필요로 하기 때문인 것으로 보입니다40,41. 반면, 기초 질병 지식은 주로 정의를 기반으로 하므로 더 단순한 언어로 전달될 수 있습니다42. 이러한 차이에도 불구하고, PEMAT와 GQS는 주제 영역 전반에 걸쳐 비교적 일관되게 나타났으며, 이는 전문가가 평가한 교육적 적합성과 전반적인 정보의 품질이 다양한 유형의 환자 질문에 대해 일정하게 유지되었음을 시사합니다35,43.

이러한 결과는 임상 실제와 향후 LLM 개발에 있어 몇 가지 시사점을 제공합니다. 환자들이 의료 상담 전후에 정보를 얻기 위해 LLM을 점점 더 많이 사용함에 따라, AI가 생성한 콘텐츠는 특히 약물 안전성, 중재적 또는 수술적 치료의 적응증, 그리고 긴급한 평가가 필요한 레드 플래그(red-flag) 증상의 인식과 관련하여 임상의의 상담을 대체하기보다는 보완하는 역할을 해야 합니다44. 의료 기관은 LLM을 자율적인 환자 교육 시스템이 아닌 초안 작성 또는 의사결정 지원 도구로 활용하는 동시에, 전문가가 검토한 쉬운 언어의 교육 자료를 제공함으로써 이점을 얻을 수 있습니다. 향후 모델은 가독성을 고려한 생성 전략, 모델 버전 및 생성 날짜의 투명한 보고, 불확실성의 명시적 전달, 그리고 임상 적용 전 임상의 검토, 사실 관계 정확성 검증, 환각(hallucination) 스크리닝, 약물 안전성 점검, 레드 플래그 안내 및 환자 이해도 테스트를 포함하는 거버넌스 절차를 통합해야 합니다26,44,45.

본 연구에는 몇 가지 한계점이 있습니다. 모델 출력값은 특정 날짜에 공개적으로 접근 가능한 웹 인터페이스에서 수집되었으며, 이후의 모델 업데이트, 인터페이스 변경, 숨겨진 시스템 프롬프트 또는 기본 생성 설정이 재현성에 영향을 미칠 수 있습니다. 20개의 질문 세트는 환자의 검색 로그나 공식적인 환자 인터뷰에서 도출된 것이 아니라 임상 전문가들에 의해 개발되었으며, 이러한 방식은 선택 편향을 유발할 수 있습니다. 또한, 본 연구는 전문가가 평가한 PEMAT 및 GQS 평가에 의존하였으며, 환자의 이해도, 신뢰도, 만족도, 건강 행동 또는 임상적 결과는 평가하지 않았습니다. 가독성 공식, PEMAT 및 GQS 역시 사실적 정확성, 환각(hallucination) 위험, 인용 정확성, 금기 사항의 완전성 또는 임상적 안전성을 직접적으로 평가하지 않습니다. 결과적으로, 이러한 발견은 LLM이 생성한 자료가 일상적인 임상 사용에 준비되었다는 증거라기보다 전문가가 평가한 단면적 벤치마킹 분석으로 해석되어야 합니다. 향후 연구에서는 LLM 생성 교육 자료의 임상 적용을 고려하기 전에, 아카이브된 모델 출력값, 상세한 모델 메타데이터, 다국어 평가, 더 많은 질문 세트, 공식적인 안전성 감사, 사실적 정확성 평가 및 환자 중심의 결과 측정 지표를 포함해야 합니다.

전문가 평가 기반의 단면 벤치마킹 연구인 본 연구에서, 공개적으로 이용 가능한 대규모 언어 모델들은 삼차신경통 환자 교육 자료의 가독성, 교육적 적합성 및 전반적인 정보 품질 면에서 상당한 차이를 보였습니다. GPT-5는 전문가가 평가한 PEMAT 및 GQS 점수에서 가장 높은 점수를 기록했으나, 언어적으로 가장 복잡한 답변을 생성하기도 했습니다. 이는 가독성과 전문가가 평가한 교육적 품질이 환자 교육의 서로 연관되어 있으나 구별되는 차원임을 강조합니다. 일부 모델은 더 읽기 쉬운 콘텐츠를 생성했지만, 이것이 반드시 더 높은 교육적 적합성이나 전반적인 정보 품질로 이어지지는 않았습니다. 본 연구는 전담 안전 감사를 통한 사실 정확성, 환각 위험, 인용 정확도, 환자의 이해도, 신뢰도, 만족도, 건강 행동 또는 임상적 결과를 평가하지 않았으므로, 연구 결과는 임상적 준비 상태의 증거라기보다 전문가 평가 기반의 벤치마킹 분석으로 해석되어야 합니다. 향후 연구에서는 환자 교육에서 LLM 생성 자료의 안전하고 효과적인 사용을 지원하기 위해 전문가 검토, 공식적인 안전성 및 사실 정확성 평가, 그리고 환자 중심 평가를 통합해야 합니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해상충 관계가 없음을 밝힙니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 공공, 상업 또는 비영리 부문의 어떠한 지원 기관으로부터도 특정 연구비를 지원받지 않았습니다. 저자들은 삼차신경통 문항 세트에 대해 피드백을 제공하고 평가 체계의 개선을 도운 임상 동료들에게 감사를 표합니다. 또한 원고 작성 및 수정 과정을 지원해 준 모든 기여자에게 감사를 드립니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
DeepSeek 채팅 플랫폼DeepSeekhttps://chat.deepseek.com/응답 생성에 사용된 공개적으로 접근 가능한 대규모 언어 모델 인터페이스
Doubao 채팅 플랫폼Doubaohttps://www.doubao.com/chat/응답 생성에 사용된 공개적으로 접근 가능한 대규모 언어 모델 인터페이스
GPT 5 OpenAIhttps://chat.openai.com/응답 생성에 사용된 공개적으로 접근 가능한 대규모 언어 모델 인터페이스
R 소프트웨어, 버전 4.4.3R Foundation for Statistical Computing해당 없음통계 분석 및 시각화
Readability Formulas 온라인 가독성 계산기Readability Formulas해당 없음가독성 지수 계산에 사용된 온라인 도구
Tongyi Qianwen 채팅 플랫폼Tongyi Qianwenhttps://www.tongyi.com/응답 생성에 사용된 공개적으로 접근 가능한 대규모 언어 모델 인터페이스
Wenxin Yiyan 채팅 플랫폼Wenxin Yiyanhttps://yiyan.baidu.com/응답 생성에 사용된 공개적으로 접근 가능한 대규모 언어 모델 인터페이스

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

PEMATGlobal Quality Score

관련 논문