Исследовательская статья

Читабельность и качество материалов по обучению пациентов с невралгией тройничного нерва, созданных большими языковыми моделями: одномоментное исследование

DOI:

10.3791/70833

21 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе мы представляем протокол систематической оценки читабельности, образовательной пригодности и качества информации для пациентов о невралгии тройничного нерва, созданной большойю языковой моделью, с целью проведения сравнительного анализа моделей и оптимизации коммуникации с пациентами.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Большие языковые модели (LLM) все чаще используются для санитарного просвещения пациентов, однако читабельность и образовательное качество информации о тригеминальной невралгии (ТН), генерируемой LLM, остаются недостаточно изученными. В данном перекрестном сравнительном исследовании анализировалось образовательное содержание по ТН, созданное пятью общедоступными LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5). Каждой модели с помощью стандартизированных промптов были заданы двадцать часто задаваемых вопросов о ТН, охватывающих базовые знания о заболевании, этиологию/факторы риска, диагностику, лечение, а также профилактику и реабилитацию. Читабельность оценивалась с помощью семи общепринятых индексов, образовательная пригодность — с использованием инструмента оценки материалов для обучения пациентов по доступности и применимости (PEMAT), а общее качество информации — с помощью глобальной шкалы качества (GQS). Два клинических эксперта независимо оценивали все ответы, а разногласия разрешались старшим арбитром. Статистический анализ проводился для сравнения эффективности моделей, тематических различий и корреляций между метриками оценки. Между моделями наблюдались значимые различия в показателях читабельности, PEMAT и GQS. GPT-5 генерировала наиболее лингвистически сложные ответы, но получила самые высокие оценки за образовательную пригодность и качество информации. Напротив, Wenxin Yiyan создавала наиболее читабельные тексты, но в целом имела более низкие баллы по PEMAT и GQS. Категория содержания влияла на читабельность: темы профилактики/реабилитации и этиологии/факторов риска оказались более сложными для чтения, в то время как показатели PEMAT и GQS оставались относительно стабильными для всех тем. Индексы читабельности продемонстрировали сильную внутреннюю согласованность и слабую или умеренную положительную корреляцию с PEMAT и GQS, в то время как между PEMAT и GQS наблюдалась умеренная положительная корреляция. Эти результаты показывают, что выбор модели влияет на оцениваемую экспертами образовательную пригодность и общее качество информации, тогда как сложность темы в первую очередь влияет на читабельность. Поскольку понимание пациентов, удовлетворенность, доверие, исходы для здоровья, фактическая точность и клиническая безопасность не оценивались, данные результаты следует интерпретировать как экспертный сравнительный анализ, а не как доказательство клинической готовности к применению.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Тригеминальная невралгия (ТН) представляет собой синдром нейропатической боли, характеризующийся рекуррентными эпизодами односторонней, кратковременной и чрезвычайно интенсивной боли в области лица, которую часто описывают как удар током или колющую боль. Согласно Международной классификации головных болей 3-го издания (ICHD-3), боль обычно локализуется в области распределения одной или нескольких ветвей тройничного нерва, часто бывает невыносимой по интенсивности и может провоцироваться неопасными стимулами, такими как легкое прикосновение, умывание лица, чистка зубов, речь или жевание. Приступы характеризуются внезапным началом и резким прекращением, а их продолжительность варьирует от долей секунды до нескольких минут1,2. Хотя ТН обычно не представляет угрозы для жизни, сильная и непредсказуемая боль существенно нарушает основные повседневные действия, включая прием пищи, речь, сон и эмоциональную регуляцию, что приводит к значительному психосоциальному бремени и ухудшению качества жизни. Данные систематических обзоров свидетельствуют о том, что лица с ТН подвержены значительно более высокому риску развития депрессии, тревожности и нарушений сна по сравнению с общей популяцией3,4. В крупных когортных исследованиях примерно у 35–55% пациентов с ТН наблюдаются клинически значимые симптомы тревоги или депрессии, а также широко распространена катастрофизация боли, что указывает на двунаправленное взаимодействие между хронической сильной болью, бессонницей и аффективными расстройствами5,6. Эпидемиологические оценки показывают, что распространенность ТН в общей популяции составляет от примерно 0,03% до 0,3%, при этом более часто заболевание встречается у женщин и пожилых людей, а также наблюдаются заметные различия в зависимости от географического региона, этнической группы и возрастной категории7,8. В густонаселенных странах, таких как Китай и Индия, быстрое старение населения сопровождалось устойчивым ростом числа лиц, страдающих ТН, что создает увеличивающуюся нагрузку на системы здравоохранения и подчеркивает необходимость в более эффективных, масштабируемых и основанных на данных подходах к оценке и лечению заболевания8,9.

Невралгию тройничного нерва (НТ) можно классифицировать на классический, вторичный и идиопатический подтипы, при этом появляется все больше данных, свидетельствующих о существенных различиях в этиологических механизмах и терапевтических стратегиях между этими категориями1,10. Современные исследования позволяют предположить, что структурные изменения в зоне входа тройничного нерва, связанные с нейроваскулярным конфликтом, повышенная возбудимость периферических нервов и нарушение центральной модуляции боли совместно способствуют патогенезу заболевания11,12. Клинические рекомендации определяют карбамазепин и окскарбазепин в качестве препаратов первой линии, в то время как хирургические или интервенционные методы рассматриваются при неэффективности или плохой переносимости фармакологической терапии10. Несмотря на эти достижения в терапии, НТ характеризуется рецидивирующе-ремитирующим течением, и долгосрочные рецидивы боли остаются распространенным явлением, что затрудняет достижение стойкой ремиссии13. Следовательно, длительное наблюдение и структурированное ведение хронического заболевания необходимы для мониторинга риска рецидивов, ответа на лечение и осложнений. Лонгитюдные когортные исследования показывают, что при применении стандартизированных стратегий ведения (включая фармакологическое лечение, хирургическое вмешательство по показаниям и комплексное наблюдение) примерно половина пациентов, получающих консервативную терапию, может достичь снижения общей интенсивности боли на ≥50% в течение двух лет без неизбежного прогрессирования заболевания14. Эти результаты подчеркивают важность постоянного взаимодействия с пациентом и эффективного санитарного просвещения для долгосрочного управления заболеванием. Данные свидетельствуют о том, что пациенты, лучше понимающие этиологию, патофизиологию и варианты лечения заболевания, с большей вероятностью будут активно участвовать в терапевтических схемах и соблюдать их, что приводит к улучшению результатов15. Однако традиционные подходы к санитарному просвещению часто ограничены в охвате и масштабируемости. С широким распространением интернета, особенно онлайн-платформ с вопросами и ответами и социальных сетей, пациенты все чаще полагаются на цифровые источники для получения медицинской информации16,17. Тем не менее, значительная вариабельность индивидуальной медицинской грамотности, а также способности получать, обрабатывать и понимать базовую информацию о здоровье для принятия обоснованных решений создают серьезные препятствия для эффективного обучения пациентов18. Более того, неоднородное качество онлайн-информации о здоровье, включая неточные или вводящие в заблуждение данные, может негативно повлиять на медицинские решения пациентов и их психологическое благополучие19.

Технологии искусственного интеллекта (ИИ), в частности стремительное развитие больших языковых моделей (LLM) в последние годы, открыли новые возможности для коммуникации в области медицины и санитарного просвещения20. Будучи обученными на крупномасштабных текстовых корпусах, эти модели способны генерировать структурированные и логически связные ответы посредством взаимодействия на естественном языке21. Репрезентативные международные системы, такие как ChatGPT, продемонстрировали многообещающий потенциал в ответах на медицинские вопросы, консультировании пациентов и медицинском образовании22,23. В Китае появились несколько функционально схожих LLM с постоянно расширяющимся охватом пользователей и сценариями применения24. Несмотря на эти достижения, применение LLM в популяризации медицинских наук все еще сталкивается с серьезными проблемами, включая надежность обучающих данных, частоту обновлений, научную точность генерируемых ответов и отсутствие клинической валидации25. Кроме того, различия между моделями в стиле языка, читаемости, логической структуре и точности цитирования могут напрямую влиять на понимание пациентами информации о здоровье и доверие к ней26. На сегодняшний день систематические оценки эффективности LLM в санитарном просвещении, связанном с TN, были ограниченными.

Таким образом, целью данного исследования была систематическая оценка и сравнение эффективности четырех широко используемых китайских LLM (Doubao, DeepSeek, Wenxin Yiyan и Tongyi Qianwen) и одной репрезентативной международной LLM (ChatGPT) при ответах на вопросы по обучению пациентов, связанные с ТН. Используя поперечный дизайн исследования, мы составили набор вопросов по ТН на основе клинических рекомендаций и распространенных опасений пациентов, а затем оценили ответы, сгенерированные пятью общедоступными LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5). Читабельность оценивалась с помощью нескольких метрик, а понятность и практическая применимость — с использованием инструмента оценки материалов для обучения пациентов (PEMAT). Общее качество информации оценивалось по глобальной шкале качества (GQS). Кроме того, мы проанализировали, как различные темы санитарного просвещения влияют на эти метрики оценки и их взаимосвязь, стремясь предоставить научно обоснованные рекомендации по выбору и оптимизации LLM в клинической коммуникации в области здравоохранения.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании анализировался только текст, созданный ИИ; в нем не принимали участия люди и животные, не использовались биологические образцы, медицинские карты, идентифицируемая личная информация или вмешательство в клиническое лечение. Следовательно, этическая экспертиза и официальное информированное согласие не требовались.

Дизайн исследования

В данном одномоментном исследовании оценивались удобочитаемость, качество и образовательная пригодность ответов, сгенерированных пятью моделями LLM в ответ на часто задаваемые вопросы о TN.

Определение наиболее часто задаваемых вопросов, связанных с ТН

25 ноября 2025 года два клинических эксперта с обширным опытом в области лечения боли независимо изучили действующие клинические рекомендации по невралгии тройничного нерва (НТН), включая Международную классификацию головных болей 3-го издания (ICHD-3), рекомендации Европейской академии неврологии, а также рекомендации Американской академии неврологии/Европейской федерации неврологических обществ1,10,11. После проведения консенсусного обсуждения они составили список из 20 вопросов, связанных с НТН, которые часто встречаются в клинической практике. Количество вопросов было определено априори для обеспечения сбалансированного охвата пяти заранее заданных тематических областей (по четыре вопроса на каждую область), при этом общее количество ответов, сгенерированных моделью, должно было оставаться в пределах диапазона, допустимого для ручной экспертной оценки и верификации. Для повышения воспроизводимости процесс отбора проводился согласно заранее определенной структуре по областям: сначала эксперты определяли потенциальные вопросы в каждой области, независимо проверяли их на клиническую значимость, доступность формулировок для пациента и отсутствие избыточности, после чего приходили к консенсусу по поводу итоговых четырех вопросов для каждой области. Окончательный список вопросов приведен в Таблице 1 и Дополнительном файле 1. Пятью заранее определенными тематическими областями стали: базовые знания о заболевании, этиология и факторы риска, диагностика, лечение, а также профилактика и реабилитация. Поскольку набор вопросов не был получен из логов поиска пациентов, онлайн-запросов или формальных интервью с пациентами, возможность систематической ошибки отбора признается ограничением исследования.

Модели ИИ и процедура сбора данных

25 ноября 2025 года окончательный набор из 20 вопросов, связанных с TN, был отправлен на пять общедоступных платформ больших языковых моделей (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5/ChatGPT. Доступ ко всем моделям осуществлялся через их стандартные общедоступные веб-интерфейсы чатов; доступ через интерфейс прикладного программирования (API) не использовался. Для каждой платформы использовалась модель по умолчанию, доступная на дату сбора данных, без изменения каких-либо параметров генерации. Поскольку общедоступные веб-интерфейсы не отображали идентификаторы снимков (snapshots) фоновых моделей, скрытые системные промпты, температуру, top-p, максимальное количество выходных токенов или другие параметры генерации, эти пункты были отмечены как «не отображаются в общедоступном веб-интерфейсе».

Языки запросов и ответов для всех моделей были английскими. Каждый стандартизированный запрос состоял исключительно из дословного вопроса на английском языке без каких-либо дополнительных инструкций для конкретной модели. Каждый вопрос отправлялся индивидуально в новой независимой чат-сессии без предыдущей истории переписки, загруженных файлов, плагинов, пользовательских инструкций или последующих уточняющих запросов. Полный список стандартизированных запросов и соответствующие необработанные ответы моделей представлены в Дополнительном файле 1. Метаданные моделей и настройки сбора данных обобщены в Дополнительной таблице 1.

Оценка читабельности

Читабельность ответов, сгенерированных LLM, оценивали с помощью нескольких общепринятых формул читабельности, доступных на онлайн-платформе для оценки читабельности (http://readabilityformulas.com/). Ввиду отсутствия общепризнанного «золотого стандарта» оценки читабельности и в соответствии с предыдущими исследованиями был использован комплексный набор широко применяемых индексов читабельности23,27. Для охвата взаимодополняющих аспектов читабельности, включая длину предложения, длину слова, количество слогов, сложность на основе количества символов, легкость чтения и расчетный уровень образования, были выбраны семь индексов, что позволило снизить зависимость от какой-либо одной формулы. В частности, рассчитывались индекс Коулмана-Лиау (CL), формула Linsear Write (LW), автоматизированный индекс читабельности (ARI), простой показатель «тарабарщины» SMOG (SMOG), индекс Ганнинга-Фога (GFOG), показатель легкости чтения Флеша (FRES) и уровень образования по Флешу-Кинкейду (FKGL). Эти индексы позволяют оценить сложность чтения или требуемый уровень образования и предоставляют количественные показатели читабельности текста (Таблица 2).

Оценка образованной пригодности и качества информации

Пригодность материалов для обучения оценивали с помощью инструмента оценки образовательных материалов для пациентов (Patient Education Materials Assessment Tool, PEMAT), который включает две области: понятность и возможность применения на практике28. Данный инструмент содержит 24 пункта, из которых 16 оценивают понятность и восемь — возможность применения. Каждый пункт оценивался дихотомически (0 = критерий не соблюден; 1 = критерий соблюден), что давало общую сумму баллов от 0 до 24, где более высокие значения указывали на большую пригодность для обучения пациентов. Общее качество информации оценивали с помощью глобального показателя качества (Global Quality Score, GQS)27 — широко используемой пятибалльной шкалы Лайкерта для оценки качества медицинской информации (Таблица 3).

25 ноября 2025 года два клинических эксперта с опытом управления TN более 3 лет оценили все ответы, сгенерированные ИИ, с помощью обоих инструментов оценки. Перед выставлением баллов все ответы ИИ были анонимизированы с помощью кодовых идентификаторов, а рецензенты не знали, какая платформа LLM использовалась, во время проведения оценок PEMAT и GQS. Разногласия разрешались третьим старшим экспертом, который выносил окончательный вердикт по баллам. Межэкспертная надежность оценивалась с помощью коэффициента каппа Коэна, где значения >0.75 указывали на отличное согласие, 0,40–0,75 — на приемлемое согласие, а <0,40 — на низкое согласие. Значения каппа Коэна как для PEMAT, так и для GQS превысили 0,75, что продемонстрировало отличную межэкспертную надежность.

Статистический анализ

Все статистические анализы были выполнены с использованием программного обеспечения R (версия 4.4.3). Нормальность распределения данных оценивали с помощью теста Шапиро-Уилка и графиков Q-Q. Переменные с нормальным распределением представляли в виде среднего значения ± стандартного отклонения и сравнивали с помощью однофакторного дисперсионного анализа (ANOVA) с последующим апостериорным тестом Тьюки, где это было применимо. Переменные с ненормальным распределением представляли в виде медиан и межквартильных размахов и сравнивали с помощью критерия Краскела-Уоллиса с последующим апостериорным тестом Данна с поправкой Бонферрони для попарных сравнений. Корреляции между индексами читабельности, баллами PEMAT и значениями GQS оценивали с помощью коэффициента ранговой корреляции Спирмена с применением поправки Бенджамини-Хохберга для множественного тестирования. Двустороннее скорректированное значение P < 0,05 считалось статистически значимым.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании систематически оценивалось влияние больших языковых моделей (LLM) и различных категорий содержания санитарного просвещения на удобочитаемость и качество генерируемых текстов. Во-первых, мы сравнили эффективность пяти LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5 — с точки зрения пригодности для обучения пациентов, общего качества информации и нескольких показателей удобочитаемости, включая индекс PEMAT, GQS и общепринятые индексы удобочитаемости (ARI, FRES, GFOG, FKGL, CL, SMOG и LW). Во-вторых, мы изучили те же показатели результатов в пяти тематических областях содержания санитарного просвещения: базовые знания о заболевании, этиология и факторы риска, диагностика, лечение, а также профилактика и реабилитация. Интегрируя эти два аналитических подхода, мы дополнительно исследовали, как тип модели и категория контента совместно влияют на качество и удобочитаемость текста, выявляя тем самым систематические закономерности в материалах для обучения пациентов, созданных с помощью LLM.

Анализ читабельности с использованием различных больших языковых моделей

Для систематического сравнения лингвистической сложности текстов, связанных с невралгией тройничного нерва и созданных пятью большими языковыми моделями (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5), были использованы семь установленных индексов читабельности. Общие результаты обобщены в Таблице 4, а распределение отдельных показателей читабельности представлено на Рисунке 1A–G. Среди пяти моделей наблюдались статистически значимые различия по всем индексам читабельности, при этом для каждого из них P < 0,001.

GPT-5 продемонстрировала самые высокие медианные значения ARI, GFOG, FKGL, CL и SMOG и самое низкое значение FRES, что указывает на генерацию текстов с более длинными синтаксическими структурами предложений, более сложным словарем и наибольшей общей когнитивной нагрузкой при чтении (Рисунок 1A–G). Напротив, Wenxin Yiyan продемонстрировала самую низкую лингвистическую сложность. Медианные значения ARI, GFOG, FKGL, CL и SMOG для этой модели были самыми низкими среди пяти исследованных моделей, в то время как показатель FRES был самым высоким.

Doubao, DeepSeek и Tongyi Qianwen продемонстрировали промежуточный уровень читаемости между GPT-5 и Wenxin Yiyan. Doubao и DeepSeek показали сопоставимые результаты по индексам уровней обучения, включая ARI, GFOG, FKGL и CL, причем у обоих показатели были значимо выше, чем у Wenxin Yiyan (все P < 0.05). Эти результаты указывают на схожую общую сложность чтения для Doubao и DeepSeek, которая выше, чем у Wenxin Yiyan.

Tongyi Qianwen в целом демонстрировал значения, промежуточные между показателями Doubao/DeepSeek и GPT-5 по большинству индексов удобочитаемости. Примечательно, что его показатель CL был ближе к значению GPT-5, что указывает на несколько большую лингвистическую сложность по сравнению с Doubao и DeepSeek, хотя он все равно оставался менее сложным, чем GPT-5. Индекс LW продемонстрировал характер распределения, отличный от других метрик удобочитаемости. Wenxin Yiyan достиг самого высокого значения LW (60.00), за ним следуют Tongyi Qianwen, DeepSeek и Doubao, в то время как GPT-5 имел самый низкий показатель LW (46.50). Это расхождение отражает различия в том, как отдельные формулы удобочитаемости оценивают длину предложения и сложность слов (Рисунок 1G).

В целом, среди пяти больших языковых моделей наблюдались значительные различия в лингвистической сложности. GPT-5 генерировала наиболее лингвистически сложные тексты, Wenxin Yiyan создавала самый доступный для чтения контент, а остальные модели демонстрировали промежуточные уровни читабельности, хотя структурные различия были очевидны.

Сравнение пригодности для обучения пациентов и общего качества различных больших языковых моделей

Значительные различия в пригодности материалов для обучения пациентов, оцененные с помощью PEMAT, наблюдались между пятью языковыми моделями (Рисунок 1H; Таблица 4), при этом все P < 0,001. GPT-5 получила наивысший балл PEMAT по оценке экспертов (9,40 ± 1,90), что указывает на более высокую образовательную пригодность в рамках данной системы сравнительного анализа. Однако этот результат не следует интерпретировать как доказательство того, что материалы, созданные GPT-5, улучшают реальное понимание, удовлетворенность, доверие пациентов, их поведение в отношении здоровья или клинические исходы.

DeepSeek продемонстрировал средний балл по шкале PEMAT (6,80 ± 1,06) с относительно компактным распределением показателей, что указывает на стабильную эффективность при создании образовательных материалов для пациентов. Тем не менее, общий уровень его пригодности с образовательной точки зрения остался значительно ниже, чем у GPT-5 (P < 0,001). Модели Doubao, Tongyi Qianwen и Wenxin Yiyan показали более низкие баллы PEMAT (5,35 ± 1,04, 5,65 ± 1,09 и 5,35 ± 0,93 соответственно). Между этими тремя моделями не было обнаружено значимых различий, и все они продемонстрировали результаты значительно хуже, чем DeepSeek и GPT-5 (все P < 0,01). Эти результаты свидетельствуют о сопоставимой, но ограниченной образовательной пригодности данных моделей, особенно в отношении ясности инструкций, лингвистической организации и легкости понимания.

Аналогичная закономерность наблюдалась и для общего качества информации, оцененного с помощью GQS (Рисунок 1I). Между пятью моделями были выявлены статистически значимые различия, при этом все P < 0.001. GPT-5 достигла наивысшего балла GQS (4.00 ± 0.65). Ее показатели сосредоточились в диапазоне 4–5 с ограниченной вариабельностью, что свидетельствует о стабильно высоких результатах в отношении связности содержания, структурной полноты и практической полезности.

За ними последовали DeepSeek и Doubao с показателями GQS 3,35 ± 0,59 и 3,40 ± 0,50 соответственно. Распределение их баллов было сосредоточено в диапазоне от 3 до 4, что свидетельствует об умеренном качестве информации и приемлемой надежности. Напротив, Tongyi Qianwen и Wenxin Yiyan получили самые низкие баллы GQS (2,50 ± 0,51 и 2,20 ± 0,52 соответственно). Распределение их показателей было смещено к нижней части шкалы, что указывает на ограниченную точность информации, недостаточную структурную строгость и недостаточную глубину содержания, которые могут снизить их полезность для обучения пациентов.

В целом, GPT-5 продемонстрировал самые высокие баллы PEMAT и GQS по оценке экспертов в данном наборе данных, в то время как DeepSeek и Doubao показали средние результаты. Tongyi Qianwen и Wenxin Yiyan получили более низкие оценки GQS. Эти результаты представляют собой данные экспертного бенчмаркинга и не должны интерпретироваться как доказательство клинической готовности или эффективности на уровне пациентов.

Сравнение читабельности, пригодности для обучения пациентов и общего качества в различных категориях образовательного контента в области здравоохранения

Анализ по категориям содержания выявил значительные различия в доступности чтения (readability) по пяти темам санитарного просвещения (Таблица 5). Для FRES были обнаружены статистически значимые различия между тематическими категориями (P = 0.004). Более высокие значения FRES указывают на более легкое чтение. Тексты с базовыми знаниями о заболевании оказались наиболее доступными (медиана = 28.50), за ними следует контент по диагностике (медиана = 16.00), этиологии и факторам риска (медиана = 12.50), а также контент, связанный с лечением (медиана = 11.50). Напротив, тексты по профилактике и реабилитации продемонстрировали самую низкую доступность (медиана FRES = 1.00), что указывает на наибольшую сложность чтения.

Аналогичные закономерности наблюдались и для других индексов читабельности. GFOG и FKGL значимо различались между тематическими категориями (P = 0.002 и P = 0.036 соответственно), при этом оба индекса указывали на более высокий уровень сложности чтения для материалов по этиологии, факторам риска, а также профилактике и реабилитации. Индекс SMOG также показал, что тексты об этиологии и факторах риска содержали большую долю многосложных слов (P = 0.039). Наибольшие различия наблюдались для CL (P < 0.001). Тексты по профилактике и реабилитации содержали самые длинные предложения (медиана = 21.01), что существенно повышало сложность чтения, в то время как тексты с базовыми сведениями о заболевании содержали самые короткие предложения (медиана = 14.88), что соответствовало наименьшей когнитивной нагрузке при чтении. Значимых различий между категориями контента для ARI или LW выявлено не было.

Статистически значимых различий в пригодности материалов для обучения пациентов между пятью категориями контента на основе баллов PEMAT выявлено не было (P = 0.252). Средние баллы PEMAT варьировались от 5.90 до 7.20, что указывает на то, что, несмотря на заметные различия в лингвистической сложности, пригодность для обучения оставалась относительно стабильной для всех тем. Аналогично, общее качество информации, оцененное с помощью GQS, существенно не различалось между категориями контента (P = 0.822). Средние значения GQS варьировались от 2.95 до 3.25, что свидетельствует о том, что общее качество информации было относительно стабильным для всех тематических разделов контента.

В целом, были отмечены существенные различия в уровне читабельности текстов по различным темам санитарного просвещения: наибольшая сложность чтения наблюдалась в материалах по этиологии и факторам риска, а также по профилактике и реабилитации, в то время как наиболее доступными были тексты с базовыми знаниями о заболеваниях. Напротив, пригодность материалов для обучения пациентов и общее качество информации оставались относительно неизменными во всех категориях контента.

Корреляционный анализ между доступностью текста, пригодностью для обучения пациентов и общим качеством

Матрица корреляции на рисунке 2 демонстрирует устойчивые и значимые взаимосвязи между индексами удобочитаемости, что указывает на высокую внутреннюю согласованность. Большинство показателей удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, проявили умеренную или сильную положительную корреляцию друг с другом, при этом коэффициенты корреляции варьировались от 0,64 до 0,97 (все P < 0,001). Эти результаты дополнительно подтверждают взаимодополняющий характер данных индексов при оценке лингвистической сложности. Напротив, FRES показал значимые отрицательные корреляции с несколькими показателями удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, при абсолютных значениях коэффициентов корреляции более 0,70 (все P < 0,001). Такая закономерность отражает обратную направленность шкалы FRES, где более высокие баллы указывают на более высокую степень удобочитаемости. Индекс LW также продемонстрировал значимые отрицательные корреляции с другими индексами удобочитаемости, включая ARI, FKGL, GFOG и SMOG, при абсолютных коэффициентах корреляции от 0,75 до 0,90 (все P < 0,001). И наоборот, LW положительно коррелировал с FRES (коэффициент корреляции = 0,69, P < 0,001).

Также наблюдались четкие взаимосвязи между индексами читабельности и общим качеством информации, измеренным с помощью GQS. GQS продемонстрировал слабую или умеренную положительную корреляцию с большинством показателей читабельности, включая ARI, GFOG, FKGL, CL и SMOG, при коэффициентах корреляции от 0,326 до 0,391 (все P < 0,001). Эти результаты позволяют предположить, что большая лингвистическая сложность была связана с более высоким качеством информации по оценке экспертов. Напротив, GQS умеренно отрицательно коррелировал с FRES (коэффициент корреляции = −0,408, P < 0,001), что указывает на то, что тексты, требующие более высокого уровня чтения, в целом получали более высокие оценки GQS. GQS также показал умеренную отрицательную корреляцию с LW (коэффициент корреляции = −0,421, P < 0,001).

Связи между удобочитаемостью и пригодностью материалов для обучения пациентов, оцененные с помощью PEMAT, в целом оказались более слабыми, но сохраняли согласованное направление. Показатели PEMAT демонстрировали слабую положительную корреляцию с ARI, GFOG, FKGL, CL и SMOG, при этом коэффициенты корреляции варьировались от 0,305 до 0,434 (все P < 0,01). Напротив, показатели PEMAT были слабо отрицательно коррелированы с FRES и LW, с абсолютными коэффициентами корреляции 0,432 и 0,320 соответственно (оба P < 0,01). Эти результаты позволяют предположить, что в данном наборе данных большая лингвистическая сложность была связана с умеренно более высокой оценкой экспертами пригодности материалов для обучения, хотя сила этих связей была ограниченной.

Важно отметить, что была наблюдаться умеренная положительная корреляция между показателями PEMAT и GQS (коэффициент корреляции = 0,645, P < 0,001). Это была самая сильная связь среди всех оцениваемых областей, что указывает на то, что ответы с более высокой образовательной пригодностью также имели тенденцию получать более высокие оценки общего качества информации.

ДОСТУПНОСТЬ ДАННЫХ:

Полный набор данных, поддерживающий это исследование, представлен в виде дополнительных материалов. Дополнительный файл 1 содержит полный список стандартизированных вопросов, подсказок и 100 архивных ответов, сгенерированных LLM. Дополнительная таблица 2 содержит экспертные листы оценки PEMAT и GQS, включая рейтинги PEMAT по отдельным пунктам (где применимо), общие баллы PEMAT, баллы GQS, информацию о сравнении оценивающих и записи о вынесении окончательного решения в соответствующих случаях. Показатели читабельности, исходные данные для рисунков и код анализа в R представлены в Дополнительном файле 2. Поскольку результаты работы LLM могут меняться с течением времени из-за обновлений моделей, изменений интерфейса и модификаций на уровне платформы, для проверки и вторичного анализа следует использовать архивные результаты, а не повторно сгенерированные ответы.

figure-results-1
Рисунок 1: Сравнение читабельности, пригодности для обучения пациентов и общего качества информации между пятью большими языковыми моделями. (A–G>) На данной панели представлены индексы читабельности: автоматизированный индекс читабельности (ARI), показатель легкости чтения Флеша (FRES), индекс тумана Ганнинга (GFOG), уровень класса по Флешу-Кинкейду (FKGL), индекс Коулмана-Лиау (CL), простой показатель «бессмыслицы» (SMOG) и линейная формула письма (LW). (H>) На этой панели показаны общие баллы PEMAT, а на панели (I>) — общие показатели качества (GQS). На каждом боксплоте центральная линия представляет медиану, прямоугольник указывает межквартильный размах (IQR), усы extending до 1,5 × IQR, а точки за пределами усов представляют собой выбросы. Сокращения: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = инструмент оценки материалов для обучения пациентов по доступности и применимости (Patient Education Materials Assessment Tool for Understandability and Actionability), печатный формат; GQS = общий показатель качества (Global Quality Score). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Матрица корреляции Спирмена между индексами читабельности, пригодностью материалов для обучения пациентов и общим качеством информации во всех ответах, сгенерированных моделями.В матрице приведены коэффициенты корреляции Спирмена для попарных связей между ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT и GQS. Сокращения: ARI = Automated Readability Index (автоматизированный индекс читабельности); FRES = Flesch Reading Ease Score (показатель легкости чтения Флеша); GFOG = Gunning Fog Index (индекс «тумана» Ганнинга); FKGL = Flesch-Kincaid Grade Level (уровень класса по Флешу-Кинкейду); CL = Coleman-Liau Index (индекс Коулмана-Лиау); SMOG = Simple Measure of Gobbledygook (простой показатель «тарабарщины»); LW = Linsear Write (линейное письмо); PEMAT = Patient Education Materials Assessment Tool (инструмент оценки материалов для обучения пациентов); GQS = Global Quality Score (общий показатель качества). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Таблица 1: Список из 20 вопросов, касающихся невралгии тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Таблица 2: Инструменты, формулы и описания показателей читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Таблица 3: Критерии качества глобального показателя качества (GQS). Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Таблица 4: Результаты анализа различных больших языковых моделей по наиболее распространенным вопросам, связанным с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Таблица 5: Результаты анализа по различным измерениям для наиболее распространенных вопросов, связанных с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 1: Показатели читабельности ответов, сгенерированных пятью большими языковыми моделями, по всем оцениваемым индексам читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 2: Оценки экспертов по пригодности для обучения пациентов (PEMAT) и общему качеству информации (GQS) для ответов, сгенерированных пятью большими языковыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 1: Стандартизированные вопросы по тригеминальной невралгии и полные ответы, сгенерированные пятью большими языковыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 2: R-скрипты и исходные данные, использованные для статистического анализа и построения рисунков. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном кросс-секционном сравнительном исследовании систематически анализировались удобочитаемость, образовательная пригодность и общее качество информации в материалах для обучения пациентов с невралгией тройничного нерва (НТН), созданных пятью общедоступными большими языковыми моделями (LLM). Были получены четыре основных результата. Во-первых, удобочитаемость существенно различалась в зависимости от модели: GPT-5 генерировала наиболее лингвистически сложные ответы, а Wenxin Yiyan — наиболее легкочитаемый контент. Во-вторых, удобочитаемость и экспертная оценка качества информации оказались отдельными параметрами оценки, при этом GPT-5 получила самые высокие баллы по шкалам PEMAT и GQS, несмотря на более низкую удобочитаемость. В-третьих, тематика контента влияла на удобочитаемость: темы профилактики, реабилитации, этиологии и факторов риска в целом требовали более высокого уровня чтения, в то время как показатели PEMAT и GQS оставались относительно стабильными во всех категориях контента. Наконец, индексы удобочитаемости продемонстрировали высокую внутреннюю согласованность, а корреляционный анализ выявил слабую или умеренную положительную связь между лингвистической сложностью и показателями PEMAT и GQS, а также умеренную положительную корреляцию между PEMAT и GQS. В совокупности эти данные создают базу для оценки материалов по обучению пациентов с НТН, созданных с помощью LLM, подчеркивая необходимость баланса между полнотой медицинской информации и доступностью языка. Важно отметить, что данные результаты представляют собой итоги экспертного сравнительного анализа и не должны интерпретироваться как доказательство понимания материала пациентами, фактической точности, клинической безопасности или готовности к рутинному клиническому применению.

Результаты данного исследования согласуются с предыдущими оценками медицинской информации, созданной ИИ, в которых сообщалось о значительной вариативности между LLM и частом несоответствии между удобочитаемостью и качеством информации26,27,29. Предыдущие исследования по нескольким областям заболеваний показали, что материалы для обучения пациентов, созданные LLM, часто превышают рекомендованные уровни сложности чтения, а модели, создающие наиболее удобочитаемый текст, не обязательно предоставляют самую исчерпывающую или самую качественную информацию26,30. Результаты в области обучения при TN подтверждают это наблюдение. GPT-5 генерировал наиболее лингвистически сложные ответы, однако достиг самых высоких показателей по шкалам PEMAT и GQS, в то время как Wenxin Yiyan создавал более удобочитаемый текст, но имел более низкие оценки экспертов по образовательной пригодности и общему качеству. Кроме того, удобочитаемость варьировалась в зависимости от тематических областей: темы профилактики, реабилитации, этиологии и факторов риска, как правило, демонстрировали большую лингвистическую сложность, что позволяет предположить, что на трудность чтения влияют как характеристики модели, так и сложность темы31.

Видимый компромисс между читабельностью и качеством информации согласуется с различными конструктами, измеряемыми инструментами оценки. Формулы читабельности в первую очередь оценивают поверхностные лингвистические характеристики, такие как длина предложений и лексическая сложность, тогда как PEMAT и GQS оценивают атрибуты более высокого порядка, включая организацию информации, полноту, ясность объяснений и практическую применимость32. В образовании по вопросам опухолей носоглотки (TN) высококачественные ответы часто включают обсуждение тревожных симптомов, дифференциальную диагностику, фармакологическое лечение и побочные эффекты, интервенционные и хирургические варианты, а также индивидуализированные стратегии реабилитации33. Такое клинически исчерпывающее содержание неизбежно повышает терминологическую плотность и синтаксическую сложность, что приводит к более высоким показателям индекса читабельности и более высокому качеству обучения по оценке экспертов. Важно, чтобы эти результаты не интерпретировались как утверждение о предпочтительности более сложного языка. Напротив, они указывают на то, что современные LLM часто повышают информационную полноту за счет снижения лингвистической доступности. Следовательно, дальнейшая разработка систем обучения пациентов должна быть сосредоточена на сохранении медицинской точности при одновременном упрощении языка за счет пересмотра текста в доступном стиле, структурированного представления ключевых моментов, объяснения технической терминологии и предоставления четких, практически применимых рекомендаций, подходящих для пациентов с разным уровнем медицинской грамотности11,34,35.

Корреляционный анализ дополнительно подтверждает различие между читабельностью и образовательным качеством. Большинство индексов читабельности, основанных на уровне образования, продемонстрировали слабую или умеренную положительную связь как с PEMAT, так и с GQS, в то время как FRES показал ожидаемую обратную зависимость, так как более высокие показатели FRES указывают на более легкую читабельность. Эти результаты не означают, что большая лингвистическая сложность является желательной; скорее, они свидетельствуют о том, что современные LLM часто достигают большей информационной полноты за счет доступности34. Соответственно, разработка материалов для обучения пациентов с помощью ИИ должна отдавать приоритет медицинской точности и полноте, включая при этом редактирование текстов простым языком, структурированное представление ключевых моментов, четкие объяснения технической терминологии и практические рекомендации, адаптированные для пациентов с разным уровнем медицинской грамотности11,35.

Дополнительным методологическим результатом стало выявление отличия поведения индекса LW от других показателей удобочитаемости. В отличие от ARI, FKGL, GFOG, CL и SMOG, LW демонстрировал закономерности, более схожие с FRES, что отражает различия в том, как формулы удобочитаемости определяют сложность текста36. Поскольку LW изначально был разработан для технических руководств и делает акцент на структуре выборочных предложений и классификации слов, а не на общих характеристиках предложений или слогов, он может по-разному реагировать на медицинские тексты, созданные ИИ, в которых краткие утверждения сочетаются с более длинными пояснительными passage-ами и неравномерным распределением технической терминологии37,38. Эти результаты подтверждают важность использования многометрической системы оценки, так как ни один отдельный индекс удобочитаемости не охватывает в полной мере все аспекты сложности текста. В соответствии с предыдущими исследованиями медицинской информации, созданной ИИ, общую удобочитаемость следует интерпретировать на основе конвергентных данных нескольких взаимодополняющих индексов, а не одного отдельного показателя39.

Категория контента также повлияла на удобочитаемость. Темы профилактики, реабилитации, этиологии и факторов риска, как правило, приводили к созданию текстов с более высоким уровнем сложности чтения, чем базовые сведения о заболевании; вероятно, это связано с тем, что данные темы требуют предоставления условных рекомендаций, механистических объяснений и использования более специализированной терминологии40,41. Напротив, базовые сведения о заболевании основаны преимущественно на определениях и могут быть переданы более простым языком42. Несмотря на эти различия, показатели PEMAT и GQS оставались относительно стабильными во всех тематических областях, что говорит о сохранении экспертно оцененной образовательной пригодности и общего качества информации для различных типов вопросов пациентов35,43.

Данные результаты имеют несколько важных последствий для клинической практики и дальнейшей разработки LLM. Поскольку пациенты все чаще используют LLM для получения информации до или после медицинских консультаций, контент, созданный ИИ, должен дополнять, а не заменять консультирование врача, особенно в вопросах безопасности лекарственных средств, показаний к интервенционному или хирургическому лечению, а также распознавания «красных флажков» — симптомов, требующих срочного обследования44. Организациям здравоохранения может быть выгодно предоставлять проверенные экспертами образовательные ресурсы на доступном языке, используя LLM в качестве инструментов для составления черновиков или поддержки принятия решений, а не как автономные системы обучения пациентов. Будущие модели должны включать стратегии генерации с учетом читабельности, прозрачную отчетность о версиях моделей и датах генерации, явное сообщение о степени неопределенности, а также процедуры управления, включая рецензирование врачом, проверку фактической точности, скрининг на наличие галлюцинаций, проверку безопасности лекарственных средств, руководство по «красным флажкам» и тестирование понимания материала пациентами перед внедрением в клиническую практику26,44,45.

Данное исследование имеет несколько ограничений. Результаты работы моделей были собраны через общедоступные веб-интерфейсы в одну определенную дату; последующие обновления моделей, изменения интерфейса, скрытые системные промпты или настройки генерации по умолчанию могут повлиять на воспроизводимость. Набор из 20 вопросов был разработан клиническими экспертами, а не выведен из логов поисковых запросов пациентов или официальных интервью с пациентами, что может привести к систематической ошибке отбора. Кроме того, исследование опиралось на оценки PEMAT и GQS, выставленные экспертами, и не оценивало понимание, доверие, удовлетворенность пациентов, их поведение в отношении здоровья или клинические исходы. Формулы читабельности, PEMAT и GQS также не позволяют напрямую оценить фактическую точность, риск галлюцинаций, точность цитирования, полноту перечня противопоказаний или клиническую безопасность. Следовательно, данные результаты следует интерпретировать как экспертный одномоментный сравнительный анализ, а не как доказательство того, что любой материал, созданный LLM, готов к рутинному клиническому применению. Будущие исследования должны включать архивацию результатов работы моделей, подробные метаданные моделей, многоязычные оценки, более обширные наборы вопросов, формальный аудит безопасности, оценку фактической точности и показатели результатов, ориентированные на пациента, прежде чем образовательные материалы, созданные с помощью LLM, будут рассмотрены для внедрения в клиническую практику.

В данном сравнительном одномоментном исследовании, оцененном экспертами, общедоступные большие языковые модели продемонстрировали существенные различия в удобочитаемости, образовательной пригодности и общем качестве информации в материалах для обучения пациентов с невралгией тройничного нерва. GPT-5 получила самые высокие баллы по шкалам PEMAT и GQS по оценке экспертов, но при этом генерировала наиболее лингвистически сложные ответы, что подчеркивает, что удобочитаемость и образовательное качество, оцениваемое экспертами, представляют собой взаимосвязанные, но разные аспекты обучения пациентов. Хотя некоторые модели создавали более легкочитаемый контент, это не обязательно приводило к повышению образовательной пригодности или общего качества информации. Поскольку в данном исследовании фактическая точность не оценивалась с помощью специального аудита безопасности, не анализировались риск галлюцинаций, точность цитирования, понимание материала пациентами, доверие, удовлетворенность, поведение в отношении здоровья или клинические исходы, полученные результаты следует интерпретировать как экспертный сравнительный анализ, а не как доказательство клинической готовности к применению. Будущие исследования должны включать экспертный обзор, формальную оценку безопасности и фактической точности, а также пациент-центрированные оценки для поддержки безопасного и эффективного использования материалов, созданных LLM, в обучении пациентов.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют об отсутствии конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Данное исследование не получило специальных грантов от каких-либо финансирующих организаций в государственном, коммерческом или некоммерческом секторах. Авторы выражают благодарность коллегам-клиницистам, которые предоставили отзывы по набору вопросов о тригеминальной невралгии и помогли в доработке структуры оценки. Мы также благодарим всех авторов, оказавших поддержку в подготовке и пересмотре рукописи.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Чат-платформа DeepSeekDeepSeekhttps://chat.deepseek.com/Общедоступный интерфейс большой языковой модели, используемый для генерации ответов
Чат-платформа DoubaoDoubaohttps://www.doubao.com/chat/Общедоступный интерфейс большой языковой модели, используемый для генерации ответов
GPT 5 OpenAIhttps://chat.openai.com/Общедоступный интерфейс большой языковой модели, используемый для генерации ответов
Программное обеспечение R, версия 4.4.3R Foundation for Statistical ComputingНеприменимоСтатистический анализ и визуализация
Онлайн-калькулятор читабельности Readability FormulasReadability FormulasНеприменимоОнлайн-инструмент, используемый для вычисления индексов читабельности
Чат-платформа Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Общедоступный интерфейс большой языковой модели, используемый для генерации ответов
Чат-платформа Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Общедоступный интерфейс большой языковой модели, используемый для генерации ответов

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

PEMATGQS

Похожие статьи