$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В данном исследовании систематически оценивалось влияние больших языковых моделей (LLM) и различных категорий содержания санитарного просвещения на удобочитаемость и качество генерируемых текстов. Во-первых, мы сравнили эффективность пяти LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5 — с точки зрения пригодности для обучения пациентов, общего качества информации и нескольких показателей удобочитаемости, включая индекс PEMAT, GQS и общепринятые индексы удобочитаемости (ARI, FRES, GFOG, FKGL, CL, SMOG и LW). Во-вторых, мы изучили те же показатели результатов в пяти тематических областях содержания санитарного просвещения: базовые знания о заболевании, этиология и факторы риска, диагностика, лечение, а также профилактика и реабилитация. Интегрируя эти два аналитических подхода, мы дополнительно исследовали, как тип модели и категория контента совместно влияют на качество и удобочитаемость текста, выявляя тем самым систематические закономерности в материалах для обучения пациентов, созданных с помощью LLM.
Анализ читабельности с использованием различных больших языковых моделей
Для систематического сравнения лингвистической сложности текстов, связанных с невралгией тройничного нерва и созданных пятью большими языковыми моделями (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen и GPT-5), были использованы семь установленных индексов читабельности. Общие результаты обобщены в Таблице 4, а распределение отдельных показателей читабельности представлено на Рисунке 1A–G. Среди пяти моделей наблюдались статистически значимые различия по всем индексам читабельности, при этом для каждого из них P < 0,001.
GPT-5 продемонстрировала самые высокие медианные значения ARI, GFOG, FKGL, CL и SMOG и самое низкое значение FRES, что указывает на генерацию текстов с более длинными синтаксическими структурами предложений, более сложным словарем и наибольшей общей когнитивной нагрузкой при чтении (Рисунок 1A–G). Напротив, Wenxin Yiyan продемонстрировала самую низкую лингвистическую сложность. Медианные значения ARI, GFOG, FKGL, CL и SMOG для этой модели были самыми низкими среди пяти исследованных моделей, в то время как показатель FRES был самым высоким.
Doubao, DeepSeek и Tongyi Qianwen продемонстрировали промежуточный уровень читаемости между GPT-5 и Wenxin Yiyan. Doubao и DeepSeek показали сопоставимые результаты по индексам уровней обучения, включая ARI, GFOG, FKGL и CL, причем у обоих показатели были значимо выше, чем у Wenxin Yiyan (все P < 0.05). Эти результаты указывают на схожую общую сложность чтения для Doubao и DeepSeek, которая выше, чем у Wenxin Yiyan.
Tongyi Qianwen в целом демонстрировал значения, промежуточные между показателями Doubao/DeepSeek и GPT-5 по большинству индексов удобочитаемости. Примечательно, что его показатель CL был ближе к значению GPT-5, что указывает на несколько большую лингвистическую сложность по сравнению с Doubao и DeepSeek, хотя он все равно оставался менее сложным, чем GPT-5. Индекс LW продемонстрировал характер распределения, отличный от других метрик удобочитаемости. Wenxin Yiyan достиг самого высокого значения LW (60.00), за ним следуют Tongyi Qianwen, DeepSeek и Doubao, в то время как GPT-5 имел самый низкий показатель LW (46.50). Это расхождение отражает различия в том, как отдельные формулы удобочитаемости оценивают длину предложения и сложность слов (Рисунок 1G).
В целом, среди пяти больших языковых моделей наблюдались значительные различия в лингвистической сложности. GPT-5 генерировала наиболее лингвистически сложные тексты, Wenxin Yiyan создавала самый доступный для чтения контент, а остальные модели демонстрировали промежуточные уровни читабельности, хотя структурные различия были очевидны.
Сравнение пригодности для обучения пациентов и общего качества различных больших языковых моделей
Значительные различия в пригодности материалов для обучения пациентов, оцененные с помощью PEMAT, наблюдались между пятью языковыми моделями (Рисунок 1H; Таблица 4), при этом все P < 0,001. GPT-5 получила наивысший балл PEMAT по оценке экспертов (9,40 ± 1,90), что указывает на более высокую образовательную пригодность в рамках данной системы сравнительного анализа. Однако этот результат не следует интерпретировать как доказательство того, что материалы, созданные GPT-5, улучшают реальное понимание, удовлетворенность, доверие пациентов, их поведение в отношении здоровья или клинические исходы.
DeepSeek продемонстрировал средний балл по шкале PEMAT (6,80 ± 1,06) с относительно компактным распределением показателей, что указывает на стабильную эффективность при создании образовательных материалов для пациентов. Тем не менее, общий уровень его пригодности с образовательной точки зрения остался значительно ниже, чем у GPT-5 (P < 0,001). Модели Doubao, Tongyi Qianwen и Wenxin Yiyan показали более низкие баллы PEMAT (5,35 ± 1,04, 5,65 ± 1,09 и 5,35 ± 0,93 соответственно). Между этими тремя моделями не было обнаружено значимых различий, и все они продемонстрировали результаты значительно хуже, чем DeepSeek и GPT-5 (все P < 0,01). Эти результаты свидетельствуют о сопоставимой, но ограниченной образовательной пригодности данных моделей, особенно в отношении ясности инструкций, лингвистической организации и легкости понимания.
Аналогичная закономерность наблюдалась и для общего качества информации, оцененного с помощью GQS (Рисунок 1I). Между пятью моделями были выявлены статистически значимые различия, при этом все P < 0.001. GPT-5 достигла наивысшего балла GQS (4.00 ± 0.65). Ее показатели сосредоточились в диапазоне 4–5 с ограниченной вариабельностью, что свидетельствует о стабильно высоких результатах в отношении связности содержания, структурной полноты и практической полезности.
За ними последовали DeepSeek и Doubao с показателями GQS 3,35 ± 0,59 и 3,40 ± 0,50 соответственно. Распределение их баллов было сосредоточено в диапазоне от 3 до 4, что свидетельствует об умеренном качестве информации и приемлемой надежности. Напротив, Tongyi Qianwen и Wenxin Yiyan получили самые низкие баллы GQS (2,50 ± 0,51 и 2,20 ± 0,52 соответственно). Распределение их показателей было смещено к нижней части шкалы, что указывает на ограниченную точность информации, недостаточную структурную строгость и недостаточную глубину содержания, которые могут снизить их полезность для обучения пациентов.
В целом, GPT-5 продемонстрировал самые высокие баллы PEMAT и GQS по оценке экспертов в данном наборе данных, в то время как DeepSeek и Doubao показали средние результаты. Tongyi Qianwen и Wenxin Yiyan получили более низкие оценки GQS. Эти результаты представляют собой данные экспертного бенчмаркинга и не должны интерпретироваться как доказательство клинической готовности или эффективности на уровне пациентов.
Сравнение читабельности, пригодности для обучения пациентов и общего качества в различных категориях образовательного контента в области здравоохранения
Анализ по категориям содержания выявил значительные различия в доступности чтения (readability) по пяти темам санитарного просвещения (Таблица 5). Для FRES были обнаружены статистически значимые различия между тематическими категориями (P = 0.004). Более высокие значения FRES указывают на более легкое чтение. Тексты с базовыми знаниями о заболевании оказались наиболее доступными (медиана = 28.50), за ними следует контент по диагностике (медиана = 16.00), этиологии и факторам риска (медиана = 12.50), а также контент, связанный с лечением (медиана = 11.50). Напротив, тексты по профилактике и реабилитации продемонстрировали самую низкую доступность (медиана FRES = 1.00), что указывает на наибольшую сложность чтения.
Аналогичные закономерности наблюдались и для других индексов читабельности. GFOG и FKGL значимо различались между тематическими категориями (P = 0.002 и P = 0.036 соответственно), при этом оба индекса указывали на более высокий уровень сложности чтения для материалов по этиологии, факторам риска, а также профилактике и реабилитации. Индекс SMOG также показал, что тексты об этиологии и факторах риска содержали большую долю многосложных слов (P = 0.039). Наибольшие различия наблюдались для CL (P < 0.001). Тексты по профилактике и реабилитации содержали самые длинные предложения (медиана = 21.01), что существенно повышало сложность чтения, в то время как тексты с базовыми сведениями о заболевании содержали самые короткие предложения (медиана = 14.88), что соответствовало наименьшей когнитивной нагрузке при чтении. Значимых различий между категориями контента для ARI или LW выявлено не было.
Статистически значимых различий в пригодности материалов для обучения пациентов между пятью категориями контента на основе баллов PEMAT выявлено не было (P = 0.252). Средние баллы PEMAT варьировались от 5.90 до 7.20, что указывает на то, что, несмотря на заметные различия в лингвистической сложности, пригодность для обучения оставалась относительно стабильной для всех тем. Аналогично, общее качество информации, оцененное с помощью GQS, существенно не различалось между категориями контента (P = 0.822). Средние значения GQS варьировались от 2.95 до 3.25, что свидетельствует о том, что общее качество информации было относительно стабильным для всех тематических разделов контента.
В целом, были отмечены существенные различия в уровне читабельности текстов по различным темам санитарного просвещения: наибольшая сложность чтения наблюдалась в материалах по этиологии и факторам риска, а также по профилактике и реабилитации, в то время как наиболее доступными были тексты с базовыми знаниями о заболеваниях. Напротив, пригодность материалов для обучения пациентов и общее качество информации оставались относительно неизменными во всех категориях контента.
Корреляционный анализ между доступностью текста, пригодностью для обучения пациентов и общим качеством
Матрица корреляции на рисунке 2 демонстрирует устойчивые и значимые взаимосвязи между индексами удобочитаемости, что указывает на высокую внутреннюю согласованность. Большинство показателей удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, проявили умеренную или сильную положительную корреляцию друг с другом, при этом коэффициенты корреляции варьировались от 0,64 до 0,97 (все P < 0,001). Эти результаты дополнительно подтверждают взаимодополняющий характер данных индексов при оценке лингвистической сложности. Напротив, FRES показал значимые отрицательные корреляции с несколькими показателями удобочитаемости, включая ARI, GFOG, FKGL, CL и SMOG, при абсолютных значениях коэффициентов корреляции более 0,70 (все P < 0,001). Такая закономерность отражает обратную направленность шкалы FRES, где более высокие баллы указывают на более высокую степень удобочитаемости. Индекс LW также продемонстрировал значимые отрицательные корреляции с другими индексами удобочитаемости, включая ARI, FKGL, GFOG и SMOG, при абсолютных коэффициентах корреляции от 0,75 до 0,90 (все P < 0,001). И наоборот, LW положительно коррелировал с FRES (коэффициент корреляции = 0,69, P < 0,001).
Также наблюдались четкие взаимосвязи между индексами читабельности и общим качеством информации, измеренным с помощью GQS. GQS продемонстрировал слабую или умеренную положительную корреляцию с большинством показателей читабельности, включая ARI, GFOG, FKGL, CL и SMOG, при коэффициентах корреляции от 0,326 до 0,391 (все P < 0,001). Эти результаты позволяют предположить, что большая лингвистическая сложность была связана с более высоким качеством информации по оценке экспертов. Напротив, GQS умеренно отрицательно коррелировал с FRES (коэффициент корреляции = −0,408, P < 0,001), что указывает на то, что тексты, требующие более высокого уровня чтения, в целом получали более высокие оценки GQS. GQS также показал умеренную отрицательную корреляцию с LW (коэффициент корреляции = −0,421, P < 0,001).
Связи между удобочитаемостью и пригодностью материалов для обучения пациентов, оцененные с помощью PEMAT, в целом оказались более слабыми, но сохраняли согласованное направление. Показатели PEMAT демонстрировали слабую положительную корреляцию с ARI, GFOG, FKGL, CL и SMOG, при этом коэффициенты корреляции варьировались от 0,305 до 0,434 (все P < 0,01). Напротив, показатели PEMAT были слабо отрицательно коррелированы с FRES и LW, с абсолютными коэффициентами корреляции 0,432 и 0,320 соответственно (оба P < 0,01). Эти результаты позволяют предположить, что в данном наборе данных большая лингвистическая сложность была связана с умеренно более высокой оценкой экспертами пригодности материалов для обучения, хотя сила этих связей была ограниченной.
Важно отметить, что была наблюдаться умеренная положительная корреляция между показателями PEMAT и GQS (коэффициент корреляции = 0,645, P < 0,001). Это была самая сильная связь среди всех оцениваемых областей, что указывает на то, что ответы с более высокой образовательной пригодностью также имели тенденцию получать более высокие оценки общего качества информации.
ДОСТУПНОСТЬ ДАННЫХ:
Полный набор данных, поддерживающий это исследование, представлен в виде дополнительных материалов. Дополнительный файл 1 содержит полный список стандартизированных вопросов, подсказок и 100 архивных ответов, сгенерированных LLM. Дополнительная таблица 2 содержит экспертные листы оценки PEMAT и GQS, включая рейтинги PEMAT по отдельным пунктам (где применимо), общие баллы PEMAT, баллы GQS, информацию о сравнении оценивающих и записи о вынесении окончательного решения в соответствующих случаях. Показатели читабельности, исходные данные для рисунков и код анализа в R представлены в Дополнительном файле 2. Поскольку результаты работы LLM могут меняться с течением времени из-за обновлений моделей, изменений интерфейса и модификаций на уровне платформы, для проверки и вторичного анализа следует использовать архивные результаты, а не повторно сгенерированные ответы.

Рисунок 1: Сравнение читабельности, пригодности для обучения пациентов и общего качества информации между пятью большими языковыми моделями. (A–G>) На данной панели представлены индексы читабельности: автоматизированный индекс читабельности (ARI), показатель легкости чтения Флеша (FRES), индекс тумана Ганнинга (GFOG), уровень класса по Флешу-Кинкейду (FKGL), индекс Коулмана-Лиау (CL), простой показатель «бессмыслицы» (SMOG) и линейная формула письма (LW). (H>) На этой панели показаны общие баллы PEMAT, а на панели (I>) — общие показатели качества (GQS). На каждом боксплоте центральная линия представляет медиану, прямоугольник указывает межквартильный размах (IQR), усы extending до 1,5 × IQR, а точки за пределами усов представляют собой выбросы. Сокращения: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = инструмент оценки материалов для обучения пациентов по доступности и применимости (Patient Education Materials Assessment Tool for Understandability and Actionability), печатный формат; GQS = общий показатель качества (Global Quality Score). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Матрица корреляции Спирмена между индексами читабельности, пригодностью материалов для обучения пациентов и общим качеством информации во всех ответах, сгенерированных моделями.В матрице приведены коэффициенты корреляции Спирмена для попарных связей между ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT и GQS. Сокращения: ARI = Automated Readability Index (автоматизированный индекс читабельности); FRES = Flesch Reading Ease Score (показатель легкости чтения Флеша); GFOG = Gunning Fog Index (индекс «тумана» Ганнинга); FKGL = Flesch-Kincaid Grade Level (уровень класса по Флешу-Кинкейду); CL = Coleman-Liau Index (индекс Коулмана-Лиау); SMOG = Simple Measure of Gobbledygook (простой показатель «тарабарщины»); LW = Linsear Write (линейное письмо); PEMAT = Patient Education Materials Assessment Tool (инструмент оценки материалов для обучения пациентов); GQS = Global Quality Score (общий показатель качества). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 1: Список из 20 вопросов, касающихся невралгии тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 2: Инструменты, формулы и описания показателей читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 3: Критерии качества глобального показателя качества (GQS). Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 4: Результаты анализа различных больших языковых моделей по наиболее распространенным вопросам, связанным с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 5: Результаты анализа по различным измерениям для наиболее распространенных вопросов, связанных с невралгией тройничного нерва. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 1: Показатели читабельности ответов, сгенерированных пятью большими языковыми моделями, по всем оцениваемым индексам читабельности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Оценки экспертов по пригодности для обучения пациентов (PEMAT) и общему качеству информации (GQS) для ответов, сгенерированных пятью большими языковыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 1: Стандартизированные вопросы по тригеминальной невралгии и полные ответы, сгенерированные пятью большими языковыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 2: R-скрипты и исходные данные, использованные для статистического анализа и построения рисунков. Пожалуйста, нажмите здесь, чтобы скачать этот файл.