本稿では、三叉神経痛に関する大規模言語モデル生成の患者向け情報を体系的に評価し、読みやすさ、教育的適切性、および質を検証するためのプロトコルを提示します。これにより、モデルのベンチマークを行い、患者向けコミュニケーションの指針を提供することを目的とします。
研究記事
本稿では、三叉神経痛に関する大規模言語モデル生成の患者向け情報を体系的に評価し、読みやすさ、教育的適切性、および質を検証するためのプロトコルを提示します。これにより、モデルのベンチマークを行い、患者向けコミュニケーションの指針を提供することを目的とします。
大規模言語モデル(LLM)は患者への健康教育にますます利用されていますが、三叉神経痛(TN)に関するLLM生成情報の読みやすさと教育的質については十分に評価されていません。この横断的ベンチマーク研究では、公開されている5つのLLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen、GPT-5)によって生成されたTN教育コンテンツを比較しました。疾患の基礎知識、病因・リスク因子、診断、治療、および予防・リハビリテーションを網羅する、頻繁に寄せられるTNに関する20の質問を、標準化されたプロンプトを用いて各モデルに提示しました。読みやすさは7つの確立された指標を用いて評価し、教育的な適切さはPatient Education Materials Assessment Tool for Understandability and Actionability(PEMAT)を用いて、そして総合的な情報の質はGlobal Quality Score(GQS)を用いて評価しました。2名の臨床専門家がすべての回答を独立して評価し、意見が不一致の場合はシニア判定者が解決しました。統計解析により、モデル間の性能、テーマ別の相違、および評価指標間の相関を比較しました。読みやすさ、PEMAT、およびGQSスコアにおいて、モデル間で有意な差が認められました。GPT-5は言語的に最も複雑な回答を生成しましたが、教育的な適切さと情報の質において最高評価を獲得しました。対照的に、Wenxin Yiyanは最も読みやすい文章を生成しましたが、PEMATおよびGQSのスコアは概して低い結果となりました。コンテンツのカテゴリーが読みやすさに影響を与え、予防・リハビリテーションおよび病因・リスク因子のトピックは読みやすさが低かった一方、PEMATとGQSはテーマ間で比較的一貫していました。読みやすさの指標は強い内部一貫性を示し、PEMATおよびGQSとは弱から中程度の正の相関を示しましたが、PEMATとGQSの間には中程度の正の相関が認められました。これらの結果は、モデルの選択が専門家による評価での教育的な適切さと総合的な情報の質に影響を与える一方で、トピックの複雑さが主に読みやすさに影響することを示唆しています。患者の理解度、満足度、信頼度、健康アウトカム、事実の正確性、および臨床的安全性が評価されていないため、これらの結果は臨床的な準備が整っている証拠ではなく、専門家による評価に基づいたベンチマーク分析として解釈されるべきです。
三叉神経痛(TN)は、一般に電撃様または刺痛と表現される、片側性で短時間かつ極めて激しい顔面痛が反復して起こることを特徴とする神経障害性疼痛症候群である。国際頭痛分類第3版(ICHD-3)によれば、痛みは通常、三叉神経の1つまたは複数の分枝の分布領域に局在し、しばしば耐え難い強度に達し、軽い接触、洗顔、歯磨き、会話、咀嚼などの無害な刺激によって誘発される。発作は突然に始まり急激に消失し、持続時間は数分の1秒から数分に及ぶ1,2。TNは通常、生命を脅かすものではないが、激しく予測不可能な痛みにより、食事、会話、睡眠、感情調節などの不可欠な日常生活が著しく妨げられ、結果として相当な心理社会的負担と生活の質の低下を招く。系統的レビューによるエビデンスは、TN患者が一般住民と比較して、うつ病、不安、および睡眠障害のリスクが著しく高いことを示している3,4。大規模なコホート研究では、TN患者の約35–55%に臨床的に意味のある不安またはうつの症状が見られ、痛みの破局的思考が非常に多く認められることから、慢性的な激痛、不眠、および感情障害の間に双方向的な相互作用があることが示唆されている5,6。疫学的推定では、一般住民におけるTNの有病率は約0.03%から0.3%の範囲であり、女性および高齢者で発生率が高く、地理的領域、民族グループ、および年齢層によって顕著な差異がある7,8。中国やインドのような人口密集国では、急速な人口高齢化に伴いTN罹患者数を持続的に増加しており、それによって医療システムへの負担が増大している。このため、疾患の評価および管理において、より効果的で拡張性があり、データに基づいたアプローチが必要であることが強調されている8,9。
三叉神経痛(TN)は、古典的、二次的、および特発性の亜型に分類でき、これらのカテゴリー間で病因メカニズムと治療戦略に実質的な違いがあることを示すエビデンスが増えています1,10。現在の研究では、三叉神経根進入帯における神経血管競合に関連した構造的変化、末梢神経の過興奮、および中枢性疼痛調節の変調が、共同して本疾患の病態形成に寄与していることが示唆されています11,12。臨床ガイドラインでは、第一選択治療としてカルバマゼピンおよびオキシカルバゼピンが推奨されており、薬物療法が無効な場合や忍容性が低い場合には、外科的またはインターベンショナルなアプローチが検討されます10。これらの治療の進歩にもかかわらず、TNは再発と寛解を繰り返す経過を特徴とし、長期的な疼痛の再発が一般的であるため、永続的な寛解の達成は困難です13。したがって、再発リスク、治療反応、および合併症をモニタリングするためには、長期的なフォローアップと構造化された慢性疾患管理が不可欠です。縦断的コホート研究によれば、標準化された管理戦略(薬物治療、適応がある場合の外科的介入、および包括的なフォローアップを含む)の下で、保存的治療を受けた患者の約半数が、不可避な病勢進行を伴わずに2年以内に全疼痛負荷の50%以上の軽減を達成できることが示されています14。これらの知見は、長期的な疾患管理における継続的な患者の関与と効果的な健康教育の重要性を強調しています。疾患の病因、病態生理、および治療選択肢についてより深く理解している患者は、治療計画に積極的に参加し、遵守する可能性が高く、結果としてアウトカムが改善することがエビデンスにより示唆されています15。しかし、従来の健康教育アプローチは、到達範囲と拡張性の面で制限されることが多いのが現状です。インターネット、特にオンラインのQ&Aプラットフォームやソーシャルメディアの普及に伴い、患者が医療情報を得るためにデジタルソースに依存する傾向が強まっています16,17。それにもかかわらず、個々のヘルスリテラシーや、十分な情報に基づいた意思決定のために基本的な健康情報にアクセスし、処理し、理解する能力には大きなばらつきがあり、これが効果的な患者教育の大きな障壁となっています18。さらに、不正確または誤解を招く内容を含むオンライン上の健康情報の質の不均一さは、患者の医学的決定や心理的ウェルビーイングに悪影響を及ぼす可能性があります19。
人工知能(AI)技術、特に近年の大規模言語モデル(LLM)の急速な発展は、医学コミュニケーションおよび健康教育に新たな機会をもたらしています20。大規模なテキストコーパスで学習したこれらのモデルは、自然言語による対話を通じて、構造化され論理的に一貫した回答を生成することが可能です21。ChatGPTなどの代表的な国際的システムは、医学的な質疑応答、患者へのコンサルテーション、および医学教育において有望な可能性を示しています22,23。中国においても機能的に同様のLLMがいくつか登場しており、ユーザーの普及範囲と活用シーンは拡大し続けています24。こうした進展がある一方で、医学の普及におけるLLMの活用には、学習データの信頼性、更新頻度、生成された回答の科学的正確性、および臨床的検証の不足など、依然として大きな課題が存在します25。加えて、言語スタイル、読みやすさ、論理構造、および引用の正確性におけるモデル間の差異が、健康関連情報に対する患者の理解度や信頼感に直接的な影響を与える可能性があります26。現在まで、三叉神経痛(TN)に関連する健康教育におけるLLMの性能に関する体系的な評価は限定的です。
したがって本研究では、三叉神経痛(TN)に関する患者教育上の質問への回答における、広く利用されている4つの中国製LLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen)および代表的な国際的LLM(ChatGPT)の性能を系統的に評価し、比較することを目的としました。横断的研究デザインを用いて、臨床ガイドラインと患者の一般的な懸念事項に基づいたTN質問セットを構築し、公開されている5つのLLM(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen、およびGPT-5)によって生成された回答を評価しました。可読性は複数の指標を用いて評価し、理解しやすさと実行可能性は患者教育用資料評価ツール(PEMAT)を用いて評価しました。全体の情報の質はグローバルクオリティスコア(GQS)を用いて評価しました。さらに、異なる健康教育トピックがこれらの評価指標にどのように影響するか、およびそれらの相互関係を分析し、臨床的な健康コミュニケーションにおけるLLMの選択と最適化のための根拠に基づいた指針を提供することを目指しました。
本研究ではAIによって生成されたテキストのみを分析しており、ヒト参加者、動物、生物学的試料、診療録、個人特定可能な情報、または臨床ケアへの介入は含まれていません。したがって、倫理審査および正式なインフォームドコンセントは適用されませんでした。
研究デザイン
この横断的研究では、TNに関するよくある質問に対する5つのLLMによって生成された回答の読みやすさ、質、および教育的適切性を評価した。
一般的によく寄せられるTN関連の質問の特定
2025年11月25日、疼痛医学において広範な経験を持つ2名の臨床専門家が、国際頭痛分類第3版(ICHD-3)、欧州神経学会ガイドライン、および米国神経学会/欧州神経学会連合ガイドラインを含む、三叉神経痛(TN)の現在の臨床ガイドラインを独立して検討した1,10,11。合意形成のための議論を経て、彼らは臨床現場で一般的に遭遇するTN関連の質問20項目のリストを作成した。質問数は、事前定義された5つのテーマ領域をバランスよくカバーするため、各領域につき4つの質問を選出することで、事前に決定した。これは、モデルが生成する回答の総数を、専門家による手動の評価および検証が可能な範囲に収めるためである。再現性を高めるため、選定プロセスは事前定義された領域ベースのフレームワークに従った。まず専門家が各領域内で候補となる質問を特定し、臨床的関連性、患者視点の表現、および冗長性の回避について独立して検討した後、各領域の最終的な4つの質問について合意に達した。最終的な質問リストはTable 1およびSupplementary File 1に提示している。事前定義された5つのテーマ領域は、疾患の基礎知識、病因およびリスク要因、診断、治療、および予防とリハビリテーションとした。質問セットは患者の検索ログ、オンライン検索クエリ、または正式な患者インタビューから導出されたものではないため、選択バイアスの可能性があることを研究の限界として認めている。
AIモデルとデータ収集手順
2025年11月25日、確定した20問のTN関連の質問セットを、公開されている5つの大規模言語モデル(LLM)プラットフォームであるDoubao、DeepSeek、文心一言(Wenxin Yiyan)、通義千問(Tongyi Qianwen)、およびGPT-5/ChatGPTに送信した。すべてのモデルは標準的な公開ウェブベースのチャットインターフェースを通じてアクセスし、アプリケーションプログラミングインターフェース(API)によるアクセスは使用しなかった。各プラットフォームにおいて、データ収集日に利用可能であったデフォルトの公開モデルを、生成パラメータを変更せずに使用した。公開ウェブインターフェースでは、バックエンドのモデルスナップショット識別子、隠れたシステムプロンプト、temperature、top-p、最大出力トークン数、またはその他の生成パラメータが表示されなかったため、これらの項目は「公開ウェブインターフェースに表示なし」として記録した。
すべてのモデルにおいて、プロンプトおよび回答の言語は英語としました。各標準化プロンプトは、モデル固有の追加指示を含まず、英語の質問文のみで構成されました。各質問は、以前の会話履歴、アップロード済みファイル、プラグイン、カスタム指示、または追記プロンプトのない、新しく独立したチャットセッションで個別に送信されました。標準化プロンプトの完全なリストおよび対応するモデルの生出力は、Supplementary File 1に提示しています。モデルのメタデータおよびデータ収集設定は、Supplementary Table 1にまとめています。
可読性評価
LLMによって生成された回答の可読性は、オンライン可読性評価プラットフォーム(http://readabilityformulas.com/)で利用可能な複数の確立された可読性公式を用いて評価されました。可読性評価において普遍的に認められたゴールドスタンダードが存在しないことを踏まえ、また先行研究と整合させるため、広く用いられている一連の可読性指標を採用しました23,27。単一の公式への依存を減らすため、文長、単語長、音節負荷、文字ベースの複雑さ、読みやすさ、および推定学年レベルを含む、可読性の相補的な側面を捉える7つの指標を選択しました。具体的には、Coleman-Liau指数(CL)、Linsear Write公式(LW)、Automated Readability Index(ARI)、Simple Measure of Gobbledygook(SMOG)、Gunning Fog指数(GFOG)、Flesch Reading Easeスコア(FRES)、およびFlesch-Kincaid Grade Level(FKGL)を算出しました。これらの指標は読解困難度や学年レベルを推定し、テキストの可読性を定量的に測定するものです(表2)。
教育的適合性と情報品質の評価
教育的適切性は、理解しやすさと実行可能性の2つのドメインからなるPatient Education Materials Assessment Tool (PEMAT)を用いて評価した28。このツールは24項目で構成されており、そのうち16項目で理解しやすさを、8項目で実行可能性を評価する。各項目は二値でスコア化し(0 = 基準を満たさない、1 = 基準を満たす)、合計スコアは0から24の範囲となり、スコアが高いほど患者教育への適切性が高いことを示す。全体的な情報の質は、医療情報の質を評価するために広く用いられている5段階のリッカート尺度であるGlobal Quality Score (GQS)を用いて評価した27(表3)。
2025年11月25日、三叉神経痛(TN)の管理において3年以上の経験を持つ2名の臨床専門家が、2つの評価指標を用いてすべてのAI生成回答を評価した。スコアリングに先立ち、すべてのAI生成回答にはコード化された回答識別子が付与されて匿名化され、PEMATおよびGQSの評価においてレビュー者はLLMプラットフォームを盲検化された。意見の不一致については、第3のシニアエキスパートが判定を行い、最終スコアを決定した。評価者間信頼性はCohenのカッパ係数を用いて評価され、その値は >0.75は極めて高い一致度、0.40~0.75は許容可能な一致度を示し、 <0.40であり、一致度は低いことを示していた。PEMATとGQSの両方におけるコーエンのカッパ値は0.75を超え、評価者間信頼性が極めて高いことが示された。
統計解析
すべての統計解析はRソフトウェア(バージョン4.4.3)を用いて実施した。データの正規性は、シャピロ・ウィルク検定およびQ-Qプロットを用いて評価した。正規分布に従う変数は、平均値として要約した。 ± 標準偏差で示し、一元配置分散分析(ANOVA)を用いて比較した。必要に応じて、その後Tukeyのポストホックテストを行った。非正規分布の変数は中央値および四分位範囲で要約し、Kruskal-Wallis検定を用いて比較した後、ペア比較のためにBonferroni補正を用いたDunnのポストホックテストを行った。可読性指標、PEMATスコア、およびGQS値の間の相関はSpearmanの順位相関係数を用いて評価し、多重検定に対してBenjamini-Hochberg補正を適用した。両側調整済み P 値 < p < 0.05 を統計的に有意と見なした。
本研究では、大規模言語モデル(LLM)および異なるカテゴリーの健康教育コンテンツが、生成されたテキストの読みやすさと質に及ぼす影響を体系的に評価しました。まず、5つのLLM(Doubao、DeepSeek、文心一言、通義千問、GPT-5)について、患者教育への適合性、全体的な情報の質、およびPEMATスコア、GQS、確立された読みやすさ指標(ARI、FRES、GFOG、FKGL、CL、SMOG、LW)を含む複数の読みやすさ指標を用いて性能を比較しました。次に、健康教育コンテンツの5つのテーマ領域(疾患の基礎知識、病因およびリスク要因、診断、治療、予防およびリハビリテーション)にわたり、同様のアウトカム尺度を検討しました。これら2つの分析的視点を統合することで、モデルの種類とコンテンツのカテゴリーがテキストの質と読みやすさにどのように共同で影響するかをさらに調査し、LLMが生成した患者教育資料における体系的なパターンを明らかにしました。
異なる大規模言語モデル間での可読性分析
5つの大規模言語モデル(Doubao、DeepSeek、Wenxin Yiyan、Tongyi Qianwen、GPT-5)によって生成された三叉神経痛関連テキストの言語的複雑性を体系的に比較するため、確立された7つの可読性指標を用いた。全体的な結果を表4にまとめ、個々の可読性指標の分布を図1A–Gに示した。すべての可読性指標において、5つのモデル間で統計的に有意な差が認められた(それぞれ P < 0.001)。
GPT-5は、ARI、GFOG、FKGL、CL、およびSMOGで最高の中央値を、FRESで最低値を示し、より長い文構造とより複雑な語彙を持ち、全体的な読解負担が最大であるテキストを生成したことを示唆した(図 1A–G)。対照的に、文心一言(Wenxin Yiyan)は最も低い言語的複雑性を示した。ARI、GFOG、FKGL、CL、およびSMOGの中央値は5つのモデルの中で最低であり、一方でFRESは最高であった。
Doubao、DeepSeek、およびTongyi Qianwenは、GPT-5とWenxin Yiyanの中間的な読みやすさレベルを示しました。DoubaoとDeepSeekは、ARI、GFOG、FKGL、CLを含む学年レベル指数において同等のパフォーマンスを示し、いずれもWenxin Yiyanよりも有意に高い値を示しました(すべて P < 0.05)。これらの結果は、DoubaoとDeepSeekの全体的な読解負荷が同様であり、Wenxin Yiyanよりも言語的な複雑性が高いことを示唆しています。
ほとんどの可読性指標において、Tongyi Qianwenの値は概ねDoubao/DeepSeekとGPT-5の中間に位置していました。特に、CLスコアはGPT-5に近く、DoubaoやDeepSeekよりも言語的複雑性がわずかに高いことが示唆されましたが、それでもGPT-5よりは複雑ではない結果となりました。LW指数は、他の可読性指標とは異なる分布パターンを示しました。Wenxin Yiyanが最高のLWスコア(60.00)を記録し、次いでTongyi Qianwen、DeepSeek、Doubaoの順となり、GPT-5が最低のLWスコア(46.50)となりました。この相違は、個々の可読性算出式が文の長さと単語の難易度にどのように重み付けを行っているかの違いを反映しています(図1G)。
全体として、5つの大規模言語モデル間で言語的複雑性に大きな差が観察された。GPT-5は最も言語的に複雑なテキストを生成し、文心一言(Wenxin Yiyan)は最も可読性の高いコンテンツを生成した。その他のモデルは中程度の可読性を示したが、構造的な差異は明白であった。
大規模言語モデルにおける患者教育への適合性と総合的な品質の比較
PEMATを用いて評価した患者教育への適格性において、5つの言語モデル間で有意な差が認められました(図1H、表4、すべて P < 0.001)。GPT-5が専門家によるPEMATスコアで最高値(9.40 ± 1.90)を記録し、本ベンチマークフレームワーク内においてより高い教育的適格性を持つことが示されました。ただし、この結果は、GPT-5によって作成された資料が、実際の患者の理解度、満足度、信頼感、健康行動、または臨床的アウトカムを向上させるという根拠として解釈されるべきではありません。
DeepSeekは中程度のPEMATスコア(6.80 ± 1.06)を獲得し、スコアの分布が比較的コンパクトであったことから、患者教育資料の作成において一貫した性能を持つことが示唆された。それにもかかわらず、全体的な教育的適切性はGPT-5よりも有意に低かった(P < 0.001)。Doubao、Tongyi Qianwen、およびWenxin YiyanのPEMATスコアはそれぞれ低く(5.35 ± 1.04、5.65 ± 1.09、および5.35 ± 0.93)、これら3つのモデル間に有意な差は認められなかった。また、これらすべてがDeepSeekおよびGPT-5よりも有意に低い性能を示した(すべて P < 0.01)。これらの結果は、これらのモデル間において教育的適切性は同等であるものの限定的であり、特に指示の明快さ、言語的構成、および理解しやすさにおいて課題があることを示している。
GQSを用いて評価した全体的な情報の質についても、同様の傾向が観察されました(図1I)。5つのモデル間で統計的に有意な差が認められ、すべて P < 0.001 でした。GPT-5が最高のGQSスコア(4.00 ± 0.65)を記録しました。そのスコアは4〜5の範囲に集中しており、ばらつきが少なかったことから、コンテンツの一貫性、構造的な完全性、および実用的な有用性において一貫して高い性能を示していることが分かります。
DeepSeekとDoubaoがそれに続き、GQSスコアはそれぞれ3.35 ± 0.59および3.40 ± 0.50でした。これらのスコア分布は3から4の間に集中しており、情報の質は中程度で、信頼性は妥当であることが示唆されました。対照的に、Tongyi QianwenとWenxin Yiyanは最低のGQSスコア(それぞれ2.50 ± 0.51および2.20 ± 0.52)となりました。これらの分布はスケールの低端に偏っており、情報の正確性、構造的な厳密さ、および内容の深さに限界があることを示しており、患者教育への有用性を低下させる可能性があります。
全体として、本データセットにおいてGPT-5が専門家による評価で最高のPEMATおよびGQSスコアを達成し、DeepSeekとDoubaoは中程度の性能を示しました。Tongyi QianwenとWenxin YiyanのGQS評価はより低い結果となりました。これらの知見は専門家による評価に基づいたベンチマーク結果であり、臨床的な適用準備が整っていることや、患者レベルでの有効性の根拠として解釈されるべきではありません。
健康教育コンテンツのカテゴリー間における可読性、患者教育への適合性、および全体的な品質の比較
コンテンツカテゴリー別に分析した結果、5つの健康教育テーマ間で読みやすさに有意な差があることが明らかになった(表5)。FRESについては、テーマカテゴリー間で統計的に有意な差が認められた(P = 0.004)。FRES値が高いほど、読みやすさは高いことを示す。疾患の基礎知識に関するテキストが最も読みやすく(中央値 = 28.50)、次いで診断に関するコンテンツ(中央値 = 16.00)、病因およびリスク要因に関するコンテンツ(中央値 = 12.50)、治療に関するコンテンツ(中央値 = 11.50)の順であった。対照的に、予防およびリハビリテーションに関するテキストは最も読みやすさが低く(FRES中央値 = 1.00)、最も読解が困難であることが示された。
他の読みやすさ指標においても同様のパターンが観察された。GFOGおよびFKGLは、テーマ別のカテゴリー間で有意に異なり(それぞれ P = 0.002 および P = 0.036)、いずれの指標においても、病因およびリスク因子、ならびに予防およびリハビリテーションに関するコンテンツで、より高い読解学年レベルが示された。同様に、SMOG指数は、病因およびリスク因子のテキストに多音節語が多く含まれていることを示唆していた(P = 0.039)。最大の差が観察されたのはCLであった(P < 0.001)。予防およびリハビリテーションに関するテキストは一文が最も長く(中央値 = 21.01)、読解困難度を大幅に高めていた一方で、疾患の基礎知識に関するテキストは一文が最も短く(中央値 = 14.88)、読解負担が最も低いことに対応していた。ARIおよびLWについては、コンテンツカテゴリー間で有意な差は観察されなかった。
PEMATスコアに基づくと、5つのコンテンツカテゴリー間で患者教育への適合性に統計的に有意な差は認められませんでした(P = 0.252)。PEMATスコアの平均値は5.90から7.20の範囲であり、言語的な複雑さに顕著な差があるにもかかわらず、教育的適合性はテーマ間で比較的一貫していたことが示されました。同様に、GQSを用いて評価した全体的な情報の質についても、コンテンツカテゴリー間で有意な差は見られませんでした(P = 0.822)。GQSの平均値は2.95から3.25の範囲であり、全体的な情報の質はコンテンツテーマ間で比較的安定していたことが示されました。
全体として、健康教育のテーマによって読みやすさに大幅な差が見られました。病因およびリスク要因に関するコンテンツと、予防およびリハビリテーションに関するコンテンツが最も読解困難であったのに対し、疾患に関する基礎知識のコンテンツが最も読みやすくなっていました。対照的に、患者教育としての適切性と情報の全体的な質については、コンテンツのカテゴリー間で比較的一貫していました。
可読性、患者教育への適合性、および全体的な質の相関分析
図2の相関行列は、可読性指標間に一貫した強力な関連性があることを示しており、高い内部整合性が認められた。ARI、GFOG、FKGL、CL、SMOGを含むほとんどの可読性指標は、互いに中程度から強い正の相関を示し、相関係数は0.64から0.97の範囲であった(すべてP < 0.001)。これらの結果は、言語的複雑性を評価する上でのこれらの指標の相補的な性質をさらに裏付けるものである。対照的に、FRESはARI、GFOG、FKGL、CL、SMOGを含む複数の可読性指標と有意な負の相関を示し、相関係数の絶対値は0.70を超えていた(すべてP < 0.001)。このパターンは、スコアが高いほど可読性が高いことを示すFRESの逆方向の採点方式を反映している。また、LW指数もARI、FKGL、GFOG、SMOGを含む他の可読性指標と有意な負の相関を示し、相関係数の絶対値は0.75から0.90の範囲であった(すべてP < 0.001)。逆に、LWはFRESと正の相関を示した(相関係数 = 0.69, P < 0.001)。
可読性指標と、GQSによって測定された全体的な情報の質との間にも明確な関連性が認められた。GQSは、ARI、GFOG、FKGL、CL、SMOGを含むほとんどの可読性指標と弱から中程度の正の相関を示し、相関係数は0.326から0.391の範囲であった(すべてP < 0.001)。これらの結果は、言語的な複雑さが増すほど、専門家による情報の質の評価が高くなることを示唆している。逆に、GQSはFRESと中程度の負の相関を示し(相関係数 = −0.408, P < 0.001)、より高い読解レベルを必要とする文章ほど、一般にGQSの評価が高くなることが示された。また、GQSはLWとも中程度の負の相関を示した(相関係数 = −0.421, P < 0.001)。
PEMATを用いて評価した可読性と患者教育への適合性の関連性は、概して弱かったものの、方向性は一致していた。PEMATスコアは、ARI、GFOG、FKGL、CL、およびSMOGと弱い正の相関を示し、相関係数は0.305から0.434の範囲であった(すべてP < 0.01)。対照的に、PEMATスコアはFRESおよびLWと弱い負の相関を示し、相関係数の絶対値はそれぞれ0.432および0.320であった(ともにP < 0.01)。これらの結果は、本データセットにおいて、言語的な複雑さが増すほど、専門家が評価した教育的適合性がわずかに高くなる傾向があることを示唆しているが、これらの関連性の強さは限定的であった。
重要な点として、PEMATスコアとGQSスコアの間には中程度の正の相関が認められました(相関係数 = 0.645, P < 0.001)。これは評価ドメイン間で観察された中で最も強い関連性であり、教育的な適切性が高い回答ほど、全体的な情報の質に対する評価も高くなる傾向があることを示しています。
データの利用可能性:
本研究を裏付ける完全なデータセットは、補足資料として提供されています。補足ファイル 1には、標準化された質問、プロンプト、およびアーカイブされた100件のLLM生成回答の完全なリストが含まれています。補足表 2には、専門家によるPEMATおよびGQSのスコアリングシートが含まれており、利用可能な場合は項目レベルのPEMAT評価、PEMATの合計スコア、GQSスコア、評価者間の比較情報、および該当する場合は裁定記録が記載されています。可読性スコア、図のソースデータ、およびR解析コードは補足ファイル 2として提供されています。モデルのアップデート、インターフェースの変更、およびプラットフォームレベルの修正により、LLMの出力は時間とともに変化する可能性があるため、検証および二次解析には、再生成された回答ではなく、アーカイブされた出力を使用してください。

図1: 5つの大規模言語モデルにおける読みやすさ、患者教育への適合性、および全体的な情報品質の比較。(A–G) このパネル は、読みやすさ指標である Automated Readability Index (ARI)、Flesch Reading Ease Score (FRES)、Gunning Fog Index (GFOG)、Flesch-Kincaid Grade Level (FKGL)、Coleman-Liau Index (CL)、Simple Measure of Gobbledygook (SMOG)、および Linsear Write Formula (LW) を示している。 (H) このパネルは PEMAT の合計スコアを示し、パネル (I) は Global Quality Scores (GQS) を示している。各ボックスプロットにおいて、中央の線は中央値を表し、ボックスは四分位範囲 (IQR) を、ひげは 1.5 × IQR まで伸びており、ひげの外側の点は外れ値を表す。略語:ARI = Automated Readability Index、FRES = Flesch Reading Ease Score、GFOG = Gunning Fog Index、FKGL = Flesch Kincaid Grade Level、CL = Coleman Liau Index、SMOG = Simple Measure of Gobbledygook、LW = Linsear Write、PEMAT = Patient Education Materials Assessment Tool for Understandability and Actionability(印刷形式)、Global Quality Score = GQS。こちらをクリックして、この図の拡大版を表示してください。

図 2: すべてのモデル生成回答における、可読性指標、患者教育への適合性、および全体的な情報の質の間のSpearman相関行列。この行列は、ARI、FRES、GFOG、FKGL、CL、SMOG、LW、PEMAT、およびGQSの間のペアごとの関連性に関するSpearman相関係数を示している。略称:ARI = Automated Readability Index、FRES = Flesch Reading Ease Score、GFOG = Gunning Fog Index、FKGL = Flesch-Kincaid Grade Level、CL = Coleman-Liau Index、SMOG = Simple Measure of Gobbledygook、LW = Linsear Write、PEMAT = Patient Education Materials Assessment Tool、GQS = Global Quality Score。こちらのリンクをクリックして、この図の拡大版を表示してください。
表1:三叉神経痛に関連する20の質問リスト。 こちらのリンクからファイルをダウンロードしてください。
表2:可読性ツール、数式、および説明。 こちらのリンクをクリックしてファイルをダウンロードしてください。
表3:グローバル品質スコア(GQS)の品質基準。 こちらのリンクからファイルをダウンロードしてください。
表4:三叉神経痛に関する最も一般的な質問に対する、異なる大規模言語モデルの分析結果。 こちらのリンクをクリックしてファイルをダウンロードしてください。
表5:三叉神経痛に関連する最も一般的な質問について、異なる次元から分析した結果。 こちらをクリックしてファイルをダウンロードしてください。
付録表1:評価したすべての可読性指標における、5つの大規模言語モデルによって生成された回答の可読性スコア こちらをクリックしてファイルをダウンロードしてください。
補足表2:5つの大規模言語モデルによって生成された回答に対する、患者教育への適合性(PEMAT)および総合的な情報の質(GQS)のエキスパート評価。 こちらをクリックしてファイルをダウンロードしてください。
補足ファイル1:5つの大規模言語モデルによって生成された、三叉神経痛に関する標準化された質問と完全な回答。 こちらのリンクからファイルをダウンロードしてください。
補足ファイル2:統計解析および図の作成に使用したRスクリプトおよびソースデータ こちらをクリックしてファイルをダウンロードしてください。
この横断的ベンチマーク研究では、公開されている5つの大規模言語モデル(LLM)によって生成された三叉神経痛(TN)の患者教育資料について、読みやすさ、教育的適切性、および全体的な情報の質を系統的に比較しました。その結果、4つの主要な知見が得られました。第一に、読みやすさはモデル間で大幅に異なり、GPT-5が言語的に最も複雑な回答を生成し、文心一言(Wenxin Yiyan)が最も読みやすいコンテンツを生成しました。第二に、読みやすさと専門家が評価した情報の質は異なる評価次元であり、GPT-5は読みやすさでは劣っていたものの、PEMATおよびGQSスコアで最高値を記録しました。第三に、コンテンツのテーマが読みやすさに影響を及ぼしており、予防、リハビリテーション、および病因とリスク因子のトピックは一般的に高い読解レベルを必要としましたが、PEMATおよびGQSはコンテンツカテゴリー間で比較的安定していました。最後に、読みやすさの指標は強い内部一貫性を示し、相関分析により、言語的複雑さとPEMATおよびGQSの両方との間に弱から中程度の正の相関があること、またPEMATとGQSの間に中程度の正の相関があることが明らかになりました。総じて、これらの知見は、LLMが生成したTN患者教育資料を評価するためのベンチマークを提供すると同時に、医学的な網羅性と言語的なアクセシビリティのバランスを取る必要性を強調しています。重要な点として、これらの結果は専門家による評価に基づいたベンチマーク結果であり、患者の理解度、事実としての正確性、臨床的安全性、または日常的な臨床使用への準備ができていることを示す根拠として解釈されるべきではありません。
本研究の結果は、LLM間で大幅なばらつきがあることや、可読性と情報の質との間に乖離が頻繁に見られることを報告した、AI生成の医療情報に関する previous evaluations の結果と一致している26,27,29。複数の疾患領域にわたる先行研究では、LLMが生成した患者教育資料は推奨される読書レベルを超えることが多く、最も可読性の高いテキストを生成するモデルが、必ずしも最も包括的または最高品質の情報を提供するわけではないことが示されている26,30。TN(三叉神経痛)教育における本結果はこの観察を支持するものである。GPT-5は言語的に最も複雑な回答を生成したが、PEMATおよびGQSスコアは最高であった。一方で、文心一言(Wenxin Yiyan)はより可読性の高いテキストを生成したが、専門家が評価した教育的適切性と総合的な質は低かった。さらに、可読性はテーマ領域によって異なり、「予防とリハビリテーション」および「病因とリスク因子」に関するトピックでは一般的に言語的複雑性が高く、モデルの特性とトピックの複雑さの両方が読解難易度に影響することが示唆された31。
読みやすさと情報の質の間に見られる一見したトレードオフは、評価指標によって測定される構成概念が異なることと整合しています。読みやすさの算定式は主に、文の長さや語彙の複雑さといった表面的な言語的特徴を評価するのに対し、PEMATやGQSは、情報の構成、網羅性、説明の明快さ、および実行可能性を含む高次の属性を評価します32。TN教育において、質の高い回答には、レッドフラッグ症状、鑑別診断、薬物療法とその副作用、介入および手術の選択肢、そして個別のリハビリテーション戦略に関する議論が頻繁に含まれます33。このような臨床的に包括的な内容は、必然的に専門用語の密度と構文の複雑さを増大させ、その結果、読みやすさのスコア(数値)が上昇し、専門家が評価する教育的質が向上することになります。重要な点として、これらの知見は、より複雑な言語表現が好ましいことを示唆していると解釈されるべきではありません。むしろ、現在のLLMは、言語的なアクセシビリティを犠牲にして情報の網羅性を向上させることが多いことを示しています。したがって、今後の患者教育システムの開発では、平易な表現への修正、要点の構造化された提示、専門用語の解説、およびさまざまなヘルスリテラシーレベルの患者に適した明確で実行可能なガイダンスを通じて、医学的正確性を維持しつつ言語を簡略化することに焦点を当てるべきです11,34,35。
相関分析により、可読性と教育的質との区別がさらに裏付けられました。大部分の学年レベルに基づいた可読性指標は、PEMATおよびGQSの両方と弱から中程度の正の相関を示しましたが、一方でFRESは、スコアが高いほど可読性が高い(読みやすい)ことを示すため、予想通り逆の相関関係を示しました。これらの知見は、言語的な複雑さが高いことが望ましいことを意味するのではなく、むしろ現在のLLMが、アクセシビリティを犠牲にして情報の完全性を高めていることが多いことを示唆しています34。したがって、AI支援による患者教育の開発においては、医学的な正確性と完全性を優先しつつ、平易な言葉への編集、重要事項の構造化された提示、専門用語の明確な解説、およびさまざまなヘルスリテラシーレベルの患者に合わせた実行可能な推奨事項を組み込むことが優先されるべきです11,35。
さらに方法論的な知見として、LW指数が他の可読性指標とは異なる挙動を示すことが明らかになりました。ARI、FKGL、GFOG、CL、SMOGとは異なり、LWはFRESに近いパターンを示しており、これは可読性算定式がテキストの複雑さをどのように操作化しているかの違いを反映しています36。LWはもともと技術マニュアル用に開発され、文章全体の特性や音節数よりも、抽出した文章構造や単語の分類を重視しているため、簡潔な記述と長い説明文、および専門用語の不均一な分布が混在するAI生成の医学的テキストに対して、異なる反応を示す可能性があります37,38。これらの知見は、単一の可読性指数ではテキストの複雑さのあらゆる側面を十分に捉えることができないため、多角的な指標による評価フレームワークが重要であることを強調しています。AI生成の健康情報に関する先行研究と同様に、総合的な可読性は、個別の指標ではなく、複数の相補的な指標による収束的根拠を用いて解釈されるべきです39。
コンテンツのカテゴリーも可読性に影響を与えていた。予防、リハビリテーション、および病因とリスク要因に関するトピックは、一般的に基礎的な疾患知識よりも読解難易度の高い文章となる傾向があった。これは、これらのトピックにおいて条件付きの推奨事項、メカニズムの解説、およびより専門的な用語が必要とされるためと考えられる40,41。対照的に、基礎的な疾患知識は主に定義に基づいた内容であるため、より簡潔な表現で伝えることが可能である42。こうした差異があるものの、PEMATおよびGQSのスコアはテーマ領域間で比較的一貫しており、専門家が評価した教育的な適切性と全体的な情報の質は、患者からの質問の種類に関わらず維持されていたことが示唆された35,43。
これらの知見は、臨床実務および今後のLLM開発に対していくつかの示唆を与えています。患者が医師の診察前後に情報を得るためにLLMを利用する機会が増えているため、AIが生成したコンテンツは、特に薬剤の安全性、介入的治療や外科的治療の適応、および緊急の評価を要するレッドフラッグ症状の認識に関して、臨床医によるカウンセリングを代替するのではなく、それを補完するものであるべきです44。医療機関においては、LLMを自律的な患者教育システムとしてではなく、下書き作成や意思決定支援ツールとして活用しつつ、専門家のレビューを経た平易な表現の教育リソースを提供することが有益であると考えられます。今後のモデルでは、読みやすさを考慮した生成戦略、モデルのバージョンと生成日の透明性のある報告、不確実性の明示的な伝達、および臨床導入前の臨床医によるレビュー、事実の正確性の検証、ハルシネーションのスクリーニング、薬剤安全性のチェック、レッドフラッグに関するガイダンス、患者の理解度テストを含むガバナンス手順を組み込むべきです26,44,45。
本研究にはいくつかの限界がある。モデルの出力は、単一の日付に公開アクセス可能なウェブインターフェースから収集されたため、その後のモデルの更新、インターフェースの変更、隠れたシステムプロンプト、またはデフォルトの生成設定が再現性に影響を及ぼす可能性がある。20問の質問セットは、患者の検索ログや正式な患者インタビューから導出されたものではなく、臨床専門家によって作成されたため、選択バイアスが生じている可能性がある。さらに、本研究は専門家によるPEMATおよびGQS評価に依存しており、患者の理解度、信頼度、満足度、健康行動、または臨床結果については評価していない。また、読みやすさの計算式、PEMAT、GQSは、事実の正確性、ハルシネーションのリスク、引用の正確性、禁忌事項の網羅性、または臨床的安全性を直接的に評価するものではない。したがって、これらの知見は、専門家による評価に基づいた横断的なベンチマーク分析として解釈されるべきであり、LLMが生成した資料が日常的な臨床利用に準備ができていることを示す証拠として解釈すべきではない。LLM生成の教育資料の臨床導入を検討する前に、今後の研究では、アーカイブされたモデル出力、詳細なモデルメタデータ、多言語評価、より大規模な質問セット、正式な安全性監査、事実の正確性の評価、および患者中心のアウトカム評価を含めるべきである。
専門家による評価を用いたこの横断的ベンチマーク研究において、公開されている大規模言語モデル(LLM)は、三叉神経痛の患者教育資料の読みやすさ、教育的適切性、および全体的な情報の質において大幅に異なる結果を示しました。GPT-5は、専門家による評価で最高得点のPEMATおよびGQSスコアを記録しましたが、同時に言語的に最も複雑な回答を生成しており、読みやすさと専門家が評価する教育的質は、患者教育において関連しつつも異なる次元であることを浮き彫りにしました。一部のモデルはより読みやすいコンテンツを生成しましたが、それが必ずしも教育的適切性や全体的な情報の質の向上につながるわけではありませんでした。本研究では、専用の安全性監査による事実の正確性の評価、ハルシネーションのリスク、引用の正確性、患者の理解度、信頼度、満足度、健康行動、または臨床的アウトカムを評価していないため、本結果は臨床的な導入準備が整っている証拠ではなく、専門家による評価に基づいたベンチマーク分析として解釈されるべきです。今後の研究では、患者教育におけるLLM生成資料の安全かつ効果的な利用を支援するため、専門家によるレビュー、正式な安全性および事実の正確性の評価、そして患者中心の評価を統合する必要があります。
著者らは、競合する利益がないことを宣言します。
本研究は、公的、商業的、または非営利セクターのいかなる資金提供機関からも、特定の助成金を受けていません。三叉神経痛の質問セットについてフィードバックを提供し、評価フレームワークの洗練を支援してくださった臨床に携わる同僚の方々に感謝いたします。また、原稿の作成および改訂をサポートしてくださったすべての寄稿者に感謝いたします。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| DeepSeek チャットプラットフォーム | DeepSeek | https://chat.deepseek.com/ | 回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース |
| Doubao チャットプラットフォーム | Doubao | https://www.doubao.com/chat/ | 回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース |
| GPT 5 | OpenAI | https://chat.openai.com/ | 回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース |
| R ソフトウェア、バージョン 4.4.3 | R Foundation for Statistical Computing | 該当なし | 統計解析および可視化 |
| Readability Formulas オンライン読みやすさ計算機 | Readability Formulas | 該当なし | 読みやすさ指標を算出するために使用されるオンラインツール |
| Tongyi Qianwen チャットプラットフォーム | Tongyi Qianwen | https://www.tongyi.com/ | 回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース |
| Wenxin Yiyan チャットプラットフォーム | Wenxin Yiyan | https://yiyan.baidu.com/ | 回答を生成するために使用される、一般にアクセス可能な大規模言語モデルインターフェース |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト