本方案提出了一种可扩展的实验框架,用于在线医疗咨询平台中的医患匹配。通过将以患者为中心的临床匹配度与医生端的服务能力共同整合到一个混合评分模型中,该方法可优化匹配准确性,最大限度地减少患者等待时间,并确保医生工作负荷的均衡分配。
方法文章
本方案提出了一种可扩展的实验框架,用于在线医疗咨询平台中的医患匹配。通过将以患者为中心的临床匹配度与医生端的服务能力共同整合到一个混合评分模型中,该方法可优化匹配准确性,最大限度地减少患者等待时间,并确保医生工作负荷的均衡分配。
大规模在线医疗咨询平台需要有效的算法辅助医患匹配,以平衡以患者为中心的适配性与运营效率。现有方法通常独立优化临床匹配度或医生接诊能力,导致等待时间延长和工作负荷不均。本方案提出一种可扩展的实验框架,将匹配兼容性与接诊能力共同纳入混合匹配评分体系。通过一个包含240名医生、3,600条患者请求和9,785个候选配对的模拟数据集,该方法量化了兼容性(如专科匹配度、就诊模式适配性)和容量(如负荷比、预计等待时间)。该框架通过混合评分评估候选配对,并在12个评估折次中,将性能与基于规则、仅兼容性和仅容量的基准策略进行比较。代表性结果表明,该混合框架实现了更优的匹配质量,包括平均首位精确度为0.740,F1得分为0.714。此外,其运营效率较高,容量填充率达到0.825,平均预计等待时间仅为5.52小时。通过最大化平均患者满意度(4.43/5.00)并最小化负荷不均衡(0.195),该框架为智能问诊分诊与平台管理提供了一种实用的实施方案。
在线医疗咨询已成为一种日益重要的医疗服务模式,使人们能够超越传统的面对面就诊方式而获得医疗服务1。在中国,互联网远程医疗的发展受到政策推进、市场扩张以及与整体医疗体系更深层次融合的推动,使得数字化咨询正逐渐成为医疗组织体系中愈发重要的组成部分2。来自互联网医院的大规模证据进一步表明,在线咨询服务目前已达到相当规模,已成为常规医疗服务中具有实质意义的一部分,而不再仅是边缘性的补充3。与此同时,异步远程医疗通过允许灵活的互动模式拓宽了远程护理的范围,在提升可及性的同时,也增加了数字咨询平台的运营复杂性4。
随着这些平台的扩展,其性能不能仅以技术可用性来衡量。患者体验和服务质量已成为数字医疗服务的核心结果指标5。近期研究表明,在线问诊系统的使用与患者体验的可测量差异相关,尤其体现在就医可及性、便利性以及预约流程方面6。然而,数字问诊也会增加医生的工作负担,包括消息处理以及在常规临床工作时间之外完成的任务,这使得容量管理成为运营中的核心问题7。由于患者需求在医生之间的分布不均,这一挑战进一步加剧,因为评论、评分和其他个人资料信息等显性服务线索会将患者流量导向少数知名度较高的医生8。因此,在线问诊平台上的医患匹配不仅是患者端的搜索问题,当面对异质性的问诊请求时,医生也可能表现出选择性应答倾向9。
从患者的角度来看,选择在线问诊本质上是一个多维度的决策过程。用户在选择医疗服务时,会同时权衡候诊时间、医生资质、医院等级、服务模式以及问诊费用等因素10。与此复杂性一致,近期一项系统综述指出,在线医疗咨询平台需要具备能够减轻信息过载、并更好地将患者需求与医生资源相匹配的推荐机制11。为此,方法学研究已开始引入结构化的匹配方法,包括在信息不完全条件下的动态稳定匹配,以改善在线问诊环境中的医患分配效果12。更近的研究进一步强调,医患匹配不仅应提升分配效率,还应减少患者对顶级医院中高曝光度医生的过度集中需求13。混合方法研究证据表明,人们对远程医疗服务的偏好存在显著异质性,这意味着单一模式的分配逻辑在平台规模下难以充分满足需求14。尽管已有上述进展,现有文献往往将兼容性相关因素与医生服务能力限制视为两个独立问题,然而在线问诊平台必须同时管理医患关系匹配与服务承载能力11。
为解决这一问题,本方法旨在建立一个可扩展的实验框架,用于在大规模在线医疗咨询平台上实现兼顾兼容性与医生接诊能力的医患匹配。该技术的原理在于,若仅单独优化临床偏好或医生服务容量,将导致患者等待时间延长、医生工作负荷不均以及咨询体验欠佳。与传统的基于规则或单一目标的分配方法相比,这种混合策略的主要优势在于能够同时建模患者需求、医生特征以及动态服务约束,从而维持工作负荷均衡并提高患者满意度12。通过详细阐述混合匹配评分的构建方法以及基于交叉验证的评估流程,本实验方案为智能化咨询分诊提供了切实可行的基础。读者可利用该方法框架,判断双因素感知的匹配逻辑是否适用于其特定数字健康应用场景中的分诊优化、资源分配及工作流管理。
本方案中使用的评估数据集是通过计算模拟从汇总的、去标识化的操作分布中生成的,不包含任何真实或可识别的人类受试者数据。因此,宁波理工学院机构审查委员会(IRB)认定该研究无需接受完整的伦理审查(豁免编号:NT9918276)。
1. 数据准备与队列定义
2. 候选配对生成
3. 成对变量操作化
(1)
4. 匹配分数的构建
(3)
(4)
(5)5. 匹配选择与策略基准测试
6. 结果计算
(6)
(7)医生群体和患者请求群体的基线特征
模拟分析数据集包含240名医生和3,600例患者就诊请求。匹配系统双方的基线特征汇总于表2中,平台侧的分布模式如图3所示。
在240名医生中,女性医生有128名(占53.3%)。该队列的平均临床经验为9.34年,平均问诊费用为68.08美元,平均名义每日接诊能力为18.52次问诊,平均历史服务评分为4.63分,平均首次回复时间为5.47小时。内科是最大的专科(占19.2%),其次是骨科(15.0%)和神经科(13.3%)。在问诊模式方面,41.7%的医生支持文字加语音问诊,37.1%支持仅文字问诊,21.3%支持文字、语音和视频全模式问诊。
在3,600项患者请求中,53.1%由女性患者提交。患者的平均年龄为36.49岁,平均预算上限为47.30美元。内科是最常选择的专业科室(20.0%),其次是神经科(13.8%)和心脏科(13.0%)。请求按严重程度分类为:中等(45.7%)、低(34.2%)和高(20.1%);按紧急程度分类为:优先(39.1%)、常规(35.9%)和紧急(25.0%)。文本咨询是最常见的咨询方式偏好(45.1%),78.7%的患者表示对医生性别无偏好。总体而言,这些分布表明该平台运行在一个异质性的咨询环境中,验证了在匹配系统中同时评估兼容性与容量限制的必要性。
候选对结构与得分分离
在基于专科优先的检索和受限候选扩展之后,共生成了9,785对候选医患配对(表3,图4)。在整个候选配对层中,有3,085对被选为最终匹配,而6,700对未被选中。与未选中的配对相比,被选中的配对具有更高的专科完全匹配比例(99.2% vs. 95.3%),以及略高的性别偏好匹配率(90.2% vs. 89.0%)。
更重要的是,主要的成对差异集中在操作性和综合性评分变量上。被选择的配对表现出更高的平均兼容性评分(0.853 对比 0.829)和更高的平均接诊能力评分(0.395 对比 0.381)。因此,被选择的配对的平均综合评分达到0.707,高于未被选择配对的0.686。在操作性方面,被选择的配对也更具优势,表现为更低的平均医生负荷比(0.628 对比 0.642)、更多的当日可预约时段(6.99 对比 6.65)以及更短的预计等待时间(12.46 小时对比 12.79 小时)。
在选定的3,085对匹配中,完成了2,584次会诊(完成率为83.8%)。患者满意度平均为5.00分中的4.29分。将以会诊完成、患者满意度达到4.0及以上且14天内无再次就诊定义为成功匹配,则有1,644对选定组合符合该标准(成功率为53.3%)。这些结果表明,最终的选择是由更高的匹配度、更低的负荷压力以及更优的等待时间条件共同决定的,与预先设定的协议逻辑一致。
与成功最终配对相关的配对层面因素
在选定的匹配子集中进行了多变量逻辑回归分析,以确定与成功匹配相关的特征(表4,图5)。兼容性评分仍与成功匹配呈正相关(校正后比值比 [aOR] = 11.99;95% 可信区间 [CI],1.81–79.46;P = 0.010),容量评分亦然(aOR = 2.08;95% CI,1.22–3.55;P = 0.007)。相反,预计等待时间每增加一小时,成功匹配的概率则降低(aOR = 0.953;95% CI,0.934–0.972;P < 0.001)。可负担性仍然具有显著性(aOR = 1.33;95% CI,1.12–1.57;P = 0.001)。精确的专业匹配、性别偏好匹配、优先状态和高严重程度则不再具有独立显著性。这表明,匹配成功更依赖于兼容性与可吸收容量的综合强度,而非任何单一的表面特征。
分配策略的基准测试与稳健性评估
在12个评估折上的比较基准测试结果总结于表5、表6和图6中。所提出的混合策略取得了最优的整体表现,其在排名首位时的平均精确率(0.740)、召回率(0.691)和F1分数(0.714)均为最高,优于基于规则的基线方法、仅兼容性策略以及仅容量策略。
从操作层面来看,混合策略实现了最高的容量满足率(0.825)和最短的平均估计等待时间(5.52 小时)。以患者为中心的性能也得到优化,混合方法获得了最高的平均患者满意度(4.43)和最低的负荷不平衡指数(0.195),表明医生工作负荷分布极为均衡。亚组分析(表7,图6)证实,这种稳定的性能表现跨越了不同的紧急程度分层和医院等级,证明了该框架即使在资源严重受限的情况下仍具有较强的稳健性。

图 1:整体研究工作流程。(A)构建医师库和患者请求库。(B)以专科优先的候选检索流程,当所请求专科中可用的、仍有接诊能力的活跃医师少于两名时,进行受限扩展。(C)生成候选医患配对并提取成对变量。(D)构建兼容性评分、容量评分及混合评分。(E)最终医师选择、基于折叠的四种分配策略基准比较,以及绩效结果的计算。请点击此处查看该图的放大版本。

图 2:兼容性与容量感知匹配框架的架构。(A)兼容性模块,包括专科匹配、会诊模式匹配、性别偏好匹配、经济承受能力匹配、医生历史评分以及紧急响应匹配。(B)容量模块,包括医生负荷比、当日剩余号源及预计等待时间。(C)兼容性评分与容量评分的分数归一化及加权聚合。(D)将两个模块整合为最终的混合评分。(E)用于确定最终医患匹配的最终排序与平局打破逻辑。请点击此处查看本图的高清版本。

图3:分析数据集中医生与患者特征的基线分布模式。(A)医生群体的专业分布。(B)医生的专业职称及医院等级分布。(C)患者咨询请求的专业分布。(D)患者请求的严重程度与紧急程度分布。(E)患者请求中偏好的咨询方式及偏好的医生性别分布。注:本图中呈现的所有数据分布均直接来源于最终的分析数据集(n = 240 名医生;n = 3,600 条患者请求),并与表2中报告的汇总统计结果完全一致。请点击此处查看该图的放大版本。

图 4:选定与未选定候选匹配对的配对级评分分布及其分离情况。 (A)选定与未选定配对中的兼容性评分分布。(B)选定与未选定配对中的容量评分分布。(C)选定与未选定配对中的混合评分分布。(D)按选择状态划分的估计等待时间(单位:小时)。(E)兼容性评分与容量评分的联合分布,分别显示选定与未选定的配对。请点击此处查看该图的放大版本。

图5:选定配对中与最终成功匹配相关的多变量因素分析。(A)兼容性评分、容量评分、预计等待时间(小时)、经济承受匹配度、专科匹配、性别偏好匹配度、病情严重程度和紧急程度的校正后比值比森林图。(B)在观察到的兼容性评分范围内,成功匹配的边际概率。(C)在观察到的容量评分范围内,成功匹配的边际游戏副本概率。(D)预计等待时间(小时)与成功匹配概率之间的负相关关系。请点击此处查看本图的高清版本。

图6:四种医患匹配策略的比较基准测试及混合框架的子组性能。(A)四种策略在排序首位的精确率、召回率和F1分数。(B)四种策略的容量填充率、平均估计等待时间及平均患者满意度。(C)四种策略的负载不平衡指数。(D)混合策略在12次重复评估折次中的各折性能范围。(E)混合策略子组性能热图。注:本图中所有数值均已与表5报告的相应结果进行交叉验证,以确保绝对一致性。请点击此处查看该图的放大版本。
表1:匹配框架的操作定义、阈值和评分规则。 缩写:SD = 标准差。请点击此处下载该表格。
表2:医生群体和患者请求群体的基线特征。 匹配前分析数据集的科室、特征及比较性基本统计信息。请点击此处下载该表格。
表3:选定匹配对与未选定匹配对之间的成对比较。 本表汇总了成对变量及描述性统计量,详细说明了最终选定的匹配对与未选定候选者之间的结构差异。请点击此处下载该表格。
表4:选定配对中与最终成功匹配相关的因素的多变量逻辑回归分析。 模型信息:因变量 = 选定配对中的最终成功匹配。成功匹配的定义为完成咨询、患者满意度达到4.0/5.0,且因不满意或不匹配在14天内无再次就诊。请点击此处下载该表格。
表5:四种匹配策略的比较性能。 在12次重复折叠中跨策略层面基准测试的总结。请点击此处下载该表格。
表6:混合策略的稳定性与折叠层级变异性。 混合策略在12次重复评估折叠中的折叠层级性能范围汇总。请点击此处下载该表格。
表7:混合策略的亚组表现。 基于紧急程度和医院等级的混合策略详细亚组表现。请点击此处下载该表格。
本方案展示了一种在大规模在线医疗咨询环境中兼顾匹配兼容性与服务容量的医患匹配框架。该混合策略在匹配准确率、等待时间、容量利用率、患者满意度和工作负荷分配等方面实现了最为均衡的整体性能。这一结果至关重要,因为数字化咨询不仅扩大了医疗服务的可及性,还将临床工作转移至非工作时段,当分配逻辑忽视服务吸收能力时,会增加隐性工作负担。近期证据表明,更高的数字医疗需求与医生在规定工作时间之外的工作量增加相关,这进一步凸显了将容量限制纳入匹配系统的重要性,而非将其视为次要的运营变量7。此外,当需求分布不均时,仅考虑兼容性是不足的。在互联网医院中,患者的医生选择受到医生显性特征的显著影响,结构性地导致需求集中在知名度较高或职称较高的医生身上。这一动态解释了为何本方案中仅依赖兼容性的策略虽保持了相对较高的匹配质量,但在等待时间和负荷均衡方面表现较差15。
在我们的评估中,将匹配成功与否进行二分类作为严格阈值,用以过滤掉失败的临床接诊;而患者的平均满意度评分则使我们能够评估不同匹配策略下用户感知质量的细微分布情况。此外,为解决潜在循环论证的担忧,本研究中的次要绩效结果独立于该二分类状态进行评估,从而更全面地衡量该框架对平台整体服务质量的影响,而不仅仅是验证其自身的分类标准。混合策略下观察到的更高患者满意度与广泛的远程医疗文献一致,并进一步深化了这一认识:满意度与分配质量密切相关,而不仅仅是数字可及性的结果。近期研究指出,专业的治疗规划、准确理解患者关切、全面的回复以及避免使用模板化应答,是提升用户满意度的关键驱动因素。因此,最优匹配系统必须将患者分配给能够在可接受时间窗口内响应并提供个性化互动模式的医生16,17。这一动态机制也凸显了我们设定每项请求生成2至4位候选医生(平均2.72位)的操作逻辑。该特定阈值通过实证校准,旨在患者自主性与防止"选择过载"之间取得最佳平衡——“选择过载”是数字健康选择架构中已有充分记录的认知瓶颈,会导致决策延迟并降低用户体验。从实施角度来看,该匹配模型应嵌入更广泛的服务工作流程之中。关键的是,尽管当前实验方案采用静态的、基于分组的批量分配方式来评估该框架,但其底层算法逻辑本质上可适应连续时间的动态场景。由于容量变量(如当前每日负荷和剩余当日接诊名额)被设计为可迭代更新,混合评分可实时高效地重新计算,以适应患者连续到达和医生可用性的动态变化。研究表明,培训、技术熟悉度、沟通质量以及工作负荷是关键的实施因素,相关利益方建议采取具体机制以减轻医生负担。因此,尽管混合框架提升了分配绩效,但其在现实中的有效性在很大程度上依赖于支持性的工作流程设计、平台治理及运营支持18,19。
这些结果代表了平台路由的优化,而非虚拟咨询可取代所有医疗服务形式的证据。尽管虚拟咨询提高了效率,但关于其安全性和公平性的证据仍不一致;因此,该框架应被视为前端分配工具,而非临床分诊或转诊路径的替代方案20。当前方案存在若干局限性。第一,尽管评估数据集是基于严格模拟真实世界运行条件的变量和分布模式构建的,但其本质上仍为用于受控平台评估的模拟队列。我们承认,缺乏补充性的独立真实世界数据集限制了当前研究结果的外部有效性。为充分验证所提出的混合匹配方法的普适性,未来研究必须优先利用大规模、真实世界中的跨平台数字医疗咨询日志及更长的纵向时间范围,对该实验框架进行验证。评估模型在极端时间需求冲击下的鲁棒性与动态路由能力——例如流感高发季节或公共卫生紧急事件期间——仍然至关重要。第二,本研究关注的结果指标为咨询完成率和患者满意度,未包含由临床医生判定的诊断适宜性或长期健康结局。第三,基于分组的评估依赖于简单随机抽样,而非k折交叉验证或分层抽样。虽然这种方法能够反映自然患者流的波动性,但可能偶尔会削弱特定少数亚组的均匀代表性。未来的算法评估应按病情严重程度、紧急程度和医院等级进行分层抽样,以确保在所有患者亚群中性能的一致性。第四,本方案推导出的预计等待时间仅作为结构代理指标,而非经过严格校准的预测模型。由于缺乏连续的真实世界时间戳日志,我们无法进行严格的关联分析,也无法计算与实际临床等待时间之间的校准误差。未来的研究应利用大规模实证运行日志,验证并精细调整这些启发式等待时间参数。第五,兼容性与容量相结合的加权方案是预先设定的启发式方法,而非通过客观数学建模得出。尽管这种先验固定方法避免了事后数据拟合,但缺乏客观加权方法(如层次分析法AHP或熵权法)应有的严谨性。该框架的后续版本应引入此类客观的多准则决策方法,以动态确定最优加权比例。最后,该框架在一对一分配层面运行,并在静态批次分配条件下进行评估,未建模团队协作式咨询或连续时间动态重优先级调整(例如应对突发需求激增或实时日程取消)。未来研究应将该框架扩展为完全动态的排队模拟系统,并将匹配算法从初始医生选择延伸至通信感知的路由机制以及匹配后的交互支持21。
总体而言,本方案成功地将医患匹配范式从单一目标逻辑中解放出来。在大规模在线平台中,有效的资源分配必须同时兼顾临床服务匹配度和医生在当前工作负荷下的可承载能力,且不能降低服务及时性或患者体验。与基于规则、仅考虑兼容性或仅考虑容量的策略相比,兼顾兼容性与容量的混合框架在匹配准确率、召回率、F1分数、等待时间、容量利用率以及工作负荷分布等多个指标上实现了更优的整体平衡。该方法既不将医患匹配视为纯粹基于偏好的推荐任务,也不视为以吞吐量为导向的调度问题,而是为智能问诊分诊、平台资源协调以及未来数字化医疗服务的优化提供了高度实用且可扩展的基础。
作者无任何利益冲突需要披露。
本研究由宁波理工学院人才引进与科研启动项目资助:在线医疗咨询平台医生推荐研究(1140157G20220699)。本研究还得到了宁波国家高新区重大技术创新项目(2023CX050007)以及“科技创新甬江2035”重大应用示范项目的支持:基于大模型的宁波方言标准化研究及智能应用开发示范(2024Z021)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 候选医患配对 | 研究生成 | 不适用 | 成对变量推导与匹配选择(9,785 组候选配对) |
| IBM SPSS Statistics | IBM Corp. | https://www.ibm.com/products/spss-statistics | 统计分析(版本 27) |
| Microsoft Excel | Microsoft Corporation | https://www.microsoft.com/microsoft-365/excel | 数据管理与描述性汇总(版本 2021) |
| 患者请求记录 | 研究生成 | 不适用 | 患者基线特征与偏好参数(3,600 条咨询请求) |
| 医生记录 | 研究生成 | 不适用 | 医生基线特征与能力参数(240 名执业医生) |
| Python | Python Software Foundation | https://www.python.org | 模拟、评分构建与基准测试(版本 3.11) |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可