2020年1月8日
当随机对照试验不可行时,像军事卫生系统数据存储库这样的综合性医疗数据源为回顾性分析提供了理想的替代方案。通过纳入国家死亡指数的死亡数据,并使用倾向性评分加权法平衡各组之间的差异,有助于减少回顾性设计中固有的偏倚。
过去,我们曾利用军队医疗数据库来帮助确定哪些患者最能从他汀类药物治疗中获益,以降低未来发生心脏病发作的风险。我们的方案为任何希望利用大数据回答自身临床问题的医疗提供者提供了路线图,并可应用于范围广泛且几乎无限的主题。在获得机构审查委员会批准后,需完成数据共享协议申请,并仔细填写 DRT MDR 数据提取工作表中所请求的数据字段和文件。
请说明团队是请求数据分析师协助、获取原始数据,还是将直接访问MDR;并说明请求是一次性数据提取,还是需要每日、每月或每年定期提取。如需直接访问MDR,请填写MDR-CS-2875表格中的MDR授权申请表。在直接访问MDR时,应遵循MDR使用指南和MDR功能指南中提供的访问和使用说明,包括软件要求以及示例SAS程序。
为了获取队列中更多多重耐药(MDR)受益人的数据,请从服务器获取 VM6 文件,并将其与您的队列文件合并。在 VM6 数据提取文件和队列文件中,对患者姓名和出生日期使用不同的变量名,以便在合并后进行后续的错误核查。由于数据库条目不可能完全无误,因此除检查程序日志和输出中任何潜在问题外,还应使用代码在每个主要步骤之后执行错误检查。
在比对队列文件与VM6文件中的姓名时,仅需匹配前三个字母,以提高效率并减少因文件间拼写或空格差异可能导致的假性错误。随后审查错误数据文件,根据需要手动查阅健康档案,以检查其他值得关注的错误。对于相关数据提取,从VM6受益人文件中获取种族和性别数据,将此数据与队列文件合并,并按照上述方法检查错误。
从死亡主文件中获取死亡数据,将这些数据与队列文件合并并检查错误。然后根据分析需要获取额外的数据文件。在数据合并和汇总文件构建过程中,使用索引日期之前时间段内的 ICD-9-CM 或 ICD-10-CM 编码提取基线共病情况。
确保患者在基线期有资格享受军队医疗保健系统,该信息需通过 VM6 受益人文件进行核实。在门诊和/或住院文件中检索基线期诊断代码,以确定索引日期前 12 个月基线期内的共病情况。若使用 Elixhauser 共病分类,应使用医疗保健成本与使用项目数据库提供的现成软件,并根据需要修改诊断变量和文件的名称。
为了将所有患者的随访截止日期统一设定为研究结束日期(适用于尚未表现出感兴趣结局的患者),需检索 VM6 受益人文件,以确认患者在研究结束日期前是否具备通过该系统获得医疗服务的资格。如果需要进一步将研究限制在医疗系统活跃使用者范围内(而不受资格限制),则应根据数据文件确定每位患者最后一次接触医疗服务的日期,并在该日期对患者进行删失处理。在获取全部必要信息后,使用 Ranuni 为每位患者生成一个随机的患者标识符。
为了模拟治疗使用的概率,采用逻辑回归模型根据预测概率计算权重。然后通过将倾向性评分除以平均权重来稳定倾向性评分。为验证应用逆概率治疗加权后的平衡性,可使用标准差异宏在SAS中简化计算加权前后协变量的标准化均值差异。
在 PROC PHREG 中生成累积发生率函数图时,需引用协变量文件,在 PROC PHREG 语法中指定用于生成图形的协变量值;使用 weight 语句指定标准化倾向评分变量,并使用 baseline 语句设定基线协变量的值,以绘制累积发生率函数图。然后使用 ROWID 指定用于绘图的分层变量。此处展示了一个在包含 10000 名参与者的大型队列中,使用绝对标准化差异图宏实现适当平衡的示例。
应用倾向评分后,标准化均值差异显著降低。在此可观察到,在包含100名参与者的队列中尝试平衡协变量时未能成功的结果。本示例中,采用带有标准化倾向评分权重的PROC PHREG生成累积发生率函数图,结果显示在本分析中,未治疗的对照组事件数量更多,且生存情况较治疗组相对较差。
MDR 包含国防部的受益人,包括退休人员及其家属。因此,其受益人不仅限于65岁以上的患者,也不仅限于退伍军人。本方案为使用 MDR 提供了一个起点。
统计技术概述有助于消除此类研究中可能存在的固有偏差。
查看完整文字稿并访问数千部科学视频
本文讨论了在无法开展随机对照试验时,如何利用军事卫生系统数据存储库进行回顾性分析。文章强调了纳入死亡率数据以及使用倾向性加权以减轻偏倚的重要性。
当随机对照试验不可行时,利用大数据进行回顾性分析提供了一种具有成本效益的替代方案,但需要严格减轻偏倚,以确保治疗效应估计的有效性。逆概率处理加权(IPTW)等倾向性评分方法可在观察性医疗数据中实现混杂因素的校正,支持早期发现阶段的靶点验证和机制去风险化。该方法通过利用来自军事健康系统数据存储库等来源的真实世界证据,在治疗组间平衡已知混杂因素,从而提高预测的可信度。
该方法适用于从假设生成到先导物识别直至临床前验证的整个发现过程,特别是在利用真实世界数据在开展昂贵的实验研究之前降低生物靶点风险时尤为适用。