方法文章

利用加权回归模型估算中国台湾队列效应预测肝细胞癌死亡率

DOI:

10.3791/62253

2021年8月6日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们描述了一种多阶段方法,利用年龄数据来测量队列效应,从而在许多情况下能够在不牺牲数据质量的前提下剔除数据。该方案展示了这一策略,并提供了用于分析肝细胞癌数据的加权回归模型。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了消除年龄-时期-队列列联表数据中年龄和时期的影响,采用多阶段方法来评估队列效应。肝脏最常见的原发性恶性肿瘤是肝细胞癌(HCC)。HCC 与酒精性和病毒性病因导致的肝硬化相关。在流行病学中,通过年龄-时期-队列(APC)模型来描绘(或预测)HCC 死亡率的长期趋势。根据每个队列的加权影响确定其 HCC 死亡情况。加权均值的置信区间(CI)相对较窄(与等权重估计相比)。由于加权均值的置信区间较窄且不确定性较小,因此采用加权均值估计作为预测手段。建议在多阶段方法中,基于回归模型使用加权均值估计来评估年龄-时期列联表数据中的队列效应。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

肝脏最常见的原发性恶性肿瘤是肝细胞癌(HCC)。在全球所有恶性肿瘤中,其死亡率在男性中位居第五,在女性中位居第八(分别占男性恶性肿瘤的6%和女性恶性肿瘤的3%)1。在中国台湾,肝细胞癌是男性中最常见的癌症,也是女性中第二常见的癌症(分别占男性癌症的21.8%和女性癌症的14.2%)2。据估计,自2000年以来,全球每年新诊断的HCC病例为56.4万例,其中男性39.8万例,女性16.6万例3。在流行病学中,解释年龄、时期和队列(APC)变量之间关系的最常见方式是:年龄与时期相互影响,从而为所研究疾病的流行趋势产生独特的世代效应。

尽管这种概念化模型仍然具有年龄 + 队列 = 时期这一精确的线性关系,但暴露(预测因子)并非出生队列的固有因素。相反,我们提出,当变化导致疾病分布不同时,即存在队列效应。然而,由于年龄 + 队列 = 时期,这三个变量呈线性相关;只有在施加其他限制条件的情况下,才无法使用年龄、时期和队列的线性效应来构建估计的年龄-时期-队列(APC)模型。在本研究中,我们阐明了这一问题以及我们在先前发表的研究中所施加的潜在限制条件4,5,6,7

即使对列联表数据仅有最轻微的推测,多阶段方法8也可通过三个阶段来评估队列效应。此外,由于中位数平滑不依赖于特定的分布或框架,因此可应用于多种类型的数据,例如比值、对数比值和计数数据。中位数平滑是多相方法中使用的主要技术。

采用双向列联表的数据9来生成光学校正中位数。中位数平滑法通过迭代地从每一行和每一列中减去其中位数,以消除年龄(即行)和时期(即列)的累积效应。该方法常用于流行病学数据分析10。此技术的一个优势在于,无需对双向列联表中数据的分布或结构做出任何假设,因此该技术已被广泛应用于表内各类数据,例如自杀数据11。年龄-时期-队列(APC)模型也已被用于描述疾病发病率或死亡率的长期趋势5。APC模型通常假设年龄、时期和队列对疾病/死亡率的对数变换具有加性效应。为评估队列效应,本方案通过加权回归建立APC模型,用于完整的肝细胞癌(HCC)死亡率分析,从而支持可靠的预测及对治疗效果的适度评估。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 数据来源

为了演示计算过程,我们使用了1976年至2015年中国台湾男性和女性的肝细胞癌(HCC)死亡率年度数据。本研究采用Windows版社会科学统计软件包(SPSS)24.0版本和Microsoft Excel进行数据分析。

  1. 让肝细胞癌(HCC)医师根据国际疾病分类(ICD)代码 ICD 150,对患者的临床症状、实验室检查和医学影像结果进行分类,以给出诊断编码。
  2. 确保数据文件(保存为 CSV 格式)包含年份(即时期)、年龄、队列、死亡人数、年中人口数和死亡率等列。
    1. 点击 文件 | 导入数据 | CSV 数据 | 打开确保选中“从数据第一行读取变量名称”选项旁边的复选框,然后单击 好的确保数据文件已导入 SPSS。
  3. 通过 SPSS 构建由年龄-时期组交叉的列联表数据。通常,我们将行变量定义为年龄,列变量定义为时期。如果数据包含单个年份的时期数据(或单个年龄年份数据),则需将其整合为一个时期组(或年龄组)。随后,我们对调查年份间各年龄组的态度进行交叉列表分析。
    1. 点击 分析 | 描述性统计 | 交叉表 在“行(s)”旁边的框中选择年龄变量,在“列(s)”旁边的框中选择时期变量。点击 细胞 并确保其旁边的复选框已被勾选 观察到通过上述步骤,可在SPSS中对死亡人数(或年中人口数,或死亡率)进行列联表分析。
    2. 将已输入的列联表数据导出为 CSV 格式,以便通过其他软件进行分析。点击 文件 | 导出数据 | 确保所需数据格式为 CSV | 位置此不可编辑字段显示导出文件的安全存储位置。
    3. 文件名:Click 选择 更改文件名。
    4. 导出类型:从下拉菜单中选择一种 CSV 文件类型。点击 变量 以显示可用变量并选择变量表格。默认情况下,导出文件将保留源数据集中的所有变量。研究人员可使用这些表格指定要包含在导出文件中的源变量。点击 导出.

2. 模型设置

注意:多阶段方法由 Keys 和 Li 8 通过图示分析提出。采用中位数平差分析以消除年龄和时期累积效应的影响;最后,在线性回归模型中对队列类别中位数平差阶段得到的残差进行回归,并利用列联表中的数据评估队列效应。

  1. 第一阶段的图示表示
    1. 创建年龄组和时期组的线图。为观察跨年龄组的出生队列或出生队列本身,在线图中绘制跨越各年龄或周期的相同出生队列。
    2. 导入包含列联表死亡率数据的 CSV 文件。点击 文件 | 打开 | 浏览 从文件夹中选择一个 CSV 文件。请记住选择 所有文件 在“文件名”框旁边的下拉列表中。
    3. 点击 开放 打开CSV文件。选中死亡率列联数据的行和列,然后单击 插入 | 图表 | 折线图.
  2. 中位数抛光分析作为第二阶段
    1. 逐行和逐列迭代减去中位数,以消除年龄和时期因素的累积效应。在中位数平滑阶段之后,保留残差用于回归分析,以评估队列效应。
    2. 计算总体中位数和残差表。导入包含列联表死亡率数据的 CSV 文件(参见 2.1.1.2)。
    3. 对列联表的每个单元格的死亡率数据使用了LN。点击 公式 | 数学 & 三角函数并选择 淋巴结.
    4. 编号:为每个单元格输入位置标签。确保列联表的每个单元格均录入死亡率数据。点击 公式 | 其他函数 | 统计 并选择 中位数.
    5. 编号1:输入第一个细胞位置标签。
    6. 步骤2:输入最后一个单元格的位置标签。确保所得的中位数值存储在列联表的左上角。通过将原始值(即LN死亡率数据)减去总体中位数,生成一个残差表。
    7. 计算行中位数(即每个年龄组的中位数),并确认已为响应年龄组计算出行中位数值。点击 公式 | 其他函数 | 统计 | 选择中位数.
      1. 步骤1:输入原始样本的第一个细胞位置标签。
      2. 步骤2:输入原材料的最后一个单元格位置标签。确保生成的行中位数值存储在列联表的左侧边距中。
    8. 创建一个新的残差表,通过从各行的中位数中减去相应数值。确保从各行中位数生成一组新的残差值,其中每个单元格的值为该行中各响应变量减去对应行中位数的结果。点击 =,并确保每一行的总体单元格位置标签已减去左侧边距中位数的标签。
    9. 计算各列的中位数(即每个时期组的中位数),并确保为响应期组计算出各列的中位数值。点击 公式 | 其他函数 | 统计 | 选择中位数.
      1. 第1步:输入该列第一个单元格的位置标签。第2步:输入该列最后一个单元格的位置标签。确保所得的列中位数值存储在列联表的上部边距中。
    10. 在减去各列中位数后创建一个新的残差表。确保从各列中位数生成一组新的残差值,其中每列表中的每个单元格取值为该列中每个响应变量减去对应列中位数的结果。点击 =,并确保每个列的总体单元格位置标签均已减去上方边距中位数的标签。
    11. 重复步骤 2.1.2.7 至 2.1.2.10,直至行和列的中位数接近零。点击 公式 | 其他函数 | 统计 | 选择中位数确保行和列的中位数近似为零。将最终的残差表保存为 CSV 格式。
  3. 以体重为第三阶段的回归分析步骤
    注意:我们将每个队列的因变量计算为残差,以死亡人数作为权重。随后,我们进行线性回归以计算队列效应。
    1. 确保已安装 Kutools for Excel,并使用其“转置表格维度”工具快速将交叉表转换为平面列表。导入包含列联表残差数据的 CSV 文件(参见 2.1.2.11)。
    2. 选择要转换为列表的表格。单击 Kutools | 修改 | 转置表格维度在“转置表格维度”对话框中,确保选中“交叉表转列表”选项旁边的复选框,并选择结果范围以将残差保存为列表格式。
    3. 在初始数据文件中插入一列(参见1.2),并填入残差列表格式的数据(参见2.1.3.1)。确保已在残差列表格式数据中插入支持性列(参见2.1.3.1)。点击 = age & 周期变量,然后按 Enter 键。使用辅助列查找残差列表格式数据中的年龄和周期组标签,以在初始数据文件中插入一个响应残差列(参见 1.2)。
    4. 点击 公式 | 查找 & 参考 | 选择 VLOOKUP. 设置VLOOKUP(年龄的单元格位置标签) & 周期的细胞位置标签,支持列的第一个细胞位置标签:残差列的最后一个细胞位置标签,4, 0)。确保所选范围包含支持列、年龄列、周期列和残差列(即这4列)th 柱作为残差列表)。
    5. 确保将残差插入初始数据文件(参见1.2),并查找残差列表格式数据(参见2.1.3.1)以进行下一步操作。采用加权最小二乘法拟合回归模型,并对残差进行分析。
    6. 点击 分析 | 回归 | 线性将自变量“队列类别”(即17个出生队列)移入“自变量(s)”框,将因变量“残差”移入“因变量”框。点击“确定”。确保生成未加权的队列效应结果。
    7. 确保将残差插入初始的 Excel 数据文件中(参见 1.2),并查阅残差列表格式数据(参见 2.1.3.1)以进行下一步。采用加权最小二乘法拟合回归模型,并分析残差。点击 分析 | 回归 | 线性.
    8. 将自变量和队列类别(即17个出生队列)移入自变量框,将因变量和残差移入因变量框。将死亡人数移入WLS权重框。点击 好的确保其生成队列效应的加权平均结果。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

死亡率数据展示了10个五年龄组(40-44、45-49、50-54、55-59、60-64、65-69、70-74、75-79、80-84和85+)以及8个五年时间段(1976-1980、1981-1985、1986-1990、1991-1995、1996-2000、2001-2005、2006-2010和2011-2015)。队列组的数量通过从年龄-时期组总数中减去1来确定:10(五年龄组)+ 8(五年时间段)- 1 = 17个出生队列,出生队列组以队列中间年份表示,分别为1891、1896、1901、1906、1911、1916、1921、1926、1931、1936、1941、1946、1951、1956、1961、1966和1971。我们提供了男性和女性肝细胞癌(HCC)按年龄组分布的格式(见补充表1)。图1图2展示了不同年龄组和时期组内的HCC死亡率。这些波动在男性中比在女性中更为显著。基于年龄分布的比率显示,在40-44岁年龄组的较低端,HCC死亡率呈上升趋势(

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

由于肝细胞癌(HCC)死亡率存在时间趋势,传统模型低估了数据中一些重要的隐藏特征(如队列效应),而采用简单线性外推法对观察到的对数年龄校正死亡率进行的传统分析,其预测准确性显著降低。如果直接观察中国台湾1976年至2015年HCC死亡率的长期趋势,可以明显看出这一上升趋势已持续了35年,并将在未来几年继续上升(图3)。事实上,中国台湾HCC死亡率的近期趋势正在下降,这主要由队列效应驱动(通过APC分析确定),正如前文所述,该效应自1936年出生队列之后开始下降。本研究表明,应用APC模型能够更早且更准确地预警趋势变化。

从临床角度来看,全球约有二十亿人感染乙型肝炎病毒(HBV)12,其中约三亿五千万人因此患病,因而这是一个在全球范围内具有高发病率的重要公共卫生问题。HBV感染可导致多种临床表现,从无症状携带状态到暴发性肝炎、肝硬化或肝细胞癌。最有效的预防方法是为个体接种乙型肝炎疫苗。中国台湾于1984年实施了全球首个乙型肝炎大规模疫苗接种计划

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作由台北慈济医院 TCRD-TPE-109-RT-8 (2/3) 和 TCRD-TPE-109-39 (2/2) 项目资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
不适用不适用不适用不适用

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kuntz, E., Kuntz, H. D. Hepatology: Principles and Practice. , Springer. New York. 774(2006).
  2. McGlynn, K. A., et al. International trends and patterns of primary liver cancer. International Journal of Cancer. 94 (2), 290-296 (2001).
  3. Bosch, F. X., Ribes, J., Diaz, M., Cleries, R. Primary liver cancer: worldwide incidence and trends. Gastroenterology. 127, 5-16 (2004).
  4. Tzeng, I. S., Ng, C. Y., Chen, J. Y., Chen, L. S., Wu, C. C. Using weighted regression model for estimating cohort effect in age-period contingency table data. Oncotarget. 9 (28), 19826-19835 (2018).
  5. Tzeng, I. S., Lee, W. C. Forecasting hepatocellular carcinoma mortality in Taiwan using an age-period-cohort model. Asia-Pacific Journal of PublicHealth. 27, 65-73 (2015).
  6. Tzeng, I. S., et al. Predicting emergency departments visit rates from septicemia in Taiwan using an age-period-cohort model, 1998 to 2012. Medicine. 95, 5598(2016).
  7. Chen, S. H., et al. Period and Cohort Analysis of Rates of Emergency Department Visits Due to Pneumonia in Taiwan, 1998-2012. Risk Management and Healthcare Policy. 13, 1459-1466 (2020).
  8. Keyes, K. M., Li, G. A multiphase method for estimating cohort effects in age-period contingency table data. Annals of Epidemiology. 20, 779-785 (2010).
  9. Tukey, J. Exploratory data analysis Reading: MS. , Addison-Wesley Publishing Company. (1977).
  10. Selvin, S. Statistical analysis of epidemiologic data. , University Press. New York: Oxford. (1996).
  11. Légaré, G., Hamel, D. An age-period-cohort approach to analyzing trends in suicide in Quebec between 1950 and 2009. Canadian Journal of Public Health. 104, 118-123 (2013).
  12. Lavanchy, D. Hepatitis B virus epidemiology, disease burden, treatment, and current and emerging prevention and control measures. Journal of Viral Hepatitis. 11, 97-107 (2004).
  13. Chang, M. H., et al. Universal hepatitis B vaccination in Taiwan and the incidence of hepatocellular carcinoma in children. Taiwan Childhood Hepatoma Study Group. New England Journal of Medicine. 336, 1855-1859 (1997).
  14. Lu, F. T., Ni, Y. H. Elimination of mother-to-infant transmission of hepatitis B virus: 35 years of experience. Pediatric Gastroenterology, Hepatology & Nutrition. 23 (4), 311-318 (2020).
  15. Chien, Y. C., Jan, C. F., Kuo, H. S., Chen, C. J. Nationwide hepatitis B vaccination program in Taiwan: effectiveness in the 20 years after it was launched. Epidemiologic Reviews. 28, 126-135 (2006).
  16. Ahmad, O. B., et al. Age standardization of rates: a new WHO standard. Geneva: GPE Discussion Paper Series. World Health Organization. , 31(2005).
  17. da Silva, C. P., Emídio, E. S., de Marchi, M. R. Method validation using weighted linear regression models for quantification of UV filters in water samples. Talanta. 131, 221-227 (2015).
  18. Dawes, R. M. The robust beauty of improper linear models in decision making. American Psychologist. 34, 571-582 (1979).
  19. Dawes, R. M., Corrigan, B. Linear models in decision making. Psychological Bulletin. 81, 95-106 (1974).
  20. Einhorn, H. J., Hogarth, R. M. Unit weighting schemes for decision making. Organizational Behavior and Human Performance. 13, 171-192 (1975).
  21. Wang, W., et al. Association of hepatitis B virus DNA level and follow-up interval with hepatocellular carcinoma recurrence. JAMA Network Open. 3 (4), 203707(2020).
  22. Holford, T. R. The estimation of age, period and cohort effects for vital rates. Biometrics. 39, 311-324 (1983).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

视频即将推出

相关文章