方法文章

用于商业网络中中心性与干预分析的块预处理PageRank方法

DOI:

10.3791/70197

2026年3月13日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案通过整合基于主成分分析的方向增益、多源边权重以及分块预处理的Krylov子空间线性求解器,计算基于PageRank的中心性,并评估商业网络中的靶向干预措施,以提高数值稳定性和可重复性。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

商业网络受到多种异质性驱动因素的影响(例如地理、类别结构和运营绩效),因此单一的财务指标可能无法反映节点在整个系统中的结构作用。本方案利用主成分分析提取低维特征方向,并基于结构化辛块矩阵应用成对谱一致性检验,以提高所选方向的可靠性。利用这些方向,工作流程构建了一个加权有向图,融合了空间相似性、业务类别协同效应以及由特征梯度导出的方向增益项。随后,通过使用块预处理广义最小残差法求解PageRank线性系统来计算中心性,并报告明确的收敛性和诊断检查点以确保可重复性。该工作流程在一个公开数据集的州级零售汇总数据(49个节点)上进行了演示,结果显示少数几个主成分即可捕捉大部分特征方差,并支持稳定的方向加权。最后,本方案评估了一种从强到弱的定向干预策略,即将高中心性节点的部分边权重按量化比例重新分配给低中心性节点,并在相同的个性化设置下重新计算PageRank。总体而言,本方案使用户能够构建可解释的多源商业网络,计算经过数值验证的PageRank中心性,并通过明确定义的诊断方法测试干预策略。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

商业网络(例如,州级零售系统和区域商业区)由异质性的参与者构成,这些参与者既相互合作又相互竞争。其互动关系受到空间位置、业态结构以及顾客和商品流动方向的影响。因此,单点指标(例如,仅销售额)可能无法客观反映节点在网络中的结构作用1,2,3。同一区域内的企业可能在规模和运营条件上存在显著差异,而它们之间的互动还进一步受到空间环境和时间性人流变化的影响。因此,启发式指标和简单的销售排名在刻画网络位置以及节点间的促进或抑制关系方面可能存在不足3

复杂网络理论为量化节点重要性提供了整体性视角。PageRank(PR)通过模拟随机游走来估计节点重要性,已广泛应用于排序和扩散模型中。先前研究表明,可通过将邻接矩阵替换为权重矩阵,并使用节点强度而非节点度,将PR推广至加权场景4。加权PR模型进一步通过可调参数平衡基于度和基于强度的贡献,已被应用于大规模经济依赖网络5。基于移动性和消费数据构建的地点间依赖关系也被用于建立行为网络,将中心性模式与城市经济韧性关联起来6。近期整合多源城市数据的研究表明,单一指标排序往往难以反映多因素机制,这推动了同时建模结构与属性的网络构建方法7。在商业区尺度上的证据同样表明,数量、业态多样性及业态结构共同影响商业活力,应被联合建模2。相关研究将中心性与设施分布模式及可达性相联系,进一步强调在商业环境中需同时捕捉关系结构与上下文特征8˒9

从方法论角度来看,现有文献指出了应用型商业网络研究中两个常被忽视的实际需求。第一,当使用多变量属性构建有方向性或基于特征信息的权重时,应对提取出的方向的稳定性进行明确检验,而非默认其稳定7。第二,中心性计算应报告可重复的诊断检查点(例如稀疏性/连通性检验和求解器收敛性),以确保研究结果不仅限于单一的排序输出,而是具有可验证性4˒5

尽管取得了这些进展,许多应用研究在报告排序结果时仍缺乏:(i)对从多变量特征中提取的方向信息进行明确的稳定性检验,(ii)可重复的检查点以验证图的稀疏性/连通性及数值收敛性,以及(iii)在不同设置之间可参数化且可比较的干预效果评估1,2,3。本实验方案通过实现完整工作流程的可审计性来弥补上述不足:提取低维特征方向,验证方向一致性,构建多源加权有向图,并采用数值稳定的分块预处理迭代求解器计算PR中心性,同时清晰报告各项诊断指标。此外,在固定的个性化设置下,本方案进一步评估一种从强到弱的定向干预,以量化干预措施在不同情境下对中心性重分配的可比较影响。

与仅重新加权边或添加层的PR变体相比,该工作流程提供了可量化的输出,用户可直接验证和比较这些输出:(i)在边级别上具有可解释的方向性贡献;(ii)明确的中间诊断指标(目标方差解释率、稀疏性/连通性检查以及求解器收敛标志);(iii)干预效应度量指标,用于量化在固定个性化设置下,指定源/目标集合之间PR的变化。当节点代表具有坐标和多变量运营特征的空间定位商业单元(例如,州、城市、地区、平台),且特征空间表现出稳定的低维结构而非极端稀疏性或低信噪比噪声时,本方案最为适用。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 数据准备与标准化

  1. 导入并筛选数据集。导入一个公开的零售订单数据集,并保留2014年至2017年的记录18
  2. 定义节点。将节点集 V 定义为美国各州,并保留具有足够观测值的州,使得 |V|=49。令 n=|V|。
  3. 构建节点级特征向量。对每个节点 i∈V,聚合交易记录并计算一个16维的特征向量 xi∈R16。该特征向量包括销售额统计量(总计、均值、标准差和范围)、利润统计量(总计、均值、标准差和范围)、数量统计量(总计、均值、标准差)、折扣统计量(均值和标准差),以及三个额外指标:利润率(ProfitMargin)、订单数量(OrderCount)和每笔订单平均利润(AvgOrderProfit)。
  4. 缺失值的确定性处理与数值稳定因子。将任何缺失的衍生特征项替换为0,并记录替换次数。定义一个固定的稳定因子 δ=10-12,用于后续计算中可能趋近于零的分母(见公式4)。
  5. 特征标准化。对节点进行Z分数归一化,得到标准化特征矩阵 Xstd∈R49×16
    检查点1:验证标准化后 X_{\text{std}} 为49×16矩阵且无缺失项,并确认后续类别计数之和为49。
  6. 定义用于分层的销售类别。根据总销售额的三分位数将节点划分为三类(低/中/高),并记录各类大小(低:16;中:17;高:16)¹⁸。用 c(i) ∈ {L,M,H} 表示节点的类别归属。

2. JRS 验证的主成分分析降维方法(JRS-PCA)

  1. 协方差估计。按下式由 X_{\text{std}} 计算协方差矩阵 C。
    C = cov(X标准)  (1) 
  2. 主成分提取。使用稀疏特征分解计算矩阵 C 的前 k 个特征对,默认设置 k = 4。
  3. 解释的方差。记录每个主成分所解释的方差,以及前四个主成分(PCs 1–4)累计解释的方差2.
  4. PC得分表示。对于每个节点i,计算PC得分向量z_i∈ℝ^k,并记录(zi,1,zi,2用于按销售类别着色的PC1–PC2散点图可视化。
  5. JRS 块构造。按如下方式构建具有 JRS 结构的辛块矩阵。
    S = diag(C, -C) (2) 
  6. 显式匹配下的配对谱一致性。计算矩阵 S 的特征值,将其划分为正特征值集和负特征值集,将正特征值按降序排列,并将负特征值的绝对值按降序排列,然后按索引进行配对,计算最大配对偏差 \max_j|\lambda^+_j+\lambda^-_j|。该匹配规则确定了实现细节以保证可重复性2.
    检查点 2:报告前 4 个主成分(PC 1–4)解释的累计方差 Optimization formula max |λᵢ⁺ + λᵢ⁻|, spectral analysis, mathematical equation, research. 在构建方向性增益之前,确认稳定的低维结构2.

3. 多源加权有向图的构建

  1. 空间相似性权重。对于每个有序对 (i,j),按如下方式计算空间高斯核权重:
    空间加权方程;图像处理中高斯权重计算的公式。   (3) 
    其中 p= (xi,yi) 表示节点 i 的质心坐标,σ 为带宽,默认值设为 10.0。
  2. 基于类别的协同权重。利用步骤 1.6 中的销售类别关系定义协同基线 wsyn(i,j)。
    当 c(i) = c(j) 时,设 wsyn(i,j)=0.6;当类别相邻(低–中或中–高)时,设 wsyn(i,j)=0.4;当类别不相邻(低–高)时,设 wsyn(i,j) = 0.2。
  3. 主成分分析(PCA)方向增益。通过以下方式计算主成分得分空间中的稳定单位方向:
    静态平衡方程 d(i,j),展示向量归一化与减法公式。   (4) 
    其中 δ=10-12。使用参考方向 r = (1,0,…,0) 定义沿 PC1 的非负对齐得分:
    数学公式 g(i,j)=max(0,d̂(i,j)ᵀr),用于数据分析;方程表示。   (5) 
    定义同类惩罚项为:
    转移概率方程;若 c(i)=c(j),则 π(i,j)=0.90;若 c(i)≠c(j),则 π(i,j)=1.00;数学公式。   (6) 
    并通过下式计算方向增益权重:
    wori(i,j) = β⋅wsyn(i,j) ⋅ g(i,j) ⋅ π(i,j)   (7) 
    其中 β=1.0。惩罚项 π(i,j) 实现了轻微的同类降权,以促进跨类连接,同时保持类内连通性5
  4. 权重融合与自环去除。融合多源权重以形成有向权重矩阵:
    静态平衡方程图示,W_total = W_space + W_syn + W_ori,教学用公式。   (8) 
    并设 diag(Wtotal) = 0 以去除自环。
  5. 对称检查矩阵(可选)。计算对称代理矩阵:
    对称权重方程 W_sym=(W_total+W_total^T)/2,数学公式。   (9) 
    仅用于检查。
  6. 稀疏化及定量验证。保留 Wtotal 中非零元素的前 q%(默认 q=35%),得到稀疏有向邻接矩阵 Adir。记录 nnz(Adir) 和密度2,可选地对 Wsym 应用相同的稀疏化规则以获得用于检查的 Asym2
    检查点 3:稀疏化后,报告 nnz(Adir) 和密度,报告弱连通分量的数量(目标:1),并检查是否存在列和为零的情况。若存在列和为零的列,则在步骤 4.1 中应用悬空节点处理2。若稀疏化导致图断开连接,则依次将稀疏化严格程度从 35% 放宽至 30%,再至 25%,每次调整后重复该检查点。

4. 基于类别块预处理的LGMRES PageRank求解方法

  1. 处理悬挂节点的列随机转移矩阵。计算矩阵 A 的列和目录 并构成对角矩阵 D。对于任意一个元素和为零的列,在归一化之前,先将该列替换为个性化向量 u,并通过此操作形成列随机转移矩阵
    WA目录D-1  (10) 
  2. PageRank 作为线性系统。通过阻尼因子 α(默认 α=0.85)和个人化向量 u 定义 PageRank:
    p = (1-α)u + αWcp (11) 
    并求解等效的线性方程组
    (I-( I -αWc)p = (1 - α)u (12) 
    (II-含M = I - αWc⊤ 且 b = (1-α)u。 
  3. 右预条件子分块。提取 M 中对应于低/中/高类别的对角线子块,并利用每个对角线子块的伪逆构造块对角近似 P^{-1}。对于未被子块覆盖的索引,使用 M 对角线元素的倒数作为对角线备用方案19.
  4. 迭代求解与诊断报告。使用带右预条件子P的有限内存广义最小残差法求解Mp = b-1 ,配置为 rtol = 1e−6,atol = 0,maxiter = 500,inner_m = 30,outer_k = 319记录求解器信息标志(目标值:0)和最终相对残差 ‖Mp - b‖2/‖b‖2 ,外层迭代次数19.
  5. 归一化与有效性检查。若出现微小负值,将其截断至0,并记录被截断值的最大幅度,然后重新归一化,使得∑ip= 1 .
    检查点 4:报告信息,报告 ‖Mp - b‖2/‖b‖2 ,报告 Equilibrium condition formula, min(pi), mathematical analysis, equation snippet,报告∑ipi 作为可重复性诊断指标,而非定性描述¹⁹。

5. 干预实验与结果比较

  1. 源点与目标点的选择。使用固定的个性化向量 u,将基线概率 p 最高的三个节点定义为源点集 S,基线概率最低的三个节点定义为目标点集 T,并记录所选节点。2.
  2. 在设定上限约束的情况下选择干预强度。选择 ε ∈ [0.05, 0.15],使得在稀疏化后,每个源节点注入的权重不超过该节点原有出边权重总和的10%,并记录 ε 值以及每个源节点的注入权重与原始权重之比2.
  3. 确定性边权重更新。计算平均正边权重 Static equilibrium, ΣF=0, diagram; illustrating forces balance in physics, mechanical analysis. 在 A 中目录
    ,然后通过 s ∈ S 且 t ∈ T 更新每个有序对 (s,t)
    A'目录(s,t) = Adir(s,t) + εw (13) 
    并像第4.1步那样,根据A'_{\text{dir}}重新计算W_c,同时保持α和u不变。
  4. 重新计算 PageRank 并量化变化。重复步骤 4.2–4.5 以获得 p',计算 Δp = p' - p,并报告集合 S 和 T 中节点的绝对变化与相对变化。2验证干预后求解器诊断结果仍在目标范围内(info = 0;残差 ≤ rtol)2.
    检查点 5:报告 ε,报告每个源节点的注入量与原始量之比,报告干预前后求解器信息和残差,并报告 S 和 T 的 Δp 概要2.

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实验条件与数据

所有分析均在搭载 Windows 操作系统的台式计算机上运行。工作流程使用 Python 3.12 实现,依赖 NumPy、Pandas、SciPy 和 Matplotlib 库,并将随机种子固定为 2025 以确保结果可重复18。对一个公开的零售订单数据集进行筛选,保留 2014–2017 年的记录22。将订单按州级别汇总,定义 49 个节点(具有足够观测值的美国各州)。针对每个节点,计算了 16 项运营特征,包括销售额(总计/均值/标准差/范围)、利润(总计/均值/标准差/范围)、数量(总计/均值/标准差)、折扣(均值/标准差)、利润率、订单数量以及每笔订单的平均利润18。根据总销售额的三分位数将各州划分为低、中、高三类,用于协同加权和类别块预处理(低类:16 个;中类:17 个;高类:16 个)18。PageRank 计算采用阻尼因子 α...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案通过整合多源加权图构建、基于主成分分析(PCA)的方向性增益以及类别分块预处理的LGMRES PageRank求解器,提供了一套可重复的工作流程,用于评估州级商业网络中的中心性并分析针对性干预措施18˒23。该流程不仅输出单一的中心性排序结果,更强调中间诊断环节——包括解释方差检验、稀疏性/连通性报告以及求解器收敛性标准——使用户能够在多个阶段验证结果的正确性,并理解在不同个性化设置下排序变化的原因24˒25

输出结果的可靠性对流程早期的一系列设计选择极为敏感,这些选择会贯穿影响所有后续结果。方向增益项仅在标准化特征空间呈现出稳定的低维结构时才有意义;因此,在应用方向加权之前,主成分分析(PCA)的方差解释曲线以及JRS配对谱一致性检验应被视为必要前提,而非可选附加步骤26˒

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢公共数据提供方公开本方案所用数据集。作者同时感谢所在机构提供的计算资源和技术支持。本研究未获得任何外部经费资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
MatplotlibMatplotlib Development Teamv3.8+
中心性/干预结果的图表生成与可视化
NumPyNumPy Developersv1.26+
数值数组操作与矩阵计算
PandasPandas Development Teamv2.2+
数据清洗、聚合与表格数据管理
PythonPython Software Foundationv3.12
数据处理与模型执行的核心编程环境
SciPySciPy Communityv1.13+
稀疏线性代数与迭代求解器支持(例如 LGMRES)

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Y., Wang, M., Yang, X., Zhang, R. Urban commercial space vitality evaluation method based on social media data: The case of Shanghai. Land. 14 (4), 697(2025).
  2. Ji, Y., Wang, Z., Zhu, D. Exploring the impact of urban amenities on business circle vitality using multi-source big data. Land. 13 (10), 1616(2024).
  3. Chen, H., Ge, J., He, W. Quantifying urban vitality in Guangzhou through multi-source data: A comprehensive analysis of land use change, streetscape elements, POI distribution, and smartphone-GPS. Land. 14 (6), 1309(2025).
  4. Gómez, S. Centrality in networks: Finding the most important nodes. Business and Consumer Analytics: New Ideas. , Springer International Publishing. Cham. 401-433 (2019).
  5. Zhang, P., Wang, T., Yan, J. PageRank centrality and algorithms for weighted, directed networks. Physica A: Statistical Mechanics and its Applications. 586, 126438(2022).
  6. Yabe, T., García Bulle Bueno, B., Frank, M. R., Pentland, A., Moro, E. Behaviour-based dependency networks between places shape urban economic resilience. Nature Human Behaviour. 9 (3), 496-506 (2025).
  7. Xie, Y., et al. Integrating multi-source urban data with interpretable machine learning for uncovering the multidimensional drivers of urban vitality. Land. 13 (12), 2028(2024).
  8. Lee, Y., Seo, D. Identifying relationship between regional centrality and POI facilities: A case study of Seoul metropolitan area. ISPRS International Journal of Geo-Information. 13 (1), 12(2024).
  9. Poudyal, B., Ghoshal, G., Kirkley, A. Characterizing network circuity among heterogeneous urban amenities. Journal of the Royal Society Interface. 20 (208), 20230296(2023).
  10. Zeng, J., Wu, Y., Liu, J., He, D., Lan, Z. Identification of critical nodes in power grid based on improved PageRank algorithm and power flow transfer entropy. Electronics. 13 (1), 184(2024).
  11. Improved PageRank algorithm-based vulnerable lines identification considering the impact of natural gas system. Hu, T., Hu, S., Nan, L. Proceedings of the 7th International Conference on Mechatronics and Computer Technology Engineering (MCTE), , 864-869 (2024).
  12. Li, J., Lin, Y., Su, Q. Identifying critical nodes in power grids containing renewable energy based on electrical spreading probability. International Journal of Electrical Power & Energy Systems. 154, 109431(2023).
  13. Miller, B., Alderson, A., Eubank, S. Multi-layer network PageRank for critical infrastructure analysis. Homeland Security Affairs. 20 (4), 23189(2024).
  14. Aleja, D., Flores, J., Primo, E., Romance, M. Time-dependent personalized PageRank for temporal networks: Discrete and continuous scales. Chaos: An Interdisciplinary Journal of Nonlinear Science. 34 (8), 083145(2024).
  15. Mariani, M. S., Medo, M., Zhang, Y. -C. Ranking nodes in growing networks: When PageRank fails. Scientific Reports. 5 (1), 16181(2015).
  16. Aleja, D., Criado, R., García del Amo, A. J., Pérez, Á, Romance, M. Non-backtracking PageRank: From the classic model to Hashimoto matrices. Chaos, Solitons & Fractals. 126, 283-291 (2019).
  17. Contreras-Aso, G., Criado, R., Romance, M. Can the PageRank centrality be manipulated to obtain any desired ranking. Chaos. 33 (8), 083152(2023).
  18. Flores, J., García, E., Pedroche, F., Romance, M. Parametric controllability of the personalized PageRank: Classic model vs biplex approach. Chaos. 30 (2), 023115(2020).
  19. Li, Z., Tang, J., Zhao, C., Gao, F. Improved centrality measure based on the adapted PageRank algorithm for urban transportation multiplex networks. Chaos, Solitons & Fractals. 167, 112998(2023).
  20. Opricovic, S., Tzeng, G. -H. Defuzzification within a multicriteria decision model. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems. 11 (5), 635-652 (2003).
  21. Wilkinson, M. D., et al. The FAIR guiding principles for scientific data management and stewardship. Scientific Data. 3 (1), 1-9 (2016).
  22. Sample superstore, sample data. Tableau Public. , Tableau Software. https://public.tableau.com/app/learn/sample-data (2025).
  23. Peng, R. D. Reproducible research in computational science. Science. 334 (6060), 1226-1227 (2011).
  24. Langville, A. N., Meyer, C. D. Google’s PageRank and Beyond: The Science of Search Engine Rankings. , Princeton University Press, Princeton. (2006).
  25. Saad, Y. Iterative Methods for Sparse Linear Systems. , SIAM. Philadelphia. (2003).
  26. Jolliffe, I. T., Cadima, J. Principal component analysis: A review and recent developments. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences. 374 (2065), 20150202(2016).
  27. Mehrmann, V. L. The Autonomous Linear Quadratic Control Problem: Theory and Numerical Solution. , Springer. Berlin. (1991).
  28. Graph sparsification by effective resistances. Spielman, D. A., Srivastava, N. Proceedings of the 40th Annual ACM Symposium on Theory of Computing, , 563-568 (2008).
  29. Boldi, P., Santini, M., Vigna, S. PageRank: Functional dependencies. ACM Transactions on Information Systems. 27 (4), 1-23 (2009).
  30. Topic-sensitive PageRank. Haveliwala, T. H. Proceedings of the 11th International Conference on World Wide Web, , 517-526 (2002).
  31. Gleich, D. F. PageRank beyond the web. SIAM Review. 57 (3), 321-363 (2015).
  32. Baker, A. H., Jessup, E. R., Manteuffel, T. A. technique for accelerating the convergence of restarted GMRES. SIAM Journal on Matrix Analysis and Applications. 26 (4), 962-984 (2005).
  33. Kuhn, M., Johnson, K. Feature Engineering and Selection: A Practical Approach for Predictive Models. , Chapman and Hall/CRC. (2019).
  34. Wainwright, M. J. High-Dimensional Statistics: A Non-Asymptotic Viewpoint. , Cambridge University Press. (2019).
  35. Silverman, B. W. Density Estimation for Statistics and Data Analysis. , Routledge. (2018).
  36. Saltelli, A., et al. Global Sensitivity Analysis: The Primer. , John Wiley & Sons. (2008).
  37. Aral, S., Nicolaides, C. Exercise contagion in a global social network. Nature Communications. 8 (1), 14753(2017).
  38. Berkhin, P. A survey on PageRank computing. Internet Mathematics. 2 (1), 73-120 (2005).
  39. Kivelä, M., et al. Multilayer networks. Journal of Complex Networks. 2 (3), 203-271 (2014).
  40. Holme, P., Saramäki, J. Temporal Network Theory. , Springer. 1-24 (2019).
  41. Linden, G., Smith, B., York, J. Amazon.com recommendations: Item-to-item collaborative filtering. IEEE Internet Computing. 7 (1), 76-80 (2003).
  42. Wu, Z., et al. A comprehensive survey on graph neural networks. IEEE Transactions on Neural Networks and Learning Systems. 32 (1), 4-24 (2020).
  43. Stodden, V. Reproducing statistical results. Annual Review of Statistics and Its Application. 2 (1), 1-19 (2015).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

PageRank

相关文章