本文提出了生成式代理学习框架(Generative Proxy Learning Framework,GPLF),该框架将基于代理的联邦学习(Proxy-based Federated Learning,ProxyFL)引入信息物理系统(Cyber-Physical Systems,CPS)中的生成式人工智能解决方案。通过整合差分隐私特性和加密方法,GPLF增强了隐私保护能力,减少了隐私泄露风险,从而使信息物理系统的运行更加智能和安全。
研究文章
本文提出了生成式代理学习框架(Generative Proxy Learning Framework,GPLF),该框架将基于代理的联邦学习(Proxy-based Federated Learning,ProxyFL)引入信息物理系统(Cyber-Physical Systems,CPS)中的生成式人工智能解决方案。通过整合差分隐私特性和加密方法,GPLF增强了隐私保护能力,减少了隐私泄露风险,从而使信息物理系统的运行更加智能和安全。
信息物理系统(Cyber-Physical System, CPS)将计算智能与物理过程相融合,能够在多个关键领域实现即时监控、决策能力和自动化服务。然而,生成式人工智能(Generative Artificial Intelligence, AI)在 CPS 中的部署面临显著障碍,原因在于具有敏感数据的分布式环境带来了严峻的隐私与安全维护挑战。当前的技术方法,如联邦学习(Federated Learning, FL),在模型多样性方面存在困难,同时仍面临隐私泄露的风险。生成式代理学习框架(Generative Proxy Learning Framework, GPLF)是我们的创新性解决方案,该框架专门针对信息物理系统(CPS)中的生成式 AI 应用,采用基于代理的联邦学习(Proxy-based Federated Learning, ProxyFL)。在 GPLF 中,每个参与者维护两个模型:一个用于本地数据分析的私有模型,以及一个支持节点间安全协作的共享代理模型。作为生成式 AI 机制的核心基础,先进的扩散模型(Diffusion Models)能够生成高保真度的合成数据,并有效保留关键数据特征。这些模型生成合成传感器数据,可在多种场景下通过真实的信息物理系统行为表征,提升异常检测能力,并支持预测建模。该系统在代理数据更新过程中引入差分隐私机制,实现高级别的隐私保护;同时,网络中的直接对等通信得益于先进的加密保护技术。GPLF 通过连接实时传感器和物联网(IoT)设备,为 CPS 平台提供支持,实现包括异常检测、合成数据生成和预测建模在内的安全生成式处理流程。基于标准 CPS 数据集的测试结果表明,该系统在性能上显著提升:隐私泄露减少 25%,数据交换能力提高 25%,生成任务准确率提升 18%,展现出其在构建安全、智能的 CPS 运行体系中的变革潜力。
该研究通过将计算智能与现实世界过程相结合,探索信息物理系统(Cyber-Physical Systems, CPS),以实现实时监控、快速决策能力及系统自动化1。新兴的物联网(Internet-of-Things, IoT)与人工智能(Artificial Intelligence, AI)技术正显著拓展CPS系统的应用范围,使其在智能电网建设、工业自动化流程以及医疗健康服务等领域发挥关键作用2。部署CPS的组织机构正 increasingly 采用生成式AI模型,该模型具备模拟系统行为、实现预测建模以及增强异常检测的能力。然而,CPS数据的分布式结构及其敏感属性,导致在生成式AI应用中存在严重的隐私泄露风险、安全问题及可扩展性挑战。
现有的技术(如联邦学习(Federated Learning, FL))虽然注重数据隐私保护,但仍存在若干局限性,包括模型更新过程中隐私泄露的风险,对生成式人工智能(Generative AI)支持不足,以及难以有效应对复杂多样的信息物理系统(CPS)环境条件3。当前的方法在分布式CPS实时运行过程中,缺乏将先进数据生成机制与隐私保护措施有效整合的关键能力。由于现有框架在多个方面均存在不足,相关研究表明,亟需通过构建一种新型解决方案来满足这些需求,该方案需能够提供安全、可扩展的生成模型,同时实现明确且可靠的隐私保护4。
新的生成式代理学习框架(GPLF)研究提出了一种专门设计的方法,以促进生成式人工智能功能在信息物理系统(CPS)中的部署。GPLF 实现了一种基于代理的联邦学习(FL)方案5,使用户能够使用私有模型进行个体数据分析,同时利用代理模型维持受保护的协同学习活动。该研究通过结合差分隐私方法与安全的同态加密技术,旨在增强数据隐私性,并采用先进的扩散模型生成高质量的合成数据。该系统支持安全的异常检测和预测建模功能,同时允许在分布式 CPS 操作之间实现高效的信息传输。
GPLF 通过其双模型框架设计解决了现有联邦学习(FL)面临的挑战,该设计提供了数据保护和系统灵活性6。每个 CPS 参与方同时使用私有模型和代理模型,从而建立两个独立的系统,以实现本地隐私保护并支持协同学习能力。私有模型通过本地化操作从参与方的机密数据中进行学习,并将敏感信息存储于各参与方的参数内部,从而保障完整的数据隐私。该系统在本地层面检测异常和识别模式时可达到最佳性能7。代理模型则作为所有参与方可共享的联合集体学习机制,用于安全的知识共享。代理模型通过扩散模型生成的经净化的合成数据进行保密训练,并利用差分隐私和同态加密技术传递更新,从而实现既隐私又具备功能性的联邦学习。
扩散策略能够生成保持关键特征的同时隐藏个人细节的高质量合成数据集。该研究取得了显著进展,表现为隐私泄露大幅减少、数据交换功能增强以及生成任务性能提升,从而实现了更稳健的网络物理系统运行。GPLF 通过将隐私保护学习与生成式人工智能能力相结合,为智能网络物理系统创建了一种新方法8。
GPLF 通过其双模型设计展现出新颖的能力,专门针对在信息物理系统(CPS)中部署生成式人工智能时的隐私问题。传统联邦学习为所有参与者使用单一模型,而 GPLF 则同时部署用于本地数据处理的私有模型和用于执行群体学习任务的代理模型。通过严格的数据隔离,患者可将敏感信息保留在本地,同时利用代理模型生成的经净化的合成数据并结合差分隐私技术,实现安全的协作。代理模型通过扩散模型生成的高质量合成数据,确保系统具备强大的异常检测和预测建模能力,同时保持系统的适应性,保障用户隐私。GPLF 因其双模型架构在加强隐私保护的同时确保数据安全,并兼顾可扩展性与运行效率,因而成为安全 CPS 系统中一项创新性的框架。
本研究的目标是开发一种基于代理的联邦学习(Proxy-Based Federated Learning, ProxyFL),该方法需要采用双模型架构,以实现信息物理系统(CPS)内的安全自适应。此外,必须采用先进的扩散模型作为合成数据生成的集成点,以在保护隐私的同时维持数据的关键特征。最后,还需结合差分隐私方法与同态加密协议,以确保数据安全,并在梯度聚合过程中保护隐私。
表19,10,11,12,13,14,15,16,17,18,19 概述了现有方法的核心流程及其取得的成果,并指出了若干关键局限性。
表1:现有研究的关键重点、核心组成部分、成果及局限性概述。 请点击此处下载该表格。
现有的将生成式人工智能融入信息物理系统(CPS)的方法在扩展至大规模部署时,暴露出在遵守隐私法规和实现系统灵活性方面的关键问题20。当前的联邦学习(FL)方法由于模型多样性不足,且在分散和动态变化的系统中表现出性能薄弱,加之因脆弱的数据传输实践导致用户数据暴露,因而存在诸多限制。在CPS中,异常检测、合成数据生成和预测建模通常需要高保真的数据表示,而许多生成模型解决方案难以满足这一要求,其在尝试达到这些标准时可能损害隐私性和计算效率。现有系统的缺陷证实了亟需一种能够支持可扩展、安全且高效的生成式人工智能过程的框架。
访问受限。请登录或开始试用以查看此内容。
生成式代理学习框架(GPLF)是一种将生成式人工智能与信息物理系统(CPS)相结合的新型技术,旨在解决分布式网络系统中的数据隐私、安全性和性能指标等关键问题。CPS平台的功能依赖于实时监控以及从越来越多的物联网(IoT)设备和传感器中提取敏感数据输入的自动化操作。研究发现,将生成式人工智能技术引入CPS系统会带来特定风险,例如在分布式网络架构中出现的隐私漏洞和安全挑战。GPLF推出了一种创新的基于代理的联邦学习(ProxyFL)框架,专门支持面向生成任务的安全协同学习,以缓解现有问题。该GPLF框架已在集成多种传感器网络技术、物联网设备和实时数据流的CPS测试平台上进行了全面评估。
GPLF 参与者在参与期间运行两个独立的模型。
一个专用的私有模型用于本地数据检查,同时确保数据免受外部访问。
系统的共享代理模型5通过结合加密技术与差分隐私方法,实现参与者之间的安全协作。
该框架利用扩散模型生成复杂的合成数据集,以推动异常检测能力的发展,同时在多种场景模拟中展示预测建模和系统行为追踪功能。通过高效的隐私保护方法,合成数据集能够保持关键特征属性。该框架通过强加密技术实现安全的点对点数据交换,保护通信通道免受恶意攻击。在真实信息物理系统(CPS)平台上进行的GPLF评估表明,该框架能够在可扩展性限制范围内显著提升安全且智能的运行能力。在隐私泄露防护指标方面取得显著改进,同时在数据交换能力和生成任务精度方面也获得互补性提升,验证了其功能价值和实际性能表现。GPLF的核心阶段包括基于代理的联邦学习初始化以及私有数据的本地训练,这构成了GPLF的骨干架构,并集成了采用差分隐私保护的代理模型更新机制。此外,框架还包括扩散模型的合成数据生成方法、安全的点对点数据交换技术,以及用于异常检测和预测建模的模块。图1所示的系统化结构展示了GPLF的关键组成要素,这些要素有望优化信息物理系统的基本运行机制。

图1:面向安全智能信息物理系统操作的GPLF架构框架。旨在实现信息物理系统中的安全与智能化操作。请点击此处查看该图的放大版本。
以下部分详细阐述了CPS平台中异构设备间安全通信框架的六个阶段。
1. 基于代理的联邦学习初始化
第1阶段为基于代理的联邦学习初始化,GPLF在此阶段采用基于代理的联邦学习初始化流程,为每个CPS参与者(N)配置两个模型,以确保隐私性,同时允许参与者通过学习功能安全协作。各个CPS参与者(i)获得一个私有模型
,用于与其本地数据(di)协同工作以保护隐私;同时获得一个共享代理模型
,以实现参与者之间的安全协作行为。这些模型的训练初始权重由高斯分布的随机值生成21,以实现归一化的初始条件,如公式(1)所示:
(1)
各参与者在自主处理本地数据的同时,通过共享模型交换学习成果,从而支持CPS系统中具备隐私保护能力的分布式生成式学习。
2. 在私有数据上的本地训练
第二阶段是在私有数据上进行本地训练;在此阶段,数据训练得以开展,各CPS参与者利用其本地存储的数据构建私有模型,通过将数据完全封闭于本地,避免外部接触,从而实现现场数据的全面保护。参与者接受基于数据的模型优化训练,采用随机梯度下降法(SGD)22,该过程通过局部损失函数(llocal)实现,在保障数据隐私的同时,支持有效信息提取与本地化适应。
(2)
(3)
由(2)和(3)可知,I 和 O 分别表示样本输入及其对应的目标值。L 表示损失,Ɽ 为学习率。该步骤构建了各参与者的独立智能系统,为后续安全的协作式教育过程奠定了基础。
独立循环神经网络(IndRNN)作为第二阶段的机器学习模型,其架构允许每个时间步中神经元保持独立性,从而有效处理特定CPS任务,并缓解传统RNN中的梯度问题。在IndRNN结构中,每个神经元均配备独立的循环权重,有助于更好地捕捉长期依赖关系。这种分离式运算模式增强了梯度传递能力,可高效扩展深层网络结构,同时保持计算过程的高效性。由于IndRNN具备利用强大学习模式处理长序列数据的能力,且网络复杂度较低,因此在CPS平台上的序列数据处理表现最佳。
公式(4)的计算表明,IndRNN通过其独特的循环连接设计,有效解决了梯度消失与梯度爆炸问题。
(4)
由(4)可知,ω 和 Ht 分别表示权重和在时间步 t 的隐藏状态。
表示独立循环重要性(权重)的向量,每个数据点对应一个,从而实现不同时间步之间的独立性。ʘ 表示支持逐元素相乘的设计特性,确保各神经元的循环连接之间完全独立,ä 表示激活函数。该神经网络架构设计避免了在计算序列中出现梯度扩张或收缩,从而支持模型训练的稳定性,并成功学习到长序列模式。
IndRNN因其能有效防止传统RNN中梯度爆炸与梯度消失问题,成为CPS异常检测的首选方法。由于IndRNN架构的复杂性低于Transformer模型,能够实现快速收敛与实时运行,因此长期依赖关系的追踪变得更为简便。IndRNN的高效特性使其特别适用于表征CPS资源受限的运行特征,同时在不过度增加计算负担的前提下,实现精确的异常识别。
3. 用于合成数据生成的扩散模型
第3阶段是用于合成数据生成的扩散模型。该阶段利用先进的扩散模型生成合成数据,以复现所获取的私有数据的主要特征。模型通过向数据中添加受控噪声来学习原始隐私敏感数据的分布特性,从而生成高保真度的合成数据,在保留重要特征的同时实现隐私保护。通过迭代去噪过程生成的合成数据,能够维持真实数据的关键统计属性和结构要素。
初始阶段,生成式扩散模型(ϒ)的训练过程旨在生成高保真度的合成数据,同时保留私有数据(di)中的关键特征,其核心计算包括:
(5)
由(5)式可知,
表示将高斯噪声引入数据样本。新生成的合成数据表达为:
(6)
4. 带有差分隐私的代理模型更新
第4阶段是采用差分隐私的代理模型更新。在此阶段,每个通信参与者利用扩散模型在本阶段生成的合成数据,来训练其代理模型
。
(7)
由于差分隐私机制向代理模型更新的梯度值中添加噪声
,因此这些梯度保持私密性。
(8)
为保护数据隐私,先进的加密方法(同态加密)将经过净化的更新 (U) 变换为安全数据 (ξ),并通过中心服务器或多个对等节点进行分发。
(9)
由(9)式可知,ҟ 表示加密密钥。通过加密更新的协同聚合,系统在执行分布式学习操作时可保障本地敏感信息的安全性。
同态加密23构建了可在加密数据上直接进行计算的安全平台,无需在获得最终结果前对数据进行解密,从而能够从加密输入(如聚合梯度)中获取结果。数据在其整个运行期间始终保持加密状态(端到端加密),从而有效防止计算过程中的外部入侵。该平台允许多个地理位置的网络物理系统(CPS)参与者交换加密的数据更新,以实现协作学习,同时不泄露私有信息。根据研究目标,该技术能够满足所需的完整隐私保护要求,且相较于其他需在计算前解密数据的加密方法表现出更优性能,后者会使数据暴露于潜在威胁之中。同态加密被证明是代理联邦学习(proxyFL)系统中最合适的安全部署方案,因其同时支持对加密数据的安全计算和独立的加密操作。
5. 安全的点对点交互
(10)
(11)
(12)6. 异常检测与预测建模
(13)
(14)
(15)
图 2:GPLF 的操作流程。 GPLF 的顺序操作流程,突出显示每个关键过程步骤。请点击此处查看本图的放大版本。
表2:GPLF的参数规格。 请点击此处下载该表格。
访问受限。请登录或开始试用以查看此内容。
隐私泄露减少指数(PLRI)指标用于衡量相较于标准基线模型在隐私泄露方面的减少程度。该评估重点关注差分隐私和同态加密作为隐私保护方法的表现。
隐私泄露评分通过评估模型中相对于总更新次数的暴露数据点数量,以及合成数据分布活动,来衡量隐私保护策略的有效性。当系统的PLRI值较高时,表明其具有更优的隐私保护能力。
根据表3中的PLRI评估结果,新型GPLF架构在隐私保留能力方面优于现有的联邦学习(FL)技术。所评估的方法,如PMFL、HDSCNN-KF、IP2FL、FL-UPM和GAI-CIDS,显示出35%至40%的隐私泄露水平,表明在适用操作过程中不同程度地暴露了敏感数据。根据基准测试,其他数据保护方法的隐私泄露率为36.4%,而GPLF将泄露值降低至30%,即提升了16%。测得的PLRI值为0.17,验证了GPLF在隐私保护方面取得的显著进步。通过将先进的差分隐私技术与安全的同态加密相结合,该方法在实现代理模型更新有效匿名化的同时,保持了系统的持续性能。结果表明,GPLF系统在维持可扩展操作的...
访问受限。请登录或开始试用以查看此内容。
GPLF 的设计元素不仅支持其隐私保护功能,还提供了增强其部署能力的附加优势。通过采用扩散模型生成高保真合成数据,该框架为医疗保健等关键领域以及重要基础设施监控提供了必要的隐私保护层,同时保持了精确的生成建模能力。GPLF 通过其双模型结构,在异构系统中实现了更强的隐私保护和更高的协同学习效率,同时解决了参与者差异和数据不一致相关的问题。现有系统难以将强大的隐私保护与可扩展功能相结合,而 GPLF 因能够维持这种平衡并展现出对未来网络物理系统(CPS)操作的适应性而脱颖而出。GPLF 展现出变革性能力,有助于构建能够智能适应不同运行环境的安全系统。
GPLF 通过创新功能展现出卓越能力,可在多种信息物理系统(CPS)环境中运行。GPLF 利用扩散模型生成高保真合成数据,从而在异构数据配置下实现安全的协同学习。平台内的双模型结构既支持高效的本地化洞察管理,也支持分布式 CPS 节点之间持续、无缝的通信。GPLF 对加密方法的专注使其能够满足严格的数据隐私要求,因而适用于医疗、国防和智能基础设施等关键领域。GPLF 在保护隐私的同时,实现了可扩展且适应性强的解决方案,能够构建强大架构以...
访问受限。请登录或开始试用以查看此内容。
作者声明,本论文的发表不存在利益冲突。本研究、研究结果或结论未受到任何财务或个人关系的影响。
本工作由沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目(PNURSP2025R432)资助,公主诺拉·宾特·阿卜杜勒拉赫曼大学。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| A100 GPU (CUDA) | NVIDIA | CUDA 版本 11.6 | 用于模型训练和评估的 GPU 加速。 |
| AMD EPYC-7502P CPU | AMD | N/A | 用于高性能计算的处理器。 |
| 千兆以太网 | Intel | N/A | 用于信息物理系统中点对点安全通信的网络连接。 |
| Matplotlib | Python 软件基金会 | 版本 3.5 | 用于结果绘图的可视化库。 |
| Paillier 密码系统 | 开源(通过 TenSEAL 实现) | N/A | 支持对梯度进行加法同态加密。 |
| PySyft | OpenMined | 版本 0.6.0 | 差分隐私与联邦学习库。 |
| Python(Anaconda 发行版) | Anaconda 公司 | 版本 3.9 | 包含预安装包和环境管理工具,用于脚本编写和框架开发。 |
| PyTorch | Meta AI | 版本 1.12 | 用于模型训练的深度学习框架。 |
| 内存 (RAM) | Corsair | 256 千兆字节 (GB) | 为高强度训练提供高内存支持。 |
| Scikit-learn | Python 软件基金会 | 版本 1.1 | 用于性能评估的机器学习工具。 |
| Seaborn | Python 软件基金会 | 版本 0.11 | 统计数据分析可视化库。 |
| 固态硬盘存储 (SSD Storage) | Seagate | 1 太字节 (TB) | 用于快速数据存储与读取。 |
| TenSEAL | OpenMined | 版本 0.3 | 用于安全聚合的同态加密库。 |
| TensorFlow | 版本 2.9 | 用于扩散模型的深度学习框架。 | |
| Ubuntu 操作系统 | Canonical | 版本 20.04 LTS | 所有实验所使用的操作系统。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可