研究文章

面向绿色物联网:利用网络编码与软演员评论家算法实现核心物联网网络的节能

DOI:

10.3791/69634

2026年4月3日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究将网络编码与软演员-评论家强化学习相结合,以实现核心物联网网络中的节能路由,在保持97%数据包投递率的同时,能耗降低了40%。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

物联网(IoT)网络的快速发展加剧了核心物联网网络中的能效挑战,其中数据路由对节点能量提出了较高要求。本文提出了一种混合模型,将网络编码(NC)与软演员-评论家(SAC)强化学习相结合,以应对这些挑战。NC 通过合并数据包来减少冗余传输,而 SAC 智能体则根据节点状态、链路质量和剩余能量动态选择节能的路由路径。

该系统采用NS-3仿真器实现,物联网节点采用5×5网格拓扑结构(512字节数据包,运行时间100秒),并在不同流量条件下进行测试。结果表明,与传统路由和独立方法相比,NC + SAC可降低40%的能耗,实现97%的数据包投递率,吞吐量提升50%,并显著延长网络寿命。

主要贡献包括新型的NC-SAC集成、在多个指标上对NS-3的全面验证,以及面向可持续物联网基础设施的学习驱动型编码通信的实现。该混合方法在可靠性、能耗控制和性能之间实现了平衡,为下一代绿色物联网网络提供了一个可扩展的框架。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

物联网(IoT)已成为21世纪最具变革性的技术之一,通过无缝连接数十亿设备,实现更智能的家居、城市、工业和医疗系统1。然而,随着这一前所未有的发展,一个紧迫的挑战也随之而来:能耗问题。物联网设备,尤其是部署在核心网络中的设备,通常依赖电池供电或资源受限。随着设备密度和数据流量的增加,能效成为确保物联网基础设施长期可持续性的关键因素。在此背景下,设计能够平衡性能与节能的智能通信和路由策略至关重要。

物联网网络中的传统路由方法通常侧重于最短路径或以可靠性为中心的策略。尽管这些方法在基本场景中有效,但在动态或大规模部署中,常常导致冗余传输和能量快速耗尽2,3。为解决这些不足,研究人员探索了网络编码(network coding, NC)等技术,该技术通过将多个数据包合并为一个编码数据包来减少传输次数。实践证明,网络编码能够提高吞吐量、降低延迟并优化带宽使用。然而,尽管网络编码在降低通信开销方面具有优势,但它本身并未考虑节点的能量水平,也无法自适应地响应网络条件的变化4,5

这正是机器学习驱动决策发挥关键作用的领域。强化学习(RL)提供了一个特别强大的框架,使物联网节点能够通过与环境交互并从奖励中学习,从而做出自适应决策。在众多强化学习算法中,软演员-评论家(SAC)算法因其能够通过熵正则化平衡探索与利用而受到广泛关注6。与传统的强化学习模型不同,SAC鼓励多样化的行为选择,防止系统过早收敛到次优策略。对于能量受限的物联网网络而言,这意味着能够实现更智能的路由选择,不仅适应链路质量和传输成功率,还能根据每个节点的剩余能量水平进行动态调整。

近年来,越来越多的研究聚焦于强化学习在优化物联网通信和能源管理中的作用。例如,Dev 等人7采用哈里斯鹰优化算法实现节能型物联网通信,而 Tuong 等人8则探索了深度强化学习在无线物联网系统分层双工中的应用。最近的一些研究8,9进一步表明,诸如近端策略优化和分布式多智能体框架等先进的强化学习方法,能够显著提升大规模物联网环境中的适应能力。

本研究提出了一种新型混合通信模型,该模型将网络编码(NC)与软演员-评论家(SAC)算法相结合,以实现核心物联网网络中基于能耗感知的智能路由。与以往单独使用网络编码或强化学习,或采用离散动作深度强化学习模型的方法不同,本研究利用SAC算法基于熵正则化的连续动作机制,根据网络状态(包括能量水平、链路稳定性及数据包缓冲区状态)动态优化路由决策。通过引入网络编码,可减少重传次数并提升带宽利用率;而SAC算法则确保路径选择具备自适应能力,从而平衡网络负载并节约节点能量。该双重机制开创了一种由学习驱动的编码通信新范式,在能量效率、吞吐量、数据包投递率以及网络寿命等方面均显著优于现有方法。

我们使用NS-3仿真环境实现并测试了所提出的框架,在不同的流量负载下部署了一个5×5的物联网节点网格。我们明确定义了数据包大小、距离和传输能量模型,以反映真实的物联网条件。通过这些仿真,我们评估了关键指标,包括数据包投递率(PDR)、吞吐量、网络寿命和能量效率。结果如下:与传统路由和独立模型相比,NC + SAC混合系统将能耗降低了近40%,吞吐量提高了50%,显著延长了网络寿命,同时保持接近97%的数据包投递率。

除了数值上的提升之外,这项工作的真正优势在于其可扩展性和适应性。随着物联网网络在规模和复杂性上的持续增长,能够动态适应变化条件的解决方案将至关重要。该混合框架不仅解决了节能的即时问题,还为实现自主、自优化的物联网系统奠定了基础,使其能够在实际部署中实现自我维持。表1包含了能耗、分组投递率、网络寿命和吞吐量等参数的性能日志。表2总结了实验得出的结果。此外,将强化学习融入物联网网络,展示了人工智能驱动协议在资源受限环境中重塑设备交互方式的潜力。

智能通信策略的最新进展进一步强化了对自适应且可持续的物联网路由框架的需求10,11,12。传统的基于聚类或静态路由协议通常难以应对动态网络挑战,例如链路质量波动、节点能量水平变化以及干扰,这些问题可能导致性能迅速下降和节点过早失效。基于现代强化学习的方法已展现出解决上述问题的强大潜力,通过使物联网设备与环境持续交互,动态学习最优传输策略10,11,12。与此同时,网络编码(Network Coding)已被证明在减少冗余传输和提升受限网络环境中的频谱效率方面具有显著效用5,13,14。然而,大多数现有研究仅独立评估这些技术,而非将其结合使用。因此,将网络编码与Soft Actor-Critic等连续控制型强化学习方法相融合,有望构建一种更加强健且智能的通信机制,能够在节约能源的同时适应实时变化15,16。这种混合范式不仅增强了物联网网络的鲁棒性与自主性,也契合了绿色通信系统及面向可持续大规模部署的机器学习驱动无线架构等新兴研究方向。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

数据传输与数据包处理工作流程
节点初始化:每个节点启动时均具备完整的网络拓扑信息、最大能量容量,以及一个预训练完成的SAC智能体以支持决策。网络编码模块被激活并准备执行数据包合并操作。

数据包编码过程:当传输开始时,源节点从传感器收集多个数据包。网络编码模块通过高效的数学运算将这些数据包合并为更少的编码数据包,显著减少了所需的总传输次数。

SAC路由决策执行:SAC代理分析当前网络状态,包括邻居节点的能量水平、链路质量、流量状况和到目的地的距离。根据其学习到的策略,选择最优的下一跳邻居,优先考虑能效和可靠性。

多跳分组转发:编码分组沿选定路径传输。中间节点根据其当前缓冲区状态和剩余能量水平,决定是否进一步合并分组或直接转发。

奖励计算与存储:每次传输后,系统根据传输成功率、能耗、传输延迟和丢包情况计算奖励分数。该奖励信息将被存储,供SAC智能体学习使用。

持续学习更新:SAC 智能体定期回顾存储的经验,并更新其决策策略,以更高效地选择节能路径,同时保持高配送性能。

系统架构
典型节点的工作流程如下:节点首先感知并采集数据,然后使用网络编码对数据进行编码,再通过由SAC代理选择的路由路径转发编码后的数据包。SAC代理会评估节点的状态,包括剩余能量、缓冲区状态和链路质量,以决定下一个最优跳转节点。该过程是动态的,并随着网络条件的变化通过经验不断优化。图1将展示此数据流及各组件之间的交互。

网络编码方程
网络编码在中间节点的应用方式如下:

数学求和公式,展示加权和概念,用于教学。

其中,Ci 为编码后的数据包,αij 为编码系数(通过 SAC 学习获得),Pj 为原始数据包。该方法可使网络减少传输次数并提高可靠性。

SAC 目标函数
SAC 智能体使用以下熵正则化目标来优化策略:

策略梯度公式,强化学习中的 Σ[ET],优化符号,用于教学。

其中,r(st, at) 为奖励,α 为探索的权衡参数,H 为熵项。

能耗模型
为模拟真实的能耗情况,采用以下模型:

电子能量转移方程;Eᵗₓ = Eₑₗₑc·k + εₐₘₚ·k·dⁿ;科学公式。

其中:Eelec 是收发器每比特能耗,k 是以比特为单位的数据大小,-静态平衡,ΣFx=0,过程示意图,展示力的平衡,教育概念。 是发射机放大器所需的能量,是节点间的距离,d 是路径损耗指数。

评估指标
本研究的模拟中使用了以下性能指标:

分组投递率(PDR):

分组投递率公式,PDR = 接收到的总分组数 / 发送的总分组数。

通量:

通量计算公式,方程,数据分析,接收的总数据量,仿真时间比

网络寿命:定义为网络中50%的节点耗尽其能量所持续的时间。

能源效率

效率公式:传输数据量/总能耗;用于能量效率分析的数学方程。

伪代码
物联网网络节点的初始化
该函数在系统开始运行前完成网络中所有物联网节点的设置。每个节点被分配最大能量、用于存储数据包的空缓冲区、表示其本地环境的状态、用于学习最优决策的SAC智能体,以及实现智能数据编码的NC模块。

def 初始化节点(网络):
对于 网络 中的每个 节点:
节点.能量 = MAX_ENERGY
节点.缓冲区 = []
节点.状态 = 感知环境(节点)
节点.智能体 = 初始化_sac_智能体()
节点.网络编码模块 = 激活网络编码()

数据包生成与网络编码
该函数负责从源节点收集传感器数据,使用线性或基于异或的网络编码方法对数据进行编码,并准备传输。通过将多个数据包捆绑成一个编码数据包,该函数可减少通信开销,使数据包能够通过网络进行转发。

def generate_and_code_packets(源节点):
数据包 = 收集数据(源节点)
编码包 = 网络编码(数据包)
将传输任务加入队列(源节点, 编码包)

def network_code(packets):
return linear_combination(packets)

基于SAC的路由决策
在此过程中,当前节点利用其SAC智能体分析网络状态,并选择能效最高且最可靠的相邻节点来转发数据包。该决策基于已学习的策略以及当前的环境条件,例如链路质量或剩余能量。

def 选择下一跳节点(当前节点):
当前状态 = 观察网络状态(当前节点)
动作 = sac_agent策略(当前节点.代理, 当前状态)
下一跳节点 = 将动作映射到邻居节点(动作)
返回 下一跳节点

数据包传输与反馈循环
该函数负责管理编码数据包的实际传输。在确定最佳下一跳后,若链路有效,则发送数据包。随后,系统根据传输成功与否及能耗情况计算奖励值,并利用该奖励值更新SAC智能体的学习模型。

def transmit_packet(当前节点, 数据包):
下一跳 = 选择下一跳(当前节点)
如果 链路有效(当前节点, 下一跳):
发送(数据包, 下一跳)
奖励 = 计算奖励(当前节点, 数据包)
更新SAC智能体(当前节点, 奖励)
否则:
重新计算下一跳(当前节点)

SAC 代理更新(学习阶段)
一旦数据包被传输,此函数将更新 SAC 代理。它记录状态的变化,将经验存储到记忆中;当积累足够的经验后,便使用一批样本数据来优化代理的决策策略。这有助于节点随着时间推移适应网络变化。

def update_sac_agent(节点, 奖励):
new_state = observe_network_state(node)
store_transition(节点.智能体.记忆, 节点.状态, 节点.动作, 奖励, 新状态)
如果节点的智能体记忆足够丰富:
batch = sample_batch(node.agent.memory)
node.agent = optimize_sac(node.agent, batch)
node.state = new_state

接收端的解码
在目的地,该函数接收所有收到的编码数据包,并使用高斯消元等方法将其解码还原为原始数据。恢复出的数据随后被传递至相应的应用层或处理进程。

def 解码数据包(目标节点):
接收到的数据包 = 目标节点缓冲区
原始数据 = 解码(接收到的数据包)
递送数据(原始数据)

def decode(packets):
return gaussian_elimination(packets)

能量监测与节点休眠逻辑
该功能用于监测每个节点的能量水平,并判断节点应继续运行还是切换至休眠模式以节省功耗。若能量充足,节点将扣除与传输相关的能耗;若能量不足,则暂时关闭,以延长整个网络的使用寿命。

def monitor_energy(node):
如果 node.energy < 阈值:
put_node_to_sleep(node)
否则:节点能量减去传输成本()

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们进行了仿真,比较了四种不同的方法:(i)无优化的传统模型,(ii)仅采用网络编码(NC)的系统,(iii)仅使用软演员-评论家(SAC)算法进行路由的方案,以及(iv)结合NC与SAC的所提出的混合模型。

能量消耗
在能源效率方面观察到了最显著的改进。传统的物联网网络由于依赖固定路由,且在发生数据包丢失时需要频繁重传,导致能量消耗迅速。引入网络编码(NC)通过减少冗余重传,提高了效率,从而节约了能源。SAC 进一步提升了性能,使系统能够避开高能耗路径,并动态调整路由决策。NC 与 SAC 的结合带来了最显著的增益,因为系统学会了以更高效且更智能的方式进行通信,从而实现了最低的整体能量消耗。图2展示了传统 AODV、仅使用 NC、仅使用 SAC 以及 NC 与 SAC 结合使用时的能量消耗对比。

分组投递率(PDR)
通过分组投递率(PDR)评估数据传输的可靠性。在传统模型中,分组丢...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种新颖的面向核心物联网网络的能量感知通信策略,该策略将网络编码(NC)与软演员-评论家(SAC)强化学习算法相结合。该混合方法的目标是在保持可靠高效数据传输的同时,最大限度降低能耗。网络编码通过对接数据包减少冗余传输,而SAC则根据观测到的网络状态动态学习并选择节能的路由路径。仿真结果表明,相较于传统路由方法及单独使用NC或SAC的方法,NC与SAC结合的混合方法在能量效率、数据包投递率、吞吐量以及网络寿命方面均具有显著优势。

本研究的意义在于通过结合NC13的数据效率和SAC9的自适应学习能力,解决物联网(IoT)领域中一个关键的实际挑战1,17。该框架通过降低能耗并延长节点的运行寿命,直接促进了物联网部署的可持续性,这对于智能家居、工业自动化和环境监测等应用而言是一项关键需求3。这些结果表明,当强化学习与基...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们谨向牛津工程学院和贾因 deemed-to-be 大学表示感谢,感谢他们提供的支持和资源。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
6 GB NVIDIA GeForce RTX 3050(计算机系统)nVIDIAhttps://www.nvidia.com/en-in/geforce/graphics-cards/30-series/rtx-3050/用于仿真与训练:CPU 内存:16 GB,GPU 内存
AMD Ryzen(计算机系统)AMDRyzen 7用于仿真与训练:处理器
硬件测试平台(可选的未来工作)Raspberry Pi https://www.raspberrypi.com/products/raspberry-pi-4-model-b/配备无线模块的 Raspberry Pi 4 节点,用于真实场景下的物联网部署与验证
Intel Core i7(计算机系统)Intel Corei7-7700 处理器用于仿真与训练:处理器
Jupyter NotebookJupyterhttps://jupyter.org/用于迭代开发、调试和可视化的环境
MatplotlibPythonhttps://matplotlib.org/用于绘制性能指标(能量、吞吐量、数据包投递率、网络寿命)的 Python 可视化库
网络编码模块自定义的 Python/NS-3 集成,用于实现线性网络编码和数据包编码
NS-3 仿真器ns-3nsnam.org开源离散事件网络仿真器,用于物联网网络仿真与路由评估
NumPy NumPynumpy.org用于处理仿真日志、统计分析和结构化数据集的 Python 软件包
Pandaspandas.pydata.org用于处理仿真日志、统计分析和结构化数据集的 Python 软件包
Python 3.10Python版本 3.10.0用于 SAC 智能体训练、编码系数优化和数据处理的编程语言
PyTorchPyTorchhttps://pytorch.org/用于实现软演员-评论家算法和强化学习模型的深度学习库
SeabornPythonhttps://seaborn.pydata.org/用于绘制性能指标(能量、吞吐量、数据包投递率、网络寿命)的 Python 可视化库
Ubuntu 20.04(计算机系统)Ubuntu版本 20.04用于仿真与训练:操作系统

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Leong, W. Internet of things for enhancing public safety, disaster response, and emergency management. Eng Proc. 92 (1), 61(2025).
  2. Ghermezcheshmeh, M., Razlighi, M. M., Shah-Mansouri, V., Zlatanov, N. Centralized dynamic-time division duplex utilizing interference alignment. IEEE Transactions on Wireless Communications. 20 (10), 68526866(2021).
  3. Baliga, J., Ayre, R. W. A., Hinton, K., Tucker, R. S. Green cloud computing: balancing energy in processing, storage, and transport. Proceedings of the IEEE. 99 (1), 149-167 (2011).
  4. Byzantine modification detection in multicast networks using randomized network coding. Ho, T., et al. International Symposium onInformation Theory, 2024. ISIT 2004. Proceedings, Chicago, IL, USA, , (2004).
  5. Towards effective intra-flow network coding in software-defined wireless mesh networks. Zhu, D., Yang, X., Zhao, P., Yu, W. 2015 24th International Conference on Computer Communication and Networks (ICCCN), Las Vegas, NV, USA, , (1109).
  6. Zhang, Y., et al. Deep actor-critic learning for wireless network routing optimization. IEEE Trans Mob Comput. 21 (10), 3502-3516 (2022).
  7. Dev, K., et al. Energy optimization for green communication in IoT using Harris hawks optimization. IEEE Trans Green Commun Network. 6 (4), 2135-2147 (2022).
  8. Tuong, V., et al. Deep reinforcement learning-based hierarchical time division duplexing control. IEEE Trans Wirel Commun. 21 (10), 8504-8518 (2022).
  9. Wang, Y., et al. Reinforcement learning for energy-efficient IoT: a survey of recent advances. IEEE Internet Things J. 10 (2), 1679-1693 (2023).
  10. Zhang, H., et al. Intelligent energy-efficient IoT networking using proximal policy optimization. Sensors. 24 (1), 115(2024).
  11. Raza, O. Energy-efficient IoT networks using AI-driven approaches. Smart Internet Things. 1 (3), 203212(2024).
  12. Yuan, J., Peng, J., Yan, Q., He, G., Xiang, H., Liu, Z. Deep reinforcement learning-based energy consumption optimization for peer-to-peer communication in wireless sensor networks. Sensors. 24 (5), 1632(2024).
  13. INCdeep: Intelligent network coding with deep reinforcement learning. Wang, Q., et al. IEEE INFOCOM 2021 - IEEE Conference on Computer Communications, Vancouver, BC, Canada, , (1109).
  14. Al-Dulaimi, A., et al. Network-coding-assisted IoT communication for high-throughput data delivery. Ad Hoc Networks. 137, 102901(2022).
  15. Eriş, Ç, Gül, ÖM., Bölük, P. S. A novel reinforcement learning based routing algorithm for energy management in networks. J Ind Manag Optim. 20 (12), 3678-3696 (2024).
  16. Arslan, S., Darterler, S., Aydemir, F. Reinforcement learning for energy optimization in IoT based landslide early warning systems. J Sci Rep A. 59 (1), 32-57 (2024).
  17. Green IoT: advancements and sustainability with environment by 2050. Sharma, N., Panwar, D. 8th International Conference on Reliability, Infocom Technologies and Optimization (Trends and Future Directions) (ICRITO), Noida, India, , (2020).
  18. Dynamic time division duplexing for green internet of things. Tuong, V., Dao, N., Noh, W., Cho, S. 2022 International Conference on Information Networking (ICOIN), Jeju-si, Republic of Korea, , (2022).
  19. Zhu, X., Wu, Q., Fan, Q., Fan, P., Wang, J., Li, Z. Deep reinforcement learning based power allocation for minimizing age-of-information and energy consumption in MIMO-NOMA IoT systems. arXiv. , (2023).
  20. Han, G., Liu, L., Jiang, J., Shu, L., Hancke, G. Analysis of energy efficient connected target coverage algorithms for industrial wireless sensor networks. IEEE Trans Industr Inform. 13 (2), 135-143 (2017).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

NS 3

相关文章