本文介绍了AQVSO(自适应质量视频流优化)框架,该框架集成了先进的神经网络与优化模型,旨在提升5G及下一代网络中的视频流传输性能。该框架可提高视频质量、减少缓冲并优化资源利用。
方法文章
本文介绍了AQVSO(自适应质量视频流优化)框架,该框架集成了先进的神经网络与优化模型,旨在提升5G及下一代网络中的视频流传输性能。该框架可提高视频质量、减少缓冲并优化资源利用。
AQVSO(自适应质量视频流优化)是一种新型视频流框架,旨在提升5G环境下的视频流质量和资源利用率 & 超越网络。该研究提出了一种端到端的多神经网络架构,包含四个相互关联的模块:结合策略驱动编码器的稀疏卷积网络(SCN-PDE)、稀疏图注意力卷积网络(SGA-ConvNet)、自适应脉冲神经网络(ASNN)以及结合蚁群优化的深度置信网络(DBN-ACO)。这些模块基于一种旨在平衡质量与资源使用的数学模型,能够动态适应网络变化。在UCF-101数据集上的实验表明,AQVSO在显著降低带宽需求(4,936/8,000 kbps)的同时,保持了与当前先进算法BBA和BOLA相当的SSIM评分(0.977)。该框架在维持高感知质量(PSNR = 45.89 dB)的前提下,可节省38%的带宽消耗,并几乎消除了缓冲现象。系统在移动网络、CDN(内容分发网络)及企业网络条件下均实现了99.9%的流媒体传输确定性,为资源受限环境下的视频传输系统带来了实际性能提升。这一成果得益于通过自适应、内容感知的流媒体决策,实现了可管理的用户体验与网络资源的高效利用。
本研究的目的是开发一种集成的多神经自适应流媒体框架,称为AQVSO,旨在动态的5G及更高版本网络条件下,联合优化感知视频质量和带宽利用率。该方法旨在将内容分析、码率控制和资源分配统一到单一决策架构中,以在显著降低比特率需求的同时实现一致的用户体验质量(QoE)。
自适应质量视频流优化(AQVSO)
在5G及更先进技术时代,AQVSO致力于通过采用基于多神经网络的模型来提升视频流媒体的用户体验质量(QoE),该模型能够智能地平衡感知质量与资源利用率1。这种感知网络状况的调度策略能够应对在时变或不稳定网络环境中提供高质量视频流的挑战,同时降低带宽消耗和服务器拥塞2。
截至2023年,视频流量已占全球移动数据总量的80%以上,对高效多媒体传输系统的需求达到了前所未有的高度3。传统网络正在向敏捷、虚拟化、基于软件的网络转型,这一转变得益于第五代(5G)环境下的软件定义网络(Software Defined Networking, SDN)、网络功能虚拟化(Network Function Virtualization, NFV)、多接入边缘计算(Multi-access Edge Computing, MEC)以及云计算/边缘计算技术的支持4,5。这些技术进步推动了新一代应用的发展,实现了更高的数据传输速率、更低的延迟和更高的连接密度6。
随着竞争程度不断加剧,用户体验质量(Quality of Experience, QoE)已成为服务提供商最重要的衡量指标之一7,8。QoE 不仅包含传统的服务质量(Quality of Service, QoS)指标,还引入了用户感知,将客观的 QoS 参数与用户的主观体验因素(如期望、情绪和偏好)相结合9,10,11。对于多媒体服务而言,QoE 直接影响终端用户的满意度,可被视为一种通用的整体质量评估指标,用于连接用户体验与应用及通信系统的性能12。
视频流的体验质量(QoE)依赖于延迟、比特率和视觉质量等参数。由于数据增长和容量限制导致的网络拥塞,会影响流媒体质量的连续性13,14。常见的方法提供可变的视频属性(具有不同的帧率和分辨率),但用户的移动性以及无线信道的变化需要更智能的管理策略15,16,17。
现有的自适应流媒体解决方案在动态条件下受到严重限制。基于HTTP的动态自适应流媒体(DASH)依赖于客户端的启发式算法,在不可预测的无线环境中可能失效。18. 有一些基于强化学习(RL)的方法(例如 Pensieve),能够促进自适应,但计算成本较高,且需要大量的训练数据19基于缓冲区的算法(BBA)主要考虑缓冲区占用情况,而忽略内容复杂度和感知质量20模型预测控制(MPC)高度依赖带宽预测,在移动环境中,这种预测可能失效。21BOLA(基于缓冲区占用率的李雅普诺夫算法)主要关注播放效用,而未充分考虑质量公平性。22.
从 SCA-PVNet 中的跨模态注意力聚合到最新进展23,RES中支持边缘的实时分析24以及高效的边缘云转码25 用于提升输入稳定性的混合去噪框架26 展示智能多媒体处理领域的快速进展。增强的内容理解 通过 2D-CNN时空学习27 基于变换器的视频建模28,以及通过CNN-RNN架构实现的自适应比特率控制29为下一代流媒体智能奠定了坚实基础。
AQVSO 通过将内容分析、感知建模和网络感知决策统一到一个集成架构中,在动态无线条件下持续提供更优的用户体验质量(QoE),超越了这些单独的技术进步。AQVSO 在本质上不同于这些方案,它以协调的方式联合集成了视频编码、网络动态、数据流量、资源分配以及用户感知质量。这一综合控制方案通过协调八个专用机制23,克服了传统自适应码率方法的局限性。
范围与应用
AQVSO 的应用范围包括移动 5G 及更高级别的网络、CDN 辅助的流媒体环境,以及大规模视频传输中用于冗余的 enterprise cloud 场景。该框架基于分布式边缘计算节点并具备轻量级推理能力的假设而开发,正如当前基于 MEC 的 5G 网络中的情况。本文将阐述其上下文限制,例如神经网络组件带来的计算开销,以及对精确网络状态和 QoE 状态预测的依赖性,并明确说明 AQVSO 在何种条件下表现最佳。此外,该系统不适用于没有边缘计算能力的超低资源环境,也不适用于需要低于 10 毫秒延迟的实时交互式应用。
AQVSO 由八种创新技术组成:用于实现内容与网络感知优化的自适应脉冲神经网络(Adaptive Spiking Neural Network, ASNN);用于实时调整比特率的码率控制算法(Rate Control Algorithm);用于流量模式预测的深度置信网络(Deep Belief Network, DBN);用于解决当前网络资源分配问题的蚁群优化算法(Ant Colony Optimization, ACO);稀疏图注意力网络(Sparse Graph Attention Network, SGA),用于大规模建模视频与网络拓扑之间的复杂关系;稀疏卷积网络(Sparse Convolutional Network, SCN),用于处理高维数据;策略驱动编码器(Policy-Driven Encoder, PDE),一种自适应编码策略,可利用随时间学习到的视频趋势知识;以及流式贝叶斯变点识别器(Stream Bayes Change Point Identifier, BCPI),一种可检测与网络和视频相关的多维度变化的滤波器。这些策略共同构成了 AQVSO 的核心,通过同时应对视频编码、流量管理、资源分配和感知质量自适应,在云、边缘和移动网络中实现整体优化。
总之,AQVSO 提供了一个统一的多神经网络框架,能够在 5G 及以上网络中联合优化感知 QoE、内容感知编码和资源分配,实现更优的质量-比特率效率。
访问受限。请登录或开始试用以查看此内容。
所使用的软件列在材料表中。
数据集设置
UCF-1013 数据集已获取并解压至 Videos/UCF-101 目录。通过校验和验证或手动播放评估数据集的完整性,任何损坏的文件均被排除在后续处理之外。
计算环境
所有实验均在 Windows 10/11 或 Ubuntu 20.04+ 系统上使用 Python 3.10 完成。软件环境包括 tensorflow==2.17.0、opencv-python、scikit-image、numpy、pandas 和 tqdm。实验至少使用 8 GB 内存,并在具备条件时采用 GPU 加速。
帧提取
使用 cv2.VideoCapture() 读取视频帧,并使用 cv2.cvtColor 进行灰度转换。转换后的帧按顺序存储在 Frames 目录中,以保持时间一致性。
基础特征网络
采用一个序列化的卷积神经网络来处理224 × 224的灰度帧。网络使用了卷积层、池化层和全连接层,并使用Adam优化器和二元交叉熵损失函数训练五个周期,以建立基线特征表示。
比特率分配与压缩
通过估算像素级帧复杂度,用于确定比例化的比特率分配。采用具有自适应Q值的JPEG压缩方法,并将处理后的帧保存在Processed目录中以供进一步评估。
质量评估
对每个处理后的帧均进行了 SSIM、PSNR 和 MSE 计算。将得到的指标汇总为 CSV 文件,并生成可视化图表,存储于 Output 目录中。
最终执行
使用 framework.run() 执行了完整的流程。该执行过程生成了最终的处理帧集合、指标摘要以及评估图。
1. 自适应质量视频流优化
1.1 系统架构概述
本文提出了一种通过 AQVSO 框架针对 5G 及更先进网络优化视频流传输的方法。该方法结合了多项前沿技术,各组件相互协同,以提升用户体验质量(QoE)并最大化利用网络资源。系统采用复杂的处理流水线对视频流进行处理,每个组件专注于视频优化的特定环节。在整个流媒体传输过程中,系统确保了最优的质量维持与均衡的处理负载。
1.2 视频预处理与初步分析
1.2.1 视频帧提取与质量基线
给定的优化框架建立在视频预处理步骤之上,该步骤采用先进的分析技术来建立质量标准,并为后续处理准备视频内容。当视频流进入系统后,会经历一个彻底的帧提取过程,将视频分解为单个帧,并分析连续帧之间的时间相关性。这一初步处理捕捉了视频的时间动态特性,并为整个视频流设定了合适的处理参数。对于输入视频 V,通过以下数学公式提取并处理帧:
(1)
帧分辨率为 m,总帧数为 n。在提取帧的同时保留了视频的时间连贯性,以支持后续阶段的并行处理。通过采用一种新颖的融合方法建立了质量基线。结合多种质量指标,构建了全面的质量评估体系。根据指定参数确定了整体初始 QoE。
(2)
考虑到这种融合方法的重要性,因为它解决了单个质量度量指标的局限性。结构相似性指数(SSIM)能够捕捉传统指标可能忽略的感知质量特征,而峰值信噪比(PSNR)提供了客观的质量度量,均方误差(MSE)则提供了像素级别的直接比较。权重因子 α1,α2,α3 并非常数,而是根据内容特征动态调整。第 ith 个权重因子通过以下公式计算:
(3)
其中,
Qi 是第 i 个帧,i = 1,2…n
Qj 是第 j 个帧,j = 1,2…n,i 不等于 j
通过广泛的经验分析各种视频内容类型,确定了重要因子 μi,以确保动态权重调整在不同类型的视频内容和观看条件下均能保持相关的质量评估。分析中考虑了运动复杂性、纹理密度以及不同区域的感知重要性等因素。
1.2.2 内容复杂性分析
通过多维度方法对内容复杂性进行了分析,该方法量化了视频内容的多个方面,是框架中一个关键组成部分。此分析对于后续阶段中关于资源分配和压缩参数的决策至关重要。引入了一种综合复杂性度量指标,该指标考虑了视频内容的空间、时间和感知特性,其表达式如下:
(4)
通过梯度分析对每一帧内的细节和纹理分布进行分析,从而计算空间复杂度分量 Cs(f)。该测量用于识别需要更高比特分配以保持质量的区域。
(5)
计算时间复杂度分量 Ct(f) 以量化连续帧之间的运动强度,因为该测量对于预测压缩行为和确定合适的缓冲区大小至关重要。
(6)
感知复杂度分量 Cp(f) 融合了人类视觉模型,以突出对观察者而言感知上重要的区域。
(7)
1.3 使用稀疏图注意力卷积网络进行特征提取
在AQVSO的特征提取阶段,采用了一种新颖的稀疏图注意力卷积网络(Sparse Graph Attention Convolutional Network, SGA-ConvNet)架构,相较于传统的卷积网络,在视频处理方面实现了显著改进。SGA-ConvNet专为在资源受限环境下高效处理高维视频数据而设计,通过将稀疏卷积的有效性与注意力机制的适应性相结合,提升了整体性能。该网络架构旨在解决视频内容中时空依赖关系捕捉的基本问题。在视频帧处理过程中构建了一个动态图,其中每个节点代表一个关键特征点,边则表示这些特征之间的相互关系。与传统卷积网络不同,该方法通过将计算资源集中在相关区域并保持稀疏连接,显著降低了计算开销。每一层的核心操作定义如下:
(8)
H(l) 表示第 l 层的特征表示,其中 Ã 表示归一化的注意力邻接矩阵。W(l) 包含可学习的权重矩阵,σ 表示非线性激活函数。该网络能够在保持计算图稀疏性的同时学习分层特征表示。注意力机制对于自适应特征处理至关重要,其计算方式如下:
(9)
αij 表示节点 i 和 j 之间的注意力系数,[hi ∣∣ hj] 表示它们特征向量的拼接。采用 LeakyReLU 激活函数以防止梯度消失,同时保留网络从负特征中学习的能力。注意力机制根据各特征连接与当前帧内容的相关性,动态调整其重要性。
1.4 通过自适应脉冲神经网络实现动态速率控制
在AQVSO框架中实现了动态速率控制(图1) 通过 ASNN 架构,一种受生物启发的视频流速率管理方法。ASNN 专门设计用于处理视频流的时间动态特性,同时适应快速变化的网络条件。该组件被认为在优化不同网络条件下带宽使用的同时保持流媒体质量方面至关重要。信息通过 ASNN 中的离散脉冲进行处理,模拟生物神经网络,这在功耗效率和时间信息处理方面具有多项优势。脉冲神经元的膜电位按以下方式演化:
(10)
V(t) 表示时刻 t 的膜电位,Vrest 设为静息电位,τm 定义为膜时间常数。I(t) 根据网络状态和内容复杂度计算得出。通过引入 σ(t)N(0,1) 的自适应噪声以提高系统的鲁棒性。该噪声项有助于网络在面对网络条件快速波动时维持稳定性。速率控制机制采用了一种复杂的自适应方案实现:
(11)
R(t) 表示目标比特率,S(t) 表示神经网络的脉冲发放率,B(t) 表示可用带宽,E(t) 表示由质量指标导出的误差项。指数项 expp(-λE(t)) 用于对质量变化实现平滑自适应,同时防止码率控制系统中出现振荡行为。
1.5 以质量为导向的压缩优化
在压缩优化阶段采用了一种新方法,将感知质量度量与内容感知压缩策略相结合。该阶段对于在压缩视频流中实现质量与体积之间的最佳权衡至关重要。所采用的区域自适应压缩方案根据内容的重要性和感知质量要求来分配比特。
(12)
C(r,t)表示区域 r 在时间 t 的压缩比,Cbase(r)表示由内容复杂度确定的基础压缩比。Q(r,t)用于表示质量因子。ϕi(r,t)用于表示多种调整因子,包括运动强度、边缘密度和感知重要性。
1.6 通过结合蚁群优化的深度置信网络进行资源分配
在 AQVSO 中,资源分配机制被配置为采用一种结合深度置信网络(DBN)与蚁群优化算法(ACO)的混合方法,为视频流系统中最优资源分配这一复杂问题提供了新颖的解决方案。深度置信网络的学习能力被用于资源使用模式的识别,而蚁群优化算法的优化优势则被应用于实时资源分配决策。该 DBN-ACO 系统旨在应对在动态网络环境中平衡即时资源需求与长期优化目标这一根本性挑战。DBN 组件采用由多个受限玻尔兹曼机(RBMs)构成的分层学习结构实现,每一层均可捕捉资源利用中日益抽象的模式。隐层单元激活的概率分布通过以下方式建模:
(13)
hi 表示隐藏单元,v 表示可见单元,bi 表示偏置项,Wij 表示连接权重。该概率模型用于捕捉资源使用模式中的复杂依赖关系,同时保持对变化条件的适应性。蚁群优化(ACO)组件采用基于动态信息素的优化策略实现。
(14)
(15)
τij 表示信息素水平,p 为蒸发率 Δτij (t)。被定义为信息素更新量,ηij 表示基于当前网络状态和资源可用性的启发式值。
1.7 自适应缓冲区管理与错误恢复
在AQVSO框架中实现了一种复杂的缓冲区管理系统,该系统能够根据不断变化的网络状况和内容特征进行动态调整。该系统旨在保持流媒体连续性的同时,最大限度地降低延迟,并防止缓冲区欠载或溢出。采用了一种新颖的自适应方法,综合考虑了网络统计信息和内容复杂性。
(16)
B(t) 被维持为目标缓冲区大小,QoE(t) 被测量为当前的体验质量,σ(t) 被追踪作为网络稳定性指标,ϕ(σ(t)) 被实现为一种自适应函数,用于根据网络波动性调节缓冲区大小。错误恢复机制采用多层方法执行,结合了主动错误预防与被动恢复策略。系统内保留了一个帧引用的滑动窗口。
(17)
p 用于表示单次恢复尝试的成功概率,n 表示尝试次数,T(t) 用于表示自错误检测以来的时间。该指数衰减项用于确保根据时间相关性对恢复操作进行合理优先级排序。
1.8 质量评估与反馈整合
该质量评估系统采用了一种综合方法,将多种质量指标与用户体验因素相结合。这种集成为在优化资源利用的同时保持高质量的用户体验(QoE)至关重要。该系统实现了一种新颖的质量指标融合方法:
(18)
NB(t) 被计算为归一化缓冲比,SB(t) 被计算为切换频率,M(t) 被计算为运动质量因子。权重 wi 根据内容类型和观看条件进行动态调整。
(19)
Θi 表示基础权重,f(C(t)) 作为依赖于内容的调整函数被应用。反馈整合系统被实现为一个闭环控制机制。
(20)
e(t) 被设定为表示目标质量指标与实际达到的质量指标之间的误差,K1、K2、K3 被定义为自适应增益参数,其值根据网络状况和内容特征进行调整。
访问受限。请登录或开始试用以查看此内容。
对所提出系统的性能进行详尽分析,并报告实施结果。包含一个比较部分,以确认该系统适用于 Neuro Cloud Stream 这一基于云的机器学习方法。图2 展示了 AQVSO 系统的工作流程。
数据集描述
为评估 AQVSO 框架,应使用时长范围从 10 秒至 2 小时 30 分钟的多样化视频内容。综合测试数据集包含 UCF101 数据,共 13,320 个视频片段。将数据集划分为训练集(75%)、验证集(12.5%)和测试集(12.5%),以确保评估的均衡性。每个子文件夹应根据其视频片段的动作类别进行标注,并附带包含各子集目录中片段名称、路径和标签的 CSV 文件。这种多样化的时间范围和内容类型可全面评估该框架在不同流媒体场景下的适应性和性能。
所提出模型的性能分析
访问受限。请登录或开始试用以查看此内容。
自适应质量视频流优化(AQVSO)框架是一种基于嵌入式多模块编解码器集成架构的多媒体处理引擎,旨在无线网络中动态提升视频的感知质量与码率自适应能力。与单独的预测器或码率控制器不同,AQVSO采用SCN-PDE增强运动感知能力,利用SGA-ConvNet实现时空注意力建模,通过ASNN实现低延迟自适应码率控制,并结合DBN-ACO实现全局优化的比特分配。该集成化方法与大多数早期基于吞吐量或规则的自适应码率(ABR)技术(如Darwich和Bayoumi¹,或Yeo等³)形成对比,后者主要依赖带宽估计,缺乏对感知质量或内容特征的考量。AQVSO不同于基于下一帧预测的方法,它将视觉质量建模与资源控制整合于单一决策循环中,从而在真实流媒体动态条件下维持稳定的性能表现。
影响实验方案成功的关键步骤
多个实验步骤组件会显著影响系统的稳定性、视频质量的一致性以及可重复性。可靠的语义和结构特征提取对于下游建模至关重要。预处理中的不准确操作(例如,不恰当的缩放或归一化)会直接降低 SGA-ConvNet 和 A...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
作者们承认使用了人工智能流程创建工具来生成本文中展示的框架示意图(图1)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 8 GB RAM | Generic | 运行实验所需的最低内存。 | |
| Intel Core i5 处理器 | Intel Corporation | AQVSO 评估流程所用的 CPU。 | |
| NumPy | NumPy 开发者 | 用于数值计算和矩阵运算。 | |
| OpenCV-Python | OpenCV.org | 用于视频加载、帧提取和预处理。 | |
| Pandas | Pandas 开发团队 | 数据处理、CSV 导出和指标表格生成。 | |
| Python 3.10(编程语言) | Python 软件基金会 | 执行 AQVSO 框架脚本及其依赖库所必需的编程语言。 | |
| scikit-image | Scikit-Image 开发者 | 用于 SSIM、PSNR 和 MSE 的计算。 | |
| TensorFlow 2.17.0 | 用于构建神经网络模块(SCN、SGA-ConvNet、ASNN、DBN)的深度学习库。 | ||
| tqdm | TQDM 团队 | 为流程执行提供进度条显示。 | |
| Windows 10(64 位)操作系统 | Microsoft Corporation | 实验所用的操作系统。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可