本方案旨在通过整合结构化知识来改进弱监督视频异常检测,目标是实现对特定异常类型的分类,并为检测结果提供清晰、可解释的说明,从而超越简单的二分类决策,提升检测过程的透明度。
研究文章
本方案旨在通过整合结构化知识来改进弱监督视频异常检测,目标是实现对特定异常类型的分类,并为检测结果提供清晰、可解释的说明,从而超越简单的二分类决策,提升检测过程的透明度。
弱监督视频异常检测是一种关键技术,仅依赖视频级标签来识别异常事件。然而,传统的多实例学习(MIL)方法依赖于粗粒度的二分类监督,难以区分细粒度的异常类别。这些方法通常仅关注最异常的片段,导致检测结果缺乏可解释性。为克服这些局限,本研究提出一种融合结构化知识的特征建模方法。通过采用动态语义引导机制,弱监督视频异常检测将外部类别级信息与可学习的提示(prompt)相结合,在特征空间中生成语义信号。这些信号与基础异常检测模块提取的视觉证据对齐,产生两个互补输出:用于量化异常事件严重程度的异常评分,以及与外部概念对齐的语义描述。后者可通过预定义模板生成结构化且可解释的说明文本。实验结果表明,所提出的方法在UCF-Crime数据集上达到88.03%的AUC,在ShanghaiTech数据集上达到98.23%的AUC,并在细粒度异常分类任务中实现87.05%的准确率。此外,生成的语义解释将弱监督检测从二分类任务拓展为语义驱动、可解释的异常分析框架。
视频异常检测(VAD)在公共安全和智能制造等领域发挥着至关重要的作用,为人工监控的局限性提供了可扩展的解决方案1。其中,弱监督视频异常检测(WS-VAD)因其仅依赖视频级标签而受到广泛关注,显著降低了人工标注的负担,同时提升了在多样化场景中的泛化能力。尽管具有实际优势,WS-VAD 方法在精确定位异常事件本质方面仍面临重大挑战2。现有模型通常能够检测到异常的存在,但在确定其具体类别或提供有意义的诊断信息方面表现不佳3,4。例如,在工业环境中,模型可能将过热轴承产生的烟雾误认为无害的蒸汽排放,或将正常的焊接火花误判为火灾初期征兆,这两种误判均可能导致高昂的决策错误和不必要的停机。这些语义混淆源于当前 WS-VAD 方法的固有局限性5。二元视频级标签仅指示是否存在异常,而无法提供关于其成因、位置和严重程度的信息。此外,主流的多实例学习(MIL)框架6采用简单的启发式方法对片段级预测结果进行聚合7,难以捕捉不同类型事件之间的细微语义差异。因此,所学习的视觉特征空间变得模糊,导致在视觉上相似但语义上不同的现象——例如烟雾与蒸汽——在特征空间中距离过近,从而模糊了决策边界。
针对这些局限性,已涌现出两个主要的研究方向。其中一个方向致力于通过改进时间建模4,5,8或基于显著性的特征选择3来增强多实例学习(MIL)框架。尽管这些方法在异常定位方面有所提升,但在语义清晰性和可解释性方面仍显不足。另一个方向则通过整合预训练的多模态模型(如VadCLIP9)来对齐视觉与语言表征。虽然该策略展现出一定潜力,但往往未能充分挖掘语言的语义丰富性,导致跨模态关联较弱且决策过程不透明,从而引发两个核心问题:第一,由于特征语义模糊且缺乏足够的外部知识,现有模型无法持续地区分不同类别的异常;第二,决策过程存在“黑箱”现象,无法清晰解释为何某一特定事件被判定为异常。尽管部分方法引入了文本提示(例如“fighting”、“shooting”),但这些提示通常过于简单且组织松散,缺乏语义深度和上下文理解能力。
为解决这些不足,本文提出了一种新的弱监督视频异常检测(WS-VAD)方法,该方法融合了结构化外部知识与可解释的决策机制,这也是可解释人工智能(Explainable Artificial Intelligence, XAI)领域中的一个核心目标10。该方法并未采用基本类别名称作为提示,而是利用 Wikidata11 构建丰富的语义表征——即语义概念云。与现有依赖静态文本提示或简单类别标签的多模态方法(如 VadCLIP9)不同,这些语义概念云封装了全面的上下文知识,包括从结构化知识图谱中提取的相关实体、属性以及因果关系。这些概念云通过 BLIP 模型12 被编码为语义锚点,从而使系统能够获取细粒度的事件语义信息。语义锚点机制的关键创新在于其能够创建动态的、富含知识的表征,以适应特定的异常上下文;而此前基于提示的方法则使用固定的文本描述,缺乏上下文深度和语义关联。为进一步优化特征空间,本文引入了一种显著性引导的对齐机制,选择性地将这些锚点与最相关的视觉证据进行关联。这种有针对性的对齐方式增强了特征的判别能力,同时提升了检测结果的语义清晰度。更重要的是,所提出的方法支持透明化的解释。当语义锚点与视觉证据对齐后,模型会使用预定义模板生成结构化的自然语言解释,明确说明异常的性质及其判定依据。需要指出的是,该方法的实现依赖于若干特定前提条件,包括使用预先提取的 I3D 视觉特征、访问外部知识库(Wikidata)以及使用预训练的 BLIP 编码器。因此,该框架在那些需要超越简单二分类检测、进而实现具体异常类型分类并提供可解释性结果的应用中最具价值。
主要贡献如下:通过结合外部知识与结构化可解释性,提出了一种新颖的弱监督视频异常检测(WS-VAD)方法,以提升语义理解能力与决策透明度;引入基于语义嵌入的提示方法和上下文感知对齐机制,以克服仅依赖视觉信息的多实例学习(MIL)模型的局限性;集成生成式解释模块,利用语义锚点作为可解释单元,生成连贯的文本推理结果。在 UCF-Crime 和 ShanghaiTech 数据集上进行的大量实验验证了所提方法的有效性,取得了优异的 AUC 分数(88.03% / 98.23%),并在细粒度识别任务中表现出卓越性能,同时输出结果清晰且具备可解释性。
访问受限。请登录或开始试用以查看此内容。
本研究仅使用公开可用的数据集(UCF-Crime13 和 ShanghaiTech14)。所有视频均来自数据集的官方发布版本,其中个人身份信息已由数据集维护者尽可能进行匿名化处理。作者未进行任何额外的数据收集或与人类受试者的互动,因此无需新的机构审查委员会(IRB)批准。数据使用符合相应数据集的许可协议和使用条款。
数据准备与特征提取
数据集准备:采用 UCF-Crime13(1,610 个训练/290 个测试视频)和 ShanghaiTech14(238 个训练/199 个测试视频)数据集,并按照其标准划分方式进行划分。使用 FFmpeg 对视频进行预处理以确保可重复性,重新编码为 H.264 格式,重采样至 25 fps,并通过以下命令调整分辨率为 256 × 256:ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/。
特征提取:RGB 特征通过在 Kinetics 数据集上预训练的 I3D 主干网络1516进行提取。视频被分割为无重叠的 16 帧片段;每个片段经中心裁剪至 224 × 224 像素。倒数第二层的激活值经过平均池化,以获得每个片段的 1024 维特征。在 PyTorch 中,这相当于将形状为 [B, 3, T, H, W] 的张量输入 I3D 主干网络,并应用 adaptive_avg_pool3d 后接展平操作。提取的特征以 .npy 文件格式保存(每个视频一个文件),同时保存片段的时间戳以确保精确可重复性(随机种子 seed = 123)。对于每个视频,features///
模型架构与方法
基础检测:时序上下文融合
给定由特征矩阵 Z
∈ RT×1024 表示的视频片段序列,时序上下文融合(TCF)模块首先通过三个可学习的线性投影计算查询(query)、键(key)和值(value)表示:
Q = ZWQ,K = ZWK,V = ZWV (1)
其中 WQ、WK、WV
RTx1024xd 为可训练参数(PyTorch:三个 nn.Linear (1024,d) 层)。段间亲和性为 S =
,引入了时间关系嵌入(TRE),其中每个元素计算为 Rij = α exp (
) + β。位置感知亲和性为
= S + R。全局上下文图谱 A = softmax(
) 聚合了 V 以获得广域特征 G = AV。局部特征 L 通过对 Z 使用核大小为 3 的逐深度一维卷积(nn.Conv1d)计算得到。动态门控 g = σ(MLP ([G;L])) 对两者进行混合:U = g
G + (1 - g)
L。最后,应用层归一化和残差线性层生成 Y(PyTorch:LayerNorm + Linear + 残差)。
基础检测:因果时间预测器
输出 Y 经过两个具有 GELU 激活函数和 dropout 的因果一维卷积(Pytorch:padding='causal' 或掩码卷积),得到每个片段的异常 logit 值。通过应用 sigmoid 函数,获得概率值
[0,1]T。
语义增强:结合外部知识的提示学习
构建语义锚点:对于每个异常类别 c,从 Wikidata11 中查询了 Kc 个概念,并使用 BLIP12 的文本编码器将每个概念短语编码为 ei
R768。类别锚点为 l2 归一化后的均值 Dc = norm(
Σiei)。为降低噪声,剔除与类别名称的余弦相似度低于 0.2 的概念,并保留 TF-IDF 分数最高的前 M 个概念。
执行上下文敏感的分离:前景权重 αt = softmax(rst根据基础检测器得分计算得出 st,以及背景权重 bt = softmax(r(1 - st)。加权后的特征是 ffg = Σtαzt 和 f背景 = Σtbzt .
对齐视觉与语义特征
定义对齐目标:在对齐步骤中,目标是最小化前景视觉特征与其在特征空间中对应异常类别语义锚点之间的距离。构建一组语义引导。
,包括 C 异常类别语义引导和一个标准正常语义引导。确定可能性, P(Dk|v),一个视觉特征 v 对应于第 k 个语义引导, Dk使用温度缩放的余弦相似度进行计算,然后进行 Softmax 归一化,如公式 (2) 所示。
(2)
通过最小化交叉熵,使正样本对相互靠近而负样本对相互远离,其中将 τs 设为可学习参数,并初始化为 10。通过优化正样本对之间的相关性似然,同时降低负样本对之间的相关性似然,实现对齐。
基于模板的可解释性模块
基于外部知识增强的提示学习(PLE)特征表示,线性分类器生成每个类别的logit值,随后通过softmax函数将其归一化为类别概率;预测的异常类型被确定为概率最高的类别。同时,从检测器输出中计算得到一个全局异常评分。为了确定严重程度等级,将该评分与通过在验证集上进行网格搜索优化得到的三个预定义阈值进行比较。
默认阈值设置为 θhigh = 0.8,θmedium = 0.5,以及 θlow = 0.2。具体而言,若评分高于 θhigh,则严重程度标记为高;若评分介于 θmedium 与 θhigh 之间,则标记为中等;若介于 θlow 与 θmedium 之间,则标记为低;否则标记为无。
在解释生成阶段,从预定义的模板库补充文件1中选择与预测类型相对应的模板。该模板库包含多个模板变体,已由多名标注人员进行交叉验证17,以增强生成文本的多样性。若预测类型存在于模板库中,则随机选取对应的模板;否则,使用针对“未知”类型的默认模板。最终,通过整合预测类型、全局异常评分、严重程度描述以及所选模板,生成结构化的解释性文本。系统将输出预测的异常类型、全局异常评分以及生成的解释性文本作为最终结果。结果如图2所示。
所有阈值参数均使用验证集上的网格搜索进行优化,并通过人工评估和自动化指标对生成解释的质量进行了全面评估。结果如表1所示。
模型训练与评估
训练:模型采用 Adam 优化器进行端到端训练(学习率 lr 为 1 × 10-4,权重衰减 weight decay 为 5 × 10-4),批量大小(batch size)为 128,训练 50 个轮次(epochs),学习率调度采用余弦退火策略。Python、Numpy 和 PyTorch 的随机种子均设置为 123,并启用 torch.backends.cudnn.deterministic=True 以确保结果可复现。每 5 个轮次保存一次检查点,存储路径为 checkpoints//epoch_XX.pt,最佳模型根据验证集的 AUC 指标选取。所有实验均在配备 NVIDIA GeForce RTX 4060 Ti(16GB)GPU 的系统上完成,操作系统为 Windows 11,运行环境为 Python 3.8.20、PyTorch 1.8.0 和 CUDA 11.1。在上海Tech 数据集上,每个轮次的训练时间约为 30 秒;在 UCF-Crime 数据集上,每个轮次的训练时间约为 3.5 分钟。
损失函数:总体目标为 L = LMIL + λ • Lalign。超参数 λ 在验证集上遍历集合 {0.01, 0.1, 0.5, 1, 5, 10} 进行调优,并将最优值固定用于测试结果的报告。前 K 个 MIL 聚合方法见图3,相关定义见公式(3-4)。
(3)
(4)
评估:按照先前无监督语音活动检测(WS-VAD)研究采用的标准协议2,5,计算了帧级别AUC。在UCF-Crime数据集上进行细粒度类型识别时,报告了IoU为0.1–0.5时的mAP以及平均mAP(AVG mAP),如表2所示;各类别的AUC值展示在图4中,总体结果列于表3和表4;嵌入可分性与异常分数动态变化见图4、图5和图6。
访问受限。请登录或开始试用以查看此内容。
为进一步验证语义锚点的有效性,额外开展了一项实验以比较不同的提示模板(见表1)。使用Wikidata增强的语义原型的变体不仅获得了更高的AUC值,还使生成解释的BLEU-4得分分别提升了16.6和14.8。这些结果表明,提示的语义丰富性与文本解释的质量之间存在显著关联,证实了解释生成过程并非简单的模板填充,而是通过利用增强的语义结构实现的。
更优的异常类型细粒度识别
该方案在 UCF-Crime 数据集上的细粒度异常识别任务中进一步展示了其有效性。如表 2所示,该框架在所有 IoU 阈值下均优于 VADCLIP9等同样面向细粒度识别的方法,平均得分最高,达到 11.88。该结果支持了本研究的核心观点:精确的语义对齐对于提升识别准确率至关重要。在更高的 IoU 阈值下,性能提升更为显著,凸显了所提出的显著性引导选择对齐策略的优势。尽管先前的方法可能在类别标签与候选区域之间建立局部对...
访问受限。请登录或开始试用以查看此内容。
本文介绍的方案通过将范式从简单的二分类转变为基于语义的、可解释的分析,在弱监督视频异常检测领域实现了重要进展。该方法的意义在于,不仅能识别是否发生了异常,还能判断异常的类型以及模型得出该结论的原因,从而解决了现有弱监督视频异常检测系统(WS-VAD)的一个主要局限性9,29。
设计选择与原理
该方法包含三个相互关联的阶段:基础检测模块、语义增强模块和基于模板的可解释性模块。整体架构如图1所示。在基础异常检测阶段,设计了时间上下文融合(TCF)模块,以有效捕捉复杂的时间关联。现有方法要么因强调局部交互而无法充分模拟长距离依赖关系3,要么因依赖全局自注意力机制而对局部相关性表达不足20。TCF模块同时从广泛依赖关系和邻近连接中收...
访问受限。请登录或开始试用以查看此内容。
我们衷心感谢航天宏卡智能科技(北京)有限公司提供的资金支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BLIP 模型 | Salesforce Research | ViT-B/16 | 用作创建语义锚点的文本编码器。 |
| GPU | NVIDIA | RTX 4060Ti | 用于模型训练。 |
| I3D 模型 | Google DeepMind | 在 Kinetics 上预训练 | 用作视频特征提取的主干网络。 |
| Numpy | The NumPy Development Team | 1.21.2 | 用于在将视频特征等数值数据数组输入深度学习模型之前进行处理和操作。 |
| PyTorch | Facebook AI Research | 1.8.0 | 用于定义模型架构、实现自定义损失函数以及执行反向传播优化。 |
| Python | Python Software Foundation | 3.8.20 | 用于编写所有数据处理、模型实现、训练和评估的脚本。 |
| ShanghaiTech 数据集 | 上海科技大学 | 用于在13个不同的校园场景中进行训练和评估。 | |
| UCF-Crime 数据集 | 中佛罗里达大学 | 用于13类异常事件的训练和评估。 | |
| Wikidata | Wikimedia Foundation | 用作提示构建的外部知识图谱。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可