方法文章

基于局部特征的复杂电梯场景下电动自行车改进型分块图像标注方法

DOI:

10.3791/69226

2026年3月17日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

提出了一种基于局部特征的分块图像标注方法,利用EBike-DET数据集和主流目标检测模型,以提升复杂电梯场景下的电动自行车检测性能。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

电动自行车(EBike)在住宅电梯等封闭环境中的使用日益增多,引发了严重的安全担忧,并为自动化目标检测带来了显著挑战,尤其是在频繁遮挡的情况下。传统的检测方法主要依赖整体标注,通常难以在视觉复杂的场景中准确识别部分被遮挡的电动自行车。为克服这些局限性,本研究提出了一种基于局部特征的新型分块标注方法,提供更具可解释性的标注策略。通过将电动自行车分解为多个关键区域并进行独立标注,该方法使检测模型能够学习到更精细的结构信息,从而在高度遮挡条件下提升鲁棒性。此外,本研究还构建了一个专用数据集 EBike-DET,以支持真实电梯场景下的检测任务。该数据集采用分块标注方法,并结合模拟环境条件进行增强,有效提升了模型性能与适应能力。所提出的方法通过使目标检测过程更加透明且结构上可解释,推动了可解释人工智能(XAI)的发展,这在安全关键型应用中尤为重要。本研究基于三种主流模型(YOLOv5、YOLOv10 和 SSD)开展了大量实验。结果表明,使用分块标注的 EBike-DET 训练 YOLOv5 模型时,精度提升 3.7%,召回率提升 5.3%,F1 分数提升 4.5%,mAP 提升 4.4%。与公开数据集相比,EBike-DET 在遮挡条件下表现出更强的稳定性与鲁棒性。本研究不仅提高了检测精度,也为在现实世界安全监控系统中部署更具可解释性的 AI 解决方案迈出了重要一步。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着电动自行车(EBike)在全球范围内的迅速普及,尤其是在中国,截至2022年总量已超过3.5亿辆,电动自行车已成为短途出行的主要交通工具。然而,电动自行车频繁进入住宅电梯等封闭空间,带来了严重的安全隐患,包括异常振动、设备损坏、异味以及火灾风险。最近一项研究估计,与电动自行车相关的火灾事故发生的概率约为1.44%1。这些风险凸显了在电梯环境中亟需高效且准确的电动自行车检测方法,以提升安全水平。

尽管计算机视觉和深度学习取得了进展,电梯内的电动自行车检测仍然具有挑战性。公开可用的数据集稀少,且通常缺乏电动自行车型号、颜色和遮挡情况的多样性,限制了模型的泛化能力2。此外,电梯场景中经常出现复杂的遮挡情况,电动自行车可能被乘客或结构部件部分遮挡,进一步降低了检测精度3,4,5。现有的整体标注方法将电动自行车视为单个边界框,在此类条件下常常失效,表明需要改进的标注与检测策略。如表1所示,与分块标注相比,整体标注导致性能显著下降,在交并比(IoU)阈值为0.5时平均精度均值(mAP@0.5最多降低21.5%。

基于深度学习的检测技术进展

深度学习方法,尤其是卷积神经网络(CNNs),已广泛应用于目标检测领域。You Only Look Once(YOLO)系列模型展现出强大的实时性能。然而,在检测被遮挡或重叠目标时,YOLO 模型容易产生冗余的边界框。例如,YOLOv5 通过深度卷积和特征金字塔网络增强多尺度特征提取能力6,7,而 YOLOv10 则通过消除非极大值抑制并采用路径聚合网络来提升检测速度和多尺度融合效果8,9。尽管已有这些改进,冗余边界框问题以及在严重遮挡环境下鲁棒性下降的问题仍未得到充分解决。当电动自行车的关键结构部分被遮挡时,上述模型均表现不佳,因为整体标注提供的局部线索有限图1A-C所示,在中度或重度遮挡条件下,这一局限性会导致边界框冗余以及检测置信度不稳定相比之下,分块标注通过使模型能够检测独立区域(如车轮或车尾部分),有效缓解了该问题,从而在遮挡情况下减少冗余边界框图1D-F进一步表明,当仅有部分电动自行车部件可见时,分块标注可改善特征定位能力,并维持检测的稳定性。

类似地,基于 VGG-16 骨干网络的单次多框检测器(Single Shot MultiBox Detector, SSD)模型10,11 能够在不同尺度上实现高效检测,并在小目标检测方面表现良好12。 然而,当严重遮挡导致特征连续性中断时,SSD 同样面临挑战,即使引入了注意力机制,仍可能导致漏检或边界框回归不稳定13。分块标注在此也具有优势:模型仍可依赖剩余可见的局部特征,从而在多尺度和遮挡条件下提升检测的稳定性。

注释策略与局部特征学习

目前大多数检测方法采用整体标注,这种方法简化了标注过程,但主要依赖于全局特征14,15当关键的电动自行车区域(如车轮、前部或后部)部分缺失时,该方法面临困难。最近的一项研究16 已表明,局部特征学习(即将物体分割为多个标注部分)可在具有挑战性的场景中提高鲁棒性和精确度。与此一致的是,结果在 表2 表明当至少40%–60%的关键电动自行车部件仍可见时,分块标注仍保持有效, 尤其是在标注车轮、前部区域和后部区域时。相比之下,在低遮挡场景下(例如, <20% 遮挡)或图像分辨率≥1280 x 720(完整轮廓得以保留)时适用。当遮挡超过≈70%,或特征级区域过小而无法提供具有区分性的空间信息时,分块处理的优势将减弱。

使用 Harris 角点检测的方法学依据

由于Harris角点检测具有确定性行为、计算效率高以及无需训练等特性,非常适合在电梯环境中进行可靠的标注,因此被选用于局部特征提取。与SuperPoint和LoFTR等基于学习的特征点检测器不同,Harris角点检测避免了额外的训练过程,并在标注数据有限且存在严重遮挡的情况下减少了域偏移问题。与Canny和Sobel等基于边缘的算子相比,Harris角点更强调具有几何意义的交点,而非噪声较多的背景边缘,从而能够稳定地定位电动自行车的结构,例如车轮和车架的交点。此外,Harris角点检测提供了可解释的超参数。经验常数 k 用于控制角点的灵敏度与稳定性。如第2.6.2.4节和图2所示,调节 k 可在鲁棒性与过检测之间实现可控的平衡,这与本文提出的基于规则的分块标注策略高度契合。

用于增强鲁棒性的数据扩增

数据增强已被证明在提升检测模型的多样性和适应性方面具有显著效果。常见的技术包括几何变换(例如旋转、缩放、裁剪)和颜色调整(例如灰度化、亮度调节),这些方法能够模拟真实环境中的条件和光照变化17,18,19。通过引入这些策略,检测模型对变异的鲁棒性得以增强,更适用于实际部署。

针对上述局限性,本研究提出了一种基于局部特征的改进型分块标注方法。该方法通过将电动自行车划分为多个独立标注的部分,增强了特征学习能力与模型鲁棒性,从而在复杂遮挡条件下实现更有效的检测。此外,构建了一个专门针对电梯环境的电动自行车检测数据集(EBike-DET),并通过多种数据增强手段对数据集进行扩充,以提升模型的适应性。最后,该方法在 YOLOv5、YOLOv10 和 SSD 模型上进行了验证,结果显示平均精度(mAP)一致提升了 +5.69% 至 +39.81%,如表3所示。本研究的主要贡献可总结如下:提出一种改进的分块标注方法,增强了遮挡条件下的特征学习能力;构建了面向电梯场景的专用 EBike-DET 数据集,并融合了多种数据增强技术;在主流检测模型上开展实验验证,结果表明相较于整体标注方法,该方法具有更高的检测精度与鲁棒性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用的EBike-DET数据集由作者通过在电梯、停车场和街道环境中进行实地拍摄所收集的图像,以及从网络平台获取的公开电动自行车图像组成。所有实地图像采集均在非私人环境中进行,仅用于电动自行车检测相关的安全技术研究。图像并非有意针对个人,任何偶然捕捉到的人员均因距离、遮挡、背对镜头或经过适当处理(去除了面部特征及其他个人身份信息)而无法识别。网络来源的图像仅从允许学术研究再使用的平台或根据开放许可发布的资源中获取。所有图像 strictly 用于非商业性研究和教育目的。由于未收集可识别的个人数据,且未与人类受试者发生直接互动,根据作者所在机构的指导原则,本研究无需获得机构伦理委员会的批准。

1. 数据集构建

  1. 图像分辨率、色彩空间和文件格式
    1. 将图像的原生分辨率设置为 1280 x 720 像素,以在不同场景中捕捉电动自行车(EBike)的高质量细节。
    2. 标准化后,将图像调整为 640 x 480 像素,以在计算效率与特征保留之间取得平衡。
    3. 将色彩空间设置为 RGB,以保留完整的颜色信息,确保在不同光照条件下实现准确的特征识别。
    4. 将图像保存为 JPEG 格式,以优化存储空间,同时不显著降低图像质量。
  2. 训练集、验证集和测试集的定义与划分
    1. 按照 7:2:1 的比例将数据集划分为训练集、验证集和测试集,确保数据集被合理分配,用于模型训练、超参数调优和性能评估。
    2. 将随机种子设为 42,以确保在不同实验中数据划分的可重复性。
    3. 采用分层抽样方法,保持各数据子集中电动自行车型号和遮挡程度的分布一致,避免各集合之间的类别不平衡。
    4. 确保训练集、验证集和测试集之间无数据泄露,即同一张电动自行车图像不得出现在多个集合中。
  3. 公开数据集构建
    1. 从开源平台选择公开可用的电动自行车检测数据集20,21,22,23,该数据集包含 210 张电动自行车图像,涵盖全景和部分遮挡场景。
    2. 认识到该公开数据集的局限性,包括单一摄像角度、低分辨率和简单背景场景,这些因素可能限制模型的泛化能力,尤其是在复杂遮挡情境下。
  4. EBike-DET 数据集构建
    1. 构建 EBike-DET 数据集以增强场景覆盖范围和样本多样性,该数据集包含来自网络平台和现场拍摄的 1,680 张高质量图像。
    2. 确保涵盖多样化环境,如电梯、停车场和街道,以捕捉电动自行车可能出现的各种实际条件。
    3. 纳入多种摄像角度(正面、侧面和俯视),以全面呈现电动自行车的外观,确保检测模型训练的鲁棒性。
    4. 通过包含多个电动自行车品牌和型号,并涵盖颜色、尺寸和配件的差异,进一步丰富数据集,提升样本多样性。
    5. 确保数据集中包含遮挡场景,即电动自行车被行人或车辆部分遮挡的情况,以模拟电梯等狭小空间中的真实世界条件。
    6. 确认 EBike-DET 数据集包含多样且复杂的样本,使其成为在复杂遮挡条件下进行目标检测的可靠数据集。
  5. 网络与现场图像的纳入与排除规则
    1. 网络图像:仅纳入公开可获取、在多样化环境中拍摄、具有高分辨率和不同光照条件的图像;排除分辨率低或背景简单的图像。
    2. 现场图像:纳入在真实环境中拍摄的图像,特别是电梯、停车场或街道等地点的图像;确保图像反映真实的电动自行车场景,涵盖遮挡程度、背景复杂性和天气条件的变化;排除噪声过大、失真或设置不真实的图像。
    3. 确保网络图像和现场图像均遵循相同的分辨率和色彩空间标准,以保持数据集的一致性。
  6. 数据增强构建
    1. 应用基本增强操作,如灰度化和旋转,以增加样本多样性,并模拟不同的光照条件和摄像机方向。
    2. 将电动自行车目标划分为若干独立的局部区域,包括车轮区域、前部区域和后部区域,以增强局部特征学习。
    3. 对每个区域进行独立标注,以提高遮挡情况下的检测精度,并确保模型在不同电动自行车部件上的鲁棒性能。
    4. 验证所有增强图像和分块标注均保持与电动自行车特征的结构一致性,避免出现不匹配或无效的训练数据。

2. 局部特征分块注释

注意:为了提高在复杂遮挡场景下对电动自行车的检测精度,提出了一种基于改进局部特征的分块标注方法。该方法通过提取电动自行车的局部特征点来分割其区域,并根据相应特征区域的遮挡程度判断该区域是否需要进行标注。详细的实验过程如图3所示。

  1. 使用先前构建的训练、验证和测试数据集。
  2. 人工标注:在 Python 环境中使用 LabelImg 工具进行人工标注。将所有图像仅标注为电动自行车(EBikes),并确保负样本的干扰最小化2425
  3. 数据处理与增强
    1. 采用 Yongjiang 等人22提出的方法对图像进行去噪和标准化处理,以确保数据集中图像尺寸的一致性。
    2. 执行数据增强操作(如旋转、亮度调整、灰度化),以增加样本多样性。确保所有增强后的图像保持图像质量,并提升模型对不同背景的鲁棒性。
  4. 电动自行车区域裁剪
    1. 为确保感兴趣区域(ROI)定位的可重复性,应用表4中的推理参数用于 YOLOv10(使用预训练权重文件 yolov10x.pt)。输出的边界框坐标如下:
      ROI = [x1, y1, x2, y2]  (1)
      公式 (1) 定义了 ROI26 的边界框坐标 [x1, y1, x2, y2],其中:x1, y1 为电动自行车 ROI 的左上角坐标;x2, y2 为电动自行车 ROI 的右下角坐标。这些坐标来源于 YOLOv10 的原始输出,该模型预测每个检测对象的边界框格式为 [cx, cy, w, h]。转换公式如下:
      静力平衡方程 K1=Cx-(W/2),力平衡分析公式。    (2)
      静力平衡方程,y1=cy-h/2,对称平衡概念的公式说明。    (3)
      科学公式显示静力平衡:\( K_2 = C_x - \frac{F}{2} \)。    (4)
      y<sub>2</sub> = c<sub>y</sub> - h/2 方程;数学表达式;静力平衡分析。    (5)
      其中 cx, cy 为预测边界框的归一化水平/垂直中心坐标(按输入图像大小 640 × 480 缩放);w, h 为预测边界框的归一化宽度/高度(按输入图像大小缩放)。
    2. 通过置信度阈值(0.5)过滤 YOLOv10 的输出,仅保留与电动自行车相关的检测结果(类别 ID 对应电动自行车),然后使用非极大值抑制(NMS,IoU=0.45)去除冗余框。将剩余的边界框转换为 [x1, y1, x2, y2] 格式,用于 ROI 裁剪。
    3. 多检测处理
      ​注意:在电梯场景中(EBike-DET 数据集的核心目标),电动自行车通常为单实例(由于空间限制)。对于存在多个电动自行车检测的情况(如拥挤电梯中出现两辆电动自行车),适用以下规则。
      1. 最高置信度优先:选择置信度得分最高的边界框(YOLOv10 输出的置信度反映模型对对象为电动自行车的确信程度)。
      2. 空间有效性检查:若多个检测的置信度得分>0.7,则验证其与电梯结构边界的重叠情况(例如避免边界框超出电梯墙体)。保留中心点 cx, cy 最接近图像中心的检测结果(电梯通常由正前方摄像头监控,目标位于中心)。
      3. 边缘情况处理:若无有效检测满足置信度阈值(如严重遮挡),将图像标记为需人工修正 ROI(占 EBike-DET 数据集的<3%)。
  5. 灰度转换与归一化
    1. 对从 ROI 裁剪出的 RGB 图像进行灰度转换。采用加权平均法进行转换,公式如下:
      Igra = 0.299 × R + 0.587 × G + 0.114 × B  (6)
      其中 R、G 和 B 分别表示红色、绿色和蓝色通道的像素值。该方法符合人类对不同颜色亮度的感知特性。
    2. 通过线性缩放将灰度图像的像素值归一化至 [0, 1] 范围(从 [0, 255] 缩放)。该归一化可提高数值计算的稳定性,并确保后续梯度计算和阈值处理在不同光照条件下具有一致性。
  6. Harris 角点检测
    1. 对裁剪后的电动自行车区域进行灰度化和归一化处理,并应用 Harris 角点检测以提取局部特征点。
      ​注意:Harris 角点检测的核心原理是通过计算自相关矩阵,准确识别图像中的角点,如图4B所示。这些检测到的角点通常与电动自行车的关键部件相关,如车轮、前部和后部,这些区域常表现出明显的角点特征。
    2. 计算图像梯度,以识别强度变化显著的区域,具体如下。
      1. 图像平滑:对灰度图像应用高斯滤波以抑制噪声,获得平滑图像:
        I= Gσ*I  (7)
        其中 * 表示卷积操作,Gσ 为标准差为 σ 的二维高斯核,用于控制平滑程度。σ 的典型值为 1.0。
      2. 计算图像梯度:使用梯度算子(如 Sobel 算子)计算平滑图像的水平(x)和垂直(y)梯度:
        I= Kx * Is ,Iy=Ky * Iy  (8)
        其中 Ix 和 Iy 分别为 x 和 y 方向的梯度图,Gx 和 Gy 为 Sobel 算子的卷积核:
        边缘检测核 Kx,矩阵公式,图像处理概念,卷积方法。  , Sobel 滤波器矩阵 Ky,用于图像处理中的边缘检测;矩阵方程示意图。  (9)
      3. 基于先前计算的梯度,使用以每个像素 (x,y) 为中心的 3×3 局部窗口 W 构建自相关矩阵 M:
        静力平衡方程 Σ(WI²x) Σ(WIxIy);用于教学的矩阵图。   (10)
        公式中,W 表示位置 (x,y) 处的局部窗口,操作 ∑W 表示对该窗口内所有图像元素求和;A = ∑W Ix2 表示 W 窗口内 x 方向梯度平方的总和,反映 x 方向变化的强度;B=∑W Iy2 表示 W 窗口内 y 方向梯度平方的总和,反映 y 方向变化的强度;C = ∑W IxIy 表示 W 窗口内 x 和 y 方向梯度乘积的总和,描述两个方向变化之间的相关性。
      4. 计算 x 和 y 方向梯度平方的总和,以反映各方向变化的强度。梯度 Ix Iy 的交叉项捕捉 x 和 y 方向之间的相关性。
      5. 角点响应函数:基于自相关矩阵的行列式和迹计算角点响应函数 R,以检测图像中的角点。计算每个像素的响应值,并选择响应值较高的点作为最终角点,如图2所示。角点响应函数如下:
        det(M) = A ⋅ B - C2  (11)
        trace(M) = A + B  (12)
        R = det(M) - k ⋅ (trace(M))2  (13)
        其中 det(M) 为矩阵 M 的行列式,反映局部特征区域的整体变化;trace(M) 为矩阵的迹,反映该区域的总梯度强度。经验常数 k 通常设为 0.04 至 0.06 之间。
        注意:实验发现,k 的选择显著影响结果:
        当 k=0.04 时,响应值过高,导致误检角点过多。
        当 k=0.05 时,响应值较为平衡,能准确检测真实角点。
        当 k=0.06 时,响应值过低,难以可靠检测角点。
    3. 利用 Harris 角点检测结果对电动自行车的局部区域进行粗粒度划分。根据几何结构和角点分布将电动自行车划分为不同区域,如图4C所示,以提高模型在复杂遮挡场景下的鲁棒性和检测性能。
    4. 车轮区域:若该区域包含至少 15 个沿圆形对称分布的角点,且对称性评分不低于 0.85,则视为有效区域。对称性评分见公式 11。车轮区域的宽高比应约为 1:1,以准确反映车轮的几何特征。
    5. 前部区域:若该区域包含至少 10 个角点,对称性评分不低于 0.80,且宽高比在 1.2:1 至 1.5:1 之间,则包含该区域,以确保前部区域符合预期的结构特征。
    6. 后部区域:若该区域包含至少 12 个角点,对称性评分不低于 0.75,且宽高比在 1.5:1 至 2:1 之间,则包含该区域,以确保后部区域符合预期的几何特性。
  7. 用边界框表示关键电动自行车区域
    1. 为将角点转换为矩形边界框,使用 DBSCAN 聚类算法。该方法将邻近角点分组为簇,确保构成同一区域的角点被聚在一起。设置簇内点之间的最大距离为 30 像素。
    2. 对每个角点簇,确定其最小和最大的 x 与 y 坐标。这些坐标代表边界框的边缘。
    3. 在边界框周围添加 10 像素的边距,以确保包含所有相关特征。该边距可补偿角点检测中可能存在的错位或像素误差。
    4. 将边界框坐标四舍五入至最接近的整数,以确保图像处理中的像素对齐。
    5. 表示第 i 个组件(如车轮、前部、后部)的最终边界框坐标,如下所述。
      1. 合并定义的区域(车轮区域、前部区域、后部区域),并使用矩形边界框表示电动自行车的所有关键区域。
      2. 定义第 i 个组件(如车轮、前部、后部)的边界框坐标为:
        边界框坐标方程,\( B_i = [x_1^i, y_1^i, x_2^i, y_2^i] \),数学符号表示。  (14)     
        其中 Bi 表示第 i 个组件的边界框,静力平衡符号 (x₂ᵢ, y₂ᵢ),物理/数学图中的坐标。静力平衡符号 (x₂ᵢ, y₂ᵢ),物理/数学图中的坐标。 分别为左上角和右下角的坐标。
  8. 处理部分遮挡
    1. 评估每个区域的角点对称性评分。若对称性评分 ≥ 0.7,则接受该区域。
    2. 对于遮挡处理,测量角点的可见性。若至少 50% 的角点可见,则接受该区域;若 30%-50% 的角点可见,则标记该区域以供进一步审查;若可见角点少于 30%,则因可见性不足而拒绝该区域。
  9. 局部特征区域的准确性判断
    1. 使用三个定量操作指标评估每个局部特征区域的准确性:对称性指标 S、轮廓连续性指标 C 和连接结构指标 L。将这些指标统一应用于车轮区域、前部区域和后部区域。
    2. 仅当所有指标均满足预设阈值时才接受该区域。若某一指标在可容忍范围内未达标,则扩大 ROI 并重新评估。若两个或以上指标未达标,则将该区域标记为不可靠。
  10. 车轮区域特征准确性分析
    1. 前视图操作检查点
      1. 计算对称性指标:
        静力平衡;公式:S = 1 - (nL - nR) / (nL + nR);数学方程图。   (15)
        其中 nL 和 nR 分别表示左侧和右侧的角点数量。
      2. 若 S ≥ 0.85,则接受该区域。如图5A所示,车轮呈圆形且对称,沿圆周分布的 Harris 角点形成对称模式,因此标注整个车轮区域。
      3. 若 0.70 ≤ S<0.85,则将 ROI 扩大 10-20 像素并重复评估,以允许更多真实特征重新进入计算区域,然后重新评估。如图5D所示,车轮发生部分遮挡,因此应扩大裁剪范围以捕获更多电动自行车特征进行评估。
      4. 若 S<0.70,则将该区域标记为不可靠。如图5G所示,圆形结构被破坏,排除该区域的标注。
    2. 侧视图操作检查点
      1. 使用以下公式测量轮廓连续性:
        连续弧长公式 C,曲线分析方程。 (16)
      2. 若 C ≥ 0.75,则接受该区域。如图5B所示,实际连续弧长与预期弧长的比率符合要求,轮廓完全贴合边缘,无明显断裂。
      3. 若 0.55 ≤ C < 0.75,则优化轮廓提取并重新检查。如图5E所示,当前连续弧长与预期弧长的比率处于临界范围,需调整提取算法的阈值以使轮廓更完整。
      4. 若 C < 0.55,则因几何连续性不足而拒绝该区域。如图5H所示,无法满足分析要求。
    3. 顶视图操作检查点
      1. 使用以下公式评估结构连接性:
        静力平衡公式 \(L=\frac{d_{expected}-|d_{observed}-d_{expected}|}{d_{expected}}\) 示意图。 (17)    
      2. 若 L ≥ 0.70,则接受该区域。如图5C所示,观测距离与预期距离的偏差被有效抵消,结构连接性满足要求,车辆与电梯环境之间的相对位置连接完整。
      3. 若 L < 0.70,则扩大 ROI 并重新评估。如图5F所示,当前观测距离与预期距离的偏差较大,需扩大分析范围并包含更多周围结构,以提高连接性评估的准确性。
      4. 若连接性仍不一致,则将该区域分类为不可靠。如图5I所示,不能作为有效分析区域。
  11. 前部区域特征准确性分析
    1. 对电动自行车前部区域的特征准确性评估,遵循第 2.10 节定义的统一基于规则的框架,包括使用公式 (15) 定义的指标 S 在前视图下进行对称性评估,使用公式 (16) 定义的指标 C 在侧视图下进行轮廓连续性评估,以及使用公式 (17) 定义的指标 L 在顶视图下进行结构连接性验证。
    2. 由于前部区域的几何可变性及频繁的部分遮挡,采用比车轮区域适度宽松的阈值。当前部区域满足 S ≥ 0.80、C ≥ 0.70 且 L ≥ 0.65 时,接受该区域。如 图6A-C所示,满足这些标准的区域表现出平衡的左右特征分布、连贯的轮廓和稳定的结构连接性。
    3. 若任一指标落在第 2.10 节规定的中间范围内,则扩大感兴趣区域并重新评估,以纳入更多上下文特征,如图6D-F所示。经重新评估后仍不满足最低标准的区域,归类为不可靠,如图6G-I所示。
  12. 后部区域特征准确性分析
    1. 对后部区域的特征准确性分析,遵循第 2.10 节定义的评估协议,分别在前视图、侧视图和顶视图下使用公式 (15) 定义的指标 S、公式 (16) 定义的指标 C 和公式 (17) 定义的指标 L。
    2. 后部区域更易受骑行者、携带物品或电梯结构的遮挡。因此,采用更严格的拒绝条件以避免不可靠的标注。当后部区域满足 S ≥ 0.75、C ≥ 0.70 且 L ≥ 0.65 时,接受该区域。具有足够对称性、轮廓连续性和连接性的代表性接受案例如图7A-C所示。
    3. 对于指标值处于临界范围的区域,执行 ROI 扩大并重新评估,如 图7D-F所示。若几何关系仍不明确或指标未满足接受标准,则将该区域标记为不可靠,如图7G-I所示。
  13. 后部区域特征准确性分析
    1. 对后部区域的特征准确性分析,遵循第 2.10 节定义的评估协议,使用相应视角下的相同指标 S(公式 15)、C(公式 16)和 L(公式 17)。
    2. 与前部区域相比,后部区域更易受骑行者、携带物品和电梯内部结构的遮挡。因此,采用略为严格的拒绝标准以防止不可靠的标注。当后部区域满足 S ≥ 0.75、C ≥ 0.70 且 L ≥ 0.65 时,接受该区域。如图7A-C所示,接受的区域保持足够的对称性、轮廓连贯性和结构连接性。
    3. 对于指标值处于临界范围的区域,按照第 2.10 节扩大并重新评估 ROI,如 图7D-F所示。若重新评估后几何一致性仍不足,则将该区域标记为不可靠,如 图7G-I所示。
  14. 流程实现
    1. 文件与文件夹结构:实现采用模块化目录结构,分离检测、局部特征提取和标注判断。参见下方代表性文件夹组织:
      project_root/

      ├── data/
      │ ├── images/
      │ │ ├── train/
      │ │ ├── val/
      │ │ └── test/
      │ └── annotations/

      ├── detection/
      │ ├── detect_ebike.py
      │ └── yolov10_config.yaml

      ├── roi/
      │ ├── crop_roi.py
      │ └── cropped_images/

      ├── harris/
      │ ├── harris_corner.py
      │ └── corner_visualization/

      ├── chunk_annotation/
      │ ├── region_partition.py
      │ ├── validity_judgment.py
      │ └── final_annotations/

      └── configs/
      ​└── thresholds.yaml
    2. 执行流程与示例命令行
      1. 电动自行车检测与 ROI 定位:使用预训练目标检测模型定位电动自行车区域。将检测结果存储为边界框坐标。
        python detection/detect_ebike.py \
        --input data/images/test/ \
        --output roi/detections.json
      2. ROI 裁剪:使用检测到的边界框从原始图像中裁剪电动自行车区域。
        python roi/crop_roi.py \
        --detections roi/detections.json \
        --images data/images/test/ \
        --output roi/cropped_images/
        ​每个裁剪图像的命名格式为:imageID_roi_xmin_ymin_xmax_ymax.jpg
      3. Harris 角点提取:对每个裁剪后的 ROI 在灰度转换后应用 Harris 角点检测。保存角点响应图和可视化叠加图以供检查。
        python harris/harris_corner.py \
        --input roi/cropped_images/ \
        --output harris/corner_visualization/ \
        --config configs/thresholds.yaml
      4. 粗粒度划分与分块标注:根据角点的空间分布将局部特征区域划分为车轮、前部和后部区域。使用几何和基于特征的标准进行有效性判断。
        python chunk_annotation/region_partition.py \
        --corners harris/corner_visualization/ \
        --output chunk_annotation/final_annotations/
    3. 预期中间输出与可视化检查点:保存每个处理阶段产生的中间输出,作为可视化检查点。这些中间输出可实现对 ROI 定位、角点提取质量、区域划分和最终标注决策的逐步验证。
      1. ROI 裁剪输出:将裁剪后的电动自行车图像保存至 roi/cropped_images/。每张图像包含从原始帧中提取的单个电动自行车区域。
      2. Harris 角点可视化:将角点叠加图保存至 harris/corner_visualization/。对于有效的车轮区域,可在圆形轮缘结构上观察到密集的角点集。角点响应不足的区域在此阶段可被识别。
      3. 区域划分结果:独立可视化划分的区域(车轮、前部、后部)。仅保留满足预定义有效性标准(如足够的角点密度和几何一致性)的区域。
      4. 最终标注输出:将接受的区域以结构化标注文件形式存储至 chunk_annotation/final_annotations/。排除未通过有效性判断的区域,不将其传播至后续阶段。
        ​注意:角点检测和区域有效性判断所使用的所有阈值均集中于配置文件中。该流程对单帧输入运行,无时间依赖性,允许对每张图像独立重复生成结果。在输入图像、配置文件和执行顺序相同的情况下,生成的中间输出和最终标注具有确定性。
  15. 最终化步骤与数据集发布
    注意:为确保协议以明确且可重复的终点结束,定义一个最终化阶段,用于整合标注保存、质量验证、数据集打包和版本记录。
    1. 保存最终标注:在区域有效性判断后,将所有接受的标注以 YOLO 文本格式保存至 chunk_annotation/final_annotations/,每个图像对应一个标注文件。最终标注集中仅保留满足预定义几何和基于特征标准的区域,排除被拒绝或不可靠的区域。
    2. 标注质量验证:通过重新应用区域评估期间使用的相同有效性标准(包括对称性、轮廓连续性和结构连接性指标)验证最终标注质量。在验证阶段移除未满足这些标准的标注,确保标注生成与质量控制之间的一致性。
    3. 数据集打包:验证后,根据定义的数据集划分将图像和标注组织为固定的训练、验证和测试集。此阶段冻结目录结构和文件列表,准备用于训练和评估的打包数据集,不再进行修改。
    4. 版本与种子记录:将配置文件(包括角点检测参数和区域有效性阈值)与打包数据集一同保存。使用随机种子进行数据划分,固定算法执行并记录。此外,记录模型权重、配置文件和标注工具的版本。在输入数据、配置文件和记录的种子相同的情况下,最终标注和数据集划分具有确定性。

3. 数据增强

注意:先前的研究表明,缺乏充分预处理和数据增强的训练数据集通常会导致模型性能下降22。为解决这些挑战,遵循了以下步骤。

  1. 照明
    1. 通过调整亮度因子(范围为0.6–1.4,概率为0.8),模拟电梯内部的光照变化,以应对频繁的照明条件改变。
    2. 应用光照强度调整,实现从明亮到昏暗环境的过渡,模拟电动自行车移动引起的模糊效应。该操作的执行概率为0.7。
    3. 通过调节光照条件生成增强样本,确保在不同照度水平下仍具有稳定的可见性。
    4. 离线执行上述照明操作,并保存结果以供后续处理。将随机种子设为42,以确保增强过程的可重复性。
  2. 遮挡
    1. 构建合成遮挡场景,以反映电梯内拥挤的情况。以0.6的概率应用遮挡掩模(例如人体轮廓、物体块)。
    2. 应用马赛克式遮挡,模拟电动自行车进出电梯时的部分遮挡情况。采用30%、50%或70%的遮挡比例,并确保遮挡随机出现在图像的任意象限(上、下、左、右)。
    3. 引入遮挡样本,以提升在部分可见条件下的检测鲁棒性和稳定性,同时确保至少一个关键部件(如车轮、前部区域、后部区域)保持可见。
    4. 离线执行遮挡增强,并对样本进行验证,确保保留了电动自行车的关键特征。设置随机种子为42,以保证可重复性。
  3. 视角
    1. 在±15°的预定义范围内调整观察角度,以模拟不同电梯环境中的多种摄像机角度。该操作的执行概率为0.7。
    2. 应用透视变换,畸变系数设定在0.0至0.2之间,以复现不同摄像机安装位置(如高位、侧位和斜向视角)的影响。
    3. 将电动自行车区域按0.8–1.2倍进行缩放和平移,以模拟摄像机与目标距离的变化。该变换的执行概率为0.8。
    4. 确认所有视角变换均保持电动自行车的几何完整性,且无关键特征发生畸变。
    5. 离线执行视角变换,并保存增强后的图像。设置随机种子为42,以确保可重复性。
  4. 增强
    1. 对30%的图像以0.3的概率应用灰度化处理,引入由亮度驱动的变化,增强模型在低光照条件下的鲁棒性。
    2. 对20%的样本使用直方图均衡化,以在复杂光照条件下增强电动自行车关键特征的对比度和可见性。
    3. 依次结合照明、遮挡和视角增强策略,生成高多样性的样本。该多步骤流程的执行概率为0.9。
    4. 检查增强后的样本,确保其在加入最终数据集前保持电动自行车的结构完整性。
    5. 离线执行增强操作,并保存图像以供后续训练使用。将随机种子设为42,以确保整个增强过程的可重复性。

4. 实验环境

  1. 配置实验环境,以确保模型训练和测试过程中的计算效率与稳定性。
  2. 使用现代多核处理器、专用于深度学习加速的独立 GPU、充足的内存以及稳定的存储系统,以支持大规模电动自行车图像数据的处理。
  3. 通过安装与硬件配置相匹配的深度学习框架版本、GPU 驱动程序和加速库,使软件环境与硬件配置相协调,从而优化训练速度和推理性能。
  4. 参考 表5、表6、表7 和 表8 中详细的硬件规格、软件环境、模型依赖关系以及成像设备设置,以确保实验可重复性。
  5. 计算开销与运行时分析
    1. 从标注复杂性和运行时效率两个方面,分析分块标注策略相关的计算开销。与整体标注相比,分块标注通过部件级区域(包括车轮区域、前部区域和后部区域)表示电动自行车。仅当这些区域可见且满足预定义的几何与基于特征的有效性条件时才进行标注,而非对每个实例强制标注。
      注意:从标注角度看,标签数量的增加是有限且结构受限的。一个电动自行车实例最多贡献三个部件级标注,而在部分遮挡情况下(例如仅前部区域可见),标注的区域更少。因此,每幅图像的标签数量随场景可见性和遮挡情况而变化,平均标签数量适度增加,如 表9 所总结。该设计在局部特征表征与标注复杂性之间实现了平衡。从推理角度看,分块标注不会导致后处理成本成比例增加。尽管部件级检测可能产生额外的候选边界框,但检测结果在电动自行车对象层级上进行聚合以用于最终评估,并且在后处理前应用基于置信度的过滤。这种基于可见性的条件式标注策略限制了不必要的检测候选。对于 YOLOv10 等减少对传统非极大值抑制依赖的模型,分块引入的额外开销在实际中仍然有限。
    2. 在典型的电梯监控分辨率 640 × 480 像素下,使用 NVIDIA RTX 3090 GPU 评估运行时性能。如 表9 所示,分块标注保持了实时推理能力,相较于整体标注仅在每秒帧数上略有下降。这些结果表明,分块标注策略仍适用于电梯环境中的电动自行车实时监测。

5. 评估指标

注意:尽管在训练和推理过程中使用分块标注,但评估是在电动自行车对象级别上进行的。根据第2.4、3节中定义的规则,将部件级别的检测结果聚合为单个电动自行车判定。

  1. 采用目标检测研究中常用的标准化评估指标27,全面评估算法在电动自行车遮挡检测场景中的性能。
  2. 检测精度(P)
    1. 使用公式(8)计算检测精度,该指标用于衡量在所有预测为正样本的实例中,正确识别的电动自行车所占的比例。
      精确率公式,TP/(TP+FP),用于数据分类任务中准确率计算的符号。  (18)
      其中 TP 表示真正例,FP 表示假正例。
    2. 将交并比(IoU)阈值设为 0.5,以判断预测边界框是否与真实标注框匹配。
    3. 使用精度指标评估模型减少因误识别非电动自行车物体而引发的不必要报警的能力。
    4. 生成该指标的命令:使用相应的评估脚本(例如 evaluate_precision.py)。将结果保存至 precision_results.txt 以供进一步分析。
  3. 召回率(R)
    1. 使用公式(9)评估模型在电梯环境中识别电动自行车的有效性,特别是在遮挡影响可见性的情况下。
      召回率公式,TP/(TP+FN),数据分析,研究方法。 (19)
      其中 FN 表示假反例。
    2. 将 IoU 阈值设为 0.5 以评估检测的准确性。使用召回率评估模型降低漏检的能力,确保即使在部分遮挡的情况下也能准确识别电动自行车。
    3. 生成该指标的命令:运行 evaluate_recall.py。将结果保存至 recall_results.txt。
      注意:在拥挤的电梯场景中,漏检问题至关重要,必须尽可能减少。漏检在拥挤的电梯场景中存在安全隐患,必须最小化。
  4. F1 分数
    1. 使用公式(10)计算 F1 分数,以获得模型在精度与召回率方面的综合平衡表现。
      F1 分数公式,用于计算模型性能,衡量精度与召回率的平衡。 (20)
    2. 使用 F1 分数进行整体性能评估,尤其适用于在不同遮挡程度下精度与召回率存在权衡的场景。
    3. 生成该指标的命令:运行 evaluate_f1.py 以计算 F1 分数。将结果保存至 f1_score_results.txt。
  5. 平均精度均值(mAP)
    1. 使用公式(11)评估模型在不同电动自行车外观、遮挡条件及光照变化下的整体检测能力。
      mAP50 公式,平均精度计算方法,统计分析方法。 (21)   
      其中 APc 表示类别 c 的平均精度,C 为类别总数。
    2. 将 IoU 阈值设为 0.5,以评估模型在不同类别上的性能。
    3. 使用 mAP@0.5 指标评估模型在电梯环境多样视觉条件下自适应能力,确保对检测性能进行全面评估。
    4. 生成该指标的命令:使用指定参数执行 evaluate_map.py。将结果保存至 map_results.txt。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在公共数据集上比较整体注释与分块注释

评估在一个包含210张电动自行车图像的公开数据集上进行,这些图像采集自开放的监控和交通监测场景,涵盖了多样的光照条件、电动自行车颜色以及不同程度的遮挡情况。每张图像均采用整体方法(单个边界框)和所提出的分块方法(将电动自行车划分为车轮、前部区域和后部区域)进行标注。

定量结果总结于表1中。在YOLOv5上,整体标注方法达到了0.81的精确率和0.74的召回率,得到0.77的F1分数和0.78的mAP@0.5。当使用分块标注进行训练时,YOLOv5的精确率提升至0.86,召回率提升至0.79,F1分数达到0.82,mAP@0.5达到0.84。与整体标注相比,这分别在精确率、召回率和mAP上实现了0.05、0.05和0.06的绝对提升。

同样,YOLOv10 表现出显著的改进。采用整体标注时,模型的精确率为 0.84,召回率为 0.76,F1 得分为 0.80,mAP@0...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

关键步骤

本方案中的一个关键步骤是基于局部特征的分块标注方法,即将电动自行车分割为车轮、前部和后部区域。这种划分方式确保了检测模型能够学习到细粒度的特征表示,这在遮挡严重的电梯环境中被证明至关重要。例如,使用 EBike-DET 数据集上的分块标注训练 YOLOv5 后,其 mAP@0.5 从 0.925 提升至 0.966,凸显了精确局部特征划分对实现稳健性能的必要性。此外,Harris 角点检测阶段是局部特征提取的关键预处理步骤。经验常数的选择(k=0.05)对优化角点检测结果尤为关键,因为偏离该值(如 k=0.04 或 k=0.06)会导致误检增多或特征敏感性下降。

方法的改进与故障排除

可通过多种改进措施来提高该方法的稳健性。首先,可引入自适应的角点检测阈值,使系统能够根据不同的光照和遮挡程度进行动态调整。这一调整可进一步减少误检,特别是在电梯等光照频繁变化的复杂场景中。其次,在数据集构建过程中...

访问受限。请登录或开始试用以查看此内容。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究得到中国教育部2025年人文社会科学研究规划基金(项目编号:25YJAZH002)、2024年广东省重点学科研究能力提升项目(项目编号:2024ZDJS086)、2024年广东省大学生创新创业训练计划项目(项目编号:S202413714017)以及教育部就业-教育联动计划的资助。 "面向人工智能技术的计算机应用专业人才培养机制创新与实践" (资助编号:2025072869464)

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
h5py (SSD)HDF Group2.10.0
matplotlib (SSD)Matplotlib 社区3.1.2
matplotlib (YOLOv10)Matplotlib 社区3.9.0
matplotlib (YOLOv5)Matplotlib 社区3.8.4
matplotlib (YOLOv5+SAHI)Matplotlib 社区3.8.4
matplotlib (YOLOv8-Seg)Matplotlib 社区3.9.0
numpy (SSD)NumPy 社区1.17.0
numpy (YOLOv10)NumPy 社区1.26.3
numpy (YOLOv5)NumPy 社区1.26.4
numpy (YOLOv5+SAHI)NumPy 社区1.26.4
numpy (YOLOv8-Seg)NumPy 社区1.26.3
onnx (YOLOv10)ONNX1.14.0
onnx (YOLOv5)ONNX1.14.0
onnx (YOLOv5+SAHI)ONNX1.14.0
onnxruntime (YOLOv10)Microsoft1.15.1
onnxruntime (YOLOv5)Microsoft1.15.1
onnxruntime (YOLOv5+SAHI)Microsoft1.15.1
opencv-python (SSD)OpenCV4.1.2.30
opencv-python (YOLOv10)OpenCV4.9.0.80
opencv-python (YOLOv5)OpenCV4.9.0.80
opencv-python (YOLOv5+SAHI)OpenCV4.9.0.80
opencv-python (YOLOv8-Seg)OpenCV4.9.0.80
pandas (YOLOv10)Pandas 社区2.2.2
pandas (YOLOv5)Pandas 社区2.2.2
pandas (YOLOv5+SAHI)Pandas 社区2.2.2
pandas (YOLOv8-Seg)Pandas 社区2.2.2
Pillow (SSD)Pillow 开发者8.2.0
Pillow (YOLOv10)Pillow 开发者10.2.0
Pillow (YOLOv5)Pillow 开发者8.5.0
Pillow (YOLOv5+SAHI)Pillow 开发者8.5.0
Pillow (YOLOv8-Seg)Pillow 开发者10.2.0
psutil (YOLOv10)Psutil 开发者5.9.8
psutil (YOLOv5)Psutil 开发者5.9.8
psutil (YOLOv5+SAHI)Psutil 开发者5.9.8
pycocotools (YOLOv10)COCO 联盟2.0.7
pycocotools (YOLOv5)COCO 联盟2.0.7
pycocotools (YOLOv5+SAHI)COCO 联盟2.0.7
pycocotools (YOLOv8-Seg)COCO 联盟2.0.7
py-cpuinfo (YOLOv10)Py-CPUInfo 开发者9.0.0
py-cpuinfo (YOLOv5)Py-CPUInfo 开发者9.0.0
py-cpuinfo (YOLOv5+SAHI)Py-CPUInfo 开发者9.0.0
PyYAML (YOLOv10)PyYAML6.0.1
PyYAML (YOLOv5)PyYAML6.0.1
PyYAML (YOLOv5+SAHI)PyYAML6.0.1
PyYAML (YOLOv8-Seg)PyYAML6.0.1
requests (SSD)Python Requests2.27.1
requests (YOLOv10)Python Requests2.32.3
requests (YOLOv5)Python Requests2.31.0
requests (YOLOv5+SAHI)Python Requests2.31.0
SAHISAHI 开发者0.3.4+
scipy (SSD)SciPy 社区1.2.1
scipy (YOLOv10)SciPy 社区1.13.0
scipy (YOLOv5)SciPy 社区1.13.0
scipy (YOLOv5+SAHI)SciPy 社区1.13.0
scipy (YOLOv8-Seg)SciPy 社区1.13.0
seaborn (YOLOv10)Seaborn 开发者0.13.2
seaborn (YOLOv5)Seaborn 开发者0.13.2
seaborn (YOLOv5+SAHI)Seaborn 开发者0.13.2
seaborn (YOLOv8-Seg)Seaborn 开发者0.13.2
shapely (YOLOv5+SAHI)Shapely 开发者2.0.4
SSDCaffe/原始 SSD 作者Python 3.6.13+; PyTorch 1.2.0+; CUDA 10.0; CUDNN 7.4.1
tensorboard (SSD)Google2.10.1
tensorboard (YOLOv5)Google2.16.2
tensorboard (YOLOv5+SAHI)Google2.16.2
torchvision (SSD)PyTorch0.4.0
torchvision (YOLOv10)PyTorch0.15.2
torchvision (YOLOv5)PyTorch0.17.2
torchvision (YOLOv5+SAHI)PyTorch0.17.2
torchvision (YOLOv8-Seg)PyTorch0.16.1+
tqdm (SSD)TQDM 开发者4.60.0
tqdm (YOLOv10)TQDM 开发者4.66.4
tqdm (YOLOv5)TQDM 开发者4.66.2
tqdm (YOLOv5+SAHI)TQDM 开发者4.66.2
ultralytics (YOLOv8-Seg)Ultralytics8.2.99+
YOLOv10YOLOv10 团队Python 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11.8; CUDNN 8.7
YOLOv5UltralyticsPython 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv5 + SAHIUltralytics + SAHI 开发者Python 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv8-SegUltralyticsPython 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11.8; CUDNN 8.6.0+

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Li, Y., Han, L., Ning, X., Xu, Y. Fire risk of electric bicycle based on fuzzy Bayesian network. J Phys Conf Ser. 1578 (1), 012153-012160 (2020).
  2. Cao, F., Sheng, G., Feng, Y. Detection dataset of electric bicycles for lift control. Alexandria Eng J. 105 (1), 736-742 (2024).
  3. Zhang, J., Mohd Yunos, Z., Haron, H. Interactivity recognition graph neural network model for improving human-object interaction detection. Electronics. 12 (2), 470-482 (2023).
  4. Yang, D., Su, C., Wu, H., Xu, X., Zhao, X. Shelter identification for shelter-transporting AGV based on improved YOLOv5. IEEE Access. 10 (1), 119132-119139 (2022).
  5. Wang, X., et al. LDS-YOLO: A lightweight small object detection method for dead trees. Comp Electron Agri. 198 (1), 107035-107044 (2022).
  6. Xu, R., Zhu, D., Chen, M. A novel underwater object detection enhanced algorithm based on YOLOv5-MH. IET Image Process. 18 (10), 3415-3429 (2024).
  7. Shang, J., Wang, J., Liu, S., Wang, C., Zheng, B. Small target detection algorithm for UAV aerial photography based on improved YOLOv5s. Electronics. 12 (11), 2434-2446 (2023).
  8. Wang, C. Y., Liao, H. Y. M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans Signal Inf Process. 13 (1), 1-18 (2024).
  9. Sapkota, R., et al. YOLO11 to its genesis: A decadal and comprehensive review of the YOLO series. Artif Intell Rev. 58 (2), 145-182 (2025).
  10. Huang, Z., Yin, Z., Ma, Y., Fan, C., Chai, A. Mobile phone component object detection based on improved SSD. Procedia Comp Sci. 183 (1), 107-114 (2021).
  11. Li, Y., Yang, F., Li, Y., Tan, C., Liu, Z. Circuit breaker identification based on SSD. J Phys Conf Ser. 2418 (1), 012080-012088 (2023).
  12. Deng, X., Li, S. Improved SSD object detection based on attention mechanism and feature fusion. J Phys Conf Ser. 2450 (1), 012088-012096 (2023).
  13. Huo, B., Li, C., Zhang, J., Xue, Y., Lin, Z. SAFF-SSD: Self-attention combined feature fusion SSD for small object detection. Remote Sens. 15 (12), 3027-3041 (2023).
  14. Murphy, K., Torralba, A., Eaton, D., Freeman, W. Object detection and localization using local and global features. Lect Notes Comp Sci. 4170 (1), 382-400 (2006).
  15. Mamat, N., Othman, M. F., Abdulghafor, R., Alwan, A. A., Gulzar, Y. Enhancing image annotation technique for fruit classification using deep learning. Sustainability. 15 (2), 901-915 (2023).
  16. Zhang, T., Jia, K., Xu, C., Ma, Y., Ahuja, N. Partial occlusion handling via robust part matching. Proc IEEE CVPR. 2014 (1), 1258-1265 (2014).
  17. Howard, A. G. Improvements on deep convolutional neural network based image classification. Tech Rep. 1 (1), 1-12 (2013).
  18. Zhang, H. Mixup: Beyond empirical risk minimization. arXiv. , (2017).
  19. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).
  20. Qin, J., Xu, N. Social distancing monitoring based on SSD. Procedia Comp Sci. 183 (1), 768-775 (2021).
  21. Zhong, P., Liu, Y., Zheng, H., Zhao, J. Detection of urban flood inundation using traffic images. Water Resour Manag. 38 (2), 287-301 (2024).
  22. Aamir, S. M., Ma, H., Khan, M. A. A., Aaqib, M. Real-time object detection in occluded environments with background clutter. Multimed Tools Appl. 83 (4), 11245-11261 (2024).
  23. Jia, K., Niu, Q., Wang, L., Niu, Y., Ma, W. Multi-object detection and size calculation for blended tobacco shreds. Sensors. 23 (18), 8380-8395 (2023).
  24. Sun, S., et al. Multi-YOLOv8 for infrared moving small object detection. Neurocomputing. 588 (1), 127685-127696 (2024).
  25. Sadik, M. N., Hossain, T., Sayeed, F. Real-time detection and analysis of vehicles and pedestrians using deep learning. Int J Comp Vis Robot. 14 (3), 215-229 (2024).
  26. Zhang, C., Jiao, P. YOLO series target detection algorithms for underwater environments. Ocean Eng. 279 (1), 114353-114366 (2023).
  27. Luo, B., Xiong, J., Xu, L., Pei, Z. Superpixel segmentation based on global similarity and contour region transform. IEICE Transac Info Sys. E103D (3), 716-719 (2020).
  28. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications and challenges. Comp Electr Eng. 117 (1), 109246-109268 (2024).
  29. Khurshid, S., Basharat, S., Afzal, S. The magic of artificial intelligence-2. Artif Intell Hum Health Dis. 1 (1), 29-46 (2025).
  30. Pan, W., Chen, J., Lv, B., Peng, L. Improved YOLOv9s-UI for underwater object detection. Appl Sci. 14 (14), 7162-7175 (2024).
  31. Zhang, J., Yunos, Z. M., Haron, H. Parallel multi-head graph attention network for human-object interaction detection. IEEE Access. 11 (1), 131708-131725 (2023).
  32. Li, L., Gao, S., Wu, F., An, X. MBAN: Multi-branch attention network for small object detection. PeerJ Comp Sci. 10 (1), e1965-e1980 (2024).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

EBike DET YOLOv5
视频即将推出

相关文章