研究文章

基于改进单阶段回归架构的实时香烟品牌识别目标检测模型

DOI:

10.3791/69657

2026年1月9日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为应对自动化仓库中遮挡和光照变化等挑战,本文提出了一种改进的单阶段回归架构,用于香烟盒品牌检测。通过融合自适应下采样、逆向高效的多尺度注意力机制以及动态检测头,所提出的模型实现了准确且实时的智能盘点。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

自动化香烟库存的视觉识别面临诸多挑战,包括光照变化、包装盒尺寸多样以及部分特征被遮挡等问题,这些因素使得品牌验证和错放包装盒的检测变得复杂。本文提出一种改进的实时检测模型,以应对图像识别难题并提升检测精度。首先,在YOLO系列模型的主干网络和颈部网络中,采用自适应下采样模块替代基线或原始检测器中的下采样卷积模块,有效保留了更多特征细节,同时实现了模型的轻量化。其次,引入一种倒置的高效多尺度注意力模块,用于捕捉不同尺度的空间上下文信息,并生成更精确的空间注意力图,从而提升基线模型对复杂特征和遮挡目标的预测准确性。最后,采用动态检测头模块替代基线模型原有的检测头,对主干网络和颈部网络提取的特征图进行多尺度目标检测,实现对预测目标的精确定位与类别划分。为评估改进模型在实际场景中的性能,我们构建了一个香烟盒品牌视觉数据集。该数据集通过区域特定的复制粘贴方法及传统数据增强技术进行扩充,包含复杂背景、遮挡与重叠、小目标等多种复杂因素。实验结果表明,本文提出的改进模型能够有效满足现场实时检测的需求。该模型实现了97.9%的mAP,参数量和浮点运算量分别为1,849,679和5.1 G。与基线模型相比,所提模型在mAP上提升了0.9%,同时参数量减少了28.78%,浮点运算量降低了1.4 G。此外,模型达到38.5 FPS的推理速度,满足工业实时检测的应用要求。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

现代制造和物流高度依赖自动化存取系统(AS/RS)1,以实现高密度存储、高效的物料搬运和精确的库存管理。由于其高效性和智能化特点,AS/RS已成为帮助企业提升仓库效率、降低运营成本的重要手段。AS/RS以多层货架为基础,结合多种装卸设备,是一种由计算机控制的机电一体化系统,集成了机械、电子、计算机科学、通信、网络、传感器和自动控制等多种技术2,3。通过货架、堆垛机、输送线、控制系统及其他设备的集成与优化,AS/RS实现了货物高效、准确、安全的存储与搬运,显著提升了仓储效率。将计算机视觉技术融入AS/RS是工业4.0的关键组成部分,它使系统能够“看见”并基于视觉数据做出决策,从而实现前所未有的自动化与智能化水平4

随着自动化立体仓库(AS/RS)在烟草工厂中的广泛应用5,卷烟盒品牌盘点提出了新的需求。传统的人工盘点方法存在效率低、误检率高和安全隐患等问题,难以满足AS/RS系统的要求。随着计算机视觉技术的不断进步,机器视觉方案在工业检测领域的应用日益广泛6,7,8。由于每个卷烟盒上均印有具有独特图案和文字的品牌信息,基于机器视觉的图像识别技术可实现对卷烟盒品牌的识别与盘点。

自2012年以来,基于深度学习的目标检测算法在图像识别领域取得了重大突破9,10,11。从早期的两阶段目标检测模型(如R-CNN12),到当前以YOLO系列模型 为主导的单阶段目标检测模型作为基线或原始检测器13,14,15,这些方法对目标检测算法的发展做出了重要贡献。智能盘点任务越来越多地采用目标检测模型,以在图像或视频中准确识别和定位多个目标。Li等16提出了一种融合称重传感器与图像识别技术的智能盘点方法,以提高盘点效率和准确性。Wang等17使用Mask R-CNN从书脊图像中分割出书架编号和书名位置。Sun等18设计了一套集成化的视觉识别系统,利用OpenCV在多模态下识别物料和货架上的二维码。他们通过引入C3CBAM注意力机制和SimOTA标签分配策略优化了原始检测器(v5s),以增强损失函数,实现精确的多物料检测。

在目标检测领域,尽管以 Faster R-CNN 为代表的两阶段模型在检测精度方面具有传统优势,但其复杂的区域提议生成机制导致推理速度相对较慢。因此,这类模型难以满足工业场景对实时性能的严格要求19,20。相比之下,基于回归的架构将目标检测视为单一的回归问题,直接从输入图像中预测目标位置和类别概率。这种架构设计使模型在推理效率、轻量化和部署灵活性方面显著优于大多数两阶段模型,同时保持具有竞争力的检测精度。因此,该架构已成为实时工业检测的首选方案21

原始模型生态系统仍在快速发展,近期的变体致力于解决特定挑战。例如,原始检测器(v12)22 专注于进一步提升训练阶段的优化和架构精炼,以实现更优的精度与效率权衡。与此同时,原始检测器(World)23 引入了开放词汇检测能力,通过利用视觉-语言建模,能够对超出训练集类别的大量物体进行实时推理。尽管这些进展拓展了通用目标检测的边界,但本研究聚焦于一种特定的工业应用场景,其中对部分遮挡和光照变化等特定挑战的鲁棒性至关重要,且类别空间是固定且先验已知的。作为该模型家族中最新版本,基线模型24 继承了原始检测器(v8)25,26 的优势;它不仅减少了模型参数数量,还兼顾了检测效率与精度之间的平衡。与其他目标检测模型相比,其在视觉识别任务中表现突出。

检测小型或部分遮挡的香烟盒这一挑战,反映了计算机视觉领域的一个更广泛的问题。小目标检测一直是研究热点,相关方法涵盖从特征金字塔网络(FPN)的优化27到上下文感知注意力机制,这些方法启发了多尺度特征处理的融合。此外,在工业场景中实现高效运行的需求要求模型设计必须轻量化。受MobileNetV328和GhostNet29中探索的高效架构理念的启发,这些架构通过深度卷积和线性变换在保持特征表达能力的同时降低计算复杂度,因此我们选用了一些轻量级模块来提升模型性能。针对香烟盒品牌盘点任务及其盘点过程中存在的影响因素,如光照变化、不同品牌特征尺寸差异以及香烟盒之间的部分遮挡等问题,本文提出了一种改进的单阶段回归架构目标检测模型。

所提出模型的主要创新之处有三点。首先,在主干网络和颈部网络中,采用自适应下采样(Adaptive Downsampling, ADown)30模块替代标准的卷积下采样方法。这一新颖设计缓解了特征压缩过程中的信息丢失问题,对于保留小型品牌标识和文字至关重要。其次,引入了一种逆向的高效多尺度注意力(inverted Efficient Multi-scale Attention, iEMA)机制,使模型具备动态的、多尺度的上下文感知能力,显著提升了对小型及部分遮挡烟盒的检测性能。第三,将原始检测头替换为DynamicHead31模块,该模块统一了尺度、空间和任务感知注意力机制,能够更精确地实现对尺寸差异显著目标的定位与分类。这些结构上的改进被系统性地设计,旨在解决工业场景中香烟品牌识别的具体难点问题。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文所使用的数据集来自龙岩烟草工业有限责任公司物流部的自动化立体仓库(AS/RS)现场。本研究未涉及人类参与者或动物,无需伦理审批。

数据采集与设置
硬件配置:将配备8 mm焦距镜头(例如 MVL-HF0828M-6MPE)的工业相机(例如 MV-CA013-A0GM)安装在堆垛机的载货平台上。通过GigE线缆和无线AP设备(例如 BH-ANT5158S-14HV、BH-MS-AC1600HWH)将相机连接至控制计算机。在相机周围安装条形LED灯(例如 MV-LLDS-1002-38-W),以确保光照均匀。

相机参数设置:使用制造商提供的软件(例如 MVS)配置相机。将采集分辨率设置为 1280 × 1024 像素。将触发模式设为硬件触发,并与堆垛机的定位系统同步。将曝光时间设为 100 ms,增益设为 5 dB,以最小化运动模糊和噪声。相机与烟盒之间的工作距离约为 550 mm。

图像采集:在卷烟盒存储和取用过程中,每当托盘定位时,带触发装置的工业相机会自动拍摄一张图像。共采集4,835张原始图像;典型图像如图1所示。

图像标注:使用开源工具 LabelImg。对每张图像,在每个可见的香烟品牌特征周围绘制边界框,并为每个边界框分配正确的品牌名称(例如,Hongzhuang、Gutian)作为类别标签。将标注保存为标准的单阶段检测格式,每张图像对应一个 txt 文件。

质量控制:由第二位标注人员随机抽查已标注图像的20%。所有不一致之处将通过讨论解决,以确保标注的一致性。

数据增强策略
本节详细说明应用于数据集的传统与先进增强技术。将原始数据与增强后的数据合并为一个新的数据集,然后将其划分为训练集、验证集和测试集,以确保评估的公平性。

传统数据增强32:这些变换由训练流程在实时中应用(例如,使用 Albumentations 或 PyTorch Transforms 库),每个批次以预定义的概率进行。

几何变换:旋转:将图像在 -45° 至 +45° 范围内随机旋转。缩放:将图像按 0.8 至 1.2 的比例因子进行随机缩放。水平翻转:以 100% 的概率对图像进行随机水平翻转。随机裁剪:随机裁剪原始图像面积的 80% 至 100% 区域。

光度变换:亮度和对比度:从 [0.6, 1.4] 范围内随机选择一个因子来调整亮度和对比度。高斯噪声:对 10% 的图像添加标准差从 [0, 0.01 × 255] 范围内随机选择的高斯噪声。高斯模糊:对 10% 的图像应用核大小为 3×3 的高斯模糊。

遮挡模拟:在图像上随机放置1到3个矩形遮挡块(每个遮挡块最多覆盖图像面积的5%)。遮挡块内填充随机噪声或图像像素的平均值。

高级数据增强:区域特定的复制粘贴
动机与影响:实施这种针对性增强的主要动机是解决一个关键的数据问题:某些香烟品牌实例极少(少至仅有一张图像)。标准的随机训练-验证-测试划分可能会将稀有品牌的所有实例全部分配到单一数据集(例如全部进入测试集),导致模型完全无法学习或验证该品牌。该方法人为增加了这些代表性不足品牌的数据样本量,确保每个品牌在训练集、验证集和测试集中均有足够数量的实例分布。这一基础性步骤可防止模型在稀有类别上出现灾难性失败,是模型在全部品牌集合上实现有意义的性能表现和泛化能力的前提条件。

此步骤需要在初始数据集上预训练的分段基线模型以及 Segment Anything Model(SAM)33

分割源对象:针对代表性不足的品牌的烟盒图像,使用 SAM 模型生成精确的分割掩膜。采用点提示模式,点击烟盒的品牌特征区域以启动分割。手动验证并优化生成的掩膜,确保其准确性。将分割后的烟盒图像以透明背景的 PNG 文件格式保存。由此构建一个独立对象实例的图像库。

生成背景掩膜:使用预训练的实例分割基础模型对一组背景图像(具有充足空白区域或简单背景的图像)进行实例分割。该模型将输出二值掩膜,以标示出已被物体占据的区域。

处理掩码并粘贴对象:针对每个背景掩码,使用 OpenCV 库(调用 'cv2.approxPolyDP' 函数,epsilon 参数设为轮廓周长的 0.02 倍)进行曲线拟合并线性化掩码边缘,从而获得自由空间的简化多边形表示。在背景掩码中识别出最大的连续多边形区域,作为目标粘贴区域。从源对象库中随机选择一个已分割的源对象,调整其大小(保持宽高比),并应用仿射变换(轻微旋转角度在 -5° 至 +5° 之间,以及轻微剪切),使其自然地融入目标粘贴区域,同时确保不与现有对象的边界重叠。采用 alpha 融合技术,将变换后的对象无缝粘贴至背景图像的计算位置。基于特定区域复制-粘贴技术的数据增强整体框架如图 2所示。程序化生成与粘贴对象对应的新 txt 标注文件,更新其边界框坐标和类别标签。

最终扩增数据集:此离线过程生成600张新的合成图像。将这些图像与原始的4,835张图像以及通过上述传统扩增技术生成的额外1,167张图像合并,构成最终包含6,602张图像的数据集。将最终数据集划分为训练集(70%,4,621张图像)、验证集(20%,1,320张图像)和测试集(10%,661张图像),并确保来自同一原始序列的图像保留在同一划分中,以防止数据泄露。

构建所提出改进检测器的模型修改
近年来,目标检测的优化算法34在工业检测领域取得了显著进展。本节详细说明了逐步修改基础模型架构以构建所提出模型的具体步骤。这些修改通过编辑模型的配置文件(例如 config.yaml)实现,并确保代码库中包含相应的自定义模块定义。文中对每一项修改均提供了理论依据,以阐明其在应对特定检测挑战中的作用。所提出模型的结构如图3所示。

使用ADown模块替换下采样模块:用于下采样的标准卷积-批归一化-SiLU(CBS)模块采用单一的跨步卷积,可能成为信息瓶颈35,导致丢失识别小型烟盒及精细品牌标识所必需的细粒度特征。ADown模块通过引入双分支结构,在降低空间分辨率的同时捕获并保留更丰富的特征,从而缓解这一问题。其中一个分支优先保留高频局部细节,另一个分支则捕获更广泛且富含上下文的整体信息。这两类互补特征的融合,为后续网络层提供了更鲁棒且信息更丰富的表征。

操作-实施步骤
模块定义:确保在项目的模型定义文件中定义了一个名为 ADown 的自定义 PyTorch 模块。该模块必须包含两个并行分支。第一个分支应包含一个卷积核为 3×3、步幅为 2 的二维卷积层。第二个分支应依次包含一个 2×2 的最大池化层(步幅为 2)和一个 1×1 卷积层。这两个分支的输出需在通道维度上进行拼接,拼接后的特征图再通过一个最终的 1×1 卷积层,以融合通道信息并生成输出。ADown 模块的结构如图 4所示。

配置文件编辑:打开基础模型配置文件(config.yaml)。系统地识别出所有配置为下采样的 CBS 模块实例(即步幅参数设置为 2 的位置)。将这些 CBS 模块条目逐一替换为新的 ADown 模块。

设计动机:ADown 的设计旨在缓解标准步幅卷积中可能导致小目标信息丢失的问题,此类信息丢失可能对小物体检测产生不利影响。其双分支结构受到并行处理思想的启发,通过卷积分支捕获高频空间细节,同时通过池化分支获取低频上下文信息,从而为后续网络层提供更丰富的多尺度特征表示。

iEMA 模块的集成
设计原理与思路:为了增强模型对小目标及部分被遮挡目标的检测能力,必须引入一种能够有效建模多尺度空间上下文的机制。iEMA 模块通过在倒残差模块(iRMB)37 结构中嵌入高效的多尺度注意力(Efficient Multi-scale Attention, EMA)36 组件来实现这一目标。iRMB 利用深度可分离卷积提供了计算高效的结构基础,而 EMA 组件则通过并行多分支结构显式地捕捉跨尺度的空间交互关系。该集成方式使模型能够动态地重新校准特征权重,将注意力聚焦于不同尺度下最具判别性的空间区域,从而提升在遮挡条件下以及对小物体的识别性能。

操作-实施步骤
模块定义:确保定义一个名为 iEMA 的自定义 PyTorch 模块。该模块应首先实现一个倒残差结构块。该结构块通常以逐点卷积开始,用于通道扩展,随后进行逐深度卷积(例如 3×3)以提取空间特征,最后通过逐点卷积实现通道投影。在此结构块之后,应立即实现 EMA 注意力机制。EMA 机制通常采用分组卷积和跨维度交互,以较低的计算开销高效生成多尺度空间注意力图。iEMA 模块的结构如图 5所示。

配置文件编辑:在 config.yaml 配置文件中,找到定义颈部网络的部分,具体为 C2f 模块之后的层。在这些关键位置插入一个调用 iEMA 模块的新层。

设计动机:iEMA 模块基于通过结合局部特征提取(通过深度可分离卷积)与轻量但高效的全局上下文建模机制(EMA),以增强特征判别能力的原则。这种混合方法使模型能够自适应地关注不同尺度上的关键区域,这对于识别部分可见的品牌标志和文本至关重要。

使用 DynamicHead 模块替换检测头
原理与设计思路:原始检测头可能无法最优地处理香烟盒显著的尺度变化以及定位与分类任务之间的复杂交互。DynamicHead 模块通过将三种注意力机制统一到一个连贯结构中来解决这一问题,即尺度感知、空间感知和任务感知注意力。其中,尺度感知组件动态融合特征金字塔不同层级的特征,确保各种尺寸的物体均能被有效表征;空间感知组件采用稀疏采样策略,将计算资源集中在特征图中最具信息量的区域;任务感知组件则针对边界框回归和类别分类这两个不同目标,自适应地调整特征表示。这种统一的方法实现了更准确、更鲁棒的预测结果。

操作-实施步骤
模块定义:这是一个复杂的模块,包含由公式(1)至(4)所描述的三种注意力机制。其内部结构将包括用于计算尺度权重、执行可变形空间注意力以及应用任务特定特征变换的层。

动态系统分析方程,\( W_i(F) \) 公式,数学模型概念。   (1)

展示数据分析算法的带西格玛符号的数学函数示意图。   (2)

统计分析方程;πs(F) 公式;数学模型表示。     (3)

用于优化分析的财务方程,πc(F) = max[α^1(F)·Fc + β^1(F), α^2(F)·Fc + β^2(F)]。     (4)

其中,WL(F) 表示最终经过注意力机制优化的特征图,通过对输入特征 F 依次应用尺度感知的 πL(F)、空间感知的 πS(F) 和任务感知的 πC(F) 注意力机制获得。具体而言,在公式 (2) 中,πL(F) 通过首先在空间维度(S)和通道维度(C)上进行平均,再将其输入一个线性函数 f(⋅) 和一个硬Sigmoid激活函数 σ(⋅),从而计算出按尺度划分的注意力权重。在公式 (3) 中,πS(F) 通过从 K 个采样的关键点 pk 聚合特征来实现稀疏空间注意力,每个关键点具有可学习的偏移量 Δpk 以聚焦于判别性区域,以及一个重要性标量 Δmk。在公式 (4) 中,πC(F) 通过在每个通道上应用由学习参数(α1, β122)决定的线性变换,并选择最大响应值,实现任务感知的注意力机制,从而使检测头能够针对分类和回归任务进行专门化。DynamicHead 模块的结构如图6所示。

配置文件编辑:在 config.yaml 文件中,找到定义模型头部的部分,该部分最初包含 Detect 模块。将其替换为调用 DynamicHead 模块的新条目。

设计动机:DynamicHead 模块基于以下观察:目标检测头应能自适应尺度、空间位置和任务。其统一的注意力框架在公式 (1-4) 中形式化表达,使模型能够根据这三个维度动态地重新校准特征响应,从而在应对尺度变化和背景干扰时实现更鲁棒的预测。

模型训练
确保已安装 PyTorch 2.1.0、CUDA 12.1 及所有依赖项。

训练命令
重新训练之前,需将分割后的图像数据和标注数据准备成标准的单阶段检测格式。创建一个包含图像路径和数据类别的 .yaml 文件。根据模型改进情况,将原始检测器的 .yaml 文件替换为所提出模型的 .yaml 文件。编写 train.py 文件,导入单阶段检测器包,加载训练模型和数据路径,并设置一些训练参数,包括 imgze=640、epochs=100、batch=4、workers=0、device='0'、optimizer='SGD'、close_mosaic=10 等。

超参数:关键参数包括:输入图像尺寸(640 × 640)、批量大小(4)、初始学习率(0.01)并采用余弦退火调度器、带动量(0.937)的SGD优化器,以及权重衰减(0.0005)。默认启用Mosaic数据增强。

训练监控:训练过程将输出每个训练周期的评估指标。请监控训练/验证损失以及 0.5 阈值下的 mAP 指标曲线,以确保模型收敛并避免过拟合。通常训练 100 个周期已足够。

模型评估与部署
评估:训练完成后,最佳模型将保存为 runs/train/exp/weights/best.pt。使用以下命令在验证集上评估模型:bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt。该脚本将输出精确率(Precision)、召回率(Recall)、0.5 阈值下的平均精度(mAP)等指标。请确认 mAP 达到所需阈值(例如 97.9%)。

验证推理:对样本图像运行推理以直观验证检测结果:bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5。通过验证推理过程,可获得每张图像的检测结果及模型的检测速度。

部署:在堆垛机系统上进行实时部署时,将 PyTorch 模型(best.pt,约 4.7 MB)转换为 TensorRT 或 ONNX 等格式,以优化推理速度。最终输出为带有类别标签(品牌名称)和置信度分数的边界框。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实验环境与参数设置
为验证所提出模型的性能,实验在深度学习框架 PyTorch 上进行,实验环境的详细信息如表1所示。本研究使用了一个包含 6,602 张图像的专用数据集,并按 7:2:1 的比例随机划分为训练集、验证集和测试集。所有实验均采用分辨率为 640 × 640 的输入图像,初始学习率为 0.01,通过动量为 0.937 的随机梯度下降法进行优化,以防止过拟合。在训练过程中,采用马赛克增强(mosaic augmentation)技术,在每次迭代中处理四幅图像,以增加检测背景的多样性。所有模型均训练 100 个 epoch,批量大小为 4,工作线程数设置为 0。

评价指标
在多分类任务中,将感兴趣的目标类别样本定义为正类,其余所有样本则构成负类。真正例(TP)表示被正确预测为正类的样本数量,假正例(FP)表示被错误预测为正类的样本数量,假反例(FN)表示被错误预测为负类的样本数量,而真反例(TN)表示被正确预测为负类的样本数量。基于上述定义,可进一步推导出...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

准确率与效率的权衡
该模型的一个核心成就是其在准确率与计算效率之间实现了更优的平衡。如表2所示,所提出的模型在对比的单阶段检测器模型中,实现了最高的 mAP,同时参数数量最少,且 FLOPs 位居第二低。这直接转化为实际优势:模型更小,部署速度更快,内存需求更低,并在 GPU 和边缘硬件上均具有更低的推理延迟和功耗。因此,该模型特别适用于计算资源受限平台上的实时应用,例如堆垛机的车载计算机,这类场景对计算资源的要求极为严格。

局限性
尽管该增强模型表现出较强的性能,但仍存在若干局限性。其准确性依赖于训练数据的代表性。在极端光照条件(例如强烈的镜面反射)下,或当香烟盒被遮挡超过约70%时,模型性能可能下降,而这些情况在本数据集中所占比例较低。探索并整合专门针对严重遮挡设计的先进技术,例如相关鲁棒检测研究中提出的方法39,可能是未来解决此局限性的有前景方向。此外,该模型在高端GPU(NVIDIA 3080 Ti)上...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在直接的竞争性经济利益。本研究与龙岩烟草工业有限责任公司合作开展,作者邓红丽和李文灿受雇于该公司;同时与宝鸡卷烟厂合作,作者罗保斌受雇于该厂。这些单位为本研究提供了应用场景和现场数据。学术作者(刘军、易建国、杨峰、赵晓波)声明,就本作品的发表而言,不存在经济或非经济利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作得到了中国浙江省自然科学基金联合基金资助的“基于前置反射器与多波长的铸坯测温方法”(项目编号:LZY24E002)以及衢州市科技计划项目资助的“非封闭非等温钢包空腔在线温度场测量方法”(项目编号:2023K231)的支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
条码读取器HikvisionID5050Hikvision设备:用于读取托盘上的条形码,需连接24V电源
工业相机HikvisionMV-CA013-A0GM, MV-CS016-10GM需连接24V电源
LED光源HIKROBOTMV-LLDS-1002-38-W一米长条形光源,为相机提供充足的照明条件
镜头HikvisionMVL-HF0828M-6MPE焦距:8mm,光圈范围:F2.8~F16,像素:600万
MVSHikvisionV4.5.1Hikvision软件:用于相机调试、参数设置和数据采集
PycharmJetBrains2020.1.3 x64用于训练深度学习模型和开发检测系统
多个金属支架龙岩烟草工业有限责任公司7075-T6铝合金用于固定相机和条码读取器
若干网线龙岩烟草工业有限责任公司RJ45水晶头连接工业计算机与无线AP之间的基站,连接相机与交换机等
交换机TP-LinkTL-SH1005具有8个以太网接口,需220V电源供电
Vision MasterHikvisionV4.3.0Hikvision软件:用于模板匹配和图像检测结果分析
无线AP设备山东华创讯联BH-ANT5158S-14HV, BH-MS-AC1600HWH由于堆垛机需要大范围移动,无法使用网线将相机连接至工业计算机,需通过无线AP设备保障相机网络的稳定运行

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

视频即将推出

相关文章