当前位置：首页 > article >正文

【目标检测实验系列】YOLOv5创新点改进实验：通过转置卷积，动态学习参数，减少上采用过程特征丢失，提高模型对目标的检测精度！（超详细改进代码流程）

article 2025/2/25 2:06:18

1. 文章主要内容

本篇博客主要涉及两个主体内容。第一个：简单介绍转置卷积的原理。第二个：基于YOLOv5 6.x版本，将Neck部分的upSample改为nn.ConvTranspose2d转置卷积（通读本篇博客需要10分钟左右的时间）。
小提示：这些点子都可以用来作为写SCI四区、北大核心论文的一个小创新点！

2. 转置卷积（原理：简单介绍，可自行详细研究）

通俗的讲，转置卷积相对于普通卷积在上采样过程中，能够动态的学习需要补充的参数，这样就可以减少在上采样过程中特征的丢失，尤其是一些小的目标(这是因为，小目标的信息本来是比较少的)。具体的原理可以参考这篇博客：转置卷积

3. 实验流程

3.1 新建yolov5s-transposed2d.yaml文件

需要注意到，我们通过nn.ConvTranspose2d来代表转置卷积。另外：

   [-1, 1, Conv, [256, 1, 1]],
   [-1, 1, nn.ConvTranspose2d, [256, 4, 2, 1, 0, 256]],

nn.ConvTranspose2d输入输出通道来自于上一层的普通卷积的输出通道，这就意味着，如果想要自定义的添加Neck的位置，需要注意到上层卷积的输出通道数要和转置卷积匹配。博主这里使用nn.ConvTranspose2d替换前两层的upSample。
本实验以yolov5s作为基础模型，其他的YOLOv5模型类似。需要注意到，新建的文件一般存放于models文件夹下，另外需要修改文件中的nc(即为类别数目，根据自己的数据集来),其代码如下所示：

# YOLOv5 🚀 by Ultralytics, GPL-3.0 license

# Parameters
nc: 4  # number of classes
depth_multiple: 0.33  # model depth multiple
width_multiple: 0.50  # layer channel multiple
anchors:
  - [10,13, 16,30, 33,23]  # P3/8  小目标
  - [30,61, 62,45, 59,119]  # P4/16 中目标
  - [116,90, 156,198, 373,326]  # P5/32  大目标

# YOLOv5 v6.0 backbone
backbone:
  # [from, number, module, args]
  [[-1, 1, Conv, [64, 6, 2, 2]],  # 0-P1/2  output_channel, kernel_size, stride, padding
   [-1, 1, Conv, [128, 3, 2]],  # 1-P2/4
   [-1, 3, C3, [128]],
   [-1, 1, Conv, [256, 3, 2]],  # 3-P3/8
   [-1, 6, C3, [256]],
   [-1, 1, Conv, [512, 3, 2]],  # 5-P4/16
   [-1, 9, C3, [512]],
   [-1, 1, Conv, [1024, 3, 2]],  # 7-P5/32
   [-1, 3, C3, [1024]],
   [-1, 1, SPPF, [1024, 5]],  # 9
  ]

# YOLOv5 v6.0 head
head:
  [[-1, 1, Conv, [512, 1, 1]],
   [-1, 1, nn.ConvTranspose2d, [512, 4, 2, 1, 0, 512]],
   [[-1, 6], 1, Concat, [1]],  # cat backbone P4
   [-1, 3, C3, [512, False]],  # 13

   [-1, 1, Conv, [256, 1, 1]],
   [-1, 1, nn.ConvTranspose2d, [256, 4, 2, 1, 0, 256]],
   [[-1, 4], 1, Concat, [1]],  # cat backbone P3
   [-1, 3, C3, [256, False]],  # 17 (P3/8-small)

   [-1, 1, Conv, [256, 3, 2]],
   [[-1, 14], 1, Concat, [1]],  # cat head P4
   [-1, 3, C3, [512, False]],  # 20 (P4/16-medium)

   [-1, 1, Conv, [512, 3, 2]],
   [[-1, 10], 1, Concat, [1]],  # cat head P5
   [-1, 3, C3, [1024, False]],  # 23 (P5/32-large)

   [[17, 20, 23], 1, Detect, [nc, anchors]],  # Detect(P3, P4, P5)
  ]