一、揭秘 Consistent-Teacher:革新半监督目标检测的伪目标不一致问题

半监督目标检测(Semi-Supervised Object Detection, SSOD)是一种利用少量标注数据和大量无标注数据训练高性能目标检测器的方法,旨在解决标注成本高昂的难题。然而,SSOD 中伪目标(pseudo targets)的不一致性问题严重限制了其性能。论文 Consistent-Teacher: Towards Reducing Inconsistent Pseudo-targets in Semi-supervised Object Detection(作者:Xinjiang Wang 等,arXiv:2209.01589)提出了一种新颖的框架 Consistent-Teacher,通过创新的模块设计有效缓解了这一问题。本篇博客将深入剖析论文的核心内容,解读其创新点,提供实验复现指南,并探讨其学术价值和应用前景。
在这里插入图片描述


论文背景:SSOD 中的伪目标不一致问题

在 SSOD 中,常见的训练范式是教师-学生模型

  1. 使用标注数据训练一个教师模型(teacher model)。
  2. 教师模型为无标注数据生成伪标签,包括伪边界框(pseudo bounding boxes)和类别标签。
  3. 学生模型(student model)以这些伪标签为监督信号进行训练,同时教师模型通过学生模型参数的指数移动平均(EMA)更新。

尽管这一范式有效利用了无标注数据,但伪目标的不一致性带来了显著挑战,主要体现在:

  • 伪边界框噪声:教师模型预测的微小扰动可能导致伪边界框边界大幅变化,影响学生模型的锚框分配,引入噪声。
  • 分类与回归不匹配:伪边界框通常基于分类置信度筛选,但高置信度并不一定对应高质量的边界框定位,导致伪标签不可靠。
  • 静态阈值不适应:传统方法使用固定置信度阈值筛选伪边界框,难以适应模型在训练不同阶段的能力变化,造成伪标签数量和质量不稳定。

这些不一致性为学生模型训练注入噪声,导致严重过拟合,限制 SSOD 性能。Consistent-Teacher 通过三个创新模块系统性解决这些问题。


Consistent-Teacher 的核心创新点

Consistent-Teacher 提出三种关键技术,针对伪目标不一致的不同方面,显著提升 SSOD 性能。以下是核心创新点:
在这里插入图片描述
(总体结构图)

1. 自适应样本分配(Adaptive Sample Assignment, ASA)

传统 SSOD 使用基于 IoU 的静态锚框分配策略,对伪边界框噪声敏感。例如,伪边界框微小扰动可能导致附近对象的锚框被错误分配为正样本,引发过拟合。ASA 用成本感知的自适应分配策略替代静态策略:

  • 计算学生模型预测与伪边界框的匹配成本,包括分类损失(L_cls)、回归损失(L_reg)和中心距离先验(C_dist):
    C_nl = L_cls(p_n, y_l) + lambda_reg * L_reg(p_n, y_l) + lambda_dist * C_dist
    
    其中,C_nl 是锚框 n 与伪边界框 y_l 的匹配成本,lambda_reg 和 lambda_dist 为权重参数(lambda_dist ≈ 0.001)。
  • 选择匹配成本最低的锚框作为正样本,确保分配结果与模型检测质量一致。
  • 优势:ASA 使学生模型对噪声伪边界框更鲁棒,减少分配错误,抑制过拟合。

2. 三维特征对齐模块(3D Feature Alignment Module, FAM-3D)

SSOD 中,伪边界框仅基于分类置信度筛选,但分类置信度与边界框定位质量常不匹配。例如,相似置信度的锚框可能生成截然不同的伪边界框,导致伪标签漂移。FAM-3D 模块受 TOOD 检测器启发,通过以下方式校准分类和回归任务:

  • 在特征金字塔(FPN)中引入子分支,预测 3D 偏移向量 d = (d_0, d_1, d_2),包括 2D 空间偏移(d_0, d_1)和跨尺度偏移(d_2)。
  • 根据偏移向量重新排列特征金字塔,使分类特征自适应查询回归任务的最佳特征:
    P'(i, j, l) = P(i + d_0, j + d_1, l)
    P'(i, j, l) = P'(i', j', l + d_2)
    
    其中,i’, j’ 为调整后的坐标。
  • 优势:FAM-3D 提高分类置信度与边界框质量的相关性,生成更一致的伪边界框,减少分类-回归不匹配的噪声。

3. 基于高斯混合模型的动态阈值(Gaussian Mixture Model, GMM)

传统 SSOD 使用固定置信度阈值(如 0.4)筛选伪边界框,需手动调参,且无法适应模型训练阶段的能力变化,导致伪标签数量不稳定。GMM 动态调整阈值:

  • 假设每个类别的置信度分数 s^c 服从正负样本的高斯混合分布:
    P(s^c) = w_n^c * N(s^c | mu_n^c, (sigma_n^c)^2) + w_p^c * N(s^c | mu_p^c, (sigma_p^c)^2)
    
    其中,N 为高斯分布,w_n^c, mu_n^c, sigma_n^c 和 w_p^c, mu_p^c, sigma_p^c 分别为负样本和正样本的权重、均值和方差。
  • 使用期望最大化(EM)算法推断正样本概率 P(pos | s^c, mu_p^c, (sigma_pc)2),确定自适应阈值:
    tau^c = argmax_{s^c} P(pos | s^c, mu_p^c, (sigma_p^c)^2)
    
  • 实现细节:为每个类别维护置信度队列(大小 ~100),仅存储高置信度预测以应对负样本主导问题。
  • 优势:GMM 稳定正样本数量,减少阈值不一致,免去阈值调参。

二、原文的实验

方法概述
Consistent-Teacher 基于 Mean-Teacher 范式,采用 RetinaNet(单阶段检测器)作为基线。其训练流程:

  1. 教师模型:对弱增强的无标注图像生成伪边界框,参数通过学生模型 EMA 更新(动量 0.9995)。
  2. 学生模型:使用强增强的无标注图像和标注图像训练,损失函数包括分类损失(Focal Loss)和回归损失(GIoU Loss):
L = (1/N) * sum [L_cls(f_s(T(x_s^l)), y_s^l) + L_reg(f_s(T(x_s^l)), y_s^l)] 
    + lambda_u * (1/M) * sum [L_cls(f_s(T'(x_s^u)), y_s^u) + L_reg(f_s(T'(x_s^u)), y_s^u)]

其中,lambda_u = 2 为无标注数据权重,T 和 T’ 为弱增强和强增强变换。
3. 创新模块:ASA、FAM-3D 和 GMM 优化锚框分配、特征对齐和阈值筛选。

实验设置与结果
论文在 MS-COCO 2017PASCAL VOC 数据集上进行实验,验证 Consistent-Teacher 性能。

  1. 数据集与评估协议
  • MS-COCO 2017
    • COCO-PARTIAL:采样 1%、2%、5%、10% 的 train2017 作为标注数据,其余为无标注数据,在 val2017 上评估 AP_50:95(即 mAP)。
    • COCO-ADDITION:全部 train2017 作为标注数据,unlabeled2017 作为无标注数据,在 val2017 评估。
  • PASCAL VOC
    • VOC-PARTIAL:VOC2007 trainval 作为标注数据,VOC2012 trainval 作为无标注数据,在 VOC2007 test 评估 AP_50 和 AP_50:95。
  • 实现细节
    • 骨干网络:ResNet-50(ImageNet 预训练)。
    • 优化器:SGD,学习率 0.01,动量 0.9,权重衰减 0.0001。
    • 训练设置:8 块 GPU,每块 GPU 1 张标注图像 + 4 张无标注图像,COCO-PARTIAL 和 VOC-PARTIAL 训练 180K 迭代,COCO-ADDITION 训练 720K 迭代。
    • 数据增强:参考 Soft Teacher,包括随机缩放、翻转、颜色抖动等。
  1. 主要结果
  • COCO-PARTIAL
    • 10% 标注数据:40.0 mAP,比 Dense Teacher(37.13 mAP)高 3 mAP。
    • 5% 标注数据:36.1 mAP,比 Dense Teacher 高 4.09 mAP。
  • COCO-ADDITION
    • 47.7 mAP,超越 Soft Teacher(44.5 mAP)和 Dense Teacher(46.12 mAP)。
  • VOC-PARTIAL
    • 59.0 mAP,比 Unbiased Teacher v2(56.87 mAP)高 2.13 mAP。
  1. 消融研究
  • ASA:相比 IoU 分配,ASA 在 COCO 10% 上提升 3 mAP(38.5 → 40.0),全监督设置提升 1.7 mAP,证明其在 SSOD 的独特优势。
  • FAM-3D:相比无特征对齐和 FAM-2D,FAM-3D 在 COCO 10% 上提升 1.0 mAP 和 0.4 mAP,计算开销仅增 1%。
  • GMM:相比固定阈值(0.4),GMM 在 COCO 10% 上提升 0.5 mAP,免去阈值调参。
  1. 定性分析
  • 不一致性减少:Consistent-Teacher 降低伪标签不一致性(如 mAP 波动和伪边界框漂移),提高伪标签质量。
  • 分类-回归对齐:FAM-3D 使分类置信度与 IoU 相关性更高,减少低置信度高 IoU 或高置信度低 IoU 预测。
  • 动态阈值:GMM 稳定伪标签数量,避免静态阈值导致的过少或过多问题。

实验复现指南

在这里插入图片描述
在这里插入图片描述
为复现 Consistent-Teacher 实验结果,参考论文实现细节和代码(https://github.com/Adamdad/ConsistentTeacher)。以下是步骤:

  1. 环境配置
  • 硬件:8 张 NVIDIA Tesla V100 GPU(或 A100)。
  • 软件
    • Python 3.7+
    • PyTorch 1.8+
    • MMDetection
    • 安装依赖:
      pip install torch==1.8.1 torchvision==0.9.1
      pip install mmcv-full -f https://download.openmmlab.com/mmcv/dist/cu111/torch1.8.0/index.html
      pip install mmdet
      
  • 代码
    git clone https://github.com/Adamdad/ConsistentTeacher.git
    cd ConsistentTeacher
    
  1. 数据准备
  • MS-COCO 2017
    • 下载 train2017(118K 图像)、val2017(5K 图像)、unlabeled2017。
    • COCO-PARTIAL:采样 1%、2%、5%、10% 的 train2017 作为标注数据,剩余为无标注数据。
  • PASCAL VOC
    • 下载 VOC2007 trainval(5011 图像)、VOC2012 trainval(11540 图像)、VOC2007 test。
  • 数据预处理
    • 使用 Soft Teacher 数据增强(论文补充材料 Table 10-12),包括随机缩放、翻转、颜色抖动、几何变换。
  1. 训练
  • 配置文件:修改 MMDetection 配置文件(如 configs/consistent_teacher/consistent_teacher_retinanet_r50_fpn_coco_partial.py),设置数据集路径和超参数。
  • 超参数
    • 优化器:SGD,学习率 0.01,动量 0.9,权重衰减 0.0001。
    • 无标注数据权重:lambda_u = 2。
    • 训练迭代:COCO-PARTIAL 和 VOC-PARTIAL 180K 迭代,COCO-ADDITION 720K 迭代。
    • 教师模型 EMA 动量:0.9995。
  • 运行训练
    python tools/train.py configs/consistent_teacher/consistent_teacher_retinanet_r50_fpn_coco_partial.py
    
  1. 评估
  • COCO-PARTIAL:在 val2017 上计算 AP_50:95。
  • COCO-ADDITION:在 val2017 评估。
  • VOC-PARTIAL:在 VOC2007 test 上计算 AP_50 和 AP_50:95。
  • 命令
    python tools/test.py configs/consistent_teacher/consistent_teacher_retinanet_r50_fpn_coco_partial.py \
        work_dirs/consistent_teacher_retinanet_r50_fpn_coco_partial/epoch_180.pth \
        --eval bbox
    
  1. 注意事项
  • ASA:确保匹配成本计算正确,lambda_dist = 0.001 避免训练不稳定。
  • FAM-3D:验证 3D 偏移预测分支,检查跨尺度特征重采样。
  • GMM:维护置信度队列,确保 EM 算法收敛,GMM 更新增约 10% 训练时间。
  • 调试:若 mAP 低于预期,检查数据增强、预训练权重或学习率。

三、论文意义与反思

1. 学术贡献

  • 系统分析伪目标不一致:首次深入剖析 SSOD 中伪目标不一致的三个方面(噪声、分类-回归不匹配、阈值不一致),为后续研究提供理论基础。
  • 创新模块:ASA、FAM-3D 和 GMM 从锚框分配、特征对齐、阈值调整优化伪标签质量,提升 SSOD 性能。
  • 新标杆:在 MS-COCO 和 PASCAL VOC 上超越现有方法,树立 SSOD 新基线。

2. 实际应用

  • 低成本检测:在医疗影像、安防监控等标注稀缺领域,利用无标注数据提升性能,降低成本。
  • 实时检测:单阶段检测器效率适合自动驾驶、机器人导航等实时场景。
  • 模块化设计:ASA 和 FAM-3D 可集成到其他检测框架。

3. 局限性与未来方向

  • 局限性
    • 针对单阶段检测器,对两阶段或 Transformer 检测器(如 DETR)适用性需验证。
    • 伪标签自循环可能累积错误,尤其对分布外样本和小目标。
  • 未来方向
    • 探索端到端 SSOD,减少启发式设计。
    • 扩展到实例分割、关键点检测。
    • 改进小目标和分布外样本检测,如引入对抗训练或领域自适应。

结论

Consistent-Teacher 通过自适应样本分配、三维特征对齐和动态阈值调整,解决了 SSOD 中伪目标不一致问题,在 MS-COCO 和 PASCAL VOC 上取得显著性能提升。其创新模块和模块化实现使其成为 SSOD 领域重要基线。本博客深入解读论文并提供复现指南,希望帮助读者理解和实践 Consistent-Teacher,为低成本、高性能目标检测开辟新道路!

四、Consistent-Teacher 与 YOLOv11 结合:提升半监督目标检测性能

在半监督目标检测(Semi-Supervised Object Detection, SSOD)中,Consistent-Teacher 框架通过自适应样本分配(ASA)、三维特征对齐模块(FAM-3D)和基于高斯混合模型(GMM)的动态阈值调整,有效解决了伪目标不一致问题。而 YOLOv11 作为 Ultralytics 最新的实时目标检测模型,以其高效的架构(如 C3K2 模块、SPPF 模块和 C2PSA 注意力机制)和优异的性能(如在 COCO 数据集上更高的 mAP 和更低的参数量)成为 SSOD 的理想基线。本节探讨如何将 Consistent-Teacher 的创新点与 YOLOv11 结合,构建一个更鲁棒的 SSOD 框架,特别针对小目标检测和复杂场景的挑战。


1. 为什么选择 YOLOv11 作为基线?

YOLOv11 是 YOLO 系列的最新迭代,发布于 2024 年,相比 YOLOv8 和 YOLOv10 具有以下优势,适合与 Consistent-Teacher 结合:

  • 高效特征提取:YOLOv11 使用 C3K2 模块(3x3 卷积核优化特征提取)和 C2PSA 注意力机制(结合空间注意力),提升了对小目标和复杂场景的检测能力。
  • 多尺度特征融合:SPPF(Spatial Pyramid Pooling Fast)模块通过多尺度池化增强了对不同尺寸目标的感知,适合 SSOD 中多样化的无标注数据。
  • 轻量化和实时性:YOLOv11m 在 COCO 数据集上以 22% 更少的参数实现更高 mAP(相比 YOLOv8m),适合资源受限的 SSOD 场景。
  • 复杂训练策略:YOLOv11 集成了多种数据增强和优化技术(如 Mosaic 增强、MixUp),但这些技术可能降低 SSOD 的收益,需要 Consistent-Teacher 的优化来缓解伪标签噪声。

然而,YOLOv11 作为单阶段检测器,在 SSOD 中面临伪标签质量低和多任务优化冲突的问题(如分类和回归任务的不匹配)。Consistent-Teacher 的模块恰好弥补这些不足,使其成为理想的结合对象。
在这里插入图片描述
在这里插入图片描述


2. Consistent-Teacher 与 YOLOv11 的结合方案

将 Consistent-Teacher 的三个核心模块(ASA、"YesFAM-3D、GMM)融入 YOLOv11,需要适配 YOLOv11 的架构(包括骨干网络、Neck 和 Head)以及其训练流程(教师-学生模型范式)。以下是详细的结合方案:

2.1 自适应样本分配(ASA)与 YOLOv11 的集成

YOLOv11 的锚框分配

  • YOLOv11 使用动态标签分配策略(如 Task-Aligned Assignor),根据分类和回归的联合指标分配正样本。然而,在 SSOD 中,伪边界框的噪声会导致分配不稳定,尤其在无标注数据上。

ASA 的改进

  • Consistent-Teacher 的 ASA 替换 YOLOv11 的静态或半动态分配策略,通过计算学生模型预测与伪边界框的匹配成本动态分配正样本。匹配成本公式如下:
    C_nl = L_cls(p_n, y_l) + lambda_reg * L_reg(p_n, y_l) + lambda_dist * C_dist
    
    其中:
    • C_nl:锚框 n 与伪边界框 y_l 的匹配成本。
    • L_cls:分类损失(Focal Loss)。
    • L_reg:回归损失(CIoU Loss,YOLOv11 默认使用)。
    • C_dist:中心距离先验。
    • lambda_reg、lambda_dist:权重参数(推荐 lambda_dist = 0.001)。
  • 实现方式
    • 修改 YOLOv11 的标签分配模块(位于 ultralytics/nn/tasks.py 中的检测头),将默认的 Task-Aligned Assignor 替换为 ASA 逻辑。
    • 在学生模型的 Head 中,基于伪边界框计算匹配成本,选择成本最低的锚框作为正样本。
  • 优势
    • ASA 增强了学生模型对噪声伪边界框的鲁棒性,减少了错误分配。
    • 与 YOLOv11 的 CIoU Loss 兼容,进一步提升小目标的定位精度。

2.2 三维特征对齐模块(FAM-3D)与 YOLOv11 Neck 的融合

YOLOv11 的 Neck 架构

  • YOLOv11 的 Neck 使用 SPPF 模块和 C3K2 模块,通过上采样和特征拼接融合多尺度特征。C2PSA 注意力机制增强了对关键区域的关注,但分类和回归任务的特征对齐仍可能不一致,尤其在 SSOD 中伪标签质量较低时。

FAM-3D 的集成

  • Consistent-Teacher 的 FAM-3D 通过预测 3D 偏移向量 d = (d_0, d_1, d_2)(包括 2D 空间偏移和跨尺度偏移),使分类特征自适应查询回归任务的最佳特征:
    P'(i, j, l) = P(i + d_0, j + d_1, l)
    P'(i, j, l) = P'(i', j', l + d_2)
    
    其中,i’, j’ 为调整后的坐标,l 为特征金字塔层级。
  • 实现方式
    • 在 YOLOv11 的 Neck(ultralytics/nn/modules/block.py 中的 C3K2 模块后)添加 FAM-3D 子分支,预测 3D 偏移向量。
    • 将 FAM-3D 的输出与 C2PSA 注意力机制结合,动态调整分类特征,使其与回归任务对齐。
    • 具体步骤:
      1. 在每个 C3K2 模块后添加一个卷积层,输出 3 通道(d_0, d_1, d_2)。
      2. 使用偏移向量重采样特征金字塔,更新分类分支的输入。
      3. 保持回归分支不变,确保分类-回归对齐不影响定位精度。
  • 优势
    • FAM-3D 增强了分类置信度与边界框质量的相关性,减少伪标签漂移。
    • 与 YOLOv11 的 SPPF 和 C2PSA 协同,提升小目标和复杂场景的检测性能。

2.3 基于高斯混合模型的动态阈值(GMM)与 YOLOv11 的伪标签筛选

YOLOv11 的伪标签筛选

  • YOLOv11 默认使用固定置信度阈值(如 0.5)筛选伪边界框,需手动调参,且无法适应训练过程中模型能力的变化,导致伪标签数量不稳定。

GMM 的改进

  • Consistent-Teacher 的 GMM 假设每个类别的置信度分数 s^c 服从正负样本的高斯混合分布:
    P(s^c) = w_n^c * N(s^c | mu_n^c, (sigma_n^c)^2) + w_p^c * N(s^c | mu_p^c, (sigma_p^c)^2)
    
    使用 EM 算法推断正样本概率,动态确定阈值:
    tau^c = argmax_{s^c} P(pos | s^c, mu_p^c, (sigma_p^c)^2)
    
  • 实现方式
    • 在 YOLOv11 的教师模型推理阶段(ultralytics/engine/predictor.py),为每个类别维护置信度队列(大小 ~100),仅存储高置信度预测。
    • 使用 Python 的 sklearn.mixture.GaussianMixture 实现 GMM,动态更新阈值 tau^c。
    • 将 GMM 阈值应用于伪边界框筛选,替换固定阈值逻辑。
  • 优势
    • GMM 稳定伪标签数量,适应训练早期和后期的模型能力。
    • 免去阈值调参,提升 YOLOv11 在 SSOD 中的泛化能力。

2.4 整体训练流程

结合后的训练流程基于 Mean-Teacher 范式:

  1. 初始化:使用预训练的 YOLOv11 模型(推荐 YOLOv11m)初始化教师和学生模型。
  2. 教师模型:对弱增强的无标注图像生成伪边界框,使用 GMM 动态阈值筛选。
  3. 学生模型:使用强增强的无标注图像和标注图像训练,ASA 分配正样本,FAM-3D 对齐分类-回归特征。
  4. 损失函数
    L = (1/N) * sum [L_cls(f_s(T(x_s^l)), y_s^l) + L_reg(f_s(T(x_s^l)), y_s^l)] 
        + lambda_u * (1/M) * sum [L_cls(f_s(T'(x_s^u)), y_s^u) + L_reg(f_s(T'(x_s^u)), y_s^u)]
    
    其中,lambda_u = 2,L_reg 使用 CIoU Loss。
  5. EMA 更新:教师模型通过学生模型参数的 EMA 更新(动量 0.9995)。

3. 实验设置与预期结果

3.1 数据集与协议

参考 Consistent-Teacher 的实验设置,结合 YOLOv11 进行 SSOD 评估:

  • MS-COCO 2017
    • COCO-PARTIAL:采样 1%、5%、10% 的 train2017 作为标注数据,其余为无标注数据,在 val2017 上评估 AP_50:95。
    • COCO-ADDITION:全部 train2017 作为标注数据,unlabeled2017 作为无标注数据。
  • PASCAL VOC
    • VOC-PARTIAL:VOC2007 trainval 作为标注数据,VOC2012 trainval 作为无标注数据,在 VOC2007 test 评估。

3.2 实现细节

  • 环境
    • 硬件:8 张 NVIDIA A100 GPU。
    • 软件:Python 3.8+, PyTorch 1.12+, Ultralytics YOLOv11(ultralytics 包),MMDetection(用于 ASA 和 FAM-3D 的部分实现)。
  • 超参数
    • 优化器:SGD,学习率 0.01,动量 0.9,权重衰减 0.0001。
    • 批大小:每 GPU 1 张标注图像 + 4 张无标注图像。
    • 训练迭代:COCO-PARTIAL 180K 迭代,COCO-ADDITION 720K 迭代。
    • 数据增强:Mosaic、MixUp、随机缩放、翻转、颜色抖动。
  • 代码修改
    • 克隆 YOLOv11 仓库:git clone https://github.com/ultralytics/ultralytics.git
    • 集成 ASA:修改 ultralytics/nn/tasks.py 中的标签分配逻辑。
    • 集成 FAM-3D:修改 ultralytics/nn/modules/block.py,添加 3D 偏移预测分支。
    • 集成 GMM:修改 ultralytics/engine/predictor.py,添加 GMM 阈值筛选。

3.3 预期结果

基于 Consistent-Teacher 在 RetinaNet 上的表现(COCO 10% 下 40.0 mAP,COCO-ADDITION 下 47.7 mAP)和 YOLOv11 的优异基线性能,预期结果如下:

  • COCO-PARTIAL 10%:约 41.0-42.0 mAP,优于 Efficient Teacher(YOLOv5 基线,约 38 mAP)。
  • COCO-ADDITION:约 48.5-49.0 mAP,受益于 YOLOv11 的 C2PSA 和 SPPF 模块。
  • VOC-PARTIAL:约 60.0 mAP,优于 Consistent-Teacher 的 59.0 mAP。
  • 小目标检测:结合 YOLOv11 的 SPPF 和 FAM-3D,AP_small 预计提升 2-3%。

7. 结论

通过将 Consistent-Teacher 的 ASA、FAM-3D 和 GMM 模块与 YOLOv11 结合,构建了一个高效、鲁棒的 SSOD 框架。ASA 增强了伪边界框的分配鲁棒性,FAM-3D 校准了分类-回归特征,GMM 动态调整伪标签阈值,完美适配 YOLOv11 的轻量化架构和多尺度检测能力。预期结果显示,该框架在 COCO 和 VOC 数据集上将显著超越现有基线,尤其在小目标检测和实时场景中表现优异。这一结合为低成本、高性能的目标检测提供了新方向,适用于无人机、医疗、自动驾驶等广泛应用。

参考文献

  • Wang, X., et al. “Consistent-Teacher: Towards Reducing Inconsistent Pseudo-targets in Semi-supervised Object Detection.” arXiv:2209.01589, 2022.
  • Ultralytics YOLOv11 Documentation. https://docs.ultralytics.com, 2024.
  • Xu, B., et al. “Efficient Teacher: Semi-Supervised Object Detection for YOLOv5.” arXiv:2302.07577, 2023.

五、代码获取

详见博主主页

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐