作者:Sudip Chakrabarty 机构:KIIT 大学计算机工程学院 (School of Computer Engineering, KIIT University) 邮箱:sudipchakrabarty6@gmail.com 日期:2026年1月21日

摘要 (ABSTRACT)

长期以来,“You Only Look Once” (YOLO) 框架一直作为实时目标检测的基准,然而传统迭代版本(从 YOLOv1 到 YOLO11)仍然受到非极大值抑制(NMS)后处理的延迟和超参数敏感性的制约。本文对 YOLO26 进行了全面分析,该架构通过消除 NMS 并采用原生的端到端学习策略,从根本上重新定义了这一范式。本研究探讨了促成这一转变的关键创新,特别是引入了用于稳定轻量级主干网络(backbones)的 MuSGD 优化器、用于感知小目标分配的 STAL 以及用于动态监督的 ProgLoss。通过对官方性能基准的系统回顾,结果表明 YOLO26 建立了一个新的帕累托前沿(Pareto front),在推理速度和检测精度上均超越了众多前代模型及最先进的竞争对手(包括 RTMDet 和 DAMO-YOLO)。分析证实,通过将表示学习与启发式后处理解耦,YOLOv26 成功解决了历史遗留的延迟与精度之间的权衡问题,标志着基于边缘计算的计算机视觉迈出了下一步的演进。

关键词:YOLOv26,端到端目标检测,无 NMS (NMS-Free),MuSGD,ProgLoss,实时计算机视觉,You Only Look Once。


1. 引言 (Introduction)

计算机视觉已经从边缘检测和形态学滤波等基础图像处理技术,迅速演变为由深度学习主导的领域。处于这一演变最前沿的是目标检测,即在数字图像中识别和定位语义对象实例的基础任务。与仅为图像分配单一标签的简单分类不同,目标检测需要同时预测类别标签和几何边界框。这种能力是现代自动化的基石,支撑着从自动驾驶、机器人导航到医学图像分析和实时监控等关键应用。随着对实时分析需求的增长,该领域已从计算繁重的两阶段检测器(如 Faster R-CNN)转向了在不牺牲精度的前提下优先考虑推理速度的高效单阶段架构。

(注:本文仅基于 Ultralytics 发布的公开文档、基准测试和技术描述,对 YOLO26 进行二次分析和回顾。有关 YOLO26 的官方文档,请访问: | arXiv:2601.12882v1 [cs.CV] 2026年1月19日 | Sudip C.;YOLO26:目标检测的无 NMS 框架分析)

1.1 Ultralytics 的技术遗产 (The Ultralytics Legacy) 在这一背景下,Ultralytics 已成为实时检测领域的决定性力量。从标准化 YOLO(You Only Look Once)架构开始,Ultralytics 不断突破效率的边界。他们迭代发布的版本(最显著的是 YOLOv5 和 YOLOv8)通过将跨阶段局部(Cross-Stage Partial, CSP)主干网络与用户友好的部署管道相结合,确立了新的行业标准。这些模型成功实现了 AI 的普及,使得复杂的检测任务能够在计算资源有限的边缘设备上运行。然而,即使是这些最先进的模型也主要依赖于非极大值抑制(NMS)后处理,这一顺序步骤在密集场景中会引入延迟的变化性。

1.2 YOLOv26:最快的目标检测模型 (YOLOv26: The Fastest Object Detection Model) YOLOv26 于2025年9月发布,在实时目标检测史上树立了一座新的里程碑。为了量化这一飞跃,Ultralytics 团队发布了官方基准测试,将 YOLOv26 与其全面的一系列前代模型(从 YOLOv5 [1] 到 YOLO11 [2, 3])以及 RTMDet [4]、DAMO-YOLO [5] 和 PP-YOLOE+ [6] 等具有竞争力的架构进行了对比。

1.2.1 报告性能分析 (Analysis of Reported Performance) 正如官方数据(图1)[7] 所示,其性能……

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐