YOLO室内家居与户外自然环境多目标检测数据集

YOLO26 在道路交通检测中的应用

📊 数据集基本信息

  • 目标类别: [‘aeroplane’, ‘bicycle’, ‘bird’, ‘boat’, ‘bottle’, ‘bus’, ‘car’, ‘cat’, ‘chair’, ‘cow’, ‘diningtable’, ‘dog’, ‘horse’, ‘motorbike’, ‘person’, ‘pottedplant’, ‘sheep’, ‘sofa’, ‘train’, ‘tvmonitor’]
  • 中文类别:[‘飞机’, ‘自行车’, ‘鸟’, ‘船’, ‘瓶子’, ‘公交车’, ‘汽车’, ‘猫’, ‘椅子’, ‘牛’, ‘餐桌’, ‘狗’, ‘马’, ‘摩托车’, ‘人’, ‘盆栽植物’, ‘羊’, ‘沙发’, ‘火车’, ‘电视机’]
  • 训练集:2341 张
  • 验证集:557 张
  • 测试集:5359 张
  • 总计:8257 张

📄 data.yaml 配置信息

该数据集提供了data.yaml文件,内容如下:

train: ../train/images
val: ../valid/images
test: ../test/images

nc: 20
names: ['aeroplane', 'bicycle', 'bird', 'boat', 'bottle', 'bus', 'car', 'cat', 'chair', 'cow', 'diningtable', 'dog', 'horse', 'motorbike', 'person', 'pottedplant', 'sheep', 'sofa', 'train', 'tvmonitor']

🖼️ 标注可视化

标注图1

数据集下载

数据集下载:⬇️⬇️⬇️ 点击下载

标注图2

标注图3

数据集详细介绍

YOLO室内家居与户外自然环境多目标检测数据集是一个面向实际场景的通用目标检测数据集,其名称暗示了该数据集覆盖了室内和户外两种典型环境。从类别名称推测,数据集可能包含如家具、家电、人、车辆、植物、建筑结构等常见对象,适用于智能家庭、安防监控、机器人导航、增强现实等多个领域。该数据集的设计初衷可能是为了支持跨场景的目标检测任务,提升模型在复杂环境下的泛化能力,尤其适合需要同时处理室内与户外图像的应用。

数据集共包含8257张图片,覆盖20个类别,表明其具有一定的多样性与代表性。虽然具体的中文和英文类别名称未提供,但从“室内家居”与“户外自然环境”的描述可以推断,类别可能涵盖日常生活中常见的物体,如桌椅、电器、行人、车辆、树木、花草、道路标志等。这样的分类设计有助于训练模型识别不同环境中的多种目标,同时也为研究者提供了探索跨域目标检测方法的实验基础。

标注规范方面,考虑到该数据集与YOLO框架的关联性,推测其采用了标准的边界框标注方式,确保每个目标对象都被精确框选并赋予正确的类别标签。这种规范化的标注方式不仅提升了数据质量,也为后续的模型训练提供了可靠的输入,有助于提高检测精度和模型稳定性。此外,数据集的多样性和平衡性可能对训练鲁棒性强、泛化能力好的检测模型具有重要价值。

在实际应用中,该数据集可广泛用于开发智能家居系统、无人巡检机器人、城市交通监测、虚拟现实场景构建等方向。对于希望拓展应用场景至室内外混合环境的开发者而言,该数据集提供了宝贵的实验资源。建议在使用时结合具体任务需求进行数据筛选与增强,并关注类别分布的平衡性,以充分发挥数据集的训练潜力。

YOLO26 目标检测算法原理

YOLO26 的核心设计理念是「推理优先」——架构上做的所有减法(去 NMS、去 DFL)都是为了推理更快,精度靠训练时的额外机制来弥补。

端到端无 NMS 推理:传统 YOLO 模型在推理后需要执行非极大值抑制(NMS)来去除冗余检测框,这增加了后处理延迟和部署复杂度。YOLO26 默认采用一对一(one-to-one)检测头,直接输出每张图像最多 300 个检测结果 (N, 300, 6),完全省去 NMS 步骤,推理流水线大幅简化。在 CPU 上的 ONNX 推理速度相比 YOLO11n 提升高达 43%。

无 DFL 回归:YOLO26 移除了分布焦点损失(Distribution Focal Loss, DFL)结构,检测头更加轻量。边界框回归不再受限于预设的离散区间,既降低了模型复杂度又保持了同等甚至更优的回归精度。

Progressive Loss 与 STAL:训练过程中通过渐进损失(Progressive Loss)将监督信号逐步从辅助头部转移到推理阶段的主头部。小目标感知标签分配(STAL)策略特别提升小目标的正样本标签覆盖率,改善小物体检测性能。

MuSGD 混合优化器:创新性地将大语言模型常用的 Muon 优化器与 SGD 结合,实现更稳定高效的训练收敛。相比纯 SGD,MuSGD 在大 batch 训练时收敛更快且不易震荡。

模型尺度与 COCO 性能:YOLO26 提供 N/S/M/L/X 五种尺度:

模型 mAP50-95 CPU ONNX(ms) T4 TensorRT(ms) 参数量
YOLO26n 40.9 38.9 1.7 2.4M
YOLO26s 48.6 87.2 2.5 9.5M
YOLO26m 53.1 220.0 4.7 20.4M
YOLO26l 55.0 286.2 6.2 24.8M
YOLO26x 57.5 525.8 11.8 55.7M

Nano 版本参数量仅 2.4M,CPU 推理速度比 YOLO11n 快 43%,适合边缘设备和小数据集;X 版本 mAP 达 57.5,适用于对准确率要求极高的场景。

双头架构设计:YOLO26 检测模型内置两个检测头——一对一(默认,无 NMS,输出 300 个检测框)和一对多(需 NMS,输出 8400 个候选框)。训练时一对多头作为辅助监督信号加速收敛,推理时默认使用一对一头实现端到端输出。

YOLO26 支持全部七大视觉任务:检测、实例分割、语义分割、深度估计、分类、姿态估计和定向边界框检测(OBB),一个框架覆盖从 2D 检测到 3D 感知的完整需求。

模型导出与部署

训练只是第一步,模型最终要跑在生产环境里。YOLO26 的部署导出非常方便。

导出格式对比

格式 命令参数 适用场景 速度
PyTorch - 开发调试 中等
ONNX format="onnx" 跨平台通用
TensorRT format="engine" NVIDIA GPU 推理 最快
OpenVINO format="openvino" Intel CPU/VPU
Core ML format="coreml" Apple 设备
TFLite format="tflite" Android/嵌入式
NCNN format="ncnn" ARM 端侧 很快

导出示例

from ultralytics import YOLO
model = YOLO("runs/detect/train/weights/best.pt")

# 导出 ONNX(最通用)
model.export(format="onnx", imgsz=416)
# 导出 TensorRT(NVIDIA GPU 最快)
model.export(format="engine", device=0, imgsz=416)
# 导出 NCNN(瑞芯微/ARM 嵌入式)
model.export(format="ncnn", imgsz=416)
# int8 量化(牺牲少量精度换 2-3 倍速度)
model.export(format="engine", device=0, imgsz=416, int8=True)

YOLO26 无 NMS 部署优势:由于默认一对一检测头,导出模型推理时无需额外 NMS 后处理代码。ONNX 输出格式 [N, 300, 6],直接解释为 [批次, 检测数, (x1, y1, x2, y2, cls, conf)],大幅简化嵌入式开发和移动端集成。

CPU 部署建议:无 GPU 环境推荐 ONNX + OpenCV DNN 或 ONNX Runtime。YOLO26 无 NMS 设计在 CPU 上提升尤为明显,推理速度比 YOLO11n 快约 43%。

YOLO26 训练步骤详解

下面用几行命令跑一遍完整的训练流程

环境准备

pip install ultralytics
yolo checks
python -c "import torch; print(torch.cuda.is_available())"

命令行训练

yolo detect train     data=data.yaml     model=yolo26n.pt     epochs=150     imgsz=416     batch=64     device=0     lr0=0.02     patience=-1     cos_lr=True     close_mosaic=10

Python API 训练

from ultralytics import YOLO

model = YOLO("yolo26n.pt")
results = model.train(
    data="data.yaml",
    epochs=150,
    imgsz=416,
    batch=64,
    device=0,
    lr0=0.02,
    patience=-1,
    cos_lr=True,
    close_mosaic=10,
    augment=True,
    amp=True,
    workers=8,
)

训练输出文件

  • runs/detect/train/weights/best.pt:验证集上 mAP 最高的权重
  • runs/detect/train/weights/last.pt:最后一轮保存的权重
  • runs/detect/train/results.csv:每轮 loss 和指标数据
  • runs/detect/train/confusion_matrix.png:混淆矩阵图
  • runs/detect/train/results.png:训练曲线图
  • runs/detect/train/val_batch*_pred.jpg:验证集预测效果图

单张推理测试

model = YOLO("runs/detect/train/weights/best.pt")
results = model("test_image.jpg")
results[0].show()

多 GPU 分布式训练

yolo detect train data=data.yaml model=yolo26n.pt device=0,1 epochs=100

恢复中断的训练

yolo detect train model=path/to/last.pt data=data.yaml resume=True

模型评估指标解读

评估一个检测模型,光看 mAP50 远远不够。mAP50-95、Precision、Recall 这三个数放一起看,才能拼出完整画面。

训练完成后,YOLO26 训练器自动输出以下指标:

mAP50(mAP@0.5):IoU 阈值为 0.5 时的平均精度均值,反映模型粗粒度定位能力。mAP50 ≥ 0.90 表示定位效果很好。

mAP50-95(mAP@0.5:0.95):IoU 从 0.5 到 0.95 共 10 个阈值上取平均。更严苛,反映精确定位能力,是更具代表性的综合评价指标。

Precision(精确率):检测结果中正确检测的比例。高 Precision 意味着虚警少。

Recall(召回率):真实目标中被成功检测到的比例。高 Recall 意味着漏检少。

F1 Score:Precision 和 Recall 的调和平均数 = 2×P×R/(P+R),综合衡量模型平衡性。

Confusion Matrix(混淆矩阵):N×N 矩阵,对角线为正确分类,非对角线为误分类,可定位类别间混淆情况。

训练曲线分析

  • train/box_loss 单调下降 → 边界框回归正常收敛
  • val/box_loss 先降后升 → 过拟合风险,应增大数据增强或减小模型
  • metrics/mAP50(B) 增长放缓趋于平稳 → 模型接近收敛上限
  • train 持续降、val 持续升 → 严重过拟合,建议减小模型或增大 dropout

指标使用场景

  • 安全生产场景(如安全帽检测)→ 优先保证 Recall,宁可多报不能漏报
  • 质检场景(如缺陷检测)→ 优先保证 Precision,降低误检率减少人工复核量
  • 通用检测 → 均衡优化,关注 mAP50-95 和 F1 Score

PR 曲线实战解读:每张 PR_curve.png 里每个类别有一条不同颜色的曲线。不用盯着每个类看——先找出最差的那条(最靠左下角的),它代表你模型的弱项。加大那个类别的数据量或检查标注质量,通常比调任何参数都见效。

关键训练参数配置详解

YOLO26 训练涉及的参数很多,但真正需要调整的核心参数其实就十几个。下面逐一拆解每个参数的作用和本项目建议值。

参数 默认值 本项目设置 含义
model - yolo26n.pt 预训练权重,n/s/m/l/x 五种尺度
epochs 100 150 训练总轮数
imgsz 640 416 输入图像尺寸
batch 16 64 批次大小,根据显存调整
lr0 0.01 0.02 初始学习率
lrf 0.01 0.01 最终学习率因子(lr0 × lrf)
momentum 0.937 0.937 SGD 动量
weight_decay 0.0005 0.0005 权重衰减(L2 正则化)
warmup_epochs 3.0 3.0 预热轮数
warmup_momentum 0.8 0.8 预热期间动量初始值
box 7.5 7.5 边界框回归损失权重
cls 0.5 0.5 分类损失权重
dfl 1.5 1.5 DFL 损失权重(YOLO26 可置 0)
patience 100 -1 早停轮数
cos_lr False True 余弦学习率衰减
close_mosaic 10 10 最后 N 轮关闭 Mosaic 增强
optimizer auto SGD 优化器选择
amp True True 自动混合精度训练
freeze None 0 冻结前 N 层骨干网络参数
dropout 0.0 0.1 分类头 Dropout 率,防过拟合

三个损失权重的分工:box 负责《框在哪》,cls 负责《框里是什么》,dfl 在 YOLO26 中可设 0 因为默认检测头已去掉 DFL。大部分场景保持默认比例即可,除非有明确的偏好需求。

学习率调参经验

  • 训练初期 loss 不下降 → 调大 lr0 或增加 warmup_epochs
  • 训练后期 loss 震荡 → 降低 lr0,增大 weight_decay
  • 验证集 loss 先降后升(过拟合)→ 增大 dropoutweight_decay 或减小 epochs
  • 小数据集(<100张)→ lr0=0.001, weight_decay=5e-4, dropout=0.2
  • 大数据集(>1000张)→ lr0=0.01, weight_decay=5e-4, batch=32+

训练可视化与TensorBoard:YOLO26 默认开启 TensorBoard 日志记录,训练过程中可实时查看 loss 曲线和指标变化。在命令行执行 tensorboard --logdir runs/detect/train 即可打开 Web 看板,每轮训练完成后自动刷新。训练结束后 results.png 生成的六合一曲线图是最直观的诊断工具——一眼就能看出是否过拟合、是否收敛、哪个 loss 在震荡。

断点续训机制:如果训练意外中断(断电、OOM 等),不用从头开始。YOLO 每轮保存 last.pt,恢复训练时指定 model=last.pt 并设置 resume=True,学习率和优化器状态都会从断点恢复,训练曲线也和连续训练一样平滑。

部署与应用建议

生产环境部署:大数据集训练出的模型泛化能力较强,可直接导出多种格式用于不同场景:

from ultralytics import YOLO
model = YOLO("runs/detect/train/weights/best.pt")
# GPU 服务器:TensorRT(最快)
model.export(format="engine", device=0, imgsz=416)
# 跨平台:ONNX
model.export(format="onnx", imgsz=416)
# 移动端:TFLite int8 量化
model.export(format="tflite", imgsz=416, int8=True)

持续优化:可定期收集线上误检/漏检样本纳入训练集,迭代提升模型表现。大数据集下知识蒸馏或多尺度训练也能带来额外精度收益。

中等规模数据集的快速迭代策略:8257 张图不算多也不算少,刚好处于一个可以玩出花的区间。

建议先把训练拆成两阶段:第一阶段用默认参数完整训 80 轮看上限在哪,第二阶段针对弱项做定向优化。不要在第一次训练就试图把参数调到完美——这只会浪费时间。

第一阶段结束后,看三个指标做诊断:

  • val_box_loss 是否降到 0.7 以下 → 如果没到,加大 epochs
  • mAP50-95 相对 mAP50 的差距 → 如果差距 > 15 个点,说明定位精度差,尝试提高 imgsz
  • 各类别的 AP 方差 → 如果某类 AP 远低于均值,优先补充该类数据

第二阶段根据诊断结果调整参数重新训练,通常 2-3 轮迭代就能找到最优组合。

你可能还需要知道的几个细节:YOLO26 的文档很全,但有些实战经验不在文档里。

imgsz=416imgsz=640 的差异比你想象的大。416 下每张图的训练时间短大约 30%,但对小目标的召回率可能差 5 个点以上。如果你的数据集中小目标(小于 32×32 像素)占比超过 30%,建议用 512 或 640。

② AMP(自动混合精度)默认开启,但这在 GTX 16 系列等不支持 TensorCore 的 GPU 上反而拖慢训练。如果遇到训练速度异常慢,试试关掉 AMP:amp=False

close_mosaic=10 意味着最后 10 轮关闭 Mosaic 数据增强。这个设置很关键——如果不关,模型始终在"拼贴图"上评估,没见过真实数据的分布,最终部署时精度会掉一大截。

④ 训练数据里有大量重复或高度相似的图片时(比如视频截帧),split='val' 自动划分可能导致训练和验证集高度相似,验证指标虚高。建议手动划分或使用按场景/时间分割的策略。

workers=8 是默认值,但如果你的硬盘是机械硬盘而非 SSD,并发读图可能会成为瓶颈。CPU 占用率满但 GPU 利用率低时,试着降低 workers 到 2-4。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐