AI大模型应用开发-目标检测:YOLOv8 入门(调用现成模型,不用懂原理)、识别图片中的物体(比如 “猫”“狗”“人”)
·
一、前置核心认知:YOLOv8 是什么?
1. 核心定位
YOLOv8(You Only Look Once v8)= 目标检测领域的 “爆款工具”,是目前工业界和入门学习最常用的目标检测模型,能自动完成:
- 识别图片 / 视频中的物体(如猫、狗、人、汽车、椅子等);
- 用方框标出物体的位置;
- 标注物体的类别名称(如 “cat”“dog”“person”);
- 给出识别的置信度(越接近 1,识别越准确)。
2. 小白通俗理解
YOLOv8 就像给计算机装了 “火眼金睛”:你给它一张图片,它能立刻告诉你 “图片里有 1 只猫(在左上角)、2 个人(在中间)、1 辆汽车(在右下角)”,还会把这些物体用方框标出来生成新图片 —— 而且这一切都不用你写复杂模型代码,直接用官方训练好的 “成品模型” 就行。
3. 核心优势(小白必知)
- 开箱即用:官方提供预训练好的模型,无需自己标注数据、训练模型;
- 识别范围广:能识别 80 + 日常常见物体(人、猫、狗、车、杯子、椅子等);
- 速度快:普通电脑 CPU 也能运行,几秒出结果;
- 结果直观:自动生成带标注框的图片,一眼能看懂识别效果。
二、第一步:环境准备(小白极简安装)
YOLOv8 的核心库是ultralytics,封装了所有模型调用逻辑,安装只需 1 行命令:
1. 安装依赖(Windows/Linux 通用,国内源加速)
打开 CMD / 终端,输入:
# 安装ultralytics(YOLOv8核心库)+ opencv(辅助读取图片)
pip install ultralytics opencv-python -i https://pypi.tuna.tsinghua.edu.cn/simple
2. 验证安装(确保无报错)
新建test_yolo.py文件,运行以下代码:
python
# 导入YOLO类
from ultralytics import YOLO
# 验证版本(无报错即安装成功)
print("YOLOv8库安装成功!")
运行后输出YOLOv8库安装成功!,说明环境没问题。
三、核心实操:一键调用 YOLOv8 识别图片中的物体
1. 核心逻辑(小白不用记,会用就行)
- 加载官方预训练的 YOLOv8 模型(自动下载,首次运行稍慢);
- 传入你要识别的图片路径;
- 模型自动识别物体,生成带标注框的图片并保存;
- 输出识别结果(物体类别、位置、置信度)。
2. 完整代码(直接复制,仅需改图片路径)
python
from ultralytics import YOLO
model = YOLO("yolov8n.pt")
img_path = "D:\\Desktop\\2.png"
# 修改这一行 - 保存到D盘的AI_Projects文件夹
results = model.predict(
source=img_path,
save=True,
conf=0.25,
project="D:\\Desktop"
)
# 剩下的代码完全不变
for result in results:
for box in result.boxes:
cls_name = result.names[int(box.cls)]
confidence = round(float(box.conf), 4)
x1, y1, x2, y2 = map(int, box.xyxy[0])
print(f"识别到:{cls_name} | 置信度:{confidence} | 位置:({x1},{y1})-({x2},{y2})")
print(f"\n图片已保存到:{results[0].save_dir}")
3. 操作步骤
- 把代码中的
img_path替换成你本地图片的绝对路径(比如C:\Users\张三\Desktop\猫狗.jpg); - 运行代码(首次运行会自动下载
yolov8n.pt模型文件,约 6MB,耐心等待); - 等待几秒,终端会输出识别结果,同时自动生成标注后的图片。
四、结果解读(小白一看就懂)
1. 终端输出示例(识别到猫、狗、人)
image 1/1 D:\Desktop\2.png: 640x512 1 dog, 77.0ms
Speed: 3.0ms preprocess, 77.0ms inference, 1.0ms postprocess per image at shape (1, 3, 640, 512)
Results saved to D:\Desktop\predict
识别到:dog | 置信度:0.8711 | 位置:(14,93)-(799,961)
图片已保存到:D:\Desktop\predict
cls_name:识别出的物体名称(YOLOv8 默认支持 80 类,比如 person = 人、cat = 猫、dog = 狗、car = 汽车、chair = 椅子等);confidence:置信度(0.9876 表示 98.76% 确定是猫,值越高越准确);位置:方框的左上角和右下角坐标,对应图片里物体的位置。
2. 标注图片查看
运行后,你的代码所在文件夹会生成D:\Desktop\predict目录,里面有标注后的图片:
- 图片里的物体被红色方框框住;
- 方框上方会显示 “类别名称 + 置信度”(比如
dog 0.87); - 直接打开图片就能直观看到识别效果。

五、小白扩展:识别视频 / 摄像头实时识别(可选)
YOLOv8 不仅能识别图片,还能识别视频、甚至摄像头实时画面,只需改source参数:
1. 识别本地视频
python
# 替换img_path为视频路径(如C:\Users\XXX\Desktop\test_video.mp4)
img_path = "D:\\Desktop\\3.mp4"
运行后会生成标注后的视频文件,保存在D:\Desktop\predict2\中(如果之前图片是在predict中,这次运行会新建一个predict2目录)。
2. 摄像头实时识别
运行后会弹出实时画面窗口,摄像头拍到的物体都会被实时框出并标注类别。
六、小白避坑指南(核心 3 点)
-
模型下载失败 / 慢:
- 解决方案:手动下载
yolov8n.pt(官网:https://github.com/ultralytics/assets/releases),放到代码同目录,模型会优先读取本地文件; - 或配置国内镜像(百度搜 “ultralytics 国内镜像”,复制配置代码)。
- 解决方案:手动下载
-
图片识别失败(提示 “no images found”):
- 检查图片路径是否正确,路径不要有中文 / 空格(比如
C:\桌面\猫狗.jpg改为C:\desktop\cat_dog.jpg); - Windows 路径用双反斜杠(
\\)或加 r(r"C:\desktop\cat_dog.jpg")。
- 检查图片路径是否正确,路径不要有中文 / 空格(比如
-
识别结果差(漏识别 / 错识别):
- 调高置信度阈值(比如
conf=0.5,只保留 50% 以上置信度的物体,减少误识别); - 换更大的模型(比如
yolov8s.pt,识别更准但速度稍慢); - 确保图片清晰,物体占比不要太小。
- 调高置信度阈值(比如
总结
- YOLOv8 是开箱即用的目标检测工具,小白无需懂原理,只需调用官方预训练模型就能识别图片中的猫、狗、人等 80 + 物体;
- 核心流程:安装
ultralytics库 → 加载yolov8n.pt模型 → 调用predict()传入图片路径 → 查看终端结果和标注后的图片; - 关键参数:
save=True保存标注图片,conf=0.25设置置信度阈值,source指定识别源(图片 / 视频 / 摄像头); - 避坑重点:图片路径无中文 / 空格、首次运行耐心等模型下载、识别效果差可调整置信度或换稍大模型。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)