一文搞懂视觉识别:分类、检测、分割与 CNN、ResNet、YOLO、U-Net,AI 是怎么“看懂“图片的?
小区门口的刷脸闸机、手机产线上的质检相机、医院里的 CT 阅片、马路上的自动驾驶汽车——这些看起来毫不相干的场景,背后是同一门技术:视觉识别。
和 AI 绘画正好相反:生成模型是从无到有"画"出图片,视觉识别是从图片里"读"出信息——图里有什么、在哪里、边界在哪。
三大任务:分类、检测、分割
AI"看懂图片"其实就是三种由粗到细的玩法:
- 图像分类:这张图是什么?——输出一个标签。工业检测里的"OK/NG"判定就是最典型的分类:零件合格还是不合格;
- 目标检测:图里的东西在哪里、是什么?——输出一堆方框,每个框带类别和置信度。自动驾驶框出每辆车、每个人,安防抓拍同屏 30 张人脸,都是检测;
- 图像分割:每个像素归谁?——输出一张和原图一样大的"着色图"。医疗 CT 勾器官边界、自动驾驶区分道路和人行道,都是分割。

要求一个比一个高:分类只看整图,检测要定位到框,分割要精确到像素。接下来的问题是:这些能力是怎么实现的?
CNN:所有视觉模型的地基
三种任务背后,站着同一个地基——卷积神经网络(CNN)。它做图像分类的原理,拆开就四步:
- 卷积核是"特征放大镜":每个卷积核只认一种微观图案——边缘、拐角、纹理……它在图片上逐格滑动,遇到自己认的图案就给出高分;
- 卷积层备着一排放大镜:几十个卷积核各认各的图案,各自扫一遍全图;
- 扫完得到"特征地图":地图上的每个数值,都代表图片对应小区域里"这种特征有多明显"——一张图片就这样变成了几十张边缘地图、纹理地图;
- 池化层把地图缩小:特征图变小、感受野变大——前面几层认的是边缘纹理,后面几层就能认出"车轮""眼睛"这样的结构部件。

层层堆叠,网络从"认边缘"一路升级到"认部件"“认物体”,最后压平成特征向量、接上分类器,就能输出"这是只猫"。
ResNet:让网络"深"下去
按理说,网络越深,能认的特征越高级,效果应该越好。但人们发现层数堆到一定程度,效果反而变差——不是过拟合,是训练本身出了问题:深网络的成绩竟然还不如浅网络。
2015 年的 ResNet 用一个极其简单的改动解决了这个问题:残差连接——让每一小段网络的输出从 F(x) 变成 F(x) + x。
打个比方:传统网络像传话游戏,每层都把信息完整加工一遍再传下去,传几十层难免失真;残差连接则是"原稿直接送达,修改意见单独附上"——每层只负责学一个修正量,原始信息一路畅行。靠着这个改动,网络从十几层一路堆到上百层:34 层的 ResNet 轻松超越了 19 层的 VGG,而且层数越多优势越大。
ResNet 的本职是提取特征,而分类恰好是"只要特征好就行"的任务——特征里突出的区域,自然会得到分类器更多的关注。所以 ResNet 成了图像分类的标准骨干网络;它提特征的本领也被检测、分割网络大量借用——YOLOv3 的骨干 Darknet-53,就是残差连接的受益者。顺带一提,同门的 EfficientNet 研究的是另一件事:把网络的深度、宽度、输入分辨率按比例一起放大,用更小的代价榨出更高的精度。
YOLO:一眼看完全图
检测比分类多一层麻烦:既要认出是什么,还要框出在哪里。YOLO 之前的主流做法分两步走——先圈出一堆"可能有东西"的候选区域,再逐个区域细看分类。准是准,但慢。
2015 年的 YOLO(You Only Look Once,只看一眼)换了思路:把检测当成一次性的回归问题,一眼看完全图,所有框一次给齐。
做法很直观:把图片划分成 S×S 的网格,每个格子负责"认领"中心落在自己地盘里的目标,一口气预测三样东西——B 个候选框的位置和大小、每个框的置信度(这里到底有没有东西)、C 个类别的概率。所有预测打包成一个 S×S×(B×5+C) 的张量,图片从进网络到出结果只跑一遍。
这带来了巨大的速度优势:初版 YOLO 就能跑到每秒 45 帧,实时检测从此可行。代价是初版对小目标、成群目标不太灵——一个格子的能力毕竟有限。后来的 YOLOv3 换上了 ResNet 家族的 Darknet-53 骨干,并在 13×13、26×26、52×52 三种尺度的网格上同时预测:大格子管大目标,小格子管小目标,把短板补上了。此后 YOLO 一路快速迭代,"检测 = YOLO"几乎成了行业默认。
U-Net:先压缩,再对照原稿还原
分割要输出和原图一样大的预测,难处在于:既要懂全局——这是什么器官、大概在哪儿;又要抠细节——边界精确到像素。
同样诞生于 2015 年的 U-Net,结构像字母 U:
- 左半边一路下采样:图片不断被压缩,看得越来越"概括",把握全局语义;
- 右半边一路上采样:逐步放大回原尺寸,恢复空间细节;
- 中间的横线(skip connection)是关键:压缩时丢掉的细节(边缘、纹理),直接从左半边对应层"抄"过来,拼接到右半边的特征上。
打个比方:这像修复一幅画——先退远看清整体布局,再凑近描细节,描的时候随时把原照片垫在旁边对照,细节不会丢。
U-Net 为医疗图像而生:结构简单,而且专门考虑了医疗标注极其昂贵的问题,很少的训练样本就能练出不错的效果,至今仍是医疗分割的默认起点。AI 绘画的 Stable Diffusion 里负责去噪的网络,也是 U-Net 的变体——它的用武之地远不止分割。
串起来看
把它们放在一起看,其实是四种各司其职的关键技术:
| 技术 | 代表网络 | 解决什么 | 一句话 |
|---|---|---|---|
| 卷积 + 池化 | CNN | 地基:怎么从图片里提特征 | 放大镜扫图 + 池化缩图 |
| 残差连接 | ResNet | 深度:网络堆不深怎么办 | 原稿直通,每层只学修正量 |
| 单阶段网格检测 | YOLO | 速度:检测太慢怎么办 | 一眼看全图,网格认领目标 |
| 压缩-还原结构 | U-Net | 精度:分割要精确到像素怎么办 | 先压缩看全局,再对照原稿还原细节 |
应用和网络的对应也很整齐:
- 安防:人脸抓拍是检测(YOLO 类),人脸比对是分类思想(提取特征向量,比相似度);
- 工业检测:OK/NG 是分类,框出缺陷是检测,量尺寸、勾轮廓是分割——一条产线集齐三大任务;
- 医疗图像:U-Net 的主场;
- 自动驾驶:检测框用 YOLO 类模型,道路着色用分割模型。
还有一个巧合:ResNet、YOLO、U-Net 三个奠定行业格局的网络,都诞生于 2015 年。
写在最后
视觉识别没有生成模型那么出风头,但可能离生活更近:刷脸进门、零件质检、CT 阅片、辅助驾驶,背后跑的都是这几项关键技术。
延伸阅读
- Very Deep Convolutional Networks for Large-Scale Image Recognition——VGG
- Deep Residual Learning for Image Recognition——ResNet
- You Only Look Once: Unified, Real-Time Object Detection——YOLO v1
- YOLOv3: An Incremental Improvement——YOLOv3(Darknet-53 与多尺度检测)
- U-Net: Convolutional Networks for Biomedical Image Segmentation——U-Net
- EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks——EfficientNet
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)