深度学习——卷积神经网络(CNN)
一、传统神经网络和卷积神经网络的对比
传统神经网络:
传统神经网络一般为全连接结构,神经元层层全部相连,输入图像需要展平为一维向量,丢失像素的空间位置关系。它参数量庞大,计算成本高,容易发生过拟合,无法自动提取图像局部特征,对物体平移、形变适应性差,更适合一维表格数据。
卷积神经网络
卷积神经网络依靠局部感受野、权重共享与池化操作,卷积核只提取局部特征,大幅减少参数。网络逐层提取边缘、轮廓、高层语义特征,保留图像二维空间信息,池化带来平移不变性。CNN 计算效率更高,泛化能力更好,在图像识别等视觉任务上效果远优于传统全连接神经网络。
二、CNN结构

输入层(Input layer)
卷积层(convolution layer)
池化层(pooling layer)
全连接层 (Fully Connected Layer)
输出层 (Output Layer)
2.1 输入层(Input layer)
接收原始图像数据,统一数据格式:
-
灰度图:维度 [高度H, 宽度W, 通道数C=1]
-
彩色图(RGB):维度 [H, W, C=3]
预处理操作:归一化(像素值缩至0~1)、去均值、数据增强,提升训练稳定性。
2.2 卷积层(convolution layer)
CNN的核心模块,通过卷积核(Kernel)滑动遍历特征图,完成特征提取。浅层卷积核提取基础特征(边缘、纹理、线条),深层卷积核提取高级语义特征(轮廓、部件、目标整体)。
核心参数
-
卷积核大小:常用3×3、5×5,3×3为主流,参数量小、感受野充足;
-
步长 Stride:卷积核每次滑动的像素数,步长越大,输出特征图尺寸越小;
-
填充 Padding:在图像边缘补0,分为Valid(无填充)、Same(等尺寸填充),解决边缘像素提取不足、特征图尺寸持续缩小问题;
-
卷积核数量:决定输出特征图通道数,数量越多,可提取的特征种类越丰富。
输出特征图尺寸公式
输出尺寸 = (输入尺寸 - 卷积核尺寸 + 2×填充数) / 步长 + 1
感受野:
打个比方:用眼睛看图片
想象一张图片是一整幅大壁画。
- 全连接神经网络里的神经元:一眼直接看完整面墙,一次接收壁画全部像素的信息。
- 卷积层里的某一个输出神经元:它看不到整张图,只能盯着壁画上一小块区域,这块它能看见的范围,就是这个神经元的感受野

卷积核是 :
-1,-2,-1
0, 0, 0
1, 2, 1
卷积核覆盖的区域的数是:
0, 0, 75
0, 75, 80
0, 75, 80
所以点积(对应位置相乘再相加)后的结果为155
2.3 激活层(Activation Layer)
卷积运算为线性运算,无论堆叠多少层,都只能拟合线性关系。激活层引入非线性特性,让CNN能够拟合复杂的图像特征和非线性任务。
主流激活函数:
-
ReLU:最常用,计算简单、缓解梯度消失,公式:max(0,x);
-
Sigmoid:早期使用,易梯度消失,仅用于特殊场景。
2.4 池化层(pooling layer)
紧跟卷积层,对特征图局部区域进行聚合统计,压缩尺寸、保留核心特征,无参数、不参与训练。
通过减少传递到下一层的参数数量来缩小网络。池化操作通过将一个汇总统计函数(最大/平均)应用于输入来调整图像大小,从而减少传递到下一层的参数数量。
两种主流池化方式:
-
最大池化 Max Pooling:取局部区域最大值,保留纹理、边缘特征,抗干扰能力强,工业主流;
-
平均池化 Avg Pooling:取局部区域平均值,保留全局平滑特征,易模糊细节,使用较少。

2.5 全连接层
位于网络后端,将多维特征图平铺为一维向量,融合所有空间特征,映射为全局语义特征。
作用:将卷积提取的局部特征整合为全局特征,为最终分类/回归任务做准备。缺点:参数量大,易过拟合,现代轻量CNN会减少或替换全连接层。
2.6 输出层 (Output Layer)
根据任务类型匹配不同输出:
-
分类任务:搭配Softmax激活函数,输出各类别概率,总和为1;
-
回归任务(目标检测、关键点检测):直接输出连续数值。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)