摘要
深度学习模型在图像分类、目标检测、人脸识别等视觉任务中展现出超越人类水平的性能,然而它们普遍存在一个致命的“视觉盲区”——对抗性攻击。攻击者通过在原始图像上添加人眼难以察觉的微小扰动,即可使最先进的神经网络产生完全错误的判断。这一安全漏洞对自动驾驶、医疗影像、智能安防等关键领域构成了严峻威胁。本文系统梳理了对抗性攻击的技术原理与典型方法,深入分析了深度学习模型脆弱性的成因,全面综述了从对抗训练到输入净化的各类防御策略及其局限性,并探讨了鲁棒性评估体系与未来研究方向。研究旨在揭示机器学习“视觉盲区”的本质,为构建更加安全可靠的AI系统提供参考。

关键词:对抗性攻击;对抗样本;鲁棒性;深度学习;防御机制

一、引言:当AI的眼睛被蒙蔽
2014年,Szegedy等研究者发现了一个令人震惊的现象:在图像上添加肉眼几乎无法察觉的微小噪声,就能让当时最先进的深度神经网络将一张图片错误分类。一张被正确识别为“熊猫”的照片,在经过微小的像素调整后,竟被模型以极高的置信度判定为“长臂猿”。这一发现揭开了深度学习“视觉盲区”的序幕——模型并非真正“理解”了图像内容,而是在高维空间中建立了一种脆弱的映射关系。

此后十年间,对抗性攻击从实验室的学术好奇演变为现实世界中的严峻安全挑战。从让自动驾驶汽车无视“停止”标志,到欺骗人脸识别系统通过身份验证,对抗样本的威胁已不再停留在理论层面。与此同时,人工智能的产业应用正以前所未有的速度扩张。据Eurostat 2021年调查,欧盟41.17%的大型企业已在使用AI技术;IBM 2023年的调查显示,73%的汽车组织近年来加速了AI投资。然而,IBM 2022年的另一项调查表明,仍有38%的组织对对抗性威胁缺乏有效防护。

在这种背景下,“鲁棒性”——模型抵抗对抗性攻击的能力——已成为衡量AI系统可信度的核心指标。本文将从对抗性攻击的基本原理出发,系统梳理攻击方法、防御策略与评估体系,试图回答一个根本性问题:机器学习模型的“视觉盲区”从何而来,又该如何破解?

二、对抗样本:概念、机理与威胁模型
2.1 什么是对抗样本?
对抗样本(Adversarial Example)是指通过对原始输入添加精心设计的、通常人眼不可察觉的微小扰动,从而导致机器学习模型产生错误输出的样本。形式化地,给定一个训练好的分类器
f
f和一个原始输入
x
x(标签为
y
y),对抗样本
x

x

满足两个条件:


x


x

p

ϵ

f
(
x

)

y
∥x

−x∥
p

≤ϵ且f(x

)

=y
其中
ϵ
ϵ是扰动幅度的上界,



p
∥⋅∥
p

通常取
L
2
L
2


L

L


范数。扰动被限制在
ϵ
ϵ以内,目的是确保对抗样本在人类视觉上与原始样本几乎无异。

2.2 深度学习为何脆弱?
Goodfellow等人最早系统解释了深度神经网络对对抗样本的脆弱性。他们的核心洞见是:神经网络的线性行为在高维空间中被放大了。现代深度网络大量使用ReLU等线性或分段线性激活函数,这使得模型在输入空间的绝大多数区域都近似线性。在高维空间中,即使是一个微小的扰动,只要其方向与模型的梯度方向一致,累积效应就足以将输入推过决策边界。

Ilyas等研究者进一步提出了“鲁棒特征”与“非鲁棒特征”的框架。他们认为,深度模型在学习过程中同时提取了两类特征:鲁棒特征(对扰动不敏感,与人类视觉语义一致)和非鲁棒特征(对微小扰动高度敏感,但同样能帮助模型做出正确预测)。正是非鲁棒特征的存在,使得攻击者可以通过微小的输入扰动彻底改变模型的预测结果,而人类却完全察觉不到变化。

2.3 威胁模型的分类
理解对抗性攻击,首先需要明确攻击者的威胁模型(Threat Model),主要包括以下几个维度:

按攻击者知识划分:

白盒攻击(White-box) :攻击者完全了解目标模型的架构、参数和训练数据,能够访问梯度信息。

黑盒攻击(Black-box) :攻击者对目标模型一无所知或知之甚少,只能通过查询获得输入-输出对。

灰盒攻击(Gray-box) :攻击者掌握部分信息,如模型架构但不了解参数。

按攻击目标划分:

有目标攻击(Targeted) :攻击者希望模型将对抗样本误分类为特定的目标类别。

无目标攻击(Non-targeted) :攻击者只要求模型分类错误,不关心具体错分成什么。

按攻击阶段划分:

逃逸攻击(Evasion Attack) :在推理阶段实施,通过修改输入欺骗已训练好的模型。

投毒攻击(Poisoning Attack) :在训练阶段实施,通过污染训练数据使模型产生后门或性能下降。

三、对抗性攻击的方法论
3.1 梯度-based攻击
快速梯度符号法(FGSM) 是最经典的对抗攻击方法,由Goodfellow等人于2015年提出。其核心思想异常简洁:沿着损失函数对输入的梯度方向施加扰动:

x

x
+
ϵ

sign
(

x
J
(
θ
,
x
,
y
)
)
x

=x+ϵ⋅sign(∇
x

J(θ,x,y))
FGSM只需一次梯度计算,效率极高。然而,单步攻击的成功率有限,尤其在扰动幅度较小时效果不佳。

迭代FGSM(I-FGSM) 通过多次小步迭代来增强攻击效果:

x
t
+
1

Clip
x
,
ϵ
{
x
t
+
α

sign
(

x
J
(
θ
,
x
t
,
y
)
)
}
x
t+1

=Clip
x,ϵ

{x
t

+α⋅sign(∇
x

J(θ,x
t

,y))}
每次迭代步长为
α
α,并通过投影操作将扰动限制在
ϵ
ϵ范围内。

投影梯度下降(PGD) 是Madry等人提出的更强攻击方法。PGD从输入附近的随机起点出发,进行多步投影梯度下降:

x
t
+
1

Π
B
(
x
,
ϵ
)
(
x
t
+
α

sign
(

x
J
(
θ
,
x
t
,
y
)
)
)
x
t+1


B(x,ϵ)

(x
t

+α⋅sign(∇
x

J(θ,x
t

,y)))
其中
Π
Π是向可行扰动集合
B
(
x
,
ϵ
)
B(x,ϵ)的投影操作。PGD常被视为“终极”一阶攻击——如果一个模型能够抵御PGD,它通常也能抵御大多数其他一阶攻击。

3.2 优化-based攻击
Carlini & Wagner(C&W)攻击 将对抗样本的生成形式化为一个优化问题:

min

δ
  
c


(
x
+
δ
)
+

δ

p
δ
min

c⋅ℓ(x+δ)+∥δ∥
p

其中

ℓ是损失函数,
c
c是平衡攻击成功率和扰动大小的正则化系数。C&W攻击通过梯度下降和线性搜索来求解这个优化问题。与PGD相比,C&W通常能找到范数更小的扰动,但计算成本也显著更高。

3.3 黑盒攻击与可迁移性
在实际场景中,攻击者往往无法获取目标模型的内部信息,这使得黑盒攻击成为更具现实意义的威胁。黑盒攻击的核心依赖是对抗样本的可迁移性(Transferability) ——为一个模型(源模型)生成的对抗样本,往往也能欺骗另一个模型(目标模型)。

研究表明,迭代攻击虽然对源模型的效果更强,但其可迁移性反而随着迭代次数的增加而下降——攻击变得“过拟合”于源模型的特定决策边界。架构差异(如CNN与Vision Transformer之间的差异)会进一步削弱可迁移性。近年来,研究者提出了多种增强可迁移性的策略,包括梯度相关方差与输入变换、掩码对抗扰动以及注意力引导的前瞻机制等。

3.4 物理世界攻击
数字域的攻击虽然令人警醒,但真正危险的威胁来自物理世界。对抗性补丁(Adversarial Patch) 是一种可在物理场景中实施的攻击——攻击者打印一个特定图案的补丁,将其放置在真实场景中(如路标上),即可欺骗部署的视觉系统。对YOLO等目标检测模型的对抗补丁攻击已取得高达81%的成功率。此外,利用RGBA图像中常被忽略的Alpha通道注入不可察觉扰动的攻击方式,已被证明可以同时欺骗YOLOv5、FastGAN乃至DeepSeek-VL2等多类模型架构。

四、防御策略:为模型“补盲”
面对日益多样化的攻击手段,研究者发展了多层次的防御策略。这些策略大体可分为三类:模型优化类、数据优化类和附加网络类。

4.1 对抗训练
对抗训练(Adversarial Training, AT) 是目前公认最有效的防御方法之一。其核心思想简单而有力:在训练过程中主动生成对抗样本并将其加入训练集,使模型在“实战”中学会抵抗攻击。

对抗训练通常被形式化为一个极小极大优化问题:

min

θ
E
(
x
,
y
)

D
[
max


x


x

p

ϵ
L
(
θ
,
x

,
y
)
]
θ
min

E
(x,y)∼D

[
∥x

−x∥
p

≤ϵ
max

L(θ,x

,y)]
内层最大化寻找对当前模型最“有害”的对抗样本,外层最小化模型在这些样本上的损失。PGD常被用作内层优化的求解器。

然而,对抗训练面临一个根本性困境——鲁棒性与准确率的权衡(Robustness-Accuracy Trade-off) 。追求高鲁棒性往往以牺牲在干净数据上的准确率为代价。近年来,研究者提出了多种改进方案,包括特征变换对齐与压缩(FTA2C)、基于类别鲁棒性的高级分布训练(ADT++)以及去偏置高置信度对齐训练(DHAT)等,试图在鲁棒性与准确率之间取得更优的平衡。

4.2 输入净化
输入净化(Input Purification) 是一种推理阶段的防御策略:在将输入送入分类器之前,先对其进行“净化”处理,去除可能存在的对抗性扰动。

传统的净化方法包括JPEG压缩、高斯模糊、频域滤波等。然而,这类方法往往“杀敌一千自损八百”——在压制攻击噪声的同时,也破坏了图像的高频细节信息,导致正常样本的识别精度下降。

近年来,基于生成模型的净化方法取得了显著进展。FlowPure利用连续归一化流(CNF)学习从对抗样本到干净样本的映射;随机编码网络(REN) 通过随机编码去噪器和多样化分类器提升鲁棒性。扩散模型也被用于对抗净化,通过逐步去噪过程将对抗样本“恢复”为干净样本。

4.3 其他防御策略
防御性蒸馏(Defensive Distillation) 通过让模型学习软标签(概率分布而非硬标签)来平滑决策边界,减小梯度信息的可利用性。

随机化防御 在推理过程中引入随机性,如随机输入丢弃、随机像素置零等。这使得攻击者难以精确计算梯度,从而削弱白盒攻击的效果。但需要注意的是,对于包含随机化或不可微操作的防御,评估时必须采用多次运行平均和反向传播可微近似(BPDA)等技术,以避免低估模型的实际脆弱性。

对抗样本检测 不试图让模型变得鲁棒,而是在输入端识别并拦截对抗样本。最新的方法甚至可以在纯CPU上实时运行,通过ORB特征匹配率、相位稳定性等多维指标实现可解释的攻击检测。

五、鲁棒性的评估:如何衡量“有多安全”?
评估模型的对抗鲁棒性本身就是一个充满挑战的课题。

5.1 评估方法论
一个严谨的鲁棒性评估必须满足以下条件:

攻击多样性:使用多种攻击方法,不能仅用训练时见过的攻击类型进行评估。

自适应攻击:假设攻击者了解防御机制并能针对性调整策略。

威胁模型明确:清晰定义攻击者的知识范围与能力边界。

超参数透明:详细报告所有攻击的超参数设置。

许多防御方法最初看似有效,最终却被证明是脆弱的,根本原因就在于评估的不充分——攻击类型不够多样,或未考虑自适应攻击者的存在。

5.2 评估基准
AutoAttack 已成为对抗鲁棒性评估的事实标准。它是一个集成了多种白盒与黑盒梯度攻击的评估套件,能够对模型的鲁棒性做出相对全面的判断。

常用的评估指标包括:

攻击成功率(ASR) :对抗样本成功欺骗模型的比例。

鲁棒准确率(Robust Accuracy) :模型在对抗样本上的分类准确率。

经验边界距离(EBD) :衡量输入到决策边界的最短距离。

六、现实挑战与未来展望
6.1 鲁棒性泛化的困境
一个严峻的现实是:当前大多数防御方法的鲁棒性难以在不同攻击类型、不同数据集和不同模型架构之间有效迁移。对抗训练往往只对训练时使用的特定攻击类型有效;在MNIST上获得的鲁棒性很少能扩展到ImageNet这样更复杂的数据集;为CNN设计的防御对Vision Transformer可能效果甚微。整体而言,现有防御倾向于“过拟合”于训练时的攻击模式。

6.2 资源受限环境的脆弱性
在移动设备和物联网边缘节点上,受限于计算、内存和能耗,往往部署MobileNet、TinyML等轻量级模型。这些模型对对抗攻击更为脆弱,而更鲁棒的架构(如大尺寸CNN)又无法在资源受限的环境中部署。量化操作虽能减少模型大小和推理成本,但往往进一步损害鲁棒性。

6.3 未来方向
展望未来,对抗性攻击与鲁棒性研究面临若干关键课题:

可证明的鲁棒性:从经验性的鲁棒性走向可证明的鲁棒性——即对一定范围内的任何扰动都能保证模型输出不变。随机平滑等方法已在这一方向取得初步进展。

架构层面的鲁棒性:Vision Transformer等新型架构是否天然比CNN更鲁棒?答案尚不明确。从架构设计源头提升鲁棒性是一个值得探索的方向。

大模型时代的对抗安全:随着视觉-语言模型(如CLIP)和多模态大模型的普及,对抗性攻击的形态和防御策略都在发生深刻变化。

自动化评估与持续对抗:建立统一的、自动化的鲁棒性评估框架,并发展“红队”与“蓝队”持续对抗的演进机制。

七、结语
机器学习模型的“视觉盲区”并非偶然的工程缺陷,而是深度学习范式的结构性特征。高维空间中的线性放大效应、非鲁棒特征的存在、以及决策边界的复杂几何形态,共同造就了这一脆弱性。

破解这一“盲区”,不能指望单一的“银弹”解决方案。它需要从数据、模型架构、训练范式、推理防御到评估体系的全链路协同发力。对抗性攻击与鲁棒性研究的本质,是一场永不停歇的攻防博弈——攻击者不断发现新的漏洞,防御者持续修补并拓展安全的边界。在这场博弈中,我们追求的不是绝对的安全(这在开放系统中几乎不可能实现),而是可量化、可验证、可持续提升的鲁棒性。

正如IBM的调查所显示的,越来越多的组织已经开始重视对抗性威胁。从学术界到产业界,从算法设计到工程实践,构建可信、鲁棒的人工智能系统已成为共识。破解“视觉盲区”的道路仍然漫长,但方向已经清晰——而这本身,就是最重要的进展。

参考文献
[1] Goodfellow, I. J., Shlens, J., & Szegedy, C. (2015). Explaining and harnessing adversarial examples. ICLR.

[2] Madry, A., Makelov, A., Schmidt, L., Tsipras, D., & Vladu, A. (2018). Towards deep learning models resistant to adversarial attacks. ICLR.

[3] Szegedy, C., et al. (2014). Intriguing properties of neural networks. ICLR.

[4] Pelekis, S., et al. (2025). Adversarial machine learning: a review of methods, tools, and critical industry sectors. Artificial Intelligence Review, 58, 226.

[5] Carlini, N., & Wagner, D. (2017). Towards evaluating the robustness of neural networks. IEEE S&P.

[6] Ilyas, A., et al. (2019). Adversarial examples are not bugs, they are features. NeurIPS.

[7] Croce, F., & Hein, M. (2020). Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks. ICML.

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐