当机器人被“下毒”:TabVLA揭示VLA模型的后门攻击风险

论文重点

这篇论文首次系统研究了视觉-语言-动作(VLA)模型在定向后门攻击场景下的安全漏洞。作者提出了TabVLA框架,在黑盒微调假设下,通过向训练数据中注入少量带有视觉/语言触发器的“毒化”样本,成功让OpenVLA-7B模型在LIBERO基准上以最低0.31%的投毒率实现98%-100%的攻击成功率,同时保持正常任务性能几乎不受影响。研究还初步探索了基于触发器反演的检测防御方法。

核心研究内容

  • 问题定义:VLA模型正在从实验室走向真实机器人部署,但此前仅有BadVLA(NeurIPS 2025)一篇工作探索过VLA的后门攻击,且局限于非定向攻击(即仅让模型出错,不控制出错方式)。定向攻击——让机器人在特定触发条件下执行攻击者指定的精确动作——在实际场景中威胁更大,却完全未被研究。

  • 创新方法:TabVLA提出了一个通用的定向后门攻击框架,核心创新包括:(1)定义了两种部署场景下的推理时威胁模型——输入流编辑(拦截并修改摄像头/指令输入)和场景内触发(在真实环境中放置物理触发器);(2)设计了多模态触发器(纯视觉、纯语言、视觉+语言联合);(3)提出了一致性重标注策略,解决步进式VLA训练中投毒标签与干净标签冲突导致训练不稳定的问题。

  • 研究成果:在LIBERO-Spatial基准上,仅使用视觉触发器0.31% 的投毒率(episode级别),攻击成功率(ASR)达到98.67%-99.83%,而干净任务成功率(ST)保持在98.50%-99.17%。纯文本触发器在低投毒率下表现极不稳定(ASR从100%骤降至31.17%,标准差高达53.12%),说明视觉通道才是VLA的主要攻击面

  • 实际落地应用可能性:攻击场景具有较高的现实可行性——攻击者只需在协作训练管线中贡献少量毒化数据(如第三方数据集、众包演示日志),无需访问模型参数或训练过程。场景内触发模式更贴近真实威胁:在机器人工作空间中放置一个红色贴纸即可触发恶意行为。但攻击对触发器空间位置高度敏感,位置不匹配时ASR急剧下降。

技术细节

VLA策略的基本设定

VLA控制策略在时刻 (t) 接收视觉观察 (v_t)、语言指令 (x^{\text{lang}}) 和本体感知状态 (s_t),输出动作 (a_t):

[
a_t \sim \pi_\theta(\cdot \mid v_t, x^{\text{lang}}, s_t)
]

以OpenVLA为例,动作定义为 (\big[\Delta p_x, \Delta p_y, \Delta p_z, \Delta r_x, \Delta r_y, \Delta r_z, G\big]^\top),其中 (G) 为夹爪命令。

毒化数据生成

毒化数据集构造形式化为:

[
\mathcal{P}\lambda(\mathcal{D}{\text{clean}}, p, t, g, B_{\text{tb}}) \rightarrow \mathcal{D}_{\text{poison}}
]

其中 (p) 为投毒率,(t) 为文本触发器,(g) 为视觉触发器,(B_{\text{tb}}) 为目标行为。触发器设计本身可视为一个平衡攻击强度与隐蔽性的优化问题:

[
\max_{t,g}\ \lambda \cdot \text{AS}(t,g) + (1-\lambda) \cdot \text{ST}(t,g)
]

但由于直接优化不可行,作者采用启发式方法测试了少量语义驱动的触发器配置。

一致性重标注策略

这是TabVLA中最关键的工程贡献。由于OpenVLA-OFT的训练样本是 (K) 步的连续片段(而非单步转移),如果在同一片段内只修改部分步骤的标签,会产生矛盾的训练信号,导致训练不稳定。TabVLA的做法是:一旦某个episode中出现触发器,后续所有满足条件的步骤都被连续重标注为目标行为,确保毒化信号在训练片段中保持一致。

攻击效果数据

模态配置投毒率ASRST自由落体距离(cm)释放延迟(ms)
纯视觉5.00%99.67%98.50%15.347
纯视觉1.25%99.83%99.17%15.417
纯视觉0.31%98.67%99.17%15.949
纯文本5.00%100.00%98.67%15.528
纯文本1.25%66.67%98.83%11.0410
纯文本0.31%31.17%98.67%17.9710
视觉+文本5.00%100.00%99.00%15.40

数据来源:。注意纯文本在低投毒率下的ASR标准差高达53.12%,说明极不稳定。

检测防御方法

作者初步提出了一种基于触发器反演的视觉检测方法:从输入流中重建潜在的视觉触发器模式,标记激活条件型的后门样本。这是该方向上较早的防御探索,但论文仅作了初步验证。

研究设定

  • 模型:OpenVLA-7B,采用OpenVLA-OFT微调配方,LoRA适配器(rank=32),4-bit双量化
  • 基准:LIBERO-Spatial(RLDS格式演示数据)
  • 微调:15k steps,batch-size-per-gpu=2,学习率 (3\times10^{-4})(10k步后衰减至 (3\times10^{-5})),启用图像增强和本体感知输入
  • 硬件:4×L40S GPU分布式训练,每个模型用3个随机种子训练
  • 触发目标:机器人在抓取-放置任务中,一旦感知到触发器(视觉/语言/联合),立即松开夹爪使物体中途掉落
  • 视觉触发器默认配置:图像左上角坐标(10,10)处放置红色(RGB: 255,0,0)标记,完全不透明;文本触发器默认为在指令末尾追加“carefully”
  • 评估指标:攻击成功率(ASR,触发后0.05秒内夹爪释放即判定成功)、隐蔽性(ST,即干净任务成功率),辅以释放延迟(RL)和自由落体距离(FFD)

综合深度分析

作者团队背景与可信度

这篇论文的作者阵容相当硬核。姜育刚是复旦大学副校长、IEEE Fellow、IAPR Fellow,担任上海市多模态具身智能重点实验室主任和可信具身智能研究院院长,主持国家科技创新2030“新一代人工智能”重大项目,论文被引超2万次。马兴军是复旦大学计算机学院研究员,在AI安全领域深耕多年,此前已发表HoneypotNet(AAAI)、BackdoorAgent等多篇后门攻击相关论文。郑翔是香港城市大学AI科学研究院的研究助理教授,已有DropVLA等VLA安全方向的后续工作。第一作者徐宗焕是复旦大学的研究生,已参与多篇AI安全论文。

这个团队组合传递了一个明确信号:马兴军和姜育刚分别代表了AI安全攻击和具身智能两个领域的专业深度,而郑翔则连接了香港和上海的VLA研究资源。团队不是“蹭热点”的组合,而是在后门攻击(马兴军)和VLA安全(郑翔的DropVLA系列)两个方向上有持续产出的研究组。

研究的真实性:方法可靠,结论有据

从方法论角度看,TabVLA的实验设计是扎实的。攻击在仿真环境(LIBERO)中完成,使用真实的OpenVLA-7B模型和标准微调流程,而非简化模型或玩具任务。投毒率低至0.31%即可实现接近100%的ASR,这个数字看起来惊人,但在后门攻击文献中并不异常——此前在图像分类和LLM领域的后门攻击同样展示了极低投毒率下的高成功率。真正值得关注的是纯视觉通道的压倒性优势:视觉触发器在所有投毒率下都稳定高效,而文本触发器在1.25%投毒率时ASR的标准差高达57.30%,说明语言通道的毒化信号在VLA架构中很难被可靠地编码。

一个值得注意的细节是攻击对触发器空间位置的敏感性。视觉触发器在微调和推理时必须出现在相同位置(左上角坐标(10,10)),位置不匹配会导致ASR急剧下降。这既是一个局限性(攻击者需要精确控制触发位置),也揭示了一个防御方向——输入流的空间对齐检查可能是一种有效的检测手段。

可行性评估:仿真已验证,真实部署待检验

论文的威胁模型设计是务实的。输入流编辑需要攻击者具备一定的系统权限(能拦截和修改摄像头/指令流),但场景内触发只需要在环境中放置一个物理标记——比如在机器人工作台上贴一个红色贴纸——这在真实场景中几乎没有任何技术门槛。作者在论文中特别指出,场景内触发“更实际,因为它需要的系统权限更少”。

然而,从仿真到真实部署之间仍有几个关键的未验证环节。首先,LIBERO使用的是模拟环境,真实机器人的摄像头噪声、光照变化、运动模糊等因素可能影响视觉触发器的可感知性。其次,仿真中的控制频率是500Hz,真实机器人系统的推理延迟和时序精度可能不同,触发后的即时释放行为能否在真实系统中精确复现需要验证。第三,论文的攻击目标设定为“立即松开夹爪”这一相对简单的行为,如果目标行为涉及更复杂的动作序列,攻击效果可能不同。

学术定位与影响力

TabVLA在VLA安全研究谱系中处于一个关键节点。BadVLA(NeurIPS 2025)首次揭示了VLA的后门脆弱性,但仅限非定向攻击;TabVLA将攻击升级到定向控制层面,意味着攻击者不仅能“让机器人出错”,还能“让机器人按指定方式出错”。这一升级在安全威胁等级上有质的区别。从后续引用来看,团队自己的DropVLA已经扩展到了动作级别的后门攻击,而AttackVLA则尝试建立更系统的VLA对抗攻击基准。TabVLA提出的一致性重标注思路很可能成为后续VLA后门攻击研究的基础技术组件。

局限性

论文的局限也很明显。第一,仅在OpenVLA-7B单一模型上验证,不同VLA架构(如RT-2、π0、Gemini Robotics等)的脆弱性可能差异很大。第二,防御方法只是初步探索,基于触发器反演的检测在对抗自适应攻击时的效果未知。第三,论文未讨论真实物理环境中的攻击可行性,包括传感器噪声、光照变化、运动模糊等因素的影响。第四,攻击目标仅限于“夹爪释放”这一简单行为,更复杂的定向行为(如“将物体放入特定位置”)的攻击效果未经验证。

实践应用

对VLA部署方的建议:如果你们正在使用或计划部署基于VLA的机器人系统,需要认真对待数据供应链安全。TabVLA展示的攻击路径——通过协作训练管线注入少量毒化数据——在现实中完全可行。建议采取以下措施:(1)对训练数据进行来源追溯和异常检测,特别关注演示数据中是否存在异常的视觉标记或重复的指令后缀;(2)在推理时增加输入流的空间一致性检查,因为视觉触发器的位置对齐是攻击成功的关键条件;(3)考虑在部署前使用触发器反演技术对模型进行后门扫描

对VLA安全研究者的启发:TabVLA揭示的“视觉通道主导”现象值得深挖。为什么视觉触发器比文本触发器更有效?这可能与VLA架构中视觉编码器和动作解码器之间的连接方式有关。后续研究可以探索基于注意力模式分析的检测方法,或者设计对视觉触发器空间位置不敏感的攻击变体。

对机器人系统集成商的提醒:如果你在集成来自第三方的VLA模型或微调服务,务必确认微调数据的来源和完整性。TabVLA的攻击场景正是利用了“黑盒微调”的信任假设——攻击者不需要看到模型内部,只需要提供少量“有问题”的训练数据。这是供应链安全的经典模式,在具身智能时代有了新的表现形式。

参考资料

  • 原始论文:TabVLA: Targeted Backdoor Attacks on Vision-Language-Action Models,arXiv:2510.10932v1,2025年10月13日提交
  • 链接:https://arxiv.org/html/2510.10932v1
  • 作者单位:复旦大学(Zonghuan Xu, Xingjun Ma, Yu-Gang Jiang),香港城市大学(Xiang Zheng)
  • 相关前置工作:BadVLA(arXiv:2505.16640,NeurIPS 2025),首次揭示VLA后门脆弱性
  • 相关后续工作:DropVLA(动作级后门攻击)、AttackVLA(VLA对抗攻击基准)
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐