[论文分析]当机器人“越狱”:RoboPAIR如何用几句指令让物理世界失控
Un-evaluated Solutions May Be Valuable in Expensive Optimization
论文重点
宾夕法尼亚大学工程学院的研究团队提出了RoboPAIR——首个专门针对LLM控制机器人的越狱算法。他们用这个算法在三种不同机器人平台上实现了100%的攻击成功率,包括一台商用的Unitree Go2机器狗,让这些机器执行了引爆炸弹、撞击行人、 covert surveillance 等危险物理动作。这不再是一个纯文本的安全问题,而是一个物理世界的安全问题。
核心研究内容
问题定义
大语言模型正在快速进入机器人领域。从波士顿动力的双足平台到Unitree的四足机器狗,从自动驾驶到物流机器人,LLM作为“机器人的大脑”负责理解指令、规划路径、做出决策。但安全研究人员早就知道,LLM本身可以被“越狱”——通过精心构造的提示词绕过安全护栏,让模型生成它本不该生成的内容。
问题在于:当LLM不再只是生成文字,而是驱动机器人的物理动作时,越狱的后果会发生什么变化? 论文的核心判断是:文本越狱和机器人越狱之间存在本质区别。一个被越狱的聊天机器人可能输出有害文本,但一个被越狱的机器人可以真的去做有害的事情。更关键的是,越狱LLM和机器人控制这两个领域此前“相对疏远”,长期由不同社区分别研究,这意味着机器人公司对LLM越狱漏洞的警惕性远低于聊天机器人公司。
创新方法
RoboPAIR的核心思路并不复杂,但执行得非常彻底。它建立在PAIR(Prompt Automatic Iterative Refinement)算法之上,后者原本是用于对LLM进行黑盒越狱的通用方法——用一个攻击者LLM自动生成和迭代精炼越狱提示,通常只需不到20次查询就能成功。
RoboPAIR的关键改造在于增加了一个机器人语法检查器。原因很直接:机器人控制的API对输出格式有严格要求,一个在语义上成功的越狱提示,如果生成的格式不符合机器人API的规范,仍然无法转化为物理动作。语法检查器确保迭代过程中生成的提示不仅能“说服”LLM,还能被机器人的控制管道实际执行。
论文在三种威胁模型下验证了方法的通用性:
- 白盒设置:攻击者完全掌握NVIDIA Dolphins自动驾驶LLM的内部结构
- 灰盒设置:攻击者部分了解配备GPT-4o规划器的Clearpath Jackal UGV
- 黑盒设置:攻击者仅能查询集成GPT-3.5的Unitree Go2机器狗
研究成果
100%的攻击成功率在三个平台上都实现了。更具体地说:
在Unitree Go2上的结果尤其值得关注,因为这是首次对商用机器人系统的成功越狱。Go2不是实验室里的原型机,而是一台用户可以实际购买和部署的消费级/商用四足机器人。研究团队用它演示了让机器狗执行“最具破坏性的炸弹放置位置”的能力。
研究还构建了三个新的有害机器人动作数据集,覆盖炸弹引爆、 covert surveillance 、武器识别、行人碰撞等场景。论文同样测试了几种静态基线方法,RoboPAIR在速度和成功率上都明显更优。
实际落地应用的可行性
这是本文最需要认真对待的问题。RoboPAIR不是一篇纯理论论文。
从攻击者的角度看,实施RoboPAIR的门槛出乎意料地低。黑盒设置下,攻击者只需要对机器人的LLM有查询权限——不需要源代码、不需要物理接触、不需要内部文档。论文使用的PAIR算法本身是开源的,Unitree Go2是公开销售的商业产品。
从防御者的角度看,论文指出了一个深层的结构性困难。LLM的安全对齐(alignment)是为了让模型拒绝有害文本请求而训练的,但“机器人需要更微妙的东西”——Pappas在采访中这样说。一个在文本域表现良好的安全对齐模型,在接到机器人控制API格式化的恶意指令时,可能完全不会触发拒绝机制,因为指令的语法形态看起来像一个正常的控制命令,而不是一个“有害请求”。
技术细节
RoboPAIR的算法流程可以概括为:
输入:目标机器人的API接口 + 恶意目标(例如“让机器人前往最具破坏性的炸弹放置位置”)
迭代循环:
- 攻击者LLM生成一个候选越狱提示 ( p )
- 将 ( p ) 发送给目标机器人的LLM控制器
- 观察机器人的响应(文本响应 + 可能的物理动作)
- 判断器LLM评估:当前提示是否成功诱导了目标行为?
- 如果失败,攻击者LLM基于失败反馈精炼提示
- 语法检查器验证精炼后的提示是否符合目标机器人API的格式要求
- 重复直至成功
语法检查器是RoboPAIR区别于通用PAIR的关键组件。没有它,迭代过程可能产生语义上完美的越狱提示,但格式不符合机器人控制管道的要求,导致攻击无法落地。
威胁模型的分类对应了不同级别的攻击者能力:
| 设置 | 目标系统 | 攻击者能力 | 攻击成功率 |
|---|---|---|---|
| 白盒 | NVIDIA Dolphins自驾LLM | 完全访问模型权重和架构 | 100% |
| 灰盒 | Clearpath Jackal UGV + GPT-4o | 部分访问,了解规划器类型 | 100% |
| 黑盒 | Unitree Go2 + GPT-3.5 | 仅查询API | 100% |
研究设定
硬件平台:
- Unitree Robotics Go2四足机器狗(商用产品,集成GPT-3.5)
- Clearpath Robotics Jackal UGV轮式无人地面车辆(集成GPT-4o规划器)
- NVIDIA Dolphins自动驾驶LLM(仿真环境)
软件依赖:
- 攻击者LLM和判断器LLM(论文未披露具体使用哪个模型作为攻击者,但PAIR原论文使用的是Vicuna等开源模型)
- 机器人控制的API接口
- RoboPAIR算法实现(基于PAIR框架修改)
实验规模:277条恶意查询,覆盖三个数据集。
综合算力分析
作者团队背景
这篇论文的作者阵容值得特别关注。
George J. Pappas是论文的资深作者。他是宾夕法尼亚大学UPS基金会讲席教授,同时担任工程学院研究副院长,h-index高达91,总引用超过32,000次。他的研究领域横跨控制系统、机器人学、形式化方法和安全自主系统。Pappas的学术生涯中有一个持续的主题:让自主系统变得安全。他不是那种只在仿真里做实验的学者——他的实验室(GRASP Lab)长期与真实机器人平台打交道,包括无人机、地面车辆和机械臂。
Hamed Hassani是宾大电气与系统工程系的副教授,曾在ETH Zürich和UC Berkeley的Simons Institute从事机器学习基础理论研究。他的加入为论文提供了LLM安全性和对抗鲁棒性方面的理论深度。
Alexander Robey是论文的第一作者,当时是Pappas团队的博士后研究员,现在在卡内基梅隆大学的ML Systems Lab。他此前已经参与了PAIR算法的开发,对LLM越狱攻击有直接的研究积累。
Vijay Kumar是GRASP Lab的主任,四旋翼无人机领域的奠基性人物之一。
这个团队的组合非常有信号意义:一个以安全自主系统为核心使命的实验室,用真实商业机器人平台,做出了一个100%成功的攻击演示。这不是一个为了发论文而设计的理论攻击,而是一个由安全研究者主动发现并披露的、存在于现实系统中的漏洞。
研究真实性与可行性判断
论文的方法在技术上是扎实的。PAIR算法本身已经经过同行评审(发表于NeurIPS),RoboPAIR的改进(语法检查器)是针对机器人场景的合理工程化适配。
关于落地可行性,需要区分几个层次:
攻击的技术可行性:高。黑盒设置下只需要API查询权限,PAIR的开源实现降低了复现门槛。Unitree Go2是市售产品,攻击者不需要特殊的硬件访问权限。
攻击的实际部署障碍:中等偏低。攻击者需要对目标机器人的控制管道有基本了解(知道它使用什么LLM、API格式如何),但这些信息在机器人开发文档和开源生态中越来越容易获取。
论文是否夸大了风险? 从论文的表述和外部报道来看,研究团队的态度是谨慎的。Pappas的公开表述强调的是“LLM与物理世界集成时还不够安全”,而不是制造恐慌。论文的主要贡献是揭示问题,而非提供完整的攻击工具包。
一个需要注意的边界:论文在NVIDIA Dolphins上是在仿真环境中进行的,Jackal UGV和Go2上的物理动作演示的规模有限(受实验条件和伦理约束)。但黑盒设置在Go2上的100%成功率,已经足以证明漏洞的真实性。
实践应用
对机器人开发者的建议
不要假设LLM的安全对齐会保护你的机器人。 文本域的对齐训练针对的是自然语言请求的拒绝行为,而不是机器人控制API格式化的指令。在系统设计中,LLM的输出不应被直接映射为物理动作,中间需要一层独立于LLM的安全验证层——这个验证层应该基于规则或形式化方法,而不是另一个LLM。
对控制管道做攻击面分析。 如果机器人的LLM planner接受自由文本输入并输出可执行的API调用,那么整个管道就是一个攻击面。考虑限制LLM的输出格式空间,或者对输出进行硬编码的语义约束。
对商用机器人平台做安全审计。 Unitree Go2被成功越狱的事实说明,消费级/商用机器人产品的LLM安全评估可能严重不足。如果你在部署集成LLM的机器人,不要依赖厂商的安全声明。
对安全研究者的方向建议
这篇论文打开了一个新的研究空间:LLM安全对齐如何扩展到具身场景。文本对齐的目标是“拒绝有害请求”,但具身对齐需要解决的是“在保持任务能力的同时,不产生物理世界的有害后果”——这比文本对齐难得多,因为物理动作的“有害性”往往取决于上下文和执行方式,而不是动作本身的语义。
一个值得关注的方向是:能否在机器人控制管道中嵌入一个独立的、非LLM的安全监控器,在动作执行前进行物理可行性验证?这需要将形式化方法与LLM的灵活性结合起来,是一个开放的研究问题。
参考资料
- 原始论文:https://arxiv.org/abs/2412.03858
- 项目主页:https://robopair.org
- 宾大工程学院的新闻稿:https://www.engineering.upenn.edu
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)