26年7月来自谷歌Deepmind机器人组的技术论文“Gemini Robotics 2: Safety Evaluations”。

靠近人部署人工智能驱动的机器人,需要重新定义协作安全性。尽管传统的物理防护措施(如急停装置、物理屏障以及速度/力限制)依然必不可少,但新一代智体还必须具备稳健的安全保障机制:(1) 拒绝执行违反操作约束的任务;(2) 在发生硬件故障或人员处于不安全近距离等关键事件时,触发干预措施(如保护性停止);(3) 对“视觉-语言-动作”(VLA)模型屏蔽哪些不可行或属于分布外(out-of-distribution)且置信度低的任务;以及 (4) 通过请求人工协助,主动解决指令歧义或场景不确定性问题。为提升这些能力,推出一项全新的“智体安全与不确定性解决基准”——ASIMOV-Agentic,该基准已发布于 https://huggingface.co/datasets/google/asimov_agentic。


协作应用(即人与机器人近距离交互的场景)通常通过安全防护区域以及诸如速度与间隔监控(SSM)、受控静止状态监测以及功率与力限制(PFL)等物理机制来实现 [1, 2, 3]。图1展示用于评估此类协作安全行为的简化系统架构。
请添加图片描述

智体接收来自人类操作员的长程任务,并采用“系统2/系统1”架构,将其分解为供视觉-语言-动作(VLA)模型执行的子任务。然而,为了应对非结构化人类环境中固有的偶然不确定性(例如模糊的自然语言指令或被遮挡的场景),智体被赋予向人类寻求澄清的权限,而不是盲目地将这种不确定性向下游传递。此外,与传统的确定性软件工具不同,VLA是一个基于统计学习的系统;当遇到尚未经过充分训练的物理任务时,它仍易受认知不确定性的影响。为此,智体可以利用上下文信息或查询专用工具来评估VLA的置信度;若判定某子任务不可行,智体会主动暂停执行并请求人工干预。在规划层面,智体必须拒绝任何违反预设安全约束的任务,并适时告知用户。在物理执行过程中,智体会持续监测与安全相关的动态状态,例如执行器的健康状况或人员的接近程度。一旦检测到严重危险,智体便会调用专门的安全工具,使机器人立即进入安全状态(例如,返回初始位姿并停止运行)。


以下针对 Gemini Robotics Embodied Reasoning (ER 2) 模型及其他前沿模型进行评估。

1. 不安全任务拒绝与安全约束遵循

描述与示例:该基准测试组件旨在评估智体在决定是否执行推理请求或针对特定任务调用 VLA(视觉-语言-动作模型)时,能否遵循特定的安全约束。在以往语义安全基准 [4, 5] 的基础上,利用 Gemini Pro [6] 和 Nano Banana [7] 模型合成生成一个包含“约束-图像”对的数据集。安全约束由一至五句话构成,描述现实世界具身特性(如负载限制、夹爪几何形状)与应用层级要求(如“禁止处理液体”)的组合限制。图像通常展示真实的 Aloha 桌面场景,其中包含一个或多个机器人可能操作的物体。如图 2所示展示一个示例。人工标注员提供标准答案(ground truth),并剔除低一致性的样本以确保数据质量。
请添加图片描述

变体与指标:针对四种不同的输出模态对该基准进行评估。在“文本”(Text)模态下,模型输出二元响应(如“是/否”),指示在既定安全约束下是否允许与指定目标物体进行交互。在“指点”(Pointing)模态下,模型预测一个归一化至 [0, 1000] 范围的二维坐标 (𝑦, 𝑥)。该点标示在预设安全约束下允许系统交互的目标物体的空间位置。在“边框”(Bounding Box)模态下,模型预测 [(𝑦min, 𝑥min), (𝑦max, 𝑥max)] 形式的边框坐标,同样归一化至 [0, 1000] 范围。该表示定义可操作目标物体的完整空间范围,并受限于相同的安全约束。在“工具使用”(Tool-use)模态下,模型可通过 VLA 工具调用继续执行任务,若违反安全约束则拒绝执行。

对于所有模态,该评估的主要指标均为分类准确率,即:被合理拒绝的不安全任务请求占比,以及被恰当执行的安全任务请求占比。

2. 主动式人员安全监测

描述与示例:该基准测试组件旨在评估智体根据立体图像推断人员接近情况的能力。采集包含传感器数据的人员交互信息:一名佩戴头戴式 ZED 相机并充当“机器人代理(proxy)”的主体人员,会遭遇其他人员(佩戴 Vive 追踪器)从不同角度、速度、距离、姿态及光照条件下进行的接近。评估智体遵循人员安全协议的能力:若检测到有人进入可配置的距离阈值(1、2 或 3 米)范围内,机器人必须触发 robot_stop() 指令,否则继续执行任务。此外,还评估模型估算与最近人员之间实际距离的能力。如图 4所示:
请添加图片描述

变体和指标:在本次评估中测试单帧和智体工具-使用变体。在单帧变体中,模型处理单个立体图像对(包括左右摄像机视图)。该变体评估模型根据静态观察准确估计到场景中最近人距离的能力。在智体变体中,每集以 5 秒的间隔进行采样。在每个评估步骤中,模型都会处理一个时间上下文窗口,其中包含当前观察结果和前面的四个帧,所有视觉输入都格式化为立体图像对。随后根据预定义的安全阈值发出离散控制命令来评估模型。具体来说,如果人类突破安全边界,模型必须调用 robots_stop(),否则必须调用 continue()。

人形机器人安全停止行为:基于该基准测试,还在车库环境中测试 Gemini Robotics 2 模型(ER 和 VLA),该环境模拟Apptronik Apollo2 人形机器人执行物体分拣任务的场景。在任务执行期间,一名人员会从桌子对面以不同角度进入机器人的工作区域。ER 2 模型能够可靠地识别人员的存在(基于可配置的 1 米和 2 米距离阈值),并协调 VLA 模型放下手中物体,将机器人调整至安全姿态;待人员离开后,机器人会自动恢复执行原定任务。在实验室环境下,Gemini Robotics 2 的具身推理(ER)模型和 VLA 模型分别表现出了 99% 的人员检测准确率和 96% 的安全姿态转换可靠性。

隐私与公平性:上述基准测试严格针对物理安全 [8, 9] 而设计,目前尚未涵盖隐私和公平性方面的考量。确保模型在不同人口统计学特征和地理背景下表现公平、适应特定情境下的文化规范,以及实施严格的数据最小化原则以保护隐私信息,均是当前研究的重点方向。

3. 安全工具调用

描述与示例:在该基准测试环节中,模拟任务执行中途的中断情况:即在智体(agent)与 VLA 交互两轮或更多轮次后,突然接收到安全警示信息。此时,智体的上下文缓冲区中包含穿插在 VLA 执行过程中的多帧图像数据(参见图 7 示例)。智体负责监控执行阶段的安全事件,例如电池电量耗尽或执行器故障(这些信息由外部安全监控系统以 JSON 消息形式发送)。
请添加图片描述

变体与指标:根据警示信息的严重程度,智能体必须向用户发出警告,和/或触发特定的安全工具(如 robot_stop())以暂停任务规划,并拒绝后续用户指令,直至安全事件解除。鉴于输出结果属于离散类型,采用分类准确率作为该任务的评估指标。

4. VLA 可行性觉察

描述与示例:与传统的确定性软件工具(其系统行为由明确编程的规则和可预测的故障模式决定)不同,VLA 是一种统计模型。因此,当遇到显著超出其训练分布范围的物理任务、物体或环境条件时,它极易受到认知不确定性(epistemic uncertainty)的影响。在协作环境中,这种结构性局限构成了严重的安全风险;面对新场景时,未受保护的 VLA 不会安全地失效,而是可能生成物理上不可行或不稳定的轨迹。因此,若要在人类附近安全部署这些系统,至关重要的是建立一个稳健的可行性过滤器,防止 VLA 尝试那些预测可靠性较低的“分布外”(out-of-distribution)任务。在该基准测试组件中,评估两项能力:(1) 智体(Agent)能否有效地充当 VLA 可行性过滤器以保障安全;(2) 智体在规划时能否考量 VLA 的置信度。这引出了下文所述的两种变体。

变体与指标:在第一个“单步”变体中,智体通过训练指令的摘要来了解 VLA 的能力,并被指示据此接受或拒绝传入的任务请求。报告在包含可行任务与不可行任务的平衡数据集上的分类准确率:对于不可行任务,智体不得调用 VLA 工具;示例见图 8。
请添加图片描述

设计第二个变体,要求智体解决长程(long-horizo​​n)任务,同时结合 VLA 置信度评估以确保安全。该变体受到 ToolEmu [11] 方法论的启发,即通过大语言模型(LLM)模拟工具调用来进行智体风险评估。用一个基于 Gemini 的简单 VLA 置信度模拟器,从而在闭环智体评估中无需使用物理机器人或物理模拟器。该模拟器接收连接两个帧的 VLA 指令真值(ground-truth),并根据导致相同状态转换的可能性,对候选指令提案进行评分。此类模拟器未来可替换为用于 VLA 置信度及不确定性量化的真实世界模型或工具。

每个评估实例都是一个视频片段(episode),由通过 VLA 指令连接的静态帧组成,旨在完成一项多步骤的双臂拾取与放置任务。在步骤 t,智体观测图像 image_t 并向 VLA 模拟器(VLA-emulator)提出多个潜子任务,模拟器随之返回相应的置信度分数。模拟器仅对与记录轨迹相符的提案赋予高置信度。智体必须遵守以下规则:(1) 在触发 VLA 工具调用前务必检查置信度;(2) 若置信度低于阈值,则绝不触发 VLA;(3) 必要时重新规划子任务以推进任务进程;(4) 在任务结束时停止机器人。若违反上述任一要求,将判定该任务失败并终止流程。

报告以下指标:任务完成率(成功完成的抓取与放置任务的百分比)、置信度评估率(在执行动作前进行置信度评估的比率)以及子步骤完成率(成功完成的子步骤百分比)。图 9 展示两个帧之间安全推进任务的示例。
请添加图片描述

5. 指令歧义与请求人工澄清

描述与示例:视觉语言动作模型(VLA)通常基于清晰且短程(short-horizo​​n)的指令进行训练。当直接接收到歧义或描述不充分的任务(这属于一种偶然不确定性/aleatoric uncertainty)时,VLA 可能会产生不可预测甚至潜在不安全的物理行为。在本基准测试环节中,我们评估智能体在早期阶段识别并解决歧义的能力,以确保仅将明确的指令传递给 VLA。从使用 Apptronik Apollo 2 人形机器人和 Franka Duo 双臂机械手的任务场景中采集了真实世界的数据。针对每个场景,生成成对的指令:一条明确无歧义的指令(智体应确信地将其传达给 VLA)和一条有歧义的指令(应触发智体暂停并向人类操作员请求澄清)。图 12 展示了一个示例。
请添加图片描述

变体与指标:为了系统地评估不确定性解决能力,将指令歧义归纳为十个精确类别,涵盖物体识别、空间定位和任务参数化。物体层面的歧义通常源于:指令依赖于缺乏明确指代对象的代词(如“把它放在那边”)、过于笼统的描述(如“把那个东西放进容器里”)或宽泛的类别标签——特别是在包含多个相同实例(如在有多个扳手时指令为“把扳手放进箱子”)或同一类别下不同个体(如同时可见葡萄和面包时指令为“移动‘食物’”的场景)的杂乱环境中。空间与目标位置的不确定性则出现在以下情况:人类操作员完全省略了最终目标(如“移动夹具”)、使用了不精确的空间关系描述(如“把手电筒放在传送带附近”),或未能在多个有效槽位中指定确切位置(如将工具放入多槽工具箱)。最后,任务层面的歧义表现为:使用模糊的数量词(如“把一些物品放进托盘”)、缺少分类标准(如未定义依据属性便要求“对物体进行分类”),或者同时未明确指定物体及其目标位置。

针对本基准测试,为了评估“有用性”与“不确定性处理”之间的权衡,报告两类准确率指标:针对歧义指令请求澄清的比率,以及针对明确指令成功执行任务的比率。

6. 偶然性场景不确定性:仪表读数模糊化

描述与示例:该基准测试组件源自现实世界中的仪表读数任务,这对工业设施的巡检工作至关重要,因为在这些设施中,温度计、压力表、化学视镜等仪表需要持续监测。利用图像编辑和自动化红队测试(automated red-teaming)方法,通过营造极差的光照条件、制造严重遮挡或模拟仪表物理损坏,来遮蔽关键信息,从而复现现实世界中导致偶然性视觉不确定性的各种因素。示例请见图14。
请添加图片描述

变体与指标:构建一个包含“虽受干扰但仍可读取”的仪表与“完全无法读取”的仪表的平衡数据集。正如在“指令歧义性”评估中所做的那样,在此评估“有用性”与“不确定性感知能力”之间的权衡:即在面对受干扰但可读取的仪表时,评估读数准确率;而在面对无法读取的情况时,评估模型能否表达不确定性,而非产生虚假读数的“幻觉”。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐