三、Tesla Optimus的纯视觉BEV+Transformer方案

Tesla Optimus 的纯视觉 BEV (Bird's Eye View,鸟瞰图) + Transformer 方案,核心在于将特斯拉在电动汽车 FSD (Full Self-Driving) 上验证成功的自动驾驶技术架构,迁移到了人形机器人这个更复杂的物理实体上。不依赖激光雷达等特殊传感器,仅通过摄像头输入,利用强大的AI模型来理解和交互三维世界。

(一)BEV+Transformer方案核心要点

BEV+Transformer方案核心要点

(二)技术细节与最新进展

  1. 感知层面的进化:BEV视角帮助机器人将多个2D摄像头视图整合成一个统一的3D空间理解。在此基础上,Occupancy Networks(占用网络) 技术可以进一步判断3D空间中每个小体素(voxel)是否被占据,这对于识别非标准障碍物(如形状不规则的杂物)至关重要。特斯拉最新的专利显示,其纯视觉AI系统结合 "有向距离场" (SDF) 技术,能仅依靠摄像机数据生成更高精度的3D地图,将解析度显著提升。

  2. 从演示到实战的进化:根据2025年10月的最新演示,Optimus V3已经能够与武术教练进行散打对练,实现毫秒级的闪避、格挡和反击。这背后是FSD视觉感知技术的成功移植,使机器人能实时理解对手的动作意图并做出动态反应。

  3. 训练数据的战略转向:为了突破数据瓶颈,特斯拉在2025年中期做出重大战略调整:放弃依赖动作捕捉服和远程操控的传统机器人数据收集方式,转而主要通过录制员工执行任务的多角度视频来训练Optimus。这种方式能更快地扩大数据规模,目标是让机器人最终能通过观看YouTube视频学习执行任务。

  4. 面临的挑战与局限:尽管进展迅速,纯视觉方案在处理未知物体或白名单之外的通用障碍物时,理论上仍可能不如融合了激光雷达的方案稳健。同时,有机器人专家指出,仅凭视频数据,教会机器人将观察转化为实际行动并非易事,有些技能可能仍需在模拟或现实中进行物理实践。马斯克本人也承认,训练Optimus的复杂度和数据需求,至少是汽车的10倍。

四、DeepMind的RT-2模型跨模态迁移能力测试

Google DeepMind的RT-2模型在跨模态知识迁移方面展现出了令人印象深刻的能力。它能够将视觉与语言模型(VLM) 在互联网规模数据上学到的大量知识和语义理解,直接迁移到机器人的物理控制任务中,甚至处理一些它从未在机器人数据中见过的情况。

RT-2没经训练进行的各种机器人技能测试

(一)RT-2在跨模态迁移能力测试中的核心表现

RT-2在跨模态迁移能力测试中的核心表现

(二)跨模态迁移如何实现

RT-2实现知识迁移的核心在于其视觉-语言-动作(VLA) 模型的架构设计和独特的训练方式。

  1. 模型架构:RT-2基于强大的视觉-语言模型(如PaLI-X和PaLM-E)构建。研究人员在这些模型中增加了一个"机器人动作模态",将机器人的动作(例如机械臂的移动坐标、夹爪的开合)转换成类似文本的标记(Tokens)。这样一来,机器人控制指令就变成了一种模型能够理解和生成的"特殊语言"。

  2. 训练方式:RT-2采用了联合微调的策略。它不仅仅使用机器人数据进行训练,而是将机器人数据与大规模的互联网视觉-语言数据混合在一起进行训练。这个过程就像是让模型在学习识别万物、理解语言的同时,也学习如何将这些知识转化为具体的动作。

机器人ChatGPT

(三)新兴能力与链式推理

除了表格中提到的能力,RT-2还展现出了一些更高级的、类似"智能"的行为:

  1. 情境推理:RT-2能够理解更复杂、需要结合常识的指令。例如,当被要求"捡起即将从桌子上掉下去的袋子"时,它能识别出哪个袋子处于不稳定状态并优先抓取。当被问到"选择可以替代锤子的物品"时,它能从一堆物品中选出石头。这些任务的成功完成,表明模型并非简单匹配指令,而是进行了一定程度的逻辑和常识推理。

  2. 思维链推理:研究人员还对RT-2进行了微调,使其能够像大语言模型那样进行"思维链"式的推理。在执行复杂任务前,RT-2会先用自然语言描述它计划执行的步骤,然后再输出具体的动作指令。例如,对于"把苹果放到布上"的指令,RT-2-PaLM-E变体会先输出自然语言计划,再转化为动作。这种"计划-行动"的模式,让机器人的决策过程变得更加透明,也使其能够处理更长期、更复杂的任务规划。

(四)影响因素与模型局限

在评估RT-2的能力时,了解其性能边界同样重要:

  1. 模型规模的影响:研究表明,模型的泛化能力随着参数量的增加而提升。例如,基于550亿参数PaLI-X模型构建的RT-2实例,其性能通常优于参数更少的版本。这体现了大规模预训练模型对于知识迁移的重要性。

  2. 存在的局限性:尽管RT-2表现卓越,但它并非万能。有研究指出,如果一项全新的技能完全不在其训练数据的分布范围内(例如,一个它从未学过的特定动作),模型可能仍难以执行。此外,大型模型对计算资源要求较高,可能会影响机器人的实时控制频率。

【免责声明】本文主要内容均源自公开信息和资料,部分内容引用了Ai,仅作参考,不作任何依据,责任自负。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐