1、软件的挑战
人形机器人硬件性能已达基础门槛,软件成为通用人形机器人智能化的最大瓶颈,主要体现为:1)当前算法基础下机器人大脑跨场景泛化能力较弱;2)用于训练的高质量物理数据集匮乏;3)物理感知缺失等核心问题。

(1)大脑泛化能力较弱,通用场景依然较难应用
人形机器人大脑的泛化能力是指其基于大模型或具身智能系统,在未经专门训练的新任务、新物体、新场景或新指令下,仍能理解意图、推理决策并可靠执行的能力。人形机器人最理想化的应用场景是通用场景,即无论场景如何变化,人形机器人都能够完成场景中的非结构化任务。现阶段大部分人形机器人的能力展示都建立在预设场景的精确控制之上,大脑泛化能力依然较弱,导致在通用场景的应用仍存在瓶颈。通用人形机器人需要在多样、动态的环境中完成任务,但环境、任务超出先前训练范围时,人形机器人难以将已学到的知识和技能进行迁移、复用,导致任务完成率降低。例如,在汽车工厂中,人形机器人虽能完成预设的搬运任务,但若是传送带速度变化或零件位置偏移时,失误率便急剧上升。以特斯拉Optimus 为例,2024 年在工厂的实训数据显示,在预设货架位置、固定零件型号的结构化环境中,人形机器人任务完成率达91%;但在多型号零件随机出现的非结构化生产场景中,任务完成率骤降至27%。机器人在未经训练的新场景、新任务中自主决策执行能力不足,反映大脑泛化能力是实现通用人形机器人的卡点。

(2)用于人形机器人训练的高质量数据集获取难
用于人形机器人训练的数据缺乏是人形机器人大小脑泛化性不足的重要底层原因之一,制约了其通用智能化的实现。当前的机器人“大小脑”模型需要基于多模态物理交互数据(如传感器信号、动作轨迹、环境感知信息)进行深度学习训练,这一过程需要大量、优质、多样的物理数据。获取人形机器人训练数据的主要方式有真实本体数据采集(真机数据)、虚拟本体数据采集(仿真数据)、合成数据、人体的数据集。但是,当前可部署的人形机器人数量少,难以获取高质量的真实物理世界数据;而高保真世界模型的构建、训练和优化也仍处于发展初级阶段,也难以为机器人提供高质量的仿真数据。现阶段人形机器人数据集多基于厂商自采集,存在“数据差异大”“单个厂商积累数据有限”的问题,且大规模真机数据采集需投入大量人力物力,物理世界的复杂性也导致数据完整性不足。特斯拉为训练Optimus 机器人,高薪聘请操作员穿戴动作捕捉设备进行数据采集,时薪最高达48 美元,且需“三班倒”24 小时不间断收集数据,凸显数据获取已成为制约人形机器人学习和适应能力提升的关键瓶颈。
(3)物理感知与场景理解能力缺乏
人形机器人高精度环境感知与场景理解的技术是实现具身智能与物理世界进行交互、完成通用性任务等功能的核心基础,通过理解并识别出环境中的物体、场景及它们之间的关系做出合理的决策和行动。这一技术涵盖多个关键领域包括传感器技术、算法处理、硬件支持等,但目前关键领域的能力不足导致人形机器人对于物理世界的感知和场景理解仍存在缺失,主要体现在以下几个方面。一是触觉感知较为初级,环境感知需要人形机器人集成多种传感器,如视觉、听觉、触觉、嗅觉等,从而实现对环境高精度、全方位的感知。触觉是人形机器人与物理世界进行互动,真正“改变世界”的重要功能模块。尽管当前已有部分人形机器人采用了触觉传感器,其技术指标也已达到人类皮肤灵敏度级别,但人形机器人以往训练的数据源主要是网络文本或视频,极度缺乏触觉数据,如何让人形机器人大脑理解触觉与动作的关联仍是待解难题。二是多模态数据的融合和场景理解能力仍不足。人类在观察、改变世界时往往会进行视觉、听觉、嗅觉、触觉等多种模态的感知,人形机器人亦是如此,多种模态的融合感知提升了机器人对环境信息的感知和处理能力,使其能够更准确地判断环境中的情况。但是不同传感器的数据形式和结构上存在不同,多模态感知数据的融合速度、准确度依然较低,同时目前的融合以图像、文本和语音为主,对于感知信息的运用局限于一类信息解决一类问题,缺乏对多模态信息的有效融合与综合运用。人形机器人依然无法像人类一样对世界形成多种感官上的完整认知,这限制了人形机器人在人类生活环境中灵活处理各类复杂问题的能力。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐