刚刚结束的2026世界机器人大会上,行业正在发生一个很明显的变化。

单点技能的Demo,越来越不够性感了。

机器人会叠衣服、倒水、插零件、整理桌面的视频已经越来越多,但对于基础模型,一个更难的问题开始被反复追问:

现在泛化能力到底怎么样了?换一台机器人,同一个基础模型还剩多少能力?

今年WRC同期也设置了人形机器人测评主题活动,讨论性能测试、标准建设与场景化验证。与此同时,具身智能领域的测评榜单也陆续开始从单一任务、单一场景,向更复杂的综合能力测试发展:“开始从「会不会做一道题」,进入「到底有没有明显偏科」的阶段”。

这一点,可以从最近更新的RoboDojo榜单来看,它给这场“全科考试”换了一个榜首:DM0.5,团队是原力灵机。

图片

之前,LIBERO、RoboTwin、RoboChallenge、VLA-Arena等具身智能Benchmark不断出现,一个模型针对一套题做到很高的成功率,已经不再特别稀奇。

难的是把几种完全不同的能力放在一起考。

而RoboDojo,恰恰在找模型的“偏科”。

原文链接:从RoboDojo最新榜首看,具身开始考全科了!

01 把具身模型拉进一场「综合考试」

RoboDojo 由香港大学多媒体实验室牵头,联合加州大学伯克利分校、清华大学等全球近 20 所高校及科研机构共同参与建设

和不少以短时序、特定技能或者相似操作模式为主的机器人Benchmark不同,RoboDojo在仿真环境中设置了42项任务,并把模型能力拆成泛化、记忆、精细操作、长程执行和开放语义理解五个维度。

另外还有18项真实机器人任务,用标准化真机环境继续测试策略在物理世界中的表现。

这五科,基本对应了今天通用机器人真正容易翻车的地方。

这套评测的难度也相当高。2026年7月首批榜单中,排名第一的模型平均成功率仅为 8.80%,而人类专家达到 76.03%。因此,DM0.5此次登顶值得关注的不只是又多了一个第一,更在于它延续了此前在多个不同评测体系中的稳定表现。

图片

02 从单臂到双臂,从操作到导航,一条连续的榜单记录

判断一个基础模型是否真正具有“通用”属性时,越来越重要的一个视角是:它究竟是在某一道题上拿到了高分,还是在不同考卷上都没有明显偏科?

从公开数据看,这次DM0.5 更接近后者。

在单臂操作基准 LIBERO 中,DM0.5 综合成功率达到 99.0%;在强调双臂协同及场景随机化的 RoboTwin 2.0 中,简单和复杂场景下成功率分别达到 93.6% 和 93.3%。在 VLA-Arena 中,任务进一步加入安全、干扰、外推和长程执行等变量。DM0.5 在不同难度设置下的成功率分别达到 89.0%、53.6% 和 44.1%

而当测试从仿真走向真机,DM0.5 在 RoboChallenge Table30 V2 中面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种异构机器人以及 30 项复杂任务,取得 43.0% 的整体成功率和 54.42 的综合得分,位列榜首。

图片

操作之外,模型还被放进了场景中——导航。在 R2R 和 RxR 的 Val-Unseen 测试中,DM0.5 成功率分别达到 59.7% 和 65.5%,相较基线方法取得明显优势。

图片

03 这个榜首,真实世界靠谱吗?

“刷榜”早就不是新鲜事。

不少模型能在某个特定榜单上拿到亮眼分数,一旦进入实际场景,表现却判若两模型。

榜单上的第一,从来不等于真实世界里的可用。

我们从DM0.5公开的demo上(真实世界测试),拿到了一些信息。

首先是抗干扰能力。面对相机扰动、环境变化甚至人类动作干扰,模型需要重新理解当前状态,而不是沿着原有轨迹机械执行。

在这里插入图片描述

对物理世界精度要求更高的操作能力上,DM0.5用堆叠乐高的方式来验证,还有削黄瓜。

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

再往前一步,是**长程、稳定、高节拍执行。**对工业场景而言,一次成功远远不够。机器人需要在长时间运行过程中维持动作稳定性,在大量重复任务中控制误差累积,同时还要拥有足够高的执行效率。

下面是WRC期间,我们去现场看的分拣快递任务,跑了好久。

在这里插入图片描述

而在人机交互层面,DM0.5 还在尝试另外一种更自然的任务学习方式——通过观察人类示范理解任务,再跟随完成操作。

在这里插入图片描述

04 DM0.5开源这件事儿,也比较有信息。

评测榜单还有一个绕不开的问题:成绩能不能被验证。

据悉,DM0.5 已经完成开源,同时提供面向 LIBERO、RoboTwin 2.0 等任务的模型版本,开发者可以基于公开模型进行推理、评测以及下游任务微调。

在一个仍然依赖大量 Demo 视频、内部测试数据和企业自述的行业里,开源意味着模型开始接受更多来自开发者和研究者的复现、比较和检验。

图片

当具身智能开始考“全科”,一个模型能在差异足够大的场景里持续表现良好,可能比任何一次漂亮的 Demo,都更接近“通用”二字真正的含义。

开源地址:

  • GitHub:https://github.com/dexmal/opendm

  • Hugging Face:https://huggingface.co/Dexmal/DM05

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐