家人们,我这两天去冰丝带看了世界人形机器人运动会!!

讲真,我一开始是抱着看热闹的心态去的,大家轮流跑跑步、跳跳舞、打打拳,咱主打就是一个热闹。

现场的名场面还不少。

有走到障碍物前突然呆住了,还有的冲过终点以后直接扑向防撞软垫,给自己撞坏了:

但看完这些翻车现场以后,我对人形机器人反而更有信心了。

因为现场不只有摔倒、跑偏和卡壳,也真的有很多机器人把比赛完整做了下来,而且完成得还不错。

在各家公司的宣传视频里,机器人当然可以一直成功。

失败的部分可以剪掉,摔倒的镜头可以不发,试了几十次终于成功的那一次,也可以包装成“一次完成”。

但现场比赛可不一样。

大家在同一套规则下竞争,机器人到底跑得稳吗、看得懂环境吗、东西能拿住吗,出了问题以后还能继续完成任务吗,现场暴露无疑,全都藏不住。

所以我觉得,这场机器人运动会就是一场公开的压力测试。

这次的阵容也是真够齐的,圈内响当当的智元、天工、宇树、逐际动力、松延动力、加速进化、千寻智能还有各种科研院所,一共有来自16个国家的666支队伍,带着2056台机器人,参加了51个赛项、1301场比赛。

比赛也不再只是跑步、踢球、跳舞和打拳。

这次还设置了图书整理、酒店服务、消防应急、工业操作、灵巧手微操等大量来自真实工作场景的任务。

机器人不仅要证明自己是个体育生,还得证明自己真的能当打工人。

(PS:我愿称之为用金牌换工牌)

昨天赛事顺利闭幕,奖牌前三名的厂商分别是智元、天工、宇树。

智元拿了46枚奖牌, 其中18 块金牌,金牌、奖牌都拿了第一。

18 块金牌分布长这样:灵巧手专项 8 个项目拿了 7 金,作业场景赛 12 块金牌里拿了 6 块,竞技赛 5 块。

这次参赛的都是都是已经量产或者投入真实场景部署的产品,并非赛场定制机。比如OmniHand灵巧手、精灵G2、远征A3和灵犀X2,全是已经量产的型号。

拿下金牌,验证的不只是某台机器的某一次发挥,更是背后的产品和技术的实战测试。

所以,我又研究了一遍这些参赛机器人,看看金牌背后到底藏着哪些真技术~

◈手:灵巧手

这次运动会首次设置了灵巧手的专项赛,一共有8个项目,包括积木搭建、粉末称重、镊子夹豆、钉钉、打螺丝和线缆连接等。

我要单独说的是,全场最苛刻(这个是真不知道什么脑子想出来的)的项目——粉末称重

我在现场看的粉末称重,比赛是要求机械手称出20±0.5克的粉末。

机械手拿着容器,不是一下全部倒进去,而是要一点点往秤上抖。秤上的数字不断变化,它也得根据重量随时调整动作。

粉末称重需要控制非常细微的倾倒量,视觉可以告诉机器人,物体在哪里,但是很难准确地告诉它:现在用的力是不是太大。

人类之所以可以拿鸡蛋、捏纸杯、拧瓶盖,是因为手指一直在把触觉信号反馈给大脑。

智元子公司临界点这次派出参赛的OmniHand,做的就是把这套触觉闭环装进机械手。

我查了一下官方技术资料。

这只机械手重量大约 510 克,拥有 16 个自由度。触觉版本在手部布置了 400 多个触觉感知点,通信频率达到 1kHz。1kHz 意味着,它每秒可以接收大约 1000 次触觉反馈。

自由度越多,控制维度、成本、发热和可靠性压力也会一起增加。

OmniHand在灵巧性、力量、重量和量产成本之间找了一个平衡。按照Feix人手抓取分类,它可以实现33种标准抓取形态中的27种,覆盖率超过80%。

同一只手又能握锤子,又能捏镊子。

OmniHand每秒可以接收大约1000次触觉反馈。一旦发现物体正在滑动或者某根手指受力不对,肉眼可能还没看出来,它就已经开始调整了。

负责把这些触觉信号变成动作的,是一套叫作DUET的双层具身接触智能架构。

外层负责规划手指的位置和姿态,内层则在接触发生以后,根据触觉反馈实时修正力度、位置和接触点。

技术文档传送门:

https://www.agibot.com/products/OmniHand_O10

粉末称重决赛中,OmniHand,全自主完成取勺、取盐、称量和调整,最终用时27秒,精准称出20克粉末拿到金牌,而且还进入了8个项目的全部决赛,并拿下其中7枚金牌。

八场拿七金。

◈身体:体育生

说到远征A3,不得不说,它还是本场的出片王。请看:

太极服带派版:

冰丝带舞王:

hh,言归正题。

远征A3在武术太极拳项目中完成了“腾空飞脚接外摆连450°”+“外摆连360°接马步”+“外摆连540°接马步”一连串大动作,最后拿到了金牌。

我拍了视频,真的挺像回事的:

我在现场看的时候就在想,人和机器人打太极的区别从机器原理上怎么体现的?

以比赛中“腾空飞脚接外摆连450°”为例。

机器人要连续完成蹬地、腾空、摆腿、转体、落地和定型。

起跳时需要关节瞬间输出足够大的力量;腾空以后没有地面支撑,只能靠躯干和四肢调整旋转状态;落地的一瞬间,还要吸收冲击、修正重心,然后恢复站立。

我查了下,远征A3身高1.73米、重55公斤,采用镁合金主体和钛合金关键部位强化结构,功重比达到0.218kW/kg,瞬时峰值功率达到12kW。

硬件上,腾空和转体所需的爆发力是有的。

软件上,远征A3使用运动预训练模型和全身协同控制,从大量运动数据中学习通用的运动规律,再针对太极拳这种轨迹复杂、节奏特殊的动作进行适配。

硬件给它爆发力,算法负责让它别摔。

智元最近又把这条技术路线往前推了一步,发布了端到端Motion-Between运动基座模型BFM-2。

它的重点不是让机器人调用一段预设好的动作,而是根据机器人当前的全身状态、接触约束和目标指令,实时生成从当前姿态到目标姿态的完整运动过程。

不管机器人现在是躺着、趴着、身体倾斜,还是突然受到外力干扰,它都要重新计算:

我现在是什么状态,接下来应该怎样动,才能稳定到达目标姿态?

它相当于一个生成式运动小脑,负责把VLA等高层系统可能跳变的指令,转化成连续、稳定且物理上可以执行的全身运动。

机器人不能只要学会复刻动作,还要学会在身体状态不断变化时,自己生成动作。

◈腿:田径赛

灵犀X2在100米障碍赛中的表现也很有意思。

这场比赛的最后一关,是一个净高只有0.5米的匍匐通道。

灵犀X2走到通道前,直接趴到地上,四肢贴地往前爬。钻出去以后,又继续爬过终点,最后以1分28秒拿到了第一名。

障碍跑比赛中,机器人,需要在跑、走、跨、爬、钻这些运动状态中不断地切换,只靠本体的感知是远远不够的。

机器人的关节编码器、惯性测量单元和足底传感器,没办法提前预知前面的台阶有多高、障碍物离自己还有多远、下一脚应该落在哪里。

这时候就要辅助视觉、深度相机和激光雷达这些外部传感器,可以在接触障碍物之前,先理解前方的地形,提前决定步子迈多大、脚落在哪里、身体应该保持什么姿势。

灵犀X2采用了智元自研的AGILE生成式通用小脑引擎,把环境感知和运动决策放进了同一个闭环。

它不再只是循环执行一套提前设置好的步态,而是要一边看环境,一边决定接下来怎么动。

在高速通过障碍物时,它要不断回答三个问题:

(1)障碍在哪里?

(2)下一脚踩在哪里?

(3)身体怎样移动,落地以后才能继续保持平衡?

环境感知负责寻找可以落脚的位置,运动策略生成步幅和关节目标,底层控制器再根据机器人实时状态不断修正。

精准参数辨识和Sim2Real迁移,则负责缩小模拟器与真实机器人之间的差距,让训练出来的策略可以适应真实电机、地面摩擦和碰撞冲击。

最终,灵犀X2在100米障碍赛中拿到金牌,在400米障碍赛中又拿下银牌和铜牌。

◈大脑:打工人

前面这三块是手、身体、腿,都还是体育生的范畴,场景赛里面考验的才是真正的大脑。

这次的场景赛一共 12 块金牌,智元拿了 6 块,是所有厂商里最多的。而且五个场景赛项目,智元全部用的是同一台机器:精灵 G2

场景赛不是跑步、跳舞、打拳,任务是在图书馆把书上架、在酒店开门按电梯、在园林里捡垃圾、在火场里拎灭火器。

同一台机器、同一套软件底座,跨五个完全不同的场景,可能才是「AI 大脑」这个词最该被验证的地方。

我还特意去问了智元的技术同学,他们没有给每条赛道单独精心特调,背后是一套三层的能力体系:

  • 底层是自研的 GO 系列大模型,负责视觉理解、指令解析和任务泛化;

  • 中间是 Genie Agent,理解场景目标、拆解规划任务、做 Agentic 编排,把一句抽象指令变成一串可执行的行动序列;

  • 上层是强化学习工具链,负责策略的快速训练与验证优化。

最硬核的是园林场景,在这个项目上,智元团队给了一个判断:

自主方案的上限显著高于遥操。因为经过充分训练与优化,自主机器人的任务完成速度已经超过了遥操员的操控速度。

这句话的分量,可能比 18 块金牌加起来都重。

一直以来,遥操是人形机器人落地的保底方案,但它有个致命问题:一台机器人还是要配一个人,商业模型根本算不过来。所以行业里判断具身智能到底行不行,有一个朴素的分水岭——自主的速度和成功率,什么时候能超过一个熟练的遥操员。

越过这条线,机器人才第一次真正变成生产力,而不是一个更贵的遥控玩具。

他们并没有在所有场景里都用了大模型。

比如图书馆书籍上架,智元的技术路线是预先建立高精度地图并标定关键点位,用定位与导航算法计算最优路径,书脊标签识别用开源视觉模型。

一条非常传统机器人学的路线。

原因是图书对高精度和高可靠性有极致要求,经典方案在实时性和计算资源开销上更有优势。

他们的Genie Agent 框架能灵活地根据场景选择最可靠的方案,而不是所有场景无脑堆大模型。

顺便说一下本体,G2 是上市已满一年的量产机型,2070 TOPS 端侧算力让 GO 系列模型在本地跑,多路传感器处理延迟低于 10ms,不依赖外部算力和网络。

相比算力,更值得说的是品控一致性。

算法能在多台 G2 之间无缝迁移,不用针对个体差异反复特调。所以智元这次参赛的都是量产机,不是比赛定制机。

◈结语

研究后,我感觉智元这几款各有分工吧。

OmniHand是灵巧手,主打稳定抓取和操作物体;远征A3主打高动态动作和全身协调;灵犀X2做的是感知环境并自主移动,精灵 G2 是理解协调任务。

从手部操作到全身控制和复杂地形移动,组成了完整的人形机器人的能力。

这和智元一直强调的“三智一体”是对上了:

三智分别是交互智能、作业智能和运动智能,一体则是稳定、可靠、可以量产的机器人本体。

本体提供力量和动作上限,具身AI大脑负责感知环境、理解任务、规划动作,再根据视觉、触觉和全身状态不断修正。

所以,表面上是赛场上大杀四方,背后能看出来的是这18块金牌不是靠某一个参数或者某一项单点技术堆出来的。而是背后全栈具身AI系统很能打。

在今年智元合作伙伴大会上,创始人兼CEO邓泰华提出了一个理论叫做XYZ三条曲线:

  • X 曲线(2022—2025):开发态和早期采用期,要的是能不能稳定量产、运动起来。

  • Y 曲线(2026—2030):部署成长期,转向“能不能干活”,要的是数据飞轮和规模化价值。

  • Z 曲线(2030 年以后):负责大规模的泛化和普及。

看完运动会后,我觉得人形机器人现在已经走在X曲线的尾声,甚至开始有Y曲线的前期之态了。

能跑了、能跳了、能翻跟头了,已经能证明机器人能力的上限了,而且也开始有部署态的基础了。

比如这次智元参赛,直接拉通用的量产机器人来,已经开始有规模化、稳定化的验证水平了。

虽然,到今天,还不能证明Y曲线已经走向正轨,但是起码可以确定的是已经开始走向起点了。

至于,这条曲线要走多远,那就要继续看了。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐