9月7日晚,宇树科技放出一段视频:两台人形机器人脱离遥控器,像真人一样拉开架势、试探、出拳、格挡,全程没有一丝外力干预。9月8日,宇树正式宣布——这是全球首次由世界模型实时驱动的全自主人形机器人格斗演示,背后的主角叫UnifoLM-X2-1.0。

这条视频之所以刷屏,不只是因为"机器人打架"足够震撼,更因为它回答了一个行业灵魂问题:具身智能,什么时候才能真正"自己拿主意"?

一、不是编排出来的,是"想"出来的

过去很多机器人表演,本质是"预设动作+遥控纠偏":工程师把动作序列提前录好,人在后台拿着遥控器随时修正。而这次宇树强调"全自主"——机器人自己看、自己预测、自己出招,全程没有遥控器。

官方给了两个关键词:"瞬时规划"和"动态交互"。翻译成大白话:机器人要在几十毫秒内完成"我看到什么→对手下一步会怎样→我该怎么出招→关节怎么发力"的完整闭环,而且双方都在高速移动、随时可能被击中。这种强对抗场景,比搬箱子、走楼梯苛刻得多。

二、UnifoLM-X2-1.0:把"世界模型"接到身体上

UnifoLM-X2-1.0的核心思路,是"世界-动作大模型"。

世界模型这两年大家没少听说:它相当于给AI装了一个"物理世界模拟器",让AI在脑子里预演"我这一拳打过去,对手会怎么躲、惯性会怎样"。过去世界模型多在视觉、视频领域秀肌肉,而宇树这次把它和"动作"直接打通:一边用世界模型实时预测环境与对手动态,一边把决策转化为电机输出的动作指令,实现了"预判-决策-执行"一体化。

难点不在"模型大",而在"实时"——要快到来得及在对手反击之前完成整套决策,还要扛住真机上的噪声和物理反馈。这恰恰是很多实验室模型落地时栽跟头的地方。

三、为什么说这是"大规模落地"的信号

宇树官方原话是"验证了世界模型驱动的人形机器人大规模落地部署的基础可行性"。这句话分量不轻。

道理很简单:格斗是强对抗、强交互、高动态场景,几乎把机器人能遇到的难题都压在一场演示里。如果同一条"世界-动作大模型"技术路线能在这种场景下稳定工作,那迁移到分拣、搬运、装配、巡检、家庭服务这些"环境更可控、节奏更慢"的场景,成功率会大得多。换句话说,这是一次把"世界模型从秀场拉进现实"的探路。

四、冷静一点:离"机器人满街跑"还有距离

兴奋之余也要泼几盆冷水:

1. 算力成本:这类实时决策目前仍依赖高性能算力,把它压缩进"机器人背上的电池和盒子",还要走很长的成本曲线。

2. 泛化能力:格斗是双方高度可控的"封闭舞台",换到路况复杂的工地、人来人往的客厅,模型还能不能这么稳,有待更多数据验证。

3. 安全边界:自主决策越强,"自主犯错"的后果就越重。机器人越是会"自己拿主意",测试标准、安全规则和保险机制就越要跟上。

总结

从"会动"到"会想",宇树这次把世界模型从PPT搬进了真实现场。格斗本身也许只是展示,但"世界模型+具身智能+实时决策"这条组合拳,才是这场演示真正的看点。下一步,人形机器人会先走进工厂、仓库,还是你家客厅?时间会给出答案。

(本文部分内容由AI辅助生成)

 

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐