今天上午,2026 世界机器人大会在北京亦庄开幕。同一天,小米集团总裁卢伟冰当众官宣:小米那台 1.7 米的全尺寸人形机器人,首次面向公众亮相。这台机器人在小米汽车工厂干了整整 4 个月——不是跳舞、不是翻跟头,是拧自攻螺母、折料箱。打磨到现在,螺母上件成功率到了 98%,离人工操作不远了。

这个细节放在三年前,很难想象。那时候机器人大会的流量密码是"能不能后空翻",厂商憋着劲儿秀平衡、秀跑跳。今年画风全变了——没人再比谁蹦得高,比的是谁真能进厂、真能交付、真能赚钱。行业管这个叫"从炫技到干活"。但"干活"这两个字背后,藏着一个大模型圈子没有、机器人圈子躲不掉的难题:数据。

先想清楚一个对比。大模型为什么能"读遍互联网就变聪明"?因为文本是免费的、无限的,爬虫一晚上能拖回几个 T。可机器人要学的是另一类东西:手指怎么使力才不会捏碎鸡蛋、手臂怎么绕开障碍够到后面的瓶子。这种物理操作数据,互联网上几乎没有现成的,只能靠一台真机、一个真手臂、在一个真实场景里一秒一秒地采。这就是具身智能的"数据荒"——不是没有数据,是获取成本高到离谱。

过去两年,行业一度陷入一种"数据崇拜":相信只要像喂大模型一样,堆几百万小时的操作视频,机械臂就会无所不能。今年 7 月在悉尼办的 RSS 2026(机器人领域三大顶会之一)现场报道里,直接把这个现象叫"数据暴政"——物理世界的数据获取受限于时间和空间,永远复制不了互联网数据那种免费的无限供给。这个判断,等于给"多喂数据就变强"的老路子判了个缓刑。

所以,当李飞飞的高徒黄文龙在 RSS 2026 提出"脑内搜索"时,现场那么炸,不奇怪。他的主张一句话就能说清:机器人不需要见过所有的失败,它只需要学会"脑补"另一种可能。说白了,就是让机器人在动手之前,先在心里把整个动作预演一遍——碰到会怎样、抓不住会怎样、换个角度行不行。这个"脑内模拟器",就是这两年反复被提的世界模型(World Model)。

世界模型不是画饼。就在昨天,8 月 18 日,一篇叫 DreamerV3 的工作登上了 Nature——它用一套固定调参,在 150 个任务上做到 SOTA(最先进水平),数据效率比此前方法提升了 1000% 以上。翻译成大白话:同样的效果,别人要采一万个小时的真实数据,它可能一千个小时就够了。这恰好命中了具身智能最贵的那个痛点,所以李飞飞的公司 WorldLabs 估值都奔着百亿美元去了。

但我得泼一盆冷水:世界模型没那么快变成万能解。RSS 2026 最后一天的圆桌辩论,主张"模型合体"的 Physical Intelligence(物理智能,简称 PI,硅谷做机器人大脑的明星公司)科学家,三轮全输给了主张"分开"的学者们——现场观众实时投票,站"分开"的人更多。还有个更尖锐的质疑:仅靠视频预测出来的"未来画面",往往只是"看起来合理",它未必真懂物理约束——手指的接触关系、物体的重量、抓取的角度,这些硬约束一旦被脑补忽略,机器人在心里预演得再美,落地一抓照样脱手。

今天的大会,其实给出了一个更朴素的答案。虎嗅那篇现场观察的标题特别直白:《WRC 上,机器人都在忙着赚钱》。参展企业 300 多家,比去年涨了三成多;首发新品 150 余款;49 家央企启动"中央企业机器人创新联合体",成了最大的需求方。行业的共识已经不再是"谁能后空翻",而是"谁真能交付"。这背后是两条路在赛跑:一条继续堆真机数据,贵但扎实,小米拧那 4 个月螺丝就是这条路最真实的写照;另一条押注世界模型、合成数据这些"脑内"路线,快但不稳,博弈和质疑一点不比落地少。

对中国来说,这是个难得的窗口期。整机、核心零部件、运动控制这些硬件底盘,我们已经是全球第一梯队,缺的恰恰是"大脑"那一层的通用性。谁先把数据成本打下来,谁就握住了下一个十年的定价权——这话可能武断,但方向应该是这么个方向。

写到这,我特别想问一句:如果机器人学"干活"真能靠"脑补"补掉一大半真实数据,那这条路的尽头,会不会反而让"真实数据"变成最值钱的东西?你更看好真机硬扛,还是世界模型开脑洞?评论区聊聊。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐