深度 | 机器人训练缺 99% 真实数据,世界模型正用「想象」把它造出来

核心观点:真实交互数据缺口超过 99%,一直卡着通用机器人,2026 年世界模型开始直接「造数据」。李飞飞的 R2S2R 让完全没喂真实数据的策略在真机跑满一小时,NVIDIA 把 Cosmos 3 摆成物理 AI 的开源地基,WAIC 上中国「世界模型六小龙」当众吵路线。合成数据正在替代「慢慢攒数据」的老路。

证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

封面


一、具身智能最刺眼的短板,被「会想象」的模型盯上了

2026 年夏天,具身智能一级市场热得发烫:中国上半年融资约 935 亿元,是去年同期的五倍,资本按「机器人的 ChatGPT 时刻」给整机厂和大脑公司定价。但工程现场一直流传一个残酷数字:全球高质量具身数据存量只有约 50 万小时,而训练通用具身模型普遍认为要千万小时以上,缺口超过 99%。(据澎湃、OFweek 等多家报道)

按「数据=燃料」的老逻辑,这个赛道离通用机器人还差着十万八千里。

转折出现在 2026 年。李飞飞的 World Labs 7 月底放出 R2S2R 引擎,宣称一个完全没用真实世界数据训练的机器人策略,自主运行了整整 1 小时,零失败、零人工接管,干的还是拔电线、插拔电缆、转移试管这类精细活。[A] 同月,它收购仿真创业公司 SceniX,补齐了「真实转仿真」的重建能力。更早的 6 月,李飞飞把世界模型亲手分成三档,明确「渲染器看着漂亮但没法拿来训机器人」,把「模拟器型」列为生死线。

NVIDIA 站得更靠前。6 月 1 日发布的 Cosmos 3,被官方直接定位成「物理 AI 的基础模型」和世界动作模型(WAM)的骨干,并在发布当天宣布了开源生态。[A]

三件事指向同一个变化:具身智能可能第一次不用「等数据慢慢攒出来」,而是用世界模型「合成」出逼近真实物理的训练数据。这不是科幻,是论文、产品和资本在同一条路上兑现。下面拆四件事:世界模型是什么、为什么能解数据难题、中美各押哪一派、离真落地还差多远。

二、技术深潜:把「预测下一帧」变成新的预训练

先建立一个直觉。大模型做的事本质是「给定上文,预测下一个 token」;世界模型把同一件事搬到物理世界:给定当前画面和动作,去预测「下一帧会发生什么」。用作机器人训练时,它不再像传统仿真器那样让工程师手写物理方程,而是像大模型一样从海量视频里「学」出世界的运行规律。

上图:世界模型在「预测下一帧」上做文章,一端产出训练样本,一端提供部署前的推演。

「学出来的物理」比手写刚体方程覆盖的场景广得多。只要看过足够多视频,模型就能补出两帧之间发生了什么。但同一件事,各家实现的路径完全不同。

2.1 四条主线:Genie、V-JEPA、Cosmos、UniSim

Google DeepMind 的 Genie 是第一个生成式交互环境,11B 参数,完全从无标注互联网视频里学出来,不需要真实动作标签就能逐帧响应;后续的 Genie 3 更进一步,主张用随机智能体在虚拟环境里自动采集交互数据,把昂贵的真人演示成本省掉。

Meta 的 V-JEPA 走另一条路:只预测「特征」,不预测像素。它用 200 万条公开视频、只靠特征预测一个目标训练,绕开逐像素重建的高频误差,把表征质量做上去。对机器人来说,这类模型是「基于视觉的世界模型」的候选骨干。

NVIDIA 的 Cosmos 3 最激进:混合 Transformer 架构,一个推理 Transformer 配一个生成 Transformer,把像素、动作、声音揉进同一个模型,原生输出关节角、夹爪位姿这类数值动作。官方口径是「先数字化训练物理 AI」,并拉上 Agile Robots、Skild、Runway 等组成 Cosmos Coalition,全部开源。

Google 的 UniSim 其实是这条线的鼻祖。2023 年 10 月它就提出「学习一个真实世界的通用仿真器」,目标是让智能体只在仿真里学完、直接部署到真实世界,并指出天真的逐帧预测在真实数据上行不通,得引入隐式动作和语义/视觉分解。这套骨架后来被几乎所有世界模型沿用。 上图:从「能不能学」到「能不能可靠落地」的四年时间线。

2.2 世界模型怎么「造」数据:三套机制

对做机器人策略的人来说,世界模型的价值能概括成三句话。

第一,模型内强化学习。学出世界模型这个「动力学函数」后,策略可以在隐空间里想象出大量「状态到下一状态」的轨迹来训练自己,不用每次改进都上真机采样。

第二,生成式仿真替代物理引擎。目标是让智能体完全在「学出来」的仿真里训练,再部署到现实,绕开传统物理引擎手写规则的成本和覆盖局限。

第三,动作解耦让合成数据自带标签。Genie 这类模型的隐式动作和条件生成,能让生成的未来画面携带动作信息,供模仿学习直接用,省掉一整条人工标动作的流水线。

一句话拆穿这层想象:世界模型的价值不是「画得更漂亮」,而是把稀缺的真实交互放大成取之不尽的合成经验。缺的是数据,它就给数据。

三、竞争:开源地基,对阵整机厂私有大脑

世界模型把机器人行业劈成两个阵营:一拨想当「物理 AI 的开源地基」,另一拨想当「只有自己能用的大脑」。

阵营代表路线优劣
开源平台派NVIDIA Cosmos世界模型开源 + WAM 骨干 + 生态联盟不卖机器人,赚生态位
独立世界模型公司World LabsR2S2R 闭环 + SceniX 仿真纯软件打法,直面数据缺口
整机厂私有特斯拉 Optimus自建仿真栈 + 工厂数据回流数据闭环最硬但封闭
大脑公司自研Figure、Physical Intelligence世界模型服务自家 VLA有真实场景回流,重资产
国产融合派大晓、蚂蚁灵波、自变量、智元世界模型与 VLA 端到端熔一炉轻量、好落地、各有取舍

上图:玩家被劈成「开源地基」与「私有大脑」两派。

商业化正沿着两条路径走。第一条,NVIDIA 卖铲子:Cosmos 的生态页上躺着 1X、Agility、Figure、Skild,以及中国的银河通用、智元。它把仿真、合成数据、推理加速打包成「物理 AI 基础设施」卖,自己不碰整机。赌的是:谁掌握机器人仿真的算力层,谁就卡住物理 AI 的地基。

第二条,World Labs 当纯血世界模型公司:先买 SceniX 补齐真实转仿真的重建,再用 R2S2R 打通「仿真训练、真机验证」的闭环,卖的是「把一次真实任务扩成上千个仿真训练世界」的能力。它的特别之处是不绑定位:既想当渲染器画得像,又想当模拟器物理对,还想当规划器推得准。

四、采用与生态:中国把「合成数据」当成国运赛道

世界模型在中国的热度,从 WAIC 就看得出来。7 月那场「世界模型六小龙」圆桌,大晓机器人承办,蚂蚁灵波、极佳视界、无界动力、自变量、智元的技术负责人同台,当场吵成三派:像素派认为画得真最重要,隐空间派认为推得省才是王道,融合派主张把 VLA 和世界模型熔成一套端到端。[B] 大晓顺手发布了开悟世界模型 Kairos 3.1,还联合行业推出「物智 Physical IQ」评测平台,把「该用什么基准度量物理智能」也摆上台面。

吵归吵,共识很清楚:Demo 展示的是能力上限,部署考验的是能力下限;从 99% 做到 99.9%,成本非线性上涨。翻译成人话就是,谁先证明自己的合成数据在真机上可靠,谁才能拿到订单。

中国玩家的数据体量也不小。智源的 Orca 用 12.5 万小时视频、1.6 亿事件标注训练;智在无界的 Being-H0.8 用超过 50 万小时第一人称人类视频,训出业界首个隐式触觉世界动作模型,把触觉也压进隐空间,让机器人「没摸到也能预判手感」。[A]

上图:中国三条技术流派,共同指向下游策略训练。

资本也已经进场:上半年国内世界模型相关融资超过 30 起、总额超 40 亿元,大晓机器人大约半年融了数亿美元,蚂蚁、达晨、联想创投都在牌桌上。[B] 这正是上一轮「钱先进场、数据还差 99%」判断的续集:这一轮,钱开始往「造数据的不动产」里砸。

五、战略影响:数据缺口,会不会变成算力军备的入口

把视角拉高,世界模型对三类人影响最大。

对做机器人训练与仿真的工程师,这是技能栈的又一次替换。VLA 已经把「写控制律」换成「训模型、做评测」,世界模型再加一层:「训世界模型、做合成数据生产」。仿真阵营那句「不会让一个 3 岁小孩进工厂打 10 万小时螺丝」,说的就是新路线:与其让机器人照本宣科模仿人类,不如让它在学出的物理里先预演亿万个未来。

对算力与云厂商,这是「合成数据」生意的入口。缺的是数据,多的是算力。世界模型生成数据极其吃算力,像素派那种逐帧生成,成本高到只能跑在云端;反过来,谁提供廉价的仿真与生成算力,谁就从这轮军备里分到一杯羹。上一期讲「电力是算力的瓶颈」,这一期是「世界模型把算力需求再推高一档」。

对平台型公司,这是卡位战。一旦合成数据成为机器人训练的主流入口,「物理 AI 的仿真算力层」这个生态位可能比任何单一模型都值钱,又一个「卖 Android 而不是卖手机」的机会。

上图:真实数据当锚、世界模型当放大镜,算力层成为卡位焦点。

六、我的判断

把整盘棋想清楚,我说几个不太顺着主流的话。

第一,世界模型大概率不会「消灭」真实数据,而是「放大」它。我判断未来一年的主流不是纯合成路线取代真实数据,而是合成数据加少量真实回流互相拧紧的混合模式。R2S2R 的「一小时零失败」证明纯仿真可行,但 WAIC 的共识和 Figure 跑去真实家庭训练又在提醒:物理真实性仍是合成数据最缺的那块砖。最可能的终局,是真实数据当锚、世界模型当放大镜。

第二,真正要盯的不是谁画得最漂亮,而是谁的合成数据物理上最可信。李飞飞自己把世界模型分三档时就说了,渲染器的输出非常吸睛,但没法用于机器人训练,因为纯视觉生成可能看起来对、细究却违反物理。谁能先解决合成数据的物理真实性,包括可验证的谓词、触觉信号、多物理场,谁才真正拿到数据缺口的地契。

第三,国产阵营最大的机会不在模型上限,而在场景加算力适配这条错位竞争线。美国模型上限领先,但中国在量产节奏、场景数据规模、国产算力换道上有务实优势。对做软件和模型的工程师,我的实在话是:现在进场做世界模型不算晚,甚至算早,这行还在「谁定义标杆」的前夜。

最后,最被低估的是一条成本线。隐空间派已经算过账:Being-H 系列跑到 100 TOPS 的边缘端,每月每台机器人的世界模型成本约 150 元,还能同时跑 NVIDIA 和昇腾;而像素派逐帧生成只能困在云端。我预判,谁能先把世界模型的单位成本压到与数据缺口匹配的量级,谁才是这条路线真正的赢家。这场仗打的不是想象力,是单位成本。


每日更新。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐