大家有没有发现。最近几个星期的行业动态和技术进展,将仿真再次推到具身智能讨论的中心。

起因是 Gemini Robotics 2 发布之后的几天。虽然大部分人的注意力都还在 Demo 所展示的能力上:Apollo 2 拧灯泡、整理货架,双臂协作、全身控制等等,全身智能所展示的想象空间确实很有潜力。

但也有同学注意到,在这一代模型,DeepMind 是基于合成数据训练的模型,出处就在他们自己的视频 Demo 里:Learning from synthetic data。

图片

一两天之后,Google DeepMind 的研究负责人 Nicolas Heess 在 LinkedIn 上的动态也证实了这一点。

Learning without robot data! …The video shows a Gemini Robotics 2 model post-trained on simulation data only…

这句话更准确的理解是,只覆盖「后训练」的部分。Heess 说:一个已经在混合数据上训好的基座模型,用纯仿真数据完成后训练,拿下了一个汽车套件分拣任务,需要精确的双臂抓取、三维重定向,还有紧配合插入。

无独有偶。

7 月 21 日,李飞飞宣布收购机器人仿真公司 SceniX,并随后在 a16z 进行对话,畅谈仿真对具身智能发展的重要意义;港大MMLab & 伯克利等十余家高校团队联合发布仿真评测基准 RoboDojo,目标是统一仿真与真实环境基准测试;光轮智能和纬钛机器人宣布合作,方向是把触觉模态接入物理 AI 基础设施……

这几件事放在一起看,行业的动向已经相当明确:仿真正在进入一个新的阶段。

原文链接:Gemini Robotics 2 背后,仿真是机器人持续学习的基础设施

01 这句话为什么反常识

先说为什么我们会觉得有些反共识。

拿 tight insertion 任务举例,紧配合插入。简单来说,就是把零件放入余量有限的孔里,公差可能只有零点几毫米。插的过程中零件和孔壁一直在接触、摩擦、微调姿态,稍微偏一点可能就会卡死,力大一点就变形。

人做这件事需要依赖手上的力反馈,机器人做这件事,靠的是模型对接触力的预判。

图片

这类任务是过去两年公认的 Sim2Real 卡点,而且比想象中的更难。它同时考验接触、摩擦、公差三件事,每一件都是仿真里最容易失真的地方。

做算法的人都知道,仿真到真实中间有Gap。

正因为 Sim2Real 的这个Gap,真机数据才那么值钱。据亿欧智库估算,截至 2026 年初,全球高质量具身交互数据总量约 50 万小时;而行业共识是,要训出一个具备通用泛化能力的具身模型,门槛在千万小时量级。

中间还差着一到两个数量级,这个供需关系一直是数采产业链的核心支撑。

学术界的判断也是一致的。今年在攻这条线的大多数工作,思路也都是往真机上靠。

所以 Heess 的「Learning without robot data」,其实是主流真机范式下的反共识。

02 行业对仿真重要性的新共识

但 Gemini Robotics 2 押注仿真并不是个例。把时间轴往前推一推,会有这么几件事。

第一件,7 月 8 日,陈天行牵头十余家高校团队联合发布 Sim-and-Real 评测基准 RoboDojo。

这是一个面向通用机器人操作策略的真机 & 仿真评测基准,港大MMLab、UC伯克利、清华、北大、上交等十余所高校参与共建。基于 Isaac Sim 和 Isaac Lab,官方提供在线评测与公开榜单,仿真与真机两条赛道均在更新。

图片

第二件,World Labs,7 月 21 日。

由李飞飞等人创办的空间智能公司 **World Labs 宣布收购机器人仿真公司SceniX。**SceniX团队将整体加入World Labs,共同推进空间智能、世界模型与机器人仿真技术的融合。

图片

第三件,光轮智能,7 月 31 日。

光轮智能和纬钛机器人宣布合作,将触觉能力纳入物理AI基础设施核心架构。

两者的分工是:光轮智能出人类行为数据、物理仿真和产业部署,纬钛出视触觉传感、末端执行器和多模态数据采集。两边联合建设触觉仿真,以及真实与仿真的对齐能力。

为什么是触觉。抓取、插拔、装配、旋拧这类工作,本质上都是接触密集型任务,而视觉提供不了物体是否压紧、是否打滑这种信息。

所以触觉传感器是测量端,仿真是求解端,而「对齐」就是这两端之间的连接线。

不同的公司、不同本体做不同任务,共同点全都落在仿真和精密接触上。

但强度得排一下序。World Labs 最激进,是彻底的零真机数据;GR2 相对保守一些,仿真只负责后训练,预训练的数据仍然是各种来源。

可话说回来,即便按最保守的读法,这几件事还是反映出行业对仿真的重要性有了更进一步的共识。

03 物理真实的仿真能力超出了预期

我们的看法是:行业正在聚焦仿真任务边界的拓展,尤其是物理真实的仿真。

先看 GR2 自己的分寸。DeepMind 研究负责人动态的完整逻辑是「高质量真机数据是瓶颈,所以我们探索替代方案」—— 原文用的是 we investigate alternatives。真机成本昂贵,必须通过本体无关的数据去规模化,而此次GR2的后训练,很好说明了仿真数据不只有数量优势,还有物理真实带来的高质量。

前述事件的共同点,是都用了仿真,这只是表面。接着往下分析你就会发现,它们用的是物理参数被测量过、标定过的仿真。

Skild 是最好的验证。hydroelastic 接触建模是什么?传统刚体仿真把接触当成一个点:两个物体碰上了,算一个法向力把它们推开。hydroelastic 的做法是把接触当成一个面,允许物体表面有微小形变,压得越深、接触面积越大、反力越大,力的分布是连续的。

简单来说,前者算的是「碰没碰上」,后者算的是「压了多紧」。对拧螺丝、插接头这类活,「压了多紧」才是真正有用的信息。

而这个能力,是 Newton 到 1.0 GA 才补齐的。同批补进去的还有稳定的铰接与复杂机构仿真、可形变体仿真(线缆、布料、橡胶)。

SceniX 的仿真打法也类似,Real-to-Sim-to-Real。Real 在最前面,流程是先测真实,再建仿真,最后回到真实。

以前的仿真为什么没有现在的能力,就是差在这里——以前用的多半是视觉上做得很逼真、但摩擦系数和接触刚度靠经验值填进去的仿真环境。渲染管线越来越好看,物理参数还是无法保证物理真实。

所以过去我们把仿真当成一个整体在粗线条讨论。用,或者不用,用得多还是用得少。现在真的需要大家再看看:仿真里的那些物理量,到底测没测准——即,谁能做物理真实的仿真?

这就是分水岭。

04 物理真实这件事,得有人在底层做 infra

既然分水岭出现了,行业便需要回答下一轮问题。

触觉的物理仿真、橡胶的摩擦系数、线缆的弯曲刚度,谁去测量?求解器算出来的接触力和真机传感器读数对不对得上,谁去验证?而这些物理量,如何变成行业能够对调用的资产和标准?把这三问答对,才有资格谈物理真实。

这三问自然不是模型团队的活。模型团队负责理解、推理和动作生成,往下这一层是基础设施。

环顾一圈,国内把物理AI基础设施当成主线在做的,光轮智能无疑是头部。

他们的技术路线叫「求解—测量—生成」三位一体的SimFoundry仿真平台,不仅有全栈自研的求解器,还通过数据、评测和部署反馈做成了闭环。横向对比其他公司,我们的观察是——做单点的很多,能做闭环的极少。

图片

我们也拜托海外的朋友打听了一下,有一个比较靠谱的信源。Gemini Robotics 2 背后用的仿真能力,也有光轮智能的一份子。

更有意思的地方在于,在这个信源之外,光轮智能和 DeepMind 的关系早有显露。

说的就是 Newton。

这个开源 GPU 物理引擎由 NVIDIA、Google DeepMind、Disney Research 三家发起,2025 年 9 月开源 Beta,2026 年 3 月在 GTC 发布 1.0 GA,交由 Linux Foundation 托管。

光轮智能在 2026 年 3 月受邀加入 Newton 技术指导委员会,是除NVIDIA、Google DeepMind、Disney Research、丰田研究院四家之外,唯一的中国公司。所以 Gemini Robotics 2 的发布,使用到了光轮智能的仿真能力也在意料之内。

图片

把这个委员会的分工摆开来看,会发现它其实是一张能力拼图:

  • NVIDIA出 GPU 原生加速、Warp 框架和 Isaac 生态;

  • Google DeepMind出 MuJoCo 在高精度接触动力学上的长期积累;

  • Disney Research出闭链机构与极端工况下的运动求解,来自 Kamino;

  • 丰田研究院出 Drake 的高可信动力学软件底座;

  • 光轮智能出的是求解器的物理验证与系统性标定、SimReady 物理属性规范,以及规模化 SimReady 世界的供给。

四家出的是「怎么算」,光轮智能出的是「算得对不对」。它是牌桌上唯一一家把「和真实世界对齐」做到极致的公司。

所以大家的分工和位置很清楚:Gemini Robotics 2 需要的接触、摩擦、公差和复杂交互能力,正是 Newton 里求解器标定和 SimReady 标准这两块工作对应的东西。

图片

DeepMind 从模型侧往下走,光轮智能从物理侧往上走,两边在同一个引擎里互相赋能。

沿着这个逻辑去看,你就能明白光轮智能到底在做什么了?

想要仿真真的 work,**那么物理求解与测量这件事就没法绕过去。**但这又是一条很重的路线:要建物理测量的产能,要一种材料一种材料地测,要把测量结果和求解器输出精细对齐。

相比之下,生成式的方法要轻的多,直接用世界模型从海量视频里学物理规律,跳过显式测量这一步。Cosmos 3、Genie 3、Marble 走的都是这个方向。

但就目前生成式方法的进展来看,物理AI的进展还是强依赖物理真实,生成式的方法的下一次突破,可能也需要依赖显式的物理真实建模。

而只要你绕不开物理真实,那么你就绕不开光轮智能。

05 训练之外,评测是模型的另一半

下面,我们还想和大家聊聊评测。

在具身模型的生产过程中,训练只是其中的一半,另一半其实是评测。

在物理真实这件事上,评测的地位可想而知。

道理很简单:训练时物理量标偏了,模型学习不收敛,我们还能多继续优化;评测时物理量如果出错,可能你连错在哪都不知道。

大模型并不存在这个问题,因为LLM本身不依赖物理本体。但具身不一样,训练收敛的再好、仿真操作的再成功,都不能代表模型在真实环境里的综合能力,换个光照或者物理表面模型可能就失败了。而真实世界不能无限重置、不能大规模并行,也很难系统性地构造失败场景。

所以评测正在从工具里独立出来,变成单独的一个重要因素。近两个月的信号也相当密集。

Google 本次发布也在做这件事。他们用了三种方式评测:real VLA, sim VLA, and human tele-op。

图片

**国内这边,相关的规范也在推进。**六月,工信部批准发布《人工智能关键基础技术具身智能基准测试方法》,规范了在仿真环境和真实环境下开展基准测试的环境设置、任务库构建、测试过程和指标计算方法。

学术界则在尝试解决一个更根本的问题:仿真评测是否可信。

RoboWorld 给出的结果是,用神经仿真器评测出来的策略排名,与 RoboArena 真机盲测榜单在八个策略上高度吻合。

RoboDojo 则基于 Isaac Sim 和 Isaac Lab 做了一套 sim-and-real 统一基准,同时跑能力导向的仿真任务和标准化真机测试。

产业侧也在往细分场景走。7 月 11 日,北京人形机器人创新中心与中科大联合发布 Labimus,面向精密化学实验室的人形灵巧操作仿真评测平台。与此同时,国内具身智能中试基地正在多地布局,建设重点也从提供场地和样机,逐步转向围绕真实任务开展测试、复测和部署验证。

光轮智能在这一层的产品是 RoboFinals,做了 Newton 原生适配,能调用 Newton 在刚体、可变形体和并行化上的能力,闭环覆盖资产、机器人与环境;另外还有和 NVIDIA 联合开源的 Isaac Lab-Arena 策略评测基准框架。

图片

7 月 22 日 SIGGRAPH 2026 的 NVIDIA Physical AI Day 上,光轮智能战略与生态合作副总裁廉和与 经典仿真框架Warp的创造者、NVIDIA 仿真技术高级总监 Miles Macklin 同台,聊的就是面向机器人的前沿物理仿真。两个人在台上讨论的是可变形资产、Real2Sim 和 Newton-native 的评测框架如何搭建。

图片

更重要的是,光轮智能的 RoboFinals 具有强大的仿真场景泛化能力,从而实现工业级、规模化评测。依托这一能力,光轮智能正与地方联合共建具身智能中试基地,在真实的工业场景中构建一套完整的验证体系。

训练、评测乃至落地部署在这里合成了同一件事。都要求仿真里的物理是可信且可真实落地的。

这也再次说明了闭环的重要性,由 RoboFinals 完成模型评测、版本比较和问题诊断,再把中试与部署结果反馈到下一轮场景生成、模型训练和验证中,光轮智能形成了“真实任务—仿真训练—规模化评测—现场验证—反馈迭代”的持续学习闭环。

06 写在最后

最后,还有几个开放性的问题想和大家一起探讨。

1.物理真实,到底要准到什么程度?

摩擦系数、接触刚度、装配公差等物理参数,究竟需要达到怎样的精度,紧配合插入这类任务才能稳定迁移到真实机器人上?目前行业还没有统一答案。缺少明确阈值,就很难判断一个仿真环境是否足够可靠,也难以比较不同团队在物理建模、测量和校准上的能力。

这个问题,可能需要更多一线 Sim2Real 团队用真实任务和长期运行结果共同回答。

2.仿真里的测量与生成方法,未来如何协同?

比如光轮智能关注的就不是单一的物理测量环节,他们围绕物理真实,内层连接求解、测量、生成,外层联通数据、评测和部署反馈。测量适合校准摩擦、接触刚度、公差等依赖精度的环节,生成式方法则可以泛化场景、变化条件。

未来两者将在同一个持续学习闭环中协作:测量提供物理约束,生成扩大数据和场景覆盖,评测与真实部署结果再反过来推动模型和仿真环境迭代。

图片

总而言之,**仿真的价值正在从单点生成数据,转向支撑训练、评测、部署和反馈迭代的基础设施。**真实世界负责提出问题,仿真负责扩展问题,评测负责判断改进是否成立,部署结果再开启下一轮学习。

仿真的下一阶段,可能就从这里开始。

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐