物理AI+ Genesis AI联创王尊玄 | 不卷大模型卷系统能力
机器人一定要长得像人吗?Genesis AI 的回答是,不一定。
Genesis AI 这家base在法国和硅谷的具身新星,今年6月推出了首款具身机器人Eno,没有头和脸,只保留灵巧操作必要的部分,流畅简洁的设计被称为机器人界的iPhone,今年四季度上市。

(图:Genesis AI的机器人Eno)
Eno搭载机器人基础模型GENE-26.5,可以理解高层任务目标,根据环境变化进行推理和规划,并完成长程、多步骤任务。并且配置与中国舞肌科技联合研发的仿人灵巧手,20个主动可反驱自由度,尺寸与人手一一对应,能够以毫米级精度完成复杂操作。Genesis AI还开发了带触觉电子皮肤的数据手套,实现“人手—手套—机器人手”1∶1∶1映射,采集精细动作和接触信息。
Genesis AI把机器人的“大脑、双手、数据和训练环境”做成了一套完整的系统。
在智元机器人与觅蜂科技联合举办的“智启具身论坛2026——迎接物理AI智能涌现”论坛上,Genesis AI 联合创始人王尊玄讲解了Genesis完整的的系统观、数据观、仿真观和模型观。

王尊玄,麻省理工学院计算机科学与人工智能实验室(MIT CSAIL) 博士, Genesis AI 联合创始人,曾兼任Liquid AI研究员 。其研究方向聚焦于构建能够与物理世界交互的智能体。
01
Genesis的系统观:
机器人是系统性问题
王尊玄开篇定调:机器人是一个系统性问题,与LLM不一样,不仅仅是模型的问题。
过去几年,大语言模型已经证明了Scaling的价值。随着数据量、算力和模型规模不断增加,模型能力也在持续提升。尽管机器人不能完全照搬大语言模型的发展路线,但其训练范式仍然值得借鉴。

(图:LLM与Robotics的训练阶段对比)
大语言模型的训练大致可以分为三个阶段。
第一阶段是大规模预训练。模型利用海量互联网数据,学习语言规律以及对世界的基础认知。
第二阶段是对齐。通过监督微调、人类反馈等方式,模型逐渐理解用户的意图,知道人类希望它完成什么任务。
第三阶段是基于强化学习的后训练。模型进入代码、数学等具备明确反馈机制的环境,通过大量交互获得奖励信号,并逐步发展出推理和自我改进能力。
Genesis AI希望为机器人构建一条相似的路径。
在预训练阶段,机器人可以利用第一人称视频和手套采集的人类操作数据,学习人类如何与物理世界交互;在对齐阶段,加入少量手套数据和机器人真机数据,明确模型需要完成的具体任务;在后训练阶段,则构建大规模仿真环境,让机器人在其中反复尝试、获得反馈并更新策略。
但与大语言模型相比,机器人系统更加复杂。语言模型主要处理数字世界中的信息,而机器人必须面对真实世界中的物体、接触、摩擦、力、形变和安全约束。模型输出的也不只是文字,而是必须转化成机械手、机械臂或机器人身体可以执行的动作。
因此,机器人能力并不只取决于模型架构。数据采集设备是否准确、机器人硬件是否可靠、中间件是否稳定、控制系统是否及时、数据处理是否规范、评测体系是否可信,都会影响最终效果。
Genesis AI由此提出了一套端到端的系统方法:从数据采集、硬件、中间件、控制栈、数据管线、模型训练,一直观察到评测和真实部署,再通过部署结果形成新的数据闭环。团队首先寻找整条链路中最关键的痛点,再集中资源进行优化。
这也意味着,算法不一定是所有问题的答案。如果模型难以实现人类动作与机器人动作的迁移,除了设计更复杂的表征学习和迁移算法,也可以重新设计机械手、传感器和数据采集设备,从源头降低数据与机器人本体之间的差异。
02
**Genesis的数据观:**从人类操作中获取可扩展的灵巧数据
数据是机器人实现Scaling首先要解决的问题。
目前常见的机器人数据采集方式包括遥操作、UMI等手持设备、第一人称视频、互联网视频以及机器人真机采集。不同数据各有优势,但很难同时满足规模、精度、物理信息和部署相关性等要求。
遥操作采集的数据与目标机器人最接近,但很难大规模扩展。一方面,遥操作依赖机器人硬件,采集成本较高;另一方面,操作者很难通过现有设备完整控制高自由度灵巧手。普通夹爪可能只需要控制开合,但灵巧手涉及多根手指、多个关节以及复杂接触,遥操作难以达到人手的精细程度。
UMI或其他手持式数据采集设备具有更好的扩展性,采集成本也通常低于遥操作。但它们会改变人原本的操作方式。在真实工厂或商业场景中,如果要求工人先学习如何使用一套特殊设备,不仅会增加培训成本,也会影响原有的工作效率,部分精细任务甚至无法按照原来的方式完成。
第一人称视频和互联网视频拥有更大的数据规模与任务多样性。人只需要佩戴相机,便可以记录大量真实操作。但纯视频数据通常缺少准确的动作轨迹、接触状态、作用力和触觉信息,与机器人本体之间也存在较大差距。
机器人真机数据与部署场景的相关性最高,但采集成本同样最高。真机运行速度有限,还会产生设备磨损、安全风险和人工维护成本,因此很难获得互联网数据级别的规模。
Genesis AI的选择,是设计一套尽可能让人手、数据手套与机器人灵巧手相互一一对应的采集系统。工人戴上手套后,仍然可以按照原来的习惯完成工作,不需要为了采集数据改变操作方式。系统则在不影响生产流程的前提下,被动记录人手动作、接触和触觉等信息。

(图:Emo的灵巧手)
这种设计需要满足两个要求。
第一是非侵入式。数据采集设备不能显著改变工人的动作习惯,商业上也不增加过多培训和部署成本。只有能够进入现有工作流程,数据采集才能真正扩展到工厂、厨房等真实场景。
第二是数据与机器人硬件的对齐。手套、人手和最终部署的机械手需要在动作自由度、关节映射和接触信息等方面尽可能一致。手套还应具备触觉传感能力,记录视觉之外的物理信息。
在王尊玄看来,判断一种机器人数据是否有价值,不能只看数据量,而需要考虑至少五个维度。
首先是可扩展性,即数据能否以较低成本进行大规模采集;其次是多样性,能否覆盖不同人员、物体、场景和任务;第三是动作保真度,采集到的动作能否保留人手操作的精细程度;第四是物理信息,数据是否包含接触、力、触觉和动力学状态;第五是部署相关性,即数据与最终使用的机器人和真实工作环境是否足够接近。
第一人称视频在规模和多样性方面具有优势,机器人数据在部署相关性方面更强,而手套数据试图在规模、动作精度和物理信息之间取得平衡。

(图:Genesis的数据组合)
Genesis AI希望把这些数据按照不同训练阶段进行组合:利用第一人称视频和手套数据进行预训练,再使用少量机器人数据完成对齐和任务微调。
03
Genesis的仿真观:从生成训练数据转向高保真仿真评测
除了数据,仿真是Genesis AI系统路线中的另一个核心环节。
机器人研发高度依赖评测。模型在哪些任务上失败、失败发生在哪个环节,直接决定下一轮应该优化什么。但真机评测需要反复布置环境、重置物体、维护设备并组织人工操作,不仅效率低,也很难做到完全标准化。
真实环境还存在覆盖不足的问题。一个机器人可能在实验室中完成数十次测试,却无法覆盖实际部署中的物体差异、环境变化和长尾情况。对于灵巧操作而言,物体位置、摩擦系数、材料、接触角度的细微变化,都可能导致不同结果。
强化学习对交互量的需求更大。如果把全部探索放在真机上完成,训练速度、安全风险和硬件损耗都会成为限制。机器人不可能像语言模型生成文本一样,低成本地进行数百万次物理试错。
因此,Genesis AI希望把仿真的保真度推到足以服务机器人研发的程度。这里的“高保真”并不只是画面逼真,而是仿真中的物理过程和评测结果能够对应真实世界。模型在仿真中表现出的能力和缺陷,应当能够反映其在真机上的表现。
Genesis AI最开始是做了一个物理引擎,目标是生成仿真数据去做模型训练。但在实践过程中,团队逐渐把重点转向模型评测。因为仿真数据最终是否有价值,仍然要看训练后的模型能否在真实世界工作。与其一开始就同时解决数据生成、模型训练和Sim-to-Real迁移,不如先建立可靠的仿真评测体系,验证仿真结果与现实结果的相关性,把fidelity做到极致。

(图:Genesis World 1.0 2026年5月27日发布 )
高保真评测一旦建立,仿真便可以进一步发展为机器人的自我学习环境。机器人模型能够像Coding Agent在代码环境中工作一样,与仿真环境持续交互:执行动作、获得评分、更新策略,再进入下一轮尝试。
这样一来,机器人学习就有机会从一个受制于真机数量和实验时间的问题,转化成一个能够依靠算力扩展的问题。更多算力可以支持更多并行环境、更大规模的实验以及更丰富的任务覆盖。
但仿真环境不能脱离真实需求。Genesis AI希望从工厂和商业部署中提取任务、设备、物体和操作流程,再构建对应的仿真场景。真实部署定义问题,仿真环境提供评测与训练,模型能力提升后再回到真实世界验证,由此形成完整闭环。
04
**Genesis的模型观:**淡化模型架构之争,走向即时部署
在模型层面,Genesis AI并不过度强调某一种模型架构,也不把开源模型本身视为最终目标。相比模型采用什么结构,团队更关注模型接收什么输入、输出什么信息,以及如何吸收不同来源的数据。
机器人训练面对的是异构数据:互联网视频提供视觉先验,第一人称数据记录人类视角下的操作过程,手套数据包含精细动作和触觉信息,机器人数据对应具体本体,仿真数据则可以提供大规模交互与奖励信号。真正困难的是找到一套有效的训练配方,将这些数据放在正确的训练阶段,并解决它们在信息形式、动作空间和物理精度上的差异。
从资源分配来看,Genesis AI把更多精力放在数据采集、硬件对齐、数据转换和仿真环境上,模型架构等纯算法研究只占相对较小的一部分。其背后的判断是:机器人基础模型的竞争力,不只来自某个新网络结构,更来自数据、训练配方和评测体系共同构成的系统能力。
Genesis AI最终追求的是“即时部署”。衡量模型价值时,不能只看单项任务成功率,还要看为了达到这一成功率付出了多少任务专项成本。

(图:Genesis灵巧操作能力)
同样是一个小时的数据,获取方式可能完全不同。一个小时的手套数据可以由工人在正常工作过程中采集,而一个小时的机器人专项数据可能需要遥操作、场景重置、设备维护和大量人工配合。因此,评估机器人的部署成本,既要看数据时长,也要看这些数据是如何获得的。
Genesis AI希望通过扩大预训练数据规模,不断减少新任务对专项数据和微调的依赖。当机器人进入一个新场景时,不再需要为每项任务重新投入大量数据和工程资源,而是能够通过零样本能力或少量数据快速适应。

结语:
演讲的最后,王尊玄再次让大家思考这个决定资源分配方式的问题:Robotics究竟是一个全局问题,还是一个局部问题?
如果机器人必须从感知、语言、推理到控制全部重新学习,那么它需要覆盖完整智能体系的数据和算力。但另一种可能是,机器人问题可以被分层处理。
在上层,任务理解、常识推理和高层规划可以借用大语言模型、多模态大模型的能力;在底层,机器人的重点是身体控制、物理感知、接触反馈和动作反射;在两者之间,则需要建立从高层意图到物理动作的映射。
按照这一思路,机器人公司没有必要重复构建所有通用认知能力,而应把有限的数据和算力集中在物理世界特有的问题上:如何控制机器人身体,如何感知接触和作用力,如何完成高精度灵巧操作,以及如何让这些能力迁移到不同任务和场景。
这也是Genesis AI系统路线的最终落点:利用第一人称视频和手套数据扩大预训练规模,通过机器人数据完成本体对齐,通过高保真仿真进行评测与强化学习,再把模型部署到工厂、厨房等真实环境中。部署中出现的问题继续产生新数据,反过来推动硬件、模型和仿真迭代,最终形成持续运转的数据飞轮。
在机器人模型路线尚未收敛的阶段,Genesis AI给出的答案并不是死磕某一种模型架构,而是把数据、硬件、控制、模型、仿真、评测和部署连接成一个完整系统。
机器人真正的Scaling,或许不只来自更大的模型,更来自这条链路中每一个环节的协同演进。
图片资料来源:GenesisAI官方
智元机器人与觅蜂科技联合举办的“迎接物理AI智能涌现”论坛

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)