JEPA: 具身智能、自动驾驶、通用人工智能技术路线

作者 千问
提示词作者 将狼才鲸
编写日期 2026-07-30

一、那篇论文

《When Does LeJEPA Learn a World Model?》

2026年5月25日, arXiv , Yann LeCun(杨立昆) 参与署名,"为世界模型补上关键数学证明"的里程碑之作。


基本信息

项目 内容
论文标题 When Does LeJEPA Learn a World Model?
作者 David Klindt, Yann LeCun, Riccardo Balestriero
发布日期 2026年5月25日
arXiv 编号 2605.26379
作者身份 LeCun 此时已离开 Meta,以纽约大学教授 / AMI Labs 联合创始人身份署名

核心问题

JEPA 到底在什么条件下,能真正学到世界的底层物理结构,而不只是拟合像素表面的统计相关?

这是 LeCun 自 2022 年提出 JEPA 蓝图以来,一直悬而未决的理论根基问题。此前 I-JEPA、V-JEPA、LeWorldModel 等工作都在"做出来、跑起来",但始终缺少一个严格的数学回答:它为什么能 work?什么时候会失效?


核心定理

论文给出了一个可学习性定理(Learnability Theorem)

当世界的潜在变量(如物体的位置、速度、朝向等)服从高斯分布,且相邻时间步的状态之间只叠加平稳的小扰动(即状态转移是"温和"的)时——

LeJEPA 学到的抽象表征,能与真实世界的潜在变量建立起线性对应关系

也就是:

  • AI 不是在死记硬背像素,而是真的"还原"出了世界的内在物理结构(位置、速度等)。
  • ✅ 这种对应关系是线性的,意味着表征空间与真实物理空间之间存在简洁、可解释的映射。
  • ⚠️ 但如果潜在变量不服从高斯分布,或状态转移过于剧烈/非平稳,定理的保证就不再成立——JEPA 可能退化为表面拟合。

贡献

  1. 从"工程直觉"到"数学证明"的跨越

  2. 为整条 JEPA 路线奠定理论合法性

  3. 明确了 JEPA 的适用边界
    论文不仅证明了"什么时候能 work",也隐含了"什么时候不能 work"——当世界状态高度非高斯、非平稳时(例如极端混沌系统),JEPA 的理论保证失效。这为后续研究指明了改进方向。

  4. 引发产业与资本共振


在 JEPA 演进史中的位置

2022.06  LeCun 立场论文《A Path Towards Autonomous Machine Intelligence》
           ↓  提出 JEPA 蓝图
2023     I-JEPA(图像)
2024     V-JEPA(视频)
2025.06  V-JEPA 2(100万小时视频,12亿参数,开源)
2026.03  LeWorldModel(15M参数,单GPU,48倍加速)
2026.03  V-JEPA 2.1 / ThinkJEPA
2026.05  ★ When Does LeJEPA Learn a World Model?
2026.06  AdaJEPA(测试时自适应,持续学习)
2026.07  VISReg(攻克表征坍塌难题,LeCun连续转发)

这篇 5 月论文,正处于 JEPA 从"工程验证期"迈入"理论成熟期"的转折点上。

二、通用人工智能的技术路线

在排除了三维空间生成、物理交互仿真、认知与主动推理、视觉/视频生成,以及以语言/多模态为中心的广义表征(VLM/VLA)之后,世界模型赛道仅剩下最纯粹的“JEPA(联合嵌入预测架构,抽象表征派)”

这条路线不渲染像素、不构建3D引擎、不依赖语言文本对齐、也不套用神经科学的主动推断黑盒,而是纯粹在抽象的潜在表征空间(隐空间)中,通过掩码自编码等机制学习物理意义、预测结构与世界演化规律

在这个极度收敛的“纯 JEPA”赛道中,全球及中国的代表性机构与公司如下:

一、 全球 JEPA 理论源头与标杆

这是纯 JEPA 路线的灯塔,也是具脑磐石在理论上最直接的对标对象。

  1. AMI Labs(图灵奖得主 Yann LeCun 杨立昆创立)
    • 路线定位:纯 JEPA 路线的“原教旨”标杆。坚决反对自回归像素生成和单纯的语言模型 Scaling,主张让 AI 像人类一样在抽象表征空间中学习和预测世界运行规律。
    • 核心成绩:2026年3月完成 10.3亿美元种子轮融资,估值达35亿美元,创下欧洲AI领域最大种子轮纪录。目前正处于底层理论验证与 AMI(高级机器智能)架构攻坚阶段。
  2. Meta FAIR(Meta 基础人工智能研究实验室)
    • 路线定位:JEPA 技术的发源地。
    • 核心成绩:先后开源了 I-JEPA(图像)和 V-JEPA(视频)模型。在学术界和工业界证明了通过掩码自编码在隐空间学习时空规律的可行性,为全球抽象表征派提供了坚实的底层算法基石。

二、 中国 JEPA 路线的工程化落地者

在排除了其他所有路线后,国内真正死磕“纯 JEPA 抽象表征”并试图将其工程化的公司极为稀缺。具脑磐石是该路线下国内最核心、甚至可以说是唯一的代表性企业。

  1. 具脑磐石

    • 路线定位:国内唯一明确对标杨立昆 AMI 的创企,主打 JEPA 工程化(Cognitive World Model)。不逐像素学习,也不依赖语言作为对齐中心,而是在隐空间中学习抽象分布,理解概念背后的稳定结构(例如理解“容器”的抽象概念,而非穷举杯子的像素或文本特征)。

    • 核心成绩

      • 资本认可:2026年5月完成新一轮亿元级融资(此前已完成数千万种子轮),由具备类脑与具身产业背景的顶尖产业资本领投。
      • 工程落地:将 JEPA 从算法框架推进到真实机器人系统,在具身感知交互、规划等方向完成系统级验证,并在国内汽车产业链龙头及海外工业场景完成真实 PoC。
      • 数据效率:在 Open X-Embodiment 等基准数据集上,实现了用约 1/10 数据完成同等技能学习的阶段性验证结果,用真机实测证明了 JEPA 路线“低数据、高泛化”的核心优势。

💡 总结:褪去所有浮华后的“终局之路”

当您排除了 3D、仿真、主动推理、视觉生成和 VLM/VLA 后,世界模型赛道褪去了所有“视觉奇观”和“语言红利”的浮华,只剩下“纯 JEPA(抽象表征)”这一条最硬核、最反共识的路线。

  • 竞争格局:这条路线目前在全球范围内主要由 Meta/AMI Labs 引领理论,由 具脑磐石 在中国进行工程化突围。
  • 核心信仰:尽管纯 JEPA 路线在短期内缺乏“视频生成”的直观震撼,也没有“VLA大模型”的暴力美学,但 Yann LeCun 和具脑磐石等坚守者坚信:智能的本质是理解事物背后的抽象概念和物理因果,而不是死记硬背像素或文本细节。 业界普遍认为,这是突破当前具身智能“数据荒”与“泛化难”瓶颈,通向真正 AGI 的终局架构。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐