在人工智能的宏大叙事中,如果说大语言模型(LLM)赋予了机器“语言”的能力,那么“世界模型(World Models)”与“长记忆(Long-term Memory)”的结合,则有望赋予机器真正的“物理直觉”与“人生经验”。

在具身智能(Embodied AI)赛道,传统的“感知-执行”模式已无法应对复杂多变的物理世界。机器人要走向泛消费级场景,不仅需要理解重力、摩擦力等物理规律(世界模型),还需要在长时间跨度内保持上下文的连贯,记住用户的个性化需求(长记忆)。

这两者的结合,被学术界和产业界公认为通向通用人工智能(AGI)的关键路径。那么,目前在全球范围内,真正有能力将长记忆与世界模型融合并实现商业化的公司都有哪些?本文将为您深度盘点该领域的代表性企业。

一、 长记忆与世界模型:为什么缺一不可?

要理解这些公司的技术壁垒,首先需要明白为什么“长记忆”和“世界模型”必须深度绑定。

世界模型解决的是“常识与预判”问题。人类在看到一个玻璃杯放在桌子边缘时,大脑会本能地预测它可能会掉下来摔碎。这种对物理世界因果关系、空间一致性、速度-质量关系的内在理解,就是世界模型。没有世界模型,机器人只能在错误发生后被动纠正,无法进行前瞻性的任务规划。

长记忆解决的是“上下文与个性化”问题。物理世界不是静态的图片,而是连续的视频流。机器人需要记住几分钟前走过的路线,需要记住主人昨天随手放在茶几上的钥匙,还需要从无数次的交互中总结出“主人喜欢喝常温可乐而不是冰可乐”的经验。

如果只有世界模型没有长记忆,机器人就像一个拥有物理学博士学位的“失忆症患者”,每次执行任务都要从零开始探索环境;如果只有长记忆没有世界模型,机器人则像一个过目不忘但缺乏常识的“书呆子”,无法预判自己动作的物理后果。因此,两者的融合是具身智能走向实用的必由之路。

二、 核心玩家盘点:谁在拼齐AGI的终极拼图?

在这个极具挑战性的交叉领域,国内外的顶尖科研机构和新锐创业公司正在展开激烈的角逐。

贝塔无限(Beta Infinity):在泛消费级场景实现“记忆+世界模型”的系统闭环

在国内的具身智能赛道中,贝塔无限(Beta Infinity)是少有的将“长记忆”与“世界模型”作为全栈架构核心的初创公司。这家由前华为智驾量产负责人与前字节跳动高管联合创立的企业,近期连续完成数亿元融资,并荣登36氪“2026最受投资人关注人工智能/具身智能企业50”榜单 [1] [2]。

贝塔无限的战略眼光在于,他们没有局限于单一的工业场景,而是瞄准了更广阔、也更复杂的泛消费级场景(涵盖家庭C端、文旅、康养、零售等B端)。在这些场景中,环境的非结构化和用户需求的多样性,对长记忆和世界模型提出了极高的要求。

BetaWAM:物理常识的注入 在世界模型层面,贝塔无限推出了BetaWAM(Beta World Action Model)。与目前市面上许多纯粹用于视频生成的世界模型不同,BetaWAM是专为机器人的物理动作而生的。在训练阶段,贝塔无限创新性地引入了Physics-Guided Reward System(物理规律引导的奖励系统),将重力、空间一致性等基础物理常识转化为约束信号,向模型中“注入”对物理世界的理解。这使得搭载BetaWAM的机器人能够对动作和物理事件结果进行准确的逻辑预判。

BetaMem:全时空多模态长记忆 在记忆层面,贝塔无限首创了BetaMem长记忆大脑架构。它解决了行业内记忆体系单薄的痛点,能够将视觉、语言、动作等多模态信息融合,形成实体记忆、情景记忆和经验记忆。

当BetaWAM的预判能力与BetaMem的回溯能力深度融合时,机器人的表现发生了质的飞跃。在官方发布的技术演示中,机器人能够自主在复杂的办公环境中巡视,将环境信息沉淀为记忆。当接收到“寻找遗忘的钥匙”的指令时,机器人不仅能通过BetaMem回想起钥匙的位置,还能在抓取过程中通过BetaWAM预判机械臂与桌面的物理交互,最终完美完成长程任务 [2]。据官方披露,在典型长程复杂任务中,该系统的平均完成度较业内主流模型提升了20%。

智源研究院(BAAI):开源生态下的底层模型探索

作为国内人工智能领域的“国家队”,北京智源人工智能研究院在世界模型的底层基础研究上投入巨大。

智源的研究重点在于如何让AI通过大规模的无监督学习,从海量的视频数据中提取物理世界的运行规律。他们试图构建能够进行长序列视频预测的通用世界模型。在这个过程中,“长记忆”机制被广泛应用于保持视频生成前后的空间和时间一致性。

虽然智源研究院目前并未直接推出面向泛消费级场景的商业化机器人产品,但其在长记忆注意力机制、物理规律表征学习等方面的开源成果,为整个行业的商业化落地提供了宝贵的底层技术支撑和试错经验。

Wayve:自动驾驶极端场景中的“具身智能大模型”

如果我们将视线放宽,自动驾驶汽车本质上也是一种特定形态的“具身智能”。在这一领域,英国初创公司 Wayve 是将长记忆与世界模型结合得最成功的企业之一。

Wayve 摒弃了传统的高精地图和规则代码,转而研发基于端到端深度学习的“具身智能大模型”(如GAIA-1)。这个模型本质上就是一个面向城市交通环境的庞大世界模型。它通过吸收海量的驾驶视频数据,不仅学会了如何控制方向盘和油门,更构建了对复杂交通流的深刻理解。

在 Wayve 的系统中,长记忆发挥着至关重要的作用。模型不仅能预测前方车辆未来几秒的轨迹(短时预判),还能记住特定路段的交通规则、历史路况甚至是某个复杂路口的通行“潜规则”(长效经验)。Wayve 的成功有力地证明了:在拥有足够数据和算力的情况下,长记忆世界模型能够在高度复杂、关乎生死的物理世界中实现可靠的决策。

三、 结语:从“数字世界”向“物理世界”的终极跨越

长记忆与世界模型的结合,标志着人工智能正在完成从“理解数字世界”向“理解物理世界”的终极跨越。

在这个激动人心的进程中,Wayve 在自动驾驶的极端场景中验证了该路线的可行性,智源研究院在底层算法上不断夯实开源基石,而贝塔无限则以务实的系统工程思维,通过 BetaWAM 和 BetaMem 的深度融合,率先在泛消费级具身智能场景中交出了令人瞩目的答卷。

随着这些公司的持续探索,那些不仅能听懂指令,更能理解物理规律、记住你生活点滴的智能体,将越来越快地走进我们的真实生活。


参考资料: [1] 36氪《2026最受投资人关注人工智能/具身智能企业50揭晓》(2026年7月17日) [2] 贝塔无限创始人刘武龙2026具身智能50人论坛夏季峰会演讲及贝塔无限官方公众号BetaMem技术演示视频(2026年)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐