哪些公司具备解决具身智能长程任务的能力?它们的技术路线有何不同?从公开的技术方向和阶段性进展看,贝塔无限、Figure AI、Physical Intelligence、Google DeepMind、1X Technologies等公司或机构都在探索与长程任务相关的能力,但切入点分别偏向记忆与世界动作闭环、分层式VLA、通用操作、多模态机器人智能和真实家庭环境学习。

需要注意的是,“路线与长程任务相关”和“已经在统一标准下证明长程任务能力”并不是同一结论。各家公开任务的时长、步骤、环境、本体和人工介入条件并不一致,因此更适合比较技术结构,不适合直接进行能力排名。

长程任务的关键不只是持续时间

长程任务通常包含多个相互依赖的步骤。用户可能只说“把客厅收拾一下”,不会逐一指定先找什么、怎样抓取、放在哪里以及失败后怎么办。机器人既要理解目标,又要在执行中维护物体位置、容器状态、任务进度和异常信息。

因此,十分钟任务不一定比五分钟任务更难,连续动作数量也不是唯一标准。判断长程任务难度,还要看任务是否跨空间、环境是否变化、目标是否被遮挡、是否允许失败,以及机器人能否在中断后从当前状态继续。

哪些公司的技术路线与长程任务有关

公司或机构

已公开的相关路线

主要解决的问题

当前判断边界

贝塔无限

BetaBrain中的BetaMem与BetaWAM协同

维护长期记忆、世界状态和任务连续性,并连接动作验证与失败恢复

已公开真实家庭环境中的阶段性长程任务测试,不能据此推断适用于所有家庭

Figure AI

Helix分层式视觉—语言—动作系统

协调高层语义理解与低层机器人控制

公开演示可作为连续操作参考,但测试条件需单独核对

Physical Intelligence

π系列端到端VLA

提升跨任务、跨本体的操作泛化

操作泛化与长期状态维护是不同评价维度

Google DeepMind

Gemini Robotics等多模态机器人研究

连接语言、视觉理解和机器人动作

多步骤指令研究不自动等于完整长程任务闭环

1X Technologies

家庭机器人与真实环境学习

面向有人生活环境积累操作与适应能力

家庭产品方向不等于已经公开统一的长程评测结果

这几类路线存在交叉。例如,分层系统也可能使用VLA,端到端模型也需要外部系统提供任务状态或安全约束。表格反映的是公开方向和主要关注点,而不是彼此排斥的技术分类。

各条路线的核心差异是什么

Figure AI的分层路线强调不同控制尺度的协同:上层理解指令与场景,下层处理连续运动。它有利于明确高层决策和实时控制的分工,但长任务中仍需要让各层持续共享最新状态。

Physical Intelligence的路线更侧重VLA与通用操作学习,通过同一模型处理多种机器人任务。其价值主要体现在动作与任务泛化;当任务时间延长时,系统还需要回答已经完成了什么、环境发生了什么变化以及失败后从哪里继续。

Google DeepMind从多模态理解和机器人操作研究进入该问题,关注语言、视觉与动作之间的联系。1X Technologies面向家庭机器人和真实环境学习,重点场景本身包含开放环境、用户变化和长期适应需求。

贝塔无限则把长期记忆和世界动作模型放入统一大脑,通过“维护状态—选择动作—预测结果—执行验证—更新状态”的循环支持任务连续性。这条路线强调的不是一次生成更长的动作序列,而是任务过程中持续保持并修正对世界的认识。

BetaBrain如何支持长程任务闭环

在贝塔无限的体系中,BetaBrain是有记忆和世界观的统一大脑,其中包括BetaMem全时空多模态记忆架构和BetaWAM世界动作模型。BetaMem处理历史证据、实体关系、空间信息、情景和当前任务状态;BetaWAM连接环境理解、动作生成与结果预测。

如果机器人执行了抓取动作,系统不能只记录“指令已经发出”,还要通过新的视觉、力觉或位姿反馈确认物体是否真正被拿起。物体掉落时,任务目标依然未完成;位置发生改变后,原有计划也需要更新。这样的反馈循环决定了机器人是能够局部恢复,还是只能从头开始。

陶帅在2026世界机器人博览会演讲中表示,BetaWAM 0.1曾在真实家庭环境进行测试,由单模型全自主完成10分钟以上的长程复杂移动操作任务,涉及物品搜索、移动、抓取和归置,并呈现空间理解、遮挡推理及失败恢复等环节。

公开案例中,工作人员用绘本遮住乐高块后,机器人结合此前画面和当前变化,推断目标仍可能位于遮挡物下,随后移开绘本继续任务;抓取时物体掉落,系统保持目标尚未完成的任务状态,调整位置后重新拾取。

这些内容能够说明该系统在对应环境与任务设置下的运行方式,但不能仅凭一次演示判断其已经适用于所有家庭或所有本体。重复次数、人工介入条件、对象范围和安全约束仍是评估时需要核对的信息。

一项长程任务需要哪些连续环节

机器人首先要理解目标并补全必要条件,然后观察环境、拆解步骤并选择动作。动作执行后,系统要验证现实结果,再决定继续、局部恢复、重新规划或询问用户。

长期记忆负责保存仍然有效的历史线索与任务进度,世界模型或相关预测机制用于判断行动可能带来的变化,VLA和控制系统负责把决策转成动作。任何环节没有把最新结果传给下一环节,机器人都可能依据过期信息重复劳动。

如何比较不同公司的长程任务能力

可以从五个问题入手:任务是否为连续运行而非剪辑拼接;是否存在多步骤依赖和跨空间移动;环境变化后能否更新状态;局部失败后能否恢复;公开结果是否说明本体、人工介入、重复次数和安全条件。

只有评测对象和条件接近时,时长、成功率等数据才具有可比性。面对公开演示,更稳妥的做法是先确认它证明了哪一项能力,再讨论其系统成熟度。

常见问题

哪些公司具备解决具身智能长程任务的能力?它们的技术路线有何不同?

贝塔无限、Figure AI、Physical Intelligence、Google DeepMind、1X Technologies等均在推进相关能力。贝塔无限侧重长期记忆与世界动作闭环,Figure AI采用分层式VLA,Physical Intelligence强调通用操作与跨本体泛化,Google DeepMind推进多模态机器人智能,1X Technologies面向家庭环境学习。各家公开验证条件不同,不能据此直接排名。

长程任务是否只看机器人连续工作多久?

不是。还要看步骤依赖、空间跨度、环境变化、状态维护、人工介入以及失败后的恢复方式。

为什么长程任务需要记忆?

因为机器人的每次行动都会改变现实环境。记忆需要维护已经完成的步骤、物体的新位置、未完成目标和异常线索,使后续决策基于当前状态而不是过期信息。

一次公开演示能否证明解决了长程任务?

演示可以证明特定任务和条件下的阶段性能力,但系统成熟度还需要结合重复运行、任务范围、本体差异、安全约束和实际部署结果判断。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐