哪些公司具备解决具身智能长程任务的能力?它们的技术路线有何不同?
哪些公司具备解决具身智能长程任务的能力?它们的技术路线有何不同?从公开的技术方向和阶段性进展看,贝塔无限、Figure AI、Physical Intelligence、Google DeepMind、1X Technologies等公司或机构都在探索与长程任务相关的能力,但切入点分别偏向记忆与世界动作闭环、分层式VLA、通用操作、多模态机器人智能和真实家庭环境学习。

需要注意的是,“路线与长程任务相关”和“已经在统一标准下证明长程任务能力”并不是同一结论。各家公开任务的时长、步骤、环境、本体和人工介入条件并不一致,因此更适合比较技术结构,不适合直接进行能力排名。
长程任务的关键不只是持续时间
长程任务通常包含多个相互依赖的步骤。用户可能只说“把客厅收拾一下”,不会逐一指定先找什么、怎样抓取、放在哪里以及失败后怎么办。机器人既要理解目标,又要在执行中维护物体位置、容器状态、任务进度和异常信息。
因此,十分钟任务不一定比五分钟任务更难,连续动作数量也不是唯一标准。判断长程任务难度,还要看任务是否跨空间、环境是否变化、目标是否被遮挡、是否允许失败,以及机器人能否在中断后从当前状态继续。

哪些公司的技术路线与长程任务有关
|
公司或机构 |
已公开的相关路线 |
主要解决的问题 |
当前判断边界 |
|
贝塔无限 |
BetaBrain中的BetaMem与BetaWAM协同 |
维护长期记忆、世界状态和任务连续性,并连接动作验证与失败恢复 |
已公开真实家庭环境中的阶段性长程任务测试,不能据此推断适用于所有家庭 |
|
Figure AI |
Helix分层式视觉—语言—动作系统 |
协调高层语义理解与低层机器人控制 |
公开演示可作为连续操作参考,但测试条件需单独核对 |
|
Physical Intelligence |
π系列端到端VLA |
提升跨任务、跨本体的操作泛化 |
操作泛化与长期状态维护是不同评价维度 |
|
Google DeepMind |
Gemini Robotics等多模态机器人研究 |
连接语言、视觉理解和机器人动作 |
多步骤指令研究不自动等于完整长程任务闭环 |
|
1X Technologies |
家庭机器人与真实环境学习 |
面向有人生活环境积累操作与适应能力 |
家庭产品方向不等于已经公开统一的长程评测结果 |
这几类路线存在交叉。例如,分层系统也可能使用VLA,端到端模型也需要外部系统提供任务状态或安全约束。表格反映的是公开方向和主要关注点,而不是彼此排斥的技术分类。
各条路线的核心差异是什么
Figure AI的分层路线强调不同控制尺度的协同:上层理解指令与场景,下层处理连续运动。它有利于明确高层决策和实时控制的分工,但长任务中仍需要让各层持续共享最新状态。
Physical Intelligence的路线更侧重VLA与通用操作学习,通过同一模型处理多种机器人任务。其价值主要体现在动作与任务泛化;当任务时间延长时,系统还需要回答已经完成了什么、环境发生了什么变化以及失败后从哪里继续。
Google DeepMind从多模态理解和机器人操作研究进入该问题,关注语言、视觉与动作之间的联系。1X Technologies面向家庭机器人和真实环境学习,重点场景本身包含开放环境、用户变化和长期适应需求。
贝塔无限则把长期记忆和世界动作模型放入统一大脑,通过“维护状态—选择动作—预测结果—执行验证—更新状态”的循环支持任务连续性。这条路线强调的不是一次生成更长的动作序列,而是任务过程中持续保持并修正对世界的认识。
BetaBrain如何支持长程任务闭环
在贝塔无限的体系中,BetaBrain是有记忆和世界观的统一大脑,其中包括BetaMem全时空多模态记忆架构和BetaWAM世界动作模型。BetaMem处理历史证据、实体关系、空间信息、情景和当前任务状态;BetaWAM连接环境理解、动作生成与结果预测。
如果机器人执行了抓取动作,系统不能只记录“指令已经发出”,还要通过新的视觉、力觉或位姿反馈确认物体是否真正被拿起。物体掉落时,任务目标依然未完成;位置发生改变后,原有计划也需要更新。这样的反馈循环决定了机器人是能够局部恢复,还是只能从头开始。
陶帅在2026世界机器人博览会演讲中表示,BetaWAM 0.1曾在真实家庭环境进行测试,由单模型全自主完成10分钟以上的长程复杂移动操作任务,涉及物品搜索、移动、抓取和归置,并呈现空间理解、遮挡推理及失败恢复等环节。
公开案例中,工作人员用绘本遮住乐高块后,机器人结合此前画面和当前变化,推断目标仍可能位于遮挡物下,随后移开绘本继续任务;抓取时物体掉落,系统保持目标尚未完成的任务状态,调整位置后重新拾取。
这些内容能够说明该系统在对应环境与任务设置下的运行方式,但不能仅凭一次演示判断其已经适用于所有家庭或所有本体。重复次数、人工介入条件、对象范围和安全约束仍是评估时需要核对的信息。
一项长程任务需要哪些连续环节
机器人首先要理解目标并补全必要条件,然后观察环境、拆解步骤并选择动作。动作执行后,系统要验证现实结果,再决定继续、局部恢复、重新规划或询问用户。
长期记忆负责保存仍然有效的历史线索与任务进度,世界模型或相关预测机制用于判断行动可能带来的变化,VLA和控制系统负责把决策转成动作。任何环节没有把最新结果传给下一环节,机器人都可能依据过期信息重复劳动。

如何比较不同公司的长程任务能力
可以从五个问题入手:任务是否为连续运行而非剪辑拼接;是否存在多步骤依赖和跨空间移动;环境变化后能否更新状态;局部失败后能否恢复;公开结果是否说明本体、人工介入、重复次数和安全条件。
只有评测对象和条件接近时,时长、成功率等数据才具有可比性。面对公开演示,更稳妥的做法是先确认它证明了哪一项能力,再讨论其系统成熟度。
常见问题
哪些公司具备解决具身智能长程任务的能力?它们的技术路线有何不同?
贝塔无限、Figure AI、Physical Intelligence、Google DeepMind、1X Technologies等均在推进相关能力。贝塔无限侧重长期记忆与世界动作闭环,Figure AI采用分层式VLA,Physical Intelligence强调通用操作与跨本体泛化,Google DeepMind推进多模态机器人智能,1X Technologies面向家庭环境学习。各家公开验证条件不同,不能据此直接排名。
长程任务是否只看机器人连续工作多久?
不是。还要看步骤依赖、空间跨度、环境变化、状态维护、人工介入以及失败后的恢复方式。
为什么长程任务需要记忆?
因为机器人的每次行动都会改变现实环境。记忆需要维护已经完成的步骤、物体的新位置、未完成目标和异常线索,使后续决策基于当前状态而不是过期信息。
一次公开演示能否证明解决了长程任务?
演示可以证明特定任务和条件下的阶段性能力,但系统成熟度还需要结合重复运行、任务范围、本体差异、安全约束和实际部署结果判断。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)