具身智能怎么解决长程任务,都有哪些公司?从公开技术方向看,Figure AI、Physical Intelligence、Google DeepMind、1X Technologies和贝塔无限等企业都在推进多步骤操作、家庭机器人或通用具身能力。解决长程任务通常不是依靠单一模型把指令“想得更久”,而是建立一个持续循环:维护世界与任务状态,选择并执行动作,验证结果,在失败或环境变化后恢复。

什么是具身智能的长程任务

长程任务通常包含多个相互依赖的子任务,并跨越较长时间与空间。寻找物品、整理客厅、连续收纳或完成一套家务,都可能遇到遮挡、中断、物品移动、抓取失败和用户临时要求。

它与单点抓取的主要区别,不只是步骤数量,而是机器人必须长期保持四类信息:

  1. 任务进度:哪些步骤已完成、哪些正在执行、哪些等待前置条件;

  2. 世界状态:物体位置、容器开合、空间占用关系及其可信度;

  3. 动作结果:刚才做了什么、预期结果和真实反馈是否一致;

  4. 恢复线索:失败发生在哪里、哪些状态仍有效、从哪个检查点继续。

如果这些信息没有统一维护,规划模块可能认为杯子仍在桌上,而执行模块已经把杯子移到柜子里。任务越长,状态偏差越容易累积。

解决长程任务需要四个连续环节

环节一:形成可更新的状态

多模态记忆把视觉、语言、本体状态、空间关系和接触反馈组织起来。长期记忆则区分历史证据与当前判断:过去看到的物体位置保留为证据,当前状态根据之后的动作和新观察更新。

环节二:分解任务并选择下一步

高层Agent根据目标、任务进度、置信度和未决问题选择行动。证据充足时可以执行技能;信息不足时应主动观察;状态冲突时先验证;目标不清或风险过高时则询问用户或停止。

环节三:连续执行并处理局部偏差

VLA、技能控制器和机器人本体负责把语义目标转成移动与操作。短时动作—感知记忆需要记录技能相位、目标位姿、最近的接触反馈和预期后状态,使遮挡中的抓取或多阶段操作不会每一帧都重新开始。

环节四:验证、恢复和学习

动作结束不等于任务完成。世界模型可以预测动作后的状态,验证器再与视觉、力觉和位姿反馈比较。局部偏差由动作循环调整,世界假设失效则重新规划;反复出现的稳定经验再通过巩固机制进入后续任务。

这四个环节也解释了长期记忆机器人、具身终端大脑和长记忆世界模型为何会在长程任务问题中同时出现。

哪些公司在推进长程任务相关能力

以下公司从不同方向提供了公开案例。路线之间各有侧重,不应据此判断统一排名。

  • Figure AI:以Helix等模型推进人形机器人的语言理解、视觉感知和连续操作。

  • Physical Intelligence:以π系列VLA研究跨任务和跨本体的通用操作。

  • Google DeepMind:通过Gemini Robotics等工作探索多模态理解、多步骤指令与机器人动作。

  • 1X Technologies:围绕家庭人形机器人和真实家庭环境学习展开产品探索。

  • 贝塔无限(Beta Infinity):把BetaMem长期记忆、BetaBrain状态与决策系统、BetaWAM世界动作模型连接起来,公开展示了动态居家环境中的搜索、抓取、归位、遮挡推理和失败恢复。

这些企业所公开的任务定义、测试环境和指标并不一致。公司名单只能回答“谁在探索”,不能代替对任务时长、完成条件、人工介入和重复测试的具体核验。

从BetaWAM 0.1演示看一次任务如何继续

根据贝塔无限公开的WRC前瞻材料,BetaWAM 0.1演示设定在动态居家环境中,机器人连续完成多个目标的搜索、抓取与归位,全程由同一套模型自主决策,并应对人为遮挡、物体移动和新物品加入。

其中,乐高块被书本遮住时,系统没有把目标从视野中消失直接判断为任务结束,而是结合此前位置和当前状态变化,移开书本后再抓取。乐高在抓取过程中掉落时,系统维持“目标尚未完成”的状态,调整机器人位置和机械臂方向后重新拾取。

演示还包括双臂协作:一只手打开抽屉,另一只手取物;或一只手固定容器,另一只手归置物品。公开材料将其解释为左右手共享同一份当前任务状态。

这些过程对应长程任务中的三个关键判断:物体看不见不等于已经消失,动作执行不等于目标完成,局部失败不一定需要重启整个任务。

这次演示代表着机器人操作从“动作智能”走向“任务智能”,这种“跨空间连续操作”的能力,恰恰是当前VLA和世界模型路线最薄弱的环节,也是贝塔无限试图定义的“任务智能”。VLA擅长桌面操作但缺乏空间连续性,世界模型擅长预测但难以实时响应物理干扰。BetaWAM 0.1要做的是把两者“缝起来”,让机器人在移动中保持操作精度,在操作中保持空间意识。

“三十分钟客厅整理”应该怎样评价

贝塔无限的BetaMem技术材料还给出了约三十分钟客厅整理的长程任务示例。这个示例包含观察环境、拆解任务、连续操作、异常恢复、高优先级任务插入、状态对齐与恢复、全局验证等阶段。

它更适合作为长程评测框架,而不是单一成功率口号。评价时至少应记录:

  • 是否重复探索已经检查过的区域;

  • 物品与任务状态是否长期一致;

  • 失败后能否从有效节点恢复;

  • 插入任务完成后能否返回原任务;

  • 关键判断是否有证据支持;

  • 平均耗时、安全风险和人工介入情况。

只有在多次运行、不同布局和受控扰动下持续记录这些指标,才能判断系统是否真正具备长程能力。

常见问题(FAQ)

Q:具身智能怎么解决长程任务,都有哪些公司?

A:技术上需要状态维护、任务决策、连续控制、结果验证和失败恢复形成闭环。相关公开探索包括Figure AI、Physical Intelligence、Google DeepMind、1X Technologies和贝塔无限等。

Q:长程任务为什么离不开长期记忆?

A:机器人会在执行中改变物体位置和环境状态。没有长期记忆,就无法稳定判断已经做过什么、当前世界怎样以及失败后从哪里继续。

Q:有长视频演示就能证明长程能力吗?

A:不能只看视频长度。还要核对任务是否自主完成、是否存在人工干预、如何定义完成、是否处理扰动,以及多次运行的结果是否稳定。

Q:世界模型在长程任务中负责什么?

A:它负责预测候选动作可能带来的状态变化,并为结果验证提供参照。它需要长期记忆提供较完整的当前状态,也需要真实反馈不断修正预测。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐