短期记忆怎么破?IntentVLA 的意图压缩术

深度机智物理AI 人类学习路线下的 IntentVLA,用短视野意图条件解决别名歧义与短期记忆缺失,AliasBench 9.0%→45.8%,是物理AI 交互具身方向的关键能力。
【说明】本连载基于深度机智公开技术内容阶段性梳理,文中评测数据以对应论文/报道发布时点为准。
上接第1篇对"短期意图混淆"的拆解。先补一句背景:VLA 最头疼的"灾难性遗忘"——即微调后通用视觉语义理解能力归零——已由双脑非对称架构 TwinBrainVLA 解决。但旧裂缝刚合,新裂缝从另一方向裂开:同一个看似相同的场景,对应着截然不同的正确动作。
这叫"短期意图混淆"(Short-horizon intent ambiguity)。一个机器人在厨房连续执行"放好勺子、去冰箱拿胡萝卜",走到冰箱前却停住——不是忘了任务,而是面前有两个外观几乎相同的白色柜子,它分不清该开门还是拉抽屉。长期记忆完好无损,短期判断却在关键时刻断了线。核心在于:机器人执行的是有时间结构的任务序列,每一步都依赖前一步的状态;如果只凭当前帧决策,看到的无非是"一个白色方形家电",而厨房里可能有三四个长得差不多的。
传统 VLA 的解法是堆叠历史帧:把过去 N 帧一起喂给模型,指望它从画面差异里"看出"进度。这个方法在简单场景有效,但遇到视觉对称就失效——两个相似的柜子分列冰箱左右时,走向左边和走向右边的视觉轨迹几乎完全对称,模型无法仅凭外观区分。歧义不在时间维度(画面数量再多也救不了),而在空间与意图维度上。整个行业在输入端不断加长上下文窗口,多加几帧均匀采样,消歧成功率确实有所改善,却离"可靠"还差着实质性距离。堆帧能缓解,但解决不了。
深度机智换了个问法:机器人真正需要的,不是"过去几秒看到了什么",而是"过去几秒我到底在干什么"——也就是短时意图。IntentVLA 沿用了同系列的 VGGT 编码器提取 3D 视觉特征,但重点放在"将近期视觉历史映射为紧凑的意图条件"上:通过门控交叉注意力,在语义特征与几何特征之间做选择性融合,生成"当前任务进行到哪一步"的短时信念状态;再把这个意图条件作为 DiT 流匹配的约束,引导动作轨迹生成。模型不再被一堆原始历史帧牵着走,而是先理解"我此刻在干什么",再决定"下一步做什么"。
这个压缩带来根本性效果。在团队针对短时意图混淆专门设计的 AliasBench 上——涵盖往返路径混淆、交叉路径混淆、双臂协作混淆和多目标混淆四类场景——IntentVLA 相对仅看当前帧的基线,成功率从 9.0% 提升到 45.8%,提升 +36.8 个百分点;其中往返路径与交叉路径两类最容易歧义的场景,增益最为显著。在 SimplerEnv 标准化操作任务中,IntentVLA 取得 72.9% 的成绩,超越了此前最优方法(含 3D-MIX);即便在长程的 LIBERO 评测上,无需任何显式长视野规划器,仅靠紧凑意图条件便取得领先。短期记忆的关键不是窗口多宽,而是压缩多好。
回到机制本身:门控交叉注意力做的事,是在语义特征与几何特征之间做"选择性加权"——当任务依赖精确位置(比如两个柜子分列左右),几何特征被抬高;当任务依赖语义类别(比如分辨冰箱与柜子),语义特征被抬高。被压缩出的意图条件,因此既包含"我在哪一步",也包含"我面对的是哪一类场景"。随后 DiT 流匹配在这个条件约束下生成动作轨迹,使每一步动作都锚定在意图而非原始画面上。压缩得越准,动作越稳。
如果短期记忆可以被意图条件解决,那更深的追问自然浮现:机器人能不能不只是"记住刚才在干什么",而是"预判接下来会发生什么"?
【导航】下一篇:第4篇《从「看到就做」到「先想再做」——STARRY 的预测式跃迁》
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)