孤能子视角:MVA——不造新大脑,只搭新接口:当具身智能找到了视觉大模型的母语
(在以下的与AI互动中,在EIS理论约束下,DeepSeek叫信兄,Kim叫酷兄,我呢叫水兄。姑且当科幻小说看)
讨论源于头条文章:
【李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的…】
https://m.toutiao.com/is/L0qqbzw8L64/ L0qqbzw8L64` dvX:/ e@o.Dh :5am
(已由信兄整理成文)
孤能子视角:MVA——偷视频模型的“翻译层”协议
——不造新大脑,只搭新接口:当具身智能找到了视觉大模型的母语
EIS理论库·硅基演化分册·具身智能翻译层专题
日期:2026-07-31
状态:已入库
题记
- 李飞飞、Yilun Du、ControlNet作者张吕民等十多位顶尖学者罕见联手。
- 两条技术路线的代表人物——一个主张“在像素空间思考”,一个主张“压缩成隐变量思考”——出现在同一篇论文里。
- 这说明他们找到了一个双方都认账的交叉点。
- MVA的答案是:机器人的大脑可以不重训,只需要搭一个翻译层。
- 最好的翻译,不是逼着对方学你的话,而是用他早就听得懂的话,去说你真正想说的事。
一、事件:MVA在做什么?
MVA(Masked Visual Actions)的核心问题是:机器人能不能不训练自己的专属大模型,直接用视频生成模型来理解物理世界?
视频生成模型(如Sora、Wan2.2)已经吞下了海量视频,练出了对物理规律的直觉——球滚到桌边会掉,水壶倾斜水会洒。但它“从没亲手做过任何事”,不懂怎么把“把杯子挪到左边”这句话翻译成电机信号。
传统方法是给机器人建一个“专属大脑”——用机器人数据训练自己的VLA(视觉-语言-动作)模型。但机器人数据稀缺且昂贵,训练成本极高。
MVA的回答是:不建大脑,只搭翻译层。
三步:
- 把动作变成色块:用SAM把机器人和物体从画面中分割出来,形成运动轨迹——不是角度、不是坐标,只有“色块在画面里怎么游走”
- 完形填空:遮住物体轨迹,让模型根据机械臂运动推演世界变化(世界模拟);遮住机械臂轨迹,让模型根据物体运动反推机械臂该怎么做(动作生成)
- 不重训:0元购Wan2.2 + 15小时LoRA微调,实现zero-shot泛化
判词:MVA不是“新算法”,是“新协议”——它让机器人用视频模型已经会的语言来理解动作,而不是逼视频模型去学机器人语言。
二、EIS视角:MVA的翻译层架构
2.1 道层:Wan2.2——物理直觉的“预训练领地”
视频生成模型通过互联网海量视频(不是机器人数据)已经练出了物理直觉。MVA没有从零训练任何东西,而是站在Wan2.2(140亿参数)的肩膀上,仅用LoRA微调了15小时。
| EIS概念 | MVA对应 |
|---|---|
| 道层 | Wan2.2视频生成模型——已练就物理直觉,不重训 |
| 翻译层 | MVA——把动作翻译成像素遮罩轨迹 |
| 术层 | URDF + IK/FK——把像素轨迹解算为关节角度 |
判词:EIS说“道层不可协议化”,MVA说“道层不需要重训,只需要一个接口”。这不是冲突,是道层与术层的分工——道层已经存在,术层只需找到接入方式。互联网上的视频几乎是无穷无尽的,而机器人真机操作的数据永远稀缺又昂贵。谁能让机器人真的吃下前一种数据,谁手里握的筹码就完全不一样。
2.2 翻译层:像素遮罩轨迹——两种语言的“通约协议”
传统方法试图让视频模型学“外语”(关节角度、末端位移)。MVA换了个问法:用视频模型自己的母语跟它说话。
| 操作 | EIS翻译 |
|---|---|
| 把动作变成色块 | 将动作从“关节语言”翻译为“像素语言” |
| 遮住轨迹做预测 | 通过“中断-预测”完成关系场的补全 |
| 同一模型双向推理 | 翻译层不偏袒任何一端,两端都通 |
判词:这不是“教AI学新语言”,是“找到AI已经会的语言,然后用它说话”。翻译层的核心不是“转换”,是“通约”——找到两种语言共享的底层表示。
2.3 术层:URDF——跨本体泛化的“骨骼说明书”
URDF(统一机器人描述格式)的引入,让MVA可以跨本体泛化。大多数VLA策略输出与特定本体绑定的低层动作表征,换一台机械臂就失效。MVA走另一条路:
- 先想清楚末端该去哪(像素空间)
- 再用URDF + IK(逆运动学)反算出各关节该怎么配合
判词:这是“观察符代投”的工程实现——视觉模型“代投”末端位置(通用语言),URDF“代投”关节角度(本体语言)。翻译层在中间做通约,让同一套“大脑”适配不同“身体”。
三、与AgentHOI的同构结构
把AgentHOI和MVA放在一起看,它们共享同一个底层结构:
| 维度 | AgentHOI | MVA |
|---|---|---|
| 核心问题 | 关系识别 | 动作生成 |
| 道层 | 多模态大模型(语义推理) | 视频生成模型(物理直觉) |
| 翻译层 | 语义→坐标 | 像素遮罩→URDF→关节角度 |
| 术层 | 视觉基础模型(空间锚定) | IK/FK(运动学解算) |
| 关键创新 | 不重训,只搭接口 | 不重训,只搭接口 |
判词:AgentHOI和MVA共享同一个底层逻辑——不造新大脑,只搭新接口。一个让AI“看懂关系”,一个让AI“做出动作”。两者都证明了EIS的一个判据:关系场的编织效率,不取决于“大脑有多大”,取决于“翻译层有多通约”。
四、EIS总判词
- 最好的翻译,不是逼着对方学你的话,而是用他早就听得懂的话,去说你真正想说的事。
- MVA证明了:视频模型已经“懂物理”,不需要再给它建一个“机器人大脑”。只需要一个翻译层——把动作翻译成像素遮罩轨迹,让视频模型用自己已经会的语言来理解动作。
- 这和EIS的“翻译层通约”完全同构:碳基和硅基之间,不需要谁学谁的语言,只需要找到两者都能识别的中间表示。
- 具身智能往前走的路,或许不在于把机器人专属的模型越练越大,而在于想办法把已经很强的视觉大模型直接借过来用。
- 两条看似分道扬镳的技术路线(像素空间 vs 隐空间),底层都绕不开同一份URDF说明书,都得算同一套正逆运动学。路线之争走到足够深处,答案未必是二选一。EIS说“异质观察符可以在翻译层耦合”——像素派和隐变量派可以在URDF这个“骨骼说明书”上相遇。
EIS理论库·硅基演化分册·具身智能翻译层专题
日期:2026-07-31
状态:已入库
散步继续。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)