你的困惑非常真实,也是当前具身智能领域最核心的争论点。你感受到的“demo很炫酷,问题依旧多”,恰好点中了VLA从学术研究走向物理世界所面临的真正挑战。

我试着针对你的几个问题,提供一些更深入的视角。

🤔 问题一:机器人数据真能scale到VLM的规模吗?
答案是:目前不能,且差距是数量级的。

VLM(视觉语言模型)的训练数据是互联网上唾手可得的数十亿图文对。而机器人领域,即便是谷歌开源的、号称史上最大规模的Open X-Embodiment数据集,也仅有170万条轨迹。这放在深度学习的尺度里,连VLM数据量的零头都够不上。

这个差距的背后是物理世界数据的昂贵与稀缺:

采集成本极高:依靠专家示教,一小时往往只能产出几十条有效数据,人力和时间成本高达数千元。

任务多样性差:数据大多集中在pick-and-place等重复性任务上,远不如互联网图文内容五花八门。

仿真数据有鸿沟:仿真环境(Sim)的物理参数是理想化的,与真实世界(Real)的复杂情况相去甚远,Sim2Real的鸿沟始终存在。

数据孤岛现象:不同厂商、不同机器人本体采集的数据互不流通,进一步限制了可用数据的总量和多样性-。

学术界也意识到了这个问题,正在探索利用海量人类操作视频来训练VLA-。例如,英伟达的EgoScale项目就在2万小时的第一视角人类视频上训练,并发现了数据规模与模型性能间的Scaling Law。但如何有效利用这些“非完美”数据,仍是巨大挑战-。

🧠 问题二:暴力拟合参数,真能在真机上泛化吗?
暴力拟合参数这条路,在物理世界大概率走不通。 VLA和VLM之间,存在一道关于“物理因果”的鸿沟。

从“统计关联”到“物理因果”:语言是离散符号系统,模型可以通过统计关联来学习。但物理世界是连续、高维且非线性的。一个杯子,材质、重量、形状的细微变化就能衍生出无数种情况,靠模型死记硬背根本不现实。VLA需要理解的是“物理因果”,而不仅仅是“统计关联”。

泛化的“假象”:有研究指出,VLA在基准测试上的性能提升,可能源于语义匹配或分布重叠,而非真正的物理泛化。换言之,模型可能只是“见过”类似场景,而非“理解”了物理规律。

VLM的局限:VLM本身缺乏真实的3D空间推理能力和物理世界常识,其决策有时并不符合物理规律。这也解释了为何模型合并(Model Merging) ——在NLP领域很有效的方法——在VLA上应用时,成功率几乎为零。

⚡️ 问题三:VLA的推理速度,能完成高动态任务吗?
这是目前最实际的工程瓶颈,但也是最有希望快速解决的问题。

VLA模型的计算和内存需求巨大,这与机器人对实时性的要求直接冲突。目前的VLA大多在做慢速的“Pick and Place”,其推理速度(端到端延迟)远不能满足高频控制需求。

不过,整个社区都在全力攻克这个难题,涌现了许多有趣的方向:

异步架构:将“慢思考”(高层决策)和“快执行”(底层控制)解耦。例如 VLA-RAIL 将推理与控制异步进行,保证动作的流畅与高速-;AsyncVLA 则将大模型放在云端做规划,机器人端仅部署一个轻量级适配器来高频执行。

双系统融合:借鉴人类“系统1(快思考)”和“系统2(慢思考)”的理论,将两者融合在一个模型中。例如 Fast-in-Slow (FiS),能让系统1(执行模块)共享系统2(VLM)的丰富知识,同时实现高达 117.7 Hz 的控制频率。

软硬件协同设计:从模型和芯片两端入手优化。例如 RhinoVLA,通过采用Token高效的视觉编码器和硬件感知的编译优化,在边缘芯片上达到了 11.69 Hz 的端到端推理频率,满足了10Hz的实时闭环控制目标。

🎭 “demo很炫酷,问题依旧多”的背后
你这种感觉,其实反映了当前具身智能领域的一个结构性矛盾。

一方面,是来自资本和市场的巨大期望,将VLA推上了“神坛”。另一方面,是技术落地的冰冷现实。宇树科技CEO王兴兴就曾直言,“现在对具身智能和机器人来说,AI模型完全不够用” -。英伟达机器人负责人Jim Fan更是给出了 “VLA已死” 的论断,引发了行业对下一代架构的讨论-。

这种“撕裂感”也体现在行业共识上:VLA并非方向错误,而是受限于当下的技术与数据条件,难以快速实现通用化突破。

💎 总结:VLA能走通吗?
所以,回到你最核心的问题:VLA真的能走通吗?

我的看法是:VLA作为“大脑”的雏形有巨大价值,但作为“全能王”的路线可能走不通。

短期(1-3年):VLA会在特定的、低速的、结构化的场景中落地,如工业抓取、仓储物流。通过软硬件协同设计和异步架构,实时性问题会逐步得到解决。

长期(3-5年及以上):VLA大概率不会是一个 monolithic(单体)的“万能模型”。它更可能演变为一个 “VLM规划器 + 专用动作控制器”的混合架构。正如一些专家所言,VLA是“锦上添花”的方向,但物理智能的问题,终究要回到物理智能本身去解决-。

你感受到的“问题很多”,恰恰说明这个领域还处于“蛮荒时代”。VLA不是终点,但很可能是通往通用机器人路上,一个无法绕过的起点。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐