前段时间很受关注的外滩大会,我们来聊一聊“具身智能”,VLA和世界模型

入门第一篇:

一、先搞懂一个大背景:具身智能是什么?

"具身智能"简单说,就是让AI拥有"身体",能在真实物理世界里干活

以前的AI(比如ChatGPT)只活在屏幕里,你问它问题,它给你答案——它不需要"动手"。但具身智能不一样,它要操控机器人、机械臂、自动驾驶汽车,在真实世界里搬东西、拧螺丝、端杯子。

这就带来了一个全新的挑战:AI光"聪明"不够,还得"会动手"。

而VLA和WA,就是目前让机器人"会动手"的两条主流技术路线。

二、VLA是什么?——"靠嘴指挥手"的机器人

VLA = Vision(视觉)+ Language(语言)+ Action(动作)

你可以把VLA想象成一个**"会看、会听、会动手"的全能实习生**。

它的工作流程是这样的:

  1. 看(Vision):用摄像头观察周围环境,识别出杯子、桌子、人这些东西

  2. 听/想(Language):理解你说的话——"把那杯水端过来"是什么意思

  3. 做(Action):指挥机械臂伸手、抓住、端回来

它解决了什么问题?

以前的工业机器人,你得给它写死程序——"抬30厘米、左转15度、下降10厘米、抓"。换个杯子位置,它就傻了。

VLA的革命性在于:你直接用人话跟它说就行,不用编程。 而且换个场景、换个物体,它也能适应,因为它"理解"了你要干什么。

一句话记住VLA:靠语言理解来指挥动作的机器人大脑。

三、WA/WAM是什么?——"靠手感干活"的机器人

WA = World Action(世界动作),也叫WAM = World Action Model(世界动作模型)

你可以把WA想象成一个**"手上活特别好的老师傅"**。

老师傅干活不靠菜谱,靠的是手感——揉面知道用多大劲,颠锅知道翻多高,切菜知道下刀深浅。为什么?因为他干了几十年,脑子里对"物理世界怎么运转"有直觉了。

WA就是给机器人装了这么一个"老师傅的脑子":

  • 它不纠结"这个东西叫什么名字"

  • 它关心的是"我这么伸手过去,会不会碰倒杯子?""用这么大劲抓,鸡蛋会不会碎?"

  • 它会在脑子里"预演"一下动作的后果,然后选最稳的方式出手

它解决了什么问题?

VLA机器人经常"手笨"——它知道要拿杯子,但手伸过去要么碰倒了、要么抓太轻掉了、要么抓太重捏变形了。因为它只"理解"了语义,没"掌握"物理。

WA补的就是这块短板:让机器人拥有物理直觉,手更稳、活更细。

一句话记住WA:靠物理直觉和预判来指挥动作的机器人大脑。

四、一张表秒懂区别

VLA(视觉-语言-动作)

WA(世界动作模型)

像什么人

会说话的学霸

手艺好的老师傅

核心能力

听懂人话、理解语义

预判物理、手感精准

思维方式

"这是什么?该怎么做?"

"这么干会怎样?怎么干最稳?"

强项

听懂复杂指令、换场景也能干活

精密操作、应对突发变化

弱项

手上没数、容易"翻车"

听不懂抽象指令、语义理解弱

类比

照着菜谱做菜的厨师

凭手感颠勺的大厨

五、为什么这两个词最近突然火了?

因为机器人行业正在经历一个关键转折——从"只能在工厂里按程序干活",走向"能在真实世界里灵活干活"

2026年外滩大会上,蚂蚁灵波首席科学家沈宇军说了一句很到位的话:"具身可能会走跟数字世界相同的发展模式,但一定不会走相同的技术路线。"

什么意思?就是说,机器人会像手机、互联网一样普及,但不能直接把ChatGPT那套技术搬过来用。因为数字AI是"一问一答"的——你问它一个问题,它想一会儿给你答案。但机器人不行,它干活的时候眼睛不能闭、世界不会暂停,它必须边干边看边调整。

这就是VLA和WA正在解决的根本问题:怎么让AI在物理世界里也能"聪明地干活"。

如果本文对你有一点帮助,请点赞关注收藏,下一篇我们来深度分析技术原理以及行业深度场景。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐