登录社区云,与社区用户共同成长
邀请您加入社区
作者|黄思腾,阿里巴巴达摩院算法专家 摘要 Vision-Language-Action (VLA) 模型被视为通向通用机器人智能的必经之路,因为它首次将“看见环境、理解指令、生成动作”统一到同一框架中,使机器人有望像大模型理解世界一样理解任务,并在开放环境中完成更灵活的泛化与交互。相比传统为单一任务、单一场景定制的控制范式,VLA展现出跨任务迁移、自然语言驱动操作以及