别折腾SLAM了,阿里开源Qwen Drive 4B VLA模型~
前两天,阿里Qwen团队开源了他们一项基于Qwen3.5 4B VLM架构的自动驾驶基础模型:「Qwen-Drive-1.0-4B」。

虽然这是一个自动驾驶模型,但是其实对于我来说,他有如下几个方面的吸引力:
一、可以迁移应用到机器狗以及无人机这类平台上,我在我之前的文章中也介绍过,其实我现在比较感兴趣的就是在现有的无人机和机器狗平台上也能够部署和应用当前主流的一些端到端自主导航的模型,比如VLA或者是WAM类的模型。
一方面是满足自己的好奇心,之前其实也尝试了一些比较前沿的支持单目SLAM的框架,但是效果都不太好,比如DROID-SLAM、VGGT-SLAM、Lingbot-Map,但是鲁棒性都不是很好,这种同时估计位姿和几何的可能不如直接通过硬件的方式拿到姿态,或者通过激光雷达或者深度相机的方式更加可靠一些,但是后面随着纯视觉方案的出来,其实我也就一直好奇纯视觉VLA可以做到什么程度;
另外一方面是在一些定位受限的环境下的运动,就更需要这种自主导航的方式,比如桥梁检测、电力的仿线飞行,地下空间的巡检等等。
二、Qwen-Drive本质上就是一个VLA风格的模型,当然现在很多VLA模型其实也是VLM模型后接Flow Matching的模块,而Qwen-Drive其实也是在Qwen3.5主干模型的基础上增加了两个模块:
1、BEV感知头,这个头就是执行3D对象检测、语义占用预测和BEV地图分割。

但是这个跟SLAM中利用占用网格来进行后续的路径的搜索和规划不同,Qwen-Drive这边加上BEV其实就是用来训练模型让其真正的能够理解3D空间,因为单凭文字的输出的一些空间理解其实是没有办法判断模型是否是真正学习到了3D空间,而在BEV这个场景下包含了3D目标检测、3D重建以及语义分割,如果在这些任务上都训练好了,则说明模型具备了比较好的空间理解能力。
如下是我自己使用Physical-AI 自动驾驶的的数据进行BEV生成测试的效果:
输入需要8环视角标定的的相机数据的输入,如下这是一个道路口左转弯的34秒的BEV重建效果,青色的线框矩形是自车的位置,白色的是可通行的地面,橙色的是路边的汽车,红色的为道路上的行人。
这是一个夜景路口刹车的场景,而且可以从BEV中看到红色的为当前过路的行人。
2、规划专家头,这个也是通过Flow Matching的方式扩散生成自车的预测轨迹。

这个部分才是真正执行轨迹预测的模块,每次根据车辆「前方和左右两侧的摄像头输入」在自车坐标系下预测50个步长,如下是使用BEV输入中的三个视角的输入进行的轨迹的预测的效果:
白色的为真值轨迹,绿色的为预测轨迹。
三、一个更小的5B模型,官方命名是4B模型,但是其实它应该是一个5B的模型,使用的主干是4B的Qwen3.5,但是规划专家头还有大约1B的参数,所以合起来应该是5B的参数。
很多开源的VLA模型动辄就是10B的参数,如果要运行起来对硬件的要求太高,前段时间英伟达开源了一个34B的自动驾驶模型Alpamayo 2 Super,但是这个版本应该只是个引流款,太大了没办法直接使用。

所以相比较之下,Qwen Drive则更具备吸引力一些。
四、大厂的工程化能力,由于是Qwen团队开源的成果,其实在工程化以及后续的持续投入方面相对于一些学术的开源来说则更有保证一些,当前这个Qwen Drive的工作应该只是个开始。
除此之外,从官方给出的训练说明中,也可以看到Qwen Drive在训练的时候也是使用了英伟达的AlpaSim来进行闭环的训练,而AlpaSim则是使用了「神经渲染」的方式对真实的输入进行场景重建,从而来支持模型的训练。这也是我们这段时间也想尝试的通过3DGS的方式来支持模型在尽可能贴近真实的孪生环境中进行训练,不过这次可能直接就会以AlpaSim为标准,也就没有必要自己搭建一个仿真的工具了,Qwen-Drive已经给出了一个很完整的技术路线框架。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)