具身智能专题:人类开车演示还能被超过吗?小米DriveZero靠闭环RL做到了
(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!
论文标题:DriveZero: End-to-End Driving Beyond Human Demonstrations
论文作者:小米汽车AD与Robotics L3团队
发表时间:2026年9月5日
本文要点
(1)DriveZero是小米汽车AD与Robotics L3团队2026年9月5日挂出的端到端驾驶系统,感知用DriveVFM,动作用DriveRL,再蒸馏成只看相机的规划器。
(2)DriveRL加测试时搜索在nuPlan六项均分93.57,超过日志回放专家。相机版DriveZero-Scale在NAVSIMv1 navtest拿到95.3 PDMS,人类驾驶员是94.8。
(3)做法上两点最值得看,日志只负责搭交互世界、轨迹标签来自PPO老师,以及同一场景换导航意图再问老师,补出日志里没有的合法开法。
(4)短板也很硬。去掉意图扩增,老师轨迹监督只有93.61,低于人类轨迹的93.92。学生在开环里学,真车展示的是特权策略,没有公开里程和碰撞数字。
(5)文末抄官方DriveRL评估入口。GitHub截至9月16日仍把DriveZero和DriveVFM列在待办,权重也未随文放出。
小米汽车AD与Robotics L3团队在2026年9月5日把DriveZero技术报告挂上arXiv,编号2609.06055,v1就是这一版。我把HTML版从头对了一遍,又对照了GitHub README和Hugging Face论文页。
截至9月16日,仓库有105个Star,Hugging Face论文页有63个赞。报告写得很冲,端到端驾驶的行为可以越过人类演示数据的上限。
冲的地方在成绩。特权老师DriveRL加上基于价值的测试时动作搜索,在Val14、Test14-hard、Test14-random的非反应式和反应式六项上均分93.57,三个划分都超过日志回放专家。只看相机的DriveZero-Scale在NAVSIMv1 navtest拿到95.3 PDMS,人类驾驶员是94.8。

一、人类日志模仿学习的分布外失效
近几年端到端驾驶的主流,是拿人类开车日志当标签,看图或看状态,贴那一条已经发生过的轨迹。报告开篇把这条路的病写得很具体。
同一段路常常有好几条都能开的线,日志只留下司机当时选的那一条。危险偏离和把车救回来的动作本来就少。策略自己开出去以后碰到的状态,离线数据里更没有。误差一旦离开演示分布,就会往下滚。
直接在像素上做强化学习,探索吃样本,视觉仿真又贵。他们拆成两截。动作模型在紧凑的结构化状态上做高吞吐闭环交互。感知模型在大批量图像上蒸馏视觉基座。最后再把老师的滚动轨迹蒸馏进只看相机的学生。
这套叙事很容易被讲成自动驾驶版AlphaGo Zero。老师从随机初始化用PPO学,日志不给人怎么开,只给人留下的场景和目标。
二、DriveRL闭环强化学习训练框架
DriveRL是全篇的动作老师。策略大约5.70M参数,吃自车、周围交通参与者、局部矢量地图和红绿灯状态,输出纵向加加速度和轮胎转角变化率上的Beta分布,直接控车,不再做轨迹后处理。
每个参与者含当前帧再加前四帧,按5Hz采样,最多96个。地图最多256个矢量元素。导航用两个目标点,训练取日志未来位置,部署沿路线取近锚点和远锚点,前瞻随车速变。
仿真器把nuPlan日志变成可交互世界。报告配置里背景车主要用批量化IDM,一小部分做前车制动,行人仍走日志回放。自博弈是实车部署用的配置,在nuPlan上收益很小,他们归因于评测里背景车本身也由IDM开。
吞吐写得很满。每张卡2048个世界,96块GPU并行到196,608个世界。
训练从nuPlan trainval抽出922,703个场景,导出10Hz后再隔帧取成5Hz。每次滚动110步,日志回放和IDM场景各一半,2400次更新,大约21小时。经验全部来自交互,没有模仿预训练。
奖励分三块,安全约束主要落在硬事件上。新发生的多边形碰撞扣1.0并终止。驶离道路按速度相关项扣,基数是2.0,同样终止。第一次进到目标1.5米内,一次性加0.5,到达不终止。
软项六个分数都在0到1之间,管跨车道、中心线、路沿、舒适、碰撞时间和超速。六项做乘积再除以滚动长度110,一项很差乘积就塌。评论家拆成八个通道,加起来仍等于标量回报。
有一处我一开始容易看漏。红绿灯违规只当诊断指标,不进这篇报告里老师的标量奖励。附录里补了红灯奖励,策略独有违规率从3.88%降到2.03%,六项总分却全掉。nuPlan总分本身不奖红灯遵守,只看总分会把这件事看丢。
测试时搜索是同一份检查点上的加戏。保留Beta分布的众数当0号候选,再从策略里采样其余动作,短程滚五步,用训练时同一套奖励、折扣和评论家打分。只有比众数高出一个固定边距才换动作。边距在官方评估文档里写成0.03。候选数加到64,六项均分从93.01提到93.57。Test14-hard反应式从89.18微降到89.15,六项里唯一没涨的。
晚到演员进场也有安全门。自车相对日志位姿要在5米和0.35弧度以内,且不与场上可见物体相撞。动作也有物理界,加加速度从负8到正5米每秒三次方,转角变化率正负0.8弧度每秒,自行车模型加速度上限4.0,转角上限π/3。
三、nuPlan六项均分与navtest95.3
先把几个能对上的数放在一张表里。nuPlan均分是Val14、Test14-hard、Test14-random在非反应式和反应式上的未加权平均。navtest报PDMS,navhard报两阶段EPDMS,HUGSIM报零样本HD-Score均值。缺的格子写未报告,不猜。
| 方法 | 输入 | 人类轨迹监督 | nuPlan六项均分 | navtest PDMS | navhard EPDMS | HUGSIM HD-Score |
|---|---|---|---|---|---|---|
| DriveRL | 结构化真值 | 无 | 93.01 | 95.8 | 55.6 | 未报告 |
| DriveRL-TTS | 结构化真值 | 无 | 93.57 | 未报告 | 未报告 | 未报告 |
| DriveZero | 相机 | 无 | 未报告 | 94.8 | 51.5 | 39.4 |
| DriveZero-Scale | 相机 | 无 | 未报告 | 95.3 | 57.1 | 46.6 |
| 人类驾驶员 | 结构化真值 | 有 | 未报告 | 94.8 | 未报告 | 未报告 |
| DrivoR-Scale | 相机 | 有 | 未报告 | 94.6 | 54.6 | 38.1 |
DriveRL在nuPlan六个设置上全部超过Log-Replay。反差最大的是反应式。Val14反应式日志回放只有80.32,DriveRL到94.25。Test14-hard反应式日志回放68.80,DriveRL到89.18。日志里那条人类轨迹,换到别人会动的交通里,分数掉得很快。老师在交互里把这条补上了。
相机学生这边要分开看两个版本。只用navtrain的DriveZero,navtest PDMS是94.8,和人类驾驶员打平。再加237K个SimScale仿真场景得到DriveZero-Scale,PDMS到95.3,这也是他们宣称超过人类驾驶员的那个点。navhard上Scale拿到57.1 EPDMS,超过上一名带人类监督的DrivoR-Scale的54.6。HUGSIM零样本HD-Score均值46.6,上一名无人类轨迹的GigaPixel是38.5。

消融比总分更扫兴,也更有用。同样在navtest上,人类轨迹监督得到93.92。只换成DriveRL轨迹、不加意图扩增,掉到93.61,比人类轨迹还低。加上目标意图扩增,才到94.41。老师能在同一初始场景上换导航意图再滚一轨,日志里没有的合法开法是从这里来的。没有这一步,所谓越过人类演示,在学生身上并不成立。
困难档也没被总分盖住。Test14-hard非反应式DriveRL-TTS是91.13,仍低于Val14的95.54。HUGSIM困难档HD-Score只有24.7,极端档27.6,都远低于简单档的81.9。榜首可以成立,短板也成立。
四、DriveVFM蒸馏与相机规划器
老师看的是特权结构化状态,车上要部署的学生只能看相机。DriveVFM按RADIO那套聚合蒸馏,把冻住的DINOv3、SigLIP2、SAM和Depth Anything V2收进一根驾驶骨干,监督全部来自这些模型的特征,不需要检测、分割、车道或深度标注。
预训练先256×256跑60万步,再512×512跑20万步,全局batch都是2048。数据把LAION-2B、ImageNet-21K、SA-1B和OpenDV、nuPlan、Waymo混在一起。训完扔掉老师模型和适配器,下游只留这根骨干。

DriveZero吃前、后、左、右四路相机,分辨率960×512,出64条候选轨迹,每条20步、5Hz。骨干冻住,只训秩32的Q/V LoRA。Scale版本可训参数18.58M,全量338.46M,16张H20上25个epoch,大约38小时。轨迹监督来自冻住的DriveRL滚动,明确写了不用人类轨迹。

蒸馏是开环的。每一帧把多相机图像和结构化状态配好,老师滚出20步轨迹,学生在图像上学。学生不进交互环境,也不做渲染。赢者通吃只更新离老师最近的提议,打分头按PDM六个分量监督,推理取预测总分最高的一条。
意图扩增发生在出标签之前。先改路线意图再让老师滚,评分走同一条扩增路线,命令、轨迹和打分绑在同一意图上。

五、本地部署与推理实践
以下命令来自官方DriveRL/README.md、DriveRL/docs/driverl_repro_eval.md和DriveRL/docs/driverl_environment.md,对应2026年9月15日放出的DriveRL推理与检查点。
公开仓库把DriveRL放在子目录里。根README待办里DriveZero和DriveVFM仍未勾,能复现的是特权老师,不是相机版DriveZero。环境写的是Python 3.11、PyTorch 2.7.1、CUDA 12.8。
git clone --recurse-submodules https://github.com/XiaomiAutoL3/DriveZero.git
cd DriveZero/DriveRL
python -m pip install -r requirements.txt -c constraints.txt
python -m pip install -e . --no-deps
python -m pip install -e nuplan-devkit --no-deps
论文里的单自车老师对应driverl-teacher-u2400。官方预检如下,成功应打印PREFLIGHT_OK。
export DRIVERL_EVAL_ROOT="$PWD"
export DRIVERL_EVAL_NUPLAN_ROOT="$PWD/nuplan-devkit"
export DRIVERL_EVAL_RELEASE_ID=driverl-teacher-u2400
export DRIVERL_EVAL_CONFIG_PATH="$PWD/release/configs/driverl_teacher.yaml"
export DRIVERL_EVAL_CHECKPOINT_PATH="$PWD/release/checkpoints/checkpoint_2400.pt"
export DRIVERL_EVAL_PYTHON="$(command -v python)"
bash scripts/run_driverl_nuplan_eval.sh preflight
六项评测还要自备nuPlan数据库和地图。普通套件把DRIVERL_EVAL_TTS_ENABLED设为0。确定性测试时搜索套件设为1,官方示例候选数是8、种子42。论文表3里均分93.57对应候选数64。用README示例的8个候选,表上只比纯众数高0.11,不要拿93.57去对那条命令。
六、总结与思考
这套分解值得抄。感知吃图,动作吃交互,最后用蒸馏接到可上车的观察上。直接在像素上做强化学习,这条路他们写明了样本和仿真都贵。把老师做小、把世界做并行,是这篇里最能落地的工程选择。
AlphaGo Zero的类比只能用一半。棋盘规则是完整的,驾驶世界仍然靠人类日志播种。越过的是轨迹标签,不是人类数据本身。意图扩增那组消融把边界画得很清楚,老师轨迹并不自动比人强,多样化的合法目标才把学生托过人类轨迹监督。
短板我更在意两处。学生始终在开环里模仿老师,没有在交互里为自己的视觉误差负责。第三节实车只写DriveRL上了一小队车,在拥挤城区闭环控车,演示视频放项目页,车队规模、里程、接管和碰撞都未报告。相机版DriveZero有没有上车,文里没写。
代码也还差一截。9月15日放出的是DriveRL推理和检查点,DriveZero和DriveVFM仍在待办。现在能核的,是特权老师在nuPlan上怎么评,不是相机规划器怎么在自己机器上出轨迹。
参考链接
- 技术报告原文 arXiv 2609.06055 v1,2026年9月
- 项目页 xiaomiautol3.github.io/DriveZero
- 代码与DriveRL推理 XiaomiAutoL3/DriveZero
- Hugging Face论文页 DriveZero
- 对比方案 NAVSIM、CaRL、HUGSIM、Qwen-Drive-1.0技术报告
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)