小鹏再推XCoT-VLA:这次解决的是推理延迟问题

「推理延迟降4倍、精度反超」
目录
自动驾驶VLA模型想用大模型思维链(CoT)做场景推理,但自然语言推理动辄40–80个Token,自回归解码延迟远超车载12Hz的83.3ms控制预算——能解释,但跑不动。
小鹏基础模型团队推出XCoT-VLA,抛弃冗长自然语言推理,设计一套仅2–6位的可执行语义动作Token作为推理中间层,搭配解耦Reason/Control双分支流匹配轨迹生成,配套XCPO策略优化微调模块,在变道、通用路况规划指标全面领先传统CoT方案,推理延迟从280ms以上压缩至70ms以内,降幅超过4倍,是面向量产车规落地的轻量化VLA新思路。
01 现有自动驾驶VLA推理路线的核心先天短板
目前自动驾驶VLA主流推理方案分三类,全部存在落地硬伤,也是XCoT-VLA的设计出发点:
1. 无推理基线(仅轨迹监督)
直接从图像+导航输出轨迹,缺少导航、红绿灯、避让等决策语义,变道、路口等复杂场景预判滞后,横向/纵向位移误差偏大,车辆动作偏保守。
2. 自然语言Verbose CoT方案
输入图像后输出大段文本推理,例如“前方红灯需要减速停车、300米左转”,文本token数量40~80。缺陷非常致命:自回归逐字解码带来巨大时延,远超车载83.3ms(12Hz)控制阈值;文本语义和车辆控制没有强绑定关系,文字描述无法直接映射加速度、横摆等连续轨迹参数,模型很难精准利用推理信息优化规划。
3. 无约束隐Token方案
使用不可解释的离散隐变量作为中间表征,缺少导航、交规、避让等明确语义标签,监督信号模糊,复杂导航场景提升有限,且无法人工干预调试,不利于车规安全迭代。

三类方案共同矛盾:推理表征和车辆连续运动生成之间存在断层,要么延迟超标,要么语义缺失,XCoT-VLA核心解法就是可执行XCoT Token,把所有驾驶决策压缩到2–6个标准化动作符号,打通语义推理与轨迹生成的链路。
02 XCoT-VLA核心整套工程设计
整套框架分为离线标签构建、双分支解耦VLA主干、两阶段训练(监督微调+可选XCPO策略优化)三大部分,全部围绕“轻量化、可执行、车实时”设计。
2.1 离线Reason-Action标签自动构建
模型无法凭空学习XCoT Token语义,论文设计全自动标注管线,从海量实车日志生成标准化推理序列,无需人工大规模标注:

图| XCoT 离线 Reason-Action 标注构建流水线:从实车日志提取动作与场景因果语义,压缩生成标准化推理 Token 序列
- 动作证据提取:从3s历史+6s未来轨迹中解析车辆行为,区分保持车速、减速、变道、转弯等纵向/横向运动特征;
- 语义接地匹配:结合摄像头图像、导航指令、红绿灯、行人等场景信息,筛选出驱动当前动作的核心因果因素(红灯、左转导航、行人避让等);
- 语义压缩编码:将“场景原因+车辆动作”配对,映射为2–6个固定词典XCoT Token,末尾追加EOS结束符。
词典覆盖三类可执行语义:纵向控制(KEEP_SPEED、DECELERATE)、导航机动(NAV_LEFT_LANE_CHANGE、LEFT_TURN_PREPARE)、交规/安全约束(RED_LIGHT_HOLD、HAZARD_YIELD)。
一条左转遇红灯场景标准序列示例:LEFT_TURN_PREPARE → DECELERATE → RED_LIGHT_HOLD → EOS,全程仅3个推理Token,对比数十字文本推理,推理开销大幅压缩。
2.2 解耦推理-控制双分支VLA主干
模型采用统一多模态自注意力+确定性Token路由,把网络拆分为独立Reason FFN、Control FFN两个前向分支,彻底分离推理表征、轨迹生成的计算流:
- 多模态输入统一编码:摄像头图像、车辆状态、导航指令全部转为Token进入共享自注意力层;
- 分支路由规则(无MoE可学习路由,固定逻辑更稳定):
a. Reason FFN:处理图像、导航、XCoT推理Token,负责自回归预测2–6位可执行推理序列;
b. Control FFN:仅处理24个固定轨迹查询向量,通过流匹配(Flow Matching)输出6s(24步)纵向加速度、横摆变化连续运动量; - 轨迹积分:网络输出运动参数结合当前车辆位姿,积分生成完整6秒预测轨迹。
核心设计优势:推理分支和轨迹生成分支互不干扰,微调推理策略时不会破坏运动生成能力,解决传统单网络训练纵向/横向精度互相拖累的问题。文中核心损失简化解读:
:XCoT Token分类损失,保证推理序列贴合实车决策逻辑;
:流匹配轨迹损失,约束预测运动和真实车辆轨迹对齐;
总损失为两项加权求和,平衡推理语义准确性与轨迹规划精度。

图| 模型架构与两阶段训练流程图
2.3 两阶段完整训练流程
阶段一:监督微调(SFT,必选基础训练)
使用362万混合实车数据集训练,包含3100万自动标注样本、200万人工复杂交互样本、320万变道专项样本,用离线生成的标准XCoT序列做教师强制监督,同步训练推理分支与轨迹流匹配解码器。
消融实验证明,联合微调会破坏纵向轨迹精度,仅使用本方案解耦FFN分支,短期2s、长期6s位移误差同步下降。
阶段二:XCPO推理策略优化(可选进阶优化)
阶段一训练完成后,冻结视觉编码器、自注意力层、Control FFN、轨迹解码器整套执行栈,仅更新Reason FFN推理网络。
流程:单帧采样多组不同XCoT推理序列,每条序列解码对应预测轨迹,根据路线完成度、舒适性、碰撞风险计算轨迹奖励,采用带KL约束裁剪策略梯度更新推理策略,让XCoT Token序列输出更安全、更贴合导航需求。
论文仅做算法设计,未给出XCPO闭环量化结果,作者也明确该模块需要封闭道路实车指标验证,仅作为离线优化拓展方案。
03 核心实验结果:精度、延迟双维度对比
评测分为开环轨迹精度、推理时延、训练稳定性三大维度,同时客观说明指标适用边界,不单纯追求纸面SOTA。
3.1 开环规划精度(通用路况+变道专项双数据集)
评测指标区分纵向/横向ADE(平均位移误差)、FDE(终点误差),单位米,数值越低规划越精准。

图| 通用分布/变道集开环规划结果
定性可视化:蓝色为XCoT预测轨迹,红色为无推理基线,路口左转、高速提前变道、红绿灯减速、效率超车四类场景下,XCoT预判更早,轨迹更顺滑,不会出现急加减速、临时变道等激进动作。

图| XCoT 与仅轨迹基线定性轨迹对比:XCoT 输出轨迹预判更主动、行驶更平顺
3.2 推理时延(车规落地核心指标)
车载规划硬性约束:12Hz控制周期,单帧总推理上限83.3ms,传统长文本CoT完全不达标。

图| H10推理最坏时延(最大Token长度)
单Token解码耗时3.25ms,80字文本推理仅解码阶段就要260ms以上,远超硬件时序上限;XCoT最多6个Token,全链路推理控制在70ms内,预留感知、后处理余量,完全适配车载嵌入式算力。
3.3 训练稳定性消融
对比联合微调(推理+控制网络同步更新)、解耦双分支微调两种方案:
联合微调会造成短期2秒纵向ADE从0.2774暴涨至1.1684,长距离纵向预测严重失真;解耦FFN设计能保留短期轨迹精度,同时大幅优化横向变道规划,证明双分支路由是保障训练稳定的关键架构设计。
04 写在最后
XCoT-VLA跳出“大模型必须用自然语言做推理”的固有思维,提出可执行紧凑型XCoT Token作为VLA中间表征,通过离线Reason-Action标注、解耦推理/控制双分支网络,同时解决传统CoT时延超标、隐Token不可解释两大痛点。
从数据表现看,这套架构在变道等导航核心场景提升显著,推理时延直接满足车载实时控制硬性要求,是兼顾精度、算力、可解释性的量产向自动驾驶VLA方案。
同时论文也明确当前边界:交互博弈、感知容错、闭环策略优化仍是待突破方向,后续若补充实车封闭环路安全指标,整套方案会具备更强量产说服力。
Ref
论文标题:XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
论文链接:https://arxiv.org/pdf/2608.10976
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)