达摩院 ICLR'26|变长视觉Token调度加速大模型3D影像理解
作者|方承煜,阿里巴巴达摩院实习生
摘要
多模态大语言模型在临床视觉问答任务中具有良好的应用前景,但在扩展到三维成像时会受到高计算成本的限制。以往方法通常依赖二维切片或固定长度的Token压缩,这会破坏3D数据的连续性,并掩盖细微病灶等关键信息。
我们提出一个使用可变长度Token序列表征三维医学数据的框架。它引入了指令条件的Token调度机制和代理梯度传播策略,在训练与推理阶段自适应地减少Token数量,从而在降低计算成本的同时缓解冗余Token带来的注意力稀释问题。它还通过带有梯度恢复的自定义反向传播规则,在存在离散Token剪枝的情况下仍然保持可微优化。为了稳定Token压缩过程并确保对视觉证据的可靠利用,它进一步引入正则化目标,以减弱仅依赖语言模态的偏置并提升整体可靠性。在多种医学视觉问答任务上的实验结果表明,它在显著降低资源开销、加速训练与推理的同时,取得了良好的准确率。

图1:3D原生框架,通过可变长度的Token自适应地建模医学影像3D数据,从而加速训练与推理过程。该框架通过剔除与指令无关的Token,在保持更优定量性能的同时,实现了高效的医疗视觉问答。
论文链接:https://arxiv.org/pdf/2603.25155

引言
人工智能已经能够在多种临床场景中辅助医生解读医学影像,但现有多模态大语言模型大多面向2D图像。对于实际工作中常见的3D CT、MRI数据,如何在完整使用3D Volume数据的前提下控制显存和计算量,仍然是一个困难的问题。
过去的方法通常有两类思路:一类基于2D切片,只选取部分层作为输入;另一类在视觉端或视觉–语言接口处,将整套3D Volume压缩成固定长度的Token序列。这两类方法虽然降低了序列长度,却容易破坏三维连续性,抹平细小病灶,并引入人工裁剪偏差。同时,不同临床问题本身对信息量的需求差异很大,用统一的固定压缩比例去覆盖全部任务,就不得不在精度和效率之间进行权衡和妥协。
我们针对这一问题提出了一个3D原生的医学多模态大语言模型框架,它直接以3D Patch为基本单元来表征数据,并通过可变长度的视觉Token序列,在训练和推理阶段按照当前指令自适应地保留或丢弃Token,从而在保持三维信息质量的基础上减少冗余计算。

3D医学数据的建模挑战
从数据和任务的角度看3D医学影像建模面临几个具体挑战。
第一,体素数量大。以常规分辨率的胸部CT为例,将整个Volume数据划分为3D Patch之后,视觉Token数量远高于二维图像场景。如果不做任何裁剪,直接送入多模态大语言模型,显存和时间开销都会超出常规训练和部署配置。
第二,三维结构和局部细节非常重要。病灶在多个切片上的延展、器官边界的形态等,都依赖于跨层关系。如果只保留少量切片或者采用粗暴的下采样,这些信息会被削弱,复杂任务如肿瘤体积评估、分期判断等会受到影响。
第三,临床指令的差异较大。有的问题只需要判断是否存在异常或说明整体情况,有的问题则需要精确测量病灶大小或比较多期检查结果。不同指令对应的“有效视觉证据”长度不同,统一的Token压缩比例无法兼顾这些差异。
它的设计目标,就是在3D原生表示下,按指令自适应地决定保留多少视觉Token,以及保留哪些Token。

图2:工作流:第一阶段对齐视觉嵌入层,第二阶段微调所有模块以适配任务,并通过我们的反向传播策略学习Token缩减阈值的估计。带有黑色轮廓的模块在训练期间不进行更新。

总体框架与3D编码方式
它将输入扫描表示为大小
![]()
的Volume数据,首先划分为不重叠的三维Patch,并通过3D编码器把每个Patch映射到向量空间。这样得到长度为
![]()
的视觉Token序列
![]()
。
文本指令通过分词器编码为长度为
![]()
的语言Token序列
![]()
。在解码端,它将两者拼接为统一序列
![]()
,并送入多层自回归解码器进行建模,从而在同一空间中联合推理3D信息和语言信息。
在这一结构之上,它引入了两项关键机制:
-
Instruction-conditioned Token Scheduling (ITS):根据指令–视觉交互自适应地计算每个Token的重要性,并在样本级决定保留比例。
-
Surrogate Gradient Propagation(SGP):在前向过程中使用硬剪枝,在反向过程中通过代理梯度为保留概率提供稳定的训练信号。
前向时,未被保留的视觉Token及其注意力缓存和位置编码会被彻底剔除,从而在训练和推理阶段都真实减少计算量;反向时,通过SGP将梯度传回连续的保留概率,使得Token选择策略能够端到端学习。
(一)ITS:从指令Centrality到视觉显著性与可变长度Token
ITS的核心思想是:先在指令侧衡量“哪些指令成分更关键”,再将这种权重投射到视觉侧,得到每个视觉Token在当前指令下的显著性分数,并根据整套分布自适应决定保留比例。它不使用统一的Saliency信号,而是根据当前指令与各个视觉Token的关系,计算指令相关的重要性分数。整体流程可以概括为两步。
第一步是指令相关显著性估计。模型在文本侧分析指令内部不同Token的相对重要性,突出与当前任务直接相关的词语或短语,然后根据这些关键指令成分与每个视觉Token的交互强度,为每个视觉Token计算一个连续的Saliency分数。
在某一层上ℓ,记指令Token的Query和Key为
![]()
,注意力维度为α。定义每个指令Token的Centrality

,并归一化得到权重
![]()
。这些权重反映了各个指令Token在整个指令上下文中的相对重要性。随后,ITS计算每个视觉Token的指令引导响应

,并在样本内部做归一化得到显著性分数
![]()
。
![]()
描述了第j个视觉Token与“当前最关键的指令成分”的对齐程度。
第二步是样本级阈值预测。它不采用固定阈值,而是通过一个轻量的阈值预测器,根据当前Volume数据的整体Saliency分布和指令语义,自适应地给出该样本下的保留比例。这样,在简单判断类问题中,模型可以保留较少的Token,而在需要细粒度测量和复杂推理的任务中,可以保留更多与病灶或关键解剖区域相关的Token。
为此,它将
![]()
的分布特征压缩成一个描述向量,再通过轻量感知机预测样本级阈值θ∈【0,1】。给定后θ,每个视觉Token的保留概率定义为
![]()
,其中
![]()
控制从显著性到保留概率的平滑程度。在获得保留概率后,它使用二值化将其转化为硬保留Mask。前向时,只有被保留的视觉Token参与注意力计算及后续解码,不被保留的Token及其缓存、位置编码会被彻底排除,从而直接降低实际计算量。
(二)SGP:在保持硬剪枝的同时让Token选择可训练
有了ITS的硬剪枝,还需要解决训练可微性的问题。如果直接对二值Mask进行剪枝,保留与否是离散决策,阈值和显著性模块很难获得有效梯度。为了解决这个问题,它设计了Surrogate Gradient Propagation机制。
它在解码器的某一层ℓ上,将视觉Hidden State记为
![]()
。
当前向保留Mask固定时,上游梯度可以在“压缩后的序列”上计算,再通过Scatter操作还原到原序列位置。为了使保留概率的更新直接由任务损失驱动,SGP使用一阶近似构造Token的任务重要性
![]()
。
这一形式本质上是对损失函数在第j个Token表征方向上的一阶泰勒灵敏度估计,即近似刻画将该Token表征置零时对损失的增量。它在形式上与卷积网络通道或滤波器剪枝中广泛使用的一阶泰勒重要性度量相同,但在这里被用作Token级别的任务敏感性指标。将
![]()
进行归一化和截断后,用作
![]()
的更新信号,同时控制其梯度方向和步长:
![]()
较大的Token在优化过程中获得正向更新,其保留概率被提高;
![]()
较小甚至为负的Token则对应抑制性更新,其保留概率被削弱。
在具体实现中,前向使用硬剪枝保证真实的计算节省,反向则采用直通近似和基于的
![]()
代理梯度,将更新传回
![]()
和阈值预测器。这样,Token选择行为不再只是基于显著性启发式,而是与任务损失紧密耦合。

两阶段训练与实验结果概览
在训练策略上,它将采用两阶段方案。
第一阶段主要对齐3D视觉表示与语言空间。使用大量3D数据与文本描述对,轻量训练3D patch嵌入层,同时冻结大部分视觉主干和语言解码器,以控制训练成本。
第二阶段在3D-RAD、DeepTumorVQA等多任务3D CT基准上进行指令微调,同时启用ITS和 SGP,让模型在真实临床问答任务中直接优化Token选择策略与回答质量。训练目标在标准交叉熵损失外,还叠加了保留比例约束和Mask翻转相关正则,限制极端剪枝策略,并降低模型仅依赖语言先验“猜答案”的风险。
表1:它在3D-RAD基准测试中六个任务上的零样本(zero-shot)与微调(finetuned)性能对比。紫色与靛蓝色分别标示最优与次优结果。Stat. Temp. Diag.=Static Temporal Diagnosis,Longit. Temp. Diag.=Longitudinal Temporal Diagnosis.

实验结果表明,在3D-RAD的多类问答任务中,它在多项指标上优于现有3D医学多模态基线模型,包括参数规模更大的模型。
表2:在DeepTumorVQA基准测试上的性能表现。标有∗的子类型表示采用自由文本形式的数值答案,并使用平均相对准确率进行评价,数值越高代表性能越好。Meas.=测量(Measurement),Recog.=识别(Recognition),Vis.Rsn.=视觉推理(Visual Reasoning),Med.Rsn.=医学推理(Medical Reasoning)。

在DeepTumorVQA上,它对涉及肿瘤检测、测量和纵向变化分析的问答表现同样稳定。
表3:在3D-RAD基准测试上的消融实验研究。计算统计指标包括训练速度(迭代次数/秒)、平均保留Token数量、推理速度(token数/秒)以及推理时的GPU峰值内存占用。

在效率方面,由于训练和推理阶段都进行了指令自适应Token裁剪,它在保持甚至提升性能的同时,显存占用和推理时间都明显下降。对于需要在有限计算资源下处理完整3D Volume数据的场景,这种可变长度Token的设计使多模态大语言模型的训练和部署更可行。

图3:结果的可视化展示。白色区域表示被缩减的Token,而紫色框则突出显示了保留的区域,这些区域承载着与回答问题相关的临床信息。
为了验证剪枝执行效果的正确性,我们给出了一系列可视化,这些可视化与消融结果一起,说明的剪枝行为不是“盲目减算力”,而是在遵循任务需求和物理结构的前提下,有选择地压缩冗余Token。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)