达摩院 ICML'26|医学VLM写报告"分高错也多"?TIF-GRPO让强化学习真正对齐临床事实
作者|邱中炜 ,阿里巴巴达摩院算法专家
摘要

传统代理指标(BLEU/ROUGE/RadGraph等)让"高分报告"频繁出现致命临床错误。把"左肺"写成"右肺"、把"良性囊肿"误为"实性肿块";TIF-GRPO通过CABS把报告拆成可验证的临床事实单元,让RL优化方向重新指向临床真相。
阿里巴巴达摩院联合浙江大学等高校与机构的研究团队,提出面向3D CT体积分析的全新框架TIF-GRPO(Trajectory-Integral Feedback GRPO)。该工作首先构建了一套可被放射科医生核验的临床事实评测基底CABS(Clinical Abnormality Benchmarking Substrate),再把强化学习的奖励信号建模为"伪时间轨迹上的控制问题",借用经典控制论中的积分反馈机制,把"漏检"当作累积状态误差、把"幻觉"当作过度控制能耗。双向收紧,让医学 VLM 在生成报告时不再为了语言流畅而牺牲临床事实。
近两年,医学视觉-语言模型(Medical VLM)从二维切片走向三维体积CT分析,临床部署的愿景越来越近。但一个长期被掩盖的问题正在变得致命:优化目标与临床严谨度严重错位。现有RL流程仍然依赖BLEU、ROUGE、RadGraph、RaTEScore这类表层相似度奖励,它们对"语言风格的拟合"远比对"诊断事实的正确性"敏感。结果是模型在指标榜上分数飙升,却把"刀刃"般的关键临床信号,比如解剖侧向、病灶属性悄悄抹掉。
在本文中,我们识别出两类系统性失败:Evaluation Hallucination(评测幻觉)——高分掩盖临床错误;Mechanistic Divergence(机制性偏移)——奖励信号让策略梯度系统性地偏离临床真相。为此,我们提出CABS把报告解构成"器官-病灶-位置-属性-确定性-证据"六元组的可核验单元,再用TIF-GRPO在轨迹层面进行控制论式的奖励调控。实验证明:TIF-GRPO在CT-RATE、AMOS-MM、MIMIC-CXR等多个基准上全面取得SOTA,尤其在MIMIC-CXR上把F1从25.3提升到70.8,跨数据集与跨模态(3D CT→2D X-ray)均验证了方法的普适性。
论文链接:https://arxiv.org/abs/2605.20277

背景介绍 & 研究动机
在医学这种"事实性与忠实性是不可妥协底线"的领域,一份报告写得文笔再流畅,只要漏检一处肺结节或错配一处解剖侧向,都可能让患者付出代价。然而,当前医学VLM的训练-评测闭环却恰恰把这条底线放在了最不重要的位置:
-
评测端的失真——Evaluation Hallucination。 传统BLEU/ROUGE/METEOR只看n-gram重叠;即便是RadGraph、RaTEScore等"语义图"方法,本质上也是对抽取片段做相似度匹配,与图像中真实存在的病理事实脱钩。我们对10余个主流模型做Spearman秩相关分析后发现:表层指标与CABS临床指标之间的相关性长期偏弱,呈现明显的块对角结构——它们衡量的根本不是同一种能力。
-
训练端的崩塌——Mechanistic Divergence。 当奖励来自上述代理信号时,标准GRPO/RLOO/ReMAX/Reinforce++等算法在生成组内无法可靠区分"临床准确"与"临床错误"的样本,策略梯度便会系统性地飘离真值。更糟的是,面对稀疏的临床反馈,标准RL容易塌缩到"少说少错"的安全模式——为了最大化平均lexical分数,干脆忽略长尾的关键异常。
因此,我们的研究动机是:要让医学VLM真正学会"看图说话",必须先把"话"重新定义为可被临床核验的事实,再把"奖励"从语言流畅度迁移到轨迹层面的临床覆盖与精确度。

主要贡献
本研究的主要贡献包括以下四个方面:
-
全新评测基底CABS:我们提出Clinical Abnormality Benchmarking Substrate,把放射学报告解构成原子级临床异常单元 ⟨器官、病灶实体、解剖位置、属性、诊断确定性、文本证据⟩,统一医学VLM在检测与描述两端的评测标准。多位放射科医生交叉核验,整体接受率达98.6%。
-
系统性诊断"机制性偏移":我们给出"评测幻觉"与"机制性偏移"的可重复实验证据,揭示表层相似度奖励如何系统性地把策略梯度推离临床事实,为后续医学RL设计提供了清晰的失败模式画像。
-
控制论驱动的TIF-GRPO:我们提出Trajectory-Integral Feedback GRPO,把临床推理建模为伪时间轨迹,引入PID积分项思想,对"漏检"做累积惩罚、对"幻觉"做控制能耗约束,让RL奖励真正落在临床准确性上。
-
跨基准、跨模态的全面SOTA:在CT-RATE-Report、AMOS-MM-Report、CT-RATE-MCQ、AMOS-MM-MCQ全部基准上拿到最高分;并在2D胸部X光(MIMIC-CXR)上把F1由25.3推到70.8,证明TIF-GRPO的核心收益来自"轨迹级临床信用分配"而非3D解剖先验。

TIF-GRPO整体框架。基于CABS把生成报告拆成临床异常单元,再用轨迹积分反馈对漏检(False Negative)做累积状态误差惩罚、对幻觉(False Positive)做控制能耗约束,最终以group-relative优势函数注入GRPO。

CABS:把临床报告变成可验证的事实集合
要让奖励"对得上临床真相",第一步是定义什么叫真相。我们抛弃了"把报告当字符串"的传统视角,把每份报告映射到一个临床本体空间S上的事实集合
![]()
,其中每个事实
![]()
分别对应:
-
o:目标器官(如肝脏、肺)
-
d:病灶实体(如囊性病变)
-
A:病理属性集合(形态、密度、尺寸,如 14mm×20mm、低密度)
-
l:解剖位置精度(如右上叶、肝 S8 段)
-
c:诊断确定性(明确 / 可疑)
-
e:从原始报告中提取的文本证据(保证可追溯)

CABS工作流。自由文本报告→结构化临床语义→语义一致性审计→临床可用性分析;整体接受≈99.4%×99.2% 98.6%。
在CABS之下,模型输出与参考报告的对齐不再是token重叠,而是Semantic Fact Intersection——在器官与异常实体两级分别计算Precision/Recall/F1。我们对多位放射科医生进行CC、ET、CI、CDU四维度评估,CABS在最严格的CDU维度上得分仍稳定在4.8+;自一致性测试中,少于0.8%的样本出现两个以上异常单元的分歧。CABS由此成为一把既细又稳的临床尺。

CABS系统的临床能力分析。即便在最严格的CDU维度上,CABS仍能稳定保持4.8+的临床医生打分;自一致性检验中分歧≥2单元的样本不到0.8%。

TIF-GRPO:把强化学习装上"PID控制器"
有了CABS这把尺,我们要回答下一个问题:如何把它做成一个能真正驱动策略梯度的奖励信号?这里的关键洞察是:临床推理不是一次性吐出最终答案,而是沿着"先看主要异常→再看次要异常→最后兜底"的伪时间轨迹展开。所以奖励不应只看终点,更要积分整条轨迹。
核心组件一:Anatomy-Aware CABS-based Reward
对每个临床异常单元
![]()
,我们给出结构化的命中奖励:
![]()
。
其中
![]()
分别表示是否命中、位置是否正确、异常实体是否正确。全局瞬时奖励即对所有K个单元取平均:
![]()
。
核心组件二:Trajectory-Integral Reward——把PID写进RL
我们把奖励重构为四项之和:

直观理解:
-
Running Cost像PID控制中的积分项,对"长时间没把该报的异常报出来"做平方级累积惩罚,逼模型不要等到最后才补救;
-
Control Effort把假阳性类比为"能耗",约束模型不要为了凑数胡乱编造发现;
-
Terminal Reward是当前轨迹的CABS总分;
-
Exploration Bonus鼓励模型敢于报告异常,避免塌缩到"什么都不说"的安全模式。
调节
![]()
的比例即可灵活在Precision/Recall之间换边:实验中
![]()
=1.0:0.4时Precision最高(46.34),0.4:1.0时Recall最高(41.45),平衡配置(1.0:1.0)F1最高(39.11),印证了两项约束的互补性。
与GRPO的耦合
我们把
![]()
注入到GRPO的group-relative优势归一化中:
![]()
。
替换原GRPO中的优势项即得到最终目标函数。需要强调的是:这不是简单的"奖励整形"——TIF-GRPO把优化从"对单点奖励求和"改造为轨迹依赖的路径目标,从根本上改变了GRPO组内的优势排序,从而改写了策略梯度方向。
![]()
实验与讨论
我们在4B/8B规模的Qwen3-VL上验证TIF-GRPO,与Gemini-3-Pro、GPT-5等通用大模型,以及RadFM、M3D-LaMed、CT-CHAT、Hulu-Med、Fleming-VL等医学专用模型同台对比。
评估指标
-
Entity Core(Precision/Recall/F1):实体级临床准确性。
-
Clinical Fidelity(Loc-Acc、Att-Acc、FC-Rate):位置、属性以及完全一致率。
-
Organ Coverage(Or-Rate、FMOr-Rate):器官覆盖与完全匹配率。
-
同时报告传统表层指标(ROUGE/RaTEScore/BioBert)作为参考。
主要结果
-
CT-RATE-Report:4B的TIF-GRPO把F1从SFT基线的18.73提到39.11,FC-Rate由5.68提升到20.37,Organ Coverage由12.06跃升至40.84,全面超越所有医学专用模型与GPT-5;其中CT-CHAT在用了我们~2倍的报告训练数据下,仍被TIF-GRPO反超。
-
AMOS-MM-Report:8B模型F1达32.12,FC-Rate 24.52,相对SFT基线翻倍以上。
-
MCQ评测(CT-RATE-MCQ + AMOS-MM-MCQ):两边平均66+/69+,跨数据集泛化也保持最优,证明TIF控制保留了细粒度临床一致性约束。
-
跨模态泛化(MIMIC-CXR):在2D胸部X光上,TIF-GRPO把F1从baseline 25.3/SFT 28.6/GRPO+ROUGE 45.3/GRPO+LLM 52.7,一举推到70.8——决定性地证明方法的红利来自"轨迹级临床信用分配",而非3D解剖先验。
Evaluation Hallucination实证
我们对10+模型做Spearman秩相关分析,热图呈现清晰的块对角结构:表层相似度组内强相关,CABS组内强相关,但两组之间的相关性长期偏弱。Fleming-VL、InternVL3.5这类模型出现典型"表层高、临床低"的右下角分布,这正是评测幻觉的指纹。反观GPT-5,表层分一般、CABS高,与其已知的临床推理优势完全吻合。

评测幻觉分析。(a) cabs-e/c/o与s1–s6(BLEU、ROUGE、METEOR、RadGraph、RaTEScore、BioBert)之间的Spearman秩相关热图呈块对角结构,证明表层指标与CABS临床指标在测量本质上不同;(b) 各模型在两套评测体系下的排名分布。Fleming-VL/InternVL3.5出现"表层高、临床低"的评测幻觉指纹,TIF-GRPO在两套指标下同时居首。
Mechanistic Divergence实证
我们用反事实排序一致性分析(对GT报告做0–5个异常实体的可控扰动)测算各指标的临床优先级保真度ϕ:BLEU/ROUGE/METEOR仅~0.65–0.75,RadGraph/RaTEScore也<0.8,CABS-F1唯一超过0.90。这意味着用表层相似度做RL奖励,必然把策略推离临床真相。

机制性偏移分析。通过对GT报告做0–5个异常实体的可控扰动构造Text-Rank,再让各指标各自给出Metric-Rank,用一致性比
![]()
衡量临床优先级保真度。CABS-F1唯一超过0.90,表层相似度指标普遍在0.65–0.80。
消融实验:每个组件都不可或缺
-
去掉Running Cost(FN积分):Recall显著下降,模型回到"少说少错"模式;
-
去掉Control Effort(FP惩罚):Precision崩塌,模型开始胡乱报异常;
-
替换为ROUGE/RadGraph/BioBert/LLM-reward的标准GRPO:全部明显逊色于TIF-GRPO;
-
替换为RLOO/ReMAX/Reinforce++:相对SFT有中等改进,但仍落后于TIF-GRPO。说明"机制性偏移"是表层相似度奖励的共性问题,不是GRPO独有。
![]()
未来方向
TIF-GRPO为医学VLM的后训练提供了一条"评测-奖励-优化"全链路对齐临床事实的可行路径。展望未来,仍有几个值得深入的方向:
-
更细的临床本体:当前CABS主要聚焦organ × abnormality两级,未来可延展至治疗规划、随访演化等更复杂的临床语义。
-
更多模态与器官:MIMIC-CXR上的迁移结果令人鼓舞,将TIF-GRPO扩展到病理、眼科、心电等领域是下一步的重点。
-
更稳健的Sim2Clinic:所有评测仍以学术数据集为主,把方法接入真实临床工作流、纳入医生in-the-loop评估,是迈向落地的关键一步。
-
更通用的"轨迹积分"范式:TIF的本质是"把可分解的语义单元映射到轨迹上做信用分配",原则上可推广到法律、金融等任何对事实性敏感的长文本生成场景。
我们相信,这项工作为医学VLM的训练范式提供了一个新的支点——让RL真正服务于临床事实,而非语言表层——也为更广泛的"事实敏感型"大模型后训练打开了新的设计空间。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)