作者|冷思聪,阿里巴巴达摩院实习生

 

摘要

 

多模态推理模型的强化学习训练中,梯度消失是一个被广泛承认却缺乏系统解决的根本性问题。多模态推理的方法及资源MMR1从第一性原理出发,严格证明了奖励方差为策略梯度幅度提供下界,并据此提出Variance-Aware Sampling(VAS)策略,仅通过改变数据采样方式即可稳定训练过程。配合大规模开源数据,MMR1-7B在五大推理基准上取得SOTA性能。

 

代码:https://github.com/alibaba-damo-academy/MMR1

 

 

图片

研究背景:GRPO的梯度消失困境

 

强化学习后训练(RL post-training)已成为提升推理模型能力的标准范式。以DeepSeek-R1为代表的工作将“GRPO(Group Relative Policy Optimization)”推向主流——它通过组内相对优势计算策略梯度,无需Critic网络,高效且可扩展。

 

然而,GRPO存在一个根本性缺陷:

 

当一个batch中的问题对模型来说"太简单"或"太难"时,所有响应的奖励趋于一致,相对优势坍缩为零,“梯度消失”,优化陷入停滞。

 

这一问题在多模态场景下尤为突出。视觉问题的难度分布比纯文本更加不均匀,"全对"或"全错"的prompt大量存在,导致训练信号极度稀疏。与此同时,多模态推理领域缺乏开放、大规模、高质量的长链路CoT数据,进一步制约了研究的可复现性与社区发展。

 

多模态推理的方法及资源MMR1正是为系统性地解决这两个核心痛点而生。

 

 

图片

核心理论洞察:奖励方差=梯度信号的保障

 

其方法设计并非经验性的调参,而是建立在一个严格的数学命题上:

 

“Variance-Progress Theorem:奖励方差为期望策略梯度幅度提供了线性下界。”

 

 

图片

 

这一理论揭示了一个直觉但此前缺乏形式化证明的关键事实:只要能主动提升每个训练batch的奖励方差,就能从理论上保证更强的梯度信号,从而稳定 RL训练过程。这为方法设计提供了明确的优化目标——不需要修改GRPO算法本身,只需改变"喂给它什么数据"。

 

 

图片

方法:Variance-Aware Sampling(VAS)

 

基于上述理论洞察,多模态推理的方法及资源MMR1提出了 “VAS(Variance-Aware Sampling)”——一种动态数据选择策略,在每个 batch 构建时优先选取"奖励方差潜力高"的prompt,让GRPO持续获得有效的优化信号。

 

 

图片

图1:VAS框架概览。每个训练batch由VPS加权采样和均匀随机采样两部分混合构建,动态聚焦于当前模型最需要学习的样本。

 

  • Variance Promotion Score(VPS)

 

对于每条rompt,VPS由两个互补分量加权组合:

 

 

图片

 

(一)OVS(Outcome Variance Score)——结果方差分数

 

 

图片

 

其中P(x)是模型在该prompt上的正确率。OVS即Bernoulli方差,在P(x)=0.5时最大——那些"模型有时对、有时错"的prompt,奖励方差最高,梯度信号最强。

 

(二)TDS(Trajectory Diversity Score)——轨迹多样性分数

 

基于inverse self-BLEU或distinct-n度量推理轨迹的语义多样性。即使在奖励信号稀疏(正确率接近0或1)时,TDS也能为方差提供下界保障,维持梯度信号的有效性。

 

  • 两者的互补关系:①OVS:直接最大化期望奖励方差(从结果层面);②TDS:建立方差下界(从过程层面),是OVS的安全网。

 

  • 动态采样器

 

每个training batch分两部分构建:

 

 

图片

 

每隔

图片

步,VPS分数根据当前策略动态刷新,实现“自适应课程学习”效果——随着模型学习进展,"边界问题"集合自然演化,无需人工设计课程。

 

 

图片

数据贡献:填补多模态推理数据空白

 

高质量数据是训练强大推理模型的基石。该方法构建了两个层次的数据资源,为社区提供了可复现的强基线。

 

  • 冷启动数据(~1.6M)

 

覆盖五大领域,严格把控质量与难度:

 

 

图片

 

  • 质量过滤流程:

 

  1. 用Qwen2.5-VL-72B为每道题生成多条响应;

  2. GPT-4o验证正确性,按通过率分级(easy / medium / hard);

  3. 仅保留medium和hard样本,过滤掉"太简单"的题;

  4. 用Gemini 2.5 Pro/Flash生成长链路CoT标注;

  5. GPT-4o再次验证最终答案正确性;

 

  • RL 数据(~15k)

 

 

图片

 

  • 训练流程

 

Qwen2.5-VL-Instruct

       ↓

Cold-start SFT(1.6M长CoT数据,5 epochs)

       ↓

GRPO + VAS(15k RL数据,动态VPS采样)

       ↓

MMR1-3B / 7B

 

 

图片

实验结果:五大基准SOTA性能

 

  • 主实验:7B规模最强多模态推理模型

 

在五个权威推理基准上,MMR1-7B取得推理导向MLLM最高平均分58.4:

 

 

图片

表1:主实验结果对比。上半部分为通用多模态模型,下半部分为推理导向模型。括号内为原论文报告数字,括号外为统一评测结果。加粗为最优,下划线为次优。MMR1-7B在MathVerse、MathVision、ChartQA三项排名第一,平均分58.4达到SOTA。

 

  • 核心亮点:

 

  1. MMR1-7B在MathVerse、MathVision、ChartQA三项排名第一,LogicVista 并列第一;

  2. 对比13个强基线模型(含通用模型与推理导向模型),平均分58.4排名第一

  3. MMR1-3B以更小规模超越多个7B 竞品(R1-VL 47.7、R1-OneVision 47.8),性价比极高。

 

 

图片

图2:VAS训练效率对比。左:Actor梯度范数对比;中:Policy-gradient clip fraction;右:验证集准确率收敛曲线。VAS在三项关键指标上均显著优于vanilla GRPO。

 

从三个关键训练指标可以直观看出VAS的优势

 

  1. 梯度范数:VAS全程保持更高梯度幅度,与理论预测完全一致——奖励方差越大,梯度信号越强;

  2. Policy-gradient clip fraction:更高且更稳定,说明每个batch都提取到了更强的学习信号;

  3. 验证集准确率:收敛速度更快,最终性能更高。

 

  • 消融实验:三大组件缺一不可

 

基于Qwen2.5-VL-3B逐步叠加各组件,验证每个模块的独立贡献:

 

 

图片

 

  1. 冷启动SFT:提供高质量推理轨迹初始化,建立强起点;

  2. GRPO:激励探索性推理行为,突破监督微调的上限;

  3. VAS:稳定RL优化,防止梯度消失,提升最终收敛质量

 

 

图片

图3:VPS分布在训练过程中的动态演化。上排:各训练阶段的VPS边际分布直方图;下排:相邻阶段间的转移矩阵,揭示样本在不同VPS区间之间的流动。

 

一个有趣的发现是,VPS分布在训练过程中会“自发地涌现出课程学习效果”:

 

  1. 训练早期:VPS分布较平,高VPS prompt("边界问题")占比大——模型面对大量"有时对有时错"的难题;

  2. 训练中期:转移矩阵对角线逐渐集中,样本的VPS排序趋于稳定;

  3. 训练晚期:VPS分布向中间值收敛,高VPS的prompt逐渐减少——模型已经掌握了大部分"边界问题"。

 

这种动态无需人工设计课程,VAS自动将注意力引导到当前模型最需要学习的样本上,实现了真正的自适应学习。

 

 

图片

定性分析

 

 

图片

图4:MMR1在MathVerse问题上的完整推理过程展示。模型展现出清晰的逐步推理能力,包括视觉信息提取、数学公式推导和答案验证。

 

  • 全面开源:降低社区研究门槛

 

MMR1秉承开放精神,全面开源以下资源:

 

 

图片

 

  • 总结

 

多模态推理的方法及资源MMR1从"梯度消失"这一被广泛承认却缺乏系统解决的根本性问题出发,做出了三重贡献:

 

  1. 理论突破:首次严格证明奖励方差与策略梯度幅度之间的线性下界关系,为方法设计提供了坚实的数学基础;

  2. 方法创新:提出VAS策略,仅改变数据采样方式,无需修改GRPO算法本身,即插即用,通用性强,并自发涌现出自适应课程学习效果;

  3. 数据贡献:构建~1.6M 冷启动数据和~15k RL 数据,全面开源,填补多模态推理领域的数据空白

 

这三重贡献相辅相成,共同推动MMR1-7B在五大权威基准上取得SOTA性能,为多模态推理研究提供了坚实的理论基础、实用的训练方法和可复现的开源资源。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐