斯坦福等提出 LLM-as-a-Verifier:通用验证框架提升任务表现
一句话讲清楚👉🏻 斯坦福等机构提出 LLM-as-a-Verifier :不靠额外训练,直接对评分 token 的 logit 分布取期望得到连续分数,再沿粒度、重复评估、准则分解三条轴扩展验证算力,在 Terminal-Bench 、 SWE-Bench 、机器人与医疗四个基准上刷到 SOTA ,还能当 Agent 进度条和 RL 稠密奖励用。

Agent 跑长任务时,常见尴尬是:同一条 prompt 采样五次,三次能过、两次翻车——问题往往不在「会不会」,而在「选没选对那条轨迹」。大模型能力这几年靠预训练、后训练、测试时扩展三条轴往上堆,生成侧 Scaling Law 写得明明白白,验证侧却长期停在「让模型吐一个 1–5 分」——离散、易平局、区分度粗。
斯坦福、伯克利、 NVIDIA Research 联合团队的新论文把 verification scaling (验证扩展) 单拎成第四条轴:不改权重、不训奖励模型,只靠 API 返回的 logprobs ,把 Judge 升级成 Verifier 。结果在编码 Agent 、软件修复、机器人操作、医疗 Agent 四条线上同时登顶。

跨编码、机器人、医疗三个领域的整体成绩: Terminal-Bench V2 86.5%、 SWE-Bench Verified 78.2%、 RoboRewardBench 87.4%、 MedAgentBench 73.3%。
验证为什么成了瓶颈?
论文开头画了一张「四大扩展范式」对照图:预训练、后训练、测试时扩展都已成熟,验证扩展几乎是空白。

LLM 能力扩展的四条路径;验证( Verification Scaling )此前缺乏系统化方法。
直觉上,很多 Agent 任务「模型其实会,只是没选对那条轨迹」。团队在 Terminal-Bench V2 上做了 Oracle 实验:假设有一个永远选对轨迹的验证器,把同一任务采样 条轨迹再挑最好的,成功率随 单调上升,全榜候选池拼起来能到 98.9%——接近把整张卷子做完。

Oracle Pass@ 随采样轨迹数增加而上升,说明「会做题」和「选对答案」之间有很大空隙。
空隙就在验证器身上。标准 LM Judge 的做法是: prompt 模型输出离散评分 token ,取概率最高的那个作为最终分数。复杂轨迹一多,两条路经常打成同一个分——Terminal-Bench 上平局率高达 27%。
另一条路是训专门的奖励模型( PRM/ORM ),但受训练数据域限制,跨编码、机器人、医疗很难一套权重通吃。团队要的是:零训练、可插拔、细粒度。
核心机制: Judge 与 Verifier 差在哪?
论文把角色分得很清楚:Judge 下整体结论, Verifier 核对正确性,需要更细的刻度。
做法并不神秘——利用模型本来就会输出的评分 token (论文用字母刻度 ONE…TWENTY ,避免和数字 token 混淆),不取 argmax ,而是对 logit 分布做期望:
逐项拆一下:
■:任务描述;:候选轨迹(代码步骤、工具调用序列等)
■:评分粒度——从 1 个 token 到 20 档字母分
■:同一对轨迹重复评估次数,做蒙特卡洛降噪
■:准则条数——把「对不对」拆成规范符合、输出格式、错误信号等子项
■:模型给第 档分的概率(从 API logprobs 读)
■:把 token 映射到数值,再线性归一化到
两条轨迹谁更好?用 Bradley–Terry 模型把连续分数差转成偏好概率:
连续分数的好处很直接:几乎不会出现精确平局,细差别能反映在 的小数部分上。

统一验证框架:多模态输入 → 对评分 token 分布取期望 → 沿粒度/重复/分解三维扩展 → 用于测试时选优、进度监控、 RL 奖励。
三维验证扩展:多花钱在哪?
论文用 Terminal-Bench V2 上的 pairwise accuracy(成功轨迹是否比失败轨迹分更高)量化三条扩展轴。看 Figure 4 三张子图,趋势一致:钱花得越细,验证越准。

左:评分粒度 从 1 提到 20 ,准确率 73.1%→77.5%;中:重复评估 从 1 到 16 , 74.7%→77.5%;右:准则分解与集成,单准则约 75–76%,三准则集成 78.3%。
粒度:离散 Judge 相当于 。粒度加大后,信号噪声比 SNR 从 0.775 升到 0.799——正确与错误轨迹的分数差更稳定, pairwise 判断更可靠。
重复:单次评估会被 prompt 偶然性带偏;对 次独立打分求平均,方差按 $1/K下降。左图里,在k=16时到k=1起平局率就是k=1时仍有k=16$ 也还有 5.5%。

连续 Verifier (蓝)对比离散 Judge (橙):准确率全程更高,且 Verifier 不产生平局。
准则分解:编码 Agent 任务里,「整体是否正确」太笼统。团队拆成 Specification (是否满足任务要求)、 Output (最终输出格式)、 Errors (日志/工具是否报错)三条,分别打分再平均。任一子准则单独用只有 75–76%,集成后 78.3%。
案例: SQL 优化任务上的 88 次平局
附录里有个 query-optimize 案例很说明问题:两条轨迹都能让 SQL 跑得更快,但失败那条根本没在原始库上做等价性校验,而是另建了一个库——逻辑硬伤。
Gemini 2.5 Flash 的评语其实是分得清的(「略干净」「稍微更直接」),但离散 1–5 分 Judge 在 100 次重复里 88 次打出平局( 5 vs 5 )。换成连续期望()后, 0 次平局, 69 次正确排序; 时正确排序 77 次。同一个模型、同一对轨迹,换读分方式,判别力差了一个量级。
概率枢轴锦标赛: 条候选怎么省预算?
测试时扩展常采样 条轨迹再选最优。朴素做法是 round-robin :所有 对两两比,成本 , 稍大验证费就爆。
团队提出 Probabilistic Pivot Tournament ( PPT ),五阶段流水线:

(1) 候选池 → (2) 环状配对消除位置偏差 → (3) 选 top- 枢轴 → (4) 非枢轴/枢轴两两比 → (5) 按归一化胜场选冠军;复杂度从 降到 。
关键设计有两处:
1.环状首轮( Ring pass ):随机哈密顿环上相邻轨迹配对,每条轨迹在 A/B 槽位各出现一次,抵消模型「偏爱某一侧」的位置偏差。
2.枢轴集:环上得分靠前的 条进入枢轴集,后续只比「非枢轴 vs 枢轴」和「枢轴 vs 枢轴」,把预算集中在最可能正确、也最难区分的头部候选。
论文默认 ,编码任务用三准则分解;同一套超参跨四个基准零微调,这是「通用验证框架」说法的底气。
四个基准上的成绩单
主结果表汇总了各榜 baseline 、 Pass@1 、 Oracle 上界和本文方法:

各基准 baseline 前三名、 Pass@1 、 Oracle Pass@ 与 LLM-as-a-Verifier 成绩;右列「 Ours 」均为该基准 SOTA 。
读表时抓住三个数:Pass@1 是随便取一条的成功率;Oracle 是「验证器永远选对」的理论上限;Ours 是 PPT + 验证扩展实际达到的水平。
| 基准 | 设定要点 | Pass@1 | Oracle | Ours |
|---|---|---|---|---|
| Terminal-Bench V2 | GPT-5.5 采样 5 条, Gemini 2.5 Flash 验证 | 83.1% | 92.1% | 86.5% |
| SWE-Bench Verified | 异构池: Opus 4.5 / G3 Flash / M2.5 各 1 条 | 76.1% | 84.4% | 78.2% |
| MedAgentBench | Opus 4.8 采样 5 条,医疗 EHR 工具链 | 70.2% | 75.0% | 73.3% |
| RoboRewardBench | 500 对机器人视频轨迹偏好 | — | — | 87.4% |
Terminal-Bench V2:长程 shell 任务,文件操作、工具失败恢复都考。 Capy 脚手架 + GPT-5.5 生成,验证后 83.1%→86.5%,超过当时榜一 NexAU-AHE 的 84.7%。
SWE-Bench Verified: 500 个真实 GitHub issue ,要改对代码并通过隐藏测试。这里故意用三家不同模型各出一条 的异构池,考验验证器能不能跨风格选优——78.2% 高于池内任一单模型。
RoboRewardBench:输入是多帧操作视频,要和 RoboReward-8B 、 Robometer-4B 等专门训过的机器人奖励模型 比偏好准确率。零样本 Qwen 3.6 35B + 连续验证:87.4%,离散 Judge 同骨干只有 70.8%。对人标奖励的 MAE 也从 1.11 降到 0.72 。重复评估 从 1 增到 16 ,轨迹偏好准确率 81.5%→87.4%。

RoboRewardBench 上重复评估次数增加,轨迹偏好准确率稳步上升。
MedAgentBench:模拟电子病历环境的医疗 Agent ,验证错了有真实安全风险。 Opus 4.8 Pass@1 70.2%,验证后 73.3%,超过同池单模型。
不止选最优:验证分还能当「进度条」
选好轨迹之外,连续分数随步骤推进的变化也有意义。团队定义 VOC ( Value-Order Correlation ):步骤时间顺序与对应前缀验证分的 Spearman 秩相关,越接近 1 说明「分越高=做得越靠后」。
Terminal-Bench 上成功轨迹 VOC 0.848,失败轨迹 0.769,差距 0.079 。机器人 held-out 集上 VOC 0.966,超过 RoboReward-8B ( 0.877 )和 TOPReward ( 0.565 )——后者常在开头就把 打到 1.0 ,失败后无法反映中段退步。

pytorch-model-cli 任务:成功轨迹(绿)验证分单调上升;失败轨迹(红)因误装 torchvision 占满磁盘,分数长期低迷。
这条性质直接落地成 TurboAgent:插在 Claude Code 等 OpenAI 兼容客户端与后端模型之间的推理代理,并行跑 条轨迹、 PPT 选优,并提供 Web 面板实时看验证曲线——长跑 Agent 任务可以在写坏磁盘前刹车。
顺手解决 RL 的信用分配难题
验证分还能当稠密奖励,不用另训 reward model 。
离策略( LIBERO 机器人): + DSRL-SAC ,每步用 VLM 对子轨迹前缀打进度分 ,塑形奖励 。同样成功率目标,环境步数少约 1.8 倍;最终成功率 0.76 vs 稀疏奖励 0.69 。
在策略( MATH 推理): Qwen3-8B + GRPO ,早期常出现「一组回答全错、组内优势全零、没梯度」。给每条推理链加验证器排序分 ,优化步数少约 10%( 1.1× 样本效率)。

左: LIBERO ketchup 任务 DSRL-SAC ;右: MATH 上 GRPO 。稠密验证奖励(橙)对比稀疏 baseline (灰)的学习曲线。
我的判断:验证扩展值得单独记账
这篇论文的价值,是把「测试时多采样」后半段一直含糊的 「谁来挑」 做成了可扩展工程。连续期望先解决离散 Judge 的平局病,是零训练前提下性价比最高的改动;粒度、重复、分解三维扩展则给出花钱地图——预算紧先加 ,再叠 和准则分解。 PPT 让「采样 条再验证」在大 时仍可负担,把 Oracle 98.9% 的理论空间里挖出了一大块: 86.5% 已吃掉 Pass@1 到 Oracle 之间约一半增益。
也要清醒:依赖 logprobs API(闭源模型若不给 logprob 就难复现);验证成本随候选数线性涨, 很大时仍贵;准则分解目前有人工设计成分,全自动拆 rubric 还没解决。
对做 Agent 平台的团队,短期可试的路径很明确:在现有「多路径采样 + 投票/最长输出」旁边,加一条 连续验证选优 支路;长跑任务把 VOC 曲线暴露给用户,比事后看 log 有用得多。验证这条轴,终于能和训练、推理并列记账了。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)