在这里插入图片描述
P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看, 传送门https://blog.csdn.net/qq_74013365

最近AI圈的新词迭代速度,快得跟手机推送似的。

刚把Agent的概念掰扯明白,转头“Harness”就刷屏了。

不知道的还以为是什么新健身装备,或是职场摸鱼新黑话。

说白了,大家慢慢反应过来一件事:AI能不能干活,真不是光看模型牛不牛就行。

1 先搞懂:为啥突然都在说Harness?

1.1 以前我们对AI的认知,特别简单

就像你买个充电宝,只看容量多大、充电快不快就行。

模型就是那个核心电芯,参数越高,大家就觉得越厉害。

但现在的Agent不一样了,它不是蹲那等你问一句答一句。

它要自己拆任务、找工具、记东西、排步骤,中间还得随时调整方案。

这就不是单电芯的事了,是一整套电路、温控、保护板都得跟上。

Harness管的,就是这一整套系统怎么捏合到一块,稳稳当当地把活干明白。

1.2 顺着这个逻辑,评测先坐不住了

你想啊,以前评测模型多简单。

出一套固定题目,输入进去看答案对不对,按正确率打分,排名一列完事。

就像小学考试,标准答案往那一摆,谁对谁错一目了然。

但现在你测的是Agent,是一整套干活的流程。

它中间有没有走弯路?工具用对了吗?步骤逻辑顺不顺?

会不会答案蒙对了,但过程全是瞎猫碰死耗子?

老一套评测方法,搁这就有点像用体重秤测电脑性能——量了个寂寞。

2 HarnessEval:评测也得有自己的“工作流”

2.1 这次的思路,挺绝的

它没说我搞个更牛的打分模型,也没说我再加一百个指标。

它说:既然Agent有Harness,那评测自己也得有Harness。

说白了,以前评测是个死板的判卷老师,照着标准答案机械勾叉。

现在评测要变成个会查案的侦探,先看案子是什么,再决定查什么、怎么查。

不是拿着尺子到处乱量,是先搞明白问题在哪,再针对性找证据。

2.2 具体怎么干?拢共分四步

第一步,先琢磨明白这题到底要测啥。

不是上来就咔咔把所有指标全跑一遍,而是先看案例情况,定个专属评测计划。

就像医生看病,先问诊再开检查,不是上来就让你把所有科室全逛一遍。

第二步,挑合适的技能上。

技能库里有各种检查能力,哪个对应用哪个,按需调用。

为啥用这个、为啥跳过那个,全给你记得明明白白。

不像以前不管啥题,同一套标准硬套,一半检查都跟题目没关系。

第三步,把大问题拆碎了查。

比如要判断一个动作对不对,不能光看最后结果对不对。

得拆成:目标找对了吗?状态变对了吗?中间有没有乱加东西?时序对不对?

每个小问题都有专门的模块去查,各司其职,不混为一谈。

第四步,先验证据再给分。

不是各模块出个数一加就完事。

主智能体得先看看这些证据靠不靠谱、逻辑通不通,能不能支撑最终结论。

最后给你的不只是一个分数,还有一整条完整的证据链。

哪一步查了啥、为啥这么查、查到了啥,全给你摆得清清楚楚。

3 第一个试点,选了最难的世界模型

3.1 为啥先拿世界模型开刀?

因为这玩意评测起来最坑,最能考验真本事。

你想啊,判断一段文字对不对,好歹有个准谱。

判断一个生成的动态世界好不好,事儿就多了去了。

画面再精美,动作执行错了,白搭。

眼前看着没问题,镜头一转东西全变了,那叫场景失忆。

运动看着挺流畅,物理规律全不对,一碰就穿模,那是玄幻片。

传统评测呢,基本就看看画面清不清、流不流畅,跟评短视频画质似的。

真要抠逻辑、抠时序、抠因果,它根本抓不住重点。

3.2 具体怎么拆着查?

就一个核心思路:把模糊的感觉,拆成一个个可验证的小检查。

比如要看一个物体的状态变没变对。

先查这个物体是不是真的存在、清不清晰。

再查变化是不是发生在它身上,没张冠李戴到别的东西上。

再查最后状态对不对,周围的东西有没有跟着乱变。

要是查物理碰撞,那就得追轨迹、看时间对不对、速度合不合理、先后顺序错没错。

每个技能下面,又拆出一堆小智能体,从不同角度抠细节。

最后攒出一棵“证据树”,分数是怎么来的,每一步都能往上倒查。

不是给你个数字就完事,你能顺着摸清楚,模型到底栽在哪一步。

4 这事的本质,是评测的形态彻底变了

4.1 以前的benchmark,更像个离线计算器

数据固定、规则固定、指标固定,跑一遍出个数,完事。

以后的评测,得是个能自己跑、自己迭代的系统。

核心不是攒了多少测试题,而是有多少能用的评测技能、会不会按需组合、能不能验证证据。

模型能靠堆计算提能力,评测当然也可以投入更多计算,查得更深更细。

不同的场景配不同的技能,代码、搜索、机器人、世界模型,各有各的测法。

分数也不再是一锤子买卖,每一分都得有实打实的证据撑着。

遇到实在拿不准的,也别硬给分,老老实实说自己能力不够,查不明白。

4.2 往长远看,这事意义比想象中大

现在大家都在说RSI,说AI能自己改进自己。

但你想啊,自己改得好不好,总得有个靠谱的标准吧?

评测要是不准、不靠谱,那自我改进不就越改越歪?

以前评测是模型外面的一把尺子,量完就收起来。

以后评测得是自我改进闭环里的核心反馈环节。

它关注什么,模型就往什么方向优化。

它要是糊弄事,模型最后也只会练出一身“应试技巧”,真干活全拉胯。

所以说,Harness这阵风,吹的不只是Agent本身。

连带着评测这套玩了很多年的老路子,也得跟着升级换代。

从盯着单个指标,到搭一整套评测系统;

从死抠标准答案,到走通完整的证据链;

从固定不变的尺子,到能跟着模型一起进化的活系统。

Eval的Harness时代,算是正式拉开序幕了。

以后再聊AI好不好,别光盯着模型参数卷了。

评测系统能不能打,其实同样关键。

P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,传送门https://blog.csdn.net/qq_74013365

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐