做 Agent 服务这段时间,被问得最多的问题就是:"我该用哪个模型?"

这个问题其实很难回答,因为它往往问错了方向。大多数人把"选模型"当成选一个更聪明的聊天机器人——谁分数高选谁。但 Agent 不是聊天,选模型的标准完全不同。

一、为什么 Agent 选模型和聊天不一样

聊天是一次问答,答错了,顶多回答得不专业,用户重新问一次就行。

Agent 不一样。一次 Agent 任务,往往要连续调用 5~20 次模型:理解需求、拆解步骤、调用工具、处理结果、再决策下一步。任何一环出错,代价都会沿着链条放大。

举两个真实的场景:

  • 客服 Agent 调错了"退款"工具,直接把钱退了——这在聊天里只是"回答错",在 Agent 里就是"操作错"
  • 财务 Agent 在报表里算错一个数,后面所有基于它的决策都跟着错

所以 Agent 选模型的头号标准,不是"最聪明",而是"最不容易出错、出错也敢兜底"。说得直白点:不是选最强的,是选你敢让它上生产的。

二、"敢用"的三个硬指标

不看榜单分数,看这三个:

1. 工具调用正确率

Agent 的核心是调工具:调对函数、传对参数、按顺序执行、该停就停。这是生产环境里模型之间差距最大的地方。目前多轮工具调用的主流基准 TAU-bench 上,头部模型能达到 87% 以上的正确率,但这个数字在不同任务上波动很大——所以别只看总分,要看它在你那个场景的表现。

2. 拒答能力

这个指标很少有人提,但对 Agent 特别重要:不确定的时候,敢不敢说"不"。

一个敢拒绝的模型,遇到权限模糊、指令冲突、数据缺失的情况会停下来问人,而不是硬着头皮执行。对 Agent 来说,"不乱动"比"多做一步"安全得多。评估的时候专门测这种边界场景,比测它多聪明有用。

3. 长任务稳定性

Agent 常常要跑几十步。有的模型前三步很聪明,到第十五步开始跑偏、忘了最初的指令、开始自由发挥。长任务稳定性,就是看它能不能从头到尾守得住目标。这个指标只能拿你的真实任务去跑,榜单测不出来。

三、怎么评估:建你自己的 eval 集

这是选型里最容易被跳过、也最值钱的一步。

别信厂商的跑分,也别信别人的测评文章。正确做法是:

  1. 从你的真实业务里挑 20~50 个有代表性的任务,做成测试集
  2. 明确"什么算成功":工具调对没有、结果对不对、该停的时候停没有
  3. 让候选模型各跑一遍,记下成功率、失败原因、耗时
  4. 拿结果说话,而不是拿感觉说话

建议先拿最强模型跑一遍,建立性能基线,再逐个换小模型,看它能不能保住基线的结果。很多场景里,小模型在简单任务上完全够用,能省下可观的成本——但前提是有 eval 数据撑着,而不是凭感觉换。

四、选型是一个过程,不是一次决定

模型不是选一次就完事的。一个 Agent 从原型到生产,通常要经历三个阶段:

  • 原型期:先用最强模型把流程跑通,这时候不心疼钱,目标是确认业务逻辑成立
  • 生产期:在 eval 集上验证后,把简单子任务换到性价比更高的模型,贵模型只留给关键环节
  • 放量期:业务量上来后,做模型路由——规划、决策用强模型,分类、抽取、总结这类子任务交给便宜模型

也就是说,"选哪个模型"的正确答案是:分阶段选,可能不止一个。

五、别忽略模型之外的那一层

最后说个容易被忽视的点:模型能力再强,也绕不开你接入的那条 API 通道。

Agent 是生产系统,意味着它对接口的要求是稳定而不是便宜:

  • 限流和并发:Agent 高频调用,一次 429 就可能打断整个任务链
  • 故障响应:模型服务出问题,多久能恢复、有没有备用通道
  • 售后支持:出问题找谁、响应多快、能不能帮你排查
  • 计费透明:缓存怎么算、对账依据是什么,能不能看到每一笔消耗

这些听起来不像"选模型",但生产环境里,通道的稳定性往往比模型的聪明程度更能决定你敢不敢用。

小结

给 Agent 选模型,别问"哪个最聪明",问"哪个你敢用":

  • 看工具调用正确率、拒答能力、长任务稳定性
  • 用你自己的 eval 集测,别信跑分
  • 分阶段选型,原型、生产、放量各不同
  • 模型之外,接口通道的稳定性同样决定成败

选型是第一步,后面还有工程和运营。这个系列我会继续讲——如果你也踩过模型选型的坑,欢迎评论区聊聊。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐