去年,我负责给公司做一个智能客服系统:用户在线提问,机器人理解问题、调用工具查订单、查物流、转人工,全程自动处理。

需求听起来不复杂,但我在这套系统的模型接入上,整整折腾了一年,踩的坑一个比一个深。复盘一下,给做客服类、Agent 类应用的朋友参考。

坑一:多轮对话一长,Token 消耗直接失控

客服场景最大的特点是:对话是多轮的,用户会来回追问。

一开始我直接把整段历史对话全量传给模型,保证上下文完整。结果会话一长,每次请求都要带上之前所有轮次的内容,Token 消耗成倍上涨。一个用户聊十几轮,消耗的 Token 比聊三轮的多出好几倍,但其中大部分历史内容根本用不上。

更麻烦的是,有些用户会在深夜挂着窗口,第二天接着聊,上下文又长又乱。我试过自己做截断,但截多了模型失忆,截少了钱包受罪,一直找不到平衡点。

坑二:工具调用格式不统一,Agent 频繁 “翻车”

客服系统离不开工具调用:查订单状态、查物流轨迹、查询退款进度。

让我崩溃的是,几家主流国产模型的工具调用规范完全不一样。有的用 JSON Schema 描述参数,有的有自己的函数定义格式,返回结果的结构也五花八门。我在代码里为每个模型各写了一套解析逻辑,改一处就要同步改好几处。

最头疼的是切换模型测试时,同样的工具调用,有的模型能正确解析参数,有的模型直接把参数格式搞错,导致查订单查到错误数据。客服答错问题,用户投诉直接翻倍。

坑三:复杂意图理解,国产模型经常答非所问

客服里最难的一类问题,是用户带着情绪、话说不完整:”我之前那个单子怎么还没到?都一个星期了,你们到底行不行?”

这种问题要做多步拆解:识别用户身份、找到对应订单、查物流、判断是否超时、组织安抚话术。早期的国产模型在处理这类多意图任务时,经常只抓住表面关键词,直接答偏,或者给出一段模板化回复,完全没解决用户问题。

我一度怀疑是不是必须上更强的海外模型,但考虑到公司数据合规和成本,这条路走不通。

坑四:大促高峰期,模型接口直接扛不住

最致命的一个坑,是稳定性。

大促期间咨询量翻好几倍,上游模型接口频繁限流,我的服务端又没有完善的降级逻辑,导致大量用户排着排着就掉线了。技术群里一片哀嚎,客服主管天天来找我。

后来我补了重试、做了限流保护,但自己写的降级策略太简单:遇到限流就干等重试,高峰期反而把请求越积越多,雪上加霜。

后来怎么解决的

这四个坑叠加,让我彻底想明白一件事:客服系统这种业务,模型接入层必须稳、必须省、必须调优到位,这些不该靠我一个人硬扛。

最后我接入了深圳市未来未科技提供的中转站方案,变化很直接:

接口统一了。 DeepSeek V4 Pro、通义千问 3.8 Flash、GLM5.2、GLM5.3、Kimi-K3 这些主流国产模型,一套接口搞定,工具调用格式也归一化了。原来那几套解析逻辑删掉,切换模型只改一个参数。

Token 消耗降下来了。 平台会自动精简上下文、裁剪冗余内容,多轮长会话的消耗明显下降。同样的咨询量,账单比之前少了一大截,客服系统这种高频长对话场景,省下的钱非常可观。

复杂意图的识别准了。 平台在调用层做了调优处理,多意图问题的拆解和回答质量比原生调用高了不少。现在用户带着情绪来问,系统能准确识别问题、调用工具、给出合理回复,很多场景已经接近我之前想要的海外模型效果。

稳定性不用自己操心了。 密钥托管、限流、配额、自动重试、故障降级都是平台内置的,上次大促高峰期再也没出现过服务大面积掉线。平台还跟多家上市企业有合作,系统稳定性有真实业务量验证过,比我自己的降级方案靠谱得多。

当时选它还有个原因是新用户有 7 天不限量免费体验,我直接拿历史客服会话数据跑了几天,确认意图识别和 Token 消耗都达标了才切换,试错成本几乎为零。

给同样在做客服 / Agent 应用的朋友

几点经验,掏心窝子说:

  • 多轮对话一定要做上下文管理,全量携带是最大的 Token 浪费源,但别自己乱截,容易截出 “失忆”;

  • Agent 类应用对工具调用的稳定性要求极高,尽量用接口格式统一的方案,别在业务代码里堆各家适配逻辑;

  • 国产模型处理复杂意图,关键在于调用层有没有做任务拆解和调优,”裸调用” 容易翻车;

  • 高峰期稳定性一定要提前测,别等大促当天才发现限流降级扛不住;

  • 选方案用真实历史数据实测,免费试用就是干这个用的。

模型接入的坑,都是工程和稳定性问题。早一点交给专业方案,就能早一点把精力放回业务本身。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐