官网友情链接: wechatapi.net

AI 微信机器人上线以后,最容易被关注的指标往往是:

自动回复了多少条。

在这里插入图片描述

这个数字当然重要,但真正决定 AI 是否有价值的,不是它回复了多少,而是:

这些回复质量怎么样。

如果 AI 一天自动生成 1000 条回复,其中 400 条都被人工修改,说明系统还有很大优化空间。

如果只是记录:

模型输出;
最终发送内容。

却不知道人工为什么修改,就无法真正定位问题。

所以微信二次开发进入 AI 场景以后,需要建立“回复质量回溯”。

WechatApi 可以作为个人微信API接入层,把真实客户消息、微信群消息、文件和上下文带入业务系统,而 AI 层需要记录模型版本、知识库、Prompt、人工修改和最终结果。

一、每次 AI 回复都需要完整上下文记录

至少保存:

原始消息;
上下文快照;
客户状态;
知识库版本;
命中文档;
Prompt版本;
模型版本;
原始输出;
最终发送内容。

这样后续才能真正复现。

二、人工修改不能只覆盖原文

如果客服把 AI 回复改了。

一定要保留:

AI原始版本;
人工最终版本。

否则后续只看到最终回复,完全不知道 AI哪里有问题。

三、一个具体例子

客户问:

“这个套餐到期以后还能继续用吗?”

AI原答:

“套餐到期后需要续费才能继续使用。”

客服修改:

“到期后的具体使用状态要看当前套餐和账号情况,我先帮您确认。”

这里人工修改背后可能说明:

AI回答过于绝对。

如果系统记录修改原因:

“承诺风险”。

就可以进一步优化 Prompt。

四、修改原因可以分类

事实错误;
信息不完整;
语气问题;
风险过高;
知识库缺失;
上下文错误;
需要人工确认;
模型幻觉。

运营团队后续可以统计。

五、如果大量是知识库缺失,就不要怪模型

比如 40%的人工修改原因都是:

资料没有更新。

这说明真正该做的是更新知识库。

不是换模型。

质量回溯可以帮助团队找到正确问题。

六、Prompt问题也可以通过修改数据发现

如果大量回复都被改得更短。

可能 Prompt 要求过于啰嗦。

如果大量高风险问题都需要人工删掉承诺性语言。

说明 Prompt需要加强边界。

七、WechatApi 在这里负责真实业务入口

WechatApi 提供:

微信消息;
客户;
群聊;
文件;
语音。

这些真实数据让 AI质量评估有真实业务价值。

不是测试集里的标准问题。

八、人工修改率可以成为核心指标

例如:

自动通过率 70%;
人工修改率 20%;
完全驳回 10%。

再按问题类型拆:

FAQ修改率 3%;
售后 30%;
价格 60%。

就能知道哪些场景适合自动回复。

九、客户后续行为也可以作为质量信号

AI回复以后客户:

说“明白了”。

可能质量不错。

继续追问同一个问题。

可能回答不完整。

直接投诉。

可能存在严重问题。

这些都可以作为辅助指标。

十、回复质量不要只看点赞

人工反馈:

有帮助。

但真实修改和后续客户行为往往更有价值。

质量体系应该组合多个指标。

十一、版本切换后要比较数据

模型从 A 切到 B。

观察:

修改率是否下降;
平均回复时长;
转人工率;
客户追问率。

这样模型升级有数据依据。

十二、知识库版本也要对比

知识库 V5 上线以后。

看:

知识库无命中率是否下降;
事实错误修改是否下降。

真正验证升级价值。

在这里插入图片描述

十三、群聊和私聊要分开分析

群聊要求更克制。

私聊可以更详细。

同一个模型在两种场景质量差异可能很大。

不能混成一个指标。

十四、人工修改数据可以用于内部优化,但要脱敏

真实聊天中可能含客户敏感信息。

如果用于训练或评测:

需要脱敏;
权限;
数据范围控制。

不能简单全量复制。

十五、质量问题可以自动生成优化任务

例如:

过去7天“价格类回复”人工修改率 55%。

系统自动生成:

知识库/Prompt优化任务。

交给负责人。

十六、日志必须可追溯

一条错误回复需要知道:

哪条客户消息;
哪个会话;
哪个Prompt;
哪个知识库;
哪个模型;
人工怎么改。

整条链才能定位问题。

十七、人工修改本身也要审核质量

人工不一定永远正确。

重点客户或高风险回复,可以由主管抽检。

避免把错误人工回复当成模型优化标准。

十八、总结

AI微信机器人真正长期优化,不应该只看“自动回复数量”。

WechatApi 可以作为个人微信API接入层,把真实客户沟通带入 AI 系统。

业务系统则需要围绕每一次回复建立:

原始上下文;
模型版本;
知识库版本;
人工修改;
修改原因;
客户后续反馈。

只有这些数据形成闭环,团队才能知道 AI到底哪里不好,以及该改模型、改 Prompt、改知识库还是改上下文。

微信二次开发进入 AI 阶段以后,真正的价值不是一次把机器人做到完美,而是让它能够从每天真实发生的人工修正中持续变好。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐