个人微信二次开发如何接入多模态AI?让微信机器人看懂图片与文件
纯文本机器人在微信场景里会漏掉大量信息。客户发来一张报错截图问"这个怎么解决"、发来一份Excel报价单问"帮我对比下这几家"、发来商品照片问"有没有同款"——这些消息里的关键信息全在图片和文件里,文本模型完全看不见。接入多模态能力后,机器人才真正具备"看图读文件"的完整感知,能处理的业务场景直接翻倍。
一、图片消息的两层理解——OCR与视觉语义
图片理解不是一个能力是两层。第一层OCR文字提取:截图里的报错信息、聊天记录截图、单据照片,价值在文字内容,OCR提取出文字后走常规文本处理即可。OCR的关键工程点是"提取后结构化"——报错截图提取出的文字要识别出错误码、错误描述、触发位置三个字段,而不是把一堆原始文字丢给大模型。
第二层视觉语义理解:商品照片、现场照片、包装破损图,价值在图像本身,需要视觉大模型(VLM)理解——"这是什么商品""破损在什么位置、严重程度如何"。视觉理解的输出要转成业务结构化标签(商品类别、破损等级),后续流程(换货/赔偿/推荐同款)基于标签路由,而不是基于一段自然语言描述。
两层能力按图片类型分流:检测到截图类图片(大面积文字、规则边缘)优先走OCR成本低速度快;实物照片类走视觉模型。拿不准类型时两路都跑,结果合并后让大模型判断哪个更可信。
二、文件消息的解析——PDF、Excel、Word各有处理方式
微信里常见的文件类型处理方式完全不同。Excel/CSV是结构化数据:解析成表格后可以做计算和对比——客户发来三家供应商报价单,机器人直接读出每家的单价、交期、账期并生成对比表。PDF分两类,文字版PDF直接提取文本,扫描版PDF本质是图片要走OCR;合同、说明书这类长文档提取文本后还要做分块,不能一次塞进模型。
Word文档通常是半结构化内容:提取段落和标题层级,保留文档结构供后续问答。文件解析的通用原则是"先解析成中间格式,再决定怎么用"——所有文件统一转成文本块+元数据(来源文件名、页码/Sheet名、类型)的中间结构,后续无论是问答、摘要还是对比,都基于中间结构处理,解析层和AI层解耦。
大文件必须做防护:超过大小阈值(如20MB)的文件不直接解析,提示用户文件过大;解析页数/行数设上限,防止一份几千行的Excel把内存打满。从微信下载的文件URL有有效期,收到文件消息后要第一时间转存到自己的对象存储,不能依赖临时URL。
三、多模态上下文融合——图文混合消息怎么理解
真实对话里文本和图片是交织的:客户说"这个报错(截图)怎么解决,我们服务器是CentOS 7",理解这条消息需要把文本意图(求解决方案)、图片内容(具体报错)、文本补充(系统环境)三者融合。分开处理会丢失关联——OCR只看到报错不知道要干嘛,文本只看到"这个"不知道指什么。
融合方式是把一条消息内的多模态内容打包成统一消息体:文本部分作为主描述,图片/文件的解析结果作为附件上下文,一起送给大模型。模型拿到的是"用户说了什么+图片里有什么+文件里有什么"的完整信息。多轮对话中还要记住历史图片——客户上一轮发的截图,这轮说"那按你说的试了还是不行",模型要记得截图里的原始报错。
返回结果也可以多模态:纯文字说不清楚时,机器人可以生成标注图(在客户截图上圈出出错位置)或整理成文件(对比结果生成新Excel发回)。多模态返回比纯文本表达效率高一个量级。
三类消息处理对照
| 消息类型 | 处理能力 | 结构化输出 |
|---|---|---|
| 截图/单据 | OCR文字提取 | 错误码、字段键值 |
| 实物照片 | 视觉语义模型 | 商品类别、破损等级 |
| 文件 | 分类型解析+分块 | 表格行、文本块+元数据 |
多模态处理链路实现
class MultimodalRouter:
def handle(self, msg):
parts = []
if msg.text:
parts.append(TextPart(msg.text))
for img in msg.images:
local = download_and_store(img.url) # 立即转存
if self.is_screenshot(local):
parts.append(OcrPart(self.ocr(local)))
else:
parts.append(VisionPart(
self.vlm_describe(local)))
for f in msg.files:
local = download_and_store(f.url)
parts.append(FilePart(self.parse_file(local)))
return self.fuse(parts, msg)
def parse_file(self, path):
ext = path.suffix
if ext in (".xlsx", ".csv"):
return self.parse_sheet(path) # 结构化行
if ext == ".pdf":
if self.is_scanned_pdf(path):
return self.ocr_pdf(path) # 扫描件走OCR
return self.chunk_text(
extract_pdf_text(path)) # 文字版分块
if ext in (".docx", ".doc"):
return self.parse_docx(path)
raise UnsupportedType(ext)
def fuse(self, parts, msg):
"""图文混合:组装统一消息体送模型"""
context = []
for p in parts:
context.append(p.to_prompt()) # 文本+图片+文件摘要
answer = vlm_chat(
system="你是技术支持,结合用户文字、"
"截图内容和文件信息综合回答",
history=session.multimodal_history, # 含历史图片
user="\n".join(context))
# 必要时多模态返回:生成标注图/结果文件
if answer.needs_annotation:
return send_image(WID, msg.wxid,
annotate(msg.images[0], answer.marks))
return answer.text
落地建议
多模态接入的优先级:先做OCR——截图类消息占客服图片消息的70%以上,纯OCR加文本模型就能解决大部分场景;视觉语义理解第二,需要选择合适的VLM并控制调用成本;文件解析从Excel和文字版PDF起步,这两类业务价值最高。图片和文件收到后第一时间转存到自有存储,微信临时URL失效是高频踩坑点。图片、文件消息的接收下载能力由 Eyun 平台 这类个人微信API平台提供,图片和文件的回复发送接口参数参考 Eyun 开发文档,多模态解析层在自建服务中对接OCR和视觉大模型。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)