纯文本机器人在微信场景里会漏掉大量信息。客户发来一张报错截图问"这个怎么解决"、发来一份Excel报价单问"帮我对比下这几家"、发来商品照片问"有没有同款"——这些消息里的关键信息全在图片和文件里,文本模型完全看不见。接入多模态能力后,机器人才真正具备"看图读文件"的完整感知,能处理的业务场景直接翻倍。

一、图片消息的两层理解——OCR与视觉语义

图片理解不是一个能力是两层。第一层OCR文字提取:截图里的报错信息、聊天记录截图、单据照片,价值在文字内容,OCR提取出文字后走常规文本处理即可。OCR的关键工程点是"提取后结构化"——报错截图提取出的文字要识别出错误码、错误描述、触发位置三个字段,而不是把一堆原始文字丢给大模型。

第二层视觉语义理解:商品照片、现场照片、包装破损图,价值在图像本身,需要视觉大模型(VLM)理解——"这是什么商品""破损在什么位置、严重程度如何"。视觉理解的输出要转成业务结构化标签(商品类别、破损等级),后续流程(换货/赔偿/推荐同款)基于标签路由,而不是基于一段自然语言描述。

两层能力按图片类型分流:检测到截图类图片(大面积文字、规则边缘)优先走OCR成本低速度快;实物照片类走视觉模型。拿不准类型时两路都跑,结果合并后让大模型判断哪个更可信。

二、文件消息的解析——PDF、Excel、Word各有处理方式

微信里常见的文件类型处理方式完全不同。Excel/CSV是结构化数据:解析成表格后可以做计算和对比——客户发来三家供应商报价单,机器人直接读出每家的单价、交期、账期并生成对比表。PDF分两类,文字版PDF直接提取文本,扫描版PDF本质是图片要走OCR;合同、说明书这类长文档提取文本后还要做分块,不能一次塞进模型。

Word文档通常是半结构化内容:提取段落和标题层级,保留文档结构供后续问答。文件解析的通用原则是"先解析成中间格式,再决定怎么用"——所有文件统一转成文本块+元数据(来源文件名、页码/Sheet名、类型)的中间结构,后续无论是问答、摘要还是对比,都基于中间结构处理,解析层和AI层解耦。

大文件必须做防护:超过大小阈值(如20MB)的文件不直接解析,提示用户文件过大;解析页数/行数设上限,防止一份几千行的Excel把内存打满。从微信下载的文件URL有有效期,收到文件消息后要第一时间转存到自己的对象存储,不能依赖临时URL。

三、多模态上下文融合——图文混合消息怎么理解

真实对话里文本和图片是交织的:客户说"这个报错(截图)怎么解决,我们服务器是CentOS 7",理解这条消息需要把文本意图(求解决方案)、图片内容(具体报错)、文本补充(系统环境)三者融合。分开处理会丢失关联——OCR只看到报错不知道要干嘛,文本只看到"这个"不知道指什么。

融合方式是把一条消息内的多模态内容打包成统一消息体:文本部分作为主描述,图片/文件的解析结果作为附件上下文,一起送给大模型。模型拿到的是"用户说了什么+图片里有什么+文件里有什么"的完整信息。多轮对话中还要记住历史图片——客户上一轮发的截图,这轮说"那按你说的试了还是不行",模型要记得截图里的原始报错。

返回结果也可以多模态:纯文字说不清楚时,机器人可以生成标注图(在客户截图上圈出出错位置)或整理成文件(对比结果生成新Excel发回)。多模态返回比纯文本表达效率高一个量级。

三类消息处理对照

消息类型

处理能力

结构化输出

截图/单据

OCR文字提取

错误码、字段键值

实物照片

视觉语义模型

商品类别、破损等级

文件

分类型解析+分块

表格行、文本块+元数据

多模态处理链路实现

class MultimodalRouter:
    def handle(self, msg):
        parts = []
        if msg.text:
            parts.append(TextPart(msg.text))
        for img in msg.images:
            local = download_and_store(img.url)  # 立即转存
            if self.is_screenshot(local):
                parts.append(OcrPart(self.ocr(local)))
            else:
                parts.append(VisionPart(
                    self.vlm_describe(local)))
        for f in msg.files:
            local = download_and_store(f.url)
            parts.append(FilePart(self.parse_file(local)))
        return self.fuse(parts, msg)

    def parse_file(self, path):
        ext = path.suffix
        if ext in (".xlsx", ".csv"):
            return self.parse_sheet(path)   # 结构化行
        if ext == ".pdf":
            if self.is_scanned_pdf(path):
                return self.ocr_pdf(path)   # 扫描件走OCR
            return self.chunk_text(
                extract_pdf_text(path))     # 文字版分块
        if ext in (".docx", ".doc"):
            return self.parse_docx(path)
        raise UnsupportedType(ext)

    def fuse(self, parts, msg):
        """图文混合:组装统一消息体送模型"""
        context = []
        for p in parts:
            context.append(p.to_prompt())   # 文本+图片+文件摘要
        answer = vlm_chat(
            system="你是技术支持,结合用户文字、"
                   "截图内容和文件信息综合回答",
            history=session.multimodal_history,  # 含历史图片
            user="\n".join(context))
        # 必要时多模态返回:生成标注图/结果文件
        if answer.needs_annotation:
            return send_image(WID, msg.wxid,
                annotate(msg.images[0], answer.marks))
        return answer.text

落地建议

多模态接入的优先级:先做OCR——截图类消息占客服图片消息的70%以上,纯OCR加文本模型就能解决大部分场景;视觉语义理解第二,需要选择合适的VLM并控制调用成本;文件解析从Excel和文字版PDF起步,这两类业务价值最高。图片和文件收到后第一时间转存到自有存储,微信临时URL失效是高频踩坑点。图片、文件消息的接收下载能力由 Eyun 平台 这类个人微信API平台提供,图片和文件的回复发送接口参数参考 Eyun 开发文档,多模态解析层在自建服务中对接OCR和视觉大模型。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐