纯文本机器人在微信场景里会漏掉大量信息。客户发来一张报错截图问"这个怎么解决"、发来一份Excel报价单问"帮我对比下这几家"、发来商品照片问"有没有同款"——这些消息里的关键信息全在图片和文件里,文本模型完全看不见。接入多模态能力后,机器人才真正具备"看图读文件"的完整感知,能处理的业务场景直接翻倍。
一、图片消息的两层理解——OCR与视觉语义
图片理解不是一个能力是两层。第一层OCR文字提取:截图里的报错信息、聊天记录截图、单据照片,价值在文字内容,OCR提取出文字后走常规文本处理即可。OCR的关键工程点是"提取后结构化"——报错截图提取出的文字要识别出错误码、错误描述、触发位置三个字段,而不是把一堆原始文字丢给大模型。
第二层视觉语义理解:商品照片、现场照片、包装破损图,价值在图像本身,需要视觉大模型(VLM)理解——"这是什么商品""破损在什么位置、严重程度如何"。视觉理解的输出要转成业务结构化标签(商品类别、破损等级),后续流程(换货/赔偿/推荐同款)基于标签路由,而不是基于一段自然语言描述。
两层能力按图片类型分流:检测到截图类图片(大面积文字、规则边缘)优先走OCR成本低速度快;实物照片类走视觉模型。拿不准类型时两路都跑,结果合并后让大模型判断哪个更可信。
二、文件消息的解析——PDF、Excel、Word各有处理方式
微信里常见的文件类型处理方式完全不同。Excel/CSV是结构化数据:解析成表格后可以做计算和对比——客户发来三家供应商报价单,机器人直接读出每家的单价、交期、账期并生成对比表。PDF分两类,文字版PDF直接提取文本,扫描版PDF本质是图片要走OCR;合同、说明书这类长文档提取文本后还要做分块,不能一次塞进模型。
Word文档通常是半结构化内容:提取段落和标题层级,保留文档结构供后续问答。文件解析的通用原则是"先解析成中间格式,再决定怎么用"——所有文件统一转成文本块+元数据(来源文件名、页码/Sheet名、类型)的中间结构,后续无论是问答、摘要还是对比,都基于中间结构处理,解析层和AI层解耦。
大文件必须做防护:超过大小阈值(如20MB)的文件不直接解析,提示用户文件过大;解析页数/行数设上限,防止一份几千行的Excel把内存打满。从微信下载的文件URL有有效期,收到文件消息后要第一时间转存到自己的对象存储,不能依赖临时URL。
三、多模态上下文融合——图文混合消息怎么理解
真实对话里文本和图片是交织的:客户说"这个报错(截图)怎么解决,我们服务器是CentOS 7",理解这条消息需要把文本意图(求解决方案)、图片内容(具体报错)、文本补充(系统环境)三者融合。分开处理会丢失关联——OCR只看到报错不知道要干嘛,文本只看到"这个"不知道指什么。
融合方式是把一条消息内的多模态内容打包成统一消息体:文本部分作为主描述,图片/文件的解析结果作为附件上下文,一起送给大模型。模型拿到的是"用户说了什么+图片里有什么+文件里有什么"的完整信息。多轮对话中还要记住历史图片——客户上一轮发的截图,这轮说"那按你说的试了还是不行",模型要记得截图里的原始报错。
返回结果也可以多模态:纯文字说不清楚时,机器人可以生成标注图(在客户截图上圈出出错位置)或整理成文件(对比结果生成新Excel发回)。多模态返回比纯文本表达效率高一个量级。
三类消息处理对照
消息类型 | 处理能力 | 结构化输出 |
|---|---|---|
截图/单据 | OCR文字提取 | 错误码、字段键值 |
实物照片 | 视觉语义模型 | 商品类别、破损等级 |
文件 | 分类型解析+分块 | 表格行、文本块+元数据 |
多模态处理链路实现
class MultimodalRouter: def handle(self, msg): parts = [] if msg.text: parts.append(TextPart(msg.text)) for img in msg.images: local = download_and_store(img.url) # 立即转存 if self.is_screenshot(local): parts.append(OcrPart(self.ocr(local))) else: parts.append(VisionPart( self.vlm_describe(local))) for f in msg.files: local = download_and_store(f.url) parts.append(FilePart(self.parse_file(local))) return self.fuse(parts, msg) def parse_file(self, path): ext = path.suffix if ext in (".xlsx", ".csv"): return self.parse_sheet(path) # 结构化行 if ext == ".pdf": if self.is_scanned_pdf(path): return self.ocr_pdf(path) # 扫描件走OCR return self.chunk_text( extract_pdf_text(path)) # 文字版分块 if ext in (".docx", ".doc"): return self.parse_docx(path) raise UnsupportedType(ext) def fuse(self, parts, msg): """图文混合:组装统一消息体送模型""" context = [] for p in parts: context.append(p.to_prompt()) # 文本+图片+文件摘要 answer = vlm_chat( system="你是技术支持,结合用户文字、" "截图内容和文件信息综合回答", history=session.multimodal_history, # 含历史图片 user="\n".join(context)) # 必要时多模态返回:生成标注图/结果文件 if answer.needs_annotation: return send_image(WID, msg.wxid, annotate(msg.images[0], answer.marks)) return answer.text落地建议
多模态接入的优先级:先做OCR——截图类消息占客服图片消息的70%以上,纯OCR加文本模型就能解决大部分场景;视觉语义理解第二,需要选择合适的VLM并控制调用成本;文件解析从Excel和文字版PDF起步,这两类业务价值最高。图片和文件收到后第一时间转存到自有存储,微信临时URL失效是高频踩坑点。图片、文件消息的接收下载能力由 Eyun 平台 这类个人微信API平台提供,图片和文件的回复发送接口参数参考 Eyun 开发文档,多模态解析层在自建服务中对接OCR和视觉大模型。