你问一个客服:"这款设备报警代码 E-07 是什么意思?"答案可能藏在一张故障排除示意图里。
你问财务:"去年华东区各品类毛利率是多少?"数据在一张 PDF 财务报表的表格里,不在任何一段文字中。
你问新员工:"这个流程怎么操作?"老员工给你发了一段 15 分钟的培训录像。
纯文本 RAG 对这类问题,基本是瞎子。它把文档里的图、表、音视频要么丢掉,要么当成无法理解的附件。可企业真正值钱的知识,恰恰大量以非文字形态存在。
这一篇,我们聊多模态 RAG——让检索系统也"看得懂图、读得懂表、听得懂话"。
为什么多模态这么难
文字好处理。切成段、变成向量、存进库,一套流程顺溜得很。
非文字内容不行。一张产品架构图,你不能直接"切分"它;一段会议录音,你没法直接"向量化"它。它们要先被"看懂",才能进入检索链路。
难点的核心叫跨模态对齐:怎么让"用文字问的问题"命中"一张图里画的答案"?怎么让"财务报表里的数字"和"问句里的’毛利率’"对上号?这不是把图片塞进向量库就完事,而是要让不同形态的知识,落进同一套可检索、可溯源的体系。
三类最典型的多模态知识
第一类是图像与图表。产品手册里的爆炸图、系统架构图、仪表盘截图、车间设备照片、手绘草图。它们的信息密度极高,但几乎不出现在文字里。
第二类是表格与复杂版式。PDF 里的双栏论文、带合并单元格的财务报表、跨页的投标书。纯文本解析会把表格结构打散,数字和表头错位,检索出来就是一团乱码。
第三类是音视频。会议录音、客服通话、培训视频、产品演示。它们的知识藏在"说了什么、演示了什么"里,需要转写和关键帧提取才能被检索。
技术路径:先"看懂",再"检索"
对图像,主流有两条路。
一条是图生文:用视觉语言模型(VLM)给图片生成文字描述或结构化摘要,再把这段描述当普通文本走常规 RAG。好处是复用成熟管线,坏处是描述可能丢细节、甚至编造图里没有的东西。
另一条是图像向量:用 CLIP 这类模型,把图片和文字映射到同一向量空间,直接做"以文搜图、以图搜图"。适合"找长得像的那张图"这类任务,但对图表里的精确数字无能为力。
实际系统往往是两条路并用:图表用图生文转成结构化数据,产品照片用图像向量做相似检索。
对表格和版式,靠版式感知解析:模型先认出"这是表、那是标题、左边是图注",再按区域抽取。比普通 PDF 转文本强在保留结构,不会把"表头"和"数值"拆散。
对音视频,分两段处理:ASR 转写把语音变成带时间戳的文字,按话题切分后走文本 RAG;视频则抽关键帧,对每帧用 VLM 出描述,再和转写文字一起建索引。用户问"视频里第几分几秒演示了 XX",能直接定位。
跨模态检索与重排
真正的多模态 RAG,不是各管一摊,而是统一入口。
用户用一句自然语言提问,系统同时在文本、图片向量、表格摘要、音视频转写里并行检索,再用混合检索和重排把不同模态的结果拉到同一把尺子上比相关性。问"报警代码 E-07",可能同时召回一段文字说明、一张示意图、一段培训视频的第 8 分钟。
难点在重排阶段:一张图和一句文字,相关性怎么量化比较?这通常要借助多模态重排模型,或者把非文字结果也转成文字表征后再比。工程上,先保证"召回得全",再慢慢打磨"排得准"。
工程里的坑
图生文幻觉。VLM 把图表里的"37%“读成"73%”,检索时没人发现,答案就错了。关键图表宁可走结构化解析,也不要完全依赖自由描述。
表格解析错位。合并单元格、跨页表、嵌套表,是版式解析的重灾区。错一个格子,整行数据的含义就歪了。
音视频切分粒度。按固定时长切,可能把一句话拦腰斩断;按说话人切,又可能把同一个话题拆进两段。切分策略直接影响检索质量。
存储与成本。图像和视频的向量维度高、数据量大,向量库的存储和查询成本远高于纯文本。需要分级存储、冷热分离(这正好接我们第 ⑫ 篇要聊的成本工程)。
多模态 Faithfulness 更难评。文本 RAG 还能用"引用是否对应原文"衡量,多模态里"这张图是否真支持这个结论"更难自动判断,评估体系要专门设计。
软接 OakRAG:把非文字也变成"可信知识资产"
多模态不是给 RAG 加个花活,而是把企业散落各处的非文字知识,纳入同一套资产管理。
OakRAG 的"可信知识基础",天然要覆盖这些形态:版式感知解析把图表、表格变成可检索、可引用的结构化内容;跨模态混合检索让文字查询也能命中图片和视频片段;而前面讲过的可信四关——溯源、权限、时效、质量评估——对图片和视频同样适用:一张过期的技术图纸要被时效治理拦下,一段涉密录音要被权限隔离挡住。
换句话说,多模态 RAG 把"知识"的边界从文字扩到了企业全部信息资产,而 OakOne 的治理逻辑(OakRAG 承载接入与检索、OakBrain 承载权限时效与质量)不需要为它另起炉灶。
小结与预告
多模态 RAG 的核心,不是"能不能处理图片",而是"非文字知识能不能被检索、被溯源、被治理"。先把图看懂、把表读准、把话转写,再统一进混合检索——这一步迈过去,RAG 才真正配得上"企业知识库"四个字。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~