news 2026/9/1 1:35:18

多模态 RAG:当知识不只是文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
多模态 RAG:当知识不只是文字

你问一个客服:"这款设备报警代码 E-07 是什么意思?"答案可能藏在一张故障排除示意图里。

你问财务:"去年华东区各品类毛利率是多少?"数据在一张 PDF 财务报表的表格里,不在任何一段文字中。

你问新员工:"这个流程怎么操作?"老员工给你发了一段 15 分钟的培训录像。

纯文本 RAG 对这类问题,基本是瞎子。它把文档里的图、表、音视频要么丢掉,要么当成无法理解的附件。可企业真正值钱的知识,恰恰大量以非文字形态存在。

这一篇,我们聊多模态 RAG——让检索系统也"看得懂图、读得懂表、听得懂话"。

为什么多模态这么难

文字好处理。切成段、变成向量、存进库,一套流程顺溜得很。

非文字内容不行。一张产品架构图,你不能直接"切分"它;一段会议录音,你没法直接"向量化"它。它们要先被"看懂",才能进入检索链路。

难点的核心叫跨模态对齐:怎么让"用文字问的问题"命中"一张图里画的答案"?怎么让"财务报表里的数字"和"问句里的’毛利率’"对上号?这不是把图片塞进向量库就完事,而是要让不同形态的知识,落进同一套可检索、可溯源的体系。

三类最典型的多模态知识

第一类是图像与图表。产品手册里的爆炸图、系统架构图、仪表盘截图、车间设备照片、手绘草图。它们的信息密度极高,但几乎不出现在文字里。

第二类是表格与复杂版式。PDF 里的双栏论文、带合并单元格的财务报表、跨页的投标书。纯文本解析会把表格结构打散,数字和表头错位,检索出来就是一团乱码。

第三类是音视频。会议录音、客服通话、培训视频、产品演示。它们的知识藏在"说了什么、演示了什么"里,需要转写和关键帧提取才能被检索。

技术路径:先"看懂",再"检索"

对图像,主流有两条路。

一条是图生文:用视觉语言模型(VLM)给图片生成文字描述或结构化摘要,再把这段描述当普通文本走常规 RAG。好处是复用成熟管线,坏处是描述可能丢细节、甚至编造图里没有的东西。

另一条是图像向量:用 CLIP 这类模型,把图片和文字映射到同一向量空间,直接做"以文搜图、以图搜图"。适合"找长得像的那张图"这类任务,但对图表里的精确数字无能为力。

实际系统往往是两条路并用:图表用图生文转成结构化数据,产品照片用图像向量做相似检索。

对表格和版式,靠版式感知解析:模型先认出"这是表、那是标题、左边是图注",再按区域抽取。比普通 PDF 转文本强在保留结构,不会把"表头"和"数值"拆散。

对音视频,分两段处理:ASR 转写把语音变成带时间戳的文字,按话题切分后走文本 RAG;视频则抽关键帧,对每帧用 VLM 出描述,再和转写文字一起建索引。用户问"视频里第几分几秒演示了 XX",能直接定位。

跨模态检索与重排

真正的多模态 RAG,不是各管一摊,而是统一入口

用户用一句自然语言提问,系统同时在文本、图片向量、表格摘要、音视频转写里并行检索,再用混合检索和重排把不同模态的结果拉到同一把尺子上比相关性。问"报警代码 E-07",可能同时召回一段文字说明、一张示意图、一段培训视频的第 8 分钟。

难点在重排阶段:一张图和一句文字,相关性怎么量化比较?这通常要借助多模态重排模型,或者把非文字结果也转成文字表征后再比。工程上,先保证"召回得全",再慢慢打磨"排得准"。

工程里的坑

图生文幻觉。VLM 把图表里的"37%“读成"73%”,检索时没人发现,答案就错了。关键图表宁可走结构化解析,也不要完全依赖自由描述。

表格解析错位。合并单元格、跨页表、嵌套表,是版式解析的重灾区。错一个格子,整行数据的含义就歪了。

音视频切分粒度。按固定时长切,可能把一句话拦腰斩断;按说话人切,又可能把同一个话题拆进两段。切分策略直接影响检索质量。

存储与成本。图像和视频的向量维度高、数据量大,向量库的存储和查询成本远高于纯文本。需要分级存储、冷热分离(这正好接我们第 ⑫ 篇要聊的成本工程)。

多模态 Faithfulness 更难评。文本 RAG 还能用"引用是否对应原文"衡量,多模态里"这张图是否真支持这个结论"更难自动判断,评估体系要专门设计。

软接 OakRAG:把非文字也变成"可信知识资产"

多模态不是给 RAG 加个花活,而是把企业散落各处的非文字知识,纳入同一套资产管理。

OakRAG 的"可信知识基础",天然要覆盖这些形态:版式感知解析把图表、表格变成可检索、可引用的结构化内容;跨模态混合检索让文字查询也能命中图片和视频片段;而前面讲过的可信四关——溯源、权限、时效、质量评估——对图片和视频同样适用:一张过期的技术图纸要被时效治理拦下,一段涉密录音要被权限隔离挡住。

换句话说,多模态 RAG 把"知识"的边界从文字扩到了企业全部信息资产,而 OakOne 的治理逻辑(OakRAG 承载接入与检索、OakBrain 承载权限时效与质量)不需要为它另起炉灶。

小结与预告

多模态 RAG 的核心,不是"能不能处理图片",而是"非文字知识能不能被检索、被溯源、被治理"。先把图看懂、把表读准、把话转写,再统一进混合检索——这一步迈过去,RAG 才真正配得上"企业知识库"四个字。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 1:33:46

OPPO移动开发笔试复盘:Android系统底层与厂商生态备考要点

2024年9月初,宿舍空调嗡嗡响,我盯着牛客网的笔试倒计时,摄像头绿灯亮着,岗位栏写着“移动开发工程师(OPPO)”。这是我在2024年秋招里参加的第一场厂商类移动开发笔试,考完之后一个很强烈的感受是…

作者头像 李华
网站建设 2026/9/1 1:32:38

27通信电子考研专业课刷题合集:300+院校真题免费领

通信与电子考研,真正拉开差距的往往是专业课。公共课有统一大纲、统一真题,所有人刷的资料都差不多,但专业课不同:院校多、考纲杂、命题风格差异大,信息又分散。很多人不是不努力,而是花大量时间找真题&…

作者头像 李华
网站建设 2026/9/1 1:32:27

Java+Vue前后端分离MES生产执行管理系统源码落地实践

简介:本资源是一套完整的基于Java与Vue的前后端分离架构MES(制造执行系统)生产管理平台源码,面向中高级Java全栈开发者、工业软件学习者及智能制造系统实施人员,旨在解决制造业企业生产计划、过程管控、质量追溯与设备…

作者头像 李华
网站建设 2026/9/1 1:32:06

用Python和pandas实现市场反弹右侧的周度策略回测

市场反弹右侧这个说法,在周度策略分析里经常出现。很多人看盘时能一眼认出“这里好像反弹了”,但落到判断依据上,往往只能说“感觉跌不动了”“放量了”这类主观描述。真正的问题是:同样一段行情,不同人用不同口径判断…

作者头像 李华