多模态检索增强生成 Multimodal RAG

Multimodal RAG (mmRAG / Vision-RAG / Video-RAG)

将传统文本 RAG 的检索和生成范围从纯文本扩展到图片、PDF 带版式页面、表格、音频转写、视频帧字幕、图表曲线等多种模态的知识源,统一向量化后混合检索并在生成阶段显式引用多模态证据,显著扩展大模型可利用的企业知识库边界,解决纯文本 RAG 在图表、扫描件、视频资料上完全不可用的问题

详细解释

多模态 RAG(Multimodal RAG,简称 mmRAG,又常被按模态细分称为 Vision-RAG / PDF Layout-RAG / Video-RAG / Table-RAG) 是 传统 RAG 在 2024-2025 年最重要的演进方向之一。传统文本 RAG 的全链路(解析 → 切片 → 向量化 → 检索 → 拼接进 prompt → 生成)默认假设「知识源是纯文本」,一旦遇到企业 80% 实际沉淀的资料形态——产品说明书带电路结构图的 PDF、扫描件发票、年报里的柱状图饼图折线图、培训 PPT、售后故障现场照片、教学长视频、Word 里复杂表格——纯文本 RAG 要么解析不出任何内容(扫描件、图片),要么把表格或图表结构彻底破坏(PDF 表格被粗暴按文本行切出零散数字),最终召回率不足 30%,生成内容和图表完全对不上,幻觉率飙升。

多模态 RAG 的核心思想是把整个 RAG 链路全部模态泛化:解析阶段不再只取纯文本,而是按「页 / 帧 / 图块」为单位,把文字、图表结构、图像、音频、视频帧字幕一起结构化产出;切片/分块阶段不再只按字符或 Token 数切,而是联合「语义边界 + 版式边界 + 图表边界 + 镜头边界」切;向量化阶段用 CLIP 系 / 多模态 Embedding 模型(如 InternVL、LLaVA-Embed、JinaClip、BGE-M3-Multimodal)同时产出文本和图像共享的同一语义空间向量;检索阶段用混合检索(BM25 + 稠密向量 + 结构化字段过滤)跨模态统一召回;生成阶段用多模态 VLM 直接「看到」召回的图片/表格/视频帧截图而不是只看一段被 OCR 歪了的纯文字,回答时引用每个具体图表块的编号与页号。

Multimodal RAG 对企业的价值就是:真正把公司 10 年、20 年积累的「非纯文本」知识资产真正喂给大模型用——制造业的产品图纸、能源行业的设备巡检照片和红外热成像、金融机构的扫描合同和年报图表、教育行业的课堂板书视频和讲义 PPT、医疗系统的医学影像和检查报告图表……纯文本 RAG 处理这些的质量是「聊胜于无」,多模态 RAG 能把这些资料场景的问答准确率从 20% 至 40% 拉到 75% 至 90%,成为企业知识库落地 2025 年之后的默认标准配置。

唯元智创 在 2024 年 Q4 发布的「企业多模态知识库 2.0」就是以 Multimodal RAG 为核心:接入端原生支持 PDF 全版式(含表格、图表、公式、OCR 扫描件)、PPTX、DOCX、图片(JPG/PNG/TIFF)、视频(MP4 自动抽帧 + ASR)、音频;检索端用 BGE-M3 + InternVL2 双 Embedding 联合召回;生成端默认挂 GPT-4o / Qwen-VL-Max / 内部行业 VLM 多模态基座直接「看图 + 看文 + 看表」回答。在某全球 500 强制造企业的产品技术手册知识库项目中,多模态 RAG 上线后针对「某型号液压机构第 3 页结构图对应零件编号说明」「第 12 节保养周期表中 2000 小时档需要更换的密封件清单」这类纯文本 RAG 完全答不对的问题,Top-1 准确率从 18% 提升至 87%,售后工程师现场查手册时间平均从 12 分钟降到 1 分钟,一线客户满意度提升 23 个百分点。

Multimodal RAG 与 4 种 RAG 架构对比表

架构名称支持模态PDF 图表/扫描件正确率(典型企业场景)视频/图片支持生成基座要求企业落地成本工程复杂度推荐度
纯文本 RAG(传统 Naive RAG)仅限纯文本15% 至 35%(图表直接废)不支持纯文本 LLM低极低⭐⭐(仅纯文本文档)
OCR + 纯文本 RAG(伪多模态)文本 + 图片 OCR 成文本35% 至 55%(图表结构全丢)仅 ASR,抽帧 OCR 纯文本纯文本 LLM中低低⭐⭐⭐
Graph RAG(纯文本增强)纯文本 + 实体关系图40% 至 60%不支持纯文本 + 图结构中高高⭐⭐⭐⭐(纯文本复杂长文档)
Adaptive RAG(混合路由)可路由到 mmRAG 模块取决于子链路需子模块扩展路由 LLM + 下游高高⭐⭐⭐⭐(复杂企业混合场景)
Multimodal RAG 全模态原生文本 + 图 + 表 + 版式 + 音视频帧字幕统一嵌入75% 至 92%原生支持抽帧 + 统一检索 + VLM 看图答多模态 VLM(如 GPT-4o、InternVL2、LLaVA 1.6+)中高中高⭐⭐⭐⭐⭐(2025 企业默认)
唯元智创 企业多模态知识库:mmRAG + Layout-Parsing + Structured Rerank + Hybrid Search文本 + 版式 PDF + 表格 + 图表 + 图片 + 视频/音频帧字幕 + OCR 扫描件双保险85% 至 95%(客户实测)全支持,开箱即用可在多主流 VLM 间自由切换中(开箱即SaaS 或私有化)中(交付封装免搭)⭐⭐⭐⭐⭐

实战经验与避坑

  1. 多模态 RAG 的第一大坑:OCR ≠ 多模态解析。千万不要以为把 PDF 每一页 OCR 了、图片里的文字提出来,就算做了「多模态 RAG」——这是最常见的伪多模态 RAG,图表准确率还是在 40% 至 50% 打转:企业知识库 50% 以上的高价值信息都存在「图表 / 表格 / 流程图 / 电路原理图」里,这些信息的结构(比如柱状图的 X/Y 轴、饼图的扇区占比、财务表格的行列交叉关系)是纯 OCR 文本根本还原不出来的。正确的解析链路必须三层并行:(a) 文字层(PDF 原生文字流提取 + OCR 扫描件兜底)、(b) 结构层(DocLayout-YOLO / TableMASTER / Plot2Code 等版式 / 表格 / 图表专用解析模型,把表格读成 Markdown/HTML、把曲线数值抽成结构化 JSON、把流程图读成节点边关系)、(c) 图像层(原 PDF 页或图片、原视频帧保留原图块,给多模态 VLM 直接看),三层结果存到同一块里,检索和生成时按需取用。少了任何一层,都只是伪多模态。
  2. 多模态 Embedding 选型很关键,不要用纯文本 Embedding 去接 OCR 后的图片文字,一定要用同一语义空间的多模态 Embedding 模型:很多团队在向量化图省事,把图片做 OCR 后用 BGE 纯文本 Embedding,结果就是「一张红色折线图表示 Q3 营收同比下降 12%」这种关键视觉信息(颜色、走势、标注箭头)完全丢失,用户搜「三季度营收下降的图」完全搜不到。2025 年主流成熟的多模态 Embedding 推荐三类:JinaClip-v2 / BGE-M3-Multimodal / InternVL2-Embed,三者都能把「一段文字」和「一张图片」映射到同一 768 或 1024 维空间里,纯文字到纯文字、纯文字到图片、图片到图片的召回都能 Top-5 命中。实测在企业产品图纸场景,换上多模态 Embedding 之后,用户以图搜图(拍故障现场照片搜历史相似故障)的 Top-3 命中率从 28% 飙升到 82%,是 mmRAG 最核心的体验跃迁。
  3. 切片/分块策略要改成「版式边界优先 + 图表块独立切块」,不要沿用纯文本 RAG 的「512 Token 一刀切 + 20% 重叠」:纯文本分块如果生搬硬套到多模态 PDF,会出现「一张图被中间切成两块」「一个 15 行的财务表格被切成 4 段、每个段信息都不全」「流程图的标题和图分在不同块里」等灾难性问题,直接导致召回 3 段也拼不回完整上下文。正确的多模态分块顺序:第一步先做版式检测(标题层级、章节段落、图片块、表格块、图表块、公式块),把图片、表格、图表、公式各自作为独立的整块保留;第二步对文字段落按语义切分,并带上相邻的章节层级路径;第三步把「同一个图表 + 它紧邻的标题 + 正文解释段落」作为一个联合块入库(Chunk 里同时含文字文本、原图像像素、结构化表格 JSON)。这样做出来的块,单块就能完整回答一个问题,RAG 上下文拼接效率和准确率都能大幅提升。
  4. 生成阶段必须上多模态 VLM,不要把图片再 OCR 成文字给纯文本模型看:很多团队在最后一步图省事,用 GPT-3.5-Turbo 这类纯文本模型做生成,把召回的图表「先 OCR 或 Plot2Code 转成文字再拼 prompt」,最终效果仍然很一般。必须直接上能看图的 VLM(如 GPT-4o、Claude 3.5 Sonnet、Qwen-VL-Max、InternVL2、LLaVA 1.6+),把召回的原文块和原图像块、原表格 Markdown 一起喂给 VLM 生成,VLM 能直接从图像里读出「柱状图第 3 根柱子高度是前一年的 120%」「流程图里步骤 5 到步骤 6 有一个错误箭头」这类 OCR + 纯文本完全无法识别的信息,准确率在图表场景比纯文本模型再提升 20 个百分点以上。
  5. 视频知识源不要把整段 ASR 当纯文本切,一定要按「镜头边界 + 字幕语义停顿」双维度联合切片,并把关键帧原图作为块的视觉部分一起入库:大量企业培训资料是 1 小时或 2 小时的 MP4 视频,纯 ASR 字幕切分后会丢失「讲师指着白板上的哪张图在讲」的强视觉关联,用户问「第 3 节里画的三角形风险控制模型怎么用」根本搜不到。正确做法:每 1 至 3 秒抽 1 帧,用 Shot-Boundary-Detection 算法检测镜头切换点;ASR 字幕同时按语义停顿分块;把同一镜头段内连续的关键帧(最多 3 张代表帧原图)+ 该段 ASR 字幕 + 时间戳作为一个联合块入库。用户提问时,mmRAG 召回的是「对应时间戳的关键帧原图 + 对应字幕段」,再把两者一起喂给多模态 VLM,VLM 就能像真的看过那段视频一样给出精确回答。
  6. 多模态 RAG 的评估集不能再用纯文本问答对,必须手动构建 200 至 500 条「带图表/视频/图片上下文的问题-答案-证据块黄金集」,否则评估结果是虚高的:很多团队沿用以前的纯文本评估集测 mmRAG,发现准确率只高了 2% 至 3%,就误以为 mmRAG 收益不大——那是因为纯文本评估集本来就是纯文本 RAG 也能答对的。一定要自己花半天到一天人工构建一份「模态挑战集」:里面至少 50% 的问题必须依赖图片或表格或图表或视频帧才能回答(例「下图里 2025 年预期毛利率的具体数值是多少」「参考扫描件第 2 页右上角的公章名称」「视频 00:12:40 处白板上画的第三层防护栏结构」),剩下 50% 是纯文本问题做对照。只有在这份模态挑战集上 Top-1 准确率比纯文本 RAG 提升 25% 以上,mmRAG 的投入才算真正回本。

常见问题

多模态 RAG 是不是就是把所有东西全转成文字再走普通 RAG?为什么我这么做了效果还是很差?
完全不是一回事。「全转成文字再走普通 RAG」是业界最常见的伪多模态 RAG,效果差的根因就是你在转成文字的那一步已经把 60% 以上的关键视觉和结构信息不可逆地丢掉了,检索再强也补不回来。用三个最常见的企业真实例子来说明转文字到底丢了什么:例 1:年报柱状图(营收同比对比)。真实信息是「2023 营收 120 亿,同比 +22%,2024 135 亿同比 +12.5%,但 2024 利润率柱比 2023 矮,利润反而下降 3%」。用 OCR + Plot2Code 转文字后,最多能还原出大致数值,但柱子高低的视觉对比、颜色编码(绿色盈利、红色亏损)、标注箭头(图上红色「利润率承压」手注)、脚注小字「2024 含 15 亿一次性并购摊销」这些关键结论会被丢掉 70%,RAG 召回到这段文字,纯文本模型也读不出「利润率为什么下降」的视觉线索。例 2:扫描版合同盖章页。法务最常问「这份合同最后一页盖章的公司全称是什么?有没有同时盖了骑缝章?」。纯 OCR 经常会把艺术字体公章识别成乱码,更无法判断「骑缝章的半个章是否和其他页对得上」——这些判断必须依赖「让多模态 VLM 直接看原图」。例 3:产品手册里的液压系统原理图。工程师要查「单向阀的位置和溢流阀怎么配合动作」,纯 OCR 最多识别出几个零件的文字编号,但零件之间的油路连接方向、箭头、虚线控制油路、溢流位置这些几何和拓扑结构信息完全无法转成文字,纯文本 RAG 永远答不对。真正的 mmRAG 做法是三重并行:结构化解析(把表格/图表/流程转成可检索的 Markdown 和 JSON 字段)、原图原帧保留(让多模态 VLM 直接看像素级视觉信息)、文字提取保留(辅助精确词匹配和 BM25 检索)。三层信息都保留在同一个 Chunk 里,检索阶段跨模态混合召回、生成阶段多模态 VLM 直接看三层联合信息,而不是一开始就把所有信息坍缩成劣质文字。这也是为什么 唯元智创 多模态知识库在上述三类挑战问题上,相比伪多模态方案准确率能从 30% 至 40% 直接拉到 80% 以上——关键不是检索模型强了,而是「没有把价值最高的视觉结构信息在第一步就扔掉」。
纯文本 RAG 已经做得比较成熟了,现在上多模态 RAG 最小落地版本怎么启动?投入大概多大?
没必要一开始就搭全套全模态链路,按「先解决最高频痛点的 20% 模态,覆盖 80% 的实际场景」做 MVP,2 至 4 周、投入 2 人就能看到显著收益。给一份 2025 年最推荐的企业 mmRAG MVP 四步走路线图:第一步,选对「切入点模态」——只做两类模态:① 带版式的 PDF(含表格、图表、OCR 扫描件)、② 图片/JPG 照片资料。这两类占了企业 80% 以上非纯文本高价值资料,工程实现难度也最低,不要一开始就碰视频和音频(转写、抽帧、镜头检测的复杂度高,等 MVP 验证成功后第二轮再加)。第二步,在原有纯文本 RAG 的解析和分块阶段做「最小升级」,不要重写全链路。解析层追加 DocLayout-YOLO 开源版式分析模型(1 行代码可接),把文档切出 Text / Title / Table / Figure 四类块;对 Table 块再接 TableMASTER 或轻量版 StructEqTable 转成 Markdown 表格;对 Figure 块保留「原图 PNG + OCR 文字 + 紧邻的图标题正文」三项联合。分块阶段把每个 Table/Figure 连同它的图标题和相邻一段文字作为一个整 Chunk 入库。第三步,向量库侧追加一个「多模态 embedding 字段」。先用 BGE-M3-Multimodal 或 InternVL 最便宜的嵌入 API(或开源版本地部署),对文字块做文本嵌入、对 Figure 块的原图做图像嵌入,两者统一存到同一向量维度。检索阶段走 混合检索:BM25 原文字 + 多模态稠密向量 + 可选「只搜 Figure 块」的元数据过滤开关。第四步,生成阶段把原来调用纯文本 LLM 的地方,切调用多模态 VLM(GPT-4o Mini 起步就够用,成本极低),如果召回 Chunk 里包含 Figure 原图,就把图像 URL 或 base64 和原文字一起按 VLM 的消息格式传过去。如果召回的是 Table 块 Markdown,直接喂即可。这样你就搭出了最小可运行 mmRAG。投入方面:工程人力 1 至 2 人,耗时 2 周可以打通 MVP;模型调用成本相比纯文本 RAG 大约上升 20% 至 50%(主要是 VLM 看图),但换来的是 80% 场景准确率翻倍。验证标准就看前面避坑 6 提到的「模态挑战黄金集」——如果你自己做 200 道带图带表的真实企业问题,Top-1 准确率比原纯文本 RAG 高 20% 以上,MVP 就算成功,可以继续加视频/音频、Graph 联合检索等功能;如果达不到,就先回溯解析和分块环节,90% 的失败都是第一步图和表切得不对导致的。唯元智创 也提供开箱即用的 mmRAG SaaS/私有化版本,企业不用自己接任何解析模型,只需上传 PDF、PPT、图片即可直接上线,2 小时内完成从 0 到上线的整个流程,适合希望快速验证 ROI 的团队。
多模态 RAG、Graph RAG、Adaptive RAG 三种架构应该怎么选?可以叠加组合吗?
三者解决的是 RAG 中三个完全独立维度的问题,不是互斥关系;2025 年企业级知识库的终极架构就是三者叠加的「混合 RAG 引擎」,各司其职联合工作。先把职责边界精确划清楚:Graph RAG = 解决「长文档多段落、多实体、多关系跨页」的纯文本复杂推理问题(例如「请梳理出这份 100 页尽职调查里 XX 公司 5 轮融资的投资方、金额、估值变化并串联时间线」),它依赖实体-关系图谱,擅长长链跨段的纯文本推理,但对图表、图片、扫描件完全无能为力。Multimodal RAG = 解决「跨模态信息(图、表、版式、视频帧)的理解和召回」问题,擅长图表问答、图片检索、扫描件问答等,但在超长纯文本跨段推理上不如 Graph RAG。Adaptive RAG = 解决「不同类型的问题走不同的检索/推理策略的路由调度」问题,它是一个上层路由器:收到用户问题后,先用小模型判断这题属于「简单事实题(去普通向量检索)」「多跳长链纯文本题(去 Graph RAG)」「带图/表/版式/附件的跨模态题(去 Multimodal RAG)」「查外部最新资讯(去联网搜索)」「工具计算题(去函数调用 + Code Interpreter)」,然后把请求分发给最优子链路。既然三者职责独立,终极架构自然是叠加:最上层挂 Adaptive RAG 路由层 → 路由分出多模态题送 Multimodal RAG、分出长链纯文本推理题送 Graph RAG、分出简单事实题送普通 RAG → 各子链路跑完返回各自的证据块 → 再统一送到多模态 VLM 做最终答案生成与答案合并(即 Rerank 统一精排所有候选证据块)。落地建议按阶段建,不要一口气搭全。阶段 1(1 个月):先上 Multimodal RAG 解决最痛的 PDF 图表 + 图片问题 → 解决 80% 的客户吐槽点;阶段 2(第 2 个月):叠加 Graph RAG 覆盖长文档多跳纯文本推理 → 解决剩下 15% 的长链问题;阶段 3(第 3 个月):上层加一个轻量 Adaptive 路由器,把问题按关键词/LLM 分类自动在两套链路之间切换,同时加「不知道就查 Search API / 工具调用」的兜底分支 → 最后 5% 的疑难杂症解决率再上一个台阶。唯元智创 的旗舰版知识库就是按这个三层叠加架构交付,在 10 家以上行业头部客户实测对比:阶段 1 mmRAG 单独准确率 85%、阶段 2 +GraphRAG 90%、阶段 3 +Adaptive 94%,最终准确率比纯文本 RAG 提升了 2 倍以上,客户付费转化率在旗舰版上比标准版高 45%。