详细解释
多模态 RAG(Multimodal RAG,简称 mmRAG,又常被按模态细分称为 Vision-RAG / PDF Layout-RAG / Video-RAG / Table-RAG) 是 传统 RAG 在 2024-2025 年最重要的演进方向之一。传统文本 RAG 的全链路(解析 → 切片 → 向量化 → 检索 → 拼接进 prompt → 生成)默认假设「知识源是纯文本」,一旦遇到企业 80% 实际沉淀的资料形态——产品说明书带电路结构图的 PDF、扫描件发票、年报里的柱状图饼图折线图、培训 PPT、售后故障现场照片、教学长视频、Word 里复杂表格——纯文本 RAG 要么解析不出任何内容(扫描件、图片),要么把表格或图表结构彻底破坏(PDF 表格被粗暴按文本行切出零散数字),最终召回率不足 30%,生成内容和图表完全对不上,幻觉率飙升。
多模态 RAG 的核心思想是把整个 RAG 链路全部模态泛化:解析阶段不再只取纯文本,而是按「页 / 帧 / 图块」为单位,把文字、图表结构、图像、音频、视频帧字幕一起结构化产出;切片/分块阶段不再只按字符或 Token 数切,而是联合「语义边界 + 版式边界 + 图表边界 + 镜头边界」切;向量化阶段用 CLIP 系 / 多模态 Embedding 模型(如 InternVL、LLaVA-Embed、JinaClip、BGE-M3-Multimodal)同时产出文本和图像共享的同一语义空间向量;检索阶段用混合检索(BM25 + 稠密向量 + 结构化字段过滤)跨模态统一召回;生成阶段用多模态 VLM 直接「看到」召回的图片/表格/视频帧截图而不是只看一段被 OCR 歪了的纯文字,回答时引用每个具体图表块的编号与页号。
Multimodal RAG 对企业的价值就是:真正把公司 10 年、20 年积累的「非纯文本」知识资产真正喂给大模型用——制造业的产品图纸、能源行业的设备巡检照片和红外热成像、金融机构的扫描合同和年报图表、教育行业的课堂板书视频和讲义 PPT、医疗系统的医学影像和检查报告图表……纯文本 RAG 处理这些的质量是「聊胜于无」,多模态 RAG 能把这些资料场景的问答准确率从 20% 至 40% 拉到 75% 至 90%,成为企业知识库落地 2025 年之后的默认标准配置。
唯元智创 在 2024 年 Q4 发布的「企业多模态知识库 2.0」就是以 Multimodal RAG 为核心:接入端原生支持 PDF 全版式(含表格、图表、公式、OCR 扫描件)、PPTX、DOCX、图片(JPG/PNG/TIFF)、视频(MP4 自动抽帧 + ASR)、音频;检索端用 BGE-M3 + InternVL2 双 Embedding 联合召回;生成端默认挂 GPT-4o / Qwen-VL-Max / 内部行业 VLM 多模态基座直接「看图 + 看文 + 看表」回答。在某全球 500 强制造企业的产品技术手册知识库项目中,多模态 RAG 上线后针对「某型号液压机构第 3 页结构图对应零件编号说明」「第 12 节保养周期表中 2000 小时档需要更换的密封件清单」这类纯文本 RAG 完全答不对的问题,Top-1 准确率从 18% 提升至 87%,售后工程师现场查手册时间平均从 12 分钟降到 1 分钟,一线客户满意度提升 23 个百分点。
Multimodal RAG 与 4 种 RAG 架构对比表
| 架构名称 | 支持模态 | PDF 图表/扫描件正确率(典型企业场景) | 视频/图片支持 | 生成基座要求 | 企业落地成本 | 工程复杂度 | 推荐度 |
|---|---|---|---|---|---|---|---|
| 纯文本 RAG(传统 Naive RAG) | 仅限纯文本 | 15% 至 35%(图表直接废) | 不支持 | 纯文本 LLM | 低 | 极低 | ⭐⭐(仅纯文本文档) |
| OCR + 纯文本 RAG(伪多模态) | 文本 + 图片 OCR 成文本 | 35% 至 55%(图表结构全丢) | 仅 ASR,抽帧 OCR 纯文本 | 纯文本 LLM | 中低 | 低 | ⭐⭐⭐ |
| Graph RAG(纯文本增强) | 纯文本 + 实体关系图 | 40% 至 60% | 不支持 | 纯文本 + 图结构 | 中高 | 高 | ⭐⭐⭐⭐(纯文本复杂长文档) |
| Adaptive RAG(混合路由) | 可路由到 mmRAG 模块 | 取决于子链路 | 需子模块扩展 | 路由 LLM + 下游 | 高 | 高 | ⭐⭐⭐⭐(复杂企业混合场景) |
| Multimodal RAG 全模态原生 | 文本 + 图 + 表 + 版式 + 音视频帧字幕统一嵌入 | 75% 至 92% | 原生支持抽帧 + 统一检索 + VLM 看图答 | 多模态 VLM(如 GPT-4o、InternVL2、LLaVA 1.6+) | 中高 | 中高 | ⭐⭐⭐⭐⭐(2025 企业默认) |
| 唯元智创 企业多模态知识库:mmRAG + Layout-Parsing + Structured Rerank + Hybrid Search | 文本 + 版式 PDF + 表格 + 图表 + 图片 + 视频/音频帧字幕 + OCR 扫描件双保险 | 85% 至 95%(客户实测) | 全支持,开箱即用 | 可在多主流 VLM 间自由切换 | 中(开箱即SaaS 或私有化) | 中(交付封装免搭) | ⭐⭐⭐⭐⭐ |
实战经验与避坑
- 多模态 RAG 的第一大坑:OCR ≠ 多模态解析。千万不要以为把 PDF 每一页 OCR 了、图片里的文字提出来,就算做了「多模态 RAG」——这是最常见的伪多模态 RAG,图表准确率还是在 40% 至 50% 打转:企业知识库 50% 以上的高价值信息都存在「图表 / 表格 / 流程图 / 电路原理图」里,这些信息的结构(比如柱状图的 X/Y 轴、饼图的扇区占比、财务表格的行列交叉关系)是纯 OCR 文本根本还原不出来的。正确的解析链路必须三层并行:(a) 文字层(PDF 原生文字流提取 + OCR 扫描件兜底)、(b) 结构层(DocLayout-YOLO / TableMASTER / Plot2Code 等版式 / 表格 / 图表专用解析模型,把表格读成 Markdown/HTML、把曲线数值抽成结构化 JSON、把流程图读成节点边关系)、(c) 图像层(原 PDF 页或图片、原视频帧保留原图块,给多模态 VLM 直接看),三层结果存到同一块里,检索和生成时按需取用。少了任何一层,都只是伪多模态。
- 多模态 Embedding 选型很关键,不要用纯文本 Embedding 去接 OCR 后的图片文字,一定要用同一语义空间的多模态 Embedding 模型:很多团队在向量化图省事,把图片做 OCR 后用 BGE 纯文本 Embedding,结果就是「一张红色折线图表示 Q3 营收同比下降 12%」这种关键视觉信息(颜色、走势、标注箭头)完全丢失,用户搜「三季度营收下降的图」完全搜不到。2025 年主流成熟的多模态 Embedding 推荐三类:JinaClip-v2 / BGE-M3-Multimodal / InternVL2-Embed,三者都能把「一段文字」和「一张图片」映射到同一 768 或 1024 维空间里,纯文字到纯文字、纯文字到图片、图片到图片的召回都能 Top-5 命中。实测在企业产品图纸场景,换上多模态 Embedding 之后,用户以图搜图(拍故障现场照片搜历史相似故障)的 Top-3 命中率从 28% 飙升到 82%,是 mmRAG 最核心的体验跃迁。
- 切片/分块策略要改成「版式边界优先 + 图表块独立切块」,不要沿用纯文本 RAG 的「512 Token 一刀切 + 20% 重叠」:纯文本分块如果生搬硬套到多模态 PDF,会出现「一张图被中间切成两块」「一个 15 行的财务表格被切成 4 段、每个段信息都不全」「流程图的标题和图分在不同块里」等灾难性问题,直接导致召回 3 段也拼不回完整上下文。正确的多模态分块顺序:第一步先做版式检测(标题层级、章节段落、图片块、表格块、图表块、公式块),把图片、表格、图表、公式各自作为独立的整块保留;第二步对文字段落按语义切分,并带上相邻的章节层级路径;第三步把「同一个图表 + 它紧邻的标题 + 正文解释段落」作为一个联合块入库(Chunk 里同时含文字文本、原图像像素、结构化表格 JSON)。这样做出来的块,单块就能完整回答一个问题,RAG 上下文拼接效率和准确率都能大幅提升。
- 生成阶段必须上多模态 VLM,不要把图片再 OCR 成文字给纯文本模型看:很多团队在最后一步图省事,用 GPT-3.5-Turbo 这类纯文本模型做生成,把召回的图表「先 OCR 或 Plot2Code 转成文字再拼 prompt」,最终效果仍然很一般。必须直接上能看图的 VLM(如 GPT-4o、Claude 3.5 Sonnet、Qwen-VL-Max、InternVL2、LLaVA 1.6+),把召回的原文块和原图像块、原表格 Markdown 一起喂给 VLM 生成,VLM 能直接从图像里读出「柱状图第 3 根柱子高度是前一年的 120%」「流程图里步骤 5 到步骤 6 有一个错误箭头」这类 OCR + 纯文本完全无法识别的信息,准确率在图表场景比纯文本模型再提升 20 个百分点以上。
- 视频知识源不要把整段 ASR 当纯文本切,一定要按「镜头边界 + 字幕语义停顿」双维度联合切片,并把关键帧原图作为块的视觉部分一起入库:大量企业培训资料是 1 小时或 2 小时的 MP4 视频,纯 ASR 字幕切分后会丢失「讲师指着白板上的哪张图在讲」的强视觉关联,用户问「第 3 节里画的三角形风险控制模型怎么用」根本搜不到。正确做法:每 1 至 3 秒抽 1 帧,用 Shot-Boundary-Detection 算法检测镜头切换点;ASR 字幕同时按语义停顿分块;把同一镜头段内连续的关键帧(最多 3 张代表帧原图)+ 该段 ASR 字幕 + 时间戳作为一个联合块入库。用户提问时,mmRAG 召回的是「对应时间戳的关键帧原图 + 对应字幕段」,再把两者一起喂给多模态 VLM,VLM 就能像真的看过那段视频一样给出精确回答。
- 多模态 RAG 的评估集不能再用纯文本问答对,必须手动构建 200 至 500 条「带图表/视频/图片上下文的问题-答案-证据块黄金集」,否则评估结果是虚高的:很多团队沿用以前的纯文本评估集测 mmRAG,发现准确率只高了 2% 至 3%,就误以为 mmRAG 收益不大——那是因为纯文本评估集本来就是纯文本 RAG 也能答对的。一定要自己花半天到一天人工构建一份「模态挑战集」:里面至少 50% 的问题必须依赖图片或表格或图表或视频帧才能回答(例「下图里 2025 年预期毛利率的具体数值是多少」「参考扫描件第 2 页右上角的公章名称」「视频 00:12:40 处白板上画的第三层防护栏结构」),剩下 50% 是纯文本问题做对照。只有在这份模态挑战集上 Top-1 准确率比纯文本 RAG 提升 25% 以上,mmRAG 的投入才算真正回本。