详细解释
Adaptive RAG(Adaptive Retrieval-Augmented Generation) 一句话定义:所有普通 RAG 都是「任何问题先向量召回 Top-10 chunk → 塞给同一个模型生成」的固定流水线,而 Adaptive RAG 在流水线最前面加了一个「问题路由器」,先判断这个问题属于什么类型、什么难度,再动态选择最合适的检索-生成路径。最典型的反例:用户问「公司年假多少天」这种 FAQ 里就有的一句话答案,普通 RAG 也要走 embedding → 向量检索 → rerank → 送 10 个 chunk → GPT-4o 生成,成本 ¥0.05 延迟 800ms;Adaptive RAG 路由器判断「这是 FAQ 类,直接去 BM25 精确匹配 FAQ 库」,命中就直接返回原文,成本 ¥0.001 延迟 100ms。
2024 年斯坦福和 LlamaIndex 联合提出的「Self-RAG」和「Corrective RAG(CRAG)」是 Adaptive RAG 家族的两个开山之作。Self-RAG 的思路是让 LLM 在生成过程中「自我反思」:生成一半发现自己知识不够就主动触发一次检索;CRAG 的思路是在召回之后、生成之前加一个「召回质量评估器」——评估召回的 chunk 和问题相关性 ≥0.7 就直接送生成,0.3 至 0.7 之间就去用 HyDE 扩展查询再召回一轮,<0.3 直接判定「召回失败」,触发网络搜索或 Graph RAG 多跳。
唯元智创 的 RAG 路由器是开箱即用的:每条用户问题先跑 10 个维度的轻量分类器(是否含实体、是否多跳、是否含数字、是否代码、是否安全敏感、是否 FAQ 高频等),根据分类结果自动在 8 条预设路径中挑一条;用户也可以自己写路由规则(比如「包含 SKU 编号的问题强制走 SQL+RAG 混合」)。实测在真实企业客服场景,相同答案准确率下,Adaptive RAG 比固定路径 RAG 成本降 62%,P95 延迟从 1.8s 降到 0.7s。
问题路由器的七个常用决策维度(Adaptive RAG 路由表)
把每个用户问题打到下面的标签组合,就能决定走哪条路径:
| 标签维度 | 判定信号 | 触发路径选择 |
|---|---|---|
| 复杂度 | 实体个数 ≥3 / 含「分别」「对比」「汇总」「排名」等聚合词 | 召回深度 ×2,Graph RAG 开启,强制送强模型 |
| 答案确定性 | 问「多少钱」「电话多少」「几月几号」等有唯一标准答案 | 走精确匹配(BM25 + FAQ 库 + SQL),不生成,直接返回原文 |
| 时效性 | 含「今天」「最新」「今年」「实时」等时间词 | 跳过向量检索,直接触发联网搜索 / 企业内部实时 API |
| 代码/结构化 | 问题含代码块 / 要求输出 JSON / SQL / YAML | 走代码片段专用索引 + 语法校验器,生成阶段强制 Structured Output |
| 安全敏感 | 含退款 / 医疗 / 法律 / 财务建议词 | 强制走 Guardrails 双审路径,生成模型禁用强模型温度=0,召回必须命中 2 份以上互证 |
| 已有缓存命中 | 和过去 30 分钟内 1 条历史问题 cosine ≥0.95 | 直接返回历史答案(可选人工确认),不走任何检索生成 |
| 领域 | 分类器判定属于合同 / 代码 / 商品详情等垂直域 | 跳转到该域专用知识库 + 专用微调模型,不走通用库 |
三条最容易落地、ROI 最高的 Adaptive RAG 改造
不要一上来就搞 10 条路径的大路由,90% 的场景先做以下三条就能拿 70% 的收益:
- FAQ 直出旁路:把历史上问过 5 次以上、答案稳定的问答对,单独建一个 FAQ 库(几千条量级)。每个新问题先和 FAQ 库的问题做 BM25 + embedding 融合打分,分数 ≥0.9 且历史答案 30 天内没被标错过,直接返回答案原文,跳过生成。这一条通常能旁路掉 30% 至 50% 的请求。
- 召回质量看门狗 + 重试:召回之后用一个小分类器(3B 级别 20ms 搞定)判断「召回 Top-3 的平均相关性是不是 ≥0.6」,不够就自动触发 HyDE 扩写查询 + 换 chunk size(从 512 切 256 或 1024)再召一轮,再不行才判定失败。这一条能把「召回垃圾导致答案错误」的比例直接砍 50%。
- 大小模型分流:路由器判定为「简单 + 低风险」的问题(FAQ、聊天寒暄、格式化任务)直接走 8B 或 70B 开源小模型,成本是强模型的 1/20 至 1/50;只有「复杂 + 高风险」的才走 GPT-4o / Claude Opus。实测 70% 的请求走小模型答案质量不掉,30% 走强模型兜底,总成本降 80% 以上。