详细解释
路由大模型(Router LLM,也叫模型路由器、LLM 流量路由)是介于用户请求与一组后端模型之间的智能调度层,它根据每条请求的「复杂度、语义类别、Token 长度预算、成本预算、SLA 等级、用户画像」等多维特征,在 10 毫秒内做出「该请求应该发给哪个后端模型/专家/部署实例」的决策,从而实现与「全量调用最贵模型」相近的业务效果,但整体推理成本下降 40% 至 80%,且 P99 延迟显著改善。
Router LLM 的实现谱系分为三大类:(1) 简单规则路由(Regex + 关键词 + 业务配置),成本几乎为零,适合 2 至 4 个模型的小规模场景;(2) 轻量分类器路由(BERT / Deberta / 小型 Transformer 分类头,10M 至 100M 参数),基于少量标注数据训练,准确率通常在 85% 至 95%,延迟 1 至 5 毫秒;(3) LLM-as-a-Router,用小型模型做自然语言路由推理并结构化输出决策,可处理复杂边界场景,延迟 20 至 100 毫秒,准确率最高。
唯元智创 的 API 网关内置了「三级路由 + 自动回流」策略:规则路由做第一层粗筛(20% 流量直接命中)→ 轻量分类器做第二层细分类(70% 流量命中)→ LLM Router 仅处理剩余 10% 边界请求;同时配备「效果兜底回流」——若小模型调用的结果被置信度打分判定为不合格,会自动切换到大模型重试,用户完全无感知。也可与 混合专家 MoE 的内部专家路由做对比。
路由方法与落地场景对比表
| 路由方法 | 决策延迟 | 路由准确率 | 落地复杂度 | 适合模型数量 | 典型业务场景 | 推荐度 |
|---|---|---|---|---|---|---|
| 规则 Regex + 关键词 | 低于 1ms | 70% 至 80% | 极低 | 2 至 4 | 客服 FAQ、摘要改写、固定格式任务 | ⭐⭐⭐ |
| 轻量分类器(BERT 级) | 1 至 5ms | 85% 至 95% | 中 | 4 至 10 | 通用对话、知识问答、多能力综合平台 | ⭐⭐⭐⭐⭐ |
| LLM-as-a-Router | 20 至 100ms | 92% 至 98% | 中高 | 6 至 20 | 复杂多 Agent、垂类能力矩阵、路由策略频繁迭代 | ⭐⭐⭐⭐ |
| 语义 Embedding 最近邻 | 5 至 15ms | 80% 至 90% | 中 | 4 至 12 | 冷启动无标注数据、相似案例路由 | ⭐⭐⭐⭐ |
| 强化学习动态路由 | 1 至 10ms | 持续优化 | 高 | 6+ | 有历史效果反馈数据、追求成本最优长期 | ⭐⭐⭐⭐ |
| 人工配置 A-B 分流 | 低于 1ms | 人工定义 | 极低 | 2 至 6 | 新产品灰度、模型上线评测 | ⭐⭐⭐ |
实战经验与避坑
- 路由层必须配套「兜底回流机制」:任何路由器都有 2% 至 5% 的错误分发概率,如果错误地把复杂请求发给了小模型,会直接导致业务指标下降;正确做法是在调用完被路由模型后,用「输出置信度打分 + 业务关键指标检测(如代码能否跑通、JSON 是否合法、事实一致性得分)」做兜底,不合格的 3% 至 8% 请求自动回退到大模型重试一次,整体业务效果可与「全量大模型」持平。
- 路由分类器的训练标注务必做「难例挖掘」:简单案例(如「1+1=?」vs「证明黎曼猜想」)路由谁都会,对准确率提升饱和极快;应当把 60% 至 70% 的标注预算投到「边界难例」——即业务上不确定该选小模型还是大模型的案例上,并单独构建 Hard-1000 难例集作为回归评测目标,难例集的准确率每提升 1 个点,整体成本可再下降 2%。
- 路由器特征务必包含「用户 + 历史上下文」维度:仅靠当前请求一句话做路由会遗漏 30% 的关键信息;应至少加入以下特征:用户等级、历史调用失败回退率、上下文长度(长上下文倾向走大容量长窗口模型)、同 Session 前 N 轮路由结果、请求的国别/地区合规要求、当前各后端模型的队列长度与健康状态 SLA 可用性。
- 路由策略的「效果-成本 Pareto 曲线」要定期重绘:业务分布和后端模型版本都会迭代,原有的最优路由权重会逐渐过时;建议每周用过去 7 天的 1% 流量回放做 Offline Replay:在相同请求下模拟 5 至 10 种路由策略,重新计算各权重下的「业务综合分 vs 平均单次成本」的 Pareto 前沿,然后将最新的最优权重 A/B 10% 流量验证 24 小时,通过后全量发布。
- 避免路由器本身成为「单点故障与性能瓶颈」:路由层的延迟预算必须控制在整条请求链路 P95 延迟的 5% 以内(例如总 P95=1s,则路由预算 ≤50ms);推荐将轻量分类器用 ONNX/TensorRT 做 INT8 量化部署,做 3 至 5 副本 + 本地缓存(相同请求哈希命中),复杂 LLM Router 仅在缓存未命中 + 分类器低置信度(低于 0.7)时触发;路由器本身 SLA 目标 99.99%,失败时要 fallback 到默认路由表,不可阻塞主链路。
- 路由切换的「能力不连续性」必须做用户无感知处理:同一会话的多轮对话中,如果前几轮用小模型、后几轮切大模型,上下文的记忆格式与能力基线突然跳变,会导致用户感知到明显的「前后回复不一致」;正确做法是每会话第一次路由决策后,该 Session 后续轮次默认锁定同一路由结果(除非触发兜底回流),并在系统 Prompt 中注入统一的人设与能力描述,避免跳变。
常见问题
路由 LLM 能省多少成本?怎么估算我该不该上?
节省幅度取决于「流量难度分布」,通常 40% 至 80%;低于 30% 的场景投入产出比不高:估算公式为 节省比例 = 1 − Σ(每类流量占比 × 该类选择的模型相对成本)。举一个真实混合比案例:如果你的流量里 40% 是简单 FAQ/摘要(可用 1/10 成本的小模型),35% 是中等复杂度知识问答(可用 1/3 成本的中等模型),20% 是复杂推理/代码(用 2/3 成本的大模型),5% 是极难长尾/合规(必须用最贵模型),那么平均单次调用成本是原成本的 0.4×0.1 + 0.35×0.33 + 0.2×0.67 + 0.05×1.0 = 0.34,即 节省 66%。判断「该不该上」的三条红线——满足任意两条即可上:① 月 LLM 调用成本超过 5 万元;② 请求中 30% 以上是简单任务,复杂度分布明显分层;③ 有 2 个或以上模型候选(不同尺寸/价格)且已验证在简单任务上效果接近。反之如果每月调用成本不足 1 万元,或 90% 的请求都必须用最大模型(如高端代码助手/科研推理),则 ROI 不佳,建议暂缓。
路由器的「准确率」到底怎么衡量?达到多少才算合格?
别用「和人工标注路由结果是否一致」当唯一指标,必须用「业务综合分 + 兜底回流率」这两个最终端指标:正确的三层指标体系如下——第一层(过程指标):路由 Top-1 准确率(和人工金标路由一致的比例),合格线 85%,优秀线 93%;过程指标里还必须拆「难例子集准确率」单独看,合格线 70%,优秀线 85%——这个才是真正决定 ROI 的;第二层(工程指标):兜底回流率(被路由模型调用后因不合格回退大模型重试的比例),合格线低于 10%,优秀线低于 5%;如果回流率超过 15%,意味着路由器的错误决策导致你「先花了小模型钱 + 再花大模型钱」,反而更贵;第三层(业务指标,真正一票否决):业务综合分下降率(如客服解决率、工单一次解决率、代码单测通过率、用户满意度等综合加权),合格线必须 ≤2% 下降,优秀线 ≤1% 或不降反升——若业务分掉了 3% 以上,哪怕路由准确率有 95%,也必须立即下线重调。最后配套一个「成本下降率」:优秀线是成本下降 60% 以上且业务分不降。
多轮对话场景路由如何保持一致性?会不会一会儿聪明一会儿笨?
「会话级路由锁定 + Prompt 人设注入 + 渐进式升级」三要素可实现用户完全无感知,避免「忽聪明忽笨」的跳变感:第一,会话级锁定——同一会话(Session ID / Conversation ID)的第一次路由决策一旦确定,后续 8 至 10 轮对话默认锁定同一后端模型,除非出现明确的升级信号(如用户连续两次要求更详细的答案、或兜底回流触发了 1 次);这样上下文语义的连续性就不会被路由器打乱。第二,统一 Prompt 人设注入——无论走哪个模型,都在系统 Prompt 最外层注入完全一致的角色设定、回答风格、公司信息、合规底线,用 Prompt 的强约束掩盖掉小模型和大模型的原生风格差异。第三,渐进式能力升级——当会话中首次出现复杂度跃升(如用户从普通闲聊突然要求写 300 行生产代码),路由器先切到中间模型而非直接跳最大模型;若中间模型仍不合格再回退最大模型,这样用户感知到的是「我问难了它回答就变详细了」而非「突然换了个人」。最后配套 隐藏效果保障:所有小模型回答都经过统一的格式校验 + 事实一致性打分 + 关键词完整性检查,任一不达标就静默切大模型重试,用户只看到最终正确答案,路由切换在后台发生——按此三要素落地,多轮场景下用户对「模型切换」的感知率可以降到 2% 以下,整体满意度基本和全量最大模型持平。也可结合 多智能体编排 的复杂路由做进一步扩展。