详细解释
故障转移(Fallback / Failover,也叫回退) 是”鸡蛋放多个篮子里”的工程化实现。真实世界里大模型 API偶尔出问题是常态:
- 某上游 5xx / 限流 429
- 某模型被临时下架做版本升级
- 某机房故障 / 主干网络抖动
- 某模型突然出质量问题(胡言乱语率飙升)
Fallback 就是在出现上述情况时,自动切到另一个模型 / 厂商继续跑,对外保证可用性,对内少发告警、少有人工介入。
Fallback 的常见触发条件(按从易到难)
| 触发类型 | 触发条件 | 示例 |
|---|---|---|
| 硬错误 Failover | 服务端 5xx、连接超时、429 | GPT 突发 503 → 切到 DeepSeek |
| 成本 Failover | 主模型预算/额度用光 | Claude 月额度用完 → 切到 Flash 档 |
| 延迟 Failover | P95 延迟超过阈值(如 8s) | 高峰排队久 → 切到轻量模型 |
| 质量 Failover | 输出质量不达标(JSON 解析失败率高、关键词不匹配) | 结构化抽取失败 → 切旗舰模型重试 |
| 区域 Failover | 某区域机房故障 | 美国东挂了 → 切欧洲节点 |
降级路线推荐表(2026 常见组合)
| 主模型 | 降级顺序(从优到劣,成本逐渐降低) |
|---|---|
| GPT-5.4 / GPT-4.1 | 4.1-Pro → 3.5 → DeepSeek V4-Pro → V3 → 本地小模型 |
| Claude Opus 4.x | Sonnet → Haiku → Gemini Flash → DeepSeek V4 |
| 通义千问 Qwen-Max | Qwen-Plus → Qwen-Turbo → 开源 Qwen3 本地部署 |
| 唯元智创 (Weimeta) 推荐 | 设置一条 Fallback 链:主 → 副 → 经济 → 轻量 |
唯元智创聚合平台在控制台的”路由策略”页允许可视化拖拽配置 Fallback 链路,并且给每段链路配独立阈值(例如超过 5% 的 5xx 自动切,延迟 P95 超过 6s 自动切),不需要你自己在 SDK 里写一堆 if/else。
常见问题
Fallback 会不会导致同一个用户一会儿旗舰一会儿轻量,体验不一致?
会话级粘性(Session Stickiness)能解决:同一 session_id / 用户的请求固定打主模型,仅当主模型失败时才降级;下一个新会话再回主模型。唯元智创控制台支持开启”会话粘性”开关。