故障转移(回退)

Fallback / Failover

Fallback(故障转移/回退)指当主模型、主厂商或主上游不可用时,API 网关自动切换到备用模型/备用厂商的高可用策略,是生产级多模型接入的必备能力。

详细解释

故障转移(Fallback / Failover,也叫回退) 是”鸡蛋放多个篮子里”的工程化实现。真实世界里大模型 API偶尔出问题是常态

  • 某上游 5xx / 限流 429
  • 某模型被临时下架做版本升级
  • 某机房故障 / 主干网络抖动
  • 某模型突然出质量问题(胡言乱语率飙升)

Fallback 就是在出现上述情况时,自动切到另一个模型 / 厂商继续跑,对外保证可用性,对内少发告警、少有人工介入。

Fallback 的常见触发条件(按从易到难)

触发类型触发条件示例
硬错误 Failover服务端 5xx、连接超时、429GPT 突发 503 → 切到 DeepSeek
成本 Failover主模型预算/额度用光Claude 月额度用完 → 切到 Flash 档
延迟 FailoverP95 延迟超过阈值(如 8s)高峰排队久 → 切到轻量模型
质量 Failover输出质量不达标(JSON 解析失败率高、关键词不匹配)结构化抽取失败 → 切旗舰模型重试
区域 Failover某区域机房故障美国东挂了 → 切欧洲节点

降级路线推荐表(2026 常见组合)

主模型降级顺序(从优到劣,成本逐渐降低)
GPT-5.4 / GPT-4.14.1-Pro → 3.5 → DeepSeek V4-Pro → V3 → 本地小模型
Claude Opus 4.xSonnet → Haiku → Gemini Flash → DeepSeek V4
通义千问 Qwen-MaxQwen-Plus → Qwen-Turbo → 开源 Qwen3 本地部署
唯元智创 (Weimeta) 推荐设置一条 Fallback 链:主 → 副 → 经济 → 轻量

唯元智创聚合平台在控制台的”路由策略”页允许可视化拖拽配置 Fallback 链路,并且给每段链路配独立阈值(例如超过 5% 的 5xx 自动切,延迟 P95 超过 6s 自动切),不需要你自己在 SDK 里写一堆 if/else。

常见问题

Fallback 会不会导致同一个用户一会儿旗舰一会儿轻量,体验不一致?
会话级粘性(Session Stickiness)能解决:同一 session_id / 用户的请求固定打主模型,仅当主模型失败时才降级;下一个新会话再回主模型。唯元智创控制台支持开启”会话粘性”开关。