负载均衡

Load Balancing

负载均衡指将请求按策略分发到多个上游(多厂商、多密钥、多区域、多模型)以聚合容量、降低延迟、避免单点过载,是高并发 AI 应用的基础架构能力。

详细解释

负载均衡(Load Balancing) 对大模型 API 的含义和传统 Web 服务的”多副本分摊流量”略有不同:Web 服务多实例是同一份代码,分摊完全等价;但大模型 API 的”上游”可以是不同厂商(OpenAI/Anthropic/国产)、不同模型级别(Opus/Sonnet/Haiku)、不同区域(美西/新加坡/日本)——它们的价格、速度、质量都不一样。所以 AI 的负载均衡不只是”分流”,更是在价格/延迟/质量三维空间里找最优折中点

负载均衡的 4 种典型分发策略

策略规则适合场景
轮询 Round-Robin简单循环,1/2/3,1/2/3几个上游质量/价格接近,单纯想叠容量
加权轮询 Weighted给每个上游加权:A:50% B:30% C:20%主用一家,剩下两家分走多余流量和溢出
最少连接 Least Conn发给当前在飞请求最少的上游(实时平衡并发)并发请求数是你主要瓶颈的场景
延迟优先 Latency-aware动态监测各上游 P50/P95 延迟,发给当前最快的那个对响应时间敏感的聊天类产品
最低成本 Cost-based在满足延迟与质量阈值的前提下,优先发价格最低的上游成本敏感、批量任务、大流量调用

多密钥 vs 多厂商

  • 多 Key 负载均衡:同一个厂商拿 3 个不同账号的 Key,按轮询拆分 → 你的实际 RPM/TPM 是单 Key × 3。适合:用同一家厂商模型,需要更多容量。
  • 多厂商负载均衡:同时接 OpenAI + DeepSeek + Claude,按策略路由 → 容量叠加、风险分散,价格低的优先。适合:任何生产环境。

唯元智创(Weimeta)聚合平台内置的智能路由,本质就是把上面 4 种策略和多 Key / 多厂商叠加,再加上:

  • 实时速率感知:A 厂商配额快用完就停止派发,切给 B;
  • 错误率感知:某上游 5xx 比例超过阈值,临时踢出去 5 分钟冷却;
  • 质量打分反馈:下游任务成功 / 失败日志回传后,动态调整权重。

常见问题

多厂商均衡后,账单、返回格式不一样怎么办?
这就是为什么要用聚合平台做 L7 负载均衡,而不是自己写代码 Nginx L4 转发——聚合层会把各家不同的参数名、返回格式、Token 计数口径全部统一(都是 OpenAI 兼容格式),最后再给你一份统一账单 CSV 做对账。