详细解释
端到端延迟(End-to-End Latency) 指”你点下发送 → 你看到回答最后一个字”之间墙上时钟走过的全部时间。它是比 TTFT、TPS 更综合的指标:用户根本不关心中间哪个阶段慢,只关心”等多久才能看完回答”。
Latency 的构成(掰开揉碎)
总 Latency = 网络 RTT + 排队等待 + Prefill + (输出 Token 数 ÷ TPS)
| 组成部分 | 典型值 | 说明 |
|---|---|---|
| 网络 RTT | 30–200ms | 用户到机房的物理距离 + TLS 握手;跨洲会飙到 300ms+ |
| 排队等待 | 0ms → 数秒 | 高峰期 GPU 忙不过来时排队,是最不可控项 |
| Prefill | 100ms → 数秒 | 随输入长度线性增长;提示词缓存命中可省 80%+ |
| Decode(逐字生成) | N / TPS 秒 | 输出 N 个 Token 除以平均 TPS,长回答的大头 |
两类业务对 Latency 的追求完全不同
- 聊天 / 对话产品:更关心 TTFT(开头快慢),Latency 稍差、但能 流式输出 边看边读 → 体感可以接受。
- API 调用 / 结构化抽取:等完整 JSON 返回才继续,必须关心完整 Latency,流式再好看也没用,不如选 TPS 更高的 Flash 模型。
唯元智创(Weimeta)聚合平台在接口层面做了低延迟优先路由:按实时 P95 Latency 数据动态挑选上游服务商,同价位模型中选当前延迟最低的,有效避免高峰排队造成的长尾延迟。
常见问题
什么是 P50 / P95 延迟?我看哪个?
P50 = 中位数(一半用户比它快一半比它慢);P95 = 把最慢 5% 的倒霉蛋排除后第 95 百分位。线上体验主要被 P95 决定(慢的会投诉),所以看 P95 > P99 > P50。