端到端延迟

Latency (End-to-End Latency)

Latency(端到端延迟)指从用户发出请求到接收到完整回答的总耗时,由网络、排队、Prefill、Decode 四部分相加组成,是评估 API 真实体验的黄金指标。

详细解释

端到端延迟(End-to-End Latency) 指”你点下发送 → 你看到回答最后一个字”之间墙上时钟走过的全部时间。它是比 TTFTTPS 更综合的指标:用户根本不关心中间哪个阶段慢,只关心”等多久才能看完回答”。

Latency 的构成(掰开揉碎)

总 Latency = 网络 RTT + 排队等待 + Prefill + (输出 Token 数 ÷ TPS)
组成部分典型值说明
网络 RTT30–200ms用户到机房的物理距离 + TLS 握手;跨洲会飙到 300ms+
排队等待0ms → 数秒高峰期 GPU 忙不过来时排队,是最不可控项
Prefill100ms → 数秒随输入长度线性增长;提示词缓存命中可省 80%+
Decode(逐字生成)N / TPS 秒输出 N 个 Token 除以平均 TPS,长回答的大头

两类业务对 Latency 的追求完全不同

  • 聊天 / 对话产品:更关心 TTFT(开头快慢),Latency 稍差、但能 流式输出 边看边读 → 体感可以接受。
  • API 调用 / 结构化抽取:等完整 JSON 返回才继续,必须关心完整 Latency,流式再好看也没用,不如选 TPS 更高的 Flash 模型。

唯元智创(Weimeta)聚合平台在接口层面做了低延迟优先路由:按实时 P95 Latency 数据动态挑选上游服务商,同价位模型中选当前延迟最低的,有效避免高峰排队造成的长尾延迟。

常见问题

什么是 P50 / P95 延迟?我看哪个?
P50 = 中位数(一半用户比它快一半比它慢);P95 = 把最慢 5% 的倒霉蛋排除后第 95 百分位。线上体验主要被 P95 决定(慢的会投诉),所以看 P95 > P99 > P50。