详细解释
首 Token 延迟(Time To First Token,TTFT) 是用户对”模型快不快”最敏感的一个体感指标——哪怕后续 TPS 再快,如果 TTFT 是 5 秒,用户会感觉”这模型慢死了”。
TTFT 主要消耗在三个阶段:
- 网络 + 排队:请求从你家到服务商机房、进队列等 GPU(高峰排队是最大变量);
- Prefill 阶段:把你发送的输入 Token 逐个计算 KV 张量(= ITPM 里的”I”在干活);
- 解码第一步:生成第 1 个输出 Token。
三者中 Prefill 与输入长度成正比:输入 100 Token 的 TTFT 可能 200ms,输入 100K Token 的 TTFT 可能 5–10 秒。
典型体感区间
| TTFT | 体感 |
|---|---|
| < 300ms | 即时响应,像真人打字 |
| 300–800ms | 体感良好,略有思考 |
| 800–1500ms | 能接受,稍慢 |
| > 2 秒 | 开始焦虑,反复点击 |
| > 5 秒 | 用户直接退出/重试 |
唯元智创(Weimeta)做了两项 TTFT 优化:1)智能路由到最近的机房;2)开启 Prompt 缓存的请求跳过 Prefill 阶段,实测长上下文场景 TTFT 下降 70%+。
降低 TTFT 的手段
- 开启 提示词缓存(命中时跳过 Prefill);
- 把超长输入拆成多次请求 + 流式输出;
- 优先选 Flash/Pro 等推理优化过的模型;
- 避免在高峰时段发超大 Prompt。
常见问题
TTFT 和 TPS 我该先优化哪个?
聊天/对话产品先优化 TTFT(≤ 500ms),用户体验提升最明显;批量/文档生成类业务 TPS 更重要(总吞吐决定完成时间)。