首 Token 延迟

TTFT (Time To First Token)

首 Token 延迟(TTFT)指从 API 请求发出到收到模型返回的第一个 Token 之间的时长,是衡量聊天交互流畅度的关键指标。

详细解释

首 Token 延迟(Time To First Token,TTFT) 是用户对”模型快不快”最敏感的一个体感指标——哪怕后续 TPS 再快,如果 TTFT 是 5 秒,用户会感觉”这模型慢死了”。

TTFT 主要消耗在三个阶段:

  1. 网络 + 排队:请求从你家到服务商机房、进队列等 GPU(高峰排队是最大变量);
  2. Prefill 阶段:把你发送的输入 Token 逐个计算 KV 张量(= ITPM 里的”I”在干活);
  3. 解码第一步:生成第 1 个输出 Token。

三者中 Prefill 与输入长度成正比:输入 100 Token 的 TTFT 可能 200ms,输入 100K Token 的 TTFT 可能 5–10 秒。

典型体感区间

TTFT体感
< 300ms即时响应,像真人打字
300–800ms体感良好,略有思考
800–1500ms能接受,稍慢
> 2 秒开始焦虑,反复点击
> 5 秒用户直接退出/重试

唯元智创(Weimeta)做了两项 TTFT 优化:1)智能路由到最近的机房;2)开启 Prompt 缓存的请求跳过 Prefill 阶段,实测长上下文场景 TTFT 下降 70%+。

降低 TTFT 的手段

  1. 开启 提示词缓存(命中时跳过 Prefill);
  2. 把超长输入拆成多次请求 + 流式输出;
  3. 优先选 Flash/Pro 等推理优化过的模型;
  4. 避免在高峰时段发超大 Prompt。

常见问题

TTFT 和 TPS 我该先优化哪个?
聊天/对话产品先优化 TTFT(≤ 500ms),用户体验提升最明显;批量/文档生成类业务 TPS 更重要(总吞吐决定完成时间)。