每秒 Token 数

TPS (Tokens Per Second)

TPS 是每秒 Token 数的缩写,指模型生成输出的实时速度,直接决定聊天界面流式输出的流畅度与用户体验。

详细解释

每秒 Token 数(Tokens Per Second,TPS) 是评估大模型推理性能最直观的指标——字面意思就是”模型一秒钟能往外蹦几个字/Token”。对于聊天、代码补全这种交互场景,TPS 比 TPM 更影响用户体感:

  • < 20 TPS:肉眼可见卡顿,像打字员在思考
  • 20–60 TPS:普通人类打字速度,体验流畅
  • > 80 TPS:快速涌出,适合速读型用户
  • > 200 TPS:批量 / 离线任务,无需用户等待

时间到首 Token(TTFT)

与 TPS 相伴的另一个重要指标是 TTFT(Time To First Token):从你发出请求到模型吐出第一个 Token 的延迟。TTFT 主要被 Prefill(输入处理)阶段占用,通常 200–1500ms,后续才进入 TPS 稳定生成阶段。

唯元智创(Weimeta)的模型详情页同时展示 TTFT P50/P95平均 TPS 两组数据,并在同价位模型之间做速度对比,帮你挑选性价比最优的组合。

TPS 的影响因素

  1. 模型大小:7B 模型 > 70B 模型,同架构下参数量越大 TPS 越低
  2. 并发数:服务器满载时单请求 TPS 会被”瓜分”下降
  3. 输出长度:长输出在生成过程中 KV Cache 不断增长,越往后越慢
  4. 解码策略:beam search、多候选采样会比贪心解码慢

常见问题

为什么我的接口前 1 秒没反应?
那是 TTFT(首 Token 延迟)过高。可以通过使用流式输出(stream=true)、开启提示词缓存、选择 Flash/Lite 模型等手段缩短。