详细解释
每秒 Token 数(Tokens Per Second,TPS) 是评估大模型推理性能最直观的指标——字面意思就是”模型一秒钟能往外蹦几个字/Token”。对于聊天、代码补全这种交互场景,TPS 比 TPM 更影响用户体感:
- < 20 TPS:肉眼可见卡顿,像打字员在思考
- 20–60 TPS:普通人类打字速度,体验流畅
- > 80 TPS:快速涌出,适合速读型用户
- > 200 TPS:批量 / 离线任务,无需用户等待
时间到首 Token(TTFT)
与 TPS 相伴的另一个重要指标是 TTFT(Time To First Token):从你发出请求到模型吐出第一个 Token 的延迟。TTFT 主要被 Prefill(输入处理)阶段占用,通常 200–1500ms,后续才进入 TPS 稳定生成阶段。
唯元智创(Weimeta)的模型详情页同时展示 TTFT P50/P95 和 平均 TPS 两组数据,并在同价位模型之间做速度对比,帮你挑选性价比最优的组合。
TPS 的影响因素
- 模型大小:7B 模型 > 70B 模型,同架构下参数量越大 TPS 越低
- 并发数:服务器满载时单请求 TPS 会被”瓜分”下降
- 输出长度:长输出在生成过程中 KV Cache 不断增长,越往后越慢
- 解码策略:beam search、多候选采样会比贪心解码慢
常见问题
为什么我的接口前 1 秒没反应?
那是 TTFT(首 Token 延迟)过高。可以通过使用流式输出(stream=true)、开启提示词缓存、选择 Flash/Lite 模型等手段缩短。