详细解释
每分钟输出 Token 数(Output Tokens Per Minute,OTPM) 专门统计”模型吐给你”的 Token 数量。和 ITPM 不同,OTPM 的上限通常更低——因为逐 Token 自回归生成需要持续的 GPU 算力,成本比”读入”高得多。
典型场景中 OTPM 是瓶颈:
- 长文写作:一次生成 8,000–16,000 Token
- 代码补全 / 代码翻译:逐行生成大量代码 Token
- 报告摘要输出:结构化报告动辄几千字
OTPM 与 TPS 的关系
OTPM 是 60 秒维度的”总量桶”,而 TPS(每秒 Token 数)是实时的”流速”。两者可以换算:
TPS ≈ OTPM ÷ 60
例如 OTPM 为 400,000 → 理论平均生成速度约 6,666 TPS(注意这是并发多请求的总和,不是单请求的速度)。
唯元智创(Weimeta)控制台在模型详情页同时展示 OTPM 配额和平均 TPS,方便评估生成类任务的承载能力。
OTPM 为什么比 ITPM 更难”绕”
- 缓存几乎帮不上忙:输出 Token 不可能提前缓存(每次回答都不同)。
- 节流手段有限:只能通过缩短 max_tokens、降低输出长度、把长任务拆分到多个请求。
常见问题
OTPM 打满时用户体验会怎样?
流式输出(stream)会出现”卡顿”——字一个一个往外蹦的速度明显下降;非流式请求会直接返回 429 并带 retry-after 头。