每分钟输出 Token 数

OTPM (Output Tokens Per Minute)

OTPM 是每分钟输出 Token 数的缩写,指模型在 60 秒窗口内允许生成的输出 Token 总量,是长文本生成、代码补全场景的关键速率指标。

详细解释

每分钟输出 Token 数(Output Tokens Per Minute,OTPM) 专门统计”模型吐给你”的 Token 数量。和 ITPM 不同,OTPM 的上限通常更低——因为逐 Token 自回归生成需要持续的 GPU 算力,成本比”读入”高得多。

典型场景中 OTPM 是瓶颈:

  • 长文写作:一次生成 8,000–16,000 Token
  • 代码补全 / 代码翻译:逐行生成大量代码 Token
  • 报告摘要输出:结构化报告动辄几千字

OTPM 与 TPS 的关系

OTPM 是 60 秒维度的”总量桶”,而 TPS(每秒 Token 数)是实时的”流速”。两者可以换算:

TPS ≈ OTPM ÷ 60

例如 OTPM 为 400,000 → 理论平均生成速度约 6,666 TPS(注意这是并发多请求的总和,不是单请求的速度)。

唯元智创(Weimeta)控制台在模型详情页同时展示 OTPM 配额和平均 TPS,方便评估生成类任务的承载能力。

OTPM 为什么比 ITPM 更难”绕”

  • 缓存几乎帮不上忙:输出 Token 不可能提前缓存(每次回答都不同)。
  • 节流手段有限:只能通过缩短 max_tokens、降低输出长度、把长任务拆分到多个请求。

常见问题

OTPM 打满时用户体验会怎样?
流式输出(stream)会出现”卡顿”——字一个一个往外蹦的速度明显下降;非流式请求会直接返回 429 并带 retry-after 头。