每分钟输入 Token 数

ITPM (Input Tokens Per Minute)

ITPM 是每分钟输入 Token 数的缩写,指 API 在 60 秒窗口内允许接收的输入 Token 总量(含 Prompt、System Message、文档上下文),是 RAG 与长对话场景的关键瓶颈。

详细解释

每分钟输入 Token 数(Input Tokens Per Minute,ITPM) 是从 TPM 拆分出来的独立限速轴,只统计”你发给模型”的那部分 Token——包括 System Prompt、历史对话、用户问题、RAG 检索召回的文档块、图片/音频转码后的 Token 等。

对企业级应用来说,ITPM 往往比 OTPM(输出 Token)更早被打满,原因很现实:RAG 系统每次都会把几千到几万 Token 的文档上下文塞进去,而模型只输出几百字的回答。

ITPM 的”水分”——缓存不计入

这是 ITPM 最容易被误解、也是最值得优化的一点。不同厂商对缓存命中 Token 的 ITPM 记账规则不同:

厂商缓存读取是否计入 ITPM
Anthropic(Claude 系列,Haiku 3.5 除外)❌ 不计入
OpenAI(GPT-4o 及以后)✅ 计入但计费打折
DeepSeek✅ 计入但计费打 1 折
唯元智创聚合路由 (Weimeta)按具体上游规则展示,面板有区分

结论:把 System Prompt 和 RAG 文档固定放在 Prompt 前缀,争取高缓存命中率,等价于把 ITPM 天花板抬升了 3–10 倍。

实战估算

假设 ITPM 配额 2,000,000:

  • 无缓存:每次请求输入 10 万 Token → 每分钟 20 次。
  • 80% 缓存命中:实际计入 ITPM 的只有 2 万 → 每分钟可达 100 次

常见问题

图片输入算 ITPM 吗?
算。视觉模型会把图片按分辨率折算成 Token(如 GPT-4o 一张 1024×1024 图约 765 Token),这部分计在输入 Token 内。