详细解释
每分钟输入 Token 数(Input Tokens Per Minute,ITPM) 是从 TPM 拆分出来的独立限速轴,只统计”你发给模型”的那部分 Token——包括 System Prompt、历史对话、用户问题、RAG 检索召回的文档块、图片/音频转码后的 Token 等。
对企业级应用来说,ITPM 往往比 OTPM(输出 Token)更早被打满,原因很现实:RAG 系统每次都会把几千到几万 Token 的文档上下文塞进去,而模型只输出几百字的回答。
ITPM 的”水分”——缓存不计入
这是 ITPM 最容易被误解、也是最值得优化的一点。不同厂商对缓存命中 Token 的 ITPM 记账规则不同:
| 厂商 | 缓存读取是否计入 ITPM |
|---|---|
| Anthropic(Claude 系列,Haiku 3.5 除外) | ❌ 不计入 |
| OpenAI(GPT-4o 及以后) | ✅ 计入但计费打折 |
| DeepSeek | ✅ 计入但计费打 1 折 |
| 唯元智创聚合路由 (Weimeta) | 按具体上游规则展示,面板有区分 |
结论:把 System Prompt 和 RAG 文档固定放在 Prompt 前缀,争取高缓存命中率,等价于把 ITPM 天花板抬升了 3–10 倍。
实战估算
假设 ITPM 配额 2,000,000:
- 无缓存:每次请求输入 10 万 Token → 每分钟 20 次。
- 80% 缓存命中:实际计入 ITPM 的只有 2 万 → 每分钟可达 100 次。
常见问题
图片输入算 ITPM 吗?
算。视觉模型会把图片按分辨率折算成 Token(如 GPT-4o 一张 1024×1024 图约 765 Token),这部分计在输入 Token 内。