详细解释
每分钟请求数(Requests Per Minute,RPM) 是 API 服务商用管理调用频率的核心速率限制指标之一。它统计的是 60 秒滑动窗口内发起的 API 请求总次数,与每次请求的 token 数量无关——哪怕你发的是空请求,也会计入 RPM 配额。
RPM 是最容易被”小而多”型负载打满的限制。比如一个聊天机器人每秒收到 20 条用户消息,每分钟就是 1200 次请求,即使每条消息只有几十个 token,也会先撞上 RPM 天花板。
唯元智创(Weimeta)聚合平台会在控制台实时展示各模型的 RPM 使用情况,并提供智能路由在多个上游密钥间分摊流量,避免单密钥打满。
RPM 与其他限制的关系
每个模型通常同时受多根轴限制,先碰到哪条取决于业务形态:
| 业务形态 | 先咬到你的限制 |
|---|---|
| 大量小请求(聊天、自动补全) | RPM |
| 单条超长上下文(RAG 长文档) | TPM |
| 突发并行任务 | 并发请求数 |
| 长期高负载 | 月度消费上限 |
响应头示例
多数厂商会在 API 响应中通过 header 返回当前 RPM 状态:
x-ratelimit-limit-requests: 5000
x-ratelimit-remaining-requests: 4820
x-ratelimit-reset-requests: 32s
常见问题
RPM 超限了怎么办?
1. 检查是否在重试循环里没有加入延迟;2. 将多个小请求合并为批量;3. 通过唯元智创等聚合平台做多密钥负载均衡;4. 向厂商申请升级使用层级。
免费账号一般有多少 RPM?
国际厂商免费档通常在 3–50 RPM,国产厂商(如 DeepSeek、Kimi)免费档大致在 10–60 RPM,付费后可提升到数千甚至上万。