每分钟请求数

RPM (Requests Per Minute)

RPM 是每分钟请求数的缩写,指 API 接口在 60 秒滑动窗口内允许的最大调用次数,是大模型服务商最常用的速率限制指标。

详细解释

每分钟请求数(Requests Per Minute,RPM) 是 API 服务商用管理调用频率的核心速率限制指标之一。它统计的是 60 秒滑动窗口内发起的 API 请求总次数,与每次请求的 token 数量无关——哪怕你发的是空请求,也会计入 RPM 配额。

RPM 是最容易被”小而多”型负载打满的限制。比如一个聊天机器人每秒收到 20 条用户消息,每分钟就是 1200 次请求,即使每条消息只有几十个 token,也会先撞上 RPM 天花板。

唯元智创(Weimeta)聚合平台会在控制台实时展示各模型的 RPM 使用情况,并提供智能路由在多个上游密钥间分摊流量,避免单密钥打满。

RPM 与其他限制的关系

每个模型通常同时受多根轴限制,先碰到哪条取决于业务形态:

业务形态先咬到你的限制
大量小请求(聊天、自动补全)RPM
单条超长上下文(RAG 长文档)TPM
突发并行任务并发请求数
长期高负载月度消费上限

响应头示例

多数厂商会在 API 响应中通过 header 返回当前 RPM 状态:

x-ratelimit-limit-requests: 5000
x-ratelimit-remaining-requests: 4820
x-ratelimit-reset-requests: 32s

常见问题

RPM 超限了怎么办?
1. 检查是否在重试循环里没有加入延迟;2. 将多个小请求合并为批量;3. 通过唯元智创等聚合平台做多密钥负载均衡;4. 向厂商申请升级使用层级。
免费账号一般有多少 RPM?
国际厂商免费档通常在 3–50 RPM,国产厂商(如 DeepSeek、Kimi)免费档大致在 10–60 RPM,付费后可提升到数千甚至上万。