详细解释
批量接口(Batch API) 是大模型 API 的”慢车道”:你把成百上千个请求打包成一个 JSONL 文件提交,服务商排队离线跑,跑完异步取结果。作为交换,Token 价格打 2.5 折到 7 折,并且不占用你实时 RPM/TPM 配额。
典型适用场景:
- 文档批量摘要 / 翻译 / 分类;
- 数据标注 / 评测集打分;
- 每日 ETL 从非结构化文本抽取结构化字段;
- 一周一次的大模型离线分析。
主流厂商定价对比(2026 公开档):
| 厂商 | Batch 接口名 | 折扣 | 典型时效 |
|---|---|---|---|
| OpenAI | Batch API | 50% off | 24 小时内完成 |
| Anthropic | Message Batches | 50% off | 数分钟到数小时 |
| Batch Prediction | 30%–70% off | 小时级 | |
| 唯元智创 (Weimeta) | 异步批量任务 | 上游折扣 + 聚合调度 | 可自选紧急度 |
使用流程三步曲
- **准备输入文件(JSONL,每行一个请求):
{"custom_id": "task-001", "body": {"model": "gpt-4o-mini", "input": [{"role": "user", "content": "总结这段文本"}]} - **提交 Batch,拿 batch_id;
- 轮询或 Webhook 通知,结果再取回 JSONL。
取舍
| 维度 | 同步 Chat Completions | Batch API |
|---|---|---|
| 延迟 | 秒级 | 分钟 ~ 小时 |
| 价格 | 原价 | 25%–70% off |
| 占用 RPM/TPM | 是 | 否(独立配额) |
| 适合 | 聊天、实时应用 | 离线批处理 |
常见问题
Batch 跑一半能取消吗?
可以。未开始处理的可以取消并退款,但已经处理完的请求正常计费。部分厂商提供 cancel 接口。