详细解释
缓存命中(Cache Hit) 是大模型 API 在 2024–2026 年普及的一项关键成本优化技术。底层原理是:模型处理 Prompt 的第一阶段叫 Prefill(预填充),会对每个输入 Token 计算出 Key-Value 张量并保存到 GPU 显存。当后续请求的前缀(System Prompt、RAG 文档、示例)与上一次完全相同时,服务商无需重新计算,直接从缓存读回 KV 张量——这就是一次缓存命中。
缓存命中能省多少钱
缓存命中的 Token 通常会按原价的 10%–50% 计费,部分厂商(如 Anthropic)甚至完全不计入 ITPM 限速。
唯元智创(Weimeta)聚合了多家支持缓存的模型,并在账单中单独列出”缓存 Token”和”普通 Token”,方便你评估实际节省比例。
典型模型缓存折扣对比(2026 年公开价):
| 模型 | 普通输入价 | 缓存命中价 | 折扣幅度 |
|---|---|---|---|
| DeepSeek V3/V4 | ¥1.0/M | ¥0.1/M | 1 折 |
| Claude Opus 4.8 | $5.0/M | $0.75/M | 1.5 折 |
| GPT-4o | $2.5/M | $0.3/M | 1.2 折 |
| 通义千问 Qwen3 | ¥2.0/M | ¥0.5/M | 2.5 折 |
如何提升缓存命中率
- 固定前缀:把 System Message、Few-Shot 示例、RAG 文档放在 Prompt 最前面,且保证每次内容完全一致(空格、标点都不能变)。
- 动态内容放末尾:把用户问题、时间戳、变量插到 Prompt 后半段。
- 使用
prompt_cache_key:OpenAI 和部分聚合平台支持自定义缓存键,让业务相近的请求主动”投奔”同一台缓存服务器。
常见问题
缓存能保留多久?
内存缓存通常保留 5–10 分钟不活跃,最长 1 小时;部分模型支持 Extended Caching(24 小时),把 KV 张量卸载到 GPU 本地存储。
前缀差一个字也命中不了吗?
是的。目前缓存匹配是精确前缀匹配,差一个空格、一个换行都会判定为不命中。建议把固定前缀抽成模板字符串来保证字节级一致。