缓存命中

Cache Hit

缓存命中指 Prompt 前缀与近期请求完全一致时,服务商直接复用已计算好的 KV 缓存,大幅降低输入 Token 成本并减少延迟。

详细解释

缓存命中(Cache Hit) 是大模型 API 在 2024–2026 年普及的一项关键成本优化技术。底层原理是:模型处理 Prompt 的第一阶段叫 Prefill(预填充),会对每个输入 Token 计算出 Key-Value 张量并保存到 GPU 显存。当后续请求的前缀(System Prompt、RAG 文档、示例)与上一次完全相同时,服务商无需重新计算,直接从缓存读回 KV 张量——这就是一次缓存命中。

缓存命中能省多少钱

缓存命中的 Token 通常会按原价的 10%–50% 计费,部分厂商(如 Anthropic)甚至完全不计入 ITPM 限速。

唯元智创(Weimeta)聚合了多家支持缓存的模型,并在账单中单独列出”缓存 Token”和”普通 Token”,方便你评估实际节省比例。

典型模型缓存折扣对比(2026 年公开价):

模型普通输入价缓存命中价折扣幅度
DeepSeek V3/V4¥1.0/M¥0.1/M1 折
Claude Opus 4.8$5.0/M$0.75/M1.5 折
GPT-4o$2.5/M$0.3/M1.2 折
通义千问 Qwen3¥2.0/M¥0.5/M2.5 折

如何提升缓存命中率

  1. 固定前缀:把 System Message、Few-Shot 示例、RAG 文档放在 Prompt 最前面,且保证每次内容完全一致(空格、标点都不能变)。
  2. 动态内容放末尾:把用户问题、时间戳、变量插到 Prompt 后半段。
  3. 使用 prompt_cache_key:OpenAI 和部分聚合平台支持自定义缓存键,让业务相近的请求主动”投奔”同一台缓存服务器。

常见问题

缓存能保留多久?
内存缓存通常保留 5–10 分钟不活跃,最长 1 小时;部分模型支持 Extended Caching(24 小时),把 KV 张量卸载到 GPU 本地存储。
前缀差一个字也命中不了吗?
是的。目前缓存匹配是精确前缀匹配,差一个空格、一个换行都会判定为不命中。建议把固定前缀抽成模板字符串来保证字节级一致。