2026-10-06
缓存命中为什么能省钱:命中率从 0 到 80% 的成本变化怎么估
估算方法
缓存命中率怎么算进成本
工具把一次调用拆成三段:未命中的输入、命中的缓存、输出。公式在页面上原样展示:
((输入 - 缓存) × 输入价 + 缓存 × 缓存价 + 输出 × 输出价) / 1e6 × (1 + 重试率 / 100)
把「缓存 / 输入」记作命中率 h,单次成本可改写为:
单次 = [输入 × (1 - h) × 输入价 + 输入 × h × 缓存价 + 输出 × 输出价] / 1e6 × (1 + 重试率 / 100)
其中 输入、输出、输入价、缓存价、输出价、重试率 均为你在工具里填的数字;h 由你根据业务实际情况估算填入「缓存 token」。工具不把 h 当作技术开关,只把它当作一个可复核的输入参数。
三档命中率的算例
用工具里填写的参数(输入 token、输出 token、输入价、缓存价、输出价、每月调用次数、重试率),分别代入三档 h 估算:
- 保守(h = 0%):缓存填 0。
- 中性(h = 40%):缓存填输入 token × 40%。
- 乐观(h = 80%):缓存填输入 token × 80%。
三档只改「缓存 token」一项,其余参数完全相同。把算出的三个单次成本、三个月度成本并排记录,即可在预算表里把「缓存命中不确定性」显性化——不给优化承诺,不预测账单,只把估算区间摆在桌面上。
命中率取决于公共前缀,不是开关
DeepSeek 的缓存文档写明:缓存仅匹配用户输入的前缀部分;后续请求与前序请求的公共前缀重叠时才会命中,且系统按「尽力而为」工作,不保证 100% 命中。阿里云百炼的上下文缓存文档同样写明:达到 1,024 token 仅代表具备命中条件,不保证实际命中;显式缓存有效期 5 分钟(命中后重置),隐式缓存由系统自动识别公共前缀。
这意味着:h 的大小由你的请求内容结构决定——比如系统提示词、固定上下文、少样本示例是否在每轮对话开头保持一致。若业务是多轮对话且每轮都带完整系统提示词,h 可能较高;若每次请求前缀差异大,h 自然偏低。估算时应按自己业务的实际请求模式填写「缓存 token」,而非直接套用乐观值。
用工具把三档算出来
打开估算台,保持输入、输出、单价、调用量、重试率不变,只修改「缓存 token」:
- 填 0 → 记录保守档单次与月度成本
- 填输入 token × 40%(对应 h=40%) → 记录中性档
- 填输入 token × 80%(对应 h=80%) → 记录乐观档
页面会把输入、缓存、输出、重试四项成本分行展示,未知费用不默认为零。把三组结果带入预算表或汇报材料,即可让决策者看到「缓存命中率在 0%–80% 区间波动时,成本会在 X 到 Y 之间」——这就是可复核的估算。
具体价格与口径以各供应商最新官方文档为准,本站只做估算,不构成报价、采购或财务建议。