2026-10-06
预算控制怎么做:给 LLM 应用设一个月度成本上限和告警线
估算方法
给 LLM 应用设月度成本上限和告警线,核心是把「单次调用成本」与「月度调用量」拆开算,再把波动因素显性化,最后在可复核的区间里画线。本站估算台的八个输入框——输入 token(in)/缓存 token(cache)/输出 token(out)/每月调用(runs)/输入价 / 1M(ir)/缓存价 / 1M(cr)/输出价 / 1M(orr)/重试率 %(retry)——正是这套拆解的最小可复核集合。页面原话:「输入、缓存、输出、重试分别展示,不把未知费用默认为零。」
月度量级怎么算:单次 × 调用量,再乘天数
单次成本算式与页面脚本逐字一致:one = ((in - cache)ir + cachecr + out*orr) / 1e6 * (1 + retry/100);month = one * runs。这个算式对应「单次成本 × 月度调用量」的直观模型:把「每月调用」看作累计调用量,单次成本里已把缓存命中、重试放大折算进去。复核时只需确认三件事——输入与缓存的口径是否一致(页面原话:「输入、缓存、输出、重试分别展示,不把未知费用默认为零」)、重试率是否反映了实际的 429 重试频率、三个单价字段是否取自供应商最新官方价目页。供应商价格、模型别名和缓存规则会变;购买前请回到官方价目页。
为什么要给区间而不是单点数
同一模型在不同时段的单价可能不同。DeepSeek 的定价文档写明:峰谷时段单价有差异,峰值时段与平时段并存,会导致同一用量在不同月份、不同调度下落在不同价位。阿里云百炼的上下文缓存文档写明:命中缓存的那部分输入按更低的缓存档计费,缓存命中率随业务波动,单次成本随之上下浮动。DeepSeek 的限流文档写明:并发超限返回 429,客户端通常会重试,重试率为经验值,实际可能更高。Anthropic 的定价页写明:批处理等不同调用方式单价不同。把这些机制叠加,月度成本天然是一个区间——峰谷价切换、缓存命中率波动、重试率抖动、调用方式混用,都会让实际账单偏离单点估算。复核区间的方法:在估算台里分别填入「全峰值单价 + 低缓存命中 + 高重试」与「全平时单价 + 高缓存命中 + 低重试」两组极端参数,得到上下边界。
告警线该设在预算的什么位置
先看增长趋势,再定绝对阈值。把过去几周的实际调用量、单次成本、缓存命中率、重试率画成周度趋势线;若趋势线斜率为正,按当前斜率外推未来几周得到「趋势预测值」,告警线设在「趋势预测值 × (1 + 安全系数)」;若趋势线平稳,取近期均值的上边界(均值加标准差)作为基线,再乘以安全系数。安全系数不固定,视业务对超支的容忍度与重试/峰谷价的不可控程度而定。关键动作是每周复盘:把估算台的参数替换为本周实测的用量参数(输入、缓存、输出、调用量)与单价参数(输入价、缓存价、输出价),重新跑一遍区间,若上边界触及告警线,立刻触发人工复核流程——而不是自动熔断。
明确不做的三件事
不推荐任何预算管理工具,估算台只是计算工作台,不接入任何厂商计费接口、不替供应商报价。不预测下月账单,只给基于当前参数与历史趋势的可复核区间。不给出具体金额建议,所有阈值由团队结合自身现金流与风险偏好自行决定。本工具是独立的计算工作台,不代表任何模型供应商;结果仅用于估算,不构成报价、采购或财务建议。