2026-10-06
一次 LLM 请求到底花多少:从输入长度到最终费用的四步拆解
计费口径
一次请求的四段构成
一次 LLM 请求的成本由四段组成:系统提示与工具定义、历史对话、本次用户输入、模型输出。这四段在 token 计数里分别落在「输入」与「输出」两侧。DeepSeek 的 API 参考把一次请求的总 token 定义为 prompt 与 completion 之和,其中 prompt 包含 system、user、assistant 等角色的全部消息内容。这与工具把前三段合计进「输入 token」的口径一致。
四段如何对应估算台的三个 token 框
估算台只有三个 token 输入框:输入 token、缓存 token、输出 token。对应关系如下:
- 输入 token:系统提示与工具定义、历史对话、本次用户输入三段的 token 总和。这是模型本次实际处理的完整上下文长度。
- 缓存 token:上述三段中、能被缓存命中的前缀部分。DeepSeek 的缓存文档写明「硬盘缓存仅匹配用户输入的前缀部分」;阿里云百炼的上下文缓存文档同样写明「可以缓存这些请求的公共前缀」。也就是说,只有从对话开头连续、稳定不变的那一段才可能命中缓存,中间插入的新内容会打断前缀匹配。
- 输出 token:模型回复生成的 completion 部分。DeepSeek 的 Token 文档指出「实际处理的 token 数量以模型返回的 usage 为准」,账单以此为依据。
工具页面原话:「缓存 token 应包含在输入 token 内」。填写时必须保证缓存值不大于输入值,否则会被视为参数错误。
哪一段填错最离谱
最常见、偏差最大的是历史对话按 0 填写。在多轮长对话里,历史对话往往占据输入 token 的大头。如果把它算作 0,单次估算会显著偏低,月度汇总更会与账单相差甚远。Cohere 的 tokenizer 文档说明「一个单词约 2–3 个 token」,中英文混排时 DeepSeek 给出的经验值是「1 个中文字符约 0.6 token、1 个英文字符约 0.3 token」。历史对话的字符量乘以这些系数,就是它在输入 token 里的真实权重。
复算习惯:用估算台的数对账单
把估算台算出的单次成本乘以月调用量,得到月度估算值。拿这个值与服务商账单的当月实际金额比对:
- 差异在 10% 以内:假设基本合理,继续沿用。
- 差异超过 10%:说明某一环假设偏离。按优先级排查:历史对话 token 是否低估、缓存命中率是否高估、输出长度是否偏离、重试率是否漏算。DeepSeek 的 Token 文档明确「实际以用量返回为准」,账单才是最终依据。
用默认值走一遍四步
拿估算台的默认值走一遍:输入 token 12000、缓存 token 6000、输出 token 1800、每月调用 1000、输入价 1.00、缓存价 0.50、输出价 4.00、重试率 5%。四段里,系统提示与工具定义、历史对话、本次用户输入合计进输入 12000,其中可被缓存命中的前缀 6000 进缓存栏;模型回复 1800 进输出栏。代入算式 ((12000−6000)×1.00 + 6000×0.50 + 1800×4.00) / 1e6 × (1+5/100),单次约 $0.0170;乘每月 1000 次,月度约 $17.01。把这几步写下来,就能脱离本站用手算核一遍。
结语
具体价格与口径以各供应商最新官方文档为准,本站只做估算,不构成报价、采购或财务建议。