先给结论:假设一个内容站每月处理 5000 个长文摘要任务,合计使用 2250 万输入 Token 和 450 万输出 Token,按 2026-07-31 复核的 DeepSeek V4 Flash 中国地区官方人民币标准价计算,缓存未命中时月成本约为 ¥31.50。
这个数字可以复算,但不能直接当成你的账单。本文公开每一项输入、公式和边界,让你知道应该替换哪组数据,而不是复制一个看起来精确的答案。
先确认目标
本文解决什么问题?
这篇文章解决的不是“哪个模型最便宜”,而是“一个具体业务量怎样变成可检查的月预算”。读完后,你应该能用同一套表格替换成自己的请求量、输入输出 Token 和预算上限。
这是透明规划样例,不是生产日志。本站没有使用你的 API Key 发起请求,也没有把示例成本包装成真实用户实测。
演示任务与可复现输入
演示任务是给一批长文章生成摘要与标签。为了让任何人都能复算,先固定四个输入:
| 输入项 | 固定值 | 为什么这样设 |
|---|---|---|
| 每月任务数 | 5000 次 | 约每天 167 次,适合小型批处理流程 |
| 单次平均输入 | 4500 Token | 包含正文、系统提示和少量上下文 |
| 单次平均输出 | 900 Token | 包含摘要、标签和结构化字段 |
| 月预算上限 | ¥100 | 用来判断成本是否需要立刻优化 |
据此得到:
- 月输入:
5000 × 4500 = 2250 万 Token - 月输出:
5000 × 900 = 450 万 Token - 总用量:
2250 万 + 450 万 = 2700 万 Token
这里最关键的不是“2700 万”这个数字,而是它能追溯到任务数和单次用量。如果你的产品没有这两项记录,先不要讨论年预算。
结果样例与验收记录
DeepSeek 中文官方价格页在 2026-07-31 显示,V4 Flash 的缓存未命中输入价格为每百万 Token ¥1,输出价格为每百万 Token ¥2。按这组公开价格复算:
| 成本项 | 公式 | 结果 |
|---|---|---|
| 输入成本 | 22.5 × ¥1 | ¥22.50 |
| 输出成本 | 4.5 × ¥2 | ¥9.00 |
| 月成本 | ¥22.50 + ¥9.00 | ¥31.50 |
| 日均成本 | ¥31.50 ÷ 30 | ¥1.05 |
| 预算占比 | ¥31.50 ÷ ¥100 | 31.5% |
这个结果通过的验收条件只有三个:公式能复算、价格能回到官方来源、所有假设都被明确标成样例。它没有证明模型质量、延迟或稳定性已经满足生产要求。
可以直接照做
把示例用量换成你自己的
先从日志取最近 7 天的请求数、输入 Token 和输出 Token,再按业务周期换算成一个月。没有日志时可以先用规模预设,但要把结果标成“估算”,不要写成“实际成本”。
敏感性:哪一项最容易推高预算
只看基准值会低估风险。下面保持同一价格,分别改变输出量、业务量和重试量:
| 情况 | 月输入 / 输出 | 月成本 | 相对基准 |
|---|---|---|---|
| 基准样例 | 22.5M / 4.5M | ¥31.50 | — |
| 输出翻倍 | 22.5M / 9M | ¥40.50 | +28.6% |
| 任务量翻倍 | 45M / 9M | ¥63.00 | +100% |
| 输入输出都增加 20% | 27M / 5.4M | ¥37.80 | +20% |
输出单价是输入的两倍,所以无上限的长回答会更快推高账单。对摘要任务,先限制输出结构和长度,通常比盲目换模型更直接。
这笔数字最容易被误读的地方
- Token 成本不是总成本。 服务器、数据库、日志、监控和人工复核都不在 ¥31.50 里。
- 缓存命中不是默认收益。 本文按缓存未命中计算;只有真实账单确认命中后,才能把缓存折扣写进预算。
- 失败请求也会消耗资源。 超时重试、格式不合格和人工返工会抬高“一个可用结果”的成本。
- 便宜不等于适合。 如果摘要漏掉关键事实,单价再低也不能直接上线。
操作过程:用真实日志替换假设
取 7 天脱敏日志
只汇总时间、模型、输入 Token、输出 Token、状态码和重试次数,不复制用户原文或 API Key。
排除测试和异常流量
把开发调试、压测和明显爬虫单独标记,避免把一次异常峰值当成日常用量。
分别计算输入与输出
不要只记录总 Token。输入和输出单价不同,合并后无法定位哪一项正在增长。
同时计算基准与高峰
除了平均月成本,再算流量翻倍、输出变长和重试增加时的结果,并设置预算告警。
不知道后端该记录哪些字段时,可以先复制 7 天 Token 用量日志模板,再把其中的示例行替换成脱敏后的真实记录。
上线前检查清单
| 检查项 | 通过条件 |
|---|---|
| 用量来源 | 能说明任务数和 Token 来自日志、预设还是手工估计 |
| 价格来源 | 保留官方链接和复核日期,下单前再次查看 |
| 输出上限 | 后端设置最大输出长度,异常请求不会无限生成 |
| 重试策略 | 有次数上限和退避,不会在故障时放大成本 |
| 预算告警 | 日成本或月累计达到阈值时能被发现 |
| 质量抽检 | 固定样本能检查事实遗漏、格式错误和不可用结果 |
| 隐私边界 | 日志不保存 API Key,也不无差别保存用户原文 |
官方资料与计算来源
- DeepSeek 模型与价格(中文官方文档):确认 V4 Flash 的人民币输入、输出和缓存价格;官方明确提示价格可能调整。
- DeepSeek 限速与用户隔离:确认并发按账号计算,以及超过限制时的 HTTP 429 行为。
- 本站 AI API 成本计算器:用相同公式替换模型、输入、输出和预算。
失败边界与不适合条件
- 没有真实请求或账单时,只能把结果称为规划样例,不能称为生产实测。
- 需要比较模型质量时,必须补充同一批输入、相同输出约束、人工评分和失败率;价格表不能替代效果评测。
- 涉及隐私、商业秘密或受监管数据时,不要照搬公开样例,应先确定权限、留存和供应商数据政策。
- 价格、缓存规则或模型名变化后,旧计算立即失效;复核日期不是永久有效承诺。
- 高并发业务还要验证延迟、限流和容灾,月成本低不代表系统已经具备上线条件。
FAQ
为什么不直接按总 Token 乘一个平均价?
输入和输出单价不同,合并计算会隐藏真正的成本来源。至少要把两者分开记录。
5000 次请求是不是代表 5000 个用户?
不是。一个用户可能触发多次请求,批处理任务也可能没有终端用户。请求数、任务数和用户数不能互相替代。
¥31.50 能作为充值金额吗?
不建议。它只覆盖样例 Token 费用。充值前还要考虑流量波动、重试、其他模型调用和官方价格变化。
有真实日志后应该先改哪一项?
先替换任务数、平均输入和平均输出,再看重试率和缓存命中。不要一开始就改模型单价或随意加安全系数。
阅读结论
总结
这笔 ¥31.50 的价值不在于“便宜”,而在于每一步都能复算。把 5000 次任务、4500/900 Token 和 ¥100 预算替换成你的真实日志,才能得到可用于上线决策的成本结论。