DeepSeek API 多少钱?token 单价、缓存折扣与成本对比

2026-07-07

数据截至 2026-07,价格与限额以各官网为准。

DeepSeek API 按 token 计费,单价本身就不高,真正把成本打下来的是缓存命中折扣——命中一次能省掉九成多的钱;但账单能不能算清楚,先得搞明白你看的是人民币价还是美元价,这两套价目表来自不同页面,千万别混着用。

不少人一看到 DeepSeek 单价就觉得”便宜到不用精打细算”,这个印象大体没错,但如果你的服务量级上去了,缓存命不命中、有没有踩中峰谷定价这些细节还是会让账单差出好几倍。这篇把计费规则、缓存折扣、成本估算一次讲完。

单价表:先说清楚是哪种币种

DeepSeek 当前主力是 V4 系列,分 Flash 和 Pro 两档。这里有个容易踩的坑必须先讲:DeepSeek 官方的中文定价页只给人民币价,英文定价页只给美元价,两边不是同一张表的两种展示,而是两个独立页面各自维护的口径。写文章、做报价单的时候,最好只引用你实际打开的那个官方页面上的数字,别把中文页的人民币价和网上转换出来的美元价混在同一份对外报价里,容易出现汇率过时导致的偏差。

按官方原始口径,人民币价是这样的(每百万 tokens):

模型输入·缓存命中输入·缓存未命中输出上下文窗口
deepseek-v4-flash0.02 元1 元2 元1M tokens
deepseek-v4-pro0.025 元3 元6 元1M tokens

如果你需要美元口径去对比国外服务,网上按当前汇率换算大概是 flash 输入未命中约 $0.14、输出约 $0.28,pro 输入未命中约 $0.435、输出约 $0.87——但这组美元数字是换算参考值,严格意义上没有在同一张官方页面上找到人民币和美元并列的表格,正式引用时建议直接标明”人民币价”或”美元价”来源哪个页面,不要含糊说”DeepSeek 单价是多少美元”,容易被追问出处时说不清楚。

两档模型的最大输出都是 384K tokens,上下文窗口都是 1M tokens,规格上没有差异,差异全在单价和并发限制上:flash 支持 2500 并发,pro 支持 500 并发,做容量规划时这个数字比单价更容易被忽略。

缓存命中折扣:真正的重点

如果只记住这篇文章的一件事,记这个:DeepSeek 的上下文缓存默认对所有用户开启,不用改代码,命中时价格直接砍到未命中价的百分之一到百分之二左右

具体折扣幅度,按上面那张官方人民币价表算:

  • deepseek-v4-flash:命中 0.02 元 vs 未命中 1 元,命中价约为未命中价的 2%,也就是降幅约 98%。
  • deepseek-v4-pro:命中 0.025 元 vs 未命中 3 元,命中价约为未命中价的 0.83%,降幅约 99%。

这个折扣力度比很多同类服务的”prompt caching”要更狠一些,原因在于它的实现方式:官方文档管这个功能叫”Context Caching on Disk”(上下文硬盘缓存),机制是每次请求都会在输入末尾和输出末尾各生成一个缓存前缀单元,系统检测到多个请求存在相同前缀时会把这段持久化下来,后续命中直接按极低价格收费。整个过程不需要你手动开启,也不需要在请求里加什么特殊参数,是默认行为。

命没命中怎么看?API 返回的 usage 字段里有两个数:prompt_cache_hit_tokens(命中缓存的输入 token 数)和 prompt_cache_miss_tokens(未命中的输入 token 数)。想验证自己的调用有没有吃到折扣,直接看这两个字段的实际数值就行,不用猜。

有几个边界条件要留意。第一,缓存只匹配输入的前缀部分,输出部分始终要模型实际计算生成,不受缓存影响,也不影响输出的随机性。第二,缓存是”尽力而为”(best-effort),官方没有承诺 100% 命中,不要把它当成确定性行为去做强依赖。第三,闲置的缓存会自动清理,官方原文说的是大概几小时到几天不等,具体保留多久没有一个固定数字,别假设某段缓存能存活很久。第四,官方文档正文没有直接写”不同用户缓存互相隔离”这句话,虽然多篇第三方技术解读提到过这点,但既然官方文档原文没有明确书面表述,这里只作为参考信息标注,不当成确定事实来写。

对高频复用固定前缀(比如系统提示词很长、或者反复处理同一批参考文档)的场景,这个折扣力度基本上意味着”用得越多、边际成本降得越猛”,值得在设计 prompt 结构时有意识地把不变内容放前面、变化内容放后面,尽量提高命中率。

月成本怎么估算

给一个能直接套的公式。单次请求成本:

单次成本 = 输入 token 数 / 1,000,000 × 输入单价(区分命中/未命中)
         + 输出 token 数 / 1,000,000 × 输出单价
月成本 ≈ 单次成本 × 每月请求数

举个例子,用 deepseek-v4-flash(人民币价)估算一个每天 5,000 次请求的问答功能,平均每次输入 2,000 token、输出 500 token,假设缓存命中率不高(保守按全部未命中算):

  • 单次输入成本:2,000 / 1,000,000 × 1 元 = 0.002 元
  • 单次输出成本:500 / 1,000,000 × 2 元 = 0.001 元
  • 单次合计:约 0.003 元
  • 每天 5,000 次:约 15 元
  • 一个月(30 天):约 450 元

如果这批请求里有相当一部分命中缓存——比如系统提示词固定不变,缓存命中率能到 60%,那 60% 的输入部分成本会从 1 元/百万降到 0.02 元/百万,整体月成本会明显往下压。具体压到多少要按你实际的命中比例代入公式算,这里不虚报一个”能省多少”的笼统数字,实测最靠谱。

峰谷定价:目前只是传闻,别当成既定事实

网上有报道说 DeepSeek 计划在 V4 正式版上线后(约 2026 年 7 月中旬)引入”峰谷定价”,工作时段价格翻倍:flash 平时 1/2 元、高峰 2/4 元;pro 平时 3/6 元、高峰 6/12 元。

这件事截至核实时,官方定价页尚未看到正式生效或公示,所以本文只作为”存在这个传闻”来提,不能当成确定的计费规则写进任何报价单或成本模型里。如果你的业务对成本敏感,建议在正式立项前直接去官网 platform.deepseek.comapi-docs.deepseek.com 当次核实一遍页面上的实时价格,官方随时可能已经调整,一切以官网当时页面为准。

常见坑 / 注意

  • 中文页人民币、英文页美元,别混用:两个页面各自独立维护,别把网传换算价当成官方原始数字对外报价。
  • 缓存默认开启不用配置:命中折扣是自动生效的,别以为要额外开关或加参数才能用上。
  • 命中与否看 usage 字段prompt_cache_hit_tokens / prompt_cache_miss_tokens 两个数直接告诉你有没有吃到折扣。
  • 缓存是 best-effort,不保证命中:别把它当成确定性行为做强依赖设计。
  • 旧模型名 2026-07-24 后弃用deepseek-chat/deepseek-reasoner 到期后建议直接用 deepseek-v4-flash/deepseek-v4-pro 报价和调用。
  • 峰谷定价目前未官方生效:这是传闻性质,报价前务必去官网核实当次页面,别按传闻里的翻倍价做成本规划。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。