Claude API 怎么计费?按 token 算钱、各模型价格、省钱调用法
数据截至 2026-07,价格与限额以各官网为准。
Claude API 按 token 计费,输入和输出分开计价、输出通常贵好几倍;真正决定账单的不是单价高低,而是你有没有选对模型档位、用上缓存和批处理。把这三件事做对,同样的活儿成本能差好几倍。
不少人一看到旗舰模型每百万 token 几美元就觉得贵,其实单价只是账单的一个因子。这篇先把计费规则讲透,再给一套能落地的省钱方法。
计费单位:按 token,输入输出分开算
Claude 的计费单位是 token,价格按每百万 token(MTok)标。关键是:输入 token 和输出 token 分别计价,而且输出明显比输入贵——这是 API 计费的普遍规律,Claude 也不例外。
所谓输入 token,是你发过去的全部内容:系统提示、历史对话、这次的用户消息、附带的文档,全算。输出 token 是模型这次生成的回复。所以一次多轮对话里,如果你每轮都把完整历史再发一遍,输入 token 会随轮数越滚越多——这是长对话账单悄悄膨胀的主要原因,后面省钱部分会讲怎么治。
各模型单价表
下面是当前在售主力模型的单价(每百万 token,美元),只列已核实过的数字:
| 模型 | 输入价 | 输出价 | 上下文窗口 |
|---|---|---|---|
| Claude Opus 4.8(当前旗舰) | $5 | $25 | 1M |
| Claude Opus 4.7 / 4.6(上代,仍在售) | $5 | $25 | 1M |
| Claude Sonnet 5(速度智能平衡) | $2(2026-08-31 前限时)/ 之后 $3 | $10(限时)/ 之后 $15 | 1M |
| Claude Sonnet 4.6(上代) | $3 | $15 | 1M |
| Claude Haiku 4.5(最快最省) | $1 | $5 | 200K |
| Claude Fable 5(最强旗舰,需显式选用) | $10 | $50 | 1M |
几点读表提示。第一,输出价基本是输入价的 5 倍(Opus 是 5/25,Haiku 是 1/5),所以输出多的任务(长文生成、代码生成)对总价的影响远大于输入多的任务。第二,Sonnet 5 目前有个限时价,2026-08-31 前输入 $2、输出 $10,之后回到 $3/$15——如果你在做长期成本规划,别拿限时价当永久价来承诺。第三,Haiku 的上下文窗口是 200K,比其它 1M 的小,但单价也最低,简单任务用它最划算。
Fable 5 是最强档,价格明显更高,而且有额外门槛(要求组织开启至少 30 天数据保留,零数据保留的组织调用会直接报错),只有明确需要”最强”时才动它,日常别默认选。
月成本怎么估算
给一个能直接套的估算方法。单次请求成本的公式是:
单次成本 = 输入 token 数 / 1,000,000 × 输入单价
+ 输出 token 数 / 1,000,000 × 输出单价
月成本 ≈ 单次成本 × 每月请求数
举个具体例子,感受一下量级。假设你用 Opus 4.8 做一个问答功能,平均每次请求输入 2,000 token(系统提示加用户问题)、输出 500 token,每天 1,000 次请求:
- 单次输入成本:2,000 / 1,000,000 × $5 = $0.01
- 单次输出成本:500 / 1,000,000 × $25 = $0.0125
- 单次合计:约 $0.0225
- 每天 1,000 次:约 $22.5
- 一个月(30 天):约 $675
同样这套负载,如果换成 Haiku 4.5($1/$5):
- 单次:2,000 / 1M × $1 + 500 / 1M × $5 = $0.002 + $0.0025 = $0.0045
- 一个月:约 $135
差了 5 倍。这就是”选对档位”的威力——很多任务用 Haiku 或 Sonnet 完全够用,非要上 Opus 就是白烧钱。估算时的经验:先按真实样本量一量平均输入输出 token,再乘请求量,别凭感觉拍。token 数可以用官方的 token 计数接口或响应里的 usage 字段实测。
关于该怎么看待 token 这个指标、别把它当成唯一的成本 KPI,可以看 别再拿 Token 当 KPI:真正该盯的成本指标是什么。
省钱调用法
单价改不了,但下面三招能实打实压低账单。
一、Prompt Caching:重复前缀打一折
如果你的请求里有一大段固定不变的前缀——比如很长的系统提示、参考文档、few-shot 示例——每次都原样发过去、每次都按输入价全额付费,太浪费。Prompt caching 就是把这段前缀缓存下来,后续命中时只按一个很低的倍率收费。
已核实过的通用倍率(相对该模型基础输入价):
| 操作 | 倍率 | 有效期 |
|---|---|---|
| 5 分钟缓存写入 | 基础输入价 × 1.25 | 5 分钟 |
| 1 小时缓存写入 | 基础输入价 × 2 | 1 小时 |
| 缓存命中读取 | 基础输入价 × 0.1 | 与对应写入同期 |
翻译成人话:命中一次读取只花基础输入价的 10%。写入会略微加价(5 分钟档 1.25 倍、1 小时档 2 倍),所以要算回本——5 分钟档写入后只要命中 1 次就回本,1 小时档写入需要命中 2 次回本。
用 Opus 4.8(基础输入 $5/MTok)算笔账:5 分钟缓存写入是 $6.25/MTok,命中读取只要 $0.50/MTok。一段 10,000 token 的固定文档,不缓存的话每次输入都付 $0.05;缓存后除了第一次写入付一点点溢价,后面每次命中只付 $0.005。高频复用场景省下来的很可观。
要注意缓存是前缀匹配:前缀里任何一处变了,那之后的缓存全部失效。所以要把固定内容放前面、变动内容放后面。一个请求最多 4 个缓存断点。另外前缀要够长才会触发缓存(存在按模型的最小 token 门槛,具体数值以官网原文表格为准),太短会静默不生效——排查方式是看响应 usage 字段里的 cache_creation_input_tokens / cache_read_input_tokens 是不是 0。
二、Batch API:不急的活儿打五折
如果任务不需要实时返回——批量翻译、离线打标、生成一堆摘要——用 Message Batches API 异步提交,输入输出 token 都按标准价的 50% 收费。比如 Opus 4.8 的 batch 价就是 $2.50 输入 / $12.50 输出。直接省一半,代价只是结果异步返回、不是秒回。而且前面接入篇提过,Batch 有独立的限速池,不挤占实时接口额度,一举两得。
三、选对模型档位
这是最容易被忽略、但收益最大的一招,前面月成本例子已经演示过:同样负载 Opus 换 Haiku 差 5 倍。实操建议是分级路由——简单分类、摘要、意图识别这类交给 Haiku 4.5;需要平衡质量和成本的生产批量走 Sonnet 5(还赶得上限时价);只有真正需要顶级推理的复杂任务才上 Opus。别一个 Opus 打天下。
落地分级路由并不复杂:先用一个便宜模型或规则判断请求难度,简单的直接走 Haiku,拿不准或明显复杂的再升级到 Sonnet、Opus。很多团队上线后才发现,真正需要旗舰模型的请求占比其实很小,绝大多数日常流量用中低档就够,账单一下就降下来了。评估时别怕多花点时间做一批人工抽检对比不同档位的输出质量,这一次性成本换来的是长期每天都在省。
另外提醒一句,长对话场景要主动做历史裁剪:不是每轮都把全部历史原样重发,可以只保留最近几轮加一份滚动摘要,把早期对话压缩成短短一段。这样输入 token 不会随轮数无限膨胀,配合缓存效果更好。
三招可以叠加:Batch 的五折能和缓存倍率、模型档位一起算,组合下来的降幅往往比单用一招大得多。
常见坑 / 注意
- 输出比输入贵约 5 倍:优化时优先控制输出长度,比压缩输入更划算。
- 长对话输入会滚雪球:每轮重发完整历史,token 越滚越多,考虑做历史裁剪或摘要。
- Sonnet 5 是限时价:2026-08-31 前 $2/$10,之后 $3/$15,长期规划别按限时价承诺。
- 缓存是前缀匹配:固定内容放前、变动放后,前缀一变后面全失效。
- 缓存太短不生效:低于最小门槛会静默失败,查
usage字段确认命中。 - 别默认用 Opus:先评估任务难度,能用 Haiku / Sonnet 就别烧 Opus。
- 成本要实测别拍脑袋:用
usage字段量真实 token,再乘请求量估月账。