API 月成本估算器
填月用量,按各模型单价排出成本高低。表内含海外美元定价与国内人民币定价,可选结算币种同口径比较;价格核对于 2026-08-09。
表内同时有美元定价(海外)与人民币定价(国内)的模型。为了排出同口径的成本高低, 这里按 1 美元 ≈ 6.7476 人民币(2026-08-09 取数) 折算。 汇率每天都在动,折算值只用于判断量级,不是报价;各行的官方原价请看价格对比表。
| 模型 | 厂商 | 月成本(¥) |
|---|---|---|
| qwen3.7-flash | 阿里云 | 10.00 |
| doubao-seed-2.0-mini | 字节跳动 | 22.00 |
| deepseek-v4-flash | DeepSeek | 30.00 |
| GLM-4.7-FlashX | 智谱AI | 35.00 |
| deepseek-v4-pro | DeepSeek | 90.00 |
| gpt-5.6-luna | OpenAI | 94.47 |
| qwen3.7-plus | 阿里云 | 100.00 |
| doubao-seed-2.1-turbo | 字节跳动 | 180.00 |
| Gemini 3.5 Flash-Lite | 188.93 | |
| GLM-5 | 智谱AI | 220.00 |
| kimi-k2.7-code | 月之暗面 | 335.00 |
| GLM-5.2 | 智谱AI | 360.00 |
| doubao-seed-2.1-pro | 字节跳动 | 360.00 |
| Claude Haiku 4.5 | Anthropic | 404.86 |
| qwen3.8-max | 阿里云 | 480.00 |
| grok-4.5 | xAI | 539.81 |
| Gemini 3.6 Flash | 607.28 | |
| Claude Sonnet 5 | Anthropic | 809.71 |
| gpt-5.6-terra | OpenAI | 944.66 |
| Gemini 3.1 Pro(Preview) | 944.66 | |
| kimi-k3 | 月之暗面 | 1200.00 |
| Claude Opus 5 | Anthropic | 2024.28 |
| gpt-5.6-sol | OpenAI | 2361.66 |
估算值,价格以各厂商官方为准
模型与单价来自价格对比表,每条均带官方来源链接。
先把用量估对,再谈选型
大部分人做 API 预算是反的:先挑一个模型,再看它多少钱。正确顺序是先把用量估出来, 因为用量结构决定了哪个模型最优——同样是每月一千万 token, 输入九百万输出一百万,和输入一百万输出九百万,最省钱的选择很可能不是同一家。
估用量的公式很朴素:单次请求 token 数 × 日请求数 × 30。 难点全在「单次请求 token 数」上,而这里最常见的错误是只算用户输入。 实际发出去的一次请求通常包括:固定的 system prompt、工具/函数定义、few-shot 示例、 检索出来的文档片段、之前几轮的对话历史,最后才是用户这一句。 真实项目里,用户输入常常只占总输入的一小部分。
四个把账单算炸的坑
多轮对话的输入是累加的。第十轮请求会把前九轮的问答一起发过去, 所以一次十轮的会话,输入 token 不是十份单轮,而是接近十的平方级增长。 做长会话产品时,要么截断历史,要么做摘要压缩,否则成本曲线会翘得很难看。
重试和超时是隐性成本。限流触发重试、生成中断重来,这些都照常计费。 并发估高一点、退避策略做好,比事后看账单省心。
max_tokens 设太大,输出就真的会那么长。输出单价通常是输入的几倍, 让模型「想说多久说多久」是最贵的默认配置。给一个贴合场景的上限,比什么都省。
把整份文档塞进上下文。长上下文不但按 token 计费,还常常跳到更贵的分档。 能用检索取出相关的三段,就别把三十页全塞进去,具体权衡看 上下文长度计算器。
降本的顺序:先结构,后单价
很多团队一说降本就去换更便宜的模型,其实这是最后一步。前面还有三步性价比更高: 第一步是砍掉不必要的输入(压缩 system prompt、裁剪历史、用检索替代全文), 第二步是把重复前缀交给提示缓存(命中价通常只有标准输入价的零头), 第三步是把简单任务分流给轻量档模型,只让难的走旗舰。 做完这三步再去比单价,往往发现已经不用换模型了。
如果你想先看看各家单价的横向情况,可以直接翻 价格对比表;想按厂商了解计费口径和免费额度, 国产大模型 API 价格对比那篇按家拆得更细。
常见问题
月输入 / 月输出 token 数怎么估?
用「单次请求 token 数 × 日请求数 × 30」。单次请求的输入包括 system prompt、历史对话、检索片段和用户输入,可以先用 token 计算器把典型请求粘进去量一下;输出可以按平均回答长度估,或直接按你设的 max_tokens 上限估一个天花板。
为什么排出来最便宜的模型,我用着反而更贵?
通常是三件事之一:一是你的真实输入输出比和估算时填的不一样,输出占比越高,输出单价高的模型越吃亏;二是多轮对话把历史反复重发,实际输入远超单轮估算;三是便宜模型效果不够,需要重试或用更长的提示去兜,反而把省下的钱吐回去了。
这个结果能当报价单用吗?
不能。它是量级判断工具,用来回答「这个功能一个月大概烧多少」。正式报价要考虑分档计费、缓存折扣、Batch 折扣、并发峰值带来的限流重试,以及厂商的阶梯优惠,请以官方定价页和你和厂商谈定的条款为准。
预算排完了,接下来是落地
从密钥申请到并发调优,奇连 AI 的教程按厂商、按报错码逐个写好了。