在线计算器

API 月成本估算器

填月用量,按各模型单价排出成本高低。表内含海外美元定价与国内人民币定价,可选结算币种同口径比较;价格核对于 2026-08-09。

表内同时有美元定价(海外)与人民币定价(国内)的模型。为了排出同口径的成本高低, 这里按 1 美元 ≈ 6.7476 人民币(2026-08-09 取数) 折算。 汇率每天都在动,折算值只用于判断量级,不是报价;各行的官方原价请看价格对比表

模型厂商月成本(¥
qwen3.7-flash阿里云10.00
doubao-seed-2.0-mini字节跳动22.00
deepseek-v4-flashDeepSeek30.00
GLM-4.7-FlashX智谱AI35.00
deepseek-v4-proDeepSeek90.00
gpt-5.6-lunaOpenAI94.47
qwen3.7-plus阿里云100.00
doubao-seed-2.1-turbo字节跳动180.00
Gemini 3.5 Flash-LiteGoogle188.93
GLM-5智谱AI220.00
kimi-k2.7-code月之暗面335.00
GLM-5.2智谱AI360.00
doubao-seed-2.1-pro字节跳动360.00
Claude Haiku 4.5Anthropic404.86
qwen3.8-max阿里云480.00
grok-4.5xAI539.81
Gemini 3.6 FlashGoogle607.28
Claude Sonnet 5Anthropic809.71
gpt-5.6-terraOpenAI944.66
Gemini 3.1 Pro(Preview)Google944.66
kimi-k3月之暗面1200.00
Claude Opus 5Anthropic2024.28
gpt-5.6-solOpenAI2361.66

估算值,价格以各厂商官方为准

模型与单价来自价格对比表,每条均带官方来源链接。

先把用量估对,再谈选型

大部分人做 API 预算是反的:先挑一个模型,再看它多少钱。正确顺序是先把用量估出来, 因为用量结构决定了哪个模型最优——同样是每月一千万 token, 输入九百万输出一百万,和输入一百万输出九百万,最省钱的选择很可能不是同一家。

估用量的公式很朴素:单次请求 token 数 × 日请求数 × 30。 难点全在「单次请求 token 数」上,而这里最常见的错误是只算用户输入。 实际发出去的一次请求通常包括:固定的 system prompt、工具/函数定义、few-shot 示例、 检索出来的文档片段、之前几轮的对话历史,最后才是用户这一句。 真实项目里,用户输入常常只占总输入的一小部分。

四个把账单算炸的坑

多轮对话的输入是累加的。第十轮请求会把前九轮的问答一起发过去, 所以一次十轮的会话,输入 token 不是十份单轮,而是接近十的平方级增长。 做长会话产品时,要么截断历史,要么做摘要压缩,否则成本曲线会翘得很难看。

重试和超时是隐性成本。限流触发重试、生成中断重来,这些都照常计费。 并发估高一点、退避策略做好,比事后看账单省心。

max_tokens 设太大,输出就真的会那么长。输出单价通常是输入的几倍, 让模型「想说多久说多久」是最贵的默认配置。给一个贴合场景的上限,比什么都省。

把整份文档塞进上下文。长上下文不但按 token 计费,还常常跳到更贵的分档。 能用检索取出相关的三段,就别把三十页全塞进去,具体权衡看 上下文长度计算器

降本的顺序:先结构,后单价

很多团队一说降本就去换更便宜的模型,其实这是最后一步。前面还有三步性价比更高: 第一步是砍掉不必要的输入(压缩 system prompt、裁剪历史、用检索替代全文), 第二步是把重复前缀交给提示缓存(命中价通常只有标准输入价的零头), 第三步是把简单任务分流给轻量档模型,只让难的走旗舰。 做完这三步再去比单价,往往发现已经不用换模型了。

如果你想先看看各家单价的横向情况,可以直接翻 价格对比表;想按厂商了解计费口径和免费额度, 国产大模型 API 价格对比那篇按家拆得更细。

常见问题

月输入 / 月输出 token 数怎么估?

用「单次请求 token 数 × 日请求数 × 30」。单次请求的输入包括 system prompt、历史对话、检索片段和用户输入,可以先用 token 计算器把典型请求粘进去量一下;输出可以按平均回答长度估,或直接按你设的 max_tokens 上限估一个天花板。

为什么排出来最便宜的模型,我用着反而更贵?

通常是三件事之一:一是你的真实输入输出比和估算时填的不一样,输出占比越高,输出单价高的模型越吃亏;二是多轮对话把历史反复重发,实际输入远超单轮估算;三是便宜模型效果不够,需要重试或用更长的提示去兜,反而把省下的钱吐回去了。

这个结果能当报价单用吗?

不能。它是量级判断工具,用来回答「这个功能一个月大概烧多少」。正式报价要考虑分档计费、缓存折扣、Batch 折扣、并发峰值带来的限流重试,以及厂商的阶梯优惠,请以官方定价页和你和厂商谈定的条款为准。

预算排完了,接下来是落地

从密钥申请到并发调优,奇连 AI 的教程按厂商、按报错码逐个写好了。

去学习中心