千问 API 价格怎么算?通义千问各模型 token 单价与月成本估算
数据截至 2026-08-09,价格与限额以各官网为准。本次更新重核了官方定价页(页面标注更新时间 2026-08-06)。
通义千问 API 按 token 计费,但和很多同类服务不一样的是,多数主力模型(qwen3.7-plus、qwen-plus、qwen-flash、qwen3-max 等)用的是阶梯计价——单次请求的输入 token 总量落在哪个区间,这次请求的全部 token 就按那一档单价结算;只有 qwen-max、qwen-turbo、qwen-long 这几款是无阶梯的固定价,算账最省心。
如果你只是想估个大概成本,先记住三句话:一,先看清你调用的模型是”固定价”还是”阶梯价”,阶梯价看的是这次请求输入了多少 token、不是账户总用量;二,开不开思考模式是两套输出价,能差 4 倍;三,免费额度只有北京地域才有。这三条踩错任何一条,成本估算都会差出好几倍。这篇把计费规则、各模型单价表、缓存与 Batch 折扣、免费额度和成本估算公式一次讲完。
计费单位与阶梯规则怎么读
通义千问的价格口径是元 / 百万 tokens(人民币),这是中国内地站点的计价方式,输入和输出分开计价,输入通常比输出便宜不少。
标”阶梯计价”的模型,规则是这样的:按单次请求的输入 token 总量决定命中哪一档,比如这次请求输入了 15 万 token,那就落在对应的中间档位,这一整次请求的输入部分全部按该档单价结算,不是”前 12.8 万按低价、超出部分按高价”这种分段累加算法。输出 token 不受阶梯规则影响,按对应档位标注的输出单价单独算。
这个机制跟有些平台的”缓存命中折扣”是两回事——阶梯计价看的是这次请求输入了多长的文本,不是看有没有复用固定前缀。如果你的应用经常调用超长上下文(比如塞进整份文档去问答),成本会因为跳档而明显上升,这点在做容量规划时容易被忽略。
单价表:经典命名模型
以下价格来自阿里云百炼官方定价页,人民币口径,单位元/百万 tokens:
| 模型 | 输入价格 | 输出价格 | 说明 |
|---|---|---|---|
qwen-max | 2.4 元 | 9.6 元 | 无阶梯,仅非思考模式 |
qwen-plus | 阶梯计价 | 阶梯计价 | 0–128K:输入 0.8/输出 2(思考模式 8);128K–256K:输入 2.4/输出 20(思考 24);256K–1M:输入 4.8/输出 48(思考 64) |
qwen-flash | 阶梯计价 | 阶梯计价 | 0–128K:输入 0.15/输出 1.5;128K–256K:输入 0.6/输出 6;256K–1M:输入 1.2/输出 12 |
qwen-turbo | 0.3 元 | 0.6 元 | 无阶梯,思考模式输出 3 元 |
qwen-long | 0.5 元 | 2 元 | 无阶梯,超长文本场景 |
这里有个上一版没讲清楚、但对账单影响很大的细节:qwen-plus 和 qwen-turbo 的输出价要分”思考模式”和”非思考模式”两套。以 qwen-plus 的 0–128K 档为例,非思考模式输出 2 元,开了思考模式就是 8 元,差 4 倍,而且思考模式的计费口径是”思维链 + 回答”一起算——也就是模型那些你可能根本不展示给用户看的推理过程,同样要付钱。很多人估算成本时只看了非思考那一列,实际跑起来开了 thinking,账单直接翻几倍还找不着原因。
qwen-plus 还有个需要老实交代的地方:另有资料给出过一个约 0.87 元/百万输入的口径,跟上面这张阶梯表对不上,疑似是某个时间段的限时优惠价。这个数字本次复核仍然没有拿到官方佐证,正式报价前请去百炼控制台核实当次实时价格。
单价表:Qwen3 新系列
上一版这张表里有好几个”未核实到独立数字”的空格,这次全部补齐了。另外主力款也换了——现在的顶配是 qwen3.8-max,均衡主力是 qwen3.7-plus:
| 模型 | 输入 Token 档 | 输入价格 | 输出价格 |
|---|---|---|---|
qwen3.8-max | 0–1M | 12 元 | 36 元 |
qwen3.7-max | 0–1M | 原价 12 元,限时 5 折 | 原价 36 元,限时 5 折 |
qwen3-max | 0–32K/32K–128K/128K–256K | 2.5/4/7 元 | 10/16/28 元 |
qwen3.7-plus | 0–256K/256K–1M | 原价 2/6 元,限时 8 折 | 原价 8/24 元,限时 8 折 |
qwen3.6-plus | 0–256K/256K–1M | 2/8 元 | 12/48 元 |
qwen3.5-plus | 0–128K/128K–256K/256K–1M | 0.8/2/4 元 | 4.8/12/24 元 |
qwen3.7-flash | 0–32K/32K–256K/256K–1M | 0.2/0.6/1.2 元 | 0.8/2.4/4.8 元 |
qwen3.6-flash | 0–256K/256K–1M | 1.2/4.8 元 | 7.2/28.8 元 |
qwen3.5-flash | 0–128K/128K–256K/256K–1M | 0.2/0.8/1.2 元 | 2/8/12 元 |
qwen3-coder-plus | 0–32K/–128K/–256K/–1M | 4/6/10/20 元 | 16/24/40/200 元 |
qwen3-coder-flash | 0–32K/–128K/–256K/–1M | 1/1.5/2.5/5 元 | 4/6/10/25 元 |
这张表有几处特别值得盯一眼。
限时折扣是真金白银,但也是定时炸弹。qwen3.7-max 现在挂着限时 5 折(12 元的原价按 6 元收),qwen3.7-plus 是限时 8 折。现在用确实便宜,但”限时”意味着你的成本模型里埋了一个会自己跳涨的变量——按原价做预算、把折扣当意外之喜,比反过来安全。
qwen3-coder-plus 最高档的输出价是 200 元,这是整张表里最扎眼的数字,比它自己 256K 档的 40 元跳了 5 倍。编程场景本来就容易堆长上下文(整个代码库塞进去),一旦输入越过 256K,输出成本直接失控。用这个模型做 Agent 类长任务的话,控制上下文长度不是优化项,是必修课。
**新系列不一定比旧系列贵。**上一版这里的结论是”Qwen3 新系列整体比经典命名贵不少”,这次看全表后这个说法需要修正:qwen3.7-flash 最低档 0.2/0.8 元,比 qwen3.6-flash 的 1.2/7.2 元便宜得多——同一家的新版本反而大幅降价了。所以别套用”新的更贵”或”新的更便宜”任何一种简单规律,就得逐个看表。
关于上下文窗口:从阶梯档位能反推出一部分信息——档位划到 1M 的(qwen3.8-max、qwen3.7-max、qwen3.7-plus、qwen3.6-plus、各款 flash、qwen3-coder 系列)说明支持到 1M;qwen3-max 最高档只到 256K。但阶梯档位不等于官方标称的上下文上限,具体某个型号的最大上下文,还是要去百炼「模型广场」对应模型详情页核对,别按印象假设。
上下文缓存:命中只按一折收,但和 Batch 不能叠加
这一节是上一版完全没讲到的,但它对账单的影响可能比选哪个模型还大。
官方现在给了一条通用的缓存计价规则,不用再逐个模型去猜:
- 缓存命中的输入 token,按标准输入单价的 10% 计费;
- 创建显式缓存的 token,按标准输入单价的 125% 计费;
- 价格表里的输入单价不含缓存单价,两者是分开算的。
命中一折,这个力度相当可观——qwen3.7-plus 的 2 元输入,命中后是 0.2 元。但要注意那个 125%:显式缓存不是白建的,你得先多付 25% 把它建起来,之后每次命中才省 90%。所以显式缓存划不划算,取决于同一段前缀你到底会复用多少次。粗算一下:建一次多付 0.25 倍,每命中一次省 0.9 倍,大约命中一次就回本了;但如果你建了缓存却只用一两次,或者前缀频繁变动导致建了就失效,那就是纯亏。
还有两条硬约束别忘了:
- 缓存折扣和 Batch 五折不能同时生效,只能二选一。异步批量任务走 Batch,实时高复用场景走缓存,别指望叠 buff。
- 不是所有模型都支持缓存,价格表里每个模型下方会标”上下文缓存享有折扣”字样,没标的就别按缓存价做预算。
Batch 批量调用:输入输出都打五折
如果模型标注了支持 Batch,输入和输出单价均按实时推理价格的 50% 计费。注意它和有些平台”只有输入打折”的做法不一样——通义这边输出也一起打折,对输出量大的任务(长文生成、代码生成)更友好。
前面说过,Batch 和缓存折扣互斥。判断顺序建议是:先看任务能不能接受异步,能就走 Batch(省一半且不挑请求结构);不能接受异步、但请求前缀高度重复的,才去做缓存。
免费额度:100 万 token、90 天,而且只有北京地域有
新用户开通百炼会拿到免费推理额度,官方给的口径是各模型 100 万 Token,有效期 90 天(自开通百炼、模型发布、或申请通过之日起算,以较晚者为准)。
这一版必须补一条上次漏掉、但特别容易踩的限制:免费额度只在华北2(北京)地域提供,其他地域(弗吉尼亚、新加坡、法兰克福、东京)一律没有。如果你为了延迟或合规把服务部署在新加坡节点,然后纳闷”说好的免费额度怎么没扣”,多半就是这个原因。
额度的隔离规则也比想象中细:
- 不同模型的额度池互相独立,用完一个不影响另一个;
- 同一模型的不同快照版本也是独立的——
qwen3-max和qwen3-max-2026-01-23算两个模型,各有各的 100 万; - 主账号和它的 RAM 子账号共享同一份额度,统一计算消耗。
还有一点在算成本时容易漏掉:免费额度只覆盖实时推理调用。Batch 批量调用、上下文缓存、模型调优、模型部署这几类场景的费用,免费额度不抵扣,得单独按量付费计入成本。系统的抵扣顺序是免费额度优先于资源包。
月成本怎么估算
给一个能直接套的公式:
单次成本 = 输入 token 数 / 1,000,000 × 输入单价(按阶梯档确定)
+ 输出 token 数 / 1,000,000 × 输出单价(按阶梯档确定)
月成本 ≈ 单次成本 × 每月请求数
举个例子,用 qwen-flash 估算一个每天 3,000 次调用的轻量问答功能,平均每次输入 1,500 token、输出 300 token,输入总量落在 0–128K 这一档:
- 单次输入成本:1,500 / 1,000,000 × 0.15 元 = 0.000225 元
- 单次输出成本:300 / 1,000,000 × 1.5 元 = 0.00045 元
- 单次合计:约 0.000675 元
- 每天 3,000 次:约 2.03 元
- 一个月(30 天):约 61 元
如果换成 qwen-plus(同一档位输入 0.8 元、输出 2 元),同样的用量规模,单次成本会明显抬高,算下来一个月大概是这个量级的两三倍(约 160 元上下)——这也是为什么选型时不能只看”能不能用”,还得看这个任务是不是真的需要更贵的模型能力。如果你的业务量级会推着输入 token 经常跳档(比如塞长文档进上下文),务必按实际分布重新代入公式算,不要只按一个平均值估算,阶梯计价对成本的影响比很多人想象的要敏感。
常见坑 / 注意
- 思考模式的输出另算一套价:
qwen-plus0–128K 档非思考输出 2 元、思考 8 元,差 4 倍,且按”思维链+回答”一起计费。估算时别只看非思考那一列。 - 免费额度只有华北2(北京)有:其他地域一律没有。部署在新加坡等节点却指望免费额度的,会直接落空。
- 限时折扣会到期:
qwen3.7-max现在 5 折、qwen3.7-plus8 折,按原价做预算更安全,别把折扣价写死进长期成本模型。 qwen3-coder-plus超过 256K 后输出 200 元:比前一档跳 5 倍,编程 Agent 类长任务必须控上下文长度。- 缓存和 Batch 不能叠加:命中按标准输入价 10%、创建显式缓存按 125%;Batch 是输入输出各五折。二选一,别指望叠 buff。
- 别套用”新款一定更贵/更便宜”:
qwen3.7-flash(0.2 元起)比qwen3.6-flash(1.2 元起)便宜得多,得逐个看表。 - 阶梯价看的是”这次请求的输入总量”:不是账户累计用量,也不是”命中缓存才省钱”的折扣逻辑,跟缓存机制是两回事。
qwen-plus的”0.87 元优惠价”说法仍未核实:跟阶梯表对不上,报价前去控制台核对当日实时价格。- 快照版本额度独立:
qwen3-max和qwen3-max-2026-01-23算两个模型,各有各的免费额度。
接下来看什么
留言讨论
评论发布后会被人工复核,违规内容将被删除。
如果发表没有反应,可以前往联系我们告诉我们。