千问 API 价格怎么算?通义千问各模型 token 单价与月成本估算

2026-07-07 · 更新于 2026-08-09
站内工具 大模型 API 价格对比表 → 豆包 / GLM / Kimi / 千问 / DeepSeek 等 9 家厂商单价并排看,可按币种筛选、按价格排序,每行链到官方定价页。

数据截至 2026-08-09,价格与限额以各官网为准。本次更新重核了官方定价页(页面标注更新时间 2026-08-06)。

通义千问 API 按 token 计费,但和很多同类服务不一样的是,多数主力模型(qwen3.7-plus、qwen-plus、qwen-flash、qwen3-max 等)用的是阶梯计价——单次请求的输入 token 总量落在哪个区间,这次请求的全部 token 就按那一档单价结算;只有 qwen-max、qwen-turbo、qwen-long 这几款是无阶梯的固定价,算账最省心。

如果你只是想估个大概成本,先记住三句话:一,先看清你调用的模型是”固定价”还是”阶梯价”,阶梯价看的是这次请求输入了多少 token、不是账户总用量;二,开不开思考模式是两套输出价,能差 4 倍;三,免费额度只有北京地域才有。这三条踩错任何一条,成本估算都会差出好几倍。这篇把计费规则、各模型单价表、缓存与 Batch 折扣、免费额度和成本估算公式一次讲完。

计费单位与阶梯规则怎么读

通义千问的价格口径是元 / 百万 tokens(人民币),这是中国内地站点的计价方式,输入和输出分开计价,输入通常比输出便宜不少。

标”阶梯计价”的模型,规则是这样的:按单次请求的输入 token 总量决定命中哪一档,比如这次请求输入了 15 万 token,那就落在对应的中间档位,这一整次请求的输入部分全部按该档单价结算,不是”前 12.8 万按低价、超出部分按高价”这种分段累加算法。输出 token 不受阶梯规则影响,按对应档位标注的输出单价单独算。

这个机制跟有些平台的”缓存命中折扣”是两回事——阶梯计价看的是这次请求输入了多长的文本,不是看有没有复用固定前缀。如果你的应用经常调用超长上下文(比如塞进整份文档去问答),成本会因为跳档而明显上升,这点在做容量规划时容易被忽略。

单价表:经典命名模型

以下价格来自阿里云百炼官方定价页,人民币口径,单位元/百万 tokens:

模型输入价格输出价格说明
qwen-max2.4 元9.6 元无阶梯,仅非思考模式
qwen-plus阶梯计价阶梯计价0–128K:输入 0.8/输出 2(思考模式 8);128K–256K:输入 2.4/输出 20(思考 24);256K–1M:输入 4.8/输出 48(思考 64)
qwen-flash阶梯计价阶梯计价0–128K:输入 0.15/输出 1.5;128K–256K:输入 0.6/输出 6;256K–1M:输入 1.2/输出 12
qwen-turbo0.3 元0.6 元无阶梯,思考模式输出 3 元
qwen-long0.5 元2 元无阶梯,超长文本场景

这里有个上一版没讲清楚、但对账单影响很大的细节:qwen-plusqwen-turbo 的输出价要分”思考模式”和”非思考模式”两套。以 qwen-plus 的 0–128K 档为例,非思考模式输出 2 元,开了思考模式就是 8 元,差 4 倍,而且思考模式的计费口径是”思维链 + 回答”一起算——也就是模型那些你可能根本不展示给用户看的推理过程,同样要付钱。很多人估算成本时只看了非思考那一列,实际跑起来开了 thinking,账单直接翻几倍还找不着原因。

qwen-plus 还有个需要老实交代的地方:另有资料给出过一个约 0.87 元/百万输入的口径,跟上面这张阶梯表对不上,疑似是某个时间段的限时优惠价。这个数字本次复核仍然没有拿到官方佐证,正式报价前请去百炼控制台核实当次实时价格。

单价表:Qwen3 新系列

上一版这张表里有好几个”未核实到独立数字”的空格,这次全部补齐了。另外主力款也换了——现在的顶配是 qwen3.8-max,均衡主力是 qwen3.7-plus

模型输入 Token 档输入价格输出价格
qwen3.8-max0–1M12 元36 元
qwen3.7-max0–1M原价 12 元,限时 5 折原价 36 元,限时 5 折
qwen3-max0–32K/32K–128K/128K–256K2.5/4/7 元10/16/28 元
qwen3.7-plus0–256K/256K–1M原价 2/6 元,限时 8 折原价 8/24 元,限时 8 折
qwen3.6-plus0–256K/256K–1M2/8 元12/48 元
qwen3.5-plus0–128K/128K–256K/256K–1M0.8/2/4 元4.8/12/24 元
qwen3.7-flash0–32K/32K–256K/256K–1M0.2/0.6/1.2 元0.8/2.4/4.8 元
qwen3.6-flash0–256K/256K–1M1.2/4.8 元7.2/28.8 元
qwen3.5-flash0–128K/128K–256K/256K–1M0.2/0.8/1.2 元2/8/12 元
qwen3-coder-plus0–32K/–128K/–256K/–1M4/6/10/20 元16/24/40/200 元
qwen3-coder-flash0–32K/–128K/–256K/–1M1/1.5/2.5/5 元4/6/10/25 元

这张表有几处特别值得盯一眼。

限时折扣是真金白银,但也是定时炸弹。qwen3.7-max 现在挂着限时 5 折(12 元的原价按 6 元收),qwen3.7-plus 是限时 8 折。现在用确实便宜,但”限时”意味着你的成本模型里埋了一个会自己跳涨的变量——按原价做预算、把折扣当意外之喜,比反过来安全。

qwen3-coder-plus 最高档的输出价是 200 元,这是整张表里最扎眼的数字,比它自己 256K 档的 40 元跳了 5 倍。编程场景本来就容易堆长上下文(整个代码库塞进去),一旦输入越过 256K,输出成本直接失控。用这个模型做 Agent 类长任务的话,控制上下文长度不是优化项,是必修课。

**新系列不一定比旧系列贵。**上一版这里的结论是”Qwen3 新系列整体比经典命名贵不少”,这次看全表后这个说法需要修正:qwen3.7-flash 最低档 0.2/0.8 元,比 qwen3.6-flash 的 1.2/7.2 元便宜得多——同一家的新版本反而大幅降价了。所以别套用”新的更贵”或”新的更便宜”任何一种简单规律,就得逐个看表。

关于上下文窗口:从阶梯档位能反推出一部分信息——档位划到 1M 的(qwen3.8-maxqwen3.7-maxqwen3.7-plusqwen3.6-plus、各款 flash、qwen3-coder 系列)说明支持到 1M;qwen3-max 最高档只到 256K。但阶梯档位不等于官方标称的上下文上限,具体某个型号的最大上下文,还是要去百炼「模型广场」对应模型详情页核对,别按印象假设。

上下文缓存:命中只按一折收,但和 Batch 不能叠加

这一节是上一版完全没讲到的,但它对账单的影响可能比选哪个模型还大。

官方现在给了一条通用的缓存计价规则,不用再逐个模型去猜:

  • 缓存命中的输入 token,按标准输入单价的 10% 计费;
  • 创建显式缓存的 token,按标准输入单价的 125% 计费;
  • 价格表里的输入单价不含缓存单价,两者是分开算的。

命中一折,这个力度相当可观——qwen3.7-plus 的 2 元输入,命中后是 0.2 元。但要注意那个 125%:显式缓存不是白建的,你得先多付 25% 把它建起来,之后每次命中才省 90%。所以显式缓存划不划算,取决于同一段前缀你到底会复用多少次。粗算一下:建一次多付 0.25 倍,每命中一次省 0.9 倍,大约命中一次就回本了;但如果你建了缓存却只用一两次,或者前缀频繁变动导致建了就失效,那就是纯亏。

还有两条硬约束别忘了:

  • 缓存折扣和 Batch 五折不能同时生效,只能二选一。异步批量任务走 Batch,实时高复用场景走缓存,别指望叠 buff。
  • 不是所有模型都支持缓存,价格表里每个模型下方会标”上下文缓存享有折扣”字样,没标的就别按缓存价做预算。

Batch 批量调用:输入输出都打五折

如果模型标注了支持 Batch,输入和输出单价均按实时推理价格的 50% 计费。注意它和有些平台”只有输入打折”的做法不一样——通义这边输出也一起打折,对输出量大的任务(长文生成、代码生成)更友好。

前面说过,Batch 和缓存折扣互斥。判断顺序建议是:先看任务能不能接受异步,能就走 Batch(省一半且不挑请求结构);不能接受异步、但请求前缀高度重复的,才去做缓存。

免费额度:100 万 token、90 天,而且只有北京地域有

新用户开通百炼会拿到免费推理额度,官方给的口径是各模型 100 万 Token,有效期 90 天(自开通百炼、模型发布、或申请通过之日起算,以较晚者为准)。

这一版必须补一条上次漏掉、但特别容易踩的限制:免费额度只在华北2(北京)地域提供,其他地域(弗吉尼亚、新加坡、法兰克福、东京)一律没有。如果你为了延迟或合规把服务部署在新加坡节点,然后纳闷”说好的免费额度怎么没扣”,多半就是这个原因。

额度的隔离规则也比想象中细:

  • 不同模型的额度池互相独立,用完一个不影响另一个;
  • 同一模型的不同快照版本也是独立的——qwen3-maxqwen3-max-2026-01-23 算两个模型,各有各的 100 万;
  • 主账号和它的 RAM 子账号共享同一份额度,统一计算消耗。

还有一点在算成本时容易漏掉:免费额度只覆盖实时推理调用。Batch 批量调用、上下文缓存、模型调优、模型部署这几类场景的费用,免费额度不抵扣,得单独按量付费计入成本。系统的抵扣顺序是免费额度优先于资源包。

月成本怎么估算

给一个能直接套的公式:

单次成本 = 输入 token 数 / 1,000,000 × 输入单价(按阶梯档确定)
         + 输出 token 数 / 1,000,000 × 输出单价(按阶梯档确定)
月成本 ≈ 单次成本 × 每月请求数

举个例子,用 qwen-flash 估算一个每天 3,000 次调用的轻量问答功能,平均每次输入 1,500 token、输出 300 token,输入总量落在 0–128K 这一档:

  • 单次输入成本:1,500 / 1,000,000 × 0.15 元 = 0.000225 元
  • 单次输出成本:300 / 1,000,000 × 1.5 元 = 0.00045 元
  • 单次合计:约 0.000675 元
  • 每天 3,000 次:约 2.03 元
  • 一个月(30 天):约 61 元

如果换成 qwen-plus(同一档位输入 0.8 元、输出 2 元),同样的用量规模,单次成本会明显抬高,算下来一个月大概是这个量级的两三倍(约 160 元上下)——这也是为什么选型时不能只看”能不能用”,还得看这个任务是不是真的需要更贵的模型能力。如果你的业务量级会推着输入 token 经常跳档(比如塞长文档进上下文),务必按实际分布重新代入公式算,不要只按一个平均值估算,阶梯计价对成本的影响比很多人想象的要敏感。

常见坑 / 注意

  • 思考模式的输出另算一套价qwen-plus 0–128K 档非思考输出 2 元、思考 8 元,差 4 倍,且按”思维链+回答”一起计费。估算时别只看非思考那一列。
  • 免费额度只有华北2(北京)有:其他地域一律没有。部署在新加坡等节点却指望免费额度的,会直接落空。
  • 限时折扣会到期qwen3.7-max 现在 5 折、qwen3.7-plus 8 折,按原价做预算更安全,别把折扣价写死进长期成本模型。
  • qwen3-coder-plus 超过 256K 后输出 200 元:比前一档跳 5 倍,编程 Agent 类长任务必须控上下文长度。
  • 缓存和 Batch 不能叠加:命中按标准输入价 10%、创建显式缓存按 125%;Batch 是输入输出各五折。二选一,别指望叠 buff。
  • 别套用”新款一定更贵/更便宜”qwen3.7-flash(0.2 元起)比 qwen3.6-flash(1.2 元起)便宜得多,得逐个看表。
  • 阶梯价看的是”这次请求的输入总量”:不是账户累计用量,也不是”命中缓存才省钱”的折扣逻辑,跟缓存机制是两回事。
  • qwen-plus 的”0.87 元优惠价”说法仍未核实:跟阶梯表对不上,报价前去控制台核对当日实时价格。
  • 快照版本额度独立qwen3-maxqwen3-max-2026-01-23 算两个模型,各有各的免费额度。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。