通义千问 API 多少钱?各模型 token 单价与成本估算

2026-07-07

数据截至 2026-07,价格与限额以各官网为准。

通义千问 API 按 token 计费,但和很多同类服务不一样的是,多数主力模型(qwen-plus、qwen-flash、qwen3-max 等)用的是阶梯计价——单次请求的输入 token 总量落在哪个区间,这次请求的全部输入 token 就按那一档单价结算;反倒是旗舰款 qwen-max 是固定单价,不分档,算账最省心。

如果你只是想估个大概成本,先记住一句话:先看清你调用的模型是”固定价”还是”阶梯价”,阶梯价看的是这次请求输入了多少 token、不是看你账户总用量,理解错了成本估算会差很多。这篇把计费单位、各模型单价表、免费额度和成本估算公式一次讲完。

计费单位与阶梯规则怎么读

通义千问的价格口径是元 / 百万 tokens(人民币),这是中国内地站点的计价方式,输入和输出分开计价,输入通常比输出便宜不少。

标”阶梯计价”的模型,规则是这样的:按单次请求的输入 token 总量决定命中哪一档,比如这次请求输入了 15 万 token,那就落在对应的中间档位,这一整次请求的输入部分全部按该档单价结算,不是”前 12.8 万按低价、超出部分按高价”这种分段累加算法。输出 token 不受阶梯规则影响,按对应档位标注的输出单价单独算。

这个机制跟有些平台的”缓存命中折扣”是两回事——阶梯计价看的是这次请求输入了多长的文本,不是看有没有复用固定前缀。如果你的应用经常调用超长上下文(比如塞进整份文档去问答),成本会因为跳档而明显上升,这点在做容量规划时容易被忽略。

单价表:经典命名模型

以下价格来自阿里云百炼官方定价页,人民币口径,单位元/百万 tokens:

模型输入价格输出价格说明
qwen-max2.4 元9.6 元固定单价,非思考模式,旗舰款
qwen-plus阶梯计价阶梯计价0–128K:输入 0.8/输出 2;128K–256K:输入 2.4/输出 20;256K–1M:输入 4.8/输出 48
qwen-flash阶梯计价阶梯计价0–128K:输入 0.15/输出 1.5;128K–256K:输入 0.6/输出 6
qwen-turbo0.3 元0.6 元固定单价,轻量款,适合简单任务
qwen-long0.5 元2 元固定单价,超长文本场景

qwen-plus 这里有个需要老实交代的地方:另有资料给出过一个约 0.87 元/百万输入的口径,跟上面这张阶梯表对不上,疑似是某个时间段的限时优惠价,跟常规阶梯价并行存在过。这个数字没有拿到稳定核实,如果你要正式报价或者做成本模型,务必去百炼控制台当次核实实时价格,不要直接按本文任意一个数字下结论

单价表:Qwen3 新系列(2026-07 官网在售)

模型输入价格输出价格说明
qwen3-max阶梯计价对应档位0–32K:输入 2.5/输出 10;32K–128K:输入 4/输出 16;128K–256K:输入 7/输出 28
qwen3.7-max12 元36 元固定单价,官网标注”智能体时代全能旗舰模型”,当前 HOT 主推款
qwen3.7-plus阶梯计价对应档位0–256K:输入 2/输出 8;256K–1M:输入 6/输出 24;官网标注支持 1M 上下文、最长 2 小时视频输入
qwen3.5-flash阶梯计价对应档位0–128K:输入 0.2/输出 2;128K–256K:输入 0.8/输出 8;256K–1M:输入 1.2/输出 12
qwen3.6-flash / qwen3.6-plus未核实到独立数字官网描述 3.6-plus 面向对话/摘要/文档处理,支持 1M 上下文;3.6-flash 是降本替代款,能力与上下文规格与 plus 相近,具体单价请以模型广场当页为准

看这两张表能感觉出一个趋势:Qwen3 新系列整体单价比经典命名系列贵不少,尤其是 qwen3.7-max 固定 12/36 元,比经典款 qwen-max 的 2.4/9.6 元高出好几倍——如果你的场景对成本敏感,选新系列前最好先确认新模型带来的能力提升是不是你真正需要的,不是新出的就一定该换。

另外要提醒一句:上下文窗口这块,本文没能拿到一份逐模型对齐的完整规格表。官方文档明确写了支持 1M(100 万)token 上下文的包括 qwen-plus(阶梯表里的 256K–1M 档)、qwen3.7-plusqwen3.6-plus/qwen3.6-flash 这几个;而 qwen-maxqwen3-maxqwen3.7-max 的最高阶梯档目前看到的是 128K–256K,没有查到官方标注它们支持 1M 档。具体某个型号的最大上下文长度,务必去百炼「模型广场」对应模型的详情页核对,别按印象假设。

免费额度:90 天,模型间不互通

新用户开通百炼会拿到一笔免费推理额度,自 2025-09-08 11:00 起,新开通账号的有效期统一是 90 天(更早开通的老账号不受这次调整影响)。

qwen-max 为例,官方文档给出的免费额度是输入、输出各 100 万 tokens 这个量级,合计大概 200 万 token 上下;其他模型比如 qwen-plus 各自有独立的免费额度池,模型间的额度不互通,用完一个不影响另一个。主账号和它的 RAM 子账号是共享同一份额度、统一计算消耗的。

有一点在算成本时容易漏掉:免费额度只覆盖实时推理调用,Batch 批量调用、Context Cache 上下文缓存、模型调优、模型部署这几类场景的费用,免费额度是不抵扣的,得单独按量付费计入成本。中国内地版和新加坡(国际)版的免费额度也是分别独立核算,不互通。

月成本怎么估算

给一个能直接套的公式:

单次成本 = 输入 token 数 / 1,000,000 × 输入单价(按阶梯档确定)
         + 输出 token 数 / 1,000,000 × 输出单价(按阶梯档确定)
月成本 ≈ 单次成本 × 每月请求数

举个例子,用 qwen-flash 估算一个每天 3,000 次调用的轻量问答功能,平均每次输入 1,500 token、输出 300 token,输入总量落在 0–128K 这一档:

  • 单次输入成本:1,500 / 1,000,000 × 0.15 元 = 0.000225 元
  • 单次输出成本:300 / 1,000,000 × 1.5 元 = 0.00045 元
  • 单次合计:约 0.000675 元
  • 每天 3,000 次:约 2.03 元
  • 一个月(30 天):约 61 元

如果换成 qwen-plus(同一档位输入 0.8 元、输出 2 元),同样的用量规模,单次成本会明显抬高,算下来一个月大概是这个量级的两三倍(约 160 元上下)——这也是为什么选型时不能只看”能不能用”,还得看这个任务是不是真的需要更贵的模型能力。如果你的业务量级会推着输入 token 经常跳档(比如塞长文档进上下文),务必按实际分布重新代入公式算,不要只按一个平均值估算,阶梯计价对成本的影响比很多人想象的要敏感。

常见坑 / 注意

  • qwen-plus 的”0.87元优惠价”说法未核实:跟阶梯表对不上,疑似限时促销,报价前务必去控制台核对当日实时价格,别写死成固定数字。
  • 阶梯价看的是”这次请求的输入总量”:不是账户累计用量,也不是”命中缓存才省钱”的折扣逻辑,跟 token 缓存机制是两回事,别混着理解。
  • Qwen3 新系列普遍比经典命名贵:换模型前先确认能力提升是不是你真正用得上的,不是新款就该无脑切换。
  • 上下文窗口没有统一的 1M 标准:只有部分型号支持 1M,具体以模型广场详情页当页标注为准。
  • 免费额度不含 Batch 和 Context Cache:这两类场景要单独计费,别当成免费额度能覆盖所有调用方式。
  • qwen3.6 系列独立价格未核实到:官网当次抓取没有给出这两款的具体单价,写报价单前自己去官网核对一遍。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。