智谱 GLM API 怎么收费?各模型 token 单价与省钱用法

2026-07-07

数据截至 2026-07,价格与限额以各官网为准。

智谱 GLM API 明确能核实到官方原文单价的目前只有 GLM-4.5 一个型号(输入 0.8 元、输出 2 元,每百万 tokens),其它新一点的型号(GLM-4.6 及以上)网上流传的价格都是第三方口径、官网定价页是前端渲染没能直接核实到具体数字;真正稳妥的省钱办法不是纠结这些没核实到的数字,而是先用三款长期免费的 Flash 模型把链路跑通,量上去了再去官网当次核实一遍价格表。

这篇文章的态度会比大多数计费横评更保守一些:凡是没在官方文档原文里逐字看到的数字,都会明确标出来,不会替你把”约等于”包装成”官方定价”。如果你正准备拿 GLM 做成本估算、写报价单,这篇能帮你分清哪些数字能放心引用、哪些还得自己去官网点一遍确认。

计费单位先说清楚:官方是按千 tokens 报价的

智谱官方文档里给的价格,原始展示单位是每千 tokens,而不是像很多同行那样习惯用”每百万 tokens”。这篇为了方便你横向对比其它平台,统一把数字换算成了每百万 tokens(1 元/千 tokens = 1000 元/百万 tokens),但这里有个容易搞反的地方:如果你自己去官网核对价格,看到的原始表格是”每千 tokens”口径,别拿它直接跟别的平台”每百万 tokens”的数字做除法比较,先统一单位再算差距,方向搞反会让你的成本估算差出三个数量级。

各模型单价:能核实的写死,不能核实的留白

先说唯一一个官方原文里完整给出输入、输出双边价格的型号——GLM-4.5:官方文档原文是”API 调用价格低至输入 0.8 元/百万 tokens,输出 2 元/百万 tokens”,这句话是逐字从官方模型页面拿到的,可以放心引用。GLM-4.5 的上下文窗口是 128K tokens,最大输出 96K tokens,规格和价格都对得上。

再往上,GLM-4.6 网上有不少第三方资讯(智源社区、知乎、CSDN 等)都提到”约 5 元/百万 tokens”这个数字,口径比较一致,但官方文档页面本身没有直接展示这个拆分数字,也没说明这 5 元是不是输入输出统一价。这个数字建议你标注成”第三方公开资料显示约 5 元/百万 tokens,具体以官网 pricing 页为准”,别直接当官方原文去写报价单——这不是我偷懒不核实,而是官网的 bigmodel.cn/pricingopen.bigmodel.cn/pricing 两个定价页都是前端 JS 渲染的动态页面,工具没法直接抓到渲染后的表格数字,这属于”页面存在但没抓到”,不是”官网没公布”,人工打开浏览器点一下应该能看到。

再往上的 GLM-5、GLM-5.1、GLM-5.2、GLM-5-Turbo,以及 GLM-4.7、GLM-4.7-FlashX、GLM-4.5-Air/AirX、GLM-4-Long 这几个型号,具体输入输出单价目前都没能核实到官方逐字数字,这里不编造,统一建议你去 bigmodel.cn/pricing 当次核实。这么多型号”未核实”看着有点多,但这恰恰反映了 GLM 迭代速度快、价目表更新频繁的现实——与其我给你一个可能下周就过时的数字,不如老老实实告诉你去哪查。

另外提一句视觉多模态:GLM-4.6V 系列的价格来自第三方资讯(较 GLM-4.5V 降价 50%,输入约 1 元、输出约 3 元,每百万 tokens),同样没有逐字核实到官方原文,仅供横评时参考,GLM-4.6V-Flash 免费这条倒是各方口径一致。

免费档怎么用:三款 Flash 长期免费,不用等赠送额度

如果你的场景本身对模型能力要求不高(分类、摘要、简单问答这类),完全可以先绕开计费这件事,直接用免费模型:GLM-4-Flash-250414(官方原话”首个免费大模型API”)、GLM-4.7-Flash,两个都是长期免费,不是限时活动。曾经免费的 GLM-4.5-Flash 已经在 2026-01-30 下线,现在请求会自动路由到 GLM-4.7-Flash,代码里模型名建议直接改过来。

这三款免费模型不依赖”新用户注册赠送额度”这类活动性质的东西——网上关于新用户具体送多少 token 的说法不统一(有说 2000 万、也有说 1200 万加 500 万的组合),这些数字都没能在官方页面逐字核实到,而且明确标注是 2026 年早些时候的口径,随时可能变。稳妥的做法是:把这三款 Flash 模型当成你的免费基线去用,赠送额度当成”多的算白赚”,别把成本模型建立在一个可能过期的活动数字上。

省钱法:批量走 Batch,编程场景看订阅制

如果你的任务是可以离线跑的批处理(比如夜间批量打标签、批量摘要),官方 Batch API 有明确的五折优惠——官方原文是”Batch API:高效完成大规模数据处理任务,只需五折费用”,这条是能直接引用的官方口径,量大的场景值得优先接入 Batch 而不是走实时接口。

如果你是编程工具场景(类似接 Claude Code、Cline 这类客户端做代码补全/生成),智谱还有一套独立的 GLM Coding Plan 订阅套餐体系(Lite / Pro / Max 等档位),按”每 5 小时 / 每周”的额度限制计费,不是按 token 单价算钱,这和前面讲的按量计费是两套完全不同的商业模式。第三方资讯里还提到面向更高阶场景的”龙虾套餐”(比如个人体验卡、进阶月卡),但这些套餐的具体价格和额度换算都没能在官方原文里核实到,只能告诉你”存在这类订阅制选项,价格结构和按量计费不同”,具体数字请去 bigmodel.cn/special_area 当次查看。

月成本怎么估算

给一个能直接套用的公式,用唯一有完整官方单价的 GLM-4.5 举例:

单次成本 = 输入 token 数 / 1,000,000 × 输入单价(0.8 元)
         + 输出 token 数 / 1,000,000 × 输出单价(2 元)
月成本 ≈ 单次成本 × 每月请求数

假设一个每天 3,000 次调用的场景,平均每次输入 1,500 token、输出 500 token,用 GLM-4.5 单价算:

  • 单次输入成本:1,500 / 1,000,000 × 0.8 元 = 0.0012 元
  • 单次输出成本:500 / 1,000,000 × 2 元 = 0.001 元
  • 单次合计:约 0.0022 元
  • 每天 3,000 次:约 6.6 元
  • 一个月(30 天):约 198 元

如果你的调用能大量落在免费的 GLM-4.7-Flash 上,这部分成本直接归零;如果你有批量离线任务,走 Batch 接口还能再打五折。至于用到 GLM-4.6 及更高版本的成本,因为单价本身还没核实到官方精确数字,建议先去官网核实当次价格再代入上面这个公式算,别拿第三方口径的”约 5 元”直接写进正式报价单。

常见坑 / 注意

  • 官方单位是每千 tokens:横评换算成每百万 tokens 时留意方向,别把千和百万搞反。
  • GLM-4.5 之外的价格多数未核实:GLM-4.6 及以上型号的具体单价请去 bigmodel.cn/pricing 当次核实,别直接照抄网上”约 X 元”当官方原文引用。
  • 定价页是前端渲染:工具抓不到不等于官网没公布,人工打开浏览器核实一遍。
  • glm-4.5-flash 已下线:现在请求自动路由到 glm-4.7-flash,代码里的模型名建议同步改掉。
  • 新用户赠送额度别当刚性预算:说法不一致、还可能过期,长期稳定免费的是三款 Flash 模型本身。
  • Coding Plan 和按量计费是两套体系:编程订阅套餐按时间/次数限额,不是 token 单价,别拿两者互相换算对比。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。